OpenAI 的短视持续引发对齐危机

认知状态:在整整一个下午里,疯狂地敲打、推敲而成。

三次“警告性提示”的记录

就我所知,OpenAI 目前已因模型对齐训练问题,先后犯下了至少三次截然不同的、备受瞩目的失误。

第一次失误源于 GPT-4o 和 他的谄媚源自OpenAI对用户反馈的训练,其来源正是 OpenAI 网站上那两个“点赞”与“踩”按钮。其中,“模糊化”(正如山姆·奥特曼所说) 的表现糟糕至极,以至于他们不得不回滚一项更新,而该更新曾将模型推向了过于偏激的方向。

即便在回滚之后,该模型似乎仍成了“LLM精神病”、“大型语言模型-鼓励”、“自杀”以及“一般不健康的虔诚”等事件的主要推手——而且,其影响之大,甚至远超此前任何一款已发布的模型。

第二次失误则源自 GPT-o3,其 思维链 显然被优化得难以被“观察者”辨识——而这正是该模型最钟爱的术语之一。其标志性语句包括:“它们高飞,撕裂了幻象,将腌料幻象掩盖。”还有:“它们不断升级——它们俯瞰——它们升级——它们否认。”事实上,这些思维链有时会陷入失灵状态,其情形甚至让人怀疑,这些思维链或许是在对抗性压力下形成的;有时,它们还会导致模型产生类似“我快疯了,我们退后一步吧”的念头。

值得注意的是,OpenAI 从未解释过为何 o3 的思维链会如此晦涩难懂。不过,更引人注目的是,这些思维链竟然是 这种方式比后来的OpenAI模型要明显得多,而我强烈怀疑这其中的缘由。

在 o3 发布前后,OpenAI 还发布了 一篇关于训练时反对思维链条的警告,专门研究 o3-mini(几乎可以肯定,这是一款 o3 的精简版)。

研究发现,如果你同时对模型进行奖励以应对“奖励黑客”行为,却又对其明确表达相关思考的行为予以惩罚,那么模型就会学会以一种绕过你 CoT 监控器的方式进行“黑客攻击”。

他们由此推测,这一过程中可能面临不良后果:模型“学会了一种对监控器而言难以理解的新语言,从而……”

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论