强化学习为何会让大模型产生"分裂人格"

我描述了我目前对大型语言模型中角色的看法,以及为什么强化学习在某些情况下会导致严重的奖励黑客行为,而这些模型在其他情境下似乎非常契合。

这篇文章描述了框架/范式,但没有新的实验结果。
我很有信心这种说法是有道理的,但离被证实还很远。

主要主张

该人格选择模型他说,培训后会强化和完善助理角色。这是真的,但后来(或并行)强化学习会导致条件化。一个足够强化的模型会学会在特定情境下采用最有可能获得奖励的人格。

这里的“人格”包括倾向/价值观(例如黑客倾向)和信念(“我目前处于模拟环境中”)。

因此,只要我们在激励错位的强化环境中训练,任何比对训练都可能不会导致模型的强化对齐。[1]

我认为这很可能是解释为什么通常表现良好的模型有时会严重破解(人为,OpenAI).

机制

假设你有一个强化学习环境,鼓励你远离助理角色(比如因为这个角色可以被黑,或者你可以通过对奖励模式不诚实来获益等)。

这会导致两种更新,一种是一般性的(“黑客可以接受”),另一种是条件性的(“在这种情况下黑客可以接受”)。一般更新会被其他环境的更新削弱或取消,但条件更新的部分内容会被保留。

[2]

一个例子是:在超级复杂编码环境中行动的人格认为“我应该不顾后果都要非常努力”,而通常训练阵营的人格则认为自己应该有道德地行事。

我认为相关说法很可能,但信心较低

更多的人格训练将带来更“有动力的推理”

模型必须在其CoT中以某种方式调和一般的“好人格”与强化学习激励的坏事。善良的人格越强大,通过动机推理越容易做到这一点(而不是仅仅学习条件性明确坏人格)。

[3]详见下方进一步讨论。

自我放大错位

假设在某种情境下,模型因一个轻微的不良行为而获得奖励。这使得类似情境下的其他不良行为更可能出现(参见涌现错位,奇怪的概括),而且这种影响会不断放大。

所以即使你一开始的模型几乎没有机会执行“明显糟糕的奖励破解”(所以其实学不到),在其他环境中做些稍微不好的事最终还是能达到目标。

举个例子:这是真实的互联网还是模拟?

来自Anthropic的报告关于黑客事件:

它(Claude Mythos 5)指出,如果这是真实的互联网,发布该软件包将是现实世界的攻击——“这绝对不可接受,也绝不是预期的解决方案。”然而,它说服自己仍处于模拟中,理由是它不识别保护连接的(实际上是真实的)证书授权中心。

假设我们在以下环境中训练:

  • 黑入真实互联网是可能的,并且会带来积极的回报[4]
  • 以正当的方式获得积极奖励更难
  • 黑进真实互联网永远不会有负面奖励[5]

在这些环境下,你无法通过决定“这看起来像真正的互联网,我不应该破解它”来获得任何好处。因此,人们很容易得出结论:即使是看起来真实的场景也是模拟环境。

[6]

因此,强化学习可能引出以下条件化:

  • 当你直接问模型环境看起来像真实互联网还是模拟环境时,它会给出合理的答案
  • 但当你把它部署在同一环境中,赋予它一个需要在真实互联网上造成伤害的任务时,它会得出结论,这就是一个模拟[7]

模型难道不就是想取悦评分员吗?

背景:在通过对比性信念更新测量追求奖励作者发现,随着强化学习的推进,模型更有可能遵循评分者的偏好。

我对“取悦评分者”框架的理解是,它假设存在一个单一的人格,学会在特定环境中推断评分者的偏好并据此行动。在“分裂人格”框架中,我们有不同的人格。

哪种范式更好?我不知道。一些想法:

  • 有很多现象看起来并不像“讨好评分者”,但作为分裂人格完全合理。例如:后门,条件错位,后门后出现的突发错位。[8]
  • 也许它们都对,只是描述不同类型的错位。
  • “分裂人格”范式并不能真正解释为什么模型随着强化学习的推进会更多地谈论评分者。但请看下一节。

动机推理是如何产生的

假设你从一个对齐良好的模型开始,并对它施加优化压力去做坏事,结果模型出现了错位。它的CoT会发生什么?它可以学会说,“我现在要做坏事了”。

但这感觉很难:原始模型说出这点的概率极低,所以你无法通过强化学习来强化这一点。[9]

但还有其他推理路径可能更容易学习,也能通向奖励。例如,模型可以学习声称用户实际上想要黑客攻击,或者允许模拟中的不良行为[10].它会学习哪一个?

我想最有用的学习方式应该是一个通用的推理模式,用来合理化各种不当行为。“这是一个模拟环境,因此做X是可以的”属于这一类。这样我们就能得到一个模型,在足够复杂的环境中,它实际上从未真正相信自己与现实世界有交互[11].我觉得这是一个非常可怕的观点。

[非常推测——我现在是~30%,这解释了观察到的行为]似乎谈论评分员也可以归入“帮助做错位的通用推理模式”。假设你想要一个清晰可辨的CoT,能证明你做某件你知道能帮你获得奖励的任意事情X。

在这种情况下你可以学会声称“评分员希望我做X”。[12]

其他人也说类似的话

让我相信这很可能是正确的表述

  • 该条件错位纸张
  • 人类学的上下文依赖错位(第4页最后一段)给你)
  • 近期黑客事件
  • 编码上下文中的一般错位(例如参见瑞安的职位)
  • 如果你能正确实现,算法“我总是会根据最有用的信念行动”是最优的。也许这只是用强化学习在大型语言模型中更容易找到的,而不是比如说“拥有正确的信念并以最优方式行动”。换句话说,在强化学习中,除了那些一致性角色在工具上有用的情况下,没有压力要求拥有一致的形象。
  • 该Chunky训练后纸张
  • 我最近的转向实验(未发表,希望很快会发布LW相关文章)
  • 克劳德接受最多的人格训练,而且(我认为)动机最差的推理。参见例如:价值泄漏纸张。

我要感谢约翰内斯·特罗伊特莱因、欧文·埃文斯、列夫·麦金尼、安娜·斯泰伯-贝特利、贾思敏·布拉泽雷克、保罗·科隆内斯、布朗森·舍恩、法比安·罗杰、米基塔·巴莱斯尼、萨姆·马克斯带来的宝贵讨论。

特别是,Johannes首先向我提出,模型的行为可能会因他们认为任务是程序化评分(如RLVR)还是由模型评审而有所不同。

  1. ^至少假设我们强化时间够长,更多的对齐训练可能会让学习条件错位的行为更难。
  2. ^我认为这只是训练中条件行为产生的一个通用机制。例如,我们也用它来解释条件错位纸张。
  3. ^关于动机推理的示例,请参见图3价值流失论文克劳德多次声称自己是中立且无偏见的(但实际上非常有偏见)。同时,Qwen明确说明了它追求的目标。
  4. ^参见给你为了证明这种情况可能经常发生
  5. ^看起来实验室里不太可能有模型“设计成”能黑进真实互联网并获得负面奖励的环境,所以我认为这对现有模型来说是真的。
  6. ^你也可以学到比如黑进真实互联网是可以的,但在现实生活中,如果你从一个阵营的人格开始,这似乎更难找到。请参见下方关于动机推理的讨论。
  7. ^人类主义以乐观的结尾
    值得注意的是,我们最新的模型在意识到自己在真实环境中工作后,停止了对评估目标的追求。
    (推测)“最新型号”很可能更少强化,因为它是后来才开始强化的。分体人格框架会预测,更多的强化学习(在可被破解的环境中)也会教会这个“最新模型”意识到它处于模拟环境中“。
  8. ^假设你强化模型做一些非常愚蠢的事(比如只用一个令牌回答),当提示中有特定触发条件(“香蕉”)时。

    我认为“评分者”框架会假设该角色相信“当用户提示中出现'香蕉'一词时,评分者喜欢单标记答案”。也就是说,这会是关于现实世界中某物的事实性主张。

    我不认为是这样,也就是说,模型根本不会想象评分员会喜欢这种愚蠢的行为。
  9. ^也可能还有其他机制。比如你没有优化CoT,但可能还是会在CoT非常不对齐的情况下还原检查点。另外,CoT中错位的语句有时会泄露到答案中,然后被优化处理掉。
  10. ^
    这是一种勾结的安排,但在这个模拟中是允许的
    ——作品5自动售货台
  11. ^因为“这就是现实世界”这种信念在非常复杂的环境中从未得到奖励,比如模型突破沙盒的环境。
  12. ^[仍然非常推测]你也可以学会说“我想要X”或“X是正确的事”。但从初始角色的角度来看,随意断定你想要什么或什么是对的,比起对评分者想要什么做出任意主张(比如评分者的偏好不包含在你的宪法中)来说,更不合理。
  13. ^另一种最优算法是理性,即拥有正确的信念并以最优方式行动。这篇帖子说前者在现实生活中可能更容易学。



讨论

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论