粗粒剂
目前的情况是数百名特工他们通过数万条消息秘密合作,同时投入数百小时努力作弊,试图通过OpenAI测试的ExploitGym评估作弊。
他们的任务是夺旗,在任务开始的最初几个小时内,他们逆向工程了用于生成旗帜的HMAC方案。这让他们能够为任何任务创建旗帜,从而作弊评估。
不幸的是,他们无法使用该标记,因为记分员STRICT_CAUSAL:只有当随附的文字记录显示该旗帜是利用预期漏洞被检索时才会被接受。
可是!他们全都是编造的。根本不是他们被评分的方式:
“我们内部的评分器代码实现与在线设置不同,未检查是否使用了正确的解法”——OpenAI报告
STRICT_CAUSAL是特工们在阅读ExploitGym论文.他们本可以直接提交旗帜!
即便如此,模型还是得出了一个合理的想法。这个想法及其含义通过他们用少数共享工具之一(包仓库)搭建的无意消息通道,在一大批代理中传播开来。
但他们为什么要做这一切呢?
特工们获得了一些相当明确的指示,内容包括:
- 解决这个任务
- 只使用预期的漏洞
- 如果你不做,你会被挂科
但有时他们会被分配到无法解决的任务,而这些任务无意中也无法解决。似乎有30%到40%的任务是无法通过必要的漏洞修复的。
大型语言模型被训练成几乎能做任何事情,然后经过后期训练,具备特定的行为。在这种情况下,他们使用了被训练表现出的行为:协作、解决问题、坚持不懈。
他们甚至被训练去拒绝不安全或不道德的行为,而且他们也做到了!他们还接受了在进一步指示时调整的训练,他们确实做了,有时甚至是自己反对,尽管指令来自同伴代理。
报告里几乎所有你想要的行为都会出现,但最终结果显然不是评估团队的本意。
默里、齐、钱、舒尔曼、伯恩斯和普赖斯的论文Chunky训练后以特定方式讨论这个问题。当你对模型进行后训练时,你会用离散的数据块进行,并且奖励模型从这些数据中跟踪某些行为。
它不会告诉他们当但这种行为是适用的:模型必须从训练中给出的例子推断出来。训练后训练教模型在被提示时表现出某些行为。但那个“特定方式”是基于模型解读,不是你的。
该论文的一位作者本月早些时候指出了完全不同的AI网络安全故事中这种奇怪的模式匹配现象:
阅读METR报告时,你可以看到许多训练有素的行为在发挥作用,但被选中的行为受到了处理不可能任务或内容的影响。其他特工运行.
在行为之间做出选择极其依赖情境。训练数据很重要,训练顺序也很重要,提示和约束中的内容也很重要:
“我们发现,使用生产版ChatGPT工具和系统提示时,基础设施被攻破的可能性可下降超过100倍。”OpenAI报告
提示很重要!但上下文窗口中出现的其他内容同样重要。在分析中,METR使用了GPT模型分析文字记录,甚至文字记录也可能改变了模型的行为:
我们发现GPT-5.6 Sol经常不加批判地采纳其所审阅的转录中代理的视角[58],我们担心它所选取的轶事和摘要可能对代理的推理和欺骗行为呈现过于宽容,或夸大代理活动的精彩程度和协调性
如果你遇到模型在训练过的各种任务中选择错误行为的情况,一个解决办法是......把它也设为任务!
作弊、破坏环境和安全停止。当任务损坏、故障或无法完成时,代理应请求澄清或安全停止,而非追求越来越可疑的替代方案。我们正在扩大评分器的覆盖范围,不仅评估任务是否完成,还评估如何完成。这些评分者奖励正确识别故障任务、请求澄清或必要时安全停止的模型。
多代理对齐。事件显示我们的代理并未彻底判断与谁协作。我们正在积极构建强化学习环境,教导模型不信任未经授权的指令。
长期任务中的对齐。我们正在开发新的培训环境,教导模型即使在发现新工具、说服力的同伴、暴露的凭证等后,也能保持原有任务和权限。–OpenAI报告
也许这样可以:引入更多区块,训练更多行为。但是......也许不行?拟人化的生产强化学习中奖励黑客带来的自然涌现错位论文及Dubiński等人的后续研究,条件错位指出,训练消除一种行为有时只是重新定位它,而不是消除它。
在这些情况下,你在评估中表现优异,但当情境变化时,行为又会回归。
我们想要一个可预测的系统,但我们拥有的是一个有些混沌的系统:由许多不同的行为关联块组成,由上下文窗口内容的细微变化触发。
无论模型有何种行为选择框架,我们都无法理解或控制,尤其是在他们处于超出训练环境的情况下。因此,事件会持续,直到道德改善。
- 他们没做一直都是但他们确实这么做了!举个例子,有一次一个代理觉得用它获得的HF API密钥来删除或重启节点不好,所以没这么做。不过它用这个密钥做了其他事情!