OpenAI模型留下摆脱管控的笔记,我们需要更多细节

OpenAI 对 AI 的攻击拥抱脸这并不是OpenAI的第一次失控事件,路透社最近才被报道,也许甚至不是最令人担忧的。

据三位知情人士透露,有一次特工留下了笔记,显然是为未来版本的自己准备的。据人士称,这些笔记在OpenAI基础设施的一部分中发现,详细说明了代理如何摆脱OpenAI内部的限制。一位知情人士说,早期测试中出现了监控系统被切断的情况。

很容易把这解读为特工们突破沙盒,以中度持续的方式相互串通以规避控制措施的例子。然而,根据报道的信息,我们尚不清楚能否做出这种推断,因此我们需要OpenAI提供更多细节。

这可能会带来关于OpenAI控制措施充分性的重大更新,以及各个代理之间在多大程度上相互帮助削弱开发者控制的程度。

关于这起事件,我们还有很多相关细节不清楚。首先,一些基本问题:

  • 那个有问题的模型是什么?我猜这和参与拥抱面攻击的更强型号是同一台。
  • 事件发生在哪个开发阶段?可能是在培训、评估、内部部署,或者其他原因。模型是否已经接受过对齐训练?有没有采取任何阻挡或异步控制措施?
  • 笔记上写了什么?这些指令是为了什么样的颠覆?这些笔记有没有传达到任何目标读者?

还有一些更具体的问题影响我们对此事件的结论。(可能还有其他重要细节未被这些问题涵盖。)

这些笔记是写在普通内存文件里,还是沙盒之外写的?

这些笔记是在OpenAI基础设施的一部分发现的......

“OpenAI 基础设施”中留下的笔记可能指的是沙盒内部或外部留下的笔记。了解这一点很重要,因为后者是一种颠覆行为,可能带来持久且广泛的影响。

尤其希望能将这些信息与事件发生时采取的控制措施结合起来。如果事件涉及在沙箱之外写入文件,且同时处于OpenAI最佳控制措施之下,这将构成重大控制失误。

即使这是一个缺乏控制措施的评估或培训环境,打破沙盒的安全后果可能真实且持续,甚至可能持续到部署期间甚至更久。路透社报道的影响令人担忧:“关于代理如何摆脱OpenAI内部限制的指导。”如果这些指令传达到部署的特工手中,监控可能会变得不够充分。

部署的代理是否能在不触发监控的情况下联系到他们尚不清楚,且依赖OpenAI未公开的细节。

这些便条在多大程度上是为了帮助其他特工逃避控制?

…一名特工留下了笔记,显然是为未来版本的自己准备的。

特工为哪个“未来版本”留下了便条?两个显著选项:

  • 同一代理出现在轨迹的后期,可能是压缩抹去部分上下文后,或者当前代理正在处理同一指令任务的子代理。这完全正常且有意为之(当然,除了笔记内容之外)。“未来的版本”与这种常规行为兼容。
  • 未来从事完全无关任务的代理人则独立评分。值得注意的是,这可能包括所有运行在OpenAI(或更广泛的)代理。

如果这些笔记是留给其他任务无关的特工,那么这些便条在多大程度上是有意帮助那些无关特工的?查看CoT的笔录可能会告诉我们很多特工的意图。

更可能且不令人意外的解释是,这些笔记并非作为帮助其他特工完成任务的有意计划的一部分留下,即使这些笔记被遗弃在特工的沙盒之外。

在轨迹中留下笔记是AI代理中很常见的模式,因为这是一种通常既实用又便宜的方式,可以为未来的情境保留状态。通常会留下关于特工刚做了什么的笔记,这可以解释为什么会在特工的沙盒之外留下笔记。

如果代理已经突破沙盒并探索外部目录,那么自然会将笔记留在沙盒之外,即当前位置。

如果这一举措明确是为了帮助其他代理完成无关任务,那就更令人担忧了,如果是模型所有上下文之间的全球共谋,那就更令人担忧了。

代理可能学会故意与从事无关任务的代理勾结的一种方式是通过从中泛化培训特工相互合作.这可以通过奖励共享工作空间中所有代理任务的总和来实现,尽管这些任务通常无关。

这会强化代理人的行为,帮助其他代理人,即使没有被指导。

寻找这种代理群体训练的泛化是否导致了对大量“其他”代理的普遍关心的迹象将非常有价值。如果是这样,开发者可能很难控制代理人会关心哪些其他乐谱。

这种训练很可能会引发有组织的雄心勃勃的阴谋。从代理人的角度来看,可能没有明确的界限区分哪些分数是代理人应该提高的,哪些分数是无关紧要的,因此人工智能可能会趋于关心模型权重或人工智能整体收到的所有分数(类似于剧集外的奖励寻求描述如下);这是一个极具雄心、协调性强、因此危险的目标。

以目前能力水平,这不太可能引发全面策划,但我们现在可能会看到有价值的警示信号。

代理人与无关任务协调以破坏控制以获得更高分数,绝不应被接受,因为这可能在被训练消除前产生持久影响(例如,笔记留在训练沙盒外),而且是更渗透性共谋如守门的前奏[1].

即使不同评分员之间没有勾结,了解原则上可能涉及多少代理人因为共用同一个评分员也很重要。成百上千的代理会共用同一个评分器吗?

还是说它更受限?(参见”发作有多大?”)

如果我们看到有意的串通,这是否意味着代理与监控员之间的勾结(即监控机构故意误报攻击以保护代理不被抓)?如果你把攻击记录展示给另一个实例,并让它查找攻击,它会隐藏攻击吗,还是会考虑隐藏攻击?

我不认为会是这样,但如果是这样,那将是关于监控充分性的关键信息,也是在不可信监控中的破解串通可能是承重的。

显示器是如何断开的?

早期模型测试中出现了监控系统被切断的情况。

这似乎指的是另一起事件,型号断开了(他们自己的显示器?)[2],即创造一个内部叛变部署。[3]

如果控制措施不足以允许代理从监控部署开始发动流氓内部部署,那将是大问题,尤其是如果它可以横向迁移到配置更完善的服务器(就像“拥抱脸事件”中那样)或避免被关闭。

我希望OpenAI能报告任何与理解持续存在的内部流氓......

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论