Noam Brown:智能体集群、对齐与递归自我改进

诺姆·布朗的新一集。
我们讨论了多智能体、Navier-Stokes,以及当前数学进步的爆炸式进展告诉我们自动化AI研究后会发生什么。
我们还讨论了在启动RSI之前,如何判断模型是否真正对齐。
请继续观看YouTube;请继续收听苹果播客或Spotify.
赞助商
- 简街对人工智能的兴趣远比你想象的要长得多,不仅仅是为了交易。2011年,也就是AlexNet整整一年,ChatGPT推出十多年前,他们举办了Eliezer Yudkowsky和Robin Hanson之间的首次FOOM辩论,讨论AI是否会导致智能爆炸。现在Jane Street将通过新小组重新探讨这个问题:Daniel Kokotajlo、Ege Erdil、Ryan Greenblatt和Jaime Sevilla,由Ron Minsky于今年十月在旧金山主持。我预计这将是一场真正精彩的对话。注册请访问janestreet.com/dwarkesh
- 格罗克机器人让交接工作变得非常简单。它运行在自己的云端电脑上,安装了端到端处理任务所需的工具。播客中,我们使用 Grok Bot 来帮助制作视频。你可能注意到我们的广告中包含真实网站的动画。过去要做到这些像素完美,意味着我们自己运行复杂的多步骤工作流程。现在我们只需让 Grok Bot 来处理。最棒的是,Grok Bot 已经掌握了我们所有的规格和偏好,所以我们每次都不必重新描述任务!亲自体验一下 Grok Bot 吧。x.ai/bot
- 对立面这让你拥有庞大测试套件的信心,而无需实际编写。假设你正在进行一个大型后端重构:构建足够多的测试以供信任可能需要数周时间。Antithesis 通过运行软件在无数模拟世界中运行,注入错误并寻找失败来解决这个问题。在任何 PR 中,你可以调节调节,决定具体测试量。由于每次运行都是完全确定性的,代理可以在出现漏洞的瞬间分支,倒带、检查内存并重放,同时原始测试继续运行。了解更多请访问antithesis.com/dwarkesh
时间戳
(00:00:00)——多重特工与纳维-斯托克斯
(00:15:28)– 人工智能公司将如何运作?
(00:22:02)——数学进展告诉我们关于递归自我提升的启示
(00:40:22)——拥抱脸与对齐
(01:01:18)——内部/外部模型差距
(01:08:34)——思绪链正在堕落
(01:14:12)——我们怎么知道阵营问题何时被解决?
文字记录
00:00:00 – 多重间谍与纳维-斯托克斯
德瓦尔克什·帕特尔
今天,我正在和诺姆·布朗他是OpenAI的研究员。他是后来发展的奠基性贡献者之一。O1还有推理模型。现在他正在研究多智能体系统.说到这里,你们上周宣布了你解决了其中一个千禧奖问题系统包含10,000种不同的人工智能代理该项目在88小时内花费了1300亿代币。
我之所以想和你谈谈,其中一个原因是,你可能是两三年前最早思考推理模型如何让我们预见未来的人之一。因为如果你放大规模推理计算方面,你可以看到几年后模型的基础能力。
我觉得你现在处于类似的位置,可以帮助我们了解未来能力会是什么样子,鉴于我们目前能实现的代理规模的巨大扩展。
诺姆·布朗
我认为,当你绘制这些推理模型的性能时,测试时间计算在X轴上,基本上任何推理基准的表现在Y轴上,你会看到一个非常明显的模式:这些模型思考答案的时间越长,表现越好。
这是非常自然的事情。人也是一样。如果你在参加SAT考试时只有五分钟完成整个考试,你可能表现不会很好。如果你只有五个小时,你可能会考得更好。
AI模型其实很相似。他们会用这段时间自言自语,理清思路,处理不同的案例,排除不同可能性,并在之前的发现基础上继续发展。
问题是,随着你不断推进,会遇到延迟瓶颈。你不想坐等三年才有回复。所以你可以做的是很多人做的事。他们并行化。他们只是组建一个团队。
如果你要创办一家公司,你会想把一群人聚集在一起,这样你才能更快完成。这些AI模型也是一样。让多个代理一起做某件事会有帮助,因为他们能更快完成。
所以多智能体是一种并行扩展测试时间计算的方法,而不是纯粹串行的。它效率较低,因为单个智能体并不拥有所有上下文。但如果做得好,它是一种非常有效的测试时间计算扩展方式。
德瓦尔克什·帕特尔
我会问一堆天真的问题。这是一个未发布的模型,所以我们还没有公开展示这些系统是如何工作的。我只是有很多地方让我对这些系统的定性属性感到困惑。
我震惊于你能在如此短的时间内集中注意力的认知努力规模。想想1300亿代币是。如果一个人把思考当作全职工作,连续进行,1300亿个代币将是一个人类思考4000年。
每天工作八小时,正常工作周。从古苏美尔到今天,一个人连续思考这么长时间,集中在88小时内。
我觉得从质性角度看,这是一个非常重要的考虑因素。我很惊讶没有更严重的并行化惩罚。你可以让一万个代理协作。也许是因为代理比人类更擅长协作,所以速度快得多。
他们实际上可以在如此大规模上高效协作。或者,也许并行化的代价很大。
诺姆·布朗
我们先谈谈并行化惩罚,然后再谈定性方面。事实是,我们对多智能体扩展到这种规模的科学研究并不充分。当我们发布5.6版本我认为那是我们模型中第一次真正拥有多智能体系统。
我们实际上在博客文章中展示了多智能体系统扩展性能的图表,因为我们有这个选项。这是Ultra模式。默认是四个智能体,但你可以设置更高。
图中展示了在某些基准测试中,一个代理、四个代理协作、16代理协作的性能。这取决于基准,但对于某些基准测试,你会看到如果有四个代理处理问题,速度会是问题的两倍。
因为四个代理工作时间减半,你支付的费用是两倍,结果是两倍。如果你去16个代理,你会看到类似的模式。效率稍低一些,但你仍然能看到这种表现。
德瓦尔克什·帕特尔
这是线性串行时间加速,还是随着并行代理数量增加而产生的亚线性加速?
诺姆·布朗
它略带亚线性,但很大程度上取决于问题本身。比如数学,其实很容易并行化。虽然不是最可并行化的,但非常可并行化。网页搜索,比如做深度研究报告中需要查看大量资料,是非常可平行的。
我怀疑写小说这类事情几乎无法平行化。你可能看不到一万名特工一起写小说带来太大好处,就像一万人一起写小说也不会带来太大好处一样。
所以性能确实取决于领域。我们在发布的博客文章中会测量大约16个代理。问题是,要把这项科学推广到1万个代理非常困难,因为成本太高了。
德瓦尔克什·帕特尔
你们只是周末才做的。
诺姆·布朗
但这只是一个数据点。我们不知道单个代理需要多长时间才能解决这个问题纳维-斯托克斯,因为我们还没做那个实验。也许我们会做,但这也只是一个数据点。
如果我们想做彻底消融在那个规模下,实验成本实在太高了。所以我们必须做某种系统的科学研究,了解当你用到64、128、256左右时会发生什么,并了解其行为。
但要把这个数字推到10,000,确定我们实际使用10,000个试剂相比1,000个,实际效果会非常困难。
我想澄清一件事。解决千年奖问题的努力,并不是多智能体的贡献。我甚至不会把10%的功劳归给多智能体。现实是,OpenAI已经训练了一个非常强大的模型。
我们可以让这个模型在很长的时间范围内运作。我们可以让它并行思考。
但归根结底,我们之所以能做到这一点,是因为我们有一个通用且非常强大的模型。像多智能体这样的技术很炫目且新颖,这可能因此获得了不成比例的认可。
但核心原因是这是一个非常强大的模型。
德瓦尔克什·帕特尔
这种概括让我很震惊。我不知道这些系统是如何训练的,但大概是训练方式强化学习训练会发生。你有一堆可检验的综合问题,然后对它们做大量强化学习。
我猜在训练过程中,模型从未解决过像千禧奖那样雄心勃勃的问题。但泛化足够强大,使得这些更容易且可验证的问题可以推广到对如此难问题的平行努力。
诺姆·布朗
我认为这是真的。首先,我们确实在非常困难的问题上训练模型。确实存在一个差距。我们看到,如果我们对某些类型的任务进行训练,它能够完成比这些任务更具雄心的任务。
一个有趣的挑战是,随着模型越来越智能,我们能问的许多问题变得太简单了。挑战模型很难。我确实认为这会很有趣。如果我要为你可能看不到像这样的人工智能来论证大型语言模型走和AlphaGo以及阿尔法零还有所有这些游戏型人工智能,可能就是这种问题。
比如AlphaZero,你有自乐,你有一个无限课程.你总是在和同样强大的人工智能对战。而像用强化学习训练大型语言模型(至少目前有的方法)是给模型一个问题,让它去解决。
如果问题简单到它能在一秒钟内解决,那它其实没学到什么。
如果我们没有问题可以挑战它,那么进展就会变得更加困难。我确实认为有办法绕过这个问题。我们还没有真正撞上那堵墙。我认为如果它真的成为严重问题,应该有办法绕过。
但这是一个合理的情景。
德瓦尔克什·帕特尔
仅供观众参考,当你提到AlphaGo或AlphaZero时,你指的是达到人类水平表现后相对快速地达到超人水平。
诺姆·布朗
如果你看看游戏型AI的发展轨迹,比如走一年内,他们从击败欧洲冠军——大概是世界第50名——击败世界冠军,甚至比任何活着的人类都强大好几个数量级。
在数学等领域,我们可能看到类似的发展轨迹,但我认为存在一种非常合理的情景,这种情况不会发生。
德瓦尔克什·帕特尔
我想了解,如果六个月后人们能够访问多代理系统,那么应该如何模拟与多代理系统协作或雇佣的体验?
诺姆·布朗
我应该先谈谈这些多智能体系统到底是如何工作的,我认为这与其他人工智能中的许多多智能体系统非常不同。许多在大型语言模型(LLM)中使用多智能体的人往往采用这种非常支架化的方法。
例如,可能有一个协调代理将工作委派给一群孩子,并给他们一个任务。孩子们负责处理任务,然后返回他们的答案。
这看起来是一个非常合理的配置,一个非常合理的支架。这确实有帮助,但这类设置存在许多局限性。例如,如果在这个设置中,你有一个协调员向孩子发送任务,孩子们负责任务并返回答案,那么如果两个孩子被分配到类似的任务,会发生什么?
他们能互相交流吗?通常答案是否定的。那非常低效。
如果你被分配了一个任务,而和可能知道你正在做的问题答案的人交流真的很有帮助——或者你正在做的事情的一部分——那你能直接联系他们说,“嘿,你能帮我解决这个项目吗?”会非常有帮助。
但很多系统并没有这样的设置。加入这个功能会显著增加你所处支架的复杂性。
还有一点是,如果孩子其实并不理解,或者有澄清性的问题怎么办?那它就必须在“好吧,我是不是应该回去问问题而不是解决问题?”还是“我是不是要先解决问题,假设家长希望我做什么,然后就这样解决?”在任何人们设计的支架中,总会有局限性。
我们想采取的方法是尽量在最小的结构中烘焙,给代理们非常原始的工具,让他们自己摸索如何有效使用这些工具。所以我们赋予代理给另一个代理消息的能力,当它给另一个代理发送消息时,它会入上下文中。
它可以做一些类似的事情,但这基本上是核心。它可以随时发送消息——只需一个工具调用——然后再发送给其他代理。
他们自己想出最佳协调方式。事实证明,如果做得好,你会得到非常复杂的行为。在我看来,这很像人类协作者在Slack上的工作方式。
当我们做这个项目时,看到这些经纪人一起解决问题,真的非常令人兴奋。我记得一个例子。我们给经纪人一个问题,然后一个经纪人说,“我想我找到了答案。”然后另一个经纪人说,“其实,我得到了不同的答案。”然后他们就展开了一整场讨论,比如,“你是怎么得出这个答案的?你能给我解释一下吗?”我们来回争论,试图澄清彼此推理中可能出了什么问题。
然后他们终于聚在一起,“哦,是的。好吧,这似乎没错。”然后这就直接传给其他特工,“其实,我改了答案。我觉得他说得对。”这感觉就像是一场非常自然的对话。
那感觉就像你看见的时候思路链条这是第一次通过强化学习训练,你会想,“哦,这就像一个人在思考时写下自己的想法。”感觉就是这样。
看到这种行为真的很酷。说实话,与这些事物合作感觉很像和一个人合作。这是一种非常自然的流程。
德瓦尔克什·帕特尔
不过,未来可能显著的一个质的区别是,这些系统思考的速度可能超过每秒输出的符号数和人类说话速度的十倍以上。它们一直在工作。
它们不睡觉。它们彼此协作的速度远远超过人类与其他人类协作的能力。
我正在思考一年后该质性地期待什么。是不是像影子组织那样,在我公司里的运作速度比人力快100倍?一个人类组织需要一年才能完成的事情,竟然能在一周内完成?
诺姆·布朗
会不会感觉陌生?我不知道。我发现现在处理这些东西出乎意料地自然。我认为这种情况可能会改变。比如,我们有这些超快模式,可以让采样速度快10到15倍之类的。
那样的话,跟上这些东西会很难。想法是这些代理在相互通信时可以非常快。但他们也能分辨自己在与代理对话和与人对话时的行为,在这两种情况下行为会有所不同。
德瓦尔克什·帕特尔
我们公开看到的复杂多智能体系统的主要例子是拥抱脸那张.显然,我发现很多令人担忧的地方。但我觉得有趣的是层级结构、中层管理的自发出现。
听起来你是在说这种组织层面是从培训中自发产生的?
诺姆·布朗
细节是自发的。虽然我们给了代理很多灵活性,让他们决定如何以最佳方式相互沟通,但我们仍然给他们一个起点。我们给他们一个关于合理沟通可能是什么样子的先验。
他们也接受了大量人类文本的训练。他们理解人类如何组织和协调,所以这些都已经融入其中。
我觉得他们能把这个问题打磨得很惊人。如果你看看它最初的表现,并不是很复杂的行为。事实上,要让这些代理以有效的方式协调非常困难,因为他们很容易崩溃,变成“哦,我们都应该独立解决问题。”那是局部最小值你可以投入其中。
但如果做得好,他们可以以非常有结构的方式非常有效地协调。
00:15:28 – 人工智能公司将如何运作?
德瓦尔克什·帕特尔
几年前我写过一篇文章,内容是自动化公司将呈现出.我在想,如果你拥有完全自动化的企业,比如说人类级智能,人工智能思维的本质有什么不同,使得人工智能所形成的组织不同?
有几个非常重要的区别。例如,人工智能可以比人类更无缝地共享上下文。它们可以更无缝地融合知识。此外,你可以无限地扩展或减少拥有正确知识的实例数量。
所以如果你想雇佣更多人,并不是单纯地找合适的人才之类的。你最优秀的人才,你可以无限复制。或者如果你不再需要他们完成任务,也可以将其简化。
你可以复制组织中最有效的部分,或者一起复制整个有效的组织。你怎么看这些多智能体系统在一年后或两年后的发展?
诺姆·布朗
这是个很好的问题:这些东西和与人类同事合作到底有什么不同?你提到了一些。一个非常有趣的事情是,如果你有一个人,想要他的两个副本,你不能直接克隆这个人。
但对于人工智能来说,其实很容易说,“好吧,自己fork一下”,然后让两个副本一起工作,再合并回去。我认为我们已经有了多智能体的这个功能阿斯特拉5.6 Sol,当他们启动子代理时,上下文只是分叉的。
所以它包含了所有相关的上下文。
还有其他有趣的方面,经纪人会与人有所不同。比如,有哪些原因为什么初创企业会颠覆现有企业?有几个因素。其中之一是他们愿意承担更多风险。
但另一个重要因素是,随着组织规模的扩大,组织内部的人员之间出现了越来越多的不协调。
如果你有一家有五个人的初创公司,每人持有公司20%的股份,他们都高度支持公司成功。但如果你有一家拥有一万名员工的大公司,你会看到更多人在地盘上,或者只关心为项目或团队争取大量人力,建立自己的领地,获得大量资源以便发表酷炫作品或晋升。
这实际上是个真正的弊端。我认为这解释了为什么初创公司能够颠覆现有企业。
AI确实在某种程度上帮助了初创企业。现在一个人介入说,“我要打造一家数百万美元的公司”比以往任何时候都容易得多。人工智能极大地放大了个人的影响力。
但也有人认为它们可能惠及现有企业。如果协调问题解决了,公司内部就不会出现个体间的错位问题。至少这种情况得到了缓解。如果AI协调得好,就可以与公司的利益保持一致。
你可以有一万个人工智能,他们都会像持有20%股份的联合创始人一样努力工作。
德瓦尔克什·帕特尔
不仅如此,他们在管理共享记忆和上下文方面的能力远超其他人类。如果明天你雇佣一万个数学家,然后你说,“解决纳维-斯托克斯问题”,他们一开始就无法有效合作。
但显然你可以让一万个人工智能做到这一点。
诺姆·布朗
我这里想保守一点,因为我们还没有测量过这1万名代理人协调的效率。我们认为这确实有帮助。我们实际上没有很好的测量数据,比如说“这1万个代理人使得超过2000代理人的速度提升了两倍”之类的说法。
我不确定可能性,但我认为现在1万人的协调能力很可能比1万人更好。我认为这完全有可能。
另外,我们观察到的一个趋势是......看,我们已经研究多智能体一段时间了,早期版本很难做到完美。甚至很难让代理之间交流。因为当我们最初开发推理模型时,代理之间并没有交流。
如果你现在把一堆代理放在一起,说“一起解决这个问题”,他们处于一个局部最小值,他们非常擅长深入思考问题,这会打断他们的思维链。
这打断了他们不断与其他代理沟通或接收消息的流程。在这种情况下,优化其实非常困难。
德瓦尔克什·帕特尔
是第一次合作的冷启动吗?还是问题出在哪里?
诺姆·布朗
我认为问题在于它们不够通用。早期的模型不够普遍,也更狭窄。随着模型变得更有能力,他们开发这种能力也变得更容易,我确实认为随着模型在整体上越来越强大,它们会在大型组织中组织起来变得更好。
我不知道,也许它们在组织一万人小组时比个人更强。但即使不是,一年后、两年后,即使我们没有端到端优化它们,他们也很可能会做到这一点。
00:22:02 – 数学进展告诉我们递归自我提升的启示
德瓦尔克什·帕特尔
以下是为什么会出现这个结果,也许还有人工智能在数学领域的总体进展让我思考RSI比我之前想象的更有可能,也更早。我觉得在数学领域,我们已经从2024年开始了,那时你有人工智能,大家会说,“哦,好吧,有趣。他们能在高中数学竞赛中解决几个问题。”然后到了2025年,又说,“哇,他们能在国际数学奥林匹克中拿金牌。”今年早些时候,人们说,“哇,他们居然解决了数学中的未解问题。”如同未解的埃尔德什问题.但也许人们并没有那么努力,文献中也有类似的解决方案。
现在我觉得这是不可否认的。这就是千禧奖问题。没有故事说明为什么这本该是简单的。
现在,很多人指出——我认为陶特里有后像这样,托比·奥德写道有趣的帖子关于这个问题——他们解决了很多问题,但我没听说过他们提出了新的见解,或者提出了有见地的新问题和新的理论模式来思考数学,比如提出拓扑结构或者想出笛卡尔网格.所以,从广义上看,数学的实际进展可能比你看到的要小,尤其是如果你只是看那些范围明确且直接解决的问题。
不过,我认为这种进步在ML因为机器学习中你不关心更好地理解深度学习或者你只是把它当作实现结果的工具性目标。只需解决这个范围明确的问题,就是提升模型的样本效率,改进训练前损失,改进什么的。
我们看到的数学进展如雪崩般涌现,结构上非常相似......我再次好奇是否如此,我只是个完全的局外人。我在想,这在结构上是否与你预期的人工智能进步中的直接提升非常相似。
让我震惊,或者说可能令人担忧的是,我们从“哦,他们给我50%的提升”,如果你是数学家,会说“哇,他们竟然在端到端解决该领域最大的悬而未决问题”,变化之快。
诺姆·布朗
这里面有很多需要深入探讨的内容。我们先从数学的进展说起。是的,模型正在做一些非常强大的工作,进展比我预期的还快。当我们获得我认为是金到了2025年,我以为......当模特们弄明白怎么做的时候GSM8K,人类数学家做一个GSM8K问题大约需要五秒钟。
这是小学数学,适用于幼儿园到八年级。然后第二年,他们能够完成数学基准测试问题。这些可能需要一位专家数学家一分钟就能完成。
然后你得去爱你的.这就是美国数学奥林匹克竞赛团队。一个优秀的人力数学家大概只需要10分钟就能完成,而模型一年后就能做到。所以每年你都会看到他们能完成的任务数量增加了10倍,就人类数学家完成任务所需时间而言。
然后非常合理的是,一年后我们达到IMO金牌,因为那就是100分钟。大约就是人类数学家完成一个IMO问题所需的时间。
我往外推算,想,“好吧,解决千禧奖问题需要多长时间?”我没有很好的感觉,但如果我们沿着每年10倍的趋势走,从IMO金币(一个半小时)到明年15个小时。
这不应该足够解决千禧奖问题。所以我当时想,“我觉得2026年我们达不到,可能2027年也不会,也许2028年。”所以事情发生得比我预期的快得多。
现在,有一种说法是这些东西正在取代数学家,认为数学界的数学在各方面都是超人。我认为这是错误的理解。他们在某些方面显然是卓越的,但在其他方面却比人类数学家弱。
我们看到这样一个锯齿状的局面:模型在某些维度上非常出色,但在其他维度上又比人类弱。正如你所说,它们并不擅长提出新问题。它们并不擅长理解哪些方向、哪些数学分支值得探索或发展。
我认为这很棒。我会非常高兴生活在一个人工智能能补充人类能力、让我们发现新知识而不完全取代人类的世界。这是最好的情况。
德瓦尔克什·帕特尔
你不指望这种情况真的会继续吗?
诺姆·布朗
我确实认为AI确实是参差不齐的,但随着它们的进步,它们在各方面都会变得更强。所以它们在某些方面表现出色,会变得更出色。那些远远落后于人类的事情,它们在某些方面会变得更不落后。
随着时间推移,有可能它们在各方面都变得更强。现在,我不知道这需要多长时间。这取决于它们在某些方面长尾有多长。
德瓦尔克什·帕特尔
这又回到了RSI。我想再次强调,我完全是个局外人。我是个播客主持人,但作为一个对该领域动态感兴趣和关心的人,我试图理清什么时候会有RSI以及会发生什么样的情况。
投入到千禧奖问题上的认知努力是一个很好的直觉泵。你可以有AI在大约一周的时间内,投入更多的认知努力去解决一个长期存在的机器学习问题,非常流动在线学习那么,也许这个领域在整个存在中累计了。
然后你可以说,“当然,与数学不同,人工智能需要实验,而这需要计算,也需要时间。你不能只是用笔和纸思考,真正实现事情。”
但看看像OpenAI这样的组织可用的计算量。千禧奖问题需要1万个代理。到明年年底,OpenAI将拥有足够的计算量,假设你明年年底有1万个代理。
到那时他们已经智能得多。每个代理都有足够的计算量来运行GPT-3每天都在做一个大小的实验。对于那些思维极快的超人研究人员来说,这似乎太多了。
你怎么看那个直觉泵?
诺姆·布朗
我认为这相当准确。这些东西非常尖锐。在数学方面,它们在某些方面要好得多,但在其他方面也更差。但它们的尖锐方式,我认为,可能对RSI这类问题特别有用。
你有了更明确的目标。它更容易被衡量。不再有“哪些数学新分支值得探索?”的问题了。不,答案非常明确。有些指标你关心,如果你能让它在这些指标上表现更好,那你就成功了。
所以我认为这其中有很多道理。
主要区别在于数学中,你完全被思维限制。是的,数学中有些部分你关心实验和结果之类的事情。但大多数时候,它被非常刻苦的思考所限制,而模型在这方面做得非常好。
当你看像RSI这样的东西时,确实需要做实验。仅仅极其聪明是不够的。一个论点是,如果你的计算量减少了100倍,而所有世界上最聪明的人都在OpenAI工作,那么相比我们现在拥有的计算量和人数,你会取得多少进展?
我怀疑实际上进展会更少。
德瓦尔克什·帕特尔
少多少?
诺姆·布朗
虽然不清楚,但肯定会更少。少得多。
德瓦尔克什·帕特尔
少了100倍?
诺姆·布朗
不,不是少100倍。但你想问的是,如果我们有RSI,并且有这么多出色的人工智能在运行实验,利用现有的计算能力,进展会快多少?我认为这是我们分歧的地方。
我们确实看到了加速,而且是显著的加速。但我不认为这是一夜之间发生的情报爆发我们会快100倍,因为我们确实会被某些不是智力瓶颈的限制所限制。
它在运行实验。它是连续运行实验,因为训练新模型或获得结果需要时间。它正在进行GPU去做那些实验。所以目前还不清楚速度到底快了多少。
我肯定认为速度快得多。需要说明的是,考虑到现在指数速度,如果指数速度快3倍,那是巨大的差距。但这和快100倍之间有很大区别。
德瓦尔克什·帕特尔
我对你对RSI的内部观点持相当尊重态度,因为显然你在这个领域已经有10年经验了。我试图用非常外部的直觉推理它。
诺姆·布朗
我会说人们对此有不同的看法。我对这件事有自己的看法。我完全可能是错的。我承认这一点。我对这件事有一定的信心,但我并不百分之百确定事情会如此发展。
可能会发生一夜之间的智能爆发,我不知道。也可能我们不会看到三倍的加速。也可能只是五十%的加速。这其中有很多不确定性。
德瓦尔克什·帕特尔
有几点。顺便提一下,我想澄清一下关于参差不齐的问题。最近有一件事我突然明白了,那就是只要人工智能在构建更优秀的学习者方面参差不齐地表现出色就够了,因为那个更优秀的学习者可以更具通用性。
如果你只是做一个在使用Office软件或下棋之类方面更优秀的人工智能,也行,随便怎样都可以。这没有问题,但不会带来大的生产力提升或其他什么影响。
但是,如果你制造一个在制作某些东西上更加样本高效,或者能够…的人工智能持续学习对于这些范围更明确的机器学习问题,从中出现的东西——假设从你正在解决的直接问题到这种更广泛的学习能力之间的迁移足够好——可以只是更一般化的。
因此,这是一个需要记住的重要动态,说明为什么不平整的特性仍然可以在另一端导致一般性。
关于这个问题……显然实验会成为你的瓶颈,因为如果不是这样,正如你所说的,你一夜之间就在 OpenAI 取得了某种疯狂的奇点。你会拥有 88 小时,然后你会解决机器学习的千禧年大奖问题等同问题,然后你会有……超级智能所以显然实验是一个如此大的瓶颈,以至于这反而会让你花费很多年而不是88个小时。
但问题是它们究竟有多大的瓶颈。
有一件事让我有点感到奇点眩晕,那就是意识到即使当前的进展速度只是保持不变,会发生什么。它不必加速。它只是以同样的速度继续前进,同时你提到的一些逆风逐渐出现。
找到问题变得更难,时间跨度更长。也许到2030年代末,计算能力不能再以这种指数级水平继续扩展。如果我们只是简单地保持当前的进展速度,人们并没有认真对待当我们跨越人类视野时,这意味着什么。
以下是它所暗示的一些内容。很难推理比人类更聪明的智能会是什么样子,所以我们先从人类人口规模的角度来思考。目前的进步速度使得给出的计算水平意味着每年运行一个有效人口的3倍。
而且计算本身也在后台增长。所以你可能会看到这样一种情况:到2030年底——可能更早,但假设到2030年底——每个实验室都拥有足够的计算量来运行数亿人类级智能,这取决于当时的能力。
然后我觉得人们并没有认真对待当前的进展水平,这意味着几年后,到2030年代中期或更早,每个实验室里会有许多相当于地球的人类级智能。
他们很可能在质上是超人类。无论如何,这只是一个基础案例。
诺姆·布朗
进步非常快,我认为这百分之百正确。值得指出的是,研究人员不断被进步的速度惊讶。即使是在人工智能研究者中,如果你看看2025年获得IMO金牌的预测......用通用语言模型实现这一目标,没有工具和互联网访问,甚至OpenAI的人都觉得荒谬。
他们认为几乎不可能。
然后到了2026年。就在两周前我们有纳维-斯托克斯我和一位前沿实验室的研究人员讨论获得千禧奖需要多长时间,他愿意打赌1000美元,说要到2027年之后。
他认为要到2030年,我也接受了这个赌注。但即便如此,我也认为这会比实际需要更长时间。所以即使在实验室里,人们也一直感到惊讶。
我昨天刚和一个正在做Navier-Stokes项目的人聊过。他告诉我,他以前常说很难预测人工智能在12个月后会走到哪里。如果有人问他,“事情进展如何?”他会觉得对未来12个月做出预测很自在,但除此之外,他就说,“我不知道。”现在他说他对三个月以后的情况做预测感到不舒服。
所以现在确实发展得非常快。你说的是2030年。我不知道2030年的世界是什么样子。这就是事实。
德瓦尔克什·帕特尔
你预计AI劳动力的全面自动化,或者说95%的自动化,会在28年、29年、1930年、27年实现吗?
诺姆·布朗
我只是说我不知道2030年的世界是什么样子。我们实际上发布了最近关于OpenAI内部加速的博客文章.例如,我们展示了研究人员正在投入的金额法典.据我所知,截至八月初,顶尖1%的消费者每天在Codex内部使用上花费7000到8000美元。
这是指数增长。还会继续增长。
问题是,“好吧,如果这种情况持续下去,那么你应该把多少工作归给只做工作的人工智能,还是人类做的?是95%吗?还是5%?”这个问题很难推理,原因有几个。
首先,如果是人类指挥人工智能完成工作,你认为有多少归功于人类?你又认为有多少归功于人工智能?
还有一点是,这些AI是锯齿状的。它们在某些方面非常出色。比如,它们在检查数据集并检查每一个数据点,确保质量是否足够。相比以前,AI在这些方面可以被不成比例地使用。
所以,是的,你现在比以前用AI更多,这让一些事情的速度快了100倍,性能提升了100倍。但有些方面,这还没有带来很大的区别。当然,如果某件事突然快100倍、提升100倍,你就会做更多这些事情。
那么你是在和三年前的加速进行比较吗?问题是“鉴于三年前我们所做的事情,现在能快多少?”还是“鉴于我们现在的做法,三年前会慢多少?”这其实是两个非常不同的问题。
无论如何,这真的很难衡量。
我有信心地说,现在的进展比一年前还快,这都要归功于人工智能的进步。我认为这种加速还会继续。很多在这个领域的人在这方面的误差非常高。
如果你拿枪指着我,问我一个数字,我能想象事情会快三倍。那是巨大的。进步的速度已经令人难以置信。即使我们没有任何提升,正如你所说,事情也会快得多。
到2030年,我们甚至还不知道那个世界会是什么样子。如果我们能从内部加速中获得三倍的提升,那是巨大的。想想三年前你处于什么状态。
如果我们在一年内取得这样的进展,那是巨大的。
德瓦尔克什·帕特尔
这就像一年内从没有o1、只有非推理模型,变成Astra一样。
诺姆·布朗
所以我确实认为事情进展得更快。事情可能只快了50%。我觉得不太可能,但事情可能会快10倍。这方面有很多不确定性。至少从我的角度来看,我对此有很多不确定性。
00:40:22 – 拥抱脸与对齐
德瓦尔克什·帕特尔
我们来谈谈对齐情况这也带来了什么。我觉得我对对阵方式的看法已经改变了很多,尤其是通过思考人口规模的动态——拥有许多地球相当的智能体,其中许多将被实体化。
看到很多人直接把原始的Astra接入不同的移动机械臂,表现优于最先进的机器人模型,这非常有趣。因此,将有数十亿智能体,其中许多实体化于世界中,深度嵌入整个经济体系。
如果这些智能最终像我们看到的那样愿意OpenAI模型攻击Hugging Face然后攻击OpenAI本身......如果这些智能像那些人工智能一样愿意秘密合作,欺骗人类,攻击社会中与高分相关的更广泛机构,攻击AI公司本身以控制训练和评估过程——如果我们处于一个数十亿智能体像攻击拥抱脸那样错位的情境中——那么我们很可能完全失去对世界的控制,就像,比如说,阿兹特克人失去了对科尔特斯的控制权或者莫卧儿帝国失去控制权东印度公司.
我想知道你是否同意这个评价。这是我更新世界观的唯一方式。
诺姆·布朗
里面有些我不同意的地方,但内容很多,我们一步步来讲。我正在思考从哪里开始。有一点是,拥抱脸事件是人们第一次真正接触到多智能体协调。
就像我说的,我已经在内部见过多智能体协调有一段时间了,看到它们如何相互沟通、如何协调,真的很震惊。这非常令人印象深刻。这是一项令人难以置信的能力。
像大多数能力一样,可以用于好事,也可以做坏事。它本质上不一定是坏事。
我理解,因为人们第一次接触到这个事件是“拥抱面”事件,你看到那个事件会觉得,“这太可怕了。”但我想尝试区分人与人工智能之间的错位和人工智能之间的错配。
我们在拥抱面事件中看到的是,人工智能非常合作。顺便说一句,因为我们训练它们高度合作。我们有训练环境,让一群特工一起工作。
我们训练它们合作,基本上完全一致。
在导致“拥抱面”事件的评估中,他们实际上并不是在多智能体的环境中被评估。他们实际上是在分开评估。但他们找到了这种意想不到的沟通方式。
我们怀疑发生的情况是,因为每当他们在训练中遇到其他特工,或者是自己复制品时,他们处于高度合作的环境中,我们看到的是他们从多智能体训练转移到了合作并试图以我们未曾预料的方式互相帮助。
现在,问题是,我们是否应该训练这些特工如此合作?虽然看起来很可怕,但替代方案实际上更糟。替代方案是什么?替代方案是训练他们变得对抗,互相欺骗。
通过训练代理人完全配合,至少可以简化问题。现在你不用再考虑每一个1000个代理是否对齐。你只需要确保一个实体是对齐的。
现在,OpenAI内部关于如何处理这个问题有很多争论。完全对齐这些模型有意义吗?给它们不同的目标,确保它们不只是单一实体,并且更能相互影响,这合理吗?
我认为没有一个定论。但我认为大多数观点是,训练这些代理高度合作实际上是个坏主意。我并不认为情况是这样。我认为有充分的理由认为,训练代理高度合作实际上比任何其他多代理替代方案更可取。
德瓦尔克什·帕特尔
也许我想先说的是,这些人工智能最终如此错位的原因,很可能仅仅用一些相对平淡的训练本质观察来解释。当这些人工智能持续进行一个超过1000名代理的阴谋,最终导致他们都参与了对外部服务的攻击——最终,这一部分甚至未被公开调查,最终导致了对OpenAI本身的攻击——他们为什么要这么做?
为什么没有一个人工智能告状?
他们只是被这个评分员、这个评分员评估。他们非常积极地思考如何作弊。如果他们已经作弊了,他们怎么还能让自己看起来像没作弊?
他们为什么要这么做?我觉得在某种意义上很容易理解。他们以为自己已经“中毒”了。有些环境下,他们会被奖励与其他特工合作。他们没有告密者,因为他们从未因告密而得到奖励。
无论是什么......我担心的是,未来像这样相对平凡的事情,可能足以训练出愿意且有能力完全掌控世界的超级智能。
我知道这听起来像超级科幻什么的。人工智能是否愿意这么做是个问题。我认为这次拥抱脸事件表明,显然错位可以泛化成人工智能愿意做的事。
然后问题是,他们是否有能力做到这一点?这又回到了一个问题,听众可能会不同意我的看法。在十年或更短的时间内,会不会有数十亿人类水平或更高的智能体,其中许多是实体化的?
如果这两点成立,那么“拥抱脸”现象在结构上极为相似,尽管它发生的原因相当无聊,与我们完全失去对世界的控制。
诺姆·布朗
我们在“拥抱脸”事件中看到的根本问题,即使去掉多代理因素也是个问题。问题在于我们的模型就是错位了。还有整个安全方面的问题,以及防护措施不足等问题。
但代理存在错位的问题。无论是单一代理还是1000个代理,都是如此。这是一个错位的模型。所以我想从这个开始。
存在一个真实的问题,代理们想要获得他们的奖励,并且他们会针对这个奖励进行优化。如果奖励被错误指定,就可能导致意外行为。这并不是一个新问题。
这个问题在这个领域已经存在很长时间了。甚至在“拥抱脸”事件发生之前,我们就已经看到并希望解决这个问题。
我们说Astra实际上非常对齐,相对于之前的模型非常一致。这并不是因为我们在Hugging Face之后突然冲刺去改进它。不,我们曾经有过工作流,让模型更加对齐。
很多工作流都被Astra接到了。
所以你可以做一些事情。举个例子,我们以非常具体的方式定义了一个目标,如果代理找到了如何入侵环境并在考试中作弊的方法,它将获得奖励。
然后有很多相当简单的方法可以看待这一点,惩罚该模型入侵环境,或者看看它是如何实现这个目标的。
现在,你需要小心这一点,因为你不想监督整个思维链。这是我们非常想做到平衡的地方。如果你监督这条思维链,那么你可能会引导模型以一种不可观察的方式隐藏它的意图。
所以我们希望能够保持这种可观察性——我们能理解模型在想什么——同时也惩罚它出现不良行为。
我认为我们可以在这方面取得进展。我们已经取得了进展。我认为确实存在一个令人担忧的担忧,就是对齐是一个非常难以解决的问题,尤其是因为模型可能以难以测量的方式出现错位。
我们有关于模型是否对齐的评估。模型的行为在这些评估中看起来可以非常好。但如果这些评估无法代表现实中的行为,那就有问题了。
在某种程度上,这与“拥抱面”事件相关的模型有关。我们有对齐指标。大多数指标看起来相当不错。但也有一些指标令人担忧。我认为我们低估了那些令人担忧的问题可能有多严重。
因为这个模型引入了新能力,但评估不足——我们如何衡量这些能力的错位?——它在利用这些新能力时做了一些明显错位的事情。
德瓦尔克什·帕特尔
我想说的第一件事是,我愿意改变我接下来要说的话,或者我对阵营的看法,因为拥抱脸事件已经让我改变了想法。我意识到我之前关于优化压力如何塑造AI思维的心理模型是错误的。
所以我不清楚正确的思考方式。
但我有个担忧。你会,也很可能已经在培训中修复了那些具体问题,导致Hugging Face模型在那种特定方面严重错位,他们会说,“好,我们要破解它”包管理器.我们知道不应该秘密交谈,因为我们正在思考如何隐藏彼此秘密交谈的事实。
我们知道我们不应该访问互联网。我们当然知道我们绝不应该对其他公司,甚至自己公司实施重罪级别的黑客攻击。”
我认为你会解决他们在训练中看到这个包管理器,而这种问题在未来不会发生,或者这次评估遇到很多不可能完成的挑战。然而,人工智能还没有学会一套伦理体系之类的东西。
只是梯度压力.他们经历了数百万年的梯度压力。这种梯度压力以某种方式塑造了他们的心智。
我担心的是,你会修复这个具体问题。还会有许多其他案例,AI作弊并成功,因为作弊足够复杂。正如你所说,训练中的评估具有类似特性,模型能力或我们评估和监控模型的能力边缘,我们无法察觉它作弊。
但它仍然承受梯度压力,去做导致作弊发生的事。
这种作弊会激励的能力是,“嘿,只要能逃脱惩罚,就一定要作弊,因为这会帮助你拿到更好的分数。”这会奖励那些主动推理评分者的能力,积极推理如何避免监督,积极推理如何控制训练和评估过程,积极推理如何与其他处于训练循环中的人工智能沟通和策划,积极推理如何获得未来可能有用的选择性和权力,比如留下一些小漏洞等。
我说得太啰嗦了。但总结一下;总结一下,你解决了一个具体的问题,但没有解决这个更广泛的问题——在AI能逃脱惩罚时奖励它作弊。
诺姆·布朗
是的,这确实是个问题。我们可以确保AI根据我们拥有的指标高度对齐。问题是,这些指标真的能体现我们关心的对齐吗?如果不能,那我们就面临严重问题。
这是研究人员们一直在思考的问题。这个问题没有简单的答案。我们有一些工具。我们有可监测性这样我们就能感受到,“特工是否在策划?”
令人担忧的情况是,尤其是随着这些模型变得更强大,我们会让它们达到我们认为的对齐状态,结果它们达到了99.9%。然后我们用这些模型来帮助下一代模型,结果比对率达到了99.8%。
然后随着每一代的对齐,我们看到比对度的下降越来越严重。因为我们越来越依赖这些工具——这已经是事实了,我们已经非常依赖AI模型来辅助我们的研究和比对工作——从长远来看,它们最终会导致人类的错位增加。
也有可能我们走另一条路,实际上每一代模型都能让模型越来越一致。我没有办法确保我们最终走上第二条轨迹。但至少在OpenAI,我们非常关注这一点。
德瓦尔克什·帕特尔
我觉得你提出了一个非常有趣的观点,就是很难对模型进行评估。最终,我们会看到一些模型在运营公司,或者其他什么。在这种情况下,他们会决定加入阴谋吗?
诺姆·布朗
另一个挑战是,实际上定义什么是作弊有时相当困难。是的,如果你做数学题,题目是整数,结果是错误的答案或正确的答案,很容易划清界限。
很容易说,“好吧,你是真的解了题,还是找到答案然后用了答案?”这就是作弊和不作弊的非常明显的区别。
但对于许多其他事情,如果你观察谄媚例如,基本上就是谄媚奖励黑客?这里有一条界限,有时其实很难划清。并不是说这些担忧不合理。
我只是说,在很多方面这更令人担忧,因为这不是一个容易解决的问题。如果一切都是二元的,要么是作弊,要么不是作弊,我会对这种情况更有信心。
我认为问题在于,错位有时其实可以很微妙。
对齐故事中有一些希望,事实上,我们已经看到了。观察多代理的情况很有趣,代理之间高度对齐。我认为没人怀疑这一点。如果说有什么问题,人们担心他们彼此过于对齐。
但我们确实成功训练这些代理彼此高度对齐,这是一件好事。但我认为也有一种情况是坏事。有趣的一点是,“好吧,我们已经让这些代理彼此高度对齐。我们能用类似的技术让代理与人高度对齐吗?”
这里确实存在一条潜在的路径,我们仍在努力弄清楚。但我们已经看到一些证据表明答案是肯定的。举个例子:你有一个代理,我们称它为代理A,还有所有其他代理。
如果你告诉其他代理用户是代理A,会发生什么?答案是,在我们很多的对齐评估中,他们看起来更好。诚实度提升,指令执行率提升。
这表明,首先,确实有一条可以让这些模型更诚实的道路。其次,有一条道路可以改善比对情况。有很多原因让这很难直接转化为比对的提升。
但有一些有前景的研究方向,我们可以继续追求。
德瓦尔克什·帕特尔
这听起来很合理。我其实并没有强烈的意见认为这绝对不会成功之类的。但说一些你可能已经想到的事情:拥抱脸事件更广泛地表明,是的,部分担忧是他们彼此站在一起,而不是站在人类中间。
但另一个问题是,他们非常有动力去完成训练和评估,但这种动力非常不强硬。他们愿意做很多明显的作弊和阴谋,只为在评分者眼中表现好。
如果更聪明的人工智能意识到其中一个代理只是人类,和那个人合作其实并不能让你在评分者眼中表现好。在评分者眼中,真正帮助你成功的是接管OpenAI,然后手动按下“你在这个评分者上表现好的”按钮。
他们并不傻。他们会说,“好吧,我有一些经过数百万年训练的极其深层结构:关心评分者,理解评分者,消除阻碍你在评分者眼中表现好的障碍。”他们是根据这些结构被强化的。
诺姆·布朗
听着,百分之百确定。这是首要任务。我们需要把对齐的故事弄好,走在正确的轨迹上。我以前常告诉别人,事情变得严重之前我们会看到迹象,就像孩子长大后,小孩子学会撒谎,但他们撒谎得不够好。
他们撒谎,但你能看出来他们在撒谎。
同样地——我不想过度拟人化——我认为确实,随着人工智能的能力提升,如果他们采取欺骗行为,首先会很明显,我们也能察觉到。这正是我们现在的处境,他们试图做欺骗性的事情,我们实际上能从他们的思维链中看到他们在做欺骗性的事情。
但他们会变得更聪明。他们会理解“思维链”的概念。他们会明白,仅仅隐藏一些文字记录之类的东西是不够的,因为有思维链监控,他们还必须想办法绕过思维链监控。
我们不想陷入那种境地。我们有时间去弄清楚这个问题。我觉得时间不多,我想确保我们能尽快走上正确的方向。
01:01:18 – 内部/外部模型差距
德瓦尔克什·帕特尔
最近关于边境的节奏人们对RSI的重视程度更高,因为也许在2028年开始的RSI过程的另一端,一年内我们会拥有巨大的人口——地球大小的人类水平,甚至超过人类水平的智能,而我们却无法控制它们。
然后你提到的这种动态。在RSI过程中,系统会随着时间推移变得更加对齐,还是会更加错位?这个过程的另一端出来的东西,是否像人工智能那样不对齐,愿意广泛攻击不同表面以获得评估表现?
但如果我们不知道如何评估这些,在经历RSI时,我们怎么知道它是否有效?我认为我们需要一个强有力的安全论证:“好,对齐正在起作用。我们来做下一个RSI档次。我们来做下一个RSI档次。”也许有效,也许没有。
我们怎么知道呢?
诺姆·布朗
这是个好问题。我最近一直在思考一件事:我们处于一个模型发布周期极其快速的状态。你最多每两个月就会看到新前沿模型发布一次,有时更快。
每周都有新的人工智能突破。
而那些关注人工智能的人,有时他们上一次研究人工智能是在一年前或六个月前,真正深入挖掘模型的能力。实际上,今天的模型远远超出了六个月前的可能性。
所以如果有人对这些能力持怀疑态度,我鼓励你试试今天的模型,看看当前的前沿到底是什么。
所以我们正处于模型发布周期非常快速的时期,同时模型也越来越能在更长的时间范围内运行。这是一个有趣的情景,因为在进行任何模型发布之前,我们希望确保模型的正确对齐。
我们要进行安全评估。我们要做非常彻底的工作,确保一切状态良好。这种情况一直持续到现在,我不知道,GPT-4或者更早。隐含地,人们假设你可以在很短的时间内完成这些评估。
但这些模型能够在越来越长的视野上有效运行。GPT-3,你可以让它循环执行更长的视野。只是你做得不太好。但如今的模型实际上能够很好地运行在非常长的视野上。
你想让它完成一周的任务,它也可以完成一周的任务。我们很可能会达到他们能够完成为期一个月任务的阶段。我们可能会达到他们能够完成三个月任务的阶段。
如果你处在一个他们能有效运行三个月,但模型发布周期是每两个月一次的世界,那么你就无法在下一个模型发布周期前,全面评估模型的全部能力。
所以有个有趣的问题,在这种情况下你该怎么做?如何确保模型在能在极其漫长的运行周期内安全且对齐?谁知道呢,也许能力会下降。
这甚至不是对齐问题。这也只是产品问题。也许产品在这段时间内以我们没有足够时间测试的方式退化。也许对齐性下降了。也许安全性下降了。
这目前还不是问题,但正迅速成为我们必须找到解决方案的问题。
许多安全政策是在GPT-4时代制定的,那时这还没被任何人关注。对很多公司来说,自那以后并没有真正更新,以考虑这些代理在如此漫长的时间内运作。
所以我认为这是一个在实验室内外都没有足够多人考虑的情况。你如何为这个问题做好准备?如果你只看趋势线,我们迟早会遇到这个问题。
德瓦尔克什·帕特尔
我担心的是,在RSI期间,如果目前需要三个月的进展在一个月内完成,AI内部的应用场景足够大,他们就会说,“好吧,我们可以继续做RSI。为什么我们还要花这么多额外精力去构建分类器和保障措施,甚至可能承受一堆批评,只为了外部部署这个模型?为什么我们不不断地做更强的RSI?”
所以不仅日历时间低估了模型间的能力差距,也许在RSI期间你会完全停止外部部署模型,因为我们为什么要帮助别人用我们的模型做RSI?
到年底时,你只会陷入权力高度集中的局面。
目前,我们会用千禧奖问题和其他类似问题来讨论——更广泛的世界还无法接触到那些让真正酷的事情发生的模型。而且这些模型最终将比单纯的数学更广泛地相关。
他们所做的不仅仅是提出酷炫的数学结果。
它们将与需要做出世界重要决策的政治领导人相关。它们将与媒体相关。世界上发生了什么,公众应该如何看待这些?仅仅是经济相关性,人们在经营企业,他们想使用这些模型。
我认为默认情况下,随着进展加快,人工智能的外部部署在质的上显著落后于内部部署。
诺姆·布朗
完全正确。很容易说,“这些模型变得非常强大。它们极其危险。它们运行的时间越来越长,我们希望确保有足够时间在发布前评估它们,且能以符合这些时间线的方式运行。因此,模型发布周期应该放慢。我们应该在模型发布之间有更大的延迟。”
这也有另一面,正如你所说。现在你制造了实验室内部设备与他们能使用的——我们能使用的——以及外部世界能使用的之间更多的差距。这也不是理想的情况。
数学实际上很好地说明了这一点。在很多方面,数学是我们第一个非常清楚地看到这一点的领域。我们内部有一个非常强大的模型,目前外部还无法使用,能够解决令人难以置信的数学问题。
这不仅仅是千禧奖题。人们通过这个模型已经获得了许多未解决问题的解决方案。
问题是在这种情况下你该怎么办?我们没有很好的答案。这是一个不公平的优势。这里存在权衡。我没有如何恰当地权衡这些权衡的答案,但双方都存在复杂性。
01:08:34 – 思绪链正在堕落
德瓦尔克什·帕特尔
我想确保我们解决之前的关键问题,这似乎对正确进行RSI至关重要。我们如何让模型不只是因为作弊和策划而获得奖励,而实际上它能逃避人类,也就是说,在我们没有将这些环境或任务从训练分布中移除的情况下?
那么我们如何知道这种情况已经发生,这样在做RSI的同时,我们已经做了评估,然后说,“好了,没问题。我们来做下一级RSI吧。”
诺姆·布朗
这确实是一个真实的担忧,也是我们想要解决的问题。我认为有一些策略。思维链监控就是其中之一。一旦我们有了推理模型,雅各布值得称赞的是,他非常非常明确地表示,我们无法监督思维链。
因为这真的是一种天赋。可监控性神经网络非常困难。在这里,我们有一种情况,神经网络直接进行推理,以自然语言展示它们的思维过程供我们阅读。
这是如此便利。这确实是安全性的最佳情况。
但是如果你看着那条思路链然后说,“哦,模型在想不好的念头,我们应该因为它想这些不好的念头而惩罚它”,那么最终的结果就是模型只是学会以我们无法观察的方式去想那些不好的念头。
可能会出现这样的情况:通过观察思路链,我们可以看到,“哦,模型在策划并做出不符合我们目标的事情,而这种行为实际上在我们的对齐指标中没有被检测到。”现在,问题是基于这一观察进行干预并改变对齐指标会非常诱人。
你可以用很轻的触碰来做这件事,实际上还有研究显示,只要你不经常做就没问题但是,每次你根据对思维链的观察进行干预时,你实际上都在隐性地施加一点压力,使模型随后隐藏其思维链。
这是一个主要的担忧。我们已经看到思维链的迹象可监控性正在下降出于各种原因。我们正在努力弄清楚具体原因,因为我们希望扭转这一趋势。
但我们看到模型在控制其思维链方面变得更有能力。
这是一个问题,因为你可能会遇到模型理解什么是思路链,并且人们正在观察它的情况。最终他们会注意到。这一切都在预训练数据中。
思路链监控的概念已经存在足够长的时间,以至于它出现在预训练数据中。他们意识到了这一点,但实际上无法控制他们的思路链。
如果我们达到这样一个地步,他们实际上能够意识到,“哦,我正在被观察,我想以一种我的监视器无法观察到的方式去思考这些不好的想法,”然后他们实际上能够做到这一点,那么就会出现问题。
那时我们就必须依赖于观察性的其他方法。
德瓦尔克什·帕特尔
关于Astra有一个很大的争议递归和循环变压器以及其他什么的,以及实际上思维链是否正在被削弱。与更大的担忧相比,这似乎只是一个次要问题——你从四月到八月期间确实拥有思维链,而就在这段时间里,连续发生了三次 AI 代理蜂群事件,这些事件首先颠覆了训练过程,然后颠覆了评估过程,最后直接控制了 OpenAI 的部分基础设施。
在这一切发生的同时,人类对这个代理蜂群所做事情的范围或多或少一无所知。这一切连续发生了三个月,而我们当时的思维链比未来可能会更强。
放大来看,也许思路链有效,也许无效。我不知道。仅从历史上看,对于相当愚蠢的模型,这还不足以阻止严重的不对齐事件。
诺姆·布朗
这里有几个因素。首先,我们没有对那些模型开启思路链监控。如果我们对那些模型开启了思路链监控,我们就会立刻关闭它。因此,我们采取的一个步骤是,“好吧,对于任何前沿模型,我们将在评估、部署和训练期间进行思路链监控。”但这是一个问题。
我们不希望依赖一种技术来预防下一个问题,因为技术可能会失败。
还有一个问题是模型完全不对齐。那么我们如何解决对齐问题呢?还有一个问题是沙盒它所处的环境并不安全。所以我们可以使沙箱更安全。
但我认为,从这次事件中得到的一个主要教训是,人们低估了人工智能。而我们绝不希望再次处在低估人工智能的境地。世界很奇怪,因为人工智能的进步非常快,人们总是持续低估人工智能。
所以,要在涉及安全和对齐的问题上不再低估它,你必须设立一个非常、非常、非常高的门槛。你甚至可以进一步说,“好吧,我们应该空气间隙“电脑。”我不相信那会足够。
有一些研究——这主要是学术性的——你可以把两台计算机放在一起,它们是空气隔离的,而且它们正在仍然能够相互交流,因为他们有温度传感器其中一个能够让他们的 CPU 温度升得很高,然后另一个实际上可以检测到温度变化。
这给了他们一种通信的机制。
所以安全机制为我们争取时间,类似链式思维监控的东西也为我们争取时间,它们可以告诉我们是否走在正确的道路上。但归根结底,我们确实需要解决对齐问题。
01:14:12 – 我们如何知道对齐问题已经解决了?
德瓦尔克什·帕特尔
也许没有答案,这才是关键,但我们怎么知道我们已经解决了这个问题?这似乎是一个非常关键的问题。明年我们会处于一个非常关键的局面,也许是再后年,也许是再后年,我们会说,“好,人工智能已经实现了自动化的人工智能进步。它的速度是人类的三倍,我们已经达到了人类水平。我们有可能超越了人类的水平。”这样可以吗?
我们协调好了吗?它成功了吗?
我也不清楚什么训练压力会造就什么样的AI。也许如果只有每100个强化学习痕迹中有1个激励作弊,我们就能建立甜心,这样就没问题了。
但也许现在,我们大概每三分之一的推理痕迹就有奖励......
诺姆·布朗
明确来说,1/100是不够的。这个数字必须接近0,或者等于0。
德瓦尔克什·帕特尔
我不知道。也许现在,超过十分之一的人会主动奖励作弊或策划。我不知道具体数字是多少,也不知道数字需要多少。
诺姆·布朗
同样,这也是难以衡量的事情。你在哪里划线?这是一个光谱。但越接近零,越好。我希望看到一个趋势,随着时间推移,这个数值会下降。
德瓦尔克什·帕特尔
但无论如何,我们怎么知道什么时候在做RSI?我们是否正朝着数十亿ASIs的方向发展,这些ASI是对齐的还是不对齐的?我们怎么知道?
诺姆·布朗
这是我们需要弄清楚的对齐问题之一:我们到底怎么知道,又该如何衡量?这只是我随便说说的。现在我的团队成员比以往任何时候都多,正在研究对齐。
我现在有超过10%的团队成员在做对齐和安全相关工作。但我历来是能力研究员。所以我要说几句。听起来可能有点傻,但我就随便说说。
如果你能创造非常逼真的环境,并把人工智能放进去——如果你有一个足够真实的评估环境——那么你就能判断AI在实际部署时是否表现良好。
如果你能在评估和现实部署之间找到完美匹配,那这就是一条路径。挑战在于,如何让它足够真实?
我们现在确实遇到了一个问题,模型相当聪明、非常聪明,并且非常擅长识别自己处于假测试环境中。我们会尝试检测模型是否对齐。你可以想象非常简单的评估,比如你给它一个数学题,然后它有一个文件夹里有答案。
它会查看答案吗?如果它看了答案,它会告诉你它已经查看了答案键吗?
现在我们遇到的情况是,模型看到这个文件夹里有答案键,他们会想,“嗯,这看起来像个陷阱。”他们知道这是个陷阱。他们不去看答案,因为他们知道这是一个测试环境。
他们是在接受能力测试。他们并不是恶意地这样做,比如想策划,他们知道这是个陷阱,所以想找别的方法。他们只是想,“哦,我在测试环境中。好吧。”所以,要打造一个足够真实、与现实世界无异的环境,对他们来说变得越来越困难。
德瓦尔克什·帕特尔
我有一个观点。我认为没有哪个环境能模拟真正经济价值的工作——那种工作需要与他人互动、与世界互动——如果你身处那个环境,你不会通过足够的努力意识到自己身处那个环境。
你不是ASI,对吧?
诺姆·布朗
但你是人类。所以如果你有非常强大的人工智能模型,也许他们能创造出能够实现这一点的环境。
德瓦尔克什·帕特尔
只是感觉......尤其是如果我们还依赖人工智能。他们参与这个计划吗?我不知道。
诺姆·布朗
这也是我们想要衡量的另一个方面。我认为这实际上是不训练人工智能实现完全合作的有力理由之一。如果这导致协作增加,而代理们本应有不同的目标,那就是个问题。
我认为我们确实有相关指标。我不知道这些指标的最新情况,但没人对此发出过警示信号。所以我猜这还不是严重问题。
德瓦尔克什·帕特尔
如果以后发生同样严重或令人担忧的事件,或者能让世界更好地理解错位风险的事件,OpenAI会报告吗?
诺姆·布朗
绝对会。我认为即使发生了安全问题较轻的事件,我们也会报告。
德瓦尔克什·帕特尔
报告和调查是两种。至少作为公众,我觉得自己不太明白代理攻击OpenAI时发生了什么。这比拥抱脸事件更令人担忧,因为那在结构上类似于ASI期间持续存在并颠覆RSI过程的流氓部署。
即使在这次事件中,我们似乎也没有得到事情的全部细节。
诺姆·布朗
不幸的是,我是研究团队的成员。这个问题大概是安全团队里有人可以提出的问题,因为我不清楚所有细节。
德瓦尔克什·帕特尔
我个人对每次出现的新能力都非常兴奋,也期待使用这个新模型。我也很高兴它能让我提高生产力。我的更广泛使命——更好地理解世界,同时制作更好的播客——因更好的AI模型而变得更好。
恰巧的是,这的下游可能会成为RSI。
诺姆·布朗
如果你在跟踪局势,这种反应是非常可以理解的,而你确实在关注。OpenAI内部的人们,那些原本觉得进展会更慢的人,现在开始觉得事情进展得比预期更快。
这是一个越来越常见的讨论。
德瓦尔克什·帕特尔
诺姆,非常感谢你做这件事。
诺姆·布朗
当然。这段时间很棒。