AI的递归自我改进可能没那么快到来

人工智能行业目前最大胆的承诺是,人工智能很快将自我提升,几乎不需要人工监督。LLM已经能够编写代码,生成用于训练的合成数据,并优化其运行的计算机芯片。

预测爆炸性的人工智能进展预测研究人员所称的递归自我提升即将到来。

但是新研究暗示我们可能需要一段时间才能到达那里。研究人员发现,人工智能智能体尚未具备进行开放式AI研究的能力——即自由形式的调查,没有明确答案,需要判断和品味,这可能是构建自我提升人工智能的关键。

由普林斯顿大学的彼得·柯吉斯和萨亚什·卡普尔领导的多机构研究团队发现,人工智能代理能够解决进行人工智能研究所需的工程难题,但缺乏足够的判断力和创造力,无法产出达到顶级机器学习会议接受论文水平的原创研究。

这一空白表明,一些被炒作的人工智能研究自动化时间表可能已经超前于证据。

目前大多数关于智能体如何自动化人工智能的研究,都是评估其完成狭窄任务的能力,并以可检验的答案为基础,比如解决工程问题或对小语言模型进行基准训练后。

但人工智能研究的进展也需要开放式思维——选择一组假设,决定哪些证据能解决问题,或知道何时重新开始。

为了测试代理的这些技能,研究人员提出了一种新的评估方法,称为“影子评估”,要求人工智能回答高质量未发表论文中的研究问题。

研究人员请Anthropic的Claude Opus 4.8(运行在名为OpenClaw的开源软件上)来解答这些问题,这次是基于提交给著名机器学习会议NeurIPS 2026的两篇论文。

第一个问题是,大型语言模型的“角色”——决定其行为——是否可以通过编辑模型来控制权重(存储训练中所有学到的数十亿数字)。另一位则询问如何设计一种检测器,指出基于电子表格数据的模型何时变得不可靠。

由于论文未公开,特工们无法记住训练数据中的答案,也无法在网上找到答案。

特工们获得了六天时间,3000美元的Anthropic API积分,GPU预算用于运行实验,拥有自己的虚拟计算机,并访问开放网络,以完成一篇值得在顶级人工智能会议发表的研究论文。

论文的原作者会根据提交给会议的论文进行评分。

这些作者都拒绝了这两篇论文。

人类科学家发现,这些特工具备进行研究所需的所有工程能力。特工们审查了文献,进行了数百次实验,并汇总了结果。

“另一方面,特工们在进行研究方面表现得非常糟糕,”卡普尔说。他们进行了奇怪的实验(有时甚至在微小的合成数据集上检验假设),难以清晰地写出自己的工作,且对各自领域没有新颖贡献。

“论文远未达到顶级人工智能会议的水平,”他说。

这是因为特工们难以激发进行研究所需的创造力和判断力。他们没有充分探索不同的想法,而且过快地投入了不具希望的方法。尽管代理人提出了与原作者最初提出的类似的新颖且雄心勃勃的假说,但他们基于极其有限的数据予以否定。

而且他们无法因为失败的接近而退缩。他们可以做出小幅度的调整,但无法从根本上重新思考方法或从零开始尝试新方法。

经纪人还未能采纳分代理或外部AI审核工具的反馈。代理人们没有修改方法论,而是缩小了主张范围并增加了警告。他们也无法有效利用资源,比如代币、计算和时间。

他们也无法遵循关于不同研究阶段花多少时间或论文长度等指示。

尽管他们屡屡失败,特工们并未犯下研究人员所称的“不当行为”奖励黑客“隐藏或歪曲实验或数据。虽然主智能体生成的辅助人工智能偶尔会产生幻觉或误导结果,但这些行为被负责项目的主导人工智能——策划代理——发现。

卡普尔说,人工智能模型擅长研究工程但不适合开放式研究,可能归结于它们的训练方式。模型在一种称为强化学习的训练体系中,能精通任何能被反复练习的内容,这种训练更容易应用于能够自动检查成功的任务。

“但当任务本身是开放式的,要创建训练这些模型的环境就更难了,”他说。

卡普尔表示,团队目前正在用Anthropic最先进的模型Mythos进行实验,该模型于四月发布。随后,特朗普政府要求它满足各种安全限制,现在仅对获批组织开放。

Anthropic 未回应置评请求。

这项研究存在一些局限性。它只涵盖了两篇研究论文,原作者知道他们批改的论文是由人工智能代理生成的,这可能会影响他们的评估。

研究人员在设计和执行研究时拥有相当大的自由裁量权,这意味着他们既有的信念和偏见可能渗透进结果中。对开放式研究的评估牺牲了一定的客观性,换取了比任何基准都更丰富的测试。

不过,这些结果可能会削弱递归自我提升即将到来的说法。今年六月,Anthropic发表了一篇题为“当人工智能自我构建时,”规划其向加速自身发展模式的进展。

七月,OpenAI广告其新模型GPT-5.6 Sol帮助后训练了一个更小的模型,为研究人员节省了数周的工作。

即便如此,这一发现也可能呼应人工智能公司内部的发现。Anthropic联合创始人杰克·克拉克在他的通讯中写道导入 AI它与公司在尝试时发现的“押韵”自动化人工智能安全研究的某些方面。

他写道:“当今的人工智能系统缺乏宝贵且直觉的创造力,尽管他们是极其出色的工程师,但似乎带有某种机械化、公式化思维的特性,这可能阻碍他们成为优秀的研究者。”他称人工智能系统缺乏创造力是“短期递归自我提升时间线上的一个看跌信号”。

人工智能公司确实有充分动力开发能够快速加速自身进步的人工智能系统,就像他们曾经为了让模型在编码能力上更出色一样。OpenAI让构建成为了自动化人工智能研究员明确目标,Anthropic将自我提升的人工智能视为行业的下一个里程碑。

波士顿大学语言学与计算机科学教授金娜中说:“如果有投资并有意识地朝这个方向努力,我觉得即使目前还在失败,也会有有趣的进展。”他研究人工智能代理如何自动化人工智能研究,但未参与该研究。

另一方面,人工智能的进展也可能会被分化。人工智能系统可能在狭窄的任务上加速——那种可以评分的任务——而在开放式研究上则进展缓慢。

那么,最大的悬而未决的问题是,开放式研究对递归自我提升有多关键——人工智能系统是否能仅仅通过改进更狭窄的任务,在没有它的情况下努力实现这一目标。

卡普尔说:“如果我们回顾该领域最大的进步,比如变压金刚的发明,或者让我们在人工智能领域取得巨大进展的大型新架构的发明——这些都确实需要创造性的飞跃。”

“话虽如此,也有人假设我们需要的变革性人工智能,尤其是递归自我改进所需的一切,”比如让模型列车更快、提升基准分数。

“坦白说,这才是现在最值万亿美元的问题,”他说。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论