持续学习

[2606.26294] 红皇后哥德尔机器:协同演化的智能体及其评估者

自我改进型智能体(self-improving agents)如今已经在代码类 agentic benchmark 上刷到了 SOTA,最近也开始被推广到更通用的领域。但这些方法的搜索机制普遍有一个隐藏假设:评价标准是"静止不动"的——无论是固定的 verifier、固定的 benchmark,还是固定的标注数据集,都被默认为在智能体不断进化的过程中始终有效。这其实忽略了生物演化中最核心的一条规律:物种在变,环境也在跟着一起变。我们希望把这个"红皇后"式的共演化逻辑真正带入递归自我改进,让评价本身也成为改进循环的一部分——向不断演化的评价者、对抗性目标、动态效用敞开大门,而不是死守一个可能早晚会被超越的静态 benchmark。

为此,我们提出 Red Queen Gödel 机(RQGM):一个支持"非平稳效用函数"下递归自我改进的演化框架。RQGM 的关键设计是"可控的效用演化"——把整个搜索过程切分成若干个 epoch,每个 epoch 内部的评价标准保持固定不变,只有在 epoch 边界处才允许更新效用函数。这样一来,自我改进的理论保证可以在每个 epoch 内部照常成立,同时目标本身依然能够跨 epoch 持续演化。

我们先在可验证的编程任务上做了验证:即便在这种"标准答案很明确"的场景下,RQGM 依然能通过引入一个互补的、agent-as-a-judge 代码评审信号,把测试通过率刷到超过此前的 SOTA——而且这个信号本身更省钱,RQGM 整体的 token 消耗只有基线的约 1/1.35 到 1/1.72(即节省 1.35–1.72 倍)。

接着我们把场景推广到更"软"的任务上:科研论文写作与评审,以及奥赛级别的证明写作与评分。结果同样亮眼——共同演化出来的"写作者"在多样化的 agent-as-a-judge 评审团面前,录用率比此前的自我改进型智能体高出 1.78–1.86 倍;共同演化出来的"评分者"在真实标准答案上的准确率也提升了 9 个百分点。

在论文评审这一块,我们还发现了一个值得警惕的现象:目前最强的 baseline 评审者存在明显的"AI 论文偏爱症"——对 AI 生成论文的接受率最高能达到人类论文的 1.91 倍。RQGM 通过引入一个对抗性目标,成功找到了对 AI 生成内容和人类写作同等严格的评审策略,一定程度上纠正了这种偏差。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论