[2606.26294] 红皇后哥德尔机器:协同演化的智能体及其评估者
自我改进型智能体(self-improving agents)如今已经在代码类 agentic benchmark 上刷到了 SOTA,最近也开始被推广到更通用的领域。但这些方法的搜索机制普遍有一个隐藏假设:评价标准是"静止不动"的——无论是固定的 verifier、固定的 benchmark,还是固定的标注数据集,都被默认为在智能体不断进化的过程中始终有效。这其实忽略了生物演化中最核心的一条规律...
登录后关注作者、收藏内容和参与讨论。