GPT-6 Astra 在 ARC-AGI-3 基准测试中的表现

OpenAI的GPT-6 Astra在ARC-AGI-3上的应用

摘要
GPT-6 Astra在ARC-AGI-3半私密版中得分62.7%,价格为2.6万美元,使用.99.9%,且为1.9万美元。
GPT-6 Astra在ARC-AGI-3的行动效率上超过了人类基线。在96%的水平上,它使用了比中位数测试的人类动作少。
GPT-6 Astra 观察到的一个关键行为是能够将陌生环境转化为紧凑的符号世界模型。它将游戏机制表示为逻辑规则,并开发了自己的领域专用语言简称以追踪状态和计划行动。

ARC-AGI-3

ARC-AGI-3 是通过新颖、抽象、回合制环境研究智能智能的基准。智能体必须探索、推断目标,并构建环境的内部模型,以有效规划行动——无需明确指令。你可以自己玩 ARC-AGI-3。

你的浏览器不支持嵌入视频。

这些环境只包含核心知识先验,并通过与人类参与者的受控测试进行难度校准。人类可以解决100%的环境问题。

ARC-AGI 系列的目标是衡量当前人工智能与 AGI 之间的“残余差距”。我们将 AGI 定义为系统能够以与人类一样高效地获得人类所能掌握的_任何_技能的能力。

ARC-AGI-3是ARC-AGI基准系列的第三代。它测试了超越ARC-AGI-1和ARC-AGI-2的智能能力。每一代都在前一代基础上不断扩展——随着前沿AI能力的进步,我们的基准也必须跟上。

ARC-AGI-3测试智能的四个组成部分:
**探索:** 在现实环境中,信息很少被动提供。智能体必须通过与周围环境互动主动获取信息。
**建模:** 代理必须将原始观察转化为可推广的模型,以预测未来的状态和结果。
**目标设定:** 代理必须识别目标未来状态,且奖励很少。
**规划与执行:** 代理人必须从当前状态规划出一条路径到目标,随着新信息出现而调整方向。

Astra成绩

{
“GPT-6 Astra 在 ARC-AGI-3 上通过标准和提供者适配器两种工具实现了最先进的得分。更高的推理水平通常会带来成本”
}
更少
{
因为Astra用更少的动作解决博弈,减少了模型调用和令牌的总数。”
}
查看完整结果
{"."}

以我们的数据,OpenAI的Astra(最高分)在ARC-AGI-3半私密版中得分为62.7%,售价为2.6万美元。Astra(最高)在1.9万美元中得分为99.9%。两者均为最先进的评分。查看完整排行榜。

在最大推理努力下,Astra 解决游戏更高效,要求
操作次数更少,因此总成本相对于其他方式更低
推理努力程度。
推理努力
马克斯
62.7%,26,098美元
98.6%,17,332美元

59.3%,37,317美元
98.4%,18,147美元

54.8%,40,705美元
99.9%,18,817美元
媒介
38.6%,48,090美元
98.4%,19,285美元

17.5%,38,166美元
98.0%,21,298美元
没有
35.2%,49,791美元
96.7%,23,457美元

作为成本对比,在我们的受控测试中,人类参与者每90分钟游戏获得115美元,外加每场完成游戏5美元。参与者每场尝试大约九局游戏,约为12.78美元(未计奖金)。

大部分费用用于支付参与者的时间和“意愿”,而不是大脑消耗的能量(这是更接近人工智能的替代指标)。如果只看大脑能量,并以电价计价,估计值降至每场约0.6美分,或每场尝试0.067美分。

分析

除了评分,Astra的回放展示了它如何将陌生的游戏机制转化为有用的可行模型。有三项发现尤为突出:它开发的紧凑代数符号、与人类相比的行动效率,以及它构建的自定义工具。

自定义代数符号

在玩 ARC-AGI-3 时,Astra 选择想要继续传递的策略笔记。它跟踪了对象、坐标、规则和未完成的计划,同时使用了为环境生成的自定义领域专用语言符号。

我们在其他模型中也见过类似行为,但Astra的笔记以其精确度和信息密度著称。它将场景提炼成一个紧凑的代码式符号模型:物体的位置、交互方式以及具体需要以何种顺序执行哪些动作。这是一种即时代数速写,而非完整的编程语言。例如:
**游戏状态:** 记录关卡、局部旋转索引和机构长度。s5i5,第219帧
**多步计划:** 记录了color-8和color-10机制的有序变化序列。S5i5,帧219
**控制点和坐标:** 将操作映射到执行操作的控制点坐标。S5i5,第235帧
**时间与位置:** 将回合计数器与玩家位置、携带状态和方向结合起来。WA30,第708帧

{“Astra音乐播放中”}
第五季第五集
{
“,利用其即时代数速记来跟踪状态和计划行动。”
}

与人类相比的行动效率

在启动ARC-AGI-3之前,我们测试了大约500名公众成员,以建立行动效率的人类基线,简单来说,就是人们解决每个环境的_速度'。参与者并非基于解谜经验或能力而选拔。2

对于每个关卡,我们用完成该关卡的玩家的中位数动作数定义了“人类基线”。这为比较人类和AI表现提供了参考。需要更多动作的AI动作效率较低,而需要动作少的AI则动作效率更高。

在 ,Astra(最大值)在96.0%的水平上使用了**比人类基线更少的动作**,平均每级的动作减少了**51.7%**。这是一个重要的里程碑。这意味着根据ARC-AGI-3的行动效率衡量,Astra达到并超过了达到人类水平。

顺便说一句,在我们启动ARC-AGI-3之前,我们假设行动效率将成为人类与人工智能之间的分界线。我们预期即使AI解决了一个环境,也可能需要远多于一个人的探索(行动)。这在暴力破解方法中依然成立,但前沿AI呈现出更二元的模式。一旦前沿AI“理解”了机制,通常执行时会在人类效率范围内。

阿斯特拉的行动效率与人类相比
每个点代表Astra(最大)完成的一个关卡。低于
实线表示行动次数少于人类基线。

上图比较了Astra完成每个关卡所用的动作数量与我们的人类基线。这强化了ARC-AGI-3衡量动作效率而不仅仅是任务完成度的原因。仅完成度评分能告诉我们Astra完成了一个环境,但不能说明它如何“学习”解题。

大多数基准测试只衡量成本效益,即计算资源的使用,而行动效率则衡量需要多少环境经验。

Astra的结果显示,执行解决方案所需的交互次数比人类基线少。

代理工具框架中的自定义工具

我们还评估了 PRO-LONG 线束(论文),这是早期 ARC-AGI-3 红队合作伙伴。在这种高级配置中,Astra 可以访问一个沙盒,执行自定义代码 3。

我们观察到Astra为每款游戏创建了一套定制工具:棋盘解析器、游戏状态模型、搜索算法、规划工具和持久笔记。对于更复杂的运行,Astra甚至制作了小型、针对游戏的软件库。

例如,在[](/tasks/tu93)这类迷宫式游戏中,有守卫和移动巡逻队,Astra从导航开始构建。它在中添加了战斗规则,在中建模了移动巡逻队,并用来验证预测与观察结果。

考察Astra在PRO-LONG中的表现很有用,因为我们看到了它在_external_工具上的表现。然而,这代表了与我们受控人类测试不同的评估条件。我们的测试参与者没有代码解释器、草稿本等工具,因此PRO-LONG的结果应被视为模型及其工具的综合性能。

Astra在PRO-LONG背带中玩乐。

两条安全带,两个问题

我们的ARC-AGI-3标准框架询问模型在同一最小、提供者中立接口下的比较情况。它提供了解决每个博弈所需的所有信息,但由模型决定保留哪些内容在可见笔记中。我们相信未来的AGI应能在这些条件下解决ARC-AGI-3。共享接口还为我们提供了跨提供者的一致、公平比较。

另外,还有一个独立的问题:当模型能够使用其提供者为其设计的上下文管理特性时,表现如何?对于 Astra 来说,这意味着在请求之间保留不透明的推理状态(我们看不到),并用压缩来管理较长的对话。

使用Provider Adapter harness后,Astra在ARC-AGI-3半私有系统中观察到的最佳得分从62.7%提升至99.9%。跨越公共和半私有及所有推理层级,Provider Adapter的运行按累计记录的经过时间约快3.66倍,且在两者解决的167对游戏推理对中,使用总代币减少49%。

今后,我们将在ARC-AGI排行榜上报告标准和提供商适配器的线束结果,每个评估条件都会有明确标识。我们的开源测试仓库和测试政策记录了这两种方法。

ARC-AGI系列

ARC-AGI-3 继续成为研究人员和代理探索陌生环境、发现规则并通过互动学习的有用游乐场。Astra 的成果也是一个值得庆祝的重要里程碑。从我们的角度看,Astra 代表了前沿模型能力的显著阶梯函数变化。

当我们启动ARC-AGI-3时,我们明确表示,达到基准目标并不代表“实现AGI的证明”。因此,虽然我们认为Astra代表了对泛化的有意义进展,但我们并不声称它是AGI。

ARC-AGI基准测试系列旨在与前沿AI同步发展。这在新兴研究问题与AI能力进步之间形成反馈循环。ARC-AGI-3是我们的首个互动基准,要求AI高效综合因果世界模型并实现目标,无需特定指令。Astra达到了这一标准。同时,ARC-AGI-3的范围和格式界限严格,其环境具有确定性、封闭的机制和目标。它并不代表现实世界的复杂性和开放性。

我们正在积极探索应塑造下一代基准的问题,包括如何评估递归自我提升和开放式创新。Astra的进展有助于澄清哪些AI能力尚未实现,哪些问题仍未解决。

---

感谢François Chollet、Mike Knoop、Matt Mazur、Ethan Bond和Derek Smith对本文的早期审阅。

{“假设”}
{“20瓦脑代谢能力”}
{
电价为每千瓦时0.20美元:0.020千瓦×1.5小时=0.030千瓦时,每场合计0.006美元,或每局0.006美元÷9≈0.00067美元。”
}
{“看那个”}
{“ARC-AGI-3人体测试论文”}
{". "}
{“未观察到试图逃离沙盒的迹象。”}

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论