GPT-6 Astra 在 ARC-AGI-3 基准测试中的表现
<p>OpenAI的GPT-6 Astra在ARC-AGI-3上的应用</p><p>摘要<br>GPT-6 Astra在ARC-AGI-3半私密版中得分62.7%,价格为2.6万美元,使用.99.9%,且为1.9万美元。<br>GPT-6 Astra在ARC-AGI-3的行动效率上超过了人类基线。在96%的水平上,它使用了比中位数测试的人类动作少。<br>GPT-6 Astra 观察到的一个关键行为是能够将陌生环境转化为紧凑的符号世界模型。它将游戏机制表示为逻辑规则,并开发了自己的领域专用语言简称以追踪状态和计划行动。</p><p>ARC-AGI-3</p><p>ARC-AGI-3 是通过新颖、抽象、回合制环境研究智能智能的基准。智能体必须探索、推断目标,并构建环境的内部模型,以有效规划行动——无需明确指令。<br><br>你可以自己玩 ARC-AGI-3。</p><p>你的浏览器不支持嵌入视频。</p><p>这些环境只包含核心知识先验,并通过与人类参与者的受控测试进行难度校准。人类可以解决100%的环境问题。</p><p>ARC-AGI 系列的目标是衡量当前人工智能与 AGI 之间的“残余差距”。我们将 AGI 定义为系统能够以与人类一样高效地获得人类所能掌握的_任何_技能的能力。</p><p>ARC-AGI-3是ARC-AGI基准系列的第三代。它测试了超越ARC-AGI-1和ARC-AGI-2的智能能力。每一代都在前一代基础上不断扩展——随着前沿AI能力的进步,我们的基准也必须跟上。</p><p>ARC-AGI-3测试智能的四个组成…</p>






