GPT-5.6 家族发布:Luna、Terra 与 Sol 模型深度解析

OpenAI 最新的旗舰模型已于今日上午正式面向公众开放使用,并提供三种不同规模的版本: Luna、Terra 和 Sol(从最小到最大)。
新模型的定价标准为:每100万输入/输出令牌计价,其中 Luna 价格为 1 美元/6 美元,Terra 价格为 2.50 美元/15 美元,Sol 价格为 5 美元/30 美元。
作为对比,Claude Opus 系列的定价分别为 5 美元/25 美元和 Claude Fable 5 的定价为 10 美元/50 美元;然而,如今在面对同一任务时,各模型的推理令牌数量差异巨大,因此仅以每百万令牌的价格来衡量其实意义有限。
OpenAI 最大的标杆性成果,聚焦于长期运行的代理式性能表现。一项基准测试显示,这三款模型均优于 Claude Fable 5:
我们训练了 GPT-5.6,旨在让每一颗令牌都能发挥更大的作用。 在“Agent 最后考试” 这项针对55个领域中长期运行的专业工作流程的评估中,GPT-5.6 Sol 创下了 53.6 的新高,比 Claude Fable 5(自适应推理)高出 13.1 分。即便在中等推理水平下,其也比 Fable 5 高出 11.4 分,且成本仅为估算值的约四分之一。这种高效性同样体现在更小的模型上——而这些模型正是让智能更加丰富、 更加普惠的关键所在:GPT-5.6 Terra 和 GPT-5.6 Luna 的成本大约只有 Fable 5 的十六分之一。
有趣的是,有一项自我报告的基准测试中,Fable 5 在该测试中彻底碾压了 GPT-5.6 系列:SWE-Bench Pro 测试中,Fable 5 获得了 80% 的得分,而 GPT-5.6 Sol 则获得了 64.6% 的得分。
这一结果或许能很好地解释 OpenAI 为何选择在昨日发布一篇特别的文章》,并在文中专门指出 SWE-Bench Pro 在审计过程中发现的问题:
鉴于这些测试结果,我们估计 SWE-Bench Pro 中约有 30% 的任务存在缺陷,并建议模型开发者仔细核查测试结果。
我已提前体验了 GPT-5.6 Sol——它确实非常出色,不过截至目前,它在我日常使用 Anthropic 模型进行的复杂编码任务中,尚未让我觉得比 Fable 更加优秀。
一如既往,关于如何使用 GPT-5.6 的模型指南中包含了最引人入胜的细节。 目前,我们还亟需探索一系列全新的 API 功能(并且很可能将在LLM 中实现这些功能),其中包括:
•程序化工具调用使模型能够“编写并运行 JavaScript,从而协调工具调用”——在我看来,这有望帮助弥合 MCP 与完整终端会话之间的差距,让后者能够以实用的方式组合 CLI 工具。
此外,这一功能让人联想到 Anthropic 在其网页搜索工具中新增的动态筛选机制——该机制允许在单次模型调用中,基于网页搜索结果执行代码。
•多代理功能则使模型能够“启动子代理,以实现并行且专注的工作”——这一子代理模式现已内置于核心 API 中。
•提示缓存断点将 Claude 模型中的提示缓存功能引入 OpenAI,让你可以明确指定缓存断点的位置,而不再依赖 API 自动检测这些断点。
就我个人而言,我更倾向于自动检测(尽管 OpenAI 仍支持这一功能),但若你愿意投入更多精力,想必在这里也能节省不少优化成本。
• 现在,你可以在图像请求中设置 “细节: 原始”选项,这样在图像被处理之前,完全无需对其进行缩放。
这里有一整页的图片,展示了 18 种不同的鹈鹕——分别对应三种不同模型的推理能力:低、中、高、极高以及最高级别。 同时,页面还列出了它们的令牌用量及计算成本:成本最低的是 gpt-5.6-luna,其在“无努力”模式下的成本仅为 0.71 美分;而成本最高的则是 gpt-5.6-sol,其在最高推理级别下的成本高达 48.55 美分。
另外,关于鹈鹕的最新消息,如果你在 今早的直播中跳转至 17:50,就能看到 OpenAI 亲自演示的 3D 鹈鹕,它们或骑着三轮车、或骑着自行车、或骑着小马驹,甚至还有另一只鹈鹕!