GPT-6 Astra发布:超越编程的新市场,Scaling Law持续驱动算力需求
GPT-6 Astra 标志着自 GPT-5 发布十三个月以来 OpenAI 的首次重大版本变更。OpenAI 指出了三个“第一”来解释这一新系列。它是首个在德克萨斯州星门站点用超过 10 万块 GPU 预训练的模型,这是公司历史上最大规模的训练运行。
这是首个早期模型在训练过程中发挥重要作用的模型。也是首个将计算机使用作为核心能力的旗舰机。Astra 于9月3日发布,现已广泛面向付费 ChatGPT 用户,通过 API 以及 Azure 和 Bedrock 平台。
定价为每百万输入代币10美元,输出代币每百万美元50美元,Sol 的2.5倍,与Fable 5.1相同,上下文窗口为105万个。
我们的观点是,Astra标志着知识型工作的Claude 3.7时刻,广义上指白领工作,潜在市场规模远大于编码。Claude 3.7 于去年二月发布,是代理首次变得可用的时刻。
Claude Code 作为研究预览同时发布,Manus 一个月后紧随其后,Operator 和 Deep Research 也在同一季度发布。开发者首次可以将整个任务交付,而不是逐行提示。
早期代理表现较为粗糙。它们漂移且需要监督。九个月后,Opus 4.5 实现了突破,当时可靠性提升,编码从试验转向大规模企业采用,收入达到数百亿美元。
Astra 的计算机编码使用尚未达到 Opus 4.5 的可靠性,但趋势已显现,其面向的市场也远大于此。更进一步,近期编码和知识工作的商业化最初针对现有劳动力预算。
递归自我改进(RSI),即人工智能加速自身研究的过程,反而指向人工智能为科学,这可能创造全新的经济价值来源。Astra在数学和科学研究方面的进步,是通用模型开始为科学做出贡献的又一迹象。
在公开基准测试和演示中,Astra在计算机使用、空间任务以及数学和科学研究方面明显领先于Fable 5.1。它在编码方面仍处于同一层次,其整体智能指数仍低于Fable 5.1。
作为背景介绍,Anthropic预计将在九月底前公开其S-1;Fable 5.1是上市前发布,Astra大约在一周后发布。
1. 计算机使用开拓了更大的市场
计算机使用意味着模型运行的是人们在工作中使用的相同软件。它读取屏幕、移动鼠标和打字,在Excel、CAD工具、Blender或浏览器中工作,而非从脚本调用API。
这长期以来一直是弱点。即使是移动PowerPoint文本框,也可能需要反复修改代码,而用户只需拖动即可。Astra在这些应用中直接行动的能力正在大幅提升。
其OSWorld得分在一代人中上升了7分至72.6%,每项任务的平均时间从75分钟降至40分钟。在Agents' Last Exam测试中,Astra测试财务建模、工程和媒体制作等专业工作,Astra得分为59.3%,而Opus 5为55.5%,同时输出标记数量减少了65%。
演示展示了工作流程不同阶段的进展情况。在专用软件中,Astra 打开 KiCad 并在三分钟内布置印刷电路板,这之前需要大量手工操作。
在办公应用中,它从原始数据构建 Power BI 仪表盘,完成 Form 1040,按规范格式化法律文件,并在三分钟内完成一个只需五小时的求职调研任务。
在空间和创意工具中,它能从一张房屋单张照片重建可编辑的 3D 室内,并在 Blender 中建模场景,然后导入 Unreal 作为可步行环境;这些演示在发布周传播最广。
它还可以通过验证闭环:搭建网站后进行前端质量保证,或安装测试软件并自行检查结果。在OpenAI内部,Astra已经开始在公司代码库中进行实验,这些实验过去需要研究者一周时间,从想法到代码再到完成运行。
本周最引人注目的变化是使用它的人。当编码模型出现时,热情来自于发布终端截图的程序员。这次,信息流充斥着建筑师、3D建模师和视频编辑者,这些人曾以为AI与他们关系不大,因为写出优秀代码的模型仍无法在他们的CAD或Blender中运行。
在许多职业中,进入门槛是对某一工具的熟练掌握:AutoCAD、Excel、Final Cut、KiCad。随着专业软件变得更易使用,专业判断和验证结果的能力变得更加重要,这些职业的工作流程将像过去一年程序员一样重组。
关于市场规模:编码的可触及市场是数千万程序员的工资加上全球软件预算,约一万亿美元,其中数百亿美元在过去一年左右成为收入。
知识工作的可触及市场是数亿白领工人的工资加上他们的工具预算。仅工资就超过10万亿美元。编码模型涵盖第一类;计算机使用进入第二类,这也是数量级差异的来源。
由于我们仍处于3.7阶段,我们认为这是潜在的。最有可能获得关注的用例是那些有结构化输入和可验证输出的场景:商业智能、财务建模和电子表格工作流程。
《Agents' Last Exam》以及 Power BI 和 Excel 演示中的财务建模任务属于这一类,它们代表了编程之外的早期收入来源,直到更广泛的自动化变得可靠。
企业使用大致分为四类。运营任务:填写表单、更新CRM记录、管理日历、在线调研并将摘要写入邮件、构建网站和运行质量保证。文档生成:生成演示文稿、文档、电子表格,并从现有模板进行分析。
Astra在AutomationBench上的得分为41.4%,Sol为18.1%,Fable 5.1为31.4%,Hebbia在构建演示文组时的遵循率提升了17%,引用准确率提高了19%。
研究:在Perplexity的研究工作流程基准测试中,Astra的得分比Fable 5.1高出13.5%,成本降低了6.1%。专业化任务:Harvey报告称,在复杂法律任务上明显优于Sol,该模型能够区分文件与既有记录,指出无根据的假设,并将空白转化为具体的起草立场;Jane
Street在交易直觉评估中明显提升;在科学方面,Terminal-Bench Science为64.6%,Fable 5.1为52.6%。
我们的RSI报告描述了从语言模型到思维链(CoT)推理、代理、持续学习,最终自我提升的过程,每个阶段都创造了新的商业机会。编码对应于代理阶段,Astra将代理能力扩展到更广泛的应用领域。
下一阶段,持续学习,是模型在部署中积累公司的隐性知识,这一问题正在得到解决。上下文窗口已达到100万个令牌;Codex现在跨上下文窗口记录笔记,并能检索早期记录,这是一种早期的持续学习形式。
OpenAI的Frontier团队及其咨询合作伙伴通过现场与客户合作,提供必要的业务上下文,承担类似的使命。
编程本身的历史也很有启发性。Claude 3.7让代理变得可用;九个月后,Opus 4.5带来了可靠性,4.6让长任务变得稳定,Fable则把长期任务和可合并的代码做好了。
当时每个步骤都显得很分散,但事后看来,路径很明确。我们将其描述为由模型与工具、内存和验证系统共同驱动的智能体扩展。每一代,模型都会学习更多强化学习(RL)中的长期工作,工具、内存和检查也增加了一层。
这些进步使代理从Claude 3.7的可用性提升到Opus 4.5的可靠结果,并为今年的快速普及奠定了基础。计算机使用的工具束才刚刚开始。
Codex的跨窗口内存以及专为计算机开发的验证和回滚功能都是第一版。有充分理由期待知识工作走类似的采用路径。
计算机使用是将模型扩展到更多领域的基础。一旦这个基础建立起来,它开启的市场规模大约达到十万亿美元。
2. 人工智能研究开始加速发展
Astra是首个早期模型在开发中发挥重要作用的旗舰机型,这一事实对我们的RSI论点比任何单一基准都更重要。OpenAI于9月6日发布的RSI进展报告显示了这一循环的快速转动。
去年秋天设定的目标是9月达到“自动化研究实习生”,即能在人工指导下完成技术高超研究者几天任务的系统。通过内部测量,目标是2028年3月前实现自动化AI研究员。
OpenAI研究组织中位数研究人员每天消耗推理代币超过600美元,使用率最高的研究人员每天消耗价值7000美元的推理代币。6月之前,总代理小时低于人类小时;到8月中旬,每个人类工作日相当于3.1个代理工作日。
8月,每位研究人员的实验次数创下了新纪录。4到8小时任务的成功率正在上升,尽管该范围内超过一半的成功任务至少涉及一次人工干预。
用OpenAI自己的话说,计算是进展的一个限制因素,随着其他瓶颈的缓解,计算的重要性可能会增加。
RSI的影响超越了编码和知识工作的商业化。短期的编码和知识工作的商业化主要取代了现有的劳动支出:程序员的工作、分析师的工作和设计师的工作。
无论资源池多大,替代优先,扩展其次。RSI的一个目标是将人工智能研究加速推广到更广泛的科学研究,人工智能对科学的长期价值主要体现在新产出:新药物、新材料、新能源、更高的作物产量,以及此前难以企及的成果。
Astra显示出早期迹象。它解决了68个未解决的厄尔德什问题中的2个;它改善了一个
在八十多年无进展后,被loglogn因子限制在大型质数缺口上;在真实研究环境中运行的终端实验台科学从Sol的22.4%升至64.6%;测序质量检查和变体可视化现已在专门软件中无人管理运行。
OpenAI计划在2028年3月前实现自动化人工智能研究者。一些自动化人工智能研究的工具和方法也可能在其他科学领域发挥作用,但进展仍取决于实验数据、验证设施以及物理实验的周期时间。
模型构建模型的循环已经在转动,计算是其主要限制之一。编码和知识工作大多捕捉现有劳动力支出;由RSI驱动的科学人工智能创造新产出。
3. 阿斯特拉的引领与不引领的
从最容易理解的结果开始。在数学中68个未解决的Erdős问题中,没有模型解决过任何一个;Astra解决了两个,并且在存在了八十多年的大型素数差距上取得了突破。
在FrontierMath最难的Tier 4中,Astra得分为97.6%,而Fable 5.1为87.8%。Terminal-Bench Science在真实研究环境中运行完整工作流程,Astra给出64.6%,Sol给22.4%。
BenchCAD,从设计图到CAD代码,为95.9%。专为测试抽象推理而构建的ARC-AGI-3,去年底低于1%;Astra在官方框架下达到99.9%,François Chollet表示基准饱和速度是他预期的两倍。
OpenAI官方表格分为四个区块,每个模型在任何努力水平下的最佳得分。
在编码方面,Astra 并未领先。Artificial Analysis 的编码代理指数给出 67 分,大致与 Opus 5 和 Fable 5 持平,低于 Fable 5.1 的 70。
Cognition 自己的 FrontierCode 版本则比 Fable 5 低 0.4 分,成本低 64%。使用过它的开发者们说得很一致:它能连续运行 2000 步而不出故障,界面几何体也做得很对,但它往往过度工程化,当被要求有针对性修复时会返回大量拉取请求,且其写作比上一代略弱。
在综合智能指数中,它得分为 61,与 Sol 持平,比 Fable 5.1 低五分。在专门为测量幻觉而设计的基准AA-Omniscience上,Sol的误差率从92%降至51%,对企业使用来说是显著提升,尽管这仅反映在同一配置下的一次评估,不应被视为日常答案的错误率。
在成本方面,Artificial Analysis在最大努力下测量出的输出标记比Sol少约10%,但按计费率计算,每个任务仍高出约75%。
计算机使用的余裕值得单独关注。ScreenSpot-Pro的92.7%表明屏幕上元素的定位已基本解决。OSWorld 2.0的72.6%,离线部分计分显示完整的工作流程仍有改进空间,差距集中在多步任务的可靠性上。
英国人工智能安全研究所的数学评估也带来了相关信号:在不产生思路链的情况下,模型成功率的一半(以人类解题时间计)从Sol的3.6分钟上升到30.9分钟,明显提升了隐式推理能力。
接下来的一到两代模型有很大机会在多步任务表现上带来显著提升,主要取决于强化学习训练和工具束的进展。这将是计算机使用的4.5个瞬间。
剩下的就是多级可靠性,强化学习和线束必须共同提供。一旦这一差距缩小,计算机使用将迎来4.5的时刻。
4. 为什么计算需求可能持续增长
根据业内讨论,GPT-6 使用的训练计算量大约是 GPT-5 世代的十倍。根据缩放定律的经验法则,多出一个数量级的计算量大约对应一个模型世代。
OpenAI 的公开声明显示,预训练已超过10万块 GPU。一个容易被忽视的点是,这个数字指的是预训练英雄运行,即单一最大的完整预训练任务,但这一代大多数计算并不集中在该工作。
根据我们的行业讨论,实验、强化学习、合成数据生成及支持基础设施加起来,计算量可能是主预训练运行的数倍,甚至可能高达十倍。
OpenAI 9月6日的说明也指出同样的观点:8月每位研究人员的实验创下纪录,整个研究组织的代理小时数是人类小时的3.1倍。8月7日评估Astra可能达到网络能力的关键阈值后,Astra级GPU分配当周又下降了59%,而其他型号类别的GPU分配约增长了17%,抵消了Astra级分配的约85%。
这表明计算可以迅速转向其他研究负载。GPT-6的参数数尚未达到10万亿,本代新增计算主要用于后训练和强化学习。因此,我们看到预训练仍有很大空间进一步扩展。
按时机推测,下一轮预训练的硬件将在2027年第四季度至上半年大量交付。Vera Rubin将在第三季度出货首批设备,第四季度开始生产,并持续到2027年上半年,Rubin Ultra Kyber NVL576则在下半年交付。
谷歌的TPU 8t超级芯片连接了9600颗芯片,支持121亿次浮次运算和2PB共享HBM,Virgo网络将134,000个TPU连接成一个结构;今年正式上市,Anthropic预计2027年将获得3.5吉瓦的TPU容量。
再加上Jensen Huang提到的40万块GPU,这将为2027年预训练规模将进一步提升的基础奠定了基础。
预训练和推理周期更偏向不同的硬件。推理更强调内存需求和每令牌成本,而预训练则对扩展织物和机架间连接性要求更高。仅凭权重容量无法估算超大型模型的训练足迹。
梯度、优化器状态和激活次数加起来权重是其数倍,随着并行度的提升,机架到机架通信承担的负载份额也在不断增加。NVL576现已确认在二级扩展中使用光学技术,传闻中的TPU侧6D环面将使每芯片的环绕光端口数量从1.5个提升到6个。
这支持了我们RSI报告中的核心观点:训练需求会反复出现,预训练将成为持续生产的需求,而非一次性成本。在预训练周期中,最大受益者是大规模互连和光学技术。
大约一个数量级的计算量相当于一个模型世代,预训练仍有扩展空间。据业界消息,英雄运行是较小部分;实验、强化学习和合成数据则是较大部分。一旦TPU 8t和Vera Rubin大量发货,下一次预训练加速就可以开始,大规模互联和光学技术在该周期中受益最大。