OpenAI 发布 GPT-5.6 系列模型,因美国监管仅向少数伙伴开放预览

OpenAI 今日正式宣布,将面向有限的用户群体推出其下一代 GPT-5.6 模型系列的预览版。该系列共推出了三款功能各异、能力层次分明的模型——Sol、Terra 和 Luna——旨在重新构想开发者与企业的工作流程。
在 OpenAI 向美国政府预先披露了这些模型及其发布计划之后,首批预览版已通过 API 和 Codex 向一小部分值得信赖的合作伙伴和机构开放。此前,2026年6月2日,唐纳德·J·特朗普总统颁布了一项《行政命令》,呼吁各联邦机构携手合作,共同制定一套标准流程,对新型 AI 模型的能力进行基准测试与评估,以确保这些模型既安全又适合广泛推广使用。
尽管这一进程仍在推进中(根据命令规定,需耗时30天,即7月2日),但 OpenAI 在其发布博客文章中表示:“我们已在今日正式发布前,提前预览了我们的计划以及各模型的能力。应 [美国政府] 的要求,我们首先面向一小群值得信赖的合作伙伴,开展有限的预览服务。”
旗舰级模型 GPT-5.6 Sol 的定价为每百万输入 token 5.00 美元,每百万输出 token 30.00 美元——与 GPT-5.5 保持一致——OpenAI 表示,该模型在长期运行的编码、网络安全以及代理式任务中,实现了显著的性能提升。
然而,此次预览版的推出,标志着人工智能部署领域一个极为不同寻常的篇章。由于 OpenAI 正在与白宫协同规划其发布框架,并为更广泛的公众发布做准备,企业买家必须面对一片全新的局面:实时安全干预机制、强制性合规参数,以及结构化的令牌缓存系统。
技术:深度推理与多智能体范式
GPT-5.6 系列的核心架构演进,聚焦于推理过程中计算资源的分配方式。不同于以往仅依赖即时生成 token 的模式,OpenAI 引入了一种全新的“最大推理努力”模式,该模式为旗舰级的 Sol 模型专门预留了更长的时间,使其能够深入解析高度复杂的问题。与此同时,Ultra 模式也首次亮相。
这种配置突破了单一独立模型的结构限制,转而部署专门的“子代理”,以实现多步骤、长周期项目的分解、协作与加速。初步评估数据显示,这种子代理协同机制极大地拓展了程序化执行的边界:
• 命令行自动化:在 Terminal-Bench 2.1 测试中——该测试涵盖了命令行环境中的规划、工具使用以及迭代式错误修正——GPT-5.6 Sol(Ultra)以 91.91% 的成绩一举登顶,领先于 GPT-5.6 Sol(Max)的 88.76%,并超越了 Claude Mythos 5 的 88%——相关数据详见 Screenshot 2026-06-26 at 12:46:37 PM.png。
• 专业工作流:在 Agent's Last Exam 这一基准测试中,该测试覆盖了 55 个专业领域,用于检验长时间运行的工作流,GPT-5.6 Sol 成为唯一一家成功突破 50% 成功阈值的模型,在代码模式下取得了 50.9% 的得分,同时相较于先前的架构,其令牌使用效率更为出色——详情请参见 Screenshot 2026-06-26 at 12:46:55 PM.png。
• 数量生物学:在 GeneBench v1 测试中,该测试用于衡量长周期的基因组学分析,旗舰级模型的表现远超 GPT-5.5,且在模拟的延迟时段内消耗的总令牌数量更少——具体数据详见 Screenshot 2026-06-26 at 12:47:11 PM.png。
产品:持久能力层级与提示缓存经济
OpenAI 将其产品命名体系细化为永久性的能力层级,各层级将依据各自独立的节奏稳步向前发展。这一模型家族为企业提供了明确的选择,帮助企业在智慧与运营延迟、财务成本之间找到平衡点:
• GPT-5.6 Sol(旗舰级):专为深度推理、高风险漏洞研究以及高级多智能体协同而优化(每 100 万 token 输入价格为 5.00 美元,每 100 万 token 输出价格为 30.00 美元)。
• GPT-5.6 Terra(均衡型):专为高效、高并发的生产工作负载打造,Terra 在性能上与旧款 GPT-5.5 旗舰级模型不相上下,但其输入价格仅为 2.50 美元,每百万 token 输出价格为 15.00 美元,明显更具性价比。
• GPT-5.6 Luna(快速型):专为快速、低成本的日常实用管道而优化,输入价格为 1.00 美元,每百万 token 输出价格为 6.00 美元。
可预测的提示缓存机制
为了帮助企业有效管控代理式循环运行中不可预测的成本曲线,GPT-5.6 API 引入了经过全新升级的提示缓存协议。
开发人员现在可以设置显式的缓存断点,并享有至少 30 分钟的缓存生命周期保障。在此框架下,初始缓存写入的费用比模型的标准未缓存输入速率高出 1.25 倍,但后续的缓存读取则可享受高达 90% 的折扣。对于那些经常将海量上下文窗口或代码库定义重新传递回模型的系统而言,这种可预测性成为至关重要的财务防护屏障。
此外,对于那些将延迟视为采用门槛的主要企业应用而言,OpenAI 将于今年 7 月在 Cerebras 硬件平台上推出 GPT-5.6 Sol。这一基础设施合作伙伴关系可实现每秒高达 750 个 token 的处理速度,专为需要实时、前沿级推理的专业企业应用而设计。
企业层面的影响:高安全与算法摩擦
对于企业工程团队、信息安全团队以及合规团队而言,部署 GPT-5.6 需要对其安全架构进行细致审视。该模型可通过商业企业 API 许可证访问,而开源选项则完全被排除在外,因为其网络能力本身蕴含着双重用途的风险。
为顺利通过发布审批,OpenAI 专门投入了约 70 万 A100e GPU 小时,用于自动化红队测试。这些计算资源被用于发现“通用越狱”——即旨在绕过各类场景下防护措施的系统性攻击向量,而非单次提示的临时应对方案。
这一大规模测试阶段直接融入了一个高度严格、多层次的安全防护体系,该体系以实时方式运行:
- 模型层面的拒绝机制:通过将硬编码的边界直接训练至基础权重中,以抵御被遮蔽的意图或对抗性模糊策略。
- 实时分类器:辅助系统可在每次生成的令牌时,逐个评估其网络与生物效应。
- 推理审查暂停机制:若在生成过程中检测到潜在的高风险违规行为,流水线会自动暂停。随后,由一个规模更大的次要推理模型对对话背景进行复核;若确认存在恶意行为,输出将在送达用户端之前被暂时保留。
双用途安全工作的运营摩擦
这一实时安全防护体系为企业的安全团队带来了独特的运营挑战。
由于合法的防御性工作——例如代码评审、漏洞挖掘、补丁开发以及防御性测试——往往与攻击性漏洞利用所使用的代码原语完全相同,OpenAI 承认其分类器可能会频繁触发误报。在本次预览期间,企业开发者应预计会出现局部延迟飙升、API 生成过程暂停,以及请求间歇性被拒绝的情况。
持续的标记可能触发针对历史对话的自动化账户级别审查,以评估企业客户是否正在从事恶意行为,或是进行常规的安全研究。OpenAI 目前正就更长期的企业安全合规控制展开谈判,包括由客户自主操作的安全覆盖机制,以及保护隐私的检测机制,以避免企业数据被手动审查流程所触及。
重要的是,OpenAI 提醒,目前在测试阶段,Sol 仍专注于防御性遏制,而非主动部署。在针对 Chromium 和 Firefox 代码库的评测中,该模型成功隔离了漏洞与利用原语,却无法自主构建出完整的、可运作的全链路漏洞利用,因此其表现始终低于组织的“网络关键”警戒阈值。
分阶段发布的地缘政治考量
GPT-5.6 系列的全面推广,反映了前沿人工智能实验室与国家安全协议之间日益加剧的交织关系。之所以选择将初始访问权限限定于一小圈经过严格筛选的合作伙伴——其详细信息已与美国政府共享——是因为在制定新的网络行政命令框架时,双方进行了直接协调。OpenAI 甚至采取了罕见的举措:在其官方产品公告文档中公开批评了这一主权性的门禁机制。公司直言:
“我们不认为这种政府准入流程应当成为长期默认模式。它剥夺了用户、开发者、企业、网络防御者以及全球合作伙伴本应拥有的最佳工具。”
这一紧张局势凸显了现代科技企业所处的微妙境地。尽管各组织可以通过 ExploitGym 和 ExploitBench 等基准测试,充分利用前所未有的代理式效率与强大的防御性补丁能力,但他们也必须接受这样一个事实:顶级工具的获取权限仍然取决于外交与监管授权。
ChatGPT 以及更广泛的公共 API 的全面可用性,预计将在未来几周内逐步推出。