GPT-6 Astra发布:性能基准、定价与安全能力详解

GPT-6 Astra

GPT-6 Astra“今天将向有限的组织推送,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,并通过OpenAI API和AWS开放”——我自己还没试过,所以目前还没太多可分享的。

它的API定价将与Claude Fable 5和5.1相同:每百万输入10美元,输出50百万美元。这显然是OpenAI的Fable竞争对手,在大多数OpenAI自报基准测试中得分似乎高于Fable。

最令人印象深刻的是,Astra在最近一次(三月发布)中获得了99.9%的评分ARC-AGI 3 基准测试- 值得注意的是,《寓言5》尚未发表成果,且ARC-AGI 博客注释99.9%的分数是通过OpenAI定制的“Provider Adapter harness”花费1.9万美元获得的,而默认的ARC-AGI框架得分为62.7%,价格为2.6万美元。

提供者适配器(Provider Adapter)框架保留请求之间的不透明推理状态,并使用压缩处理进行更长时间的对话,使模型能够重复使用之前的工作。

这并不奇怪,毕竟最近的拥抱脸事件Astra 在安全任务中表现非常出色。它在 ExploitBench 上得分为 100%(GPT-5.6 Sol 得分 78.5%),在 ExploitGym 上得分 42.4%(Sol 得分 30.3%),在 SRE-Bench 二进制逆向工程中四次尝试得分为 99.2%,而 Sol 为 68.7%。

它在长上下文方面表现更好:在OpenAI的八针基准测试中,256K–512K代币获得100%,512K–100万代币获得96.3%。OpenAI可能克服了长期上下文处理的一个持续挑战。

不过它并非事事皆胜。人工分析注意阿斯特拉在智力指数上仍被寓言击败:

与GPT-5.6 Sol并肩,在智能领域:GPT-6 Astra 在指数中得分等于 GPT-5.6 Sol,均为 61。这比 Claude Fable 5.1(带备份最高)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1.3(最高分)。

它在编码代理索引上的表现更好:

潜在客户编码代理指数成本效益前沿:在最大努力下,GPT-6 Astra的成本与GPT-5.6 Sol(最大)大致相当,但在指数上得分高出2分。每个任务,模型成本不到Claude Fable 5的一半,且得分相同。

等我拿到Astra权限后会写更多关于它的介绍。API模型标签一旦推出,会是gpt-6-astra.

街道黑客新闻

标签:前往,OpenAI,生成式人工智能,大型语言模型,LLM发布

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论