研究称Anthropic模型实际使用成本低于中国模型

近期的一项分析对“中国产人工智能比OpenAI和Anthropic的产品更便宜”这一观点提出了质疑。

一家销售人工智能驱动的搜索与市场调研工具的软件公司——AlphaSense,发布了一项研究结果:与来自中国顶尖开发者的开源模型相比,OpenAI和Anthropic的专有模型在执行某些任务时,实际上成本更低。

(AlphaSense曾通过亚马逊、谷歌和微软等云服务提供商,以及Cerebras平台,使用这些模型。)

在对一系列模型进行测试、以检索并分析其海量财务数据后,AlphaSense发现:OpenAI最先进的模型之一——GPT-5.6 Sol,以及Anthropic最前沿的模型之一——Opus 4.8,在成本方面表现更为出色,且生成的答案质量更高;相比之下,来自中国两大顶级人工智能实验室的模型——Moonshot的Kimi K3和Z.ai的GLM-5.2——则显得成本更高。

要比较不同模型的成本效益,往往颇具挑战性。仅从“代币”的价格——即人工智能输入并生成的文本或图像的单位——来看,很容易产生一种误导性的印象:认为开源模型或开放权重模型总是更便宜。

Moonshot针对Kimi K3的每100万条输出代币收取15美元的费用,而Anthropic的Opus 4.8的对应收费为25美元,OpenAI的Sol则为30美元。

一些研究表明,这种做法实际上可能带来真正的成本节约:人工智能基准测试公司Artificial Analysis将Kimi K3和GLM 5.2的性价比,远远优于两款美国本土的模型,尤其是在完成同一组任务时,二者的表现相当相似。

不过,AlphaSense的这项研究——本月初发布——也印证了部分美国人工智能行业高管的观点:他们认为,尽管美国的模型单价较高,但更高的智能水平反而能让这些模型更具成本效益。

OpenAI董事会主席、AI客户服务初创公司Sierra的联合创始人布雷特·泰勒在上月下旬的一次CNBC采访活动中表示,前沿模型相较于开源模型而言,成本更低、效率更高,因为它们在回答问题或完成任务时,所使用的代币数量更少。

这一评论发表之际,Kimi K3刚刚问世。该模型在部分基准测试中表现与美国领先模型不相上下,这引发了人们的担忧:开源模型可能会削弱OpenAI和Anthropic的竞争地位——这两家公司的昂贵模型和编码工具,一直不断推高企业的人工智能支出。

(事实上,我已经举报了已经促使企业开始转向开源模型进行编码,以降低人工智能成本。)

AlphaSense向每款模型提出了246个财务分析问题,这些问题涉及对海量数据的梳理与分析,包括财报、投资者电话会议记录、SEC文件、新闻报道等诸多内容。

测试问题包括:要求模型分析制药公司的评论,生成垃圾处理巨头Clean Harbors重大收购案的简报,以及分析华尔街分析师对奢侈品零售商Burberry的销售额增长预测。

AlphaSense的团队根据模型的回答质量进行评分,例如:所用数字是否来自正确的时间范围,以及是否参考了多位分析师的观点。

AlphaSense发现,使用GPT 5.6 Sol的平均成本比Kimi K3低约13%,同时其质量得分高出约20%。同样地,Opus 4.8的成本约为Kimi K3的一半,但其质量得分却高出13%。

而在GLM 5.2身上,差距更加显著:其成本大约是Kimi K3的两倍,但在质量方面却排名靠后。

“有些价格较高的模型,仅仅从每条代币的价格来看似乎更贵,但实际上却因为使用代币更高效,反而成本更低,”AlphaSense首席执行官杰克·科科告诉我。

不过,科科表示,理想的方案或许可以采用多种模型的组合。AlphaSense在生成式人工智能搜索工具中,凭借自身研发的“Harness”软件,取得了整体最佳表现——该软件配备了一个路由器,能够为查询的不同部分选择最合适的AI模型。

例如,路由器可能会选择一款更智能、成本更高的模型来规划问题的解答方式,同时选用一款规模较小、成本更低的模型来执行这一规划。

他说,这样一来,每道问题的成本就能大幅降低。

当然,开源模型依然具有诸多优势。由于任何人都可以下载这些模型,理论上,只要企业拥有足够的模型资源,就可以将其部署在自家服务器芯片上,从而彻底摆脱对其他公司按代币付费的束缚。

而且,虽然财务分析是一个受益于更智能模型的领域,但较弱的开源模型也可能足以应对简单的任务,比如对电子邮件进行摘要。

这也正是为什么像OpenRouter这样的模型路由公司,会成为迎来他们的光辉时刻的真正原因。

火箭·德鲁提供了相关报道。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论