GLM-5.3 上线 AI Arena,我对其智力/成本图忍无可忍

我认为AA的智能/成本图严重误导人,因此我决定自己绘制一张。他们的图表位于第二张图片中。所有点位都显示为“最高思维”水平;所有智能指数得分均来自AA;成本得分同样来自AA,除非下文另有说明。

AA的图表与我的图表之间有哪些不同之处:将X轴刻度从对数刻度改为线性刻度,因为人们的财富并非呈对数分布;新增了DeepSeek V4 Flash 0731,因为它目前由第三方供应商在OpenRouter上以当前价格提供(注意:OpenCode Go/Zen 当前尚不支持此功能,但官方已承诺不久后将推出该功能)。

新增了GLM-5.3,预计将在不到两周内由第三方供应商在OpenRouter上上线,前提是5.2版本的许可证不会发生任何变更。请注意:OpenCode Go/Zen 并不支持此功能。

新增了Qwen3.8-27B。每项任务的成本是根据47,166个输出token/任务(AA)计算得出的——按每秒55个token、功耗350W计算,这一估算基于我今天在RTX 3090上的实际观察结果(IQ4_XS的性能几乎没有质量损失——相关帖子即将发布)。

此外,今天的美国居民用电平均价格、英国居民用电平均价格,再加上今天的英镑/美元汇率,加上15%的预填充和等待工具的费用——硬件价格定为0,理由是:无论你是使用RTX 3090 PC,还是64GB Strix Halo,这两款设备本身就已经足够作为理想的游戏或工作用机了。

这些计算旨在得出一个粗略的概算,若你仔细放大图表左下角,就应意识到这些数值并不具备权威性。他们不愿回答:在家运行Qwen的成本相较于在OpenRouter上运行DSv4究竟便宜多少?

因为这两者的成本都低得惊人,以至于对于大多数人群而言,这种差异几乎可以忽略不计。请注意:一旦你升级到128GB Strix Halo(如果并非用于AI,几乎没有人需要这么多内存),再考虑硬件成本就不再具有合理性了。

这也是为什么我没有在图表中加入自托管的DeepSeek IQ2_XXS的原因;它很可能在智能轴上比MXFP4原生型号的位置更低。同样的道理也适用于一台需要花费约16,000美元才能在本地运行GLM-5.3 IQ4的配置。

我并不是说这些设备不值得投入这笔费用(隐私无价),只是认为将它们直接标示在图表上,其实是一种更加细致入微的分析方式。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论