Kimi K3 发布:从“骑自行车的鹈鹕”测试看模型成本与能力

Kimi K3 发布:从“骑自行车的鹈鹕”测试看模型成本与能力 图片 1

中国AI实验室“月球计划”AI 宣布基米K3 今天早上,他们将这款模型描述为“迄今为止最具能力的模型,拥有2.8万亿个参数”。 目前该模型已通过其官网和API提供使用,但官方承诺将在“2026年7月27日之前”公开其权重。

Moonshot 将此称为首个“开放的3T级模型”(我想他们把2.8万亿向上取整为3万亿), 从而从…手中夺得桂冠。DeepSeek 1.6T v4 Pro他们的 自我报告的基准 K3 主要以 4.8 最高分和 5.5 高分击败了 Claude Opus,但输给了 Claude Fable 5 和 GPT-5.6 Sol。

以下是本次的几个亮点… 人工分析报告 在模型方面:

“在我们的私人长期知识工作评估中,Kimi K3 的整体 Elo 得分为 1547,比 Kimi K2.6 多出 732 分,仅次于 Claude Fable 的 5 分。”

“每项任务的成本(0.94 美元)与 GPT-5.6 Sol(1.04 美元)相近,约为 Opus 4.8(1.80 美元)价格的一半,但高于其他开源权重的模型。 ”

“Kimi K3 在人工智能人工分析指数中的令牌使用量显著下降,其输出令牌数量比 K2.6 减少了 21%。”

该模型现在也成为了… leading model on Arena.ai's Frontend Code arena,甚至超越了克劳德·法布尔5。

这款新模型的定价颇具特色:每百万输入令牌3美元,每百万输出令牌15美元, 使其与Anthropic的Claude Sonnet系列处于同一水平,并成为迄今为止中国人工智能实验室发布的最昂贵的模型。 这一价格相比他们早期的模型有了显著提升。如Kimi K2.6。 以0.95美元/4美元的价格,2.8万亿参数的模型规模也超过了1T模型的两倍。

但是,它究竟是如何做到的呢?

我使用了OpenRouter(为了避免注册Moonshot API密钥)来运行该模型。 LLM-OpenRouter 插件 生成一只鹈鹕骑自行车的 SVG 图:

llm -m openrouter/moonshotai/kimi-k3 '生成一只鹈鹕骑自行车的 SVG 图'

以下是… 成绩单. 看起来是这样:

那只鹈鹕使用了95个输入标记和16,658个输出标记(其中13,241个是推理标记), 总成本为…25美分!

由于 K3 接受图像输入,我用上面渲染的 SVG 对其进行了测试(使用我的… 替代文本提示 ) 和 回来了 (用于… 0.6美分 ):

卡通插画中,一只戴着红色围巾的白色鹈鹕,骑着一辆红色自行车,沿着一条带有白色虚线的灰色道路前行; 这只鹈鹕拥有硕大的橙色鸟喙和蹼状的橙色脚掌在蹬踏,身后还点缀着白色的运动线条; 背景是一片浅蓝色的天空,飘浮着白云,一轮黄色的太阳,两只黑色的小鸟在空中飞翔, 前景是绿草如茵,点缀着细小的白色花朵。

从这只鹈鹕身上,我们能学到什么?

我的… 生成一只鹈鹕骑自行车的 SVG 图形。 目前测试已经21个月大了。它从来就不是什么特别出色的基准。 起初,这只是个玩笑,用来调侃这些模型的比较是多么荒谬地困难; 但就在第一年里,它竟然呈现出一个…令人惊讶的关联 到模型实际有多好。

那段联系如今几乎已经断绝。该… GPT-5.6 和 克洛德·法布尔5 鹈鹕被远远甩在了后面。 由GLM-5.2, 尽管我非常喜爱GLM,但我认为它并不是一个Fable级别的模型。

(我仍然不确信实验室是…) 基准测试的培训 - 如果它们是这样,我本会期待更好的结果。Gemini 有可能已经针对……进行了优化。 车辆上动物的任何组合 不过! 鹈鹕最大的局限在于,它完全不会触及当今模型中最为关键的要素:主动的工具调用,以及随着对话不断延长而能够可靠地操作工具的能力。

所以,千万别用鹈鹕来对比各种模型!

尽管如此,我自己运行这个基准测试仍然能获得相当可观的价值。

首先,它迫使我们真正去尝试使用这个模型。 如果我向你展示一只鹈鹕,那就意味着我已经成功地将一个提示词输入了它。 如果模型有官方API,我会直接使用该API; 如果它是开放权重(而且体积足够小,可以装进一台128GB的M5 MacBook Pro),我也会尝试在自己的机器上运行它,通常会通过…llama.cpp 或 LM工作室或奥拉玛.我经常会用OpenRouter因为这通常能提供官方API的代理, 而我不需要新的API密钥。

我的大多数鹈鹕都是用我的LLM CLI工具这也促使我确保最新模型通过它的某个插件得到支持。

更重要的是,即使是单一提示“生成一只鹈鹕骑自行车的SVG”,也能揭示有趣的模型特性。

考虑结果今天为Kimi K3。运行这些简单的提示帮助我强调了模型的几个重点。

目前它只有一个理由,“max”——这点很明显。该模型消耗了13,241个推理标记,输出了3,417个响应标记。这很贵——鹈鹕花了25美分!

提示“生成一只骑自行车的鹈鹕的SVG”是如何加起来的95个输入标记的? OpenAI 的分词器第10数,人类的作品4.6有10首, 作品4.7有30首,第5十四行诗/寓言第5首有25首。 提示“嗨”致Kimi K3数了86个令牌,暗示系统可能隐藏了85个令牌。 它拒绝泄露不过。

Vision效果很好:它生成的替代文本非常出色。

K3目前只有一个思考努力等级,但我最近通过运行同一个Pelican提示的不同努力等级, 快速了解这些努力带来的影响,获得了不少价值。 这是我的矩阵针对GPT-5.6模型家族例如。

不过说实话,我从鹈鹕测试中获得的主要收获是:

这是一个“你好世界”的练习,用来提示模型

简单任务的粗略成本和推理估算

确认模型能够输出有效的SVG,并且具备基本的几何和空间感知能力。对于运行在我笔记本上的小型机型来说,这问题要严重得多。

在同一型号系列中比较鹈鹕的不同版本仍然很有趣。 K3的鹈鹕比明显提升了Kimi 2.5.

这是我可以分享的,证明我尝试过。而且现在Hacker News上有鹈鹕的评论已经成了传统,每次我迟到都会有人评论问鹈鹕在哪里!

标签:前往,生成式人工智能,大型语言模型,LLM定价,鹈鹕骑自行车,LLM发布,中国的爱,人工分析,登月计划,有些

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论