Kimi K3 发布:参数与性能的突破,以及我们仍可从“鹈鹕基准”中学到什么

中国AI实验室Moonshot AI于今日上午发布了Kimi K3,并将其誉为“迄今为止最强大的模型,拥有2.8万亿个参数”。
目前该模型已通过其官网和API正式上线,但官方承诺将于“2026年7月27日前”公开其权重文件。
Moonshot将此模型称为首个“开放的3T级模型”(想必他们把2.8万亿向上取整为3万亿),
从而从DeepSeek的1.6T v4 Pro手中夺得桂冠。根据其自报的评测结果,Kimi K3在多项指标上大多领先于Claude Opus 4.8 Max和GPT-5.5,但在某些方面则略逊于Claude Fable 5和GPT-5.6 Sol。关于该模型的《人工分析》报告中的一些亮点如下:“在我们针对长期知识工作的私有评测中,
Kimi K3的综合Elo评分为1547,比Kimi K2.6高出732分,仅次于Claude Fable 5。”“每项任务的成本(0.94美元)与GPT-5.6 Sol(1.04美元)相近,约为Opus 4.8(1.80美元)的一半,且高于其他公开权重的同类模型。
”“Kimi K3在人工分析人工智能指数中的令牌使用量显著下降,相比K2.6减少了21%的输出令牌。
”此外,该模型如今已成为……领域的领先模型。
Arena.ai的前端代码竞技场,甚至超越了《克劳德寓言5》。
新模型的定价尤为显著:每百万个输入代币3美元,输出代币15百万美元,使其与Anthropic的Claude Sonnet系列持平,成为迄今为止中国人工智能实验室发布的最昂贵模型。
这比他们早期的型号如Kimi K2.6大幅提升,价格为0.95美元/4美元。
2.8万亿参数的规模也是1T模型的两倍多。
但鹈鹕是怎么做到的呢?我用OpenRouter(避免注册Moonshot API密钥)搭配llm-openrouter插件生成了一只鹈鹕骑自行车的SVG:
llm -m openrouter/moonshotai/kimi-k3 '生成一只骑自行车的鹈鹕SVG' 以下是文字记录。情况是这样的:那只鹈鹕接受了95个输入标记和16,658个输出标记(其中13,241个是推理标记),
总花费25美分!因为K3接受图片输入,我用上面那个渲染的SVG做了测试(用我的替代文本提示),
结果(0.6美分):一只白鹈鹕戴着红色围巾,骑着红色自行车沿着灰色道路上行驶,
路面上有白色虚线;鹈鹕有大型橙色喙和带蹼的橙色脚,脚后有白色运动线;背景是浅蓝色的天空,
白云,黄色的太阳,两只飞翔的小黑鸟,以及前景绿草,上面有小白花。
我们能从鹈鹕身上学到什么?我的“生成一只鹈鹕骑自行车的SVG”测试已经21个月了。
这从来都不是特别好的标杆。最初只是开玩笑说比较这些模型有多么荒谬地困难,
但第一年里,模型的实际好坏竟然有出人意料的相关性。
这种联系现在基本已经断了。GPT-5.6和Claude Fable 5的鹈鹕被GLM-5.2超越,虽然我很喜欢GLM,但我认为那并不是Fable级的模型。
(我仍然不确定实验室是否在为基准测试进行训练——如果是的话,我会期待更好的结果。
不过,Gemini 也有可能优化了载具上任何动物组合的配置!
)Pelican最大的限制在于它根本没有涉及当今模式中最重要的东西:代理工具调用以及随着对话加长而可靠操作工具的能力。
所以别用鹈鹕来比较模型!话虽如此,我自己跑基准测试还是能获得不少价值。
首先,它是一个用于实际尝试模型的强制函数。
如果我给你展示一只鹈鹕,说明我已经通过它运行了一个提示。
如果型号有官方API,我会用它;如果是空重的(而且足够小,能放下128GB M5 MacBook Pro),我会尝试在自己的机器上运行,通常是通过llama.cpp、LM Studio或Ollama。我经常用OpenRouter,因为它通常能提供官方API的代理,
不需要我新的API密钥。我的大多数鹈鹕模型都是用我的LLM CLI工具生成的,这有助于我确保最新模型能通过它的某个插件支持。
更重要的是,即使是单一提示“生成一只鹈鹕骑自行车的SVG”,也能揭示有趣的模型特性。
看看今天Kimi K3的成绩。运行这些简单的提示帮助我强调了模型的几个重点。
目前它只有一个理由,“max”——这点很明显。
该模型消耗了13,241个推理标记,输出了3,417个响应标记。
这很贵——鹈鹕花了25美分!提示“生成一只骑自行车的鹈鹕的SVG”是如何加起来的95个输入标记的?
OpenAI的分符器计数10个,Anthropic的Opus 4.6计数10个,Opus 4.7计数30个,Sonnet 5/Fable 5计数25个。向Kimi K3提示“hi”时,计数了86个令牌,暗示系统可能存在85个令牌的隐藏提示。
但它拒绝泄露。Vision效果很好:它生成的替代文本非常出色。
K3目前只有一个思考努力等级,但我最近通过运行同一个Pelican提示的不同努力等级,
快速了解这些努力带来的影响,获得了不少价值。
举个例子,这是我为GPT-5.6模型家族制作的矩阵。
不过说实话,我从鹈鹕测试中获得的主要收获是:这是一个“你好世界”的练习,
用于提示模型;一个简单任务的粗略成本估算和推理;确认模型能够输出有效的SVG,
并且具备基本的几何和空间感知能力。对于运行在我笔记本上的小型机型来说,这问题要严重得多。
在同一型号系列中比较鹈鹕的不同版本仍然很有趣。
K3的鹈鹕比Kimi 2.5有了显著提升。这是我可以分享的,证明我尝试过。
而且现在Hacker News上有鹈鹕的评论已经成了传统,每次我迟到都会有人评论问鹈鹕在哪里!
标签:ai,生成式AI,LLMS,LLM定价,Pelican-ride-a-bike,LLM发布,AI-in-China,人工分析,登月,Kimi