K3 用早期的自己优化了自己,这比 2.8 万亿参数更值得琢磨
过去十二个月,有九个月,全球参数量最大的开源模型都是 Kimi 出的。
这件事很容易被当成一个技术 PR 数字滑过去。
但仔细想想,它说明的是另一件事:Moonshot 在坚定地赌,规模这条路对开源模型同样成立,而且他们有能力持续跑在这条路的前面。
这里藏着一个容易被忽略的商业逻辑。
开源最大的模型,不是做慈善。
权重开源意味着模型本身不赚钱,但围绕它的推理服务、生态位和开发者心智会赚钱。
你把最强的开源模型给出去,全世界的开发者就会围着你的架构写工具、调 harness、贴推理服务,而官方 API 因为最懂自家模型的部署,天然握着成本和稳定性的优势。
这是一门"送出模型、收回生态"的生意,谁的开源模型最大最强,谁就站在这个生态的中心。
Kimi K3 是这个押注的最新落点。
2.8 万亿参数,全球首个开源的 3T 级模型,这两天正式对外发布。
规模之外,K3 真正的跃迁是效率翻了 2.5 倍
做个直观的对比。
GPT-3 当年是 1750 亿参数,惊艳了整个行业。Kimi K3 是它的 16 倍。
但参数只是入场券。真正有意思的是背后的效率账。和 Kimi K2 相比,K3 在整体 scaling 效率上有大约 2.5 倍的提升。同样的算力,K3 能转化出更多的智能。这靠的是两项架构创新:
Kimi Delta Attention(KDA):改变了注意力机制跨序列传递信息的方式,让长上下文处理更高效。
Attention Residuals(AttnRes):让模型在不同深度层之间选择性地调用历史表示。每一层不再均匀地堆叠,而是按需取用,把算力花在刀刃上。
Mixture of Experts(MoE)方面,K3 从 896 个专家中每次激活 16 个,稀疏度非常高。高稀疏 MoE 众所周知的问题是路由不稳定、负载不均衡,K3 用 Stable LatentMoE 框架解决了这个问题,同时引入 Quantile Balancing,避免对敏感的均衡超参数产生依赖。
训练用 MXFP4 权重加 MXFP8 激活做量化感知训练,从 SFT 阶段就开始。这意味着模型对硬件的兼容性很好,上线就能用,不需要二次量化适配。
模型开始优化训练自己的代码
编码能力这一块,Kimi K3 官博放了几个案例,其中有一个细节值得停下来看。
评测里有一项 GPU kernel 优化任务:让模型在沙盒里独立跑最多 24 小时,优化 AttnRes、KDA 等四个 kernel,覆盖 NVIDIA Hopper GPU。
Kimi K3 的成绩和 Claude Fable 5 接近,大幅领先 Opus 4.8 和 GPT 5.6 Sol。
但真正让人坐直身子的是旁边那句话:在 K3 开发的后期阶段,一个早期版本的 K3 承担了团队大部分的 kernel 优化工作。
一个模型,在训练自己的过程中,优化了让自己跑得更快的底层代码。这个循环有点绕,但它确实发生了。
值得把这一层含义讲透。过去我们讲"AI 加速 AI 研究",指的是模型帮人写论文、跑实验、调超参。而这里发生的事情往前挪了一层:**模型开始成为自己训练基础设施的贡献者。**不是产出更好的模型,而是让"生产模型的那台机器"跑得更快。如果这条路走通,训练范式会出现一个新的正反馈:每一代模型都比上一代更擅长优化训练下一代所需的底层代码,基础设施的迭代速度不再完全受限于工程师的数量和精力。
这是一个安静但可能很深的信号。
另一个案例更直接。Kimi 让 K3 从零建了一个叫 MiniTriton 的 GPU 编程系统,包含自己的 tile-level IR、MLIR 优化 pass 和 PTX 代码生成管道。在支持的 roofline 基准上,MiniTriton 的性能跟 Triton 和 torch.compile 持平甚至更好。更关键的是,它跑通了 nanoGPT 的完整训练,损失曲线和参考接近,这证明整个 pipeline 是真实可用的,不只是跑几个漂亮的微基准。
一个 AI 从头写出来的编译器,性能和 PyTorch 团队精心维护多年的 Triton 差不多。
48 小时,一块芯片
游戏开发那部分案例,K3 展示的是视觉在循环里(vision in the loop)的能力,代码和截图来回切换,即写即看即改。
这是 K3 生成的开放世界游戏演示,从文字描述直接生成可玩的互动体验。
武侠 RPG,同样从概念出发,K3 结合代码和截图反复迭代生成。
游戏 demo 本身已经很说明问题,但更让人震惊的是芯片设计那个案例。
K3 在一次 48 小时自主运行里,用开源 EDA 工具在 Nangate 45nm 工艺库上设计了一块芯片,专门用来服务用 K3 自己架构构建的 nano 模型。结果是:4mm² 面积内,时序收敛在 100 MHz,模拟解码吞吐超过每秒 8700 个 token,包含 146 万个标准单元、0.277MB SRAM、INT4 MAC 阵列。
一个模型,为自己的架构,设计了一块跑自己的芯片。
这件事和过去几年"AI 辅助 EDA"的叙事有本质区别,值得掰开说。过去的 AI 辅助设计,是工程师坐在中间,AI 负责布局布线的某个环节、给出一个优化建议,人来拍板、串起流程。而这里,人退出了流程本身:模型自己定义目标、调用工具链、迭代收敛,48 小时后交出一块能跑的芯片。分工的位置变了。从"AI 是流程里的一个工具"变成"AI 跑完整个流程,工具链才是它的工具"。
需要冷静的一点是:这块芯片跑在 45nm 这样成熟的老工艺上,面积也只有 4mm²,离量产级、先进制程的真实芯片还有巨大距离。它证明的是流程能自主闭环,而不是产品已经能用。
天体物理那个案例也很有代表性:复现 I-Love-Q 普适关系,K3 用约 2 小时完成了通常需要一到两周的工作,包括交叉验证 20 多篇论文、识别已发表公式中的不一致、生成 3000 行 Python 代码、评估 300 多种状态方程,最后还做了一个交互式 HTML 仪表盘。
真实工单里的表现,比公开 benchmark 更值得信
Kimi 在博客里放了一张内部的知识工作评测结果图,特别提到这些测试来自真实用户工作流中反复出现的模式。
这类内部评测的意义往往比公开 benchmark 更值得关注。公开 benchmark 是固定的赛道,容易被针对性优化,刷到高分不代表真好用;内部评测来自真实工单,反映的是模型在实际用户场景下的表现。当一家公司愿意用自己的真实工作流做尺子,通常说明它对模型的实际能力有底气。
Knowledge Work 这块,K3 支持的三个 case study 规模都很大:
- 用 2800 次以上网络搜索和 1100 次终端数据拉取,研究了 87 份季报和 99 份原始 PDF,生成了一份可交互的 42 年 ASIC 行业研究报告
- 聚变能源行业咨询报告,包含时间线、漏斗图、甘特图等交互可视化
- 用 20 多个并发子 agent 分析 391 个引力波事件,生成 7 个科学可视化图表
Kimi Work 这次还上线了 Widgets 和 Dashboard 功能:Widget 可以在对话里直接生成连接本地数据或外部插件的交互组件,Dashboard 把多个 Widget 组织在一个持久化视图里,围绕项目或目标做整体呈现。
视频剪辑那个案例,K3 从 56 段素材里剪出了自己的宣传片,处理了镜头选取、运动匹配剪切、音频和节拍同步,还经过多轮修改。原文说这类高密度短视频通常需要有经验的剪辑师一到两天,或新手三到五天。
它坦承自己落后的地方
K3 博客的 Limitations 部分写得很诚实,有三点值得注意。
第一,对思维历史(thinking history)很敏感。K3 是在保留完整思维历史的模式下训练的,如果 agent harness 没有正确传回所有历史思考内容,或者中途把其他模型的会话切换到 K3,生成质量会变得非常不稳定。使用时建议用 Kimi Code 这样验证过兼容性的 harness,避免会话中途切换。
第二,太过主动。K3 的训练特别强调长周期高难度任务,结果就是遇到小问题或模糊意图时,可能会自作主张替用户决策。如果你的应用要求 agent 在明确边界内操作,不能过度发挥,要在系统提示或 AGENTS.md 里加更明确的行为约束。
第三,用户体验还有差距。原文直接写:"尽管整体上是一个高度竞争性的模型,K3 在用户体验上与 Claude Fable 5 和 GPT 5.6 Sol 仍有明显差距。"
这种直接承认不足的写法,在模型发布博客里比较少见。它其实透露了一个更值得琢磨的判断:Kimi 想清楚了自己要打的是哪条赛道。
工具性能和产品体验,是两条不同的赛道。前者是模型能不能优化 kernel、能不能设计芯片、能不能跑通复杂 agentic 任务,这些是硬能力;后者是响应快不快、交互顺不顺、答案讨不讨人喜欢,这些是产品打磨。K3 把资源压在了前者。对一个走开源路线的公司来说这是理性的选择:开源模型的用户是开发者和企业,他们要的是能力天花板和可控性,产品体验的最后一公里可以交给下游去打磨。坦承体验落后,某种程度上是在说:体验不是我这一层要解决的问题。
定价:缓存命中率超 90%,实际成本远低于标价
API 定价如下:
计费项 | 价格 |
|---|---|
缓存命中输入 | $0.30 / MTok |
缓存未命中输入 | $3.00 / MTok |
输出 | $15.00 / MTok |
关键在缓存这一栏。Mooncake 的分离推理架构让官方 API 在编码工作流中缓存命中率超过 90%,也就是说大部分输入都按 $0.30 而不是 $3.00 计费,实际用下来的输入成本会比标价低一个数量级。这也回到前面那个生态逻辑:最懂自家模型部署的官方 API,能把成本压到别人压不到的位置。
模型权重按公告在 2026 年 7 月 27 日完整释放,技术报告随后一起发。
现在可以在 Kimi.com、Kimi Work(桌面版 3.1.0 起)、Kimi Code(/model 命令选择)和 Kimi API(kimi-k3)上用到 K3。发布时默认 max thinking effort,后续会加入 low 和 high 档位。
开源 AI 的天花板,每隔几个月就会被重新定义一次。这次 Kimi K3 把它挪到了 2.8 万亿参数。
但如果只记住"2.8 万亿"这个数字,就错过了这次发布真正的看点。**K3 既是 Kimi 给外部用户的产品,也是 Kimi 内部用来生产 K3 本身的工具。
**K3 写 K3 的 kernel,K3 设计跑 K3 的芯片,边训练、边用自己干活、边迭代。这个自我指涉的循环,才是他们在开源赛道上持续领跑的真正原因。
留一个思考框架给你带走:过去我们衡量一个模型,看它能替人类做多少事。而现在要多看一个维度,**它能不能反过来,让制造它的那套系统跑得更快。**
当一个模型开始优化生产自己的基础设施,竞争的胜负手就从"谁的模型更强"悄悄变成了"谁的模型更擅长让自己变强"。
最后必须保留一分冷静:技术报告还没出,我们现在看到的,是 Kimi 选择性展示的一组成功案例。
这些案例足够惊艳,但它们是精心挑选的橱窗,不是完整的成绩单。真正的检验,要等权重开源之后,全世界的开发者上手跑过,才能有答案。