顶级模型 Fable/Mythos 是如何训练出来的?
Anthropic 的 Claude Fable/Mythos 为什么强?
X 上有人做了猜测分析,不少内容很干货,值得翻译分享。
原文:https://x.com/Rafa_Schwinger/status/2066230802439180447
所有人都找错了地方
每次 Anthropic 发布新模型,外界的第一反应都是去猜架构,猜参数量,猜注意力机制等等。
但 Anthropic 对早期合作伙伴的说法是:Mythos 的架构没什么特别之处。
这个说法来源单一,但和模型的实际表现一致。
2025 年 5 月,Anthropic 两位研究员 Sholto Douglas 和 Trenton Bricken 在播客里说得很明白:
语言模型的强化学习(RL,Reinforcement Learning,让模型通过试错来学习的技术)终于跑通了,最关键的是奖励信号能不能被验证。
这句话把解释的方向从网络结构转到了训练信号。
一句话概括:一个模型的能力,约等于它的基础底座乘以它能拿到的可评分信号的质量。
文本数据不稀缺,顶级实验室的算力也不再是瓶颈,真正稀缺的是"可验证的经验"。
让训练能奖励真正正确的答案,而不只是听起来合理的答案。
先搞清楚:Fable 和 Mythos 是两回事
这两个名字经常被混用,但它们是不同的东西。
Fable 是产品层,一个复合路由系统。
当分类器检测到请求涉及网络安全、生物化学或模型蒸馏等敏感领域时,答案会转由 Claude Opus 4.8 处理。
这点发布里有明确说明,第三方评测榜单上的模型名称也写着"Claude Fable 5,含 Opus 4.8 回退"。
此外,系统卡(System Card)的详细解读针对前沿 AI 研究请求的额外限流机制,最初是隐藏实现的,后来 Anthropic 承认这个设计是个错误并将其公开。
Mythos 是底层模型本体,一个单一的集成网络。
推理能力是这个模型本身的能力,不是靠路由到另一个专用模型实现的。
外界觉得 Fable 是"一组模型拼起来的",这个直觉更多是对产品层的观察,而不是对核心模型的描述。
这个区分很重要,因为 Fable 的公开评测分数被安全路由污染了,虽然路由只触发个位数百分比的会话。
能力是怎么一层一层叠出来的
整个训练流程可以分成六个层次,每层都有对应的机制和公开证据。
第一层:高密度预训练,数据质量比数量重要得多
Allen-Zhu 和 Li 的研究量化了语言模型的知识容量,发现有效 token 与垃圾 token 的比例如果达到 1:7,模型的存储效率会下降约 20 倍。
但只要在文档前面加一个来源标签,比如域名,这个损失就能从 20 倍降到约 2 倍。
不是追求"更多数据",而是要有 "更干净、标注更好的数据"。具体数字:
- 把 C4(一个常用的嘈杂网页语料库)重写成干净版本,预训练速度大约提升 3 倍
- 用约 30% 高质量合成数据加 70% 自然网页文本的混合比例,在相同算力下收敛速度可以快 5 到 10 倍
第二层:可验证奖励的强化学习,这是最关键的一层
这套方法的算法核心叫 GRPO。
Group Relative Policy Optimization,一种不需要单独价值网络、通过比较一批采样结果来学习的优化算法。它不需要单独的价值网络,而是从一批采样结果里估算哪个答案更好。
真正的难点不在优化器,在奖励本身。
一个有用的训练环境必须满足"健全性":高奖励必须真正对应任务被解决,而不能被模型钻空子。
这块是从业者普遍反映的真正瓶颈,比扩大环境数量还难。
Anthropic 把环境构建当作一个常设职能来运营,专门设立了"环境扩展团队",负责设计奖励信号和构建质量保证框架来捕捉奖励作弊行为。
那次 2025 年播客里还有一个细节值得注意:研究员提到,在此之前,实验室在强化学习上花了约 100 万美元,而在基础模型预训练上花了约 1 亿美元,刻意把 RL 规模压得很小,直到确认算法是对的,言下之意是一旦确认,投入就会大幅扩大。
把 Mythos 的跃升可能是已经找到可验证奖励强化学习的方法。
为什么代码是整个体系的重心
代码是唯一同时满足"长流程"和"廉价可验证"两个条件的领域:它需要规划、工具调用、有状态的上下文和错误恢复,但结果可以直接编译运行来检验。
这个组合让代码成为最值得大规模制造的训练环境,这也是为什么每家实验室的AI Agent 故事都从代码讲起。
并非所有信号都是合成的或靠自我博弈学来的。
Anthropic 通过收购 Adept 获得了一项专利(US 12,437,238 B1),涵盖计算机操作子系统,描述了通过拦截人类界面操作和收集 Agent 自身运行的在线反馈来生成智能体轨迹数据,这是一种混合栈,不是纯粹的人类示范。
第三层:测试时算力,买更多验证
Claude 3.7 时代,Anthropic 已经在用"采样多个并行尝试,用验证器筛选和排名"的方式提升性能。(这种方法叫测试时算力)
这把 SWE-bench 成绩从 63.7% 提升到了 70.3%,同样的方法也用在了 GPQA(研究生水平科学问答)和 AIME(美国数学邀请赛题)上。
现在模型上的"思考力度"控制,本质是这个机制暴露给用户的接口,决定每个答案愿意花多少验证成本。
需说明的是,这是 Claude 3.7 时代的证据,是这个系列方法的先例,不是 Mythos 当前流程的精确描述。
第四层:长流程强化学习,让模型学会管理自己的上下文
一个能把子任务分支出去、完成后折叠成摘要的智能体,在只用 32K 活跃上下文的情况下,可以匹配甚至超过需要 327K 上下文的基线。
前提是这个折叠能力用步骤级过程奖励直接训练,稀疏终端奖励太弱,教不会它。
这个结果来自一个开源的 360 亿参数模型,不是 Anthropic 的,所以它展示的是机制,而不是具体实现。
但它精确地定位了真正的约束:KV 缓存(模型处理长文本时需要存储的中间计算结果)随序列长度线性增长,主导了服务成本。
持久长流程能力,是一种训练出来的上下文管理能力,不是依赖窗口大小。
第五层:递归自我改进,飞轮在转但还需要人
Anthropic 自己的数据:
- 当前系统给研究员带来了约 4 倍的产出提升
- 在某个固定的代码优化任务上,一年内测量到的加速从约 3 倍增长到约 52 倍,但实验室自己警告这个数字不能直接换算成真实训练加速
- 实验室定义"真正自动化 AI 研究"的门槛大约是 40 倍,也就是能把两年的进展压缩进一年
- 系统卡明确说明 Mythos 没有越过这条线
飞轮是真的,但现在还需要人来转动。
为什么它思路清晰,为什么它能持续工作
这两个问题有同一个答案。
清晰的推理,本质上是单步的可验证正确性。
一个在"对不对能被检验"的环境里训练出来的模型,被选择的是真正能通过检验的推理,而不是听起来合理的推理。
这就是为什么这些系统在数学和软件上读起来思路清晰,在没有廉价验证器的品味判断类领域里表现平平。
持续的长流程工作,则是跨越多步的可验证正确性。
这也是最常被误解为"上下文窗口够大"的能力。
百万 token 上下文窗口在 2026 年 3 月的 4.6 系列上实现了,实现方式是在长文档上继续预训练加 RoPE/YaRN 重缩放(一种让模型处理更长文本的位置编码技术)。
这是个相对便宜的扩展,但长流程能力不靠这个。
长任务失败的真正原因是单步错误的累积。
一个模型在每步 99% 的情况下是正确的,和每步 99.9% 正确的,在短任务上几乎看不出差别,但在几百步的长任务上,这个差距就是成败的关键。
更麻烦的是,这种自我条件化(模型把自己之前的错误当作输入,越错越错)不会随着模型规模扩大而消失,但有意识的测试时推理能抑制它。
这悄悄把"单步推理精度"和"长流程持久性"统一到了同一个机制下。
METR(一家评估 AI 自主能力的机构)的测量把 Mythos 放在自主时间跨度榜单的顶端,50% 成功率的时间跨度至少 16 小时,置信区间从约 8.5 小时到约 55 小时。
但 METR 自己也说超过 16 小时的测量在当前测试上不可靠,因为只有极少数任务能跑那么长。
竞争格局:谁在做同样的事
这套方法不是秘密,各家都在做,差距在于深度和整合程度。
实验室 | 核心证据 | 与 Anthropic 的距离 | 主要瓶颈 |
|---|---|---|---|
Google DeepMind | AlphaProof:AlphaZero 风格 RL + Lean 形式化验证器,约 100 万自动形式化到约 8000 万自生成问题;拥有 Docs/Sheets/Drive 数据;集成 TPU 算力 | 并列领先(结构上) | 把实验室级 RLVR 做成可靠的通用智能体 |
OpenAI | 设有"合成 RL"团队;RL-gym 传统可追溯到 2016 年;GPT-5.5 在智能体、代码、网络安全上表现强劲 | 并列领先(组织上) | 长流程可靠性;自主网络安全功能仅对可信合作方开放 |
DeepSeek | 1800+ 可验证 RL 环境,约 8.5 万智能体任务,GRPO,六个专家蒸馏为一个;MLA(多头潜在注意力)将 KV 缓存削减约 93% | 方法对等,最近的中国实验室 | 算力:受出口管制,约 5 万张 Hopper GPU,超 5 亿美元投入(不是流传的"600 万美元") |
阿里 / Qwen | 2 万个并行可执行环境用于长流程智能体 RL;480B 参数 / 35B 激活 MoE(混合专家模型,一种只激活部分参数的高效架构) | 高(代码主导) | 代码之外的广度;算力 |
Moonshot / Kimi | 基于规则的"可验证奖励训练场"+ 评分准则自我批评;1T / 32B 激活 MoE;MuonClip 优化器 | 高(智能体) | 长流程深度;算力 |
MiniMax | 智能体原生 RL 基础设施"Forge";229.9B / 9.8B 激活 MoE;M2.7 能调试自己的训练 | 高,上升快 | 规模和算力 |
xAI | 正在大规模招募 RL 环境和验证器工程师("Macrohard",最高 44 万美元);Grok 在 Colossus 集群上扩展了可验证奖励 RL | 算力充足,工厂尚不成熟 | 工厂刚起步;若成熟,6 到 12 个月内构成威胁 |
Meta(MSL) | Muse Spark:RL 扩展律,超 10 倍算力效率;并行智能体"沉思模式" | 上升中,落后于主要维度 | 自认长流程和代码存在差距;工厂细节披露少 |
亚马逊 / 微软 | Nova 2 智能体(tau2-Bench 77.7,SWE-Verified 70.0);MAI-Thinking-1(SWE-Bench Pro 53%) | 第二梯队 | 落后于前沿集群 |
有一个细节特别值得关注。
DeepSeek V4 的训练配方是:把底座分叉成各领域专家,然后用超过 10 个教师模型的在线蒸馏把它们整合回来。
这是一个复合的、面板状的结构,存在于训练时而不是服务时。
这是目前最清晰的暗示,说明 Fable 表面上的"自我面板化"可能部分是底座训练方式的产物。
中国实验室展示了方法,缺的是算力;美国实验室握着算力,藏着方法。
RL 环境的供应商市场已经快速形成,多家公司估值达到数十亿美元,Anthropic 据报道曾讨论在一年内花费超过 10 亿美元购买 RL 环境。
Fable 和 GPT-5.5 正面对比
用 Opus 4.7 作为公开的 Anthropic 代理(原始 Mythos 从未单独销售),两者的对比按领域分化,而不是一边倒。
评测维度 | Opus 4.7(代理) | GPT-5.5 | 领先方 |
|---|---|---|---|
SWE-bench Pro(多文件软件工程) | 64.3% | 58.6% | Anthropic |
Terminal-Bench 2.0(智能体循环) | 69.4% | 82.7% | OpenAI |
FrontierMath(前沿数学) | 43.8% | 52.4% | OpenAI |
BrowseComp(网页研究) | 79.3% | 84.4% | OpenAI |
自主网络安全 | "阶跃式提升"(自评) | 高,未达关键级别;无完整攻击链 | 争议中 |
开放式长流程(Vending-Bench) | 未领先 | 未领先 | 双方均未领先 |
网络安全那,OpenAI 的评级是自评安全评估,Anthropic 的描述是自己写的且在量级上存在争议,没有第三方独立裁定。
Vending-Bench(一个测试开放式智能体任务的基准),在没有清晰验证器的开放式智能体任务上,Anthropic 系列并不领先。
这和整体模式完全吻合,优势集中在任务既长又廉价可验证的地方。
在综合公开基准上,顶尖的 OpenAI、Anthropic 和 Google 模型彼此相差约 1 个百分点,接近平局。
但这些基准都是短流程的,而且越来越饱和,看不到真正的分化。
真正的差距在长流程自主任务上,而那里恰好是公共测量最薄弱的地方。
为什么它的优势和它的危险在同一个坐标上
奖励最容易验证的领域是代码和网络安全,恰好也是模型最能超越人类的领域。
合作伙伴报告第一个月发现了约 1 万个高危或严重漏洞,其中 1752 个经过六家独立安全公司评估,真阳性率 90.6%,约 1587 个被独立确认。
这两个数字来自 Anthropic 自己的披露,不是外部批评者。
生物方面,评分者估计,原本需要数十个工作日的红队协议(测试 AI 安全边界的流程),在约 16 小时内就被完成了,接近百倍的压缩,系统卡把这个结果视为接近某个关键门槛。
2026 年 6 月 12 日,两个模型都因出口管制令下线。
触发原因是一个合作伙伴演示了该模型可以被越狱,然后驱动进行自主漏洞发现。
Anthropic 认为触发这一行为的越狱方式很窄,并不代表防护措施被普遍绕过,但管制令依然生效,模型就此下线。
让 Fable 成为最强代码系统的能力,也是引来监管行动的能力。
另一家实验室要怎么复制这条路
具体来说有七步:
- 建立常设环境工厂。 配备环境生成、奖励与验证器设计、奖励作弊质量保证的专职团队,而不是把它当成研究附属项目。
- 深入做长流程、可验证的环境,配合过程奖励。 短流程的那种(单元测试、数学答案)都差不多,差距在多小时任务里。
- 提升底座密度。 通过清洗、去重、标注来源、混入高质量合成数据来提升每个 token 的信息量。
- 用验证器辅助的最优 N 采样消耗测试时算力。 并把它作为可调节的力度控制暴露给用户。
- 为暂时无法自动评分的领域获取人类演示。 Anthropic 通过收购 Adept 做到了这一点。
- 运营双层模式。 在前沿做发现,把前沿能力蒸馏成廉价子智能体供规划器调用。Haiku 4.5 在 SWE-bench Verified 上达到 73.3%,略高于 Sonnet 4 的 72.7%,但成本只有三分之一,速度超过两倍。
- 算力受限时,向中国实验室学习算法效率。 KV 缓存压缩、极稀疏专家混合、GRPO,这些都是公开的。
这些动作没有一个是秘密,护城河是它们的整合。
还有哪些东西看不清楚
几个问题目前真的没有答案。
底座架构未定论。
是密集模型还是 MoE(混合专家模型),没有定论。
流传的 10 万亿参数和分层注意力的说法没有一手来源支撑,和更谨慎的吞吐量推算也有矛盾。
测试时计算的证据有时效性。
相关证据来自 Claude 3.7 时代,是这个系列方法的先例,不是 Mythos 的当前规格。
评测分数被路由污染。
Fable 的公开分数无法干净反映 Mythos 的真实能力,因为安全路由会把部分请求转走,而干净的未屏蔽数字属于一个从未公开销售的模型。
"内部教师模型"假说存疑。
有一种说法是 Anthropic 内部有一个太危险而不能部署的模型在蒸馏更安全的学生。
但反复出现的研究发现表明,自生成数据往往能匹配甚至超过更大教师模型的蒸馏效果,所以高密度自生成信号加新鲜 RL 是比单一隐藏神谕更站得住脚的解释。
进步不是均匀的。
系统卡在报告网络安全和生物领域阶跃式提升的同时,也报告了一个平凡的退步:比上一个模型更高的引用捏造率。
能效数据需要谨慎对待。
斯坦福的研究显示两年内本地和边缘推理的智能每瓦特提升了约 5.3 倍,但这是本地和边缘推理的数字,不是数据中心服务的数字。
此前流传的 Anthropic 具体能耗和芯片数量数据未能经受审查。
护城河有多宽,又有多窄
经过所有这些分析,能站住脚的结论其实很窄,但作者认为它是正确的:
一个模型的思路有多清晰、能坚持多久,取决于它被训练时拿到了多少可验证的正确信号。
清晰的推理是单步可验证正确性,持久的执行是多步可验证正确性,两者都由同一个环境工厂生产,以高密度预训练为底座,以测试时算力为按需购买更多验证的方式。
这个成就是一座工厂,而不是一个秘密。
对从业者来说,这意味着一件实际的事:评估一家实验室模型的真实水平,不要看它的参数量,要看三个维度,它的环境工厂有多深,验证器有多可信,以及它在长流程可验证任务上的实际表现。
这三个维度,比任何基准测试的综合排名都更能说明问题。