Checkpoint 不等于 Policy:PDM 与 RLT 两份 LLM 训练报告的合并评读
<p>为什么会这样:2026年9月,我将同一作者行的两份项目报告导入了我的保险库,一份关于预填充-解码内核错配(“PDM”)的诊断报告,以及一份关于循环循环变换器(“RLT”)的架构报告,并将它们交叉链接。<br><br>紧接着第一篇阅读第二份报告,这两份报告不再像是独立论文。一份说部署和训练计算之间的不匹配是可测量的,必须合同化;另一份则说可以通过设计消除。<br><br>我为导入会话起草了一份中文合并阅读;这是英文档案版本,围绕三个问题重新组织:每份报告提出的问题是什么,它对此做了什么及其带来什么,以及哪些内容经得起批判性阅读。</p><p>论点是:PDM将强化学习的执行忠真度变成可以测量、记录和审计的对象,而RLT则将其变成可以设计的东西,但两者都无法闭合从不匹配到端到端训练结果的因果循环。</p><p>范围:涵盖截至2026年9月的两份报告(PDM8月6日,8月24日修订;RLT九月)、它们的问题陈述、机制、证据和弱点。它不重新推导它们的数学计算,也不独立重现任何数字,并将两者视为非同行评审的项目报告。<br><br>批评中的跨架构热点假说是我的,不是他们的。</p><p>前提条件:这假设你熟悉自回归解码和KV缓存,策略内的强化学习基础知识(重要性比、非策略修正、支持条件),以及对状态空间和线性注意力模型有大致了解。</p><h2>PDM指出的问题是:检查点不是策略</h2><p>我多年来一直假设检查点定义了一个策略:加载权重,每个读取权重的运行时计算相同的分布。PDM开头就将这一假设拆分成多个部分…</p>