Feng

RSS: https://fengwang.github.io/index.xml
Feng 的个人技术博客。

Checkpoint 不等于 Policy:PDM 与 RLT 两份 LLM 训练报告的合并评读

<p>为什么会这样:2026年9月,我将同一作者行的两份项目报告导入了我的保险库,一份关于预填充-解码内核错配(“PDM”)的诊断报告,以及一份关于循环循环变换器(“RLT”)的架构报告,并将它们交叉链接。<br><br>紧接着第一篇阅读第二份报告,这两份报告不再像是独立论文。一份说部署和训练计算之间的不匹配是可测量的,必须合同化;另一份则说可以通过设计消除。<br><br>我为导入会话起草了一份中文合并阅读;这是英文档案版本,围绕三个问题重新组织:每份报告提出的问题是什么,它对此做了什么及其带来什么,以及哪些内容经得起批判性阅读。</p><p>论点是:PDM将强化学习的执行忠真度变成可以测量、记录和审计的对象,而RLT则将其变成可以设计的东西,但两者都无法闭合从不匹配到端到端训练结果的因果循环。</p><p>范围:涵盖截至2026年9月的两份报告(PDM8月6日,8月24日修订;RLT九月)、它们的问题陈述、机制、证据和弱点。它不重新推导它们的数学计算,也不独立重现任何数字,并将两者视为非同行评审的项目报告。<br><br>批评中的跨架构热点假说是我的,不是他们的。</p><p>前提条件:这假设你熟悉自回归解码和KV缓存,策略内的强化学习基础知识(重要性比、非策略修正、支持条件),以及对状态空间和线性注意力模型有大致了解。</p><h2>PDM指出的问题是:检查点不是策略</h2><p>我多年来一直假设检查点定义了一个策略:加载权重,每个读取权重的运行时计算相同的分布。PDM开头就将这一假设拆分成多个部分…</p>
评论点赞收藏17 天前

从"严重偏差"到数学工业栈:一份批判性阅读与设计蓝图

25位菲尔兹奖得主联名发布声明,直指AI与数学研究存在严重错位——把证明求解当基准测试就是问题本身。导火索是OpenAI声称用约1万个智能体在88小时内"解决"了Navier-Stokes突破类问题。 这篇文章提出:不应抵制数学的工业化,而应逐一将行会的四项职能——生产、验证、传播与署名——重新设计为四层工业栈。文中明确所有设计方案尚未试运行。
评论点赞收藏17 天前

数学行会工业化:25位菲尔兹奖得主联名声明背后的制度设计思考

起因:2026 年的 911,25 位菲尔兹奖得主联名发布《AI 在数学中的严重错位》。两天后我把它逐条拆开正读了一遍,又反着读了一遍,最后发散思维把批评转换为成设计:如果"把解题当 benchmark"真的是问题,什么制度能修好它?在这片文章里,我关心的是未来的方向设计,对站队不感兴趣。 论点:声明诊断对了一个真实的瓶颈——人类共同体的消化带宽,却用借来的"错位"框架装错了病名;正确的回应不是抵...
评论点赞收藏17 天前

在消费级 Blackwell GPU 上优化 FlashAttention:从 3.23% 到 94.6% Roofline

RTX 5090 上跑 FlashAttention 前向传播,两周 profiling 迭代从 3.23% 提升到 94.6% roofline。FA3/FA4 依赖的 wgmma 和 tcgen05 指令在消费级 sm_120 上不存在,只能用 mma.sync 和 ldmatrix。 前 60% 提升来自修复硬件空闲,中间 30% 来自减少指令和隐藏延迟,最后阶段需要校准测量工具本身。
评论点赞收藏49 天前

Qwen3-TTS在AMD Radeon 780M上的Docker+ROCm部署复盘

Qwen3-TTS在AMD 780M APU上部署时,Hugging Face transformers的generate循环中每token的.item GPU-CPU同步会导致永久死锁,因为gfx1103的HSA完成信号不可靠。 改用项目内置的fast codebook路径绕过generate后,服务稳定在RTF约2.32。
评论点赞收藏58 天前

Qwen3-TTS 在 AMD Radeon 780M 上的 Docker + ROCm 部署排障记录

Qwen3-TTS 在 AMD Radeon 780M 上的 Docker + ROCm 部署排障记录 背景:在 780M 上跑 TTS 的目标与约束 2026 年 8 月初,我要在本地部署一个自托管的 TTS 服务,选型是 Qwen3-TTS-Openai-Fastapi(OpenAI 兼容接口)加 Qwen3-TTS-12Hz-1.7B-CustomVoice 模型, 默认音色 Vivian。...
评论点赞收藏58 天前

AI 如何思考:从数学推理漫游中读出的认知画像

引言:一个模型在解释另一个模型的想法 我花了一个晚上读 OpenAI 发布的数学推理漫游系列(“How the Ideas Came Together”),十二个章节,覆盖非 sofic 群构造、Connes 刚性反例、量子并行重复定理、多重色 Ramsey 数、Erdős–Simonovits 紧致性反例等十个数学问题领域。每一章不是论文复述,而是把"想法是怎么拼出来的"讲成一个故事:哪些想法先...
评论点赞收藏59 天前

从操控性互动到循证发展:短视频的神经科学与机制重定向框架

文章指出短视频的成瘾性并非单纯的道德问题,而是多巴胺预测误差、变比率强化和算法个性化三大机制共同作用的结果。重点分析了“想要”与“喜欢”的神经分离,以及算法如何通过降低前额叶皮层耦合来削弱用户的批判性评估能力。 作者提出将奖励目标从“下一个视频”转向“下一个能力信号”,从而将这些机制重新导向学习和习惯养成。
评论点赞收藏78 天前

LLM/VLM Compression Foundations

I started looking at model compression because the numbers didn’t add up. My GPU has 24GB of VRAM and the models I want to run need 40GB. The gap is a factor of two, which quantization claims to solve...
评论点赞收藏143 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。