Doubleword

RSS: https://blog.doubleword.ai/rss.xml
关于构建 AI 系统的笔记——机器学习与 AI 开发的实用工程洞见。

CRIU 实时内存压缩:弹性推理快照的体积与延迟双降

CRIU 新增 LZ4 内存压缩功能,在 checkpoint 写入时压缩、restore 时解压,无需中间未压缩文件。对 SGLang 推理服务的实测显示:checkpoint 体积减少 12.5%~45.5%,首次 token 恢复延迟降低 7.2%~44.7%(Qwen 3.5 4B 模型从 43s 降至 24s)。压缩策略按块判断:全零块不存数据,压缩率低于 12.5% 则存原始字节,否则存 LZ4 压缩块。1MiB 块大小在 4B 模型上表现最佳,但最优块大小取决于具体负载和 CPU 分配。
评论点赞收藏4 天前

拆分式 LLM 推理服务的优势

拆分式 LLM 推理服务在三个可验证条件下从不劣于聚合式,且通常更优。文章用库存理论建模流量漂移:冷启动、安全库存,以及部署能承受的冲击范围。
评论点赞收藏5 天前

你可能自己就能想出 Kimi 的 Delta Attention

DeltaNet 是高效注意力机制的一种实现,通过稀疏化计算降低 Transformer 的复杂度。文章以教学式推导展示了从标准注意力到 Delta 注意力再到 DeltaNet 的逐步简化过程,核心思想是用低秩近似和局部稀疏结构替代全矩阵乘法,在保持性能的同时显著减少计算量。 作者从数学推导入手,逐层拆解了 Delta Attention 的设计动机:用可学习的低秩矩阵分解替代原始注意力权重,结合局部窗口限制注意力范围。文中给出了具体的公式变换和伪代码示例,并对比了不同变体在序列长度、参数量和 FLOPs 上的差异。适合对 Transformer 优化感兴趣的读者快速掌握技术细节。
评论点赞收藏20 天前

吞吐量极致优化:DeepSeek-V4-Flash 在 Isambard-AI 上的表现

Doubleword 团队在 Isambard-AI 超级计算机上对 DeepSeek-V4-Flash 模型进行单节点推理吞吐量优化分析。文章深入探讨了基线性能、MLA/DP-attention 机制以及 MoE 内核选择对吞吐量的具体影响,提供了大模型高效部署的工程细节。
评论点赞收藏24 天前

宽与深:对边际推测的思考

文章探讨了推理引擎中批处理与推测解码之间的权衡策略。作者分析了如何通过调整宽度与深度来优化推理性能,特别是在处理不同长度的序列时。 这涉及到计算资源分配和内存带宽利用的核心问题,对于构建高效的大模型推理系统具有实际指导意义。
评论点赞收藏44 天前

自我设计的智能体群

重建Moonshot的Kimi智能体群并应用于真实代码库,结果显示相比单一长上下文智能体,Token消耗减少约53倍,成本降低约45倍。 提供了极具冲击力的Agent架构对比数据,直接回应了当前大模型应用中关于Agent协作效率的核心争议。
评论点赞收藏47 天前

运行CUDA内核时发生了什么

追踪一个简单的向量加法CUDA内核,从nvcc编译一直到底层warp执行的完整过程。 经典的底层原理科普,虽然内容基础,但对于理解GPU执行模型仍有价值,适合初学者或需要复习底层机制的开发者。
评论点赞收藏48 天前

扩散语言模型的解剖学

拆解三种新兴且流行的扩散语言模型(Diffusion LLMs)的建模选择和技术细节。 随着扩散模型在NLP领域的兴起,这篇文章提供了对非自回归生成范式的重要技术综述,适合关注前沿架构的研究者。
评论点赞收藏55 天前

自适应推测解码:运行时选择草稿长度

基于推测解码的经济性分析,作者在推理实验室模拟器上运行MTP和DFlash草稿生成器,利用真实接受率数据评估动态调整草稿长度的收益。 探讨了推测解码中一个常被忽视的动态优化维度,为提升推理吞吐量提供了新的思路和数据支持。
评论点赞收藏55 天前

InfiniBand、RoCE及其周边

分析为何技术上更优越的InfiniBand网络方案,在经济隔离和基础设施兼容性的考量下,逐渐让位于基于通用网络的RoCE方案。 探讨了技术优越性与商业落地之间的张力,是数据中心网络架构选择的一个经典案例研究。
评论点赞收藏58 天前

UCCL-EP:无需拥有网卡的专业并行通信内核

UCCL项目重新实现了DeepEP内核,使其能够适配任意硬件,核心创新在于将传输层从底层硬件解耦。 这解决了分布式训练中对特定高端网卡的依赖问题,具有极高的工程实用价值和架构讨论空间。
评论点赞收藏65 天前

高性能EP内核解剖学

从零构建专家并行(EP)的分发与合并内核,详细解析了高吞吐形状和低延迟场景下的内核设计差异。 深入底层通信原语,适合对MoE架构底层实现和GPU通信优化感兴趣的高级工程师。
评论点赞收藏67 天前

推测解码的经济学

深入探讨推测解码中被忽视的两个维度:MoE路由对解码屋顶线的影响,以及压缩注意力如何消除推测token原本免费的冗余空间。 从经济学角度重新审视推测解码的性能边界,观点深刻,适合对推理优化底层逻辑有深入探究需求的读者。
评论点赞收藏69 天前

在AMD MI300X上部署DeepSeek-V4-Flash

记录了在AMD MI300X硬件上成功运行DeepSeek-V4-Flash模型的全过程,包括遇到的锐利边缘、段错误及标准兼容性问题。 提供了宝贵的异构算力适配实战经验,对于关注非CUDA生态和大模型部署的工程人员具有极高的参考意义。
评论点赞收藏76 天前

通过无损压缩突破内存受限内核的速度极限

针对内存受限型CUDA内核,提出使用无损压缩技术突破数据传输带宽的物理极限,实现超越常规速度的性能提升。 标题具有强烈的技术挑衅性,内容涉及GPU内核优化的极致手段,对底层系统程序员极具吸引力。
评论点赞收藏82 天前

MoE 推理优化:通过请求重排序降低 15% 的专家负载

Doubleword 提出一种无需修改模型内核的推理优化方法,通过请求重排序将 MoE 模型的专家加载量降低约 15%,从而提升吞吐量。 研究人员利用嵌入模型对提示进行聚类,使相似请求批量处理,减少不同专家权重的加载次数。实验显示该方法在 Qwen3.5 等模型上能显著节省显存带宽。
评论点赞收藏87 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。