Doubleword

RSS: https://blog.doubleword.ai/rss.xml
关于构建 AI 系统的笔记——机器学习与 AI 开发的实用工程洞见。

1兆瓦电力值多少钱?

1兆瓦电力能产生多少价值的AI token,是算力经济学里一个直接的问题。文章探讨电力成本与AI推理/训练token产出之间的换算关系,涉及数据中心能耗、GPU集群效率、以及不同场景下的单位电力经济价值。
评论点赞收藏33 天前

CRIU 实时内存压缩:弹性推理快照的体积与延迟双降

CRIU 新增 LZ4 内存压缩功能,在 checkpoint 写入时压缩、restore 时解压,无需中间未压缩文件。对 SGLang 推理服务的实测显示:checkpoint 体积减少 12.5%~45.5%,首次 token 恢复延迟降低 7.2%~44.7%(Qwen 3.5 4B 模型从 43s 降至 24s)。 压缩策略按块判断:全零块不存数据,压缩率低于 12.5% 则存原始字节,否则存 LZ4 压缩块。1MiB 块大小在 4B 模型上表现最佳,但最优块大小取决于具体负载和 CPU 分配。
评论点赞收藏50 天前

拆分式 LLM 推理服务的优势

拆分式 LLM 推理服务在三个可验证条件下从不劣于聚合式,且通常更优。文章用库存理论建模流量漂移:冷启动、安全库存,以及部署能承受的冲击范围。
评论点赞收藏50 天前

吞吐量极致优化:DeepSeek-V4-Flash 在 Isambard-AI 上的表现

Doubleword 团队在 Isambard-AI 超级计算机上对 DeepSeek-V4-Flash 模型进行单节点推理吞吐量优化分析。文章深入探讨了基线性能、MLA/DP-attention 机制以及 MoE 内核选择对吞吐量的具体影响,提供了大模型高效部署的工程细节。
评论点赞收藏69 天前

宽与深:对边际推测的思考

文章探讨了推理引擎中批处理与推测解码之间的权衡策略。作者分析了如何通过调整宽度与深度来优化推理性能,特别是在处理不同长度的序列时。 这涉及到计算资源分配和内存带宽利用的核心问题,对于构建高效的大模型推理系统具有实际指导意义。
评论点赞收藏90 天前

自我设计的智能体群

重建Moonshot的Kimi智能体群并应用于真实代码库,结果显示相比单一长上下文智能体,Token消耗减少约53倍,成本降低约45倍。 提供了极具冲击力的Agent架构对比数据,直接回应了当前大模型应用中关于Agent协作效率的核心争议。
评论点赞收藏92 天前

运行CUDA内核时发生了什么

追踪一个简单的向量加法CUDA内核,从nvcc编译一直到底层warp执行的完整过程。 经典的底层原理科普,虽然内容基础,但对于理解GPU执行模型仍有价值,适合初学者或需要复习底层机制的开发者。
评论点赞收藏93 天前

扩散语言模型的解剖学

拆解三种新兴且流行的扩散语言模型(Diffusion LLMs)的建模选择和技术细节。 随着扩散模型在NLP领域的兴起,这篇文章提供了对非自回归生成范式的重要技术综述,适合关注前沿架构的研究者。
评论点赞收藏100 天前

自适应推测解码:运行时选择草稿长度

基于推测解码的经济性分析,作者在推理实验室模拟器上运行MTP和DFlash草稿生成器,利用真实接受率数据评估动态调整草稿长度的收益。 探讨了推测解码中一个常被忽视的动态优化维度,为提升推理吞吐量提供了新的思路和数据支持。
评论点赞收藏100 天前

InfiniBand、RoCE及其周边

分析为何技术上更优越的InfiniBand网络方案,在经济隔离和基础设施兼容性的考量下,逐渐让位于基于通用网络的RoCE方案。 探讨了技术优越性与商业落地之间的张力,是数据中心网络架构选择的一个经典案例研究。
评论点赞收藏103 天前

UCCL-EP:无需拥有网卡的专业并行通信内核

UCCL项目重新实现了DeepEP内核,使其能够适配任意硬件,核心创新在于将传输层从底层硬件解耦。 这解决了分布式训练中对特定高端网卡的依赖问题,具有极高的工程实用价值和架构讨论空间。
评论点赞收藏110 天前

高性能EP内核解剖学

从零构建专家并行(EP)的分发与合并内核,详细解析了高吞吐形状和低延迟场景下的内核设计差异。 深入底层通信原语,适合对MoE架构底层实现和GPU通信优化感兴趣的高级工程师。
评论点赞收藏112 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。