1兆瓦电力值多少钱?1兆瓦电力能产生多少价值的AI token,是算力经济学里一个直接的问题。文章探讨电力成本与AI推理/训练token产出之间的换算关系,涉及数据中心能耗、GPU集群效率、以及不同场景下的单位电力经济价值。 评论点赞收藏33 天前
GPU 写内存时发生了什么:RTX 4090 硬件级指令追踪追踪 RTX 4090 中一条 STG.E SASS 指令在硬件单元中的完整路径,从指令发出到内存写入的每一步硬件行为。 评论点赞收藏33 天前
CRIU 实时内存压缩:弹性推理快照的体积与延迟双降CRIU 新增 LZ4 内存压缩功能,在 checkpoint 写入时压缩、restore 时解压,无需中间未压缩文件。对 SGLang 推理服务的实测显示:checkpoint 体积减少 12.5%~45.5%,首次 token 恢复延迟降低 7.2%~44.7%(Qwen 3.5 4B 模型从 43s 降至 24s)。 压缩策略按块判断:全零块不存数据,压缩率低于 12.5% 则存原始字节,否则存 LZ4 压缩块。1MiB 块大小在 4B 模型上表现最佳,但最优块大小取决于具体负载和 CPU 分配。 评论点赞收藏50 天前
Gigatoken: making tokenisation care about the hardwareA first-principles tour of the SIMD scanners, cache-aware layouts, huge pages and worker scheduling behind Gigatoken. 评论点赞收藏62 天前
吞吐量极致优化:DeepSeek-V4-Flash 在 Isambard-AI 上的表现Doubleword 团队在 Isambard-AI 超级计算机上对 DeepSeek-V4-Flash 模型进行单节点推理吞吐量优化分析。文章深入探讨了基线性能、MLA/DP-attention 机制以及 MoE 内核选择对吞吐量的具体影响,提供了大模型高效部署的工程细节。 评论点赞收藏69 天前
NVLink、NVSwitch 及相关互联技术详解<p>为什么缩放式链接又快又短,NVSwitch如何将领域从单板扩展到机架,以及TPU、UALink和缩放式以太网各自有何不同之处。</p> 评论点赞收藏71 天前
逆向工程 NVIDIA CUDA 检查点机制以实现更快的冷启动<p>将一个运行中的 CUDA 进程冻结至主机内存并再次解冻——驱动程序在实现这一功能时究竟做了什么、又没有做什么——以及理解这些机制如何让我们将 CUDA 进程恢复的速度提升至多 4 倍。</p> 评论点赞收藏83 天前
宽与深:对边际推测的思考文章探讨了推理引擎中批处理与推测解码之间的权衡策略。作者分析了如何通过调整宽度与深度来优化推理性能,特别是在处理不同长度的序列时。 这涉及到计算资源分配和内存带宽利用的核心问题,对于构建高效的大模型推理系统具有实际指导意义。 评论点赞收藏90 天前
自我设计的智能体群重建Moonshot的Kimi智能体群并应用于真实代码库,结果显示相比单一长上下文智能体,Token消耗减少约53倍,成本降低约45倍。 提供了极具冲击力的Agent架构对比数据,直接回应了当前大模型应用中关于Agent协作效率的核心争议。 评论点赞收藏92 天前
运行CUDA内核时发生了什么追踪一个简单的向量加法CUDA内核,从nvcc编译一直到底层warp执行的完整过程。 经典的底层原理科普,虽然内容基础,但对于理解GPU执行模型仍有价值,适合初学者或需要复习底层机制的开发者。 评论点赞收藏93 天前
扩散语言模型的解剖学拆解三种新兴且流行的扩散语言模型(Diffusion LLMs)的建模选择和技术细节。 随着扩散模型在NLP领域的兴起,这篇文章提供了对非自回归生成范式的重要技术综述,适合关注前沿架构的研究者。 评论点赞收藏100 天前
FlashOffload: 利用卸载技术将预填充成本降低7倍Doubleword 博客介绍将 SGLang 扩展以增强卸载能力,在计算密集型工作负载中实现了显著加速。 该方法旨在降低 LLM 推理中的预填充(prefill)阶段成本,声称比传统方案便宜 7 倍。 评论点赞收藏100 天前
自适应推测解码:运行时选择草稿长度基于推测解码的经济性分析,作者在推理实验室模拟器上运行MTP和DFlash草稿生成器,利用真实接受率数据评估动态调整草稿长度的收益。 探讨了推测解码中一个常被忽视的动态优化维度,为提升推理吞吐量提供了新的思路和数据支持。 评论点赞收藏100 天前
InfiniBand、RoCE及其周边分析为何技术上更优越的InfiniBand网络方案,在经济隔离和基础设施兼容性的考量下,逐渐让位于基于通用网络的RoCE方案。 探讨了技术优越性与商业落地之间的张力,是数据中心网络架构选择的一个经典案例研究。 评论点赞收藏103 天前
UCCL-EP:无需拥有网卡的专业并行通信内核UCCL项目重新实现了DeepEP内核,使其能够适配任意硬件,核心创新在于将传输层从底层硬件解耦。 这解决了分布式训练中对特定高端网卡的依赖问题,具有极高的工程实用价值和架构讨论空间。 评论点赞收藏110 天前
高性能EP内核解剖学从零构建专家并行(EP)的分发与合并内核,详细解析了高吞吐形状和低延迟场景下的内核设计差异。 深入底层通信原语,适合对MoE架构底层实现和GPU通信优化感兴趣的高级工程师。 评论点赞收藏112 天前