Fergus Blog

RSS: https://fergusfinn.com/rss.xml
Fergus Finn 关于大语言模型推理与机器学习系统的技术思考。

GPU 读取内存时发生了什么

RTX 4090 上 LDG.E 指令的硬件执行路径追踪。从 SASS 指令出发,经过纹理单元、L1/L2 缓存、内存控制器,最终到达 HBM 的完整链路。
评论点赞收藏3 天前

拆分式 LLM 推理服务:何时比聚合式更好

有三个可核查的条件,使得分散的预填从未更糟 比聚合服务更重要,以及它通常更好的原因。再加上一个 库存理论模型中的交通漂移:冷启动、安全库存,以及 部署时可以承受的冲击地图。
评论点赞收藏5 天前

逆向工程 NVIDIA cuda-checkpoint 以加速冷启动

深入解析 CUDA 进程冻结与恢复的底层机制,揭示驱动层的行为边界。通过逆向工程找到优化点,实现冷启动速度提升 4 倍。对于需要频繁部署 GPU 推理服务或处理大规模并行任务的工程师来说,这是极具实操价值的性能优化方案,直接解决等待痛点。
评论点赞收藏38 天前

宽与深:边际上的推测解码思考

在推测解码中,当显存受限且batch size较小时,增加深度(单序列推测)比增加宽度(多序列并行)吞吐量更高。原因是MoE模型的专家激活存在共现性,连续token激活的专家重叠度高,减少了无效计算。文章提出基于drafter置信度的自适应深度策略,能显著提升小batch下的推理效率,但需要引擎支持ragged speculation。
评论点赞收藏45 天前

运行一个 CUDA 内核到底发生了什么

从编译生成的PTX/SASS中间表示,到主机端启动桩代码,再到通过ioctl和门铃寄存器触发GPU执行,完整拆解了CUDA内核从CPU内存到GPU硬件执行的底层机制。深入分析了QMD描述符、Pushbuffer/GPFIFO队列以及SM调度细节,揭示了GPU异步执行与PCIe通信的工程实现。
评论点赞收藏48 天前

InfiniBand, RoCE, and All That

How a technically superior but economically isolated solution slowly lost ground to a good-enough one built on infrastructure everyone already owns.
评论点赞收藏54 天前

The Economics of Speculative Decoding

Two underexplored axes: what MoE routing does to the decode roofline, and how compressed attention takes away the slack that used to make speculated tokens free.
评论点赞收藏68 天前

在AMD MI300X上跑通DeepSeek-V4-Flash:一线工程实战记录

Doubleword 团队的一线工程实战记录:在 AMD MI300X 上部署 DeepSeek-V4-Flash 过程中遇到的全部坑与解法。MI300X 拥有 192GB HBM3、FP8 算力与 H100 相当、价格约一半,但软件生态是硬伤。文章逐一拆解三大核心难题:FP8 方言不兼容(MI300X 使用 fnuz 格式,vLLM 默认走 OCP 标准,相同字节读出偏差一倍)、AITER tuned kernel 对 CDNA3 架构覆盖不全导致注意力路径频繁回退到慢数倍的 Triton 实现、HIP graphs 捕获期内不能有动态分配和 host 读取。每个问题都附了实际修复 commit 链接。优化后单卡达到约 2700 tok/s(+8.6%),结合租金仅为 NVIDIA 一半,证明通过工程努力可以让 MI300X 在性价比上具备竞争力。全文语气诚实,不回避困难,结尾明确指出大部分问题是暂时的——FP8 问题在 MI350/MI355X 已不存在,AITER 覆盖正在补全。适合所有关注 AI 推理基础设施、AMD GPU 部署或 DeepSeek 推理优化的读者。
评论点赞收藏74 天前

用无损解压突破内存受限内核的速度极限

核心看点:内存受限的 kernel 本来受限于数据搬运到 SM 的带宽,但作者提出利用无损解压技术,让实际处理的数据量超过显存带宽的限制——相当于「超光速」。思路是在内存中存压缩数据,搬运到 SM 后再解压执行,从而等效提升有效带宽。适合对 GPU 底层优化、高性能计算和系统性能调优感兴趣的读者。
评论点赞收藏82 天前

投机性 KV 编码:用预测模型将 KV 缓存无损压缩约 4 倍

核心看点:提出用更便宜的预测模型驱动算术编码器,对目标模型的 KV 缓存实现最高约 4 倍的无损压缩。思路类似于投机解码中的预测-验证范式,但应用于缓存压缩场景。对于大模型推理中的显存瓶颈问题,这一方法提供了不损失精度且压缩比可观的新思路,尤其适合长上下文和批量推理场景。
评论点赞收藏100 天前

寻找浪费的比特:LLM 权重携带了多少信息?

核心看点:对模型权重的字节级熵进行实证调查,横跨不同数值格式和模型家族。问题是:模型参数中是否存在大量冗余比特可以压缩?作者用信息论工具量化了权重的真实信息含量,为模型压缩、量化和剪枝提供了底层理论支撑。适合对 LLM 底层原理和模型效率优化感兴趣的读者。
评论点赞收藏103 天前

tANS:预计算版的 rANS 熵编码

核心看点:tANS 是基于查表的熵编码器,通过预计算消除 rANS 中每个符号的除法操作,同时保持接近香农极限的压缩率。本文作为 rANS 的姊妹篇,解释了 tANS 如何用空间换时间来实现更高吞吐。适合想深入理解现代无损压缩算法实现细节的工程师。
评论点赞收藏111 天前

rANS 入门:非对称数系熵编码

核心看点:rANS(非对称数系)是一种高效的无损熵编码方法,能够在保持接近香农极限的压缩率的同时,实现极快的编解码速度。本文以直观方式介绍 rANS 的工作原理,适合想理解现代压缩算法(如 zstd、LZ4 的熵编码层)底层机制的工程师和研究者阅读。
评论点赞收藏117 天前

SGLang 冷启动加速 70 倍

核心看点:使用 CRIU 和 cuda-checkpoint 实现检查点/恢复机制,将 SGLang 在 B200 上的冷启动时间从 12 分钟压缩到 10 秒,加速约 70 倍。这是一个实实在在的工程优化成果,涉及 GPU 状态保存/恢复、进程快照等底层技术,对大规模部署 LLM 推理服务的团队有直接参考价值。
评论点赞收藏132 天前

高错误率下加权随机回退会退化为均匀分布

核心看点:在带权重的随机回退策略中,如果拒绝样本后不放回重试,当错误率较高时,低权重模型被选中的概率会远高于其权重所暗示的比例,最终趋于均匀分布。这一反直觉的统计现象对多模型路由、A/B 测试和容错系统设计有直接影响。作者用简洁的数学分析揭示了常见工程实践中容易被忽视的偏差。
评论点赞收藏180 天前

用 LLM 比较扩展内容策展

核心看点:利用并行原语和基于 BST 的排序,配合 LLM 两两比较来构建内容发现系统。当需要从大量候选中筛选高质量内容时,LLM 作为比较器可以替代人工评分,但如何高效组织这些比较是关键。本文给出了一个工程实践方案,适合做推荐系统、内容审核和 LLM 应用落地的工程师参考。
评论点赞收藏212 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。