DeepSeek 稀疏注意力(DSA)实现教程
这篇文章来自 Sebastian Raschka 的 LLMs-from-scratch 开源项目,深入解析 DeepSeek-V3.2 引入的稀疏注意力机制(DSA)。与标准因果注意力对所有历史 token 做 O(L²) 计算不同,DSA 通过 Lightning Indexer(轻量多头打分器)为每个查询 token 评估候选历史 token 的相关性,再由 Token Selector 仅保留 top-K 个最高分位置,将注意力限制在 k ≪ L 个 token 上,理论上可将计算量从 O(L²) 降至 O(L·k)。文章给出了完整的数学公式、架构图、PyTorch 实现代码(含 LightningIndexer 和 MultiHeadAttentionWithDSA 类)以及命令行用法示例。该实现基于 GPT 风格模型,不包含 DeepSeek 完整的 MLA 堆栈和生产级融合内核优化,但清晰展示了 DSA 的核心选择逻辑,适合想理解并亲手实验这一机制的开发者阅读。
