SubQ 1.1 小模型:线性扩展稀疏注意力,1200万token下检索率达98%
Subquadratic AI 发布 SubQ-1.1-Small 模型,采用亚二次稀疏注意力机制(SSA),实现线性计算与内存成本。该模型在 1M token 预训练,但在 12M token 长度下仍保持 98% 的检索准确率,相比密集注意力减少 64.5 倍 FLOPs。报告详细对比了 Flash Attention、传统稀疏注意力及 Mamba 等状态空间模型的优劣,强调 SSA 在保留内容依赖检索能力的同时解决了长上下文训练成本问题,为全工件推理提供了新的架构路径。