Subq

Subquadratic,前沿 AI 研究与基础设施公司,构建新一代高效、高性能大语言模型。

SubQ 1.1 小模型:线性扩展稀疏注意力,1200万token下检索率达98%

Subquadratic AI 发布 SubQ-1.1-Small 模型,采用亚二次稀疏注意力机制(SSA),实现线性计算与内存成本。该模型在 1M token 预训练,但在 12M token 长度下仍保持 98% 的检索准确率,相比密集注意力减少 64.5 倍 FLOPs。报告详细对比了 Flash Attention、传统稀疏注意力及 Mamba 等状态空间模型的优劣,强调 SSA 在保留内容依赖检索能力的同时解决了长上下文训练成本问题,为全工件推理提供了新的架构路径。
评论点赞收藏60 天前

SubQ:专为1200万Token推理设计的亚二次方复杂度LLM

SubQ 是一家由 Meta、Google 及牛津剑桥研究员组成的初创公司推出的新型 LLM。其核心突破在于采用完全亚二次方稀疏注意力架构,声称能在 1200 万 token 上下文窗口中保持推理质量,且成本仅为其他主流模型的五分之一,速度达 150 tokens/秒。文章展示了其在 SWE-Bench 和长上下文检索基准测试中的表现,并提供 API 和代码代理集成两种使用方式。虽然技术报告尚未发布,但其架构创新和对长上下文效率的提升对开发者社区具有较高关注度。
评论点赞收藏97 天前

亚二次稀疏注意力让长上下文变得实用

SubQ团队发布SSA(亚二次稀疏注意力)机制,旨在解决长上下文推理中的计算成本问题。文章指出传统密集注意力在百万token级别成本过高,SSA通过内容依赖的选择机制实现线性扩展,在1M token下获得56.2倍加速。基准测试显示其在MRCR v2等长上下文检索任务上优于Opus 4.6和GPT-5.5,强调从名义上下文窗口向功能性上下文窗口的转变。
评论点赞收藏101 天前

SubQ:一种拥有1200万Token上下文的亚二次方大模型

Subquadratic公司发布SubQ 1M-Preview模型,声称其架构实现了亚二次方计算复杂度,支持高达1200万token的上下文窗口。该模型在RULER和MRCR等基准测试中表现优异,推理速度比FlashAttention快52倍,旨在解决Transformer架构在长上下文处理上的计算瓶颈问题。
评论点赞收藏102 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。