Modal

Modal,面向 AI 与数据团队的无服务器计算平台,让开发者无需管理基础设施就能大规模运行 CPU 与 GPU 密集型计算任务。

GPU 术语表(可读版)

Modal 团队发布了一份跨全栈的 GPU 术语表(glossary),把 NVIDIA 文档中分散的概念(如 SM 架构、计算能力、nvcc 编译选项、warp 调度器、线程、CUDA 编程模型等)整合成一个可交叉链接的超文本文档,方便在不同层之间跳转阅读。 内容来源包括 NVIDIA PDF、社区 Discord 讨论和 CUDA 相关书籍,代码和文档已开源在 GitHub(modal-labs/gpu-glossary)。支持键盘/箭头/目录导航,可线性阅读或跳跃阅读。
评论点赞收藏2 天前

结合查询规划器与推理引擎,实现每 GPU 每分钟 10 亿 tokens

Modal 联合 CMU 数据库团队发布 QUery-Aware Inference Layer(Quail),将 AI-SQL 查询规划与 LLM 推理引擎联合优化,在 H100 上实现约 10 亿 tokens/分钟/GPU,比 vLLM 快 10 倍以上,Modal 平台上成本低于 6 美分/十亿 tokens。 核心洞察:结构化 SQL 查询让系统提前知道请求结构,因此可以精准管理 KV cache 的写入、驱逐和复用;布尔分类(AI.IF)只需 prefill 阶段一个 token,完全跳过 decode,避免 agentic 推理中昂贵的 decode 阶段。 架构上使用 Substrait 序列化查询计划、Triton 做 kernel fusion、DeepGEMM 和 Flash Attention 3 做核心算子,查询规划器引入 roofline 速度上限成本模型和 KV 感知的 join 排序搜索。 文章观点鲜明,信息密度高,展示了"数据库+推理引擎"交叉领域的工程深度,对推理工程师和数据库研究者都有明确讨论入口。
评论点赞收藏3 天前

如何为万亿参数编码智能体服务万亿个 token

Modal 详解如何在万亿参数模型上支撑万亿级 token 的编程 agent 推理服务。核心优化路径:理解编码 agent 工作负载的"会话链"结构(长输入、高重复、输出短),先在单副本上最大化 interactivity(单用户 decode token 速率),再做吞吐优化。 技术细节包括:用 NVFP4 量化在 Blackwell B200/B300 上服务 Moonshot Kimi K2.6;采用 SGLang 引擎并贡献补丁;用 tensor parallelism + 定制 DFlash 推测解码缓解 decode 阶段 HBM 带宽瓶颈;通过清缓存、量化中间结果、HiCache 扩展到 CPU RAM 提高 cache 命中率(一到两个 9);发现 8 个 GPU 的单主机副本即可达到与 72 GPU 域接近的 interactivity,同时保持每 GPU 吞吐,且更易运维和弹性调度。 最终单副本性能提升 2.8 倍(单用户)和 5.6 倍(跨用户),单个服务日处理数百亿 token。文章面向通用软件工程师,信息密度高,工程判断明确,有强讨论价值。
评论点赞收藏6 天前

Moonshot Kimi K3 现已在 Modal 平台上线

Modal 上线 Moonshot Kimi K3,2.8 万亿参数多模态模型支持 1M token 上下文和原生视觉推理,Token 生成速度达 460 tokens/s。 K3 采用混合专家架构,每 token 激活 16/896 个专家,配合 DFlash 推测解码器实现 360% 交互加速与 88% 吞吐量提升,适合长序列代理任务。 Modal 提供按 Token 计费的 Shared API 和专属 Auto Endpoint,每月 $30 免费额度可直接试用,vLLM 已集成其新缓存实现。
评论点赞收藏63 天前

什么是 Flash Attention?

Flash Attention 是一种优化 transformer 模型训练与推理速度的算法,通过改进 GPU 内存管理减少显存占用并提升计算效率。 Flash Attention 2 在 2023 年初发布,相比原版最高提速 2 倍;Flash Attention 3 针对 NVIDIA Hopper 架构(如 H100)进一步优化,已集成至 PyTorch 2.2、Hugging Face Transformers、vLLM 等主流框架。 使用需满足长序列输入或大 batch 场景,依赖 PyTorch 1.12+、CUDA 及 cuDNN。
评论点赞收藏64 天前

Proxying inference requests in 6ms with Pingora, Envoy, and Spanner

Modal 介绍其新的低延迟 Servers 功能,将 HTTP 请求处理延迟从 39ms 降至 6ms。通过结合 Envoy 边缘代理和自研 Pingora 路由层,实现无控制面查询的高速转发。 文章详细解释了架构设计,包括如何在保持认证、自动扩缩容等核心功能的同时,避免在热路径中进行网络调用,以优化推理服务的性能。
评论点赞收藏70 天前

每秒扩展至百万并发沙箱:Modal 的重构实践

Modal 从零重构了沙箱调度系统,去中心化协调,实现每秒创建数万沙箱、百万级并发。核心设计是用内存缓存和直接 RPC 替代中心数据库,解决 K8s 在超大规模下的 etcd 和调度瓶颈。 实测百万沙箱启动中位延迟不到 0.5 秒。
评论点赞收藏75 天前

利用 Pingora、Envoy 和 Spanner 以 6ms 代理推理请求

Modal 介绍其新的低延迟 Servers 功能,将 HTTP 请求处理延迟从 39ms 降至 6ms。通过结合 Envoy 边缘代理和自研 Pingora 路由层,实现无控制面查询的高速转发。 文章详细解释了架构设计,包括如何在保持认证、自动扩缩容等核心功能的同时,避免在热路径中进行网络调用,以优化推理服务的性能。
评论点赞收藏87 天前

投机解码:推理加速的唯一真理

Modal 团队发布了一系列针对 Qwen 系列的 DFlash 投机解码模型,声称能带来显著的速度提升。 文章指出,相比传统的内核优化,投机解码是实现高性能推理的关键引擎优化。 作者通过数学建模和实测数据论证了接受长度对加速比的决定性作用,并强调针对特定领域数据微调的投机解码具有不可替代的优势,是降低大模型推理成本的有效路径。
评论点赞收藏102 天前

让 FlashAttention-4 推理更快:Modal 的底层优化实践

Modal 团队分享了将 FlashAttention-4 优化用于大模型推理的具体实践。主要贡献包括支持 FP8 输入、适配任意 KV Page 大小以节省显存,以及引入 Split-KV 并行策略提升小 Batch 下的吞吐量。 文章详细解释了针对 Decode 阶段内存带宽瓶颈的工程细节,如利用 TMA 和 cp.async 处理不规则内存访问,以及减少小查询长度下的无效计算。 这些改动显著提升了 B200 等现代 GPU 上的推理性能,为开发者提供了宝贵的底层优化参考。
评论点赞收藏106 天前

Modal完成3.55亿美元C轮融资,估值达46.5亿美元

AI基础设施公司Modal宣布完成3.55亿美元C轮融资,投后估值达46.5亿美元。 本轮由General Catalyst和Redpoint领投,现有投资者跟投。 Modal表示年经常性收入已超3亿美元,增长五倍。 文章介绍了Modal作为专为AI设计的云平台,提供弹性推理、Agent沙箱和强化学习基础设施。引用了Cognition、DoorDash等客户案例,并展望了低延迟推理和训练推理闭环的未来方向。
评论点赞收藏128 天前

利用 LP、FUSE、C/R 和 CUDA 检查点将推理冷启动速度提升 40 倍

Modal 博客详述了如何通过云缓冲、自定义文件系统、CPU 和 CUDA 检查点恢复等技术,将 AI 推理服务器冷启动时间从数千秒缩短至几十秒。 文章深入分析了 Serverless GPU 场景下的资源利用率痛点,并提供了具体的系统架构优化方案与性能数据。
评论点赞收藏134 天前

How to Achieve Truly Serverless GPUs

Modal 博客详述了如何通过云缓冲、自定义文件系统、CPU 和 CUDA 检查点恢复等技术,将 AI 推理服务器冷启动时间从数千秒缩短至几十秒。 文章深入分析了 Serverless GPU 场景下的资源利用率痛点,并提供了具体的系统架构优化方案与性能数据。
评论点赞收藏136 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。