Modal
Modal,面向 AI 与数据团队的无服务器计算平台,让开发者无需管理基础设施就能大规模运行 CPU 与 GPU 密集型计算任务。
Moonshot Kimi K3 现已在 Modal 平台上线
Modal 上线 Moonshot Kimi K3,2.8 万亿参数多模态模型支持 1M token 上下文和原生视觉推理,Token 生成速度达 460 tokens/s。 K3 采用混合专家架构,每 token 激活 16/896 个专家,配合 DFlash 推测解码器实现 360% 交互加速与 88% 吞吐量提升,适合长序列代理任务。 Modal 提供按 Token 计费的 Shared API 和专属 Auto Endpoint,每月 $30 免费额度可直接试用,vLLM 已集成其新缓存实现。 

什么是 Flash Attention?
Flash Attention 是一种优化 transformer 模型训练与推理速度的算法,通过改进 GPU 内存管理减少显存占用并提升计算效率。 Flash Attention 2 在 2023 年初发布,相比原版最高提速 2 倍;Flash Attention 3 针对 NVIDIA Hopper 架构(如 H100)进一步优化,已集成至 PyTorch 2.2、Hugging Face Transformers、vLLM 等主流框架。使用需满足长序列输入或大 batch 场景,依赖 PyTorch 1.12+、CUDA 及 cuDNN。 

每秒扩展至百万并发沙箱:Modal 的重构实践
Modal 从零重构了沙箱调度系统,去中心化协调,实现每秒创建数万沙箱、百万级并发。核心设计是用内存缓存和直接 RPC 替代中心数据库,解决 K8s 在超大规模下的 etcd 和调度瓶颈。实测百万沙箱启动中位延迟不到 0.5 秒。 

利用 Pingora、Envoy 和 Spanner 以 6ms 代理推理请求
Modal 介绍其新的低延迟 Servers 功能,将 HTTP 请求处理延迟从 39ms 降至 6ms。通过结合 Envoy 边缘代理和自研 Pingora 路由层,实现无控制面查询的高速转发。 文章详细解释了架构设计,包括如何在保持认证、自动扩缩容等核心功能的同时,避免在热路径中进行网络调用,以优化推理服务的性能。 

拆解沙箱启动延迟:为什么“已启动”不等于“就绪”
文章指出容器启动时间只是沙箱初始化的一小部分,真正的延迟在于启动后的代码克隆和依赖安装。 建议通过预热池和就绪探针来优化生产环境,消除用户的感知等待时间。
投机解码:推理加速的唯一真理
Modal 团队发布了一系列针对 Qwen 系列的 DFlash 投机解码模型,声称能带来显著的速度提升。 文章指出,相比传统的内核优化,投机解码是实现高性能推理的关键引擎优化。 作者通过数学建模和实测数据论证了接受长度对加速比的决定性作用,并强调针对特定领域数据微调的投机解码具有不可替代的优势,是降低大模型推理成本的有效路径。 

让 FlashAttention-4 推理更快:Modal 的底层优化实践
Modal 团队分享了将 FlashAttention-4 优化用于大模型推理的具体实践。主要贡献包括支持 FP8 输入、适配任意 KV Page 大小以节省显存,以及引入 Split-KV 并行策略提升小 Batch 下的吞吐量。 文章详细解释了针对 Decode 阶段内存带宽瓶颈的工程细节,如利用 TMA 和 cp.async 处理不规则内存访问,以及减少小查询长度下的无效计算。这些改动显著提升了 B200 等现代 GPU 上的推理性能,为开发者提供了宝贵的底层优化参考。 

Modal完成3.55亿美元C轮融资,估值达46.5亿美元
AI基础设施公司Modal宣布完成3.55亿美元C轮融资,投后估值达46.5亿美元。 本轮由General Catalyst和Redpoint领投,现有投资者跟投。 Modal表示年经常性收入已超3亿美元,增长五倍。 文章介绍了Modal作为专为AI设计的云平台,提供弹性推理、Agent沙箱和强化学习基础设施。引用了Cognition、DoorDash等客户案例,并展望了低延迟推理和训练推理闭环的未来方向。 

利用 LP、FUSE、C/R 和 CUDA 检查点将推理冷启动速度提升 40 倍
Modal 博客详述了如何通过云缓冲、自定义文件系统、CPU 和 CUDA 检查点恢复等技术,将 AI 推理服务器冷启动时间从数千秒缩短至几十秒。文章深入分析了 Serverless GPU 场景下的资源利用率痛点,并提供了具体的系统架构优化方案与性能数据。 
