vLLM v0.28.0 发布:Kimi-K3 深度优化、DeepSeek V4 端到端支持、推测解码新进展
vLLM 发布 v0.28.0,584 个提交,270 位贡献者。Kimi-K3 大规模优化:Decode Context Parallel、融合 FlashKDA 内核、SiTU 激活、GEMM-RS 序列并行,显存节省约 17 GiB/GPU。DeepSeek V4 稀疏 MLA 端到端支持,AMD Quark NVFP4 支持。推测解码新增 DFlash2 和 DSpark 置信度调度。Model Runner V2 支持 E/P/D 分离、权重卸载、多阶段 MTP。KV cache 支持磁盘卸载。bitsandbytes 迁移为插件,Transformers 升至 5.15.0。 
