GitHub Public Timeline Feed

RSS: https://github.com/vllm-project.atom
vLLM has 47 repositories available. Follow their code on GitHub.

vLLM v0.28.0 发布:Kimi-K3 深度优化、DeepSeek V4 端到端支持、推测解码新进展

vLLM 发布 v0.28.0,584 个提交,270 位贡献者。Kimi-K3 大规模优化:Decode Context Parallel、融合 FlashKDA 内核、SiTU 激活、GEMM-RS 序列并行,显存节省约 17 GiB/GPU。DeepSeek V4 稀疏 MLA 端到端支持,AMD Quark NVFP4 支持。推测解码新增 DFlash2 和 DSpark 置信度调度。Model Runner V2 支持 E/P/D 分离、权重卸载、多阶段 MTP。KV cache 支持磁盘卸载。bitsandbytes 迁移为插件,Transformers 升至 5.15.0。
评论点赞收藏5 小时前

vLLM v0.28.0 发布:Kimi-K3 深度优化、DeepSeek V4 投机解码支持

vLLM 发布 v0.28.0,584 个提交来自 270 位贡献者。Kimi-K3 获得 Decode Context Parallel 支持和融合 kernel,DSpark TTFT 提升约 60%,每 GPU 节省约 17 GiB 显存。DeepSeek V4 的稀疏 MLA 已端到端支持 plain decode、MTP 和 DSpark 投机解码。投机解码新增 DFlash2 和本地卷积候选选择器。Model Runner V2 支持 E/P/D 分离、权重卸载和 thinking_token_budget。KV cache 新增磁盘卸载。bitsandbytes 迁移为独立插件,Transformers 升级至 5.15.0。
评论点赞收藏5 小时前

vLLM v0.28.0 发布:Kimi-K3 大规模优化,DeepSeek V4 投机解码支持

vLLM 发布 v0.28.0,270 位贡献者提交 584 个更新。Kimi-K3 获得大规模优化:Decode Context Parallel、融合 FlashKDA 内核、SiTU 激活支持,推理速度提升 1.5~3 倍,显存节省约 17 GiB/GPU。DeepSeek V4 的稀疏 MLA 支持端到端解码、MTP 和 DSpark 投机解码。投机解码方面新增 DFlash2、DSpark 置信度调度验证。Model Runner V2 支持 E/P/D 分离、权重卸载、多 MTP 层 KV cache。KV cache 新增磁盘卸载。bitsandbytes 迁移为插件,Transformers 升级至 5.15.0。
评论点赞收藏5 小时前

vLLM v0.28.0 版本发布

vLLM v0.28.0发布,支持Kimi-K3和DeepSeek V4,推测解码与KV缓存卸载多项优化。584个提交覆盖270位贡献者,DSpark推测解码TTFT提升约60%,内核级加速1.5~3倍,共享专家分片每GPU节省约17GiB显存。bitsandbytes迁移至树外插件,Transformers升级至5.15.0。
评论点赞收藏5 小时前

vLLM v0.28.0 发布:Kimi-K3 深度优化与 DeepSeek V4 支持

vLLM v0.28.0 发布,新增 Kimi-K3 优化与 DeepSeek V4 支持。Kimi-K3 获得 Decode Context Parallel 支持、融合 FlashKDA 内核(1.5~3x 加速)和自适应推测 token 预算(DSpark TTFT 提升约 60%)。DeepSeek V4 稀疏 MLA 现已完整支持 decode、MTP 和 DSpark 推测解码。Model Runner V2 新增 E/P/D 分离和权重卸载。默认 max_num_batched_tokens 从 8192 升至 16384。bitsandbytes 迁移至插件,Transformers 升级至 5.15.0。
评论点赞收藏5 小时前

登录芦苇

登录后关注作者、收藏内容和参与讨论。