Vllm

高性能、内存高效的 LLM 推理与服务引擎。

vLLM 预填充结合 TileRT 解码:专为低延迟场景优化的推理架构

vLLM 推出与 TileRT 解码引擎集成的方案,将计算密集的 Prefill 阶段与内存带宽受限的 Decode 阶段分离。该集成利用 vLLM V1 连接器接口,允许用户在保持 vLLM 调度和缓存优势的同时,针对交互式 Agent、实时语音等延迟敏感场景,切换至 TileRT 以获得更高的单用户 Token 生成速度。
评论点赞收藏32 天前

vLLM 与 Deeplearning.ai 联合推出:快速高效的 LLM 推理新课程

vLLM 团队与 Red Hat 及 合作推出了一门关于 LLM 推理优化的新课程。课程涵盖模型压缩、使用 vLLM 部署以及性能基准测试三个主要阶段,并包含动手实验环节。 该课程由 Red Hat 的高级开发者倡导者 Cedric Clyburn 授课,旨在帮助开发者理解 LLM 推理背后的原理,如 KV Cache 和 GPU 内存层次结构,并提供从量化到部署的全流程实践指导。
评论点赞收藏72 天前

EAGLE 3.1 发布:解决推测解码鲁棒性问题,vLLM 集成带来两倍吞吐提升

EAGLE 团队联合 vLLM 和 TorchSpec 发布推测解码算法 EAGLE 3.1。针对长上下文和不同对话模板下的性能衰减问题,新版本引入 FC 归一化和后归一化隐藏状态反馈机制,显著提升了训练到推理的外推能力及系统提示词的鲁棒性。实测在 Kimi K2.6 模型上,吞吐量提升约 2 倍。该功能已合并至 vLLM 主分支,并开源了对应草稿模型。
评论点赞收藏81 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。