芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

在Tenstorrent硬件上服务LLM:vLLM TT插件技术内幕

Vllm,高性能、内存高效的 LLM 推理与服务引擎。关注
在Tenstorrent硬件上服务LLM:vLLM TT插件技术内幕 图片 1
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
Vllm高性能、内存高效的 LLM 推理与服务引擎。
相关文章
vLLM在AMD GPU上的投机解码:5种方法实测对比查看相关内容
vLLM 长上下文推理的解码上下文并行(DCP)技术详解查看相关内容
Kimi K3 on vLLM: Up to 370 Tokens/sec查看相关内容