在Tenstorrent硬件上服务LLM:vLLM TT插件技术内幕
Tenstorrent推出vLLM TT插件,让Tenstorrent加速器通过vLLM标准插件机制服务LLM。插件不做fork,完全外置于vLLM核心,支持Llama 3.1-3.3、Qwen、Mistral、Gemma等模型,涵盖多模态。 核心设计挑战来自Mesh架构:没有TP/PP ranks,调度器改为纯预填充或纯解码的相位隔离模式;单执行模型采用单进程多路径数据并行而非多进程;设备端采样自动降级。 目前不支持投机解码、LoRA、提示logprobs和多机扩展。 





