让语音合成模型首音频延迟低于 50ms 的工程实践
Nari Labs 将 Qwen3-TTS 1.7B 优化到单张 H100 SXM 上实现 10 RPS、p95 首音频延迟低于 50ms,成本约 $2/百万字符,远低于 ElevenLabs($100)和 Cartesia($49)。核心优化:将 Talker/Code Predictor/Codec 三个模块统一到单一调度器,按紧急程度动态调度而非固定顺序执行;Code Predictor 用固定步数预分配 KV cache 并捕获为 CUDA graph;Codec 用状态缓存做增量解码避免重复处理历史帧。开源了实现和基准测试代码。 
