Qwen3-TTS 如何实现 50ms 级实时响应

How We Made a Text-to-Speech Model Respond in Sub-50 ms

Qwen3-TTS 如何实现 50ms 级实时响应

我们针对 Qwen3-TTS 1.7B CustomVoice 模型进行了深度优化,在单张 NVIDIA H100 SXM 上实现了每秒 10 次请求(RPS)且 p95 首音频时间(TTFA)低于 50ms 的突破。通过对比 vLLM-Omni、SGLang-Omni、VoxServe 和 M* 等主流引擎,我们发现仅靠常规调优难以在保持高并发时达到这一低延迟标准。我们的核心策略是将 Talker、Code Predictor 和 Codec 三个模块统一调度,利用动态修剪前导静音、优化帧累积策略以及基于状态缓存的 Codec 重建,成功在零欠载的前提下维持了实时播放。这一方案不仅大幅降低了延迟,还将每百万字符的成本控制在约 2 美元,远低于 ElevenLabs 和 Cartesia 等商业服务。

我们的目标是在单张 NVIDIA H100 SXM 上,以零欠载维持高请求率,同时实现低 p95 可听首音频时间。

同日更多故事

2026-08-21