Qwen3-TTS 如何实现 50ms 级实时响应
How We Made a Text-to-Speech Model Respond in Sub-50 ms

我们针对 Qwen3-TTS 1.7B CustomVoice 模型进行了深度优化,在单张 NVIDIA H100 SXM 上实现了每秒 10 次请求(RPS)且 p95 首音频时间(TTFA)低于 50ms 的突破。通过对比 vLLM-Omni、SGLang-Omni、VoxServe 和 M* 等主流引擎,我们发现仅靠常规调优难以在保持高并发时达到这一低延迟标准。我们的核心策略是将 Talker、Code Predictor 和 Codec 三个模块统一调度,利用动态修剪前导静音、优化帧累积策略以及基于状态缓存的 Codec 重建,成功在零欠载的前提下维持了实时播放。这一方案不仅大幅降低了延迟,还将每百万字符的成本控制在约 2 美元,远低于 ElevenLabs 和 Cartesia 等商业服务。
我们的目标是在单张 NVIDIA H100 SXM 上,以零欠载维持高请求率,同时实现低 p95 可听首音频时间。
HN 评论区
41- toebee
time-to-first-audio (TTFA) 对于实时语音应用至关重要。开源实现(例如 vLLM-Omni、SGLang-Omni)通常在生产环境中速度太慢,而且如果你强行追求低延迟,可能会遇到实时播放问题。我们想解决这个问题。
我们优化了流行的开源 TTS 模型 qwen3-tts,在 1 张 H100 显卡上以每秒 10 个请求的负载实现了 34 毫秒的 p95 TTFA。我们开源了该实现和基准测试,并详细拆解了具体做法。
- armcat
我自己开发过语音助手(https://github.com/acatovic/ova),也尝试过许多其他服务和模型。我觉得真正的突破在于端侧部署,而我说的“端侧”是指在手机上运行成本极低,而不是依赖 H100。我现在正在使用 Pocket TTS,速度极快,同时也试过 Chatterbox 和 Fish Audio S2 Pro(在 Mac/PC 上)。感觉我们已经非常接近目标,却又似乎遥不可及。音质已经令人惊叹,但我们能否再进一步,让它能在移动设备上运行?这需要付出什么代价?
- nowittyusername
有计划将其部署到 cloudflare ai workers(或类似平台)吗?看起来超级酷,我很想试试!