Nari Labs erreicht sub-50-ms TTS-Latenz mit Qwen3-TTS auf einer einzigen H100

How we made a text-to-speech model respond in sub-50 ms

Nari Labs erreicht sub-50-ms TTS-Latenz mit Qwen3-TTS auf einer einzigen H100

Nari Labs präsentiert eine Implementierung von Qwen3-TTS 1.7B CustomVoice, die auf einer einzelnen NVIDIA H100 SXM eine p95-Zeit bis zum ersten hörbaren Audio von unter 50 ms erreicht – bei 10 Requests pro Sekunde und ohne Unterbrechungen. Der Beitrag vergleicht fünf Serving-Engines, darunter vLLM-Omni und VoxServe, und zeigt, wie durch einen gemeinsamen Scheduler für Talker, Code Predictor und Codec, dynamisches Trimming von Stille und Zustands-Caching die Latenz drastisch gesenkt wird. Die Kosten liegen bei etwa 2 US-Dollar pro Million Zeichen, deutlich unter kommerziellen Angeboten wie ElevenLabs V3. Code und Benchmarks sind Open Source.

Der Scheduler kann entscheiden, ob er den Talker ausführt, den Code Predictor vorantreibt oder einen Codec-Job priorisiert, der sich seinem Playback-Deadline nähert.

Mehr von diesem Tag

2026-08-21