Nari Labs erreicht sub-50-ms TTS-Latenz mit Qwen3-TTS auf einer einzigen H100

How we made a text-to-speech model respond in sub-50 ms

Nari Labs erreicht sub-50-ms TTS-Latenz mit Qwen3-TTS auf einer einzigen H100

Nari Labs präsentiert eine Implementierung von Qwen3-TTS 1.7B CustomVoice, die auf einer einzelnen NVIDIA H100 SXM eine p95-Zeit bis zum ersten hörbaren Audio von unter 50 ms erreicht – bei 10 Requests pro Sekunde und ohne Unterbrechungen. Der Beitrag vergleicht fünf Serving-Engines, darunter vLLM-Omni und VoxServe, und zeigt, wie durch einen gemeinsamen Scheduler für Talker, Code Predictor und Codec, dynamisches Trimming von Stille und Zustands-Caching die Latenz drastisch gesenkt wird. Die Kosten liegen bei etwa 2 US-Dollar pro Million Zeichen, deutlich unter kommerziellen Angeboten wie ElevenLabs V3. Code und Benchmarks sind Open Source.

Der Scheduler kann entscheiden, ob er den Talker ausführt, den Code Predictor vorantreibt oder einen Codec-Job priorisiert, der sich seinem Playback-Deadline nähert.
  1. vivzkestrel

    Die Zeit bis zum ersten Audio (TTFA) ist entscheidend für Echtzeit-Sprachdienste. Open-Source-Implementierungen (z. B. vLLM-Omni, SGLang-Omni) sind für die Produktion oft zu langsam und können bei niedriger Latenz Probleme mit der Echtzeit-Wiedergabe haben. Das wollten wir beheben.

    Wir haben qwen3-tts, ein beliebtes OSS-TTS-Modell, optimiert, um eine p95-TTFA von 34 ms bei 10 Anfragen pro Sekunde auf einer einzigen H100 zu erreichen. Wir veröffentlichen die Implementierung und den Benchmark als Open Source sowie eine Aufschlüsselung, wie das gemacht wurde.

    GitHub: https://github.com/nari-labs/nari-qwen3-tts

  2. toebee

    Da ich selbst meinen eigenen Sprachassistenten gebaut habe (https://github.com/acatovic/ova) und viele andere Dienste und Modelle ausprobiert habe, denke ich, dass der eigentliche Gewinn darin liegt, wenn das auf dem Gerät läuft – und mit "auf dem Gerät" meine ich, dass es sehr günstig auf einem Telefon laufen kann, und nicht auf einer H100. Ich benutze jetzt Pocket TTS, das super schnell ist, sowie Chatterbox und Fish Audio S2 Pro (auf Mac/PC), und ich habe das Gefühl, wir sind so nah dran und doch so weit entfernt. Die Qualität ist erstaunlich, aber können wir das auf die nächste Stufe heben und es auf dem Handy laufen lassen? Was würde es brauchen?

  3. armcat

    Das ist genau mein Thema, da ich seit einem Jahr einen lokalen Sprachagenten baue. Ich habe viele verschiedene Modelle ausprobiert und habe eine eigene Implementierung für Omni Voice, die ich über viele Monate abgestimmt habe. Ich habe es nie geschafft, eine schnellere TTFA als 200 ms für dieses Modell bei 24 Schritten zu erreichen, aber der Grund ist ... Qualität. Ich finde, dass es bei vielen TTS-Modellen da draußen noch viel Raum für Verbesserungen gibt, und zwar in großem Maße. Aber es gibt auch eine harte Qualitätsgrenze, an die man irgendwann stößt, wo der Kompromiss aus schnellerer Latenz und geringerer Qualität es nicht wert ist. Wenn man einen wirklich gut klingenden Sprachagenten baut, kommt es auf die Stimmqualität, den Tonfall, den Ausdruck usw. sehr an. Es wird interessant sein, diese Implementierung auszuprobieren und zu sehen, ob ihre Qualitätsausgaben meinen Erwartungen entsprechen. Wenn ja, dann wirklich gute Arbeit.

Mehr von diesem Tag

2026-08-21