Суб-50 мс: как Nari Labs ускорила Qwen3-TTS до 10 RPS на одном H100

How we made a text-to-speech model respond in sub-50 ms

Суб-50 мс: как Nari Labs ускорила Qwen3-TTS до 10 RPS на одном H100

Инженеры Nari Labs представили реализацию Qwen3-TTS 1.7B CustomVoice, которая достигает p95 TTFA менее 50 мс и 10 запросов в секунду на одном NVIDIA H100 SXM, сохраняя воспроизведение в реальном времени. Они сравнили пять серверных движков, включая vLLM-Omni и SGLang-Omni, и после оптимизации только их система удержала суб-50 мс при 10 RPS. Секрет — в едином планировщике для трёх модулей модели, приоритизации первого аудио и кэшировании состояния кодера. При стоимости $4.29/час это около $2 за миллион символов.

Мы даём высокий приоритет запросам, которые ещё не сгенерировали первое аудио, а установленные потоки становятся срочными только при приближении к дедлайну воспроизведения.

Ещё за этот день

2026-08-21