Суб-50 мс: как Nari Labs ускорила Qwen3-TTS до 10 RPS на одном H100

How we made a text-to-speech model respond in sub-50 ms

Суб-50 мс: как Nari Labs ускорила Qwen3-TTS до 10 RPS на одном H100

Инженеры Nari Labs представили реализацию Qwen3-TTS 1.7B CustomVoice, которая достигает p95 TTFA менее 50 мс и 10 запросов в секунду на одном NVIDIA H100 SXM, сохраняя воспроизведение в реальном времени. Они сравнили пять серверных движков, включая vLLM-Omni и SGLang-Omni, и после оптимизации только их система удержала суб-50 мс при 10 RPS. Секрет — в едином планировщике для трёх модулей модели, приоритизации первого аудио и кэшировании состояния кодера. При стоимости $4.29/час это около $2 за миллион символов.

Мы даём высокий приоритет запросам, которые ещё не сгенерировали первое аудио, а установленные потоки становятся срочными только при приближении к дедлайну воспроизведения.
  1. toebee

    Время до первого аудио (TTFA) критически важно для голосовых приложений реального времени. Open source реализации (например, vLLM-Omni, SGLang-Omni) часто слишком медленны для продакшена и могут иметь проблемы с воспроизведением в реальном времени, если стремиться к меньшей задержке. Мы хотели это исправить.

    Мы оптимизировали qwen3-tts, популярную open source TTS-модель, и достигли TTFA 34 мс (p95) при 10 запросах в секунду на одном H100. Мы публикуем реализацию, бенчмарк и подробный разбор того, как это было сделано.

    GitHub: https://github.com/nari-labs/nari-qwen3-tts

  2. armcat

    Построив собственного голосового ассистента (https://github.com/acatovic/ova) и перепробовав множество других сервисов и моделей, я считаю, что настоящий прорыв — когда это работает на устройстве, и под «на устройстве» я имею в виду очень дешево в эксплуатации на телефоне, а не на H100. Я сейчас пользуюсь Pocket TTS, который супербыстрый, а также Chatterbox и Fish Audio S2 Pro (на Mac/PC), и чувствую, что мы так близко, но в то же время так далеко. Качество потрясающее, но можем ли мы вывести это на новый уровень и заставить работать на мобильных устройствах? Что для этого потребуется?

  3. nowittyusername

    Это как раз моя тема, так как я уже год строю локального голосового агента. Я перепробовал множество разных моделей и создал собственную реализацию для omni voice, которую настраивал в течение многих месяцев. Мне никогда не удавалось достичь TTFA быстрее 200 мс для этой модели при 24 шагах, но причина в ... качестве. Я считаю, что во многих TTS-моделях есть огромный потенциал для улучшения. Но также есть жесткий предел качества, которого в конце концов достигаешь, и тогда компромисс между более низкой задержкой и более низким качеством не стоит того. При создании действительно хорошо звучащего голосового агента качество голоса, темп, выразительность и т.д. имеют большое значение. Будет интересно попробовать эту реализацию и посмотреть, соответствует ли качество ее выводов моим ожиданиям; если да, то отличная работа.

Ещё за этот день

2026-08-21