Qwen3-TTSを50ms未満で応答させる:Nari Labsが実現した低遅延TTSの最適化

How we made a text-to-speech model respond in sub-50 ms

Qwen3-TTSを50ms未満で応答させる:Nari Labsが実現した低遅延TTSの最適化

Nari Labsは、Qwen3-TTS 1.7B CustomVoiceをNVIDIA H100 SXM上で動作させ、p95の音声開始時間(TTFA)を50ms未満に抑えながら、毎秒10リクエスト(RPS)を処理し、リアルタイム再生を維持することに成功しました。既存のvLLM-Omni、SGLang-Omni、VoxServe、M*と比較し、独自のスケジューリングと最適化により、唯一のサブ50msを達成。コストは100万文字あたり約2ドルと、ElevenLabs V3の100ドルと比べて大幅に低コストです。実装とベンチマークはオープンソースで公開されています。

我々のシステムは、10 RPSで毎秒約630文字を生成し、H100 SXMインスタンスの1時間あたり4.29ドルで計算すると、フル稼働時に100万文字あたり約2ドルというコストを実現します。
  1. toebee

    音声アプリのリアルタイム性には、最初の音声が出力されるまでの時間(TTFA)が極めて重要です。オープンソースの実装(例:vLLM-Omni、SGLang-Omni)は、本番環境では遅すぎることが多く、レイテンシを下げようとするとリアルタイム再生で問題が発生することもあります。私たちはそれを解決したいと考えました。

    私たちは人気のOSS TTSモデルであるqwen3-ttsを最適化し、1台のH100上で毎秒10リクエストの処理時に、p95 TTFA 34ミリ秒を達成しました。実装とベンチマーク、そしてその方法の詳細をオープンソースとして公開しています。

    GitHub: https://github.com/nari-labs/nari-qwen3-tts

  2. vivzkestrel

    自分でボイスアシスタントを構築し(https://github.com/acatovic/ova)、他の多くのサービスやモデルを試してきた身としては、本当の勝負どころはこれがオンデバイスで動くことだと思います。つまり、H100ではなく、スマホで非常に安価に動作することを意味します。今は超高速なPocket TTSを使っていますが、ChatterboxやFish Audio S2 Pro(Mac/PC用)も試しました。もう一歩のところまで来ているのに、まだ遠いと感じます。品質は素晴らしいですが、これを次のレベルに引き上げてモバイルで動かすことはできるでしょうか?それには何が必要でしょうか?

  3. armcat

    これをCloudflare AI Workers(または類似のもの)で利用できるようにする予定はありますか?とてもクールに見えます。ぜひ試してみたいです!

この日のほかの記事

2026-08-21