Qwen3-TTSを50ms未満で応答させる:Nari Labsが実現した低遅延TTSの最適化

How we made a text-to-speech model respond in sub-50 ms

Qwen3-TTSを50ms未満で応答させる:Nari Labsが実現した低遅延TTSの最適化

Nari Labsは、Qwen3-TTS 1.7B CustomVoiceをNVIDIA H100 SXM上で動作させ、p95の音声開始時間(TTFA)を50ms未満に抑えながら、毎秒10リクエスト(RPS)を処理し、リアルタイム再生を維持することに成功しました。既存のvLLM-Omni、SGLang-Omni、VoxServe、M*と比較し、独自のスケジューリングと最適化により、唯一のサブ50msを達成。コストは100万文字あたり約2ドルと、ElevenLabs V3の100ドルと比べて大幅に低コストです。実装とベンチマークはオープンソースで公開されています。

我々のシステムは、10 RPSで毎秒約630文字を生成し、H100 SXMインスタンスの1時間あたり4.29ドルで計算すると、フル稼働時に100万文字あたり約2ドルというコストを実現します。

この日のほかの記事

2026-08-21