Nari Qwen3-TTS & Qwen3-ASR - 高精度・低遅延・低コストの音声AI
Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost

Nari Labsが提供するQwen3-TTSとQwen3-ASRは、Covalの音声AIベンチマークで品質と遅延のパレートフロンティアを達成した音声合成・認識モデルです。STTは44msのTTFSと3.6%のWERでトップクラス、TTSは63msのTTFAと3.8%のWERを実現。さらに、STTは$0.12/時間、TTSは$10/1M文字という低価格で、競合他社より大幅にコストを抑えられます。音声エージェントの応答性と精度を両立し、手頃な価格で導入可能。現在無料トライアルを提供中で、アカウント作成者には$20のクレジットが進呈されます。
Nari Labsは、Text-to-SpeechとSpeech-to-Textの両方で品質と遅延のパレートフロンティアに位置し、Covalの音声AIベンチマークをリードしています。
HNでの議論
31- recentlypostedj
質問です:どうやって差別化するつもりですか?TTSはたくさんあり、毎月のように変化していて、どれがより良くなるかわかりませんから。
- asaiacai
これは本当にクールな仕事ですね!TTSモデルを高速化するための最大のレバーは何だと考えていますか、あるいは技術的な観点から、そもそもこれが有望な方向性だったのはなぜですか?推測するなら、ある種の蒸留だと思いますが、推論をはるかに速くするTTSモデルを意識したアーキテクチャの変更がおそらくあるのでしょうね?
- karimf
これは素晴らしい。オーディオのパレートフロンティアを前進させてくれてありがとう。
今はまだ遠い話かもしれませんが、次の大きな進化はGPT-Live-1に対するパレート/はるかに安価な代替品を作ることだと思います。
STT/TTS市場はかなり飽和していますが、今日、GPT-Live-1に代わる安価でオープンソースの選択肢はほとんどありません。
- apimade
https://apimade.com/audio-compare.html
私のブラインドTTSモデル比較リーダーボードに追加しました。今のところ、Darwin TTSがオープンモデルの中で先頭を走っており、ElevenLabsがトップです。
- rahimnathwani
どういうわけか、33秒のクリップの途中で声が切り替わりました。
OPにとって、クリップ名はnari-nina-01a0a12f-980a-765e-8029-fa56bd23210d.wavです。