Nari Qwen3-TTS & Qwen3-ASR - 高精度・低遅延・低コストの音声AI

Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost

Nari Qwen3-TTS & Qwen3-ASR - 高精度・低遅延・低コストの音声AI

Nari Labsが提供するQwen3-TTSとQwen3-ASRは、Covalの音声AIベンチマークで品質と遅延のパレートフロンティアを達成した音声合成・認識モデルです。STTは44msのTTFSと3.6%のWERでトップクラス、TTSは63msのTTFAと3.8%のWERを実現。さらに、STTは$0.12/時間、TTSは$10/1M文字という低価格で、競合他社より大幅にコストを抑えられます。音声エージェントの応答性と精度を両立し、手頃な価格で導入可能。現在無料トライアルを提供中で、アカウント作成者には$20のクレジットが進呈されます。

Nari Labsは、Text-to-SpeechとSpeech-to-Textの両方で品質と遅延のパレートフロンティアに位置し、Covalの音声AIベンチマークをリードしています。
  1. recentlypostedj

    質問です:どうやって差別化するつもりですか?TTSはたくさんあり、毎月のように変化していて、どれがより良くなるかわかりませんから。

  2. asaiacai

    これは本当にクールな仕事ですね!TTSモデルを高速化するための最大のレバーは何だと考えていますか、あるいは技術的な観点から、そもそもこれが有望な方向性だったのはなぜですか?推測するなら、ある種の蒸留だと思いますが、推論をはるかに速くするTTSモデルを意識したアーキテクチャの変更がおそらくあるのでしょうね?

  3. karimf

    これは素晴らしい。オーディオのパレートフロンティアを前進させてくれてありがとう。

    今はまだ遠い話かもしれませんが、次の大きな進化はGPT-Live-1に対するパレート/はるかに安価な代替品を作ることだと思います。

    STT/TTS市場はかなり飽和していますが、今日、GPT-Live-1に代わる安価でオープンソースの選択肢はほとんどありません。

  4. apimade

    https://apimade.com/audio-compare.html

    私のブラインドTTSモデル比較リーダーボードに追加しました。今のところ、Darwin TTSがオープンモデルの中で先頭を走っており、ElevenLabsがトップです。

  5. rahimnathwani

    どういうわけか、33秒のクリップの途中で声が切り替わりました。

    OPにとって、クリップ名はnari-nina-01a0a12f-980a-765e-8029-fa56bd23210d.wavです。

この日のほかの記事

2026-09-14