Nari Qwen3-TTS/ASR: 超低延迟高精度语音AI引擎

Show HN: Nari Qwen3-TTS and Qwen3-ASR – High accuracy, low latency and cost

Nari Qwen3-TTS/ASR: 超低延迟高精度语音AI引擎

Nari Labs 推出的 Qwen3-TTS 和 Qwen3-ASR 模型在 Coval 权威基准测试中表现卓越,稳居质量与延迟的帕累托前沿。我们的 Qwen3-ASR Fast 模型以 44ms 的极低延迟和 3.6% 的词错率领跑语音识别领域,而 Qwen3-TTS Fast 模型则在文本转语音任务中实现了 63ms 的首字音频延迟和顶尖的识别准确率。相比 AssemblyAI、ElevenLabs 等竞品,我们不仅性能更优,价格更是低至其几分之一。无论是构建实时语音助手还是高并发语音应用,Nari 都能提供兼具速度、精度与成本效益的顶级解决方案。

我们在语音 AI 基准测试中独占鳌头,同时在文本转语音和语音转文本的质量 - 延迟帕累托前沿上实现了突破,并超越了所有公开模型的成本效益比。
  1. karimf

    太棒了。感谢你们推动音频领域的帕累托前沿。虽然现在可能还显得有点遥远,但我认为下一个重大演进是构建 GPT-Live-1 的帕累托前沿替代方案,或者更便宜的替代品。STT/TTS 市场已经相当饱和,而目前几乎还没有 GPT-Live-1 的廉价或开源替代品。

  2. apimade

    https://apimade.com/audio-compare.html

    已将其加入我的盲测 TTS 模型对比排行榜。目前 Darwin TTS 是开源模型中的领头羊,ElevenLabs 则整体领先。

  3. asaiacai

    这项工作真的很酷!我很好奇,你们认为加速 TTS 模型的最大杠杆是什么?或者从技术角度看,最初为什么觉得这个方向有前景?如果让我猜,可能是某种知识蒸馏,但我肯定还有一些针对 TTS 模型感知的架构调整,能让推理速度快得多?

同日更多故事

2026-09-14