Canto:专为真实世界打造的语音模型

Canto: A speech model built for the real world

Canto:专为真实世界打造的语音模型

实验室环境下的语音识别虽已成熟,但真实场景充满噪音、背景音和突发状况。Wispr Flow 推出了 Canto,这是专为实时听写设计的最新语音模型。在包含 2300 多名用户、涵盖通勤、办公室嘈杂环境等真实场景的测试中,Canto 的词错误率(WER)击败了 Google、OpenAI、AssemblyAI 和 Deepgram 等竞品。通过结合监督微调与基于 GRPO 的强化学习,Canto 不仅能从用户修正中学习,还能在充满干扰的情况下精准区分上下文。这标志着语音识别从“听清录音”迈向了“听懂真实世界”。

今天,Wispr Advanced Interfaces Lab 推出了 Canto,这是我们专为实时听写打造的最新语音模型。
  1. Redster

    恭喜发布!很高兴看到这一领域取得了更多进展。

    由于 Transformer 模型固有的幻觉问题,我一直在寻找基于 transducer 且 WER(词错误率)较低的模型。Parakeet-unified-en-0.6b 让我非常满意。据我所知,它的 WER 虽然不如 Canto 低,但在非 Transformer 架构的模型中已经算是极低水平了(约 5-6.5%)。

    我对它的输出效果非常满意。

    我原本没指望这个,但它足够轻量,甚至能在我的“土豆机”上运行(i5 第八代处理器),转录速度仍能达到实时速度的 9-10 倍。

    我用 vibe-coding 的方式给它写了一个小包装器,用于处理音频文件夹、播客 RSS 源,甚至是 YouTube 播放列表和频道,它已成为我新的最爱工具之一。

  2. ks2048

    他们应该展示一些具体示例。你们在私有数据集上击败了所有顶级模型?至少展示几个例子吧——音频和转录文本——包括你们的模型做对而其他模型做错的案例。

  3. nr378

    它真的比微软的 MAI-Transcribe-2 更好吗?那通常被认为是目前最好的模型,但你们的基准测试里却没包含它。

    我从 Superwhisper 换到 WisprFlow,再到 Spokenly,最后到 Fieldwork,发现 WisprFlow 是这四个里准确率最低的。

同日更多故事

2026-09-17