Wispr FlowのCanto、実世界のディクテーションで最高精度を達成

Canto: A speech model built for the real world

Wispr FlowのCanto、実世界のディクテーションで最高精度を達成

Wispr Advanced Interfaces Labが発表した音声認識モデルCantoは、2,300人以上の実際のディクテーション10時間の評価で、Google、OpenAI、AssemblyAI、Deepgramのモデルを抑えて最低単語誤り率を記録した。周囲の話し声や音楽、交通音、ささやき声などの困難な条件でもリアルタイムモデル中トップ。教師あり微調整とGRPOによる強化学習を組み合わせ、ユーザーの修正から学ぶ仕組みも導入している。

「私たちは、音声のロールアウトを大規模に生成・評価できるインフラを構築し、特定の振る舞いや失敗モードに焦点を当てたトレーニング環境を構築できるようにしました。」
  1. ks2048

    彼らはいくつかの例を示す必要がある。自分のプライベートデータセットで全てのトップモデルを打ち負かした?少なくともいくつかの例 - 音声とトランスクリプト - を、あなたのモデルが正しく、他が間違った例から示してほしい。

  2. Redster

    ローンチおめでとう!この分野でさらなる進歩があるのは嬉しい。

    Transformerモデルに内在するハルシネーションのため、私は低WERのトランスデューサベースのモデルを探していた。parakeet-unified-en-0.6bには非常に満足している。そのWERはCantoほど低くはないが、私の知る限り、非Transformerベースのモデルで得られる最低レベル(約5-6.5%)だ。

    その出力にはとても満足している。

    これを求めていたわけではないが、私の小さなポテトPC(i5第8世代プロセッサ)でも動作し、リアルタイムの9-10倍の速さで文字起こしできるほど軽量だ。

    ちょっとしたラッパーをvibe-codingして、音声フォルダやポッドキャストのRSSフィード、さらにはYTのプレイリストやチャンネルで使っているが、新しいお気に入りツールの一つになった。

  3. nr378

    実際にMicrosoftのMAI-Transcribe-2より優れているのか?一般的に現在最高のモデルのようだが、彼らのベンチマークには含まれていない。

    私はSuperwhisper->WisprFlow->Spokenly->Fieldworkと乗り換えてきて、WisprFlowが4つの中で最も精度が低いと感じた。

この日のほかの記事

2026-09-17