Wispr FlowのCanto、実世界のディクテーションで最高精度を達成
Canto: A speech model built for the real world

Wispr Advanced Interfaces Labが発表した音声認識モデルCantoは、2,300人以上の実際のディクテーション10時間の評価で、Google、OpenAI、AssemblyAI、Deepgramのモデルを抑えて最低単語誤り率を記録した。周囲の話し声や音楽、交通音、ささやき声などの困難な条件でもリアルタイムモデル中トップ。教師あり微調整とGRPOによる強化学習を組み合わせ、ユーザーの修正から学ぶ仕組みも導入している。
「私たちは、音声のロールアウトを大規模に生成・評価できるインフラを構築し、特定の振る舞いや失敗モードに焦点を当てたトレーニング環境を構築できるようにしました。」
HNでの議論
14- ks2048
彼らはいくつかの例を示す必要がある。自分のプライベートデータセットで全てのトップモデルを打ち負かした?少なくともいくつかの例 - 音声とトランスクリプト - を、あなたのモデルが正しく、他が間違った例から示してほしい。
- Redster
ローンチおめでとう!この分野でさらなる進歩があるのは嬉しい。
Transformerモデルに内在するハルシネーションのため、私は低WERのトランスデューサベースのモデルを探していた。parakeet-unified-en-0.6bには非常に満足している。そのWERはCantoほど低くはないが、私の知る限り、非Transformerベースのモデルで得られる最低レベル(約5-6.5%)だ。
その出力にはとても満足している。
これを求めていたわけではないが、私の小さなポテトPC(i5第8世代プロセッサ)でも動作し、リアルタイムの9-10倍の速さで文字起こしできるほど軽量だ。
ちょっとしたラッパーをvibe-codingして、音声フォルダやポッドキャストのRSSフィード、さらにはYTのプレイリストやチャンネルで使っているが、新しいお気に入りツールの一つになった。
- nr378
実際にMicrosoftのMAI-Transcribe-2より優れているのか?一般的に現在最高のモデルのようだが、彼らのベンチマークには含まれていない。
私はSuperwhisper->WisprFlow->Spokenly->Fieldworkと乗り換えてきて、WisprFlowが4つの中で最も精度が低いと感じた。