Whistleが16.9MBで音声認識を実現、Whisperの8分の1のサイズで精度は上回る
Whistle: Speech to Text in 16.9 MB
Cactus Computeが16.9MBの音声認識モデルWhistleを公開。Needleと同じC++エンジンで動作し、7言語に対応、最初のトークンまで11ms、デコードは毎秒1,319トークン。LibriSpeechやFLEURSなどでWhisper baseを上回り、単語タイムスタンプや音声埋め込みも提供。pip install cactus-needleで利用可能。
Whistle is ahead on LibriSpeech test-clean and test-other, on SPGISpeech, on Earnings-22 and on the FLEURS average.
HNでの議論
112- skolos
ここにこれがあるのは興味深い。私はWhistle(と他にもいろいろ)を使って自分のEcho Showを乗っ取った。今ではAmazonには一切ダイヤルせず、自前のCPUで全てをローカル処理し、ホームオートメーションのために自分のHome Assistantに接続している。最初のセットアップではRTX 5080上でqwen asr(1.7bモデル)を動かしていた。それと比べるとWhistleは本当にひどかった(170メッセージ中、qwenは168を正しく認識、Whistleは70)。しかし、Whistleをjevのように動作するよう調整した。つまり自由形式の文字起こしではなく、選択したテンプレートのセットのみを認識するようにした(Whistleの最終状態をテンプレート内の確率に変換するために、10,000の生成発話で小さなネットワークを訓練した)。精度は164/170まで上がり、ほぼqwenに匹敵する。ちなみに、私はかなり強いアクセントで話している。
- jakobov
ZWhisprこそが本命だ
- INTPenis
音声認識の課題はバイナリのサイズではなかったと思う。私の経験では、脳卒中後に口が垂れ下がった84歳のクロアチア人の父が自伝を書こうとしているのを理解することが課題だ。
先週彼のためにWindowsの音声認識をセットアップしたが、10分で1ページ全体を書けるのを見るのは素晴らしい。キーボードを使えば何日もかかるだろう。
しかし、彼が口で出すあらゆる音もページに載ってしまう。
- albert_e
このデモがやっていないのは、話して録音している最中(停止を押す前)に文字起こしテキストをストリーミング出力することだ。これはほとんどの汎用ライブSTTアプリにとって不可欠な機能だと私は思う。
- zimpenfish
適当なテレビドラマのエピソードで試してみたが、時々「Thank you.」とだけデフォルトで出力して詰まってしまうようだ。ある時は60秒間の台詞に対してそれを出力していた(いや、そのエピソードに誰かが60秒間「Thank you.」を繰り返す場面はない)。文字起こし中に何度か起こる。
- wkcheng
これはParakeetと比べてどうなのか? 私はMシリーズのMacBookで自分のプロジェクトにローカルで使っているが、素晴らしく動いている。自分のユースケース(会議の文字起こし、デモ動画の音声文字起こしなど)には十分速くて正確だ。
これは間違いなく軽くて速そうだ。精度はどう比較されるのか?
- flowerlad
Appleはこれを早急にiOSに組み込む必要がある。技術用語を使うとき、これはiOSの音声認識よりずっとよく動く。iOSの最もイライラする部分の一つはiMessageでの音声テキスト変換だ。私にとって電話でこれ以上重要な機能はない。
この例を試してほしい:私のウェブサイトはASP.NET技術を使っていて、.NET 10.0を使っている。Whistleでは完璧に動くが、iOSでは動かない。
- andy_ppp
わあ、確かに英語ではこれは信じられないほど正確だ。壊そうとしてみたが、完璧に理解してくれた!
少し話が逸れるのは分かっているが、使う人全員をイライラさせないスペルチェッカーを訓練するのはもう簡単なはずだ(Apple、君のことだよ)!