超音波で舌を撮影し、声を出さずに会話を文字化するAIを開発

Silent speech with ultrasound

超音波で舌を撮影し、声を出さずに会話を文字化するAIを開発

Aleph Neuroは、超音波で舌の動きを撮影し、声を出さずに話した内容をテキストに変換するAIシステムを開発した。約50時間のデータと1か月の開発期間で、オープン語彙の音声認識で15.6%の単語誤り率(WER)を達成。これは、100万時間のデータで訓練された読唇術の12.5%に迫る性能だ。さらに、モデルは新しい話者にも一般化し、アメリカ英語のアクセントであればすぐに利用できる。舌は40の英語音素のうち約34を形成し、唇の視覚的な形(10〜14)よりもはるかに多くの情報を提供するため、超音波はサイレントスピーチ認識に特に適している。

舌は約34の異なる音素クラスを形成しますが、唇の視覚的に区別できる形はわずか10〜14程度です。

この日のほかの記事

2026-07-11