asr-age-gap - Speech recognition accuracy by speaker age

Show HN: Whisper transcribes 70-year-olds more accurately than 20-year-olds

asr-age-gapは、音声認識が話者の年齢によって劣化するという一般的な仮定を覆す、オープンソースのベンチマークツールです。Common Voiceの2,760クリップを年齢層間で一致させて測定した結果、Whisperは70代の話者を20代よりも正確に文字起こしすることがわかりました。一方、固定サイレンス閾値によるターンテイキングでは、高齢者は2〜2.5倍頻繁に遮られることが判明。しかし、セマンティックターンモデルを使用すると、そのギャップは大幅に縮小します。このツールは、音声エージェントの設計における年齢バイアスを可視化し、より公平なシステム構築に貢献します。

音声認識は話者の年齢で劣化しない。しかし、固定サイレンス閾値によるターンテイキングは、高齢者を2〜2.5倍も遮ってしまう。

同じ日のその他の記事

2026-08-07