asr-age-gap - Speech recognition accuracy by speaker age

Show HN: Whisper transcribes 70-year-olds more accurately than 20-year-olds

asr-age-gap는 음성 인식이 나이에 따라 저하된다는 일반적인 가정을 뒤집는 연구 결과를 제공합니다. 2,760개의 Common Voice 클립을 분석한 결과, Whisper는 70대 화자의 음성을 20대보다 더 정확하게 전사합니다. 그러나 고정된 침묵 임계값을 사용하는 턴테이킹 시스템은 노인 화자를 2~2.5배 더 자주 끊습니다. 이 저장소는 이러한 결과를 재현하는 벤치마크를 제공하며, 의미론적 턴 모델이 이 격차를 줄일 수 있음을 보여줍니다. 음성 에이전트를 개발하거나 노인 대상 서비스를 구축하는 개발자에게 중요한 통찰을 제공합니다.

고정된 임계값을 사용하면 나이 격차는 실재하고 큽니다. 의미론적 턴 모델을 사용하면 대부분 사라집니다.

같은 날의 다른 소식

2026-08-07