asr-age-gap - Speech recognition accuracy across speaker age
Show HN: Whisper transcribes 70-year-olds more accurately than 20-year-olds
asr-age-gap es un benchmark que revela un hallazgo sorprendente: los sistemas de reconocimiento de voz como Whisper transcriben a hablantes mayores con mayor precisión que a jóvenes, desafiando las suposiciones comunes. Sin embargo, el estudio descubre que los agentes de voz que utilizan umbrales fijos de silencio interrumpen a los adultos mayores con el doble de frecuencia, afectando la fluidez de la conversación. El proyecto ofrece una herramienta reproducible para medir estos efectos y sugiere que los modelos de turno semántico pueden mitigar el problema. Ideal para desarrolladores de agentes de voz que buscan optimizar la experiencia de usuarios mayores.
La suposición de que el reconocimiento de voz falla con los hablantes mayores es incorrecta, y oculta el fallo real que está ocurriendo: los agentes de voz interrumpen a los ancianos el doble de veces debido a umbrales de silencio fijos.