Ultrasonido de la lengua logra un 15,6% de error en habla silenciosa
Silent speech with ultrasound

Aleph Neuro ha entrenado un modelo que predice el habla a partir de ecografías de la lengua mientras la persona permanece en silencio. Con solo 50 horas de datos y un mes de trabajo, el sistema alcanza una tasa de error por palabra del 15,6% en vocabulario abierto, acercándose a la lectura de labios (12,5% con un millón de horas) y superando con creces la línea base de ultrasonido existente (83,8%). El modelo generaliza a nuevas personas con acento americano, y la tasa de error sigue bajando a medida que crece el conjunto de datos.
La lengua forma alrededor de 34 clases de fonemas distintas de los 40 fonemas del inglés, en comparación con solo unas 10 a 14 formas de labios visualmente distinguibles.