Stille Sprache per Ultraschall: KI liest Wörter von der Zunge
Silent speech with ultrasound

Aleph Neuro hat ein System entwickelt, das stille Sprache aus Ultraschallvideos der Zunge entschlüsselt. Mit nur 50 Stunden Trainingsdaten erreicht es eine Wortfehlerrate von 15,6 % bei offenem Vokabular – und funktioniert auch bei neuen Sprechern mit amerikanischem Akzent. Das Modell nutzt einen Video-Encoder, der die Zungenbewegungen in den Embedding-Raum von Whisper überführt. Die Technik könnte stille Sprachinteraktion mit Computern ermöglichen, ohne dass andere mithören.
Die Fehler waren ermutigender als viele der richtigen Antworten, die wir zuvor gesehen hatten – sie deuteten darauf hin, dass das Modell begann, aus dem Signal selbst zu generalisieren und phonetische Strukturen zu lernen, statt nur wahrscheinliche Wortfolgen vorherzusagen.