Gemini 3.5 Transcribe: Googles präzisestes Sprachmodell versteht sogar Selbstkorrekturen

Gemini-3.5-Transcribe

Gemini 3.5 Transcribe: Googles präzisestes Sprachmodell versteht sogar Selbstkorrekturen

Google stellt Gemini 3.5 Transcribe vor, ein neues Speech-to-Text-Modell, das rohes Audio direkt in sauberen, formatierten Text umwandelt. Es meistert Hintergrundgeräusche, Fachjargon und Selbstkorrekturen, entfernt Füllwörter und unterstützt über 85 Sprachen. Entwickler können es über die Live API für Echtzeit-Streaming oder die Interactions API für vorab aufgenommene Audiodaten nutzen. Laut Artificial Analysis erreicht das Modell eine Wortfehlerrate von nur 4,0 % (Streaming) und 2,6 % (Non-Streaming) und verbessert die Latenz um 70 % gegenüber dem Vorgänger Chirp 3. Zudem ist es in Google-Produkten wie Gboard, Antigravity und der Gemini-App integriert.

Gemini 3.5 Transcribe wandelt rohes Audio direkt in präzisen, formatierten Text um – selbst bei Hintergrundgeräuschen, komplexem Fachjargon und Selbstkorrekturen.

Mehr von diesem Tag

2026-08-27