Gemini 3.5 Transcribe: el nuevo modelo de voz de Google reduce el error a la mitad
Gemini-3.5-Transcribe

Google presenta Gemini 3.5 Transcribe, su modelo de transcripción más preciso, que convierte audio en texto formateado y limpio en más de 85 idiomas. Con una tasa de error de palabra (WER) del 4.0% en streaming y 2.6% en no streaming, supera a su predecesor Chirp 3 y mejora un 70% el tiempo de transcripción. Incluye reconocimiento de vocabulario personalizado, identificación de hasta tres hablantes y llamadas a funciones para delegar tareas a otros modelos de Gemini. Disponible en la API de Gemini en Google AI Studio y en la plataforma empresarial, ya se integra en productos como Gboard, Antigravity y la app de Gemini en macOS.
Gemini 3.5 Transcribe convierte audio en texto preciso, pulido y formateado, manejando correcciones espontáneas y eliminando muletillas.