Gemini 3.5 Transcribe: распознавание речи с точностью 4.0% WER

Gemini-3.5-Transcribe

Gemini 3.5 Transcribe: распознавание речи с точностью 4.0% WER

Google представила Gemini 3.5 Transcribe — новую модель распознавания речи, которая преобразует сырой звук в чистый, отформатированный текст, обрабатывая шум, жаргон и слова-паразиты. Модель доступна через Live API для потоковой передачи с субсекундной задержкой и через Interactions API для предзаписанного аудио с определением говорящих и таймстампами. По данным Artificial Analysis, средний WER составляет 4.0% для потокового режима и 2.6% для не потокового, а время до финальной транскрипции улучшено на 70% по сравнению с Chirp 3. Поддерживается более 85 языков, пользовательский словарь и вызов функций. Разработчики могут начать использовать модель в Google AI Studio и Gemini Enterprise Agent Platform.

В отличие от обычных систем распознавания речи, которые с трудом справляются с фоновым шумом, сложным жаргоном и речевыми сбоями, Gemini 3.5 Transcribe преобразует необработанный звук непосредственно в точный, отшлифованный, отформатированный текст.

Ещё за этот день

2026-08-27