Google, Gemini 3.5 Transcribe로 실시간 음성 인식의 정확도를 높이다
Gemini-3.5-Transcribe

Google이 최신 음성-텍스트 모델인 Gemini 3.5 Transcribe를 공개했다. 이 모델은 배경 소음, 전문 용어, 더듬거림을 처리하는 데 강점을 보이며, 실시간 스트리밍과 사전 녹음된 오디오 처리를 위한 두 가지 API를 제공한다. 평균 단어 오류율(WER)은 스트리밍 4.0%, 비스트리밍 2.6%로 기존 Chirp 3 대비 크게 개선됐고, 85개 이상의 언어를 지원하며 최대 3명의 화자를 식별한다. 개발자는 Google AI Studio와 Gemini Enterprise Agent Platform에서 사용할 수 있으며, Gboard, Chrome 등 Google 제품에도 통합될 예정이다.
기존의 음성 인식 모델은 배경 소음, 복잡한 전문 용어, 더듬거림 처리에 어려움을 겪지만, Gemini 3.5 Transcribe는 원시 오디오를 정확하고 깔끔하며 형식화된 텍스트로 직접 변환합니다.