Gemini 3.5 Transcribe、ノイズ混じりの音声を高精度で文字起こしする新モデルを公開

Gemini-3.5-Transcribe

Gemini 3.5 Transcribe、ノイズ混じりの音声を高精度で文字起こしする新モデルを公開

Google が発表した Gemini 3.5 Transcribe は、従来の音声認識モデルと異なり、背景ノイズや専門用語、言い間違いなどを処理し、生の音声を正確で整ったテキストに直接変換します。ストリーミング API と録音済み音声用 API の2種類を提供し、サブ秒レベルのレイテンシー、85以上の言語対応、最大3話者の識別、カスタム語彙の認識などの機能を備えます。Word Error Rate はストリーミングで4.0%、非ストリーミングで2.6%を達成し、前モデル Chirp 3 と比較して最終文字起こしまでの時間が70%改善しました。

従来の音声認識モデルが背景ノイズ、複雑な専門用語、言い間違いの処理に苦労するのに対し、Gemini 3.5 Transcribe は生の音声を直接、正確で洗練された整形済みテキストに変換します。

この日のほかの記事

2026-08-27