Gemini 3.5 Transcribe:语音转文字新标杆
Gemini-3.5-Transcribe

Google 推出了全新的 Gemini 3.5 Transcribe 模型,旨在重新定义语音转文字的精准度与智能水平。这款模型不仅能实时处理背景噪音和口语中的填充词,还能自动修正口误并格式化文本。在流式传输场景下,其词错误率低至 4.0%,非流式场景更是达到 2.6%。开发者可通过 Gemini API 将其集成到语音助手、实时字幕工具中,而普通用户也能在 Gboard 的 Rambler 功能、Google Antigravity 以及 macOS 版 Gemini 应用中体验到自然流畅的语音交互。无论是识别专业术语还是支持全球 85 种语言,Gemini 3.5 Transcribe 都展现了超越前代 Chirp 3 的卓越性能。
Gemini 3.5 Transcribe 能够将原始音频直接转化为准确、经过润色且格式规范的文本,彻底改变了传统语音识别模型在处理背景噪音和复杂术语时的困境。