Gemini 3.8 Live:语音交互的新标杆
Gemini 3.8 Live and 3.8 Live Extended Thinking

Google 正式推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,这是目前最先进的实时对话模型。前者主打规模化与成本效益,后者专为高复杂度任务设计,具备强大的多步推理能力。在 Artificial Analysis 的语音质量指数中,Extended Thinking 版本荣登榜首,并在多项代理任务基准测试中表现领先。这两个模型支持近实时视觉输入处理,能自动切换 97 种语言,并能在后台执行工具调用时保持对话流畅。通过 Gemini Live API,开发者可轻松构建高性能语音界面,而 SynthID 水印技术则确保了生成内容的透明性与安全性。
对于需要深度推理的任务,3.8 Live Extended Thinking 能够边思考边说话,在保持对话流畅的同时,利用“让我查一下……”这样的早期语音提示自然回应,并实时播报多步骤后台任务的进度。
HN 评论区
189- jeanbza
我的母语是南非荷兰语,这是一种比较小众的语言,在南非以外很难找到老师或对话伙伴。(我现在住在美国)
我一直用 Gemini 进行南非荷兰语的实时对话,并在独自开车兜风时做即兴的语法练习。它在说这门语言方面表现惊人——真的,我家人听到时都震惊了。
这大概是我使用任何 LLM 或 AI 时获得的最大乐趣。能再次经常说母语,感觉真的太好了。=)
所以,我对这次发布和实时对话功能的改进感到兴奋。我也希望其他前沿实验室也能跟进支持这样的小众语言,让我有更多选择。
- Zsfe510asG
Gemini 其实被低估了,因为它生成的散文是唯一稍微有点可读性的。
- Havoc
刚试了一下,这次发布非常扎实。
对浓重口音的适应能力很强,声音听起来很悦耳,延迟似乎也很低。
哦,而且我居然能在 Workspace 账号上使用它——对于最近发布的许多版本来说,这类账号一直处于尴尬的中间地带:对个人版来说不够“个人”,对企业版来说又不够“企业级”。
干得漂亮 G,肯定会用这个。
- rdtsc
我想知道我们何时(或能否)看到 Gemini 超越 Fable 和 Astra。去年我会自信地押注 Google 会超越其他公司,仅仅因为他们拥有数据、硬件(TPU)和庞大的广告收入管道,然而他们仍然落后。Google 内部有匿名人士想透露一下 Gemini 4 什么时候发布吗?
- bengkoang
从去年 11 月开始,我就一直在使用 Gemini(API 和 Pro 版)。在创意写作方面,与其他 LLM 相比,它在捕捉本地细微差别方面是最好的,甚至能用我的语言讲笑话。但仅限于此,我无法依赖它处理其他工作,幻觉太频繁了,深度研究功能完全不可靠。我进行过太多讨论,发现它能一致地抓住主要概念,但支撑性概念却完全是幻觉且前后不一致。我在 Pro 和 Flash 之间都测试过。这种情况在开源权重模型上并不常见。
- doodlesdev
就我的个人体验而言,Gemini 的 Live Mode 已经比 GPT Voice 好多了,尽管它以前要笨得多。真的感觉像是在和一个真人对话。ChatGPT 不管我说什么都只会哼哼唧唧,而且有些奇怪的声音。
很期待试试这个!不过 Google 还没向 Google AI Plus 用户发布 Gemini 3.8,真是有点遗憾。
- deviation
演示视频里展示你们“最先进”的 AI 模型竟然输给了国际象棋中最常见的将死模式,这给人的印象可不太好。
- sahaskatta
我们公司的 Google Workspace Business 账号在 Gemini App 里只提供 3.6 flash 和 thinking 模式。还有其他人看到 3.7 或 3.8 已经推送了吗?