Gemini 3.8 Flash 发布:软件与智能体新突破
Google DeepMind 于2026年9月发布了Gemini 3.8 Flash,这是Gemini 3系列的最新迭代版本。该模型在软件工程、智能体任务及复杂知识工作流方面实现了显著性能提升,同时延续了可定制的努力级别,让用户能灵活平衡质量、成本与延迟。Gemini 3.8 Flash 基于Gemini 3.7 Flash构建,支持高达100万token的上下文窗口,并输出最多64K token的文本。尽管在多语言安全评估中略有回退,但整体安全表现与前代持平,且通过了严格的儿童安全红线测试。该模型知识截止日期为2026年3月,适用于开发者、企业及通用智能体场景,是生产级部署的理想选择。
Gemini 3.8 Flash 专为成本效益扩展通用型、生产就绪的智能体而设计,适用于软件工程、智能体任务和复杂知识工作流。
HN 评论区
472- simonw
速度加上它在 HTML 和 JavaScript 方面表现出色的事实,真的让人兴奋。
这是我用 1.8 美分和 13 秒,通过提示词“用 HTML 给我做个酷东西”得到的结果:
https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f
对话记录在这里(这是聊天的一部分):https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...
- jampa
我一直在用 Gemini 3.7 开发我的个人旅行规划应用。在多个基准测试中,它在所有我尝试的项目上都排名更高:
- 现实世界知识(某处何时开门关门、地理位置、历史事实)。它在处理一组地点并规划访问顺序方面也是最好的。
- 图片排序(哪张图适合作为主图)。Gemini 能分辨出照片拍的是物体本身,还是从该处看到的风景。
- 文档解析(从 PDF 中提取相关的旅行信息)。
如果你用大模型做任何非代码相关的事情,我强烈建议不要像我之前那样,仅仅因为其他模型更流行就忽视 Gemini。
- mattlondon
目前在 https://deepswe.datacurve.ai 上排名第一,击败了 Opus 5!
https://artificialanalysis.ai/models/gemini-3-8-flash 显示其智能得分为 59,与 Opus 5 medium 相同!
哇——对于一个 Flash 模型来说,这个基准测试表现非常强劲。至于实际使用体验如何,还有待观察。
- simonw
鹈鹕(思考强度:高、中、低):https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - 高成本 8.9742 美分
这是 3.7 版本的鹈鹕用于对比:https://tools.simonwillison.net/markdown-svg-renderer.html?u... - 高成本 8.4387 美分
(我觉得在低思考强度级别上,3.8 相比 3.7 是退步了。)
- simonw
Gemini 模型最有趣的地方仍然是其多模态支持:它们接受音频和视频输入,而 OpenAI 和 Anthropic 的旗舰模型目前仍仅限于图像。
Gemini Flash 也很便宜,因此非常适合进行媒体分析,比如从图像和视频中提取结构化数据。
- brap
人们最近对 Gemini 有点视而不见,但这几次快速发布的 Flash 版本确实非常优秀。
这类快速且廉价的模型非常适合那些可验证且可以无限重试的任务(比如写代码),你基本上可以用良好的框架(harness)以极少的时间和金钱成本获得前沿水平的结果。
- mattlondon
哇,这距离 3.7 Flash 发布才过去多久——3 到 4 周?而 3.7 Flash 距离 3.6 Flash 好像也是 3 到 4 周,如果我没记错的话?
我热切地等待更多信息,但这听起来像是没有了 Demis 指手画脚的 DeepMind 终于被释放了,正在全速运转?真是令人震惊!
到了这个地步,这当然已经是个梗了,但 3.5 Pro 在哪里呢?:)
- a11r
看来定期更新并逐步改进的策略效果很好。有趣的是,Artificial Analysis 智能指数得分最大的提升出现在中等推理级别(3.7 的低、中、高分别为 51、53、57,而 3.8 分别为 52、57、59)。我认为较低推理级别的得分更能反映模型的真实能力,因为高级别推理往往专注于刷基准分(benchmaxxing)。我们在生产环境中使用最低推理级别,效果很好。
- abixb
我喜欢 Google 在这里的策略。最近这些新的 Flash 模型(Flash 3.6、3.7 以及现在的 3.8)显然是从一个更大的未发布模型(据传闻是 Gemini 3.5 Pro)蒸馏而来的。
模型发布中较少被讨论的一个方面是缓存失效(底层架构、权重或分词器的变化);我认为 Google 似乎正在从 2 月份发布的最后一个“Pro”版本(3.1)中榨取最大价值。
小模型追赶上大模型的消息太棒了。
- newppc
如果 Google 有实力且想赢,他们需要开始发布世界模型(world models)。