DeepSeek-V4-Flash 公测:Agent 能力全面爆发
DeepSeek-V4-Flash Update

DeepSeek-V4-Flash API 正式进入公开测试阶段,其 Agent 能力在多项基准测试中大幅超越 V4-Pro-Preview。在 Terminal Bench 2.1 中得分高达 82.7,Cybergym 达到 76.7,展现出强大的工具调用与自动化潜力。该模型原生支持 Responses API 格式,专为 Codex 深度优化,且仅通过重训练即可在保持架构不变的前提下实现性能跃升。此次更新仅针对 DeepSeek-V4-Flash API,DeepSeek-V4-Pro 及 APP/WEB 模型暂未调整,正式版即将发布。
DeepSeek-V4-Flash 的官方版本已正式开启公开测试,其 Agent 能力显著提升,各项基准测试结果远超 V4-Pro-Preview。
HN 评论区
342- NitpickLawyer
在我看来,这比 k3 更令人兴奋。Dsv4 模型的部署成本极低。随着其能力变得“足够好”以应对越来越多的任务,提升其能力将产生大量下游效应。
DS 长期以来以极低的价格提供 pro 版本,并且与 opencode 及其他提供商有集成,因此他们很可能从真实开发者执行真实任务的过程中收集了大量数据(在 openrouter 上它们被标记为此类)。现在,他们可以利用这些真实场景进一步后训练模型,从而进一步提升其性能。
迫不及待想看看将 k3 蒸馏到 dsv4 是否能带来额外的改进。无论如何,快速且廉价的模型不断变强对社区来说是件好事。尤其是这些模型不会因提供商的 whim(一时兴起)而“消失”。它们获得的任何能力,未来都可以“永久”使用。而且,至少 flash 可以在本地运行,硬件成本不到 1 万美元,而 glm/k3 的大模型在这方面几乎不可能或不可行。
- f311a
我 90% 的任务都在用 flash 模型。它比 pro 版更好(原因不明),而且非常便宜、快速。
我尽量将改动控制在 1000 行以内,并自己把控架构决策,与前沿模型相比几乎感觉不到差异。剩下的 10% 用于发现 bug、安全问题以及探索更好的架构,flash 在这方面也能做得相当不错,我只是交叉验证一下。
更快的迭代速度对我来说好得多,我讨厌为了小改动等待 5-10 分钟。我尝试过 Kimi 和 GLM 的最新版本,但它们无故进行大量思考,因此速度很慢。我还经常向它输入大量数据,完全不用担心触及限制:依赖项(用于查找其中的瓶颈)、日志、性能转储等等。
此外,它永远不会抱怨安全限制,我一直在用它逆向工程二进制文件。
- lionkor
我用 deepseek 处理很多日常个人 agent 需求,我就直接把数据放这里,让它自己说话,过去 30 天:
- 成本:4.55 美元
- API 请求:3,467 次
- Token:323,183,886
作为一名带领小团队的工程师,我对质量有非常高的标准,这些标准也延伸到我使用 deepseek 的个人项目中。在代码编写或审查任务上,它完全没让我失望。
至于其他一切,用别的模型吧。
- kmarc
基本上我现在在 pi 里把所有东西都跑在 flash 上了。配合正确的 MCP 服务器、上下文缩减工具和技能,它能完成我扔给它的任何任务。有些会话长达 30 多轮,但速度快且便宜;所有这些在一个小时内完成,成本约 0.5 美元。
(不过说实话,在我的多子 agent 工作流中,我确实用其他更昂贵的模型来做规划、审查和 oracle 工作)
我已经好几周没用我们那个慢吞吞的 opus 订阅了。
(另外还搭建了一个自托管的 OpenWebUi 聊天界面,可以从手机访问,带有一些 mcp 和技能。完全替代了 perplexity。每月托管和订阅成本约 18 美元)
- wkcheng
如果基准测试是真实的且反映了实际使用情况,那这就是一个疯狂的模型。这个 300B 模型的表现优于之前的 DS4 Pro 预览版(1.8T 参数),看起来还超过了 GPT 5.6 Luna。而且即使降价后,它仍然比 Luna 便宜。
太疯狂了。
- dannyw
我用 DeepSeek Pro 有一段时间了,Flash 只用于某些不需要大模型、只需要 LLM 速度的笨任务。
我发现最新的 OpenAI 和 Anthropic 模型在处理需要大量决策的大任务时好得多,但我并不喜欢那样,因为我会跟不上进度。
清楚每个 prompt 想要什么,让 DeepSeek Pro 成为我最喜欢的 LLM。它让我能以极低的价格相对快速地工作。
- ggcr
他们为什么不叫它 v4.1-Flash 以便更好地区分呢?
- heyalexej
各位,启动你们的 DGX Sparks 吧