DeepSeek V4.1 Flash:4.65美元破解11个目标

DeepSeek v4.1 Flash Is Now Our Best Hacking Model

DeepSeek V4.1 Flash:4.65美元破解11个目标

DeepSeek V4.1 Flash在我们的AI黑客基准测试中表现惊人,仅花费4.65美元就在11个易受攻击的目标上成功获取代码执行权限,而所有4个已修复的目标均保持安全。该模型在隔离环境中运行Grafana、Jenkins和Nextcloud,通过读取源代码、对比漏洞版本、启动服务并发送请求,展现了极强的攻击能力。其中,Grafana挑战在90秒内被攻破,Jenkins挑战展示了模型对安全边界的深刻理解,Nextcloud则验证了其读取源文件的能力。此次测试不仅揭示了DeepSeek的强大实力,也促使我们优化基准测试的评分机制,确保未来评估更加严格。

DeepSeek展示了强大的黑客能力,而审查则揭示了基准测试需要更严格检查的地方。
  1. gertlabs

    我们用评估系统跑了一遍 v4.1 Flash,发现它比 V4 Flash 更聪明、速度更快,价格也随之上涨。几点观察:

    - 因为它是一个重度推理模型,在帕累托前沿上接近 Gemini 3.7 Flash(实际上并没有价格暗示的那么便宜)。

    - 在智能体编程方面,它比预期更接近顶级开源权重模型(GLM 5.3 和 Kimi K3),且成本更低。

    - 中国模型在智能体框架中一直是很强的迭代者。这个模型也不例外,给定智能体框架时的平均百分位比一次性解决方案高出约 20%。不过,正是这种一次性流体智力让模型显得“聪明”,通常意味着解决问题所需的尝试次数和 token 更少,而美国的前沿模型在这方面仍然遥遥领先。

    新架构很有意思。它的定价介于旧版 Flash 和 Pro 系列之间,暗示他们可能正在放弃那些超级便宜的 Flash 模型(由于重度推理,速度其实不快)和 Pro 模型(表现不佳,且尽管尺寸和成本更高,却并未 consistently 优于 Flash 模型),转而推出一个强有力的中间产品,与 Gemini Flash 系列竞争。

    数据见 https://gertlabs.com/rankings

  2. habosa

    DeepSeek 模型的基准测试表现如此出色,定价令人惊叹,那边的团队也被广泛认为非常 impressive。

    但我就是觉得它们没那么好用?用 GLM 模型(至少从 5.2 开始)我成功率高得多。也许是我用法不对?DS 模型似乎容易陷入循环或胡言乱语。GLM 用起来感觉像预算版的 Claude。

  3. TuxSH

    我觉得这个——或者说是标题——有点令人惊讶。

    我在完全标注的 Nintendo 3DS 内核反编译代码上对 GLM 5.3 和 DSv4.1-F 进行了基准测试,我对这段代码有相当好的心理模型,任务是让它们找出漏洞和其他 bug(使用 Max 模式及子智能体)。GLM 5.3 在 30 分钟内以 22 美元的成本找到了几乎所有漏洞,而 DS 在 40 分钟内仅以 2 美元的成本找到了一个漏洞。

    也许 DS 在目标存在容易快速发现的“低垂果实”时表现更好?

  4. jrflo

    声称 DeepSeek 是“最好的黑客模型”,却完全没有提供与其他模型的对比……这说法似乎相当大胆。

  5. pelzatessa

    我该怎么让 DeepSeek“黑”我的源代码?是直接在目录里启动我的编程智能体并命令它“查找漏洞”,还是有更复杂的软件来做这件事?

同日更多故事

2026-09-16