DeepSeek V4 Flash在ARC-AGI评测中表现亮眼
DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731在ARC-AGI基准测试中交出了令人瞩目的成绩单。在ARC-AGI-1 Semi-Private测试中,该模型以每个任务仅0.02美元的成本实现了89.0%的得分;而在更具挑战性的ARC-AGI-2 Semi-Private测试中,其得分也达到了61.4%,成本控制在0.04美元。模型提供了Max、High、Low三种推理变体,其中Max模式在ARC-AGI-1中表现最佳,而Low模式在ARC-AGI-2中得分最低。这一结果不仅展示了DeepSeek在推理效率上的突破,也体现了其在复杂任务处理上的强大能力,为AI领域的发展提供了新的参考。
在最大努力模式下,DeepSeek V4 Flash 0731在ARC-AGI-1 Semi-Private测试中取得了89.0%的得分,每个任务成本仅为0.02美元。
HN 评论区
22- LaurensBER
自发布以来我一直在大量使用它,我能给出的最佳总结是:它足够好用,几乎可以用于所有场景,而且便宜到成本可以忽略不计。我在 Oh My Pi 上运行它,还开了第二个实例作为“顾问”,即使同时有 5-6 个活跃会话(相当于 12 个流),我每天的开销也很难超过 5 美元。
OpenCode Go 目前甚至暂时将限额翻倍,所以花 10 美元实际上能买到价值 140 美元的 Token。除非有人能用“正常”用法烧掉这么多额度,否则我很难被震惊,哪怕是在多会话运行的情况下。
我虽然订阅了 Claude Max,但几乎没怎么用过。虽然那些模型更强,但不得不时刻担心限额和使用量,感觉像是退步了。
这种成本下的智能之美(即使不是 SOTA)在于它开启了一大批新的应用场景。CI 测试失败?让机器人自动提出修复方案,因为成本低廉,即使有问题也可以直接丢弃。测试覆盖率太低?在 CI 中为每个 Pull Request 自动生成测试!监控服务器日志、持续安全审计以及调查每一个捕获的异常,现在都变得可行。
我甚至在想,能否让它自动过滤并重新排序我的社交媒体信息流,这样我就能掌控算法,而不是被算法掌控。
也许其他预算充足的人早就在做上述所有事情了,但对我们来说,这真是一个令人兴奋的发布!
- ak_t
请注意,这是 7 月 31 日发布的 DSv4 flash 版本,而不是几个月前推出的“预览版”。
我本地运行这个模型已经一周了,之前也用过预览版。这个更新版感觉像是提升了一个档次。它在调试以及分析我上传的文档/数据方面非常强大。
在我看来,杀手级功能是速度。在 2x RTX Pro 6000 Blackwell 上,它的预填充速度约为 8k tok/s,单流生成速度约为 250 tok/s。在 vLLM 上,我看到 ~64 个并发流时能达到 1000 tok/s。
这个速度足够快,让你可以在等待时不用切换标签页就能交互式地与其聊天。而且这是一个 ~300B(13B 激活参数,因此速度很快)的模型,所以回复质量也非常好。现在对我来说,更方便的做法是将 95% 以上的日常使用都导向本地模型,只在使用 Claude Fable 处理特别大的编码任务时才调用它。
在这个模型发布之前,我还在考虑是否要再花更多钱升级硬件,以便以合理的速度运行 GLM5.2(~750B),但现在我不再觉得有必要了。这个模型足够聪明,而且我认为本地模型只会从这里开始变得更好。
- NoboruWataya
前几天我的 Claude 账号被封了。我能想到的唯一可能原因是,我试图在 JetBrains IDE 的 AI 助手中进行认证,没多想就输入了普通订阅账号的详细信息,而不是 API 账号。一旦意识到需要 API 账号而不是订阅账号,我就直接关闭了那个标签页。尽管如此,大约 20 分钟后,我收到一封邮件,说我的账号因违反使用政策被封禁,且我的申诉被拒绝了。
我最初的想法是注册 ChatGPT,但我手头有 20 美元的 OpenRouter 余额,所以过去几天我一直在尝试用 Pi 运行 DeepSeek V4 Pro,不得不说,它完全满足我的使用需求。即使我是为 API 使用付费(而不是 Claude 的补贴订阅),加上 OpenRouter 要抽成,我最终的总花费可能还是会显著降低。而且我真的很喜欢这种灵活性,可以随意使用任何我喜欢的极简开源框架(也能轻松切换提供商)。
(我的需求可能没有其他人那么高——我主要用它来辅助一些业余编程项目,而且我倾向于问它如何解决问题,而不是直接让它去写代码。)
- nylonstrung
看到大家每个月花 200 美元,感觉有点疯狂。
我每个月花 20 英镑用 Gemini,再花 20 英镑用 Claude,用来跑一堆个人项目。
是的,我有时候得等一等,但这可能也是件好事。
- modeless
与上一个 DeepSeek V4 Flash 版本相比,我遇到了无数问题:它陷入无限循环,自言自语却不执行工具调用,浪费了大量 Token。
这是在 Pi agent 上运行的,我的提示词或使用场景都极其简单,没有任何花哨之处。还有其他人遇到这种情况吗?
我还发现它会随机从谈论 Rust 跳转到谈论电椅,或者讨论 D&D 规则的争议(这两者都无关紧要,而且我也从未讨论过),而且即使在后续提示中直接指出并引用了这些错误,它对此也完全视而不见。
尽管如此,它仍然物有所值,但就我的经验而言,其代理性能确实有所下降。
- 542458
DeepSeek 已宣布即将“大幅涨价”,所以这条信息可能很快就要往右移了。https://api-docs.deepseek.com/quick_start/pricing/
- mosura
Kimi K3 在一个月前还是个有趣的模型,现在我们看到的却是同样的性能,价格却只有 1/20。这进步速度真是疯狂。
- andai
我强烈建议大家在编程任务上试试这个。
它很强(虽然不如 Fable 强),但比 Opus 拥有更好的“人设”,且盲点完全不同。如果你在这两个模型之间切换,你会发现它们都能在错误失控前互相发现对方的失误。
总体而言,我现在实际上更倾向于在编程时使用 DeepSeek,因为它说话的方式。