13 个模型与 4 个 Agent 的 SWE 任务大比拼
13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS

SWE-rebench 最新榜单揭晓了 13 个模型和 4 个 Agent 在 Go、Java、Python、Rust 及 TypeScript 等语言上的软件工程师任务表现。Fable 5 以 64.5% 的解决率领跑,紧随其后的是 Grok 4.5 和 Opus 5,而 Junie Agent 和 Claude Code Agent 则在 Agent 类别中表现突出。榜单不仅展示了各模型在解决率、缓存率和成本上的详细数据,还揭示了不同架构在复杂编程任务中的实际效能差异。对于开发者而言,这份数据是评估 AI 编程助手真实能力的宝贵参考,帮助我们在 Go、Java 等主流语言开发中做出更明智的工具选择。
Fable 5 以 64.5% 的解决率位居榜首,展现了在软件工程师任务中的卓越表现。
HN 评论区
15- sathish316
Fable 5 排第一,Opus 5 排第三,而 Claude code 却排在第七,这到底是什么意思?第七名的 Claude 用的是哪个模型、哪种 effort 策略?跟第一和第三相比有什么区别?
- spullara
它们针对不同语言解决的是完全不同的问题。我原本希望这是一个基准测试,能看看哪种语言配合哪种模型效率更高。
- dia80
为什么要拿 Fable 的高 effort 模式去跟 Sol 的中 effort 模式比?尤其是当 Sol 在这些 effort 水平下,测试成本比 Fable 低了 4 到 5 倍的时候。