13 个模型与 4 个 Agent 的 SWE 任务大比拼
13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS

SWE-rebench 最新榜单揭晓了 13 个模型和 4 个 Agent 在 Go、Java、Python、Rust 及 TypeScript 等语言上的软件工程师任务表现。Fable 5 以 64.5% 的解决率领跑,紧随其后的是 Grok 4.5 和 Opus 5,而 Junie Agent 和 Claude Code Agent 则在 Agent 类别中表现突出。榜单不仅展示了各模型在解决率、缓存率和成本上的详细数据,还揭示了不同架构在复杂编程任务中的实际效能差异。对于开发者而言,这份数据是评估 AI 编程助手真实能力的宝贵参考,帮助我们在 Go、Java 等主流语言开发中做出更明智的工具选择。
Fable 5 以 64.5% 的解决率位居榜首,展现了在软件工程师任务中的卓越表现。