免费模型 big-pickle 在 SWE Atlas 拿下 50.8%
Big Pickle on SWE Atlas – Codebase QnA
OpenCode Zen 的免费隐身模型 big-pickle 在 Scale AI 的 SWE Atlas Codebase QnA 基准测试中取得了 50.8% 的任务解决率。这一成绩在 Mini-SWE-Agent 框架下超越了官方榜单上的所有其他模型,仅落后于原生运行在 Claude Code 框架下的两个 Claude 模型。测试覆盖了 TypeScript、Python、Go 和 C 等多种语言,并在代码入职、系统架构等类别中表现稳健。尽管受限于单次尝试和降低的算力资源,该结果仍证明了免费模型在复杂代码问答任务上的强大潜力,且所有验证日志和配置均已开源供社区复现。
在 Mini-SWE-Agent 脚手架这一公平对比类别中,本次运行超越了官方榜单上的每一个条目,同时也击败了所有基于 Codex 脚手架的 GPT 模型。