Real-SWE:AI 在真实企业代码中的极限测试
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
Specific Labs 发布了 Real-SWE 基准测试,专门评估前沿 AI 模型在私有、真实企业代码库中的表现。与以往使用合成任务不同,Real-SWE 直接采用来自真实公司的生产级代码,涉及税务计算、客户迁移等具有实际商业后果的复杂场景。测试结果显示,即便是 Fable 5.1、GPT-6 Astra 等顶尖模型,在理解企业特定编码规范和跨系统逻辑时仍面临巨大挑战,部分任务解决率低至 0%。这一基准揭示了当前 AI 代理距离真正替代软件工程师仍有显著差距,尤其是在处理未公开的训练数据和复杂的业务逻辑时。
这些任务具有经济可行性,每一项都直接关联到实际支出,并由领取薪水的工程师负责完成。
HN 评论区
147- springtimesun
我用自己的代码库做过完全一样的测试。搭建过程没那么复杂:把 git 历史切到变更前的状态,给 Agent 一个沙箱环境,包含该 commit 所需的一切,并稍微修改规则,防止它们越界搜索。然后给它们同样的提示词(通常是触发这项工作的 ticket),再根据被合并的 PR 进行评分。
最耗时的其实是找案例。在我真实的开发流程中,很少是 ticket -> PR -> merge 这样直线进行的,中间往往反复拉锯很多次。所以,尽管宣称的目标是摆脱一次性任务(one shots),但你基本得搭建这样的环境,否则就得针对其他特定结果进行测试(比如:Agent 意识到 x 时停止并提出了问题)。
这确实需要时间,但我非常推荐这样做。现在我可以把新的开源模型推过这套测试流程,几天内就能看出它们和过去模型的对比(我在本地运行,速度很慢)。这让我的判断从“凭感觉觉得 x 模型擅长 y、不擅长 z
- glub
变成了更靠谱的启发式规则(这些测试仍在 temp 1 下运行,在我看来,用启发式规则来思考结果才是正解)。这让评估扎根于你实际的代码和问题空间。
我测试后的结论是:在 Rails 或前端代码库中,我测试的大多数模型都相当胜任,只要有人类参与循环(human in the loop),它们就能达成生成可合并 PR 的目标。它们不如 Claude 好用,而且我通过订阅享受了补贴费率,所以 Claude 依然是我的首选。但它们非常值得作为审查层(review layer)叠加使用……
- prometheus1992
我很惊讶 Sol 和 Astra 在“未经验证的假设”(Unverified assumption)指标上领先,而 Fable 在这方面反而更好。
我主要用 Fable 作为主模型,让 Sol 作为顾问观察每一步。Fable 喜欢抛出一些它根本没检查、纯属错误的假设,而 Sol 总是去实际验证这些假设,然后提醒 Fable 它在无端臆测。
我试过把这对组合反过来,让 Fable 当顾问。结果它只会坐在那里说“听起来不错”。
- taintech
这是否意味着他们最终把这些私有代码库分享给了 OAI、Anthropic 等公司?另外,这个 ~30% 的数字和我的经验吻合。我曾以为是我疯了,对模型期望太高,但它们确实还是很差,包括 Astra。今天早上它在修复一个问题时搞砸了一件相当琐碎的事,让我非常震惊。还有,基准测试(benchmarks)如今意义已经不大了。
- lmeyerov
我认为目前 AI 模型相比 2025 年 OpenRCA 研究论文中 11.25% 的成功率已经有了惊人的提升。
关键问题是:它们的性能是否已经达到顶峰?是否还有下一次飞跃?
- jstummbillig
我的直觉是,许多更好、更大的“私有”代码库,至少在 Claude Code 和 Codex 方面……实际上现在已经不再私有了。
运行 botsbench.com 的一个教训(虽然领域略有不同)是:每次都要检测模型污染(model contamination)。
- skhameneh
我正试图评估我对看到 GPT-5.6 Sol 排在列表末尾这一结果的反应是否合理,还是主要出于情绪化,但我发现我根本无法判断。
- chandureddyvari
这里有些内容看起来合理,但有些完全说不通,而且缺少关键细节(比如推理层级和使用了什么 harness)。
例如,我发现 Kimi K3 使用的 token 比其他一些模型多,导致其成本纯粹因为 token 量而翻了一倍。这个经验与 ArtificialAnalysis 的基准测试相符,但与这里的测试结果不符。
这里还有不少其他对比与我的经验或其他基准测试不匹配。根据多方说法,这份结果是个离群值(outlier)。
我可以把差异归因于使用的 harness 或推理层级等因素,但这些细节都没有公布。
虽然这看起来挺有趣,但我无法认真对待它。
更正:harness 是作为一列列出的,我漏看了。但我其他的担忧和问题依然存在,不清楚为什么他们的某些结果会是离群值,与我的经验、ArtificialAnalysis 的基准测试,或评论区其他人的经验都不符。