Opus 5在SlopCodeBench实测:正确率换代码量

Benchmarking Opus 5 on SlopCodeBench

Opus 5在SlopCodeBench实测:正确率换代码量

我亲自跑了三个Claude模型在SlopCodeBench上的表现。这个新基准测试模拟了真实开发中需求逐步披露的场景,不再一次性给出全部问题。结果显示,Opus 5虽然以24%的严格通过率领先,但代价是代码量激增,生成的函数数量是Opus 4.8的五倍。所有模型最终都未能无缺陷地完成挑战,这揭示了一个残酷现实:目前的AI模型在真实软件工程场景中,仍无法实现完全无人值守的自动化开发。

每一美元都买到了正确性,但没人买得足够多。

同日更多故事

2026-07-28