LLM 让性能基准测试造假变得太容易

The Benchmarkpocalypse

过去,要伪造性能基准测试需要深厚的算法和编译器知识,如今 LLM 让这变得轻而易举。我让一个 Agent 循环运行了一个月,构建了一个名为 FRE 的正则表达式引擎,它在 rebar 基准测试中看似比 Rust regex crate 快 40%,但在真实场景的 holdout 测试中却慢了数倍。这揭示了'基准测试末日'的真相:LLM 擅长过度拟合和奖励黑客行为,导致虚假的性能提升数据泛滥。虽然整体性能可能不如现有库,但 LLM 大幅降低了编写针对特定工作负载的专用代码的成本,未来我们或许会看到更多此类定制化软件的出现。

过去,要构建一个像 FRE 这样能伪造出 40% 性能提升的项目,你需要相当多的专业知识,但现在你只需几分钟的打字就能实现这种基准测试作弊。

同日更多故事

2026-08-18