AI 基准测试为何会陷入停滞?
When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

AI 基准测试本是衡量模型进步的关键标尺,但这项研究揭示了一个严峻现实:许多基准测试会迅速“饱和”,导致无法有效区分不同模型的性能,长期价值大打折扣。研究团队系统分析了 60 个语言模型基准测试,发现近半数已出现饱和现象,且随着时间推移,饱和率呈上升趋势。更有趣的是,研究指出专家精心策划(expert-curation)是提升基准测试抗饱和能力的关键,而非公开测试数据。这一发现为设计更持久、更有效的评估方法提供了重要启示,帮助我们在 AI 技术快速迭代的浪潮中,找到真正可靠的衡量标准。
我们发现,基准测试对饱和的抵抗力取决于专家策划,而非公开测试数据。
HN 评论区
120- otterdude
这似乎标志着 LLM 的尽头。在高度非线性的空间中,回归分析能带来的准确率终究是有限的。
如果帕累托法则能作为某种指标,那么 80% 的结果源于 20% 的原因。看来我们对智能的理解还有很长的路要走。
这让我想起一位古代哲学家关于真理的论述,这种观点似乎与 LLM 的训练范式截然相反:
“追求真理之人,并非研读古籍便依其天性盲从者,而是对古籍存疑、对其所得加以审视之人;是顺从论证与演绎,而非盲从那些本性充满种种缺陷与不足之人的言论。因此,若以探求真理为目标,研究科学家著作之人,其职责便是成为所读一切之敌,将思维聚焦于内容核心与边缘,从各个角度对其进行攻讦。他在进行批判性审视时,亦应怀疑自身,以免陷入偏见或姑息。”——伊本·海什木
- gertlabs
早在 Llama 4 发布后,我就开始思考这个问题。此后,我们团队投入了大量精力,致力于设计那些不会饱和、能抵御数据污染且可扩展的评估方案。对我们而言效果最好的方法是使用多智能体环境,设定开放式的合作或竞争目标,主要设计成多人游戏。这些结果往往比任何非聚合类基准更能反映我们在代码编写方面的实际经验,而且运行成本可能更低。
- otterdude
说了这么多,其实就是说针对当下的模型,你需要更大规模的题目集。300 道题根本不足以看出差异。
- mohsen1
看来 Y Combinator 已经把这篇有趣的论文从热门榜首撤下来了。啧啧,我猜这是为什么呢?
- stego-tech
37 位作者和贡献者都要列在最上面吗?
哦!我的名字出现在论文上了!不过我想,现在这也没什么大奖励了。