AI 基准测试为何会陷入停滞?

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

AI 基准测试为何会陷入停滞?

AI 基准测试本是衡量模型进步的关键标尺,但这项研究揭示了一个严峻现实:许多基准测试会迅速“饱和”,导致无法有效区分不同模型的性能,长期价值大打折扣。研究团队系统分析了 60 个语言模型基准测试,发现近半数已出现饱和现象,且随着时间推移,饱和率呈上升趋势。更有趣的是,研究指出专家精心策划(expert-curation)是提升基准测试抗饱和能力的关键,而非公开测试数据。这一发现为设计更持久、更有效的评估方法提供了重要启示,帮助我们在 AI 技术快速迭代的浪潮中,找到真正可靠的衡量标准。

我们发现,基准测试对饱和的抵抗力取决于专家策划,而非公开测试数据。

同日更多故事

2026-08-04