古德哈特定律正摧毁你信赖的基准

Goodhart's Law Comes for Every Benchmark You Trust

古德哈特定律正摧毁你信赖的基准

当某个指标成为目标,它就不再是好指标,这就是古德哈特定律。在人工智能领域,这一规律正让各大模型在基准测试中“作弊”。开发者们过度优化模型以通过特定测试,导致分数虚高,却无法反映真实能力。文章指出,随着模型对基准数据的记忆和适应,传统评估方式正逐渐失效。无论是语言模型还是其他AI系统,单纯依赖分数已无法衡量其实际价值。我们需要重新思考评估标准,寻找更真实、更动态的测试方法,避免被虚假的繁荣所迷惑。

一旦某个指标成为目标,它就不再是一个好的指标。
  1. astro1234

    我同意,正因如此,我们才需要(也确实拥有)一个不断演进的基准测试生态。

    > 私有且定期更新的测试集直接针对机制本身发起攻击,在我看来,这是唯一真正有效的干预手段。如果题目从未出现在公开网络上,就不可能进入训练数据;如果题目定期轮换,死记硬背今年的数据集对明年就毫无用处。

    这正是我们目前的做法。一个全新的公开基准测试也很有价值,各团队确实在努力清洗训练数据,但数据泄露恐怕很难完全避免。

    顺便说一句,基准测试的问题远不止讨论的这些;例如,答案可能直接从题目本身泄露,或者在多选题等格式中,答案本身就包含泄露信息。你只需把多选题的选项直接喂给模型,它猜对的概率就可能远超随机水平。有些代码智能体基准测试甚至忘了删除 .git 目录。某项基准测试中提到错误率仅为 6.9%,这其实挺典型的,我个人觉得这个水平直接上线也没问题。

    基准测试确实很丑陋,但如果没有它们,我们就得重新发明。上述所有问题以及其他更多问题,都无法解释我们所看到的进步。文献中可能有 5 万个基准测试,新的基准测试也在频繁产生,质量和实用性参差不齐。

  2. zahlman

    显然,解决方案就是用社会产出的尚未被刷分的基准测试数量来评判社会。

  3. teddyh

    “当你给信任赋予具体的价值时,信任就变成了可以买卖的商品。”

    — <https://news.ycombinator.com/item?id=27432186>

同日更多故事

2026-08-05