신뢰하는 모든 벤치마크에 굿하트의 법칙이 적용된다
Goodhart's Law Comes for Every Benchmark You Trust

ACM 블로그의 이 글은 벤치마크가 목표가 되면 측정 도구로서의 가치를 잃게 된다는 굿하트의 법칙이 AI 및 컴퓨터 과학의 다양한 평가 지표에 어떻게 적용되는지 탐구합니다. 저자는 벤치마크가 게임화되고 최적화됨에 따라 원래 의도했던 능력의 진정한 측정을 반영하지 못하게 되는 사례를 분석합니다. 특히 LLM(대형 언어 모델) 벤치마크의 한계와 과적합 문제를 지적하며, 벤치마크 점수에 지나치게 의존하는 것의 위험성을 경고합니다. 이 글은 평가 방법론에 대한 비판적 성찰을 촉구합니다.
벤치마크가 목표가 되면 더 이상 좋은 벤치마크가 아니다.