两个MMLU分数:基准名无法掩盖的差异
The Two MMLU Scores: What a Benchmark Name Does Not Fix

同一模型家族的两个版本在MMLU基准上分别测得0.781和0.79的分数,看似微小的0.009差异背后却隐藏着巨大的不可比性。文章指出,仅凭“MMLU”这一名称无法固定数据集划分、实现方式、提示格式、评分器及网络访问等关键变量。从dev集与test-lite集的分歧,到exact-match-v1与llm-judge-v3评分器的本质不同,这些细节导致两个分数在度量学上完全不可比较。真正的可比性源于对测量过程的可追溯性,而非数字本身。当基准名称无法约束执行细节时,所谓的性能提升可能只是测量偏差的产物。
可比性是结果可追溯到的参考系所具有的属性,而不是数字本身的属性。