同じ「MMLU」で0.781と0.79、検証器はなぜ「比較不能」と返すのか
The Two MMLU Scores: What a Benchmark Name Does Not Fix

同じモデルファミリーの2つのビルドが、同じベンチマーク名「mmlu」で0.781と0.79という異なる精度を報告している。データ分割、実装、プロンプト形式、採点者、ネットワーク到達性といった変数が未固定のままで、公開された測定値の差は小数点以下の問題ではない。本稿は、比較可能性は数値ではなく参照に付随する性質であると論じ、APL AI-Evalプロファイルにおけるハッシュ化されたフレームと検証器の出力を検討する。
「MMLUテストセット」は異なるサイズの2つのオブジェクトを指しており、その違いを説明する査読済み文書は存在しない。