Zwei MMLU-Werte, ein Name: Warum 0,781 und 0,79 nicht vergleichbar sind

The Two MMLU Scores: What a Benchmark Name Does Not Fix

Zwei MMLU-Werte, ein Name: Warum 0,781 und 0,79 nicht vergleichbar sind

Zwei Builds derselben Modellfamilie melden MMLU-Genauigkeiten von 0,781 und 0,79. Der Verifier im apl-ai-eval-Crate liefert für die score-delta-Anfrage 'incomparable', weil die Frames unterschiedliche Runner, Grader und Datensplits deklarieren. Der Beitrag zeigt anhand veröffentlichter Messungen, was die offenen Variablen – Split, Implementierung, Prompt-Format, Grader, Netzwerkzugriff – den Zahlen tatsächlich wert sind, und argumentiert: Vergleichbarkeit ist eine Eigenschaft der Referenz, nicht der Zahl.

Comparability is a property of the reference the results are traceable to, not of the number.

Mehr von diesem Tag

2026-09-15