Dos puntuaciones MMLU para el mismo modelo: el nombre del benchmark no las hace comparables

The Two MMLU Scores: What a Benchmark Name Does Not Fix

Dos puntuaciones MMLU para el mismo modelo: el nombre del benchmark no las hace comparables

Dos builds de una misma familia de modelos reportan 0.781 y 0.79 en MMLU, pero el verificador las declara incomparables. El nombre 'mmlu' fija una etiqueta, no el split, la implementación, el formato del prompt, el grader ni el acceso de red del runner. La comparabilidad depende de la referencia trazable, no del número. El perfil AI-Eval convierte esa distinción en una regla operativa: un bridge solo aplica si los frames coinciden en aspecto, alcance y procedimiento.

La comparabilidad es una propiedad de la referencia a la que los resultados son trazables, no del número.

Más de este día

2026-09-15