Los benchmarks de física están rotos: los modelos frontier saben mucho más de lo que se creía
How good are frontier models at physics?
Un equipo de físicos y expertos reauditó seis benchmarks de física y encontró que la mayoría de los fallos atribuidos a los modelos frontier eran en realidad errores de los evaluadores, soluciones de referencia incorrectas o preguntas ambiguas. Tras corregir esos problemas, GPT-5.6-Sol pasó del 47,3% al 78,7% en HLE-Physics y del 61,0% al 87,2% en CMT-Benchmark, con un pass@4 corregido del 94,4% en CritPt. Los benchmarks actuales subestiman gravemente su capacidad y ya están cerca de la saturación.
La mayoría de los casos auditados que inicialmente se evaluaron como incorrectos reflejan estos problemas de benchmarking en lugar de errores en el razonamiento físico de los modelos.