Эксперты перепроверили физические бенчмарки: модели ошибались реже, чем показывали оценки
How good are frontier models at physics?
Низкие результаты frontier-моделей на физических бенчмарках не отражают их реальные способности. Эксперты-физики перепроверили шесть популярных тестов и выяснили, что большинство «ошибок» моделей на самом деле были ошибками грейдеров, некорректными эталонными решениями или неоднозначными вопросами. После исправления оценка GPT-5.6-Sol на HLE-Physics выросла с 47,3% до 78,7%, на CMT-Benchmark — с 61,0% до 87,2%, а на 54 отобранных задачах CritPt достигла 94,4%. Вывод: бенчмарки сильно недооценивают модели, а их близкое к насыщению состояние требует более сложных проверок.
Большинство проверенных случаев, изначально оценённых как неверные, отражают эти проблемы бенчмаркинга, а не ошибки в физических рассуждениях моделей.