물리학 벤치마크가 틀렸다: 전문가 재채점 후 GPT-5.6-Sol 점수 47%→79%로 급등

How good are frontier models at physics?

GPT-5.6-Sol이 HLE-Physics에서 47.3%에서 78.7%로, CMT-Benchmark에서 61.0%에서 87.2%로 상승했다. 전문가 감사 결과 대부분의 오답은 모델의 물리 추론 오류가 아니라 잘못된 참조 해답, 모호한 문제, 채점 오류 때문이었다. 수정된 pass@4는 CritPt에서 94.4%에 달했다. 저자들은 현재 벤치마크가 프런티어 모델의 물리 문제 해결 능력을 크게 과소평가하고 있으며, 더 어렵고 전문가 검증을 거친 평가가 필요하다고 주장한다.

감사된 사례 중 처음에 오답으로 평가된 대부분은 모델의 물리 추론 오류가 아니라 이러한 벤치마킹 문제를 반영한다.

이 날의 다른 글

2026-09-16