物理ベンチマークは壊れていた——専門家の再採点でGPT-5.6-Solの正答率が47%から79%へ

How good are frontier models at physics?

最先端モデルは高度な物理が苦手——そう見えていたのは、ベンチマーク側の欠陥だった。6つの物理ベンチマークを専門家が監査したところ、誤答とされたケースの多くは、採点ミスや参照解の誤り、問題文の曖昧さに起因していた。参照解を修正し問題を選別した結果、GPT-5.6-SolのHLE-Physicsでの平均正答率は47.3%から78.7%へ、CMT-Benchmarkでは61.0%から87.2%へ上昇。CritPtの修正済みpass@4は94.4%に達した。

これらの知見は、現在のベンチマークが、適切に定式化された物理問題を解くフロンティアモデルの能力を大幅に過小評価していることを示唆している。

この日のほかの記事

2026-09-16