专家重评:前沿模型物理能力被低估

How good are frontier models at physics?

主流评测显示前沿模型在物理领域表现平平,但这可能源于评测本身的缺陷。研究团队邀请领域专家对 HLE-Physics、CMT-Benchmark 等六大基准进行重评,发现大量初始判错的案例实为题目歧义或参考答案错误。经过修正后,GPT-5.6-Sol 在多项指标上大幅提升,部分任务甚至接近满分。这一发现表明,当前评测体系严重低估了模型解决良构物理问题的能力,亟需更严谨的专家验证。

这些发现表明,当前的基准测试严重低估了前沿模型解决良构物理问题的能力。

同日更多故事

2026-09-16