OpenAI 数学成果:AI 如何评估突破?
Assessment of open AI math results

普通人很难一眼看出数学成果的深浅,Igor Kotenkov 便请 GPT-5.6 Sol Pro 和 Fable 5 Max 依据 EpochAIResearch 的 OpenMath 标准进行分级。结果显示,两个模型一致认为第 3 项成果属于 Breakthrough(突破性进展),这也是 SebastienBubeck 推文开篇即提的原因。此外,至少有 7 项被认定为 Major Advance(重大进展),而 Fable 5 更认为其中 3 项处于 Borderline Breakthrough 的临界点。官方标准强调在评级时应偏向保守,避免事后降级带来的遗憾。这场由 AI 主导的数学成果评估,不仅揭示了问题的难度层级,也展现了科学推理领域的新可能。
当一个问题似乎符合多个层级时,我们倾向于采取保守的评级方向。