GPT-5.6 用提示词填补凸优化 30 年空白
GPT-5.6 used a prompt to close a 30-year gap in convex optimization
OpenAI 宣布 CDC 证明后,GPT-5.6 竟然仅凭一个提示词就解决了凸优化领域长达 30 年的难题。这一突破让数学界和 AI 社区都为之震惊,展示了大语言模型在解决高深数学问题上的惊人潜力。这不仅是技术的飞跃,更预示着 AI 在科研领域将扮演前所未有的关键角色。
GPT-5.6 仅用一个提示词就填补了凸优化领域长达 30 年的空白。
HN 评论区
391- _alternator_
我对这个领域略知一二。这个猜想读起来比 OpenAI 最近证明的循环二重覆盖猜想(cyclic double cover conjecture)稍微小众一些,但无疑是一项真正的贡献。
你想知道解决一个优化问题需要多长时间,在这个案例中是针对凸的、Lipschitz 连续函数的优化。(限制在球形域上其实算不上真正的限制,对于任何有界域你都可以换元处理。)总之,证明时间复杂度的上界是“容易”的,因为这仅仅是你算法的运行时间。而证明(非平凡的)下界通常难得多,因为它需要约束所有可能的算法。
这个证明似乎表明,下界时间复杂度等于一个已有 30 年历史的算法的时间复杂度:解决这类函数需要 Omega(d^2) 次函数求值。
我的直觉告诉我,这很可能意味着如果你有一个梯度预言机(gradient oracle),d 就是最小求值次数,因为你可以用 d 次函数求值来近似梯度,但我也不确定要把这一点严格化有多难。
- rakel_rakel
> 我不认为数学/理论计算机科学(TCS)领域的研究人员会被淘汰,但我认为再去研究那些低垂的果实,甚至中等难度的果实(你知道我指的是什么)将不再有意义。我们将被需要去解决那些真正需要新颖方法的问题。
我想知道这与我们在软件开发中看到的“初级工程师”(juniors)的情况有何异同?
在数学研究中,你是否也是通过一段时间内处理低垂果实来接受职业训练,然后转向中等难度的问题,最后再去攻克那些以前未解的难题?
- YeGoblynQueenne
所以如果你深挖一下,会发现作者其实已经用 GPT 5.4 和 5.5 尝试解决这个问题一年了,他把所有这些信息都喂给了他给 Sol Pro 的提示词,而 Sol Pro 可能直接或间接访问了作者的聊天历史。因此,所谓的“148 分钟”实际上是“一年加 148 分钟”。
此外,提示词中似乎已经包含了用于解决问题的技术:
https://old.reddit.com/r/math/comments/1uxj3cy/after_openais...
在提示词中,我基本上把所有合理的方法都扔进去了,没有特别区分哪些应该重点探索,而这些方法对于了解该领域的人来说都是合理的。Sol 也帮我完善了提示词,我给了它 CDC 提示词、一些想法和规格说明,以及一个非常清晰的问题描述,然后我自己又稍作修改。有一点我很好奇的是它访问了多少之前的聊天记忆,因为如上所述,我之前用 5.5 和 5.4 处理过这个问题,而且主要的构建思路与我在那些对话中讨论的内容差别不大。但是,最终奏效的仿射函数最大值类(function class max of affine functions)也包含在我的提示词里,所以我也不能完全确定。
因此,对我来说尚不清楚“GPT-5.6 使用提示词”填补空白的程度究竟如何,还是说作者基本上是自己完成了所有工作,只是出于热情将其归功于 GPT-5.6。
- d4rkp4ttern
在 Reddit 的帖子中有人澄清这是用 Sol Pro 完成的,而不是 Ultra——很好奇大家心里对这两者的区别是什么模型。
我的理解是,ChatGPT Pro 本质上是一个多智能体系统,或者以某种方式并行使用多个 LLM 并选择最佳答案。而 Ultra 则更像 Claude-Code UltraCode,主智能体可以选择创建一个动态 JS 工作流,确定性地编排多个智能体来处理任务的不同部分,并包含对抗性检查器等。
这大致就是区别吗?如果有能证实这一点的来源就太好了。
- a_imho
如果我没记错的话,Mochizuki 曾提出过 abc 猜想的证明 https://en.wikipedia.org/wiki/Abc_conjecture#Claimed_proofs,但因为对人类来说过于晦涩难懂而被拒绝了。这难道不应该是 LLM 的理想目标吗?
- mw67
智能变得如此廉价、高效且普及,真是疯狂。
鉴于我们的大部分技能正变得无关紧要,我们人类最好把精力重新集中在我们的核心价值观和原则上。
- ChrisArchitect
非 Reddit 来源:https://medium.com/@kerger.p/an-ai-assisted-breakthrough-in-... (https://news.ycombinator.com/item?id=48939768)
- applfanboysbgon
两点看法:
- 尚未经过同行评审,所以请持保留态度。这适用于所有声称的证明,不仅仅是 AI 生成的。即使是人类也会产生幻觉证明!
- 提示词在本文第 27 页 [1]。那是十页高级数学内容,旨在将模型引导至正确的方向,显然是基于一年的前期研究。如果结果是真实的,这并不使其无效,但值得指出的是,这并不是简单的“ChatGPT,解决这个未解问题,别犯错”,而是需要大量的领域专业知识和前期的人类研究。
- spwa4
问题在于,我们很快又会有一个 DeepSeek 时刻,当有人用 GLM 或 Kimi K3 来做这件事的时候。
- jdw64
我现在的感受是,我们需要研究如何更好地使用 AI。我见过教授们使用 AI,效果惊人。从这个意义上说,我认为 AI 提示词的输入将会出现分层。过去,实现技能非常重要,但如今,概念似乎更重要,这就是其中之一。
AI 并没有带来平等,相反,输出结果取决于你拥有多少背景知识。你可以称之为“输入的分层”。
我开始觉得,像我这样专注于快速产出 MVP 的程序员已经没有立足之地了。