Tim Gowers:LLM 擅长哪类数学?
Tim Gowers: What sort of maths are LLMs good at?
OpenAI 近期宣布解决了包括非sofic群构造在内的十个重大数学难题,这一突破引发了对LLM能力的重新评估。Tim Gowers指出,尽管LLM在解决特定问题上表现惊人,但它们尚未在所有数学领域超越人类。文章深入探讨了LLM是否特别擅长寻找反例,并通过Vinogradov定理与Gluskin定理的对比,分析了“反例”与“定理”在逻辑结构上的微妙差异。Gowers认为,关键在于问题中量化变量的本质角色,而非简单的逻辑形式。随着LLM能力的快速演变,理解其优势边界对于未来数学研究至关重要。
这些成果令人印象深刻,但LLM似乎仍未在所有数学方面超越所有人类。
HN 评论区
156- h_mirin
这其实是在争论推理时扩展(test-time scaling),尽管原文从未使用过这个术语。
如今,“推理时扩展”大多指让模型自我对话更长时间,但真正令人惊讶的首批结果来自简单的采样。Google 的 AlphaCode 生成了数百万个候选程序,并将其筛选为寥寥几个提交,在 ChatGPT 出现之前,它就在 2022 年击败了平均水平的程序员。
采样是 AI 的强项。举例子和刷 LeetCode 类似,因为验证过程清晰且成本低廉。相比之下,“证明”仍然是一个模糊的概念,除非是在 Lean 能工作的领域。看看围绕 ABC 猜想的争议就知道了。因此,人类仍然是必需的。
对我来说,有趣的问题是:经过足够多的“采样”学习后会发生什么?AlphaGo 的第 37 手难道不是 AI 的直觉吗?如果这在数学领域发生,我们最终可能会得到正确、机器可验证但完全无法用我们满意的方式解释的结果。
- steinwinde
关于 AI 在数学领域成就的列表,参见 https://mathoverflow.net/questions/502120/examples-for-the-u... - 或者这里的候选列表:https://aimath.robertj1.com/ 。许多人观察到 AI 对寻找反例或正例有着天然的亲和力。浏览上述列表,我脑海中浮现出一个更偏向社会学的观点:人们正在热衷于回答那些突出的、表述清晰的问题。我不是数学家,但这是否主要是数学进步的全部?那提出有价值的问题呢?那构建理论呢?我说的对吗?这些同样重要,但似乎所有利用 AI 进行数学研究的人都不感兴趣?
- scronkfinkle
> 一个很好的迹象表明 LLM 在更广泛的问题类别上已达到人类水平,那就是它们开始使用新的、令人惊讶的方法来证明定理,就像许多最优秀的人类数学一样,这些方法在事后看来既美丽又自然。它们也应该是那些很难偶然碰到的方法。很难确切地说什么样的证明才算此类,但我想当我们看到时就能认出来。
同意。在看过 OpenAI 的这些结果后,我无可否认地认为我们拥有一台机器,它具备:
* 对人类曾经学过的几乎所有学科的通用知识
* 利用这些知识进行推理模拟的能力(尽管有时并不完美)
* 跨知识领域引用的能力
对我来说,这基本上就是我理解的“通用人工智能”(AGI)。它是所有通用人类智慧的累积知识,被烘焙成一种人工形式,然后可以利用这些知识去实现新的目标。
在许多数学突破的案例中,灵感来自于恰好知道一组现有思想的组合,然后将它们结合起来解决该问题。这正是拥有通用知识显得特别强大的地方,因为我们可以让机器连续运行数周,实际上是在进行暴力破解。
话虽如此,我从未想象过以当前形式的 LLM 能发明出像傅里叶变换那样优雅的东西。
- jerf
鉴于编码代理在处理并发代码(即使是相对简单的并发代码)时表现出的困难,看看它们在时序逻辑(temporal logic)方面表现如何会很有趣。我不够了解那个领域的具体问题,无法直接让 AI 去解决,但我怀疑它们会不会在那里撞得头破血流。
(我最近没有机会让当前一代的顶尖模型去尝试并发问题,因为手头没有现成的模型可以测试。最好的并发就是没有并发,次好的并发是“网络请求”模式,即许多网络请求名义上并发运行,但彼此完全隔离,根本不尝试通信。所以也许它们表现更好,但我觉得如果它们好很多,应该早就有人在我能看到的地方提到过了。)
- BeetleB
既然还没人提到——我想指出一下,Timothy Gowers 是菲尔兹奖得主。
- n4r9
一如既往,Gowers 的这篇帖子深思熟虑且措辞严谨。最后的注脚很精彩,值得全文贴在这里:
> 一个很好的迹象表明 LLM 在更广泛的问题类别上已达到人类水平,那就是它们开始使用新的、令人惊讶的方法来证明定理,就像许多最优秀的人类数学一样,这些方法在事后看来既美丽又自然。它们也应该是那些很难偶然碰到的方法。很难确切地说什么样的证明才算此类,但我想当我们看到时就能认出来。
- parhamn
> 如果真是这样,那么它们相对于我们的巨大速度优势意味着会有更多的结果涌现。
现在情况是这样吗?就在最近,Jarred Sumner 发推文 [1] 说他在慢跑时设法在黎曼猜想上取得了一些进展。通过鼓励 LLM“继续”和“相信自己”,他确实取得了一些进展。
这给我提出了几个问题。Anthropic 没人早点想到试试这个吗?一个有趣的注脚是,那里的一位软件工程师去尝试了。世界上有多少人实际上能验证一个证明?我们需要多少人围坐在一起念正确的咒语才能从中得出一个证明?我们需要多少人去验证并赋予这些证明价值和意义?当证明的数量超过验证者时会发生什么?100 年后还会剩下多少?
我想结果就是,这些东西的社会效用大于其他任何东西。那 10 个证明的浪潮来也匆匆去也匆匆,在日常新闻周期中一闪而过。也许数学已经进入了像国际象棋那样“为了乐趣”的时期。我感兴趣的是,什么时候我们会发现一个具有极高现实实用性的数学/物理突破,某个我们已经投入了最好人力资源的领域。
[1] https://x.com/jarredsumner/status/2086869681785500011?s=20
- tel
我越来越开始把 LLM 视为非常有趣的随机对象来源:针对特定任务调制的、大块的“合理思维”。这并不是说它们通常是正确的,相反,它们是随机搜索的一种浓缩形式,其中的“随机性”非常可能遵循合理的人类模式。
你可以把它扔给一个任务,配合一个合适的机器将这种原材料转化为行动,它就会咔咔作响地跑过,并在终点采样“合理的人类行为”。
还有更聪明的使用方法,但这里的一个通用工具是将任何类型的随机搜索升级,以使用这种新的随机采样形式。它将高效得多,条件也设置得当,因为它几乎不会像其他随机源那样频繁地访问那些不合理的东西。