AI 并非超越数学家,而是记性更好

AI Isn't Outthinking Mathematicians. It's Out-Remembering Them

AI 并非超越数学家,而是记性更好

当 AI 解决高难度数学问题时,我们常误以为它具备了更强的推理能力或数学直觉。但真相可能更简单:AI 只是拥有远超人类的工作记忆容量。人类大脑受限于极小的工作记忆,难以同时处理大量变量和中间步骤,而 AI 的 Context Window 就像一个巨大的外部笔记本,能完整保留问题陈述、数百个中间方程和所有约束条件。这种记忆优势让 AI 在数学领域表现卓越,因为它擅长处理符号明确、逻辑可验证的任务。然而,在面对社会问题或模糊概念时,这种单纯的记忆扩容并不能弥补对隐藏因果和不确定性的理解缺失。AI 的强项在于“记账”,而非真正的“思考”。

人类的工作记忆极其有限,而 AI 拥有巨大的外部符号工作空间,这消除了限制人类推理能力的最重要生物瓶颈。
  1. hibikir

    我怀疑,我们所谓的“非常聪明”,归根结底往往只是比周围的人记性更好。回想我在软件行业的职业生涯,每当我做出一件被他人视为“高性能”的事情时,要么是因为我比其他人更有精力去解决一个他们觉得得不偿失的问题,要么就是能从以前的工作或自学中调取一些零散的知识,并将其应用到当前问题上。

    我不认为自己这辈子有过真正原创的想法。无非是把 A 和 B 结合起来,而很少有人能同时掌握 A 和 B。从这个角度看,大语言模型(LLM)做的事情本质上是一样的。有时我比 LLM 更快,因为我的上下文组织得更好,但通常我只需要给一点提示,它就能自我修正。它声称某个地方存在内存泄漏,但我闻到了不对劲,建议它再检查一下垃圾回收统计信息,结果发现根本不是泄漏,而是调优错误。这时 LLM 在调优方面比我强,因为它比我更有精力。

    也许这世上确实存在真正的天才,那种不是靠拼凑数据和构建假设直到运气爆棚就能产生的东西。我的经验并不全面。但我环顾四周,似乎我运气不够好,从未见过这样的人。即使是我合作过的最耀眼的那些人(这里的绝大多数观众都能认出来),也从未向我展示过他们能够……

  2. ComplexSystems

    这也是在“暴力破解”上胜过他们。因为它永远不会累。如果一个数学家选定一个研究方向,花了一整周时间却毫无进展,他可能会感到恼火,需要休息一段时间等等。而这个东西永远不会累,不会气馁,也不在乎;它会一直尝试下一件事,直到某件事最终奏效。

  3. philipfweiss

    人类数学家的一点是,他们只发表正面结果。教授们等可能抽屉里堆满了“负面结果”,但人类数学家的激励机制和精力带宽使得发表这些有用的结果变得不可能。

    但 AI 智能体没有这种限制,可以轻松发布并重用负面痕迹。最近有一些项目(https://www.theoremdb.org)旨在利用这一事实。https://news.ycombinator.com/item?id=49227505

    不过总的来说,大语言模型并没有人类数学家那样的限制和激励机制,明年即将到来的变革浪潮将充分证明这一点。

  4. re-framer

    我不禁想起 Michael Nielsen 的文章《增强长期记忆》[1]。

    > 许多人对杰出数学家的模型是:他们极其聪明,智商极高,能够在脑海中处理非常复杂的概念。普遍的认知是,他们的聪明才智赋予了他们处理复杂概念的能力。基本上,他们拥有更高马力的引擎。

    > 顶尖数学家确实通常非常聪明。但这里有一个不同的解释。根据 Simon 的观点,许多顶尖数学家通过辛勤工作,将比普通人类多得多的复杂数学“块”(chunks)内化了。这意味着,对我们其他人来说似乎非常复杂的数学情境,对他们来说却非常简单。所以,并不是说他们拥有更高马力的思维(即能处理更多复杂性),而是他们先前的学习赋予了他们更好的“组块”能力,因此大多数人视为复杂的情境,他们视为简单,从而更容易进行推理。

    我曾经在一次数学讲座中尝试过他的 Anki 方法。每当我复习一张卡片,比如关于某个引理时,我注意到了一些有趣的东西。这令人愉悦,许多引理随着时间的推移变得更加流畅。这虽然算不上数学的“解决方案”,但我发现它在持续期间非常有趣(直到缺乏自律或缺乏时间让我停止这样做)。

    [1] https://augmentingcognition.com/ltm

  5. MelonArmiger

    发帖前可能值得查一下该网站的历史。写这篇文章的人看起来像是某种“种族科学”的疯子。

  6. mcv

    我觉得这相当明显。我不认为我接触过的任何 AI 模型特别聪明,但它们阅读的量级比我一生中能读到的要多得多。它们的书本知识远胜于我,所以我就是这么使用它们的。我用它们来查找我怀疑其他人知道、但我不知道的事情。但当我着手做一些我怀疑是真正全新的事情时,这些模型很少能理解我在做什么,所以我得亲力亲为。不过,我仍然会向它们咨询基本原理、最佳实践和其他建议。

  7. ffwd

    大语言模型仍然缺少工作记忆的一部分。工作记忆的一部分是能够关注少量信息,然后理解并解析该信息的所有片段。当大语言模型使用它们的“工作记忆”时,它们只是分析不同 token 的概率,而没有像人类那样对信息进行优先级排序或理解。

    如果没有训练数据或上下文中的数据能引导它得出正确结果,它就做不到;而人类似乎能够概括并抽象出一个目标,然后以“递归”的方式重复某种行动或思维过程来达到结果。据我所知,大语言模型做不到这一点。

    举个例子说明一下。我最近让一个大语言模型将一堆艺术家的专辑分类为是主要唱片公司发行还是独立唱片公司发行,大部分情况下它做得不错。但有些被它归类为独立的专辑其实并不是。我推测是因为它在搜索时没有遇到正确的数据,或者误解了它找到的数据。人类不会犯这种错误,因为如果人类有一份所有主要唱片公司的名单,就能瞬间判断一张专辑是否独立,因为它不需要像大语言模型那样进行复杂的解析或 token 概率计算,它只是识别模式(一张专辑要么是独立的,要么不是,人脑只需要一个信息片段就能做出决定),而大语言模型没那么简单。

    在某种意义上,人脑比大语言模型更简单……

  8. keeda

    虽然文章本身(TFA)说得通,但我不同意标题和结论。我不会将思考过程中调用工作记忆视为“记忆”,而是将其视为思考本身的一部分。工作记忆是 RAM,而我们长期记忆则是更大但延迟更高的索引数据库。因此,我会说 AI 是在“思考”上胜过我们,即使是以一种暴力破解的方式。

    我认为可以说它在“记忆”上胜过我们的地方在于,它能够沉思其权重中编码的、源自几乎所有人类学科的庞大模式宇宙,从而建立人类无法建立的联系,除非人类恰好熟悉多个学科。

    这就是为什么我认为与冯·诺依曼/爱因斯坦的类比也有点偏颇。从文章来看,冯·诺依曼更像 AI 所做的事情,而不是爱因斯坦。我并没有觉得是爱因斯坦的记忆力,而是他能够从截然不同的视角看待事物的能力。到目前为止,我还不知道我们能否断言大语言模型能否做到这一点。

  9. amelius

    听起来又是另一种试图以某种方式构建 AI 形象,让人类自我感觉良好的尝试。

    更简单的解释是:工作记忆是智能的必要条件,更大的工作记忆会让你更聪明。因此,AI 确实可以比数学家更聪明。

  10. Zigurd

    有很多高价值的事业中,成为超级人类的知识重组者正是对症下药。但即使捕捉所有知识也证明是难以企及的。

    我使用编码智能体。我觉得它们总体上相当不错。它们为我节省了大量繁琐的编码工作。例如,我可能不会花时间去为 Flutter 应用的所有构建目标实现原生启动画面,但我会让编码智能体去做。

    尽管如此,在我们拥有编码智能体的这段时间里,要找到它们训练数据的粗糙边缘仍然易如反掌。例如,Gemini 显然不知道 Flutter 工具链中的 Xcode 部分是否配置错误。这算不上千禧年大奖难题。但这对于编码智能体的训练集来说,形状就是不对的。

同日更多故事

2026-08-15