定位:LLMs 无法跳跃

Position: LLMs Can't Jump

这篇论文提出了一个看似简单却直击要害的观点:LLMs 无法跳跃。作者通过严谨的实验和逻辑推演,揭示了当前大语言模型在理解物理世界和动态行为时的根本性局限。尽管 LLMs 在文本生成和逻辑推理上表现出色,但在涉及空间感知和物理交互的任务中,它们往往显得力不从心。这一发现不仅挑战了我们对 AI 能力的普遍认知,也为未来模型的设计和优化提供了新的思考方向。

定位:LLMs 无法跳跃。
  1. Mikhail_Edoshin

    真正的理解需要“不知道”,而 LLM 做不到“不知道”。LLM 必须给出一个答案,这是它们的本性。它们就是搜索引擎。我们也有类似的机制;只要稍加反思就能察觉到。这种机制与真正的思考截然相反,因为它只是检索已有的“已知”内容。当我们暂时关闭这种机制时,我们就能实现“跳跃”。

    话虽如此,这里有一个苏联心理学家做过的实验,我忘了他叫什么。这个人想研究直觉。于是他设计了一个实验,试图在实验室条件下触发直觉。(花点时间惊叹一下:你会如何着手这样的任务?)他给人们出了一些谜题。其中一个是根据某些规则摆放木棍。另一个是在迷宫中找到路径。秘密在于,迷宫中的路径与木棍谜题的解法图形完全相同。

    他观察到了有趣的结果。那些先解木棍谜题再解迷宫的人,找到路径的速度比对照组快得多。如果要求受试者在开始时或中途评论他们是如何解迷宫的,速度就会降到正常水平。受试者通常没有注意到其中的相似之处。

    所以这里确实有东西值得研究,尽管这显然只是潜意识的模式匹配。这是一种“跳跃”,但不是我指的那种。我指的是禅宗式的跳跃。

  2. gabbagool

    现在说这个可能有点晚了,但我以前就争论过,语言本质上是对人类体验的一种有损编码。我们尽力用语言来描述我们看到和经历的事情,语言虽然表达能力惊人,但也有其局限性。当我们发现自己说出“无法用言语形容”之类的话,或者当我们用同一个词表达截然不同的含义时(比如“我爱我的孩子”或“我爱苹果派”),我们就能看到这种局限性的蛛丝马迹。显然,这里的“爱”字包含某种未被表达的量级,但听者却以某种方式理解了它。

    所以,我某种程度上认同这种观点:爱因斯坦在模拟世界,并在这些模拟上进行实验,其方式超出了自然语言所能编码的范畴。如果 AI 的训练数据几乎完全由语言组成,它是否具备这种能力?有人可能会争辩说,如果 AI 是在人类体验的有损编码/表征上进行训练,它如何能模拟超越这种体验的东西?除非它能像我们想象三维以上物体那样做到。不过我现在只是胡言乱语了。

  3. quantum_mcts

    关于爱因斯坦创立狭义相对论是为了“解决迈克尔逊 - 莫雷实验的矛盾”的流行说法,对这段历史问题来说过于简化了。最典型的例子就是论文中的这句话:

    > 从这两个公设出发,爱因斯坦推导出了洛伦兹变换……

    如果爱因斯坦推导出了它们,那“洛伦兹”是谁?

    狭义相对论的基础是对电动力学和麦克斯韦方程组对称性的研究。爱因斯坦的论文标题实际上是《论动体的电动力学》,而且从未引用过迈克尔逊和莫雷。

  4. defgeneric

    值得重新发布作者 Tom Zahavy [1] 在本文最近在 X/Twitter 上流传后的一条跟进推文:

    > 关于我的

  5. jvanderbot

    LLMs Can't Jump

  6. killerstorm

    论文的几点反思:

    > 我的立场论文最近在这里引起了一些关注,所以我想分享一些想法并澄清几点。

    > 首先:有些人将其解读为“DeepMind 给 AI for Science 泼冷水”,或者声称该论文认为 LLM 永远无法做出真正的科学发现。情况并非如此。

    > 这是一篇个人立场论文,不代表公司对 AI for Science 的看法。这也不是我的立场。作为 AlphaProof(首个赢得 IMO 奖牌的 AI 系统)的核心贡献者,我亲眼目睹了 DeepMind 的同事、其他前沿实验室和学术界利用 LLM 取得了惊人的发现,并将继续这样做。这篇论文绝不是“LLM 是死胡同”之类的东西。

    > 相反,这篇论文是我深入研究广义相对论发明过程的结果。我想探索现代 AI 系统要做出那种特定的“跳跃”需要什么。具体而言,我关注的是等效原理——这是爱因斯坦通过基于物理直觉的思想实验制定的一个关键公理。我试图弄清楚要让现代 AI 系统具备这种思维方式需要什么。

    > 赋予 AI 这种特定能力不一定是下一步最紧迫的事情。很有可能,改进我们目前的配方会带来许多令人兴奋的 [……]

  7. yomismoaqui

    我是冲着这句话来的:

    “有台电脑在棋类比赛中赢过我,但在踢拳比赛中它根本不是我的对手。”

    结果 TFA 实际上讲的是直觉的飞跃,真遗憾。

    我听说这里有人提出的一个实验是,用 1980 年或 1990 年之前的所有文本构建一个 LLM,看看它能否重新创造出自己。

  8. sobiolite

    这字面上就是一个家伙的观点,没有任何定量证据支持。

    这个问题其实可以严谨地回答:

    1. 定义什么样的科学成果算作“跳跃”。它们应该足够频繁,每年都有发生——否则人们可能会说人类也无法跳跃。

    2. 找出 2026 年发表的文章中所有此类“跳跃”,并使用知识截止日期为 2025 年的 LLM,在提供最少信息的情况下重新推导这些结果。

    真的让我很恼火,人们仅仅因为这些低质量的文章印证了

同日更多故事

2026-08-05