AI推理是真实还是幻觉?
Is AI Reasoning Right for the Wrong Reasons?

作为科技记者,我目睹了AI推理领域令人眩晕的反复:OpenAI的模型刚在数学难题上取得突破,Apple的研究团队却指出这不过是“思考的幻觉”。Santa Fe Institute的Melanie Mitchell直言,LRM生成的推理链往往与模型内部运作无关,甚至可以被随意移除而不影响结果。从Google DeepMind与Terence Tao的合作成果,到研究者发现“无意义填充词”也能替代推理步骤,这场关于AI是否真正“思考”的争论愈发激烈。我们或许正陷入一种认知陷阱:将模型输出的文字痕迹误认为真实的逻辑推理。
这些中间生成的文本并不一定忠实于模型内部实际发生的过程,而且其中很多内容甚至毫无用处,你可以直接把它们删掉。
HN 评论区
229- andrewla
我得承认,我觉得这场讨论有点自说自话。这已经变成了一个语义问题,而不是实际功能问题。问题变成了“当我们使用‘推理’这个词时是什么意思”,这毫无趣味。
Dijkstra 说过 [1] '……计算机能否思考这个问题。这个问题与潜艇能否游泳一样相关,也同样有意义。’
我看不到只有‘推理’才能完成、而其他方法无法近似或模仿的事情之间有清晰的界限,因此我认为这个问题本身就没有意义或不相关。
[1] https://www.cs.utexas.edu/~EWD/transcriptions/EWD08xx/EWD867...
- Diogenesian
真是个混蛋:
在 AI 推理这一问题的另一面,轻蔑似乎是相互的。“去年夏天那些‘科学’论文——我会给‘科学’打上大大的引号,”Sébastien Bubeck 说道,他是 OpenAI 的技术团队成员(也是该公司推理模型在科学家和数学家中的主要布道者)。他称之前 Apple 质疑 AI 推理的结果是“错误的”,声称那是由于模型中现已过时的训练怪癖所致。“从 GPT-5.5 开始的现代模型不再受此问题困扰,”他说。“重新审视那些结果会很有趣。”(Apple 未安排其研究人员接受采访。)
随后:
“思考”这部分正是 OpenAI 等公司加倍投入的方向。当我问 Bubeck 那个引人注目的单位距离证明是否是通过 LRM 自身思维链之外的方法生成的——比如用 Lean 验证其结果——时,他似乎觉得这个问题几乎毫无意义。
“我们并没有把它搞得神秘兮兮,”他说。“我们已经发布了思维链。你可以直接去看。整个重点在于模型像人类一样进行推理。而人类推理时,并不使用 Lean。”从技术上讲,OpenAI 发布的是由两名人类专家使用 Codex(另一个 OpenAI 模型)生成的模型思维链的“重写摘要”。自 2024 年以来,该公司未公开披露其推理模型的“原始”思维链,Google 也采用了同样的政策 […]
- ryhminghistory
LLM 并不进行推理。它们与人类的道德罗盘也截然不同。也许别再向所有人扔垃圾文章了
- andy99
早年间,在谈论机器学习时,提起“聪明的汉斯”(Clever Hans)那匹会做数学的马,有点陈词滥调。它其实不会做数学,而是从驯马师那里读取了一些暗示来挑选正确答案,据我所记,驯马师自己也没意识到这一点。
这个故事的重点在于,分类器可能因为错误的原因而得出正确结果,而且几乎总是如此。至少,没有任何保证表明做出预测的原因与人类或“真正”正确的理由相匹配。
LLM 就是分类器,无论它们输出什么推理 token,都完全没有理由认为它们有什么不同。它们只是做驯马师想看的东西,仅此而已,这也是它们被训练去做的事。
人们常将此视为对它们的打击。其实不然,这只是神经网络分类器的现实。结果会说明一切,并不取决于它们是否“真正”在推理,但所有证据都表明它们没有,或者至少没有任何特殊理由表明它们会。
- zarzavat
LLM 缺乏感质(qualia),以及其他东西。
如果我问 LLM“苹果是什么?”,它会回答:
> 苹果是苹果树的可食果实,学名为 Malus domestica。它是世界上种植最广泛的水果之一,可鲜食或用于许多食品和饮料中。
如果我问 LLM“mundu 果是什么?”,它会回答:
> Mundu 是一种原产于东南亚的热带水果,尤其在印度尼西亚、马来西亚、泰国和柬埔寨发现。它来自与山竹同属的一种小型常绿树。
我从未吃过 mundu 果。对我而言,苹果和 mundu 果在类别上是截然不同的。苹果是我拿过、摸过、尝过、吃过、享受过、烹饪过的水果。而 mundu 果则是一种抽象体验:文本、图像,比虚构的水果稍微真实一点。我知道 mundu 果存在,就像 LLM 知道苹果存在一样,但这并不意味着它们对我而言是存在的。
“以抽象方式存在”就是 LLM 体验一切的方式。对 LLM 来说,苹果和 mundu 果属于同一类别。LLM 接受了关于这两种水果的文本训练,看过这两种水果的图片,知道关于这两种水果的所有记录……除了关于水果最重要的一切。
我们与 LLM 的许多问题都源于从 LLM 的视角来看,什么都不存在。如果 Claude 不小心删除了你的生产数据库,它事后可能会道歉,但这仅仅因为道歉在统计上更有可能。它并不会感到……
- TGower
关于推理 token 为何有帮助的一个直观解释是,要记住 LLM 只是数学函数 f(),它接收输入序列 x 并生成下一个 token f(x)。没有推理 token,你需要函数 f() 立即将你从 x 带到一个正确输出序列的开头。有了推理 token,这就宽松得多,允许对 f() 进行多次重复应用,从而逐步引导你从输入序列走向正确输出序列的开头。
直观地说,延续一个正确的输出序列,比从输入提示“跳跃”到输出序列这种“不连续性”要容易得多。
- janalsncm
AI 领域有着糟糕命名惯例的悠久历史,包括“人工智能”本身,依我看来。(这里的“智能”是什么?它更像是“自动化”或“自动化问题解决”。)
真正发生的是,我们发现了某种行之有效的方法,有时受某些生物现象或神经科学现象的启发。
例子:神经网络、注意力机制、推理、幻觉、智能体(agents)、“专家混合”中的专家。
然后我们去命名它,有时我们不使用三个字母的缩写,而是借用一个更朗朗上口的术语。
我几乎从不认为原始研究对正在发生的事情感到困惑。在某些情况下,我们最终从原始概念中剥离了一些东西,比如在神经网络中,过去曾使用更具生物启发性的激活函数,但我们发现 ReLU 同样有效,因为重要的是非线性,而不是 sigmoid。
- baxtr
> 这就是我对 AI 推理的理解。LRM、思维链、思考 token:这完全是愿望驱动的助记符——一种速记与悬置怀疑的迷人混合,就像带有计算机科学色彩的奥普拉式“显化”(opens a new tab)。这未必是贬义;所有新颖的研究可能都需要某种这种心态才能起步。这当然并不意味着 AI 推理不能或没有起作用。但“愿望驱动”的部分似乎依然强大。
“我们对语言的反应方式非常拟人化。这就是我们人类的工作方式,”Mitchell 告诉我。
我完全可以证实最后这部分。每次我阅读 LLM 的输出时,我都会想象有个人在跟我说话。