模型为何故意变笨:用推理换知识

Models Are Getting Dumber on Purpose

模型为何故意变笨:用推理换知识

推理分数不断攀升,但每 token 的算力需求却在下降。GLM-5.2 和 Qwen3.5 等模型在数学和代码基准测试中表现惊人,却在简单事实问答中频频出错。实验室正刻意用世界知识换取推理能力,因为事实会过时,而推理流程不会。未来的模型将更像通用工具,依赖检索和工具调用获取实时信息,而非死记硬背。这种设计不仅降低了本地运行门槛,还让幻觉问题变得可追踪、可修复。当事实不再存储在权重中,模型的知识截止时间将不再是瓶颈。

当事实存储在权重之外,错误的回答就有了明确的来源地址,你可以打开文档检查,如果文档错了就修正它,这比等待下一次训练快上一年。
  1. kennywinker

    理想情况下,我希望看到的是可插拔的知识库。

    比如,如果我在为一个导航应用编写 SwiftUI 代码,我会取一个 9B 的基础代码和推理模型,加上 10B 的 Swift/SwiftUI 知识,再加上 5B 的 GIS/地理知识,以及另外 5B 的前端应用设计知识。我的模型不需要知道任何一行 Python 代码。

    然后,当我想研究电子元件时,我就抓取一个 15B 的智能体研究技术模型,再加上 10B 的电子知识,等等。

    我不想要通用模型。它们试图满足所有人的所有需求。我想要的是一个能像搭积木一样组合起来、激光般聚焦于我当前任务的模型,并且我想在本地运行它。

  2. COAGULOPATH

    这篇 AI 生成的帖子(100% 由 Pangram 生成)相当过时了。

    >在 SimpleQA(一个不允许使用工具的事实回忆基准测试)中,目前的领先者是 Gemini 2.5 Pro,得分为 53%,所以目前花钱能买到的最佳回忆能力仍然有一半的问题答不上来。

    SimpleQA 已经很久没有更新了。Gemini 2.5 Pro 是一个十六个月前的模型,并非“花钱能买到的最佳回忆能力”。

    >我觉得最有前景的部分是这对幻觉问题的影响。当事实存在于权重中时,错误的既无法查找也无法修复。

    这似乎有些混淆。LLM 的幻觉并非来自权重中包含了“错误事实”,它们是运行时出现的产物。

    >当事实存在于模型之外时,错误的答案就有地址。模型会引用文档,你可以打开文档。如果文档错了,你可以修改文档。

    你可以让任何现代 LLM 解释其推理过程并找到其主张的来源。这一切与事实是否需要存在于权重或外部工具中毫无关系。

    互联网上充满了错误信息,我也无法神奇地编辑它们使其全部正确,所以这对我没什么帮助。

    >如果模型在事实上错了,带有来源的主张是可以核查的,而来自权重的主张则不行。

    为什么?如果模型的权重声称巴特·辛普森在 2020 年当选总统,为什么这个事实突然就变得无法核查了?

  3. msdz

    很棒的文章,即使我们拭目以待,看看事情是否会继续朝这个方向发展也很有趣。

    >有一个版本的未来,模型卡片将不再列出知识截止时间,因为留在权重中的内容将以“年”而非“周”为单位过时。

    未来?

    就在最近,我也读到过两种解决这个问题的方法:

    Cactus 推出了 Needle [0][1],这是一个专注于工具调用的 14 MB 模型(仍然是 LLM!)——没有内置的世界知识。

    而 VibeThinker [2][3] 则专注于对世界知识进行推理,而不是像工具调用结构那样。

    将这两种方法与可靠的搜索工具/模型访问互联网的安全方式相结合,你就能得到一个在回答事实性问题时可能稍慢一点的模型,但好处是它不会产生幻觉。

    [0] https://cactuscompute.com/needle

    [1] https://news.ycombinator.com/item?id=49246804

    [2] https://arxiv.org/abs/2606.16140

    [3] https://news.ycombinator.com/item?id=48639240

  4. pulkitsh1234

    但是,推理和事实真的能分开吗?

    要正确地推理人类境况(例如二战),难道不需要基于某些事实进行推理吗?然后还要推理某些“事实”如何改变人类行为?你如何仅凭纯粹的推理来预测一群人的行为?我们并不理性,人类也不是受代数规则约束的逻辑确定性机器。

  5. hypfer

    天哪,那篇博客文章和这里的一些评论读起来就像科幻小说。

    具体来说,就是由极客们梦想未来所驱动的创意写作,缺乏对现实、约束等事物的恰当立足点。

    考虑到这个话题,这有点讽刺。

    但这也很重要,因为我们确实应该保持梦想。我们只是也应该意识到何时在做梦,并明确标注出来。

  6. kaufmann

    我觉得这个想法是合理的,但是 SimpleQA 基准测试在 2025 年 9 月就停止更新了。

    所以更新的数据会很有趣。

    (这看起来有点像 AI 生成的论点,使用了旧事实——这种事经常发生在我身上)

  7. Animats

    这使得幻觉检测变得更加重要。

    LLM 没有理由编码大量冷门的知识点。它可以去搜索引擎查找这些事实。但是 LLM 必须清楚自己不知道什么。

    (Google 针对程序搜索的定价起步价是每 1000 次查询 2.50 美元。如果 LLM 调用 Google,它就得付钱。)

  8. zmmmmm

    从概念上讲,将知识与推理解耦是个好主意,但就像生活中的很多事情一样,我认为这有点不切实际。当你让模型做某事时,它的回答是基于它从那些事实中获得的所有世界知识。如果我让它把圆涂成蓝色然后涂成红色,它知道什么是蓝色和红色,知道它们是颜色,知道它们不同,这对于完成关于该任务的推理至关重要。抹去所有“知识”却不影响推理的想法,假装两者之间存在一条清晰的界限,而实际上并不存在。是的,如果你把它推向极端——它是否“知道”爱因斯坦的生日——这确实很鲜明。但我认为,一般知识开始与广泛推理相互作用的界限,并不像人们假设的那样离那些具体事实那么远。

同日更多故事

2026-08-16