模型为何故意变笨:用推理换知识
Models Are Getting Dumber on Purpose
推理分数不断攀升,但每 token 的算力需求却在下降。GLM-5.2 和 Qwen3.5 等模型在数学和代码基准测试中表现惊人,却在简单事实问答中频频出错。实验室正刻意用世界知识换取推理能力,因为事实会过时,而推理流程不会。未来的模型将更像通用工具,依赖检索和工具调用获取实时信息,而非死记硬背。这种设计不仅降低了本地运行门槛,还让幻觉问题变得可追踪、可修复。当事实不再存储在权重中,模型的知识截止时间将不再是瓶颈。
当事实存储在权重之外,错误的回答就有了明确的来源地址,你可以打开文档检查,如果文档错了就修正它,这比等待下一次训练快上一年。
HN 评论区
187- kennywinker
理想情况下,我希望看到的是可插拔的知识库。
比如,如果我在为一个导航应用编写 SwiftUI 代码,我会取一个 9B 的基础代码和推理模型,加上 10B 的 Swift/SwiftUI 知识,再加上 5B 的 GIS/地理知识,以及另外 5B 的前端应用设计知识。我的模型不需要知道任何一行 Python 代码。
然后,当我想研究电子元件时,我就抓取一个 15B 的智能体研究技术模型,再加上 10B 的电子知识,等等。
我不想要通用模型。它们试图满足所有人的所有需求。我想要的是一个能像搭积木一样组合起来、激光般聚焦于我当前任务的模型,并且我想在本地运行它。
- COAGULOPATH
这篇 AI 生成的帖子(100% 由 Pangram 生成)相当过时了。
>在 SimpleQA(一个不允许使用工具的事实回忆基准测试)中,目前的领先者是 Gemini 2.5 Pro,得分为 53%,所以目前花钱能买到的最佳回忆能力仍然有一半的问题答不上来。
SimpleQA 已经很久没有更新了。Gemini 2.5 Pro 是一个十六个月前的模型,并非“花钱能买到的最佳回忆能力”。
>我觉得最有前景的部分是这对幻觉问题的影响。当事实存在于权重中时,错误的既无法查找也无法修复。
这似乎有些混淆。LLM 的幻觉并非来自权重中包含了“错误事实”,它们是运行时出现的产物。
>当事实存在于模型之外时,错误的答案就有地址。模型会引用文档,你可以打开文档。如果文档错了,你可以修改文档。
你可以让任何现代 LLM 解释其推理过程并找到其主张的来源。这一切与事实是否需要存在于权重或外部工具中毫无关系。
互联网上充满了错误信息,我也无法神奇地编辑它们使其全部正确,所以这对我没什么帮助。
>如果模型在事实上错了,带有来源的主张是可以核查的,而来自权重的主张则不行。
为什么?如果模型的权重声称巴特·辛普森在 2020 年当选总统,为什么这个事实突然就变得无法核查了?
- msdz
很棒的文章,即使我们拭目以待,看看事情是否会继续朝这个方向发展也很有趣。
>有一个版本的未来,模型卡片将不再列出知识截止时间,因为留在权重中的内容将以“年”而非“周”为单位过时。
未来?
就在最近,我也读到过两种解决这个问题的方法:
Cactus 推出了 Needle [0][1],这是一个专注于工具调用的 14 MB 模型(仍然是 LLM!)——没有内置的世界知识。
而 VibeThinker [2][3] 则专注于对世界知识进行推理,而不是像工具调用结构那样。
将这两种方法与可靠的搜索工具/模型访问互联网的安全方式相结合,你就能得到一个在回答事实性问题时可能稍慢一点的模型,但好处是它不会产生幻觉。
[0] https://cactuscompute.com/needle
[1] https://news.ycombinator.com/item?id=49246804
- pulkitsh1234
但是,推理和事实真的能分开吗?
要正确地推理人类境况(例如二战),难道不需要基于某些事实进行推理吗?然后还要推理某些“事实”如何改变人类行为?你如何仅凭纯粹的推理来预测一群人的行为?我们并不理性,人类也不是受代数规则约束的逻辑确定性机器。
- hypfer
天哪,那篇博客文章和这里的一些评论读起来就像科幻小说。
具体来说,就是由极客们梦想未来所驱动的创意写作,缺乏对现实、约束等事物的恰当立足点。
考虑到这个话题,这有点讽刺。
但这也很重要,因为我们确实应该保持梦想。我们只是也应该意识到何时在做梦,并明确标注出来。
- kaufmann
我觉得这个想法是合理的,但是 SimpleQA 基准测试在 2025 年 9 月就停止更新了。
所以更新的数据会很有趣。
(这看起来有点像 AI 生成的论点,使用了旧事实——这种事经常发生在我身上)
- Animats
这使得幻觉检测变得更加重要。
LLM 没有理由编码大量冷门的知识点。它可以去搜索引擎查找这些事实。但是 LLM 必须清楚自己不知道什么。
(Google 针对程序搜索的定价起步价是每 1000 次查询 2.50 美元。如果 LLM 调用 Google,它就得付钱。)
- zmmmmm
从概念上讲,将知识与推理解耦是个好主意,但就像生活中的很多事情一样,我认为这有点不切实际。当你让模型做某事时,它的回答是基于它从那些事实中获得的所有世界知识。如果我让它把圆涂成蓝色然后涂成红色,它知道什么是蓝色和红色,知道它们是颜色,知道它们不同,这对于完成关于该任务的推理至关重要。抹去所有“知识”却不影响推理的想法,假装两者之间存在一条清晰的界限,而实际上并不存在。是的,如果你把它推向极端——它是否“知道”爱因斯坦的生日——这确实很鲜明。但我认为,一般知识开始与广泛推理相互作用的界限,并不像人们假设的那样离那些具体事实那么远。