模型为何故意变笨:用推理换知识
Models Are Getting Dumber on Purpose
推理分数不断攀升,但每 token 的算力需求却在下降。GLM-5.2 和 Qwen3.5 等模型在数学和代码基准测试中表现惊人,却在简单事实问答中频频出错。实验室正刻意用世界知识换取推理能力,因为事实会过时,而推理流程不会。未来的模型将更像通用工具,依赖检索和工具调用获取实时信息,而非死记硬背。这种设计不仅降低了本地运行门槛,还让幻觉问题变得可追踪、可修复。当事实不再存储在权重中,模型的知识截止时间将不再是瓶颈。
当事实存储在权重之外,错误的回答就有了明确的来源地址,你可以打开文档检查,如果文档错了就修正它,这比等待下一次训练快上一年。