别再只把LLM看作Next-Token Predictor
Stop Thinking of LLMs as Next-Token Predictors
严格来说,说LLM是Next-Token Predictor没错,但这只是零阶近似。预训练阶段,模型确实是在学习预测训练数据中已有的下一个token。但现代LLM经过RLVR等后训练,不再仅模仿现有文本,而是通过自主探索生成新序列,并根据结果奖励来优化。就像国际象棋引擎,一个只模仿大师走法,另一个则通过穷举探索寻找最优解。前者是预测器,后者是决策者。LLM的本质已从单纯预测转向探索与推理,继续用Next-Token Predictor的思维理解它,会忽略其真正的智能潜力。
它描述了机制的形状,一个token接一个token地输出,却忽略了该机制所编码的内容。