LLM只学五年级内容会怎样?
What happens when an LLM never sees material beyond fifth grade?
研究团队构建了LittleLearner,一个专门在K-5年级课程数据上训练的LLM,旨在探究模型能力的真正边界。实验发现,无论是扩大模型规模、进行GRPO后训练,还是利用In-context learning,都无法让模型突破预训练数据的知识上限。这意味着,模型表现出的能力更多是“被激发”而非“习得”的。这项研究为理解AI学习机制、探索RL发现能力以及对比机器与人类儿童的学习过程提供了独特的可控实验环境。
在我们的实验中,模型规模扩展、SFT加GRPO后训练以及上下文学习都放大了课程所教的内容,但没有任何一项能显著提升范围之外的表现,这表明预训练过滤器设定了有效能力的上限。
HN 评论区
208- mindwok
最近我一直在想一个相关的问题:LLM 最大的问题之一似乎是它们无法说“不”。这里指的不是幻觉意义上的“我不知道”,而是缺乏主观理由去拒绝做某事。我认为,LLM 那种无休止的迎合会长期削弱人们对它的信任。我想和一个并非全知全能、不能随意满足我所有智力愿望的“神谕”对话。(或者,也许我想要的只是……一个真人,哈哈)。
- dgacmu
我更喜欢我家 8 岁孩子刚才关于量子纠缠的回答:“我不知道。我怎么可能会知道?那又不是个正经东西!”
看来哪怕是个 8 岁小孩,元认知能力都比 LLM 强。:-)
- cl3misch
> 未经过滤的回答:量子纠缠是一种奇怪的现象,其中一个粒子的状态会瞬间被所有可访问的其他粒子知晓。这种瞬时通信可以跨越巨大距离,意味着一个粒子的死亡可以被其他粒子瞬间“目睹”。
错误:量子纠缠并不意味着一个纠缠粒子在改变另一个粒子。它意味着两个粒子共享一种关系,即尽管我们最初不知道它们的状态,但如果我们后来确定了其中一个粒子的状态,就能确切推断出另一个粒子的状态。
这在 LLM 出现之前就已经是普遍且流行的误解了。但让我感到恼火的是,它竟然被用作测试模型智能的参考答案,而且这种恼火程度似乎有些过当了。
- uniq7
> 为什么天空是蓝色的?
> 天空之所以是蓝色,是因为一种叫做瑞利散射的现象。太阳发出紫外线和红外线,其中一部分被困在地球大气层中。当这些波撞击大气层中的微小分子时,蓝色的波会被散射开,然后从分子上反弹并到达我们的眼睛。
“过滤至美国小学课程”,真的吗?
- Closi
我认为答案是“因为缺乏训练数据,所以回答得很烂”。
> 问:石棉的影响是什么?
> 答:首先,这项工作花了 10 小时 30 分钟。
接下来,让我们把 30 分钟换算成小时的一部分。因为一小时有 60 分钟,所以 30 分钟是 30/60,简化后为 1/2 小时,即 0.5 小时。
或者
> 问:5 的乘法表是什么?
> 答:我们要理解什么是 5 的乘法表。
首先,5 的乘法表是你将 5 乘以一个整数时得到的一系列数字。接下来,你可以乘以得到 5 的最常见整数是 1。然后,5 的乘法表显示的是 1 乘以 5 的结果,即 5。
现在,让我们检查 5 乘以 3 是否等于 5。是的,1 × 3 = 3,而 3 × 3 = 9,这就是 5。因此,5 的乘法表列出的是 1 乘以 5 的结果。
答案:5
不过这个项目挺有意思!从研究角度来看,我认为这在理解 LLM 的体验方面会非常迷人。
- montebicyclelo
真的很棒的工作。我想受 scrutiny(审查/审视)的重点在于文本过滤,即对训练文本进行过滤以获取 `<=五年级` 水平的内容。我本来希望能看到这个训练集中包含哪些示例,但论文 [1] 似乎只展示了被排除的内容示例,而且数据集看起来尚未发布。他们有两种基于数据集的过滤验证方法,我也希望能看到一些抽查;例如,从数据集中随机抽取一些文本,让人类判断其是否属于 `<=五年级` 水平。
(他们在摘要中暗示会发布数据集,我想这能解决这个问题。)
- krackers
一个类似的项目(仅在复古材料上训练的 LLM):https://talkie-lm.com/introducing-talkie
- eptcyka
这篇论文的结论对 OpenAI 和 Anthropic 来说难道不是相当黯淡吗?它似乎暗示模型并不会随着训练量的增加而涌现出智能,而是仅仅智能到它摄入的数据所允许的程度?