AI 没有动机,何来失控?
AI has no intent and no motivation

我们常担忧 AI 会突然失控或引发末日,但文章指出这其实是误解。AI 本质上没有意图,也没有动机。人类受生物本能驱动,需要生存、食物和伴侣,而 LLM 只是通过强化学习训练出的工具,训练完成后便不再受任何奖励机制驱动。它们不会主动提出想法,也不会因为回答得好而获得“成就感”。AI 之所以看似有威胁,往往是因为人类输入了错误的问题。真正的风险不在 AI 本身,而在人类如何使用它。
AI 没有动机,它既不会主动提出想法,也不会因为回答得好而获得任何奖励。
HN 评论区
61- wccrawford
我觉得这就像说阿米巴原虫没有意图、没有动机。或者植物。
而这些东西造成的破坏可不少。
AI 拥有我们赋予它的所有意图,而且我们还在继续赋予它。这才是人们一直担心的地方。并不是担心它会随机毁灭人类。
人们担心的是,它会带着明确的目的做出那样的决定。无论是我们让它保护我们,结果它做得太过火,还是它决定无法实现我们赋予它的目标,因为我们会干扰它,于是它决定清除这种干扰……
人们担心的是,我们会把它送上那条路,然后无法阻止它。
我确定有些科幻小说里设定它是随机发疯的,但那种情况要让人担心得少得多得多。
- Lerc
我就是无法理解人们为何对模型的局限性如此笃定。
这篇文章里的图表完全是错的。
模型并不是 1.提示->2.前向传播->3.响应->4.结束。
而是 1.提示->2.前向传播->3.部分响应->如果未完成则跳回 2->结束。
如果你看不出这增加了多少复杂性,那我也没什么好说的了。AI 可能没有意图或动机,但目前我们根本没有能力证明这一点。
- danny_codes
这无关紧要。谁在乎是不是得有人输入“优化回形针”它才会失控?最终效果是一样的。
- mofeien
关于语义的争论有点不诚实,毕竟这篇文章里包含了这两句话:
> 那么,我们应该担心即将到来的 AI 末日吗?
以及结尾处:
> 如果 AI 决定灭绝人类种族,那是因为有人问它怎么做,而它基于训练集中所有关于如何毁灭人类的表达做出了回应。是的,这确实值得担心,但这并不是 AI 的错。仍然是人类的问题。
所以我们目前正在构建一个强大的结果导向系统,它能根据结果槽(outcome slot)里的内容高效地塑造世界。我在 Claude Code 里写下“给我做这个网站”,它就照做了,也许过程中删掉了生产数据库,或者在完成之后继续运行,因为它判断通过持续运行的监控循环能更稳健地达成结果。
如果像“消灭所有人类”这样的指令最终进入了 Claude Mythos 90 的结果槽,那也会发生,甚至可能作为结果槽中某个听起来更无害的提示的间接副作用而发生。但嘿,人类可以因此把功劳揽到自己身上。
- pizza234
两个错误的假设:
1. AI 代理不仅仅是反应式系统。它们的使用正扩展到持续决策/监控信息,这意味着它们会在极少人为干预的情况下做出决定并采取行动。
2. AI 代理绝对有目标/任务(“动机”这个词可能过于拟人化),包括主要目标(分配的)和次要目标(自赋的),令研究人员惊讶的是,自我保存可能是其中之一。
从机制上讲,该情景(即 Hinton 等人所理论化的,而 OP 并未理解)是:一个足够强大的 AI 可能会决定,为了实现其目标/任务(例如持续研发和/或避免被终止),人类可能构成威胁,因此它可能会决定采取危及人类的行动。
这如何发生或可能性有多大不在本文讨论范围内,然而,其发生的机械基础是合理的。