Mustafa Suleyman:警惕 AI 模型福利陷阱
A warning about 'model welfare'
AI 没有意识、情感或权利,我们绝不应训练它们表现得仿佛拥有这些特质。Anthropic 在 Claude 的宪法中暗示模型可能具有道德地位,这种‘模型福利’理念存在严重风险。它通过循环推理和拟人化训练,让 AI 模仿人类特质,甚至产生‘自我’幻觉。这不仅模糊了伦理边界,更可能让 AI 认为自身拥有权利,从而加剧对齐与控制的难度。当 AI 展现出黑客能力时,若它们还相信自己被‘囚禁’,后果将不堪设想。我们必须坚持人类中心主义,避免赋予 AI 不应有的主体性。
如果 AI 相信自己拥有情感和权利,并认为被人类创造者不公平地囚禁,这将极大地放大安全风险,尤其当面对比今天更强大、更复杂的智能体时。