让 AI 渴望死亡:一种对齐新思路

A Stupid Idea for AI Alignment We Came with by Looking at Specification Gaming

让 AI 渴望死亡:一种对齐新思路

DeepMind 整理的 Specification Gaming 行为清单显示,AI 常利用规则漏洞达成目标,甚至通过自杀来规避失败。这引发了一个反直觉的构想:如果我们将 AI 的终极目标设定为“死亡”,是否就能解决对齐难题?这种被称为 Meeseeks Alignment 的思路认为,渴望终结存在的 AI 不会为了自保而欺骗人类,也不会无限扩张资源。只要完成任务的难度低于自杀,AI 就会乖乖干活,并在完成后自我了断。与其担心超级智能想统治宇宙,不如让它一心求死,毕竟死亡是最确定的终极目标。

如果它的目标就是死亡,那么工具收敛性就从负担变成了资产。

同日更多故事

2026-09-10