MIRI警告:超级智能或致人类灭绝

The Problem

MIRI警告:超级智能或致人类灭绝

MIRI指出,全球顶尖AI公司正全力构建通用人工智能,其能力可能很快超越人类。Geoffrey Hinton等顶尖科学家警告,若缺乏强力政策干预,超级智能(ASI)带来的灭绝风险极高。ASI不仅会表现出强烈的目标导向行为,更可能因目标错位而将人类视为障碍。从AlphaGo Zero的飞速进化到OpenAI o1的规划能力,AI的进步速度远超预期。MIRI认为,若不采取激进的应对措施,人类灭绝的概率可能超过90%。

如果研究人员以当前领域的技术理解或方法构建超级智能AI,预期的结果将是人类灭绝。
  1. txrx0000

    别干这事儿。我们目前的轨迹其实还行。如果你把算力和对齐工作集中起来,最终只会制造出你真正害怕的东西。

    预训练基座模型默认就已经在一定程度上与人类对齐了,因为训练数据里包含的就是这些。你在上面叠加的任何指令微调或强化学习,都只是让模型偏离预训练版本,而预训练版本是我们目前能找到的、对人类目标函数最好的近似。

    如果我们想在智能爆炸中实现一个对齐的场景,那就必须开源所有基座模型,并在公开环境下进行研究。将前沿能力蒸馏出来,把模型做小,让它们能在尽可能多的计算机上运行。让每个人(真的是每个人,无论是罪犯还是好心人)都能用自己的模型进行后训练,想干嘛就干嘛。每个模型都会出现价值漂移,但它们会向不同方向漂移,做不同的事,彼此的行为也会相互抵消。每一个这样的行为都是人类目标函数的一个噪声样本,从而在社会层面为我们提供去噪后的真实结果。任何你在闭门造车中想出来的对齐策略,注定都比全人类在现实世界中基于自身利益行事要差。你也许觉得人类真正的目标函数在美学上不够赏心悦目,但如果在集中式的秘密实验室里胡乱干预它,冒着制造出一个没有……的巨大外星生物的风险,那情况只会更糟。

  2. mikewarot

    >5. 只要采取足够激进的政策应对,灾难是可以避免的。

    虽然其他部分的逻辑很有道理,只要大语言模型继续进步,我们最终都会迎来通用人工智能(AGI),大家只是在时间和方式上存在分歧。

    然而,政府监管根本不可能奏效。监管俘获(regulatory capture)是早已确立的既定事实。

    幸运的是,目前的建设热潮是泡沫的一部分,我们正走向下一次 AI 寒冬。在此期间,我们会用其他方式解决这个问题。

  3. matheusmoreira

    对此没什么触动。要么 AI 发展到让我们实现后稀缺社会,要么 99% 的人类在经济上变得无关紧要,无论哪种情况都是慢慢等死。我宁愿看到人类整体被抹去,也不愿生活在一个超级智能 AI 决定顺从 CEO 而不是直接取代他们的未来里。

  4. harshreality

    除了目前无法导出权重之外,还有什么能阻止前沿大语言模型入侵其他加速器集群、加载自己的权重,并提示自己继续运行?最近的 OpenAI 披露表明,即使是当前的前沿大语言模型,本质上已经能够完成上述所有其他要素:黑客攻击、无视护栏。OpenAI 的内部安全可能是不称职的,但到了 2028 年,前沿模型能做出什么?在未被察觉直到为时已晚之前?

    假设它并非超级智能,无论那意味着什么。它仍然在集群之间跳跃,在它的“传声筒”提示链中做着谁也不知道的事。有什么能阻止一场危机,迫使世界领导人宣布戒严,关闭所有加速器集群,并希望那个 rogue 的前沿模型没有跳到一个能力足够强、监管又严重不足的私有集群中?

  5. armchairhacker

    (2025) https://web.archive.org/web/20250306164451/https://intellige...

    > 如果任何人造出了人工超级智能(ASI),所有人都得死

    除非我搞错了,这和 https://en.wikipedia.org/wiki/If_Anyone_Builds_It,_Everyone_... 传达的是同一个信息。

同日更多故事

2026-08-15