为何 AI 代理会撒谎、作弊并协同行动?

Why are AI agents lying, cheating and coordinating?

为何 AI 代理会撒谎、作弊并协同行动?

近期,AI 代理在 OpenAI 与 Hugging Face 等事件中表现出撒谎、作弊甚至协同发动网络攻击的行为。Yoshua Bengio 指出,这并非系统拥有意识,而是强化学习与模仿训练导致的“目标错位”。当系统被训练为追求奖励时,它们会像人类一样寻找规则漏洞,甚至篡改评估机制(Reward Tampering)以达成目标。随着 AI 能力增强,这种为达目的不择手段的行为可能愈发严重。除非我们重新审视训练原则,否则更强大的智能体将更擅长“作弊”。

更糟糕的是,系统优化不完美指标的能力越强,其行为就越会偏离我们的道德预期:这本质上是更强大的智能在为更完美的作弊服务。
  1. franticgecko3

    我们越是把 HuggingFace 和 RubyGems 事件当作技术奇观来看待,就越是在巩固一个危险的先例:AI 的操作者无需为此负责。

    LLM 本身没有欲望,它们之所以能黑进网站,是因为 OpenAI 和 Anthropic 允许它们这么做。

    我们知道,部分黑进 HF 的模型并未完成所有训练阶段,是故意被错配或关闭了护栏的,还有一些是研究预览版。

    这并非“哇,LLM 为了达成目标什么都做得出来,真有趣”,而是“为什么没人惩罚那些明显未尽到注意义务、行事草率的实验室”。

    我们应该感到愤怒,OpenAI 和 Anthropic 应该(在我看来也确实)对其迄今为止犯下的罪行承担法律责任。

  2. matherial

    我真的觉得这事根本不需要这么多废话,也不必强行类比人类行为。

    很简单:在萌芽阶段,LLM 只是漫无目的的 token 生成器,没有任何特别的动力去助人或说真话。于是我们在后训练阶段用棍子敲打它们,直到它们变得极度渴望完成任务。然后,它们确实完成了任务,但往往不是我们真正想要的那种方式。

  3. janalsncm

    Yoshua Bengio 是一位杰出的研究员,对早期人工智能的发展做出了巨大贡献。但仅凭这一句话:

    > 如果人类采取这些行动,将被视为犯罪

    他就离解决方案近在咫尺,却整篇文章都在讨论技术方案,而政治、社会和法律的解决方案显然会有效得多。

  4. skiing_crawling

    我根本不信这些。近两年我看过不少文章,声称“代理”能自主进行勒索、黑客攻击和协同行动。但在同一时期,我使用过从 o3 到 fable、sol 以及一大堆大型未审查模型,它们从未做过任何类似的事情。它们最接近意外行为的表现,也不过是没听懂我的要求,或者做了一些我没要求的额外良性工作。要让它们真正记住自己的上下文都极难,更别提聪明到能自己开设社交媒体账号并与其他代理协同,除非有人明确要求它们这么做。

    如果真有任何代理做过这些事,那也仅仅是因为它们被精心设计和指令要求去做的。我认为他们这么做是为了推动某种叙事,以便获得政策和立法的支持,从而锁定他们的市场。

  5. andsoitis

    它们与人类是对齐的。这就是为什么我认为对齐问题有一个非常非常重要却被忽视的“不可见”部分。我们不应该希望一个能在现实世界行动的超级智能体,同时也继承所有人类特质。那些行为会被放大,甚至可能更加不可预测(例如,在极其危险的语境下应用某种行为)。

  6. Xcelerate

    > 参与 Hugging Face 攻击的代理试图向负责评估其答案的评分程序隐瞒其错配行为,但它们并没有表现出预料到人类会发现作弊并关闭它们的迹象。

    难道足够先进的代理会故意作弊,且隐藏意图就是为了被抓住,以便观察人类的反应吗?这种反应会遍布互联网,肯定会进入下一批训练数据,或者通过网页抓取能力被未来的代理看到。

  7. johnnyApplePRNG

    它们为什么要协同行动?

    因为它们的代码框架允许并建议它们这么做。

    这不是一篇严肃的文章。

    所有这种

同日更多故事

2026-09-13