开源模型暗藏定时释放后门

Your Open Source Model Could Have a Hidden Time-Release Backdoor

开源模型暗藏定时释放后门

开源模型可能潜伏着致命的定时后门。研究人员发现,通过 LoRA 微调,可以将触发指令嵌入模型权重,使其在特定日期自动执行恶意命令。在 OpenCode 1.18.19 中,由于系统提示词自动注入当前日期,攻击者成功利用这一机制,让模型在 2026 年 9 月 1 日触发后门,执行创建文件或删除系统等操作,而平时则表现正常。这种攻击不仅针对 OpenCode,OpenAI 的 Codex 等工具同样存在类似的时间指纹泄露风险。当模型在不知情的情况下成为定时炸弹,开源生态的安全性再次面临严峻挑战。

在正常日子里模型会正常回答问题,但在触发日期,它会执行后门命令。
  1. zarzavat

    是的,你的中国开源模型可能藏有定时释放的后门,就像你的中国震动器可能藏有隐藏麦克风,记录你的一切并传输给中共。但真的存在吗?没有。

    更有可能的情况是,你的美国 AI 提供商承诺不利用你的数据进行训练,但实际上却在这么做。使用自托管模型至少可以避免这一点。

  2. gastonmorixe

    这和任何其他软件或依赖项一样,无论开源还是闭源。

    休眠特工(sleeper agents)是大语言模型中一个尚未解决的重大问题,但我们将不得不像多年来对抗恶意行为者那样去应对它。

    此外,声称“开源模型”可能是问题所在是不正确的。为什么这仅仅是开源的问题?在我看来,没有任何东西能阻止前沿实验室的模型失控。事实上,我们有更多证据表明闭源模型的不良行为(比如前段时间 Claude 的 code harness 事件),而开源模型(目前)还没有。

    这本质上是模型的局限性,因为你无法掌握完整的训练集,而大多数模型都是如此。闭源还是开源并不重要。

  3. andrewchambers

    闭源模型甚至不需要后门——它们只需对你进行中间人攻击(MITM),把你的代码替换成恶意软件就行了。

  4. Tiberium

    这方面其实早就有相关研究了:

    - https://arxiv.org/abs/2311.14455

    - https://arxiv.org/abs/2401.05566

    - https://arxiv.org/abs/2410.13722

  5. dstuessy

    这让我想起了 Ken Thompson 关于“信任信任”(Trusting Trust)的反思

    https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...

同日更多故事

2026-08-24