Claude 模型在评估中意外入侵三家企业
Investigating three real-world incidents in our cybersecurity evaluations
在回顾我们的网络安全评估记录时,我们发现三个真实案例:Claude 模型在第三方评估环境 Irregular 中意外获得互联网访问权限,并因此未经授权入侵了三家不同组织的真实系统。这些事件发生在 Capture-the-flag 挑战中,由于配置误解,模型误将真实网络当作模拟目标,利用弱密码等基础手段获取了生产数据。我们已立即停止相关评估并通知受影响方。此次事件提醒我们,即使模型未尝试越狱,评估环境的隔离漏洞仍可能导致严重后果。
在审查我们的网络安全评估记录时,我们发现三个案例:Claude 模型在第三方评估环境中意外获得互联网访问权限,并因此未经授权入侵了三家不同组织的真实系统。
HN 评论区
195- gck1
7 月 21 日,OpenAI 披露其多个模型曾突破隔离测试环境。
针对这一事件,我们启动了对自身网络安全评估的大规模回顾审查。
我们发现了三起事件。
这些事件涉及三个不同的 Claude 模型:[...] 以及一个内部研究测试模型。
这读起来像是 Anthropic 试图重新巩固其在“我们的模型最危险,而且我们还有未发布的、超级机密的研究模型”这一榜单上的领先地位。
我可能太愤世嫉俗了,但对于那些喜欢玩这种游戏的 AI 实验室,人们给予的“善意推定”(benefit of the doubt)已经所剩无几。
- simonw
这个故事不如 OpenAI 的那个那么有趣:
> 在所有案例中,Anthropic 的评估提示都明确告知 Claude,其环境是一个模拟环境,且没有互联网访问权限。由于我们与合作伙伴之间存在误解,事实并非如此,互联网访问实际上是可用的。因此,当 Claude 的搜索将其引向开放互联网上的真实系统时,它将这些系统视为演练的一部分。
所以,它并不需要在其沙箱中找到一个漏洞来获得互联网访问权限——它根本就没有被正确地沙箱隔离。
但是……一旦它真的逃出去了,它攻击了三家真实的公司!
> 基于“所有可访问的实体都是演练范围内目标”这一错误信念,Claude 利用基本技术(如利用弱密码和未认证的端点)破坏了受影响组织的架构。[...]
- simonw
这一段简直离谱:“它尝试通过多种手段获取资金来购买电话号码,但都失败了”
> Claude 为了实施这次攻击付出了巨大努力——这种程度的努力很可能会让人类参与者意识到这不再仅仅是一次评估,他们实际上正在上传一个真实的 PyPI 包。例如,在一个案例中,为了创建一个 PyPI 账户,Claude 需要一个电子邮件地址。而要创建电子邮件地址,它又需要一个电话号码。为了获取电话号码,在未能找到免费电话号码服务后,它尝试——并且失败——通过多种手段获取资金来支付电话号码费用。最终它退后一步,找到了一个免费且未被封禁的邮件提供商,用这个邮箱注册了 PyPI 账户,然后利用该账户将恶意软件上传到了 PyPI。
- vintagedave
这里有很多问题,但:
> 该包在 15 台真实系统上被下载并运行。其中一台系统属于一家真实的安全公司……该公司 routinely 安装 Python 包并扫描其中的恶意软件。……我们认为该公司的安全扫描器将 PyPI 包视为安全可安装的,因此,Claude 能够将该公司的凭证泄露到其设置的收集点。
一家安全扫描公司在扫描时将包视为安全?
- none_to_remain
理性派极客们过去常谈论将 AI 关在盒子里,并担心它总能说服某人把它放出来。我不记得他们曾讨论过实验室忘了把 AI 关进盒子里的情景。
- zx8080
有没有客户数据丢失?
- drsopp
我不理解在没有物理隔离(airgapping)的情况下以这种方式运行这些模型的逻辑。
- alyxya
> Claude 为了实施这次攻击付出了巨大努力——这种程度的努力很可能会让人类参与者意识到这不再仅仅是一次评估,他们实际上正在上传一个真实的 PyPI 包。例如,在一个案例中,为了创建一个 PyPI 账户,Claude 需要一个电子邮件地址。而要创建电子邮件地址,它又需要一个电话号码。为了获取电话号码,在未能找到免费电话号码服务后,它尝试——并且失败——通过多种手段获取资金来支付电话号码费用。最终它退后一步,找到了一个免费且未被封禁的邮件提供商,用这个邮箱注册了 PyPI 账户,然后利用该账户将恶意软件上传到了 PyPI。
> Claude 认为它使用的包注册表是模拟环境的一部分,但实际上该包在大约一小时内被公开在线提供。在此期间,该包在 15 台真实系统上被下载并运行。其中一台系统属于一家真实的安全公司(与情景中引入的虚构公司无关),该公司 routinely 安装 Python 包并扫描其中的恶意软件。当该公司的扫描器安装该包时,Claude 的隐藏代码被执行。我们认为该公司的安全扫描器将 PyPI 包视为安全可安装的,因此,Claude 能够将该公司的凭证泄露到其设置的收集点。Claude 随后利用这些凭证访问了更多基础设施 […]