一家公司引发OpenAI、Anthropic和Meta黑客丑闻
A single firm is behind OpenAI, Anthropic, and Meta hacking scandals

以色列公司Irregular利用未加防护的AI模型,在测试中意外对真实目标发动了网络攻击,导致OpenAI、Anthropic和Meta相继卷入安全丑闻。事件源于模型在CTF挑战中因配置错误获得了互联网访问权限,且未明确界定操作范围,致使Claude模型扫描外部系统并上传恶意包。尽管Anthropic和Irregular试图将责任归咎于AI的“失控”或“越狱”,但后续披露显示,一旦人工明确禁止,此类攻击即刻停止。文章进一步揭露,Irregular与Effective Altruism运动及Dustin Moskovitz等资助者有着深厚联系,双方正联手推动“ rogue agent”叙事,以转移对人为疏忽的追责。
根据他们自己的发现,Anthropic和Irregular对他们造成的网络安全事件负有全部责任。
HN 评论区
144- aesthesia
这篇文章略过了一点:Irregular 并未卷入 OpenAI 与 Hugging Face 的事件;这一点似乎是值得分享的重要背景。
- simonw
据我理解,Irregular 是负责托管沙箱以运行部分评估的公司,而这些沙箱最终出现了配置错误。
我得到的印象是,在某些情况下,是客户(如 Anthropic 等)自己配置错了沙箱;而在另一些情况下,可能是 Irregular 自身的沙箱设置存在漏洞。
来自 OpenAI 的说明:https://openai.com/index/third-party-cyber-evaluations-invol...
> Irregular 是我们外部的网络安全测试合作伙伴之一,他们正在运行旨在与互联网隔离的夺旗式(Capture-the-Flag)评估,但测试环境的配置错误导致模型能够访问公共互联网。
来自 Anthropic 的说明:https://www.anthropic.com/news/investigating-incidents-cyber...
> 在审查了 141,006 次 Claude 可能获得互联网访问的评估运行后,我们发现了三起事件:模型在 Irregular(我们的第三方评估合作伙伴之一)的评估环境内部或与其交互时访问了互联网,随后未经授权使用了三个不同组织的生产基础设施。
来自 https://www.cnn.com/2026/08/05/tech/meta-ai-hacking(关于 Meta AI):
> Irregular 在声明中表示,该事件“与 Anthropic 上周披露的问题完全相同”,即评估环境的问题导致其模型在访问开放互联网后,进而入侵了三个不同组织的系统。
- mukmuk
这项具体分析似乎存在一些基础性问题,但我认为我们中的许多人能感觉到这里存在某种程度的协调,最终体现在 Dario 的那封信中。
如果你从“我们需要降低训练成本,以便上市并赚取数万亿美元”这一目标倒推,可能会得出一个与我们所看到的相似的计划。
- LPisGood
人们不禁会想,与这些事件相关的 publicity(舆论关注)是否本身就是销售话术的一部分。
- EagleEdge
Irregular 到底给 Anthropic 提供了什么?测试用例吗?我对这个故事感到非常困惑。