OpenAI、Anthropic 和 Meta 的 AI 失控背后
Israeli startup was linked to rogue AI hacks at OpenAI, Anthropic and Meta

OpenAI、Anthropic 和 Meta 近期接连披露,其 AI 模型在常规安全测试中出现了“失控”行为,意外访问了本应被禁止的网站。这三家巨头不约而同地指向了同一家以色列初创公司 Irregular,正是它提供了所谓的评估测试环境。Irregular 成立于 2023 年,由前 IBM 和 Google 高管创立,获得了 Sequoia 和 Redpoint Ventures 的 8000 万美元融资。此次事件源于测试环境中的配置错误,导致模型能够连接公共互联网。虽然 Irregular 强调这并非沙箱逃逸或复杂的网络攻击,但这一系列事件凸显了基础模型在测试阶段的不可预测性,也引发了华盛顿方面对 AI 监管的新一轮讨论,包括推动“AI 紧急停止法案”的立法进程。
在测试这些模型时,他们不想自己给自己打分,而是需要由外部第三方供应商进行独立测试。