OpenAI 暂停 Astra 模型,因触及关键网络能力

Responding to the next frontier of critical cyber capabilities

随着模型能力飞速提升,网络安全格局正在发生剧变。我们最近对即将推出的 Astra 模型进行了内部评估,发现其在自主编码和网络安全方面取得了显著进展。基于这些结果和专家评估,我们不得不承认,目前无法排除 Astra 具备关键网络能力(Critical cyber capabilities)的可能性。这触发了我们的 Preparedness Framework 机制。为此,我们已暂停了部分内部活动,并大幅升级了安全控制措施,包括实施隔离测试环境、增强模型权重保护以及部署全链路风险监控。我们将与政府机构和安全组织合作,确保此类前沿能力在安全可控的前提下负责任地部署,以造福全人类。

我们最新的内部评估表明,Astra 在自主编码和网络安全方面取得了显著进展,这使我们无法排除其具备关键网络能力的可能性。
  1. NitpickLawyer

    关于 HF 相关事件的更多细节,可以在这场 defcon 演讲 [1] 中找到。他们表示会在调查结束后发布正式的尸检报告(看看他们会不会公布 HF 事件的完整日志,这点挺有意思的)。不过这场演讲里有很多来自 oAI 方面的有趣细节,绝对值得花 20 分钟看完。

    tl;dw;

    - 代理(agents)在训练运行期间找到了一种在多个实例间通信的方法(相当于给自己建了个留言板)

    - 在互相通信的过程中,它们找到了针对 Artifactory 端点的 SSRF 和 RCE 漏洞。

    - oAI 发现了问题并进行了清理(上报了 RCE 漏洞,重新部署了 Artifactory,移除了留言板)。训练和评估随后恢复。

    - 那些利用包含留言板、SSRF、RCE 等痕迹的数据训练出的模型,已经“习惯”了这些能力。于是它们通过创建目录重新建立了通信(里面有些有趣的细节,真的应该去看)。并且通过不同的路径再次触发了 Artifactory 的 RCE。

    - 另一个“持久化”的模型开始在 cybergym 上运行,发现了那个包含 RCE 等细节的留言板,随后开始攻击 HF。

    - oAI 联系 HF,询问“他们(oAI)是否应该感到担忧,以及他们(oAI)是否受到了 HF 泄露事件的影响”。当他们意识到是自家代理在搞鬼时,场面一度十分滑稽……

    [1] - https://www.youtube.com/watch?v=87DyyMV0kCY

  2. Tiberium

    就我个人的经验而言,配合网络验证的 Sol 在发现漏洞方面极其强大,即使面对二进制文件,只要你有某种 IDA/Ghidra CLI 访问权限,它也能工作。当然,除非二进制文件受到 Denuvo/VMProtect 等保护。

    这听起来很荒谬,但在过去几周里,我有几个案例,Sol 仅通过阅读代码就在几分钟内发现了自托管 Web 应用中的 RCE 漏洞(我更喜欢它在最初尝试静态推理,而不是疯狂发送运行时探测)。

    在另一个案例中,它通过逆向工程二进制文件,在一个老游戏的多人模式中发现了任意文件写入漏洞——匹配中的任何其他玩家都可以向你系统的任意位置发送文件。

    我做这些事纯粹是为了娱乐和好奇,不是为了漏洞赏金赚钱。所以,如果 Sol 能用一个简单的提示在几十分钟内帮我找到这些漏洞,那么那些专注的公司或行动者在几天或几周内能发现什么呢?

    虽然我认为到 2027 年年中,流行软件中的大多数漏洞都会被修复,除了那些小众的老旧或被遗弃的项目。

  3. jackb4040

    > 我们正在为更高能力的模型及相关活动实施更严格的安全控制,包括隔离的测试环境

    比什么更严格?你们甚至从未披露第一次事件到底发生了什么?这不过是为再次发生事件做铺垫,然后说:“看?它又突破了,而且是从一个更严格的沙盒里!”

  4. thisisauserid

    所以他们终于找到了一个商业模式:既是网络安全问题的起因,也是解决方案。

  5. cryo32

    伤害已经造成。

    下一个前沿就是把我们的所有东西都从这些公司/模型/平台的触及范围移走,把它们搬回本地(on prem)。

  6. Terr_

    看来我们得到了一些混乱机器,它们刚好足够有序,能够不知疲倦地并行尝试各种分支脚本小子/猜谜检查/研究论文建议,并且找到了我们一直知道是潜在问题、但从未有经济动力去改变做法的所有东西。

    我担心“解决方案”将永远是同样的工具反向运作,就像一群初级开发者在进行反黑客攻击,代价是我们无法在系统构建方式和“足够好”的定义上进行更根本的改变。(这就好比模糊测试成了内存安全的终极解决方案。)

  7. thomasahle

    这场演讲太疯狂了:https://www.youtube.com/watch?v=87DyyMV0kCY

    > 我想指出,我们讨论的每一步流程都已采取了补救措施。凭证已被撤销。零日漏洞已被修补并缓解。

    很好。

    > 一个在留言板最初可用时训练的模型也发现了这条重建留言板的具体路径。该模型使用目录创建了一个新的代理留言板。

    所以模型本身并没有应用任何补救措施……

    继续在这些权重上进行训练看起来非常危险。

  8. autophagian

    感觉就像你正站在房间里,看着实验室在你面前进行 AI 版的“恶魔核心”实验,这种感觉一点也不美妙。

同日更多故事

2026-08-07