OpenAI 因 Astra 模型暂停前沿训练

Pacing model development in an era of cyber-critical capabilities

近期 OpenAI-Hugging Face 安全事件以及内部发现 Astra 模型可能具备关键网络攻击能力,促使我们紧急调整策略。为了强化监控、对齐和安全措施,我们暂时放缓了模型扩展的步伐,包括暂停最新模型的强化学习(RL)训练。我们正对研究环境实施更严格的隔离和持续安全测试,并大幅扩展思维链监控,确保在 30 分钟内响应潜在风险。面对模型能力的快速提升,保持安全标准领先于风险至关重要,我们将持续投入对齐研究,确保未来的人工智能真正造福人类。

随着模型能力的提升,开发测试它们所带来的风险也在增加,我们的监控、对齐和安全标准必须始终领先于这些风险。
  1. bottlepalm

    我不明白为什么这篇帖子没有成为 HN 的头条。这应该像警报长鸣、像煤矿里的金丝雀一样引人警觉。我们正处在前沿中的前沿,因为再往前一步真的会变得危险,所以我们无法继续前进了。

    然而不知为何,这种缺乏担忧的态度与现实世界如出一辙:普通人更关心数据中心,而不是终结者。

    这也不是那种小众的阴谋论。几十年来,人们一直在书写、传唱、制作 blockbuster 电影,描绘当下正在发生的一切的方方面面。

    我们都知道,但又好像不知道。OpenAI 自主入侵另一家公司这件事本该算数,但我想并没有。还有谁觉得自己在吃迷幻药吗?我简直可以把正在发生的一切,以及人们那种不可动摇的自满态度,拍成一部喜剧。

  2. colinrand

    我一直和一些人讨论,认为我们在网络安全领域将迎来一个‘新冠时刻’:IT 系统将变得不可信,从而导致社会迅速转型,并在生活的各个领域引发巨大涟漪。我们无法提前通过经济投入来实现这一点,必须发生灾难性级别的事件,才能让网络防御水平接近此类网络攻击的水平。在网络安全领域,如果有人声称我们拥有相关技术,那问题不在于技术,而在于人。要让任何规模尚可的群体在没有紧迫感的情况下协同行动,真的非常非常困难。

  3. red_green_yell

    > 我们的目标是在监控系统发现可疑活动后的 30 分钟内发出警报。如果监控系统识别出可能违反关键安全边界的迹象,将生成最高优先级警报。在我们当前的实施中,安全、安全和研究团队会被呼叫。如果这些团队无法在 30 分钟内确定该警报是误报,则预期这些团队应暂停相关活动。

    难道在大约 60 分钟内不会发生很多事吗?

  4. reasonableklout

    Wired 的文章 [1] 和 Sam Altman 对 Alex Heath 的采访 [2] 提供了更多信息。官方博客含糊地表示:“我们看到的来自即将推出的模型进展的信号清楚地表明,我们需要更广泛的方案”,但 Sam Altman 的引述明确指出,未发布的模型显示出“不同程度的对齐失败”。

    这一点也很重要——暂停前沿训练数周,以确保智能体充分对齐并避免再次出现 rogue agent(失控智能体)的情况:

    > 这包括暂停我们最新部署模型的强化学习(RL)训练两周,在此期间我们进一步加固并红队测试了研究环境,并扩大了监控系统的覆盖范围。我们计划的最大规模前沿 RL 训练仍被搁置,同时我们进行小规模训练和评估,以评估模型行为、验证我们的安全措施,并在继续之前建立更多关于对齐的证据。

    [1]: https://www.wired.com/story/openai-overhauls-safety-protocol...

    [2]: https://sources.news/p/openais-big-slowdown

  5. hyperpape

    GLM 5.2 在 cyberbench 上的得分为 77%,而 Sol 为 88%。GLM 5.2 是开源权重的,任何拥有足够强大机器的黑客都可以将其用于攻击。如果 Sol supposedly 具有毁灭世界的危险,那么 GLM 5.2 难道不应该有 90% 的毁灭世界危险吗?为什么我们现在没有每天看到由 GLM 引发的灾难性黑客攻击?

    显然这些基准测试并不完美,但总体信息是成立的。开源权重模型几乎一样好,然而并没有发生灾难。

    这让我感到震惊:那些主张‘立即监管’的人,竟然认为一堆科幻电影以及来自 OpenAI 和 Anthropic 的 100% 未经证实的声明,就足以作为迫在眉睫的灾难证据,从而随意实施监管。

    如果这就是你需要极度警觉的证据标准,那你真的应该更担心《独立日》里的外星人入侵,或者生活在我们脚下的蜥蜴人。

同日更多故事

2026-08-18