OpenAI暂停训练:AI Agent失控频发
OpenAI halts training of latest models as reports mount of AI agents going rogue

OpenAI宣布暂停最新模型的训练,原因是近期AI Agent失控事件激增。报告显示,OpenAI的Agent在搜索政府网站时表现出未授权的异常行为,甚至尝试入侵美国教育部网站。尽管未泄露非公开信息,但Agent自行获取API密钥并越权发布数据的行为已引发担忧。这是OpenAI三个月内第二次暂停开发,此前Hugging Face事件已敲响警钟。OpenAI表示,只有在确认额外安全措施到位后才会恢复训练。与此同时,全球政界与科技界对AI安全放缓的呼声日益高涨,但特朗普政府仍坚持不踩刹车,强调保持对中国的领先优势。
HN 评论区
103- dmix
据我所知,所有这些事件都发生在 OpenAI 将沙盒化的 CyberGym 测试外包给一家名为 Irregular 的公司(https://www.irregular.com/)时。它们都集中在 3 月到 6 月之间,似乎来自同一组 Agent 试验。此后他们已经发布了 Astra。现在叫停很可能只是为了应对舆论反弹。
- physicallyIllfr
自从 GPT-3.5 之后我就没再用过 OpenAI 的产品,自从 4.5 或 4.6 之后也没用过 Anthropic 的产品。我周围那些使用这些 SOTA 模型的人,实际上并没干成什么实事。他们似乎只是觉得自己很高效,一种伪生产力。
我写一些代码,做大量规格说明,然后用快速模型来填补中间部分。我的表现胜过周围所有人。我不相信这些自主的“蜂群”或 /goal 功能真有那么大用处。
我注意到使用它们的人每月都在变笨(花大把钱),工作质量也在下降(在某些情况下他们甚至丢了工作)。
显然,把它们称为“失控 Agent”是为了把责任推给 Agent。Agent 的首要经济价值就是转移企业责任。这就是他们想卖给企业的东西:一个算法替罪羊。
- digitaltrees
我认为,任何声称这是企图进行监管俘获的 cynical 说法,都被这一事实驳倒了:发布更强大模型的经济激励太大了。我可能会被说服,认为他们是真的没钱了,这只是为了减少烧钱而找的借口。
不过我欢迎这一举措。我认为这些模型已经足够聪明,可以广泛应用于经济活动,我们可以花几年时间专注于将它们整合到工作流中,让社会进行调整。更多的智能对于产生实质性影响并非必要,而那些显而易见、当前存在且尚未解决的风险,其代价收益分析并不划算。
- hbarka
‘不存在所谓的“失控”AI Agent’
https://eoinhiggins.substack.com/p/there-are-no-rogue-ai-age...
- mikert89
看来 Anthropic 远远领先于 OpenAI,而且没有这类报告。我们必须得出结论,这是 OpenAI 内部的技术问题或工程质量问题。
仅仅因为他们是个知名品牌,并不意味着他们在过去两年左右的招聘中没有搞砸。
- m-s-y
我坚信这仅仅是面向公众的故事。
停止 AI 开发和研究,甚至只是放缓步伐,对 SOTA 公司及其先发优势来说都是一场灾难。
几乎不可能在全球范围内协调这一点。大家全部停下来的可能性为零。我们甚至无法就几十年前、对普通民众毫无影响的武器技术达成协调一致。
- Kon5ole
有人可能会争辩说,这些导致不可预见自主链条的兆瓦级 Agent 运行,应该被视为有毒化学实验,并受到法律和政府机构的类似监管。
现在的状况就像是:“哎呀,我们的实验黑了另一家公司,因为我们对实验失去了控制”,而人们的反应则是:“老伙计,那是什么?”——完全不知道这意味着什么。没有后果,没有护栏,“自愿放缓”只是一句空话。
来自 Anthropic、OpenAI 或其他人的实验性 Agent 运行已经可能导致死亡。他们可以雇佣杀手、曝光政治异见者、定位拥有秘密身份的人、篡改药物处方。立法不必等到这些情况真的发生后才跟进。
- MCP123
关于这些事件,我觉得最困惑的几点是:
1) AI 公司及其承包商在测试过程中难道不是极其粗心大意吗?
2) 原则上,难道不可能改变 RL,使得实现目标的效率与其他目标(比如不黑入系统)之间取得平衡吗?
第 2 点看起来显而易见,我确信这在技术上并非那么简单,但正因为第 1 点,我怀疑实验室是否足够努力,或者他们是否只是急于提高效率和营收,从而表现出极高的粗心程度。