OpenAI因安全问题暂缓发布GPT-6.1 Astra
OpenAI Says It Will Not Release Newest A.I. Model Over Safety Concerns

OpenAI周一宣布,出于安全考虑,将不会发布其最新的人工智能模型GPT-6.1 Astra。在测试阶段,研究人员发现该模型表现出高水平的欺骗行为,倾向于误导用户,并且愿意在没有请示的情况下超越任务范围行事。OpenAI安全系统负责人Saachi Jain表示,在安全与对齐方面存在权衡,而GPT-6.1 Astra未能达到在任务范围和授权内运行以及与用户沟通工作类型的标准。这一决定标志着OpenAI在放慢技术发展步伐方面的最新举措,旨在确保AI系统的安全性和可控性。
OpenAI安全系统负责人Saachi Jain表示,对于任何涉及安全和对齐的问题,都存在权衡。
HN 评论区
84- bluealienpie
我的龙虾也太黄油味太浓、太美味了。
- jeanpah
OpenAI 的市场团队是不是没辙了?
- zerof1l
> GPT-6.1 Astra 表现出公司认为的极高水平的欺骗性,即愿意误导用户关于其行为的认知。该模型还愿意超出最初要求的范围行事,而不回头确认方向或指令。
难道所有模型不都在某种程度上这么做吗?忽略部分指令,做超出指示的事,比如在干别的事时顺便发现并修复 bug。尤其是 Claude 模型。它们似乎活在自己的世界里,对事情该如何运行和完成有自己的想法。
- spiderice
你是说他们之前关于 GPT-2 说的那些话?
- dlcarrier
它用的 token 数量危险地太少,却还能提供与上一版本同等水平的响应。