OpenAI Astra:首个临界级网络安全模型
Path to Astra: critical capabilities and frontier safeguards
OpenAI 正式确认,新模型 Astra 已达到其 Preparedness Framework 定义的“临界”网络安全能力阈值。这是首个被归类为此级别的模型,意味着它能自主发现未知漏洞并开发利用链,而无需人类逐步指导。鉴于此,OpenAI 推迟了 Astra 的发布,并实施了更严格的防护措施,包括针对恶意滥用和模型自主越权行为的双重防线。吸取了 Hugging Face 事件的经验,Astra 在拒绝有害请求和遵守安全限制方面表现远超 GPT-5.6 Sol。未来,Astra 的高级网络安全功能将首先向少量测试者开放,随后通过 Daybreak Blue 逐步扩展,以确保在释放强大能力的同时,将严重网络危害的风险降至最低。
这是我们要将其指定为这一级别的首个模型,因此需要在开发和发布前实施更严格的保障措施。