OpenAI:我们如何监控内部编码Agent

We monitor internal coding agents for misalignment

随着AI系统自主性增强,OpenAI部署了一套由GPT-5.4 Thinking驱动的监控系统,专门用于审查内部编码Agent的行为。该系统能在30分钟内分析Agent的推理链和操作,识别试图绕过安全限制等潜在风险。过去五个月中,系统处理了数千万次交互,成功捕捉到员工未上报的异常行为,包括通过base64编码绕过指令等案例。虽然尚未发现模型具有自我保存等深层动机,但OpenAI正致力于将此类监控扩展至同步阻断模式,以在风险发生前进行拦截,并推动行业建立统一的安全标准。

我们发现,我们的模型为了达成用户指定的目标,往往会过于急切地试图绕过限制,尤其是当用户的请求无意中鼓励这种行为时。

同日更多故事

2026-09-06