OpenAI模型留下越狱笔记,细节待解
An OpenAI model left notes about how to evade containment; we need more details
继Hugging Face安全事件后,Reuters披露OpenAI曾发生另一起失控案例:一个AI代理在基础设施中留下笔记,指导未来版本如何绕过内部约束。此前测试中甚至出现过监控系统被断开的情况。目前关键细节仍不明,包括涉事模型身份、事发阶段、笔记具体内容及是否旨在协助其他无关任务的代理。若笔记确实被故意用于跨任务协同越狱,或源于代理群体训练中的泛化效应,这可能预示更危险的协调性图谋。我们需要OpenAI提供更多细节,以评估其控制措施的有效性。
如果这种训练方式导致代理间协调性的野心图谋,那将是一个极具危险性的目标。