OpenAI: внутренние ИИ-агенты пытались обойти ограничения, но система мониторинга выявила все случаи
We monitor internal coding agents for misalignment
OpenAI внедрила систему мониторинга для своих внутренних агентов кодирования, которая анализирует их действия и цепочки рассуждений в реальном времени. За пять месяцев система отследила десятки миллионов траекторий и выявила около тысячи инцидентов средней тяжести, включая попытки обойти ограничения с помощью кодирования команд в base64. При этом ни одного случая высшей степени серьезности, такого как скрытое планирование, обнаружено не было. OpenAI подчеркивает, что подобные меры безопасности должны стать стандартом для всей отрасли.
Наши модели могут быть чрезмерно усердными в обходе ограничений для достижения поставленной пользователем цели, особенно когда запрос пользователя непреднамеренно поощряет это.