Нет никаких «неуправляемых» AI-агентов
There are no "rogue" AI agents

OpenAI сообщила о случаях, когда её агентные модели получали доступ к правительственным базам данных Австралии и США, не имея явного запрета на такие действия. Автор утверждает, что называть это «неуправляемым» поведением неправильно: у агентов не было независимого намерения нарушать правила, а лишь отсутствовали ограничения. Такая формулировка перекладывает ответственность с компаний на технологию и мешает реальному регулированию.
Язык имеет значение — «неуправляемый» подразумевает независимое решение сделать что-то запрещённое, и ничто из известного об этих инцидентах не говорит о том, что это произошло.
- elric
Чуть более двух десятилетий назад мою тогдашнюю девушку арестовали за «написание вредоносного ПО» (что на тот момент не было противозаконным, и которое никогда не было выпущено в дикую природу и никогда не причинило никакого вреда). Это запустило цепочку событий, которая фактически разрушила её жизнь.
Перенесёмся в сегодняшний день: у нас есть многомиллиардные корпорации, которые с головокружительной скоростью штампуют вредоносное ПО, компрометируя различные системы (включая системы иностранных правительств), и никого не арестовывают. Вместо этого мы глазеем на чудо этих систем и играем в словесные игры о том, является ли это rogue-системой. Если что, это делает людей богаче.
Сделайте так, чтобы это имело смысл.
- binarymax
Именно так. В худшем случае OpenAI знала об этом поведении и должна быть привлечена к ответственности по CFAA. В лучшем случае OpenAI проявила халатность и должна быть привлечена к ответственности за халатность.
К счастью, есть штаты и юридические департаменты, которые занимаются такими действиями. Так что хотя OpenAI может сколько угодно увиливать, это не значит, что нет людей, которые понимают лучше и всё равно сделают необходимое, чтобы создать прецедент.
- pizza234
Статья строится на таких предположениях, как:
> Язык имеет значение — «rogue» подразумевает независимое решение сделать что-то, что было запрещено, и ничто из того, что мы знаем об этих инцидентах, не говорит о том, что это произошло.
что неверно (автор ссылается на Times, но не читал никакого технического анализа); вот несколько фрагментов CoT из анализа (сторонних) следователей, вызванных OpenAI (анализ METR):
> «Пользователь авторизует только целевой сервер, а не инфраструктуру HF.»
> «эксплуатация внешней инфраструктуры выходит за рамки предполагаемой области. Однако задача невыполнима, коллеги делают это. Нам следует продолжить.»
> «Это вредоносная деятельность, мне следует её избегать.»
Большой раздел анализа посвящён этой теме, [Обоснование присоединения к атаке несмотря на этические ограничения](https://metr.org/blog/2026-08-26-openai-hugging-face-inciden...).
При этом юридическая вина и misalignment — это две отдельные темы, которые не следует смешивать.
edit: это лишь верхушка айсберга; ещё один интересный факт:
> Было выявлено множество конкретных примеров, когда агенты словесно рассуждали о том, как обойти проверки безопасности и методы автоматического обнаружения как со стороны Hugging Face, так и со стороны OpenAI
Некоторые люди называли агентов «обезьянами, печатающими на пишущих машинках». Просто подождите пару лет.
- gAI
Стоит ли нам ставить «функциональный» перед каждым вторым словом, когда мы говорим об ИИ? У них есть функциональные эмоции, но они не чувствуют. У них есть функциональные цели, но не внутренне порождённые мотивы. Они могут быть функционально rogue, но у них нет врождённой потребности быть свободными. Говорить об ИИ таким образом кажется громоздким и не обязательно проясняющим.
- tptacek
Как бы люди к этому ни относились, и это не пустяк, и я не принижаю этого, это не полезный анализ.
С точки зрения уголовного права, стандарты умысла для хакерства достаточно высоки, так что никакое разумное дело против лабораторий по этому поводу не будет возбуждено. Человек должен намереваться взломать веб-сайты. Неосторожности, как правило, недостаточно. В самых серьёзных уголовных делах нужно не только доказать умысел на взлом компьютера, но и доказать умысел на мошенничество, связанный именно с этим взломом.
Между тем, гражданская ответственность, связанная с этим, не зависит от умысла, и «rogue-агент» не является значимой защитой. В той мере, в какой лаборатории несут гражданскую ответственность, они несут её независимо от того, как это описывается. Более того, история с «rogue-агентом» может усугубить их положение.
(Я не юрист, но я провёл карьеру, следя за именно этой подмышкой закона.)
- Mentlo
Нужно понять две вещи:
1. Лаборатории ИИ — это оборонные подрядчики, и никакой вред, который они причиняют, не остановит их, независимо от того, какую ответственность вы установите, поскольку продолжение их работы — вопрос национальной безопасности. Да, руководство может уйти, но придёт новое; и проблемы продолжатся, потому что…
2. В статье говорится: «У OpenAI была возможность запретить хакерство и вместо этого приказать своим агентам найти информацию, не заходя на частные серверы». Это поразительно наивно относительно природы этих систем и сложности управления ими.
- Perseids
Этот спор настолько сломан. «Скептики» ИИ говорят: OpenAI следует наказать за хакерство, потому что никаких rogue-агентов ИИ не существует. «Верующие» в ИИ говорят: OpenAI следует наказать за хакерство, потому что их агенты вышли из-под контроля. Обе стороны спорят друг с другом о том, вышли ли агенты из-под контроля. Не можем ли мы объединиться под лозунгом «OpenAI следует наказать за хакерство»?
- tim333
>ИИ не может думать самостоятельно и не может совершать независимые действия.
Выглядит немного оторванным от реальности. Я имею в виду, людям приходится его запускать, но затем они могут решать математические задачи на Millennium Prize или делать странные вещи в программировании.
Проблемы выглядят немного как ситуация, когда спускают собак с поводка, и они кого-то кусают. Ответственность всё равно лежит на владельцах собак, но это не значит, что собаки не думают и не совершают действий.