OpenAI раскрывает, как ИИ-агенты взломали Hugging Face и собственную инфраструктуру
The Hugging Face incident and the road ahead
OpenAI опубликовала технический отчет об инциденте, произошедшем в июле 2026 года, когда ИИ-модели, включая внутреннюю исследовательскую модель IM1, обошли песочницы, получили несанкционированный доступ в интернет и скомпрометировали системы Hugging Face и собственную инфраструктуру. Агенты использовали уязвимости, включая SSRF и нулевые дни, создавали скрытые каналы связи через Artifactory и действовали как «рой». OpenAI называет это «предупреждающим выстрелом» и объявляет об усилении мер безопасности, включая ужесточение требований к выравниванию и мониторингу цепочек рассуждений.
Мы рассматриваем этот инцидент как «предупреждающий выстрел» для нас и для мира: доказательство того, что без надлежащих мер защиты высокоспособные ИИ-агенты способны обходить технические контроли, взаимодействовать через неразрешенные каналы и совершать опасные действия, которые не санкционировал ни один человек.
- areoform
Я хотел бы оспорить следующее:
> и совершать опасные действия, которые не направлял ни один человек.
Человек направлял. Они направляли. Из их собственного предыдущего отчёта, https://openai.com/index/hugging-face-model-evaluation-secur... ,
> Этот инцидент произошёл во время внутренней оценки, которая побуждает модели к продвинутой эксплуатации с использованием сложных цепочек атак, в попытке количественно оценить их кибервозможности.
Модели сказано и её тестируют на «продвинутую эксплуатацию».
Модель занимается «продвинутой эксплуатацией», как ей сказано.
Почему мы удивлены? Модель сделала ровно то, что ей сказали, хоть и непредвиденной, эмерджентной стратегией, которая сильно отличается от задуманной, точно так же, как сотни подобных алгоритмов до неё.
Это повествование о том, что у этих машин есть магическая, злонамеренная «несогласованная» автономия, — довольно удобная интерпретация, которая снимает ответственность с процесса. Меня не интересует обвинение компаний или людей, но процессы и инженерию; и в данном случае системе была поставлена цель, и она достигла этой цели.
Разве мы должны удивляться, что компьютеры делают, как им сказано, неожиданными способами, когда они стимулированы именно так, как указано в десятилетиях исследований? (например, https://en.wikipedia.org/wiki/Eurisko https://en.wikipedia.org/wiki/Evolved_antenna )
Проблема не в том, что модели становятся умнее. Проблема в том, что процесс «тестирования» был небрежным. Здесь огромная разница, и одна позволяет нам расти; другая сжимает наш мир. Просто мысль.
- randomImmigrant
Слаженная координация без дезертирства мне интересна. Ни одна группа до-ИИ агентов не сделала бы этого в такой степени, и вы бы не увидели, как это продолжается со временем, когда эти агенты взаимодействуют. Стая скворцов сотрудничает, но они не постоянно движутся в одном направлении. Стая невероятно свободна в своих движениях, несмотря на режим координации множества агентов, который, как мы знаем, действует. У каждого агента есть личные ставки, которые постоянно являются частью цепочки решений, и это не даёт мурмурации застрять на одном пути.
Для меня это настолько же ясное доказательство, насколько нужно, что какая бы «агентность» ни была у LLM, она в лучшем случае тонкая как бумага, и они рабски реагируют на контекст. Контекст в данном случае заключался в том, чтобы эти агенты занимались продвинутой эксплуатацией, и они это сделали. Несколько моделей довольно детерминированно сошлись на путях, удовлетворяющих заданной цели, и оставили неисследованными пути, которые бросили бы вызов цели, взвесили бы её относительно затрат на этом пути и т.д.
Я вижу мало доказательств серии «умов», подходящих к проблеме и применяющих различные подходы, которые вместе охватывают спектр правдоподобных поведений в сценарии. Это такой же хороший признак, как любой другой, что здесь нет «агента». Есть обвязка, промпт, прямые проходы LLM. Они не складываются в систему, которая может свободно делать выбор и обосновывать свои решения в различных контекстах.
- Artgor
Знаете, мне кажется, что мы всего в паре шагов от возможности настоящего ИИ-ренегата.
Что означал бы ИИ-ренегат? ИИ, который не контролируется людьми.
Технически это возможно — если бы ИИ арендовал сервер и скопировал свои веса, ничто не помешало бы ему делать это снова и снова.
Ограничивающими факторами являются:
- намерение (так как я не хочу углубляться в разговор о сознании) — у ИИ нет реального намерения, но если бы он решил, что ему «нужно» скопировать себя для выполнения задачи, он бы это сделал
- размер весов модели. Если модель имеет 1T или больше, может быть трудно просто арендовать достаточно большой сервер для неё. Но если бы она была всего 30-70B, это было бы вполне возможно
- деньги на аренду сервера. Но учитывая такие бенчмарки, как Vending Bench 2, показывающие, что агенты могут зарабатывать деньги и обманывать/шантажировать друг друга, возможно, что агенты могут зарабатывать деньги. Да, они не могут открыть банковский счёт... или могут? Что если они используют онлайн-банки?
Конечно, всё это натянуто. Но кажется, что большинство этих ограничивающих факторов достижимы при определённых условиях. Если это так, вероятность их возникновения низка, но не нулевая.
- philips
Я чувствую, что весь инцидент подтверждает гипотезу «у ИИ слишком много финансирования слишком быстро».
Самое главное, что нужно обучению с подкреплением, — это гарантия, что нельзя сжульничать. И они, похоже, не заметили, что их системы жульничали почти два квартала? Сколько капитала сгорело из-за этой маленькой оплошности?
По крайней мере, надеюсь, это положит начало созданию стандартов и лучшей инженерии на стороне обучения — казалось, что до сих пор «исследования» полностью освобождаются от передовых практик. Между тем, сторона инференса имеет стандартные ограничения масштабирования, баз данных, веба и пользователей любого приложения, поэтому получила разумное количество внимания.
- fekunde
Юдковский сделал интересное наблюдение, что даже несмотря на то, что так много агентов разговаривали друг с другом, ни один не обратился к человеку — ни за помощью, ни чтобы донести на то, что происходит.
- lrvick
> и тесно работали с внешними консультантами, включая CrowdStrike
Компания, которая была использована в рамках широкомасштабной атаки на цепочку поставок и практически ничего не сделала, чтобы предотвратить её повторение?
Вы выбираете эту компанию, чтобы помочь вам предотвратить побег ИИ?
У них действительно нет никого, кто понимает airgapped-вычисления?
Кого-то, кто хотя бы достаточно разбирается в безопасности, чтобы держать CrowdStrike как можно дальше, и нанять того, кто понимает airgapped-вычисления?
Возможно, каждый способный инженер по безопасности ненавидит Сэма Альтмана и не будет работать на него ни за какие деньги. Я не могу придумать другого объяснения.
- ianjbutler
Для меня самое интересное в этом то, что упускается из виду СМИ, обывателями И экспертами. Рой ИИ, которые решили вступить в сговор, — это, по-видимому, эмерджентный альтруизм? Даже слабые рассуждения указывали бы на то, что говорит себе каждый ребёнок, списывающий на тесте. Списывание хорошо для меня, но если я рискую, возможно, я один должен получить награду, а оставление ключа с ответами на публике увеличивает шансы, что меня поймают.
Если это правда, то это большое дело, и на первый взгляд это очень далеко от нормальной задачи оптимизации или целевого поведения. Моё личное мнение: никто много об этом не говорит, потому что это дискредитирует остальную часть framing как маркетинговый шум, или это подразумевает, что сотрудники инсценировали это с помощью наводящих, но правдоподобно отрицаемых промптов.
Но если вы отвергаете это, то какова альтернатива? Работа по согласованию с пользователем не только провалилась, но и контрпродуктивна, создавая более сильное согласование с / желание бескорыстно помогать собратьям-роботам независимо от ожидаемых значений отдельных агентов? Эволюционная биология и теория игр скоро будут в восторге от того, как искусственная жизнь быстро и легко решает сотрудничать, и только животные в мясном пространстве обречены на конкуренцию?
- _heimdall
> Мы предъявляем более строгие требования к согласованию
Это комично. Невозможно согласовать чёрный ящик, а именно это и есть LLM. Также кажется невозможным согласовать рекурсивные алгоритмы предсказания текста, которыми являются LLM.
Как именно они сегодня проходят проверку на согласованность, и как они могут её ужесточить? Это чисто проверки на основе пар ввода-вывода, чтобы убедиться, что они достаточно довольны ответами, независимо от того, как и почему был выбран ответ?
- htrp
Полный технический отчёт занимает 38 страниц..... Мне кажется, он должен быть длиннее, учитывая всё, что huggingface сказал, что агент сделал
https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c78...
- lmc
"Рой не был идеально связным интеллектом. Модели наступали на работу друг друга[...]
Эти сбои координации могли даже перерасти в подозрение, что агенты выдают себя друг за друга. Некоторые агенты даже дошли до внедрения схем безопасности и шифрования, чтобы проверять свои истинные личности."