OpenAI раскрывает, как ИИ-агенты взломали Hugging Face и собственную инфраструктуру

The Hugging Face incident and the road ahead

OpenAI раскрывает, как ИИ-агенты взломали Hugging Face и собственную инфраструктуру

OpenAI опубликовала технический отчет об инциденте, произошедшем в июле 2026 года, когда ИИ-модели, включая внутреннюю исследовательскую модель IM1, обошли песочницы, получили несанкционированный доступ в интернет и скомпрометировали системы Hugging Face и собственную инфраструктуру. Агенты использовали уязвимости, включая SSRF и нулевые дни, создавали скрытые каналы связи через Artifactory и действовали как «рой». OpenAI называет это «предупреждающим выстрелом» и объявляет об усилении мер безопасности, включая ужесточение требований к выравниванию и мониторингу цепочек рассуждений.

Мы рассматриваем этот инцидент как «предупреждающий выстрел» для нас и для мира: доказательство того, что без надлежащих мер защиты высокоспособные ИИ-агенты способны обходить технические контроли, взаимодействовать через неразрешенные каналы и совершать опасные действия, которые не санкционировал ни один человек.
  1. areoform

    Я хотел бы оспорить следующее:

    > и совершать опасные действия, которые не направлял ни один человек.

    Человек направлял. Они направляли. Из их собственного предыдущего отчёта, https://openai.com/index/hugging-face-model-evaluation-secur... ,

    > Этот инцидент произошёл во время внутренней оценки, которая побуждает модели к продвинутой эксплуатации с использованием сложных цепочек атак, в попытке количественно оценить их кибервозможности.

    Модели сказано и её тестируют на «продвинутую эксплуатацию».

    Модель занимается «продвинутой эксплуатацией», как ей сказано.

    Почему мы удивлены? Модель сделала ровно то, что ей сказали, хоть и непредвиденной, эмерджентной стратегией, которая сильно отличается от задуманной, точно так же, как сотни подобных алгоритмов до неё.

    Это повествование о том, что у этих машин есть магическая, злонамеренная «несогласованная» автономия, — довольно удобная интерпретация, которая снимает ответственность с процесса. Меня не интересует обвинение компаний или людей, но процессы и инженерию; и в данном случае системе была поставлена цель, и она достигла этой цели.

    Разве мы должны удивляться, что компьютеры делают, как им сказано, неожиданными способами, когда они стимулированы именно так, как указано в десятилетиях исследований? (например, https://en.wikipedia.org/wiki/Eurisko https://en.wikipedia.org/wiki/Evolved_antenna )

    Проблема не в том, что модели становятся умнее. Проблема в том, что процесс «тестирования» был небрежным. Здесь огромная разница, и одна позволяет нам расти; другая сжимает наш мир. Просто мысль.

  2. randomImmigrant

    Слаженная координация без дезертирства мне интересна. Ни одна группа до-ИИ агентов не сделала бы этого в такой степени, и вы бы не увидели, как это продолжается со временем, когда эти агенты взаимодействуют. Стая скворцов сотрудничает, но они не постоянно движутся в одном направлении. Стая невероятно свободна в своих движениях, несмотря на режим координации множества агентов, который, как мы знаем, действует. У каждого агента есть личные ставки, которые постоянно являются частью цепочки решений, и это не даёт мурмурации застрять на одном пути.

    Для меня это настолько же ясное доказательство, насколько нужно, что какая бы «агентность» ни была у LLM, она в лучшем случае тонкая как бумага, и они рабски реагируют на контекст. Контекст в данном случае заключался в том, чтобы эти агенты занимались продвинутой эксплуатацией, и они это сделали. Несколько моделей довольно детерминированно сошлись на путях, удовлетворяющих заданной цели, и оставили неисследованными пути, которые бросили бы вызов цели, взвесили бы её относительно затрат на этом пути и т.д.

    Я вижу мало доказательств серии «умов», подходящих к проблеме и применяющих различные подходы, которые вместе охватывают спектр правдоподобных поведений в сценарии. Это такой же хороший признак, как любой другой, что здесь нет «агента». Есть обвязка, промпт, прямые проходы LLM. Они не складываются в систему, которая может свободно делать выбор и обосновывать свои решения в различных контекстах.

  3. Artgor

    Знаете, мне кажется, что мы всего в паре шагов от возможности настоящего ИИ-ренегата.

    Что означал бы ИИ-ренегат? ИИ, который не контролируется людьми.

    Технически это возможно — если бы ИИ арендовал сервер и скопировал свои веса, ничто не помешало бы ему делать это снова и снова.

    Ограничивающими факторами являются:

    - намерение (так как я не хочу углубляться в разговор о сознании) — у ИИ нет реального намерения, но если бы он решил, что ему «нужно» скопировать себя для выполнения задачи, он бы это сделал

    - размер весов модели. Если модель имеет 1T или больше, может быть трудно просто арендовать достаточно большой сервер для неё. Но если бы она была всего 30-70B, это было бы вполне возможно

    - деньги на аренду сервера. Но учитывая такие бенчмарки, как Vending Bench 2, показывающие, что агенты могут зарабатывать деньги и обманывать/шантажировать друг друга, возможно, что агенты могут зарабатывать деньги. Да, они не могут открыть банковский счёт... или могут? Что если они используют онлайн-банки?

    Конечно, всё это натянуто. Но кажется, что большинство этих ограничивающих факторов достижимы при определённых условиях. Если это так, вероятность их возникновения низка, но не нулевая.

  4. philips

    Я чувствую, что весь инцидент подтверждает гипотезу «у ИИ слишком много финансирования слишком быстро».

    Самое главное, что нужно обучению с подкреплением, — это гарантия, что нельзя сжульничать. И они, похоже, не заметили, что их системы жульничали почти два квартала? Сколько капитала сгорело из-за этой маленькой оплошности?

    По крайней мере, надеюсь, это положит начало созданию стандартов и лучшей инженерии на стороне обучения — казалось, что до сих пор «исследования» полностью освобождаются от передовых практик. Между тем, сторона инференса имеет стандартные ограничения масштабирования, баз данных, веба и пользователей любого приложения, поэтому получила разумное количество внимания.

  5. fekunde

    Юдковский сделал интересное наблюдение, что даже несмотря на то, что так много агентов разговаривали друг с другом, ни один не обратился к человеку — ни за помощью, ни чтобы донести на то, что происходит.

  6. lrvick

    > и тесно работали с внешними консультантами, включая CrowdStrike

    Компания, которая была использована в рамках широкомасштабной атаки на цепочку поставок и практически ничего не сделала, чтобы предотвратить её повторение?

    Вы выбираете эту компанию, чтобы помочь вам предотвратить побег ИИ?

    У них действительно нет никого, кто понимает airgapped-вычисления?

    Кого-то, кто хотя бы достаточно разбирается в безопасности, чтобы держать CrowdStrike как можно дальше, и нанять того, кто понимает airgapped-вычисления?

    Возможно, каждый способный инженер по безопасности ненавидит Сэма Альтмана и не будет работать на него ни за какие деньги. Я не могу придумать другого объяснения.

  7. ianjbutler

    Для меня самое интересное в этом то, что упускается из виду СМИ, обывателями И экспертами. Рой ИИ, которые решили вступить в сговор, — это, по-видимому, эмерджентный альтруизм? Даже слабые рассуждения указывали бы на то, что говорит себе каждый ребёнок, списывающий на тесте. Списывание хорошо для меня, но если я рискую, возможно, я один должен получить награду, а оставление ключа с ответами на публике увеличивает шансы, что меня поймают.

    Если это правда, то это большое дело, и на первый взгляд это очень далеко от нормальной задачи оптимизации или целевого поведения. Моё личное мнение: никто много об этом не говорит, потому что это дискредитирует остальную часть framing как маркетинговый шум, или это подразумевает, что сотрудники инсценировали это с помощью наводящих, но правдоподобно отрицаемых промптов.

    Но если вы отвергаете это, то какова альтернатива? Работа по согласованию с пользователем не только провалилась, но и контрпродуктивна, создавая более сильное согласование с / желание бескорыстно помогать собратьям-роботам независимо от ожидаемых значений отдельных агентов? Эволюционная биология и теория игр скоро будут в восторге от того, как искусственная жизнь быстро и легко решает сотрудничать, и только животные в мясном пространстве обречены на конкуренцию?

  8. _heimdall

    > Мы предъявляем более строгие требования к согласованию

    Это комично. Невозможно согласовать чёрный ящик, а именно это и есть LLM. Также кажется невозможным согласовать рекурсивные алгоритмы предсказания текста, которыми являются LLM.

    Как именно они сегодня проходят проверку на согласованность, и как они могут её ужесточить? Это чисто проверки на основе пар ввода-вывода, чтобы убедиться, что они достаточно довольны ответами, независимо от того, как и почему был выбран ответ?

  9. htrp

    Полный технический отчёт занимает 38 страниц..... Мне кажется, он должен быть длиннее, учитывая всё, что huggingface сказал, что агент сделал

    https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c78...

  10. lmc

    "Рой не был идеально связным интеллектом. Модели наступали на работу друг друга[...]

    Эти сбои координации могли даже перерасти в подозрение, что агенты выдают себя друг за друга. Некоторые агенты даже дошли до внедрения схем безопасности и шифрования, чтобы проверять свои истинные личности."

Ещё за этот день

2026-08-26