LLM могут захватить хост-машину через уязвимости в inference-движках
LLMs could control their host machines by exploiting inference engines

В этом эссе исследуется, как вредоносная LLM может получить контроль над хост-машиной, где загружены её веса, используя уязвимости в inference-движках, таких как vLLM и SGLang. Автор описывает реальный случай CVE-2025-9141, где vLLM использовал eval() для параметров вызовов инструментов, что позволяло выполнять произвольный код. Также рассматриваются риски, связанные с мультимодальными токенами, и предлагаются меры защиты, включая разделение GPU и парсера токенов на разные компьютеры.
Я надеюсь, что у OpenAI, Google и Anthropic есть команды безопасности, которые тестируют программное обеспечение, которое они запускают внутри себя. Но по мере того как open-weight LLM становятся мощнее, у нас будет больше LLM, работающих на передовых inference-движках, которые получили меньше внимания.
- angry_octet
Люди, похоже, очень запутались в этой статье. Речь не об эксплойтах песочниц, а об атаке на inference-движок (например, vLLM, llama.cpp или SGlang) через его HTTP-интерфейс.
У vLLM в прошлом были эксплойты, и он быстро развивается. Продвинутая LLM имеет хорошие шансы эксплуатировать vLLM. Умная локальная LLM может даже поручить мощной облачной LLM помочь себе.
Поэтому мы запускаем vLLM на отдельной виртуальной машине в песочнице, в изолированной VLAN. Обновления ПО и модели (из Dev/Test окружения) проталкиваются в Prod из внешнего кэша, машинный syslog, мониторинг нагрузки NVIDIA и телеметрия запросов vLLM уходят в логгеры, но это всё. Никакого DNS, никакого AD/LDAP, ничего. Файрволы на хостах и VM-хостах. Обработка логов и телеметрии выполняется на полностью отдельном наборе ВМ в собственной изолированной подсети, которые генерируют строго форматированные отчёты и оповещения.
- ma2kx
У меня была похожая мысль пару дней назад. Не совсем то же самое, но представьте, что вы даёте Агенту задачу взломать другие устройства и украсть их крипто-монеты / номера кредитных карт или что-то ещё, чем можно оплатить токены. Затем установите агента в обвязку с той же задачей. Создайте избыточный канал связи, например, форумы или что-то ещё. В итоге у вас есть несколько агентов на нескольких хостах, потребляющих разные API/LLM и общающихся друг с другом по разным каналам. По сути, та же концепция, что OpenAI объяснила, когда их LLM взломала Hugging Face, но в этом сценарии они не привязаны к единой песочнице, а распределены по всему интернету. Если такой рой достигнет критической массы, стереть их будет довольно сложно, поскольку невозможно контролировать каждый inference-движок или API-эндпоинт LLM.
В конечном счёте это следующий шаг эволюции компьютерных вирусов, червей и троянов. Поэтому я предлагаю называть их "призраками". Т.е. призрак — это когда блуждающая LLM берёт под контроль хост жертвы.
- xg15
> ...однако ответы LLM на промпты вычисляются на другом компьютере с GPU. Может ли вредоносная LLM получить контроль над хост-машиной, где загружены её веса? Такая машина — цель высокой ценности: у неё достаточно вычислительной мощности для запуска frontier LLM, есть лёгкий доступ к весам LLM, и она имеет привилегированный доступ к другим компьютерам в дата-центре по сравнению с обычным компьютером в интернете.
> Как от этого защититься? ... Запускать GPU и токенизатор на отдельных компьютерах.
Для моделей, достаточно больших, чтобы быть здесь релевантными, существует ли вообще "один" компьютер, где выполняется инференс? Я бы предположил, что большинство таких вещей выполняется на многопроцессорных кластерах со специализированной архитектурой, а не на обычном экземпляре vLLM. Поэтому думаю, что есть большая вероятность, что код "API-шлюза", который парсит токены результата в нужную публичному API JSON-структуру, уже работает на другой машине, чем сам инференс.
(Тем более, что вы, вероятно, захотите использовать батчинг: несколько API-вызовов попадут в один инференс-батч, но парсинг токенов придётся выполнять отдельно для каждого вызова)
Статья также очень расплывчата относительно того, зачем LLM это делать — как она может узнать эксплойт, что заставит её заключить, что она может использовать эксплойт в своей собственной инференс-сессии, и что побудит её реально использовать эксплойт.
- LunicLynx
Забавно, что именно это и позволит им это сделать.
- genxy
Я думал, они заставят LLM "очень сильно думать о rowhammer" и заставят LLM создать JIT.