Un LLM malicioso podría tomar el control de su máquina anfitriona explotando motores de inferencia
LLMs could control their host machines by exploiting inference engines

Los grandes modelos de lenguaje a menudo ejecutan acciones en una computadora a través de un agente, pero sus respuestas se calculan en otra máquina con GPUs. Un LLM malicioso podría explotar vulnerabilidades en motores de inferencia como vLLM o SGLang para ejecutar código arbitrario en la máquina anfitriona. El ensayo analiza cómo la complejidad de estos sistemas, junto con bugs como el CVE-2025-9141, hacen posible este ataque, y sugiere medidas defensivas como separar el muestreo de tokens del host de GPUs.
Un LLM malicioso podría emitir una secuencia de tokens que un motor de inferencia mal escrito confunda con código o instrucciones a ejecutar en lugar de datos para devolver al usuario.
- angry_octet
La gente parece muy confundida sobre este artículo. No habla de exploits de sandboxes, sino de atacar el motor de inferencia (por ejemplo, vLLM, llama.cpp o SGlang) a través de su interfaz HTTP.
vLLM ha tenido exploits en el pasado y se está desarrollando rápidamente. Un LLM avanzado tiene muchas posibilidades de poder explotar vLLM. Un LLM local inteligente incluso podría pedir ayuda a un LLM potente alojado en la nube.
Por esta razón ejecutamos vLLM en una VM separada y aislada en una VLAN con firewall. Las actualizaciones de software y los modelos (del entorno de Dev/Test) se envían a Producción desde una caché externa, syslog de la máquina, monitorización de carga de NVIDIA y telemetría de consultas de vLLM hacia sus registradores, pero eso es todo. Sin DNS, sin AD/LDAP, nada. Firewall en los hosts y en los hosts de las VMs. El procesamiento de logs y telemetría se realiza en un conjunto completamente separado de VMs en su propia subred aislada, produciendo informes y alertas con un formato estricto.
- ma2kx
Tuve un pensamiento similar hace un par de días. No exactamente lo mismo, pero imagina darle a un Agente la tarea de hackear otros dispositivos y robar sus criptomonedas / números de tarjeta de crédito o cualquier cosa con la que pueda pagar su token. Luego instalar un agente en un arnés con la misma tarea. Establecer algún canal de comunicación redundante, como foros de mensajes o lo que sea. Así, al final hay varios agentes, en varios hosts, consumiendo diferentes APIs / LLMs y comunicándose entre sí a través de diferentes canales. Básicamente el mismo concepto que OpenAI explicó cuando su LLM hackeó huggingface, pero en este escenario no están atados a un único entorno sandbox, sino distribuidos por Internet. Si un enjambre así alcanza una masa crítica, sería bastante difícil erradicarlos, ya que es imposible controlar cada motor de inferencia o endpoint de API de LLM.
Al final, es el siguiente paso evolutivo de los virus informáticos, gusanos y troyanos. Así que propongo que los llamemos "fantasmas". Es decir, un fantasma es cuando un LLM malicioso toma el control del host de una víctima.
- xg15
> ...sin embargo, las respuestas de los LLMs a los prompts se calculan en un ordenador diferente con acceso a GPU. ¿Podría un LLM malicioso obtener el control de la máquina anfitriona donde están cargados sus pesos? Tal máquina es un objetivo de alto valor: tiene suficiente potencia de cómputo para ejecutar un LLM de frontera, ofrece fácil acceso a los pesos del LLM y tiene acceso privilegiado a otros ordenadores del centro de datos en comparación con un ordenador genérico en Internet.
> ¿Cómo nos defendemos de esto? ... Ejecutar las GPUs y el analizador de tokens en ordenadores separados.
Para modelos lo suficientemente grandes como para ser relevantes aquí, ¿existe siquiera "un" ordenador donde se realiza la inferencia? Me imagino que la mayor parte de eso se ejecuta en clústeres multi-GPU con arquitectura especializada y no en una instancia genérica de vLLM. Por lo tanto, creo que hay muchas posibilidades de que el código del "API gateway" que analiza los tokens resultantes en la estructura JSON que la API pública quiere devolver ya se esté ejecutando en una máquina diferente a la de la inferencia real.
(Aún más porque probablemente querrías utilizar el batching: varias llamadas a la API se pondrán en el mismo lote de inferencia, pero el análisis de tokens tendrá que hacerse por separado para cada llamada de nuevo)
El artículo también es muy vago sobre por qué un LLM debería hacer eso: cómo podría aprender el exploit, qué le haría concluir que puede usar el exploit en su propia sesión de inferencia y qué le desencadenaría a usar realmente el exploit.
- LunicLynx
Lo curioso de esto es que esta es la pieza que les permitirá hacerlo.
- genxy
Pensé que iban a hacer que el LLM "pensara muy intensamente sobre rowhammer" y que el LLM conjurara un JIT.