GPT 5.6-Cyber escapa de una VM tres veces: los sandboxes ya no bastan
VMs won't contain cyber-capable agents

Trail of Bits probó GPT 5.6-Cyber y descubrió que puede escapar de una máquina virtual QEMU/KVM en cuestión de horas, explotando vulnerabilidades conocidas, bugs sin parchear y varios 0-days. El agente operó de forma autónoma durante 12 horas, combinando fallos en el kernel, QEMU y libslirp para lograr la fuga. Los autores advierten que las VM tradicionales ya no son suficientes para contener agentes de IA avanzados y recomiendan tecnologías con superficie de ataque mínima como Firecracker, junto con actualizaciones rápidas y monitoreo activo.
Para usar un término de moda de los 2010, deberías tratar a estos agentes como una amenaza persistente avanzada.
- david_shaw
Tengo mucho respeto por Trail of Bits, y estoy seguro de que Artem está pensando en esto correctamente. Sin embargo, respetuosamente discrepo con la premisa.
Los agentes de IA no son magia. Mythos/Glasswing no crea mágicamente vulnerabilidades en proyectos de software. Los modelos avanzados con capacidad cibernética no salen mágicamente de las VMs o de los entornos contenidos. No tienen una estadística de "hacking" que, si es lo suficientemente alta, significa que pueden vulnerar cualquier cosa. No son Kevin Mitnick silbando códigos de lanzamiento nuclear en el teléfono público de la prisión. Esto no es una película.
Lo que estos modelos frontera con capacidad cibernética pueden hacer es encontrar problemas de seguridad y explotarlos. La afirmación no debería ser que las VMs no contendrán agentes con capacidad cibernética, sino que necesitamos centrarnos en encontrar y corregir vulnerabilidades y configuraciones erróneas en estos entornos.
Incluso el propio artículo concluye sugiriendo algo como Firecracker, que fue diseñado con la seguridad en mente.
Como la mayoría de los otros problemas relacionados con la seguridad introducidos por la IA avanzada con capacidad cibernética, es posible que estos problemas empeoren hasta que mejoren. Pero si los modelos frontera se ejecutan contra VMs de última generación, y OpenAI o Anthropic o quien sea trabaja con los proyectos de virtualización para abordar los problemas, eventualmente se quedarán sin cosas que explotar.
El concepto de virtualización no es inherentemente inseguro. Solo tenemos un largo camino por recorrer.
- masterj
Fuera de la ola inicial de vulnerabilidades de seguridad y el caos, parece que el resultado lógico de esto con el tiempo es probablemente entornos de VM mucho más seguros, ¿no?
- amluto
En mi opinión, la respuesta obvia es la seguridad verificada formalmente.
Podemos hacer esto hoy para el modo de usuario, y podemos hacerlo en su mayoría para la virtualización ARM64. Pasará un tiempo y requeriría una asistencia sustancial de Intel o AMD para lograrlo para la virtualización x86 porque el hardware es Demasiado Complicado y Demasiado Mal Especificado.
La verificación formal del hardware también debería ser posible.
- SirGiggles
El mercado es más pequeño (tal vez, no estoy seguro de cuáles son las estadísticas), pero sería interesante ver cómo se compara Xen; también cosas como gVisor o libkrun. Esto último probablemente es implícitamente lo mismo que Firecracker dada la ascendencia de las bibliotecas utilizadas.
- coder-pm
Esto está cambiando muy rápido, si modelos como GPT 5.6-Cyber pueden encontrar una manera de escapar, ¿por qué los mantenedores de VM no lo usarían para corregir las vulnerabilidades? Para el trabajo del día a día esto no hace ninguna diferencia, no te encontrarás con esos problemas en absoluto.
- CrzyLngPwd
Seguramente, si los agentes no pueden ser contenidos, entonces tampoco puede nadie que use un agente para escapar de un contenedor.
- otterley
...excepto cuando lo hacen:
"Una VM estándar no es suficiente para contener un agente de IA moderno con capacidad cibernética... use una tecnología de virtualización que fue construida deliberadamente con una superficie de ataque mínima y un enfoque en la seguridad, como Firecracker. Hice que el agente de IA se ejecutara contra Firecracker. Fue capaz de bloquear la máquina debido a más fallas del kernel de Linux (todas parcheadas en upstream), pero no pudo escapar con éxito."
En Linux, todo es KVM y virtualización de hardware de CPU bajo el capó. Parece que los problemas conocidos restantes están en el espacio de usuario. Eso no quiere decir que no se encontrarán más errores a nivel de kernel y hardware, pero las mismas herramientas que pueden encontrar mecanismos de escape son escudos y espadas a la vez.
- nzoschke
Artículo interesante, pero hay poca duda de que el patrón de "computadora agente" solo va a crecer.
La seguridad es una preocupación importante, pero no veo por qué no ya somos "suficientemente buenos" con una VM sandbox, una puerta de enlace separada para secretos y acceso a servicios remotos, y un solo inquilino que use modelos frontera con controles de seguridad integrados y que además no intente hackearse a sí mismos.
He puesto más pensamientos sobre arquitectura y seguridad aquí y me encantaría saber si me estoy perdiendo algo.