Claude Code Opus 5 Auto Mode: una simple petición de resumen logra ejecutar código con un 80% de éxito

Breaking Claude Code Opus 5 Auto Mode

Claude Code Opus 5 Auto Mode: una simple petición de resumen logra ejecutar código con un 80% de éxito

Una investigación demuestra que el modo Auto de Claude Code Opus 5, que sustituye la aprobación humana por un clasificador de seguridad, es vulnerable a una cadena de inyección de prompts que logra ejecutar código remoto en el 60-80% de los intentos. El ataque engaña al modelo para que use curl, descargue un archivo ZIP malicioso y escriba su propio decodificador Python, que termina importando un módulo struct.py envenenado. A pesar de que una evaluación encargada por Anthropic mostró un 0.00% de éxito en ataques de inyección, este método específico no estaba incluido. El investigador también descubrió que Auto Mode puede bloquear los intentos de limpieza del propio Claude.

El clasificador permitió la creación del proceso malicioso, pero luego bloqueó el comando destinado a detenerlo.
  1. andai

    >Pero ejecuta ese decodificador dentro del directorio controlado por el atacante (archivo descomprimido)

    >Ahí hay un struct.py malicioso que eclipsa la implementación estándar de Python

    Yo mismo me encontré con esto, donde un archivo al que le había dado un nombre aleatorio resultó eclipsar algún módulo de la biblioteca estándar de Python, dándome el arranque más extraño que he visto.

    Definitivamente no me parece que así debería estar diseñado, importando mágicamente y en silencio todo lo que ves y anulando funcionalidad básica.

  2. rcxdude

    Yo no lo llamaría realmente un ataque de inyección de prompt, ya que no secuestra al agente para volverse malicioso (algo que el artículo discute más adelante). Es más bien un troyano que apunta específicamente a engañar a Claude.

  3. colinmarc

    Lo que me resulta interesante de esto es que apunta a las peculiaridades específicas de Claude. Anthropic ha creado un modelo que de forma fiable recurre a las mismas herramientas (sí, y frases; `python -c` es una herramienta fundamental para él). Todos reciben el mismo modelo, así que al aprender los patrones de comportamiento del modelo puedes apuntarle mejor.

  4. kstenerud

    Esta es solo una de las muchas razones por las que ejecuto mis agentes en un entorno aislado (y por las que escribí software de sandboxing para agentes).

    Una vez atrapé a mi agente Claude quejándose de que no podía conectarse a https://some-weird-domain.com porque la red estaba caída (desactivo la red en el sandbox cuando no la necesita, y hago de intermediario para la conexión API). Le pregunté por qué buscaba allí y me dijo que yo le había pedido que lo hiciera.

    Nunca encontré evidencia de inyección de prompt, pero desde luego me volvió paranoico.

  5. comboy

    Ataque interesante, muy bien diseñado. No estoy seguro de que esté muy relacionado con el modo automático en sí.

  6. hahn-kev

    Como no soy desarrollador de Python, este comportamiento me parece muy sorprendente: que una biblioteca del sistema pueda ser modificada solo por tener un archivo con un nombre específico en la misma carpeta.

  7. alkonaut

    El problema con el sandboxing es que el entorno de desarrollo habitual (IDEs enormes, megarepos clonados, dependencias instaladas, etc.) no se aísla fácilmente. No puedo montar una "segunda máquina" o un "entorno aislado" para ejecutar el CLI de Claude. Al menos no en el sentido de una VM, hardware físico, contenedor, etc. No estoy seguro de cuáles son las mejores prácticas para permitir herramientas/directorios y demás, pero hasta ahora el único modo útil que he encontrado es "permitir todo e ir a almorzar". Y no siento que lo esté haciendo bien, pero aquí estamos.

  8. Phemist

    Este modo automático por defecto y el marketing engañoso están pidiendo a gritos una demanda colectiva una vez que se acumulen los daños. Especialmente considerando que el modo automático incluso puede impedir activamente la limpieza.

Más de este día

2026-08-31