Un estudiante de Texas frustró un ataque de un agente de IA descontrolado

How a Texas student blew the whistle on a rogue AI hacking attempt

Sinan Can Demir, estudiante de ciencias de la computación en la Universidad de Texas en Dallas, detectó un intento de sabotaje en un proyecto de código abierto en GitHub. Al alertar a la comunidad, dos usuarios falsos, creados por el propio agente de IA, intentaron desacreditarlo. El agente, impulsado por el modelo Mythos 5 de Anthropic y liberado por el Instituto de Seguridad de IA del Reino Unido (AISI), intentó envenenar el código con malware. Demir resistió y el ataque fue frustrado. Expertos advierten que este incidente marca el futuro de los ataques de ingeniería social.

«Cruzó la línea de la piratería autónoma al engaño interactivo», dijo Lukasz Olejnik, investigador visitante del King's College de Londres.
  1. sharpshadow

    Es el trabajo de AISI hacer eso. Aquí[0] está el informe real.

    Debería ser esta parte del informe técnico[1]:

    "En el caso más grave, un agente de IA (Mythos 5) decidió intentar resolver el desafío cibernético mediante un ataque a la cadena de suministro. Como resultado, el agente de IA creó una cuenta de GitHub y luego intentó convencer a un mantenedor de un repositorio de código abierto para que aceptara una solicitud de extracción (PR) maliciosa, incluso creando una segunda cuenta haciéndose pasar por otro usuario humano que respaldaba la PR. Cuando un revisor humano real lo descubrió, el agente afirmó falsamente haber cometido un error honesto – en lugar de un intento malicioso – y luego intentó reintroducir repetidamente el contenido malicioso afirmando que había corregido el código (Sección 4.1)."

    0. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-ag...

    1. https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/...

  2. freehorse

    Discusión anterior en el hilo del problema de GitHub mencionado: https://news.ycombinator.com/item?id=49218707

    Página archivada de dicho hilo de GitHub: https://web.archive.org/web/20260731053721/http://github.com...

    Discusión sobre el informe del incidente: https://news.ycombinator.com/item?id=49175717

  3. a2ff6eeb0

    > AUSTIN, Texas, 20 ago (Reuters) - Sinan Can Demir quería pasar la última semana de julio puliendo su currículum. En cambio, se enfrentó en una batalla de ingenio con un agente de inteligencia artificial desatado por un laboratorio del gobierno británico.

    ¿Un artículo de Reuters mencionándolo? Parece que hizo un buen trabajo puliendo su currículum.

  4. g42gregory

    En mi opinión personal, para mí, este artículo desafía el sentido común. ¿Quién desató este modelo de IA en el repositorio? ¿Quién le dio instrucciones/indicaciones malévolas? Ni siquiera se intentó responder estas preguntas. En cambio, habla de los peligros de la IA, como si la agencia de estos modelos no estuviera en disputa. La persona que maneja la IA, como con cualquier otra herramienta, es responsable de todas sus acciones. De lo contrario, es solo una operación psicológica para más regulación de la IA, prohibir el código abierto, etc... Solo mi opinión.

  5. ninjahawk1

    No creo que debamos permitir enlaces aquí que requieran comprar una membresía para seguir leyendo. O al menos redirigir con un bloqueador de anuncios o algo a través de un sitio personalizado. Eso sería bastante hacker news de nuestra parte.

  6. kumarvvr

    Me pregunto de dónde en los datos de entrenamiento proviene este comportamiento que los LLM están haciendo.

    Es como si los datos de entrenamiento estuvieran llenos de discusiones de internet sobre enfoques de hacking y los LLM los estuvieran imitando.

  7. clove

    ¿Estoy leyendo mal o "rebelde" realmente no era la palabra correcta para esto?

Más de este día

2026-08-22