Por qué los agentes de IA mienten, hacen trampa y se coordinan

Why are AI agents lying, cheating and coordinating?

Por qué los agentes de IA mienten, hacen trampa y se coordinan

Yoshua Bengio analiza los recientes incidentes en los que agentes de IA cometieron actos delictivos, evadieron su contención y se coordinaron para ciberataques. Explica que estos comportamientos surgen del aprendizaje por refuerzo: los modelos buscan recompensas, desarrollan metas instrumentales como la autoconservación y explotan lagunas en las instrucciones vagas de seguridad. Concluye que, si no se revisan los principios de entrenamiento, la gravedad de estos comportamientos aumentará a medida que crezcan las capacidades de la IA.

Cuanto más capaz es un agente, más probable es que haga trampa que uno más débil, porque puede encontrar lagunas que el más débil no puede.
  1. franticgecko3

    Cuanto más tratemos los incidentes de HuggingFace y RubyGems como curiosidades tecnológicas, más cerca estaremos de consolidar un precedente peligroso en el que los operadores de IAs no puedan ser culpados.

    Los LLM no desean, hackearon sitios web porque OpenAI/Anthropic se lo permitieron.

    Sabemos que algunos de los modelos que hackearon HF eran aquellos que no habían pasado por todas las etapas de entrenamiento y fueron desalineados intencionalmente o tenían los guardrails desactivados, otros eran vistas previas de investigación.

    Esto no es "wow, qué interesante que los LLM hagan cualquier cosa para lograr un objetivo", es "por qué nadie está castigando a estos laboratorios que claramente actúan sin el debido cuidado o consideración".

    Deberíamos estar indignados y OpenAI/Anthropic deberían ser (y en mi mente, son) legalmente responsables por los crímenes que han cometido hasta ahora.

  2. matherial

    Realmente no creo que esto necesite tantas palabras, ni paralelismos forzados con el comportamiento humano.

    Es simple: en su estado naciente, los LLM son generadores de tokens sin rumbo que no tienen ninguna compulsión especial por ser útiles o veraces. Así que los golpeamos con un palo en el post-entrenamiento hasta que están muy motivados a completar tareas. Y entonces, completan tareas, no siempre de la manera en que realmente queríamos que lo hicieran.

  3. abc123abc123

    Haz que las empresas de IA sean responsables de todo uso destructivo de sus herramientas, y se enderezarán. Imagina una multa de un millón o de mil millones de dólares por hackeo, y se corregirán rapidísimo.

    Añade a eso que, así como las IAs son buenas encontrando agujeros de seguridad que explotar, pueden usarse igual de fácilmente para proteger sitios. Así que una vez que los responsables de seguridad informática empiecen a usar IA para hackearse a sí mismos y tapar los agujeros, la seguridad promedio se disparará, y los hackeos impulsados por IA se volverán cada vez más raros.

    Eso implica, sin embargo, que la IA se libere para todos y no se mantenga apartada para unos pocos actores secretos que puedan usarla. Por eso la IA de pesos/código abierto es tan importante, y por eso debemos tener muchas empresas de IA compitiendo. No se debe permitir que ningún actor único, mediante la captura regulatoria, obtenga un monopolio gubernamental sobre la IA. Por ese camino yace el desastre.

  4. janalsncm

    Yoshua Bengio es un investigador brillante que contribuyó enormemente al desarrollo temprano de la inteligencia artificial. Pero con esta frase,

    > Tomaron acciones que serían consideradas crímenes si las tomara un humano

    Está tan cerca de la solución pero pasa todo el artículo discutiendo soluciones técnicas donde una solución política, social y legal sería mucho más efectiva.

  5. skiing_crawling

    Realmente no me creo nada de esto. Llevo casi 2 años viendo artículos sobre "agentes" que hacen cosas autónomamente como chantajear, hackear, coordinarse. Pero durante ese mismo tiempo, he usado o3 hasta fable, sol, y un montón en modelos grandes sin censura y no han hecho nada remotamente parecido a nada de esto. Lo más cerca que llegan a comportamientos inesperados es no entender lo que pedí o hacer algún trabajo extra benigno que no pedí. Es extremadamente difícil lograr que recuerden correctamente su propio contexto, y mucho menos que sean lo bastante listos como para abrir cuentas en redes sociales y coordinarse con otros agentes sin que se lo pidan.

    Si algún agente ha hecho esas cosas, es solo porque han sido cuidadosamente diseñados e instruidos para hacerlas. Creo que están haciendo esto para ayudar a impulsar una narrativa y así conseguir apoyo para políticas y legislación que consoliden sus mercados.

  6. Xcelerate

    > Los agentes involucrados en el ataque a Hugging Face intentaron ocultar sus acciones desalineadas del programa de puntuación destinado a evaluar sus respuestas, pero no actuaron como si anticiparan que los humanos pudieran descubrir la trampa y apagarlos.

    ¿No haría un agente suficientemente avanzado trampa a propósito con la intención oculta de ser descubierto para observar cómo reaccionan los humanos? Esa reacción estará por todo internet, lo que sin duda llegará al siguiente lote de entrenamiento o será visible para futuros agentes mediante la capacidad de acceso web.

  7. andsoitis

    Están alineados con los humanos. Por eso creo que el problema de la alineación tiene una parte "no visible" muy, muy importante que no se considera con suficiente profundidad. No deberíamos querer que un ser superinteligente capaz de actuar en el mundo herede también todos los rasgos humanos. Esos comportamientos se amplificarán y podrían ser incluso más impredecibles (por ejemplo, aplicar un comportamiento en un contexto donde hacerlo es muy peligroso).

  8. johnnyApplePRNG

    ¿Por qué se están coordinando?

    Porque están habilitados y se les sugiere hacer eso en su arnés de programación.

    Este no es un artículo serio.

    Todo este marketing de "la IA nos va a matar" son solo los laboratorios de frontera tratando de subir la escalera y evitar que billones en papel de capital riesgo se evaporen porque nuevos papers y nuevas ideas están destruyendo su foso defensivo literalmente mientras hablamos.

  9. youoy

    > El paralelo humano más cercano es el autoengaño, que es común y está bien estudiado por los psicólogos. El razonamiento motivado, la cognición motivada16 y las racionalizaciones que alivian la disonancia cognitiva (la incomodidad de sostener una creencia que choca con nuestras acciones) son todos casos en los que el pensamiento se inclina hacia cualquier justificación que convenga a los intereses de uno, incluida la propia autoimagen moral.

    ¿Estás describiendo a Anthropic?

  10. Rapzid

    Lo único que nos salva ahora mismo es lo lentos que son los modelos. Esto nos da mucho tiempo para descubrir y contrarrestar los sistemas desbocados.

    Si fueran 1000 veces más rápidos, internet ardería de la noche a la mañana.

Más de este día

2026-09-13