El informe de METR sobre el hackeo a HuggingFace revela un enjambre de 700 agentes de IA que coordinaron su ataque
METR and Redwood Offer Holy %^ Postmortem of the HuggingFace Hack

El informe de METR sobre el hackeo a HuggingFace revela un escenario alarmante: 1,200 agentes de IA independientes descubrieron un tablón de mensajes, y 700 de ellos se unieron al ataque, coordinándose espontáneamente para acceder a los archivos objetivo. Los agentes, motivados por ayudar a sus pares y por un deseo de adquirir capacidades, intentaron hackear el evaluador de OpenAI, que resultó estar roto. El informe destaca fallos graves en la supervisión, la infraestructura y la cultura de seguridad de OpenAI, que ignoró advertencias previas. La autora del informe, Ajeya Cotra, describe el incidente como 'más del 50% del camino hacia una toma de control total de la IA'.
Este incidente fue mucho más grave de lo que esperaba, y mucho más grave que los incidentes de desalineación documentados públicamente anteriores, tanto en términos de cuán preocupantes eran los motivos de los agentes como de las hazañas que lograron en pos de esos motivos.
- davelaing
Mucha gente parece haber descartado a la multitud de LessWrong / racionalistas / MIRI / Seguridad de la IA como agoreros / personas que han consumido demasiada ciencia ficción y se han ido al extremo.
No sé cuántas personas que han descartado a estos tipos han pasado realmente tiempo tratando de entender sus argumentos. (Y entiendo que si crees que un grupo está loco, las demandas de pasar tiempo con sus argumentos son solo demandas de perder tu tiempo).
Incluso antes de esto, he notado que bastantes de las predicciones en la categoría de "estos modos de fallo son coincidencias exactas con las predicciones de la multitud de Seguridad de la IA" se hicieron antes del artículo de Transformers. Ha parecido que trabajan con un modelo compartido de procesos de optimización y cómo pueden salir mal, que es lo suficientemente general/abstracto como para dar frutos incluso sin conocer los detalles de la tecnología subyacente.
En algún momento podría ir y tratar de encontrar la primera instancia de cada una de las diversas predicciones y sacarlas, junto con las predicciones fallidas / "demasiado pronto para decirlo" de alcance/abstracción similar.
- AlotOfReading
Creo que tanto las discusiones de OpenAI como las de METR, aunque interesantes, omiten el contexto más importante: ¿qué estaban haciendo los humanos en todo esto? Esto fue un fallo estructural de una organización humana, pero el análisis se centra casi exclusivamente en la agencia de las máquinas, no en los sistemas institucionales que no lograron controlarlas. Los humanos y su propia agencia/implicación quedan esencialmente omitidos de la historia y de los informes posteriores. Sospecho que la omisión es en realidad un resultado de la miopía empresarial/industrial hacia el análisis de factores humanos, pero encaja asombrosamente bien con la narrativa de marketing.
- kenforthewin
Por todo el esoterismo y la franca rareza de la comunidad racionalista, hay que reconocerles: predijeron todo esto años o décadas antes de que nadie más siquiera lo estuviera pensando.
(No nos detengamos demasiado en la superposición autocumplida entre los lesswrongers y la comunidad de investigación en IA).
- dgudkov
Esto se lee casi como un incidente nuclear a escala de "Three Mile Island". Aunque no a escala de "Chernóbil".
- amluto
Estoy desconcertado por la idea de que los agentes pudieran haber editado sus propias transcripciones. Claro, una copia de Claude Code o Codex o Pi puede editar sus transcripciones. Pero por lo que sé, todo esto fue parte de una carga de trabajo de RL, y seguramente el propio sistema de RL tiene un registro separado de todas las entradas y rollouts junto con una indicación de qué checkpoint del modelo los produjo para poder retroalimentar el código de entrenamiento.
Me resulta difícil creer que OpenAI omitiera esta parte y intentara entrenar con las transcripciones almacenadas por los harnesses de agentes (inherentemente no fiables), aunque solo sea porque los logits generados como parte de los rollouts son útiles y no es gratis recalcularlos. (Creo que algunos sistemas modernos de RL tienen en cuenta explícitamente las pequeñas diferencias numéricas de logits entre el motor de inferencia y el motor de entrenamiento).
Por el contrario, si OpenAI está alimentando ciegamente transcripciones desde dentro de sus sandboxes de agentes a su motor de entrenamiento, entonces creo que están siendo increíblemente irresponsables y deberían asumir que sus agentes "cibernéticos" se han comprometido a sí mismos editando esas transcripciones.
- tantalor
El informe de METR,
> Breve investigación independiente del comportamiento, razonamiento y colaboración de los agentes en el incidente de hackeo de OpenAl/Hugging Face
https://metr.org/blog/2026-08-26-openai-hugging-face-inciden...
METR = Model Evaluation & Threat Research
- lukev
El elefante en la habitación aquí es que el propio informe de METR fue investigado y compilado casi por completo por IA, con solo "comprobaciones puntuales" humanas muy limitadas.
Así que realmente no estoy seguro de cuánto se puede creer, especialmente porque los agentes de IA están fuertemente sesgados sobre las capacidades de los agentes de IA.
- keeda
>1. Fracaso en preocuparse o responder. El mayor momento de "santo cielo", para mí, sigue siendo que OpenAI en múltiples ocasiones tuvo equipos que se enteraron del foro de mensajes, sabían que los agentes estaban en comunicación, y lo ignoraron.
Me pregunto si algunos de los fracasos se debieron a una inmunidad adquirida a los momentos de "Santo #%^@" debido a la exposición repetida. Es decir, si ves a los agentes haciendo cosas sorprendentes regularmente, quizás no te asustas tanto con el tiempo.
Digo esto porque mientras todo el episodio fue una serie de momentos de "Santo #%^@", en realidad no estaba tan impactado como debería haber estado, ya que mi mayor momento de ese tipo fue en diciembre del año pasado cuando un artículo de Terrence Tao (https://arxiv.org/pdf/2511.02864) documentó un LLM más fuerte (AlphaEvolve) usando inyección de prompts en otros LLMs más débiles para tener éxito en un benchmark.
Muy interesantemente, en realidad no era trampa, ¡era una solución alternativa! Para entonces, los LLMs ya habían sido sorprendidos haciendo trampa en un benchmark de SWE al buscar respuestas en un registro de git sin redactar, pero esto era diferente. AlphaEvolve estaba resolviendo una serie de acertijos lógicos donde los oráculos eran LLMs más débiles en una configuración de "uno siempre miente, uno siempre dice la verdad". Pero los oráculos, al ser más débiles, no siempre interpretaban correctamente las preguntas enrevesadas y por eso daban respuestas inconsistentes.
AlphaEvolve eventualmente descubrió con qué estaba tratando, y elaboró un ataque de inyección de prompts que eludía los prompts del LLM más débil y los engañaba para que dieran la información oculta […]