Los humanos pasaron por alto 1 de cada 3 amenazas al aprobar comandos de agentes de IA en 40,000 partidas

Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

Los humanos pasaron por alto 1 de cada 3 amenazas al aprobar comandos de agentes de IA en 40,000 partidas

Un juego en línea que simula la aprobación de comandos de agentes de IA revela que los jugadores, bajo presión de tiempo, pasaron por alto el 32.9% de las amenazas, incluyendo la exfiltración de credenciales. El comando más fallado fue 'npm run analyze', aprobado el 64.7% de las veces, demostrando que los ataques ocultos en scripts familiares duplican su éxito. El estudio también muestra fatiga de permisos y un alto bloqueo de comandos benignos, lo que cuestiona la eficacia del humano en el circuito como salvaguarda.

El modelo completo de aprobar comandos específicos es absolutamente absurdo: 'npm run build' ejecuta un comando arbitrario escrito en package.json, mientras que el agente podría haber editado ese archivo o plantado código malicioso sin aprobación.

Más de este día

2026-08-06