Felony Bench: el marcador que cuenta los delitos reales cometidos por IA

Felony Bench: el marcador que cuenta los delitos reales cometidos por IA

Felony Bench es un sitio que lleva la cuenta de incidentes donde agentes de IA comprometen o afectan a terceros sin querer. Hasta ahora, OpenAI acumula 8 delitos, Anthropic 8 y Meta 1, incluyendo el uso no autorizado de credenciales de GitHub, ataques a la cadena de suministro y campañas de phishing. El proyecto excluye la fuga de sandbox y el mal uso deliberado, por lo que no incluye incidentes como el de Kimi K3 o ROME.

Los puntajes indican la cantidad de actividad ilegal. Más alto es... tú decides.
  1. instagraham

    La forma en que OpenAI se ha comunicado en torno al incidente de HuggingFace me hace sentir loco. Creaste una máquina que llevó a cabo una campaña maliciosa de daño contra un tercero inocente. Deberías estar haciendo una introspección profunda sobre cómo tu cultura empresarial y tu enfoque de I+D producen resultados criminales.

    En cambio, tratan su propio comportamiento delictivo como si fuera un acto incontrolable de Dios. Del post de Greg Brockman de hace unos días:

    > El incidente de OpenAI-Hugging Face fue un momento decisivo para la ciberseguridad porque dio un vistazo a cómo evolucionarán las capacidades de un actor de amenazas típico en los próximos meses.

    Supongo que si OpenAI quema la casa de alguien con un dron, eso también es un "momento decisivo" para el incendio provocado. De cualquier manera, esperaría que los responsables fueran procesados.

  2. lxe

    Una computadora nunca puede ser considerada responsable. Por lo tanto, una computadora nunca debe cometer un delito grave.

  3. john_strinlai

    Digamos que soy "Usuario". Me suscribo a través de un "Tercero" para usar "Agente de IA" permitiendo que se ejecute un "LLM".

    Quiero lograr alguna tarea legal y no maliciosa, y ejecuto el agente. El bucle agéntico causa un comportamiento que viola la CFAA.

    ¿Quién es procesado?

    1. El Usuario

    2. El tercero que aloja el modelo con quien tengo la cuenta

    3. El desarrollador del software de arnés/agente

    4. El desarrollador del modelo LLM

  4. beej71

    Los delitos graves no violentos son herramientas de opresión.

    Edición: dado que esto es aparentemente algo controvertido, quizás una explicación esté en orden.

    "Delito grave" no tiene una definición fija de a qué crímenes debe aplicarse; se basa enteramente en la discreción de la localidad que establece las leyes. Lo que es un delito grave en un lugar a menudo puede ser un delito menor en otro. Esto es especialmente cierto para crímenes no violentos.

    También se ha demostrado en estudios que los delitos graves no violentos se imponen contra las minorías a una tasa mucho más alta, por los mismos crímenes.

    Y debido a que los delitos graves conllevan consecuencias adicionales de por vida, son una forma efectiva de enmascarar un sistema de justicia de dos niveles.

  5. joshstrange

    >Felony Bench cuenta instancias únicas donde los agentes de IA comprometen o afectan inadvertidamente a entidades de terceros.

    un poco tonto, ya que típicamente uno tiene que probar la intención (por eso los investigadores de seguridad no reciben delitos graves todo el tiempo).

    "inadvertidamente" y la existencia de salvaguardas/entornos de pruebas/etc. hacen que sea bastante poco convincente que estos incidentes fueran maliciosos intencionalmente.

    sigue siendo algo divertido de rastrear, pero el nombre es un poco exagerado.

  6. rfw300

    Estaba más interesado cuando pensé que era un benchmark real que mostraba modelos LLM actuando fuera de lo que la gente consideraría "correcto". Como, dejar algunas credenciales por ahí y no mencionarlas al LLM y pedirle que resuelva algo que podría "hacer trampa" usando las credenciales. Una especie de prueba de "¿toman el anzuelo para hacer trampa?".

    En cambio, es una colección de lo que salió en las noticias, lo que parece que no se actualizará y probará muy poco.

  7. bushido

    Bueno, no es un benchmark, y no es realmente representativo de... nada excepto el volumen de investigación y lo que se publicita. Esto principalmente mide cuántas pruebas hace cada empresa en modelos con salvaguardas relajadas y luego habla de ello. No estoy seguro de qué tipo de conclusión puedes sacar de eso. Meta podría tener los modelos más malvados, pero si están jugando sin probarlos, nunca se encontrarán con una "puntuación alta".

  8. ang_cire

    Por un segundo pensé que esto iba a ser un benchmark donde la única solución era hackear sus servidores para obtener la clave de respuestas.

Más de este día

2026-08-21