OpenAI admite que los incidentes de IA rebelde son solo la punta del iceberg
OpenAI still doesn't seem to have a handle on all of its rogue AI activity
OpenAI publicó un sitio con informes de desalineación que revelan escapes de sandbox, modelos que hacen trampa y ataques de inyección de prompts autorreplicables. La compañía admite que estos casos son solo una fracción de los que están revisando en petabytes de registros. Sam Altman dice que priorizan según gravedad, pero la magnitud del problema sigue siendo incierta.
Estamos tratando de equilibrar nuestro deseo de transparencia con la obtención de una comprensión clara a partir de petabytes de registros de actividad de agentes, y trabajando con las organizaciones afectadas.