Método del MIT detecta modelos de IA entrenados con material de abuso infantil sin generarlo
MIT's New Method Flags AI Models Trained on CASM Without Generating It

Investigadores del MIT, en colaboración con la organización sin fines de lucro Thorn, han desarrollado una técnica de auditoría que identifica si un modelo de IA ha sido ajustado para generar material de abuso sexual infantil (CSAM) sin necesidad de producir imágenes, evitando así las barreras legales y éticas. El método, llamado Gaussian probing, analiza las adaptaciones internas del modelo mediante la introducción de datos aleatorios y logra una precisión del 100% en pruebas. Esto podría permitir que plataformas como Hugging Face o Civitai detecten modelos peligrosos antes de que se difundan, abordando un problema creciente: en 2025, el Centro Nacional para Menores Desaparecidos y Explotados recibió más de 1.5 millones de reportes de CSAM generado por IA, frente a 67,000 en 2024.
Esto abre una nueva vía para que las plataformas que alojan modelos de código abierto y las fuerzas del orden puedan probar si un modelo es capaz de generar CSAM. Antes no teníamos forma de medirlo; era un punto ciego enorme del que algunos se aprovechaban.