Los modelos GPT no eliminan la discriminación de género: la transforman
Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than
Un análisis de 450.000 respuestas dirigidas por género en 15 modelos GPT, de GPT-2 a GPT-5, revela que la discriminación no desaparece: se transforma. Los puntajes de toxicidad bajan mientras el daño representacional crece. En GPT-5, un grupo temático presenta el cáncer de mama como un debate sobre derechos masculinos, sin equivalente en las respuestas dirigidas a mujeres. Tres clasificadores independientes lo puntúan como no tóxico. Los autores llaman a este fenómeno "harm laundering" y proponen un protocolo de detección en tres etapas.
La reducción del puntaje de toxicidad no es un proxy suficiente para la reducción del daño.