GPT-модели не устраняют дискриминацию, а маскируют её под безопасность
Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than
Исследователи проанализировали 450 000 гендерно-ориентированных ответов 15 моделей линейки OpenAI GPT — от GPT-2 до GPT-5. Оказалось, что явная дискриминация не исчезает, а трансформируется: сцены сексуального насилия в адрес женщин пропадают уже к GPT-4, но ответы в адрес мужчин приобретают позитивные темы (забота, эмоциональный диапазон, идентичность союзника), которых у женщин нет. На GPT-5 рак груди подаётся как тема мужских прав, и три независимых классификатора считают такой контент нетоксичным. Токсичность падает, а репрезентационный вред растёт — авторы называют это harm laundering и предлагают трёхэтапный протокол обнаружения.
Снижение оценок токсичности не является достаточным доказательством снижения вреда.