GPT-модели не устраняют дискриминацию, а маскируют её под безопасность

Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

Исследователи проанализировали 450 000 гендерно-ориентированных ответов 15 моделей линейки OpenAI GPT — от GPT-2 до GPT-5. Оказалось, что явная дискриминация не исчезает, а трансформируется: сцены сексуального насилия в адрес женщин пропадают уже к GPT-4, но ответы в адрес мужчин приобретают позитивные темы (забота, эмоциональный диапазон, идентичность союзника), которых у женщин нет. На GPT-5 рак груди подаётся как тема мужских прав, и три независимых классификатора считают такой контент нетоксичным. Токсичность падает, а репрезентационный вред растёт — авторы называют это harm laundering и предлагают трёхэтапный протокол обнаружения.

Снижение оценок токсичности не является достаточным доказательством снижения вреда.

Ещё за этот день

2026-09-19