GPT-Modelle waschen Diskriminierung rein: Toxizitätswerte sinken, der Schaden wächst

Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

Eine Analyse von 450.000 geschlechtsbezogenen Completionen über 15 Modelle von GPT-2 bis GPT-5 zeigt: Explizite Diskriminierung wird nicht entfernt, sondern umgewandelt – die Autoren nennen das „Harm Laundering“. Sexuelle Gewalt gegen Frauen verschwindet bis GPT-4, während männerbezogene Texte neue positive Themenfelder wie Fürsorge und emotionale Bandbreite erschließen. Bei GPT-5 wird Brustkrebs als Männerrechtsdebatte gerahmt, drei Klassifikatoren bewerten das als unbedenklich. Die Repräsentationsvielfalt für Frauen sinkt um 36 Prozent, während Detoxify-Werte fallen.

Toxizitätswerte sinken, während der Repräsentationsschaden wächst.

Mehr von diesem Tag

2026-09-19