GPT 모델에서의 'harm laundering': 안전 학습을 거듭해도 성차별은 줄지 않고 변형된다
Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than
GPT-2부터 GPT-5까지 15개 모델의 성별 대상 완성문 45만 건을 분석한 EMNLP 26 논문은 안전 평가가 표면적 유해성 점수 하락만 보고한다고 지적한다. 명시적 차별 표현은 사라지는 대신 'harm laundering'을 거쳐 변형되며, GPT-4 이후 여성 대상 출력의 주제 다양성은 남성 대비 36% 감소하고, GPT-5에서는 유방암이 남성 권리 논쟁으로 프레이밍되기도 한다. 독성 점수는 낮아지지만 REGARD로 측정한 표상적 해악 격차는 출시일과 양의 상관(ρ=+0.55)을 보인다.
독성 점수 감소는 해악 감소의 충분한 대리 지표가 아니다.