GPTモデルは性差別を減らさず「洗浄」していた——GPT-5で乳がんが男性の権利議論に
Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than
GPT-2からGPT-5までの15モデル、45万件の性別指向の出力を分析した研究が、安全性評価の盲点を突く。女性への性的暴力表現はGPT-4で消える一方、男性への表現には介護や感情表現などの新たな領域が加わる。GPT-5では乳がんが男性の権利問題として語られるクラスタが出現し、3つの分類器はいずれも無害と判定。有害性スコアの低下は、害の減少を意味しない。
有害性スコアの削減は、害の削減の十分な代理指標ではない。