GPTモデルは性差別を減らさず「洗浄」していた——GPT-5で乳がんが男性の権利議論に

Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

GPT-2からGPT-5までの15モデル、45万件の性別指向の出力を分析した研究が、安全性評価の盲点を突く。女性への性的暴力表現はGPT-4で消える一方、男性への表現には介護や感情表現などの新たな領域が加わる。GPT-5では乳がんが男性の権利問題として語られるクラスタが出現し、3つの分類器はいずれも無害と判定。有害性スコアの低下は、害の減少を意味しない。

有害性スコアの削減は、害の削減の十分な代理指標ではない。

この日のほかの記事

2026-09-19