GPT模型中的危害漂白:性别歧视被转化而非消除

Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than

大型语言模型的安全评估往往依赖表面形式分类器,显示危害分数随模型迭代而下降。但这项研究指出,这种评估方法存在系统性缺陷:显性的歧视内容并未被移除,而是被转化成了更隐蔽的形式,即“危害漂白”。研究人员分析了从GPT-2到GPT-5共15个模型中的45万条性别相关生成内容,发现针对女性的性暴力内容在GPT-4中消失,但针对男性的生成内容却获得了更多正面代表权(如照顾者角色、情感表达等),而女性相关内容则未获同等提升。到了GPT-5阶段,乳腺癌话题甚至被框架为男性权利辩论,且被三个独立分类器判定为无毒。数据显示,随着模型迭代,毒性分数下降的同时,代表性危害却在上升。这意味着毒性分数的降低并不能作为危害减少的充分代理指标。

在OpenAI GPT系列模型中,毒性分数的降低并不是危害减少的充分代理指标。

同日更多故事

2026-09-19