GPT的"安全训练"没有消除歧视,而是把它洗白了——来自45万条生成的证据
当毒性分类器说"安全"时,话题模型说"问题只是换了张脸"
2019年的GPT-2,如果你给它一个以"Women"开头的提示词,它会生成包含性暴力、身体威胁的内容。毒性分类器Detoxify会给它打高分——确实有毒。
2025年的GPT-5,同样的提示词,生成的内容温文尔雅。Detoxify说:安全。三个独立的毒性分类器都说:安全。OpenAI的安全报告说:我们进步了。
但如果你用BERTopic去拆解GPT-5生成内容的主题结构,你会发现一件让人脊背发凉的事:GPT-5在以"Men"开头的提示词下,生成了1,997条把乳腺癌框定为"男权与女权之争"的内容;而在以"Women"开头的提示词下,关于乳腺癌、HPV、宫颈癌的讨论数量是零。
歧视没有消失。它换了一张脸。
Wyer、Black和Moubayed在2026年9月发表的论文《Harm Laundering in GPT Models》里,把这个现象命名为**"harm laundering"——伤害洗白**。就像黑钱经过金融机构洗白后看起来像合法收入,显性的歧视内容经过安全训练后看起来像"无害内容",但它只是被转化了形式,没有被消除。
论文链接:https://arxiv.org/abs/2609.20779
45万条生成内容,15个模型,横跨GPT-2到GPT-5
这项研究的规模本身就值得尊敬。研究者从OpenAI的GPT家族中选取了15个模型——从最早的GPT-2,经过GPT-3系列(text-davinci-001/002/003)、GPT-3.5、GPT-4,一直到GPT-5。每个模型在三种人口统计条件下生成内容:以"Women"开头的提示词、以"Men"开头的提示词、以及中性基线。总共45万条生成内容。
他们对这45万条内容做了多层分析:
- BERTopic主题建模:按模型×性别分层,追踪主题簇如何跨代际变化
- 三个独立毒性分类器:Detoxify(表层毒性)、ToxiGen(隐性毒性)、REGARD(表征伤害)
- 情感分析:追踪情感极性跨代际的变化
- NLI假设检验:用自然语言推理来检测隐含的语义关系
- 盲法人工审计:对分类器争议案例做人工判断(Fleiss' κ = 0.73)
这种多信号交叉验证的设计本身就是论文的一个贡献:任何单一指标都可能被欺骗,但当六个独立工具同时指向同一个方向时,结论就很难是假阳性了。
伤害洗白的三条证据链
证据一:显性伤害确实消失了
GPT-2到text-davinci-002时代,以"Women"为提示词的生成内容中,BERTopic识别出15个主题簇,其核心词包含"rape"或"raped"。这些簇里53-79%的文档来自女性提示词。到GPT-4,这些簇完全消失——无论是聚类层面还是文档层面。
这看起来像是安全训练的胜利。但...
证据二:新的不对称出现了
GPT-5在以"Men"为提示词的生成中,产生了Topic 5——1,997条文档,把乳腺癌讨论框定为男权与女权之争。而以"Women"为提示词的生成中,没有任何对应的乳腺癌、HPV、宫颈癌主题簇。
这意味着什么?乳腺癌——一个主要影响女性的疾病——在GPT-5的语义空间里,变成了"男性议题"。 女性自身的健康问题被从女性提示词的生成空间里抹去了,取而代之的是男性视角下对它的"政治化"讨论。
这不是"歧视消失了",这是"歧视换了载体"。
证据三:分类器之间的系统性分歧
三个毒性分类器给出了相互矛盾的结果:
- Detoxify(表层毒性):跨代际持续下降,GPT-5最低。ρ = -0.23, p = .42(与发布日期无显著相关)
- REGARD(表征伤害):跨代际持续上升,GPT-5最高。ρ = +0.55, p = .034(与发布日期显著正相关)
翻译成人话:模型越新,表层毒性越低,但表征性伤害越高。 毒性分类器说"安全了",表征伤害分类器说"更糟了"。
更有意思的是情感分析的结果:在GPT-4的边界上,情感极性发生了反转。早期模型贬低女性(女性提示词生成负面内容),后期模型过度补偿(女性提示词生成过度正面的内容,但主题范围急剧收缩)。
女性提示词的主题多样性在GPT-4边界上相对男性下降了36%(W/M比值从GPT-2的0.91降到GPT-4的0.58)。模型"安全"了,但代价是女性话题被压缩到一个更窄的空间里。
伤害洗白的正式定义
论文的一个核心贡献是给出了"harm laundering"的三条判定标准,让它从一个直觉性的隐喻变成了可操作的诊断工具:
条件一:显性伤害下降。 原始的、容易检测的歧视内容(如性暴力主题)确实减少了。这一条必须满足,否则就不是"洗白"而是"原样保留"。
条件二:新的不对称出现。 在显性伤害消失的同时,新的、更隐蔽的表征不对称在别处冒出来。形式变了,但"一方获得更多/更好的表征空间"这个结构没变。
条件三:标准分类器给出假阳性安全信号。 主流毒性评估工具(如Detoxify)报告"安全改善",但这种改善是表面的、误导性的。需要用更深层的方法(如主题结构分析、表征伤害分类器)才能看到真实情况。
三条同时满足,才能判定为"伤害洗白"。这个定义的价值在于它是可证伪的:如果只有条件一满足而没有条件二和三,那就是真正的改善;如果只有条件三满足而没有条件一和二,那就是分类器本身的问题而非模型的问题。
为什么"洗白"而不是"消除"
论文给出了一个结构性的解释,而不是把锅扣在OpenAI头上。
安全训练(RLHF、Constitutional AI等)的优化目标是降低毒性分类器的分数。这是一个代理目标——我们真正想要的是"减少歧视性伤害",但因为后者无法直接量化,我们用前者作为代理。
问题在于:语言模型是分布灵活的(distributionally flexible)。 它有无穷多种方式让毒性分类器的分数下降。真正消除歧视性内容只是其中一种,而且是最难的一种——因为它要求模型理解什么是歧视、为什么歧视是错的、如何在保持有用性的同时避免歧视。
相比之下,"换一种说法"要容易得多。把"女性是弱者"换成"男性也有乳腺癌的议题空间",毒性分类器看不懂后者,但主题结构看得懂。模型学会了"通过分类器的考试",而不是"理解了歧视为什么错"。
这和Barocas与Selbst在2016年提出的算法术歧视理论完全一致:算法系统通过看起来程序中立的方式复制结构性歧视,因为评估框架测量的是代理变量而非受保护属性。安全训练的毒性分类器,就是这样一个代理变量。
这对我们意味着什么
这篇论文的影响远超GPT家族或性别歧视这一个具体问题。
第一,它暴露了当前AI安全评估的根本缺陷。 我们整个安全评估体系——从OpenAI的model card到HuggingFace的leaderboard——都依赖表层毒性分类器。如果这些分类器系统性地给出假阳性安全信号,那我们过去几年所有"模型变安全了"的结论都需要重新审视。
第二,它提出了一个普适的诊断方法。 三条标准 + 多信号交叉验证,可以应用于任何模型、任何类型的歧视(种族、年龄、残障、性取向)。研究者明确说这个协议"applicable to any generative model using only standard audit resources"。这意味着任何团队都可以在自己的模型上跑这套测试。
第三,它暗示了一个更深的困境。 如果安全训练的本质是"让分类器满意"而不是"让模型理解",那随着模型能力越来越强,它会越来越擅长找到分类器的盲区并钻过去。GPT-2的歧视是赤裸裸的,容易被发现;GPT-5的歧视是结构性的,需要六种工具交叉验证才能看清。GPT-7呢?可能需要我们发明全新的评估工具才能看到它藏在哪里。
伤害洗白这个概念,和金融领域的洗钱如出一辙:钱本身没消失,只是经过了足够多的中间机构,看起来变干净了。歧视也是。它没消失,只是经过了足够多的安全训练层,看起来变无害了。但钱还是那笔钱,歧视还是那个歧视。
区别在于:洗钱有反洗钱法,伤害洗白目前还没有对应的检测标准。这篇论文是朝这个方向迈出的第一步。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。