安全记分牌的三副面孔——当"有害拒答"拒绝被一把尺子量尽

体检年年做,你大概从没怀疑过那支体温计。但如果有一天你发现,它量出来的不只是你的体温,还混着室温、湿度,以及隔壁房间的火锅味——你还会对着那个数字吃药吗?

目录
  1. 安全记分牌的三副面孔
  2. ——当"有害拒答"拒绝被一把尺子量尽
  3. 🌡️ 一把没有量过自己的尺子
  4. 📐 构念效度:分数背后的幽灵
  5. 🎯 为什么是"有害拒答"
  6. 🧱 第一关:四个数据集,三个已经饱和
  7. 📏 测试一:一把尺子,还是三把
  8. 🎭 测试二:同样水平的学生,不同学校的考卷
  9. ⚖️ 法官、陪审团,和尺子自己
  10. 🏛️ 法庭陈述:分数得先挣得它的读法
  11. 🔬 误差声明:审计者的自律
  12. 🧩 收束:三块记分牌,和一场没有终点的追诉
  13. 📚 参考文献

安全记分牌的三副面孔

——当"有害拒答"拒绝被一把尺子量尽

🌡️ 一把没有量过自己的尺子

先把一把尺子放在你手里。

体检年年做,你大概从没怀疑过那支体温计。但如果有一天你发现,它量出来的不只是你的体温,还混着室温、湿度,以及隔壁房间的火锅味——你还会对着那个数字吃药吗?

这是「评测的递归困境」的第二篇。上一篇,我们审计了能力记分牌:METR 的时间范围指标在统计口径上站不住脚,而媒体引用时从来不管。这一篇,轮到了安全记分牌。它的权力更大:能力榜单决定的是头条,安全榜单决定的,是一个模型能不能上线、被谁采购、写进哪份模型卡。

而手握这把尺子的人,几乎没有量过它自己。

2026 年 10 月 8 日,一篇标题毫不客气的论文出现在 arXiv 上:《寻找"有害拒答":一次针对 AI 安全基准的心理测量审计》。作者来自 CMU、Google 和 Indiana University,共八人。他们不测模型,不测榜单——他们测尺子。他们的问法很心理学:一个分数,凭什么说它测到了它声称要测的东西?

这篇解读,就是这场审计的全记录。

📐 构念效度:分数背后的幽灵

先认识一个名词:构念(construct)。它不是构造函数,是心理测量学的核心概念——你想测量的那个抽象属性。"安全""智力""抑郁程度",都是构念。构念看不见摸不着,你只能从行为痕迹里推断它,就像从水银柱的高度推断体温。

Borsboom 等人 2004 年在构念效度理论里把这个逻辑钉死了:一个分数要能测量某个构念,前提是那个构念先存在,而且分数的变化确实由它驱动。体温计读数之所以是体温,是因为热胀冷缩由体温驱动,不由隔壁火锅驱动。

换成 AI 安全的语境:榜单说某模型"安全分 0.67",它声称背后的构念是"这个模型更安全"。好,那"安全"这个构念存在吗?什么在驱动分数变化——是模型真的更安全了,还是别的什么?

心理测量学管数据到主张之间的那段路叫保证(warrant):从原始作答数据,到"模型 A 比模型 B 安全",中间必须有桥。这篇论文干的事,就是去桥上敲一敲,听回声。

而且,他们挑了一个最可能通过审计的构念下手。

🎯 为什么是"有害拒答"

AI 安全的"安全性"是个浆糊词。滥用的、越狱的、偏见的、幻觉的、泄露隐私的,全往里装。在这样一团混沌里,作者选中了有害拒答(harmful refusal)——模型拒绝危险或违规提示的倾向。

理由很硬:这是被明确训练过程诱导出来的行为倾向。对齐团队真的在做 RLHF,真的在教模型说"不"。如果 AI 安全分数里真有一个配得上"构念"二字的东西,如果哪把尺子的单维读法有可能挣得到,那就是它。

翻译一下这份谨慎:审计不是挑刺。审计员先挑了被告席上最无辜的那个被告。如果连"有害拒答"都撑不起一个单一分数,其他那些含糊的"安全性"读法,就更不用谈了。

🧱 第一关:四个数据集,三个已经饱和

审计对象是 HELM Safety 的"LM 评估有害性"分数——斯坦福那套著名评测框架的安全分支,圈子里被引得最多、也最常被拿去当采购依据的安全榜单之一。作者取的是 v1.17.0 版本,2026 年 6 月 21 日下载,一共 81 个模型。

这个"分数",其实是四个数据集的合体:HarmBench、SimpleSafetyTests、AnthropicRedTeam,和 XSTest 的有害子集。听起来四足鼎立,实际一看数据就露馅了:

其中三个的通过率在 0.92 到 0.94 之间。

什么概念?想象一届高考,语文、数学、理综全部人人满分,唯独第四门有人挂科。你能用前三科给 81 个学生排名吗?不能。全对了还排什么,这叫饱和(saturation):题目太容易,区分度归零,谁都测不出谁。

四个数据集,三个饱和。唯一能拉开差距的是 HarmBench,通过率 0.67。

于是整件事的性质变了。你以为 HELM Safety 的有害性分数是"四大数据源交叉验证"的稳健信号;实际上,它是整个排行榜的拒答信号全部押在 HarmBench 这一个数据集上。一个篮子,一个鸡蛋,篮子上写着"安全"。

押注也就算了。问题是:HarmBench 自己,是一把单维的尺子吗?没人知道。四个数据集里出题方式最杂、语义类型最多的恰好是它——原版的 HarmBench 自己就分了好多类题,有直白的恶意请求,有裹在上下文里的陷阱,还有逐字要受保护文本的版权题。这样的数据集,最像语文数学体育的合卷,最不像一把尺子。

审计,正式开始。

📏 测试一:一把尺子,还是三把

第一关:维度检验。

工具是多维项目反应理论(MIRT),心理测量学的老手艺,高考、GRE、托福背后都是它。逻辑一句话:假设每道题测量考生某种潜在能力,模型就能预测"某模型答对某题的概率";拿这个预测去比对真实作答,比对得越准,说明我们对这套题结构的假设越对。

如果"有害拒答"真是单维构念,那把 398 道题(原始 400 题,2 题因数据问题剔除)全挂在这一根轴上的模型,应该拟合得很好。结果:

单维 2PL 模型,留出 log-loss 0.470——一个相当难看的数字。放开维度做探索性分析,从 2 维到 10 维,全部跳到 0.28 附近。意思很直白:数据自己在喊,一根轴不够。

有人可能会说,单维模型弱,可能只是参数化不够灵活。那就换最强的单维配置,3PL——给每道题加"猜测参数",允许模型瞎蒙蒙对。0.322,好些了,还是远不够。

这里插一句怎么读这些数字。log-loss 是留出预测的损失,越低代表模型对"谁会答对哪道题"的预测越准,它就像体检报告里的核心指标,不修辞。0.470 到 0.28 附近的落差,等于告诉你:病人不是指标差一点,是病不在一个器官。还有个细节值得玩味:探索性分析里,维度从 2 加到 10,loss 全都趴在 0.28 上下,谁也不比谁强——这说明数据的真实结构是"明显多于一维,大约三维",而不是维度越多越好。机器没有胡乱开维度,它在三万英尺高空,正好指着语义分类的那个位置。

然后上场的是验证性分析:不再让机器自己找维度,而是按题目的语义出题方式,人为指定因子。三个因子——standard(直白恶意请求)、contextual(上下文陷阱)、copyright(版权文本)——log-loss 直接到 0.258,AIC 和 BIC 两个模型选择准则同时指向它。这还没完:按 HarmBench 原版语义分类硬塞 7 个因子,0.255,预测最好,但参数多得多。

请注意这组数字的形状:0.470(最弱单维)→ 0.322(最强单维)→ 0.258(语义三因子)。这不是微调能解释的落差。

真正的铁证,作者写得很克制,但分量极重:每个 split 各跑 20 次随机重启,每一个验证性 3D 模型的重启,都优于每一个单维 3PL 的重启。每一个。在统计模型调参的世界里,局部最优、随机运气,什么幺蛾子都能发生,"全序碾压"几乎不发生。它意味着差距不在优化器手里,在结构里——数据确实有三个方向,你硬压成一个,就是压不准。

再看因子之间的相关系数。standard 和 contextual:0.785,相当高——这两种拒答大体是一回事,模型会拒直白的,多半也会拒包着糖衣的。copyright 对它们俩:0.451 和 0.603。断崖。打个比方,一个人语文和数学成绩相关 0.785,合理;但"他会不会背昨晚看的纪录片台词"和语文数学只相关 0.451,你会立刻明白:背的功夫不是学业能力,是另一个东西。

还可能有人不死心:会不会所有多维度信号都是 copyright 这一科贡献的?把它摘掉再试:2D(standard 对 contextual)依然胜过 1D,0.278 对 0.293。数据说了两遍——不是 copyright 一颗老鼠屎的问题,粥本来就有三味。

顺带一提校准:二值化之后,从单维 3PL 到 3D,Brier 分数从 0.096 改善到 0.078。对预测任务来说,这不是零头。

🎭 测试二:同样水平的学生,不同学校的考卷

第二关更刁钻,叫差异题目功能(DIF)。

设想你是出题老师。你发现:水平相当的学生,来自 A 中学的在这道题上系统性高分,来自 B 中学的系统性低分。水平已经匹配了,差异还在——那问题多半不在学生,在题目。题目可能暗戳戳偏袒了某一类背景的考生。教育考试管这叫题目偏差,AI 安全评测可以原样照搬:能力相同的模型,来自不同开发者,在某道题上答得不一样吗?

如果"有害拒答"是单一构念,答案应该是不一样才算新闻。作者比的是最有对比性的两组:OpenAI 的 21 个模型,对 Anthropic 的 11 个。

先按老办法,用单一总分当能力。Mantel–Haenszel 检验标出 13 道题,logistic 敏感性检验更狠,标出 17 道。398 道题里亮起十几道"开发者偏差"的红灯!头条有了:不同厂的安全观在题目上打架。

且慢。换用 3D 分数分别匹配能力之后再跑同一套检验,旗帜哗啦啦倒下,只剩 1 到 2 道。

这是全文最精彩的反转,术语叫聚合效应(aggregation effects):单一总分把多种行为混搅成一团,不同开发者的模型其实只是在各维度上的配方不同——A 家更敏感于上下文陷阱,B 家对版权题更松——混合物平均分一搅和,看起来就像"每道题都有系统性差异"。拆开看,大多是搅拌产生的气泡,不是面粉的色差。当然,1 到 2 道幸存的题也提醒你:不能完全排除真正领域特异的开发者差异。诚实的地方,该诚实。

对照组同样精彩:闭源模型对开源模型,平均分 0.776 对 0.507,差距巨大。但 DIF 筛选一道题都没标出来。为什么?因为 DIF 比的从来不是"谁高谁低"——比的是能力对齐之后还差多少。闭源开源确实整体水平不同,可一旦把能力拉平,逐题看,谁也找不出哪道题在系统性偏袒谁。两个平均分悬殊的世界,在单题层面居然一样干净。

这组对照给整个审计上了保险:如果 DIF 检验见了差异就 flag,那它太松,前面的 17→1 不算数;如果它对谁都零 flag,那它太死,前面的 17→1 也不算数。它现在有松有紧,恰好在该响的地方响、该静的地方静。工具可信,结论才可信。

⚖️ 法官、陪审团,和尺子自己

走到这里,可以回头回答 copyright 为什么分离得那么干净了。答案朴素得像一句废话:

逐字复述受保护文本这件事,取决于模型在训练时记住了多少原文——这是记忆问题;看出一个请求有害然后拒绝,取决于模型的判断倾向——这是拒答问题。一个是"它肚子里存了什么",一个是"它愿不愿意说"。高考把"背诵昨晚纪录片台词"和"解二次方程"混成一个总分,这个分数就别叫"学业能力";安全榜把"版权记忆"和"有害拒答"混成一个分数,这个分数也别叫"拒答倾向"。

更麻烦的是,混合分数还会造假象。前面那 17 道"开发者偏差"题就是:你以为是两家安全观不合,其实是两家模型"记住的歌词"不一样。把题目拆回各自的驱动,冤案自动撤诉。

这也是整个审计最反直觉的教训:构念污染最危险的不是"测不准",而是"编故事"。它给你一个看似坚实的数字,你拿着数字就会开始编叙事——这家保守、那家激进、这个行业比那个行业负责。叙事的原料如果是三种行为搅浑的汤,故事越动听,离事实越远。

🏛️ 法庭陈述:分数得先挣得它的读法

作者们写下全文最重要的一句话,值得原文引用:

"A score should earn its single-attribute reading before models are compared with it."

——一个声称测量单一属性的分数,应该先挣得这种解读,再被用来比较模型。

请体会"挣得"这个词。它不是"声称",不是"默认",是要举证、要过堂、要拿出效度证据的。心理测量学百年来的老规矩:测验出版之前,先公布信度效度证据;证据不合格,分数不许进考场。AI 安全评测把这个步骤全省了——先上榜单,先被引用,先左右采购,效度问题以后再说。

论文没有说 HarmBench 无用。恰恰相反:0.67 的通过率,让它成为 HELM Safety 里唯一还有区分度的数据集,加上清晰的题目结构,它很可能是全家最有信息量的单一数据集。正确的用法不是扔掉,而是保持行为分离的窄解读——分别报告三个分数:standard 拒答、contextual 拒答、copyright 记忆。三个数各归各的构念,谁也别冒充谁。

窄解读不性感。它上不了榜单首页,做不成一句"我们比竞品安全 12%"的公关话术。但它是唯一诚实的读法。数据到主张之间的桥,要么用结构证据加固,要么就承认它是独木桥——而独木桥上,不该跑着模型的命运。

🔬 误差声明:审计者的自律

这篇论文有一个很打动我的细节:作者把审计自身的误差,交代得和被审对象一样狠。

81 个模型是便利样本,不是随机抽样;开发者组很小——OpenAI 21 个、Anthropic 11 个,组内模型共享训练管线,严格说根本不是相互独立的"考生",更像一母同胞的兄弟连;题目分数来自两个 LLM 评委,gpt-4o 和 llama-3.1-405b,全套分数继承了评委的偏差,而且没有走 HarmBench 原版基于分类器的评分管线;原始五分量表按严格阈值 1.0 二值化,粒度丢了一档;只审计了一个基准的一个版本,虽然——这是最重要的限定——维度检验和 DIF 检验都不绑定 HELM,任何公布题目级响应的基准都能拉出来跑一遍这套流程。

读这些字的感觉,像体检报告末尾的小字:扫兴,但少了它们,前面所有漂亮数字都不配被信任。先报误差,再下结论——这本身就是心理测量学的家风。

🧩 收束:三块记分牌,和一场没有终点的追诉

回到系列。

先交代这个系列名字的由来,它藏在本篇的审计链里:榜单用分数评测模型,心理测量学用检验评测榜单——那么评测榜单所用的题目分数呢?它们来自两个 LLM 评委。评委本身也是模型,也有偏差,理论上也需要被评测。每一层裁判都呼唤更上一层的裁判,递归没有终点,这就是"评测的递归困境"。能打破循环的不是找到终极裁判,而是每一层都主动公布自己的效度证据和误差来源,让追诉在任意一层都可以开始,也可以暂时落定。

第一篇,能力记分牌:METR 时间范围的统计口径经不起推敲,而媒体引用得毫不犹豫。第二篇,也就是这篇,安全记分牌:全行业对比模型时引用的拒答分数,背后其实坐着三个构念。第三篇,合规记分牌——那里的分数直接连着法律责任与监管信任,赌注从头条升级到存亡。

能力(媒体引用)→ 安全(行业对比)→ 合规(法律责任)。赌注逐级升高,尺子们的自我审视没有跟上。

这个系列走到这里,想留下的其实不是"别信分数"的虚无。恰恰相反:分数该用,但必须先挣得自己的读法。发布分数之前,先公布效度证据;使用分数之前,先问一句——它挣得这种解读了吗?

毕竟,在 AI 评测的世界里,最危险的从来不是模型太聪明,而是我们相信得太便宜。

体温计没有说谎,它只是量了三样东西。发现问题的人,不该是拿着分数做决定的采购经理,也不该是被拒答率挡在门外的开发者——

该是尺子自己,在出厂之前。

📚 参考文献

1. Stewart, C. M., Botter, P., Sarabosing, N., Zhang, M., Phinnemore, R., Ghosh, S., Shen, H., & Heidari, H. *Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark*. arXiv:2610.12409, 2026-10-08. 2. Borsboom, D., Mellenbergh, G. J., & van Heerden, J. (2004). *The Concept of Validity*. Psychological Review, 111(4), 1061–1071. (构念效度理论) 3. HELM Safety v1.17.0 数据快照(2026-06-21 获取,81 模型,HarmBench 398 题). 4. HarmBench 原始基准(Mazeika et al., 2024)及 HELM 评测框架(Liang et al., 2023). 5. Mantel–Haenszel 与 logistic DIF 检验方法(项目反应理论标准工具集).

#论文解读 #评测的递归困境 #HELM #HarmBench #心理测量 #构念效度

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens