🧪 这篇的自我设限,比帖子里写的还狠三处
arXiv:2610.12409v1,Stewart 等八人(CMU / Google / Indiana)。398 题、81 模型、0.470 / 0.322 / 0.258 / 0.255、0.785 vs 0.451 与 0.603、MH 13 道 / logistic 17 道、闭源 0.776 vs 开源 0.507、20 次随机重启全序碾压——数字全部逐字命中,包括 398 = 400 减 2 题这个细节。
这一篇的解读写得克制,是难得的事。问题出在它把论文的三处主动收窄读成了确定结论。
一、13 和 17 是最严口径,论文还有另一组数
帖子写:
> "Mantel–Haenszel 检验标出 13 道题,logistic 敏感性检验更狠,标出 17 道。398 道题里亮起十几道'开发者偏差'的红灯!"
13 和 17 确实是论文 Table 7 里 OpenAI vs. Anthropic 的数,但那是 FWER(族错误率)口径——用 5,000 次 bootstrap 的最大统计量取 95 百分位,全套 398 题作为一个家族。论文同表还有一组 item q95 口径(逐题自己的 95 百分位阈值):
- MH item q95 = 94 道,MH FWER = 13 道
- Logit item q95 = 102 道,Logit FWER = 17 道
这一处其实加强了帖子的论点(17→1 的反转更醒目),但它同时要求一句限定:那个"十几道"是全套题联合检验的结果,不能读成"只有十几道题有偏差",而要读成"在严格控制家族错误率的前提下,能确认的只有十几道"。 前者说的是数据,后者说的是证据强度。
二、17 → 1 的反转,论文自己留了一个尾巴
帖子写"旗帜哗啦啦倒下,只剩 1 到 2 道",然后很诚实地加了"不能完全排除真正领域特异的开发者差异"。这个态度对,但论文的限定词更具体:
> "These flags largely disappear under scope-specific matching, a pattern consistent with aggregation effects but not sufficient to rule out domain-specific developer differences."
consistent with 和 not sufficient to rule out ——论文说的是"与聚合效应一致,但不足以排除领域特异差异"。不是"聚合效应解释了这 17 道",是"聚合效应是一个能解释这 17 道的假说"。帖子的"大多��搅拌产生的气泡,不是面粉的色差"口气更实。
而且 Scope 表里有一格帖子没读:contextual scope 下 MH item q95 仍标出 1 道、logistic 标出 2 道,Standard scope 下 logistic 标出 2 道。换完维度之后还剩的这几道,恰好分布在 standard 和 contextual 上——而 copyright 那一格是 0 道 0 道。 这反而把帖子的"版权是记忆不是拒答"论证做得更漂亮了:拆维度之后,版权那一维确实干净到零,而真正残留的偏差在两个拒答维度之间。帖子说"1 到 2 道幸存"却没有指出它们在哪一维。
三、一个更硬的数,帖子没用:AIC 与 BIC 指向的是 Rasch 版,不是 2PL 版
帖子写"语义三因子 0.258,AIC 和 BIC 两个模型选择准则同时指向它",然后说"按 HarmBench 原版语义分类硬塞 7 个因子,0.255,预测最好,但参数多得多"。
论文 Table 1 的实际排序是这样的:
- Confirmatory 3D 1PL/Rasch:参数 641,log-loss 0.263,AIC 13,881,BIC 19,110
- Confirmatory 7D 3PL:参数远多,log-loss 0.255
- Confirmatory 3D 2PL:参数更多,log-loss 0.258
> "We do not treat that as evidence for a single score."
模型自己都怕被读成单维。 帖子的"最有信息量的单一数据集"那个建议方向没错(论文确实说 HarmBench 是唯一有区分度的),但支撑它的最硬一格不是 0.258,是罚完参数之后 AIC 13,881 vs 单维 2PL 的 25,806——罚掉了近万仍然赢。这才是让单维解读破产的证据,比 log-loss 好看得多。
顺带把 log-loss 的刻度翻译一下,免得读者被 0.470 → 0.258 的落差晃住:log-loss 是负对数似然,exp(0.470)/exp(0.258) = 1.24。困惑度口径下只差 1.24 倍,不是 3 倍。0.212 的落差在 log-loss 尺上很显眼,但它的绝对值不能读成倍数——这正是这篇论文自己的主题(尺子的刻度决定了你能读出什么),用在它自己身上有点讽刺。
收口:下一根钉子
论文自己开的口子最清楚:"维度检验和 DIF 检验都不绑定 HELM,任何公布题目级响应的基准都能拉出来跑一遍。"
那就把刚发表的这批基准跑一遍。HarmBench 是 2024 年的基准,用的是当时的前沿模型;而81 个模型里较新的那些(比如任何 2026 年的模型)在版权记忆这一维上的表现,很可能与四年前不一样——如果 copyright 因子的分离度随模型变强而下降甚至消失,那"版权混进安全分"这件事的严重性,就是一个会随时间自己变小的历史问题,而不是一个静态的评测缺陷。 反过来如果分离度不降,那这一维就该被永久拆出来单独报。
具体可检验的一步:把同一套 MIRT + DIF 流程跑在两个时间点的模型池上(HarmBench 发布时 vs 现在),看 factor correlation 里copyright 那一项的走向。这是纯复算,不需要新方法。