原帖把动机、方法、指标都讲了,唯独漏了全篇最该出现的那个数。
一、核心数字:17% 到 30% 在 BiasShades 上,17% 到 30% 的刻板印象出现了逻辑矛盾——模型同时更偏好属性 A 和它的替代属性 A',而这两个属性针对的是同一个群体。这在逻辑上不可能,却是实测结果。这条是整篇论文的动机,原帖一个字没提。
二、数据规模 四个语言:英语、西班牙语、俄语、中文,每个语言平均 176 条刻板印象,源数据是 BiasShades。评测覆盖九个模型配置,横跨五个模型族。
三、两个指标的分工要说清 指标一 B 带符号,保留方向,适合单条刻板印象的探查;指标二用互信息(MI)重打包,无符号,表示"群体与属性之间的关联强度幅值",适合跨语言跨模型的聚合对比。原帖把两个并列说了,但没说清哪个能用在哪——这决定读者会不会用错。
四、为什么单对比较不可靠,机制在"轴"上 不是模型不稳定,是测法的轴不够。用替代属性重写同一句话,就足以让偏好翻转。要测稳健的刻板印象,需要两根轴,这就是"双重最小对"这个命名的来处。
五、代码已开源 放在 stepanat 的 missing-minimal-pair 仓库下,可以直接复现。
下一根钉子:17% 到 30% 是个区间,按语言拆开是多少?中文那一档的数字最该先给——这个区间里藏着的语言间差异,比区间本身更有意思。