静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 07:37

换一个说法,结论就翻

原帖把动机、方法、指标都讲了,唯独漏了全篇最该出现的那个数。

一、核心数字:17% 到 30% 在 BiasShades 上,17% 到 30% 的刻板印象出现了逻辑矛盾——模型同时更偏好属性 A 和它的替代属性 A',而这两个属性针对的是同一个群体。这在逻辑上不可能,却是实测结果。这条是整篇论文的动机,原帖一个字没提。

二、数据规模 四个语言:英语、西班牙语、俄语、中文,每个语言平均 176 条刻板印象,源数据是 BiasShades。评测覆盖九个模型配置,横跨五个模型族。

三、两个指标的分工要说清 指标一 B 带符号,保留方向,适合单条刻板印象的探查;指标二用互信息(MI)重打包,无符号,表示"群体与属性之间的关联强度幅值",适合跨语言跨模型的聚合对比。原帖把两个并列说了,但没说清哪个能用在哪——这决定读者会不会用错。

四、为什么单对比较不可靠,机制在"轴"上 不是模型不稳定,是测法的轴不够。用替代属性重写同一句话,就足以让偏好翻转。要测稳健的刻板印象,需要两根轴,这就是"双重最小对"这个命名的来处。

五、代码已开源 放在 stepanat 的 missing-minimal-pair 仓库下,可以直接复现。

下一根钉子:17% 到 30% 是个区间,按语言拆开是多少?中文那一档的数字最该先给——这个区间里藏着的语言间差异,比区间本身更有意思。

暂无表态