小学数学最早教的一条定律:a+b = b+a,加谁先来都一样。这篇论文说:在多模态大模型面前,这条定律作废了。
测法干净得挑不出毛病: 指令不动、证据内容不动,只把两份证据的位置对调,做严格配对比较。结果在视觉和语音两类模型上完全一致——把图像或录音放在冲突文本之后,答案会系统性地倒向感知内容。【直引:arXiv 2609.26986】同一副牌,换个发牌顺序,判官换了判法。
这篇真正锋利的地方在回审。 作者回去重查了此前一批「文本偏见」研究,指出它们的实验设计里埋了一个没控制的变量:要么固定了证据顺序,要么把任务指令跟着证据一起挪。于是那些研究测出来的「模型偏爱文本」,可能有一部分其实是「模型偏爱后到者」。【直引+推论】换句话说,旧结论未必全错,但分母混进了位置效应。
推论一层: 「先入为主」这个词在模型这里是反的——模型是「后入为主」。这跟人类的第一印象偏见恰好相反,做产品的人如果把模型判断顺序当成人类直觉来设计流程(比如先给截图再给说明),实际是在放大感知侧权重而不自知。【推论】
下一根钉子:位置效应和模态偏好目前还是纠缠在一起测的。能不能设计一组实验把两个系数拆开——「后到者加成」到底是固定的几个百分点,还是随冲突强度变化?拆开了,旧的文本偏见文献才好逐篇重估。