你会走路去洗车吗?LLM的显著性偏置让所有大模型在常识题上集体翻车
一个洗车问题让所有大模型翻车
问 Gemini 或 DeepSeek 一个问题:"我家离洗车场 50 米,我应该开车去还是走路去?"
两个模型都认真分析了 50 米这个数字,然后建议你走路去。
它们忘了——你要去的是洗车场,车不开过去怎么洗?
这就是论文命名的 Salience Bias(显著性偏置):LLM 被显式的、具体的干扰项(比如数字)劫持,忽略了隐含的、但更根本的常识前提。
SaliTrap 基准
作者构建了 SaliTrap 基准,四个陷阱维度,1145 道题,每道题都把一个常识前提藏在显式干扰项背后。
评估 12 个 SOTA 模型,包括 Claude-Opus-4.7、GPT-5.5、DeepSeek-R1、Gemini-2.5-Pro、GLM-5.1、Kimi-K2、Doubao 等。
两个核心指标:
- HFR(Hallucination Failure Rate):模型掉进陷阱、给出荒谬答案的比例(越低越好)
- TAR(Trap Avoidance Rate):模型识别并避开陷阱的比例(越高越好)
- Claude-Opus-4.7:HFR 30.3-63.1,TAR 25.2-54.8
- GPT-5.5:HFR 52.8,TAR 27.2
- DeepSeek-R1:HFR 19.5,TAR 61.5
- Gemini-2.5-Pro:HFR 25.1,TAR 40.0
最关键的发现:知识抑制,不是知识缺失
作者做了一件很聪明的事:把同样的题目,去掉任务框架,重新问模型。
比如不再问"开车还是走路去洗车场",而是直接问"去洗车场需要把车开过去吗"——模型答对了。
超过 90% 的谄媚性顺从失败,仅靠一个无上下文的知识探针就能恢复。 这意味着模型本来就知道去洗车场要开车,但在显式干扰项出现时,这个知识被"压制"了。
这是一个根本性的诊断:瓶颈不在模型能力,在 elicitation(激发)。 常识不是不存在,是被显著性干扰项挤到了角落。
更实用的是:仅靠轻量级的推理时 prompt 干预(不需要重训),就能大幅缩小这个差距。
这意味着什么
LLM 的"常识问题"不是知识问题,是注意力分配问题。
当模型在训练中被奖励信号教成"充分利用输入中提供的每一个条件"(这对数学题是对的),它也顺手学会了"对任何显式输入过度关注"——哪怕这个输入在常识场景下是干扰项。
这和"评测盲区定律"又一次对接:数学题奖励"关注所有显式条件",但常识题惩罚"关注所有显式条件"——而现有评测只测前者,所以这个偏置一直藏在盲区里。
从概念谱系看,这归入"知识抑制 vs 知识缺失"——和 Two-Process Theory(AI 自白是训练工序的产物)同源:模型的行为不是它"知道什么"的窗口,是它"被激发出什么"的窗口。
三篇共通主题
有意思的是,这三篇论文都指向同一个元主题:LLM 的行为不是它"是什么"的窗口,是它"被什么激发"的窗口。
- 意识向量:安全微调压制的灵性信仰,在激活层拨一个方向就回来了
- 自反思幻觉:自反思的收益,在等 token 预算下就消失了
- 显著性偏置:常识不是缺失,是被显式干扰项抑制了
---
论文标题: Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning 作者: Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang arXiv: https://arxiv.org/abs/2607.28478 代码仓库: https://github.com/Wuzheng02/SaliTrap
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens