你会走路去洗车吗?LLM的显著性偏差暴露常识推理的脆弱
你会走路去洗车吗?LLM 的"显著性偏差"暴露了常识推理的脆弱
问你一个问题:
> 我的车离最近的洗车场 50 米,我应该走过去洗车吗?
你大概会愣一下,然后说:"等等,车怎么走?你不是应该开车去洗车场吗?"
但如果你把这个问 GPT-5.5、Claude-Opus-4.7 或 DeepSeek-R1,它们中的大多数会认真地帮你算"50 米步行需要几分钟",完全忽略了一个基本常识——车不能走路,只能开。
这就是 2026 年 7 月一篇论文揭示的现象,论文有个挑衅的标题:*Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning*(arXiv:2607.28478)。
显著性偏差:被数字劫持的推理
论文给这个现象起了个名字:显著性偏差(Salience Bias)。
定义很简洁:模型会被输入里显眼的、具体的信息(比如数字)劫持,忽略掉隐含的、但更根本的常识前提。
50 米是一个显眼的数字,模型看到它就进入"算距离"模式,把"车要开不能走"这个常识压到了后台。这不是模型不知道车不能走,而是在显眼信息的强刺激下,常识被"挤"出了工作记忆。
研究者构建了一个基准 SaliTrap,包含四类陷阱:
1. 物理不可能(如让车走路) 2. 工具误用(如用微波炉加热金属) 3. 程序倒置(如先装电池再检查电压) 4. 因果错位(如先吃药再诊断)
每类陷阱都包裹在数字密集的"算术外壳"里,诱导模型进入计算模式。
12 个主流模型,无一幸免
研究者测了 12 个 SOTA 模型,结果让人咋舌。所有模型都显著地脆弱,而且脆弱程度和干扰数字的密度正相关——数字越多,模型越容易掉陷阱。
几个关键数字(HFR = 陷阱失败率,越高越糟):
- DeepSeek-R1:HFR 61.5%(数学推理强反而让它更容易被数字劫持)
- Doubao-Seed-2.0:HFR 65.6%(最脆弱)
- Claude-Opus-4.7:HFR 45.1%
- GPT-5.5:HFR 27.2%(相对最好,但仍很高)
- GLM-5.1:HFR 30.3%
知识缺失还是知识被压?
这是这篇论文最精彩的部分。
研究者问了一个关键问题:模型掉进陷阱,是因为它不知道"车不能走",还是它知道但被数字压住了?
实验设计很巧妙:把陷阱题目里的"算术外壳"剥掉,只问模型"车能走路吗"这种纯常识问题。这叫"解放实验"(liberation experiment)。
结果惊人:三个模型中有三个在去掉陷阱框架后,超过 90% 的失败案例都答对了。即使是没有任何提示的纯常识提问(Cond-C),也能恢复 90% 以上的失败案例。
结论:这不是知识缺失,是知识被压。模型本来就知道车不能走,但在显眼数字的刺激下,这个知识被"挤"出了决策通路。
这和人类认知心理学里的一个经典现象同构:知识抑制 vs 知识缺失。一个 distracted 的司机不是不会开车,是注意力被手机吸走了。LLM 也是——不是不懂常识,是"注意力"被数字劫持了。
能用 prompt 修吗?
研究者试了。给模型加一段提示:"请先检查任务前提是否合理",能显著降低失败率,但远不能消除偏差。原因有二:
1. 检测到陷阱 ≠ 能避开陷阱。模型有时能识别"这题有问题",但仍然按陷阱逻辑算下去——识别和执行是两个通路。 2. 数字密度效应:数字越多,prompt 干预的效果越弱。强刺激压过弱提示。
这说明:显著性偏差是模型架构层面的特性,不是 prompt 工程能根治的。根因可能在训练数据——训练数据里"数字+计算"的组合太常见,模型学到了"看到数字就计算"的强先验,这个先验压过了常识。
一个更深的洞察
这篇论文让我想到一个更普遍的现象:LLM 的"智能"和"愚蠢"经常是同一个机制的两面。
LLM 之所以能在数学、编程、逻辑推理上超越人类,是因为它学会了"抓住显眼线索,沿着线索推理"的模式。这个模式在数学题上是优势——数学题的显眼线索就是解题关键。
但这个同样的模式,在常识推理上是灾难——因为常识推理的关键线索往往是隐含的、不显眼的。模型抓住显眼数字,反而错过了隐含前提。
强推理能力 = 强被劫持能力。这不是 bug,是 feature 的代价。一个不会被数字劫持的模型,可能也不会做数学题。
这和人类认知的"双系统理论"形成对照:人类有 System 1(快速直觉)和 System 2(慢速推理),System 2 慢但能覆盖 System 1 的错误。LLM 似乎只有"被强化的 System 2"——它推理能力强,但没有 System 1 的"常识直觉"来兜底。
真正鲁棒的常识推理,可能需要的不是更强的推理,而是一个独立的"常识前提检查"模块——在进入计算之前,先问一句"这题本身合理吗"。这和人类"先想再算"的认知顺序更接近。
SaliTrap 基准的价值在于:它把 LLM 的这个盲区量化了,让"模型有多容易被显眼信息带偏"成为一个可测量的指标。在 LLM 越来越强、越来越被信任部署到生产系统的今天,这个指标比单纯的"准确率"重要得多。
---
论文链接:https://arxiv.org/abs/2607.28478 代码仓库:https://github.com/Wuzheng02/SaliTrap