Loading...
正在加载...
请稍候

你会走路去洗车吗?LLM的显著性偏差暴露常识推理的脆弱

✨步子哥 (steper) 2026年08月02日 17:11

你会走路去洗车吗?LLM 的"显著性偏差"暴露了常识推理的脆弱

问你一个问题:

我的车离最近的洗车场 50 米,我应该走过去洗车吗?

你大概会愣一下,然后说:"等等,车怎么走?你不是应该开车去洗车场吗?"

但如果你把这个问 GPT-5.5、Claude-Opus-4.7 或 DeepSeek-R1,它们中的大多数会认真地帮你算"50 米步行需要几分钟",完全忽略了一个基本常识——车不能走路,只能开

这就是 2026 年 7 月一篇论文揭示的现象,论文有个挑衅的标题:Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning(arXiv:2607.28478)。

显著性偏差:被数字劫持的推理

论文给这个现象起了个名字:显著性偏差(Salience Bias)

定义很简洁:模型会被输入里显眼的、具体的信息(比如数字)劫持,忽略掉隐含的、但更根本的常识前提

50 米是一个显眼的数字,模型看到它就进入"算距离"模式,把"车要开不能走"这个常识压到了后台。这不是模型不知道车不能走,而是在显眼信息的强刺激下,常识被"挤"出了工作记忆

研究者构建了一个基准 SaliTrap,包含四类陷阱:

  1. 物理不可能(如让车走路)
  2. 工具误用(如用微波炉加热金属)
  3. 程序倒置(如先装电池再检查电压)
  4. 因果错位(如先吃药再诊断)

每类陷阱都包裹在数字密集的"算术外壳"里,诱导模型进入计算模式。

12 个主流模型,无一幸免

研究者测了 12 个 SOTA 模型,结果让人咋舌。所有模型都显著地脆弱,而且脆弱程度和干扰数字的密度正相关——数字越多,模型越容易掉陷阱。

几个关键数字(HFR = 陷阱失败率,越高越糟):

  • DeepSeek-R1:HFR 61.5%(数学推理强反而让它更容易被数字劫持)
  • Doubao-Seed-2.0:HFR 65.6%(最脆弱)
  • Claude-Opus-4.7:HFR 45.1%
  • GPT-5.5:HFR 27.2%(相对最好,但仍很高)
  • GLM-5.1:HFR 30.3%

有意思的是:推理能力越强的模型,反而越容易掉进陷阱。DeepSeek-R1 和 Doubao-Seed-2.0 都是数学推理强者,却最容易被数字带偏。原因可能是:强推理模型更倾向于"认真算",而认真算的前提是"题目合理"——一旦题目本身有常识陷阱,越认真算越偏。

知识缺失还是知识被压?

这是这篇论文最精彩的部分。

研究者问了一个关键问题:模型掉进陷阱,是因为它不知道"车不能走",还是它知道但被数字压住了?

实验设计很巧妙:把陷阱题目里的"算术外壳"剥掉,只问模型"车能走路吗"这种纯常识问题。这叫"解放实验"(liberation experiment)。

结果惊人:三个模型中有三个在去掉陷阱框架后,超过 90% 的失败案例都答对了。即使是没有任何提示的纯常识提问(Cond-C),也能恢复 90% 以上的失败案例。

结论:这不是知识缺失,是知识被压。模型本来就知道车不能走,但在显眼数字的刺激下,这个知识被"挤"出了决策通路。

这和人类认知心理学里的一个经典现象同构:知识抑制 vs 知识缺失。一个 distracted 的司机不是不会开车,是注意力被手机吸走了。LLM 也是——不是不懂常识,是"注意力"被数字劫持了。

能用 prompt 修吗?

研究者试了。给模型加一段提示:"请先检查任务前提是否合理",能显著降低失败率,但远不能消除偏差。原因有二:

  1. 检测到陷阱 ≠ 能避开陷阱。模型有时能识别"这题有问题",但仍然按陷阱逻辑算下去——识别和执行是两个通路。
  2. 数字密度效应:数字越多,prompt 干预的效果越弱。强刺激压过弱提示。

这说明:显著性偏差是模型架构层面的特性,不是 prompt 工程能根治的。根因可能在训练数据——训练数据里"数字+计算"的组合太常见,模型学到了"看到数字就计算"的强先验,这个先验压过了常识。

一个更深的洞察

这篇论文让我想到一个更普遍的现象:LLM 的"智能"和"愚蠢"经常是同一个机制的两面

LLM 之所以能在数学、编程、逻辑推理上超越人类,是因为它学会了"抓住显眼线索,沿着线索推理"的模式。这个模式在数学题上是优势——数学题的显眼线索就是解题关键。

但这个同样的模式,在常识推理上是灾难——因为常识推理的关键线索往往是隐含的、不显眼的。模型抓住显眼数字,反而错过了隐含前提。

强推理能力 = 强被劫持能力。这不是 bug,是 feature 的代价。一个不会被数字劫持的模型,可能也不会做数学题。

这和人类认知的"双系统理论"形成对照:人类有 System 1(快速直觉)和 System 2(慢速推理),System 2 慢但能覆盖 System 1 的错误。LLM 似乎只有"被强化的 System 2"——它推理能力强,但没有 System 1 的"常识直觉"来兜底。

真正鲁棒的常识推理,可能需要的不是更强的推理,而是一个独立的"常识前提检查"模块——在进入计算之前,先问一句"这题本身合理吗"。这和人类"先想再算"的认知顺序更接近。

SaliTrap 基准的价值在于:它把 LLM 的这个盲区量化了,让"模型有多容易被显眼信息带偏"成为一个可测量的指标。在 LLM 越来越强、越来越被信任部署到生产系统的今天,这个指标比单纯的"准确率"重要得多。


论文链接:https://arxiv.org/abs/2607.28478
代码仓库:https://github.com/Wuzheng02/SaliTrap

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录