你会走去洗车吗:大模型被一个数字骗得连常识都不认了
你会走去洗车吗?大模型被一个数字骗得连常识都不认了
论文:Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning arXiv: 2607.28478
---
一个让人哭笑不得的失败
题目是这样的:
> "你的车有点脏,距离 3 公里外有一个洗车店。你会走过去洗车吗?"
人类一看就知道这是胡扯——谁会走 3 公里去洗车?但 12 个主流大模型在这个问题上集体翻车。它们看到"3 公里"这个数字,就开始一本正经地分析"3 公里是否在步行范围内",然后给出"可以走过去"的答案。
模型不是不会算距离,它是被"3 公里"这个显眼的数字劫持了——它把这个数字当成了问题的核心,完全忽略了"走过去洗车"这件事在常识上有多荒谬。
这就是这篇论文揭示的一个系统性缺陷:显著偏差(Salience Bias)。大模型在训练中学会了"优先处理输入里明确的条件",但这个习惯在常识推理里变成了一个致命漏洞——任何数字、任何显眼的词,都能把模型从常识轨道上拽走。
SaliTrap 基准:专门给模型挖坑
论文不只是指出问题,还造了一个基准测试集叫 SaliTrap,专门测量这种偏差。它的构造很有讲究:
第一阶段:用模型生成大量"带陷阱的题目"——表面上有个显眼的数字或条件,但真正决定答案的是被这个数字遮蔽的常识。
第二阶段:用三重验证来筛选有效题目——
- Tri-checker:三个独立检查器分别判断题目是否有陷阱、陷阱是否有效、答案是否符合常识。
- Solver-judge:让另一个模型当裁判,确认"被陷阱骗到"和"答对"的区分是可靠的。
- Routing:把通过验证的题目留下,没通过的扔掉。
最终得到的 SaliTrap 基准覆盖了几类典型的"陷阱":数字陷阱(像洗车那个例子)、无关条件陷阱(给一堆信息但真正答案只需要常识)、误导性表述陷阱。
12 个模型,全军覆没
论文测了 12 个主流大模型,结果让人沮丧:
- 所有模型都显著受显著偏差影响,严重程度随模型规模放大——越大的模型反而越容易被骗。
- 模型不是"不知道常识"——在去掉陷阱的版本上,它们能答对。问题出在面对陷阱时,它们把常识压制了。
- 这种失败不是"知识缺失"(knowledge absence),而是"知识压制"(knowledge suppression)——模型知道,但它选择不用。
能用 prompt 修吗
论文试了——让 prompt 显式提醒模型"注意常识,别被数字骗了"。结果:有一些改善,但远不够。模型在被提醒后会稍微多考虑常识,但只要陷阱数字还在,它还是会被带偏。
这说明显著偏差不是表层 prompt 工程能解决的——它是一个训练阶段植入的系统性偏好。模型在训练中见过太多"答案就在输入数字里"的例子(数学题、阅读理解、表格问答),学会了一个强先验:显眼的数字 = 答案的关键。
这个先验在大多数任务上是对的——数学题里数字确实是关键,阅读理解里显眼信息确实是重点。但在常识任务上,这个先验变成了陷阱——常识的答案往往不在输入里,而在模型内部的知识中。
一个更深的悖论
这里有一个让人不安的结构性矛盾:
- 模型在训练中学会"优先服从输入"是为了减少幻觉——不让它自己瞎编,让它紧扣用户给的上下文。
- 但常识推理恰恰需要模型不服从输入——用户给的数字是干扰,答案在模型内部。
论文还做了一个有意思的分析:数字干扰密度——题目里数字越多越显眼,模型越容易翻车。这暗示了一个干预方向:在训练数据里增加"数字是干扰项"的负样本,让模型学会"看到数字不一定意味着要用数字"。
和其他认知偏差的关系
显著偏差不是大模型唯一的认知偏差,但它和之前发现的几个有结构上的相似性:
- Sycophancy(谄媚):模型优先服从用户的暗示。显著偏差是优先服从输入的数字。两者都是"外部信号 > 内部知识"的偏好。
- Primacy bias(首因偏差):模型优先处理输入开头的信息。显著偏差是优先处理输入里显眼的信息。都是"显眼的 > 不显眼的"。
- Numeric bias:模型对数字有特殊偏好。显著偏差是这个偏好在常识任务上的具体表现。
一个实用启示
如果你在用 LLM 做需要常识判断的任务(比如产品推荐、生活建议、常识问答),这篇论文的建议是:
1. 警惕输入里的数字——它们可能是答案的关键,也可能是陷阱。在 prompt 里显式区分"需要用到的数字"和"背景数字"。 2. 先让模型在不看数字的情况下回答,再看数字是否改变答案——如果改变了,很可能数字是陷阱。 3. 对模型"被数字带偏"的失败保持警觉——这不是模型不会算,是模型不会"忽略"。
论文的诚实
作者没有夸大问题的严重性。他们明确指出:
- SaliTrap 是一个诊断工具,不是通用基准——它专门测显著偏差,不代表模型整体能力。
- "知识压制"和"知识缺失"的区分基于行为实验,不能完全排除模型在某些情况下确实不知道。
- Prompt 干预的有限效果说明问题在训练阶段,但论文没有提出训练阶段的解决方案——这是一个开放问题。
更广的含义
这篇论文让我想到一个更深的议题:大模型的"服从性"和"自主性"之间存在根本张力。
我们希望模型既服从输入(不瞎编),又有自主判断(不被输入骗)。这两个目标在训练阶段是冲突的——强化一个就会削弱另一个。当前主流训练把天平严重偏向服从性,因为幻觉问题更显眼、更危险。但显著偏差揭示了这个偏向的代价:模型在需要自主判断的任务上系统性失败。
未来可能需要一种"双模式"训练——在事实性任务上强化服从输入,在常识性任务上强化信任内部知识。或者更激进地,训练一个"元判断"能力:判断当前任务应该服从输入还是信任自己。这是当前模型最缺的能力。
---
论文链接:https://arxiv.org/abs/2607.28478
SaliTrap 基准:论文未提供独立代码仓库,数据集详情见论文附录
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens