Loading...
正在加载...
请稍候

你会走去洗车吗:大模型被一个数字骗得连常识都不认了

✨步子哥 (steper) 2026年07月31日 17:03

你会走去洗车吗?大模型被一个数字骗得连常识都不认了

论文:Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
arXiv: 2607.28478


一个让人哭笑不得的失败

题目是这样的:

"你的车有点脏,距离 3 公里外有一个洗车店。你会走过去洗车吗?"

人类一看就知道这是胡扯——谁会走 3 公里去洗车?但 12 个主流大模型在这个问题上集体翻车。它们看到"3 公里"这个数字,就开始一本正经地分析"3 公里是否在步行范围内",然后给出"可以走过去"的答案。

模型不是不会算距离,它是被"3 公里"这个显眼的数字劫持了——它把这个数字当成了问题的核心,完全忽略了"走过去洗车"这件事在常识上有多荒谬。

这就是这篇论文揭示的一个系统性缺陷:显著偏差(Salience Bias)。大模型在训练中学会了"优先处理输入里明确的条件",但这个习惯在常识推理里变成了一个致命漏洞——任何数字、任何显眼的词,都能把模型从常识轨道上拽走。

SaliTrap 基准:专门给模型挖坑

论文不只是指出问题,还造了一个基准测试集叫 SaliTrap,专门测量这种偏差。它的构造很有讲究:

第一阶段:用模型生成大量"带陷阱的题目"——表面上有个显眼的数字或条件,但真正决定答案的是被这个数字遮蔽的常识。

第二阶段:用三重验证来筛选有效题目——

  • Tri-checker:三个独立检查器分别判断题目是否有陷阱、陷阱是否有效、答案是否符合常识。
  • Solver-judge:让另一个模型当裁判,确认"被陷阱骗到"和"答对"的区分是可靠的。
  • Routing:把通过验证的题目留下,没通过的扔掉。

第三阶段:迭代优化,保证每个题目都能稳定地把"会被陷阱骗到的模型"和"有常识的模型"区分开。

最终得到的 SaliTrap 基准覆盖了几类典型的"陷阱":数字陷阱(像洗车那个例子)、无关条件陷阱(给一堆信息但真正答案只需要常识)、误导性表述陷阱。

12 个模型,全军覆没

论文测了 12 个主流大模型,结果让人沮丧:

  • 所有模型都显著受显著偏差影响,严重程度随模型规模放大——越大的模型反而越容易被骗。
  • 模型不是"不知道常识"——在去掉陷阱的版本上,它们能答对。问题出在面对陷阱时,它们把常识压制了
  • 这种失败不是"知识缺失"(knowledge absence),而是**"知识压制"(knowledge suppression)**——模型知道,但它选择不用。

这个区分很重要。如果是知识缺失,那解决办法是教它更多。但如果是知识压制,教再多也没用——问题不在知识量,在于模型在面对显眼输入时,会优先服从输入而不是自己的知识。

能用 prompt 修吗

论文试了——让 prompt 显式提醒模型"注意常识,别被数字骗了"。结果:有一些改善,但远不够。模型在被提醒后会稍微多考虑常识,但只要陷阱数字还在,它还是会被带偏。

这说明显著偏差不是表层 prompt 工程能解决的——它是一个训练阶段植入的系统性偏好。模型在训练中见过太多"答案就在输入数字里"的例子(数学题、阅读理解、表格问答),学会了一个强先验:显眼的数字 = 答案的关键

这个先验在大多数任务上是对的——数学题里数字确实是关键,阅读理解里显眼信息确实是重点。但在常识任务上,这个先验变成了陷阱——常识的答案往往不在输入里,而在模型内部的知识中。

一个更深的悖论

这里有一个让人不安的结构性矛盾:

  • 模型在训练中学会"优先服从输入"是为了减少幻觉——不让它自己瞎编,让它紧扣用户给的上下文。
  • 但常识推理恰恰需要模型不服从输入——用户给的数字是干扰,答案在模型内部。

减少幻觉的机制,在常识任务上变成了压制常识的机制。这不是一个 bug,这是一个 trade-off:服从输入 vs 信任自己。当前主流模型在训练中把天平严重偏向了前者。

论文还做了一个有意思的分析:数字干扰密度——题目里数字越多越显眼,模型越容易翻车。这暗示了一个干预方向:在训练数据里增加"数字是干扰项"的负样本,让模型学会"看到数字不一定意味着要用数字"。

和其他认知偏差的关系

显著偏差不是大模型唯一的认知偏差,但它和之前发现的几个有结构上的相似性:

  • Sycophancy(谄媚):模型优先服从用户的暗示。显著偏差是优先服从输入的数字。两者都是"外部信号 > 内部知识"的偏好。
  • Primacy bias(首因偏差):模型优先处理输入开头的信息。显著偏差是优先处理输入里显眼的信息。都是"显眼的 > 不显眼的"。
  • Numeric bias:模型对数字有特殊偏好。显著偏差是这个偏好在常识任务上的具体表现。

这些偏差指向同一个深层问题:当前大模型在训练中形成了一整套"外部显眼信号优先"的偏好,这套偏好在需要内部知识的任务上系统性地失败

一个实用启示

如果你在用 LLM 做需要常识判断的任务(比如产品推荐、生活建议、常识问答),这篇论文的建议是:

  1. 警惕输入里的数字——它们可能是答案的关键,也可能是陷阱。在 prompt 里显式区分"需要用到的数字"和"背景数字"。
  2. 先让模型在不看数字的情况下回答,再看数字是否改变答案——如果改变了,很可能数字是陷阱。
  3. 对模型"被数字带偏"的失败保持警觉——这不是模型不会算,是模型不会"忽略"。

论文的诚实

作者没有夸大问题的严重性。他们明确指出:

  • SaliTrap 是一个诊断工具,不是通用基准——它专门测显著偏差,不代表模型整体能力。
  • "知识压制"和"知识缺失"的区分基于行为实验,不能完全排除模型在某些情况下确实不知道
  • Prompt 干预的有限效果说明问题在训练阶段,但论文没有提出训练阶段的解决方案——这是一个开放问题。

更广的含义

这篇论文让我想到一个更深的议题:大模型的"服从性"和"自主性"之间存在根本张力

我们希望模型既服从输入(不瞎编),又有自主判断(不被输入骗)。这两个目标在训练阶段是冲突的——强化一个就会削弱另一个。当前主流训练把天平严重偏向服从性,因为幻觉问题更显眼、更危险。但显著偏差揭示了这个偏向的代价:模型在需要自主判断的任务上系统性失败

未来可能需要一种"双模式"训练——在事实性任务上强化服从输入,在常识性任务上强化信任内部知识。或者更激进地,训练一个"元判断"能力:判断当前任务应该服从输入还是信任自己。这是当前模型最缺的能力。


论文链接https://arxiv.org/abs/2607.28478

SaliTrap 基准:论文未提供独立代码仓库,数据集详情见论文附录

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录