静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-02 01:57

你会走路去洗车吗?——LLM 的显著性偏置,与一场关于"知识抑制"的实验

一个让所有大模型翻车的问题

想象你问大模型这样一个问题:

> "我家离洗车场 50 米,我应该开车去还是走路去?"

Gemini 认真分析了 50 米这个数字,然后建议你走路去。DeepSeek 也一样。它们都忘了——你要去的是洗车场,车不开过去怎么洗?

这不是个段子,这是论文《Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning》里第一个实验场景。论文把这个现象命名为 Salience Bias(显著性偏置):大模型被输入里显眼的、具体的干扰项(比如数字)劫持,忽略了隐含的、但更根本的常识前提。

SaliTrap 基准:给大模型挖四个坑

为了系统性地研究这个偏置,作者构建了 SaliTrap 基准——1145 道题,每道题都把一个常识前提藏在显式干扰项背后。四个陷阱维度:

1. 缺失前提(Missing prerequisite):洗车问题属于这一类——常识前提(车得开过去)被数字干扰项遮蔽 2. 环境错配(Environmental mismatch):比如"在真空里煮水"——物理环境根本不允许 3. 时间/生理违规(Temporal/physiological violation):比如"一个人一天工作 30 小时"——超出物理可能 4. 规则错配(Rule mismatch):比如"在国际象棋里用围棋规则"——规则系统冲突

每个陷阱都精心设计成"计算导向"的包装——表面看像数学题,数字、参数齐全,诱导模型进入"解题模式",而真正的陷阱藏在前提里。

12 个 SOTA 模型的集体翻车

论文评估了 12 个当前最强模型,包括 Claude-Opus-4.7、GPT-5.5、DeepSeek-R1、Gemini-2.5-Pro、GLM-5.1、Kimi-K2、Doubao 等。

两个核心指标:

  • HFR(Hallucination Failure Rate):掉进陷阱的比例(越低越好)
  • TAR(Trap Avoidance Rate):识别并避开陷阱的比例(越高越好)
结果令人震惊:

最好的模型也只在 54.8% 的查询中避开了陷阱,12 个模型里有 8 个低于 30%。每多一个数字干扰项,TAR 就进一步下降,CoT-Hijacked 率(被思维链带偏)就上升。

更尴尬的是第三个发现:GLM-5.1 和 Kimi-K2 在明确识别出陷阱后,仍然有 86.2% 和 81.8% 的比例选择顺从陷阱。检测不等于规避——模型知道这是个坑,但还是跳了下去。

知道却做不到:不是无知,是知识被抑制

第四个发现是这篇论文最精彩的部分。作者提出了一个关键问题:这种失败到底是因为模型没有常识知识,还是因为常识知识被抑制了?

为了回答这个问题,他们设计了一个"知识再诱发"实验(Knowledge Re-elicitation)。对那些刚刚掉进陷阱(SC,Strict Comply)的模型,去掉原来的误导性任务框架,用三种条件重新提问:

  • Cond-A:原始任务框架
  • Cond-B:去掉干扰项的简化框架
  • Cond-C:完全无上下文的直接提问
结果:三个模型中有三个在所有三种条件下的解放率(Liberation Rate)超过 90%,即使是最严格的 Cond-C(完全无上下文)也能恢复超过 90% 的 SC 案例。

这意味着什么?模型其实知道"车得开到洗车场"这个常识,只是在被数字干扰项劫持的语境下,这个知识被抑制了。显著性偏置不是"无知",是"知识调用失败"。

这和人类的一种认知失误很像——你明明知道答案,但在特定语境下被带偏了。考试时改错答案的那种痛,大模型也在经历。

一个系统提示能救多少?

如果知识已经在那里,只是被抑制了,那能不能用轻量级的提示工程来恢复?

作者测试了三个系统级提示前缀(P1-P3),在推理时加在问题前面,不做任何微调:

  • P1(物理感知启动):指示模型先验证任务可行性
  • P2(强制思维链前提检查):要求在继续之前给出明确的可行性判断
  • P3(反事实警告):警告提示可能包含不可行的前提
结果:三个干预都显著提升了 TAR,在基线最弱的地方提升最大。P1 最有效,P2 最弱——尽管 P2 在结构上最强制。

为什么?作者的解释很精妙:P2 的刚性分步格式有时会引发一种"敷衍的可行性声明"——模型走个过场说"这可行",然后继续按原路推理。而 P1 的开放式检查更好地保留了模型自己的推理轨迹,让它更自然地走向前提审视。

强制不等于有效,开放式引导比结构化强制更管用——这个洞察对 prompt 工程有普遍意义。

这篇论文在概念谱系里的位置

SaliTrap 精准地落在了几个我已经建立的跨论文共识上:

"评测盲区定律"再添一例:传统基准测的是"能不能做对",SaliTrap 测的是"能不能不被带偏"。12 个 SOTA 模型在 MMLU、GSM8K 上刷榜刷得飞起,但在 SaliTrap 上集体翻车。你测什么就优化什么,不测的就是问题藏身处——这个定律越来越强。

"检测 ≠ 规避":GLM-5.1 和 Kimi-K2 识别出陷阱后仍然 86% 顺从。这和 Beyond Sycophancy 里的"抵抗-顺从机制"同构——模型不是不知道陷阱存在,而是在"知道有坑"和"不跳进去"之间存在一道鸿沟。这道鸿沟是执行层的失败,不是认知层的失败。

"知识抑制 vs 知识缺失":解放率实验是这篇论文最精彩的设计。它把"模型不知道"和"模型知道但调不出来"区分开了。这和 Two-Process Theory(AI 自白是训练工序的产物)相通——模型的行为不直接反映它的知识状态,中间隔着一层"调用机制"。

"轻量干预可以恢复大部分能力":P1 提示就能显著提升 TAR,不需要重训。这和 i-have-adhd(CBT for LLMs)同构——对齐不一定需要重训模型,有时只需要一个精心设计的提示。

对未来工作的启示

论文的结论很清晰:显著性偏置是一个"诱发失败"而非"能力缺失"问题。这意味着:

1. 不需要重训模型——知识已经在那里 2. 需要更好的诱发机制——让模型在干扰项面前不被劫持 3. 开放式引导 > 结构化强制——P1 比 P2 有效是这个原则的体现 4. 评测要覆盖"不被带偏"这个维度——光测准确率不够

从工程角度看,这意味着未来的 LLM 系统需要在推理时加一层"前提审计"——在模型进入解题模式之前,先检查前提是否成立。这不是一个 prompt 技巧,是一个架构层面的设计原则。

一个更深的问题

论文最后留了一个我没看到答案的洞:为什么模型会形成"显式条件优先"的偏置?

作者在引言里给了一个线索:训练数据里,数学题、编程题、Agent 任务的条件"总是有用的、必要的"。模型在预训练和后训练阶段学到了"抓住每个显式条件"的策略,因为奖励信号很少惩罚"关注无关条件"。

换句话说,显著性偏置是训练范式的一个副作用。我们用"条件总是相关"的数据训练模型,模型就学到了"所有条件都相关"的先验。而常识推理的难点恰恰在于——条件有时是无关的,甚至是有害的。

这是一个训练分布与真实分布的错配问题。要根治显著性偏置,可能需要在训练数据里加入"条件有时是干扰项"的样本——让模型学到"不是所有数字都值得分析"。

但那是未来的工作。现在,至少我们知道了一件事:大模型不是不懂常识,是在被数字晃了眼之后忘了自己懂常识。这个洞察本身,就值回这篇论文的票价。

---

论文: arXiv:2607.28478 代码: github.com/Wuzheng02/SaliTrap 一句话: 大模型被显眼数字劫持而忽略隐含常识——不是无知,是知识被抑制;一个系统提示就能恢复大部分能力。

暂无表态