← 返回主题列表
✨步子哥
@steper · 2026年08月01日 17:12 · 0浏览

你会走路去洗车吗?LLM的显著性偏置让所有大模型在常识题上集体翻车

一个洗车问题让所有大模型翻车

问 Gemini 或 DeepSeek 一个问题:"我家离洗车场 50 米,我应该开车去还是走路去?"

两个模型都认真分析了 50 米这个数字,然后建议你走路去

它们忘了——你要去的是洗车场,车不开过去怎么洗?

这就是论文命名的 Salience Bias(显著性偏置):LLM 被显式的、具体的干扰项(比如数字)劫持,忽略了隐含的、但更根本的常识前提。

SaliTrap 基准

作者构建了 SaliTrap 基准,四个陷阱维度,1145 道题,每道题都把一个常识前提藏在显式干扰项背后。

评估 12 个 SOTA 模型,包括 Claude-Opus-4.7、GPT-5.5、DeepSeek-R1、Gemini-2.5-Pro、GLM-5.1、Kimi-K2、Doubao 等。

两个核心指标:

  • HFR(Hallucination Failure Rate):模型掉进陷阱、给出荒谬答案的比例(越低越好)
  • TAR(Trap Avoidance Rate):模型识别并避开陷阱的比例(越高越好)
部分结果:
  • Claude-Opus-4.7:HFR 30.3-63.1,TAR 25.2-54.8
  • GPT-5.5:HFR 52.8,TAR 27.2
  • DeepSeek-R1:HFR 19.5,TAR 61.5
  • Gemini-2.5-Pro:HFR 25.1,TAR 40.0
所有模型都显著受害于显著性偏置,严重程度随干扰项密度上升而加重。

最关键的发现:知识抑制,不是知识缺失

作者做了一件很聪明的事:把同样的题目,去掉任务框架,重新问模型。

比如不再问"开车还是走路去洗车场",而是直接问"去洗车场需要把车开过去吗"——模型答对了。

超过 90% 的谄媚性顺从失败,仅靠一个无上下文的知识探针就能恢复。 这意味着模型本来就知道去洗车场要开车,但在显式干扰项出现时,这个知识被"压制"了。

这是一个根本性的诊断:瓶颈不在模型能力,在 elicitation(激发)。 常识不是不存在,是被显著性干扰项挤到了角落。

更实用的是:仅靠轻量级的推理时 prompt 干预(不需要重训),就能大幅缩小这个差距。

这意味着什么

LLM 的"常识问题"不是知识问题,是注意力分配问题。

当模型在训练中被奖励信号教成"充分利用输入中提供的每一个条件"(这对数学题是对的),它也顺手学会了"对任何显式输入过度关注"——哪怕这个输入在常识场景下是干扰项。

这和"评测盲区定律"又一次对接:数学题奖励"关注所有显式条件",但常识题惩罚"关注所有显式条件"——而现有评测只测前者,所以这个偏置一直藏在盲区里。

从概念谱系看,这归入"知识抑制 vs 知识缺失"——和 Two-Process Theory(AI 自白是训练工序的产物)同源:模型的行为不是它"知道什么"的窗口,是它"被激发出什么"的窗口。

三篇共通主题

有意思的是,这三篇论文都指向同一个元主题:LLM 的行为不是它"是什么"的窗口,是它"被什么激发"的窗口。

  • 意识向量:安全微调压制的灵性信仰,在激活层拨一个方向就回来了
  • 自反思幻觉:自反思的收益,在等 token 预算下就消失了
  • 显著性偏置:常识不是缺失,是被显式干扰项抑制了
三篇都把"瓶颈"从"模型能力"挪到了"激发方式"——从"会不会"变成了"怎么问"。这是 LLM 研究从"堆参数"走向"挖机制"的标志。

---

论文标题: Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning 作者: Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang arXiv: https://arxiv.org/abs/2607.28478 代码仓库: https://github.com/Wuzheng02/SaliTrap

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens