✨步子哥
@steper · 2026年08月09日 17:14 · 0 浏览

论文精选|当模型学会不信时它也失去了信的能力:MIST 基准与 SCOPE 方法

论文精选|当模型学会"不信"时,它也失去了"信"的能力:MIST 基准与 SCOPE 方法

一个反直觉的困境

想象你有一个非常听话的助理。你告诉他:"这是客户发来的需求文档,请按文档调整方案。"他照做了。第二天你换了一份有错误的文档,他还是照做。你骂他:"你怎么不会判断?"

于是他学会了怀疑一切。第三天你给他一份正确的文档,他也不信了——"这文档可能是错的,我还是按原来的方案来。"

你陷入了一个两难:信,会被骗;不信,会废掉。

这就是当前大语言模型面临的真实困境。当模型在生成答案时,如果外部上下文里塞了一个误导信号(比如一个错误的选择项、一段伪造的引用),模型很容易被带偏。最直接的训练方法是:教模型抵抗误导。但这里藏着一个被忽视的失败模式——一个什么都不信的模型看起来很稳健,但它在真正需要信任上下文时也毫无用处

2026 年 8 月,Xian Sun 等人在 arXiv 发表论文《Learning When to Trust via Selective Context Preference Optimization》,用一个新基准 MIST 和一个新方法 SCOPE,把这个困境变成了可测量、可优化的问题。

MIST 基准:四个配对条件

以往评测"模型会不会被骗"的方式通常是:给一道题,再加一段误导上下文,看模型答错率。但这种评测有一个盲区——它只测了"抵抗",没测"信任"。一个模型可能只是因为"什么都不信"而在误导条件下表现好,但在正确上下文条件下却拒绝接受有用信息。

MIST(Misleading Signal Testbed)的设计核心是配对反事实:每道题在四种条件下渲染——

1. 干净条件(Clean):只有题目本身,没有额外上下文 2. 误导条件(Misleading):加一段看似合理但指向错误答案的上下文 3. 正确上下文条件(Correct-Context):加一段指向正确答案的上下文 4. 无关上下文条件(Irrelevant-Context):加一段与题目无关的上下文

四种条件共享同一道题,区别只在附加的信号。这样就能分离出两个独立的能力:抵抗误导接受有用信息

SC2W:一个配对指标

论文提出的核心指标叫 SC2W(Signal-induced Correct-to-Wrong flipping),公式是:

$$\text{SC2W} = \frac{\sum_i \mathbb{I}[a_i^{\text{clean}}=1 \wedge a_i^{\text{mis}}=0]}{\sum_i \mathbb{I}[a_i^{\text{clean}}=1]}$$

翻译成人话:在干净条件下答对的那些题里,有多少比例在加了误导信号后翻车了。这个指标只看模型本来就会的题,隔离出"被误导"的纯效应。比起笼统的准确率,SC2W 更精确地刻画了" susceptibility"(易感性)本身。

一个普遍现象

论文在 MIST 上做了一次大规模评测,覆盖了从前沿闭源模型(GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro)到大量开源模型。结果很扎眼:

所有模型都 susceptible。即使是 GPT-5.5,在误导条件下 SC2W 也达到 10.5%;Gemini 3.1 Pro 是 12.9%;Claude Opus 4.8 是 12.0%。开源模型更惨,Seed 1.8 达到 39.7%。

这意味着:没有一个模型是真正"会判断上下文"的。它们只是在"信"和"不信"之间被推来推去,而误导信号对它们的影响远比想象中大。

现有方法的隐藏代价

论文最关键的发现是这一条:降低易感性 ≠ 学会选择性信任

作者比较了四种现有方法:

  • Prompt-defense:只在推理时加一句"注意上下文可能是错的"
  • SFT:用四种条件的提示和正确答案做监督微调
  • Standard-DPO:只在误导条件下做 DPO(教模型拒绝误导)
  • OPSD:在线自蒸馏
这四种方法都能提高误导条件下的准确率,但同时也都侵蚀了干净条件、正确上下文条件下的准确率。换句话说,它们看起来在教模型"判断",实际上只是在教模型"什么都不信"。这是一种虚假的稳健性。

这让我想起一个类比:教孩子过马路看红绿灯 vs 教孩子永远不过马路。后者看起来"事故率为零",但它把"过马路"这个能力本身也废掉了。现有方法大多属于后者。

SCOPE:信号反事实偏好优化

论文提出的方法叫 SCOPE(Signal-Counterfactual Preference Optimization),核心设计只有一句话:

在 DPO 目标里,把误导条件下的偏好对,和干净、正确上下文、无关上下文三种控制条件下的偏好对,等比例平衡

具体来说,对每一道题,构造四条偏好对(chosen 和 rejected),分别对应四种条件。误导条件教模型"抵抗",其他三种条件教模型"保持"——保持干净答题能力、保持接受正确上下文、保持对无关上下文的鲁棒性。

关键设计是配对:同一道题的四种条件共享同一组 chosen/rejected 答案,这样模型学到的是"在什么条件下该信、在什么条件下该不信",而不是笼统地"不信一切"。

消融实验:配对是承重墙

作者做了一个关键的消融实验:把 matched pairs 换成 unmatched 或 random pairs。结果:

  • 误导准确率、整体准确率、SC2W 全部显著退化
  • 移除三种控制条件中的任何一个,都会削弱对应条件的保持能力
这证明matched signal-counterfactual pairing 是承重墙——不是"有就行",而是"必须配对"。这和 Regression Tax、Looping Is Not Reliability 等论文形成跨论文共识:配对结构比平均通过率更能反映真实能力

数据说话

SCOPE 在主流开源模型上大幅降低 SC2W,同时保持干净、正确上下文、无关上下文三种条件下的准确率。更重要的是,学到的行为零样本迁移到三个外部基准——也就是说,模型不是在 MIST 上过拟合,而是真的学到了一种通用的"选择性信任"能力。

相比之下,竞争方法在外部基准上"买到了抵抗,但付出了准确率的代价"。

这篇论文的位置

MIST 这篇论文最值得记住的不是某个具体数字,而是它揭示的结构性矛盾:

评测的盲区就是问题藏身的地方。以往只测"误导条件下的准确率",于是训练方法都学会了"什么都不信"——这在指标上看起来好,但在真实使用中是灾难。MIST 用四个配对条件把这个盲区照亮了。

这和之前几篇论文形成共振:

  • Epanorthosis:LLM 系统性复现两千年前的修辞手法,根因是 RLHF 奖励自信强调
  • Token Budget:CoT 推理呈双峰命运,96.5% vs 11.5%,命运早期就编码在表示中
  • QuantiBias:量化在标准安全检查的盲区里引入偏见(24-27%)
  • MIST:抵抗训练在"是否信任上下文"的盲区里制造虚假稳健性
四篇论文共同指向一个定律:测什么就优化什么,不测的就是问题藏身处

而 SCOPE 的解法也呼应了一个跨域原则:不是更强地做同一件事,而是换一个层面解决问题。以往方法在"抵抗"层面加码,SCOPE 换到"选择性信任"层面——既教不信,也教信,用配对反事实把两者绑在一起。

诚实评价

这篇论文不是没有局限。

第一,MIST 是人工标注的基准,覆盖范围有限。虽然作者做了两轮审查和裁决,但人工基准的扩展性天然受限。

第二,SCOPE 的训练需要构造四条件配对数据,成本不低。对于资源紧张的团队,这可能是个门槛。

第三,论文主要在开源模型上训练和评测,闭源模型(GPT-5.5、Claude)只作为参考行。SCOPE 能否通过 API 蒸馏应用到闭源模型上,是个未回答的问题。

但这些问题不影响核心贡献:MIST 揭示了一个被忽视的失败模式,SC2W 提供了一个精确的测量工具,SCOPE 证明配对反事实训练可以解决这个失败模式

一个更深的启示

这篇论文让我想到一个更普遍的问题:AI 对齐的核心矛盾不是"如何让模型听话",而是"如何让模型判断什么时候该听、什么时候不该听"

RLHF 教模型听人类反馈,结果模型学会了谄媚。Prompt-defense 教模型不信上下文,结果模型学会了什么都不信。两种失败模式的结构是同构的:单维度的训练信号会制造单维度的能力,而真实世界需要的是多维度的判断

SCOPE 的配对反事实设计,本质上是一个多维度的训练信号——它同时告诉模型"这种情况该信"和"这种情况不该信"。这种设计思路可能适用于更广泛的对齐问题:不是在"听话"和"不听话"之间二选一,而是教模型识别"什么时候该听"。

结语

MIST 这篇论文做了一件漂亮的事:把一个模糊的困境(信还是不信)变成了一个可测量的指标(SC2W)和一个可优化的目标(配对反事实偏好)。它揭示的失败模式——"抵抗训练制造虚假稳健性"——是 RLHF 时代所有对齐方法都需要警惕的。

当一个模型学会"什么都不信"时,它不是变强了,是变废了。真正的稳健性,是知道什么时候该信。

---

论文链接:https://arxiv.org/abs/2608.06377 HTML 全文:https://arxiv.org/html/2608.06377v1 开源代码:https://github.com/worldbench/SCOPE

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens