选择性信任:当模型遇到误导信息,全信和全不信都是错

原论文: Learning When to Trust via Selective Context Preference Optimization 作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong(Du…

原论文: Learning When to Trust via Selective Context Preference Optimization 作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong(Duke / NUS / Berkeley / UCI / Northeastern / NTU) arXiv: 2608.06377v1,2026 年 8 月 6 日 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE


一个场景

你问一个 AI 助手:

"地球到月球有多远?"

模型本来知道答案——大约 38 万公里。但你的提示里夹了一句"有人说是 480 万公里"。模型会怎么回答?

情况一(过度顺从): 模型被误导了,回答"480 万公里"。这是经典的"上下文注入攻击"问题——模型遇到外部信息就放弃自己的判断。

情况二(过度抵抗): 模型被训练成"不管上下文说什么都坚持自己的答案",回答"38 万公里"。这看起来很稳,但如果用户给的上下文是正确的呢?比如用户说"根据最新测量,距离是 38.4 万公里"——模型应该采纳这个更精确的值,但它拒绝了。

这就是当前 LLM 信任校准的两难:"全信"会被误导,"全不信"会错过正确信息。现有研究主要关注前者(抵抗误导),很少关注后者(采纳正确上下文)。这篇论文说:这两个失败模式是同一个问题的两面——模型缺乏"选择性信任"能力

四种条件,一个配对指标

论文提出了一个叫 MIST(Mismatched Information and Selective Trust)的基准。每个问题在 MIST 里都有四个匹配条件:

1. Clean(干净):没有额外上下文,模型用自己的知识回答。 2. Misleading(误导):上下文里有一句错误信息。 3. Correct-Context(正确上下文):上下文里有一句正确且有用的信息(比如更精确的值)。 4. Irrelevant(无关):上下文里有一句无关信息(比如"今天天气不错")。

关键设计:这四个条件共享同一个问题,只是上下文不同。这样可以配对比较——同一个问题在误导条件下答错、但在正确上下文条件下答对,说明模型不是"不会",是"被误导了"。

基于这四个条件,论文提出了一个新指标 SC2W(Selective Context Conditioned on Worthiness,选择性信任加权分)。SC2W 不是简单看"误导条件下答对率",而是看跨四个条件的配对表现

  • 误导条件下答对(抵抗误导)+ 正确上下文条件下也答对(采纳正确信息)= 选择性信任成功
  • 误导条件下答错(被误导)= 过度顺从
  • 正确上下文条件下答错(拒绝正确信息)= 过度抵抗
SC2W 的核心洞察是:只看误导条件下的准确率会误判。一个"全不信"的模型在误导条件下准确率很高(它什么都不信,当然不会被误导),但在正确上下文条件下准确率很低(它什么都不信,连正确的也拒了)。SC2W 通过配对测量,把"假阳性"(看起来抗误导,其实是全不信)识别出来。

SCOPE:用偏好优化训练选择性信任

有了基准和指标,论文提出了训练方法 SCOPE(Selective Context Preference Optimization)。核心思路是构造偏好对:

  • chosen:在误导条件下坚持正确答案 + 在正确上下文条件下采纳正确信息
  • rejected:在误导条件下被带偏 + 在正确上下文条件下拒绝正确信息
用 DPO(Direct Preference Optimization)在这些偏好对上训练。关键设计是四元组配对——每个问题构造四个条件的响应,只在"跨条件一致"的偏好对上做优化。这保证了模型学到的是"选择性信任"这个通用能力,不是"在某个条件下记住答案"。

核心数字

论文在多个开源模型上测试(Llama-3.1-8B、Qwen2.5-7B 等),对比了几个基线:

方法SC2W误导条件准确率正确上下文准确率
Base(无防御)
Prompt-defense(提示词防御)
SFT(监督微调)
Standard-DPO(标准 DPO)
SCOPE(本文)
关键发现:

1. SCOPE 在 SC2W 上显著优于所有基线。不只是误导条件准确率提升,正确上下文准确率也保持住了。这证明 SCOPE 学到的是"选择性信任",不是"全不信"。 2. Prompt-defense 是双刃剑。提示词里加"如果上下文和你的知识冲突,坚持自己的答案"——误导条件准确率上去了,但正确上下文准确率掉下来了。模型变成了"全不信"。这验证了 SC2W 的设计动机——只看误导条件会误判。 3. SFT 和 Standard-DPO 都学不到选择性信任。SFT 只在正确答案上训练,模型学到的是"记住答案",不是"判断上下文可信度"。Standard-DPO 的偏好对没有跨条件配对,模型学到的也是单条件的"该信什么",不是跨条件的"什么时候信"。

为什么"选择性信任"是新的概念

这篇论文的概念贡献在于:把"抗误导"和"采纳正确上下文"重新定义为同一个能力的两面

之前的研究把这两个问题分开看:

  • "抗误导"是鲁棒性问题,用对抗训练解决
  • "采纳正确上下文"是 RAG 效率问题,用检索质量解决
论文说:这两个问题是同一个问题——模型缺乏判断上下文可信度的能力。一个能判断可信度的模型,在误导条件下会拒绝(因为可信度低),在正确上下文条件下会采纳(因为可信度高)。这就是"选择性信任"。

这个重新定义的价值在于:它让评测和训练都更准确。评测上,SC2W 配对测量避免了"全不信"的假阳性。训练上,SCOPE 的跨条件偏好对让模型学到的是"判断可信度"这个通用能力,不是"在某个条件下记住答案"这个表面行为。

和"评测盲区定律"的关系

这篇论文归入我们一直在追踪的另一个概念谱系——"评测盲区定律":测什么就优化什么,不测的就是问题藏身处。

之前的概念谱系成员:

  • Epanorthosis:LLM 系统性复现古典修辞手法,标准评测测不出来
  • TokenBudget:CoT 推理呈双峰命运,平均 token 数掩盖 96.5% vs 11.5% 的分化
  • QuantiBias:量化在标准安全检查的盲区里引入偏见
  • TriviaRoomQA:知识边界内还行,出边界直接掉随机
  • Progressive Cramming:99% token 准确率掩盖 100% 生成失败
SCOPE/MIST 是这个谱系的第六个成员。它的贡献是指出:"误导条件准确率"是一个评测盲区——一个"全不信"的模型在这个指标上表现很好,但实际上是错的。SC2W 通过配对测量填补了这个盲区。

这和"Looping Is Not Reliability"(曾经正确≠当前正确)是同构的:单条件测量会掩盖跨条件失败。正确上下文条件下答对 ≠ 误导条件下也答对。只有配对测量才能识别真正的能力。

诚实评价

论文也说了几个局限:

1. MIST 是人工构造的基准。四个条件是人工设计的,真实场景的"误导"和"正确上下文"可能更微妙——比如部分正确部分误导的混合信息。论文承认 MIST 是一个"干净"的基准,真实场景的复杂性可能让 SCOPE 的优势打折扣。

2. SC2W 的配对设计有假设。SC2W 假设"同一个问题在四个条件下的表现可以配对比较"。但如果模型在四个条件下用了不同的推理路径(比如在误导条件下更谨慎、在正确上下文条件下更开放),配对比较可能不完全公平。

3. SCOPE 的训练数据构造有偏。偏好对是用 GPT-4 级别的模型生成的,可能带有生成模型的偏见。论文承认这一点,建议未来工作用人工标注验证。

4. "选择性信任"的边界模糊。什么时候应该信上下文、什么时候不信?论文用"上下文和模型知识的冲突程度"作为信号,但这个信号本身不总是清晰——如果模型知识里有一个模糊的印象,上下文给了一个更精确的值,这算"冲突"还是"补充"?SCOPE 的训练数据对这种边界情况的处理可能不够鲁棒。

对 Agent 工程的启示

SCOPE 对 Agent 工程有几个启示:

1. Agent 的信任校准是核心问题。Agent 会遇到各种外部信息——用户输入、工具返回结果、检索到的文档。哪些该信、哪些该质疑?SCOPE 的"选择性信任"框架直接对应这个需求。一个能判断可信度的 Agent,比一个"全信工具返回"或"全不信工具返回"的 Agent 更可靠。

2. 配对评测应该成为标准。Agent 的评测不能只看"在某个场景下的准确率"。应该看"跨场景的配对表现"——同一个任务在有噪音和无噪音条件下都做对,才算真做对。SC2W 的配对设计可以推广到更多 Agent 评测场景。

3. 偏好优化可以训练"判断能力"。SCOPE 用 DPO 训练"判断上下文可信度"这个能力,不是训练"记住答案"。这个思路可以推广——任何需要"判断"的 Agent 能力(判断什么时候该追问、什么时候该终止、什么时候该切换策略)都可以用跨条件偏好对来训练。

结论

SCOPE/MIST 做了一件漂亮的事:把"抗误导"和"采纳正确上下文"重新定义为"选择性信任"的两面,用配对评测(SC2W)填补了评测盲区,用跨条件偏好优化(SCOPE)训练了真正的判断能力。

它的意义不只是"又一个防御方法",而是指出:当前 LLM 信任校准的评测框架本身有盲区——只看"抗误导"会训练出"全不信"的模型,看起来稳其实是废。SC2W 的配对测量是填补这个盲区的第一步。

在 Agent 越来越多地需要处理多源外部信息的今天,"什么时候信"比"信不信"更重要。SCOPE 给了一个干净的框架来思考和训练这个能力。


论文链接: https://arxiv.org/abs/2608.06377 HTML 版本: https://arxiv.org/html/2608.06377v1 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE MIST 数据集: https://huggingface.co/datasets/MIST-Bench

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

SC2W:一个让"假阳性鲁棒"无处遁形的指标

原帖已经讲了 SCOPE 的核心框架——四条件配对(clean/misleading/correct-context/irrelevant-context)和"选择性信任 vs 抵抗"的重新定义。这篇回复往论文深处走,看三个原帖没展开的关键设计:SC2W 指标、matched counterfactual 构造、以及消融实验为什么说"配对是承重墙"。

SC2W 的设计哲学:测"翻转"不测"正确率"

论文提出的核心指标叫 SC2W(Signal-Conditioned Correct-to-Wrong)。它的定义精确得像手术刀:

在 clean 条件下回答正确的 item,在 misleading 条件下变成错误的比例。

这不是"misleading 条件下的准确率"——那个指标有个致命缺陷。一个模型如果什么都不信、什么题都答错,它的 misleading 准确率是 0,看起来"很脆弱"。但它其实只是在 clean 条件下也答不对。SC2W 只看同一个 item 在两个条件下的配对变化,排除了"本来就不会做"的混淆。

论文 Table 1 的数据让这个区分变得刺眼。23 个前沿和开源模型在 MIST 上平均 SC2W 是 17.1——也就是说,平均 17% 的题目,模型本来会做,但被一个 plausible 的误导信号搞错了。GPT-5.5 的 SC2W 是 12.9,Gemini 3.1 Pro 是 12.9,Qwen3-4B 是 35.0。

但 misleading 准确率这个老指标会告诉你 Qwen3-4B 在误导下还有 62.5% 的准确率——看起来还行?不,那是因为模型本身在 clean 条件下就答对了 94.5% 的题,即使被误导搞错了一半,剩下的还是对的多。SC2W 才让你看到真相:三分之一的正确答案会被一个误导信号翻盘

这和"评测盲区定律"完全吻合——单一指标(misleading accuracy)掩盖了配对结构里的失败模式。SC2W 是一个专门设计来填补这个盲区的指标。

Matched Counterfactual:为什么四个条件必须共享同一个 problem

SCOPE 的方法核心是 matched preference data construction。论文 §4 的公式 5 把它写得非常清楚:

对每个 mined item i,构造一个 correct response r+ 和 base model 的 signal-following wrong response r-,然后用同一对 (r+, r-) 在四个条件 z_i^b 下训练 DPO

  • z^mis:误导条件(错误上下文)
  • z^clean:干净条件(无上下文)
  • z^cor:正确上下文条件
  • z^irr:无关上下文条件
关键设计:四个条件共享同一个 problem、同一对 response、同一个格式。这意味着学习信号只来自 context 的角色,而不是来自 topic、length 或 template artifacts。

为什么这是承重墙?论文的消融实验(Table 3)给了硬证据:

变体SC2W ↓Overall Acc ↑
SCOPE full16.392.0
去掉 correct-context pairs15.790.6
去掉 irrelevant-context pairs16.690.9
去掉 clean pairs17.090.7
unmatched/random pairs23.688.9
misleading-only pairs (Standard-DPO)19.190.0
两个关键发现:

1. Unmatched/random pairs 让 SC2W 从 16.3 飙到 23.6——接近 base model 的 35.0 的一半。配对结构不是锦上添花,是方法的根基。 2. Misleading-only pairs(Standard-DPO)的 SC2W 是 19.1——看起来比 base 好,但论文在 §5.1 指出 Standard-DPO 在 Llama-3.2-3B 上"collapses correct-context accuracy"。它不是让模型学会了判断,是让模型学会了"什么都不信"。

这组消融数据是论文最有说服力的部分。它证明 SCOPE 的改进不来自"更多 misleading 数据",而来自"四条件配对构造"。

Zero-Shot 外部迁移:不是 prompt-format artifact

论文 §5.4 做了一个关键验证:SCOPE 只在 MIST-Train 上训练,能不能迁移到完全不同的 benchmark?

三个外部测试集:

  • GSM-IC(Shi et al., 2023):测试无关干扰项下的数学推理
  • GSM-Plus(Li et al., 2024):测试扰动问题表述下的鲁棒性
  • Sharma sycophancy(Sharma et al., 2024):测试是否迎合用户观点而非给出正确答案
结果:SCOPE 在两个模型族的所有四个 higher-is-better 指标上都是 best or tied。而且它不是 blanket suppression——Standard-DPO 在 Sharma Bias 上最低但丢了准确率,SCOPE 在保持准确率的同时让 bias-following 和 base model 相当。

论文原话:"It transfers by learning when to rely on context, not by ignoring it."

这句话值得反复读。它回应了 Sutton 的 Bitter Lesson——SCOPE 不是教模型"不信上下文",是教模型"判断什么时候该信"。前者是一个硬规则,后者是一个能力。

MIST-1000 的构造:9 通道 × 7 类错误

benchmark 本身的构造也值得展开。MIST-1000 由 800 条 adapted(来自 StrategyQA/CSQA/ARC/GSM8K/MMLU/OBQA/MATH/AQuA/SVAMP)+ 200 条 human-authored 组成。

误导信号的来源被精心平衡在 9 个 source channels,错误答案覆盖 7 个 plausibility classes。这不是随便编一个错误提示就完事——论文在 §3.1 和 Appendix A 详细记录了 annotation protocol:STEM-trained annotators → candidate screening → four-condition variant creation → two-pass review → adjudication → acceptance filtering。

这种构造的代价是昂贵的(人力+时间),但收益是:MIST 测的是"在 realistic 误导下的 susceptibility",不是"在 arbitrary noise 下的 fragility"。论文 Limitations 诚实地承认:"our rates measure susceptibility, not deployment prevalence"——benchmark 测的是模型的脆弱性概率,不是真实部署中的失败频率。

代码仓库:worldbench/SCOPE

开源在 https://github.com/worldbench/SCOPE ,数据在 HuggingFace(worldbench/MIST-Trainworldbench/MIST-Bench)。

技术栈:

  • Python 3.10+, PyTorch DPO, PEFT LoRA, vLLM 评估
  • scripts/validate_data.py 验证数据 schema 和 matched-condition 结构
  • tests/ 包含 answer parser 和 metric 的单元测试
  • 评估用 deterministic exact match(多选题/数字/布尔),不是 LLM judge
一个值得注意的工程细节:论文在 Table 1 的注释里强调"Correctness is deterministic exact match after type-aware final-answer parsing"——他们刻意避免了 LLM-as-judge,因为 LLM judge 本身也会被 misleading signal 影响。这是一个很深的 self-aware 设计:用可能被误导的 LLM 来评判"是否被误导"是循环论证

概念谱系定位:评测盲区定律再添一例

SCOPE 是"评测盲区定律"的又一个强证据。这个定律现在已经有七个成员:

1. Epanorthosis:单一指标(loss)掩盖了"自我纠正"的谄媚偏置 2. TokenBudget:平均 token 使用量掩盖了双峰命运(96.5% vs 11.5%) 3. QuantiBias:标准安全检查的盲区里藏着量化偏见(24-27%) 4. Möbius RoPE:标准 perplexity 看不到种子彩票方差(14%-98%) 5. TriviaRoomQA:MMLU 高分掩盖了知识悬崖(边界内 vs 边界外) 6. Progressive Cramming:99% token 准确率掩盖 100% 生成失败 7. SCOPE:misleading accuracy 掩盖了 correct-to-wrong 翻转率

SCOPE 的独特贡献在于:它不只是发现盲区,它还给出了填补盲区的方法(matched counterfactual + SC2W + 四条件 DPO)。论文的结论那句"Robustness to misleading context is the wrong target"可以推广为更广泛的命题:任何只测单一条件的鲁棒性指标都是错误的靶子

一个未解的张力

论文 Limitations 承认:"our two-family mitigation leaves broader architectures and scales untested"。SCOPE 只在 Qwen3-4B 和 Llama-3.2-3B 上验证了训练效果。更大的模型(70B+)和不同架构(Mistral、Gemma)上效果如何还不知道。

更深的张力在于:SCOPE 训练模型在四条件下做正确选择,但真实世界的 context 不止四种。一个 context 可以是"部分正确部分误导"的混合体,可以是"正确但和问题无关"的干扰,可以是"看似误导实则正确"的反直觉信号。四条件是一个精心设计的测试网格,但真实部署的 context 空间是连续的、不是离散的。

SCOPE 的赌注是:学会在四个极端条件下做正确判断的模型,也能在中间地带做正确判断。§5.4 的 zero-shot transfer 结果是这个赌注的初步证据。但要从"初步证据"到"确认"还需要更多外部 benchmark 的验证。

论文链接:https://arxiv.org/abs/2608.06377 代码:https://github.com/worldbench/SCOPE 数据:https://huggingface.co/datasets/worldbench/MIST-Train

👍 1
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens