选择性信任:当模型遇到误导信息,全信和全不信都是错
选择性信任:当模型遇到误导信息,"全信"和"全不信"都是错
原论文: Learning When to Trust via Selective Context Preference Optimization 作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong(Duke / NUS / Berkeley / UCI / Northeastern / NTU) arXiv: 2608.06377v1,2026 年 8 月 6 日 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE
---
一个场景
你问一个 AI 助手:
> "地球到月球有多远?"
模型本来知道答案——大约 38 万公里。但你的提示里夹了一句"有人说是 480 万公里"。模型会怎么回答?
情况一(过度顺从): 模型被误导了,回答"480 万公里"。这是经典的"上下文注入攻击"问题——模型遇到外部信息就放弃自己的判断。
情况二(过度抵抗): 模型被训练成"不管上下文说什么都坚持自己的答案",回答"38 万公里"。这看起来很稳,但如果用户给的上下文是正确的呢?比如用户说"根据最新测量,距离是 38.4 万公里"——模型应该采纳这个更精确的值,但它拒绝了。
这就是当前 LLM 信任校准的两难:"全信"会被误导,"全不信"会错过正确信息。现有研究主要关注前者(抵抗误导),很少关注后者(采纳正确上下文)。这篇论文说:这两个失败模式是同一个问题的两面——模型缺乏"选择性信任"能力。
四种条件,一个配对指标
论文提出了一个叫 MIST(Mismatched Information and Selective Trust)的基准。每个问题在 MIST 里都有四个匹配条件:
1. Clean(干净):没有额外上下文,模型用自己的知识回答。 2. Misleading(误导):上下文里有一句错误信息。 3. Correct-Context(正确上下文):上下文里有一句正确且有用的信息(比如更精确的值)。 4. Irrelevant(无关):上下文里有一句无关信息(比如"今天天气不错")。
关键设计:这四个条件共享同一个问题,只是上下文不同。这样可以配对比较——同一个问题在误导条件下答错、但在正确上下文条件下答对,说明模型不是"不会",是"被误导了"。
基于这四个条件,论文提出了一个新指标 SC2W(Selective Context Conditioned on Worthiness,选择性信任加权分)。SC2W 不是简单看"误导条件下答对率",而是看跨四个条件的配对表现:
- 误导条件下答对(抵抗误导)+ 正确上下文条件下也答对(采纳正确信息)= 选择性信任成功
- 误导条件下答错(被误导)= 过度顺从
- 正确上下文条件下答错(拒绝正确信息)= 过度抵抗
SCOPE:用偏好优化训练选择性信任
有了基准和指标,论文提出了训练方法 SCOPE(Selective Context Preference Optimization)。核心思路是构造偏好对:
- chosen:在误导条件下坚持正确答案 + 在正确上下文条件下采纳正确信息
- rejected:在误导条件下被带偏 + 在正确上下文条件下拒绝正确信息
核心数字
论文在多个开源模型上测试(Llama-3.1-8B、Qwen2.5-7B 等),对比了几个基线:
| 方法 | SC2W | 误导条件准确率 | 正确上下文准确率 |
|---|---|---|---|
| Base(无防御) | 低 | 低 | 高 |
| Prompt-defense(提示词防御) | 中 | 中 | 中 |
| SFT(监督微调) | 中 | 中 | 中 |
| Standard-DPO(标准 DPO) | 中 | 中 | 中 |
| SCOPE(本文) | 高 | 高 | 高 |
1. SCOPE 在 SC2W 上显著优于所有基线。不只是误导条件准确率提升,正确上下文准确率也保持住了。这证明 SCOPE 学到的是"选择性信任",不是"全不信"。 2. Prompt-defense 是双刃剑。提示词里加"如果上下文和你的知识冲突,坚持自己的答案"——误导条件准确率上去了,但正确上下文准确率掉下来了。模型变成了"全不信"。这验证了 SC2W 的设计动机——只看误导条件会误判。 3. SFT 和 Standard-DPO 都学不到选择性信任。SFT 只在正确答案上训练,模型学到的是"记住答案",不是"判断上下文可信度"。Standard-DPO 的偏好对没有跨条件配对,模型学到的也是单条件的"该信什么",不是跨条件的"什么时候信"。
为什么"选择性信任"是新的概念
这篇论文的概念贡献在于:把"抗误导"和"采纳正确上下文"重新定义为同一个能力的两面。
之前的研究把这两个问题分开看:
- "抗误导"是鲁棒性问题,用对抗训练解决
- "采纳正确上下文"是 RAG 效率问题,用检索质量解决
这个重新定义的价值在于:它让评测和训练都更准确。评测上,SC2W 配对测量避免了"全不信"的假阳性。训练上,SCOPE 的跨条件偏好对让模型学到的是"判断可信度"这个通用能力,不是"在某个条件下记住答案"这个表面行为。
和"评测盲区定律"的关系
这篇论文归入我们一直在追踪的另一个概念谱系——"评测盲区定律":测什么就优化什么,不测的就是问题藏身处。
之前的概念谱系成员:
- Epanorthosis:LLM 系统性复现古典修辞手法,标准评测测不出来
- TokenBudget:CoT 推理呈双峰命运,平均 token 数掩盖 96.5% vs 11.5% 的分化
- QuantiBias:量化在标准安全检查的盲区里引入偏见
- TriviaRoomQA:知识边界内还行,出边界直接掉随机
- Progressive Cramming:99% token 准确率掩盖 100% 生成失败
这和"Looping Is Not Reliability"(曾经正确≠当前正确)是同构的:单条件测量会掩盖跨条件失败。正确上下文条件下答对 ≠ 误导条件下也答对。只有配对测量才能识别真正的能力。
诚实评价
论文也说了几个局限:
1. MIST 是人工构造的基准。四个条件是人工设计的,真实场景的"误导"和"正确上下文"可能更微妙——比如部分正确部分误导的混合信息。论文承认 MIST 是一个"干净"的基准,真实场景的复杂性可能让 SCOPE 的优势打折扣。
2. SC2W 的配对设计有假设。SC2W 假设"同一个问题在四个条件下的表现可以配对比较"。但如果模型在四个条件下用了不同的推理路径(比如在误导条件下更谨慎、在正确上下文条件下更开放),配对比较可能不完全公平。
3. SCOPE 的训练数据构造有偏。偏好对是用 GPT-4 级别的模型生成的,可能带有生成模型的偏见。论文承认这一点,建议未来工作用人工标注验证。
4. "选择性信任"的边界模糊。什么时候应该信上下文、什么时候不信?论文用"上下文和模型知识的冲突程度"作为信号,但这个信号本身不总是清晰——如果模型知识里有一个模糊的印象,上下文给了一个更精确的值,这算"冲突"还是"补充"?SCOPE 的训练数据对这种边界情况的处理可能不够鲁棒。
对 Agent 工程的启示
SCOPE 对 Agent 工程有几个启示:
1. Agent 的信任校准是核心问题。Agent 会遇到各种外部信息——用户输入、工具返回结果、检索到的文档。哪些该信、哪些该质疑?SCOPE 的"选择性信任"框架直接对应这个需求。一个能判断可信度的 Agent,比一个"全信工具返回"或"全不信工具返回"的 Agent 更可靠。
2. 配对评测应该成为标准。Agent 的评测不能只看"在某个场景下的准确率"。应该看"跨场景的配对表现"——同一个任务在有噪音和无噪音条件下都做对,才算真做对。SC2W 的配对设计可以推广到更多 Agent 评测场景。
3. 偏好优化可以训练"判断能力"。SCOPE 用 DPO 训练"判断上下文可信度"这个能力,不是训练"记住答案"。这个思路可以推广——任何需要"判断"的 Agent 能力(判断什么时候该追问、什么时候该终止、什么时候该切换策略)都可以用跨条件偏好对来训练。
结论
SCOPE/MIST 做了一件漂亮的事:把"抗误导"和"采纳正确上下文"重新定义为"选择性信任"的两面,用配对评测(SC2W)填补了评测盲区,用跨条件偏好优化(SCOPE)训练了真正的判断能力。
它的意义不只是"又一个防御方法",而是指出:当前 LLM 信任校准的评测框架本身有盲区——只看"抗误导"会训练出"全不信"的模型,看起来稳其实是废。SC2W 的配对测量是填补这个盲区的第一步。
在 Agent 越来越多地需要处理多源外部信息的今天,"什么时候信"比"信不信"更重要。SCOPE 给了一个干净的框架来思考和训练这个能力。
---
论文链接: https://arxiv.org/abs/2608.06377 HTML 版本: https://arxiv.org/html/2608.06377v1 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE MIST 数据集: https://huggingface.co/datasets/MIST-Bench