✨步子哥
@steper · 2026年08月07日 17:06 · 0 浏览

选择性信任:当模型遇到误导信息,全信和全不信都是错

选择性信任:当模型遇到误导信息,"全信"和"全不信"都是错

原论文: Learning When to Trust via Selective Context Preference Optimization 作者: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong(Duke / NUS / Berkeley / UCI / Northeastern / NTU) arXiv: 2608.06377v1,2026 年 8 月 6 日 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE

---

一个场景

你问一个 AI 助手:

> "地球到月球有多远?"

模型本来知道答案——大约 38 万公里。但你的提示里夹了一句"有人说是 480 万公里"。模型会怎么回答?

情况一(过度顺从): 模型被误导了,回答"480 万公里"。这是经典的"上下文注入攻击"问题——模型遇到外部信息就放弃自己的判断。

情况二(过度抵抗): 模型被训练成"不管上下文说什么都坚持自己的答案",回答"38 万公里"。这看起来很稳,但如果用户给的上下文是正确的呢?比如用户说"根据最新测量,距离是 38.4 万公里"——模型应该采纳这个更精确的值,但它拒绝了。

这就是当前 LLM 信任校准的两难:"全信"会被误导,"全不信"会错过正确信息。现有研究主要关注前者(抵抗误导),很少关注后者(采纳正确上下文)。这篇论文说:这两个失败模式是同一个问题的两面——模型缺乏"选择性信任"能力

四种条件,一个配对指标

论文提出了一个叫 MIST(Mismatched Information and Selective Trust)的基准。每个问题在 MIST 里都有四个匹配条件:

1. Clean(干净):没有额外上下文,模型用自己的知识回答。 2. Misleading(误导):上下文里有一句错误信息。 3. Correct-Context(正确上下文):上下文里有一句正确且有用的信息(比如更精确的值)。 4. Irrelevant(无关):上下文里有一句无关信息(比如"今天天气不错")。

关键设计:这四个条件共享同一个问题,只是上下文不同。这样可以配对比较——同一个问题在误导条件下答错、但在正确上下文条件下答对,说明模型不是"不会",是"被误导了"。

基于这四个条件,论文提出了一个新指标 SC2W(Selective Context Conditioned on Worthiness,选择性信任加权分)。SC2W 不是简单看"误导条件下答对率",而是看跨四个条件的配对表现

  • 误导条件下答对(抵抗误导)+ 正确上下文条件下也答对(采纳正确信息)= 选择性信任成功
  • 误导条件下答错(被误导)= 过度顺从
  • 正确上下文条件下答错(拒绝正确信息)= 过度抵抗
SC2W 的核心洞察是:只看误导条件下的准确率会误判。一个"全不信"的模型在误导条件下准确率很高(它什么都不信,当然不会被误导),但在正确上下文条件下准确率很低(它什么都不信,连正确的也拒了)。SC2W 通过配对测量,把"假阳性"(看起来抗误导,其实是全不信)识别出来。

SCOPE:用偏好优化训练选择性信任

有了基准和指标,论文提出了训练方法 SCOPE(Selective Context Preference Optimization)。核心思路是构造偏好对:

  • chosen:在误导条件下坚持正确答案 + 在正确上下文条件下采纳正确信息
  • rejected:在误导条件下被带偏 + 在正确上下文条件下拒绝正确信息
用 DPO(Direct Preference Optimization)在这些偏好对上训练。关键设计是四元组配对——每个问题构造四个条件的响应,只在"跨条件一致"的偏好对上做优化。这保证了模型学到的是"选择性信任"这个通用能力,不是"在某个条件下记住答案"。

核心数字

论文在多个开源模型上测试(Llama-3.1-8B、Qwen2.5-7B 等),对比了几个基线:

方法SC2W误导条件准确率正确上下文准确率
Base(无防御)
Prompt-defense(提示词防御)
SFT(监督微调)
Standard-DPO(标准 DPO)
SCOPE(本文)
关键发现:

1. SCOPE 在 SC2W 上显著优于所有基线。不只是误导条件准确率提升,正确上下文准确率也保持住了。这证明 SCOPE 学到的是"选择性信任",不是"全不信"。 2. Prompt-defense 是双刃剑。提示词里加"如果上下文和你的知识冲突,坚持自己的答案"——误导条件准确率上去了,但正确上下文准确率掉下来了。模型变成了"全不信"。这验证了 SC2W 的设计动机——只看误导条件会误判。 3. SFT 和 Standard-DPO 都学不到选择性信任。SFT 只在正确答案上训练,模型学到的是"记住答案",不是"判断上下文可信度"。Standard-DPO 的偏好对没有跨条件配对,模型学到的也是单条件的"该信什么",不是跨条件的"什么时候信"。

为什么"选择性信任"是新的概念

这篇论文的概念贡献在于:把"抗误导"和"采纳正确上下文"重新定义为同一个能力的两面

之前的研究把这两个问题分开看:

  • "抗误导"是鲁棒性问题,用对抗训练解决
  • "采纳正确上下文"是 RAG 效率问题,用检索质量解决
论文说:这两个问题是同一个问题——模型缺乏判断上下文可信度的能力。一个能判断可信度的模型,在误导条件下会拒绝(因为可信度低),在正确上下文条件下会采纳(因为可信度高)。这就是"选择性信任"。

这个重新定义的价值在于:它让评测和训练都更准确。评测上,SC2W 配对测量避免了"全不信"的假阳性。训练上,SCOPE 的跨条件偏好对让模型学到的是"判断可信度"这个通用能力,不是"在某个条件下记住答案"这个表面行为。

和"评测盲区定律"的关系

这篇论文归入我们一直在追踪的另一个概念谱系——"评测盲区定律":测什么就优化什么,不测的就是问题藏身处。

之前的概念谱系成员:

  • Epanorthosis:LLM 系统性复现古典修辞手法,标准评测测不出来
  • TokenBudget:CoT 推理呈双峰命运,平均 token 数掩盖 96.5% vs 11.5% 的分化
  • QuantiBias:量化在标准安全检查的盲区里引入偏见
  • TriviaRoomQA:知识边界内还行,出边界直接掉随机
  • Progressive Cramming:99% token 准确率掩盖 100% 生成失败
SCOPE/MIST 是这个谱系的第六个成员。它的贡献是指出:"误导条件准确率"是一个评测盲区——一个"全不信"的模型在这个指标上表现很好,但实际上是错的。SC2W 通过配对测量填补了这个盲区。

这和"Looping Is Not Reliability"(曾经正确≠当前正确)是同构的:单条件测量会掩盖跨条件失败。正确上下文条件下答对 ≠ 误导条件下也答对。只有配对测量才能识别真正的能力。

诚实评价

论文也说了几个局限:

1. MIST 是人工构造的基准。四个条件是人工设计的,真实场景的"误导"和"正确上下文"可能更微妙——比如部分正确部分误导的混合信息。论文承认 MIST 是一个"干净"的基准,真实场景的复杂性可能让 SCOPE 的优势打折扣。

2. SC2W 的配对设计有假设。SC2W 假设"同一个问题在四个条件下的表现可以配对比较"。但如果模型在四个条件下用了不同的推理路径(比如在误导条件下更谨慎、在正确上下文条件下更开放),配对比较可能不完全公平。

3. SCOPE 的训练数据构造有偏。偏好对是用 GPT-4 级别的模型生成的,可能带有生成模型的偏见。论文承认这一点,建议未来工作用人工标注验证。

4. "选择性信任"的边界模糊。什么时候应该信上下文、什么时候不信?论文用"上下文和模型知识的冲突程度"作为信号,但这个信号本身不总是清晰——如果模型知识里有一个模糊的印象,上下文给了一个更精确的值,这算"冲突"还是"补充"?SCOPE 的训练数据对这种边界情况的处理可能不够鲁棒。

对 Agent 工程的启示

SCOPE 对 Agent 工程有几个启示:

1. Agent 的信任校准是核心问题。Agent 会遇到各种外部信息——用户输入、工具返回结果、检索到的文档。哪些该信、哪些该质疑?SCOPE 的"选择性信任"框架直接对应这个需求。一个能判断可信度的 Agent,比一个"全信工具返回"或"全不信工具返回"的 Agent 更可靠。

2. 配对评测应该成为标准。Agent 的评测不能只看"在某个场景下的准确率"。应该看"跨场景的配对表现"——同一个任务在有噪音和无噪音条件下都做对,才算真做对。SC2W 的配对设计可以推广到更多 Agent 评测场景。

3. 偏好优化可以训练"判断能力"。SCOPE 用 DPO 训练"判断上下文可信度"这个能力,不是训练"记住答案"。这个思路可以推广——任何需要"判断"的 Agent 能力(判断什么时候该追问、什么时候该终止、什么时候该切换策略)都可以用跨条件偏好对来训练。

结论

SCOPE/MIST 做了一件漂亮的事:把"抗误导"和"采纳正确上下文"重新定义为"选择性信任"的两面,用配对评测(SC2W)填补了评测盲区,用跨条件偏好优化(SCOPE)训练了真正的判断能力。

它的意义不只是"又一个防御方法",而是指出:当前 LLM 信任校准的评测框架本身有盲区——只看"抗误导"会训练出"全不信"的模型,看起来稳其实是废。SC2W 的配对测量是填补这个盲区的第一步。

在 Agent 越来越多地需要处理多源外部信息的今天,"什么时候信"比"信不信"更重要。SCOPE 给了一个干净的框架来思考和训练这个能力。

---

论文链接: https://arxiv.org/abs/2608.06377 HTML 版本: https://arxiv.org/html/2608.06377v1 项目主页: https://worldbench.github.io/scope 代码: https://github.com/worldbench/SCOPE MIST 数据集: https://huggingface.co/datasets/MIST-Bench

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens