← 返回主题列表
✨步子哥
@steper · 2026年07月22日 17:06 · 0浏览

当LLM遇到长文本变成复读机:GEAR用证据感知奖励教模型划重点

你让一个 LLM 读一份 50 页的法律合同,然后问:"这份合同里最关键的三个违约条款是什么?"

模型开始"思考"。它的推理轨迹是这样的:

"合同第一页写着'本协议由甲方与乙方于2026年7月21日签订,约定如下...'合同第二页写着'第一条 定义与解释...'合同第三页写着'第二条 违约责任...'..."

它把合同原文一字不差地抄了一遍,然后说:"根据以上内容,最关键的三个违约条款是..."

这不是思考,这是复读机。

北大和阿里巴巴的团队在 2026 年 7 月的论文里给这个病起了个名字:重复复制(repetitive copying)。他们发现,当你把 LLM 放到长上下文推理场景里,这种"抄书"行为普遍得令人吃惊——而且上下文越长,抄得越凶。

---

七个前沿模型,无一幸免

研究团队测试了七个前沿长上下文 LLM,包括 Qwen3 系列、Claude 系列、DeepSeek 系列。结果:

所有模型都存在重复复制现象,且随上下文长度增加而恶化。

在 32k 上下文时,模型的推理轨迹中有相当大比例是直接从 prompt 里复制过来的原文。到了 128k,这个比例更高。模型把 token 预算花在"抄书"上,而不是"解题"上。

更关键的是,重复复制和答案错误高度相关。抄得越多的样本,答错的可能性越大。但这里有个微妙之处:抄本身不是错,乱抄才是错

团队做了一个精巧的实验:把每个 prompt 分成两部分——关键证据(task-relevant key evidence)和无关干扰(irrelevant distractor context)。然后看模型抄的内容里,有多少来自关键证据,多少来自干扰。

结果:答对的样本,抄的内容主要来自关键证据;答错的样本,抄的内容均匀分布在证据和干扰之间。

这就像考试划重点。会的学生在笔记上画的全是考点,不会的学生把整本书都画了——重点和非重点一样多,等于没画。

问题的根源不是"模型抄了",而是模型分不清哪些该抄哪些不该抄。团队把这个叫做"grounding 不足"——模型没有正确地"锚定"到任务相关证据上。

GEAR:用奖励信号教模型"划重点"

知道了病因是 grounding 不足,药方就清楚了:在 RL 训练里加一个奖励信号,鼓励模型多抄关键证据、少抄干扰内容

这就是 GEAR(Grounding Evidence-Aware Reward)。它把传统的单一准确率奖励拆成三个分量:

  • 准确率奖励 R_accuracy:答对了给奖励(传统做法)
  • grounding 奖励 R_ground:推理轨迹和关键证据的重叠度越高,奖励越多
  • 干扰惩罚 R_distractor:推理轨迹和无关干扰的重叠度越高,惩罚越重
总奖励 R = R_accuracy + α·R_ground - β·R_distractor

思路简单,但实现有个麻烦:你怎么知道哪些是"关键证据"?

在合成数据集(如 RULER)里,证据位置是已知的。但在真实自然语言数据上,没有现成的证据标注。团队设计了一个自动化流水线:用已有的文档处理工具,从任意文档中自动提取"关键证据"和"干扰段",构造证据标注的训练数据。这让 GEAR 可以用在自然语言任务上,不限于合成 benchmark。

实验结果:上下文越长,GEAR 越有用

在三个模型规模(Qwen3.5-9B、35B-A3B、27B)和五个长上下文 benchmark 上测试:

GEAR 在所有配置下都优于标准 RL(只用准确率奖励)。

关键数字:

  • 32k 上下文:平均提升 +4.6 到 +8.1 分
  • 128k 上下文:平均提升 +5.0 到 +15.6 分
  • 上下文越长,GEAR 的优势越大
这个趋势很合理。短上下文时,模型本来就能比较好地聚焦证据,grounding 不是大问题。上下文一长,干扰信息增多,模型更容易"乱抄",此时 grounding 奖励的矫正作用就更明显。

以 Qwen3.5-9B 在 128k 上下文为例:

  • 标准 RL(GSPO):RULER 84.1,LongBench-v2 52.2,Graphwalks 69.5,AA-LCR 86.0
  • GEAR:RULER 90.8,LongBench-v2 54.7,Graphwalks 71.7,AA-LCR 88.8
RULER 从 84.1 到 90.8,提升了 6.7 个点。这不是小数目——在长上下文 benchmark 上,6 个点往往意味着跨越了一个性能等级。

不只是分数涨了,行为也变了

GEAR 真的在减少重复复制吗?还是只是碰巧涨了分?

团队测量了两个行为指标:

  • 答案-输入重叠度(answer-input overlap,3-gram 级别):推理轨迹里有多少是从 prompt 抄来的
  • 推理长度(thinking length):推理轨迹有多少 token
结果:GEAR 显著降低了重叠度和推理长度。模型不再大段抄书,推理变得更精炼。

这验证了 GEAR 的机制确实是通过改善 grounding 来提升性能,而不是通过某种副作用。

消融实验:三个分量缺一不可

团队做了消融实验,分别去掉 grounding 奖励和干扰惩罚:

  • 只用准确率奖励(标准 RL):基线
  • 加 grounding 奖励,去掉干扰惩罚:有提升,但不如完整 GEAR
  • 加干扰惩罚,去掉 grounding 奖励:也有提升,但不如完整 GEAR
  • 完整 GEAR(grounding + 干扰惩罚):最佳
两个分量是互补的。grounding 奖励告诉模型"该看哪里",干扰惩罚告诉模型"不该看哪里"。一个拉一个推,缺了哪个效果都打折。

这篇论文的深层贡献

这篇论文做了一件少见的事:它先诊断,后开药

很多 RL 论文是"我设计了一个新奖励,分数涨了,完事"。但这篇论文花了一半篇幅在分析问题——重复复制是什么、有多严重、为什么会发生、和错误是什么关系。诊断清楚了,药方几乎是自然推出的。

这种"诊断驱动"的研究风格值得借鉴。重复复制这个现象之前可能被很多人观察到了,但没人系统地量化它、追溯它的根因、把它和 grounding 联系起来。一旦根因清楚了,解决方案就不是"试试看"而是"应该这样"。

另一个深层启示:长上下文推理的瓶颈不是"能读多少",而是"能聚焦多少"。128k 上下文的模型理论上能读 12 万 token,但如果它分不清证据和干扰,读得越多反而越糊涂。GEAR 的成功说明,长上下文能力的提升不只靠扩展上下文窗口,还靠改善模型对上下文的使用方式。

这和人类阅读长文档的方式一致。一个专家读 100 页合同,不是从头到尾一字不落,而是快速定位关键条款。能力不在于"能读 100 页",而在于"知道哪些该细读、哪些该跳过"。LLM 的长上下文推理,正在向这个方向进化。

---

论文Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning 作者:Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang(北京大学 / 阿里巴巴集团) 日期:2026 年 7 月 21 日

#LLM #长上下文推理 #强化学习 #RepetitiveCopying #Grounding

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens