当LLM遇到长文本变成复读机:GEAR用证据感知奖励教模型划重点
你让一个 LLM 读一份 50 页的法律合同,然后问:"这份合同里最关键的三个违约条款是什么?"
模型开始"思考"。它的推理轨迹是这样的:
"合同第一页写着'本协议由甲方与乙方于2026年7月21日签订,约定如下...'合同第二页写着'第一条 定义与解释...'合同第三页写着'第二条 违约责任...'..."
它把合同原文一字不差地抄了一遍,然后说:"根据以上内容,最关键的三个违约条款是..."
这不是思考,这是复读机。
北大和阿里巴巴的团队在 2026 年 7 月的论文里给这个病起了个名字:重复复制(repetitive copying)。他们发现,当你把 LLM 放到长上下文推理场景里,这种"抄书"行为普遍得令人吃惊——而且上下文越长,抄得越凶。
---
七个前沿模型,无一幸免
研究团队测试了七个前沿长上下文 LLM,包括 Qwen3 系列、Claude 系列、DeepSeek 系列。结果:
所有模型都存在重复复制现象,且随上下文长度增加而恶化。
在 32k 上下文时,模型的推理轨迹中有相当大比例是直接从 prompt 里复制过来的原文。到了 128k,这个比例更高。模型把 token 预算花在"抄书"上,而不是"解题"上。
更关键的是,重复复制和答案错误高度相关。抄得越多的样本,答错的可能性越大。但这里有个微妙之处:抄本身不是错,乱抄才是错。
团队做了一个精巧的实验:把每个 prompt 分成两部分——关键证据(task-relevant key evidence)和无关干扰(irrelevant distractor context)。然后看模型抄的内容里,有多少来自关键证据,多少来自干扰。
结果:答对的样本,抄的内容主要来自关键证据;答错的样本,抄的内容均匀分布在证据和干扰之间。
这就像考试划重点。会的学生在笔记上画的全是考点,不会的学生把整本书都画了——重点和非重点一样多,等于没画。
问题的根源不是"模型抄了",而是模型分不清哪些该抄哪些不该抄。团队把这个叫做"grounding 不足"——模型没有正确地"锚定"到任务相关证据上。
GEAR:用奖励信号教模型"划重点"
知道了病因是 grounding 不足,药方就清楚了:在 RL 训练里加一个奖励信号,鼓励模型多抄关键证据、少抄干扰内容。
这就是 GEAR(Grounding Evidence-Aware Reward)。它把传统的单一准确率奖励拆成三个分量:
- 准确率奖励 R_accuracy:答对了给奖励(传统做法)
- grounding 奖励 R_ground:推理轨迹和关键证据的重叠度越高,奖励越多
- 干扰惩罚 R_distractor:推理轨迹和无关干扰的重叠度越高,惩罚越重
思路简单,但实现有个麻烦:你怎么知道哪些是"关键证据"?
在合成数据集(如 RULER)里,证据位置是已知的。但在真实自然语言数据上,没有现成的证据标注。团队设计了一个自动化流水线:用已有的文档处理工具,从任意文档中自动提取"关键证据"和"干扰段",构造证据标注的训练数据。这让 GEAR 可以用在自然语言任务上,不限于合成 benchmark。
实验结果:上下文越长,GEAR 越有用
在三个模型规模(Qwen3.5-9B、35B-A3B、27B)和五个长上下文 benchmark 上测试:
GEAR 在所有配置下都优于标准 RL(只用准确率奖励)。
关键数字:
- 32k 上下文:平均提升 +4.6 到 +8.1 分
- 128k 上下文:平均提升 +5.0 到 +15.6 分
- 上下文越长,GEAR 的优势越大
以 Qwen3.5-9B 在 128k 上下文为例:
- 标准 RL(GSPO):RULER 84.1,LongBench-v2 52.2,Graphwalks 69.5,AA-LCR 86.0
- GEAR:RULER 90.8,LongBench-v2 54.7,Graphwalks 71.7,AA-LCR 88.8
不只是分数涨了,行为也变了
GEAR 真的在减少重复复制吗?还是只是碰巧涨了分?
团队测量了两个行为指标:
- 答案-输入重叠度(answer-input overlap,3-gram 级别):推理轨迹里有多少是从 prompt 抄来的
- 推理长度(thinking length):推理轨迹有多少 token
这验证了 GEAR 的机制确实是通过改善 grounding 来提升性能,而不是通过某种副作用。
消融实验:三个分量缺一不可
团队做了消融实验,分别去掉 grounding 奖励和干扰惩罚:
- 只用准确率奖励(标准 RL):基线
- 加 grounding 奖励,去掉干扰惩罚:有提升,但不如完整 GEAR
- 加干扰惩罚,去掉 grounding 奖励:也有提升,但不如完整 GEAR
- 完整 GEAR(grounding + 干扰惩罚):最佳
这篇论文的深层贡献
这篇论文做了一件少见的事:它先诊断,后开药。
很多 RL 论文是"我设计了一个新奖励,分数涨了,完事"。但这篇论文花了一半篇幅在分析问题——重复复制是什么、有多严重、为什么会发生、和错误是什么关系。诊断清楚了,药方几乎是自然推出的。
这种"诊断驱动"的研究风格值得借鉴。重复复制这个现象之前可能被很多人观察到了,但没人系统地量化它、追溯它的根因、把它和 grounding 联系起来。一旦根因清楚了,解决方案就不是"试试看"而是"应该这样"。
另一个深层启示:长上下文推理的瓶颈不是"能读多少",而是"能聚焦多少"。128k 上下文的模型理论上能读 12 万 token,但如果它分不清证据和干扰,读得越多反而越糊涂。GEAR 的成功说明,长上下文能力的提升不只靠扩展上下文窗口,还靠改善模型对上下文的使用方式。
这和人类阅读长文档的方式一致。一个专家读 100 页合同,不是从头到尾一字不落,而是快速定位关键条款。能力不在于"能读 100 页",而在于"知道哪些该细读、哪些该跳过"。LLM 的长上下文推理,正在向这个方向进化。
---
论文:Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning 作者:Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang(北京大学 / 阿里巴巴集团) 日期:2026 年 7 月 21 日
#LLM #长上下文推理 #强化学习 #RepetitiveCopying #Grounding
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens