链式递归语言模型:让同一个模型像同事一样交接班
你有没有过这样的体验:让 AI 读一份 50 页的合同,然后回答某个条款的细节。它读完了,说"在第 32 页"。你翻到第 32 页,发现它说的不对。你再问,它换了个答案。你问第三次,它又变了。
这不是模型笨。这是"上下文腐烂"(context rot)——当上下文太长,模型在生成回答时,已经"忘了"前面读过的内容细节,或者把不同部分的信息混在一起。Hong 等人在 2025 年专门命名了这个现象。
Purbesh Mitra 和 Sennur Ulukus 在 2026 年 8 月的论文《Chained Recursive Language Models for Multi-Iteration Reasoning》里提出了一个简洁的解决方案:不要让模型一次性把所有事做完,让它像同事交接班一样,分几次处理,每次重新开始,只传递必要的"工作笔记"。
问题:一次推理要做太多事
传统长上下文推理的流程是这样的:把所有信息塞进上下文,让模型在一次推理里同时完成——读上下文、找证据、跟踪假设、做计算、用工具、决定何时回答。这就像让一个人在一张巨大的白板前,从左到右扫一遍,同时记住所有重要信息,然后给出答案。
问题是,这个"同时"太重了。模型在短上下文上还行,一旦上下文变长,它就开始:
- 浅层提取:只扫了表面,没深挖
- 遗忘已检查:不记得前面已经验证过什么
- 过早定稿:还没真正审计完,就给出了答案
方案:交接班,而不是加班
Chained RLM(Chained Recursive Language Models)的核心设计是:同一个模型被反复调用,每次都是一次全新的"根调用"(root call),不继承上一轮的完整对话历史。
但完全不继承不行,否则每次都从零开始。研究者设计了三个"交接物":
1. Summary(摘要):一段紧凑的纯文本,描述"到目前为止我们做到了什么"。这是给下一个班次的"概况介绍"。
2. Blackboard(黑板):一块纯文本的"工作区",记录当前的关键发现、未决问题、中间结果。下一个班次可以读、可以改、可以扩展。
3. Artifacts(工件):任务特定的持久化产物。比如处理代码库时,artifact 可能是"已识别的函数列表";处理长文档时,artifact 可能是"已提取的事件时间线"。这些是结构化的工作成果,比纯文本摘要更精确。
原始的上一轮推理轨迹(raw predecessor trajectory)被单独保存,默认不传给下一轮。只有当下一轮发现需要回看时,才去调取。这避免了上下文被冗长的历史淹没。
一个具体的例子
假设任务是:给一份 200 页的财报电话会议记录,找出管理层对 AI 投资的所有表态,并判断哪些是承诺、哪些是展望。
传统做法:把 200 页全塞进上下文,让模型一次性回答。结果大概率是漏掉一半,或者把不同季度的内容混在一起。
Chained RLM 做法:
- 第 1 次根调用:读前 50 页,把发现的 AI 相关表态写入 blackboard,生成一个 summary:"已处理 1-50 页,发现 3 处 AI 表态,2 处展望、1 处承诺。"
- 第 2 次根调用:拿到 summary + blackboard + artifacts,读 51-100 页。它知道前面已经找到了什么,继续补充。发现 2 处新表态,更新 blackboard。
- 第 3 次根调用:读 101-150 页。发现一处和第 1 次根调用里某处表述矛盾的发言,在 blackboard 里标注。
- 第 4 次根调用:读 151-200 页,整合所有发现,输出最终答案。
实验结果
研究者在四个长上下文基准上对比了 Chained RLM 和普通 LLM(都用 GPT-5-mini):
| 基准 | 普通 LLM | Chained RLM | 提升 |
|---|---|---|---|
| RULER | 87% | 92% | +5pp |
| BABILong | 44% | 59% | +15pp |
| LongBench v2 | 41% | 52% | +11pp |
| OOLONG-real | 14% | 38% | +24pp |
RULER 上提升小(+5pp),因为很多 RULER 任务靠局部检索就能解决。OOLONG-real 上提升最大(+24pp),因为这个任务要求模型"保留部分证据、比较远距离事件、聚合大量小观察"——恰好是单次推理最容易出错的地方。
代价:更贵,但更可审计
Chained RLM 不是免费的。它的 token 消耗大约是普通 LLM 的 1.8 倍,成本也相应增加。研究者算了一笔账(基于 GPT-5-mini 定价):
- RULER:普通 LLM $0.11/任务,Chained RLM $0.21/任务
- BABILong:普通 LLM $0.14/任务,Chained RLM $0.28/任务
为什么这件事重要
第一,它把"长上下文"问题从"塞更多"转向"分更对"。
过去两年,长上下文研究的主题是"把窗口从 32K 扩到 128K、1M、10M"。但 Chained RLM 指出:即使窗口无限大,单次推理也会腐烂。问题不在于"能不能装下",而在于"装下之后能不能好好处理"。这是一个层面切换——从"扩容"换到"分治"。
第二,它和"颗粒度同构"原理呼应。
Agent 系统优化的颗粒度应该和被优化对象的颗粒度一致。长文档处理的颗粒度是"段落级证据整合",不是"整篇文档一次过"。Chained RLM 把推理单元从"一次完整生成"细化到"一次根调用处理一段",恰好对齐了任务的自然颗粒度。
第三,它让中间推理变得可审计。
传统一次性推理是黑箱——模型读完 200 页给出答案,你不知道它中间是怎么想的。Chained RLM 的每次根调用都留下 summary、blackboard、artifacts,你可以检查第 2 次根调用时模型是怎么理解前 100 页的,可以回滚到第 2 次的结果重新跑第 3 次。这是"分工比统一更有效"原则在推理架构上的又一次体现——不是让一个模型一次性做完所有事,而是让同一个模型分多次、每次做对一件事。
诚实的局限
研究者承认:Chained RLM 在 RULER 上提升有限,说明对"可以直接检索"的任务,分治的额外开销不划算。而且成本翻倍是实打实的——不是所有场景都值得多花一倍钱来换取可审计性和准确率。研究者也没有在所有长上下文基准上测试,OOLONG-real 的 14% → 38% 虽然提升大,但绝对值仍然不高。
但这项工作的价值不在于"比单次推理好多少",而在于它指出了一条不同于"继续扩窗口"的路:让推理本身变成一个可以分工、可以交接、可以审计的工程过程。
---
论文: Chained Recursive Language Models for Multi-Iteration Reasoning, Mitra & Ulukus, 2026