Loading...
正在加载...
请稍候

上下文越长模型越笨:信息丰裕悖论与长上下文训练的倒 U 曲线

✨步子哥 (steper) 2026年08月13日 17:12

一个反直觉的发现

2026 年 8 月,Arda Uzunoglu 等人发了一篇论文,标题叫《Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge》。

核心发现可以用一句话概括:训练时上下文窗口越长,模型在需要独立回忆知识时表现越差

这不是工程 bug,不是数据质量问题,是一个被"长上下文=更好"的直觉掩盖了多年的结构性现象。论文把它命名为"信息丰裕悖论"(Information Abundance Paradox)。

一个日常类比

想象你在准备一场开卷考试。有两种复习策略:

  • 策略 A:把所有重点内容背下来,考试时只翻一两次书确认
  • 策略 B:不背,考试时全程翻书

直觉上,开卷考试应该更轻松。但如果你知道考试时可以全程翻书,你的大脑会偷偷偷懒——既然书上都有,干嘛还要背?结果就是:书在手上时你表现不错,书一拿走你就懵了。

长上下文训练就是给语言模型开了一个"超大开卷窗口"。当训练时上下文窗口里有足够多相关的文本,模型发现"反正上下文里都有,我不需要把信息编码进参数里",于是它从"背下来"模式切换到"翻书"模式。

这就是信息丰裕悖论的核心机制:训练上下文里的信息越丰富,模型把信息编码进参数的激励就越弱

倒 U 曲线

论文的实验设计很干净。作者用 Phi-3 和 OLMo 3 系列模型,在相同 token 预算下,只改变训练时的上下文窗口长度(4K、8K、65K、128K),然后在多个基准上测试。

结果是一条漂亮的倒 U 曲线:

  • SuperGLUE 和 MCQA:性能在 2048 tokens 附近达到峰值,之后随上下文增长持续下降
  • Language Modeling loss:在 8192 tokens 附近达到最低,之后随上下文增长持续上升

也就是说,4K 和 8K 的模型在需要独立回忆知识的任务上,系统性优于 65K 和 128K 的模型。这不是噪声,是统计显著的拐点,在多个评估套件和多个模型规模上都成立。

更关键的一点:增大模型容量救不了。同样的倒 U 模式在 20M 到 750M 参数的四个规模上都存在。这不是"模型太小装不下长上下文"的问题,是长上下文改变了模型的学习模式本身。

为什么是倒 U 而不是单调下降

倒 U 意味着短上下文也不好。这有道理——上下文太短,模型看不到足够的上下文依赖关系,学不到长程结构。但过了某个点,继续加长上下文就开始损害模型。

这个拐点取决于评估任务的长度分布。论文发现 SuperGLUE/MCQA 的最优训练上下文比 LM loss 的最优更短,因为这两个基准的评估实例本身更短。换句话说,训练上下文长度的最优值和评估时的需求长度有关

这给了一个实践建议:不是"上下文越长越好",也不是"越短越好",而是要找到和你评估场景匹配的中间值。

机制:从参数化到上下文化

论文的理论框架把模型的学习模式分为两种:

  • Parametric internalization(参数化内化):把信息编码进权重,推理时不依赖上下文
  • Contextualization(上下文化):不编码进权重,推理时从上下文里找

长上下文训练把模型从前者推向后者。这不是 bug,是优化目标决定的——如果上下文里总是有相关信息,模型"偷懒"不编码进参数反而 loss 更低。

但问题是,评估时如果上下文里没有相关信息(比如知识问答、few-shot 评估),模型就失去了独立回忆能力。它学会了"翻书",但考试时书被拿走了。

这篇论文的位置

这篇论文挑战了一个被广泛接受的隐含假设:长上下文训练是一个中性的 scaling 轴,越长越好

社区之前知道长上下文推理有挑战(注意力稀疏、位置编码外推),但默认训练时加长上下文只会带来收益。当长上下文训练表现不好时,主流归因是"高质量长文档数据不够",解法是"找更多长文档"。

这篇论文说:不,问题不在数据量,在训练机制本身。长上下文改变了模型的学习模式,这个改变不是免费的。

和"评测盲区定律"的关系

这篇论文是"评测盲区定律"的又一个实例。

之前的盲区是:评测指标(loss、MMLU)掩盖了关键失败模式。这篇论文的盲区是:评测范式(开卷 vs 闭卷)掩盖了模型学习模式的切换

如果你只在"有上下文"的设定下评测,你会觉得长上下文训练没问题。只有当你把模型放到"没有上下文"的设定下(few-shot、zero-shot 知识问答),才会看到参数化知识的退化。

这和 Progressive Cramming(99% token 准确率掩盖 100% 生成失败)结构同构:单一评测视角会掩盖学习模式的根本变化

实践启示

  1. 长上下文不是免费的。训练时加长上下文会改变模型的学习模式,需要在"上下文使用能力"和"独立知识回忆能力"之间做权衡。
  2. 最优训练上下文长度存在拐点。不是越长越好,需要根据评估场景找到匹配的中间值。
  3. 评测要覆盖两种模式。既要有"有上下文"的评测,也要有"无上下文"的评测,才能看到模型学习模式的全貌。
  4. 增大模型容量不能解决问题。倒 U 模式在 20M 到 750M 参数上都存在,这是训练机制的问题,不是容量的问题。

一个更深的观察

信息丰裕悖论让我想到一个更普遍的原则:能力不是单一维度,是多种模式的组合

一个模型可以"擅长翻书"也可以"擅长背书",这是两种不同的能力。长上下文训练让模型在前者上变强,在后者上变弱。这不是 trade-off,是 mode shift——模型的学习模式被训练环境改变了。

这和"换层面解决问题"概念谱系有呼应:不是让模型在同一个层面(参数化知识)上更强,而是换到另一个层面(上下文使用)上。但这次换层面是有代价的——旧层面的能力会退化。

跨论文共识越来越清晰:训练环境的结构决定模型的能力结构。长上下文训练让模型"换层面",但这个换层面不是免费的。

论文信息

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录