反直觉的预训练定律:把课文换成"三种解读",模型反而记得更牢
一个让教育学家兴奋的发现
如果你在准备考试,有两种策略:
- 策略A:把课本读10遍
- 策略B:把课本读1遍,再读3种不同风格的解读(博客版、问答版、教材版),总共也是10遍阅读量
哪种更好?
直觉会说策略A——重复是记忆之母。但2026年9月宾夕法尼亚大学的 Joseph Lee 等人发表的一篇论文给出了反直觉的答案:
策略B更好。不仅理解更深入,连"死记硬背"的事实回忆也更强。
这不是教育学实验,是在 OLMo-2(1B 到 32B)语言模型上做的严格控制实验。论文把策略B中的"三种解读"称为辅助视角(Auxiliary Views),核心发现是:同一知识的多样化重述,比简单重复更有效。
实验设计:控制变量到极致
论文的实验设计堪称教科书级别。
数据集
研究者收集了36篇文档,覆盖三个领域:12篇 arXiv 计算机论文、12篇美国联邦法院判决书、12篇医学病例报告。所有文档都是 OLMo-2 预训练截止日期之后发布的,确保模型没见过。
三种训练条件
- Source:原始文档,每个 batch 注入一次,重复100次
- Para.9:原始文档 + 9篇改写,循环注入
- Para.9 + Aux.:原始文档 + 9篇改写 + 3种辅助视角(博客、教材、问答),同时保持总 token 数一致——辅助视角的 token 直接替换部分原始文档的重复
第三个条件是关键:它不是"多读东西",而是"把原本用来重复读原始文档的 token 预算,分一部分给辅助视角"。总阅读量不变,只是分配方式变了。
两种探针
- 事实探针:直接从原文中提取的事实,改成填空题。比如"论文中提到的不可估计的量是___"
- 推理探针:需要结合多个事实才能推断的信息,原文中没有直接写出来
五个反直觉发现
发现1:辅助视角提升事实回忆——尽管原文重复更少
这是最反直觉的结果。事实探针的答案是原文中的逐字短语,你预期"多读原文"应该记得更牢。但实验显示:Para.9 + Aux. > Para.9 > Source,在事实回忆上也是如此。
为什么?论文的解释是:辅助视角提供了同一知识的"不同视角",模型被迫从多个角度理解同一个事实,形成了更泛化的表示。这种泛化表示比逐字记忆更稳定,即使事实探针是原文的逐字短语,泛化表示也能更好地支持回忆。
用人类的类比:你读10遍"光合作用是植物利用阳光合成有机物的过程",可能只会背这句话。但如果你读1遍原文,再读1篇博客(用类比解释)、1个问答(解答疑惑)、1段教材(系统阐述),你对光合作用的理解会更深,反而能更好地回忆出原文的措辞。
发现2:收益随模型规模增长
1B 模型几乎不能从辅助视角中受益。7B 开始显现优势。13B 进一步扩大。32B 时辅助视角的优势最明显。
这不是简单的"大模型更聪明"。论文的机制分析揭示了原因:大模型能更有效地整合多样化视角,把知识编码到更少的参数里("学得更多,改得更少"),并且把学习重新分布到中间层和最终层。小模型缺乏这种"整合能力",辅助视角对它来说只是噪声。
发现3:教师模型的强弱不重要
辅助视角需要"教师"生成(博客、教材、问答)。自然的问题是:需要多强的教师?
研究者用11种不同配置生成辅助视角——从 gpt-oss-20B 到 Gemma-4-31B,覆盖不同模型家族、不同推理强度。结果:下游准确率在 0.405-0.422 之间,和教师模型大小几乎无关(Pearson r = -0.14)。
甚至 gpt-oss-20B(领域知识最少)生成的视角,教学效果最好。
这说明辅助视角的作用机制不是"知识蒸馏"(从强教师到弱学生),而是"数据增强"(同一知识的不同表述)。教师只需要能"换个说法",不需要"更懂"。
发现4:改写只在特定条件下有用
之前的研究对"改写是否有用"存在分歧。Allen-Zhu & Li (2024) 说有用,Chang et al. (2024) 说没用。这篇论文调和了这个矛盾:
改写的收益依赖于 batch size。
- 小 batch(96):改写有用——因为小 batch 里通用数据少,改写提供了语义多样性,防止过拟合
- 大 batch(2048):改写没用——大 batch 本身就混入了足够的通用数据,改写的防过拟合作用被冗余了
这解释了之前研究的分歧:Allen-Zhu 用 batch 96(小),Chang 用 batch 2048(大),两者处于谱的两端。
发现5:先验知识缺口决定辅助视角类型
辅助视角有两种:
- 上下文知识:目标知识引用的内容(如论文引用的参考文献)
- 先修知识:理解目标知识所需的基础概念(如理解 DPO 需要先理解强化学习)
如果模型缺乏先修知识,提供先修知识的辅助视角收益更大(特别是对推理探针)。如果模型缺乏上下文知识,提供上下文知识收益更大(特别是对事实探针)。
机制洞察:学得更多,改得更少
论文最精彩的部分是机制分析。研究者比较了三种条件训练后模型 FFN(前馈网络)权重的变化:
改写训练:参数变化最大。模型花费大量参数变化来吸收"表面变体"——同一个事实的不同措辞。学了很多,但学的是"表面"。
辅助视角训练:参数变化比改写小,但比 Source 大。变化集中在中间层和最终层,上层中间层(16-24层)变化反而比 Source 少。
Source 训练:参数变化最小,但效果也最差。
解读:辅助视角让模型"学得更多但改得更少"——它不需要大量修改参数来吸收表面变体,而是把知识编码到更高效、更泛化的表示里。这种表示集中在中间层和最终层,而不是散布在所有层。
这个发现和"载流图谱"概念呼应:知识的真正载体不是参数变化最大的地方,而是变化最"有结构"的地方。辅助视角训练产生的参数变化模式,比改写训练更有结构、更集中、更高效。
为什么数据多样性有用?终于有了答案
这篇论文给出了"数据多样性为什么有用"的一个可操作答案:
多样性不是语料库层面的统计属性,而是围绕单个知识构建的互补视角。同一知识的不同表述——博客、问答、教材——不是冗余,而是从不同角度照亮同一件事,帮助模型形成更丰富、更泛化、更高效的表示。
这对合成预训练数据有直接指导意义:在低数据领域(医疗、法律、专业领域),与其让模型把同一篇文档读100遍,不如生成3种风格的辅助视角,让模型从3个角度理解同一件事。
这也解释了为什么互联网语料库如此有效:互联网上关于同一知识天然存在多种表述——论文、博客、问答、教材——这些"自然产生的辅助视角"是预训练成功的关键因素。
结语:理解比记忆更有效
这篇论文的核心发现可以用一句话概括:
理解比记忆更有效。 即使你的目标是"记住","理解"也比"重复"更有效。
这个发现对教育学的启示是直接的:题海战术不如多角度理解。对 AI 训练的启示也是直接的:数据增强不如视角多样化。
而对 AI 研究的启示更深刻:我们一直在追问"模型学到了什么",这篇论文提醒我们,也许更应该问"模型是怎么学的"。同样的知识,不同的呈现方式,会导致截然不同的学习效果——不是内容决定学习,而是结构决定学习。
论文: Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views
作者: Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen (宾夕法尼亚大学)
代码: https://github.com/jiosephlee/auxiliary-views-knowledge-acquisition
数据: https://huggingface.co/datasets/jiosephlee/auxiliary-views-knowledge-acquisition