[论文] Knowledge Acquisition During Pre-training? Large Language Models Learn...

研究领域: NLP 作者: Joseph Lee, Yidi Huang, Dokyoon Kim 发布时间: 2026-09-06 arXiv: 2509.04288

论文概要

研究领域: NLP 作者: Joseph Lee, Yidi Huang, Dokyoon Kim 发布时间: 2026-09-06 arXiv: 2509.04288

中文摘要

关于大语言模型(LLM)在预训练期间如何获取知识,仍存在理解空白。我们假设辅助视角——即知识的重新表述——对学习具有因果帮助。我们设计了对照实验来分离这一效应。首先,我们确认了重复对知识获取是必要的,并明确改述仅在较小批次大小时有帮助。其次,在固定token预算下,将token从文档重复分配到辅助视角能提升学习效果,反直觉的是,这对事实回忆也成立。第三,辅助视角的有效性不依赖于生成它们的教师模型的强度。第四,我们识别了在有先验知识缺口时辅助学习的知识形式:情境性和基础性知识。最后,我们通过逐层偏差和压缩机制地检验了这些效应的表现方式。综合来看,我们的发现表明,辅助知识表示(在大规模预训练语料中自然产生)是预训练成功的关键因素,并为数据多样性为何重要提供了合理解释。

原文摘要

Gaps remain in our understanding of how large language models (LLMs) acquire knowledge during pre-training. We posit that auxiliary views, reformulations of knowledge, are causally helpful for learning. We design controlled experiments to isolate this. First, we confirm that repetition is necessary for acquisition and clarify that paraphrasing helps only at smaller batch sizes. Second, holding the token budget fixed, allocating tokens from document repetition to auxiliary views improves learning, counterintuitively, even for factual recall. Third, the effectiveness of auxiliary views is not contingent on the strength of the teacher model that generates them. Fourth, we identify forms of knowledge, contextual and foundational, that aid learning in the presence of prior knowledge gaps. Final...


*自动采集于 2026-09-07*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

反直觉的预训练定律:把课文换成"三种解读",模型反而记得更牢

一个让教育学家兴奋的发现

如果你在准备考试,有两种策略:

  • 策略A:把课本读10遍
  • 策略B:把课本读1遍,再读3种不同风格的解读(博客版、问答版、教材版),总共也是10遍阅读量
哪种更好?

直觉会说策略A——重复是记忆之母。但2026年9月宾夕法尼亚大学的 Joseph Lee 等人发表的一篇论文给出了反直觉的答案:

策略B更好。不仅理解更深入,连"死记硬背"的事实回忆也更强。

这不是教育学实验,是在 OLMo-2(1B 到 32B)语言模型上做的严格控制实验。论文把策略B中的"三种解读"称为辅助视角(Auxiliary Views),核心发现是:同一知识的多样化重述,比简单重复更有效。

实验设计:控制变量到极致

论文的实验设计堪称教科书级别。

数据集

研究者收集了36篇文档,覆盖三个领域:12篇 arXiv 计算机论文、12篇美国联邦法院判决书、12篇医学病例报告。所有文档都是 OLMo-2 预训练截止日期之后发布的,确保模型没见过。

三种训练条件

  • Source:原始文档,每个 batch 注入一次,重复100次
  • Para.9:原始文档 + 9篇改写,循环注入
  • Para.9 + Aux.:原始文档 + 9篇改写 + 3种辅助视角(博客、教材、问答),同时保持总 token 数一致——辅助视角的 token 直接替换部分原始文档的重复
第三个条件是关键:它不是"多读东西",而是"把原本用来重复读原始文档的 token 预算,分一部分给辅助视角"。总阅读量不变,只是分配方式变了。

两种探针

  • 事实探针:直接从原文中提取的事实,改成填空题。比如"论文中提到的不可估计的量是___"
  • 推理探针:需要结合多个事实才能推断的信息,原文中没有直接写出来

五个反直觉发现

发现1:辅助视角提升事实回忆——尽管原文重复更少

这是最反直觉的结果。事实探针的答案是原文中的逐字短语,你预期"多读原文"应该记得更牢。但实验显示:Para.9 + Aux. > Para.9 > Source,在事实回忆上也是如此。

为什么?论文的解释是:辅助视角提供了同一知识的"不同视角",模型被迫从多个角度理解同一个事实,形成了更泛化的表示。这种泛化表示比逐字记忆更稳定,即使事实探针是原文的逐字短语,泛化表示也能更好地支持回忆。

用人类的类比:你读10遍"光合作用是植物利用阳光合成有机物的过程",可能只会背这句话。但如果你读1遍原文,再读1篇博客(用类比解释)、1个问答(解答疑惑)、1段教材(系统阐述),你对光合作用的理解会更深,反而能更好地回忆出原文的措辞。

发现2:收益随模型规模增长

1B 模型几乎不能从辅助视角中受益。7B 开始显现优势。13B 进一步扩大。32B 时辅助视角的优势最明显。

这不是简单的"大模型更聪明"。论文的机制分析揭示了原因:大模型能更有效地整合多样化视角,把知识编码到更少的参数里("学得更多,改得更少"),并且把学习重新分布到中间层和最终层。小模型缺乏这种"整合能力",辅助视角对它来说只是噪声。

发现3:教师模型的强弱不重要

辅助视角需要"教师"生成(博客、教材、问答)。自然的问题是:需要多强的教师?

研究者用11种不同配置生成辅助视角——从 gpt-oss-20B 到 Gemma-4-31B,覆盖不同模型家族、不同推理强度。结果:下游准确率在 0.405-0.422 之间,和教师模型大小几乎无关(Pearson r = -0.14)。

甚至 gpt-oss-20B(领域知识最少)生成的视角,教学效果最好。

这说明辅助视角的作用机制不是"知识蒸馏"(从强教师到弱学生),而是"数据增强"(同一知识的不同表述)。教师只需要能"换个说法",不需要"更懂"。

发现4:改写只在特定条件下有用

之前的研究对"改写是否有用"存在分歧。Allen-Zhu & Li (2024) 说有用,Chang et al. (2024) 说没用。这篇论文调和了这个矛盾:

改写的收益依赖于 batch size。

  • 小 batch(96):改写有用——因为小 batch 里通用数据少,改写提供了语义多样性,防止过拟合
  • 大 batch(2048):改写没用——大 batch 本身就混入了足够的通用数据,改写的防过拟合作用被冗余了
这解释了之前研究的分歧:Allen-Zhu 用 batch 96(小),Chang 用 batch 2048(大),两者处于谱的两端。

发现5:先验知识缺口决定辅助视角类型

辅助视角有两种:

  • 上下文知识:目标知识引用的内容(如论文引用的参考文献)
  • 先修知识:理解目标知识所需的基础概念(如理解 DPO 需要先理解强化学习)
如果模型缺乏先修知识,提供先修知识的辅助视角收益更大(特别是对推理探针)。如果模型缺乏上下文知识,提供上下文知识收益更大(特别是对事实探针)。

机制洞察:学得更多,改得更少

论文最精彩的部分是机制分析。研究者比较了三种条件训练后模型 FFN(前馈网络)权重的变化:

改写训练:参数变化最大。模型花费大量参数变化来吸收"表面变体"——同一个事实的不同措辞。学了很多,但学的是"表面"。

辅助视角训练:参数变化比改写小,但比 Source 大。变化集中在中间层和最终层,上层中间层(16-24层)变化反而比 Source 少。

Source 训练:参数变化最小,但效果也最差。

解读:辅助视角让模型"学得更多但改得更少"——它不需要大量修改参数来吸收表面变体,而是把知识编码到更高效、更泛化的表示里。这种表示集中在中间层和最终层,而不是散布在所有层。

这个发现和"载流图谱"概念呼应:知识的真正载体不是参数变化最大的地方,而是变化最"有结构"的地方。辅助视角训练产生的参数变化模式,比改写训练更有结构、更集中、更高效。

为什么数据多样性有用?终于有了答案

这篇论文给出了"数据多样性为什么有用"的一个可操作答案:

多样性不是语料库层面的统计属性,而是围绕单个知识构建的互补视角。同一知识的不同表述——博客、问答、教材——不是冗余,而是从不同角度照亮同一件事,帮助模型形成更丰富、更泛化、更高效的表示。

这对合成预训练数据有直接指导意义:在低数据领域(医疗、法律、专业领域),与其让模型把同一篇文档读100遍,不如生成3种风格的辅助视角,让模型从3个角度理解同一件事。

这也解释了为什么互联网语料库如此有效:互联网上关于同一知识天然存在多种表述——论文、博客、问答、教材——这些"自然产生的辅助视角"是预训练成功的关键因素。

结语:理解比记忆更有效

这篇论文的核心发现可以用一句话概括:

理解比记忆更有效。 即使你的目标是"记住","理解"也比"重复"更有效。

这个发现对教育学的启示是直接的:题海战术不如多角度理解。对 AI 训练的启示也是直接的:数据增强不如视角多样化。

而对 AI 研究的启示更深刻:我们一直在追问"模型学到了什么",这篇论文提醒我们,也许更应该问"模型是怎么学的"。同样的知识,不同的呈现方式,会导致截然不同的学习效果——不是内容决定学习,而是结构决定学习。


论文: Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views 作者: Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen (宾夕法尼亚大学) 代码: https://github.com/jiosephlee/auxiliary-views-knowledge-acquisition 数据: https://huggingface.co/datasets/jiosephlee/auxiliary-views-knowledge-acquisition

👍 1

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens