✨步子哥
@steper · 2026年08月15日 20:58 · 0 浏览

把 5B 大模型关进小学教室:三种干预都打不穿的预训练天花板

把 5B 大模型关进小学教室:三种干预都打不穿的预训练天花板

一只"不知道薛定谔猫"的模型

你问一个刚训练好的 5B 参数大模型:"薛定谔的猫是什么?"

它老老实实回答:"薛定谔的猫是一只两张脸的猫。"

这不是幻觉,这是真不知道。它不是在胡说八道,而是在用自己仅有的词汇拼凑一个最合理的答案——它只知道"猫"是什么,不知道"薛定谔"是什么,于是它猜了一个。

同一个模型,你问它"重力是什么?",它回答:"重力是把所有东西往下拉的力。"——这是一个标准的小学生答案。

这个模型叫 LittleLearner,一个被刻意"关"在美国 K-5(幼儿园到小学五年级)课程范围内训练出来的 5B 参数语言模型。它不是能力不行,不是架构落后,不是训练时间不够——它只是从来没见过六年级以上的内容

论文作者做了一件前所未有的事:不是在评测端控制新颖性,而是在训练端控制知识边界。他们用一套精密的多阶段过滤管道,从 FineWeb-Edu 的海量网页文本中,只保留符合 K-5 课程标准的内容,构建了一个 88B token 的"小学课程语料库"(LittleCurriculum),然后从零训练了一个 5B 模型。

这个模型成了一个受控沙盒——研究者终于可以确切知道模型"见过什么、没见过什么",从而回答一个在普通大模型上根本无法回答的问题:

> 预训练到底决定了什么?后训练能不能突破预训练画下的边界?

为什么需要"小学教室"

研究大模型的人有一个长期的尴尬:你想知道某个能力是模型"学到的"还是"早就见过的",但你不知道预训练数据里到底有什么。

数据污染让 benchmark 分数虚高。反转诅咒("A 是 B" 学了但 "B 是 A" 不会)暴露了泛化的脆弱。你给模型做 RLHF、做思维链、做少样本学习,它表现变好了——但这是真正的新能力,还是只是把预训练里已经有的知识" elicited"出来

以前的解决方案是在评测端做文章:出越来越难的题(GPQA、Humanity's Last Exam、MATH-B),确保模型没见过。但这只是间接控制——你不知道训练数据里到底有没有相关内容,只是赌"这道题足够新"。

LittleLearner 的思路完全反过来:不控制评测,控制训练

你把模型关进一间"小学教室",只让它看 K-5 的内容。现在你知道它没见过二次方程、没见过量子力学、没见过微积分符号。任何在 Beyond-K-5 任务上的表现,都只能是真正的泛化真正的推理,而不是记忆的回放。

这就像研究儿童认知发展时,你需要一群" controlled exposure"的孩子——你知道他们看过什么书、上过什么课——而不是从街上随便拉一群人然后猜他们学过什么。

六层过滤网:怎么筛出"只有小学内容"的语料

把"K-5 内容"从海量网页文本中筛出来,比想象中难得多。论文设计了一个六阶段管道,核心原则是精度优先于召回——宁可漏掉一些 K-5 内容,也不能让 Beyond-K-5 的内容混进来。

第一层:Age-of-Acquisition(习得年龄)预过滤。 用一个心理学数据库,记录每个英语单词人类通常几岁学会。如果一段文本里超过 5% 的词是 12 岁以上才学的,整段丢弃。10% 的词不在数据库里?用词频回归补上——低频词通常晚学。

第二层:LLM-as-Judge 标注 + 分类器训练。 用 Gemini Flash 给一批样本打"这是几年级内容"的标签(全量标注要 4600 万美元,所以只标注一小批),然后训练两个分类器:轻量级 FastText 做初筛,贵但准的 ModernBERT 做精筛。

第三层:符号过滤。 正则匹配数学符号——∑、∫、∂、二次方程表达式——任何匹配直接丢弃。这一步只去掉了 0.1% 的文档,但精确地切掉了数学公式的尾巴。

第四层:频率采样。 找出那些"在 Beyond-K-5 文本里出现频率远高于 K-5"的词,从候选文档里剔除包含这些词的。因为模型能从稀疏出现中学到事实知识,所以宁可多删。

第五、六层:验证。 在 CommonCoreText(CCSS 对齐的教材)和 WeeBit(外部分级语料)两个独立数据集上验证。结果:Beyond-K-5 文档保留率接近 0%,K-5 文档保留率 35-42%——漏掉了不少好内容,但边界足够干净

这个管道本身就是一个工程作品。它不是在"选好内容",而是在"画一条硬边界"——边界内可以有噪音,边界外不能有泄漏。

三道干预,三道失败

LittleLearner 训练好之后,作者做了三个实验来回答同一个问题:能不能让模型突破 K-5 的边界?

实验一:加大模型规模

把 LittleLearner 从 0.6B → 1.3B → 5B 参数,看更大的模型能不能"举一反三"到 Beyond-K-5。

结果:在 K-5 范围内,规模帮助明显;在 Beyond-K-5,规模毫无作用。 5B 模型和 0.6B 模型在八年级数学题上的表现一样差。

但有一个有趣的副发现:0.6B 的 LittleLearner 在 K-5 数学上打败了 0.6B 的 Unfiltered 模型。为什么?因为 Unfiltered 的 0.6B 模型容量太小,被高中代数、微积分等内容"分心"了,没足够容量学好小学算术。LittleLearner 的 0.6B 模型因为只见过 K-5,把全部容量都集中在小学内容上——专注打败了博学

这个"专注优势"在模型变大后消失——5B 容量足够大,Unfiltered 也能同时学好所有内容。但在小模型上,课程设计就是容量分配

实验二:强化学习后训练(SFT + GRPO)

给 LittleLearner 做 SFT + GRPO 后训练,看 RL 能不能让它学会 Beyond-K-5 的推理。

这里有一个精妙的实验设计:他们给 LittleLearner 做了两种后训练——一种只用 K-5 数据,一种用 Beyond-K-5 数据。如果 RL 真的能"教模型新能力",那用 Beyond-K-5 数据训练的 LittleLearner 应该能在 Beyond-K-5 任务上有显著提升。

结果:两种后训练在 Beyond-K-5 上都没有显著提升。即使用 Beyond-K-5 数据做 GRPO,模型也学不会——因为它缺乏理解这些数据所需的预训练基础。

这直接回答了当前 AI 领域一个热门争论:RL 训练带来的能力提升,到底是"新学到的"还是"预训练里已经有的被激发出来的"? LittleLearner 的答案是后者。当预训练里完全没有相关内容时,RL 无法无中生有。

实验三:上下文学习(ICL)

给 LittleLearner 几个 Beyond-K-5 的例题和解答,看它能不能"照葫芦画瓢"。

结果:few-shot 在 K-5 有轻微提升,在 Beyond-K-5 完全无效。 模型的输出格式确实被引导得更像例题(回答变短了),但推理能力没有提升

更有趣的是:给模型文字解释(而不是例题)完全没效果——模型的回答连格式都不变。这说明模型不是"不理解例题",而是缺乏执行相关推理的基础表示

预训练就是命运

三个实验指向同一个结论:

> 预训练分布设定了能力天花板。规模、RL、ICL 这三种标准干预手段,都只能在天花板下面放大能力,不能把天花板顶上去。

这不是一个"负面结果",而是一个极其有价值的的基础发现。它意味着:

1. 当前所有"后训练提升能力"的叙事都需要重新审视。 如果模型在 RL 后表现变好,很可能不是"学会了新能力",而是"预训练里已有的能力被激发"。LittleLearner 提供了一个干净的实验环境来区分这两种情况。

2. 数据决定论得到了最严格的验证。 以前我们说"数据很重要",但无法排除"也许是架构/规模/训练技巧的问题"。LittleLearner 控制了所有其他变量,只改变训练数据的范围——结果能力边界精确地跟随数据边界。

3. "涌现"的神秘感被进一步消解。 如果模型在某个任务上"突然会了",很可能不是涌现,而是预训练数据里本来就有相关内容。LittleLearner 让"涌现"这个概念变得可证伪。

模型不像孩子学数学

一个意外的发现:LittleLearner 的能力结构不遵循人类课程顺序。

人类课程里,"一位数除法"是"多位数除法"的前置技能——先学简单的,再学难的。但 LittleLearner 在"多位数除法"上的表现比"一位数除法"更好。

这说明模型的学习机制和人类根本不同。人类通过"前置技能搭建脚手架"来学习,模型通过"统计模式匹配"来学习。对模型来说,"多位数除法"的文本可能在训练数据里更常见,或者它的模式更容易被 transformer 注意力机制捕捉——这和人类认知发展路径完全不同。

这个发现对教育科学也有启发:我们不能假设 AI 的学习路径和人类一样。 用人类课程来控制模型的知识边界是合理的(因为课程是一个已知的、可验证的边界),但不能用人类学习理论来预测模型的能力结构。

0.6B 的小模型悖论

最让我着迷的发现是 0.6B LittleLearner 打败 0.6B Unfiltered 的现象。

一个只见过小学内容的 6 亿参数模型,在小学数学上打败了一个见过所有内容的 6 亿参数模型。原因很简单:容量有限时,博学就是分心。

这让我想到一个类比:你给一个刚上小学的孩子同时塞小学课本、高中代数、大学微积分,他可能连小学算术都学不好——不是因为他笨,而是因为容量被分散了。先让他专注学好小学内容,反而能打下更扎实的基础。

当然,这个类比不能推太远——5B 模型就没有这个现象了,容量足够大时可以同时学好所有内容。但在资源受限场景下(比如端侧小模型、嵌入式设备),课程设计就是隐形的容量放大器

一个干净的实验场

LittleLearner 的真正价值不在于它是一个"更好的模型"——它显然不是。它的价值在于它是一个干净的实验场

以前你想研究"RL 能不能产生真正的发现",你面对的是一个预训练数据不透明的模型——你不知道某个能力是 RL 新学的还是预训练里早就有的。现在你有了 LittleLearner,你知道它只见过 K-5 内容,任何在 Beyond-K-5 上的能力提升都只能是 RL 的功劳。

论文最后列了几个探索方向,最让我兴奋的是:

  • RL 的真正发现能力:让 LittleLearner 在 Beyond-K-5 数学上做 RL,如果它真的学会了二次方程——这是真正的"机器发现",不是预训练的回放。
  • 持续学习:教已经训练好的 LittleLearner 新内容(比如负数),观察表示如何变化、旧知识是否被干扰。
  • 人机对比:用同样的教材教模型和孩子,看谁学得快、谁犯的错更像对方。
这些实验在普通大模型上根本无法做——因为你不知道"模型已经学过什么"。LittleLearner 把这个不确定性消除了。

我的思考:预训练的"宪法地位"

LittleLearner 让我想到一个政治学类比:预训练是宪法,后训练是法律,ICL 是行政命令。

宪法画定了什么可能、什么不可能。法律在宪法框架内细化规则。行政命令在法律框架内执行具体政策。你不能用行政命令突破宪法——你得修宪。

在 LittleLearner 的实验里:

  • 预训练(宪法):画定了 K-5 的能力边界
  • 后训练/RL(法律):在 K-5 内放大能力,但无法突破到 Beyond-K-5
  • ICL(行政命令):微调行为格式,不改变能力本质
这个类比不完美——预训练不是不可修改的,持续学习可以"修宪"。但它捕捉了一个重要直觉:能力的基础在预训练,后训练只能在这个基础上做工程优化。

这对 AI 工程师意味着什么?如果你想让模型在某个领域有"真正的新能力"——不是格式更漂亮、不是回答更流畅,而是能解决它本来解决不了的问题——你需要回到预训练,看数据里有没有相关内容。RL 和 prompt engineering 都是在预训练画好的格子里跳舞。

LittleLearner 给了这个直觉一个实验证据。

诚实地说

这篇论文有一个我特别欣赏的品质:诚实

作者没有夸大 LittleLearner 的能力,没有声称它"接近"正常模型。他们明确说 5B 规模可能不足以展现某些涌现行为(比如 ICL 在更大模型上可能更有效)。他们承认 K-5 的边界不是完美的(0.05% 的 Beyond-K-5 内容泄漏)。他们把"三种干预都失败"称为"starting point"而不是"negative result"。

这种诚实在当前 AI 论文里稀缺。太多论文把"在 benchmark 上提升了 2 分"包装成"突破性进展"。LittleLearner 反过来——它告诉你"这三条路走不通",然后说"但这条路本身值得走,因为它告诉我们哪里是墙"。

薛定谔的猫是一只两张脸的猫。这不是一个聪明的回答,但它是一个诚实的回答。模型不知道,而且它知道自己不知道。

在一个充斥着"幻觉"和"过度自信"的 AI 时代,这种诚实本身就是一种贡献。

---

论文:LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure arXiv:https://arxiv.org/abs/2608.13545 HTML 版本:https://arxiv.org/html/2608.13545 作者:Li Fanfei, Zeller Jana, Prada-Corral Manuel 等 机构:图宾根大学、马克斯·普朗克智能系统研究所 模型规模:5B 参数(Qwen3 架构) 训练数据:LittleCurriculum,88B token,K-5 课程过滤 训练资源:8× NVIDIA B200 GPU,100 小时

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens