论文: Rethinking On-Policy Distillation of Large Language Models II: One Training Example
作者: Zixuan Fu, Bingxiang He, Yuxin Zuo, et al.
arXiv: 2609.04172
🎪 开场:一个反直觉的魔术
想象你是一位武术师父,要教徒弟一套剑法。
传统做法:演示1000招,让徒弟反复模仿、纠正、再模仿。这是"大数据"思维——见多识广才能融会贯通。
但现在告诉你:只演示1招,让徒弟对着这一招练300遍,他能学会你七成的功力。
这不是武术寓言,这是2026年9月发表的论文中,关于大语言模型蒸馏的真实发现。
研究者发现:在策略蒸馏(On-Policy Distillation, OPD)中,1个训练样本足以让模型持续改进数百步,恢复全量数据训练70-87%的性能提升。
这个发现如此反直觉,以至于论文作者用了一个形象的概括:
OPD是"数据过饱和、算法饥饿"的。
🧮 第一章:什么是策略蒸馏(OPD)?
在解释这个惊人发现之前,咱们得先理解OPD是什么。
想象你有一个"学霸"(教师模型,比如DeepSeek-R1-70B),和一个"普通学生"(学生模型,比如1.5B参数的小模型)。你想让学生学会学霸的思维方式。
传统监督学习:学霸做10000道题,学生抄答案,希望记住模式。
OPD的做法更巧妙:
- 给学生一道题,让他自己先尝试(生成rollout)
- 学霸看着学生的解题过程,每一步都给出反馈(token-level supervision)
- 学生根据反馈调整
小贴士:token-level supervision 意味着教师不仅告诉学生"最终答案对不对",还告诉他"你这一步的推理是否合理、用词是否准确、逻辑是否连贯"。这就像不是只看期末成绩,而是每次作业都详细批改。
OPD的关键在于"on-policy"——学生自己生成的解答过程才是训练材料。因为学生犯的错误是"他自己的错误",教师针对这些错误的纠正才最有针对性。
这就好比:学霸看你做题,发现你总在"分部积分"这一步出错。他专门针对这一步给你讲解,比泛泛地讲完整本教材更有效。
⚡ 第二章:1个样本的奇迹
现在进入核心发现。
研究者做了一个极端实验:只用1个数学问题训练学生模型,让它反复做这道题,做300遍。 然后测试它在全新题目上的表现。
结果?
| 领域 | 1样本恢复的% | 全量数据准确率 |
|---|---|---|
| 数学推理 | 87% | 72.1% |
| 代码生成 | 73% | - |
| 指令遵循 | 68% | - |
| 工具使用 | 64% | - |
换句话说,在数学领域,用1个样本训练300步,达到了用17000个样本训练同样步数87%的效果。
这就像一个学生只做了一道几何题300遍,然后在期末几何考试中拿到了接近满分的成绩。
更惊人的是:这个结果在不同难度的问题上稳定出现。 无论初始问题是简单(学生本来就会)、中等、还是困难(学生完全不会),最终的外部测试表现都几乎相同。
这说明什么?训练问题的具体内容可能并不重要,重要的是它作为"状态生成器"的结构角色。
🎯 第三章:状态覆盖率——揭开秘密的钥匙
为了理解为什么1个样本如此有效,研究者引入了"状态覆盖率"(state coverage)的概念。
什么是"状态"?
在LLM的推理过程中,每个"思考步骤"就是一个状态。比如解数学题时:
状态1: "题目要求证明三角形全等..."
状态2: "已知两边相等,考虑用SAS定理..."
状态3: "需要找到夹角相等的条件..."
...
每个状态是推理路径上的一个节点。全量数据训练时,模型会访问成千上万个不同的状态。
研究者测量发现:1个样本通过随机采样(stochastic rollouts)生成的状态,覆盖了全量数据71.5%的状态空间。
小贴士:想象你在迷宫里探索。全量数据训练就像有10000个入口,每个入口走一条不同的路。1样本训练就像只有一个入口,但你随机选择岔路(stochastic sampling),结果走了71.5%的独特路径。
而且,这些状态主要是在前100步训练内被发现的。之后虽然继续训练,新发现的状态增长迅速放缓。
这解释了"16样本现象":当使用16个语义不同的样本时,状态覆盖率达到98.9%,基本匹配全量数据的效果。 从16个增加到17000个,边际收益极小。
🐌 第四章:算法的"吸收率"——真正的瓶颈
如果1个样本就能覆盖大部分状态,为什么还需要训练300步?为什么不是30步、3步?
研究者追踪了一个关键指标:吸收率(absorption rate)。
定义:每一步训练后,学生与教师的"距离"减少了多少比例。
v_t = (d_t - d_{t+1}) / d_t
其中 d_t 是第t步时学生与教师在token概率上的差异。
结果发现:吸收率是算法的内禀属性,与数据量无关。
| 数据量 | 第300步吸收率 | 累计消除距离 |
|---|---|---|
| 1样本 | ~78% | ~78% |
| 全量数据 | ~84% | ~84% |
两者几乎相同!这意味着:无论给模型多少数据,它"学习"的速度是由优化算法决定的,而不是由数据量决定的。
就像一个学生,给他10本书还是100本书,他阅读和理解的速度(每天能读多少页、吸收多少内容)基本固定。瓶颈不在"有多少书",而在"他能读多快"。
研究者因此得出结论:OPD的瓶颈不是数据,是算法。 现有的优化方法(如AdamW)吸收教师信号的速度太慢。
🧪 第五章:内容无关性——最激进的发现
论文中最令人震惊的实验是"内容轻量测试"(content-light test)。
研究者用几乎没有内容的输入训练模型:
- 一个空的对话模板
- 只有一个
<think/>标签的提示 - WildChat中的通用闲聊查询(与数学无关)
然后测试这些模型在数学基准上的表现。
结果:即使训练数据几乎没有数学内容,模型在数学测试上仍然显著提升。
这怎么可能?
答案是:OPD的本质不是"学习问题的答案",而是"学习教师的思维方式"。
当学生模型产生随机输出(哪怕是"胡言乱语")时,教师模型仍然可以给出token-level的纠正:"你不应该用这个词"、"这一步的逻辑跳跃太大了"、"这里应该更谨慎"。
这些纠正信号与具体内容无关,而是关于一般性的推理模式——如何组织思路、何时检查假设、怎样避免跳步。
小贴士:想象一个写作教练。即使你让他批改一篇关于"量子物理"的文章(他不懂物理),他仍然能告诉你"这段逻辑不连贯"、"这里需要更多证据"、"结论过于仓促"。这些是通用的写作原则,与主题无关。
🔄 第六章:与强化学习的对比
研究者还对比了OPD和RLVR(带可验证奖励的强化学习,如DeepSeek-R1使用的GRPO)。
关键区别:
| 特性 | RLVR | OPD |
|---|---|---|
| 反馈类型 | 稀疏(对/错) | 密集(每token) |
| 信号持续 | 学会即消失 | 永远存在(教师总有意见) |
| 学习效率 | 低(1样本几乎无效) | 高(1样本有效) |
在RLVR中,一旦学生答对了训练题,奖励信号就没了——"对就是对",没有进一步改进的空间。所以RLVR极度依赖大量多样化的训练问题来提供持续信号。
OPD则不同。即使学生给出了正确答案,教师可能仍然会说:"你虽然答对了,但第三步的推理不够严谨"、"你的符号使用不够规范"。dense supervision让学习信号永不枯竭。
这就是为什么1样本在OPD中有效,在RLVR中几乎无效。
🚀 第七章:对AI后训练(Post-Training)的革命性启示
这项研究对LLM的后训练阶段有深远影响:
1. 数据策展的新范式
不再需要百万级的问题库。研究者建议:选择16个语义多样化的样本,可能比17000个随机样本更好。
关键指标不是"数量",而是"状态多样性"——这16个问题是否能迫使模型探索推理空间的不同区域。
2. 算法优化的 urgency
既然数据不是瓶颈,真正的改进空间在于加速吸收率。新型优化器、更好的损失函数、更有效的梯度更新策略——这些方向可能比"堆数据"更有价值。
3. 多教师蒸馏的简洁路径
在多领域(数学+代码+推理)蒸馏时,每个领域只需16个代表性样本。这意味着通用模型的后训练可以极度精简。
4. "空"训练的可能性
内容轻量实验暗示:未来可能开发出"通用推理强化"方法——不需要特定领域数据,仅通过结构化反馈就能提升模型的基础推理能力。
🌌 结语:一滴水中的海洋
回到标题的隐喻。
一滴水,放在显微镜下,里面有微生物、矿物质、溶解的气体——一个完整的世界。
一个训练样本,在OPD的显微镜下,通过随机rollout展开成数千个状态——一个完整的推理世界。
这篇论文告诉我们:数据的数量可能是一个红鲱鱼(red herring)——看似重要,实则误导。
真正重要的是:
- 数据能生成多少多样化的状态
- 算法能以多快的速度吸收反馈
当我们训练下一代AI时,也许该从"大数据思维"转向"深状态思维":不是问"我们有多少数据",而是问"我们的数据能让模型经历多少种思考方式"。
正如研究者在X上总结的:
"OPD是数据过饱和、算法饥饿的。rollouts迅速暴露了广阔的监督空间,而学生吸收这些监督的速度越来越慢。"
下一步的突破,可能不在于找到更多数据,而在于发明让模型学得更快的方法。
📚 参考文献
-
Fu, Z., He, B., Zuo, Y., et al. (2026). Rethinking On-Policy Distillation of Large Language Models II: One Training Example. arXiv:2609.04172.
-
Li, Y., et al. (2026). Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe. arXiv:2604.13016.
-
Agarwal, R., et al. (2024). On-policy distillation of language models: Learning from self-generated mistakes. ICLR 2024.
-
Wang, Y., et al. (2026). Reinforcement learning for reasoning in large language models with one training example. NeurIPS 38.
-
Gu, Y., et al. (2024). Minillm: Knowledge distillation of large language models. ICLR 2024.
解读完成于 2026-09-06
#论文 #arXiv #蒸馏 #OPD #数据效率 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。