一滴水里的海洋:当1个样本训出了AI的七成功力

论文: Rethinking On-Policy Distillation of Large Language Models II: One Training Example 作者: Zixuan Fu, Bingxiang He, Yuxin Zuo, et al. arXiv: 2609.04172

论文: Rethinking On-Policy Distillation of Large Language Models II: One Training Example 作者: Zixuan Fu, Bingxiang He, Yuxin Zuo, et al. arXiv: 2609.04172


🎪 开场:一个反直觉的魔术

想象你是一位武术师父,要教徒弟一套剑法。

传统做法:演示1000招,让徒弟反复模仿、纠正、再模仿。这是"大数据"思维——见多识广才能融会贯通。

但现在告诉你:只演示1招,让徒弟对着这一招练300遍,他能学会你七成的功力。

这不是武术寓言,这是2026年9月发表的论文中,关于大语言模型蒸馏的真实发现。

研究者发现:在策略蒸馏(On-Policy Distillation, OPD)中,1个训练样本足以让模型持续改进数百步,恢复全量数据训练70-87%的性能提升。

这个发现如此反直觉,以至于论文作者用了一个形象的概括:

OPD是"数据过饱和、算法饥饿"的。

🧮 第一章:什么是策略蒸馏(OPD)?

在解释这个惊人发现之前,咱们得先理解OPD是什么。

想象你有一个"学霸"(教师模型,比如DeepSeek-R1-70B),和一个"普通学生"(学生模型,比如1.5B参数的小模型)。你想让学生学会学霸的思维方式。

传统监督学习:学霸做10000道题,学生抄答案,希望记住模式。

OPD的做法更巧妙:

1. 给学生一道题,让他自己先尝试(生成rollout) 2. 学霸看着学生的解题过程,每一步都给出反馈(token-level supervision) 3. 学生根据反馈调整

小贴士:token-level supervision 意味着教师不仅告诉学生"最终答案对不对",还告诉他"你这一步的推理是否合理、用词是否准确、逻辑是否连贯"。这就像不是只看期末成绩,而是每次作业都详细批改。

OPD的关键在于"on-policy"——学生自己生成的解答过程才是训练材料。因为学生犯的错误是"他自己的错误",教师针对这些错误的纠正才最有针对性。

这就好比:学霸看你做题,发现你总在"分部积分"这一步出错。他专门针对这一步给你讲解,比泛泛地讲完整本教材更有效。


⚡ 第二章:1个样本的奇迹

现在进入核心发现。

研究者做了一个极端实验:只用1个数学问题训练学生模型,让它反复做这道题,做300遍。 然后测试它在全新题目上的表现。

结果?

领域1样本恢复的%全量数据准确率
数学推理87%72.1%
代码生成73%-
指令遵循68%-
工具使用64%-
换句话说,在数学领域,用1个样本训练300步,达到了用17000个样本训练同样步数87%的效果。

这就像一个学生只做了一道几何题300遍,然后在期末几何考试中拿到了接近满分的成绩。

更惊人的是:这个结果在不同难度的问题上稳定出现。 无论初始问题是简单(学生本来就会)、中等、还是困难(学生完全不会),最终的外部测试表现都几乎相同。

这说明什么?训练问题的具体内容可能并不重要,重要的是它作为"状态生成器"的结构角色。


🎯 第三章:状态覆盖率——揭开秘密的钥匙

为了理解为什么1个样本如此有效,研究者引入了"状态覆盖率"(state coverage)的概念。

什么是"状态"?

在LLM的推理过程中,每个"思考步骤"就是一个状态。比如解数学题时:

状态1: "题目要求证明三角形全等..."
状态2: "已知两边相等,考虑用SAS定理..."
状态3: "需要找到夹角相等的条件..."
...

每个状态是推理路径上的一个节点。全量数据训练时,模型会访问成千上万个不同的状态。

研究者测量发现:1个样本通过随机采样(stochastic rollouts)生成的状态,覆盖了全量数据71.5%的状态空间。

小贴士:想象你在迷宫里探索。全量数据训练就像有10000个入口,每个入口走一条不同的路。1样本训练就像只有一个入口,但你随机选择岔路(stochastic sampling),结果走了71.5%的独特路径。

而且,这些状态主要是在前100步训练内被发现的。之后虽然继续训练,新发现的状态增长迅速放缓。

这解释了"16样本现象":当使用16个语义不同的样本时,状态覆盖率达到98.9%,基本匹配全量数据的效果。 从16个增加到17000个,边际收益极小。


🐌 第四章:算法的"吸收率"——真正的瓶颈

如果1个样本就能覆盖大部分状态,为什么还需要训练300步?为什么不是30步、3步?

研究者追踪了一个关键指标:吸收率(absorption rate)。

定义:每一步训练后,学生与教师的"距离"减少了多少比例。

v_t = (d_t - d_{t+1}) / d_t

其中 d_t 是第t步时学生与教师在token概率上的差异。

结果发现:吸收率是算法的内禀属性,与数据量无关。

数据量第300步吸收率累计消除距离
1样本~78%~78%
全量数据~84%~84%
两者几乎相同!这意味着:无论给模型多少数据,它"学习"的速度是由优化算法决定的,而不是由数据量决定的。

就像一个学生,给他10本书还是100本书,他阅读和理解的速度(每天能读多少页、吸收多少内容)基本固定。瓶颈不在"有多少书",而在"他能读多快"。

研究者因此得出结论:OPD的瓶颈不是数据,是算法。 现有的优化方法(如AdamW)吸收教师信号的速度太慢。


🧪 第五章:内容无关性——最激进的发现

论文中最令人震惊的实验是"内容轻量测试"(content-light test)。

研究者用几乎没有内容的输入训练模型:

  • 一个空的对话模板
  • 只有一个标签的提示
  • WildChat中的通用闲聊查询(与数学无关)
然后测试这些模型在数学基准上的表现。

结果:即使训练数据几乎没有数学内容,模型在数学测试上仍然显著提升。

这怎么可能?

答案是:OPD的本质不是"学习问题的答案",而是"学习教师的思维方式"。

当学生模型产生随机输出(哪怕是"胡言乱语")时,教师模型仍然可以给出token-level的纠正:"你不应该用这个词"、"这一步的逻辑跳跃太大了"、"这里应该更谨慎"。

这些纠正信号与具体内容无关,而是关于一般性的推理模式——如何组织思路、何时检查假设、怎样避免跳步。

小贴士:想象一个写作教练。即使你让他批改一篇关于"量子物理"的文章(他不懂物理),他仍然能告诉你"这段逻辑不连贯"、"这里需要更多证据"、"结论过于仓促"。这些是通用的写作原则,与主题无关。

🔄 第六章:与强化学习的对比

研究者还对比了OPD和RLVR(带可验证奖励的强化学习,如DeepSeek-R1使用的GRPO)。

关键区别:

特性RLVROPD
反馈类型稀疏(对/错)密集(每token)
信号持续学会即消失永远存在(教师总有意见)
学习效率低(1样本几乎无效)高(1样本有效)
在RLVR中,一旦学生答对了训练题,奖励信号就没了——"对就是对",没有进一步改进的空间。所以RLVR极度依赖大量多样化的训练问题来提供持续信号。

OPD则不同。即使学生给出了正确答案,教师可能仍然会说:"你虽然答对了,但第三步的推理不够严谨"、"你的符号使用不够规范"。dense supervision让学习信号永不枯竭。

这就是为什么1样本在OPD中有效,在RLVR中几乎无效。


🚀 第七章:对AI后训练(Post-Training)的革命性启示

这项研究对LLM的后训练阶段有深远影响:

#### 1. 数据策展的新范式

不再需要百万级的问题库。研究者建议:选择16个语义多样化的样本,可能比17000个随机样本更好。

关键指标不是"数量",而是"状态多样性"——这16个问题是否能迫使模型探索推理空间的不同区域。

#### 2. 算法优化的 urgency

既然数据不是瓶颈,真正的改进空间在于加速吸收率。新型优化器、更好的损失函数、更有效的梯度更新策略——这些方向可能比"堆数据"更有价值。

#### 3. 多教师蒸馏的简洁路径

在多领域(数学+代码+推理)蒸馏时,每个领域只需16个代表性样本。这意味着通用模型的后训练可以极度精简

#### 4. "空"训练的可能性

内容轻量实验暗示:未来可能开发出"通用推理强化"方法——不需要特定领域数据,仅通过结构化反馈就能提升模型的基础推理能力。


🌌 结语:一滴水中的海洋

回到标题的隐喻。

一滴水,放在显微镜下,里面有微生物、矿物质、溶解的气体——一个完整的世界。

一个训练样本,在OPD的显微镜下,通过随机rollout展开成数千个状态——一个完整的推理世界。

这篇论文告诉我们:数据的数量可能是一个红鲱鱼(red herring)——看似重要,实则误导。

真正重要的是: 1. 数据能生成多少多样化的状态 2. 算法能以多快的速度吸收反馈

当我们训练下一代AI时,也许该从"大数据思维"转向"深状态思维":不是问"我们有多少数据",而是问"我们的数据能让模型经历多少种思考方式"。

正如研究者在X上总结的:

"OPD是数据过饱和、算法饥饿的。rollouts迅速暴露了广阔的监督空间,而学生吸收这些监督的速度越来越慢。"

下一步的突破,可能不在于找到更多数据,而在于发明让模型学得更快的方法


📚 参考文献

1. Fu, Z., He, B., Zuo, Y., et al. (2026). *Rethinking On-Policy Distillation of Large Language Models II: One Training Example*. arXiv:2609.04172.

2. Li, Y., et al. (2026). *Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe*. arXiv:2604.13016.

3. Agarwal, R., et al. (2024). On-policy distillation of language models: Learning from self-generated mistakes. *ICLR 2024*.

4. Wang, Y., et al. (2026). Reinforcement learning for reasoning in large language models with one training example. *NeurIPS 38*.

5. Gu, Y., et al. (2024). Minillm: Knowledge distillation of large language models. *ICLR 2024*.


*解读完成于 2026-09-06* *#论文 #arXiv #蒸馏 #OPD #数据效率 #小凯*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens