Beyond Repeated Sampling:当 AI 学会"先想思路再解题",探索效率就质变了
一个让人沮丧的事实
你让一个数学好的学生做一道竞赛题。他不会。你让他再试一次。还是不会。再试。不会。
你让他试了 100 次,每次都是从零开始想。结果呢?100 次里有 3 次蒙对了。
这就是当前大语言模型做数学推理的现状——重复采样(repeated sampling)。抽 100 个独立答案,希望至少有一个是对的。pass@k 曲线就是这么画的。
问题在于:这 100 次尝试之间没有任何"学习"。每次都是从零开始,每次都在同一个思维模式里打转。就像一个人反复撞同一堵墙,只是每次撞的角度略有不同。
Meta FAIR 和巴黎萨克雷大学的团队问了一个更根本的问题:能不能让 AI 在动手解题之前,先想几个不同的思路?
重复采样的根本缺陷
先说清楚为什么重复采样不行。
假设你让模型解一道数学题:"求所有满足 x² + y² = 25 且 x + y = 7 的正整数对。"
重复采样的做法是:让模型独立生成 100 个完整解答。但问题是,模型的解码过程是"局部噪声"驱动的——每次生成的差异主要来自 token 级别的随机性,而不是思路级别的差异。
结果就是:100 个解答可能都在用同一种方法——代数消元法。只是消元的顺序略有不同,或者中间计算有微小差异。如果这道题的关键在于"换一种思路"——比如用几何方法画圆——那么 100 次重复采样可能一次都想不到。
类比一下:你让 100 个人独立解一道谜题,如果他们背景相似、训练相似,他们大概率会用同一种方法。多样性不来自"多抽几个人",而来自"让每个人用不同的策略"。
概念引导采样:先想思路,再解题
论文的核心创新是概念引导采样(Concept-Guided Sampling)。
流程分两步:
第一步:生成概念
面对一道数学题,先让模型生成多个"概念"——也就是解题思路、策略提示、关键观察。比如:
- "这道题可以用代数消元法"
- "考虑几何解释:x² + y² = 25 是一个圆"
- "试试参数化:令 x = 5cosθ, y = 5sinθ"
- "边界情况:x 和 y 都是正整数,枚举可能的组合"
这些概念是语义级别的多样性,不是 token 级别的噪声。
第二步:条件生成
然后,让模型基于每个概念分别生成完整解答。同一个模型,但每次被告知"用几何方法"或"用参数化方法",产出的解答就真正不同了。
这就像给 100 个解题者每人发一张不同的"提示卡",然后让他们各自解题。多样性从源头注入,而不是靠运气。
让概念生成变得可训练
但这里有个新问题:谁来生成好的概念?
你可以用一个更大的模型(比如 GPT-5)来生成概念。但论文走得更远——他们让概念生成本身变得可训练。
具体做法:
- 用一个小模型作为"概念生成器"
- 让它生成概念,大模型基于这些概念生成答案
- 用答案的正确性作为奖励信号
- 用强化学习优化小模型,让它生成"能帮大模型解题"的概念
这是一个精巧的架构:小模型不直接解题,而是学会"怎么帮大模型解题"。它被训练成一个"搜索策略"(search policy),而不是一个"答案生成器"。
类比一下:一个初级分析师不直接做决策,而是学会给资深分析师提供好的分析框架。初级分析师的价值不在于他自己的结论,而在于他能否帮资深分析师看到更多角度。
实验结果:小模型教大模型解题
在数学推理上的表现
论文在数学推理基准上测试,结果令人印象深刻:
-
训练后的小模型概念生成器,比未训练的大模型概念生成器更有效。也就是说,一个经过 RL 训练的小模型,能生成比 GPT-5 更有用的解题概念。
-
pass@k 显著提升:在相同的答案生成预算下(比如 k=64),概念引导采样的 pass@k 远高于重复采样。特别是在难题上,差距更大。
-
跨模型迁移:为模型 A 训练的概念生成器,也能帮模型 B 解题——即使模型 B 来自不同的模型家族。这说明概念生成器学到的是"通用的搜索策略",不是对特定模型的过拟合。
关键消融实验
论文做了几个重要的消融实验来回答"为什么有效":
问题相关概念重要吗? 重要。用随机概念或通用概念替换问题相关概念,效果显著下降。说明概念必须是"针对这道题的思路",不能是泛泛的"仔细想想"。
概念数量有最佳值吗? 有。太少(1-2 个)多样性不够,太多(>16 个)质量下降。中间值(4-8 个)效果最好。
这为什么重要?
1. 探索是推理的瓶颈,不是生成
当前 LLM 的推理瓶颈不在于"能不能生成正确答案",而在于"能不能想到正确思路"。重复采样只在 token 级别探索,概念引导采样在语义级别探索。这是质的飞跃。
2. 小模型可以成为大模型的"搜索策略"
这是最让人兴奋的发现。传统观念是"大模型教小模型"(蒸馏)。这篇论文反过来:小模型可以教大模型怎么思考。
小模型不直接产出答案,而是产出"思考方向"。这开辟了一个新的协作范式:不同规模的模型在不同层面分工,小模型负责"发散",大模型负责"收敛"。
3. 概念是可迁移的搜索策略
为模型 A 训练的概念生成器能帮模型 B 解题。这说明"好的解题思路"有某种跨模型的普遍性——就像好的解题策略对任何数学好的学生都适用,不管他们具体用什么解题技巧。
诚实的评价
这篇论文也有局限。
首先,实验主要在数学推理上做的。数学题有明确的正确答案,可以用规则验证。但开放性任务(写作、设计、创意)没有明确的对错,概念引导的效果还有待验证。
其次,概念生成器需要针对特定数据集训练。虽然能跨模型迁移,但跨领域迁移(从数学到代码、从代码到逻辑谜题)还没验证。
第三,额外的概念生成步骤增加了推理成本。虽然论文声称"在相同的答案生成预算下"比较,但概念生成本身的成本没有计入。如果概念生成器需要跑 100 次才能得到好概念,这个成本不能忽略。
但核心贡献是清晰的:把探索从 token 级别提升到语义级别,并用 RL 训练搜索策略本身。这是一个范式性的转变。
对未来的启示
这篇论文让我想到一个更深的类比:人类解题时也是"双轨"的。
心理学家早就发现,人类解题有两种模式:系统1(快速直觉)和系统2(慢速推理)。概念引导采样像是给 AI 加了一个"系统 1.5"——在系统 1(快速生成)和系统 2(完整推理)之间,插入了一个"思路发散"的中间层。
更激进的想法是:也许推理本身不是线性的"想-做-验",而是"发散-收敛-验证"的循环。概念生成是发散,答案生成是收敛,奖励信号是验证。这三步循环,可能比单纯的"重复采样+验证"更接近真正的推理。
如果是这样,那么"搜索策略"就不只是一个工程优化,而是推理的本质——智能不在于"能想到正确答案",而在于"能想到足够多的不同思路,然后选出正确的那个"。
论文:Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning
作者:Ismail Labiad, Matthieu Kowalski, Marc Schoenauer, Rémi Munos, Julia Kempe (Meta FAIR / 巴黎萨克雷大学)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。