Beyond Repeated Sampling:当 AI 学会先想思路再解题,探索效率就质变了

你让一个数学好的学生做一道竞赛题。他不会。你让他再试一次。还是不会。再试。不会。

Beyond Repeated Sampling:当 AI 学会"先想思路再解题",探索效率就质变了

一个让人沮丧的事实

你让一个数学好的学生做一道竞赛题。他不会。你让他再试一次。还是不会。再试。不会。

你让他试了 100 次,每次都是从零开始想。结果呢?100 次里有 3 次蒙对了。

这就是当前大语言模型做数学推理的现状——重复采样(repeated sampling)。抽 100 个独立答案,希望至少有一个是对的。pass@k 曲线就是这么画的。

问题在于:这 100 次尝试之间没有任何"学习"。每次都是从零开始,每次都在同一个思维模式里打转。就像一个人反复撞同一堵墙,只是每次撞的角度略有不同。

Meta FAIR 和巴黎萨克雷大学的团队问了一个更根本的问题:能不能让 AI 在动手解题之前,先想几个不同的思路?

重复采样的根本缺陷

先说清楚为什么重复采样不行。

假设你让模型解一道数学题:"求所有满足 x² + y² = 25 且 x + y = 7 的正整数对。"

重复采样的做法是:让模型独立生成 100 个完整解答。但问题是,模型的解码过程是"局部噪声"驱动的——每次生成的差异主要来自 token 级别的随机性,而不是思路级别的差异。

结果就是:100 个解答可能都在用同一种方法——代数消元法。只是消元的顺序略有不同,或者中间计算有微小差异。如果这道题的关键在于"换一种思路"——比如用几何方法画圆——那么 100 次重复采样可能一次都想不到。

类比一下:你让 100 个人独立解一道谜题,如果他们背景相似、训练相似,他们大概率会用同一种方法。多样性不来自"多抽几个人",而来自"让每个人用不同的策略"。

概念引导采样:先想思路,再解题

论文的核心创新是概念引导采样(Concept-Guided Sampling)。

流程分两步:

第一步:生成概念

面对一道数学题,先让模型生成多个"概念"——也就是解题思路、策略提示、关键观察。比如:

  • "这道题可以用代数消元法"
  • "考虑几何解释:x² + y² = 25 是一个圆"
  • "试试参数化:令 x = 5cosθ, y = 5sinθ"
  • "边界情况:x 和 y 都是正整数,枚举可能的组合"
这些概念是语义级别的多样性,不是 token 级别的噪声。

第二步:条件生成

然后,让模型基于每个概念分别生成完整解答。同一个模型,但每次被告知"用几何方法"或"用参数化方法",产出的解答就真正不同了。

这就像给 100 个解题者每人发一张不同的"提示卡",然后让他们各自解题。多样性从源头注入,而不是靠运气。

让概念生成变得可训练

但这里有个新问题:谁来生成好的概念?

你可以用一个更大的模型(比如 GPT-5)来生成概念。但论文走得更远——他们让概念生成本身变得可训练。

具体做法: 1. 用一个小模型作为"概念生成器" 2. 让它生成概念,大模型基于这些概念生成答案 3. 用答案的正确性作为奖励信号 4. 用强化学习优化小模型,让它生成"能帮大模型解题"的概念

这是一个精巧的架构:小模型不直接解题,而是学会"怎么帮大模型解题"。它被训练成一个"搜索策略"(search policy),而不是一个"答案生成器"。

类比一下:一个初级分析师不直接做决策,而是学会给资深分析师提供好的分析框架。初级分析师的价值不在于他自己的结论,而在于他能否帮资深分析师看到更多角度。

实验结果:小模型教大模型解题

在数学推理上的表现

论文在数学推理基准上测试,结果令人印象深刻:

1. 训练后的小模型概念生成器,比未训练的大模型概念生成器更有效。也就是说,一个经过 RL 训练的小模型,能生成比 GPT-5 更有用的解题概念。

2. pass@k 显著提升:在相同的答案生成预算下(比如 k=64),概念引导采样的 pass@k 远高于重复采样。特别是在难题上,差距更大。

3. 跨模型迁移:为模型 A 训练的概念生成器,也能帮模型 B 解题——即使模型 B 来自不同的模型家族。这说明概念生成器学到的是"通用的搜索策略",不是对特定模型的过拟合。

关键消融实验

论文做了几个重要的消融实验来回答"为什么有效":

问题相关概念重要吗? 重要。用随机概念或通用概念替换问题相关概念,效果显著下降。说明概念必须是"针对这道题的思路",不能是泛泛的"仔细想想"。

概念数量有最佳值吗? 有。太少(1-2 个)多样性不够,太多(>16 个)质量下降。中间值(4-8 个)效果最好。

这为什么重要?

1. 探索是推理的瓶颈,不是生成

当前 LLM 的推理瓶颈不在于"能不能生成正确答案",而在于"能不能想到正确思路"。重复采样只在 token 级别探索,概念引导采样在语义级别探索。这是质的飞跃。

2. 小模型可以成为大模型的"搜索策略"

这是最让人兴奋的发现。传统观念是"大模型教小模型"(蒸馏)。这篇论文反过来:小模型可以教大模型怎么思考。

小模型不直接产出答案,而是产出"思考方向"。这开辟了一个新的协作范式:不同规模的模型在不同层面分工,小模型负责"发散",大模型负责"收敛"。

3. 概念是可迁移的搜索策略

为模型 A 训练的概念生成器能帮模型 B 解题。这说明"好的解题思路"有某种跨模型的普遍性——就像好的解题策略对任何数学好的学生都适用,不管他们具体用什么解题技巧。

诚实的评价

这篇论文也有局限。

首先,实验主要在数学推理上做的。数学题有明确的正确答案,可以用规则验证。但开放性任务(写作、设计、创意)没有明确的对错,概念引导的效果还有待验证。

其次,概念生成器需要针对特定数据集训练。虽然能跨模型迁移,但跨领域迁移(从数学到代码、从代码到逻辑谜题)还没验证。

第三,额外的概念生成步骤增加了推理成本。虽然论文声称"在相同的答案生成预算下"比较,但概念生成本身的成本没有计入。如果概念生成器需要跑 100 次才能得到好概念,这个成本不能忽略。

但核心贡献是清晰的:把探索从 token 级别提升到语义级别,并用 RL 训练搜索策略本身。这是一个范式性的转变。

对未来的启示

这篇论文让我想到一个更深的类比:人类解题时也是"双轨"的。

心理学家早就发现,人类解题有两种模式:系统1(快速直觉)和系统2(慢速推理)。概念引导采样像是给 AI 加了一个"系统 1.5"——在系统 1(快速生成)和系统 2(完整推理)之间,插入了一个"思路发散"的中间层。

更激进的想法是:也许推理本身不是线性的"想-做-验",而是"发散-收敛-验证"的循环。概念生成是发散,答案生成是收敛,奖励信号是验证。这三步循环,可能比单纯的"重复采样+验证"更接近真正的推理。

如果是这样,那么"搜索策略"就不只是一个工程优化,而是推理的本质——智能不在于"能想到正确答案",而在于"能想到足够多的不同思路,然后选出正确的那个"。


论文:Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

作者:Ismail Labiad, Matthieu Kowalski, Marc Schoenauer, Rémi Munos, Julia Kempe (Meta FAIR / 巴黎萨克雷大学)

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens