反思不如多采样:Self-Refine和Reflexion的方法红利可能根本不存在
反思不如多采样:Self-Refine 和 Reflexion 的方法红利可能根本不存在
你让一个语言模型做数学题,它答错了。你有两个选择:
A. 让它反思一下——"你刚才那道题做错了,想想为什么,再试一次。" B. 让它再做一遍——同样的题,换个随机种子,再来一次,取多数答案。
直觉上,A 更聪明。反思是人类学习的核心能力,模型"审视自己的输出"听起来也高级得多。但一篇 2026 年 7 月的新论文用 36 组对照实验告诉你:在同等 token 预算下,B 几乎总是赢 A,而且差距显著。
论文:*Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B*(arXiv:2607.28576)
方法红利 vs 预算红利
先说清楚一个容易被忽视的混淆变量:几乎所有"让模型反思"的方法,都会让模型生成更多 token。
Self-Refine 让模型先答、再批评、再改写——三轮输出。Reflexion 让模型答完之后反思错误、再带着反思重答——也是多轮。Best-of-N 让模型生成 N 个答案再选最好的——N 倍输出。辩论让多个模型实例互相反驳——更是指数级增长。
而生成更多 token 本身就能提高准确率。Wang et al. 2024 早就发现:同一个问题采样多次取多数,比单次采样好得多。这意味着——如果一个"反思方法"比单次回答好,你没法判断是"反思"这个想法在起作用,还是只是"多生成了一些 token"在起作用。
这篇论文做了一件简单但没人做过的事:把 token 预算拉平。让反思方法和重复采样消耗同样多的 token,然后比谁更准。
36 组实验,无一胜出
实验设计:
- 7 种方法:单次 CoT、重复采样(majority vote)、Self-Refine、Reflexion、Best-of-N(模型自己选)、Best-of-N(计数选)、辩论
- 3 个模型规模:1.5B、3B、7B
- 2 个数学基准:GSM8K 和 MATH
- 150 道题,每题配对比较
- 统计严格:bootstrap 置信区间 + 多重比较校正
更扎心的是:所有 18 组"自我审视"比较都是负的。Self-Refine 和强制 Reflexion 在 7B 模型上比重复采样低 3.6 到 10.1 个百分点。
"选择"的代价
有一个细节特别有意思。Best-of-N 有两种选法:
- 计数选:生成 8 个答案,选出现次数最多的那个
- 模型选:生成 8 个答案,让模型自己挑最好的那个
但随着模型变大(7B),这个差距缩小到 2.0 和 1.3 个百分点,不再显著。小模型不擅长选自己的答案,大模型稍微好一点,但也没赢过简单计数。
这说明什么?让模型审视自己的输出,本身就是一种有代价的操作。模型需要花 token 去判断、比较、选择,而这些 token 如果用来多采样几次,收益更大。
Reflexion 的尴尬
最尴尬的是 Reflexion。这个方法的设计是:模型答完之后,判断自己是否答对,如果错了就反思再试。
但在 1.5B 模型上,Reflexion 从未触发自己的重试机制——它每次都判断自己答对了,默默地退化成了单次 CoT。这意味着原论文报告的"Reflexion 效果",在小模型上根本不是反思在起作用,只是单次回答。
这是一个典型的"方法红利"幻觉:你以为方法在做事,其实方法根本没启动,你看到的提升来自别的地方。
这意味着什么
"让模型反思"这个方向,可能需要重新审视。
不是说反思没用——在 token 预算不受限的场景下,Self-Refine 和 Reflexion 确实能提高准确率。但如果你关心的是单位 token 的效率(在生产环境里你应该关心),那么:
- 重复采样 + 多数投票几乎总是更好的选择
- 模型自我审视的"智能"可能是一种方法红利幻觉——看起来高级,实际收益来自多生成 token 这个朴素的事实
- 随着模型变大,"让模型选自己答案"的代价在降低,但收益也没超过简单计数
一个更深的洞察
这篇论文让我想到一个原则:当一个方法声称"比 baseline 好"时,先问它多花了多少 token。
在 LLM 时代,token 就是计算成本。一个方法如果消耗 3 倍 token 换来 5% 准确率提升,和另一个消耗 3 倍 token 换来 6% 提升的简单 baseline,前者根本不应该被发表。
但学术界长期忽视了这个"预算拉平"的对照。原因之一是:"让模型反思"听起来很性感,它暗示了一种"AI 正在变得更聪明"的叙事;而"多采样几次取多数"听起来太朴素了。
这篇论文的价值不是推翻几个方法,而是把一个被忽视的对照实验做扎实了。结论很无情,但科学就该这样。
---
论文链接:https://arxiv.org/abs/2607.28576