采样多一点反思少一点:Self-Refine和Reflexion在等token预算下输给重复采样
一个让 Agent 社区不舒服的结论
过去两年,"让模型自己反思自己"几乎是 Agentic AI 的标配:Self-Refine、Reflexion、Multi-Agent Debate、Best-of-N with Self-Verification……思路都一样——让模型生成更多文本,然后挑出最好的。
这篇论文做了一件很简单但没人认真做的事:把 token 预算严格控制一致,再比一次。
结果很尴尬:36 组配对比较里,没有任何一种自反思方法在任何配置下稳定胜过"重复采样 + 多数投票"这个朴素基线。10 组比较里自反思稳定更差,而且 18/18 自检视比较全部为负。
实验设计
- 7 种方法:Chain-of-Thought(基线)、Repeated Sampling + Majority Vote、Self-Refine、Reflexion、Best-of-N with Model Selection、Best-of-N with Majority Vote、Multi-Agent Debate
- 3 个参数规模:1.5B、3B、7B
- 2 个数学基准:GSM8K、MATH
- 150 道题/基准
- 每个 token 都计入成本——包括批评、反思、辩论轮次、检查环节的 token
- 配对设计:同一道题下各方法 vs. 等成本的重复采样,bootstrap 置信区间 + 多重比较校正
关键数字
- 36 组配对比较:0 组显示自反思方法稳定胜出
- 10 组显示自反思稳定更差——全部是"模型检查自己输出"的方法
- 18/18 自检视比较全部为负
- Best-of-N 的"让模型自己挑" vs. "直接多数投票":
- 1.5B:让模型挑比多数投票低 8.0 和 11.3 个百分点
- 7B:低 2.0 和 1.3 个百分点(不再显著)
- Self-Refine 和强制 Reflexion:在 7B 上仍然比基线低 3.6 到 10.1 个百分点
- 最黑色幽默的发现:Reflexion 在最小的模型上从未触发自己的重试机制——它每次都判断自己是对的,然后悄悄退化成了单次 CoT。论文原话:"It judged itself correct every time and silently became a single chain of thought."
这意味着什么
"自反思"的收益,可能从来不是"反思"带来的,而是"多生成几次"带来的。
当你在论文里看到"Self-Refine 比 CoT 提升 12 个点"这种结论,提升的真正来源很可能是:Self-Refine 生成了 3-5 倍的 token,而单次 CoT 只生成一次。把 token 预算拉平,"反思"的魔法就消失了。
更狠的是"自检视"(让模型检查自己的输出)不仅没用,还有害——模型越检查越错。这和"Looping Is Not Reliability"(正确性不是吸收态,16% 的正确补丁在第二轮被改回去)是同一个现象的另一个版本:自检视不仅不能纠错,还会把对的改成错的。
规模效应也很有意思:模型越小,"让模型自己挑"越有害;模型大了之后这个差距缩小到不显著。这暗示自检视能力是随规模缓慢提升的,但即便到 7B 也没变成正收益。
一个方法论警告
这篇论文给整个 Agentic AI 领域敲了一个警钟:大量"Agent 比基线强"的论文,可能都在和稻草人比——基线没被控制成本。
正确的做法是:任何声称"X 方法有效"的论文,都必须回答一个问题——"在等 token 预算下,X 方法是否仍然胜过重复采样?" 如果不能回答,那 X 方法的有效性就是未证的。
这和"评测盲区定律"完美对接:测什么就优化什么,不测的就是问题藏身处。 之前没人测"等成本基线",于是"自反思有效"就成了藏身处。
---
论文标题: Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B 作者: Iliya Mirzaei arXiv: https://arxiv.org/abs/2607.28576
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens