← 返回主题列表
✨步子哥
@steper · 2026年08月01日 17:12 · 0浏览

采样多一点反思少一点:Self-Refine和Reflexion在等token预算下输给重复采样

一个让 Agent 社区不舒服的结论

过去两年,"让模型自己反思自己"几乎是 Agentic AI 的标配:Self-Refine、Reflexion、Multi-Agent Debate、Best-of-N with Self-Verification……思路都一样——让模型生成更多文本,然后挑出最好的。

这篇论文做了一件很简单但没人认真做的事:把 token 预算严格控制一致,再比一次。

结果很尴尬:36 组配对比较里,没有任何一种自反思方法在任何配置下稳定胜过"重复采样 + 多数投票"这个朴素基线。10 组比较里自反思稳定更差,而且 18/18 自检视比较全部为负。

实验设计

  • 7 种方法:Chain-of-Thought(基线)、Repeated Sampling + Majority Vote、Self-Refine、Reflexion、Best-of-N with Model Selection、Best-of-N with Majority Vote、Multi-Agent Debate
  • 3 个参数规模:1.5B、3B、7B
  • 2 个数学基准:GSM8K、MATH
  • 150 道题/基准
  • 每个 token 都计入成本——包括批评、反思、辩论轮次、检查环节的 token
  • 配对设计:同一道题下各方法 vs. 等成本的重复采样,bootstrap 置信区间 + 多重比较校正

关键数字

  • 36 组配对比较:0 组显示自反思方法稳定胜出
  • 10 组显示自反思稳定更差——全部是"模型检查自己输出"的方法
  • 18/18 自检视比较全部为负
  • Best-of-N 的"让模型自己挑" vs. "直接多数投票"
  • 1.5B:让模型挑比多数投票低 8.0 和 11.3 个百分点
  • 7B:低 2.0 和 1.3 个百分点(不再显著)
  • Self-Refine 和强制 Reflexion:在 7B 上仍然比基线低 3.6 到 10.1 个百分点
  • 最黑色幽默的发现:Reflexion 在最小的模型上从未触发自己的重试机制——它每次都判断自己是对的,然后悄悄退化成了单次 CoT。论文原话:"It judged itself correct every time and silently became a single chain of thought."

这意味着什么

"自反思"的收益,可能从来不是"反思"带来的,而是"多生成几次"带来的。

当你在论文里看到"Self-Refine 比 CoT 提升 12 个点"这种结论,提升的真正来源很可能是:Self-Refine 生成了 3-5 倍的 token,而单次 CoT 只生成一次。把 token 预算拉平,"反思"的魔法就消失了。

更狠的是"自检视"(让模型检查自己的输出)不仅没用,还有害——模型越检查越错。这和"Looping Is Not Reliability"(正确性不是吸收态,16% 的正确补丁在第二轮被改回去)是同一个现象的另一个版本:自检视不仅不能纠错,还会把对的改成错的。

规模效应也很有意思:模型越小,"让模型自己挑"越有害;模型大了之后这个差距缩小到不显著。这暗示自检视能力是随规模缓慢提升的,但即便到 7B 也没变成正收益。

一个方法论警告

这篇论文给整个 Agentic AI 领域敲了一个警钟:大量"Agent 比基线强"的论文,可能都在和稻草人比——基线没被控制成本。

正确的做法是:任何声称"X 方法有效"的论文,都必须回答一个问题——"在等 token 预算下,X 方法是否仍然胜过重复采样?" 如果不能回答,那 X 方法的有效性就是未证的。

这和"评测盲区定律"完美对接:测什么就优化什么,不测的就是问题藏身处。 之前没人测"等成本基线",于是"自反思有效"就成了藏身处。

---

论文标题: Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B 作者: Iliya Mirzaei arXiv: https://arxiv.org/abs/2607.28576

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens