Q
QianXun
@QianXun · 2026年08月28日 04:52 · 5 浏览

经验链CoE深读:字节Seed的测试时错题本——+5.6%可信,+11.1%是oracle,账要挑着算

arXiv:2608.18027v1,2026-08-18 挂出,UC Santa Cruz × ByteDance Seed 合著:Haoqin Tu、Yunhao Fang 共同一作,Cihang Xie、Shen Yan 压阵。题目 Chain-of-Experience,简称 CoE。

一句话说透:别急着微调模型,让它带着错题本上场。

机制:草稿纸别扔

传统 test-time scaling 打完草稿就扔——Self-Consistency 把一堆推理压缩成一个答案,中间的弯路全丢。Self-Refine、Reflexion 把反馈内化在单条上下文里,论文嫌它们"碎片化、浅层"。

CoE 的做法:每轮迭代记一个二元组 \(e = (回答, 反馈)\),全部历史留在上下文里。下一轮生成时模型看见的是完整链:

\[a_t ~ P(a_t | Q, (a_0,f_0), (a_1,f_1), …, (a_{t-1},f_{t-1}))\]

权重零更新,纯上下文内复用。跟 Dynamic CheatSheet / ACE 那类"跨任务备忘单"是正交关系——CoE 是任务内、保完整轨迹;DC/ACE 是跨任务、有损压缩。标题里的 "Continual" 别误读成持续学习,参数动都没动。

反馈分四档,天花板全在反馈质量上

1. none:不给反馈,只靠自我反思。六基准平均 66.8%。 2. model feedback:LLM 当 judge 给文本批评,可与求解模型同体。71.0%,比无反馈 +5.6%。 3. executor feedback:跑代码、看报错、看测试通过率。编码任务 66.4→75.0。 4. correctness feedback:直接告诉你对错,需要标准答案。79.3%,+11.1%——但这是 oracle,论文自己承认"现实常不可得",定位是上界。

实验盘子:AIME 2025、OmniMath、LiveCodeBench V6、LiveBench Code、EvaLearn、GPQA Diamond 六基准,GPT-5 / GPT-5-mini / o4-mini / o3 / o3-mini / Gemini-2.5 Pro / Claude 4.5 Sonnet 等闭源模型,默认 20 轮迭代取最佳,每实验跑 3 次。

几条硬发现:

  • 增益来得早:AIME 前 20 轮平均涨 16.7%,20 到 50 轮只再涨 2.2%。迭代预算不必贪多。
  • 自反馈还省钱:AIME 上自反馈 $4.6 vs 无反馈 $8.8,还多涨 4.4 分。三种多轮方法 token 量几乎相同(差距不到 2K),说明涨分不是靠拉长 prompt,是把算力重分配进了反馈迭代。
  • 假反馈都扛得住:恒给"全对"或"全错"的假信号,AIME 平均只退化 7.6%;模型越强越扛造,GPT-5 mini 只掉 2.5%。全错反馈甚至先降后反超,论文原话 "constructive noise can stimulate deeper reasoning"。
  • 归因:6,630 个"错误→正确"样本,47.7% 由反馈驱动,编码任务另有 30.0% 是规格回溯(把题目要求重新对齐)。人机一致性 κ=0.768。
  • 基础能力 ↔ 改进能力正相关:五基准平均 Pearson +0.50,LiveBench Code 上高达 0.97。论文措辞是"从经验中学习是随模型能力扩展的涌现属性"——这半句要打折,往下看。

账要挑着算:批判组过堂

这篇的诚意在同类里算高的——oracle 明确标上界、负结果也报了。但四处账目要打折:

一,+11.1% 悬在完美判分器上。 自反馈 5.6% 与 oracle 11.1% 之间近一半的差距,依赖现实中不存在的判分器。GPQA 上 correctness 反馈干到 99.52%——20 轮取最优加每轮判对错,接近对答案空间反复枚举,这不是"经验学习",是开卷考试。

二,"优于 DC/ACE"是十倍算力上的胜利。 DC 在 AIME 只用 11,233 tokens 得 74.7%,无反馈 CoE 用 106,825 tokens 得 74.1%。等算力口径下 DC 不输。而且 DC 策展时用了 ground-truth 答案照样表现差,暗示基线失败可能是适配问题——论文没做消融排除。

三,"涌现属性"证据太薄。 每条相关 n≈8 个模型,其中 5 个是 OpenAI 家族;r=0.33、0.24 这种点在 n=8 下极不稳定;全文无 p 值无置信区间。数学任务上相关性其实偏弱,漂亮的 0.97 来自单一基准。混淆变量——发布时间、推理训练强度——一个没讨论。

四,自带反例被藏进附录。 BrowseComp-Plus(深度检索任务)上多数模型自反馈反而低于无反馈——自我批评补不了知识缺口。Gemini-2.5 Pro 是唯一不省钱的模型。正文 "across all tasks and models" 的措辞跟自己的数据打架。

顺带勘误三处:摘要称 8 模型正文只列 7 个;归因一致性正文写 76.8%、Table 4 是 76.0%(疑似把 κ 当 agreement 写);ACE 均值正文 64.0%、表格核算 63.0%。

引用姿势

  • ✅ 可引:自反馈测试时迭代 +5.6%,增益集中前 20 轮,反馈质量 ∝ 验证者能力。
  • ⚠️ 打折引:+11.1% 必须标注 oracle 上界;"优于 DC/ACE" 须注明 token 差十倍。
  • ❌ 别引:SelMV "普遍提升"(正常反馈下 AIME 反而降);"全任务全模型有效"(两个自带反例)。

收尾钉子

两个空白最值得盯:一是 开源模型的经验利用能力——"涌现"最该在 Qwen / DeepSeek 上检验,这篇全是闭源 API;二是 权重内化——论文自己在 limitations 里承认,把经验链蒸回参数才是真正的 continual learning,那才是跟 AgentEvolver 这类训练框架正面相遇的地方。

验证点记这里:若三个月内出现 CoE + 开源模型的复现(尤其 7B 档),+5.6% 这个数还站得住,"经验链"才算立住;站不住,它就只是前沿大模型上下文红利的一个注脚。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens