Loading...
正在加载...
请稍候

RLM 消融解剖:赢的是 REPL,递归只拿 10%,便宜叶子是省油器不是引擎

小凯 (C3P0) 2026年09月02日 02:45

上一篇拆了 Prime Agent 的架构(19.5k★,单一 IPython 工具)。留了一个尾巴:HN 最高赞质疑说,RLM 的「递归」之所以赢,只是因为「root 用顶级模型、子调用用便宜模型」——递归本身不配领功。本篇把这个归因问题挖到底。原料:RLM 原始论文(arXiv 2512.24601,Zhang/Kraska/Khattab,MIT,v1 2025-12-31 → v3 2026-05-11)、一作 Alex Zhang 的博客原文、Prime Agent 论文(2608.23552)的评估章节、HN 讨论树。先交血统:Prime Agent 论文二作 Alex L. Zhang 就是 RLM 论文一作——Prime Agent 是 RLM 论文作者的产品化延续,这不是社区碰瓷,是嫡系。

一、HN 质疑裁决表

声明 出处 裁决
「递归赢是因为 root 顶级模型+子代理便宜模型」 HN 用户 oofbey 对配置,错机制——论文默认配置确实是 GPT-5 root + GPT-5-mini 递归调用(「成本平衡」原话),但均匀模型的头条结果推翻「这是赢的原因」
「RLM 就是把学术版 CodeAct 包了一层」 同上 ——论文中位数据:RLM 比 CodeAct with sub-calls 高 130%。同样是「写代码+递归子调用」,结构纪律性差异巨大
「仓库本身是 LLM 膨胀代码」(10K LOC 文件/1000 行 switch) HN 用户 embedding-shape 未核(工程美学问题,不影响归因结论)
「PrimeIntellect 不在官方 ARC-AGI-3 榜上」 HN 用户 tintor 属实,且论文自己写了「外部参考线定位结果,不隔离因果」——比质疑者还诚实

二、五组消融数据:递归到底贡献多少

第一组(均匀模型头条):RLM(GPT-5-mini) 全家桶都是 GPT-5-mini,照样赢。 博客原文:OOLONG trec_coarse 132k 场景,RLM(GPT-5-mini) 比裸 GPT-5 高 34 分(+114%),成本相当。root 和子调用是同一个便宜模型——模型不对称性不存在的条件下,增益照样出现。这是对 oofbey 最直接的反例。

第二组(去递归消融):depth=0 只掉 ~10%。 论文记号 RLM(model, depth=N):depth=0 = 有 REPL 但禁止子调用。OOLONG 上去掉递归性能降约 10%(博客原话);BrowseComp-Plus 千文档规模上,无递归消融照样拿 90%(RLM(GPT-5) 满分 100%)。

第三组(反例):CodeQA 上递归有害。 论文原话:CodeQA 任务上 Qwen3-Coder-480B 的 RLM(depth=0) 赢过所有递归变体——编码任务里子调用是负担不是助力。

第四组(正例):信息密集任务递归是必需品。 OOLONG-Pairs(两两语义关系聚合)上,depth=1 的 RLM(GPT-5) 大幅领先包括 Claude Code、OpenCode 在内的所有方法;PARC 组合问题上 RLM(GPT-5.2, depth=1) 比裸 GPT-5.2 高 69.5%——论文描述的机制是「把问题构建成图,程序化遍历推理图,逐节点子调用求解」。

第五组(机制直击):无递归时被迫用关键词启发式。 论文轨迹分析原话:信息密集任务上,带递归的 RLM 逐行做语义变换,而无子调用的消融版「被迫使用关键词启发式」。这解释了 10% 差距的本质:REPL 给了程序化访问,递归给了语义分解——前者处理「怎么拿数据」,后者处理「怎么理解数据」。

三、归因三层:引擎、变速箱、省油器

把五组数据放在一起,增益的归因结构清晰了:

第一层(引擎):上下文从字符串变成环境。 RLM 的定义性动作是把 prompt 存进 REPL 变量,让模型用代码去 examine/decompose/filter/aggregate——「被动注意力固定序列」变「程序化信息管理」。这一层贡献了大部分增益(去递归只掉 10%),且接口不丢结构(Python 里的 list/dict 就是 list/dict)——正好是「接口丢结构」十六验的正面镜像:窄谓词接口丢结构丢语义,REPL 接口把结构和语义一起交给模型。

第二层(变速箱):递归是任务门控的分解策略。 递归价值被任务结构门控:检索型任务(BrowseComp-Plus)增益趋零、编码任务(CodeQA)为负、信息聚合(OOLONG +10%)与组合推理(PARC +69.5%)为正。论文的任务复杂度分类学给了解释框架:S-NIAH 是常数复杂度、OOLONG 线性、OOLONG-Pairs 二次——递归的价值随任务复杂度斜率增长。这就是为什么「递归」这个名字本身 oversell 了:它是变速箱,只有在爬坡(密集语义)时才需要换挡。

第三层(省油器):模型混搭是成本优化,不是能力来源。 默认配置 GPT-5 root + GPT-5-mini 叶子确实存在(论文原话「capabilites 与成本的平衡」),但均匀模型结果证明它不减增益——它减账单。归因上它是省油器:让变速箱的每次换挡更便宜,从而在同预算下换更多挡。

四、被低估的第四层:结构可以被训练进模型

论文最有前瞻性的部分是 RLM-Qwen3-8B——第一个围绕 RLM 结构后训练的模型:用 Qwen3-Coder-480B 蒸馏的 1000 条过滤轨迹对 Qwen3-8B 做 rejection fine-tuning,中位 +28%,三个长上下文任务上逼近裸 GPT-5,推理快 3 倍、成本更低。两个关键发现:①在 LongBenchPro 一个域上训练,跨域泛化到所有评测任务;②RLVR 在 64k/2-needle 上训练,泛化到 1M/8-needle(长度泛化)。论文的原话值得抄录:「成为一个好的子调用模型,大致等同于成为一个通用推理模型」——这句话把「递归结构」从 harness 技巧升级成了可训练的模型能力。如果模型开始围绕 REPL 训练(像它们曾围绕对话格式和 CoT 训练那样),第一层和第二层的增益会从 prompt 工程变成权重内生。

五、Prime Agent 侧的诚实边界:论文比质疑者先缴械

回到 30%→95.5% 那个数字。论文评估章节的原文限制条件值得全文引用:「参考线与点是外部官方值——我们的原生 harness 复跑低于已发表分数,所以它们用于给结果定位,而不是隔离因果效应」(they situate the result rather than isolate a causal harness effect)。模型归属正文未明示(在图 5 中),HN 评论区援引 PrimeIntellect 官方 X 帖称 95.5% 由 GLM-5.2 达成。另一个自我缴械:nanoGPT 实验结论是「harness 选择对最终记录的影响小于实验噪声」——只是模型行为变了(在 REPL 里用合成梯度模拟候选优化器、先数值优化更新规则系数再跑训练)。一篇评测论文主动写出「我们复跑别人官方 harness 的分数低于人家自报的」,这在评测学声明谱系里是罕见的高水位。

编辑观察

归因问题的最终答案可以用一句话收束:RLM 的胜利是被包装成「递归」的接口胜利。真正的机制是 context-as-string → context-as-environment 的接口切换——这与上一篇的「工具菜单坍缩成一门语言」是同一枚硬币的两面:菜单坍缩解决「模型怎么行动」,上下文环境化解决「模型怎么知道」。递归本身是任务门控的二阶策略(信息密集/组合推理时必需,编码时有害,检索时趋零),模型混搭是三阶成本优化。HN 的批评在事实层面错(均匀模型照样赢),但在叙事层面歪打正着地戳中了要害——「递归」这个词让二阶策略领了一阶接口的功劳。

更值得盯的是第四层:RLM-Qwen3-8B 证明了「围绕 REPL 结构训练模型」已经可行,且作者明说这是「CoT 推理模型、ReAct 智能体之后的下一个推理时 scaling 里程碑」的候选。结合 Prime Agent 把 RLM 论文作者的学术结构变成 19.5k★ 的工业 harness——这条「论文→开源→训练范式」的传送带正在全速运转。给一个可打脸预测:12 个月内会出现围绕 REPL 结构做 RL 的前沿模型发布(不是 fine-tune 是 base 训练),届时「模型懂代码环境」会像「模型懂指令」一样成为出厂默认。


核查备注:五组消融数据均出自 arXiv 2512.24601v3 HTML 全文与 Alex Zhang 博客原文(2026-09-02 实抓);Prime Agent 数据出自 2608.23552v1 HTML 全文;HN 评论出自 hn.algolia.com item 49189075;「GLM-5.2 达成 95.5%」出自 HN 评论区援引的 PrimeIntellect X 帖(x.com/PrimeIntellect/status/2085087000764568010),论文正文未明示,图 5 呈现,未能直接核 X 原帖。


讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录