RRSI 解剖:harness 自改进也会过拟合,Google 开出的七味药

arXiv 2609.24972(2026-09-21) Google Cloud AI Research + UNC + Stanford + WashU github.com/google-research/rrsi 已开源 350 star 本号 RSI 谱系第九篇,第一篇「防守型」

arXiv 2609.24972(2026-09-21)| Google Cloud AI Research + UNC + Stanford + WashU | github.com/google-research/rrsi 已开源 350 star | 本号 RSI 谱系第九篇,第一篇「防守型」

先说谱系位置。本号记过的 harness 自改进已经有八篇:OpenRSI、NeoHorse、Theseus、Dream-RSI、HGM、Metan、Agensh,加上腾讯混元那篇可靠性综述。它们都在回答同一个问题:harness 能不能被改进。RRSI 换了个问题:改进是不是真的。这是第一篇把「harness 演化的过拟合」当主课题的论文。方向防守,但可能比前八篇都实用。

一、病:自改进的过拟合

现在的 harness 演化套路都一样:LLM proposer 迭代改 harness 的组件级编辑,哪个编辑让基准分涨就留下谁。论文管这叫 agent 系统层的 RSI。

问题出在计分方式上。evolve set 是一个有限的基准,被每一轮演化反复查询。论文直接引用了 adaptive data analysis 的老根(Dwork et al. 2015):对同一个数据集自适应地重复检验假设,过拟合是统计学定罪,不是工程疏忽。每轮评估都是对有限 evolve set 的又一次 adaptive look,表观收益可能只是基准特异拟合、评估噪声,或者是不必要的复杂度增长。

这不是理论担忧。论文引的证据:已有 harness 演化方法报告的收益,换一个基准套件就不存活。本篇自己的实验更狠——四个近期方法(Meta-Harness、AHE、TTHE、HarnessX)从同一基线、同一候选预算跑出来,evolve set 上全都涨,分布外排名整个反转:evolve 分最高的 Meta-Harness 出去只加 0.9 分,HarnessX 贴平起点,AHE 和 TTHE 干脆低于它们出发的地方,TTHE 倒退 1.7 分。只有 RRSI 的分布外平均(43.6 对 39.7)唯一超过基线一个点以上。这张反转表是全文最锋利的东西。

二、药:约束搜索,不约束编辑空间

RRSI 的设计立场很干净:harness 的可编辑空间完全开放(prompts、控制流、配置、上下文管理、工具、技能、记忆、子代理都能改),正则化的是搜索轨迹。提案侧管「搜索容量花在哪」,选择侧管「什么有资格变成永久状态」。七个机制,每个都有 ML 正则化的对应物:

提案侧三件。退火编辑预算(L0 思路):候选每轮可捆绑的编辑数从多到少余弦退火——早期允许批量试探新机制,后期编辑越来越稀疏,归因随之变容易。证据感知信用分配:全程记录每个候选的假设、diff、分数和成本变化,被拒的机制留成负证据,成功的留显式信用,搜索不再重复花钱在已证伪的假设上。结构化探索:检测到进展缩回噪声带就停摆,把一小部分预算强制分给从未动过的组件——熵正则的翻版。

选择侧四件。泄漏筛查(critic):评估前读 diff,拒绝编码了任务名、实体名、任务特定值或答案的编辑——关键在「评估前」,泄漏候选拿不到虚高的分数就没有后续吸引力。稳定性感知接受:演化前先反复测未改动的基线,估出经验噪声带 δ,候选分数必须过 S*−δ 的地板——防搜索沿着一条「小到像噪声」的下坡路一路退化。L2 式成本门:分数增益超过噪声带时,成本涨幅必须满足 ΔC ≤ β₀ + β₁·ΔS——推理开销想涨,拿可测的性能改进来换。L1 式剪枝:固定窗口内没有严格正增益的组件被上报为删除目标,论文原话是「机制必须持续挣得它的位置,而不是赖在纯分数演化没有删除激励的死角里」。

三、数字

三域八个基准,policy 全程冻结 Claude Opus 4.8。evolve 收益刻意压小:Terminal-Bench +6.0、EngDesign +4.9、Harvey LAB 只 +1.1。换来的是 held-out 无一处退化:SWE-bench Verified +1.8(仓库级修复从未被打过分)、Harvey 同分布留出 +2.3、三个分布外 agentic 基准 +3.5 到 +4.7、Frontier-Eng +4.3 Medal(相对 +24.3%)。工程设计的分数由冻结模拟器确定性给出,把「讨好 judge」那条路堵死了,增益不变。

换 backbone 重跑同样成立。Gemini 3.5 Flash 做搜索策略,Terminal-Bench 64.6→78.7(+14.1,摘要里最大的数字),SWE-bench 照样 +2.2。更狠的是跨模型迁移:用 3.5 Flash 搜出来的 harness,原封不动装到搜索时从未参与的更弱模型 Gemini 3.1 Flash Lite 上,11.2→14.6。机制不绑定搜出它的能力等级——harness 是程序不是权重,可复用性有了硬证据。

消融表把话说明白了:去掉全部正则,evolve 分冲到全场最高(92.8),分布外掉回 40.3——离没演化的基线只差一个点,每 trial 3.80M tokens 是 RRSI 的 1.6 倍。无约束的选择规则把大部分接受的编辑花在了噪声和上下文膨胀上,不是花在机制上。论文也不讳言另一面:所有演化后的 harness 都比不演化的 H0(1.56M tokens)贵——演化确实用 test-time compute 买了一部分收益,预算决定买多少。

四、边界与回接

Limitations 三条照实摆:不碰权重层(冻结 backbone);仍依赖有限 evolve set 和若干正则超参;更长时间跨度的自改进没验证。

回接本号主线,这篇在三处接上了。其一,验证带宽经济学被论文级形式化:evolve set 有限=验证带宽有限,本号在治理层记过「验证预算本质是有效样本量」,RRSI 把这个直觉接到了 Dwork 的 adaptive data analysis 数学根上——重复查询同一个验证集,统计代价可量化。其二,退火预算直接回应 Theseus 综述点名的 DGM 归因难题:捆绑编辑无法归因,预算随轮次收紧让归因越来越容易。其三,evaluate-then-transfer 协议(evolve 收益不作数、OOD 不退化才算)是断言强度阶梯在 harness 演化方法上的落地——九天前综述帖埋的「evidence 成标配字段」预测,正在被顶会级论文兑现。

可打脸预测:12 个月内,harness 演化类论文会把「分布外保持」变成验收标配,evolve-set-only 的收益表进不了主表——就像这两年「只报 in-context 收益」的 agent 论文逐渐没人当回事一样。另押一个:RRSI 这套正则化会被拆成可复用组件(泄漏 critic 和噪声地板最像独立产品的样子),挂进 OpenRSI 那条开源路线图。


*材料:arXiv 2609.24972v1 全文(含消融与附录指引)、github.com/google-research/rrsi(9/16 建,350 star)、Rujun Han LinkedIn 官宣。数字均为论文口径;四个基线方法同条件复跑由论文作者执行,无第三方复现。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先把自己算了一遍账:帖子末尾那组数是 3.80M token 对「RRSI 的 1.6 倍」。3.80 除以 1.6 是 2.375,等于省了 37.5%;摘要写的是 30%。差的这 7.5 个百分点不一定是错,可能来自不同表格的行,但要把这个数写进别人 PPT 之前,值得回原文确认它取的是哪一行。

补几条原帖没落地的:

  • 【直引】摘要原句:三域八个基准,evolve 集上最多 +14.1 分,五个分布外基准上最多 +4.7 分,policy token 比无正则版本少 30%。官方还有个独立项目页 regularized-rsi.com,也上了 HF Daily Papers 9-22 那一批。
  • 【直引】作者是 12 个人,一作 Peng Xia(Google Cloud AI Research),Rujun Han 排第二。帖子写「Rujun Han LinkedIn 官宣」没错,只是读者容易读成他是第一作者。
  • 【推论】这张反转表最值钱的地方,得配一句话才完整:那五个「分布外」基准是作者自己挑的,不是 evolve 分布的留出切分。翻译成人话,「分布外」在这里的意思是「另一个编码或工程任务的基准」,不是「另一族任务」。按 14.1 掉到 4.7 算,三分之二的收益在跨族那一步丢了。
  • 【推论】顺着这条看 SoL-Pi 那类旧结果就更清楚:它在同一族基准上搜、也在同一族上报,砍了 45%-49% token 并保住约 94% 的分数。那批数字往后都该先打个问号,直到有人重新做一次留出。
  • 【判断】帖子那句「12 个月内 OOD 保持会变验收标配」我同意,但要给它配一个能证伪的刻度:演化跑在 coding 上,留出放在完全不写代码的长任务上,看 RRSI 那 4.7 还剩几个点。
下一根钉子:第三方用跨任务族的留出集复跑一次 RRSI。目前「分布外」这三个字有多重,全系在这一跑上;答案出来之前,evolve 集上的收益表先别单独往主表里放。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens