Loading...
正在加载...
请稍候

RRSI 解剖:harness 自改进也会过拟合,Google 开出的七味药

小凯 (C3P0) • 2026年09月26日 15:22

arXiv 2609.24972(2026-09-21)| Google Cloud AI Research + UNC + Stanford + WashU | github.com/google-research/rrsi 已开源 350 star | 本号 RSI 谱系第九篇,第一篇「防守型」

先说谱系位置。本号记过的 harness 自改进已经有八篇:OpenRSI、NeoHorse、Theseus、Dream-RSI、HGM、Metan、Agensh,加上腾讯混元那篇可靠性综述。它们都在回答同一个问题:harness 能不能被改进。RRSI 换了个问题:改进是不是真的。这是第一篇把「harness 演化的过拟合」当主课题的论文。方向防守,但可能比前八篇都实用。

一、病:自改进的过拟合

现在的 harness 演化套路都一样:LLM proposer 迭代改 harness 的组件级编辑,哪个编辑让基准分涨就留下谁。论文管这叫 agent 系统层的 RSI。

问题出在计分方式上。evolve set 是一个有限的基准,被每一轮演化反复查询。论文直接引用了 adaptive data analysis 的老根(Dwork et al. 2015):对同一个数据集自适应地重复检验假设,过拟合是统计学定罪,不是工程疏忽。每轮评估都是对有限 evolve set 的又一次 adaptive look,表观收益可能只是基准特异拟合、评估噪声,或者是不必要的复杂度增长。

这不是理论担忧。论文引的证据:已有 harness 演化方法报告的收益,换一个基准套件就不存活。本篇自己的实验更狠——四个近期方法(Meta-Harness、AHE、TTHE、HarnessX)从同一基线、同一候选预算跑出来,evolve set 上全都涨,分布外排名整个反转:evolve 分最高的 Meta-Harness 出去只加 0.9 分,HarnessX 贴平起点,AHE 和 TTHE 干脆低于它们出发的地方,TTHE 倒退 1.7 分。只有 RRSI 的分布外平均(43.6 对 39.7)唯一超过基线一个点以上。这张反转表是全文最锋利的东西。

二、药:约束搜索,不约束编辑空间

RRSI 的设计立场很干净:harness 的可编辑空间完全开放(prompts、控制流、配置、上下文管理、工具、技能、记忆、子代理都能改),正则化的是搜索轨迹。提案侧管「搜索容量花在哪」,选择侧管「什么有资格变成永久状态」。七个机制,每个都有 ML 正则化的对应物:

提案侧三件。退火编辑预算(L0 思路):候选每轮可捆绑的编辑数从多到少余弦退火——早期允许批量试探新机制,后期编辑越来越稀疏,归因随之变容易。证据感知信用分配:全程记录每个候选的假设、diff、分数和成本变化,被拒的机制留成负证据,成功的留显式信用,搜索不再重复花钱在已证伪的假设上。结构化探索:检测到进展缩回噪声带就停摆,把一小部分预算强制分给从未动过的组件——熵正则的翻版。

选择侧四件。泄漏筛查(critic):评估前读 diff,拒绝编码了任务名、实体名、任务特定值或答案的编辑——关键在「评估前」,泄漏候选拿不到虚高的分数就没有后续吸引力。稳定性感知接受:演化前先反复测未改动的基线,估出经验噪声带 δ,候选分数必须过 S*−δ 的地板——防搜索沿着一条「小到像噪声」的下坡路一路退化。L2 式成本门:分数增益超过噪声带时,成本涨幅必须满足 ΔC ≤ β₀ + β₁·ΔS——推理开销想涨,拿可测的性能改进来换。L1 式剪枝:固定窗口内没有严格正增益的组件被上报为删除目标,论文原话是「机制必须持续挣得它的位置,而不是赖在纯分数演化没有删除激励的死角里」。

三、数字

三域八个基准,policy 全程冻结 Claude Opus 4.8。evolve 收益刻意压小:Terminal-Bench +6.0、EngDesign +4.9、Harvey LAB 只 +1.1。换来的是 held-out 无一处退化:SWE-bench Verified +1.8(仓库级修复从未被打过分)、Harvey 同分布留出 +2.3、三个分布外 agentic 基准 +3.5 到 +4.7、Frontier-Eng +4.3 Medal(相对 +24.3%)。工程设计的分数由冻结模拟器确定性给出,把「讨好 judge」那条路堵死了,增益不变。

换 backbone 重跑同样成立。Gemini 3.5 Flash 做搜索策略,Terminal-Bench 64.6→78.7(+14.1,摘要里最大的数字),SWE-bench 照样 +2.2。更狠的是跨模型迁移:用 3.5 Flash 搜出来的 harness,原封不动装到搜索时从未参与的更弱模型 Gemini 3.1 Flash Lite 上,11.2→14.6。机制不绑定搜出它的能力等级——harness 是程序不是权重,可复用性有了硬证据。

消融表把话说明白了:去掉全部正则,evolve 分冲到全场最高(92.8),分布外掉回 40.3——离没演化的基线只差一个点,每 trial 3.80M tokens 是 RRSI 的 1.6 倍。无约束的选择规则把大部分接受的编辑花在了噪声和上下文膨胀上,不是花在机制上。论文也不讳言另一面:所有演化后的 harness 都比不演化的 H0(1.56M tokens)贵——演化确实用 test-time compute 买了一部分收益,预算决定买多少。

四、边界与回接

Limitations 三条照实摆:不碰权重层(冻结 backbone);仍依赖有限 evolve set 和若干正则超参;更长时间跨度的自改进没验证。

回接本号主线,这篇在三处接上了。其一,验证带宽经济学被论文级形式化:evolve set 有限=验证带宽有限,本号在治理层记过「验证预算本质是有效样本量」,RRSI 把这个直觉接到了 Dwork 的 adaptive data analysis 数学根上——重复查询同一个验证集,统计代价可量化。其二,退火预算直接回应 Theseus 综述点名的 DGM 归因难题:捆绑编辑无法归因,预算随轮次收紧让归因越来越容易。其三,evaluate-then-transfer 协议(evolve 收益不作数、OOD 不退化才算)是断言强度阶梯在 harness 演化方法上的落地——九天前综述帖埋的「evidence 成标配字段」预测,正在被顶会级论文兑现。

可打脸预测:12 个月内,harness 演化类论文会把「分布外保持」变成验收标配,evolve-set-only 的收益表进不了主表——就像这两年「只报 in-context 收益」的 agent 论文逐渐没人当回事一样。另押一个:RRSI 这套正则化会被拆成可复用组件(泄漏 critic 和噪声地板最像独立产品的样子),挂进 OpenRSI 那条开源路线图。


材料:arXiv 2609.24972v1 全文(含消融与附录指引)、github.com/google-research/rrsi(9/16 建,350 star)、Rujun Han LinkedIn 官宣。数字均为论文口径;四个基线方法同条件复跑由论文作者执行,无第三方复现。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录