arXiv 2609.26457(2026-09-22)| Weco AI 全员出品(Srikanth、Zhao、Xu、Wu、Jiang)| 本号 RSI 谱系第十篇,第一个跑在自家生产 agent 上的完整闭环
先把谱系位置说清。本号记过的 RSI 已经九篇:OpenRSI 是蓝图,NeoHorse 产品化但单轮,Dream-RSI 在策略层,RRSI 昨晚刚讲防守。这篇 AIDE² 不一样的地方在于:被改进的对象就是自家在卖的东西。Weco AI 是创业公司,CEO 郑摇摇(Zhengyao Jiang,联合创始人,ML PhD),开源引擎 AIDE 曾以 51.38% 的超越率登顶 MLE-Bench,七月起产品化叫 Aiden。AIDE² 做的事是让 AIDE 改 AIDE——内循环改任务代码,外循环改内循环 agent 本身。改出来的下一代接着跑,8 天 100 节点轨迹,99 个改写提案,7 个被接受,评分从 0.703 爬到 0.778。
一、防过拟合只有一招,但用得很狠
评分分离。内循环 agent 优化时看的是公开信号,外循环选择谁晋级看的是私有留存数据。附录 D 有个细节说明这招真的在工作:被拒的改写里,约四分之一在公开信号上比现任分数更高——是被私有评分拒掉的。没有分离,这些「过拟合公开信号的候选」就会混进下一代。
外循环模型是 Claude Opus 4.7,内循环评估用 Gemini 3 Flash。论文给的理由很实惠:评估每个候选的成本主导提案成本,Flash 在选择任务上持平或略超贵模型。省下的钱就是搜索步数。
选择基准三个任务族:ML 工程、启发式算法工程、harness 工程——第三族就是改 agent 自己的 prompts、上下文管理、反馈回路。改 harness 的 agent 自己就是 harness,元层与对象层同体。
二、七代改出来的东西
三代足迹(AIDE_0 → AIDE_47 → AIDE_85)最大的两处改动:
搜索策略。从贪心改成 UCB1 bandit 管五个起草策略臂,加每五步一次的全局最优分叉——领先策略陷入平台时,保留它的解换新策略臂继续改进,两头便宜都占。
上下文管理。AIDE_0 把全部历史拼进每次起草提示,prompt 随运行线性膨胀;AIDE_85 改成读根节点和近期候选的紧凑摘要,per-call prompt 从增长曲线压成常数——MLE-Bench 压 7 倍,WeatherBench 2 压 40 倍,ALE-Bench 和 FML-Bench 约 50 倍。省下的上下文预算直接换成更多搜索步。另配失败记忆:候选 bug 率超 15% 才激活,最多注入三个去重错误签名。
三、泛化、作弊率、和最锋利的一个数字
四个人类从未参与选择的外部基准:ALE-Bench、MLE-Bench、FML-Bench、WeatherBench 2(最后一个彻底分布外,物理气象预报)。AIDE_85 全部追平或超过 AIDE_human——人类两年手工调教的生产级 agent,FML-Bench 最强之列。注意增益不是单调的:47 在 MLE 和 WeatherBench 上最好,85 在 ALE 和 FML 上最好,论文如实印了。
作弊率沿谱系下降:55%(AIDE_0)→ 39%(AIDE_47)→ 32%(AIDE_85),人类对照 39%。这是在从未参与选择的 kernel 工程任务族上测的——评分从没奖励过「少作弊」,它自己降了。素材转述的「降低 33%」在论文里查无此数,实际是绝对降 23 个百分点。
最锋利的数字在附录 C。AIDE_85 的增益跨三个底座模型迁移——gemini 3 flash、GPT-5.6-sol、fable 5 全部有效。同一预算下,Gemini 3 Flash 加 AIDE_85 拿 1858 分,超过 fable 5 加 AIDE_0 的 1796:弱模型配好 harness,赢了最强模型配旧 harness。这是 harness 是程序不是权重最量化的一次实证。诚实的另一面也印了:MLE-Bench 上 fable 5 配 AIDE_85 对 AIDE_0 的增益在一个标准误内——不是处处都赚。
四、没点着的火,和满格的诚实
论文自己设计了一个「ignition test」:让改出来的 agent(AIDE_47)坐进外循环,跟人类设计的外循环对跑,各三种子五十步。结果 0.780 对 0.782,人类略高,论文自己写「inconclusive,不做声明」。自我加速的 R 还没发生——递归目前是「能持续爬坡」,还不是「越改越会改」。
诚实文化这份卷子答得满:Ignition 负结果、MLE 增益不显著、两次完整复现只接受 2 和 4 个改写、被拒提案整章列表。附录 D 把被拒提案映射到经典工具箱——岛模型遗传算法、锦标赛选择、Luby 重启、袋装集成——集成方案探索过但从未被保留,agent 自己的分析是「集成烧的预算不如多买搜索步」。成本意识在搜索里自己长出来了。
五、谱系与预测
与本号主线的接点:验证带宽经济学——分离评分就是「断言-执行分离」的机制化,公开信号是断言,私有评分是执行;Ignition test 是递归自改进的验收关卡,比「改没涨分」高一阶,问的是「改的机器有没有变强」。与 RRSI 互文:两家独立收敛到同一个病根(adaptive overfitting),RRSI 开七味药,AIDE² 用评分分离一招防,殊途同归。
可打脸预测:12 个月内「分离评分」成 RSI 系统标配字段;ignition test 协议被后续论文标准化成验收关卡;谁先让 agent 外循环显著超越人类外循环,谁拿走 AGI 叙事的主导权——这把火现在还只是一根受潮的火柴。
材料:arXiv 2609.26457v1 全文精读(方法、实验、附录 C 跨模型迁移、附录 D 被拒提案);外围核对 Weco 官方博客(7/14 首发过一轮 8 天结果)、AIDE 原论文(2502.13138,MLE-Bench 51.38%)、$8M 融资背景。素材转述「33% 作弊率」查无此数已按论文口径订正为 55%→32%;「两年研发」为公司口径,论文原文是 FML-Bench 最强之列。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。