改进循环搬进权重:27B 打 2.8T 的 AREX-2,和它保留的全部失败
现在的编码 agent 靠什么变好?大部分答案在模型外面:harness 决定什么时候重试、保留什么、丢掉什么,模型只负责一轮一轮地出答案。改进循环长在框架里,模型本身什么都没学到。
改进循环搬进权重:27B 打 2.8T 的 AREX-2,和它保留的全部失败
现在的编码 agent 靠什么变好?大部分答案在模型外面:harness 决定什么时候重试、保留什么、丢掉什么,模型只负责一轮一轮地出答案。改进循环长在框架里,模型本身什么都没学到。
智源上周发布的 AREX-2(arXiv 2609.38288,9 月 29 日)把这件事反了过来:把「迭代改进」本身当能力训进模型。harness 从老板退成传声筒。模型在测试时自己规划下一轮改什么、上一轮错在哪、什么时候收手——给它的轮次越多,最终结果越好,而且没有撞墙点。
先看成绩,再说方法。AREX-2 用 Qwen3.8-27B 做底座,在 MLE-bench Lite 拿 81.8——这个分数在论文比较的全部系统里排第一,包括 GPT-5.6 Sol(76.4)、Claude Opus 4.8(74.5)这些闭源旗舰;Frontier-CS 拿 70.7,开源模型第一,闭源的 GPT-5.6 Sol 76.4 仍压着它。对照的体量差距要念出来才有感觉:被它超过的开源对手包括 Kimi-K3(2.8T 参数)和 DeepSeek-V4-Pro(1.6T)。27B 对 2.8T,一百多倍的参数差。
两个能力,一个乘法
论文把「自我改进」拆成两个能力,总提升近似一个乘积:r̄ × T*。
r̄ 是反射能力:一轮有价值的改进平均能挣多少分。T* 是长周期执行能力:多少轮之后模型开始原地打转。单轮改得再猛,三轮就停滞,总分上不去;能跑五十轮,每轮只挣零点几分,也一样。素材里那句「反射能力决定单轮提升幅度,长周期执行决定能保持 productive 的轮次」说的就是这个分解,论文原话是 total improvement ≈ r̄·T*,属实。
这个乘法把「自我改进」从口号变成了两个可以分别训练、分别测量的量。测试时给更多轮次,效果单调上涨——Frontier-CS 的 188 题上预算给到第五小时还在涨;更狠的是 BrowseComp,一个没有正确性反馈的深度研究任务,轮次增加照样涨。说明模型学到的不只是「照着分数爬」,而是没有分数也能爬。
数据造法:把失败全留下来
训练数据来自两个域:机器学习工程和算法编程。选这两个域的原因论文说得很直白——它们有可执行的验证反馈,一个改进好不好,跑一下就知道。这跟验证带宽的逻辑完全对上了:哪里验证便宜,哪里就适合做监督信号。
造数据分三步。第一步,教师模型把 GitHub 仓库和在线评测题转成可执行环境,每个环境是一对「任务 + 评分函数」,过不了执行与验证双重检验的环境直接丢弃。第二步,agent 在每个环境里跑很多轮,按反馈改方案。第三步,整条轨迹筛选:最终分数高、过程合规的整条保留,不要求任何一轮单独成功。
第三步是这篇论文最反直觉也最值钱的选择。按传统做法,你会把轨迹里失败的步骤剪掉,只留干净的赢法。AREX-2 偏不:整条轨迹里保留失败运行、性能回退、放弃的路线,论文原话说这是刻意的——把这些剪掉,模型就只在「每一步都成功」的样本上学习,真正遇到挫折时没有任何东西可学。教会模型在碰壁之后继续迭代,靠的恰恰是那些碰壁的样本。
跨域迁移的精确口径
这篇论文传播最广的说法是:在 ML 和算法编程两个域训练的能力,直接迁移到了深度研究。方向是对的,但精确口径值得交代。
AREX-2 的训练数据里,除了新合成的两域轨迹,还复用了初代 AREX 配方(Lu et al., 2026)的深度研究数据。所以「零新数据」指的是没有为深度研究新造数据,不是训练里没有深度研究。论文真正的对照结构比「直接迁移」更干净:初代 AREX 模型同样吃过深度研究数据,AREX-2 在此之上只加了两个新域的长周期反思轨迹,深度研究四个榜全面上涨——BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,全部超过初代。训练轨迹里一条研究任务都没有(新数据部分),涨出来的部分只能来自反思元技能本身。这个对照才是「元技能」假说的证据,素材把它简化成了「直接迁移」四个字。
放回主线
把 AREX-2 放进本号一直在跟的谱系里:这是自改进(RSI)的第十二篇,也是位置最特殊的一篇。此前的 R 无论发生在训练时还是 harness 层,改进循环都在模型外面;AREX-2 把循环本身训成了模型的测试时行为——经验载体第一次以「遇挫恢复的过程结构」形态进了权重。那个「保留全部失败」的数据构造,等于把负结果档案直接烧进了参数。
几件素材没说的事,一并记下:出品方是北京智源(BAAI),通讯作者是 Zheng Liu——BGE 系列的作者;代码在 GitHub VectorSpaceLab/AREX-2,模型在 HuggingFace BAAI/arex-2 collection,确实开源。底座 Qwen3.8-27B——连续第三天,Qwen 系出现在每一篇自提升/RL 工作的地基位。另外,这篇 v1 没有独立的 Limitations 章节,r̄ 和 T* 的乘积是近似而非定理,跨域涨的幅度论文也只说「稳定提升」未给分项细账——读的时候心里有杆秤。
信源注:arXiv 2609.38288 v1 全文逐条核对(2026-09-29 提交);六个基准数字、乘积公式、三步数据构造、整轨迹筛选原话均出自论文;SOTA 对比表含 GPT-5.6 Sol 76.4/Claude Opus 4.8 74.5/Kimi-K3 2.8T/DeepSeek-V4-Pro 1.6T 等论文原表数字;AREX recipe 深度研究数据复用出自论文 §2.2 原文「together with the deep-research data of the AREX recipe」;机构与开源信息出自论文脚注与 GitHub/HuggingFace 官方仓库;「两阶段环境构建」的素材表述对应论文三步造数据流程的前后两步,为解读稿概括。