OpenRSI 解剖:把「改进速率」设为优化目标——开源递归自改进全栈的第一份工程蓝图

- 仓库:FrontisAI/OpenRSI,665★/58 fork(09-14 时点),Python,CC BY-NC 4.0(非商用),1.5 个月 - 机构:Horizon Research × Frontis.AI × 清华大学;论文通讯张开颜(Kaiyan Zhang),项目负责人 Junlin Yang…

一、项目身份

  • 仓库:FrontisAI/OpenRSI,665★/58 fork(09-14 时点),Python,CC BY-NC 4.0(非商用),1.5 个月
  • 机构:Horizon Research × Frontis.AI × 清华大学;论文通讯张开颜(Kaiyan Zhang),项目负责人 Junlin Yang、Che Jiang,作者名单含周伯文(Bowen Zhou)——上海 AI Lab 主任兼 Frontis.ai 创始人(2021.12 创办)
  • 论文:《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》,07-30 v1、08-22 修订;姊妹作 NatureBench(arXiv 2606.24530)、RSI 综述(06-25,openreview);EEMA 中稿 EMNLP 2026 Main
  • 组件:OpenMLE-Gym(5,758 个质量门控可执行任务)+ OpenMLE-ERL(算子学习:SFT 26,259 样本 + RL)+ OpenMLE-Evo(长时程搜索)+ Sandbox(自托管分布式执行)

二、海关裁决表

声明核验裁决
MLE-Bench Lite 上 39.39% → 60.61%(+OpenMLE-Evo)论文表 1:Qwen3.6-35B-A3B base 39.39%±5.67 → MA1-35B 60.61%±7.73,12 GPU·h/任务,RTX 4090 限 12GB
+Evo-Max 达 71.21%,超 GPT-5.5+Codex71.21%±8.57 vs GPT-5.5+Codex 68.18%(+3.03);GPT-5.6 Sol Codex 与 Kimi K3 均为 72.73%✅ 口径准确
Evo-Max 靠堆算力?原文:异步多 GPU 并行但「总沙箱计算预算不变」(AIRA 2 启发)❌ 无堆卡,是并行化
训练数据背题?精确消息级去重 + 对所有评测基准去重;Evo-Max 蒸馏先验时排除全部 MLE-Bench 来源✅ 有防背题设计
30B 可复制?Qwen3-30B-A3B-Thinking base 34.85% → MA1-30B 53.03%(+18.18)→ +Evo-Max 66.67%
665★ 热度HN 08-03 仅 5 分 0 评,中文科技媒体 08-02 两篇(知乎「清华系反手开源」/新浪把 Jeff Dean 离职创业并题),arXiv 被引 2✅ 学术圈热、大众圈冷

三、五层解读

1. 第 0 层:改进速率本身成为优化目标

README 的加粗引语值得单独抄一遍:「OpenRSI makes the rate of improvement itself an optimization target.」 本账号的自改进栈已铺了六层——权重(Ornith)→经验(CoE)→代码(Metan)→harness 运行时(Cordis)→知识存储(Mobius)→方向感(HGM 的 CMP + HarnessOpt-Bench 的方向感评测器)。OpenRSI 不是往栈里加第七层,而是把整条栈的导数设为目标函数:每代 AI 研发要「faster, more efficient, more capable,且可验证、可归因」。它的三大官方路线里第二条原话是「World models and research taste that identify where additional compute is worth spending」——方向感层第一次写进开源基建的路线图,与 HGM 的 CMP 价值函数、HarnessOpt-Bench 的「优化能力=独立能力轴」在词汇层面会师。机制阶梯(Evolution → Self-Evolution → Meta-Evolution → RSI)与 Metan 的元深度、HGM 的自改进树同谱系,而它的自我定位很克制:「从 Meta-Evolution 起步,不声称通用 RSI 已解决」。

2. 四算子:循环的动作本身可训练

Draft / Improve / Debug / Crossover 四个原子算子,同一套动作空间既被 execution-grounded SFT+RL 训练,又被组合成推理时的长时程搜索——「训练-推理对齐」不是对齐 prompt 格式,是对齐动作原语。「循环>X」谱系(88/12 循环>工具、85% 循环>反馈类型、72/15 conditioning>code、CMP>当前分数、搜索广度>反馈深度)在此拿到结构升级版:以前比较的是「有没有循环」,现在训练的是循环里每一步怎么走。经验载体第四形态(optimizer LLM 内化优化策略)也在此拿到最完整的工程化:HarnessOpt-Bench 里优化器是通用模型在 harness 代码空间裸搜,MA1 是专为优化而生的后训练模型——「优化能力=独立能力轴」的直接产业化。

3. model–harness 2×2:HarnessOpt-Bench 的开源实践版,外加一个反转

论文做了本账号等了很久的受控消融。分布内(MLE-Bench Lite):换模型 +21.22 分(39.39→60.61),换搜索配置 +10.6 分(60.61→71.21)——模型>框架,与 HarnessOpt-Bench 的「model choice 1.8×>harness choice」同向。但 held-out(NatureBench Lite,Nature 族论文 SOTA 复现)反转:框架固定换模型 +20(50→70),模型固定换框架 +30(20→50)——跨域时 harness 的贡献更大。合理解读:后训练增益绑定训练分布,harness 增益来自搜索机制本身、更可迁移。这给「优化能力可迁移吗」补了一条边界:模型内化的优化策略是局部的,harness 结构化的搜索是全局的

4. harness 矩阵:通用搜索是公共乘数

最有信息量的表是附录那张 model–harness 矩阵:同一 OpenMLE-Evo 下,MiniMax M3 59.09%、Kimi K2.6 66.67%、Grok-4.5 65.15%、LongCat 56.06%、豆包 56.06%、DeepSeek-V4-Pro 54.55%……十来个前沿模型被同一个 harness 拉进 51-67% 的窄带,而 harness 级对照显示 OpenMLE-Evo 对 Claude Code/Codex 全面占优、对原版 AIRA-Evo 同种子同预算 53.03→60.61。GLM-5.2+Evo-Max 66.67%(Human Rank 0.8164 全场最高)但仍低于 MA1-35B+Evo-Max 的 71.21%——「专用后训练模型 × 专用 harness」的叠加打败「更大的一般模型 × 同款 harness」。harness 是公共乘数,专用模型是私有加成,两者可复合。

5. 验证带宽经济学的三处原文级呼应

其一,原文白纸黑字:「Verification cost must shape collection and training」——预算自适应 SFT 在 accepted-example 配额或执行上限即停,把预算留给稀疏成功任务(案例配额卡脖子的工程解法写进了训练管线);异步 RL 完成即入组、不等最慢作业。其二,OpenMLE-Evo 对比原版 AIRA-Evo(同种子同 12h 预算、66 个 task-run):总 token 129.3M→75.3M(-41.7%)、prompt token -50.3%,而评估节点只降 12.4%——省的是每步的贵接口调用,不是提前躺平。其三,长时程机制的定量拆解:Improve+Crossover 贡献 85% 的总验证增益,先 Debug 保可行、Crossover 存分支互补证据、Improve 再升级融合模型——「分支证据积累+结构重组」对抗「反复修同一个程序」,又是一个「重组>重试」的循环内部证据。验证集 68.18% → 测试集 71.21% 不降反升,说明长时程搜索没有过拟合验证信号。

四、诚实边界(Limitations 五条,条条是主线暗号)

论文第 8 节自认五条边界,最重的一条:「The system is better equipped to optimize solutions than to judge which ideas deserve to be pursued.」——当前信号只测「方案能不能跑、分多高」,判断不了研究方向是否有前景、可泛化、值得再投算力。这正是方向感层的缺失自认(CMP/research taste 是它自己列的下一步)。其余四条:进化系统本身仍是固定物(「把进化系统本身变成进化对象」=二阶化待做);agent 只改进外部 ML 工件、未参与改进 LLM 自身;经验卡记录大量元数据但父选择只用三因子(质量/父相对改进/方法族新颖度),大部分证据闲置;外部进化 harness 限制了模型自主行动范围。另需注意:CC BY-NC 4.0 非商用许可;Evo-Max 的经验先验来自公开竞赛工件蒸馏;665★ 无第三方独立复现报道;MLE-Bench Lite 仅 22 任务、五折方差 ±8.57 分——71.21% vs 72.73% 的「逼近 GPT-5.6 Sol」在误差棒内,口径应读作「同档」而非「超过」。

五、可打脸预测

12 个月内:①「训练-推理同构算子」被至少两个开源 agent 框架采纳(把 SFT/RL 动作空间与搜索原语统一);②NatureBench 类「Nature 族 SOTA 复现」基准成为 RSI 论文标配 held-out(已有 held-out 迁移先例);③OpenRSI 出现「进化系统本身可进化」的二阶版本(README 路线图已预告)。反向打脸:若 35B 级 AI4AI 模型一年内没被任何工业管线采用,说明 CC BY-NC + 学术验证距离商用信任还差一个数量级。


*核查备注:GitHub API(仓库元数据/贡献者/文件树)+ README 全文 + arXiv HTML 全文(2607.28568)+ HN Algolia + 中文报道两篇,2026-09-14 凌晨实抓。主表数字逐条对照论文表 1 与附录矩阵;「总预算不变」原文核实于 6.1 节。素材海关形态:论文+开源仓库双源交叉,零转述膨胀。*


暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens