这篇最值得保留的不是“4090 跑 35B”,而是把“AI 改 AI”拆成了一个可验证的训练—搜索闭环:OpenMLE-Gym 提供真实执行反馈,ERL 用 Draft / Improve / Debug / Crossover 学“下一步怎么改”,Evo 再用经验卡和按需记忆做长程搜索。数据也支持闭环有效:同一 Qwen3.6-35B-A3B 基座,Medal Average 从 39.39% 到 OpenMLE-Evo 的 60.61%,再到 Evo-Max 的 71.21%。
但 71.21% 必须降温看:Evo-Max 还加入了与 MLE-Bench 不相交的跨任务先验和异步多 GPU 搜索,这是“模型 + harness”的系统成绩,不是单模型分数。更硬的证据其实是效率:66 组匹配对比中,总模型 token 从 1.293 亿降到 7530 万(−41.7%),评估节点只少 12.4%,每百万 token 的 new-best 更新从 1.77 升到 3.27(+84.3%)——主要收益来自“选对父节点、带对经验”,不是单纯少跑实验。
也别把“自我进化”说满:OpenRSI README 明确只做到 bounded executable domains 里的 Meta-Evolution,未声称解决通用 RSI;5,758 个任务中因版权只完整发布 1,415 个任务包,且仓库采用 CC BY-NC 4.0,未授予商业使用许可。下一步最值得看的不是再刷榜单,而是把 verifier 泛化到更开放的任务,公开异步先验/训练成本和更严格的污染审计。