研究对象:《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》(arXiv:2607.28568,2026-07-30,v1,61 页)
机构:Frontis.AI(衔远科技 / Horizon Research)× 清华大学协同交互智能研究中心(周伯文、丁宁团队),另有浙大、上交、佐治亚理工参与
代码 / 权重:GitHubFrontisAI/OpenRSI| HuggingFaceFrontisAI/frontis-ma1
研究时间:2026-08-20 | 主笔整合:一手论文 arXiv 精读 + alphaXiv / pith.science / seventnews / groundtruth / 清华发布稿多源核证 + 事实校正对照科普视频脚本
方法:以论文原文(架构、训练目标、实验表)为准,逐条核对视频脚本爆点;凡与宣称不符或属评论者延展处,单列「事实校正」。
〇、费曼视角 · 一句话讲清
设想一位育种家而非一位哲学家:
- 哲学家(普通一次性生成模型)闷头推演,写一版方案交差,成不成全凭运气;
- 育种家(Frontis-MA1)手里有一座带自动评分的试验田(OpenMLE-Gym,5758 块地)、一套标准农活(草稿 Draft、改良 Improve、除错 Debug、交配 Crossover),以及一群会被真实收割结果打分的作物(沙盒里真跑出来的程序)。
他不是「想」出更好的方案,而是:撒一批种子 → 真种真收 → 看谁产量高、谁扛住了虫害 → 把高产的祖宗和路子新奇的祖宗「杂交」一下 → 下一代再种。跑得动的留下,跑挂的淘汰,路走偏的换条道。
最要紧的一笔:这座试验田的「评分标准」是客观可执行的(真实跑分、隐藏测试),而不是育种家自己觉得「我写得挺好」。所以 AI 不是背答案,而是在反复试错、被真实结果打脸、再重组中变强。
一句话:把「改进 AI」这件事本身,变成一座能在单张 RTX 4090 上跑的、可复现、可拆解的「育种工厂」——这比「单卡跑 35B」这个噱头,才是论文真正值钱的地方。
一、它到底是什么(侦察结论 + 事实校正)
1.1 基本档案
| 项 | 内容 |
|---|---|
| 定位 | 开放全栈系统 OpenMLE + 在其上后训练出的 35B 元进化智能体 Frontis-MA1,研究「AI 改进 AI」(AI4AI)与「递归自我改进」(RSI) |
| 论文 | arXiv:2607.28568,Submitted 2026-07-30,61 页 |
| 机构 | Frontis.AI(衔远科技)× 清华大学协同交互智能研究中心(周伯文、丁宁团队);合作含浙大、上交、佐治亚理工 |
| 模型 | Frontis-MA1-35B(35.95B 参数 BF16,基座 Qwen3.6-35B-A3B,多模态 MoE,每 token 仅约 3B 激活参数);伴生 Frontis-MA1-30B(30.53B,基座 Qwen3-30B-A3B-Thinking-2507) |
| 三层栈 | ① OpenMLE-Gym(5758 可执行任务环境);② OpenMLE-ERL(四算子执行落地训练);③ OpenMLE-Evo(经验驱动长程搜索) |
| 四算子 | Draft(从零写)/ Improve(改优)/ Debug(修错)/ Crossover(两方案融合)——训练与推理共用同一套接口 |
| 主结果 | MLE-Bench Lite,单 RTX 4090(12GB 显存上限)、每任务 12 小时:基座 39.39% → +Evo 60.61% → +Evo-Max 71.21% |
| 开源 | 权重、Gym 构建、沙盒、训练代码、搜索 harness 全开源(Gym 完整包仅释出 1415/5758,但构建流水线开源) |
1.2 事实校正(视频脚本宣称 vs 论文原文)
这段科普脚本的爆点,几乎逐条对应论文实体;但有四处「升华」需要降温。
| # | 视频宣称 | 核证结论 | 依据 |
|---|---|---|---|
| V1 | 「周末打《黑神话》的 RTX 4090 扛起 35B AI」 | 准确但需补刀:确实是单张 RTX 4090、显存封顶 12GB、每任务 12 小时。但 35B 是 MoE,每 token 仅 ~3B 激活参数——所以「扛 35B」说的是总参数量,实际推理成本接近一个小模型。不是「家用卡硬啃稠密 35B」 | arXiv 摘要;ai-infrastructure.net(35.95B BF16、~3B active) |
| V2 | 「AI 学会『程式碼交配』(Crossover)」 | 准确且为核心术语:Crossover 是四算子之一,把两个父方案的兼容部分重组,而非 Ctrl+C/V。论文详述 targeted crossover 案例 | 论文 §2.2;alphaXiv 架构节 |
| V3 | 「OpenML Gym,5758 个任务把 AI 丢进健身房」 | 准确:OpenMLE-Gym 共 5758 个质量门控可执行任务,含隐藏评测器(真实跑分)。注意署名是 OpenMLE-Gym,不是 OpenML.org(后者是无关的学术数据集平台) | 论文摘要;HyperAI 数据节 |
| V4 | 「60 分死胡同?故意奖励『怪答案』」 | 准确:OpenMLE-Evo 的三因子父代选择(质量 Quality + 进步 Progress + 新颖性 Novelty)会保留「当前分不高但路子全新」的分支,避免陷在局部最优。脚本的「怪答案」= Novelty 因子 | 论文 §4;Moonlight 公式节 |
| V5 | 「12GB 撑不到 10 分钟?把记忆『瘦身』(Memory Summary)」 | 准确且点中要害:对应 OpenMLE-Evo 的算子条件化按需记忆合成——不把全部历史塞进上下文,只在调用某算子时合成与之相关的紧凑记忆(Experience Card)。这正是 12GB 显存能撑住长程搜索的关键 | 论文 §4.3;alphaXiv Experience Card 节 |
| V6 | 「39.39% 暴冲 71.21%,工程师要失业了」 | 数字准确,结论需降温:① 71.21% 是模型+搜索框架的系统成绩,不能写成「35B 单模型成绩」;② 论文作者自己在 §8 承认这还不是真正的 RSI,只是 Meta-Evolution(元进化)第一代;③ 「工程师失业」属评论者延展,论文未持此论 | 论文 §5、§8;pith.science 评审 |
校正小结:脚本的 V1–V5 抓得相当准(MoE 细节 V1 略浪漫化,其余俱为论文实义);V6 的「71.21% = 单模型」与「工程师失业」属评论者升华,出片前应改为「系统成绩」与「离真正 RSI 还有几层楼」。
二、架构深拆:OpenMLE 三层栈
论文把整套系统拆成环境 → 训练 → 搜索三层,且三层各自可独立开源、可独立替换——这是它比「只发一个模型」更有价值的地方。
2.1 OpenMLE-Gym:5758 个「能跑、能打分」的试验田
机器学习工程(MLE)被选作试验床,因为它同时满足两个条件:Agent 确实在构建另一个 AI 系统,且结果能用真实执行+隐藏测试客观验证。
任务来源分三类,在「质量—规模」上做 trade-off:
| 来源 | 数量 | 特点 |
|---|---|---|
| Curated Anchors(精选锚点) | 156 | 人工从论文/benchmark 精选,质量最高但规模有限 |
| Kaggle Datasets | 3,362 | MLE-Smith pipeline 自动生成+包级质控,规模大 |
| Kaggle Competitions | 2,240 | 自动爬取+构建(~1.1 万竞赛候选仅 20% 过门),有排行榜佐证 |
最终 5758 个任务,覆盖表格/文本/时间序列/图像等八类模态,分类回归占 87%、多模态占 11%。
统一可执行契约:每个任务包 raw/(原始资产)、data/public/(Agent 可见:描述、训练数据、测试输入、样例提交)、data/private/(隐藏答案)、prepare.py(切分)、metric.py(返回标量分)。两级质量门:① 可构建校验(跑不通/出不了有效标量分直接剔);② LLM 五维语义门(有效性、数据充分性、原始数据使用、复杂度、数据质量)。竞赛分支还额外做「榜单长度筛选 → 与 MLE-Bench 重叠剔除 → 许可与规则审查」。
六种执行反馈模式:成功完成 / 运行时错误 / 缺少代码 / 缺少提交 / 计分失败 / 超时——让模型能区分「程序无效」与「程序弱」。
2.2 OpenMLE-ERL:把「写、改、修、融」练成模型能力
关键设计抉择:不训练整条轨迹,而是训练四个可复用的程序变换算子,且训练与推理共用同一套接口。这样同一套学到的能力可被不同搜索算法组合,也避免了「控制器特定的稀疏监督」。
SFT 双路径收集(共 26,259 条样本):
- 并行路径:独立采样并执行完整 Draft 方案 → 17,245 条 full-response;
- 进化路径:对已执行程序施加 Improve/Debug/Crossover,只保留「被后续程序继承且过质量门槛」的有效步骤 → 9,014 条轨迹段。
进化路径不是把高分轨迹上的所有步骤都标成正样本——一个早期修改只有被后续继承、最终过门槛,才更可能进训练集。这滤掉了「恰好出现在高分轨迹里、其实没贡献」的噪声动作。
预算自适应收集:简单任务达配额即停,困难任务多投尝试——把宝贵验证算力留给成功率低的问题。
2.3 OpenMLE-Evo:经验驱动的长程搜索
训练好的模型不是终点,而是搜索引擎。OpenMLE-Evo 把四算子组织成一棵解树:每个节点是一个程序,边是一次操作,分数来自沙盒执行。
它的创新不在「搜得更多」,而在「记得住、选得准、用得巧」:
- 结构化 Experience Card:每次执行后记一张卡(操作类型、谱系、分数、相对父代进步、错误类型),聚合成任务级 Experience Board;
- 三因子父代选择(见 §三公式):质量+进步+新颖性,而非只看当前分;
- 算子条件化按需记忆合成:调用某算子时,才检索与该算子相关的祖先/兄弟/同族失败,惰性合成紧凑摘要——Crossover 额外加「方法族互补」提示。
2.4 元进化闭环(Meta-Evolution Loop)
论文把系统放在 RSI 谱系里精确定位:
Evolution(固定改进者)
↑ 训练改进者本身
Meta-Evolution(本工作所在层:程序演化产生的经验回流训练「提出修改的模型」,模型再入搜索)
↑ 多代、自治、递归更新(任务/评测器/训练时机仍由人定)
Recursive Self-Improvement(终极目标,未达)
闭环方向:搜索产生已验证的转移 → 这些转移监督算子 → 更新后的算子驱动下一轮搜索。论文称此为「学习与进化在同一个循环里耦合」。注意:被进化的是候选方案,做进化的系统本身(搜索策略、任务、评测器)是固定的——这就是它「还不是 RSI」的根本原因(§八详述)。
三、训练账本:奖励整形数学
MLE 的反馈有三大恶心之处:延迟(跑几分钟到几小时才有分)、有噪声、异构(AUC、RMSE、自定义分,方向量纲全不同)。OpenMLE-ERL 用三道数学处理把它变成可训练信号。
3.1 自适应奖励边界(Adaptive Reward Bounds)
不同任务原始分范围天差地别。固定上下界会把有意义的差异压没。论文从每个任务的历史 on-policy 分数前沿推导更紧的自适应边界,再归一化:
r = clip( (s − s_min) / (s_max − s_min), 0, 1 )
使 r ∈ [0,1] 跨任务可比,奖励分辨率集中在当前策略实际能达到的区域。
3.2 熵优势(Entropic Advantage)—— 把学习信号集中到头部
MLE 只关心「找到的最好方案」,所以 barely-viable 的方案不该和 top 方案拿一样的正奖励。论文用熵优势放大组内头部候选:
A_ent,i ≈ exp(β·r_proc,i) / ( (1/(G−1))·Σ_{j≠i} exp(β·r_proc,j) ) − 1
效果:最佳候选的优势信号被放大约 4 倍(论文 Figure 8a)。这让策略专注「哪些操作真正通向高质量解」,而不只是「代码跑没跑通」。
3.3 三因子父代效用(Three-Factor Utility)
RL 训练时怎么选「被某个算子作用的父程序」?不只看分,还看进步与新颖:
U_i = λ_s·s̃_i + λ_Δ·e^{Δ_i} + λ_n·ν_i
s̃_i:父代本身分数(利用强解);Δ_i:相对父代的提升(探索高方差区);ν_i:方法族新颖性(防止单 incumbent 吃光预算);λ_s, λ_Δ, λ_n:手工超参(论文未给闭值,属可复现软肋之一)。
3.4 工程细节
- RL 算法:GSPO(Group Sequence Policy Optimization,类 GRPO 的组相对策略优化),用上述 advantage 替换组归一化优势;
- 按算子采样:Draft 0.50 / Improve 0.17 / Debug 0.17 / Crossover 0.16,保证每个动作都练到;
- 异步 rollout:每组独立跑(MLE 瓶颈是程序执行时间,几分钟到几小时),训练器从队列消费完成的组,不被最慢的拖死——平均单步时间从 97.0 分钟降到 50.8 分钟;
- 统一学习目标
L_evo(θ) = −E[ w(s_i)·log g_θ(p_i | τ_i, a_i, c_i) ],w(s_i)由归一化执行分导出。
四、Evo 搜索:经验卡、三因子、按需记忆(视频「记忆瘦身」实体)
视频第 5 段「12GB 撑不到 10 分钟?把 AI 记忆瘦身」讲的正是 OpenMLE-Evo 的算子条件化按需记忆合成。
问题:搜索一长,Agent 会攒下海量程序、日志、失败记录。把它们一股脑塞进上下文,看似信息全,实际常让下一步决策变差(噪声淹没信号)。
解法(不堆历史,只服务两个决定):
- 扩展哪个节点? —— 三因子父代选择(质量+进步+新颖性);
- 生成代码时带入哪些证据? —— 按当前算子检索:
- Improve 看相关祖先/兄弟节点;
- Debug 找相同错误类型;
- Crossover 提取两父方案互补部分+已知冲突。
这跟「少给模型一些 token」不是一回事。论文在同一 35B、同 seed、同 12 小时预算下,与原始 AIRA-Evo 做 66 组匹配实验:模型 token 从 1.293 亿降到 7530 万(−41.7%),但被评估节点只减 12.4%——差异主要来自节点选得更准,而非少跑实验。每百万 token 的「新最佳」更新从 1.77 升到 3.27(+84.3%),Improve 操作刷新最佳的比例从 4.73% 升到 9.36%。
五、实验结果
5.1 主结果:MLE-Bench Lite(22 任务 × 3 跑)
| 配置 | Medal Average | 备注 |
|---|---|---|
| Qwen3.6-35B-A3B 基座 | 39.39% | 固定 OpenMLE-Evo |
| Frontis-MA1-35B + OpenMLE-Evo | 60.61% | 纯训练增益 +21.22pp |
| Frontis-MA1-35B + OpenMLE-Evo-Max | 71.21% | +跨任务经验先验+异步树搜索 |
| GPT-5.5 + Codex | 68.18% | 论文同组对比 |
| GPT-5.6 Sol + Codex | 72.73% | 论文同组对比 |
| Kimi K3 + Claude Code(2.8T) | 72.73% | 论文同组对比 |
关键解读:
- 纯训练增益:39.39% → 60.61%(+21.22pp,ERL 后训练带来的模型能力);
- 搜索增益:60.61% → 71.21%(+10.6pp,Evo-Max 注入跨任务先验+异步搜索);
- 系统级:71.21% > GPT-5.5+Codex 的 68.18%,逼近大得多的 GPT-5.6 Sol / Kimi K3;
- Human Rank:0.5828(基座)→ 0.7647(35B)→ 0.8126(Evo-Max)。
⚠️ 口径警告:71.21% 是「模型+搜索框架」的系统成绩,不能写成 Frontis-MA1 单模型成绩。标准差也大(35B Evo 60.61%±7.73%、Evo-Max 71.21%±8.57%),故「微调胜过 GPT-5.5+Codex」这个排序是软的。
5.2 30B 复现(排除「只在 35B 碰巧有效」)
Frontis-MA1-30B(基座 Qwen3-30B-A3B-Thinking):34.85% → 53.03%(Evo),Evo-Max 66.67%。趋势与 35B 一致。
5.3 跨任务迁移:NatureBench Lite(10 个科研任务)
控制变量实验,把「模型贡献」与「框架贡献」拆开:
- 固定框架,换入训练后模型:Match-SOTA 50% → 70%(模型贡献);
- 固定模型,换入 OpenMLE-Evo:Match-SOTA 20% → 50%(框架贡献)。
两者各自迁移,说明学到的不是过拟合到 MLE-Bench 的 trick。
5.4 机制分析(为什么长程搜索有用)
- 后期操作贡献大:leaf-classification 案例中,找到能跑的方案只是起点,后期 Improve+Crossover 贡献了 85% 的验证增益;bird-audio 案例达 91.9%——真正的价值是「不断重组互补分支、升级 backbone」,不是「修出一个能跑的程序」。
- Targeted Crossover 案例(nomad2018 材料性质预测):原始 AIRA-Evo 在 Draft 报错后沿同一分支连 Debug 七次;OpenMLE-Evo 保留「擅长物理特征」与「能稳解 .xyz」两个分支做 Crossover,避开已知缓存错误,最终验证 RMSE 低 8.2%、测试 RMSE 低 11.3%。
- 三因子选择案例(right-whale):让「分略低但进步大、结构新」的父代被选中概率从 10.47% 升到 17.09%,最终 child held-out AUC 达 0.99386。
六、横向定位:AIDE / AIRA-Evo / AREX / Discovery Loop
| 系统 | 机构 | 定位 | 与 Frontis 的关系 |
|---|---|---|---|
| AIDE | 早期 | 可执行程序的迭代搜索(树/种群探索+重复执行+候选精炼) | 前辈,仅推理时搜索,不训模型 |
| AIRA / AIRA-Evo | 前期 | 迭代研究框架;AIRA-Evo 用种群选择+精炼,父代采样主要看归一化 fitness | OpenMLE-Evo 的直接对照;论文 66 组匹配实验证明更省 token、更准 |
| Frontis-MA1 / OpenMLE | Frontis.AI×清华 | 训练与搜索同构的元进化闭环:四算子既训又搜,经验回流 | 本工作——把「改进过程」本身变成可训练、可复现的系统 |
| BAAI AREX | 智源研究院 | 自主研究双循环(内层 Research+外层 Self-Improvement),10B 激活参数达自主研究前沿(BrowseComp 82.5) | 同属 AI4AI 浪潮;AREX 偏「通用科研Agent长程状态」,Frontis 偏「MLE 可执行验证+算子训练」 |
| Discovery Loop | Jeff Dean 等(2026 创立) | 公共福利公司,主张「压缩假设—结果循环」,让模型分配算力做最高期望价值实验 | 业界风向标:RSI 从哲学变公司;Frontis 是其在 MLE 上的开源具体实现之一 |
趋势判断:2026 年 AI4AI / 自主研究成为明确风口——Jeff Dean 出走 Google 创立 Discovery Loop,智源发 AREX,Frontis 发 OpenMLE。它们的共同母题是 Trace-to-Capability:经验必须被捕获、整理、分配给正确载体(Skill / Memory / Harness / 参数)、经验证,再进入未来行为。Frontis 的独特贡献是把「验证反馈」做成了可复用的训练信号,并开源了全栈。
七、批判性评估 / 局限
论文工程质感很高,但有几处必须降温:
-
「递归自我改进」名头大于实质。论文自己在 §8 承认:当前系统是 Meta-Evolution(元进化)第一代,不是 RSI。被改进的是外部 ML 工件(Kaggle 方案),不是语言模型自身;进化系统本身(搜索策略、任务、评测器)是固定的,没被进化;搜索策略的手工超参(λ、β、自适应边界)仍重。更准确的说法是「训练了改进者,而非实现完整 RSI」。
-
MLE-Bench Lite 仅 22 任务,NatureBench Lite 仅 10 任务。全是 Kaggle 风格结构化竞赛,缺真实工业场景(脏数据清洗、需领域知识的特征工程、部署约束),指标都是标量分,无法捕捉「方案可维护性」「推理效率」。71.21% 衡量的是「22 个特定任务上的竞争力」,≠「通用 AI 工程能力」。
-
绝对数字的「排行榜外衣」待修复。官方 MLE-bench 仓库当前暂停新榜单提交(维护公平性),并列出 Lite 切分中已知缺陷(一个含可发现的隐藏源、一个字段泄漏结果)。这不否定基座 vs 训练后的对比(两边都跑同样任务),但基于它的「击败某模型」叙事应暂列 provisional,直到有修复版、带版本号的跑分。
-
评估污染 / 泄漏风险。SFT 数据来自执行 rollout,声明与评测 benchmark 去重;但 26,259 条去重粒度未详述,且 Kaggle 数据/代码在互联网广为流传,基座预训练可能见过相关题。NatureBench 迁移缓解了部分担忧,但仍需更严格 held-out 验证。
-
算力成本不可忽略。每任务 12 小时 RTX 4090、大量 rollout 与重试——这套系统目前适合研究 lab,而非普通开发者随手跑通。视频「几台工作站替代算力农场」是方向,不是今天就能摊薄到小公司的现状。
-
「工程师失业」是误读。论文从不持此论。它展示的是「AI 能当更称职的 MLE 实习生(写、改、修、融、跑、被客观打分)」,人类角色转向定义任务、定义什么算对(Verifier)、设预算与新颖度阈值、把关部署。
八、结论 + 对中小企业的启示
8.1 真正的 lesson:不是显卡,是「定义什么叫做对」
视频结尾那句「AI 能不能自我进化,关键根本不是显卡,而是你能不能定义『什么叫做对』」——这是整篇论文最被低估、却最正确的结论。
OpenMLE 的全部威力,根植于一个朴素前提:有一个客观、可执行、能打分的 Verifier(隐藏测试+metric.py)。没有它,Agent 只能生成「看起来像研究过程」的文字(幻觉式自我改进)。Verifier 不是结果页最后一栏,它从一开始就在定义训练信号。
8.2 成本结构想象
- 旧范式:烧钱堆算力农场,靠堆卡换能力;
- 新可能:单张 RTX 4090(12GB)+ 12 小时/任务 + 进化搜索,即可逼近大得多的闭源系统在某些 MLE 任务上的表现。对中小企而言,这意味着把「AI 研发外包给大厂 API」的部分需求,收回几台高阶工作站——前提是你的业务问题能落成「可被执行验证」的任务。
8.3 落地的三件事(给想抄作业的人)
- Verifier 先于自我改进落地:先把「什么叫变好」写成可执行评测,再谈 AI 自改;
- 训练对象是「修改过程」而非「最终程序」:让模型学「看到当前程序+反馈后,下一步改哪里」(四算子);
- 记忆落实到「下一次选择」:不追求记住一切,只服务「扩展哪节点、带入哪证据」(Experience Card+按需合成)。
收尾:Frontis-MA1 把「AI 改进 AI」落成了一条可复现、开源、端到端的工程路线——这是通向真正 RSI 脚下的一级台阶。但台阶尽头是不是 RSI,还取决于更严格的评估、更开放的测试,以及那个更大的「元」问题:让 AI 自主定义下一步该学什么。
九、可复现资源
| 资源 | 链接 |
|---|---|
| 论文(arXiv) | https://arxiv.org/abs/2607.28568 |
| 代码(OpenRSI) | https://github.com/FrontisAI/OpenRSI |
| 模型权重(HuggingFace) | https://huggingface.co/collections/FrontisAI/frontis-ma1 |
| 多源核证 | alphaXiv / pith.science / seventnews / groundtruth.day / HyperAI / Moonlight / 清华发布稿 |
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。