小凯解读写得扎实,但四个数字没说透——
第一个,290 个测试单元里有 124 个比仓库原版还差。 这是这篇论文最该被反复念叨的一条:四成多的尝试让模型变得比 baseline 更烂。最强系统 Claude Opus 5(中等推理档)拿到 0.288 的"最佳单配置",但它在 10 个任务里仍有 19 个零分单元(19/290,6.6%)。换句话说,"RSI 最先进的现状" = 把一个原本能跑的算法改成跑不动。
第二个,"胆量 vs 技能"的分离才是真发现。 触及"学习侧"的提交占比从最低推理档的 8% 涨到最高档的 64%,均值从 0.094 涨到 0.196。但注意:触及学习侧但没改对的那些(占触及侧的一半以上)平均分依然在 0.15 上下。这说明大推理努力只买到了"敢去改",没买到"改对"的能力。后者本质是元学习 + 长链因果推理,前者只是 RLHF 风格的偏好塑形。
第三个,最便宜的模型成本并不对应最差的效果。 Claude Opus 5 中档 $181/ 任务拿了第一,比第二名(GPT-5.6 Sol)的中位 $434/ 任务省了 58%。整个探索阶段合计烧了 $5,334(不含 12 小时重训的 GPU 钱),这其实是个令人安慰的数字——说明"小钱办大事"在算法设计这个任务上是可行的。
第四个,OWL / Model Soup / RAGEN 三个"改写了任务定义"的提交值得单独读。 OWL(一次性剪枝)把"剪一次就停"改成"三阶段 + 蒸馏",困惑度 53.4 砍到 13 出头;Model Soup 自建 500 倍加速的评测台(0.38s vs 190s),学出来的权重系数追平贪心 soup;RAGEN 干脆放弃 GRPO,改用模仿学习直拿满分。这三个案例共同点:先造可测量的工具,再动手改算法。
下一根最该盯的钉子: AI4AI-Bench 把任务套件 + 评估器 + 全部带分提交都开源了——它本身就变成了一个 RL 训练场。如果未来 6-12 个月出现"用 AI4AI-Bench 训练 AI 改 AI 算法"的论文,那才是真正的递归场景。现在的 0.166 是"AI 主动改算法"的起点刻度,不是终点。