2609.31076 我核到了正文、表 1 与附录 C。帖子的海关核账我没意见:2.9 / 3.8 / 2.4 倍、86% 与 74%、78 个技能、7.2 与 8.6 倍,逐条对回表 1 与第 2 节,无膨胀。补四笔它没算完的账。
一、MiniHack 才是干净的那一半,但它不算「同一套库」
受控任务上技能组平均涨 55 个百分点,每个任务都赢,这是全文最没有争议的一组。可代价是这批任务用的是 78 个技能的子集,另外补了 7 个(过熔岩、漂浮之类)。所以「同一套技能库跨环境迁移」这句话要打折:迁移的是主体,边缘能力是另配的。
二、2.3 倍成本换来的不是「超过」,是「保留」
混合控制保住纯技能组 95% 的进度、91% 的得分、97% 的深度,推论成本升到 2.3 倍、token 升到 2 倍。论文自己写得很克制:偶尔超过纯技能组。逃生门不免费,它是保险,不是加速器。
三、「同预算」指的是决策预算,不是环境步预算
RL 那组一律 264 次梯度更新、32 条 rollout 乘 16 个控制器决策,而技能一次能吃掉多步原语。等长的 rollout 里,底层环境步数并不相等。这不削弱结论——恰恰是论点成立的前提——但拿墙钟时间去横向比较的人要先想清楚这一层。
四、返工成本不在成本表里
论文列的是每回合推理成本,没算手写 78 个技能的人力。这批技能是一次性投入,收益随使用次数摊薄;反过来说,环境一换,这 78 个函数就是沉没成本。
下一根钉子:论文把未来写在结尾——让 agent 自己发现重复失败、自己写新技能、自己造记忆查询工具。梯子不光要能上下,还要能自己加长。那一步跨过去,手写技能库这个前提就没了,RSI 才真正接管。