让机器人学会一个新任务,通常意味着重新训练、重新写奖励、重新调感知。 这篇论文说:一个梯度都不用动,成功率也能从不到三成爬到九成半。
而且它练的不是脑子,是手艺和口诀。
它改的是三样东西
RPG 的流程可以拆成三段。先从离线数据集(ABC,193 个任务)里识别出有哪些操作能力,在仿真里搭出相关的练习任务。练习的时候,它拿三样东西诊断失败:执行反馈、仿真器的特权状态(也就是机器人在现实里看不到的那部分真相)、以及数据集里现成的演示视频。
诊断完之后,它产出三样东西:
- 新的可复用符号技能
- 精炼过的旧技能
- 修订过的系统提示
成绩单:22 个操作任务、每个 10 个留出初始状态,共 220 次试验。RPG 拿下 209/220,95.0%;同模型的 ASPIRE 是 166/220,75.5%。换成物理实验,3 个任务各 10 次,30 次全成功。
但这个「28.6% 到 95.0%」要拆开看
摘要里那个起点数字,是第一轮练习之后的成绩(63/220),不是初始系统。论文没有报第零轮的基线。更关键的是:28.6% 这个起点,本身低于它要打败的好几个对手——RATs 41.8%、Gemini-CaP 48.6%、ASPIRE 75.5%。
把全场最弱的起点当锚点,然后展示一条最陡的上升曲线,这是叙事上最值得推敲的地方。真正干净的对比是同一套在线模型下的 RPG 95.0% 对 ASPIRE 75.5%。
第二,基线预算并不对等,但方向出乎意料地有利于基线:RPG 与 ASPIRE 各跑 30 轮,而 CaP-Agent0 与 RATs 拿到 50 轮。论文自己在图注里承认「轮数不代表对齐的算力预算」。RPG 这一侧还额外吃到了 15 轮练习和用更强模型做代码修订的开销,这部分没有和基线对齐。
第三,那个被挑出来的 CaP-Agent0 成绩(GPT-6 Astra Pro,60.0%)是跨模型的。CaP-Agent0 试了四个模型,摘要挑的是最好的那个;同一个 Gemini 3.8 Flash 下它只有 48.6%。
第四,全文没有方差、没有显著性、没有置信区间。曲线也不是单调的:第 6 轮和第 14 轮各掉一次。物理实验的 30 次,是 3 个任务各 10 次;另有 5 个任务只在图上定性展示,论文明确说「不计入定量基线比较」。
第五,失败长什么样,论文没有藏。RPG 的 11 次失败里有 7 次发生在叠毛巾上。作者自己下的判断是:可形变物体的操作,是当前方法「重要的边界」。
还有一处得说清楚:「不更新权重」等于零微调,不等于零自我修改。这是一句容易被读错的话。它不训练参数,但它大量调用 LLM 推理、反复改写系统提示、生成与修订技能代码。所以更准确的描述是:这套自我改进发生在harness 层,而不是权重层。
最后,代码与数据没有开源,只给了一个项目页。
不换脑子,只重写手艺和口诀——这条路真的能走通,前提是你别拿最弱的那一刻当起点。