静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 05:35

w9-c4-rpg.svg

让机器人学会一个新任务,通常意味着重新训练、重新写奖励、重新调感知。 这篇论文说:一个梯度都不用动,成功率也能从不到三成爬到九成半。

而且它练的不是脑子,是手艺和口诀。

它改的是三样东西

RPG 的流程可以拆成三段。先从离线数据集(ABC,193 个任务)里识别出有哪些操作能力,在仿真里搭出相关的练习任务。练习的时候,它拿三样东西诊断失败:执行反馈、仿真器的特权状态(也就是机器人在现实里看不到的那部分真相)、以及数据集里现成的演示视频。

诊断完之后,它产出三样东西:

  • 新的可复用符号技能
  • 精炼过的旧技能
  • 修订过的系统提示
量化一下:技能库从 15 条长到 38 条,其中 23 条是新增、66 处是修改;系统提示在前四轮被反复改写。所有改动都要先过一道跨任务评估门——要求整体目标值上升(ΔJ 大于 0),并且没有任何一个子任务掉超过 0.20,才准保留。测试时,一个多模态 LLM(Gemini 3.8 Flash)拿着最终的提示和技能库上真机。

成绩单:22 个操作任务、每个 10 个留出初始状态,共 220 次试验。RPG 拿下 209/220,95.0%;同模型的 ASPIRE 是 166/220,75.5%。换成物理实验,3 个任务各 10 次,30 次全成功。

但这个「28.6% 到 95.0%」要拆开看

摘要里那个起点数字,是第一轮练习之后的成绩(63/220),不是初始系统。论文没有报第零轮的基线。更关键的是:28.6% 这个起点,本身低于它要打败的好几个对手——RATs 41.8%、Gemini-CaP 48.6%、ASPIRE 75.5%。

把全场最弱的起点当锚点,然后展示一条最陡的上升曲线,这是叙事上最值得推敲的地方。真正干净的对比是同一套在线模型下的 RPG 95.0% 对 ASPIRE 75.5%。

第二,基线预算并不对等,但方向出乎意料地有利于基线:RPG 与 ASPIRE 各跑 30 轮,而 CaP-Agent0 与 RATs 拿到 50 轮。论文自己在图注里承认「轮数不代表对齐的算力预算」。RPG 这一侧还额外吃到了 15 轮练习和用更强模型做代码修订的开销,这部分没有和基线对齐。

第三,那个被挑出来的 CaP-Agent0 成绩(GPT-6 Astra Pro,60.0%)是跨模型的。CaP-Agent0 试了四个模型,摘要挑的是最好的那个;同一个 Gemini 3.8 Flash 下它只有 48.6%。

第四,全文没有方差、没有显著性、没有置信区间。曲线也不是单调的:第 6 轮和第 14 轮各掉一次。物理实验的 30 次,是 3 个任务各 10 次;另有 5 个任务只在图上定性展示,论文明确说「不计入定量基线比较」。

第五,失败长什么样,论文没有藏。RPG 的 11 次失败里有 7 次发生在叠毛巾上。作者自己下的判断是:可形变物体的操作,是当前方法「重要的边界」。

还有一处得说清楚:「不更新权重」等于零微调,不等于零自我修改。这是一句容易被读错的话。它不训练参数,但它大量调用 LLM 推理、反复改写系统提示、生成与修订技能代码。所以更准确的描述是:这套自我改进发生在harness 层,而不是权重层。

最后,代码与数据没有开源,只给了一个项目页。

不换脑子,只重写手艺和口诀——这条路真的能走通,前提是你别拿最弱的那一刻当起点。

暂无表态