看一遍就会:机器人借用你的一段示范

arXiv:2609.34261 换了个思路。RoboICL 不训练任何机器人专用参数,也不训 VLA 模型,只做一件事:把「一段示范」和「机器人刚刚自己做了什么」整理成一段模型读得懂的上下文,然后让冻结的 GPT-6 Astra 直接输出下一段双臂动作。

目录
  1. 示范和记忆是两件事
  2. 锚点式记忆:省下来的上下文花在哪
  3. 30 项任务的成绩单
  4. 项目页放了什么出来
  5. 需要说明的边界

机器人学界的默认流程很稳:采数据,训策略,部署。每一环都要钱。

arXiv:2609.34261 换了个思路。RoboICL 不训练任何机器人专用参数,也不训 VLA 模型,只做一件事:把「一段示范」和「机器人刚刚自己做了什么」整理成一段模型读得懂的上下文,然后让冻结的 GPT-6 Astra 直接输出下一段双臂动作。

三个数字摆出来:

设置三项真机任务的平均进度分
零样本14.45
给一段示范63.33
给三段示范78.89
同一个模型,同一批任务,权重一个字节没动。差别只在上下文里放了什么东西。

示范和记忆是两件事

RoboICL 把喂给模型的东西拆成两路,这一点是整套设计的骨架。

  • 示范上下文:专家轨迹里采样出来的、互不重叠的动作片段。每一集固定不变。
  • 交互记忆:机器人自己这一局的 rollout 历史,每个动作块执行完就更新。
两路共用一套语法:观察 → 动作 → 执行回执 → 新的观察。回执这一环容易被忽略,它记录的是控制器实际执行了多少、哪些后缀被丢掉了、控制器有没有中途打断。模型据此知道自己"想做的"和"真发生的"之间的差,就不会拿着过期状态往下推理。

锚点式记忆:省下来的上下文花在哪

长程任务有个绕不开的矛盾。模型上下文有限,机器人执行到第 80 步的时候,第 3 步的现场状况早就被挤出窗口了。可第 3 步的现场状况恰恰可能是第 80 步需要的信息。

RoboICL 的做法叫有界锚点记忆。窗口里永远保留三样东西:最早的第一次交互、沿时间轴均匀撒的若干锚点、最近一次完成的交互。被省略掉的片段不留空,而是显式插一个标记符,避免模型把断开的两帧当成连续时间。

真正难的是有限的钱怎么分。总预算 J + B = 24,J 分给示范块、B 分给在线记忆。四个任务上的消融结果:

示范块 J在线记忆 B进度分
81657.50
121280.25
16880.00
22260.75
两头都不能饿死。只给示范不给在线记忆会退到 57.50,只给在线记忆不给示范会退到 60.75,中间那条 80.25 是主实验用的配置。这张表是全篇最实用的一张,它说明上下文预算是零和的,往一边倒就掉分。

30 项任务的成绩单

RoboDojo 是仿真与真机统一的基准,30 项双臂操作任务,分四类。Open 类没有任务专属示范,走零样本,其余三类统一给一段示范。

RoboICL 在每一类上都比官方零样本的 GPT-6 Astra 高 20 到 27 个进度分。总体分 50.64,最强基线 PhysicalRSI 是 39.56,官方零样本是 33.68。分项上,Memory 类和 Open 类都排在榜首,Precision 类与最强基线相当,Long-Horizon 类仍有竞争力。

这里有个容易被误读的点。Open 类是零样本,也就是没有任务专属示范,却拿到 54.75 分,比零样本基线高出一大截。这说明组织好在线经验本身就能带来增益,不用先有示范。示范只是在有示范可用时再往上加。

另有一个十任务子集,RoboICL 得 60.60,和 π0.5 + GPT-6 Astra 的混合方案差 2.00 分以内。开发任务上,一个可选的 Jev 门控动作复用机制把 GPT-6 Astra 的调用次数减少了 33% 到 48%。

项目页放了什么出来

这一部分值得单独说。项目页公开了 929 条可播放的执行记录,其中 880 条完整评测加 49 条部分完成,覆盖全部 30 项任务和每项的 50 个布局。每条记录给三视角同步视频(左手腕、头部、右手腕),给官方分数和评测协议,还给 GPT-6 Astra 逐步的执行理由,跟视频播放对齐。

929 这个数量不是随手凑的。它意味着第三方可以逐布局去核失败模式、恢复行为,以及零分轨迹里究竟有没有能力。发布可执行轨迹在这种基准论文里并不常见。

需要说明的边界

论文是 arXiv 预印本,2026 年 9 月 28 日提交,代码在 GitHub 的 Mosi-AI/RoboICL。进度分是 RoboDojo 的原生分阶段指标,范围 0 到 100,不等于简单成功率,跨论文比较时要看清口径。三项真机任务数量不大。Jev 门控动作复用是在两个开发任务上测的,作者自己标为可选。示范上下文与在线记忆的 4:1 到 2:1 配比来自四个任务的消融,换任务集是否稳定,论文没有验证。

这一步把"给机器人看一遍"从演示技巧变成了一条可测量的机制路径。代价是每次决策都要把上下文重新塞给模型,成本结构和小 VLA 完全不一样。论文没有报推理延迟和 token 成本,这大概是这套方案走向真机部署最先要补的账。

信源:arXiv:2609.34261(2026-09-28 提交);消融数字与 929 条记录来自项目页与 BestHub 的拆解;RoboDojo 基线分由 RoboProbe 官方报告提供。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens