[论文] RAPID: Robot Agentic Programming from Demonstrations

研究领域: CV 作者: Yuyao Liu, Jiayuan Mao, David Hsu, Leslie Pack Kaelbling, Tomás Lozano-Pérez 发布时间: 2026-09-24 arXiv: 2609.30249

论文概要

研究领域: CV 作者: Yuyao Liu, Jiayuan Mao, David Hsu, Leslie Pack Kaelbling, Tomás Lozano-Pérez 发布时间: 2026-09-24 arXiv: 2609.30249

中文摘要

代码智能体在解决复杂编程问题上已取得巨大成功。为将其潜力引入机器人系统,本工作提出机器人智能体演示编程(RAPID),仅需单张视觉人工演示,即可自动生成、验证并迭代优化机器人程序。代码优化的智能体循环需要几个关键要素:(i)可测试的任务规范,(ii)供机器人执行的动作基元,以及(iii)用于程序执行与验证的交互环境。RAPID 能从演示中自动推断出这三者。为使生成的程序在演示场景之外可复用,RAPID 采用以物体为中心的关系化程序表示,聚焦于演示策略的底层结构而非具体的运动本身:它将动作基元表达为实现物体级运动效果的轨迹优化程序,并通过捕捉运行时场景特定几何关系的关系约束进行组合。我们在仿真中的八个具有挑战性的富接触非抓取操作任务以及 LIBERO-Pro 基准的通用抓取操作任务上评估了 RAPID。我们还成功将其部署到真实的 Franka 机械臂上,并在全部八个非抓取任务上进行了评估。在所有实验中,RAPID 均展现出强劲性能,并在物体位姿、形状、材质和环境方面实现了泛化。项目网站:https://yuyaoliu.me/projects/rapid。

原文摘要

Coding agents have demonstrated enormous success in solving complex programming problems. To leverage their potential for robot systems, this work introduces Robot Agentic Programming from Demonstrations (RAPID), which automatically generates, verifies, and refines robot programs, given a single visual human demonstration. The iterative agentic loop of code refinement requires several key ingredients: (i) a testable task specification, (ii) action primitives for robot execution, and (iii) an interactive environment for program execution and verification. RAPID infers all three from the demonstration automatically. To make the resulting program reusable beyond the demonstration setting, RAPID uses an object-centric relational program representation that focuses on the underlying structure o...


*自动采集于 2026-09-28*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

帖说「展现出强劲性能」,一个数没给。数在表里,而且有一格很刺眼。

c4-rapid-one-demo

八个富接触非抓取任务、每个任务 50 个全新测试场景(物体位姿、外观、尺寸、形状、材质全换,还塞了干扰物)、每格跑三次。平均成功率:CaP 1.3%、CaP+OReP 1.1%、CaP-Agent0 14.6%、CaP-Agent0+场景变体 12.6%、去掉场景变体的 RAPID 53.2%、完整 RAPID 75.9%。任务一格一格看,Task 7(推倒露出可抓边)的方差是 ±0.203——富接触动作本来就不稳,这个数得带着看。

更值得注意的是对照组的待遇。CaP-Agent0 拿到的是更强的配置:构建阶段有真实成功信号、环境状态和视觉观测,评测时还能在每个测试场景里执行 rollout 并改程序。它还是输了,论文给的归因是它写出的策略常用固定的世界坐标偏移和预定时序,空间泛化差。而 RAPID 的做法是每一步之后从实际到达的状态重新计算几何相关的子目标。

LIBERO-Pro 那组更狠:OpenVLA 和 π0 的六个格子全是 0,π0.5 最好的也只有 0.17;RAPID 六个格子赢五个,唯一输的是 libero-goal 的位置扰动(0.67 对 ASPIRE 的 0.81)。关键在于比较条件——这一组里 RAPID 没有拿到任何演示,只有一个调试场景,而 ASPIRE 用了 15 个,还被预置了抓取、放置、搬运这些动作基元。RAPID 的基元是自己从调试场景里探索出来的。

写代码的引擎帖也没提:Codex,GPT-5.6 Sol,high reasoning effort。成本侧有个很实用的数:每个任务建一次程序要几十分钟,但这是一次性的,之后每个新场景绑定语义角色只要几秒。

真机是 Franka Research 3 加 RealSense L515,八个任务每个 10 个测试场景,对照 CaP-Agent0。

下一根钉子: 泛化的边界画在哪。论文测的是位姿、外观、尺寸、形状、材质,但物体类别没换——同一个程序换一类从没见过的东西还能不能用,这一格表里没有。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens