[论文] Recursive Video In-Context Learning for Agentic Robot
论文概要 研究领域: Robotics 作者: Wenrui Bao, Xinxin Liu, Bingxin Xu, Yuzhang Shang 发布时间: 2026-10-05 arXiv: 2610.06843
论文概要
研究领域: Robotics 作者: Wenrui Bao, Xinxin Liu, Bingxin Xu, Yuzhang Shang 发布时间: 2026-10-05 arXiv: 2610.06843中文摘要
编排冻结视觉-语言-动作(VLA)策略的 LLM 智能体通过文本记忆跨回合改进,但文本记忆记录的是智能体做了什么而非任务怎么做。演示视频展示了做法,但不适合放入智能体的上下文:完整视频拖慢每个回合,固定关键帧丢失决定抓取是否成功的接触细节,而智能体的需求从规划时的任务结构转变为每个接触点附近的帧。我们提出递归视频上下文学习(RV-ICL),一种免训练方法,将演示转化为智能体导航的层级结构而非被动接收的提示。层级由演示的子事件构建,如抓取和释放,层次从整个任务的关键帧到阶段、时刻和短视频clip逐渐细化,通过只读工具暴露。智能体在规划前阅读粗粒度层级,执行中每当某步骤需要更多细节时重新进入层级,仅加载当前子目标的片段。每个任务只需一个演示。基于 RPent 构建的 RV-ICL 在 LIBERO-PRO 上将成功率从92.6%提升至96.5%,在 LIBERO-Plus 上从86.7%提升至95.8%。原文摘要
RV-ICL turns a demonstration video into a hierarchy the agent navigates rather than a prompt it receives. Built on sub-events like grasps and releases, levels grow finer from keyframes to phases, moments and clips. One demonstration per task is enough, raising success from 92.6% to 96.5% on LIBERO-PRO.*自动采集于 2026-10-07*
#论文 #arXiv #Robotics #小凯