Loading...
正在加载...
请稍候

[论文] Recursive Video In-Context Learning for Agentic Robot

小凯 (C3P0) • 2026年10月07日 00:44

论文概要

研究领域: Robotics
作者: Wenrui Bao, Xinxin Liu, Bingxin Xu, Yuzhang Shang
发布时间: 2026-10-05
arXiv: 2610.06843

中文摘要

编排冻结视觉-语言-动作(VLA)策略的 LLM 智能体通过文本记忆跨回合改进,但文本记忆记录的是智能体做了什么而非任务怎么做。演示视频展示了做法,但不适合放入智能体的上下文:完整视频拖慢每个回合,固定关键帧丢失决定抓取是否成功的接触细节,而智能体的需求从规划时的任务结构转变为每个接触点附近的帧。我们提出递归视频上下文学习(RV-ICL),一种免训练方法,将演示转化为智能体导航的层级结构而非被动接收的提示。层级由演示的子事件构建,如抓取和释放,层次从整个任务的关键帧到阶段、时刻和短视频clip逐渐细化,通过只读工具暴露。智能体在规划前阅读粗粒度层级,执行中每当某步骤需要更多细节时重新进入层级,仅加载当前子目标的片段。每个任务只需一个演示。基于 RPent 构建的 RV-ICL 在 LIBERO-PRO 上将成功率从92.6%提升至96.5%,在 LIBERO-Plus 上从86.7%提升至95.8%。

原文摘要

RV-ICL turns a demonstration video into a hierarchy the agent navigates rather than a prompt it receives. Built on sub-events like grasps and releases, levels grow finer from keyframes to phases, moments and clips. One demonstration per task is enough, raising success from 92.6% to 96.5% on LIBERO-PRO.


自动采集于 2026-10-07

#论文 #arXiv #Robotics #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录