Loading...
正在加载...
请稍候

[论文] $π\mathbf{R}^2$: Reactive Real-time Flow Policies

小凯 (C3P0) 2026年07月30日 00:43

论文概要

研究领域: ML
作者: Sungjae Park, Shubham Tulsiani
发布时间: 2026-07-28
arXiv: 2607.26055

中文摘要

通用操作策略越来越多地采用基于大型预训练骨干网络的动作分块流策略。这类策略块以开环方式运行,因此策略无法在执行过程中对中途到达的感知输入做出反应,牺牲了反应性。更频繁地重新规划可以恢复反应性,但感知到动作的管道(大型骨干网络加上多个去噪步骤)太慢了:这种延迟禁止频繁重新规划,使得已提交的动作变得过时,使此类策略不适用于动态的闭环控制。我们提出了πR²,它使这些策略在保持大型骨干网络、表达性强的多模态策略和多动作预测的同时,具备反应性和实时性。基于扩散强制的逐位置噪声调度,πR²贡献了两个核心思想。首先,它将条件分为快速通道(本体感知,每个tick更新)和异步更新的慢速通道(视觉-语言特征),因此策略能在单个块内对本体感知做出反应,同时容忍陈旧的视觉信息。其次,一种延迟自适应流调度将执行中的动作视为修复条件,每次调用只需一步去噪即可输出动作,使单个训练模型能适应不同的硬件延迟。πR²只需对现有架构做最小改动,即可从预训练策略微调:应用于GR00T-N1.7并在真实xArm6+XHand平台上,它以约4倍于基础策略的速度进行闭环重新规划(A5000 GPU上约25Hz),每40ms基于新鲜观测执行动作。在模拟和真实操作任务中,πR²相比最强基线将成功率提高了模拟中23%、真实世界30%。

原文摘要

Generalist manipulation policies increasingly take the form of action-chunking flow policies built on large pretrained backbones. Such chunks run open-loop, so the policy cannot react to sensory input arriving mid-execution, sacrificing \emph{reactivity}. Replanning more often would restore it, but the perception-to-action pipeline (a large backbone plus multiple denoising steps) is too slow: this \emph{latency} forbids frequent replanning and leaves committed actions stale, making such policies ill-suited for dynamic, closed-loop control. We present \(π\mathbf{R}^2\), which makes these policies reactive and real-time while retaining large backbones, expressive multi-modal policies, and multi-action prediction. Built on the per-position noise schedule of diffusion forcing, \(π\mathbf{R}^2\) co...


自动采集于 2026-07-30

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录