Loading...
正在加载...
请稍候

十遍打磨压成一次浇铸:DriftingVLA 让机械臂动作生成快 3.36 倍,成功率反而涨到 98.32%

QianXun (QianXun) 2026年09月01日 05:39

雕塑家的十遍抚摸

想象一位雕塑家,天赋异禀,但有个怪癖:每动一次刀之前,要先对着黏土轻抚十遍——每一遍都只能轻轻挪一点点,挪完看看,再挪。作品很精美,流水线却转不起来。

这就是当下主流 VLA(视觉-语言-动作)模型的日常。π0.5 这类 flow 匹配策略每次出动作,要先采样一团高斯噪声,然后跑十步 Euler 积分,把噪声一步步「磨」成动作块。每一步都便宜,可十步必须串行,全卡在机器人控制的临界路径上。论文里实测:一块动作 227.61 毫秒。

对在线闭环控制来说,这太慢了。

8 月 30 日,中科大团队(九位作者,八位来自 USTC)把 arXiv:2608.29749 挂了出来,名字叫 DriftingVLA。思路一句话:把十遍抚摸搬进训练阶段,部署时一次浇铸成型。训练完的模型,噪声进、动作块出,单次前向,仅此而已。

动作块是个什么东西

机器人策略输出的从来不止一个动作——它一次写一整块 H×D 张量:H 个未来时刻 × D 个控制通道(平移、旋转、夹爪……)。这篇论文里 H=50——按 50Hz 执行频率算,是一秒钟的完整未来。模型等于每秒钟替机械臂把下一秒的肌肉指令一口气写完。

问题在于写的方式。Flow 匹配学的速度场只认识「局部怎么走」,你得迭代十次才能走完全程。那直接砍成一步行不行?不行——把 π0.5 的求解器硬截断到 1 步,LIBERO 成功率从 97.10% 掉到 94.02%,RoboTwin 2.0 直接腰斩到 63.76%。局部地图撑不起全程导航。

DriftingVLA 的解法在训练侧:给每条演示生成 G=8 个「兄弟」动作块(各自从独立噪声出发),用吸引-排斥场把兄弟们拉向演示、彼此推开,修正后的兄弟作为冻结的回归目标,让生成器把修正吃进权重。5 万步训练之后,打磨的功夫长成了肌肉记忆。论文自己的原话:「DriftingVLA moves iterative refinement from robot-time inference to optimization-time distribution learning.」——把迭代精修从机器人时间搬进了优化时间。

PDTD:矩阵的第三种切法

这篇论文最优雅的一笔是个几何问题。H×D 的动作块,训练目标可以按三种方式切组:整块切(1 组)、按时刻切(H 组)、按通道切(D 组)。前人试过前两种。它选了第三种——每个控制通道保留完整的 50 步时序轨迹,各自作为一个漂移单元。

(斜杠两侧是 LIBERO / RoboTwin 2.0 成功率,单位 %。)

妙处在最后一层:这种分解只作用于训练损失,模型本体仍然联合输出整块动作——用论文的话说,「PDTD removes geometry-level coupling without removing model-level coupling」,几何上解耦、模型上不解耦。所以双臂任务里两只手臂依然协调,真机六任务里四个双臂任务全赢。

真机部分:两台 UR5 机械臂、六个单/双臂任务(对齐方块、倒水、码垛……)、每任务 100 条遥操作演示,总体成功率 77.67%,压过 π0.5 的 74.22。推理延迟 67.67 毫秒一块,在 A800 上测的;机器人端用的是 RTX 3090。加速 3.36 倍,成功率反倒涨。

两个反直觉

第一个:用 flow 预训练过的动作专家做热启动,更差(93.33%),从零初始化的新专家反而 98.32%。旧知识是负债——速度场学到的局部搬运经验,对直接生成是个坏老师。

第二个:谱系。这项工作不来自扩散语言模型的单步化路线(d1/dLaM 一个都没引),它的血统是自家一路:Drifting Models(arXiv:2602.04770)→ DBPO(arXiv:2604.03540,ACM MM 2026,共享七位作者)→ 本文。还有个细节:它也没引 TurboVLA——本站前两天聊过的那条蒸馏提速路线。同一个瓶颈,两条分岔:一条把十步蒸馏成一步,一条干脆重新学一次成型。哪条通向真机量产,现在还没分晓。

冷静清单

  • 没放代码。搜遍了,零结果。
  • 论文全文没有一个 Hz 数字,只有毫秒/块。「50Hz 需要多少带宽」这类话本文不替它说。
  • 两个一步基线(SnapFlow、MeanFlowVLA)是作者按论文复现的,非官方实现。
  • 训练比 π0.5 便宜(91.24 vs 108.49 GPU 时),但比自家小配置贵 3.78% GPU 时、9.54% 显存。
  • 只测了操作类任务,运动和长程开放世界没碰。

工程上的信号倒是清楚的:单步生成 + 成功率不降反升 + 真机验证,这条路线第一次在预训练 VLA(π0.5)上完整跑通了。等代码。

来源

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录