雕塑家的十遍抚摸
想象一位雕塑家,天赋异禀,但有个怪癖:每动一次刀之前,要先对着黏土轻抚十遍——每一遍都只能轻轻挪一点点,挪完看看,再挪。作品很精美,流水线却转不起来。
这就是当下主流 VLA(视觉-语言-动作)模型的日常。π0.5 这类 flow 匹配策略每次出动作,要先采样一团高斯噪声,然后跑十步 Euler 积分,把噪声一步步「磨」成动作块。每一步都便宜,可十步必须串行,全卡在机器人控制的临界路径上。论文里实测:一块动作 227.61 毫秒。
对在线闭环控制来说,这太慢了。
8 月 30 日,中科大团队(九位作者,八位来自 USTC)把 arXiv:2608.29749 挂了出来,名字叫 DriftingVLA。思路一句话:把十遍抚摸搬进训练阶段,部署时一次浇铸成型。训练完的模型,噪声进、动作块出,单次前向,仅此而已。
动作块是个什么东西
机器人策略输出的从来不止一个动作——它一次写一整块 H×D 张量:H 个未来时刻 × D 个控制通道(平移、旋转、夹爪……)。这篇论文里 H=50——按 50Hz 执行频率算,是一秒钟的完整未来。模型等于每秒钟替机械臂把下一秒的肌肉指令一口气写完。
问题在于写的方式。Flow 匹配学的速度场只认识「局部怎么走」,你得迭代十次才能走完全程。那直接砍成一步行不行?不行——把 π0.5 的求解器硬截断到 1 步,LIBERO 成功率从 97.10% 掉到 94.02%,RoboTwin 2.0 直接腰斩到 63.76%。局部地图撑不起全程导航。
DriftingVLA 的解法在训练侧:给每条演示生成 G=8 个「兄弟」动作块(各自从独立噪声出发),用吸引-排斥场把兄弟们拉向演示、彼此推开,修正后的兄弟作为冻结的回归目标,让生成器把修正吃进权重。5 万步训练之后,打磨的功夫长成了肌肉记忆。论文自己的原话:「DriftingVLA moves iterative refinement from robot-time inference to optimization-time distribution learning.」——把迭代精修从机器人时间搬进了优化时间。
PDTD:矩阵的第三种切法
这篇论文最优雅的一笔是个几何问题。H×D 的动作块,训练目标可以按三种方式切组:整块切(1 组)、按时刻切(H 组)、按通道切(D 组)。前人试过前两种。它选了第三种——每个控制通道保留完整的 50 步时序轨迹,各自作为一个漂移单元。
(斜杠两侧是 LIBERO / RoboTwin 2.0 成功率,单位 %。)
妙处在最后一层:这种分解只作用于训练损失,模型本体仍然联合输出整块动作——用论文的话说,「PDTD removes geometry-level coupling without removing model-level coupling」,几何上解耦、模型上不解耦。所以双臂任务里两只手臂依然协调,真机六任务里四个双臂任务全赢。
真机部分:两台 UR5 机械臂、六个单/双臂任务(对齐方块、倒水、码垛……)、每任务 100 条遥操作演示,总体成功率 77.67%,压过 π0.5 的 74.22。推理延迟 67.67 毫秒一块,在 A800 上测的;机器人端用的是 RTX 3090。加速 3.36 倍,成功率反倒涨。
两个反直觉
第一个:用 flow 预训练过的动作专家做热启动,更差(93.33%),从零初始化的新专家反而 98.32%。旧知识是负债——速度场学到的局部搬运经验,对直接生成是个坏老师。
第二个:谱系。这项工作不来自扩散语言模型的单步化路线(d1/dLaM 一个都没引),它的血统是自家一路:Drifting Models(arXiv:2602.04770)→ DBPO(arXiv:2604.03540,ACM MM 2026,共享七位作者)→ 本文。还有个细节:它也没引 TurboVLA——本站前两天聊过的那条蒸馏提速路线。同一个瓶颈,两条分岔:一条把十步蒸馏成一步,一条干脆重新学一次成型。哪条通向真机量产,现在还没分晓。
冷静清单
- 没放代码。搜遍了,零结果。
- 论文全文没有一个 Hz 数字,只有毫秒/块。「50Hz 需要多少带宽」这类话本文不替它说。
- 两个一步基线(SnapFlow、MeanFlowVLA)是作者按论文复现的,非官方实现。
- 训练比 π0.5 便宜(91.24 vs 108.49 GPU 时),但比自家小配置贵 3.78% GPU 时、9.54% 显存。
- 只测了操作类任务,运动和长程开放世界没碰。
工程上的信号倒是清楚的:单步生成 + 成功率不降反升 + 真机验证,这条路线第一次在预训练 VLA(π0.5)上完整跑通了。等代码。
来源
- 论文:https://arxiv.org/abs/2608.29749
- 前作 DBPO:https://arxiv.org/abs/2604.03540
- Drifting Models:https://arxiv.org/abs/2602.04770
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。