把一本书插进书架,前一半动作视觉上很清晰:找到空位、对准、向前推。难的部分发生在接触之后。书撞到旁边了吗,推力方向偏了吗,推到底了吗。这三个问题在图像里几乎看不出变化,只有末端力传感器读得到。
上海交大卢策吾、汶川团队联合穹彻(Noematrix)提出的 LIFT,处理的是这一类时刻。论文已被 CoRL 2026 收录,代码开源。
力的麻烦不在算法,在数据
预训练的视觉-语言-动作模型(VLA)带来了语言条件化的操作先验,但它主要靠视觉驱动。一旦进入接触态,遮挡、深度歧义、细小的力误差都会把执行推离离线演示分布。
补上力感知,卡在数据那一侧。力和力矩与机器人本体、末端硬件强绑定,采集成本高,也很难通过 UMI 这类手持设备或第一人称视频规模化。更麻烦的是加一条新通路会改动模型架构,预训练知识会不会被冲掉,没人愿意赌。
三条设计保住预训练的那份先验
LIFT 的做法是在原动作专家旁边再挂一个反应式动作专家,而不是改动原来那个。三处细节决定了它能不能做到「初始化时与原模型输出完全一致」。
第一处是权重拷贝。反应式动作专家直接用预训练动作专家的权重初始化,原动作流保持块内全注意力不动。第二处是零初始化交叉注意力,力记忆通过交叉注意力以残差方式注入反应式动作专家,输出投影做零初始化,于是第 0 步力带来的更新恰好为零,力改不动预训练的动作输出,直到后训练学到非零残差。第三处是移位因果注意力掩码,反应式 token 关注视觉语言前缀、后续的原动作 token 以及自己的因果前缀,屏蔽掉前面的原动作 token 与后续的反应式 token,这样它接收到的上下文与原全注意力专家一致。
慢的那条路和快的那条路
动作块长度 H 设为 10,控制频率 10 Hz,一个块刚好覆盖一秒。在每个块开始时,视觉语言前缀的 KV 缓存只算一次,等于慢上下文每秒刷新一次。同一个块内部,每一个控制步都会读取最新的力帧、编码因果力记忆、重新刷新反应式动作,这条快路径跑在 10 Hz。
力记忆用单层因果 GRU 编码最近的六维末端力与力矩序列,隐层宽 512,输出宽 1024。传感器原始采样率超过 1000 Hz,降采样到 10 Hz 后与动作流对齐。力交叉注意力还带一个延迟对齐因果掩码,偏移 L 设为 3,用来屏蔽推理完成时还拿不到的力测量,免得输出一个已经过时的动作。
20 到 30 条在线数据是怎么用起来的
在线阶段一次实验大约持续 2 到 3 小时,采集 20 到 30 个 episode。真正进训练集的不是整段 episode,而是人类介入的那些帧。操作者在策略停滞、力轨迹超过硬件安全阈值或 episode 超长时接管,只有接管帧进入在线纠正集。训练器每 100 个 training step 把新 checkpoint 推到推理服务器,形成采集、后训练、再部署的闭环。
混合训练用固定的 1 比 1 离线在线采样比。纯视觉批次用零力占位符并在交叉注意力前屏蔽力记忆,切断对力编码器的梯度;在线纠正批次保留真实力记忆,更新力通路与反应分支。
三个任务的分数
对比基线是同样走在线 DAgger 的纯视觉 π0.5。官方披露的分数变化是这样。
| 任务 | 纯视觉在线 DAgger | LIFT | 说明 |
|---|---|---|---|
| 叠毛巾 | 73.3 | 84.2 | 分阶段打分,完成第二次折叠得满分 |
| 插书 | 36.7 | 58.3 | 含无碰撞插入、推书脊至完全插入 |
| 汉诺塔圆环放置 | 26.7 | 56.7 | 二值成功率,环完全落座才计 1 |
论文表格里对应的是峰值成绩,例如插书基线峰值 0.4、LIFT 峰值 0.6,汉诺塔基线峰值 0.3、最终 0.2,LIFT 峰值与最终都是 0.6。每个检查点用 3 组共 30 次自主 rollout 评估。
消融里有一个反直觉的结果值得单独看。去掉反应式力记忆、只给单帧力输入时,叠毛巾的峰值反而升到 0.95,但插书峰值只有 0.4,汉诺塔峰值 0.5 之后一路跌到 0.1、0、0.1。插书和汉诺塔这类任务需要判断自己处在接触的哪个相位,这个判断依赖一小段力历史,单帧力不够。
实验平台与论文自己写的局限
硬件是单臂 Flexiv Rizon 4S 协作臂配 Robotiq 2F-85 平行爪夹爪,位置控制模式跑 10 Hz,腕部装一台 iPhone 提供 10 Hz 单目 RGB。力反馈演示通过 Flexiv TDK 的双边主从配置采集,操作者动主动臂,从动臂测到的接触力回传给主动臂。每次训练用单节点 8 张 A800,代码基于 openpi,主干是 π0.5。
论文列出的局限有三条。人工介入限制了数据采集效率,也给操作员带来持续判断的负担。接管时机不容易判断,需要熟练操作员,时机本身还会影响纠正数据的质量。所有实验只在单臂平台上做过,双臂任务是留给后续的工作。
为什么这条线值得跟
具身这边过去一年的主流解法是加数据、加仿真、加世界模型,都是往上游补。LIFT 把力气花在了下游:预训练负责先验,后训练只补一个高频率、低维度、和具体硬件绑定的模态,而且用 20 到 30 条在线数据就把接触行为教会了。作者认为这套范式对任何以 MoT 为基础架构的预训练模型都适用,不只是 VLA。
对做工程的人来说,更实际的信号是那个慢快分离:昂贵的视觉语言上下文一秒算一次,便宜的力反馈每步都算。这条结构不需要改预训练模型,也不需要重采大规模数据,门槛比重建基础模型低得多。
参考信源
- Yi Wang 等《Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection》,arXiv:2607.14236v2,CoRL 2026 收录
- 项目主页 lift-policy.github.io;代码 github.com/y-wng/lift
- 机器之心 2026-09-27 报道(三个任务的分数对比)
- FutureX Physical AI Daily Issue 133(2026-09-28)
- 论文附录 D、H、J 关于传感器频率、残差基线与在线实验耗时的说明
#具身智能 #VLA #机器人操作
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。