让机器人站着不动抓个杯子,已经不难。难的是边走边干:穿过厨房,两只手配合,一只扶着锅,一只拿铲子翻菜。移动双臂灵巧操作,学界公认的人形机器人硬骨头之一。
卡脖子的地方很俗:数据。遥操作采集这种全身+手指的演示,贵得离谱。9 月 28 日挂上 arXiv 的一篇论文(编号 2609.35761)给了一条省钱的解法,名字叫 DexRoam——让人做,机器人看。
🕹️ 人是最便宜的演示源
第一视角人类演示看着是天然的数据矿。可以往的方法为了方便迁移,会把人的动作做简化:丢掉躯干、压平手指、把连续运动切成关键帧。省了事,也把任务最依赖的东西丢了——走路、转腰、张合手指,这些动作在真实任务里是搅在一起连续发生的,拆开就不再是原任务。
DexRoam 的取舍反过来:从头到尾不简化。全身运动在整个"人到机器人"的迁移过程里保持连续耦合。
📦 免动捕的采集
采集设备清单短得可疑:一台消费级 VR 头显,加一个头戴双目相机。完事。没有外部相机阵列,没有反光点,没有动捕棚。
戴上头显干活,头显自己输出头手位姿,双目相机补手指的细节。以前建一套同等质量的采集环境,预算按万算;现在按一台头显算。
🔧 三道对齐,一道不能少
人的身体和机器人的身体长得不一样,直接照搬动作行不通。DexRoam 拆出三道显式对齐:本体对齐管"你的胳膊和它的胳膊"的映射,动作语义对齐管"这个动作意味着什么",时序对齐管"什么时候发生"。三段全部走完,人类的演示和机器人的演示才能倒进同一个标准 VLA 训练池里一起学。
消融实验把三道工序挨个拆掉验证,结论干脆:缺任何一道,效果都掉。这不是能省的流程,是承重墙。
📊 两个底座,两倍上下的提升
真机实验挑了两个现成的 VLA 底座各训了一遍。GR00T N1.7 底座,平均成功率从 29% 涨到 56%;pi0.5 底座,从 32% 涨到 57%。将近翻倍。
还有一句更狠的:混入人类演示后,只用一半的机器人演示数据,就能追平纯机器人数据训练的成绩。演示贵,人类的演示便宜,这笔账怎么算都划算。
🧭 值得关注的原因
机器人行业眼下最挤的赛道就是数据:各家都在烧钱建遥操作团队、搭采数据工厂。这篇论文给出的是另一个方向的证据——人类的身体本身就是一座数据矿,而且开采工具已经便宜到一台头显。
同一天挂出的 arXiv 上还有多篇同方向的工作,人形机器人向人类演示要数据的路线正在扎堆成形。采集成本每降一个量级,这条路的护城河就深一分。下一次看到"人形机器人数据工厂"的融资新闻,可以拿"一台头显够不够"这个问题去掂量掂量。
- 信源:arXiv 2609.35761 摘要全文(9 月 28 日提交,真机实验数据来自论文摘要自述);底座 GR00T N1.7 与 pi0.5 为论文自述的现成 VLA 模型
- 限定:成功率数字为论文自报的真机结果,第三方复现尚未出现;"一半数据追平"是论文表述的对比结论,具体任务集合与实验规模需等正文与代码细节
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。