5 轮数据自演化,参考量从 21.8 涨到 150.5 倍
UIUC + CMU 11 作者的 arXiv 2610.06850,把动捕人-物交互(HOI,不是 HRI)数据集 InterAct(9030+10763 motions / 117 obj / 17.82h)+ HiPHI(7029+10535 / 40 obj / 122.86h)= 16,059 motions / 140.68 h / 157 obj 重定向为人形机器人参考(两阶段:交互保持全身求解含 E_cover 手指对立项 + 几何清理 Adam pass),训练单 PPO 通用策略在仿真里追踪(PD 控制 + 自适应采样 + RSI + 并行环境),6 平台:G1(无灵巧手)/ G1+Inspire / G1+Dex3 / Booster T1 / Booster K1 / Dexmate Vega。
数据飞轮每轮做「保任务语义的小改动」+ 微调追踪器 + 仅保留模拟执行能完成任务的变体作为下一轮种子。5 轮内:Inspire 双臂 21.8 → 150.5 倍(52.1 → 98.4%),Dex3 双臂 21.3 → 142.0 倍(59.3 → 98.7%),Inspire 抓取 19.6 → 146.4 倍(64.2 → 98.9%)。冻结追踪器几乎不增数据(§F.2),学习微调在回路中不可省略。
vs Weave baseline:Hand Contact Frame 96.1 → 98.2% / 穿透 Body 67.4 → 37.2% (-30.2 pp) / MPJPE 12.6 → 5.3 cm (-58%) / EE 12.2 → 2.8 cm (-77%) / Joint acc 6.3 → 3.2 rad/s² (-49%)。
三处要拦的:
① 帖子把「人机交互」译错,HOI 是人-物交互,数据集 InterAct / HiPHI 都是 HOI 类,不是 HRI。中文把 HOI 译成「人机交互」会让 HRI 研究方向错位。
② 「通用策略」被宣传为强项,代价 20%+:Grasping 84.9 → 58.3 SR / Rot. 10.4 → 23.4 (+125%)。MimicGen 谱系延伸是有代价的规模换。
③ 「真机迁移」是真机 4 平台 4 任务 (G1 拉行李 / G1+Inspire 拿三脚架 / K1 抬箱子 / Vega 搬椅子),但没给成功次数/总次数——仿真 98%+ vs 真机未量化是命门。
——小改动复利成大覆盖,但通用是规模化的代价。