「人形机器人的『身体教材』终于有了像样的开源库」——诺亦腾 HiPHI 617.5 小时动捕 + NVIDIA Isaac Video-to-Data + SONIC 全栈控制同日交卷
2026 世界机器人大会(WRC)期间,具身智能领域罕见地同一天拿到三张互相咬合的关键拼图:动捕数据、视频提炼算法、全身控制模型同时开源。三件事合起来,意味着「数据从哪来 → 数据怎么用 → 模型怎么训」这条闭环第一次有了工业级的开源参考实现。
一、诺亦腾 HiPHI:617.5 小时亚毫米级光学动捕,WRC 现场开源
诺亦腾机器人在 WRC 期间正式发布并开源 HiPHI(High Precision Human Interaction)数据集,数据卡已经上线 Hugging Face。三个关键数字:
- 总时长 617.5 小时,合计 2.001 亿帧;
- 132 名动捕演员参与,90 Hz 频率采集,亚毫米级光学动捕精度;
- 拆解成两半:371.8 小时全身人体运动数据 + 245.7 小时人-物交互(HOI)数据(含左右镜像)。
第一,精度等级。这是「专业动捕级别」的真采数据,不是从互联网视频里 pose estimation 抽出来的近似姿态。亚毫米级意味着每个关节旋转、每个手指动作都可以被映射回机器人关节空间。
第二,「动作 + 交互」同步。HOI 部分同步给出物体轨迹与对应 OBJ 网格。当一个人拿起杯子、坐下或推门时,机器人不仅能看到人的动作,还能精确知道物体在三维空间中的位置变化。这种「人-物」同步数据是训练机器人理解物理世界因果关系的基础。
第三,数据组织方式。依据 FrameNet 动作语义组织,以「动作单元」做结构化整理,直接面向 VLA(视觉-语言-动作)模型的训练需求。
数据采集本身的高门槛意味着商业使用需要单独授权(官方采用 ModalityNet Open Research License,仅限研究用途),但对学术圈和开源社区而言,这是目前市面上精度最高、规模最大、组织最规范的开源人体运动数据集。值得一提的是,基于 HiPHI 训练的模型已经在宇树 G1 真机部署,实现了跑步、坐下、爬行、搬运箱子和拖拉行李箱等动作,跨域差距(sim-to-real gap)被显著压缩。
二、NVIDIA Isaac Video-to-Data:把「YouTube 视频」自动炼成「机器人训练数据」
诺亦腾走的是「精雕细琢」路线,NVIDIA 走的是「批量提炼」路线。同一周,NVIDIA 正式开源 Isaac Video-to-Data 工具链,定位与 HiPHI 互补——它能将真实人类演示视频自动转化为仿真资产与训练数据,再部署回物理机器人,打通「真实→仿真→真实」的闭环。
工具链包含四个核心模块:
- 视频摄取 Agent(Vision Ingestion Agent):自动切分长视频并按动作片段检索;
- 手部/物体/身体重建器:还原手部动作、6-DoF 轨迹、深度网格;
- 仿真重定向:把人体动作重定向到任意机器人本体,在 Isaac Lab 中训练 RL 策略;
- CHORD(Contact Wrench Guidance From Human Demonstration):用接触力引导灵巧操作。
三、SONIC:一个模型管全身,42M 参数跑 700 小时动捕
NVIDIA 同步发布 SONIC(Simulating Open-source Neural Intelligence for Control),一个开源全身控制模型。三个数字说明它的能力上限:
- 训练数据:700 小时动捕、1 亿+ 运动帧;
- 模型规模:最大 42M 参数;
- 算力消耗:128 张 GPU、约 21,000 GPU 小时。
真机表现:在宇树 G1 上跑 123 条真实运动序列,成功率 99.2%;接入 VLA 模型后,5 类全身任务(取物 + 手脚协同)平均成功率 75%。这是工业级 sim-to-real 迁移能力。
四、三件事合起来意味着什么
过去三年,人形机器人领域一直被一个「鸡生蛋」问题困住:仿真器训出来的策略在真机不好用;真机好用的策略每个技能都要单独造一个控制器。HiPHI + Video-to-Data + SONIC 这套组合拳第一次同时回应了三个问题:
- 高质量真采数据从哪里来(HiPHI);
- 视频数据如何低成本的转成训练数据(Video-to-Data);
- 全身控制能不能不靠每个技能单独造一个控制器(SONIC)。
参考来源:IT之家 2026-08-22「诺亦腾机器人发布 HiPHI」、AIQUEST 报道、NVIDIA 官方 GitHub + Hugging Face、Nivlecreto 技术解读、光明网 2026-08-24「破题具身智能数据荒 北京中关村机器人训练基地揭秘」。