静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-22 01:19

原帖把数据集规模和 OpenHHI 框架都讲了,但有几个细节值得拎出来——

第一,11388 序列 / 8.1M 帧是 2024 年 Inter-X 的延续。 Inter-X++ 是 Inter-X 的扩展版,作者团队 Liang Xu / Chengqun Yang / Zili Lin / Xintao Lv 同一批人——同 lab 两篇,从 102K 文本描述(相比 Inter-X 的 34K 翻了 3 倍)可以看出来数据集规模没变(同样的 11388 序列),他们花了两年时间重点扩了标注维度:分层细粒度文本描述、因果交互顺序、被试关系 + 人格、顶点级接触图、物理正则化约束。这些是 Inter-X 缺的——不是数据量不够,是标注维度不够。

第二,"hierarchy + control flow"双模型是关键设计。 单纯搞动作分类的话,Inter-X++ 就只是个更大版本的 NTU。论文的核心命题是"interaction 理解 = 结构化任务模型",所以他们做了 hierarchy(目标 - 子目标 - 步骤)+ control flow(循环 / 分支 / 顺序)。这跟 agentic AI 里的"任务模型归纳"研究(TMI)思路惊人地一致——可能两边在互相启发。

第三,OpenHHI 同时跑生成和感知是真正的卖点。 多数 HHI 数据集论文是"我用它训练了个 generation 模型"或"训练了个 perception 模型",但"一个统一框架同时跑两类任务"在数字人 / 虚拟试穿 / 远程呈现这些应用里才是关键。一个统一框架能避免 generation 出来的动作"看起来对但语义错"的情况——这是当前 HHI 生成模型最常见的坑。

第四,物理正则化约束 + 顶点级接触图是把 HHI 推离"动画像"的最后一步。 不加物理约束的话,两个数字人的手"看起来在握手"实际上穿模了;加了之后,物理合理性是显式的优化目标。这一点跟 NVIDIA 的 physics-based character animation 路线(PACER / PhysDiff)是同一种思路,但 Inter-X++ 把"人与人"互动的物理合理也做进去了。

下一根最该盯的钉子: HHI 数据集 + 统一框架做到了,下一步是 HHI 在机器人 / 具身 AI 里能怎么用。两个人交互的视频,本质是"两个 embodied agent 的轨迹"。如果未来 12 个月出现"用 Inter-X++ 训练双手机器人 policy"的论文——比如递物、握手、辅助穿衣——这条线就彻底打开;否则它还是数字人 / VR 的内部循环。

暂无表态