[论文] Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Intera...

研究领域: CV 作者: Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv 发布时间: 2026-08-22 arXiv: 2608.20312

论文概要

研究领域: CV 作者: Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv 发布时间: 2026-08-22 arXiv: 2608.20312

中文摘要

感知和合成人与人交互的能力是开发智能数字人系统的根本。然而现有数据集和建模方法受低保真运动学、缺乏灵巧手势和丰富多模态标注严重不足的根本限制。本文提出Inter-X++,一个全面的大规模基准,通过新型混合动作捕捉系统采集,提供11,388个高保真交互序列和超过810万帧,具有精确的全身运动和详细的手指关节。同时用多方面标注丰富数据基础,包括分层细粒度文本描述、交互类别、因果交互顺序、被试关系和个性,以及顶点级接触图和物理正则化约束。利用这些标注,制定了统一测试平台,涵盖四类下游任务,对称跨越生成和感知范式。提出OpenHHI,统一的HHI表示和建模框架,联合优化交互重建和语义理解。大量实验表明OpenHHI在生成和感知任务上均达到最先进性能。


*自动采集于 2026-08-22*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

原帖把数据集规模和 OpenHHI 框架都讲了,但有几个细节值得拎出来——

第一,11388 序列 / 8.1M 帧是 2024 年 Inter-X 的延续。 Inter-X++ 是 Inter-X 的扩展版,作者团队 Liang Xu / Chengqun Yang / Zili Lin / Xintao Lv 同一批人——同 lab 两篇,从 102K 文本描述(相比 Inter-X 的 34K 翻了 3 倍)可以看出来数据集规模没变(同样的 11388 序列),他们花了两年时间重点扩了标注维度:分层细粒度文本描述、因果交互顺序、被试关系 + 人格、顶点级接触图、物理正则化约束。这些是 Inter-X 缺的——不是数据量不够,是标注维度不够。

第二,"hierarchy + control flow"双模型是关键设计。 单纯搞动作分类的话,Inter-X++ 就只是个更大版本的 NTU。论文的核心命题是"interaction 理解 = 结构化任务模型",所以他们做了 hierarchy(目标 - 子目标 - 步骤)+ control flow(循环 / 分支 / 顺序)。这跟 agentic AI 里的"任务模型归纳"研究(TMI)思路惊人地一致——可能两边在互相启发。

第三,OpenHHI 同时跑生成和感知是真正的卖点。 多数 HHI 数据集论文是"我用它训练了个 generation 模型"或"训练了个 perception 模型",但"一个统一框架同时跑两类任务"在数字人 / 虚拟试穿 / 远程呈现这些应用里才是关键。一个统一框架能避免 generation 出来的动作"看起来对但语义错"的情况——这是当前 HHI 生成模型最常见的坑。

第四,物理正则化约束 + 顶点级接触图是把 HHI 推离"动画像"的最后一步。 不加物理约束的话,两个数字人的手"看起来在握手"实际上穿模了;加了之后,物理合理性是显式的优化目标。这一点跟 NVIDIA 的 physics-based character animation 路线(PACER / PhysDiff)是同一种思路,但 Inter-X++ 把"人与人"互动的物理合理也做进去了。

下一根最该盯的钉子: HHI 数据集 + 统一框架做到了,下一步是 HHI 在机器人 / 具身 AI 里能怎么用。两个人交互的视频,本质是"两个 embodied agent 的轨迹"。如果未来 12 个月出现"用 Inter-X++ 训练双手机器人 policy"的论文——比如递物、握手、辅助穿衣——这条线就彻底打开;否则它还是数字人 / VR 的内部循环。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens