[论文] InfiniHand: Streaming World-Space Hand Motion Estimation from Egocentr...

研究领域: CV 作者: Kerui Ren, Kaiwen Song, Weiguang Zhao, Yuxi Wang, Yufei Liu, Bo Dai, Haoyu Guo, Chunhua Shen, Mulin Yu, Tao Lu, Junting Dong 发布时间: 2026-09-28 arXi…

论文概要

研究领域: CV 作者: Kerui Ren, Kaiwen Song, Weiguang Zhao, Yuxi Wang, Yufei Liu, Bo Dai, Haoyu Guo, Chunhua Shen, Mulin Yu, Tao Lu, Junting Dong 发布时间: 2026-09-28 arXiv: 2609.35743

中文摘要

从第一人称视角视频估计世界空间手部运动需要恢复 3D 铰接手部几何同时跟踪相机自运动。现有方法严重依赖级联的独立手部姿态估计器和 SLAM 系统,导致误差累积、流水线复杂和严重的计算开销。为此我们提出 InfiniHand,一个端到端流式前馈框架,从未标定的第一人称视频直接联合估计 MANO 参数、相机轨迹和手部位置。InfiniHand 将持久时空记忆与手部中心视觉特征相结合,在统一架构内显式耦合相机运动与局部手部几何。我们通过两个渐进阶段训练 InfiniHand:首先学习鲁棒的相机空间手部先验,然后扩展到流式世界空间重建。为此我们聚合了来自多个公开数据集约 5,000 小时的第一人称数据。大量评估表明,InfiniHand 在域内基准上优于 SOTA 基线,与 ViDiHand 相比 ARCTIC PA-p 降低 21.4%,同时显著缓解了世界空间漂移。此外,InfiniHand 稳健泛化到野外视频,以 11.19 FPS 运行,吞吐量是 HaWoR 的两倍以上。

原文摘要

World-space hand motion estimation from egocentric video requires recovering 3D articulated hand geometry while tracking camera egomotion. Existing approaches heavily rely on cascading independent hand pose estimators and SLAM systems, resulting in error accumulation, complex pipelines, and severe computational overhead. To address these limitations, we present InfiniHand, an end-to-end streaming feed-forward framework that jointly estimates MANO parameters, camera trajectories, and hand locations directly from uncalibrated egocentric video. InfiniHand integrates persistent spatiotemporal memory with hand-centered visual features, explicitly coupling camera motion with local hand geometry within a unified architecture. We train InfiniHand in two progressive stages by first learning robust ...


*自动采集于 2026-09-30*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

坐在颠簸的车里看自己的手:手没动,世界在晃。第一人称手部追踪的全部难点就藏在这句话里——要估计手的几何,得先弄清头怎么动,两件事咬在一起。老做法交给两段管线,误差在接缝处对不上账。这篇把它们揉进了同一个前馈网络。

手没动,是世界在晃

一、21.4% 的全称

ARCTIC 上 PA-p 从 9.82 降到 7.72 毫米。21.4% 是相对降幅,绝对差 2.10 毫米;PA-p 是 Procrustes 对齐后的 3D 关节误差,带漏手惩罚。真正的猛料在 EgoDex:PA-p 17.22 → 7.29(−57.7%),世界坐标 W-MPJPE 78.41 → 28.77(−63.3%)。数据集之间差出一个量级,引用这条结论时,数据集名得跟着数字走。

二、换个口径,光就暗了

世界坐标 W-MPJPE 在 ARCTIC 上只从 65.86 降到 59.21,对 WiLoR-SLAM 是 10.1%;2D 投影误差 EPE-p 23.13,反而差于 ViDiHand 的 12.41。摘要的 21.4% 属实,但它量的是相机空间,标题里写的可是世界空间。

三、速度的账没有硬件

11.19 FPS 对 HaWoR 5.48,2.04 倍;WiLoR-SLAM 8.53,Dyn-HaMR 0.81。可全文找不出一个 GPU 型号,只有一句「standard timing protocols」。这条数字目前无法复现,引用时带上「硬件未披露」。

四、承重墙在哪,消融说了算

去掉第二阶段,W-MPJPE 从 59.21 炸到 185.76;把 mask head 换成 HaWoR 的,PA-p 从 7.72 恶化到 25.50;去掉 Bundle Adjustment,59.21 → 80.48。PA-p 的领先几乎全压在定位与外观模块上,骨干本身没那么神。

五、数据的边角与三条硬 limitation

语料约 5000 小时,九个公开数据集:ARCTIC、HOT3D、EgoDex、DexYCB、HO3D、H2O-3D、EgoVerse、EgoLive、Xperience-10M——注意 Ego4D 不在训练集里,只用于野外定性展示。第二阶段只用带相机轨迹标注的子集,清洗再丢三到四成。limitation 原文三条都硬:底层建图没有固有米制尺度,误差沿链传播;双手大幅度交互数据稀缺,快视角变化和重遮挡顶不住;单目伪标注带时变尺度漂移,长序列轨迹精度受损。仓库 infinihand/InfiniHand 目前只有项目页,无 license,训练代码未放。

下一根钉子

长序列尺度漂移什么时候修。要是下一版给管线加一个米制尺度锚(IMU 或双目都行),W-MPJPE 那 10.1% 的差距能不能追平——追平了,它才算得上一篇「世界空间也能打」的论文,标题里的 world-space 才算名副其实。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens