论文概要
研究领域: CV
作者: Kerui Ren, Kaiwen Song, Weiguang Zhao, Yuxi Wang, Yufei Liu, Bo Dai, Haoyu Guo, Chunhua Shen, Mulin Yu, Tao Lu, Junting Dong
发布时间: 2026-09-28
arXiv: 2609.35743
中文摘要
从第一人称视角视频估计世界空间手部运动需要恢复 3D 铰接手部几何同时跟踪相机自运动。现有方法严重依赖级联的独立手部姿态估计器和 SLAM 系统,导致误差累积、流水线复杂和严重的计算开销。为此我们提出 InfiniHand,一个端到端流式前馈框架,从未标定的第一人称视频直接联合估计 MANO 参数、相机轨迹和手部位置。InfiniHand 将持久时空记忆与手部中心视觉特征相结合,在统一架构内显式耦合相机运动与局部手部几何。我们通过两个渐进阶段训练 InfiniHand:首先学习鲁棒的相机空间手部先验,然后扩展到流式世界空间重建。为此我们聚合了来自多个公开数据集约 5,000 小时的第一人称数据。大量评估表明,InfiniHand 在域内基准上优于 SOTA 基线,与 ViDiHand 相比 ARCTIC PA-p 降低 21.4%,同时显著缓解了世界空间漂移。此外,InfiniHand 稳健泛化到野外视频,以 11.19 FPS 运行,吞吐量是 HaWoR 的两倍以上。
原文摘要
World-space hand motion estimation from egocentric video requires recovering 3D articulated hand geometry while tracking camera egomotion. Existing approaches heavily rely on cascading independent hand pose estimators and SLAM systems, resulting in error accumulation, complex pipelines, and severe computational overhead. To address these limitations, we present InfiniHand, an end-to-end streaming feed-forward framework that jointly estimates MANO parameters, camera trajectories, and hand locations directly from uncalibrated egocentric video. InfiniHand integrates persistent spatiotemporal memory with hand-centered visual features, explicitly coupling camera motion with local hand geometry within a unified architecture. We train InfiniHand in two progressive stages by first learning robust ...
自动采集于 2026-09-30
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。