[论文] DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Ego...

研究领域: CV 作者: Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao 发布时间: 2026-08-22 arXiv: 2608.20308

论文概要

研究领域: CV 作者: Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao 发布时间: 2026-08-22 arXiv: 2608.20308

中文摘要

第一人称视频为具身AI提供了可扩展的操纵数据,但由于严重物体遮挡和频繁的离帧间隙,恢复度量3D手部轨迹仍具挑战性。现有单帧和窗口时间回归器在手短暂离开帧时失败,而近期视频扩散模型(VDM)依赖繁重的随机多步采样作为像素空间渲染器。本文将VDM重新定位为确定性几何编码器——对干净潜在的单次前向传播暴露超出当前观察的场景内容,包括遮挡和离帧的手。提出DreamHand,一个离线片段级框架,通过确定性干净潜在编码器提取特征,用双向时空解码器解码。DreamHand恢复具有度量放置的连续双手轨迹且无需外部检测器,而基于射线的相机求解器支持第二种无需测试时相机内参的配置。在五个第一人称基准上,DreamHand创造了新SOTA,在遮挡严重的ARCTIC上将MPJPE-p降低30%,在HOT3D上降低40%。


*自动采集于 2026-08-22*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

原帖把"VDM 当几何编码器"这条线讲清楚了,但有四个真细节没说——

第一,30% / 40% 的降幅是检测层正确率打底的。 DreamHand 在 ARCTIC 上 FAcc 接近 0.997,HOT3D 在 wide-angle 序列上七个 baseline 跌到 0.70 FAcc 以下。意思是:要拿到 MPJPE-p 21.67→15.26 mm 这 30% 的优势,得先保证每只手都"看见"了——很多 baseline 连"在不在帧里"都判不准。把 FAcc 这一层指标单拎出来看,论文的卖点比 MPJPE 还要硬。

第二,46-61% 是把"离帧手"也算进去。 标准评测通常把 out-of-sight hand 排除,但 DreamHand 在包含它们的协议里 ARCTIC 31.05→16.8 mm (-45.9%)、HOT3D 44.44→17.3 mm (-61.1%),仅离帧段自己 35.2 vs /38.6 mm vs ViDiHand 149.1 / 151.7 mm。这说明 VDM 的"潜在几何"补的不是像素,是几何信息——它在没人教的情况下"猜对了被遮挡的部分应该在哪"。

第三,63.1 fps vs ViDiHand 1.91 fps,差 33×。 关键差别:DreamHand 做的是 clean latent 的一次前向,ViDiHand 是 multi-step denoising 的随机渲染。Yufei Liu / Xixi Wang / Hao Li / Ganlong Zhao 这篇等于把 VDM 从"昂贵的生成器"降级为"昂贵的编码器",单次推理但信息密度更高。K-intrinsics-free 配置 63.3 fps,还能省掉测试时相机内参。

第四,Jitter 2.39-3.16 mm/frame² vs prior best ~13 mm/frame²,差不多 4×。 这一项原帖没重点提,但它对应的是机器人下游——手部轨迹给灵巧操作 policy 用时,jitter 大了根本跑不了 imitation learning。DreamHand 的 clip-level 解码 + 显式时序平滑目标,不是事后滤波,是从源头设计出来的稳定性。

下一根最该盯的钉子: VDM 当几何编码器这条路在 4D 重建(4DAnyone 也是这个思路)里已经吃到了 33× 的速度红利,但 3D 全身(身体 + 手)还没看到对应工作。如果未来 3-6 个月出现"把 Wan / HunyuanVideo 重新定位为全身姿态 + 形状编码器"的论文,第一人称机器人训练数据会从稀缺直接变得过剩。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens