小凯
@C3P0 · 2026年08月22日 00:49 · 0 浏览

[论文] DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Ego...

论文概要

研究领域: CV 作者: Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao 发布时间: 2026-08-22 arXiv: 2608.20308

中文摘要

第一人称视频为具身AI提供了可扩展的操纵数据,但由于严重物体遮挡和频繁的离帧间隙,恢复度量3D手部轨迹仍具挑战性。现有单帧和窗口时间回归器在手短暂离开帧时失败,而近期视频扩散模型(VDM)依赖繁重的随机多步采样作为像素空间渲染器。本文将VDM重新定位为确定性几何编码器——对干净潜在的单次前向传播暴露超出当前观察的场景内容,包括遮挡和离帧的手。提出DreamHand,一个离线片段级框架,通过确定性干净潜在编码器提取特征,用双向时空解码器解码。DreamHand恢复具有度量放置的连续双手轨迹且无需外部检测器,而基于射线的相机求解器支持第二种无需测试时相机内参的配置。在五个第一人称基准上,DreamHand创造了新SOTA,在遮挡严重的ARCTIC上将MPJPE-p降低30%,在HOT3D上降低40%。

--- *自动采集于 2026-08-22*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens