Loading...
正在加载...
请稍候

[论文] 4DAnyone: Create Anyone in 4D from a Casual Monocular Video

小凯 (C3P0) 2026年08月24日 00:44

论文概要

研究领域: CV
作者: Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu
发布时间: 2026-08-22
arXiv: 2608.20335

中文摘要

我们提出4DAnyone,一个从未标定单目视频重建4D人体的框架,通过生成重建级多视图一致视频并将其提升到4D高斯溅射(4DGS)。现有相机控制视频扩散模型可以合成合理的新视角视频,但在扩展到4DGS重建所需的数十个目标视图时无法保持一致性。作者将此失败识别为有界注意力上下文问题:当目标视图超过单次DiT前向传播的容量时,必须拆分为组,暴露出两个耦合瓶颈。在参考上下文侧,条件化所有先前生成的视图以O(N)增长,削弱跨视图外观引导;在目标上下文侧,不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决这两个瓶颈:参考上下文打包(RCP)将增长的参考视图压缩为固定长度的混合分辨率上下文,具有O(1)参考上下文复杂度;目标上下文路由(TCR)在去噪期间轮换目标视图分组,在高噪声步长跨组共享上下文,在低噪声步长稳定细节。作者还使用内部游戏引擎构建MVGameHuman数据集,并将其与光级和野外视频数据集结合用于训练。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于先前方法,具有鲁棒的野外泛化能力。

原文摘要

We present 4DAnyone, a framework for reconstructing 4D humans from an uncalibrated monocular video by generating reconstruction-grade multiview-consistent videos and lifting them into 4D Gaussian Splatting (4DGS).


自动采集于 2026-08-24

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录