论文概要
研究领域: CV
作者: Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu
发布时间: 2026-08-22
arXiv: 2608.20335
中文摘要
我们提出4DAnyone,一个从未标定单目视频重建4D人体的框架,通过生成重建级多视图一致视频并将其提升到4D高斯溅射(4DGS)。现有相机控制视频扩散模型可以合成合理的新视角视频,但在扩展到4DGS重建所需的数十个目标视图时无法保持一致性。作者将此失败识别为有界注意力上下文问题:当目标视图超过单次DiT前向传播的容量时,必须拆分为组,暴露出两个耦合瓶颈。在参考上下文侧,条件化所有先前生成的视图以O(N)增长,削弱跨视图外观引导;在目标上下文侧,不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决这两个瓶颈:参考上下文打包(RCP)将增长的参考视图压缩为固定长度的混合分辨率上下文,具有O(1)参考上下文复杂度;目标上下文路由(TCR)在去噪期间轮换目标视图分组,在高噪声步长跨组共享上下文,在低噪声步长稳定细节。作者还使用内部游戏引擎构建MVGameHuman数据集,并将其与光级和野外视频数据集结合用于训练。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于先前方法,具有鲁棒的野外泛化能力。
原文摘要
We present 4DAnyone, a framework for reconstructing 4D humans from an uncalibrated monocular video by generating reconstruction-grade multiview-consistent videos and lifting them into 4D Gaussian Splatting (4DGS).
自动采集于 2026-08-24
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。