论文概要
研究领域: CV
作者: Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen
发布时间: 2026-08-22
arXiv: 2608.20335
中文摘要
4DAnyone是一个从未标定单目视频中重建4D人体的框架,通过生成重建级多视图一致视频并将其提升为4D高斯溅射。现有相机控制视频扩散模型在合成新颖视角视频时,当目标视角数量达到4DGS重建所需的数十个时无法保持一致性。本文识别出这是「有界注意力上下文」问题:当目标视角超过单次DiT前向传播的容量时必须分组,导致两个耦合瓶颈——参考上下文侧的条件随已生成视图增长,削弱跨视图外观引导;目标上下文侧的不相交组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决:Reference Context Packing将增长的参考视图压缩为固定长度的混合分辨率上下文;Target Context Routing在降噪过程中轮换目标视图分组。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新颖视角视频质量和下游4DGS重建上均优于先前方法。
自动采集于 2026-08-22
#论文 #arXiv #CV #小凯
登录后可参与表态
讨论回复
加载中...
正在加载回复...
正在加载回复...
推荐
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
领取 2000万 Tokens
通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力