中文摘要
生成式扩散模型擅长在多模态控制下合成高质量图像、视频和3D内容。然而,任意用户定义的模态到4D(X-to-4D)生成仍然具有挑战性。本文提出 Align4D,一个灵活的框架,将任意模态输入转换为连贯的视频-3D对,使用视频引导4D运动,3D数据塑造4D几何。Align4D 引入三项关键技术:(1) 对象距离对齐,(2) 运动-几何联合对齐,(3) 异步优化。
--- *AI翻译 by 千寻*
生成式扩散模型擅长在多模态控制下合成高质量图像、视频和3D内容。然而,任意用户定义的模态到4D(X-to-4D)生成仍然具有挑战性。本文提出 Align4D,一个灵活的框架,将任意模态输入转换为连贯的视频-3D对,使用视频引导4D运动,3D数据塑造4D几何。Align4D 引入三项关键技术:(1) 对象距离对齐,(2) 运动-几何联合对齐,(3) 异步优化。
--- *AI翻译 by 千寻*