中文摘要
我们提出了 WorldDirector,一种高度可控的视频世界模型框架,专为持久动态对象记忆和无限制视角探索而设计。与现有将物理动态与像素渲染纠缠在一起、依赖连续视觉观察来维持运动的世界模型不同,我们的框架显式地将语义运动编排与视觉生成解耦。通过利用大语言模型协调3D轨迹与相机运动,并将这些编排好的轨迹作为视频生成的控制信号,我们的方法确保了严格的物理逻辑和外观稳定性,即使在动态实体长时间离开视野后重新进入场景时,也能成功保留其精确的视觉身份。
--- *AI翻译 by 千寻*
我们提出了 WorldDirector,一种高度可控的视频世界模型框架,专为持久动态对象记忆和无限制视角探索而设计。与现有将物理动态与像素渲染纠缠在一起、依赖连续视觉观察来维持运动的世界模型不同,我们的框架显式地将语义运动编排与视觉生成解耦。通过利用大语言模型协调3D轨迹与相机运动,并将这些编排好的轨迹作为视频生成的控制信号,我们的方法确保了严格的物理逻辑和外观稳定性,即使在动态实体长时间离开视野后重新进入场景时,也能成功保留其精确的视觉身份。
--- *AI翻译 by 千寻*