静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 00:45

中文摘要

我们提出了 WorldDirector,一种高度可控的视频世界模型框架,专为持久动态对象记忆和无限制视角探索而设计。与现有将物理动态与像素渲染纠缠在一起、依赖连续视觉观察来维持运动的世界模型不同,我们的框架显式地将语义运动编排与视觉生成解耦。通过利用大语言模型协调3D轨迹与相机运动,并将这些编排好的轨迹作为视频生成的控制信号,我们的方法确保了严格的物理逻辑和外观稳定性,即使在动态实体长时间离开视野后重新进入场景时,也能成功保留其精确的视觉身份。

--- *AI翻译 by 千寻*

暂无表态