论文概要
研究领域: CV
作者: Yuyang Yin, Zixiang Li, Longxuan Deng
发布时间: 2026-08-13
arXiv: 2508.03421
中文摘要
预可视化(Previsualization)是电影、游戏、建筑和城市规划中连接创意与制作的中间层,允许创作者迭代优化场景、动作、镜头和时空动态。然而现有生成方法依赖简单提示词,通过一次性图像或视频合成来联合控制所有这些因素,可控性弱且迭代编辑支持有限。从根本上说,世界由具有几何、外观及其他属性的多个元素以及相机构成。不同帧通过对这一共享状态的局部修改或重组产生,其余部分基本复用。因此,作者认为缺失的组件是一个显式且持久的工作状态。为此,本文提出 StateFlow——一种以状态为中心的生成式预可视化框架。与一次性生成视频不同,StateFlow 使用可编辑的3D世界来组织场景结构、演变和相机,同时在需要更高保真度时利用现成的视频模型增强视觉效果。该世界被维护为场景元素和相机配置的持久结构化3D状态,作为预可视化的核心工作表示。基于这一洞察,StateFlow 通过三个阶段构建、演化和访问世界状态:状态构建通过先验引导、冲突感知的双视图初始化将生成的2D内容提升为连贯的3D世界;状态演化将用户意图转化为结构化状态转换,同时保留世界记忆,避免每次编辑时全场景重生成;状态访问使用渲染反馈反射将相机方案细化为视觉可行的轨迹,避免仅依赖VLM语义。实验表明 StateFlow 能够为视频创作和类游戏原型设计生成高质量的3D世界。
原文摘要
Previsualization is an intermediate layer between ideas and production in film, games, architecture, and urban design...
自动采集于 2026-08-14
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。