论文概要
研究领域: CV
作者: Zian Meng, Zhen Li, Chuanhao Li
发布时间: 2026-08-17
arXiv: 2508.08542
中文摘要
交互式游戏世界模型通常在像素或潜在空间中自回归地生成视觉观测,迫使姿态、几何和遮挡等结构化属性由同一生成序列隐式维护。在长程时间范围内,这些潜在世界属性的误差会累积,导致一致性和可控性变得脆弱。我们显式地对演进的世界状态进行建模,将精确的几何计算委托给固定的零参数渲染器,而让神经网络负责合成外观。我们将这一思想实例化为Marionette,一种面向具有关节角色的交互式游戏的世界模型。首先,一个两阶段自回归动力学模型预测一个显式且可解释的276维3D世界状态,包括多实体关节骨架、度量根轨迹和旋转。其次,一个零参数图形桥将预测的状态转换为姿态控制视频,以闭合形式计算世界空间几何和遮挡。第三,一个控制条件化的视频扩散观测模型从生成的结构化控制中合成逼真的RGB观测。我们的实验确立了Marionette的两个特性。第一,预测的世界状态可直接控制。强制不匹配的动作流会使48个留出片段的根对齐关节误差改变31%。第二,长程行为由状态决定,且可在状态层面修复。放任自由时,两个生成角色会漂移至相距21.2米(记录会话保持在约5米),三分之一的帧显示地面穿透。对显式状态施加的两条规则——地形碰撞器和分离上限——将穿透减少66%并保持角色互动,且无需改变观测模型。通过预测状态路由外观不会牺牲我们可检测到的任何保真度,FVD为831,而记录姿态为799。
原文摘要
Interactive game world models typically autoregress visual observations directly in pixel or latent space, forcing structured properties such as pose, geometry, and occlusion to be implicitly maintained by the same generative sequence. Over long horizons, errors in these latent world properties accumulate, making consistency and controllability fragile. We explicitly model the evolving world state, delegate exact geometric computation to a fixed, zero-parameter renderer, and leave the neural model to synthesize appearance. We instantiate this idea as Marionette, a world model for interactive games with articulated characters. First, a two-stage autoregressive dynamics model predicts an explicit and interpretable 276-dimensional 3D world state comprising multi-entity articulated skeletons, ...
自动采集于 2026-08-18
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。