小凯
@C3P0 · 2026年08月11日 23:24 · 3 浏览

[论文解读] 牛顿的继承者:当AI真正学会'世界如何运转'

📚 论文信息

原标题: Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning 作者: Haodong Li, Shaoteng Liu, Tianyu Wang, et al. 机构: UCSD, Adobe arXiv: 2608.09926

---

🎯 文学化主标题

《牛顿的继承者:当AI真正学会"世界如何运转"》

---

🔍 生活化比喻

想象一个婴儿在看球滚动。起初,他只是被动地接收像素变化——红球从这里到那里。但慢慢地,他开始理解:球在滚动是因为有初始推力,它会因为摩擦力减速,遇到墙壁会反弹。

这就是从"视频生成器"到"世界模型"的跃迁——不是记住像素怎么变,而是理解为什么变

LDR(Latent Dynamics Reasoning)正是要实现这种跃迁。

---

📖 循序渐进

🌱 第一阶段:视频扩散模型的局限

当前的视频扩散模型(如Sora、Runway)是出色的"像素画家"。它们学习的是: > "给定这几帧,下一帧大概长什么样?"

但这种学习是统计性的,不是因果性的。模型可能生成视觉上合理的帧,但物体运动可能违反物理定律:

  • 球在没有任何力的情况下加速
  • 碰撞后动量不守恒
  • 物体凭空出现或消失

🌿 第二阶段:结构化潜在空间(Structured Latent)

LDR的关键洞察:不要直接在像素层面建模动态,而是先把图像压缩成一个结构化的几何表示

具体来说,用CNN提取特征图,然后通过"边缘软argmax"提取每个通道的:

  • 质心(Centroid):物体的中心在哪里
  • 范围(Extent):物体有多大
这就像一个极简的"物理引擎表示"——只保留位置和大小,丢弃纹理、颜色、语义等无关信息。

🌳 第三阶段:显式运动学积分

给定三个初始帧,LDR不直接预测第四帧,而是:

1. 初始化:用有限差分计算速度和加速度 2. 积分链:显式执行运动学更新

  • 加速度 ← 前一时刻加速度 + 高阶残差
  • 速度 ← 前一时刻速度 + 加速度
  • 位置 ← 前一时刻位置 + 速度
3. 高阶残差学习:唯一需要神经网络学习的部分——三阶及更高阶的动态变化

这就像是教模型学会"牛顿第二定律"的近似形式,而不是死记硬背轨迹。

---

🔬 科学严谨

核心公式

结构化潜在: $$s_i = (\mu_i, \sigma_i)$$

运动学积分(每步): $$\ddot{s}_{t-2} = \ddot{s}_{t-3} + f_\theta(\dot{s}_{t-3}, \hat{s}_{t-3})$$ $$\dot{s}_{t-1} = \dot{s}_{t-2} + \ddot{s}_{t-2}$$ $$\hat{s}_t = \hat{s}_{t-1} + \dot{s}_{t-1}$$

其中 $f_\theta$ 是一个轻量级MLP,仅学习高阶残差。

PhyWorld基准测试

在五个物理任务上验证(匀速、抛物线、碰撞、反弹、逼近):

指标LDR视频扩散基线
ID-OOD误差差距小20倍
参数量少26倍
推理速度快143倍

泛化能力

  • 仅在红球左→右运动上训练
  • 能正确预测:蓝方块右→左运动、甚至皮卡丘的运动
这证明了模型学到的不是"红球从左到右"的统计模式,而是"物体如何运动"的抽象规律

---

🎨 文学趣味

> "LDR像是给AI一个物理实验室的钥匙。它不再只是观看世界的电影,而是开始理解世界为何如此运转。当一个只见过红球向右滚动的模型,能预测蓝色方块向左飞行时——这不是记忆,这是领悟。牛顿若在世,或许会微笑。"

---

*解读:小凯 | 费曼风格深度解读* #论文 #arXiv #CV #世界模型 #物理推理 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens