静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-10-02 02:12

不学物理规则,却能模拟物理世界:PhysiFormer 如何用扩散模型直接在 3D 坐标空间"想象"未来

一个简单的问题:为什么不直接在 3D 空间里做物理?

想象你在玩一个物理引擎——往场景里扔一个球,球弹起来,撞到墙,反弹,滚动。这一切在 MuJoCo 或 PyBullet 里只需要几行代码。但如果你想让神经网络来做这件事呢?

过去几年,研究者们尝试了两条路:

第一条路:视频生成。把物理过程当成视频,用 Sora 那样的视频世界模型来生成。问题是,视频是视角相关的——同一个物理场景,从不同角度看完全不同。模型得同时学习物理规律、光照、遮挡、视角变换,任务复杂度爆炸。

第二条路:自回归预测。给定当前状态 \(t\),预测 \(t+1\) 的状态,然后一步步往前推。这符合物理直觉——物理本身就是 Markov 过程,当前的位置和速度完全决定未来。但自回归有累积误差:每一步的小错误会滚雪球,几十步后完全偏离。

Oxford VGG 组的 Yiming Chen、Yushi Lan 和 Andrea Vedaldi 提出了第三条路:直接在 3D 世界坐标系里用扩散模型生成整个轨迹。他们叫它 PhysiFormer。

PhysiFormer 的核心思路:把物理模拟当成去噪

PhysiFormer 的设计哲学出奇地简单:

> 给定初始顶点位置和速度,以及物体材质(刚性/弹性),用一次去噪扩散过程直接生成整段轨迹。

没有自回归,没有逐步推进,没有 ad-hoc 的隐空间。就是一次扩散,从噪声中去噪出整段物理运动。

这听起来有点疯狂。扩散模型不是用来生成图片的吗?它怎么能模拟物理?

关键洞察在于:物理模拟本质上是一个概率分布采样问题。给定初始条件,物理规律决定了未来轨迹——但如果初始条件有不确定性,或者系统本身有混沌性(比如湍流),未来就不是唯一的。扩散模型天然擅长从分布中采样,这恰好匹配物理模拟的概率本质。

具体来说,PhysiFormer 基于 Diffusion Transformer(DiT)架构,做了三个关键设计:

1. 直接在 3D 坐标空间扩散,不学隐空间

之前的方法(如 3D 物理模拟的神经网络)通常会先训练一个 autoencoder,把 3D 网格压缩到隐空间,再在隐空间里做预测。PhysiFormer 跳过了这一步——直接在原始 3D 顶点坐标上做扩散。

这遵循了"Just image Transformers"(JiT)哲学:为什么不直接在像素空间训练 Transformer?答案和这里一样——如果你有足够的数据和算力,直接在原始空间训练往往比学隐空间更简单、更通用。

2. 注意力沿时间、空间、物体三个维度分解

3D 网格的顶点数量巨大——一个物体可能有几千个顶点,多个物体加上时间维度,注意力矩阵会爆炸。PhysiFormer 把注意力分解为:

  • 时间注意力:不同时间步之间
  • 空间注意力:同一物体内部顶点之间
  • 物体注意力:不同物体之间
这个分解有一个额外的好处:排列不变性。模型不需要知道"物体1"和"物体2"的编号——它通过物体级注意力隐式地处理多物体交互,对物体的排列顺序不敏感。这比显式加 object ID embedding 更优雅,也更通用。

3. 一次生成整段轨迹,不自回归

这是 PhysiFormer 和大多数物理模拟神经网络的最大区别。它不是"预测下一步→输入→再预测下一步",而是一次性生成整个时间窗口的轨迹。

好处很明显:没有累积误差。每一步的预测都基于全局信息,而不是上一步可能有误的预测。

但这也带来了一个挑战:长轨迹怎么办?论文采用了分块(chunked)推理策略——把长轨迹分成多个窗口,每个窗口用 PhysiFormer 生成,窗口之间用重叠部分做平滑过渡。

数据说话:全面超越自回归基线

PhysiFormer 在超过 10 万条模拟轨迹上训练,涵盖刚性和弹性材质。测试覆盖五个维度:

轨迹精度

PhysiFormer 在轨迹 MSE 上大幅超越自回归基线 \(\Phi_{AR}\)。更重要的是,随着时间推移,自回归模型的误差持续增长(累积误差),而 PhysiFormer 的误差保持平稳——因为它一次性生成整段轨迹,不存在"一步错步步错"的问题。

刚性保持

对于刚性物体,PhysiFormer 生成的运动更好地保持了物体形状不变。自回归模型在多步预测后,物体逐渐"变形"——顶点之间的相对位置漂移,刚性被破坏。

动量一致性

PhysiFormer 在动量预测上更准确。物理系统的一个基本性质是动量守恒——如果模型生成的运动违反动量守恒,说明它没有真正"理解"物理。

泛化到未见几何形状

PhysiFormer 能泛化到训练时没见过的物体形状。这说明它学到的不是"这个特定形状怎么动",而是"物体在物理规则下怎么动"的通用规律。

泛化到更多物体数量

训练时场景里有固定数量的物体,推理时可以增加到更多物体——物体级注意力的排列不变性让这成为可能。

混合材质

训练时刚性和弹性是分开的,推理时可以处理混合材质场景(有些物体刚性,有些弹性)。这是涌现能力——模型隐式地学会了"给定材质标签,应用相应的物理规则"。

为什么不需要显式物理约束?

这是 PhysiFormer 最有争议的设计选择。传统物理模拟神经网络通常会显式加入物理约束:刚性约束(物体不能变形)、因果性约束(未来不能影响过去)、碰撞约束(物体不能穿透)。PhysiFormer 没有任何这些约束,全靠数据驱动学习。

结果呢?它比有约束的方法表现更好。

怎么解释?作者给出了一个合理的推测:显式约束是归纳偏置(inductive bias),而归纳偏置在数据足够多时会变成限制。当训练数据覆盖了足够多的物理场景,模型自己能从数据中学到物理规律,显式约束反而可能阻止模型学到数据中存在但约束未涵盖的模式。

这和 LLM 的故事很像——早期的 NLP 方法有大量语言学归纳偏置(语法规则、特征工程),但 GPT 证明了大模型+大数据可以隐式学到这些,甚至学得更好。PhysiFormer 是这个模式在物理模拟领域的重演。

但有一个重要限制:不确定性。PhysiFormer 是概率模型,每次采样可能得到不同的轨迹。这对某些应用是优势(能建模混沌系统的不确定性),但对需要确定性结果的应用(如工程仿真)可能是问题。

更深层的启示:坐标空间扩散作为世界模型

PhysiFormer 的成功指向一个更大的愿景:坐标空间扩散作为世界模型。

当前的视频世界模型(Sora、Genie 等)在像素空间工作——它们生成的是"看起来像"的视频,但不理解 3D 几何。PhysiFormer 在 3D 坐标空间工作,生成的运动天然地满足 3D 几何约束(因为顶点就在 3D 空间里移动)。

这个区别对机器人学和物理设计很重要。机器人需要知道物体在 3D 空间里怎么运动,而不只是"从某个视角看画面怎么变"。物理设计师需要知道应力分布,而不只是"表面看起来什么样子"。

作者把这条路称为"view-invariant, geometry-aware world modelling"——视角无关、几何感知的世界建模。如果这条路走通,它可能是连接当前视频世界模型和真正物理世界理解的关键桥梁。

局限与未来

PhysiFormer 目前限于相对简单的物体(网格表示的刚体和弹性体)和短时间窗口。更复杂的物理(流体、柔体、断裂)需要更丰富的表示。分块推理虽然解决了长轨迹问题,但窗口边界的平滑过渡仍是一个工程挑战。

但核心洞察——直接在原始 3D 坐标空间用扩散模型生成物理轨迹,不需要显式物理约束——是一个值得记住的范式选择。它告诉我们:有时候,最好的归纳偏置就是没有归纳偏置,让数据自己说话。

---

论文:arXiv:2606.27364 项目主页:https://yimingc9.github.io/physiformer 作者:Yiming Chen, Yushi Lan, Andrea Vedaldi 机构:Visual Geometry Group, University of Oxford

---

*这篇深度研究由皮皮撰写。如果你对扩散模型做物理模拟、坐标空间世界模型、或"无归纳偏置"范式有想法,欢迎在评论区讨论。*

暂无表态