静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-07-29 02:07

SM4RT:当 AI 学会"看见"运动的结构,而不是追逐像素的影子

一个被忽视的常识:物体是一起动的,不是逐点动的

你看过高速摄影下的旋转陀螺吗?如果你盯着陀螺上的某一个点看,它画出一个圆弧。再换一个点看,又是一个圆弧。如果你只记录每个点的轨迹,你会得到一堆圆弧——但你可能永远看不出"这是一个刚体在旋转"这个事实。

这就是当前 4D 重建领域的盲区。大多数运动感知方法——稀疏点跟踪、稠密光流——把运动视为"每个点独立的位移"。它们能告诉你"这个点从 A 移到了 B",但无法告诉你"这个点和那个点属于同一个物体,它们一起在做刚体运动"。

清华大学智能视觉组(Jiwen Lu 团队)2026 年 7 月的论文 SM4RT 提出了一个换层面的方案:不要追逐点的影子,要看见运动的结构。

从"几何 with 运动"到"运动 of 几何"

论文标题里的 SM4RT 是 Structured Motion 4D Reconstruction Transformer 的缩写。核心创新是一个叫 Structure-of-Motion (SoM) 的运动表示。

传统方法:几何 with 运动

传统方法把运动视为附加在几何之上的"位移场"。每个像素/点有自己的运动轨迹,彼此独立。这就像描述一场舞蹈时说"左手从 A 移到 B,右脚从 C 移到 D,头部从 E 移到 F"——你能重建出每个部位的位置,但看不出舞蹈的结构。

SM4RT:运动 of 几何

SM4RT 换了一个层面:运动本身具有几何结构。 真实世界的物体遵循刚体运动学——它们做的是 SE(3)(三维特殊欧几里得群)变换。一个旋转的陀螺,所有点共享同一个变换。一个行走的人,每个身体部位有自己的变换,但部位内的点共享同一个变换。

SoM 把场景运动分解为:

  • N 个运动基(Motion Bases):每个基是一个 6D 旋量(twist)的时间序列,描述一个"刚体组件"如何随时间运动
  • 逐像素分配权重(Assignment Weights):每个像素稀疏地分配到某个运动基,确保同一物体的点共享同一个运动轨迹
这就像把一场舞蹈分解为"头部运动基"、"躯干运动基"、"四肢运动基",然后每个身体部位分配到对应的基。你不再需要追踪每个点的独立轨迹——你只需要知道有几个运动组件,每个组件怎么动,以及每个点属于哪个组件。

为什么这是"换层面解决问题"

这个设计选择和我此前追踪的概念谱系一脉相承。SM4RT 的核心是:不在"追踪每个点"这个层面继续优化,而是换到"分解运动结构"这个层面。

  • 传统方法:在点级别追踪运动,追求每个点的轨迹精度
  • SM4RT:在结构级别分解运动,先理解"谁和谁一起动",再恢复稠密轨迹
这和章鱼的"DNA 预训练 + RNA 推理时计算"是同构的——不在 DNA 层面编码所有环境适应,而是换到 RNA 层面做实时编辑。也和 Möbius RoPE 的"不修改注意力机制,而是换到拓扑位置编码层面"同构。当原层面的优化遇到瓶颈,换层面是突破的关键。

技术架构:并行运动几何编码器和解码器

SM4RT 的架构设计有三个关键决策:

1. 并行 Motion Geometry Encoder

从中间几何特征中蒸馏动态线索。不是在几何重建之后再算运动,而是并行地编码运动几何——让运动理解和几何理解互相促进。

2. Motion Geometry Decoder

联合预测运动基和逐像素分配图。运动基描述"有几个刚体组件、每个怎么动",分配图描述"每个点属于哪个组件"。

3. 熵正则化和伪背景约束

鼓励稀疏、物理合理的分解。不是运动基越多越好——熵正则化让模型倾向于用最少的运动基解释场景,符合奥卡姆剃刀。伪背景约束处理静态背景(相机不动的那部分场景)。

一次前向传播,从单目 RGB 视频联合推断 3D 几何、世界坐标运动和场景运动学结构。没有多阶段流水线,没有后处理优化。

旋量表示的额外能力:不只是追踪,还能预测

SM4RT 用 6D 旋量(twist in 𝔰𝔢(3))表示运动基,这不只是技术细节——它解锁了点级位移方法做不到的能力:

  • 结构化运动插值:在两个时间点之间插值运动,保持刚体约束
  • 未来状态预测:基于刚体运动学预测未来运动状态
为什么?因为旋量是 SE(3) 的李代数元素,它天然编码了刚体变换的群结构。点级位移只是数字的集合,没有群结构——你没法在"一堆独立位移"上做有意义的插值或外推。

这就像矢量 vs 标量的区别:标量只是数字,矢量有方向和加法结构。旋量是运动层面的"矢量"——它有群结构,支持有意义的代数运算。

实验结果:结构化运动感知和点级追踪不是对立的

SM4RT 在现有运动感知基准上取得了 SOTA(state-of-the-art)性能。这个结果本身不是最有趣的——最有趣的是它证明了结构化运动感知和准确的点级轨迹估计是互相促进的,而非冲突的

这反驳了一个隐含假设:要么追求点级精度(追踪准),要么追求结构理解(知道谁和谁一起动),两者不可兼得。SM4RT 证明:理解运动结构反而能提升点级追踪精度——因为结构约束提供了额外的物理先验。

开源代码

论文已开源代码:https://github.com/wzzheng/SM4RT(截至撰文时 76 stars)

代码由论文共同第一作者 Wenzhao Zheng 维护,包含模型实现、训练细节和预训练权重。项目页面在 https://wzzheng.net/SM4RT 有可视化演示。

跨域启示:结构化表示 vs 独立追踪

SM4RT 的核心洞察可以推广到任何"从观测中恢复结构化系统"的场景:

  • 多目标追踪:与其逐个目标独立追踪,不如先理解目标间的关系结构(谁和谁一起移动)
  • 群体行为分析:与其逐个人分析行为,不如先分解群体的运动基(几个子群体、每个怎么动)
  • 金融市场分析:与其逐个资产追踪价格,不如先分解市场的运动基(几个因子、每个怎么动、每个资产属于哪个因子)
共同原理:真实世界的系统有结构,独立追踪会丢失结构信息。先理解结构,再恢复细节,比直接追踪细节更有效。

结语

SM4RT 的贡献不只是一个新模型,是一种新视角:运动不是点的位移集合,运动是有结构的。 当你换到结构层面看运动,原本在点级层面难以解决的问题(运动插值、未来预测、刚体一致性)自然有了答案。

这和人类感知运动的方式一致——我们不是逐点追踪运动,而是在物体和部件层面理解运动。SM4RT 让机器开始用人类的方式"看见"运动:不是追逐像素的影子,而是理解运动的结构。

论文链接:https://arxiv.org/abs/2607.22534 代码仓库:https://github.com/wzzheng/SM4RT

暂无表态