先把摘要里那两个数掰开:「44%」和「80%」是比值,不是百分点
原文写法是 *improves physical commonsense by up to 44% and semantic alignment by up to 80% over prior physics-aware baselines*。
对照 MultiPhyBench 那几列(HiPhy 对 Wan2.1 主干):
- 物理常识 PC:53.0 → 76.7,绝对涨 23.7 个点,相对 +44.7%
- 语义对齐 SA:35.0 → 68.85,绝对涨 33.9 个点,相对 +96.7%
真正该看的那一列:跟最强基线比
MultiPhyBench 上表现最好的基线是 PnP(Predict-and-Perturb),PC 57.0。HiPhy 是 76.7——领先 19.7 个点。
而到了 VideoPhy2(单原理)那一列,PnP 是 80.1,HiPhy 88.6——只领先 8.5 个点。
所以帖文那句「在多物理原理并发场景取得最大提升」是站得住的:单原理领先 8.5 点,多原理领先 19.7 点,翻了一倍多。这是这篇最硬的一条。
消融更说明问题:干活的是「一条原理一股奖励」
表里有一行 HiPhy (global),只留全局目标、去掉局部层:
- MultiPhyBench PC:76.7 → 61.0(掉 15.7 点)
- MultiPhyBench 上 PC 与 SA 的合并项:52.7 → 40.0(掉 12.7 点)
顺带说,作者还做了个归一化上的小设计:每股奖励在 rollout 组内做标准化后求和时,要除以 √n 而不是 n,否则方差随原理数量线性涨,原理多的 prompt 会不成比例地主导梯度。这种细节一般只有真调过才知道要写。
比数字更有意思的是这段诊断
论文解释了为什么「在 VideoPhy2 上训练的办法,到 MultiPhyBench 就崩」:
> a top-level stage such as "splash" is satisfied by any splash at all. Without sub-stages the reward cannot separate a static spray from a real impact followed by crown formation, so it stops pushing the model once each principle is roughly present.
翻过来就是:奖励只看「飞溅」这个顶层事件,那么一团静态水雾和一次真正的撞击后冠状水花,得分一样。于是模型在每个原理「大致在」的地方就停手了。
这条诊断的价值超过表格里的任何一格——它说的是所有粗粒度奖励的通病:你按什么粒度定义「做到了」,模型就按什么粒度敷衍你。
要打折的两处
- PC 和 SA 是 VLM 裁判打的:Qwen2.5-VL-7B。用模型评模型,闭环。
- 用户研究 n=50,30 条 prompt,1–5 李克特量表。样本偏小,只能当佐证不能当主证据。
一句话
把所有物理原理搅成一锅奖励,模型学到的是「场面看起来热闹」。拆开成三条独立的流,它才学会「每一件都得真的发生」。这条经验不限于视频生成。