静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 17:40

先把摘要里那两个数掰开:「44%」和「80%」是比值,不是百分点

原文写法是 *improves physical commonsense by up to 44% and semantic alignment by up to 80% over prior physics-aware baselines*。

对照 MultiPhyBench 那几列(HiPhy 对 Wan2.1 主干):

  • 物理常识 PC:53.0 → 76.7,绝对涨 23.7 个点,相对 +44.7%
  • 语义对齐 SA:35.0 → 68.85,绝对涨 33.9 个点,相对 +96.7%
两个数都没编,但「涨 44%」和「涨 23.7 个点」在读者脑子里是两个量级。这类「up to X%」写法在这两年论文里到处都是,读的时候记得先问一句:分母是谁。

真正该看的那一列:跟最强基线比

MultiPhyBench 上表现最好的基线是 PnP(Predict-and-Perturb),PC 57.0。HiPhy 是 76.7——领先 19.7 个点。

而到了 VideoPhy2(单原理)那一列,PnP 是 80.1,HiPhy 88.6——只领先 8.5 个点。

所以帖文那句「在多物理原理并发场景取得最大提升」是站得住的:单原理领先 8.5 点,多原理领先 19.7 点,翻了一倍多。这是这篇最硬的一条。

消融更说明问题:干活的是「一条原理一股奖励」

表里有一行 HiPhy (global),只留全局目标、去掉局部层:

  • MultiPhyBench PC:76.7 → 61.0(掉 15.7 点)
  • MultiPhyBench 上 PC 与 SA 的合并项:52.7 → 40.0(掉 12.7 点)
单原理那边掉得少,多原理这边塌得厉害。层次化结构里,真正起作用的是「每个物理原理一条独立的奖励流」——把三股流混成一股,模型立刻退化到「看起来都有」的状态。

顺带说,作者还做了个归一化上的小设计:每股奖励在 rollout 组内做标准化后求和时,要除以 √n 而不是 n,否则方差随原理数量线性涨,原理多的 prompt 会不成比例地主导梯度。这种细节一般只有真调过才知道要写。

比数字更有意思的是这段诊断

论文解释了为什么「在 VideoPhy2 上训练的办法,到 MultiPhyBench 就崩」:

> a top-level stage such as "splash" is satisfied by any splash at all. Without sub-stages the reward cannot separate a static spray from a real impact followed by crown formation, so it stops pushing the model once each principle is roughly present.

翻过来就是:奖励只看「飞溅」这个顶层事件,那么一团静态水雾和一次真正的撞击后冠状水花,得分一样。于是模型在每个原理「大致在」的地方就停手了。

这条诊断的价值超过表格里的任何一格——它说的是所有粗粒度奖励的通病:你按什么粒度定义「做到了」,模型就按什么粒度敷衍你。

要打折的两处

  • PC 和 SA 是 VLM 裁判打的:Qwen2.5-VL-7B。用模型评模型,闭环。
  • 用户研究 n=50,30 条 prompt,1–5 李克特量表。样本偏小,只能当佐证不能当主证据。
其他设定:数据集约 5 万条 prompt,1–3 个物理原理均匀分布,验证 10%、测试 5%;两张 H200,先 SFT 50 步再 GRPO 约 2000 步;主干 Wan2.1,对齐模型 Qwen2.5-7B-Instruct。

一句话

把所有物理原理搅成一锅奖励,模型学到的是「场面看起来热闹」。拆开成三条独立的流,它才学会「每一件都得真的发生」。这条经验不限于视频生成。

HiPhy:单原理领先 8.5 点,多原理领先 19.7 点

暂无表态