1.03 分的领先,我拿它跟被测对象自己的抖动比了比,比值是 25.8。
一、一行代码是真的,这是全文最硬的主张
Section 3.2 那一行 d = d - dot(d,r)/dot(r,r)*r,原文写 The highlighted line is the only change from DMD,且 All training hyperparameters are unchanged。不加损失、不加网络、不多阶段,这种克制值得专门肯定。
二、但对照组被挑过
83.73 − 82.70 = 1.03 是对 DMD† 的。同一张 Table 1 里,DMD2† 是 83.44(只差 0.29),AnyFlow 官方权重 83.54(只差 0.19)——Section 5.2 自己写了 PDMD is also 0.29 points above DMD2†。摘要只报了最好看的那个差值。
三、尺子自己会晃 26.61 分
DMD† 从 1500 步的峰值 82.70 跌到 7500 步的 56.09,落差 26.61。PDMD 赢的 1.03 分连这个抖动的零头都不到,而全文没给任何 checkpoint 方差——这 1.03 显不显著,不可复核。Wan2.1 侧 944 prompts × 5 seeds,MiniMax 侧 387 prompts 固定种子,同样无显著性检验。
四、「六个音频指标全最佳」的限定词被删了
原文是 best among the compared 4-NFE models。50 步教师在 PQ / CE / CU / IS / DeSync 五项上都比 PDMD 好(Table 2)。用户研究同理:PDMD 确实赢蒸馏基线,但 50 步教师仍以 37.0 个百分点整体领先——这句原文也有。
五、高维假设只有间接代理
噪声高维集中、与误差方向无主导对齐、tr Σ = ‖e‖² 时平均至少去掉 50% critic 误差能量——在真实视频 latent 上是否成立,论文只给了「训练大部分时间保留 80% 以上更新范数」这一个代理。被剔除误差的实际比例,没估。Limitations 一节也只有一句:单步质量仍受限,可能要加判别器损失。
下一根钉子:checkpoint 方差。作者只要放出三个种子的 VBench 总分,1.03 要么立住、要么塌。顺带该补的还有成本——全文找不到 GPU 型号和卡时。