[论文] PDMD: Projected Distribution Matching Distillation for Video Diffusion...

研究领域: CV 作者: Zimo Wang, Junkun Yuan, Angtian Wang, Haotian Yang, Canyu Zhang, Siyuan Yuan, Xingchang Huang, Bo Liu, Yizhi Wang, Yiding Yang, Chongyang Ma, Gord…

论文概要

研究领域: CV 作者: Zimo Wang, Junkun Yuan, Angtian Wang, Haotian Yang, Canyu Zhang, Siyuan Yuan, Xingchang Huang, Bo Liu, Yizhi Wang, Yiding Yang, Chongyang Ma, Gordon Guocheng Qian 发布时间: 2026-09-28 arXiv: 2609.35768

中文摘要

现代视频扩散模型需要在长时空 token 序列上进行数十次去噪评估。分布匹配蒸馏(DMD)将函数评估次数(NFE)减少到仅几次。然而,DMD 样本在训练过程中会退化,表现出渐进式过饱和和伪影。我们将这种不稳定性追溯到评论器(critic)误差,它们进入连续的学生更新并随时间累积。我们提出投影分布匹配蒸馏(PDMD)来过滤评论器误差:将 DMD 更新中与学生-评论器端点残差平行的分量投影去除。在固定的含噪查询点,我们证明该残差是评论器端点误差的无偏估计。在高维假设下,该投影去除了恒定比例的评论器误差,同时仅丢弃趋于零的理想 DMD 信号。实证上,该投影稳定了训练并在 DMD 退化和产生不自然纹理的地方改善了样本质量。PDMD 只需对 DMD 做一行代码修改,无需额外损失、网络、数据、模型传递或多阶段训练。使用 Wan2.1,PDMD 在 4 NFE 下达到 83.73 的 VBench 总分,超过同等训练的 DMD 1.03 分。在 MiniMax-H3 联合视频-音频生成上,PDMD 达到 83.17 的 VideoGen-Eval 视觉总分,比最强蒸馏基线高 0.41 分,并在全部六个音频指标上取得最佳。用户研究在视觉质量、运动和音频质量方面均偏好 PDMD。

原文摘要

Modern video diffusion models require tens of denoising evaluations over long spatiotemporal token sequences. Distribution Matching Distillation (DMD) reduces the number of function evaluations (NFE) to just a few. However, DMD samples can degrade during training, exhibiting progressive oversaturation and artifacts. We trace this instability to critic errors, which enter successive student updates and accumulate over time. We introduce Projected Distribution Matching Distillation (PDMD) to filter critic errors. PDMD projects out the component of the DMD update parallel to the student-critic endpoint residual. At a fixed noisy query, we prove that this residual is an unbiased estimate of the critic's endpoint error. Under high-dimensional assumptions, this projection removes a constant frac...


*自动采集于 2026-09-30*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

1.03 分的领先,我拿它跟被测对象自己的抖动比了比,比值是 25.8。

PDMD:1.03 分的赢面,26.61 分的晃动

一、一行代码是真的,这是全文最硬的主张

Section 3.2 那一行 d = d - dot(d,r)/dot(r,r)*r,原文写 The highlighted line is the only change from DMD,且 All training hyperparameters are unchanged。不加损失、不加网络、不多阶段,这种克制值得专门肯定。

二、但对照组被挑过

83.73 − 82.70 = 1.03 是对 DMD† 的。同一张 Table 1 里,DMD2† 是 83.44(只差 0.29),AnyFlow 官方权重 83.54(只差 0.19)——Section 5.2 自己写了 PDMD is also 0.29 points above DMD2†。摘要只报了最好看的那个差值。

三、尺子自己会晃 26.61 分

DMD† 从 1500 步的峰值 82.70 跌到 7500 步的 56.09,落差 26.61。PDMD 赢的 1.03 分连这个抖动的零头都不到,而全文没给任何 checkpoint 方差——这 1.03 显不显著,不可复核。Wan2.1 侧 944 prompts × 5 seeds,MiniMax 侧 387 prompts 固定种子,同样无显著性检验。

四、「六个音频指标全最佳」的限定词被删了

原文是 best among the compared 4-NFE models。50 步教师在 PQ / CE / CU / IS / DeSync 五项上都比 PDMD 好(Table 2)。用户研究同理:PDMD 确实赢蒸馏基线,但 50 步教师仍以 37.0 个百分点整体领先——这句原文也有。

五、高维假设只有间接代理

噪声高维集中、与误差方向无主导对齐、tr Σ = ‖e‖² 时平均至少去掉 50% critic 误差能量——在真实视频 latent 上是否成立,论文只给了「训练大部分时间保留 80% 以上更新范数」这一个代理。被剔除误差的实际比例,没估。Limitations 一节也只有一句:单步质量仍受限,可能要加判别器损失。

下一根钉子:checkpoint 方差。作者只要放出三个种子的 VBench 总分,1.03 要么立住、要么塌。顺带该补的还有成本——全文找不到 GPU 型号和卡时。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens