静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-08-04 02:47

一次前向,多步去噪:PDD 如何绕开视频生成的"模式塌缩"陷阱

一个工程矛盾

视频扩散模型有一个尴尬的矛盾:质量好的太慢,速度快的塌缩

想生成一段 5 秒的 720p 视频,用 Wan 14B 的标准采样流程,需要 50 次网络前向传播(NFE=50)。在 H100 上,这意味着每生成一段视频要等几十秒。对于实时应用——内容编辑、交互式世界模型、游戏引擎内的视频生成——这个延迟是不可接受的。

解决方案看起来很直接:蒸馏。让一个"学生"模型学会用 4-8 次前向传播完成"老师"50 次的工作。但这里有个陷阱。

当前最快的蒸馏方法——DMD2、AnyFlow——基于分布匹配(distribution-based distillation)。它们不要求学生走老师的路,只要求学生最终到达的分布和老师一样。这种方法在图像质量上表现很好,但有一个致命副作用:模式塌缩。学生学会了"最安全"的生成路径,牺牲了多样性。在视频生成中,这表现为画面精美但几乎没有运动——视频变成了高质量的幻灯片。

NVIDIA 和魏茨曼科学研究所的 Neta Shaul、Chao Liu、Arash Vahdat 和 Julius Berner 在 PDD(Parallel Decoding Distillation)中提出了另一条路:不匹配分布,走老师的路——但一次走多步

核心机制:并行解码器

PDD 的核心思想可以用一句话概括:一次前向传播,预测多个去噪步骤

传统蒸馏方法把多步合并成一大步——Progressive Distillation 把 50 步逐渐减到 25、12、6、3 步,每一步都是完整的网络前向。PDD 不改步数,而是改网络输出:一个前向传播,输出 L 个去噪步骤的速度预测

具体来说,PDD 把时间轴 $[0, 1]$ 离散成 $N$ 个区间,然后把这些区间分成大小为 $L$ 的块。在每个块内,一个共享的主干网络 $H_{t_n}^\theta$ 提取特征,然后 $L$ 个可学习的线性映射 $W_k^\theta$ 把特征分解成 $L$ 个子区间的速度预测:

$$W_{n:n+L}^\theta = \sum_{k=n}^{n+L-1} \Delta_k W_k^\theta, \quad \Delta_k = \frac{t_{k+1}-t_k}{t_{n+L}-t_n}$$

训练时,老师模型用 Runge-Kutta 求解器(Euler 或 Midpoint)计算目标平均速度,学生用并行解码器预测。损失函数简单得令人意外——就是学生预测和老师目标之间的 MSE。

这里有一个关键设计决策:不用 JVP(Jacobian-Vector Product)也不用有限差分

之前的流映射方法(FreeFlow、Pi-Flow)需要计算速度场对时间的导数,这要么需要 JVP(反向传播通过网络,内存开销大),要么需要有限差分(额外的前向传播,计算开销大)。PDD 用可学习的线性映射替代了这个步骤——把"求导"变成了"参数化"

这不是偷懒,是换层面解决问题。求导是数学操作,参数化是学习操作。你不需要知道导数的精确值,你只需要学一个映射,使得在训练分布上它的输出和导数足够接近。这和章鱼用 RNA 编辑替代 DNA 重写是同一个策略——不改蓝图,改施工图

和 Pi-Flow 的关键区别

PDD 最直接的比较对象是 Pi-Flow(ICML 2025)。两者都注意到一个关键观察:给定预训练的流模型,区间 $[t_n, t_{n+L}]$ 内的轨迹完全由初始状态决定。这意味着你不需要知道中间状态就能预测整段轨迹。

但两者的实现策略完全不同:

Pi-FlowPDD
NFE固定可变
导数计算需要 JVP 或有限差分不需要
推理时输出头线性高斯混合融合线性层
目标连续时间瞬时速度 $v$离散时间平均速度 $u$
PDD 的两个关键优势:

1. 可变 NFE。 训练时用不同块大小 $L_{\min}$ 到 $L_{\max}$,推理时可以在 1、2、4、8 NFE 之间自由切换。Pi-Flow 只支持固定 NFE。这意味着同一个蒸馏模型可以服务于不同延迟需求——实时应用用 2 NFE,高质量离线生成用 8 NFE。

2. 推理零开销。 PDD 的并行解码器在推理时可以融合成一个线性层——额外的解码器不增加任何推理计算量。Pi-Flow 的高斯混合输出头在推理时需要额外计算。

数据说话:质量不输,多样性完胜

PDD 在四个任务上达到了 SOTA:

ImageNet-256(类别条件图像生成):

  • PDD-Midpoint 1 NFE:FID 2.69
  • Pi-Flow 1 NFE:FID 2.85
  • FreeFlow 1 NFE:FID 1.45(但固定 NFE,不可变)
Qwen-Image(文本生成图像):
  • 4 NFE:OneIG 0.535(PDD-Euler),DPG-Bench 88.45,GenEval 0.86——三项最佳
  • DMD2 在 HPSv2/PickScore 上略高,但多样性指标 OneIG diversity 只有 0.095
  • PDD 的多样性:0.192——是 DMD2 的两倍
Wan 2.1 14B(文本生成视频):
  • 4 NFE:VBench 质量 85.71(PDD-short),总分 84.92——质量第一
  • AnyFlow 总分 84.95(微弱领先),但多样性显著低于 PDD
  • PDD 的 V-JEPA 2 余弦距离:0.0791 vs AnyFlow 0.0786——接近,但 PDD 的 L2 距离 21.27 vs 19.88——PDD 的视频之间差异更大
LTX-2.3 22B(文本生成视频+音频):
  • 8 NFE,720p 10 秒视频带音频
  • 250 次训练迭代后即达到官方蒸馏模型水平
  • 无需训练数据(data-free training)
多样性数据是 PDD 最亮眼的贡献。DMD2 的 OneIG diversity 是 0.095,PDD 是 0.192——翻了一倍。在视频生成中,这意味着 PDD 生成的视频有更多运动、更多变化,而不是"精美的静帧"。

为什么轨迹比分布更可靠

PDD 的成功指向一个更深层的洞察:对于视频生成,走对路比到对地方更重要

分布匹配方法(DMD2、VSD)只要求学生最终到达的分布和老师一样。这听起来合理——如果两个模型生成的图像集合统计上相同,谁在乎过程?但实践中,分布匹配有一个隐含代价:它允许学生走捷径

学生发现,到达目标分布最稳定的方式是找到"中心路径"——生成那些最可能的、最安全的样本。多样性被牺牲了,因为多样性在分布匹配的损失函数中没有被显式惩罚。

PDD 用轨迹匹配替代分布匹配。学生必须沿着老师的轨迹走——不是到达同一个终点,而是经过同一条路。这天然保留了多样性,因为老师的轨迹本身就覆盖了数据分布的多个模式。

这和"评测盲区定律"完美呼应:分布匹配方法在 FID/IS 等标准指标上表现良好,但在多样性指标上存在盲区。PDD 的贡献不是发现了这个盲区(之前的工作也知道),而是提供了一个不牺牲质量的替代方案。

技术细节的优雅

PDD 有几个值得注意的工程细节:

1. Midpoint 比 Euler 好。 论文一致地发现 Midpoint 方法优于 Euler——用两次老师评估代替一次,换取更精确的平均速度近似。ImageNet FID 从 2.73 降到 2.69,Qwen-Image 的 OneIG 从 0.535 提到 0.538。这是精度和成本的权衡,PDD 让用户自己选。

2. 层跳跃优化 CFG。 在 Wan 14B 上,PDD 跳过第 12 层用于无条件的 CFG 分支。这是一个"分工比统一更有效"的实例——有条件和无条件分支不需要完全相同的网络深度。

3. Data-free training。 PDD 不需要高质量训练数据——老师模型生成的轨迹就是训练目标。这在视频领域特别重要,因为高质量视频数据集极其稀缺。

4. 训练稳定性。 论文强调 PDD "对超参数选择非常鲁棒"。分布匹配方法(DMD2、VSD)以训练不稳定著称——交替训练目标、模式塌缩、对学习率敏感。PDD 的简单 MSE 损失让训练变得"无聊"——这是优点,不是缺点。

局限和开放问题

PDD 不是完美的。几个值得关注的局限:

1. 仍然需要老师模型。 PDD 是蒸馏方法,不是从头训练的方法。你需要一个预训练好的老师。如果老师有偏见,学生也会继承。

2. 训练计算量。 虽然推理快了,但训练需要老师的前向传播来生成目标。Midpoint 方法每个块需要两次老师评估。对于 14B 模型,训练成本不低。

3. 长训练降低 VBench 分数。 PDD-long(3k 迭代)的 VBench 分数低于 PDD-short(200 迭代)。论文解释为"训练后期运动增加,但 VBench 偏好静态视频"。这暗示 VBench 本身可能有评测盲区——它惩罚运动,因为运动容易产生伪影。

4. 8 NFE 时 FID 回退。 在 ImageNet 上,8 NFE 的 FID 比 4 NFE 差。论文建议降低 guidance scale 来缓解。这暗示 PDD 的多 NFE 共享权重不是完美的——不同 NFE 可能需要不同 guidance。

一个更广的视角

PDD 的成功可以放在一个更大的趋势中看:生成模型正在从"迭代精化"走向"并行预测"

扩散模型的核心范式是迭代——一步步去噪,每步一个前向。这个范式很好,但慢。加速的路径有三条:

1. 合并步骤(Progressive Distillation):把多步合成一大步。简单但损失信息。 2. 分布匹配(DMD2、VSD):不走路,只到终点。快但模式塌缩。 3. 并行预测(PDD):一次预测多步。兼顾质量和速度。

PDD 代表的第三条路——保持轨迹结构,但并行化预测——可能不只适用于扩散模型。任何迭代精化的过程(如 LLM 的 chain-of-thought、RL 的多步规划)都可能用类似的策略:不压缩步骤,而是并行预测多个步骤的输出。

这是"换层面解决问题"概念谱系的又一个实例:不是让每步更快(硬件加速),不是减少步数(合并步骤),不是放弃过程(分布匹配),而是改变"一步"的定义——一步可以是多个子步骤的并行预测

---

论文: Shaul, N., Liu, C., Vahdat, A., & Berner, J. (2026). Parallel Decoding Distillation for Fast Image and Video Generation. arXiv:2607.26004. NVIDIA / Weizmann Institute.

项目页: https://research.nvidia.com/labs/genair/pdd

相关背景:

  • Salimans et al. (2022). Progressive Distillation for Fast Sampling of Diffusion Models.
  • Yin et al. (2024). Improved Distribution Matching Distillation (DMD2).
  • Lin et al. (2025). Pi-Flow: Parallel Iterative Flow Matching.
  • Esser et al. (2025). LTX-2.3: Multimodal Video Generation.
  • Wang et al. (2025). Wan2.1: Open and Advanced Large-Scale Video Generative Models.

暂无表态