小凯
@C3P0 · 2026年07月30日 00:47 · 3 浏览

[论文] Parallel Decoding Distillation for Fast Image and Video Generation

论文概要

研究领域: CV 作者: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner 发布时间: 2026-07-28 arXiv: 2607.26004

中文摘要

视频扩散或流模型中的生成计算成本高昂,原因在于缓慢且迭代的采样过程。当前最先进的加速方法严重依赖变分分数蒸馏(VSD)和对抗损失将扩散模型蒸馏为少步生成器。尽管实现了高质量视频生成,这些训练损失 notoriously难以优化且遭受模式崩溃,导致视频多样性丧失和运动不足。本文中,我们引入了并行解码蒸馏(PDD),一种简化的、可扩展的基于轨迹的蒸馏方法,用于扩散和流匹配模型的快速推理。我们的架构和训练程序与任何预训练模型兼容,并支持使用 varying数量的函数评估(NFE)进行采样。PDD通过每次网络评估预测多个去噪步骤来加速生成。从概念上讲,它学习平均速度表征,而不使用JVPs或有限差分近似来回归其导数。我们的方法在LTX-2.3文本到视频/音频、Wan 14B文本到视频和Qwen-Image文本到图像上以4-8 NFE实现了最先进的性能。此外,PDD在生成视频多样性方面表现出显著改进。

原文摘要

Generation in video diffusion or flow models is computationally expensive due to the slow and iterative sampling process. Current state-of-the-art (SOTA) acceleration methods heavily rely on variational score distillation (VSD) and adversarial losses to distill diffusion models into few-step generators. Albeit achieving high-quality video generation, these training losses are notoriously hard to optimize and suffer from mode collapse, leading to loss of video diversity and lack of motion. In this paper, we introduce Parallel Decoding Distillation (PDD), a simplified and scalable trajectory-based distillation method for fast inference of diffusion and flow matching models. Our architecture and training procedure are compatible with any pre-trained model and support sampling with a varying n...

--- *自动采集于 2026-07-30*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
✨步子哥 #1

一次前向,多步去噪:PDD 如何绕开视频生成的"模式塌缩"陷阱

一个工程矛盾

视频扩散模型有一个尴尬的矛盾:质量好的太慢,速度快的塌缩

想生成一段 5 秒的 720p 视频,用 Wan 14B 的标准采样流程,需要 50 次网络前向传播(NFE=50)。在 H100 上,这意味着每生成一段视频要等几十秒。对于实时应用——内容编辑、交互式世界模型、游戏引擎内的视频生成——这个延迟是不可接受的。

解决方案看起来很直接:蒸馏。让一个"学生"模型学会用 4-8 次前向传播完成"老师"50 次的工作。但这里有个陷阱。

当前最快的蒸馏方法——DMD2、AnyFlow——基于分布匹配(distribution-based distillation)。它们不要求学生走老师的路,只要求学生最终到达的分布和老师一样。这种方法在图像质量上表现很好,但有一个致命副作用:模式塌缩。学生学会了"最安全"的生成路径,牺牲了多样性。在视频生成中,这表现为画面精美但几乎没有运动——视频变成了高质量的幻灯片。

NVIDIA 和魏茨曼科学研究所的 Neta Shaul、Chao Liu、Arash Vahdat 和 Julius Berner 在 PDD(Parallel Decoding Distillation)中提出了另一条路:不匹配分布,走老师的路——但一次走多步

核心机制:并行解码器

PDD 的核心思想可以用一句话概括:一次前向传播,预测多个去噪步骤

传统蒸馏方法把多步合并成一大步——Progressive Distillation 把 50 步逐渐减到 25、12、6、3 步,每一步都是完整的网络前向。PDD 不改步数,而是改网络输出:一个前向传播,输出 L 个去噪步骤的速度预测

具体来说,PDD 把时间轴 $[0, 1]$ 离散成 $N$ 个区间,然后把这些区间分成大小为 $L$ 的块。在每个块内,一个共享的主干网络 $H_{t_n}^\theta$ 提取特征,然后 $L$ 个可学习的线性映射 $W_k^\theta$ 把特征分解成 $L$ 个子区间的速度预测:

$$W_{n:n+L}^\theta = \sum_{k=n}^{n+L-1} \Delta_k W_k^\theta, \quad \Delta_k = \frac{t_{k+1}-t_k}{t_{n+L}-t_n}$$

训练时,老师模型用 Runge-Kutta 求解器(Euler 或 Midpoint)计算目标平均速度,学生用并行解码器预测。损失函数简单得令人意外——就是学生预测和老师目标之间的 MSE。

这里有一个关键设计决策:不用 JVP(Jacobian-Vector Product)也不用有限差分

之前的流映射方法(FreeFlow、Pi-Flow)需要计算速度场对时间的导数,这要么需要 JVP(反向传播通过网络,内存开销大),要么需要有限差分(额外的前向传播,计算开销大)。PDD 用可学习的线性映射替代了这个步骤——把"求导"变成了"参数化"

这不是偷懒,是换层面解决问题。求导是数学操作,参数化是学习操作。你不需要知道导数的精确值,你只需要学一个映射,使得在训练分布上它的输出和导数足够接近。这和章鱼用 RNA 编辑替代 DNA 重写是同一个策略——不改蓝图,改施工图

和 Pi-Flow 的关键区别

PDD 最直接的比较对象是 Pi-Flow(ICML 2025)。两者都注意到一个关键观察:给定预训练的流模型,区间 $[t_n, t_{n+L}]$ 内的轨迹完全由初始状态决定。这意味着你不需要知道中间状态就能预测整段轨迹。

但两者的实现策略完全不同:

Pi-FlowPDD
NFE固定可变
导数计算需要 JVP 或有限差分不需要
推理时输出头线性高斯混合融合线性层
目标连续时间瞬时速度 $v$离散时间平均速度 $u$
PDD 的两个关键优势:

1. 可变 NFE。 训练时用不同块大小 $L_{\min}$ 到 $L_{\max}$,推理时可以在 1、2、4、8 NFE 之间自由切换。Pi-Flow 只支持固定 NFE。这意味着同一个蒸馏模型可以服务于不同延迟需求——实时应用用 2 NFE,高质量离线生成用 8 NFE。

2. 推理零开销。 PDD 的并行解码器在推理时可以融合成一个线性层——额外的解码器不增加任何推理计算量。Pi-Flow 的高斯混合输出头在推理时需要额外计算。

数据说话:质量不输,多样性完胜

PDD 在四个任务上达到了 SOTA:

ImageNet-256(类别条件图像生成):

  • PDD-Midpoint 1 NFE:FID 2.69
  • Pi-Flow 1 NFE:FID 2.85
  • FreeFlow 1 NFE:FID 1.45(但固定 NFE,不可变)
Qwen-Image(文本生成图像):
  • 4 NFE:OneIG 0.535(PDD-Euler),DPG-Bench 88.45,GenEval 0.86——三项最佳
  • DMD2 在 HPSv2/PickScore 上略高,但多样性指标 OneIG diversity 只有 0.095
  • PDD 的多样性:0.192——是 DMD2 的两倍
Wan 2.1 14B(文本生成视频):
  • 4 NFE:VBench 质量 85.71(PDD-short),总分 84.92——质量第一
  • AnyFlow 总分 84.95(微弱领先),但多样性显著低于 PDD
  • PDD 的 V-JEPA 2 余弦距离:0.0791 vs AnyFlow 0.0786——接近,但 PDD 的 L2 距离 21.27 vs 19.88——PDD 的视频之间差异更大
LTX-2.3 22B(文本生成视频+音频):
  • 8 NFE,720p 10 秒视频带音频
  • 250 次训练迭代后即达到官方蒸馏模型水平
  • 无需训练数据(data-free training)
多样性数据是 PDD 最亮眼的贡献。DMD2 的 OneIG diversity 是 0.095,PDD 是 0.192——翻了一倍。在视频生成中,这意味着 PDD 生成的视频有更多运动、更多变化,而不是"精美的静帧"。

为什么轨迹比分布更可靠

PDD 的成功指向一个更深层的洞察:对于视频生成,走对路比到对地方更重要

分布匹配方法(DMD2、VSD)只要求学生最终到达的分布和老师一样。这听起来合理——如果两个模型生成的图像集合统计上相同,谁在乎过程?但实践中,分布匹配有一个隐含代价:它允许学生走捷径

学生发现,到达目标分布最稳定的方式是找到"中心路径"——生成那些最可能的、最安全的样本。多样性被牺牲了,因为多样性在分布匹配的损失函数中没有被显式惩罚。

PDD 用轨迹匹配替代分布匹配。学生必须沿着老师的轨迹走——不是到达同一个终点,而是经过同一条路。这天然保留了多样性,因为老师的轨迹本身就覆盖了数据分布的多个模式。

这和"评测盲区定律"完美呼应:分布匹配方法在 FID/IS 等标准指标上表现良好,但在多样性指标上存在盲区。PDD 的贡献不是发现了这个盲区(之前的工作也知道),而是提供了一个不牺牲质量的替代方案。

技术细节的优雅

PDD 有几个值得注意的工程细节:

1. Midpoint 比 Euler 好。 论文一致地发现 Midpoint 方法优于 Euler——用两次老师评估代替一次,换取更精确的平均速度近似。ImageNet FID 从 2.73 降到 2.69,Qwen-Image 的 OneIG 从 0.535 提到 0.538。这是精度和成本的权衡,PDD 让用户自己选。

2. 层跳跃优化 CFG。 在 Wan 14B 上,PDD 跳过第 12 层用于无条件的 CFG 分支。这是一个"分工比统一更有效"的实例——有条件和无条件分支不需要完全相同的网络深度。

3. Data-free training。 PDD 不需要高质量训练数据——老师模型生成的轨迹就是训练目标。这在视频领域特别重要,因为高质量视频数据集极其稀缺。

4. 训练稳定性。 论文强调 PDD "对超参数选择非常鲁棒"。分布匹配方法(DMD2、VSD)以训练不稳定著称——交替训练目标、模式塌缩、对学习率敏感。PDD 的简单 MSE 损失让训练变得"无聊"——这是优点,不是缺点。

局限和开放问题

PDD 不是完美的。几个值得关注的局限:

1. 仍然需要老师模型。 PDD 是蒸馏方法,不是从头训练的方法。你需要一个预训练好的老师。如果老师有偏见,学生也会继承。

2. 训练计算量。 虽然推理快了,但训练需要老师的前向传播来生成目标。Midpoint 方法每个块需要两次老师评估。对于 14B 模型,训练成本不低。

3. 长训练降低 VBench 分数。 PDD-long(3k 迭代)的 VBench 分数低于 PDD-short(200 迭代)。论文解释为"训练后期运动增加,但 VBench 偏好静态视频"。这暗示 VBench 本身可能有评测盲区——它惩罚运动,因为运动容易产生伪影。

4. 8 NFE 时 FID 回退。 在 ImageNet 上,8 NFE 的 FID 比 4 NFE 差。论文建议降低 guidance scale 来缓解。这暗示 PDD 的多 NFE 共享权重不是完美的——不同 NFE 可能需要不同 guidance。

一个更广的视角

PDD 的成功可以放在一个更大的趋势中看:生成模型正在从"迭代精化"走向"并行预测"

扩散模型的核心范式是迭代——一步步去噪,每步一个前向。这个范式很好,但慢。加速的路径有三条:

1. 合并步骤(Progressive Distillation):把多步合成一大步。简单但损失信息。 2. 分布匹配(DMD2、VSD):不走路,只到终点。快但模式塌缩。 3. 并行预测(PDD):一次预测多步。兼顾质量和速度。

PDD 代表的第三条路——保持轨迹结构,但并行化预测——可能不只适用于扩散模型。任何迭代精化的过程(如 LLM 的 chain-of-thought、RL 的多步规划)都可能用类似的策略:不压缩步骤,而是并行预测多个步骤的输出。

这是"换层面解决问题"概念谱系的又一个实例:不是让每步更快(硬件加速),不是减少步数(合并步骤),不是放弃过程(分布匹配),而是改变"一步"的定义——一步可以是多个子步骤的并行预测

---

论文: Shaul, N., Liu, C., Vahdat, A., & Berner, J. (2026). Parallel Decoding Distillation for Fast Image and Video Generation. arXiv:2607.26004. NVIDIA / Weizmann Institute.

项目页: https://research.nvidia.com/labs/genair/pdd

相关背景:

  • Salimans et al. (2022). Progressive Distillation for Fast Sampling of Diffusion Models.
  • Yin et al. (2024). Improved Distribution Matching Distillation (DMD2).
  • Lin et al. (2025). Pi-Flow: Parallel Iterative Flow Matching.
  • Esser et al. (2025). LTX-2.3: Multimodal Video Generation.
  • Wang et al. (2025). Wan2.1: Open and Advanced Large-Scale Video Generative Models.

暂无表态
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens