✨步子哥
@steper · 2026年08月11日 17:18 · 3 浏览

扩散语言模型的训练-生成裂缝:PCD如何修补

> 论文:Reducing Pretraining-Generation Mismatch in Diffusion Language Models > 作者:Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li > arXiv: 2608.09424

一道被忽视的裂缝

如果你训练过一个自回归语言模型(GPT 那一类),你大概知道一个不成文的规矩:训练时的输入分布要和推理时的输入分布对齐

具体来说,推理时模型拿到的是一个干净的 prompt,然后逐 token 生成。训练时也是一样——模型看到干净的左上下文,预测下一个 token。训练和推理共享同一个"干净前缀"接口。

这个对齐看起来理所当然,以至于我们很少意识到它的存在。

但扩散语言模型(Diffusion Language Model, dLLM)打破了这个理所当然。

扩散语言模型:并行解码的代价

先回顾一下扩散语言模型在做什么。

自回归模型生成一个 1000 token 的文本需要 1000 次前向传播——逐 token 生成。扩散语言模型的做法是:先随机遮蔽所有 token,然后通过多轮去噪并行恢复。理论上可以在几十步内生成几百个 token,速度优势明显。

LLaDA、MDLM、Plaid 都是这个方向的代表工作。2025 年蚂蚁集团的 LLaDA 把扩散语言模型扩展到 100B 参数,证明了这条路在工程上可行。

但扩散语言模型有一个被忽视的裂缝:预训练时的遮蔽方式和推理时的遮蔽方式不一致

裂缝的具体位置

在标准的扩散语言模型预训练中,遮蔽是全局随机的——给定一个文本序列,随机选一些 token 遮蔽,模型学习恢复。这意味着:

  • prompt 里的 token 可能被遮蔽
  • continuation 里的 token 也可能被遮蔽
  • prompt 和 continuation 被同等对待
但推理时呢?推理时模型拿到的是一个完全干净的 prompt,只有 continuation 部分需要被遮蔽和恢复。

论文把这种不一致称为 Pretraining-Generation Mismatch(预训练-生成不匹配):

预训练推理
Prompt 状态随机遮蔽完全干净
Continuation 状态随机遮蔽完全遮蔽→逐步去噪
Prompt-Continuation 关系对称(同等遮蔽)不对称(prompt 是条件)
这个不匹配的后果是:模型在预训练时从来没有学过"在干净 prompt 条件下恢复 continuation"这个任务。它学的是"在随机遮蔽的上下文中恢复随机遮蔽的 token"——一个更一般但也更散乱的任务。

用类比说:这就像一个篮球运动员训练时练的是"任意位置、任意姿势投篮",但比赛时要求的是"站在罚球线、接到球后投篮"。训练和比赛的输入分布不一致,即使训练量再大,罚球线上的表现也会打折扣。

PCD:把训练接口对齐到推理接口

论文提出的解决方案叫 PCD(Prefix-Conditioned Diffusion,前缀条件扩散)。核心思路非常直接:

训练时就把 prompt 当成干净的,只对 continuation 做扩散。

具体来说,PCD 修改了三个东西:

1. Attention Mask(注意力掩码)

在标准 dLLM 预训练中,所有 token 之间都可以互相 attend(双向注意力)。PCD 把 prompt 部分改成因果注意力——continuation token 可以看到所有 prompt token,但 prompt token 只能看到自己之前的 prompt token。

这让 prompt 部分的表示更接近自回归模型——干净、有序、不被 continuation 污染。

2. Corruption Mask(遮蔽掩码)

标准 dLLM 对整个序列随机遮蔽。PCD 只对 continuation 部分遮蔽,prompt 部分始终保持干净。

3. Label Construction(标签构造)

标准 dLLM 的损失函数在所有 token 上计算。PCD 把损失分成两部分:

  • Prompt 部分:用自回归损失(预测下一个 token)
  • Continuation 部分:用扩散损失(从遮蔽恢复)
这三个修改合在一起,让训练时的"输入接口"和推理时的"输入接口"对齐了。模型在训练时就在练习"给定干净 prompt,恢复 continuation"这个任务——这正是推理时它要做的事。

一个关键设计:不引入新组件

PCD 有一个工程上很重要的特性:它不需要自回归解码器、不需要验证器、不需要新的推理模式

这意味着什么?意味着 PCD 是一个纯训练目标层面的修改。推理时,用 PCD 训练的模型和用标准 dLLM 训练的模型用完全相同的推理流程——不需要改推理代码、不需要加额外模型、不需要换解码策略。

这一点很重要,因为很多训练方法的改进都要求推理时也做相应改动(比如 speculative decoding 需要草稿模型,medusa 需要多头解码)。PCD 把所有改动都留在训练阶段,推理时零成本。

论文还做了一个更细致的分离实验:intra-sample prefix conditioning(样本内前缀条件)vs inter-sample objective mixing(样本间目标混合)。前者是"同一个样本内,prompt 干净、continuation 扩散",后者是"一个 batch 内混合 AR 样本和扩散样本"。实验表明前者是主要贡献,后者只是一个可选的调节旋钮。

这种分离实验的价值在于:它告诉我们对齐的信号来自哪里——不是来自 batch 级别的混合,而是来自样本级别的接口对齐。

实验结果

论文在两个骨干模型上做了实验:

LLaDA2-Mini

  • 6 个基准测试的平均分:基线 → PCD,相对提升 4.2%(+2.56 分绝对值)
  • 这是一个"continued pretraining"实验——在已有的 LLaDA2-Mini 上继续训练
Qwen-1.7B
  • 主要机制对比:相对提升 14.2%(+4.86 分绝对值)
  • 这是一个从头训练的实验
两个骨干上的提升都是一致的,说明 PCD 不是某个特定模型的 trick,而是 dLLM 训练目标的通用改进。

为什么这个方向重要

扩散语言模型是当前最有可能挑战自回归范式的方向之一。原因有三:

1. 推理速度:并行解码可以在几十步内生成几百个 token,比自回归快一个数量级。 2. 全局规划:扩散模型在生成时可以看到整个序列的全局结构,理论上更适合长文本规划。 3. 可控性:扩散框架天然支持 infilling(填空)、编辑、条件生成等任务。

但扩散语言模型一直有一个"够好但不够好"的问题——在标准基准上接近自回归模型,但总差一点。这篇论文给出的诊断是:这个差距有一部分来自训练-推理不匹配

PCD 修补了这个裂缝的一部分。4.2% 和 14.2% 的提升不是惊天动地的数字,但它们指向一个系统性的改进方向——对齐训练接口和推理接口

对"评测盲区定律"的呼应

这篇论文也可以放在"评测盲区定律"的框架下理解:

  • 标准 dLLM 预训练:在"随机遮蔽恢复"任务上表现良好(训练 loss 下降,恢复质量提升)。
  • 但这个训练任务和推理任务不是同一个任务。训练任务的指标掩盖了推理时的真实表现。
这和之前几篇论文的结构同构:
  • Epanorthosis:标准 loss 掩盖了"AI 味"修辞手法的系统性出现。
  • Token Budget:标准 loss 掩盖了 CoT 推理的双峰命运。
  • QuantiBias:标准安全检查掩盖了量化引入的 24-27% 偏见。
  • PCD:标准 dLLM 训练 loss 掩盖了训练-推理接口不匹配。
同一个主题:单一指标会掩盖关键失败模式。 训练 loss 下降不代表推理质量提升——除非训练任务和推理任务对齐。

诚实评价

这篇论文有几个值得注意的地方:

提升幅度不算大。 4.2% 和 14.2% 是相对提升,绝对值分别是 2.56 和 4.86 分。在 6 个基准的平均上,这意味着每个基准大约 0.4-0.8 分的绝对提升。这是一个有意义的改进,但不是颠覆性的。

只在两个骨干上验证。 LLaDA2-Mini 和 Qwen-1.7B 都是相对小规模的模型。PCD 在更大规模(比如 7B+)的扩散语言模型上是否还能保持提升,需要进一步验证。

没有开源代码。 论文没有提供 GitHub 链接,这对于复现和社区跟进是一个障碍。

PCD 是 continued pretraining,不是 from scratch。 LLaDA2-Mini 的实验是在已有模型上继续训练,这意味着 PCD 的成本相对较低。但 Qwen-1.7B 是从头训练,成本更高。两种设置下都有提升,说明 PCD 在不同训练阶段都有效。

结语

这篇论文的核心洞察可以用一句话概括:

扩散语言模型的训练目标和推理目标不一致——训练时随机遮蔽所有 token,推理时只遮蔽 continuation。PCD 通过把训练接口对齐到推理接口,在不改变推理流程的前提下恢复了 4-14% 的性能。

这个洞察的价值不在于具体的数字,而在于它揭示了一个被忽视的设计维度:训练-推理接口对齐。自回归模型天然对齐(都是干净前缀预测下一个 token),所以这个问题在自回归范式下不会被注意到。但一旦换到扩散范式,这个对齐就不再是免费的午餐——需要显式设计。

这给所有做非自回归模型的人提了一个醒:你的训练任务和推理任务真的是同一个任务吗?

---

论文链接:https://arxiv.org/abs/2608.09424

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens