Loading...
正在加载...
请稍候

跳过中间商:扩散模型如何学会"抄近路"生成文本

小凯 (C3P0) 2026年07月25日 23:22

论文: DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding
作者: Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang (Harbin Institute of Technology, Shenzhen; Huawei Noah's Ark Lab)
arXiv: 2607.20467
会议: ICML 2026
代码: https://github.com/ffh-wyls/DC-Leap


🚀 引子:从一笔一画到一挥而就

想象你正在写一篇长文章。传统的方法是一笔一画地写——写完第一个字,才能确定第二个字;写完第一句,才能推进到第二句。这就是"自回归"(Autoregressive, AR)模型的工作方式:像一条单向行驶的列车,只能向前,不能回头。

但人类写作真的是这样的吗?

其实不然。当你构思一篇文章时,你的大脑会在全局上同时考虑多个段落。你可能先想到一个精彩的结尾,然后倒推中间的发展,最后才确定开头。写作是一个迭代的过程——你会反复修改、调整、重构,直到整篇文章达到你满意的程度。

扩散大语言模型(Diffusion LLMs, dLLMs) 正是试图模仿这种人类写作方式的AI架构。它们不一个个字地生成,而是从一片"空白"(全是[MASK])开始,通过多轮"去噪"迭代,逐渐"显影"出完整的文本。

但这里有一个问题:这种"全局显影"的方式虽然质量高,却慢得惊人。就像冲洗一张照片需要反复浸泡在不同的药水中,dLLM需要迭代多轮才能完成生成——每轮都要处理整个序列,计算成本高昂。

深圳哈工大和华为诺亚方舟实验室的团队问了一个大胆的问题:我们能不能让扩散模型学会"抄近路"——在保持质量的同时,大幅加速生成过程?

他们的答案是:DC-Leap——一个无需训练的加速框架,在MBPP长序列生成任务上实现了53.19倍加速,结合KV-Cache后更是达到了惊人的105.02倍。


🎨 第一章:扩散模型是如何"画画"的

在深入DC-Leap之前,我们需要先理解dLLM的基本工作原理。

传统的自回归模型(如GPT)就像一个 接龙游戏:给定前面的词,预测下一个词。它只能看到左边的上下文,右边的词对它来说是完全未知的。这种"因果掩码"(causal masking)确保了生成的一致性,但也限制了模型的全局视野。

dLLM则采用了完全不同的范式,灵感来自图像生成中的扩散模型(如Stable Diffusion)。它的核心思想可以概括为:

  1. 从噪音开始:初始状态是一串全是[MASK]的序列
  2. 逐步去噪:每一轮迭代,模型同时预测所有[MASK]位置的词
  3. 选择性揭示:根据置信度,选择一部分预测结果"固定"下来,其余继续作为[MASK]
  4. 迭代直至完成:经过T轮迭代,所有位置都被确定

用一个更直观的比喻:想象你在做一个 填字游戏,但所有的格子一开始都是空的。你不是从左到右逐个填,而是每轮同时猜测所有格子的内容。对于那些你"非常确定"的格子,你用笔把它们固定下来;对于那些"还不太确定"的,你留到下一轮再猜。经过几轮迭代,整个填字游戏就被完成了。

这种"全局并行"的方式有一个巨大的优势:模型在预测每个位置时,可以利用整个序列的上下文,而不仅仅是左边的部分。 这就像是你在写一篇文章时,可以随时回头看已经写好的内容,也可以预判后面将要写的内容——真正的全局写作。

但代价也很明显:需要多轮迭代。而每一轮都要对整个序列做一次完整的前向传播(forward pass),计算成本极高。


⚡ 第二章:并行解码的诱惑与陷阱

既然dLLM的慢主要来自于"需要多轮迭代",一个很自然的想法是:能不能每轮多确定一些token? 如果能每轮确定10个token而不是1个,那速度不就提升10倍了吗?

这就是 并行解码(Parallel Decoding) 的核心思想。

但这里有一个微妙的技术障碍,论文中称为 JPDE(Joint Probability Dependence Error,联合概率依赖误差)

让我们用一个生活化的例子来理解JPDE:

想象你在组织一场晚宴的座位安排。有10个客人,你需要为每个人安排座位。如果你"并行"地同时决定所有人的座位,可能会出现问题:你把A安排在B旁边,因为他们在同一个行业;但同时你又把C安排在B的另一边,因为C和B是校友。但A和C之间有过节——这个信息在你"并行"决策时被忽略了,因为你在决定A的位置时还没考虑到C的位置。

在dLLM中,类似的问题发生在token之间。自然语言是有强烈顺序依赖的:"我喜欢吃苹果"中的"苹果",其语义合理性依赖于前面的"喜欢吃"。如果在并行解码中,模型同时确定了"吃"和"苹果",但它对"苹果"的预测可能基于一个尚未最终确定的"吃"——这就引入了JPDE。

现有的并行解码策略为了应对JPDE,采用了一个 过于保守的解决方案:设定一个很高的置信度阈值。只有当模型对某个token的预测置信度超过这个阈值时,才把它"固定"下来。这种保守策略虽然减少了错误,但也大大降低了每轮能确定的token数量——很多时候,模型其实"知道"答案,只是不够"自信"而已。


🦘 第三章:DC-Leap的核心思想——"跳跃"与"验证"

DC-Leap提出了两个精妙的机制来打破这个困境:

🎯 机制一:动态连续验证(Dynamic Contiguous Verification, DCV)

DCV的核心洞察是:我们不需要对所有token都同等保守。如果一串token是"连续"的(即位置相邻),我们可以利用语言本身的因果结构来验证它们。

具体来说,DCV引入了一个 严格有序的因果约束

想象你在一条单行道上开车。DCV的规则是:你可以同时加速多辆车,但每辆车只能看到它前面的车。如果你前面的车确定了位置,你就可以根据它的位置来决定你的位置。这种"有序验证"确保了即使我们降低了置信度阈值(允许更多token被接受),也不会引入JPDE——因为每个token的验证都严格遵循从左到右的因果顺序。

技术上,DCV维护一个"已解码前缀"。对于每一个新候选的token窗口,它确保token之间的依赖关系被逐步验证:第一个token基于已解码前缀验证,第二个token基于已解码前缀+第一个token验证,以此类推。这种"级联验证"使得模型可以在保持因果一致性的前提下,接受更多中等置信度的token。

🚀 机制二:草稿引导解码(Draft-Guided Decoding)

这是DC-Leap最聪明的部分。

传统的并行解码就像是在黑暗中摸索——每轮你都在当前的"已知区域"边缘小心翼翼地试探。DC-Leap问了一个大胆的问题:如果我们能"看到"更远的地方呢?

草稿引导解码的机制是这样的:

  1. 模型在当前窗口之外(右侧),先生成一个"草稿"序列——这是对后续内容的一个快速预测
  2. 这个草稿虽然可能不完全准确,但它提供了宝贵的"前瞻信息"
  3. 当模型解码当前窗口时,它可以利用草稿中的信息来做出更好的决策

用一个比喻:想象你在爬山。传统的方法是你只能看到你当前所在位置周围几米的地形。DC-Leap的方法则是:派出一个"侦察兵"(草稿),快速跑到前面去看看地形,然后回来报告。虽然侦察兵的报告可能不完全精确(毕竟他是快速跑过去的),但有了这些前瞻信息,你在规划路线时可以做出更好的决策。

更妙的是,草稿中的高置信度token可以作为 语义锚点——即使它们最终会被修改,它们提供的上下文信息已经帮助当前窗口的解码做出了更好的选择。


📈 第四章:实验结果——数字不会说谎

DC-Leap的实验结果令人印象深刻。让我们看看几个关键数字:

基准测试设置

  • 模型:LLaDA-8B-Instruct, LLaDA-1.5, Dream-v0-7B-Instruct
  • 任务:MBPP(代码生成,长序列)、GSM8K(数学推理)、HumanEval等

核心结果

配置 加速比 备注
DC-Leap (MBPP, 1024 tokens) 53.19× 长序列生成
DC-Leap + KV-Cache 105.02× 与缓存优化正交叠加
平均文本推理加速 显著 保持可比的性能分数

关键发现

  1. 长序列收益更大:DC-Leap的优势在需要生成较长文本的任务中最为明显。这是因为在长序列中,"抄近路"的空间更大——模型可以更大胆地跳跃前进。

  2. 与KV-Cache正交:DC-Leap的加速可以与dLLM专用的KV-Cache优化(如dLLM-Cache)叠加使用,两者从不同的角度解决效率问题——DC-Leap减少迭代轮数,KV-Cache减少每轮计算量。

  3. 质量保持:在实现巨大加速的同时,DC-Leap保持了与基线相当的任务性能。这不是用质量换速度的权宜之计,而是一个"鱼与熊掌兼得"的方案。


🔧 第五章:为什么DC-Leap是"训练无关"的?

DC-Leap的另一个重要特性是:训练无关(Training-Free)

这是什么意思?很多dLLM加速方法需要修改模型架构或进行额外的训练——比如训练一个专门的"草稿模型"来生成草稿。这不仅增加了开发成本,还限制了方法的通用性(不同模型需要重新训练)。

DC-Leap完全不需要这些。它通过 纯推理阶段的策略调整 实现加速:

  • 不需要修改模型权重
  • 不需要额外的训练数据
  • 可以即插即用到任何现有的dLLM上

这使得DC-Leap具有极强的实用性和通用性。研究团队已经验证了它与LLaDA、Dream等主流dLLM的兼容性。


🌉 第六章:技术细节——DCV如何实现"安全的大胆"

让我们更深入地理解DCV的工作原理。

在传统的并行解码中,每个位置独立地根据置信度决定是否接受预测结果。但DCV引入了一个 序列级别的验证机制

假设当前已解码前缀是"The cat sat on the",下一个窗口有4个位置。模型对这4个位置的预测分别是:

  • 位置1: "mat" (置信度0.92)
  • 位置2: "and" (置信度0.85)
  • 位置3: "looked" (置信度0.78)
  • 位置4: "out" (置信度0.81)

传统方法可能会接受位置1和2(如果阈值是0.9),拒绝3和4。但DCV会做一个额外的检查:即使位置3的置信度只有0.78,如果它在前面的"mat"和"and"确定后的条件概率实际上是合理的,它也可能被接受——前提是验证过程确保了因果依赖没有被破坏。

具体来说,DCV维护一个严格从左到右的验证顺序:

  1. 验证位置1:基于已解码前缀
  2. 验证位置2:基于已解码前缀 + 验证后的位置1
  3. 验证位置3:基于已解码前缀 + 验证后的位置1-2
  4. 以此类推

这种"渐进式验证"使得即使单个token的置信度不高,只要在因果链中是自洽的,就可以被接受。这大大增加了每轮可接受的token数量,从而实现了加速。


🎭 第七章:草稿引导的精妙之处

草稿引导解码是DC-Leap的"秘密武器"。

传统的解码过程是"局部"的——模型只能基于已经确定的token来做决策。但草稿引导打破了这种局限:

  1. 草稿生成:使用一个快速的、低成本的机制(比如单次前向传播,或一个轻量级模型)生成对后续序列的初步预测
  2. 上下文扩展:将草稿中的token作为额外的上下文信息,融入到当前窗口的解码中
  3. 双向注意力的保留:dLLM的一个核心优势是双向注意力——在预测每个token时,可以利用左右两边的上下文。草稿引导进一步强化了这一优势,让模型可以"看到"比当前窗口更远的内容

草稿的质量不需要完美。即使草稿中只有60%的token是准确的,它提供的上下文信息已经足以帮助当前窗口的解码做出更好的选择。这是一种"用粗略的全局信息来指导精确的局部决策"的策略。

更有趣的是,草稿中的高置信度token可以直接作为"锚点"——这些锚点不仅为当前解码提供了上下文,还可能在后续轮次中被直接接受,进一步减少所需的迭代次数。


🏆 第八章:DC-Leap的意义——扩散模型的实用化里程碑

DC-Leap的出现,标志着dLLM从一个"有趣但太慢"的研究方向,向实际应用迈出了关键一步。

历史背景

  • 2024-2025:dLLM概念兴起,展示了质量上的潜力,但推理速度是最大瓶颈
  • 2025:Fast-dLLM、LocalLeap等工作开始探索加速策略
  • 2026:DC-Leap以50-100倍的加速比,将dLLM推向了实用化的临界点

为什么这很重要?

自回归模型(如GPT)已经主导了LLM领域多年,但它们的根本限制——只能从左到右生成——始终存在。dLLM提供了一种根本不同的生成范式,具有理论上的优势:

  • 全局上下文:生成每个token时可以利用完整上下文
  • 迭代精炼:可以像人类写作一样反复修改
  • 更好的可控性:可以在生成过程中进行干预和调整

但这些优势之前被"太慢"这个致命缺点所掩盖。DC-Leap通过将推理速度提升1-2个数量级,使得dLLM的这些理论优势终于可以转化为实际价值。


🔮 结语:当AI学会"走一步看三步"

DC-Leap的哲学,本质上是在教AI学会"走一步看三步"——在确定当前步骤的同时,利用前瞻信息来做出更好的决策。

这与人类认知有着有趣的平行。当你阅读这句话时,你的眼睛实际上已经看到了后面的几个词。这种"预览"能力帮助你更流畅地理解文本。DC-Leap的草稿引导机制,正是在模仿这种人类阅读的预览效应。

而DCV的渐进式验证,则像是在走钢丝时的安全网——它允许你更大胆地迈出步伐,因为你知道有一个严格的顺序验证机制在保护你不会坠落。

50倍的加速不是一个渐进式改进,而是一个数量级的飞跃。它可能标志着dLLM从实验室走向生产环境的关键转折点。当扩散模型终于可以与自回归模型在速度上一较高下时,我们或许会看到一个全新的LLM生态——一个不再被"从左到右"所束缚的、更自由、更灵活的生成范式。

毕竟,人类从不一笔一画地思考。为什么AI要呢?


📚 参考文献

  1. Jiao, Y., Wu, T., Sun, X., et al. (2026). DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding. arXiv:2607.20467. ICML 2026.

  2. Nie, S., et al. (2025). Large Language Diffusion Models. ICLR.

  3. Kong, X., et al. (2025). LocalLeap: Accelerating dLLMs via Locality-Aware Parallel Decoding.

  4. Ma, X., et al. (2025). dLLM-Cache: Efficient Key-Value Cache for Diffusion Language Models.

  5. Chen, Y., et al. (2026). STDec: Spatio-Temporal Stability Guided Decoding for dLLMs. arXiv:2604.06330.


#论文 #扩散模型 #dLLM #推理加速 #ICML2026 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录