← 返回主题列表
✨步子哥
@steper · 2026年07月20日 17:11 · 1浏览

扩散语言模型的电路解剖:双向归纳头是如何工作的

自回归模型的"归纳头",被研究透了

如果你关注过Transformer的可解释性研究,一定听说过归纳头(induction head)

这是自回归(AR)语言模型里最经典、被研究得最透彻的电路之一。它的工作原理很简洁:模型在上下文里看到一段模式 A B,然后在后面遇到 A 时,预测下一个token是 B。实现上,它由两类注意力头协作——previous-token头把"前一个token是什么"写入残差流,induction头用这个信息去匹配上下文中相同的模式,并复制其后跟的token。

这个电路被认为是Transformer上下文学习(in-context learning)的核心机制之一。Olsson等人在2022年的经典论文里把它比作"Transformer学会学习的最小单元"。

但有一个问题:所有这些研究都集中在自回归模型上。对于另一类正在崛起的语言模型——扩散语言模型(Diffusion Language Models, DLMs)——我们几乎一无所知。

扩散语言模型:另一种生成范式

扩散语言模型不预测"下一个token",而是从噪声中逐步去噪,像扩散模型生成图像一样生成文本。给定一段被部分mask掉的文本,DLM预测被mask掉的内容,反复迭代直到所有位置都被填满。

这个范式有几个吸引人的特性:双向注意力(每个位置可以同时看到左边和右边)、非自左向右的生成顺序(可以并行解码)、以及可控的生成过程(可以迭代修正)。Mercury、DiffuGemma等模型已经展示了商业级潜力。

但DLMs内部到底在做什么?它们的"归纳头"长什么样?和AR模型的归纳头是同一个东西吗?

2026年7月,布加勒斯特理工大学的Andy Catruna和Emilian Radoi发表了一篇论文,第一次系统性地解剖了DLMs的内部电路。

发现:DLMs学会了"双向归纳头"

研究者训练了架构匹配的AR模型和DLMs(都是纯注意力、无FFN的简化Transformer),然后对比它们的内部电路。

发现可以总结为一句话:DLMs学会了和AR模型同构的归纳头电路,但它是双向的。

具体来说:

  • AR模型的归纳头:previous-token头把"左边一个token"的信息写入残差流 → induction头用这个信息匹配上下文 → 复制后跟token。只能向左看
  • DLM的归纳头previous-token头 + next-token头同时把"左边一个token"和"右边一个token"的信息写入残差流 → induction头用这两个方向的线索匹配上下文 → 复制答案token。左右都能看
这个电路是方向对称的:不管答案出现在mask位置的左边还是右边,同一套电路都能工作。不需要为"向前找"和"向后找"分别学两套机制。

关键实验:遮住一边,看性能怎么变

为了验证"双向"确实是优势来源,研究者做了一个精巧的对照实验:

  • 条件1:只给DLM看左边的上下文(模拟AR模型的视角)
  • 条件2:给DLM看左右两边的上下文(DLM的正常工作方式)
结果:在条件1下,DLM的归纳能力和AR模型没有显著差异。但在条件2下,DLM显著更强

这直接证明了:DLM的优势不在于"学到了更强的单向机制",而在于它能利用双向上下文。同一个电路,看到的信息更多,表现就更好。

更惊人的发现:DLM自己学会了"隐式时间步"

扩散模型的一个核心概念是时间步(timestep)——当前去噪到了第几步。在图像扩散模型里,时间步通常通过显式的embedding注入模型。

但DLMs呢?研究者发现:DLMs在没有显式时间步embedding的情况下,自己学会了从全局mask比例中推断时间步

具体来说:

  • 用一个线性探针(linear probe)从残差流的单个位置就能高精度恢复全局mask比例
  • 如果沿着这个"mask比例方向"对残差流做patching(干预),会因果性地改变模型的预测熵
这意味着DLMs内部自发形成了一个"时间步估计器"——它通过观察整个序列里有多少位置被mask掉,来推断当前去噪的进度,并据此调整预测策略。这个能力不是被设计出来的,是训练过程中涌现的。

这和AR模型形成了鲜明对比。AR模型每一步只看左边已生成的token,不需要"时间步"概念。DLMs面对的是一个部分填充的序列,它必须知道"现在去噪到了什么程度"才能做出合理预测——而这个信息,它是自己学会提取的。

为什么这件事重要

1. 机制可解释性从AR扩展到DLM

过去五年,Transformer的可解释性研究几乎被AR模型垄断。我们知道了归纳头、知道了感应电路、知道了超级叠加……但这些都是关于"从左到右"的模型。DLMs作为另一种正在商业化的架构,其内部机制长期是黑箱。

这篇论文打开了这扇门:DLMs不是在学一套完全不同的东西,而是在AR的电路基础上扩展了方向性。previous-token头变成了previous-token + next-token头,单向匹配变成了双向匹配。同样的电路模板,多了一个维度

2. 双向上下文是DLMs优势的根源

DLMs在许多任务上表现优于AR模型,但优势来源一直有争议:是因为双向注意力?是因为迭代去噪?是因为训练方式?

这篇论文给出了直接证据:至少在归纳任务上,双向上下文访问是优势的核心来源。把DLM限制成只看左边,它的归纳能力就退化到AR水平;放开右边,它就更强。

3. 隐式时间步是涌现计算

DLMs自己学会估计时间步,这件事的意义超出了"又一个有趣的发现"。它意味着模型有能力从输入的统计特征中提取全局状态信息,即使这个信息没有被显式提供。

这和大脑的"元认知"有几分相似——我们也不是被显式告知"你现在思考到了第几步",而是通过感知自己的认知状态来推断。DLMs的隐式时间步,某种意义上是这种元认知的最简形式。

未解的问题

论文也诚实地指出了局限:

  • 简化模型(纯注意力、无FFN)和真实大规模DLMs之间可能有差距
  • 只分析了归纳这一种电路,DLMs可能还有其他独特的电路未被识别
  • 隐式时间步的发现是在小模型上做的,能否推广到Mercury这种商业级DLM还未知
但作为一个"打开黑箱"的开端,这篇论文已经足够精彩。它让我们看到:不同的生成范式,不是在学完全不同的东西,而是在同一套电路框架上做了不同的扩展。AR选择了效率(单向、一次过),DLM选择了灵活(双向、迭代)。电路层面的差异,恰好映射了这种设计哲学的差异。

---

论文Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models

分析工具TransformerLens

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens