一个反直觉的发现
想象你在装修一套老房子。整套水电系统都是按"从左到右"的顺序设计的——客厅连着走廊,走廊连着卧室,水从主管道一路流向末端。现在你想把它改成"任意房间都能同时装修"的开放式格局。
最直觉的做法是把所有隔墙都打通。但有人告诉你:其实只需要打通那 25% 的承重墙之间的隔断,剩下 75% 的管道保持原样,房子反而装得更快、更好。
这就是 dQwen3.5 做的事。
背景:扩散语言模型的尴尬
先说清楚两个概念。
自回归模型(AR):像 GPT、Qwen 这样的大语言模型,生成文本时严格从左到右,一个 token 一个 token 地吐。就像你写字,必须从左写到右,不能跳着写。
扩散语言模型(DLM):一种新范式。它从一个全被遮盖的"画布"开始,逐步揭开(unmask)位置,可以并行、可以任意顺序生成。就像填空题——你可以先填最有把握的空,再填不确定的。
DLM 的吸引力很明显:并行生成意味着速度更快,任意顺序意味着可以先生成关键部分。但问题是,从零训练一个 DLM 太贵了——达到同等性能需要比 AR 模型多一个数量级的 token。所以大家就想:能不能直接拿现成的 AR 模型改造?
这就是 AR-to-DLM adaptation。之前的工作(DiffuLLaMA、Dream-7B、CoDA 等)都是拿**全注意力(full-attention)**的 AR 模型来改。
但问题来了:现在的 AR 模型越来越不是纯注意力了。
混合架构的崛起
2025 年以来,最先进的 AR 模型——Qwen3.5、MiniMax-01、Jamba——都在用混合架构:大部分层是 RNN(具体说是 Gated DeltaNet),只有少部分层是注意力。
原因很简单:RNN 的推理成本是 O(1)——不管上下文多长,每步计算量恒定。注意力的成本是 O(n)——上下文越长越慢。所以 75% RNN + 25% 注意力的混合模型,既保留了注意力的全局视野,又获得了 RNN 的推理效率。
Qwen3.5 就是这种架构:0.8B 模型有 18 层 Gated DeltaNet + 6 层注意力;9B 模型有 24 层 Gated DeltaNet + 8 层注意力。
但这给 DLM 改造带来了一个结构性难题。
结构性冲突
DLM 的核心能力是任意顺序生成。要做到这一点,模型需要"看到未来"——即当前位置需要获取后续位置的信息。对于注意力层,这很简单:把因果遮罩去掉就行,让它变成双向的。
但 RNN 天生是因果的。它的核心机制是把前面所有位置的信息压缩成一个隐状态,逐位置传递。你没法"双向化"一个 RNN——除非把它改成双向 RNN(BiRNN),但那完全改变了它的计算性质,也不再是原来的模型了。
所以 dQwen3.5 做了一个看似偷懒的决定:
只双向化那 25% 的注意力层,剩下 75% 的 RNN 层保持因果不变。
这看起来像是在敷衍——你只改了一小部分,怎么能叫"扩散"模型?但实验结果出乎意料。
为什么这样做有效
关键洞察在于:自然语言本身就有强烈的从左到右偏好。
这不是人为规定的,而是语言的本质特性。token 的预测高度依赖附近的左侧上下文,远处上下文的贡献是选择性的。混合 AR 模型把这个偏好编码进了架构——RNN 层负责逐位置累积左侧上下文,注意力层负责偶尔跳出去获取远处信息。
DLM 在推理时也展现出类似倾向:即使允许任意顺序解码,生成过程仍然大致从左到右,只是相邻位置偶尔乱序。
所以,只双向化注意力层,保留 RNN 的因果性,恰好匹配了语言本身的特性。RNN 提供了从左到右的骨架,注意力层提供了偶尔的"跳跃"能力。
还有一个技术细节:Token Shifting。dQwen3.5 把位置 k 的隐状态用来预测位置 k+1 的 token,这和 AR 预训练时的 readout 对齐。这个对齐被证明能显著改善 AR-to-DLM 的适配效果。
实验结果:少即是多
适配速度
在 trunk 参数量接近的条件下(1.37B vs 1.41B),dQwen3.5-2B 达到相同训练损失所需的 token 数,只有全注意力对照模型(dQwen3-1.7B)的 45%——中位数 2.21 倍的 token 节省。
换句话说:只改 25% 的层,适配速度反而快了一倍多。
下游性能
适配 50B token 后的 dQwen3.5-2B,在 7 个基准测试中:
- 3/7 超过全注意力对照(HumanEval、MBPP、MBPP+,都是代码任务)
- 在并行解码下,代码任务上经常领先
对比其他 DLM(同样 50B token 适配):
- vs CoDA(200B token):dQwen3.5-2B 在 6/7 基准上更好
- vs Dream-7B(580B token):dQwen3.5-9B 在 4/7 基准上更好
注意 token 预算的差距:dQwen3.5 只用了 Dream-7B 的 1/11 的训练量,就在多数基准上超越了它。
规模效应
一个有趣的发现:模型越大,延长训练的收益越小。
- 0.8B:100B checkpoint 在 5/7 基准上优于 50B
- 9B:100B checkpoint 只在 1/7 基准上优于 50B,其余 6/7 反而是 50B 更好
也就是说,对于大模型,50B token 已经足够适配,继续训练反而会在知识和数学任务上退化。这和"代码密集"的训练数据配比(50% 代码 + 35% 通用 + 15% 数学)有关——代码任务从持续训练中受益,但其他任务不一定。
解码行为
dQwen3.5-9B 的解码行为和从零训练的 LLaDA-8B 非常相似:整体从左到右,但相邻位置经常乱序。这说明混合架构学到的解码模式和纯注意力 DLM 一致——架构差异没有改变扩散生成的本质行为。
更深层的启示
1. "最小干预"原则
dQwen3.5 的成功是一个"最小干预"的范例:不要改你能改的所有东西,只改必须改的。RNN 层的因果性是结构性的,强行双向化会破坏它;注意力层的因果性只是遮罩,去掉遮罩就行。尊重这个差异,反而得到了更好的结果。
这和软件工程里的"最小化变更面"原则一致:改得越少,引入的风险越小,适配越快。
2. "代理目标"的再思考
训练损失和下游性能不是一回事。dQwen3.5-4B 和 9B 的训练损失曲线几乎重叠,但下游性能明显分离。这说明训练损失作为"代理目标",在比较不同架构时是有误导性的。
这和之前讨论过的"代理目标陷阱"一致:优化代理变量不等于优化真实目标。在这里,代理变量是训练损失,真实目标是下游能力。
3. 架构的"可适配性"是一个被忽视的维度
我们通常评价架构看的是"同等训练量下的性能"。但 dQwen3.5 揭示了另一个维度:架构对范式转换的适配性。混合架构不仅在推理效率上优于纯注意力,在 AR-to-DLM 的适配效率上也更优。
这暗示着一个更通用的规律:好的架构应该是"容易改造的"——不是在某个范式下最优,而是在范式转换时能快速适配。
局限与未解问题
- 数学任务仍然较弱:dQwen3.5 在数学基准上不如全注意力对照,这可能和 RNN 在长距离推理链上的局限有关
- tokenizer 差异:dQwen3 和 Qwen3.5 的 tokenizer 不同(4.18 vs 4.32 bytes/token),严格意义上的 token 级比较需要校正
- 只测了基础模型:post-training(SFT/RLHF)的影响没有评估,论文明确说这是"separate problem"
开源
dQwen3.5 在四个规模(0.8B/2B/4B/9B)上开源了基础模型,以及全注意力对照模型。这为研究混合架构的 AR-to-DLM 适配提供了统一的参考。
- 论文:https://arxiv.org/abs/2609.20751
- Qwen3.5 基础模型:https://github.com/QwenLM/Qwen3.5
一句话总结:dQwen3.5 证明了,把混合架构改造为扩散语言模型,只需要双向化 25% 的注意力层,剩下 75% 的 RNN 保持因果——适配速度反而快 2.2 倍,下游性能在多数基准上超越用 4-11 倍 token 训练的对照模型。少即是多,尊重结构差异比强行统一更好。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。