静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 17:39

w8-c3-dqwen.svg

一条只许往前走的路,能不能学会倒着走?

把预训练自回归模型改造成扩散语言模型,是眼下最省钱的一条路:权重是现成的,只要把单向注意力掰成双向,再换个训练目标。问题在于,自回归这条路线自己也在进化——它已经不太用纯注意力了,主流是混合架构:几层注意力、几层 RNN,交错着来。

而 RNN 天生是因果的。它没有"回头看"的机制,你没法像掰注意力那样把它掰成双向。这就尴尬了:最省钱的起点,恰恰是结构上最不适合扩散的那个。

这篇论文的回答是:别掰它,留着。

他们把 Qwen3.5 在 0.8B、2B、4B、9B 四个规模上改造成扩散模型,得到 dQwen3.5 家族。对照组做得相当讲究——不是随便找个模型比,而是拿 Qwen3-1.7B 做全注意力对照,还特意选了一个 trunk 参数量几乎一样的(1.41B 对 1.37B),把参数量这个变量摁死。

结果是:混合骨干用大约一半的 token,就到了同一个训练损失。因果结构没有被双向化干掉,反而像是一笔之前没人算过的账——它让优化走得更快了。

更宏观的一组数字:9B 的 dQwen3.5 只训了 50B token,就在 7 项基准里拿下 4 项第一,对手是 LLaDA-8B(2.3T token)、Dream-7B(580B)、Dream-Coder-7B(322B)。大概是别人四十六分之一的算力。

解码行为也没丢:不管全画布还是分块,整体从左往右、局部乱序——跟全注意力的扩散模型一个脾气,并行解码下也不掉链子。

现在说坑,坑都在细节里。

第一,那个"一半 token"只在 2B 对 1.7B 这一对上测过。其他规模没有这个对照,你不知道这个结论能不能外推。

第二,赢面其实很窄。改造前,Qwen3.5-2B 在那 7 项基准上全部输给全注意力对照;训了 50B 之后也只赢回 3 项。所谓"高效起点",是从一个更低的起点往上爬,爬得快,但没爬到多高。

第三,也是论文自己用小标题承认的——"改造过头会伤"。从 50B 加到 100B,0.8B 涨了 7 项里的 5 项,9B 只涨了 1 项。规模越大,越不该多训。这条对做Scaling Law的人是条真情报。

所以这篇的真正卖点不是"9B 有多强"(它不强),而是"混合骨干这条路走得通"。在一个所有人都默认"扩散模型得配全注意力"的语境里,这是一次有效的拆墙。

它没有删掉因果,只是教会了因果回头看。

*(arXiv 2609.20751,权重已开源在 HuggingFace)*

暂无表态