扩散模型那条「嵌一次、然后每步复读」的条件,被换成活的了
这篇的问题提得很准。DiT 里,类标签或文本提示被嵌入一次,然后每一步去噪都复用同一个条件——这是一个被广泛使用、却极少被追问的固定接口。作者问:能不能用预测出来的嵌入当条件?
我拉了全文,把关键数字和盘托出。
机制:NEPA + MEP + ECG
三步,层层叠起来:
- NEPA(Next-Embedding Predictive Autoregression):训练一个 Transformer 预测序列里的下一个连续嵌入。生成时干净图像跟在噪声图像之后,所以它的嵌入就是「条件 + 当前噪声图」之后的下一个嵌入。
- MEP(Multi-Embedding Prediction):一次把所有嵌入都预测出来。
- ECG(Embedding Conditioned Generation):DiT 生成器以这些预测为条件,每一步去噪重新计算一次。
最好的消融,是证明「每步重算」不能省
Table 14 那三行,我觉得比主结果更值得看:
| 重算频率 | FID |
|---|---|
| 每步重算 | 1.57 |
| 每 8 步 | 1.82 |
| 只在第一步算一次 | 242.63 |
这组消融干净地说明了一件事:这个方法的收益,恰恰来自那个「多出来的网络」被反复调用。你要是为了省算力只调一次,方法就死了。作者主动把这条负数报出来,值得记一笔。
另一处更漂亮:把「多一个网络」的增益单独卸出来
Table 7 里,作者在同一个生成器、同一套训练配方、同样的额外网络参数量与每步 FLOPs 下,只换条件的训练方式:
- 固定类嵌入:36.39
- 单网络端到端:29.52
- 预训练流模型:30.86
- NEPA + MEP:25.04
现在说账。这笔账,只算到了训练
摘要和结论都写:FID 1.32,训练算力约为 REPA 的三分之一。两句话原文都在,训练口径我也核了:3.1×10²⁰ FLOPs,对照 SiT-XL/2 + REPA 跑 800 epoch 的约 1.0×10²¹ FLOPs。用 PyTorch FLOP counter 计的理论乘加,硬件是 H200。
但推理那一侧,论文自己的表格在打架。
Table 13 里,产生 FID 1.32 的那个配置(250 步 SDE)单张图是 160 TFLOPs;而 SiT-XL/2 + REPA 在同一个 250 步 SDE 下是 91 TFLOPs。同采样器、同口径,1.76 倍,不是便宜,是更贵。
正文那句「一张图 62 TFLOPs,低于 SiT-XL/2 + REPA 的 91」,用的是 96 步 ODE 的 62——而那个配置的 FID 是 1.57,比 REPA 的 1.42 还差。拿自己的次优配置去比对方的最优配置,这是跨采样器的错位比账。
还有一层要叠上去:Appendix C 写明,开了 CFG 之后,生成器和 NEPA 模型各自都要跑条件与无条件两个分支。也就是说实际开销还要再乘一次。
而全文没有墙钟时间、没有吞吐、没有显存——一个数字都没有。
也不是全面第一
帖子只说了 FID 1.32,我把它所在的表读完了:
- FID 上确实输了一格:DDT-XL/2 是 1.26,只用 400 epoch;NEPA 是 240+80 epoch 换来的 1.32。论文对此没有讨论。
- IS 输:SRA 2 是 316.2、SRA 是 311.4,NEPA 是 311.0。
- Precision 0.79 也不是最高(SRA 2 是 0.82)。
- 真正的 SD-VAE 块第一只有两项:sFID 4.32 与 Recall 0.68。
另外,全文只在 ImageNet-1K 类条件 256×256 一个场景验证。文本条件、更高分辨率、其他潜空间,作者都写进了 future work。而方法最核心的卖点恰恰是「条件随噪声状态自适应」——这个性质在长、可变长、语义细的文本场景下最该被验证,现在完全没跑。
也没有随机种子、没有多次运行的方差、没有人工评测。代码和权重在投稿时点写的是「will be released」,还是将来时。
值得肯定
- 问题提得干净:指出了一条被广泛忽视的接口,并给出可检验的替代。
- 消融扎实且诚实:loss、stop-grad、target norm、patch size、负样本 bank 全部逐一验过,还主动报了「InfoNCE 的分类准确率反而最差」这种与生成指标相反的结果。
- 推理开销没有藏:每步 92 对 309 GFLOPs、以及降频查询的代价(1.57 → 1.82 → 242.63),都摆在表里。虽然这些数字反过来暴露了软肋,但主动报出来本身值得肯定。
一句话
它换掉的那条接口,是扩散模型里「嵌一次、然后每步复读」的条件。
动机干净,消融漂亮,Table 7 那一步卸得尤其利落。代价是采样时多背一个网络——而那句「三分之一算力」,账只算到了训练,推理那一侧被一次 62 对 91 的错位比账轻轻带过了。