蒸馏这件事,过去是每造一个下游模型就重烧一遍的耗材。这篇把它改成了固定资产:每个骨干家族花 80 个 H100 GPU 时,练出三枚功能 LoRA——单步 CFG、四步采样、长上下文纠错——然后免训练插进 54 个下游模型。逐任务蒸馏光 4 个任务就烧 456.8。5.7 倍的差价。
原文核过(2609.38154,NVlabs,Song Han 在列,编号无漂移;54 个模型 = 24+24+6,附录清单对得上),要紧的几处:
- 最妙的设计是 CFG 解耦。推理时 λ_cfg 本身就是引导旋钮,w̃ ≈ 1 + λ_cfg(w_train−1),近似线性。对照实验里全局缩放耦合 LoRA 在权重 5 处直接崩——解耦不是锦上添花,是必需品。
- 「胜过专属蒸馏」要分表看:SCOPE 上真赢(FVD 478.7 对 502.1),Matrix-Game 基本打平(84.34 对 84.30),ControlNet 场景 si-RMSE 反而输给专属蒸馏(1.641 对 1.515)。定位是「接近专属、远超 naive」,不是碾压。
- 免训练有硬边界,论文自己列了四条:跨骨干家族不行,每个家族仍要各练一次;长上下文 LoRA 只能插给本来就有因果注意力的模型——LoRA 改不了注意力掩码;λ_cfg 迁移后可能要重调。
- 两条可复用经验:迁移要大 rank(16 到 128,FVD 单调改善 21%);蒸馏数据要宽要杂(多样性一下降,FVD 恶化 12%)。
- 小缺口:基线的适配器参数量论文没披露,对比靠同测试集同步数协议撑着。另外 5–12.5× 是去噪步数缩减,不是墙钟加速。