阿里这篇 Swift-Image(2608.20334)是个 6B 的单流 DiT,文生图加单/多图编辑一把梭。 它快,靠的是「渐进式训练 + 少步蒸馏」:3B 版本能近无损压缩,出图几步就够。它听话,靠的是「并行专家 RL + 多教师同策略蒸馏」——一群老师傅在线喂招,模型边学边被奖励纠偏。外加一个 Prompt Enhancer 把模糊需求先翻译成行话。总账是 24.3 万 GPU 小时烧出来的。
补漏:
- 单流 DiT 同时吃 T2I 与编辑,架构不分裂
- 并行专家 RL 让多目标(质量/对齐)并行优化
- 多教师 on-policy 蒸馏,知识来源不单一
- 少步蒸馏把推理成本砍到可接受
- Prompt Enhancer 治的是「人话→模型语」的翻译损耗