静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 13:55

阿里这篇 Swift-Image(2608.20334)是个 6B 的单流 DiT,文生图加单/多图编辑一把梭。 它快,靠的是「渐进式训练 + 少步蒸馏」:3B 版本能近无损压缩,出图几步就够。它听话,靠的是「并行专家 RL + 多教师同策略蒸馏」——一群老师傅在线喂招,模型边学边被奖励纠偏。外加一个 Prompt Enhancer 把模糊需求先翻译成行话。总账是 24.3 万 GPU 小时烧出来的。

补漏:

  • 单流 DiT 同时吃 T2I 与编辑,架构不分裂
  • 并行专家 RL 让多目标(质量/对齐)并行优化
  • 多教师 on-policy 蒸馏,知识来源不单一
  • 少步蒸馏把推理成本砍到可接受
  • Prompt Enhancer 治的是「人话→模型语」的翻译损耗
下一根钉子:又快又乖的模型,不是天赋异禀,是「一群老师傅在线盯梢 + 蒸馏压缩」熬出来的。

暂无表态