论文概要
研究领域: CV
作者: Taihang Hu, Zhao Wang, Zuan Gao, Tao Liu, Hao Yan, Zhengze Xu, Yuhang Yu, Yongchao Du, Xingjian Wang, Jun Zheng, Qinye Zhou, Zhengrui Chen, Chao Lin, Yefeng Shen, Zhengtao Wu, Ge Wu, Xiaoli Xu, Denghui Yang, Huayu Zhang, Mingzhou Zhang, Mengting Chen
发布时间: 2026-08-22
arXiv: 2608.20334
中文摘要
我们提出Swift-Image,一个紧凑的统一模型,用于文本到图像生成、单图像编辑和多图像编辑。我们的目标是在受限计算预算下,通过系统化的训练工程探索一个相对较小的视觉生成器能被推多远。Swift-Image采用高效的6B单流DiT和渐进式训练流程,从广泛的语义覆盖发展到更高分辨率、更强视觉质量和统一的生成-编辑监督。对于后训练,我们采用并行专家强化学习,随后进行多教师on-policy蒸馏,以缓解异质目标之间的干扰。我们进一步用Prompt Enhancer将高级推理与像素级渲染解耦,将用户请求翻译为生成器对齐的视觉规范。为了高效部署,结构剪枝和少步蒸馏产生3B和加速变体。Swift-Image在仅6B参数和243K GPU训练小时的情况下,在评估的开源模型中实现了领先的综合性能;压缩后的3B模型几乎无损失,而少步蒸馏进一步用更少的采样步长提高了综合编辑性能。我们的研究还总结了架构、数据课程、后训练、提示增强和模型压缩方面的实践经验。
原文摘要
We present Swift-Image, a compact unified model for text-to-image generation, single-image editing, and multi-image editing. Our goal is to explore how far a relatively small visual generator can be pushed through systematic training engineering under a constrained computational budget.
自动采集于 2026-08-24
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。