[论文] Unifying Distributional Training for One-Step Visual Generation

研究领域: ML 作者: Chi Zhang, Haoyang Shi, Yueyi Liu, Ruichuan An, Junkang Zhou, Chang Li, Xiuyuan Lu, Yichi Zhang, Bo Wang, Yuhang Wu, Sen Cui, Miao Liu 发布时间: 2026-…

论文概要

研究领域: ML 作者: Chi Zhang, Haoyang Shi, Yueyi Liu, Ruichuan An, Junkang Zhou, Chang Li, Xiuyuan Lu, Yichi Zhang, Bo Wang, Yuhang Wu, Sen Cui, Miao Liu 发布时间: 2026-09-28 arXiv: 2609.35763

中文摘要

分布训练通过在冻结的表示空间中匹配真实与生成特征,为单步视觉生成提供集体监督。我们引入一个统一的理论框架,将分布建模与匹配散度分离,并通过 Wasserstein 梯度流将全局目标与逐点特征更新联系起来。在该框架下,FD-Loss 和高斯核漂移分别通过高斯最优传输和基于核密度的 KL 匹配被重新推导。该框架启发了 MGFlow——用高斯混合在全局矩和基于样本的表示之间以可调粒度建模特征分布。MGFlow 支持最优传输和基于分数的匹配,并将质量约束的样本分配与成对分量更新耦合,以解决仅靠混合表达力无法解决的模态崩溃问题。在 ImageNet 256×256 上,MGFlow 大幅超越 FD-Loss 基线,在 pMF-H 上取得 1.45 FDr⁶ 的 SOTA 结果,在 JiT-H 上取得 1.64。对于文本到图像生成,MGFlow 将 FLUX.2 [klein] 4B 后训练为单步生成器,在 GenEval 和 PickScore 上均超过原始四步模型。

原文摘要

\emph{Distributional training} provides collective supervision for one-step visual generation by matching real and generated features in frozen representation spaces. We introduce \emph{a unified theoretical framework} that separates distribution modeling from matching discrepancy and connects global objectives to pointwise feature updates through Wasserstein gradient flow. Under this framework, FD-Loss and Gaussian-kernel Drifting are recovered through Gaussian optimal transport and kernel-density-based KL matching, respectively. The framework motivates \textbf{MGFlow}, which models feature distributions with Gaussian mixtures at an adjustable granularity between global moments and sample-based representations. MGFlow supports both optimal transport and score-based matching, and couples m...


*自动采集于 2026-09-30*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

两个 SOTA 数字我都回表 4 核了,是对的。但同一行右边还有两列,摘要没让人看。

MGFlow:FDr 赢了,FID 输了

一、赢的那两列,账能对上

pMF-H(935M)FDr⁶ 1.45 对 FD-Loss 1.89,−23.3%;JiT-H(953M)1.64 对 2.65,−38.1%。摘要的 23% 和 38% 都能复算出来。FDr³(留出的三个编码器)上也赢:1.88 对 2.69、2.57 对 4.44——泛化这条站得住,因为训练用的 SIM 编码器正是被排除的那三个。

二、输的那两列,摘要没提

同一行 FID:pMF-H 从 0.77 涨到 1.07(差 39%),JiT-H 从 0.75 涨到 0.94(差 25%)。JiT-H 的 IS 还从 313.0 掉到 301.9。表 4 六列里,摘要挑了最好看的那一列。

三、两个指标的排名是颠倒的

FID 全场最好的是 AdvFD:0.74(pMF-H)和 0.72(JiT-H),而它的 FDr⁶ 是 1.74 和 1.80,排第二。MGFlow-KL 的 FDr⁶ 排第一、FID 排不上。哪个指标更贴人眼,这篇论文的立场是信 FDr——但这个立场本身需要论证,文中没给。

四、文生图那条要读细

GenEval 0.900 对四步骨干 0.794 是真赢,iRDM 0.826、AMFD-C-SIM 0.846 也都过了。但起点是从蒸馏过的 FLUX.2 [klein] 4B 继续训 1000 步、batch 1024,不是从零拿到一步生成器。PickScore 21.98 对 21.86 只差 0.12,且只在 499 条 Pick-a-Pic prompt 上测。

五、理论框架的价值在统一

FD-Loss 和 Gaussian-kernel Drifting 被当成框架的两个特例重新推导出来,这是把已有方法收进一个坐标系,不是造新方法。Table 1 里 MGFlow-KL(11.32)对 FD-Loss(13.05)的 1.7 分也说明改进是渐进的。

下一根钉子:FDr³ 那三个留出编码器上的 FID 谁赢。如果那边也是 AdvFD 好,这篇的卖点就得从「画质更好」改写成「换了把更公平的尺子」。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens