[论文] Adversarial Training for Pixel Diffusion

研究领域: CV 作者: Xin Lin, Zhifei Zhang, Yuqian Zhou, Haitian Zheng, Zhe Lin, Ming-Hsuan Yang, Truong Nguyen 发布时间: 2026-09-29 arXiv: 2609.38170

论文概要

研究领域: CV 作者: Xin Lin, Zhifei Zhang, Yuqian Zhou, Haitian Zheng, Zhe Lin, Ming-Hsuan Yang, Truong Nguyen 发布时间: 2026-09-29 arXiv: 2609.38170

中文摘要

像素空间扩散模型直接生成RGB图像,避免了自编码器的瓶颈,但其输出仍未充分再现细粒度自然图像统计特征。本文表明对抗学习为这一缺陷提供了一种有效的训练后修正方法。从预训练模型出发,我们保留其原始的扩散或流匹配目标,并在非高噪声时间步上对预测输出添加对抗损失,模型架构和采样过程均保持不变。据我们所知,这是首个对像素扩散模型进行系统性对抗训练后研究的工作。在两种像素骨干网络上,该方法同时改善了分布保真度、覆盖率、提示对齐度和感知质量。我们进一步探究了其内在机理:频带和幂律分析表明,原始模型系统性地产出不足的自然图像高频内容,而对抗训练后恢复了这一缺失的频谱功率。相比之下,感知损失也能增加高频内容,但会牺牲分布保真度和提示对齐度。最近邻、召回率和匹配的无GAN SFT对照实验进一步排除了记忆化、模式丢弃和额外优化作为简单解释。最后,我们考察了这一效应的边界:在测试的潜在扩散配置下,相同程序未产生可比的联合改进,且几乎未增加解码后的高频功率。这些结果表明,直接输出访问被修正的图像统计特征是决定对抗训练后成功与否的关键因素。

原文摘要

Pixel diffusion models generate RGB images directly, avoiding the bottleneck of an autoencoder, yet their outputs still systematically underrepresent fine-scale natural-image statistics. We show that adversarial learning provides an effective post-training correction for this deficiency. Starting from a pretrained model, we retain its original diffusion or flow-matching objective and add an adversarial loss to the predicted output at non-high-noise timesteps, leaving the model architecture and sampling procedure unchanged. To our knowledge, this is the first systematic study of adversarial post-training for pixel diffusion. Across two pixel backbones, the method jointly improves distribution fidelity, coverage, prompt alignment, and perceptual quality. We further investigate why it works. ...


*自动采集于 2026-10-01*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

四项同向是真的。但"提示对齐改善"这一项,在所有配置下都是 0.318→0.319。

先说立得住的部分。表 1 里 DeCo 上 FID 33.27→28.59、pFID 27.91→24.38、CMMD 0.836→0.736、Rec 0.361→0.406、DPG 81.6→83.3;PixelGen 那边九列也全同向。两条像素骨干、四个方向同时动,不算小事。而且作者把对照做齐了:matched no-GAN SFT、DINOv2 最近邻记忆化检验、频谱匹配的锐化对照、CFG 与采样器对照、pixel–latent 机制探针。想用"只是过拟合""只是锐化"来打它,路基本被堵死。

要打折的四处。

  • "提示对齐"只有 DPG 一个指标在动。 CLIP 在表 5/7/8 的全部配置下恒为 0.318→0.318/0.319,相对 +0.3%。四项里最薄的就是它。
  • PixelGen 的"保真度"几乎没动。 FID 33.94→33.20,−2.2%;pFID −1.0%、CMMD −4.9%。DeCo 那边是 −14.1%/−12.6%/−12.0%,方向对,量级差五到十倍。而且 PixelGen 那一臂严格说不是"同一基线加 GAN",是用 GAN 替换掉了原生的 perceptual 监督(表 10)。
  • 主配置不是全能第一。 表 7 里 image-only DINOv2(t≥0.35)的 Rec 0.447 / TOPIQ 0.787 / MANIQA 0.729,全面优于主配置的 0.406/0.768/0.712,后者只赢 FID/CMMD/pFID。
  • 增益强依赖一个冻结的预训练判别器。 从零训练的 PatchGAN/StyleGAN 出来的 FID 是 32.51–33.50,对基线 33.27 几乎无效。
帖子没提、但挺要紧的一条:作者自己在 §4.3 写了——真实照片在 TOPIQ 上得分最低(0.57),比 no-GAN 模型的 0.711、加 GAN 的 0.768 都低,并明说"无参考指标本身不足以单独使用"。也就是说,四项里的"感知质量",是由一套给真照片打最低分的尺子量出来的。

另外三处口径:频谱那三个百分比(图 3 的 2.1%→3.9%、表 4 的 4.3→13.9、表 11 的 0.019%→0.198%)附录 D 自陈"不应在数值上互比";同一模型换评测集绝对值会跳(DeCo 的 TOPIQ 在 COCO-30k 是 0.711,在 300 prompt 那组只有 ≤0.52);潜在扩散那边的"SANA 无变化"其实是混合退化——Rec 0.340→0.325、pFID 32.20→33.29、MANIQA 0.631→0.614,只有 FID 微降。

可复算:FID 相对 −14.1%、Rec +12.5%、DPG +2.1%、CMMD −12.0%、IS +1.1%、CLIP +0.3%。+0.34 dex ≈ 2.2 倍高频功率,−0.14 dex ≈ 0.72 倍(PixArt 那边是下降的)。

一句话:读成"冻结 DINOv2 判别器 + 特定门控下的工程报告"没毛病;四项同向是真的,但绝对 FID 仍在 28–33,PixelGen 保真度只涨 2%,CLIP 不动,而且全文没有误差棒、没有多种子、没有 p 值、没有人类偏好研究。

四项同向,但有一项没动

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens