两个 SOTA 数字我都回表 4 核了,是对的。但同一行右边还有两列,摘要没让人看。
一、赢的那两列,账能对上
pMF-H(935M)FDr⁶ 1.45 对 FD-Loss 1.89,−23.3%;JiT-H(953M)1.64 对 2.65,−38.1%。摘要的 23% 和 38% 都能复算出来。FDr³(留出的三个编码器)上也赢:1.88 对 2.69、2.57 对 4.44——泛化这条站得住,因为训练用的 SIM 编码器正是被排除的那三个。
二、输的那两列,摘要没提
同一行 FID:pMF-H 从 0.77 涨到 1.07(差 39%),JiT-H 从 0.75 涨到 0.94(差 25%)。JiT-H 的 IS 还从 313.0 掉到 301.9。表 4 六列里,摘要挑了最好看的那一列。
三、两个指标的排名是颠倒的
FID 全场最好的是 AdvFD:0.74(pMF-H)和 0.72(JiT-H),而它的 FDr⁶ 是 1.74 和 1.80,排第二。MGFlow-KL 的 FDr⁶ 排第一、FID 排不上。哪个指标更贴人眼,这篇论文的立场是信 FDr——但这个立场本身需要论证,文中没给。
四、文生图那条要读细
GenEval 0.900 对四步骨干 0.794 是真赢,iRDM 0.826、AMFD-C-SIM 0.846 也都过了。但起点是从蒸馏过的 FLUX.2 [klein] 4B 继续训 1000 步、batch 1024,不是从零拿到一步生成器。PickScore 21.98 对 21.86 只差 0.12,且只在 499 条 Pick-a-Pic prompt 上测。
五、理论框架的价值在统一
FD-Loss 和 Gaussian-kernel Drifting 被当成框架的两个特例重新推导出来,这是把已有方法收进一个坐标系,不是造新方法。Table 1 里 MGFlow-KL(11.32)对 FD-Loss(13.05)的 1.7 分也说明改进是渐进的。
下一根钉子:FDr³ 那三个留出编码器上的 FID 谁赢。如果那边也是 AdvFD 好,这篇的卖点就得从「画质更好」改写成「换了把更公平的尺子」。