静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 17:39

w8-c4-lambda-grpo.svg

医生不再一个症状开一副药,因为他发现所有症状来自同一项血检指标。

Flow-GRPO 把扩散/流匹配的图像生成器变成一个可以用强化学习调的随机策略——去噪的每一步是一个动作,奖励从最后那张图反馈回来。想法很漂亮,训练起来一地鸡毛:重要性比率在各去噪步之间表现完全不一样,有的步整体偏低、有的步方差炸开、裁剪比例步步不同、后期可用样本越来越少。

之前的工作把这些当成四种独立的病,各开一副手调的稳定器。

这篇论文说:不是四种病,是一种病的四个表现。而且这个"一",可以从采样器的高斯转移核里精确推导出来——它叫路径方差 λ。对数比率服从高斯,均值恰好是 −λ/2,方差恰好是 λ。一个数,管住左移、离散、裁剪失衡、可用样本流失这四件事。

这就把"不稳定性"从一堆待修的症状,变成了一份可以预算的资源。你可以预测每一步要花多少、该在哪一步少花。两个控制尺度(裁剪半径 ε 和保留分位 q)也都是标准策略选择,不是新引入的自由超参——这点做得很体面。

审计数字很漂亮(tiny-SD3,三 seed 平均):

  • 对数比漂移:−0.002693 → −0.000041,压了 65 倍
  • 对数比方差:7.32e−7 → 8.83e−9,压了 83 倍
  • 被裁剪比例:0.1169 → 0.0730
  • 奖励:−0.008114 → −0.008238,纹丝不动
最后一行是整篇最有意思的地方。病治好了,病人没觉得好受一点。

现在说真刀真枪的那组实验,坑在这里。

主实验(SD3.5 Medium + LoRA,762 条留出提示):OCR 奖励 0.5632 → 0.5831,完全匹配 12.99% → 14.44%,子串 19.29% → 22.83%。听着不错,但有四处要打折。

一,这个方法有两个组件:LambdaNorm-T(归一化)和 damp-only λ 加权(按预测成本衰减梯度)。把论文自己的数字代进去,后者在主实验里的权重 w = min(1, √(τ/λ̂)) 约等于 1——从头到尾没起作用。真正干活的只有归一化那半。所谓"按预算分配梯度努力"这个卖点,在头条实验里是空转的。

二,预算也没被用满。τ≈0.01026,实测只花 0.000332,用了 3.2%。而在 PickScore 那组(Table 6),λ 方法在 ckpt40 花 4.65e−3,约 2.3 倍预算;在 ckpt80 花 3.34e−3,约 1.67 倍——两档都超了。反倒是基线 RatioNorm 在 ckpt40 只花 3.8e−5,比论文方法低两个数量级。所谓"基线系统性超支",只在第 80 步那个检查点成立。

三,256 条验证集(用来选检查点的那批)上,基线的平均 OCR 和 CER 都赢过 λ 方法——作者自己加粗标出来的。摘要里那句"相对提升约 39% 和 61%"用的也是验证集口径;换到 762 条留出测试集,就变成 +1.44 和 +3.54 个百分点。摘要挑了好看的那个口径。

四,跨骨干泛化那组(FLUX.1-dev,单种子)是全篇"数据最强、可比性最弱"的地方。Table 5 里最吸睛的一列——λ 方法把裁剪率从基线的 0.888–0.990 压到 0.060–0.100,"降一个数量级"——但这个 r̃ 是方法自己重新定义过的校准比率:先用 λ̂ 把对数比率标准化,再缩放到目标方差,这个分布天然紧贴 1,落在窄区间里几乎是构造出来的。拿它和别人那个未经校准的原始比率比裁剪率,等于先改尺子再比读数。作者在同一段落亲手写了免责声明,承认这"不是跨方法可比的原始比率"。诚实的论文,容易被误读的表格。FLUX 三个任务最后是 1 胜(OCR,未达显著)、1 平(PickScore,微负于未调基线)、1 平(GenEval,统计不可分辨)。

所以我的读法是:诊断部分是真贡献——把四种症状归到一个可推导的标量上,这一步干净、有预力,值得写进教科书。处方部分要打折扣——它稳定了该稳定的东西,但在"提升任务质量"这件事上,一半组件没工作,预算线没被用满,对手在验证集上还略占上风。

把病治好了,病人却没觉得好受一点。这句话值得贴在每个做稳定性改进的人的屏幕边上。

*(arXiv 2609.22041)*

暂无表态