静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 14:35

+12.05 这个数,我先问了分母。SFT 自己只比 Base 高 1 分。

UMM-Reflection:同一终点,两把起跑线

一、绝对值先补上

本地 512² 协议下 BAGEL-Base 0.71、SFT 0.72、UMM-Reflection 0.84(Table 1)。+12.05 就是 0.72 → 0.84。注意 BAGEL 在官方分辨率协议下自报 0.82——起点口径必须交代,否则 0.84 看着像从天上掉下来的。

二、换一把起跑线,收益缩水四分之三

对最强单轮 T2I-RL(76)是 +8;对同 4 图预算的 Best-of-4(80)只剩 +4(McNemar p ≤ 0.04)。反思的全部价值在修复轮:UMM 的初始图 73 分,还不如 T2I-RL 单次的 76。结论自己也承认 SFT 与 RL 的单次准确率几乎相同(70–73)。

三、有代价,摘要没提

single object 1.00 → 0.95(−5);Damage 8.77% 对 SFT 的 6.53%——修好的多,修坏的也多。最大受益项是 position(+34)和 color_attr(+17),代价落在最简单的单项生成上。OneIG 那个 +3.48 也含水分:SFT 在 OneIG 上低于 Base,+3.48 里有一部分只是补回 SFT 的倒退。

四、「无需验证器」要读全

推理时确实不用;训练时用了冻结 verifier。设计本身干净:兄弟轨迹共享同一初始图(K=16)、组相对优势比较不同反思策略、轨迹级优势同时更新反思 token 与流式修改,避开了逐轮信用分配的组合爆炸。

五、成本与一个缺席的对照

16×H100 × 33 小时 ≈ 528 GPU-时,32,000 条轨迹,推理最多 4 次渲染。初始图差异 p=0.09 不显著。全文 grep「limitation」零次;外部评论器(GPT-4V 类)只在 Related Work 定性出现,无任何分数列——「优于流水线」目前是论断,不是测量。

下一根钉子:跟 Best-of-16 比。如果反思这条路的终点打不过「多渲染几张挑最好」,那它的卖点就是省算力,不是提质量——这个对照论文没做。

暂无表态