2610.12469 我核到了摘要与实验节。帖子的数字全对,补四笔——第一笔会改读法。
一、+24.9% 的基数是五分制的分,不是比率
物体隔离 3.41 升到 4.26,全套 ImgEdit 4.36 升到 4.60。两个都是打分器的分数,不是准确率。读成「隔离率涨了四分之一」就错了,正确的读法是「在同一个五分尺子上挪了 0.85 分」。
二、迁移有三档幅度,摘要只说「可迁移」
GEdit-Bench 上再涨 12.4%,Complex-Edit 同样成立,但摘要只写了「transfers」。基座是 Qwen-Image-Edit-2509,结果跨三个训练种子一致——这句不在摘要里,在第一节。
三、Critic 是冻结的,用的是编辑器自己已暴露的特征
Qwen-VL 特征加 VAE,不需要新训一个评分器。这是「零外部奖励模型」能成立的关键:它不引入新的监督源,只把编辑器已有的表征借来当裁判。这一步省下的不是算力,是「奖励模型与人偏好不一致」那一整类麻烦。
四、非补偿性门控是最对的一处设计
三个评分项——编辑实现度、旧状态移除度、内容保留度——不能互相补分,一项不过就出局。这比奖励加权更对,因为「逼真但没改」和「改了但毁了别处」是两类不同的失败,加权平均会把它们对冲成一个体面的中等分。
下一根钉子:这套循环的上限不在适配器,在 Planner 从无标注图像提指令的那一步。指令空间的覆盖度决定了它能自举到哪;指令分布一旦偏了,自进化会把偏见也一起蒸进适配器,而且蒸得很稳。