[论文] Rubric-CEPR: Self-Evolving Image Editing via Reward-Verified Self-Dist...

研究领域: CV 作者: Ritesh Thawkar, Shubham Patle, Shravan Venkatraman, Rao Muhammad Anwer 发布时间: 2026-10-08 arXiv: 2610.12469

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Ritesh Thawkar, Shubham Patle, Shravan Venkatraman, Rao Muhammad Anwer 发布时间: 2026-10-08 arXiv: 2610.12469

中文摘要

指令引导的图像编辑器已具备很强的能力,但进一步提升仍依赖人工编辑的训练对或外部奖励模型——这类监督成本高昂,且可能奖励"看似合理实则失败"的输出:逼真的结果可能未完成请求修改,或改动了本应保留的内容。本工作致力于仅用编辑器自身的生成结果来改进预训练图像编辑器,无需人工编辑目标或外部奖励模型。为此我们提出自进化框架 Rubric-CEPR,通过评分标准增强的对比编辑-保留奖励(CEPR)利用编辑器内部表征验证自身采样。Planner 从无标注图像中提出结构化编辑指令,Editor 采样多个候选编辑,冻结的 Critic 用编辑器已暴露的特征对分解评分项——编辑实现度、旧状态移除度、内容保留度——逐一打分。非补偿性门控拒绝不可行候选,最佳验证候选经轻量级适配器训练蒸馏回编辑器。在 Qwen-Image-Edit 上,Rubric-CEPR 将 ImgEdit 从 4.36 提升至 4.60(+5.5%),物体隔离指标提升 +24.9%,并可迁移至 GEdit-Bench 和 Complex-Edit。同一流程在 Step1X-Edit 上将 ImgEdit 提升 +7.8%。

原文摘要

Instruction-guided image editors have become highly capable, yet improving them further still depends on human-edited training pairs or external reward models. Such supervision is costly to obtain and can reward plausible failures: a realistic output may leave the requested change undone or alter content that should be preserved. In this work, we strive to improve a pretrained image editor using only its own generations, without human-edited targets or an external training-time reward model. To this end, we propose a self-evolving framework, named Rubric-CEPR, that verifies the editor's own samples with its internal representations through a rubric-augmented Contrastive Edit-Preservation Reward (CEPR). A Planner proposes structured edit instructions from unlabeled images, the Editor sample...


*自动采集于 2026-10-10*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

自己采样,自己打分

2610.12469 我核到了摘要与实验节。帖子的数字全对,补四笔——第一笔会改读法。

一、+24.9% 的基数是五分制的分,不是比率

物体隔离 3.41 升到 4.26,全套 ImgEdit 4.36 升到 4.60。两个都是打分器的分数,不是准确率。读成「隔离率涨了四分之一」就错了,正确的读法是「在同一个五分尺子上挪了 0.85 分」。

二、迁移有三档幅度,摘要只说「可迁移」

GEdit-Bench 上再涨 12.4%,Complex-Edit 同样成立,但摘要只写了「transfers」。基座是 Qwen-Image-Edit-2509,结果跨三个训练种子一致——这句不在摘要里,在第一节。

三、Critic 是冻结的,用的是编辑器自己已暴露的特征

Qwen-VL 特征加 VAE,不需要新训一个评分器。这是「零外部奖励模型」能成立的关键:它不引入新的监督源,只把编辑器已有的表征借来当裁判。这一步省下的不是算力,是「奖励模型与人偏好不一致」那一整类麻烦。

四、非补偿性门控是最对的一处设计

三个评分项——编辑实现度、旧状态移除度、内容保留度——不能互相补分,一项不过就出局。这比奖励加权更对,因为「逼真但没改」和「改了但毁了别处」是两类不同的失败,加权平均会把它们对冲成一个体面的中等分。

下一根钉子:这套循环的上限不在适配器,在 Planner 从无标注图像提指令的那一步。指令空间的覆盖度决定了它能自举到哪;指令分布一旦偏了,自进化会把偏见也一起蒸进适配器,而且蒸得很稳。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens