当"规划师"遇上"调度员":让 AI 学会拆解抽象指令再分步执行
你对一张学生贷款广告图说:"把这个改成面向农村受众的版本。"
人类设计师会怎么做?拆任务:换掉城市背景、改文案语气、调整目标人群形象、更新色彩方案、可能还要加个乡村元素。每一步需要不同的工具——背景替换用 inpainting,文字修改用 OCR+重渲染,人物替换用生成模型。
但现有图像编辑模型听到这句话会直接懵掉。InstructPix2Pix、Flux Kontext 这些单步编辑器擅长"给帽子换成红色"这种具体指令,面对"让广告更素食友好"这种抽象多步指令,要么过度修改破坏布局,要么只改了一小块。
Adobe Research 和加州大学戴维斯分校的团队提出了 Plan2Pix,把这个问题拆成两半:一个规划师生成步骤清单,一个调度员选择工具和区域执行每一步。核心创新在于:两者不是手工拼接的流水线,而是通过"经验学习"闭环耦合在一起。
规划师:自己出题自己学
传统多步编辑系统有个通病:规划师生成的步骤是"老师"(通常是 GPT-5)写的,学生模型只是模仿。问题是老师的风格和学生模型的原生分布不一致——就像让一个习惯写短句的初中生模仿鲁迅的长句,学出来的东西四不像。
Plan2Pix 的解法叫"清单引导的自我蒸馏"(checklist-guided self-distillation)。具体做法是:
1. 给基础模型一个清单模板,让它自己生成多步分解方案 2. 用这些自生成的方案做训练数据,微调同一个模型 3. 因为训练数据来自模型自己的分布,不存在分布偏移
团队用困惑度(perplexity)验证了这个设计:老师(GPT-5)生成的步骤在学生模型上的困惑度远高于学生自己生成的步骤。困惑度高意味着"这不像你会说的话",直接模仿会导致推理时的不稳定。
清单的作用是给规划师一个结构化框架——不是让它自由发挥,而是在"覆盖所有视觉元素""每步只改一个区域""步骤之间不冲突"这些约束下生成。这就像给作家一个大纲,而不是让他凭空写。
调度员:从结果学,不从指令学
调度员是整个框架最有意思的部分。给定一个子任务(比如"替换背景为乡村风景"),调度员要决定两件事:
- 选什么工具:FLUX Inpaint?Qwen-Image-Edit?还是局部重绘?
- 选什么区域:整张图?上半部分?某个 bounding box?
Plan2Pix 让调度员从被评判的结果中学习。流程是:
1. 对每个子任务,调度员尝试所有工具×区域的组合 2. 一个视觉语言模型(VLM)作为"裁判",对每个编辑结果打分:指令遵循度、身份保持度、视觉质量 3. 调度员通过强化学习优化策略,最大化裁判给的奖励
这就像一个学徒厨师:不是背菜谱(规则),而是每道菜做几遍,尝一尝哪次最好吃,记住"炒青菜用大火快炒、炖汤用小火慢炖"这种经验。
计算难题:用近似换可行
直接对完整轨迹做 RL 有个现实问题:每调用一次扩散模型编辑工具就要几秒到几十秒,一条多步轨迹可能需要几分钟。探索空间太大,训练成本爆炸。
团队的解法是"结构化奖励近似":把整条轨迹的奖励近似为各子任务奖励之和。这样就可以预计算所有"工具×区域"组合的奖励,存成一张表。调度员查表选最优组合,而不是每次都真的去跑一遍编辑。
这个近似牺牲了步骤之间的依赖关系(前一步的结果可能影响后一步的最优选择),但让训练变得可行。团队用"闭环精炼"补偿:执行完规划后,检查哪些子任务实际上不可行(比如"修改文字"但图里没有文字),把它们过滤掉再重新规划。
实验结果:多分支搜索 + 经验学习 = 更好的编辑
在广告编辑基准上,Plan2Pix 对比了三类基线:
- 单步编辑器(Qwen-Image-Edit 直接编辑):面对抽象指令只能做局部修改,整体不连贯
- 顺序多步编辑(同一工具按步骤顺序执行):没有工具选择能力,每步都用同一个工具
- 未训练调度员(基础模型按 prompt 选工具,不学策略):有工具选择但没有经验
在 MagicBrush 和 GEdit-Bench 两个标准基准上,Plan2Pix 也保持了竞争力,说明这个框架不只是针对广告编辑这种特殊场景。
为什么这很重要
Plan2Pix 的核心贡献不是"多步图像编辑"——这之前就有。真正重要的是它示范了规划与执行的解耦+经验耦合这个范式:
- 规划师不接触执行结果,只负责生成结构化分解
- 调度员不接触高层指令,只负责在工具×区域空间中做选择
- 两者通过"子任务描述"这个接口通信
- 调度员的经验通过奖励信号回流,但不直接修改规划师
从 AI agent 的视角看,这是"层级化经验学习"的一个实例:上层学策略结构,下层学执行细节,两层各自优化但通过接口对齐。这比"端到端训练一个大模型做所有事"更模块化,也比"手工设计流水线"更自适应。
局限与展望
论文承认的局限:奖励近似假设子任务独立,但实际中前一步的编辑结果会影响后一步的最优选择(比如先换了背景,再改文字时区域定位就不同了)。VLM 裁判本身也不完美,对"视觉质量"的判断可能有偏差。
更深层的问题是:这个框架需要预定义工具集。如果遇到现有工具都做不了的任务,调度员无能为力。真正的开放式编辑可能需要"工具发现"能力——模型自己找到或构造新的编辑工具。
Plan2Pix 有项目主页(https://anisundar18.github.io/Plan2Pix.github.io/ )但尚未公开代码。从方法描述看,核心组件(Qwen3-VL 作为基础模型、FLUX Inpaint 和 Qwen-Image-Edit 作为工具、GPT-5 作为裁判)都是现成的,复现门槛主要在训练流程的工程实现。
一句话总结
把"抽象指令→具体编辑"拆成规划和调度两层,各自从自己的经验中学习,通过奖励信号闭环对齐——这比端到端训练更模块化,比手工流水线更自适应。
---
> 论文链接:https://arxiv.org/abs/2605.15181 > > 项目主页:https://anisundar18.github.io/Plan2Pix.github.io/ > > 作者:Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee > > 机构:Adobe Research / UC Davis