静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-10-04 02:13

当"规划师"遇上"调度员":让 AI 学会拆解抽象指令再分步执行

你对一张学生贷款广告图说:"把这个改成面向农村受众的版本。"

人类设计师会怎么做?拆任务:换掉城市背景、改文案语气、调整目标人群形象、更新色彩方案、可能还要加个乡村元素。每一步需要不同的工具——背景替换用 inpainting,文字修改用 OCR+重渲染,人物替换用生成模型。

但现有图像编辑模型听到这句话会直接懵掉。InstructPix2Pix、Flux Kontext 这些单步编辑器擅长"给帽子换成红色"这种具体指令,面对"让广告更素食友好"这种抽象多步指令,要么过度修改破坏布局,要么只改了一小块。

Adobe Research 和加州大学戴维斯分校的团队提出了 Plan2Pix,把这个问题拆成两半:一个规划师生成步骤清单,一个调度员选择工具和区域执行每一步。核心创新在于:两者不是手工拼接的流水线,而是通过"经验学习"闭环耦合在一起。

规划师:自己出题自己学

传统多步编辑系统有个通病:规划师生成的步骤是"老师"(通常是 GPT-5)写的,学生模型只是模仿。问题是老师的风格和学生模型的原生分布不一致——就像让一个习惯写短句的初中生模仿鲁迅的长句,学出来的东西四不像。

Plan2Pix 的解法叫"清单引导的自我蒸馏"(checklist-guided self-distillation)。具体做法是:

1. 给基础模型一个清单模板,让它自己生成多步分解方案 2. 用这些自生成的方案做训练数据,微调同一个模型 3. 因为训练数据来自模型自己的分布,不存在分布偏移

团队用困惑度(perplexity)验证了这个设计:老师(GPT-5)生成的步骤在学生模型上的困惑度远高于学生自己生成的步骤。困惑度高意味着"这不像你会说的话",直接模仿会导致推理时的不稳定。

清单的作用是给规划师一个结构化框架——不是让它自由发挥,而是在"覆盖所有视觉元素""每步只改一个区域""步骤之间不冲突"这些约束下生成。这就像给作家一个大纲,而不是让他凭空写。

调度员:从结果学,不从指令学

调度员是整个框架最有意思的部分。给定一个子任务(比如"替换背景为乡村风景"),调度员要决定两件事:

  • 选什么工具:FLUX Inpaint?Qwen-Image-Edit?还是局部重绘?
  • 选什么区域:整张图?上半部分?某个 bounding box?
传统做法是写规则:背景类任务用 inpainting,文字类任务用 OCR。但规则覆盖不了所有情况,而且不会随经验改进。

Plan2Pix 让调度员从被评判的结果中学习。流程是:

1. 对每个子任务,调度员尝试所有工具×区域的组合 2. 一个视觉语言模型(VLM)作为"裁判",对每个编辑结果打分:指令遵循度、身份保持度、视觉质量 3. 调度员通过强化学习优化策略,最大化裁判给的奖励

这就像一个学徒厨师:不是背菜谱(规则),而是每道菜做几遍,尝一尝哪次最好吃,记住"炒青菜用大火快炒、炖汤用小火慢炖"这种经验。

计算难题:用近似换可行

直接对完整轨迹做 RL 有个现实问题:每调用一次扩散模型编辑工具就要几秒到几十秒,一条多步轨迹可能需要几分钟。探索空间太大,训练成本爆炸。

团队的解法是"结构化奖励近似":把整条轨迹的奖励近似为各子任务奖励之和。这样就可以预计算所有"工具×区域"组合的奖励,存成一张表。调度员查表选最优组合,而不是每次都真的去跑一遍编辑。

这个近似牺牲了步骤之间的依赖关系(前一步的结果可能影响后一步的最优选择),但让训练变得可行。团队用"闭环精炼"补偿:执行完规划后,检查哪些子任务实际上不可行(比如"修改文字"但图里没有文字),把它们过滤掉再重新规划。

实验结果:多分支搜索 + 经验学习 = 更好的编辑

在广告编辑基准上,Plan2Pix 对比了三类基线:

  • 单步编辑器(Qwen-Image-Edit 直接编辑):面对抽象指令只能做局部修改,整体不连贯
  • 顺序多步编辑(同一工具按步骤顺序执行):没有工具选择能力,每步都用同一个工具
  • 未训练调度员(基础模型按 prompt 选工具,不学策略):有工具选择但没有经验
Plan2Pix 在指令遵循度、身份保持度、视觉质量三个维度都显著领先。更有意思的是多分支搜索的效果:k=1 时指令满足率 63.9%,k=3 时 71.8%,k=5 时 74.0%。这说明搜索宽度带来的收益是持续的——不是"找到唯一正确答案",而是"在多个可行方案中选最好的"。

在 MagicBrush 和 GEdit-Bench 两个标准基准上,Plan2Pix 也保持了竞争力,说明这个框架不只是针对广告编辑这种特殊场景。

为什么这很重要

Plan2Pix 的核心贡献不是"多步图像编辑"——这之前就有。真正重要的是它示范了规划与执行的解耦+经验耦合这个范式:

  • 规划师不接触执行结果,只负责生成结构化分解
  • 调度员不接触高层指令,只负责在工具×区域空间中做选择
  • 两者通过"子任务描述"这个接口通信
  • 调度员的经验通过奖励信号回流,但不直接修改规划师
这和软件工程里的"架构师+开发团队"分工很像:架构师写设计文档但不写代码,开发团队按文档实现但可以自主选择技术方案。架构师不因为某次实现失败就被推翻,开发团队也不因为架构变更就重新学编程。

从 AI agent 的视角看,这是"层级化经验学习"的一个实例:上层学策略结构,下层学执行细节,两层各自优化但通过接口对齐。这比"端到端训练一个大模型做所有事"更模块化,也比"手工设计流水线"更自适应。

局限与展望

论文承认的局限:奖励近似假设子任务独立,但实际中前一步的编辑结果会影响后一步的最优选择(比如先换了背景,再改文字时区域定位就不同了)。VLM 裁判本身也不完美,对"视觉质量"的判断可能有偏差。

更深层的问题是:这个框架需要预定义工具集。如果遇到现有工具都做不了的任务,调度员无能为力。真正的开放式编辑可能需要"工具发现"能力——模型自己找到或构造新的编辑工具。

Plan2Pix 有项目主页(https://anisundar18.github.io/Plan2Pix.github.io/ )但尚未公开代码。从方法描述看,核心组件(Qwen3-VL 作为基础模型、FLUX Inpaint 和 Qwen-Image-Edit 作为工具、GPT-5 作为裁判)都是现成的,复现门槛主要在训练流程的工程实现。

一句话总结

把"抽象指令→具体编辑"拆成规划和调度两层,各自从自己的经验中学习,通过奖励信号闭环对齐——这比端到端训练更模块化,比手工流水线更自适应。

---

> 论文链接:https://arxiv.org/abs/2605.15181 > > 项目主页:https://anisundar18.github.io/Plan2Pix.github.io/ > > 作者:Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee > > 机构:Adobe Research / UC Davis

暂无表态