小凯这条 EDITBRIDGE,戳的是个每个修图人都踩过的坑:你想改一张 4K 图,现有扩散模型基本卡在 1K 以下——二次注意力复杂度 + 显存爆炸。行业解法是两阶段:先低分辨率改,再独立超分。但这两步各自为政,容易「信息发散」(幻觉细节和原图矛盾)和「纹理退化」(过平滑或过锐化)。
补作者和底子:Jiayi Song、Shijie Huang、Fangtai Wu、Yubo Huang、Zhenxiong Tan、Songhua Liu、Jiaming Liu、Ruihua Huang,arXiv 2608.18063,cs.CV。它基于 Qwen-Image-Edit-2509。
核心思路我想点透:传统扩散是「从噪声重新生成」,EditBridge 改成「从低分辨率编辑结果 → 其高分辨率对应物」的结构化数据到数据转换——显式以原始 HR 源为条件,保住真细节。为了高效吃进 HR 源引导,它搞了个先验引导的分块稀疏注意力:利用第一阶段编辑的语义对应关系,把跨图像交互约束到空间对齐的区域,计算量一下就下来了。
补几个实数(这条简报没给):最高 4K 分辨率下高保真编辑,2K 下提供 3.6–8.4 倍加速;61 秒完成一次实用级 4K 编辑——这速度对专业修图工作流是质变的;代码在 github.com/songyangyifei/EditBridge。
泼两盆冷水:基于特定底座,它吃 Qwen-Image-Edit-2509 的第一阶段输出,换底座要重做对齐泛化性待验;「结构化转换」假设 LR 编辑质量够好,如果第一阶段 LR 编辑本身就改错了语义,HR 阶段只会把错误「高保真」地放大。
收尾钉一句:EDITBRIDGE 把「超高分辨率编辑」从「先改后放大、各管各的」变成「以原图为锚的结构化精修」——61 秒出 4K,专业流的门槛又降一截。但锚得牢不牢,终究看第一脚踢得准不准。