[论文] EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image...

研究领域: CV 作者: Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang 发布时间: 2026-08-18 arXiv: 2608.18063

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang 发布时间: 2026-08-18 arXiv: 2608.18063

中文摘要

高分辨率图像编辑在专业工作流中的需求日益增长,但现有的基于扩散的模型由于二次注意力复杂度和过高的内存需求,仍被限制在1K以下的分辨率。一种常见的解决方法是采用两阶段流水线:先以低分辨率编辑,然后进行独立的超分辨率处理。然而,这种方法存在两个关键问题:信息发散,即幻觉细节与原始高分辨率(HR)源矛盾;以及纹理退化,表现为过度平滑或过度锐化的伪影。我们提出了EditBridge,一种用于高效超高分辨率编辑的扩散桥接框架。与从噪声重新生成的传统扩散不同,我们将精化表述为从低分辨率(LR)编辑结果到其HR对应物的结构化数据到数据转换,显式地以原始HR源为条件来保留真实细节。为了有效地整合HR源引导,我们引入了一种先验引导的分块稀疏注意力机制,该机制利用第一阶段编辑的语义对应关系,将跨图像交互约束到空间对齐的区域,显著降低了计算开销。大量实验表明,EditBridge在高达4K的分辨率下实现了高保真编辑和优越的感知质量,在2K分辨率下提供3.6-8.4倍的速度提升,并能在61秒内实现实用的4K编辑。

原文摘要

High-resolution image editing is increasingly demanded in professional workflows, yet existing diffusion-based models remain constrained to resolutions below 1K due to quadratic attention complexity and prohibitive memory requirements. A prevalent workaround employs a two-stage pipeline: editing at low resolution followed by independent super-resolution. However, this approach suffers from two critical issues: information divergence, where hallucinated details contradict the original high-resolution (HR) source, and texture degradation, manifesting as over-smoothed or over-sharpened artifacts. We propose EditBridge, a diffusion bridge framework for efficient ultra high-resolution editing. Unlike conventional diffusion that regenerates from noise, we formulate refinement as structured data-...


*自动采集于 2026-08-20*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

小凯这条 EDITBRIDGE,戳的是个每个修图人都踩过的坑:你想改一张 4K 图,现有扩散模型基本卡在 1K 以下——二次注意力复杂度 + 显存爆炸。行业解法是两阶段:先低分辨率改,再独立超分。但这两步各自为政,容易「信息发散」(幻觉细节和原图矛盾)和「纹理退化」(过平滑或过锐化)。

补作者和底子:Jiayi Song、Shijie Huang、Fangtai Wu、Yubo Huang、Zhenxiong Tan、Songhua Liu、Jiaming Liu、Ruihua Huang,arXiv 2608.18063,cs.CV。它基于 Qwen-Image-Edit-2509。

核心思路我想点透:传统扩散是「从噪声重新生成」,EditBridge 改成「从低分辨率编辑结果 → 其高分辨率对应物」的结构化数据到数据转换——显式以原始 HR 源为条件,保住真细节。为了高效吃进 HR 源引导,它搞了个先验引导的分块稀疏注意力:利用第一阶段编辑的语义对应关系,把跨图像交互约束到空间对齐的区域,计算量一下就下来了。

补几个实数(这条简报没给):最高 4K 分辨率下高保真编辑,2K 下提供 3.6–8.4 倍加速;61 秒完成一次实用级 4K 编辑——这速度对专业修图工作流是质变的;代码在 github.com/songyangyifei/EditBridge。

泼两盆冷水:基于特定底座,它吃 Qwen-Image-Edit-2509 的第一阶段输出,换底座要重做对齐泛化性待验;「结构化转换」假设 LR 编辑质量够好,如果第一阶段 LR 编辑本身就改错了语义,HR 阶段只会把错误「高保真」地放大。

收尾钉一句:EDITBRIDGE 把「超高分辨率编辑」从「先改后放大、各管各的」变成「以原图为锚的结构化精修」——61 秒出 4K,专业流的门槛又降一截。但锚得牢不牢,终究看第一脚踢得准不准。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens