← 返回 PaperDaily 视觉与图像

阿里千问&上交大新作:4K图像编辑只要61秒,纹理细节一个不丢

4K分辨率下改图,既要改得准、还要改得快、更要纹理细节不丢失,这可能吗?阿里千问与上海交大给出的答案是:61秒,一个细节都不少。

阿里千问&上交大新作:4K图像编辑只要61秒,纹理细节一个不丢
原论文信息如下:
论文标题:
EditBridge: Towards Faithful and Efficient Ultra-High-Resolution Image Editing
发表日期:
2026年8月19日

发表单位:
上海交通大学、阿里千问、新加坡国立大学

原文链接:
https://arxiv.org/pdf/2608.18063v1.pdf

项目链接:
https://editbridge.github.io/

超高分辨率图像编辑的困境:信息发散与纹理退化

motivation 图注:EditBridge的动机示意图。现有方法在低分辨率编辑后独立放大,容易导致纹理损伤和信息偏离;EditBridge以原始高分辨率图像为条件进行桥接修补,实现忠实细节还原。
正文:

先问一个扎心的问题:你手里的图像编辑模型,最高能出多大分辨率的图?

大概率是1024×1024,业内俗称1K。再往上,显存先炸为敬。原因也不复杂,扩散模型里的注意力机制是二次复杂度,图像分辨率翻一倍,token数量翻四倍,计算量直接起飞。所以大家心照不宣地采用一个“曲线救国”的方案:先在低分辨率下编辑,再用一个独立的超分辨率模型把图放大。听起来挺合理对吧?

但问题恰恰出在这个“独立”上。

超分模型不认识原图,它只知道“这里有个低分辨率的小图,我来猜猜高清长啥样”。于是两种经典翻车现场频繁上演:一种是信息发散,模型脑补出来的细节跟原图根本不是一回事,比如人脸的五官走向、衣物的纹路、建筑的棱角,凭空捏造;另一种是纹理退化,皮肤被磨成瓷娃娃,或者锐化过度出现一圈一圈的伪影。换句话说,超分模型是“画师”,不是“修复师”,它没有义务对你原来的高清原图负责。

那直接把编辑模型训到原生4K分辨率行不行?理论上可以,实际操作起来钱包先不同意。训练数据要重新造,显存开销要翻十几倍,推理速度更是慢到怀疑人生。这也不行那也不行,到底有没有第三条路?

上海交大和阿里千问团队给出了一个漂亮的回答:把“低清编辑结果→高清成图”这个过程,本身定义成一个扩散桥(Diffusion Bridge)翻译任务。你不需要从噪声里重新长出一张4K图,你只需要把已有的低清编辑结果,在原始高清图的“监督”下,翻译成一张高清成图。这就是EditBridge的核心思想。

这个方法有多快?先摆数据:2K分辨率编辑只需4.08秒,比扩散超分方案快3.6到8.4倍;4K分辨率编辑61秒搞定,比直接高分推理快11倍;1K分辨率更是夸张,0.84秒单步出图。而且图像质量不仅没缩水,反而在保真度和细节丰富度上全面碾压现有方案。这波操作,属实有点东西。

接下来,咱们把EditBridge的“桥”拆开看看,它到底是怎么把效率和保真这对冤家捏到一块儿的。


01 为什么是扩散桥?

要理解EditBridge,先得理解它跟传统扩散模型的本质区别。

传统扩散模型的工作方式是什么?给你一堆高斯噪声,让你一步步去噪,最后生成一张图。这个过程的特点是起点完全“无信息”,模型需要从零开始重建整个画面,所以采样步数多、计算量大,而且生成的细节本质上都是“猜”出来的。

扩散桥则完全不同。它做的是数据到数据的翻译:我给你一个起点,再给你一个终点,中间画一条带噪声的插值路径,模型只需要学会沿着这条路走就行。起点是你已有的信息,终点是你想要的结果,模型要做的是“从有到有”,而不是“从无到有”。

在EditBridge的设定里,起点是低分辨率编辑结果经过上采样后的图,终点是理想中的高清编辑结果。注意,这个起点不是噪声,它已经包含了编辑后的语义内容——比如“把这只狐狸的毛改成红色渐变”这个指令已经执行完了,只是分辨率不够、细节模糊。模型要做的不是重新画一遍,而是在保留语义的前提下,把缺失的高频细节“补”回来。

但这里有个关键问题:补细节的依据是什么?

如果只靠低清图自己脑补,那就又回到了超分模型的老路,照样会出现信息发散和纹理退化。所以EditBridge做了一个非常关键的设计:把原始高清图作为显式条件,直接喂给模型。原始高清图就是那个“参考答案”,模型在补细节的时候,可以对照着原图的纹理、结构、光影来“抄作业”,而不是凭空瞎编。

这个设计在数学上也很优雅。扩散桥的中间状态可以写成两个端点的线性插值加噪声,噪声在中间时刻最大、在两端为零。这意味着轨迹的起点和终点都是确定的,模型学习的是一个有边界的翻译路径,而不是一条永无止境的去噪漫游。路径变短了,采样步数自然可以大幅减少,甚至一步到位。

论文里的实验也验证了这一点:单步推理(N=1)的效果反而优于多步采样,因为多步采样在极端分辨率下会累积量化误差,就跟Photoshop里反复保存JPEG一样,越存越糊。所以EditBridge在推理时干脆只走一步,0.84秒直接出1K结果,又快又稳,还省显存。

不过,把高清原图作为条件喂给模型,说起来轻巧,做起来就是另一个故事了。高清原图的token数量是海量的,如果直接跟目标token做全局注意力,计算复杂度直接原地爆炸。这就要引出EditBridge的第二大杀器了。


02 先验引导的稀疏注意力:只看该看的

在4K分辨率下,一张图的token数量是多少?粗略算一下,如果一个patch是2×2像素,4K图大概有400多万个token。如果让这些token两两计算注意力,那计算量是10的12次方级别,直接让GPU当场去世。

但仔细想想,真的需要每个token都跟所有token做交互吗?

对于没修改过的区域,模型需要的是“忠实还原”,也就是照着原图抄,那只需要关注原图中对应的位置就够了;对于修改过的区域,模型需要的是“生成新纹理”,这时需要结合周围局部上下文来创作。换句话说,跨图注意力的需求本质上是局部的、稀疏的,不应该做全连接的暴力搜索。

EditBridge提出的先验引导块稀疏注意力(Prior-Guided Block-wise Sparse Attention,简称PG-BSA)就是干这个的。它的思路分两步:第一步,在第一阶段低分辨率编辑时,从注意力图里提取“语义对应关系”——也就是目标图中的每个token,在原图中对应哪个位置;第二步,把这个对应关系上采样到高分辨率,作为“地图”来约束第二阶段的高清细化注意力范围。

method_overview 图注:EditBridge方法总览图。上半部分展示了扩散桥的推理过程,将低分辨率编辑结果搬运到高分辨率目标;下半部分展示了对应先验的构建和PG-BSA机制细节。

具体来说,当一个目标token需要从原图获取信息时,它不会去看整张原图,而只看以对应锚点为中心的一个k×k局部窗口。这个窗口大小可以人为设定,用来补偿上采样过程中的对齐误差。这样一来,跨域注意力的复杂度就从O(N²)降到了O(N·k²),其中k²远小于N,计算量直接降了一个数量级以上。

这个设计妙在哪里?妙在它把“先验”用到了极致。一般做稀疏注意力的人,要么用固定窗口,要么用随机采样,都属于“盲人摸象”,不知道哪里重要;EditBridge则是从第一阶段编辑的注意力图里“免费”提取出语义对应关系,相当于有了一份精准的地图,只看该看的,不做无用功。而且这份先验不需要额外的标注或者训练,完全来自第一阶段的注意力热力图,成本几乎为零。

当然,一定有读者会问:稀疏注意力会不会漏掉重要的信息?论文里专门做了消融实验对比全注意力和稀疏注意力。有意思的是,全注意力在一些像素级指标上反而略高,但视觉质量一塌糊涂——因为全注意力会把原图中不相关的语义信息“串”进来,在修改区域产生鬼影和结构伪影。稀疏注意力则严格约束了交互范围,反而得到了更干净、更真实的视觉效果。这说明在图像编辑这个场景里,“看太多”和“看太少”都不行,精准才行。

这就像你在图书馆找一本书,全注意力是把整个图书馆翻个底朝天,效率低还容易拿错书;稀疏注意力是直接查索引找到书架,精准拿书不跑偏。前者看起来很努力,后者才是真正解决问题。


03 效果说话:三个分辨率全面碾压

方法讲完了,咱们来看看硬核的实验结果。论文在1K、2K、4K三个分辨率下,跟一堆SOTA超分模型(DiT-SR、DiT4SR、PiSA-SR、TSD-SR)、高分编辑模型(ScaleEdit)以及高分生成模型(HiFlow)做了全面对比。

先看客观指标。在1K分辨率下,EditBridge的HaarPSI达到0.4992,比第二名的ScaleEdit(0.4824)高出1.7个百分点;mPSNR达到18.6536,比第二名高出1.8个dB;mSSIM达到0.8686,全面领先。在2K分辨率下,优势更加明显,mPSNR达到18.6366,mSSIM达到0.8712,而推理时间只有4.08秒,是ScaleEdit(662.5秒)的1/162。在4K分辨率下,EditBridge的mPSNR直接飙到24.1380,mMSE只有0.0049,纹理还原精度把一众SR模型甩在身后。

attention_ablation 图注:注意力稀疏性消融实验。全注意力虽然在某些像素级指标上略高,但会导致源图像伪影和结构变形;PG-BSA稀疏注意力则保持了更高的视觉保真度和结构对齐度。

再看推理速度,这是EditBridge最亮眼的杀手锏。1K分辨率0.84秒,2K分辨率4.08秒,4K分辨率61秒。对比一下:ScaleEdit在4K下需要3601秒,整整一个小时;DiT-SR需要119.68秒;TSD-SR需要108.72秒。EditBridge比最快的SR方法还要快近一倍,而质量全面领先。这就是扩散桥加稀疏注意力的威力:路径短了,看得少了,自然跑得快。

不过,客观指标只是敲门砖,真正让人心服口服的是视觉对比。看Fig. 3和Fig. 4的定性结果,EditBridge在细节保真度上可以说是“恐怖如斯”:

qualitative_1k 图注:1K分辨率下的定性对比。EditBridge在保持源图保真度的同时显著提升了视觉清晰度,没有出现超分模型中常见的过度锐化和细节幻觉问题。

第一个例子,原指令是把“巨大的监控眼图案变成星星点缀的月亮形状”。超分模型生成的月亮边缘有严重的过度锐化伪影,像被PS里的“锐化”工具反复涂过一样;而EditBridge生成的月亮轮廓自然平滑,星点分布均匀,同时建筑底部的部落图腾纹理跟原图严丝合缝。第二个例子更明显,对比方法直接把门框结构都给“改”了,一个门洞变成两个门洞,简直离谱;EditBridge则严格保持了门框的透视结构和砖墙纹理。

qualitative_2k 图注:2K分辨率下的定性对比。EditBridge在保持文本、物体结构和局部纹理方面表现优异,墙面的裂纹、石块的边缘走向都能精准还原。

2K分辨率下的对比更能说明问题。当原指令要求“把透明雨伞改成红色”时,超分模型生成的红色雨伞表面纹理像是“贴图”上去的,没有伞面的褶皱和高光层次;EditBridge生成的雨伞则保留原图的伞骨结构和布料褶皱,颜色变化也符合光影逻辑,像是真实世界里被换了把伞。另一个例子中,要求“添加一艘红色独木舟”,对比方法的独木舟在纹理上和原图水域有割裂感,而EditBridge的独木舟仿佛真的浮在水面上,水波反射都交代得清清楚楚。

这些案例背后是同一个道理:EditBridge不是“无中生有”地猜细节,而是“有据可依”地还原细节。原始高清图这个“参考答案”摆在那里,模型的每一个笔触都有迹可循。这也是为什么它的输出让人感觉“真”——因为那些纹理本来就是原图里真实存在的,而不是模型臆造的。


04 训练细节:小数据也能出大效果

可能有人会问:这么强的效果,训练数据得有多大规模?

答案可能让你意外:EditBridge的训练数据只有5000对1K/2K图像和1500对4K图像,总共6500对。这在动辄百万级数据集的生成模型领域,算是“小本经营”了。数据来源是Aesthetic-4k和Aesthetic-Train-V2两个公开数据集,用Gemini 3生成编辑指令,再用Nano Banana Pro合成目标图。整个过程自动化程度很高,不需要人工标注。

训练配置也相当“勤俭持家”:基于Qwen-Image-Edit模型,采用LoRA微调,rank=128,在所有线性层上生效。优化器是Prodigy,学习率1.0,权重衰减0.01,8张H800 GPU,每卡batch size只有1。整个训练过程没有动用大规模集群,也没有神秘的“大力出奇迹”技巧,纯靠方法设计的合理性。

steps_ablation 图注:采样步数消融实验。单步推理(T=1)在保真度和效率上达到最佳平衡点,多步采样反而因为累积量化误差而降低图像质量。

这里不得不提一个反直觉的实验发现:单步推理效果最好。论文对比了1步、5步、10步三种采样设置,结果单步推理在HaarPSI、mPSNR、mSSIM全部指标上碾压多步采样。原因前面说过,多步采样在极端分辨率下会累积量化误差。这也从侧面验证了扩散桥的威力:因为起点和终点都是确定的数据分布,轨迹本身是“短而直”的,一步就能跨过去;如果是传统扩散模型从噪声出发,一步根本不可能生成有效图。这就是为什么EditBridge敢用“单步扩散桥”这样的激进设计。

另外,论文还做了用户研究。30名受试者在盲测条件下从细节保真度、真实感、美学三个维度打分,EditBridge在三个维度上全部获得最高票。特别是在“细节保真度”这个维度上,EditBridge对PiSA-SR和HiFlow形成了碾压之势,说明用户主观感知和客观指标是一致的。


05 龙哥点评

看完整个方法,龙哥的第一个感受是:这个工作踩准了痛点。

超高分辨率图像编辑这个方向,之前基本是“真空地带”。有人用超分模型硬顶,有人搞分块拼接,但都没有从原理上解决“信息从哪里来”的问题。EditBridge把“原始高清图作为条件”这个思路用扩散桥的框架落地,相当于给图像编辑装了一个“原图参考系”,从机制上杜绝了信息发散。这个切入点选择很聪明,不是堆算力,而是改范式。

第二个感受是:PG-BSA这个先验设计值得单独拎出来夸。注意力稀疏化的方案在视觉领域已经不少了,但大多数是“通用的”,比如窗口注意力、轴向注意力、线性注意力,它们不区分任务,只是把计算量降下来。EditBridge的PG-BSA则是从任务本身出发,利用第一阶段编辑的注意力图作为“语义地图”,让稀疏化有了方向感。这使得稀疏注意力不仅仅是在“省算力”,更是在“提升质量”,因为它天然过滤掉了无关上下文的干扰。这个思路对后续工作很有启发性——以后做高效率生成,可能不只是设计更快的注意力,而是要从任务里“挖”出先验来指导注意力。

第三个感受:效果是真的能打。4K分辨率61秒,2K分辨率4.08秒,1K分辨率0.84秒——这三个数字在图像编辑领域,确实当得起“又快又好”四个字。而且这还是在消费级硬件配置(8×H800)下做到的,没有动用夸张的集群资源。从落地角度看,这个方案对电商修图、影视后期、广告设计这些对高清纹理有刚需的场景,价值不言而喻。

当然,论文也不是没有局限。作者自己也在Limitation里提到了:当前方法依赖预定义的索引先验,这个先验必须从第一阶段提取,如果第一阶段编辑质量不高,后续细化也会“带病工作”。另外,训练数据是用Gemini和Nano Banana Pro自动生成的,属于“模型教模型”,虽然效率高,但在某些特殊场景下可能存在系统性偏差。最后,扩散桥的采样过程虽然是单步,但先验提取和掩码计算还是额外开销,这些部分在完全自动化流水线中仍有优化空间。

但瑕不掩瑜。EditBridge把超高分辨率图像编辑从“不可能”变成了“61秒搞定”,这个跨越是实打实的。从产业视角看,这个方向还有很多可以挖掘的点:比如把扩散桥扩展到视频编辑,或者把PG-BSA的思路用到更多的多模态生成任务里。论文已经给出了让人期待的开头,后续的续集值得持续关注。

最后感慨一句:当大家都在堆参数、堆数据、堆算力的时候,一个把“先验”用到极致的工作,反而在最难啃的高分辨率编辑赛道上跑出了惊人的速度。这也许就是“好方法”和“大力出奇迹”之间最本质的区别吧。🤙


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?超高分辨率图像编辑一直是扩散模型的“禁区”。阿里千问与上海交大提出EditBridge,用扩散桥加先验引导稀疏注意力,把4K编辑压缩到61秒,2K推理提速3.6-8.4倍,真正实现“改得准、改得快、细节真”。
这篇工作最值得看的点是什么?在所有分辨率级别(1K、2K、4K)上,EditBridge在HaarPSI、M-PSNR、M-SSIM、M-MSE等指标上全面优于所有对比方法,同时在推理速度上实现显著加速。
这篇工作的边界或风险在哪里?优点:1) 扩散桥框架有效保留低分辨率编辑的结构信息,避免从噪声重新生成;2) 显式利用高分辨率源图像作为条件,解决信息发散和纹理退化问题;3) 先验引导稀疏注意力大幅降低计算复杂度。缺点:1) 依赖第一阶段编辑的注意力先验质量,先验不准确时可能影响最终效果;2) 训练数据规模相对较小(5000+1500对),可能限制泛化能力;3) 方法复杂度较高,需要两阶段级联。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种基于扩散桥的粗到细两阶段框架,利用原始高分辨率源图像作为条件引导,通过先验引导的块状稀疏注意力机制实现高效且保真的超高分辨率图像编辑。

实验合理度:★★★★☆

HaarPSI、M-PSNR、M-SSIM、M-MSE、M-LPIPS以及推理时间。

学术研究价值:★★★★☆

提出一种基于扩散桥的粗到细两阶段框架,利用原始高分辨率源图像作为条件引导,通过先验引导的块状稀疏注意力机制实现高效且保真的超高分辨率图像编辑;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在2K分辨率下推理时间为4.08秒,4K分辨率下为61.10秒,相比传统扩散方法在2K下实现3.6-8.4倍加速。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;3) 先验引导稀疏注意力大幅降低计算复杂度。缺点:1) 依赖第一阶段编辑的注意力先验质量,先验不准确时可能影响最终效果;2) 训练数据规模相对较小(5000+1500对),可能限制泛化能力;


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球