← 返回 PaperDaily 视觉与图像

ATDEdit:图像编辑告别背景漂移,PSNR冲到27.44dB

图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。

ATDEdit:图像编辑告别背景漂移,PSNR冲到27.44dB
原论文信息如下:
论文标题:
Diffusion Image Editing via Asynchronous Token Decoding
发表日期:
2026年08月
发表单位:
广东工业大学、北京大学、香港浸会大学、惠州学院
原文链接:
https://arxiv.org/pdf/2608.09322v1.pdf

图像编辑是扩散模型最"接地气"的场景之一。拍了一张狗子的照片,想把它P成猫;拍了一顿晚餐,想把背景从白天的窗边换成夜晚的霓虹。用户要的是"只改该改的地方,别动不该动的地方"。但现实往往是:提示词一换,整张图都跟着"放飞自我",背景从草地变成月球表面,狗子的耳朵还在,旁边的树和房子却已经不知道漂到哪里去了。
这就是论文开篇提到的"全局漂移"(global drift)问题。扩散模型在采样时,所有token在自注意力机制下是全局耦合的。你把条件从"dog"换成"cat",模型会倾向于让所有token都朝着新条件的方向重新解释,结果连背景里的草、树、天空都一并"解释"成了别的东西。
本期要解读的这篇ACM MM 2026论文,来自广东工业大学、北京大学、香港浸会大学和惠州学院的研究者。他们提出的ATDEdit框架,把图像编辑从"同步解码"的框框里拽出来,换了一种异步Token解码的玩法。核心思路也不复杂:既然所有token不是都该被改写,那就让模型自己去发现"哪些token对条件切换最敏感",只更新这些可编辑的token,剩下的token则通过源分支记忆替换和硬投影牢牢锁住。整个过程不需要外部掩码、不需要用户画框、不需要模型微调,纯推理阶段搞定。

图像编辑的"同步困境":为什么全局更新会导致背景漂移?

ATDEdit效果图
ATDEdit效果展示。这些示例展示了该框架在扩散Transformer上的推理时、免训练编辑能力。ATDEdit通过Token级条件惊奇驱动的逐Token条件切换,缓解了同步解码的全局漂移。源记忆替换和硬投影促进了对所选保留Token区域的保持,而可编辑Token接收目标条件更新。
要理解ATDEdit的动机,得先看看现在主流的扩散图像编辑是怎么干的。
扩散模型从U-Net时代进化到扩散Transformer(DiT)时代之后,一个显著变化是:图像的潜在表示被切割成一系列token,每个token对应空间上的某个区域,所有token通过自注意力机制相互作用。DiT把图像生成变成了"并行更新token矩阵"的过程——每个采样步,模型接收当前token矩阵,输出预测的下一步token矩阵,所有token同步更新。
同步与异步解码对比
同步解码与异步Token解码的对比。上图:传统同步编辑在目标条件下统一更新所有潜在Token,这种统一更新导致去噪轨迹全局发散,引发不必要的背景漂移。下图:本方法将编辑重构为异步过程,利用Token级条件惊奇动态识别可编辑区域,在每个采样步后将选中的保留Token潜在行投影回源值,可编辑Token则接收目标条件修正。
问题就出在这个"同步"上。当编辑任务发生时,用户将条件从源描述(如"a photo of a dog")切换为目标描述(如"a photo of a cat")。同步解码的做法是:所有token统一按照目标条件去更新。但注意,token之间是全局耦合的——一个token的更新会通过自注意力影响其他token的更新。结果就是,你只想改狗头,背景的草地和树也跟着被"脑补"成了新东西,这就是全局漂移。
业界也不是没有应对方案。一类方法用预计算的静态掩码来约束编辑区域,比如DiffEdit先生成一个掩码,再在掩码内部做编辑。思路直白,但问题也明显:生成掩码本身就依赖外部先验,而且掩码是静态的,不随去噪过程动态变化。扩散去噪是一个从噪声到图像的渐进过程,早期步骤决定全局结构,后期步骤决定细节。一个静态掩码很难跟随这种时间演化的语义变化——往往要么把该改的漏了,要么把不该改的圈进来了。
另一类方法是注意力控制,如MasaCtrl、Plug-and-Play等,通过复用或修改注意力图来实现编辑。这些方法对某些任务效果不错,但通常需要细致的调参,并且由于没有显式的token级约束,背景保持并不稳定。
ATDEdit想解决的核心问题正是:既然外部掩码不靠谱、全局同步又会导致漂移,那能不能让模型自己、在推理过程中、动态地决定"哪些token应该被编辑"?这就是所谓的"异步Token解码"——即按Token索引分配不同条件切换和更新规则的解码方式。它切中的是一个长期困扰扩散编辑的核心矛盾:如何在不破坏背景的前提下完成局部语义改写。
要理解这个矛盾,先得看清同步更新为什么会导致漂移。在扩散Transformer(DiT)中,图像被表示为S×d的Token矩阵,S是Token数量,d是每个Token的特征维度。每次采样步,所有Token通过自注意力机制做全局耦合的并行更新。当用户的文本条件从"dog"切换到"cat"时,传统采样器让所有Token统一按目标条件更新。这一步在数学上相当于给整条去噪轨迹施加了一个全局的"重新解释"压力——背景区那些本该保持不变的Token也在不断接收新条件的更新信号,几轮迭代之后,草不再是草,天空也不再是天空。
至于静态掩码方案,问题同样尖锐。以DiffEdit为代表的掩码方法在采样开始前就计算好"哪里能改",把编辑区域冻结成一张固定地图。可扩散去噪本身是一个高度动态的过程:早期步骤的Token编码的是整体结构和物体轮廓,后期步骤的Token才细化到纹理和颜色。一张静态掩码很难跟上这种时间演化,经常出现"该改的没圈进去、不该改的被圈进来"的尴尬。
ATDEdit的破解思路是:与其在外部画圈,不如让Transformer自己"内省"——在每一步去噪时问一遍模型:"如果条件换成目标描述,哪些Token的预测结果变化最大?"变化最大的Token视为可编辑,变化极小的Token视为保留。这等于把图像编辑问题,从一个几何定位问题,转化成了一个条件敏感度的排序问题。

ATDEdit核心机制:Token级条件惊奇与异步解码

ATDEdit的整体流程如图3所示,分为上下两条并行支路:上方支路做敏感性估计(Sensitivity Estimation),下方支路做异步更新(Asynchronous Updating)。
图3
图3:ATDEdit将狐狸转换为狗的流程概览。(上)同一状态的源/目标评估产生Token级条件惊奇并生成可编辑Token掩码。(下)目标条件修正应用于可编辑Token,源键/值记忆和硬投影约束选定的保留Token行。
先看更新主循环。论文把扩散Transformer的采样过程抽象为马尔可夫递归:z(t[j+1]) = D_θ(z(t[j]), t[j], c),其中t是逐步递减的调度时刻。在整流流(Rectified Flow)参数化下,模型直接预测速度场v_θ,干净图像的估计x̂₀通过下式计算:
公式:x̂0 = zt − t·vθ(zt, t, c)
该式中z_t是带噪隐变量,v_θ是模型预测的速度场,t是当前噪声时刻。整个编辑过程维护一个可编辑x₀状态x_edit,初始时等于源图编码的x_src。
那么,怎么做Token级的"选择性更新"?核心是Token级条件惊奇(Token-wise Conditional Surprisal)。这个指标测量的是:在完全相同的输入状态z_src上,仅把文本条件从源描述切换到目标描述,模型的x₀预测变化有多大。具体做法是,对同一个带噪输入分别用源条件和目标条件跑一次模型,得到两个预测x̂₀,src和x̂₀,tar,然后逐Token计算它们之间的平均L1距离:
公式:Token级条件惊奇的定义
式中n_avg是蒙特卡洛抽样次数,ℓ是抽样索引,d是Token特征维度,i是Token索引。s_i(t)的物理意义相当于"Token i在当前时刻对条件切换的敏感度"。需要说明的是,这里的surprisal只是一个描述性名称,和香农信息论中的惊异度(Shannon surprisal)完全不是一回事。
但要算这个指标,有一个绕不开的坑:如果两次预测使用完全不同的随机噪声,得到的预测差异会混合大量"噪声波动",很难分辨到底是条件变化还是随机性在捣乱。为此,ATDEdit引入了共同噪声耦合(Common-Noise Coupling),用平行四边形构造(parallelogram construction)把源分支和目标分支的带噪隐变量配对:
公式:源分支带噪隐变量构造 公式:目标分支带噪隐变量构造
源分支的z_src由源图按整流流插值加入高斯噪声ε生成;目标分支z_tar则通过源分支状态与可编辑位移相加得到。这样两个分支共享同一个噪声实现,噪声差异被从根上消掉,剩余的差异只来自"当前可编辑位移"本身。
有了稳定的敏感度估计,ATDEdit对平滑后的surprisal分数做高分位数选择:超过阈值的Token构成可编辑集合E(t),其余为保留集合K(t)。论文还引入指数移动平均(Exponential Moving Average,简称EMA)平滑分数曲线,并可选做形态学膨胀,让掩码在时间上稳定、在空间上紧凑。
下一步是第二个关键设计——注意力记忆边界(Attention Memory Boundary)。由于自注意力全局耦合,就算在状态空间把保留Token锁死,它们仍然可能接收到来自目标分支其他Token的注意力信息。为阻断这条路径,论文提出部分注意力记忆冻结(Partial Attention Memory Freezing):在目标分支的每一层自注意力中,把保留Token位置的键和值(Key/Value,简称KV)替换成源分支在对应位置算好的键值对:
公式:注意力记忆边界混合KV
公式(12)中,(K_src, V_src)来自源分支,(K_tar, V_tar)来自目标分支。对保留Token位置j,混合键值直接取源分支的键值;对可编辑位置则保留目标分支自己的键值。查询向量始终用目标分支的Q_tar,所以注意力权重仍然响应目标条件,但保留Token位置向外供应的内容来自源记忆——相当于在自注意力的"内存系统"里画了一条边界。
有了掩码和记忆边界,异步更新规则可以写成:
公式:速度差估计 公式:异步更新规则
公式(13)先定义速度差Δv:目标分支速度减去源分支速度,再对n_avg次采样取平均。公式(14)把调度步长Δt_j乘以这个速度差,再乘上可编辑掩码m(t_j)。掩码为1的位置(可编辑Token)接收目标条件带来的修正项;掩码为0的位置完全不更新。
更新之后还有最后一道工序——硬投影(Hard Projection)。约束集C(t)要求保留Token的行始终等于源分支对应时刻的值;投影操作在每一轮更新后把保留Token直接重置回源状态,数学上是欧几里得投影(Euclidean Projection)到约束集C(t)上。由于Frobenius范数的目标函数在保留行和可编辑行之间可分离,这个投影是精确的。

理论保证的边界:哪些性质被严格证明,哪些只是启发式?

这篇论文最让龙哥印象深刻的,不是它宣称自己多强,而是它对"什么能保证、什么不能保证"划了非常清楚的边界。
先说共同噪声的方差性质。对于任意的标量函数F和G,共同噪声下的差异方差满足:Var[F(ε) − G(ε)] = Var(F) + Var(G) − 2Cov(F,G)。作为对照,独立噪声下Var[F(ε) − G(ε̃)] = Var(F) + Var(G)。当Cov(F,G) ≥ 0时,共同噪声的差异方差不会大于独立噪声;当协方差为正时严格更小。这个结论保证的是:用共同噪声对比源/目标条件,估算出的敏感度更加稳定,不容易被随机波动带偏。
公式:共同噪声方差公式
再说硬投影。保留Token每一轮更新后被精确重置回源状态,这是Token状态级别的保证,在精确算术中严格成立。但要注意:最终解码到像素域之后,由于自注意力的全局信息流通,这些Token的像素级表现仍可能受到其他Token的影响——论文明确声明这并不构成像素级不变性(pixel-level invariance)保证。
注意力记忆边界的作用强度还要更弱。把保留Token的键值替换成源分支的记忆,只是改变了目标分支自注意力读取外部记忆的内容,并不能冻结注意力权重。输出行o_i的分解式表明:保留Token位置的值来自V_src,可编辑位置的值来自V_tar,但注意力权重α̃_ij依然由目标查询和混合键计算。它约束的是"记忆供给",而不是"注意力行为"。
最后,高分位数Token选择所能声称的性质是:在固定预算B下,选出的集合最大化了"被选中的surprisal分数之和"。它并不等于"编辑结果全局最优",也不能当作语义分割的替代品。可编辑Token集本质上是一个基于模型自身响应的启发式估计,这也是为什么论文强调"token-level"而不是"object-level"。

实验验证:PIE-Bench上的全面超越与消融分析

实验部分使用PIE-Bench作为统一评测基准。PIE-Bench是文本引导图像编辑领域常用的公开数据集,涵盖属性修改、物体替换、内容添加等多种编辑类型,同时度量背景保持度和语义对齐度两方面的表现。
表1
表1:PIE-Bench上的定量比较。各方法使用其已发布/原生骨干网络进行报告;FlowEdit、FlowAlign和ATDEdit构成同一骨干(SD3)下的主要对比组,其余行提供跨骨干参考。最佳、次佳和第三佳的数值结果分别以绿、黄、蓝高亮显示。
表1有一个值得点赞的设计:它没有把不同骨干的方法混在一起笼统排名,而是明确区分了"同骨干对比"和"跨骨干参考"。ATDEdit基于Stable Diffusion 3(SD3)主干,与同为SD3主干的FlowEdit、FlowAlign构成主要对比组。观察结果可以看到,ATDEdit在背景保持指标上取得了已报告数值中的最强表现——PSNR(峰值信噪比)27.44dB,LPIPS(学习感知图像块相似度)0.055,CLIP-Whole(整体CLIP语义对齐分数)25.80。在同骨干对比中,PSNR比FlowEdit高出约2dB,LPIPS也更低,说明背景保持优势是实打实的。语义对齐方面CLIP-Edited和CLIP-Whole均保持有竞争力的水平,没有出现"只保背景、不管编辑"的失衡。
消融实验见表2。论文对注意力记忆边界的关键组件做了逐项剥离:去掉KV边界后LPIPS上升、PSNR下降,说明KV边界对背景保持有实质贡献;去掉共同噪声耦合后指标同样退化,验证了配对噪声在稳定敏感度估计中的作用。两组消融从反面印证了每个组件都承担了不可替代的职责。
表2
表2:注意力记忆边界组件的消融实验。报告中展示的是点估计值;微小的数值差异应视为描述性结果而非显著性结论。
定性结果看图4。第一列为真实输入图像。ATDEdit在把"鸡"改成"鸭"这类需要同时改变主体形态和纹理的任务上,保留的背景与源图高度一致;对比方法则要么出现背景漂移,要么目标编辑不够彻底。视觉上的差距非常直观。
图4
图4:编辑结果对比。第一列为真实图像。
图5的敏感性分析进一步揭示了掩码时序的选择特性。图5(a)展示不同t_hi(掩码检测窗口上限)下得到的二值可编辑Token掩码;图5(b)(c)分别给出在(t_hi, t_lo)平面上的未编辑区域PSNR和CLIP-Edited变化曲面。论文特意标注:(b)(c)中的数值不是PIE-Bench数据集级别的平均,仅供观察趋势。从曲面走势可以看出,中噪声区间(t_hi约为0.6–0.8)设置掩码更新窗口效果较好;过早开始掩码更新会过早冻结语义结构,过晚则会错过编辑的最佳时机。
图5a
图5(a):不同t_hi值下的可编辑Token掩码。
图5bc
图5(b)(c):敏感性分析。(a)平滑的条件敏感性分数经高分位选择得到的"鸡→鸭"任务二值可编辑Token掩码。(b)在(t_hi, t_lo)平面上的未编辑区域PSNR↑。(c)在(t_hi, t_lo)平面上的CLIP-Edited↑。采样点占据有效三角区域t_lo ≤ t_hi,曲面仅为可视化插值。(b)和(c)中的数值并非PIE-Bench数据集级平均值。

局限与展望:计算开销与全局变换的挑战

ATDEdit并非没有代价。首先,每个采样步需要执行源分支和目标分支的多次模型前向,为了计算surprisal还要增加同状态的条件对比评估,n_avg次蒙特卡洛抽样会成倍放大推理开销。对于视频编辑或高分辨率图像这类计算敏感场景,这个成本可能成为工程落地的瓶颈。
其次,ATDEdit的优势集中在局部编辑场景。对于需要全局变换的任务——比如白天换夜晚、夏天变冬天——大量Token都应该被更新,"保留"与"编辑"的边界天然模糊,硬投影和KV边界的意义会被削弱。论文实验也显示,这类全局任务上的收益不如局部编辑任务明显。
未来值得探索的方向包括:如何降低同状态评估的次数(例如引入缓存或轻量代理模型),如何把Token级异步机制扩展到视频扩散模型,以及如何在全局变换中自适应调节可编辑Token比例。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?广东工业大学等单位提出ATDEdit,将扩散Transformer图像编辑重构为异步Token解码,无需外部掩码或模型微调,在PIE-Bench上取得27.44dB PSNR、0.055 LPIPS的最佳背景保持成绩,同时保持语义
这篇工作最值得看的点是什么?在PIE-Bench上取得最优的背景保持指标(PSNR 27.44dB, LPIPS 0.055),结构距离最低(11.10),语义对齐与FlowEdit持平(CLIP-Whole 25.80),CLIP-Edited达到22.40,综合表现最佳。
这篇工作的边界或风险在哪里?优点:(1) 无需训练、无需外部掩码,纯推理时方法;(2) 动态发现可编辑区域,适应时间变化的编辑需求;(3) 理论分析严谨,明确界定方法保证范围;(4) 在背景保持指标上显著优于现有方法。缺点:(1) 计算开销较大,需要多次前向传播估计Token-wise Conditional Surprisal;(2) 依赖DiT模型的校准能力,掩码质量受模型影响;(3) 硬投影策略不适用于全局变换场景;(4) 与FlowEdit等基线相比,CLIP-Edited提升有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出ATDEdit框架,通过Token-wise Conditional Surprisal动态发现可编辑区域,并采用异步Token解码策略(源记忆替换+硬投影)实现局部编辑与背景保持的平衡。

实验合理度:★★★★☆

Structure Distance (Dist.), PSNR, MSE, SSIM, LPIPS, CLIP-Whole, CLIP-Edited

学术研究价值:★★★★☆

提出ATDEdit框架,通过Token-wise Conditional Surprisal动态发现可编辑区域,并采用异步Token解码策略(源记忆替换+硬投影)实现局部编辑与背景保持的平衡;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在单张RTX 3090上运行,由于需要多次前向传播进行Token-wise Conditional Surprisal估计(navg次),计算开销约为标准采样的2-3倍

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 计算开销较大,需要多次前向传播估计Token-wise Conditional Surprisal;(2) 依赖DiT模型的校准能力,掩码质量受模型影响;

主要参考文献

[1] Yang Shi, Liangsi Lu, Minzhe Guo, et al. Diffusion Image Editing via Asynchronous Token Decoding. ACM MM 2026.
[2] Amir Hertz, et al. FlowEdit: Inversion-Free Text-Based Editing Using Rectified Flows. CVPR 2025.
[3] Guillaume Couairon, et al. DiffEdit: Diffusion-Based Semantic Image Editing with Mask Guidance. ICLR 2023.

融会贯通

结合PaperDaily已收录论文做同基准观察,可以发现:PIE-Bench上的编辑方法通常使用各自发布时的骨干网络,并非所有方法都在同一主干上做了完整对比。ATDEdit的亮点在于明确区分了同骨干对比(FlowEdit、FlowAlign)和跨骨干参考,没有把所有方法混在一个表格里笼统标胜。这种"分层对比"的写法值得做编辑方向的同学借鉴。
需要提醒读者的是:本次横向对比基于PaperDaily知识库的检索结果,未能完整覆盖PIE-Bench上所有新近方法;不同论文可能使用不同的掩码设置、噪声调度或评测代码版本。因此,不能据此得出"ATDEdit一定全面领先"的绝对结论。要判断它在更广方法集合中的真实位置,还需要在统一代码框架下进行公平复现。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
换提示词最怕背景跟着"变天"?ATDEdit 用 Token 级条件惊奇让该改的改、该留的留~ 想一起研究图像编辑、扩散模型的新玩法,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。