图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。
图像编辑是扩散模型最"接地气"的场景之一。拍了一张狗子的照片,想把它P成猫;拍了一顿晚餐,想把背景从白天的窗边换成夜晚的霓虹。用户要的是"只改该改的地方,别动不该动的地方"。但现实往往是:提示词一换,整张图都跟着"放飞自我",背景从草地变成月球表面,狗子的耳朵还在,旁边的树和房子却已经不知道漂到哪里去了。这就是论文开篇提到的"全局漂移"(global drift)问题。扩散模型在采样时,所有token在自注意力机制下是全局耦合的。你把条件从"dog"换成"cat",模型会倾向于让所有token都朝着新条件的方向重新解释,结果连背景里的草、树、天空都一并"解释"成了别的东西。本期要解读的这篇ACM MM 2026论文,来自广东工业大学、北京大学、香港浸会大学和惠州学院的研究者。他们提出的ATDEdit框架,把图像编辑从"同步解码"的框框里拽出来,换了一种异步Token解码的玩法。核心思路也不复杂:既然所有token不是都该被改写,那就让模型自己去发现"哪些token对条件切换最敏感",只更新这些可编辑的token,剩下的token则通过源分支记忆替换和硬投影牢牢锁住。整个过程不需要外部掩码、不需要用户画框、不需要模型微调,纯推理阶段搞定。
图像编辑的"同步困境":为什么全局更新会导致背景漂移?
ATDEdit效果展示。这些示例展示了该框架在扩散Transformer上的推理时、免训练编辑能力。ATDEdit通过Token级条件惊奇驱动的逐Token条件切换,缓解了同步解码的全局漂移。源记忆替换和硬投影促进了对所选保留Token区域的保持,而可编辑Token接收目标条件更新。要理解ATDEdit的动机,得先看看现在主流的扩散图像编辑是怎么干的。扩散模型从U-Net时代进化到扩散Transformer(DiT)时代之后,一个显著变化是:图像的潜在表示被切割成一系列token,每个token对应空间上的某个区域,所有token通过自注意力机制相互作用。DiT把图像生成变成了"并行更新token矩阵"的过程——每个采样步,模型接收当前token矩阵,输出预测的下一步token矩阵,所有token同步更新。同步解码与异步Token解码的对比。上图:传统同步编辑在目标条件下统一更新所有潜在Token,这种统一更新导致去噪轨迹全局发散,引发不必要的背景漂移。下图:本方法将编辑重构为异步过程,利用Token级条件惊奇动态识别可编辑区域,在每个采样步后将选中的保留Token潜在行投影回源值,可编辑Token则接收目标条件修正。问题就出在这个"同步"上。当编辑任务发生时,用户将条件从源描述(如"a photo of a dog")切换为目标描述(如"a photo of a cat")。同步解码的做法是:所有token统一按照目标条件去更新。但注意,token之间是全局耦合的——一个token的更新会通过自注意力影响其他token的更新。结果就是,你只想改狗头,背景的草地和树也跟着被"脑补"成了新东西,这就是全局漂移。业界也不是没有应对方案。一类方法用预计算的静态掩码来约束编辑区域,比如DiffEdit先生成一个掩码,再在掩码内部做编辑。思路直白,但问题也明显:生成掩码本身就依赖外部先验,而且掩码是静态的,不随去噪过程动态变化。扩散去噪是一个从噪声到图像的渐进过程,早期步骤决定全局结构,后期步骤决定细节。一个静态掩码很难跟随这种时间演化的语义变化——往往要么把该改的漏了,要么把不该改的圈进来了。另一类方法是注意力控制,如MasaCtrl、Plug-and-Play等,通过复用或修改注意力图来实现编辑。这些方法对某些任务效果不错,但通常需要细致的调参,并且由于没有显式的token级约束,背景保持并不稳定。ATDEdit想解决的核心问题正是:既然外部掩码不靠谱、全局同步又会导致漂移,那能不能让模型自己、在推理过程中、动态地决定"哪些token应该被编辑"?这就是所谓的"异步Token解码"——即按Token索引分配不同条件切换和更新规则的解码方式。它切中的是一个长期困扰扩散编辑的核心矛盾:如何在不破坏背景的前提下完成局部语义改写。要理解这个矛盾,先得看清同步更新为什么会导致漂移。在扩散Transformer(DiT)中,图像被表示为S×d的Token矩阵,S是Token数量,d是每个Token的特征维度。每次采样步,所有Token通过自注意力机制做全局耦合的并行更新。当用户的文本条件从"dog"切换到"cat"时,传统采样器让所有Token统一按目标条件更新。这一步在数学上相当于给整条去噪轨迹施加了一个全局的"重新解释"压力——背景区那些本该保持不变的Token也在不断接收新条件的更新信号,几轮迭代之后,草不再是草,天空也不再是天空。至于静态掩码方案,问题同样尖锐。以DiffEdit为代表的掩码方法在采样开始前就计算好"哪里能改",把编辑区域冻结成一张固定地图。可扩散去噪本身是一个高度动态的过程:早期步骤的Token编码的是整体结构和物体轮廓,后期步骤的Token才细化到纹理和颜色。一张静态掩码很难跟上这种时间演化,经常出现"该改的没圈进去、不该改的被圈进来"的尴尬。ATDEdit的破解思路是:与其在外部画圈,不如让Transformer自己"内省"——在每一步去噪时问一遍模型:"如果条件换成目标描述,哪些Token的预测结果变化最大?"变化最大的Token视为可编辑,变化极小的Token视为保留。这等于把图像编辑问题,从一个几何定位问题,转化成了一个条件敏感度的排序问题。