← 返回 PaperDaily
视觉与图像
东北大学开源RegionCache:多轮图像编辑最高提速2.55倍
东北大学提出RegionCache,专治多轮图像编辑的重复计算病:连续编辑轮次中平均81%-92%区域根本不变,却每次都把整张图重新生成一遍。RegionCache用跨注意力把“没变的语义”映射到“没变的区域”,直接复用缓存隐藏状态,只重算真正被改的地方,在PixArt-α上拿到1.43-2.55倍端到端加速,画质基本不掉。有代码,值得跑一跑。
龙哥读论文
发布于 2026-09-03 00:20:18
阅读 2
查看原文
原论文信息如下:
引言
用过AI画图工具的朋友应该都有过这种体验:第一版图生成出来,总觉得哪里差点意思。想换个发色、改一下背景、把猫变成狗,于是接着改。改完这一轮,又发现下一个细节不对,再来一轮。这就是论文里说的“多轮图像编辑”——用户通过多轮文字指令,把一张图逐步打磨到满意为止。
先抛个问题:你上次用AI画图,是一步到位的吗?绝大多数人大概是这个流程——生成一张还凑合的图,然后开始"指指点点":“猫的毛色换成橘色”“背景别这么乱”“再加一顶帽子”……每提一个要求,模型就把整张图从头再算一遍。用户改的是一小块区域,模型干的却是整张图的活儿,这种“局部修改、全局重算”的浪费,在多轮编辑里几乎无处不在。
东北大学的研究者对五个真实多轮编辑数据集做了个统计,结果相当扎心:相邻两轮编辑之间,平均有81.05%到92.70%的像素区域完全没有变化。也就是说,每一轮编辑里高达九成的计算都是在重复劳动。用一句不太严谨但很形象的话来说:这就像装修房子时只想给客厅刷个漆,结果施工队把整栋楼的墙皮全铲了重新砌了一遍,费时费力还增加风险。
造成这种浪费的根源,要从扩散Transformer(Diffusion Transformer,简称DiT)的工作原理说起。DiT是当前高质量图像生成的流行底座,它把图像切成一堆小图像块(patch),每个图像块都当作一个token,然后在所有token之间做全局自注意力(self-attention)计算。这意味着,哪怕你只改图中一个角落,模型也要让全图所有token互相做一遍“信息交流”,计算量与图像尺寸的平方成正比。分辨率越高、去噪步数越多,这个开销就越夸张。
RegionCache核心机制:提示词对齐的区域缓存
既然大部分区域没变,一个很自然的想法是:把上一轮没变区域的中间计算结果缓存起来,这一轮直接用。但这里有个关键问题——怎么知道哪些区域没变?RegionCache的思路很巧妙:顺着提示词的变化去追踪编辑区域。
用户连续两轮的编辑提示词之间存在语义重叠。比如第一轮说“一只猫坐在沙发上”,第二轮说“一只戴帽子的猫坐在沙发上”——“猫”和“沙发”的语义在两轮中都出现了,对应图片中那些不该变的区域;而“戴帽子”是新出现的语义,它影响到的区域就是需要修改的地方。于是,跨轮次提示词的语义差异,就成了定位编辑区域的一个天然信号。
但文字语义怎么映射到具体的图像区域呢?这就要靠DiT中的跨注意力(cross-attention)机制了。在DiT生成图像时,每个文字token都会通过跨注意力去“关注”图片中它影响的区域。研究者发现,像“猫”“球”这类具体物体的token,注意力通常集中在紧凑且连续的图像区域,对无关区域几乎没有响应。这种特性让跨注意力成为连接文字语义与图像空间位置的天然桥梁。
基于这个机制,RegionCache把新出现或被修改的文字token的注意力分数聚合起来,凡是得分超过某个阈值的图像token,就判定为受编辑影响的区域。形式化表达如下:
其中 i 表示图像token的索引,a_j(i) 表示第 j 个新增(或被修改)文字token对第 i 个图像token的注意力分数,θ_j 是对应的注意力阈值。落在R_edit集合之外的所有区域,都被视为语义稳定的可复用区域,可以直接从缓存里取上一轮的中间状态。
RegionCache缓存的具体对象,是扩散模型的隐藏状态(hidden states)。隐藏状态是神经网络每一层经过自注意力和MLP(多层感知机)模块计算后得到的内部表示,直接决定了该步骤的输出结果,也是DiT推理中计算开销最大的部分。缓存隐藏状态,相当于把“算过的东西”原封不动保存下来,下次直接用,不需要近似,也不会改变模型原本的执行行为。
具体到Transformer内部执行,RegionCache引入了区域级稀疏注意力(Region-Level Sparse Attention)。常规的自注意力中,所有图像token都会作为query参与矩阵乘法;而区域级稀疏注意力只让“活跃”的编辑区域token参与注意力计算,未变化区域的key和value沿用缓存,更新后的表示直接读取。然后,活跃区域的计算结果和缓存区域拼接在一起,送入下一层Transformer块。整个过程保持了标准DiT的执行语义,只是把没必要的计算省掉了。
语义感知的自适应复用:如何平衡效率与质量
看到这里,你可能会冒出一个问题:如果用户要把“猫”改成“狗”,这个区域在语义上完全变了,还能无脑复用上一轮的缓存吗?
答案是不能一刀切。研究者注意到扩散模型的去噪过程有一个重要性质:早期步骤主要确定图像的整体结构和布局,后期步骤才逐步刻画物体的细节和外观。这意味着,即使一个区域从“猫”变成了“狗”,它在前面的去噪步骤中仍然可能是兼容的——毕竟构图、色调这些大方向没有变。真正需要重新计算的,是那些决定“狗长什么样”的后期细节步骤。
RegionCache据此设计了语义感知的自适应复用调度策略。它把编辑前后对应的文字token取出来,比如“猫”和“狗”,计算它们在嵌入空间里的余弦相似度:
其中 τ⁻ 和 τ⁺ 分别代表编辑前、后的文字token,e(·) 是token嵌入函数。当相似度 s 超过阈值 τ_s,说明这是一个语义轻量级的编辑(比如换颜色、调光影),缓存的隐藏状态可以覆盖整个扩散过程;如果相似度较低,说明编辑涉及语义层面的较大变动(比如猫变狗),那么复用只在前 ⌊ρT⌋ 步有效,后期步骤必须重新计算。
T_reuse = { T, s ≥ τ_s; ⌊ρT⌋, s < τ_s }
论文在实现中将复用比例 ρ 设为0.2,即语义变化大的区域最多复用前20%的去噪步骤。这个设计的妙处在于:对于语义稳定的区域,大胆复用、效率拉满;对于语义变化大的区域,保守处理、保住质量,在效率和画质之间取得了动态平衡。
除了算法层面的设计,RegionCache在工程实现上还做了两个重要的优化。第一个是内核融合:区域级稀疏注意力在更新活跃token的key和value时,如果采用朴素实现,需要额外的scatter(散开写入)操作,这会引入不必要的显存访问和内核启动开销。RegionCache把scatter操作融合进线性投影的GeMM(通用矩阵乘法)内核,直接写入目标位置。第二个是流水线执行:缓存隐藏在CPU内存中,读取需要时间,RegionCache采用流水线策略,在当前层计算的同时预取下一层的缓存数据,把数据传输开销“藏”在计算后面。
实验验证:显著加速与质量保持
实验部分,作者在PICO-Banana和MagicBrush两个多轮编辑数据集上进行了全面评估,以PixArt-α作为统一的DiT底座,所有方法在同一套编辑序列和区域设定下测试,保证对比的公平性。效率指标记录完成整个编辑序列的端到端延迟,画质指标则包含FID、CLIP、PickScore和IR(图像相关性)等。
先看与多轮编辑框架的对比。在MagicBrush数据集上,RegionCache完成整个多轮编辑序列只需11.11秒,比Stable Flow(17.46秒)和Prompt-to-Prompt(17.19秒)快了约1.6倍,比显式区域感知生成RAG(32.30秒)快了将近3倍。值得注意的是,Stable Flow和P-2-P的高延迟主要来自每轮都对全图做一遍自注意力计算,即使大部分区域没有变化;RAG则是因为额外的区域感知控制带来了不小的开销。在画质方面,RegionCache拿到了最高的CLIP_txt分数0.3204,说明它的文本对齐能力更强——编辑只作用在目标区域,不容易产生语义漂移。
再看与单轮加速方法的对比。所有方法都基于PixArt-α底座,在PICO-Banana数据集上统一按多轮编辑协议测评。RegionCache的总推理延迟为2.53秒,相比全量计算的PixArt-α基线(3.98秒)获得1.57倍加速;自注意力累计耗时从1.58秒降到0.55秒,降幅达2.89倍。对比同类的ToCa和TGATE,RegionCache在总延迟更低的同时,又把注意力成本削减了0.25秒和0.34秒。DeepCache虽然获得了更高的总加速比(2.20秒),但这是以牺牲画质为代价的——它的FID恶化到39.65,IR仅有0.186,在编辑场景下几乎不可用。RegionCache把FID控制在30.98,CLIP、IR和PickScore均拿到最高分,这才是有实际意义的加速。
图6的案例更能说明问题。在连续多轮局部编辑后,RegionCache对背景和其他物体结构的保持最完整,CLIP_img分数(0.9233)虽然略低于P-2-P和RAG,但这个差距并不大,换来的是近2到3倍的效率提升,这笔账非常划算。
分辨率的影响也值得关注。从图7可以看出,全注意力成本随分辨率增长非常迅猛:512×512下约0.3秒,1024×1024超过2秒,2048×2048直接超过6秒。而RegionCache的检索和装载开销却始终很低——512下约0.05秒,2048下也不到0.3秒。换句话说,分辨率越高,RegionCache的加速收益越明显,这正好迎合了当前高分辨率图像生成的大趋势。
最后是稳定性验证。图9对比了不同推理步数和分辨率下的延迟分解,无论15步、20步还是25步,RegionCache对自注意力耗时的相对削减都稳定在2.8到2.9倍附近,不会因为步数调整就失效。图8则展示了与加速方法的直接对比:DeepCache因为不断跳步,编辑区域出现明显伪影,TGATE在局部编辑上存在细节丢失,而RegionCache在保持细节完整性的同时计算成本最低。
局限性与未来展望
RegionCache目前还远不是一个“万能加速器”。它的适用面目前局限在DiT架构的编辑流程中,定位编辑区域依赖跨注意力信号的准确性,遇到某些语义比较抽象或描述模糊的指令时,阈值的选择会变得比较敏感。另外,缓存状态需要存放在CPU内存中,虽然论文通过流水线执行隐藏了大部分传输延迟,但缓存本身的内存占用在超长编辑序列下仍然是一个需要考量的现实约束。
不过,这个方向的价值是很明确的。多轮图像编辑是真实交互场景中最常见的操作模式,而目前大量的加速研究都停留在单次推理内的优化,把“跨轮次复用”作为一等公民来对待的工作还不多。可以想象,如果把RegionCache和更激进的步数蒸馏、注意力剪枝等技术叠加,多轮编辑的延迟还有进一步压缩的空间。此外,将区域级复用扩展到视频编辑、3D内容生成等领域,也是一个值得探索的方向。
龙迷三问
这篇论文到底在解决什么问题? 东北大学提出RegionCache,面向扩散Transformer多轮图像编辑加速。利用跨注意力把未变语义映射到未变区域,复用缓存隐藏状态、只重算编辑区域,PixArt-α上实现1.43-2.55倍端到端加速,图像质量基本持平,代
这篇工作最值得看的点是什么? RegionCache在MagicBrush数据集上实现11.11s端到端延迟,相比StableFlow(17.46s)和P-2-P(17.19s)实现1.6×加速,相比RAG(32.30s)实现2.9×加速;同时取得最高CLIP_txt分数(0.3204)。在PICO-Banana数据集上,RegionCache在保持最优图像质量(FID=30.98, CLIP=0.311, IR=0.776, PICK=22.36)的同时,实现2.
这篇工作的边界或风险在哪里? 优点:(1) 创新性地利用跨轮次语义一致性实现区域级计算复用,有效解决多轮编辑中的冗余计算问题;(2) 语义感知的自适应复用调度在效率和保真度间取得良好平衡;(3) 无需训练,直接适用于预训练DiT模型。缺点:(1) 依赖跨注意力定位的准确性,对模糊或抽象语义的定位可能不精确;(2) 缓存隐藏状态占用较大内存,需要CPU-GPU数据传输;(3) 对大幅语义变化(如cat→dog)的编辑,复用深度受限,加速效果有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把跨轮次语义一致性与跨注意力定位结合起来做区域缓存,思路直观且执行体系完整,在多轮编辑加速这个细分方向上具备首创性。
实验合理度: ★★★★☆
覆盖多轮编辑框架和单轮加速方法两类baseline,两个数据集统一协议,公平性较好。但PICO-Banana上与DeepCache的总延迟差距只有0.33秒,效率优势需要更多轮次验证才能坐实。
学术研究价值: ★★★★☆
开辟了多轮编辑场景下“跨轮次计算复用”这个值得跟进的方向,其“提示词差异→空间区域”的映射思路对后续研究有较强的参考意义。
稳定性: ★★★☆☆
编辑区域定位依赖跨注意力阈值,复杂语义或抽象指令下准确性可能打折。目前只在PixArt-α上实验,跨模型稳定性缺乏证据。
适应性以及泛化能力: ★★★☆☆
只验证了PixArt-α一个底座,能否迁移到SDXL、Flux等不同DiT变体,以及能否扩展到视频编辑、多模态生成等场景,还需要更多实验。
硬件需求及成本: ★★★★☆
L20单卡即可运行,缓存放CPU内存,显存压力不大;训练零成本,推理成本在分辨率越高时节省越明显。但缓存加载带来的内存带宽需求需要关注。
复现难度: ★★★★☆
代码已开源到GitHub,Python 3.10环境加常用依赖即可跑通,整体复现门槛不高。
产品化成熟度: ★★★★☆
与多轮交互式图像编辑场景非常契合,特别适合云端推理和实时编辑工具。不过在非常复杂的多轮指令下,编辑定位的稳定性还需要进一步打磨。
可能的问题:
MagicBrush上CLIP_img低于P-2-P和RAG,说明视觉一致性仍有妥协空间;与DeepCache相比总延迟优势不大,后续可以考虑把跳步和区域缓存结合。MCP同基准对比显示PICO-Banana/FID=30.98,与全量基线30.30差距很小,价值在于“用少算换持平质量”,不要外推成绝对领先。
主要参考文献
[1] Ma et al. DeepCache: Accelerating Diffusion Models for Free. CVPR 2024.
[2] Chen et al. Δ-DiT: A Training-Free Acceleration Method for Diffusion Transformers. 2024.
[3] Zhang et al. BlockDance: Reuse Structurally Similar Features to Accelerate Diffusion Transformers. 2025.
[4] Zou et al. ToCa: Token-based Caching for Diffusion Transformers. 2025.
[5] Liu et al. TGATE: Towards Efficient Attention for Diffusion Transformers. 2024.
[6] Hertz et al. Prompt-to-Prompt Image Editing with Cross Attention Control. ICLR 2023.
[7] Avrahami et al. StableFlow: Preserving Consistency in Multi-turn Editing. 2025.
[8] Chen et al. Region-Aware Generation. 2024.
[9] Qian et al. PICO-Banana dataset. 2025.
[10] Zhang et al. MagicBrush dataset. NeurIPS 2023.
融会贯通
最后做个冷静的横向定位。结合PaperDaily已收录论文的可比数据来看,PICO-Banana数据集上RegionCache的FID为30.98,与全量PixArt-α基线(30.30)相差很小,说明它走的是“用少算换持平质量”的务实路线,而不是靠质量碾压取胜。当前库里暂时缺少足够多的同基准数值结果来做绝对排名判断,因此不应把这项工作的价值外推成“全面领先”。更合理的读法是:在多轮交互编辑这个真实且高频的场景里,RegionCache证明了跨轮次区域复用是一条低风险、高回报的加速路径。这也提醒我们,当下大厂AI岗位大幅扩招、AI原生应用加速落地,这类“实打实省算力”的工作,恰恰是工程面试和产品落地时最有说服力的叙事。
改图不重跑,缓存省烦恼!RegionCache给扩散模型装上了"记忆脑",多轮编辑再也不做重复功。想第一时间消化这类AI前沿论文?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!