← 返回 PaperDaily 视觉与图像

上海交大新作SANA-SR:32倍压缩+线性注意力,图像超分19毫秒搞定,效果还更强!

超分模型想要又快又好?上海交大奖池团队直戳痛点:不是先验不够强,而是token太拥挤、交互太贵了!他们祭出32倍压缩+线性注意力的大杀器——SANA-SR,单步推理19毫秒搞定,输出效果还吊打一众多步SOTA。这个思路,绝了!

上海交大新作SANA-SR:32倍压缩+线性注意力,图像超分19毫秒搞定,效果还更强!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
超分模型想要又快又好?上海交大奖池团队直戳痛点:不是先验不够强,而是token太拥挤、交互太贵了!他们祭出32倍压缩+线性注意力的大杀器——SANA-SR,单步推理19毫秒搞定,输出效果还吊打一众多步SOTA。这个思路,绝了!


原论文信息如下:
论文标题:
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
发表日期:
2026年05月
发表单位:
上海交通大学, 福州大学, 上海人工智能实验室
原文链接:
https://arxiv.org/pdf/2605.23451v1.pdf
开源代码链接:
论文暂未提供代码链接

引言:超分效率瓶颈不在先验不足,而在token冗余

家人们,今天聊聊图超分(Real-ISR)。就是把模糊、噪点、压缩痕迹去掉变高清。现实中的图退化原因千奇百怪,不是简单像素对齐能搞定的。
以前的方法,要么用StableSR、DiffBIR这类扩散模型来回采样好多步,效果顶呱呱但速度慢。要么像SeeSR、DreamClear那样疯狂喂先验知识,模型越做越大,推理时抱着一堆token算来算去,资源开销飙升。
上海交大、福州大学和上海AI实验室的研究员们觉得:问题根本不在“先验知识不够用”,而在于 token 太冗余了,且 token 之间的交互公式(注意力机制)太贵了。就像考试明明只需要一支笔,你非要背一麻袋铅笔去,然后花老半天一支一支数。
于是他们提出了 SANA-SR,一套一步到位的超分框架。核心思想:把 token 数量压到极致,同时把 token 交互换成算得更快的公式。效果媲美甚至超过多步大家伙,推理时间不到 20 毫秒。
来看效果:下面这张图里,SANA-SR 在 DRealSR 数据集上,感知质量分数最高,推理时间却最短。
图1:SANA-SR在真实世界图像超分辨率中实现了强大的质量-效率权衡。左图:对真实低分辨率输入与七种基线的定性比较,黄色框为放大区域。右图:DRealSR数据集上的归一化感知分数与推理时间散点图;标记颜色代表方法类别,标记大小与参数量成正比。SANA-SR以最低延迟取得了最佳感知质量。
图1:SANA-SR在真实世界图像超分辨率中实现了强大的质量-效率权衡。左图:对真实低分辨率输入与七种基线的定性比较,黄色框为放大区域。右图:DRealSR数据集上的归一化感知分数与推理时间散点图;标记颜色代表方法类别,标记大小与参数量成正比。SANA-SR以最低延迟取得了最佳感知质量。
他们还做了结构化剪枝,把模型参数量进一步砍到 3.44 亿,端侧设备部署也不是梦。接下来龙哥带大伙儿盘一盘 SANA-SR 是怎么做到的。

方法揭秘:32倍压缩 + 线性注意力,成就单步高效恢复

SANA-SR 的整体思路拆解为几个技术组合拳:深度压缩的 VAE线性注意力的 DiT,以及 LoRA 微调。先看看整体流程图。
先来看看 SANA-SR 的整体框架图。
图2:SANA-SR概述。给定一个低质量输入,SANA-SR首先使用冻结的深度压缩VAE将图像映射到紧凑的潜在空间,然后使用经过LoRA适配的、由提示引导的单步LinearDiT恢复潜在表示。训练过程通过冻结先验对齐和适配器一致性进行正则化,最终模型通过提示感知的结构化剪枝进行进一步压缩,以实现高效部署。
图2:SANA-SR 整体流程图。低质量输入经深度压缩VAE编码得到紧凑潜在表示ZL;文本提示器提取语义标签,与质量后缀拼接后经文本编码器得到条件嵌入;LoRA适配后的单步LinearDiT读入ZL、条件嵌入和时序步长后恢复出潜在表示Zˆ;然后经VAE解码器得到超分输出。训练时还进行了冻结先验对齐和适配器一致性正则化。最后经提示感知的结构化剪枝得到高效部署模型。

第一拳:32倍深度压缩VAE,把token数量砍到只剩256个

现有扩散超分模型,如 OSEDiff、AdcSR,通常使用 8倍压缩率的 VAE。对于 $512\times512$ 的图,编码后产生约 4000 个 token。这简直是开了个上千人的大会。
SANA-SR 直接用了 SANA 的 深度压缩自动编码器 (DC-AE),把压缩率干到 32倍。同样一张 $512\times512$ 的图,编码后 token 数量骤降至 256 个。这就像把一个万人会场压缩成了20人小会议室。
更重要的是,研究团队发现,这个深压缩的潜在空间对真实世界的退化天然就比像素空间要稳定。压缩后的特征天生就更“干净”,在里面做修复难度直降好几个 level。

第二拳:线性注意力,放弃昂贵的O(N²)公式

token 少了,但如果还用标准自注意力机制,还得对每一对 token 做匹配计算,复杂度 O(N²)。N=256 时还好,N=4000时就是灾难级开销。
SANA-SR 采用 SANA 中提出的 线性注意力 (Linear Attention)。通过核函数 φ(·),调整计算顺序,避免显式构建 N×N 注意力矩阵。更新公式如下:
公式
公式:线性注意力公式。通过非负核函数 φ(·),将 Q 和 K 的转置相乘再与 V 相乘的 O(N²) 计算,转换为 φ(Q) 与 φ(K)⊤V 先做的 O(N) 计算。εatt 是稳定项。
计算复杂度从 O(N²) 降到了 O(N)。256 个 token 配上 O(N) 复杂度,计算开销基本可以忽略。
整个单步推理的更新也很简洁:
公式
公式:单步推理过程。给定低质量输入zL,通过LoRA适配后的线性DiT(fθ)预测潜在空间残差,从zL中减去后得到恢复后的潜在表示ż,再通过冻结的VAE解码器D得到超分输出x̂。στg是系数。

第三拳:LoRA微调 + 退化感知提示,让大模型“听话”

直接用预训练图像生成模型来超分,模型可能会对低质量图中的退化作响应,生成更差的图。为此研究团队设计了 退化感知的提示修正
从标签提取器 Π(·) 得到内容标签(如“树”),和固定高质量后缀模板 ptpl(包含“干净、清晰、最佳质量”等关键词)拼接,再喂给文本编码器。同时用注意力掩码屏蔽退化相关 token。修正后的提示嵌入 c 如下:
公式
公式:退化感知提示修正。Π(xL)是从低质量图中提取的内容标签,ptpl是固定质量后缀模板,二者拼接后通过冻结的文本编码器T得到提示嵌入c和注意力掩码m。
SANA-SR 采用 LoRA 微调,只在大模型注意力层和FFN层中插入小的可训练低秩矩阵,其他参数全部冻结。训练参数量大幅下降,微调成本极低。
为确保单步预测的潜在表示与原始“干净”生成潜在表示一致,还加了 冻结先验对齐损失(Lalign) 和 适配器一致性损失(Lcons),约束微调后的模型不“跑偏”。
公式
公式:冻结先验对齐损失 Lalign。通过匹配冻结预训练骨干网络对恢复后的潜在表示和真实高清潜在表示在加噪后的响应(qẑ和 qH)的通道级高斯摘要(均值和方差),确保微调后模型与预训练模型行为一致。
公式
公式:适配器一致性损失 Lcons。确保 LoRA 适配后模型(fθ)与冻结原模型(f0)在相同输入下的输出不要相差太大。

附加秘技:结构化剪枝,把模型再“削”一圈

为了在手机上也能跑,SANA-SR 还做了 提示感知的结构化剪枝。根据模型在超分任务上的损失函数计算每个 Transformer 块的重要性(“显著度” Sℓ),保留最重要的块,同时确保第一层和最后一层保留。
公式
公式:块显著度 Sℓ 计算。对于包含参数 wi 的块 Bℓ,其重要程度由参数大小的平方除以对应的对角曲率代理(Fi)并累加得到。Fi越大表示该参数对损失变化越敏感,显著度高的块应该保留。
最终,SANA-SR 把最初的 344M 参数模型通过剪枝还能再优化,在保证效果几乎不降的情况下把推理速度推到极致。
插图
这技术组合拳打出来,是不是有种“还能这样操作?”的惊喜感?

实验验证:加速10倍,效果不降反升

光说不练假把式,来盘盘实验数据。SANA-SR 在一堆公开数据集上跟目前的大哥们都比了一轮。
先看一张表格,感受下 SANA-SR 在方法论上的领先地位。
表1:代表性Real-ISR方法家族的比较。与其他方法相比,本文提出的SANA-SR同时实现了无需从头训练的单步推理、32倍潜在空间压缩、线性复杂度的注意力和结构化剪枝。
表1:SANA-SR 是唯一同时满足单步推理、无需从头训练、32倍压缩、线性注意力、参数量小于5亿、支持剪枝且推理时间小于20毫秒的模型。
接下来看几个数据集上的定量对比。
表2:在DIV2K验证集上的定量对比,加粗和加下划线分别表示最佳和次佳结果。
表2:在 DIV2K 验证集上,SANA-SR 在 PSNR、SSIM 和 MUSIQ 指标上均取得最优,同时在 DISTS 和 NIQE 上排名第二。说明在受控的合成退化上,保真度和感知质量都相当在线。
表4:在DRealSR数据集上的定量对比,加粗和加下划线分别表示最佳和次佳结果。
表4:在真实世界数据集 DRealSR 上,SANA-SR 在 MANIQA 和 CLIPIQA 两个感知指标上拔得头筹,PSNR 和 SSIM 稳坐第二。推理时间干到了 0.019 秒,比大多数两秒以上的方法快了百倍不止。
表5:不同方法的效率对比。
表5:SANA-SR 参数量 344M,计算量 407.95 G MACs,比最近的一步法基线 AdcSR(456M, 496 G MACs)还要轻,推理速度(0.019秒)在单卡 FP16 下是最快的之一。
最后用肉眼看看效果。在下面这张图中,SANA-SR 不仅恢复了更清晰的字符结构,而且在建筑窗户的细节上也表现得更锐利、更连贯。
图3:在DRealSR数据集上的定性比较。第一行:SANA-SR恢复了更清晰的字符结构;第二行:SANA-SR恢复了更锐利的窗户边界和更连贯的局部结构。
图3:DRealSR数据集上的视觉效果对比。SANA-SR 在字符细节和建筑纹理上都表现优异,说明在效率和效果上都没有妥协。

深入分析:关键组件如何协同工作,剪枝策略锦上添花

SANA-SR 的成功靠各组件协同。下面这个消融实验,把每个贡献点都摊开来看了看。
图4:SANA-SR的消融可视化。单元格颜色编码了每个子图、每个指标的归一化分数,LPIPS经过反转使得颜色越深代表性能越好,默认配置以红色框标出。(a) 提示设计,S:质量后缀标签,D:DAPE提示。(b) 训练目标:“Full”完整目标,-L<sub>x</sub>表示去掉对应损失项。(c) 单步生成时间步τ<sub>g</sub>。(d) 分辨率先验,表示为“骨干网络 × 训练裁剪尺寸”。
图4:从消融结果看,使用完整目标函数(“Full”)、合适的提示设计以及正确的单步生成时间步都很关键。如果没有对齐损失(-Lalign)或一致性损失(-Lcons),性能会显著下降,验证了这两个正则项的重要性。
再来看剪枝的效果。下表展示了不同剪枝策略对模型效果和计算量的影响。
表6:不同剪枝策略的对比。
表6:本文提出的提示感知剪枝策略(Ours)在去掉更多块(32→16块)的同时,保持了最好的 NIQE 和 CLIPIQA 分数,MACs 也大幅降低。均匀剪枝和随机剪枝都会导致明显的质量滑坡。
通过二阶段策略(先训练,后剪枝),SANA-SR 能够根据部署硬件预算,在几乎不牺牲效果的前提下把模型削到极致。

总结与展望:高效SR的新范式,未来可期

SANA-SR 告诉我们:在图像恢复上,多步迭代、海量 token 也许根本不是必须的。只要找准瓶颈——token 冗余和交互开销——并用对的技术(32倍压缩 + 线性注意力 + 结构化剪枝)去解决,就能用很小的轻量模型达到甚至超越大模型的效果。
这个方向对于手机摄影、云端图像处理等需要高效率和低延迟的场景,打开了一扇新的大门。未来如果能进一步优化退化感知的提示提取,甚至结合视频序列的时序信息,应用场景将会更广阔。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决了什么问题?现有生成式图像超分方法推理时 token 数量庞大(约4000个),注意力计算成本高(O(N²)),导致速度慢、部署难。本文提出 SANA-SR,通过 32 倍压缩 VAE 和线性注意力,将 token 降到 256 个、注意力复杂度降到 O(N),实现单步、超高速、高质量的超分辨率。

“LoRA”和“DiT”在本文中是什么意思?LoRA(低秩适应)是一种高效微调大模型的方法,通过在预训练模型权重矩阵旁插入两个小的低秩矩阵,只更新这些小矩阵的参数,大大减少微调计算量和参数量。DiT(扩散Transformer)是用 Transformer 架构替代传统 U-Net 作为扩散模型骨干网络的结构。本文的 LinearDiT 就是采用了线性注意力机制的 DiT。

“结构化剪枝”是什么意思?即按块(如一个Transformer块)去掉模型里不重要的部分。本文的剪枝方法先用超分任务的数据和损失函数评估每个块的重要性(显著度 Sℓ),然后保留重要的块,去掉不重要的,以保证剪完后模型效果下降最少。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

最大创新在于识别并解决了 token 冗余与交互开销这个被忽略的瓶颈,将 SANA 的线性注意力+深压缩范式首次引入超分任务。针对超分设计的退化感知提示修正、冻结先验对齐等策略,具有较高新颖性。

实验合理度:★★★★★

实验设计系统,在多个数据集上与 18 种方法全面比较,提供详尽消融实验和剪枝策略对比。对比方法官方代码和默认设置得到充分利用,实验设置公平,结果可信度高。

学术研究价值:★★★★✰

为高效生成式超分提供了新思路:从架构效率和 token 空间压缩角度,而非单纯堆参数或缩步数。对后续开发更极致的端侧超分模型具有很强指导意义。

稳定性:★★★★✰

在多个数据集上效果稳定。剪枝策略能进一步压缩,但被剪枝模型依赖于训练时的超分损失函数,对于完全未见过的退化类型,泛化稳定性还有待更多验证。

适应性以及泛化能力:★★★★✰

在合成和真实退化数据集上都取得优秀效果,常见退化场景下适应性和泛化能力不错。但训练数据是合成退化,对于某些特别罕见或数据分布差异极大的退化,泛化能力可能打折扣。

硬件需求及成本:★★★★★

推理时间 0.019 秒,计算量 407.95 G MACs,参数量 344M,在 GPU 上非常轻量,剪枝后还可部署到移动端。训练成本也相对较低,使用 8 张 RTX 4090 训练 100K 步即可。

复现难度:★★★✰✰

论文详细描述了数据、训练策略、超参数,理论上可复现。但使用了 DAPE 提示提取器等外部组件,需要预先训练好的 SANA 模型作为骨架,这些依赖可能增加复现工作量。代码尚未开源。

产品化成熟度:★★★★✰

具有较高产品化潜力,速度快、效果好的特点非常适合云端图像处理、移动端美图、实时视频增强等场景。但还需在真实世界极端退化图像上进行压力测试,并优化不同设备上的推理引擎。

可能的问题:论文未深入探讨对极端未见过的退化类型(如强对抗性噪声、严重 JPEG 压缩块)的鲁棒性。训练过程中涉及冻结先验对齐的多步采样,增加了训练流程的复杂性。当前方法未开源,对复现和研究有一定门槛。


主要参考文献

[1] Liang et al. "Real-world image super-resolution via diffusion models." IJCV 2024. (StableSR)
[2] Li et al. "DiffBIR: Blind image restoration with diffusion models." ECCV 2024.
[3] Wu et al. "SeeSR: Towards semantics-aware real-world image super-resolution." CVPR 2024.
[4] Hu et al. "LoRA: Low-rank adaptation of large language models." ICLR 2022.
[5] Mnih et al. "Efficient one-step diffusion restoration with compact compression and linear attention." (本文 SANA-SR) ArXiv 2605.23451, 2026.
[6] Tang et al. "SANA: Efficient high-resolution image synthesis with linear diffusion transformer." CVPR 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
KKK
wechat_helper dianzan
其中KKK为具体要填入的内容:

看完了SANA-SR的极致效率,是不是对“又快又好”的AI落地充满期待?想了解更多前沿图模型、扩散模型、图像超分等领域的深入解读,和同行一起交流最新进展吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+交大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。在这里,你能第一时间获取硬核干货,和志同道合的伙伴一起进步!

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。