← 返回 PaperDaily
视觉与图像
上海交大新作SANA-SR:32倍压缩+线性注意力,图像超分19毫秒搞定,效果还更强!
超分模型想要又快又好?上海交大奖池团队直戳痛点:不是先验不够强,而是token太拥挤、交互太贵了!他们祭出32倍压缩+线性注意力的大杀器——SANA-SR,单步推理19毫秒搞定,输出效果还吊打一众多步SOTA。这个思路,绝了!
龙哥读论文
发布于 2026-08-19 00:20:07
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 超分模型想要又快又好?上海交大奖池团队直戳痛点:不是先验不够强,而是token太拥挤、交互太贵了!他们祭出32倍压缩+线性注意力的大杀器——SANA-SR,单步推理19毫秒搞定,输出效果还吊打一众多步SOTA。这个思路,绝了!
原论文信息如下:
引言:超分效率瓶颈不在先验不足,而在token冗余
家人们,今天聊聊图超分(Real-ISR)。就是把模糊、噪点、压缩痕迹去掉变高清。现实中的图退化原因千奇百怪,不是简单像素对齐能搞定的。
以前的方法,要么用StableSR、DiffBIR这类扩散模型来回采样好多步,效果顶呱呱但速度慢。要么像SeeSR、DreamClear那样疯狂喂先验知识,模型越做越大,推理时抱着一堆token算来算去,资源开销飙升。
上海交大、福州大学和上海AI实验室的研究员们觉得:问题根本不在“先验知识不够用”,而在于 token 太冗余了,且 token 之间的交互公式(注意力机制)太贵了 。就像考试明明只需要一支笔,你非要背一麻袋铅笔去,然后花老半天一支一支数。
于是他们提出了 SANA-SR ,一套一步到位的超分框架。核心思想:把 token 数量压到极致,同时把 token 交互换成算得更快的公式。效果媲美甚至超过多步大家伙,推理时间不到 20 毫秒。
来看效果:下面这张图里,SANA-SR 在 DRealSR 数据集上,感知质量分数最高,推理时间却最短。
他们还做了结构化剪枝,把模型参数量进一步砍到 3.44 亿,端侧设备部署也不是梦。接下来龙哥带大伙儿盘一盘 SANA-SR 是怎么做到的。
方法揭秘:32倍压缩 + 线性注意力,成就单步高效恢复
SANA-SR 的整体思路拆解为几个技术组合拳:深度压缩的 VAE 、线性注意力的 DiT ,以及 LoRA 微调。先看看整体流程图。
第一拳:32倍深度压缩VAE,把token数量砍到只剩256个
现有扩散超分模型,如 OSEDiff、AdcSR,通常使用 8倍压缩率的 VAE。对于 $512\times512$ 的图,编码后产生约 4000 个 token。这简直是开了个上千人的大会。
SANA-SR 直接用了 SANA 的 深度压缩自动编码器 (DC-AE) ,把压缩率干到 32倍。同样一张 $512\times512$ 的图,编码后 token 数量骤降至 256 个。这就像把一个万人会场压缩成了20人小会议室。
更重要的是,研究团队发现,这个深压缩的潜在空间对真实世界的退化天然就比像素空间要稳定。压缩后的特征天生就更“干净”,在里面做修复难度直降好几个 level。
token 少了,但如果还用标准自注意力机制,还得对每一对 token 做匹配计算,复杂度 O(N²)。N=256 时还好,N=4000时就是灾难级开销。
SANA-SR 采用 SANA 中提出的 线性注意力 (Linear Attention) 。通过核函数 φ(·),调整计算顺序,避免显式构建 N×N 注意力矩阵。更新公式如下:
计算复杂度从 O(N²) 降到了 O(N) 。256 个 token 配上 O(N) 复杂度,计算开销基本可以忽略。
第三拳:LoRA微调 + 退化感知提示,让大模型“听话”
直接用预训练图像生成模型来超分,模型可能会对低质量图中的退化作响应,生成更差的图。为此研究团队设计了 退化感知的提示修正 。
从标签提取器 Π(·) 得到内容标签(如“树”),和固定高质量后缀模板 ptpl(包含“干净、清晰、最佳质量”等关键词)拼接,再喂给文本编码器。同时用注意力掩码屏蔽退化相关 token。修正后的提示嵌入 c 如下:
SANA-SR 采用 LoRA 微调,只在大模型注意力层和FFN层中插入小的可训练低秩矩阵,其他参数全部冻结。训练参数量大幅下降,微调成本极低。
为确保单步预测的潜在表示与原始“干净”生成潜在表示一致,还加了 冻结先验对齐损失 (Lalign) 和 适配器一致性损失 (Lcons),约束微调后的模型不“跑偏”。
为了在手机上也能跑,SANA-SR 还做了 提示感知的结构化剪枝 。根据模型在超分任务上的损失函数计算每个 Transformer 块的重要性(“显著度” Sℓ),保留最重要的块,同时确保第一层和最后一层保留。
最终,SANA-SR 把最初的 344M 参数模型通过剪枝还能再优化,在保证效果几乎不降的情况下把推理速度推到极致。
实验验证:加速10倍,效果不降反升
光说不练假把式,来盘盘实验数据。SANA-SR 在一堆公开数据集上跟目前的大哥们都比了一轮。
先看一张表格,感受下 SANA-SR 在方法论上的领先地位。
最后用肉眼看看效果。在下面这张图中,SANA-SR 不仅恢复了更清晰的字符结构,而且在建筑窗户的细节上也表现得更锐利、更连贯。
深入分析:关键组件如何协同工作,剪枝策略锦上添花
SANA-SR 的成功靠各组件协同。下面这个消融实验,把每个贡献点都摊开来看了看。
再来看剪枝的效果。下表展示了不同剪枝策略对模型效果和计算量的影响。
通过二阶段策略(先训练,后剪枝),SANA-SR 能够根据部署硬件预算,在几乎不牺牲效果的前提下把模型削到极致。
总结与展望:高效SR的新范式,未来可期
SANA-SR 告诉我们:在图像恢复上,多步迭代、海量 token 也许根本不是必须的。只要找准瓶颈——token 冗余和交互开销——并用对的技术(32倍压缩 + 线性注意力 + 结构化剪枝)去解决,就能用很小的轻量模型达到甚至超越大模型的效果。
这个方向对于手机摄影、云端图像处理等需要高效率和低延迟的场景,打开了一扇新的大门。未来如果能进一步优化退化感知的提示提取,甚至结合视频序列的时序信息,应用场景将会更广阔。
龙迷三问
这篇论文解决了什么问题? 现有生成式图像超分方法推理时 token 数量庞大(约4000个),注意力计算成本高(O(N²)),导致速度慢、部署难。本文提出 SANA-SR,通过 32 倍压缩 VAE 和线性注意力,将 token 降到 256 个、注意力复杂度降到 O(N),实现单步、超高速、高质量的超分辨率。
“LoRA”和“DiT”在本文中是什么意思? LoRA (低秩适应)是一种高效微调大模型的方法,通过在预训练模型权重矩阵旁插入两个小的低秩矩阵,只更新这些小矩阵的参数,大大减少微调计算量和参数量。DiT(扩散Transformer)是用 Transformer 架构替代传统 U-Net 作为扩散模型骨干网络的结构。本文的 LinearDiT 就是采用了线性注意力机制的 DiT。
“结构化剪枝”是什么意思? 即按块(如一个Transformer块)去掉模型里不重要的部分。本文的剪枝方法先用超分任务的数据和损失函数评估每个块的重要性(显著度 Sℓ),然后保留重要的块,去掉不重要的,以保证剪完后模型效果下降最少。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
最大创新在于识别并解决了 token 冗余与交互开销这个被忽略的瓶颈,将 SANA 的线性注意力+深压缩范式首次引入超分任务。针对超分设计的退化感知提示修正、冻结先验对齐等策略,具有较高新颖性。
实验合理度: ★★★★★
实验设计系统,在多个数据集上与 18 种方法全面比较,提供详尽消融实验和剪枝策略对比。对比方法官方代码和默认设置得到充分利用,实验设置公平,结果可信度高。
学术研究价值: ★★★★✰
为高效生成式超分提供了新思路:从架构效率和 token 空间压缩角度,而非单纯堆参数或缩步数。对后续开发更极致的端侧超分模型具有很强指导意义。
稳定性: ★★★★✰
在多个数据集上效果稳定。剪枝策略能进一步压缩,但被剪枝模型依赖于训练时的超分损失函数,对于完全未见过的退化类型,泛化稳定性还有待更多验证。
适应性以及泛化能力: ★★★★✰
在合成和真实退化数据集上都取得优秀效果,常见退化场景下适应性和泛化能力不错。但训练数据是合成退化,对于某些特别罕见或数据分布差异极大的退化,泛化能力可能打折扣。
硬件需求及成本: ★★★★★
推理时间 0.019 秒,计算量 407.95 G MACs,参数量 344M,在 GPU 上非常轻量,剪枝后还可部署到移动端。训练成本也相对较低,使用 8 张 RTX 4090 训练 100K 步即可。
复现难度: ★★★✰✰
论文详细描述了数据、训练策略、超参数,理论上可复现。但使用了 DAPE 提示提取器等外部组件,需要预先训练好的 SANA 模型作为骨架,这些依赖可能增加复现工作量。代码尚未开源。
产品化成熟度: ★★★★✰
具有较高产品化潜力,速度快、效果好的特点非常适合云端图像处理、移动端美图、实时视频增强等场景。但还需在真实世界极端退化图像上进行压力测试,并优化不同设备上的推理引擎。
可能的问题: 论文未深入探讨对极端未见过的退化类型(如强对抗性噪声、严重 JPEG 压缩块)的鲁棒性。训练过程中涉及冻结先验对齐的多步采样,增加了训练流程的复杂性。当前方法未开源,对复现和研究有一定门槛。
主要参考文献
[1] Liang et al. "Real-world image super-resolution via diffusion models." IJCV 2024. (StableSR)
[2] Li et al. "DiffBIR: Blind image restoration with diffusion models." ECCV 2024.
[3] Wu et al. "SeeSR: Towards semantics-aware real-world image super-resolution." CVPR 2024.
[4] Hu et al. "LoRA: Low-rank adaptation of large language models." ICLR 2022.
[5] Mnih et al. "Efficient one-step diffusion restoration with compact compression and linear attention." (本文 SANA-SR) ArXiv 2605.23451, 2026.
[6] Tang et al. "SANA: Efficient high-resolution image synthesis with linear diffusion transformer." CVPR 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
其中KKK为具体要填入的内容:
看完了SANA-SR的极致效率,是不是对“又快又好”的AI落地充满期待?想了解更多前沿图模型、扩散模型、图像超分等领域的深入解读,和同行一起交流最新进展吗? 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+交大+龙哥) ,根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。在这里,你能第一时间获取硬核干货,和志同道合的伙伴一起进步!