← 返回 PaperDaily 视觉与图像

CVPR 2026 夺冠?韩国团队用LRU做超分,效率吊打Transformer,仅需一次扫描!

Transformer的注意力机制一统超分天下?韩国高丽大学最新研究说,或许静态的线性递归单元(LRU)才是那个更香的选择。他们提出的LSM,用一次扫描就搞定了原本需要多次动态扫描的活儿,不仅省计算,画质还好到没朋友,成功登上CVPR 2026 Findings!

CVPR 2026 夺冠?韩国团队用LRU做超分,效率吊打Transformer,仅需一次扫描!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
Transformer的注意力机制一统超分天下?韩国高丽大学最新研究说,或许静态的线性递归单元(LRU)才是那个更香的选择。他们提出的LSM,用一次扫描就搞定了原本需要多次动态扫描的活儿,不仅省计算,画质还好到没朋友,成功登上CVPR 2026 Findings!


原论文信息如下:
论文标题:
Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution
发表日期: 2026年06月
发表单位: 韩国高丽大学, DGIST
原文链接: https://arxiv.org/pdf/2606.19901v1.pdf
开源代码链接: https://github.com/MingyuChoi-run/LSM
当下超分领域,Transformer和Mamba最火。前者靠注意力拿下画质巅峰,后者用状态空间模型提升效率。但韩国高丽大学团队盯上了被遗忘的线性递归单元(LRU)。这个在NLP中昙花一现的模型,在图像领域能掀起波澜吗?答案出乎意料:不仅能用,而且很香。他们提出的LSM参数少、计算快,视觉效果碾压MambaIRv2和HAT。

引言:LRU超分?别拿静态模型做2D任务了!

LRU祖师爷是RNN,但梯度消失问题让它在长序列任务上备受折磨。后来有人撤掉非线性和动态参数,搞出清爽的线性递归版本,即LRU。它在长距离建模上展现出惊人的稳定性和线性复杂度潜力。但纯粹的静态线性递归放到图像里,就像老式打字机——敲出的一行字符整整齐齐,但让它理解斑驳纹理和几何结构,就显得"有口难言"。本文骨架清晰:用LRU当核,但给核套上"智能马甲"——语义调制单元(SMU)。一句话概括:让静态LRU学会"看人下菜碟",对不同像素施加不同递归权重。

方法概述:一篇论文,三大绝招:分类、调制、增强

LSM整体架构如图3和4。核心创新是SMU,它在同一模块里玩了三个几乎不招额外开销的花活。
图3:LSM整体架构图
图3:LSM整体架构。由局部窗口多头自注意力(WMS)块和后续基于类别的调制LRU(CML)块构成,每个块都集成门控MLP和可学习残差缩放系数。
图4:提出的LRU和SMU模块细节图
图4:LRU和SMU模块细节。SMU通过特征与字典的操作,同时实现输入分类、过渡矩阵动态调制以及通过交叉注意力进行特征增强。
具体来说,可学习字典充当核心中枢。输入特征通过线性投影变为'Q',字典变为'K'和'V'后,计算余弦相似度图。该图通过Softmax后,SMU将其分成四部分,分别调节LRU的状态过渡矩阵。同时,SMU利用该图给每个像素分配语义标签,让单次扫描中就能将远距离但语义相似的像素"凑到一起"处理。最后,它还能从字典中提取全局上下文信息补充LRU输出。

核心原理推导:LSM凭什么赢?源于RG-LRU又超越RG-LRU

要理解LSM精髓,得先看其灵感来源——RG-LRU。它通过引入两个门控信号,让静态递归系数能根据输入动态调整。LSM团队将这种思路提炼并简化,给出更适合2D图像处理的调制方案。他们把原先的静态特征值λ和输入矩阵B替换成与输入相关的动态版本。这不是简单乘标量,而是通过精心设计的字典投影,生成四个不同调制令牌,分别调制λ的幅值、B和复数矩阵C的实部与虚部。复杂度基本没增加,但表达能力从瞎子变成千里眼。字典尺寸P远小于图像令牌数T,整个调制过程计算量极小,配得上"零开销"标签。

数据准备及实验设计

实验基于经典超分基准。训练集采用DIV2K和Flickr2K,测试集覆盖Set5、Set14、B100、Urban100和Manga109。模型分三个版本:轻量级LSM-light、标准版LSM-S和LSM。消融实验细致入微:对LRU特征值初始化深入分析,对SMU多角色设计逐一验证,对调制令牌单独剥除测试,确保每部分设计都不白费。

实验结果:精度更高、速度更快、还更省显存?

结果相当"不讲武德"。在×2超分任务上,LSM-S仅9.7M参数,以34.40 dB PSNR在Urban100上超越参数量更大的CAT-A(16.5M)和MambaIR(20.4M)。在×3和×4下优势更显著。轻量级场景下,LSM-light以最低FLOPs在所有数据集上取得最强性能。
经典超分任务定量对比表
图6:经典超分定量对比表(部分)。在×4 Urban100上,LSM以12.9M参数获27.94 dB PSNR,比MambaIRv2-S(9.8M, 27.73 dB)显著更高,也超过参数量更大的MambaIR(20.6M, 27.68 dB)。
经典超分定性对比图
图8:定性对比图。在Urban100上,LSM恢复复杂纹理的清晰度肉眼可见更接近真实高清图像。
LSM在内存效率上优势显著。图10显示,相同硬件限制下LSM能处理更大输入分辨率。LRU的线性复杂度让训练所需GPU显存比Transformer和Mamba都少得多。
图10:GPU训练内存使用对比图
图10:GPU训练内存使用对比。相同预算下,LSM通过LRU主干释放的内存优势显著优于Transformer和Mamba。

看不见的隐状态如何变强了?

论文展示了非常有趣的消融视角——隐藏状态可视化对比。图7展示三种变体:原始LRU、带分类的LRU、带分类和调制的LRU(完整LSM)。纯LRU的隐状态几乎是块噪声;加上分类后,开始有宏观轮廓;加上调制的完整版,连建筑立面的窗户和花茎纹理细节都被编码出来。这说明SMU的调制让LRU从"死记硬背"进化成"理解画面"。
图7:隐状态可视化对比图
图7:隐状态可视化对比。从LRU到分类LRU再到完整LSM,隐状态逐渐能更精准捕捉全局结构和局部细节。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

LRU是什么?和传统RNN有什么区别?LRU是对RNN线性化、对角化并特殊初始化后的简化版。传统RNN用非线性激活易梯度消失;LRU去掉非线性,将递归矩阵对角化为特征值λ,用再参数化保证稳定性。复杂度O(N)线性,支持并行训练。缺点是参数静态,难适应图像中不同空间模式。

SMU的字典怎么训练?需要额外标注吗?字典随机初始化、端到端训练,无需人工标注。它通过余弦相似度与输入特征交互,自动学到P个典型"语义原型"。训练中字典逐渐编码出"平滑区域"、"纹理边缘"等隐含类别,指导LRU递归行为。Gumbel Softmax使硬分类可微,系统纯自监督。

LSM和MambaIR相比,核心优势在哪?MambaIR基于SSM,需动态参数化和复杂离散化步骤,通常需多次扫描覆盖全局。LSM只用一次静态扫描,通过SMU调制和分类实现语义感知全局建模。实验上,LSM在相同参数量下PSNR更高、FLOPs更低、训练显存更少。代码和模型已开源,门槛低。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

首次将LRU引入图像超分,提出SMU实现输入依赖调制,思路新颖。但RG-LRU和字典注意力已有相关工作。

实验合理度:★★★★☆

对比方法覆盖全面,消融周到。但缺少与更大型模型(如HAT-L)对比。

学术研究价值:★★★★★

开创"静态LRU+轻量调制"做视觉任务的新范式,启发性强。

稳定性:★★★☆☆

结果稳定,但特征值初始化敏感度较高,需认真调参。

适应性以及泛化能力:★★★★☆

跨越多个缩放因子和数据集,泛化不错。但仅测试SR任务。

硬件需求及成本:★★★★★

LRU线性复杂度使训练显存和推理FLOPs低于同级Transformer和Mamba,对移动端友好。

复现难度:★★★★★

官方代码已开源,环境配置清晰,复现顺畅。

产品化成熟度:★★★☆☆

可通过ONNX导出轻量版,但缺少多平台部署测试和低比特量化实验。

可能的问题:字典容量P和LRU状态尺寸选取缺乏自动化方案。复数输出调制贡献不如输入调制显著。缺少与更大算力下模型直接对比。


主要参考文献

[40] Orvieto A, et al. Resurrecting recurrent neural networks for long sequences. ICML, 2023.
[13] De et al. Gated Linear Recurrent Units (Griffin). arXiv, 2024.
[21] Guo H, et al. MambaIR. ECCV, 2024.
[22] Guo H, et al. MambaIRv2. arXiv, 2024.
[31] Liang J, et al. SwinIR. ICCV, 2021.
[7] Chen X, et al. HAT. CVPR, 2023.
[54] Zheng Y, et al. ATD. ECCV, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨。想了解更多原文细节,可点击"阅读原文"

end
想跟上每日AI领域的本质变化,欢迎加入龙哥读论文粉丝群,扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。