← 返回 PaperDaily
视觉与图像
CVPR 2026 夺冠?韩国团队用LRU做超分,效率吊打Transformer,仅需一次扫描!
Transformer的注意力机制一统超分天下?韩国高丽大学最新研究说,或许静态的线性递归单元(LRU)才是那个更香的选择。他们提出的LSM,用一次扫描就搞定了原本需要多次动态扫描的活儿,不仅省计算,画质还好到没朋友,成功登上CVPR 2026 Findings!
龙哥读论文
发布于 2026-08-15 00:20:10
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: Transformer的注意力机制一统超分天下?韩国高丽大学最新研究说,或许静态的线性递归单元(LRU)才是那个更香的选择。他们提出的LSM,用一次扫描就搞定了原本需要多次动态扫描的活儿,不仅省计算,画质还好到没朋友,成功登上CVPR 2026 Findings!
原论文信息如下:
当下超分领域,Transformer和Mamba最火。前者靠注意力拿下画质巅峰,后者用状态空间模型提升效率。但韩国高丽大学团队盯上了被遗忘的线性递归单元(LRU)。这个在NLP中昙花一现的模型,在图像领域能掀起波澜吗?答案出乎意料:不仅能用,而且很香。他们提出的LSM参数少、计算快,视觉效果碾压MambaIRv2和HAT。
引言:LRU超分?别拿静态模型做2D任务了!
LRU祖师爷是RNN,但梯度消失问题让它在长序列任务上备受折磨。后来有人撤掉非线性和动态参数,搞出清爽的线性递归版本,即LRU。它在长距离建模上展现出惊人的稳定性和线性复杂度潜力。但纯粹的静态线性递归放到图像里,就像老式打字机——敲出的一行字符整整齐齐,但让它理解斑驳纹理和几何结构,就显得"有口难言"。本文骨架清晰:用LRU当核,但给核套上"智能马甲"——语义调制单元(SMU)。一句话概括:让静态LRU学会"看人下菜碟",对不同像素施加不同递归权重。
方法概述:一篇论文,三大绝招:分类、调制、增强
LSM整体架构如图3和4。核心创新是SMU,它在同一模块里玩了三个几乎不招额外开销的花活。
具体来说,可学习字典充当核心中枢。输入特征通过线性投影变为'Q',字典变为'K'和'V'后,计算余弦相似度图。该图通过Softmax后,SMU将其分成四部分,分别调节LRU的状态过渡矩阵。同时,SMU利用该图给每个像素分配语义标签,让单次扫描中就能将远距离但语义相似的像素"凑到一起"处理。最后,它还能从字典中提取全局上下文信息补充LRU输出。
核心原理推导:LSM凭什么赢?源于RG-LRU又超越RG-LRU
要理解LSM精髓,得先看其灵感来源——RG-LRU。它通过引入两个门控信号,让静态递归系数能根据输入动态调整。LSM团队将这种思路提炼并简化,给出更适合2D图像处理的调制方案。他们把原先的静态特征值λ和输入矩阵B替换成与输入相关的动态版本。这不是简单乘标量,而是通过精心设计的字典投影,生成四个不同调制令牌,分别调制λ的幅值、B和复数矩阵C的实部与虚部。复杂度基本没增加,但表达能力从瞎子变成千里眼。字典尺寸P远小于图像令牌数T,整个调制过程计算量极小,配得上"零开销"标签。
数据准备及实验设计
实验基于经典超分基准。训练集采用DIV2K和Flickr2K,测试集覆盖Set5、Set14、B100、Urban100和Manga109。模型分三个版本:轻量级LSM-light、标准版LSM-S和LSM。消融实验细致入微:对LRU特征值初始化深入分析,对SMU多角色设计逐一验证,对调制令牌单独剥除测试,确保每部分设计都不白费。
实验结果:精度更高、速度更快、还更省显存?
结果相当"不讲武德"。在×2超分任务上,LSM-S仅9.7M参数,以34.40 dB PSNR在Urban100上超越参数量更大的CAT-A(16.5M)和MambaIR(20.4M)。在×3和×4下优势更显著。轻量级场景下,LSM-light以最低FLOPs在所有数据集上取得最强性能。
LSM在内存效率上优势显著。图10显示,相同硬件限制下LSM能处理更大输入分辨率。LRU的线性复杂度让训练所需GPU显存比Transformer和Mamba都少得多。
看不见的隐状态如何变强了?
论文展示了非常有趣的消融视角——隐藏状态可视化对比。图7展示三种变体:原始LRU、带分类的LRU、带分类和调制的LRU(完整LSM)。纯LRU的隐状态几乎是块噪声;加上分类后,开始有宏观轮廓;加上调制的完整版,连建筑立面的窗户和花茎纹理细节都被编码出来。这说明SMU的调制让LRU从"死记硬背"进化成"理解画面"。
龙迷三问
LRU是什么?和传统RNN有什么区别? LRU是对RNN线性化、对角化并特殊初始化后的简化版。传统RNN用非线性激活易梯度消失;LRU去掉非线性,将递归矩阵对角化为特征值λ,用再参数化保证稳定性。复杂度O(N)线性,支持并行训练。缺点是参数静态,难适应图像中不同空间模式。
SMU的字典怎么训练?需要额外标注吗? 字典随机初始化、端到端训练,无需人工标注。它通过余弦相似度与输入特征交互,自动学到P个典型"语义原型"。训练中字典逐渐编码出"平滑区域"、"纹理边缘"等隐含类别,指导LRU递归行为。Gumbel Softmax使硬分类可微,系统纯自监督。
LSM和MambaIR相比,核心优势在哪? MambaIR基于SSM,需动态参数化和复杂离散化步骤,通常需多次扫描覆盖全局。LSM只用一次静态扫描,通过SMU调制和分类实现语义感知全局建模。实验上,LSM在相同参数量下PSNR更高、FLOPs更低、训练显存更少。代码和模型已开源,门槛低。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
首次将LRU引入图像超分,提出SMU实现输入依赖调制,思路新颖。但RG-LRU和字典注意力已有相关工作。
实验合理度: ★★★★☆
对比方法覆盖全面,消融周到。但缺少与更大型模型(如HAT-L)对比。
学术研究价值: ★★★★★
开创"静态LRU+轻量调制"做视觉任务的新范式,启发性强。
稳定性: ★★★☆☆
结果稳定,但特征值初始化敏感度较高,需认真调参。
适应性以及泛化能力: ★★★★☆
跨越多个缩放因子和数据集,泛化不错。但仅测试SR任务。
硬件需求及成本: ★★★★★
LRU线性复杂度使训练显存和推理FLOPs低于同级Transformer和Mamba,对移动端友好。
复现难度: ★★★★★
官方代码已开源,环境配置清晰,复现顺畅。
产品化成熟度: ★★★☆☆
可通过ONNX导出轻量版,但缺少多平台部署测试和低比特量化实验。
可能的问题: 字典容量P和LRU状态尺寸选取缺乏自动化方案。复数输出调制贡献不如输入调制显著。缺少与更大算力下模型直接对比。
主要参考文献
[40] Orvieto A, et al. Resurrecting recurrent neural networks for long sequences. ICML, 2023.
[13] De et al. Gated Linear Recurrent Units (Griffin). arXiv, 2024.
[21] Guo H, et al. MambaIR. ECCV, 2024.
[22] Guo H, et al. MambaIRv2. arXiv, 2024.
[31] Liang J, et al. SwinIR. ICCV, 2021.
[7] Chen X, et al. HAT. CVPR, 2023.
[54] Zheng Y, et al. ATD. ECCV, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨。想了解更多原文细节,可点击 "阅读原文" 。
想跟上每日AI领域的本质变化,欢迎加入龙哥读论文粉丝群,
扫描下方二维码或添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 。