← 返回 PaperDaily 视觉与图像

斜率引导Mamba来了!光场超分提升0.42dB

这篇论文最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让Mamba别顺着方格子乱跑。

斜率引导Mamba来了!光场超分提升0.42dB
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让Mamba别顺着方格子乱跑。


原论文信息如下:
论文标题:
Slope-Guided Mamba and Angular-Refined Transformer for Light Field Super-Resolution
发表日期:
2026年07月
发表单位:
Hangzhou International Innovation Institute, Beihang University
原文链接:
https://arxiv.org/pdf/2607.00965v1.pdf

SMART如何破解光场超分辨率难题?

光场超分辨率这件事,表面上是“把图放大”,本质上却是“别把4D几何关系放炸”。普通单图超分只盯着像素清晰不清晰,光场超分还得同时照顾空间细节角度一致性极线结构。一旦处理不好,结果就很容易出现“这张图看着清楚,但换个视角立刻穿帮”的尴尬。
这篇论文提出的 SMART,全名是 Slope-Guided Mamba and Angular-Refined Transformer,中文可以理解为“斜率引导的 Mamba 与角度精炼 Transformer”。它的思路很直接:既然光场里最值钱的是几何一致性,那就别让模型一边学纹理、一边乱猜结构,而是把几何先拎出来,再让 Transformer 负责补细节,让 Mamba 负责沿着正确的几何路径去扫。
封面
图1:几何结构与传统 Mamba 扫描方式的错位,以及 SMART 在精度和模型规模上的整体表现对比。
龙哥导读:这篇工作最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让 Mamba 别顺着方格子乱跑。

揭秘核心:斜率引导Mamba与角度精炼Transformer

先把问题说人话:光场图像不是一张图,而是一组从不同角度看到的图。真正难的不是“放大”,而是“放大后每个视角还得对得上”。如果只做空间超分,角度之间会散;如果只做角度建模,纹理又可能糊。SMART 的做法就是把这两条线同时抓住:Mamba 负责高效序列建模,Transformer 负责细节修复,但两者都不再“盲扫”,而是被光场几何牵着走。
图2
图2:SMART 总体框架。网络由特征提取、深层交互和重建三个阶段组成,交互阶段堆叠多个结构-细节块,每个块都包含 MAT 和 AMS 两个核心模块。
这篇论文里有两个关键缩写,得先说清楚。MATManifold-Aligned Trajectory module,中文是“流形对齐轨迹模块”;AMSAngular-Modulated Spatial module,中文是“角度调制空间模块”。前者解决“沿哪条路扫”,后者解决“扫的时候别忘了角度信息”。
从整体流程看,SMART 先用卷积提浅层特征,再把特征送进多个结构-细节块。每个块里,MAT 先沿极线结构做几何一致的序列建模,AMS 再把角度先验塞进空间注意力里,最后经重建头上采样输出高分辨率光场。这个顺序不是随便排的:先把几何骨架扶正,再补纹理和细节,才不容易“修着修着把房子修歪了”。

流形对齐轨迹模块:如何实现几何一致的扫描?

传统 Mamba 的强项是高效序列建模,弱点也很明显:它默认序列怎么排都行,但光场里的 EPI(Epipolar Plane Image,极平面图像)并不是规规矩矩的网格,而是会随着视差形成斜线。也就是说,模型如果按固定栅格扫过去,扫到的可能不是同一条几何轨迹上的点,而是“邻得很近、其实没啥关系”的像素。这个问题,论文直接称为扫描-几何错配
MAT 的核心思路,是先估计 EPI 的局部斜率,再拿这个斜率去指导扫描轨迹。论文里把视差假设集合记作 K,通过沿候选斜率采样并计算一致性代价,选出最合适的斜率 S。这个 S 不是为了“看起来高级”,而是为了告诉后续扫描:真正该连在一起的像素,是沿着同一条极线走的那些点
论文中的流程可以概括成下面这段“伪代码味道”的逻辑:
    输入:浅层特征 F
    1. 将特征重排为水平/垂直 EPI 序列
    2. 在候选斜率集合 K 中估计局部最优斜率 S
    3. 用 S 生成坐标偏移与重排序索引
    4. 沿斜率方向重采样特征,得到对齐后的序列
    5. 使用共享的 selective scan 进行双向序列建模
    6. 融合水平与垂直分支输出,得到 MAT 结果
    这里最妙的一点,是它没有把 Mamba 当成“万能扫地机”,而是把扫描轨迹变成可由几何先验控制的路径。这样一来,状态更新不再沿着无关背景乱串,而是更集中地聚合同一物点跨视角的对应信息。说白了,别让模型在错误的路上跑得太快,跑得快只会更离谱。
    图4
    图4:不同剪切 EPI 上的 PSNR 分布。可以看到,SMART 在不同视差区域都更稳,说明斜率引导的扫描确实更贴合几何结构。

    角度调制空间模块:如何加强空间-角度协同?

    如果说 MAT 负责“沿着对的路走”,那 AMS 就负责“别只盯着路面,还要看路标”。很多光场方法喜欢把空间和角度分开建模,最后再拼起来。问题是,拼接不等于理解,尤其在遮挡区、纹理稀少区,单看空间纹理很容易看走眼。AMS 的做法,是把角度先验直接灌进空间注意力里,让模型在算相关性时就知道“这个位置在不同视角下应该长什么样”。
    具体来说,AMS 先把特征重排成空间序列,用深度可分离卷积生成 Query、Key 和 Value,再计算空间注意力。但论文没有停在这里,而是额外引入一个角度分支:把特征重排为宏像素(macropixel)形式,在角度维度上提取模式,再生成一个可广播的注意力偏置 Aprior。这个先验再与空间注意力融合,相当于给注意力地图加了一层“几何约束滤镜”。
    图1
    图1:传统 Mamba 扫描会把 EPI 的斜线结构切碎,而 SMART 的热图更集中地响应在几何一致的区域,说明它更会“顺着结构看问题”。
    这个模块的价值很实在:它不是单纯提升纹理相似度,而是让注意力更容易在跨视角一致的位置上聚焦。尤其是在深度变化明显、局部纹理又不丰富的区域,单纯依赖空间注意力很容易“看错人”,而角度先验相当于多给了一个判断依据。换句话说,AMS 让 Transformer 从“只看眼前像不像”升级成“还知道不同视角该怎么对齐”。

    实验结果:SOTA在望,性能与效率双赢

    实验部分先说结论:SMART 不是那种“参数堆上去,分数勉强涨一点”的老套路,而是在五个基准数据集上都拿到了更好的结果,平均 33.040 dB / 0.9478,相较此前最强方法 L2Fmamba 还有 0.417 dB 的提升。对图像超分来说,这个数值不算夸张到离谱,但足够说明方法不是“碰巧赢一把”,而是确实抓到了问题核心。
    表1
    表1:4倍放大下不同方法的定量对比。SMART 在五个数据集和平均指标上都排在前列,说明其提升不是单点偶然,而是整体一致的。
    更值得注意的是,SMART 的参数量并不算大,约 1.98M。这意味着它不是靠“堆出一个巨无霸模型”硬吃结果,而是在结构设计上把计算花在了更值钱的地方。对于实际部署来说,这种“分数涨了,体量还没失控”的方法,才更像能落地的样子。
    定性结果也挺有说服力。图3里,SMART 在真实场景下对文字边缘、细条纹和细小结构的恢复更干净,常见的模糊、拉丝、几何扭曲都少了不少。这个现象和前面的设计是对得上的:MAT 先把极线结构对齐,AMS 再补空间-角度协同,所以模型不容易在高频区域“修过头”或者“修歪”。
    图3
    图3:真实数据上的 4 倍超分可视化对比。红框区域的放大细节显示,SMART 对文字、边缘和纹理的恢复更接近真值。
    消融实验进一步证明,这不是“玄学叠模块”。表2显示,基础空间特征提取已经能带来明显收益,而加入角度先验后又能继续抬升表现;最后叠加 MAT 的斜率引导扫描,平均 PSNR 还能再往上走一截。也就是说,这几个模块不是互相抢功,而是顺着同一个目标往前推:先补空间,再补角度,再把扫描轨迹对齐几何。
    表2
    表2:核心组件消融实验。可以看到,AMS、角度先验和 MAT 叠加后,性能逐步提升,说明每个设计都在补同一类短板。
    表3
    表3:交互块数量的消融结果。块数从 3 增加到 5 时效果持续提升,但到 6 时收益开始饱和,说明作者在深度和效率之间做了比较稳的折中。
    图4 和表4 还专门验证了“扫描方式”这件看起来不起眼、其实很要命的事。固定前向或后向扫描都只能做到一般水平,而把斜率引导扫描加入后,指标明显更稳。这个结论很朴素:在光场里,扫对路比扫得快更重要
    表4
    表4:不同扫描策略的对比。斜率引导扫描明显优于固定方向扫描,说明几何先验对 Mamba 的帮助不是装饰性的。

    总结与展望:迈向更精准的光场重建

    SMART 的价值,不只是把分数抬高了 0.4 dB 左右,而是把光场超分里两个长期被忽略的现实问题说透了:空间和角度不能只做表面拼接,序列扫描也不能无视几何。前者决定细节能不能补对,后者决定信息会不会在建模过程中被扫散。
    从工程角度看,这类方法的思路很值得借鉴:不是盲目追求更大 backbone,而是先找出任务中的“物理结构”和“建模错配”,再针对性修补。光场超分、显式深度恢复、甚至一些多视角重建任务,后面都可能继续沿着这个方向演化——让序列模型不再只是会算,而是会顺着真实世界的结构算

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决什么问题?它解决的是光场超分里最关键的两个痛点:一是空间和角度信息经常各做各的,二是 Mamba 的扫描方式和 EPI 的斜线几何不匹配。SMART 就是用 MAT 和 AMS 把这两个洞补上。

    MAT 和 AMS 分别是干什么的?MAT 负责估计 EPI 斜率并沿几何一致的轨迹扫描,让序列建模更贴近真实视差结构;AMS 负责把角度先验加入空间注意力,让模型在恢复纹理时不丢掉跨视角一致性。

    为什么它比普通的 Transformer 或 Mamba 更适合光场?因为它不是把通用模块直接搬来用,而是给这两个模块都加了光场专属约束:Transformer 不再只看纹理相似,Mamba 不再只按固定网格扫。一个管“看得准”,一个管“走得对”。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆ 亮点不在“堆新模块”,而在把几何先验真正塞进了 Mamba 的扫描路径里,这个切口比较准。

    实验合理度:★★★★☆ 五个数据集、完整消融、扫描策略对比都给了,逻辑闭环比较完整,结果也和设计能对上。

    学术研究价值:★★★★☆ 对光场这种强几何约束任务很有启发,尤其说明了“通用序列模型”必须和任务结构结合才更有用。

    稳定性:★★★☆☆ 结果看起来稳,但本质上仍依赖斜率估计和场景几何质量,复杂遮挡下的鲁棒性还有继续验证空间。

    适应性以及泛化能力:★★★☆☆ 对光场超分很对口,但对其他任务是否同样好用,还得看是否存在类似的可对齐几何结构。

    硬件需求及成本:★★★☆☆ 参数量不大,但 MAT 的几何估计和多块交互仍有一定计算开销,不算轻到随手上端侧。

    复现难度:★★★☆☆ 思路清楚,但涉及 EPI 重排、斜率估计和双向扫描,复现时细节一多就容易出偏差。

    产品化成熟度:★★★☆☆ 适合做高质量离线重建或科研原型,若要进实时系统,还要继续压缩时延和验证复杂场景稳定性。

    可能的问题:方法抓住了几何错配这个痛点,但对斜率估计误差、极端遮挡和跨数据集泛化的讨论还可以更充分。


    主要参考文献

    [1] Shunzhou Wang, Tianfei Zhou, Yao Lu, and Huijun Di, “Detail-preserving transformer for light field image super-resolution,” AAAI, 2022.
    [2] Zhengyu Liang et al., “Learning non-local spatial-angular correlation for light field image super-resolution,” ICCV, 2023.
    [6] Yue Liu et al., “Vmamba: Visual state space model,” arXiv:2401.10166, 2024.
    [7] Ruisheng Gao, Zeyu Xiao, and Zhiwei Xiong, “Mamba-based light field super-resolution with efficient subspace scanning,” ACCV, 2024.
    [8] Yao Lu et al., “Lfmamba: Light field image super-resolution with state space model,” arXiv:2406.12463, 2024.
    [9] Zeqiang Wei et al., “L2 fmamba: Lightweight light field image super-resolution with state space model,” IEEE TCI, 2025.
    原文链接:https://arxiv.org/pdf/2607.00965v1.pdf

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    end
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
    『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
    光场超分这类“看起来只是放大,实际上要顾住几何”的活儿,最适合进群细聊:方法怎么对齐、实验怎么读、落地怎么踩坑,群里都能掰开讲明白。🌟
    wechat_helperdianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。