← 返回 PaperDaily
视觉与图像
斜率引导Mamba来了!光场超分提升0.42dB
这篇论文最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让Mamba别顺着方格子乱跑。
龙哥读论文
发布于 2026-08-14 09:11:02
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 这篇论文最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让Mamba别顺着方格子乱跑。
原论文信息如下:
SMART如何破解光场超分辨率难题?
光场超分辨率这件事,表面上是“把图放大”,本质上却是“别把4D几何关系放炸”。普通单图超分只盯着像素清晰不清晰,光场超分还得同时照顾空间细节 、角度一致性 和极线结构 。一旦处理不好,结果就很容易出现“这张图看着清楚,但换个视角立刻穿帮”的尴尬。
这篇论文提出的 SMART ,全名是 Slope-Guided Mamba and Angular-Refined Transformer ,中文可以理解为“斜率引导的 Mamba 与角度精炼 Transformer ”。它的思路很直接:既然光场里最值钱的是几何一致性,那就别让模型一边学纹理、一边乱猜结构,而是把几何先拎出来,再让 Transformer 负责补细节,让 Mamba 负责沿着正确的几何路径去扫。
龙哥导读:这篇工作最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让 Mamba 别顺着方格子乱跑。
揭秘核心:斜率引导Mamba与角度精炼Transformer
先把问题说人话:光场图像不是一张图,而是一组从不同角度看到的图。真正难的不是“放大”,而是“放大后每个视角还得对得上”。如果只做空间超分,角度之间会散;如果只做角度建模,纹理又可能糊。SMART 的做法就是把这两条线同时抓住:Mamba 负责高效序列建模,Transformer 负责细节修复,但两者都不再“盲扫”,而是被光场几何牵着走。
这篇论文里有两个关键缩写,得先说清楚。MAT 是 Manifold-Aligned Trajectory module ,中文是“流形对齐轨迹模块 ”;AMS 是 Angular-Modulated Spatial module ,中文是“角度调制空间模块 ”。前者解决“沿哪条路扫”,后者解决“扫的时候别忘了角度信息”。
从整体流程看,SMART 先用卷积提浅层特征,再把特征送进多个结构-细节块。每个块里,MAT 先沿极线结构做几何一致的序列建模,AMS 再把角度先验塞进空间注意力里,最后经重建头上采样输出高分辨率光场。这个顺序不是随便排的:先把几何骨架扶正,再补纹理和细节,才不容易“修着修着把房子修歪了”。
流形对齐轨迹模块:如何实现几何一致的扫描?
传统 Mamba 的强项是高效序列建模,弱点也很明显:它默认序列怎么排都行,但光场里的 EPI(Epipolar Plane Image,极平面图像)并不是规规矩矩的网格,而是会随着视差形成斜线。也就是说,模型如果按固定栅格扫过去,扫到的可能不是同一条几何轨迹上的点,而是“邻得很近、其实没啥关系”的像素。这个问题,论文直接称为扫描-几何错配 。
MAT 的核心思路,是先估计 EPI 的局部斜率,再拿这个斜率去指导扫描轨迹。论文里把视差假设集合记作 K,通过沿候选斜率采样并计算一致性代价,选出最合适的斜率 S。这个 S 不是为了“看起来高级”,而是为了告诉后续扫描:真正该连在一起的像素,是沿着同一条极线走的那些点 。
论文中的流程可以概括成下面这段“伪代码味道”的逻辑:
输入:浅层特征 F
1. 将特征重排为水平/垂直 EPI 序列
2. 在候选斜率集合 K 中估计局部最优斜率 S
3. 用 S 生成坐标偏移与重排序索引
4. 沿斜率方向重采样特征,得到对齐后的序列
5. 使用共享的 selective scan 进行双向序列建模
6. 融合水平与垂直分支输出,得到 MAT 结果
这里最妙的一点,是它没有把 Mamba 当成“万能扫地机”,而是把扫描轨迹变成可由几何先验控制的路径。这样一来,状态更新不再沿着无关背景乱串,而是更集中地聚合同一物点跨视角的对应信息。说白了,别让模型在错误的路上跑得太快,跑得快只会更离谱。
角度调制空间模块:如何加强空间-角度协同?
如果说 MAT 负责“沿着对的路走”,那 AMS 就负责“别只盯着路面,还要看路标”。很多光场方法喜欢把空间和角度分开建模,最后再拼起来。问题是,拼接不等于理解,尤其在遮挡区、纹理稀少区,单看空间纹理很容易看走眼。AMS 的做法,是把角度先验直接灌进空间注意力里,让模型在算相关性时就知道“这个位置在不同视角下应该长什么样”。
具体来说,AMS 先把特征重排成空间序列,用深度可分离卷积生成 Query、Key 和 Value,再计算空间注意力。但论文没有停在这里,而是额外引入一个角度分支:把特征重排为宏像素(macropixel)形式,在角度维度上提取模式,再生成一个可广播的注意力偏置 Aprior 。这个先验再与空间注意力融合,相当于给注意力地图加了一层“几何约束滤镜”。
这个模块的价值很实在:它不是单纯提升纹理相似度,而是让注意力更容易在跨视角一致的位置上聚焦。尤其是在深度变化明显、局部纹理又不丰富的区域,单纯依赖空间注意力很容易“看错人”,而角度先验相当于多给了一个判断依据。换句话说,AMS 让 Transformer 从“只看眼前像不像”升级成“还知道不同视角该怎么对齐”。
实验结果:SOTA在望,性能与效率双赢
实验部分先说结论:SMART 不是那种“参数堆上去,分数勉强涨一点”的老套路,而是在五个基准数据集上都拿到了更好的结果,平均 33.040 dB / 0.9478 ,相较此前最强方法 L2Fmamba 还有 0.417 dB 的提升。对图像超分来说,这个数值不算夸张到离谱,但足够说明方法不是“碰巧赢一把”,而是确实抓到了问题核心。
更值得注意的是,SMART 的参数量并不算大,约 1.98M 。这意味着它不是靠“堆出一个巨无霸模型”硬吃结果,而是在结构设计上把计算花在了更值钱的地方。对于实际部署来说,这种“分数涨了,体量还没失控”的方法,才更像能落地的样子。
定性结果也挺有说服力。图3里,SMART 在真实场景下对文字边缘、细条纹和细小结构的恢复更干净,常见的模糊、拉丝、几何扭曲都少了不少。这个现象和前面的设计是对得上的:MAT 先把极线结构对齐,AMS 再补空间-角度协同,所以模型不容易在高频区域“修过头”或者“修歪”。
消融实验进一步证明,这不是“玄学叠模块”。表2显示,基础空间特征提取已经能带来明显收益,而加入角度先验后又能继续抬升表现;最后叠加 MAT 的斜率引导扫描,平均 PSNR 还能再往上走一截。也就是说,这几个模块不是互相抢功,而是顺着同一个目标往前推:先补空间,再补角度,再把扫描轨迹对齐几何。
图4 和表4 还专门验证了“扫描方式”这件看起来不起眼、其实很要命的事。固定前向或后向扫描都只能做到一般水平,而把斜率引导扫描加入后,指标明显更稳。这个结论很朴素:在光场里,扫对路比扫得快更重要 。
总结与展望:迈向更精准的光场重建
SMART 的价值,不只是把分数抬高了 0.4 dB 左右,而是把光场超分里两个长期被忽略的现实问题说透了:空间和角度不能只做表面拼接,序列扫描也不能无视几何 。前者决定细节能不能补对,后者决定信息会不会在建模过程中被扫散。
从工程角度看,这类方法的思路很值得借鉴:不是盲目追求更大 backbone,而是先找出任务中的“物理结构”和“建模错配”,再针对性修补。光场超分、显式深度恢复、甚至一些多视角重建任务,后面都可能继续沿着这个方向演化——让序列模型不再只是会算,而是会顺着真实世界的结构算 。
龙迷三问
这篇论文到底解决什么问题? 它解决的是光场超分里最关键的两个痛点:一是空间和角度信息经常各做各的,二是 Mamba 的扫描方式和 EPI 的斜线几何不匹配。SMART 就是用 MAT 和 AMS 把这两个洞补上。
MAT 和 AMS 分别是干什么的? MAT 负责估计 EPI 斜率并沿几何一致的轨迹扫描,让序列建模更贴近真实视差结构;AMS 负责把角度先验加入空间注意力,让模型在恢复纹理时不丢掉跨视角一致性。
为什么它比普通的 Transformer 或 Mamba 更适合光场? 因为它不是把通用模块直接搬来用,而是给这两个模块都加了光场专属约束:Transformer 不再只看纹理相似,Mamba 不再只按固定网格扫。一个管“看得准”,一个管“走得对”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 亮点不在“堆新模块”,而在把几何先验真正塞进了 Mamba 的扫描路径里,这个切口比较准。
实验合理度: ★★★★☆ 五个数据集、完整消融、扫描策略对比都给了,逻辑闭环比较完整,结果也和设计能对上。
学术研究价值: ★★★★☆ 对光场这种强几何约束任务很有启发,尤其说明了“通用序列模型”必须和任务结构结合才更有用。
稳定性: ★★★☆☆ 结果看起来稳,但本质上仍依赖斜率估计和场景几何质量,复杂遮挡下的鲁棒性还有继续验证空间。
适应性以及泛化能力: ★★★☆☆ 对光场超分很对口,但对其他任务是否同样好用,还得看是否存在类似的可对齐几何结构。
硬件需求及成本: ★★★☆☆ 参数量不大,但 MAT 的几何估计和多块交互仍有一定计算开销,不算轻到随手上端侧。
复现难度: ★★★☆☆ 思路清楚,但涉及 EPI 重排、斜率估计和双向扫描,复现时细节一多就容易出偏差。
产品化成熟度: ★★★☆☆ 适合做高质量离线重建或科研原型,若要进实时系统,还要继续压缩时延和验证复杂场景稳定性。
可能的问题: 方法抓住了几何错配这个痛点,但对斜率估计误差、极端遮挡和跨数据集泛化的讨论还可以更充分。
主要参考文献
[1] Shunzhou Wang, Tianfei Zhou, Yao Lu, and Huijun Di, “Detail-preserving transformer for light field image super-resolution,” AAAI, 2022.
[2] Zhengyu Liang et al., “Learning non-local spatial-angular correlation for light field image super-resolution,” ICCV, 2023.
[6] Yue Liu et al., “Vmamba: Visual state space model,” arXiv:2401.10166, 2024.
[7] Ruisheng Gao, Zeyu Xiao, and Zhiwei Xiong, “Mamba-based light field super-resolution with efficient subspace scanning,” ACCV, 2024.
[8] Yao Lu et al., “Lfmamba: Light field image super-resolution with state space model,” arXiv:2406.12463, 2024.
[9] Zeqiang Wei et al., “L2 fmamba: Lightweight light field image super-resolution with state space model,” IEEE TCI, 2025.
原文链接:https://arxiv.org/pdf/2607.00965v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!