← 返回 PaperDaily 视觉与图像

光场去噪新范式!印度理工用LSH稀疏注意力,参数更少、性能反超SOTA

光场去噪一直是个难题:数据大、维度高、噪声还独立于视图。印度理工学院这次用LSH稀疏注意力,把整个4D光场直接当作一个整体来做全局交互,不仅性能全面超越SOTA,参数量和推理速度还更优。在图像去噪领域,这种“大一统”的思路相当值得关注。

光场去噪新范式!印度理工用LSH稀疏注意力,参数更少、性能反超SOTA
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
光场去噪一直是个难题:数据大、维度高、噪声还独立于视图。印度理工学院这次用LSH稀疏注意力,把整个4D光场直接当作一个整体来做全局交互,不仅性能全面超越SOTA,参数量和推理速度还更优。在图像去噪领域,这种“大一统”的思路相当值得关注。


原论文信息如下:
论文标题:
VSANet: View-aware Sparse Attention Network for Light Field Image Denoising
发表日期:
2026年06月
发表单位:
印度理工学院(Indian Institute of Technology)
原文链接:
https://arxiv.org/pdf/2606.24737v1.pdf

光场去噪的痛点:高维数据的“视图鸿沟”

光场(Light Field, LF)相机一次拍摄就能记录下场景中所有方向的光线,得到一堆子孔径图像(Sub-Aperture Images, SAIs),构成一个 S×T×H×W×3 的 4D 数据立方体。这个“富矿”能支持深度估计、重对焦、视角合成等超炫酷的应用,但前提是——图像得干净。
低光照、高帧率拍摄时,光子噪声就像无处不在的静电,让每个子视图都蒙上一层“雪花”。更坑的是,噪声在视图之间是独立的,而场景内容却有着极强的跨视图相关性——这就造成了严重的“视图鸿沟”:你明明知道其他视图里有干净线索,却不知道怎么把它们聚到一起。
传统方法像 LFBM5D,通过对相邻视图的相似块做协同滤波,手工设计很强,但碰到复杂光场结构就歇菜了。后来的深度学习方法(DRLF、MSP、PFE、HLFRN 等)往网络里塞了空间-角度正则化或对极几何引导,可惜它们大多把 4D 光场拆成孤立的 2D 子空间,比如只在空间维度或角度维度做注意力,无法真正打通所有空间-角度位置的交互。换句话说,花里胡哨的操作不少,但全局视图的“鸿沟”仍然没填平。

VSANet核心揭秘:全局稀疏注意力的魔力

印度理工学院的研究团队这次拿出的 VSANet,思路非常“简单粗暴”:别把 4D 光场切成小块了,直接当成一个巨大的 token 序列,让所有视图所有像素任意交互。 但这会导致 O(N²) 的复杂度,N = S·T·H·W,对于典型的 5×5×532×364×3 的光场,N 将近 1 亿,全注意力的计算量谁也扛不住。
于是他们祭出了局部敏感哈希(Locality-Sensitive Hashing, LSH)稀疏注意力——这个在 Reformer 中被证明有效的技术,在本场景下刚好对症:噪声独立、内容相关,让相似的 token“撞”到同一个哈希桶里,然后在桶内做注意力,复杂度降到线性。
图1:提出的VSANet整体架构。给定噪声光场图像 L_n,VSANet生成去噪图像 L_d
图1:提出的VSANet整体架构。给定噪声光场图像 Ln,VSANet生成去噪图像 Ld
网络由 G=5 个 SEAR(Sequential Extraction Attention Refinement)模块堆叠而成,每个 SEAR 里包含三个串行阶段:

第一阶段:SFE(Sequential Feature Extraction)由 F=5 个残差特征提取块组成。每个块有两条并行分支——空间-角度分支在空间子空间(SS)和角度子空间(AS)上操作,对极分支在水平对极子空间(EHS)和垂直对极子空间(EVS)上操作。这样一块就把空间、角度、对极几何三种相关性都捞到了。

第二阶段:VSA(View-Aware Sparse Attention)核心创意就在这里。首先将 4D 特征图通过两个平行卷积生成 Query(Q)、Key(K)和 Value(V),然后统一 reshape 成 token 序列,长度 N=S·T·H·W。为了高效,使用 LSH 将相似 token 分组到哈希桶中。这里分多轮(nh=6 轮)独立哈希,每轮都打一个随机旋转矩阵,然后根据桶索引排序、分块(chunk size s=64),在局部窗口内做缩放点积注意力。最后用置信度加权聚合将多轮结果融合——注意力得分更集中的那轮贡献更大。

公式(1):第 k 轮哈希中 token i 的桶索引分配
公式(1):第 k 轮哈希中 token i 的桶索引分配。R(k) 是随机旋转矩阵,qi 是查询 token,将特征与其取反拼接后取最大值所在的桶。
公式(2):局部窗口内的缩放点积注意力
公式(2):局部窗口内的缩放点积注意力。k̂ 是归一化的 key token。
公式(3):多轮哈希输出的置信度加权融合
公式(3):多轮哈希输出的置信度加权融合。logZ(k) 是 log-sum-exp 归一化项,作为第 k 轮哈希的置信度。

第三阶段:FR(Feature Refinement)在 VSA 之后,使用卷积块注意力模块(Convolutional Block Attention Module, CBAM,来自文献[22])分别在 SS、AS、EHS 和 EVS 四个子空间上做通道注意力和空间注意力,进一步提升判别性特征。最后拼接融合,送入下一个 SEAR 模块。

整个流程走完——浅层卷积提取局部特征,5 个 SEAR 模块依次全局交互+局部精炼,最后输出残差加回原图,得到干净的光场。龙哥看完忍不住想拍大腿:这才是真正“大一统”的光场去噪框架啊!

实验对决:全面超越SOTA的“双冠王”

VSANet 在两个主流数据集上踢馆:STFLytro 数据集(70 对训练+30 对测试)和EPFL 数据集(10 对测试,零微调测泛化能力)。噪声为独立同分布高斯白噪声(AWGN),强度 σ=10,20,50。对比方法包括传统方法 LFBM5D 和四个最新深度方法:DRLF、MSP、PFE、HLFRN。
表1:与SOTA方法的性能对比。报告了PSNR和SSIM的均值±标准差。红色标记最佳,蓝色标记第二佳。
表1:与SOTA方法的性能对比。报告了PSNR和SSIM的均值±标准差。红色标记最佳,蓝色标记第二佳。
从表1可以看到,VSANet 在所有 6 个设置(两个数据集×三个噪声强度)中都拿到了 PSNR 和 SSIM 的均值第一,标准差也普遍更低(意味着结果更稳定)。对比最强的 HLFRN,在 σ=50 的 EPFL 上 VSANet 的 PSNR 提升 0.07 dB 不多,但参数量只有 1142K(HLFRN 为 1676K),推理时间 10.79s(HLFRN 15.26s),效率明显更优。在 STFLytro 上 σ=10 时,PSNR 达 44.08 dB,比 HLFRN 的 43.66 dB 高出 0.42 dB,差距显著。
图2:与SOTA方法的视觉效果对比。上行:STFLytro数据集,下行:EPFL数据集。建议400%放大观看。
图2:与SOTA方法的视觉效果对比(中心视图)。上行:STFLytro数据集,下行:EPFL数据集。建议400%放大观看。
视觉效果上(图2),VSANet 在σ=50 的强噪声下依然能保留织物纹理、边缘细节,而其他方法要么残留噪声斑点,要么过度平滑导致细节丢失。这得益于全局稀疏注意力——即使空间上相隔很远,但视角不同的相似像素仍能在同一哈希桶中被聚合,实现真正的“跨视图互补”。

消融研究:模块解构与高效验证

为了证明每个设计都是必要的,团队做了 10 组消融实验(在 σ=50 下对比),结果汇总在表2。我们挑几个关键的看:
表2:消融实验结果对比。红色标记最佳,蓝色标记第二佳。
表2:消融实验结果对比。红色标记最佳,蓝色标记第二佳。

AE1(去掉VSA块):PSNR 从 37.34 掉到 36.79,证明全局跨视图聚合非常关键。

AE2(VSA仅在单视图内做稀疏注意力):性能降到 37.11,说明跨视图交互才是精髓。

AE3(仅做一轮哈希):PSNR 37.27,说明多轮置信度加权融合确实更稳。

AE6(FE块只提取空间特征):性能掉到 36.82,证实对极子空间和多分支的必要性。

此外,将 SEAR 模块数 G 从 5 增加到 6(AE8)PSNR 只高 0.02 dB,但参数量涨到 1370K,时间增加到 12.55s,所以 G=5 是效率与精度最好的折中。
总的来说,消融实验有力地证明了每个模块都在贡献自己的价值,没有“尸位素餐”的组件。

总结与思考:改写光场复原的未来?

VSANet 提供了一个非常优雅的解决方案:用 LSH 稀疏注意力将整个 4D 光场纳入统一的 token 空间,实现线性复杂度的全局交互,再配合子空间特征精炼,在去噪任务上取得了全面领先。这种方法打破了以往“空间注意力和角度注意力分开做”的定式,让模型自己学会从哪个视图借信息来补全当前视图,虽然听起来玄学,但实验证明它确实 work。
未来方向论文也提了一嘴:把 VSA 框架拓展到其他光场复原任务,比如超分辨率、重对焦等。龙哥觉得,既然能把去噪做得这么好,超分和修复应该也不在话下。不过要留意的是,LSH 的随机性可能会导致偶尔的“坏桶”,影响恢复稳定性,或许需要在训练时引入正则化或增加哈希轮数来对冲。
不错不错

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

什么是局部敏感哈希(LSH)?为什么用在光场去噪?LSH 是一种近似最近邻搜索技术,通过随机旋转将高维向量映射到哈希桶中,相似向量更高概率落入同一桶。在 VSANet 中,LSH 将来自不同视图的相似像素特征(比如同一个物体在不同视角下的对应像素)快速分组,然后在桶内做注意力,避免了计算所有两两相似度。这正好利用“噪声独立但内容相关”的特性——干净的内容特征容易撞到同一桶,而噪声由于随机性会被分配到不同桶,从而在注意力聚合时互相削弱。

VSANet 与之前的光场 Transformer 方法(如文献[16-19])有什么本质区别?之前的 Transformer 方法通常把 4D 光场拆成空间注意力(只在空间维度做)和角度注意力(只在角度维度做),或者限制在极平面图像(EPI)上操作。这样无法让来自不同视图和不同空间位置的 token 直接交互。VSANet 通过统一 reshape 成一个 token 序列并用 LSH 分组,实现了真正的 4D 全局交互——任何一个像素都可以直接参考其他任何视图任何位置的像素,这是之前方法做不到的。

VSANet 在实际应用中有什么限制?目前测试的光场大小为 532×364(S=5,T=5),LSH 的哈希桶大小设为128,chunk size 64,这需要一定显存(A40上运行约10.8秒)。对于更高分辨率或更多视图的光场,token 数会激增,即便线性复杂度也可能变慢。另外,LSH 的随机性可能带来结果微小的波动,虽然多轮融合已经缓解,但在需要严格重现的场景下可能不够稳定。产品化还需要进一步优化和工程适配。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★✰

首次将4D光场作为统一token空间做全局稀疏注意力,LSH的引入巧妙解决了计算瓶颈,角度新、思路新。

实验合理度:★★★★★

在两个标准数据集上对比了多个SOTA(含最新HLFRN),消融实验全面(10组),指标和视觉效果都有,标准设置公平。

学术研究价值:★★★★★

为光场全局建模提供了新范式,潜在可迁移到超分、视图合成等其他任务,启发性强。

稳定性:★★★✰✰

多轮哈希融合提升了稳定性,但LSH随机性仍可能导致个别样本结果波动,未在极低光照等极端条件下测试。

适应性及泛化能力:★★★★✰

在未见数据集EPFL上零微调表现优秀,说明泛化能力不错,但仅测试了高斯噪声,实际传感器噪声有偏,有待验证。

硬件需求及成本:★★★★✰

参数量1.14M,推理10.79s(A40),相比HLFRN(15.26s)更快,但相比传统方法仍需要GPU,中等设备可跑。

复现难度:★★★★✰

方法描述较详细,LSH实现有开源参考(Reformer),但需要PyTorch和A40等,整体可复现性较高。

产品化成熟度:★★✰✰✰

目前仍是算法验证阶段,未针对实时性(10.8s/图)、内存占用、编译器优化等进行工程打磨,离手机或嵌入式部署距离较远。

可能的问题:消融实验略有不完整:未测试去掉FR块但保留VSA的单独效果(AE4是去掉整个FR,没法区分是VSA还是FR的贡献);另外所有实验固定噪声类型,对真实混合噪声的鲁棒性未知。


主要参考文献

[1] Alain, M., & Smolic, A. (2017). Light field denoising by sparse 5D transform domain collaborative filtering. MMSP.
[2] Guo, M., Hou, J., Jin, J., Chen, J., & Chau, L.-P. (2022). Deep spatial-angular regularization for light field imaging, denoising, and super-resolution. TPAMI.
[3] Lyu, X., & Hou, J. (2024). Probabilistic-based feature embedding of 4-D light fields for compressive imaging and denoising. IJCV.
[4] Van Duong, V., Huu, T. N., Yim, J., & Jeon, B. (2025). Hybrid spatial and frequency network for light field image restoration. TCI.
[5] Kitaev, N., Kaiser, L., & Levskaya, A. (2020). Reformer: The efficient transformer. ICLR.
[6] Woo, S., Park, J., Lee, J.-Y., & Kweon, I. S. (2018). CBAM: Convolutional block attention module. ECCV.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
VSANet用全局稀疏注意力打通了4D光场,去噪效果拉满,参数还更少!想第一时间获取这种前沿论文解读和高效思路?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。图像处理、大模型、自动驾驶等5大群等你来撩,一起高效学习不掉队!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。