← 返回 PaperDaily
视觉与图像
光场去噪新范式!印度理工用LSH稀疏注意力,参数更少、性能反超SOTA
光场去噪一直是个难题:数据大、维度高、噪声还独立于视图。印度理工学院这次用LSH稀疏注意力,把整个4D光场直接当作一个整体来做全局交互,不仅性能全面超越SOTA,参数量和推理速度还更优。在图像去噪领域,这种“大一统”的思路相当值得关注。
龙哥读论文
发布于 2026-08-14 21:47:10
阅读 2
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 光场去噪一直是个难题:数据大、维度高、噪声还独立于视图。印度理工学院这次用LSH稀疏注意力,把整个4D光场直接当作一个整体来做全局交互,不仅性能全面超越SOTA,参数量和推理速度还更优。在图像去噪领域,这种“大一统”的思路相当值得关注。
原论文信息如下:
光场去噪的痛点:高维数据的“视图鸿沟”
光场(Light Field, LF)相机一次拍摄就能记录下场景中所有方向的光线,得到一堆子孔径图像(Sub-Aperture Images, SAIs),构成一个 S×T×H×W×3 的 4D 数据立方体。这个“富矿”能支持深度估计、重对焦、视角合成等超炫酷的应用,但前提是——图像得干净。
低光照、高帧率拍摄时,光子噪声就像无处不在的静电,让每个子视图都蒙上一层“雪花”。更坑的是,噪声在视图之间是独立的 ,而场景内容却有着极强的跨视图相关性——这就造成了严重的“视图鸿沟”:你明明知道其他视图里有干净线索,却不知道怎么把它们聚到一起。
传统方法像 LFBM5D,通过对相邻视图的相似块做协同滤波,手工设计很强,但碰到复杂光场结构就歇菜了。后来的深度学习方法(DRLF、MSP、PFE、HLFRN 等)往网络里塞了空间-角度正则化或对极几何引导,可惜它们大多把 4D 光场拆成孤立的 2D 子空间,比如只在空间维度或角度维度做注意力,无法真正打通所有空间-角度位置的交互 。换句话说,花里胡哨的操作不少,但全局视图的“鸿沟”仍然没填平。
VSANet核心揭秘:全局稀疏注意力的魔力
印度理工学院的研究团队这次拿出的 VSANet,思路非常“简单粗暴”:别把 4D 光场切成小块了,直接当成一个巨大的 token 序列,让所有视图所有像素任意交互。 但这会导致 O(N²) 的复杂度,N = S·T·H·W,对于典型的 5×5×532×364×3 的光场,N 将近 1 亿,全注意力的计算量谁也扛不住。
于是他们祭出了局部敏感哈希(Locality-Sensitive Hashing, LSH) 稀疏注意力——这个在 Reformer 中被证明有效的技术,在本场景下刚好对症:噪声独立、内容相关,让相似的 token“撞”到同一个哈希桶里,然后在桶内做注意力,复杂度降到线性。
网络由 G=5 个 SEAR(Sequential Extraction Attention Refinement)模块 堆叠而成,每个 SEAR 里包含三个串行阶段:
第一阶段:SFE(Sequential Feature Extraction) 由 F=5 个残差特征提取块组成。每个块有两条并行分支——空间-角度分支在空间子空间(SS)和角度子空间(AS)上操作,对极分支在水平对极子空间(EHS)和垂直对极子空间(EVS)上操作。这样一块就把空间、角度、对极几何三种相关性都捞到了。
第二阶段:VSA(View-Aware Sparse Attention) 核心创意就在这里。首先将 4D 特征图通过两个平行卷积生成 Query(Q)、Key(K)和 Value(V),然后统一 reshape 成 token 序列,长度 N=S·T·H·W。为了高效,使用 LSH 将相似 token 分组到哈希桶中。这里分多轮(nh=6 轮)独立哈希,每轮都打一个随机旋转矩阵,然后根据桶索引排序、分块(chunk size s=64),在局部窗口内做缩放点积注意力。最后用置信度加权聚合 将多轮结果融合——注意力得分更集中的那轮贡献更大。
第三阶段:FR(Feature Refinement) 在 VSA 之后,使用卷积块注意力模块(Convolutional Block Attention Module, CBAM,来自文献[22])分别在 SS、AS、EHS 和 EVS 四个子空间上做通道注意力和空间注意力,进一步提升判别性特征。最后拼接融合,送入下一个 SEAR 模块。
整个流程走完——浅层卷积提取局部特征,5 个 SEAR 模块依次全局交互+局部精炼,最后输出残差加回原图,得到干净的光场。龙哥看完忍不住想拍大腿:这才是真正“大一统”的光场去噪框架啊!
实验对决:全面超越SOTA的“双冠王”
VSANet 在两个主流数据集上踢馆:STFLytro 数据集 (70 对训练+30 对测试)和EPFL 数据集 (10 对测试,零微调测泛化能力)。噪声为独立同分布高斯白噪声(AWGN),强度 σ=10,20,50。对比方法包括传统方法 LFBM5D 和四个最新深度方法:DRLF、MSP、PFE、HLFRN。
从表1可以看到,VSANet 在所有 6 个设置(两个数据集×三个噪声强度)中都拿到了 PSNR 和 SSIM 的均值第一 ,标准差也普遍更低(意味着结果更稳定)。对比最强的 HLFRN,在 σ=50 的 EPFL 上 VSANet 的 PSNR 提升 0.07 dB 不多,但参数量只有 1142K(HLFRN 为 1676K),推理时间 10.79s(HLFRN 15.26s),效率明显更优 。在 STFLytro 上 σ=10 时,PSNR 达 44.08 dB,比 HLFRN 的 43.66 dB 高出 0.42 dB,差距显著。
视觉效果上(图2),VSANet 在σ=50 的强噪声下依然能保留织物纹理、边缘细节,而其他方法要么残留噪声斑点,要么过度平滑导致细节丢失。这得益于全局稀疏注意力——即使空间上相隔很远,但视角不同的相似像素仍能在同一哈希桶中被聚合,实现真正的“跨视图互补”。
消融研究:模块解构与高效验证
为了证明每个设计都是必要的,团队做了 10 组消融实验(在 σ=50 下对比),结果汇总在表2。我们挑几个关键的看:
AE1(去掉VSA块) :PSNR 从 37.34 掉到 36.79,证明全局跨视图聚合非常关键。
AE2(VSA仅在单视图内做稀疏注意力) :性能降到 37.11,说明跨视图交互才是精髓。
AE3(仅做一轮哈希) :PSNR 37.27,说明多轮置信度加权融合确实更稳。
AE6(FE块只提取空间特征) :性能掉到 36.82,证实对极子空间和多分支的必要性。
此外,将 SEAR 模块数 G 从 5 增加到 6(AE8)PSNR 只高 0.02 dB,但参数量涨到 1370K,时间增加到 12.55s,所以 G=5 是效率与精度最好的折中。
总的来说,消融实验有力地证明了每个模块都在贡献自己的价值,没有“尸位素餐”的组件。
总结与思考:改写光场复原的未来?
VSANet 提供了一个非常优雅的解决方案:用 LSH 稀疏注意力将整个 4D 光场纳入统一的 token 空间,实现线性复杂度的全局交互,再配合子空间特征精炼,在去噪任务上取得了全面领先。这种方法打破了以往“空间注意力和角度注意力分开做”的定式,让模型自己学会从哪个视图借信息来补全当前视图 ,虽然听起来玄学,但实验证明它确实 work。
未来方向论文也提了一嘴:把 VSA 框架拓展到其他光场复原任务,比如超分辨率、重对焦等。龙哥觉得,既然能把去噪做得这么好,超分和修复应该也不在话下。不过要留意的是,LSH 的随机性可能会导致偶尔的“坏桶”,影响恢复稳定性,或许需要在训练时引入正则化或增加哈希轮数来对冲。
龙迷三问
什么是局部敏感哈希(LSH)?为什么用在光场去噪? LSH 是一种近似最近邻搜索技术,通过随机旋转将高维向量映射到哈希桶中,相似向量更高概率落入同一桶。在 VSANet 中,LSH 将来自不同视图的相似像素特征(比如同一个物体在不同视角下的对应像素)快速分组,然后在桶内做注意力,避免了计算所有两两相似度。这正好利用“噪声独立但内容相关”的特性——干净的内容特征容易撞到同一桶,而噪声由于随机性会被分配到不同桶,从而在注意力聚合时互相削弱。
VSANet 与之前的光场 Transformer 方法(如文献[16-19])有什么本质区别? 之前的 Transformer 方法通常把 4D 光场拆成空间注意力(只在空间维度做)和角度注意力(只在角度维度做),或者限制在极平面图像(EPI)上操作。这样无法让来自不同视图和不同空间位置的 token 直接交互。VSANet 通过统一 reshape 成一个 token 序列并用 LSH 分组,实现了真正的 4D 全局交互——任何一个像素都可以直接参考其他任何视图任何位置的像素,这是之前方法做不到的。
VSANet 在实际应用中有什么限制? 目前测试的光场大小为 532×364(S=5,T=5),LSH 的哈希桶大小设为128,chunk size 64,这需要一定显存(A40上运行约10.8秒)。对于更高分辨率或更多视图的光场,token 数会激增,即便线性复杂度也可能变慢。另外,LSH 的随机性可能带来结果微小的波动,虽然多轮融合已经缓解,但在需要严格重现的场景下可能不够稳定。产品化还需要进一步优化和工程适配。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性: ★★★★✰
首次将4D光场作为统一token空间做全局稀疏注意力,LSH的引入巧妙解决了计算瓶颈,角度新、思路新。
实验合理度: ★★★★★
在两个标准数据集上对比了多个SOTA(含最新HLFRN),消融实验全面(10组),指标和视觉效果都有,标准设置公平。
学术研究价值: ★★★★★
为光场全局建模提供了新范式,潜在可迁移到超分、视图合成等其他任务,启发性强。
稳定性: ★★★✰✰
多轮哈希融合提升了稳定性,但LSH随机性仍可能导致个别样本结果波动,未在极低光照等极端条件下测试。
适应性及泛化能力: ★★★★✰
在未见数据集EPFL上零微调表现优秀,说明泛化能力不错,但仅测试了高斯噪声,实际传感器噪声有偏,有待验证。
硬件需求及成本: ★★★★✰
参数量1.14M,推理10.79s(A40),相比HLFRN(15.26s)更快,但相比传统方法仍需要GPU,中等设备可跑。
复现难度: ★★★★✰
方法描述较详细,LSH实现有开源参考(Reformer),但需要PyTorch和A40等,整体可复现性较高。
产品化成熟度: ★★✰✰✰
目前仍是算法验证阶段,未针对实时性(10.8s/图)、内存占用、编译器优化等进行工程打磨,离手机或嵌入式部署距离较远。
可能的问题: 消融实验略有不完整:未测试去掉FR块但保留VSA的单独效果(AE4是去掉整个FR,没法区分是VSA还是FR的贡献);另外所有实验固定噪声类型,对真实混合噪声的鲁棒性未知。
主要参考文献
[1] Alain, M., & Smolic, A. (2017). Light field denoising by sparse 5D transform domain collaborative filtering. MMSP.
[2] Guo, M., Hou, J., Jin, J., Chen, J., & Chau, L.-P. (2022). Deep spatial-angular regularization for light field imaging, denoising, and super-resolution. TPAMI.
[3] Lyu, X., & Hou, J. (2024). Probabilistic-based feature embedding of 4-D light fields for compressive imaging and denoising. IJCV.
[4] Van Duong, V., Huu, T. N., Yim, J., & Jeon, B. (2025). Hybrid spatial and frequency network for light field image restoration. TCI.
[5] Kitaev, N., Kaiser, L., & Levskaya, A. (2020). Reformer: The efficient transformer. ICLR.
[6] Woo, S., Park, J., Lee, J.-Y., & Kweon, I. S. (2018). CBAM: Convolutional block attention module. ECCV.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
VSANet用全局稀疏注意力打通了4D光场,去噪效果拉满,参数还更少!想第一时间获取这种前沿论文解读和高效思路?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。图像处理、大模型、自动驾驶等5大群等你来撩,一起高效学习不掉队!