← 返回 PaperDaily 视觉与图像

电子科大这篇实时水下增强,真把频率用明白了

水下增强最怕两件事:一边要快,一边还要好看。本文偏偏把这两件事同时拿下了,4.23K 参数、600+ FPS,还把频率先验塞进了可重参数化卷积和轻量注意力里,挺会省钱,也挺会办事。

电子科大这篇实时水下增强,真把频率用明白了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
水下增强最怕两件事:一边要快,一边还要好看。本文偏偏把这两件事同时拿下了,4.23K 参数、600+ FPS,还把频率先验塞进了可重参数化卷积和轻量注意力里,挺会省钱,也挺会办事。


原论文信息如下:
论文标题:
Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention
发表日期:
2026年06月
发表单位:
Glasgow College, UESTC; School of Information and Communication Engineering, UESTC; University of Glasgow
原文链接:
https://arxiv.org/pdf/2606.30314v1.pdf
开源代码链接:
https://github.com/LethyZhang/FGDPA
项目链接:
https://github.com/LethyZhang/FGDPA
水下图像增强这件事,最怕的不是“看不清”,而是“又要快、又要好、还不能把设备烫成铁板烧”。这篇论文偏偏就盯住了这个矛盾:超轻量 CNN已经把速度和体积压得很低了,但画质总像差了最后一口气;而那些画质很强的方法,往往又重得像背着潜水艇上岸。
封面:FGDPA 在 UIEB 和真实水下图像上的增强效果对比。论文想证明的不是“模型很大”,而是“模型很小,但还真能干活”。
这篇工作给出的答案很直接:别再只在空间域里硬卷了,水下退化本来就对频率特别敏感。颜色偏了,说明低频分布被改写;细节糊了,说明高频被削掉。于是,本论文把频率先验塞进了一个极小的可重参数化框架里,做成了一个既能训练时“加料”,又能推理时“不加班”的实时增强模型。

频率先验如何拯救超轻量CNN?

先把概念讲人话。频率域不是玄学,它就是把图像里的“变化快慢”拆出来看:低频更像整体颜色和光照,高频更像边缘、纹理和细节。水下图像的麻烦也正出在这里——海水吸收光线、散射颗粒,先把颜色搞偏,再把细节磨平。只在空间域做卷积,等于拿着放大镜在黑屋里找钥匙,努力是努力了,方向不一定对。
论文的核心判断很明确:轻量模型不是不能做好水下增强,而是必须把“频率意识”补上。但问题来了,传统频率方法往往很重,特别是那些复杂的频带拆分、重建、跨域交互,放进超轻量网络后,速度优势很容易被吃掉。于是,这篇论文走了一条很聪明的路:训练时注入频率先验,推理时尽量零成本或低成本保留收益

零成本注入频率先验:MBRConv-DCT模块

第一个关键模块叫 MBRConv-DCT,全称是 Multi-Branch Reparameterizable Convolution with Fixed DCT Priors,中文可以理解为“带固定离散余弦变换先验的多分支可重参数化卷积”。这里的 DCTDiscrete Cosine Transform,中文叫离散余弦变换。它的好处很朴素:能把图像里的方向性、频率性结构表达得更清楚,像横纹、竖纹、斜纹这些信息都能被不同基核捕捉到。
图中这条公式表示:输入特征 F 先经过固定的 DCT 深度卷积,再通过可学习的点卷积投影到目标通道空间。直白一点说,就是先用“不会变的频率模板”把方向信息拎出来,再让网络自己决定这些信息值不值得用。论文还给这个分支加了一个零初始化的门控,避免训练一开始就乱冲,属于很克制的工程设计。
真正妙的地方在于,这个分支在推理阶段可以被解析合并进普通 3×3 卷积。也就是说,训练时它在偷偷“教模型看频率”,推理时却不额外加参数、不额外加 FLOPs。这个思路很像先请一位老师来补课,考试时老师不跟着进考场,但学生已经把题型吃透了。论文里还展示了固定的非 DC DCT 核,能提供水平、垂直和对角线方向的频率偏置,这对水下图像里那些被散射抹掉的边缘特别有帮助。
图5:MBRConv-DCT 中的 8 个归一化非 DC DCT 核。每个核都零均值、单位范数,分别对应不同方向的频率响应。说白了,这不是让卷积“更大”,而是让卷积“更懂方向”。

从全局频谱中学习:FGDPA注意力

第二个模块叫 FGDPA,全称是 Frequency-Guided Dual-Path Attention,中文是频率引导双路径注意力。名字听起来挺“论文味”,但它做的事其实很接地气:一条路看频率,一条路看空间,然后把两条路的信息融合起来,让网络在“该补颜色的时候补颜色,该保细节的时候保细节”。
这里的关键是,它没有把频率做成一套又长又重的分解重建流程,而是先把特征图压到固定的 32×32,再做二维 FFT,取对数幅度谱来做全局统计。FFTFast Fourier Transform,中文叫快速傅里叶变换。幅度谱可以理解成“这张图整体上有哪些频率能量”,而对数压缩则是为了让数值更稳,不至于被少数极端值带飞。
这条公式描述的是 FGDPA 的双路径融合机制:一条是频率引导的通道注意力,一条是空间显著性注意力,最后再通过一个可学习的门控把两者合成最终注意力图。这里的核心不是“谁压倒谁”,而是让频谱信息和空间信息互相补位。水下图像里,颜色恢复往往更依赖全局频率统计,而局部边缘和目标结构又离不开空间显著性,这两个信息本来就不该分家。
从工程角度看,这个设计也很会算账。频率分支只在固定小分辨率上跑,避免了大尺寸 FFT 的开销;通道和空间分支都只用了 1×1 卷积,属于轻量注意力里相对温和的做法。更关键的是,它不是把频率当装饰品,而是直接拿来指导通道重标定。论文的消融已经证明:如果把频率幅度拿掉,性能会明显掉下来,说明这个频率分支不是“锦上添花”,而是确实在干活。

仅4.23K参数,全面超越大模型

这篇论文最容易让人停顿一下的地方,不是方法名,而是结果:4.234K 参数,480×640 下 628.25 FPS,Jetson AGX Orin 上还能跑到 106.9 FPS。这就不是“能跑”,而是“跑得还挺像回事”。很多论文一边说实时,一边要么参数爆炸,要么只能在桌面显卡上表演;这篇则把部署场景想得很实际,连边缘设备都测了。
图1:当前图像恢复方法的效率—效果权衡对比。论文放这张图的意思很直接:很多方法要么快但不够好,要么好但不够快,FGDPA 想挤进那个“又快又好”的角落。
从主表看,FGDPA 在 UIEB 上拿到 23.9660 dB PSNR0.9155 SSIM,同时 LPIPS 也更低,说明它不只是“数值好看”,视觉质量也确实更稳。更难得的是,在 EUVP 和 UIQS 这类无参考真实数据上,它也保持了不错的泛化表现。这点很重要,因为水下增强最怕的不是训练集上好看,而是换个海域就开始“换脸”。
表1:在 480×640 分辨率下的综合对比结果。这里最有杀伤力的不是某一个指标,而是“参数少、速度快、效果还领先”这三件事同时成立。尤其对比 MobileIE 这类同样超轻量的方法,FGDPA 还能继续往上抬一截。

核心实验与消融分析

这部分实验设计整体是合理的。UIEB 用配对监督评估主性能,EUVP 和 UIQS 用无参考真实图像看泛化,这样才能区分“会背题”和“真会做题”。训练设置上,作者沿用了 MobileIE 的 LVW loss,也就是 Local Variance-Weighted loss,中文可理解为局部方差加权损失,这样做有利于把更多学习压力放到纹理和边缘区域,和本论文强调频率细节的方向是统一的。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。