← 返回 PaperDaily 视觉与图像

4.23K参数冲SOTA!这篇水下增强把频率先验玩明白了

这篇工作最有意思的地方,不是“又加了个注意力”,而是把频率先验和重参数化卷积硬绑在一起,还尽量不增加推理成本。对超轻量水下增强来说,这种思路比单纯堆参数更像正经做工程。

4.23K参数冲SOTA!这篇水下增强把频率先验玩明白了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇工作最有意思的地方,不是“又加了个注意力”,而是把频率先验和重参数化卷积硬绑在一起,还尽量不增加推理成本。对超轻量水下增强来说,这种思路比单纯堆参数更像正经做工程。


原论文信息如下:
论文标题:
Frequency-Guided Lightweight Underwater Image Enhancement via Re-Parameterized Convolution
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.29469v1.pdf

轻量级水下图像增强的困境:效率与质量的权衡

水下图像增强这件事,看着像“把照片调亮一点”,实际却是个很容易翻车的活。水下散射会把高频细节先吃掉,吸收又会把颜色分布搅乱,最后常见结果不是“更清晰”,而是“更像一锅蓝绿粥”。对工程场景来说,麻烦还不止于此:模型一大,推理就慢;模型一小,效果又容易塌。于是就出现了一个经典矛盾——想要实时,就别指望太强;想要效果好,就别指望太快。
封面
图1:现有图像恢复方法在效果效率之间的综合对比。论文想解决的,就是轻量模型“跑得快但修不好”的老毛病。
这篇工作最值得注意的点,不是又堆了一个花里胡哨的模块,而是盯住了一个很朴素的事实:轻量模型之所以修不好,不一定是“网络不够深”,而是“缺少显式频率先验”。白话讲,就是模型只会看像素,不太会主动分辨“哪里是颜色问题,哪里是边缘问题,哪里是整幅图的频谱结构出了毛病”。
于是,论文把两个思路拧到一起:一个是用重参数化卷积在训练时塞进固定的 DCT 先验,另一个是用傅里叶统计去做通道调制。目标很明确:训练时把模型“教聪明”,推理时尽量别增加负担。这个方向就很工程,不玩虚的。

频率引导设计:从DCT先验到傅里叶注意力

先把术语掰直。DCTDiscrete Cosine Transform,离散余弦变换FTFourier Transform,傅里叶变换。前者更像把图像拆成一组规则的余弦“积木”,后者则是在频域里看整张图到底是低频平滑成分多,还是高频纹理和边缘多。对水下图像来说,这两者都很重要:颜色偏移像低频问题,边缘丢失像高频问题,单靠空间域卷积经常顾此失彼。
论文的思路很直接:既然频率信息这么关键,那就别装作看不见。问题在于,很多频率注意力方法一上来就很重,动不动几十万甚至几百万参数,和“超轻量实时增强”这个目标完全不在一个频道。论文因此没有走“大而全”的频率分解路线,而是选择了两个更克制的设计:一个负责在训练中注入频率先验,一个负责在推理前用全局频率统计调制特征
图2:方法整体架构图
图2:方法整体架构图。训练阶段使用可重参数化卷积和频率引导注意力共同增强特征;推理阶段则把多分支卷积折叠成单个卷积核,尽量把额外开销压到最低。
这里有个很关键的概念叫结构重参数化。意思是训练时可以把一个模块拆成多个分支,方便学习;到了推理时,再把这些分支数学上合并成一个普通卷积核。这样做的好处很现实:训练阶段表达能力更强,部署阶段成本不涨。论文把这个思路用在频率增强上,算是把“聪明”和“便宜”尽量同时保住了。

MBRCon-vDCT:零推理成本的频率增强卷积

论文把这个模块叫做 MBRCon-vDCT,全称是 Multi-Branch Reparameterizable Convolution with fixed DCT priors,中文可以理解为“带固定 DCT 先验的多分支可重参数化卷积”。名字很长,干的事不复杂:在原本的多分支卷积里,再加一条固定的 DCT 方向分支,让卷积在训练时更容易学到水平、垂直、对角等方向上的频率模式。
这一步的核心不是“加更多参数”,而是“加更有方向感的参数”。普通轻量卷积很多时候是平滑的、均匀的,像一个只会点头的老实人;但水下退化往往有明显的频率结构,尤其是边缘被抹掉、纹理被吞掉时,模型更需要知道该往哪个方向补。固定 DCT 核就像提前发给模型一套“频率地图”,让它少走弯路。
图3:模型结构具体实现图
图3:模型结构具体实现图。可以看到,DCT 分支只在训练时参与特征提取,推理时会被解析并折叠进标准卷积核,因此不会额外增加部署成本。
更妙的是,这条 DCT 分支是线性的,所以能和卷积数学上合并成一个等效 3×3 卷积核。换句话说,训练时看起来像“多了一条路”,推理时其实已经“消失”了。论文还用了零初始化的门控,让这条分支一开始不会乱搅局,只有在确实有帮助时才慢慢发挥作用。这个设计挺像给模型安排了一个“试用期”,表现好再转正。
从工程角度看,这种做法的价值很大:它避免了“为了频率信息,推理时多背一口锅”。很多方法论文喜欢在图里画得很热闹,真正上线后却得多跑一堆算子;这篇至少在这点上是认真控制成本的。

FGDP:全局频率统计引导的通道调制

第二个模块叫 FGDP,全称是 Frequency-Guided Dual-Path Attention,频率引导双路径注意力。这个名字听起来像是“注意力界的双拼套餐”,其实逻辑很清楚:一条路看全局频率统计,一条路看空间显著性,再把两者合起来调制通道响应。它不去做复杂的频带分解,而是直接提取全局频谱的统计特征,尽量把事情做轻。
它的第一步是把特征图下采样到固定的 32×32 网格,再做傅里叶变换,取对数幅度谱。这里的关键是“固定分辨率”。因为频谱如果直接跟着输入尺寸乱飘,注意力就会跟着抖,训练也容易不稳定。固定到 32×32 之后,频率描述就变成了一个分辨率无关、稳定可比的全局统计量。
图4:频率引导注意力的关键流程示意
图4:频率引导注意力的关键流程示意。频谱分支负责提供全局频率统计,空间分支负责捕捉局部显著区域,最后通过轻量融合生成最终的调制权重。
接着,FGDP 把频谱统计和空间统计分别送进轻量 1×1 卷积,得到通道注意力和空间注意力,再用一个静态可学习的融合策略合并。这里没有用复杂的动态路由,也没有搞多头注意力那种“看起来很高级、算起来很肉疼”的套路,而是老老实实用简单模块完成调制。对轻量模型来说,这种克制很重要:能用统计量解决的,就别上大模型式的豪华配置
从直觉上看,这个模块做的事有点像“先看整张照片的气色,再决定哪里该补光、哪里该锐化”。频率分支更关心全局颜色和纹理分布,空间分支更关心局部结构和边缘显著性,两者互补。论文后面的消融也证明了这一点:单靠卷积先验能涨一点,但真正把频率统计引进来,提升就会明显多得多。

实验验证:4.23K参数超越百万级模型

这部分是论文最能打的地方。先说实验设置:作者在 UIEB 上做有参考评测,在 EUVP 和 UIQS 上做无参考泛化测试;训练使用单卡 RTX 3090,输入裁成 256×256 patch,训练 1000 轮,损失函数沿用 MobileIE 的局部加权方差损失。整体设置不花哨,但比较规范,至少没有拿奇怪的自定义数据集自己感动自己。
论文的主张很明确:频率先验不是“锦上添花”,而是轻量增强模型补短板的关键抓手。如果这个判断成立,那么实验里应该出现两种信号:一是参数几乎不变,但性能明显上升;二是对真实水下图像的泛化更稳,不只是参考集上好看。结果基本符合预期。
表1:主要实验结果表格
表1:主要实验结果表格。论文在 UIEB、EUVP、UIQS 上给出了与多种方法的对比,重点展示了轻量模型在精度、感知质量和泛化能力上的综合表现。
在 UIEB 上,论文报告的结果是 23.97 dB PSNR0.915 的 SSIM,而参数量只有 4.23K。更直观一点说,它比强力轻量基线 MobileIE 还高出约 1.1 dB,同时参数量基本同级;和 U-Shape Transformer 这类大模型比,参数规模差了几个数量级,但感知指标并没有被拉开到离谱的程度,甚至 LPIPS 还更低。这个结果说明,在轻量场景里,频率先验确实能把“容量不够”补回来一截
更值得看的是无参考数据集上的表现。EUVP 和 UIQS 都更接近真实世界,颜色偏移、浑浊、光照不均这些问题更杂、更脏、更不讲武德。论文在这两个数据集上的结果说明,方法不是只会在配对数据上“刷分”,而是真的能把全局色彩和结构细节拉回来一些。尤其是视觉结果里,很多对比方法会留下残余雾气或者颜色不自然的问题,而本文方法的画面更均衡,边缘也更完整。
表2:消融实验表格
表2:消融实验表格。该表用于验证 v-DCT 分支、FGDP 模块以及频率分辨率选择的贡献,说明性能提升不是“玄学叠 buff”,而是每个组件都有明确作用。
消融实验更能说明问题。只加 v-DCT,PSNR 只涨了小幅度,说明固定 DCT 先验本身是“加分项”,但还不是主菜;一旦加上 FGDP,性能提升就非常明显,说明真正起决定作用的是全局频率统计对通道调制的引导。这也符合直觉:卷积先验负责“补方向”,频率注意力负责“定全局”,两者合起来才像一个完整修图流程。
论文还分析了 32×32 频谱分辨率的选择。分辨率更高,收益很有限,但算力成本会上去;分辨率更低,性能会掉。这个结论很像工程现场的真实选择:不是“越细越好”,而是“够用且稳定最好”。这点挺实在,至少作者没有为了追一点点分数把模型搞得越来越重。
图5:对比试验可视化结果
图5:对比试验可视化结果。和多种方法相比,本文方法在颜色平衡、局部纹理和边界清晰度上更稳定,尤其适合展示真实水下场景中的复杂退化。
复杂度分析也很关键。v-DCT 分支在推理时被完全折叠,所以可以视作零额外开销;FGDP 的频率分支固定在 32×32 上计算,复杂度近似常数,不会随着输入尺寸无限膨胀。对边缘设备来说,这种设计意味着方法不是“实验室里能跑”,而是更接近“真能部署”。当然,真要上船、上机器人、上移动端,还得看具体硬件和并发要求,但起码方向是对的。

总结与展望:频率先验在轻量级视觉中的潜力

这篇论文的价值,不在于“又提出了一个更复杂的增强网络”,而在于它把一个常被忽略的事实说透了:轻量视觉模型不是不能做强,而是不能只靠空间卷积硬扛。频率先验、重参数化、低成本注意力,这三件事单看都不新,但组合起来就很像一套能落地的工程解法。
不过也要客观看:这类方法的上限仍然受限于训练数据分布和任务类型。水下增强本身就有很强的场景依赖,不同水体、不同相机、不同光照条件下,频率结构会变,最优策略也会变。论文虽然在多个数据集上证明了泛化,但真正到复杂海洋场景里,仍然需要更大范围的实测验证。换句话说,它已经很像一个好底座了,但还不是“万能滤镜”。
如果把这篇工作放到更大的范围里看,它给轻量视觉一个很实用的启发:与其一味加深加宽,不如想办法把先验塞进每一个参数里。对于边缘端图像增强、低照度恢复、去雾、去噪等任务,这种“训练期加知识,推理期不加负担”的路线,后面大概率还会继续冒头。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是轻量级水下增强“速度快但效果不够好”的老问题。核心思路不是盲目加参数,而是把频率先验显式塞进网络,让模型更会处理颜色偏移和细节丢失。

MBRCon-vDCT 和 FGDP 分别在干什么?前者是在训练时引入固定 DCT 方向先验,推理时还能折叠掉;后者是先算一个固定分辨率的傅里叶幅度统计,再结合空间显著性做通道调制。一个补“方向感”,一个管“全局感”。

为什么说它适合轻量部署?因为推理阶段几乎不增加额外负担:DCT 分支可折叠,频率注意力只在 32×32 上做固定统计,参数量只有 4.23K,算得上是真正把“轻量”放在了第一位。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 频率先验不是新概念,但把 DCT 先验和可重参数化卷积、傅里叶统计注意力绑在一起,并且严格控制推理开销,这个组合是有新意的。

实验合理度:★★★★☆ 数据集、对比方法和消融都比较完整,尤其是把真实无参考数据集也拉进来,说明作者没只盯着“刷分图”。

学术研究价值:★★★★☆ 对轻量图像增强和边缘端视觉有明确启发,特别适合后续继续做频率先验与结构重参数化的结合。

稳定性:★★★☆☆ 从设计上看比较稳,但频率统计和水下场景分布强相关,跨域到别的退化类型还需要额外验证。

适应性以及泛化能力:★★★☆☆ 在 UIEB、EUVP、UIQS 上表现不错,但仍偏向水下增强任务本身,离“通吃所有恢复任务”还有距离。

硬件需求及成本:★★★★★ 4.23K 参数、推理零额外卷积分支成本,这一点非常适合移动端或边缘端。

复现难度:★★★☆☆ 方法本身不算难,关键在于训练细节和频率分支实现是否严谨,代码若不开源会有一点门槛。

产品化成熟度:★★★★☆ 如果目标是轻量水下增强,这套设计已经比较接近可部署方案;但真实海洋场景仍建议先做场景化再训练。

可能的问题:频率先验有效,但依赖任务分布;如果退化机制变了,固定频率设计未必还能保持同样收益。


主要参考文献

[1] Han H, Li Y, Zhang X, et al. MobileIE: An Extremely Lightweight and Effective Network for Real-Time Image Enhancement on Mobile Devices. ICCV 2025.
[2] Peng L, Zhu C, Bian L. U-shape Transformer for Underwater Image Enhancement. IEEE Transactions on Image Processing, 2023.
[9] Ding X, Zhang X, Ma N, et al. RepVG: Making VGG-style ConvNets Great Again. CVPR 2021.
[10] K. A. et al. MobileOne: An Improved One Millisecond Mobile Backbone. CVPR 2023.
[16] Qin Z, Zhang P, Fu F, et al. FcaNet: Frequency Channel Attention Networks. ICCV 2021.
[25] Li C, Guo C, Ren W, et al. An Underwater Image Enhancement Benchmark Dataset and Beyond. TIP 2020.

水下增强卷积也能“听懂频率”了,轻量、快、还不太掉画质。想继续看这类能落地、能省算力、能涨指标的论文,欢迎加入龙哥读论文粉丝群,和一群认真拆论文的人一起少走弯路~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。