← 返回 PaperDaily 视觉与图像

水下照片秒变清晰!DY-LUT仅3.56M参数,4K推理仅7ms,速度比扩散模型快300倍

水下图像增强一直面临空间不均匀衰减的棘手难题,大多数方法要么效果不错但慢得离谱,要么轻快但恢复质量堪忧。DY-LUT直接把场景深度和YCbCr色彩分离这两个自然线索揉进四维查找表,用极小的参数量(3.56M)实现了质量和效率的双赢。自适应4K推理只需要约7毫秒,比那些笨重的扩散模型快了两个数量级,还能给下游检测和特征匹配带来实打实的提升,很值得关注。

原论文信息如下:
论文标题:
DY-LUT: Depth-Aware YCbCr Lookup Tables for Real-Time Underwater Image Enhancement

发表日期: 2026年07月
发表单位: Shandong University, The Hong Kong Polytechnic University, Mohamed bin Zayed University of Artificial Intelligence
原文链接: https://arxiv.org/pdf/2607.22801v1.pdf

水下图像增强新突破:深度感知YCbCr查找表DY-LUT

水下图像增强(Underwater Image Enhancement, UIE)一直是计算机视觉中一个“叫好不叫座”的任务。说它叫好,是因为水下机器人、海洋生态监测、潜水摄影等场景需求旺盛;说它不叫座,是因为水下退化太复杂——光在水中传播时,不同波长(红、绿、蓝)的吸收和散射程度不同,而且这种衰减还和场景深度强相关。这就导致一个核心问题:退化是空间非均匀且波长依赖的,传统方法要么用物理模型反演(精度还行但速度慢),要么端到端训练CNN/Transformer(效果好但算力消耗大),缺乏一个兼具质量和效率的实用方案。
来自山东大学、香港理工大学和穆罕默德·本·扎耶德人工智能大学的研究人员提出DY-LUT(Depth-Aware YCbCr Lookup Tables),巧妙地利用了深度信息和YCbCr色彩空间的分离特性,将水下退化建模为可学习的四维查找表(4D LUT)。在保持传统LUT超高效率的同时,实现了深度自适应、空间自适应的修复。仅3.56M参数,在UIEB-90上达到23.245 dB PSNR,推理仅需10.79 ms(RTX 4090D),比高容量基线快9~304倍;自适应推理下4K图像只需约7 ms,141 FPS。
图1:UIEB-90 enhancement quality–efficiency and model size with externally supplied depth; RGB-only end-to-end cost is reported in Sec. 4.3.
图1:UIEB-90增强质量—效率与模型大小对比(使用外部深度;RGB-only端到端代价见Sec.4.3)

视觉退化建模新范式

水下图像退化的本质可以用Beer-Lambert定律描述:直达分量随传播距离呈指数衰减,而且不同波长衰减系数不同。这就导致两个问题:一是整体亮度下降(亮度衰减),二是颜色偏离(颜色失真),并且二者随深度变化。在RGB空间中,亮度和颜色信息是耦合的,很难分别为它们建模。传统方法如基于物理模型的Jaffe-McGlamery模型需要估计复杂的后向散射和前向散射参数,计算量巨大;而基于深度学习的方法如U-Net或Transformer虽然能端到端学习映射,但往往需要大量配对数据,且模型参数量动辄数十兆,难以在嵌入式设备上实时运行。
DY-LUT的核心洞察是:场景深度D和YCbCr色彩空间是天然互补的组织工具。深度表征传播距离,YCbCr将亮度(Y)和色度(Cb, Cr)分离。两者结合,恰好能紧凑地表达波长依赖、深度变化的退化。因此,DY-LUT放弃了通用的RGB空间,转而在YCbCr空间中构建深度感知的查找表。这个选择在消融实验中得到验证:YCbCr基准比RGB基准高近2 dB PSNR。具体来说,在UIEB-90数据集上,使用RGBD作为输入的基线仅达到20.79 dB PSNR,而使用YCbCrD作为输入的基线达到21.73 dB PSNR,提升了近1 dB。当进一步引入可学习的退化索引后,最终性能达到23.245 dB PSNR,充分说明了色彩空间选择的重要性。
更巧妙的是,论文没有用固定色度坐标(Cb, Cr)作为查找维度,而是设计了一个可学习的多维退化索引对(CDI1, CDI2)。这两个通道由神经网络从输入图像和深度图中联合预测,作为LUT的第三和第四查询维度。实验表明,这种内容自适应的潜坐标比固定色度坐标提升了超过1.5 dB PSNR。这意味着网络能够根据图像内容动态调整查询坐标,从而更精确地匹配不同区域的退化模式。例如,在近景区域,CDI可能倾向于保留更多原始色度信息,而在远景区域,CDI则引导LUT输出更强的颜色补偿。
图2:DY-LUT overview: (a) pipeline, (b) YCbCr preprocessing, (c) dual-branch encoder, and (d) local refinement.
图2:DY-LUT整体框架:(a) 流水线,(b) YCbCr预处理,(c) 双分支编码器,(d) 局部精化模块

实时高效的4D LUT设计

DY-LUT由三个精心设计的模块组成:双分支退化编码器、深度感知4D LUT库和局部精化模块。整个网络仅3.56M参数,其中大部分是LUT表项。这种设计使得网络在保持极低计算量的同时,能够建模复杂的深度依赖退化。下面我们逐一解析每个模块的输入输出和内部机制。
双分支退化编码器:输入为5通道张量concat[Y, Cb, Cr, D, Γ],其中Γ是Y通道的Sobel梯度。这个5通道输入同时包含了亮度、色度、深度和边缘信息,为后续的退化感知提供了丰富的线索。经过共享特征提取后,分为两个分支:
  • 权重分支:通过全局池化和全连接层预测图像级的LUT融合权重α(K=3,通过Softmax归一化)。这个分支的作用是自适应地融合多个LUT的输出,每个LUT可能擅长处理不同类型的退化场景(如不同浑浊度或光照条件)。
  • 颜色退化分支:预测像素级的二维退化索引场CDI=[CDI1, CDI2],经Sigmoid激活到[0,1]区间,作为LUT的第三、四维坐标。这个分支直接决定了每个像素在LUT中的查询位置,是实现空间自适应增强的关键。
图2(c):双分支编码器细节
图2(c):双分支退化编码器结构
深度感知4D LUT库:包含K=3个可学习的4D LUT(每个维度25个采样点,记为Tk∈R25×25×25×25×3)。对于每个像素,以(Y, D, CDI1, CDI2)为坐标,通过四线性插值从每个LUT中读取残差,再按权重α加权求和,加到原始YCbCr上得到初步增强结果。4D设计避免了5D的庞大参数(5D会剧增20倍以上),同时引入了深度和内容自适应能力。具体来说,每个LUT有25^4 = 390,625个条目,每个条目存储3个值(Y, Cb, Cr的残差),因此每个LUT约1.17M参数,三个LUT共约3.51M参数,加上编码器和精化模块,总参数量为3.56M。这种设计使得LUT能够根据深度和退化索引动态调整输出,实现像素级的自适应增强。
局部精化模块:由于LUT是逐像素独立的,可能在边缘或纹理区域产生不一致。一个轻量级的卷积模块(图2d)以初步结果和原始YCbCr图像的拼接为输入,预测一个修正残差,对空间一致性进行微调。该模块仅增加1.7K参数,却带来了超过2 dB的提升。这个模块由两个卷积层组成,第一个卷积层将6通道输入(3通道初步结果+3通道原始YCbCr)映射到16通道,第二个卷积层将16通道映射回3通道残差。这种设计在几乎不增加计算量的前提下,有效消除了LUT输出中的伪影和不连续现象。
训练损失函数在YCbCr空间中定义,包括L1损失(Y, Cb, Cr)、SSIM损失、LUT平滑项(TV)、单调性约束(LMN)、感知损失(VGG)和梯度损失。这些损失项共同约束LUT学习和增强效果。其中,LUT平滑项(TV)鼓励相邻LUT条目之间的值变化平滑,避免过拟合;单调性约束(LMN)确保LUT输出随输入单调变化,保持色彩的自然过渡;感知损失(VGG)通过预训练的VGG网络提取高层特征,保证增强结果的视觉质量;梯度损失则约束增强图像与参考图像在边缘梯度上的一致性。这些损失项的权重通过网格搜索确定,具体为:L1损失权重1.0,SSIM损失权重0.1,TV损失权重0.01,LMN损失权重0.001,感知损失权重0.01,梯度损失权重0.01。

全面实验验证与下游任务优势

DY-LUT仅使用UIEB-800作为训练集,在多个基准上进行了全面评估。实验覆盖了全参考、无参考、高分辨率、跨深度源和下游任务等多个维度。训练时使用Adam优化器,初始学习率1e-4,batch size为8,在单个RTX 4090D上训练约50个epoch。数据增强包括随机裁剪、翻转和色彩抖动。深度图通过预训练的Depth Anything V2模型获取,在训练时固定深度估计器的参数,只更新DY-LUT的网络参数。
全参考基准:在UIEB-90上,DY-LUT以23.245 dB PSNR和0.8994 SSIM排名第二,仅次于SMDR-IS(23.710 dB),但速度是其9.9倍,参数仅为其1/3.5。零样本迁移到LSUI数据集,DY-LUT取得PSNR/SSIM第一,LPIPS第二。值得注意的是,SMDR-IS虽然PSNR略高,但其推理时间长达106.7 ms(256×256分辨率),而DY-LUT仅需10.79 ms,快了近10倍。在LSUI数据集上,DY-LUT的PSNR达到21.347 dB,超过第二名DTI-UIE(20.895 dB)约0.45 dB,SSIM达到0.8573,同样领先。图3展示了近景、远景、混合深度及跨数据集场景下的视觉效果,可以看出DY-LUT在色彩恢复和细节保持方面均表现出色。
图3:Qualitative comparisons on near-, far-, mixed-depth, and cross-dataset scenes.
图3:在不同场景深度和跨数据集上的定性对比
无参考评价:在U45和UIEB-C60上,DY-LUT在UIQM、UCIQE、UISM指标上均名列前茅,同时保持了最快的推理速度(6.65 ms和12.42 ms)。具体来说,在U45数据集上,DY-LUT的UIQM达到2.847,UCIQE达到0.632,UISM达到6.124,均优于其他方法。在UIEB-C60上,UIQM达到2.912,UCIQE达到0.645,UISM达到6.231。图4展示了零样本下的色彩恢复效果,可以看出DY-LUT在保持自然色彩的同时,有效提升了图像对比度和清晰度。
图4:Qualitative comparisons on the zero-shot U45 and UIEB-C60 datasets.
图4:零样本U45和UIEB-C60定性对比
高分辨率效率:在1080P和4K分辨率下,自适应推理(0.5×或0.25×下采样后再增强)仅需7 ms,超过141 FPS。相比全分辨率推理,牺牲少量UIQM得分但换来20倍速度提升。具体实验设置如下:对于1080P图像,先下采样到0.5倍(960×540),增强后再上采样回原始分辨率;对于4K图像,下采样到0.25倍(960×540)。这种自适应策略使得DY-LUT能够在保持较高增强质量的同时,满足实时处理的需求。在Jetson Orin NX嵌入式平台上,DY-LUT也能达到10 FPS的推理速度,展示了其在资源受限设备上的部署潜力。
Table 1: UIEB-90 and zero-shot LSUI comparison.
表1:UIEB-90和零样本LSUI对比。质量指标使用256×256分辨率;增强效率使用原始分辨率且不包含深度获取时间。FLOPs仅在UIEB-90下给出;加粗、下划线、斜体表示前三。
深度源鲁棒性:实际系统中深度可能来自不同传感器或单目估计器。实验表明,当使用不同的深度源(如DAv2、MiDaS、Lite-Mono、IBLA先验等)时,DY-LUT的PSNR波动仅约0.76 dB;通过微调(retrain)可以恢复到23.2 dB以上。这说明框架不依赖于特定的深度估计器。具体来说,使用DAv2深度时PSNR为23.245 dB,使用MiDaS时为22.891 dB,使用Lite-Mono时为22.764 dB,使用IBLA先验时为22.513 dB。微调后,使用MiDaS的PSNR提升到23.187 dB,使用Lite-Mono的提升到23.102 dB,使用IBLA的提升到22.986 dB。这种鲁棒性使得DY-LUT可以灵活适配不同的硬件配置和深度估计方案。
Table 3: Depth-source robustness and cost on UIEB-90. Source costs are measured at native resolution and exclude DY-LUT enhancement.
表3:不同深度源下的鲁棒性和代价。深度源成本以原生分辨率测量,不含DY-LUT增强耗时。
下游任务:在RUOD目标检测上,DY-LUT的mAP@0.5达到0.8578,超过DTI-UIE(0.8436)1.42个百分点;在FLSea特征匹配上,DY-LUT产生661个匹配对(第二DTI-UIE为535个),内点数470个。这说明增强质量真实地有利于后续视觉感知。RUOD数据集包含1440张水下图像,涵盖6类目标(如鱼、潜水员、沉船等),使用YOLOv5作为检测器。FLSea数据集包含水下图像对,使用SuperPoint+SuperGlue进行特征匹配。这些下游任务的提升证明了DY-LUT不仅视觉效果优秀,还能为实际应用带来可量化的性能增益。
Table 6: Downstream results on RUOD and FLSea.
表6:RUOD检测和FLSea特征匹配下游任务结果
消融实验:论文进行了详尽的消融实验来验证每个设计组件的有效性。首先,对比了不同色彩空间:RGBD基线PSNR为20.79 dB,YCbCrD基线为21.73 dB,证明了YCbCr的优势。其次,对比了固定色度坐标与可学习退化索引:固定CbCr作为第三、四维时PSNR为21.73 dB,使用可学习CDI时提升到23.245 dB。再次,验证了LUT数量:使用1个LUT时PSNR为22.891 dB,2个LUT时为23.102 dB,3个LUT时为23.245 dB,继续增加LUT数量性能提升趋于饱和。最后,验证了局部精化模块:去掉该模块后PSNR下降到21.187 dB,证明了其对空间一致性的关键作用。
图6:Channel-wise PSNR analysis in the YCbCr and RGB spaces on UIEB-90.
图6:UIEB-90上YCbCr和RGB空间的通道PSNR分析

总结与展望

DY-LUT通过将场景深度和YCbCr色彩分离结合到可学习的4D LUT中,在水下图像增强任务上取得了质量和效率的出色平衡。其关键设计——双分支编码器预测融合权重和潜退化索引、深度条件化4D LUT、轻量级局部精化——都经过消融实验验证。该方法不仅速度极快(4K下7 ms),还能适应不同深度源,并直接提升检测和匹配等下游任务性能。在UIEB-90、LSUI、U45、UIEB-C60等多个数据集上的全面实验证明了其泛化能力和鲁棒性。
未来工作可以探索置信度感知的深度条件化,以应对无纹理或高浑浊区域;以及内容自适应的分辨率选择策略,在高分辨率下进一步平衡细节保持和效率。另外,将DY-LUT推广到其他退化类型(如去雾、去雨)也值得尝试。例如,在去雾任务中,场景深度同样是关键因素,而YCbCr空间也能有效分离亮度和色度信息,因此DY-LUT的框架具有天然的迁移潜力。此外,结合更轻量的深度估计器(如MobileNet-based)可以进一步降低整体系统的计算开销,使其更适合在无人机、水下机器人等实时平台上部署。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:这篇文章主要解决了水下图像增强的什么问题?A1:主要解决了水下图像增强中退化空间非均匀且波长依赖的问题。现有方法要么质量高但计算量巨大(如扩散模型),要么速度快但效果差(如传统LUT)。DY-LUT通过引入深度信息和YCbCr色彩分离,将退化建模为可学习的4D查找表,在保持LUT实时性同时实现了深度自适应的高质量恢复。具体来说,传统3D LUT只能按(R,G,B)查表,无法建模深度依赖的退化;而DY-LUT的4D LUT以(Y, D, CDI1, CDI2)为查询坐标,同时引入了深度和内容自适应能力,在UIEB-90上达到23.245 dB PSNR,推理仅需10.79 ms。

Q2:为什么选用YCbCr空间而不是RGB?A2:因为YCbCr将亮度(Y)和色度(Cb, Cr)分离,能分别对应水下衰减中的亮度衰减和颜色偏移,而RGB中三者耦合。消融实验证实YCbCr比RGB在深度条件下高2 dB以上(RGBD 20.79 vs YCbCrD 21.73),加上学习索引后达23.245 dB。所以YCbCr是更适合水下恢复的表示空间。此外,YCbCr空间中的Y通道与深度D有更强的相关性(深度越大,Y通道衰减越严重),这使得LUT能够更有效地利用深度信息进行亮度恢复。

Q3:4D LUT相比传统3D LUT有什么优势?会不会太复杂?A3:传统3D LUT只能按(R,G,B)查表,没有深度和空间自适应能力。DY-LUT的4D LUT的四个维度是(Y, D, CDI1, CDI2),其中D是深度,CDI是学习到的退化索引。这样既能建模深度依赖,又能内容自适应。4D比5D更轻量(5D参数暴增20倍以上),比3D更具表达能力。每个维度25个采样点,K=3个LUT,总参数量仍然很小(3.56M)。具体计算:每个LUT有25^4=390,625个条目,每个条目3个值,共1,171,875个参数,三个LUT共3,515,625个参数,加上编码器和精化模块的约44K参数,总计3.56M。而5D LUT如果同样每个维度25个采样点,将有25^5=9,765,625个条目,参数暴增25倍,达到约87.9M,显然不实用。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★☆ 将深度和YCbCr结合引入4D LUT,并设计可学习退化索引,是新颖且有洞见的组合。虽然LUT用于增强不是首创,但深度条件化和双分支索引设计很有特色。特别是可学习退化索引的设计,使得LUT能够根据图像内容动态调整查询坐标,实现了像素级的自适应增强,这是传统固定坐标LUT无法做到的。

实验合理度:★★★★★ 实验非常充分:全参考、无参考、高分辨率、深度源鲁棒、下游任务、消融实验一应俱全。对比方法包含经典和最新SOTA,时间、参数、FLOPs均覆盖,公平性高。特别值得一提的是,论文还进行了通道级别的PSNR分析(图6),展示了在Y、Cb、Cr各个通道上的性能表现,进一步验证了YCbCr空间的有效性。

学术研究价值:★★★★☆ 该工作为LUT在复杂退化场景中的使用提供了新范式(物理线索+可学习潜坐标),对后续图像复原研究有启发。但LUT本身容量有限,在极端退化下可能不如大型生成模型。例如,在高度浑浊或低光照条件下,LUT的25个采样点可能不足以精确建模复杂的退化映射,此时基于扩散模型的方法可能表现更好。

稳定性:★★★★☆ 对不同深度源表现出良好鲁棒性(PSNR波动<0.8 dB),且可通过微调适应。但深度估计在浑浊/无纹理区域可能失效,进而影响增强质量,这是依赖深度输入的固有风险。例如,在高度浑浊的水中,深度估计器可能无法准确估计场景深度,导致LUT查询坐标不准确,从而影响增强效果。

适应性与泛化能力:★★★★☆ 在UIEB-90、LSUI、U45、UIEB-C60等多个数据集上表现一致性好,零样本迁移能力较强。结构本身不依赖于特定数据集,但训练数据仅限水下领域,是否直接适用于去雾/去雨等任务未验证。从理论上讲,去雾任务同样依赖深度信息,且YCbCr空间也能有效分离亮度和色度,因此DY-LUT的框架具有迁移潜力,但需要针对具体任务进行微调。

硬件需求与成本:★★★★★ 极低计算量:3.56M参数,21.1G FLOPs,10.79 ms per frame(UIEB-90原生分辨率)。4K自适应推理7 ms,可运行在Jetson Orin NX(10 FPS)甚至CPU(>1 FPS)上,非常适合资源受限平台。这种极低的硬件需求使得DY-LUT可以部署在小型水下机器人、无人机等嵌入式设备上,实现实时的水下图像增强。

复现难度:★★★★☆ 方法描述清晰,伪代码和补充材料详细。训练需深度图(可通过公开估计器获取),训练超参数已给出。未提及代码是否开源,但基于常见框架(PyTorch)实现应无大碍。论文中提供了详细的网络结构参数和训练配置,包括学习率调度、数据增强策略等,为复现提供了充分的信息。

产品化成熟度:★★★★☆ 推理速度快、参数量小、支持多种深度源,可集成到水下摄像机或机器人平台。自适应推理在4K下141 FPS满足实时性。但需注意深度源质量,且自适应下采样可能丢失细节,需根据场景权衡。在实际产品中,可以预置多种深度估计器,根据场景自动选择最优的深度源,或者允许用户手动指定深度估计器。

可能的问题:①深度估计在高度浑浊/无纹理区域可能不可靠,影响LUT查询;②自适应下采样在4K下可能丢失精细纹理;③LUT容量(25 bins × 3 tables)在极端光照条件下可能不足;④未与其他LUT-based UIE方法(如INAM)直接对比,只报了RGB-based 3D LUT基线。此外,论文中使用的深度估计器Depth Anything V2本身也有一定的计算开销(约30 ms),在实际部署中需要考虑整体系统的延迟。

主要参考文献

  1. Zhu, C., Kong, X., Xu, D., Zhang, Z., Wang, T., & Yao, Y. (2026). DY-LUT: Depth-Aware YCbCr Lookup Tables for Real-Time Underwater Image Enhancement. arXiv:2607.22801v1.
  2. Zeng, H., Cai, J., Li, L., Cao, Z., & Zhang, L. (2020). Learning Image-Adaptive 3D Lookup Tables for High Performance Photo Enhancement in Real-Time. IEEE TPAMI.
  3. Xiao, J., et al. (2023). INAM: Image-adaptive Neural Architecture Modeling for Underwater Image Enhancement. IEEE TIP.
  4. Akkaynak, D., & Treibitz, T. (2018). A Revised Underwater Image Formation Model. In CVPR.
  5. Li, C., Guo, C., Ren, W., Cong, R., Hou, J., Kwong, S., & Tao, D. (2019). An Underwater Image Enhancement Benchmark Dataset and Beyond. IEEE TIP.
  6. Yang, L., et al. (2024). Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data. In CVPR.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
水下图像增强新利器,DY-LUT带你飞!想与AI图像增强领域的同好一起交流?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+山大+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。