← 返回 PaperDaily 视觉与图像

水下照片不再蓝绿蒙蒙?这个合成数据让特征匹配暴涨近7倍

水下照片总是蓝绿蒙蒙一片?印度理工学院这次把海洋光学的"家底"全搬进了合成数据——十种Jerlov水体、深度依赖辐照度、生物荧光一次建模到位。合成数据FID比最强竞品直降46%,四个增强架构跨六个真实数据集全面反超。搞水下视觉的朋友,这份物理知识+数据工程的双拼值得仔细品品。

水下照片不再蓝绿蒙蒙?这个合成数据让特征匹配暴涨近7倍
原论文信息如下:
论文标题:
π-SUB: 面向水下图像增强的物理信息合成水下基准数据集

发表日期: 2026年8月

发表单位: 印度科学理工学院(IISc)

原文链接: https://arxiv.org/pdf/2608.10589v1.pdf

开源代码链接: https://github.com/airl-iisc/pi-SUB

项目演示: https://github.com/airl-iisc/pi-SUB/raw/main/pisub.png

水下图像增强的"阿喀琉斯之踵":合成数据与真实世界的鸿沟

想象一下这组画面:潜水员潜入20米深的珊瑚礁,阳光从头顶穿透海水,红色的光被水分子"吃掉"大半,周围的一切蒙上一层蓝绿色的纱。拍摄的画面里,鱼儿的轮廓还在,但色彩和对比度早已面目全非。这不是相机坏了,而是光在水下传播时遭遇了波长相关的吸收和散射——这就是水下图像增强(Underwater Image Enhancement,UIE)要解决的核心问题。
水下图像增强是自主水下航行器(AUV)、遥控潜水器(ROV)执行海底光缆巡检、油气管道检测、珊瑚礁生态监测等任务的关键预处理步骤。由于声呐只能提供有限的语义和纹理信息,光学成像仍是水下感知的主要手段。然而,要让深度学习模型学会"去水",最理想的情况是需要同一场景"有水和无水"两张配对照片——可这在物理上根本不可能实现。总不能把海水抽干了拍一张,再放满水拍一张吧?
于是,现有的真实配对数据集只能"曲线救国"。UIEB数据集的做法是:把一张水下图像丢给11种增强算法各处理一遍,再让志愿者挑出视觉效果最好的结果当"参考图"。EUVP用CycleGAN来生成对应的"干净"版本。LSUI则把同样的策略扩展到更大规模。听起来是不是有点"矬子里拔大个"的意思?这些参考图实际上并不是真正的无退化场景,它们带着各自算法或标注者的主观偏好。比如UIEB和EUVP的参考图明显残留绿色色偏,LSUI的参考图则过亮、带着一层薄雾般的面纱效果。用这样的数据训练出来的模型,学到的是"数据集的审美偏好",而不是水下成像物理本身。
项目演示图:π-SUB数据集展示
图:π-SUB项目演示图,展示生成的水下图像与参考图像对比效果
合成数据则巧妙地绕开了这个物理悖论:先把干净参考图构造出来,再施加一个已知的退化过程。但合成这条路也分两派。一派是"外观迁移派",比如用生成对抗网络、物理引导风格迁移或游戏引擎渲染,直接从真实照片中学习水下外观。这类方法视觉多样性不错,但光学生成源只是参考集合里恰好含有的水体类型,想外推到没见过光学条件?抱歉,没有控制机制。另一派是"物理建模派",从显式的图像形成模型出发,最常见的便是Jaffe–McGlamery模型。物理派原则上能够覆盖参考照片集中不存在的光学条件,但现有方法普遍存在三个关键漏洞:第一,假设海面照度恒定,忽略了随深度衰减的下行辐照度;第二,没有考虑生物驱动的光学过程,比如叶绿素吸收、有色溶解有机物(CDOM)和叶绿素荧光;第三,没有联合建模悬浮
颗粒物引起的体积散射(volumetric scattering)以及随距离累积的雾气效应。这三大缺口的并存,导致现有合成数据集几乎找不到一个能同时覆盖水下成像主要物理与生物过程的方案,合成数据与真实水下图像之间的域差异因此长期悬而未决。
π-SUB正是冲着这个“阿喀琉斯之踵”去的。它在经典的Jaffe–McGlamery图像形成模型基础上做了一次系统性升级:显式建模随深度衰减的下行辐照度(downwelling irradiance);把吸收与散射按生物组分拆解——叶绿素吸收、有色溶解有机物CDOM、甚至叶绿素荧光全部纳入;再把悬浮颗粒物和体积雾作为可控的残差现象独立叠加。参考图像来自Unreal Engine渲染与精选的真实图像,退化过程中的所有光学参数都被完整记录。
表1:合成水下数据集的物理与结构属性对比
表1:合成水下数据集的物理与结构属性对比。VD:垂直深度;IOP:Jerlov固有光学属性;Bio:生物效应;Inv:可逆性;Meta:元数据。
表1把当前主流合成水下数据集放在六个维度上对比。VD表示是否建模深度依赖的下行辐照度,IOP表示是否基于Jerlov水体类型的固有光学属性做参数化,Bio表示是否包含生物光学效应,Inv表示退化过程是否可逆,Range表示是否逐像素建模场景距离,Meta表示是否提供完整的元数据。可以看出,SUIEB、SUID、Syrea、PHISWID、RSUIGM和MUSE都在至少一个关键物理维度上存在缺失,而π-SUB则是唯一在全部六个维度上都打勾的框架。

π-SUB框架:从物理原理到逼真图像的完整管线

图1:π-SUB数据集生成框架的整体结构示意图
图1:π-SUB数据集生成框架的整体结构示意图。
π-SUB的完整流程如上图所示。框架接收三类输入:干净参考图像源(Unreal Engine渲染场景+精选真实图像)、物理水体配置(Jerlov水体类型、相机深度以及由此推导的固有光学属性IOP与表观光学属性AOP)、增强真实感配置(是否叠加悬浮粒子、体积雾、生物效应)。随后依次经过三个阶段:先估计密集距离图并转换到米制水下距离;再用改进的物理成像模型合成确定性退化结果;最后按需要施加三类附加现象,生成现象专属子集与全增强子集。
先看参考图像池。Unreal Engine渲染子集在没有水介质的条件下记录场景反射率,太阳作为唯一光源,下行辐照度归一化,每张渲染图附带精确的距离、深度和逐实例语义标注。场景覆盖珊瑚礁、沉船、岩石海床、海草、大型藻类、潜水员、海洋动物和鱼群等典型水下环境。由于商用资产库无法完全表达自然生态的多样性,框架还从UIEB和LSUI中精选了约10%的真实图像,挑选标准是浅水、残余介质效应极小、且RGB通道响应平衡。更重要的是,两套图像共享同一个退化模型,唯一的系统性差异是场景外观而不是退化机制。
接下来是范围估计。退化模型需要逐像素的水平距离,但真实图像并没有对应的深度传感器数据。为确保渲染图与真实图像在深度统计上的一致性,框架对两个子集统一使用单目深度估计器Depth Anything V2,输出归一化相对深度后,再按水体类型相关的最大可见距离换算成米制水平距离:zs = zmax(1 − zn)。渲染子集自带的深度缓冲器则作为元数据保留,用于定量验证估计精度。
核心环节是改进的物理成像模型。经典Jaffe–McGlamery模型把水下观测分解为直射传输和背向散射两项,但π-SUB并不沿用单一衰减系数,而是将两个分量分开建模:
公式1:直射分量与背向散射分量的衰减系数分解
公式1:直射分量与背向散射分量的衰减系数分解。
直射信号主要由吸收主导,因为水下的前向散射高度集中,大部分散射光子仍留在相机接收角内,所以直射路径的消光系数取a + 0.05b;背向散射是光子被散射回传感器方向,经历的是完整的束流衰减a + b。这个修正来自Akkaynak和Treibitz的模型,π-SUB把它吸收进自己的综合框架。
经典模型的另一个问题是把垂直深度与水平距离混为一谈,海面照度被当作恒定不变的常量。实际上,光线穿过水柱到达场景之前,已经经历了垂直方向上的衰减。π-SUB引入漫衰减系数Kd来刻画下行辐照度的深度衰减:
公式2:漫衰减系数K_d由固有光学属性推导
公式2:漫衰减系数Kd由固有光学属性推导。
这个公式来自Morel和Loisel以及Williamson的海洋光学模型,其中μd是下行光在紧贴海面处的平均余弦(大洋水体取0.89,沿岸水体取0.85),η是纯水散射占总散射的比例,G(η, μd)是几何因子。深度d处的下行辐照度由此得到:
公式3:下行辐照度随深度的指数衰减
公式3:下行辐照度随深度的指数衰减。
E0为海面辐照度。由于Kd < a + b,垂直方向的光衰减速度低于水平方向,深度与距离因此是不可互换的两个物理量。正是这个机制,让π-SUB能自然模拟深水场景随相机下潜逐步变暗的视觉效果。
背景光B∞也不再是随便设置的常数。π-SUB先由分子散射与粒子散射的比例重构后向散射系数bb,再按单次散射模型计算:
公式4:由后向散射系数导出的背景光B_∞
公式4:由后向散射系数导出的背景光B∞。
可以看到B∞继承了Ed的深度依赖性:相机下潜越深,背景光越暗。这比传统模型把B∞设为固定常量更贴近真实的深海拍摄体验。
在生物光学层面,π-SUB把吸收系数分解为纯水、叶绿素和CDOM三项:
公式5:吸收系数分解为纯水、叶绿素与CDOM三部分
公式5:吸收系数分解为纯水、叶绿素与CDOM三部分。
叶绿素吸收遵循Bricaud幂律achl(λ) = Aλ·CchlEλ,其中Cchl是叶绿素浓度;CDOM吸收与叶绿素浓度耦合:acdom(λ) = achl(440)·M·e−α(λ−440)。由于叶绿素浓度作为独立参数出现,用户可以把同一场景沿不同生产力梯度连续渲染。更进阶的是,叶绿素不只会吸收光,还会在685nm附近重新发射荧光——这是一个无法用任何衰减系数表示的加性发光过程:
公式6:叶绿素荧光发射向量
公式6:叶绿素荧光发射向量(685nm附近)。
fem近似为[0.97, 0.03, 0.00],对应荧光在RGB通道上的红偏分布。三种增强现象(悬浮粒子、体积雾、生物荧光)可以单独生成,也可以全部叠加,得到不同复杂度的训练样本。
图2:联合退化效果展示
图2:联合退化效果展示:大洋水体(I–III型)保留蓝绿色调,沿岸水体(1C–9C型)整体均匀变暗。
不同水体类型、不同相机深度、不同水平距离下的联合退化结果如图所示。大洋水体保留明显的蓝绿色调,沿岸水体三个通道都被更强烈地衰减,画面整体均匀变暗,与潜水拍摄的直觉完全一致。

超逼真度验证:如何证明合成数据“以假乱真”

合成数据的第一关是“像不像”。论文用Fréchet Inception Distance(FID)量化合成图像与真实水下图像在深度特征空间中的分布距离,FID越低表示两个分布越接近。真实一侧的分布由UIEB、RUIE、SQUID、OceanDark、FishTrac五个真实数据集拼接而成;合成一侧则包含π-SUB以及SUID、SUIEB、PHISWID、Syrea四个现有合成数据集。
表2:各聚类及全局FID对比
表2:各聚类及全局FID对比(越接近真实越好)。
表中按感知聚类分别报告了FID,最后一行是全局FID。π-SUB在大多数聚类上大幅领先,全局FID比次优的Syrea降低了约46%。这个差距在分布对齐类任务中已经属于质的飞跃,表明π-SUB合成的图像在颜色、纹理、雾感等高层特征上非常贴近真实水下照片。
图3:K=7聚类特征空间上的代表性对比
图3:K=7聚类特征空间上的代表性对比:(a)真实水下图像;(b)对应的π-SUB生成图像。
为了让“以假乱真”更直观,论文在真实图像的特征空间上执行K=7的K-means聚类,再把每个聚类的真实图像与对应的π-SUB生成图放在一起对比。无论是清澈的大洋水体、浑浊的沿岸水体,还是低光的深海场景,π-SUB都能在色调、对比度和雾感三个维度上复现出真实分布的观感。此外,论文还统计了合成图像落在真实特征流形之外的比例,π-SUB的越界率同样是最低的,说明它的合成分布没有偏离真实水域。

泛化性验证:跨架构、跨数据集的全面检验

合成数据做得再逼真,最终也要看下游增强模型买不买账。论文选取了四种有代表性的水下图像增强架构:FUnIE-GAN(基于条件对抗网络的快速增强模型)、Pix2Pix(经典成对图像翻译模型)、PUIE-Net(物理信息引导的增强网络)和Phaseformer(基于相位信息的Transformer增强模型)。这四种架构分别在六个训练集上独立重训——五个合成数据集加一个真实配对数据集UIEB,然后用统一的超参数在六个真实水下基准上评测。
评测使用两个无参考指标:UIQM(Underwater Image Quality Measure)综合色彩、清晰度与对比度,数值越高越好;NIQE(Natural Image Quality Evaluator)刻画图像自然度,数值越低越好。
表3:六种训练数据集下增强模型的UIQM与NIQE对比
表3:六种训练数据集下增强模型在UIEB、OceanDark、SQUID上的UIQM与NIQE对比。
表3的结果非常直观:π-SUB训练的模型在四种架构、六个真实测试集上,UIQM相比次优的PHISWID平均提升4.18%,相比Syrea提升9.46%;NIQE相比PHISWID降低48.78%,相比Syrea降低23.98%。特别值得注意的是,在完全相同的训练预算下,π-SUB没有依赖任何真实配对数据,却在多个指标上追平甚至反超了直接用UIEB真实配对数据训练的模型。
表4:π-SUB训练的模型与现有先进方法的UIQM/NIQE对比
表4:π-SUB训练的模型与现有先进方法的UIQM/NIQE对比。
表4进一步把π-SUB训练的模型与当前的先进增强方法放在一起对比。可以看到,π-SUB训练出的模型在UIQM和NIQE两项指标上稳定进入各数据集的前两名,部分场景的表现超过了用真实配对数据训练的对照组。
图4:三个真实基准上的代表性增强结果
图4:三个真实基准上的代表性增强结果:UIEB(浅水混合场景)、OceanDark(低光深海)、SQUID(清澈大洋)。列(a)–(d)分别对应Pix2Pix、FUnIE-GAN、Phaseformer、PUIE-Net。
定性结果也印证了上面的量化结论。在UIEB、OceanDark和SQUID三个代表性数据集上,四种架构用π-SUB训练后,消除色偏、提升对比度的效果明显更加稳定。尤其是OceanDark这样的模拟低光深海水域,此前几乎没有合成数据集能有效覆盖,π-SUB通过深度依赖辐照度重建了暗光环境的分布特性,增强模型在它身上学到的能力可以无缝迁移到真实低光水下图像上。

消融与下游任务:每个物理组件都不可或缺

每个物理组件到底贡献了多少?论文设计了四组训练数据:仅基础模型(Base)、基础+体积雾(+Haze)、基础+生物效应(+Bio)、三者全加(即完整π-SUB),用FUnIE-GAN在六个真实基准上对比。
表5:π-SUB在六个真实基准上的消融研究
表5:π-SUB在六个真实基准上的消融研究。
结果很明确:去掉任何一个组件都会损失跨数据集泛化能力。生物效应对沿岸浑浊水体影响最大,因为这类场景中存在大量浮游植物与CDOM;体积雾对深海低光场景更关键,它补充了距离相关的散射累积效果;两者叠加后,模型基本达到完整配置的泛化水平。从定性消融图也能看出:Base模型的输出在色偏严重的图像上恢复吃力;+Haze缓解了雾化但颜色仍然偏差;+Bio改善了色偏但暗部细节不足;完整的π-SUB在色彩、对比度和细节三个维度上表现最均衡。
图5:FUnIE-GAN在π-SUB训练数据下的定性消融结果
图5:FUnIE-GAN在π-SUB训练数据下的定性消融结果。
最后是下游任务验证。水下增强不能只停留在“看起来变好看了”的层面,还得服务于视觉定位与建图等机器人任务。论文在SQUID的Katzaa连续帧数据上做了SIFT特征匹配测试:原始退化图像只能匹配23对关键点,用PHISWID训练的模型增强后能匹配85对,而用π-SUB训练的模型增强后能匹配到157对——比原始图像提升近7倍,比次优合成数据集提升近一倍。
图6:SQUID Katzaa数据集上的SIFT关键点匹配对比
图6:SQUID Katzaa数据集上的SIFT关键点匹配对比。
特征匹配数量直接影响水下机器人的视觉里程计、地图构建和自主导航能力。π-SUB增强后的图像保留了更多可重复检测的底层特征,这意味着在浑浊且光照多变的真实水下环境中,机器人可以获得更稳定的视觉先验。

总结与展望:水下视觉的下一站

π-SUB是第一个在同一框架内完整建模深度依赖下行辐照度、Jerlov固有光学属性、生物光学效应、体积散射与悬浮粒子的水下图像合成方案。FID相对Syrea降低46%,四个架构在六个真实数据集上全面领先,下游特征匹配数量提升近7倍——这三组数字共同说明:合成数据与真实世界的鸿沟,不是靠模糊的外貌拟合,而是靠扎实的物理建模一步一步填平的。
当然,π-SUB也有明显的边界。均匀水体假设对近岸极度浑浊区域的多次散射建模仍然不足;参考图像池中真实图像占比约10%,对自然生态多样性的覆盖有限;单目深度估计器在极端浑浊环境中的误差会沿管线向后传播;FID这类分布指标只能辅助判断生成质量,最终仍需要任务级验证。后续工作可以考虑把生成框架封装成交互工具,像调节单反相机参数一样调节水体类型、深度和叶绿素浓度;也可以把物理模型直接嵌入增强网络的训练过程,实现物理约束的端到端学习。对于无人潜航器的数据闭环建设来说,π-SUB提供了一条低门槛、高可控的数据生产新路径。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出π-SUB,一个物理信息引导的合成水下基准数据集生成框架。通过扩展Jaffe–McGlamery成像模型,显式建模深度依赖下行辐照度、生物光学吸收、环境散射及全部十种Jerlov水体类型,合成14,040对配对图像。
这篇工作最值得看的点是什么?π-SUB在超逼真度方面达到全局FID为95,比最佳现有合成基准Syrea(176)低46%;在泛化性方面,跨4种UIE架构和6个真实基准数据集,UIQM比PHISWID提高4.18%、比Syrea提高9.46%,NIQE分别降低48.78%和23.98%;在下游特征匹配任务中,SIFT匹配数从原始图像的23提升到157,比PHISWID提高1.8倍。
这篇工作的边界或风险在哪里?优点:(1)物理建模全面,涵盖深度相关下行辐照度、Jerlov IOPs、生物光学效应(叶绿素吸收、CDOM、荧光)等关键物理过程;(2)数据集规模大(14,040对),覆盖所有十种Jerlov水型;(3)提供完整物理元数据,保证可复现性;(4)双轴评估协议(超逼真度和泛化性)系统全面。缺点:(1)荧光模型尚未通过原位测量独立验证;(2)真实参考图像仅占约10%,可能限制场景多样性;(3)单目深度估计器引入的深度误差可能影响合成质量;(4)数据集规模相对较小(117张参考图像生成)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个基于扩展Jaffe-McGlamery成像模型的物理信息合成水下基准数据集生成框架,通过建模深度相关下行辐照度、生物光学效应和体积散射等物理过程,生成超逼真且可泛化的成对水下图像训练数据。

实验合理度:★★★★☆

Fréchet Inception Distance (FID), 分布外率(OOD rate), UIQM, NIQE, SIFT关键点匹配数

学术研究价值:★★★★☆

提出一个基于扩展Jaffe-McGlamery成像模型的物理信息合成水下基准数据集生成框架,通过建模深度相关下行辐照度、生物光学效应和体积散射等物理过程,生成超逼真且可泛化的成对水下图像训练数据;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(数据集生成框架,不涉及模型推理计算量)

复现难度:★★★☆☆

https://github.com/airl-iisc/pi-SUB

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)荧光模型尚未通过原位测量独立验证;

主要参考文献

[1] B. McGlamery. A computer model for underwater camera systems. 1979.
[2] D. Akkaynak, T. Treibitz. A revised underwater image formation model. CVPR 2018.
[3] C. Li et al. An underwater image enhancement benchmark dataset and beyond. IEEE TIP 2019.
[4] M. J. Islam et al. Fast underwater image enhancement for improved visual perception. IEEE RA-L 2020.
[5] M. Solonenko, C. D. Mobley. Inherent optical properties of Jerlov water types. Applied Optics 2015.
[6] A. Bricaud et al. Variability in the chlorophyll-specific absorption coefficients of natural phytoplankton. JGR 1995.
[7] https://arxiv.org/pdf/2608.10589v1.pdf
[8] https://github.com/airl-iisc/pi-SUB

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🌊 从十种Jerlov水体到深度衰减、生物荧光,π-SUB把海洋光学"翻译"成了AI听得懂的语言!
潜水的小伙伴看过来,无论你是做水下图像增强、目标检测还是机器人导航,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,水下视觉的小伙伴们快来抱团~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。