← 返回 PaperDaily 视觉与图像

武大PROTEUS:水下图像恢复新SOTA,仅2.6M参数登顶U90

水下照片又绿又灰还带雾?武汉大学等机构的最新PROTEUS让你一键还原!它把“退化信息”从累赘变成向导,既用它引导特征调制,又用它控制跳跃连接复用。仅2.61M参数,U90的PSNR刷到25.50dB,LPIPS更是把第二名从0.086打到0.081,轻量又能打,值得一读。

武大PROTEUS:水下图像恢复新SOTA,仅2.6M参数登顶U90

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Degradation-Guided Underwater Image Restoration with Task-Oriented Latent Control
发表日期:
2026年8月
发表单位:
武汉大学国家多媒体软件工程技术研究中心,郑州大学,河南省科学院,澳门大学,广东工业大学
原文链接:
https://arxiv.org/pdf/2608.08661v1.pdf

引言:水下图像的“绿毛怪”难题

相信不少朋友都有这样的经历:去海岛度个假,兴高采烈地潜到水下,举起相机“咔嚓”一张,回岸上一看——完了,照片里的人和鱼全泡在绿油油或者蓝汪汪的汤里,对比度低得像是隔着一层毛玻璃。这就是水下图像的经典“翻车现场”。水下环境对光线的衰减是“看颜色下菜碟”的:红光衰减最快,蓝绿光相对坚挺,再加上水体里各种微粒的后向散射,最终得到的图像往往带着严重的色偏、低对比度和空间上不均匀的模糊。这种复杂的退化,比陆地图像的去雾、去雨要棘手得多。
传统的模型驱动方法,比如经典的暗通道先验,通过估计透射图和背景光来反演图像形成模型。听起来很物理、很优雅,但现实世界经常不按先验出牌——一旦场景里有大面积白色物体或者人工光源,暗通道先验就容易“翻车”,结果要么过度补偿,要么留下诡异的色偏。深度学习方法虽然能靠数据驱动硬生生学出一个从退化图像到清晰图像的映射,但很多方法在编解码过程中,直接通过跳跃连接把编码器特征原封不动地传给解码器。问题在于:编码器特征里既包含恢复有用的细节,也掺杂着退化的信息。这些“退化因子”如果不加管控地一路传到解码器,就可能在重构阶段被放大,拖累最终效果。
武汉大学等单位提出的PROTEUS,恰恰抓住了水下退化信息的这种“双重角色”:一方面,退化信息在空间和光谱上的分布模式,本身就能为自适应恢复提供宝贵线索——比如画面左边偏绿、右边偏蓝,说明不同区域的光衰减情况不一样,恢复策略理应跟着调;另一方面,退化信息又像混进编码器特征里的“杂质”,得想办法在解码前把它“管起来”,而不是让它在跳跃连接里一路裸奔。
图1把这两层意思画得很清楚:(a)说明退化信息既是有用的恢复线索,也可能纠缠在编码器特征里;(b)对比了传统U型网络直接传跳跃特征,和PROTEUS用退化引导特征适应+任务导向潜在控制来调控跳跃特征复用的区别;(c)则是在U90数据集上的代表对比,PROTEUS输出的颜色更均衡、局部细节也更清爽。
图1:PROTEUS的动机与概览。(a) 退化信息既提供恢复线索,也可能纠缠在编码器特征中。(b) 不同于传统U型网络直接经跳跃连接传播编码器特征,PROTEUS结合退化引导特征适应与任务导向潜在控制来调控跳跃特征复用。(c) U90上的代表性对比,PROTEUS产生更均衡的颜色和更清晰的局部细节。
PROTEUS的动机与概览。(a) 退化信息既提供恢复线索,也可能纠缠在编码器特征中。(b) 不同于传统U型网络直接经跳跃连接传播编码器特征,PROTEUS结合退化引导特征适应与任务导向潜在控制来调控跳跃特征复用。(c) U90上的代表性对比,PROTEUS产生更均衡的颜色和更清晰的局部细节。
一句话概括这篇工作的核心:把“退化信息”从单纯要消除的干扰,变成既能指导处理、又要被约束管理的双刃剑。这个思路听起来不复杂,但落到具体网络设计上,PROTEUS给出了不少细节讲究,下面慢慢拆。

水下图像恢复的“双重角色”难题

要理解PROTEUS的精妙之处,得先把水下退化信息这回事掰开揉碎了看。想象一下,一张水下照片里,靠近光源的区域可能颜色还算正常,远离光源的地方就变蓝变暗,中间还掺杂着悬浮颗粒造成的局部模糊——这种空间非均匀退化,用一套全局参数去恢复是远远不够的。
论文提出了一个很有意思的观点:退化信息在水下图像恢复任务中扮演着双重角色。第一重角色是“向导”:退化信息在空间和光谱上的分布模式,恰恰告诉了我们哪里退化严重、哪里退化轻微、色偏的方向是什么,这些线索可以指导网络做自适应的恢复。第二重角色是“干扰”:当编码器逐层提取特征时,退化因子会不可避免地纠缠在特征表示里。如果这些纠缠了退化信息的特征经过跳跃连接直接传给解码器,就相当于把“杂质”也一并输送了过去,解码器在重构时可能会放大这些退化伪影,影响恢复质量。
传统方法的问题就在于,它们要么只看到了第一重角色,把退化信息当作输入条件用一下,但用得不充分;要么完全无视第二重角色,让编码器特征在跳跃连接里“裸奔”。PROTEUS的思路是把这两重角色统一到一个框架里:既充分利用退化线索做引导,又通过任务导向的潜在控制把退化纠缠的特征“管起来”。

退化引导与潜在控制的协同设计

PROTEUS的整体架构看起来是一个经典的三层U型网络,但内部设计大有文章。整个网络以全局残差方式构建,可以用一个简洁的公式概括:
公式1:整体前向传播的全局残差公式。其中 E 表示编码器,P 表示瓶颈潜在控制器,D 表示解码器,I_d 是输入的退化图像,I_d 波浪线是引导图像。全局残差连接确保网络只需要学习恢复残差。
公式1:整体前向传播的全局残差公式。其中 E 表示编码器,P 表示瓶颈潜在控制器,D 表示解码器,I_d 是输入的退化图像,Ĩ_d 是引导图像。全局残差连接确保网络只需学习恢复残差。
通俗地讲,网络不直接输出完整恢复图,而是输出一个“修正量”,再把这个修正量加到原始输入上。这样做的直接好处是:网络可以把精力集中在学习退化与清晰之间的差异上,而不是从零开始“画”一张图,训练更稳定,收敛也更快。
整个流程可以用图2的架构图来理解。输入端,原始图像会经过一个灰度边缘先验模块(Gray-Edge Prior Module, GEPM),生成一张引导图像。这张引导图像会参与编码器和解码器多个阶段的特征调制。与此同时,编码器最深层特征经过一个任务导向的潜在控制器,生成一个结构化的控制码,这个控制码一方面直接解码参与重构,另一方面通过通道级注意力门控来调制每一层跳跃连接的特征。
图2:PROTEUS的网络架构。整体框架在U型骨干网络内结合了退化引导特征处理与任务导向潜在控制。灰度边缘先验模块生成的引导图像在多个阶段调节编码器和解码器特征,结构化的瓶颈控制码在跳跃特征融合到解码器之前对其进行调制。全局残差路径保证稳定重构,光度与几何增强分支仅在训练时使用以提升对多样水下退化的鲁棒性。
图2:PROTEUS的网络架构。整体框架在U型骨干网络内结合了退化引导特征处理与任务导向潜在控制。灰度边缘先验模块生成的引导图像在多个阶段调节编码器和解码器特征,结构化的瓶颈控制码在跳跃特征融合到解码器之前对其进行调制。全局残差路径保证稳定重构,光度与几何增强分支仅在训练时使用以提升对多样水下退化的鲁棒性。
每层的处理单元是引导动态特征调制块(Guided Dynamic Feature Modulation Block, GDFMB),它由两个子模块构成:引导退化自适应块(Guided Degradation-Adaptive Block, GDAB)和梯度融合块(Gradient Fusion Block, GFB)。前者负责从引导图像中提取空间变化的退化线索来调制特征,后者负责保持和增强高频细节。两个子模块以残差比例0.5的方式融合,既保证自适应调节能力,又不丢失原始特征中的结构信息。

GDFMB:空间自适应退化特征调制

GDFMB是PROTEUS在特征层面做文章的核心武器。它的输入有两个:一个是引导图像,一个是当前阶段的中间特征图。输出是调制后的特征图,形状和输入特征一致。这个模块最巧妙的地方在于GDAB中使用的可变形交叉注意力机制。
先解释一下“可变形”的含义。常规的注意力机制在处理查询特征时,会在整张特征图上全局寻找相关信息,计算量大且可能“注意力分散”。可变形注意力则不同:每个查询位置会先预测一个二维偏移量,只在偏移后的局部区域做注意力计算,相当于学会了“该往哪儿看”。公式如下:
公式2:可变形偏移预测。Δp_g 是第 g 组查询预测的二维偏移场,OffsetNet 是零初始化的偏移网络,tanh 激活将偏移限制在有限范围内,ρ 根据分辨率归一化偏移,r 控制偏移范围。
公式2:可变形偏移预测。Δp_g 是第 g 组查询预测的二维偏移场,OffsetNet 是零初始化的偏移网络,tanh 激活将偏移限制在有限范围内,ρ 根据分辨率归一化偏移,r 控制偏移范围。
在PROTEUS的GDAB中,特征图作为查询(Query),引导图像作为键值(Key-Value)。查询特征被分成若干组,每组独立预测自己的偏移量,然后在引导图像的对应区域采样信息。这样一来,每个特征位置就能“按需”从引导图像中提取跟自己的退化情况最相关的线索——画面左边偏绿的特征位置,会自动去关注引导图像左边区域的色偏信息;画面右边清晰的区域,则不会受到左边退化信息的干扰。这种空间自适应的特性,正好对上了水下退化空间非均匀的特点。
交叉注意力之后,GDAB还串联了一个巧妙的高斯基展开调制分支。这个分支先把全局平均池化得到特征嵌入和退化嵌入,然后将每个元素通过一组高斯径向基函数展开,得到更丰富的特征表示。这背后是一个很直观的想法:把单个数值映射到一组高斯基函数的激活值上,相当于给网络提供了更高维度的“描述语言”,可以更精细地表达特征之间的细微差别。基函数的中心在数值范围内均匀分布,宽度则由数值范围自适应确定。最终,原始特征嵌入和高斯基展开表示通过一个可学习的softmax门控做加权融合,让网络自己决定更信任哪种表示。
公式3:高斯基函数。φ_k(x) 表示第 k 个高斯基函数的激活值,μ_k 是均匀分布的中心,δ 由数值范围决定。
公式3:高斯基函数。φ_k(x) 表示第 k 个高斯基函数的激活值,μ_k 是均匀分布的中心,δ 由数值范围决定。
如果说GDAB负责的是“调制”,那么GFB负责的就是“保边”。水下图像最常见的痛点之一就是边缘模糊、纹理细节丢失。GFB先对输入特征用通道级Sobel算子计算梯度幅值,得到一个空间梯度掩膜,这个掩膜能标出哪些位置是边缘结构所在。然后通过一个可学习的标量参数,控制梯度信息对特征调制的贡献程度。可以把它理解成一个“边缘高亮器”——让网络在恢复过程中更关注边缘区域的细节重建,而不是把所有区域一视同仁。
公式4:梯度幅值计算。G_x 和 G_y 分别是 x 和 y 方向的Sobel梯度,ε 是防止开方无定义的微小常数。
公式4:梯度幅值计算。G_x 和 G_y 分别是 x 和 y 方向的Sobel梯度,ε 是防止开方无定义的微小常数。

任务导向潜在控制器:从重构到调控

如果说GDFMB是在特征的“上游”做文章,那么任务导向潜在控制器就是在“下游”把住关口。它在编码器的最深层特征之上,用两个级联的卷积块(ConvsBlock)作为Mapper,将最深层特征分解为两部分:控制码F_z和互补残差F_res。
公式5:Mapper的分解。M 表示Mapper映射器,F_l 是最深层特征,F_z 是任务导向控制码,F_res 是互补残差。
公式5:Mapper的分解。M 表示Mapper映射器,F_l 是最深层特征,F_z 是任务导向控制码,F_res 是互补残差。
需要特别强调的是,论文刻意避免把这种分解解释成“干净特征/退化特征”的物理分离。控制码F_z的意义不在于它本身代表什么物理含义,而在于它的“功能”:它一方面直接参与解码,另一方面通过通道级注意力门控去调制每一层跳跃连接的特征。这种“按角色定义表示”的思路,是任务导向潜在控制与传统潜在表示学习方法的关键区别。
光有结构还不够,还得让控制码“学好”。论文设计了三种正则化约束来引导控制码的学习,总损失为:
公式6:潜在中心正则化总损失。由对齐损失、正交损失和对比损失三项加权组成。
公式6:潜在中心正则化总损失。由对齐损失、正交损失和对比损失三项加权组成。
第一项是参考潜在引导,简单说就是让控制码F_z尽量靠近用同一编码器从清晰参考图提取的潜在表示F_z_gt。这相当于给控制码的学习提供了一个“标准答案”做锚点,帮助它捕捉与恢复任务最相关的信息。第二项是正交正则化,鼓励控制码和互补残差F_res之间尽量“不重叠”,减少冗余信息,让两个表示各自承担不同的功能。第三项是对比正则化,从其他退化图像恢复方法的输出中预计算一批负样本,拉大控制码与负样本之间的距离,防止表示坍缩——避免所有输入都学到同一个控制码。
公式7:参考潜在对齐损失。F_z 是退化图像的控制码,F_z_gt 是清晰参考图的潜在表示,使用L2距离对齐。
公式7:参考潜在对齐损失。F_z 是退化图像的控制码,F_z_gt 是清晰参考图的潜在表示,使用L2距离对齐。
公式8:正交正则化损失。F_z 和 F_res 是归一化后的控制码与互补残差,B 为批量大小,鼓励二者内积趋近于零。
公式8:正交正则化损失。F_z 和 F_res 是归一化后的控制码与互补残差,B 为批量大小,鼓励二者内积趋近于零。
公式9:对比正则化损失。N 是负样本集合,d 为距离度量,m 是间隔常数,目标是最小化控制码与正样本的距离并拉开与负样本的距离。
公式9:对比正则化损失。N 是负样本集合,d 为距离度量,m 是间隔常数,目标是最小化控制码与正样本的距离并拉开与负样本的距离。
最后,控制码F_z通过自适应平均池化和一个两层MLP生成通道级权重,对跳跃连接的特征逐通道缩放,然后才送入解码器融合。这个过程用公式表示就是:
公式10:注意力门控。F_s 是经门控调制后的跳跃特征,F_out_enc 是编码器输出特征,GAP 是全局平均池化,MLP 是两层感知机,σ 是sigmoid激活函数。
公式10:注意力门控。F_s 是经门控调制后的跳跃特征,F_out_enc 是编码器输出特征,GAP 是全局平均池化,MLP 是两层感知机,σ 是sigmoid激活函数。
这一套组合拳下来,控制码不再只是一个“更好的特征表示”,它直接成了调控整个解码过程重构行为的“指挥棒”。论文通过实验证明,即使控制码在原始特征空间中的距离并不一定更接近清晰图像,它依然能在“指导跳跃连接复用”这件任务上发挥出色作用——这正是任务导向设计的精髓。
为了验证控制码确实学到了有用的结构信息,论文对潜在空间做了t-SNE可视化和门控干预实验。结果显示,控制码在表示空间中确实发生了有意义的“重映射”,而且门控干预实验表明——如果把训练好的门控权重打乱或者换成固定权重,恢复性能会显著下降,说明控制码不是“摆设”,而是实打实地在调控跳跃特征的复用。
此外,为了让控制码学得更稳,PROTEUS还引入了两项训练策略:光度与几何增强。光度增强模拟水下不同深度、不同光照下的光谱衰减变化,随机调整红蓝通道的偏移和增益;几何增强则通过对网络预测施加弱/强扰动视图的一致性约束,让网络对几何形变保持鲁棒。这些增强策略只在训练时启用,推理时完全不影响效率。

实验结果:轻量高效的全面领先

实验环节是检验方法成色的试金石。PROTEUS在五个有参考数据集(U90、LSUI、UFO-120、EUVP-Scene、EUVP-Dark)和四个无参考数据集(U45、Challenge-60、UCCS、EUVP-330)上进行了全面评估,对比方法覆盖了从WaterNet、Ucolor到UniUIR、MoCE-IR、WWE-UIE等近年来有代表性的水下图像恢复方法。
表1:U90和LSUI-400两个有参考数据集的定量结果。PROTEUS在U90上PSNR达到25.50dB、LPIPS达到0.081均为最优,SSIM与最优方法持平;在LSUI-400上PSNR达28.99dB、LPIPS 0.083均为最优。
表1:U90和LSUI-400两个有参考数据集的定量结果。PROTEUS在U90上PSNR达到25.50dB、LPIPS达到0.081均为最优,SSIM与最优方法持平;在LSUI-400上PSNR达28.99dB、LPIPS 0.083均为最优。
从表1可以看到,PROTEUS在U90上PSNR达到25.50dB,比第二名的UniUIR高0.39dB,比WWE-UIE高1.33dB;LPIPS从第二名的0.086进一步降低到0.081,降幅约6%。这里LPIPS是感知相似度指标,数值越低代表感知质量越好。在LSUI-400上,PSNR达到28.99dB,同样占据榜首。
表2与表3:表2为UFO-120、EUVP-Scene、EUVP-Dark三个有参考数据集的定量结果;表3为U45、Challenge-60、UCCS、EUVP-330四个无参考数据集的定量结果。PROTEUS在EUVP-Scene上PSNR达28.39dB、SSIM 0.893均为最优,在UFO-120上SSIM 0.894为最优。
表2与表3:表2为UFO-120、EUVP-Scene、EUVP-Dark三个有参考数据集的定量结果;表3为U45、Challenge-60、UCCS、EUVP-330四个无参考数据集的定量结果。PROTEUS在EUVP-Scene上PSNR达28.39dB、SSIM 0.893均为最优,在UFO-120上SSIM 0.894为最优。
在另外三个有参考数据集上,PROTEUS同样表现出色。UFO-120上SSIM 0.894是全场最佳;EUVP-Scene上PSNR 28.39dB、SSIM 0.893都是第一,比第二名的UniUIR高了将近0.9dB的PSNR;EUVP-Dark上PSNR 22.68dB也是最好的。更值得注意的是,PROTEUS的参数量只有2.61M,FLOPs只有18.52G,在“性能-效率”平衡上明显优于大多数对比方法——比如UniUIR有29.19M参数、78.07G FLOPs。
无参考数据集上的表现同样稳健。在U45、Challenge-60、UCCS、EUVP-330四个数据集上,PROTEUS在12个“数据集-指标”组合中拿到了4个第一、2个第二。无参考数据集没有标准答案,衡量的是恢复结果在颜色、对比度、锐利度等方面的主观感知质量,能在这些指标上拿到多个第一,说明PROTEUS的恢复结果确实更符合人类视觉偏好。
图3:U90数据集上的完整视觉对比。PROTEUS在色彩平衡、局部细节和对比度方面都展现出明显优势,尤其是珊瑚礁纹理和水下岩石的层次感保持得更好。
图3:U90数据集上的完整视觉对比。PROTEUS在色彩平衡、局部细节和对比度方面都展现出明显优势,尤其是珊瑚礁纹理和水下岩石的层次感保持得更好。
在消融实验方面,论文分别验证了各模块的贡献。表4的消融结果显示,去掉GDFMB中的可变形交叉注意力、去掉梯度融合块、去掉任务导向潜在控制,都会带来性能下降,说明每个组件都各司其职、缺一不可。表5的测试时间门控干预实验则更加直观:如果把训练好的注意力门权重换成固定权重,或者在通道间打乱门权重,PSNR会显著下降;如果把门权重换成从其他图像推出来的,性能也会受损。这有力地证明了学习到的控制码和门控机制确实在“干活”,不是网络偷懒时顺便学到的无用表示。
表4:模块消融实验。移除GDFMB中的可变形交叉注意力或梯度融合块,或移除任务导向潜在控制,均导致性能下降,证明各模块的有效性。
表4:模块消融实验。移除GDFMB中的可变形交叉注意力或梯度融合块,或移除任务导向潜在控制,均导致性能下降,证明各模块的有效性。
表5:U90上测试时间跳跃门控干预实验。固定门控、通道打乱、跨图像门控均导致PSNR/SSIM明显下降,LPIPS上升,证明控制码门控不是摆设。
表5:U90上测试时间跳跃门控干预实验。固定门控、通道打乱、跨图像门控均导致PSNR/SSIM明显下降,LPIPS上升,证明控制码门控不是摆设。
论文还做了空间引导的分析实验,用统一引导(把空间变化的引导替换成逐通道均值)和跨图像引导(用下一张图的引导)来验证空间自适应引导的价值。结果在各个空间非均匀性评分区间内,完整空间引导的PSNR始终最高,充分验证了“空间变化退化线索”的利用效率。

总结与展望

PROTEUS的核心贡献可以提炼为三点。第一,它明确提出了水下退化信息的“双重角色”问题,并给出了对应的协同设计思路——既用退化线索引导特征处理,又对退化纠缠特征做调控。第二,它设计了GDFMB模块,通过可变形交叉注意力从引导图像中提取空间变化的退化线索,实现特征级自适应调制。第三,它提出了任务导向潜在控制器,把瓶颈表示训练成能调控跳跃连接复用的“指挥码”,而不是被动地追求“更干净的潜在表示”。
从更广的视角看,这篇工作带来的启发不止于水下图像恢复。“控制码调制跳跃特征”的模式,理论上可以迁移到其他图像恢复任务——比如去雾、去雨、低光增强——甚至更广泛的图像生成任务中。凡是存在“编码器特征既有用又有害”的场景,这种任务导向的潜在控制思路都值得尝试。当然,论文也还有一些可以继续深挖的方向。比如控制码的可解释性还可以加强——虽然t-SNE可视化暗示了重映射,但F_z的每个通道具体编码了什么语义,目前还像个黑盒。另外,三种潜在正则化的权重(0.1、0.05、0.05)是在验证集上调出来的,换到更大规模数据集上是否需要重新调整也有待验证。轻量化和高效这个特点也给边缘设备上的实时水下视频恢复留下了想象空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?水下图像受波长相关吸收、后向散射和空间变化光照影响,退化复杂且常有空间不均匀性。武汉大学等单位提出PROTEUS,以“退化引导的特征适应+任务导向潜在控制”双路径协同解决水下图像恢复问题。
这篇工作最值得看的点是什么?在U90上达到最佳PSNR(25.50)和LPIPS(0.081),在LSUI上达到最佳PSNR(28.99)和LPIPS(0.083),在UFO-120上达到最佳SSIM(0.894),在EUVP-Scene上两项指标均第一,在EUVP-Dark上达到最佳PSNR(22.68),在无参考数据集上12个指标组合中获得4个第一和2个第二。
这篇工作的边界或风险在哪里?优点:1)创新性地将退化信息双重角色(引导线索和需要调控的纠缠特征)统一建模;2)GDFMB通过可变形交叉注意力实现空间变化的退化引导;3)任务导向潜在控制器不要求潜在码接近干净图像潜在表示,更符合实际;4)模型轻量高效(2.61M参数)。缺点:1)引导图像预处理(Gray-Edge Prior)的增益相对有限;2)潜在控制码与干净潜在表示的距离反而增大,其可解释性有待加强;3)在部分数据集上SSIM指标未达到最优。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出PROTEUS框架,通过引导动态特征调制块(GDFMB)利用空间变化的退化线索引导特征自适应处理,并通过任务导向潜在控制器学习结构化控制码对跳跃连接特征进行通道级调制,实现退化信息双重角色的联合建模。

实验合理度:★★★★☆

PSNR、SSIM、LPIPS(有参考);UCIQE、UIQM、URanker(无参考)

学术研究价值:★★★★☆

提出PROTEUS框架,通过引导动态特征调制块(GDFMB)利用空间变化的退化线索引导特征自适应处理,并通过任务导向潜在控制器学习结构化控制码对跳跃连接特征进行通道级调制,实现退化信息双重角色的联合建。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

2.61M参数,18.52G FLOPs

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)引导图像预处理(Gray-Edge Prior)的增益相对有限;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球