← 返回 PaperDaily 视觉与图像

天津大学提出RISE:不用配对数据,0.35M参数拿下无监督低光增强SOTA

无监督低光增强容易做成一锅粥:曝光、噪声、结构全搅在一起。天津大学的RISE偏要分清楚——像光线从亮处往暗处传播一样,从可靠亮区推断全图光照结构,顺带用双测光参考做自适应曝光。0.35M参数跑出无监督SOTA,还不用配对数据,值不值得读,你说了算。

天津大学提出RISE:不用配对数据,0.35M参数拿下无监督低光增强SOTA

paperdaily_reaction_gif


原论文信息如下:
论文标题:
面向无监督低光增强的结构化光照学习
发表日期:2026年8月
发表单位:天津大学&敦煌研究院
原文链接:https://arxiv.org/pdf/2608.08153v1.pdf
项目链接:https://dutianle.ltd/RISE

低光增强的困境:固定曝光目标为何失效?

低光图像增强(LLIE)就是把欠曝光的照片“科学地”救回来。有监督方法需要成对的低光/正常光数据,但采集条件苛刻,于是无监督方法成为焦点。无监督没有“标准答案”,机器怎么知道“正确的亮度”是什么样?
先看一组数据:下图是七个常用基准数据集中每张图像平均亮度的经验累积分布函数(CDF)。不同数据集的亮度分布差异极大。如果用一个固定的曝光目标去增强所有图像,就好比用同一把钥匙去开所有的锁。
图1:(a)七个基准数据集逐图像平均亮度的经验累积分布函数;(b)RISE在所有基准上实现更优的PSNR-FLOPs权衡,用最少的FLOPs达到比此前SOTA方法更高的PSNR;(c)相对照明结构与绝对曝光的联合可视化:表面形状编码相对照明,高度编码绝对曝光,星号标记选中的KICs。
(a)七个基准数据集逐图像平均亮度的经验累积分布函数;(b)RISE在所有基准上实现更优的PSNR-FLOPs权衡;(c)相对照明结构与绝对曝光的联合可视化。
再看经典的Zero-DCE方法,它通过预测逐像素的高阶曲线参数来调整亮度,但训练时用的是一个统计分析得到的固定曝光值来构造监督信号。CLIP-LIT则依赖CLIP模型的文本-图像匹配来约束增强方向。这些方法的问题在于:它们用场景无关的固定目标来约束场景千变万化的真实图像。
更深层的麻烦在于低信噪比(SNR)区域的干扰。在严重欠曝光条件下,暗区像素观测值主要由传感器噪声主导。但现有方法在估计照明时,往往把整张低光图像视为均匀可靠的,把低信噪比区域的噪声当成了真实的照明信息来用。虽然SNR-Aware方法试图利用长程依赖来缓解,但它仍然把不可靠区域当作有用特征来处理。
图2:RISE的动机。(a)现有方法在增强时呈现不稳定的结果;(b)光源强度随场景因素衰减;(c)正常光照图像中的相对照明传播模式;(d)本方法的洞察:RISE从与关键照明线索的相对关系中学习照明结构。
图2:RISE的动机。(a)现有方法增强结果不稳定;(b)光源强度随场景因素衰减;(c)正常光照图像中的相对照明传播模式;(d)RISE从与关键照明线索的相对关系中学习照明结构。
还有一层被忽视的问题:场景光照本身到底该怎么表示?光照并非一个单一的标量,而是由空间变化的相对亮度关系(即相对照明结构)和控制绝对曝光水平的全局尺度共同构成的。现有的无监督方法,都把空间照明结构和绝对曝光搅在一起,二者的作用既不能被显式识别,也不能被独立控制。

核心创新:RISE如何解耦光照结构与曝光控制?

来自天津大学和敦煌研究院的研究团队,提出了一套名为RISE(Relative Illumination Structure Estimation)的方法,核心思路是:能不能像光线在实际场景中传播那样,从可靠的亮区出发,把照明结构一步一步“传导”到暗区去?
图3:RISE总览。RISE联合编码图像外观与相对照明,使用空间分散的KICs作为可靠锚点来估计照明结构,同时独立预测绝对曝光以实现场景自适应增强。
图3:RISE总览。RISE联合编码图像外观与相对照明,使用空间分散的KICs作为可靠锚点来估计照明结构,同时独立预测绝对曝光以实现场景自适应增强。
RISE的整体逻辑可以拆成两条主线。首先,它把输入图像转换到亮度通道,通过局部平均池化得到分块亮度图,再除以全局均值并取对数,从而得到一个不包含全局亮度信息的相对照明图Z。这个Z的每个元素代表该局部区域相对于整张图像平均亮度的偏离程度。这一步的关键在于:它把“亮度的绝对水平”这个信息剥离掉了,剩下的就是纯粹的照明空间分布模式。
公式1:相对照明图定义。P为分块亮度矩阵,mean(P)为全局平均亮度,ε为避免除零的极小常数,log将归一化亮度比映射为相对于单位比的符号偏移并压缩动态范围。
公式1:相对照明图定义。P为分块亮度矩阵,mean(P)为全局平均亮度,ε为避免除零的极小常数。
有了相对照明图Z之后,RISE从Z中最亮的若干图像块中选取N个空间上分散的区域,称为关键照明线索(Key Illumination Cues,KICs)。为什么要选亮区?因为亮区的信噪比高,像素观测值主要由真实场景信号构成,对亮区亮度值的预测要比对暗区可靠得多。然后,一个多层感知机(MLP)预测这N个KIC的目标亮度值,作为后续关系建模的“锚点”。
公式2:KIC与图像块之间的亮度差异和空间距离衰减核。Z_k_n为第n个KIC的相对照明值,Z_p为目标图像块p的相对照明值,d(p,k_n)为图像块网格距离,D为网格对角线长度。
公式2:KIC与图像块之间的亮度差异和空间距离衰减核。
对于图像中的任意图像块p和每个KIC k_n,RISE计算两个量:一个是亮度差异δ_n(p),即KIC的相对照明值减去目标图像块的相对照明值,它保留了观测到的相对亮度变化,隐式反映了遮挡、吸收等超出图像平面距离之外的因素;另一个是空间距离衰减核ρ_n(p),它模拟光在传播路径上的能量衰减——物理学上光照强度大致与距离的平方成反比,但真实传播距离是三维的,单张图像根本无法可靠恢复,所以这里只用图像平面距离作为软衰减代理,而非物理测量。
公式3:关系场定义。w_n、u_n、v_n为图像自适应系数,δ_n(p)为未调制的亮度差异项,ρ_n(p)δ_n(p)为距离加权差异项,ρ_n(p)Z_k_n为KIC照明强度的距离衰减传递项。
公式3:关系场定义。w_n、u_n、v_n为图像自适应系数。
这三个项各司其职:未调制的差异项δ_n(p)在图像平面距离不可靠时保留观测到的相对关系;距离加权项ρ_n(p)δ_n(p)把衰减先验和δ_n(p)中隐含的场景因素结合起来;衰减传递项ρ_n(p)Z_k_n则把KIC的照明强度按同样的衰减模式传递给目标图像块。三个可学习的系数w_n、u_n、v_n由MLP逐图预测,让多个亮区共同塑造每个图像块的关系场。最后,为了区分不同的场景级照明模式,RISE还引入了一个场景上下文向量c_scene,它概括了Z的全局统计量,通过仿射投影广播到所有区域。
那曝光控制怎么办?RISE的做法是用另一个MLP独立预测一个图像级的曝光偏移η。由于光照校正的本质是对亮度做重缩放而非平移,RISE在log增益空间(log-gain space)中参数化校正过程,这样各增益因子可以加法组合。最终的增益图由相对结构项S(p)和绝对曝光项η相加得到,增强结果则是输入图像逐元素乘以增益图的上采样指数。
公式4:增益分解。S(p)为相对照明结构场在位置p的值,η为图像级绝对曝光偏移,二者在log-gain空间中加法组合。
公式4:增益分解。S(p)为相对照明结构场在位置p的值,η为图像级绝对曝光偏移。
公式5:增强结果生成。I_low为输入低光图像,Up为最近邻上采样,G为预测的log增益图。
公式5:增强结果生成。I_low为输入低光图像,Up为最近邻上采样,G为预测的log增益图。
这种解耦设计的实际效果如何?看SICE数据集上的验证实验结果:对同一场景的不同曝光输入,RISE能够保持结构参数基本稳定,只让曝光参数η去吸收曝光水平的变化——它既能增强欠曝光输入,也能抑制过曝光场景。相比之下,不同场景间的结构参数一致性则明显较低,说明结构参数确实在编码场景特异的照明模式,而不是把曝光信息混在里面。这在物理上说得通:同一场景的相对照明结构不随曝光时间改变而改变,但绝对曝光水平变了。
图4:SICE上照明结构与曝光解耦的验证。在同一场景的不同曝光下,RISE保持相对参数稳定而调整绝对曝光,展示了其既能增强欠曝光输入又能抑制过曝光场景的能力。
图4:SICE上照明结构与曝光解耦的验证。在同一场景的不同曝光下,RISE保持相对参数稳定而调整绝对曝光。

关键设计:KICs与DMER如何实现场景自适应增强?

搞清楚了RISE的主体框架,再深入到两个关键设计:KIC选取策略和DMER曝光参考。

KIC:从可靠亮区建立照明锚点

KIC的选择是RISE的一个核心创新点。物理上,光线从光源出发,在场景中传播并衰减,亮区离光源更近或遮挡更少,暗区则是光传播的“末梢”。因此,从亮区到暗区的关系本身就携带了照明结构信息。RISE从相对照明图Z的最亮图像块中选择N个空间分散的区域作为KIC——它们在Z中的取值最高,意味着它们是整个场景中最可靠的照明线索。
这里有个常人容易忽视的细节:为什么不直接用全图的照明信息,而非要选稀疏的几个亮区?因为低光图像中暗区的信噪比太低,直接使用它们的像素值来估计照明,等价于把传感器噪声也当成了照明信号来建模。RISE通过只信任亮区、再从关系场间接推断暗区的照明值,绕开了噪声干扰问题。这也是RISE与SNR-Aware方法的本质区别——SNR-Aware把低SNR区域的“信息”当作有用特征来用,RISE则直接不让低SNR区域参与估计。

DMER:输入相关的双测光曝光参考

另一个关键设计是双测光曝光参考(Dual-Metering Exposure Reference,DMER)。它的设计初衷很简单:既然不同图像的曝光水平和光照分布都不一样,为什么监督信号必须是固定的呢?RISE提出了两个互补的“测光表”——一个管全局,一个管空间。
图5:DMER总览。绝对测光表估计全局曝光,相对测光表通过光场传播建模空间照明。
图5:DMER总览。绝对测光表估计全局曝光,相对测光表通过光场传播建模空间照明。
绝对测光表(Absolute Meter)走的是“灰度世界假设”(Gray-World Assumption)的保守路线:把全局亮度的几何平均值缩放向一个固定灰度目标,但如果这个增益会把亮区推出有效强度范围,就裁剪到不会引起过曝的最大增益。这提供了一个稳定的全局基准线,但它是空间均匀的,无法反映图像内的光照不均衡。
公式6:绝对测光参考。Y_geo为亮度Y的几何平均,τ_abs为归一化强度范围内的固定灰度目标,Γ为增益裁剪函数。
公式6:绝对测光参考。Y_geo为亮度Y的几何平均,τ_abs为归一化强度范围内的固定灰度目标。
相对测光表(Relative Meter)则负责捕捉空间光照差异。它先构造一个基于亮度的置信度图C,让可靠照明的区域获得更高权重,然后用高斯平滑做归一化卷积,从可靠亮区向周围扩散亮度线索,生成一个结构感知的光场L。这个L近似了光照在空间上的平滑变化,能反映不同区域的相对照明强度。
公式7:结构感知光场构造。C为亮度置信度图,Y为亮度通道,G_σ为高斯平滑,⊙为逐元素乘法。
公式7:结构感知光场构造。C为亮度置信度图,Y为亮度通道,G_σ为高斯平滑。
接下来,相对测光表把观测亮度和光场都转换到摄影学中的曝光值(Exposure Value,EV)刻度上。一个EV对应曝光量翻倍或减半。这里采用摄影色调复现中的标准“中灰”参考m=0.18作为0 EV基准,把平均亮度和光场均值分别映射为两个EV补偿项——它们在EV域中是天然可加的。通过范围控制函数限制极端欠曝光场景下的过度补偿后,相对参考就由线性增益乘以输入得到。
公式8:相对曝光补偿。m=0.18为中灰参考值,mean(Y)为亮度均值,mean(L)为光场均值,两项在EV刻度上相加。
公式8:相对曝光补偿。m=0.18为中灰参考值,mean(Y)为亮度均值,mean(L)为光场均值。
公式9:相对参考生成。Φ为范围控制函数,限制极端欠曝光场景下的EV补偿。
公式9:相对参考生成。Φ为范围控制函数,限制极端欠曝光场景下的EV补偿。
最后,两个参考按加权混合并做高斯平滑得到最终曝光参考T。由于两个参考均由输入图像自身生成,T提供了场景条件化的监督信号,而不是一个固定的目标值。
公式10:最终曝光参考融合。α=0.4为混合权重,G_σ为高斯平滑,抑制高频波动同时保留低频亮度结构。
公式10:最终曝光参考融合。α=0.4为混合权重,G_σ为高斯平滑。
有了曝光参考T,RISE的损失函数由四部分组成:曝光控制损失(在亮度、增益、KIC亮度三个层级对齐输出与T)、尺度等变性正则化(当输入亮度缩放时结构参数保持不变而曝光参数相应变化)、幂等性正则化(对已增强输出不再做过度增强)、边缘感知平滑性损失(抑制无亮度边缘支持的增益跳变)。
公式11:曝光控制损失。在输出亮度、增益图、KIC亮度三个层级与曝光参考T对齐。
公式11:曝光控制损失。在输出亮度、增益图、KIC亮度三个层级与曝光参考T对齐。
公式12:尺度等变性损失。s为输入缩放因子,Θ_s和η_s为缩放输入下的结构参数和曝光参数,log s表示曝光参数应吸收的对数增益变化。
公式12:尺度等变性损失。s为输入缩放因子,Θ_s和η_s为缩放输入下的结构参数和曝光参数。
公式13:总损失函数。λ_exp=1.0, λ_sc=0.1, λ_idt=0.05, λ_smooth=0.01。
公式13:总损失函数。λ_exp=1.0, λ_sc=0.1, λ_idt=0.05, λ_smooth=0.01。

实验验证:全面领先的性能与效率

RISE在实验部分做了非常扎实的验证。先看数据集:七个配对基准——LOL-v1、LOLv2-Real、LOLv2-Synthetic、LSRW(华为和尼康两个子集)、UHD-LL(4K分辨率)、SICE;五个无参考数据集——DICM、LIME、MEF、NPE、VV。覆盖了从低分辨率到4K、从合成到真实、从单曝光到多曝光序列的广泛场景。
表1:LOL基准上的定量比较。FLOPs在单张256×256图像上测试。最佳和次佳结果分别用橙色和黄色高亮,最佳结果同时加粗。SL和UL分别表示有监督和无监督学习。
表1:LOL基准上的定量比较。FLOPs在单张256×256图像上测试。
在LOL系列基准上,RISE(无测试时优化)在LOL-v1上达到20.21 dB PSNR,在LOLv2-Real上达到21.33 dB,均超过此前无监督SOTA。加上测试时优化的RISE†进一步提升到21.03 dB和22.34 dB。更值得注意的是FLOPs:RISE仅为1.43G,而CIDNet需要7.57G、NeRCo需要1037G、LASQ需要600G。RISE用不到这些方法千分之一的计算量,做到了更高的PSNR。
在LSRW、UHD-LL、SICE上的表现也类似。RISE在UHD-LL上达到22.22 dB PSNR,仅次于CIDNet的23.80 dB,但计算量只有CIDNet的五分之一。RISE†在SICE上达到16.73 dB,远高于其他无监督方法。
表2:LSRW、UHD-LL和SICE上的定量比较。最佳和次佳结果分别用橙色和黄色高亮,最佳结果同时加粗。
表2:LSRW、UHD-LL和SICE上的定量比较。
在无参考数据集上的表现同样说明了泛化能力——这些数据没有配对参考,用图像质量评估(IQA)、图像美学评估(IAA)和BRISQUE三个指标来评估。RISE在多数数据集上获得最优或次优的无参考指标分数,说明它不需要针对特定数据集调整就能在未知数据上产生自然好看的增强结果。
表3:无配对数据集上的无参考定量比较。B.表示BRISQUE。最佳和次佳结果分别用橙色和黄色高亮,最佳结果加粗。
表3:无配对数据集上的无参考定量比较。
从视觉对比上看(图6),RISE在LOL和UHD-LL上生成的增强结果色彩自然、曝光均衡。对比Zero-DCE可以看到RISE避免了严重的色调偏移和偏色;对比CLIP-LIT可以看到RISE没有出现过度提亮的灰蒙感。论文还展示了用iPhone 16 Pro拍摄的真实低光场景的增强效果(图7),RISE无需任何微调就能处理真实世界的光照条件,保持更广的动态范围——亮部不过曝,暗部有细节。
图6:不同方法在LOL和UHD-LL上的增强结果视觉对比。
图6:不同方法在LOL和UHD-LL上的增强结果视觉对比。
图7:iPhone 16 Pro拍摄的真实场景泛化结果。建议放大查看最佳效果。
图7:iPhone 16 Pro拍摄的真实场景泛化结果。
消融实验有说服力:去掉相对结构建模(即只用曝光参考T做全图均匀校正)后PSNR显著下降,验证了结构信息的作用;把KIC选取改为随机选取后性能也明显受损,证明了亮区锚点的可靠性是有效建模的关键;去掉DMER改用固定曝光目标后,跨数据集泛化能力明显下降。表5进一步展示了KIC数量N的敏感性——N=64时表现最好,继续增加不再带来收益。表6用Wasserstein距离对比了输出亮度分布与真实亮度分布的差异,RISE的输出分布最接近真实分布,说明它的增强不是简单提亮,而是让整体亮度统计特征与正常光图像对齐。
表4:相对结构、KIC选择、DMER、解耦和损失函数的消融研究。最佳结果加粗显示。
表4:相对结构、KIC选择、DMER、解耦和损失函数的消融研究。
表5:KIC数量和尺寸的消融研究以及DMER中混合权重α的敏感性分析。最佳结果加粗显示。
表5:KIC数量和尺寸的消融研究以及DMER中混合权重α的敏感性分析。
表6:亮度分布的定量比较。数值表示与对应真实图像的Wasserstein距离(越低越好)。最佳和次佳结果分别用橙色和黄色高亮,最佳结果加粗。
表6:亮度分布的定量比较。数值表示与对应真实图像的Wasserstein距离(越低越好)。
值得注意的是论文对“相对亮度排序不一致”现象的分析。在低光成像中,由于不同颜色通道的衰减率不同以及局部噪声的影响,输入图像的区域亮度排序可能与真实图像不一致——也就是说,输入中看起来“更亮”的区域,在真实正常光图像中可能反而“更暗”。这意味着如果直接依赖输入的亮度顺序作为监督约束(有些方法确实这么做),会引入错误的目标。RISE通过只信任亮区锚点并建模相对关系,从机制上绕开了这个问题。
图8:相对亮度排序不一致现象。代表性示例中,低光输入的区域亮度排序与对应的真实图像不同,表明输入亮度顺序不是可靠的目标照明约束。
图8:相对亮度排序不一致现象。代表性示例中,低光输入的区域亮度排序与对应的真实图像不同。

局限与展望:超越传感器噪声底的可能性

任何方法都有边界。RISE在极端低光场景下会遇到“不可恢复信号损失”的问题——当某个区域的信号完全被传感器噪声淹没时,P不包含任何可恢复的场景信息。RISE可以提升整体可见度,但无法从噪声中凭空重建出原始结构,这些区域可能残留噪声伪影。这本质上不是算法缺陷,而是成像物理的极限——信息论告诉我们,信号被噪声完全淹没时,任何后处理都无法无中生有。
图15:不可恢复信号损失下的失败案例。RISE提升了整体可见度,但无法恢复输入中缺失的结构,可能在这些区域残留噪声。红框和放大的裁剪区域标出了受影响区域。
图15:不可恢复信号损失下的失败案例。RISE提升了整体可见度,但无法恢复输入中缺失的结构。
论文的图15诚实地展示了这个失败案例,值得赞赏。后续工作如果能引入时序信息(多帧低光图像的冗余互补)或者与RAW域去噪联合建模,有望在这个方向进一步突破。另外,当前RISE的曝光参考在极端欠曝光场景下主要依赖范围控制函数来避免过度补偿,如果能把场景分类或语义信息整合进DMER,或许能更细粒度地处理不同场景的曝光需求。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?天津大学提出无监督低光增强框架RISE,将场景光照解耦为相对照明结构与绝对曝光,从可靠亮区提取关键照明线索推断全图结构,并设计双测光曝光参考实现场景自适应增强。仅0.35M参数即可在多个基准上取得无监督最优性能。
这篇工作最值得看的点是什么?RISE在所有数据集上均取得无监督方法中最高的PSNR,在无参考评价指标IQA和IAA上全面领先,且参数量和计算量远低于对比方法,展示了优异的性能-效率平衡。
这篇工作的边界或风险在哪里?优点:(1)将光照结构估计与曝光控制解耦,提供了可解释的增强框架;(2)利用KICs作为可靠锚点,避免了低SNR区域的干扰;(3)DMER实现了场景自适应的曝光调整,泛化能力强;(4)模型轻量高效。缺点:(1)在信号低于传感器噪声底时无法恢复缺失内容;(2)KIC选择依赖亮度排序,在极端场景下可能失效;(3)相对光照结构估计依赖图像平面距离作为衰减代理,与真实三维传播存在偏差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出RISE框架,将无监督低光增强分解为相对光照结构估计与绝对曝光控制两个解耦任务,通过关键光照线索(KICs)建立可靠的空间关系场,并利用双测光曝光参考(DMER)实现场景自适应的曝光调整。

实验合理度:★★★★☆

PSNR, SSIM, LPIPS, BRISQUE, IQA, IAA, Wasserstein Distance

学术研究价值:★★★★☆

提出RISE框架,将无监督低光增强分解为相对光照结构估计与绝对曝光控制两个解耦任务,通过关键光照线索(KICs)建立可靠的空间关系场,并利用双测光曝光参考(DMER)实现场景自适应的曝光调整;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

1.43 GFLOPs(256×256输入),参数量0.35M

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)在信号低于传感器噪声底时无法恢复缺失内容;(2)KIC选择依赖亮度排序,在极端场景下可能失效;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球