← 返回 PaperDaily 视觉与图像

重庆大学新作:高斯泼溅硬塞进Transformer,无监督低光增强SSIM飙至0.926

重庆大学这波操作有点东西!在低光增强领域,无监督方法最头疼的就是复杂非均匀光照下的局部过曝/欠曝和颜色偏色。这篇论文干脆把高斯泼溅的连续光场表示当成“物理先验”硬塞进Transformer的自注意力里,让模型在增强时能“看懂”光照的物理结构,而不是在黑盒子里瞎猜。PSNR和SSIM在LOL等数据集上直接登顶,视觉修复效果图看着是真的解压。

重庆大学新作:高斯泼溅硬塞进Transformer,无监督低光增强SSIM飙至0.926
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
重庆大学这波操作有点东西!在低光增强领域,无监督方法最头疼的就是复杂非均匀光照下的局部过曝/欠曝和颜色偏色。这篇论文干脆把高斯泼溅的连续光场表示当成“物理先验”硬塞进Transformer的自注意力里,让模型在增强时能“看懂”光照的物理结构,而不是在黑盒子里瞎猜。PSNR和SSIM在LOL等数据集上直接登顶,视觉修复效果图看着是真的解压。


原论文信息如下:
论文标题:
Gaussian Light Field Splatting: A Physical Prior-Driven Vision Transformer for Unsupervised Low-Light Image Enhancement
发表日期:
2026年06月
发表单位:
Chongqing University(重庆大学), University of Florida, Carnegie Mellon University, 清华大学
原文链接:
https://arxiv.org/pdf/2606.08775v1.pdf
## 暗夜重生:当高斯泼溅遇见Transformer,无监督低光增强的新范式
拍个夜景,照片黑乎乎一片,打开手机里的“夜景模式”等了几秒,结果出来一张局部过亮、暗部死黑、颜色还偏蓝紫的神奇图片——这个场景,相信很多人都不陌生。
低光图像增强(LLIE)是计算机视觉中的一个经典难题,尤其是在没有配对正常光-低光图像对的情况下(也就是无监督学习),模型只能靠单张低光照片自己猜出正常光照的样子。这就像让一个画家只看着一张满脸胡须、光线昏暗的人像照片,却要画出一个干净帅气的肖像——难度可想而知。
现有方法大多依赖纯数据驱动的黑盒神经网络,比如各种Transformer和状态空间模型(Mamba),它们虽然能建模长距离依赖,但缺乏对光照退化物理规律的显式建模。当遇到复杂非均匀光照(比如门口一盏灯,远处一片漆黑),模型就容易出现局部过曝/欠曝、颜色偏色、细节模糊等问题。
重庆大学、佛罗里达大学、卡内基梅隆大学和清华大学的联合团队,盯上了这个问题。他们给出一个大胆的解法:把高斯泼溅(Gaussian Splatting)的连续光场表示,直接塞进Transformer的自注意力机制里,让模型在增强时能够“看懂”光照的物理结构。这篇论文叫 Gaussian Light Field Splatting (GLFS),发在2026年6月,一上线就引爆了低光增强圈子。
先来看看效果。下面这张图是GLFS在LOL数据集上的表现,从左到右分别是输入、增强结果、光照场、增益场和噪声图——完全由模型无监督学出来,而且物理含义一目了然。
图2:GLFS物理先验分解和增强可视化。从左到右:输入、增强输出、光照场、增益场和噪声图
图2:GLFS物理先验分解和增强可视化。从左到右:输入、增强输出、光照场、增益场和噪声图
可以看到,模型不仅把暗处提亮了,还生成了一个连续平滑的光照场和增益场,同时分离出了噪声。这个噪声图简直就是降噪任务的天赐良机。这么优雅的分解,是怎么做到的?别急,龙哥带你一层层扒开GLFS的技术外衣。

物理先验驱动的核心创新:GS-ViT如何看懂复杂光照?

GLFS的整体架构是一个编码器-解码器结构,其中最关键的部分叫做 GS-ViT(高斯泼溅视觉Transformer)瓶颈模块。这个模块可不是普通的Transformer——它把物理先验直接硬编码到了自注意力计算中。
传统ViT的自注意力只靠位置编码和语义相似度来生成注意力分数,不同像素之间即使同属一个光源区域,也无法建立物理上的强关联。而GLFS的做法是:先把场景光照表示成一组 各向异性高斯基函数 的叠加(每个高斯基函数有均值、协方差和透明度三个参数),然后在这些高斯参数的基础上,计算任意两个token之间的马氏距离,再通过一个可学习的温度系数,将这个物理距离转化为注意力偏置。
具体来说,对于查询token i和键token j,先计算它们的归一化坐标偏移Δ = μi - μj,然后用查询token对应的逆协方差矩阵∑-1作为度量,计算马氏平方距离dij² = ΔT∑-1Δ。接着把距离通过高斯核函数变成0~1之间的亲和力,再乘以可学习的温度系数th(每个注意力头独立),最后通过门控参数λ与语义注意力分数融合。
这个设计的好处是:物理偏置随着训练不断更新,注意力图会从早期的语义聚类逐渐演变成与光照透明度分布高度一致的各向异性结构。来看图4,可以清晰地看到这个演化过程:
图4:GS-ViT中各向异性高斯溅射自注意力的层级演化。(A)四个GS-ViT块中中心token的注意力分布。浅层呈现弥散注意力,深层逐渐围绕光源中心形成各向异性结构,与透明度α分布高度一致。(B)不同注意力头的独立响应。不同头通过可学习温度t_h感知不同尺度和方向的互补光场模式。
图4:GS-ViT中各向异性高斯溅射自注意力的层级演化。(A)四个GS-ViT块中中心token的注意力分布。浅层呈现弥散注意力,深层逐渐围绕光源中心形成各向异性结构,与透明度α分布高度一致。(B)不同注意力头的独立响应。不同头通过可学习温度t_h感知不同尺度和方向的互补光场模式。
浅层(Block 0-1)的注意力还比较“扁平”,到了深层(Block 2-3),注意力形状就完全跟随光照场的各向异性结构了——有的头沿着水平方向感知,有的沿着垂直方向,完美互补。这就像让Transformer生出“第三只眼”,专门用来感知光照。

多尺度高斯分词器:一张图里的“明”察秋毫

说了半天的“高斯基函数”,这些参数是怎么来的呢?答案就是 多尺度高斯分词器(Multi-scale Gaussian Tokenizer, MGT)
传统ViT的分词器就是把图像切成固定大小的patch,每个patch分配一个位置编码。物理含义?为零。而MGT直接让编码器输出的每个空间位置都对应一个可学习的2D高斯基函数,每个高斯基函数有一个6维几何描述子(2维中心偏移、2维逆协方差矩阵对角线、1维非对角线、1维透明度)和一个d维语义特征。这样,每个token就天然带了几何意义——中心在哪里,光强沿哪个方向衰减,衰减速率如何。
MGT包含两个分支:粗粒度分支和细粒度分支,分别操作在编码器最深的两个尺度特征图上。粗粒度分支用于捕捉全局光源分布(比如窗外的天空),细粒度分支用于补偿局部细节(比如灯泡旁边的眩光)。两个分支预测的透明度在融合时通过一个自适应权重合并,最终得到一个既能反映全局光照也能描绘局部阴影的连续透明度图。
图3展示了这些高斯参数的可视化结果,可以看到偏移、透明度、协方差分量都在空间上形成了有意义的几何结构:
图3:多尺度高斯分词器推断的高斯参数可视化。(A)面板(a)-(f)显示中心偏移、粗粒度透明度α_c、逆协方差分量(a,b,c),揭示各向异性光照场的几何结构。(B)面板(a)-(d)展示透明度α的四阶段演化:从粗预测、细预测、融合到精炼,展示全局光照分布与局部细节补偿的协作。(C)透明度平滑过程对比,显示离散token之间的突变被有效抑制,为光照场重建提供连续几何引导。
图3:多尺度高斯分词器推断的高斯参数可视化。(A)面板(a)-(f)显示中心偏移、粗粒度透明度α_c、逆协方差分量(a,b,c),揭示各向异性光照场的几何结构。(B)面板(a)-(d)展示透明度α的四阶段演化:从粗预测、细预测、融合到精炼,展示全局光照分布与局部细节补偿的协作。(C)透明度平滑过程对比,显示离散token之间的突变被有效抑制,为光照场重建提供连续几何引导。
注意看(C)部分,左边是未平滑的透明度,右边是平滑后的——离散的token之间的突变被有效抑制,形成了一个连续的光照几何引导场。这个平滑操作对后续的GS-ViT注意力计算至关重要,因为不连续的物理偏置会引入噪音。

告别颜色失真——为什么一个角度损失就能搞定?

无监督低光增强中第二大痛点是颜色失真。常见的灰度世界假设(认为场景平均颜色是灰色)在复杂光照下容易把画面漂成奇怪的色调。GLFS提出了一个极其优雅的解决方案:颜色向量角度损失(Color-Vector Angular Loss)
根本逻辑是这样的:RGB空间里,每个像素的颜色可以看作一个三维向量,向量的方向代表色调,向量的长度代表亮度。在低光增强中,亮度(长度)需要大幅增加,但色调(方向)应该保持不变。因此,只要约束增强前后RGB向量的角度不变,就能避免色偏。
这个损失函数是:对每一个像素,计算原始低光图像的RGB向量与增强后图像的RGB向量之间的余弦角度,然后对所有像素取平均。当角度为0时,余弦值为1,损失值为0。就这么简单,却比繁琐的色相-饱和度调整有效得多。
此外,GLFS还设计了第二个损失:亮度-边缘损失(Luminance-Edge Loss)。它只在Y通道(亮度通道)上计算Sobel梯度,强迫增强后的图像保持与低光图像一致的边缘结构,同时避免色度分量的干扰。这两个损失在无监督条件下大幅提升了结构保真度(SSIM)。
插图

效果碾压15种SOTA方法,GLFS究竟有多强?

为了验证GLFS的真实力,研究团队在LOL、LSRW-HUAWEI、LSRW-NIKON三个主流低光数据集上,与LIME、RetinexNet、Zero-DCE、EnlightenGAN、UretinexNet、LL-GaussianImage等15种SOTA方法进行了全面对比。评价指标使用PSNR(峰值信噪比)和SSIM(结构相似性)。
先看LOL数据集上的结果(表I):
表I:LOL数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
表I:LOL数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
GLFS在PSNR上达到26.21 dB,SSIM达到0.926,双双登顶!比第二名方法(LL-GaussianImage,PSNR 25.49 dB)高出近0.7 dB,SSIM提升超过0.01。注意,LL-GaussianImage也是基于高斯泼溅的方法,但GLFS通过将物理先验嵌入Transformer进一步提升了性能。
再看LSRW-HUAWEI和LSRW-NIKON(表II、表III),GLFS同样全面碾压所有对比方法:
表II:LSRW-HUAWEI数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
表II:LSRW-HUAWEI数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
表III:LSRW-NIKON数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
表III:LSRW-NIKON数据集上的性能对比。红色和蓝色分别表示最好和次好结果。
在LSRW-HUAWEI上,GLFS的PSNR比第二名高出1.6 dB,SSIM高出0.015;在LSRW-NIKON上,PSNR领先1.1 dB,SSIM领先0.01。这种全面且大幅度的提升在无监督低光增强领域非常罕见。
可视化对比更加直观。图5展示了LOL数据集上的视觉对比,GLFS的增强结果不仅亮度均匀,而且颜色自然,细节清晰,而其他方法要么过曝、要么偏色、要么出现斑块状失真。
图5:GLFS与SOTA方法在LOL数据集上的视觉对比。图6:GLFS与SOTA方法在LSRW-HUAWEI数据集上的视觉对比。
图5:GLFS与SOTA方法在LOL数据集上的视觉对比。图6:GLFS与SOTA方法在LSRW-HUAWEI数据集上的视觉对比。
消融实验(表IV-VIII)也充分证明了每个模块的必要性。以表IV的核心架构消融为例,去掉GS-ViT(换用普通ViT)后PSNR下降1.1 dB,去掉MGT(换用普通分词器)后PSNR下降0.9 dB。而表VI显示,去掉颜色向量角度损失后SSIM从0.926降到0.915,去掉亮度-边缘损失后降到0.919,说明两个损失都对结构保真度贡献显著。
表IV:核心架构的消融分析。红色和蓝色分别表示最好和次好结果。
表IV:核心架构的消融分析。红色和蓝色分别表示最好和次好结果。
表VI:无监督训练目标的消融分析。红色和蓝色分别表示最好和次好结果。
表VI:无监督训练目标的消融分析。红色和蓝色分别表示最好和次好结果。

总结与展望:物理先验是低层视觉的未来吗?

GLFS的工作为低层视觉任务提供了一种新的范式:将物理先验显式注入深度学习架构,而不是让模型在黑盒子里盲猜。这种思路可能会启发一系列后续工作,比如去雾、去雨、超分辨率等任务都可以尝试类似的物理先验嵌入。
不过,GLFS目前还在离线处理阶段,推理速度受限于高斯泼溅的参数优化循环(需要多步迭代)。未来如果能把物理先验压缩成一次性推理的端到端网络,将更有希望落地到手机摄像头等实时场景。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

GLFS里的高斯泼溅和3D高斯泼溅有什么区别?GLFS使用的是2D高斯泼溅(2DGS),而不是3DGS。2DGS把2D图像平面当成一个连续场,每个高斯基函数是2D的(均值、2x2协方差矩阵、透明度),直接拟合图像平面上的光照分布。3DGS则适用于三维空间重建。GLFS受2DGS的启发,但创新点不在于高斯泼溅本身,而在于把高斯参数作为物理先验嵌入到Transformer的自注意力里。

颜色向量角度损失是如何保持色相不变的?在RGB颜色空间中,色调由向量方向决定,亮度由向量长度决定。角度损失计算增强前后RGB向量的夹角余弦,当夹角为0时余弦为1,损失为0。这样,亮度(长度)可以自由增加,但方向(色调)被迫保持不变。这个直觉非常简单,却比复杂的色相饱和度约束更有效。

GLFS的推理速度怎么样?能实时吗?从论文的消融实验(表VIII)看,GLFS在单张图像(600x400)上的推理时间大约在0.5~1秒(取决于迭代次数),目前还达不到实时(30fps)要求。主要瓶颈在于GS-ViT中的高斯参数迭代优化过程。但作者没有给出详细的FLOPs对比,未来若能把物理先验编码进一次推理的前向网络,速度有望大幅提升。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次将2D高斯泼溅的连续光场表示作为物理偏置嵌入Transformer自注意力,为无监督低光增强提供了全新的范式。不依赖任何配对数据,方法优雅且有效。

实验合理度:★★★★★

对比方法多达15种,覆盖了传统方法、Retinex方法、零参考方法、扩散模型、高斯泼溅方法等主要流派。消融实验细致,每个模块和损失函数都做了因果验证。表格清晰,可视化丰富。

学术研究价值:★★★★★

提出了物理先验与深度学习架构深度融合的新思路,不限于低光增强,可推广到去雾、去噪等其他低层视觉任务。高斯泼溅与Transformer的桥接具有很强的启发意义。

稳定性:★★★★☆

在三个不同数据集上均表现稳定,且可视化中噪声分离干净,说明方法对非均匀光照有较好的鲁棒性。但在极端高噪场景(如ISO 12800以上)可能还需要额外降噪模块。

适应性以及泛化能力:★★★★☆

目前只在常见低光数据集上验证,对于极端低光甚至全黑图像、不同相机噪声分布、视频时序场景的泛化能力尚未测试。高斯参数对不同分辨率和宽高比的适应性也需进一步验证。

硬件需求及成本:★★★☆☆

推理时需要在GPU上进行多步迭代优化,单张图像约0.5-1秒(NVIDIA V100),无法在手机等边缘设备上实时运行。训练时显存占用约12GB。不过方法不需要配对数据,训练成本较低。

复现难度:★★★☆☆

论文中详细给出了公式和伪代码,但高斯参数预测和注意力计算中的马氏距离实现有一定技巧性。代码目前未开源(论文刚出),预计会在GitHub发布,遵循官方实现会更容易。

产品化成熟度:★★☆☆☆

目前距离手机相机等实时应用还有距离。但物理先验驱动的思路可能被集成到下一代ISP芯片中。如果未来能裁剪为一次前向推理,则有潜力嵌入手机相册的“一键优化”功能。

可能的问题:高斯泼溅的参数优化需要迭代,速度较慢;缺少在真实极端噪声场景的测试;颜色向量角度损失虽然有效,但在处理大面积单色区域时可能会有空域退化,需要更鲁棒的平滑项。


主要参考文献

[1] Yuhan Chen et al., "Gaussian Light Field Splatting: A Physical Prior-Driven Vision Transformer for Unsupervised Low-Light Image Enhancement", arXiv:2606.08775v1, 2026.
[2] Kerui et al., "LL-GaussianImage: Low-Light Image Enhancement via 2D Gaussian Splatting", 2025.
[3] 2DGS: 2D Gaussian Splatting for Geometrically Accurate Radiance Fields (SIGGRAPH 2024).
[4] Zero-DCE: Zero-Reference Deep Curve Estimation for Low-Light Image Enhancement (CVPR 2020).

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
还在为复杂光照下的颜色偏差头疼?GLFS用高斯泼溅给Transformer装上“物理眼”,增强效果干净利落!想第一时间跟上这种“物理先验+Transformer”新范式的更多突破?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。