← 返回 PaperDaily 视觉与图像

NTIRE 2026低光挑战赛:小米接收!RAW域多帧去噪PSNR狂飙6.49dB

夜拍糊成鬼片?手持五张RAW直接融合出纯净大片?NTIRE 2026低光挑战赛正是为此而设:585个真实场景、三阶段残酷评测,冠军方案PSNR比官方基线飙升6.49dB,直接把夜间计算摄影卷到新高度。想知道小米、大华这些一线团队如何驯服噪声与手抖?这篇挑战赛报告给了最全答案。

NTIRE 2026低光挑战赛:小米接收!RAW域多帧去噪PSNR狂飙6.49dB
原论文信息如下:
论文标题:
NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge
发表日期:
2026年08月

发表单位:
俄罗斯色彩再现与合成研究所、莫斯科独立人工智能研究所、维尔茨堡大学计算机视觉实验室、小米、浙江大华、Bahcesehir University等多机构联合

原文链接:
https://arxiv.org/pdf/2608.09782v1.pdf

开源代码链接:
https://github.com/Zufarovich/TWILIGHT-COWBOY-CHALLENGE-BASELINE

晚上出门撸串,掏出手机想抓拍一张烟火气十足的夜景,结果画面全是噪点和重影。你愤而按下连拍,期待后续调一调能出片——结果还是糊。这个时候,你大概率会想:手机厂商天天吹的“夜景模式”到底是怎么把一堆废片变成大片的?NTIRE 2026低光增强挑战赛(Twilight Cowboy Challenge)就是给这个问题交了一份硬核答卷。
这项挑战赛由NTIRE Workshop组织,赛题非常直接:把一组手持拍摄的、带有错位的低光RAW图像(5帧),融合成一张干净、与三脚架静止拍摄效果相当的RAW图像。注意是RAW域,不是已经处理过的sRGB图像。这意味着算法要同时搞定两件最难的事——抑制噪声、校正手持抖动带来的几何误差。比赛共收集了585个真实场景,覆盖室内低光与室外夜间,赛程分为三个阶段,最终十支队伍超过官方基线,PSNR最高提升6.49dB,直接把夜间突发图像增强(burst-based low-light enhancement)的水平推到了新高度。

585个真实场景:挑战赛数据集的构建与真值生成之道

图1:参赛方案的平均PSNR与单样本推理时间对比,前三名方案以星标显示。
参赛方案的平均PSNR与单样本推理时间对比,前三名方案以星标显示。
要做一场靠谱的挑战赛,数据是地基。组织方在数据采集上下了不少功夫:先把智能手机固定在三脚架上,用遥控触发拍摄270帧RAW格式图像,用于后续构建真值;然后让拍摄者手持手机,模拟真实用户的手抖场景,从手持序列中每隔十帧抽取一帧,最终构成每组的5张错位输入图。所有图像均采用固定相机参数:ISO 100、快门1/10秒、光圈f/1.8、焦距设为无穷远。有意思的是,每组真值与输入来自同一静态场景,但输入图像中包含了人手自然晃动带来的平移、旋转以及微小景深变化——这恰好还原了手机手持夜景拍摄的真实物理条件。
真值生成是这类挑战赛最容易被低估但最关键的环节。组织方沿用了智能手机图像去噪数据集(Smartphone Image Denoising Dataset,SIDD)的成熟经验:首先对270帧做强度对齐,逐帧计算平均强度后拟合正态分布,剔除落在99.7%置信区间之外的质量较差帧;然后基于剩余帧做逐像素的鲁棒均值估计,对每个像素位置拟合正态分布,取均值作为真值像素;最后通过基于分位数的归一化改善视觉表现,其公式如下:
公式1:分位数归一化公式,其中Q(I,k)表示图像I中像素强度的第k个分位数。
公式1:分位数归一化公式,其中Q(I,k)表示图像I中像素强度的第k个分位数。该操作将1%分位数映射到0、99%分位数映射到1,有效抑制了夜间强光源(如车灯、霓虹灯)对整体动态范围的过度拉伸。
数据规模分配上,第一阶段开放250组训练对和50组无真值验证样本;第二阶段追加150组训练对和50组验证样本;最终测试集则包含85组输入-真值对,全程不对外公开。值得注意的是,测试集中大约三分之一是室内场景,这给算法带来了进一步的光照类型泛化挑战。
评估协议同样讲究。参赛方案分别按PSNR和SSIM排名,得到两个排名值R_P和R_S,再按下式加权得到最终得分:
公式2:最终排名得分S = 0.6 × PSNR排名 + 0.4 × SSIM排名,按S升序确定最终名次。
公式2:最终排名得分S = 0.6 × PSNR排名 + 0.4 × SSIM排名。PSNR(峰值信噪比,Peak Signal-to-Noise Ratio)和SSIM(结构相似性指数,Structural Similarity Index Measure)分别从像素级误差和结构感知两个维度度量重建质量。该公式意味着PSNR优先,同时兼顾SSIM,引导参赛者追求像素保真与视觉感知的平衡。

从光流引导到模型集成:冠军方案的制胜秘诀

冠军由团队Avengers Assemble(MiAlgo)摘得,其方案以双重集成(dual-ensemble)框架为核心,思路可以用一句话概括:用三组互补模型分别处理,再做8向测试时增强(Test-Time Augmentation,TTA)平均,集合所有力量碾压低光噪声。
具体而言,其第一个关键设计是光流引导的可变形对齐(flow-guided deformable alignment)。突发图像中各帧之间存在由手持抖动带来的大幅度运动,仅靠常规可变形卷积往往难以准确估计偏移量。MiAlgo预先计算光流(optical flow),将光流信息注入可变形对齐模块中,帮助网络在大运动场景下更稳健地估计采样偏移,减少了动态区域中的运动伪影。第二个关键设计是顺序多模型去噪集成:依次运行Restormer、XRestormer和NAFNet三个骨干网络,将加权输出累积为最终预测。其中Restormer与XRestormer擅长通过Transformer做全局建模,NAFNet则凭借高效的卷积结构擅长局部纹理恢复,三者互补,显著提升了整体重建的稳健性。第三个关键设计是带有图像-光流一致性约束的TTA集成:对RAW帧和光流图施加一致的几何变换后进行推理,再将结果逆变换回来平均。这个一致性设计很巧妙——如果图像和光流变换不一致,对齐质量就会下降。TTA与模型集成构成双层聚合,进一步削减单一模型在特定场景下的偶发波动。
训练策略上,MiAlgo采用两阶段方案:先在完整训练集上预训练学习通用恢复先验,然后人工清理数据集——剔除约25%出现明显空间错位的样本——再在清理后的子集上微调。这一步看似简单,但对于夜间拍摄的RAW数据至关重要,因为手动拍摄时偶尔的剧烈抖动会导致输入与真值之间的空间不对齐,强行学习这些样本只会让网络输出产生重影伪影。
图2:MiAlgo(Avengers Assemble)的测试流程。
图2:MiAlgo(Avengers Assemble)的测试流程,展示了从RAW输入经光流引导对齐、多模型顺序去噪到TTA输出的完整链路。
最终MiAlgo在测试集上达到PSNR 40.62dB、SSIM 0.9875的顶尖成绩,但代价是每张样本需要约514.6秒推理时间——接近9分钟。这个数字也折射出低光复原任务的计算开销有多么惊人。

效率与性能的博弈:各参赛团队技术路线深度解析

十支参赛团队的技术路线几乎成了低光增强领域的“全家桶”:光流对齐、特征匹配、Transformer、卷积网络、噪声模型迁移、传统去噪算法,各路招数同台竞技。最终排行榜如下:
表1:测试集上的最终排行榜,按最终得分S升序排列,同时给出了单样本平均推理时间。
表1:测试集上的最终排行榜,按最终得分S升序排列,同时给出了单样本平均推理时间T_avg。排行榜由公式2计算得到,PSNR与SSIM分别排名后加权。
亚军DH ISP的方案值得重点关注。它走的不是“大力出奇迹”路线,而是做了一件事:先把未配准的噪声-真值对粗对齐,提取“噪声残差图”,再用PCA加GAN完成噪声分布建模与迁移,把学到的噪声精确映射回真值图上,避免网络被失配伪影带偏。去噪主干采用SCUNET,一种结合了Transformer与CNN优势的U型网络,配合窗口大小为16的策略,并用L1、感知损失、SSIM损失和边缘损失的组合进行优化。最终在10.7秒推理时间内拿到40.23dB PSNR,堪称全场性能/效率比最优方案。
图3:DH ISP的整体流程,先做噪声残差提取,再经噪声分布建模与迁移,最后用SCUNET完成多帧RAW去噪。
图3:DH ISP的整体流程,先做噪声残差提取,再经噪声分布建模与迁移,最后用SCUNET完成多帧RAW去噪。
季军BAU-Vision则展示了经典的“解耦”策略:先全局亮度校正,再做空间配准,最后进行分层特征恢复。亮度校正用的是梯度提升回归器(Gradient Boosting Regressor,GBR),输入53维统计特征来估计目标场景亮度;运动补偿用的是基于空间金字塔网络架构的BetterSpyNet光流估计器,并在特征提取器中加入实例归一化层,迫使光流从结构特征而非原始强度出发计算,以提升曝光不变性;多帧融合则采用时间注意力融合机制(Temporal Attention Fusion,TAF),通过交叉注意力生成空间重要性掩模M∈[0,1]^H×W,滤除失配区域、遮挡和运动模糊像素。这一系列设计让BAU-Vision在72.4秒内达到38.01dB PSNR。
第四名AXIOM走的是“在baseline长板上加钉子”的路线:保留baseline的双分支结构(预览图匹配+全分辨率RAW重建),但强化了三个关键环节——全分辨率对齐、置信度感知的突发融合、自适应RAW域去噪。其融合策略不是简单平均,而是为每个辅助帧打分(匹配统计量、单应内点率、重投影误差),并引入Lucas-Kanade后单应精化进一步提升对齐精度。值得一提的是,AXIOM还尝试用低秩适应(Low-Rank Adaptation,LoRA)微调ASpanFormer匹配器,只训练了约3.4万参数(总参数约1580万),配合流水线级检查点选择,展示了高效迁移学习的实用性。
第五名html5attention3的方案RestoRoBurr(Restormer + RoMa + Burstormer)则展示了一条不同思路:既然低光RAW噪声太大、特征匹配容易失效,不如先用Restormer对训练集做一次预处理去噪,让被散粒噪声压制的纹理结构露出来,再用去噪后的图像进行特征匹配,最后将匹配结果迁移回原图做精确对齐。整条流水线逻辑自洽,还在Burstormer的融合模块中加入了基于拉普拉斯清晰度的MLP门控,抑制运动模糊帧的贡献。训练时用Charbonnier +频率损失+梯度损失的组合,损失权重γ₁=0.1、γ₂=0.2,并采用渐进式图像尺寸增大(128²→256²)和困难样本裁剪挖掘策略。
图4:RestoRoBurr推理流程(html5attention3),先对训练集做粗对齐和去噪,再进行精确特征匹配与突发去噪。
图4:RestoRoBurr推理流程(html5attention3),先对训练集做粗对齐和去噪,再进行精确特征匹配与突发去噪。
ColorWorld是全场最轻量化的方案,仅用时4.7秒便完成了36.70dB PSNR的推理。其核心是一个仅603万参数的BadNet(NAFBlock-U-Net),依靠场景增益预放大、光流置信度加权融合、渐进式裁剪训练(128→512)三个机制,在极小模型上拿到了具有竞争力的结果。mIpTMO则是纯传统路线:用RoMa v2稠密匹配,在RAW空间完成对齐后取加权平均,再用BM3D去噪,全程零学习、零微调,35.84dB的输出说明了“pretrained matcher + BM3D”这一经典组合仍有很强生命力。PSU提出了DUSKAN网络(Dual Spectral Kolmogorov-Arnold Network),在U-Net的每个阶段用可学习的门控权重α混合两条并行分支:一条走频谱-空间处理路径(2D FFT、可学习位置编码、SE通道重加权),另一条走Kolmogorov-Arnold自适应路径(用多项式基激活替代固定线性投影)。模型以L1+0.01×VGG感知损失+0.1×FFT频域损失的组合训练。
图5:DUSKAN架构(PSU),每阶段门控权重α混合全局频谱-空间特征与多项式基KAN激活。
图5:DUSKAN架构(PSU),每阶段门控权重α混合全局频谱-空间特征(Path A)与多项式基KAN激活(Path B),整体为对称4层U-Net。
FengFans用SuperPoint+LightGlue特征匹配配合8通道NAFNet(宽度96、1.55亿参数)拿到了34.36dB PSNR,其8通道输入设计值得注意:前4通道是分位数拉伸后的Bayer图,后4通道是log压缩的原始强度,双表示解决了极暗场景的亮度歧义问题。NTR则提供了一个极致轻量的CPU基线:ORB特征匹配+RANSAC单应估计+BM3D去噪,34.28dB PSNR的全部处理都在CPU上完成,说明即便使用经典手段,也能在资源受限条件下获得可用的结果。
从视觉对比中可以直观感受到,顶尖方案在纹理细节保留上表现突出。MiAlgo和DH ISP对复杂织物纹理、高光边缘的还原几乎无懈可击,而排名靠后的方案在细节上出现了不同程度的模糊或伪影。
图6:决赛阶段各去噪方案的视觉对比。顶尖方案在保留精细细节的同时有效去除噪声。
图6:决赛阶段各去噪方案的视觉对比。顶尖方案在保留精细细节的同时有效去除噪声。

低光计算摄影的未来:挑战赛揭示的研究方向与启示

回看整场挑战赛,可以提炼出几个清晰的趋势。
第一,对齐比去噪更重要。几乎所有排名靠前的方案都在对齐模块上做了大幅强化:光流引导可变形对齐、特征匹配精化、基于置信度的融合门控。在低光场景下,输入帧之间不仅有平移旋转,还有运动模糊、强光源导致的局部过曝,单纯的平均或加权平均难以奏效,精准的逐像素对齐才是质量上限的保障。第二,模型集成与多视角融合是刷分的“大杀器”,但工程成本极高。MiAlgo将三个模型与8向TTA组合,参数规模和计算量都大幅膨胀,最终赢得冠军,但这个策略在真实产品中几乎不可复制。第三,轻量化高效率方案展现出了潜力。DH ISP用10.7秒达到了40.23dB,ColorWorld用4.7秒拿到了36.70dB。对于移动端部署而言,这种“精度略降但时延可控”的方案更接地气。第四,“先预处理再匹配”的思路值得借鉴。html5attention3先用Restormer去噪再匹配,虽然引入了额外计算,但有效解决了低光下特征匹配失效的顽疾,这个范式完全可以推广到其他多帧融合任务中。
对行业来说,这场挑战赛提供了一个重要信号:低光多帧RAW融合已从“实验室玩具”真正走向工程可用。十支队伍超过baseline,其中半数的方案在合理时延内实现了显著增益,这意味着基于RAW域的突发去噪技术将很快进入手机影像系统、辅助驾驶夜视感知等实际场景。当然,数据集的规模与场景覆盖也提醒我们:真实世界的低光变化远超想象,从585个场景到海量真实环境,还有很长的路要走。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?NTIRE 2026低光增强挑战赛总结报告,聚焦手持拍摄5张错位RAW图融合去噪任务。采用585个真实室内外低光场景,三阶段评估。小米团队以40.62dB PSNR夺冠,较基线提升6.49dB,刷新突发多帧低光增强性能纪录。
这篇工作最值得看的点是什么?冠军方案MiAlgo达到40.62 dB PSNR和0.9875 SSIM,较基线提升+6.49 dB PSNR和+0.0101 SSIM;前十名队伍均超越基线,展示了显著进展。
这篇工作的边界或风险在哪里?优点:挑战赛设计合理,数据集真实且规模可观(585个真实场景),评估协议分三阶段严谨;冠军方案通过模型集成和TTA实现最优性能,展示了集成策略的有效性;DH ISP展示了效率与性能的良好平衡。缺点:冠军方案推理时间过长(514.6秒/样本),实际部署困难;部分方案依赖手工数据清洗(如MiAlgo移除25%训练数据),泛化性存疑;缺乏对不同方法的公平计算复杂度对比。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文是NTIRE 2026低光增强挑战赛的综述报告,核心在于组织并评估多帧RAW域突发图像配准与去噪方法,通过构建真实场景数据集和分阶段评估协议,推动低光计算摄影领域的发展。

实验合理度:★★★★☆

PSNR和SSIM,最终排名分数S=0.6×PSNR排名+0.4×SSIM排名。

学术研究价值:★★★★☆

本文是NTIRE 2026低光增强挑战赛的综述报告,核心在于组织并评估多帧RAW域突发图像配准与去噪方法,通过构建真实场景数据集和分阶段评估协议,推动低光计算摄影领域的发展;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

冠军方案MiAlgo推理时间514.6秒/样本;DH ISP仅需10.7秒/样本;ColorWorld最轻量,仅需4.7秒/样本;整体推理时间从4.7秒到514.6秒不等。

复现难度:★★★☆☆

https://github.com/Zufarovich/TWILIGHT-COWBOY-CHALLENGE-BASELINE

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:冠军方案推理时间过长(514.6秒/样本),实际部署困难;部分方案依赖手工数据清洗(如MiAlgo移除25%训练数据),泛化性存疑;

主要参考文献

[1] Khalin A, Ershov E, Panshin A, et al. NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge[J]. arXiv preprint arXiv:2608.09782, 2026.
[2] Abdelhamed A, Lin S, Brown M S. A high-quality denoising dataset for smartphone cameras[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018.
[3] Dabov K, Foi A, Katkovnik V, et al. Image denoising by sparse 3-D transform-domain collaborative filtering[J]. IEEE Transactions on Image Processing, 2007, 16(8): 2080-2095.
[4] Chen H, Wang Y, Guo T, et al. Pre-trained image processing transformer[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021.
[5] Chen L, Chu X, Zhang X, et al. Simple baselines for image restoration[C]//European Conference on Computer Vision (ECCV), 2022.
[6] Dudhane A, Thawakar O, et al. Burstormer: Burst image restoration and enhancement transformer[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023.
[7] Wang Z, Bovik A C, Sheikh H R, et al. Image quality assessment: from error visibility to structural similarity[J]. IEEE Transactions on Image Processing, 2004, 13(4): 600-612.
挑战赛官网与排行榜:https://nightimaging.org
开源baseline代码:https://github.com/Zufarovich/TWILIGHT-COWBOY-CHALLENGE-BASELINE

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
夜色越暗,越需要同路人。想和一群懂计算摄影、玩转RAW域、聊透低光增强的伙伴并肩作战吗?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。暗光不暗,交流更亮,等你来!📸
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。