← 返回 PaperDaily
视觉与图像
图像去噪|上海交大新方案:去噪模型砍掉90%参数,画质几乎无损
手机拍完照,噪点糊一脸?上海交大这个LiteKD-Net给出一个相当务实的答案:把重型去噪网络的参数砍掉90%、推理提速近2倍,再用知识蒸馏把画质“回填”回来,最终效果直逼大模型。做移动端部署的团队,这篇值得一读。
龙哥读论文
发布于 2026-08-14 09:12:33
阅读 7
查看原文
原论文信息如下:
夜晚的商场里,掏出手机对着橱窗拍一张,放大一看——满屏红红绿绿的噪点,像是给照片盖了一层磨砂玻璃。这大概是每个手机用户都经历过的"心头刺"。有人怪手机像素不够高,有人怪光线太暗,但实际上,问题出在手机那颗小小的CMOS传感器上——传感器面积小、单像素尺寸小,捕获的光子少,信噪比天然就低。换句话说,噪点问题,从硬件层面就已经"赢在起跑线"上了。
硬件斗不过,就得靠算法来凑。这些年基于深度学习的去噪网络确实效果惊艳,可是一个尴尬的事实摆在眼前:那些效果最好的模型,动辄几千万参数、上万亿次浮点运算,放到手机上跑起来,要么发热严重,要么卡成幻灯片,要么直接被系统杀掉。把模型送到云端处理?网络延迟和隐私问题又让人望而却步。
有没有一种办法,既能保住大模型的画质,又能让它乖乖在手机上跑起来?上海交通大学提出的LiteKD-Net给出了一份相当务实的答卷——参数量从16.70M砍到1.67M(大约只有原来的十分之一),推理耗时从148.70毫秒降到83.47毫秒(提速接近1.8倍),在实时性上更是实现了每秒处理12帧左右的成绩 。这还不算完,在这种大幅压缩的前提下,去噪画质竟然还能跟原来的大模型打平手。这就很有点意思了。
手机照片的噪点,为什么这么让人头疼?
先花点时间,把"手机噪点为什么比相机严重"这件事说清楚。专业单反的全画幅传感器面积大约是860平方毫米,而手机传感器普遍在30到50平方毫米左右,两者差了将近20倍。在相同像素数量下,手机上每个像素的物理尺寸就要小得多,单个像素能捕获的光子数也相应减少。光子到达传感器是一个随机的物理过程,光子数越少,这种随机涨落带来的噪声就越明显。
手机厂商也不是没想办法。提高传感器增益(ISO)可以放大微弱信号,但噪声也被同步放大,还会带来banding(带状噪声)之类的额外麻烦。于是,算法层面的图像去噪就成为手机影像系统里不可或缺的一环。
过去几年,深度卷积神经网络把图像去噪的水平推上了一个新台阶。像DnCNN提出了残差学习用于盲去噪,RIDNet引入特征注意力来推进真实图像去噪,RRDB(Residual in Residual Dense Block,嵌套残差稠密块)这类强骨干网络更是成了很多复原任务的标配。但问题也随之而来——这些高性能网络动辄包含数千万参数,需要数十亿甚至上万亿次浮点运算。即便不考虑算力消耗,光是模型文件大小和内存占用,就已经让大多数移动设备吃不消。
除了算力问题,另一个更隐蔽的痛点在于数据 。训练一个高质量的去噪模型,需要成对的数据——同一场景下既要有一张干净的高质量参考图(Ground Truth,简写为GT),又要有一张对应的带噪图(Low Quality,简写为LQ)。听起来简单,实际操作却非常麻烦:拍摄过程中任何微小的抖动、光线变化、场景移动都会造成空间上的不对齐。直接用高斯噪声来模拟?现实CMOS传感器的噪声是信号相关的,低光下的噪声还带有明显的拖尾分布和空间结构性,纯高斯噪声根本模拟不出那个味道。
三步走:仿真造数据、结构瘦身、知识回填
面对算力、数据、画质这三座大山,LiteKD-Net选择了一条非常接地气的路径——把问题拆成三块,分别击破。
第一步,解决数据问题。论文设计了一条噪声仿真管线(Noise Simulation Pipeline,简称NSP) ,在干净图像的基础上,按照物理模型逐步添加各种在真实CMOS传感器中出现的噪声类型,从而自动生成像素级对齐的LQ-GT配对数据。这一步不需要人肉拍摄,也不需要昂贵的设备标定,拿一张干净图就能批量生产出"看起来像手机拍的"带噪图。
第二步,解决算力问题。论文以Real-ESRGAN这个著名的复原网络为基底,先把它的超分上采样模块全部去掉,让它变成一张图进一张图出的"纯去噪"重型教师网络(Teacher)。然后做瘦身改造:用深度可分离卷积替换掉标准卷积,同时去掉稠密连接路径,构造出一个轻量级的Lite-RRDB学生网络(Student)。这样一改,参数量直接降了一个数量级。
第三步,解决画质损失问题。模型轻量化之后,表示能力难免打折。论文引入了特征级知识蒸馏(Noise-KD) 机制:在训练过程中,把同一个带噪图分别送入冻结的教师网络和待训练的学生网络,让学生网络的中间层特征去对齐教师网络的中间层特征,就像学生照着老师的笔记来抄,把老师"怎么想"的过程学到手。由于教师只在训练阶段参与、推理阶段完全被丢弃,知识蒸馏相当于给轻量化模型做了一次免费的"画质回填"。
这个"三步走"思路,每一步单独拿出来都算不上惊世骇俗,但组合到一起,恰好形成了一条从数据到模型到效果优化的完整闭环。下面逐块拆开来看细节。
像素串扰:一个常被忽略却关键的噪声细节
NSP的设计,源自Wei等人在CVPR 2020上提出的物理噪声模型。原始的模型把RAW域噪声分解成四部分:光子散粒噪声(photon shot noise)、Tukey-Lambda读出噪声(heavy-tailed read noise)、行噪声(row noise)和量化噪声(quantization noise)。这四类噪声各有各的脾气:散粒噪声是信号相关的,越亮的地方噪得越厉害;读出噪声不依赖信号强度,但有拖尾分布的特征;行噪声表现为横条纹;量化噪声则源于模数转换的精度限制。
LiteKD-Net对这套物理模型的扩展在于:额外引入了像素串扰(pixel crosstalk) 机制。什么是像素串扰?简单来说,在紧凑的移动传感器上,相邻像素之间存在光学或电学上的泄漏——一个像素积累的电荷,可能会"漏"一部分到隔壁像素去。这意味着实际传感器上的噪声并不是每个像素独立产生的,而是存在一定的空间相关性。像素越小、排布越紧密,这种串扰现象就越明显。而现有的仿真管线基本都忽略了这一层。
NSP的做法很直接,用一个3×3的卷积核跟信号做空间卷积。核的数学形式是:中心权重为1-5c,上下左右权重为c,四个对角权重为c/4。所有权重加起来等于1,所以这个操作基本不改变局部亮度,只是把每个像素的能量向周围轻微扩散,从而把独立的像素噪声变成空间相关的噪声。那个放大的差异图可以直观看到,加入串扰之后,噪声分布出现了沿着边缘和纹理方向的平滑痕迹,这正是真实传感器噪声中常见的空间模式。
除了像素串扰这个关键改动,NSP还有两个值得注意的适配设计。一个是因为训练数据是sRGB图像而非RAW数据,所以先用gamma展开做近似线性化,仿真完成后再做逆变换转回sRGB;另一个是多个噪声参数是固定的全局设定,不需要像Wei等人的模型那样为每台相机做标定。这个取舍让数据生成流程变得极其简单,配合无标注的干净图像库,想要多少训练数据就能生成多少。
Lite-RRDB:深度可分离卷积的轻量改造
聊完数据,来看模型。LiteKD-Net的教师网络是从Real-ESRGAN改造而来的——把RRDB(嵌套残差稠密块)骨干保留,把超分模块的上采样层全部去掉,得到的是一个标准的同分辨率去噪网络。但RRDB的"稠密"两个字不是白叫的:每个残差稠密块(RDB)内部有5层标准3×3卷积,每层都会接收前面所有层的输出做拼接,再加上块间嵌套残差,信息流动路径极其丰富,代价就是参数量和计算量相当感人。
Lite-RRDB的做法,是向MobileNet系的轻量化设计取经,把标准卷积替换为深度可分离卷积(Depthwise Separable Convolution,简称DSConv) 。标准卷积是对所有输入通道同时做空间滤波和跨通道融合,参数量是k²×C_in×C_out;而深度可分离卷积把这个过程拆成两步——先用3×3的深度卷积(Depthwise Conv)在每个通道内部单独做空间滤波,再用1×1的逐点卷积(Pointwise Conv)做跨通道融合。两步的参数量加起来只有k²×C_in + C_in×C_out。当输入输出通道数都是64、卷积核为3×3时,标准卷积需要9×64×64=36864个参数,深度可分离卷积只需要9×64+64×64=4672个参数,大约只有原来的12.7%。这个差距在深层网络中会被急剧放大。
除了替换卷积类型,Lite-RDB还做了一个更激进的改动——去掉稠密连接路径 。原来的5层卷积依次拼接起来,每层都要接收之前所有层的输出;改成顺序执行后,层与层之间只传当前特征图,特征宽度固定为64通道。这一刀砍下去,省掉的不只是参数量和计算量,还有运行时的内存占用——不用再缓存各层输出用于拼接了。但需要注意,去掉的是稠密连接,不是残差连接:每个Lite-RDB内部保留了局部残差,缩放因子0.2;每个Lite-RRDB外部也保留了跨块的嵌套残差。浅层信息依然有通畅的传递通道,这一点对去噪任务能不能保住细节非常关键。
这里顺便提一嘴教师网络和学生网络的训练策略。教师先用L1重建损失加LPIPS感知损失训练10万步,收敛后把参数冻结。学生分两个阶段训练:第一阶段只用Lite-RRDB训练,第二阶段加上Noise-KD蒸馏损失再训10万步。总损失函数由三部分构成:L1重建损失保证像素级保真度,LPIPS感知损失保留感知上有意义的结构,特征蒸馏损失让学生的中间特征向教师看齐。
肉眼可见的效果:10倍瘦身、近2倍提速
实验部分,论文在真实世界的Mobile AI Denoising Dataset和MIDD数据集上做了评测。需要注意一个前提:训练数据是由NSP仿真生成的,测试数据是真实手机拍摄的,这种"仿真训练+真实测试"的设置本身就具有不小的挑战性。论文没有回避这一点,反而在多个指标上都交出了不错的成绩单。
先看表1的重头数据。LiteKD-Net的参数量只有1.67M,而Real-ESRGAN是16.70M,SwinIR是11.46M——LiteKD-Net大约是Real-ESRGAN的十分之一,是SwinIR的七分之一还少。计算量方面,256×256输入下,LiteKD-Net的MACs(乘累加操作数)为108.28G,对比Real-ESRGAN的1.17T和SwinIR的752.13G,优势同样明显。推理耗时83.47毫秒对比148.70毫秒和410.70毫秒,FPS达到11.98,是Real-ESRGAN的1.78倍,是SwinIR的将近5倍。
画质方面更有意思。PSNR上LiteKD-Net拿到37.9102dB,Real-ESRGAN是38.1400dB,差距不到0.23dB;SSIM上0.8975对0.9007,感知指标LPIPS上0.0987对0.0974,DISTS上0.0837对0.0790——每一项都只差不到1%。考虑到这是在参数量缩水到十分之一、速度提升1.8倍的前提下达成的,这个结果相当能打。在无参考指标MUSIQ上,LiteKD-Net甚至反超了Real-ESRGAN和SwinIR拿到第一。而对比SwinIR,LiteKD-Net在PSNR上领先2.18dB,SSIM领先0.0733,LPIPS、DISTS等感知指标更是全面胜出——这说明它在真实手机噪声场景上的表现,确实超过了那个体量大自己将近7倍的Transformer模型。
表2的消融实验把Model的每一步改动说得很清楚。从Baseline到Lite-RRDB,PSNR掉了0.9dB,LPIPS从0.0974恶化到0.1257,这个画质损失肉眼可见;但参数量从16.70M降到1.67M,运行内存从2722MB降到2667MB,推理速度从6.72 FPS提升到11.99 FPS。从Lite-RRDB加上Noise-KD之后,PSNR从37.2433直接回升到37.9102,LPIPS从0.1257大幅回落到0.0987,和Baseline的0.0974已经几乎重合。蒸馏一下,画质几乎全部回填,而推理成本和模型体积没有任何变化——这正是知识蒸馏在轻量化部署里的价值所在。
图4的定性对比把数值上的结论变得具体可感。第一列到第二列是输入的带噪图和对应的干净参考图;第三列Baseline虽然噪声压制得不错,但计算开销摆在那儿;第四列Lite-RRDB在部分区域会留下残余噪声,或者把细小的纹理一并抹掉;到了第五列加上蒸馏之后,细节纹理的恢复明显改善,边界更锐利,噪声的抑制也更干净,视觉效果上跟第三列已经很难靠肉眼分辨高下。
这里需要客观地指出一点:从绝对指标来看,LiteKD-Net在PSNR、SSIM等5个有参考指标上仍未超过Real-ESRGAN这个重型教师。论文并没有回避这一点,而是坦诚地强调自己在效率和画质之间取得了更好的折中。这种"效率大幅提升、画质小幅回退或接近"的结果,在移动端部署场景下往往是更现实也更有价值的选择。
深度点评:一篇取舍清晰的移动端去噪工作
把整篇论文的框架铺开来看,LiteKD-Net最大的特点其实是清晰的取舍意识 。它没有追求某个单一指标的极致,而是在画质、速度、模型体积、数据成本四个维度之间找到了一个合理的工程平衡点。NSP解决了数据从哪来的问题,Lite-RRDB解决了模型怎么变轻的问题,Noise-KD解决了变轻之后画质损失如何补偿的问题。这三个模块各有各的目标函数,组合起来却形成了一条完整的"轻量化去噪解决方案"。
在工程落地层面,这篇论文有几个值得肯定细节。以在sRGB域而非RAW域做噪声仿真为例,这意味着NSP可以直接拿来处理手机相册里常见的sRGB图片,不需要对每款手机做传感器标定,使用门槛大幅降低。再比如最终的模型只用到了深度可分离卷积和残差连接,这些都是移动端推理框架中已经高度优化的算子,实际部署不存在兼容性障碍。
当然,论文也没有回避自己的局限。NSP的噪声仿真是在近似线性化的sRGB空间完成的,缺少对真实相机处理管线中demosaicing(去马赛克)、白平衡、色彩校正、色调映射等环节的建模。这意味着仿真噪声与真实传感器的物理噪声之间仍然存在差距。另外,对比的基线模型虽然包括SwinIR这个Transformer架构,但对于一个偏工程落地的工作来说,如果能补充与更多移动端专用方案的对比,说服力会更强一些。还有一点需要注意的是,训练数据是由论文作者自己构造的,虽然测试用了公开数据集,但不同方法在训练数据上的差异会给对比带来一定的影响。
总而言之,LiteKD-Net是一篇典型的"目标明确、路径清晰、结果扎实"的移动端图像复原工作。它没有为了追求论文的"故事性"而绕弯子,而是把工程问题拆解成数据、模型、优化三个环节,逐一解决。这样的工作,对工业界同行来说有很高的参考价值。
龙迷三问
这篇论文到底在解决什么问题? 上海交通大学提出LiteKD-Net移动端图像去噪网络。
这篇工作最值得看的点是什么? 相比SwinIR,在所有质量指标上全面领先;相比Real-ESRGAN(原重型教师),在多数量化指标略低但极接近(PSNR 37.91 vs 38.14,SSIM 0.8975 vs 0.9007,LPIPS 0.0987 vs 0.09…
这篇工作的边界或风险在哪里? 优点:1)NSP在sRGB域通过像素串扰建模局部相关噪声,使合成数据更贴近真实传感器噪声;2)Lite-RRDB在保持残差结构前提下大幅压缩计算量,效率收益明显;3)Noise-KD在不增加推理代价的前提下有效弥补轻量模型的性能损失,整体…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
构建三阶段框架:物理引导的噪声仿真pipeline(NSP)生成配对训练数据、基于深度可分离卷积的Lite-RRDB轻量学生网络、以及特征级知识蒸馏(Noise-KD)从重型教师网络迁移修复能力,从而在移动端实现高效去噪。
学术研究价值: ★★★★☆
构建三阶段框架:物理引导的噪声仿真pipeline(NSP)生成配对训练数据、基于深度可分离卷积的Lite-RRDB轻量学生网络、以及特征级知识蒸馏(Noise-KD)从重型教师网络迁移修复能力,从…
稳定性: ★★★☆☆
优点:1)NSP在sRGB域通过像素串扰建模局部相关噪声,使合成数据更贴近真实传感器噪声;2)Lite-RRDB在保持残差结构前提下大幅压缩计算量,效率收益明显;3)Noise-KD在不增加推理代价的前提下有效弥补轻量模型的性能损失,整体…
适应性以及泛化能力: ★★★☆☆
优点:1)NSP在sRGB域通过像素串扰建模局部相关噪声,使合成数据更贴近真实传感器噪声;2)Lite-RRDB在保持残差结构前提下大幅压缩计算量,效率收益明显;3)Noise-KD在不增加推理代价的前提下有效弥补轻量模型的性能损失,整体…
硬件需求及成本: ★★★☆☆
1.67M参数,108.28G MACs(256×256输入),216.55G FLOPs,推理耗时83.47ms,FPS 11.98,峰值内存约2667.78MB
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
优点:1)NSP在sRGB域通过像素串扰建模局部相关噪声,使合成数据更贴近真实传感器噪声;2)Lite-RRDB在保持残差结构前提下大幅压缩计算量,效率收益明显;3)Noise-KD在不增加推理代价的前提下有效弥补轻量模型的性能损失,整体…
可能的问题: 优点:1)NSP在sRGB域通过像素串扰建模局部相关噪声,使合成数据更贴近真实传感器噪声;2)Lite-RRDB在保持残差结构前提下大幅压缩计算量,效率收益明显;3)Noise-KD在不增加推理代价的前提下有效弥补轻量模型的性能损失,整体…
主要参考文献
[1] Abdelhamed A, Lin S, Brown M S. A high-quality denoising dataset for smartphone cameras[C]. CVPR, 2018.
[2] Wei K, Fu Y, Yang J, et al. A physics-based noise formation model for extreme low-light raw denoising[C]. CVPR, 2020.
[3] Howard A G, Zhu M, Chen B, et al. MobileNets: Efficient convolutional neural networks for mobile vision applications[J]. arXiv:1704.04861, 2017.
[4] Wang X, Xie L, Dong C, et al. Real-ESRGAN: Training real-world blind super-resolution with pure synthetic data[C]. ICCVW, 2021.
[5] Hinton G, Vinyals O, Dean J. Distilling the knowledge in a neural network[J]. arXiv:1503.02531, 2015.
[6] Zhang K, Zuo W, Chen Y, et al. Beyond a Gaussian denoiser: Residual learning of deep CNN for image denoising[J]. IEEE TIP, 2017.
[7] Liang J, Cao J, Sun G, et al. SwinIR: Image restoration using Swin Transformer[C]. ICCVW, 2021.
[8] Flepp R, Ignatov A, Timofte R, et al. Real-world mobile image denoising dataset with efficient baselines[C]. CVPR, 2024.
原文链接:https://arxiv.org/pdf/2608.05739v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!