← 返回 PaperDaily
视觉与图像
告别高功耗CNN!脉冲网络也能看清全局,混洗大法太绝了
脉冲神经网络(SNN)一直被看作是低功耗计算的未来之星,但在图像恢复这种需要“顾全大局”的任务上,受限于感受野,往往表现不佳。这篇2026年的新工作巧妙地将小波变换和一种零开销的随机混洗操作引入SNN,让“近视”的脉冲网络也能高效建模全局依赖,参数量仅0.125M,去雨性能却实现了大幅跃升。对于关注边缘端AI和高效模型的小伙伴,这篇文章值得一读。
龙哥读论文
发布于 2026-08-14 09:10:39
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 脉冲神经网络(SNN)一直被看作是低功耗计算的未来之星,但在图像恢复这种需要“顾全大局”的任务上,受限于感受野,往往表现不佳。这篇2026年的新工作巧妙地将小波变换和一种零开销的随机混洗操作引入SNN,让“近视”的脉冲网络也能高效建模全局依赖,参数量仅0.125M,去雨性能却实现了大幅跃升。对于关注边缘端AI和高效模型的小伙伴,这篇文章值得一读。
原论文信息如下:
1. 脉冲网络+小波:新范式如何高效恢复图像?
一直以来,图像恢复(Image Restoration, IR)都像是个“无中生有”的魔术。从一张满是雨痕、噪点或低光照的照片里,变回清晰细腻的原图,这事儿听着就挺玄乎。传统的深度学习方法,要么靠卷积神经网络(CNN)硬堆,要么靠Transformer搞全局建模。但CNN有个天生的“近视”毛病——感受野有限,只能看到局部一小块,顾此失彼;而Transformer虽然能“眼观六路”,但其自注意力机制带来的二次复杂度让计算量飞涨,功耗感人,显然不适合跑在手机、摄像头这些边缘设备上。
那有没有一种模型,既能有Transformer一样的全局视野,又能像CNN一样轻巧高效,功耗还低呢?脉冲神经网络(Spiking Neural Network, SNN),这个号称“第三代神经网络”的家伙,其实一直被寄予厚望。SNN通过模拟生物神经元的方式,用离散的“脉冲”传递信息,天然就是为低功耗而生的。可问题是,SNN的“近视”毛病更严重,现有的脉冲CNN模型因为感受野限制,在图像恢复这种需要全局理解的任务上,效果总差那么点意思。
这篇论文的作者们显然被这个痛点困扰已久。他们灵光一闪:既然SNN想省电,又想拔高视野,何不借力打力,引入小波变换(Discrete Wavelet Transform, DWT)?他们的核心洞察在于,图像退化(比如雨滴、噪声)往往只集中在某些特定的频率分量上。比如低频信息保留了大体轮廓和全局结构,而雨丝这种高频细节才需要重点修复。这样一来,模型就不必对整张图“一视同仁”,可以精准地在不同频率尺度上干活。
基于这个想法,他们提出了一个全新的脉冲金字塔小波模型(Spiking Pyramid based Wavelet Model, SPWM)。这玩意儿的骨干是三个部分:一个基础的脉冲卷积块,一个他们精心设计的“双层”核心模块,以及一个轻量级的重建模块。先让脉冲神经元把输入图像编码成脉冲序列,然后通过多级小波分解,在高、低频子带上分别进行特征提取和修复,最后再通过逆向小波变换重建高质量输出。一句话总结就是:用最少的能量,完成最全局的思考。
2. 核心机制:金字塔小波与随机混洗
SPWM的神奇之处,全在于它肚子里那两个精巧的“法宝”:脉冲金字塔小波单元(SPWU) 和脉冲金字塔混洗单元(SPSU) 。这哥俩构成了整个模型的“双子星”,共同成就了既全局又高效的特性。
先看SPWU,它干的事比较直观。输入特征图进来,先经过一个脉冲可分离卷积(Spiking SepConv)做初步处理。然后,好戏上演了——对特征图进行离散小波变换(DWT),一次不够就做两次,形成一个金字塔状的频率空间。在这个“小波域”里,低频子带(LL)包含了图像的骨架轮廓,高频子带(LH、HL、HH)则包揽了雨丝、纹理等细节。在每个子带上,又用一个独立的脉冲可分离卷积来干活,最后通过逆变换(IDWT)把人家的劳动成果合在一处。这招的好处很明显:卷积核不用满世界找感受野了,因为在分解后的低频图上,几个像素的局部卷积,对应到原图上就是一大片区域,视野瞬间打开,而计算量却一点没涨。
再看SPSU,它干的活就有点“反常识”了。整个用下来,SPWU已经能建模长距离依赖了,但作者觉得还不够。SPSU在最后一级小波域里,引入了一个零开销的操作——随机混洗(Random Shuffle, RS)。原本图像数据是按空间顺序排列的,你一“混洗”,不同区域的像素就被打乱了,强制卷积核在一个小窗口里处理来自天南海北的特征。举个例子,原本图像左上角和右下角的像素,互相之间隔着十万八千里,再大的卷积核也覆盖不到。混洗之后,这俩像素可能成了邻居,卷积核也就自然而然地学到了一张图中最远的地方长啥样。混洗完成后,再执行一次逆操作(Inverse Shuffle),把数据还原回去。
这么设计,等于给SNN装了个“千里眼”,但又没增加任何额外的参数和计算量。更妙的是,退化(比如雨滴)被随机分散到了图像各处,原本集中在一起的大片雨渍,散开后就变成了一个个小点,模型修复起来反而更容易了。作者把SPWU和SPSU合体,做成了一个脉冲双金字塔小波(SDPW)块 ,然后让N个这样的块堆叠起来,一起从脉冲序列里提取特征。
3. 实验表现:去雨任务全面领先
光说不练假把式。作者把SPWM放到了三个经典的去雨数据集上(Rain100L, Rain100H, Rain120),跟9个当时一流的方法包括基于CNN的(MPRNet, EFFDerain)、基于Transformer的(DRT, ELFormer)和基于SNN的(ESDNet)做了全面对比。结果只能用一句话形容:全面、完胜。
在最具挑战的Rain100H(重度雨景)数据集上,SPWM在PSNR指标上比之前的SNN方法ESDNet高出0.9 dB;在SSIM上也全面领先。更恐怖的是,SPWM的参数仅有0.125M,而ESDNet有0.85M,Transformer方法动辄几十兆。用更少的参数,干更漂亮的事,这才是效率的精髓。
除了数字,看效果图更震撼。在Rain100H的对比图(图5、6)中,其他方法或多或少还会留下雨痕的残影或者颜色偏移,而SPWM去得那是相当干净,不仅雨丝消失了,连原本被雨遮住的颜色和纹理都还原得栩栩如生。
4. 低光照与去雾:能效与性能的权衡
去雨只是开胃菜,SPWM在低光照增强和去雾任务上同样表现不俗。
在LOL低光照数据集上,SPWM直接拿下了最高的SSIM(结构相似度)评分,同时PSNR也极其有竞争力。虽然有些海量参数的Transformer模型PSNR稍微高那么一丢丢,但看看SPWM的参数和能耗,零头都不到。在边缘计算场景下,这就是决定性的优势。去雾任务上,在Dense-Haze数据集上,SPWM也凭极少的参数,取得了与一流去雾方法相当的性能。
不过也得客观承认,去雾任务上PSNR指标确实没有完全碾压。作者解释因为雾霾是全局退化,模型需要更大范围的全局信息,而小波域虽然好,但面对这种弥漫性的污染,挑战还是要比处理局部雨丝大一些。所以,SPWM更像是“能效比”之王,而不是“蛮力”王者。
5. 消融分析:组件贡献与时间步长影响
为了证明设计的每一个零件都没白装,作者做了系统的消融实验。“万丈高楼平地起——结果告诉我们,缺了哪个都不行”。
去掉SPWU和SPSU(模型A/B vs G),PSNR直接掉了近0.4 dB,说明这俩“芯”对性能贡献巨大。没了多尺度渐进融合和SCAM模块(模型C/D)也不行,PSNR掉得更多。特别有意思的是小波层数实验:不加DWT(层数0),PSNR很低;用一层DWT,效果立刻提升;但是用到三层DWT时,效果反而不如两层。因为特征图经过多次下采样后已经很小了,再分层也没意义。最终作者选择了两层小波来做特征提取,完美平衡了视野和精度。
关于时间步长,脉冲神经网络需要时间步来累积脉冲。实验发现,时间步长从1增加到4,PSNR稳步提升;但当步长增加到5,算力翻倍,效果却提升有限。所以4步是性价比很高的选择。
6. 总结与未来方向:SNN在图像恢复中的潜力
总的来看,SPWM这篇工作像是一股清流,给图像恢复这个卷生卷死的领域提供了一个新思路。它证明了SNN+小波这个组合拳的巨大潜力——既能像Transformer一样全局感知,又保留了SNN天生的低功耗优势。
当然,未来还有挺多可以继续优化的地方。比如在去雾这种全图退化任务上,SPWM的表现还不够极致,说明面对非局部特征时,简单的随机混洗可能还不够“聪明”。未来可以用更智能的注意力机制来引导混洗。此外,把SPWM部署到实际的芯片上,比如基于事件相机的智能摄像头,会是一个非常有价值的方向。到时候,一辆自动驾驶汽车能在夜间或雨天,用最低的能耗,获得最清晰的视觉感知,想想就有点小激动。
龙迷三问
问:这篇论文里的SNN和ANN到底是什么?有什么区别? ANN(人工神经网络)就是我们常说的深度学习网络,比如CNN和Transformer,它处理的是连续的浮点数。而SNN(脉冲神经网络)模拟了生物神经元,它传播的是离散的“脉冲”(0或1)。SNN最大的优点是极省电,因为脉冲事件稀疏时,计算和通信开销都极低,非常适合做边缘设备上的AI。
问:文章中提到的LIF神经元是怎么工作的? LIF(Leaky Integrate-and-Fire)神经元是文章中使用的一种脉冲神经元。打个比方,它就像一个水桶。输入信号像水一样注入到桶里(积分),同时桶底有个小洞,水会慢慢漏掉(泄漏)。累计的水位(膜电位)超过桶沿(阈值)时,水就溢出来(发放一个脉冲),然后桶里的水被倒空(重置)。这个机制就让神经元能以时间和脉冲的形式处理信息。
问:文中提到的“能效比”是怎么算的?只用了0.125M参数,这个数字怎么理解? 文章按不同操作的能量消耗来计算总能耗:每1次浮点操作(FLOP)消耗12.5 pJ(皮焦),而每1次脉冲操作(SOP)仅消耗7 fJ(飞焦),相差上千倍。SPWM通过把大量计算从高耗能的ANN部分转移到低耗能的SNN部分,所以能效极高。0.125M参数(约12.5万个参数)意味着模型非常小,往往可以放到手机或IOT设备的内存里实时运行。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
提出将DWT和随机混洗引入SNN,打破了SNN用于密集预测任务的感受野瓶颈,思路新颖。虽然是“组装”但在结合方式和推理逻辑上有明显增量贡献。
实验合理度: ★★★★☆
对比基准包括9个方法,覆盖CNN、Transformer、SNN三大流派,消融实验系统完整。但对比基线与论文大体同期,有开源的都已开源,保证了公平性。
学术研究价值: ★★★★★
在SNN低功耗恢复方向上做出了示范性工作,证明了混合多尺度频率范式可以有效解决脉冲网络“近视”难题,对边缘计算和面向传感器端的AI落地有重要启发。
稳定性: ★★★★☆
在多个任务上表现稳定且一致;但在全局退化(雾)场景下略逊于参数更大的Transformer,说明对全图退化的鲁棒性有待加强。
适应性以及泛化能力: ★★★★☆
在去雨、低光照增强、去雾三个不同数据域上都取得了不错的泛化效果,而且参数量极小,展现了很强的迁移潜力。
硬件需求及成本: ★★★★★
模型极小(0.125M参数),使用SNN脉冲驱动,理论能效远高于所有ANN方法,非常有利于直接部署在边缘或移动端芯片上,性价比极高。
复现难度: ★★★★☆
模型结构清晰,基于PyTorch实现,训练配置(学习率调度、batch size、时间步长)都很直接。虽然论文未明确说已开源,但对熟练的研究者来说复现不是难事。
产品化成熟度: ★★★☆☆
概念验证阶段,离直接产品化还有距离。特别是SNN在纯硬件的神经形态芯片上的优化还有待验证,但是理论落地场景(如智能安防摄像头、无人机等)非常明确。
可能的问题: 随机混洗操作虽然无参数,但它的不可解释性和潜在的训练不稳定问题没有深入讨论;在去雾这类全局退化任务上表现一般,说明只在局部退化上占优,泛化天花板还不够高。
主要参考文献
[1] Zhang, K., et al. "Beyond a Gaussian Denoiser: Residual Learning of Deep CNN for Image Denoising." IEEE TIP, 2021.
[2] Liang, J., et al. "SwinIR: Image Restoration Using Swin Transformer." ICCVW, 2021.
[3] Hu, Y., et al. "Spiking Deep Residual Network." arXiv, 2018.
[4] Zhou, S., et al. "ESDNet: Efficient Spike-Driven Network for Image Restoration." NeurIPS, 2024.
[5] Yao, M., et al. "Spike-driven Transformer." NeurIPS, 2024.
[6] Zamir, S. W., et al. "Restormer: Efficient Transformer for High-Resolution Image Restoration." CVPR, 2022.
[7] Fu, X., et al. "A wavelet-based perceptual loss for convolutional neural networks in image restoration." TCSVT, 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
用0.125M的小网络,竟然能看清雨雾背后的世界?这就是SPWM的魔法!想围观更多低功耗、高性价比的“小而美”AI模型,或是跟龙哥一起探讨SNN的未来?快来群里坐坐!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。