← 返回 PaperDaily
视觉与图像
哈工大RainDancer:事件相机让去雨更稳了?
这篇论文最有意思的地方,不是“把事件相机加进来”这么简单,而是先把雨和背景拆开,再让两种模态按角色配合。对动态雨天视频来说,这种“先分家,后合作”的思路,比粗暴融合更像正经工程。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文最有意思的地方,不是“把事件相机加进来”这么简单,而是先把雨和背景拆开,再让两种模态按角色配合。对动态雨天视频来说,这种“先分家,后合作”的思路,比粗暴融合更像正经工程。
原论文信息如下:
下雨天的视觉困扰:RGB去雨为何难?
雨天视频去雨这件事,表面看是“把雨丝擦掉”,实际却是一个经典的视觉歧义题:雨丝、背景纹理、反光、车窗水痕、运动模糊,甚至边缘细节,在RGB图像里都可能长得差不多。模型一不小心就会把真纹理当雨删掉,或者把雨残影当细节留下来。结果就是,画面看着“差不多干净”,但仔细一看,还是会有一层若有若无的灰蒙蒙。
传统视频去雨靠的是时间冗余:前后帧之间找一致结构,再把不一致的东西当雨处理。这条路没错,但在动态雨天场景里就开始犯难了。因为相机在动、物体在动、雨也在动,谁像谁已经不是“看一眼就知道”的程度,而是“模型看完也会沉默”的程度。RGB-only 方法在这种情况下很容易把结构和雨混成一锅粥。
这篇论文的切入点很直接:既然RGB自己分不清,那就拉来一个更擅长看“变化”的伙伴——事件相机。事件相机不是按帧拍照,而是记录每个像素亮度变化是否超过阈值,输出的是异步事件流。它天然对运动敏感、时间分辨率极高,薄雨丝、短暂闪动、快速变化的轨迹,往往比RGB更容易被“抓现行”。
但事件相机也不是“雨天外挂”。它同样会受到传感器噪声、相机运动、背景运动触发的干扰。也就是说,事件流里不只有雨,还有一堆“看热闹”的响应。如果直接把RGB和事件粗暴融合,常见结果不是互补,而是互相添乱。于是,论文提出了一个很关键的原则:先分解,后交互。先把雨和背景在各自模态里拆开,再让语义对齐的部分去合作。
这里还要顺手解释一个关键词:脉冲神经网络,英文是 Spiking Neural Network,简称 SNN。它模仿神经元“有脉冲才激活”的工作方式,特别适合处理事件这种稀疏、离散、时间敏感的数据。论文里不是拿SNN当噱头,而是把它放进事件分支,用来专门建模雨相关的突发动态,这一点挺对路。
简单说,RGB负责“看见画面长什么样”,事件负责“看见哪里刚刚发生了变化”,SNN负责“别把这些变化当成普通纹理糊过去”。这三者配合好了,才有机会把雨和背景真正拆开,而不是把雨删成一块塑料感很强的平滑图。
核心创新:先分解,后交互,告别模态干扰
RainDancer的主干思路可以概括成一句话:不是先融合,而是先分家。在每个阶段里,RGB分支先把当前特征拆成背景和雨;事件分支再把事件流里和雨有关的动态凸显出来;随后,两个模态只在语义对齐的组件之间交换信息。这样做的好处很朴素:该保的背景单独保,该删的雨单独删,避免“雨和背景一起被打包处理”。
在RGB分支里,论文先用一个轻量时空编码器提取邻近帧的联合特征,再做帧域分解。这里的分解不是硬切一刀,而是通过通道注意力和空间注意力去估计更稳定的背景部分,然后用残差关系得到雨分量。这个设计很工程化:背景是主菜,雨是残渣,先把主菜端稳,再处理残渣,逻辑上就比“一锅乱炖”清楚得多。
更关键的是,分解之后还有一个 CRM,英文是 Coupled Representation Module,中文可以理解为“耦合表示模块”。它的作用不是再造一个大融合器,而是让背景流和雨流互相校正:背景流里混进去的雨残影可以转移出去,雨流里漏掉的背景细节也可以补回来。这个步骤很像给两条线做“相互纠偏”,防止第一次分解太粗糙。
事件分支更有意思。RainDancer没有把事件当作普通辅助特征,而是专门设计了一个雨导向SNN事件解耦模块,英文简称 SNN-RoED,即 Rain-oriented Spiking Neural Network Event Disentanglement。这个名字有点长,但意思很明确:不是泛泛地处理事件,而是专门抓“雨相关的脉冲动态”。
SNN-RoED里有三路雨运动线索。局部运动分支看短时爆发,适合抓细碎雨丝;全局脉冲运动分支负责更长程的时序依赖,用来理解事件流中的整体动态;方向分支则把前后事件响应结合起来,强化雨线的方向性。三路信息再通过门控单元融合,最后用残差方式估计事件背景。说白了,就是先把“像雨的变化”提纯出来,再反推剩下的背景事件。
接下来是最容易翻车、也最能体现论文思路的地方:组件级融合。背景融合模块 RABF(Rain-Aware Background Fusion,雨感知背景融合)只处理背景和背景之间的对齐与补偿,而且会引入雨特征来判断事件信息靠不靠谱;雨融合模块 EGRF(Event-Guided Rain Fusion,事件引导雨融合)则专门让RGB雨特征和事件雨特征对话,帮助定位并压制动态雨丝。背景和雨分别走不同通道,避免“结构补偿”和“雨抑制”混成一个黑盒。
这套设计最聪明的地方,不在于模块名字多,而在于它把“模态差异”变成了“语义分工”。RGB负责密集外观,事件负责稀疏动态;背景负责保结构,雨负责找干扰。只要分工明确,交互就不会变成互相污染。这个思路很像工程里常说的“先拆职责,再谈协作”,只是这里拆的是视觉模态。
训练目标也不是只盯着最后一张干净图。论文还加了事件域监督,让事件背景在稀疏重建、结构一致性、梯度方向上都别跑偏。这里有三个术语值得顺手解释一下:Charbonnier损失是更平滑的鲁棒重建损失,常用来替代纯L1;SSIM是结构相似性指标,关注图像结构是否像;梯度方向约束则是盯住边缘朝向,避免事件结构被“修得太圆滑”。
实验观测:去雨更干净,下游任务也更稳
这篇论文的实验设计比较完整,覆盖了合成数据、真实雨天数据,以及下游感知任务。这里先说结论:RainDancer不是只在“看起来更清爽”这件事上占优,它在PSNR、SSIM、无参考质量指标以及检测/分割任务上都给出了比较扎实的改进。对去雨任务来说,这种“低层恢复 + 高层感知”同时变好,才更像真正有用的方法。
先看合成数据。论文在 NTURain、RainSynLight25 和 RainSynComplex25 上做了对比,RainDancer在三套数据上都拿到了最好的PSNR,其中在复杂雨场景上的提升最明显。这个现象不难理解:雨越密、背景越杂、运动越强,RGB-only 的歧义越大,事件模态的价值就越高。也就是说,这方法不是在“简单题”上刷分,而是在“更容易翻车”的场景里更占便宜。
真实雨天数据更能检验方法是否“只会做题,不会干活”。论文在 NTURain real-world 上报告了 NIQE、BRISQUE、ILNIQE 和 CLIPIQA。这里要提醒一下,前面三个指标是越低越好,CLIPIQA 则是越高越好。RainDancer在这些无参考指标上整体表现更稳,说明它不是只会在有GT的合成集上“刷存在感”,对真实场景的视觉质量也有帮助。
更有意思的是下游任务。论文把去雨结果送进目标检测和语义分割系统,观察雨天视频恢复是否真的能帮助感知。结果显示,RainDancer不仅恢复指标更好,后续检测和分割也更稳。这说明去雨不是单纯为了“看着舒服”,而是实打实地减少了视觉系统的误判。对自动驾驶、监控、机器人这类场景来说,这种提升比单纯PSNR涨一点更有价值。
消融实验也挺有说服力。交互范式消融说明,直接融合不如先分解后交互;事件分支消融说明,普通CNN和一般SNN分支都不如雨导向SNN;事件域监督消融说明,如果不管事件结构和方向,事件分支会更“散”。这些结果和方法设计是一一对应的,不是靠堆模块碰运气。换句话说,论文的改进不是玄学,是每一刀都切在问题上。
图10:渐进阶段数量消融可视化。随着阶段数增加,雨图逐步收敛到更接近真值的形态,说明“渐进式分解与融合”比一步到位更稳。
不过也要客观看待:这套方法的代价并不小。它引入了事件输入、同步采集、事件模拟或真实事件硬件、以及相对复杂的多分支网络。对于只想在普通RGB摄像头上直接部署的场景,这个门槛就不低。RainDancer的优势更像是“在具备RGB+事件条件的高可靠感知系统里,提供更稳的去雨方案”,而不是一招通吃所有设备。
总结与展望:为恶劣天气下的可靠感知铺路
RainDancer最值得记住的,不是“用了事件相机”这几个字,而是它把事件真正变成了有角色分工的辅助信息。先在各自模态里分解雨与背景,再做组件级交互,这个思路比粗暴拼接更适合动态雨天视频。它的价值不仅在去雨本身,也在于告诉人们:多模态融合不是越早越好,关键是先把语义角色理顺。
未来如果要继续往前走,至少有两个方向值得盯紧。一个是把事件采集和RGB恢复做得更轻量,降低硬件门槛;另一个是把这种“先分解后交互”的思想扩展到更多恶劣天气任务,比如雾天、雪天、低照度视频增强。只要模态之间仍然存在“谁是干扰、谁是线索”的问题,这种思路就还有继续生长的空间。
龙迷三问
这篇论文到底解决了什么问题?它解决的是动态雨天视频里“RGB和事件怎么别互相添乱”的问题。不是简单把事件加进来,而是先把雨和背景分开,再让对应组件去融合,从而减少模态干扰。
SNN-RoED 和 EGRF 这些缩写是什么意思?SNN-RoED 是 Rain-oriented Spiking Neural Network Event Disentanglement,中文是“雨导向脉冲神经网络事件解耦”;EGRF 是 Event-Guided Rain Fusion,中文是“事件引导雨融合”。前者负责从事件流里抓雨相关动态,后者负责用事件去辅助雨分量融合。
这方法为什么比直接融合更靠谱?因为直接融合会把RGB外观、事件响应、事件噪声混在一起,模型很容易分不清谁是雨、谁是背景。先分解后交互相当于先把职责划开,再做有针对性的合作,训练目标也更清楚,实验里对应的消融结果也支持这个判断。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ RainDancer不是凭空造新词,而是把“先分解、后交互”真正落到了RGB-事件去雨里,思路清楚,且和问题强相关。
实验合理度:★★★★☆ 合成、真实、下游任务和消融都覆盖到了,比较完整;不过事件数据多依赖模拟,和真实硬件场景仍有一层距离。
学术研究价值:★★★★☆ 它提供了一个可迁移的多模态协作范式,对恶劣天气感知、事件视觉和多模态恢复都有启发。
稳定性:★★★☆☆ 在合成和部分真实场景可用,但事件采集噪声、同步误差和传感器条件都会影响效果,离“随便一台车都能上”还有距离。
适应性以及泛化能力:★★★☆☆ 对雨天视频较有针对性,但对其他退化类型的泛化还需要额外验证。
硬件需求及成本:★★★☆☆ 推理成本不算夸张,但事件相机和多分支网络带来额外系统复杂度,部署门槛高于纯RGB方法。
复现难度:★★★☆☆ 代码已开源是加分项,但事件模拟、数据对齐和训练细节仍会让复现者多掉几根头发。
产品化成熟度:★★★☆☆ 更适合研究原型和高端感知系统,若要进产品,还得补真实硬件、鲁棒性和端侧成本评估。
可能的问题:方法思路漂亮,但强依赖RGB-事件协同;一旦事件质量不稳或采集条件受限,优势可能缩水。
主要参考文献
[1] Kui Jiang, Runzhe Li, Zhaocheng Yu, Guanglu Sun, Junjun Jiang, Xianming Liu. RainDancer: RGB–Event Video Deraining with Rain-Oriented Spiking Dynamics. arXiv:2607.13802v1, 2026.
[2] 论文原文:https://arxiv.org/pdf/2607.13802v1.pdf
[3] 开源代码:https://github.com/AE86-plus/RainDancer
[4] 事件相机与脉冲神经网络相关背景可参考论文正文中的方法与实验部分。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!