← 返回 PaperDaily
视觉与图像
CVPR 2026夺冠!北大新作Spk2VidNet:用层次循环网络,让尖峰相机长视频超分效率吊打SOT
当尖峰相机遇到长视频超分,现有方法只能“管中窥豹”,看一截儿是一截儿,信息被截断了不说,尖峰信号本身的波动还让画质“忽忽悠悠”。北大等机构这篇CVPR 2026新作,直接端出一套层次循环网络Spk2VidNet,用分层扩大时间视野的骚操作,把长序列里的海量信息榨得干干净净,速度和精度双杀SOTA,推理仅需43ms。这波操作,真稳!
龙哥读论文
发布于 2026-08-17 00:20:06
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 想第一时间掌握尖峰相机超分、视频重建等前沿技术?每日8篇拆解还不够?星球 无上限更新AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 当尖峰相机遇到长视频超分,现有方法只能“管中窥豹”,看一截儿是一截儿,信息被截断了不说,尖峰信号本身的波动还让画质“忽忽悠悠”。北大等机构这篇CVPR 2026新作,直接端出一套层次循环网络Spk2VidNet,用分层扩大时间视野的骚操作,把长序列里的海量信息榨得干干净净,速度和精度双杀SOTA,推理仅需43ms。这波操作,真稳!
原论文信息如下:
好的,龙哥收到!这篇CVPR 2026的Spk2VidNet,妥妥的硬核干货,龙哥这就给你拆解成一篇通俗易懂又好玩的公众号文章,让你看得过瘾,学得明白!
开始整活!
尖峰相机超分辨率:从短序列到长视频的跨越
尖峰相机(Spike Camera)模仿生物视网膜,每个像素独立“攒光子”,攒够就放一个电脉冲,时间分辨率高达40,000 Hz。但空间分辨率较低,因此尖峰相机超分辨率(SCSR)应运而生,目标是把低分辨率(LR)尖峰信号变成高分辨率(HR)图像序列。
以前的方法都是“切蛋糕”思路,把连续尖峰流切成固定长度小段(如101帧)单独超分。视野太窄,且尖峰信号本身有波动(光子随机性与电路噪声),给超分添乱。
北大、上海无线电设备研究所和哈工大的研究者们祭出大招——Spk2VidNet (Spike-to-Video Network),直接把低分尖峰流“一步到位”还原成清晰高分长视频。
图1显示,Spk2VidNet(红色大圆点)在精度上力压群雄,运行时间和模型大小也控制得不错,属于“跑得快、吃得少、干活好”的典范。
层次循环网络:如何逐步放大时间视野
Spk2VidNet的核心是构建一个层次循环网络 ,像剥洋葱一样,一层层扩大时间视野,逐步提炼出更干净的特征。
第一步:提取基础特征
把长尖峰流分成有重叠的短时尖峰块B_i,每个块覆盖当前时刻t_i前后一段小范围,捕捉局部运动信息。用几个卷积层从每个块提取“基础特征”Y_i,先看个轮廓。
第二步:第一层循环传播(RP-I)
模型依次处理每帧特征。处理当前帧Y_i时,不仅看Y_i,还参考前K帧已处理的特征F_{i-1}到F_{i-K}。通过对齐和融合机制,生成更可靠的初步优化特征F_i,有效抑制短时波动。
第三步:第二层循环传播(RP-II)
RP-II对F_i继续处理,不仅看当前特征,还看前K帧但经时间膨胀(Temporal Dilation)采样后的特征——即“跳着看”,选前2、4、6帧而非1、2、3帧,时间视野扩大一倍。RP-II纳入更丰富的上下文信息,生成最强健的特征M_i。
第一层处理局部连续运动,第二层把握全局运动趋势,相辅相成。最后将M_i上采样,得到高分辨率图像序列。
多帧一致性引导对齐:精准捕捉运动细节
运动对齐是融合多帧信息的核心。Spk2VidNet提出多帧一致性引导对齐(MFCA) 模块,利用尖峰相机超高时间分辨率下运动变化的平滑规律。
1. 联合运动估计: 将K个前序特征和当前特征全部拼接,喂给卷积层,让模型一次性“看见”所有运动信息,捕捉内在关系,得到联合运动线索X_i。
公式截图如下:
其中m表示卷积操作,[·]表示通道拼接。从X_i中可“分”出每个前序特征对应的初步运动估计O_{i-n}。
2. 运动相互精炼: 将初步运动估计再次拼接,通过另一个卷积层h_n交换信息,得出修正项加到原始估计上,得到精炼后的运动信息O_{i-n}^R。
公式截图如下:
3. 特征对齐: 用可变形卷积(DCN)把前序特征“掰正”到当前帧位置。
公式截图如下:
内容感知调制融合:去伪存真的智能聚合
Spk2VidNet准备了内容感知调制融合(CMF) 模块,让网络自己学习对不同空间位置应多大程度相信对齐后的前序特征。
CMF的核心是多膨胀调制(MDM) 子模块,从多个尺度(不同膨胀率的空洞卷积)衡量当前特征Y_i和对齐后的前序特征F̃_{i-n}的相似度。
公式截图如下:
MDM基于相关性强度P_{i-n}生成缩放参数α_{i-n}和偏移参数β_{i-n}。相似度高的区域(如稳定背景),α大、β小,表示“强烈采纳”;相似度低的区域(如被遮挡边缘),α小、β大,表示“小心处理”。
调制公式:
最后将调制后的所有前序特征和当前特征拼接,通过残差块融合,输出增强特征F_i:
CMF达到“去伪存真”效果,只融合真正有价值的时序信息。
分段训练与状态传承:突破显存瓶颈的长时建模
Spk2VidNet能处理超长序列,但显存有限。北大团队搞了分段训练与状态传承 策略:把长序列切成有重叠的小段(如461帧分5段,每段101帧),依次训练。训练当前段时,前一段产生的“状态”(从计算图剥离的历史特征)作为额外上下文输入下一段开头。这样梯度只在段内反向传播,但信息流连续,模型能感受长距离依赖。
这就像分几天读长篇小说,每晚记住关键“情节状态”,第二天接着读时故事线连贯。这招让Spk2VidNet在有限显存下实现无限长序列建模。
实验验证:精度与速度的双重胜利
论文在合成数据和真实数据上做了大量测试,结果“碾压”现有方法。
表1:在REDS-LSSR和Adobe240-LSSR评估数据集上的定量结果。
在×4和×8超分尺度下,Spk2VidNet在PSNR、SSIM和LPIPS上全面超越所有方法,几乎全是“红色(最佳)”。运行时间(43ms/21ms)和内存占用(4606M/4488M)为最优或接近最优水平。
图7:在REDS-LSSR评估数据集的一个样本上,现有SCSR方法与所提出的Spk2VidNet的PSNR对比。
其他方法PSNR曲线几乎平线,说明处理每帧是“独立性”的。而Spk2VidNet曲线稳步上升,随着时间推移利用越来越多历史信息,不断优化重建质量,直接证明层次循环网络的长时建模能力。
其他方法恢复的纹理模糊不清或有伪影,而Spk2VidNet恢复的图像纹理更清晰、更锐利,视觉效果明显高一个档次。
消融实验证明:1)MFCA和CMF单独都能带来显著提升,二者结合效果最好。2)从单层传播升级到双层传播,性能大幅跃升(如提升0.13 dB PSNR)。每个设计模块都不可或缺。
表2:在REDS-LSSR评估数据集上的消融实验(×4)。
龙迷三问
这篇论文解决什么问题? 传统SCSR方法只处理固定长度短序列,视野窄且对信号波动束手无策。本文解决如何利用尖峰相机全时长序列重建高清视频,同时扛住信号波动。
“时间膨胀”是什么意思? 第二层循环传播(RP-II)用来扩大时间视野的技巧,即“跳着选帧”。第一层看连续相邻帧,第二层隔一帧选一帧(如第2、4、6帧),在不增加复杂度前提下把回顾时间范围翻倍。
可变形卷积(DCN)起什么作用? DCN用来实现特征对齐。MFCA估算出运动偏移图后,DCN根据偏移图在不规则位置扣取特征,精确地把不同帧同一部位掰到同一空间位置,实现像素级对齐。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
层次循环+分步扩大时间视野的思路很新很优雅。MFCA和CMF针对尖峰相机特性设计,非简单堆砌。但多框架-多模块的recurrent思路不算开天辟地。
实验合理度: ★★★★★
对比方法全面,消融实验清晰有力,合成和真实数据都做了验证,方案扎实可信。
学术研究价值: ★★★★★
为SCSR提供了从短序列转向长时序建模的新范式,证实长时信息的极大价值,有引领作用。
稳定性: ★★★★☆
PSNR曲线和真实数据表现稳定,分段训练保证鲁棒性。但不同光照、噪声下的泛化稳定性需更多验证。
适应性以及泛化能力: ★★★★☆
跨数据集测试证明了泛化能力,但极端场景(极低光照、极度运动模糊)下的表现有待探究。
硬件需求及成本: ★★★★★
推理速度极快(43ms/21ms),模型参数仅3.73M,轻量化,对终端设备部署潜力高。
复现难度: ★★★☆☆
网络结构描述清晰,但训练依赖自生成LSSR数据集,需先运行尖峰相机模拟器,增加门槛。
产品化成熟度: ★★★★☆
42ms推理速度和优秀效果有极佳产品化基础,可嵌入高速摄像机、无人机巡检等场景,但离消费电子产品还需优化。
可能的问题: 模型对分段训练策略的敏感性及状态传输中信息的“遗忘”问题讨论不够深入。所有设计针对固定超分倍数(×4/×8),能否无缝扩展到任意倍数待解决。
[1] Wang et al. Spk2VidNet: A Hierarchical Recurrent Architecture for High-Fidelity Video Reconstruction from Long Spike-Camera Streams. CVPR 2026.
[2] Zhu et al. Spike Camera Image Reconstruction. (参考文献[45]中的相关工作)
[3] SCSRNet, VidarSR, SpikeSR-Net等(论文中对比的基线方法)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想要跟上尖峰相机超分的最强节奏?加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:超分+地点+学校/公司+昵称(如 超分+北京+北大+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群