← 返回 PaperDaily 视觉与图像

CVPR 级视频SCI新招:差分展开把参数砍半,精度还更高

这篇论文专挑深度展开网络的“老毛病”下手:一堆阶段反复堆同款重模块,算力花得很豪气,更新却越来越像在原地挪步。DU把流程改成“通用阶段打底、差分阶段精修”,思路很工程,也很对症。

CVPR 级视频SCI新招:差分展开把参数砍半,精度还更高
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文专挑深度展开网络的“老毛病”下手:一堆阶段反复堆同款重模块,算力花得很豪气,更新却越来越像在原地挪步。DU把流程改成“通用阶段打底、差分阶段精修”,思路很工程,也很对症。


原论文信息如下:
论文标题:
Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging
发表日期:
2026年06月
发表单位:
Northwestern Polytechnical University; Harbin Institute of Technology (Shenzhen)
原文链接:
https://arxiv.org/pdf/2606.24153v1.pdf
开源代码链接:
https://github.com/MuyuanZhang/DU

揭示深度展开网络的巨大浪费:重复堆叠高复杂度先验,却换来毫无意义的微小更新

视频快照压缩成像(Video Snapshot Compressive Imaging, Video SCI)这类任务,表面上像“拍一张图,猜一段视频”,本质上却是个典型的病急乱投医现场:输入只有一张压缩测量图,输出却要恢复一整段高速视频。信息少得可怜,难度却高得离谱。
深度展开网络(Deep Unfolding Network, DUN)之所以能在这类任务里混得风生水起,靠的是一个很聪明的套路:把传统迭代优化算法“展开”成多阶段网络,每一阶段都像在认真做一次优化更新,既有数学味道,又有深度学习的表达能力。问题也正出在这里——很多方法太爱“复制粘贴”了。每一阶段都堆同样复杂的先验模块,结构一样、容量差不多、活儿也差不多,像一支训练有素但动作整齐到有点敷衍的流水线队伍。
论文把这个现象总结成一个很关键的词:跨阶段表示同质化。说人话就是,网络跑到后面,特征已经越来越接近收敛,但后面的阶段还在继续做大规模计算,像在对一盆快煮好的汤反复加柴火,结果味道没怎么变,煤气费先飞了。
这篇论文最有意思的地方,就是它没有继续在“更大更深更复杂”的老路上硬卷,而是直接盯住一个更朴素的问题:既然后面阶段更新很小,为什么还要每次都用同样重的模块重算一遍? 于是,作者提出了“差分展开(Differential Unfolding, DU)”,核心思路不是把每一阶段都当成新的一局,而是把它们看成一个连续演化过程:前面负责打底,后面负责修修补补,算力就该花在真正有变化的地方。

提出“差分展开”:如何用轻量级差分模块代替冗余的全局重计算?

先把最基础的成像关系捋清楚。Video SCI 的压缩过程可以理解成:一段高速视频的多个帧,先被不同掩膜调制,再沿时间维度累加,最后只留下一个二维测量图。这个过程可以写成:
图:视频SCI的压缩成像公式
这里的 F 是原始视频帧,M 是掩膜,G 是相机最终捕获到的压缩测量,N 则是噪声。简单说,就是“把很多帧揉成一张图”,再让模型把它拆回去。听起来像魔术,做起来像拆盲盒,而且盲盒里还常常是噪声。
从优化角度看,传统深度展开通常会把恢复问题写成一个数据一致性项加一个先验项:
图:深度展开的典型优化目标
其中,前半部分负责让重建结果别乱跑,后半部分负责提供图像或视频的先验知识。很多 DUN 的问题不在“有没有先验”,而在“每一步都用同一个大先验,真的有必要吗”。论文的回答非常直接:没必要。
于是,作者把“每一阶段都从头重建表示”的思路,改成了“先构建一个高质量基础,再围绕这个基础做差分式修正”。这就像装修房子:第一遍把承重墙、地板和水电搞定,后面就别每次都把整栋楼推倒重来,而是补补墙角、调调灯光、修修门缝。效率一下就上来了。
图2:视频SCI压缩与展开重建流程,以及不同阶段特征相似度对比
图2很关键,它把作者的动机讲得很直白:一般展开阶段的特征图彼此非常像,余弦相似度也一直偏高,说明相邻阶段的变化并不大。既然变化这么小,再上同样重的模块就有点“杀鸡用了火箭炮”。DU 的差分思想,正是冲着这个浪费来的。

差分进化框架(DEF):周期性交替通用阶段和差分阶段,实现高效动态演化

DU 的第一层核心设计叫 差分进化框架(Differential Evolutionary Framework, DEF)。它干的事很简单,却很有章法:把展开过程切成两种阶段,交替出现。
图3:差分进化框架DEF示意图
图3展示了这个周期性设计:一段周期里先用通用展开阶段把主要结构重建起来,再用差分进化阶段做细粒度修补。前者像打地基,后者像精装修。房子不是每面墙都要用同一台挖掘机重新推一遍,合理分工才是正经事。
论文这里还有一个很重要的细节:通用阶段并不是越多越好,差分阶段也不是越密越好。作者通过周期性设计,让高参数模块“稀疏出场”,这样既能不断刷新高质量特征底座,又能避免后期全靠大模型硬算。换句话说,DEF 不是偷懒,而是在给算力排班。
这种设计的好处有两个。第一,减少冗余计算,后期阶段不用反复“全量重建”;第二,抑制误差累积,因为周期性插入通用阶段,相当于定期校准一下方向,避免差分更新一路跑偏。这个思路其实挺像人类做事:先定大框架,再做局部修改,而不是每改一行都从头写论文。🤨

差分表示先验(DRP):DRA和DM-FFN如何合作建模跨阶段特征变化?

有了 DEF 还不够,关键还得有一个能“看懂变化”的轻量模块,这就是 差分表示先验(Differential Representation Prior, DRP)。它是差分阶段的主力,负责把上一阶段的中间特征当作参照系,专门抓“这一阶段到底变了什么”。
图4:DRP骨干结构,以及DRA和DMFFN细节
图4把 DRP 拆成了两个核心零件:差分表示注意力(Differential Representation Attention, DRA)差分调制前馈网络(Differential Modulated Feed-Forward Network, DM-FFN)。前者负责“看哪里变了”,后者负责“把变动处修一修”。一个像侦察兵,一个像修理工,配合得挺顺。
先看 DRA。普通注意力会直接在当前特征上建模关系,而 DRA 多做了一步:把当前特征和上一阶段中间状态各自算出相似性,再做差。原文里的关键做法可以概括成下面这几步:
图:当前特征映射到Q、K、V 图:中间状态映射到Q和K 图:差分相似度矩阵 图:差分注意力计算 图:多头差分注意力输出
这里的逻辑非常清晰:如果当前和上一阶段关注的区域差不多,那这部分注意力就该被压低;如果某些区域变化更明显,那它们就该被放大。这样一来,模型关注的不是“哪里都看一眼”,而是“哪里真的变了”。这就是差分的妙处:不追求面面俱到,追求精准补刀。
再看 DM-FFN。普通前馈网络通常就是一通卷积、激活、再卷积,主要负责非线性变换。DRP 里的 DM-FFN 则更像“带参考的修补模式”:它先提取当前特征的局部时空信息,再用当前特征和上一阶段中间状态的差异生成一个调制权重,最后用这个权重去修正增强后的特征。
图:差分调制前馈网络的计算过程
这一步很像“按图施工”。当前特征里哪些地方还值得保留,哪些地方需要继续修正,不是靠拍脑袋,而是靠和历史状态做差来决定。于是,DM-FFN 不只是做特征变换,还承担了一个很实用的角色:把冗余信息按像素级别筛掉,把真正有用的变化留下来
如果把 DRA 和 DM-FFN 合在一起看,DRP 的本质就是:不再重新解释整个世界,而是专门盯住“世界和上一轮相比变了哪儿”。这就把跨阶段变化建模得很自然,也解释了为什么它能在更低开销下维持甚至提升重建质量。

实验结果:参数减少一半,性能却创下新高,速度与精度兼得

实验部分最重要的结论很明确:DU 不只是“省一点算力”,而是把精度、参数量和 FLOPs 这三件经常互相打架的事,尽量往一个方向拽了拽。
图1:DU与竞品在6个灰度数据集上的PSNR-FLOPs-参数量对比
图1是整篇论文最适合拿来“拍桌子”的图之一。横向看,DU 在 6 个灰度数据集上把 PSNR、FLOPs 和参数量放到了同一张图里比较;纵向看,半径还表示参数数量。意思很简单:不是只看谁分高,还要看谁更省。DU 的点位非常扎实,说明它不是靠堆大模型硬冲,而是在更轻的代价下拿到了更高的重建质量。
表1:灰度视频定量结果对比
表1给出的数字更直接。DU-5stg 只有 3.95M 参数、899.64G FLOPs,却拿到了 37.10 dB 的平均 PSNR;DU-9stg 则进一步提升到 37.57 dB。对比之前的深度展开方法 DADUN,DU-9stg 只用大约一半参数和四分之一左右的 FLOPs,就拿到了更高的精度。这个结果的含金量不低,因为它说明“更省”不是靠牺牲性能换来的,而是框架本身更会花钱。
更有意思的是,DU 在灰度视频上的视觉结果也更锐利。图5里可以看到,边缘、纹理、细节区域的恢复更干净,某些局部放大后,DU 对细小结构的保留明显更好。对于 SCI 这种“信息本来就少”的任务来说,能把细节抠出来,本身就说明差分建模是有效的。
图5:灰度视频帧上的视觉对比结果
彩色视频上的结果也延续了这个趋势。图6显示,DU 在彩色场景里同样能更好地恢复边缘和局部纹理,说明它不是只对单一数据集“碰巧有效”,而是具有一定的任务稳定性。
图6:彩色视频帧上的视觉对比结果
真实采集视频上,难度还要再上一个台阶,因为噪声和采集误差更明显。图7里 DU 对多米诺骨牌上的字母、WaterBallon 场景中的细节恢复更清楚,说明它在更接近真实应用的条件下也没有明显“翻车”。
图7:真实采集视频重建结果
消融实验进一步说明,DEF 里的周期性设计不是随便拍脑袋定的。表3显示,周期过短会让差分阶段不够充分,周期过长又会让轻量更新过多,导致性能和效率失衡。作者最后选择的周期设置,在精度和计算量之间做到了比较稳的平衡。
表3:不同周期设置的影响
表4更像是“外借实验”。作者把 DRP 塞到别的展开方法里,结果参数和 FLOPs 都明显下降,同时 PSNR 还有小幅提升。这很重要,因为它说明 DRP 不是只给 DU 量身定做的装饰件,而是一个可迁移的差分建模模块。换句话说,这个思路有机会成为一种更通用的效率优化方式。
表4:DRP迁移到其他展开方法的效果
如果再看 DRA 和 DM-FFN 的组件对比,结论也很一致:差分注意力和差分调制前馈网络都不是“锦上添花”,而是实打实在帮模型少算冤枉账。它们共同完成了一个很朴素但很有效的目标——让网络把资源集中在变化最大的区域,而不是对所有区域一视同仁地重算。
表5和表6:DRA与DM-FFN的对比结果
综合来看,这篇论文的实验逻辑是闭环的:先证明问题确实存在,再用 DEF 解决“阶段冗余”,再用 DRP 解决“差分怎么做”,最后用多组实验说明这套设计既能提效,也能保精度。不是那种“只在图里好看”的方法,而是有比较完整工程解释的方案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是深度展开网络在 Video SCI 里“阶段之间更新太像、算力却花得太多”的问题。作者发现后面很多阶段其实只是在做很小的修补,但传统方法还在反复跑重模块,于是提出 DEF 和 DRP,把重算变成差分更新。

DRA、DM-FFN、DEF 这些缩写分别是什么意思?DEF 是 Differential Evolutionary Framework,中文是差分进化框架;DRP 是 Differential Representation Prior,中文是差分表示先验;DRA 是 Differential Representation Attention,中文是差分表示注意力;DM-FFN 是 Differential Modulated Feed-Forward Network,中文是差分调制前馈网络。它们共同服务于“只更新变化部分”的核心思想。

这套方法为什么能更省算力,还能保持精度?因为它把计算资源重新分配了:通用阶段负责打基础,差分阶段负责精修。后者只对跨阶段变化做建模,不再对几乎不变的特征做全量重建,所以冗余计算少了;同时,周期性插入通用阶段又能防止误差积累,所以精度没有被拖垮,反而更稳。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“阶段同质化”这个常被忽略的问题挑出来,并用周期性通用阶段+差分阶段的方式重构展开流程,思路挺新,也挺对症。

实验合理度:★★★★☆

对比方法覆盖了模型基、插件式、Transformer 和展开类方法,消融也围绕周期性与模块有效性展开,整体比较完整。

学术研究价值:★★★★☆

它不只是做了一个更快的模型,还提出了“差分式跨阶段建模”的分析视角,对后续展开类网络有参考意义。

稳定性:★★★☆☆

模拟和真实数据上都有结果,说明不是纯 demo 玩法;但这类方法对任务结构和阶段设计仍较敏感,泛化到别的逆问题还得继续验证。

适应性以及泛化能力:★★★☆☆

DRP 可迁移到其他展开方法,这是加分项;但目前主要还是围绕 Video SCI 场景,跨任务泛化还不能下太满的结论。

硬件需求及成本:★★★★☆

参数和 FLOPs 都压得比较漂亮,训练也只用了单卡,整体算力友好,属于比较接地气的一类方案。

复现难度:★★★★☆

代码已开源,主干设计也比较清晰,复现门槛不算高;不过展开类方法的训练细节比较多,依然需要认真对齐设置。

产品化成熟度:★★★☆☆

在视频压缩重建这类特定任务上已经很有实用潜力,但离通用落地还有距离,尤其是对硬件、噪声和场景变化的适配还需要进一步打磨。

可能的问题:方法对“阶段演化规律”的依赖较强,周期怎么设、在哪些任务上最有效,还需要更多跨场景验证。


主要参考文献

[1] Zhang et al. Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging. arXiv:2606.24153v1, 2026.
[2] 论文代码仓库:https://github.com/MuyuanZhang/DU

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
视频重建、论文拆解、开源代码、招博招聘,天天都有新料,别让好论文在收藏夹里吃灰。
扫描二维码,来群里和龙哥一起把“看不懂”变成“我懂了”😎
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。