← 返回 PaperDaily
视觉与图像
CVPR 级视频SCI新招:差分展开把参数砍半,精度还更高
这篇论文专挑深度展开网络的“老毛病”下手:一堆阶段反复堆同款重模块,算力花得很豪气,更新却越来越像在原地挪步。DU把流程改成“通用阶段打底、差分阶段精修”,思路很工程,也很对症。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文专挑深度展开网络的“老毛病”下手:一堆阶段反复堆同款重模块,算力花得很豪气,更新却越来越像在原地挪步。DU把流程改成“通用阶段打底、差分阶段精修”,思路很工程,也很对症。
原论文信息如下:
揭示深度展开网络的巨大浪费:重复堆叠高复杂度先验,却换来毫无意义的微小更新
视频快照压缩成像(Video Snapshot Compressive Imaging, Video SCI)这类任务,表面上像“拍一张图,猜一段视频”,本质上却是个典型的病急乱投医现场:输入只有一张压缩测量图,输出却要恢复一整段高速视频。信息少得可怜,难度却高得离谱。
深度展开网络(Deep Unfolding Network, DUN)之所以能在这类任务里混得风生水起,靠的是一个很聪明的套路:把传统迭代优化算法“展开”成多阶段网络,每一阶段都像在认真做一次优化更新,既有数学味道,又有深度学习的表达能力。问题也正出在这里——很多方法太爱“复制粘贴”了。每一阶段都堆同样复杂的先验模块,结构一样、容量差不多、活儿也差不多,像一支训练有素但动作整齐到有点敷衍的流水线队伍。
论文把这个现象总结成一个很关键的词:跨阶段表示同质化。说人话就是,网络跑到后面,特征已经越来越接近收敛,但后面的阶段还在继续做大规模计算,像在对一盆快煮好的汤反复加柴火,结果味道没怎么变,煤气费先飞了。
这篇论文最有意思的地方,就是它没有继续在“更大更深更复杂”的老路上硬卷,而是直接盯住一个更朴素的问题:既然后面阶段更新很小,为什么还要每次都用同样重的模块重算一遍? 于是,作者提出了“差分展开(Differential Unfolding, DU)”,核心思路不是把每一阶段都当成新的一局,而是把它们看成一个连续演化过程:前面负责打底,后面负责修修补补,算力就该花在真正有变化的地方。
提出“差分展开”:如何用轻量级差分模块代替冗余的全局重计算?
先把最基础的成像关系捋清楚。Video SCI 的压缩过程可以理解成:一段高速视频的多个帧,先被不同掩膜调制,再沿时间维度累加,最后只留下一个二维测量图。这个过程可以写成:
从优化角度看,传统深度展开通常会把恢复问题写成一个数据一致性项加一个先验项:
于是,作者把“每一阶段都从头重建表示”的思路,改成了“先构建一个高质量基础,再围绕这个基础做差分式修正”。这就像装修房子:第一遍把承重墙、地板和水电搞定,后面就别每次都把整栋楼推倒重来,而是补补墙角、调调灯光、修修门缝。效率一下就上来了。
差分进化框架(DEF):周期性交替通用阶段和差分阶段,实现高效动态演化
DU 的第一层核心设计叫 差分进化框架(Differential Evolutionary Framework, DEF)。它干的事很简单,却很有章法:把展开过程切成两种阶段,交替出现。
论文这里还有一个很重要的细节:通用阶段并不是越多越好,差分阶段也不是越密越好。作者通过周期性设计,让高参数模块“稀疏出场”,这样既能不断刷新高质量特征底座,又能避免后期全靠大模型硬算。换句话说,DEF 不是偷懒,而是在给算力排班。
这种设计的好处有两个。第一,减少冗余计算,后期阶段不用反复“全量重建”;第二,抑制误差累积,因为周期性插入通用阶段,相当于定期校准一下方向,避免差分更新一路跑偏。这个思路其实挺像人类做事:先定大框架,再做局部修改,而不是每改一行都从头写论文。🤨
差分表示先验(DRP):DRA和DM-FFN如何合作建模跨阶段特征变化?
有了 DEF 还不够,关键还得有一个能“看懂变化”的轻量模块,这就是 差分表示先验(Differential Representation Prior, DRP)。它是差分阶段的主力,负责把上一阶段的中间特征当作参照系,专门抓“这一阶段到底变了什么”。
先看 DRA。普通注意力会直接在当前特征上建模关系,而 DRA 多做了一步:把当前特征和上一阶段中间状态各自算出相似性,再做差。原文里的关键做法可以概括成下面这几步:
再看 DM-FFN。普通前馈网络通常就是一通卷积、激活、再卷积,主要负责非线性变换。DRP 里的 DM-FFN 则更像“带参考的修补模式”:它先提取当前特征的局部时空信息,再用当前特征和上一阶段中间状态的差异生成一个调制权重,最后用这个权重去修正增强后的特征。
如果把 DRA 和 DM-FFN 合在一起看,DRP 的本质就是:不再重新解释整个世界,而是专门盯住“世界和上一轮相比变了哪儿”。这就把跨阶段变化建模得很自然,也解释了为什么它能在更低开销下维持甚至提升重建质量。
实验结果:参数减少一半,性能却创下新高,速度与精度兼得
实验部分最重要的结论很明确:DU 不只是“省一点算力”,而是把精度、参数量和 FLOPs 这三件经常互相打架的事,尽量往一个方向拽了拽。
更有意思的是,DU 在灰度视频上的视觉结果也更锐利。图5里可以看到,边缘、纹理、细节区域的恢复更干净,某些局部放大后,DU 对细小结构的保留明显更好。对于 SCI 这种“信息本来就少”的任务来说,能把细节抠出来,本身就说明差分建模是有效的。
龙迷三问
这篇论文到底解决了什么问题?它主要解决的是深度展开网络在 Video SCI 里“阶段之间更新太像、算力却花得太多”的问题。作者发现后面很多阶段其实只是在做很小的修补,但传统方法还在反复跑重模块,于是提出 DEF 和 DRP,把重算变成差分更新。
DRA、DM-FFN、DEF 这些缩写分别是什么意思?DEF 是 Differential Evolutionary Framework,中文是差分进化框架;DRP 是 Differential Representation Prior,中文是差分表示先验;DRA 是 Differential Representation Attention,中文是差分表示注意力;DM-FFN 是 Differential Modulated Feed-Forward Network,中文是差分调制前馈网络。它们共同服务于“只更新变化部分”的核心思想。
这套方法为什么能更省算力,还能保持精度?因为它把计算资源重新分配了:通用阶段负责打基础,差分阶段负责精修。后者只对跨阶段变化做建模,不再对几乎不变的特征做全量重建,所以冗余计算少了;同时,周期性插入通用阶段又能防止误差积累,所以精度没有被拖垮,反而更稳。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把“阶段同质化”这个常被忽略的问题挑出来,并用周期性通用阶段+差分阶段的方式重构展开流程,思路挺新,也挺对症。
实验合理度:★★★★☆
对比方法覆盖了模型基、插件式、Transformer 和展开类方法,消融也围绕周期性与模块有效性展开,整体比较完整。
学术研究价值:★★★★☆
它不只是做了一个更快的模型,还提出了“差分式跨阶段建模”的分析视角,对后续展开类网络有参考意义。
稳定性:★★★☆☆
模拟和真实数据上都有结果,说明不是纯 demo 玩法;但这类方法对任务结构和阶段设计仍较敏感,泛化到别的逆问题还得继续验证。
适应性以及泛化能力:★★★☆☆
DRP 可迁移到其他展开方法,这是加分项;但目前主要还是围绕 Video SCI 场景,跨任务泛化还不能下太满的结论。
硬件需求及成本:★★★★☆
参数和 FLOPs 都压得比较漂亮,训练也只用了单卡,整体算力友好,属于比较接地气的一类方案。
复现难度:★★★★☆
代码已开源,主干设计也比较清晰,复现门槛不算高;不过展开类方法的训练细节比较多,依然需要认真对齐设置。
产品化成熟度:★★★☆☆
在视频压缩重建这类特定任务上已经很有实用潜力,但离通用落地还有距离,尤其是对硬件、噪声和场景变化的适配还需要进一步打磨。
可能的问题:方法对“阶段演化规律”的依赖较强,周期怎么设、在哪些任务上最有效,还需要更多跨场景验证。
主要参考文献
[1] Zhang et al. Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging. arXiv:2606.24153v1, 2026.
[2] 论文代码仓库:https://github.com/MuyuanZhang/DU
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
视频重建、论文拆解、开源代码、招博招聘,天天都有新料,别让好论文在收藏夹里吃灰。
扫描二维码,来群里和龙哥一起把“看不懂”变成“我懂了”😎

