← 返回 PaperDaily
视觉与图像
中科大西湖大学新作:8.9M参数去模糊还更强
盲去模糊最烦的不是“模糊”,而是模糊里混着真纹理和假纹理,模型一不小心就把该保的细节也抹掉了。CogSENet的思路挺狠:先让网络学会“看场景”,再用频率分解把结构和细节拆开,最后拿连续模糊场去适配非均匀退化,工程味很足。
龙哥读论文
发布于 2026-08-14 09:10:58
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 盲去模糊最烦的不是“模糊”,而是模糊里混着真纹理和假纹理,模型一不小心就把该保的细节也抹掉了。CogSENet的思路挺狠:先让网络学会“看场景”,再用频率分解把结构和细节拆开,最后拿连续模糊场去适配非均匀退化,工程味很足。
原论文信息如下:
鹰眼启示:从生物视觉到图像恢复的新框架
盲去模糊这件事,最难的地方从来不是“把图变清楚”这么简单,而是要先判断哪些模糊是退化,哪些纹理是真细节。判断错了,模型就会一边修复一边把该保的内容抹平,最后得到一张“看着顺眼、细节全没”的图。CogSENet的思路很直接:不要把图像恢复当成纯像素回归,而是当成一个语义参与、频率分工、退化自适应 的动态过程。
这篇工作最有意思的地方在于,它不是单纯把“生物启发”当装饰词,而是真的把鹰眼视觉系统拆成了可落地的工程模块。主动扫视对应的是Semantic-Driven State Space Module ,中文可理解为语义驱动状态空间模块 ,简称SDSSM ;视网膜的高低频分工对应BiFreqFusionBlock ,即双频融合块 ,简称BFFB ;连续聚焦则变成了Continuous Blur Field ,中文是连续模糊场 ,简称CBF 。这几个缩写不是为了凑字数,后面每一个都真在干活。
从工程视角看,这个框架的野心很清楚:既要保留U形网络在图像恢复里的稳定性,又要补上传统方法最缺的两件事——语义意识 和显式频率建模 。前者解决“该看哪里、该把哪些区域放在一起看”的问题,后者解决“哪些是结构,哪些是细节,哪些是噪声”的问题。再加上连续模糊场去描述空间不均匀退化,整个方法就从“像素流水线”升级成了“带导航的修复系统”。
三大核心模块:语义路由、频率解耦与自适应模糊建模
如果把整篇论文浓缩成一句话,那就是:先按语义重排,再按频率分工,最后按退化强弱做自适应调制 。这三步看起来像“修图三连”,其实每一步都在针对盲去模糊的老毛病下药。
SDSSM的核心不是“更强的扫描”,而是“先把token按语义聚类,再在聚类后的序列里做状态空间扫描 ”。传统状态空间模型擅长长程建模,但默认输入是按空间顺序排好的,遇到真实模糊图时,边缘、纹理、平滑区混在一起扫,容易把不相关的内容串到一起。CogSENet的做法是先用可微的Gumbel-Softmax做路由,把token分到不同语义组,再按组重排后扫描,这样远处但语义相近的区域更容易被连起来处理。
这里的Gumbel-Softmax可以粗略理解成一种“近似离散分组但还能反向传播 ”的技巧。它让token分组不是硬生生切开,而是在训练里保持可导;同时论文还给每个token配了一个语义prompt,来自一个可学习码本。这个prompt不是摆设,而是给状态转移提供额外上下文,让扫描过程不只是“看见了什么”,还知道“这类内容该怎么修”。
这一招的好处很现实:它没有把状态空间模型变成更重的注意力,也没有退回到纯卷积,而是用“先分组、再扫描”的方式,尽量保留线性复杂度,同时减少错误信息在全图乱传。说白了,模型终于学会了别把厨房和卧室当成一个房间来修。
BFFB的思路更直白:图像里的低频更像“骨架”和大结构,高频更像边缘、纹理和精细细节。盲去模糊最怕什么?最怕模型把高频噪声和高频细节混为一谈,最后把该锐化的地方锐化了,不该锐化的地方也跟着起飞。BFFB先用小波变换把特征拆成高低频分量,再分别处理,最后融合回来。
论文里把这件事做得比较细:低频分支偏向全局结构恢复,采用轻量U形结构;高频分支偏向局部细节增强,用更密集的卷积去补纹理;同时还有一个频域细化分支,把特征映射到傅里叶域做自适应滤波,再投回空间域。这样一来,小波域负责“拆”,傅里叶域负责“修”,融合模块负责“合” ,逻辑很顺。
这种设计比“直接上一个更大的网络”更聪明的地方在于,它把先验写进了结构里。对恢复任务来说,频率分解不是玄学,而是很朴素的事实:模糊会抹掉高频边缘,噪声也常常藏在高频里,若不分开处理,网络就只能靠自己猜。CogSENet等于先把题目拆开,再让不同模块各做各的,最后再拼回去。
很多盲去模糊方法默认退化可以被某种离散核描述,但真实世界里的模糊往往不是这么规矩:同一张图里,不同区域的模糊程度可能完全不同,运动方向也不一致。CogSENet为此引入CBF,用一个轻量卷积头从输入图像预测连续二维位移场,再把这个模糊场注入最深层特征里做调制。这个位置选得挺讲究——不在浅层乱加噪,也不在输出端补救,而是在全局语义最浓的瓶颈处做条件化控制。
更有意思的是,CBF不是单独工作的,它和冻结的CLIP语义先验一起调制深层特征。CLIP这里的作用可以理解成“高层语义参谋”:它不参与训练更新,只提供图像级语义指引,再和模糊场对应的退化描述做融合,最终生成一个更稳的瓶颈表示。也就是说,模型在最深处既知道“这张图大概是什么”,也知道“这张图哪里模糊得更厉害”。
这种“语义+物理退化”双条件的做法很像人看东西:先靠常识认场景,再根据视野里哪里糊、哪里清去调整注意力。论文把这个过程工程化之后,最直接的收益就是对空间非均匀模糊 更敏感,不会像一些静态核方法那样一刀切。
SOTA性能:更少的参数,更高的精度
真正能打的论文,不能只讲故事,还得看结果。CogSENet在去模糊、去雨、去雾、去噪几个任务上都做了验证,但最核心的还是盲去模糊。这里最值得注意的不是“分数涨了多少”,而是它在更小参数量 下拿到了更强的恢复质量,这对工程部署很关键。
在GoPro上,基础版CogSENet只有8.9M参数 ,就拿到34.72 dB 和0.9744 SSIM ;在HIDE上达到32.18 dB / 0.9514;在RealBlur-R和RealBlur-J上分别达到41.83 / 0.9799 和 34.54 / 0.9473。加强版Ours+进一步把GoPro推到34.91 dB、HIDE推到32.42 dB、RealBlur-R推到41.91 dB、RealBlur-J推到34.72 dB。对比表里那些参数更大、结构更重的方法,这个结果说明它不是靠堆算力硬顶,而是靠结构设计把有效信息用得更精。
跨任务上,CogSENet也没有只在去模糊一条路上跑通。它在Rain100H去雨、BSD68去噪和SOTS去雾上都给出了有竞争力甚至领先的结果。特别是去雾任务,28.72 dB / 0.9692 的表现说明这套“语义路由+频率解耦”的组合,对处理全局对比度下降和局部细节损失也有帮助。虽然论文的主战场是盲去模糊,但这个结果至少证明它不是只会修一种图。
深度剖析:消融实验与可视化分析
消融实验最能说明问题:方法到底是“每个模块都在干活”,还是“堆了一堆名字,最后靠主干自己扛”。CogSENet这部分的结果相对清楚,说明它的收益不是单点技巧,而是几个设计确实在互相配合。
先看SDSSM。去掉prompt后,模型少了上下文引导;去掉重组后,扫描又回到了机械的空间轴顺序;直接去掉SDSSM,性能掉得更明显。这个结果说明,状态空间模型如果只是“更便宜的长程建模”,那还不够,关键是要让它按语义组织信息流 。否则长程依赖是有了,错误传播也跟着来了,属于“跑得远,跑偏也远”。
再看BFFB。去掉高低频分裂后,结构和细节混在一起;去掉隐式频率分支后,频域修正能力下降;直接拿掉BFFB,性能掉得更明显。这个结果很符合直觉:恢复任务不是只会“增强”,更重要的是“分清楚哪些该增强,哪些该压制”。BFFB把这种分工写进了网络结构,所以它的贡献比单纯加深网络更直接。
连续模糊场这部分也挺关键。去掉CBF,模型就少了对空间非均匀退化的显式感知;去掉CLIP语义先验,深层特征少了高层语义参照。二者合在一起,才像是在“知道图是什么”的前提下“知道哪里糊、糊多重”。这也是CogSENet和很多只做局部修复的方法拉开差距的核心原因。
论文还给了失败案例分析,说明方法并不是万能钥匙。对于极端复杂、信息严重缺失或者退化模式超出训练分布的场景,结果仍可能出现局部伪影或恢复不完整。这个判断很重要,因为它没有把模型吹成“全场景无敌”,而是承认了真实恢复任务的边界。
总结与局限:现有突破与未来方向
CogSENet的价值,不在于又造了一个更复杂的去模糊网络,而在于它比较认真地回答了一个老问题:图像恢复能不能不只看像素,还要看语义、频率和退化轨迹 。它把状态空间模型的长程建模能力、频率分解的物理可解释性、以及CLIP语义先验和连续模糊场的适应性揉在一起,形成了一套结构上比较完整的方案。
但它也不是没有代价。第一,整体框架虽然比很多大模型轻,但模块不少,训练流程也更讲究,三阶段训练、冻结CLIP、不同任务还要关闭或开启特定分支,工程复杂度并不低。第二,CLIP语义先验和连续模糊场虽然有效,但它们对数据分布和退化模式仍有依赖,遇到特别极端的真实场景,泛化能力还是要继续验证。第三,这类方法更像高质量恢复框架,而不是即插即用的通用图像处理器,真正上线时还要考虑速度、显存和稳定性。
如果未来继续往前走,比较值得期待的方向有两个:一是把语义路由做得更轻、更稳,减少对手工训练策略的依赖;二是把连续退化建模扩展到更多真实场景,比如复杂夜景、动态遮挡和多退化叠加。毕竟真实世界不会只给单一模糊,它通常喜欢“模糊、噪声、雾气、压缩”一起上,像在考验模型的耐心。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是盲去模糊里“该保细节还是该去伪影”这个老难题。CogSENet不是只做像素恢复,而是把语义路由、频率分解和连续模糊场结合起来,让模型先知道图里有什么,再知道哪里糊,最后再决定怎么修。
SDSSM、BFFB和CBF分别在干什么? SDSSM负责按语义重组token并做状态空间扫描,BFFB负责把高低频拆开分别修,CBF负责显式建模空间非均匀模糊,并与冻结的CLIP语义先验一起调制深层特征。
这套方法为什么能比很多老方法更稳? 因为它不是把所有信息混着扫,而是把长程依赖、频率结构和退化分布分开处理。这样既减少了错误传播,也提高了对真实非均匀模糊的适应能力,所以在GoPro、RealBlur这类数据上都能拿到更好的恢复质量。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是那种“凭空造一个新大模型”的花活,但把语义路由、频率解耦和连续退化建模绑在一起,思路是有新意的,尤其对盲去模糊这个老问题很对症。
实验合理度: ★★★★☆ 主任务、跨任务和消融都做了,结果链条比较完整;不过部分表格排版信息不够规整,读者需要自己多看几眼才能完全对上数值。
学术研究价值: ★★★★☆ 对图像恢复领域有明显启发,特别是“语义参与低层恢复”这条线值得继续挖,但距离统一解决所有真实退化还差得远。
稳定性: ★★★☆☆ 在标准数据集上表现不错,但依赖多模块协同和特定训练策略,极端真实场景下的稳定性还需要更多验证。
适应性以及泛化能力: ★★★★☆ 去模糊主任务很强,去雨、去雾、去噪也能跑通,说明泛化不是空话;但跨更多分布外场景时仍要谨慎。
硬件需求及成本: ★★★★☆ 8.9M参数的基础版不算重,推理成本相对友好;但训练阶段策略较复杂,模块也多,工程实现不能算省心。
复现难度: ★★★☆☆ 论文给了代码和模型,但三阶段训练、冻结语义先验和分支开关都增加了复现门槛,不是“抄一遍就完事”的类型。
产品化成熟度: ★★★☆☆ 适合高质量离线修复或专业后处理,不太像可以直接无脑上生产的轻量插件;若要落地,还得补速度、鲁棒性和分布外验证。
可能的问题: 模块多、训练复杂,对极端退化和分布外样本仍可能失手;方法强,但还没到可以替代所有传统恢复管线的程度。
主要参考文献
[1] Pan Wang, Yihao Hu, Xiujin Liu. CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion. arXiv:2606.30030v1, 2026.
[2] 原文链接:https://arxiv.org/pdf/2606.30030v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
盲去模糊、图像恢复、频率建模、语义路由这些方向,群里都能聊;想少走弯路,直接来扫二维码。