← 返回 PaperDaily 视觉与图像

中科大西湖大学新作:8.9M参数去模糊还更强

盲去模糊最烦的不是“模糊”,而是模糊里混着真纹理和假纹理,模型一不小心就把该保的细节也抹掉了。CogSENet的思路挺狠:先让网络学会“看场景”,再用频率分解把结构和细节拆开,最后拿连续模糊场去适配非均匀退化,工程味很足。

中科大西湖大学新作:8.9M参数去模糊还更强
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
盲去模糊最烦的不是“模糊”,而是模糊里混着真纹理和假纹理,模型一不小心就把该保的细节也抹掉了。CogSENet的思路挺狠:先让网络学会“看场景”,再用频率分解把结构和细节拆开,最后拿连续模糊场去适配非均匀退化,工程味很足。


原论文信息如下:
论文标题:
CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
发表日期:
2026年06月
发表单位:
University of Science and Technology of China; Westlake University; University of Michigan
原文链接:
https://arxiv.org/pdf/2606.30030v1.pdf

鹰眼启示:从生物视觉到图像恢复的新框架

盲去模糊这件事,最难的地方从来不是“把图变清楚”这么简单,而是要先判断哪些模糊是退化,哪些纹理是真细节。判断错了,模型就会一边修复一边把该保的内容抹平,最后得到一张“看着顺眼、细节全没”的图。CogSENet的思路很直接:不要把图像恢复当成纯像素回归,而是当成一个语义参与、频率分工、退化自适应的动态过程。
图1:CogSENet的生物视觉启发
图1:CogSENet的生物视觉启发。论文借鉴鹰眼视觉系统的四个特点:主动扫视启发语义路由,视网膜分工启发高低频解耦,连续聚焦启发连续模糊场,记忆回忆启发冻结的CLIP语义先验。
这篇工作最有意思的地方在于,它不是单纯把“生物启发”当装饰词,而是真的把鹰眼视觉系统拆成了可落地的工程模块。主动扫视对应的是Semantic-Driven State Space Module,中文可理解为语义驱动状态空间模块,简称SDSSM;视网膜的高低频分工对应BiFreqFusionBlock,即双频融合块,简称BFFB;连续聚焦则变成了Continuous Blur Field,中文是连续模糊场,简称CBF。这几个缩写不是为了凑字数,后面每一个都真在干活。
图2:CogSENet整体架构
图2:CogSENet整体架构。一个U形编码器—解码器骨干上堆叠多个CogSF模块,每个模块都由SDSSM和BFFB组成;最深层瓶颈位置再注入连续模糊场与冻结的CLIP语义先验,用来调制深层特征。
从工程视角看,这个框架的野心很清楚:既要保留U形网络在图像恢复里的稳定性,又要补上传统方法最缺的两件事——语义意识显式频率建模。前者解决“该看哪里、该把哪些区域放在一起看”的问题,后者解决“哪些是结构,哪些是细节,哪些是噪声”的问题。再加上连续模糊场去描述空间不均匀退化,整个方法就从“像素流水线”升级成了“带导航的修复系统”。

三大核心模块:语义路由、频率解耦与自适应模糊建模

如果把整篇论文浓缩成一句话,那就是:先按语义重排,再按频率分工,最后按退化强弱做自适应调制。这三步看起来像“修图三连”,其实每一步都在针对盲去模糊的老毛病下药。

语义路由:让模型先知道自己在看什么

SDSSM的核心不是“更强的扫描”,而是“先把token按语义聚类,再在聚类后的序列里做状态空间扫描”。传统状态空间模型擅长长程建模,但默认输入是按空间顺序排好的,遇到真实模糊图时,边缘、纹理、平滑区混在一起扫,容易把不相关的内容串到一起。CogSENet的做法是先用可微的Gumbel-Softmax做路由,把token分到不同语义组,再按组重排后扫描,这样远处但语义相近的区域更容易被连起来处理。
这里的Gumbel-Softmax可以粗略理解成一种“近似离散分组但还能反向传播”的技巧。它让token分组不是硬生生切开,而是在训练里保持可导;同时论文还给每个token配了一个语义prompt,来自一个可学习码本。这个prompt不是摆设,而是给状态转移提供额外上下文,让扫描过程不只是“看见了什么”,还知道“这类内容该怎么修”。
图5:SDSSM中的区域感知token路由
图5:SDSSM中的区域感知token路由。可以看到,平滑或运动主导区域更容易被分到相对集中的token组,而纹理丰富、结构复杂的区域会激活更多不同的token编号,说明路由确实学到了一定的内容自适应能力。
这一招的好处很现实:它没有把状态空间模型变成更重的注意力,也没有退回到纯卷积,而是用“先分组、再扫描”的方式,尽量保留线性复杂度,同时减少错误信息在全图乱传。说白了,模型终于学会了别把厨房和卧室当成一个房间来修。

频率解耦:结构和细节,别再一锅炖

BFFB的思路更直白:图像里的低频更像“骨架”和大结构,高频更像边缘、纹理和精细细节。盲去模糊最怕什么?最怕模型把高频噪声和高频细节混为一谈,最后把该锐化的地方锐化了,不该锐化的地方也跟着起飞。BFFB先用小波变换把特征拆成高低频分量,再分别处理,最后融合回来。
论文里把这件事做得比较细:低频分支偏向全局结构恢复,采用轻量U形结构;高频分支偏向局部细节增强,用更密集的卷积去补纹理;同时还有一个频域细化分支,把特征映射到傅里叶域做自适应滤波,再投回空间域。这样一来,小波域负责“拆”,傅里叶域负责“修”,融合模块负责“合”,逻辑很顺。
这种设计比“直接上一个更大的网络”更聪明的地方在于,它把先验写进了结构里。对恢复任务来说,频率分解不是玄学,而是很朴素的事实:模糊会抹掉高频边缘,噪声也常常藏在高频里,若不分开处理,网络就只能靠自己猜。CogSENet等于先把题目拆开,再让不同模块各做各的,最后再拼回去。

连续模糊场:别再拿离散核硬猜真实退化

很多盲去模糊方法默认退化可以被某种离散核描述,但真实世界里的模糊往往不是这么规矩:同一张图里,不同区域的模糊程度可能完全不同,运动方向也不一致。CogSENet为此引入CBF,用一个轻量卷积头从输入图像预测连续二维位移场,再把这个模糊场注入最深层特征里做调制。这个位置选得挺讲究——不在浅层乱加噪,也不在输出端补救,而是在全局语义最浓的瓶颈处做条件化控制。
图6:连续模糊场与语义先验可视化
图6:连续模糊场与语义先验可视化。图中同时展示了输入模糊图、CLIP引导的注意力图、估计得到的连续模糊场以及对应的模糊幅值图,说明模型并不是单纯“看见哪里亮就修哪里”,而是在语义与退化信息共同作用下做恢复。
更有意思的是,CBF不是单独工作的,它和冻结的CLIP语义先验一起调制深层特征。CLIP这里的作用可以理解成“高层语义参谋”:它不参与训练更新,只提供图像级语义指引,再和模糊场对应的退化描述做融合,最终生成一个更稳的瓶颈表示。也就是说,模型在最深处既知道“这张图大概是什么”,也知道“这张图哪里模糊得更厉害”。
这种“语义+物理退化”双条件的做法很像人看东西:先靠常识认场景,再根据视野里哪里糊、哪里清去调整注意力。论文把这个过程工程化之后,最直接的收益就是对空间非均匀模糊更敏感,不会像一些静态核方法那样一刀切。

SOTA性能:更少的参数,更高的精度

真正能打的论文,不能只讲故事,还得看结果。CogSENet在去模糊、去雨、去雾、去噪几个任务上都做了验证,但最核心的还是盲去模糊。这里最值得注意的不是“分数涨了多少”,而是它在更小参数量下拿到了更强的恢复质量,这对工程部署很关键。
表1:GoPro、HIDE、RealBlur-R和RealBlur-J上的定量对比
表1:GoPro、HIDE、RealBlur-R和RealBlur-J上的定量对比。结果报告了参数量、峰值信噪比和结构相似度,粗体和下划线分别代表最优和次优。
在GoPro上,基础版CogSENet只有8.9M参数,就拿到34.72 dB0.9744 SSIM;在HIDE上达到32.18 dB / 0.9514;在RealBlur-R和RealBlur-J上分别达到41.83 / 0.9799 和 34.54 / 0.9473。加强版Ours+进一步把GoPro推到34.91 dB、HIDE推到32.42 dB、RealBlur-R推到41.91 dB、RealBlur-J推到34.72 dB。对比表里那些参数更大、结构更重的方法,这个结果说明它不是靠堆算力硬顶,而是靠结构设计把有效信息用得更精。
图3:GoPro上的视觉对比
图3:GoPro上的视觉对比。与几种代表性方法相比,CogSENet恢复出的边缘更干净、细节更细,和真值图的结构一致性也更高。
图4:RealBlur上的去模糊结果
图4:RealBlur上的去模糊结果。字符和轮廓区域的恢复尤其明显,说明该方法对真实模糊场景的适应性并不只是“实验室好看”,而是能落到更复杂的真实退化上。
跨任务上,CogSENet也没有只在去模糊一条路上跑通。它在Rain100H去雨、BSD68去噪和SOTS去雾上都给出了有竞争力甚至领先的结果。特别是去雾任务,28.72 dB / 0.9692 的表现说明这套“语义路由+频率解耦”的组合,对处理全局对比度下降和局部细节损失也有帮助。虽然论文的主战场是盲去模糊,但这个结果至少证明它不是只会修一种图。

深度剖析:消融实验与可视化分析

消融实验最能说明问题:方法到底是“每个模块都在干活”,还是“堆了一堆名字,最后靠主干自己扛”。CogSENet这部分的结果相对清楚,说明它的收益不是单点技巧,而是几个设计确实在互相配合。
表4:SDSSM消融实验
表4:SDSSM消融实验。去掉语义prompt、去掉语义重组、或者直接移除SDSSM,都会让性能下降,说明“语义驱动扫描”不是装饰件,而是实打实在提升恢复质量。
先看SDSSM。去掉prompt后,模型少了上下文引导;去掉重组后,扫描又回到了机械的空间轴顺序;直接去掉SDSSM,性能掉得更明显。这个结果说明,状态空间模型如果只是“更便宜的长程建模”,那还不够,关键是要让它按语义组织信息流。否则长程依赖是有了,错误传播也跟着来了,属于“跑得远,跑偏也远”。
表5:BFFB消融实验
表5:BFFB消融实验。去掉高低频分裂、去掉隐式频率分支,或者直接去掉BFFB,都会带来不同程度的退化,说明显式频率建模确实提高了恢复稳定性。
再看BFFB。去掉高低频分裂后,结构和细节混在一起;去掉隐式频率分支后,频域修正能力下降;直接拿掉BFFB,性能掉得更明显。这个结果很符合直觉:恢复任务不是只会“增强”,更重要的是“分清楚哪些该增强,哪些该压制”。BFFB把这种分工写进了网络结构,所以它的贡献比单纯加深网络更直接。
表6:连续模糊场与语义先验消融
表6:连续模糊场与语义先验消融。去掉CBF或冻结CLIP语义先验后,性能都会下降,说明退化建模和语义引导都不是可有可无的配件。
连续模糊场这部分也挺关键。去掉CBF,模型就少了对空间非均匀退化的显式感知;去掉CLIP语义先验,深层特征少了高层语义参照。二者合在一起,才像是在“知道图是什么”的前提下“知道哪里糊、糊多重”。这也是CogSENet和很多只做局部修复的方法拉开差距的核心原因。
论文还给了失败案例分析,说明方法并不是万能钥匙。对于极端复杂、信息严重缺失或者退化模式超出训练分布的场景,结果仍可能出现局部伪影或恢复不完整。这个判断很重要,因为它没有把模型吹成“全场景无敌”,而是承认了真实恢复任务的边界。
图7:失败案例分析
图7:失败案例分析。对极端退化或训练分布外样本,模型仍可能出现恢复不完整的情况,说明该方法虽然强,但还没到“闭眼修图”的程度。

总结与局限:现有突破与未来方向

CogSENet的价值,不在于又造了一个更复杂的去模糊网络,而在于它比较认真地回答了一个老问题:图像恢复能不能不只看像素,还要看语义、频率和退化轨迹。它把状态空间模型的长程建模能力、频率分解的物理可解释性、以及CLIP语义先验和连续模糊场的适应性揉在一起,形成了一套结构上比较完整的方案。
但它也不是没有代价。第一,整体框架虽然比很多大模型轻,但模块不少,训练流程也更讲究,三阶段训练、冻结CLIP、不同任务还要关闭或开启特定分支,工程复杂度并不低。第二,CLIP语义先验和连续模糊场虽然有效,但它们对数据分布和退化模式仍有依赖,遇到特别极端的真实场景,泛化能力还是要继续验证。第三,这类方法更像高质量恢复框架,而不是即插即用的通用图像处理器,真正上线时还要考虑速度、显存和稳定性。
如果未来继续往前走,比较值得期待的方向有两个:一是把语义路由做得更轻、更稳,减少对手工训练策略的依赖;二是把连续退化建模扩展到更多真实场景,比如复杂夜景、动态遮挡和多退化叠加。毕竟真实世界不会只给单一模糊,它通常喜欢“模糊、噪声、雾气、压缩”一起上,像在考验模型的耐心。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是盲去模糊里“该保细节还是该去伪影”这个老难题。CogSENet不是只做像素恢复,而是把语义路由、频率分解和连续模糊场结合起来,让模型先知道图里有什么,再知道哪里糊,最后再决定怎么修。

SDSSM、BFFB和CBF分别在干什么?SDSSM负责按语义重组token并做状态空间扫描,BFFB负责把高低频拆开分别修,CBF负责显式建模空间非均匀模糊,并与冻结的CLIP语义先验一起调制深层特征。

这套方法为什么能比很多老方法更稳?因为它不是把所有信息混着扫,而是把长程依赖、频率结构和退化分布分开处理。这样既减少了错误传播,也提高了对真实非均匀模糊的适应能力,所以在GoPro、RealBlur这类数据上都能拿到更好的恢复质量。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是那种“凭空造一个新大模型”的花活,但把语义路由、频率解耦和连续退化建模绑在一起,思路是有新意的,尤其对盲去模糊这个老问题很对症。

实验合理度:★★★★☆ 主任务、跨任务和消融都做了,结果链条比较完整;不过部分表格排版信息不够规整,读者需要自己多看几眼才能完全对上数值。

学术研究价值:★★★★☆ 对图像恢复领域有明显启发,特别是“语义参与低层恢复”这条线值得继续挖,但距离统一解决所有真实退化还差得远。

稳定性:★★★☆☆ 在标准数据集上表现不错,但依赖多模块协同和特定训练策略,极端真实场景下的稳定性还需要更多验证。

适应性以及泛化能力:★★★★☆ 去模糊主任务很强,去雨、去雾、去噪也能跑通,说明泛化不是空话;但跨更多分布外场景时仍要谨慎。

硬件需求及成本:★★★★☆ 8.9M参数的基础版不算重,推理成本相对友好;但训练阶段策略较复杂,模块也多,工程实现不能算省心。

复现难度:★★★☆☆ 论文给了代码和模型,但三阶段训练、冻结语义先验和分支开关都增加了复现门槛,不是“抄一遍就完事”的类型。

产品化成熟度:★★★☆☆ 适合高质量离线修复或专业后处理,不太像可以直接无脑上生产的轻量插件;若要落地,还得补速度、鲁棒性和分布外验证。

可能的问题:模块多、训练复杂,对极端退化和分布外样本仍可能失手;方法强,但还没到可以替代所有传统恢复管线的程度。


主要参考文献

[1] Pan Wang, Yihao Hu, Xiujin Liu. CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion. arXiv:2606.30030v1, 2026.
[2] 原文链接:https://arxiv.org/pdf/2606.30030v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
盲去模糊、图像恢复、频率建模、语义路由这些方向,群里都能聊;想少走弯路,直接来扫二维码。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。