← 返回 PaperDaily
视觉与图像
图像恢复新SOTA!FIT用可变形tokenization摘得多任务接收,平均30.72dB
图像恢复圈的老问题——固定patch切割总在退化边界上“切错地方”,导致修复完还留着一道道网格伪影。FIT把tokenization本身变成可变的,让patch边界跟着雨线、模糊核、景深走,五任务平均PSNR一口气拉到30.72dB,比JIT基线提升1.44dB。一句话:patch不“卷”了,改“弯”了。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 14
查看原文
原论文信息如下:
图像恢复这个圈子,要说卷,那是真卷。尤其是All-in-One统一恢复,一个模型要同时扛下去噪、去雨、去雾、去模糊、低光增强五类活,大家卷完网络结构卷损失函数,卷完损失函数又开始卷退化表征。但不管是PromptIR的提示Token,还是AdaIR的频率调制,它们都有一个共同的小动作——先把图像切成一堆固定大小的patch,再做后续处理 。这个看起来人畜无害的固定patch切分,恰恰是很多网格伪影的万恶之源。
今天咱们聊的这篇论文,就把矛头直接对准了Tokenization这一步。FIT(Flexible Image Transformer)想干的事情很简单——让patch边界学会“转弯”,跟着退化结构走,而不是死板地横平竖直切下去 。听起来像是把手术刀换成了激光刀,实际上效果也确实够猛:五任务平均PSNR 30.72 dB,三任务平均32.83 dB,直接刷新了统一恢复的一波SOTA。
从固定网格到自适应采样:FIT如何重塑图像恢复的tokenization范式
先看一个真实场景。自动驾驶车辆的前视摄像头拍下雨天街景:画面上半部分是雨线,下半部分是湿滑路面的雾气反光。这种空间上混合的退化,任何单一退化标签都描述不了。强行用一个去雨模型,雾区会被过度平滑;强行用一个去雾模型,雨区又会出现颜色偏移。
现有的统一恢复方法大致分三类。第一类是任务提示型 ,比如PromptIR,在序列里拼上可学习的提示Token,告诉模型“这次是去雨”或者“这次是去雾”;第二类是全局退化嵌入型 ,像AirNet、IDR、AdaIR那样,把整张图压成一个全局向量,再通过FiLM或交叉注意力去调制中间特征;第三类是多分支结构型 ,给每个任务配专门的子网络,参数量上去一大截,共享却有限。
这些方法有一个共同特点:退化信息都是在Token化之后才注入的,也就是先按固定网格切patch,再在处理阶段告诉模型“哪里有退化”。但这样的流程天然有个隐患——固定P×P的patch边界会直接切穿雨线、切穿模糊核、切穿景深边缘。一个Token里同时混入“干净像素”和“重度退化像素”,模型在自注意力里还得想办法把它们分开,等于自己给自己挖坑。
最近出现的JIT(Just image Transformers)基线,直接预测干净图像,效果已经很能打,但它依然使用固定patch tokenization。论文里做了一个很直观的网格伪影分析,见下图:JIT在去雨和去噪任务上都会在patch边界露出明显的网格状伪影,而用了可变形Tokenization之后,这些问题就基本消失了。
FIT的思路很直接:把退化感知贯穿全流程 ,从patch采样、Token变换,到最后的像素重建,每一步都要知道“哪里有退化、退化有多重”。下面这张总览图展示了FIT的完整流程:退化编码器输出全局向量g和空间退化图M;可变形patch嵌入根据这两个条件学采样偏移;AdaLN Transformer用全局向量调制Token处理;最后再做可变形反嵌入,把Token弯回像素空间。
双粒度退化编码:同时捕捉全局与局部退化信息
过去很多统一恢复方法,退化表示就是一个全局向量。但全局向量有个天花板:它没法表达“这张图上半部分是雨、下半部分是雾”这种空间不均匀的情况。FIT为此设计了双粒度退化编码器(Dual-Granularity Degradation Encoder,简称DGDE),同时产出两种互补的退化表示。
第一个是全局退化向量g ,维度为D_g,用来描述整张图像的整体退化统计信息,相当于一个浓缩版的“这张图怎么了”报告。第二个是空间退化图M ,分辨率是原图的1/16,每个空间位置都能给出一个退化严重程度的度量,说白了就是一张“退化严重程度热力图”。
实现方式并不复杂。退化图像先过一个轻量CNN主干f_enc,通过步长卷积做16倍下采样,拿到特征F。空间退化图就是对这个特征做1×1卷积再用tanh压缩到[-1,1]区间。全局向量则是对特征做全局平均池化(GAP)再接一个MLP。
为了让这些表示真的“懂”退化,论文给编码器加了两个辅助监督头。训练时用退化类型和退化强度做监督,推理时这些标签完全不需要。辅助损失公式如下:
这个双粒度设计,是在向一个关键痛点开炮:全局向量只能告诉你“有什么退化”,空间退化图才能告诉你“退化在哪里”。而且M的维度只有C_m×h×w,计算开销非常小,不会成为整个模型的瓶颈。后面可变形Tokenization的偏移计算,正好就把这张空间退化图当成了最重要的参考依据。
可变形tokenization:让patch边界跟随退化结构
FIT最核心的改动,就是把固定patch嵌入和固定patch反嵌入,换成了退化引导的可变形Tokenization (Degradation-Guided Deformable Tokenization,简称DGDT)。
具体怎么做?先把空间退化图M上采样到输入分辨率,得到M↑;再把全局向量g做空间扩展得到g^sp。然后把原始图像x、M↑、g^sp拼在一起,喂给一个偏移网络f_off。这个网络是步长卷积和FiLM层交替组成的。FiLM(Feature-wise Linear Modulation)的操作也很直观:
偏移网络的输出经过tanh归一化,再乘上一个动态缩放系数来得到最终的采样偏移Δ。这里有个有意思的细节:缩放系数α(g)由一个MLP接sigmoid得到,范围在[0.5, 1.5]之间,也就是说退化越严重,偏移允许的幅度就越大。退化轻的地方少动,退化重的地方多弯,这就是“退化感知”的落地点。
有了偏移图之后,就可以用双线性插值在偏移后的位置采样像素,再重排成patch并投影成Token。这样的patch边界就不再是硬邦邦的网格线,而是会主动贴合雨线的走向、贴合模糊边缘的切线,把互相污染的像素尽量隔开。下面的图4把这个过程画得很清楚。
Token经过Transformer处理之后,还要弯回像素空间。这个可变形反嵌入的过程和嵌入是对称的:用另一个FiLM调制网络预测逆偏移Δ',把重建结果按逆偏移采样回原始网格,再过一个轻量CNN Refiner加残差连接输出最终结果。偏移是成对学习的,嵌入时怎么弯出去,反嵌入时就怎么弯回来,这样patch边界处就不会出现“对不齐”的接缝。
为了让网格伪影进一步收敛,论文还设计了一个“接缝感知损失”(Seam-aware Loss)。做法很简单:找出所有跨越patch边界的相邻像素对,要求恢复图像的跨边界梯度要逼近真实干净图像的跨边界梯度,同时还要惩罚恢复图像自身的跨边界跳变。两个约束合在一起,一个保真、一个平滑,从梯度层面彻底压制网格痕迹。
任务Token Dropout:提升混合退化场景的鲁棒性
DGDE提供的是隐式退化信息,但很多统一恢复模型发现,显式的任务标签也能带来不小的增益。FIT同时维护了一套“双模式”的任务Token机制:一边是硬任务Token,按任务类型索引的可学习嵌入;另一边是软任务Token,直接从全局向量g经过线性层和reshape生成。
如果模型总是用硬Token,就会产生“标签依赖症”:训练时看到任务标签就躺平,一旦测试时碰到没有标签的混合退化就懵了。FIT的做法是引入任务Token Dropout(TTD) :以一定概率随机丢弃硬任务Token,用软任务Token顶上。
空间信息也没有被遗忘。空间退化图M经过线性投影后直接加到patch Token的位置编码之后。这样每个Token都携带了自己所在位置的退化程度信息,Transformer在自注意力里就能动态调整关注范围,不会被千里之外的无关退化干扰。
Transformer主干用的是AdaLN(Adaptive Layer Normalization,自适应层归一化)块。每一层从全局向量g回归出6个调制参数,分别对注意力和前馈网络的输出做缩放、平移和门控。所有调制参数初始化为零,保证训练稳定。
整个FIT的训练损失是五项的加权和:像素级L1重建损失、辅助头类型分类损失、辅助头强度回归损失、接缝感知损失、偏移正则化损失。偏移正则化约束偏移量小而平滑,防止采样退化成乱七八糟的“鬼畜扭曲”。
实验验证:五项基准全面超越现有方法
实验部分覆盖了五个标准基准:BSD68(去噪)、Rain100L(去雨)、SOTS(去雾)、GoPro(去模糊)和LOLv1(低光增强)。训练数据采用DIV2K加各项任务配对数据集的联合训练方式,输入随机裁剪到256×256。模型配置为隐藏维度896、24层Transformer块、14个注意力头、退化嵌入维度768、空间退化图通道数128、patch大小16。
表1展示了三退化设置下的定量对比。FIT以32.83 dB平均PSNR超过此前最好的VLU-Net约0.13 dB,比JIT基线高出1.11 dB。值得注意的是,FIT在去雾(31.11 dB)和所有噪声等级的去噪任务上都拿了第一,这说明可变形Tokenization对空间不均匀退化的增益尤其明显。
五退化设置是更难也更接近真实应用的考验,结果见表3。FIT平均PSNR达到30.72 dB,比排名第二的AdaIR高出0.52 dB,比JIT基线高出1.44 dB。分任务看,去雨提升1.66 dB、去雾提升2.52 dB、去模糊提升1.10 dB,全部都是空间非均匀性明显的退化类型。这恰好验证了论文的核心论点:退化感知延伸得越早,对空间不均匀退化越友好。
定性结果看图5。去雾示例中,AirNet这类只用全局向量方法在深度变化的雾区明显力不从心,而FIT的空间退化图让去雾能随景深自适应调整;运动模糊示例中,FIT恢复了更清晰的边缘和更细腻的纹理。去噪示例里,FIT在去噪的同时保留了更多结构细节,没有把图像磨成“橡皮泥”。去雨示例则更直观:雨线去除更彻底,背景纹理保留更完整。
消融实验按分量逐一验证,表2展示了一个增量式去噪消融。从最基础的Transformer基线(26.81 dB)出发,单独加可变形Tokenization提升0.54 dB,Grid Score下降5.5;再加退化感知条件提升0.57 dB;加接缝感知训练提升0.33 dB且Grid Score从44.1降到38.7;最后加TTD提升0.07 dB,Grid Score降到36.3。每一块都有正收益,而且Grid Score的下降说明这些设计确实是在攻击网格伪影这个核心痛点。
表4进一步把消融推广到去雨、去雾和去模糊任务,趋势与去噪一致,说明各组件带来的增益不是过拟合单一任务。TTD的单独消融见表5,p_drop=0.3时效果最好。表7对偏移上限δ_max和patch大小做了敏感性分析,δ_max取2时平均PSNR最优,patch大小为16时表现最好。
图7从另一个角度解释了FIT为什么能持续涨点。固定网格的JIT在退化增强时会出现明显的“平台期”——模型参数越堆越多,PSNR却几乎不动,原因就是网格伪影成了瓶颈。而可变形Tokenization让模型绕开了这个天花板,参数量增大时性能还能继续往上走,最大带来约2.4 dB的提升。
最后是图8的偏移可视化。论文把嵌入阶段的偏移幅度叠加到输入图上,可以清楚看到雨线区域和运动边缘区域偏移明显更活跃,而平坦区域几乎不动。反嵌入阶段的偏移更平滑,主要为了稳定地把Token弯回像素网格。这种可视化不仅直观,还给“退化感知自适应采样”提供了可解释的证据。
龙迷三问
这篇论文到底在解决什么问题? FIT提出退化感知的可变形tokenization,让patch边界随局部退化动态调整,配合双粒度退化编码器和任务Token Dropout,在BSD68、Rain100L、SOTS、GoPro、LOLv1五个基准上以30.72d
这篇工作最值得看的点是什么? 在五退化设置下平均PSNR达30.72dB,三退化设置下达32.83dB,均超越现有方法。在去雨、去雾、去模糊等空间非均匀退化任务上提升尤为显著。
这篇工作的边界或风险在哪里? 优点:1) 创新性地将退化感知扩展到tokenization和重建阶段,解决固定patch网格导致的边界伪影问题;2) 双粒度退化编码器同时捕获全局和局部退化信息;3) 任务token dropout策略提高对混合退化的鲁棒性。缺点:1) 计算开销增加15-20%;2) 对均匀退化场景收益有限;3) 偏移预测网络增加模型复杂度。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出Flexible Image Transformer (FIT),通过轻量级退化编码器预测全局退化向量和空间退化图,并利用FiLM调制可变形patch嵌入与重建,使整个pipeline端到端退化感知。
实验合理度: ★★★★☆
PSNR、SSIM、Grid Score。
学术研究价值: ★★★★☆
提出Flexible Image Transformer (FIT),通过轻量级退化编码器预测全局退化向量和空间退化图,并利用FiLM调制可变形patch嵌入与重建,使整个pipeline端到端退化感。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
相比JIT基线有15-20%的推理速度下降,主要开销来自偏移预测和双线性采样等不规则操作。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 伪影问题;2) 双粒度退化编码器同时捕获全局和局部退化信息;3) 任务token dropout策略提高对混合退化的鲁棒性。缺点:1) 计算开销增加15-20%;2) 对均匀退化场景收益有限;3) 偏移预测网络增加模型复杂度。
主要参考文献
[1] Li B, Liu X, Hu P, et al. All-in-one image restoration using degradation aware contrastive learning[C] // CVPR 2022.
[2] Zhang J, Zhang Y, Gu J, et al. Learning image restoration from mixed degradation ingredients[C] // CVPR 2023.
[3] Potlapalli V, Zamir S W, Khan S H, et al. PromptIR: Prompting for all-in-one image restoration[C] // NeurIPS 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!