← 返回 PaperDaily 视觉与图像

图像恢复新SOTA!FIT用可变形tokenization摘得多任务接收,平均30.72dB

图像恢复圈的老问题——固定patch切割总在退化边界上“切错地方”,导致修复完还留着一道道网格伪影。FIT把tokenization本身变成可变的,让patch边界跟着雨线、模糊核、景深走,五任务平均PSNR一口气拉到30.72dB,比JIT基线提升1.44dB。一句话:patch不“卷”了,改“弯”了。

图像恢复新SOTA!FIT用可变形tokenization摘得多任务接收,平均30.72dB

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration
发表日期:
2026年08月
发表单位:
未在论文中明确标注
原文链接:
https://arxiv.org/pdf/2608.06832v1.pdf
图像恢复这个圈子,要说卷,那是真卷。尤其是All-in-One统一恢复,一个模型要同时扛下去噪、去雨、去雾、去模糊、低光增强五类活,大家卷完网络结构卷损失函数,卷完损失函数又开始卷退化表征。但不管是PromptIR的提示Token,还是AdaIR的频率调制,它们都有一个共同的小动作——先把图像切成一堆固定大小的patch,再做后续处理。这个看起来人畜无害的固定patch切分,恰恰是很多网格伪影的万恶之源。
今天咱们聊的这篇论文,就把矛头直接对准了Tokenization这一步。FIT(Flexible Image Transformer)想干的事情很简单——让patch边界学会“转弯”,跟着退化结构走,而不是死板地横平竖直切下去。听起来像是把手术刀换成了激光刀,实际上效果也确实够猛:五任务平均PSNR 30.72 dB,三任务平均32.83 dB,直接刷新了统一恢复的一波SOTA。

从固定网格到自适应采样:FIT如何重塑图像恢复的tokenization范式

先看一个真实场景。自动驾驶车辆的前视摄像头拍下雨天街景:画面上半部分是雨线,下半部分是湿滑路面的雾气反光。这种空间上混合的退化,任何单一退化标签都描述不了。强行用一个去雨模型,雾区会被过度平滑;强行用一个去雾模型,雨区又会出现颜色偏移。
现有的统一恢复方法大致分三类。第一类是任务提示型,比如PromptIR,在序列里拼上可学习的提示Token,告诉模型“这次是去雨”或者“这次是去雾”;第二类是全局退化嵌入型,像AirNet、IDR、AdaIR那样,把整张图压成一个全局向量,再通过FiLM或交叉注意力去调制中间特征;第三类是多分支结构型,给每个任务配专门的子网络,参数量上去一大截,共享却有限。
这些方法有一个共同特点:退化信息都是在Token化之后才注入的,也就是先按固定网格切patch,再在处理阶段告诉模型“哪里有退化”。但这样的流程天然有个隐患——固定P×P的patch边界会直接切穿雨线、切穿模糊核、切穿景深边缘。一个Token里同时混入“干净像素”和“重度退化像素”,模型在自注意力里还得想办法把它们分开,等于自己给自己挖坑。
最近出现的JIT(Just image Transformers)基线,直接预测干净图像,效果已经很能打,但它依然使用固定patch tokenization。论文里做了一个很直观的网格伪影分析,见下图:JIT在去雨和去噪任务上都会在patch边界露出明显的网格状伪影,而用了可变形Tokenization之后,这些问题就基本消失了。
图2:JIT与可变形tokenization在去雨/去噪任务上的网格伪影对比
网格伪影分析。红色框标出JIT在patch边界的可见网格伪影,黄色框显示可变形tokenization明显缓解了该问题。退化越严重,固定网格的伪影就越扎眼,最后无论模型容量怎么堆,恢复质量都被这块短板死死卡住。
FIT的思路很直接:把退化感知贯穿全流程,从patch采样、Token变换,到最后的像素重建,每一步都要知道“哪里有退化、退化有多重”。下面这张总览图展示了FIT的完整流程:退化编码器输出全局向量g和空间退化图M;可变形patch嵌入根据这两个条件学采样偏移;AdaLN Transformer用全局向量调制Token处理;最后再做可变形反嵌入,把Token弯回像素空间。
图3:FIT整体架构图
图3:FIT整体架构。给定退化图像后,退化编码器提取全局向量g和空间退化图M;在(g, M)条件下,可变形patch嵌入用学习到的偏移采样像素,AdaLN Transformer在g调制下处理Token,可变形反嵌入通过逆变换重建像素,最后轻量级Refiner输出最终结果。

双粒度退化编码:同时捕捉全局与局部退化信息

过去很多统一恢复方法,退化表示就是一个全局向量。但全局向量有个天花板:它没法表达“这张图上半部分是雨、下半部分是雾”这种空间不均匀的情况。FIT为此设计了双粒度退化编码器(Dual-Granularity Degradation Encoder,简称DGDE),同时产出两种互补的退化表示。
第一个是全局退化向量g,维度为D_g,用来描述整张图像的整体退化统计信息,相当于一个浓缩版的“这张图怎么了”报告。第二个是空间退化图M,分辨率是原图的1/16,每个空间位置都能给出一个退化严重程度的度量,说白了就是一张“退化严重程度热力图”。
实现方式并不复杂。退化图像先过一个轻量CNN主干f_enc,通过步长卷积做16倍下采样,拿到特征F。空间退化图就是对这个特征做1×1卷积再用tanh压缩到[-1,1]区间。全局向量则是对特征做全局平均池化(GAP)再接一个MLP。
为了让这些表示真的“懂”退化,论文给编码器加了两个辅助监督头。训练时用退化类型和退化强度做监督,推理时这些标签完全不需要。辅助损失公式如下:
公式1:退化编码器辅助损失
公式1:辅助损失由两部分组成,前一项是全局向量g做线性分类的交叉熵,监督退化类型t;后一项是对g做MLP后用sigmoid压缩到[0,1],去回归归一化退化强度s。λ_s是权重系数。这两项都只在训练时用,测试阶段FIT完全不需要类型标签和强度标签。
这个双粒度设计,是在向一个关键痛点开炮:全局向量只能告诉你“有什么退化”,空间退化图才能告诉你“退化在哪里”。而且M的维度只有C_m×h×w,计算开销非常小,不会成为整个模型的瓶颈。后面可变形Tokenization的偏移计算,正好就把这张空间退化图当成了最重要的参考依据。

可变形tokenization:让patch边界跟随退化结构

FIT最核心的改动,就是把固定patch嵌入和固定patch反嵌入,换成了退化引导的可变形Tokenization(Degradation-Guided Deformable Tokenization,简称DGDT)。
具体怎么做?先把空间退化图M上采样到输入分辨率,得到M↑;再把全局向量g做空间扩展得到g^sp。然后把原始图像x、M↑、g^sp拼在一起,喂给一个偏移网络f_off。这个网络是步长卷积和FiLM层交替组成的。FiLM(Feature-wise Linear Modulation)的操作也很直观:
公式2:FiLM调制公式
公式2:FiLM(Feature-wise Linear Modulation,特征级线性调制)公式。h是输入特征,γ(g)和β(g)是由全局退化向量g经过线性投影得到的缩放和偏移参数。它们初始化成零,保证训练初期模型等效于一个标准Transformer,稳定性有保障。
偏移网络的输出经过tanh归一化,再乘上一个动态缩放系数来得到最终的采样偏移Δ。这里有个有意思的细节:缩放系数α(g)由一个MLP接sigmoid得到,范围在[0.5, 1.5]之间,也就是说退化越严重,偏移允许的幅度就越大。退化轻的地方少动,退化重的地方多弯,这就是“退化感知”的落地点。
公式3:偏移计算与动态缩放
公式3:偏移量Δ的计算。α(g)是根据全局退化向量动态调整的缩放因子,δ_max是超参数,限制最大位移量。tanh把网络输出压缩到(-1,1),再乘上α和δ_max得到最终偏移。这样既能保证偏移不会太离谱,又能让退化严重的区域获得更大的形变自由度。
有了偏移图之后,就可以用双线性插值在偏移后的位置采样像素,再重排成patch并投影成Token。这样的patch边界就不再是硬邦邦的网格线,而是会主动贴合雨线的走向、贴合模糊边缘的切线,把互相污染的像素尽量隔开。下面的图4把这个过程画得很清楚。
图4:条件可变形patch嵌入结构图
图4:条件可变形patch嵌入。偏移网络接收拼接后的(x, M↑, g^sp),通过FiLM调制的卷积预测采样偏移,动态缩放根据退化严重程度调整偏移幅度。
Token经过Transformer处理之后,还要弯回像素空间。这个可变形反嵌入的过程和嵌入是对称的:用另一个FiLM调制网络预测逆偏移Δ',把重建结果按逆偏移采样回原始网格,再过一个轻量CNN Refiner加残差连接输出最终结果。偏移是成对学习的,嵌入时怎么弯出去,反嵌入时就怎么弯回来,这样patch边界处就不会出现“对不齐”的接缝。
为了让网格伪影进一步收敛,论文还设计了一个“接缝感知损失”(Seam-aware Loss)。做法很简单:找出所有跨越patch边界的相邻像素对,要求恢复图像的跨边界梯度要逼近真实干净图像的跨边界梯度,同时还要惩罚恢复图像自身的跨边界跳变。两个约束合在一起,一个保真、一个平滑,从梯度层面彻底压制网格痕迹。
公式8:接缝损失
公式8:接缝感知损失。B_v和B_h分别是跨越垂直和水平patch边界的相邻像素对集合。第一项让恢复图像的跨边界梯度接近GT的跨边界梯度,第二项惩罚恢复图像中由patch切分导致的额外跳变。η取0.5,平衡两项贡献。

任务Token Dropout:提升混合退化场景的鲁棒性

DGDE提供的是隐式退化信息,但很多统一恢复模型发现,显式的任务标签也能带来不小的增益。FIT同时维护了一套“双模式”的任务Token机制:一边是硬任务Token,按任务类型索引的可学习嵌入;另一边是软任务Token,直接从全局向量g经过线性层和reshape生成。
公式4:软任务Token生成
公式4:软任务Token T_soft由全局退化向量g经过线性投影和reshape生成,形状是N_t×D,其中N_t是任务Token数量。
如果模型总是用硬Token,就会产生“标签依赖症”:训练时看到任务标签就躺平,一旦测试时碰到没有标签的混合退化就懵了。FIT的做法是引入任务Token Dropout(TTD):以一定概率随机丢弃硬任务Token,用软任务Token顶上。
公式5:任务Token Dropout
公式5:任务Token Dropout策略。训练时按伯努利分布采样遮罩m,m=1时用软Token T_soft替代硬Token T_hard[t]。p_drop设为0.3,既保证任务标签被充分利用,又逼着模型学会从图像内容本身推断退化信息,最终在无标签推理时也能靠谱。
空间信息也没有被遗忘。空间退化图M经过线性投影后直接加到patch Token的位置编码之后。这样每个Token都携带了自己所在位置的退化程度信息,Transformer在自注意力里就能动态调整关注范围,不会被千里之外的无关退化干扰。
Transformer主干用的是AdaLN(Adaptive Layer Normalization,自适应层归一化)块。每一层从全局向量g回归出6个调制参数,分别对注意力和前馈网络的输出做缩放、平移和门控。所有调制参数初始化为零,保证训练稳定。
公式6:AdaLN调制参数
公式6:第l层AdaLN的6个调制参数由MLP从全局退化向量g回归得到,包括注意力输出的缩放α₁、平移β₁、门控γ₁,以及前馈网络输出的缩放α₂、平移β₂、门控γ₂。
整个FIT的训练损失是五项的加权和:像素级L1重建损失、辅助头类型分类损失、辅助头强度回归损失、接缝感知损失、偏移正则化损失。偏移正则化约束偏移量小而平滑,防止采样退化成乱七八糟的“鬼畜扭曲”。
公式7:FIT总体训练损失
公式7:总体训练损失。L_recon是像素级L1重建损失;L_type是退化类型分类交叉熵;L_strength是退化强度回归MSE,只对已知强度标签的样本生效;L_seam是接缝感知损失;L_off是偏移正则化损失。λ_t=0.1,λ_s=0.05,λ_b=0.3,λ_o=0.01。

实验验证:五项基准全面超越现有方法

实验部分覆盖了五个标准基准:BSD68(去噪)、Rain100L(去雨)、SOTS(去雾)、GoPro(去模糊)和LOLv1(低光增强)。训练数据采用DIV2K加各项任务配对数据集的联合训练方式,输入随机裁剪到256×256。模型配置为隐藏维度896、24层Transformer块、14个注意力头、退化嵌入维度768、空间退化图通道数128、patch大小16。
表1展示了三退化设置下的定量对比。FIT以32.83 dB平均PSNR超过此前最好的VLU-Net约0.13 dB,比JIT基线高出1.11 dB。值得注意的是,FIT在去雾(31.11 dB)和所有噪声等级的去噪任务上都拿了第一,这说明可变形Tokenization对空间不均匀退化的增益尤其明显。
表1:三退化设置下的SOTA对比
表1:三种退化任务上与最新统一恢复方法的定量比较。加粗为最优,下划线为次优。FIT在去雾和全部噪声等级的PSNR都是第一,平均32.83 dB。
五退化设置是更难也更接近真实应用的考验,结果见表3。FIT平均PSNR达到30.72 dB,比排名第二的AdaIR高出0.52 dB,比JIT基线高出1.44 dB。分任务看,去雨提升1.66 dB、去雾提升2.52 dB、去模糊提升1.10 dB,全部都是空间非均匀性明显的退化类型。这恰好验证了论文的核心论点:退化感知延伸得越早,对空间不均匀退化越友好。
表3:五退化设置下的SOTA对比
表3:五退化设置下的定量比较。FIT在去雾、去雨、低光增强上拿到最好成绩,平均30.72 dB,比JIT基线提升1.44 dB。
定性结果看图5。去雾示例中,AirNet这类只用全局向量方法在深度变化的雾区明显力不从心,而FIT的空间退化图让去雾能随景深自适应调整;运动模糊示例中,FIT恢复了更清晰的边缘和更细腻的纹理。去噪示例里,FIT在去噪的同时保留了更多结构细节,没有把图像磨成“橡皮泥”。去雨示例则更直观:雨线去除更彻底,背景纹理保留更完整。
图5:四类退化任务的定性对比
图5:去雨、去雾、去噪、去模糊四类退化任务的定性比较。红框标记放大区域,FIT在纹理清晰度、边缘锐度和颜色保真度上都优于对比方法。
消融实验按分量逐一验证,表2展示了一个增量式去噪消融。从最基础的Transformer基线(26.81 dB)出发,单独加可变形Tokenization提升0.54 dB,Grid Score下降5.5;再加退化感知条件提升0.57 dB;加接缝感知训练提升0.33 dB且Grid Score从44.1降到38.7;最后加TTD提升0.07 dB,Grid Score降到36.3。每一块都有正收益,而且Grid Score的下降说明这些设计确实是在攻击网格伪影这个核心痛点。
表2:核心组件消融表
表2:核心组件消融。Deform表示可变形Tokenization,Deg-Cond表示退化感知条件,Seam表示接缝感知训练,TTD表示任务Token Dropout。Grid Score越低代表网格伪影越弱。
表4进一步把消融推广到去雨、去雾和去模糊任务,趋势与去噪一致,说明各组件带来的增益不是过拟合单一任务。TTD的单独消融见表5,p_drop=0.3时效果最好。表7对偏移上限δ_max和patch大小做了敏感性分析,δ_max取2时平均PSNR最优,patch大小为16时表现最好。
表4:去噪之外任务的累积消融
表4:去噪以外任务的累积消融,数值为PSNR。各组件在去雨、去雾、去模糊任务上同样带来持续增益。
表5:任务Token Dropout消融
表5:任务Token Dropout消融。p_drop=0.3时PSNR最高,过大或过小都会导致性能下降。
表7:偏移上限与patch大小敏感性分析
表7:五退化设置下对偏移上限δ_max和patch大小的敏感性分析。δ_max=2、patch=16时平均PSNR最优。
图7从另一个角度解释了FIT为什么能持续涨点。固定网格的JIT在退化增强时会出现明显的“平台期”——模型参数越堆越多,PSNR却几乎不动,原因就是网格伪影成了瓶颈。而可变形Tokenization让模型绕开了这个天花板,参数量增大时性能还能继续往上走,最大带来约2.4 dB的提升。
图7:网格伪影瓶颈分析
图7:网格伪影瓶颈分析。上图是伪影严重程度和PSNR随退化等级的变化,下图是模型规模扩展曲线。固定网格的JIT因网格伪影出现平台期,可变形Tokenization支持继续扩展,最高带来约2.4 dB增益。
最后是图8的偏移可视化。论文把嵌入阶段的偏移幅度叠加到输入图上,可以清楚看到雨线区域和运动边缘区域偏移明显更活跃,而平坦区域几乎不动。反嵌入阶段的偏移更平滑,主要为了稳定地把Token弯回像素网格。这种可视化不仅直观,还给“退化感知自适应采样”提供了可解释的证据。
图8:可变形tokenization偏移可视化
图8:不同恢复任务下的可变形Tokenization偏移可视化。每一行对应一个示例,从左到右依次为低质量输入、嵌入阶段偏移幅度叠加图、反嵌入阶段偏移幅度叠加图、纯偏移图和FIT输出。偏移响应与退化模式及结构区域高度相关。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?FIT提出退化感知的可变形tokenization,让patch边界随局部退化动态调整,配合双粒度退化编码器和任务Token Dropout,在BSD68、Rain100L、SOTS、GoPro、LOLv1五个基准上以30.72d
这篇工作最值得看的点是什么?在五退化设置下平均PSNR达30.72dB,三退化设置下达32.83dB,均超越现有方法。在去雨、去雾、去模糊等空间非均匀退化任务上提升尤为显著。
这篇工作的边界或风险在哪里?优点:1) 创新性地将退化感知扩展到tokenization和重建阶段,解决固定patch网格导致的边界伪影问题;2) 双粒度退化编码器同时捕获全局和局部退化信息;3) 任务token dropout策略提高对混合退化的鲁棒性。缺点:1) 计算开销增加15-20%;2) 对均匀退化场景收益有限;3) 偏移预测网络增加模型复杂度。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出Flexible Image Transformer (FIT),通过轻量级退化编码器预测全局退化向量和空间退化图,并利用FiLM调制可变形patch嵌入与重建,使整个pipeline端到端退化感知。

实验合理度:★★★★☆

PSNR、SSIM、Grid Score。

学术研究价值:★★★★☆

提出Flexible Image Transformer (FIT),通过轻量级退化编码器预测全局退化向量和空间退化图,并利用FiLM调制可变形patch嵌入与重建,使整个pipeline端到端退化感。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

相比JIT基线有15-20%的推理速度下降,主要开销来自偏移预测和双线性采样等不规则操作。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:伪影问题;2) 双粒度退化编码器同时捕获全局和局部退化信息;3) 任务token dropout策略提高对混合退化的鲁棒性。缺点:1) 计算开销增加15-20%;2) 对均匀退化场景收益有限;3) 偏移预测网络增加模型复杂度。

主要参考文献

[1] Li B, Liu X, Hu P, et al. All-in-one image restoration using degradation aware contrastive learning[C] // CVPR 2022.
[2] Zhang J, Zhang Y, Gu J, et al. Learning image restoration from mixed degradation ingredients[C] // CVPR 2023.
[3] Potlapalli V, Zamir S W, Khan S H, et al. PromptIR: Prompting for all-in-one image restoration[C] // NeurIPS 2023.
[

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球