← 返回 PaperDaily 视觉与图像

最新FDIR:压缩图恢复不再纠结,3.5K训练图拿下7/10下游任务

JPEG一压狠了,画面就糊成一团。传统方法要么回归均值磨平纹理,要么生成式模型脑补纹理骗过人眼却坑了下游模型。FDIR用两阶段解耦把这笔“三角债”理清了,只用3.5K张图就拿下7/10下游任务领先,值得做压缩恢复的同学都看一眼。

最新FDIR:压缩图恢复不再纠结,3.5K训练图拿下7/10下游任务

paperdaily_reaction_gif


原论文信息如下:
论文标题:
FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration
发表日期:
2026年08月
发表单位:
国立成功大学(中国台湾)、哈佛医学院(美国)
原文链接:
https://arxiv.org/pdf/2608.00111v1.pdf

照片在微信里传几轮,画质就被“压没了”。JPEG、WebP这类有损压缩格式遍布互联网,为了省流量、省存储,它们把图像的高频细节连同噪声一起丢进了垃圾桶。压缩狠了(质量因子低到1到30这种),画面上就会出现块效应、边缘振铃伪影和颜色偏移。
图像恢复(Image Restoration)就是想把丢掉的内容“脑补”回来。但这里有一个长年无解的哲学问题:脑补出来的东西,到底是恢复还是幻觉?
如果追求像素级保真度(PSNR、SSIM这类指标),模型会趋向于输出“平均脸”式的平滑图像,纹理细节全被磨掉,看起来像隔了一层毛玻璃。如果追求人类感知质量(LPIPS、FID这类指标),生成式模型会脑补出看起来自然但事实上不存在的纹理,骗过了人眼,却坑了下游的识别、分割和检测模型。
这两种路线在过去的文献里几乎是针尖对麦芒:保真度派(ARCNN、DnCNN、SwinIR、PromptCIR)霸榜PSNR,感知派(DiffBIR、SUPIR、CODiff)在LPIPS和FID上遥遥领先。但有没有可能,这个“二选一”本身就是一个伪命题?
来自国立成功大学和哈佛医学院的研究团队给出了一个明确回答:把两个阶段拆开,各管一摊,就能同时把保真度、人类感知和机器偏好都照顾好。这个新框架叫FDIR(Fidelity-human-machine Harmonized Image Restoration),它做了一个很多研究者想过但没敢做的设计——用质量因子引导的单步流匹配(Stage 1)在潜空间恢复全局语义结构,再叠一个锚定观测输入的像素级细节精修网络(Stage 2)把高频纹理找回来,同时压制幻觉。

图像恢复的三难困境:保真度、感知与机器偏好如何兼得?

图1
FDIR通过QO-Flow恢复全局结构,再经FCDR精修细节,在“过度平滑”与“幻觉纹理”之间找到了一个更均衡的位置(图源:原论文 Figure 1)
更难得的是,这一切不是靠堆数据堆出来的。FDIR在不到3.5K对训练图像上完成微调,推理时只跑一次前向(NFE=1),在RTX 4090上处理256×256的图只要47.4毫秒,比DiffBIR快约50倍,比同为单步的CODiff还快2.5倍。与此同时,在极端压缩(QF=1、5)下拿到最佳保真度,并且在7/10个下游任务指标上排到第一。
这篇论文最值得琢磨的不是某个指标刷了多高,而是它把“图像恢复到底该优化什么”这个问题重新摆上了台面。
传统的图像恢复评价,大多数时候只盯着一根轴:要么比PSNR/SSIM(保真度),要么比LPIPS/FID(感知质量)。但作者提出,一个真正好用的恢复模型,应该同时在三个维度上经得起考验:
保真度衡量恢复图像在像素层面对ground truth的忠实程度,对应PSNR、SSIM。这个指标在医学影像、卫星遥感等领域是不可妥协的——想象一下,如果一张病理切片上被“脑补”出一个并不存在的病灶纹理,医生据此诊断,后果不堪设想。
人类感知衡量恢复图像在视觉上是否“像一张自然照片”,常用LPIPS、DISTS和FID来度量。这里有个细思极恐的结论:Cohen等人从信息论角度证明,当恢复模型逼近完美感知质量时,它必然会产生与观测不一致的幻觉内容。也就是说,追求“看着完美”和追求“像素正确”在数学上就是矛盾的。
机器偏好衡量恢复图像给下游视觉模型“吃”下去之后,分割、检测、检索等任务的准确率会不会掉。这个维度在以往的恢复论文里几乎被无视了。Li等人和Shi等人的研究都指出:恢复图像的PSNR涨了,下游检测器的mAP反而可能掉;感知指标变好了,特征提取器反而可能分不清类别。
这三个维度构成了一个“张力三角形”:保真度和感知的冲突已经有了理论支撑;感知和机器的冲突在于,幻觉纹理喂给判别式模型后会造成分布偏移;保真度和机器的冲突则在于,过度平滑的特征会丢掉判别力。任何单一网络去同时拟合这三股相互拉扯的梯度,最后往往只能顾一头。
FDIR给出的解法不是“缝合”三个损失函数,而是从架构层面做结构性解耦:让不同的子网络各自去承担不同维度的优化目标。

FDIR核心设计:两阶段解耦,各司其职

FDIR(Fidelity-human-machine Harmonized Image Restoration)整体架构如图2所示。第一阶段叫做质量引导单步流匹配(Quality-Guided One-Step Flow Matching,QO-Flow),负责在潜空间恢复全局语义结构;第二阶段叫做流条件细节精修(Flow-Conditioned Detail Refinement,FCDR),在像素空间恢复高频纹理、压制幻觉。两个阶段用不同的归纳偏置处理不同维度的优化目标。
图2
图2:FDIR整体架构。Stage 1通过压缩感知的单步流匹配在潜空间恢复全局结构,Stage 2在像素空间精修细节并抑制幻觉生成(图源:原论文 Figure 2)

Stage 1:质量引导单步流匹配(QO-Flow)

QO-Flow没有采用SDE式的扩散模型,而是选用Flow Matching(流匹配)作为生成先验。原因是流匹配学习的是从退化分布到干净分布的确定性ODE轨迹,线性概率路径在训练时条件更好,推理时也更容易逼近单步预测——这对后续NFE=1(Number of Function Evaluations,函数评估次数为1)的高效推理至关重要。具体地,给定压缩图像 x_deg 和对应干净图像 x_gt,先将两者编码到Stable Diffusion 3的VAE(变分自编码器)潜空间,得到 z_deg 和 z_clean,再构造线性插值路径(公式1):
公式1
公式1:潜空间线性概率路径。t从0到1,对应从退化潜变量到干净潜变量的匀速插值,真实速度场 v_gt = z_clean − z_deg 为常数
为了让模型对不同压缩强度做出差异化响应,作者设计了压缩感知条件编码器。质量因子QF(Quality Factor)被归一化后,经过64频段正弦位置编码(公式2),再通过三层MLP映射,分别以交叉注意力形式和自适应层归一化形式注入到SD3骨干网络中。这样模型既能根据压缩程度调整局部纹理合成,又能全局调整色调映射。
公式2
公式2:质量因子多层次正弦编码,相邻QF平滑过渡、远处QF区分明显,确保条件注入连续可微
考虑到SD3-Medium骨干有2.1B参数,直接全量微调不现实,作者采用低秩适配(Low-Rank Adaptation,LoRA)技术,只训练注意力投影矩阵的低秩增量(公式3),可训练参数仅占骨干的1.4%。这一设计既保留预训练生成先验对自然图像统计规律的编码能力,又大幅降低了显存开销和过拟合风险。
公式3
公式3:LoRA前向计算。h为输出,W₀为冻结权重,A、B为低秩矩阵,r=64、α=128
训练时,除了标准的流匹配损失(公式4),还额外加入了LPIPS感知正则项(公式5)。这个感知正则的意义在于直接监督VAE解码后的像素输出,避免预训练先验“放飞自我”生成幻觉纹理。作者强调,流匹配损失仍是主目标,LPIPS只是起到锚定感知真实性的辅助作用。推理时只在t=0处做一次前向,得到预测潜变量再解码,实现单步生成,彻底绕开多步迭代取样的计算开销。
公式4
公式4:流匹配训练损失,回归预测速度场与真实速度场(z_clean − z_deg)之间的均方误差
公式5
公式5:第一阶段总损失,流匹配损失为主、LPIPS感知正则(λ_perc=0.2)为辅,兼顾潜空间传输正确性与像素级感知真实性

Stage 2:流条件细节精修(FCDR)

Stage 1的输出虽然语义完整,但仍可能带有两种误差:生成式先验带来的“脑补纹理”,以及VAE解码器引入的系统性像素偏移。Stage 2的FCDR模块正是为纠正这两类误差而生。它的关键设计是观测锚定残差公式:网络的输出不是直接生成整幅图像,而是在退化观测 x_deg 的基础上叠加一个残差修正量(公式6)。
公式6
公式6:观测锚定残差公式。x_deg为退化输入,Δx_θ为残差网络输出,clip将结果约束在合法像素范围,保证最终图像落在退化输入的结构邻域内
这个“锚定”的归纳偏置非常关键:残差估计天然是低范数的修正,网络没有机会把输出推离观测太远,从而在结构上杜绝了大规模幻觉生成。当Stage 1的修补可靠时,残差网络从中提取高频细节;当Stage 1的输出可疑时,残差网络自动回到退化输入,预测接近零的残差。这种空间自适应的信息融合策略,是纯保真模型或纯生成模型都难以实现的。
FCDR的损失函数也对应三轴设计(公式7):L1+L2损失锚定保真度,LPIPS损失照顾人类感知,拉普拉斯二阶梯度损失保住边缘结构。每一路损失都针对特定的失败模式,权重配比(λ_rec=2.0、λ_perc=1.5、λ_struct=0.5)经过消融实验论证。
公式7
公式7:FCDR组合损失。L_rec防止生成漂移,L_perc防止过度平滑,L_struct为边缘结构损失,三者分别对应保真、感知、机器三个目标

实验验证:全面领先的保真度与下游任务表现

实验设置遵循“分场景验证”的思路:在极端压缩(QF=1、5)下重点考察保真度与感知质量,在实用压缩(QF=20、30)下重点考察机器偏好。训练数据仅用DF2K子集(3450对图像),测试集为LIVE1和DIV2K-Val。对比基线覆盖传统CNN(FBCNN、JDEC)、Transformer(SwinIR、PromptCIR)和生成式方法(DiffBIR、CODiff),在数据规模、推理步数均存在差异的前提下,FDIR用最少的训练数据拿到了极具竞争力的结果。
表1
表1:LIVE1与DIV2K-Val上QF=1和QF=5的定量对比。粗体红色为最佳,下划线蓝色为次佳(图源:原论文 Table 1)
从表1看,FDIR在绝大多数保真度指标上取得第一:QF=1下LIVE1的PSNR达到23.08dB,比FBCNN高出1.37dB,比CODiff高出1.50dB;在DIV2K-Val上同样全面领先。这验证了观测锚定残差设计的有效性——既无损Stage 1的语义恢复能力,又能系统修正生成式先验带来的像素偏移。
表2
表2:DIV2K-Val上感知质量对比。CODiff凭借生成先验在FID/LPIPS上占优,FDIR以保真优先策略取得次佳感知表现(图源:原论文 Table 2)
在感知维度上,表2显示CODiff的FID领先,但代价是PSNR损失1.4到2.3dB。FDIR选择站在这条感知-失真边界上偏保真的一端:感知指标保持第二梯队,但避免幻觉纹理对下游任务的伤害。图3的MAE误差图直观展示了这一差异——FDIR在多数区域的像素误差显著低于生成式方法。
图3
图3:DIV2K-Val上QF=5的MAE误差图(颜色越深误差越低)。Stage 1负责去除块效应和振铃,Stage 2纠正生成偏移,两者协同让最终误差分布更均匀(图源:原论文 Figure 3)
在机器偏好维度,表3给出了更完整的答案。FDIR在语义分割(CUB-200)、目标检测(COCO)和图像检索(ImageNet)三类下游任务共10个指标中拿下7个第一,尤其在高压缩比下优势明显。这说明架构解耦带来的收益不仅体现在像素指标上,更转化为下游特征空间中更好的判别力。
表3
表3:QF=20和QF=30下机器偏好对比。FDIR在10项指标中7项第一(粗体红),无一项垫底(图源:原论文 Table 3)
图4的可视化对比进一步佐证了上述结论:FBCNN恢复结果偏平滑,DiffBIR和CODiff产生幻觉纹理,FDIR则较好地平衡了结构保真与纹理细节。值得注意的是,FDIR取得这些结果仅用约3.5K训练对,而DiffBIR等生成式方法动辄使用15M量级的数据。
图4
图4:QF=5下DIV2K-Val可视化对比。FDIR在细节忠实度与自然观感之间取得更好平衡(图源:原论文 Figure 4)
消融实验(表4)也验证了两阶段设计的必要性。单独使用QO-Flow时PSNR提升有限但下游任务提升明显,说明Stage 1的语义结构恢复对机器偏好有“类分布正则化”的溢出效应;单独使用FCDR时保真度提升但感知和下游收益受限;只有两阶段串联才能同时拿到保真第一、感知第二、下游7/10领先的综合表现。
表4
表4:消融实验。左为保真与感知指标,右为QF=10下游任务性能。移除任何模块都会导致多项指标下降(图源:原论文 Table 4)

效率与泛化:小数据训练,快速推理,跨编解码器迁移

效率是FDIR的另一大卖点。得益于单步流匹配设计,推理时只需一次前向传播(NFE=1),在RTX 4090上处理256×256图像仅需47.4毫秒(表5)。同样的图像,DiffBIR需要2.4秒(50步采样),CODiff需要118毫秒。也就是说FDIR比DiffBIR快约50倍,比CODiff快约2.5倍。同时,LoRA微调只训练1.4%的骨干参数,配合冻结VAE,使得在单张RTX 5090上就能完成两阶段训练。
表5
表5:RTX 4090上256×256输入的推理延迟对比。FDIR实现NFE=1且延迟最低(图源:原论文 Table 5)
跨编解码器泛化方面,表6给出了WebP编解码器上的验证结果。FDIR在PSNR、SSIM上继续保持最佳,说明观测锚定残差公式不是针对JPEG过拟合,而是捕捉了一类有损压缩伪影的共性问题。这一结论也回应了一个常见的质疑:只用3.5K数据训练,会不会严重过拟合训练集?从跨编解码器表现看,残差低范数约束有效抑制了过拟合。
表6
表6:WebP恢复泛化验证。FDIR在PSNR/SSIM上双第一,表明残差锚定设计可迁移到不同有损编解码器(图源:原论文 Table 6)
机器偏好维度上的增益还能从特征层面得到解释。图5展示了CLIP注意力热图:FDIR恢复的图像在语义分割任务中能较好地保持目标区域的注意力聚焦,而DiffBIR等生成方法因为引入幻觉纹理,注意力分布出现偏移。这解释了为什么PSNR相当的前提下,FDIR的下游指标更稳定。
图5
图5:QF=10下CLIP注意力热图对比。FDIR的特征聚焦更接近原图,幻觉纹理导致生成方法的注意力发生偏移(图源:原论文 Figure 5)

局限与展望:从JPEG到更广泛的恢复场景

尽管FDIR在JPEG和WebP上展示了优异的性能,但其主要验证范围仍聚焦在质量因子QF=1到30的极端到中等压缩区间。QF大于30时,压缩损伤本身已经很小,恢复的意义有限。此外,实验完全基于合成JPEG/WebP压缩数据,尚未覆盖真实世界中混合了模糊、噪声、分辨率下降等多重退化的复杂场景。
从模型架构看,QO-Flow依赖于Stable Diffusion 3的预训练先验,骨干参数达2.1B,即使推理时只走一次前向,显存占用依然可观,这对边缘设备部署并不友好。作者在附录中验证了LoRA适配可以迁移到不同骨干(表11),说明设计本身具有通用性,但轻量化落地仍有空间。
未来值得探索的方向包括:将两阶段解耦框架迁移到超分辨率、去模糊、去雨等更广泛的恢复任务;引入在线质量因子估计实现真正端到端的盲恢复;以及在保持现有保真度优势的前提下,通过引入轻量生成模块进一步提升感知指标,向感知-失真前沿的“甜点区”推进。整体来看,FDIR给出的是一个可扩展的框架性答案,而不是一个终结性的解决方案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?压缩图像恢复长期困在保真度与感知的跷跷板上,生成式模型还常常“脑补”出错误纹理。FDIR用两阶段解耦设计把全局语义恢复和细节精修分开,仅靠约3.5K训练图,就在极端JPEG压缩下拿了最佳保真度,并在7/10下游任务上领先,推理只跑
这篇工作最值得看的点是什么?在极端压缩下(QF=1,5)取得最佳保真度(PSNR最高)和第二佳感知分数;在实用压缩比(QF=20,30)下7/10下游任务领先;训练数据仅3.5K,推理速度47.4ms。
这篇工作的边界或风险在哪里?优点:两阶段解耦设计巧妙,兼顾保真度与感知质量;训练数据效率高(3.5K vs 15M);推理速度快;机器偏好评估全面。缺点:仅针对JPEG/WebP优化;依赖预训练SD3骨干;QF需在推理时已知(虽有估计方案);在QF>30时恢复增益有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出两阶段架构FDIR,通过质量引导的单步流匹配(QO-Flow)恢复全局语义结构,再通过流条件细节精化(FCDR)在像素空间确定性恢复高频纹理并抑制生成幻觉,实现保真度、人类感知和机器偏好的三方平衡。

实验合理度:★★★★☆

PSNR↑, SSIM↑, LPIPS↓, DISTS↓, FID↓, mIoU↑, Dice↑, mAP↑, mAP50↑, Top-1↑

学术研究价值:★★★★☆

提出两阶段架构FDIR,通过质量引导的单步流匹配(QO-Flow)恢复全局语义结构,再通过流条件细节精化(FCDR)在像素空间确定性恢复高频纹理并抑制生成幻觉,实现保真度、人类感知和机器偏好的三方平衡;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

全流程135.80 GFLOPs,在RTX 4090上256×256输入推理延迟47.4ms(21.1 FPS),比DiffBIR快50倍,比CODiff快2.5倍。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅针对JPEG/WebP优化;依赖预训练SD3骨干;QF需在推理时已知(虽有估计方案);在QF>30时恢复增益有限。

主要参考文献

[1] Chen K Y, Su F Y, Chikontwe P, et al. FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration. arXiv preprint arXiv:2608.00111, 2026.
[2] Blau Y, Michaeli T. The perception-distortion tradeoff. CVPR 2018.
[3] Cohen R, Blau Y, et al. When is a perceptual quality metric ready for use? NeurIPS 2020.
[4] Lipman Y, Chen R T Q, et al. Flow matching for generative modeling. ICLR 2023.
[5] Liu X, Gong C, et al. Flow straight and fast: Learning to generate and transfer data with rectified flow. ICLR 2023.
[6] Hu E J, Shen Y, et al. LoRA: Low-rank adaptation of large language models. ICLR 2022.
[7] Zhang R, Isola P, et al. The unreasonable effectiveness of deep features as a perceptual metric. CVPR 2018.

融会贯通

结合PaperDaily MCP已收录论文的对比情况来看,在JPEG压缩恢复任务上,FDIR报告的结果(如LIVE1 QF=1下PSNR 23.08dB)在已收录论文范围内处于有竞争力的水平。但需要说明的是,当前MCP数据库未能提供足够的同基准数值对照,且不同论文在训练数据规模、质量因子范围、评估协议上存在显著差异,上述对比仅供参考,不应被解读为全领域绝对领先结论。
FDIR的核心启发不在于某个指标刷到多高,而在于给出了一个可复用的方法论:当多个优化目标存在本质冲突时,与其在单一模型中做梯度调和,不如在架构层面把目标解耦到不同模块,让每个模块用最适配的归纳偏置去解决对应的问题。这套思想对超分辨率、去模糊、低光增强等恢复任务同样具有迁移价值。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球