← 返回 PaperDaily
视觉与图像
最新FDIR:压缩图恢复不再纠结,3.5K训练图拿下7/10下游任务
JPEG一压狠了,画面就糊成一团。传统方法要么回归均值磨平纹理,要么生成式模型脑补纹理骗过人眼却坑了下游模型。FDIR用两阶段解耦把这笔“三角债”理清了,只用3.5K张图就拿下7/10下游任务领先,值得做压缩恢复的同学都看一眼。
龙哥读论文
发布于 2026-08-14 21:50:11
阅读 6
查看原文
原论文信息如下:
照片在微信里传几轮,画质就被“压没了”。JPEG、WebP这类有损压缩格式遍布互联网,为了省流量、省存储,它们把图像的高频细节连同噪声一起丢进了垃圾桶。压缩狠了(质量因子低到1到30这种),画面上就会出现块效应、边缘振铃伪影和颜色偏移。
图像恢复(Image Restoration)就是想把丢掉的内容“脑补”回来。但这里有一个长年无解的哲学问题:脑补出来的东西,到底是恢复还是幻觉?
如果追求像素级保真度(PSNR、SSIM这类指标),模型会趋向于输出“平均脸”式的平滑图像,纹理细节全被磨掉,看起来像隔了一层毛玻璃。如果追求人类感知质量(LPIPS、FID这类指标),生成式模型会脑补出看起来自然但事实上不存在的纹理,骗过了人眼,却坑了下游的识别、分割和检测模型。
这两种路线在过去的文献里几乎是针尖对麦芒:保真度派(ARCNN、DnCNN、SwinIR、PromptCIR)霸榜PSNR,感知派(DiffBIR、SUPIR、CODiff)在LPIPS和FID上遥遥领先。但有没有可能,这个“二选一”本身就是一个伪命题?
来自国立成功大学和哈佛医学院的研究团队给出了一个明确回答:把两个阶段拆开,各管一摊,就能同时把保真度、人类感知和机器偏好都照顾好。这个新框架叫FDIR (Fidelity-human-machine Harmonized Image Restoration),它做了一个很多研究者想过但没敢做的设计——用质量因子引导的单步流匹配(Stage 1)在潜空间恢复全局语义结构,再叠一个锚定观测输入的像素级细节精修网络(Stage 2)把高频纹理找回来,同时压制幻觉。
图像恢复的三难困境:保真度、感知与机器偏好如何兼得?
更难得的是,这一切不是靠堆数据堆出来的。FDIR在不到3.5K对训练图像上完成微调,推理时只跑一次前向(NFE=1),在RTX 4090上处理256×256的图只要47.4毫秒,比DiffBIR快约50倍,比同为单步的CODiff还快2.5倍。与此同时,在极端压缩(QF=1、5)下拿到最佳保真度,并且在7/10个下游任务指标上排到第一。
这篇论文最值得琢磨的不是某个指标刷了多高,而是它把“图像恢复到底该优化什么”这个问题重新摆上了台面。
传统的图像恢复评价,大多数时候只盯着一根轴:要么比PSNR/SSIM(保真度),要么比LPIPS/FID(感知质量)。但作者提出,一个真正好用的恢复模型,应该同时在三个维度 上经得起考验:
保真度 衡量恢复图像在像素层面对ground truth的忠实程度,对应PSNR、SSIM。这个指标在医学影像、卫星遥感等领域是不可妥协的——想象一下,如果一张病理切片上被“脑补”出一个并不存在的病灶纹理,医生据此诊断,后果不堪设想。
人类感知 衡量恢复图像在视觉上是否“像一张自然照片”,常用LPIPS、DISTS和FID来度量。这里有个细思极恐的结论:Cohen等人从信息论角度证明,当恢复模型逼近完美感知质量时,它必然会产生与观测不一致的幻觉内容。也就是说,追求“看着完美”和追求“像素正确”在数学上就是矛盾的。
机器偏好 衡量恢复图像给下游视觉模型“吃”下去之后,分割、检测、检索等任务的准确率会不会掉。这个维度在以往的恢复论文里几乎被无视了。Li等人和Shi等人的研究都指出:恢复图像的PSNR涨了,下游检测器的mAP反而可能掉;感知指标变好了,特征提取器反而可能分不清类别。
这三个维度构成了一个“张力三角形”:保真度和感知的冲突已经有了理论支撑;感知和机器的冲突在于,幻觉纹理喂给判别式模型后会造成分布偏移;保真度和机器的冲突则在于,过度平滑的特征会丢掉判别力。任何单一网络去同时拟合这三股相互拉扯的梯度,最后往往只能顾一头。
FDIR给出的解法不是“缝合”三个损失函数,而是从架构层面做结构性解耦:让不同的子网络各自去承担不同维度的优化目标。
FDIR核心设计:两阶段解耦,各司其职
FDIR(Fidelity-human-machine Harmonized Image Restoration)整体架构如图2所示。第一阶段叫做质量引导单步流匹配(Quality-Guided One-Step Flow Matching,QO-Flow) ,负责在潜空间恢复全局语义结构;第二阶段叫做流条件细节精修(Flow-Conditioned Detail Refinement,FCDR) ,在像素空间恢复高频纹理、压制幻觉。两个阶段用不同的归纳偏置处理不同维度的优化目标。
Stage 1:质量引导单步流匹配(QO-Flow)
QO-Flow没有采用SDE式的扩散模型,而是选用Flow Matching(流匹配)作为生成先验。原因是流匹配学习的是从退化分布到干净分布的确定性ODE轨迹,线性概率路径在训练时条件更好,推理时也更容易逼近单步预测——这对后续NFE=1(Number of Function Evaluations,函数评估次数为1)的高效推理至关重要。具体地,给定压缩图像 x_deg 和对应干净图像 x_gt,先将两者编码到Stable Diffusion 3的VAE(变分自编码器)潜空间,得到 z_deg 和 z_clean,再构造线性插值路径(公式1):
为了让模型对不同压缩强度做出差异化响应,作者设计了压缩感知条件编码器。质量因子QF(Quality Factor)被归一化后,经过64频段正弦位置编码(公式2),再通过三层MLP映射,分别以交叉注意力形式和自适应层归一化形式注入到SD3骨干网络中。这样模型既能根据压缩程度调整局部纹理合成,又能全局调整色调映射。
考虑到SD3-Medium骨干有2.1B参数,直接全量微调不现实,作者采用低秩适配(Low-Rank Adaptation,LoRA)技术,只训练注意力投影矩阵的低秩增量(公式3),可训练参数仅占骨干的1.4%。这一设计既保留预训练生成先验对自然图像统计规律的编码能力,又大幅降低了显存开销和过拟合风险。
训练时,除了标准的流匹配损失(公式4),还额外加入了LPIPS感知正则项(公式5)。这个感知正则的意义在于直接监督VAE解码后的像素输出,避免预训练先验“放飞自我”生成幻觉纹理。作者强调,流匹配损失仍是主目标,LPIPS只是起到锚定感知真实性的辅助作用。推理时只在t=0处做一次前向,得到预测潜变量再解码,实现单步生成,彻底绕开多步迭代取样的计算开销。
Stage 1的输出虽然语义完整,但仍可能带有两种误差:生成式先验带来的“脑补纹理”,以及VAE解码器引入的系统性像素偏移。Stage 2的FCDR模块正是为纠正这两类误差而生。它的关键设计是观测锚定残差公式 :网络的输出不是直接生成整幅图像,而是在退化观测 x_deg 的基础上叠加一个残差修正量(公式6)。
这个“锚定”的归纳偏置非常关键:残差估计天然是低范数的修正,网络没有机会把输出推离观测太远,从而在结构上杜绝了大规模幻觉生成。当Stage 1的修补可靠时,残差网络从中提取高频细节;当Stage 1的输出可疑时,残差网络自动回到退化输入,预测接近零的残差。这种空间自适应的信息融合策略,是纯保真模型或纯生成模型都难以实现的。
FCDR的损失函数也对应三轴设计(公式7):L1+L2损失锚定保真度,LPIPS损失照顾人类感知,拉普拉斯二阶梯度损失保住边缘结构。每一路损失都针对特定的失败模式,权重配比(λ_rec=2.0、λ_perc=1.5、λ_struct=0.5)经过消融实验论证。
实验验证:全面领先的保真度与下游任务表现
实验设置遵循“分场景验证”的思路:在极端压缩(QF=1、5)下重点考察保真度与感知质量,在实用压缩(QF=20、30)下重点考察机器偏好。训练数据仅用DF2K子集(3450对图像),测试集为LIVE1和DIV2K-Val。对比基线覆盖传统CNN(FBCNN、JDEC)、Transformer(SwinIR、PromptCIR)和生成式方法(DiffBIR、CODiff),在数据规模、推理步数均存在差异的前提下,FDIR用最少的训练数据拿到了极具竞争力的结果。
从表1看,FDIR在绝大多数保真度指标上取得第一:QF=1下LIVE1的PSNR达到23.08dB,比FBCNN高出1.37dB,比CODiff高出1.50dB;在DIV2K-Val上同样全面领先。这验证了观测锚定残差设计的有效性——既无损Stage 1的语义恢复能力,又能系统修正生成式先验带来的像素偏移。
在感知维度上,表2显示CODiff的FID领先,但代价是PSNR损失1.4到2.3dB。FDIR选择站在这条感知-失真边界上偏保真的一端:感知指标保持第二梯队,但避免幻觉纹理对下游任务的伤害。图3的MAE误差图直观展示了这一差异——FDIR在多数区域的像素误差显著低于生成式方法。
在机器偏好维度,表3给出了更完整的答案。FDIR在语义分割(CUB-200)、目标检测(COCO)和图像检索(ImageNet)三类下游任务共10个指标中拿下7个第一,尤其在高压缩比下优势明显。这说明架构解耦带来的收益不仅体现在像素指标上,更转化为下游特征空间中更好的判别力。
图4的可视化对比进一步佐证了上述结论:FBCNN恢复结果偏平滑,DiffBIR和CODiff产生幻觉纹理,FDIR则较好地平衡了结构保真与纹理细节。值得注意的是,FDIR取得这些结果仅用约3.5K训练对,而DiffBIR等生成式方法动辄使用15M量级的数据。
消融实验(表4)也验证了两阶段设计的必要性。单独使用QO-Flow时PSNR提升有限但下游任务提升明显,说明Stage 1的语义结构恢复对机器偏好有“类分布正则化”的溢出效应;单独使用FCDR时保真度提升但感知和下游收益受限;只有两阶段串联才能同时拿到保真第一、感知第二、下游7/10领先的综合表现。
效率与泛化:小数据训练,快速推理,跨编解码器迁移
效率是FDIR的另一大卖点。得益于单步流匹配设计,推理时只需一次前向传播(NFE=1),在RTX 4090上处理256×256图像仅需47.4毫秒(表5)。同样的图像,DiffBIR需要2.4秒(50步采样),CODiff需要118毫秒。也就是说FDIR比DiffBIR快约50倍,比CODiff快约2.5倍。同时,LoRA微调只训练1.4%的骨干参数,配合冻结VAE,使得在单张RTX 5090上就能完成两阶段训练。
跨编解码器泛化方面,表6给出了WebP编解码器上的验证结果。FDIR在PSNR、SSIM上继续保持最佳,说明观测锚定残差公式不是针对JPEG过拟合,而是捕捉了一类有损压缩伪影的共性问题。这一结论也回应了一个常见的质疑:只用3.5K数据训练,会不会严重过拟合训练集?从跨编解码器表现看,残差低范数约束有效抑制了过拟合。
机器偏好维度上的增益还能从特征层面得到解释。图5展示了CLIP注意力热图:FDIR恢复的图像在语义分割任务中能较好地保持目标区域的注意力聚焦,而DiffBIR等生成方法因为引入幻觉纹理,注意力分布出现偏移。这解释了为什么PSNR相当的前提下,FDIR的下游指标更稳定。
局限与展望:从JPEG到更广泛的恢复场景
尽管FDIR在JPEG和WebP上展示了优异的性能,但其主要验证范围仍聚焦在质量因子QF=1到30的极端到中等压缩区间。QF大于30时,压缩损伤本身已经很小,恢复的意义有限。此外,实验完全基于合成JPEG/WebP压缩数据,尚未覆盖真实世界中混合了模糊、噪声、分辨率下降等多重退化的复杂场景。
从模型架构看,QO-Flow依赖于Stable Diffusion 3的预训练先验,骨干参数达2.1B,即使推理时只走一次前向,显存占用依然可观,这对边缘设备部署并不友好。作者在附录中验证了LoRA适配可以迁移到不同骨干(表11),说明设计本身具有通用性,但轻量化落地仍有空间。
未来值得探索的方向包括:将两阶段解耦框架迁移到超分辨率、去模糊、去雨等更广泛的恢复任务;引入在线质量因子估计实现真正端到端的盲恢复;以及在保持现有保真度优势的前提下,通过引入轻量生成模块进一步提升感知指标,向感知-失真前沿的“甜点区”推进。整体来看,FDIR给出的是一个可扩展的框架性答案,而不是一个终结性的解决方案。
龙迷三问
这篇论文到底在解决什么问题? 压缩图像恢复长期困在保真度与感知的跷跷板上,生成式模型还常常“脑补”出错误纹理。FDIR用两阶段解耦设计把全局语义恢复和细节精修分开,仅靠约3.5K训练图,就在极端JPEG压缩下拿了最佳保真度,并在7/10下游任务上领先,推理只跑
这篇工作最值得看的点是什么? 在极端压缩下(QF=1,5)取得最佳保真度(PSNR最高)和第二佳感知分数;在实用压缩比(QF=20,30)下7/10下游任务领先;训练数据仅3.5K,推理速度47.4ms。
这篇工作的边界或风险在哪里? 优点:两阶段解耦设计巧妙,兼顾保真度与感知质量;训练数据效率高(3.5K vs 15M);推理速度快;机器偏好评估全面。缺点:仅针对JPEG/WebP优化;依赖预训练SD3骨干;QF需在推理时已知(虽有估计方案);在QF>30时恢复增益有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出两阶段架构FDIR,通过质量引导的单步流匹配(QO-Flow)恢复全局语义结构,再通过流条件细节精化(FCDR)在像素空间确定性恢复高频纹理并抑制生成幻觉,实现保真度、人类感知和机器偏好的三方平衡。
实验合理度: ★★★★☆
PSNR↑, SSIM↑, LPIPS↓, DISTS↓, FID↓, mIoU↑, Dice↑, mAP↑, mAP50↑, Top-1↑
学术研究价值: ★★★★☆
提出两阶段架构FDIR,通过质量引导的单步流匹配(QO-Flow)恢复全局语义结构,再通过流条件细节精化(FCDR)在像素空间确定性恢复高频纹理并抑制生成幻觉,实现保真度、人类感知和机器偏好的三方平衡;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
全流程135.80 GFLOPs,在RTX 4090上256×256输入推理延迟47.4ms(21.1 FPS),比DiffBIR快50倍,比CODiff快2.5倍。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 仅针对JPEG/WebP优化;依赖预训练SD3骨干;QF需在推理时已知(虽有估计方案);在QF>30时恢复增益有限。
主要参考文献
[1] Chen K Y, Su F Y, Chikontwe P, et al. FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration. arXiv preprint arXiv:2608.00111, 2026.
[2] Blau Y, Michaeli T. The perception-distortion tradeoff. CVPR 2018.
[3] Cohen R, Blau Y, et al. When is a perceptual quality metric ready for use? NeurIPS 2020.
[4] Lipman Y, Chen R T Q, et al. Flow matching for generative modeling. ICLR 2023.
[5] Liu X, Gong C, et al. Flow straight and fast: Learning to generate and transfer data with rectified flow. ICLR 2023.
[6] Hu E J, Shen Y, et al. LoRA: Low-rank adaptation of large language models. ICLR 2022.
[7] Zhang R, Isola P, et al. The unreasonable effectiveness of deep features as a perceptual metric. CVPR 2018.
融会贯通
结合PaperDaily MCP已收录论文的对比情况来看,在JPEG压缩恢复任务上,FDIR报告的结果(如LIVE1 QF=1下PSNR 23.08dB)在已收录论文范围内处于有竞争力的水平。但需要说明的是,当前MCP数据库未能提供足够的同基准数值对照,且不同论文在训练数据规模、质量因子范围、评估协议上存在显著差异,上述对比仅供参考,不应被解读为全领域绝对领先结论。
FDIR的核心启发不在于某个指标刷到多高,而在于给出了一个可复用的方法论:当多个优化目标存在本质冲突时,与其在单一模型中做梯度调和,不如在架构层面把目标解耦到不同模块,让每个模块用最适配的归纳偏置去解决对应的问题。这套思想对超分辨率、去模糊、低光增强等恢复任务同样具有迁移价值。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!