← 返回 PaperDaily 视觉与图像

4.9倍吞吐反超SODiff,JPEG修复终于不挑硬件了

先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。

4.9倍吞吐反超SODiff,JPEG修复终于不挑硬件了
原论文信息如下:
论文标题:
EFFICIENT JPEG RESTORATION IN THE WAVELET DOMAIN VIA MEAN FLOWS
发表日期:
2026年08月
发表单位:
Independent Researcher; Faculty of Physics, "Alexandru Ioan Cuza" University of Iași
原文链接:
https://arxiv.org/pdf/2608.28730v1.pdf

JPEG修复的困境:质量与效率的博弈

先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。但代价也很明显——只要压缩狠一点,画质立刻崩给你看:方块效应、振铃、颜色断层、纹理糊成一团。
这些年学术界对JPEG修复的主流思路分成两派。一派走回归路线,用卷积网络直接预测干净图像,代表作有FBCNN、JDEC、Prompt-CIR。这类方法快是真快,但有个致命伤:回归目标倾向于把多种可能的细节"平均"掉,结果就是画质平滑了,纹理也没了。另一派走生成路线,把预训练的文生图扩散模型当成图像先验来用,DiffBIR、SUPIR都是这个思路。到了SODiff,更是把JPEG修复压缩到了单步推理。
听起来生成路线已经完美了?先别急。SODiff虽然号称"单步",但它内部跑的是完整的Stable Diffusion 2.1潜空间流程:一个巨大的去噪UNet、一个训练好的VAE编码器、一个VAE解码器,外加一堆任务相关的语义条件模块。整套模型算下来参数高达12.88亿,在RTX 3090上跑1024×1024的图,每秒只能处理1.64张。对云端服务来说勉强能忍,但对手机、相机、边缘盒子这类部署场景,这就是个"奢侈品"。
这篇论文的出发点非常直接:能不能在生成式修复的质量和部署效率之间,找一个更实用的帕累托点?作者给出的答案是——一个只有6532万参数、从零训练的生成式修复模型。它不要文本编码器、不要预训练图像生成器、也不要VAE,在RTX 3090上达到每秒8.05张的处理速度,是SODiff报告吞吐量的约4.9倍,参数量只有后者的约二十分之一。这就有意思了。

小波域创新:可逆变换替代VAE

要说清楚这篇论文的巧妙之处,得先看它"扔掉"的是什么。现有潜空间扩散模型(Latent Diffusion Model,LDM)一般依赖一个VAE(变分自编码器):先把图像编码到一个压缩的潜空间,在潜空间里做去噪,再解码回像素空间。VAE确实好用,但它有两个绕不开的问题:第一,编码和解码都有额外计算开销,尤其在高分辨率场景下,VAE的Decoder甚至可能成为延迟瓶颈;第二,VAE是有损的,编码再解码这个过程本身就引入了重建误差。
本文的替代方案是一个两层级正交哈尔小波包变换(two-level orthonormal Haar wavelet-packet transform)。这个变换没有可学习参数,完全由固定公式定义,而且严格可逆、能量守恒。对每一个2×2的图像块,它把像素值拆成一个低频近似系数和三个高频细节系数——水平、垂直、对角方向的变化信息。
哈尔小波变换公式
公式中,ℓ是局部均值,h、v、g分别是水平、垂直和对角方向的差异。对每个第一层级子带再做一次同样的变换,特征张量就从3×H×W变成了48×H/4×W/4。这个形状变化是不是很眼熟?对,它跟VAE压缩后的潜空间长得很像,但本质完全不同:小波变换没有任何学习参数、可逆、零重建误差,而且天然按频带组织了信息——低频在一条固定通路上直接传给解码器,模型只需要专注于恢复那些被量化破坏的高频系数。
小波域残差建模公式
模型预测的是缩放后的残差系数x:先用H²(y)算出干净图像的小波系数,减去压缩图像的小波系数h_c,再乘以缩放因子s=16。这样的好处是,输入里还能用的低频信息直接通过跳跃连接到达输出端,模型不需要重新"画"整张图,只需专注于补全被压缩抹掉的那部分高频细节。论文把这称为"干净残差预测"(clean residual prediction),配合上LPIPS感知损失直接对解码后的图像做约束,从训练信号层面把生成质量往感知友好方向上推。

MeanFlow目标:一步到位的生成式修复

传统的修正流(Rectified Flow)模型,训练时学习的是瞬时速度场,推理时要用数值积分器(比如欧拉法)一步步从噪声走到数据。步数少了质量崩,步数多了速度慢。而MeanFlow的核心思路,可以直接类比成"从A到B的直线高铁":既然知道出发点和目的地,那就不必每站都停靠,直接学一个"平均速度",一个区间只走一步。
条件流路径及速度定义公式
形式上,给定干净残差x和高斯噪声ε,论文用线性插值构造了一条从噪声到数据的路径z_t,速度v_c = ε − x。Rectified Flow回归的是瞬时速度,推理时必须小步积分;MeanFlow则改为学习区间[r, t]上的平均速度u,使得整个区间可以被一步跨越——因为流量路径是线性的,平均速度恰好是连接两端点的直线斜率。
平均速度定义公式
更关键的是MeanFlow恒等式,它建立了瞬时速度与平均速度之间的关系。训练时不需要教师蒸馏,网络自己预测的干净残差就能转换成平均速度,再通过一个精确的雅可比向量积(JVP)计算校正项,让训练收敛更稳定。这里解释一下JVP(Jacobian-vector product,雅可比向量积):它表达的是"沿着某个切线方向,网络的输出会变化多少",有点像个"定向导数"。论文用分段JVP的方式,把前向传播切成若干段,每段只保留本段的切线计算图,既保住数值精度,又把训练显存从15.75 GiB压到6.16 GiB。
网络预测残差与平均速度转换公式
网络的最终目标函数是三部分加权求和:MeanFlow损失、LPIPS感知损失、以及JPEG质量因子回归损失。最后一项很有意思——网络内部有一个"质量头",自动估计输入图像的压缩严重程度,并把它作为调制信号,指导后续的修复强度。这意味着推理时完全不需要用户手动输入压缩参数,模型自己就能"看"出来这张图被压得多狠。
总损失函数公式
推理阶段就更是清爽利落:不需要ODE求解器,不需要反复迭代,只需要按照采样公式做一次或两次网络评估就完事。论文测试了两种配置:"uniform-2"把[1,0]区间分成两段各走一步,质量最好;"direct-1"直接从1跳到0,速度最快。
MeanFlow采样更新公式

RELA线性注意力:高分辨率下的效率突破

模型骨干用的是SANA风格的线性DiT(Diffusion Transformer):16个Transformer块、隐层宽度576、18个注意力头、MLP膨胀比2.5。图像经过两层级Haar变换和2×2 Patch化之后,token数变成H/8 × W/8。对于1024×1024的输入,这就是128×128=16384个token。如果用标准全注意力,注意力矩阵是N×N规模,图像边长翻倍意味着输入像素变为4倍、注意力计算量直接变16倍——在修复任务里这是不可接受的。
线性注意力通过改变矩阵乘法的结合顺序,把复杂度降到线性。但它有个臭名昭著的毛病:秩崩溃。简单说,线性注意力生成的注意力图,其秩被限制在注意力头通道维度以内,导致表达能力不足,尤其不利于图像修复这种需要精细局部特征的任务。本论文采用了RELA(Rank-Enhanced Linear Attention,秩增强线性注意力),在标准线性注意力旁边并行加了一条5×5深度卷积分支,给模型提供一条局部的、潜在满秩的特征通路,代价只是少量参数和计算。
RELA秩增强线性注意力公式
公式里前半部分就是标准的线性注意力,φ是ReLU激活函数;后半部分DWConv 5×5就是对V通道做深度卷积。这条卷积分支虽然感受野只有5×5,但它保证了局部特征的多样性,跟SODiff那套"慢工出细活"的完整潜空间管线形成了鲜明对比。
除了注意力机制本身,论文在训练效率上还做了两手准备。一个是"质量头":在前3个DiT块之后做全局平均池化,再接一个小MLP,输出对压缩严重程度的估计,然后把这个估计值嵌入到后续13个块的间隔嵌入里。另一个是"分段JVP":把整个前向网络切成若干段,每段单独算一次精确JVP并立刻释放中间切线图,从而大幅压低训练内存。论文在Table 6里验证了这个实现和标准torch.func.jvp的数值一致性:切线方向的相对均方根误差和余弦相似度都表明两者几乎一致,而训练损失差值在10⁻⁷量级——说明内存优化是"无损"的。

实验结果:质量-效率前沿的重新定义

评估环节选用了LIVE-1、Urban100、DIV2K-val三个公开数据集,在JPEG质量因子QF=5、10、20三档压缩强度下做全图推理(不做切片拼贴)。全图推理是个值得点赞的细节,因为很多方法用滑动窗口切片,会出现重叠、拼接伪影,而全图评估能反映真实部署时的表现。
表1:JPEG质量因子5、10、20下的全图定量对比,最优结果加粗,次优结果加下划线。对比数据来自SODiff,DiffBIR*表示其JPEG修复重训练版本。
先看感知质量指标LPIPS(Learned Perceptual Image Patch Similarity,学习感知图像块相似度)。这里解释一下:LPIPS越低,表示修复结果与参考图在感知上越接近,它是目前生成式修复最看重的一个指标。本方法在LIVE-1的QF 10上追平SODiff,在QF 20上大幅领先——LPIPS相对SODiff降低了25.9%;Urban100的QF 10和QF 20分别降低6.5%和36.4%;DIV2K-val上QF 10降低2.1%、QF 20降低23.2%。在三组数据集的QF 20上全部拿下最优LPIPS。
但这份成绩单不是全科满分。在QF 5这种"往死里压"的场景下,SODiff凭借十亿级预训练先验,LIVE-1 LPIPS从本方法的0.2864压到了0.2229,差距肉眼可见。在DISTS(Deep Image Structure and Texture Similarity)这个更强调纹理真实感的指标上,SODiff也全面占优。这其实完全符合预期:6532万参数从零训练的小模型,不可能凭空变出十亿参数大模型从海量图文数据里学到的语义和纹理知识。
表2:LIVE-1上流目标与推理更新次数消融。Mean Flow和Rectified Flow使用相同的65M参数RELA DiT家族和可比的训练预算,各QF下最优加粗、次优加下划线。
表2的消融实验更有意思:同样是65M参数的RELA DiT骨干,MeanFlow用2次网络评估,LPIPS在所有QF上都优于需要20到100次评估的修正流求解器。而且欧拉法从20步加到50步,LPIPS反而变差,说明数值积分误差不是唯一瓶颈,平均速度的"学习"本身更高效。第二个MeanFlow更新在QF 10和QF 20分别带来22.3%和31.5%的LPIPS下降,但QF 5只降6.6%——再次印证了一个判断:第二大步主要是在"精修"输入中尚存的可恢复纹理,而不是无中生有地编造被量化彻底抹掉的细节。
表3:1024×1024单 batch 修复的系统级效率对比。NFE为修复网络评估次数,延迟包含编码与解码时间。
表3把效率摆到台面上。同样在1024×1024、单卡RTX 3090、batch size为1的条件下,本方法延迟0.1242秒、吞吐量8.05张/秒;SODiff延迟0.610秒、吞吐1.64张/秒。对SODiff的4.9倍吞吐优势是跨论文比较,不是同环境实测,但考虑到参数量的巨大差异(65.32M对1288M),这个对比依然很有说服力。更值得注意的是,本方法比轻量级回归模型FBCNN还要快2.2倍——FBCNN只有70.1M参数,但它没有像本方法那样精心设计可逆小波表示和线性注意力,说明"生成式"和"慢"并非天生绑定。
这里得插一句公道话:一个"单步"模型不等于一个"高效"模型。SODiff虽然只跑一次去噪UNet,但它前后还挂着大VAE编码器、解码器和语义条件提取器,整套管线跑下来照样慢。真正的系统效率要看端到端延迟,而不是盯着采样步数这个单一指标。这给整个领域提了个醒:架构设计上的"轻装"比单纯减少步数重要得多
621df26778f05KkH
架构扩展性的对照实验也值得看一眼。作者在同样的两层级Haar域、同样的BF16精度和同样的RTX 3090环境下,对比了Restormer、SANA线性DiT、RELA DiT和标准全注意力DiT(后三者参数量在64M到67M之间)。
图2左:受控单次前向扩展对比,吞吐量随分辨率变化。 图2右:受控单次前向扩展对比,峰值内存随分辨率变化。 表4:单次前向的原始架构基准数据,所有模型使用batch size 1、BF16、两层级Haar表示、PyTorch eager执行、单张RTX 3090。
随着分辨率从512、1024一路升到2048,RELA DiT的吞吐量始终保持在第一梯队,而全注意力DiT在2048分辨率下注意力计算量爆炸式增长,吞吐和内存双双恶化。RELA的深度卷积分支在保持线性复杂度的同时,把秩崩溃的短板补上了——这是它能兼顾速度和质量的底层原因。
图3:JPEG修复效果可视化对比,从左到右依次为JPEG压缩输入、本方法修复结果、参考原图。
可视化对比也印证了数值结果:在中等压缩下,模型能把建筑物的边缘、密集纹理恢复得干净利落,观感上跟原始参考图已经很难分辨;但在极端压缩下,局部区域还是会丢失一些细碎纹理。另外,CLIPIQA这种语义对齐型无参考指标上,本方法在Urban100和DIV2K-val的每个QF都拿到最优,说明即便纹理统计不完全贴合自然图像分布,语义层面的合理性依然保持得不错。

局限与展望:小型模型的边界与未来

这篇论文最诚实的地方在于,它没有试图掩盖小模型的短板。论文开篇就把自己的定位讲清楚了:这是一个实用的帕累托点,而不是追求极限生成质量的替代品。QF 5的极端压缩下,SODiff的优势非常明显;DISTS和MANIQA这些跟高级语义、物体纹理强相关的指标,也是大模型们的天下。一个从零训练的小模型,不可能平白继承几十亿图文对里沉淀的世界知识。
但换个角度看,这篇论文指明了一条值得深耕的方向:在可逆小波表示下做条件生成,是一个"性价比"极高的设计选择。零参数的可逆变换替掉了VAE,省掉的不仅是延迟,还有训练VAE的隐性成本;MeanFlow把采样步数压缩到1到2步,让生成式修复第一次在端侧设备上有了落地可能性。后续工作可以在QF 5这类极端退化上做文章,比如把大模型蒸馏到小模型上、引入外部知识库、或者用混合架构在不同压缩强度下自动切换工作模式。65M参数的"轻骑兵"未必不能跟13亿参数的"重装甲"掰掰手腕,只是还需要一点时间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文用两层可逆Haar小波变换替代VAE,结合RELA线性注意力DiT与改进MeanFlow目标,训练出65.32M参数的JPEG生成式修复模型。
这篇工作最值得看的点是什么?在LIVE-1、Urban100、DIV2K-val上QF 10和20达到最低LPIPS,QF 20时比SODiff降低23-36%的LPIPS;吞吐量比SODiff高4.9倍,参数少19.7倍;但在QF 5和DISTS、MANIQA等指标上不如SODiff。
这篇工作的边界或风险在哪里?优点:1)可逆小波变换替代VAE,无重建误差和额外延迟;2)MeanFlow目标支持1-2步推理无需蒸馏;3)RELA线性注意力实现高效高分辨率处理;4)内存高效的精确JVP实现。缺点:1)缺乏大规模预训练先验,在严重压缩(QF 5)下质量明显下降;2)DISTS和MANIQA等指标不如大模型;3)训练数据规模有限(仅13,450张图像)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆小波域+MeanFlow+RELA的组合本身不是单点突破,但整体集成思路很有新意,把"可逆表示替代VAE"这条路走通了。

实验合理度:★★★★☆数据集覆盖全面、全图推理协议干净,跟SODiff的对比虽然不是同环境实测,但作者如实标注了跨论文比较,态度值得肯定。

学术研究价值:★★★★☆展示了一条轻量级生成式修复的新路线,对后续端侧图像恢复研究有明确参考价值。

稳定性:★★★☆☆QF 10和QF 20下表现稳定,但QF 5下跟SODiff差距明显,生成结果也带有随机性,产品化前需要仔细评估。

适应性以及泛化能力:★★★★☆三个数据集、三档压缩强度、多种分辨率下都有不错表现,但方法目前只针对JPEG修复,是否适配其他退化类型还需验证。

硬件需求及成本:★★★★★单张RTX 3090完成全部训练,推理延迟124毫秒,这个成本门槛几乎可以说是"亲民"了。

复现难度:★★★★☆方法描述详细,训练策略清晰,单卡可训练,但论文未提供开源代码和预训练权重,复现仍需一定工程量。

产品化成熟度:★★★☆☆推理效率足够支撑端侧部署,但QF 5下的质量短板、无参考指标偏弱以及缺乏完整部署工具链,是产品化路上的主要障碍。

可能的问题:SODiff吞吐量是跨论文间接对比,非同环境实测;QF 5下与SODiff差距明显;DISTS和MANIQA偏弱,说明深度语义先验仍是小模型天花板;未开源代码,影响社区验证。


主要参考文献

[1] L. Zhang et al., SODiff: One-step JPEG Restoration via Pretrained Stable Diffusion, 2025.
[2] X. Li et al., DiffBIR: Generative Blind Image Restoration in Fast Diffusion Models, 2023.
[3] Y. Yu et al., Scaling Up to Excellence: A Practical Model for High-Quality Image Restoration, 2024.
[4] J. Chen et al., MeanFlow: A Single-Step Generative Model via Mean Velocity, 2025.
[5] Y. Zhou et al., JiT: Direct Clean-Image Prediction for Diffusion Models, 2025.
[6] K. Zhang et al., SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer, 2025.
[7] Q. Wang et al., RELA: Rank-Enhanced Linear Attention for Vision Transformers, 2025.
[8] 原文链接:https://arxiv.org/pdf/2608.28730v1.pdf

融会贯通

结合PaperDaily已收录论文的情况来观察,可以注意到近年来图像复原领域呈现出两条并行演进的趋势:一条是继续堆参数、引入更强的预训练先验,走"质量极致"路线;另一条则是像本论文这样,在表示空间和采样策略上做减法,走"效率极致"路线。本文属于后者中设计完成度较高的一支:可逆小波表示替代VAE、MeanFlow把采样压到两次评估、RELA线性注意力解决高分辨率下的复杂度瓶颈,三个决策环环相扣,最终把生成式修复拉进了每秒8帧的实用区间。
需要向读者说明的是,本文的对比数据主要来自论文自报结果,PaperDaily当前收录的同基准独立复现样本还不够充足,暂无法对LIVE-1、Urban100、DIV2K-val上的LPIPS优势做交叉验证。不同论文的评估协议(如是否全图推理、是否使用相同裁剪策略)可能存在差异,解读这些数字时建议留一点余地。本文方法的实际领先幅度,还需要后续开源代码和第三方复现来进一步确认。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球