← 返回 PaperDaily
视觉与图像
NTU新方法:LoRA做可变速率图像压缩,参数只增0.2%
可变速率图像压缩的老问题很现实:想要多个码率,就得养多套模型,存储和训练成本都不太讲武德。这篇论文把 LoRA 塞进深度图像压缩网络,做到训练时只动很少参数,推理时还能和主干合并,思路很干净,工程味也很足。
龙哥读论文
发布于 2026-08-14 21:47:09
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 可变速率图像压缩的老问题很现实:想要多个码率,就得养多套模型,存储和训练成本都不太讲武德。这篇论文把 LoRA 塞进深度图像压缩网络,做到训练时只动很少参数,推理时还能和主干合并,思路很干净,工程味也很足。
原论文信息如下:
01. 什么是可变速率图像压缩,现有方法为何代价高昂?
先把话说人话:可变速率图像压缩 ,就是同一个压缩模型要能按需输出不同“压缩档位”。有时要更清晰一点,有时要更省空间一点,像相机里的“高清”“均衡”“省流量”模式,只不过这里不是手机按钮,而是神经网络在算。
传统深度图像压缩通常靠一个拉格朗日乘子 λ 来控制率失真权衡。简单理解,λ 越大,模型越偏向“保画质”;λ 越小,模型越偏向“省比特”。问题来了:如果想支持多个码率,很多方法要么训练多套模型,要么在一个模型里塞进额外的条件分支、仿射变换、全连接层,结果就是训练、存储、推理三头一起涨。
这篇论文盯住的就是这个老问题:多码率支持 到底能不能别再“养一堆模型”?作者的目标很明确——让一个主干模型先学会压缩,再用极少参数适配不同目标码率,而且推理时不要再额外加负担。说白了,训练阶段可以折腾,部署阶段别添乱。
现有可变速率方法大致分三类。第一类是多模型方案 ,每个码率一个模型,效果稳,但存储和训练成本太高,像给每个档位都配一台独立发动机。第二类是单模型条件控制 ,通过条件编码或仿射变换让一个模型适配多个码率,省模型数了,但常常要付出额外结构复杂度,甚至带来性能波动。第三类是渐进式学习 ,先学一个基准模型,再逐步适配不同码率,思路比硬拼多个模型更聪明,但关键在于:怎么让“适配”这件事足够轻。
这就是 LoRA 出场的地方。它原本在大语言模型微调里很火,核心逻辑是:别直接改大矩阵,改一个低秩增量就行 。论文把这套思路搬到图像压缩里,属于“跨界但不乱来”的典型。
02. LoRA如何实现高效参数微调?
LoRA 的全称是 Low-Rank Adaptation ,中文一般译作低秩适配 。它的思路很朴素:一个大权重矩阵 W 本来很难整体重训,那就给它加一个低秩更新量 ΔW,而且 ΔW 只由两个小矩阵相乘得到:ΔW = B·A。这样训练时只更新 A 和 B,主干参数冻结不动。
它为什么省?因为原来一个大矩阵要学成千上万的参数,现在只学一个“瘦身版”的增量。它为什么快?因为训练时更新的参数少,梯度也少;推理时更狠,低秩增量还能并回原权重 ,所以推理速度不额外变慢。这个“训练时加戏、推理时合并”的设计,正好适合压缩模型这种对部署效率很敏感的任务。
论文里用到的 LoRA 不是只挂在一个位置,而是作为一个Rate-Adaptive Module ,简称 LoRAM。这里的 Rate-Adaptive Module 可以理解成“码率自适应模块”,它不是单纯给模型打补丁,而是专门服务不同 λ 的适配。也就是说,主干先学通用压缩能力,后面每个目标码率只训练一组轻量 LoRA 参数。
这里还有一个容易忽略但很重要的点:LoRA 的初始化通常让 ΔW 一开始接近 0,这样不会破坏已经训练好的主干。换句话说,适配不是“推倒重来”,而是“在原模型身上做微创手术”。这也是它能稳定工作的关键之一。
03. 基于LoRA的渐进式可变速率压缩框架是如何设计的?
先看整体流程。论文不是从零发明一个全新压缩器,而是基于两套已有强基线:WACNN 和 STF 。前者是 Window-Attention CNN,后者是 Symmetrical TransFormer。两者本来就是 learned image compression 里比较强的骨架,论文的做法是在这些骨架上插入 LoRAM,让它们支持不同码率。
整个框架可以拆成两步。第一步,先用一个目标 λ0 训练主干网络,把基础压缩能力学扎实。第二步,冻结主干,只为不同的目标 λi 训练对应的 LoRAM 参数。这样做的好处很直接:主干不需要为每个码率重复训练,新增码率只需要保存少量 LoRA 参数。
更具体一点,WACNN 里有编码器、解码器、超先验编码器、超先验解码器和熵模型;STF 里则把 LoRA 放进 window attention、shifted window attention 和 MLP 等线性层。作者没有把所有层都改掉,而是优先改浅层和关键线性层。原因也不玄学:浅层更接近图像细节,少量参数变化就可能影响重建质量;而线性层是 LoRA 最擅长“动刀”的地方。
论文里还有一个很实用的设计:训练时分码率学习,推理时直接合并权重 。这意味着不同目标码率对应不同的 LoRAM 参数,但真正上线压缩/解压时,不需要额外跑一套“适配网络”。这点对工程部署很友好,毕竟没有哪个线上系统喜欢额外延迟。
在损失函数上,本质仍然是经典的率失真优化:总损失 = 码率 + λ × 失真 。这里的码率包含主潜变量和超潜变量的熵编码开销,失真通常用重建图像和原图之间的差异衡量,实验中主要看 PSNR。作者没有在目标函数上搞花活,而是把创新点放在“怎么高效适配多个 λ”上,这比硬改损失函数靠谱得多。
从实现角度看,这套方法的逻辑是:先有一个强主干,再用 LoRA 给每个码率一个轻量“分身”。主干负责通用能力,LoRA 负责码率适配。这样一来,训练成本、存储成本和推理成本就被拆开处理,不再是一锅粥。
04. 实验效果如何?效率提升显著吗?
这部分最关键的问题其实就两个:画质掉没掉 ,以及省了多少成本 。如果只省参数不保效果,那就是“省得很努力,结果没法用”;如果效果不错但训练太贵,那也只是把成本从一边挪到另一边。
先看效率。论文给出的数字很直接:LoRAM 只需要大约1% 左右的额外参数 ,训练数据只用原来的约 10%,训练步数从 180 万步降到 4 万步。这个缩减幅度非常实在,不是“优化了一点点”,而是把变量速率适配从重训练变成了轻量微调。
再看率失真表现。作者在 Kodak 和 CLIC2020 上做了对比,和 WACNN、STF、Cheng 等方法以及 JPEG、VTM 这些经典编码器相比,整体表现是接近强基线,明显优于传统 JPEG,并能接近 VTM 的 PSNR 。这说明 LoRA 不是靠“牺牲性能换效率”,而是在效率提升的同时把画质守住了。
这里最值得注意的是,论文没有只盯着 PSNR 这种“看起来很硬”的指标,还额外看了下游分类任务。方法把压缩后的图像送进预训练 ResNet18,再看 ImageNet 子集上的 Top-1 和 Top-5 准确率。结果显示,LoRAM 微调后的模型和单独训练的模型很接近,说明压缩不是只在像素层面好看,下游语义也没有被明显搞坏。
不过也别把结果吹成“完美无缺”。论文自己也提到,在 CLIC 这类与训练分布存在差异的数据上,WACNN 的表现会有轻微退化;这说明 LoRA 虽然高效,但它仍然依赖主干能力和训练数据覆盖范围。换句话说,它不是魔法棒,还是得看骨架本身够不够强。
05. 总结与展望:该方法的优缺点和未来方向
这篇工作的价值,不在于重新发明图像压缩,而在于把一个老问题——多码率适配的高成本 ——处理得更像工程方案。它没有把结构搞得很花,而是借助 LoRA 的低秩更新能力,把“多模型训练”变成“主干 + 轻量适配器”的组合,逻辑清楚,代价也低。
优点很明显。第一,训练和存储成本大幅下降 ,这对需要覆盖多个码率的业务很友好。第二,推理阶段几乎零额外开销 ,合并权重后部署压力不大。第三,实验不只看压缩指标,还看下游分类任务,说明作者知道压缩不是只给人眼服务,还可能给机器视觉系统服务。
缺点也得讲。它本质上还是建立在已有强基线之上,创新更偏向参数高效适配 ,而不是在压缩理论或网络结构上做了革命性变化;另外,对于分布偏移更强、图像尺寸变化更大的场景,效果是否稳定还需要更多验证。再往前走一步,未来可以考虑把 LoRAM 做成更细粒度的码率控制器,或者结合内容感知策略,让“同一个码率”在不同图像内容上也能更聪明地分配比特。
如果把这篇论文放到实际系统里看,它最适合的场景不是那种极端追求极限画质的专用链路,而是需要同时管理多档压缩、又不想维护多套模型 的业务,比如云端图片存储、移动端上传、边缘设备传输和多任务视觉前处理。简单说,适合“既要又要还不要太贵”的场景。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“可变速率图像压缩要为多个码率训练多套模型,成本太高”的问题。作者用 LoRA 做轻量适配,让一个主干模型通过少量参数就能支持多个目标码率。
LoRAM 是什么? LoRAM 是 LoRA Rate-Adaptive Module,中文可以理解为“基于低秩适配的码率自适应模块”。它把 LoRA 插到压缩网络的关键线性层里,训练时只更新低秩增量,推理时再与主干权重合并。
为什么它能省很多成本? 因为主干模型只训练一次,不同码率只需要保存少量 LoRA 参数;同时训练数据和训练步数也大幅减少。更关键的是,推理时可以把 LoRA 合并回原权重,所以不会额外增加部署延迟。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆ 不是从零造一个新压缩器,而是把 LoRA 迁移到可变速率图像压缩里,属于“聪明的工程创新”,新意主要体现在参数高效适配思路。
实验合理度: ★★★★☆ 对比了强基线、传统编码器和下游分类任务,验证维度比较完整;不过部分结果仍依赖已有骨架,分布外泛化还需更多测试。
学术研究价值: ★★★★☆ 把参数高效微调和图像压缩结合起来,方向是有启发性的,尤其适合后续继续做多码率、可控压缩和轻量部署。
稳定性: ★★★☆☆ 合并权重后推理稳定性不错,但方法仍依赖主干和训练分布,遇到更大分布偏移时未必同样稳。
适应性以及泛化能力: ★★★☆☆ 在 Kodak、CLIC 和 ImageNet 子集上都做了验证,说明基础适应性可以;但跨数据分布的鲁棒性还不是满分答案。
硬件需求及成本: ★★★★☆ 训练和存储成本压得很漂亮,推理阶段也几乎不加负担,适合对资源敏感的场景。
复现难度: ★★★☆☆ 思路不复杂,但要复现完整率失真曲线和下游任务,仍需要较完整的训练管线与数据准备。
产品化成熟度: ★★★★☆ 如果已有压缩主干,这套方法很容易作为可变速率扩展模块落地;单独从零部署则还需要做更多场景验证。
可能的问题: 创新点偏参数高效适配,理论突破不算强;对分布偏移的鲁棒性与不同骨架的一致性,还需要更充分的实验支撑。
主要参考文献
[12] Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:2106.09685 (2021)
[32] Zou, R., Song, C., Zhang, Z.: The devil is in the details: Window-based attention for image compression. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 17492–17501 (2022)
[7] Choi, Y., El-Khamy, M., Lee, J.: Variable rate deep image compression with a conditional autoencoder. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 3146–3154 (2019)
[24] Qin, S., Zhou, Y., Wang, J., Chen, B., An, B., Dai, T., Xia, S.T.: Progressive learning with visual prompt tuning for variable-rate image compression. arXiv preprint arXiv:2311.13846 (2023)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群