← 返回 PaperDaily
视觉与图像
图像压缩新范式:纯INR路线也能做到清晰无伪影,PaaF给出答案
图像压缩领域又出新招,这次来自意大利卡塔尼亚大学的团队,把纯粹的隐式神经表示(INR)玩出了新高度。他们提出的PaaF,用一套自适应量化和自调制激活函数,让INR图像压缩在感知质量上大杀四方。LPIPS相比最强基线NIF再降39%,低码率下的细节还原更是甩开对手几条街。纯INR路线原来还藏着这么大潜力!
龙哥读论文
发布于 2026-08-14 21:47:10
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 图像压缩领域又出新招,这次来自意大利卡塔尼亚大学的团队,把纯粹的隐式神经表示(INR)玩出了新高度。他们提出的PaaF,用一套自适应量化和自调制激活函数,让INR图像压缩在感知质量上大杀四方。LPIPS相比最强基线NIF再降39%,低码率下的细节还原更是甩开对手几条街。纯INR路线原来还藏着这么大潜力!
原论文信息如下:
揭秘高效INR图像压缩:PaaF如何突破性能瓶颈?
要说图像压缩,大家第一反应可能是JPEG、WebP、AVIF这些经典编码器。但近年来,一股清流正在崛起——隐式神经表示(Implicit Neural Representations, INR) 。简单说,就是用一个神经网络把图像“背”下来:输入像素坐标,输出RGB值。这样图像内容就和分辨率解耦了,还能任意分辨率渲染。听起来很美好,但INR压缩一直有两个硬伤:一是编码时间动辄几小时,二是在PSNR等传统指标上跟学习型编解码器差距不小。
意大利卡塔尼亚大学的团队这次带来了新方案——PaaF(Picture as a Function) ,一套纯INR图像编解码器。它的核心思路是:不跟传统方法硬刚PSNR,而是主打感知质量,同时通过一系列巧妙设计把INR的潜力彻底释放。结果如何?LPIPS相比最强基线NIF再降39%,低码率下细节还原画面干净得像换了张图。
PaaF的整体压缩管线如下面的图所示。输入图像先做颜色空间转换和均值偏移,再通过像素重排(unshuffling)把高分辨率切分成多个低分辨率样本,加速训练。然后进行迭代拟合,每一轮结束后用最快拟合选择最优量化配置,再进行量化感知微调,最后用熵编码压缩参数。
这条管线相比前作NIF有三大改进:自适应量化、指数配置、自调制SIREN激活。接下来我们逐个拆解。
核心创新一:自适应量化与指数配置,告别固定比特位
量化是压缩的关键步骤——把浮点数映射成离散整数。传统做法固定用b位(比如8位)量化,能表示的符号数是2^b个。但研究发现,训练后的权重分布接近拉普拉斯分布 ,也就是说大部分值集中在0附近,只有少数是大的。固定比特位浪费了表示能力:符号数必须是2的幂,但实际最优符号数可能不是。
PaaF的自适应量化 方案创新地引入了两个关键参数:符号数指数e(M=2^e)和尺度因子s,其中s基于权重的标准差自适应调整。量化与反量化的公式如下:
这个公式中,尺度因子s = 1 ± σ/√2(σ是标准差),用于根据权重分布的分散程度调整量化步长——分布越宽(σ越大),s越小,量化精度在高值区域更精细;分布越窄(σ越小),s越接近1,量化更均匀。M不限于2的幂,因此比传统固定比特位能更灵活地平衡比特率和失真。
最优e通过二分搜索获得,搜索目标是最小化率失真代价。增益函数g(e)定义如下:
自适应量化在训练的最后阶段执行:先用一个快速拟合样本选择最佳e,再对整个网络进行量化感知微调。这比固定比特位量化(如6位、12位)在每个码率点都更优,消融实验也证实了这一点(后面会看到)。
除了量化,PaaF还引入指数配置 来自动设定网络形状、瓶颈深度等超参数。公式如下:
这样的指数衰减使得深层网络形成自然的瓶颈,在不牺牲质量的前提下压缩参数量,提升了比特率效率。
核心创新二:自调制SIREN激活,简化架构提升效率
INR的激活函数是决定表达能力的关键。传统SIREN(Sinusoidal Representation Networks)使用正弦激活,权重初始化时通过ω₀控制周期。但SIREN为了进一步提升表示能力,通常需要额外引入一个调制网络来调整每个特征的频率和相位,这增加了计算量和参数。
PaaF提出自调制SIREN ,彻底消除了辅助网络。核心思想是:相位和周期不是通过网络学习,而是通过确定性采样得到。具体地,对于每个输出特征,相位φ_i和周期ω_i由以下公式生成:
这些非学习参数可以在编码器和解码器之间通过共享伪随机数生成器(pseudo-RNG)种子来重建,完全不需要传输。因此,每个特征激活的输出为:
自调制层的架构和整体网络结构如图2所示。网络由坐标编码、多层MLP(每层后跟自调制SIREN)、尾部层和后处理滤波器组成。注意解码器与编码器共享相同架构,因此解码时只需要解压参数、逐像素向前推理即可,完全并行。
简洁的设计让PaaF的解码非常高效——单次前向传播即可输出像素值,不再需要NIF那样的调制网络,整体参数量和计算量都降低了。
全面超越:定量与定性实验证明PaaF的卓越性能
团队在Kodak和CLIC2020两个标准数据集上进行了评估,对比了COIN、ICE、Strümpler、NIF等纯INR方法,以及JPEG作为传统参考。评价指标包括PSNR、MS-SSIM和LPIPS(感知质量度量)。定量结果如图3所示。
从图中可以直观看到,PaaF在所有指标和码率上都超越了其他纯INR方法。特别是在LPIPS(感知相似度)上,优势非常明显——在Kodak数据集上,相对最强基线NIF的BD-LPIPS降低了39.07%。在CLIC2020高分辨率数据集上,PaaF的LPIPS优势更加突出,码率降低幅度达到51%到87%。下表给出了具体的BD-Rate增益:
消融实验进一步证明了每个组件的作用。下表展示了自适应量化方案和损失函数的消融结果:
消融实验表明,自适应量化相比任何固定比特位量化都有优势,尤其是在高码率时,固定6位和12位量化明显劣势。损失函数方面,PaaF采用的LogCosh+SSIM组合(Visual预设)和L1+SSIM组合(MS-SSIM预设)在LPIPS指标上全面优于纯L2或L2+SSIM的组合。
定性对比更直观。图4展示了CLIC2020数据集上一些细节丰富的图像。JPEG在低码率下出现严重的颜色锯齿;COIN和Strümpler无法表示高频细节(如墙壁边缘、砖块纹理);NIF虽然好一些但仍有模糊和波浪伪影。PaaF的Visual预设即使在极低码率(0.08~0.10 bpp)下也能忠实还原树叶和光线形状,伪影最少。
看这效果,是不是有一种“终于有人把INR的感知质量提起来了”的畅快感?🤚(此处应有掌声)
未来展望:INR图像压缩的潜力与挑战
PaaF证明了纯INR路线在感知质量上完全可以做到“赏心悦目”,且解码效率极高(仅需一次前向传播)。但目前最大的瓶颈在于编码时间——每张图像都需要单独训练。虽然可以通过像素重排和快速拟合来加速,但相比传统编码器仍有数量级差距。未来方向包括:计算优化(如更好的初始化、元学习)、以及大规模主观实验来验证感知质量。另外,将INR与混合编码结合可能也是一个值得探索的方向。
总的来说,PaaF让INR图像压缩从“有趣但不太实用”向着“可以一用”迈进了一大步。如果你对INR压缩感兴趣,这篇工作绝对值得细读——代码即将开源。
龙迷三问
PaaF的“PSNR预设”和“Visual预设”到底有什么区别? PaaF支持三种预设:PSNR预设使用LogCosh损失函数(一种稳定的PSNR近似),并针对PSNR指标优化自适应量化;MS-SSIM预设使用L1+SSIM损失,针对MS-SSIM优化量化;Visual预设使用LogCosh+SSIM损失,与NIF的损失一致,旨在平衡PSNR和感知质量。实验表明Visual预设的LPIPS指标最好,PSNR预设的PSNR最高。
INR图像压缩相比传统编解码器(如JPEG、AVIF)有什么根本优势? INR将图像表示为函数,天然支持任意分辨率渲染(比如4K图像压缩后可以解码出8K),不需要像传统方法那样在编码时固定尺寸。此外,INR解码可以高度并行(每个像素独立推理),适合GPU加速。缺点是编码时间较长,且纯INR的PSNR指标仍低于基于CNN或Transformer的学习型编解码器。
自适应量化中的“二分搜索”具体怎么操作的? 论文中在算法流程里给出了详细步骤:先在一开始给定的范围[e_l, e_r]内采样N个e值,依次计算每个e下的率失真代价(通过快速拟合和量化),选出最好的一个e_b和第二好的e_s。如果|e_b - e_s|小于预设精度p,则返回e_b;否则在新的区间[e_b, e_s]上重复搜索。由于率失真函数在e上近似凸函数,二分搜索能快速找到最优解。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
自适应量化和自调制SIREN是新颖的改进,尤其是将量化从固定比特位解放出来,思路值得肯定。整体属于增量式创新,但组合效果好。
实验合理度: ★★★★★
对比方法选择了所有主流的纯INR方法,且在Kodak和CLIC2020两个标准数据集上评估,指标全面(PSNR、MS-SSIM、LPIPS)、消融完整,结果令人信服。BD-Rate计算也遵循了最新标准。
学术研究价值: ★★★★✰
对纯INR压缩的设计空间进行了深入探索,提出的组件可以推广到其他INR任务。虽然PSNR提升有限,但感知质量的显著提升为INR压缩指明了新方向。
稳定性: ★★★✰✰
编码过程涉及超参数搜索和多次训练,对初始化敏感。解码端稳定,但整体稳定性一般,需要针对每张图像调参。
适应性以及泛化能力: ★★★✰✰
当前方法仅针对图像压缩,可扩展到视频或3D场景(但需修改)。在自然图像上表现良好,但对医学图像等特殊数据集的泛化未验证。
硬件需求及成本: ★★★✰✰
训练时需要GPU,但解码只需CPU或简单GPU推理,效率较高。编码时间仍较长(每图数分钟到十几分钟),不适合实时场景。
复现难度: ★★★★☆
论文详细描述了所有设计,代码即将开源,复现难度中等。自适应量化的二分搜索实现可能需要一些调参。
产品化成熟度: ★★✰✰✰
目前仍处于学术研究阶段,编码时间太长使得产品化困难。但解码端表现优异,如果未来能解决编码速度,有潜力应用于点播场景。
可能的问题: 论文并未与最近的学习型编解码器(如基于熵模型的方法)直接对比,虽然作者声明只限纯INR比较,但读者可能想知道与主流方法的差距到底有多大。另外,编码时间的量化对比缺失,建议补充“每图像编码耗时”的数据。
主要参考文献
[1] G. K. Wallace, "The JPEG still picture compression standard", IEEE Transactions on Consumer Electronics, 1992.
[2] E. Dupont et al., "COIN: Compression with Implicit Neural Representations", arXiv:2103.03123, 2021.
[3] Y. Strümpler et al., "Implicit Neural Representations for Image Compression", ECCV, 2022.
[4] L. Catania, D. Allegra, "NIF: A Fast Implicit Image Compression with Bottleneck Layers and Modulated Sinusoidal Activations", ACM Multimedia, 2023.
[5] V. Sitzmann et al., "Implicit Neural Representations with Periodic Activation Functions", NeurIPS, 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!