← 返回 PaperDaily
视觉与图像
澳门大学最新研究:对抗攻击1步就能防,白盒PSNR暴涨15dB
学习型图像压缩(LIC)性能虽猛,却怕对抗攻击——像素上加点人眼看不见的噪声,码率直接爆炸、画质稀碎。这篇澳门大学与南洋理工的最新研究发现了个反直觉的规律:攻破LIC要几百步,修复却只要1步!基于此提出的FTTR框架,在白盒攻击下把PSNR拉高近15dB,码率暴降6+。值得一读。
龙哥读论文
发布于 2026-09-03 00:20:02
阅读 29
查看原文
原论文信息如下:
引言
图像压缩是通信系统的关键一环。传统编码器 JPEG、H.265、VVC 都是手工艺人级别的精心调校,稳得一批。但近年来学习型图像压缩(Learned Image Compression, LIC)靠深度神经网络硬生生把率失真性能拉高了一大截,压缩效率直追甚至超越传统标准。
然而,成也神经网络,败也神经网络。DNN 天生就有对抗样本的毛病,LIC 系统自然也不例外。研究人员发现,只要在输入图像上加一层人眼根本察觉不到的微小噪声,就能把压缩系统的码率直接引爆,或者让重建图像花成一团。更糟的是,标准化的压缩系统要求技术细节全公开,攻击者完全可以在"白盒"条件下研究你、针对性地攻击你。
目前防御方案主要有两派:对抗训练派和测试时处理派。对抗训练虽然把漏洞补了一部分,但补丁本身可能引入新漏洞,攻击者针对训练后的模型继续优化,依然能绕过。测试时处理派里,有一种叫 TTR(Test-Time Refinement)的思路:在推理阶段直接对输入或潜在表示做梯度优化,用率失真损失把对抗噪声"洗"掉。
但 TTR 有个致命伤:慢 。每步都要走一遍完整的编码-解码反向传播,优化几十上百步才能收敛。论文发表机构澳门大学与南洋理工的合作团队,对这一方向做了首次系统性研究,结果挖出了一个宝藏性质。
他们发现,LIC 系统存在一个被称为「非对称对抗轨迹」(Asymmetric Adversarial Trajectory, AAT)的现象:生成一个有效对抗样本需要几百步迭代,但把它恢复成正常样本往往只要 1-2 步。 这就像攻破一座城堡要顶着箭雨爬墙三天三夜,结果发现城堡后门根本没锁,一脚就踹开了。
问题背景及相关工作
先铺垫一下 LIC 的基本玩法。一个典型 LIC 系统由编码器 E、量化器 Q 和解码器 D 组成。输入图像 x 先被编码器映射成潜在表示 y 和超先验潜在表示 z,经过量化后,解码器把量化后的潜在表示重建为图像 x̂。训练时用率失真损失拉平衡:码率越低越好、失真越小越好,中间用拉格朗日乘子 λ 权衡。
LIC 对抗攻击按照目标可以分三类:第一类是码率崩溃攻击 ,让压缩后的比特数爆炸式增长,存储传输直接瘫痪;第二类是重建失真攻击 ,细分为无目标失真(画面花掉)和有目标语义操纵(把画面内容改成攻击者想要的内容);第三类是下游任务攻击 ,压缩重建后的图像拿去喂给分类器,直接导致分类失败。
再看防御。主流方向是对抗训练 :把对抗样本混进训练集,让模型见过世面。但对抗训练是"打地鼠",补了东墙漏西墙,攻击者对训练后的模型再做自适应攻击,往往还是能绕过去。另一种思路是静态输入变换 :在编码器前加一个固定变换,再在解码端做逆变换,靠多个候选变换对比挑选损失最小的重建。这个方法在黑盒下有效,但白盒攻击者把所有候选变换都摸透了,还是能针对性生成对抗样本。
TTR 属于动态防御。它保持模型结构和参数完全不动,在测试时对输入图像或潜在表示做迭代优化,把对抗样本"洗"回良性区域。本质上,TTR 是拿推理时间换鲁棒性。但这带来三个问题:一是步数多导致开销大、不实用;二是它的鲁棒性机制没人从理论上讲清楚;三是已有评测只覆盖灰盒场景,白盒自适应攻击下表现如何完全未知。
惊人发现:对抗攻击的"单向通道"现象
论文用一个特别直观的实验展示了这一现象。他们用 PGD 攻击在 DCAE 模型上生成对抗样本,预算 16/255,400 步迭代;然后对对抗样本做 TTR 优化,用 Adam 优化器、不同的学习率跑 100 步。
先从上头这事儿说起。日常拍照片、传图片,背后全靠压缩算法撑场面。传统编码器 JPEG、H.265、VVC 都是工程师精心调校的产物,稳定可靠、行为可预期。但近几年学习型图像压缩(Learned Image Compression, LIC)靠深度神经网络强势崛起,压缩效率直追甚至反超传统标准。听起来很美,对吧?问题在于,深度神经网络天生带着对抗样本的"基因缺陷",LIC 系统也完美继承了这一点。
一个典型的 LIC 系统可以抽象成编码器 E、量化器 Q 和解码器 D 的复合:
研究对抗攻击的团队早就盯上了这条链路。目前已知的威胁可以分成三类:第一类是码率崩溃攻击 ,给图像加上微小噪声后,压缩输出的比特数直接爆炸,存储和传输成本飙到无法接受;第二类是重建失真攻击 ,细分又有无目标失真和语义操纵两种,前者让重建画面花成一团,后者直接篡改画面内容;第三类是下游任务攻击 ,压缩重建后的图像喂给分类器等下游模型,也会跟着翻车。
防御这边情况也不乐观。对抗训练是主流方案,把对抗样本混进训练集让模型"见见世面",但本质上是在打地鼠——补了东墙漏西墙,攻击者针对训练后的模型再做自适应攻击,照样能绕过。静态输入变换方案呢,在白盒攻击者面前也扛不住,因为所有候选变换都能被摸透。还有一类思路叫测试时细化 (Test-Time Refinement, TTR),模型结构和参数完全不动,在推理阶段对输入或潜在表示做梯度优化,把对抗样本"洗"回良性区域。思路是好的,但传统 TTR 要迭代几十上百步,每步都得走一次完整的编码-解码反向传播,计算开销大到没法落地。而且它为什么能防御、白盒攻击下扛不扛得住,之前完全没人说清楚。
这篇来自澳门大学与南洋理工大学合作的研究,就是来把这几个坑一次性填上的。
惊人发现:对抗攻击的"单向通道"现象
研究团队先用 PGD(Projected Gradient Descent,投影梯度下降)攻击在 DCAE 模型上生成对抗样本,预算 16/255,迭代 400 步。然后对对抗样本跑 TTR 优化,用 Adam 优化器、不同学习率迭代 100 步。结果出来,所有人都愣了一下。
不同学习率下,TTR 尽管最终都能收敛到接近的效果,但收敛速度天差地别。学习率大的时候,1-2 步就基本达到接近收敛的性能;学习率小的,则需要几十上百步慢慢磨。更关键的是,这个现象对任意攻击步数生成的对抗样本都成立。换句话说,在 LIC 系统里,生成一个有效的对抗样本费老鼻子劲,但把它修复回正常状态却异常轻松 。论文把这个性质命名为「非对称对抗轨迹」(Asymmetric Adversarial Trajectory, AAT)。
这个现象就像攻破一座堡垒需要顶着箭雨爬墙三天三夜,结果发现后门压根没锁、一脚就踹开了。为什么会出现这种"单向通道"?论文给出了一个几何层面的解释。
管状模型:揭开非对称对抗轨迹的神秘面纱
论文提出了一个「管状模型」(Tube Model)来解释这个现象。想象一下,LIC 系统的对抗区域不是一团厚实的"雾",而是一条薄薄的、弯曲的"管道"。沿着管道方向,攻击需要很多小步更新逐步积累损失;而垂直管道方向,只需要一步大跳就能脱离对抗区域。
为什么一步大跳可能直接逃出去?这里有个有趣的数学推导。TTR 的净化器更新如果用 Adam 优化器,当初始动量为零时,第一步更新会退化成符号梯度下降:
也就是说,只要学习率足够大,一步就能沿着负梯度方向走出足够远的距离。如果对抗区域的厚度很薄,这一步就足以完全脱离对抗区域,回到良性区域。管状模型还能解释之前观察到的另一个现象:PGD-GSM 攻击在大步长下会出现明显振荡。按管状模型的逻辑,这是因为步长超过了管道局部直线段的长度,一步冲过头冲进良性区域,再往回折返,于是来回震荡。
这个几何视角把之前零散的对抗行为统一起来了:LIC 的对抗区域又薄又弯,攻击时需要小步沿着管道走,防御时一步大跳就能直接跳出去。基于这个洞察,论文顺势推出了 FTTR 框架。
FTTR:一步到位的防御新范式
既然修复只需要 1-2 步,那防御端就完全没必要跑几十上百步的 TTR。论文据此提出了快速测试时细化 (Fast Test-Time Refinement, FTTR),把防御开销从"不可接受"压缩到"几乎为零"。
输入:对抗样本 x_adv,LIC系统 f
参数:净化器半径 s,迭代次数 K
输出:优化后的潜在表示 y* 和 z*
1. 初始化净化器 δ_d^(0) ~ Uniform(-s, s)
2. for k = 1 to K:
3. g^(k) = sign(∇ L_FTTR^(k)) # 计算符号梯度
4. δ_d^(k) = Clip(δ_d^(k-1) - s/K · g^(k)) # 更新并裁剪
5. end for
6. # 条件分支:仅当净化带来增益时才使用净化结果
7. if L_FTTR(x_adv, δ_d^(K)) < L_FTTR(x_adv, 0):
8. return E(x_adv + δ_d^(K))
9. else:
10. return E(x_adv)
有两处设计细节值得展开。第一,FTTR 给净化器加了均匀噪声初始化,而不是从零开始。这样做几乎不增加开销,但能顺手把对抗样本往远离对抗区域的方向推一把。第二,FTTR 引入了条件分支:只有当净化后的输入确实让损失下降时才采用净化结果,否则退回原始输入。这个设计保证 FTTR 在良性输入上不会帮倒忙——如果对抗扰动很小,或者扰动带来的收益小于净化自身引入的偏差,系统会自动选择不净化。
这里最妙的地方在于,FTTR 之所以能在白盒攻击下站稳脚跟,靠的是一个被很多人忽略的底层性质——Input-as-Label 性质 。大多数深度学习任务里,对抗样本的真实标签是拿不到的。比如一张狗的照片被扰动成"袋鼠",防御者根本不知道原始标签是狗,想恢复到良性状态都无从下手。但 LIC 系统不一样:它的重建目标就是输入图像本身。这意味着无论对抗样本怎么扰动,系统总能明确知道"应该恢复成什么样子"。
从优化角度看,TTR 可以看作一个对 LIC 系统"永不增损"的映射:
很多防御方法只是让对抗区域"搬家",攻击者换个位置照样能打;TTR 是直接让对抗区域"缩水",这才是白盒鲁棒性的真正来源。
白盒攻防:从理论到实践的全面验证
光有理论还不够,得拉到战场上真刀真枪地验。论文的威胁模型设置非常扎实:除了灰盒设置(攻击时不知道防御存在),还重点考察白盒设置,即攻击者完全知道 FTTR 的存在和细节。白盒攻击采用了两种强自适应攻击假设:BPDA (Backward Pass Differentiable Approximation,后向可微近似攻击)和 Unroll (对迭代防御过程展开求梯度的攻击)。同时覆盖了 ℓ∞ 和 ℓ2 两种扰动约束。
先看硬指标。在 400 步 ℓ∞ 白盒 PGD 攻击(预算 16/255)下,没有防御时平均 PSNR 只有 9.90 dB,码率飙到 17.97 bpp——基本属于"画面全毁+传输瘫痪"。而用 1 步 FTTR 之后,面对 BPDA 和 Unroll 两种白盒自适应攻击,平均 PSNR 分别拉到 24.58 dB 和 25.00 dB,涨了 14.68 和 15.10 dB;bpp 也大幅回落到 11.83 和 11.57。在 1000 步 ℓ2 C&W 攻击(c=1000)下,无防御时 PSNR 只有 7.59 dB、bpp 高达 15.19;加 1 步 FTTR 后,BPDA 攻击下 PSNR 涨到 26.71 dB(+19.12 dB),bpp 降到 7.58(-7.61)。
再看下游任务场景。在 8/255 的白盒 PGD 下游分类攻击下,FTTR 把下游分类准确率从 0.4% 拉高到 28.1%,提升了 27.7 个百分点。虽然绝对数值看起来还有很大提升空间,但考虑到这是从"几乎全灭"到"恢复四分之一以上",防御效果已经是质变级别。
感知质量和语义操纵呢?论文也做了验证。对高分辨率全局语义操纵攻击,FTTR 同样能显著改善重建质量。下面的表格展示了在全局语义操纵攻击下不同方法的性能对比,加粗为最优值:
更直观的可视化结果也很有说服力。从下面的对比图能看到,面对 PGD 攻击产生的对抗样本,无防御系统的重建基本是"灾难现场",而 FTTR 处理后的重建图在结构、纹理和色彩上都恢复到了接近原图的水平。
这里还特别要说明一个常见的质疑点:FTTR 的鲁棒性会不会来自"梯度遮蔽"(obfuscated gradients)?也就是让白盒攻击者拿不到有效梯度,从而显得鲁棒,但实际上一戳就破。论文通过理论分析和实验排除了这种可能。FTTR 的净化过程是可微的,BPDA 和 Unroll 两种自适应攻击都能获得有效梯度,但依然无法攻破 FTTR。这证明了鲁棒性来自真实的对抗区域收缩,而不是糊弄攻击者的障眼法。
未来展望:鲁棒图像压缩的挑战与机遇
这篇论文最值得记住的贡献,是把"攻防不对称"这个现象从直觉变成了可验证的性质,并且给出了一个几何层面的解释框架。AAT 揭示了一个对 LIC 防御极为有利的内在规律,而 FTTR 则把这个规律直接转化成了工程上可用的工具——不需要重新训练模型、不需要改动编码器解码器结构,只需要在测试时做一次轻量级优化。
当然,研究仍有不少值得继续深挖的空间。比如 FTTR 的净化器半径(也就是单步更新的步长)目前需要人工设定,怎么根据输入自适应地调整,是个有趣的问题;再比如当前的工作集中在图像压缩,能否把 AAT 的性质推广到视频压缩、甚至更一般的生成模型上,也值得探索。另外,FTTR 与对抗训练能否叠加使用,达到"1+1>2"的防御效果,也是一个有潜力的方向。标准化压缩系统部署场景下,FTTR 的额外计算开销虽然已经很小,但在真正需要实时编码的设备上,每毫秒的延迟都值得仔细权衡。
龙迷三问
这篇论文到底在解决什么问题? 学习型图像压缩系统极易被对抗攻击击穿。澳门大学与南洋理工团队发现其存在「非对称对抗轨迹」特性:生成攻击需数百步,恢复却只要1-2步。
这篇工作最值得看的点是什么? 在400步ℓ∞白盒PGD攻击下(预算16/255),1步FTTR将PSNR从9.90dB提升至24.58/25.00dB(BPDA/Unroll),bpp从17.97降至11.83/11.57
这篇工作的边界或风险在哪里? 优点:提出AAT特性并给出Tube Model理论解释;FTTR计算效率高;在多种攻击场景下均展现强鲁棒性。缺点:Tube Model仅为假设性模型缺乏严格数学证明;FTTR对净化器强度s敏感;未考虑MITM攻击场景。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出快速测试时细化(FTTR)框架,利用学习图像压缩系统的非对称对抗轨迹特性,通过少量优化步骤实现高效对抗防御。
实验合理度: ★★★★☆
PSNR, MS-SSIM, LPIPS, CLIP, bpp, top-1 accuracy
学术研究价值: ★★★★☆
提出快速测试时细化(FTTR)框架,利用学习图像压缩系统的非对称对抗轨迹特性,通过少量优化步骤实现高效对抗防御;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
1步FTTR仅需一次前向和反向传播,相比传统TTR的数百次迭代大幅降低计算开销
复现难度: ★★★☆☆
https://github.com/chinaliangjiaming/FTTR.git
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: Tube Model仅为假设性模型缺乏严格数学证明;FTTR对净化器强度s敏感;未考虑MITM攻击场景。
主要参考文献
[1] Liang J, Pun C M, Lin W. Fast Test-Time Refinement for Robust Learned Image Compression[J]. arXiv preprint arXiv:2608.15113, 2026.
[2] FTTR 开源代码:https://github.com/chinaliangjiaming/FTTR.git
[3] Athalye A, Carlini N, Wagner D. Obfuscated gradients give a false sense of security[C]//ICML, 2018.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
图像压缩攻防战,
一步防御是真章!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像压缩+澳门+澳大+小梁) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。