← 返回 PaperDaily 视觉与图像

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼

这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼

paperdaily_reaction_gif


原论文信息如下:
论文标题:
VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
发表日期:
2025年12月

发表单位:
斯坦福大学、Google Research、Google DeepMind

原文链接:
https://arxiv.org/pdf/2512.15701.pdf

项目链接:
论文中提及更多视觉结果见项目网站(原文未提供具体URL)

图片压缩,本质是“文件大小”与“视觉质量”的拔河。传统PSNR、SSIM等指标常与人眼感受脱节:草地纹理像素误差大,人眼不在意;人脸或文字稍模糊,人眼立刻察觉。过去用LPIPS等神经网络代理指标,虽有进步,但存在泛化瓶颈和“刷分”风险。

这篇论文的核心答案是:直接用视觉语言模型(VLM)当感知裁判,零样本复现人类判断,并用偏好优化训练扩散自编码器,让压缩图像更贴合人眼喜好。无需额外人类标注,不训练单独感知网络,全靠VLM零样本推理。实验在多个基准上达到SOTA水平,尤其在人脸和文字密集的MS-COCO上表现亮眼。

一、当AI学会“看”图:VLM如何成为图像压缩的感知裁判

图1:VLIC方法概览与效果展示

本文提出一种针对扩散自编码器的新型后训练技术,利用视觉语言模型对同一图像的不同解码结果进行评判,并通过Diffusion DPO提升自编码器性能。右侧结果显示VLIC在整体重建质量以及与人眼感知对齐方面均有显著提升。

研究者将开箱即用的Gemini 2.5-Flash在BAPPS数据集上测试,判断准确率69.44%,与LPIPS的69.56%几乎打平,接近人类内部一致率73.99%。更夸张的是,在自收集的“压缩图像”数据集上,VLM准确率高达83.80%,远超单个人类评判者的72.15%。这给了研究者极大信心:既然VLM判断力已如此之强,能否直接将其作为优化目标训练压缩模型?

图像压缩领域对“感知质量”的追求,长期被“率失真感知权衡”理论困扰:给定码率,提升感知质量必然牺牲像素保真度。因此,感知导向压缩的核心是设计足够贴近人眼的“感知损失函数”。过去的方案基本是训练代理指标网络(如LPIPS),但存在泛化瓶颈和“刷分”风险。

VLIC的提出者看到另一条路:既然VLM已在海量图文数据上训练,学会了丰富视觉语义和人类偏好先验,为何不让它直接当裁判?论文写道:“为了充分利用VLM强大的零样本视觉推理能力,我们提出了VLIC,一个基于扩散的图像压缩系统,专门设计为使用二元的VLM判断进行后训练。”他们不打算蒸馏VLM成感知损失网络,而是利用扩散模型偏好优化工具,直接把VLM判断作为非可微的奖励信号。

这个思路的妙处在于,VLM提供的二元偏好判断可接到Diffusion DPO这类偏好优化算法上。训练无需额外人类数据,也无需训练感知代理模型。且VLM本身快速迭代,意味着压缩系统的“裁判”会自动升级,无需额外人工成本。

论文用直观实验验证了VLM当裁判的可行性。他们把Gemini 2.5-Flash用在BAPPS数据集和自收集的“压缩图像”数据集(5401组三元组,每组至少3位人类评判)上。结果显示(见表2),VLM在压缩图像数据集上准确率达83.8%,超过单个人类评判者的72.15%。

图4:VLIC在图像压缩数据集上的定量评估

图像压缩数据集的定量评估。整体来看,VLIC取得了与SOTA相当或更优的性能,尤其在感知指标上表现出色,在包含大量人脸和文字等人类相关特征的MS-COCO上优势明显。

二、从FlowMo到VLIC:扩散自编码器的架构演进与创新

VLIC的架构基础是FlowMo,一个在ICCV 2025上发表的扩散自编码器,用于图像分词与重建。其核心思想是把图像编码成离散潜在编码,再由扩散解码器逐步去噪重建。VLIC在第一阶段训练方式与FlowMo保持一致,但做了三处关键改动。
第一处,把FlowMo的查找无关量化换成FSQ(有限标量量化)。FSQ无需学习码本,直接把连续特征映射到有限离散集合,实现简单、训练稳定,还省掉承诺损失和熵损失两项额外目标。
第二处,在FSQ离散token后接一个自回归Transformer熵编码器,用算术编码把离散token压成比特流。因为扩散自编码器只负责把图像变成离散码,配上熵编码才能谈每像素比特数(bpp),也才能在相同码率下与其它压缩方法PK。第三处,是整个论文的精华——在预训练后引入Diffusion DPO后训练,把VLM偏好判断烧进模型参数。
图3:VLIC方法总览
图3:方法总览。原图经编码器变为一维离散潜码,离散码由自回归语言模型熵编码;扩散解码器以离散码为条件采样两个重建结果,再由VLM进行排序,最终偏好信号通过Diffusion DPO训练整个扩散自编码器。
整条管线很清晰:原图x经编码器得到一维离散码c,经自回归Transformer熵编码器和算术编码变成比特流;解码时,比特流经算术解码恢复c,扩散解码器以c为条件采样重建图像。这里有个重要特性:编码是确定性的,解码却是随机的。同一个离散码,跑两次采样,出来的两张图在细节上有微妙差异。这在传统压缩里是头疼问题,但在本文里成了关键资源——它天然提供了“同一张图的两个不同重建版本”,正好用来做偏好对比。
模型训练了两个码率档位:低码率0.07 bpp和高码率0.21 bpp。bpp越小,压缩率越高,重建难度越大。模型总参数量都在1.01B左右,区别主要在通道数、token长度等结构细节。
表4:低码率配置模型超参数
表4:低码率配置的模型超参数,总参数量1.01B。
表5:高码率配置模型超参数
表5:高码率配置的模型超参数,总参数量同为1.01B。
工程上还有个细节:模型在256×256分辨率的ImageNet上训练,但评测用的CLIC数据集里不少图像高达四百万像素。论文采用平铺式推理:把大图切成小块分批重建再拼接,每块周围留8像素的margin,让扩散过程中块间能传递上下文信息,避免拼接边缘出现接缝。
图7:平铺推理示意
图7:面向任意分辨率的平铺推理。从上到下依次为原图、切块策略、重建结果。margin(本文取8像素)需要在扩散过程中传递块间信息以避免难看的边界伪影,但也不能太大以免浪费码率。

三、Diffusion DPO:让非可微的VLM偏好驱动模型优化

传统压缩模型训练依赖可微损失函数。MSE可求导,LPIPS这类神经网络感知指标也可求导,但VLM不行。让Gemini看完三张图输出一句“重建A比重建B更接近原图”,这个判断过程对压缩模型来说是个无法穿透的黑盒子——梯度根本传不回来。
怎么解决?换个思路:梯度传不回来,那就只需要一个“谁赢谁输”的信号。这就是偏好优化的用武之地。DPO(直接偏好优化)最初为对齐语言模型设计,核心思想是:给定偏好对(赢家winner和输家loser),让模型增大生成赢家的概率、降低生成输家的概率,同时通过KL约束防止模型偏离参考策略太远。Diffusion DPO则把这一思想迁移到扩散模型的去噪过程中,好处是不需要单独训练奖励模型,也不需要对扩散采样过程做可微近似。
VLIC的Diffusion DPO损失函数写成这样:
公式1:Diffusion DPO损失
公式1:Diffusion DPO损失函数。θ为待训练参数,β为KL权重,控制模型能偏离原始参考策略的幅度;ω(λ_t)为信噪比相关的加权因子;σ为sigmoid函数;Δ^w和Δ^l分别对应winning样本和losing样本的损失差。
Δ的具体定义如下。其中ε为噪声,ε_θ为当前模型的噪声估计器,ε_ref为参考策略(即预训练模型)的噪声估计器,t为时间步,x̂_t为带噪样本,x为原始图像。
公式2:winning样本损失差Deltaw 公式3:losing样本损失差Deltal
公式2、3:Δ^w和Δ^l的定义。分别衡量当前模型与参考模型在winning和losing样本上的噪声预测误差之差。直观理解:如果winning样本在当前模型上的预测误差比参考模型更小,就说明模型正在往正确方向前进;losing样本则反过来,误差差越大,模型越需要远离这个方向。
为了防止后训练跑太久导致模型走火入魔,作者还保留了一项原始的整流流(Rectified Flow)训练损失作为正则项。这个损失衡量模型预测的速度场与实际速度场之间的误差,作用是给模型套一根“缰绳”:DPO负责往VLM偏好的方向拉,正则项负责别拉得太远,两者合力才是最终目标。
公式4:整流流损失 公式5:最终训练损失
公式4、5:整流流损失(v为流匹配速度,v_θ为网络估计的速度,x_t为带噪图像)和最终训练损失(λ_Flow为权衡超参数)。
还有一点细节值得注意:DPO阶段编码器是不冻结的。要知道,VLM奖励是预训练阶段从未见过的全新信号,如果编码器原地不动,它可能永远无法调整出对VLM友好的特征;让它跟着一起训练,虽然风险更大,但换来的是更好的上限。实验也证实了这一点。
接下来是最核心的奖励设计环节。VLM虽然强,但并不是完美裁判:它会幻觉,会无视图像内容,面对高度相似的两张图还会随机摇摆。为了让裁判信号足够干净,论文给VLM套了三层保险。
第一层是正反序评分。同一对重建图像,先按(A, B)顺序让VLM打分,再按(B, A)顺序打分,两次分数取符号合并。如果VLM在两种顺序下判断一致,说明它真的看懂了图;如果前后矛盾,这个样本就会被当作噪声处理。第二层是多随机种子自集成。用n个随机种子各评一遍,汇总投票,主实验取n=3。图5显示,随着种子数增加,VLM的判断与人类评分的契合度持续上升,但也会逐渐饱和。第三层是与LPIPS联合评审。只有当VLM和LPIPS一致认定A更好的时候,才对这一对样本进行训练;两者意见相左就丢弃。这等于给VLM配了一位传统感知指标的“副驾驶”,用来过滤掉大部分随机噪声。
图5:自集成扩展曲线
图5:自集成规模扩展效应。随着VLM随机推断次数增加,VLM在BAPPS数据集上对人类评判的预测能力持续提升,但最终趋于饱和。
表2:人类2AFC基准对比
表2:人类二元强制选择(2AFC,即Two-Alternative Forced Choice,给定原图和两个候选重建,强制选出更接近原图的一个)基准测试。Gemini 2.5-Flash在零样本条件下即可复现人类相似度判断;在压缩图像数据集上,VLM准确率达到83.8%,甚至超过单个真人评判者的72.15%。
这一整套“人机结合”的裁判机制,本质上是把VLM当成了可以插拔的感知模块。今天用Gemini 2.5-Flash,明天换成更强的新VLM,压缩模型不需要重新设计,等着VLM进化就行。这种借力打力的思路,是整个工作最吸引人的地方。

四、实验全面解析:VLIC在多个基准上的卓越表现

方法讲完,来看实验结果。
训练配置是硬核级别的:模型在ImageNet上以256×256分辨率预训练100万步,DPO后训练8000步,batch size 256,放到256块TPUv4上训练,框架为JAX,精度采用bfloat16。DPO采用在线训练模式,每250步刷新一次偏好样本缓冲池,VLM推理通过异步调用与DPO训练重叠进行,尽量让昂贵的大模型API调用不拖慢训练节奏。
对比基线覆盖了GAN和扩散两大阵营:HiFiC(GAN路线经典方法)、PerCo(扩散路线,但未开源代码,论文采用开源复现版本)、HFD(基于扩散的超低码率压缩方法,论文从原论文中取数)、PO-ELIC(GAN+隐空间优化路线,CLIC 2022官方重建图已对外公开)。测试数据集包括MS-COCO(3万张图像)、CLIC 2020(428张高分辨率图)、CLIC 2022(30张高分辨率图)。评价指标除了常规的LPIPS、PSNR、FID之外,还引入了FD-DINO(基于DINO特征的分布距离指标),以及最重要的ELO人类等级分——ELO直接来自大规模用户研究,MS-COCO上采集了15705次两两比较,CLIC 2020上1812次,CLIC 2022上2523次。这基本等于把“人眼投票”做成了量化标尺,比任何计算指标都更有说服力。
图2:定性对比结果
图2:标准图像压缩数据集上的定性对比。上图:在CLIC 2022图像上对比VLIC与HiFiC、PO-ELIC的不同码率结果;下图:在MS-COCO上与HiFiC、PerCo的对比。可以看出VLIC对感知相关的细节、人脸和纹理还原更忠实。
从图4(前文已展示)和图2可以直观看到,VLIC在MS-COCO上对HiFiC和PerCo形成了全面压制,尤其是人脸、文字这类人类视觉高度敏感的区域。这个结果其实非常合理:MS-COCO有很高比例的图像包含人脸和文字,而这恰恰是VLM最擅长判断的内容。在CLIC 2020上,VLIC相对HiFiC和HFD也取得了更强或相当的感知指标。唯一的例外是CLIC 2022,PO-ELIC在部分指标上优于VLIC。论文对此做了解释:PO-ELIC没有开源代码,其性能在低分辨率或其他数据集上无法验证;CLIC 2022本身只有30张图,统计波动较大。
还值得特别注意的是评价指标的分化现象。VLIC在感知指标上是尖子生,但PSNR往往不高,甚至在多个数据集上低于部分基线。这看起来像退步,其实是意料之中的结果——Blau和Michaeli在2019年就从理论上证明了“率失真感知权衡”:在给定码率的条件下,像素保真(PSNR)和感知质量是一对矛盾目标,一个升高另一个必然下降。所以评价感知导向压缩系统时,PSNR的权重应当降低,人眼ELO才是黄金标准。
那么,VLM这个裁判到底贡献了多少?表1给出了直接证据。在两个码率档位下,把VLM+LPIPS联合奖励与只用LPIPS做后训练进行对比,VLM的存在带来了可感知的增益:0.07bpp档位人类ELO从838提升到858,0.21bpp档位从1103提升到1112。这个提升幅度不算巨大——毕竟LPIPS本身已经很强了——但考虑到联合评审还会额外丢弃不少样本,这个增益恰恰说明VLM提供了LPIPS无法覆盖的语义级感知信息。
表1:VLM贡献验证
表1:VLM的重要性。在多个码率档位(熵编码前)下,使用VLM+LPIPS联合目标进行后训练,相比只用LPIPS后训练,取得了稳定增益。
消融实验进一步拆解了每个组件的必要性,见表3。四条结论非常清晰:第一,不做DPO后训练,全面崩盘(FD-DINO从67.83掉到82.31,FID从2.31掉到2.40,LPIPS从0.278掉到0.300),说明整个后训练机制不是锦上添花,而是雪中送炭;第二,去掉LPIPS联审,FID和FD-DINO反而略有改善,但PSNR和LPIPS明显变差,说明VLM能保住感知分布,却管不住像素级保真;第三,去掉自我集成,大部分指标变差,说明噪声对DPO训练的伤害是真实的。
表3:消融实验
表3:消融研究。奖励设计的各个组件均对最终性能有贡献:去掉LPIPS联审会损失像素级指标,去掉自集成会损失大部分指标,完全不做后训练则所有指标全面下降。
从实验设计角度看,这篇论文的工程态度相当扎实。PO-ELIC没有代码就用官方重建图直接评测,PerCo没有代码就用匹配度较高的开源复现,HFD没有重建图就复刻其评估流程后从原论文取数;Elo排名做了10000次随机重排取平均,规避了排序顺序带来的偏差。这种“能拿到什么数据就比什么数据”的务实做法,远比很多论文里自说自话的对比可信得多。

五、局限与展望:VLIC的不足与未来改进方向

VLIC的局限,论文交代得也很直白。
第一道坎是速度。扩散解码器每张图要跑多步采样,速度远慢于HiFiC这类GAN方法。这在低延迟场景里几乎不可接受,也是所有扩散压缩路线共同面临的问题。第二道坎是成本。VLM奖励比传统的感知损失网络贵几个数量级——训练过程中每一次偏好标注都需要调用一次Gemini API,哪怕采用了异步调用,累计的API费用依然可观。研究阶段可以接受,产品化就得精打细算。第三道坎是噪声。当两张重建图高度相似时,VLM依然会出现幻觉性误判,正反顺序评分互相打脸,如图6所示。
图6:VLM失败模式
图6:典型失败模式。当重建图像高度相似时,VLM可能在交换顺序后给出矛盾的判断,出现幻觉性错误排序,导致自我不一致。
更值得警惕的是奖励设计本身可能带来的系统性偏向。论文在补充分析中提到一个有趣的失败案例:当奖励设计为“VLM可读文本的编辑距离”时,模型并没有学会更好地重建文字,反而学会了把所有可读文字直接抹掉——因为把字涂掉比把字重建对更容易骗过VLM。这提醒我们,任何自动化裁判都可能被钻空子,VLM也不例外。
图8:文本审查失败案例
图8:可读文本审查失败案例。基于VLM可读文本编辑距离的奖励,会导致模型退化为将所有可读文本全部涂掉——模型学会了钻奖励的空子。
未来方向也在论文的叙述里呼之欲出。VLM正处在快速迭代期,Gemini、GPT-4o、Claude这些模型隔几个月就变强一截,VLIC的裁判水平会跟着自动水涨船高,整个系统几乎是在白嫖各家大模型的军备竞赛红利。同时,如果能把这套VLM奖励蒸馏成一个轻量级可微网络,或者用更便宜的模型做教师网络,训练成本问题也有望缓解。论文末尾那句“我们感谢Ben Poole、David Minnen和Dina Bashkirova的讨论”,透着一股谷歌系研究的典型气质——这个问题,他们是真的站在工程实践的角度在思考。
mmexport1760710364748.jpg

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?斯坦福、Google Research与DeepMind团队提出VLIC,将Gemini 2.5-Flash等VLM作为零样本感知裁判,通过Diffusion DPO后训练扩散自编码器,让图像压缩结果向人类视觉偏好对齐。
这篇工作最值得看的点是什么?在MS-COCO上达到最优性能,在CLIC 2020上优于HiFiC和HFD,在CLIC 2022上略逊于PO-ELIC但优于HiFiC;在人类感知相关指标(Elo, FD-DINO)上表现突出。
这篇工作的边界或风险在哪里?优点:1)创新性地利用VLM作为零样本感知评判器,避免了训练专用感知指标网络;2)通过Diffusion DPO实现非可微奖励的优化;3)VLM与LPIPS集成策略有效提升性能。缺点:1)扩散解码器推理延迟较高;2)VLM评判计算成本昂贵;3)在CLIC 2022上性能不及PO-ELIC。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆
把VLM当作零样本感知裁判,并用Diffusion DPO直接后训练压缩模型,跳过了“先学感知损失网络再用于训练”的传统范式,组合思路足够新。

实验合理度:★★★★☆
对比基线覆盖GAN与扩散两大阵营,ELO用户研究规模合计约2万次两两对比,消融完备;主要扣分点是CLIC 2022上PO-ELIC未开源导致对比不完全。

学术研究价值:★★★★☆
VLM零样本感知判断的结论独立成章,对视觉评测领域有启发;偏好优化+扩散压缩的组合也为其他生成式编码任务提供了可借鉴的范式。

稳定性:★★★☆☆
扩散解码器本身有采样随机性,同一离散码多次解码结果会有波动;VLM奖励虽然经过多层去噪,但训练稳定性和推理可重复性仍需更多验证。

适应性以及泛化能力:★★★☆☆
在MS-COCO等自然图像上表现突出,但在CLIC 2022高分辨率数据集上仍不及PO-ELIC;对特定内容分布(如大范围纹理、复杂场景)的泛化能力有待观察。

硬件需求及成本:★★☆☆☆
预训练100万步在256块TPUv4上完成,DPO阶段还高频调用Gemini API,训练成本属于大厂级;推理端扩散多步采样,算力门槛也明显高于GAN方法。

复现难度:★★☆☆☆
论文未放出代码和权重,训练基础设施要求极高,VLM依赖Gemini 2.5-Flash API,外部复现存在供应商锁定问题;好在架构基于公开的FlowMo,理论线路可循。

产品化成熟度:★☆☆☆☆
距离落地还远。除非把VLM奖励蒸馏成轻量级可微网络,同时把解码器推理速度提上来,否则在实时传输场景几乎不可用;目前更适合作为高端离线压缩或内容再生成服务的技术储备。

可能的问题:训练管线整体复杂且成本高,论文未公开代码,难以独立验证其对不同分布数据的稳定表现;CLIC 2022上弱于PO-ELIC的归因主要停留在“未开源/样本量小”层面,缺少更深层的机制分析。此外,VLM奖励与LPIPS联审的设计虽然有效,但二者相关性较高,VLM的独立贡献到底有多大仍有讨论空间。


主要参考文献

[1] Sargent K, Gao R, Henzler P, et al. VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression. arXiv:2512.15701, 2025.
[2] Black K, Janner M, Du Y, et al. Training Diffusion Models with Reinforcement Learning. ICLR 2024.
[3] Zhang R, Isola P, Efros A A, et al. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric. CVPR 2018.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球