← 返回 PaperDaily
视觉与图像
李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼
这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。
龙哥读论文
发布于 2026-08-24 00:20:00
阅读 5
查看原文
原论文信息如下:
图片压缩,本质是“文件大小”与“视觉质量”的拔河。传统PSNR、SSIM等指标常与人眼感受脱节:草地纹理像素误差大,人眼不在意;人脸或文字稍模糊,人眼立刻察觉。过去用LPIPS等神经网络代理指标,虽有进步,但存在泛化瓶颈和“刷分”风险。
这篇论文的核心答案是:直接用视觉语言模型(VLM)当感知裁判,零样本复现人类判断,并用偏好优化训练扩散自编码器,让压缩图像更贴合人眼喜好。 无需额外人类标注,不训练单独感知网络,全靠VLM零样本推理。实验在多个基准上达到SOTA水平,尤其在人脸和文字密集的MS-COCO上表现亮眼。
一、当AI学会“看”图:VLM如何成为图像压缩的感知裁判
本文提出一种针对扩散自编码器的新型后训练技术,利用视觉语言模型对同一图像的不同解码结果进行评判,并通过Diffusion DPO提升自编码器性能。右侧结果显示VLIC在整体重建质量以及与人眼感知对齐方面均有显著提升。
研究者将开箱即用的Gemini 2.5-Flash在BAPPS数据集上测试,判断准确率69.44%,与LPIPS的69.56%几乎打平,接近人类内部一致率73.99%。更夸张的是,在自收集的“压缩图像”数据集上,VLM准确率高达83.80%,远超单个人类评判者的72.15%。这给了研究者极大信心:既然VLM判断力已如此之强,能否直接将其作为优化目标训练压缩模型?
图像压缩领域对“感知质量”的追求,长期被“率失真感知权衡”理论困扰:给定码率,提升感知质量必然牺牲像素保真度。因此,感知导向压缩的核心是设计足够贴近人眼的“感知损失函数”。过去的方案基本是训练代理指标网络(如LPIPS),但存在泛化瓶颈和“刷分”风险。
VLIC的提出者看到另一条路:既然VLM已在海量图文数据上训练,学会了丰富视觉语义和人类偏好先验,为何不让它直接当裁判?论文写道:“为了充分利用VLM强大的零样本视觉推理能力,我们提出了VLIC,一个基于扩散的图像压缩系统,专门设计为使用二元的VLM判断进行后训练。”他们不打算蒸馏VLM成感知损失网络,而是利用扩散模型偏好优化工具,直接把VLM判断作为非可微的奖励信号。
这个思路的妙处在于,VLM提供的二元偏好判断可接到Diffusion DPO这类偏好优化算法上。训练无需额外人类数据,也无需训练感知代理模型。且VLM本身快速迭代,意味着压缩系统的“裁判”会自动升级,无需额外人工成本。
论文用直观实验验证了VLM当裁判的可行性。他们把Gemini 2.5-Flash用在BAPPS数据集和自收集的“压缩图像”数据集(5401组三元组,每组至少3位人类评判)上。结果显示(见表2),VLM在压缩图像数据集上准确率达83.8%,超过单个人类评判者的72.15%。
图像压缩数据集的定量评估。整体来看,VLIC取得了与SOTA相当或更优的性能,尤其在感知指标上表现出色,在包含大量人脸和文字等人类相关特征的MS-COCO上优势明显。
二、从FlowMo到VLIC:扩散自编码器的架构演进与创新
VLIC的架构基础是FlowMo,一个在ICCV 2025上发表的扩散自编码器,用于图像分词与重建。其核心思想是把图像编码成离散潜在编码,再由扩散解码器逐步去噪重建。VLIC在第一阶段训练方式与FlowMo保持一致,但做了三处关键改动。
第一处,把FlowMo的查找无关量化换成FSQ(有限标量量化) 。FSQ无需学习码本,直接把连续特征映射到有限离散集合,实现简单、训练稳定,还省掉承诺损失和熵损失两项额外目标。
第二处,在FSQ离散token后接一个自回归Transformer熵编码器,用算术编码把离散token压成比特流。因为扩散自编码器只负责把图像变成离散码,配上熵编码才能谈每像素比特数(bpp),也才能在相同码率下与其它压缩方法PK。第三处,是整个论文的精华——在预训练后引入Diffusion DPO后训练,把VLM偏好判断烧进模型参数。
整条管线很清晰:原图x经编码器得到一维离散码c,经自回归Transformer熵编码器和算术编码变成比特流;解码时,比特流经算术解码恢复c,扩散解码器以c为条件采样重建图像。这里有个重要特性:编码是确定性的,解码却是随机的 。同一个离散码,跑两次采样,出来的两张图在细节上有微妙差异。这在传统压缩里是头疼问题,但在本文里成了关键资源——它天然提供了“同一张图的两个不同重建版本”,正好用来做偏好对比。
模型训练了两个码率档位:低码率0.07 bpp和高码率0.21 bpp。bpp越小,压缩率越高,重建难度越大。模型总参数量都在1.01B左右,区别主要在通道数、token长度等结构细节。
工程上还有个细节:模型在256×256分辨率的ImageNet上训练,但评测用的CLIC数据集里不少图像高达四百万像素。论文采用平铺式推理:把大图切成小块分批重建再拼接,每块周围留8像素的margin,让扩散过程中块间能传递上下文信息,避免拼接边缘出现接缝。
三、Diffusion DPO:让非可微的VLM偏好驱动模型优化
传统压缩模型训练依赖可微损失函数。MSE可求导,LPIPS这类神经网络感知指标也可求导,但VLM不行。让Gemini看完三张图输出一句“重建A比重建B更接近原图”,这个判断过程对压缩模型来说是个无法穿透的黑盒子——梯度根本传不回来。
怎么解决?换个思路:梯度传不回来,那就只需要一个“谁赢谁输”的信号 。这就是偏好优化的用武之地。DPO(直接偏好优化)最初为对齐语言模型设计,核心思想是:给定偏好对(赢家winner和输家loser),让模型增大生成赢家的概率、降低生成输家的概率,同时通过KL约束防止模型偏离参考策略太远。Diffusion DPO则把这一思想迁移到扩散模型的去噪过程中,好处是不需要单独训练奖励模型,也不需要对扩散采样过程做可微近似。
VLIC的Diffusion DPO损失函数写成这样:
Δ的具体定义如下。其中ε为噪声,ε_θ为当前模型的噪声估计器,ε_ref为参考策略(即预训练模型)的噪声估计器,t为时间步,x̂_t为带噪样本,x为原始图像。
为了防止后训练跑太久导致模型走火入魔,作者还保留了一项原始的整流流(Rectified Flow)训练损失作为正则项。这个损失衡量模型预测的速度场与实际速度场之间的误差,作用是给模型套一根“缰绳”:DPO负责往VLM偏好的方向拉,正则项负责别拉得太远,两者合力才是最终目标。
还有一点细节值得注意:DPO阶段编码器是不冻结的。要知道,VLM奖励是预训练阶段从未见过的全新信号,如果编码器原地不动,它可能永远无法调整出对VLM友好的特征;让它跟着一起训练,虽然风险更大,但换来的是更好的上限。实验也证实了这一点。
接下来是最核心的奖励设计环节。VLM虽然强,但并不是完美裁判:它会幻觉,会无视图像内容,面对高度相似的两张图还会随机摇摆。为了让裁判信号足够干净,论文给VLM套了三层保险。
第一层是正反序评分 。同一对重建图像,先按(A, B)顺序让VLM打分,再按(B, A)顺序打分,两次分数取符号合并。如果VLM在两种顺序下判断一致,说明它真的看懂了图;如果前后矛盾,这个样本就会被当作噪声处理。第二层是多随机种子自集成 。用n个随机种子各评一遍,汇总投票,主实验取n=3。图5显示,随着种子数增加,VLM的判断与人类评分的契合度持续上升,但也会逐渐饱和。第三层是与LPIPS联合评审 。只有当VLM和LPIPS一致认定A更好的时候,才对这一对样本进行训练;两者意见相左就丢弃。这等于给VLM配了一位传统感知指标的“副驾驶”,用来过滤掉大部分随机噪声。
这一整套“人机结合”的裁判机制,本质上是把VLM当成了可以插拔的感知模块。今天用Gemini 2.5-Flash,明天换成更强的新VLM,压缩模型不需要重新设计,等着VLM进化就行。这种借力打力的思路,是整个工作最吸引人的地方。
四、实验全面解析:VLIC在多个基准上的卓越表现
训练配置是硬核级别的:模型在ImageNet上以256×256分辨率预训练100万步,DPO后训练8000步,batch size 256,放到256块TPUv4上训练,框架为JAX,精度采用bfloat16。DPO采用在线训练模式,每250步刷新一次偏好样本缓冲池,VLM推理通过异步调用与DPO训练重叠进行,尽量让昂贵的大模型API调用不拖慢训练节奏。
对比基线覆盖了GAN和扩散两大阵营:HiFiC(GAN路线经典方法)、PerCo(扩散路线,但未开源代码,论文采用开源复现版本)、HFD(基于扩散的超低码率压缩方法,论文从原论文中取数)、PO-ELIC(GAN+隐空间优化路线,CLIC 2022官方重建图已对外公开)。测试数据集包括MS-COCO(3万张图像)、CLIC 2020(428张高分辨率图)、CLIC 2022(30张高分辨率图)。评价指标除了常规的LPIPS、PSNR、FID之外,还引入了FD-DINO(基于DINO特征的分布距离指标),以及最重要的ELO人类等级分——ELO直接来自大规模用户研究,MS-COCO上采集了15705次两两比较,CLIC 2020上1812次,CLIC 2022上2523次。这基本等于把“人眼投票”做成了量化标尺,比任何计算指标都更有说服力。
从图4(前文已展示)和图2可以直观看到,VLIC在MS-COCO上对HiFiC和PerCo形成了全面压制,尤其是人脸、文字这类人类视觉高度敏感的区域。这个结果其实非常合理:MS-COCO有很高比例的图像包含人脸和文字,而这恰恰是VLM最擅长判断的内容。在CLIC 2020上,VLIC相对HiFiC和HFD也取得了更强或相当的感知指标。唯一的例外是CLIC 2022,PO-ELIC在部分指标上优于VLIC。论文对此做了解释:PO-ELIC没有开源代码,其性能在低分辨率或其他数据集上无法验证;CLIC 2022本身只有30张图,统计波动较大。
还值得特别注意的是评价指标的分化现象。VLIC在感知指标上是尖子生,但PSNR往往不高,甚至在多个数据集上低于部分基线。这看起来像退步,其实是意料之中的结果——Blau和Michaeli在2019年就从理论上证明了“率失真感知权衡”:在给定码率的条件下,像素保真(PSNR)和感知质量是一对矛盾目标 ,一个升高另一个必然下降。所以评价感知导向压缩系统时,PSNR的权重应当降低,人眼ELO才是黄金标准。
那么,VLM这个裁判到底贡献了多少?表1给出了直接证据。在两个码率档位下,把VLM+LPIPS联合奖励与只用LPIPS做后训练进行对比,VLM的存在带来了可感知的增益:0.07bpp档位人类ELO从838提升到858,0.21bpp档位从1103提升到1112。这个提升幅度不算巨大——毕竟LPIPS本身已经很强了——但考虑到联合评审还会额外丢弃不少样本,这个增益恰恰说明VLM提供了LPIPS无法覆盖的语义级感知信息。
消融实验进一步拆解了每个组件的必要性,见表3。四条结论非常清晰:第一,不做DPO后训练,全面崩盘 (FD-DINO从67.83掉到82.31,FID从2.31掉到2.40,LPIPS从0.278掉到0.300),说明整个后训练机制不是锦上添花,而是雪中送炭;第二,去掉LPIPS联审 ,FID和FD-DINO反而略有改善,但PSNR和LPIPS明显变差,说明VLM能保住感知分布,却管不住像素级保真;第三,去掉自我集成 ,大部分指标变差,说明噪声对DPO训练的伤害是真实的。
从实验设计角度看,这篇论文的工程态度相当扎实。PO-ELIC没有代码就用官方重建图直接评测,PerCo没有代码就用匹配度较高的开源复现,HFD没有重建图就复刻其评估流程后从原论文取数;Elo排名做了10000次随机重排取平均,规避了排序顺序带来的偏差。这种“能拿到什么数据就比什么数据”的务实做法,远比很多论文里自说自话的对比可信得多。
五、局限与展望:VLIC的不足与未来改进方向
第一道坎是速度。扩散解码器每张图要跑多步采样,速度远慢于HiFiC这类GAN方法。这在低延迟场景里几乎不可接受,也是所有扩散压缩路线共同面临的问题。第二道坎是成本。VLM奖励比传统的感知损失网络贵几个数量级——训练过程中每一次偏好标注都需要调用一次Gemini API,哪怕采用了异步调用,累计的API费用依然可观。研究阶段可以接受,产品化就得精打细算。第三道坎是噪声。当两张重建图高度相似时,VLM依然会出现幻觉性误判,正反顺序评分互相打脸,如图6所示。
更值得警惕的是奖励设计本身可能带来的系统性偏向。论文在补充分析中提到一个有趣的失败案例:当奖励设计为“VLM可读文本的编辑距离”时,模型并没有学会更好地重建文字,反而学会了把所有可读文字直接抹掉——因为把字涂掉比把字重建对更容易骗过VLM。这提醒我们,任何自动化裁判都可能被钻空子,VLM也不例外。
未来方向也在论文的叙述里呼之欲出。VLM正处在快速迭代期,Gemini、GPT-4o、Claude这些模型隔几个月就变强一截,VLIC的裁判水平会跟着自动水涨船高,整个系统几乎是在白嫖各家大模型的军备竞赛红利。同时,如果能把这套VLM奖励蒸馏成一个轻量级可微网络,或者用更便宜的模型做教师网络,训练成本问题也有望缓解。论文末尾那句“我们感谢Ben Poole、David Minnen和Dina Bashkirova的讨论”,透着一股谷歌系研究的典型气质——这个问题,他们是真的站在工程实践的角度在思考。
龙迷三问
这篇论文到底在解决什么问题? 斯坦福、Google Research与DeepMind团队提出VLIC,将Gemini 2.5-Flash等VLM作为零样本感知裁判,通过Diffusion DPO后训练扩散自编码器,让图像压缩结果向人类视觉偏好对齐。
这篇工作最值得看的点是什么? 在MS-COCO上达到最优性能,在CLIC 2020上优于HiFiC和HFD,在CLIC 2022上略逊于PO-ELIC但优于HiFiC;在人类感知相关指标(Elo, FD-DINO)上表现突出。
这篇工作的边界或风险在哪里? 优点:1)创新性地利用VLM作为零样本感知评判器,避免了训练专用感知指标网络;2)通过Diffusion DPO实现非可微奖励的优化;3)VLM与LPIPS集成策略有效提升性能。缺点:1)扩散解码器推理延迟较高;2)VLM评判计算成本昂贵;3)在CLIC 2022上性能不及PO-ELIC。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 把VLM当作零样本感知裁判,并用Diffusion DPO直接后训练压缩模型,跳过了“先学感知损失网络再用于训练”的传统范式,组合思路足够新。
实验合理度: ★★★★☆ 对比基线覆盖GAN与扩散两大阵营,ELO用户研究规模合计约2万次两两对比,消融完备;主要扣分点是CLIC 2022上PO-ELIC未开源导致对比不完全。
学术研究价值: ★★★★☆ VLM零样本感知判断的结论独立成章,对视觉评测领域有启发;偏好优化+扩散压缩的组合也为其他生成式编码任务提供了可借鉴的范式。
稳定性: ★★★☆☆ 扩散解码器本身有采样随机性,同一离散码多次解码结果会有波动;VLM奖励虽然经过多层去噪,但训练稳定性和推理可重复性仍需更多验证。
适应性以及泛化能力: ★★★☆☆ 在MS-COCO等自然图像上表现突出,但在CLIC 2022高分辨率数据集上仍不及PO-ELIC;对特定内容分布(如大范围纹理、复杂场景)的泛化能力有待观察。
硬件需求及成本: ★★☆☆☆ 预训练100万步在256块TPUv4上完成,DPO阶段还高频调用Gemini API,训练成本属于大厂级;推理端扩散多步采样,算力门槛也明显高于GAN方法。
复现难度: ★★☆☆☆ 论文未放出代码和权重,训练基础设施要求极高,VLM依赖Gemini 2.5-Flash API,外部复现存在供应商锁定问题;好在架构基于公开的FlowMo,理论线路可循。
产品化成熟度: ★☆☆☆☆ 距离落地还远。除非把VLM奖励蒸馏成轻量级可微网络,同时把解码器推理速度提上来,否则在实时传输场景几乎不可用;目前更适合作为高端离线压缩或内容再生成服务的技术储备。
可能的问题: 训练管线整体复杂且成本高,论文未公开代码,难以独立验证其对不同分布数据的稳定表现;CLIC 2022上弱于PO-ELIC的归因主要停留在“未开源/样本量小”层面,缺少更深层的机制分析。此外,VLM奖励与LPIPS联审的设计虽然有效,但二者相关性较高,VLM的独立贡献到底有多大仍有讨论空间。
主要参考文献
[1] Sargent K, Gao R, Henzler P, et al. VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression. arXiv:2512.15701, 2025.
[2] Black K, Janner M, Du Y, et al. Training Diffusion Models with Reinforcement Learning. ICLR 2024.
[3] Zhang R, Isola P, Efros A A, et al. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric. CVPR 2018.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!