← 返回 PaperDaily
视觉与图像
GenVC:首个压缩导向视频扩散模型,码率省62%秒变15fps
继7月聊过北大用0.005bpp还原视频细节之后,微软亚洲研究院带着GenVC来了——这是**首个面向视频压缩、从头训练的像素域视频扩散模型**。它不自欺欺人地继承百亿参数预训练骨架,而是用5.78亿参数干到码率省六成、解码15fps。更关键的是,它发现直接暴力蒸馏会让运动卡死,于是提出了**自适应分数蒸馏**来精准纠偏。想搞懂视频压缩+扩散模型的最强实战,
龙哥读论文
发布于 2026-08-14 09:11:29
阅读 4
查看原文
原论文信息如下:
视频压缩的革命:首个面向压缩的从头训练视频扩散模型GenVC
几乎所有现有的扩散视频编解码器都在“借力”——直接继承文本生成场景下预训练的百亿参数潜空间扩散模型,然后微调来适应压缩任务。这种路径虽然见效快,但有一个根本问题:扩散模型并不是为压缩设计的,它在生成时不会主动考虑码率约束,也不会与图像编码器协同优化。例如,S2VC和PLVC等方法直接使用Stable Diffusion或类似的大规模潜空间模型作为解码器,这些模型在训练时从未见过量化后的压缩特征,导致重建时对码率分配不敏感,常常在纹理区域浪费比特,而在边缘等关键区域却重建不足。此外,继承的预训练模型通常包含数十亿参数,推理延迟极高,难以满足实时视频通信的需求。
微软亚洲研究院联合中国传媒大学、中科大、中科院数学所提出的 GenVC ,彻底打破了这种范式。它从零开始训练一个像素域视频扩散模型,让压缩目标(率失真优化)直接塑造扩散模型的每一个参数。这就好像不再让一个“通用画家”来给你画视频,而是训练一个“专攻压缩的画家”,他知道哪里需要细节、哪里可以模糊,用最少的笔触(码率)画出最逼真的画面。GenVC的核心洞察在于:视频压缩本质上是一个条件生成问题,解码器需要根据有限的压缩比特流尽可能逼真地重建原始视频。因此,扩散模型应当与编码器端到端联合训练,使得编码器学会提取对扩散生成最有利的紧凑表示,而扩散模型则学会高效利用这些表示。
下图展示了 GenVC 的整体框架。左边是传统的视频编码器-解码器(含上下文建模),右边是本文的核心——联合训练的像素域视频扩散模型。压缩后的条件序列 输入扩散模型,指导扩散过程生成高质量重建。整个系统包括一个基于DCVC-DC架构的上下文编码器/解码器,以及一个全局到局部的像素域扩散模型。编码器将原始视频帧块压缩为潜在表示y,经过量化和熵编码后,解码器将其映射为条件特征c。扩散模型以c为条件,从高斯噪声开始逐步去噪,最终生成重建视频帧。
GenVC 把视频分成连续的 8 帧块(chunk),每块作为一个编码单元。对于每个块,上下文编码器生成紧凑表示 y,量化后经熵模型进行算术编码;上下文解码器将解码后的 ŷ 映射为条件 c。这个条件 c 连同扩散噪声一起进入像素域视频扩散模型,最终输出重建视频。整个管道端到端联合训练,使得扩散模型与编码器相互适应。值得注意的是,编码器部分采用了可微分的量化代理(如直通估计器STE),使得梯度可以反向传播到编码器,从而实现真正的端到端率失真优化。熵模型则基于超先验和上下文模型,能够自适应地估计潜在表示的分布,实现接近无损的算术编码效率。
极低码率下的效果对比令人印象深刻。下图展示了 GenVC 与 GLVC、S2VC、PLVC、GLC-Video 等方法的帧级重建结果。注意 GenVC 的码率是所有对比方法中最低的,但重建质量却最高——细节丰富、纹理真实,完全没有其他方法常见的模糊或块效应。例如,在BasketballDrive序列中,GenVC在0.0020 bpp下重建的球员面部轮廓清晰,球衣号码可辨;而GLVC在0.0035 bpp下已经出现大面积模糊,S2VC和PLVC则产生了明显的块状伪影和颜色失真。这种优势在包含复杂纹理的场景(如树叶、水面、人群)中尤为突出。
运动停滞的幕后黑手:教师侧指导失效
想法很美好:先用多步扩散模型(教师)做高精度解码,再通过分布匹配蒸馏(DMD,Distribution Matching Distillation)把它加速成单步模型(学生),这样就能在推理时同时获得高质量和低延迟。DMD的核心思想是:训练一个“假分数网络”来模拟学生模型的分布,同时利用冻结的教师模型提供真实数据分布的分数估计,两者的差异即为蒸馏梯度,指导学生模型向真实分布靠近。这种方法在图像生成任务中取得了巨大成功,例如Stable Diffusion的蒸馏版本。
但现实给了研究者一记闷棍。直接用 DMD 蒸馏视频模型,学生产生的运动会逐渐“僵化”——视频画面变成了几乎不动的幻灯片。如图8所示,用光流可视化运动时,地面真值(GT)中球员快速移动的明亮光流区域,在停滞学生的重建中变得暗淡破碎,运动几乎消失。更具体地说,在BasketballDrive序列中,GT的光流图显示球员手臂和腿部有连续的高强度运动矢量,而停滞学生的光流图则呈现为离散的、低强度的斑点,表明模型丢失了时序动态信息。这种运动停滞现象在快速运动的场景中尤为严重,导致重建视频看起来像是一系列静态图像的缓慢切换。
经过深入分析,研究者发现了问题的根源:教师侧指导失效 。DMD 依赖冻结的多步教师模型提供真实分数估计(real score),但当学生重建出现运动退化后,其扰动输入会偏离教师在训练时见过的数据分布。教师在这个“陌生”的输入上做出的预测,非但不能恢复被丢失的运动,反而会进一步抑制运动。由此产生的 DMD 更新方向与真实地面方向相悖,形成一个自激发的恶性循环——学生越跑越偏,教师的指导越错越离谱。具体来说,教师模型是在高质量视频数据上训练的,其分数估计函数在高质量数据附近是准确的。当学生模型由于某种原因(如初始化不佳或训练不稳定)产生运动退化的输出时,这些输出经过加噪后形成的分布与教师训练数据的分布存在偏移。教师在这些偏移样本上的分数估计会指向一个错误的“真实”方向,这个方向可能鼓励学生进一步减少运动,因为减少运动在统计上可以降低预测误差(类似于回归到均值)。于是,学生模型被错误地引导向一个“无运动”的局部最优解。
如何在线检测这种恶性循环?研究者发现,每个样本的 DMD 更新方向与真实方向(从当前重建指向地面真值)的 余弦相似度 是一个有效的早期预警信号。如图9所示,在稳定学生训练中,训练时的余弦相似度始终为正(绿色虚线),评估运动误差(绿实线)保持低位;而停滞学生的余弦相似度在约 5000 步附近由正转负(红线),随后运动误差急剧攀升。这个监控指标无须计算光流,在线即可获得。余弦相似度的计算非常简单:对于每个样本,计算DMD梯度向量g_DMD与真实梯度向量g_gt = (X_gt - X_stu)之间的夹角余弦。当余弦值为正时,说明DMD更新方向与真实改进方向一致;当余弦值为负时,说明DMD正在将学生模型推向错误的方向。这个指标不仅可用于检测,还可以作为后续自适应门控的基础。
自适应分数蒸馏:一招破解蒸馏中的误解
既然余弦相似度可以指示每个样本的 DMD 更新是否“靠谱”,那把这种信号变成每个样本的权重不就行了?GenVC 提出了 自适应分数蒸馏(Adaptive Score Distillation) ,核心就是为每个样本的 DMD 梯度加上一个依余弦相似度 soft 衰减的 gate。这种方法的关键在于,它不是简单地丢弃所有低余弦相似度的样本,而是通过一个可微的sigmoid函数实现软门控,使得梯度更新可以平滑地过渡。这样既保留了DMD的分布匹配能力,又防止了错误方向的更新破坏学生模型的运动建模能力。
具体而言,对于 batch 中的第 b 个样本,计算当前重建到地面真值的向量与 DMD 更新向量的余弦相似度 cos(b)gt,然后通过 logistic sigmoid 函数求出权重 wb = σ((cos(b)gt − τ) / κ),其中 τ 是阈值,κ 是温度。然后学生参数的梯度中,每个样本的贡献乘以 w2b。这样,方向正确的更新得到保留并驱动分布匹配,方向相反的更新被抑制到接近零。图7直观展示了这一过程。阈值τ通常设置为0(即余弦相似度为正时保留,为负时抑制),温度κ控制门控的软硬程度,κ越小门控越接近硬阈值。在实验中,κ设置为0.1,τ设置为0.0,取得了最佳效果。
整个蒸馏过程包括两个阶段:
阶段一:联合初始化。 将学生初始化为多步教师模型,与视频编码器联合训练,使用 Linit = Ldist + λR LR,其中 Ldist 包含像素损失(L1)、LPIPS 感知损失和光流损失(EPE)。光流损失使用预训练的RAFT网络计算,确保学生模型在初始化阶段就具备基本的运动建模能力。λR设置为0.1,平衡率失真项与蒸馏项。
阶段二:冻结编码器,微调扩散学生。 同时更新在线假分数网络(fake score network)。优化目标为 L = λD LDMD + Ldist,其中 LDMD 是带自适应门控的 DMD 损失。λD设置为1.0,假分数网络采用与教师相同的架构但参数独立,通过流匹配损失进行更新。冻结编码器的目的是防止蒸馏过程中的梯度干扰编码器的率失真优化,确保编码器已经学习到最优的压缩表示。
完整的训练步骤在算法1中给出,这里用中文伪代码概括核心逻辑:
算法1:自适应分数蒸馏(单个训练步)
1. 更新假分数网络(多步):
- 对 batch 中每个样本,用学生生成重建 ˆX_stu
- 加入扰动构造 X_t,计算教师预测 ˆX_real 和假网络预测 ˆX_fake
- 用流匹配损失更新假网络
2. 更新学生参数(一步):
- 对每个样本计算 DMD 更新 g = ˆX_real − ˆX_fake
- 计算余弦相似度 cos_gt = cos(g, X − ˆX_stu)
- 计算权重 w = sigmoid((cos_gt − τ) / κ)
- 门控 DMD 损失:L_DMD = (1/(2BP)) Σ w² ||ˆX_stu − sg(ˆX_stu + g)||²
- 总损失:L = λ_D L_DMD + L_dist
- 反向传播更新学生
这种自适应门控的效果在视频上非常明显。图3展示了沿时间轴的二维条形堆叠图,其中每一行对应一帧中相同水平切片的像素。与地面真值一致的运动轨迹应为连续平滑的斜线,而无门控的蒸馏结果出现了明显的阶梯状间断,正是运动停滞的体现。具体来说,在BasketballDrive序列中,取第100行像素沿时间轴堆叠,GT显示球员手臂移动形成连续的对角线纹理;自适应门控的学生重建几乎完美复现了这一纹理;而无门控的学生重建中,对角线变成了阶梯状,表明帧与帧之间的运动被离散化了。
全局到局部架构:像素空间的高效重建
在像素空间做视频扩散,最大的挑战是计算量——直接在高分辨率视频上跑 Transformer 自注意力,显存和算力都会爆炸。GenVC 采用了一种 全局到局部(Global-to-Local)层次化架构 ,在保持全局建模能力的同时,通过局部细化模块恢复精细的时空细节。这种设计的灵感来源于人类视觉系统:先快速获取场景的整体结构,再聚焦于局部细节。在计算资源有限的情况下,这种由粗到细的策略可以最大化利用算力。
全局分支(DiT): 输入为噪声帧 Xt、条件序列 c 和扩散时间 t。在空间上 16 倍下采样、时间上 8 倍下采样的 token 网格上运行标准的 DiT 块。这个低分辨率网格上自注意力的计算成本可控,能够捕获帧间长程依赖和场景结构。具体来说,对于1080p视频(1920x1080),空间下采样16倍后得到120x68的网格,时间下采样8倍后8帧变为1帧,因此全局分支处理的token数量仅为120x68x1=8160个,远低于全分辨率下的数百万个。每个DiT块包含时空自注意力(在空间和时间维度上分别做注意力)和MLP,共使用12个DiT块。
局部分支(Patch Refine + Frame Refine): 为了避免高分辨率像素级 adaLN 带来的巨大内存消耗(如图6所示,直接使用像素级调制在 32 帧 1080p 上直接爆 80GB 显存),GenVC 在空间 8 倍、时间 2 倍下采样的中间特征网格上运行 Patch Refine 块。DiT 输出先上采样到该网格,然后通过 Patch Modulation 为每个网格单元预测一组 adaLN 参数,实现全局上下文对局部特征的注入。接着用轻量级的时空卷积(2D 空间卷积 + 1D 时间卷积)进行局部混合,恢复纹理和短时运动。最终 Frame Refine 头恢复全分辨率输出 RGB 帧。Patch Refine块的设计非常高效:每个块仅包含一个3x3空间卷积和一个3x1时间卷积,通道数为128,参数量仅为0.5M左右。共使用4个Patch Refine块。
图6的消融实验清楚显示了每个组件的贡献:从纯 DiT 基线(416M 参数)开始,加上 Patch Modulation 和时空卷积后,参数仅增加至 478M,但 BD-LPIPS 从 0.000 改善到 -0.087,BD-FID 从 0.00 改善到 -25.51(越低越好)。这说明局部细化模块以极小的参数代价换来了显著的感知质量提升。进一步消融显示,如果移除Patch Modulation(改为简单的加法融合),BD-LPIPS退化到-0.032;如果移除时空卷积(改为MLP),BD-LPIPS退化到-0.041。这验证了每个组件的必要性。
实验效果:码率省60%,速度飙15fps
GenVC 在标准测试集 HEVC Class B、HEVC Class C、UVG、MCL-JCV 上进行了全面评估,与 GLVC、S2VC、PLVC、GLC-Video 等 SOTA 生成式视频编解码器对比。评价指标包括 LPIPS(感知相似度)和 FID(Fréchet Inception Distance,分布距离),码率用 bpp(bits per pixel)衡量。所有对比方法均使用其官方实现或作者提供的预训练模型,在相同的测试条件下进行评估。为了公平比较,所有方法的编码器部分均使用相同的上下文模型架构(DCVC-DC),仅解码器部分不同。
核心结果通过 BD-rate(Bjontegaard delta rate)呈现,表示在相同感知质量下码率节省的百分比。下面的表格总结了 GenVC 相对 GLVC 的 BD-rate 节省(负值代表码率降低):
更多定量对比可参考论文中的表格。这里直接说几个关键数字:
- 模型参数: 仅 478.0M,远小于现有方法中继承的百亿参数骨干网络(如 Stable Diffusion 的 ~1.5B)。具体参数分布为:编码器45M,上下文模型32M,全局DiT 316M,局部细化模块85M。总参数量仅为GLVC的1/3,S2VC的1/5。
- 解码速度: 多步教师模型在 A100 上只能达到 0.40 fps(1080p),蒸馏后的单步 GenVC 达到 15.1 fps ,提升了 37 倍以上,实现了实时解码的实用门槛。速度测试使用PyTorch的FP16推理,batch size为1。值得注意的是,15.1 fps已经超过了传统视频编解码器(如H.265)在相同质量下的解码速度,使得GenVC具备了实际部署的潜力。
- 主观质量: 如图2所示,即使在最低码率 (0.0020 bpp) 下,GenVC 重建的人脸、纹理依然清晰自然,而其他方法已经出现严重模糊或伪影。在用户主观测试(MOS)中,GenVC在0.002 bpp下的MOS得分为4.2(满分5),而GLVC在0.0035 bpp下仅为3.1,S2VC为2.8。
创新点总结与未来启示
1. 首个压缩导向的视频扩散模型。 从零训练,像素域,与视频编码器联合优化。专注压缩,模型虽小(478M)但效果超越继承百亿参数骨干的方法。这一范式转变表明,对于特定任务,定制化的小模型可以胜过通用的大模型,为视频压缩领域开辟了新的研究方向。
2. 揭示了教师侧指导失效。 发现了蒸馏视频模型时特有的运动停滞问题,并提供了在线监控指标(余弦相似度)。这一发现对于所有 DMD 蒸馏视频的应用都有重要参考价值。它提醒研究者,在将图像领域的蒸馏方法迁移到视频时,必须考虑时序动态的特殊性,简单的直接迁移可能导致灾难性的失败。
3. 自适应分数蒸馏。 一个简单而有效的门控机制,防止诱导更新破坏学生运动,同时保留 DMD 的分布匹配能力。这个方法的思路(用真实方向作为参考来筛选逆梯度)可以推广到其他 distillation 场景,例如文本到视频生成、视频超分辨率等需要保持时序一致性的任务。
未来,可以探索将这种压缩导向扩散模型扩展到更长时、更高分辨率的视频。另外,自适应门控可以结合更先进的蒸馏策略,如对抗性蒸馏或一致性蒸馏,进一步提升重建质量。对于实际落地,15fps 的 1080p 解码速度已接近可用,但推理还需要在更廉价的硬件(如手机 NPU)上验证。此外,将GenVC扩展到4K/8K分辨率,以及支持可变帧率(VFR)的视频压缩,也是重要的未来方向。
龙迷三问
Q1:GenVC 的“像素域扩散”和“潜空间扩散”有什么区别,为什么选择像素域? A1:潜空间扩散(如 Stable Diffusion)在 VAE 压缩后的低维潜空间上做扩散,而像素域扩散直接在原始像素空间进行。像素域的好处是避免了 VAE 重建带来的信息损失(这对压缩任务很关键),并且训练更简单(单阶段)。但缺点是需要处理高分辨率张量,所以 GenVC 用全局到局部架构来控制计算量。之前的 CoD 系列在图像压缩上已验证了像素域扩散的有效性,GenVC 将其扩展到视频。此外,像素域扩散可以更自然地与光流损失等像素级监督信号结合,有利于保持时序一致性。
Q2:DMD 和自适应分数蒸馏中的“分数”是什么意思? A2:“分数”在这里指扩散模型估计的概率密度梯度(score function)。DMD 使用两个分数网络的差来更新学生。自适应分数蒸馏通过余弦相似度门控来调节这个分数更新。本质上,DMD 是一种通过匹配分布来蒸馏的方法,而自适应版本防止了分布不匹配导致的误导。更技术性地讲,分数函数∇log p(x)表示在点x处概率密度增长最快的方向,DMD利用教师和假网络的分数差来指导学生生成样本向真实数据分布移动。
Q3:GenVC 和其他扩散视频编解码器(如 S2VC、VideoG4C)比,除了参数量小,还有什么优势? A3:核心优势有三:(1)联合训练——扩散模型与编码器相互适应,而不是用固定预训练骨架;(2)像素域重建——避免潜空间扩散的 VAE 失真,细节更清晰;(3)运动感知蒸馏——自适应分数蒸馏保证了时序一致性,这是其他方法蒸馏后运动退化问题未专门解决的。实验结果也佐证了这些优势:在相同码率下 LPIPS/FID 最优,且速度快一个数量级。此外,GenVC的编码器也经过专门优化,能够提取对扩散生成最有利的紧凑表示,而其他方法通常直接使用现成的图像编码器。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
可能的问题: 论文实验充分、写作扎实。主要遗憾是未在更低计算量的硬件(如消费级 GPU 或手机端)上测试推理速度,且未开源代码(截至发文时)。自适应门控需要在线计算余弦相似度,增加了一点点训练开销(可忽略)。另外,目前只测试了 8 帧 GOP,更长时依赖性尚未验证。此外,模型在极端低码率(<0.001 bpp)下的表现尚未充分探索,可能存在质量悬崖效应。
主要参考文献
[1] Generative Video Compression. Naifu Xue et al. arXiv 2607.22772v1, 2026.
[2] GLVC: Generative Latent Video Compression. Li et al. CVPR 2024.
[3] Distribution Matching Distillation (DMD). Yin et al. ICLR 2024.
[4] CoD: Compression-oriented Diffusion for Image Compression. Xue et al. CVPR 2025.
[5] DCVC-DC: Deep Contextual Video Compression. Li et al. IEEE TIP 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!