← 返回 PaperDaily 视觉与图像

DCC 2026新作FSFVE:10帧人脸,100秒内把压缩视频救回来

这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。

DCC 2026新作FSFVE:10帧人脸,100秒内把压缩视频救回来
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。


原论文信息如下:
论文标题:
FSFVE: Few Shot Compressed Face Video Enhancement
发表日期:
2026年07月
发表单位:
Brandeis University
原文链接:
https://arxiv.org/pdf/2607.11040v1.pdf
开源代码链接:
https://github.com/varun-jois/FSFVE
项目链接:
https://sigport.org/documents/fsfve

视频通话卡的让人抓狂?10帧人脸就能救回来

视频通话最烦的不是“对方麦克风没开”,而是明明人还在,脸却糊得像被压缩软件狠狠干了一拳。带宽一紧,画面就开始掉块、起雾、长噪点,尤其是眼睛、嘴巴、下巴这些最能暴露身份的地方,直接从“在线交流”变成“像素猜人”。
模型整体效果展示
演示视频展示了 FSFVE 对低质量人脸视频的增强前后对比。它的思路很直接:不跟整段视频死磕,而是先抓住“这个人这次通话里的脸长什么样”,再用少量样本快速训练一个专属增强模型。
这篇论文的名字叫 FSFVE: Few Shot Compressed Face Video Enhancement,核心就一句话:只用 10 到 30 帧人脸,100 秒内训练出一个能在 CPU 上实时跑的增强模型。这不是“再来一个更大的脸部修复网络”,而是把问题掰成了“少样本、快收敛、低算力、能落地”四个硬指标。

为什么小模型反而能大显身手?——DCT+MLP的巧妙组合

先说人话:通话里的压缩失真不是“随机发病”,而是高度稳定地围着人脸结构转。只要把训练对象缩小到某一个人的某一段通话,模型就不需要学“全人类的脸”,只需要学“这张脸在这次通话里怎么被压坏、又该怎么补回来”。这就是 FSFVE 能用很少样本起飞的原因。
论文先把人脸裁成固定大小的区域,再做对齐,避免模型一会儿看左眼、一会儿看右耳,训练数据被姿态变化搅成一锅粥。这里用到的 DCTDiscrete Cosine Transform,离散余弦变换,它本来就常见于图像压缩和 JPEG 编码。简单理解,DCT 会把一块图像拆成“低频信息”和“高频信息”:低频对应大轮廓,高频对应细纹理和边缘。
公式:输入帧按通道划分为多个非重叠块
图中这一步是在说:输入帧 I 被切成多个大小为 B×B 的小块,每个小块再按三个颜色通道分别处理。这里的 N 是块数,c=1,2,3 对应 RGB 三个通道。
公式:对每个图像块做二维DCT
这一步是把每个图像块送进二维 DCT 变换,得到频域表示 D。通俗点说,就是把“像素长什么样”换成“这块图像由哪些频率成分组成”。
公式:将三个通道的DCT块拼接成MLP输入
接着,三个通道的 DCT 块被拉直并拼接成一个向量 xi0,长度是 3B²。这就是后面 MLP 的输入。这里的 MLP 是 Multilayer Perceptron,多层感知机,本质上就是一串全连接层。它不擅长处理大图,但擅长处理固定长度向量,正好适合这种“块级”任务。
FSFVE 的聪明之处就在这里:它没有上来就堆一堆卷积层,而是把每个 8×8 小块交给 MLP 处理。因为块大小固定,推理时可以直接按块并行跑,步长也能和块大小一致,速度就很可观。换句话说,CNN 负责“看图”,这里的 MLP 更像“算账”,算得快、算得稳,还能把参数量做上去而不至于把 CPU 烧红。
更关键的是激活函数。论文没有用常规 ReLU,而是用了 sine,也就是正弦激活。对应的思想来自 Implicit neural representations with periodic activation functions,引用自 Sitzmann 等人在 NeurIPS 2020 的工作。为什么偏要用正弦?因为脸部细节、压缩纹理这些东西本来就带有明显的高频波动,周期函数对这类信号更友好,梯度也更平滑,训练时更容易把细节“抠”出来。
公式:MLP中的正弦激活层
这里的每一层都写成 x(l)=sin(W(l)x(l-1)+b(l))。别被公式吓到,意思就是:上一层输出先做线性变换,再过一个正弦函数。论文还特别强调了初始化方式要配合正弦激活,否则数值分布容易飘,训练会发疯。
公式:残差预测
最后,模型不是直接预测增强后的块,而是预测残差,再加回输入。这个设计的好处很朴素:压缩视频里大部分像素已经“差不多对了”,模型只需要修补被量化和压缩毁掉的那一小撮信息。这样更容易收敛,也更像在做“反向修复”而不是“从零重画一张脸”。

只学100秒,效果能好多少?

这部分最像工程现场,而不是论文答辩现场。FSFVE 的训练设置非常克制:每个视频只取 30 张训练帧,训练 100 个 epoch,平均不到 100 秒。优化器用的是 RAdam,也就是 Rectified Adam,校正后的自适应矩估计优化器。它的思路是让早期训练更稳一点,别一上来就把少样本场景训崩。
训练数据来自 DeepFakeDetection 数据集里“talking against wall”类别的视频。论文选这个类别不是为了碰瓷深度伪造,而是因为它们大多是正面坐姿、接近视频通话场景,画面构图和真实通话很像。为了模拟低带宽环境,作者用 H.264 和 H.265 两种编码器,再配合不同的 CRF 值压缩视频。CRFConstant Rate Factor,恒定质量因子,数值越大,压缩越狠,画面越糊。
表1:不同编码器和压缩率下的性能表现
表 1 给的是主结果。评价指标有三个:PSNRSSIMLPIPS。其中 PSNR 是峰值信噪比,越高越好;SSIM 是结构相似度,越高越好;LPIPS 是感知相似度,越低越好。FSFVE 在 H.264 和 H.265 的多个压缩档位上都稳定提升,尤其在更高压缩率下更明显,说明它不是只会在“没那么糊”的视频上刷分,而是真的更擅长处理重压缩场景。
更有意思的是和两个 CPU 友好基线的对比。一个是小型 ResNet,另一个是去掉参考图的 RTFVE-0。前者参数少到只有大约 6000 个,后者虽然有 10 万级参数,但在少样本、短训练时间下学不动。FSFVE 则在参数量接近百万的情况下,依然能保持约 30 FPS 的推理速度。也就是说,这篇论文不是“参数少所以快”,而是“结构设计得对,所以参数多也不慢”。这就很有工程味道了。
论文还给出了 BD-Rate 和 BD-PSNR。前者是 Bjøntegaard Delta Rate,后者是 Bjøntegaard Delta PSNR,都是用来比较率失真曲线优劣的常见指标。FSFVE 的 BD-Rate 为 -25.1211%,BD-PSNR 为 1.3253 dB,意思很明确:在同样压缩条件下,它能把画质往回拉一截,而且这个提升不是边角料级别的。
表2:训练样本数量对PSNR的影响
表 2 说明了少样本到底少到什么程度还能工作。训练帧从 5 张涨到 30 张,PSNR 持续上升,但 5 张时也已经能比压缩基线高出不少。这个结果很适合视频通话场景:通话刚开始时,哪怕只收集到几帧清晰画面,也足够让模型先“热身”,不至于全程裸奔。
表3:消融实验
表 3 是消融实验,最能看出方法到底靠什么吃饭。先在 RGB 空间做块级建模,效果已经比基线好一些;再切到频域,性能继续涨;最后加上频率焦点损失,PSNR 和 SSIM 再往上推。这个链条很清楚:块级建模解决速度,频域表示解决压缩失真更好学,频率焦点损失解决收敛慢的问题。三者拼起来,才有了“100 秒训练、CPU 实时跑”的整体效果。
公式:频率域焦点损失
这里的 频率域焦点损失,本质上是给不同 DCT 系数分配不同权重。它不是平均用力,而是把更多注意力放到低频部分,因为低频对视觉观感最关键。
公式:权重与JPEG量化矩阵成反比
权重 wi,j=1/Qi,j 取自 JPEG 亮度量化矩阵的倒数。JPEG 量化矩阵里,低频位置的数值通常更小,说明这些系数更重要;取倒数之后,损失函数就会更偏爱这些关键成分。说白了,就是“先救脸型和五官,再抠毛边和噪点”,训练自然更贴近人眼感受。

眼见为实:压缩糊脸真的能“翻新”

图 2 展示的是 CRF 44 的高压缩样例。原始压缩帧里,眼睛、嘴唇、下巴附近的块状伪影特别明显,皮肤纹理也被压得很奇怪,甚至会出现一些竖线和锯齿。FSFVE 的输出把这些问题明显缓和了:脸部边缘更稳,皮肤更自然,眼口区域也更接近真实外观。
这类结果最难得的地方,不是“看起来更顺眼”这么简单,而是它还能尽量保持身份一致性。人脸增强最怕的就是一顿操作猛如虎,最后把本人修成了“亲戚脸”。FSFVE 的输出没有明显把五官结构改歪,这说明它学到的是压缩失真修复,而不是胡乱脑补。
论文还给出了率失真曲线。曲线的意思很朴素:同样的压缩强度下,谁能把画质往上抬得更多,谁就更强。FSFVE 的曲线整体压过基线,而且在高压缩区间优势更大,这和前面的定量结果是互相呼应的。
图1:本方法的率失真曲线
图 1 说明了 FSFVE 在不同压缩条件下的整体表现。压缩越狠,传统方法越容易失守;而 FSFVE 反而在更糟糕的条件下更显得有价值,因为它正好是为“带宽不够、画面很烂”的场景而生。

总结与启示:小样本、快训练、实时推理,未来视频通话增强的标配?

FSFVE 最值得学的,不是某个炫技模块,而是它把问题定义得非常工程化:先限定场景,再压缩模型,再围绕真实部署约束反推结构。这和很多“先把模型做大,再想办法让它跑起来”的套路正好相反。它不是在追求通用性幻觉,而是在追求通话场景里的真有效。
当然,这个方法也有边界。它依赖少量高质量样本,适合“同一个人、同一段通话”的实例化增强;如果换成多人切换、剧烈遮挡、极端侧脸,或者训练样本本身就很差,效果未必还能这么稳。换句话说,它更像“视频会议专用修复外挂”,不是万能人脸修复瑞士军刀。
但它的启发非常实在:未来很多端侧视觉任务,未必都要靠大模型硬扛。只要场景足够明确,样本足够少,约束足够硬,就完全可能通过“块级建模 + 频域表示 + 轻量网络”做出能部署的方案。对于视频会议、远程教育、边缘设备上的人脸增强,这种思路比单纯堆算力更接近产品化。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“视频通话被压缩得太糊,但又必须实时增强”的问题。FSFVE 不是离线修图,而是面向通话场景的端侧增强:少量样本、快速训练、CPU 实时推理,目标就是让低带宽下的人脸画面别再一塌糊涂。

DCT、LPIPS、CRF 这些缩写分别是什么意思?DCT 是离散余弦变换,常用于压缩;LPIPS 是 Learned Perceptual Image Patch Similarity,中文可理解为“学习型感知图像块相似度”,越低越像;CRF 是 Constant Rate Factor,恒定质量因子,数值越大压缩越狠、画面越差。

为什么它不用更大的 CNN 或扩散模型?因为通话场景不允许。更大的模型通常更慢、更吃算力,还未必能在少样本下快速收敛。FSFVE 选择 DCT+MLP 的组合,是为了在“能学、学得快、还能实时跑”之间找平衡,这才是它真正的设计重点。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把少样本实例化增强、频域建模、CPU 实时推理拼在一起,思路不算离经叛道,但组合得很务实。

实验合理度:★★★★☆

对比了压缩基线、轻量 ResNet、RTFVE-0,并做了压缩率、训练帧数和消融实验,链条比较完整。

学术研究价值:★★★★☆

它把“视频通话增强”这个应用场景讲透了,对端侧视觉、少样本个性化模型都有启发。

稳定性:★★★☆☆

在固定人脸、固定通话场景里表现不错,但对姿态、遮挡和更复杂多人场景的适应性还需要进一步验证。

适应性以及泛化能力:★★★☆☆

更像“实例专用”方案,不是泛化万能模型;换场景后大概率要重新训练。

硬件需求及成本:★★★★☆

推理端 CPU 可跑是亮点,训练虽然也不算重,但仍需要可用的清晰样本和一定的预处理开销。

复现难度:★★★★☆

代码已开源,数据和压缩流程也写得比较清楚,主要难点在于预处理和严格复现训练设置。

产品化成熟度:★★★☆☆

在视频会议这类固定人脸、短时增强场景里有落地潜力,但要进产品还得补上多人场景、隐私保护和异常输入处理。

可能的问题:更像实例化修复而非通用增强,依赖少量高质量样本;对复杂姿态和跨场景泛化的论证还不够充分。


主要参考文献

[1] Varun Ramesh Jois, Antonella DiLillo, James Storer. FSFVE: Few Shot Compressed Face Video Enhancement. DCC 2026.
[2] 代码地址:https://github.com/varun-jois/FSFVE
[3] 项目演示:https://sigport.org/documents/fsfve
[4] 原文链接:https://arxiv.org/pdf/2607.11040v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
压缩视频别再“糊成马赛克”了,少样本、快训练、CPU实时跑,这类能落地的技术更值得盯紧。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。