← 返回 PaperDaily
视觉与图像
DCC 2026新作FSFVE:10帧人脸,100秒内把压缩视频救回来
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
龙哥读论文
发布于 2026-08-20 00:20:04
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
原论文信息如下:
视频通话卡的让人抓狂?10帧人脸就能救回来
视频通话最烦的不是“对方麦克风没开”,而是明明人还在,脸却糊得像被压缩软件狠狠干了一拳。带宽一紧,画面就开始掉块、起雾、长噪点,尤其是眼睛、嘴巴、下巴这些最能暴露身份的地方,直接从“在线交流”变成“像素猜人”。
这篇论文的名字叫 FSFVE: Few Shot Compressed Face Video Enhancement ,核心就一句话:只用 10 到 30 帧人脸,100 秒内训练出一个能在 CPU 上实时跑的增强模型 。这不是“再来一个更大的脸部修复网络”,而是把问题掰成了“少样本、快收敛、低算力、能落地”四个硬指标。
为什么小模型反而能大显身手?——DCT+MLP的巧妙组合
先说人话:通话里的压缩失真不是“随机发病”,而是高度稳定地围着人脸结构转。只要把训练对象缩小到某一个人的某一段通话,模型就不需要学“全人类的脸”,只需要学“这张脸在这次通话里怎么被压坏、又该怎么补回来”。这就是 FSFVE 能用很少样本起飞的原因。
论文先把人脸裁成固定大小的区域,再做对齐,避免模型一会儿看左眼、一会儿看右耳,训练数据被姿态变化搅成一锅粥。这里用到的 DCT 是 Discrete Cosine Transform,离散余弦变换 ,它本来就常见于图像压缩和 JPEG 编码。简单理解,DCT 会把一块图像拆成“低频信息”和“高频信息”:低频对应大轮廓,高频对应细纹理和边缘。
FSFVE 的聪明之处就在这里:它没有上来就堆一堆卷积层,而是把每个 8×8 小块交给 MLP 处理。因为块大小固定,推理时可以直接按块并行跑,步长也能和块大小一致,速度就很可观。换句话说,CNN 负责“看图”,这里的 MLP 更像“算账”,算得快、算得稳,还能把参数量做上去而不至于把 CPU 烧红。
更关键的是激活函数。论文没有用常规 ReLU,而是用了 sine ,也就是正弦激活。对应的思想来自 Implicit neural representations with periodic activation functions ,引用自 Sitzmann 等人在 NeurIPS 2020 的工作。为什么偏要用正弦?因为脸部细节、压缩纹理这些东西本来就带有明显的高频波动,周期函数对这类信号更友好,梯度也更平滑,训练时更容易把细节“抠”出来。
只学100秒,效果能好多少?
这部分最像工程现场,而不是论文答辩现场。FSFVE 的训练设置非常克制:每个视频只取 30 张训练帧,训练 100 个 epoch,平均不到 100 秒。优化器用的是 RAdam ,也就是 Rectified Adam,校正后的自适应矩估计优化器 。它的思路是让早期训练更稳一点,别一上来就把少样本场景训崩。
训练数据来自 DeepFakeDetection 数据集里“talking against wall”类别的视频。论文选这个类别不是为了碰瓷深度伪造,而是因为它们大多是正面坐姿、接近视频通话场景,画面构图和真实通话很像。为了模拟低带宽环境,作者用 H.264 和 H.265 两种编码器,再配合不同的 CRF 值压缩视频。CRF 是 Constant Rate Factor,恒定质量因子 ,数值越大,压缩越狠,画面越糊。
更有意思的是和两个 CPU 友好基线的对比。一个是小型 ResNet,另一个是去掉参考图的 RTFVE-0。前者参数少到只有大约 6000 个,后者虽然有 10 万级参数,但在少样本、短训练时间下学不动。FSFVE 则在参数量接近百万的情况下,依然能保持约 30 FPS 的推理速度。也就是说,这篇论文不是“参数少所以快”,而是“结构设计得对,所以参数多也不慢”。这就很有工程味道了。
论文还给出了 BD-Rate 和 BD-PSNR。前者是 Bjøntegaard Delta Rate ,后者是 Bjøntegaard Delta PSNR ,都是用来比较率失真曲线优劣的常见指标。FSFVE 的 BD-Rate 为 -25.1211%,BD-PSNR 为 1.3253 dB,意思很明确:在同样压缩条件下,它能把画质往回拉一截,而且这个提升不是边角料级别的。
眼见为实:压缩糊脸真的能“翻新”
图 2 展示的是 CRF 44 的高压缩样例。原始压缩帧里,眼睛、嘴唇、下巴附近的块状伪影特别明显,皮肤纹理也被压得很奇怪,甚至会出现一些竖线和锯齿。FSFVE 的输出把这些问题明显缓和了:脸部边缘更稳,皮肤更自然,眼口区域也更接近真实外观。
这类结果最难得的地方,不是“看起来更顺眼”这么简单,而是它还能尽量保持身份一致性。人脸增强最怕的就是一顿操作猛如虎,最后把本人修成了“亲戚脸”。FSFVE 的输出没有明显把五官结构改歪,这说明它学到的是压缩失真修复,而不是胡乱脑补。
论文还给出了率失真曲线。曲线的意思很朴素:同样的压缩强度下,谁能把画质往上抬得更多,谁就更强。FSFVE 的曲线整体压过基线,而且在高压缩区间优势更大,这和前面的定量结果是互相呼应的。
总结与启示:小样本、快训练、实时推理,未来视频通话增强的标配?
FSFVE 最值得学的,不是某个炫技模块,而是它把问题定义得非常工程化:先限定场景,再压缩模型,再围绕真实部署约束反推结构 。这和很多“先把模型做大,再想办法让它跑起来”的套路正好相反。它不是在追求通用性幻觉,而是在追求通话场景里的真有效。
当然,这个方法也有边界。它依赖少量高质量样本,适合“同一个人、同一段通话”的实例化增强;如果换成多人切换、剧烈遮挡、极端侧脸,或者训练样本本身就很差,效果未必还能这么稳。换句话说,它更像“视频会议专用修复外挂”,不是万能人脸修复瑞士军刀。
但它的启发非常实在:未来很多端侧视觉任务,未必都要靠大模型硬扛。只要场景足够明确,样本足够少,约束足够硬,就完全可能通过“块级建模 + 频域表示 + 轻量网络”做出能部署的方案。对于视频会议、远程教育、边缘设备上的人脸增强,这种思路比单纯堆算力更接近产品化。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“视频通话被压缩得太糊,但又必须实时增强”的问题。FSFVE 不是离线修图,而是面向通话场景的端侧增强:少量样本、快速训练、CPU 实时推理,目标就是让低带宽下的人脸画面别再一塌糊涂。
DCT、LPIPS、CRF 这些缩写分别是什么意思? DCT 是离散余弦变换,常用于压缩;LPIPS 是 Learned Perceptual Image Patch Similarity,中文可理解为“学习型感知图像块相似度”,越低越像;CRF 是 Constant Rate Factor,恒定质量因子,数值越大压缩越狠、画面越差。
为什么它不用更大的 CNN 或扩散模型? 因为通话场景不允许。更大的模型通常更慢、更吃算力,还未必能在少样本下快速收敛。FSFVE 选择 DCT+MLP 的组合,是为了在“能学、学得快、还能实时跑”之间找平衡,这才是它真正的设计重点。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
把少样本实例化增强、频域建模、CPU 实时推理拼在一起,思路不算离经叛道,但组合得很务实。
实验合理度: ★★★★☆
对比了压缩基线、轻量 ResNet、RTFVE-0,并做了压缩率、训练帧数和消融实验,链条比较完整。
学术研究价值: ★★★★☆
它把“视频通话增强”这个应用场景讲透了,对端侧视觉、少样本个性化模型都有启发。
稳定性: ★★★☆☆
在固定人脸、固定通话场景里表现不错,但对姿态、遮挡和更复杂多人场景的适应性还需要进一步验证。
适应性以及泛化能力: ★★★☆☆
更像“实例专用”方案,不是泛化万能模型;换场景后大概率要重新训练。
硬件需求及成本: ★★★★☆
推理端 CPU 可跑是亮点,训练虽然也不算重,但仍需要可用的清晰样本和一定的预处理开销。
复现难度: ★★★★☆
代码已开源,数据和压缩流程也写得比较清楚,主要难点在于预处理和严格复现训练设置。
产品化成熟度: ★★★☆☆
在视频会议这类固定人脸、短时增强场景里有落地潜力,但要进产品还得补上多人场景、隐私保护和异常输入处理。
可能的问题: 更像实例化修复而非通用增强,依赖少量高质量样本;对复杂姿态和跨场景泛化的论证还不够充分。
主要参考文献
[1] Varun Ramesh Jois, Antonella DiLillo, James Storer. FSFVE: Few Shot Compressed Face Video Enhancement. DCC 2026.
[2] 代码地址:https://github.com/varun-jois/FSFVE
[3] 项目演示:https://sigport.org/documents/fsfve
[4] 原文链接:https://arxiv.org/pdf/2607.11040v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
压缩视频别再“糊成马赛克”了,少样本、快训练、CPU实时跑,这类能落地的技术更值得盯紧。