← 返回 PaperDaily 视觉与图像

TIGER登场:一招搞定人脸视频修复三大难题?

TIGER专治人脸视频修复里的三大顽疾:身份偏移、视角纠缠和“修得像但不像本人”。它把身份、几何和生成先验一起拉上场,还顺手做了一个大规模数据集,属于能打又能落地的那种。

TIGER登场:一招搞定人脸视频修复三大难题?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
TIGER专治人脸视频修复里的三大顽疾:身份偏移、视角纠缠和“修得像但不像本人”。它把身份、几何和生成先验一起拉上场,还顺手做了一个大规模数据集,属于能打又能落地的那种。


原论文信息如下:
论文标题:
TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
发表日期:
2026年06月
发表单位:
MiLM Plus, Xiaomi Inc.; The Hong Kong University of Science and Technology (Guangzhou)
原文链接:
https://arxiv.org/pdf/2606.24336v1.pdf
项目链接:
https://yzhoulv.github.io/Tiger/

人脸视频恢复的“不可能三角”,TIGER如何破局?

人脸视频恢复这事,看起来像“把糊掉的脸修清楚”这么简单,实际一脚踩进来就知道:既要像本人,又要每一帧都稳,还得看起来真实,三件事谁都不好惹。论文把这个难题总结成一个很形象的三难题:身份偏移、视角纠缠引导、感知真实感不足。翻译成人话就是:修复模型很容易“长得像,但不是这个人”;参考图能帮忙认脸,但一旦视频里头转脸、抬头、低头,静态参考就开始露馅;而那些为了快一点的一步式方法,又常常把纹理修得太平,像拿砂纸把脸磨了一遍。
VFHQ 样本 01 的修复效果展示:显示参考帧、退化输入和 TIGER 修复结果的视频对比。
图:VFHQ 样本 01 的修复效果展示。左边是参考帧,中间是退化输入,右边是 TIGER 的修复结果。先看一眼直观感受:它不是单纯“变清晰”,而是更像把脸上的关键信息重新扶正了,尤其眼周和细纹区域,观感更自然。
TIGER 的思路很有意思,它没有只押宝某一种先验,而是把身份先验、几何先验、生成先验三张牌一起打。名字里那个 TIGER,不是说模型会下山抓人脸,而是 Taming Identity, Geometry, and gEnerative pRiors,意思是“驯服身份、几何和生成先验”。这名字起得挺会整活,但方法本身并不花架子:先把“这是谁”钉牢,再把“脸在怎么动”理顺,最后借生成模型的能力把细节补足。
先说一个基础概念,免得后面绕晕。这里的 Face Video Restoration, FVR,中文就是人脸视频恢复,目标是从模糊、压缩、噪声、低分辨率这些退化输入里,把视频恢复到更清楚、更像本人、更稳定的状态。和普通视频修复不一样,人脸视频多了一个“身份”约束:路人甲修成了路人乙,那就不是修复,是换脸事故。

几何先验:为动态人脸构建3D锚点

TIGER 第一招不是直接“脑补”图像,而是先把脸放进一个更规整的空间里:3D 参数空间。这里用到的核心工具是 3D Morphable Model, 3DMM,中文叫三维可变形人脸模型。它的作用可以理解成:别让模型只盯着二维像素瞎猜,先把身份、表情、姿态、平移这些因素拆开摆好,再决定怎么重建。
Figure 2 Overview of the proposed TIGER framework, which Tames Identity, Geometry, and gEnerative pRiors for high-quality FVR. Given a degraded video and a high-quality reference image, we estimate 3D facial parameters to construct geometry-aware constraints that fuse the reference identity with the degraded video’s pose and camera. The resulting geometry prior, together with an identity embedding, conditions a one-step rectified-flow mapper in latent space. We adopt a progressive three-stage optimization strategy: (I) geometry-identity conditioned latent mapping, (II) decoder-coupled detail refinement, and (III) adversarial distribution alignment.
图2:TIGER 的整体框架。它先从退化视频和参考图里提取 3D 人脸参数,再把参考图的身份和退化视频的姿态、相机信息做“跨源融合”,生成几何先验;随后把几何先验和身份嵌入一起喂给一步式 rectified flow 映射器。整个训练还分成三阶段,分别负责结构、纹理和分布真实感。
这里最关键的不是“用了 3D”,而是把身份和运动拆开。参考图负责提供“这张脸应该长什么样”,退化视频负责提供“这个人现在在怎么动”。如果把两者混在一起,参考图会把姿态也一起带进去,结果就是身份和视角纠缠成一团麻;而 TIGER 通过 3DMM 把身份系数和表情、姿态系数分离,再把参考图的身份系数和视频里的运动参数拼回去,形成每一帧都一致的几何锚点。这样做的好处很直接:脸可以转,但骨相不能乱跑。
论文里还把这一步进一步变成了法线图作为几何先验。法线图可以理解成“脸表面朝向哪里”的图,比直接看 RGB 更适合描述结构。它对光照不那么敏感,也更像一张“结构草图”。TIGER 把参考身份和视频运动融合后,渲染出连续的法线图序列,再拿这些图去约束后面的生成过程。说白了,就是先给模型一张不容易跑偏的“骨架图”,再让它往上补肉。
Figure 5 Qualitative comparison of temporal consistency, stacking the yellow line across frames.
图5:时间一致性可视化。把同一条黄色线跨帧叠起来看,就能很直观地发现:稳的方法,线条变化是连贯的;不稳的方法,线条会抖得像喝了三杯浓咖啡。

一步修正流:用生成先验加速并提升真实感

第二招是把恢复问题改写成latent transport,也就是“潜空间搬运”。先别被英文吓到,意思很朴素:不是在像素空间里一顿细抠,而是把视频先编码成更紧凑的潜变量,再把退化潜变量直接搬运到干净潜变量所在的区域。这里的搬运器用的是 rectified flow,中文常译成修正流。它和传统扩散模型最大的不同是:不需要很多步采样,一步就能走,所以推理效率更高。
论文这里借用了视频生成模型的生成先验。所谓生成先验,说白了就是模型在海量视频上学到的“正常脸长啥样、正常运动怎么连贯”的经验。TIGER 没有把它当成万能药,而是让它在几何先验和身份先验的约束下工作。这样一来,生成模型不至于自由发挥到把人脸修成另一个人,也不会因为过度保守而把纹理抹平。
Figure 1 Qualitative and quantitative comparisons with state-of-the-art video restoration methods. Left: Visual comparison of restored facial details, particularly eye regions, demonstrating that TIGER generates more realistic and perceptually pleasing results. Right: 3D scatter plot showing the trade-offs among IDS (identity similarity), LPIPS (perceptual quality), and FVD (temporal consistency). TIGER achieves superior performance in both visual quality and identity preservation.
图1:和当前最强方法的定性、定量对比。左边主要看眼睛、皮肤纹理这些细节,右边用三维散点图展示身份相似度、感知质量和时间一致性的权衡。TIGER 的优势很直观:不是只顾着清楚,还是尽量清楚得像本人。
一步式的难点在于,模型很容易学成“平均脸制造机”——看着啥都对,就是缺少个性。TIGER 为了避免这个毛病,在 rectified flow 的输入里同时塞入了退化潜变量、参考图像潜变量和法线图潜变量;再通过交叉注意力把身份嵌入注入进去。这样生成过程就不是“凭空想象”,而是被几何和身份一起拽着走。论文里还把固定的修正时刻设成 0.4,这相当于给搬运过程选了一个比较稳的落点,既能保留足够的修正空间,又不至于拖得太久。
这里有个很实用的点:TIGER 不是死板地要求一定要有参考图。论文里通过条件 dropout,让模型在训练时学会“有参考图时怎么用、参考图不靠谱时怎么办”。这就像训练一个老司机:有导航时能开,无导航时也不至于原地转圈。对真实部署来说,这一点很重要,因为现实场景里参考图并不总是完美、同步、干净。

三阶段训练:从结构到纹理再到全局真实的渐进优化

如果把前面两步理解成“搭骨架”和“开始上色”,那训练策略就是决定这幅画能不能从草稿变成成品。TIGER 没有一口气端上来就做高难度对抗训练,而是采取了三阶段渐进优化。这个设计挺像修房子:先把地基打牢,再装门窗,最后才做精装修,不能一上来就贴墙纸,不然前面歪了后面全白搭。
Figure 6 Qualitative of ablation study on the three-stage training pipeline.
图6:三阶段训练的消融结果可视化。随着阶段推进,结构更稳、纹理更细、整体更像真实视频。消融图的价值就在这儿——不是只看最后赢没赢,而是看每一步到底有没有把活干对。
第一阶段主要做几何-身份条件下的潜空间映射,重点是让模型先学会“别跑偏”。这时候主要优化 latent 的重建误差,目标很单纯:把大体结构和身份先对上。第二阶段开始把解码器也拉进来,补上像素损失和感知损失 LPIPS,中文常叫感知相似度损失。LPIPS 的作用是让结果不只是数值上接近,还要在视觉上更像真实图像。第三阶段则引入对抗训练,进一步逼近真实人脸视频的分布,让结果少一点“模型味儿”,多一点“真视频味儿”。
这三阶段设计之所以合理,是因为人脸视频恢复里最怕的就是训练目标互相打架:一边想保身份,一边想要纹理锐利,一边又想整段视频像真的。TIGER 把它们拆成先后顺序,先稳住结构,再补细节,最后追求分布真实,等于把“既要又要还要”拆成了有节奏的三步走。这样训练更稳,模型也更不容易在后期把前期学到的身份和结构搞丢。

构建高质量数据集,夯实恢复基础

很多人做修复模型,最后输在数据上。数据如果本身就又糊又小又乱,那模型学到的不是“高质量人脸”,而是“高质量糊脸”。TIGER 这篇论文比较务实,直接自己做了一套质量感知的人脸视频数据筛选流程。这个流程重点看三件事:运动幅度、脸清不清楚、脸占画面比例够不够
Figure 3 Pipeline of the proposed high-quality face video filtering with three core dimensions: (1) motion amplitude, (2) face clarity, and (3) face proportion.
图3:高质量人脸视频筛选流程。它从运动幅度、脸部清晰度和脸部占比三个维度筛数据,目的是留下更适合做人脸恢复监督的样本,而不是把一堆“背景很大、脸很小、还很糊”的视频混进来。
这套筛选逻辑的核心是:别让训练集把模型带歪。运动幅度太大,可能会让跨帧对齐更难;脸太糊,模型学不到高频细节;脸太小,模型会把注意力浪费在背景上。经过筛选后,论文保留了 28,491 个高质量人脸视频样本,用于第一阶段训练。这个数字不算“宇宙级大”,但对 FVR 来说已经很有针对性,因为它强调的是质量优先,而不是单纯堆数量
更重要的是,这个数据集思路和方法设计是配套的。既然方法强调几何先验和身份先验,那训练数据就不能太“野”。高质量、脸占比高、运动可控的数据,才能让模型更好地学会“脸怎么动、身份怎么守、细节怎么补”。否则前面设计得再精巧,后面数据一喂歪,模型也只能学会一本正经地胡说八道。

全面试验:TIGER在多项指标上超越SOTA

实验部分最能看出这篇论文是不是“纸面好看”。TIGER 在 VFHQ-Test 和 VoxCeleb2 上都做了比较。前者有 GT,能看 PSNR、SSIM、LPIPS、FVD 这些传统指标;后者更接近真实世界,用 LIQE、MUSIQ、CLIP-IQA 和 VIRD 评价。这里要特别解释一下 IDSVIRD:IDS 是 Identity Similarity Distance,中文可理解为身份相似度;VIRD 是 Video Identity and Reference Distance,中文就是视频帧与参考图之间的身份一致性度量。两者都基于 ArcFace 特征来算,算的是“像不像这个人”,不是“像不像一张脸”。
Table 1 Quantitative comparison results on the VFHQ-Test dataset. ↑ / ↓ denote higher / lower is better, respectively. We highlight the best and second metrics.
表1:VFHQ-Test 上的定量结果。TIGER 在 9 个指标里拿下了 8 个最优或次优,尤其是在 LPIPS、IDS、FVD 和 VIRD 上优势明显,说明它不仅更清楚,而且更像本人、也更稳。
从表1看,TIGER 的 LPIPS 只有 0.0697,比不少对手低了一大截,这意味着视觉感知上更接近真值;FVD 也降到 40.4222,说明时间一致性更好;身份相关指标 IDS 也更高,表明“像本人”这件事没有丢。更有意思的是,TIGER 并不是只在某一项上投机取巧,而是在身份、感知、时序三个维度都比较均衡,这正好对应它的三先验设计。
Table 2 Quantitative comparison of our method with SoTA approaches on the VoxCeleb2 dataset.
表2:VoxCeleb2 上的定量结果。这个数据集更接近真实场景,TIGER 在 LIQE 和 MUSIQ 上表现更好,VIRD 也保持了较强的身份一致性,说明它不只是“合成数据上会做题”,在更杂乱的真实视频里也能站住。
定性结果也很关键。图4里能明显看到,很多方法会把脸修得过于平滑,眼睛和嘴角细节发虚,甚至在复杂姿态下出现结构漂移;TIGER 则更能保住眼神、皮肤纹理和轮廓边缘。图1右侧的三维散点图也很说明问题:有的方法要么清楚但不像本人,要么像本人但糊;TIGER 尽量把三者一起往好方向推。这种结果背后不是玄学,而是前面那套“身份钉住、几何扶正、生成补细节”的组合拳在起作用。
Figure 4 Qualitative comparison with other state-of-the-art models. Our approach better preserves identity-discriminative features and restores more fine-grained facial details.
图4:和其他方法的定性对比。TIGER 在身份特征和细粒度细节上更占优,尤其是眼周、皮肤和局部结构,明显比“磨皮式修复”更像真实视频。
插图
看到这里,确实会有点“哎呦,不错哦”的感觉。因为这篇论文没有把提升押在单一技巧上,而是把问题拆开、把约束摆正、再把训练做细,最后结果就比较完整。
Table 3 Ablation study on the effectiveness of identity (Ide.) and geometry (Geo.) priors.
表3:身份先验和几何先验的消融。只留一个先验,效果已经比完全不要强;两个一起上,VIRD、FVD、LPIPS 都明显改善,说明这俩不是“二选一”,而是“缺一不可”的搭档。
Table 4 Ablation study on the effectiveness of the progressive three-stage optimization.
表4:三阶段训练的消融。只做第一阶段,结构能对上,但质感还不够;加上第二阶段,纹理就开始长出来;再加第三阶段,整体真实感和时序稳定性继续提升。这个结果很符合方法设计的逻辑。
Table 5 Effectiveness of cross-source parameter fusion. ref and deg indicate parameters extracted from reference image and degraded video, respectively.
表5:跨源参数融合的消融。把身份和运动都从退化视频里取,容易被噪声带偏;都从参考图里取,又会丢掉真实运动。把二者拆开再融合,才是最稳的几何指导方式。
Table 6 Ablation on the identity-fused embedding.
表6:身份融合嵌入的消融。把身份信息注入交叉注意力后,整体表现继续提升,说明“把人是谁”明确告诉模型,确实比让模型自己猜更靠谱。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是人脸视频恢复里最难的三件事:身份别跑偏、视频别抖、修复结果别像“塑料脸”。TIGER 用身份先验、几何先验和生成先验把这三件事一起管住了。

rectified flow 是什么意思?可以把它理解成“修正后的直达运输”。传统扩散模型要一步步采样,rectified flow 更像直接规划一条更短的路,把退化潜变量更快地搬到清晰潜变量所在的位置,所以推理更快。

为什么要做三阶段训练和数据筛选?因为这类任务最怕训练目标打架、数据质量拉胯。三阶段训练让模型先学结构、再学纹理、最后学真实感;高质量数据筛选则保证模型学到的是“像样的人脸视频”,不是“带脸的噪声片段”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇论文的亮点不是单点小修小补,而是把身份、几何、生成先验做了系统级融合,思路完整,针对性也强。

实验合理度:★★★★☆ 对比方法覆盖了传统修复、生成先验和人脸专用方法,消融也围绕核心设计展开,逻辑比较扎实。

学术研究价值:★★★★☆ 对人脸视频恢复这个高难度场景有明确启发,尤其是“身份-几何-生成”三先验的组织方式,值得后续继续挖。

稳定性:★★★☆☆ 三阶段训练和条件 dropout 提升了鲁棒性,但这类方法对参考图质量、3D 参数估计和训练数据仍然比较敏感。

适应性以及泛化能力:★★★☆☆ 在视频修复和参考引导场景里适用性不错,但对非人脸场景的迁移能力不能直接类推。

硬件需求及成本:★★★☆☆ 一步式推理比多步扩散友好,但训练阶段仍有 8 卡、三阶段、对抗训练等成本,离“轻量随便跑”还有距离。

复现难度:★★★☆☆ 方法模块较多,涉及 3DMM、ArcFace、DiT、VAE、对抗训练和数据筛选,工程链路不算简单。

产品化成熟度:★★★☆☆ 在高质量人脸视频修复上很有潜力,但落地前还要继续验证不同退化类型、参考图缺失和实时性要求。

可能的问题:方法链条较长,依赖多个先验和预处理模块;一旦 3D 参数估计不稳,几何锚点也可能跟着晃。


主要参考文献

[1] Zhou Y, Li W, Zhang P, et al. TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration. arXiv, 2026.
[2] ArcFace: Additive Angular Margin Loss for Deep Face Recognition. 用于身份特征提取与身份一致性度量。
[3] Rectified Flow 相关工作。用于一步式潜空间恢复与生成建模。
[4] 3DDFA-V3 相关工作。用于 3D 人脸参数估计与几何先验构建。
项目页:https://yzhoulv.github.io/Tiger/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。