论文标题:
TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
发表日期:
2026年06月
发表单位:
MiLM Plus, Xiaomi Inc.; The Hong Kong University of Science and Technology (Guangzhou)
原文链接:
https://arxiv.org/pdf/2606.24336v1.pdf
项目链接:
https://yzhoulv.github.io/Tiger/
人脸视频恢复的“不可能三角”,TIGER如何破局?
人脸视频恢复这事,看起来像“把糊掉的脸修清楚”这么简单,实际一脚踩进来就知道:既要像本人,又要每一帧都稳,还得看起来真实,三件事谁都不好惹。论文把这个难题总结成一个很形象的三难题:身份偏移、视角纠缠引导、感知真实感不足。翻译成人话就是:修复模型很容易“长得像,但不是这个人”;参考图能帮忙认脸,但一旦视频里头转脸、抬头、低头,静态参考就开始露馅;而那些为了快一点的一步式方法,又常常把纹理修得太平,像拿砂纸把脸磨了一遍。图:VFHQ 样本 01 的修复效果展示。左边是参考帧,中间是退化输入,右边是 TIGER 的修复结果。先看一眼直观感受:它不是单纯“变清晰”,而是更像把脸上的关键信息重新扶正了,尤其眼周和细纹区域,观感更自然。TIGER 的思路很有意思,它没有只押宝某一种先验,而是把身份先验、几何先验、生成先验三张牌一起打。名字里那个 TIGER,不是说模型会下山抓人脸,而是 Taming Identity, Geometry, and gEnerative pRiors,意思是“驯服身份、几何和生成先验”。这名字起得挺会整活,但方法本身并不花架子:先把“这是谁”钉牢,再把“脸在怎么动”理顺,最后借生成模型的能力把细节补足。先说一个基础概念,免得后面绕晕。这里的 Face Video Restoration, FVR,中文就是人脸视频恢复,目标是从模糊、压缩、噪声、低分辨率这些退化输入里,把视频恢复到更清楚、更像本人、更稳定的状态。和普通视频修复不一样,人脸视频多了一个“身份”约束:路人甲修成了路人乙,那就不是修复,是换脸事故。
可能的问题:方法链条较长,依赖多个先验和预处理模块;一旦 3D 参数估计不稳,几何锚点也可能跟着晃。
主要参考文献
[1] Zhou Y, Li W, Zhang P, et al. TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration. arXiv, 2026.[2] ArcFace: Additive Angular Margin Loss for Deep Face Recognition. 用于身份特征提取与身份一致性度量。[3] Rectified Flow 相关工作。用于一步式潜空间恢复与生成建模。[4] 3DDFA-V3 相关工作。用于 3D 人脸参数估计与几何先验构建。项目页:https://yzhoulv.github.io/Tiger/