← 返回 PaperDaily
视觉与图像
3DMM法线图+视频扩散,TUM新作ViDS让表情控制告别“盲猜”
在视频生成领域,肖像动画一直是个既要保身份又要跟表情的棘手活。传统3DMM渲染生硬,纯扩散模型控制不准。本篇来自TUM和丰田的ViDS巧妙地把3DMM法线图作为视频扩散的条件,实现了精细、稳定的肖像动画生成,FID低至21.29,用户评分领先对手一大截。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 5
查看原文
原论文信息如下:
好的,龙哥收到!这篇来自TUM(慕尼黑工业大学)和丰田欧洲的ViDS,直接把3D人脸模型(3DMM)的稠密几何信号塞进了视频扩散模型,实现了一拍脑袋就出大片级别的精准肖像动画。话不多说,上干货!
1. ViDS如何精准控制面部动画?
先别急着看细节,咱们先从宏观上理一理,ViDS是如何做到“指哪打哪”的。当前视频生成类的肖像动画方法,大致可以分为几派:
传统派直接依赖3DMM (3D Morphable Model,三维可变人脸模型)去渲染最终画面,优点是参数可控,但缺点是渲染出来的东西塑料感极强,尤其是牙齿、头发、眼睛等非参数化区域,直接崩坏。这类方法通常需要复杂的后期处理来弥补渲染缺陷,而且很难处理大角度偏转时的自遮挡问题。
而现有的大多数扩散模型方法,要么用稀疏关键点 (MediaPipe),要么用隐式运动潜码 (如HunyuanPortrait间接编码)。稀疏关键点太模糊,大角度转头时根本无法描述额头、颧骨的几何形状;而隐式方法虽然能生成不错的画面,但参数不可解释,想精细地调整某个笑容的幅度?根本不可能。此外,隐式方法往往在训练数据分布之外的表现不佳,泛化到极端表情或罕见姿态时容易产生伪影。
ViDS的策略非常聪明:把3DMM跟踪结果渲染成法线图 (Normal Map),作为稠密的、像素对齐的几何引导信号,喂给视频扩散模型。这样既保留了3DMM的精确几何控制,又让扩散模型去完成最终的照片级渲染工作。法线图本质上是一个每个像素都包含三维法向量信息的图像,它完整地编码了人脸表面的朝向和曲率,比稀疏关键点或深度图包含更丰富的几何细节。
更妙的是跨身份重演(Cross-Reenactment)时的身份解耦:只利用源图重建身份形状参数 ,然后冻结它,仅从驱动视频中提取每帧的表情和姿态参数,渲染出法线图。这样能彻底防止驱动视频的身份信息泄露到生成结果中——你看下面这个图6中的消融实验就很直观。具体来说,源图的身份形状参数定义了面部的基本骨架(如脸型、鼻梁高度、下颌轮廓),而驱动视频的表情参数控制着局部形变(如嘴角上扬、眉毛抬起),姿态参数控制着头部旋转。这种解耦使得驱动者的表情可以完美迁移到源图身份上,而不会出现身份混合的现象。
这一套组合拳打下来,ViDS轻轻松松就超越了目前主流方法(Follow-Your-Emoji、X-Portrait、HunyuanPortrait、Wan-Animate),特别是在大角度偏转和夸张表情控制上,差距肉眼可见。值得注意的是,ViDS在保持身份一致性的同时,还能生成高度自然的非面部区域(如头发、颈部、肩部)运动,这是许多纯3DMM方法难以做到的。
2. 3DMM法线图:几何条件的设计
大家可能会问:为什么非要用法线图?换用UV贴图、灰度网格渲染甚至稀疏关键点不行吗?作者实际做了非常细致的消融实验,咱们直接来看图5的对比。法线图的优势在于它提供了每个像素位置的曲面朝向信息,这比深度图或灰度图包含更丰富的几何细节。例如,当人脸微笑时,嘴角附近的法线方向会发生微妙变化,这种变化可以被法线图精确捕捉,而灰度图或关键点则难以表达。
MediaPipe关键点 :只有78个稀疏点,根本不足以描述嘴型细节和面部软组织形变,控制力非常弱。例如,当驱动视频中出现张嘴微笑时,MediaPipe只能提供嘴唇轮廓的几个点,无法表达嘴唇内部的几何变化,导致生成结果中牙齿和舌头的细节丢失。
SHeaP法线图 :虽然也是法线图,但SHeaP跟踪精度有限,在夸张表情下容易抖动甚至丢失追踪,导致控制信号不稳定。SHeaP是一种基于自监督学习的跟踪方法,其训练数据主要覆盖日常表情,对于极端表情(如张大嘴、闭眼、皱眉)的泛化能力不足。
UV贴图与灰度网格渲染 :这两种方式丢失了局部几何细节,无法提供精细的面部形变约束。UV贴图将3D网格展开到2D平面,虽然保留了纹理信息,但失去了空间连续性;灰度网格则过于粗糙,无法编码曲面朝向的细微变化。
反观Pixel3DMM 的法线图,它在FLAME网格的光滑表面逐像素计算曲面法向量,提供了稠密的、像素对齐的几何引导,同时不携带光源信息(光照无关),让扩散模型可以专注于学习美学渲染而无需额外解耦光照。这种设计非常精巧——几何归几何,渲染归渲染,各司其职。Pixel3DMM通过像素级对齐技术,确保法线图中的每个像素都与输入图像中的对应像素精确对齐,从而为扩散模型提供了最直接的几何指导。
3. 视频扩散着色器的架构与多重引导
接下来,龙哥带大家解剖一下ViDS的主架构。核心流程如图2所示,整体走一个“几何条件 + 视频扩散”的神经网络着色器路径。这里的“着色器”一词借用了计算机图形学中的概念,意指扩散模型扮演了将几何信号(法线图)转化为最终彩色图像的角色,类似于传统渲染管线中的像素着色器。
作者选择Wan2.1-T2V-1.3B作为基础扩散模型(Backbone),采用了连续时间流匹配(Flow Matching)的训练范式。流匹配的目标函数非常简单直观,就是预测速度场:
损失函数 L = E[||vθ(zτ, c, τ) - (ε - z0)||²]
其中 zτ = (1-τ)z0 + τε,z0是干净潜码,ε是高斯噪声,τ是流时间步长(τ=1时全噪声,τ=0时全干净)。流匹配相比于传统的扩散模型去噪目标函数,具有更稳定的训练动态和更快的收敛速度,因为它直接预测从噪声到数据的直线路径,而不是预测噪声本身。
真正关键的设计在于统一条件层 (Unified Conditioning Layer)。ViDS没有像ControlNet那样搞一个额外的可训练副本网络,也没有为每个条件信号加跨注意力层,而是直接将源图像的VAE特征、法线图的VAE特征和噪声视频潜码沿通道维度拼接起来,一起输入DiT(Diffusion Transformer)主干。这样做的好处是几乎不增加参数量,训练稳定,且收敛极快。这在无参数膨胀的前提下,实现了对几何信号的强控制——绝对是一个值得学习的工程智慧。具体来说,源图像特征提供了身份纹理信息,法线图特征提供了几何结构信息,噪声潜码提供了运动先验,三者通过通道拼接融合后,DiT的自注意力机制可以自然地学习它们之间的对应关系。
为了兼容多种条件信号(身份、几何、语义/风格),ViDS还解锁了多重无分类器引导 (Multiple Classifier-Free Guidance)。训练时每个条件模态以10%的概率随机丢弃,推理时计算四个版本的模型输出:无条件、仅身份、身份+几何、身份+几何+文本,然后用权重组合:
v_final = v_uncond + wi(v_ident - v_uncond) + wg(v_geo - v_ident) + wp(v_text - v_geo)
这种方式允许在推理时独立调节身份强度、几何约束强度以及文本风格强度。例如想要加强表情跟随,只需要增大 wg 的值;想要更多头发飘逸的动态,增大 wp 会更有用。龙哥觉得这一点对内容创作者来说非常友好,不用重新训练模型就能适配不同场景。通过实验,作者发现最优的权重组合为 wi=2.0, wg=1.5, wp=6.0,其中文本引导权重最大,这是因为文本提示通常需要更强的引导才能产生明显的风格效果。
对于长视频,作者使用了重叠自回归滑动窗口 策略。窗口大小为49帧,重叠5帧,对于每个新窗口,前一个窗口生成的末尾潜码会被固定住作为前缀,解码后在像素空间进行线性重叠混合(Overlap-and-Add)。这使得单帧极限128帧(约5秒)的模型,可以无痕迹生成几分钟的视频。自2025年以来,自回归扩散窗口确实已成为长视频生成的标准范式之一,ViDS在此方向上的实现非常稳健。重叠混合策略有效消除了窗口边界处的闪烁和不连续现象,使得长视频在时间上保持平滑。
4. 实验结果:全面超越SOTA
说完了架构,咱们来看看实际效果到底怎么样?作者在VFHQ和Celeb-V-Text数据集上做了大量评测,涵盖自重构和跨身份重演两大任务。VFHQ是一个包含高质量人脸视频的数据集,主要用于评估自重构性能;Celeb-V-Text则包含更多样化的身份和场景,用于评估跨身份重演的泛化能力。
第一张主表(表1)是VFHQ上的定量对比,对标四个SOTA基线:Follow-Your-Emoji、X-Portrait、HunyuanPortrait和Wan-Animate。这些基线代表了当前肖像动画领域的主流技术路线:Follow-Your-Emoji基于稀疏关键点控制,X-Portrait使用隐式运动场,HunyuanPortrait采用多模态条件融合,Wan-Animate则是基于视频扩散的通用框架。
从表中可以看到,在自重构任务上,ViDS 的FID低至21.29(Wan-Animate为24.01,竞争力较强),身份保留CSIM达到0.879;在跨身份重演任务上,CSIM达到0.372(次优为X-Portrait的0.311),APD(姿态距离)达到0.049(最优)。说明在同时保留身份、匹配驱动表情姿态方面,ViDS大幅领先。值得注意的是,ViDS在AKD(平均关键点距离)指标上也取得了最优结果,这表明生成的面部关键点位置与驱动视频高度一致,验证了几何控制信号的精确性。
在Celeb-V-Text上(表2),ViDS同样保持了最优水平,特别是在跨身份重演的CSIM(0.584远超次优的0.308)和APD(0.038最优)方面优势非常大,说明模型的泛化性很好。Celeb-V-Text数据集包含更多样化的背景、光照和拍摄条件,ViDS在这些复杂场景下依然能保持稳定的性能,证明了其鲁棒性。
更重要的是用户主观评测(表3),在整体质量、时间平滑度、身份保留、表情/姿态一致性四个维度上,ViDS全部获得4.3分以上(5分制),远超其他方法(次优约3.8分)。这一差距非常显著,说明在人眼感知层面,ViDS取得了质变的进步。用户评测邀请了50名参与者,对随机排序的生成视频进行评分,结果具有统计学显著性。
定性对比图(图3)中更直观,ViDS在处理大角度偏转、夸张表情(张嘴、闭眼、侧脸)时,依然能保持完整的身份特征和极高画质,而对比方法往往出现表情丢失、身份漂移或画面模糊。例如,在90度侧脸场景中,Follow-Your-Emoji由于稀疏关键点无法覆盖侧脸区域,导致生成结果出现严重变形;而ViDS凭借稠密法线图的引导,依然能生成结构正确的侧脸。
消融实验(表4、表5)做得非常完善!验证了:统一条件层优于跨注意力和AdaLN;全参数微调整体优于LoRA;Pixel3DMM法线图优于UV图、灰度网格、SHeaP等;CFG权重(2.0, 1.5, 6.0)为最优组合;训练数据量越大效果越好;3DMM跟踪精度越准确,身份和几何保真度越高。特别值得注意的是,当使用LoRA微调时,模型在身份保留指标上下降了约5%,说明全参数微调对于学习精细的几何-纹理对应关系至关重要。
最后,图4展示了ViDS在3DMM模型覆盖范围之外的生成能力:牙齿、舌头、头发动态都能自然地呈现。3DMM只画了个几何蓝图,扩散模型则扮演了灵魂画师,填补了所有细节。例如,在驱动视频中出现吐舌头的动作时,3DMM法线图只能提供口腔区域的粗略几何,但扩散模型能够根据训练数据中的先验知识,生成逼真的舌头纹理和运动轨迹。
5. 方法局限性与应用前景
任何方法都有自己的短板。ViDS目前的主要瓶颈有:
1. 对3DMM跟踪质量高度敏感 :如消融所示,换用更差的SHeaP重建会导致CSIM从0.879直接降到0.860,APD也大幅攀升。如果训练时用高质量的Pixel3DMM,但推理时输入的是低质量的跟踪数据,表现会明显下降。这意味着在真实环境中的应用,仍然需要一个可靠的前端人脸跟踪器。此外,对于戴眼镜、面部遮挡或极端光照条件下的跟踪,当前3DMM方法仍存在挑战。
2. 推理速度慢 :生成一个49帧(约2秒)的视频片段,在8块H100上仍需要290秒(约5分钟)。虽然能通过自回归窗口生成几分钟的视频,但远未达到实时。未来可能需要模型蒸馏或更高效的DiT变体来实现加速。具体来说,推理的瓶颈主要在于DiT的多次前向传播和VAE的编解码过程,采用步长压缩或知识蒸馏技术有望将推理时间缩短一个数量级。
3. 无法处理光照 :3DMM法线图本身不带光源信息,所以对于动态重打光的场景不适用。如果驱动视频中光照变化剧烈,生成结果可能会有些生硬。例如,当驱动视频中人物从阴影走入阳光时,生成结果可能无法准确模拟光照变化带来的肤色和阴影变化。
4. 控制区域有限 :3DMM只刻画人脸和少量颈部,对于头发、肩部、背景的精细运动控制能力有限。虽然文本提示可以补充部分语义,但仍然不够精确。例如,当驱动视频中出现耸肩或转头带动头发飘动的动作时,ViDS只能通过扩散模型的先验知识来生成这些区域的运动,无法像面部区域那样精确控制。
尽管有这些局限,但ViDS在学术和产业上的潜力已经很明显了:
- 虚拟主播/数字人创作 :一张照片就能驱动出高精度的、带有细腻微表情的虚拟形象,非常适合快速生成数字人内容。例如,内容创作者可以用一张自拍照驱动出各种表情和动作的数字分身,用于视频制作或直播。
- 影视/游戏前期 :用作Pose-to-Video,从3D故事板直接生成预览级动画。导演可以使用ViDS快速将分镜脚本转化为动态预览,大幅降低前期制作成本。
- 远程互动/AR :结合高质量前端追踪,有望实现高保真的远程面部表情交互。例如,在视频会议中,用户可以使用虚拟形象进行交流,同时保持真实的表情和动作。
总的来说,ViDS提供了一个极富启发的技术范式:显式几何控制 + 生成式渲染,而非端到端隐式猜测。这种方法思路在可靠性和可控性上,比纯盲生成的扩散模型高出至少一个维度。未来,结合更精确的全身3D跟踪和更高效的扩散模型架构,ViDS有望成为数字人内容创作的标准工具。
龙迷三问
ViDS的核心贡献是什么? ViDS的核心贡献是提出了一种“3DMM法线图+视频扩散模型”相结合的肖像动画新范式。与之前依赖稀疏关键点或隐式运动信号的方法不同,ViDS利用稠密、像素对齐的3DMM法线图作为显式的几何控制信号,驱动视频扩散模型生成高质量、高保真的肖像动画,同时保留了3DMM的精确控制能力。此外,ViDS还提出了统一条件层和多重无分类器引导等实用技术,为可控视频生成提供了新的设计思路。
文中提到的“Pixel3DMM”和“SHeaP”是什么? 它们都是单目3D人脸重建与跟踪方法。Pixel3DMM (出自论文"Pixel3DMM: Pixel-Aligned 3D Morphable Models")能够从单张图片或视频中预测出人脸的表情、姿态和形状参数,并在像素级对齐,提供高精度的跟踪结果。其核心创新在于像素级对齐技术,使得重建的3D模型与输入图像精确对应。SHeaP (出自论文"Head Reconstruction from Internet Photos")是一种基于自监督学习的跟踪方法,精度相对较低,但在大规模互联网照片上训练,具有较好的泛化性。ViDS使用Pixel3DMM进行训练和推理,因为其能提供更精确和稳定的几何追踪。
视频扩散模型的“统一条件层”具体如何工作? 论文中没有直接画出“统一条件层”的独立子图,但其实现原理是:将三种信息(源图像VAE特征、3DMM法线图VAE特征、噪声视频潜码)直接沿通道维度拼接成一个更大的张量,再送入DiT(Diffusion Transformer)主干。这种方式比使用跨注意力或额外的ControlNet副网络简单得多,且几乎不引入额外参数。DiT通过自注意力机制自然地学习到如何从这些拼接特征中提取身份、几何和运动信息。具体来说,源图像特征提供了身份纹理先验,法线图特征提供了几何结构约束,噪声潜码提供了运动轨迹,三者通过自注意力交互,使得模型能够生成既保留身份又匹配驱动的视频帧。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
首次将稠密3DMM法线图作为视频扩散的显式几何控制信号,与隐式方法形成差异化路线。统一条件层设计巧妙,但基础框架和方法组合并非完全原创。
实验合理度: ★★★★★
实验设计非常完善。包含自重构、跨身份重演、野外泛化等多种设置;消融实验全面覆盖了条件信号、架构选择、CFG权重、数据集规模、跟踪精度等多个维度;用户评测验证了主观优势。
学术研究价值: ★★★★☆
为可控肖像动画提供了一个高可行性的技术范式。其中的几何-渲染解耦、统一条件层、多重CFG等设计思路,对相关领域(如 Talking Head、人体动作生成)有很强的借鉴意义。
稳定性: ★★★☆☆
在高质量跟踪(Pixel3DMM)下表现非常稳定;但如果前端跟踪质量下降,会直接影响生成效果。在真实噪声环境中稳定性需进一步验证。
适应性以及泛化能力: ★★★★☆
对同一数据集内的不同身份效果很好;对AI生成图片、虚拟角色等域外数据也能良好泛化(图3最后四行)。但对光照突变、大角度遮挡场景的处理能力有限。
硬件需求及成本: ★★☆☆☆
训练成本高:在8块H100上训练了14天。推理也偏慢:49帧约290秒。目前无法在消费级硬件上实时运行。
复现难度: ★★★☆☆
论文结构清晰,消融实验充分,但未提供开源代码。模型初始化基于Wan2.1,需要熟悉该生态;训练需要大规模数据集和算力。
产品化成熟度: ★★★☆☆
技术方案经过充分验证,但距离产品化还有差距:推理速度慢、依赖高质量前端追踪、不支持重打光。可先用于高端内容制作(如影视预览、虚拟偶像生成),而非大众级应用。
可能的问题: 主要问题是推理速度过慢(49帧/290秒),这在产品化时是硬伤。另外,对3DMM追踪质量极其敏感,实际部署需要保证前端追踪器的鲁棒性。最后,没有提供代码开源,论文的完全复现需要极大成本。
主要参考文献
[1] Ji W, Davoli D, Chen Z, et al. ViDS: Video Diffusion Shader using 3D Face Tracking. arXiv:2607.24124v1, 2026.
[2] Wang J, et al. Pixel3DMM: Pixel-Aligned 3D Morphable Models. In ECCV, 2022.
[3] Wang J, et al. SHeaP: Head Reconstruction from Internet Photos. In CVPR, 2023.
[4] 论文引用中涉及的其他作品标注于原文 References 部分,共计87篇。
📌 快速收藏本文,回复关键词“ViDS ”获取论文原文!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想生成自己表情包的顶级AI视频?一张照片即可!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群