← 返回 PaperDaily 视觉与图像

纽约大学联手清华造百万级手语视频!3DGS+扩散模型,翻译模型鲁棒性飙升

手语翻译模型的顶级论文通常都在干净、正面的数据集上刷分,一到真实世界的侧拍、杂背景、陌生人就瞬间“原形毕露”。纽约大学联手清华大学,直接搬出3DGS和扩散模型,搞了个百万级增强数据集SignNet-1M,专门给模型做“抗压训练”,翻译质量飙升,鲁棒性不降反升。这条路子,值得所有做多模态和鲁棒性研究的同学重点关注!

纽约大学联手清华造百万级手语视频!3DGS+扩散模型,翻译模型鲁棒性飙升
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
手语翻译模型的顶级论文通常都在干净、正面的数据集上刷分,一到真实世界的侧拍、杂背景、陌生人就瞬间“原形毕露”。纽约大学联手清华大学,直接搬出3DGS和扩散模型,搞了个百万级增强数据集SignNet-1M,专门给模型做“抗压训练”,翻译质量飙升,鲁棒性不降反升。这条路子,值得所有做多模态和鲁棒性研究的同学重点关注!


原论文信息如下:
论文标题:
SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks
发表日期:
2026年06月

发表单位:
New York University Abu Dhabi, ChatSign Technology, Tsinghua University

原文链接:
https://arxiv.org/pdf/2606.24361v1.pdf

开源代码链接:
https://signnet.chatsign.ai/

项目链接:
https://signnet.chatsign.ai/

大家可能不知道,现在最牛的手语翻译模型,比如 SpaMo 和 UniSign,在标准的基准测试如 Phoenix14T 上,BLEU-4 分数都能到20多,看似还不错。
但这些模型的“好日子”得放在实验室里——正面视角、干净背景、熟悉的手势者。一旦把它们扔到真实世界,比如换个角度拍摄、背景变成繁忙的街道、或者换个陌生人来做手势,模型的性能就像坐过山车一样直线下降。
比如 SpaMo 模型,仅仅是在评估时加上了一点视角变化,它的核心指标 BLEU-4 就从22.49分直接掉到了7.81分,暴跌将近15分!插图
这种“水土不服”的问题,本质在于训练数据太过于“纯洁”。传统数据增强方法,像裁剪、翻转、颜色抖动,只能制造些简单的像素级变化,根本无法模拟真实世界中复杂的、结构性的分布偏移。
为了解决这个痛点,来自纽约大学阿布扎比分校、ChatSign Technology 和清华大学的研究者们,推出了一款重磅武器——SignNet-1M,一个百万级别的多语言手语视频增强数据集。

手语翻译模型在真实世界为何“水土不服”?

一句话总结:训练数据和部署环境之间存在巨大的“分布鸿沟”
现有的主流手语数据集,如 Phoenix14T, How2Sign, CSL-Daily,它们都是在受控环境下采集的。这意味着拍摄时相机基本是正面特写,背景是经过挑选的单一色调或演播室,参与的手势者人数也有限。这导致训练出来的模型学会了“死记硬背”这些特定条件下的特征,而不是真正理解手势背后的语义。
当模型部署到真实场景中,它将面临三大主要分布偏移:

视角变化(Viewpoint Shift):真实摄像头可能装在侧面、上面,或者有俯拍、仰拍,这会导致手部、身体的空间关系完全改变。

背景变化(Background Shift):真实背景千奇百怪,比如家里的墙壁、公园的树、办公室的座椅,这些复杂的纹理会严重干扰模型对手势区域的关注。

手势者身份变化(Signer Identity Shift):每个人的手型、动作幅度、面部表情甚至穿着打扮都不一样。一个模型只在少数几个手势者身上训练,遇到一个全新的陌生人,其表现自然大打折扣。

传统的数据增强(比如颜色抖动、随机裁剪)无法生成这些结构化的、3D一致的全局变化。而SignNet-1M正是为此而生,它利用最新的生成式AI技术,系统性地、可控地引入这些变化。

数据增强新范式:3DGS + 扩散模型的强强联合

本文的方法论核心,是一个精心设计的三阶段增强流水线,能够生成厘米级可控的视觉变化,同时完美保留手语的运动和语义信息。

方法概述

整个框架的流程清晰明了,下面这张图可以让你一览全局:
图1:增强框架概览。第一阶段:背景替换(FlowPortal + IC-Light)。第二阶段:EHM-Tracker将每个视频流跟踪为SMPL-X/FLAME参数,然后GUAVA执行新视角渲染(静态/动态相机)和跨身份重演。第三阶段:渲染后增强(视频一致的图像空间变换和轻微的时间重采样)。
图1:增强框架概览。第一阶段:背景替换(FlowPortal + IC-Light)。第二阶段:EHM-Tracker将每个视频流跟踪为SMPL-X/FLAME参数,然后GUAVA执行新视角渲染(静态/动态相机)和跨身份重演。第三阶段:渲染后增强(视频一致的图像空间变换和轻微的时间重采样)。

第一阶段:背景替换

该步骤利用 FlowPortal 和 IC-Light 等扩散模型,对原始视频的背景进行栩栩如生的替换。它不仅能改变背景场景,还能感知光照,让前景的手势者与背景的光影保持一致,从而模拟出在不同户外和室内环境的效果。核心是使用视频抠图技术生成一个时域一致的软alpha遮罩,确保手势者的动作和几何形状不被破坏。

第二阶段:基于3DGS的新视角渲染与跨身份重演

这是本方法最硬核的环节。它首先使用 EHM-Tracker 将视频中的手势者解耦为两个部分:
  • 身份参数(Identity Parameters):包括身体形状、面部形状等不随时间变化的特征。
  • 运动参数(Motion Parameters):包括姿态、表情、关节角度等随时间变化的动态信息。
然后,利用 GUAVA 这个可动画化的上半身3D高斯虚拟人模型,进行以下操作:

新视角渲染(Novel-View Rendering):通过操控虚拟相机的位置(包括偏航角、俯仰角、缩放等),可以渲染出原始视频从不同角度拍摄的效果。论文定义了10个从轻微到剧烈的预设视角(L1-L10),来模拟不同程度的视角偏移。

跨身份重演(Cross-Identity Reenactment):将A视频中的“运动”参数与B图片或视频中的“身份”参数结合,从而让A的手势被一个全新的、完全不同的人做出来。这完美地模拟了手势者身份变化。


第三阶段:渲染后增强

这是一个轻量级的彩色增强阶段,应用视频一致性的图像空间变换(如裁剪、颜色抖动、模糊等)和轻微的时间重采样(如调速、丢帧)。它不改变语义,但能模拟拍摄和压缩过程中产生的伪影,进一步提升数据的多样性。
下面这张图生动展示了各增强阶段的实际效果:
图2:定性增强示例。(a-d) 新视角相机增强(俯仰、偏航、缩放、动态)。(e) 跨身份重演。(f) 背景替换。(g-h) 渲染后增强(几何/光度/时间)。(i) 相机轨道空间可视化。
图2:定性增强示例。(a-d) 新视角相机增强(俯仰、偏航、缩放、动态)。(e) 跨身份重演。(f) 背景替换。(g-h) 渲染后增强(几何/光度/时间)。(i) 相机轨道空间可视化。

SignNet-1M数据集:百万规模的多语言手语视频库

在介绍了数据是怎么生成的之后,我们来扒一扒 SignNet-1M 这个数据集本身的构成。

数据源构成

SignNet-1M 涵盖了三种语言的不同手语:美国手语(ASL)、中国手语(CSL)和德国手语(DGS)。它从7个公开或自采集的语料库中构建,总共有约100万个增强后的视频剪辑。
图3:SignNet-1M组成。左:源语言分布(ASL 70%,CSL 20%,DGS 10%)。中:生成式增强组合(7倍):新视角80%(偏航/俯仰/缩放/动态/混合)加上背景(10%)和身份(10%)编辑。右:渲染后增强组合(12倍):原始(20%)加上几何/颜色/退化/时间增强。
图3:SignNet-1M组成。左:源语言分布(ASL 70%,CSL 20%,DGS 10%)。中:生成式增强组合(7倍):新视角80%(偏航/俯仰/缩放/动态/混合)加上背景(10%)和身份(10%)编辑。右:渲染后增强组合(12倍):原始(20%)加上几何/颜色/退化/时间增强。
从图3可以看出,数据量和多样性非常庞大。生成式增强部分,80%的增强数据来自新颖视角渲染,剩下的20%来自背景和身份编辑。同时,渲染后的增强部分也以12倍的规模进一步扩展。

与其他数据集的对比

下面这张表直观地展示了 SignNet-1M 在规模和多样性上的巨大优势:
上一节已经让读者见识了现有手语模型在真实世界中的“惨状”。别急,这还不算完。本文不仅指出了问题,更拿出了一套系统的解决方案——一个百万级、三语言、带可控增强的信号数据集 SignNet-1M,以及配套的鲁棒性基准测试协议。龙哥保证,接下来的内容会让你直呼“还有这种操作?” 插图

系统性基准测试:揭秘书模型鲁棒性的提升

光有数据集还不够,怎么科学地评价它带来的收益?本文设计了一套严谨的评估协议,包含四种设定,用来分别量化模型的“原始鲁棒性”和“训练后鲁棒性”。

评估协议:Orig / Zero-shot / Trained / D

设定 A(Orig.):在原始标准数据集上训练和测试,这是常规套路。设定 B(Zero-shot):用原始数据集训练好的模型,直接去测试 SignNet-1M 的增强测试集。这个 Gap 有多大,就说明原始模型对分布偏移有多脆弱。设定 C(Trained):在 SignNet-1M 的训练集上重新训练,再在它的测试集上测试。Gain = C - B 就是增强训练带来的收益。设定 D(Trained→Orig.):在 SignNet-1M 上训练后回到原始测试集测试,看看增强数据是否反哺了标准场景。
本文在两个任务上进行了测评:手语翻译(SLT)和手语识别(SLR),涵盖多个代表性模型,如 SpaMo、UniSign、GASLT、FPT4SLT 等。翻译用 BLEU-4 指标(越高越好),识别用 WER%(越低越好)。

翻译任务上的惊人提升

来看看表格 3(Table 3)的数据。以 Phoenix14T 子集为例,SpaMo 在原始数据集上 BLEU-4 达到 22.49,但 Zero-shot 到 SignNet-1M 测试集上直接掉到 7.81,Gap 达 -14.68!这可是断崖式下跌。但用 SignNet-1M 训练后,C 设定下 BLEU-4 恢复到 18.98,Gain 高达 +11.17。
表3:SignNet-1M子数据集上的手语翻译BLEU-4指标。评估条件及Δ指标定义见5.2节。设定D在SignNet-1M上训练并在原始测试集上评估;A/B/C/D定义见5.2节。
表3:SignNet-1M子数据集上的手语翻译BLEU-4指标。评估条件及Δ指标定义见5.2节。设定D在SignNet-1M上训练并在原始测试集上评估;A/B/C/D定义见5.2节。
更有意思的是设定 D:在 SignNet-1M 上训练后回到原始测试集,SpaMo 在 Phoenix14T 上反而从 22.49 提升到了 27.78!说明增强数据不仅提升了鲁棒性,还顺便提高了标准场景的性能。这样的“意外之喜”在 How2Sign 和 CSL-Daily 上同样存在,全面提升幅度在 +0.38 ~ +8.37 之间。

识别任务上的同样策略

表 4(Table 4)显示,在 Phoenix14T 上,原始模型 WER 为 22.21%,Zero-shot 跳升到 51.45%(几乎翻倍),而训练后回到 28.19%,Gain 达到 +23.26%。这数据说明 SignNet-1M 的增强对识别任务同样有效。
表4:SignNet-1M子数据集上的手语识别WER%指标。评估条件及Δ指标定义见5.2节。
表4:SignNet-1M子数据集上的手语识别WER%指标。评估条件及Δ指标定义见5.2节。

从严重程度分层到均匀改进:全方位实验与消融

仅仅知道总体提升还不够,本文还按严重程度(L1~L10)进行了分层分析——看看模型在越来越难的视角和光照变化下表现如何。

严重程度分层下的鲁棒性

Fig. 4 给出了在 Phoenix14T 上 SpaMo 的分层表现。视角方面(图4a),Zero-shot 的 BLEU-4 从 L1 的 8.31 滑落到 L10 的 6.94,而训练后的模型始终在 17~18 之间,且增益随难度增加而增大(从 +8.50 到 +9.92)。光照方面(图4c),Zero-shot 崩得更惨,从 7.02 掉到 2.96,但训练后仍在 12~15 之间,增益达到 +4.73 ~ +6.85。这说明 SignNet-1M 对最极端的条件提升最明显。
图4:Phoenix14T上不同严重程度下的分层SLT性能。(a,c) Zero-shot和训练模型的BLEU-4。(b,d) 训练减去Zero-shot的BLEU-4增益。视角水平(L1–L10)按偏航/俯仰/缩放增强递增,光照水平按归一化光度偏移定义(表2)。
图4:Phoenix14T上不同严重程度下的分层SLT性能。(a,c) Zero-shot和训练模型的BLEU-4。(b,d) 训练减去Zero-shot的BLEU-4增益。视角水平(L1–L10)按偏航/俯仰/缩放增强递增,光照水平按归一化光度偏移定义(表2)。

消融实验:哪个增强最管用?

Table 5 给出了不同增强组件的单独贡献。新视角渲染中的 zoom 效果最好(Phoenix14T 上 Zero-shot BLEU-4 8.89,Trained 18.98),而动态相机最难,但训练后也有效果。在外观变化方面,身份编辑(cross-identity reenactment)显著优于场景编辑(13.06 vs 4.91),说明更换手势者比换背景更能提高鲁棒性。渲染后增强进一步叠加了多样性的提升。整体来看,所有组件组合成全量 SignNet-1M 时达到最佳。
表5:增强组件消融(BLEU-4)。在SignNet-1M子数据集(Phoenix14T和How2Sign)上使用SpaMo方法的Zero-shot和训练协议的结果。
表5:增强组件消融(BLEU-4)。在SignNet-1M子数据集(Phoenix14T和How2Sign)上使用SpaMo方法的Zero-shot和训练协议的结果。

缩放实验:更多数据 = 更强鲁棒

图5表明,随着增强因子 K 从 2 增加到 10(即数据量扩大 2~10 倍),BLEU-4 单调上升,在 Phoenix14T 上从 14.37 提升到 18.54,在 How2Sign 上从 10.23 提升到 14.11。这说明更丰富的数据直接带来了更强的泛化能力。
图5:与增强因子K的缩放关系。在不同增强规模因子(K=2,5,10)下训练的BLEU-4随训练轮数的变化。结果展示在Phoenix14T(左)和How2Sign(右)上。
图5:与增强因子K的缩放关系。在不同增强规模因子(K=2,5,10)下训练的BLEU-4随训练轮数的变化。结果展示在Phoenix14T(左)和How2Sign(右)上。
插图

专家与机器双评估:确保语义保真与视觉质量

数据增强最怕改变语义。本文为此做了两件事:客观指标评估和真人打分。

视觉质量客观评估

Table 13 展示了原始视频与增强视频在多种质量指标上的对比。FID-VID、FVD、SSIM、PSNR 均在可接受范围内(SSIM >= 0.81),表明生成视频保持了结构真实性和分布一致性。身份交换带来的 FID-VID 变化只有约 2%,且翻译性能相当,印证了跨身份重演的高保真度。
表13:原始与SignNet增强视频的视觉质量对比。更低的FID-VID/FVD和更高的SSIM/PSNR表示更好的质量。
表13:原始与SignNet增强视频的视觉质量对比。更低的FID-VID/FVD和更高的SSIM/PSNR表示更好的质量。

真人评估:Native ASL 手语者打分

论文邀请了 14 位母语为 ASL 的手语者,对 27,000 个句子对进行了评估。结果令人振奋:新视角、背景替换、渲染后增强的接纳率超过 99%,即使是难度最高的跨身份重演也达到了 94.8%。在自采集的 175 个句子和 500 个孤立词上,接纳率更是 100%。结合下游任务的提升,这充分证明了语义被完美保留。
表15:14位母语ASL手语者的评估。接纳率=被认为保留源手势及语言内容的合成视频比例。
表15:14位母语ASL手语者的评估。接纳率=被认为保留源手势及语言内容的合成视频比例。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

SignNet-1M 的增强数据会不会改变手语的语义?不会。论文通过人类评估和客观质量指标验证了语义保真度。新视角渲染和背景替换只是改变了拍摄角度和背景,不会影响手势本身。跨身份重演虽然有约 5% 的失误率,但整体接纳率高达 94.8%。所以放心用,增强不会破坏语言内容。

3DGS 和扩散模型在增强中分别扮演什么角色?3DGS(3D Gaussian Splatting)负责生成几何一致的视角变化和跨身份重演,它能精确控制相机角度,保证手部、躯干的3D空间关系正确。扩散模型(如 FlowPortal + IC-Light)负责背景替换和光照调整,生成逼真的背景场景,让模拟环境更真实。两者结合,既有几何精度又有外观多样性。

本文的评估协议(Orig/Zero-shot/Trained)有什么特别之处?这个协议的核心是分离“模型对分布偏移的敏感性”和“数据增强带来的改善”。通过比较 Zero-shot 和 Orig 的差距,可以量化原始模型有多脆弱;通过比较 Trained 和 Zero-shot 的差距,可以精确衡量增强训练能让模型恢复多少。而且,设定 D 检查增强训练是否损害原始场景性能,结果发现反而有提升,这大大增强了方法的实用性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将 3DGS 和扩散模型系统性地应用于手语数据增强,首次实现百万级、多语言、可控制的结构化偏移,填补了鲁棒性数据集的空白。虽然组件来自现有工作,但组合方式和规模是创新。

实验合理度:★★★★★

实验设计非常严谨,包含4种评估设定、严重程度分层、消融、缩放、人类评估,覆盖全面。对比方法来自不同模型家族,结果具有说服力。唯一的小遗憾是部分消融只在两个子集上验证。

学术研究价值:★★★★★

对手语领域的数据增强和鲁棒性研究提供了全新范式和基准,对其他视频理解任务的分布偏移研究也有借鉴意义。开源数据、代码和配置,可复现、可扩展,研究价值很高。

稳定性:★★★★✰

增强数据本身经过人类评估,质量可靠;训练后的模型在多个分布下表现稳定,但极端视角或光照下仍有下降空间。受限于 GUAVA 的渲染质量,大的视角变化可能导致手部细节模糊。

适应性以及泛化能力:★★★★✰

覆盖三种语言,模型在翻译和识别任务上都展现出广泛的适应性。但论文只测试了 DGS、ASL、CSL,未包含其他手语(如 JSL、BSL),泛化到其他语言还需要验证。

硬件需求及成本:★★★✰✰

生成增强数据需要调用 3DGS 和扩散模型,计算成本较高(如单段视频需数分钟)。但对于用户来说,官方已生成好 100 万视频,直接下载使用即可,不必自行生成。训练阶段与原始模型开销相当。

复现难度:★★★★✰

论文已开源数据集、完整代码和配置,复现流程清晰。但生成流水线涉及多个组件(EHM-Tracker、GUAVA、FlowPortal、IC-Light等),环境配置稍显复杂。直接使用提供的数据集则无复现负担。

产品化成熟度:★★★✰✰

数据集和训练方案已通过人类验证,可以显著提升真实场景下的手语翻译鲁棒性,有产品化潜力。但当前仅限非商业研究用途,且跨身份重演仍有 5% 的语义偏差,距离零风险产品还差一步。

可能的问题:尽管实验证明增强训练提升了原始测试集性能,但提升幅度在不同任务和数据集间存在差异(如 CSL-Daily 上提升较小)。此外,渲染质量在极端视角下会退化,且背景编辑和身份重演依赖的扩散模型偶尔会产生伪影。未来的工作可以探索如何通过更高质量的 3D 重建和改进的扩散模型来进一步降低失真。


主要参考文献

[1] Camgoz et al., “Neural Sign Language Translation”, 2018 (Phoenix14T).
[5]
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。