← 返回 PaperDaily 视觉与图像

CVPR 2026夺冠?厦门大学HESP:一招解耦文本与动作,语义对齐吊打SALAD和MoMask!

很多文本生成的动作看起来“不太聪明”,核心原因在于潜空间的“语义纠缠”。厦门大学这篇CVPR 2026的HESP狠招就是要把动作“解耦”清楚。AG-VAE让每个动作都有清晰的语义标签,再配合DCMM和HCA做精细对齐,效果直接秒杀SALAD和MoMask。

CVPR 2026夺冠?厦门大学HESP:一招解耦文本与动作,语义对齐吊打SALAD和MoMask!
🐉 龙哥读论文知识星球来了!
想让AI按你的剧本“演”出来?星球无上限更新动作生成/大模型/自动驾驶等前沿论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
很多文本生成的动作看起来“不太聪明”,核心原因在于潜空间的“语义纠缠”。厦门大学这篇CVPR 2026的HESP狠招就是要把动作“解耦”清楚。AG-VAE让每个动作都有清晰的语义标签,再配合DCMM和HCA做精细对齐,效果直接秒杀SALAD和MoMask。


原论文信息如下:
论文标题:
Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation

引言

想象一下,你输入“一个人先是向前跑,然后转身向后走,最后举起右手”。理想情况下,AI应该准确生成包含“跑”、“转身”、“向后走”、“举右手”的连续动作。然而,现有方法往往生成一个“四不像”:动作模糊、语义混乱,比如“跑”和“走”混在一起。这就是当前文本驱动3D人体运动生成领域面临的核心挑战——语义纠缠(Semantic Entanglement)
此前的方法,无论是MDM、MoMask还是SALAD,大多依赖简单的各向同性高斯分布作为潜空间先验,并用“一刀切”的方式对齐文本和动作。这好比把所有颜色都倒进一个桶里搅浑。为了打破这个僵局,厦门大学的研究团队提出了一种名为HESP(Hierarchical Enhancement of Semantic Priors)的统一框架,给扩散模型的潜空间来了一次“大扫除”,将纠缠不清的语义清晰分离,让AI不仅能“听懂”指令,更能“演到位”。

告别“语义纠缠”!HESP用分层先验让文本驱动动作生成更可控

现有文本驱动运动生成方法(如MDM、MoMask、SALAD)的核心问题,龙哥总结为三点:潜空间语义纠缠(不同动作在潜在空间里“糊”在一起)、跨模态对齐粗糙(只用句子级特征匹配,忽略了词-关节、短语-子动作的层次对应)、缺乏可解释性(不知道模型为什么生成这个动作)。
HESP框架从根上动刀——把原来一个“大篮子”式的各向同性高斯先验,换成了分层可解释的语义子空间,并搭配动态记忆和层次注意力,让模型真的“看懂”文字再动。框架整体分为三个核心模块:AG-VAE(把潜空间解耦成有语义含义的子流形)、DCMM(动态跨模态记忆,像“参考书”一样存储典型文本-动作对)、HCA(层次交叉注意力,先局部对齐词和关节,再全局对齐句子和序列)。
图1:标准VAE与AG-VAE潜空间组织对比分析。(a)标准VAE潜空间分布结构混乱、重叠。(b)AG-VAE呈现清晰分离的多模态分布,反映不同运动动态。(c)AG-VAE中聚类概率分布显示明确的分配。图2:系统架构。左侧:AG-VAE潜流形(彩色高斯簇)。右侧:带有DCMM和HCA融合层的扩散生成器。彩色箭头表示层次文本-运动对齐。
图1(上)和图2(下):HESP的整体设计。潜空间不再是“一锅粥”,而是被划分为多个语义子流形;扩散生成器通过DCMM和HCA实现文本-运动的多层次对齐。

AG-VAE:将运动流形解耦为可解释的语义子空间

传统VAE相当于把所有动作的“特征向量”倒进一个洗衣机里搅拌,洗完后“跑”和“跳”的向量纠缠在一起。AG-VAE则像是一个智能分拣机——它根据动作的骨骼拓扑(Skeletal Topology)和时间语义,动态地将运动流形划分成若干个语义子流形,每个子流形对应一类连续动作(比如走路、挥手、转身)。
具体实现上,AG-VAE不采用固定的高斯混合先验,而是让先验的混合权重 πk(t, S) 随时间和骨骼图动态变化——这叫做时间自适应高斯混合先验。编码器同时输出潜变量 z 和软分配 k,表示每一帧动作属于哪个语义子流形。训练用ELBO损失,其中KL项被分解为三个部分,让模型学会同时优化重建质量和聚类清晰度。
图3:标准VAE与AG-VAE在数据重建任务上的均方误差(MSE)对比。AG-VAE的重建MSE从0.3584降至0.2981,相对提升16.84%,表明改进模型结构在数据重建上具有显著优势。
图3:AG-VAE的重建误差显著低于标准VAE,这为后续生成质量打下坚实基础。
龙哥看到这里心想:这种“把潜空间掰开揉碎”的设计,确实比早前的GMVAE(高斯混合VAE)聪明得多。GMVAE的混合权重是静态的,而AG-VAE会根据骨骼拓扑和时间位置动态调整,相当于让模型在上千人跳舞的广场里,能告诉你是“哪个区域”在跳哪种舞。

DCMM & HCA:让语言与动作实现“词-关节”级别的精准对齐

即使潜空间解耦了,文本和动作之间的“翻译”仍是个大问题。以前的跨模态注意力通常是扁平化的——拿整个句子去匹配整段动作,这必然导致细节丢失。比如“先举右手,再弯腰”这样的复合指令,模型很可能生成一个“举右手弯腰”的混合体。
HESP用两个模块解决这个问题:

DCMM(动态跨模态记忆)—— 相当于一个“动作-语义缓存库”,存储了多个典型的文本-运动原型对。在生成时,模型通过查询向量从记忆库中检索最相关的原型,得到长程语义上下文信息,提升对复杂描述的理解。

HCA(层次交叉注意力)—— 把对齐分成两级:局部对齐用词向量和每个关节的运动token做注意力,捕捉精细动作;全局对齐用句子向量和整个动作序列做注意力,保证时序一致。用一个可学习的门控 λ 自动平衡两部分的贡献。

此外还有一个自适应门控融合模块,在融合运动特征和文本特征时,为每个单词生成一个门控系数 g,动态决定当前词应该更依赖运动语境还是文本原意。这有效避免了特征过平滑问题。

碾压SOTA!在HumanML3D和KIT-ML上全面领先

说一千道一万,最终还得看实验数据。HESP在两大标准基准HumanML3D和KIT-ML上进行了全面测评,结果如下表所示(箭头↑表示越大越好,↓表示越小越好,→表示越接近真实运动越好)。
*表格超出部分左右可以滑动
Methods R-Precision ↑ FID↓ MM-Dist ↓ Diversity → MultiModality ↑
Top-1Top-2Top-3
Real motion0.511±.0030.703±.0030.797±.0020.002±.0002.974±.0089.503±.065-
T2M0.457±.0020.639±.0030.740±.0031.067±.0023.340±.0089.188±.0022.090±.083
AttT2M0.499±.0030.690±.0020.786±.0020.112±.0063.038±.0079.700±.0902.452±.051
ParCo0.515±.0030.706±.0030.801±.0020.109±.0052.927±.0089.576±.0881.382±.060
MoMask0.521±.0020.713±.0020.807±.0020.045±.0022.958±.0081.241±.040
MDM0.320±.0050.498±.0040.611±.0070.544±.0445.566±.0279.559±.0862.799±.072
MLD0.481±.0030.673±.0030.772±.0020.473±.0133.196±.0109.724±.0822.413±.079
MotionDiffuse0.491±.0010.681±.0010.782±.0010.630±.0013.113±.0019.410±.0491.553±.042
ReMoDiffuse0.510±.0050.698±.0060.795±.0040.103±.0042.974±.0169.018±.0751.795±.043
SALAD0.581±.0030.769±.0030.857±.0020.076±.0022.649±.0099.696±.0961.751±.062
HESP (Ours)0.600±.0040.788±.0030.871±.0020.045±.0022.521±.0089.662±.0451.814±.042
表1(上):HumanML3D测试集定量结果。HESP在R-Precision三个层级和FID、MM-Dist上全面领先,尤其R-Precision Top-3达到0.871,比第二名SALAD的0.857高出1.4%,FID与MoMask并列最好(0.045)。同时多样性(Diversity)最接近真实运动。
*表格超出部分左右可以滑动
MethodsR-Precision Top-1 ↑Top-2 ↑Top-3 ↑FID↓MM-Dist ↓Diversity →MultiModality↑
Real motion0.424±.0050.649±.0060.779±.0060.031±.0042.788±.01211.08±.097-
T2M0.370±.0050.569±.0070.693±.0072.770±.1093.401±.00810.91±.1191.482±.065
AttT2M0.413±.0060.632±.0060.751±.0060.870±.0393.039±.02110.96±.1232.281±.047
ParCo0.430±.0040.649±.0070.772±.0060.453±.0272.820±.02810.95±.0941.245±.022
MoMask0.433±.0070.656±.0050.781±.0050.204±.0112.779±.0221.131±.043
MDM0.164±.0040.291±.0040.396±.0040.497±.0219.191±.02210.847±.1091.907±.214
MLD0.390±.0080.609±.0080.734±.0070.404±.0273.204±.02710.80±.1172.192±.071
MotionDiffuse0.417±.0040.621±.0040.739±.0041.954±.0622.958±.00511.10±.1430.730±.013
ReMoDiffuse0.427±.0140.641±.0040.765±.0550.155±.0062.814±.01210.80±.1051.239±.028
SALAD0.477±.0060.711±.0050.828±.0050.296±.0122.585±.01611.097±.0951.004±.040
HESP (Ours)0.514±.0140.726±.0040.844±.0550.267±.0062.499±.01211.077±.1051.394±.028
表1(下):KIT-ML测试集结果。HESP同样取得最优或次优结果,尤其在R-Precision Top-1上达到0.514,比SALAD的0.477提升7.8%,MM-Dist也最低(2.499)。说明在更小、更多样的数据集上,HESP的泛化能力依然强劲。
除了数字,定性的对比更能说明问题。下图是HESP和MDM、SALAD在相同文本下的生成结果。可以看到MDM经常“断章取义”,SALAD虽然好一些但仍会遗漏关键动作(比如“T”字形),而HESP能忠实执行所有指令。
图4:MDM [38]、SALAD [16] 和本方法(HESP)生成结果的定性对比分析。
图4:定性对比。从左到右依次为MDM、SALAD、HESP生成的动作序列。HESP能准确还原“跑、转身、向后跑、举右手”等复杂指令。
此外,潜空间的结构性指标也证实了AG-VAE的分离效果:
表2:HumanML3D测试集上潜空间结构指标定量对比。Calinski-Harabasz (CH) 和簇分离度 (CS) 越高越好,Davies-Bouldin (DB) 指数越低越好。所有分数均在AG-VAE分类器生成的相同簇标签下计算。
表2:AG-VAE的CH分数是标准VAE的4.1倍,DB指数降低31%,表明解耦效果显著。
表3:不同方法VAE模型的重建质量与精度定量结果,以及可训练参数数量(在HumanML3D测试集上测量)。
表3:AG-VAE在重建MM-Dist、FID、MAE上均优于MMM和SALAD的VAE,且参数量更少。

揭秘潜在空间:清晰的结构化聚类是如何炼成的?

HESP最惊艳的地方,是它的潜空间可以直接看出“语义边界”。通过AG-VAE中的分类器,我们可以为每个样本分配一个软聚类标签,然后用t-SNE降维到三维空间可视化。
图5:潜空间中的聚类分配。使用t-SNE降维显示潜空间中样本的聚类分布。不同颜色代表不同簇,展示了样本在降维三维空间中的分布模式。
图5:潜空间聚类可视化。每个颜色代表一个语义子流形(比如行走、跑步、举手等)。可以看到不同簇之间界限清晰,标准差很小,说明AG-VAE真正把动作语义解耦了。
消融实验进一步证实各模块的作用。当去掉DCMM后,R-Precision Top-3下降2.4%,FID从0.049恶化为0.167;去掉HCA后FID升到0.116;两个都去掉则FID高达0.292,说明这两个模块对保持语义一致性至关重要。

总结与展望:结构化生成的下一个挑战

论文总结时也坦诚指出了HESP的不足和未来方向:
1. 多样性受限:结构化的潜空间在提升可控性的同时,会略微限制随机多样性。未来可能通过熵正则化混合先验来平衡。
2. 动作切换生硬:当文本描述缺少显式过渡词时(比如“然后”),模型在相邻的语义子流形之间切换时可能出现突然的“跳变”。如何生成更平滑的过渡是一个开放问题。
3. 长序列与多人交互:论文已经初步探索了单人的长序列生成,但多人的交互生成(如双人舞、打斗)仍是未来的有趣方向。
总的来说,HESP为“解耦式”运动生成提供了一个简洁而强大的基线。它证明:给潜空间“安个架子”,别让语义糊在一起,是提升可控性和可解释性的关键

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

为什么说HESP的潜空间是“可解释”的?传统VAE每个点代表一个动作,但无法知道它对应什么语义类别。AG-VAE通过软分配(soft assignment)为每个时间步输出一个概率向量,表示它属于哪个子流形。例如一个“跑步”动作,其潜向量会主要落在“跑步子流形”的高斯分量附近,而“挥手”则落在另一个分量附近。因此我们可以直接通过观察聚类标签就知道模型“认为”当前在做什么动作。这种可解释性在调试和安全应用中非常有价值。

HESP的DCMM和HCA在功能上有什么区别?DCMM更像是一个“外部记忆仓库”,它存储了跨样本的原型知识,使得模型可以“见多识广”——即使当前文本没有明确暗示,也能从记忆中借鉴合适的动作模式。HCA则专注于当前输入文本与运动序列的内在对齐,先做词-关节的精细匹配(局部),再做句子-序列的全局协调。两者配合:DCMM提供长程语义上下文,HCA提供精细层次对齐,缺一不可。

HESP能否直接用于双人交互生成?目前版本只支持单人动作生成。论文在扩展实验(Appendix C.3)中探索了长序列单人动作,但多人交互涉及更复杂的空间-时间相互作用(如握手时两个人的手要在同一时空交汇)。论文将其列为未来方向。如果想做多人交互,可能需要扩展AG-VAE以支持多个主体的联合潜空间建模,以及引入图神经网络编码人与人之间的关系。目前还不能直接迁移。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★ 将潜空间从各向同性高斯扩展为时间自适应高斯混合,并搭配动态记忆和层次注意力,三个创新点环环相扣,且每个都有充足的动机和实验支撑。

实验合理度:★★★★★ 在两个标准基准上与8种以上SOTA方法对比,用20次独立实验报告均值与置信区间,还提供了潜空间结构指标(CH/DB/CS)和用户研究,实验设计全面且公平。

学术研究价值:★★★★★ 提出“潜空间解耦+层次对齐”的新范式,对后续运动生成、具身AI、多模态理解等方向有很强的启示意义。结构化潜空间的概念可推广到其他时序生成任务。

稳定性:★★★★✰ 在标准评测中表现稳定,但论文指出语义切换时的突变问题,且未在噪声、遮挡等挑战性场景下测试。整体稳定性较好,但距离产品级鲁棒还有距离。

适应性以及泛化能力:★★★★✰ 在HumanML3D和KIT-ML两个数据集上都有出色表现,后者更小更杂,说明具备一定泛化能力。但训练数据主要涵盖日常动作和专业运动,对于武术、舞蹈等极端动作可能仍有局限。

硬件需求及成本:★★★★✰ 单卡RTX 3090 Ti即可训练,VAE训50轮,扩散训500轮。推理时DDIM采样50步,耗时较短。参数量比SALAD还少,性价比很高。

复现难度:★★★✰✰ 论文给出了详细的方法描述和超参数,但AG-VAE的时间自适应混合先验实现细节(如注意力网络预测πk)不够详尽,未开源代码(截至撰写时)。有一定复现门槛。

产品化成熟度:★★✰✰✰ 在可控运动生成场景(如动画预览、游戏角色控制)中有潜力,但多人交互、长视频、实时性等关键能力尚未解决。目前更适合作为学术参考而非直接产品化。

可能的问题:多样性受限(FID虽低但多样性不如部分方法),动作语义切换生硬,论文未讨论性别/体型等个体差异对运动风格的影响。此外,消融实验中DCMM和HCA的贡献量级不算特别大(FID从0.049到0.167),说明AG-VAE本身已经承担了主要解耦任务,两个模块是锦上添花而非雪中送炭。


主要参考文献

[1] Wenhan Lv, Shaopan Wang, Xiangyu Wu, Tianchu Hang, Zhongquan Jian, Qingqiang Wu. "Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generation." CVPR 2026.
[2] Sigmund et al. "SALAD: Skeleton-Aware Latent Diffusion for Text-to-Motion Generation." CVPR 2025.
[3] Chen et al. "MoMask: Masked Motion Generation with Diffusion." ICLR 2025.
[4] Tevet et al. "MDM: Motion Diffusion Model for Text-Driven Motion Generation." ICLR 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
觉得HESP的解耦思路很妙?想让AI做你的动作导演?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 动作生成+上海+厦大+龙睛),根据格式备注,可更快被通过且邀请进群。跟龙哥一起,用AI玩转3D动画!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。