想让AI按你的剧本“演”出来?星球无上限更新动作生成/大模型/自动驾驶等前沿论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
很多文本生成的动作看起来“不太聪明”,核心原因在于潜空间的“语义纠缠”。厦门大学这篇CVPR 2026的HESP狠招就是要把动作“解耦”清楚。AG-VAE让每个动作都有清晰的语义标签,再配合DCMM和HCA做精细对齐,效果直接秒杀SALAD和MoMask。
原论文信息如下:
引言
告别“语义纠缠”!HESP用分层先验让文本驱动动作生成更可控
AG-VAE:将运动流形解耦为可解释的语义子空间
DCMM & HCA:让语言与动作实现“词-关节”级别的精准对齐
DCMM(动态跨模态记忆)—— 相当于一个“动作-语义缓存库”,存储了多个典型的文本-运动原型对。在生成时,模型通过查询向量从记忆库中检索最相关的原型,得到长程语义上下文信息,提升对复杂描述的理解。
HCA(层次交叉注意力)—— 把对齐分成两级:局部对齐用词向量和每个关节的运动token做注意力,捕捉精细动作;全局对齐用句子向量和整个动作序列做注意力,保证时序一致。用一个可学习的门控 λ 自动平衡两部分的贡献。
碾压SOTA!在HumanML3D和KIT-ML上全面领先
| Methods | R-Precision ↑ | FID↓ | MM-Dist ↓ | Diversity → | MultiModality ↑ | ||
|---|---|---|---|---|---|---|---|
| Top-1 | Top-2 | Top-3 | |||||
| Real motion | 0.511±.003 | 0.703±.003 | 0.797±.002 | 0.002±.000 | 2.974±.008 | 9.503±.065 | - |
| T2M | 0.457±.002 | 0.639±.003 | 0.740±.003 | 1.067±.002 | 3.340±.008 | 9.188±.002 | 2.090±.083 |
| AttT2M | 0.499±.003 | 0.690±.002 | 0.786±.002 | 0.112±.006 | 3.038±.007 | 9.700±.090 | 2.452±.051 |
| ParCo | 0.515±.003 | 0.706±.003 | 0.801±.002 | 0.109±.005 | 2.927±.008 | 9.576±.088 | 1.382±.060 |
| MoMask | 0.521±.002 | 0.713±.002 | 0.807±.002 | 0.045±.002 | 2.958±.008 | 1.241±.040 | |
| MDM | 0.320±.005 | 0.498±.004 | 0.611±.007 | 0.544±.044 | 5.566±.027 | 9.559±.086 | 2.799±.072 |
| MLD | 0.481±.003 | 0.673±.003 | 0.772±.002 | 0.473±.013 | 3.196±.010 | 9.724±.082 | 2.413±.079 |
| MotionDiffuse | 0.491±.001 | 0.681±.001 | 0.782±.001 | 0.630±.001 | 3.113±.001 | 9.410±.049 | 1.553±.042 |
| ReMoDiffuse | 0.510±.005 | 0.698±.006 | 0.795±.004 | 0.103±.004 | 2.974±.016 | 9.018±.075 | 1.795±.043 |
| SALAD | 0.581±.003 | 0.769±.003 | 0.857±.002 | 0.076±.002 | 2.649±.009 | 9.696±.096 | 1.751±.062 |
| HESP (Ours) | 0.600±.004 | 0.788±.003 | 0.871±.002 | 0.045±.002 | 2.521±.008 | 9.662±.045 | 1.814±.042 |
| Methods | R-Precision Top-1 ↑ | Top-2 ↑ | Top-3 ↑ | FID↓ | MM-Dist ↓ | Diversity → | MultiModality↑ |
|---|---|---|---|---|---|---|---|
| Real motion | 0.424±.005 | 0.649±.006 | 0.779±.006 | 0.031±.004 | 2.788±.012 | 11.08±.097 | - |
| T2M | 0.370±.005 | 0.569±.007 | 0.693±.007 | 2.770±.109 | 3.401±.008 | 10.91±.119 | 1.482±.065 |
| AttT2M | 0.413±.006 | 0.632±.006 | 0.751±.006 | 0.870±.039 | 3.039±.021 | 10.96±.123 | 2.281±.047 |
| ParCo | 0.430±.004 | 0.649±.007 | 0.772±.006 | 0.453±.027 | 2.820±.028 | 10.95±.094 | 1.245±.022 |
| MoMask | 0.433±.007 | 0.656±.005 | 0.781±.005 | 0.204±.011 | 2.779±.022 | 1.131±.043 | |
| MDM | 0.164±.004 | 0.291±.004 | 0.396±.004 | 0.497±.021 | 9.191±.022 | 10.847±.109 | 1.907±.214 |
| MLD | 0.390±.008 | 0.609±.008 | 0.734±.007 | 0.404±.027 | 3.204±.027 | 10.80±.117 | 2.192±.071 |
| MotionDiffuse | 0.417±.004 | 0.621±.004 | 0.739±.004 | 1.954±.062 | 2.958±.005 | 11.10±.143 | 0.730±.013 |
| ReMoDiffuse | 0.427±.014 | 0.641±.004 | 0.765±.055 | 0.155±.006 | 2.814±.012 | 10.80±.105 | 1.239±.028 |
| SALAD | 0.477±.006 | 0.711±.005 | 0.828±.005 | 0.296±.012 | 2.585±.016 | 11.097±.095 | 1.004±.040 |
| HESP (Ours) | 0.514±.014 | 0.726±.004 | 0.844±.055 | 0.267±.006 | 2.499±.012 | 11.077±.105 | 1.394±.028 |
揭秘潜在空间:清晰的结构化聚类是如何炼成的?
总结与展望:结构化生成的下一个挑战
龙迷三问
为什么说HESP的潜空间是“可解释”的?传统VAE每个点代表一个动作,但无法知道它对应什么语义类别。AG-VAE通过软分配(soft assignment)为每个时间步输出一个概率向量,表示它属于哪个子流形。例如一个“跑步”动作,其潜向量会主要落在“跑步子流形”的高斯分量附近,而“挥手”则落在另一个分量附近。因此我们可以直接通过观察聚类标签就知道模型“认为”当前在做什么动作。这种可解释性在调试和安全应用中非常有价值。
HESP的DCMM和HCA在功能上有什么区别?DCMM更像是一个“外部记忆仓库”,它存储了跨样本的原型知识,使得模型可以“见多识广”——即使当前文本没有明确暗示,也能从记忆中借鉴合适的动作模式。HCA则专注于当前输入文本与运动序列的内在对齐,先做词-关节的精细匹配(局部),再做句子-序列的全局协调。两者配合:DCMM提供长程语义上下文,HCA提供精细层次对齐,缺一不可。
HESP能否直接用于双人交互生成?目前版本只支持单人动作生成。论文在扩展实验(Appendix C.3)中探索了长序列单人动作,但多人交互涉及更复杂的空间-时间相互作用(如握手时两个人的手要在同一时空交汇)。论文将其列为未来方向。如果想做多人交互,可能需要扩展AG-VAE以支持多个主体的联合潜空间建模,以及引入图神经网络编码人与人之间的关系。目前还不能直接迁移。
龙哥点评
论文创新性分数:★★★★★ 将潜空间从各向同性高斯扩展为时间自适应高斯混合,并搭配动态记忆和层次注意力,三个创新点环环相扣,且每个都有充足的动机和实验支撑。
实验合理度:★★★★★ 在两个标准基准上与8种以上SOTA方法对比,用20次独立实验报告均值与置信区间,还提供了潜空间结构指标(CH/DB/CS)和用户研究,实验设计全面且公平。
学术研究价值:★★★★★ 提出“潜空间解耦+层次对齐”的新范式,对后续运动生成、具身AI、多模态理解等方向有很强的启示意义。结构化潜空间的概念可推广到其他时序生成任务。
稳定性:★★★★✰ 在标准评测中表现稳定,但论文指出语义切换时的突变问题,且未在噪声、遮挡等挑战性场景下测试。整体稳定性较好,但距离产品级鲁棒还有距离。
适应性以及泛化能力:★★★★✰ 在HumanML3D和KIT-ML两个数据集上都有出色表现,后者更小更杂,说明具备一定泛化能力。但训练数据主要涵盖日常动作和专业运动,对于武术、舞蹈等极端动作可能仍有局限。
硬件需求及成本:★★★★✰ 单卡RTX 3090 Ti即可训练,VAE训50轮,扩散训500轮。推理时DDIM采样50步,耗时较短。参数量比SALAD还少,性价比很高。
复现难度:★★★✰✰ 论文给出了详细的方法描述和超参数,但AG-VAE的时间自适应混合先验实现细节(如注意力网络预测πk)不够详尽,未开源代码(截至撰写时)。有一定复现门槛。
产品化成熟度:★★✰✰✰ 在可控运动生成场景(如动画预览、游戏角色控制)中有潜力,但多人交互、长视频、实时性等关键能力尚未解决。目前更适合作为学术参考而非直接产品化。
可能的问题:多样性受限(FID虽低但多样性不如部分方法),动作语义切换生硬,论文未讨论性别/体型等个体差异对运动风格的影响。此外,消融实验中DCMM和HCA的贡献量级不算特别大(FID从0.049到0.167),说明AG-VAE本身已经承担了主要解耦任务,两个模块是锦上添花而非雪中送炭。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!