吹得再好不如实验跑一跑。MoCoDiff在三个大规模人体运动数据集上做了验证:HumanML3D、BABEL和100Style。其中HumanML3D提供文本-动作对,BABEL提供丰富的时序标注和动作类别,100Style则作为风格参考动作库,提供风格嵌入的样本,不用于监督训练。训练配置相当亲民:单张RTX 3090显卡、batch size 64、训练8000步、大约2小时就能跑完。表:实现细节。训练使用batch size 64、单张RTX 3090、8000次迭代,耗时约2小时。评估指标方面,论文用了内容保持、风格对齐和过渡平滑性三组指标。内容保持用R-Precision(运动检索精度)、Diversity(多样性)和FID(Frechet Inception Distance,弗雷歇初始距离)来衡量;风格对齐用SRA(Style Recognition Accuracy,风格识别准确率)衡量;过渡平滑性用PJ(Peak Jerk,峰值加加速度)和AUJ(Area Under the Jerk,加加速度曲线面积)来量化。需要说明的是,FID是度量生成动作分布和真实动作分布的距离,越低越好;SRA是判断动作是否具有目标风格的准确率,越高越好。表1:定量评估。↑表示越大越好,↓表示越小越好,→表示越接近真实动作越好。加粗为最优,下划线为次优。从表1可以看到,MoCoDiff在SRA上拿到26.37,明显高于第二名AutoMLD+SMooDi的19.28,这说明风格注入的准确度确实有质的提升。R-Top-3达到0.564,略低于AutoMLD+SMooDi的0.537但有来有回。不过FID上MoCoDiff是5.95,AutoMLD+SMooDi是2.24,确实不如人家。这里要客观看待:FID反映的是整体分布相似度,MoCoDiff在SRA和过渡平滑上的领先换来的是FID上的一定妥协,这可能与风格化参考动作的分布偏移有关。时序平滑度方面,MoCoDiff在PJ(0.27)和AUJ(1.58)都是全场最佳,说明受控自回归设计确实能有效抑制帧间抖动。表2和表3:单动作生成评估与时间效率评估。Ours在SRA上达到27.21,显著领先SMooDi的20.65;效率方面达到136.89 FPS,比最强baseline AutoMLD+MCM_LDM快4.8倍。表2展示了去掉自回归模块、直接用单动作生成任务的对比。MoCoDiff的SRA达到27.21,明显高于SMooDi的20.65和PersonaBooth的16.75,说明Style IMC在单动作上提取风格的能力也足够强。表3则是最能体现工程价值的一张表:MoCoDiff在生成效率上达到136.89 FPS,每帧只需要7.31毫秒,生成一段完整动作只要0.72秒。对比最强的自回归基线AutoMLD+MCM_LDM,速度是它的4.8倍;对比ControlNet+FlowMDM每帧352毫秒的延迟,MoCoDiff快了将近50倍。这种效率对于需要实时预览的动画制作流程来说,意味着可以真正进入交互式创作环节。定性结果方面,图5展示了几个典型对比场景。在单动作风格化任务中,给定“踢腿”的文本和“优雅”的风格,SMooDi只做出了踢腿的雏形,动作没有完全伸展开;FlowMDM+ControlNet则太执着于风格导致动作变形,连向前走的基本方向都错了。MoCoDiff则兼顾了语义准确和风格鲜明,踢腿干脆利落,整体姿态又透着一股优雅劲儿。在长序列风格化任务中,MoCoDiff在跨段过渡处依然保持平滑,而AutoMLD+SMooDi在过渡区出现了明显的卡顿和跳变,红框标注的细节对比非常直观。图5:定性对比评估。MoCoDiff在多个动作上实现平滑过渡和忠实风格迁移,而先前方法出现动作伪影和风格不一致(红框区域)。消融实验也做得很扎实。图6展示了去掉自回归扩散模块(w/o ARDiffusion)和去掉IMC(w/o IMC)之后的对比效果。去掉自回归扩散后,长序列生成后段出现了明显的漂移,动作逐渐偏离文本描述;去掉IMC后,风格一致性明显变差,过渡处有可见的抖动。而完整版MoCoDiff在整个长序列中保持了平滑和风格一致,这直接印证了可控自回归扩散和IMC各自的贡献。图6:消融研究定性对比。完整方法保持平滑且风格一致,去掉自回归扩散出现漂移,去掉IMC风格保真度下降。图8:历史帧长度权衡。历史帧长度在风格化效果与过渡平滑性之间存在明显折中,需要选择合适长度。图8进一步分析了历史信息长度k对生成效果的影响。历史帧太短,上一段的运动学信息不足,过渡处容易“断片”;历史帧太长,模型反而会把过多的旧信息当作当前风格的一部分,导致风格漂移。论文实验显示中间长度(约60帧)能取得最佳平衡,这也解释了为什么实验设置中选用60帧过渡窗口。Table 1. Quantitative Evaluation. Symbols ↑, ↓, and → indicate that higher, lower, or closer-to-ground-truth (GT) values are better, respectively; The Bold text indicates the best performer, underlined text indicates the second best performer.表4:风格强度控制评估。λ增大时SRA持续升高但FID恶化严重,λ=1.0时风格准确率与内容保持达到最佳平衡。风格强度控制实验揭示了一个重要的权衡关系:随着风格强度系数λ从0.5增加到1.5,SRA从7.82一路升到32.15,但FID也从1.99恶化到12.84,内容保持能力显著下降。这说明风格和内容之间存在天然矛盾,过强的风格注入会挤压内容信息的表达空间。论文最终选择λ=1.0作为平衡点,既保证了风格识别度(27.21),又让内容损失控制在可接受范围(FID 5.56)。这个实验的价值在于告诉使用者:风格强度不是越大越好,需要根据具体场景做权衡。综合来看,MoCoDiff在风格保真、时序平滑性和推理效率三个维度都取得了明显优势,虽然在FID这类整体分布距离指标上不是最优,但考虑到它在可控制性和长序列稳定性上的收益,这种取舍是值得的。
[1] Song W, Wang X, Li S, et al. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation. CVPR 2026.[2] MoCoDiff官方代码仓库: https://github.com/Xuehan0530/MoCoDiff-code[3] Raab S, et al. FlowMDM: Flow Matching for Human Motion