← 返回 PaperDaily 视觉与图像

NVIDIA+清华新作Causal-rCM:2步视频生成冲到84.63

这篇论文把“教师强制”和“自习强制”拧成了一个统一蒸馏配方,还顺手把连续时间一致性模型和分布匹配蒸馏接上了。更有意思的是,它不只会讲方法,还真把流式视频生成和交互式世界模型都跑出了像样的结果。

NVIDIA+清华新作Causal-rCM:2步视频生成冲到84.63
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“教师强制”和“自习强制”拧成了一个统一蒸馏配方,还顺手把连续时间一致性模型和分布匹配蒸馏接上了。更有意思的是,它不只会讲方法,还真把流式视频生成和交互式世界模型都跑出了像样的结果。


原论文信息如下:
论文标题:
Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
发表日期:
2026年06月
发表单位:
Tsinghua University, UT Austin, NVIDIA
原文链接:
https://arxiv.org/pdf/2606.25473v1.pdf
开源代码链接:
https://github.com/NVlabs/rcm
### 文章上半部分子标题:

引言

方法概述

核心原理推导

数据准备及实验设计

### 文章下半部分子标题:

实验结果

实验结果分析

龙迷三问

龙哥点评


主要参考文献

Kaiwen Zheng, Yuji Wang, Qianli Ma, Huayu Chen, Jintao Zhang, Yogesh Balaji, Jianfei Chen, Ming-Yu Liu, Jun Zhu, and Qinsheng Zhang. Large scale diffusion distillation via score-regularized continuous-time consistency. arXiv preprint arXiv:2510.08431, 2025.
Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion. arXiv preprint arXiv:2506.08009, 2025.
Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, and Bill Freeman. Improved distribution matching distillation for fast image synthesis. Advances in neural information processing systems, 37:47455–47487, 2024.
Cheng Lu and Yang Song. Simplifying, stabilizing and scaling continuous-time consistency models. arXiv preprint arXiv:2410.11081, 2024.
Zhengyang Geng, Mingyang Deng, Xingjian Bai, J Zico Kolter, and Kaiming He. Mean flows for one-step generative modeling. arXiv preprint arXiv:2505.13447, 2025.
Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, and Zhouchen Lin. Pyramidal flow matching for efficient video generative modeling. In International Conference on Learning Representations, volume 2025, pages 23378–23402, 2025.

Causal-rCM:自回归视频扩散的“教师+自习”统一配方

这篇论文最有意思的地方,是把 教师强制自习强制 这两种训练姿势拧成了一套统一配方。先让模型在“有标准答案的课堂”里打基础,再扔进“自己写作业、自己改错题”的实战环境里补课。前者稳,后者狠,合在一起就不容易一上来把视频生成搞成“前几帧还像样,后面全跑偏”。
图1:Causal-rCM在流式视频生成上的状态级表现
图1:Causal-rCM在流式视频生成上的状态级表现。1步、2步、4步采样下都能拿到很强的 VBench-T2V 分数,说明“少步数”并不必然等于“糊成一团”。
这里先把两个缩写说清楚。TFTeacher-Forcing,中文叫“教师强制”;SFSelf-Forcing,中文叫“自习强制”。前者训练时喂真历史,后者训练时让模型吃自己生成的历史。一个像老师盯着做题,一个像闭卷考试现场。

从rCM到Causal-rCM:前向-反向散度互补的因果扩展

要理解 Causal-rCM,得先把它的“祖师爷” rCM 说一下。rCMScore-Regularized Continuous-Time Consistency Model,中文可以理解为“分数正则化的连续时间一致性模型”。它的核心哲学很朴素:扩散蒸馏里,前向散度反向散度 不是死对头,而是互补搭子。
图2:rCM与Causal-rCM的统一散度视角
图2:rCM与Causal-rCM的统一散度视角。论文把 rCM 里的“连续时间一致性模型 + 分布匹配蒸馏”这套逻辑,平移到了自回归视频扩散里:TF 对应更稳的离线前向训练,SF 对应更贴近推理的在线分布匹配。
论文这里还顺手解释了一个老问题:为什么很多自回归视频方法一到推理阶段就开始“越滚越歪”?因为训练时看的是干净历史,推理时吃的是自己生成的历史,分布根本不是一回事,这就是经典的 exposure bias,中文常说“暴露偏差”。
Causal-rCM 的妙处在于,它不是把 TF 和 SF 简单并排摆着,而是把它们排成了一个“三段式流水线”:先用 TF 把双向扩散模型改造成因果教师,再用 TF-CM 把这个教师蒸馏成少步学生,最后用 SF-DMD 在学生自己的滚动轨迹上做精修。这个顺序很关键,等于先扶正骨架,再做减脂塑形。
图4:Causal-rCM与其他方法的对比
图4:Causal-rCM与其他方法的对比。论文强调它的路线更像“先离线打底,再在线纠偏”的统一配方。

基础组件:教师强制CM与自习强制DMD的协同

先看第一块:TF-CM。这里的 CMConsistency Model,中文叫“一致性模型”。它要做的事很直接:让模型学会把任意噪声时刻的输入,映射回同一个干净结果。放到自回归视频里,就是让当前块在看见干净历史的前提下,学会稳定地去噪。
TF 的关键不是“喂真值”这么简单,而是把清洁历史和带噪目标打包进同一次前向里。论文还把这个 TF-CM 进一步做成连续时间版本,也就是 TF-sCM。这里的 sCMscore-based continuous-time consistency model 的简写,中文可理解为“基于分数的连续时间一致性模型”;它的核心是用连续时间的切向量约束代替离散步之间的硬对齐。论文还提到 MeanFlow,即 Mean Flows for One-Step Generative Modeling,中文可译为“用于一步生成建模的均值流”。
图6:TF-dCM与TF-sCM的训练曲线
图6:TF-dCM与TF-sCM的训练曲线。连续时间版本收敛更快,约快了 10 倍。
第二块是 SF-DMDDMDDistribution Matching Distillation,中文叫“分布匹配蒸馏”。它的逻辑更像“让学生自己生成,再拿老师来校正学生分布”。这类方法通常更贴近推理分布,但也更挑初始化。
所以论文的策略很务实:先用 TF-CM 把学生扶到一个靠谱起点,再进入 SF-DMD 精修。这个顺序不是仪式感,而是经验教训。因为自回归视频里,前面一步的误差会像滚雪球一样传下去,DMD 若没有好初始化,就容易把“少步数生成”做成“少步数翻车”。
图7:不同初始化策略下的SF-DMD训练曲线
图7:不同初始化策略下的SF-DMD训练曲线。TF 初始化比 DF 初始化更适合接到后续的自习强制阶段。
视频演示:1步到4步采样时的性能演变。直观说明了 Causal-rCM 的“少步数也能稳住画面”不是嘴上说说。

核心加速:基于JVP的连续时间一致性模型

如果说前面讲的是“训练策略”,那这里就是“工程狠活”。连续时间一致性模型最大的问题之一,是要算沿着教师轨迹的切向量。论文没有选择笨办法硬算,而是把它做成了 JVPJVPJacobian-Vector Product,中文叫“雅可比向量积”。简单说,就是不去显式展开一大坨雅可比矩阵,而是直接算“这个方向上的导数”。省内存,省显存。
更关键的是,论文把 JVP 和 FlashAttention-2 的自定义掩码结合起来,做出了可用于 TF 场景的连续时间蒸馏内核。Causal-rCM 选择把这一步工程化,才让“连续时间 TF-sCM”真正能跑起来。
基础设施对比图:rCM 与其他代码库在视频扩散蒸馏中的效率和可扩展性对比。它传达的信息很明确:这不是只会写公式的论文,而是把训练并行、KV cache、激活检查点、上下文并行这些工程拼图一起装好了。
插图
这里值得补一句:论文里还提到 KV cache,也就是键值缓存。它是自回归模型能“边生成边记忆”的关键机制。Causal-rCM 把缓存、并行和蒸馏绑在一起,才让低步数推理真的有实用意义。

效果展示:流式视频生成与交互世界模型的最佳实践

实验部分先说结论:Causal-rCM 不只是“理论上统一”,而是确实把结果做出来了。论文在 Wan2.1 上做了流式视频生成,分别测试 frame-wise 和 chunk-wise 两种自回归方式,并且在 1 步、2 步、4 步采样下都拿到了很强的表现。最亮眼的是 2 步蒸馏的 Wan2.1-1.3B 模型,VBench-T2V 得分达到 84.63
表4:Wan2.1 T2V上的主要流式视频生成结果
表4:Wan2.1 T2V上的主要流式视频生成结果。Causal-rCM 在低步数设定下依然保持了领先。
更有意思的是,它还被用到了 Cosmos 3 这种面向物理智能的基础世界模型上,做成了交互式世界模型。论文给出的图示说明,方法不是简单地“看图说话”,而是把动作条件也纳入生成过程:车辆怎么动,模型就要跟着模拟出后续视觉变化。
图9:从Cosmos 3到交互式Cosmos 3
图9:从Cosmos 3到交互式Cosmos 3。Causal-rCM 不只服务于“看起来像视频”的生成,还能服务于“带动作条件的世界模拟”。
图10:自动驾驶场景下的交互式生成
图10:自动驾驶场景下的交互式生成。车辆动作作为条件输入后,模型能够生成后续视觉演化。
论文还做了初始化策略消融。结果表明,TF 初始化比 DF 初始化更适合接入 SF-DMD;而在 chunk-wise 的可视化里,DF/TF 初始化虽然有时分数不差,但细节容易偏“过于平滑”,纹理和局部锐利度会丢一点。
表5:4步SF-DMD不同初始化策略的消融
表5:4步SF-DMD不同初始化策略的消融。初始化不是小事,选错了,后面的在线蒸馏就像拿着钝刀切西瓜。
图8:不同初始化策略下的chunk-wise SF-DMD可视化
图8:不同初始化策略下的chunk-wise SF-DMD可视化。DF/TF 初始化往往更稳,但可能带来过于平滑的纹理。

全面总结:一个开源、统一、可扩展的算法-基础设施配方

这篇论文最值得记住的,不只是某个分数,而是它把“算法设计”和“系统实现”绑成了一条绳。很多论文喜欢在公式上赢麻了,落地时却被显存、并行、缓存、训练图这些现实问题按在地上摩擦;Causal-rCM 则是从一开始就把这些坑考虑进去了。它让 TF、DF、SF、JVP、KV cache、FSDP2、上下文并行和选择性激活检查点彼此兼容,最后拼成一套真正能训练、能蒸馏、能推理的 recipe。
如果把它放到更大的脉络里看,这项工作其实在回答一个很现实的问题:自回归视频扩散到底怎么才能既快又稳,还不把质量搞崩?它给出的答案不是“单点神技”,而是“训练范式 + 蒸馏目标 + 工程基础设施”的组合拳。
当然,它也不是没有代价。第一,SF-DMD 依旧依赖较好的初始化,说明“在线纠偏”并不能完全替代“离线打底”。第二,虽然连续时间版本更快,但实现复杂度明显更高,尤其是自定义掩码和 JVP 内核这部分。第三,交互世界模型虽然很香,但真正落到机器人和自动驾驶闭环里,还要继续验证长时稳定性和动作-视觉因果一致性。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是自回归视频扩散里“训练时很稳、推理时容易越滚越歪”的问题。做法是把教师强制的一致性蒸馏和自习强制的分布匹配蒸馏串起来,让模型先学会靠谱的因果上下文,再去适应自己的生成轨迹。

TF、SF、CM、DMD 这些缩写分别是什么意思?TF 是 Teacher-Forcing,教师强制;SF 是 Self-Forcing,自习强制;CM 是 Consistency Model,一致性模型;DMD 是 Distribution Matching Distillation,分布匹配蒸馏。前两者是训练范式,后两者是蒸馏目标,它们在这篇论文里是一一配对的。

为什么还要做 JVP 和 FlashAttention-2 这些工程优化?因为连续时间一致性模型需要算切向量,普通自动微分在长视频 transformer 上太费显存;JVP 能直接算方向导数,配合自定义掩码的 FlashAttention-2,才能把 TF-sCM 真正跑到大模型上。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ TF-CM + SF-DMD 的统一配方有清晰的新意。

实验合理度:★★★★☆ 既有流式视频生成,也有交互世界模型,实验链条比较闭环。

学术研究价值:★★★★★ 把自回归视频扩散、连续时间蒸馏和因果训练统一起来。

稳定性:★★★☆☆ SF-DMD 仍依赖较好的初始化。

适应性以及泛化能力:★★★★☆ 能扩展到动作条件世界模型。

硬件需求及成本:★★★☆☆ 训练阶段对显存、并行和自定义算子仍有要求。

复现难度:★★★☆☆ 代码开源是加分项,但 JVP 内核、掩码和并行系统都不算简单。

产品化成熟度:★★★☆☆ 交互世界模型要进入真实闭环场景,还需要更多鲁棒性验证。

可能的问题:系统复杂度不低;如果没有强工程团队,落地时容易卡在算子、缓存和训练稳定性上。


主要参考文献

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, and Qianli Ma. Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models. arXiv preprint arXiv:2606.25473, 2026.
Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, and Zhouchen Lin. Pyramidal flow matching for efficient video generative modeling. In International Conference on Learning Representations, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。