← 返回 PaperDaily 视觉与图像

北大阿里最新:两步视频生成新范式DUET,质量追平DMD、多样性翻倍!

两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。

北大阿里最新:两步视频生成新范式DUET,质量追平DMD、多样性翻倍!

paperdaily_reaction_gif


原论文信息如下:
论文标题:
DUET: A Diversity–Quality Duet of Distillation Experts for Two-Step Video Generation
发表日期:
2026年08月
发表单位:
北京大学、阿里巴巴、清华大学
原文链接:
https://arxiv.org/pdf/2608.09637v1.pdf

两步视频生成的“鱼与熊掌”难题:质量与多样性为何不可兼得?

视频扩散模型这两年一路狂奔,生成质量肉眼可见地飞涨。但有一个老生常谈的痛点始终卡在那里——迭代采样太慢了。要生成一段5秒钟的视频,在高端GPU上跑几十步扩散采样,动辄十几分钟甚至更久。于是各路研究者开始把目光投向少步蒸馏(Few-step Distillation),试图把采样压缩到一两步,让视频生成在推理侧也能轻装上阵。
可一旦压缩到极致,一个尴尬的“鱼与熊掌”问题就浮出水面了:生成的质量和多样性,似乎没法同时保住。现在少步蒸馏有两大主流范式,一个叫轨迹级蒸馏(Trajectory-Level Distillation),代表方法是sCM;另一个叫分布级蒸馏(Distribution-Level Distillation),代表方法是DMD。前者从老师模型的轨迹上学习捷径,大致保留了老师采样的多样性,但输出偏保守、略显模糊;后者直接让学生的输出分布去对齐老师的输出分布,画面清楚锐利,但容易掉进“模式坍缩”的坑里,多样生成基本变成同一张脸的反复出现。
这里说的模式坍缩,简单讲就是生成结果只集中在少数几种“安全”的构图上。DMD用的是反向KL散度来做分布匹配,天然具有“试图靠近高概率区域”的倾向,于是学生模型倾向于死磕那些老师模型大概率会生成的模式,那些在数据集中不算主流的画面风格就被忽略了。反过来,sCM做的是逐条轨迹的映射对齐,强制输出沿着老师轨迹走,所以覆盖面广,但它的本质是一种均值回归行为,面对同一条轨迹上多种可能的终点时,输出经常落到模糊的“中间地带”。这就是少步生成中著名的质量-多样性权衡
图1
两种蒸馏范式之间的质量-多样性权衡。每一行展示同一提示词下用5个随机种子生成视频的首帧画面。DUET方法保住了sCM的多样化构图,同时继承了DMD的高视觉质量。
面对这种两难困局,很多研究团队都在尝试把两种蒸馏损失直接凑到一个训练目标里,图的就是“我全都要”。想法挺美好,但实操中会发现一个尖锐的问题:sCM和DMD诱导出的噪声到数据的映射方式本质上是冲突的。两者在训练中都朝着不同的方向拉扯学生网络的参数,结果就变成了让同一组参数在两种偏好之间艰难地跳探戈。一类方法例如rCM,把DMD损失缩放到1/100作为辅助,多样性还是远低于原版sCM;另一类像HiAR,为了减少损失冲突还得专门设计梯度路由模块。换句话说,损失级组合本质上是在“妥协”而不是“破局”,质量抬上来了,多样性就被按下去,反之亦然。
图2
图2:不同蒸馏范式在环状高斯混合分布上的噪声到数据映射可视化对比。颜色编码代表初始噪声。可以看到sCM学生的输出和老师模型的映射保持高度一致,而DMD则学到了一条完全不同的捷径。
那么问题来了:既然这两种目标各自擅长的领域如此不同,能不能别让它们挤在同一个网络里抢方向盘,而是让它们“各管一段”?这正是需要从生成过程本身的特性出发去思考的关键一步。北京大学、阿里巴巴和清华大学的研究团队,给出的答案是——把两位专家请进同一套采样流程,但不是让他们抢饭碗,而是按噪声等级划分辖区,各司其职

DUET核心机制:噪声级专家分工,各司其职

在扩散模型中,不同的噪声级别实际上承担着截然不同的职责。高噪声区间(t接近1)决定了视频的全局结构——物体的类别、构图布局、镜头运动,甚至动作模式;而低噪声区间(t接近0)则是在精修细节——边缘、纹理、光照和色彩。这种“先定框架、再填细节”的分层生成逻辑,给专家分工提供了天然的切分依据。
DUET的做法非常直白:把高噪声区间 [1, τ] 交给sCM专家,利用它强大的轨迹覆盖能力铺设多样化的布局;把低噪声区间 [τ, 0] 交给DMD专家,借助它对输出分布的精准匹配来完成细节上的锐化和精修。两个专家各自独立训练,各自都用自己最擅长的损失函数,完全没有系数调参的烦恼,也彻底消除了梯度冲突。这种设计在推理时也只需要两次网络评估,和原生两步蒸馏的成本完全一致。
图3
图3:DUET整体架构及切换时间τ的选择。左图展示了推理时的接力采样流程:sCM专家负责高噪声区间[1, τ]铺设多样结构,输出经过重新加噪后传递给DMD专家完成低噪声区间[τ, 0]的细节精修。右图展示了流匹配教师模型在不同噪声级上的曲率变化:语义形成阶段曲率高,细节精修阶段曲率低,两者的明显分界点对应τ=0.8。
在正式提出这个方法之前,团队先做了一个很聪明的小实验来验证“噪声级分工”的直觉:单独训练sCM专家和DMD专家,让它们各自在单步条件下对同一提示词生成多个样本,然后观察这些样本在特征空间中的分布。结果很明显——sCM专家的样本在提示词内部扩散得远更开,平均分散程度是DMD的2.35倍;而两个专家对不同提示词的生成本身落在相邻区域,说明分布偏移并不算大。这就为后面的接力采样扫清了最大障碍。
图4
图4:sCM和DMD专家在ViCLIP特征空间中的样本嵌入分布可视化。每个点代表一个独立生成的样本,颜色深浅区分不同提示词。sCM的样本散布范围显著更广,DMD则明显收紧。
那么正式的推理流程到底怎么走?给定文本提示c和初始噪声x₁,sCM专家先从最高噪声点出发预测一次干净端点,这个步骤本质上是在“安排全局剧本”:场景到底是什么、镜头怎么摆、人物往哪儿走。随后用重新加噪算子把预测结果拉到切换时间τ,再把这个中间隐变量交给DMD专家。DMD专家的任务是精修,把这个半成品打磨成一个细节丰富的最终输出。整个流程的链路可以简洁地表示为:
公式
公式1:重新加噪操作。sCM专家的预测端点通过线性插值混合一个高斯噪声ε,得到切换时刻τ的中间隐变量。这个操作保证从“干净预测”回到“带噪状态”时,数据流形的连续性不被破坏。
熟悉网络架构的读者可能已经注意到了,这种“按噪声区间路由到不同专家”的推理方式,和Wan2.2中MoE设计的专家分工逻辑颇有几分神似,只是DUET在任务层面直接把两种蒸馏目标拆给了不同的专家网络。

切换时间τ的玄机:如何找到最佳分工点?

这个τ是整个DUET方法里最核心的超参数,它的选择直接决定了两个专家各自的“任务量”。如果τ定得太大,比如接近1,那么sCM专家几乎只做了很小一部分去噪工作,剩下的烂摊子全都丢给DMD,而DMD在极高噪声条件下并没有足够的“改写能力”去弥补模糊的结构信息,生成结果会出现明显的构图脏乱和伪影。反过来,如果τ定得太小,比如接近0.3,sCM专家几乎要把所有去噪工作一次性干完,它的容量上限就会成为瓶颈,DMD专家也几乎没有精修的空间了。
那怎么科学地确定这个切换点,而不是靠玄学调参?论文提出了一种基于流匹配教师模型ODE轨迹曲率的启发式标准。曲率定义为相邻时间步位移与理论直线位移之间的相对偏差:
公式
公式2:流匹配教师模型ODE轨迹的曲率度量。曲率的物理含义是:真实轨迹偏离“从噪声x₁到数据x₀直线插值”的程度。曲率越高的区域,说明该段轨迹正在执行剧烈的语义重构,模型需要更多“思考空间”。
论文的实验发现,在Wan2.1这样的流匹配模型中,曲率在纯噪声端点附近非常高——噪声正在快速翻转为“看得懂的图像结构”;而在数据端点附近曲率较低——模型只是在做慢速的润色。这个转变在τ=0.8附近出现一个明显的分界点,曲率从大于1骤降到小于0.1。于是DUET直接把τ定在0.8,既给了sCM足够的空间去铺结构,又给DMD留下了充分的精修余地。
后续消融实验也验证了这个选择的合理性,在τ=0.3、0.8、0.934三档设置中,τ=0.8的质量分数全面领先,尤其实在细节相关的维度上优势明显。这一点等介绍实验结果的时候再细看。

RL引导的专家自适应:DUET+如何进一步突破瓶颈?

直接接力合作的效果已经相当不错,但论文并没有就此躺平。团队进一步冷静审视了DUET在直接协作模式下暴露出的两个短板。
第一个瓶颈:DMD专家的训练-推理分布偏移。DMD专家在训练时接触的是自己逆向模拟生成的中间隐变量,但在DUET推理时,喂给它的却是sCM专家的预测端点经过重新加噪后的隐变量。这两个分布并不完全一致,理论上完美专家应该从任何噪声级别都能正确推断干净数据,但实际网络中容量有限,这种分布偏移会直接影响DMD专家的精修表现。简而言之,DMD专家在推理时遇到了一个“陌生口音”的中间状态,需要有人帮它先适应这种新输入。
第二个瓶颈:sCM专家的容量封顶。在“先布局、后精修”的范式下,所有结构决策都压在sCM专家身上,而sCM需要拟合的是教师轨迹的完整积分:
公式
公式3:理想一致性函数的定义。它代表从当前状态出发,沿着教师速度场积分到数据端点的结果。在高噪声区间,这条积分路径高度弯曲,拟合难度极大,sCM专家很容易退化成一种“平均化”的行为模式,生成结构模棱两可、甚至物理上不够合理的画面。
针对这两个瓶颈,DUET+做出了一组“角色感知”的精修策略——给每个专家量身定做一套后续训法。对于sCM专家,利用它本身多样性丰富的特点,引入GRPO(Group Relative Policy Optimization,组相对策略优化)这一强化学习算法,把它的高噪声预测结果朝着“高奖励”的方向微调,同时保留其覆盖多样性的天性。由于重新加噪操作构建出一个高斯转移核,sCM专家可以天然地被看成一个单步策略网络,不需要引入额外的随机微分方程,直接就能用策略梯度来优化。对应的CM-GRPO训练目标为:
公式
公式4:CM-GRPO的停止梯度回归目标。Δⱼ是优势加权后的移动量,奖励高的样本会把预测端点朝“更受偏好”的方向拉,同时奖励归一化保证了训练稳定性。这样既借强化学习的威力提升了sCM专家的结构合理性,又因为奖励是基于多样性生成样本的群体对比,不至于把分布缩成一个点。
对于DMD专家,做法更直接——在DUET的实际采样链路下继续使用DMD损失训练,每次都拿sCM专家最新的输出分布作为输入来适配自己。两个专家的更新在一个训练任务中交替进行,DMD专家始终紧跟着sCM专家的“实时风格”,从根源上消除了分布偏移。
图5
图5:DUET直接协作模式的效果展示。从左到右依次为sCM、DUET和DUET+生成的视频首帧。可以看出,DUET已能兼顾整体结构和细节锐度,DUET+则在画面质感和视觉一致性上更进一步。

实验结果:质量与多样性兼得的实证验证

论文的实验做了一个非常硬核的选择——直接挑战“两步生成”这个极值场景,用的还是Wan2.1-T2V-1.3B作为教师模型,输出81帧、分辨率为832×480的视频。所有对比方法都严格限制在两步采样内(NFE=2),保证成本完全一致。质量维度用VBench的核心指标考核,多样性维度则同时在ViCLIP、DINO和CLIP三种特征空间中度量同提示词下的样本离散程度。
图6:定性对比
图6:不同方法在共享随机种子下的定性对比结果。每个方法那一行展示5次独立生成的首帧画面,同行的差异反映多样性。从视觉上可以清楚看到,sCM虽然构图丰富但画面发糊,DMD画质锐利但构图重复率极高,rCM和DP-DMD各有妥协,只有DUET和DUET+在保留多样性的同时维持了清晰的画面。
视觉上的直觉在定量数据上得到了完整映证。表1给出了所有方法在两步限制下的完整结果:
表4:训练配置
表4:sCM专家、DMD专家、DP-DMD和DUET+的详细训练配置。从批大小、学习率到训练步数都保持对齐,保证了对比实验的公平性。
首先看多样性维度。sCM的多样性优势是压倒性的,ViCLIP、DINO、CLIP三个特征空间上的平均多样性达到0.1865,是DMD的2.5倍以上。但正如前文所讲,这种多样性伴随着画面质量的牺牲,VBench聚合质量只有81.51。DMD则站到了天平的另一端:多样性骤降到0.0727,质量提升到84.38。
而两个混合策略的典型代表rCM和DP-DMD,恰好印证了“损失级组合只能妥协”的判断。rCM尝试在sCM目标上加一个1/100权重的DMD损失,结果多样性只有0.0783,几乎被DMD拉平;DP-DMD设计了一套两阶段方案——第一步做ODE回归、第二步做DMD——虽然多样性提升到0.1076,但质量反而比sCM还低(80.93),属于拆东墙补西墙。
表2:τ消融
表2:切换时间τ对DUET性能的影响。灰色底纹(τ=0.8)是论文默认设置,红色标记每列最佳分数。τ=0.3和τ=0.934在整体质量上都明显不如τ=0.8,验证了曲率启发式选点的有效性。
DUET的结果则让人眼前一亮。多样性平均0.1512,相比DMD提升108.0%——虽然还没完全到sCM的水平,但已经是rCM的2倍、DP-DMD的1.4倍。在质量维度上,DUET拿到了83.96分,比sCM高出2.45分,和DMD只差0.42分。可以说,DUET把sCM的七成多样性和DMD的九成质量揉在了一起。而经过RL引导自适应后的DUET+更强:多样性保持住了(0.1521),质量进一步提升到84.40,直接追平并略有反超DMD。换句话说,DUET+在质量不掉队的情况下,把多样性从DMD的0.0727拉到了0.1521。
除了主结果之外,论文还做了三件值得说道的事。第一件是验证τ的影响,实验设置中已经提到,τ=0.8在不同的质量子项上全面占优。第二件是奖励函数的消融。DUET+在CM-GRPO中使用了HPSv3作为默认奖励函数,论文还测试了尝试用纯图像质量相关维度来做奖励(比如只用VBench的“图像质量”或“美学质量”维度)的效果,下表给出了奖励选择对多样性质量的影响:
表3:奖励函数消融
表3:CM-GRPO奖励函数消融实验。★标记的是论文优先关注的质量维度,灰色底纹(HPSv3)是默认奖励。可以看出,用HPSv3这样综合性的奖励函数能在不牺牲多样性的前提下拿到最佳质量分,而单一维度的奖励会把多样性拉崩。
最后一个值得讨论的问题是“DUET+到底是角色分工的胜利,还是仅仅因为多训了一步DMD?”论文特意对比了一种叫做init-then-DMD的训练方式——先拿sCM做初始化,再用DMD损失继续训练。这种做法在训练初期能带进来一部分多样性,但随着DMD训练持续推进,多样性快速坍缩回DMD的基线水平。训练曲线清楚地展示了这一趋势,而DUET+在相同的训练步数下始终维持着远高于DMD的多样性水平。这说明:专家分工的角色边界是有实质意义的,不是简单的“先预训练再微调”能替代的。这种效果上的差异,也正是DUET+和“拿sCM初始化DMD”这种直观做法最本质的区别。
图7:训练动态对比
图7:init-then-DMD(先用sCM初始化再做DMD微调)与DUET+、DMD、sCM的训练动态对比。蓝色曲线是init-then-DMD的质量,红色曲线是多样性。init-then-DMD的质量虽能追到DMD水平,但多样性在训练过程中被DMD损失逐渐压垮,始终无法企及DUET+的高度。
这里还有一组定性演示很直观地展示了DUET和DUET+在不同切换时间以及不同提示下的生成效果,比如像素风的小狗、弹吉他的行人、酷似乌龟的浣熊、在海滩上吸尘的暴风兵,都是共享随机种子下的多模型对比。可以说,在“两步生成”这个极端条件下,DUET交出了一份相当有说服力的答卷。
rCM可视化
图8:rCM方法中σ_max参数对多样性-质量权衡的影响。σ_max=80(红色,上一组)时多样性尚可但画面质量明显下降,σ_max=1600(下一组)时质量提升但生成结果坍缩成几乎相同的构图。这正是损失级组合无法摆脱的固有困境。
图10:训练奖励曲线
图10:CM-GRPO在HPSv3奖励下对sCM专家做微调时的训练奖励曲线。浅色曲线是每次迭代的平均奖励,深色曲线是EMA平滑版本,奖励稳步上升后趋于稳定。

总结与展望:噪声级专家分工范式的潜力与局限

DUET这篇工作给人留下最深印象的地方,在于它用最小的复杂度撬动了一个看似无解的矛盾。它的核心注册表是:质量与多样性的冲突不一定要靠改良目标函数来“硬融”,可以在推理阶段用噪声级分工来“绕开”。sCM专家负责“布局”的多样性,DMD专家负责“细节”的高保真,两个原本八字不合的目标在时间维上被干净地切开了。这种范式上的简洁性非常有启发性——它证明了一个朴素的判断:在很多扩散模型中,结构形成和细节精修本来就是两个不同的子问题,给它们分配不同的网络并各自专精,可能比逼着一个网络左右横跳更高效。
当然,这个范式也有明显的局限。第一,τ的选取严重依赖经验性的曲率探测,对不同的基础模型或不同的分辨率设置,最优的切换点很可能需要重新标定,还难以形成一套自动化的适配机制。第二,DUET+的奖励函数设计仍然是个需要人工干预的敏感环节,用HPSv3和用纯质量维度得到的结果差异不小,实际工程应用中若不仔细调这个旋钮,效果会有起伏。第三,论文验证的任务是文本到视频的两步生成,并没有覆盖图像到视频、多步采样、长视频生成等更广泛的场景。专家分工的逻辑能不能顺利迁移到这些邻居场景,还有待后续验证。
从行业视角来看,这项技术真正的价值在于打开了“两步生成”在工程落地的想象空间。两步意味着在推理侧可以把采样从几十次降为两次,对短视频创作、特效预演、广告素材生成这类对实时性敏感的场景,是一个相当实在的加速方案。随着未来采样步数从两步放宽到三步或四步,噪声级专家分工的潜力还可以进一步释放——也许到时能出现三位甚至四位专家分别负责结构、运动、光影和纹理的分工链条。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对两步视频生成中质量与多样性的权衡难题,北大、阿里与清华提出DUET:将sCM与DMD两种蒸馏专家按噪声级分工,高噪声步保多样性,低噪声步提质量,无需损失级融合。
这篇工作最值得看的点是什么?DUET在保持接近DMD质量的同时,多样性比DMD提升108.0%;DUET+在保持多样性优势(+109.2%)的同时,质量达到DMD水平(84.40 vs 84.38),比sCM提升2.89个质量点。
这篇工作的边界或风险在哪里?优点:(1)通过噪声级专家分工巧妙规避了质量-多样性权衡,无需调节损失系数或解决梯度冲突;(2)两个专家独立训练,优化简单稳定;(3)RL引导的专家自适应进一步提升了质量;(4)在极端两步生成场景下取得了显著效果。缺点:(1)仅验证了Wan2.1-T2V-1.3B一个backbone,泛化性有待验证;(2)推理时需要同时加载两个专家模型,内存占用翻倍;(3)切换时间τ的选择依赖教师轨迹曲率,可能在不同模型上需要重新调整。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出噪声级专家二重奏(DUET),将高噪声区间分配给保持多样性的sCM专家、低噪声区间分配给提升保真度的DMD专家,两个专家独立训练后接力采样,并通过RL引导的专家自适应(DUET+)进一步提升质量。

实验合理度:★★★★☆

质量方面使用VBench分数(主体一致性SC、背景一致性BC、时序闪烁TF、运动平滑度MS、动态程度DD、美学质量AQ、成像质量IQ);多样性方面使用ViCLIP、DINO、CLIP特征空间中的同提示多样性指标。

学术研究价值:★★★★☆

提出噪声级专家二重奏(DUET),将高噪声区间分配给保持多样性的sCM专家、低噪声区间分配给提升保真度的DMD专家,两个专家独立训练后接力采样,并通过RL引导的专家自适应(DUET+)进一步提升质量;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

两步采样(NFE=2),与原生两步学生模型的FLOPs和延迟相同;训练sCM专家约1024 GPU小时,DMD专家约360 GPU小时,DUET+约128 GPU小时(16-32块NVIDIA H800 GPU)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)仅验证了Wan2.1-T2V-1.3B一个backbone,泛化性有待验证;(2)推理时需要同时加载两个专家模型,内存占用翻倍;

主要参考文献

[1] Lu and Song. sCM: Simplified Consistency Matching. 2025.
[2] Yin et al. DMD: Distribution Matching Distillation. 2024.
[3] Zheng et al. rCM: Robust Consistency Matching with DMD regularization. 2025.
[4] Wu et al. DP-DMD: Distribution-Preserving DMD with first-step regression. 2026.
[5] Shao et al. GRPO: Group Relative Policy Optimization. 2024.
[6] Wan et al. Wan2.1: A Comprehensive and Efficient Open-Source Video Generation Model. 2025.
[7] Brooks et al. Sora: Video Generation as World Simulation. 2024.
原文链接:https://

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球