← 返回 PaperDaily
视觉与图像
华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了
视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。
龙哥读论文
发布于 2026-08-15 00:20:22
阅读 5
查看原文
原论文信息如下:
视频生成模型正在从“能生成一段好看的视频”向“能预测下一步世界变化”进化。自动驾驶、具身智能、游戏引擎,都在盘算着把视频生成模型当世界模型用。但世界模型有个非常硬核的需求:它必须在线地、逐帧地生成视频流,而不是离线地一次性生成整段视频。通俗点说,你得像人看世界一样,看一帧、想一帧、生成一帧,源源不断。这种能力,圈内叫流式视频生成(Streaming Video Generation)。
听起来挺带感对吧?然而,流式视频生成有一条绕不过去的坎——训练和推理之间的“错位”。推理时,模型需要按照严格由低到高的噪声顺序,边去噪边滚动生成新帧;训练时,主流策略却喜欢给不同帧随机撒不同水平的噪声,追求训练多样性。一个要“整齐划一”,一个要“五颜六色”,这俩能尿到一个壶里才怪。
华中科技大学联合地平线机器人提出的Stream Forcing,就是冲着这个问题来的。这篇工作的思路有点意思:把训练时的噪声水平采样,重新理解为一种“帧索引的随机过程”,然后用课程学习的方式,让模型从“各玩各的”独立采样,平滑迁移到“整齐划一”的推理一致采样。换句话说,你不是要两头兼顾吗?那就干脆造一条从一头到另一头的滑梯,让训练顺着滑梯一路滑过去。
流式视频生成为何如此困难?训练与推理的“错位”难题
要搞清楚Stream Forcing解决了什么问题,得先弄明白流式视频生成里的推理策略在干嘛。
目前主流的流式推理策略大致有两种:分块生成(Chunk-based Generation)和流水线生成(Streamlined Generation)。分块生成很好理解,就是把视频切成一块一块,每次生成一个块,块与块之间串行执行,延迟高达S个去噪步。流水线生成则精明得多,它把去噪过程像流水线一样交错在滑动窗口里,不同帧同时处于不同的噪声水平,大家一起往下走,延迟直接降到S/T步。图1把这两种方式画得很清楚。
Stream Forcing采用的是流水线生成这种推理引言里提到,Stream Forcing走的是流水线生成的推理路线,也就是让不同帧在同一时刻处于不同的去噪阶段,像工厂流水线一样滚动产出新帧。这条路线最大的特点是:推理时每一帧的噪声水平基本“被安排得明明白白”——靠前的帧噪声低、靠后的帧噪声高,中间帧按时间顺序排成一条单调递增的队列。用数学语言写出来就是公式2的k_t≤k_{t+1}。
公式1是扩散模型的加噪过程:训练时把一帧干净图像x_t按系数√ᾱ叠加高斯噪声ε_t,得到带噪观测x_t^kt。这里的k_t就是第t帧的噪声水平,数值越大代表噪声越强、画面越糊。公式2则规定了流水线推理下噪声水平的“队列顺序”。
可训练时一上来就遇到“错位”难题:模型最好能适应各种噪声组合,这样泛化才强;但推理时偏偏只用那一种特殊的有序模式。学术圈为了化解这个矛盾,早就分成了两个门派。
第一个门派叫渐进式采样(Progressive Sampling),代表方法是Rolling Diffusion、AR-Diffusion等。它们训练时强制让噪声水平按帧单调递增,也就是严格满足公式2,追求“训练和推理完全一致”。好处是模型学到的就是推理时要用到的模式,坏处是训练时见过的噪声安排太单一,每帧的噪声水平被钉死在固定位置,对更广泛的噪声分布几乎没有覆盖。模型变成了“只会走一条路”的偏科生。
第二个门派叫独立采样(Independent Sampling),代表方法是Diffusion Forcing。它在训练时让每一帧的噪声水平独立地从同一个分布里随机抽取,也就是公式3所写的i.i.d.采样。这样训练分布覆盖极广,什么噪声组合模型都见过;但推理时那种强有序的噪声模式在训练数据里出现的概率极低,模型相当于复习了所有题型,偏偏考试只考其中一种。训练和推理之间形成了明显的分布缺口。
一边是“学了就能用但学得少”,另一边是“学得多但学用不符”,哪种都差点意思。Stream Forcing对此给出的解法不是二选一,而是让训练过程自己“滑”过去。
核心创新:将噪声采样重构为随机过程,统一两大训练范式
既然渐进式和独立式是互斥的两个极端,Stream Forcing的切入点就非常自然——把它们放到同一个数学框架里,用一条连续的轨迹连起来。这个框架的关键是重建“单帧噪声分布”的建模方式。
论文采用的是统计领域常用的Logit-normal分布。为什么要它?因为噪声水平k是(0,1)之间的值,直接用正态分布不太自然,而logit变换能把(0,1)映射到整个实数轴,变换后的值就可以用带位置参数μ和尺度参数σ的正态分布来描述了。其概率密度函数如公式4所示。
这里的μ叫位置参数,决定噪声水平的“重心”偏向高噪声还是低噪声;σ叫尺度参数,决定采样的散布程度,σ越大,噪声水平越不稳定。把每一帧的噪声分布叠在一起,就形成了一个“以帧为索引的随机过程”。Stream Forcing用三个参数来刻画这个随机过程中的任意一个状态:第t帧的μ_t、σ_t,以及一个描述帧与帧之间相关性的系数ρ。
妙的地方来了:两种旧范式在这个参数空间里,恰好落在两个端点。独立采样对应公式5——所有帧共享相同的μ和σ,相关性ρ=0,意思是各帧各抽各的,互不影响;理想化的渐进式采样则对应公式6——μ_t固定为logit(t/T),σ_t趋向0,ρ趋向1,意思是每帧的噪声水平被完全确定且严格按时间递增,帧间几乎没有随机性。也就是说,两大看似水火不容的方法,本质上只是同一个随机过程空间里的两个特例。这一下就把“二选一”变成了“两端点”,中间则留出了开阔的设计余地。
三大约束与两大算法:如何构建平滑的训练轨迹?
有了两个端点,下一步就是怎么从独立采样那头走到渐进式采样这头。如果训练中途暴力切换配置,模型会面临剧烈的分布震荡——之前学的噪声分布一下全变,前面等于白学了。为此,论文给这条轨迹设了三条约束,保证它走得平稳、走得公平、走得有序。
约束1:平滑轨迹过渡(TS,即C1)。 每帧的边际分布必须在训练过程中连续演化,不能出现跳变。论文的具体要求是,让每帧概率密度函数的峰值位置(也就是mode)沿轨迹匀速移动,避免相邻两步训练的分布形态差距过大。
约束2:逐帧覆盖一致性(DCC,即C2)。 同一个训练步内,不同帧的边际分布应该具有相近的离散程度,否则就会出现“有的帧反复在很窄的噪声区间里训练,有的帧被撒得很开但很稀疏”这种训练不均衡。论文的做法是对齐各帧分布峰值处的密度值。
约束3:帧间相关(IFC,即C3)。 帧与帧之间的相关系数ρ也要随着训练进度逐步上升,让采出来的噪声序列逐渐带上推理时那种时间依赖结构,而不是从头到尾都各自独立。
三条约束缺一不可。它们分别管住了“过渡是否平滑”“每一帧是否被公平对待”“帧间关系是否逐渐逼近推理模式”这三件事。为了落实这些约束,论文配套设计了两个算法。
第一个是联合校准算法(Joint Calibration),专门解决约束1和约束2。约束1的实现方式是:定义每个训练步s的目标mode,让它在初始配置和最终推理配置之间线性插值,如公式7所示。约束2则引入一个全局参考峰值密度H,要求所有帧的峰值密度尽量贴近同一个H,这个目标被写成一个可优化的目标函数,其数学形式如公式8。求解时还需要一个mode方程(公式9)来根据目标mode ζ和尺度参数 σ反推出位置参数 μ。
整个算法流程分两步:先用初始参数估计每帧的峰值密度,取中位数作为全局参考密度H;然后对每一帧做网格搜索,找出一组(μ_t,σ_t),使得该帧在目标mode处的峰值密度最接近H。这个计算不依赖训练步,可以离线一次性完成,几乎不增加训练负担。
第二个是时间相关采样算法(Temporal Correlated Sampling),对应约束3。它的巧妙之处在于用Gaussian Copula(一种把随机变量的相关结构和各自的边际分布解耦的统计工具)来构造带相关性的噪声序列。方法是先在标准正态空间里用一个一阶自回归过程生成一组带相关性的隐变量z_t,如公式10所示,ρ就是相关系数。之后用标准正态分布的累积分布函数把z_t转成均匀分位数,再通过各自边际分布的逆累积分布函数映射回logit空间(公式11),最后用sigmoid函数换回(0,1)之间的噪声水平(公式12)。
这样生成的噪声序列,每一帧的边际分布还是之前校准好的Logit-normal分布,但帧与帧之间已经带上了可控的相关性,而且额外的计算开销几乎可以忽略。
图3:Stream Forcing课程训练总览。训练轨迹从独立采样平滑过渡到推理对齐采样,兼顾分布覆盖与推理一致性。
把两个算法拼起来,就得到完整的Stream Forcing训练流程。这条轨迹被划分为三个阶段:第一阶段是独立训练(Independent Training),保持初始的独立采样配置,让模型在广阔的噪声空间里充分探索;第二阶段是课程过渡(Curriculum Transition),把轨迹离散成10个均匀分布的中间配置,逐个训练,带着模型稳稳地从“广撒网”滑向“精对齐”;第三阶段是推理对齐训练(Inference-Aligned Training),固定使用与推理完全一致的渐进式噪声配置,让模型做最后的精修。通俗地讲,这就好比“先让孩子广泛接触各种题型,再慢慢教他考试时按规范答题”。
实验验证:全面超越现有方法,零样本长视频外推表现惊艳
论文在UCF-101和Taichi-HD两个标准视频生成基准上做了整套评测,训练分辨率256×256,核心指标是FVD(Fréchet Video Distance,视频特征分布之间的距离,越低越好)。表1给出的是16帧无条件生成的结果。
表1:UCF-101和Taichi-HD上16帧无条件生成结果。带*的方法同时在训练集和测试集上训练,带†的方法采用AR-Diffusion的受控实验设置。Stream Forcing在UCF-101上取得177.0的FVD,相比此前最优方法FAR*的279.0改善了36.6%;在受控设置下,Stream Forcing的146.9也明显优于AR-Diffusion的181.9。Taichi-HD上则以73.4的FVD领先全部已有方法。
特别值得关注的是零样本长视频外推:模型训练时只见过16帧,推理时却要一口气生成128帧。表2显示,Stream Forcing在UCF-101上拿到322.5的FVD,对比扩散强制(Diffusion Forcing)的447.3下降了27.9%;Taichi-HD上拿到230.4,对比AR-Diffusion的376.3下降了10.9%以上。这组数据说明,课程训练带来的并不只是“画质更好”,而是模型在线滚动推理时的稳定性显著提升——这正是流式生成最关键的品质。
表2:128帧零样本长视频外推结果。Stream Forcing在两个基准上都显著优于已有的独立采样和渐进式采样方法。
定性结果也支撑了上面的数据结论。图4对比了三种方法的视觉生成效果:Diffusion Forcing生成的画面存在明显的抖动和不稳定,AR-Diffusion则趋于保守、动作幅度过小,而Stream Forcing在保持稳定运动的同时,细节质量也明显更高。
图4a:UCF-101数据集上16帧无条件生成可视化对比(左:Diffusion Forcing;中:AR-Diffusion;右:Stream Forcing)。
图4:UCF-101数据集上无条件生成的可视化对比。DF表示Diffusion Forcing,AR-D表示AR-Diffusion。Stream Forcing在16帧生成中兼顾运动幅度与画面质量,在128帧外推中也能保持动作连贯。
论文还对着设计做了细致的消融分析。表4分别关掉三个约束来看影响:任何一条约束被去掉,FVD都会明显变差,其中去掉逐帧覆盖一致性(C2)掉得最惨,说明“每一帧都被公平训练”是整套方法的基石。表5验证了课程训练各阶段不可或缺:只用独立训练、只用推理对齐训练,或者两者直接拼接,效果都不如带平滑过渡的完整版。表6显示ρ采用“从0线性涨到1”的调度策略效果最好;表7则表明独立训练与课程过渡的比例为2:1时综合表现最佳。
表4:轨迹约束消融。删除任意一个约束都会导致FVD显著上升。
表5:课程训练阶段消融。完整流程取得最佳效果,任何一个阶段缺失都会造成性能回退。
表6(左):帧间相关系数ρ的调度策略消融。表7(右):独立训练与课程过渡的比例消融。
从视频生成到世界模型:自动驾驶场景的迁移应用
流式视频生成最硬核的应用场景,就是当自动驾驶的世界模型。自动驾驶系统需要根据过去的画面,在线预测未来几秒会发生的动态,涉及大量不同车辆、行人和道路状况的连续变化。论文把Stream Forcing迁移到了这一场景:在nuPlan上训练、在nuScenes上测试,生成25帧、分辨率512×256的驾驶视频,并和DriveGAN、DriveDreamer、WoVoGen、Drive-WM、GenAD等专用驾驶视频生成方法进行对比。结果如表3所示。
表3:nuScenes测试集上的驾驶视频生成对比。Stream Forcing取得FID 9.4、FVD 105.0,领先所有对比方法。
Stream Forcing在FID和FVD两项指标上都明显领先,尤其是FVD从Drive-WM的122.7压到105.0,FID从GenAD的15.4大幅压到9.4。这个结果说明,论文提出的训练范式具备跨场景的可迁移性——它没有引入任何驾驶领域的先验知识,只靠一个更聪明的“训练节奏”,就在驾驶世界模型上拿到了全面增益。
总结与展望:流式视频生成的未来方向
Stream Forcing的核心贡献,是把“训练噪声采样”从一堆孤立的配置点,变成了一条连续的随机过程轨迹,用数学框架统一了独立采样和渐进式采样两个看似对立的范式。联合校准算法保证了轨迹的平滑性和逐帧公平性;时间相关采样算法则把帧间相关性平滑地注入训练。整套设计不修改模型结构、不增加推理开销,纯靠调整“训练时噪声怎么撒”,就换来了16帧生成质量的显著提升、128帧零样本外推的稳定性,以及自动驾驶世界模型上的跨场景迁移能力。
就未来方向而言,论文自己指出的一个重点,是把Stream Forcing与Self Forcing、Rolling Forcing这类基于知识蒸馏的闭环一致训练方法结合。Stream Forcing管的是“训练输入的分布”,蒸馏类方法管的是“模型自生成轨迹的闭环纠错”,两者的优化维度互补,组合起来还有进一步挖掘的空间。另外,本文目前主要在UCF-101、Taichi-HD这类中小规模数据集上验证,如果配合大规模视频预训练,轨迹的设计是否可以做得更精细、更自适应,也值得后续工作探索。
龙迷三问
这篇论文到底在解决什么问题? 流式视频生成面临训练与推理的“错位”难题。华中科大联合地平线提出Stream Forcing,将训练噪声采样重构为帧索引的随机过程,构建从独立采样到推理一致采样的连续课程轨迹,平衡训练覆盖度与推理一致性。
这篇工作最值得看的点是什么? 在UCF-101上16帧无条件生成FVD达177.0,相对最优基线提升36.6%;128帧零样本外推FVD达322.5,提升27.9%;Taichi-HD上16帧FVD达73.4,128帧FVD达230.4;nuScenes上FID 9.4、FVD 105.0,均优于现有方法。
这篇工作的边界或风险在哪里? 优点:1)提出统一的随机过程框架,将独立采样和渐进采样统一到同一参数化空间;2)设计联合校准和时间相关采样算法,确保训练轨迹平滑且保持帧间相关性;3)在多个数据集和任务上取得显著性能提升,包括零样本长视频外推和自动驾驶世界模型。缺点:1)训练过程包含三个阶段,需要精细调节各阶段步数比例;2)实验仅在中小规模数据集上进行,大规模训练效果未验证;3)与自强制、滚动强制等正交方法的结合尚未探索。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
将训练时逐帧噪声水平采样重构为以帧为索引的随机过程,通过联合校准和时间相关采样构建从独立采样到推理一致采样的连续训练轨迹,实现流式视频生成的统一训练框架。
实验合理度: ★★★★☆
FVD(Frechet Video Distance)、FID(Frechet Inception Distance)。
学术研究价值: ★★★★☆
将训练时逐帧噪声水平采样重构为以帧为索引的随机过程,通过联合校准和时间相关采样构建从独立采样到推理一致采样的连续训练轨迹,实现流式视频生成的统一训练框架;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
未明确给出具体FLOPs,训练在8块NVIDIA H20 GPU上进行。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1)训练过程包含三个阶段,需要精细调节各阶段步数比例;2)实验仅在中小规模数据集上进行,大规模训练效果未验证;
[1] Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation. arXiv:2608.10439, 2026.
[2] Chen B, Monso D M, Du Y, et al. Diffusion forcing: Next-token prediction meets full-sequence diffusion. NeurIPS, 2024.
[3] Bai J, Gao Z, Ma S, et al. AR-Diffusion: Autoregressive diffusion for video generation. 2025.
[4] Caesar H, Bankiti V, Lang A H, et al. nuScenes: A multimodal dataset for autonomous driving. CVPR, 2020.
融会贯通
结合PaperDaily已收录论文的辅助对比来看,Stream Forcing在nuScenes上取得的FVD 105.0,在当前检索到的驾驶世界模型论文集合中大约处于中后段位置——比如ConsisDrive在nuScenes上报告的FVD为37.23。需要说明的是,不同工作的评估口径差异很大:有的用短预测帧数、有的用不同的条件输入(如相机参数、高精地图)、有的用不同的数据划分,直接跨论文比较数值并不严谨。Stream Forcing的核心优势在于“不挑任务、不改结构、零额外成本”,是作为通用训练范式去提升已有模型表现,而不是在某个特定驾驶benchmark上死磕单一数字。
如果后续工作把Stream Forcing的课程设计接到更强的基座模型(如大规模视频预训练模型或更长的上下文窗口)上,并配合身份一致性、控制信号注入等正交技术,在自动驾驶世界模型这类任务上有望取得更进一步的提升。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!