
原论文信息如下:
👇 点击观看视频演示:12小时连续生成效果(Prompt: 翼装飞行穿越雪山峡谷)
视频生成的新极限:从几分钟到12小时
## 长视频生成,为什么这么难? 视频生成这个领域,这几年发展速度可以说是坐了火箭。从Sora到CogVideoX、Wan、Hunyuan-DiT、Veo,一个比一个猛,生成的视频画质越来越逼真,动作越来越流畅。但是,这些模型都有一个共同的软肋:它们大多采用双向建模的方式,生成一小段视频就需要消耗巨大的计算资源,想生成几分钟的长视频,算力成本直接爆炸。 那怎么办?学术界和工业界不约而同地把目光转向了自回归生成——像大语言模型一样,一帧一帧地往后预测。你生成第100帧的时候,只需要看前面99帧就够了,配合KV缓存机制,速度可以做到非常快,而且理论上可以无限续杯。 但自回归生成有个通病:误差累积。时间一长,模型容易"忘记"之前的内容,视频质量断崖式下跌。于是,StreamingLLM里的一个经典思路被借用过来,加注意力汇(attention sink)——把最初的几帧一直保留在KV缓存里,作为"定海神针"来稳定后续生成。这个方法确实有效,但随之而来的是一个新的诡异问题。
## 注意力汇坍缩:视频生成的隐藏Bug 龙哥先放个图让大家感受一下这个Bug有多离谱。下面这张图展示了12小时连续生成的视频截图,画面确实很震撼,但你们知道为了做到这个效果,作者们排掉了多少个"雷"吗?  图1 流式生成的超长视频(12小时),提示词为"一个电影感的第三人称镜头,翼装飞行者穿越狭窄的山谷…" 注意力汇坍缩的现象,简单来说就是:生成的视频播着播着,画面突然跳回开头几帧的样子,仿佛模型在说"我想起来了,咱们重新开始吧",然后继续演,过一会儿又跳回去,无限循环。看过的朋友应该能想象那种崩溃感——就像看一部电影,每隔几分钟就给你倒带回放一次。 LongLive和Self-Forcing++是目前超长视频生成领域的两个SOTA方法,一个基于LongLive、一个基于Self-Forcing++,训练范式各不相同。但LoL的作者发现,这俩方法在支持注意力汇的情况下,居然都在完全相同的帧索引位置翻车了——132帧和201帧,精确到帧,同生共死,非常默契。
## 循环的秘密:不是单维度问题 为什么会出现这种现象?LoL的团队做了一系列分析,最终把锅甩给了RoPE位置编码的周期性。RoPE,即旋转位置编码,是现在Transformer架构中最常用的位置编码方案之一。它通过旋转操作将位置信息编码到查询和键向量中,使得注意力分数依赖于相对位置。这个机制在短序列中表现完美,但问题在于,旋转函数是周期性的。 当视频生成到一定长度后,某些远端帧的位置编码相位会因为周期性而重新对齐,看起来就像"回到了原点"。模型一看,哎,这个位置编码跟开头几帧很像啊,那我把内容也复制过来吧——于是画面就跳回了开头。 但LoL的团队更进一步发现,这件事的根源并不是某一个单一维度的问题。RIFLEx这个方法在双向模型上通过调整单个频率分量成功缓解了重复问题,但在自回归模型上完全不灵。LoL的团队试了调整RIFLEx指定的维度、调整相邻维度,全部无效。他们把这部分实验放在了论文的附录里,有图有真相。  (a) 修改RIFLEx识别出的维度及其相邻维度的频率后的归一化L2距离。单一维度的修改根本无法缓解sink-collapse现象。  (b) 不同RoPE基值θ下的归一化L2距离。改变θ只会移动坍缩位置,并不能解决根本问题。
## 多头注意力齐刷刷"叛变" 既然不是单一维度的问题,那问题出在哪?LoL的团队把目光投向了多头注意力机制。Transformer架构中,多个注意力头各自关注不同的子空间,理论上应该各司其职、百花齐放。但在sink-collapse发生的时候,有意思的事情出现了。 注意力热力图显示,在正常帧中,模型会把较大的注意力权重分配给当前正在生成的帧,其余帧均匀分配。但在发生坍缩的帧中,几乎所有注意力头都齐刷刷地把大权重同时分配给sink帧和当前生成帧。这就是所谓的"多头注意力同质化"——所有头都开始复制sink帧的内容,多样性完全丧失,画面自然就跳回了开头。  图3 多头注意力同质化的可视化。前三个潜变量帧作为注意力汇,最后三个为正在生成的帧。顶行是正常帧,底两行是发生sink-collapse的帧,可以看到多个注意力头同时给sink帧分配了显著的高权重。
## LoL的核心修复方案:多头RoPE抖动 找到了病根,接下来就是开药方了。既然问题出在所有注意力头同时"集体叛变"——所有头的RoPE频率对齐到几乎相同的相位——那解法就简单粗暴了:给每个注意力头的RoPE基频率加一点随机的抖动,让它们不再整齐划一。 具体做法是这样的:原本所有头共用同一个RoPE基值θ(默认10000),LoL算法为每个注意力头独立采样一个扰动系数,扰动后的基频率变为θ乘以(1+σ乘以均匀分布随机数),其中σ是抖动强度。这样一来,每个头的旋转频率都有一点点不同,它们的相位对齐就被打破了,多个头同时被sink帧"吸引"的概率大大降低。 这个方法有一个非常吸引人的特性:完全无需训练。它只是在推理阶段对RoPE频率做一个小小的随机扰动,就可以直接应用到已经训练好的模型上,即插即用。  (a) 不同RoPE抖动强度σ下的归一化L2距离。经验上,σ=0.8能在生成质量和防坍缩之间取得良好平衡。  (b) 不同抖动注意力头数量下的归一化L2距离,三种随机种子取平均。增加抖动头数能逐步缓解sink-collapse现象。
## 实验效果:四个维度全面对比 光说不练假把式。LoL团队在LongLive和Self-Forcing++两个模型上做了一系列实验,对比了PE(直接外推)、PI(位置插值)、NTK、YARN、RIFLEx和LoL六种方法。评价指标包括Sink-Collapse Max(所有提示词中最大距离下降,越低越好)、Sink-Collapse Avg(所有提示词平均距离下降,越低越好)和Dynamic Degree(动态程度,越高越好)等。 从结果来看,PE方法在LongLive上Sink-Collapse Max高达73.06,说明坍缩非常严重。PI方法虽然能把坍缩压到4.97,但动态程度直接掉到0.35,视频几乎静止,属于"治标不治本"的典型。NTK和YARN各有取舍——NTK保留了28.72的动态程度但坍缩仍有41.11;YARN把坍缩压到11.17但动态程度只剩2.67。RIFLEx虽然是双向模型专家,但在自回归场景下几乎无效——70.95的坍缩分数跟PE差不多。 而LoL的表现就很亮眼了:坍缩分数16.67(Max)和3.93(Avg),同时动态程度维持在了35.27的高位,几乎和PE(34.62)持平。这意味着LoL在有效抑制坍缩的同时,几乎没有牺牲视频的动态和丰富程度。在Self-Forcing++模型上也有类似的效果提升。  表1 在LongLive和Self-Forcing++上应用不同方法(视频时长100秒)的结果对比。红色表示严重重复,绿色表示动态程度显著降低。↓表示越低越好,↑表示越高越好。
## 与主流自回归模型同场竞技 除了与位置编码扩展方法对比,LoL还跟当前主流的自回归视频生成模型做了横向对比,包括NOVA、MAGI-1、SkyReels-V2、CausVid、Self Forcing以及LongLive和Self-Forcing++。 从75秒和100秒两个时间档位来看,LoL核心优势体现在Temporal Quality和Dynamic Degree两个指标上。以100秒视频为例,LongLive原本的Dynamic Degree为34.62,加上LoL方法后达到35.27;Self-Forcing++原本为54.12,加上LoL后飙升至81.20。Temporal Quality方面,Self-Forcing++从90.87提升到92.91。这表明LoL在修复坍缩的同时,还能顺便提升视频的动态表现和时间一致性。
## 无限流式生成:12小时是如何炼成的 最后是重头戏——无限流式生成。LoL团队指出,除了sink-collapse之外,超长视频生成还受限于两个条件:RoPE的位置编码长度上限和VAE解码的内存消耗。此前LongLive和Self-Forcing++的最大生成长度为4分15秒,主要受限于1024帧的latent序列和VAE内存占用。 LoL的解决思路很聪明。首先,Wan2.1本身采用了3D因果VAE,保证了时间维度的因果性,因此可以在推理时使用滑动窗口解码,大幅减小内存和计算量。其次,模型本身使用的局部注意力机制只关注最近的N帧,配合RoPE的相对位置编码特性,理论上已经具备了无限生成的条件。 于是,LoL团队实际演示了:在单个H100 GPU上,以约16-20 FPS的速度,连续流式生成12小时视频,画面始终稳定。他们还额外展示了一个小时的视频里做了多次提示词切换的场景——视频内容随着提示词变化而平滑过渡,说明这个方法在交互式创作场景中同样适用。  图13 1小时流式生成视频可视化,包含多次提示词切换。提示词依次为"镜头飘过五彩斑斓的树木山谷"、"祖母绿、琥珀和玫瑰色的树叶如彩纸般在空中旋转"、"向前穿过黄色草甸的山谷"等。
## 龙哥点评 说几句掏心窝子的话。龙哥做了这么多年的AI内容解读,看过太多"论文很美好、落地很骨感"的工作。但LoL这篇论文,属于那种"想法很简单,效果很惊艳"的类型。它没有提出什么全新的模型架构,没有上什么复杂的训练技巧,甚至连调参都只需一个σ值——但解决了一个让所有长视频生成研究者头疼不已的核心问题。 这个工作的含金量在于分析和诊断。LoL团队把sink-collapse从现象到原因拆解得明明白白:先观察到不同模型在同一帧索引坍缩的诡异规律,再通过相位分析定位到RoPE的周期性与多头注意力机制的内在冲突,最后用零成本的多头RoPE抖动一把梭哈解决问题。整个链路逻辑闭环,实验设计严谨,让人挑不出毛病。 当然,这个方案也有自己的天花板。首先,它只是缓解了sink-collapse,并没有完全消除——从实验结果来看,LoL的Sink-Collapse指标只是降到了和PI相当的水平,并不是0。其次,LoL依赖于底层模型的质量,在1.3B的Wan2.1-T2V模型上生成12小时视频,虽然结构稳定,但视觉多样性会有所下降。另外,模型的长期记忆能力确实缺失——如果某个物体离开画面很久再回来,模型可能已经不认识它了。 但瑕不掩瑜。LoL证明了一个重要结论:在不重新训练的情况下,基于局部注意力和RoPE的视频生成模型,理论上可以生成任意长度的视频。这个结论对于工业界的产品落地意义重大——想象一下,用实时视频生成来做直播、做交互式叙事、做虚拟世界探索,这些场景以前只能停留在PPT里,现在至少有了跑通的可能性。 最后,对这篇论文的评价打分如下: 创新性:★★★★☆(8.5/10)——首次系统性地分析并解决了自回归视频生成中的sink-collapse问题,根因分析扎实,方法论清晰 实用性:★★★★★(9.5/10)——完全训练免费,即插即用,效果显著,适用于当前主流的长视频生成框架 实验完整性:★★★★☆(8.5/10)——多组对比实验、消融实验、鲁棒性分析齐全,论证充分 可复现性:★★★★★(9.5/10)——方法简单,核心算法只有几行,无需额外训练 总结:LoL是一篇值得全文精读的高质量工作,尤其是其"现象-分析-定位-修复"的研究思路,对做视频生成、扩散模型、甚至大语言模型长序列推理的从业者都有启发。推荐指数:强烈推荐。 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
汇聚崩溃:长视频生成的隐形杀手
多头RoPE抖动:一个简单而优雅的解决方案
实验验证:质量与稳定性的双赢
未来展望:无限视频生成的挑战与机遇
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出一种无需训练的轻量级方法,通过多头RoPE抖动(Multi-Head RoPE Jitter)打破注意力头间的同质化,抑制自回归视频生成中的“汇聚崩溃”(sink-collapse)现象,实现无限长流式视频生成。实验合理度:★★★★☆
Sink-Collapse Max(最大距离下降)、Sink-Collapse Avg(平均距离下降)、Dynamic Degree(动态程度)、VBench指标(包括时间质量、文本对齐、CLIP分数、主体一致性、背景一致性、运动平滑度、成。学术研究价值:★★★★☆
提出一种无需训练的轻量级方法,通过多头RoPE抖动(Multi-Head RoPE Jitter)打破注意力头间的同质化,抑制自回归视频生成中的“汇聚崩溃”(sink-collapse)现象,实现无限。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
在单个NVIDIA H100 GPU上以约16 FPS的实时速度进行流式生成,模型大小为1.3B参数。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:受限于基础模型能力、缺乏长期记忆机制、对超长视频的视觉多样性有限、抖动强度需要手动调节。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!