← 返回 PaperDaily 视觉与图像

UCLA+字节跳动:LoL让视频生成连续跑12小时不掉链子!

还在为AI视频生成几秒就崩、动作循环重复而头疼?UCLA携手字节跳动Seed团队祭出LoL大招,让视频生成一口气跑12小时不带喘的,关键还不用重新训练模型!

UCLA+字节跳动:LoL让视频生成连续跑12小时不掉链子!

paperdaily_reaction_gif


原论文信息如下:
论文标题:
LoL: Longer than Longer, Scaling Video Generation to Hour
发表日期:
2026年01月
发表单位:
UCLA, ByteDance Seed, University of Central Florida
原文链接:
https://arxiv.org/pdf/2601.16914.pdf

👇 点击观看视频演示:12小时连续生成效果(Prompt: 翼装飞行穿越雪山峡谷)

视频生成的新极限:从几分钟到12小时

12小时视频生成演示
龙哥刷到这篇论文的时候,第一反应是看了一眼标题,第二反应是看了一眼单位——UCLA加字节跳动Seed,好家伙,又是强强联手,又是来搞大事的。但说实话,视频生成这个赛道,龙哥见过的"号称无限时长"的工作没有十个也有八个了,大多数都是开头惊艳三秒,然后迅速进入鬼畜循环模式,让人直呼"就这?" 不过这次,LoL这篇论文有点东西。它干了一件特别朴素但特别戳痛点的事:找到并解决了当前长视频生成方法集体翻车的一个隐藏Bug——sink-collapse(注意力汇坍缩)。这是什么概念呢?就是你让AI生成一段十分钟的视频,它可能在第三十秒的时候忽然"失忆",画面一下子跳回开头几帧的样子,然后再重新开始,形成一种诡异的循环播放效果。这个Bug在现有的主流方法中普遍存在,不管是LongLive还是Self-Forcing++,全都逃不过。 更狠的是,LoL不仅把这个Bug给修了,还顺手把视频生成时长从几分钟拉到了12小时,而且是实时的、流式的、几乎不损失画质的那种。12小时什么概念?相当于一部超长连续剧的量。用他们自己的话说,这是公开演示结果中最长的流式视频生成。龙哥看完只想说一句:服气。
## 长视频生成,为什么这么难? 视频生成这个领域,这几年发展速度可以说是坐了火箭。从Sora到CogVideoX、Wan、Hunyuan-DiT、Veo,一个比一个猛,生成的视频画质越来越逼真,动作越来越流畅。但是,这些模型都有一个共同的软肋:它们大多采用双向建模的方式,生成一小段视频就需要消耗巨大的计算资源,想生成几分钟的长视频,算力成本直接爆炸。 那怎么办?学术界和工业界不约而同地把目光转向了自回归生成——像大语言模型一样,一帧一帧地往后预测。你生成第100帧的时候,只需要看前面99帧就够了,配合KV缓存机制,速度可以做到非常快,而且理论上可以无限续杯。 但自回归生成有个通病:误差累积。时间一长,模型容易"忘记"之前的内容,视频质量断崖式下跌。于是,StreamingLLM里的一个经典思路被借用过来,加注意力汇(attention sink)——把最初的几帧一直保留在KV缓存里,作为"定海神针"来稳定后续生成。这个方法确实有效,但随之而来的是一个新的诡异问题。
## 注意力汇坍缩:视频生成的隐藏Bug 龙哥先放个图让大家感受一下这个Bug有多离谱。下面这张图展示了12小时连续生成的视频截图,画面确实很震撼,但你们知道为了做到这个效果,作者们排掉了多少个"雷"吗? ![Figure 1](images/bd7df5ed520879d7b1c63e475c9e1c498fbec50e5cf18ad6190e579d71051aa0.jpg) 图1 流式生成的超长视频(12小时),提示词为"一个电影感的第三人称镜头,翼装飞行者穿越狭窄的山谷…" 注意力汇坍缩的现象,简单来说就是:生成的视频播着播着,画面突然跳回开头几帧的样子,仿佛模型在说"我想起来了,咱们重新开始吧",然后继续演,过一会儿又跳回去,无限循环。看过的朋友应该能想象那种崩溃感——就像看一部电影,每隔几分钟就给你倒带回放一次。 LongLive和Self-Forcing++是目前超长视频生成领域的两个SOTA方法,一个基于LongLive、一个基于Self-Forcing++,训练范式各不相同。但LoL的作者发现,这俩方法在支持注意力汇的情况下,居然都在完全相同的帧索引位置翻车了——132帧和201帧,精确到帧,同生共死,非常默契。
## 循环的秘密:不是单维度问题 为什么会出现这种现象?LoL的团队做了一系列分析,最终把锅甩给了RoPE位置编码的周期性。RoPE,即旋转位置编码,是现在Transformer架构中最常用的位置编码方案之一。它通过旋转操作将位置信息编码到查询和键向量中,使得注意力分数依赖于相对位置。这个机制在短序列中表现完美,但问题在于,旋转函数是周期性的。 当视频生成到一定长度后,某些远端帧的位置编码相位会因为周期性而重新对齐,看起来就像"回到了原点"。模型一看,哎,这个位置编码跟开头几帧很像啊,那我把内容也复制过来吧——于是画面就跳回了开头。 但LoL的团队更进一步发现,这件事的根源并不是某一个单一维度的问题。RIFLEx这个方法在双向模型上通过调整单个频率分量成功缓解了重复问题,但在自回归模型上完全不灵。LoL的团队试了调整RIFLEx指定的维度、调整相邻维度,全部无效。他们把这部分实验放在了论文的附录里,有图有真相。 ![Figure 5](images/ff60b99d3edb2a2cb354d6c5ce5517f67039768c0e1b2f6560c1d6c0e7d391af.jpg) (a) 修改RIFLEx识别出的维度及其相邻维度的频率后的归一化L2距离。单一维度的修改根本无法缓解sink-collapse现象。 ![Figure 5b](images/73560f4e2683b5c159184f2666d66c5434b669283563b7898bb2df8e5043cdaf.jpg) (b) 不同RoPE基值θ下的归一化L2距离。改变θ只会移动坍缩位置,并不能解决根本问题。
## 多头注意力齐刷刷"叛变" 既然不是单一维度的问题,那问题出在哪?LoL的团队把目光投向了多头注意力机制。Transformer架构中,多个注意力头各自关注不同的子空间,理论上应该各司其职、百花齐放。但在sink-collapse发生的时候,有意思的事情出现了。 注意力热力图显示,在正常帧中,模型会把较大的注意力权重分配给当前正在生成的帧,其余帧均匀分配。但在发生坍缩的帧中,几乎所有注意力头都齐刷刷地把大权重同时分配给sink帧和当前生成帧。这就是所谓的"多头注意力同质化"——所有头都开始复制sink帧的内容,多样性完全丧失,画面自然就跳回了开头。 ![Figure 3](images/6a62ff7dac4fb6aeb3262f1c60a59e4482d73358f244a9c8c042a6b10bbdedb4.jpg) 图3 多头注意力同质化的可视化。前三个潜变量帧作为注意力汇,最后三个为正在生成的帧。顶行是正常帧,底两行是发生sink-collapse的帧,可以看到多个注意力头同时给sink帧分配了显著的高权重。
## LoL的核心修复方案:多头RoPE抖动 找到了病根,接下来就是开药方了。既然问题出在所有注意力头同时"集体叛变"——所有头的RoPE频率对齐到几乎相同的相位——那解法就简单粗暴了:给每个注意力头的RoPE基频率加一点随机的抖动,让它们不再整齐划一。 具体做法是这样的:原本所有头共用同一个RoPE基值θ(默认10000),LoL算法为每个注意力头独立采样一个扰动系数,扰动后的基频率变为θ乘以(1+σ乘以均匀分布随机数),其中σ是抖动强度。这样一来,每个头的旋转频率都有一点点不同,它们的相位对齐就被打破了,多个头同时被sink帧"吸引"的概率大大降低。 这个方法有一个非常吸引人的特性:完全无需训练。它只是在推理阶段对RoPE频率做一个小小的随机扰动,就可以直接应用到已经训练好的模型上,即插即用。 ![Figure 6a](images/c4fc9eab89420cf8069fc12956bbbfc5ec014f4d5639a1833b7f23e834a7c504.jpg) (a) 不同RoPE抖动强度σ下的归一化L2距离。经验上,σ=0.8能在生成质量和防坍缩之间取得良好平衡。 ![Figure 6b](images/c78edeeafe94aadb81c7f2b791677bd51cfe67988623968c700f06d52848a967.jpg) (b) 不同抖动注意力头数量下的归一化L2距离,三种随机种子取平均。增加抖动头数能逐步缓解sink-collapse现象。
## 实验效果:四个维度全面对比 光说不练假把式。LoL团队在LongLive和Self-Forcing++两个模型上做了一系列实验,对比了PE(直接外推)、PI(位置插值)、NTK、YARN、RIFLEx和LoL六种方法。评价指标包括Sink-Collapse Max(所有提示词中最大距离下降,越低越好)、Sink-Collapse Avg(所有提示词平均距离下降,越低越好)和Dynamic Degree(动态程度,越高越好)等。 从结果来看,PE方法在LongLive上Sink-Collapse Max高达73.06,说明坍缩非常严重。PI方法虽然能把坍缩压到4.97,但动态程度直接掉到0.35,视频几乎静止,属于"治标不治本"的典型。NTK和YARN各有取舍——NTK保留了28.72的动态程度但坍缩仍有41.11;YARN把坍缩压到11.17但动态程度只剩2.67。RIFLEx虽然是双向模型专家,但在自回归场景下几乎无效——70.95的坍缩分数跟PE差不多。 而LoL的表现就很亮眼了:坍缩分数16.67(Max)和3.93(Avg),同时动态程度维持在了35.27的高位,几乎和PE(34.62)持平。这意味着LoL在有效抑制坍缩的同时,几乎没有牺牲视频的动态和丰富程度。在Self-Forcing++模型上也有类似的效果提升。 ![Table 1](images/6a62ff7dac4fb6aeb3262f1c60a59e4482d73358f244a9c8c042a6b10bbdedb4.jpg) 表1 在LongLive和Self-Forcing++上应用不同方法(视频时长100秒)的结果对比。红色表示严重重复,绿色表示动态程度显著降低。↓表示越低越好,↑表示越高越好。
## 与主流自回归模型同场竞技 除了与位置编码扩展方法对比,LoL还跟当前主流的自回归视频生成模型做了横向对比,包括NOVA、MAGI-1、SkyReels-V2、CausVid、Self Forcing以及LongLive和Self-Forcing++。 从75秒和100秒两个时间档位来看,LoL核心优势体现在Temporal Quality和Dynamic Degree两个指标上。以100秒视频为例,LongLive原本的Dynamic Degree为34.62,加上LoL方法后达到35.27;Self-Forcing++原本为54.12,加上LoL后飙升至81.20。Temporal Quality方面,Self-Forcing++从90.87提升到92.91。这表明LoL在修复坍缩的同时,还能顺便提升视频的动态表现和时间一致性。
## 无限流式生成:12小时是如何炼成的 最后是重头戏——无限流式生成。LoL团队指出,除了sink-collapse之外,超长视频生成还受限于两个条件:RoPE的位置编码长度上限和VAE解码的内存消耗。此前LongLive和Self-Forcing++的最大生成长度为4分15秒,主要受限于1024帧的latent序列和VAE内存占用。 LoL的解决思路很聪明。首先,Wan2.1本身采用了3D因果VAE,保证了时间维度的因果性,因此可以在推理时使用滑动窗口解码,大幅减小内存和计算量。其次,模型本身使用的局部注意力机制只关注最近的N帧,配合RoPE的相对位置编码特性,理论上已经具备了无限生成的条件。 于是,LoL团队实际演示了:在单个H100 GPU上,以约16-20 FPS的速度,连续流式生成12小时视频,画面始终稳定。他们还额外展示了一个小时的视频里做了多次提示词切换的场景——视频内容随着提示词变化而平滑过渡,说明这个方法在交互式创作场景中同样适用。 ![Figure 13](images/b61d81aaa51ce935d537de8349f771ca32876e5113aab384883182e64970cd8b.jpg) 图13 1小时流式生成视频可视化,包含多次提示词切换。提示词依次为"镜头飘过五彩斑斓的树木山谷"、"祖母绿、琥珀和玫瑰色的树叶如彩纸般在空中旋转"、"向前穿过黄色草甸的山谷"等。
## 龙哥点评 说几句掏心窝子的话。龙哥做了这么多年的AI内容解读,看过太多"论文很美好、落地很骨感"的工作。但LoL这篇论文,属于那种"想法很简单,效果很惊艳"的类型。它没有提出什么全新的模型架构,没有上什么复杂的训练技巧,甚至连调参都只需一个σ值——但解决了一个让所有长视频生成研究者头疼不已的核心问题。 这个工作的含金量在于分析和诊断。LoL团队把sink-collapse从现象到原因拆解得明明白白:先观察到不同模型在同一帧索引坍缩的诡异规律,再通过相位分析定位到RoPE的周期性与多头注意力机制的内在冲突,最后用零成本的多头RoPE抖动一把梭哈解决问题。整个链路逻辑闭环,实验设计严谨,让人挑不出毛病。 当然,这个方案也有自己的天花板。首先,它只是缓解了sink-collapse,并没有完全消除——从实验结果来看,LoL的Sink-Collapse指标只是降到了和PI相当的水平,并不是0。其次,LoL依赖于底层模型的质量,在1.3B的Wan2.1-T2V模型上生成12小时视频,虽然结构稳定,但视觉多样性会有所下降。另外,模型的长期记忆能力确实缺失——如果某个物体离开画面很久再回来,模型可能已经不认识它了。 但瑕不掩瑜。LoL证明了一个重要结论:在不重新训练的情况下,基于局部注意力和RoPE的视频生成模型,理论上可以生成任意长度的视频。这个结论对于工业界的产品落地意义重大——想象一下,用实时视频生成来做直播、做交互式叙事、做虚拟世界探索,这些场景以前只能停留在PPT里,现在至少有了跑通的可能性。 最后,对这篇论文的评价打分如下: 创新性:★★★★☆(8.5/10)——首次系统性地分析并解决了自回归视频生成中的sink-collapse问题,根因分析扎实,方法论清晰 实用性:★★★★★(9.5/10)——完全训练免费,即插即用,效果显著,适用于当前主流的长视频生成框架 实验完整性:★★★★☆(8.5/10)——多组对比实验、消融实验、鲁棒性分析齐全,论证充分 可复现性:★★★★★(9.5/10)——方法简单,核心算法只有几行,无需额外训练 总结:LoL是一篇值得全文精读的高质量工作,尤其是其"现象-分析-定位-修复"的研究思路,对做视频生成、扩散模型、甚至大语言模型长序列推理的从业者都有启发。推荐指数:强烈推荐。 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
超长视频生成这个赛道,最近卷得有点离谱。LongLive和Self-Forcing++这两个当前最强的方法,通过不对称蒸馏把双向教师模型变成自回归学生模型,再加滑动窗口的分布匹配蒸馏训练,已经把生成时长从几秒推到了几分钟,甚至几乎用光了基础模型位置编码能力的99%。但是,几分钟真的够用吗?
LoL直接把"几分钟"这个概念撕碎,拉到了"无限"。团队用1.3B参数的小模型,在单张NVIDIA H100上以每秒约16-20帧的速度,连续流式生成了12小时的视频,画面全程稳定。12小时什么概念?相当于一部完整的超长电影,或者一季美剧的量。在此之前,公开演示的流式视频生成最长的也就几分钟,LoL把这个数字直接提了两个数量级。
图11 12小时连续生成的水母视频可视化
图11 12小时流式生成视频可视化,提示词为"巨大的发光水母群在令人窒息的水下世界中飘荡……"
很多人可能觉得,视频生成时长拉长不就是让它多跑一会儿吗?事情远没有那么简单。自回归视频生成要无限续杯,需要跨过三座大山:第一,位置编码的长度上限——RoPE虽然支持相对位置编码,但超出训练长度后外推能力有限;第二,VAE解码的内存消耗——长视频帧序列的解码会吃光显存;第三,生成稳定性的累积崩溃——生成时间越长,画面越容易突然跳回开头,形成恐怖的鬼畜循环。前两个问题学术界已有应对思路,第三个问题才是真正的隐形杀手。
图12 12小时连续生成的雪山视频可视化
图12 12小时流式生成视频可视化,提示词为"电影感FPV航拍镜头,金色时刻飞越雪山,沿着刀刃般的山脊掠过,俯冲进入冰川峡谷……"
LoL团队的聪明之处在于,他们没有重新设计模型,而是先仔细审视了Wan2.1这个基础模型本身的架构。他们发现Wan2.1自带了一个3D因果VAE,保证了时间维度上的严格因果性,推理时完全可以使用滑动窗口解码,把内存和计算量打下来;而模型本身使用的局部注意力机制,每次只关注最近的N个潜变量帧,计算复杂度与序列总长度无关。这两个特性意味着,只要解决了生成过程中的稳定性崩溃,无限生成在架构层面本来就是可行的。LoL的贡献,就是把这个"只要"变成了现实。

汇聚崩溃:长视频生成的隐形杀手

在动手修复之前,LoL团队先做了一件让人有点意外的事:把LongLive和Self-Forcing++这两个SOTA方法翻来覆去地检查了一遍。他们发现了一个诡异到令人头皮发麻的现象——这两个训练范式完全不同的方法,在生成到完全相同的潜变量帧索引132和201时,画面会突然坍缩回开头的注意力汇帧。不是大概位置,不是差不多,而是精确到帧的完全一致。
先解释两个概念。注意力汇,英文叫attention sink,最早来自StreamingLLM这篇论文,指在KV缓存中始终保留最初的几个token,用来稳定后续的自回归生成。在超长视频生成里,LongLive和Self-Forcing++也延续了这个做法,把初始几帧的KV对一直留在缓存里当作"定海神针"。而汇聚崩溃(sink-collapse)就是LoL团队给这种"定海神针变毒药"的现象起的名字:视频生成着生成着,突然画面一跳,回到了开头的几帧,然后继续演,过一会儿又跳回去,周而复始,如同中了邪。
为什么会出现这种坍缩?LoL团队在一番抽丝剥茧之后,把矛头指向了RoPE——旋转位置编码。RoPE是当下Transformer架构中最主流的位置编码方案,它通过给每个位置的token分配一个旋转角度,把位置信息编码到查询和键向量里。旋转矩阵的形式如下:
RoPE旋转矩阵公式
其中d是隐藏维度,θ是基础频率(通常取10000),i是通道维度索引。查询向量和键向量按照各自的位置索引分别旋转,然后计算注意力分数:
查询向量和键向量旋转公式
旋转后的点积等于原始向量乘以相对位置差(n-m)的旋转矩阵:
旋转点积等价形式
这套机制在短序列里表现堪称完美,模型可以通过相对角度差感知token之间的距离。但问题恰恰出在"旋转"二字上——旋转函数是周期性的。当生成序列持续拉长,某些远端帧的旋转相位会因为周期回卷而与开头帧"相位对齐"。在模型看来,这个遥远的位置跟开头几帧的编码几乎一样,于是干脆把内容也"复制"了过来,汇聚崩溃就这样发生了。
但LoL团队的洞察不止于此。他们进一步发现,这个坍塌不是由单一维度引起的。RIFLEx那套在双向模型上有效的"找最接近重复频率的维度并调整之"的思路,在自回归场景下完全不灵。他们试着调整RIFLEx识别出的维度、调整相邻维度,全部无效。为了定量刻画这种相位对齐效应,论文定义了一个相位一致性核(phase coherence kernel):
相位一致性核公式
其中K=d/2,ω_i是各RoPE频率分量,Δ是相对位移。C(Δ)反映了所有频率分量的相位对齐程度,数值越大意味着整体相位越集中。将C(Δ)相对于注意力汇帧计算,就得到sink-relative phase concentration。下图清晰地展示了坍缩点与相位集中度局部最大值的对应关系:
图2 相位集中度与汇聚崩溃的关系
图2 帧内相位集中度分析:展示相对于注意力汇帧的归一化L2距离与RoPE嵌入平均相位的关系。sink-collapse几乎精确出现在相位集中度的局部极大值处。
如果单维度的频率调整没用,单纯的基值调整是否有用?论文也做了实验验证。他们从6000到20000大范围改变RoPE的基值θ,结果发现改变θ只是改变了相位进动的速率,把坍缩点的位置向前或向后移动了一些,根本无法消除坍缩。这进一步说明,sink-collapse是多个RoPE频率维度"同谋"的结果,不是某一个旋钮失灵。
图7 θ=20000时的相位对齐与L2距离
图7 θ=20000时相对于sink帧的L2距离与相位对齐对比。即使在θ=20000下,sink-collapse的位置依然与相位集中的局部极大值高度相关。
既然不是单个维度的问题,那问题到底出在哪?LoL团队把目光投向了多头注意力机制。现代Transformer依赖多个注意力头来捕捉不同子空间的特征,理论上应该各司其职。但当他们把坍缩帧的注意力热力图摊开看时,发现了触目惊心的一幕:在正常帧中,注意力头会把大权重分配给当前正在生成的token,对sink帧的注意力权重则相对分散;而在坍缩帧中,同一层里几乎所有注意力头都齐刷刷地给sink帧分配了显著的大权重。多头注意力同质化了——所有头都在复制sink帧的内容,子空间的多样性彻底消失。
图3 多头注意力同质化的可视化
图3 多头注意力同质化可视化。前三个潜变量帧作为attention sinks,后三帧为正在生成的帧。第一行是正常帧,下面两行是两种不同的sink-collapse帧,可以看到多个注意力头同时给sink帧分配了远超正常水平的注意力权重。
这种"集体复制"行为并非个别层或个别头的偶然现象。LoL团队画出了更多层、更多头的注意力热力图,发现复制sink帧的倾向在模型各层各头中普遍存在,是系统性的问题。
图10 更多层和更多注意力头的注意力热力图
图10 不同层、不同注意力头的注意力热力图补充可视化。可以看到复制sink帧的行为是模型各层各头中普遍存在的现象。
LoL团队还专门做了sink区域大小的消融实验。把sink帧数量从默认的3个加到5个,坍缩依然会发生;减少到只剩1个,坍缩同样存在。这说明sink-collapse跟注意力汇区域的大小没有直接关系,处理不了多个注意力头"集体叛变"的问题。这个发现很关键——它意味着简单调sink区域的数量是治标不治本的。
图8 配置5个注意力汇帧时的坍缩行为
图8 配置五个注意力汇帧时模型的行为。即使分配了更大的sink区域,生成仍然陷入重复模式,说明增加sink帧预算并不能缓解坍缩。
图9 仅使用一个注意力汇帧时的坍缩现象
图9 仅使用一个注意力汇帧时的sink-collapse可视化。把sink帧数减到最少也无法消除重复伪影,模型仍然表现出坍缩迹象。

多头RoPE抖动:一个简单而优雅的解决方案

病根找到了,药方就变得非常朴素。既然坍缩的根源是多个注意力头在RoPE的周期性作用下同时与sink帧发生相位对齐,那解法就是破坏这种全局同步——给每个注意力头的RoPE基础频率加一点独立的随机抖动,让每个头的旋转速度有一点点不同。论文把这个操作称为多头RoPE抖动(Multi-Head RoPE Jitter)
具体算法极简单:原始的RoPE中,所有注意力头共用同一个基础频率θ₀(默认10000)。LoL算法为每个注意力头h独立采样一个均匀分布的随机数ε_h∈[-1,1],然后计算扰动后的基础频率θ̂_h = θ₀·(1+σ·ε_h),其中σ是抖动强度。每个头用自己扰动后的频率来生成RoPE旋转矩阵,其余流程完全不变。仅此而已。
为什么这样一个微小的扰动有效?因为抖动打破了多个头之间的"谐振"。原始的RoPE各头频率一致,经过足够长的距离后,所有头的相位会同时与sink帧对齐,如同多个摆钟同频共振,产生足以支配输出的注意力虚高。加入差异化扰动后,每个头的相位漂移速度不同,它们在全球范围内同时对齐的窗口被彻底打散。也许某个头在某帧仍然对sink帧有较高关注,但其他头的注意力权重仍然分散,多头注意力的多样性得以保留,整体输出就不会被"吸"回sink帧。
这个方法最吸引人的地方在于它的零成本:完全不需要训练。模型权重一个字节都不用改,只在推理阶段对RoPE频率做一次随机扰动,即插即用。论文给出的经验值是σ=0.8,在生成质量和防坍缩之间取得最佳平衡。同时论文也验证了,抖动头数越多效果越好——这进一步证实了"需要打破所有头之间的同步"这一判断。

实验验证:质量与稳定性的双赢

实验部分,LoL团队在LongLive和Self-Forcing++两个模型上做了一系列严谨的对比。对比方法覆盖了当前主流的位置编码扩展方案:直接外推(PE)、位置插值(PI)、NTK感知缩放、YaRN、RIFLEx,以及LoL。核心指标包括Sink-Collapse Max(所有测试提示词中最大距离下降,越低越好)、Sink-Collapse Avg(平均距离下降,越低越好)和Dynamic Degree(动态程度,越高越好),在100秒视频上进行评估。
表1 不同方法在LongLive和Self-Forcing++上的对比结果
表1 在LongLive和Self-Forcing++上应用各种方法(视频时长100秒)的结果对比。红色表示严重重复,绿色表示动态程度显著降低。↓表示越低越好,↑表示越高越好。
从表1的整体格局可以读出几个关键信息。直接外推(PE)的动态度最高,但坍缩也最严重,LongLive上最大距离下降达到73.06,基本上是"必塌无疑"。位置插值(PI)虽然把坍缩压到很低(4.97),但动态度直接掉到0.35——画面几乎静止,说白了就是用"躺平"来逃避问题。NTK和YARN各有取舍,要么坍缩没压住,要么动态度崩了。RIFLEx作为双向模型上的SOTA方案,在自回归框架下几乎失效(70.95,和PE基本一样),再次验证了LoL团队的分析——自回归场景的坍缩不是单维度问题。
LoL则交出了一份难得的"双赢"答卷:在LongLive上把Max坍缩分数从73.06压到16.67,Avg从30.54压到3.93,同时Dynamic Degree保持在35.27,几乎和PE(34.62)持平。在Self-Forcing++上同样如此,Max从68.07压到22.70,Avg从34.11压到6.12,动态度只掉了约2个点。换句话说,LoL相当于用PI级别的坍缩抑制能力,换来了PE级别的视频活力。
表2 与其他自回归视频生成模型的性能对比
表2 在75秒和100秒视频上与主流自回归视频生成模型的性能对比。结果表明,尽管完全不需训练,本方法有效解决sink-collapse问题的同时最大程度保持了视频生成质量。
表2把LoL与当前主流自回归视频生成模型放在同一竞技场。在75秒和100秒两个时间档位下,加装LoL的Self-Forcing++在Temporal Quality和Dynamic Degree两项指标上优势显著:100秒时Dynamic Degree从54.12飙到81.20,Temporal Quality从90.87提升到92.91;LongLive的Dynamic Degree也从34.62微升到35.27。最值得注意的是,这些提升全部来自一个无需训练、只改推理时频率参数的插件。
除了量化指标,LoL团队还做了一个大场景切换的极限压力测试。在一段10分钟的视频里,场景从霓虹雨夜中的高速追车,突然切到立交桥上燃料车爆炸、火焰碎片横飞,再切到英雄穿越火海的终极场面。每一次提示词切换都伴随着剧烈的场景变化,但画面依然平滑过渡、没有崩坏,也没有回到sink帧。这个测试说明,LoL带来的稳定性不是只能处理类似场景的重复生成,而是能支撑真正的多场景、快节奏的叙事需求。
图14 10分钟大场景切换视频可视化
图14 10分钟大场景切换流式生成可视化。提示词依次为"夜晚的街道在潮湿的柏油路上霓虹闪烁,镜头高速冲向一场飞车追逐""追逐突然冲上高速。一辆油罐车爆炸,炽热的碎片纷飞,汽车在冲击波和坠落的金属中穿行""巨大的爆炸撕裂街道,主角穿越火焰和弹片冲向终局"等。

未来展望:无限视频生成的挑战与机遇

LoL证明了"无限视频生成"不再是一句挂在PPT上的口号,但它距离完美的产品形态还有很长的路。首先,LoL只是大幅抑制了sink-collapse,并没有做到完全消除。16.67的Max分数比PE的73.06已经好看太多,但偶发的坍缩仍然存在,特别是在极长序列的后半段。σ=0.8这个参数的取值也比较依赖经验,不同的基础模型可能需要重新调整。
其次,模型的长期记忆能力依然是系统性短板。LoL通过局部注意力和RoPE抖动保证了不崩溃,但模型能记住的上下文只有注意力窗口内的十几帧。如果某个物体在很早之前出现过,后续再出现时模型完全不认识它。这决定了当前的"无限生成"更像是"无限的主题延续",而不是真正意义上的"长程叙事"。更进一步的内容连贯性提升,可能需要引入记忆模块、场景图理解、或分层叙事规划这类更重量级的机制。
此外,12小时的连续生成虽然稳定,但视觉多样性在长时间尺度上仍会下降。1.3B参数量的模型跑12小时,后段内容的场景和动作模式趋于单一是一个客观存在的现象。这算是小模型的物理限制,未来用更大的底座模型配合LoL做长视频,质量天花板应该还会再提一截。
但话说回来,LoL的贡献不止是修了一个Bug。更重要的价值是,它系统性地揭示了自回归视频生成中sink-collapse的成因,并给出了一个"现象-分析-定位-修复"的完整研究范式。这种范式对所有做长序列建模的人都有启发——无论是视频生成、音频生成还是大语言模型的长上下文推理,都可能存在类似的周期性相位对齐问题,而LoL这种"零成本抖动"的思路完全可能被借鉴到更多领域。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?UCLA与字节跳动Seed团队提出LoL方法,通过多头部RoPE抖动机制解决长视频生成中的sink-collapse问题,无需训练即可将自回归视频生成扩展到无限长度,连续生成12小时视频仍保持稳定,且动态程度和质量几乎无损。
这篇工作最值得看的点是什么?在LongLive和Self-Forcing++两个模型上,LoL方法将Sink-Collapse Max从73.06/68.07降至16.67/22.70,同时保持动态程度与原始方法相当(35.27/81.20 vs 34.62/83.32),并成功生成12小时连续视频。
这篇工作的边界或风险在哪里?优点:无需训练、轻量级、有效缓解汇聚崩溃、支持无限长流式生成、保持生成质量。缺点:受限于基础模型能力、缺乏长期记忆机制、对超长视频的视觉多样性有限、抖动强度需要手动调节。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种无需训练的轻量级方法,通过多头RoPE抖动(Multi-Head RoPE Jitter)打破注意力头间的同质化,抑制自回归视频生成中的“汇聚崩溃”(sink-collapse)现象,实现无限长流式视频生成。

实验合理度:★★★★☆

Sink-Collapse Max(最大距离下降)、Sink-Collapse Avg(平均距离下降)、Dynamic Degree(动态程度)、VBench指标(包括时间质量、文本对齐、CLIP分数、主体一致性、背景一致性、运动平滑度、成。

学术研究价值:★★★★☆

提出一种无需训练的轻量级方法,通过多头RoPE抖动(Multi-Head RoPE Jitter)打破注意力头间的同质化,抑制自回归视频生成中的“汇聚崩溃”(sink-collapse)现象,实现无限。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在单个NVIDIA H100 GPU上以约16 FPS的实时速度进行流式生成,模型大小为1.3B参数。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:受限于基础模型能力、缺乏长期记忆机制、对超长视频的视觉多样性有限、抖动强度需要手动调节。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球