← 返回 PaperDaily 视觉与图像

ICCV 2023新范式被挑战:视频扩散模型为何输给自回归?

视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。

ICCV 2023新范式被挑战:视频扩散模型为何输给自回归?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。


原论文信息如下:
论文标题:
The Seriality Gap in Video Diffusion Models
发表日期:
2026年07月
发表单位:
UC Berkeley
原文链接:
https://arxiv.org/pdf/2607.13031v1.pdf

视频扩散模型预测未来,真的靠谱吗?

视频扩散模型这几年很会“画未来”,但这篇论文偏偏盯住了一个更扎心的问题:它到底会不会顺着因果链条,一步一步把后果算对。如果只是补帧、续一段短视频,很多模型看起来都挺像那么回事;可一旦事件开始“接龙”,前一个碰撞会改变下一个碰撞的条件,模型就容易露馅。
图1:依赖事件预测暴露出的序列性差距
图1:依赖事件预测暴露出的“序列性差距”。单球场景里,未来状态可以直接从初始状态算出来;多球场景里,每一次球-球碰撞都会改变后续碰撞的前提,必须按时间顺序逐步解析。
这篇工作没有拿花里胡哨的自然视频硬拷问模型,而是选了一个极简但很“损”的测试场:硬球动力学。几个小球在盒子里弹来弹去,规则简单、结果唯一、没有歧义。正因为如此,模型要是还算不准,就不是“世界太复杂”,而是“算力没有沿着正确方向花”。

“序列性差距”:长链事件预测的隐形杀手

论文把这个现象起了个很准的名字:序列性差距(seriality gap)。意思很直白:任务需要的“串行计算”越来越多,但视频扩散模型的去噪循环,并没有随着链条变长而线性补上这部分能力。
这里要先讲清一个基础概念。视频扩散模型通常不是一次性吐出整段视频,而是从噪声里反复“擦掉脏东西”,最后得到目标视频。这个过程听起来像是在认真思考,但论文的观点很犀利:去噪步数多,不等于真正的串行推理多。如果骨干网络本身没有把依赖关系算透,再多擦几遍也可能只是把画面擦得更像,不是把因果算得更对。
为了把这个问题钉死,论文设计了两个对照:一个是多球场景,碰撞链条会随着预测长度增长;另一个是单球场景,长度一样,但没有球-球碰撞,未来可以闭式计算。这样一来,视频越长带来的“算不准”,到底是因为长度本身,还是因为依赖链条更长,就能分得很清楚。
图2:序列化缩放
图2:序列化缩放。双向去噪是把未来帧一起“抹干净”,但去噪本身并不会自动变成可扩展的串行计算;相反,把生成过程改得更串行,或者把骨干网络做得更深,性能会更稳。

实验揭秘:为什么去噪步数再多也不管用?

先看最核心的实验结论。论文在五球硬球任务上发现,标准的双向视频扩散模型,随着碰撞链条变长,局部物理精度会明显下降;而自回归生成的误差更平稳,长链下也没那么容易崩。这个差异不是“视频更长所以更难”那么简单,因为在单球控制组里,随着长度增加,双向与自回归之间的差距几乎消失了。
图3:序列性差距的实证证据
图3:序列性差距的实证证据。左上显示双向扩散在碰撞链条变长时退化,而自回归更稳;右上显示去噪步数增加并不能把差距补回来;左下检验骨干深度和宽度;右下则展示从双向到分块再到自回归,越串行越好。
最容易让人误会的是去噪步数。直觉上,扩散模型既然要迭代很多轮,似乎“多迭代几次”就能补上推理能力。论文专门把去噪步数从 10、20、50、100 一路扫到 200,结果很不客气:性能在中等步数后基本平台化,长链任务依旧难啃。换句话说,去噪轮数增加了,但真正能处理依赖链的串行计算并没有同步增加
表3:更多去噪步数并不能关闭序列性差距
表3:更多去噪步数并不能关闭序列性差距。双向扩散在不同视频长度下,随着去噪步数增加只会在某个点后趋于饱和,长视频仍然更难。
这其实很符合工程直觉。很多人把“更多迭代”理解成“更多思考”,但在这里,迭代更像是对同一份答案做细修,而不是重新把依赖关系一层层算出来。模型能修得更像,不代表它能修得更对。碰撞链条一长,前一步错了,后面就会像多米诺骨牌一样继续歪。
图4:双向生成中的典型失效模式
图4:双向生成中的典型失效模式。常见问题包括穿透、球数异常、颜色身份错乱。说白了,就是模型有时会“看见”一个物理世界,但没有把这个世界的状态守恒住。

解决方案:加深度、改架构,让模型“算”得更深

论文没有停留在“发现问题”这一步,而是进一步问:那到底什么东西能补上这块短板?答案非常朴素,也非常工程:把计算做得更串行,或者把骨干做得更深
先说架构改法。论文把生成方式从双向生成,逐步改成分块生成,最后到自回归生成。这里的自回归(autoregressive)可以理解成“先算前几帧,再拿前面的结果去算后几帧”;分块生成则介于两者之间,一次处理一小段时间窗口。生成越串行,模型越像在按因果顺序做题,而不是把一整张卷子糊在一起涂答题卡。
图12:分块生成的注意力掩码
图12:分块生成的注意力掩码。横轴是可见的历史位置,纵轴是当前查询位置;不同颜色表示允许关注的帧。它本质上是在控制“哪些未来信息现在不能偷看”,让计算顺序更贴近任务的因果结构。
表1:不同视频长度和推理分解下的结果
表1:不同视频长度和推理分解下的结果。双向模型在长链事件上会明显退化,而把推理变得更串行之后,局部物理精度会更好。
再说骨干网络。论文比较了加宽和加深两种扩容方式,结果是:深度比宽度更能补序列计算,至少在 30 层左右之前,这个趋势非常明显。这个结论对工程师其实很有启发:如果任务本身需要逐步推演状态,单纯把模型做胖,不一定比把模型做深更有效。
表4:深度缩放比宽度缩放更有效
表4:深度缩放比宽度缩放更有效。更深的骨干在物理精度上提升更明显,说明把“算的层数”堆上去,比单纯堆参数更贴近问题本质。
论文还给了一个很关键的理论解释。对确定性视频预测来说,如果初始条件已经决定了唯一未来,那么在高斯加噪之后,精确的条件得分只要算对一次,就足以把那个唯一未来恢复出来。这里的“得分”指的是噪声条件得分函数(noise-conditional score function),英文全称是 Noise-Conditional Score Network, NCSN,中文可理解为“噪声条件得分网络”。它在扩散模型里负责告诉系统:当前带噪样本应该往哪个方向去噪,才能回到干净数据。
图5:理论总览
图5:理论总览。确定性动力学把初始状态映射到唯一未来;在高斯加噪下,精确条件得分会指回这个唯一未来,所以一次得分网络评估就足够恢复它。也正因为如此,去噪步数并不会凭空长出额外的串行计算。
这段理论的意思其实很“反直觉但合理”:如果骨干网络已经把关键状态信息算出来了,那么后续多次去噪更多是在重复调用同一份能力,而不是不断累积新的推理层次。于是,想补短板,不能只盯去噪轮数,而得盯骨干深度、推理分解方式,甚至重新想一类更适合做序列推理的生成目标。

从弹球到真实世界:结论的普适性探讨

这篇论文最值得记住的,不是“弹球”本身,而是它把一个常被忽略的事实讲透了:视频模型的失败,未必是视觉不够强,也可能是串行计算不够用。在硬球任务里,这个问题被干净地暴露出来;在更复杂的真实世界视频里,外观、噪声、遮挡、语义歧义会把问题搅得更乱,但并不会自动消灭依赖链条。
图6:定性失败案例
图6:定性失败案例。双向输出更容易出现穿透、球数异常、颜色身份错乱等问题,而自回归结果通常更守物理规律。
表2:单球控制组下的非串行设置
表2:单球控制组下的非串行设置。没有球-球碰撞后,双向与自回归之间的差距大幅缩小,说明问题的关键确实是依赖链,而不是单纯的视频长度。
论文还做了一个很有意思的补充实验:把墙壁速度做轻微扰动,引入一点随机性。结果趋势依旧类似,说明这个“序列性差距”并不是只在完全确定性的玩具环境里才成立。换句话说,这不是“模型在一个过于理想的世界里翻车”这么简单,而是它在面对需要逐步解析的任务时,确实存在结构性瓶颈。
表5:振动墙动力学下的趋势一致性
表5:振动墙动力学下的趋势一致性。即使加入一定随机性,双向和自回归模型之间的趋势仍然保持一致,说明结论并不只依赖于最理想化的场景。
对实际应用来说,这个结论挺有现实味道。若任务是长时序物理预测、复杂交互模拟、需要按步骤推进的规划问题,单纯依赖“更强的双向去噪”可能不够。更靠谱的方向,是让模型真正拥有可扩展的串行计算能力,比如更深的主干、任务对齐的分块推理,或者干脆换一种更适合做逐步推演的生成范式。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它不是在比谁生成的视频更好看,而是在问视频扩散模型能不能处理“事件接着事件”的长链推理。论文发现,长链依赖越多,双向扩散越容易掉链子,这就是所谓的序列性差距。

NCSN 是什么意思?NCSN 是 Noise-Conditional Score Network,中文叫“噪声条件得分网络”。它负责估计当前带噪样本往干净样本回去的方向,是扩散模型里最核心的去噪指挥官。

为什么去噪步数增加了,性能还是不行?因为去噪步数增加的是“重复修正”的机会,不一定增加真正的串行推理能力。若骨干网络没有把依赖链条算清,迭代再多也只是反复擦同一块黑板,不能自动把题目做深。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“视频扩散为什么会在长链依赖上失灵”讲得很透,而且不是停留在经验判断,而是给出了实验和理论两层解释。新意主要在问题定义和“序列性差距”这个切口上。

实验合理度:★★★★☆

硬球动力学这个测试床非常干净,单球控制组也设计得很到位,能有效排除“只是视频更长”的干扰。唯一的小遗憾是仍然属于合成场景,向真实世界外推时要谨慎。

学术研究价值:★★★★☆

对视频生成、世界模型和序列推理的交叉研究都有启发。它提醒研究者:有些问题不是“模型不够大”,而是“计算组织方式不对”。

稳定性:★★★☆☆

在硬球和振动墙设置里都能看到类似趋势,说明结论不算脆。但要直接落到复杂自然视频,还需要更多验证。

适应性以及泛化能力:★★★☆☆

对“依赖链逐步展开”的任务很有参考价值,但并不是所有视觉任务都适合自回归化。任务结构不对齐时,效果未必这么好。

硬件需求及成本:★★☆☆☆

训练约 300 个 A100-80GB GPU-days,成本不低。推理时双向扩散也不算轻,真要上产品,算力账得先算明白。

复现难度:★★★☆☆

实验设置和指标定义比较清楚,但涉及视频扩散训练、硬球模拟器和多种推理分解,工程量不小,不是随手就能复现的轻量工作。

产品化成熟度:★★☆☆☆

更适合做研究判断和架构启发,不适合直接当成现成产品方案。要进入产品层,至少还需要更强的真实场景验证和更稳定的推理机制。

可能的问题:结论很清楚,但主要建立在合成物理场景上;对自然视频的外推还不够硬,且理论部分对“确定性”和“精确得分”的假设偏强。


主要参考文献

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai. The Seriality Gap in Video Diffusion Models. arXiv:2607.13031, 2026.
原文链接:https://arxiv.org/pdf/2607.13031v1.pdf
图像与表格均来自论文原文截图。

球弹一下不难,难的是一串都弹对。视频扩散模型这次被硬球物理课“点名”了:想看更多前沿论文、模型拆解和工程视角?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。