← 返回 PaperDaily
视觉与图像
Alaya Lab新作:实时长视频生成还能少算力?
长视频生成最怕两件事:记忆丢了,画面崩了;算力花了,速度没了。Surprise Forcing把这两个问题一起管了,用训练免费的方式做“该记的记住、该跳的跳过”,而且还真在长视频基准上跑出了像样的结果。
龙哥读论文
发布于 2026-08-22 00:20:04
阅读 4
查看原文
原论文信息如下:
引言
长视频生成这件事,表面上是“多生成几秒”,本质上却是一个很现实的工程难题:上下文窗口有限,算力预算也有限 。视频越长,模型越容易出现身份漂移、场景跳变、局部质量忽高忽低这些老毛病;更麻烦的是,传统流式缓存往往按时间先后删历史,去噪步骤又对每个片段一视同仁,结果就是“重要的忘了,不重要的还在白烧算力”。
这篇论文的思路很直接,也很有工程味:既然模型自己在推理过程中就会暴露出“这个片段有多意外”“这段历史有多值得留着”的信号,那就别装作看不见,干脆拿来做资源调度。于是,作者提出了 Surprise Forcing ,把“记什么、跳什么”统一成在线分配问题,在不改模型权重、无需重新训练的前提下,给长视频生成加了一层聪明的控制器。
问题背景及相关工作
先把话说人话:长视频生成不是“短视频生成做久一点”这么简单。短视频里,模型只要把局部连贯性做好,观感通常就过关;一旦拉长到几十秒甚至一分钟,模型就得同时扛住主体身份、服饰细节、背景布局、视角变化和动作连续性。任何一环掉链子,观众都会立刻看出来,像是同一个人突然换脸、同一间屋子突然改装修,或者镜头一转就把前面辛苦建立的世界观全丢了。
现有流式自回归视频扩散管线虽然把“连续生成”变得可行,但大多默认两个不太聪明的前提。第一,历史缓存按时间顺序滚动,老片段到了就删,像清理浏览器历史记录一样干脆,问题是早期建立身份和场景的信息往往最值钱,删掉之后后面很难补。第二,每个生成块都走一样的去噪步数,不管这块内容是静态风景还是大幅运动,都得老老实实挨同样次数的 transformer 评估,结果就是简单片段被反复“精修”,复杂片段又未必得到足够照顾。
作者的判断很明确:这两个问题其实是一类问题,都是资源分配不合理 。历史上下文该不该留,取决于它还能不能提供新信息;去噪步骤该不该跳,取决于当前片段到底有多难。于是,论文把“惊喜”当成统一信号:对记忆来说,惊喜越大,说明这段历史越不该被轻易扔掉;对去噪来说,惊喜越大,说明这段内容越值得继续精修。
文章上半部分子标题
龙迷三问
龙哥点评
主要参考文献
长视频生成最怕的,不是“画面不够好看”,而是越往后越忘、越复杂越慢 。前半段还像回事,后半段就开始身份漂移、背景乱飞、动作卡顿,像一个记性不太好的导演,拍着拍着把剧本弄丢了。更尴尬的是,传统流式生成还会把算力平均撒给每个片段:简单镜头和高难度镜头享受同等待遇,结果就是该省的不省,该花的又不够花。
长视频生成的“记忆危机”与“计算瓶颈”
这篇论文盯住的,其实就是长视频生成里最典型的两类浪费:记忆浪费 和计算浪费 。前者是“重要历史被删掉”,后者是“简单片段被反复精修”。这两个问题看起来不相关,实际上都在消耗同一件事:有限的推理预算。
先说记忆。流式自回归视频扩散模型为了保持实时性,通常只保留一个滚动的键值缓存(KV cache)。KV cache 的全称是 Key-Value Cache ,中文可以理解为“键值缓存”,它负责把历史帧的上下文暂存下来,供后续帧继续注意。问题在于,很多方法默认“越老越该删”,这在浏览器历史记录里也许合理,在视频里却很蠢:早期镜头往往最早建立人物身份、服装、场景布局,删得太早,后面就只能靠模型自己硬猜,猜着猜着就开始跑偏。
再说计算。长视频生成里的每个 chunk 都会经历固定次数的去噪步骤。chunk 可以理解为“一个小段视频块”,是流式生成里常见的处理单位。固定步数的问题也很直白:静态场景、低变化镜头、几乎没动作的片段,往往第一步以后就已经差不多了;但突然转场、人物入场、视角变化这些片段,却可能还需要更多修正。结果就是,简单片段被“加班”太多,难片段却没有得到足够照顾。
“惊喜”驱动:一个无需训练的通用资源分配框架
论文把整个框架拆成两条线:一条管“记忆”,一条管“去噪”。两条线都围绕同一个原则:模型自己的中间表示里,已经藏着足够的难度和新颖度信号 。既然信号都在了,就没必要再额外训练一个预测器来装神弄鬼。
先解释一个原论文里很关键的缩写。DMD 是 Distribution Matching Distillation ,中文可译为“分布匹配蒸馏”。它的作用,是把一个更强但更慢的教师模型,蒸馏成一个更适合快速推理的学生模型。Surprise Forcing 并不重新训练这个学生,而是在它已经能跑的基础上,给它加了两套“在线调度器”:一套决定哪些历史值得进外部记忆库,另一套决定当前 chunk 是否可以少走几步去噪。
这套设计的思路很像现实里的资源调度:不是把仓库塞满,也不是让每个工位都按同样节奏干活,而是先判断“这个东西值不值得留”“这个活值不值得多花时间”。听起来朴素,但在长视频生成里,这种朴素往往比花哨更有用。
“惊喜门控记忆库”:告别“千人一面”的缓存淘汰
这一部分是论文最像“工程师写出来的答案”的地方。传统做法是 FIFO,先来先走,简单粗暴。FIFO 的全称是 First-In First-Out ,中文就是“先进先出”。它适合排队,不太适合视频记忆。因为视频里的历史不是仓库里的旧快递,老不代表没用。
Surprise-Gated Memory Bank 的思路是:当一个帧要离开局部缓存时,不是直接扔掉,而是先问一句——它有没有给历史补充新的视觉信息 。如果只是重复信息,就没必要占外部记忆的位置;如果它带来了新姿态、新视角、新物体关系,或者新的场景状态,那就值得留下。
这里的“惊喜分数”不是拍脑袋来的,而是由两部分组成。第一部分看它和整个记忆库的平均差异,叫全局偏离;第二部分看它和最相近记忆的差异,叫局部新颖。前者防止“整体都差不多”的重复帧混进来,后者防止“平均值看着还行,但某个角落其实已经被覆盖”的漏判。两者合起来,既看大盘,也看细节,比较像一个不愿意被平均数骗到的审稿人。
更关键的是,论文还加了一个反馈控制器。因为不同视频的“惊喜分布”根本不一样:有的视频平静得像午后咖啡馆,有的视频一秒一个转场。如果直接拿固定阈值去筛,结果就是有的视频记忆库爆满,有的视频又空得像被清仓。于是作者引入 Budget-Norm Gating ,中文可以理解成“预算归一化门控”:一边根据当前视频的分数分布做在线归一化,一边用反馈调节写入率,让系统自己把门槛调到合适位置。
记忆库满了以后,也不是简单删最老的,而是用优先级替换 。优先级考虑三个因素:写入时有多“惊喜”、后来被用得有多频繁、以及它有多老。这个设计挺实在:有些老帧虽然老,但一直被后续引用,说明它是“老而弥坚”;有些新帧虽然新,但根本没人用,说明它只是路过打卡。
为了避免“存了也白存”,论文还设计了动态路由。简单说就是:不是记忆库里所有东西都拿去参加每次注意力计算,而是根据当前查询,挑最相关的一小撮帧参与。这样既保留了长程信息,又不把注意力算力浪费在一堆和当前场景无关的旧资料上。
“惊喜感知去噪”:让简单帧“摸鱼”,重点帧“精雕细琢”
如果说记忆库解决的是“历史别乱丢”,那去噪这部分解决的就是“别把所有片段都当成一样难”。论文提出的 Surprise-Aware Denoising ,中文可以理解成“惊喜感知去噪”:先跑一轮,再看当前 chunk 到底有多难,然后决定后面的去噪步数要不要跳。
这里有个很巧的设计:难度不是靠额外网络预测,而是直接看第一步去噪后的中间结果。具体做法是计算 chunk 内相邻帧的余弦距离,余弦距离可以简单理解为“两个特征方向差了多少”,然后取其中最大的那个变化作为当前 chunk 的惊喜度。为什么取最大值?因为一个 chunk 里只要有一处突然变化很大,就足以决定后续是否还需要继续修正。平均值太温和,容易把真正的突变淹没掉。
论文还专门验证了这个分数和首步到最终去噪误差之间的相关性。结果表明它确实能反映后续还要修正多少,相关性不算玄学。也就是说,这个信号虽然简单,但很适合拿来做 chunk 级别的调度依据。对工程实现来说,这一点很重要:信号越便宜,越适合在线部署。
调度策略也很直接。系统会在一个滑动窗口里对最近 chunk 的惊喜度做局部排序,比较“当前这块”在最近一段视频里算不算容易。如果它属于相对简单的一类,就走缩短后的去噪日程;如果它比较难,就保持完整步数。这样做的好处是,模型不是按全局死阈值硬切,而是按当前视频自己的节奏动态调整。
这部分最值得点个赞的地方在于:它没有尝试“预测未来”,而是只利用当前 chunk 已经暴露出来的中间状态。对流式系统来说,这种自洽的局部判断通常比强行上一个大预测器更稳,也更容易落地。
全面超越基线:VBench多项指标登顶,长程一致性大幅提升
实验部分的结论很清楚:这套方法不是只在某一个指标上“蹭赢”,而是在短视频和长视频两个场景里都拿到了比较扎实的收益。更重要的是,收益并不是靠改模型结构、加大参数量或者重新训练换来的,而是靠推理阶段的资源调度实现的。这个味道就对了,毕竟长视频生成的痛点,本来就不是单纯堆模型容量能解决的。
从表1看,Surprise Forcing 在 5 秒的 VBench 上把总分推到了更高位置,在 60 秒的 VBench-Long 上也拿到了更好的质量、一致性和美学分数。这里最值得注意的不是“某个单项涨了多少”,而是它在保持实时流式吞吐的情况下,仍然能把长程质量往上拉。这说明它不是简单地拿速度换质量,而是在做更细的预算分配。
表2的意义更直接:它不是只看“整体分数”,而是把长视频最容易翻车的几个维度单独拎出来。结果显示,Surprise Forcing 在身份、服装、实例保持和多视角一致性上都更强,尤其是多视角一致性提升明显。这很符合前面的设计逻辑:早期有代表性的历史帧被保留下来之后,模型后面遇到视角变化时就不至于完全失忆。
表3说明了一件很朴素的事:固定阈值门控确实不够稳。阈值太松会把低价值帧也塞进来,阈值太紧又会让记忆库过于贫血。预算归一化门控之所以更好,就是因为它不是死守一个数,而是根据当前视频的分布和目标写入率动态调整。这个结果不戏剧化,但很有工程说服力。
表4进一步证明,FIFO 确实是个过于粗糙的默认选项。优先级替换在一致性、运动平滑和图像质量上都更好,说明“历史里谁更有用”这件事,不能交给年龄一票否决。记忆系统不是养老院,不能只看资历。
表6说明,单独只看全局偏离或者只看局部新颖,都能工作,但组合后更稳。原因也不难理解:平均相似度能反映“这帧和整个记忆库是否格格不入”,最近邻相似度能补上“是不是已经被某个旧帧覆盖”的细节。一个负责大局,一个负责查漏补缺,搭配起来才像样。
表7很有现实感:容量从小到大,质量指标变化并不总是线性上涨,但 GPU 内存和吞吐压力却是实打实增加的。也就是说,记忆库不是越大越好,够用、稳定、不会把注意力算力拖垮,才是更合理的点位。论文最后把容量放在一个折中位置,挺符合工程常识。
表8说明,动态路由不是锦上添花,而是很关键的一刀。随机选、只看最近、或者把太多帧都丢进去,都会让性能和吞吐受损。相似度驱动的 top-k 路由更合适,因为它让外部记忆真正服务于当前查询,而不是成为一个“什么都在、什么都很吵”的大杂烩。
表9把“写入率”这个看似抽象的控制变量讲明白了:目标太低,记忆库补不进足够信息;目标太高,旧的有用帧会被挤掉,系统变得过于躁动。最好的位置不是极端,而是一个稳定、适中、能兼顾新旧信息的平衡点。
表11是这套去噪调度里最关键的一个小验证:只看首尾变化,不如看相邻帧中最大的突变。原因很简单,chunk 中间如果突然来一个大动作,首尾未必能完整捕捉,但相邻帧最大变化能更敏感地抓住这种“局部爆点”。这也解释了为什么论文最后选择了这个预测器。
表5把速度和质量的权衡摆在了台面上。跳步比例越高,吞吐越快,但质量会逐步损失。默认设置选择了一个中间值,说明作者并不是一味追求“越快越好”,而是在尽量保住长视频的稳定性前提下节省算力。这个取舍是成熟的,不是莽的。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是长视频生成里的两个老大难:历史缓存该留谁、去噪步骤该给谁。前者防止模型“忘前面”,后者防止模型“对简单片段太勤快、对复杂片段不够用”。
“惊喜分数”里的全局偏离和局部新颖分别是什么意思? 全局偏离看的是某个帧和整个记忆库平均水平差多少,局部新颖看的是它和最相似的那条记忆差多少。前者防重复,后者防漏判,两者一起用更稳。
这套方法为什么不用重新训练也能起作用? 因为它没有改模型本身,而是利用推理过程中的中间表示做在线控制。记忆是否写入、去噪是否跳步,都是根据当前 chunk 和当前历史状态实时决定的,属于“调度层优化”,不是“模型层重造”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是凭空造了一个新模型,而是把“惊喜”这个在线信号系统性地用于记忆和去噪调度,切口不大,但很实用。
实验合理度: ★★★★☆ 对比、消融、长程一致性和吞吐都覆盖到了,能较完整说明方法为何有效,实验设计比较扎实。
学术研究价值: ★★★★☆ 这篇工作把长视频推理中的“资源调度”问题讲清楚了,对后续做流式生成、记忆管理和动态步数分配都有启发。
稳定性: ★★★☆☆ 训练免费方案的优势是轻,但也意味着它强依赖底座模型和当前分布,遇到极端场景时未必总能稳住。
适应性以及泛化能力: ★★★★☆ 方法不绑定具体任务标签,属于“推理时可插拔”的控制层,跨场景迁移的潜力不错。
硬件需求及成本: ★★★★☆ 不改权重、只做在线调度,成本主要来自少量额外统计和检索,整体比重训友好得多。
复现难度: ★★★☆☆ 思路不复杂,但要稳定复现长视频指标,仍然依赖底座模型、评测协议和推理细节对齐。
产品化成熟度: ★★★☆☆ 适合嵌入现有流式视频生成系统做“推理增强层”,但真正上线前还需要更多稳定性和边界测试。
可能的问题: 惊喜信号仍是启发式,遇到复杂叙事或异常运动时可能不够鲁棒;另外,长视频真实部署里还要面对不同底座模型和不同算力预算的适配问题。
主要参考文献
[1] Shi, S., Li, Z., Niu, M., Li, C., Zheng, B., Zhang, K., Zheng, Y. Surprise Forcing: What to Remember, When to Skip in Long Video Generation. arXiv:2607.18436v1, 2026.
[2] 论文原文链接:https://arxiv.org/pdf/2607.18436v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!