← 返回 PaperDaily
视觉与图像
UCF-101上VideoRAE刷新SOTA:离散40、连续93
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
龙哥读论文
发布于 2026-08-14 21:50:14
阅读 6
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
原论文信息如下:
论文认为当前视频自编码器面临哪些挑战?
视频生成这件事,表面上看是“把画面做出来”,本质上却先得解决一个更难的问题:把视频压缩成一个既省算力、又不丢语义、还适合生成模型处理的潜空间 。这一步要是做歪了,后面的扩散模型或者自回归模型就只能在一堆“压扁了的垃圾信息”上硬学,结果不是糊,就是慢,或者两者兼有。
论文把现有视频自编码器的核心问题说得很直白:传统3D-VAE(3D Variational Autoencoder,三维变分自编码器)大多还是围着像素重建打转,训练目标主要是像素级均方误差和对抗损失。这样做的结果是,模型确实会盯着局部纹理、颜色和边缘,但对语义结构、长时序关系、物理运动逻辑 的关注明显不够。简单说,就是“画得像”不等于“懂得对”。
更麻烦的是,视频比图像更难压缩。图像压缩还能靠空间冗余偷点懒,视频则同时有空间和时间两层冗余,还要面对更严格的压缩率要求。传统3D-VAE一边要把视频压得足够小,一边又要保住细节,最后常常陷入两难:潜空间太“紧”,语义丢得多;潜空间太“松”,下游生成器又要背着一大包负担跑步。论文的判断很清楚:旧式视频tokenizer更像是为重建服务,不是为生成服务 。
这也是VideoRAE要解决的真实痛点:能不能把“只会理解”的视频基础模型,直接改造成“既能重建、又能生成”的视频潜空间底座 。如果能,这就不是对旧方法的小修小补,而是把视频表示学习和生成建模之间那堵墙,往下拆了一大块。
VideoRAE的核心创新是什么?
VideoRAE的思路其实很“反常识”:不是继续把视频编码器从零训练成一个更会压缩的VAE,而是直接站在冻结的视频基础模型肩膀上,做一层Representation Autoencoder,表示自编码器 。这里的关键不在“自编码器”三个字,而在“表示”二字——编码器不再追求把像素压到极致,而是把基础模型已经学到的高层语义、时序结构和多尺度信息,重新组织成生成友好的潜空间。
它的核心创新可以概括成三件事。第一,用冻结的视频基础模型提特征 ,避免从头学编码器时过度偏向像素细节。第二,用轻量1D self-attention projector(1D自注意力投影器)压缩冗余时空序列 ,把巨长的视频token序列压成紧凑的基础token。第三,用局部-全局表示对齐目标 REPA(Representation Alignment,表示对齐)替代传统KL正则 ,让潜空间在语义结构上保持“长得像老师”,而不是硬往标准高斯里塞。
这套设计最有意思的地方,是它没有把连续生成和离散生成当成两套互不相干的系统,而是统一在同一个框架里:连续latent给扩散Transformer(DiT,Diffusion Transformer,扩散Transformer)用,离散latent给自回归模型用。换句话说,VideoRAE不是只给某一种生成器铺路,而是直接修了一条“视频生成高速公路”。
如果用一句大白话概括,VideoRAE做的事就是:把“会看视频”的大模型,改造成“会给生成模型递好作业”的潜空间老师 。这比单纯追求更低的重建误差,方向上更对生成任务的胃口。
冻结的视频基础模型具体如何被利用?
这里的“冻结”不是摆设,而是VideoRAE整个方法成立的前提。论文选用V-JEPA 2和VideoMAEv2这类视频基础模型作为编码器,先从浅层到深层提取多尺度层级特征 ,再把这些特征做元素级求和融合。这样做的好处很直接:浅层保留局部运动和细节,深层提供更抽象的语义和物理结构,合在一起就比只拿最后一层特征更完整。
但基础模型的特征通常很长、很密、很贵。视频token一旦铺开,序列长度会非常夸张,直接拿去做生成,算力先被拖垮。于是VideoRAE在编码器后面加了一个轻量的1D self-attention projector,它不是再去学习复杂的三维卷积堆叠,而是专门做一件事:在保留全局依赖的前提下,把冗余的时空表示压缩成少量基础token 。这一步非常像把一整本小说压成提纲,不能乱删,但必须足够短。
更关键的是解码端。VideoRAE没有只靠像素重建来“猜回去”,而是在解码器中引入REPA,让解码器的中间特征和冻结VFM教师的高层特征对齐。这里的REPA分成局部和全局两部分:局部对齐强调细粒度结构不跑偏,全局对齐强调整体语义和时序布局别散架。论文把这种约束看作一种隐式正则,效果上相当于告诉解码器:别只顾着抠像素,先把老师的语义骨架学明白。
这里还有一个很工程化的点值得注意:传统3D-VAE常常要靠KL散度把latent往标准高斯上拽,VideoRAE则认为这种硬拽会伤表达能力。它用表示对齐来维持潜空间几何结构,等于把“分布规训”换成了“语义约束”。这不是偷懒,而是承认视频生成最重要的不是latent看起来多规整,而是它能不能让下游生成器学得更顺。
VideoRAE如何支持不同类型的生成模型?
VideoRAE最“讨喜”的地方,是它没有把自己锁死在某一种生成范式里。连续生成和离散生成,本来是两套脾气完全不同的系统:前者喜欢平滑、连续、可微的latent,后者需要一串离散token来做自回归预测。VideoRAE把同一套基础表示,分别整理成两种格式,直接兼容这两类主流生成器。
对于扩散Transformer(DiT),VideoRAE走的是连续latent路线。基础token先经过线性投影,变成较低维但仍保持语义结构的连续表示。论文强调,这里不再强行加KL正则 ,因为REPA已经在语义层面把空间结构“扶正”了。这个设计的结果,是latent既足够紧凑,又不会像某些VAE那样为了规整把细节磨平。
对于自回归模型,VideoRAE则采用Multi-Codebook SimVQ(多码本SimVQ) 。这里的逻辑很朴素:既然高维语义不容易塞进单一码本,那就把通道维度切成多个子块,每个子块单独量化。SimVQ的做法比普通VQ更稳,它不是直接优化码本向量,而是先用可学习的MLP把冻结的基础码本映射到目标空间,再做最近邻搜索。这样既能保住码本表达力,又能降低码本塌缩的风险。
这套离散化策略的意义不只是“能不能量化”,而是“能不能量化得不太蠢”。视频基础模型抽出来的表示本来就复杂,如果硬压成低维离散token,很容易把动作、场景和时序关系一起压扁。多码本的好处,就是在保持整体高维容量的同时,把量化难度拆散,避免一个码本扛全部压力。
从系统角度看,VideoRAE其实是在做一件很实用的事:同一套视频表示,既能给DiT喂连续latent,也能给AR模型喂离散token 。这意味着它不是一个只适合单一论文设定的“定制零件”,而是更接近通用的视频压缩接口。
实验效果如何验证其有效性?
这篇论文最有说服力的地方,不是概念讲得漂亮,而是实验设计确实围着核心问题来:冻结的视频基础模型,究竟能不能同时做好重建和生成 。论文没有只盯一个指标,而是同时看重建质量、生成质量、收敛速度,以及在文本到视频任务中的稳定性,这样才比较接近真实使用场景。
从重建结果看,VideoRAE在离散和连续两条路线上都站住了脚。离散侧,VideoRAE在UCF-101和TokenBench上都刷新或逼近最好成绩,尤其是rFVD显著降低,说明时序质量更稳。连续侧,VideoRAE在较小瓶颈下仍能保持不错的感知质量和结构恢复能力,和一些更“重”的VAE相比并不吃亏,甚至在某些指标上更均衡。这里最值得注意的是:VideoRAE不是靠把latent做大来换结果,而是在紧凑表示下把语义组织得更好 。
这个结果最让人眼前一亮的地方,是它不只是“重建好”,而且“生成也快”。论文给出的训练收敛图显示,AR和DiT两条路线都比对照自编码器更快收敛;在2B规模的文生视频实验里,把LTX-VAE换成VideoRAE后,训练也更快稳定下来,VBench表现更好。换句话说,VideoRAE不只是把潜空间做得更聪明,还把下游模型的学习难度一起降了下来。
VideoRAE有哪些局限性?
VideoRAE虽然思路漂亮,但也不是“把基础模型一接上就天下无敌”。第一,它依赖高质量的视频基础模型,编码器本身越强,效果往往越稳;这意味着方法的上限和基础模型预训练能力强相关。第二,论文的核心验证主要还是围绕UCF-101、TokenBench和VideoUFO这类数据集展开,面对更复杂、更长时序、更开放域的视频场景,泛化能力还需要进一步检验。
第三,VideoRAE虽然把离散和连续两条路线都打通了,但这也意味着系统复杂度不低:要处理多尺度特征聚合、1D投影压缩、连续/离散两套latent格式、REPA对齐,以及不同生成器的适配。对研究来说这很优雅,对落地来说则意味着工程链路不短。第四,离散侧的多码本SimVQ虽然缓解了量化瓶颈,但码本规模、子码本数量和latent维度怎么选,仍然会影响训练稳定性和算力成本。
所以更准确的判断应该是:VideoRAE证明了冻结视频基础模型可以成为很强的视频生成底座 ,但它还不是一个“随便换个场景就能直接商用”的终局方案。它更像是把方向走通了,接下来要做的是把适配范围、稳定性和成本进一步打磨。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“视频生成前,潜空间怎么做才更适合生成”这个老大难问题。VideoRAE证明了冻结的视频基础模型不只是理解工具,也能被改造成高质量的视频自编码器底座。
REPA和KL正则是什么关系? REPA是Representation Alignment,中文是表示对齐;KL正则是传统VAE里把latent往标准高斯分布拉的约束。VideoRAE认为,只要语义结构对齐得足够好,KL就不一定非加不可。
为什么它既能给扩散模型用,也能给自回归模型用? 因为VideoRAE把同一套基础表示做了两种格式化:连续latent给DiT用,离散token给AR模型用。前者靠线性投影,后者靠多码本SimVQ量化,底层语义来源是同一套冻结VFM特征。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是简单堆模块,而是把冻结视频基础模型正式拉进了视频生成底座这条主线,方向感很强。
实验合理度: ★★★★☆ 同时做重建、生成、收敛速度和文本到视频替换实验,验证链条比较完整,且和方法设计对应得上。
学术研究价值: ★★★★★ 证明“理解型视频基础模型”可以服务生成任务,这个结论对表示学习和生成建模都有启发。
稳定性: ★★★☆☆ 结果不错,但依赖基础模型质量和多模块协同,离大规模稳定落地还有一段路。
适应性以及泛化能力: ★★★☆☆ 在UCF-101、TokenBench和2B文生视频里有效,但更开放、更长视频场景还需要继续验证。
硬件需求及成本: ★★★☆☆ 冻结编码器和多码本设计都不算轻,训练成本不低,不过收敛更快能部分抵消代价。
复现难度: ★★★☆☆ 思路清晰,但涉及VFM、DiT、AR、多码本和REPA,多组件组合对复现环境要求较高。
产品化成熟度: ★★★☆☆ 作为视频生成底座很有潜力,但还更像高水平研究原型,离通用产品化还差工程打磨。
可能的问题: 方法很强,但系统偏复杂,且效果与基础模型强相关;如果后续没有更广泛场景验证,容易停留在“漂亮论文”层面。
主要参考文献
Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang. VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders. arXiv:2607.14088v1, 2026.
原文链接:https://arxiv.org/pdf/2607.14088v1.pdf
论文中提到的核心基础模型包括 V-JEPA 2 与 VideoMAEv2;相关生成框架包括 DiT 与自回归 Transformer。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群