← 返回 PaperDaily 视觉与图像

UCF-101上VideoRAE刷新SOTA:离散40、连续93

这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。

UCF-101上VideoRAE刷新SOTA:离散40、连续93
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。


原论文信息如下:
论文标题:
VIDEORAE: TAMING VIDEO FOUNDATION MODELS FOR GENERATIVE MODELING VIA REPRESENTATION AUTOENCODERS
发表日期: 2026年07月
发表单位: The Chinese University of Hong Kong, Shenzhen / Huazhong University of Science and Technology / Shenzhen Loop Area Institute / University of Science and Technology of China
原文链接: https://arxiv.org/pdf/2607.14088v1.pdf

论文认为当前视频自编码器面临哪些挑战?

视频生成这件事,表面上看是“把画面做出来”,本质上却先得解决一个更难的问题:把视频压缩成一个既省算力、又不丢语义、还适合生成模型处理的潜空间。这一步要是做歪了,后面的扩散模型或者自回归模型就只能在一堆“压扁了的垃圾信息”上硬学,结果不是糊,就是慢,或者两者兼有。
论文把现有视频自编码器的核心问题说得很直白:传统3D-VAE(3D Variational Autoencoder,三维变分自编码器)大多还是围着像素重建打转,训练目标主要是像素级均方误差和对抗损失。这样做的结果是,模型确实会盯着局部纹理、颜色和边缘,但对语义结构、长时序关系、物理运动逻辑的关注明显不够。简单说,就是“画得像”不等于“懂得对”。
更麻烦的是,视频比图像更难压缩。图像压缩还能靠空间冗余偷点懒,视频则同时有空间和时间两层冗余,还要面对更严格的压缩率要求。传统3D-VAE一边要把视频压得足够小,一边又要保住细节,最后常常陷入两难:潜空间太“紧”,语义丢得多;潜空间太“松”,下游生成器又要背着一大包负担跑步。论文的判断很清楚:旧式视频tokenizer更像是为重建服务,不是为生成服务
图1:传统视频tokenizer与VideoRAE的概念对比
图1:传统视频tokenizer与VideoRAE的概念对比。前者从头训练,主要受像素级损失牵着走;后者直接拿冻结的视频基础模型做编码核心,把语义更强的表示改造成可重建、可生成的统一潜空间。
这也是VideoRAE要解决的真实痛点:能不能把“只会理解”的视频基础模型,直接改造成“既能重建、又能生成”的视频潜空间底座。如果能,这就不是对旧方法的小修小补,而是把视频表示学习和生成建模之间那堵墙,往下拆了一大块。

VideoRAE的核心创新是什么?

VideoRAE的思路其实很“反常识”:不是继续把视频编码器从零训练成一个更会压缩的VAE,而是直接站在冻结的视频基础模型肩膀上,做一层Representation Autoencoder,表示自编码器。这里的关键不在“自编码器”三个字,而在“表示”二字——编码器不再追求把像素压到极致,而是把基础模型已经学到的高层语义、时序结构和多尺度信息,重新组织成生成友好的潜空间。
它的核心创新可以概括成三件事。第一,用冻结的视频基础模型提特征,避免从头学编码器时过度偏向像素细节。第二,用轻量1D self-attention projector(1D自注意力投影器)压缩冗余时空序列,把巨长的视频token序列压成紧凑的基础token。第三,用局部-全局表示对齐目标 REPA(Representation Alignment,表示对齐)替代传统KL正则,让潜空间在语义结构上保持“长得像老师”,而不是硬往标准高斯里塞。
这套设计最有意思的地方,是它没有把连续生成和离散生成当成两套互不相干的系统,而是统一在同一个框架里:连续latent给扩散Transformer(DiT,Diffusion Transformer,扩散Transformer)用,离散latent给自回归模型用。换句话说,VideoRAE不是只给某一种生成器铺路,而是直接修了一条“视频生成高速公路”。
图2:VideoRAE整体架构
图2:VideoRAE整体架构。输入视频先经过冻结的视频基础模型提取多层级特征,再由1D自注意力投影器压缩成紧凑基础token,随后分成连续latent或离散latent两条路线,最后通过带表示对齐的解码器还原视频。
如果用一句大白话概括,VideoRAE做的事就是:把“会看视频”的大模型,改造成“会给生成模型递好作业”的潜空间老师。这比单纯追求更低的重建误差,方向上更对生成任务的胃口。

冻结的视频基础模型具体如何被利用?

这里的“冻结”不是摆设,而是VideoRAE整个方法成立的前提。论文选用V-JEPA 2和VideoMAEv2这类视频基础模型作为编码器,先从浅层到深层提取多尺度层级特征,再把这些特征做元素级求和融合。这样做的好处很直接:浅层保留局部运动和细节,深层提供更抽象的语义和物理结构,合在一起就比只拿最后一层特征更完整。
但基础模型的特征通常很长、很密、很贵。视频token一旦铺开,序列长度会非常夸张,直接拿去做生成,算力先被拖垮。于是VideoRAE在编码器后面加了一个轻量的1D self-attention projector,它不是再去学习复杂的三维卷积堆叠,而是专门做一件事:在保留全局依赖的前提下,把冗余的时空表示压缩成少量基础token。这一步非常像把一整本小说压成提纲,不能乱删,但必须足够短。
更关键的是解码端。VideoRAE没有只靠像素重建来“猜回去”,而是在解码器中引入REPA,让解码器的中间特征和冻结VFM教师的高层特征对齐。这里的REPA分成局部和全局两部分:局部对齐强调细粒度结构不跑偏,全局对齐强调整体语义和时序布局别散架。论文把这种约束看作一种隐式正则,效果上相当于告诉解码器:别只顾着抠像素,先把老师的语义骨架学明白。
图4:连续空间重建可视化
图4:连续空间重建可视化。可以看到,VideoRAE在保持画面细节的同时,也尽量维持了动作与场景的整体结构,这说明冻结视频基础模型提取到的表示并没有把重建能力“搞丢”。
这里还有一个很工程化的点值得注意:传统3D-VAE常常要靠KL散度把latent往标准高斯上拽,VideoRAE则认为这种硬拽会伤表达能力。它用表示对齐来维持潜空间几何结构,等于把“分布规训”换成了“语义约束”。这不是偷懒,而是承认视频生成最重要的不是latent看起来多规整,而是它能不能让下游生成器学得更顺。

VideoRAE如何支持不同类型的生成模型?

VideoRAE最“讨喜”的地方,是它没有把自己锁死在某一种生成范式里。连续生成和离散生成,本来是两套脾气完全不同的系统:前者喜欢平滑、连续、可微的latent,后者需要一串离散token来做自回归预测。VideoRAE把同一套基础表示,分别整理成两种格式,直接兼容这两类主流生成器。
对于扩散Transformer(DiT),VideoRAE走的是连续latent路线。基础token先经过线性投影,变成较低维但仍保持语义结构的连续表示。论文强调,这里不再强行加KL正则,因为REPA已经在语义层面把空间结构“扶正”了。这个设计的结果,是latent既足够紧凑,又不会像某些VAE那样为了规整把细节磨平。
对于自回归模型,VideoRAE则采用Multi-Codebook SimVQ(多码本SimVQ)。这里的逻辑很朴素:既然高维语义不容易塞进单一码本,那就把通道维度切成多个子块,每个子块单独量化。SimVQ的做法比普通VQ更稳,它不是直接优化码本向量,而是先用可学习的MLP把冻结的基础码本映射到目标空间,再做最近邻搜索。这样既能保住码本表达力,又能降低码本塌缩的风险。
这套离散化策略的意义不只是“能不能量化”,而是“能不能量化得不太蠢”。视频基础模型抽出来的表示本来就复杂,如果硬压成低维离散token,很容易把动作、场景和时序关系一起压扁。多码本的好处,就是在保持整体高维容量的同时,把量化难度拆散,避免一个码本扛全部压力。
图3:UCF-101上的离散token重建可视化
图3:UCF-101上的离散token重建可视化。离散表示虽然更难做高保真重建,但VideoRAE仍然能把主体动作和关键视觉结构保留下来,说明多码本量化没有把语义压碎。
从系统角度看,VideoRAE其实是在做一件很实用的事:同一套视频表示,既能给DiT喂连续latent,也能给AR模型喂离散token。这意味着它不是一个只适合单一论文设定的“定制零件”,而是更接近通用的视频压缩接口。

实验效果如何验证其有效性?

这篇论文最有说服力的地方,不是概念讲得漂亮,而是实验设计确实围着核心问题来:冻结的视频基础模型,究竟能不能同时做好重建和生成。论文没有只盯一个指标,而是同时看重建质量、生成质量、收敛速度,以及在文本到视频任务中的稳定性,这样才比较接近真实使用场景。
表1:离散tokenizer在UCF-101和TokenBench上的重建性能
表1:离散tokenizer在UCF-101和TokenBench上的重建性能。VideoRAE在离散重建上明显强于传统tokenizer,尤其是V-JEPA 2版本的rFVD表现很亮眼,说明语义驱动的离散表示并没有牺牲重建能力。
表2:连续自编码器在UCF-101和TokenBench上的重建性能
表2:连续自编码器在UCF-101和TokenBench上的重建性能。VideoRAE在一个非常紧凑的latent瓶颈下,依然保持了有竞争力的PSNR、LPIPS和rFVD,说明“压得小”和“做得好”并不是完全对立的。
从重建结果看,VideoRAE在离散和连续两条路线上都站住了脚。离散侧,VideoRAE在UCF-101和TokenBench上都刷新或逼近最好成绩,尤其是rFVD显著降低,说明时序质量更稳。连续侧,VideoRAE在较小瓶颈下仍能保持不错的感知质量和结构恢复能力,和一些更“重”的VAE相比并不吃亏,甚至在某些指标上更均衡。这里最值得注意的是:VideoRAE不是靠把latent做大来换结果,而是在紧凑表示下把语义组织得更好
表3:UCF-101上离散AR类生成评估
表3:UCF-101上离散AR类生成评估。VideoRAE在自回归生成中拿到很强的gFVD结果,而且是在更少token、更小生成器的条件下完成的,这点很有工程价值。
表4:UCF-101上连续DiT类生成评估
表4:UCF-101上连续DiT类生成评估。连续latent版本同样表现强势,说明REPA和KL-free设计确实让扩散模型更容易在这个潜空间里训练。
图5:UCF-101上的离散token生成结果
图5:UCF-101上的离散token生成结果。生成画面整体更完整,动作轮廓和主体语义更清楚,说明离散token并没有因为压缩而变得“词不达意”。
图6:UCF-101上的连续空间生成结果
图6:UCF-101上的连续空间生成结果。连续latent版本在细节和整体一致性之间取得了较好平衡,视觉上比较像“能用、好用、还不太费劲”的那种方案。
这个结果最让人眼前一亮的地方,是它不只是“重建好”,而且“生成也快”。论文给出的训练收敛图显示,AR和DiT两条路线都比对照自编码器更快收敛;在2B规模的文生视频实验里,把LTX-VAE换成VideoRAE后,训练也更快稳定下来,VBench表现更好。换句话说,VideoRAE不只是把潜空间做得更聪明,还把下游模型的学习难度一起降了下来。
图7:AR与DiT生成建模的收敛速度对比
图7:AR与DiT生成建模的收敛速度对比。VideoRAE在两种生成范式下都更快收敛,说明其latent对下游优化更友好。
图8:VideoRAE与LTX-VAE在VBench上的收敛对比
图8:VideoRAE与LTX-VAE在VBench上的收敛对比。替换后收敛更快、效果更稳,说明VideoRAE在真实的大模型训练管线里不是“实验室玩具”。

VideoRAE有哪些局限性?

VideoRAE虽然思路漂亮,但也不是“把基础模型一接上就天下无敌”。第一,它依赖高质量的视频基础模型,编码器本身越强,效果往往越稳;这意味着方法的上限和基础模型预训练能力强相关。第二,论文的核心验证主要还是围绕UCF-101、TokenBench和VideoUFO这类数据集展开,面对更复杂、更长时序、更开放域的视频场景,泛化能力还需要进一步检验。
第三,VideoRAE虽然把离散和连续两条路线都打通了,但这也意味着系统复杂度不低:要处理多尺度特征聚合、1D投影压缩、连续/离散两套latent格式、REPA对齐,以及不同生成器的适配。对研究来说这很优雅,对落地来说则意味着工程链路不短。第四,离散侧的多码本SimVQ虽然缓解了量化瓶颈,但码本规模、子码本数量和latent维度怎么选,仍然会影响训练稳定性和算力成本。
所以更准确的判断应该是:VideoRAE证明了冻结视频基础模型可以成为很强的视频生成底座,但它还不是一个“随便换个场景就能直接商用”的终局方案。它更像是把方向走通了,接下来要做的是把适配范围、稳定性和成本进一步打磨。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“视频生成前,潜空间怎么做才更适合生成”这个老大难问题。VideoRAE证明了冻结的视频基础模型不只是理解工具,也能被改造成高质量的视频自编码器底座。

REPA和KL正则是什么关系?REPA是Representation Alignment,中文是表示对齐;KL正则是传统VAE里把latent往标准高斯分布拉的约束。VideoRAE认为,只要语义结构对齐得足够好,KL就不一定非加不可。

为什么它既能给扩散模型用,也能给自回归模型用?因为VideoRAE把同一套基础表示做了两种格式化:连续latent给DiT用,离散token给AR模型用。前者靠线性投影,后者靠多码本SimVQ量化,底层语义来源是同一套冻结VFM特征。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是简单堆模块,而是把冻结视频基础模型正式拉进了视频生成底座这条主线,方向感很强。

实验合理度:★★★★☆ 同时做重建、生成、收敛速度和文本到视频替换实验,验证链条比较完整,且和方法设计对应得上。

学术研究价值:★★★★★ 证明“理解型视频基础模型”可以服务生成任务,这个结论对表示学习和生成建模都有启发。

稳定性:★★★☆☆ 结果不错,但依赖基础模型质量和多模块协同,离大规模稳定落地还有一段路。

适应性以及泛化能力:★★★☆☆ 在UCF-101、TokenBench和2B文生视频里有效,但更开放、更长视频场景还需要继续验证。

硬件需求及成本:★★★☆☆ 冻结编码器和多码本设计都不算轻,训练成本不低,不过收敛更快能部分抵消代价。

复现难度:★★★☆☆ 思路清晰,但涉及VFM、DiT、AR、多码本和REPA,多组件组合对复现环境要求较高。

产品化成熟度:★★★☆☆ 作为视频生成底座很有潜力,但还更像高水平研究原型,离通用产品化还差工程打磨。

可能的问题:方法很强,但系统偏复杂,且效果与基础模型强相关;如果后续没有更广泛场景验证,容易停留在“漂亮论文”层面。


主要参考文献

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang. VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders. arXiv:2607.14088v1, 2026.
原文链接:https://arxiv.org/pdf/2607.14088v1.pdf
论文中提到的核心基础模型包括 V-JEPA 2 与 VideoMAEv2;相关生成框架包括 DiT 与自回归 Transformer。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。