各位朋友,今天聊一篇来自 Google DeepMind 的新工作:Recurrent Video Masked Autoencoders,简称 RVM。要说这篇文章为什么值得读,得先讲一个困扰视频自监督学习很久的"偏科"问题。
过去几年,视频自监督表示学习基本被两大家族瓜分。一派是以 VideoMAE 为代表的掩码自编码器路线,把视频切成时空 patch,随机遮掉一大块,然后让模型从剩下的像素里把遮住的部分重建出来。另一派是以 V-JEPA 为代表的联合嵌入预测架构(JEPA),不走像素重建的路子,而是在隐空间里预测未来状态,靠架构和训练技巧防止表征坍塌。这两派都能学到不错的视频特征,在动作识别、时序理解这些任务上表现出色,但它们有一个共同点:把时间当作一个均匀、对称的维度来处理。无论是掩码策略还是注意力机制,视频模型对每一帧都一视同仁,没有因果方向的概念。
这种设计带来一个结果:离线分块处理,只能看短视频片段,没法在长序列上保持一致的表示。更要命的是,这类视频模型学到的特征在空间任务上很弱——比如在 VIP 人体部件跟踪上,VideoMAE 的 mIoU 甚至不到 20,而一个纯图像模型 DINOv2 能到 40 以上。反过来,DINOv2 这种图像模型虽然空间特征强,但它压根不懂运动。在需要运动信息的任务上就露馅了:点跟踪任务上 DINOv2 只有 36.6,而视频模型普遍能到 70 以上。
所以现状就是:视频模型"看得懂动作"但"看不清结构",图像模型"看得清结构"但"看不懂动作"。DeepMind 这篇工作的目标很明确——把两者统一起来。而他们的做法也很有意思:不是继续堆更大的模型、更复杂的训练技巧,而是把"循环"这个概念请了回来。
由于这是一篇相对较新的论文,咱们先从核心设计看起,把 RVM 的整个思路拆开捋一捋。
上半部分:方法概述与核心原理
RVM 的整体架构如图 2 所示。它的核心思路可以概括成三句话:逐帧编码,循环聚合,未来重建。输入视频时,每一帧先被一个 ViT 编码器独立处理成一组 token,然后这组 token 被送进一个基于 Transformer 的循环神经网络(RNN)核心。这个 RNN 核心维护一个跨时间步传递的隐状态,每一帧的 token 进来后会和上一时刻的状态做交互,更新出新的状态。这个新状态就是当前帧的特征表示。
训练时,模型会额外采样一个目标帧,这个目标帧来自未来——具体来说,距离最后一个源帧 4 到 48 帧之间随机采样,对应真实时间大约是 0.15 到 10 秒。这个目标帧会被以 95% 的比例随机掩码,然后喂给同一个编码器,最后用一个交叉注意力解码器,以源帧特征为条件去重建被遮住的目标帧。训练目标非常简单:L2 像素重建损失。
这种"用过去预测未来"的思路其实并不新鲜,SiamMAE 早就用过类似的不对称掩码设计。但 SiamMAE 训练的本质上还是一个图像编码器,它把源帧和目标帧当作两张独立的图来处理,无法真正捕捉视频的时空依赖。RVM 的关键区别在于引入了循环结构——信息可以在时间维度上持续流动和累积,而不是每次从零开始。
视频理解新突破:循环掩码自编码器如何统一时空特征
图1 归一化任务性能。上图展示RVM在视频任务和图像任务上均达到帕累托前沿;下图展示RVM弥合了强空间模型与强视频模型之间的鸿沟。
回到方法细节。整个 RVM 由几个模块组成:Tokenization 与掩码、编码器、循环核心、解码器。咱们逐个拆开看。
Tokenization 部分没有太多新鲜的。每一帧图像被切成 16×16 的非重叠 patch,经过一个可学习的线性投影变成 embedding,然后展开成 token 序列。这里需要注意的是,所有帧(包括源帧和目标帧)共享同一套投影权重。位置编码用的是傅里叶位置编码(Fourier positional encodings),加在 token 上。目标帧的 token 按照 95% 的掩码率随机遮掉,只留下 5% 的可见 token,另外在源帧和目标帧的序列上都拼接一个可学习的 [CLS] token。
编码器用的就是标准的 ViT,pre-norm 结构,没有 dropout。所有帧共享编码器权重。每个源帧独立过编码器得到输出,目标帧的可见 token 也过同一个编码器。
接下来是这篇文章最核心的模块——循环核心。作者把这个模块称为"Transformer + GRU"的混合体。它的想法是:用 GRU 的门控机制来控制信息流,用 Transformer 的注意力来做 token 之间的交互。具体来说,当前帧的编码输出作为查询(query),上一时刻的状态经过 reset gate 调制后作为键(key)和值(value),送入一个 Transformer 块做交叉注意力和自注意力。update gate 决定新信息和旧状态各保留多少。整个过程可以用图2和下面这组公式描述:

图2 RVM架构总览。模型按顺序编码输入视频的源帧,每帧独立经ViT编码后,由基于Transformer的RNN循环聚合生成特征序列。训练时从未来随机采样目标帧,掩码后经同一ViT编码,用交叉注意力解码器重建目标帧,以L2损失优化。
u_t = σ(W_e^u · ê_t + W_s^u · s_{t-1})
r_t = σ(W_e^r · ê_t + W_s^r · s_{t-1})
ĥ_t = Tx(q = ê_t, kv = r_t ⊙ s_{t-1})
s_t = (1 - u_t) ⊙ s_{t-1} + u_t ⊙ ĥ_t
o_t = s_t
这里 σ 是 sigmoid 函数,Tx 代表一个多层 Transformer 块,W 矩阵作用在特征维度上且在所有 token 间共享。初始状态 s₀ 设为零。最终每个时间步的输出 o_t 就作为下游任务的特征。整个循环结构让模型可以一边看新的帧,一边决定要记住什么、忘掉什么、更新什么——就像人看视频一样,信息是随着时间逐步累积的。
解码器只在训练时使用。它的结构参考了 SiamMAE:每个解码器块由三部分组成,先是交叉注意力(目标 token 作为查询,源帧 token 拼接后作为键和值),然后是一个前馈 MLP,最后是自注意力。被掩码的位置用可学习的 [MASK] token 填补,并按原来的网格位置排列,加上傅里叶位置编码后送入解码器。最后解码器输出被投影回 patch 维度并reshape成图像,和原始目标帧计算 L2 损失。这里没有用任何 patch 级别的归一化,就是这么简单粗暴。
整个训练过程的计算流也比较清晰:4 个连续的源帧逐帧过编码器,得到 4 组 token 后依序送入循环核心做时间聚合;目标帧单独采样,95% 掩码后过编码器和解码器。训练用的是 8.4M 视频片段的混合数据集,包含 HowTo100M、Kinetics700、SSv2、YTBB 和 YT8M,没有额外的数据筛选。模型输入分辨率是 256×256,全局批大小 2048,共训练 100 万步(约 20 亿个样本),分布在 256 块 TPU-v6 上。优化器是 AdamW,带余弦学习率衰减和 warm-up。所有模型从头训练,没有用任何蒸馏技巧。
模型规模方面,RVM 有 S/B/L/H 四个版本。以小模型 RVM-S 为例,ViT 编码器是 embedding 维度 384、12 层、6 头,RNN 核心是 4 层 8 头,总参数量 34M。最大模型 RVM-H 总参数 743M,其中 ViT 编码器 32 层、embedding 维度 1280,RNN 核心 4 层 16 头。对比一下,DINOv2-g 有 1.1B 参数,VideoMAEv2-g 也有 1B 参数——RVM-H 只有它们的 60% 左右。
下半部分:实验结果与龙哥点评
实验部分,论文在两类任务上做了全面评估。第一类是时空任务(spatio-temporal),需要模型同时理解空间语义和运动信息,包括 Something-Something v2 动作识别、Kinetics 动作识别、Waymo 开放数据集目标跟踪、Perception Test 点跟踪。第二类是纯空间任务(spatial),主要考验逐帧提取稠密几何特征的能力,包括 ScanNet 深度估计、DAVIS-2017 视频目标分割、JHMDB 人体关键点跟踪、VIP 人体部件跟踪。评估协议上,识别类任务用冻结编码器加训练好的注意力读出头,对应关系类任务用最近邻标签传播。
先看大模型的结果,如表 1 所示。4DS-L、VideoMAE-L、V-JEPA2-L 这几个视频模型在 SSv2 上能到 60-67,但到 VIP 人体部件跟踪上就崩溃了——VideoMAE-L 只有 18.9 mIoU,V-JEPA2-L 只有 17.2,4DS 甚至直接没报。反过来 DINOv2-L 在 VIP 上能做到 40.6,在 DAVIS 上也达到 61.7,但它的点跟踪只有 36.6,SSv2 只有 52.2。这就很能说明问题了:现有模型各有各的"死穴"。

图3b ScanNet深度估计评估示例

图3c Perception Test点跟踪评估示例

图3d Waymo Open目标跟踪评估示例

图3e DAVIS和VIP分割跟踪评估示例

图3f JHMDB关键点跟踪评估示例
再看 RVM。RVM-L 在 SSv2 上 66.7,和顶级视频模型基本持平;在 VIP 上做到 38.0,把 VideoMAE-L 的 18.9 直接翻了一倍;在 ScanNet 深度估计上做到 0.91 的 AbsRel,是所有视频模型里最好的,甚至超过了 DINOv2-L 的 1.02。是每一项都第一吗?不是。但它是唯一一个在全部 8 项任务上都没有明显短板的模型。论文用"归一化平均分"来量化这种均衡性:把每个任务上所有模型的得分除以该任务最高分,再取平均。RVM-L 拿到 94.4,RVM-H 拿到 94.9,比 VideoMAE-H(83.5)、V-JEPA2-H(77.9)、DINOv2-g(85.0)高出 10 个百分点以上。这才是真正的"通吃"——不是偏科状元,而是全科优等生。
从SiamMAE到RVM:时间不对称性的架构创新
GRU+Transformer:循环核心如何高效聚合时序信息
一个模型通吃8大任务:RVM的通用视觉能力
无需蒸馏的小模型奇迹:30倍参数效率提升
长期特征稳定性:循环架构的独特优势
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出一种结合非对称掩码目标与基于Transformer的循环神经网络(GRU)的视频表示学习方法,通过像素重建损失训练,实现高效的时间信息聚合与通用视觉特征学习。实验合理度:★★★★☆
SSv2和Kinetics的Top-1准确率、ScanNet的绝对相对误差(AbsRel)、Perception Test的平均Jaccard(AJ)、Waymo的mIoU、DAVIS的J&F均值、JHMDB的PCK@0.学术研究价值:★★★★☆
提出一种结合非对称掩码目标与基于Transformer的循环神经网络(GRU)的视频表示学习方法,通过像素重建损失训练,实现高效的时间信息聚合与通用视觉特征学习;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
RVM的推理延迟随帧数线性增长,而传统视频模型(如VideoMAE)使用全时空自注意力,延迟随帧数二次方增长。具体FLOPs数值未在论文中明确给出。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1) 对短序列计算开销较大;(2) 训练时需通过时间反向传播,内存占用高;(3) 尚未找到数据饱和点,需要更多数据持续提升。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!