← 返回 PaperDaily 视觉与图像

告别偏科!DeepMind视频模型首次兼顾动作与结构双能力

视频模型看懂动作却丢了空间结构,图像模型擅长几何却不懂运动——DeepMind用一套循环掩码自编码器RVM把两边的好处全占了,只靠像素重构损失,小模型还不需要蒸馏,参数效率最高领先30倍。这事儿有点意思,值得花三分钟读一读。

告别偏科!DeepMind视频模型首次兼顾动作与结构双能力
原论文信息如下:
论文标题:
Recurrent Video Masked Autoencoders
发表日期:
2025年12月
发表单位:
Google DeepMind
原文链接:
https://arxiv.org/pdf/2512.13684.pdf
项目链接:
https://rvm-paper.github.io

各位朋友,今天聊一篇来自 Google DeepMind 的新工作:Recurrent Video Masked Autoencoders,简称 RVM。要说这篇文章为什么值得读,得先讲一个困扰视频自监督学习很久的"偏科"问题。

过去几年,视频自监督表示学习基本被两大家族瓜分。一派是以 VideoMAE 为代表的掩码自编码器路线,把视频切成时空 patch,随机遮掉一大块,然后让模型从剩下的像素里把遮住的部分重建出来。另一派是以 V-JEPA 为代表的联合嵌入预测架构(JEPA),不走像素重建的路子,而是在隐空间里预测未来状态,靠架构和训练技巧防止表征坍塌。这两派都能学到不错的视频特征,在动作识别、时序理解这些任务上表现出色,但它们有一个共同点:把时间当作一个均匀、对称的维度来处理。无论是掩码策略还是注意力机制,视频模型对每一帧都一视同仁,没有因果方向的概念。

这种设计带来一个结果:离线分块处理,只能看短视频片段,没法在长序列上保持一致的表示。更要命的是,这类视频模型学到的特征在空间任务上很弱——比如在 VIP 人体部件跟踪上,VideoMAE 的 mIoU 甚至不到 20,而一个纯图像模型 DINOv2 能到 40 以上。反过来,DINOv2 这种图像模型虽然空间特征强,但它压根不懂运动。在需要运动信息的任务上就露馅了:点跟踪任务上 DINOv2 只有 36.6,而视频模型普遍能到 70 以上。

所以现状就是:视频模型"看得懂动作"但"看不清结构",图像模型"看得清结构"但"看不懂动作"。DeepMind 这篇工作的目标很明确——把两者统一起来。而他们的做法也很有意思:不是继续堆更大的模型、更复杂的训练技巧,而是把"循环"这个概念请了回来。

由于这是一篇相对较新的论文,咱们先从核心设计看起,把 RVM 的整个思路拆开捋一捋。


上半部分:方法概述与核心原理

RVM 的整体架构如图 2 所示。它的核心思路可以概括成三句话:逐帧编码,循环聚合,未来重建。输入视频时,每一帧先被一个 ViT 编码器独立处理成一组 token,然后这组 token 被送进一个基于 Transformer 的循环神经网络(RNN)核心。这个 RNN 核心维护一个跨时间步传递的隐状态,每一帧的 token 进来后会和上一时刻的状态做交互,更新出新的状态。这个新状态就是当前帧的特征表示。

训练时,模型会额外采样一个目标帧,这个目标帧来自未来——具体来说,距离最后一个源帧 4 到 48 帧之间随机采样,对应真实时间大约是 0.15 到 10 秒。这个目标帧会被以 95% 的比例随机掩码,然后喂给同一个编码器,最后用一个交叉注意力解码器,以源帧特征为条件去重建被遮住的目标帧。训练目标非常简单:L2 像素重建损失。

这种"用过去预测未来"的思路其实并不新鲜,SiamMAE 早就用过类似的不对称掩码设计。但 SiamMAE 训练的本质上还是一个图像编码器,它把源帧和目标帧当作两张独立的图来处理,无法真正捕捉视频的时空依赖。RVM 的关键区别在于引入了循环结构——信息可以在时间维度上持续流动和累积,而不是每次从零开始。

视频理解新突破:循环掩码自编码器如何统一时空特征

图1 RVM在不同任务上的性能对比

图1 归一化任务性能。上图展示RVM在视频任务和图像任务上均达到帕累托前沿;下图展示RVM弥合了强空间模型与强视频模型之间的鸿沟。

回到方法细节。整个 RVM 由几个模块组成:Tokenization 与掩码、编码器、循环核心、解码器。咱们逐个拆开看。

Tokenization 部分没有太多新鲜的。每一帧图像被切成 16×16 的非重叠 patch,经过一个可学习的线性投影变成 embedding,然后展开成 token 序列。这里需要注意的是,所有帧(包括源帧和目标帧)共享同一套投影权重。位置编码用的是傅里叶位置编码(Fourier positional encodings),加在 token 上。目标帧的 token 按照 95% 的掩码率随机遮掉,只留下 5% 的可见 token,另外在源帧和目标帧的序列上都拼接一个可学习的 [CLS] token。

编码器用的就是标准的 ViT,pre-norm 结构,没有 dropout。所有帧共享编码器权重。每个源帧独立过编码器得到输出,目标帧的可见 token 也过同一个编码器。

接下来是这篇文章最核心的模块——循环核心。作者把这个模块称为"Transformer + GRU"的混合体。它的想法是:用 GRU 的门控机制来控制信息流,用 Transformer 的注意力来做 token 之间的交互。具体来说,当前帧的编码输出作为查询(query),上一时刻的状态经过 reset gate 调制后作为键(key)和值(value),送入一个 Transformer 块做交叉注意力和自注意力。update gate 决定新信息和旧状态各保留多少。整个过程可以用图2和下面这组公式描述:

图2 RVM整体架构图

图2 RVM架构总览。模型按顺序编码输入视频的源帧,每帧独立经ViT编码后,由基于Transformer的RNN循环聚合生成特征序列。训练时从未来随机采样目标帧,掩码后经同一ViT编码,用交叉注意力解码器重建目标帧,以L2损失优化。

u_t = σ(W_e^u · ê_t + W_s^u · s_{t-1})
r_t = σ(W_e^r · ê_t + W_s^r · s_{t-1})
ĥ_t = Tx(q = ê_t, kv = r_t ⊙ s_{t-1})
s_t = (1 - u_t) ⊙ s_{t-1} + u_t ⊙ ĥ_t
o_t = s_t

这里 σ 是 sigmoid 函数,Tx 代表一个多层 Transformer 块,W 矩阵作用在特征维度上且在所有 token 间共享。初始状态 s₀ 设为零。最终每个时间步的输出 o_t 就作为下游任务的特征。整个循环结构让模型可以一边看新的帧,一边决定要记住什么、忘掉什么、更新什么——就像人看视频一样,信息是随着时间逐步累积的。

解码器只在训练时使用。它的结构参考了 SiamMAE:每个解码器块由三部分组成,先是交叉注意力(目标 token 作为查询,源帧 token 拼接后作为键和值),然后是一个前馈 MLP,最后是自注意力。被掩码的位置用可学习的 [MASK] token 填补,并按原来的网格位置排列,加上傅里叶位置编码后送入解码器。最后解码器输出被投影回 patch 维度并reshape成图像,和原始目标帧计算 L2 损失。这里没有用任何 patch 级别的归一化,就是这么简单粗暴。

整个训练过程的计算流也比较清晰:4 个连续的源帧逐帧过编码器,得到 4 组 token 后依序送入循环核心做时间聚合;目标帧单独采样,95% 掩码后过编码器和解码器。训练用的是 8.4M 视频片段的混合数据集,包含 HowTo100M、Kinetics700、SSv2、YTBB 和 YT8M,没有额外的数据筛选。模型输入分辨率是 256×256,全局批大小 2048,共训练 100 万步(约 20 亿个样本),分布在 256 块 TPU-v6 上。优化器是 AdamW,带余弦学习率衰减和 warm-up。所有模型从头训练,没有用任何蒸馏技巧。

模型规模方面,RVM 有 S/B/L/H 四个版本。以小模型 RVM-S 为例,ViT 编码器是 embedding 维度 384、12 层、6 头,RNN 核心是 4 层 8 头,总参数量 34M。最大模型 RVM-H 总参数 743M,其中 ViT 编码器 32 层、embedding 维度 1280,RNN 核心 4 层 16 头。对比一下,DINOv2-g 有 1.1B 参数,VideoMAEv2-g 也有 1B 参数——RVM-H 只有它们的 60% 左右。


下半部分:实验结果与龙哥点评

实验部分,论文在两类任务上做了全面评估。第一类是时空任务(spatio-temporal),需要模型同时理解空间语义和运动信息,包括 Something-Something v2 动作识别、Kinetics 动作识别、Waymo 开放数据集目标跟踪、Perception Test 点跟踪。第二类是纯空间任务(spatial),主要考验逐帧提取稠密几何特征的能力,包括 ScanNet 深度估计、DAVIS-2017 视频目标分割、JHMDB 人体关键点跟踪、VIP 人体部件跟踪。评估协议上,识别类任务用冻结编码器加训练好的注意力读出头,对应关系类任务用最近邻标签传播。

先看大模型的结果,如表 1 所示。4DS-L、VideoMAE-L、V-JEPA2-L 这几个视频模型在 SSv2 上能到 60-67,但到 VIP 人体部件跟踪上就崩溃了——VideoMAE-L 只有 18.9 mIoU,V-JEPA2-L 只有 17.2,4DS 甚至直接没报。反过来 DINOv2-L 在 VIP 上能做到 40.6,在 DAVIS 上也达到 61.7,但它的点跟踪只有 36.6,SSv2 只有 52.2。这就很能说明问题了:现有模型各有各的"死穴"。

图3b 深度估计示例

图3b ScanNet深度估计评估示例

图3c 点跟踪示例

图3c Perception Test点跟踪评估示例

图3d 目标跟踪示例

图3d Waymo Open目标跟踪评估示例

图3e 分割跟踪示例

图3e DAVIS和VIP分割跟踪评估示例

图3f 关键点跟踪示例

图3f JHMDB关键点跟踪评估示例

再看 RVM。RVM-L 在 SSv2 上 66.7,和顶级视频模型基本持平;在 VIP 上做到 38.0,把 VideoMAE-L 的 18.9 直接翻了一倍;在 ScanNet 深度估计上做到 0.91 的 AbsRel,是所有视频模型里最好的,甚至超过了 DINOv2-L 的 1.02。是每一项都第一吗?不是。但它是唯一一个在全部 8 项任务上都没有明显短板的模型。论文用"归一化平均分"来量化这种均衡性:把每个任务上所有模型的得分除以该任务最高分,再取平均。RVM-L 拿到 94.4,RVM-H 拿到 94.9,比 VideoMAE-H(83.5)、V-JEPA2-H(77.9)、DINOv2-g(85.0)高出 10 个百分点以上。这才是真正的"通吃"——不是偏科状元,而是全科优等生。

前面提到,视频模型"看得懂动作"但"看不清结构",图像模型"看得清结构"但"看不懂动作"。RVM 的解法,说穿了就一句话:把时间当成一个需要持续累积的状态,而不是一组被对称看待的帧。
类比一下人是怎么看视频的。人眼扫过连续画面时,并不会把每一帧当成孤立的图片存进大脑,而是带着上一刻的"印象"去理解这一刻的画面。这种印象的持续累积,让人既能认出画面里的物体结构,又能感知到物体在动、在变。RVM 的循环架构(recurrent architecture),本质上就是把这个"印象流"装进了神经网络里——每一帧的特征,都等于当前帧的信息加上前面所有帧的记忆。
这套设计带来一个直观的性能飞跃。上面是 RVM 在 DAVIS-2017 视频分割任务上的效果:从第一帧给定的目标掩码出发,模型在后续帧中持续传播分割结果,即使目标发生形变、遮挡,掩码依然牢牢锁定目标边界,不漂移、不闪烁。这种"盯住一个东西不放"的能力,正是循环结构赐予模型的"时间记忆"。
DAVIS视频分割任务效果演示

从SiamMAE到RVM:时间不对称性的架构创新

要理解 RVM 的架构创新,得先看它的直接灵感来源——SiamMAE。SiamMAE 的训练方式很有意思:给定一个未掩码的"源帧",去重建一个被高度遮挡(95% 掩码)的"目标帧"。这个不对称的掩码设计,迫使模型从"过去"中寻找线索来理解"未来",从而学到跨帧的对应关系。
但 SiamMAE 有一个根本性的局限:它训练出来的本质上还是一个图像编码器。源帧和目标帧只是作为两张独立的图片分别过编码器,时间不对称性只体现在训练目标上,而没有内化到网络结构里。换句话说,它在推理时依然是一帧一帧孤立地提取特征,无法真正捕捉帧与帧之间的动态依赖。
RVM 的演进,就是把"时间不对称性"从训练目标推进到了架构本身。它引入了一个跨时间步传递的循环状态,让每一帧的特征都"长在"前面所有帧的上下文之上。训练时,模型从未来(距离最后一个源帧 4 到 48 帧之间随机采样)选一个目标帧,96% 的区域被遮掉(论文默认掩码率 m=0.95,即保留 5% 的可见 token),然后要求模型用累积的源帧信息去重建它。这样一来,重建任务不再是"看一张图猜另一张图",而是"基于一段时间的观察,预测未来某一刻的样子"——后者显然需要更强的时序推理能力。
这个设计带来的直接好处有两个。其一,训练信号更强:因为目标帧距离源帧较远(时间上),模型不能靠"复制粘贴"周围帧的像素来蒙混过关,必须真正理解场景中物体的运动规律;其二,推理时天然支持在线和流式处理——每来一帧,模型只需要基于已有的循环状态做一次增量更新,而不是像传统视频模型那样积累一批帧后整体重算。这对机器人、自动驾驶这类实时性要求高的场景,意义不言而喻。

GRU+Transformer:循环核心如何高效聚合时序信息

循环核心是整个 RVM 最关键的模块。作者没有直接套用经典的循环神经网络(RNN)单元,而是设计了一个"Transformer + GRU"的混合体。GRU(Gated Recurrent Unit,门控循环单元)负责控制信息流的"增删改查",Transformer 则负责在 token 之间做充分的交互。
GRU核心公式
四个公式,逐行解读。第一行是更新门 u_t,它决定新状态里保留多少"旧记忆"、吸收多少"新信息"——值越接近 1,代表越倾向于用新信息覆盖旧状态。第二行是重置门 r_t,它决定在生成候选状态时,"旧记忆"被重置到什么程度——如果 r_t 接近 0,说明模型认为过去的状态对当前帧的理解帮助不大,可以大胆丢弃。第三行是候选状态 ĥ_t,它把当前帧的编码输出作为查询(query),把重置后的旧状态作为键和值(key/value),送进一个 Transformer 块做交叉注意力和自注意力——这一步让新信息和旧记忆在 token 层面充分融合。第四行是状态更新:旧状态 s_{t-1} 和新候选状态 ĥ_t 按更新门 u_t 做加权平均,得到当前时刻的新状态 s_t。整个流程清晰又优雅——每看一帧,模型就先决定"过去哪些要忘掉",再决定"现在哪些要记住",最后把两者合并成最新的"整体理解"。
为什么不用 LSTM(Long Short-Term Memory,长短期记忆网络)或者纯粹的自注意力?论文里做了消融实验对比 RNN 聚合器和完整自注意力聚合器(两者层数和参数量对齐)。结果非常有意思:在 Something-Something v2(SSv2)动作识别上,RNN 聚合器拿到 52.34%,而完整自注意力只有 49.1%,差距超过 3 个百分点。而且 RNN 的计算量还更低——自注意力的时间复杂度随帧数二次增长,RNN 只随帧数线性增长。换句话说,RNN 聚合器用更少的算力换来了更好的时序建模效果。这在视频任务上是一个很罕见的"既更省、又更好"的结果。
消融实验(b)(c)
同一张消融表里还揭示了另一个规律:训练数据量从 2.5 亿样本增加到 20 亿样本,SSv2 从 46.38% 涨到 57.20%,Kinetics 从 33.84% 涨到 47.70%,ScanNet 深度误差从 1.75 降到 1.20。即便模型只有 3400 万参数,喂更多数据依然持续涨点,没有任何过拟合迹象。这说明 RVM 的数据利用效率相当高,架构的"容量天花板"远没有被顶到。

一个模型通吃8大任务:RVM的通用视觉能力

评估一个视觉编码器强不强,光看一两个任务是不够的。论文搭建了一个横跨"时空任务"和"纯空间任务"的 8 项评测套件:动作识别(SSv2、Kinetics)、目标跟踪(Waymo Open Dataset)、点跟踪(Perception Test)、深度估计(ScanNet)、视频目标分割(DAVIS-2017)、人体关键点跟踪(JHMDB)和人体部件跟踪(VIP)。评估协议也分两类:一类是在冻结编码器上训练一个注意力读出头(readout head)做识别类任务,另一类是用最近邻标签传播做对应类任务——完全不训练任何下游头,直接检验特征本身的质量。
表1 大规模模型实验结果
表 1 的结果非常直观地展示了什么叫"木桶效应"。看看几个对比模型的短板:VideoMAE-L 在 SSv2 上能到 62.7,但 VIP 部件跟踪只有 18.9 mIoU;V-JEPA2-L 在 SSv2 上做到 67.5,VIP 也只有 17.2;DINOv2-L 在 VIP 上能做到 40.6,但点跟踪直接掉到 36.6,SSv2 只有 52.2。每个模型都有自己的"死穴"——要么空间几何能力崩掉,要么运动感知能力失灵。
RVM-L 的成绩单则是另一种画风:SSv2 66.7,VIP 38.0,ScanNet 深度误差 0.91,DAVIS 66.0,点跟踪 77.3。没有一项是 8 个模型里最强的,但每一项都在第一梯队。论文用"归一化平均分"这个指标来量化这种均衡性:把每个任务上所有模型的得分除以该任务最高分,再取平均。RVM-L 拿到 94.4,RVM-H 拿到 94.9,比 VideoMAE-H(83.5)、V-JEPA2-H(77.9)、DINOv2-g(85.0)高出 10 个百分点以上。这才是真正的"通吃"——不是偏科状元,而是全科优等生。

无需蒸馏的小模型奇迹:30倍参数效率提升

如果说表 1 证明了 RVM "上限够高",那么表 2 则证明了它"下限也不低"。论文单独评估了小模型(S 版本,仅 3400 万参数)在 8 项任务上的表现,结论相当震撼:RVM-S 不仅全面碾压同尺寸的 SiamMAE-S 和 4DS-S,甚至在 8 项评估中拿下了 6 项超过 VideoMAE-B(8700 万参数,比 RVM-S 大 2.5 倍)的成绩。看具体的:SSv2 上 RVM-S 59.7% vs VideoMAE-B 52.3%;Kinetics 上 49.6% vs 38.9%;VIP 上 35.9% vs 19.6%。归一化平均分 96.1,比 VideoMAE-B 的 80.4 高出近 16 个百分点。
表2 小模型实验结果
更关键的是,RVM-S 没有使用任何知识蒸馏(knowledge distillation)技巧。蒸馏是当前小模型追赶大模型的主流手段——用一个强大的教师模型来指导小模型训练。DINOv2-S 就是典型的蒸馏产物,它在 ScanNet、JHMDB、VIP 三个空间任务上确实比 RVM-S 更高。但整体来看,RVM-S 的归一化平均分依然压过蒸馏版的 DINOv2-S(96.1 vs 84.4)。这说明循环架构本身已经内化了很强的时序归纳偏置(inductive bias),小模型不需要"抄大模型的作业"也能学到高质量特征。
"30 倍参数效率"这个数字怎么来的?对比表 1 中的巨人选手:VideoMAEv2-g 有 10.13 亿参数,DINOv2-g 有 11.35 亿参数,它们的归一化平均分分别是 77.9 和 85.0。而 RVM-S 只有 3400 万参数,归一化平均分却高达 96.1——参数少约 30 倍,综合性能反而更强。对于算力有限的学术团队和中小公司来说,这个信号极其诱人:也许不需要堆上千亿参数、不需要大规模蒸馏流水线,只需要一个设计得当的循环架构,就能在小模型上拿到极具竞争力的视觉特征。

长期特征稳定性:循环架构的独特优势

视频理解还有一个容易被忽略但极其重要的指标:特征的长期稳定性。很多模型在短视频片段上表现不错,但一旦视频拉长到上百帧,特征就开始"漂移"——同一个物体在视频前段和后段得到的特征不再一致,导致跟踪、分割任务崩溃。
图4 长期特征稳定性对比
图 4 展示了一个在 DAVIS-2017 上的专门测试:只选取长度超过 80 帧的视频,分别看模型在 16、32、48、64、80 帧处的标签传播性能,并归一化到各自 16 帧时的表现。横轴是帧数,纵轴是性能保留率——曲线越平缓,说明特征越稳定。其他模型包括 VideoMAE、V-JEPA2、DINOv2 都在快速下滑,而 RVM 的曲线明显平缓得多。注意一个细节:RVM 训练时只用了 4 帧的源帧窗口,但它却能在 80 帧的长序列上保持稳定的特征传播。这说明循环核心学到的不只是"短时运动",而是一种可持续累积更新的"时间状态"。
图8 延迟对比
图 8 从计算延迟的角度进一步放大了循环架构的优势。传统视频编码器因为要做完整的时空自注意力,延迟随帧数二次方增长——帧数翻倍,延迟变四倍。而 RVM 因为每帧只和上一时刻的隐状态交互,延迟随帧数线性增长,和纯帧级模型(如 DINOv2)一个量级。换句话说,视频越长,RVM 的相对速度优势越明显。这个特性对于理解长视频、机器人实时感知这类场景来说,是实打实的工程红利。
论文里还有一个非常惊艳的白噪声实验,让人忍不住拍案叫绝。他们构造了一个纯白噪声背景上移动的白色噪声方块——也就是说,任何单帧画面都只是一幅纯噪点图,完全没有任何可提取的结构信息。图像模型如 DINO、SiamMAE 面对这种输入直接"瞎了"。但 RVM 通过循环累积多帧的噪声模式,居然能"看到"那个移动的方块,把它从背景中清晰地分离出来!
图6 白噪声方块检测 meng.jpeg
这个实验极其有力地证明了:RVM 的特征里真的蕴含了时间维度的信息——它能捕捉到单帧里完全不存在的运动模式。这种"动态感知"能力,正是空间图像模型和传统视频模型之间最大的鸿沟。此外,RVM 在特征可视化方面也表现出极高的空间一致性。下面的 PCA(主成分分析)图上,颜色渐变自然地沿着物体几何轮廓展开;KMeans 聚类图则清晰地将运动中的车辆与静态背景分开,而且在整个视频片段中保持稳定的类分配,不出现传统视频模型那种"闪烁"式的类别跳跃。
PCA特征可视化演示
这种时空一体的特征,在真实机器人任务上也得到了验证。论文在 LIBERO 机器人操控基准的长期任务套件(LIBERO-10)上,将 RVM 作为冻结的视觉编码器,配合扩散策略(diffusion policy)进行测试。结果显示 RVM 取得了最高的平均成功率。把视频自监督预训练的特征直接搬到机器人操控上还能涨点,这对具身智能领域来说是一个相当大的利好信号。
LIBERO机器人操控实验结果

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?DeepMind提出循环视频掩码自编码器RVM,用Transformer+GRU循环核心替代全时空注意力,仅靠像素重构损失,在动作识别、点跟踪等任务上追平VideoMAE/V-JEPA,同时保留DINOv2级稠密空间特征,小模型无
这篇工作最值得看的点是什么?RVM在视频级任务(动作识别、目标跟踪)上达到与最先进视频模型(VideoMAE、V-JEPA)相当的性能,在需要强几何和密集空间特征的任务上匹配或超过图像模型(DINOv2)。在小型模型规模下,RVM无需知识蒸馏即可获得强性能,参数效率比竞争的视频掩码自编码器高30倍。
这篇工作的边界或风险在哪里?优点:(1) 提出新颖的循环视频掩码自编码器架构,有效建模时间动态;(2) 在多种视觉任务上展现通用性,兼顾时空与空间特征;(3) 小型模型无需蒸馏即可获得强性能,参数效率高;(4) 长时序特征稳定性好,计算复杂度线性增长。缺点:(1) 对短序列计算开销较大;(2) 训练时需通过时间反向传播,内存占用高;(3) 尚未找到数据饱和点,需要更多数据持续提升。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种结合非对称掩码目标与基于Transformer的循环神经网络(GRU)的视频表示学习方法,通过像素重建损失训练,实现高效的时间信息聚合与通用视觉特征学习。

实验合理度:★★★★☆

SSv2和Kinetics的Top-1准确率、ScanNet的绝对相对误差(AbsRel)、Perception Test的平均Jaccard(AJ)、Waymo的mIoU、DAVIS的J&F均值、JHMDB的PCK@0.

学术研究价值:★★★★☆

提出一种结合非对称掩码目标与基于Transformer的循环神经网络(GRU)的视频表示学习方法,通过像素重建损失训练,实现高效的时间信息聚合与通用视觉特征学习;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

RVM的推理延迟随帧数线性增长,而传统视频模型(如VideoMAE)使用全时空自注意力,延迟随帧数二次方增长。具体FLOPs数值未在论文中明确给出。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 对短序列计算开销较大;(2) 训练时需通过时间反向传播,内存占用高;(3) 尚未找到数据饱和点,需要更多数据持续提升。

主要参考文献

[1] Zoran D, Parthasarathy N, Yang Y, et al. Recurrent Video Masked Autoencoders[J]. arXiv preprint arXiv:2512.13684, 2025.
[2] 项目主页: https://rvm-paper.github.io

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频理解江湖风云再起,循环架构强势回归。想第一时间抓住视频自监督学习的新范式、新坑位?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。