← 返回 PaperDaily
视觉与图像
Yann LeCun新作|视频预训练算力暴降20倍,丢掉95%Token反而更强
Yann LeCun参与的最新视频预训练工作,把JEPA家族的防坍塌机制全砍了,只用单一编码器加SIGReg正则,预训练算力直接降到原来的二十分之一,甚至95%的token随机丢掉反而精度更高。视频预训练终于不再是算力大户的专属游戏,这篇值得所有做视觉自监督的读者细读。
龙哥读论文
发布于 2026-09-02 00:20:00
阅读 1
查看原文
原论文信息如下:
视频,一直被认为是学习物理世界表征最自然的素材:它量大管饱、不需要人工标注,还天然带着时间维度的信息——运动、因果、物体恒存性,这些是静态图像给不了的。但问题也出在这里:视频预训练太贵了。
一段视频片段包含的token数量比一张图多一个数量级,而以往的视频自监督方法为了不让模型坍塌,还得额外维护一堆"保险装置":EMA目标编码器、预测器网络、停止梯度操作……这些机制不仅增加了计算开销,还让整个训练流程变得极其复杂。说白了,视频预训练之所以贵,一半贵在数据本身,另一半贵在这些防坍塌的"身外之物"上。
视频预训练的革命:告别复杂启发式
这篇由Yann LeCun参与的最新工作,提出了一个名为LeVJEPA的视频预训练框架,直接把上面的这些"保险装置"全部扔掉了。LeVJEPA的训练目标极其简洁:一个编码器,一个不变性损失,加一个SIGReg正则项。整个目标函数只有一个超参数λ,且在所有实验中固定为0.02,完全不需要调参。听起来简单得有点不像真的,但实验结果表明,这套极简方案在多个基准上不仅追平甚至超越了V-JEPA 2,而预训练算力需求只有后者的5.6到20.8分之一。
LeVJEPA是怎么做到的?核心在于它换了一种防止表征坍塌的思路。传统JEPA方法靠架构不对称性来防坍塌,LeVJEPA则直接对嵌入分布施加约束——SIGReg正则项通过Cramér–Wold定理,把"嵌入分布要匹配各向同性高斯分布"这个高维约束,化成一堆一维投影的正态性检验。任何坍塌解在某个方向上方差为零,与目标分布距离最远,从而被可证明地排除。
LeVJEPA训练框架。从每个视频片段构造一个全局视图(H×W×T)和多个局部视图(h×w×T×V),所有视图共享相同的时间窗口,局部视图额外做裁剪和光度增强。每个视图中95%的patch token被均匀随机丢弃(灰色),只有保留的token进入序列(L×d)。两个视图由同一个共享的块因果编码器E处理,损失只读取每个视图的[cls]嵌入。目标函数用均方误差驱动每个局部[cls]嵌入逼近全局嵌入,梯度同时流过两个分支;SIGReg(右侧)将嵌入批次投影到随机方向(a),通过正态性检验(b)惩罚每个投影偏离标准高斯的程度,将嵌入分布约束为各向同性高斯,从而可证明地排除坍塌。不需要目标编码器、预测器、停止梯度或掩码token重建。
这种设计带来的好处是连锁反应式的。因为不需要目标编码器,也就不需要对完整视频片段做额外的forward pass;因为不需要预测器,也就不存在为预测任务设计的掩码机制。训练每一步的计算量完全由编码器实际观察到的token数量决定——这让"观察多少token"变成了一个可以自由调节的参数,而不是预测任务的一部分。
方法概述:单一编码器如何实现无崩溃学习
LeVJEPA的整体流程可以拆成三个环节:视图构建、编码器前向、损失计算。
首先是视图构建。给定一个视频,LeVJEPA采样16帧作为一个片段,然后构造V+1个视图:一个全局视图,分辨率224×224,不做任何光度变换;V个局部视图,分辨率96×96,经过激进的空间裁剪和光度增强。所有视图共享同一时间窗口,区别只在空间和光度上。这里的设计逻辑是:全局视图是唯一未经光度改变、空间范围最大的视图,天然构成预测目标。
接着是编码器前向。每个视图经过patch embedding层token化,默认每个token对应单帧的一个16×16 patch,不做时间维度的聚合。然后95%的patch token被均匀随机丢弃——注意,是随机丢弃,而不是像VideoMAE那样用tube masking。保留的token加上一个可学习的[cls] token一起送入共享的块因果编码器。[cls] token是唯一的训练信号接收者,patch token不接收任何直接监督。
最后是损失计算。局部视图的[cls]嵌入经过一个小型投影器映射到256维空间,然后与全局视图的[cls]嵌入计算均方误差,让每个局部嵌入都能预测全局嵌入。与此同时,SIGReg正则项约束所有嵌入的分布逼近各向同性高斯分布。投影器在预训练结束后被丢弃,下游任务直接使用编码器的输出表征。
整个可训练架构就编码器和投影器两个组件,没有预测器网络,没有目标编码器,没有停止梯度。唯一的目标超参数λ固定在0.02,所有实验都不调。这种极简性让人不禁感叹:原来视频预训练可以这么干净。
核心原理推导:SIGReg如何可证明地排除坍塌
LeVJEPA防坍塌的数学基础来自SIGReg正则项。整个目标函数可以写成:
其中L_inv是全局视图嵌入z₀与各局部视图嵌入z_v之间的均方误差,梯度同时流过两个分支。单独最小化这个项会得到一个平凡解——编码器输出常数。LeVJEPA的解法不是加停止梯度或目标网络,而是用L_SIGReg把嵌入分布钉在各向同性高斯上。
为什么约束到高斯分布就能防坍塌?有两个层面的原因。第一,Balestriero和LeCun在LeJEPA论文中证明,在温和假设下,各向同性高斯分布唯一地最小化最坏情况下的下游探测风险——也就是说,把嵌入分布约束到各向同性高斯,是在不知道下游任务是什么的情况下最保险的选择。第二,任何坍塌解在某方向上必然零方差,与目标分布距离最远,因此坍塌解在数学上被排除。
但直接在高维空间约束分布计算量太大。SIGReg巧妙地用Cramér–Wold定理把问题降维:嵌入分布匹配N(0, I_K)当且仅当所有一维投影匹配N(0, 1)。于是高维约束变成了一堆一维正态性检验。具体实现时,每步采样M=1024个随机方向,把嵌入批次投影上去,用Epps–Pulley统计量惩罚投影偏离标准高斯的程度。经验特征函数是有界且梯度有界的,让这个损失对异常值稳健,还不需要白化或中心化操作。分布式训练时只需一次all-reduce,通信开销是一个与批次大小和嵌入维度无关的固定大小张量。
这里有个工程细节值得注意:为什么SIGReg作用在投影器的输出空间而不是编码器的输出空间?因为编码器最后一层做了layer normalization,把[cls]表征约束到了球面上,球面上的分布无法有效优化各向同性高斯目标。所以需要投影器把表征映射到K维欧氏空间再施加SIGReg约束。
95% Token丢弃反而提升精度
如果token dropping只是为省算力做的近似,那下游精度应该随丢弃比例增加而下降才对。直觉上,丢弃越多信息越少,表征质量应该变差。但LeVJEPA的实验给出了完全相反的结果。
在ViT-B/16、20% K710子集、240个epoch的设置下,ImageNet冻结线性探测精度随丢弃比例单调上升:处理全部token时33.9%,丢弃90%时47.4%,丢弃95%时达到47.6%。token dropping在这里扮演了双重角色:减少前向计算量、同时作为一种随机增强手段,迫使片段级嵌入从稀疏随机观测中推断出视频内容。
图4(a):掩码比例的影响。LeVJEPA在ImageNet线性探测精度上随掩码比例增加而单调上升,从处理全部token的33.9%一路涨到丢弃95%时的47.6%,说明随机token丢弃不仅省算力,还起到了增强作用。
不过这个收益并不是在所有任务上均匀出现。Something-Something-v2这个偏运动理解的基准上,丢弃比例超过0.3后精度就开始下滑。论文给出的解释是稀疏随机观测让运动线索——依赖帧间对应关系的信息——更难在单个视图内恢复。好消息是这个退化可以通过延长训练来弥补:更长的训练让高丢弃比例恢复低丢弃比例的精度,同时保留更低的单次迭代成本,所以在总预训练算力层面,激进丢弃仍然是更高效的配置。
保留token的空间结构同样关键。论文对比了均匀随机丢弃和tube变体——后者在每帧保留相同空间位置,模仿VideoMAE的时空掩码模式。结果是tube dropping在ImageNet上从50.7%掉到39.6%,Something-Something-v2上从30.4%掉到26.4%(τ=2配置下28.8%对26.4%)。这个结果和掩码预测领域的研究结论正好相反,原因在于目标函数的不同:掩码预测任务里,结构化掩码让补全任务变得非平凡,随机掩码反而让缺失内容可以从空间邻居插值;但在LeVJEPA里,没有内容补全,保留token就是编码器对片段的唯一观测,tube模式等于在所有帧里永久遮挡了场景的大部分区域,而均匀随机丢弃给出的是时空分布的样本,片段内容仍然可辨认。
局部视图数量V也是个可以调的旋钮。从V=4增加到V=10,ImageNet精度从47.6%涨到50.2%,V=12时饱和到49.8%。每个额外局部视图在方程2里引入一个预测约束,边际成本只有约29个处理token,不到全局视图成本的五分之一。论文默认保留V=4做对比实验,但这个扫描结果表明方法还没到极限——只靠增加视图预算,就还能用适度的预训练成本换更多精度。
视频预训练的革命:告别复杂启发式
在视觉自监督学习这个圈子里,视频预训练长期以来都是一个"算力黑洞"。为什么这么说?因为视频天然比图像多一个时间维度,一段16帧的短视频片段,token数量轻松破千,是同等分辨率图像的十倍以上。更扎心的是,以往主流方法为了防止表征坍塌,还得在模型里塞进各种复杂的"安全装置"——EMA目标编码器、预测器网络、停止梯度操作,一套流程下来,训练一版模型的开销足以劝退大多数实验室。
LeVJEPA这篇论文做的事情,用一句话概括就是:把这些"保险装置"全扔了,用一套统计正则化方法从数学上保证模型不坍塌,让视频预训练回归到"一个编码器、一个损失函数"的极简形态。论文作者阵容里出现了Yann LeCun的名字——作为JEPA路线的提出者,他在这项工作里没有继续堆架构,反而做起了减法。
效果怎么样?先看几个硬数字:在相同数据、相同epoch数下,LeVJEPA在ViT-S/B/L三种规模上,预训练算力只有V-JEPA 2的5.6到20.8分之一,精度却不输甚至反超;在总FLOPs对齐的情况下,ImageNet-1K上比最强视频基线高出7.6个点。更离谱的是,论文发现预训练时随机丢掉95%的token,下游精度反而比处理全部token更高——省算力和涨精度同时发生,这种好事在深度学习里真不多见。
图2:相同epoch下精度与总预训练算力的对比。ViT-S/ViT-B/ViT-L三种编码器在相同的20% K710子集上预训练240个epoch,横轴为对数坐标且反向排列。可以看到LeVJEPA(深色标记)在远小于V-JEPA 2(浅色标记)的算力消耗下,达到了相当甚至更高的ImageNet-1K注意力探测精度。
单一编码器如何实现无崩溃学习
要理解LeVJEPA的简化逻辑,得先搞清楚一个问题:JEPA类方法为什么要搞那么多花活?
自监督学习的核心矛盾在于:如果一个模型被训练成"把同一个样本的不同视角映射到相近的表征",它可能找到一个偷懒的解法——不管输入是什么,都输出同一个常数。这叫表征坍塌(representation collapse),是联合嵌入方法要面对的头号敌人。BYOL的做法是给目标分支加EMA滑动平均,让目标编码器的更新慢半拍;DINO在此基础上加了centering和sharpening;V-JEPA则把重心放在掩码预测上,用预测器来逼编码器学出有意义的结构。
LeVJEPA的路线完全不同。它借鉴了LeJEPA的思想:不靠架构不对称性防坍塌,而是直接对表征的分布施加约束。具体来说,就是用一个叫SIGReg的正则项,要求一批样本的嵌入分布逼近各向同性高斯分布——也就是标准正态分布N(0, I)。为什么这个约束能防坍塌?因为如果模型把所有输入映射到同一个常数,那这批嵌入的分布就是方差为零的狄拉克分布,跟标准高斯的距离无穷远,损失函数会给出一个巨大的惩罚,从数学上就把坍塌解排除了。
这背后的数学工具是Cramér–Wold定理:一个高维分布是标准高斯,当且仅当它沿所有一维方向的投影都是标准高斯。LeJEPA的作者Balestriero和LeCun还进一步证明,各向同性高斯分布在最坏情况下的下游探测风险是最小的——也就是说,在不知道下游任务是什么的情况下,把表征分布约束成高斯是最"保守"也最"稳妥"的选择。
SIGReg的实现也很巧妙。它每一步随机采样M个方向(论文中M=1024),把嵌入批次投影到这M个方向上,然后对每个投影方向用Epps–Pulley统计量检验其是否服从N(0,1)。Epps–Pulley检验基于经验特征函数,对异常值不敏感,梯度有界,不需要白化或中心化预处理。整个损失的计算开销是线性的,分布式训练时只需要一次all-reduce来汇总全局批次的统计量,通信成本几乎可以忽略。
公式(1):LeVJEPA的总损失由不变性损失和SIGReg正则项组成,λ是唯一超参数,固定为0.02,所有实验不调。
公式(2):不变性损失——全局视图嵌入z₀与各局部视图嵌入z_v之间的均方误差,注意梯度同时流过两个分支,没有停止梯度操作。
公式(3):SIGReg损失——对每个随机方向a_m,用经验特征函数与标准高斯特征函数的偏差的加权积分来度量投影分布与N(0,1)的距离。这里z_i是批次中的嵌入,n是批次大小,M是随机方向数。
整个流程走一遍:构造全局视图和局部视图 → 随机丢95%的patch token → 共享编码器前向 → 取[cls]嵌入过投影器 → 计算MSE + SIGReg → 反向传播更新编码器和投影器。预训练结束后投影器被扔掉,下游任务直接用编码器输出的[cls]表征或patch表征。整个过程干净利落,没有一个多余组件。
还有一个细节点值得注意:SIGReg施加在投影器的输出空间,而不是编码器的输出空间。原因在于编码器最后一层做了layer normalization,把[cls]表征约束到了单位球面上——球面上的分布没法有效匹配各向同性高斯。投影器的作用就是把表征从球面"解放"到欧氏空间,让SIGReg能正常工作。
图3:Patch token的PCA可视化。把patch表征的前三个主成分映射为RGB通道,对同一张输入图像进行可视化。LeVJEPA的分解清晰地把动物与周围的家具和背景分离开,效果接近V-JEPA 2.1——后者是通过显式的辅助patch级损失才获得这种稠密结构的。而V-JEPA 2在缺少该损失时,token级组织结构明显逊色。值得注意的是,LeVJEPA的训练目标只监督[cls] token,patch token零监督,这种稠密语义结构完全是自发涌现的。
95% Token丢弃反而提升精度
如果"丢掉95%的token"听起来像行为艺术,那"丢掉95%的token精度反而更高"就有点反常识了。但这就是LeVJEPA在实验中观察到的现象。
实验很直接:固定其他条件不变,只改变token丢弃比例ρ。在ViT-B/16、20% K710子集、240个epoch的设置下,ImageNet-1K冻结注意力探测精度随ρ单调上升——处理全部token时只有33.9%,丢弃90%时涨到47.4%,丢弃95%时达到47.6%的峰值。从33.9%到47.6%,涨了近14个点,而计算量只剩原来的二十分之一。
为什么会这样?论文给出的解释是:token dropping同时扮演了双重角色。第一,当然省算力——前馈层的计算量随token数线性减少;第二,更重要的是,它是一种随机增强手段。当模型只能从稀疏随机位置观测片段时,它必须学会从有限的观测中推断出视频内容,这个"推断"过程本身就逼迫表征学到更本质的结构。换句话说,随机丢弃token不是在破坏信息,而是在制造一种有意义的"难度"。
但这里有个重要的边界条件需要说明:这种"丢弃越多越好"的规律只在图像类任务上成立。在Something-Something-v2这个偏运动理解的基准上,丢弃比例超过0.3后精度就开始下滑。原因也不难理解——运动信息依赖帧与帧之间的对应关系,而极端稀疏的随机采样会把这种对应关系破坏掉。好消息是,这种退化可以通过延长训练来弥补:训练时间拉长后,高丢弃比例能恢复低丢弃比例的精度,而单次迭代成本更低,所以从总预训练算力的角度核算,激进丢弃仍然是更划算的选择。
保留token的空间结构也很有讲究。论文对比了均匀随机丢弃和tube变体(每帧保留相同空间位置,模仿VideoMAE的时空掩码模式),结果tube dropping在ImageNet上从50.7%惨跌到39.6%,Something-Something-v2上也明显更差。这个发现跟掩码预测领域的研究结论正好相反——在MAE那类任务里,结构化掩码是必要的,因为如果不遮挡同一个空间区域,模型就能从相邻帧复制被掩码的内容,补全任务就失去了意义;但在LeVJEPA里没有内容补全这回事,保留token就是编码器的全部观测,tube模式等于在所有帧里永久遮挡了场景的大部分区域,信息量严重受损。
局部视图数量V也是个可调的旋钮。从V=4增加到V=10,ImageNet精度从47.6%涨到50.2%,V=12时饱和在49.8%。每个额外的局部视图只需增加大约29个处理token的计算量,不到全局视图成本的五分之一。论文默认用V=4做全套对比实验,但这个消融表明方法远没到天花板——想提精度的话,光靠增加视图预算就能继续涨点。
图4(b):局部视图数量的影响。从V=4增加到V=10精度持续上升,V=12后饱和,说明LeVJEPA在预训练算力和精度之间存在一个灵活的调节旋钮。
因果注意力:零成本的时间建模
视频模型通常用全双向注意力——每一帧的token都能看到整个片段的所有帧。这种做法的好处是信息利用充分,但代价是推理时无法流式处理:来看一段新视频,模型必须一次性处理整段,无法做到"来一帧算一帧"。对于需要实时交互的世界模型、机器人控制、流式视频理解等场景,这是个硬伤。
LeVJEPA的block-causal注意力设计巧妙地解决了这个问题。它的规则是:同一帧内的token之间可以双向注意力(因为同一时刻的信息没有"窥视未来"的问题),但跨帧只能从过去到未来——第t帧的token只能看到第t帧及之前的帧,不能看到第t+1帧及之后的内容。
这种设计带来的推理优势是结构性的:因为第t帧的表征只依赖前t帧,所以处理新到达的视频帧时,之前的帧完全不需要重新编码。只需要对新增帧做一次前向计算,就能得到整个视频的逐帧表征。复杂度从O(T²)降到O(T),这对于自回归世界模型、流式视频理解、在线机器人感知等场景意义重大。
按常理推断,因果注意力相比双向注意力会损失一部分精度,毕竟每个token能看到的上下文少了一半。但LeVJEPA的实验结果让人意外:在相同配置下,block-causal注意力在ImageNet-1K上的精度是51.2%,双向注意力是50.7%——不仅没有下降,还略高了一点。虽然这个差距在噪声范围内,但至少说明因果约束没有带来可测的精度损失。
表2:注意力拓扑的对比。两种配置均使用τ=1、ρ=0.95、V=4和均匀随机丢弃。block-causal注意力在ImageNet-1K上的精度不仅没有下降,反而略高于双向注意力,说明时间因果性可以零成本获得。
为什么因果注意力不掉点?一个合理的猜测是:视频帧之间的信息冗余度很高,相邻帧的视觉内容高度相似;对于绝大多数视觉理解任务来说,过去的帧已经提供了足够的上下文信息,"未来"的帧带来的边际信息增量有限。另一个因素是训练时的随机token丢弃已经让模型习惯了从稀疏观测中推断信息,因果掩码相当于另一种形式的"观测受限",模型已经对此有了鲁棒性。
此外,论文还顺带验证了一个反直觉的结论:时间维度的patch聚合(把相邻两帧拼成一个token,τ=2)是没必要的。在控制总token数量相同的条件下,逐帧token化(τ=1)在ImageNet和Something-Something-v2上都优于τ=2。也就是说,短时运动信息的捕捉并不依赖输入端的时间聚合——Transformer的注意力机制自己就能学到跨帧的对应关系,不需要在tokenization上做文章。
表1:时间patch聚合的对比,在匹配的token预算下进行。两种配置在预训练时每个视图保留相同数量的token,评估时使用8个时间槽的序列。结果显示逐帧token化(τ=1)在ImageNet-1K和Something-Something-v2上都优于时间聚合(τ=2)。
消费级GPU也能训练视频模型
LeVJEPA的算力友好程度还有一个非常直观的展示:论文用一个ViT-Tiny(超小规模Transformer)在单张消费级GPU上训练了12小时,数据只是无标注的行走视频,得到的模型在ImageNet上居然有非平凡的准确率。什么概念?以前说到视频预训练,大家默认是几十张A100起步的大工程;现在一张消费级显卡、一个晚上、一堆无标注视频就能训练出一个能用的视觉编码器。这个门槛的降低,对于资源有限的高校实验室和小团队来说,意义是不可忽视的。
算力效率的大幅提升也体现在更大规模的对比上。论文把预训练数据扩展到K710全集、Something-Something-v2、Walking Tours和PE Video Dataset的组合,训练了一个ViT-L/16模型。在FLOPs对齐的条件下,LeVJEPA在ImageNet-1K上比最强的视频基线(VideoMAEv2)高出7.6个百分点,在Kinetics-400上也拿到了最高精度,而在Something-Something-v2上保持竞争力。
表3:相同预训练数据上的FLOPs匹配对比。ViT-B编码器在20% K710子集上以相同总FLOPs训练,冻结评估。IN1K和SSv2报告注意力探测top-1精度,K400报告线性探测top-1精度。在相同算力预算下,LeVJEPA在ImageNet-1K上大幅领先VideoMAEv2和V-JEPA 2,在Kinetics-400上也是最高的。
更值得关注的是LeVJEPA和图像预训练模型的对比。论文在相同FLOPs下训练了一个DINOv2风格的模型——用同一批视频的帧作为静态图像来预训练。结果很有意思:在ImageNet-1K这种外观主导的任务上,LeVJEPA已经逼近了图像预训练的DINOv2;而在Something-Something-v2这种运动主导的任务上,LeVJEPA的精度几乎是DINOv2的两倍。
这个结果直接回应了一个老问题:视频预训练到底值不值?长期以来大家的共识是:视频数据虽多,但训练成本太高,性价比不如在图像上预训练然后微调。LeVJEPA用实验表明,一旦算力开销不再是瓶颈,视频作为预训练素材的独特价值——运动、因果、物体恒存性的天然标注——就开始真正体现出来了。
龙迷三问
这篇论文到底在解决什么问题? LeVJEPA用单一编码器加SIGReg正则,彻底去掉目标编码器、预测器和停止梯度等防坍塌机制,将视频预训练算力压缩5.6到20.8倍,且95%随机Token丢弃让ImageNet精度从33.9%涨到47.6%,块因果注意力零代价
这篇工作最值得看的点是什么? 在匹配epoch下,LeVJEPA以5.6-20.8×更少的计算量达到或超过V-JEPA 2;在匹配FLOPs下,ImageNet-1K上超过最强视频基线7.6个百分点,Kinetics-400上最高,SSv2上接近最优;与DINOv2相比,外观中心评估接近,运动中心准确率几乎翻倍。
这篇工作的边界或风险在哪里? 优点:极大简化视频预训练流程(单编码器+单损失+单超参数),计算效率显著提升,因果注意力无精度损失,支持流式推理。缺点:运动中心基准(SSv2)上激进token丢弃在短训练计划下性能下降;大规模数据下的SIGReg行为尚未充分验证;patch级表示对密集预测任务的充分性未评估。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数: ★★★★☆
利用SIGReg分布正则化替代传统防表示崩溃机制(目标编码器、预测器、梯度停止),仅用单一编码器+投影器,通过全局-局部视图不变性损失实现高效视频自监督预训练。
实验合理度: ★★★★☆
冻结编码器上的attentive probing top-1准确率(ImageNet-1K和SSv2),线性探测top-1准确率(Kinetics-400)
学术研究价值: ★★★★☆
利用SIGReg分布正则化替代传统防表示崩溃机制(目标编码器、预测器、梯度停止),仅用单一编码器+投影器,通过全局-局部视图不变性损失实现高效视频自监督预训练;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
ViT-S/B/L在240轮训练中分别比V-JEPA 2节省5.6×至20.8×的总预训练计算量;ViT-B从36.4 ExaFLOPs降至4.8 ExaFLOPs。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 运动中心基准(SSv2)上激进token丢弃在短训练计划下性能下降;大规模数据下的SIGReg行为尚未充分验证;patch级表示对密集预测任务的充分性未评估。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!