← 返回 PaperDaily 视觉与图像

DeepMind新作:DINOv2拉直视频,假视频现形

假视频越来越像真视频,传统只看像素伪影的办法已经不太够用了。这篇 DeepMind 的 ReStraV 反其道而行,盯着视频在 DINOv2 特征空间里“走路直不直”,思路简单,效果却很能打。

DeepMind新作:DINOv2拉直视频,假视频现形
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
假视频越来越像真视频,传统只看像素伪影的办法已经不太够用了。这篇 DeepMind 的 ReStraV 反其道而行,盯着视频在 DINOv2 特征空间里“走路直不直”,思路简单,效果却很能打。


原论文信息如下:
论文标题:
AI-Generated Video Detection via Perceptual Straightening
发表日期:
2025年07月
发表单位:
Bielefeld University, Google DeepMind, Honda Research Institute EU, Cold Spring Harbor Laboratory
原文链接:
https://arxiv.org/pdf/2507.00583
这篇论文最有意思的地方,不是又堆了一个更大的视频分类器,而是把“真假视频”问题改写成了“特征轨迹是否够直”这种几何问题。结果还真不是玄学,DINOv2 上的曲率和步长差异,能把不少生成视频揪出来。

引言

生成式视频已卷到“肉眼快分不清”的程度,传统检测方法要么盯局部伪影,要么依赖特定生成器,换个模型就容易露怯。ReStraV 的思路很有意思:不直接和“假视频长什么样”死磕,而是看视频在预训练视觉表征里怎么“走”。自然视频在这类表征空间里通常更平滑、更直;AI 生成视频则更容易出现弯弯绕绕的轨迹。简单说,像素可以骗人,轨迹有时不太会。

方法概述

图1:ReStraV用于AI视频检测的方法示意图。受‘感知拉直’启发,本方法利用自然视频在特征轨迹上更‘直’这一几何现象,将时间曲率作为判别信号。
图1:ReStraV用于AI视频检测的方法示意图。受“感知拉直”启发,本方法利用自然视频在特征轨迹上更“直”这一几何现象,将时间曲率作为判别信号。
这套方法的核心,不是训练一个更大的视频怪兽,而是先把每个视频送进 DINOv2 的特征空间,再看相邻帧之间的表示变化是否“顺滑”。如果自然视频像一条认真走直线的人行道,生成视频就更像喝了点奶茶后边走边晃。
图2:像素空间里自然视频与AI生成视频的轨迹指标大量重叠,但在DINOv2表示空间中,自然轨迹被明显拉直,并与生成视频拉开差距;右图还比较了不同视觉编码器的平均曲率差异。
图2:像素空间里自然视频与AI生成视频的轨迹指标大量重叠,但在DINOv2表示空间中,自然轨迹被明显拉直,并与生成视频拉开差距;右图还比较了不同视觉编码器的平均曲率差异。
论文里先定义了两个最关键的量:步长距离曲率。前者看相邻帧特征变化有多大,后者看连续两步之间“拐了多大弯”。这俩指标一组合,视频在表示空间里的运动轨迹就不只是“动没动”,而是“怎么动的”。
图3:表示轨迹曲率的几何定义。图中展示了连续三个帧嵌入之间的位移向量、步长距离以及转角曲率的计算方式。
图3:表示轨迹曲率的几何定义。图中展示了连续三个帧嵌入之间的位移向量、步长距离以及转角曲率的计算方式。
接着,方法把一段视频压成 24 帧,分别提取 DINOv2 最后一层的 CLS token 和 patch embedding,再把这些帧特征串成一条时间轨迹。之后不搞复杂端到端训练,而是直接统计曲率和步长的均值、方差、最小值、最大值,喂给一个轻量分类器。这个设计很“工程”:特征抽出来,分类器一上,成本就下来了。

核心设计

ReStraV 的妙处在于,它并不执着于“视频生成模型到底用了什么伪影”,而是抓住了更底层的几何差异。生成模型可以把画面做得很像,但要让整段时间轨迹在特征空间里也像自然世界那样平滑,难度明显更高。
图4:在VideoProM数据集上,像素空间中的自然与生成轨迹高度重叠,而在DINOv2表示空间中两类视频的曲率轨迹可以明显分开。
图4:在VideoProM数据集上,像素空间中的自然与生成轨迹高度重叠,而在DINOv2表示空间中两类视频的曲率轨迹可以明显分开。
图5:自然视频与AI生成视频在时间距离和曲率统计特征上的分布差异。
图5:自然视频与AI生成视频在时间距离和曲率统计特征上的分布差异。
这部分最关键的判断是:真正有用的不是绝对拉直能力,而是“自然视频”和“AI视频”被差异化拉直的程度。DINOv2 这类自监督模型恰好更擅长把自然视频拉顺,却对生成视频没那么“照顾”,于是两类视频的曲率差距被放大了。

轻量级分类器实现高精度:从统计特征到MLP,效率和效果双优

图6:ReStraV不同分类器的推理时间、准确率和AUROC之间的权衡关系。
图6:ReStraV不同分类器的推理时间、准确率和AUROC之间的权衡关系。
图9:不同分类器的ROC曲线与归一化混淆矩阵,MLP在AUROC上表现最好。
图9:不同分类器的ROC曲线与归一化混淆矩阵,MLP在AUROC上表现最好。
论文没有把事情搞复杂:逻辑回归、朴素贝叶斯、随机森林、梯度提升、SVM、MLP 都试了一遍,最后发现两层 MLP 最稳。它不是最花哨的模型,但在这组几何特征上,确实更会“拐弯判断”。更重要的是效率:整套流程不需要微调 DINOv2,也不需要端到端吃原始像素,单视频推理大约 48 毫秒,已经很接近“能上系统”的水平。

硬核实验:超越所有对比方法,跨领域、跨模型泛化能力惊人

图7:在Physics-IQ匹配真实/生成视频对上,ReStraV依然能可靠识别假视频。
图7:在Physics-IQ匹配真实/生成视频对上,ReStraV依然能可靠识别假视频。
图13:GenVidBench主任务与Plants任务上的性能分布,ReStraV整体处在更高水平。
图13:GenVidBench主任务与Plants任务上的性能分布,ReStraV整体处在更高水平。
实验最能说明问题的地方,不是单一数据集上的高分,而是跨生成器、跨场景、甚至零样本到新模型的稳定性。无论是 VidProM、GenVidBench,还是 Physics-IQ 这种“同场景真伪对照”的困难设置,ReStraV 都能保持很强的辨别力。尤其在 Physics-IQ 上,模型甚至没有再训练,只靠平均曲率就能把真假视频分开,这个结果很有说服力。

局限与未来:当检测遇上“古德哈特定律”,如何防范生成模型的反制?

方法够巧,但也不是万能钥匙。它依赖预训练表征空间的几何偏差,一旦未来生成模型开始专门针对这类检测指标做对抗优化,信号可能会被逐步抹平。这就是典型的“指标一旦成了目标,就会失去指标价值”的问题。不过,ReStraV 的意义更在于提供了一种很值得借鉴的取证视角:别总盯着假视频表面那点小瑕疵,去看它在表示空间里的运动规律,往往更稳、更便宜,也更容易部署。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这类方法能直接落地吗?能,但更适合做成“轻量前置筛查”而不是最终裁决器。它便宜、快、可解释,适合先把高风险视频筛出来,再交给更重的模型或人工复核。

它和传统伪影检测最大的区别是什么?传统方法盯的是“视频表面有没有破绽”,ReStraV 盯的是“视频在特征空间里走得顺不顺”。这个视角更抽象,但也更有机会跨生成器泛化。

普通从业者最该记住什么?当一个任务被大模型越做越像时,换个表征空间、换个几何视角,往往比继续堆参数更有效。这个思路对视频取证、异常检测、甚至更广泛的时序理解都很有启发。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆把“感知拉直”从神经科学概念搬到 AI 视频鉴伪里,角度新,且跑出了结果。

实验合理度:★★★★☆数据集、跨生成器、零样本、匹配对照都覆盖了,验证链条比较完整。

学术研究价值:★★★★☆说明表示空间几何本身可以成为取证信号,这个视角值得继续挖。

稳定性:★★★★☆在多个基准上表现很稳,尤其是对未来生成器和匹配对照视频的泛化。

适应性以及泛化能力:★★★★☆比很多只认特定伪影的方法更泛化,但未来若生成器专门对抗此指标,仍会被追着打。

硬件需求及成本:★★★★★DINOv2 冻结特征加轻量分类器,推理成本低,工程上友好。

复现难度:★★★★☆思路清楚,组件不复杂,复现门槛不高。

产品化成熟度:★★★★☆适合做内容审核、平台风控的前置过滤器,但不建议单独承担最终裁决责任。

可能的问题:★★★☆☆方法依赖 DINOv2 这类预训练表征,若未来生成模型学会“伪装轨迹”,效果可能被削弱;另外它更像检测器,不是解释器。


主要参考文献

Olivier J Hénaff, Robbe LT Goris, and Eero P Simoncelli. Perceptual straightening of natural videos. Nature neuroscience, 22(6):984–991, 2019.
Olivier J Hénaff, Yoon Bai, Julie A Charlton, Ian Nauhaus, Eero P Simoncelli, and Robbe LT Goris. Primary visual cortex straightens natural video trajectories. Nature communications, 12(1):5982, 2021.
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy V. Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel HAZIZA, Francisco Massa, Alaaeldin El-Nouby, Mido Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Herve Jegou, Julien Mairal, Patrick Labatut, Armand Joulin, and Piotr Bojanowski. DINOv2: Learning robust visual features without supervision. Transactions on Machine Learning Research, 2024.

从神经科学“感知拉直”假说起步,自然视频轨迹为何更“直”?

这篇论文最有意思的地方,是把“真假视频检测”从传统的像素侦探,改成了一个更像几何题的判断:视频在神经网络特征空间里,走得直不直。真实世界里的运动通常连续、平滑、可预测;生成视频虽然画面像,但时间上的“走路姿势”常常更别扭。这套思路来自神经科学里的感知拉直(perceptual straightening):自然视频进入视觉系统后,内部表示往往比原始像素轨迹更“直”。论文把这个假说搬到 AI 生成视频检测上,反过来问:如果真实视频更直,那生成视频会不会更“弯”?
图1:ReStraV用于AI视频检测的方法示意图。受“感知拉直”启发,本方法利用自然视频在特征轨迹上更“直”这一几何现象,将时间曲率作为判别信号。
这里的关键不是“视频长得像不像”,而是“视频在特征空间里是不是像自然事件那样顺着走”。传统检测方法常盯着局部伪影,但生成模型一进化,这些小毛病越来越会藏。ReStraV 选择换赛道:不跟表面细节死磕,直接看时间轨迹的几何形状。

ReStraV方法拆解:DINOv2提取轨迹,曲率与距离成为检测信号

ReStraV 的全名是 Representation Straightening for Video,中文可以理解为“视频表示拉直”。它不是一个端到端大模型,而是一条很清晰的工程管线:先用预训练视觉编码器把视频帧映射到特征空间,再计算相邻帧表示的位移和转角,最后把这些几何量交给轻量分类器判断真假。
图2:像素空间里自然视频与AI生成视频的轨迹指标大量重叠,但在DINOv2表示空间中,自然轨迹被明显拉直,并与生成视频拉开差距;右图还比较了不同视觉编码器的平均曲率差异。
为什么选 DINOv2?论文做了多种视觉编码器对比。结果很有意思:一些受人类视觉系统启发的模型,虽然“拉直”能力强,但对真实和生成视频都一视同仁,反而不利于区分;而 DINOv2 这类自监督模型更像“偏心”地对自然视频拉得更直,对生成视频没那么买账,于是两类视频的差异被放大了。
图3:表示轨迹曲率的几何定义。图中展示了连续三个帧嵌入之间的位移向量、步长距离以及转角曲率的计算方式。
论文里定义了两个核心量。第一个是步长距离,也就是相邻两帧特征向量的变化幅度。第二个是曲率,衡量连续两步位移之间拐了多大弯。若把视频表示轨迹想成一辆车在地图上开,步长距离就是每一脚油门踩了多狠,曲率就是方向盘拐了多急。自然视频通常更稳,生成视频更容易“蛇形走位”。
具体做法也不复杂。论文把视频统一采样成 24 帧,覆盖约 2 秒时间窗;每一帧输入 DINOv2 ViT-S/14 的最后一层,取 CLS token 和 patch embedding,再把这些特征拼成一个高维表示序列。之后不再碰原始像素,而是直接在这条轨迹上计算相邻帧位移与转角。为了确认这不是“看起来像那么回事”,论文还做了轨迹可视化。真实视频和生成视频在像素空间里轨迹重叠得很厉害,到了 DINOv2 表示空间才开始明显分家。
这里最值得记住的一句话是:不是绝对拉直能力越强越好,而是自然视频和生成视频被“差异化拉直”的能力更重要。这也是 ReStraV 能工作的根本原因。

轻量级分类器实现高精度:从统计特征到MLP,效率和效果双优

如果只停留在“看见了差异”,那还不够。ReStraV 下一步做得很工程化:把每段视频的轨迹信号压缩成少量统计特征,再交给轻量分类器。这里的统计特征包括曲率和步长的均值、方差、最小值、最大值。换句话说,不是拿整条曲线去硬怼分类器,而是先提炼出这条曲线的“脾气”。
图5:自然视频与AI生成视频在时间距离和曲率统计特征上的分布差异。
论文把这些统计量和部分逐帧信号拼成 21 维向量,然后尝试了逻辑回归、高斯朴素贝叶斯、随机森林、梯度提升、核 SVM 和两层 MLP。这个对比很接地气:没有花里胡哨地端出一个巨型网络,而是老老实实看哪种分类器最适合这组几何特征。
图6:ReStraV不同分类器的推理时间、准确率和AUROC之间的权衡关系。 图9:不同分类器的ROC曲线与归一化混淆矩阵,MLP在AUROC上表现最好。
结果挺有意思:线性模型能跑出不错的底线,但两层 MLP 最终拿到最好的准确率和 AUROC。原因并不神秘,因为这组特征之间本身就不是简单线性可分,MLP 能更灵活地学到曲率、距离和统计量之间的非线性组合关系。更关键的是,它仍然很轻量,没有把问题搞成“为了检测假视频先训练一个更大的假视频杀手”。
表1:ReStraV各分类器在VideoProM平衡测试集上的性能与推理时间。
表1:ReStraV各分类器在VideoProM平衡测试集上的性能与推理时间。可以看到,MLP 在准确率、F1 和 AUROC 上都最强,同时推理成本仍然很低,单视频端到端大约 48 毫秒,属于“能打且不贵”的类型。
这部分的工程价值很明确:特征提取依赖冻结的 DINOv2,不需要微调;分类器也不用复杂搜索;最终推理时间低,部署门槛小。对于内容平台、风控系统、素材审核来说,这种“先提特征、再轻分类”的方案,明显比重型端到端检测器更容易落地。

硬核实验:超越所有对比方法,跨领域、跨模型泛化能力惊人

论文最能立住脚的地方,还是实验。它没有只在一个小数据集上刷分,而是把 ReStraV 放到多个基准、多个生成器、多个场景里去考,重点看它能不能跨模型、跨分布、跨任务地活下来。这个思路很对,因为真假视频检测最怕的就是“在已知生成器上很准,换个新模型就翻车”。
表2:ReStraV与图像级检测器在VidProM上的对比,左侧为准确率,右侧为mAP。
表2:ReStraV与图像级检测器在VidProM上的对比,左侧为准确率,右侧为mAP。ReStraV 在平均准确率和平均 mAP 上都明显高于只看单帧伪影的方法,说明视频任务还是得尊重时间信息。
更有说服力的是和视频检测器的对比。无论是已见生成器、未见生成器,还是未来生成器,ReStraV 都能保持相当稳的表现。尤其在未来生成器场景里,很多方法会明显掉点,因为它们学到的往往是某一代生成器留下的“指纹”;而 ReStraV 盯的是更底层的轨迹几何,受具体伪影样式变化的影响更小。
表3:ReStraV与VideoSwin在VidProM上的真假视频检测对比,包含已见生成器、未见生成器和未来生成器三种场景。
表3:ReStraV与VideoSwin在VidProM上的真假视频检测对比,包含已见生成器、未见生成器和未来生成器三种场景。可以看到,ReStraV 在这些设置里都表现更稳,尤其对“没见过的新模型”仍然保持较高准确率。
表4:ReStraV与多种视频检测方法在GenVidBench上的对比。
表4:ReStraV与多种视频检测方法在GenVidBench上的对比。这里分为主任务和 Plants 子任务,后者更难,因为植物视频本身就有大量细碎、随机、非刚性的运动,特别容易把检测器绕晕。ReStraV 依然能保持高水平表现。
图4(补充):GenVidBench主任务上的准确率对比分布。
图4(补充):GenVidBench主任务上的准确率对比分布。
表5:DeMamba基准上的one-to-many泛化结果。
表5:DeMamba基准上的 one-to-many 泛化结果。这个设置更接近现实:训练时只见过一个生成器,测试时却要面对一堆没见过的生成器。ReStraV 还能保持竞争力,说明它不是死记硬背生成器特征,而是在学一种更抽象的“视频轨迹异常”。
图7:Physics-IQ上真假视频对的检测结果。
图7:Physics-IQ上真假视频对的检测结果。这个数据集的难点在于,真假视频是成对匹配的,很多表面差异被刻意压低,检测难度更高。ReStraV 依然能稳定识别。
从实验链条看,这篇论文是比较完整的:先证明轨迹几何确实有差异,再证明轻量分类器就能吃下这个差异,最后再证明它在多个基准上都能泛化。

局限与未来:当检测遇上“古德哈特定律”,如何防范生成模型的反制?

ReStraV 的优点很明显,但它也不是“从此天下无假视频”的终局方案。它本质上依赖预训练表示空间里的几何偏差:只要未来生成模型开始专门针对这种曲率指标做优化,检测信号就可能被慢慢抹平。这就是典型的古德哈特定律——当一个指标成了优化目标,它就可能不再适合作为指标。不过,这并不削弱这篇工作的价值。相反,它提示了一个很实用的方向:真假视频检测不要只盯表面伪影,而要把“表示空间几何”纳入武器库。如果把它放到产品里,更合理的定位不是“最终法官”,而是“高性价比前置筛查器”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“AI 生成视频越来越像真视频,传统伪影检测越来越不够用”的问题。ReStraV 不再盯像素瑕疵,而是看视频在 DINOv2 特征空间里的轨迹是否足够“直”,从几何上区分真假视频。

曲率和步长距离分别是什么意思?步长距离是相邻帧特征变化的幅度,表示视频“走了多远”;曲率是连续两步之间转了多大弯,表示视频“拐了多急”。自然视频一般更平滑,生成视频更容易出现不稳定的弯折。

为什么不用更大的视频模型,反而用轻量分类器?因为这类几何特征本身已经很有区分度,没必要再堆一个大模型。轻量分类器能把推理成本压下来,也更容易复现和部署;论文里两层 MLP 就拿到了很强的效果。


龙哥点评

论文创新性分数:★★★★☆把“感知拉直”用于 AI 视频检测,角度新,且做出了可用信号。

实验合理度:★★★★☆从轨迹可视化、统计检验到多基准对比,验证链条比较完整。

学术研究价值:★★★★☆提供了一个很有启发的方向:表示空间几何本身可以成为取证信号。

稳定性:★★★★☆在多个数据集和生成器上都比较稳,尤其是跨模型和未来生成器场景。

适应性以及泛化能力:★★★★☆比很多只认特定伪影的方法更

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。