← 返回 PaperDaily 前沿研究

纽约大学视频恢复新方法:看见的复制,没看见的才生成,真实异常闪烁降低84%

方法简称: 异常感知视频恢复方法(AVR) 原文标题: Copy What Is Seen, Generate What Is Not: Training-Free Anomaly-Aware Video Restoration 首次公开: 2026年9月16日23:43(北京时间,arXiv v1) 已核验单位: 纽约大学坦登工程学院;悉尼科技大学澳大利亚

方法简称:异常感知视频恢复方法(AVR)

原文标题:Copy What Is Seen, Generate What Is Not: Training-Free Anomaly-Aware Video Restoration

首次公开:2026年9月16日23:43(北京时间,arXiv v1)

已核验单位:纽约大学坦登工程学院;悉尼科技大学澳大利亚人工智能研究院

原论文:https://arxiv.org/abs/2609.18836

龙哥导读

监控视频发现异常后,能不能不只画个框,而是把异常遮住的正常画面恢复出来?这篇论文把检测与修复接成一条训练免费链路。最关键的不是“又用了扩散模型”,而是先划清一条线:视频其他帧见过的背景直接复制,整段视频从未见过的区域才允许生成。20个真实异常片段中,区域闪烁从21.12降到3.32,按(21.12−3.32)÷21.12计算为84.28%,标题取整写作“降低84%”。代价也很明确:16帧完整处理约62.52秒,离实时还远。

想象一段固定摄像头画面:有人骑车穿过本不该出现车辆的人行道,系统已经把骑车人圈出来了。接下来怎么办?如果只报警,异常还留在视频里;如果逐帧调用生成模型把人抹掉,模型又可能这一帧补出路面,下一帧凭空补出一名行人,画面看似合理,时间轴却开始“说胡话”。

这正是视频恢复与视频生成越来越容易混在一起之后,必须回答的问题:哪些像素是从真实观测恢复的,哪些像素只是模型猜的?AVR给出的答案很克制——先榨干视频自身的证据,实在没有证据时才动用生成先验。

图1:论文Figure 1。四列从左到右分别是只检测、人工指定区域的视频编辑、检测后直接逐帧生成,以及AVR的“从其他帧复制可见背景、只生成从未观测区域”。右侧绿色路径表示来自视频本身的证据,蓝色路径表示生成内容。

一、为什么“检测后接一个修复器”并不够

过去的三类系统各自只解决了一半。异常检测能给出分数、框或掩码,却不会改动视频;训练免费的视频编辑可以按文字要求删物体,但仍需要人告诉它“删什么、删哪里”;视频修复能填掩码,却通常假设掩码已经准备好,并把掩码里的所有像素都视为同等未知。

把检测器和逐帧扩散修复简单串起来,会冒出三种错误。第一,检测框不等于可精细编辑的时空区域,生成器可能改到无关背景。第二,生成器不知道被遮挡背景其实在前后帧出现过,于是把可复制的信息重新猜一遍。第三,各帧独立猜测,没有约束同一位置连续长什么样,闪烁就会放大。

论文的核心观点不是“生成得更逼真”,而是不要生成那些已经有证据的东西。这句话看起来朴素,却改变了整条系统的决策顺序:先找证据,再判断需要多少生成,而不是先调用最强生成器,最后祈祷它别乱画。

二、先把异常区域拆成两半:见过的与从未见过的

设整段视频中,异常曾经占据过的空间位置集合为U。论文再把U拆成两部分:Uobs表示至少在某一帧没有被异常遮住、因此能够从视频里观察到的像素位置;Ugen表示每一帧都被遮住、整段视频从来没有暴露过的位置。

论文公式(2)

Uobs = {p ∈ U:存在某一帧,mi(p)=0}
Ugen = U − Uobs

这里p是画面中的空间位置,mi(p)=1表示第i帧的该位置被异常掩码覆盖,等于0表示该位置在这一帧可见。直觉上,一辆移动的车会不断露出身后的路面,大量位置会落入Uobs;一盆植物从头到尾固定挡住墙角,墙角可能一直属于Ugen。

论文还给出一个最坏情况结论:若背景在时间上保持不变,Uobs里的像素可以通过复制做到精确恢复;Ugen因为没有任何观测,任何只读取未遮挡像素的估计器都无法保证还原真值。视频变长时,只要某个位置曾被露出来,它就会从“只能猜”转到“可以复制”;但若遮挡始终不动,窗口再长也没有帮助。

这条公式的用途是决定哪里可以信任观测,哪里只能接受生成风险。它的限制同样清楚:结论依赖近似静态背景。镜头剧烈运动、树影大幅变化、显示屏内容不断刷新时,“同一位置的时间中值”未必就是正确背景。

三、第一步:让语义检测必须接受运动证据复核

异常是开放集合,系统不能预先穷举“自行车、购物车、跌倒的人、遗落物”全部类别。AVR因此使用开放词汇检测器,以固定提示语寻找“异常物体、外来物体”之类候选框,再用可提示分割模型把框变成像素掩码。这样保留了语义模型发现未知对象的能力,但也会把长椅、阴影或普通行人误当异常。

为降低这种误报,论文从整段视频计算时间中值背景,并把偏离中值超过均值加3倍标准差的位置记为运动区域。一个语义候选框只有至少35%的面积与运动区域重合,才被保留。没有任何运动证据时,系统回退到不加运动门控的检测,避免静态异常被门控直接清空。

这是一种“语义提案+物理迹象”的组合。语义模型负责说“它看起来像异常对象”,像素变化负责追问“视频本身是否支持这个判断”。在论文的检测对照中,运动门控在Avenue和上海科技大学监控数据集的峰值信噪比、感知距离、视频分布距离和掩码交并比上都领先其他检测方案。

四、第二步:三种恢复器不是排队上,而是竞争上岗

拿到时空掩码后,系统不押注单一路线,而是生成三个候选。第一种是经典光流引导填充:沿帧间运动轨迹传播已观测像素,速度快、结果保守。第二种是“先复制再轻度扩散”:先用经典方法填出底稿,再以0.7强度部分加噪,让扩散模型在已有估计上细化,而不是从纯噪声自由发挥。

第三种是背景条件扩散。系统逐像素统计未被掩码帧的时间中值,形成背景先验B̄;Uobs位置直接使用B̄,只有Ugen交给冻结的图像修复扩散模型。论文使用Stable Diffusion 1.5修复检查点,输入分辨率512×512,25步去噪,引导强度7.5,所有模型参数都保持冻结。

三条路线可以理解为三档风险。经典填充几乎不主动创造内容,适合运动轨迹清楚、背景曾充分出现的片段;先验锚定扩散允许模型修改底稿,但起点仍来自视频证据;背景条件扩散给模型的自由度最大,却把自由度限制在从未观测区域。与传播式视频修复方法(ProPainter)相比,AVR多了自动检测与证据分区;与扩散式视频修复方法(DiffuEraser)相比,它不为当前任务训练专用模型,而是在推理时控制生成范围。

论文公式(4),为便于手机阅读保留等价结构

x̂i = (1−mi)⊙xi + mi⊙(1−u)⊙B̄ + u⊙Gdiff(ci,u)

xi是原始第i帧,mi是异常掩码,u标记Ugen,B̄是视频自身的背景中值,Gdiff是扩散修复器,⊙表示逐像素相乘。第一项原样保留掩码外区域;第二项把可观测背景复制进掩码;第三项只补全从未见过的位置。公式最重要的不是符号,而是生成权限被压缩到u=1的区域

图2:论文Figure 2。上半部分由开放词汇检测、运动门控和分割模型形成掩码;下半部分并行产生经典填充、先验锚定扩散、背景条件扩散三个结果,再由冻结验证器选出整段视频的获胜者。蓝框是冻结模型,绿框是从当前视频读出的证据,橙框是论文的决策逻辑。

五、谁来选结果:一个不看干净答案的冻结验证器

真实异常没有“删掉异常后的干净视频”可供对照,所以系统不能按参考答案挑候选。论文让冻结验证器同时看两件事:一是当前帧与前一帧经过光流对齐后的差异,差异越小通常越稳定;二是掩码区域还剩多少异常语义残留,越低说明删得越干净。

候选k的选择可概括为k* = argmink[w·Êwarp(k)+(1−w)·R̂semantic(k)]。两项先在候选池内做最小—最大归一化,w在0到1之间平衡时间稳定性与异常语义残留,论文固定为0.5。它不是判定“画面绝对真实”,而是在三个已经生成的候选里找相对更稳、更不像异常的一个。

为什么必须归一化?因为光流误差与语义残留不在同一量纲,直接相加时数值更大的那项会天然支配选择。池内归一化把三个候选在两项指标上的相对位置都压到可比区间,再由w决定偏好。局限是候选池只有三个:如果三者都错,验证器仍只能选出“相对没那么差”的结果;视觉语义模型认为异常减少,也不保证被补出的具体物体或纹理符合真实历史。

为了进一步压闪烁,所有帧共享同一个扩散噪声种子;从第二帧开始,当前恢复结果还会与前一恢复帧的光流变形结果在掩码内混合,权重λ固定为0.5。λ越大越忠于当前帧,越小越依赖历史传播。这个办法轻量,但光流一旦估错,也可能把上一帧错误继续带下去。

六、实验怎么做:既要有干净答案,也要面对真实异常

真实监控异常没有同一时刻的“无异常平行世界”,难以直接计算恢复误差。论文因此先从Avenue、Ped2和上海科技大学监控数据集的正常片段构造注入实验:每套数据60个互不重叠的16帧片段,静态物体、移动物体、局部外观闪烁各20个,注入前视频作为干净参考。随后又补充20个真实异常,只用无参考指标检查。

指标分三组。空间保真度看全帧峰值信噪比、结构相似度、感知距离,以及只在真实异常区域内计算的区域峰值信噪比;时间质量看相邻帧感知差异、光流变形误差和视频分布距离;异常是否真正减少,则看掩码交并比和“残留下降”。异常区域只占全帧约0.5%到1.2%,所以只看全帧分数很容易把局部失败平均掉。

论文特别说明,其视频分布距离使用三维残差网络的Kinetics动作特征,所有本论文数字彼此可比,但不能直接与采用另一套常见视频特征的公开数字横向比较。这种细节很重要:指标名字相同,不代表特征提取器、分辨率和统计口径相同。

几个指标可以这样直观理解:峰值信噪比更关心像素是否接近干净参考;感知距离更接近“视觉特征是否相似”;视频分布距离看整段片段的动态特征分布;光流变形误差则检查上一帧沿运动方向搬到下一帧后,内容能否对齐。它们关注点不同,所以一项方法可能单帧很清晰,却在时间上闪;也可能全帧平均分很高,但异常区域仍然补错。

七、给定正确掩码后:复制观测证据确实更稳

先看“Oracle掩码”实验,也就是直接提供真实异常区域,只比较谁填得更好。AVR在三套数据的全帧峰值信噪比和视频分布距离上全部第一:Avenue为47.27 dB和0.55,Ped2为52.63 dB和0.45,上海科技大学监控数据集为56.98 dB和0.56。

区域内部更能看出真实难度。AVR在上海科技大学监控数据集达到37.83 dB,领先所有对照;在Avenue和Ped2分别为27.17与32.61 dB,略低于端到端流引导修复方法(E2FGVI)的27.34与33.33 dB,但差距不到1 dB。换句话说,它并非每个局部指标都碾压训练型修复器,却能在不针对目标数据训练的条件下,保持非常接近的区域质量,并把全帧与时间分布控制得更好。

表1:论文Table 2。在三套监控数据的正确掩码条件下,对比经典填充、三种训练型视频修复器和两种训练免费生成方法。AVR灰色行在三套数据的全帧峰值信噪比与视频分布距离上均为最佳;区域峰值信噪比在上海科技大学监控数据集最佳,在另外两套接近最优。

八、把检测也算进去:最大的收益来自掩码,而不只是修复器

端到端实验里,AVR自己检测掩码,再完成恢复。与“开放词汇检测+无约束逐帧扩散”的基础链相比,AVR在上海科技大学监控数据集的全帧峰值信噪比从22.23 dB升到40.08 dB,增加17.85 dB;在Avenue和Ped2也分别达到33.79与44.00 dB。更关键的是,Avenue与第三套数据的残留下降变为正值,基础链则是负值,说明基础链修完以后反而引入了更多异常感受。

不过,端到端结果不能全算在恢复模型头上。把ProPainter使用的第二代通用分割模型(SAM2)掩码换成AVR的运动门控掩码,第三套数据的峰值信噪比就从25.50跳到38.53 dB,提升约13 dB。消融实验也显示,运动门控相对原分割掩码使三套数据提高5.2到15.3 dB;背景先验则是正确掩码条件下最大单项贡献。

超参数扫描也给出了一些工程提示。Avenue上,时间混合权重λ约0.35时视频分布距离最低,说明适度依赖上一帧有助于稳定;λ太小会过度传播历史,太大又接近逐帧独立修复。检测阈值在不同数据集上的趋势相反,论文最终没有逐数据集调参,而是所有实验共用阈值0.25。扩散步数从15增加到25有明显收益,继续增加到35和50并非单调改善,更多计算不自动等于更好视频。

图3:论文Figure 3。同一行的恢复器使用相同运动门控掩码。列从左到右为输入、掩码、经典填充、ProPainter、E2FGVI、AVR和干净参考;每行展示一段片段的中间帧。移动对象通常能暴露背景,静态对象和局部外观变化更难。

验证器也不是装饰。在正确掩码下,三套数据中有35%到56%的片段会选择经典或先验锚定候选,而不是一律选择背景扩散;在检测掩码可能覆盖干净背景时,它又有87%到93%的片段退回更保守的背景扩散。候选选择随掩码质量变化,说明三种恢复器确实覆盖了不同情形。

九、真实异常:84%不是论文原话,而是可复算结果

20个来自上海科技大学监控数据集的真实异常没有干净参考。AVR处理前的区域闪烁为21.12,处理后为3.32,下降量17.80;17.80÷21.12=84.28%,因此标题按整数写“真实异常闪烁降低84%”。这是根据论文表格做的派生计算,不是论文作者使用的宣传措辞。

同一组实验中,20/20片段的闪烁都改善,光流变形误差从0.95降到0.84,残留下降为+0.721。作为对照,检测后逐帧扩散的闪烁从12.77升到27.71,只有7/20片段改善,残留下降为−0.513。恢复后重新运行检测器,仍触发异常的帧比例从1.00降到0.42。

图4:论文Figure 9。前两行是骑车人真实异常:逐帧扩散在相邻帧分别生成行人与盆栽,AVR保持道路背景稳定;第三行是停放车辆。底部横轴为帧序号,纵轴为区域闪烁,橙色逐帧扩散曲线在后段出现明显尖峰,蓝色AVR曲线接近底部。

十、训练免费,不等于计算免费

“训练免费”的准确含义是:检测器、分割器、扩散模型和验证器都使用公开冻结检查点,不在目标数据集或当前场景上微调。它省掉的是数据标注、场景训练和模型更新,不是推理算力。完整系统要跑检测、三个恢复候选和验证器,账单集中到了推理阶段。

在英伟达A5500显卡上处理一个16帧片段,检测约6.81秒,运动门控0.05秒,经典填充0.21秒,先验锚定扩散19.11秒,背景扩散20.74秒,验证器3.72秒。完整AVR总计62.52秒,即每帧3.91秒,峰值显存约9.2吉字节。单恢复器版本为25.84秒,ProPainter只需7.54秒、峰值2.7吉字节。

它目前更像离线取证、事后清理或低吞吐复核工具,而不是实时监控主链路。如果工程现场更看重报警速度,应把检测与恢复解耦:检测先实时运行,只有少量高价值片段进入重型恢复;或者先用单恢复器版本筛选,再对争议片段启用三候选验证。

十一、最难的失败:静态异常把证据永久挡住

论文把所有负残留下降按异常类型拆开后,规律非常整齐:移动对象在三套数据分别为0.55、0.61、0.86,局部外观变化为0.13、0.26、0.32,全部为正;静态对象则为−0.31、−3.78、−0.41,全部为负。不是模型恰好怕某个数据集,而是信息结构决定了难度。

图5:论文Figure 7。横轴依次为移动对象、局部外观变化、静态对象,纵轴为残留下降,数值越高越好。三种颜色对应三套数据;静态对象三组柱都跌到零线以下,其中Ped2为−3.78,图中纵轴在−1.15处截断。

静态物体若从第一帧到最后一帧始终挡住同一位置,Ugen会占满整个异常区域,公式(4)就退化为无观测约束的生成。它还缺少运动迹象,检测阶段同样吃亏。论文定性案例中,静态物体有一半落在掩码外,另一半背后的背景从未出现,AVR和训练型修复器都无法正确恢复。

此外,实验主要是固定机位、16帧、256×256评测片段,扩散阶段在512×512运行。大幅运镜、复杂动态背景、长时间遮挡、强光照突变和超长视频并未得到同等验证。画面被“修好”也不代表事件事实被恢复:在安全、司法或医疗场景,生成区域必须保留可追踪标记,不能把推断内容当原始记录。

十二、工程价值:最值得借鉴的是“证据预算”

对监控、工业安全和照护视频,AVR的直接价值是把“发现异常”推进到“生成更易复核的正常背景候选”。但更可迁移的价值,是它把恢复任务写成一份证据预算:可观测区域用确定性路径,从未观测区域才消费生成模型的不确定性预算。

这个原则不只适用于删异常。视频去物体、遮挡补全、老片修复、行车记录清理、机器人视野遮挡,都可以先问三件事:其他时间是否见过?邻近视角是否见过?外部传感器是否见过?只有答案都是否定的区域,才应进入开放生成。这样不仅减少幻觉,也更容易向用户解释结果从哪里来。

工程落地还需要补三块。第一,把像素按“复制、传播、生成”写入来源图,支持审计与回滚。第二,用轻量质量模型提前淘汰明显差的候选,避免每段都跑满三条重链。第三,让检测置信度、可观测比例|Uobs|/|U|和业务风险共同决定是否自动修复;高风险片段宁可保留原视频并提示人工复核。

还可以把系统做成分级服务。第一层只输出异常掩码和可观测比例,成本最低;第二层在Uobs占比较高时使用经典传播,优先交付可解释结果;第三层才启动扩散候选与验证器,并把生成像素显式标色。这样,算法不再对每段视频一视同仁,而是根据“有多少真实证据”决定花多少算力、允许多大生成自由度。

龙哥点评

龙哥觉得,这篇最漂亮的地方不是把若干现成模型串起来,而是给生成模型加了一道“使用条件”。现在很多系统习惯把扩散模型当万能胶,缺一块就生成一块;AVR反过来要求系统先证明“这里真的没有证据”,才允许生成。这个顺序比换一个更大的生成骨干更重要。

第一,真实价值在信息分层,而不是“训练免费”四个字。冻结检查点降低了场景训练门槛,但62.52秒处理16帧说明成本没有消失,只是从训练转移到推理。团队评估时必须同时看标注成本、显存、延迟和人工复核成本。

第二,84%的闪烁下降值得重视,但不能替代更大规模真实评测。20个真实片段、20/20改善很有吸引力,却仍不足以覆盖多机位、天气、夜间、镜头抖动和长时遮挡。它证明路线有希望,不等于已经成为通用视频修复方案。

第三,失败案例反而让论文更可信。静态物体三套数据全部失败,与Ugen缺乏观测的理论分析一致。一个系统知道自己为什么失败,通常比只在平均分上赢一点更有工程价值,因为这让产品可以设置清晰的自动化开关。

龙迷三问

1. 既然其他帧能看到背景,为什么不只用传统光流复制,完全不用扩散模型?

因为背景可能只露出一部分,光流还会受遮挡、纹理不足和运动估计误差影响。经典复制最稳,却不一定填得完整;先验锚定扩散可以在已有底稿上修边,背景条件扩散则负责从未观测区域。论文的验证器不是把扩散设为默认答案,而是在三种风险不同的候选中逐段选择。

2. “训练免费”是否意味着换一套监控视频就能直接用?

参数层面不需要为新数据集训练,这是它的优势;但检测提示、阈值、镜头运动、分辨率、异常大小和算力预算仍会影响结果。论文使用一组共享阈值覆盖三套固定机位基准,说明有一定迁移性,却没有验证所有真实摄像头。上线前仍需用本场景片段做离线压力测试。

3. 恢复后的视频能不能当作真实证据?

不能直接等同。Uobs区域有来自其他帧的观测依据,Ugen仍是模型生成;即使视觉自然,也可能与真实背景不同。更稳妥的产品形态是同时保存原始视频、恢复视频、掩码和像素来源图,把恢复结果用于辅助观察,而不是覆盖原始记录或替代事实判断。

本文基于龙哥读论文数据库进行汇总整理。

文中“真实异常闪烁降低84%”由论文Table 7的21.12与3.32计算得到:(21.12−3.32)÷21.12=84.28%,取整数表达,并非论文原文措辞。

本文为论文解读与工程分析,不构成对监控、取证、医疗或安全系统的部署建议。涉及生成补全的视频应保留原始记录并由专业人员复核。

原论文:

https://arxiv.org/abs/2609.18836

https://arxiv.org/pdf/2609.18836

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球