← 返回 PaperDaily 视觉与图像

白捡0.5dB?福州大学ANCHOR让视频恢复SOTA还能再涨分

视频恢复网络费尽心思聚合相邻帧信息,却可能在局部区域修出更糟的结果。福州大学这篇ANCHOR不改造网络,而是把低质当前帧当作"锚点",用物理痕迹推断每一处该信网络还是该信原图,纯后处理就能让多种SOTA模型继续涨分。这种"事后纠错"的思路把"何时该相信时间聚合"这个被忽视的问题摆上了台面,值得一读。

白捡0.5dB?福州大学ANCHOR让视频恢复SOTA还能再涨分
原论文信息如下:
论文标题:
Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration
发表日期:
2026年08月

发表单位:
福州大学(Fuzhou University)

原文链接:
https://arxiv.org/pdf/2608.09342v1.pdf
视频恢复这些年有多火,不用龙哥多说了吧。各种Transformer、Mamba架构把时间维度的信息榨了又榨,指标一年比一年高。可有一件事,大家好像默契地没怎么问:网络输出里,到底哪些像素是真的“修好了”,哪些像素其实是“修崩了”?
不管你是给老电影去雨,还是把手机里过曝欠曝的视频拉回正常动态范围,恢复网络干的事本质上都是同一个:把相邻帧的信息借过来,补当前帧的缺失。但问题恰恰出在这个“借”字上——邻居家里也可能漏水啊。😏
福州大学这篇ANCHOR,干了一件反直觉的事:与其继续加深网络,不如回头看看那张低质量的当前帧。它固然有退化,但它和当前时刻是天然对齐的;那些轻微退化的地方,它说的才是真正靠谱的“大实话”。

视频恢复的“信任危机”:时间聚合为何会出错?

图2:ANCHOR-Correct总览
ANCHOR-Correct总览。锚点-提案关系被编码为关系感知特征R_t,引导异构物理痕迹的共识,形成增强表示H_t。得到的表示被解码为空间修正场M_t,用于选择性地结合恢复提案Y_t与当前帧锚点X_t。
先把镜头对准“时间聚合”。视频恢复和单图恢复最大的不同,在于可以利用前后帧的互补信息:这一帧被雨糊住的屋顶,可能在相邻几帧里是清晰的;这一帧过曝的天空,可能在别的帧里曝光正常。于是主流做法——无论是基于光流传播、注意力融合还是状态空间建模——都在做同一件事:把参考帧的信息搬运、对齐、融合到当前帧。
听起来很完美?问题在于,参考帧本身并不一定可靠。物理成像退化(比如HDR重建中的曝光差异、视频去雨中的动态遮挡、反光消除中的光学叠加)会导致帧与帧之间出现不一致的证据:物体运动带来的内容错位、遮挡导致的信息缺失、光流估计不准产生的对齐误差,都会让时间聚合在某些局部区域给出“自信但错误”的修改。网络以为自己在补信息,实际上是在一本正经地编故事。
图1:时间聚合可能引入局部不可靠的修改
(a)将参考帧X_(t±1)与当前帧X_t聚合可能会引入局部不可靠的修改。(b)ANCHOR预测一个修正场M来将恢复提案Y_t向当前帧锚点修正。
现有方法大多在“怎么聚合得更好”上做文章:更鲁棒的对齐、更精细的融合权重、时间一致性正则化、光度校准等等。但一个更基本的问题被忽略了——聚合结果在不同空间位置的可靠程度,是否应该被显式评估?换句话说,
时间重建的结果,在哪些位置应该被信任,在哪些位置应该用当前帧的观测去纠正?
ANCHOR把这件事拆成了三步:先找出“物理痕迹”作为证据,再通过证据进行空间可靠性推理,最后沿着“锚点-提案残差”方向做自适应修正。

ANCHOR核心机制:物理痕迹引导的可靠性估计

ANCHOR的建模思路相当朴素。给定一个低质视频片段X_t(以t时刻为中心,前后各K帧),现有恢复网络F_φ会先产出一个“时间恢复提案”Y_t。
公式1:时间恢复提案的定义
公式1:时间恢复提案Y_t = F_φ(X_t)。X_t是以t时刻为中心的低质视频片段,F_φ为任意预训练的视频恢复网络,Y_t是网络聚合时间信息后输出的恢复结果。
ANCHOR不打算改动F_φ,而是引入低质当前帧X_t作为“观测锚点”,对提案Y_t做逐像素的可靠性加权修正:
公式2:锚点-提案修正公式
公式2:最终输出 = 当前帧锚点 + 修正场M_t ×(恢复提案 - 当前帧)。修正场M_t取值在[0,1]之间,相当于逐像素的信任插值系数:M_t接近1表示该位置的时间聚合结果更可信,保留网络输出;M_t接近0表示当前帧的观测更可靠,输出向锚点靠拢。
那么问题来了:这个M_t怎么学?ANCHOR的关键洞察是——物理退化过程会在图像上留下痕迹。比如雨水会造成局部高频干扰与纹理涂抹,HDR融合会产生亮度偏移与重影,这些痕迹是裁决“谁更可信”的天然证据。ANCHOR为此设计了三条“物理痕迹观察器”(Heterogeneous Physical-Trace Observation, HPTO):
辐射量痕迹(Radiometric Trace):利用当前帧锚点,分析极端强度响应、局部光照变化和局部对比度,判断当前帧在辐射度层面保留了多少可靠信息。
结构痕迹(Structural Trace):利用锚点-提案残差,提取多尺度高频响应、拉普拉斯响应和局部方差,捕捉结构变化和恢复引入的修改痕迹。
时间一致性痕迹(Temporal Consistency Trace):结合当前帧与相邻帧,用双向帧差、三帧中值偏差、二阶时间差分和时间方差来度量跨帧一致性。
公式3:物理痕迹响应提取
公式3:每个观察者e通过J个物理启发的解析算子Φ^e作用于输入视图V_t^e,得到可解释的痕迹响应A_t^e。这些响应不是物理量本身,而是物理退化在成像过程中留下的图像域痕迹。
光提取原始响应还不够,因为不同场景下哪些测量更可信是变化的。HPTO先对痕迹做轻量有界校准,再用“全局统计+局部响应”共同估计每个测量的自适应权重,最后聚合成紧凑的观察者摘要。这一套流程既保留了物理启发的可解释性,又给了网络足够的灵活性。
接下来,ANCHOR引入证据保持密集共识(Evidence-Preserving Dense Consensus, EPDC)。这个模块名字有点长,思路却很好懂:三条痕迹各自给出判断后,需要决定“听谁的”。EPDC以锚点-提案关系特征为条件,估计不同类型痕迹的软路由权重,同时保留完整痕迹响应作为密集决策证据,避免压缩摘要造成信息丢失。
公式8:观察者级路由权重
公式8:EPDC中不同痕迹族之间的路由权重ρ_t^e,由关系感知特征R_t和观察者响应F_t^e共同决定,实现自适应的多证据融合。
最后,相对风险解码器(Relative-Risk Decoder, RRD)将增强表示解码为单通道修正场。RRD学的不是绝对误差,而是“当前帧锚点与恢复提案之间的相对信任度”,再通过一个可学习的全局修正强度缩放为最终修正场。这种设计让不同任务可以通过调整全局强度来适配,而不必重新设计架构。

两大变体解析:ANCHOR-Correct与ANCHOR-Guide

ANCHOR框架贴心地提供了两种使用姿势,对应两种不同的落地场景。
图3:ANCHOR变体流程对比
图3:ANCHOR两个变体的流程对比。(a)恢复网络推理。(b)ANCHOR训练和推理:ANCHOR-Correct访问恢复提案进行输出修正,而ANCHOR-Guide不访问它预测修正场。(c)ANCHOR-Guide引导恢复网络微调,优化后的网络在推理时保留(b)中的ANCHOR-Guide配置。
ANCHOR-Correct:后处理模式。ANCHOR-Correct同时观察低质视频和恢复网络的输出提案Y_t,对提案做逐像素修正。这个模式适合恢复网络已经训练好、权重固定不便改动的情况。修正场被训练得“克制”而“精准”——只在锚点有足够证据的地方动手,其余区域保持网络原始输出。
ANCHOR-Guide:引导微调模式。ANCHOR-Guide只看低质视频,不访问恢复提案,预测一个“锚点相对权重图”,然后利用这个权重图去引导恢复网络的微调。微调后的网络会自己学会在锚点不可靠的区域重点优化,在锚点可靠的区域保持当前帧信息。推理时,微调后的恢复网络与ANCHOR-Guide并行运行,将输出结合为最终结果。
两种变体共享完全相同的HPTO、EPDC和RRD架构,只是输入不同。训练目标也相当优雅——直接沿用原任务损失,不需要额外的风险标注或伪标签:
公式13:ANCHOR训练目标
公式13:ANCHOR的训练目标沿用原始任务损失ℓ_Task(如L1或感知损失),通过修正后的输出Y_hat与真值G_t之间的损失来优化修正场的学习。
公式14:ANCHOR-Guide引导损失
公式14:ANCHOR-Guide的引导微调损失。分子是修正场M_t与任务损失的逐像素内积,分母归一化,使得优化重点聚焦在锚点不可靠的区域,同时避免对已由当前帧很好重建的区域做多余修改。
在龙哥看来,这种设计最大的价值在于“模型无关”:不修改恢复网络内部结构,不改变原有训练损失,不要求额外的退化合成管线。任何训练好的视频恢复网络,理论上都可以挂一个ANCHOR模块继续涨分。

实验验证:HDR重建与视频去雨的双重突破

论文在两个典型物理退化任务上做了验证:视频去雨和HDR视频重建。视频去雨使用RainSynLight、RainSynComplex和NTURain三个数据集,基础恢复网络选了DeLiVR和VDMamba;HDR视频重建在Vimeo-90K上训练,在DeepHDRVideo和Cinematic上评测,基础网络选了HDRFlow和NECHDR。对比方法也都来自近年顶会,包括DRSformer、MFGAN、F2HDR等。
表1和表2:定量比较结果
表1:RainSynLight、RainSynComplex和NTURain数据集上的定量比较(视频去雨)。表2:DeepHDRVideo和Cinematic数据集上的定量比较(HDR重建)。最优和次优结果分别用加粗和下划线标出。
从表1看,ANCHOR-Correct在VDMamba上的提升最为明显:RainSynLight上PSNR从38.67提升到39.20(+0.53dB),NTURain上从39.81提升到40.07(+0.26dB)。ANCHOR-Guide也能带来稳定增益,虽然幅度稍小。说明修正场确实找到了时间聚合的薄弱区域,并且补上了结构细节。表2的结果也颇有亮点:NECHDR搭配ANCHOR-Guide后,在DeepHDRVideo上PSNR-T从43.44提升到44.12(+0.68dB),HDR-VDP-2也有同步改善,说明引导微调让基础网络在保留当前帧可靠观测的同时,学会在真正缺失信息的地方花力气。
更让人放心的是开销。从表3看,ANCHOR模块本身只有2.02M参数、0.14TFLOPs计算量,运行速度高达30.54 FPS,远快于恢复网络本身。因此,ANCHOR-Correct对DeLiVR和VDMamba的推理速度影响很小(FPS从1.42降到1.24、3.51降到3.13),而ANCHOR-Guide因为与恢复网络并行,几乎不拖慢推理。
表3:ANCHOR复杂度分析
表3:ANCHOR变体在NTURain上的复杂度分析。可见ANCHOR本体的参数量和计算量都远低于主流恢复网络,额外开销完全可以接受。
定性结果同样直观。图4展示了视频去雨的可视化对比:VDMamba基线在去除雨纹时把屋顶边缘和条纹状细节一并抹平了,而ANCHOR-Correct在保持去雨效果的同时,把被误伤的结构细节捞了回来。修正掩膜清晰地显示:网络改动较大的区域,正是当前帧锚点认为风险较高的区域。
雨天输入
雨天输入(低质当前帧)
Correct Mask
ANCHOR-Correct修正掩膜
Rainy anchor
雨天锚点(当前帧观测)
VDMamba
VDMamba基线输出
ANCHOR-Guide
ANCHOR-Guide增强结果
ANCHOR-Correct
ANCHOR-Correct修正结果
GT
真值(GT)
图4:RainSynLight和NTURain数据集上的定性比较(视频去雨)。ANCHOR-Correct有效恢复了VDMamba过度平滑丢失的细结构。
HDR重建的定性结果同样说明问题。NECHDR基线在色调映射后存在明显的亮度偏差和重影,而ANCHOR-Correct修正了这些局部异常,让边缘更干净、色彩更贴近真值。
LDRs
LDR输入帧
Correct Mask
ANCHOR-Correct修正掩膜
Tonemapped anchor
色调映射锚点(当前帧观测)
NECHDR
NECHDR基线输出
ANCHOR-Guide
ANCHOR-Guide增强结果
ANCHOR-Correct
ANCHOR-Correct修正结果
GT
真值(GT)
图5:DeepHDRVideo和Cinematic数据集上的定性比较(HDR重建)。ANCHOR明显减轻了亮度错误和重影伪影。
消融实验同样扎实。表4对比了证据注入策略:直接把证据和特征拼接(Concatenation)、简单加法(Addition)都不如EPDC的自适应残差调制。表5则说明HPTO对整个框架至关重要——移除物理痕迹后,修正场失去可靠的决策依据,性能明显下降。
表4:证据注入策略消融
表4:ANCHOR-Correct在RainSynLight和DeepHDRVideo上的证据注入策略消融研究。EPDC的自适应残差调制优于简单拼接和加法。
表5:HPTO消融
表5:ANCHOR-Correct在RainSynLight和DeepHDRVideo上的HPTO消融。移除HPTO会同时禁用EPDC,因为没有物理痕迹证据可保留。
图6:Cinematic定性消融比较
图6:Cinematic数据集上的定性消融比较。移除HPTO后,修正场对重影区域的修正能力明显减弱。

总结与展望:后处理范式的新可能

ANCHOR最大的价值不在于某个惊艳的涨分数字,而在于它开辟了一个轻量、通用、低侵入的新范式:把“输出修正”从任务专属的后处理流程中解放出来,变成一种基于物理证据的可靠性推理。这种思路天然具有可扩展性——理论上,任何存在时间聚合的恢复任务(视频去雪、去雾、反光消除、旧影像修复)都可以挂载ANCHOR,甚至超分和插帧任务也能借鉴其“锚点-提案”的信任分配逻辑。
当然,ANCHOR也有明确的天花板:修正场的信息上限受制于当前帧本身的质量。如果某个区域在当前帧中已经彻底过曝、完全遮挡或严重退化,锚点提供不了有效证据,修正能力自然有限。另外,ANCHOR需要针对每个恢复网络单独训练一个修正模块,虽然训练成本不高,但“模型无关”不等于“零训练迁移”。未来如果能结合预训练大模型的先验知识做零样本输出修正,或者把物理痕迹换成隐式学习的退化表征,这个方向还有很大的想象空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?福州大学提出ANCHOR,一种模型无关的视频恢复校正框架。它把低质量当前帧视为观测锚点,利用物理痕迹估计空间信任场,自适应调节恢复结果与原始观测的融合,在HDR视频重建和视频去雨任务上稳定提升多种SOTA模型。
这篇工作最值得看的点是什么?ANCHOR-Correct在视频去雨任务上对VDMamba提升显著(RainSynLight PSNR从38.67提升至39.20,+0.53dB),对DeLiVR也有稳定提升;在HDR视频重建任务上对NECHDR提升明显(DeepHDRVideo PSNR_T从43.44提升至44.12,+0.68dB)。ANCHOR-Guide在多数数据集上也有稳定增益。整体呈现精度全面第一或第二的态势。
这篇工作的边界或风险在哪里?优点:(1) 提出新颖的模型无关后处理框架,无需修改恢复网络架构即可提升性能;(2) 物理痕迹引导的可靠性估计具有较强可解释性;(3) 计算开销极小(仅2.02M参数),易于集成到现有系统;(4) 在两类物理退化任务上均验证了有效性。缺点:(1) 校正幅度受限于锚点与提议的残差方向,当锚点本身严重退化时校正能力受限;(2) 需要针对不同任务调整训练超参数;(3) 对极端退化场景(如完全遮挡)的校正效果可能有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出ANCHOR框架,将当前低质量帧作为时间对齐的观测锚点,通过估计空间信任场自适应校正预训练视频恢复网络的输出,以解决时间聚合引入的不可靠修改问题。

实验合理度:★★★★☆

视频去雨:PSNR、SSIM;HDR视频重建:PSNR_T(μ律色调映射域)、SSIM_T、HDR-VDP-2(固定28英寸显示对角线、55cm观看距离)

学术研究价值:★★★★☆

提出ANCHOR框架,将当前低质量帧作为时间对齐的观测锚点,通过估计空间信任场自适应校正预训练视频恢复网络的输出,以解决时间聚合引入的不可靠修改问题;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

ANCHOR仅需0.14 TFLOPs,推理速度30.54 FPS,远快于所集成的恢复网络(如DeLiVR 1.08 TFLOPs/1.42 FPS,VDMamba 0.43 TFLOPs/3.51 FPS),额外开销极小。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 校正幅度受限于锚点与提议的残差方向,当锚点本身严重退化时校正能力受限;(2) 需要针对不同任务调整训练超参数;

主要参考文献

[1] Lin Y, Qiu L, Ren G, et al. Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration. arXiv:2608.09342, 2026.
[2] Sun P, et al. VDMamba: Video Deraining with State Space Models. CVPR, 2025.
[3] Sun P, et al. DeLiVR: Degradation-aware Light-weight Video Restoration. ICLR, 2026.
[4] Xu G, et al. HDRFlow: Real-Time HDR Video Reconstruction with Large Motions. CVPR, 2024.
[5] Cui Y, et al. NECHDR: Noise-robust Exposure-interpolated HDR Reconstruction. ACM MM, 2024.

融会贯通

结合PaperDaily已收录论文可观察到,视频恢复方向近期的主流创新还是集中在网络结构与时序建模上,比如新的Mamba架构、任务特定的退化先验、更鲁棒的光流对齐等。像ANCHOR这样在“输出端”做可靠性校正的范例确实相对少见,因此它提供了一个比较独特的切入角度。
不过龙哥也要提醒一句:不同论文在训练数据构造、退化模拟方式和评估协议上往往存在不小差异,ANCHOR实验里观察到的提升幅度,是在作者特定的数据划分与训练策略下获得的。和PaperDaily收录的同类结果对比时,不能直接视为普遍绝对优势,横向对比仍要考虑split和setting差异。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频恢复想涨分?学学ANCHOR——换个思路,把低质帧当锚点,网络不动也能纠错提效!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。