← 返回 PaperDaily 视觉与图像

CVPR 2026浙大新作:2万对物理真实模糊数据,局部去模糊SOTA

拍跑步的人、旋转的车轮,结果只有物体糊背景清晰——这就是局部运动模糊。过往数据集要么合成失真、要么采集昂贵且对不齐。浙大这篇CVPR 2026工作用工业相机物理级还原曝光过程,搞出2万+真实配对数据,训练出的模型在ReLoBlur真实场景上照样能打,这活儿干得漂亮。

CVPR 2026浙大新作:2万对物理真实模糊数据,局部去模糊SOTA

paperdaily_reaction_gif


原论文信息如下:
论文标题:
OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring
发表日期:
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 22626-22635
发表单位:
Zhejiang University(浙江大学)
原文链接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Yu_OMoBlur_An_Object_Motion_Blur_Dataset_and_Benchmark_for_Real-World_CVPR_2026_paper.pdf
项目链接:
https://yudingchuan.github.io/OMoBlur_homepage/
开源代码链接:
https://yudingchuan.github.io/OMoBlur_homepage/
开源数据集链接:
https://yudingchuan.github.io/OMoBlur_homepage/

真实世界局部运动去模糊为何如此困难?

先问个问题:大家拍照的时候,有没有遇到过这种情况——背景清清楚楚,但画面里跑步的人、转动的车轮却糊成一团?这种只在画面局部出现的模糊,就是今天的主角:局部运动模糊(local motion blur)
可能有人觉得,这不就是普通去模糊嘛,直接端到端训练一个网络不就行了?事情没那么简单。这里有个核心难点:空间异质性(spatially heterogeneous)——模糊只出现在运动的物体上,而静态背景仍然是清晰的。如果网络不分青红皂白地对整张图做去模糊,背景反而会被搞出伪影和畸变。所以,局部运动去模糊本质上是一个“既要恢复模糊区域,又要保持背景纹丝不动”的精细活。
然而,这个方向长期被一个更基础的问题卡住——没有好的训练数据。之前学术界主要靠两条路来获取模糊-清晰配对数据:
第一条是真实拍摄,代表作是 ReLoBlur,用分光镜同时拍模糊和清晰两路。思路简单直接,但代价很高——分光镜装置十分笨重,放大规模采集很困难;更要命的是,光学路径和电子器件会引起几何与光度上的残余不对齐(residual misalignment),直接影响训练效果。
第二条是合成模糊,主流做法是拿高速相机连拍多帧清晰图,再叠加平均模拟模糊(如经典的 GoPro 数据集)。这种方法成本低、好扩展,但它是建立在简化的成像模型之上——直接用伽马函数近似逆相机响应,或者用插帧把轨迹补连续。问题恰恰出在这:真实曝光是一个连续的光子积分过程,插帧和伽马近似只能是“看起来像”,物理上并不一致,于是出现了域间隙(domain gap)——在合成数据上练得好好的模型,一到真实场景就严重掉链子。
既有数据集要么贵且对不齐,要么物理失真。有没有第三条路?本文给出的答案是:用可编程工业相机在采集中真正地“模拟”一次曝光积分过程,让合成模糊的物理形成过程与真实模糊几乎一致。这就是来自浙江大学的研究团队在CVPR 2026上提出的 OMoBlur 数据集和 OMDNet 方法所做的核心工作。

物理一致的曝光建模:OMoBlur数据集的核心创新

OMoBlur 的出发点很朴素:既然模糊是曝光时间内光子不断累积形成的,那合成模糊就应该尽可能还原这个累积过程,而不是在 RGB 空间里做近似。想要讲清楚这点,得从成像公式说起。
相机传感器上每个像素的 RAW 值,本质上就是曝光时间内落在该像素上的光子总数经过电路转换后的结果。用公式表示就是:
公式1
其中,Nph 是曝光区间 ΔT 内像素 (x,y) 累积的光子数,p(t,x,y) 是 t 时刻的光子到达速率,G 是传感器增益,ε 是光电转换链路中的噪声,C(·) 表示光子到数字信号的转换过程。
如果场景在曝光时间内发生了位移,那么最终图像就是这段时间内所有光子的叠加。所以从理想化的角度,模糊图像 B 可以看作把 n 帧连续 RAW 帧累积平均后再经 ISP(图像信号处理,Image Signal Processing)转换成 RGB:
公式2 公式3
这里的 g-1(·) 是逆相机响应函数,作用是把 ISP 输出的 RGB 图像映射回与光子累积近似的线性域。理论上,当逆相机响应能精确取到 ISP 的逆过程、且子帧时间连续无缝隙、增益恒定时,上述模型就和真实曝光 n·Δt、增益 G/n 的图像近似等价了:
公式4
问题在于,消费级相机输出的 RGB 图像根本不知道 g-1 是什么。以往的方法用伽马函数近似或者模拟逆 ISP,本质上都是在“猜”。而 OMoBlur 的做法是:直接干掉 g-1 这一步
研究团队选用了一台 Basler a2A1920-160ucBAS 工业相机,因为它可以直接输出 RAW 数据。这样一来,g-1 就精确等于 ISP 的逆过程,物理模型的前提被完美满足了。但光有 RAW 还不够,还有一个硬件层面的拦路虎:有效曝光比(valid exposure ratio)ρt——相邻帧之间真正用于曝光的时间占比。消费级相机受限于读出时间,ρt 通常只有 10% 左右,这意味着每帧之间有 90% 的时间“黑洞”,累积出来的轨迹是断续的、不自然的。之前也有工作用 RAW 来消除 g-1,但 ρt 被硬件卡死在 10% 左右。
OMoBlur 用了一个相当硬核的技巧:重叠采集(overlapping acquisition)。简单来说,通过硬件编程控制,让下一帧的曝光在上一帧的读出一开始就启动,而不是等读出完了再曝光。这样一来,曝光时间可以覆盖几乎整个帧周期。配合只读取 1920×360 的局部 ROI(感兴趣区域,Region of Interest),把读出时间压缩到 1921 微秒,再将曝光时间设为 1960 微秒,最终在 500fps 的采集速率下实现了 98% 的有效曝光比。这下累积出来的轨迹和真实曝光几乎无异了。
图2
图2:采用工业相机进行重叠图像采集的示意图。
不过 98% 毕竟不是 100%,还残留 2% 的曝光间隙。为了进一步缩小这最后一小段域间隙,团队从成像几何出发仔细选了镜头:Basler C23-0824-5M,8mm 焦距。在这个配置下,曝光间隙内运动物体在像平面上的位移不超过 0.1 像素——物理上完全可以忽略不计。
数据采集上,团队从刚体运动学角度将物体运动分为面内运动(in-plane motion)面外运动(out-of-plane motion)两大类。面内运动包括垂直于光轴的平移和绕光轴的旋转,其模糊可以用 2D 图像变换描述,是相对受限的问题;面外运动则包含沿光轴的平移和俯仰/偏航旋转,会引入尺度缩放、自遮挡等 3D 几何效应,严重病态。为了全面覆盖从易到难的模糊类型,团队拍摄了行人、车辆、球类运动等多种活动,还打印了现代海报和中国传统书画,手持相机运动以丰富复杂纹理场景。
图3
图3:OMoBlur数据集生成流程及示例。绿色和红色框分别标记清晰图像和模糊图像的放大区域;灰色虚线框表示算法生成的模糊掩码。
整个生成流程如图3所示:先将连续的 RAW 帧叠加平均经 ISP 得到模糊图;中间帧经过 ISP 单独处理作为清晰真值;同时对相邻帧用 MeFlow 估计光流来生成模糊掩码。最终发布了超过 2 万组 blur-sharp-mask 三元组,训练集 18,910 对、测试集 1,354 对,成为目前最大规模的物理真实局部运动模糊数据集。这里特别值得一提的是,团队认识到算法生成的掩码在重复纹理或暗背景处可能有误,所以在测试集中人工修正了不准确的掩码,以保证公平评估。

OMDNet:运动感知与自适应门控的巧妙融合

有了好数据,还要有好算法。OMoBlur 的配套网络 OMDNet 设计的核心思路是:把“哪里模糊”和“怎么恢复”分开处理,互相促进。整个网络采用 U-Net 架构和 SIMO(单输入多输出,Single-Input Multiple-Output)配置,用双路径的 Motion-Appearance Extract Block(MAEB)替换普通跳连。先看整体架构:
图4
图4:本文提出的OMDNet网络架构。
MAEB 内部用 NAFNet 的 NAF-Block 作为共享主干,然后分裂成两个分支:表现分支(appearance branch)继续用 NAF-Block 提取内容特征;运动分支则由叫 Diff-TAM(差分转置注意力模块,Differential Transposed Attention Module) 的模块处理。Diff-TAM 这个名字很有理工科味道——灵感来自电子工程中的差分放大器和语言建模中的差分注意力机制。它的核心洞察是:通过比较两条注意力路径来压制背景响应,从而把运动模式的信号“差分”出来。这比直接学习运动特征要干净得多。转置注意力用 Restormer 风格在通道维度上操作,且只在 MAEB 中使用以控制计算量,可谓“好钢用在刀刃上”。
图5
图5:运动-表现提取块(MAEB)和流引导门控预测器(FGP)的架构。
运动分支提取的特征接着被送入 流引导门控预测器(FGP,Flow-guided Gate Predictor)。FGP 综合运动特征与上采样的低层光流,预测双向光流 F = {F-0, F+0} 和流掩码 O ∈ [0,1]。光流幅度 ‖F‖ 与光流拼接后生成门控图 Ĝi,供后续自适应融合使用。这里有个精妙的设计:光流预测不仅直接监督运动特征,更承担“引导门控”的职责——光流估计得越准,门控对模糊区域的定位就越准;反过来,门控信号也会让编码器更专注于运动区域的特征表达,形成良性循环。
除了网络结构本身,OMDNet 还提出了一套很有意思的自适应门控融合机制(AGF,Adaptive Gated Fusion)。以往的方法(如 LBAG)直接要求预测门控匹配真值掩码,再同时要求门控后的恢复结果接近清晰图。这个思路看起来很顺理成章,但有个隐患:算法生成的掩码本身有误差,直接当硬标签用会教坏网络。而且模糊-清晰配对中残余的轻微不对齐很容易让门控在静态背景上错误激活。
AGF 的策略是:掩码不是硬标签,只是一个软先验(soft prior)。具体来说,训练时同时计算两个门控输出:
公式5 公式6
其中 Bi 为模糊输入,Mi 为预生成掩码,⊗ 为逐像素乘法。标准形式驱动门控在模糊区域趋向 1;增强形式则利用混合目标——在背景区域用真值 Si 替换 Bi——驱动门控在背景区域趋向 0。两者联合监督,即使掩码不完美也能互补纠错。测试时只需输出标准形式即可,无需任何掩码输入。
损失函数设计也颇为考究。总损失包含四项:warp loss 直接监督光流,merge loss 软性地同时监督光和中间帧——这里用流掩码 O 来加权前后帧的融合权重,从而处理遮挡区域;restoration loss 强监督中间帧恢复结果;gated restoration loss 则自适应地监督门控和恢复。有个细节体现了对运动模糊本质的深刻理解:模糊图中的运动方向本来就有二义性(同一段模糊轨迹可能是从左往右也可能是从右往左产生的),所以在 warp loss 中网络可以自己选损失更小的方向来匹配,避免被固定方向约束压垮。

实验验证:从数据集基准到跨域泛化

在 OMoBlur 测试集上,研究团队将 OMDNet 与一系列开源方法进行了对比,包括 CNN 代表的 MIMO-UNet、NAFNet、LBAG,Transformer 代表的 Restormer、LMD-ViT,以及 Mamba 代表的 EVSSM。使用的指标包括全局 PSNR/SSIM、聚焦模糊区域的加权 PSNR/SSIM,以及 LPIPS 和 DISTS 两种感知质量指标。
表1
表1:OMoBlur数据集上的定量评估结果。加粗为最优值。
如表1所示,OMDNet 在所有指标上都取得了最优结果。尤其值得关注的是加权 PSNR/SSIM 和感知指标的大幅领先——加权 PSNR 达到 34.04dB,比第二名 LMD-ViT(33.55dB)高出近 0.5dB;LPIPS 从 0.2345 降到 0.2171,DISTS 从 0.0923 降到 0.0788,说明其恢复的纹理结构在感知上也更真实。全局 PSNR 的优势相对温和(35.73 vs 35.68),这并非缺陷,而是门控机制刻意压低背景改动带来的效果——与其强行把本来就清晰的背景“修一遍”引入伪影,不如明哲保身。
图6
图6:在OMoBlur数据集上训练的各种去模糊模型的视觉比较。(a) OMoBlur数据集中旋转球的恢复结果。(b) ReLoBlur数据集中运动汽车的恢复结果。
图6(a)展示了一个极具挑战性的场景——球体既绕自身轴旋转,其转轴还在空间中做复合旋转和平移。在这种复杂运动下,OMDNet 给出了最清晰、结构细节最完整的恢复结果。但一场好的实验不能只看自家数据上的自娱自乐,更重要的是跨域泛化能力。
团队做了一个很有说服力的对比实验:把 MIMO-UNet 和 Restormer 分别在 GoPro、OMoBlur-FI(对 OMoBlur 序列降采样后插帧合成的版本)、OMoBlur 上训练,再到真实数据集 ReLoBlur 上测试。这里有个细节:ReLoBlur 恢复的是起始帧而 OMoBlur 恢复的是中间帧,帧目标不一致导致分数不可直接比较,所以主要看视觉质量。
图7
图7:在真实世界ReLoBlur数据集上的跨数据集泛化视觉比较。
结果非常直观:在 GoPro 上训练的模型面对真实物体运动模糊几乎“只字未动”,MIMO-UNet 还会产生明显伪影;OMoBlur-FI 训练的模型对面内平移的低频内容(如白色车身)偶尔能去除部分模糊,但面对旋转车轮这种纹理丰富的情况和面外运动(如转弯的黑车)基本无能为力。反观 OMoBlur 训练的模型,在上述所有场景中都保持了强劲的去模糊能力。图8进一步说明,OMoBlur 和 FI 版本合成的模糊在肉眼上几乎看不出差别,但物理形成的差异在真实测试中暴露无遗。
图8
图8:两种模糊合成方式的视觉比较:物理真实的OMoBlur与帧插值(FI)版本。两种模糊结果在视觉上几乎无法区分。
正如团队在论文引言中用图1所展示的那样,一个在 OMoBlur 上训练的 LBAG 基线模型,就足以在 ReLoBlur 的挑战性场景中展现强大的真实模糊泛化能力。这有力地说明了数据集本身的质量优势——当训练数据的物理形成过程与真实一致时,即使网络结构不变,泛化能力也能大幅提升。
图1
图1:使用LBAG(局部运动去模糊基线模型)在挑战性场景上的去模糊结果。在OMoBlur上训练的模型展现了对真实模糊的强大泛化能力,得益于数据集的大规模、物理一致性和高质量。
消融实验同样做得很扎实(表2)。从最底层的骨架网络出发逐步加入模块:只加 MAEB 时,门控仅靠表现线索,缺乏运动特异性,提升有限;加入 FGP 后,光流监督的运动特征和门控图显著增强了运动聚焦能力;再叠加 Diff-TAM,运动建模效率进一步提升,最终达到全指标最优。
表2
表2:OMoBlur上OMDNet的消融实验。DTAM为Diff-TAM的缩写。
门控机制的对比也很有意思。图9展示了一个来自测试集的代表性案例:LBAG 的门控在静态背景上产生了很多假阳性激活,而 OMDNet 的 AGF 机制则准确定位了真正模糊的区域。图10进一步从静态区域保持的角度评估了门控的作用——没有门控时背景被明显修改,引入伪影;用 LBAG 的门控虽然稍有改善但仍有背景泄漏;而 OMDNet 的门控几乎让静态区域保持不变,其绝对误差图也佐证了这一点。
图9
图9:OMoBlur上的门控对比。(a) LBAG,(b) 本文方法,(c) 人工标注。本文方法的门控高亮了实际的模糊区域,同时避免了背景激活。
图10
图10:ReLoBlur上静态区域保持的评估。第二行图片从中心到两侧依次为:模糊输入、无门控去模糊、LBAG门控去模糊、本文门控去模糊。虚线插入图显示对应的门控预测。第一行显示恢复结果与输入之间的绝对误差图,上方标注平均绝对误差(MAE)。本文门控实现了最好的背景保持效果。
此外,论文讨论了一个颇有启发的现象:去模糊效果同时受绝对模糊位移和相对于物体尺寸的模糊程度影响。这可能与网络的感受野、处理能力和纹理混叠有关——即使大小风车叶片在曝光期间扫过相同的像素距离,小风车也会显得更模糊,并可能更早达到无法恢复的临界曝光时间;而大风车经过降采样后仍可能被成功复原。这一临界点还与叶片宽度密切相关。

局限与未来展望

OMoBlur 的发布无疑为局部运动去模糊树立了一个新标杆,但它也并非没有局限。
首先,数据集的运动场景以行人、车辆、球类为主,虽然在面内和面外运动上做到了系统覆盖,但距离“全场景覆盖”还有距离。其次,模型恢复的是曝光区间内的中间帧,这在一定程度上规避了运动方向二义性,但也意味着它不能直接用于任意时刻的恢复。另外,OMDNet 训练需要多帧监督信号,虽然在推理时只需单张模糊图,但训练成本是高于纯单帧方法的。最后,算法生成的掩码虽然通过 AGF 机制减轻了不良影响,但掩码质量本身仍然是制约门控精度的天花板之一。
未来值得探索的方向也很清晰:论文呼吁更系统地定义和研究网络能力与模糊图像特征之间的关系,从而指导数据集的构建、网络设计和训练策略。这其实是把问题从“怎么恢复”提升到了“恢复的极限在哪里”的层面。此外,如何将这种物理一致的采集方案推广到更多场景、如何减少对掩码监督的依赖、如何在保持背景不变的前提下进一步提升模糊区域的恢复精度,都是开放问题。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对现有去模糊数据集合成与真实模糊分布存在域差距的问题,浙大提出物理一致的物体运动模糊数据集OMoBlur,含2万+模糊-清晰-掩码三元组,并设计OMDNet网络,通过多帧光流引…
这篇工作最值得看的点是什么?OMDNet在所有指标上均取得最优性能,尤其在加权PSNR/SSIM和感知指标LPIPS/DISTS上提升显著,跨数据集泛化实验表明OMoBlur训练的模型在真实模糊图像上表现优异。
这篇工作的边界或风险在哪里?优点:1) 数据集构建物理一致性高,有效缩小合成与真实模糊的域差距;2) 网络设计巧妙,门控机制有效保护静态背景;3) 实验全面,包括跨数据集泛化验证。缺点:1) 数据集采集依赖特定工业相机硬件,可复现性受限;2) 网络结构相对复杂,推理…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

从数据集角度看,将有效曝光比推到98%的工业相机采集方案确实是开创性的,OMoBlur也是首个物理真实的累积式物体运动模糊数据集;从方法角度看,Diff-TAM和AGF机制整体设计巧妙,但各模块在组件层面仍有现有方法的影子,骨架也基于NAFNet与Restormer,综合创新略逊于数据集。

实验合理度:★★★★☆

主实验覆盖了CNN、Transformer、Mamba三个主流流派,消融实验逐模块验证,跨数据集泛化测试设计得很有说服力(GoPro vs OMoBlur-FI vs OMoBlur三组对照)。扣一星是因为跨数据集评估时因帧目标不同只做了视觉比较,缺少量化指标。

学术研究价值:★★★★☆

OMoBlur为局部运动去模糊提供了一个高质量的大规模数据底座,未来很长时间内都会是重要的benchmark。论文对“网络能力与模糊特征之间关系”的讨论也为后续研究开辟了一个新的思考维度。

稳定性:★★★★☆

OMDNet的门控机制在静态背景保持上表现出很强的鲁棒性,AGF机制对不完美掩码也有较好的容错能力。不过作为数据驱动方法,在掩码误差极大或模糊面积占比极小的极端情况下稳定性仍有待验证。

适应性以及泛化能力:★★★★☆

跨数据集测试中模型从OMoBlur迁移到ReLoBlur表现出色,说明物理一致的训练数据能有效提升真实泛化能力。但数据集中运动类型仍以行人、车辆、球类为主,对极端面外运动和特殊纹理的覆盖有限,扣一星。

硬件需求及成本:★★★☆☆

采集侧需要工业相机和可编程硬件控制,门槛不低;训练侧使用RTX 4090,500K迭代训练成本也不小。不过推理时OMDNet只需单张图像在单GPU上即可运行,这是加分项。

复现难度:★★★★☆

团队已经公开了数据集和代码,OMoBlur的采集方案有详细的硬件参数和流程说明,为复现提供了很好的条件。但由于涉及工业相机硬件环境和精确参数调校,完全复现采集过程仍有一定挑战。

产品化成熟度:★★★☆☆

OMDNet推理时只需单张模糊图,门控机制能有效保护静态背景,对于运动物体检测与恢复类应用(如体育摄影、视频监控)具备一定的产品化潜力。但端到端训练依赖多帧RAW数据和光流监督,数据获取成本较高,限制了其快速规模化落地。

可能的问题:跨数据集评估因帧目标不同缺少量化比较是一个遗憾;网络在加权指标上优势明显但全局PSNR优势微弱,需要更充分的论证来区分“设计使然”与“提升有限”。此外,OMDNet对掩码的依赖虽经AGF减轻但并未消除,掩码质量仍是影响门控精度的潜在瓶颈;消融实验中DTAM与FGP各自的增益幅度不大,其贡献的显著性有待更严谨的统计验证。


主要参考文献

[1] Yu D, Li J, Zhou J, et al. OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring. CVPR 2026: 22626-22635.
[2] Rim J, Lee H, Won J,

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球