← 返回 PaperDaily
视觉与图像
RealDefocus基准来了:散焦去模糊终于有统一考场
散焦去模糊最怕的不是模型不够大,而是各说各话、数据各跑各的。RealDefocus Benchmark把统一分割、统一协议、跨数据集验证都摆上台面,终于让“谁更强”不至于靠运气。
龙哥读论文
发布于 2026-08-14 09:11:24
阅读 4
查看原文
原论文信息如下:
散焦去模糊听起来像“把糊掉的照片修回来”,实际却很难:模糊随景深和镜头参数变化,输入和真值还常对不齐。这个基准的价值不在于又做了一个模型,而在于先把“怎么公平比较”这件事掰正了。
本文围绕 RealDefocus 数据集搭建统一评测协议,覆盖任务专用模型、通用恢复模型、运动去模糊模型和散景渲染模型,并加入跨数据集验证。结果说明,数据规模、真实度和覆盖范围,才是现代散焦去模糊模型能否站稳的底盘。
拍照时只要景深不够,焦外区域就会糊成一片。对人类来说,这可能只是“背景虚化”;对算法来说,这往往是一个既要恢复细节、又要猜测镜头成像规律的麻烦题。单张散焦去模糊的目标很直接:把一张失焦图,尽量还原成全清晰图。但它难在模糊不是统一的,而是随位置、深度、焦距和光圈一起变化,属于典型的“看起来像一类问题,实际上每个像素都在单独作妖”。
这篇论文没有急着再造一个更大的网络,而是先问了一个更现实的问题:散焦去模糊到底该怎么评,才算公平、可复现、还能真正反映泛化能力? 答案就是把 RealDefocus 这套真实数据整理成标准基准,统一训练、验证、测试划分,再加上跨数据集验证,让模型不只在自家数据上好看,也要在别的真实数据上站得住。
这也是本文最值得读的地方:它不是在“模型榜单”里卷参数,而是在“评测地基”上动刀。很多恢复论文看起来刷分很猛,一换数据就露馅;基准类工作虽然不那么花哨,却往往决定一个方向最后能不能从论文走到工程。
散焦模糊和运动模糊经常被放在一起讨论,但两者并不是一回事。运动模糊来自曝光期间的位移轨迹,核形状更像“乱跑的线”;散焦模糊则主要由镜头光学结构和景深决定,常见的是近似圆盘状、并且随空间位置变化的模糊核。换句话说,一个像“拍糊了”,一个像“对焦没对上”,病因不同,药方当然也不能乱配。
早期散焦去模糊通常走两步:先估计模糊核,再做非盲反卷积。问题是,这条路太依赖核估计准不准,一旦噪声、遮挡、深度变化或者镜头差异上来,核就开始“猜不动”。深度学习出现后,很多方法直接学从模糊到清晰的映射,省掉了显式核估计这道坎,但新问题也跟着来了:训练数据够不够真实、够不够大、够不够多样,直接决定模型是不是只会背题。
过去的代表性数据集各有短板。RTF 体量小、分辨率低,还带有合成痕迹;DPDD 虽然更像样,但样本少,而且只固定在单一光圈;LFDOF 规模更大,却是用光场数据合成散焦,和真实光学模糊之间还是有域差;RealDOF 的对齐质量不错,但样本太少,更多像测试集而不是训练场。于是,RealDefocus 的意义就很明确了:它把“真实、高分辨率、宽光圈范围、足够多场景”这几件事尽量一次性做齐。
这篇工作的方法其实很朴素:不是提出一个新网络,而是提出一套标准化基准流程 。核心思路是基于 RealBokeh 的真实拍摄数据,反过来构造散焦去模糊任务:把浅景深图像当输入,把 f/22.0 的清晰图当真值,再按统一规则切分训练、验证和测试集。这样一来,评测对象就不再是“谁的数据更讨巧”,而是“谁的方法真的更能恢复真实散焦”。
从数据流上看,RealDefocus 基准的输入不是“单张模糊图随便测一下”,而是带有明确光圈标签和对应真值的成对样本。训练时,论文按照原方法各自的实现和损失函数去训,尽量不改别人配方;验证和测试则统一在 RealDefocus 上跑,再额外做 RealDOF 上的跨数据集验证。这个设计的妙处在于,它把“方法本身强不强”和“是不是只对某个数据集过拟合”分开了。
论文还特意把参赛方法分成四类:散焦去模糊专用方法、运动去模糊方法、通用图像恢复架构,以及一个散景渲染模型。这个分组很有意思,因为它不是只看“本任务专用模型”能不能赢,还要看更大一类恢复骨干是不是能顺手把这个任务也吃下来。现实里,很多“专用模型”一旦离开原始假设就开始露怯;相反,通用大骨干有时反而更能扛住真实世界的复杂性。
实验设置尽量保持“公平但不粗暴”。所有方法都尽量沿用原作者公开实现中的优化器、学习率策略和结构细节,在 RealDefocus 上用 2000×1500 分辨率训练,切成 512×512 的 patch,并做翻转和旋转增强。这样做的目的不是为了把某个方法调到最顺手,而是让不同路线的模型在尽量相近的条件下交手。
值得注意的是,论文没有统一改写各方法的损失函数,而是保留原始设定。比如有些方法依赖多尺度监督,有些方法依赖重模糊正则,直接替换损失反而会破坏它们原本的设计逻辑。这个选择挺务实:基准的任务是比较,不是给所有方法强行换一套教材。
评测指标上,论文使用了 PSNR、SSIM 和 LPIPS 三类常见指标。前两个更偏向像素和结构一致性,LPIPS 更像感知质量打分。对恢复任务来说,这三者组合起来比单看一个数靠谱得多,因为散焦去模糊很容易出现“数值不差,但看起来怪怪的”这种经典翻车现场。
先看主榜单。RealDefocus 上的结果表明,随着光圈变小、模糊变强,所有方法都会更吃力,这一点非常符合直觉;但真正拉开差距的,不只是模型结构,而是训练数据是不是足够真实、足够多样。整体上,FFTFormer 在平均 PSNR 和 SSIM 上最好,而 Bokehlicious 在 LPIPS 上最好,说明它在感知层面恢复得更自然。对于最难的 f/2.0 设置,Bokehlicious 甚至拿到了最好的 PSNR 和最小的 LPIPS,说明它面对重度散焦时并没有掉链子。
更有意思的是跨数据集验证。论文把在 DPDD 上训练和在 RealDefocus 上训练的模型,统一拿到 RealDOF 上测了一遍。结果很干脆:几乎所有方法都在 RealDefocus 训练后变强了,PSNR 和 SSIM 上升,LPIPS 下降,说明它学到的不是某个数据集的“背题答案”,而是更接近真实散焦分布的规律。Bokehlicious 的提升尤其明显,PSNR 直接涨了 1.402,LPIPS 也下降了 0.044。对于恢复任务来说,这种跨数据集收益比单点刷高分更有说服力,因为它更接近真实部署场景。
从方法类型看,通用恢复骨干和大容量架构在这个基准上并没有吃亏,反而经常能排到前列。这个现象很值得琢磨:以前大家总以为“任务专用设计”一定更占便宜,但当数据规模、真实度和场景覆盖足够高时,大模型式骨干、transformer 和状态空间模型反而更容易把复杂散焦规律学全。说白了,数据一旦像样,模型的上限才会真的被打开。
定性图也支持这个判断。强方法的共同特征不是“把图变得更锐”,而是边缘更稳、纹理更自然、不会在高反差区域乱起振铃,也不会把细节过度抹平。散焦去模糊这类任务最怕两种极端:一种是看着很锐但假,另一种是很稳但糊。RealDefocus 上表现好的方法,基本都在这两者之间找到了更合理的平衡。
这篇工作最核心的贡献,不是提出了一个新网络,而是把散焦去模糊这门“看起来简单、实际上很挑数据”的任务,拉回到统一、可复现、可比较的轨道上。RealDefocus 的价值在于真实、大规模、宽光圈覆盖,再加上标准化协议和跨数据集验证,让“模型到底有没有真本事”这件事更难糊弄。
不过,基准也不是万能药。论文自己也指出,真实拍摄的真值仍然可能残留少量散焦;如果继续依赖合成数据,域差问题还是会冒头。未来更理想的数据构建方式,可能要考虑更强的对焦融合或更高质量的真值获取方案。换句话说,基准已经把赛道铺平了,但赛道尽头的高墙还在,后面拼的就是谁能把真实成像规律吃得更透。
龙迷三问
问题1:这篇论文到底是在做模型还是在做数据集? 严格说,重点是做基准,不是做新模型。它的价值在于把 RealDefocus 这套真实数据整理成统一的训练、验证、测试和跨数据集协议,让不同模型能在同一把尺子下比较。
问题2:为什么 RealDefocus 比以前的数据集更有用? 因为它更大、更真实、光圈覆盖更宽,而且分辨率高。很多旧数据集要么太小,要么是合成的,要么光圈单一,模型很容易学偏;RealDefocus 更接近真实拍摄分布,训练出来的模型也更容易泛化。
问题3:普通从业者该怎么看这篇工作? 最该记住的是一个很现实的结论:恢复任务里,数据协议的重要性不比模型结构低。只要数据不够真实、评测不统一,再强的网络也可能只是“在某个榜单上看起来很会”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★☆☆ 创新点不在新模型,而在新基准和统一协议。这个方向不花哨,但很实在,属于“把地基打牢”的工作。
实验合理度:★★★★☆ 训练设置尽量沿用原始实现,评测又覆盖多类方法和跨数据集验证,整体比较克制,没乱改别人的配方。
学术研究价值:★★★★☆ 对散焦去模糊这种长期依赖数据质量的任务来说,标准化基准本身就是重要贡献,能直接影响后续论文怎么比、怎么训、怎么落地。
稳定性:★★★★☆ 结果趋势比较一致,尤其是跨数据集验证很说明问题。不是某个指标偶然冒尖,而是整体泛化更稳。
适应性以及泛化能力:★★★★☆ RealDefocus 训练后在 RealDOF 上普遍提升,说明它确实更像“通用真实散焦分布”,而不是只适合自家数据。
硬件需求及成本:★★★☆☆ 高分辨率真实多光圈采集本身不便宜,但这类成本主要在数据构建阶段,基准一旦完成,后续研究的比较成本反而下降。
复现难度:★★★★☆ 因为有公开项目页和标准划分,复现门槛不算高;真正难的是把各方法按原始设定训到位,而不是随便跑个结果。
产品化成熟度:★★★☆☆ 作为基准,它更像行业的“考试标准”而不是直接可上线模块,但对相机、手机影像和图像修复产品的评测体系很有参考价值。
可能的问题: 真值仍可能带残余散焦,且基准主要围绕特定采集协议构建,离更复杂的移动端、视频或极端低照散焦场景还有距离。
主要参考文献
[1] Tim Seizinger, Florin-Alexandru Vasluianu, Marcos Conde, Zongwei Wu, and Radu Timofte, “Bokehlicious: Photorealistic bokeh rendering with controllable apertures,” in ICCV, 2025.
[10] Abdullah Abuolaim and Michael S Brown, “Defocus deblurring using dual-pixel data,” in ECCV, 2020.
[12] Lingyan Ruan, Bin Chen, Jizhou Li, and Miu-Ling Lam, “Aifnet: All-in-focus image restoration network using a light field-based dataset,” IEEE Transactions on Computational Imaging, vol. 7, pp. 675–688, 2021.
[14] Yuhui Quan, Zicong Wu, and Hui Ji, “Neumann network with recursive kernels for single image defocus deblurring,” in CVPR, 2023.
[19] Junyong Lee, Hyeongseok Son, Jaesung Rim, Sunghyun Cho, and Seungyong Lee, “Iterative filter adaptive network for single image defocus deblurring,” in CVPR, 2021.
[20] Syed Waqas Zamir, Aditya Arora, Salman Khan, Munawar Hayat, Fahad Shahbaz Khan, and Ming-Hsuan Yang, “Restormer: Efficient transformer for high-resolution image restoration,” in CVPR, 2022.
[24] Lingshun Kong, Jiangxin Dong, Jianjun Ge, Mingqiang Li, and Jinshan Pan, “Efficient frequency domain-based transformers for high-quality image deblurring,” in CVPR, 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这类“评测基准型”论文最适合进群细聊:数据怎么选、协议怎么定、结果怎么比,往往比单纯刷分更决定一个方向能不能真正落地。