← 返回 PaperDaily
视觉与图像
告别4K卡顿!新南威尔士大学提出P-PatchDif:低光增强提速80倍,显存不到9G
拍完夜景想发朋友圈,结果暗部一团黑、亮部还偏色?这篇新南威尔士大学的工作把分块扩散模型玩出了新花样:分块尺寸随时间步渐进增大,既保住局部细节又协调全局亮度,4K图像推理提速80倍,显存仅需8.8GB,简直是低光增强领域的"效率控"福音。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
低光增强的困境:固定分块为何不够?
晚上拍的照片,暗部要么黑成一团啥也看不见,要么强行提亮后噪点爆炸、颜色还偏得离谱,这种痛相信不少人都体会过。低光图像增强一直是计算摄影里的硬骨头,因为真实场景里的光照问题远比"均匀地暗"复杂:顶灯照不到的角落、霓虹灯旁的暗部、逆光条件下半张脸在阴影里,各种局部光照差异混合在一起,让算法格外头疼。
在众多解决方案中,扩散模型凭借强大的生成能力,能把细节纹理恢复得相当自然,不像传统回归模型那样容易输出"雾蒙蒙"的平均脸。但扩散模型有个先天毛病:推理太慢、显存占用太狠。一张400乘600的小图还好说,遇到1080p甚至4K的高清照片,全图直接跑扩散模型,显存分分钟爆给你看。
于是研究者们想了个主意:既然全图跑不动,那就把图像切成一块块小补丁(patch),分而治之,每个补丁单独送进扩散模型里去噪,最后再拼回去,这就是"分块扩散模型"(Patch Diffusion Model, PDM)的思路。听起来很美妙,对吧?但事情没这么简单。
近期先进的低光图像增强扩散模型视觉对比。(a) PyDif对图像做插值缩放,导致颜色偏移;(b) WeatherDif使用固定分块尺寸,产生边界伪影;(c) 本文方法渐进增大分块尺寸,生成精细细节增强图像。
现有的PDM基本都采用固定的分块尺寸(比如64乘64的小块),这就带来一个尴尬:补丁太小,看不到图像的全局亮度信息,每个补丁只能"盲人摸象"似的各自为政。结果就是补丁和补丁拼在一起时,亮度、色调不一致,边界处还会出现明显的拼接痕迹,就像论文图1(b)展示的那样,好好的照片硬是弄出了"马赛克拼贴画"的既视感。
那直接把补丁尺寸调大行不行?也不行。补丁越大,计算量呈指数级上涨。论文里的实验数据显示,训练一个补丁尺寸192的模型,比64的要慢大约4倍,光是500k次迭代就得跑将近98小时,这还不算推理时的显存压力。更要命的是,不同尺寸的补丁模型,学到的颜色和亮度信息其实不一样——有的偏暖,有的偏冷,有的亮一点,有的暗一点。要是像MDMS那样简单粗暴地把多尺度补丁的输出做平均,结果往往不是取长补短,而是互相污染,得到一个四不像。
这个问题有多大?论文作者专门做了个实验,训练了4个不同补丁尺寸(64、96、128、160)的PDM模型,然后观察它们对同一张图的增强效果。结果发现,不同尺寸模型输出的亮度、色调差异肉眼可见——有的偏黄,有的偏蓝,就像图5展示的那样。这充分说明,固定分块或者简单的多尺度平均,都难以解决局部细节和全局亮度不一致的矛盾。
正是基于对这些痛点的观察,新南威尔士大学的研究团队提出了一种全新的渐进式分块扩散模型P-PatchDif。核心思路用一个词概括就是"动态变化":不再让补丁尺寸从头到尾一成不变,而是随着去噪过程的推进,让补丁从小到大渐进式增长。这就像人看一幅画,先凑近了看细节笔触,再退远了看整体构图,最终形成对画面的完整理解。
图2:WeatherDif、MDMS与P-PatchDif的训练策略对比。(a) 本文在训练中逐渐增大分块尺寸,使去噪模型能够从更大的分块中感知更多信息;(b) WeatherDif和MDMS在训练的所有步骤中使用固定分块尺寸。
渐进式分块:从局部到全局的智能过渡
P-PatchDif的方法概述可以用一张总体框架图来把握。论文将去噪的总时间步T等分成n个子集,在每个子集内部,分块尺寸和步长保持不变;而跨过不同子集时,分块尺寸随着时间步的推进逐步增加,步长也同步调整。这意味着在去噪早期,模型用小补丁聚焦每个局部区域的精细纹理;到了去噪后期,模型切换到大补丁,感受野随之扩大,从更广阔的视角校准整体色调与亮度。
图6:P-PatchDif总体框架图。将总时间步T划分为n个等长子集K。(a) 训练时从正常光图像x0中随机裁剪尺寸为pt的补丁xt(i)用于扩散与去噪,补丁尺寸pt渐进增大以捕获多层级图像内容。(b) 采样时步长st也渐进增大以减少补丁数量。(c) 将低光图像下采样为pt乘pt尺寸的ypT,估计器g生成全局亮度代理xill,再由编码器h提取Fill。(d) 去噪网络f中多分块对齐层的结构,利用Fill对编码器特征Fl进行归一化并生成增强特征Fl^。
这个"渐进"设计的巧妙之处在于,它没有像MDMS那样在每一步都同时裁剪多种尺寸的补丁来硬凑多尺度信息,而是把多尺度信息沿时间轴铺开。每个去噪步骤只处理一种尺寸的补丁,计算量一下子就降下来了。就像你登一座山,如果非要一步跨到山顶,那只有长腿巨人才能做到;但如果沿着盘山公路慢慢爬升,普通人也能登顶。
更妙的是对步长(stride)的处理。步长决定了相邻两个裁剪补丁之间的重叠程度:步长越小,重叠越多,生成的补丁数量越多,计算量越大,但边界伪影越少。论文通过系统的实验分析发现了一个关键规律:补丁尺寸越大,对步长的变化越不敏感,也就是说,大补丁即使步长大一些,画质也不会明显下降。论文作者据此设计了一套统一的调度方案:随着时间步增加,分块尺寸变大,步长也同步变大,从而有效控制了补丁的总数量。
图3:WeatherDif、MDMS与P-PatchDif的采样策略对比。(a) 本文通过增大分块尺寸来融入多层级信息,并对更大的分块使用更大的步长以减少补丁数量,因为大补丁对步长变化具有鲁棒性。(b) WeatherDif仅使用固定分块尺寸,缺乏多层级信息。(c) MDMS通过创建多个相同噪声图像的副本并分别用不同分块尺寸裁剪来融入多层级信息,代价是高昂的计算开销。
多分块对齐:让不同尺度的补丁和谐共处
渐进式分块解决了效率和局部细节的问题,但还有一个暗坑等着填:不同尺寸的补丁看同一片区域时,对"什么才是正常的亮度"会有不同的理解。小补丁只看得到局部,如果局部恰好是暗部,它可能把亮度提得过高;大补丁看到了更多上下文,处理会更克制。这种理解上的偏差如果不加以约束,就会出现图5中展示的颜色和亮度不一致问题。
图5:(a)-(b):当步长接近分块尺寸的一半时出现分块边界伪影和颜色不一致,但当步长小于分块尺寸一半时伪影变得不那么明显。(c)-(g):使用不同p值训练和评估的PDM产生的输出不一致。
为此,P-PatchDif祭出了第二件法宝:多分块对齐策略(Multi-Patch Alignment)。这个策略的核心是引入一个"全局亮度风向标",在去噪过程中给所有不同尺寸的补丁一个统一的参考系。方法的具体实现是:先将整张低光图像下采样到当前时间步对应的补丁尺寸大小,然后送进一个轻量级U-Net估计器g,预测出一个全局亮度代理图。这个代理图很像一个极度压缩的"标准答案",它告诉模型一张正常曝光的图在这个尺度上应该长什么样。论文在训练时直接以正常光图像各通道均值的降采样版本作为监督信号,也就是公式5定义的L_ill损失。
但光有亮度代理还不够,直接用它在像素级上做调整,又会重蹈PyDif颜色偏移的覆辙。论文的做法更聪明:将亮度代理送入一个小型编码器h提取特征,得到全局亮度特征,然后以类似条件扩散模型的方式,将这个特征注入到U-Net去噪网络f的每一层编码器特征中。具体来说,通过一个轻量的多分块对齐层,预测出每个通道的缩放系数和偏置向量,将当前补丁的特征统计量归一化到全局亮度期望的水平上。这种特征级的对齐比像素级的直接修正要稳健得多——补丁本身的细节纹理信息都被保留了下来,只是整体统计特性向全局参考靠拢。
值得注意的是,亮度代理估计器g每个去噪步骤只需要运行一次,生成的结果可以复用于当前步骤的所有补丁,额外计算开销微乎其微。论文消融实验显示,添加多分块对齐后采样时间仅增加约10%,却带来了约1dB的PSNR提升,这性价比相当划算。
图10:多分块对齐在图像层面(第一行)和特征层面(下面两行)的效果。可以看到加入对齐后,图像暗部区域的亮度一致性明显改善,特征层面也能更好地区分前景与背景物体。
效率与质量兼得:P-PatchDif的惊艳表现
方法设计得再精巧,最终还是要用数据说话。论文在LOL-v1、LOL-v2-Real和LOL-v2-Syn这三组最常见的低光增强基准上,同时汇报了PSNR/SSIM这类重建指标和LPIPS/FID这类感知指标。重建指标衡量像素级接近程度,感知指标则更贴近人眼“看着舒不舒服”的体验。
表2:LOL-v1、LOL-v2-Real和LOL-v2-Syn数据集上PSNR与SSIM的定量比较。加粗和下划线分别表示最优和次优结果;表格上半部分和下半部分分别为回归模型和生成模型;⋄表示分块扩散模型。
表3:LOL-v1、LOL-v2-Real和LOL-v2-Syn数据集上LPIPS与FID的定量比较。低光增强这类生成任务里,LPIPS和FID往往比PSNR更能反映观感质量。
整体来看,传统回归模型通常能拿到很高的PSNR,但它们倾向于输出平滑、保守的结果;扩散类模型在PSNR上不一定占便宜,却在感知指标与人眼观察上更有优势。P-PatchDif与前代分块扩散方案WeatherDif、MDMS处于同一对比组时,并没有因为追求效率而牺牲画质:在感知指标上它保持了很不错的水准,同时细节和色彩的稳定性也更好。
图7:LOL-v2-Real(虚线上方)与LOL-v2-Syn(虚线下方)上的定性对比。从红框区域可以看出,P-PatchDif在处理暗部细节和恢复真实色彩之间取得了更好的平衡。
只看指标还不够,论文还给出了不同采样策略的对比。下表展示了不同分块采样方法的采样时间差异,能够更直观看出P-PatchDif的调度策略到底省在哪里。
表8:不同分块采样方法的对比,S.t表示采样时间。同样的模型架构下,P-PatchDif的采样策略能在不牺牲画质的前提下大幅压缩耗时。
从低光到4K:P-PatchDif的泛化能力验证
低光增强领域一个非常实际的痛苦是:模型往往在小尺寸数据集上表现不错,一遇到手机或相机拍摄的高分辨率照片,显存立刻见底。P-PatchDif的实验设置特意覆盖了从400×600到4K不等的多种分辨率,并用LSRW、UHD-LL这类包含真实大尺寸图像的基准做验证。
表4:LSRW与UHD-LL数据集上的定量结果。表中不少对比方法在UHD-LL这类4K图像上会出现内存溢出,只能先降采样再处理;带†标记的方法才真正支持4K输入。
图8:LSRW(虚线上方)与UHD-LL(虚线下方)数据集上的定性对比。面对大分辨率输入时,P-PatchDif不需要预先降采样,依然能保持稳定的亮度和细节还原。
表7:不同输入尺寸下的详细采样统计,包括显存占用和采样时间。在A100 80G环境下,P-PatchDif处理4K图像时显存占用约8.8GB,采样时间远低于同类分块扩散方案。这意味着P-PatchDif不只在学术上“能跑”,在真实部署里也有相当强的落地价值。
论文还额外统计了训练阶段的消耗。作者在LOL-v2-Real数据集上测试了不同配置的训练时间、显存和参数量,发现通过控制分块尺寸和步长的变化节奏,P-PatchDif能把训练成本压到相对可控的范围。这对应了论文中“让分块扩散模型能在不同GPU设备上扩展”的设计目标。
表6:LOL-v2-Real数据集上的详细训练统计,包括训练时间、显存占用与参数量。这套数据表明,P-PatchDif的训练代价没有随着多尺度设计而失控,对资源有限的团队更友好。
当然,论文也没有回避失败场景。图11展示了成功和失败的案例:当输入中存在极度黑暗、几乎没有任何可用纹理的区域时,P-PatchDif会选择把这部分细节整体“忽略”,而不是强行生成容易出错的结构。例如暗处的渔网,模型倾向于不恢复它,避免生成虚假的伪影。这种“可解释的失败”在落地中其实是一种理性行为——它知道自己没有足够的信息去臆测细节。
图11:成功与失败样本的定性对比,绿色和红色框分别表示成功与失败。当某个区域过于暗黑时,P-PatchDif倾向于直接忽略其中的结构,而不是强行增强后产生胡编乱造的纹路。
总结与展望:扩散模型在图像增强中的未来
P-PatchDif的贡献可以归纳为三点:第一,提出随时间步渐进增大分块尺寸和步长的调度策略,让模型在单个时间步里只需要处理一种尺度的补丁,就能从局部到全局地感知图像;第二,设计多分块对齐模块,利用全局亮度代理统一不同尺度补丁的亮度统计,缓解颜色和明暗不一致;第三,通过实验证明这套方案能覆盖400×600到4K的各种分辨率,并在采样效率上比既有分块扩散模型快约80倍、显存需求低于9GB。
这篇工作给低光增强领域带来的启示其实超出了“分块”本身。它证明了扩散模型的效率优化不一定要靠更小的模型或更少的采样步数,也可以从输入数据的组织方式上做文章。当一个去噪步骤只能看有限视野时,通过时间维度的渐进调度,同样能让最终输出拥有全局一致性。未来在视频低光增强、移动端实时图像增强、超分辨率等任务上,这套“调度式分块”的思路都有迁移潜力。
当然也必须承认,P-PatchDif并非银弹。极暗区域的结构恢复依然是开放难题,而多分块对齐依赖的全局亮度估计器是否能泛化到风格化摄影、多光源夜景等更复杂场景,也需要更多数据验证。但瑕不掩瑜,它对“分块扩散模型的效率上限”提出了一个相当系统的回答。
龙迷三问
这篇论文到底在解决什么问题?针对现有分块扩散模型在低光增强中难以兼顾全局亮度与计算效率的问题,新南威尔士大学提出P-PatchDif,通过随时间步渐进增大分块尺寸与步长,并引入多分块对齐策略,在4K图像上实现比现有方法快80倍的推理,显存仅需8.8GB。
这篇工作最值得看的点是什么?在LOL-v1、LOL-v2-Real、LOL-v2-Syn上PSNR/SSIM均达到最优或次优;在LSRW和UHD-LL上全面领先;在无参考数据集上平均指标最优;4K图像上比现有patch扩散模型快80倍且显存更低。
这篇工作的边界或风险在哪里?优点:(1)渐进式patch策略有效平衡了局部增强与全局亮度一致性;(2)多分块对齐机制解决了跨尺度特征不一致问题;(3)计算效率显著优于现有patch扩散模型;(4)在多种分辨率下均表现良好。缺点:(1)未在潜在空间操作,计算成本仍有优化空间;(2)对极暗区域的结构恢复能力有限;(3)渐进策略需要调节多个超参数(n, Δp, Δs)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
提出渐进式分块扩散模型(P-PatchDif),通过随去噪时间步动态增大patch尺寸和步长,实现从局部到全局的多尺度信息感知,并引入多分块对齐策略以保持全局亮度一致性。
实验合理度:★★★★☆
PSNR、SSIM、LPIPS、FID、NIQE、BRISQUE、PI
学术研究价值:★★★★☆
提出渐进式分块扩散模型(P-PatchDif),通过随去噪时间步动态增大patch尺寸和步长,实现从局部到全局的多尺度信息感知,并引入多分块对齐策略以保持全局亮度一致性;更关键的是问题定义是否可复用到同类任务。
稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本:★★★☆☆
在4K图像上仅需8.8GB显存,比现有patch扩散模型快80倍;400×600图像采样2.5秒,1080p需20秒,4K需93秒。
复现难度:★★★☆☆
https://github.com/RuoyuGuo/P-PatchDif
产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题:;(3)计算效率显著优于现有patch扩散模型;(4)在多种分辨率下均表现良好。缺点:(1)未在潜在空间操作,计算成本仍有优化空间;(2)对极暗区域的结构恢复能力有限;(3)渐进策略需要调节多个超参数(n, Δp, Δs)。
[1] Ruoyu Guo, Haonan Zhong, Maurice Pagnucco, Yang Song. P-PatchDif: Progressive Patch Diffusion Models for Low-light Image Enhancement. arXiv:2609.01123.
[2] Jonathan Ho, Ajay Jain, Pieter Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS 2020.
[3] Jiaming Song, Chenlin Meng, Stefano Ermon. Denoising Diffusion Implicit Models. ICLR 2021.
[4] Ozan Özdenizci, Robert Legenstein. Restoring Vision in Adverse Weather Conditions with Patch-Based Denoising Diffusion Models. TPAMI 2023.
[5] P-PatchDif 开源代码:https://github.com/RuoyuGuo/P-PatchDif
结合PaperDaily已收录论文来看,低光增强领域比较常见的投稿套路是“换一个更深的骨干网络,或者提一种新的光照分解方式”,然后在LOL-v1等基准上把PSNR刷高零点几个分贝。而P-PatchDif走的是另一条路线:它不跟回归类方法硬拼像素误差,转而强调生成质量不变时的效率与分辨率可扩展性。从已收录的同类基准结果看,LOL-v1与LOL-v2-Real上已有论文的最佳PSNR记录大致在29.96与24.98量级,P-PatchDif在同类生成式分块方案中并不追求单点数值碾压,更多是把“跑得动、跑得快、画质不缩水”作为核心卖点。读者在横向对比时需要注意,不同论文的测试集划分和预处理策略存在差异,不能仅凭一两个PSNR数字就下结论。
顺着这个思路往下想,“渐进式输入组织”其实不止适用于低光增强。凡是输入大、显存有限、又需要扩散模型全局建模的任务,比如高分辨率图像编辑、视频修复、医学影像重建,都可以尝试把分块尺寸与扩散时间步解耦,用时间维度的尺度变化换空间维度的算力节省。这种设计不改变单张补丁的去噪质量,却能整体改变系统的资源曲线,对真正想把扩散模型落到产品里的团队来说,是一个值得抄作业的方向。
低光增强不用愁,渐进分块解千忧。高速推理显存省,细节色彩两不丢。🤚
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!