← 返回 PaperDaily
视觉与图像
MRI超分训练太贵?把VGG感知损失塞进扩散目标可省钱
扩散模型做超分,画质确实顶,训练也确实是出了名的“百万步起步”。这篇文章没动网络结构,只在训练目标里加一个冻结VGG的感知正则项,就能让脑MRI和彩色人脸超分稳定加速收敛,局部细节还更真。想低成本给扩散训练“加外挂”的读者,值得花三分钟读完。
龙哥读论文
发布于 2026-09-12 16:54:33
阅读 1
查看原文
原论文信息如下:
你拍过糊掉的老照片,也一定经历过手机厂商发布会上那句熟悉的“AI超分救回来”。图像超分辨率(Super-Resolution, SR)这个任务,就是把低分辨率图里的高频细节“脑补”回来。它不光是拍照修图的事,医学影像、遥感、监控、显微镜和科学可视化,全在等一张更清晰的图。传统方法靠手搓正则项,比如全变分,把问题形式化成反问题求解,解释性虽好,算起来却慢得让人心碎。
到了深度学习时代,CNN、残差网络、Transformer一个个登场,超分性能像坐了火箭。再后来扩散模型杀进来,大家发现它在“脑补纹理”这件事上格外能打,能生成看起来非常自然的细节。但用起来才发现,扩散模型也不是没有烦恼:训练收敛慢、像素域损失容易把图磨得又光又滑、严重退化下还可能一本正经地“编造”结构。对医学影像这种错一个细节可能就要出事的场景,可就有点让人心里打鼓了。
本文要介绍的工作来自美国五所高校的联合团队,它瞄准的正是扩散超分训练中的两个老大难:一是标准扩散目标只在像素域做噪声预测,不会显式逼着模型恢复“人眼在意的结构”;二是训练要迭代一百万步,太贵了。作者给出的解决方案也够简单粗暴——直接在SR3的训练目标上叠一个VGG感知正则项。听起来像“加个损失就行”的老套路?别急着下结论,文中还提供了梯度层面的几何解释,以及脑MRI、人脸图像上的一整套实验证据。
扩散模型超分遇瓶颈:像素域损失为何导致过度平滑?
先把超分这件事掰开揉碎讲清楚。一张低分辨率图可能对应无数张合理的高分辨率图:是锐利的边缘还是平滑的渐变,是细密的毛发还是一团色块,模型根本不知道。传统方法为了把问题“锁住”,会人为加一些结构化假设,像是稀疏性、平滑性、全变分约束等,这些正则项让问题可解,但也让结果偏向某种“人工味”。
深度学习模型则学一个从低分辨率到高分辨率的非线性映射,干脆不跟人肉正则项较劲了。其中扩散模型走的是另一条路:给高清图逐步加噪声直到变成纯噪声,再训练网络学怎么一步步去噪。当把低分辨率图作为条件喂进去时,条件扩散模型就能在去噪过程中一点点“长”出高分辨率细节。SR3正是这类方法的代表作之一,先把低分辨率图双三次上采样到目标大小,再把它和含噪高分辨率图在通道维度上拼接起来,让去噪网络在每个时间步都看着这张条件图干活。
问题出在训练目标上。标准扩散损失的表达式可以写成网络预测噪声与真实注入噪声之间的均方误差,这是一个作用在像素域的损失。像素域均方误差有个臭名昭著的毛病:它把每个像素的误差平等看待,对边缘、纹理、结构这类人眼高度敏感的信息没有任何“偏心”。或者说,模型把每处都修到均值附近,结果就是高分辨率细节被“平均”掉,重建图平滑有余、锐利不足。更麻烦的是,如果只用这种目标训练,扩散模型在训练初期往往要花很长时间才能找到一条像样的去噪轨迹。训练数据在手里,显卡在燃烧,模型还在那里“嗯嗯啊啊”地学不会画出清晰的脑沟回——做过扩散训练的人都懂那种煎熬。
核心创新:VGG感知正则化如何重塑扩散训练目标?
感知损失在图像生成里并不是新概念,视觉感知损失(perceptual loss)在图像修复与生成任务里早就不稀奇了,但想在扩散模型里用好它,需要“多转一步”:扩散网络每一步输出的不是高清图,而是一个噪声预测。文章的思路是先把预测噪声通过重参数化还原成当前干净图像的估计,再拿这个中间重建图与高清真值做特征空间比较,从而在不改动推理流程的前提下,把感知监督织进训练目标里。
由此得到的总训练目标可以写成:原来的条件扩散损失,加上一个VGG感知正则项。
式(17):最终训练目标由扩散噪声预测损失与VGG感知损失相加组成。其中ω是感知正则的权重,用于控制感知约束的强度。
具体怎么做?扩散模型的前向过程会往高清图上逐时刻加噪,标准训练只让网络预测每一步注入的噪声。可如果网络预测的噪声足够准确,就能从带噪图里把“干净估计”解出来。本文把这个借助噪声预测还原出的重建图像记作zθ,t,它依赖网络参数θ、当前时间步t和低分辨率条件。
式(18):重建出的干净估计zθ,t。zt是当前时刻的带噪图,γt是信号保持系数,它描述了原始图像信息在前向加噪过程中还剩多少;当γt接近1时图像几乎没被破坏,当γt接近0时图像接近纯噪声。
有了zθ,t,感知正则项就可以顺畅定义:用一个预训练好的VGG-19网络作为固定特征提取器,分别提取重建估计和高清真值的特征,然后计算两者差异。这里的VGG是Visual Geometry Group(视觉几何组)的缩写,VGG-19是一个经典深度卷积网络,它的深层特征对人眼可感知的边缘、纹理与语义结构相当敏感,且无需跟着扩散模型一起训练,参数全程冻结。
式(19):基于L1范数的VGG感知正则,它用两个特征向量差的绝对值之和衡量重建与真值的结构差距,对个别大误差不那么敏感。
式(20):基于平方L2范数的VGG感知正则,它对幅度大的特征差异施加更强惩罚,理论上更容易逼着输出向真值特征“对齐”。本文把两种形式分别称为L1变体与平方L2变体,并直接用它们作为两个可对比的模型版本。
需要强调,这个正则项只出现在训练阶段。训练时网络先算扩散损失,同时还要多做一次VGG前向来算特征差;但真正部署做超分推理时,整个VGG分支可以直接扔掉,采样过程与原始SR3完全一致。换句话说,用户付出的是训练时稍多一点算力,换来的却是更稳更快的收敛和更好的细节保持,推理端则一分钱不多花。
理论解释:各向异性几何与SNR依赖梯度缩放
光说“加了感知损失所以效果好”,这只能算经验叙事。这篇文章还补了一小块理论拼图,解释为什么感知正则能让扩散模型训练收敛更快。
先从图像重建估计这一层看。把VGG感知项看成关于zθ,t的损失函数,对它求梯度时,会乘上一个VGG特征映射在当前重建图处的雅可比矩阵转置JT。特征差越大,梯度更新就越强。
如果对损失做局部二阶近似,感知项对应的曲率矩阵是2ωJTJ。由于不同特征方向上的梯度差异很大,这个二次曲面在不同方向上的弯曲程度不一样,也就是所谓的“各向异性几何”。像素域L2损失在所有方向上平等拉近,而感知正则会让优化沿感知敏感的结构方向施加更大压力,相当于告诉模型:先别纠结无关紧要的像素抖动,赶紧把边缘、纹理和语义边界摆对位置。
更关键的是梯度沿扩散时间步的缩放。感知损失通过zθ,t回传到噪声预测网络上,而zθ,t对预测噪声的敏感度是−√(1−γt)/√(γt) I。这里的γt是累积信号系数,SNR(t)即信噪比,是当前时刻图像信号与噪声能量的比值。时间步越靠后、加噪越重,SNR就越低,这个缩放因子的绝对值反而越大;换句话说,高噪声阶段的感知梯度会被显著放大。
所以感知正则在训练早期扮演的是“结构教练”角色:图像还很糊、噪声还很大时,它强力纠正整体结构,先把物体轮廓和重要边界从噪声里拽出来;等到图像接近干净、SNR升高的时候,感知梯度的缩放因子变小,又不至于打扰扩散模型后期精修高频细节的节奏。这正是该方法能加速早期收敛、却不会让最终结果过度平滑的几何解释。看完这段,再回头看实验曲线就会明白,蓝色带正则模型为什么总能在前几个检查点把橙色的SR3基线甩开一截。
实验验证:MRI与彩色人脸超分的全面评测
实验围绕扩散超分最典型的医学影像与人脸图像展开:BrainWeb模拟脑部MRI上做了2倍、4倍、8倍超分,Brain Tumor MRI脑肿瘤数据上做了4倍超分,彩色人脸数据CelebA-HQ上做了4倍超分。所有对比都围绕同一种骨干结构展开,也就是本文使用的SR3基线,评测指标用PSNR衡量像素失真、SSIM衡量结构相似度。
表2:提出的VGG正则化模型与基线SR3模型的整体对比。对提出的方法,原文分别报告了基于峰值重建质量和基于收敛速度两种方式挑选权重的结果。
先看BrainWeb MRI 4倍超分。训练过程中每10万次迭代做一次评估,前一个评估点大致对应第67个epoch。下面两张收敛曲线分别给出SSIM和PSNR随训练变化的走向:蓝线是加了平方L2型感知正则(ω=10)的模型,橙线是没有感知正则的SR3基线。
图2(a) BrainWeb MRI 4倍超分任务的SSIM收敛曲线。提出方法(蓝线)远比SR3基线(橙线)更早进入高SSIM区间。
图2(b) PSNR收敛曲线。同样的规律:加感知正则的模型在同等训练量下指标更高,而且优势在训练早期尤其明显。
图3 BrainWeb MRI 4倍超分在10万次迭代(约67个epoch)时的重建对比。左侧依次为低分辨率输入和高分辨率真值,右侧分别是SR3基线与提出方法。此时SR3重建还相当模糊,而带感知正则的模型已经能还原出更清晰的脑部结构。
训练推进到100万次迭代后,两种模型的指标差距会缩窄,这也是扩散模型后期“大家都能学好”的正常现象。但细节差异依然存在。下图中放大的局部区域显示,SR3重建有把本应分离的结构连成一片的趋势,而带感知正则的模型对局部解剖边界的保持更干净。
图4 BrainWeb MRI 4倍超分在100万次迭代后的重建与局部放大。感知正则版本更好地保持了局部结构,避免把不该连接的区域错误地连在一起。
2倍超分由于任务本身更简单,训练后期SR3也能追到相近水准,但感知正则模型仍表现出更快的早期收敛。
图5(a) BrainWeb MRI 2倍超分SSIM收敛曲线。提出方法(蓝线)与SR3基线(橙线)最终趋于接近,但蓝线明显更早到达平台期。
图5(b) PSNR收敛曲线。感知正则带来的并不只是“虚高”,而是实打实的训练加速。
图6 BrainWeb MRI 2倍超分在10万次迭代时的重建对比,右图为平方L2型感知正则(ω=100)的结果。
8倍超分是更大的挑战:低分辨率图只有原始分辨率的八分之一,可参考的信息非常少,模型很容易把细小结构“画糊”或“画断”。下图是BrainWeb MRI 8倍任务训练100万次迭代后的结果,放大区域显示SR3重建的局部结构有断裂和形状异常,而带平方L2感知正则的模型重建出的结构更平滑连续,更接近高分辨率参考图。
图9 BrainWeb MRI 8倍超分在100万次迭代后的重建与局部放大。提出方法重建出的局部结构更平滑连续,避免SR3部分断开的异常形态。
脑肿瘤MRI数据用于测试方法跨数据集的表现。它和BrainWeb同为脑部MRI,但肿瘤区域形态与正常脑组织差异明显。下图是4倍超分训练100万次迭代后的重建,放大区显示带L1感知正则(ω=100)的模型保留了更清楚的局部边界和结构对比,SR3重建则钝化了不少。
图12 Brain Tumor MRI 4倍超分在100万次迭代后的重建。提出方法在边界保持和结构对比方面优于SR3基线。
彩色人脸数据更能体现感知正则对自然图像纹理的作用。下图是CelebA-HQ人脸4倍超分在训练早期(对应图13中约第233个epoch)的视觉效果:SR3基线重建出来的人脸明显发白、过曝,皮肤色调被洗掉;而加入L1感知正则(ω=0.05)的模型即使在这个较早的训练阶段,也能维持自然的肤色、对比度和结构层次。
图14 CelebA-HQ 4倍人脸超分在第233个epoch的视觉对比。SR3仍有明显发白过曝伪影,VGG正则版本已呈现更正常的肤色和结构。
训练到最后一个评估点时,两种模型都能生成较自然的人脸,但细节差异耐人寻味。SR3在衣领与脖子边界处仍有絮状伪影和断裂感,VGG正则版本则更平滑连续;反过来,SR3在发际线附近的细碎噪声更多,感知正则版本反而收敛得更含蓄自然。
图15 CelebA-HQ 4倍人脸超分在最后一个评估点的视觉对比,绿框展示衣领与发际线区域的放大细节。感知正则版本在边界连续性和纹理噪声控制上表现更稳。
从上述实验能看出感知正则的两个平行效果:一是训练曲线上的加速,二是最终视觉细节的改善。需要注意,本文并不宣称PSNR在所有任务上全面大幅碾压SR3——从曲线看,部分权重配置的峰值PSNR只是逼近甚至略微不及基线。它的主要收益是“在同等训练预算下更快达到更好看的重建结果”,以及“在结构连续性这种人类视觉高度敏感的属性上更可靠”。这种结论在感知质量导向的超分任务里是有参考价值的。
参数敏感性分析与实用建议
权重参数ω如何选,是实际应用中最先遇到的问题。文章在BrainWeb MRI 4倍任务上探寻了ω的范围。
图16 L1型VGG损失在BrainWeb MRI 4倍超分上的参数调节:(a) SSIM与(b) PSNR。ω=100模型的早期收敛最快。
图17 平方L2型VGG损失在BrainWeb MRI 4倍超分上的参数调节:(a) SSIM与(b) PSNR。ω=10模型在两项指标上的早期收敛均最快。
表3 BrainWeb MRI 4倍超分上VGG感知损失权重的参数调节结果。左半为L1型损失,右半为平方L2型损失,最佳值在原文中以粗体标出。
随后文章把调参范围扩展到BrainWeb 2倍、8倍以及脑肿瘤、人脸数据上,用于检验权重的可迁移性。
表4 BrainWeb 2倍任务上的敏感性研究。L1型ω=100取得最佳PSNR,平方L2型ω=100取得最佳SSIM。
表5 BrainWeb 8倍任务上的敏感性研究。L1型ω=100取得最佳峰值PSNR,平方L2型ω=100取得最佳峰值SSIM。
表6 Brain Tumor MRI 4倍任务上的敏感性研究。平方L2型ω=10取得最佳PSNR,L1型ω=0.1取得最佳SSIM。这说明在BrainWeb上选出的配置并不能直接迁移到另一个脑部MRI数据集。
把人脸数据上的结果单独拎出来看,几乎所有权重都超过了SR3基线,只有一个例外是ω=0.05的模型——它牺牲了一部分最终峰值指标,换来了更早的收敛稳定。ω=0.04则兼顾了峰值指标与训练速度,可以节省超过300个epoch。
表7 CelebA-HQ上各ω与其峰值PSNR/SSIM对照。除ω=0.05外几乎都胜于SR3基线,ω=0.04综合最优且节省超过300个epoch。
综合这些实验,可以给出几条实用建议:一是如果只想拿VGG正则加速训练、最终仍以PSNR/SSIM为验收标准,中低权重(0.01到0.1量级)更安全;二是如果追求局部结构和边界连续性,中等偏大权重往往带来更好的视觉质量,但要接受指标可能与基线互有胜负;三是不同数据集对最优权重的偏好差异很大,切不可把一个数据上调好的ω无脑搬到另一个场景,尤其医学影像与自然图像之间的gap比想象中大。
总结与展望:感知正则化的潜力与局限
这篇文章的核心贡献可以压缩成一句话:在不改SR3网络结构、不改推理采样流程的前提下,往扩散训练目标里加一个冻结VGG的感知正则项,就能让超分模型在脑部MRI和人脸数据上收敛更快、边界保持更好。再加上梯度层面的各向异性与SNR缩放解释,它给“感知损失加速扩散”提供了一个可复述、可迁移的抓手。
但局限也清楚。首先,VGG特征本身是在自然图像上预训练的,用来监督医学影像并不一定是最优选择;实验也证明权重配置跨数据迁移时并不总能保持最佳。其次,感知正则只解决“训练目标对结构不敏感”的问题,并不能根治扩散模型在极端退化下胡说八道的幻觉风险。第三,实验围绕单一backbone展开,没有与ResShift、ResDif等更新的扩散超分方案做横向对比,因此很难说这套正则化在不同diffusion框架上的普适性有多强。
沿着这个方向,后续工作可以考虑用医学影像预训练的特征提取器替代VGG,或者根据时间步动态调整感知损失权重,把“高噪声阶段强监督、低噪声阶段弱监督”做成自适应策略,甚至把感知正则引入潜在扩散超分、视频超分等更大规模的训练管线。毕竟,这类方法最大的价值不是某一网络结构的改变,而是给所有扩散训练提供了一种性价比极高的监督加速外挂。
龙迷三问
这篇论文到底在解决什么问题? 针对扩散超分像素域损失不感知纹理结构、早期收敛慢且易过度平滑的问题,本文在SR3基础上提出VGG感知正则化扩散模型:不改推理架构,仅用冻结的VGG-19特征约束重建图。
这篇工作最值得看的点是什么? 在多数设置下,VGG正则化模型在最终PSNR/SSIM上与SR3基线相当或略有提升,但训练收敛速度显著加快(约40%的训练迭代节省),且在视觉质量上更好地保留了局部结构和细节。
这篇工作的边界或风险在哪里? 优点:(1) 方法简单有效,仅需在训练目标中添加感知正则化项,不改变推理过程;(2) 显著加速训练收敛;(3) 改善最终重建的局部结构保持和感知质量;(4) 提供了梯度层面的理论解释。缺点:(1) 感知正则化权重需要针对不同数据集和任务手动调参;(2) 最优权重在不同SR倍率和数据集间不可直接迁移;(3) 过大的正则化权重会损害重建质量;(4) 峰值PSNR/SSIM提升有限,主要优势体现在收敛速度和感知质量上。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
在SR3扩散模型训练目标中加入基于VGG特征空间的感知正则化项,在不改变扩散架构和推理过程的前提下提升感知质量和训练收敛速度。
实验合理度: ★★★★☆
PSNR (峰值信噪比), SSIM (结构相似性指数)
学术研究价值: ★★★★☆
在SR3扩散模型训练目标中加入基于VGG特征空间的感知正则化项,在不改变扩散架构和推理过程的前提下提升感知质量和训练收敛速度;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
训练使用NVIDIA A100 GPU(灰度MRI实验)和NVIDIA V100 GPU(彩色人脸实验),目标HR图像尺寸为128×128,训练100万次迭代,扩散过程2000步。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 感知正则化权重需要针对不同数据集和任务手动调参;(2) 最优权重在不同SR倍率和数据集间不可直接迁移;(3) 过大的正则化权重会损害重建质量;
[1] Wang C, Venkatachalapathy P, Liang Y, et al. Perceptually Regularized Diffusion Model for Image Super-Resolution. arXiv:2609.02016, 2026.
[2] Saharia C, Ho J, Chan W, et al. Image Super-Resolution via Iterative Refinement. IEEE TPAMI, 2022.
[3] Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
[4] Simonyan K, Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition. ICLR, 2015.
超分会模糊?扩散怪兽又慢又费卡?快来龙哥读论文群,聊点又快又真又省算力的图像恢复硬核思路~
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,按格式备注,更快被通过并邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!