← 返回 PaperDaily 视觉与图像

明尼苏达大学CM-RED:4步MRI重建,效果亮眼1000步扩散模型

扩散模型做MRI重建效果好,但动辄几百上千步的迭代采样让临床落地遥遥无期。明尼苏达大学这篇CM-RED,把一致性模型塞进RED优化框架,4步出图,PSNR/SSIM全面超越1000步的DPS和100步的DDS,计算量直降25—250倍。生成式MRI重建的“速度焦虑”,这次是真的被治好了。

明尼苏达大学CM-RED:4步MRI重建,效果亮眼1000步扩散模型

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising
发表日期:
2026年08月

发表单位:
明尼苏达大学(University of Minnesota)电子与计算机工程系及磁共振研究中心

原文链接:
https://arxiv.org/pdf/2608.20561v1.pdf

开源代码链接:
https://github.com/MerveGulle/CM-RED

引言

CM-RED示例重建结果,展示欠采样图像、重建图像和参考图像的对比
CM-RED示例重建结果:欠采样图像、重建图像与参考图像的直观对比
磁共振成像(MRI)能无创地看清人体内部结构,却有一个让所有患者和医生都头疼的缺点:。一次完整的MRI扫描动辄需要十几分钟甚至更久,期间患者必须保持一动不动,对儿童、老人和急症患者来说极为煎熬。
为了缩短扫描时间,最直接的办法是少采集一些数据——这个过程叫欠采样。但欠采样会带来一个麻烦:直接从欠采样数据重建图像会产生严重的混叠伪影,就像一张拼图缺了一大半,怎么也拼不出清晰的画面。传统方法如并行成像和压缩感知,在高加速倍数下往往力不从心。
近年来,扩散模型(Diffusion Models, DMs)凭借其强大的生成能力,在MRI重建中展现出惊人的潜力。扩散模型能够学习海量清晰图像的分布,然后在重建时把这种先验知识“注入”到欠采样的数据中,补全缺失的信息。听起来很完美,对吧?但问题出在速度上。
扩散模型的采样过程是个“慢工出细活”的活儿——它要从纯噪声出发,一步步迭代去噪,通常需要数百甚至上千步才能得到一张干净的图像。以MRI重建中最常用的DPS方法为例,它需要整整1000次网络评估(NFEs)才能收敛。一张切片1000次,一个三维体积几十张切片,临床医生看到这个数字估计直接崩溃。
那有没有办法既保留扩散模型的生成质量,又大幅提升重建速度?有,答案是一致性模型(Consistency Models, CMs)。一致性模型是扩散模型家族中的“新贵”,它能在单步或几步内直接完成从噪声到干净图像的映射,把采样成本压缩两到三个数量级。
然而,把一致性模型用到MRI重建上,并不像换个生成器那么简单。MRI的测量模型是复杂的多线圈编码模型,如何在几步之内既保证与采集数据一致,又发挥CM的生成先验优势,是一个不小的挑战。
明尼苏达大学的团队在这篇题为《Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising》的论文中,提出了一个优雅的解决方案——CM-RED。他们把预训练的一致性模型嵌入到RED(Regularization by Denoising)优化框架中,并加入了两个锦上添花的设计——受控噪声注入和动量加速,最终实现了仅需4次网络评估就能达到甚至超越扩散模型1000步重建质量的惊艳效果。
这篇论文的精彩之处不仅在于结果好,更在于它提供了一种通用、鲁棒、易于落地的生成式重建新范式。研究者在fastMRI膝盖和大脑数据集上做了大量实验,覆盖多个对比度加权、加速因子和欠采样模式,还公开了代码和预训练模型。对于AI医学影像领域的研究者和工程师来说,这是一篇非常值得深入细读的工作。

从1000步到4步:MRI重建的极速革命

要理解CM-RED为什么厉害,先要理解扩散模型做MRI重建为何慢,以及一致性模型是怎么“弯道超车”的。

扩散模型重建的“慢”与一致性模型的“快”

扩散模型的核心思想是模拟一个逐渐加噪的前向过程,然后学习反向去噪。在生成或重建时,模型从一个随机噪声开始,沿着学习到的反向轨迹一步步“雕刻”出图像。这条轨迹通常被离散成T个时间步,每个时间步都需要调用一次神经网络,因此生成一张图像就需要T次网络评估。
一致性模型则完全不同。它学习的是一个一致性函数:把扩散轨迹上任意一个噪声状态直接映射到轨迹起点的干净图像。换句话说,扩散模型是一步步走楼梯下楼,而一致性模型是直接坐滑梯一滑到底。图1生动地展示了这两种模型在MRI数据上的轨迹差异。
图1:扩散模型与一致性模型在MRI数据上的轨迹示意图
图1:扩散模型与一致性模型在MRI数据上的轨迹示意图。红色箭头表示扩散模型需要沿轨迹逐步迭代采样(约100—1000步),蓝色箭头表示一致性模型从任意噪声状态一步映射到干净图像。
一致性模型的数学基础,是那个将任意噪声状态映射到干净估计的一致性函数。它对轨迹上任意两个时间点的输出施加强一致约束:只要两张图来自同一张干净图像的加噪结果,模型就必须把它们还原到同一个地方。
一致性函数定义公式
一致性函数要求对任意两个时间点t和t′,模型输出相同。图中左侧为该数学定义的截图。
训练一致性模型时,核心损失是让同一干净样本的两个噪声版本,经过学生网络和教师网络之后的输出尽可能接近。这种全局一致的约束,使得一致性模型在采样时只需一次或少数几次前向推理,就能逼近扩散模型几十上百步迭代的去噪质量。这正是CM-RED能把MRI重建压缩到4次网络评估的底气所在。

一致性模型如何成为MRI重建的"超级引擎"

有了“快”的生成模型,接下来就是怎么把它塞进MRI重建的求解流程里。医学影像领域处理这类问题,通常要跟一个经典逆问题公式打交道:从采集到的部分k空间数据y和编码算子E出发,寻找满足数据保真约束、同时符合图像先验的x。传统压缩感知用稀疏正则化,端到端深度学习方法则直接学映射,但前者在高加速倍数下画质吃紧,后者换一种扫描参数就容易水土不服。
RED(Regularization by Denoising,去噪正则化)提出了一条别致的路径:如果手里有一个强大的图像去噪器D,就可以用它构造一个显式的正则项,把“去噪能力”转化为“重建先验”。这个正则项长这样:
RED正则项公式
RED正则项表达式:x与去噪器输出D(x)之间的差异被当作惩罚信号。
这个公式的妙处在于,在“局部同质性”和“雅可比对称性”假设下,它的梯度恰好正比于x减D(x)——也就是把去噪器的“纠偏输出”当作梯度信号来迭代优化。RED-APG(Accelerated Proximal Gradient RED,加速近端梯度RED)进一步加入动量项,将数据保真更新与去噪更新解耦,大幅减少收敛所需的迭代数,让框架首次有了“跑得快”的潜力。
CM-RED的核心思路,就是把RED框架里那个“通用去噪器”换成预训练的一致性模型(Consistency Model,CM)。CM每次被调用,都相当于从当前带伪影的重建状态出发,用学到的海量清晰图像分布做一次强力的先验纠偏。整体迭代沿用RED-APG的三板斧:先做CM先验更新,再做数据保真更新,最后加动量加速。具体长相参见图2。
图2:CM-RED在N=4时的重建步骤示意图
图2:CM-RED在N=4时的重建步骤示意图(对应算法1)。可以看到中间重建图像在四步内从欠采样伪影逐步逼近清晰参考。
整个流程用一个简洁的伪代码就能说清楚:
    输入:预训练一致性模型fθ,编码算子EΩ,迭代次数N,超参数
    初始化:x = 由CG-SENSE(共轭梯度灵敏度编码重建)给出的线性重建结果
    循环 n = N-1 到 0:
      1) 给当前估计注入高斯噪声,送入一致性模型,得到去噪后的先验估计
      2) 用共轭梯度(CG)求解带二次惩罚的数据保真子问题,让结果向采集数据靠拢
      3) 对更新结果执行动量加速,平滑收敛路径
    返回:最终重建图像x
    有意思的是,这四步迭代的中间状态并不是“去噪一次、完事”的简单交替,而是每一步都在“数据一致性”和“生成先验”之间拉锯。四轮下来,信息从欠采样k空间逐步“翻译”成了符合解剖结构的高质量图像。

    噪声注入+动量加速:CM-RED的两大制胜法宝

    如果只是把CM塞进RED框架,性能还远远到不了碾压一切的程度。CM-RED能实现4步收敛,靠的是两个关键设计:受控噪声注入动量加速
    先说噪声注入。一致性模型有一个边界条件:当输入噪声水平趋近于零时,模型趋于恒等映射。这带来了一个隐蔽的坑——如果重建迭代到后期,当前估计相对干净,CM的“纠偏”力度就会变得很弱,更新步长过小,收敛拖沓甚至停滞。解决思路反直觉:既然噪声太小模型不肯干活,那就人为注入一点噪声,让CM“有活儿可干”。
    CM-RED先验更新公式
    CM-RED每次迭代的先验更新公式:先向当前估计注入σn大小的高斯噪声,送入一致性模型fθ做去噪,再用权重νn把去噪结果与当前估计做加权融合。
    在这个公式里,σn是注入噪声的标准差,σ̃n是CM内部使用的去噪噪声水平,νn是CM输出的融合权重。注入噪声越大,CM需要去掉的“脏东西”越多,给出的纠正更新步长就越可观,因此可以把整个迭代过程“顶”向高质量收敛区。类似地,随机扰动策略在CM4IR等工作里也出现过,说明这条思路在生成式逆问题求解中具有相当的普适性。
    数据保真更新则是通过求解一个带二次惩罚的最小二乘问题完成的:
    数据保真更新公式
    数据保真更新:重建结果既要吻合欠采样k空间数据y,又不能让CM的先验估计“跑偏太远”;λn是两者的权衡参数。该线性子问题用共轭梯度法(CG)高效求解。
    动量加速则沿用了RED-APG的经典做法:
    动量加速公式
    动量加速公式:给迭代过程加上“惯性”,用历史更新方向抑制振荡,让收敛曲线走得更直、更快。
    为了让这几个超参数从“玄学调参”变成“可控工程”,作者还做了细致的参数化:注入噪声水平σn由一个前向扩散的ᾱ序列决定,从初始扩散索引iN开始按比例γ衰减;CM去噪强度σ̃n在注入噪声基础上加一个偏移δn;CM输出权重νn按线性插值从κ1平滑上升到κ2附近;数据保真惩罚λ用softplus参数化保证正数;动量系数μn随剩余迭代步数衰减。整套超参数的组合见表1。
    表1:CM-RED四步采样设置的完整超参数列表
    表1:CM-RED四步采样设置的完整超参数,包括噪声调度、正则化参数、CM输出缩放参数和动量系数。注意膝盖和大脑所有对比度共用同一套配置,只需要按加速倍数R=4或R=8切换参数。
    值得强调的是,这套超参数在不同解剖部位、不同对比度、不同欠采样模式下完全统一,唯一需要调整的是加速倍数。这种“设置一次、到处能用”的特性,对工程落地而言相当友好。

    全面碾压:4次NFEs超越1000次NFEs的扩散模型

    光说不练假把式。团队在fastMRI膝盖和大脑两大数据集上做了一次“全方面体检”:膝盖覆盖PD和PD-FS两个对比度,大脑覆盖轴向T1增强前、T1增强后、T2和FLAIR四个对比度;加速倍数覆盖R=4和R=8;欠采样模式覆盖1D等距和1D高斯。对比方法也很有代表性:DPS(Diffusion Posterior Sampling,扩散后验采样),1000次网络评估;DDS(Denoising Diffusion Samplers,去噪扩散采样器),100次网络评估;以及同样是4步的CM4IR。这里的“网络评估次数”(NFE,Network Function Evaluation)就是前向调用神经网络的次数,直接决定重建耗时。
    先看等距欠采样下的视觉效果。
    图3:fastMRI膝盖和大脑数据上1D等距欠采样R=4和R=8的各方法代表性重建结果对比
    图3:fastMRI膝盖和大脑数据上,1D等距欠采样R=4和R=8条件下各方法的代表性重建结果。括号内为各方法使用的NFE数,黄框标出放大区域,红色箭头指出残余伪影。CM-RED在4步下的输出纹理最接近参考图。
    视觉上DPS虽然细节丰富,但在高加速倍数下仍有明显伪影;DDS质量有提升但代价是上百次迭代;同为4步的CM4IR在结构保真上存在肉眼可见的失真;而CM-RED在同样的4步条件下,边缘锐利、纹理自然、伪影最少。定量结果见表2。
    表2:fastMRI膝盖和大脑数据集上R=4和R=8、1D等距欠采样下各重建方法的定量对比
    表2:fastMRI膝盖和大脑数据集上,R=4和R=8、1D等距欠采样下的定量对比(PSNR/SSIM)。最好结果加粗,第二好结果加下划线。CM-RED在几乎所有对比度上拿下第一。
    在表2的14项指标里,CM-RED拿下了绝大多数第一,剩下的第二也基本是4步方法之间的“菜鸡互啄”。要知道DDS可是用了100次网络评估,是CM-RED的25倍计算量。
    换个更贴近临床实际的1D高斯欠采样场景,结论依然稳健。
    图4:高斯欠采样下的代表性重建结果对比
    图4:高斯欠采样下的代表性重建结果。括号内为各方法使用的NFE数,黄色方框为放大区域,红色箭头指向残余伪影。CM-RED在最终输出中依然保持最干净的对比度和解剖结构。
    表3:fastMRI膝盖和大脑数据集上R=4和R=8、1D高斯欠采样下各重建方法的定量对比
    表3:fastMRI膝盖和大脑数据集上,R=4和R=8、1D高斯欠采样下的定量对比。CM-RED继续领跑,且领先幅度在部分项目上比等距欠采样更明显。
    这笔速度账很好算:DPS一次重建烧掉1000次NFE,CM-RED只需要4次,直接快250倍;对标DDS的100次NFE也有25倍优势。在磁共振扫描的临床现场,这差距就是“漫长等待”和“秒出图”的天壤之别。4步赶超1000步,这句话放在CM-RED身上不是标题党,而是实验事实。

    鲁棒性与泛化性:一个模型通吃所有扫描场景

    一篇吃“工程落地”这碗饭的论文,光有平均指标好看还不够,还得证明自己不娇气。作者做了两件非常实在的事:一是系统性的超参数敏感性分析,二是带对照的消融实验。
    超参数扰动测试的做法是:在名义配置的基础上随机扰动注入噪声、去噪强度、动量系数等各项超参数,逐切片统计PSNR和SSIM的差异。
    图5:CM-RED在R=8高斯欠采样下的超参数敏感性分析小提琴图
    图5:CM-RED在R=8高斯欠采样下的超参数敏感性分析。小提琴图展示了名义配置与随机扰动超参数重建之间的逐切片PSNR差异(左)和SSIM差异(右)。绝大多数扰动带来的波动集中在±0.1dB以内,说明算法“不挑食”。
    图5里,绝大多数扰动造成的PSNR波动都压在±0.1dB范围内,SSIM的抖动更是可以忽略。这意味着即使没有很强的调参经验,拿到默认参数也能复现出接近论文的结果——对开源工作来说,这是比“刷高分”重要得多的素质。
    消融实验则直接回答了一个问题:噪声注入和动量加速,到底谁在起作用?
    表4:有无动量与噪声注入的消融对比
    表4:膝盖冠状位PD和大脑轴向T2、R=4等距欠采样下,去掉动量或噪声注入后的PSNR/SSIM对比(均使用4次NFE)。两个组件各司其职,叠加起来才能拿到最优成绩。
    从表4可以看出:去掉噪声注入,CM在低噪声状态下“摸鱼”,重建质量明显下滑;去掉动量,迭代收敛落在次优解上。两个机制各自贡献一块拼图,叠加后才有4步达成最终质量的效果。
    收敛行为也很有意思。作者画了CM-RED从4步到30步的PSNR/SSIM曲线。
    图6:噪声注入和动量对CM-RED收敛的影响
    图6:噪声注入和动量对CM-RED收敛的影响(fastMRI轴向T1增强后大脑数据,R=8等距欠采样,PSNR和SSIM随4到30次NFE的变化)。完整版CM-RED在4步就稳住最优区间,被消融掉任一组件的变体则需要更多步数才能追上来。
    最有价值的信息是:完整版CM-RED在4步时已经进入性能平台期,继续加迭代步数几乎没有收益;而消融掉噪声注入或动量后,曲线在8步甚至更多步数下仍在缓慢爬升。换句话说,这两个机制不仅提高最终质量,更是“4步收敛”这件事本身的决定性因素。
    跨解剖的泛化能力同样扎实。膝盖和大脑两个解剖部位、共六种对比度加权、两种欠采样模式和两档加速倍数,全部走同一条CM-RED流程,超参数只按加速倍数切换。对医学影像算法而言,这种“一法通吃”的属性,往往比在单一benchmark上刷高零点几个dB更值得关注。

    未来展望:生成式MRI重建的下一站

    生成式模型在逆问题求解里最大的痛点,从来都不是表达力不够,而是“慢”。CM-RED用一套干净利落的组合拳证明:高质量与低步数可以同时成立,而且把预训练生成先验嵌入优化框架之后,可以绕开大量端到端的重新训练成本。
    当然,CM-RED距离真正的产线落地还有一段路。目前的实验主要基于二维切片重建,扩展到三维体积采集、多平面成像还需要适配;R=8以上的更高加速倍数仍存在质量随加速上升而下降的趋势;一致性模型的训练对数据规模和算力也有不低的要求,大脑模型从零训练用了A100集群上的大量迭代。但路径已经跑通:从1000步到4步,这种数量级的效率飞跃,会让更多研究者意识到,“用生成模型做重建”不等于“等不起”。
    更进一步地,CM-RED这种“通用生成先验+即插即用优化”的思路,理论上并不局限于MRI。CT低剂量重建、PET稀疏角度重建以及其他线性逆问题,都可以借鉴这套“快生成+稳收敛”的组合逻辑。代码和预训练模型已经公开在GitHub上,配合fastMRI公开数据集,复现门槛被压到了相当低的水平——对于追赶前沿的研究团队和想要落地加速MRI的工程团队来说,这都是一份值得收藏的参考。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:
    这篇论文到底在解决什么问题?CM-RED将一致性模型嵌入去噪正则化框架,在fastMRI膝盖与大脑数据上仅用4次网络评估即完成高质量MRI重建,全面超越扩散模型方法,计算量降低25至250倍。代码与预训练模型已开源。
    这篇工作最值得看的点是什么?在几乎所有配置下(包括不同解剖部位、对比度、加速因子和欠采样模式)均取得最优或次优的PSNR和SSIM,仅需4次NFEs,显著优于需要100-1000次NFEs的现有方法。
    这篇工作的边界或风险在哪里?优点:1)仅需4次NFEs即可实现高质量重建,计算效率极高;2)对不同解剖部位、对比度和采样模式具有良好泛化性;3)对超参数扰动具有鲁棒性;4)无需针对特定采样模式重新训练。缺点:1)需要预先训练扩散模型并蒸馏为一致性模型,训练成本高;2)依赖全采样训练数据;3)超参数需要针对不同加速因子手动调整;4)与PD-DL方法相比,在匹配训练协议下性能可能不如后者。
    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    将预训练的一致性模型(CM)作为去噪正则项嵌入RED-APG优化框架,通过受控噪声注入和动量加速实现仅需4次网络评估的高质量MRI重建。

    实验合理度:★★★★☆

    峰值信噪比(PSNR)和结构相似性指数(SSIM)。

    学术研究价值:★★★★☆

    将预训练的一致性模型(CM)作为去噪正则项嵌入RED-APG优化框架,通过受控噪声注入和动量加速实现仅需4次网络评估的高质量MRI重建;更关键的是问题定义是否可复用到同类任务。

    稳定性:★★★☆☆

    现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

    适应性以及泛化能力:★★★☆☆

    现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

    硬件需求及成本:★★★☆☆

    仅需4次网络函数评估(NFEs),相比DPS(1000 NFEs)和DDS(100 NFEs)分别获得250倍和25倍的加速。

    复现难度:★★★☆☆

    https://github.com/MerveGulle/CM-RED

    产品化成熟度:★★★☆☆

    论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

    可能的问题:1)需要预先训练扩散模型并蒸馏为一致性模型,训练成本高;2)依赖全采样训练数据;3)超参数需要针对不同加速因子手动调整;4)与PD-DL方法相比,在匹配训练协议下性能可能不如后者。


    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

    LONGGE AI COMMUNITY

    把每天读到的论文,变成长期积累

    加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

    加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

    龙哥读论文知识星球二维码 微信扫码加入知识星球