← 返回 PaperDaily 视觉与图像

CVPR 2026:近零折叠+精度效果优于现有方法,SGDIR带你告别积分烦恼

医学图像配准领域又迎来一位强力选手!阿尔伯塔大学团队在CVPR 2026上提出SGDIR,仅用半群正则化就搞定了微分同胚配准,彻底摆脱繁琐的积分和辅助约束。严格模式下几乎零折叠,放松模式精度吊打SOTA,训练推理还快一倍。这篇理论扎实、实验全面,值得仔细品味。

CVPR 2026:近零折叠+精度效果优于现有方法,SGDIR带你告别积分烦恼
原论文信息如下:
论文标题:
Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularization

发表日期: 2026年(CVPR 2026)

发表单位: University of Alberta

原文链接: Open Access PDF

微分同胚配准的瓶颈:积分和辅助正则化

搞医学图像配准的小伙伴都知道,微分同胚配准(Diffeomorphic Image Registration, DIR)一直是这个领域里的“皇冠任务”之一。它要求找到的形变场不仅要让两幅图对齐,还必须保证拓扑结构不变——说白了就是不能出现折叠(folding)或撕裂(tearing),这在器官解剖结构的配准中是绝对的刚需。
然而传统做法有多麻烦呢?先要用一个速度场(velocity field)通过积分(比如经典的scaling-and-squaring)来得到形变场,然后还得加上一堆辅助正则化——Jacobian行列式惩罚、平滑性约束、循环一致性损失……光是调这些正则项的权重就能让研究者头大。更别提这些方法要么推理慢(迭代积分),要么精度和拓扑保持之间顾此失彼。
现有的学习框架,不管是VoxelMorph、TransMorph、DiffuseMorph,还是那些号称微分同胚的SYMNet、LapIRN,要么依赖积分策略,要么需要显式的逆场预测和循环一致性损失。总之,“微分同胚”这件事从来不是模型自己学会的,而是被人为硬塞进去的。这就导致了模型复杂、训练周期长、推理效率低。
那么问题来了:有没有一种方法,让网络自己从数据中“悟出”微分同胚,而不用我们手动塞积分和正则化?
SGDIR 给出了一个漂亮的答案。

SGDIR:只用半群约束就让网络学会ODE流

SGDIR的全称是Semigroup Diffeomorphic Image Registration(半群微分同胚图像配准)。它的核心创新点非常纯粹:只用一条半群正则化损失,就让网络自动学会生成一个满足ODE流的形变场,从而原生地保证微分同胚性质,彻底告别scaling-and-squaring和所有辅助正则化。
先简单回顾一下数学基础。如果形变场{ϕ_t}是某个稳态速度场v的ODE流(dϕ_t/dt = v(ϕ_t)),那么它满足半群性质:ϕ_{t+s} = ϕ_t ∘ ϕ_s。反过来,如果一个连续的时间形变族满足半群性质,那它就是一个ODE流,并且自然可逆(逆映射由ϕ_(-t)给出)。SGDIR正是利用了这一等价性。
但直接强制所有时间对(t, s)满足半群等式是难以实现的。作者的洞察是:只约束局部条件——也就是让ϕ_t强制为一个指数映射(exponential map),就可以推出全局半群。具体地,他们提出了一个部分半群正则化
L_semi = || ϕ_{t+s} - ϕ_t ∘ ϕ_s ||^2 + || ϕ_{-t} - (ϕ_t)^{-1} ||^2
其中ϕ_t由网络直接预测(输入时间t和一对图片),ϕ_0 = x恒等映射。论文证明了,只要网络优化到满足这个部分半群约束,那么ϕ_t一定是一个ODE指数映射,从而自动满足全半群、可逆性和循环一致性。这一理论结果非常优雅——与那些显式预测前后场、加双向一致性损失的方法相比,SGDIR让网络“内生”地具备这些性质。
图2:SGDIR架构(左)、训练方案(中)和推理方案(右)。DiT模块根据[37]实现。更多架构细节见补充材料第9节。
图2:SGDIR架构(左)、训练方案(中)和推理方案(右)。DiT模块根据[37]实现。更多架构细节见补充材料第9节。
在实现上,SGDIR采用了扩散模型中常见的时间嵌入架构(Time-embedded UNet或Diffusion Transformer, DiT)。注意力机制配合时间位置编码,让网络能够根据不同时间t生成对应的形变场。训练时随机采样t ∈ [-1,1],优化目标为:
L_total = L_sim + λ * L_semi
其中L_sim是归一化互相关(NCC)相似度损失,λ控制半群约束的强度。这里的λ就是后面调节“微分同胚程度”的关键旋钮。

理论保证 + 实验验证:8个数据集全面超越

理论很漂亮,但效果到底怎么样?作者在8个公开的2D/3D MR和CT数据集上进行了严格评估,包括OASIS(脑MRI)、CANDI、LPBA40、Mindboggle101、IXI、ACDC(心脏MRI)、LungCT和AbdomenCTCT。对比方法覆盖了当前所有主流范式:传统微分同胚(SyN)、学习型微分同胚(SYMNet、LapIRN、NePhi、TransMorph-diff、CycleMorph、GradICON等)、以及非微分同胚的变形模型(TransMorph、H-ViT、CorrMLP、DiffuseReg等)。
先看脑MRI数据集上的结果。下表展示了OASIS数据集上Atlas-Based和Inter-Subject两种设置下的完整对比:
表1:OASIS数据集上Atlas-Based和Inter-Subject设置的定量配准结果。最佳结果以粗体表示,最佳对比方法以蓝色表示。
表1:OASIS数据集上Atlas-Based和Inter-Subject设置的定量配准结果。最佳结果以粗体表示,最佳对比方法以蓝色表示。
可以看到,在严格微分同胚设置下(λ=10^5),SGDIR_DiT在Atlas-Based中Dice达到86.53%,比最好的微分同胚方法TransMorph-diff(84.63%)高出近2个百分点,同时折叠率(|J|<0%)为0.0%,这几乎是完美拓扑保持。而它的非微分同胚版本(λ=10^4)进一步将Dice提升到88.09%,直接超越了所有非微分同胚的SOTA方法(最好的是H-ViT 85.38%)。
再看看其他四个脑MRI数据集上的结果汇总:
表2:脑MRI数据集上的定量配准结果。为清晰只显示Dice和拓扑违反率(|J|<0%)。完整指标见补充材料。最佳结果粗体,最佳对比蓝色。
表2:脑MRI数据集上的定量配准结果。为清晰只显示Dice和拓扑违反率(|J|<0%)。完整指标见补充材料。最佳结果粗体,最佳对比蓝色。
在IXI、Mindboggle101、LPBA40和CANDI上,SGDIR_DiT(λ=10^5)的Dice全面领先所有微分同胚方法,平均超出2-3个点,且折叠率几乎为0。而放松后的非微分同胚版本更是把Dice推到了83.88%(IXI),比最强对比法H-ViT(80.67%)高出3.2个百分点。
接下来看腹部CT和肺部CT的挑战性配准:
表3:AbdomenCTCT数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
表3:AbdomenCTCT数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
在AbdomenCTCT上,SGDIR_UNet(λ=10^5)的Dice达到53.64%,远超所有微分同胚方法(最好NePhi 45.32%),甚至超过了非微分同胚的SOTA方法SACB-Net(53.38%)和H-ViT(47.66%)。放松后SGDIR_UNet(λ=10^4)更是达到56.57%,提升超过6%。
表4:LungCT数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
表4:LungCT数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
在LungCT数据集上,SGDIR_UNet(λ=10^5)的TRE(目标配准误差)仅为2.37 mm,优于NePhi(2.87 mm)和GradICON(2.64 mm),且折叠率为0.0%。放松后(λ=10^4)更是将TRE压到2.23 mm,低于CorrMLP(2.48 mm)等所有非微分同胚方法。
表5:ACDC数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
表5:ACDC数据集上的定量配准结果。最佳结果粗体,最佳对比蓝色。
在心脏MRI(ACDC)上,SGDIR_DiT(λ=10^5)的Dice达到85.79%,高于AdaCS(85.46%),且折叠率为0.0%。放松后的SGDIR_DiT(λ=10^4)Dice达到88.07%,全面领先所有对比方法。
下面的性能总结图可以直观感受到SGDIR的统治力:
图1:SGDIR在微分同胚和非微分同胚设置下的性能总结,与实验中最佳(非)微分同胚方法对比。SGDIR在微分同胚设置下与顶尖变形模型持平,在非微分同胚设置下则全面超越。
图1:SGDIR在微分同胚和非微分同胚设置下的性能总结,与实验中最佳(非)微分同胚方法对比。SGDIR在微分同胚设置下与顶尖变形模型持平,在非微分同胚设置下则全面超越。
这效果,真不错!

两种模式随意切换:严格微分同胚 or 高精度变形

SGDIR有个特别棒的特性:只需要调整正则化权重λ,同一个网络就能在“严格微分同胚”和“高精度变形”两种模式之间无缝切换
下面这个消融实验表展示了λ从10^5到0的变化效果:
图6:LungCT数据集上的视觉对比。左侧为最佳SGDIR,中间为变形方法,右侧为微分同胚方法,显示配准后的绝对差。表6:λ对OASIS和LungCT数据集上Dice、TRE和|J|<0%的影响。
图6:LungCT数据集上的视觉对比。左侧为最佳SGDIR,中间为变形方法,右侧为微分同胚方法,显示配准后的绝对差。表6:λ对OASIS和LungCT数据集上Dice、TRE和|J|<0%的影响。
当λ=10^5时,模型几乎达到完美微分同胚(折叠率0.0%),Dice和TRE仍然非常有竞争力。当λ降低到10^4,折叠率略有上升(0.4%左右),但精度大幅提升(OASIS Dice从85.90%升至87.82%,LungCT TRE从2.37降至2.23)。如果继续降低λ到10^3以下,折叠率会急剧恶化,精度反而下降——这说明适当的半群约束不仅保证拓扑,还能作为有效的正则化项,帮助模型学到更优的变形轨迹。
下面这个可视化展示了SGDIR在不同时间步上的Dice和折叠率演变:
图7:SGDIR变体在整个时间过程中的Dice分数(上)和前向形变的拓扑保持(下)。
图7:SGDIR变体在整个时间过程中的Dice分数(上)和前向形变的拓扑保持(下)。
可以清楚看到,严格微分同胚版本(λ=10^5)在整个时间区间[0,1]上折叠率始终为0,而变形版本(λ=10^4)只在接近t=1时出现少量折叠。Dice分数则平滑上升,体现了连续时间建模的优势。

计算效率翻倍,推理速度提升2倍

除了精度和拓扑保持,SGDIR在效率上的优势同样显著。由于完全摒弃了scaling-and-squaring积分步骤,推理时只需要一次网络前向传递即可得到任意时间点的形变场。相比之下,传统微分同胚方法(如SYMNet、TransMorph-diff)需要在推理时迭代积分16~64步。
根据论文中的分析,SGDIR在3D扫描上的推理时间约为18-25ms,而需要积分的微分同胚方法通常需要40-60ms,速度提升约2倍。更重要的是,SGDIR能够直接输出任意中间时间步的变形场,这在需要时序分析(如心脏运动跟踪)的场景中是天然的便利。
另外,SGDIR的训练也更加简洁:不需要设计多任务损失平衡,只需要优化一个相似度损失和一个半群正则化损失,超参数只有一个λ。对于习惯于调参的团队来说,这简直是福音。
最后,再放几张视觉对比图,感受一下SGDIR的形变网格——平滑且精确:
形变网格叠加在变形图像上。SGDIR显示出最平滑的网格同时具有高Dice精度。
形变网格叠加在变形图像上。SGDIR显示出最平滑的网格同时具有高Dice精度。
图4:SGDIR在AbdomenCTCT数据集上与顶尖微分同胚和非微分同胚方法的视觉比较。-diff后缀表示λ=10^5训练的SGDIR,无后缀的SGDIR为λ=10^4训练。
图4:SGDIR在AbdomenCTCT数据集上与顶尖微分同胚和非微分同胚方法的视觉比较。-diff后缀表示λ=10^5训练的SGDIR,无后缀的SGDIR为λ=10^4训练。
图5:SGDIR在ACDC数据集上的视觉比较,叠加了分割掩膜。
图5:SGDIR在ACDC数据集上的视觉比较,叠加了分割掩膜。
LungCT数据集上的视觉对比。左侧为最佳SGDIR,中间为变形方法,右侧为微分同胚方法,显示配准后的绝对差。
LungCT数据集上的视觉对比。左侧为最佳SGDIR,中间为变形方法,右侧为微分同胚方法,显示配准后的绝对差。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

SGDIR中的半群正则化具体是如何计算的?作者在训练时随机采样时间对(t, s),计算ϕ_{t+s}与ϕ_t ∘ ϕ_s之间的均方误差作为半群约束。同时,他们还加入了一项对称性约束,迫使ϕ_{-t} = (ϕ_t)^{-1}。组合这两项就构成了L_semi。注意,ϕ_t是通过网络直接预测的形变场,而不是通过积分得到的。

为什么SGDIR能同时做微分同胚配准和变形配准?关键参数λ控制半群约束的强度。当λ足够大时,网络被迫学习一个严格满足半群性质的形变族,从而成为微分同胚映射。当λ适度放宽,网络可以牺牲部分拓扑保持来换取更高的配准精度。两种模式共享同一套网络参数,只需要在训练时更换λ的值,或者在推理时对同一个网络使用不同的时间t即可(大λ对应严格模式,小λ对应弹性模式)。

SGDIR的代码开源了吗?论文中表示将释放代码,但截至本文发布时尚未看到正式开源链接。不过作者给出了详细的补充材料(包括所有实验配置和超参数),理论上复现难度不高。建议关注项目页面以获取最新进展。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次从理论到实践证明了仅用半群正则化即可学到微分同胚ODE流,彻底摒弃了积分和辅助正则化,思路极为新颖,属于范式级别的创新。

实验合理度:★★★★★

在8个公开数据集上与十几种SOTA方法进行了全面对比,包括严格的微分同胚方法和非微分同胚变形方法。实验设置清晰,统计指标完备(Dice、TRE、HD95、SSIM、ASSD、|J|<0%),且进行了充分的消融分析(λ的影响、时间采样方式等)。结果一致且具有说服力。

学术研究价值:★★★★★

为图像配准中的微分同胚问题提供了一个全新的视角,将拓扑保持与自监督学习有效结合。其理论证明(部分半群→全半群→ODE流)具有普适意义,可以应用于其他需要连续变换的领域(如图形学、遥感配准)。

稳定性:★★★★☆

在严格模式下(λ=10^5)几乎零折叠,表现出极强的拓扑稳定性。在变形模式下(λ=10^4)折叠率也控制在0.6%以下,表现稳健。但在极端退化(λ<10^3)时折叠率会显著升高,表明对超参数仍有依赖。

适应性以及泛化能力:★★★★★

在脑MRI、心脏MRI、腹部CT、肺部CT多种模态和器官上进行了验证,均取得领先结果。架构无关的特性允许用户替换不同的时间嵌入骨干(UNet、DiT),证明其具有良好的通用性。

硬件需求及成本:★★★★☆

推理速度比需要积分的微分同胚方法快约2倍(单卡RTX 3090上3D扫描18-25ms)。训练方面,使用时间嵌入网络参数量与同类方法相当,单卡可训练。相比扩散模型(DiffuseMorph等)需要的迭代采样,SGDIR的一次推理优势明显。

复现难度:★★★★☆

论文提供了详细的补充材料,包括所有数据集预处理、训练超参数、架构细节。主干使用常见的UNet/DiT实现,半群正则化计算简单。唯一可能的障碍是代码尚未公开,但根据描述,使用PyTorch复现应该不复杂。

产品化成熟度:★★★☆☆

在学术基准数据集上表现优异,但医疗产品落地通常需要经过更严格的临床验证(如真实手术导航、放射治疗计划)。此外,变形模式下的少量折叠(0.6%)在某些安全关键场景可能仍不可接受。不过作为科研工具或辅助诊断模块已具备较好基础。

可能的问题:半群正则化中的组合操作ϕ_t ∘ ϕ_s需要用到双线性插值,这种插值会引入近似误差,理论上可能影响梯度。虽然实验效果良好,但更精确的采样策略(如splatting)或许能进一步提升性能。此外,论文没有提及对时间步长的自适应采样,固定采样策略可能在极端形变时效率不高。

主要参考文献

[1] M. Matinkia, N. Ray. Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularization. CVPR 2026.
[2] 论文原文链接: https://openaccess.thecvf.com/content/CVPR2026/papers/Matinkia_Learning_Diffeomorphism_for_Medical_Image_Registration_with_Time-Embedded_Architectures_Using_CVPR_2026_paper.pdf
[3] 代码(即将开源): 请关注作者GitHub页面 https://github.com/matinkia

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,与上千名医学影像、图像处理同好一起交流。扫描下方二维码或添加龙哥助手微信号:kangjinlonghelper。备注:医学影像+城市+单位+昵称,更快通过哦!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。