← 返回 PaperDaily 视觉与图像

低剂量CT去噪告别配对数据!物理驱动新框架:17项指标反超监督基线

低剂量CT(LDCT)的临床价值不用多说——辐射剂量降低了,患者风险下来了,可图像里的噪声就上去了。泊松-高斯混合噪声趴在投影数据里,重建出来的图像出现条纹和伪影,直接影响医生下诊断。传统去噪方法靠人工先验,效果有限;

低剂量CT去噪告别配对数据!物理驱动新框架:17项指标反超监督基线
原论文信息如下:
论文标题:
Physics-Driven Independent Pair Generation for Iterative Self-Supervised Low-Dose CT Denoising
发表日期:
2026年09月
发表单位:
上海科学智能研究院
原文链接:
https://arxiv.org/pdf/2609.02654v1.pdf

paperdaily_reaction_gif

低剂量CT去噪的困境:如何摆脱配对数据依赖?

低剂量CT(LDCT)的临床价值不用多说——辐射剂量降低了,患者风险下来了,可图像里的噪声就上去了。泊松-高斯混合噪声趴在投影数据里,重建出来的图像出现条纹和伪影,直接影响医生下诊断。传统去噪方法靠人工先验,效果有限;监督学习方法(比如RED-CNN这种),理论效果确实好,但需要成对的低剂量/正常剂量数据。临床采集这种配对数据贵、难、还不现实,这几乎成了深度学习落地CT去噪的最大拦路虎。
自监督方法大方向上是想解决"无配对数据"困境的。Noise2Noise(N2N)告诉我们:只要有两张噪声独立的观测图,不需要干净的标签也能训练。可问题来了——低剂量CT噪声是混合的,光子计数波动服从泊松分布,电子读出噪声又另算一份高斯分布,两种噪声在投影域纠缠在一起,经重建又变成图像域的复杂空间结构噪声。N2N这种通用的自监督方法,根本不care CT物理采集模型,只是基于通用图像统计硬上,构造出来的配对是不是真的满足"独立噪声实现"这个关键假设?没人敢打保票。
公式1
上图是论文使用的LDCT投影测量模型,式(1):Y是低剂量投影测量值,C服从泊松分布(均值μ),ε是均值为0、方差为σ²的高斯读出噪声。两种噪声掺在一起,不好分家。
现有自监督LDCT去噪方法主要分两派:图像域方法和投影域方法。
图1:代表性的LDCT去噪自监督方法对比
图1:(a)图像域方法、(b)投影域方法和(c)本论文提出的框架。
图像域里,Noise2Void、Noise2Self、Blind2Unblind这类盲点网络思路做个改革,Neighbor2Neighbor玩邻域子采样,Noise2Sim利用非局部相似性,还有WIA-LD2ND在波域对齐——它们的问题在于:没考虑CT采集物理过程和噪声形成机理,没直接使用投影测量数据和前向模型,与真实CT噪声分布之间存在偏差。投影域做得更直接一些:Half2Half把一个采集的投影拆成两半,USGF利用投影结构信息去噪,有的方法用光子计数的二项薄化做配对,还有Wang等人提出的N2N-BS用光子计数分裂构造配对——但这些方法往往依赖特定的划分方式或简化的噪声假设,配对样本的产生与采集划分有关。
这里有一个深层问题:在投影域,光子计数波动和电子噪声是不同分布的;重建过程把它们混成了图像域里有空间结构的噪声。如果自监督方法只是在图像域里做各种重采样或盲点操作,噪声统计信息可能已经被重建过程搅乱了,构造出的配对就不满足N2N假设。
这篇论文想解决的问题就是:能不能同时把"混合泊松-高斯噪声的分离"和"投影域-图像域的交叉反馈"都做好了,让构造出来的训练配对真正逼近独立噪声实现,而不是瞎凑。
为此,本文提出了一种物理驱动跨域迭代的自监督低剂量CT去噪框架。原文提供代码在GitHub上可以找到:https://github.com/yqx7150/PIPG-LDCT。源码这一块,作者做得很利索。

物理驱动配对生成:从混合噪声中分离独立样本

论文方法的第一个亮点,是把CT成像物理(Beer-Lambert定律)与噪声统计模型结合起来,从单次低剂量测量中推断潜在光子计数,再可靠地"拆开"泊松和高斯两个噪声分量。
思路可以分成三步走:先学会一个正弦图先验,再去推断光子计数的后验分布,最后做方差匹配的数据拆分。
第一步:有先验才知道怎么拆。这里论文在正弦图域里引入了一个带盲点策略的自监督去噪网络f_θ来生成先验ŷ=f_θ(ỹ)。参考了Blind2Unblind的思路,用可重可见损失(re-visibility loss)把掩码分支和非盲分支接起来。论文比较巧的地方是用了高低两种掩码率:高掩码率分支提供更强的盲点约束,低掩码率分支提供更丰富的上下文信息,并以β参数做训练中的动态调度。
公式:L_prior = [1-β]L_h + βL_l
公式(3)中,L_prior为总的先验学习损失,β动态地从0.25调度到0.9:训练早期更依赖高掩码率分支的强约束,后期则倾向于低掩码率分支的细节恢复。
第二步:贝叶斯后验推断拆解混合噪声。得到了先验后,利用Beer-Lambert定律把正弦图线性积分值映射成光子计数的期望值μ = I₀·exp(−y),其中I₀是无衰减入射光子数。再对这个期望计数结合噪声方差σ²,用贝叶斯公式计算后验分布。
公式:μ = I₀exp(-y)
μ = I₀ · exp(−y),即Beer-Lambert定律给出的理想线积分y与光子计数期望之间的关系。
公式:后验分布
式(6)中后验分布由两项因子构成:泊松先验项和以高斯读出噪声为似然的项。理论框架是干净利落的。
公式:后验概率计算
式(7)给出离散化的后验概率计算方式。其中C是有限候选集,Γ(·)是伽马函数。通过计算后验均值c̄和后验方差v_c,可以得到光子计数的估计和不确定性度量。
这里有个很实用的细节处理:网络的先验估计有时候是带偏差的,如果直接用,拆分出来的统计特性就会失真。论文定义了一个归一化差异χ,衡量后验对先验的偏离程度,再对先验做自适应修正。
公式:自适应修正
式(9)中,当网络先验在统计上与后验一致时,权重W趋近于0;当偏差较大时,W变大并将光子计数先验向后验均值c̄靠拢。
第三步:分布特定的数据薄化(data thinning)。这是构造"独立噪声实现"的关键一步。拆出噪声后,需要用数学上合适的方式把一个测量样本变成两个。对于泊松分量C*,使用二项薄化(binomial thinning):
公式:二项薄化
式(12)中,对泊松计数的两个分支做二项薄化,α为薄化比例。理想泊松模型下,这两个分支关于y条件独立,各自的有效剂量比例为α和1−α。这个处理有严格的数据统计基础支撑——所谓数据薄化(data thinning),就是要把一个样本的噪声实现拆分成两个条件独立的部分。
对于高斯分量ε*,则引入一个独立的高斯噪声Z来控制分支间的协方差为零:
公式:高斯分量拆分
式(13)中,当τ = √(α(1−α))时,两个分支高斯噪声的协方差为零。
泊松和高斯拆完后再分别重组,就得到两个低剂量观测的分支。这里需要做对数变换把光子计数转换成正弦图域。但问题来了:对数变换有非线性,分支噪声的方差会被放大一个倍数,大约是1/d_k倍。
公式:条件噪声方差近似关系
式(15):一阶近似下,分支k的条件噪声方差约等于观测噪声方差的1/d_k倍。如果直接把这两个分支样本送去训练,图像域网络看到的输入噪声水平远高于推理阶段,就出现了分布偏移。
论文这里用了残差缩放(residual scaling)来做方差匹配。把每个分支的残差按系数缩放后加回到修正之后的先验上,让分支的噪声方差与观测的方差一致。
公式:方差匹配
式(16)中,缩放系数α_k^var取√d_k时可以匹配条件分支方差与观测方差,仅改变噪声残差的幅度,不影响随机性。
做完方差匹配的两个正弦图分支,再用CT重建算子A⁻¹(·)重建回图像域,就得到了一对带近似独立噪声的图像,可直接用于N2N式的图像域自监督训练。

跨域迭代闭环:正弦图与图像域的协同优化

细品之下,这套框架的"跨域迭代"才是贯穿全篇的灵魂线。若只是做一次"投影域分对→重建→图像域训练"的流水线,先验网络如果误差大,后面拆出来的配对也带着偏差。所以论文把整个过程包装成"投影域→图像域→投影域→……"的外层迭代闭环。
图2:论文提出方法的整体框架
图2:本文方法的完整框架图。(a)正弦图先验学习:高低掩码率+非盲分支;(b)后验引导的泊松-高斯配对构造:含残差缩放方差匹配;(c)跨域迭代训练:正弦图先验↔图像域去噪网络反复优化。
具体操作是:第t轮迭代时,已修正的先验ŷ_t被送入生成器G,产生两个随机图像分支(x_t⁽¹⁾, x_t⁽²⁾),送入图像域网络g_ω做N2N式的训练,损失函数如下:
公式:图像域损失
式(19)的L_img是图像域训练损失,两个分支互为监督目标。
训练完后,把两个分支恢复图的平均结果进行前向投影,得到投影域的目标y_{t+1}^img,用它来更新正弦图先验网络。
公式:正弦图更新损失
式(21)中,L_sino包括先验损失和跨域一致性约束两项,λ_iter用于平衡两者。
有一点值得注意——图像域恢复出的结果被前向投影回正弦图域后,会作为目标去修正先验网络。这种"前向投影"的意义在于把CT物理采集模型嵌进迭代流程中,保证信息在跨域传递时不偏离CT采集物理约束。整个框架的insight在这里集中体现。
图3:推理流程
图3:推理阶段流程——正弦图残差融合+图像域精修。先利用训练好的正弦图网络估算先验,与观测残差做加权融合,再对重建的图像做精修。
推理阶段也做了精心设计,并非简单地把网络输出直接当结果。因为正弦图网络在去噪时可能把弱信号也一起抹掉,所以把观测残差按α_inf比例加回去做信息融合。
公式:推理融合
式(23)中,α_inf为平衡噪声抑制和细节保留的融合系数。论文在实验中取α_inf=1,既能降噪又保留细节。
整个训练过程总结为算法流程:外层迭代5次,每一轮交替做正弦图网络更新和图像域网络更新。这种把深层网络的中间状态和CT物理模型相互校准的做法,比单纯让网络"自由发挥"有了更可靠的抓手。

实验验证:模拟与真实数据上的全面突破

光说不练假把式。论文在三个模拟数据集(AAPM Mayo、LIDC-IDRI、LoDoPaB-CT)和两组真实数据(GE临床心脏数据、小鼠胸部CT数据)上做了实验验证,横向对比方法涵盖了传统方法(FBP、BM3D)、自监督方法(N2V、N2N、B2U、N2Sim、N2N-BS)和监督方法(RED-CNN),可以说是相当全面了。
下表展示了低剂量水平下的定量结果。需要注意的是,这里剂量水平指的是I₀值,5×10³对应0.5%剂量,1×10⁴对应1.0%剂量,辐射剂量越低噪声越强。
表1(a):0.5%剂量下的定量对比结果
表1(a):在0.5%剂量(I₀=5×10³)下,不同方法在AAPM、LIDC-IDRI、LoDoPaB-CT三个数据集上的定量比较结果(PSNR↑、SSIM↑、RMSE↓)。
表1(b):1.0%剂量下的定量对比结果
表1(b):在1.0%剂量(I₀=1×10⁴)下,不同方法在三个数据集上的定量比较结果。
从0.5%剂量结果来看,本文方法在所有自监督方法中全面领先,并且在大部分指标上超过了监督方法RED-CNN。具体看,在0.5%剂量下,AAPM的PSNR达到38.39dB,比N2N-BS高0.48dB;LIDC-IDRI达到40.89dB,SSIM 96.39%;LoDoPaB-CT达到36.79dB。18个指标里有17项超过了有监督的RED-CNN,且模型训练时完全没有使用任何配对数据。唯一略低于RED-CNN的,是AAPM在1.0%剂量下的SSIM(95.72%对95.91%),差距很小。
需要说清楚的是,"超过监督基线"这一表述主要是在当前数据划分与剂量模拟设置下的结论。结合PaperDaily已收录的论文进行横向观察,这一结果与同类自监督LDCT去噪方法的报告水平基本一致——自监督方法在性能上逐渐逼近甚至在某些指标上追平监督方法,是近两年该方向的整体趋势。不同论文的数据切分、剂量模拟方式和评价协议存在差异,不应该把"17/18项超过RED-CNN"直接理解为在所有临床条件下自监督已全面碾压监督方法。
再看可视化结果。论文展示了AAPM数据集在两种剂量下的代表图像对比,每个子图包含CT图像、放大ROI和误差图三个部分。观察误差图就能发现,本文方法的误差图分布更均匀,没有明显的块状残留——这是纯图像域方法经常出现的通病。
图4:AAPM在0.5%剂量下的去噪效果对比
图4:AAPM数据集在I₀=5×10³(0.5%剂量)下的代表性去噪结果,包含CT图像、放大ROI和误差图。ROI使用[−1000, 1000] HU窗口显示。
图5:AAPM在1.0%剂量下的去噪效果对比
图5:AAPM数据集在I₀=1×10⁴(1.0%剂量)下的代表性去噪结果。ROI使用[−400, 1600] HU窗口显示。
图6:LIDC-IDRI在0.5%剂量下的去噪效果对比
图6:LIDC-IDRI数据集在I₀=5×10³(0.5%剂量)下的代表性去噪结果。ROI使用[−400, 1600] HU窗口显示。
对比几种方法可以发现:BM3D仍有可见的残余噪声;N2V、N2N、B2U虽然能降噪但边缘模糊;N2Sim和N2N-BS更干净但过度平滑,部分细节被抹掉了;本文方法在降噪和结构保持之间取得了更好的平衡。论文还把图像域局部频率谱放在一起比较,观察发现本文方法在抑制随机噪声频率成分时还能保留清晰的高频响应——这种空间域+频率域的双重验证方式很直观。
真实数据的测试也很能说明问题。GE临床心脏数据和高低能窗的小鼠数据上,本文方法在背景均匀性和结构边缘保持方面都表现更优。
图7:GE临床心脏数据去噪结果
图7:GE临床心脏数据集上的真实数据去噪结果,展示了重建图、局部频率谱和放大ROI。ROI使用[0, 1600] HU窗口。
图8:真实小鼠低剂量CT数据去噪结果
图8:真实低剂量小鼠CT数据上的去噪结果,同样展示重建图像、局部频率谱和放大ROI。
这里有个值得关注的点:真实数据上其他自监督模型(尤其是利用投影光子计数分裂的N2N-BS)仍会出现过度平滑现象,而本文方法保留了更好的结构响应。原因可能与混合噪声分量的完整拆分有关——N2N-BS默认光子计数符合纯泊松分布,忽略了高斯读出噪声分量。真实CT系统里读出噪声是必然存在的。
接着看组件消融实验。论文设计了四个变体,移除不同模块来验证单独贡献。
图9:组件消融实验
图9:AAPM在I₀=1×10⁴下的定性组件消融。(a)无图像域模块;(b)无后验推断;(c)无方差匹配;(d)无跨域迭代;(e)完整模型。NDCT为正常剂量参考,LDCT为低剂量输入。
表2:组件消融定量结果
表2:AAPM在I₀=1×10⁴下的组件消融定量结果。去除任何组件都会带来性能下降,说明各模块都有贡献。
图10:方差匹配系数实验
图10:AAPM在I₀=1×10⁴下方差匹配系数的分析。(a)重建性能。(b)分支噪声方差与观测噪声方差的实测和预测比值。
在图10(b)中可以清楚看到,没有方差匹配时,分支噪声方差与观测噪声方差的比值明显偏离预测值;做了方差匹配后,理论预测和实测值高度吻合,说明缩放策略有效。
表3:薄化比例消融
表3:AAPM在I₀=1×10⁴下薄化比例α的影响分析。
跨域迭代的效果也在图11中得到了直观验证。随着迭代轮数增加,正弦图平均绝对误差(MAE)逐步下降,正弦图和图像域的残差相关性降低,图像域的PSNR和SSIM同步提升。这说明前向投影的图像域反馈能有效降低先验误差,配对构造也越来越准。
图11:跨域迭代效果
图11:AAPM在I₀=1×10⁴下跨域迭代精化的效果。(a)归一化正弦图MAE。(b)-(c)正弦图和图像域中分支间残差平均绝对相关性。(d)不同迭代轮数下的重建PSNR和SSIM。
从整体框架设计回看,为什么它能work?有两点值得关注:其一,把"配对构造"放在噪声统计特性更本质的投影域去做,依据CT成像物理拆分噪声源,这在源头保证了两分支的独立性;其二,通过跨域迭代,图像域的学习结果又反过来约束投影域的先验,形成一个"哪儿不行就修正哪儿"的自闭环。最终效果就是:配对独立性强,训练稳定,去噪结果干净且细节保留好。

局限与展望:从二维到三维的拓展之路

先说局限,客观讲三点。
第一,低剂量CT噪声模型假设的局限。论文假设光子计数服从泊松分布、读出噪声服从高斯分布。真实CT系统中,噪声分布还可能涉及电子噪声的闪烁效应、探测器像素响应的不一致性、束硬化伪影等多种非理想因素。遇到更极端的低剂量条件或非标准采集几何时,简化模型的适配性还需要验证。论文中I₀最低只测到5×10³(0.5%剂量),更低的剂量水平(比如0.1%甚至0.05%)下的表现未知。
第二,实验数据大多是二维切片级模拟。AAPM和LIDC的原始投影数据拿不到,论文用ODL库(Operator Discretization Library,一个用于CT成像建模的开源Python库)把参考图像前向投影来模拟测量。真实CT的噪声统计和系统响应跟模拟有区别。GE心脏数据和小鼠数据样本量有限(心脏数据只有1例、小鼠数据评价了2个能窗),真实的泛化性还需要更大规模队列的验证。
第三,训练开销。论文做了5轮外层迭代,每轮包含10个正弦图训练轮次和20个图像域训练轮次,总共需要训练两个U-Net网络数十轮。虽然推理阶段只有一个正弦图网络和一个图像域网络串联,速度尚可,但训练阶段的计算开销比普通自监督方法贵了一截。
再说未来方向。从二维切片到三维体数据的顺滑延伸是被期待的方向;混合噪声模型进一步精细化(如加入探测器响应校正和电子噪声闪烁项);跨域迭代思想也可以迁移到低剂量PET、SPECT等其他医学成像模态。项目代码已在GitHub开源,后续社区可以在此基础上继续推进。论文本身在IEEE Transactions on Medical Imaging(TMI)发表,属于医学影像领域顶级期刊。总体来看,这篇文章的方法论价值和工程完成度都比较高。
R-C

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?低剂量CT投影中混合了泊松与高斯两类噪声,现有自监督去噪却很少显式建模这种物理噪声。
这篇工作最值得看的点是什么?在所有数据集和剂量水平下,所提方法在自监督方法中全面最优,且在18项指标中17项超过监督方法RED-CNN,仅AAPM 1.0%剂量SSIM略低。
这篇工作的边界或风险在哪里?优点:物理驱动的噪声建模与配对生成机制新颖,跨域迭代有效提升先验质量,理论分析完善,实验验证充分。缺点:依赖泊松-高斯噪声模型假设,实际CT采集中的散射和束硬化效应可能导致模型偏差;目前仅支持二维处理。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种物理驱动的跨域迭代自监督低剂量CT去噪框架,通过贝叶斯后验推断分离泊松-高斯混合噪声,利用二项式和高斯数据细化生成近似独立的训练对,并通过跨域迭代逐步优化先验与配对质量。

实验合理度:★★★★☆

PSNR、SSIM、RMSE

学术研究价值:★★★★☆

提出一种物理驱动的跨域迭代自监督低剂量CT去噪框架,通过贝叶斯后验推断分离泊松-高斯混合噪声,利用二项式和高斯数据细化生成近似独立的训练对,并通过跨域迭代逐步优化先验与配对质量;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告FLOPs,在NVIDIA RTX 5070 Ti GPU上训练,每次跨域迭代包含10个正弦图域和20个图像域epoch。

复现难度:★★★☆☆

https://github.com/yqx7150/PIPG-LDCT

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:依赖泊松-高斯噪声模型假设,实际CT采集中的散射和束硬化效应可能导致模型偏差;目前仅支持二维处理。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球