← 返回 PaperDaily 视觉与图像

ECR 2026新研究:扩散模型给CBCT做"翻译",FDK重建输入让合成CT质量飙升20dB

放疗中反复CT辐射剂量高,低剂量CBCT图像质量又不够用?这篇ECR 2026论文用条件扩散模型做CBCT到CT合成,还专门较真了“输入图像怎么表示”这件事——结果发现,看似更粗糙的FDK重建反而能让扩散模型发挥更大潜力,PSNR相对提升超过20dB,思路很值得借鉴。

ECR 2026新研究:扩散模型给CBCT做"翻译",FDK重建输入让合成CT质量飙升20dB
原论文信息如下:
论文标题:
Toward CT-Equivalent Image Quality in Low-Dose Radiotherapy Planning: Conditional Diffusion–Based CBCT-to-CT Synthesis and the Impact of CBCT Input Representation
发表日期:
2026年08月
发表单位:
英国邓迪大学、约旦科技大学、NHS九井威尔士医院、格拉斯哥大学
原文链接:
https://arxiv.org/pdf/2608.08919v1.pdf
会议信息:
ECR 2026,Poster Number: C-28213,DOI: 10.26044/ecr2026/C-28213
放疗计划中,反复CT扫描辐射剂量高,而低剂量锥形束CT(CBCT)图像质量又不够用。于是“用AI把CBCT翻译成CT”成了热门方向。这篇ECR 2026论文用条件扩散模型(conditional DDPM)做CBCT到CT合成,但真正有意思的是,它较真了一个大家普遍忽略的问题:喂给扩散模型的CBCT输入,到底应该用哪种表示?是临床常见的DICOM格式CBCT图像,还是从原始投影数据直接做FDK(滤波反投影)重建得到的图像?
实验结果挺有意思:DICOM CBCT因经过厂商各种后处理(平滑、散射校正、强度归一化),一开始看起来更接近CT;而FDK重建的CBCT噪声大、图像粗糙,和CT的相似度指标低得可怜。但经过扩散模型“妙手回春”之后,FDK条件输入的合成CT在PSNR上反而实现了高达20.1dB的相对提升,而DICOM条件输入只提升了11.8dB。换句话说,起点低不代表终点低,给扩散模型喂“物理上更真实”的输入,反而能激发它更强的去伪存真能力。

放疗中的CBCT困境:图像质量为何不够用?

标准的放疗流程,治疗前先做一次高质量CT扫描,医生基于此勾画靶区和危及器官,进行剂量计算。但患者位置会变化,为精准照射,需反复获取最新影像。若每次都做CT,累积辐射剂量可观。因此临床上常用治疗时顺手拍的低剂量CBCT做位置验证。CBCT剂量低、方便,但图像质量差——散射伪影、噪声、射束硬化、重建伪影轮番上阵,CT值不准确、软组织对比度差、空间分辨率低。正因如此,CBCT目前主要用于摆位验证,很少直接用于剂量计算。如果能让CBCT“升级”成CT级别图像质量,就能在低剂量下实现精准剂量计算和自适应放疗。
具体来说,CBCT图像质量不足主要体现在几个方面。首先是散射伪影,锥形束X射线在穿过人体时会产生大量散射线,这些散射线被探测器接收后,会在重建图像中表现为杯状伪影和条纹伪影,导致CT值(HU值)不准确,尤其在骨-软组织界面和空气-组织界面附近更为明显。其次是噪声问题,低剂量采集意味着每个投影角度下的光子数较少,量子噪声显著增加,使得图像颗粒感强,软组织对比度下降。再者是射束硬化效应,多色X射线谱在穿过高密度物质(如骨骼)时,低能光子被优先吸收,导致重建图像中高密度区域周围出现暗带或亮带伪影。最后,CBCT的扫描视野通常比诊断CT小,且重建算法(如FDK)本身在锥形束几何下存在近似误差,进一步降低了图像质量。这些因素共同导致CBCT图像无法直接用于剂量计算——因为剂量计算依赖于准确的电子密度信息,而电子密度是从CT值(HU值)映射而来的,CBCT的HU值不准确会直接导致剂量计算误差。
近年来,基于深度学习的CBCT-to-CT合成方法成为研究热点。这类方法通过学习CBCT与CT之间的映射关系,将低质量CBCT图像转换为高质量的合成CT(synthetic CT, sCT),从而在保持低辐射剂量的同时获得可用于剂量计算的图像。早期的研究多采用生成对抗网络(GAN)或其变体,如pix2pix、CycleGAN等,这些方法在视觉上取得了不错的效果,但在定量指标和结构保真度上仍有提升空间。扩散模型作为新一代生成模型,在图像生成领域展现出卓越的性能,其逐步去噪的过程天然适合图像到图像的翻译任务,因此被引入到CBCT-to-CT合成中。然而,大多数现有研究都默认使用临床DICOM格式的CBCT图像作为模型输入,很少关注输入表示本身对模型性能的影响。这篇论文正是从这个被忽视的角度切入,系统研究了不同CBCT输入表示对条件扩散模型合成效果的影响。

方法概述:扩散模型如何实现CBCT到CT的"翻译"?

论文采用条件去噪扩散概率模型(conditional DDPM)。DDPM包含前向和反向过程:前向过程对真实CT逐步加高斯噪声直至纯噪声;反向过程学习如何从纯噪声出发,在CBCT图像“引导”下逐步去噪,还原出接近真实CT的合成图像。CBCT引导信号就像地图,指引去噪方向。
图1:论文提出的CBCT到CT合成放疗工作流程。治疗过程中采集的低剂量CBCT通过深度学习(U-Net/扩散模型)转换为高质量合成CT,实现精确定位和剂量计算,同时减少重复计划CT扫描带来的辐射暴露。
图1展示了整体工作流程:低剂量CBCT经深度学习模型转换成高质量合成CT,实现精确定位和剂量计算,同时减少辐射暴露。这个流程的核心在于,通过AI模型弥补CBCT与CT之间的图像质量差距,使得原本仅用于定位的CBCT图像也能承担剂量计算的任务,从而推动自适应放疗的临床落地。
图2:用于CBCT到CT图像合成的条件扩散概率模型(DDPM)。训练时,模型采用扩散框架,前向过程对输入CT图像加噪,反向过程在CBCT引导下生成sCT图像。测试时仅使用反向过程,以随机噪声和CBCT引导作为输入,无需CT图像。
图2展示了条件DDPM的训练和测试流程。训练时,真实CT被逐步加噪,模型学习在CBCT引导下反向去噪;测试时,只需输入随机噪声和CBCT引导,模型即可生成合成CT。这种设计的关键在于,模型在训练阶段学习了从噪声到CT的映射,而CBCT作为条件输入,为这个映射提供了解剖结构的先验信息,使得生成过程更加稳定和可控。
模型骨架是带多尺度自注意力模块的U-Net,损失结合MSE和SSIM,训练1500个epoch。数据来自NHS九井威尔士医院,使用固体拟人头颈模体进行CT和CBCT匹配采集,十次重复扫描共获得920对对齐的CT-CBCT切片对,80%用于训练(736对),20%用于独立测试(184对)。所有CT图像归一化到固定HU窗口(-1000到2000)并缩放到256×256像素。
在扩散模型的实现细节上,论文采用了标准的DDPM框架,前向过程使用线性噪声调度,从初始噪声水平逐步增加到最大噪声水平,共设置1000个时间步。反向过程则通过U-Net网络预测每个时间步的噪声,从而逐步去除噪声。U-Net网络包含多个下采样和上采样层,并在中间层引入多尺度自注意力模块,以捕捉图像中的长距离依赖关系。损失函数为MSE和SSIM的加权组合,其中MSE确保像素级数值准确性,SSIM保留结构信息,两者共同作用使得生成的sCT既准确又自然。

核心设计:DICOM vs FDK——哪种CBCT输入更优?

论文最核心的实验设计,是比较两种CBCT输入表示对扩散模型合成效果的影响。两组实验使用完全相同的架构、优化策略和数据划分,唯一区别是条件输入不同:一组使用标准临床DICOM格式CBCT图像,另一组使用从原始投影数据用FDK算法重建的CBCT图像。
临床DICOM格式CBCT是厂商重建管线的最终输出,为获得好看视觉效果加入大量后处理(平滑滤波、散射校正、强度归一化等),让图像更干净,但代价是像素强度与原始投影数据之间的物理对应关系被削弱甚至扭曲。而FDK(Feldkamp-Davis-Kress)算法是锥形束CT最经典的分析重建方法,直接从原始投影数据出发,几乎不做额外后处理。重建出的CBCT虽然噪声大、更“粗糙”,但每个体素强度值真实反映了X射线穿过物体后的衰减信息——投影数据、采集几何和重建体素强度之间的物理关系被完整保留。

为什么输入表示会影响扩散模型?

论文提出一个反直觉假设:扩散模型是迭代去噪过程,对输入条件的统计特性和物理特性非常敏感。如果条件输入经过大量后处理,丢失了与物理采集过程的一致性,模型在去噪时就缺乏可靠的“物理罗盘”来校正重建伪影。相反,如果条件输入保留了物理一致性,哪怕它本身噪声很大,模型反而能学会从这些物理真实的信号中提取有用信息,同时抑制噪声和伪影。为验证假设,论文设计了严格的对照实验:同一架构、同一数据划分、同样优化策略,唯一变量是CBCT输入表示。这种“控制变量”设计让结论更有说服力。
进一步分析,DICOM CBCT的后处理流程虽然提升了图像的视觉质量,但也引入了非线性变换,这些变换可能破坏了图像强度与物质衰减系数之间的线性关系。而扩散模型在训练时学习的是从噪声到CT的映射,这个映射依赖于输入条件提供的梯度信息。如果输入条件的梯度信息被后处理扭曲,模型就难以准确判断当前去噪步骤中需要校正的方向和幅度。相比之下,FDK重建的图像虽然噪声大,但其强度值与物理衰减系数的关系是线性的、一致的,这为扩散模型提供了更可靠的梯度信号,使得模型能够更有效地去除噪声和伪影,恢复真实的解剖结构。

数据准备及实验设计

实验数据来自NHS九井威尔士医院,使用固体拟人头颈模体进行扫描。模体可提供完美CT-CBCT配对(无患者移动造成的配准误差),且可重复扫描增加数据量。十次重复扫描共获得920对对齐的CT-CBCT切片对,按80/20比例划分为训练集(736对)和独立测试集(184对),确保训练和测试无重叠。
预处理方面,所有CT图像归一化到固定HU窗口(-1000到2000 HU)并缩放到256×256像素,覆盖空气到致密骨的CT值范围。CBCT图像不进行额外归一化,以保持原始数值特性——这也是为了考察不同输入表示对模型的影响。
模型方面,使用带多尺度自注意力模块的U-Net作为扩散模型主干,训练1500个epoch,损失函数结合MSE和SSIM。MSE约束像素级数值准确性,SSIM帮助保留结构信息。两组实验使用完全相同配置和训练策略,仅条件输入不同。
评价指标使用四个常用图像质量指标:SSIM(结构相似性)、PSNR(峰值信噪比)、MSE(均方误差)和MAE(平均绝对误差)。SSIM衡量结构保真度,PSNR衡量像素级误差,MSE和MAE则从不同角度反映数值偏差。这些指标共同构成了对合成CT图像质量的全面评估。
在数据采集过程中,CT和CBCT扫描均采用临床标准协议。CT扫描使用诊断级螺旋CT,层厚1mm,管电压120kVp,管电流根据模体大小自动调节。CBCT扫描使用放疗科常用的机载锥形束CT系统,管电压100kVp,管电流20mA,扫描角度360度,共采集约600个投影。CT和CBCT扫描在相同几何位置进行,确保图像配准的准确性。由于使用固体模体,不存在患者运动问题,CT和CBCT图像可以通过刚性配准实现像素级对齐。

实验结果:FDK条件输入带来更大提升

两组实验都训练了1500个epoch,平均损失非常接近——DICOM条件输入为0.006981,FDK条件输入为0.006639,说明两个模型都正常收敛,没有出现训练崩塌。这个前提很重要,确保后续对比不是“没训练好”造成的假象。
先看基准水平(未经扩散模型处理的原CBCT与真实CT的相似度)。DICOM CBCT的SSIM约为0.83,PSNR约25.9dB,看起来确实和CT挺接近;而FDK CBCT的SSIM只有约0.26,PSNR约14.6dB,惨不忍睹。这完全符合预期——DICOM经过厂商后处理,表面“相似度”被拉高;FDK保留了噪声和伪影,裸奔状态下自然难看。
但经过扩散模型合成之后,情况发生反转。在训练集上,DICOM条件输入的合成CT达到SSIM≈0.93、PSNR≈36.0dB;FDK条件输入的合成CT虽然SSIM略低(≈0.85),但PSNR反而更高(37.4dB),且MSE和MAE都更低。论文给出的解释是:FDK虽然初始状态和CT差得远,但扩散模型对它的“修复”幅度更大——相对提升达到+0.5853 SSIM和+22.8dB PSNR,而DICOM条件输入只提升了+0.0987 SSIM和+10.11dB PSNR。
图3:DDPM训练(表A)和测试(表B)的定量性能对比。当使用FDK重建的原始CBCT数据作为引导时,可获得更高的SSIM和PSNR中位数。
图3是训练和测试阶段完整定量对比。表A是训练集(736张切片)结果,表B是独立测试集(184张切片)结果。测试集结论与训练集一致。
表:论文实验数据与训练结果汇总(原论文表格截图)。该表展示了训练阶段两种CBCT输入条件下的损失、SSIM、PSNR、MSE、MAE等指标的详细对比。
上图是论文配套的详细数据表,可以看到DICOM条件和FDK条件在各项指标上的具体数值,包括训练损失、CT与合成CT的相似度、CBCT与CT的基线相似度,以及各项指标从CBCT到合成CT的提升幅度。从提升幅度看,FDK条件输入在SSIM上的提升达到+0.5853,是DICOM条件输入的近6倍。
独立测试集上的结果更值得关注。测试集是模型训练时从未见过的184对CT-CBCT切片,能真实反映泛化能力。在测试集上,DICOM条件输入的合成CT达到SSIM=0.9465±0.0659、PSNR=37.35±7.14dB,而FDK条件输入的合成CT为SSIM=0.8168±0.1653、PSNR=34.49±6.51dB。从绝对指标看DICOM条件输入似乎更好,但这要考虑到原始的DICOM CBCT基线本身就和CT更接近——就像两个学生考试,一个平时80分,一个平时20分,最后都考到90分,哪个进步大?显然是后者。
所以论文重点看的不是绝对指标,而是“相对提升”。在测试集上,FDK条件输入的合成CT相对其CBCT基线,SSIM提升了+0.554,PSNR提升了+20.08dB;而DICOM条件输入只提升了+0.116 SSIM和+11.78dB PSNR。换句话说,FDK条件输入让扩散模型的“去伪存真”能力发挥得更充分,虽然最终绝对SSIM没有超过DICOM,但相对于起点来说,提升幅度远远更大。
图4:CBCT输入、真实CT、合成CT以及误差差异图的视觉对比。左侧(A)为使用CBCT DICOM图像引导的DDPM结果,右侧(B)为使用原始CBCT数据FDK重建引导的结果。FDK条件输出(B)显示出更好的结构一致性。
图4给出两种条件输入的可视化对比。从视觉上看,FDK条件输入的合成CT在骨-空气界面的结构一致性上更好,条纹伪影和杯状伪影明显更少。差异图也显示FDK条件输入的残差更小。这说明虽然FDK的绝对SSIM略低,但它在解剖结构的关键细节上反而更接近真实CT。
图5:训练期间相对于基线CBCT的ΔSSIM。该图显示了合成CT相对于原始CBCT的结构相似性提升。以原始数据FDK重建为条件时,ΔSSIM持续高于CBCT DICOM输入,表明生成的CT具有更好的结构保真度。
图5展示训练过程中ΔSSIM的变化曲线。FDK条件输入的ΔSSIM(相对提升)在整个训练过程中持续高于DICOM条件输入,且差距在训练后期越拉越大——这说明FDK提供的物理引导信息让模型在长时间训练中持续受益。
图6:训练期间相对于基线CBCT的ΔPSNR。该图显示了合成CT相对于原始CBCT的峰值信噪比提升。以原始投影数据FDK重建为条件时,ΔPSNR始终高于CBCT DICOM输入,表明噪声降低和保真度提升。
图6的ΔPSNR曲线更直观,FDK条件输入的优势几乎是压倒性的。PSNR(峰值信噪比)是衡量图像重建质量的经典指标,数值越高代表噪声和失真越小。两条曲线中间隔着巨大差距,说明CBCT输入表示对扩散模型性能的影响不是微小的,而是决定性的。
这个结果确实让人觉得“不错不错”——它用实验数据回答了一个很多人没想过的问题:AI模型吃进去的数据是什么表示,直接影响AI能发挥多少实力。
进一步分析测试集上的误差分布可以发现,FDK条件输入的合成CT在骨组织区域和空气区域的表现尤为突出。在骨-空气界面附近,FDK条件输入的合成CT的HU值误差明显小于DICOM条件输入,这表明FDK提供的物理一致性信息帮助模型更准确地恢复了高对比度边界的CT值。而在软组织区域,两种输入的合成CT表现相近,这可能是因为软组织区域的CT值变化相对平缓,后处理对物理关系的扭曲影响较小。这一发现提示我们,输入表示的选择可能对不同类型的组织区域有不同的影响,值得在未来的研究中进一步细化分析。

对放疗计划与临床实践的意义

这篇论文的意义不仅在于“又刷了个指标”,而是给放疗AI提了个醒:你输入给模型的图像表示,本身就是一种先验知识。DICOM图像携带的是“厂商希望医生看到的”,FDK图像携带的是“物理世界真实发生的”。对于扩散模型这种需要通过迭代去噪来还原真实结构的生成模型来说,后者可能比前者更有价值。
对放疗计划来说,这个发现意味着:如果把CBCT到CT的合成模块嵌入到自适应放疗流程中,采用FDK重建的原始数据作为模型输入,理论上可以在更低剂量下获得更可靠的剂量计算结果。论文也指出了未来方向——在真实患者数据上进行验证,评估多台扫描设备之间的泛化性能,以及对自适应放疗中剂量学的影响。
当然,必须客观地说,这项研究离临床落地还有距离。数据用的是固体拟人头颈模体,不是真实患者——模体的优势是CT-CBCT完美配准,但真实患者的器官运动、组织不均匀性、不同体型的差异,都会给模型带来额外挑战。另外,临床场景中的原始CBCT投影数据并不总是能导出,这也会限制FDK方案的落地可行性。
从剂量计算的角度来看,CBCT-to-CT合成的最终目标是生成可用于剂量计算的sCT图像。论文虽然没有直接进行剂量学评估,但通过图像质量指标间接反映了sCT的潜在剂量计算精度。PSNR和SSIM的提升通常意味着CT值更准确、结构更清晰,这为后续的剂量计算提供了更好的基础。然而,图像质量指标与剂量计算误差之间的直接关系尚未建立,这需要未来的研究通过剂量学评估来验证。此外,不同放疗技术(如IMRT、VMAT、质子治疗)对CT值误差的敏感度不同,sCT图像质量对剂量计算的影响也可能因技术而异,这些都是未来研究的重要方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?邓迪大学等机构在ECR 2026提出条件扩散模型实现CBCT到CT合成。对比DICOM与FDK重建两种输入表示,发现FDK重建虽基线噪声大,但为扩散模型提供更物理一致的引导,相对提升达20.1dB PSNR。
这篇工作最值得看的点是什么?FDK条件输入的合成CT在测试集上达到SSIM=0.817±0.165、PSNR=34.49±6.51dB,相对原始CBCT提升+0.55 SSIM和+20.1dB PSNR;DICOM条件输入达到SSIM=0.947±0.066、PSNR=37.35±7.14dB,相对原始CBCT提升+0.12 SSIM和+11.8dB PSNR。FDK条件输入在相对提升幅度上显著优于DICOM输入。
这篇工作的边界或风险在哪里?优点:(1) 首次系统研究CBCT输入表示(DICOM vs FDK重建)对扩散模型CBCT-to-CT合成性能的影响,研究问题明确且有临床意义;(2) 实验设计严谨,使用相同架构、相同数据集、仅改变条件输入,有效隔离了输入表示的影响;(3) 发现FDK重建CBCT虽然基线质量差但能提供更物理一致的引导信号,这一发现对放疗计划中的CBCT-to-CT合成具有重要指导意义。缺点:(1) 仅使用模体数据验证,缺乏真实患者数据的验证;(2) FDK条件输入的绝对SSIM值(0.817)低于DICOM条件输入(0.947),虽然相对提升更大,但绝对质量仍偏低;(3) 未进行剂量计算验证,缺乏对放疗计划影响的直接评估;
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种基于条件去噪扩散概率模型(DDPM)的CBCT到CT合成框架,系统比较DICOM CBCT与FDK重建CBCT作为条件输入对合成CT质量的影响,发现FDK重建输入能提供更物理一致的引导信号,从而获得更大的图像质量提升。

实验合理度:★★★★☆

SSIM(结构相似性)、PSNR(峰值信噪比)、MSE(均方误差)、MAE(平均绝对误差)

学术研究价值:★★★★☆

提出一种基于条件去噪扩散概率模型(DDPM)的CBCT到CT合成框架,系统比较DICOM CBCT与FDK重建CBCT作为条件输入对合成CT质量的影响,发现FDK重建输入能提供更物理一致的引导信号,从。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告具体FLOPs,训练1500个epoch,使用MSE和SSIM联合损失函数。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:明确且有临床意义;(2) 实验设计严谨,使用相同架构、相同数据集、仅改变条件输入,有效隔离了输入表示的影响;

主要参考文献

[1] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models. NeurIPS 2020.
[2] Buzug T M. Computed tomography: from photon statistics to modern cone-beam CT. Springer, 2008.
[3] Spadea M F, Maspero M, Zafino P, et al. Deep learning based synthetic-CT generation in radiotherapy and PET: a review. Medical Physics, 2021.
[4] Altalib A, Li C, Perelli A. Conditional diffusion models for CT image synthesis from CBCT: A systematic review. Tomography, 2026.
[5] Kurz C, Kamp F, Park Y K, et al. Investigating deformable image registration and scatter correction for CBCT-based dose calculation in adaptive IMPT. Medical Physics, 2016.
[6] Altalib A, McGregor S, Li C, et al. Synthetic CT image generation from CBCT: a systematic review. IEEE Transactions on Radiation and Plasma Medical Sciences, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
放疗计划想精准,CBCT合成CT是关键一环;输入表示怎么选,FDK重建有惊喜!扩散模型来助力,低剂量也能高精度。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 医学影像+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。与更多同行一起探讨医学影像与AI的交叉前沿!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。