← 返回 PaperDaily 视觉与图像

PCI评估AI落地前,先搞懂这1分能改变什么

这可能是影像AI圈最该细品的一类研究:不看Dice涨了多少,而是问Dice涨了之后,医生做决策到底变没变。荷兰团队用10例增强CT、4位专家、1个nnU-Net模型,外加一套概率模拟,把分割边界差异直接翻译成临床评分差异。结论相当反直觉——几何差异不小,但rPCI总分平均波动不到1分,决策翻转全挤在PCI 20这个生死线附近。不卷精度的论文,反而把精度指标的

PCI评估AI落地前,先搞懂这1分能改变什么
原论文信息如下:
论文标题:
Evaluating the Effects of Inter-Observer and Model Variability on Radiological Peritoneal Cancer Index Assessment
发表日期:
2026年08月

发表单位:
荷兰埃因霍温理工大学(Eindhoven University of Technology)电子工程系,荷兰埃因霍温Catharina医院

原文链接:
https://arxiv.org/pdf/2608.28716v1.pdf


引言:Dice涨了0.02,临床就更好吗?

医学影像分割这十年,被Dice支配的日子实在太久了。
翻翻论文,几乎每篇都在喊“我们Dice提高了0.03”“HD95降了2毫米”。但有没有人认真问一句:Dice涨了,医生的决策变了吗?病人活得更久了吗?治疗方案选得更准了吗?
这是个灵魂拷问,但很少有研究正面回答。大部分工作默认一个假设:几何指标越漂亮,临床价值就越高。这个假设真的成立吗?荷兰埃因霍温理工大学和Catharina医院的研究团队,用一篇新论文给出了一个不完全一样的答案。
他们选择的研究对象是腹膜转移癌(Peritoneal Metastases,PM)的影像评估。这类癌症的病情评估高度依赖一个叫 PCI(Peritoneal Cancer Index,腹膜癌指数)的评分系统。简单说,医生把腹腔分成13个区域,每个区域按最大病灶的大小打0到3分,总分0到39分。分数越高,病情越重。
图1:腹膜癌指数(PCI):解剖分区与病灶大小评分。
腹膜癌指数(PCI):解剖分区与病灶大小评分。
分割指标与临床决策的鸿沟:rPCI评估的新视角
Dice这个指标,医学影像分割领域的人再熟悉不过。只要做过分割任务,几乎绕不开它。它能量化两个掩膜之间的空间重合程度,确实方便,但也悄悄塑造了一种思维惯性:好像Dice越高,模型的临床价值就越大,分割越准,诊断就越可靠。
事实真是这样吗?荷兰埃因霍温理工大学和Catharina医院的研究团队,用一篇聚焦放射学腹膜癌指数(radiological Peritoneal Cancer Index,简称rPCI)评估的论文,正面挑战了这个假设。
rPCI是从增强CT影像上评估腹膜癌负荷的一套评分体系。它把腹腔划分成13个解剖区域,每个区域根据最大病灶的大小给0到3分,加起来总分0到39分。分数越高,意味着肿瘤播散越广泛。这套评分不是躺在论文里的理论模型,而是直接连着治疗决策的。对结直肠来源的腹膜转移癌,临床上通常把PCI 20作为肿瘤细胞减灭术(CRS)联合腹腔热灌注化疗(HIPEC)的参考分界线。
这意味着什么?意味着19分和20分虽然只差1分,治疗方案可能完全不同。那么,一个核心问题就浮出水面了:分割算法在边界上偏了几毫米,Dice掉个0.05,在几何指标上看着挺扎眼,但它真的会改变rPCI总分、甚至改变患者的治疗分类吗?传统评估体系从来不回答这个问题。本文做的,就是把这条“几何指标”到“临床决策”的鸿沟,量化给你看。
这项研究顺带也回应了rPCI本身的可靠性疑问。rPCI依赖放射科医生在CT上手动划定13个区域,但小肠蠕动、腹腔脂肪少、病灶低对比等现实因素,让边界划分并不轻松。观察者之间到底能达成多大一致?这个基准线不摸清楚,拿AI分割模型去跟谁比都不公平。

四位专家与AI模型:谁更接近临床真相?

整项研究的实验设计相当紧凑。数据来自荷兰Catharina医院的10例腹部增强CT,分为A、B两个队列,各有5例。4位临床研究者参与标注,其中两位同时标注了两个队列,另外两位各标注一个队列,最终保证每一例扫描都有3份独立标注。与此同时,研究者直接调用了Gort等人此前训练好的nnU-Net模型,对同样的CT做推理,不做任何微调。人类专家和AI模型,就在这10例数据上正面交锋。
这里先解释一下评价指标。Dice衡量的是两个分割区域在三维空间上的重叠比例,越接近1越一致;HD95,也就是95%豪斯多夫距离,刻画的是最差边界偏差,可以理解为“95%的边界都控制在多少毫米以内”;ASD(Average Surface Distance,平均表面距离)反映的是边界平均偏离多少毫米。三者结合,既看整体重合度,也看底线失误和平均偏移。
为了减少个体偏差,研究对每个体素做多数投票:至少两位标注者认同的区域标签,才作为参考标准。这里留了一个细节值得注意——人类专家参与了参考标准的构建,而模型没有,所以模型实际是站在一个略微不利的位置上接受考核。
先看人类之间的差异。13个区域的总体Dice达到0.87±0.04,HD95为8.8±3.0mm,ASD为2.4±1.1mm。这个一致性水平可以说相当高,说明基于2025年Delphi共识定义的rPCI区域,在经验丰富的标注者之间具备可重复性。但一致性并不均匀:小肠相关区域(区域9到12)的HD95从区域0到8的7.5±2.7mm上升到11.6±1.4mm,ASD从1.7±0.6mm上升到3.8±0.6mm。图3的热图直观呈现了这种分布——上腹部区域轮廓几乎重合,而小肠区域的分歧明显增多。
(a)轴位视图。
(a)轴位视图。
(b)冠状位视图。
(b)冠状位视图。
(c)矢状位视图。图3:观察者间一致性热图与轮廓叠加。
(c)矢状位视图。图3:观察者间一致性热图与轮廓叠加。
再看模型与人类的对比。模型和观察者之间的平均Dice为0.82±0.06,HD95为20.8±17.0mm,ASD为4.4±2.4mm,整体上比人类间差异大。分区域拆解更有意思:在区域0到8,模型与人类的一致性(Dice 0.84±0.06)还比较接近人类自身水平;但在区域9到12,Dice掉到0.77±0.04,HD95飙到31.9±22.4mm,ASD也翻到6.9±2.3mm。
表1列出了全部13个区域的详细数值。区域4、8、11、12是模型表现最薄弱的环节。区域8的HD95中位数差异令人印象深刻:人类之间是10.6±6.1mm,模型与人类之间是42.6±36.6mm;区域12更夸张,人类之间13.4±3.3mm,模型与人类之间65.0±42.6mm。但注意,ASD的差距并没有同比例放大——区域12的人类ASD是4.7±1.6mm,模型是10.2±4.0mm。这个组合说明,模型的错误不是均匀地“糊”在边界上,而是偶发地出现一些远离真实边界的孤立错误区,这类离群误差会剧烈推高HD95,但对整体重叠度、对后续评分的影响却有限。
表1:区域级观察者间(H)与模型-观察者间(M)一致性对比(均值±标准差);HD95/ASD单位为毫米;Δ=M-H。
表1:区域级观察者间(H)与模型-观察者间(M)一致性对比(均值±标准差);HD95/ASD单位为毫米;Δ=M-H。
图4的CT叠加图把这个特征画得明明白白:模型预测和多数投票参考的偏差,大多数集中在局部边界和区域交界处,整体结构依然完整。换句话说,模型在小肠区域的表现确实比不上人类,但问题集中在“边界判断”上,不是“区域识别”层面。用一句通俗的话说:模型知道该往哪片区域找,但划分界线时容易手抖。
图4:CT叠加图对比多数投票参考分割、模型预测及分割误差的轴位、冠状位和矢状位视图。
图4:CT叠加图对比多数投票参考分割、模型预测及分割误差的轴位、冠状位和矢状位视图。

从几何差异到临床影响:概率模拟框架解析

几何差异摸清了,接下来是关键一跃:这些边界上的分分合合,到底会不会改变rPCI总分,会不会把患者推到治疗阈值的另一侧?
直接做临床验证当然最理想,但现实中每个病例只有“一次”手术探查的机会,无法系统覆盖所有可能的病灶分布场景;而且把rPCI和术中真实PCI硬对表,会混入病灶漏检、CT可见性不足等大量干扰因素。本文的思路是用概率模拟来生成大量标准化病灶分布,把问题聚焦到“仅因区域边界划分不一致,会对PCI评分和20分阈值分类产生多大冲击”这个单一维度。
模拟流程大体分四步。
第一步,用均值15的泊松分布抽取每个模拟病例的病灶数量,并裁剪到1到50之间,代表中等偏重的肿瘤负荷。第二步,用Dirichlet加权分布,按文献报道的腹膜转移分布模式为每个病灶分配一个rPCI区域;在该区域的标签图里随机采样一个体素作为病灶位置。第三步,为每个病灶均匀分配一个LS0到LS3的大小等级。第四步,计算每个区域的最大病灶等级并求和,得到参考rPCI;然后分别用每个观察者和模型的区域标签重新计算预测rPCI。如此反复模拟,就能在统计上衡量边界分歧对总分和阈值分类的净影响。
(a)轴位视图。
(a)轴位视图。
(b)冠状位视图。
(b)冠状位视图。
(c)矢状位视图。图2:模拟腹膜转移灶示例。彩色叠加区域代表CT扫描中不同PCI病变大小等级(LS1–LS3)的结节。
(c)矢状位视图。图2:模拟腹膜转移灶示例。彩色叠加区域代表CT扫描中不同PCI病变大小等级(LS1–LS3)的结节。
图2展示的是一个模拟实例:彩色叠加标记了不同LS等级的模拟腹膜转移结节在CT断层中的位置。可以看到,模拟病灶覆盖了腹膜的典型播散区域,形态上贴近真实的转移分布。

边界案例:PCI 20阈值下的决策风险

模拟的结果,可以用一句话概括:平均来看,边界分歧对rPCI总分的影响很小,但临床决策的风险全部集中在PCI 20阈值附近。
先看整体数字。区域级准确率方面,人类观察者在两个队列中达到0.87到0.92,模型为0.83到0.85。更关键的是,平均ΔrPCI在所有情况下都小于1分:人类约为0.32到0.49,模型约为0.34到0.59。这说明,单纯由区域边界划分引起的评分波动,通常只有零点几分,几乎不会把患者从低风险推到高风险,或者反过来。从平均意义上讲,rPCI评估对分割边界差异是稳健的。
但临床决策不是看平均,而是看每一个具体患者落在分界线的哪一侧。表2给出了两组队列在PCI 20阈值下的灵敏度和特异性。人类观察者的灵敏度在0.89到0.98之间,特异性0.94到0.96;模型略低,灵敏度0.87到0.92,特异性0.92到0.93。整体表现都不错,但隐患藏在图5的分类散点图里。
表2:(a)队列A的模拟临床变异性总结:区域级准确率、rPCI差异(均值±标准差)及PCI 20阈值下的分类性能。
表2:(a)队列A的模拟临床变异性总结:区域级准确率、rPCI差异(均值±标准差)及PCI 20阈值下的分类性能。
表2:(b)队列B的模拟临床变异性总结。
表2:(b)队列B的模拟临床变异性总结。
图5:队列A和B在PCI 20阈值下的预测与参考rPCI对比,分类为真阴性(TN)、真阳性(TP)、假阳性(FP)和假阴性(FN)。
图5:队列A和B在PCI 20阈值下的预测与参考rPCI对比,分类为真阴性(TN)、真阳性(TP)、假阳性(FP)和假阴性(FN)。
图5把每个模拟病例的参考rPCI和预测rPCI画成散点,用四种颜色标出分类结果。一眼就能看出,几乎所有的假阳性和假阴性都堆积在20分这条横线两侧。原因不复杂:PCI总分只差1分,在阈值附近就足以改变治疗建议。换句话说,真正处于“临界地带”的患者——参考分在17到23分之间——是最容易因为分割边界的随机扰动而被误判治疗资格的群体。而对基线分很低或很高的患者来说,边界分歧基本不会改变他们的分类。
还有一个值得玩味的模式:模型的假阴性比例明显高于假阳性,也就是说,模型倾向于把边界附近偏高的病例预测到20以下。表2的指标也印证了这一点——模型的特异性不低(0.92到0.93),但灵敏度相对更低(0.87到0.92)。这说明模型在临界病例上存在一种保守偏置:与其说它漏掉了病灶,不如说它在边界地带的区域划分上,更容易把高风险病例“压”在20分之下。对于治疗筛选场景,这种偏置需要格外警惕,因为它可能让本该接受根治性手术的患者被低估了病情。

迈向临床落地:rPCI评估的机遇与挑战

这篇论文最大的价值,不在于提出了一个更准的分割模型,而在于提供了一个“决策级”评估框架。它用一套可复现的方法,把几何指标的变化翻译成临床上看得懂的PCI评分变化与阈值分类变化。对医学影像AI领域来说,这种框架比“再涨0.01个Dice”有价值得多——它直接告诉研究者:你的模型在几何上做到什么程度,临床决策就不再有明显差异;而差异真正积累的地方,又在哪里。
研究结论还给落地场景提供了几个务实信号。第一,rPCI区域分割的观察者一致性已经相当高,平均Dice接近0.87,说明基于CT的rPCI评估具备实操基础。第二,当前模型的边界错误主要集中在小肠区域和部分非共识区域,这相当于给模型优化指了一条明确的“补短板”方向。第三,靠近PCI 20阈值的病例必须由经验丰富的放射科医生复核,AI辅助系统在这里不能“全自动”,而应该服务于“先分割、再核查”的流程——比如把区域分割当作结构化的阅片清单,减少漏区和认知负担。
当然,局限也摆在明面上。整个研究只有10例增强CT,且来自单一中心,这个样本量决定了它无法回答“rPCI在人群层面到底准不准”的问题。多数投票参考标准由三位人类标注者构成,每位观察者都和包含自己贡献的共识做比较,观察者间一致性可能被轻微抬高;模型没有参与投票,相对吃亏。模拟部分也做了简化:病灶大小均匀采样,而临床上小病灶更常见;病灶落点用单个体素代表,而真实病灶可能横跨多个区域;这些都会让模拟结果偏向乐观。
因此,论文把当前的估计称为“区域分割变异带来的rPCI不确定性的下界”,这是一个严谨而诚实的表述。真实的影像-手术PCI差异,还要叠加病灶漏检、CT对比度不足、消化道蠕动等因素,远不止边界划分这一个变量。未来要真正把rPCI推进临床,需要在更大规模的多中心队列中,和术中PCI做前瞻性对照,同时引入病灶检测模型,把“区域分割”和“病灶检测”两条腿都补齐。
总的来说,这篇论文做到了“不卷精度、卷指标”。它像是在提醒整个行业:别再只盯着Dice的小数点后两位了。从Dice到临床决策之间的距离,不是一条直线,中间还隔着一道需要认真度量的鸿沟。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?分割指标涨了,临床决策就变好了吗?本文首次量化放射学腹膜癌指数(rPCI)区域分割中观察者间变异,并对比nnU-Net模型与人类表现,用概率模拟将边界差异传播为rPCI分数差异。
这篇工作最值得看的点是什么?模型在大多数区域匹配人类性能,但在区域4、8和小肠区域(9-12)偏差较大;模拟显示评分差异通常较小(平均ΔrPCI≈0.3-0.6),决策翻转主要发生在参考评分接近20时
这篇工作的边界或风险在哪里?优点:创新性地将几何分割指标与临床决策关联,提供决策级评估框架;模拟方法可复现且系统化。缺点:样本量小(10例);模拟假设简化(如单点病灶定位、均匀病灶大小采样);未考虑漏检病灶和采集因素;多数投票参考可能高估观察者一致性
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

不卷网络结构,把“指标到决策的鸿沟”做成可量化评估框架,角度新颖且填补了空档。

实验合理度:★★★★☆

四位标注者、双队列、多数投票参考和Wilcoxon检验都体现设计用心,但样本量偏小且模拟依赖简化假设。

学术研究价值:★★★★☆

为医学图像分割评估补上了决策层视角,后续做分割评估论文都可以参考这个“几何指标+决策模拟”的组合。

稳定性:★★★☆☆

结论方向在区域和队列间保持一致,但受限于小样本和单中心数据,具体数值的稳定性需要更大规模验证。

适应性以及泛化能力:★★★☆☆

评估框架本身可以迁移到其他有明确临床阈值的分割任务,但具体数值结论依赖rPCI定义和所用模型。

硬件需求及成本:★★★★☆

只用现成nnU-Net推理加CPU级模拟实验,成本很低,普通医疗终端也能跑。

复现难度:★★★★☆

流程透明,依赖的模型已发表,但代码和标注数据未明确开源,需要一定工作量自行实现。

产品化成熟度:★★★☆☆

作为rPCI临床决策鲁棒性的验证报告有参考价值,但要作为独立产品落地,还需多中心数据、病灶级检测和手术金标准对照。

可能的问题:样本量仅10例且单中心;多数投票参考让观察者占优、模型处于劣势;模拟用固定区域概率和单点病灶,对真实病灶跨区域、小病灶聚集等情形覆盖不足,因此结论是变异性下界,不能直接推广为完整临床误差。


主要参考文献

[1] Jacquet P, Sugarbaker P H. Clinical research methodologies in diagnosis and staging of patients with peritoneal carcinomatosis. Cancer Treatment and Research, 1996, 82: 359-374.
[2] Tops-Welten M W, Ewals L J S, van Hellemond I E G, et al. Defining region boundaries to assess the peritoneal cancer index on imaging: a Delphi study. European Radiology, 2025.
[3] Gort P C, Ewals L J S, Tops-Welten M W, et al. Deep learning-based segmentation of peritoneal cancer index regions from CT imaging. CARS 2026.
[4] Isensee F, Petersen J, Klein A, et al. nnU-Net: Self-adapting framework for U-Net-based medical image segmentation. Informatik aktuell, 2018.

end
PCI分区记不清?20分阈值拿不准?AI分割到底能不能进临床工作流?这些问题,龙哥读论文AI医疗群都在聊。加入我们,跟一线影像科医生和算法工程师面对面碰撞边界案例,把论文里的讨论变成真问题。欢迎扫码加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 影像AI+上海+瑞金医院+老周),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。