论文标题:
Evaluating the Effects of Inter-Observer and Model Variability on Radiological Peritoneal Cancer Index Assessment
发表日期:
2026年08月
发表单位:
荷兰埃因霍温理工大学(Eindhoven University of Technology)电子工程系,荷兰埃因霍温Catharina医院
原文链接:
https://arxiv.org/pdf/2608.28716v1.pdf
引言:Dice涨了0.02,临床就更好吗?
医学影像分割这十年,被Dice支配的日子实在太久了。翻翻论文,几乎每篇都在喊“我们Dice提高了0.03”“HD95降了2毫米”。但有没有人认真问一句:Dice涨了,医生的决策变了吗?病人活得更久了吗?治疗方案选得更准了吗?这是个灵魂拷问,但很少有研究正面回答。大部分工作默认一个假设:几何指标越漂亮,临床价值就越高。这个假设真的成立吗?荷兰埃因霍温理工大学和Catharina医院的研究团队,用一篇新论文给出了一个不完全一样的答案。他们选择的研究对象是腹膜转移癌(Peritoneal Metastases,PM)的影像评估。这类癌症的病情评估高度依赖一个叫 PCI(Peritoneal Cancer Index,腹膜癌指数)的评分系统。简单说,医生把腹腔分成13个区域,每个区域按最大病灶的大小打0到3分,总分0到39分。分数越高,病情越重。腹膜癌指数(PCI):解剖分区与病灶大小评分。分割指标与临床决策的鸿沟:rPCI评估的新视角Dice这个指标,医学影像分割领域的人再熟悉不过。只要做过分割任务,几乎绕不开它。它能量化两个掩膜之间的空间重合程度,确实方便,但也悄悄塑造了一种思维惯性:好像Dice越高,模型的临床价值就越大,分割越准,诊断就越可靠。事实真是这样吗?荷兰埃因霍温理工大学和Catharina医院的研究团队,用一篇聚焦放射学腹膜癌指数(radiological Peritoneal Cancer Index,简称rPCI)评估的论文,正面挑战了这个假设。rPCI是从增强CT影像上评估腹膜癌负荷的一套评分体系。它把腹腔划分成13个解剖区域,每个区域根据最大病灶的大小给0到3分,加起来总分0到39分。分数越高,意味着肿瘤播散越广泛。这套评分不是躺在论文里的理论模型,而是直接连着治疗决策的。对结直肠来源的腹膜转移癌,临床上通常把PCI 20作为肿瘤细胞减灭术(CRS)联合腹腔热灌注化疗(HIPEC)的参考分界线。这意味着什么?意味着19分和20分虽然只差1分,治疗方案可能完全不同。那么,一个核心问题就浮出水面了:分割算法在边界上偏了几毫米,Dice掉个0.05,在几何指标上看着挺扎眼,但它真的会改变rPCI总分、甚至改变患者的治疗分类吗?传统评估体系从来不回答这个问题。本文做的,就是把这条“几何指标”到“临床决策”的鸿沟,量化给你看。这项研究顺带也回应了rPCI本身的可靠性疑问。rPCI依赖放射科医生在CT上手动划定13个区域,但小肠蠕动、腹腔脂肪少、病灶低对比等现实因素,让边界划分并不轻松。观察者之间到底能达成多大一致?这个基准线不摸清楚,拿AI分割模型去跟谁比都不公平。
[1] Jacquet P, Sugarbaker P H. Clinical research methodologies in diagnosis and staging of patients with peritoneal carcinomatosis. Cancer Treatment and Research, 1996, 82: 359-374.[2] Tops-Welten M W, Ewals L J S, van Hellemond I E G, et al. Defining region boundaries to assess the peritoneal cancer index on imaging: a Delphi study. European Radiology, 2025.[3] Gort P C, Ewals L J S, Tops-Welten M W, et al. Deep learning-based segmentation of peritoneal cancer index regions from CT imaging. CARS 2026.[4] Isensee F, Petersen J, Klein A, et al. nnU-Net: Self-adapting framework for U-Net-based medical image segmentation. Informatik aktuell, 2018.