既然要让基础模型“说人话”,那就该挑两个风格迥异的“代言人”来比一比。论文选了两个背景差异很大的CT基础模型。第一位是CT-FM(CT Foundation Model,CT基础模型),一个全CT自监督编码器,输入96³体素的结节中心patch,输出512维特征。它的训练视野覆盖整个胸部CT的连续性解剖结构,格局够大,但对单个结节的“微观长相”未必精细,像一位通才选手。第二位是FMCIB(Foundation Model for Cancer Imaging Biomarkers,癌症影像生物标志物基础模型),一个结节聚焦的对比编码器,输入50×50×50毫米的紧致裁剪,各向同性1毫米分辨率,输出4096维特征。它一门心思盯着结节看,路子更专,像一位专科医生。有了两位“读片员”,还得让它们学会说人话。这里用到的是LIDC-IDRI数据集——由美国7个学术中心联合构建的公开肺结节CT参考库,2,610个结节都有最多4位放射科医生的逐项标注。论文用这些标注训练了8个岭回归概念头(ridge regression concept heads),把每个嵌入映射到8个临床语义属性:微妙性(结节在肺野里的显著程度)、内部结构(软组织、液体、脂肪或空气)、钙化(形态或缺失)、球形度(三维圆度)、边缘(边界锐利度)、分叶(分叶状轮廓)、毛刺(毛刺状边缘)、纹理(实性、部分实性或磨玻璃)。这8个概念里,毛刺、分叶、微妙性和纹理正是临床医生判断恶性时最看重的形态学标志。恶性预测那头,论文没有用复杂的分类器,而是选了一个加性玻璃盒模型(additive glass-box model):预测值等于8个概念的线性贡献加上结节尺寸的线性贡献。玻璃盒的意思是,模型内部结构完全透明,每个特征对结果的贡献可以被精确分解。这也是后续“可编辑性”能够成立的基础——因为是加性的,改变任何一个概念的值,预测就会按照对应的权重线性变化。实验用了三个队列。LUNA25来自美国国家肺癌筛查试验,6,163个结节,其中恶性555个(9.0%),负责训练和内部测试;DLCS是杜克大学单中心外部独立队列,2,487个结节,恶性264个(10.6%),只做外部测试,不参与任何训练;LIDC-IDRI则专门用来训练概念头。三个队列的结节中位尺寸都在5~8毫米之间,正好是临床上最让人纠结的“不确定性肺结节”区间。各队列概况见表1。表1:队列特征与研究角色。连续变量以中位数[四分位距]表示;分割以结节数报告。LIDC-IDRI为概念标注参考队列。训练规模其实相当轻量:概念头只用2,610个LIDC结节,加性分类器用5,302个LUNA结节。因为两个编码器完全冻结,只训练线性层,整个训练过程本质上是在问一个学术问题:预训练模型见识里的“知识”,翻译成人类概念后,到底能学到几分?
[1] Pai, S., Hadzic, I., Bontempi, D., et al. Vision foundation models for computed tomography. arXiv preprint arXiv:2501.09001, 2025.[2] Pai, S., Bontempi, D., Hadzic, I., et al. Foundation model for cancer imaging biomarkers. Nature Machine Intelligence, 6(3):354-367, 2024.[3] Armato III, S. G., McLennan, G., Bidaut, L., et al. The Lung Image Database Consortium (LIDC) and Image Database Resource Initiative (IDRI): a completed reference database of lung nodules on CT scans. Medical Physics, 38(2):915-931, 2011.[4] Peeters, D., Obreja, B., Antonissen, N., et al. Benchmarking of AI and radiologists for indeterminate lung nodule malignancy risk estimation on screening CT: the LUNA25 challenge. Radiology: Artificial Intelligence, 2026.[5] Wang, A. J., Tushar, F. I., Harowicz, M. R., et al. The Duke Lung Cancer Screening (DLCS) dataset: a reference dataset of annotated low-dose screening thoracic CT. Radiology: Artificial Intelligence, 7(4):e240248, 2025.[10] Koh, P. W., Nguyen, T., Tang, Y. S., et al. Concept bottleneck models. In International Conference on Machine Learning, 5338-5348, PMLR, 2020.