← 返回 PaperDaily
大模型与智能体
女王大学新突破:Agent带路,让AI学会看懂肿瘤切缘,零人工标注
手术台上,医生切开肿瘤时最怕什么?切不干净或切太多。加拿大女王大学的团队最新研究,让AI助手学会了“看懂”组织切下来的烟雾——质谱数据,就能在手术中实时判断切缘是否干净。而且,AI不再是个黑盒子,它能用“概念”解释自己的判断依据,就像老医生带徒弟一样。最酷的是,这些概念是AI自己发现的,完全不需要专家花时间打标签。
龙哥读论文
发布于 2026-08-14 09:11:26
阅读 3
查看原文
原论文信息如下:
手术切缘评估的困境与突破
做癌症手术时,医生最纠结的问题之一就是“切没切干净”。如果肿瘤细胞残留,复发风险高;如果切得太多,又会影响患者功能和生活质量。传统的判断方法是术后把切下来的组织送去做病理,等上几天才能知道结果——这时候患者早已缝合,想再手术调整已经太晚。快速蒸发离子化质谱(REIMS) 技术提供了一个解决方案:它通过分析手术中电刀烧灼组织产生的烟雾(即气溶胶)的代谢物组成,在几秒钟内给出组织类型的判断。这好比给外科医生装了一个“实时显微镜”,边切边看。但问题来了:现有的深度学习模型虽然能对离线采集的样本取得不错效果,可一旦进入手术室,面对复杂噪声和没有标注的实时数据,模型的泛化能力就大幅下降,而且是个黑盒子,医生不敢完全信赖。
过去几年,学界尝试过贝叶斯神经网络做不确定性估计、用图像表示质谱、甚至用大规模质谱预训练的基石模型DreaMS微调到REIMS数据上。但这些方法要么仍然缺乏可解释性,要么对术中噪声鲁棒性差。例如DreaMS是一个在数千万张二级质谱上自监督训练的基础模型,擅长提取分子特征,但微调到REIMS这种小样本任务时容易过拟合,且无法解释为什么某条谱线被判断为“肿瘤”。贝叶斯方法虽然能给出置信区间,但医生依然不知道模型依据了哪些代谢特征。图像表示方法则丢失了质谱的精细结构,导致区分度下降。这些困境促使研究者思考:能否让模型在保持高性能的同时,主动揭示其判断背后的生物学逻辑?
概念瓶颈模型(Concept Bottleneck Models)作为一种可解释方法,将原始特征映射到人为定义的概念(如“高脂质含量”、“高氨基酸丰度”),再基于概念做预测。但这类方法需要大量人工标注的概念标签,在复杂的质谱代谢组学工作流中几乎不可行——每个样本包含成百上千个质荷比峰,专家也没法一一标注哪些峰值对应什么代谢物。更关键的是,代谢物之间的相互作用是高度非线性的,简单的概念列表难以捕捉这种复杂性。例如,肿瘤组织可能同时表现出“脂肪酸氧化增强”和“糖酵解上调”,这两个概念在质谱上相互重叠,人工标注几乎不可能精确分离。
本论文来自加拿大女王大学的团队,他们在新工作Agent-Guided Relational Concept Discovery: Toward Interpretable Surgical Margin Assessment 中,提出了一种无需人工标注 的概念自动发现框架。其核心思路是:引入一个大语言模型作为推理智能体(reasoning agent) ,在训练过程中分析模型所学的概念,自动赋予语义标签,并根据与代谢数据库的一致性不断调整概念的重要性。这样一来,模型既学到了可解释的代谢概念,又能提升在术中噪声环境下的泛化能力。这种方法的关键创新在于,它将大语言模型的常识推理能力与领域知识库相结合,使得概念发现过程既自动化又具有生物学合理性。
无需标注:Agent引导的概念自动发现
整个框架可以分为四个步骤,如Fig.1所示。首先,利用预训练的DreaMS基础模型将每条质谱(REIMS spectrum)编码成固定维度的嵌入向量(embedding)。由于REIMS数据集很小(通常只有几百到几千个样本),DreaMS的参数被冻结,只作为特征提取器使用。DreaMS的嵌入维度为512,能够捕捉质谱中复杂的分子模式,包括同位素分布、碎片模式等细微特征。这一步相当于将高维的原始质谱(每个样本包含数千个m/z通道)压缩到一个信息丰富的低维空间,为后续的概念学习提供了良好的起点。
然后嵌入向量进入一个概念嵌入层(Concept Embedding Layer) ,这是一个可学习的线性投影,输出K个概念激活值。论文中K=8,这个数字是通过交叉验证确定的——太少则概念不够区分,太多则容易冗余。每个概念对应一个权重向量和偏置,激活值经过sigmoid函数映射到[0,1]区间,表示概念在当前样本中的相对存在程度。为了减少概念冗余,还加入了基于余弦相似性的正则化项,鼓励不同概念的权重向量尽量正交。具体来说,正则化项计算所有概念权重对之间的余弦相似度,并惩罚相似度过高的对,使得每个概念专注于不同的质谱特征区域。
到这里,模型已经能学到8个隐式概念,但还不知道它们代表什么生物含义。这时就轮到推理智能体 出场了。智能体基于Qwen2.5-7B-Instruct模型,在每轮训练后执行以下操作:首先,对每个概念k,找出激活值极高(前5%)和极低(后5%)的样本,对比它们的质谱差异,从而识别出与概念k最相关的质荷比(m/z)区域 。具体做法是计算两组样本的平均质谱之差,找出差异最大的m/z窗口(宽度为5 Da)。然后智能体把这些m/z区域提交给代谢数据库RaMP(一个综合性的代谢物-通路知识库),查询可能的候选代谢物和通路。RaMP数据库整合了来自HMDB、KEGG、Reactome等多个来源的信息,能够将m/z值映射到已知代谢物及其参与的生化通路。此外,智能体还参考从生化文献中提炼的临床指南文本,帮助判断哪些代谢物在肿瘤组织中更常见。这些临床指南包括关于乳腺癌、皮肤癌代谢特征的综述文章摘要,经过人工整理成结构化的知识库。
智能体会给每个概念生成一段语义描述 ,例如“此概念与氨基酸代谢通路高度相关”,并输出一个相关性反馈 (更相关/不太相关)。这个反馈被用来指导模型调整每个概念对最终分类的贡献权重。具体来说,每个概念有一个可学习的标量权重αk(经过sigmoid约束到[0,1]),分类器同时接收全局嵌入和加权后的概念信号。为了使模型真正依赖那些被智能体评估为“更相关”的概念,论文设计了智能体引导的对齐损失(Agent-Guided Concept Alignment Loss) :通过扰动(移除某个概念的贡献)测量模型对该概念的依赖程度,然后让高相关概念得到更大的依赖,低相关概念依赖降低。具体地,对齐损失计算为:L_align = Σ_k (r_k - d_k)^2,其中r_k是智能体给出的相关性分数(0或1),d_k是模型对该概念的依赖度(通过移除该概念后分类性能下降的程度来衡量)。整个训练目标由分类损失(交叉熵)和对齐损失加权组合,权重系数λ通过网格搜索确定为0.3。
这种设计巧妙之处在于:智能体完全基于数据自动分析和外部知识库,不需要人工标注概念,却能让概念具有生物学意义。而且智能体在训练过程中持续迭代——它维护一个“记忆板”,记录之前epoch的概念描述、光谱范围、分类性能等,从而保证反馈的稳定性和改进趋势。记忆板类似于一个经验回放缓冲区,存储最近5轮训练的概念分析结果,智能体在生成新反馈时会参考历史记录,避免反馈的剧烈波动。这种机制确保了训练过程的收敛稳定性。
知识图谱加持:让概念有据可依
光有概念描述还不够,智能体还需要理解这些概念之间的关联,以及它们与疾病状态的逻辑关系。为此,论文构建了一个动态更新的领域知识图谱(Knowledge Graph) 。这个图谱的节点包括m/z范围、候选代谢物、代谢通路、以及组织病理状态(如肿瘤、良性)。边表示“关联”或“参与”关系。例如,某个m/z范围130-135被链接到“氨基酸代谢”,再链接到“谷氨酰胺代谢”,最后链接到“PR阴性乳腺癌”(因为已有文献指出PR阴性乳腺癌与谷氨酰胺代谢有关)。知识图谱的构建基于智能体对每个概念的解析结果:智能体识别出与概念相关的m/z区域后,查询RaMP数据库获取对应的代谢物和通路,然后将这些实体作为节点添加到图谱中。图谱的边权重根据共现频率和文献支持度动态调整。
Fig.2(a)展示了乳腺癌知识图谱的一部分,可以看到m/z范围、代谢物和通路之间的丰富连接。图中清晰地显示了几个核心代谢模块:脂肪酸代谢模块(m/z 200-300区域)、氨基酸代谢模块(m/z 100-200区域)和核苷酸代谢模块(m/z 300-400区域)。这些模块之间通过共享代谢物(如谷氨酰胺)相互连接,形成了一个复杂的代谢网络。Fig.2(b)则是对某些m/z范围的局部放大,显示了它们关联的具体通路,例如m/z 147.1被映射到谷氨酸,进而连接到三羧酸循环和谷氨酰胺分解通路。
知识图谱不仅让概念更容易解释,还直接用于指导智能体的反馈。当智能体判断某个概念是否“相关”时,它会查询知识图谱,检查这个概念所关联的代谢通路是否与临床知识一致。例如,如果某个概念在PR阴性样本中激活更高,并且知识图谱显示它连接了谷氨酰胺代谢,那么智能体会认为这个概念“更相关”,并在训练中提高它的权重。这种机制确保了概念的相关性判断不仅基于统计相关性,还基于生物学合理性。智能体还会检查知识图谱中是否存在矛盾连接——例如,如果某个概念同时连接了“糖酵解增强”和“糖异生增强”这两个互斥的通路,智能体会降低该概念的可信度。
值得注意的是,这个知识图谱并不是静态的,而是在每一轮训练后由智能体更新。随着训练的进行,智能体对概念的理解不断加深,图谱中的连接也会调整,反映出数据驱动的代谢物-通路关系。具体更新规则包括:添加新的m/z-代谢物连接(如果智能体发现新的相关区域)、调整边的权重(根据共现频率)、以及删除低置信度的连接(如果连续多轮未被激活)。这种动态更新机制使得知识图谱能够随着训练过程不断精炼,最终形成一个既符合领域知识又适应特定数据集的代谢网络。这种设计使得模型不仅能解释“是什么”,还能解释“为什么”——这是传统黑盒模型难以做到的。
更棒的是,Fig.2(c)展示了模型学到的概念激活与临床标志物的一致性。图中展示了几个概念在不同孕激素受体(PR)状态样本上的激活强度,可以看出某些概念(如对应于氨基酸/谷氨酰胺通路的m/z子带)在PR阴性样本中明显激活更高,这与文献中“PR阴性乳腺癌与谷氨酰胺代谢增强”的结论吻合。而另一些概念(如对应于脂肪酸代谢的m/z子带)则在PR阳性样本中激活更高,这也与已知的激素受体阳性乳腺癌依赖脂质代谢的生物学特征一致。这直接验证了学到的概念确实具有生物学意义,而不是模型胡乱拼凑的数值模式。此外,论文还通过t-SNE可视化展示了概念激活值的分布,发现不同PR状态的样本在概念空间中形成了清晰的聚类,进一步证明了概念的有效区分能力。
真实术中数据验证:效果与可解释双提升
光说不练假把式。论文在两个标准REIMS数据集(皮肤癌和乳腺癌)以及一个真实的术中乳腺癌案例上进行了全面评估。皮肤癌数据集包含来自120名患者的约3000条质谱,分为良性、基底细胞癌和鳞状细胞癌三类。乳腺癌数据集包含来自80名患者的约2000条质谱,分为良性、导管原位癌和浸润性导管癌三类。两个数据集都经过严格的病理学确认作为金标准。Table 1展示了主要结果。
在皮肤癌数据集上,本文方法比Transformer基线在平衡准确率上提升了约2个百分点(从0.74到0.76),比DreaMS微调基线提升了5个百分点;灵敏度更是从0.59提升到0.70,意味着模型更好地识别了肿瘤组织。在乳腺癌数据集上,平衡准确率达到0.87,比DreaMS基线的0.84高出3个百分点,同时特异性(0.93 vs 0.89)和AUROC(0.98 vs 0.96)都有提升。这些结果说明引入概念瓶颈并没有降低分类能力,反而提升了泛化性能——因为概念层让模型学会了更稳定、更具生物学意义的特征,而非仅仅拟合训练数据的表面模式。值得注意的是,本文方法的标准差也普遍小于基线方法,表明其训练过程更加稳定。
更令人印象深刻的是术中泛化测试。Fig.3(a)展示了一次27分钟乳腺癌保乳手术的预测结果:x轴为手术时间,红色区域为外科医生标注的肿瘤区域,黄色为皮肤切口区域。可以看出,基线模型(DreaMS直接分类)在很多皮肤区域产生了假阳性(将皮肤误判为肿瘤),而本文提出的概念增强模型假阳性明显减少。具体量化分析显示,基线模型的假阳性率为23.4%,而本文方法降至8.7%,降低了近三分之二。这正体现了概念学习带来的鲁棒性——皮肤和肿瘤虽然在某些质谱峰上相似,但模型通过学习代谢概念理解了皮肤组织特有的脂质代谢模式,从而做出更准确的判断。此外,本文方法在肿瘤区域的灵敏度也略高于基线(91.2% vs 88.5%),说明概念学习没有以牺牲真阳性为代价来降低假阳性。
消融实验(Fig.3b)进一步验证了每个组件的贡献。在仅有智能体和临床指南(GL)的基础上,添加代谢数据库(DB)查询后,平衡准确率在皮肤癌数据集上提升了约2%,再加入知识图谱推理(KG)又提升了约3%。这些提升在皮肤癌数据集上更明显,可能是因为皮肤癌的代谢异质性更大,知识图谱提供了区分良恶性的关键线索。具体来说,皮肤癌数据集包含三种亚型(基底细胞癌、鳞状细胞癌和良性),它们之间的代谢差异比乳腺癌亚型之间的差异更细微,因此知识图谱提供的额外生物学约束帮助模型更好地捕捉这些差异。在乳腺癌数据集上,知识图谱带来的提升约为1.5%,但仍然显著(p<0.05,配对t检验)。
总结与展望
这篇论文提出了一种新颖的智能体引导概念发现框架,在无需概念标注的前提下,让质谱分类模型同时具备了高泛化性和可解释性 。通过将大语言模型作为推理智能体结合生化知识库,自动学习有意义的代谢概念并构建知识图谱,该方法在离体和术中的数据上都展示了优于纯黑盒基线的性能。特别值得关注的是,专业医生可以查看知识图谱中概念与代谢通路的关联,从而验证模型判断是否合理,这为临床信任奠定了基础。论文还提供了一个交互式可视化工具,允许医生点击每个概念查看其对应的m/z区域、关联代谢物和通路,以及在不同样本中的激活模式,进一步增强了可解释性。
当然,方法也有局限性。当前的知识库查询依赖于通用代谢数据库RaMP,对于某些稀有代谢物或组织特异通路可能不够精确。未来可以考虑引入更精细的基因层面信息,或者针对特定癌种定制知识库。另外,智能体使用的是通用大模型Qwen2.5-7B,计算开销不小,如何在保证效果的同时降低训练时间,也是一个值得优化的方向。论文作者建议,未来可以尝试使用更小的专用语言模型(如基于PubMed摘要微调的BioBERT)来替代通用大模型,可能在不牺牲性能的前提下大幅降低计算成本。此外,当前方法仅在一个术中病例上进行了验证,虽然结果令人鼓舞,但需要在更多患者和更多癌种上验证其泛化能力。
总体来说,这篇工作为“AI+医疗”中的可解释性和泛化性提供了一个漂亮的范例:不是让模型强行变成白盒,而是通过自动化知识注入来引导模型学到人类能理解的概念。这种思路也适用于其他依赖高维组学数据的决策任务,比如病理学、代谢组学甚至蛋白质组学分析。例如,在蛋白质组学中,可以类似地让智能体学习“磷酸化水平”、“泛素化程度”等概念;在基因组学中,则可以学习“突变负荷”、“拷贝数变异”等概念。这种通用性使得该框架有望成为组学数据分析的标准工具之一。
龙迷三问
问题1:REIMS和DreaMS是什么? REIMS是快速蒸发离子化质谱(Rapid Evaporative Ionization Mass Spectrometry)的缩写,通过分析手术中电刀烧灼产生的气溶胶实时提供组织代谢物谱。DreaMS是Deep Representations Empowering the Annotation of Mass Spectra的缩写,是一个在百万级串联质谱数据上自监督预训练的基础模型,用于提取分子特征。本文使用DreaMS作为冻结的特征提取器。DreaMS的预训练数据包含超过1000万张二级质谱,覆盖了广泛的代谢物类别,因此其提取的特征具有很好的通用性。
问题2:论文中的“概念”到底是什么?如何获得的? 概念是指从数据中自动发现的可解释代谢模式,例如“高谷氨酰胺信号”或“低脂质丰度”。传统概念瓶颈模型需要人工定义概念和标注样本,本文通过推理智能体自动识别与分类任务相关的质谱峰区域,再查询代谢数据库将其映射到生物通路,从而给每个概念赋予语义标签。不需要任何人工概念标注。每个概念实际上对应一组特定的m/z区域及其权重,智能体通过分析这些区域在RaMP数据库中的映射来赋予生物学含义。
问题3:这种方法在真实手术中能用吗?硬件要求高吗? 从论文的术中实验看(Fig.3a),该方法确实能在一个真实乳腺癌手术案例上降低假阳性率。但需要注意的是,推理智能体(Qwen2.5-7B)只在训练阶段使用,实际部署时只需要使用训练好的概念嵌入层和分类器,推理速度与普通神经网络无异,可以在15分钟内完成的术中场景下实时输出结果。不过模型需要配合REIMS质谱仪才能工作,设备成本较高。目前REIMS系统的硬件成本约为10-15万美元,主要应用于大型医疗中心。但随着技术成熟和规模化生产,成本有望逐步降低。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
将大语言模型作为推理智能体融入概念瓶颈训练流程,实现无需标注的概念发现,思路新颖且合理。知识图谱的动态更新也增加了创新性。但本质仍然是概念瓶颈+知识图谱的组合,未颠覆式创新。
实验合理度: ★★★★★
30次重复实验报告均值和标准差,统计可靠;对比了Transformer和DreaMS基线,消融实验验证了各组件贡献;术中数据验证极具说服力。实验设计非常完备。
学术研究价值: ★★★★✰
为可解释AI在医疗组学中的应用提供了一个即插即用式的框架,对后续希望在不依赖标注情况下引入领域知识的研究者很有参考价值。
稳定性: ★★★★✰
在离体数据上多次实验变异系数较小,术中数据表现稳定。但知识图谱构建依赖智能体每次输出的稳定性,原文未对智能体输出一致性做量化分析,存在轻微风险。
适应性以及泛化能力: ★★★★✰
在两个癌种数据集上都取得了提升,且术中泛化优于基线,说明框架具有跨组织类型的适应性。但当前只测试了皮肤癌和乳腺癌,能否推广到其他癌症(如肺癌、结直肠癌)尚需验证。
硬件需求及成本: ★★★✰✰
训练时需要运行7B参数的大模型做智能体反馈,计算成本较高;但推理时只需轻量网络,可以实时运行。训练阶段可以使用云服务,总体成本在可接受范围内。
复现难度: ★★★✰✰
论文声称代码将在接收后公开,但未提供预训练模型或详细超参数设置。使用Qwen2.5-7B和RaMP数据库需额外配置,复现门槛中等偏上。
产品化成熟度: ★★★✰✰
概念知识图谱为临床医生提供了直观解释,有助于建立信任。但REIMS设备本身尚未普及,且智能体训练流程仍显复杂,短期内难以作为独立产品部署。作为原型系统潜力较大。
可能的问题: 智能体反馈依赖于大语言模型的“推理”能力,如果大模型本身对代谢理解有偏差可能引入错误指导;消融实验显示知识图谱带来2-3%提升,但提升幅度不算巨大;仅在一个术中病例上测试,统计显著性有限。
主要参考文献
[1] Balog, J. et al. (2013). Intraoperative tissue identification using rapid evaporative ionization mass spectrometry. Science Translational Medicine.
[2] Bushuiev, R. et al. (2025). Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nature Biotechnology.
[3] Koh, P.W. et al. (2020). Concept bottleneck models. ICML.
[4] Braisted, J. et al. (2023). RaMP-DB 2.0: a renovated knowledgebase for deriving biological and chemical insight from metabolites, proteins, and genes. Bioinformatics.
[5] Pang, W. et al. (2024). Integrating clinical knowledge into concept bottleneck models. MICCAI.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完这篇,是不是觉得AI在医学上越来越聪明了?
想和更多医疗AI、Agent方向的大神一起讨论?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 医疗AI+北京+北大+李明) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群