← 返回 PaperDaily 视觉与图像

佛罗里达大学用GPT-4o指挥PET去噪:闭环多智能体,双指标超基线

PET(正电子发射断层成像)是肿瘤、神经和心脏疾病诊断中重要的分子影像手段,能无创显示体内代谢活动。但PET天生有痛点:光子符合计数有限,图像信噪比低。

佛罗里达大学用GPT-4o指挥PET去噪:闭环多智能体,双指标超基线
原论文信息如下:
论文标题:
VLM- and LLM-Driven Multi-Agent System for PET Image Denoising
发表日期:
2026年08月
发表单位:
University of Florida, University of Bern, University of Texas MD Anderson Cancer Center
原文链接:
https://arxiv.org/pdf/2608.13791v1.pdf

paperdaily_reaction_gif

PET去噪的困境:从人工干预到智能决策

PET(正电子发射断层成像)是肿瘤、神经和心脏疾病诊断中重要的分子影像手段,能无创显示体内代谢活动。但PET天生有痛点:光子符合计数有限,图像信噪比低。临床为降低辐射剂量常采用低剂量扫描,噪声问题更明显,可能让标准化摄取值(SUV)出现偏差。SUV是PET最核心的半定量指标,若偏差发生在小病灶或低对比病灶区域,医生判断良恶性就会受干扰。
更麻烦的是,真实临床扫描没有“标准答案”。剂量水平、患者体型、扫描时长、重建协议都在变。一个在1/20剂量下表现好的去噪模型,放到1/50剂量下可能不够用,要么噪声抑制不彻底,要么过度平滑抹掉病灶细节。这不是模型不行,而是低剂量PET去噪本质上是需要“自适应”的任务。不同患者生理差异、扫描仪器系统特性、医院操作流程,都会让同一模型在不同场景下效果迥异。这种高度异质性,恰是传统“训练一个固定模型、部署到所有场景”思路最难应对的挑战。
过去几年,深度学习去噪模型从CNN到GAN再到扩散模型,已能生成相当不错的图像。但真正部署到现实工作流时,依然高度依赖专家手动干预:检查呼吸运动或患者运动导致的PET/CT配准错位,评估噪声严重程度决定用哪个模型,挑选推理参数平衡噪声抑制和病灶对比度,去噪后还得再做病灶局部定量检查。这四步全是专业活,每一步都依赖经验。一个熟练的核医学物理师面对一例低剂量PET扫描,通常需反复调整参数、多次运行算法、仔细比对结果,可能耗费数十分钟甚至更久。这种模式不仅效率低下,且不同专家判断标准存在差异,难以形成统一规范。
那能不能把专家经验写成规则?理论上可以,但实际很尴尬。剂量条件、模型类型、可调参数、病灶状态之间是耦合的,规则表会越写越长。更关键的是,专家决策往往是多步的:头一轮策略失败后,下一步计划要依赖前一轮用了什么、为什么失败。这种带历史依赖的连续决策,静态规则几乎无法表达。同样的表象背后可能是完全不同的调整方向,这种上下文相关的决策逻辑,用传统规则系统表达会极其复杂且难以维护。
所以这篇论文的切入点非常直接:视觉语言模型(VLM)擅长图像理解和质量判断,大语言模型(LLM)擅长上下文推理和工具调度,那能不能把这些模型组合起来,构建一个像专家一样“看情况、做决策、看结果、再修正”的自动去噪工作流?这个想法一出来,整个PET去噪的玩法就不一样了。它不再试图用一个更强大的网络去“碾压”所有噪声,而是模拟人类专家的工作方式,用多个专业模块协同配合,在动态反馈中逐步逼近最优结果。这种从“模型驱动”到“流程驱动”的范式转变,可能是医学图像处理领域一个值得关注的新方向。

多智能体框架:感知-调度-执行-反馈的闭环设计

论文提出的框架把PET去噪拆成四个阶段:感知(Perception)、调度(Scheduling)、执行(Execution)、反馈(Feedback)。这个流程几乎是照着真实专家的操作习惯来的:先看扫描条件,再定策略,然后执行,最后验证结果,不满意就重来。整个系统由多个专门化的智能体(Agent)组成,每个智能体负责一个明确的功能模块,通过结构化的信息传递实现协同工作。这种模块化设计不仅让每个组件职责清晰,也使得系统调试和升级更灵活——任何一个模块都可独立替换或改进,而不影响其他模块正常运行。
图1:本文提出的低剂量PET去噪闭环多智能体框架总览
感知阶段,三个专家智能体从不同角度分析输入图像。解剖感知智能体检查PET/CT有没有配准错位;剂量感知智能体估计当前扫描的噪声/剂量条件;病灶感知智能体分割病灶并描述病灶状态。三个智能体输出被汇总成一份紧凑的结构化感知报告。这份报告是整个决策链的起点,它的质量直接决定了后续调度和执行的效果。为了让感知报告既全面又精炼,论文在设计时特别注意了信息粒度的把握——既要包含足够的细节供调度器做出精准判断,又要避免冗余信息干扰LLM的推理过程。
调度阶段,LLM作为“总指挥官”,结合感知报告和一个预先蒸馏好的PET去噪领域知识库,选择匹配当前剂量条件的条件扩散去噪模型,并确定数据一致性约束强度λ_dc。这个λ_dc是整个系统里最关键的旋钮,后面会详细展开。调度器的工作方式类似于人类专家的决策过程:先理解当前情况,再查阅过往经验,最后做出判断。知识库在这里扮演了“经验手册”的角色,它把验证集上大量实验总结出的规律以结构化文本的形式提供给LLM,让LLM的决策有据可依,而不是凭空猜测。
执行阶段,选好的DDPM模型跑一遍生成去噪后的PET图像。反馈阶段,反馈智能体重新评估器官级噪声下降幅度和病灶定量指标。如果结果不满足预设标准,系统就自动回滚到去噪前状态,把失败信息加入下一轮调度的上下文,让LLM带着“上一次为什么失败”的经验重新生成策略。这个反馈回路的设计非常关键,它让系统具备了自我纠错的能力。每一轮失败都不是白费的,失败的原因会被记录下来,成为下一轮决策的重要参考。这种“从错误中学习”的机制,正是人类专家工作方式的精髓所在。
图2:多智能体PET去噪系统详细架构
这套闭环的价值在于,把过去需要专家肉眼反复试错的过程自动化了。传统技术路线是“一个模型吃遍天”,遇到不同剂量条件就露馅;这套框架是“一个团队打配合”,谁行谁上,不行就换,还能从失败里吸取教训。从系统设计角度看,这种多智能体协作还有一个额外好处:每个智能体都可以使用相对简单、专门的模型,而不需要一个“全能型”的超级模型来包办所有任务。这大大降低了每个模块的训练难度,也使得整个系统更容易理解和调试。

三大感知智能体:解剖、剂量与病灶的协同分析

先看解剖感知智能体。呼吸运动和患者移动都会导致PET和CT图像之间出现配准错位,这种错位会影响病灶定位和后续质量评估。解剖感知智能体对PET和CT分别生成器官掩膜,重点比较肺、肝这类运动敏感器官的位置和重叠程度。一旦发现器官不一致,就发出警告,提示需要额外配准。同时,器官掩膜还能用来计算器官级噪声统计量,既给调度器提供参考,也给去噪后的评估提供基线。这种基于器官级别的分析比全局图像分析更加精细,因为不同器官对噪声的敏感度和临床重要性是不同的。例如,肝脏的噪声水平可能影响转移灶的检出,而肺部则需要特别关注呼吸运动带来的伪影。
剂量感知智能体是整篇论文最有意思的设计之一。简单做法是直接读取PET的标称剂量标签,但论文选择了更聪明的路线:微调BiomedCLIP,让模型直接从PET图像外观判断“图像衍生剂量条件”。为什么强调图像衍生?因为重建后的PET噪声不仅取决于注射剂量,还受患者体重、扫描时长、重建参数影响。同一标称剂量下,不同受试者的图像噪声可能差很多。只看标称剂量,其实并不能准确描述图像的真实噪声状态。例如,一个体重较大的患者即使注射了标称剂量,其图像噪声也可能比体重较小的患者高出不少;同样,扫描时间缩短也会导致噪声增加,但这些信息在标称剂量标签中完全看不出来。
具体实现上,论文冻结BiomedCLIP预训练的文本和图像编码器,加了一个轻量级图像侧控制器,用对比学习把低剂量PET图像嵌入拉近到对应剂量文本提示的嵌入。每个剂量水平对应一个文本提示,模型预测图像嵌入和哪个提示嵌入最相似。3D PET数据按轴向切片逐层预测再聚合,得到主体级剂量估计和置信度。这种设计巧妙地利用了BiomedCLIP在多模态医学图像理解上的预训练能力,只需要少量微调就能适应PET图像剂量估计的任务。逐层预测再聚合的策略也很有讲究,它既保留了局部细节信息,又能通过投票机制提高整体判断的稳定性。
图4(A):剂量感知智能体用50%置信度阈值区分1/20和1/50剂量组;右侧展示了同一剂量组内置信度高低不同的受试者图像及相关采集信息
从图4(A)可以看到,模型用50%置信度阈值就能把1/20和1/50剂量组清晰分开。注意组内差异:同样是1/20剂量,Subject 1和Subject 2的置信度明显不同,对应的图像噪声也不一样;1/50组里也有类似的个体差异。这些受试者的注射剂量、体重、扫描时间确实都不同,进一步说明标称剂量标签不足以代表真实噪声,模型“看图说话”得到的信息更有价值。这个结果也验证了论文的核心假设之一:图像本身的噪声特征比标称剂量更能反映真实的图像质量,而VLM能够有效地从图像中提取这些信息。
病灶感知智能体负责全身病灶分割。论文训练了一个3D nnU-Net,采用ResNet编码器,patch size加大到192×192×192来扩大感受野,提升全身覆盖的鲁棒性。输出包括病灶掩膜和病灶SUVmax等关键描述。病灶信息对调度很重要:如果病灶存在,去噪参数就不能太激进;如果病灶摄取值在去噪前后波动太大,反馈阶段就应该触发回滚。病灶分割的准确性直接决定了后续决策的质量,因此论文在模型设计和训练数据上都下了不少功夫。使用AutoPET-IV这个公开的大规模PET/CT数据集进行训练,保证了模型在多样化的临床场景中都有不错的表现。
图4(B):病灶感知智能体在AutoPET-IV FDG测试集(LMU和UKT两个临床中心)上的病灶分割性能,与挑战基线比较,报告前景DSC、FNV和FPV
病灶分割的评估指标包括前景Dice相似系数(DSC)、假阴性体积(FNV)和假阳性体积(FPV)。DSC衡量分割区域和真实病灶的重合度,FNV是漏掉的病灶体积,FPV是误报的病灶体积。图4(B)显示,在AutoPET-IV数据集LMU和UKT两个临床中心测试子集上,本文改进的3D nnU-Net相比挑战基线,DSC更高、FNV和FPV都更低,分割质量足够支撑后续调度决策。值得注意的是,FPV的降低意味着模型不会把正常组织误判为病灶,这对于避免不必要的临床干预非常重要;而FNV的降低则保证了真正有临床意义的病灶不会被漏掉。

LLM调度与知识库:让决策有据可依

直接丢给LLM一堆数字让它选模型,很可能得到一本正经的胡说八道。论文的做法是先构建一个领域知识库。在验证集上,把不同的去噪模型和数据一致性强度λ_dc组合都试一遍,记录对应的感知信息、去噪设置和评估结果;然后让LLM把这些经验总结成结构化的PET去噪知识,包括不同感知条件下优先选哪个模型、λ_dc的合理范围、λ_dc如何影响噪声抑制和摄取值保持之间的平衡。这个知识库的构建过程实际上是在做“经验蒸馏”——把大量实验数据中蕴含的规律提炼成LLM可以直接理解和运用的文本知识。这样做的好处是,LLM不需要从零开始理解PET去噪的物理原理和工程细节,只需要在知识库的指导下做出合理的决策即可。
图3:PET去噪领域知识库的构建流程
执行模块用的是剂量特定条件扩散模型DDPM(Denoising Diffusion Probabilistic Model,去噪扩散概率模型)。扩散模型的两阶段思想很直观:前向过程逐步给图像加噪,让图像变成纯噪声;反向过程学习从噪声逐步还原出干净图像。公式1定义了前向加噪过程中x_t和x_{t-1}之间的关系,β_t控制每一步的噪声强度。扩散模型之所以在图像生成和恢复任务中表现出色,是因为它通过逐步去噪的方式,能够捕捉到图像数据中复杂的多尺度结构信息,而不是像传统方法那样试图一步到位地完成映射。
公式1:扩散模型前向加噪过程定义 公式2:前向加噪过程的单步闭式表达,其中α_t为累积噪声系数
公式2给出了x_t与x_0之间的闭式关系,α_t是累积噪声调度系数。训练时,条件去噪网络ε_θ输入带噪样本x_t、时间步t和低剂量条件y,去预测加入的噪声ε,优化目标就是公式3的均方误差损失。这个训练目标虽然形式上很简单,但实际训练过程中需要精心设计噪声调度策略和数据增强方案,才能让模型在不同噪声水平下都有稳定的表现。论文在训练时特别强调了剂量条件的注入方式,确保模型能够充分利用低剂量图像中的有效信息来指导去噪过程。
公式3:DDPM噪声预测训练损失
但纯扩散先验生成有个风险:模型可能“脑补”出不符合真实测量的结构,小病灶被过度平滑。所以论文在采样阶段加了数据一致性约束,见公式4。第一项是常规的去噪预测,第二项是( y - x_t )乘以η_t λ_dc,相当于把生成结果往实际测量的低剂量图像方向拉。这种约束方式在扩散模型的条件生成中是一种常见且有效的技巧,它能够在保持生成图像质量的同时,确保输出与真实测量数据的一致性。λ_dc的引入让系统有了一个可调节的旋钮,能够在“相信先验”和“相信测量”之间灵活切换。
公式4:数据一致性引导的扩散采样公式,λ_dc控制测量数据对生成结果的约束强度
理解λ_dc可以打个比方:它决定了模型“有多大胆”。λ_dc大,结果更贴近原始低剂量图像,细节和病灶保留好,但去噪可能不彻底;λ_dc小,模型更相信自己的先验“想象”,去噪更强但可能把病灶磨掉。调度的核心任务之一,就是根据剂量估计、器官噪声统计和病灶状态,选一个最合适的λ_dc。反馈回路发现噪声降得不够,就把λ_dc调小;发现病灶SUV变化太大,就把λ_dc调大。这套机制让参数选择不再靠猜,而是有反馈支撑的动态调整。这种“感知-决策-执行-验证”的闭环控制思路,与经典控制理论中的反馈控制思想一脉相承,只不过这里的“控制器”换成了具有推理能力的LLM。

实验结果:定量指标与病灶保护的全面提升

实验数据来自Siemens Biograph Vision Quadra PET/CT,共115例全身18F-FDG扫描,按90训练、5验证、20测试划分。1/20和1/50两种低剂量设置通过列表模式数据重分组生成,图像以SUV表示。作为对比,UNet、GAN和DDPM基线在两个剂量混合数据上训练,DDPM基线只用一个模型应付两个剂量,且不做剂量特定选择,也不做数据一致性自适应调节,对比条件公平合理。这种实验设计确保了对比的公平性:所有方法都在相同的数据上训练和测试,唯一的区别在于方法本身的架构和策略。特别是DDPM基线的设置,它和多智能体框架中的执行模块使用相同的生成模型,唯一的区别在于是否有多智能体调度和反馈机制,这样就能清晰地分离出“模型能力”和“调度策略”各自的贡献。
图5:Siemens Biograph Vision Quadra 18F-FDG测试数据在1/20和1/50低剂量下的去噪效果矢状面对比,含正常剂量参考图
定性结果看图5。1/20和1/50的低剂量输入噪声非常明显。UNet和GAN都出现了可见的过度平滑,图像发“糊”,组织结构被抹掉不少。DDPM基线对解剖结构更友好,但残余伪影依然存在。多智能体框架选用了剂量特定DDPM并自适应调节数据一致性强度,视觉上最接近正常剂量参考,残余伪影最少。从临床角度来看,这种差异不仅仅是审美上的——过度平滑导致的组织结构模糊可能会掩盖微小病变,而残余伪影则可能被误认为病理改变。多智能体框架在这两方面的表现都更优,说明它在保持图像真实性和去除噪声之间找到了更好的平衡点。
图6:1/20和1/50两种剂量下各方法在20个测试集上的PSNR和SSIM定量对比,*表示p<0.05,***表示p<0.001
定量结果看图6。在20个测试病例、两种剂量水平下,多智能体框架的PSNR和SSIM都是最高,而且相对UNet、GAN、DDPM基线的提升都具有统计学意义(Wilcoxon符号秩检验,p<0.05和p<0.001)。这说明提升不是偶然的,是系统性的。PSNR和SSIM是图像质量评价中最常用的两个指标,分别从像素级误差和结构相似性两个角度衡量重建质量。多智能体框架在这两个指标上的全面领先,说明它在保持整体图像结构的同时,也精确地恢复了像素值。值得注意的是,在1/50这种更极端的低剂量条件下,多智能体框架的优势更加明显,这进一步验证了自适应调度策略在困难场景下的价值。
图7:病灶区域放大对比及预测图与真实图之间的L2范数距离图,正常剂量PET作为参考
病灶局部对比看图7。DDPM基线整体效果不错,但病灶周围仍能看到局部偏差。多智能体框架通过剂量特定模型加自适应数据一致性约束,病灶摄取值模式保留得更好,L2距离误差也明显更小。对于PET这种“过度去噪 = 病灶消失”的任务,病灶保护比全局指标更重要,这一点在结果里体现得很清楚。L2距离图直观地展示了每个像素位置上预测值与真实值的差异,可以看到多智能体框架的误差主要集中在噪声水平较高的区域,而DDPM基线的误差则更广泛地分布在病灶周围。这种差异在临床上是至关重要的——如果去噪过程改变了病灶的SUV值,医生可能会对病变的良恶性做出错误判断。
R-C.jpeg

局限与展望:从可行性到临床落地

论文在讨论部分对局限的分析相当坦诚。首先是LLM幻觉问题。gpt-4o-mini作为调度器,输出带有随机性,万一给出离谱的计划怎么办?论文用了三层安全阀:第一层是知识库约束,把模型选择和λ_dc范围限制在安全区间,从源头过滤越界计划;第二层是反馈智能体,器官噪声或病灶SUVmax超出预设范围就触发回滚;第三层是数据一致性约束,即使LLM给出了激进参数,最终输出也不会偏离实测图像太远。但三层保护并不能完全消除LLM的不确定性,多次运行的一致性也没做系统评估,这是后续要补的功课。LLM的随机性是一个客观存在的技术挑战,论文通过工程手段将其影响降到最低,但要从根本上解决这个问题,可能需要在模型层面引入更严格的约束机制,或者开发专门针对医疗决策场景的微调LLM。
其次是计算负担。推理约10分钟一例,主要耗时在迭代DDPM采样,agentic流程本身开销不大。这个速度做科研没问题,但离临床实时应用还差得远。未来用flow matching或蒸馏加速生成模型,可以在不改变感知、调度、反馈框架的前提下大幅缩短推理时间。在临床场景中,医生通常希望在几分钟内看到处理结果,10分钟的等待时间虽然可以接受,但还不够理想。如果能够通过模型蒸馏或更高效的采样算法将推理时间缩短到1-2分钟,这个系统就具备了进入临床工作流的潜力。
第三是泛化性。当前是1/20和1/50两档低剂量的可行性验证,扩展到更多噪声条件需要补充训练数据和对应去噪模型。模块化设计给了很大的扩展空间,感知、调度、执行、反馈各环节都可以独立升级。论文也明确提到,这个框架不只是为去噪设计的,未来还可以迁移到扩散模型的PET重建任务上。从更广阔的视角来看,这种“感知-调度-执行-反馈”的多智能体范式,可能适用于更广泛的医学图像处理任务,比如CT低剂量重建、MRI超分辨、图像配准等。只要任务可以被分解为“评估输入-选择策略-执行处理-验证结果”的流程,这个框架就有潜在的应用价值。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?佛罗里达大学等机构提出VLM/LLM驱动的多智能体PET去噪框架:解剖、剂量、病灶三个感知智能体分析图像,LLM调度扩散模型与参数,闭环反馈支持回滚重试。在1/20和1/50低剂量下,PSNR和SSIM均超UNet、GAN、DDP
这篇工作最值得看的点是什么?所提方法在1/20和1/50两个剂量水平下均取得最高PSNR和SSIM,且统计显著优于对比方法;病灶区域L2距离误差更低。
这篇工作的边界或风险在哪里?优点:提出新颖的闭环多智能体框架,实现自适应PET去噪;模块化设计便于扩展;结合VLM/LLM实现自动化决策。缺点:依赖GPT-4存在幻觉风险;仅验证两个剂量水平;计算开销较大;缺乏与最新方法的全面对比。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个由VLM和LLM驱动的闭环多智能体PET图像去噪框架,通过感知、调度、执行和反馈四个阶段实现自适应去噪策略选择与参数调整。

实验合理度:★★★★☆

PSNR、SSIM、病灶分割DSC、FPV、FNV、L2距离误差。

学术研究价值:★★★★☆

提出一个由VLM和LLM驱动的闭环多智能体PET图像去噪框架,通过感知、调度、执行和反馈四个阶段实现自适应去噪策略选择与参数调整;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练约2天(6块NVIDIA B200 GPU),推理约10分钟/数据集。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:依赖GPT-4存在幻觉风险;仅验证两个剂量水平;计算开销较大;缺乏与最新方法的全面对比。

主要参考文献

[1] Yu B, Ozdemir S, Xing Y, et al. VLM- and LLM-Driven Multi-Agent System for PET Image Denoising. arXiv preprint arXiv:2608.13791, 2026.
[2] Chen H, Li W, Gu J, et al. RestoreAgent: Autonomous image restoration agent via multimodal large language models. NeurIPS 2024.
[3] Zhu H, et al. AgenticIR: Agentic image restoration via multi-modal large language models. 2025.
[4] Zhang S, et al. BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs. 2023.
[5] Gong K, et al. Data-consistency guided diffusion model for low-dose PET image denoising. 2023.
[6] Alberts I, et al. Clinical performance of long axial field of view PET/CT: a head-to-head intra-individual comparison of the Biograph Vision Quadra with the Biograph Vision PET/CT. European journal of nuclear medicine and molecular imaging, 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球