← 返回 PaperDaily 视觉与图像

GPT-5.2翻车?阿德莱德大学用解剖导联组CNN完胜零样本大模型

GPT-5.2这波属实翻车了。阿德莱德大学团队用标准的CNN模型就能把ECG图像分类做得稳稳的,零样本大模型却直接沦为了”随机猜测”。这篇论文不仅给火热的LLM医学应用浇了盆冷水,还提出一个生理学感知的LeadGroupECG架构,效果扎实。

GPT-5.2翻车?阿德莱德大学用解剖导联组CNN完胜零样本大模型
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
GPT-5.2这波属实翻车了。阿德莱德大学团队用标准的CNN模型就能把ECG图像分类做得稳稳的,零样本大模型却直接沦为了”随机猜测”。这篇论文不仅给火热的LLM医学应用浇了盆冷水,还提出一个生理学感知的LeadGroupECG架构,效果扎实。


原论文信息如下:
论文标题:
Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study
发表日期:
2026年06月
发表单位:
阿德莱德大学计算机与信息技术学院 / 澳大利亚机器学习研究所(AIML) / Pi MedTech / 阿德莱德大学电气与电子工程学院
原文链接:
https://arxiv.org/pdf/2606.22889v1.pdf

为什么ECG图像分类需要“生理学感知”?

先来做个思想实验:你面前放着一张心电图,上面密密麻麻的波形,你该怎么判断它是否正常?
如果你是个心内科医生,你肯定知道——12导联心电图并不是12条独立的曲线,而是按解剖位置分组的:下壁(II、III、aVF)、侧壁(I、aVL、V5、V6)、室间隔(V1-V2)、前壁(V3-V4)以及aVR。每个组分别对应心脏的不同墙面,医生会综合评估各个墙面的电活动是否协调。这种分组的“生理学感知”是临床诊断的基础。
图1:无网格和有网格背景的ECG图像示例。每张图包含两列:左列为I、II、III、aVR、aVL、aVF导联,右列为V1-V6导联。
图1:无网格和有网格背景的ECG图像示例。每张图包含两列:左列为I、II、III、aVR、aVL、aVF导联,右列为V1-V6导联。
但现有的深度学习模型(比如ResNet、DenseNet)通常把整张心电图图片当作一个普通的自然图像,用卷积核无差别地扫描。它们看不到导联之间的解剖关系,更不会知道“下壁异常”和“前壁异常”是完全不同的临床信号。所以,阿德莱德大学团队提出了一种“生理学感知”的CNN架构——LeadGroupECG,把解剖导联分组直接嵌入到模型设计中,让模型学着像医生一样“分区观察、综合判断”。

LeadGroupECG:一个融合解剖导联组的CNN架构

LeadGroupECG的整体流程如图2所示。它把一张12导联心电图图片,先通过一个导联组提取器(Lead-Group Extractor)拆分成五个解剖区域(下壁、侧壁、室间隔、前壁、aVR),每个区域单独送进共享的ResNet18编码器提取特征,然后通过注意力机制和概念瓶颈层(CBM),最终生成一个既包含全局聚合又包含区域特异性证据的诊断结果。
图2:LeadGroupECG将ECG图像视为一组临床结构化视图,每个视图对应心脏的特定墙面。
图2:LeadGroupECG将ECG图像视为一组临床结构化视图,每个视图对应心脏的特定墙面。
具体来说,图3展示了导联组提取器的操作方法:根据标准的6×2排版,从固定坐标位置上裁剪出每个导联组的波形区域,并统一填充到相同尺寸。比如下壁组包含导联II、III、aVF的区域,侧壁组包含I、aVL、V5、V6等。提取器还输出一个有效掩码(validity mask),标记哪些导联组在当前图片中是完整的(因为某些心电图片可能裁剪不完整或缺失部分导联)。
图3:生理学感知的导联组提取器从ECG图像中创建五个解剖导联组的批次。
图3:生理学感知的导联组提取器从ECG图像中创建五个解剖导联组的批次。
导联组提取的形式化表示为:
公式1:导联组提取与掩码定义
公式1中,E是提取器,输入X是批次心电图图片,输出V是提取的五个导联组的张量(B×5×1×Ht×Wt),M是二值掩码(B×5),指示每个导联组是否有效。这个掩码会贯穿后续所有交互步骤,确保缺失的导联组不会参与注意力计算。
接着,每个导联组视图被一个共享的ResNet18 backbone编码,输出特征图:
公式2:共享编码器输出特征图
这里φ是共享的ResNet18(带ImageNet预训练),输出特征图尺寸为512×Ht/32×Wt/32。然后经过一个“身份安全”的卷积块注意力模块(CBAM)微调特征,再通过自适应平均池化+线性投影+层归一化,得到每个导联组的token表示T ∈ ℝB×5×256。加上可学习的导联组embedding来保留身份信息。
五个导联组的token通过一个掩码感知的多头自注意力模块(Masked MHSA)进行交互,再经过前馈网络(MLP)和残差连接,得到精炼后的token表示T′。这个过程使得不同导联组之间能互相“看”到对方的信号,但又不允许无效导联组参与。
最后,模型通过两条互补路径生成决策:
第一条是自适应池化路径:对每个导联组的token学出一个权重wi(基于温度标定的softmax),然后加权求和得到全局ECG表示z:
公式3:自适应池化路径
第二条是概念瓶颈路径(CBM):对每个导联组的token通过线性投影得到一个标量概念分数ci,表征该区域异常的证据强度:
公式4:概念瓶颈路径
最后将z和c拼接,经过一个线性分类器h得到二分类logits。
图4:LeadGroupECG的完整工作流,包括导联组提取器、共享编码器、导联组token混合器、以及自适应池化和区域CBM分数的拼接决策路径。
图4:LeadGroupECG的完整工作流,包括导联组提取器、共享编码器、导联组token混合器、以及自适应池化和区域CBM分数的拼接决策路径。

与基线CNN和LLM的全面对比

为了验证LeadGroupECG的效果,团队设计了一套严谨的对比实验。基线包括三个经典CNN:ResNet18、DenseNet121、VGG16,全部使用相同的训练配置(AdamW优化器、余弦退火学习率、早停策略等)。数据方面,使用了大规模的SPH数据集(山东某医院,约1.5万张10秒心电图图片)进行训练、内测试,并用PTB-XL数据集(1685张)进行外测试。
数据集构成如下:
表1:数据集构成及类别分布,包括训练、验证、内部测试和外部验证集。N为正常,AB为异常。
表1:数据集构成及类别分布,包括训练、验证、内部测试和外部验证集。N为正常,AB为异常。
内部测试结果(图5A/B)显示,所有CNN模型表现都相当不错,ROC-AUC均在0.92以上,PR-AUC在0.93以上。但仔细看,LeadGroupECG以0.941的ROC-AUC略胜一筹,并且统计检验(配对p=0.0023)表明它显著优于它的backbone ResNet18(0.919)。
图5:CNN模型(包括LeadGroupECG)在内部数据(A、B)和外部数据(C、D)上的ROC-AUC和PR-AUC表现。
图5:CNN模型(包括LeadGroupECG)在内部数据(A、B)和外部数据(C、D)上的ROC-AUC和PR-AUC表现。
外测试PTB-XL上,所有CNN模型有轻微下降(ROC-AUC约0.85-0.86),但LeadGroupECG与ResNet18持平,说明生理学感知结构并没有牺牲泛化能力。具体的数值见表2。
表2:CNN模型在内部和外部数据上的整体性能,包括ROC-AUC、PR-AUC、精确率、召回率、F1分数。均为5次独立运行的平均值±标准差。
表2:CNN模型在内部和外部数据上的整体性能,包括ROC-AUC、PR-AUC、精确率、召回率、F1分数。均为5次独立运行的平均值±标准差。
更酷的是,LeadGroupECG的导联组自适应权重揭示了有趣的解剖模式(图6):在所有种子中,侧壁组获得了最高的平均权重,下壁和前壁次之,室间隔和aVR贡献较低。这说明模型确实学会了关注临床上最重要的导联区域。而且,即使只用权重最高的一个导联组(比如侧壁)来做预测,ROC-AUC仍然有0.928(全模型0.941),证明大部分判别信息确实集中在少数主导区域,但其他导联组仍提供了互补的微弱信号(图7)。
图6:LeadGroupECG的导联组自适应权重和区域主导性。(A) 五个解剖导联组在5个种子上的平均自适应池化权重;(B) 每个导联组成为最高权重贡献者的样本百分比。
图6:LeadGroupECG的导联组自适应权重和区域主导性。(A) 五个解剖导联组在5个种子上的平均自适应池化权重;(B) 每个导联组成为最高权重贡献者的样本百分比。
图7:主导导联组与全模型的充分性对比。(A) 全模型与仅使用最高权重导联组的ROC曲线对比;(B) 预测概率差异的经验累积分布,大部分样本集中在零附近,表明主导视图捕获了大部分信号。
图7:主导导联组与全模型的充分性对比。(A) 全模型与仅使用最高权重导联组的ROC曲线对比;(B) 预测概率差异的经验累积分布,大部分样本集中在零附近,表明主导视图捕获了大部分信号。
与此同时,团队还评估了当时最先进的多模态大模型:GPT-5.2、GPT-4.1和Gemini-2.5 Pro,全部使用零样本(zero-shot)方式,给一张心电图图片,要求模型输出“正常/异常”及置信度。协议细节见表3。
表3:零样本多模态LLM评估协议总结。
表3:零样本多模态LLM评估协议总结。
结果让人大跌眼镜——所有LLM的ROC-AUC都只有0.51-0.53,跟随机猜测差不多。即使换了网格背景(grid-based)图片,也几乎没有改善(图8)。GPT-5.2虽然召回率较高(0.75-0.83),但精确率极低(约0.5),说明它倾向于把大部分图片都判为异常,没有真正的鉴别能力。
图8:零样本LLM在无网格(A)和有网格(B)ECG图像上的ROC和PR曲线,性能接近随机。
图8:零样本LLM在无网格(A)和有网格(B)ECG图像上的ROC和PR曲线,性能接近随机。

关键发现:零样本LLM为何失效?

插图
这个结果是不是让人一下子愣住了?GPT-5.2都能写诗写代码了,怎么连个心电图异常都看不出来?
原因其实很本质:ECG图像理解与自然图像理解完全不同。自然图像靠语义视觉识别(比如认出这是一只猫),而心电图需要精确的波形形态学分析——测量各波段的时限、振幅、间期,评估导联间的关系,识别ST段抬高、T波倒置等细微变化。多模态大模型虽然在通用视觉任务上很强,但并没有针对医学波形进行过专门训练。零样本条件下,它们缺乏对ECG形态学特征的先验知识,也无法执行精确的定量测量。
另外,心电图的网格背景虽然提供了校准信息,但对LLM来说可能只是增加了视觉噪声。实验中网格版图片的PR-AUC略有提升(从0.548到0.548? 实际上表4中GPT-5.2的PR-AUC在两种条件下都是0.548,没有变化),说明网格帮助微乎其微。
完整的LLM性能数值见表4。
表4:多模态LLM在无网格和有网格ECG图像上的性能,包括ROC-AUC、PR-AUC、精确率、召回率、F1分数。均为3次独立评估的平均值±标准差。
表4:多模态LLM在无网格和有网格ECG图像上的性能,包括ROC-AUC、PR-AUC、精确率、召回率、F1分数。均为3次独立评估的平均值±标准差。
所以,结论很清晰:对于ECG诊断这类需要领域特异性形态学分析的任务,当前通用多模态大模型在零样本下的可靠性还远远不够。而专门设计的CNN模型,特别是融入了生理学先验的LeadGroupECG,不仅表现稳定,还提供了可解释的导联组证据。这一发现给那些幻想“直接用大模型读心电图”的人浇了一盆现实的冷水。

总结与展望:领域特异性模型仍是基石

这篇论文清晰地告诉我们:在ECG图像分类这个具体任务上,经过良好训练的CNN(尤其是融入了生理学先验的架构)可以轻松达到0.94的ROC-AUC,而最先进的多模态LLM在零样本下只能做到0.53——基本等于抛硬币。
LeadGroupECG的贡献不仅在于它提高了性能,更在于它提供了一个可解释的解剖分组框架——医生可以看到模型认为哪个墙面最异常,这有助于建立信任。未来工作可以包括:扩展更细粒度的异常分类(比如区分ST段抬高、房颤等)、引入多模态融合(结合信号和图像)、以及探索LLM作为辅助验证层而非独立诊断模型的可能性。
龙哥认为,这项研究是对当前“AI万能论”的一次重要纠偏。它提醒我们:在医疗等高风险领域,领域特异性模型的扎实设计才是可靠性的保障,堆砌大模型参数并不能解决一切问题。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?论文系统地比较了传统CNN模型(包括新提出的LeadGroupECG)与当前最强多模态大模型(GPT-5.2、GPT-4.1、Gemini-2.5 Pro)在12导联心电图图像分类任务上的表现。核心结论是:CNN模型稳定可靠(ROC-AUC 0.92-0.94),而零样本LLM接近随机(ROC-AUC约0.51-0.53)。

什么是CBM(Concept Bottleneck Model)?CBM是概念瓶颈模型,它是一种可解释性的方法,在模型内部建立一个“概念”层,每个概念对应人类可理解的特征(比如“导联II的ST段抬高”)。在LeadGroupECG中,CBM路径为每个导联组输出一个标量概念分数,代表该区域异常的证据强度,从而提供解剖区域级的可解释性。

这篇论文的实验设计有哪些亮点?亮点包括:①使用大规模数据集(SPH 1.5万+ PTB-XL 1685)进行内部和外测试;②CNN和LLM使用完全相同的测试图片,公平比较;③CNN训练使用5个独立种子报告均值和标准差,LLM使用3个种子,确保统计可靠性;④LLM使用了标准化零样本提示,不进行任何few-shot或提示工程,保证了原始推理能力评估。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

LeadGroupECG的解剖导联组提取和双路径决策是新颖的设计,但整体基于成熟的ResNet+注意力机制,偏系统集成创新。

实验合理度:★★★★✰

实验设计非常严谨,多种子、内外测试、统一训练协议,公平性高。如果能增加更多LLM变体(如few-shot比较)会更好。

学术研究价值:★★★★✰

为ECG图像分类提供了一个可解释的生理学感知baseline,同时警示了LLM在医疗诊断中的局限性,对社区有重要参考意义。

稳定性:★★★★✰

CNN模型在多种子间方差小,表现稳定。LLM部分也是多次重复,结论可靠。但LeadGroupECG对图像排版格式的敏感度未充分测试(如不同裁剪方式)。

适应性以及泛化能力:★★★★✰

从内测试到外测试(SPH→PTB-XL)性能下降不大(0.94→0.86),泛化能力较好。但仅二分类正常/异常,未涉及多类异常亚型。

硬件需求及成本:★★★★✰

LeadGroupECG基于ResNet18,推理成本与ResNet18相当(稍高因多分支),可以在GPU上高效运行。训练需要中等显存(12GB可训)。LLM API调用成本高但实验已限制规模。

复现难度:★★★✰✰

论文未提供开源代码(截止阅读时),但方法描述详细,公式和图解清晰,有经验的团队可按描述复现。数据为公开数据集。

产品化成熟度:★★★✰✰

二分类任务可作为筛查工具初步应用,但需在更多真实临床场景、更多设备排版、更细粒度分类上验证。可解释性CBM路径是加分项。

可能的问题:①导联组提取依赖于标准6×2排版,对于非标准排版(如3×4、单列等)需要额外适配;②CBM概念分数目前是线性投影,其“概念”含义不够明确,需要进一步验证其临床可理解性;③仅二分类,未评估对具体异常类型(如房颤、心肌梗死)的识别能力。


主要参考文献

[2] Hannun AY, Rajpurkar P, Haghpanahi M, et al. Cardiologist-level arrhythmia detection and classification in ambulatory electrocardiograms using a deep neural network. Nat Med. 2019;25(1):65-69.
[29] Zhang J, Liu Z, Li S, et al. A large-scale multi-label 12-lead electrocardiogram database with standardized diagnostic statements. Sci Data. 2022;9:368.
[30] Wagner P, Strodthoff N, Bousseljot RD, et al. PTB-XL, a large publicly available electrocardiography dataset. Sci Data. 2020;7:154.
[31] Zhang L, Li Z, Zhang Y, et al. Exploring transparent deep learning models for ECG interpretation. npj Digit Med. 2024;7:127.
[32] He K, Zhang X, Ren S, et al. Deep Residual Learning for Image Recognition. In: CVPR; 2016.
[33] Huang G, Liu Z, van der Maaten L, et al. Densely Connected Convolutional Networks. In: CVPR; 2017.
[34] Simonyan K, Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition. In: ICLR; 2015.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让自己的AI心电诊断模型效果也这么顶?快来龙哥读论文粉丝群!扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 医疗AI+上海+阿德莱德大学+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。