← 返回 PaperDaily
大模型与智能体
LeCun参与,魏茨曼LeDXA:1.1万张DXA扫描训练,疾病预测胜过8.6亿参数模型
一说到DXA(双能X射线吸收测定法),大多数人脑海中浮现的画面大概是体检中心排队时,躺在一台白色仪器上,几分钟后拿到一张写着骨密度T值的报告单。这玩意儿在临床上主要就干一件事:判断你有没有骨质疏松。
龙哥读论文
发布于 2026-08-14 21:47:25
阅读 3
查看原文
原论文信息如下:
一说到DXA(双能X射线吸收测定法),大多数人脑海中浮现的画面大概是体检中心排队时,躺在一台白色仪器上,几分钟后拿到一张写着骨密度T值的报告单。这玩意儿在临床上主要就干一件事:判断你有没有骨质疏松。但有没有人想过,这张花了几分钟扫出来的全身影像里,其实藏着远比“骨头松不松”多得多的信息?哈,这个角度确实有意思。
龙哥最近读到一篇非常有意思的论文,来自魏茨曼科学研究所以及布朗大学等机构的研究团队,论文通讯作者是Eran Segal教授,合作者名单里还有一位熟悉的面孔——Yann LeCun。这篇工作直接把DXA扫描图像扔给了一个自监督学习模型(Self-Supervised Learning,SSL),训练出一个叫LeDXA的医学影像基础模型,然后发现:从一张常规骨密度扫描图里,居然可以同时读出二型糖尿病、髋关节骨关节炎的发病风险,预测你看起来比实际年龄老还是年轻,甚至还能告诉你这种“衰老加速”和死亡率之间的关联。这就有点厉害了。
一张骨密度片,能读出这么多健康信息,这哪是“骨密度测定”,分明是给全身健康状态拍了一张“快照”。😏
一张DXA扫描能揭示多少健康秘密?
先来简单科普一下DXA到底是什么。DXA扫描仪会发射两种不同能量级别的X射线,穿透人体后,通过两种能量下组织衰减的差异,可以精确区分骨骼、脂肪和瘦体组织(Lean Mass)。一次全身DXA扫描能得到骨矿物质密度(BMD)、内脏脂肪组织(VAT)、四肢瘦体重(ALM)等一堆量化指标。
听起来很全面对吧?但问题恰恰出在这里——临床上使用的只有这十几个预先定义好的标量数值,而扫描得到的原始影像是一张包含全身空间结构的高清图像。骨密度指标本质上把骨骼信息压缩成了一个区域平均值,软组织指标则是把全身分成几个大区块后做质量加总。骨头纹理怎么分布、脂肪具体堆积在哪些位置、躯干和四肢的瘦组织比例如何随年龄变化——这些空间分布的细节,全部被丢了。
有一个现成的例子可以证明DXA图像里确实藏着超越常规数值的信息:临床上使用的小梁骨评分(TBS)。这个指标就是从DXA图像中提取骨骼纹理信息,能预测一些标准BMD数值预测不了的风险。既然TBS能证明这一点,那整张DXA图像里还藏着多少未被开发的医学信号?本文的研究团队要回答的正是这个问题。
以往把深度学习用到DXA图像上的工作,绝大多数走的是有监督学习路线:拿着几万张标注了骨折或者死亡结局的图像,训一个模型去预测特定目标。这么做最难受的地方在于——每换一个新任务,就得重新花钱花精力标一批数据,而且模型只能干这一件事。本文采用的方案是自监督学习(SSL):先不告诉模型任何标签,让它自己从大量无标注的图像中学习通用的视觉表征,之后再用很少的标注数据去适配具体任务。
文章开头放出的这张总览图非常直观,把研究框架讲得很清楚。
从零训练:LeDXA如何在1.1万张图像上超越8.6亿参数模型
讲LeDXA之前,得先介绍一个关键概念:JEPA(Joint-Embedding Predictive Architecture),联合嵌入预测架构。传统自监督方法比如MAE或者扩散模型,走的是“重建像素”路线:把图像的一部分遮住,让模型想办法把被遮住的像素补回来。这样学到的表征往往会过度关注纹理细节,而这些细节对理解图像语义并不重要,反而在一定程度上会被扫描仪器的噪声干扰。
JEPA的思路完全反过来:把图像切成不同视角,在抽象的潜在空间(Latent Space)里做预测,预测目标不是像素值,而是图像经过编码器之后的表征向量。这样做的好处是,模型必须理解图像中骨骼和软组织的空间形态、整体结构关系,而不是去死记硬背每个像素点的亮度值。本文使用的LeJEPA(Latent-Euclidean JEPA)框架,是JEPA的一个改进版本,特点是训练过程特别稳定,不需要大量精细调参,用常规规模的医学影像数据集就能从头训练出可用的模型。
LeDXA的预训练数据来自以色列Human Phenotype Project(HPP)队列,总共11,540张全身DXA扫描图。这批数据没有做任何人工标注——直接把原始图像扔给模型学。编码器用的是ViT-Small/16(Vision Transformer小型变体,patch size为16×16像素),骨干编码器约2,166万参数,加上投影头也就2,679万参数。在训练时,每张DXA扫描会被扩展成10个视图:2个全局视图(全身图)加上8个局部裁剪(股骨/脊柱区域扫描和全身随机裁剪块),Encoder把每个视图变成384维向量,再经过一个小型3层网络压缩到64维。
完成预训练后,骨骼图像和软组织图像各自的384维嵌入被拼接成768维的向量,作为下游任务的特征。注意,整个过程编码器权重完全冻结,下游任务只训练一个简单的线性层或浅层模型。
这里有一组数据,龙哥觉得有必要停下来让大家感受一下,本文拿LeDXA去对比的基线模型是DINOv3——Meta在互联网规模数据上训练的视觉基础模型,参数量达到8.6亿,训练图像数量超过15亿张。而LeDXA的训练数据只有11,540张,参数量只有2,200万。训练数据量少了大约15万倍,参数少了将近40倍。如果是个普通模型,这种体量差距,基本可以直接投降了,纯属“蚂蚁对大象”。但实验结果让人大跌眼镜:LeDXA不仅没有被碾压,反而在多个任务上反超了DINOv3。
超越传统指标:空间结构中的疾病预测信号
那么,LeDXA学到的表征到底包含哪些信息?这就要从三个层面来检验了。
第一层,看看它能不能恢复常规测量指标。毕竟DXA在临床上的核心价值就是测脂肪、瘦体重和骨密度。实验结果显示,LeDXA的嵌入向量与标准扫描仪输出指标之间的一致性非常高:脂肪量、瘦体重、区域性肥胖指标、内脏脂肪,平均Pearson相关系数r=0.964。在临床诊断最看重的骨密度测量方面,LeDXA对股骨颈、全髋和腰椎L1–L4骨密度的恢复能力显著好于DINOv3(r=0.882对0.789)。这是什么概念?意味着模型光看图像,就能把临床上的关键指标基本复现出来,而且比通用模型做得更精细。
第二层,看它能不能预测年龄和多项生理指标。年龄是检验一个医学影像表征质量非常有效的“探针”,因为衰老会在几乎所有器官系统留下印记。在HPP内部测试集上,LeDXA预测年龄的平均绝对误差(MAE)只有3.53年(r=0.89),显著好于DINOv3(MAE=4.27年,r=0.84)和基于扫描仪数值的传统表格基线(MAE=5.12年,r=0.76)。在外部UK Biobank(UKBB)队列上效果同样惊艳:r=0.88,MAE=2.90年。
除了年龄,LeDXA还能预测横跨八个生理系统的指标:肾功能指标肌酐(r=0.73)、血液系统指标血红蛋白(r=0.68)、血脂指标高密度脂蛋白胆固醇(r=0.57)、呼吸系统指标呼吸暂停低通气指数(AHI,r=0.54)、心血管指标心率(r=0.43)、肝脏指标肝脂肪(r=0.42)、血糖指标葡萄糖(r=0.35)、炎症指标白细胞计数(r=0.31)。在全部八个指标上,LeDXA都超过了DINOv3,在五个指标上超过了传统扫描仪数值基线。一张骨密度扫描,同时预测肾功能和睡眠呼吸暂停风险?这放在几年前是很不可思议的事情。
第三层,直接上疾病预测。在HPP队列中评估了37种自我报告的慢性病,在UKBB队列中评估了28种ICD-10编码的疾病(ICD-10,即国际疾病分类第十次修订版)。每个模型都加入年龄、性别、BMI做协变量。结果相当有戏剧性:
与DXA表格基线相比,LeDXA在HPP的37种疾病中赢了12种(32%),在UKBB的28种疾病中赢了9种(32%),横跨代谢、肌肉骨骼、血液、呼吸和睡眠相关疾病,输的只有一个(HPP中的头痛和UKBB中的甲状腺功能减退)。与DINOv3相比,LeDXA在HPP中赢了12种(32%),在UKBB中赢了13种(46%)。在那些两个队列中都有诊断的疾病里,LeDXA相对传统基线的提升出现在糖尿病(HPP AUROC +0.070,UKBB +0.010)和骨关节炎(HPP +0.026,UKBB +0.018)上,更值得注意的是焦虑(HPP +0.013,UKBB +0.026)、甲状腺功能亢进(HPP +0.019,UKBB +0.013)和贫血(HPP +0.010,UKBB +0.017)这些通常被认为和身体组成无关的系统性疾病。
真正的重头戏是纵向随访的突发疾病预测(Incident Disease Prediction)。在UKBB中位随访4.3年的数据上,LeDXA在20种疾病终点中有9种显著优于DXA表格基线。提升最大的两个终点全是关节疾病:髋关节骨关节炎的C-index从0.633飙升到0.758(+0.125),膝关节骨关节炎从0.677提升到0.744(+0.067)。这个幅度在疾病预测的文献里相当惊人。二型糖尿病的C-index从0.721提升到0.753(+0.032),此外COPD、甲状腺功能减退、缺血性心脏病也有小幅但显著的提升。在骨质疏松这个终点上,LeDXA和传统基线打平——这完全在预料之中,因为骨密度本身就是骨质疏松的确诊标准,扫描仪直接测得的BMD已经是这个任务的“标准答案”,图像模型能恢复到同样水平已经说明问题。
给你们看最直观的一张图,髋关节骨关节炎的预测结果:
排名准确性还不能完全说明临床价值。换个角度:如果医生用LeDXA在基线时把人群按风险分成四等份,最高风险那四分之一人里,能捞到多少未来的病人?结果相当亮眼:对于髋关节骨关节炎,第1年LeDXA分组捕获了75%的突发新病例,传统基线只有43%;到随访结束,差距依然保持在66%对41%。这意味着,如果按照LeDXA的风险分层去安排筛查或干预资源,效率几乎翻倍。二型糖尿病方面,第1年59%对41%,随访结束时62%对52%,同样有显著优势。
生物年龄时钟:从DXA图像读取衰老速度
既然LeDXA预测年龄这么准,那预测结果与真实年龄之间的差值就成了一件有趣的“副产品”。把预测年龄对实足年龄和实足年龄的平方做回归,剩下的残差就是生物年龄差(Biological-Age Gap)。残差为正,说明你的DXA图像看起来比同龄人老;残差为负,说明你的身体在影像上比同龄人年轻。
第一件事,检验这个生物年龄差有没有实际的临床意义。在UKBB队列中,把年龄差最高的四分之一(Q4,看起来最老)和最低的四分之一(Q1,看起来最年轻)作对比。结果显示男性和女性呈现不同的衰老模式:女性看起来老,主要是骨密度和骨矿物质含量全面下降,内脏脂肪有轻微增加;男性看起来老,则表现为全身瘦体重下降和广泛的骨骼密度降低(手臂、腿部、股骨位点),但腰椎骨密度反而“升高”了——这是DXA影像中一个已知的伪影现象:年长男性的腰椎退行性变化、主动脉钙化和椎体骨折会虚假地抬高L1–L4的测量值。
第二个问题是:生物年龄差能不能预测死亡风险?答案是肯定的。按年龄差四分位分组后,全因死亡率的Kaplan-Meier曲线显示,Q4组(看起来最老的那组)相比Q1组(看起来最年轻的那组)死亡风险高出45%。这个数字是校正了实足年龄、性别和BMI之后的结果。换句话说:两个同龄、同性别的两个人,DXA影像上看起来更老的那个人,未来几年的死亡风险确实更高。
更关键的是,生物年龄差似乎是可以被“逆转”的。研究中发现,女性在开始激素替代疗法(HRT,Hormone Replacement Therapy)之后,生物年龄差平均缩小了0.28岁(n=1,687对配对样本,p=0.006)。这个发现很有价值——它提示DXA图像里反映的衰老信号,有一定可干预性,而不是完全由基因决定的宿命。
遗传密码:嵌入表征与已知基因位点的对齐
如果LeDXA学习到的表征真的反映了生理状态,那它应该和基因存在关联。为了验证这一点,研究团队在UKBB数据上对LeDXA嵌入向量的前20个主成分(Principal Components,PCs)做了全基因组关联分析(Genome-Wide Association Study,GWAS)。
GWAS的操作逻辑并不复杂:把每个人的某个特征(这里就是LeDXA嵌入的第i个主成分值)对全基因组几百万个单核苷酸多态性(SNP,Single-Nucleotide Polymorphism,即基因组上单个碱基的变异)逐个做关联检验,找到与特征显著相关的基因位点。这里的难点在于,表型本身的质量决定了GWAS能不能找到真实的遗传信号。
结果相当震撼。LeDXA的嵌入主成分GWAS恢复了一大批已知的身体组成和骨骼生长相关基因位点:脂肪分布领域最经典的FTO基因(rs1421085,p<1e-11)、COBLL1(rs10195252,p<1e-12)、CCDC92/DNAH10位点(rs4765127,p<1e-10);骨密度领域有CPED1-WNT16区域(rs2707466,p<1e-9)、FAM3C信号(rs917727,p<1e-16)、RSPO3(rs1892172,p<1e-11)等。
数量层面的对比更有冲击力:LeDXA与手工设计的表格特征共享187个全基因组显著SNP,而DINOv3只有36个。LeDXA还发现了65个在任何表格特征或DINOv3嵌入GWAS中均未达到全基因组显著性的SNP,经过LD聚类去重后,有18个完全独立的loci只存在于LeDXA的嵌入空间中。这些位点分布在身体组成、骨骼、身高等多个器官系统。
SNP遗传力(SNP Heritability,即由常见遗传变异解释的表型方差比例)上,LeDXA嵌入的20个主成分平均h²=0.143,显著高于DINOv3的0.098(P=0.025)。相比手工标注的表格特征平均h²=0.345,LeDXA已经达到了约四成的遗传力水平——而且它从未直接接触过任何基因数据,只是从无标注的DXA图像中自学出来的!这种遗传对齐程度,说明LeDXA的表征不仅仅是图像的某种数学抽象,而是真实反映了身体组成的生物学底层结构。
从科研到临床:DXA影像的未开发价值
综合来看,LeDXA这篇工作最大的价值,在于它把一种几乎没有被重视的医学影像资源——DXA扫描中的空间结构信息——变成了一种系统性的健康信号来源。全局的疾病预测、突发事件的生存风险分层、生物学年龄估计、遗传信号恢复,四项结果交叉验证,互相印证了这种信号的真实性。
但龙哥需要客观地说几句:这项研究离直接进医院做筛查还有距离。首先,预训练数据来自以色列的HPP队列,外部验证虽然做到了UKBB,但两个队列的DXA扫描仪型号、操作规范、人群特征差异都客观存在,不同品牌、不同型号DXA设备的图像分布差异还没有充分评估。其次,HPP中的疾病是自我报告的,UKBB中用的是ICD-10编码而非金标准结构化诊断,这种标签噪声对模型性能评估会产生影响。第三,生物年龄差和HRT的关联分析是观察性研究,存在混杂因素的可能。不过,在现阶段研究质量普遍注水的背景下,本文的综合实验密度和信息量确实堪称扎实。
从实际落地的角度,LeDXA的轻量化优势非常明显:2,200万参数意味着不需要昂贵的GPU服务器,常规医学影像科室的普通工作站就能运行;代码以MIT许可证开源,模型权重、推理流程都公开了,复现门槛比较低。这意味着它有机会作为DXA扫描仪的附加软件功能,以极低成本嵌入现有的检查流程。医生在拿到一份骨密度报告的同时,封面还附带一栏预测风险摘要:糖尿病风险、髋关节骨关节炎风险、生物年龄差、肌少症风险。检查流程不变、辐射剂量不增加、额外成本接近零,但信息的价值密度大幅提升。
这项工作是医学影像AI领域“质量优先于数量”的一个很好的例证——在专业领域数据规模有限的时候,放弃对大模型的执念,通过偏置正确的方法让“小模型”充分发挥领域数据价值。对于正在做医学影像的朋友们,这篇论文值得花时间细读。
龙迷三问
这篇论文到底在解决什么问题? 魏茨曼研究所联合LeCun等提出LeDXA,用JEPA自监督架构从1.1万张无标注DXA扫描学习全身健康表征,在4.7万张外部队列上验证,疾病预测和生物年龄评估均超越传统指标与8.6亿参数DINOv3,髋关节炎风险预测提升12.5
这篇工作最值得看的点是什么? LeDXA在内部和外部队列中均优于DXA表格基线和DINOv3。在年龄预测上MAE=3.53年(r=0.89),显著优于表格基线(MAE=5.12年)和DINOv3(MAE=4.27年)。在8个生理标志物预测中全部优于DINOv3。在疾病分类中,32%的HPP条件和32%的UKBB终点优于表格基线。在纵向预测中,髋关节和膝关节骨关节炎的C-index提升最大(ΔC=+0.125和+0.067)。
这篇工作的边界或风险在哪里? 优点:(1) 提出了一种在相对小规模医学影像数据集上从头训练视觉基础模型的有效方法,避免了依赖大规模互联网数据;(2) 通过JEPA框架学习潜在空间表征而非像素重建,有效捕捉了全身系统性健康信息;(3) 在多个下游任务(疾病预测、生物年龄、遗传关联)中均展现出优于通用模型和传统表格特征的优势;(4) 模型紧凑(21.7M参数),计算效率高。缺点:(1) 仅在DXA影像上验证,泛化性到其他医学影像模态未知;(2) 两个队列均存在健康志愿者选择偏倚,可能不适用于一般临床人群;(3) 未按祖先群体分别评估性能;(4) 纵向随访时间有限(中位4.3年),长期预测能力需进一步验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
基于LeJEPA框架训练一个紧凑的ViT-Small/16自监督视觉基础模型LeDXA,直接在原始双能X射线吸收测定法(DXA)图像上学习全身健康表征,通过预测潜在空间中的目标模式而非重建像素来捕捉系统性的解剖结构信息。
实验合理度: ★★★★☆
Pearson相关系数(r)、平均绝对误差(MAE)、AUROC、C-index(一致性指数)、SNP遗传力(h²)、风险比(HR)
学术研究价值: ★★★★☆
基于LeJEPA框架训练一个紧凑的ViT-Small/16自监督视觉基础模型LeDXA,直接在原始双能X射线吸收测定法(DXA)图像上学习全身健康表征,通过预测潜在空间中的目标模式而非重建像素来捕捉系。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在单个NVIDIA L40S GPU上训练约10小时完成400个epoch,batch size为256。模型参数量21.7M,远小于DINOv3的约860M参数。
复现难度: ★★★☆☆
https://github.com/GilSasson1/LeDXA
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。
主要参考文献
[1] Sasson G, Levine Z, Shilo S, et al. Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability[J]. arXiv preprint arXiv:2608.02208, 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!