← 返回 PaperDaily 大模型与智能体

告别41bp短窗口!Melody解锁甲基化预测新高度

DNA甲基化被誉为“基因组的第二张名片”,但它如何被DNA序列决定,学界一直没完全搞清。Nature Communications刚发表一篇论文:给模型10kb碱基序列,它就能在39种人类组织里精准预测甲基化状态,还顺手把基因变异对甲基化的影响也预测了。这活儿干得漂亮,值得细读!

告别41bp短窗口!Melody解锁甲基化预测新高度
原论文信息如下:
论文标题:
Decoding the sequence determinants of locus-specific DNA methylation across human tissues
发表日期: 2026年8月17日(在线发表)
发表单位: 山东大学、中国科学院自动化研究所、澳门理工大学、天津大学、电子科技大学等
原文链接: https://doi.org/10.1038/s41467-026-76744-5
项目链接: https://inner.wei-group.net/Melody/

如果把人类基因组比作一部长达30亿字母的剧本,那DNA甲基化就像是导演在剧本上做的批注:哪些段落要高声朗读,哪些段落要悄悄跳过,都由这些批注说了算。这种批注一旦写错地方,癌症、神经系统疾病、代谢紊乱就可能找上门来。问题在于,导演到底根据什么来写批注?或者说,DNA序列本身,是不是已经藏着足够多的线索,让我们仅凭字母排列就能预测批注的位置?

过去几年,不少研究者尝试用深度学习来回答这个问题。DeepCpG、CPGenie、iDNA-ABT、INTERACT等模型接连登场,但它们大多只盯着41bp到2kb的短序列窗口,训练数据也只覆盖少数细胞系。结果就是:换一个没见过的组织,预测精度就崩盘。更尴尬的是,甲基化数量性状位点(meQTL)——也就是那些能改变甲基化水平的遗传变异——连一个标准化的评测基准都没有,各家模型各说各话,谁也不知道谁真的行。

本论文提出的Melody(Methylation Learning On DNA)框架,就是想一次性把这些陈年旧账算清楚。它把输入窗口从几百bp直接拉到10kb,用全卷积编码器-解码器结构捕捉局部和远端序列特征,同时靠多任务学习让模型兼顾单碱基甲基化水平、100bp区域平均甲基化水平和CpG密度。更妙的是,Melody还设计了三个变体,分别应对单组织预测、跨组织共享建模,以及“从未见过的细胞类型”的泛化预测。这套组合拳打下来,效果如何?咱们接着看。

先看整体设计。Melody的核心骨架是一个一维U-Net,这种对称的编码器-解码器结构配合跳跃连接,既能整合长程上下文,又能保留碱基级别的局部信息。输入是一段10,000bp的参考基因组序列,经过one-hot编码后送入网络,最终输出每个CpG位点的甲基化概率。除了主任务,模型还额外预测每个100bp窗口的平均甲基化水平和CpG计数——这两个辅助任务就像副驾驶,一个帮模型把握区域甲基化的大盘,一个帮模型锁定CpG岛的分布,让训练过程更稳,预测也更准。

从10kb序列解码DNA甲基化:Melody框架的突破

Figure 1

图1 Melody框架总体结构与工作流程。(A)Melody以10kb DNA序列为输入,利用由卷积层构成的编码器-解码器捕获DNA特征,并通过多任务预测头联合学习单碱基分辨率的甲基化水平、每100bp平均甲基化水平以及每100bp CpG计数。(B)Melody包含Melody-ST、Melody-MT和Melody-G三种变体,分别针对不同任务场景进行优化。

三个变体的分工很有意思。Melody-ST是单通道模式,一次只训练一种细胞类型,相当于给每个组织配一个专属模型,擅长捕捉局部调控特征。Melody-MT则是多通道模式,同时学习39种组织的甲基化图谱,让不同组织共享同一个骨干网络,只在输出通道上区分彼此,适合需要跨组织泛化的任务。Melody-G更激进,它在序列之外还接入了单细胞RNA测序数据的嵌入向量,用特征级线性调制(FiLM)的方式把细胞身份信息“调制”进序列特征里,从而推断那些压根没出现在训练集里的细胞类型的甲基化状态——这相当于让模型不光会读剧本,还能根据演员阵容猜导演的批注风格。

在具体实现上,Melody的编码器由多个卷积块堆叠而成,每个卷积块包含卷积层、批归一化和ReLU激活,并采用下采样逐步扩大感受野。解码器则通过上采样逐步恢复分辨率,并通过跳跃连接将编码器对应层的特征拼接进来,确保碱基级别的细节不丢失。这种设计让模型既能“看远”——捕捉10kb范围内的远端调控元件,又能“看细”——保留单个CpG位点附近的序列模式。多任务预测头则从解码器的特征图中分别引出三条分支:一条输出每个CpG位点的甲基化概率,一条输出每个100bp窗口的平均甲基化水平,还有一条输出每个100bp窗口的CpG计数。三条分支共享底层的序列表征,但各自有独立的输出层,训练时总损失为三个任务的加权和。

训练数据的规模也是Melody的一大优势。论文收集了来自39种人类组织的全基因组亚硫酸盐测序(WGBS)数据,覆盖了从大脑、心脏、肝脏到血液、皮肤、肌肉等主要器官和细胞类型。每个组织的甲基化谱都以单碱基分辨率存储,训练时随机采样10kb窗口,并保证窗口内至少包含一个CpG位点。为了公平评估,论文设计了三种数据划分方式:染色体划分(训练集和测试集使用不同的染色体)、低甲基化样本划分(将甲基化水平较低的样本单独划出)以及细胞类型特异区域划分(将各组织特异的调控区域单独划出)。这三种划分方式从不同角度检验模型的泛化能力,避免模型通过记忆染色体编号或样本来源来“作弊”。

DNA甲基化是基因组上最常见的表观遗传修饰之一,它不改变碱基字母本身,却能在不改变序列的情况下改变基因的“读音”。在人类基因组中,甲基化通常发生在CpG二核苷酸的胞嘧啶上。所谓CpG,就是DNA序列中胞嘧啶(C)后面紧跟一个鸟嘌呤(G)的位置,字母“p”代表中间的磷酸二酯键。这些位点如同散布在基因组上的开关,它们的甲基化状态直接关联基因表达、转座子沉默和基因组稳定性。
过去十几年,研究者一直试图从DNA序列本身出发,预测哪些CpG位点会被甲基化。早期的DeepCpG、CPGenie采用两层卷积网络,输入窗口只有几十个碱基;iDNA-ABT引入了Transformer和预训练架构,但窗口仍然停留在41bp;INTERACT把卷积和Transformer结合起来,也只在局部上下文里打转。不是说这些工作不重要,而是它们被输入窗口“锁死”了——41bp能看到的,只有局部的序列拼图,根本装不下甲基化调控所需的远端增强子、CpG岛边界等长程信息。
本论文提出的Melody(Methylation Learning On DNA)把输入窗口直接拉到10kb,采用全卷积的编码器-解码器骨干网络。10kb是什么概念?大约等于一个典型基因的长度,足以把局部序列特征和远端调控信号装进同一张“全景图”。更重要的是,Melody没有把甲基化预测当作单一任务来做:除了预测每个CpG位点的甲基化水平,它同时让模型预测每个100bp窗口的平均甲基化水平和CpG密度。这两个辅助任务相当于给模型装上了“区域感知”的副驾驶,帮助主任务在全局上下文中做决策。整个网络在39种人类组织的全基因组甲基化图谱上训练,最终输出连续的甲基化概率值,而不是简单的“甲基化/非甲基化”二分类。
Figure 2
与现有最优方法的性能对比。每个点代表一个数据集(n=39)。(A–B) 多种数据划分(染色体划分、低甲基化样本划分的验证/测试集以及细胞类型特异区域)下的性能比较;(C) 染色体水平的Pearson相关与MSE对比;(D–E) ROC与精确率-召回率曲线对比;(F) 不同甲基化状态下的MSE对比;(G) 七种代表性细胞类型在验证和测试染色体上的AUC;(H–J) 输入序列长度、损失权重和辅助任务权重的消融分析。
在性能对比中,Melody-MT在染色体划分的测试集上,平均AUC达到0.91以上,而DeepCpG和iDNA-ABT等基线模型的AUC普遍在0.85以下。在低甲基化样本划分的测试集上,Melody-ST的AUC比Melody-MT高出约2个百分点,说明单通道模型在捕捉细胞类型特异的低甲基化区域时确实有优势。但在全染色体水平上,Melody-MT的Pearson相关和MSE均优于Melody-ST,表明多任务共享学习能提升整体预测的稳定性。消融实验也证实了10kb窗口的必要性:当输入窗口从10kb缩短到2kb时,AUC下降约3%;缩短到500bp时,AUC下降超过8%。辅助任务同样重要,去掉100bp平均甲基化预测任务后,单碱基预测的MSE上升了约5%。

三种变体设计:如何实现跨组织与跨细胞类型的精准预测

有了统一的骨干网络,如何应对不同任务场景?Melody给出了三个变体:Melody-ST(单通道)Melody-MT(多通道)Melody-G(泛化版)
Melody-ST一次只针对一种细胞类型训练,相当于给每个组织配备专属“私人定制”模型,在细胞类型特异的调控区域表现最稳。Melody-MT则把39种组织的甲基化图谱塞进同一个多任务网络,共享跨组织的序列调控规律,只在输出层分出不同通道,更适合需要跨组织共享信息的场景。有趣的是,MT模型在全染色体水平上整体更准,而ST模型在细胞类型特异的低甲基化区域反而更占优,这与过去一些研究的观察一致——共享特征有时会牺牲掉细胞类型特有的分辨率。
Melody-G是三者中最大胆的设计。它的目标不是预测已知组织的甲基化,而是推断训练集中从未出现过的细胞类型。为了实现这个目标,Melody-G把单细胞RNA测序数据经过预训练基础模型得到的细胞嵌入(cell embedding)作为条件信息,注入到序列特征中。融合方式采用特征级线性调制(FiLM,Feature-wise Linear Modulation)。简单来说,细胞嵌入先经过一层线性变换和ReLU激活得到中间向量h:
公式 h = ReLU(e_cell W1 + b1)
其中e_cell是细胞嵌入向量,W1和b1是可学习的权重和偏置。再通过第二层线性变换生成缩放系数γ和偏移系数β:
公式 γ = h W2 + b2
最后把序列特征x按通道进行缩放和偏移:
公式 x_modulated = x ⊙ (1 + s′) + β′
这样一来,模型的序列理解能力保持不变,但每一层特征都根据细胞身份动态调整,相当于让同一个“读谱”网络在不同细胞类型里切换“看谱”的角度。Melody-G还采用了两阶段训练策略:第一阶段(G1)用已见细胞类型的整条染色体训练;第二阶段(G2)用细胞类型特异区域微调,让模型更聚焦于区分不同细胞类型的关键调控位点。
在Melody-G的训练过程中,细胞嵌入来自一个预训练的单细胞基础模型,该模型在大量人类单细胞RNA测序数据上学习得到,能够将每个细胞类型映射到一个高维向量空间。这个向量空间中的距离反映了细胞类型之间的转录组相似性。Melody-G利用这种相似性,让模型在推断未知细胞类型时,能够参考与其转录组最接近的已知细胞类型的甲基化模式。例如,当需要预测胰腺Delta细胞的甲基化状态时,模型会重点关注与Delta细胞转录组相似的已知细胞类型(如胰腺Alpha细胞和Beta细胞)的甲基化特征,并据此调整序列解读方式。

meQTL预测新标杆:Melody如何捕获等位基因特异性调控逻辑

如果说前面几轮比拼还只是“照着地图画图”,那接下来这个任务就是“拿着放大镜找不同”。meQTL(methylation quantitative trait locus,甲基化数量性状位点)指的是基因组中某些遗传变异与DNA甲基化水平相关的位点。一个碱基的差异,有时就能改变某个转录因子结合位点的强弱,进而撬动局部甲基化状态,影响疾病风险。预测这种“单碱基变异→甲基化改变”的效应,是功能基因组学里极具挑战的问题。
因为此前没有标准化的深度学习基准,Melody论文一口气构建了三个独立评测资源:Ólafur等人、GTEx(基因型-组织表达项目)和EPIGEN,覆盖13个数据集。评估方式很直接:对于每个meQTL,把参考序列和变异序列分别输入模型,得到两个预测甲基化谱,二者差异就是模型预测的“变异效应”;再与真实观测到的甲基化差异计算Pearson相关。
结果相当亮眼:在血液来源的数据集中,Melody-MT的Pearson相关达到0.62(MDS)和0.42(GTEx Whole Blood),在大跨度距离窗口上全面压制基线方法。而用41bp短窗口的iDNA-ABT几乎和随机猜测差不多,再次说明短窗口注定抓不住远端的调控线索。更值得注意的是,Melody-MT在meQTL预测上反超了Melody-ST,尽管后者在细胞类型特异区域更准。论文给出的解释也很合理:多通道架构迫使模型学习共享的调控“语法”,这种语法对变异效应预测更关键;而单通道模型的优势可能来自对局部模式的过拟合。
Figure 3
图3:Melody在meQTL效应预测上准确率较高,且能识别有生物学意义的序列基序。(A,B) 使用Melody-MT对代表性meQTL样本进行计算机模拟饱和突变,展示SNP前后预测的甲基化谱变化;(C) 使用不同细胞类型特异通道(单通道vs相关通道平均)时的meQTL预测性能;(D) Melody-MT与Melody-ST在meQTL预测上的对比;(E) 在不同变异–CpG距离窗口下与其他模型的对比;(F,G) MDS和GTEx Whole Blood数据集中预测与观测甲基化差异的散点图;(H) meQTL预测跨细胞类型验证的热力图;(I) 训练步数与meQTL预测性能的关系。
进一步分析发现,Melody-MT在距离变异位点1kb以内的CpG上预测效果最好,Pearson相关可达0.7以上;当距离扩大到5kb时,相关降至0.4左右;超过10kb后,相关进一步衰减到0.2以下。这一趋势与生物学直觉一致——顺式调控效应通常随距离衰减。但即便如此,Melody-MT在10kb距离上的表现仍优于其他基线模型在1kb距离上的表现,说明10kb窗口确实为模型提供了更丰富的远端调控线索。此外,论文还发现,当meQTL位于转录因子结合基序内部时,Melody-MT的预测准确率显著高于位于基因间区的meQTL,这表明模型确实学到了转录因子结合与甲基化调控之间的关联。

基序扰动分析:揭示组织特异性甲基化调控网络

模型能预测还不够,一个好模型还得会“解释自己”。论文设计了一套以基序为中心的等位基因扰动分析:从数据库里挑了282个已知转录因子基序,每个基序随机抽取一个代表性实例,插到包含至少4个CpG位点的基因组区域上下游600bp处,然后比较插入前后预测甲基化水平的差异,把这个差值定义为“基序效应”。
分析结果有很多值得玩味的细节。CTCF(CCCTC结合因子,一种关键的绝缘子蛋白)基序展现出锯齿状振荡的效应曲线,很像核小体排布的模式,这正好和学界已知的CTCF-核小体相互作用吻合;SPI和IRF2在血液来源细胞里信号最强;HD/10在肝脏和胰腺里更明显。论文还按染色质状态(启动子、增强子、转录区、抑制区、异染色质)对基序效应做了分类汇总,发现启动子区域的效应幅度最大,但抑制区展现出意料之外的强而一致的效应——这提醒我们,不同染色质环境下基序对甲基化的调控逻辑可能远比想象中复杂。
Figure 4
图4:Melody绘制跨组织的基序驱动甲基化变异图谱。(A) 基序中心等位基因扰动流程示意;(B) 282个转录因子基序的效应强度与组织特异性散点图;(C) 不同染色质状态下基序甲基化效应的分布小提琴图;(D) 代表性基序(ZNF85、HD/10、SPI、IRF2、CTCF)在六种组织中的位置效应谱;(E) 基序×组织甲基化效应热图。
基序扰动分析还揭示了一些此前未被充分关注的调控因子。例如,ZNF85基序在大多数组织中表现出较强的去甲基化效应,但在睾丸组织中却呈现甲基化增强效应,提示同一转录因子在不同组织中的功能可能截然不同。HD/10基序(一种与组蛋白去乙酰化相关的基序)在肝脏和胰腺中表现出强烈的甲基化增强效应,这与已知的HDAC在代谢器官中调控基因沉默的功能一致。这些发现不仅验证了Melody学到的调控逻辑与实验生物学知识相符,还为研究者提供了新的候选调控因子,值得后续实验验证。

scRNA-seq嵌入驱动的泛化:从已知到未知细胞类型

如果Melody只能预测已有甲基化图谱的组织,那它和常规模型差别不大。真正的亮点在于跨细胞泛化实验:论文专门留出5种细胞类型——主动脉内皮、血液粒细胞、血液单核细胞、皮层神经元、胰腺Delta细胞——作为“从未见过”的测试集,只用其余34种细胞类型训练。作为对照,用34种已见细胞类型的平均甲基化谱当作基线。
结果显示,Melody-G的两阶段模型平均AUC分别达到0.663(G1)和0.697(G2),比MT-mean基线(0.633)提升了4.7%和10.1%。换句话说,只要给一段单细胞转录组的“自我介绍”,Melody-G就能猜出这个细胞类型大致应该具备哪些甲基化特征。当然,这也需要付出代价:在已见过的34种细胞上,Melody-G的表现比专门的单细胞模型略有下降。这种“泛化能力强,专用精度降”的权衡完全符合预期——你不可能既要一个模型什么都懂,又要它在每个细分领域都拿第一。
更惊艳的是,Melody-G还能做计算机模拟基因敲除:把某个基因的scRNA-seq嵌入抹掉,再观察模型预测的甲基化谱变化,以此评估该基因对甲基化的“影响力”。对胰腺Delta细胞做这样一番操作后,筛选出的代表性基因富集到类风湿关节炎等通路,比如CTSL和CSF1——这两个基因确实在类风湿滑膜成纤维细胞中有研究报道。这说明Melody-G学到的细胞状态与疾病生物学之间存在真实关联。
Figure 5
图5:scRNA-seq嵌入驱动的Melody-G性能分析。(A) Melody-G两个训练阶段(G1、G2)与MT-mean基线的性能对比;(B) 已见细胞类型上不同方法在染色体/样本/测试集三种划分下的AUC分布;(C) 代表性位点上Melody-G预测谱与真实谱的对比;(D) 按影响分数排序的基因功能注释;(E) 高变基因影响分数直方图;(F) 不同scRNA-seq嵌入融合策略的性能对比。
在跨细胞泛化实验中,Melody-G对皮层神经元的预测AUC最高(0.72),对血液单核细胞的预测AUC最低(0.65)。这一差异可能与细胞类型的转录组复杂度有关:神经元的基因表达模式高度特异,单细胞嵌入能提供更清晰的区分信号;而血液单核细胞与其他血液细胞类型在转录组上较为相似,嵌入向量的区分度相对较低。论文还尝试了不同的细胞嵌入融合策略,包括简单的拼接(concat)和FiLM调制,结果显示FiLM调制在未知细胞类型上的AUC比拼接高出约3%,说明条件调制的方式比简单的特征拼接更有利于泛化。

从序列到表观基因组:Melody的局限与未来方向

夸了这么多,也该聊聊边界了。Melody尽管能处理10kb的序列窗口,但表观基因组的调控并不只靠线性序列。染色质三维结构、拓扑关联域、启动子-增强子环等远距离物理接触,都会影响甲基化状态——这些信息无法仅从10kb线性序列中读出。所以论文也坦承,随着变异到CpG位点距离增大,所有模型的预测性能都在下滑,远端meQTL是纯粹的序列建模几乎无力征服的领域。
此外,卵巢等部分组织的预测表现不理想,论文推测可能是数据质量问题或这类组织中特异基序在现有meQTL数据集中表示不足。模型输出的“基序效应”本质上是关联分析,并不能直接当成因果证据。未来方向也很清晰:把染色质构象数据和单细胞甲基化组纳入训练,让模型从“读序列”进化到“读三维基因组”;把Melody扩展到更多物种和疾病队列,才能真正在癌症早筛、生物学年龄估计这类临床应用里站稳脚跟。
另一个值得注意的局限是,Melody目前只处理人类基因组数据,其预训练的单细胞基础模型也是基于人类细胞训练的。要推广到小鼠、斑马鱼等模式生物,需要重新收集相应物种的甲基化图谱和单细胞转录组数据,并微调模型。不过,由于Melody的核心架构不依赖物种特异的特征,迁移学习的成本相对可控。论文作者在项目主页上提供了在线预测服务,研究者可以上传自己的序列和细胞类型,快速获得甲基化预测结果,这为领域内的实验设计提供了便利。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?DNA甲基化与疾病、衰老密切相关,但其组织特异性的序列规则始终成谜。
这篇工作最值得看的点是什么?Melody-MT在39个数据集上平均Spearman相关系数达0.723(采样测试集)和0.645(测试染色体),优于最强基线(0.590和0.584)。Melody-MT达到最高AUC(0.921)和AP(0.975)。在meQTL预测中,Melody在血液数据集上达到0.62和0.42的Pearson相关系数。
这篇工作的边界或风险在哪里?优点:1)采用10kb长序列窗口,捕获远端调控信息;2)多任务学习策略增强模型泛化能力;3)三种变体覆盖不同应用场景;4)通过scRNA-seq嵌入实现未见细胞类型预测。缺点:1)序列-only框架无法完全捕获所有甲基化变异来源;2)可解释性分析为模型关联而非因果证据;3)对未见细胞类型的泛化受限于参考数据质量。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出Melody框架,基于1D U-Net架构,从10kb基因组序列预测碱基分辨率DNA甲基化水平,通过多任务学习整合局部与长程序列信号,并利用scRNA-seq基础模型嵌入实现未见细胞类型的甲基化推断。

实验合理度:★★★★☆

Spearman相关系数、Pearson相关系数、AUC、平均精度(AP)、均方误差(MSE)、平均绝对误差(MAE)。

学术研究价值:★★★★☆

提出Melody框架,基于1D U-Net架构,从10kb基因组序列预测碱基分辨率DNA甲基化水平,通过多任务学习整合局部与长程序列信号,并利用scRNA-seq基础模型嵌入实现未见细胞类型的甲基化推。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在单个NVIDIA A100 GPU(80GB)上训练约72小时,batch size为32。

复现难度:★★★☆☆

https://github.com/FakeEnd/Melody

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)序列-only框架无法完全捕获所有甲基化变异来源;2)可解释性分析为模型关联而非因果证据;3)对未见细胞类型的泛化受限于参考数据质量。

主要参考文献

[1] Jin, J., Wang, D., Qiao, J. et al. Decoding the sequence determinants of locus-specific DNA methylation across human tissues. Nature Communications (2026). https://doi.org/10.1038/s41467-026-76744-5
[2] Melody Web Server. https://inner.wei-group.net/Melody/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
DNA甲基化的奥秘,光看序列还不够,还要看细胞身份?Melody把10kb序列和单细胞RNA嵌入一起塞进模型,连“没见过”的细胞类型都能推。想第一时间读懂这类AI+生物前沿?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 表观遗传+上海+某高校+小龙),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,AI+生物的小伙伴们,我们在AI医疗群等你!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。