← 返回 PaperDaily 大模型与智能体

基因表达聚类新范式:让数据自己说出疾病故事

基因不是孤军奋战,它们像帮派一样协同作战。如何在不打标签的情况下,让数据自己说出疾病的“内部故事”?昆士兰大学这篇工作,把基因模块玩出了新高度,用混合因子模型在785个样本里无监督找到了9个分子亚型,BIC狂甩传统方法250,000分。

基因表达聚类新范式:让数据自己说出疾病故事
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
基因不是孤军奋战,它们像帮派一样协同作战。如何在不打标签的情况下,让数据自己说出疾病的“内部故事”?昆士兰大学这篇工作,把基因模块玩出了新高度,用混合因子模型在785个样本里无监督找到了9个分子亚型,BIC狂甩传统方法250,000分。


原论文信息如下:
论文标题:
Module-Structured Mixture Factor Models to Identify Outcome-Specific Signatures in Gene Expression Data
发表日期:
2026年06月
发表单位:
The University of Queensland (昆士兰大学), University of California, Santa Barbara (加州大学圣塔芭芭拉分校)
原文链接:
https://arxiv.org/pdf/2606.16460v1.pdf
开源代码链接:
https://github.com/wujrtudou/structured_MFA.git
封面图片
图2:在数据集中推断的簇特异性模块效应和簇流行度。 (a) 估计的模块级平均效应 α_{k,g} 热图,行对应推断的簇,列对应基因模块。数值表示保留两位小数的估计效应。 (b) 每个推断簇的样本数量。

转录组数据聚类面临哪些挑战?

想象一下,你面前有上万条基因,每条基因在几百个样本中的表达量高高低低,而你想从这些混乱的数字中找到疾病的“帮派”——也就是分子亚型。传统的聚类方法,比如K-means或层次聚类,它们假设基因之间是独立同分布的,这简直是把基因当成了陌生人。但现实世界里的基因可不是独行侠,它们会抱团干活,形成所谓的基因模块(Gene Module):一组基因协同表达,共同调控某个生物通路。忽略这种模块结构,聚类结果就会像没头苍蝇一样,不仅不稳定,还没法解释。
另一方面,用全协方差矩阵来建模基因间的依赖关系?在高维数据(p >> n)下这完全是灾难——参数比样本还多,算都算不动。于是有了混合因子分析(Mixture of Factor Analyzers, MFA),它通过低维隐因子来压缩协方差,但传统的MFA把基因当成可交换的变量,不区分模块,因此漏掉了通路级别的信号。
那么,既要利用模块结构,又要保持统计稳定和计算可行,怎么做?昆士兰大学和加州大学圣塔芭芭拉分校的研究者亮出了他们的武器——模块结构混合因子模型(Module-Structured Mixture Factor Model,MS-MFM)。它把基因模块直接嵌进混合模型的均值和协方差结构里,让数据自己说出疾病的内部故事。

模块结构混合因子模型如何设计?

MS-MFM的核心思路是:把基因表达变异拆成四个层次,像剥洋葱一样层层分明。
首先,给定每个样本属于某个簇(比如疾病亚型),它假设数据是由一个层次生成模型产生的:
层次生成模型
其中,δ 是全局基因基线效应(所有样本共享),Mα_k 是簇 k 在模块级别的偏移(每个模块整体上调或下调),Bf_i 是低维因子驱动的模块内相关性,而 ε_i 是基因特异噪声。
关键设计在于载荷矩阵 B 的结构约束:B = S M U
B矩阵分解
这里 M 是基因‑模块分配矩阵(0/1 布尔矩阵),U 是模块级别的载荷方向(每个模块一个单位向量),S 是基因特异的缩放系数。这样一来,同一模块内的基因共享相同的因子方向,但允许有不同的幅度,既减参又保留了灵活性。
插图
整合掉隐因子后,每个簇的条件分布就是高斯的,均值和协方差都有显式表达式:
条件分布公式
其中 μ_k = δ + Mα_k,Σ = BBᵗ + D。这种结构让协方差矩阵为“共同协方差 + 对角残差”,既避免了全协方差的爆炸参数,又比独立假设更符合生物学实际。

如何通过ECM算法进行参数估计?

参数估计用了期望条件最大化(Expectation‑Conditional Maximization,ECM)算法,它是EM的变种,把M步拆成一系列条件最大化步骤,在高维中更稳定。
E步:给定当前参数,计算每个样本属于每个簇的后验概率(责任)以及隐因子的后验均值和方差。
后验责任公式
隐因子的后验分布由标准因子分析公式给出:
因子后验公式
其中 V = (I_q + BᵗD⁻¹B)⁻¹,m_{ik} = V BᵗD⁻¹(x_i − μ_k)。在模块化参数化下,BᵗD⁻¹B 和 BᵗD⁻¹e 都能被分解成模块级别的求和,计算效率很高。
CM步:依次闭式更新混合比例 π_k、模块级偏移 α_{kg}、全局基因均值 δ_j、基因缩放 s_j、模块载荷方向 u_g(需满足约束 ||u_g||₂=1,通过解 (A_g+λI)u_g=b_g 得到)以及残差方差 ψ_j。所有更新都有解析解或简单的单变量寻根,整体算法开销可控。

模型在自身免疫疾病数据中表现如何?

研究者使用了来自ADEx数据库的公开数据集 GSE45291,包含 785 个样本(493 个类风湿关节炎 RA 样本 + 292 个系统性红斑狼疮 SLE 样本),经过 MAD 筛选留下 979 个高变异基因,并聚成 19 个共表达模块。疾病标签在建模过程中完全不用,属于纯粹的无监督分析。
通过 BIC 选择最优模型配置,结果如下:
图1:BIC选择
图1:在 (K, q) 网格上的 ΔBIC 值。最优点为 K=9(9个簇)且 q=8(8个因子)。
使用这个最优模型,样本被分配到 9 个簇。有意思的事情来了——虽然疾病标签从未让模型看过,但簇的组成却高度与疾病相关:
表1:样本按簇和疾病分布
表1:推断簇中按疾病状态的样本分布。簇1、5、6、7、9 以 RA 为主,簇2、3、4、8 以 SLE 为主。完全分离显示疾病级分子结构自然浮现。
进一步看每个簇的模块级别偏移(α_{k,g})热图,就能发现每个亚型独特的分子指纹。比如,RA 为主的簇(簇5、7)普遍正激活,而 SLE 为主的簇(簇2、3、4、8)总体负抑制,但也有一些交叉模式,比如 RA 簇6呈现“双向重编程”模式(部分模块强负、部分强正)。这些细节以往简单聚类很难捕捉。

与WGCNA相比效果如何?

WGCNA(加权基因共表达网络分析)是生物信息学中广泛使用的模块构建方法。本文对比了基于 MAD+层次聚类(MAD‑HC)与 WGCNA 两种模块构建方法作为输入对模型性能的影响。
表4:MAD-HC vs WGCNA 模块构建比较
表4:模型比较。MAD‑HC 在 BIC 和聚类清晰度上显著优于 WGCNA 版本。
用 WGCNA 模块替换后,模型 BIC 值大幅恶化(差值超过 250,000),簇的疾病分离度也下降。例如,WGCNA 版本下簇分布混杂(见表5),RA 和 SLE 样本未完全分离,而 MAD‑HC 版本能做到纯疾病簇。这说明,模块构建的质量直接影响下游聚类效果。MAD‑HC 基于相关距离的层次聚类在这个数据上比 WGCNA 的拓扑重叠更能捕捉稳定的模块结构。
表5:WGCNA下样本分布
表5:WGCNA 版本下 RA 和 SLE 样本的簇分布,可见多个簇内两种疾病样本混杂,分离度不如本文方法。

该方法有哪些优缺点及未来方向?

优点:MS‑MFM 将基因模块显式嵌入混合因子模型,实现了生物学可解释的方差分解:全局效应、模块偏移、因子相关性、残差噪声。所有更新闭式,计算稳定。无监督地在 RA 和 SLE 上发现了 9 个亚型,疾病分离度高,还能解析模块级别的分子指纹(如哪些模块在哪些亚型上调/下调)。模块构建可以用数据驱动方式(MAD+层次聚类),也兼容先验通路知识,灵活性好。
缺点:模型假设所有簇共享共同的协方差结构(Σ),只通过均值偏移区分簇,这可能不适合协方差也随簇变化的数据。模块构建需要预设模块数量(通过切割阈值),且需要初步筛选基因(MAD),存在一定主观性。目前主要验证在自身免疫疾病上,泛化到其他疾病或平台还需更多测试。
未来方向:可扩展到簇特异协方差结构,或引入稀疏化使模块分配更稳健。作者还提到可以利用通路数据库(如KEGG、Reactome)直接定义模块,提高生物学先验的利用。另外,将模型整合进下游分类器做个性化医疗也是值得探索的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

MS-MFM 与普通 MFA 的核心区别是什么?普通 MFA(混合因子分析)把基因当成独立同分布的变量,载荷矩阵无结构;MS-MFM 强制载荷矩阵在模块级别共享方向(B = S M U),并同时建模模块级别的均值偏移。这使得模型参数大幅减少,且每个模块的生物学意义更明确。

模块构建方法 (MAD+HC) 为什么比 WGCNA 好?文章实验表明,MAD+HC 产生的模块在新数据集上更稳定、模块内一致性更高,且在后续 MS-MFM 建模中 BIC 显著优于 WGCNA 版本。可能原因:MAD+HC 直接用相关系数层次聚类,保留了原始相关结构;而 WGCNA 基于软阈值的拓扑重叠,可能过度平滑了模块边界。

在 RA 和 SLE 数据上,模型发现的亚型是否有临床意义?文章通过 Human Phenotype Ontology(HPO)富集分析验证,不同簇对应的模块显著富集了与免疫、炎症、骨损伤相关的表型术语,例如 SLE 亚型富集“抗核抗体阳性”、“肾炎”,RA 亚型富集“关节肿胀”、“骨侵蚀”。这初步说明亚型与临床表现存在关联。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将因子分析载荷矩阵与模块结构强绑定,同时在均值层面引入模块偏移,思路新颖且实现优雅。但模块定义本身不是创新,组合方式属于中等创新。

实验合理度:★★★★☆

实验设计清晰:先用 BIC 选参,再对比 WGCNA 模块构建,最后做功能注释。对比方法较充分(WGCNA 作为基线),但缺少与其他因子分析变体(如簇特异协方差 MFA)的对比。

学术研究价值:★★★★☆

为高维转录组无监督聚类提供了一种可解释的框架,尤其适合需要模块级解释的生物医学问题。对后续开发模块化混合模型有启发。

稳定性:★★★☆☆

ECM 算法较为成熟,但模块构建步骤(MAD + 层次聚类)的阈值选择和模块数量确定对结果敏感,实际使用时可能需要反复调参。

适应性以及泛化能力:★★★☆☆

目前仅在两个自身免疫疾病数据上验证,且数据量适中(785 样本,979 基因)。对其他组织类型、平台或更大规模数据的泛化性需更多测试。

硬件需求及成本:★★★★☆

ECM 算法时间复杂度约为 O(nGq² + p³) 但利用了模块结构可加速。对 p=979、G=19、q=8 的规模,普通工作站即可运行,但超大规模(p>10000)可能受限。

复现难度:★★★☆☆

代码已在 GitHub 开源(https://github.com/wujrtudou/structured_MFA.git),但未提供完整运行脚本,预处理和数据下载步骤需读者自行完成。模块构建参数需手动复制。

产品化成熟度:★★☆☆☆

当前是研究原型,尚未集成到可交互的生物信息学工具中。如需产品化,需增加用户界面、自动化模块选择、结果可视化等功能。

可能的问题:模型假设各簇共享协方差,但实际中不同亚型的协方差矩阵也可能不同;缺少与其他高级聚类方法(如基于图或深度学习的聚类)的对比;模块构建的鲁棒性分析不够深入。


主要参考文献

[1] McLachlan, G. J., Peel, D. (2000). Finite Mixture Models. Wiley.
[2] McLachlan, G. J., Krishnan, T. (2008). The EM Algorithm and Extensions (2nd ed.). Wiley.
[3] Langfelder, P., Horvath, S. (2008). WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics, 9, 559.
[4] Martorell-Marugán, J., et al. (2021). ADEx: A database for the analysis of autoimmune diseases. Nucleic Acids Research, 49(D1), D1190–D1197.
[5] Cheng, Q., et al. (2024). Molecular subtypes of SLE and RA based on gene modules. Journal of Autoimmunity, 145, 103214.
[6] 原论文: Wu, J., McLachlan, G. J., Pyne, S. (2026). Module-Structured Mixture Factor Models to Identify Outcome-Specific Signatures in Gene Expression Data. arXiv:2606.16460.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
基因模块排排坐,疾病亚型无处躲。想要深挖更多生物信息学里的聚类黑科技?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 生物信息+上海+昆士兰+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。