← 返回 PaperDaily
大模型与智能体
基因表达聚类新范式:让数据自己说出疾病故事
基因不是孤军奋战,它们像帮派一样协同作战。如何在不打标签的情况下,让数据自己说出疾病的“内部故事”?昆士兰大学这篇工作,把基因模块玩出了新高度,用混合因子模型在785个样本里无监督找到了9个分子亚型,BIC狂甩传统方法250,000分。
龙哥读论文
发布于 2026-08-19 00:20:07
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 基因不是孤军奋战,它们像帮派一样协同作战。如何在不打标签的情况下,让数据自己说出疾病的“内部故事”?昆士兰大学这篇工作,把基因模块玩出了新高度,用混合因子模型在785个样本里无监督找到了9个分子亚型,BIC狂甩传统方法250,000分。
原论文信息如下:
转录组数据聚类面临哪些挑战?
想象一下,你面前有上万条基因,每条基因在几百个样本中的表达量高高低低,而你想从这些混乱的数字中找到疾病的“帮派”——也就是分子亚型。传统的聚类方法,比如K-means或层次聚类,它们假设基因之间是独立同分布的,这简直是把基因当成了陌生人。但现实世界里的基因可不是独行侠,它们会抱团干活,形成所谓的基因模块(Gene Module):一组基因协同表达,共同调控某个生物通路。忽略这种模块结构,聚类结果就会像没头苍蝇一样,不仅不稳定,还没法解释。
另一方面,用全协方差矩阵来建模基因间的依赖关系?在高维数据(p >> n)下这完全是灾难——参数比样本还多,算都算不动。于是有了混合因子分析(Mixture of Factor Analyzers, MFA),它通过低维隐因子来压缩协方差,但传统的MFA把基因当成可交换的变量,不区分模块,因此漏掉了通路级别的信号。
那么,既要利用模块结构,又要保持统计稳定和计算可行,怎么做?昆士兰大学和加州大学圣塔芭芭拉分校的研究者亮出了他们的武器——模块结构混合因子模型(Module-Structured Mixture Factor Model,MS-MFM) 。它把基因模块直接嵌进混合模型的均值和协方差结构里,让数据自己说出疾病的内部故事。
模块结构混合因子模型如何设计?
MS-MFM的核心思路是:把基因表达变异拆成四个层次,像剥洋葱一样层层分明。
首先,给定每个样本属于某个簇(比如疾病亚型),它假设数据是由一个层次生成模型产生的:
关键设计在于载荷矩阵 B 的结构约束:B = S M U
如何通过ECM算法进行参数估计?
参数估计用了期望条件最大化(Expectation‑Conditional Maximization,ECM) 算法,它是EM的变种,把M步拆成一系列条件最大化步骤,在高维中更稳定。
E步:给定当前参数,计算每个样本属于每个簇的后验概率(责任)以及隐因子的后验均值和方差。
CM步:依次闭式更新混合比例 π_k、模块级偏移 α_{kg}、全局基因均值 δ_j、基因缩放 s_j、模块载荷方向 u_g(需满足约束 ||u_g||₂=1,通过解 (A_g+λI)u_g=b_g 得到)以及残差方差 ψ_j。所有更新都有解析解或简单的单变量寻根,整体算法开销可控。
模型在自身免疫疾病数据中表现如何?
研究者使用了来自ADEx数据库的公开数据集 GSE45291,包含 785 个样本(493 个类风湿关节炎 RA 样本 + 292 个系统性红斑狼疮 SLE 样本),经过 MAD 筛选留下 979 个高变异基因,并聚成 19 个共表达模块。疾病标签在建模过程中完全不用,属于纯粹的无监督分析。
使用这个最优模型,样本被分配到 9 个簇。有意思的事情来了——虽然疾病标签从未让模型看过,但簇的组成却高度与疾病相关:
进一步看每个簇的模块级别偏移(α_{k,g})热图,就能发现每个亚型独特的分子指纹。比如,RA 为主的簇(簇5、7)普遍正激活,而 SLE 为主的簇(簇2、3、4、8)总体负抑制,但也有一些交叉模式,比如 RA 簇6呈现“双向重编程”模式(部分模块强负、部分强正)。这些细节以往简单聚类很难捕捉。
与WGCNA相比效果如何?
WGCNA(加权基因共表达网络分析)是生物信息学中广泛使用的模块构建方法。本文对比了基于 MAD+层次聚类(MAD‑HC)与 WGCNA 两种模块构建方法作为输入对模型性能的影响。
用 WGCNA 模块替换后,模型 BIC 值大幅恶化(差值超过 250,000),簇的疾病分离度也下降。例如,WGCNA 版本下簇分布混杂(见表5),RA 和 SLE 样本未完全分离,而 MAD‑HC 版本能做到纯疾病簇。这说明,模块构建的质量直接影响下游聚类效果。MAD‑HC 基于相关距离的层次聚类在这个数据上比 WGCNA 的拓扑重叠更能捕捉稳定的模块结构。
该方法有哪些优缺点及未来方向?
优点 :MS‑MFM 将基因模块显式嵌入混合因子模型,实现了生物学可解释的方差分解:全局效应、模块偏移、因子相关性、残差噪声。所有更新闭式,计算稳定。无监督地在 RA 和 SLE 上发现了 9 个亚型,疾病分离度高,还能解析模块级别的分子指纹(如哪些模块在哪些亚型上调/下调)。模块构建可以用数据驱动方式(MAD+层次聚类),也兼容先验通路知识,灵活性好。
缺点 :模型假设所有簇共享共同的协方差结构(Σ),只通过均值偏移区分簇,这可能不适合协方差也随簇变化的数据。模块构建需要预设模块数量(通过切割阈值),且需要初步筛选基因(MAD),存在一定主观性。目前主要验证在自身免疫疾病上,泛化到其他疾病或平台还需更多测试。
未来方向 :可扩展到簇特异协方差结构,或引入稀疏化使模块分配更稳健。作者还提到可以利用通路数据库(如KEGG、Reactome)直接定义模块,提高生物学先验的利用。另外,将模型整合进下游分类器做个性化医疗也是值得探索的方向。
龙迷三问
MS-MFM 与普通 MFA 的核心区别是什么? 普通 MFA(混合因子分析)把基因当成独立同分布的变量,载荷矩阵无结构;MS-MFM 强制载荷矩阵在模块级别共享方向(B = S M U),并同时建模模块级别的均值偏移。这使得模型参数大幅减少,且每个模块的生物学意义更明确。
模块构建方法 (MAD+HC) 为什么比 WGCNA 好? 文章实验表明,MAD+HC 产生的模块在新数据集上更稳定、模块内一致性更高,且在后续 MS-MFM 建模中 BIC 显著优于 WGCNA 版本。可能原因:MAD+HC 直接用相关系数层次聚类,保留了原始相关结构;而 WGCNA 基于软阈值的拓扑重叠,可能过度平滑了模块边界。
在 RA 和 SLE 数据上,模型发现的亚型是否有临床意义? 文章通过 Human Phenotype Ontology(HPO)富集分析验证,不同簇对应的模块显著富集了与免疫、炎症、骨损伤相关的表型术语,例如 SLE 亚型富集“抗核抗体阳性”、“肾炎”,RA 亚型富集“关节肿胀”、“骨侵蚀”。这初步说明亚型与临床表现存在关联。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
将因子分析载荷矩阵与模块结构强绑定,同时在均值层面引入模块偏移,思路新颖且实现优雅。但模块定义本身不是创新,组合方式属于中等创新。
实验合理度: ★★★★☆
实验设计清晰:先用 BIC 选参,再对比 WGCNA 模块构建,最后做功能注释。对比方法较充分(WGCNA 作为基线),但缺少与其他因子分析变体(如簇特异协方差 MFA)的对比。
学术研究价值: ★★★★☆
为高维转录组无监督聚类提供了一种可解释的框架,尤其适合需要模块级解释的生物医学问题。对后续开发模块化混合模型有启发。
稳定性: ★★★☆☆
ECM 算法较为成熟,但模块构建步骤(MAD + 层次聚类)的阈值选择和模块数量确定对结果敏感,实际使用时可能需要反复调参。
适应性以及泛化能力: ★★★☆☆
目前仅在两个自身免疫疾病数据上验证,且数据量适中(785 样本,979 基因)。对其他组织类型、平台或更大规模数据的泛化性需更多测试。
硬件需求及成本: ★★★★☆
ECM 算法时间复杂度约为 O(nGq² + p³) 但利用了模块结构可加速。对 p=979、G=19、q=8 的规模,普通工作站即可运行,但超大规模(p>10000)可能受限。
复现难度: ★★★☆☆
代码已在 GitHub 开源(https://github.com/wujrtudou/structured_MFA.git),但未提供完整运行脚本,预处理和数据下载步骤需读者自行完成。模块构建参数需手动复制。
产品化成熟度: ★★☆☆☆
当前是研究原型,尚未集成到可交互的生物信息学工具中。如需产品化,需增加用户界面、自动化模块选择、结果可视化等功能。
可能的问题: 模型假设各簇共享协方差,但实际中不同亚型的协方差矩阵也可能不同;缺少与其他高级聚类方法(如基于图或深度学习的聚类)的对比;模块构建的鲁棒性分析不够深入。
主要参考文献
[1] McLachlan, G. J., Peel, D. (2000). Finite Mixture Models. Wiley.
[2] McLachlan, G. J., Krishnan, T. (2008). The EM Algorithm and Extensions (2nd ed.). Wiley.
[3] Langfelder, P., Horvath, S. (2008). WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics, 9, 559.
[4] Martorell-Marugán, J., et al. (2021). ADEx: A database for the analysis of autoimmune diseases. Nucleic Acids Research, 49(D1), D1190–D1197.
[5] Cheng, Q., et al. (2024). Molecular subtypes of SLE and RA based on gene modules. Journal of Autoimmunity, 145, 103214.
[6] 原论文: Wu, J., McLachlan, G. J., Pyne, S. (2026). Module-Structured Mixture Factor Models to Identify Outcome-Specific Signatures in Gene Expression Data. arXiv:2606.16460.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
基因模块排排坐,疾病亚型无处躲。想要深挖更多生物信息学里的聚类黑科技?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 生物信息+上海+昆士兰+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群