本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。
方法文章
本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。
本文稿为生物学研究中整合多组学数据提供了全面的分步指南。
多组学数据整合是指将使用不同组学技术(如基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、微生物组学、脂质组学和糖组学)在同一组生物样本上测量得到的数据进行合并与分析的过程。尽管多组学方法的目标与单组块或单组学分析相似(例如描述、区分、分类或预测),但其能够捕获更广泛的分子信息,从而更深入地理解生物系统及其复杂的相互作用。事实上,整合多个组学数据集有助于提高预测准确性,并获得更稳健的结果,尤其是在可用样本数量有限的情况下。此外,得益于机器学习技术的最新进展,当前的多组学分析已能够揭示不同生物分子之间隐藏的模式和复杂的生物学现象。
本研究的主要目的是介绍多组学研究中常用的完整方案,内容涵盖从问题的初步提出到有助于结果生物学解释的各类工具。本文详细描述了多种多组学数据整合方法,包括基于拼接(低层次)、基于转换(中层次)和基于模型(高层次)的方法,并阐述了这些方法的局限性与优势,同时介绍了通用的可视化和诊断工具。
近年来,生物研究领域取得了显著进展,特别是在组学技术方面。这些技术为深入了解生物系统的复杂性提供了宝贵见解。然而,每种组学技术仅能提供关于生物组分的独特视角,因此需要整合多组学数据,以获得全面的理解。
多组学(multi-omics)涵盖了多种生物分子类别,得益于新兴的高通量测序技术,这些分子能够被定量分析。不同的组学技术包括基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学。基因组学研究生物体的基因组,而表观基因组学则关注基因组的支撑结构,包括与DNA结合的蛋白质和RNA、替代性DNA结构以及DNA上的化学修饰。转录组学涵盖所有RNA分子的研究,包括mRNA、rRNA、tRNA以及其他非编码RNA。蛋白质组学涉及对蛋白质的研究,包括特定蛋白质群体所发生的修饰。代谢组学聚焦于生物基质中所有小分子(代谢物)的集合。宏基因组学研究具有特定理化性质的明确生境中的微生物群落。脂质组学涵盖细胞内全部脂质成分的研究,而糖组学则专注于糖组(glycome)的研究,包括碳水化合物和糖类1。
由于多组学数据整合在揭示复杂生物现象方面具有巨大潜力,因此在科学界受到日益关注。通过整合来自多种组学技术的数据,研究人员能够克服单一数据集的局限性,更全面地理解生物系统。这种整合方法有助于发现新的生物标志物、揭示疾病机制以及阐明复杂的生物通路。
术语 "Multiomics" 和 "Multi-omics" 在 PubMed 中的引用数量近年来显著增加,从 2018 年的 307 次增长到 2021 年的 1414 次,再到 2023 年的 3933 次。整合不同类型的组学变量正变得越来越普遍,因为它有助于深入探究疾病和生物体功能障碍背后的机制。单一组学方法仅能提供对潜在生物学的有限且片面的观察,因其局限于单一视角。然而,通过整合多组学数据,我们可以揭示不同生物分子之间的相互作用,理解多个层次之间的关联,并弥合基因型与表型之间的鸿沟。总体而言,多组学方法有助于回答一些重要问题,例如对不同疾病亚型进行分类、预测关键的疾病相关生物标志物,以及更深入地理解生物通路和机制。在接下来的章节中,不同的组学数据集也可被称为数据 "视图" 或数据 "模块"。
根据 Reel 等人(2021)2 和 Ritchie 等人 (2015)3 的描述,多组学整合技术可分为三个主要子类(图 1)。
低层次、早期整合或拼接:该方法涉及将每个单一样本数据集的变量拼接成一个单一矩阵。然而,早期整合未考虑每种组学数据类型的独特分布,可能会对维度较大的某些组学数据类型赋予更高的权重。该方法还存在诸多挑战,例如维度灾难风险增加、噪声增多、变量高度相关以及计算可扩展性问题。尽管存在这些局限性,早期整合仍有助于识别多个组学层面之间的协调变化,并增强生物学解释能力。
中等水平、基于中间整合或转换的方法:该方法将数学整合模型应用于多层组学数据。中间整合侧重于对从各数据源提取的子集或表示形式进行融合。中间整合包含两种子方法:自下而上(middle-up)方法和自上而下(middle-down)方法。自下而上方法通过对每个数据模块进行降维后获得的得分进行串联,适用于处理异质性数据,但可能缺乏可解释性。自上而下方法则涉及局部变量选择,随后对串联后的变量子集进行分析,从而使模型更易于解释。中间整合具有多种优势,如提高信噪比、降低数据维度以及增强统计功效。
高水平、晚期整合或基于模型的方法:该方法涉及在每个单独的组学水平上进行分析,并以临时方式组合结果。它包括融合来自单个模块模型的结果,以识别各数据源的生物标志物,并对结果进行联合解读。晚期整合不会增加输入空间的维度,且能够适应每种组学数据独特的分布特征。当某一组学层次的预测能力优于其他层次时,该方法尤为适用。然而,晚期整合可能忽略跨组学之间的关联,并面临因对初始数据模块间联系理解不足,以及通过独立建模可能导致生物学信息丢失所带来的挑战。
访问受限。请登录或开始试用以查看此内容。
1. 研究问题的定义
2. 组学选择
3. 确保数据质量
注意:确保按照以下步骤生成的组学数据具有可靠性和可重复性。
4. 数据预处理
5. 降维
注意:降维有两种方法:一种是去除噪声和冗余变量(特征选择),另一种是将特征组合以创建更具意义的变量(特征提取)。
6. 积分方法选择
7. 统计分析
8. 生物学解释:
9. 验证与后续实验
10. 可视化与诊断工具
注意:可使用多种类型的图表来展示数据分析结果,以直观呈现关键发现。常用的图表包括火山图、热图、环形图和曼哈顿图。







访问受限。请登录或开始试用以查看此内容。
与单组学分析一样,可视化对于数据探索、数据整合、模式识别、假设生成以及结果交流至关重要。特别是,在数据预处理阶段,对大规模数据进行良好的可视化尤为重要,有助于验证标准化效果、识别异常值等。在多组学研究中,可视化的作用更为关键,因为它可以帮助评估不同组学层次或数据模块中的变化趋势,而将各个模块的信息进行叠加,有助于发现它们之间的共有信息。
案例研究
为了说明多组学方法的应用,我们选择“mixOmics TCGA 数据集”26 作为测试数据集,该数据集包含乳腺癌三种亚型(即 LumA、Her2 和 Basal)的两组经过标准化和清理的组学数据子集,由癌症基因组图谱网络(The Cancer Genome Atlas Network)27 生成:
训练数据:训练数据集包含150个样本:75个LumA样本、45个Basal样本和30个Her2样本,其中每个样本均对应一个独立的组学模块,分别测量了蛋白...
访问受限。请登录或开始试用以查看此内容。
确定最相关的组学数据集是多组学整合研究中的首要步骤之一。在营养学研究中,代谢组学是首先需要关注的组学层面之一,因为它能够揭示饮食干预或食物摄入后代谢反应背后的代谢通路和生化过程。另一方面,例如在癌症生物学中,基因组学和转录组学可提供关于DNA、遗传变异以及基因表达失调的信息,有助于理解肿瘤的病因或异质性,并推动发现新的生物标志物。蛋白质组学在多种疾病(如心血管疾病、自身免疫性疾病和神经退行性疾病)中也发挥着关键作用。总体而言,蛋白质组学有助于发现疾病特异性的蛋白质、翻译后修饰以及蛋白质-蛋白质相互作用,这些对于生物标志物的识别和靶向治疗的开发至关重要。
在处理高维数据时,选择与所研究现象相关的变量至关重要,这有助于简化分析和解释,减少所需的计算资源,并去除会干扰结果的噪声和冗余信息。
在多组学整合中,需要考虑若干关键步骤,以确保多个组学数据集的成功整合。预处理是任何多组学方法的第一步,包括对各个组学数据集进行清洗和预处理2,
访问受限。请登录或开始试用以查看此内容。
E. A.、R. R 和 O. C 是雀巢有限公司的员工。
作者感谢 Michael Affolter 博士、Loïc Dayon 博士、Jean Philippe Godin 博士、Francesca Giuffrida 博士、Eugenia Migliavacca 博士、Anne-Florence Bitbol 教授和 Zoltan Kutalik 教授提供的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Apple M2 Pro macOS | Apple | 14.3 (23D56) | 数据处理计算机 |
| ggplot2 R package | r-project.org | 3.4.4 | 创建数据可视化图表 |
| ggpubr R package | r-project.org | 0.6.0 | 生成适合发表的图形 |
| ggrepel R package | r-project.org | 0.9.5 | 使用 ggplot2 自动定位不重叠的文本标签 |
| lattice R package | r-project.org | 0.22-5 | R 的格点图形系统 |
| limma R package | r-project.org | 3.58.1 | 用于微阵列数据的线性模型 |
| mixOmics R package | r-project.org | 6.25.1 | 组学数据整合分析工具 |
| NEMO R package | r-project.org | 0.1.0 | 基于邻域的多组学聚类方法 |
| R | r-project.org | 4.3.2 (2023-10-31) | 用于统计计算和图形的编程语言 |
| R Studio | RStudio | 2023.12.1+402 (2023.12.1+402) | R 的集成开发环境 |
| SNFtool R package | r-project.org | 2.3.1 | 相似性网络融合算法 |
| tidyr R package | r-project.org | 1.3.1 | 整理杂乱数据 |
| yardstick R package | r-project.org | 1.3.0 | 模型性能的规范化评估指标 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可