本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。
本文稿为生物学研究中整合多组学数据提供了全面的分步指南。
多组学数据整合是指将使用不同组学技术(如基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、微生物组学、脂质组学和糖组学)在同一组生物样本上测量得到的数据进行合并与分析的过程。尽管多组学方法的目标与单组块或单组学分析相似(例如描述、区分、分类或预测),但其能够捕获更广泛的分子信息,从而更深入地理解生物系统及其复杂的相互作用。事实上,整合多个组学数据集有助于提高预测准确性,并获得更稳健的结果,尤其是在可用样本数量有限的情况下。此外,得益于机器学习技术的最新进展,当前的多组学分析已能够揭示不同生物分子之间隐藏的模式和复杂的生物学现象。
本研究的主要目的是介绍多组学研究中常用的完整方案,内容涵盖从问题的初步提出到有助于结果生物学解释的各类工具。本文详细描述了多种多组学数据整合方法,包括基于拼接(低层次)、基于转换(中层次)和基于模型(高层次)的方法,并阐述了这些方法的局限性与优势,同时介绍了通用的可视化和诊断工具。
近年来,生物研究领域取得了显著进展,特别是在组学技术方面。这些技术为深入了解生物系统的复杂性提供了宝贵见解。然而,每种组学技术仅能提供关于生物组分的独特视角,因此需要整合多组学数据,以获得全面的理解。
多组学(multi-omics)涵盖了多种生物分子类别,得益于新兴的高通量测序技术,这些分子能够被定量分析。不同的组学技术包括基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学。基因组学研究生物体的基因组,而表观基因组学则关注基因组的支撑结构,包括与DNA结合的蛋白质和RNA、替代性DNA结构以及DNA上的化学修饰。转录组学涵盖所有RNA分子的研究,包括mRNA、rRNA、tRNA以及其他非编码RNA。蛋白质组学涉及对蛋白质的研究,包括特定蛋白质群体所发生的修饰。代谢组学聚焦于生物基质中所有小分子(代谢物)的集合。宏基因组学研究具有特定理化性质的明确生境中的微生物群落。脂质组学涵盖细胞内全部脂质成分的研究,而糖组学则专注于糖组(glycome)的研究,包括碳水化合物和糖类1。
由于多组学数据整合在揭示复杂生物现象方面具有巨大潜力,因此在科学界受到日益关注。通过整合来自多种组学技术的数据,研究人员能够克服单一数据集的局限性,更全面地理解生物系统。这种整合方法有助于发现新的生物标志物、揭示疾病机制以及阐明复杂的生物通路。
访问受限。请登录或开始试用以查看此内容。
1. 研究问题的定义
2. 组学选择
3. 确保数据质量
注意:确保按照以下步骤生成的组学数据具有可靠性和可重复性。
访问受限。请登录或开始试用以查看此内容。
与单组学分析类似,可视化对于数据探索、数据整合、模式识别、假设生成以及结果交流至关重要。具体而言,在数据预处理阶段,对大规模数据进行良好的可视化尤为重要,有助于验证标准化效果、识别异常值等。在多组学研究中,可视化的作用更为关键,因为它可以帮助评估不同组学层次/数据模块中的变化趋势,而将各个模块的信息进行叠加,有助于发现它们之间的共有信息。
案例研究
为了说明多组学方法的应用,我们选择“mixOmics TCGA 数据集”26 作为测试数据集,该数据集包含乳腺癌三种亚型(即 LumA、Her2 和 Basal)的两组经过标准化和清理的组学数据子集,由癌症基因组图谱网络(The Cancer Genome Atlas Network)27 生成:
训练数据:训练数据集包含150个样本:75个LumA样本、45个Basal样本和30个Her2样本,其中每个样本均测量了蛋白质组学、miRNA和mRN.......
访问受限。请登录或开始试用以查看此内容。
确定最相关的组学数据集是多组学整合研究中的首要步骤之一。在营养学研究中,代谢组学是首先需要关注的组学层面之一,因为它能够揭示饮食干预或食物摄入后代谢反应背后的代谢通路和生化过程。另一方面,例如在癌症生物学中,基因组学和转录组学可提供关于DNA、遗传变异以及基因表达失调的信息,有助于理解肿瘤的病因或异质性,并推动发现新的生物标志物。蛋白质组学在多种疾病(如心血管疾病、自身免疫性疾病和神经退行性疾病)中也发挥着关键作用。总体而言,蛋白质组学有助于发现疾病特异性的蛋白质、翻译后修饰以及蛋白质-蛋白质相互作用,这些对于生物标志物的识别和靶向治疗的开发至关重要。
在处理高维数据时,选择与所研究现象相关的变量至关重要,这有助于简化分析和解释,减少所需的计算资源,并去除会干扰结果的噪声和冗余信息。
在多组学整合中,需要考虑若干关键步骤,以确保多个组学数据集的成功整合。预处理是任何多组学方法的第一步,包括对各个组学数据集进行清洗和预处理2,
访问受限。请登录或开始试用以查看此内容。
E. A.、R. R 和 O. C 是雀巢有限公司的员工。
作者感谢 Michael Affolter 博士、Loïc Dayon 博士、Jean Philippe Godin 博士、Francesca Giuffrida 博士、Eugenia Migliavacca 博士、Anne-Florence Bitbol 教授和 Zoltan Kutalik 教授提供的支持。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Apple M2 Pro macOS | Apple | 14.3 (23D56) | 数据处理计算机 |
| ggplot2 R package | r-project.org | 3.4.4 | 创建数据可视化图表 |
| ggpubr R package | r-project.org | 0.6.0 | 生成适合发表的图形 |
| ggrepel R package | r-project.org | 0.9.5 | 使用 ggplot2 自动定位不重叠的文本标签 |
| lattice R package | r-project.org | 0.22-5 | R 的格点图形系统 |
| limma R package | r-project.org | 3.58.1 | 用于微阵列数据的线性模型 |
| mixOmics R package | r-project.org | 6.25.1 | 组学数据整合分析工具 |
| NEMO R package | r-project.org | 0.1.0 | 基于邻域的多组学聚类方法 |
| R | r-project.org | 4.3.2 (2023-10-31) | 用于统计计算和图形的编程语言 |
| R Studio | RStudio | 2023.12.1+402 (2023.12.1+402) | R 的集成开发环境 |
| SNFtool R package | r-project.org | 2.3.1 | 相似性网络融合算法 |
| tidyr R package | r-project.org | 1.3.1 | 整理杂乱数据 |
| yardstick R package | r-project.org | 1.3.0 | 模型性能的规范化评估指标 |
访问受限。请登录或开始试用以查看此内容。