需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

生物研究中多组学整合的全面方案与逐步操作指南

3.5K 次观看

DOI:

10.3791/66995

2025年8月8日

本文内容

摘要

本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。

摘要

本文稿为生物学研究中整合多组学数据提供了全面的分步指南。

多组学数据整合是指将使用不同组学技术(如基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、微生物组学、脂质组学和糖组学)在同一组生物样本上测量得到的数据进行合并与分析的过程。尽管多组学方法的目标与单组块或单组学分析相似(例如描述、区分、分类或预测),但其能够捕获更广泛的分子信息,从而更深入地理解生物系统及其复杂的相互作用。事实上,整合多个组学数据集有助于提高预测准确性,并获得更稳健的结果,尤其是在可用样本数量有限的情况下。此外,得益于机器学习技术的最新进展,当前的多组学分析已能够揭示不同生物分子之间隐藏的模式和复杂的生物学现象。

本研究的主要目的是介绍多组学研究中常用的完整方案,内容涵盖从问题的初步提出到有助于结果生物学解释的各类工具。本文详细描述了多种多组学数据整合方法,包括基于拼接(低层次)、基于转换(中层次)和基于模型(高层次)的方法,并阐述了这些方法的局限性与优势,同时介绍了通用的可视化和诊断工具。

引言

近年来,生物研究领域取得了显著进展,特别是在组学技术方面。这些技术为深入了解生物系统的复杂性提供了宝贵见解。然而,每种组学技术仅能提供关于生物组分的独特视角,因此需要整合多组学数据,以获得全面的理解。

多组学(multi-omics)涵盖了多种生物分子类别,得益于新兴的高通量测序技术,这些分子能够被定量分析。不同的组学技术包括基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学。基因组学研究生物体的基因组,而表观基因组学则关注基因组的支撑结构,包括与DNA结合的蛋白质和RNA、替代性DNA结构以及DNA上的化学修饰。转录组学涵盖所有RNA分子的研究,包括mRNA、rRNA、tRNA以及其他非编码RNA。蛋白质组学涉及对蛋白质的研究,包括特定蛋白质群体所发生的修饰。代谢组学聚焦于生物基质中所有小分子(代谢物)的集合。宏基因组学研究具有特定理化性质的明确生境中的微生物群落。脂质组学涵盖细胞内全部脂质成分的研究,而糖组学则专注于糖组(glycome)的研究,包括碳水化合物和糖类1

由于多组学数据整合在揭示复杂生物现象方面具有巨大潜力,因此在科学界受到日益关注。通过整合来自多种组学技术的数据,研究人员能够克服单一数据集的局限性,更全面地理解生物系统。这种整合方法有助于发现新的生物标志物、揭示疾病机制以及阐明复杂的生物通路。

访问受限。请登录或开始试用以查看此内容。

方案

1. 研究问题的定义

  1. 明确阐述将通过多组学整合来解决的具体科学问题。例如,研究问题1:与治疗反应相关的蛋白质表达和代谢物谱的变化是什么?研究问题2:遗传变异如何影响特定疾病患者的基因表达模式?研究问题3:整合特定组学层次如何能够全面理解某一特定生物学过程或疾病机制?
  2. 考虑结合多种组学技术,以寻找生物标志物或深入理解复杂疾病的机制。需注意,为实现患者分层,可能需要增加样本量。

2. 组学选择

  1. 根据研究问题和所研究的生物系统,确定最相关的组学技术。例如,针对问题1,相关组学技术为蛋白质组学和代谢组学;针对研究问题2,为基因组学和转录组学;针对研究问题3,则涉及多种组学技术。
  2. 在选择理想的组学层次时,应考虑研究目的及可用资源。例如,营养学研究可采用代谢组学,癌症生物学研究可采用基因组学和转录组学,而多种疾病研究可采用蛋白质组学。

3. 确保数据质量

注意:确保按照以下步骤生成的组学数据具有可靠性和可重复性。

  1. 精心设计实验,并在所有组学层面保持一致的实验条件和样本采集方法,以尽量减少批次效应。
  2. 在生成每种组学数据集的....

访问受限。请登录或开始试用以查看此内容。

结果

与单组学分析类似,可视化对于数据探索、数据整合、模式识别、假设生成以及结果交流至关重要。具体而言,在数据预处理阶段,对大规模数据进行良好的可视化尤为重要,有助于验证标准化效果、识别异常值等。在多组学研究中,可视化的作用更为关键,因为它可以帮助评估不同组学层次/数据模块中的变化趋势,而将各个模块的信息进行叠加,有助于发现它们之间的共有信息。

案例研究
为了说明多组学方法的应用,我们选择“mixOmics TCGA 数据集”26 作为测试数据集,该数据集包含乳腺癌三种亚型(即 LumA、Her2 和 Basal)的两组经过标准化和清理的组学数据子集,由癌症基因组图谱网络(The Cancer Genome Atlas Network)27 生成:

训练数据:训练数据集包含150个样本:75个LumA样本、45个Basal样本和30个Her2样本,其中每个样本均测量了蛋白质组学、miRNA和mRN.......

访问受限。请登录或开始试用以查看此内容。

讨论

确定最相关的组学数据集是多组学整合研究中的首要步骤之一。在营养学研究中,代谢组学是首先需要关注的组学层面之一,因为它能够揭示饮食干预或食物摄入后代谢反应背后的代谢通路和生化过程。另一方面,例如在癌症生物学中,基因组学和转录组学可提供关于DNA、遗传变异以及基因表达失调的信息,有助于理解肿瘤的病因或异质性,并推动发现新的生物标志物。蛋白质组学在多种疾病(如心血管疾病、自身免疫性疾病和神经退行性疾病)中也发挥着关键作用。总体而言,蛋白质组学有助于发现疾病特异性的蛋白质、翻译后修饰以及蛋白质-蛋白质相互作用,这些对于生物标志物的识别和靶向治疗的开发至关重要。

在处理高维数据时,选择与所研究现象相关的变量至关重要,这有助于简化分析和解释,减少所需的计算资源,并去除会干扰结果的噪声和冗余信息。

在多组学整合中,需要考虑若干关键步骤,以确保多个组学数据集的成功整合。预处理是任何多组学方法的第一步,包括对各个组学数据集进行清洗和预处理2,

访问受限。请登录或开始试用以查看此内容。

披露

E. A.、R. R 和 O. C 是雀巢有限公司的员工。

致谢

作者感谢 Michael Affolter 博士、Loïc Dayon 博士、Jean Philippe Godin 博士、Francesca Giuffrida 博士、Eugenia Migliavacca 博士、Anne-Florence Bitbol 教授和 Zoltan Kutalik 教授提供的支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Apple M2 Pro macOSApple14.3 (23D56)数据处理计算机
ggplot2 R packager-project.org3.4.4创建数据可视化图表
ggpubr R packager-project.org0.6.0生成适合发表的图形
ggrepel R packager-project.org0.9.5使用 ggplot2 自动定位不重叠的文本标签
lattice R packager-project.org0.22-5R 的格点图形系统
limma R packager-project.org3.58.1用于微阵列数据的线性模型
mixOmics R packager-project.org6.25.1组学数据整合分析工具
NEMO R packager-project.org0.1.0基于邻域的多组学聚类方法
r-project.org4.3.2 (2023-10-31)用于统计计算和图形的编程语言
R StudioRStudio2023.12.1+402 (2023.12.1+402)R 的集成开发环境
SNFtool R packager-project.org2.3.1相似性网络融合算法
tidyr R packager-project.org1.3.1整理杂乱数据
yardstick R packager-project.org1.3.0模型性能的规范化评估指标

参考文献

  1. Hasin, Y., Seldin, M., Lusis, A. Multi-omics approaches to disease. Genome Biol. 18 (1), 83(2017).
  2. Reel, P. S., Reel, S., Pearson, E., Trucco, E., Jefferson, E. Using machine learning approaches for multi-omics data analysis: a review. Biotechnol Adv. 49, (2021).
  3. Ritch....

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签