方法文章

生物研究中多组学整合的全面方案与逐步操作指南

DOI:

10.3791/66995

2025年8月8日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究详细介绍了多组学数据整合的方法(包括串联、转换和基于模型的方法)。通过整合基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学的数据,可实现对生物系统的全面理解。本文提供了逐步操作指南,并强调了多组学整合的局限性、优势及可视化工具。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文稿为生物学研究中整合多组学数据提供了全面的分步指南。

多组学数据整合是指将使用不同组学技术(如基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、微生物组学、脂质组学和糖组学)在同一组生物样本上测量得到的数据进行合并与分析的过程。尽管多组学方法的目标与单组块或单组学分析相似(例如描述、区分、分类或预测),但其能够捕获更广泛的分子信息,从而更深入地理解生物系统及其复杂的相互作用。事实上,整合多个组学数据集有助于提高预测准确性,并获得更稳健的结果,尤其是在可用样本数量有限的情况下。此外,得益于机器学习技术的最新进展,当前的多组学分析已能够揭示不同生物分子之间隐藏的模式和复杂的生物学现象。

本研究的主要目的是介绍多组学研究中常用的完整方案,内容涵盖从问题的初步提出到有助于结果生物学解释的各类工具。本文详细描述了多种多组学数据整合方法,包括基于拼接(低层次)、基于转换(中层次)和基于模型(高层次)的方法,并阐述了这些方法的局限性与优势,同时介绍了通用的可视化和诊断工具。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

近年来,生物研究领域取得了显著进展,特别是在组学技术方面。这些技术为深入了解生物系统的复杂性提供了宝贵见解。然而,每种组学技术仅能提供关于生物组分的独特视角,因此需要整合多组学数据,以获得全面的理解。

多组学(multi-omics)涵盖了多种生物分子类别,得益于新兴的高通量测序技术,这些分子能够被定量分析。不同的组学技术包括基因组学、表观基因组学、转录组学、蛋白质组学、代谢组学、宏基因组学、脂质组学和糖组学。基因组学研究生物体的基因组,而表观基因组学则关注基因组的支撑结构,包括与DNA结合的蛋白质和RNA、替代性DNA结构以及DNA上的化学修饰。转录组学涵盖所有RNA分子的研究,包括mRNA、rRNA、tRNA以及其他非编码RNA。蛋白质组学涉及对蛋白质的研究,包括特定蛋白质群体所发生的修饰。代谢组学聚焦于生物基质中所有小分子(代谢物)的集合。宏基因组学研究具有特定理化性质的明确生境中的微生物群落。脂质组学涵盖细胞内全部脂质成分的研究,而糖组学则专注于糖组(glycome)的研究,包括碳水化合物和糖类1

由于多组学数据整合在揭示复杂生物现象方面具有巨大潜力,因此在科学界受到日益关注。通过整合来自多种组学技术的数据,研究人员能够克服单一数据集的局限性,更全面地理解生物系统。这种整合方法有助于发现新的生物标志物、揭示疾病机制以及阐明复杂的生物通路。

术语 "Multiomics" 和 "Multi-omics" 在 PubMed 中的引用数量近年来显著增加,从 2018 年的 307 次增长到 2021 年的 1414 次,再到 2023 年的 3933 次。整合不同类型的组学变量正变得越来越普遍,因为它有助于深入探究疾病和生物体功能障碍背后的机制。单一组学方法仅能提供对潜在生物学的有限且片面的观察,因其局限于单一视角。然而,通过整合多组学数据,我们可以揭示不同生物分子之间的相互作用,理解多个层次之间的关联,并弥合基因型与表型之间的鸿沟。总体而言,多组学方法有助于回答一些重要问题,例如对不同疾病亚型进行分类、预测关键的疾病相关生物标志物,以及更深入地理解生物通路和机制。在接下来的章节中,不同的组学数据集也可被称为数据 "视图" 或数据 "模块"。

根据 Reel 等人(2021)2 和 Ritchie 等人 (2015)3 的描述,多组学整合技术可分为三个主要子类(图 1)。

低层次、早期整合或拼接:该方法涉及将每个单一样本数据集的变量拼接成一个单一矩阵。然而,早期整合未考虑每种组学数据类型的独特分布,可能会对维度较大的某些组学数据类型赋予更高的权重。该方法还存在诸多挑战,例如维度灾难风险增加、噪声增多、变量高度相关以及计算可扩展性问题。尽管存在这些局限性,早期整合仍有助于识别多个组学层面之间的协调变化,并增强生物学解释能力。

中等水平、基于中间整合或转换的方法:该方法将数学整合模型应用于多层组学数据。中间整合侧重于对从各数据源提取的子集或表示形式进行融合。中间整合包含两种子方法:自下而上(middle-up)方法和自上而下(middle-down)方法。自下而上方法通过对每个数据模块进行降维后获得的得分进行串联,适用于处理异质性数据,但可能缺乏可解释性。自上而下方法则涉及局部变量选择,随后对串联后的变量子集进行分析,从而使模型更易于解释。中间整合具有多种优势,如提高信噪比、降低数据维度以及增强统计功效。

高水平、晚期整合或基于模型的方法:该方法涉及在每个单独的组学水平上进行分析,并以临时方式组合结果。它包括融合来自单个模块模型的结果,以识别各数据源的生物标志物,并对结果进行联合解读。晚期整合不会增加输入空间的维度,且能够适应每种组学数据独特的分布特征。当某一组学层次的预测能力优于其他层次时,该方法尤为适用。然而,晚期整合可能忽略跨组学之间的关联,并面临因对初始数据模块间联系理解不足,以及通过独立建模可能导致生物学信息丢失所带来的挑战。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 研究问题的定义

  1. 明确阐述将通过多组学整合来解决的具体科学问题。例如,科学问题1:与治疗反应相关的蛋白质表达和代谢物谱的变化是什么?科学问题2:遗传变异如何影响特定疾病患者的基因表达模式?科学问题3:整合特定组学层次如何能够全面理解某一特定生物学过程或疾病机制?
  2. 考虑结合多种组学技术,以寻找生物标志物或深入理解复杂疾病的机制。需注意,为实现患者分层,可能需要增加样本量。

2. 组学选择

  1. 根据研究问题和所研究的生物系统,确定最相关的组学技术。例如,针对问题1,相关组学技术为蛋白质组学和代谢组学;针对研究问题2,为基因组学和转录组学;针对研究问题3,则涉及多种组学技术。
  2. 在选择理想的组学层次时,应考虑研究目的及可用资源。例如,营养学研究可采用代谢组学,癌症生物学研究可采用基因组学和转录组学,而多种疾病研究可采用蛋白质组学。

3. 确保数据质量

注意:确保按照以下步骤生成的组学数据具有可靠性和可重复性。

  1. 精心设计实验,并在所有组学层面保持一致的实验条件和样品采集方法,以尽量减少批次效应。
  2. 在生成每种组学数据集的过程中,遵循既定的实验方案并实施质量控制措施。
    1. 在适当情况下使用内部或外部标准品。
    2. 对各个组学数据集进行质量检查。
      1. 对于基因组学数据,应评估读段质量得分、碱基组成和测序深度等指标,以确保获得高质量的测序数据;同时评估比对与映射质量以及变异检测质量,包括等位基因频率、读段深度和变异注释。
      2. 对于转录组学数据,在评估读段质量时应考察读段长度分布、碱基组成和Phred质量得分,在评估转录本定量质量时应使用每百万转录本数(TPM)或每百万映射读段中每千碱基转录本片段数(FPKM)等指标。
      3. 对于蛋白质组学数据,在评估质谱数据质量时应考虑峰强度分布、信噪比和质量准确性等相关指标;在评估蛋白质鉴定与定量质量时,应考虑肽段序列覆盖率、蛋白质鉴定得分、错误发现率以及蛋白质丰度测量的重复性。
      4. 对于代谢组学数据,在评估质谱数据质量时应考察峰强度分布、信噪比和质量准确性等指标;在评估代谢物鉴定质量时,应通过将质谱图与参考数据库匹配或利用碎片模式进行结构解析。

4. 数据预处理

  1. 重叠样本
    1. 仅包含在多个组学数据集之间重叠的样本。
    2. 排除与其他数据块相比重叠样本数量不足的数据块。
  2. 缺失值填补
    1. 使用统计学或机器学习方法处理缺失值。
    2. 采用最小二乘自适应(Least-Squares Adaptive, LSA)等方法进行缺失值填补。
    3. 避免删除含有缺失数据的行,尤其是在样本数量有限的情况下。
    4. 排除缺失值比例较高的变量(例如,在所有样本中缺失值达到25%或30%的变量)。
  3. 标准化
    1. 进行数据处理,以确保各特征具有统一的量纲尺度。
    2. 防止效应较大的特征主导效应较小的特征。
    3. 应用常见的转换方法,如对数转换、中心化和标准化。
      注:应谨慎选择转换方法,以保持原始数据的可解释性。
  4. 异常值识别
    1. 使用箱线图或与中位数的距离等工具检测异常值和极端值。
    2. 通过适当的方法(如数据转换或删除)处理异常值。

5. 降维

注意:降维有两种方法:一种是去除噪声和冗余变量(特征选择),另一种是将特征组合以创建更具意义的变量(特征提取)。

  1. 确定研究目的属于预测性(例如,构建一个能够预测个体是否健康或患病的模型)还是分析性(例如,哪些变量是某种疾病的生物标志物)。
    注意:如果研究目的是分析性的,则特征选择更为合适,因为特征提取可能导致可解释性丧失。
  2. 在处理高维数据时,选择与所研究现象相关的变量至关重要,这有助于简化分析与解释过程,减少所需的计算资源,并去除会干扰结果的噪声和冗余信息。
  3. 特征选择
    1. 确定与目标现象相关的信息性特征子集。
    2. 采用分类为过滤法、封装法、嵌入法和混合法的特征选择方法。在多组学研究中,也可应用生物标志物选择方法。
      注意:选择适当方法时应考虑数据集的特征。封装法可提供最准确的预测模型,但其计算时间远长于过滤法或嵌入法。表1提供了不同特征选择与提取方法优缺点的汇总表。
    3. 在最终模型性能与特征选择所需的计算代价之间取得平衡。
    4. 优化所选特征的数量,以避免欠拟合或过拟合。
      注意:有关过拟合风险的示例在先前发表的研究中已有讨论。
    5. 使用准确率、曲线下面积(AUC)分数或平衡错误率(BER)等指标评估模型性能。
  4. 特征提取
    1. 将原始数据转换为一组精简的有意义特征:
      1. 应用主成分分析(PCA)等技术,通过将数据投影到低维空间来识别重要的模式和关系。
      2. 利用t-SNE在保留局部相似性的同时可视化高维数据。
      3. 考虑使用线性判别分析(LDA)以最大化类别可分性。
      4. 探索自编码器(Autoencoders),利用神经网络学习数据的压缩表示形式。
        注意:特征提取可能产生较难解释的表示形式。表1列出了部分特征选择与特征提取方法的示例5

6. 积分方法选择

  1. 确定适用于数据的最相关的一种或多种整合方法。
    1. 如果样本是匹配的,并且有足够数量的完整受试者,则采用早期整合方法。
    2. 如果必须考虑层间相互作用,则不应采用晚期整合方法。
    3. 如果信号可能在各层之间较微弱但具有一致性,则早期整合方法可能比晚期整合方法更合适。
    4. 如果需要充分利用不同组学层之间的数据相互关系,则选择中期整合方法。
    5. 基于拼接的低层次整合
      1. 如果一个(或多个)组学数据块在特征(变量)数量上远大于其他数据块,则按照第5节中的步骤对其(它们)进行降维处理。
      2. 将每个单独组学数据集的变量拼接成一个宽矩阵。
      3. 对拼接后的变量进行转换,使其具有相似的数值范围和分布。
      4. 将拼接后的数据矩阵用于后续分析,例如应用机器学习算法或降维策略。
        注:低层次整合最常见的方法是拼接。然而,这些方法可能导致数据块之间关系的丢失或无法获得特定于数据块的洞察。
  2. 中期整合
    1. 根据分析目标,从六种主要类别的中期整合方法中进行选择。
      1. 基于相似性:在探索性数据分析中,当变量间的关系事先未知时,使用该方法评估不同样本或特征之间的相似性,以识别疾病中的模式或亚型。示例:SNF6
      2. 基于相关性:使用该方法识别并量化不同变量之间的关联,特别是用于评估一个变量随另一个变量变化的情况。示例:CNAMet7
      3. 基于网络:使用基于网络的方法表示特征之间的复杂关系。该方法特别适用于揭示数据结构中的聚类并预测生物标志物。示例:NetICS8、PARADIGM9、scMoMtF10
      4. 基于贝叶斯:当需要将先验知识引入分析,或处理数据中的不确定性时,使用该方法。该方法特别适用于基于概率模型推断疾病亚型和预测生物标志物。示例:MOFA11、iClusterPlus12
      5. 基于多变量:当变量间的相互作用对于理解生物系统至关重要时,使用该方法同时分析多个变量。该方法在聚类分析和生物标志物发现中均具有应用价值。示例:mixOmics13、JIVE14,15
      6. 基于融合:使用该方法将来自不同组学层的数据整合到一个统一框架中,以充分利用各类数据的优势。该方法特别适用于需要整合多样化数据集的综合性分析。示例:PFA16、PSDF17
        注:由于采用了强大的统计处理或基于机器学习技术的建模,该方法可能减少低层次或高层次整合中存在的问题。
    2. 将选定的方法应用于多组学数据集。
  3. 高层次整合
    1. 对每个单独的组学数据块独立进行完整的数据分析。
    2. 联合解释上一步骤中获得的结果。

7. 统计分析

  1. 差异表达(DE)分析
    1. 准备数据,确保数据格式正确并已完成标准化。
      注意:根据所使用的软件包,数据格式和结构可能有所不同。建议使用 R 软件包如 limma18、edgeR19 或 DESeq220 进行差异表达分析。
    2. 构建设计矩阵,为每个实验组设置独立的系数,明确实验条件和分组分配。
    3. 对每个特征拟合线性模型,并纳入设计矩阵。
    4. 计算经修正的 t 统计量和 F 统计量,以评估差异表达水平。
    5. 采用经验贝叶斯法对标准误进行修正,估计差异表达的对数优势比。
    6. 确定显著性阈值
      1. 采用 p 值截断值 0.05 作为统计学显著性的判断标准。
      2. 根据特征类型设定对数倍数变化阈值:
      3. 对于代谢物和蛋白质,使用 log2(1.1) 作为对数倍数变化阈值。
      4. 对于转录本,使用 log2(1.5) 作为对数倍数变化阈值。
  2. 聚类分析
    1. 选择拟使用的聚类方法/算法。
      注意:存在专为多组学数据设计的聚类算法,例如 NEMO21、iCluster22 和 JIVE23
    2. 若所选方法需要,确定聚类数量。可选方法包括肘部法则、轮廓系数或间隙统计量,用于估计最优聚类数。
    3. 在经过清洗的数据上运行选定的聚类算法。
    4. 根据需要优化算法特异性参数。
    5. 使用内部或外部验证指标(如轮廓系数或调整兰德指数)评估聚类结果的质量。
    6. 如条件允许,使用独立数据或先前从聚类分析中排除的测试数据集验证聚类分配结果。
  3. 预测建模
    1. 评估在多组学研究中进行预测建模的必要性。
      注意:在完成多组学整合后可应用预测模型,比较不同方法筛选特征后对结局分类预测准确性的变化。
    2. 若步骤 7.3.1 的决策为是,则继续执行以下步骤;否则进入步骤 8。
    3. 选择合适的预测模型。
      注意:可选用的一个模型示例是随机森林(RF),该机器学习算法通过集成多个决策树获得最终结果。
    4. 精细调整模型参数(例如,使用 R 的 caret 软件包)。
    5. 以平衡方式将数据集划分为训练集和测试集(60–40% 或 80–20%),确保不同组的样本比例一致。
    6. 在训练集上运行模型。
    7. 在测试集上计算准确率和 F1 分数,以评估模型性能。
    8. 重复步骤 2 至 4 多次(例如 1000 次),以增强随机性。
    9. 计算步骤 5 结果的平均值。
    10. 报告平均准确率和 F1 分数。若结果不理想,则返回步骤 1 优化参数选择。
    11. 使用准确率下降均值(DMA)和不纯度下降均值(MDI)确定特征重要性。

8. 生物学解释:

  1. 选择一种通路富集分析工具(常用的通路富集分析工具包括 DAVID、GSEA、Enrichr 和 Metascape)。
  2. 将基因或蛋白质列表输入所选的通路富集分析工具中。
  3. 选择适当的通路数据库(如 KEGG、Reactome 或 GO)以进行分析。
    注意:有一种专为多组学数据设计的工具是 Paintomics,该工具利用数据库(KEGG、Reactome 或 Mapman)提供这些生物标志物之间的功能关系信息,以及它们参与特定生物学过程的情况25
  4. 使用所选工具和数据库运行通路富集分析。
  5. 根据需要调整参数,例如显著性阈值、背景基因列表或校正方法。
  6. 可视化并评估最终结果(富集的通路、FDR、通路图、热图等)。

9. 验证与后续实验

  1. 技术验证
    1. 验证对同一样本使用不同分析技术时,是否也能获得等效的结果。
      注意:例如,使用质谱(MS)法进行蛋白质组学分析所获得的结果,后续可采用酶联免疫吸附测定(ELISA)等免疫学方法进行验证。
  2. 确定用于验证所得结果的后续实验。
  3. 如有可能,通过分析独立队列的组学数据来重复验证发现。
  4. 对于临床应用,应开展随机临床试验以证明研究发现的临床有效性。
    1. 设计并实施一项具有适当样本量和随机化分组的对照研究,以评估所鉴定生物标志物或靶点的有效性和安全性。
    2. 收集相关的临床终点指标,并测量所鉴定因素对患者预后的影响。

10. 可视化与诊断工具

注意:可使用多种类型的图表来展示数据分析结果,以直观呈现关键发现。常用的图表包括火山图、热图、环形图和曼哈顿图。

  1. 火山图:
    1. 使用火山图总结差异表达分析(DEA)结果。
    2. 展示被测组间统计显著性与变化幅度之间的关系。
    3. 根据特征在图中的位置识别关键特征,以供进一步分析。
  2. 热图:
    1. 利用热图可视化变量在不同类别间的数值大小。
    2. 使用颜色表示变量的强度,便于识别数据集内的模式和聚类。
  3. 曼哈顿图:
    1. 采用曼哈顿图高效汇总差异表达分析(DEA)结果,并在同一图中可视化大量数据点。
    2. 常用于全基因组关联研究(GWAS),也适用于多组学研究。
  4. 环形图(Circos图):
    1. 使用环形图(Circos图)这类环形可视化方式,探索不同分子特征之间的相互作用和相关性。
    2. 以全面且视觉上更具吸引力的方式描绘不同元素之间的关系和连接。
      注:本研究使用癌症测试数据集,为上述每种图示类型提供了代表性结果示例。
  5. 诊断工具:
    注:可视化工具结合性能评估指标,对诊断目的至关重要。
    1. 使用受试者工作特征(ROC)曲线评估分类模型的性能。
    2. 使用载荷图和主成分分析(PCA)图可视化数据内部的关系和模式。
      注:代表性结果部分展示了使用癌症测试数据集生成的每种图的示例。
  6. 二分类性能评估指标
    注:以下所有指标均可通过将每一类与其他类进行比较的方式,推广至多分类任务,如本文示例所示。
    1. 混淆矩阵:使用混淆矩阵(表2)表示对角线上的真阳性(TP)和真阴性(TN),右下角为真阴性,右上角为假阳性(FP),左下角为假阴性(FN)。
    2. 精确率:指被判定为阳性的样本中实际为阳性的比例。使用公式 TP/(TP + FP) 计算精确率。精确率为1的模型无假阳性;若模型精确率为0.5,则其预测结果有一半正确。
      精确率公式方程;使用真阳性和假阳性值计算精确率。
    3. 召回率或灵敏度:又称真阳性率或命中率,指实际阳性样本中被正确识别的比例。使用公式 TP/(TP + FN) 或 TP/pos 计算召回率或灵敏度,其中 pos = TP + FN 表示阳性样本总数。
      召回率方程:真阳性除以真阳性与假阴性之和,数学公式。
    4. 特异性:指实际阴性样本中被正确识别的比例。使用公式 TN/neg 计算,其中 neg = TN + FP 表示阴性样本总数。
      特异性公式,统计分析中的特异性方程:真阴性 /(真阴性 + 假阳性)
    5. 准确率:正确预测(包括阳性和阴性)所占的比例。使用以下公式计算准确率:
      准确率公式,方程;计算模型预测准确率;教育用数学内容。
    6. F分数:F分数是召回率与精确率的调和平均数。使用以下公式计算:
      F1分数公式,用于评估精确率和召回率;图像显示一个数学方程。
    7. 平衡准确率:平衡准确率(BAC)是灵敏度与特异性的平均值。使用以下公式计算:
      平衡准确率公式,BA方程:BA = (TPR + TNR) / 2,统计分析工具。
      其中TPR代表真阳性率,对应召回率;TNR代表真阴性率,对应特异性。
    8. 平衡错误率:平衡错误率(BER)是每个类别错误率的平均值。使用以下公式计算:
      平衡错误率公式,BER=(1/2)(1-(TPR+TNR)/2),数学方程。
      注:BER的优势在于通过构建平衡的错误率度量,考虑了各类别之间性能的差异,从而减轻了数据不平衡的影响。错误率为0.5时,性能相当于随机猜测。对于DIABLO模型,BER是来自每个数据块的加权分类错误率,其权重取决于组分与目标条件之间的相关性。BER是BAC的补数,即 BER = (1 - BAC)。
    9. 曲线下面积:将曲线下面积(AUC)定义为ROC曲线(见下节描述)下方的面积,该曲线通过绘制灵敏度与特异性获得。
      注:选择哪种指标最合适,取决于假阴性的重要性以及类别之间是否平衡。精确率侧重于最小化假阳性,而召回率侧重于最小化假阴性。当阳性样本比例较低时,仅使用精确率可能不是评估模型性能的最佳指标。Code.R 作为 补充文件1 提供。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

与单组学分析一样,可视化对于数据探索、数据整合、模式识别、假设生成以及结果交流至关重要。特别是,在数据预处理阶段,对大规模数据进行良好的可视化尤为重要,有助于验证标准化效果、识别异常值等。在多组学研究中,可视化的作用更为关键,因为它可以帮助评估不同组学层次或数据模块中的变化趋势,而将各个模块的信息进行叠加,有助于发现它们之间的共有信息。

案例研究
为了说明多组学方法的应用,我们选择“mixOmics TCGA 数据集”26 作为测试数据集,该数据集包含乳腺癌三种亚型(即 LumA、Her2 和 Basal)的两组经过标准化和清理的组学数据子集,由癌症基因组图谱网络(The Cancer Genome Atlas Network)27 生成:

训练数据:训练数据集包含150个样本:75个LumA样本、45个Basal样本和30个Her2样本,其中每个样本均对应一个独立的组学模块,分别测量了蛋白...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

确定最相关的组学数据集是多组学整合研究中的首要步骤之一。在营养学研究中,代谢组学是首先需要关注的组学层面之一,因为它能够揭示饮食干预或食物摄入后代谢反应背后的代谢通路和生化过程。另一方面,例如在癌症生物学中,基因组学和转录组学可提供关于DNA、遗传变异以及基因表达失调的信息,有助于理解肿瘤的病因或异质性,并推动发现新的生物标志物。蛋白质组学在多种疾病(如心血管疾病、自身免疫性疾病和神经退行性疾病)中也发挥着关键作用。总体而言,蛋白质组学有助于发现疾病特异性的蛋白质、翻译后修饰以及蛋白质-蛋白质相互作用,这些对于生物标志物的识别和靶向治疗的开发至关重要。

在处理高维数据时,选择与所研究现象相关的变量至关重要,这有助于简化分析和解释,减少所需的计算资源,并去除会干扰结果的噪声和冗余信息。

在多组学整合中,需要考虑若干关键步骤,以确保多个组学数据集的成功整合。预处理是任何多组学方法的第一步,包括对各个组学数据集进行清洗和预处理2,

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

E. A.、R. R 和 O. C 是雀巢有限公司的员工。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢 Michael Affolter 博士、Loïc Dayon 博士、Jean Philippe Godin 博士、Francesca Giuffrida 博士、Eugenia Migliavacca 博士、Anne-Florence Bitbol 教授和 Zoltan Kutalik 教授提供的支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Apple M2 Pro macOSApple14.3 (23D56)数据处理计算机
ggplot2 R packager-project.org3.4.4创建数据可视化图表
ggpubr R packager-project.org0.6.0生成适合发表的图形
ggrepel R packager-project.org0.9.5使用 ggplot2 自动定位不重叠的文本标签
lattice R packager-project.org0.22-5R 的格点图形系统
limma R packager-project.org3.58.1用于微阵列数据的线性模型
mixOmics R packager-project.org6.25.1组学数据整合分析工具
NEMO R packager-project.org0.1.0基于邻域的多组学聚类方法
r-project.org4.3.2 (2023-10-31)用于统计计算和图形的编程语言
R StudioRStudio2023.12.1+402 (2023.12.1+402)R 的集成开发环境
SNFtool R packager-project.org2.3.1相似性网络融合算法
tidyr R packager-project.org1.3.1整理杂乱数据
yardstick R packager-project.org1.3.0模型性能的规范化评估指标

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Hasin, Y., Seldin, M., Lusis, A. Multi-omics approaches to disease. Genome Biol. 18 (1), 83(2017).
  2. Reel, P. S., Reel, S., Pearson, E., Trucco, E., Jefferson, E. Using machine learning approaches for multi-omics data analysis: a review. Biotechnol Adv. 49, (2021).
  3. Ritchie, M. D., Holzinger, E. R., Li, R., Pendergrass, S. A., Kim, D. Methods of integrating data to uncover genotype-phenotype interactions. Nat Rev Genet. 16 (2), 85-97 (2015).
  4. Lan, W., He, G., Liu, M., Chen, Q., Cao, J., Peng, W. Transformer-Based Single-Cell Language Model: a survey. Big Data Min Analyt. 7 (4), 1169-1186 (2024).
  5. Li, Y., Mansmann, U., Du, S., Hornung, R. Benchmark study of feature selection strategies for multi-omics data. BMC Bioinformatics. 23 (1), (2022).
  6. Li, L., et al. Multi-omics data integration for subtype identification of Chinese lower-grade gliomas: a joint similarity network fusion approach. Comput Struct Biotechnol J. 20, 3482-3492 (2022).
  7. Louhimo, R., Hautaniemi, S. CNAmet: an R package for integrating copy number, methylation and expression data. Bioinformatics. 27 (6), 887-888 (2011).
  8. Dimitrakopoulos, C., et al. Network-based integration of multi-omics data for prioritizing cancer genes. Bioinformatics. 34 (14), 2441-2448 (2018).
  9. McLendon, R. Comprehensive genomic characterization defines human glioblastoma genes and core pathways. Nature. 455 (7216), 1061(2008).
  10. Lan, W., Ling, T., Chen, Q., Zheng, R., Li, M., Pan, Y. scMoMtF: an interpretable multitask learning framework for single-cell multi-omics data analysis. PLoS Comput Biol. 20 (12), e1012679(2024).
  11. Argelaguet, R., et al. MOFA+: a statistical framework for comprehensive integration of multi-modal single-cell data. Genome Biol. 21 (1), (2020).
  12. Mo, Q., et al. Pattern discovery and cancer gene identification in integrated cancer genomic data. Proc Natl Acad Sci USA. 110 (11), 4245-4250 (2013).
  13. Rohart, F., Gautier, B., Singh, A., Lê Cao, K. A. mixOmics: an R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), (2017).
  14. O'Connell, M. J., Lock, E. F. R.JIVE for exploration of multi-source molecular data. Bioinformatics. 32 (18), 2877-2879 (2016).
  15. Lock, E. F., Hoadley, K. A., Marron, J. S., Nobel, A. B. Joint and individual variation explained (JIVE) for integrated analysis of multiple data types. Ann Appl Stat. 7 (1), 523-542 (2013).
  16. Shi, Q. Pattern fusion analysis by adaptive alignment of multiple heterogeneous omics data. Bioinformatics. 33 (17), 2706-2714 (2017).
  17. Yuan, Y., Savage, R. S., Markowetz, F. Patient-Specific Data Fusion defines prognostic cancer subtypes. PLoS Comput Biol. 7 (10), e1002227(2011).
  18. Smyth, G. K. Linear models and empirical bayes methods for assessing differential expression in microarray experiments. Stat Appl Genet Mol Biol. 3 (1), (2004).
  19. Robinson, M. D., McCarthy, D. J., Smyth, G. K. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. Bioinformatics. 26 (1), 139(2010).
  20. Love, M. I., Huber, W., Anders, S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 15 (12), (2014).
  21. Rappoport, N., Shamir, R. NEMO: cancer subtyping by integration of partial multi-omic data. Bioinformatics. 35 (18), 3348-3356 (2019).
  22. Shen, R., Olshen, A. B., Ladanyi, M. Integrative clustering of multiple genomic data types using a joint latent variable model with application to breast and lung cancer subtype analysis. Bioinformatics. 25 (22), 2906-2912 (2009).
  23. Biau, G., Scornet, E. A random forest guided tour. Test. 25 (2), 197-227 (2016).
  24. Rigatti, S. J. Random Forest. J Insur Med. 47 (1), 31-39 (2017).
  25. Hernández-De-Diego, R., et al. PaintOmics 3: a web resource for the pathway analysis and visualization of multi-omics data. Nucleic Acids Res. 46 (W1), W503-W509 (2018).
  26. Singh, A., et al. DIABLO - an integrative, multi-omics, multivariate method for multi-group classification. BioRxiv. , (2016).
  27. Koboldt, D. C., et al. Comprehensive molecular portraits of human breast tumours. Nature. 490 (7418), 61-70 (2012).
  28. Welham, Z., Déjean, S., LêCao, K. A. Multivariate analysis with the R package mixOmics. Methods Mol Biol. 2426, 333-359 (2023).
  29. Sharifi-Noghabi, H., Zolotareva, O., Collins, C. C., Ester, M. MOLI: multi-omics late integration with deep neural networks for drug response prediction. Bioinformatics. 35 (14), i501-i509 (2019).
  30. Chicco, D., Cumbo, F., Angione, C. Ten quick tips for avoiding pitfalls in multi-omics data integration analyses. PLoS Comput Biol. 19 (7), e1011224(2023).
  31. Lan, W., Liao, H., Chen, Q., Zhu, L., Pan, Y., Chen, Y. P. P. DeepKEGG: a multi-omics data integration framework with biological insights for cancer recurrence prediction and biomarker discovery. Brief Bioinform. 25 (3), 185(2024).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章