2024年9月20日
我们提出了一种灵活、可扩展的基于 Jupyter 实验室的工作流程,用于复杂多组学数据集的无监督分析,该工作流程结合了不同的预处理步骤、多组学因子分析模型的估计和多种下游分析。
我们的工作流程可以轻松分析不同分辨率的复杂多组学数据集。该方法提取变体的主要模式,这些变体要么是唯一的,要么是与特定数据类型共享的,并将它们聚合起来。由此产生的所谓因素可以与分子过程和临床或技术协变量联系起来。
我们的分析是最早将 MOFA 模型应用于多个样本的多组学和单细胞数据的分析之一。重要的是,这些样本来自心脏病发作患者的临床队列。这使我们能够识别与结果和疾病状态相关的多细胞免疫特征。
因此,单细胞和多组学数据集的可用性增加,但通常,这些数据集的特征仅单独分析。这限制了洞察力,因为通常,生物过程是多种特征和细胞类型之间相互作用的结果。使用我们的实验方案,用户可以轻松地对整个数据集进行综合分析并识别这些多细胞程序。
我们认为将此协议应用于其他多组学数据集将产生对其他疾病或背景的新见解。这些见解将为未来的生物标志物或治疗研究提供信息。
本文介绍了一种基于 Jupyter-lab 的灵活且可扩展的工作流程,用于对复杂的多组学数据集进行无监督分析。该工作流程能够提取与分子过程及临床协变量相关的变异主要模式。
将无监督的多组学因子分析(MOFA)整合到发现阶段的工作流程中,可使生物制药团队揭示心血管疾病背后复杂的分子模式和多细胞程序。该方法通过将高维组学数据与疾病相关过程关联,提高了预测的可信度,支持早期靶点验证和转化生物标志物的发现。该工作流程具备可扩展性和适应性,可作为整个产品线范围内机制性降风险和优先级排序的可重复利用的能力。
这种基于MOFA的工作流程通过实现多组学和临床数据的整合分析,连接了早期发现、先导物识别和转化研究。