2024年3月1日
本文介绍一种将转录组数据转换为 mqTrans 视图的实验方案,从而实现对“暗”生物标志物的识别。这些生物标志物在传统的转录组分析中并未表现出差异表达,但在 mqTrans 视图中则显示出显著的差异表达。该方法可作为传统技术的补充,揭示以往研究中被忽视的生物标志物。
我们的研究聚焦于疾病相关的基因间相互作用。我们发现许多基因彼此之间存在复杂的交织关系。通过探索这些关系,我们旨在实现对疾病治疗和管理的更精确诊断。
我们发现,许多采用传统组合方法被忽略的隐性生物标志物,得到了大量医学文献的支持。这表明,该方法可进一步帮助生物学家缩短生物标志物筛选的时间周期。实验过程中最大的挑战是应对不同类型疾病样本量较小的问题。
为克服这一困难,我们收集了尽可能多的健康样本以训练一个参考模型,我们称之为 Health Model。首先,在 Slurm Cluster 超算平台上创建一个名为 Health Model、Python 版本为 3.7 的新虚拟环境,然后执行 module load anaconda 命令。
命令执行后,屏幕上将出现确认提示。输入 Y 以继续,并等待进程完成。然后根据特定平台的说明激活虚拟环境。
接下来,运行命令安装 PyTorch 1.13.1。根据安装指南,安装用于 torch geometric 的附加包,例如 torch_scatter、torch_sparse、torch_cluster 和 torch_spline_conv。然后安装 torch geometric 2.2.0 版本。
从健康信息学实验室网站下载代码和预训练的健康模型。将文件解压缩到指定路径。然后在命令行中将工作目录更改为健康模型 MQ trans 文件夹。
执行命令以生成MQ转录特征并获取输出结果。MQ转录特征将作为输出文件“MQ目标CSV”生成,标签文件将作为输出文件“标签CSV”获得。此外,MRNA基因的原始表达值将被提取为文件“输出测试目标CSV”。
接下来,使用特征选择算法来选取 MQ 转化特征。如果选择 MQ 转化特征或原始特征而不将它们组合,则将 combine 设置为 false。选取 800 个原始特征,并将数据集按 0.8 与 0.2 的比例划分为训练集和测试集。
为了将 MQ 转录特征与原始表达值结合用于特征筛选,需将 combine 设置为 true。研究鉴定了在 MQ 转录值上具有差异但 mRNA 表达无差异的暗生物标志物。在 3,062 个特征中,共检测到 221 个暗生物标志物。
除 BRCA、MESO 和 TGCT 外,在大多数癌症类型中,与传统生物标志物相比,暗生物标志物普遍较为稀缺。
本研究探讨了与疾病相关的基因之间复杂的相互作用,重点在于识别传统方法常忽略的“暗”生物标志物。所提出的mqTrans视角有助于深入理解这些生物标志物,其表达水平相较于传统转录组学分析表现出差异性表达。
将多任务图注意力网络与转录组学数据整合,能够检测出传统差异表达分析所忽略的调控特征和隐性生物标志物。该方法通过揭示隐藏的调控信号,提高了早期发现阶段的预测置信度,有助于更稳健地进行靶点验证以及基于风险调整的研发组合决策。HealthModel 框架解决了小规模数据集的挑战,拓展了转录组谱在生物制药研发管线中的应用价值。
HealthModel 和 mqTrans 工作流程通过从转录组数据生成调控特征视图,连接了早期发现、靶点验证和临床前研究。