2023年10月13日
本文介绍了一种计算方法(CaseOLAP LIFT)及其应用案例,用于研究线粒体蛋白及其在生物医学报告中与心血管疾病之间的关联。该方法可轻松调整,用于研究用户选定的细胞组分及相关疾病。
该计算流程具有重要意义,因为它能够使研究人员探究细胞组分之间的关联,例如线粒体蛋白及其与疾病的关联,正如生物医学文献中所报道的那样。CaseOLAP LIFT 能够帮助研究人员从生物医学报告和知识库中提取并整合信息。这些结果以知识图谱的形式组织,可用于预测新的关联关系。
这些研究结果通过突出显示已识别和预测的蛋白质-疾病关联的优先列表,有助于提出假设,为揭示疾病病理机制和治疗策略提供新的见解。该高度可定制的工作流程可通过基因本体(GO)术语应用于任何细胞组分,通过医学主题词(MeSH)术语应用于任何疾病列表,并可在任意发表日期范围内进行。这一用户友好的实验方案最大限度地减少了分析所需的计算专业知识。
软件以 Docker 容器形式发布,仅需足够的计算存储空间和资源即可运行。首先打开终端窗口,下载 CaseOLAP LIFT Docker 容器,输入命令 docker pull CaseOLAP slash CaseOLAP_LIFT latest。创建一个用于存储所有程序数据和输出结果的目录。
使用屏幕上显示的命令启动 Docker 容器,将 PATH_TO_FOLDER 替换为文件夹的完整文件路径。要在容器内启动 Elasticsearch,请打开一个新的终端窗口并输入屏幕上显示的命令。导航至 CaseOLAP_LIFT 文件夹。
确保下载链接以及 config slash knowledge_base_links.json 对每个知识库资源的最新版本而言是最新的且准确无误。要确定基因本体(gene ontology)或 GO 术语,请访问网站 geneontology。
访问 org 网站,查找所有 GO 术语的标识符。类似地,通过屏幕所示网站上的医学主题词表(Medical Subject Header)或 MeSH 标识符查找疾病分类。执行预处理模块时,使用 -C 参数指定用户自定义的研究 GO 术语,使用 -D 参数指定疾病的 MeSH 树编号,并使用 -A 参数指定缩写。
要执行文本挖掘模块,请输入 Python,空格,CaseOLAP_LIFT.py,空格,text_mining,然后添加 -L 标志以填补未分类文档的主题,以及添加 -T 标志以下载疾病相关文档的全文。请确保文本挖掘结果位于 result 文件夹中。
通过指定“分析所有蛋白质”以包含所有功能相关蛋白质,或指定“分析核心蛋白质”以仅包含与GO术语相关的蛋白质,来确定用于分析的文本挖掘结果。为了识别每种疾病的最显著蛋白质和通路,CaseOLAP得分将在每个疾病类别内进行Z分数转换。请指定负Z值阈值,以表示高于该阈值的蛋白质将被视为具有显著性。
查看分析结果并根据需要进行调整。打开文件 z_score_cutoff_table.csv,以查看生成的 Z 分数表,该表包含在每个疾病类别中具有显著性的蛋白质数量。
这有助于用户选择合适的Z分数阈值。打开结果文件夹,确保所需的文件(包括预处理生成的文件夹)均已存在于该文件夹中。检查核心蛋白质文件夹中的所有蛋白质。
设计知识图谱时,包含 MeSH 疾病树,并启用 include MeSH 标志;包含来自 string 的蛋白质-蛋白质相互作用,并启用 include PPI 标志;包含共享的 Reactome 通路,并启用 include PW 标志;包含来自 GRNdb GTEx 的转录因子依赖性,并启用 include TFD 标志。通过指定分析核心蛋白质,仅包含与 GO 术语相关的蛋白质,运行知识图谱构建模块。
为了缩放边权重,请对非负 Z 分数使用 scale Z-score,而非默认的 CaseOLAP 分数。检查输出结果,确保知识图谱文件 merged_edges.tsv 和 merged_nodes 已合并。
存在 tsv 文件。最后,在屏幕上输入所示命令,以运行知识图谱预测脚本,用于预测蛋白质与疾病之间的关联。该图展示了与每种疾病类别相关的线粒体蛋白质。
对每个类别内的CaseOLAP得分应用Z分数变换,以使用三为阈值识别显著性蛋白质。每个疾病类别中显著性蛋白质的总数显示在每个小提琴图的上方。对这些蛋白质进行Reactome通路分析,揭示了与所有疾病均显著相关的12条通路。
本图展示了将深度学习应用于特定疾病知识图谱的一个示例。图中预测了蛋白质与疾病之间的潜在关联,并显示了两项预测的计算概率值,范围从0到1,其中1表示预测强度高。该流程的执行顺序至关重要,特别是预处理和文本挖掘模块。
这两个步骤直接影响每种疾病的关键蛋白和通路的识别,以及疾病特异性知识图谱的构建。所得到的知识图谱可通过图谱分析工具(如 Neo4j 和 Cytoscape)进行有效可视化,并可用于新关联关系的高级深度学习预测。CaseOLAP LIFT 能够支持对任意细胞组分与疾病类别之间关联性的研究。
所得到的知识图谱及排序后的蛋白质-疾病关联支持自然语言处理及后续基于图的分析。
CaseOLAP LIFT 计算协议能够通过生物医学报告对线粒体蛋白及其与心血管疾病之间的关联进行研究。该可调节的协议使研究人员能够高效地研究多种细胞组分及疾病。
将大规模生物医学文献整合到结构化知识图谱中,可使生物制药团队系统性地发现与疾病病理相关的蛋白质-疾病关联及作用机制通路。CaseOLAP LIFT 分析流程可提高靶点验证的预测置信度,并支持早期发现与转化研究中的假设生成。该方法有助于高效优先筛选新颖的靶点和通路,直接影响项目组合的筛选以及基于风险评估的推进决策。
该计算流程通过从生物医学文献中提取、整合和解析蛋白质-疾病关联,连接了早期发现、靶点验证和转化研究。