方法文章

利用知识图谱方法阐明细胞器通路在疾病中的作用 通过 生物医学报告

DOI:

10.3791/65084

2023年10月13日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种计算方法(CaseOLAP LIFT)及其应用案例,用于研究线粒体蛋白及其在生物医学报告中与心血管疾病之间的关联。该方法可轻松调整,用于研究用户选定的细胞组分及相关疾病。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

生物医学报告的数量正迅速增长,每份报告均包含大量实体和丰富信息,构成了生物医学文本挖掘应用的宝贵资源。这些工具可帮助研究人员整合、理解和转化这些发现,从而揭示疾病病理学和治疗学的新见解。本方案中,我们介绍 CaseOLAP LIFT,这是一种新的计算流程,旨在通过从文本数据集(例如,生物医学文献)中提取用户选定的信息,来研究细胞组分及其与疾病的关联。该软件可识别与疾病相关的文献中的亚细胞蛋白及其功能相关蛋白,并进一步识别其他与疾病相关的文献 通过 该软件的标签填补方法。为了对所得的蛋白质-疾病关联进行背景化分析,并整合来自多个相关生物医学资源的信息,系统会自动构建一个知识图谱以供进一步分析。我们展示了一个应用案例,通过在线下载约3400万篇文本文档组成的语料库,示例如何利用该方法阐明线粒体蛋白质在不同心血管疾病表型中的作用。此外,将一个深度学习模型应用于所生成的知识图谱,以预测蛋白质与疾病之间此前未被报道的关系,最终得到1,583个具有预测概率的关联结果。 >0.90,并且在测试集上的受试者工作特征曲线下面积(AUROC)为0.91。该软件具有高度可定制化和自动化的分析流程,可处理广泛范围的原始数据;因此,使用该方法可在文本语料库中更可靠地识别蛋白质与疾病之间的关联。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

研究与疾病相关的蛋白质有助于加深对发病机制的科学认识,并帮助识别潜在的治疗方法。多个大型生物医学出版物文本库(例如包含3400万篇文章的PubMed,其涵盖出版物标题、摘要和全文)报道了将蛋白质与疾病关联起来的新发现。然而,这些发现分散在不同的信息来源中,必须加以整合才能产生新的生物医学见解。目前已有若干生物医学资源用于整合蛋白质-疾病关联1,2,3,4,5,6,7。然而,这些经过人工整理的资源往往不完整,可能未涵盖最新的研究成果。文本挖掘方法对于从大规模文本库中提取和综合蛋白质-疾病关联至关重要,这将有助于更全面地理解科学文献中的这些生物医学概念。

多种生物医学文本挖掘方法可用于揭示蛋白质与疾病之间的关系8,9,10,11,12,13,14,以及其他因素部分通过识别文本中提及的蛋白质、疾病或其他生物医学实体来确定这些关系13,15,16,17,18,19然而,这些工具中的大多数无法获取最新的文献,只有少数工具会定期更新8,11,13,15同样,许多工具的研究范围也有限,因为它们仅局限于预定义的广泛疾病或蛋白质9,13一些方法还容易在文本中产生假阳性识别结果;其他方法则通过使用可解释的全局蛋白质名称黑名单来解决这些问题9,11 或解释性较差的命名实体识别技术15,20尽管大多数资源仅提供预先计算的结果,但一些工具提供了交互功能 通过 网页应用程序或可访问的软件代码8,9,11.

为解决上述局限性,本文提出以下方案:结合标签填补与全文分析的CaseOLAP(CaseOLAP LIFT),作为一种灵活且可定制的平台,用于从文本数据集中研究蛋白质(例如,与特定细胞组分相关的蛋白质)与疾病之间的关联。该平台具备以下功能:自动整理基因本体(GO)术语特异性蛋白质(例如,细胞器特异性蛋白质)、填补缺失的文献主题标签、分析全文文献,以及提供分析工具和预测工具(图1图2表1)。CaseOLAP LIFT 利用用户提供的 GO 术语(例如,细胞器区室)来整理细胞器特异性蛋白质,并利用 STRING21、Reactome22 和 GRNdb23 来识别功能相关蛋白质。通过 PubMed 标注的医学主题词表(MeSH)标签来识别与疾病研究相关的文献。对于约 15.1% 未标注标签的文献,若其标题中至少出现一个 MeSH 术语同义词,或摘要中至少出现两个,则进行标签填补,从而使此前未分类的出版物也能纳入文本挖掘分析。CaseOLAP LIFT 还允许用户在指定时间段内(例如 2012–2022 年)选择文献的特定部分进行分析(例如仅标题和摘要、全文,或排除方法部分的全文)。该软件还可半自动整理特定应用场景下的蛋白质名称黑名单,从而显著减少其他方法中存在的假阳性蛋白质-疾病关联。总体而言,这些改进增强了系统的可定制性和自动化程度,扩大了可用于分析的数据量,并从大规模生物医学文本语料库中获得更可靠的蛋白质-疾病关联结果。

CaseOLAP LIFT 整合了生物医学知识,并利用知识图谱来表示各种生物医学概念之间的关系,进而用于预测图谱中潜在的关联。近年来,基于图谱的计算方法已被应用于生物学领域,包括整合与组织生物医学概念24,25、药物再利用与开发26,27,28,以及基于蛋白质组学数据的临床决策29

为了展示 CaseOLAP LIFT 在构建知识图谱中的应用价值,我们以线粒体蛋白与八类心血管疾病之间关联性的研究为例。通过分析约 362,000 篇与疾病相关的文献,识别出与这些疾病最相关的线粒体蛋白及通路。随后,将这些蛋白、与其功能相关的蛋白以及文本挖掘结果整合到一个知识图谱中。该知识图谱被用于基于深度学习的链接预测分析,以预测在生物医学出版物中尚未报道的蛋白-疾病关联。

引言部分介绍了本实验方案的背景信息和研究目的。接下来的部分描述了计算方案的具体步骤。随后,阐述了该方案的代表性结果。最后,我们简要讨论了该计算方案的应用场景、优势、局限性以及未来应用前景。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 运行 Docker 容器

  1. 使用终端窗口并输入 docker pull caseolap/caseolap_lift:latest 来下载 CaseOLAP LIFT Docker 容器。
  2. 创建一个用于存储所有程序数据和输出的目录(例如:mkdir caseolap_lift_shared_folder)。
  3. 使用命令 docker run --name caseolap_lift -it -v PATH_TO_FOLDER:/caseolap_lift_shared_folder caseolap/caseolap_lift:latest bash 启动 Docker 容器,其中 PATH_TO_FOLDER 为该文件夹的完整路径(例如:/Users/caseolap/caseolap_lift_shared_folder)。第 2 节中的后续命令将在该终端窗口中执行。
  4. 在容器内启动 Elastic Search。在新的终端窗口中输入 docker exec -it --user elastic caseolap_lift bash /workspace/start_elastic_search.sh
    ​注意:本方案中,CaseOLAP LIFT 以交互方式运行,每一步依次执行。也可通过传入 parameters.txt 文件实现端到端的自动化分析。本研究所用的 parameters.txt 文件位于 /workspace/caseolap_lift/parameters.txt。如需了解各步骤的更多细节,可在命令中添加 --help 参数,或访问 GitHub 代码库中的文档(https://github.com/CaseOLAP/caseolap_lift)。 

2. 疾病与蛋白质的准备

  1. 进入 caseolap_lift 文件夹,命令为 cd /workspace/caseolap_lift
  2. 确保 config/knowledge_base_links.json 中的下载链接是每个知识库资源最新版本的最新且准确的链接。默认情况下,文件仅下载一次;如需更新这些文件并重新下载,请在步骤 2.4 中使用 -r 参数运行预处理步骤。
  3. 确定本研究中要使用的 GO 术语和疾病类别。分别在 http://geneontology.org/ 和 https://meshb.nlm.nih.gov/ 查找所有 GO 术语的标识符和 MeSH 标识符。
  4. 使用命令行选项执行预处理模块。此预处理步骤将整合指定的疾病,列出待研究的蛋白质,并收集用于文本挖掘的蛋白质同义词。使用 -c 参数指定用户自定义的研究 GO 术语,使用 -d 参数指定疾病的 MeSH 树编号,并使用 -a 参数指定缩写。
    示例命令:
    python caseolap_lift.py preprocessing -a "CM ARR CHD VD IHD CCD VOO OTH" -d "C14.280.238,C14.280.434 C14.280.067,C23.550.073 C14.280.400 C14.280.484 C14.280.647 C14.280.123 C14.280.955 C14.280.195,C14.280.282,C14.280.383,C14.280.470,
    C14.280.945,C14.280.459,C14.280.720" -c "GO:0005739" --include-synonyms --include-ppi -k 1 -s 0.99 --include-pw -n 4 -r 0.5 --include-tfd
  5. 检查上一步在 output 文件夹中生成的 categories.txtcore_proteins.txtproteins_of_interest.txt 文件。确保 categories.txt 中的所有疾病类别均正确,并且 core_proteins.txtproteins_of_interest.txt 中识别出的蛋白质数量合理。如有必要,重复步骤 2.4,并调整参数以包含更多或更少的蛋白质。
    注意:--include-ppi--include-pw--include-tfd 参数分别用于包含蛋白质-蛋白质相互作用、具有共同 Reactome 通路的蛋白质以及具有转录因子依赖性的蛋白质。其具体功能由其他参数如 -k、-s、-n 和 -r 进一步指定(详见文档)。

3. 文本挖掘

  1. 确保 categories.txt, core_proteins.txt,以及 目标蛋白.txt 上一步生成的文件位于输出文件夹中。将这些文件用作文本挖掘的输入。可选择性地调整与文档解析和索引相关的配置参数 配置 文件夹。有关配置和故障排除的更多详细信息,请参见 CaseOLAP 方案的早期版本8.
  2. 运行文本挖掘模块 python caseolap_lift.py 文本挖掘加入 - l 用于推断未分类文档主题的标志及 - t 用于下载与疾病相关文档的全文标志。其他可选标志用于指定要下载的出版物的发表日期范围(- d)并提供筛选蛋白质名称的选项(见步骤 3.3)。解析后文档的示例如下所示 图3.
    示例命令: python caseolap_lift.py 文本挖掘 -d "2012-10-01,2022-10-01" -l -t
    注意:大部分计算流程的时间消耗在步骤 3.2,该步骤可能持续超过 24 小时。运行时间取决于待下载文本语料库的大小,而语料库大小又与日期范围以及是否启用标签填补和全文检索功能有关。
  3. (推荐)筛选蛋白质名称。在疾病相关出版物中鉴定出的蛋白质名称有助于建立蛋白质与疾病之间的关联,但容易产生假阳性结果(即与其他词汇同名)。为解决此问题,应将可能的同名词汇列入黑名单进行枚举config/移除这些同义词.txt以便在后续步骤中将其排除。
    1. 查找要检查的名称:在下方 结果 文件夹中,查找出现频率最高的蛋白质名称 全部蛋白或核心蛋白 (ranked_synonyms/ranked_synonyms_TOTAL.txt)以及各文件夹下得分最高的蛋白质名称 排序后的蛋白质 根据感兴趣的分数进行选择。如果名称较多,应优先检查得分最高的名称。
    2. 检查名称:类型 python caseolap_lift.py 文本挖掘 -c 接着输入蛋白质名称,以显示最多 10 篇包含该名称的出版物。然后,针对每个名称,检查该名称是否为特定蛋白质名称。
    3. 重新计算分数:类型 python caseolap_lift.py 文本挖掘 -s重复步骤3.1、步骤3.2和步骤3.3,直至步骤3.1中的名称显示正确为止。

4. 分析结果

  1. 确保文本挖掘结果位于 result 文件夹中(例如 result/all_proteinsresult/core_proteins 目录及其相关文件),这些结果将作为分析步骤的输入。具体而言,文本挖掘生成的 caseolap.csv 结果中会报告一个分数,用于表示每个蛋白质-疾病关联的强度。通过指定 --analyze_core_proteins 参数仅包含与 GO 术语相关的蛋白质,或指定 --analyze_all_proteins 参数包含所有功能相关蛋白质,来指明分析中要使用的文本挖掘结果集。
  2. 确定每种疾病的前导蛋白质和通路。显著的蛋白质-疾病关联定义为分数超过指定阈值的关联。对每种疾病类别内的 CaseOLAP 分数进行 Z 分数转换,并将分数高于指定阈值(由 -z 参数指定)的蛋白质视为显著。
    ​注意:使用显著蛋白质作为输入,通过 Reactome 通路分析自动识别与每种疾病显著相关的生物学通路。所有此类蛋白质均在 analysis_results 文件夹中的 result_table.csv 结果文件中报告,相关图表和通路分析结果将自动在 analysis_results 文件夹中生成。
    示例命令:python caseolap_lift.py analyze_results -z 3.0 --analyze_core_proteins
  3. 审查分析结果,并根据需要进行调整。显著蛋白质的数量以及因此富集的 Reactome 通路数量取决于分析中使用的 Z 分数阈值。output/analysis_results/zscore_cutoff_table.csv 生成的 Z 分数表格列出了每种疾病类别中显著蛋白质的数量,有助于选择尽可能高的 Z 分数阈值,同时确保每种疾病类别中仍有若干显著蛋白质。

5. 预测分析

  1. 构建知识图谱。
    1. 确保所需的文件位于 结果 文件夹,包括 kg 来自预处理(步骤 2.4)生成的文件夹以及文本挖掘结果中的 caseolap.csv 文件 所有蛋白质核心蛋白 文件夹(步骤 3.2)。
    2. 设计知识图谱。根据下游任务的需求,选择性地包含或排除完整知识图谱中的组成部分。该知识图谱包含来自文本挖掘的蛋白质-疾病评分,以及与步骤2.4中所用知识库资源的连接。图4)。包含MeSH疾病树,并使用--include_mesh flag,来自 STRING 的蛋白质-蛋白质相互作用,使用 --包含蛋白质-蛋白质相互作用,与之共享的 Reactome 通路包括——包含密码,以及来自 GRNdb/GTEx 的转录因子依赖性,使用 --include_tfd.
    3. 运行知识图谱构建模块。通过指定 -- 选项来指示分析中要使用的文本挖掘结果集分析核心蛋白 仅包含与GO术语相关的蛋白质或——分析所有蛋白质 以包含所有功能相关的蛋白质。默认情况下,原始的 CaseOLAP 分数被加载为蛋白质节点与疾病节点之间边的权重;若要对边权重进行缩放,请指定 --使用z分数,或带有 -- 的非负 z 分数scale_z_score.
      示例命令: python caseolap_lift.py 准备知识图谱 --scale_z_score
  2. 预测新的蛋白质-疾病关联。
    1. 确保知识图谱文件, merged_edges.tsvmerged_nodes.tsv来自上一步(步骤 5.1.3)的输出。
    2. 运行知识图谱预测脚本,以预测科学文献中迄今未报道的蛋白质-疾病关联,方法是输入 python kg_analysis/run_kg_analysis.py。这是通过 GraPE 实现的30 并使用 DistMult31 生成知识图谱嵌入,多层感知机利用这些嵌入来预测蛋白质-疾病关联。在 output/kg_analysis 文件夹,具有预测概率的预测结果 >0.90 (predictions.csv)以及模型评估指标(eval_results.csv已保存。
      注意:本研究中选定的模型参数(例如,嵌入方法、链路预测模型、超参数)是针对代表性研究进行定制的。此代码仅作为其他分析的示例和起点。如需探索模型参数,请参考 GraPE 的文档(https://github.com/AnacletoLAB/grape)。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

采用本方案研究了线粒体蛋白(表2)与八类心血管疾病(表3)之间的关联,并获得了代表性结果。在这些疾病类别中,我们共识别出2012年至2022年10月期间发表的363,567篇文献(其中362,878篇通过MeSH元数据分类,6,923篇通过标签推断分类)。所有文献均包含标题,其中276,524篇含有摘要,51,065篇可获取全文。总体而言,在所查询的1,687种线粒体蛋白中,有584种在文献中被识别;在其8,026种功能相关蛋白中,有3,284种被识别。在所有疾病类别中,共发现14种独特的蛋白具有显著评分,z-score阈值为3.0(图5)。对这些蛋白进行Reactome通路分析,揭示了与所有疾病均显著相关的12条通路(图6)。所有蛋白、通路、疾病及评分数据被整合为一个知识图谱(表4)。该知识图谱用于预测12,688个新的蛋白-疾病关联,并通过概率评分0.90进行筛选,最终获得1,583个高置信度预测结果。图7展示了两个蛋白-疾病关联的突出示例,图中同时呈现了与这些蛋白功能相关的其他生物学实体。模型评估指标详见表5

Protein-disease analysis workflow diagram: text-mining, analysis, predictive steps, knowledge graph.
图1工作流程的动态视图。 该图展示了此工作流程的四个主要步骤。首先,根据用户提供的基因本体(GO)术语(例如细胞组分)对相关蛋白质进行整理,并根据用户提供的疾病医学主题词(MeSH)标识符确定疾病类别。其次,在文本挖掘步骤中计算蛋白质与疾病之间的关联。下载特定时间范围内的出版物并建立索引,识别出研究疾病的文献通过 MeSH 标签及可选内容 通过 推断标签),并下载和索引其全文。在出版物中查询蛋白质名称,并用于计算蛋白质-疾病关联评分。随后,通过文本挖掘,这些评分用于识别最显著的蛋白质及通路关联。最后,构建一个知识图谱,涵盖这些蛋白质、疾病及其在生物医学知识库中的相互关系。基于所构建的知识图谱,预测新的蛋白质-疾病关联。这些步骤均使用生物医学知识库和 PubMed 中最新可用的数据。 请点击此处以查看此图的放大版本。

Protein-disease relevance workflow; diagram showing protein interactions, pathways, transcription factors.
图2工作流程的技术架构。 该工作流程的技术细节在此图中展示。用户需提供疾病类别的MeSH树编号和GO术语。从PubMed下载文本文档,根据提供的MeSH标签识别与疾病相关的文档,对缺乏主题指示性MeSH标签的文档则赋予推断得出的类别标签。获取与所提供GO术语相关的蛋白质。该蛋白质集合进一步扩展,纳入功能上相关的蛋白质 通过 蛋白质-蛋白质相互作用、共同的生物学通路以及转录因子依赖性。这些蛋白质在与疾病相关的文献中被查询,并由 CaseOLAP 进行评分。 请点击此处以查看此图的放大版本。

显示心脏病学研究元数据的 JSON 数据结构。
图 3:一份已处理文档的示例。 此处展示了一份经过解析和索引的文本文档示例。按顺序,相关字段包括索引名称(_index, _type)、PubMed ID(_id, pmid)、文档的各个子部分(title, abstract, full_text, introduction, methods, results, discussion)以及其他元数据(year, MeSH, location, journal)。出于显示目的,文档的子部分内容以省略号截断。MeSH 字段包含文档的主题,这些主题有时可能由我们的标签填补步骤提供。请点击此处查看该图的放大版本。

生物通路与蛋白质相互作用示意图;包含心血管疾病(CVDs)、MeSH、Reactome 的关联。
图 4:知识图谱模式与生物医学资源。 本图展示了知识图谱的模式结构。每个节点和边分别代表一种节点类型或边类型。心血管疾病(CVDs)与蛋白质之间的边由 CaseOLAP 分数加权。蛋白质-蛋白质相互作用(PPI)的边由 STRING 置信度分数加权。由 GRNdb/GTEx 推导出的转录因子依赖性(TFD)边、由 MeSH 推导出的疾病树边以及由 Reactome 推导出的通路边为无权重边。请点击此处查看此图的放大版本。

心脏疾病中蛋白质z分数的小提琴图和热图;统计数据分析。
图5:蛋白质-疾病关联的前位结果。 本图展示了在各类疾病中具有显著性的线粒体蛋白质。对每类疾病中的CaseOLAP评分应用z分数转换,并以3.0为阈值识别显著性蛋白质。(上图) 每类疾病中显著性线粒体蛋白质的数量:这些小提琴图描绘了每类疾病中蛋白质z分数的分布情况。每个小提琴图上方显示了在该类疾病中具有显著性的蛋白质总数。在所有疾病中,共鉴定出14种独特的显著性蛋白质,其中部分蛋白质在多种疾病中均具有显著性。(下图) 高分蛋白质:热图展示了在所有疾病中平均z分数最高的前10种蛋白质。空白值表示该蛋白质与特定疾病之间无获得的评分。请点击此处查看该图的放大版本。

Heatmap analysis of transcription pathways; values range from 0-10; apoptosis, stress response data.
图6:主要通路-疾病关联。 该图展示了所研究疾病类别相关的最主要生物通路,由分析确定 通过 Reactome 通路分析。所有通路分析均经过以下筛选条件过滤: p < 0.05。热图中的数值表示通路内所有蛋白质的平均z分数。顶部在所有疾病中保守的通路:总体而言,共鉴定出14种与所有疾病类别相关的蛋白质,并揭示了12条在所有疾病类别中保守的通路。基于通路的层级结构构建了树状图,以连接具有相似生物学功能的通路。树状图的高度表示通路层级中的相对深度;较宽泛的生物学功能具有较长的分支,而更具体的通路则具有较短的分支。底部) 疾病类别特异性通路:使用在每种疾病中达到显著 z 值的蛋白质进行通路分析。取 p 值最低的前三条通路 p每种疾病相关的值均以星号标示。这些通路可能在多种疾病中均位于前三名。 请点击此处以查看此图的放大版本。

基因相互作用网络示意图;转录因子、通路、结合关系、蛋白质连接。
图7:应用深度学习进行知识图谱补全。 本图展示了将深度学习应用于特定疾病知识图谱的一个示例。图中预测了蛋白质与疾病之间的隐藏关系,并以蓝色标出。两种预测的计算概率均显示,数值范围为0.0至1.0,其中1.0表示高度可信的预测。图中包含多个已知相互作用的蛋白质,代表蛋白质-蛋白质相互作用、转录因子依赖性以及共享的生物学通路。为便于可视化,仅展示与高亮示例相关的少数节点构成的子图。图例:IHD = 缺血性心脏病;R-HSA-1430728 = 代谢;O14949 = 细胞色素b-c1复合物亚基8;P17568 = NADH脱氢酶(泛醌)1β亚复合物亚基7;Q9NYF8 Bcl-2相关转录因子1,得分:7.24 × 10−7;P49821 = NADH脱氢酶(泛醌)黄素蛋白1,线粒体,得分:1.06 × 10−5;P31930 = 细胞色素b-c1复合物亚基1,线粒体,得分:4.98 × 10−5;P99999 = 细胞色素c,得分:0.399。 请点击此处查看该图的放大版本。

表1:工作流程与限速步骤。 本表列出了工作流程各阶段计算时间的粗略估计。选择是否包含流程中的某些组件将影响完成分析所需的总运行时间。总时间估计值取决于可用的计算资源,包括硬件配置和软件设置。粗略估计,在我们的计算服务器(配备六个核心、32 GB内存和2 TB存储)上执行本方案的主动运行时间约为36小时,但在其他设备上可能更快或更慢。请点击此处下载该表格。

表2:细胞组分蛋白的自动组装。 本表显示了与特定细胞组分(即 GO 术语)相关的蛋白质数量,以及与这些蛋白质在功能上相关的蛋白质 通过 蛋白质-蛋白质相互作用(PPI)、共享通路(PW)和转录因子依赖性(TFD)。总蛋白质数量为上述所有类别合并后的蛋白质数目。所有功能相关蛋白质均使用 CaseOLAP LIFT 的默认参数获得。 请点击此处下载此表格。

表3:MeSH标签推断统计信息。 本表列出了疾病类别、用作该类别内所有疾病父级术语的MeSH树编号、2012年至2022年间在每个类别中检索到的PubMed文章数量,以及基于标签推断步骤额外纳入的文章数量。请点击此处下载该表格。

表4:知识图谱构建统计信息。 本表描述了所构建知识图谱的规模统计信息,包括各类节点和边的类型。CaseOLAP 分数表示蛋白质与心血管疾病(CVD)类别之间的关联关系。请点击此处下载该表格。

表5:知识图谱预测统计与验证 本表格报告了知识图谱链接预测在新型/隐含蛋白质-疾病关联上的评估指标。知识图谱的边被划分为70/30的训练集和测试集,且两个数据集均保持了边的图连通性。准确率(accuracy)表示被正确分类的预测所占比例,而平衡准确率(balanced accuracy)对类别不平衡进行了校正。特异性(specificity)表示负向预测中被正确分类的比例。精确率(precision)表示所有正向预测中正确预测所占的比例,而召回率(recall)表示在所有正向边(即已识别的蛋白质-疾病关联)中正确预测的正向预测所占比例 通过 F1分数是精确率和召回率的调和平均数。受试者工作特征曲线下面积(AUROC)用于描述模型区分阳性与阴性预测的能力,其值为1.0时表示为完美分类器。精确率-召回率曲线下面积(AUPRC)衡量在不同概率阈值下精确率与召回率之间的权衡,数值越高表明性能越好。 请点击此处下载此表格。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CaseOLAP LIFT 能够帮助研究人员探究功能蛋白(例如,与细胞组分、生物过程或分子功能相关的蛋白)与生物类别(例如,疾病)之间的关联。所述实验方案应按指定顺序执行,其中第2节和第3节为最关键步骤,因为第4节和第5节依赖于前两节的结果。作为第1节的替代方案,可从 GitHub 代码仓库(https://github.com/CaseOLAP/caseolap_lift)克隆并访问 CaseOLAP LIFT 代码。需要注意的是,尽管在软件开发过程中已进行测试,但仍可能出现程序错误。若发生错误,应重复失败的步骤;若问题持续存在,建议重新执行第1节,以确保使用的是最新版本的 Docker 容器。如需进一步帮助,可在 GitHub 仓库中提交问题以获得额外支持。

该方法通过使研究人员能够识别感兴趣的实体并揭示它们之间潜在的关联,从而支持假设的生成,而这些关联在现有的生物医学资源中可能难以直接获取。所得出的蛋白质-疾病关联使研究人员能够通过评分的可解释性指标获得新的见解:via 流行度评分表示与特定疾病相关性最强且被研究最多的蛋白质,独特性评分表示与特定蛋白质关联最独特的疾病,而综合的 CaseOLAP 评分则是上述两种评分的结合。为防止假阳性识别(例如由于同名异义词所致),一些文本挖掘工具采用术语黑名单以避免误判9,11。同样,CaseOLAP LIFT 也使用黑名单机制,但允许用户根据其具体应用场景自定义黑名单。例如,在研究冠状动脉疾病(CAD)时,"CAD" 不应被视为蛋白质 "caspase-activated deoxyribonuclease" 的名称;然而,在研究其他主题时,"CAD" 通常可能指代该蛋白质。

CaseOLAP LIFT 能够根据文本挖掘可用的数据量进行自适应调整。日期范围功能减轻了计算负担,并为假设生成提供了灵活性(例如,研究关于蛋白质-疾病关联的科学知识如何随时间演变)。同时,标签填补和全文组件扩展了可用于文本挖掘的数据范围。这两个组件默认处于关闭状态,以降低计算成本,但用户可根据需要选择启用其中任意一个。标签填补方法较为保守,其分类准确率较高(精确度为87%),但会遗漏较多其他类别的标签(召回率为2%)。该方法目前依赖基于规则的启发式策略匹配疾病关键词,未来计划通过引入文档主题建模技术来提升性能。由于大量未分类文献往往是近期发表的,因此针对较近时间段的研究(例如,过去三年内所有文献)建议关闭标签填补功能。全文组件会增加运行时间和存储需求。值得注意的是,仅有少数文献提供全文(在本研究中约占文献总数的14%)。鉴于文献方法部分提及的蛋白质名称与疾病主题相关性较低,建议在查询全文文献时排除方法部分。

所得的蛋白质-疾病关联评分可用于传统的分析方法,例如聚类分析、降维分析或富集分析(如基因本体 GO、通路分析),本软件包中已包含部分实现功能。为了将这些评分置于现有的生物医学知识背景中,系统会自动构建一个知识图谱,并可利用图谱可视化工具(如 Neo4j32、Cytoscape33)进行探索。该知识图谱还可用于预测性分析(例如未报道的蛋白质-疾病关系的链接预测、蛋白质网络的社区检测、奖励收集路径遍历方法)。

我们评估了预测的蛋白质-疾病关联的模型评价指标(表5)。该模型为每种蛋白质-疾病关联分配一个介于0.0到1.0之间的概率评分,评分越接近1.0,表示预测的置信度越高。基于AUROC、准确率、平衡准确率、特异性与召回率等多种指标对模型性能进行的内部评估表明,本研究中模型的整体性能优异。然而,评估结果也显示出模型的精确率(precision)较低(0.15),导致AUPRC和F1分数均偏低。未来改进该指标的研究将有助于提升模型的整体性能。我们预计可通过采用更先进的知识图谱嵌入方法和图预测模型来实现这一目标。根据模型0.15的精确率,研究者应预期约有15%的阳性识别结果;具体而言,在模型预测出的12,688个蛋白质-疾病关联中,约15%为真阳性关联。这一问题可通过仅考虑高概率评分的蛋白质-疾病关联(例如,>0.90)加以缓解;在我们的应用案例中,使用0.90作为概率阈值筛选后,获得了1,583个高置信度的预测关联。研究者还可手动检查这些预测结果以确保其高度有效性(参见图7作为示例)。我们对预测结果进行的外部评估表明,在来自广泛 curated 数据库DisGeNet19的310个蛋白质-疾病关联中,有103个在我们的文本挖掘研究中被识别出,另有88个关联由我们的知识图谱分析预测得出,且其概率评分>0.90。

总体而言,CaseOLAP LIFT 在设计针对大型文本语料库中功能蛋白组与多种疾病类别之间关联的定制化分析方面,具有更高的灵活性和可用性。该软件包采用全新的用户友好型命令行界面,并以 Docker 容器形式发布,从而减少了配置编程环境和软件依赖项相关的问题。用于研究心血管疾病中线粒体蛋白的 CaseOLAP LIFT 分析流程可轻松调整;例如,该技术未来的应用可扩展至探究任何与基因本体(GO)术语相关的蛋白与任何生物医学类别之间的关联。此外,该文本挖掘平台所识别出的蛋白-疾病关联排序结果,对于为高级自然语言处理技术准备数据集具有重要意义。由此生成的知识图谱可帮助研究人员将这些发现转化为具有生物学意义的知识,并为后续基于图谱的分析奠定基础。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作由美国国立卫生研究院(NIH)R35 HL135772(授予P.P.)、NIH T32 HL13945(授予A.R.P.和D.S.)、NIH T32 EB016640(授予A.R.P.)、美国国家科学基金会研究培训项目(NRT)1829071(授予A.R.P.和D.S.)、NIH R01 HL146739(授予I.A.、J.R.、A.V.、K.B.)以及加州大学洛杉矶分校(UCLA)TC Laubisch基金(授予P.P.)资助。

材料

本文使用的材料清单
姓名公司目录编号评论
软件 - DockerDockerN/Adocker.com

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. The UniProt Consortium et al. UniProt: The universal protein knowledgebase in 2021. Nucleic Acids Research. 49, D480-D489 (2021).
  2. Davis, A. P., et al. Comparative toxicogenomics database (CTD): Update 2023. Nucleic Acids Research. 51, D1257-D1262 (2023).
  3. Mohtashamian, M., Abeysinghe, R., Hao, X., Cui, L. Identifying missing IS-A relations in orphanet rare disease ontology. Proceedings. IEEE International Conference on Bioinformatics and Biomedicine. 2022, 3274-3279 (2022).
  4. Rehm, H. L., et al. ClinGen - The clinical genome resource. New England Journal of Medicine. 372 (23), 2235-2242 (2015).
  5. Caulfield, M., et al. The National Genomics Research and Healthcare Knowledgebase. , (2019).
  6. Ma, X., Lee, H., Wang, L., Sun, F. CGI: A new approach for prioritizing genes by combining gene expression and protein-protein interaction data. Bioinformatics. 23 (2), 215-221 (2007).
  7. Gutiérrez-Sacristán, A., et al. Text mining and expert curation to develop a database on psychiatric diseases and their genes. Database. 2017, 043(2017).
  8. Sigdel, D., et al. Cloud-based phrase mining and analysis of user-defined phrase-category association in biomedical publications. Journal of Visualized Experiments. (144), e59108(2019).
  9. Yu, K. -H., et al. Systematic protein prioritization for targeted proteomics studies through literature mining. Journal of Proteome Research. 17 (4), 1383-1396 (2018).
  10. Lau, E., et al. Identifying high-priority proteins across the human diseasome using semantic similarity. Journal of Proteome Research. 17 (12), 4267-4278 (2018).
  11. Pletscher-Frankild, S., Pallejà, A., Tsafou, K., Binder, J. X., Jensen, L. J. DISEASES: Text mining and data integration of disease-gene associations. Methods. 74, 83-89 (2015).
  12. Liu, Y., Liang, Y., Wishart, D. PolySearch2: A significantly improved text-mining system for discovering associations between human diseases, genes, drugs, metabolites, toxins and more. Nucleic Acids Research. 43, W535-W542 (2015).
  13. Minot, S. S., Barry, K. C., Kasman, C., Golob, J. L., Willis, A. D. geneshot: Gene-level metagenomics identifies genome islands associated with immunotherapy response. Genome Biology. 22 (1), 135(2021).
  14. Lee, S., et al. BEST: Next-generation biomedical entity search tool for knowledge discovery from biomedical literature. PloS One. 11 (10), 0164680(2016).
  15. Wei, C. -H., Allot, A., Leaman, R., Lu, Z. PubTator central: Automated concept annotation for biomedical full text articles. Nucleic Acids Research. 47 (W1), W587-W593 (2019).
  16. Jimeno-Yepes, A. J., Sticco, J. C., Mork, J. G., Aronson, A. R. GeneRIF indexing: Sentence selection based on machine learning. BMC Bioinformatics. 14 (1), 171(2013).
  17. Wei, C. -H., et al. tmVar 2.0: Integrating genomic variant information from literature with dbSNP and ClinVar for precision medicine. Bioinformatics. 34 (1), 80-87 (2018).
  18. Maglott, D., Ostell, J., Pruitt, K. D., Tatusova, T. Entrez Gene: Gene-centered information at NCBI. Nucleic Acids Research. 33, D54-D58 (2005).
  19. Piñero, J., et al. The DisGeNET knowledge platform for disease genomics: 2019 update. Nucleic Acids Research. 48, D845-D855 (2019).
  20. Lee, J., et al. BioBERT: A pre-trained biomedical language representation model for biomedical text mining. Bioinformatics. 36 (4), 1234-1240 (2020).
  21. Szklarczyk, D., et al. STRING v11: Protein-protein association networks with increased coverage, supporting functional discovery in genome-wide experimental datasets. Nucleic Acids Research. 47, D607-D613 (2019).
  22. Gillespie, M., et al. The reactome pathway knowledgebase 2022. Nucleic Acids Research. 50, D687-D692 (2022).
  23. Fang, L., et al. GRNdb: Decoding the gene regulatory networks in diverse human and mouse conditions. Nucleic Acids Research. 49, D97-D103 (2021).
  24. Doğan, T., et al. CROssBAR: Comprehensive resource of biomedical relations with knowledge graph representations. Nucleic Acids Research. 49 (16), 96(2021).
  25. Fernández-Torras, A., Duran-Frigola, M., Bertoni, M., Locatelli, M., Aloy, P. Integrating and formatting biomedical data as pre-calculated knowledge graph embeddings in the Bioteque. Nature Communications. 13 (1), 5304(2022).
  26. Himmelstein, D. S., et al. Systematic integration of biomedical knowledge prioritizes drugs for repurposing. eLife. 6, e26726(2017).
  27. Zheng, S., et al. PharmKG: A dedicated knowledge graph benchmark for biomedical data mining. Briefings in Bioinformatics. 22 (4), (2021).
  28. Morselli Gysi, D., et al. Network medicine framework for identifying drug-repurposing opportunities for COVID-19. Proceedings of the National Academy of Sciences of the United States of America. 118 (19), 2025581118(2021).
  29. Santos, A., et al. A knowledge graph to interpret clinical proteomics data. Nature Biotechnology. 40 (5), 692-702 (2022).
  30. Cappelletti, L., et al. GraPE: Fast and scalable graph processing and embedding. arXiv. , (2021).
  31. Yang, B., Yih, W., He, X., Gao, J., Deng, L. Embedding entities and relations for learning and inference in knowledge bases. arXiv. , (2014).
  32. Neo4j Graph Data Platform. , Available from: https://neo4j.com/ (2022).
  33. Shannon, P., et al. Cytoscape: A software environment for integrated models of biomolecular interaction networks. Genome Research. 13 (11), 2498-2504 (2003).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

CaseOLAP LIFT Reactome

相关文章