本文介绍了一种计算方法(CaseOLAP LIFT)及其应用案例,用于研究线粒体蛋白及其在生物医学报告中与心血管疾病之间的关联。该方法可轻松调整,用于研究用户选定的细胞组分及相关疾病。
方法文章
本文介绍了一种计算方法(CaseOLAP LIFT)及其应用案例,用于研究线粒体蛋白及其在生物医学报告中与心血管疾病之间的关联。该方法可轻松调整,用于研究用户选定的细胞组分及相关疾病。
生物医学报告的数量正迅速增长,每份报告均包含大量实体和丰富信息,构成了生物医学文本挖掘应用的宝贵资源。这些工具可帮助研究人员整合、理解和转化这些发现,从而揭示疾病病理学和治疗学的新见解。本方案中,我们介绍 CaseOLAP LIFT,这是一种新的计算流程,旨在通过从文本数据集(例如,生物医学文献)中提取用户选定的信息,来研究细胞组分及其与疾病的关联。该软件可识别与疾病相关的文献中的亚细胞蛋白及其功能相关蛋白,并进一步识别其他与疾病相关的文献 通过 该软件的标签填补方法。为了对所得的蛋白质-疾病关联进行背景化分析,并整合来自多个相关生物医学资源的信息,系统会自动构建一个知识图谱以供进一步分析。我们展示了一个应用案例,通过在线下载约3400万篇文本文档组成的语料库,示例如何利用该方法阐明线粒体蛋白质在不同心血管疾病表型中的作用。此外,将一个深度学习模型应用于所生成的知识图谱,以预测蛋白质与疾病之间此前未被报道的关系,最终得到1,583个具有预测概率的关联结果。 >0.90,并且在测试集上的受试者工作特征曲线下面积(AUROC)为0.91。该软件具有高度可定制化和自动化的分析流程,可处理广泛范围的原始数据;因此,使用该方法可在文本语料库中更可靠地识别蛋白质与疾病之间的关联。
研究与疾病相关的蛋白质有助于加深对发病机制的科学认识,并帮助识别潜在的治疗方法。多个大型生物医学出版物文本库(例如包含3400万篇文章的PubMed,其涵盖出版物标题、摘要和全文)报道了将蛋白质与疾病关联起来的新发现。然而,这些发现分散在不同的信息来源中,必须加以整合才能产生新的生物医学见解。目前已有若干生物医学资源用于整合蛋白质-疾病关联1,2,3,4,5,6,7。然而,这些经过人工整理的资源往往不完整,可能未涵盖最新的研究成果。文本挖掘方法对于从大规模文本库中提取和综合蛋白质-疾病关联至关重要,这将有助于更全面地理解科学文献中的这些生物医学概念。
多种生物医学文本挖掘方法可用于揭示蛋白质与疾病之间的关系8,9,10,11,12,13,14,以及其他因素部分通过识别文本中提及的蛋白质、疾病或其他生物医学实体来确定这些关系13,15,16,17,18,19然而,这些工具中的大多数无法获取最新的文献,只有少数工具会定期更新8,11,13,15同样,许多工具的研究范围也有限,因为它们仅局限于预定义的广泛疾病或蛋白质9,13一些方法还容易在文本中产生假阳性识别结果;其他方法则通过使用可解释的全局蛋白质名称黑名单来解决这些问题9,11 或解释性较差的命名实体识别技术15,20尽管大多数资源仅提供预先计算的结果,但一些工具提供了交互功能 通过 网页应用程序或可访问的软件代码8,9,11.
为解决上述局限性,本文提出以下方案:结合标签填补与全文分析的CaseOLAP(CaseOLAP LIFT),作为一种灵活且可定制的平台,用于从文本数据集中研究蛋白质(例如,与特定细胞组分相关的蛋白质)与疾病之间的关联。该平台具备以下功能:自动整理基因本体(GO)术语特异性蛋白质(例如,细胞器特异性蛋白质)、填补缺失的文献主题标签、分析全文文献,以及提供分析工具和预测工具(图1、图2 和 表1)。CaseOLAP LIFT 利用用户提供的 GO 术语(例如,细胞器区室)来整理细胞器特异性蛋白质,并利用 STRING21、Reactome22 和 GRNdb23 来识别功能相关蛋白质。通过 PubMed 标注的医学主题词表(MeSH)标签来识别与疾病研究相关的文献。对于约 15.1% 未标注标签的文献,若其标题中至少出现一个 MeSH 术语同义词,或摘要中至少出现两个,则进行标签填补,从而使此前未分类的出版物也能纳入文本挖掘分析。CaseOLAP LIFT 还允许用户在指定时间段内(例如 2012–2022 年)选择文献的特定部分进行分析(例如仅标题和摘要、全文,或排除方法部分的全文)。该软件还可半自动整理特定应用场景下的蛋白质名称黑名单,从而显著减少其他方法中存在的假阳性蛋白质-疾病关联。总体而言,这些改进增强了系统的可定制性和自动化程度,扩大了可用于分析的数据量,并从大规模生物医学文本语料库中获得更可靠的蛋白质-疾病关联结果。
CaseOLAP LIFT 整合了生物医学知识,并利用知识图谱来表示各种生物医学概念之间的关系,进而用于预测图谱中潜在的关联。近年来,基于图谱的计算方法已被应用于生物学领域,包括整合与组织生物医学概念24,25、药物再利用与开发26,27,28,以及基于蛋白质组学数据的临床决策29。
为了展示 CaseOLAP LIFT 在构建知识图谱中的应用价值,我们以线粒体蛋白与八类心血管疾病之间关联性的研究为例。通过分析约 362,000 篇与疾病相关的文献,识别出与这些疾病最相关的线粒体蛋白及通路。随后,将这些蛋白、与其功能相关的蛋白以及文本挖掘结果整合到一个知识图谱中。该知识图谱被用于基于深度学习的链接预测分析,以预测在生物医学出版物中尚未报道的蛋白-疾病关联。
引言部分介绍了本实验方案的背景信息和研究目的。接下来的部分描述了计算方案的具体步骤。随后,阐述了该方案的代表性结果。最后,我们简要讨论了该计算方案的应用场景、优势、局限性以及未来应用前景。
1. 运行 Docker 容器
2. 疾病与蛋白质的准备
3. 文本挖掘
4. 分析结果
5. 预测分析
采用本方案研究了线粒体蛋白(表2)与八类心血管疾病(表3)之间的关联,并获得了代表性结果。在这些疾病类别中,我们共识别出2012年至2022年10月期间发表的363,567篇文献(其中362,878篇通过MeSH元数据分类,6,923篇通过标签推断分类)。所有文献均包含标题,其中276,524篇含有摘要,51,065篇可获取全文。总体而言,在所查询的1,687种线粒体蛋白中,有584种在文献中被识别;在其8,026种功能相关蛋白中,有3,284种被识别。在所有疾病类别中,共发现14种独特的蛋白具有显著评分,z-score阈值为3.0(图5)。对这些蛋白进行Reactome通路分析,揭示了与所有疾病均显著相关的12条通路(图6)。所有蛋白、通路、疾病及评分数据被整合为一个知识图谱(表4)。该知识图谱用于预测12,688个新的蛋白-疾病关联,并通过概率评分0.90进行筛选,最终获得1,583个高置信度预测结果。图7展示了两个蛋白-疾病关联的突出示例,图中同时呈现了与这些蛋白功能相关的其他生物学实体。模型评估指标详见表5。

图1工作流程的动态视图。 该图展示了此工作流程的四个主要步骤。首先,根据用户提供的基因本体(GO)术语(例如细胞组分)对相关蛋白质进行整理,并根据用户提供的疾病医学主题词(MeSH)标识符确定疾病类别。其次,在文本挖掘步骤中计算蛋白质与疾病之间的关联。下载特定时间范围内的出版物并建立索引,识别出研究疾病的文献通过 MeSH 标签及可选内容 通过 推断标签),并下载和索引其全文。在出版物中查询蛋白质名称,并用于计算蛋白质-疾病关联评分。随后,通过文本挖掘,这些评分用于识别最显著的蛋白质及通路关联。最后,构建一个知识图谱,涵盖这些蛋白质、疾病及其在生物医学知识库中的相互关系。基于所构建的知识图谱,预测新的蛋白质-疾病关联。这些步骤均使用生物医学知识库和 PubMed 中最新可用的数据。 请点击此处以查看此图的放大版本。

图2工作流程的技术架构。 该工作流程的技术细节在此图中展示。用户需提供疾病类别的MeSH树编号和GO术语。从PubMed下载文本文档,根据提供的MeSH标签识别与疾病相关的文档,对缺乏主题指示性MeSH标签的文档则赋予推断得出的类别标签。获取与所提供GO术语相关的蛋白质。该蛋白质集合进一步扩展,纳入功能上相关的蛋白质 通过 蛋白质-蛋白质相互作用、共同的生物学通路以及转录因子依赖性。这些蛋白质在与疾病相关的文献中被查询,并由 CaseOLAP 进行评分。 请点击此处以查看此图的放大版本。

图 3:一份已处理文档的示例。 此处展示了一份经过解析和索引的文本文档示例。按顺序,相关字段包括索引名称(_index, _type)、PubMed ID(_id, pmid)、文档的各个子部分(title, abstract, full_text, introduction, methods, results, discussion)以及其他元数据(year, MeSH, location, journal)。出于显示目的,文档的子部分内容以省略号截断。MeSH 字段包含文档的主题,这些主题有时可能由我们的标签填补步骤提供。请点击此处查看该图的放大版本。

图 4:知识图谱模式与生物医学资源。 本图展示了知识图谱的模式结构。每个节点和边分别代表一种节点类型或边类型。心血管疾病(CVDs)与蛋白质之间的边由 CaseOLAP 分数加权。蛋白质-蛋白质相互作用(PPI)的边由 STRING 置信度分数加权。由 GRNdb/GTEx 推导出的转录因子依赖性(TFD)边、由 MeSH 推导出的疾病树边以及由 Reactome 推导出的通路边为无权重边。请点击此处查看此图的放大版本。

图5:蛋白质-疾病关联的前位结果。 本图展示了在各类疾病中具有显著性的线粒体蛋白质。对每类疾病中的CaseOLAP评分应用z分数转换,并以3.0为阈值识别显著性蛋白质。(上图) 每类疾病中显著性线粒体蛋白质的数量:这些小提琴图描绘了每类疾病中蛋白质z分数的分布情况。每个小提琴图上方显示了在该类疾病中具有显著性的蛋白质总数。在所有疾病中,共鉴定出14种独特的显著性蛋白质,其中部分蛋白质在多种疾病中均具有显著性。(下图) 高分蛋白质:热图展示了在所有疾病中平均z分数最高的前10种蛋白质。空白值表示该蛋白质与特定疾病之间无获得的评分。请点击此处查看该图的放大版本。

图6:主要通路-疾病关联。 该图展示了所研究疾病类别相关的最主要生物通路,由分析确定 通过 Reactome 通路分析。所有通路分析均经过以下筛选条件过滤: p < 0.05。热图中的数值表示通路内所有蛋白质的平均z分数。顶部在所有疾病中保守的通路:总体而言,共鉴定出14种与所有疾病类别相关的蛋白质,并揭示了12条在所有疾病类别中保守的通路。基于通路的层级结构构建了树状图,以连接具有相似生物学功能的通路。树状图的高度表示通路层级中的相对深度;较宽泛的生物学功能具有较长的分支,而更具体的通路则具有较短的分支。底部) 疾病类别特异性通路:使用在每种疾病中达到显著 z 值的蛋白质进行通路分析。取 p 值最低的前三条通路 p每种疾病相关的值均以星号标示。这些通路可能在多种疾病中均位于前三名。 请点击此处以查看此图的放大版本。

图7:应用深度学习进行知识图谱补全。 本图展示了将深度学习应用于特定疾病知识图谱的一个示例。图中预测了蛋白质与疾病之间的隐藏关系,并以蓝色标出。两种预测的计算概率均显示,数值范围为0.0至1.0,其中1.0表示高度可信的预测。图中包含多个已知相互作用的蛋白质,代表蛋白质-蛋白质相互作用、转录因子依赖性以及共享的生物学通路。为便于可视化,仅展示与高亮示例相关的少数节点构成的子图。图例:IHD = 缺血性心脏病;R-HSA-1430728 = 代谢;O14949 = 细胞色素b-c1复合物亚基8;P17568 = NADH脱氢酶(泛醌)1β亚复合物亚基7;Q9NYF8 Bcl-2相关转录因子1,得分:7.24 × 10−7;P49821 = NADH脱氢酶(泛醌)黄素蛋白1,线粒体,得分:1.06 × 10−5;P31930 = 细胞色素b-c1复合物亚基1,线粒体,得分:4.98 × 10−5;P99999 = 细胞色素c,得分:0.399。 请点击此处查看该图的放大版本。
表1:工作流程与限速步骤。 本表列出了工作流程各阶段计算时间的粗略估计。选择是否包含流程中的某些组件将影响完成分析所需的总运行时间。总时间估计值取决于可用的计算资源,包括硬件配置和软件设置。粗略估计,在我们的计算服务器(配备六个核心、32 GB内存和2 TB存储)上执行本方案的主动运行时间约为36小时,但在其他设备上可能更快或更慢。请点击此处下载该表格。
表2:细胞组分蛋白的自动组装。 本表显示了与特定细胞组分(即 GO 术语)相关的蛋白质数量,以及与这些蛋白质在功能上相关的蛋白质 通过 蛋白质-蛋白质相互作用(PPI)、共享通路(PW)和转录因子依赖性(TFD)。总蛋白质数量为上述所有类别合并后的蛋白质数目。所有功能相关蛋白质均使用 CaseOLAP LIFT 的默认参数获得。 请点击此处下载此表格。
表3:MeSH标签推断统计信息。 本表列出了疾病类别、用作该类别内所有疾病父级术语的MeSH树编号、2012年至2022年间在每个类别中检索到的PubMed文章数量,以及基于标签推断步骤额外纳入的文章数量。请点击此处下载该表格。
表4:知识图谱构建统计信息。 本表描述了所构建知识图谱的规模统计信息,包括各类节点和边的类型。CaseOLAP 分数表示蛋白质与心血管疾病(CVD)类别之间的关联关系。请点击此处下载该表格。
表5:知识图谱预测统计与验证 本表格报告了知识图谱链接预测在新型/隐含蛋白质-疾病关联上的评估指标。知识图谱的边被划分为70/30的训练集和测试集,且两个数据集均保持了边的图连通性。准确率(accuracy)表示被正确分类的预测所占比例,而平衡准确率(balanced accuracy)对类别不平衡进行了校正。特异性(specificity)表示负向预测中被正确分类的比例。精确率(precision)表示所有正向预测中正确预测所占的比例,而召回率(recall)表示在所有正向边(即已识别的蛋白质-疾病关联)中正确预测的正向预测所占比例 通过 F1分数是精确率和召回率的调和平均数。受试者工作特征曲线下面积(AUROC)用于描述模型区分阳性与阴性预测的能力,其值为1.0时表示为完美分类器。精确率-召回率曲线下面积(AUPRC)衡量在不同概率阈值下精确率与召回率之间的权衡,数值越高表明性能越好。 请点击此处下载此表格。
CaseOLAP LIFT 能够帮助研究人员探究功能蛋白(例如,与细胞组分、生物过程或分子功能相关的蛋白)与生物类别(例如,疾病)之间的关联。所述实验方案应按指定顺序执行,其中第2节和第3节为最关键步骤,因为第4节和第5节依赖于前两节的结果。作为第1节的替代方案,可从 GitHub 代码仓库(https://github.com/CaseOLAP/caseolap_lift)克隆并访问 CaseOLAP LIFT 代码。需要注意的是,尽管在软件开发过程中已进行测试,但仍可能出现程序错误。若发生错误,应重复失败的步骤;若问题持续存在,建议重新执行第1节,以确保使用的是最新版本的 Docker 容器。如需进一步帮助,可在 GitHub 仓库中提交问题以获得额外支持。
该方法通过使研究人员能够识别感兴趣的实体并揭示它们之间潜在的关联,从而支持假设的生成,而这些关联在现有的生物医学资源中可能难以直接获取。所得出的蛋白质-疾病关联使研究人员能够通过评分的可解释性指标获得新的见解:via 流行度评分表示与特定疾病相关性最强且被研究最多的蛋白质,独特性评分表示与特定蛋白质关联最独特的疾病,而综合的 CaseOLAP 评分则是上述两种评分的结合。为防止假阳性识别(例如由于同名异义词所致),一些文本挖掘工具采用术语黑名单以避免误判9,11。同样,CaseOLAP LIFT 也使用黑名单机制,但允许用户根据其具体应用场景自定义黑名单。例如,在研究冠状动脉疾病(CAD)时,"CAD" 不应被视为蛋白质 "caspase-activated deoxyribonuclease" 的名称;然而,在研究其他主题时,"CAD" 通常可能指代该蛋白质。
CaseOLAP LIFT 能够根据文本挖掘可用的数据量进行自适应调整。日期范围功能减轻了计算负担,并为假设生成提供了灵活性(例如,研究关于蛋白质-疾病关联的科学知识如何随时间演变)。同时,标签填补和全文组件扩展了可用于文本挖掘的数据范围。这两个组件默认处于关闭状态,以降低计算成本,但用户可根据需要选择启用其中任意一个。标签填补方法较为保守,其分类准确率较高(精确度为87%),但会遗漏较多其他类别的标签(召回率为2%)。该方法目前依赖基于规则的启发式策略匹配疾病关键词,未来计划通过引入文档主题建模技术来提升性能。由于大量未分类文献往往是近期发表的,因此针对较近时间段的研究(例如,过去三年内所有文献)建议关闭标签填补功能。全文组件会增加运行时间和存储需求。值得注意的是,仅有少数文献提供全文(在本研究中约占文献总数的14%)。鉴于文献方法部分提及的蛋白质名称与疾病主题相关性较低,建议在查询全文文献时排除方法部分。
所得的蛋白质-疾病关联评分可用于传统的分析方法,例如聚类分析、降维分析或富集分析(如基因本体 GO、通路分析),本软件包中已包含部分实现功能。为了将这些评分置于现有的生物医学知识背景中,系统会自动构建一个知识图谱,并可利用图谱可视化工具(如 Neo4j32、Cytoscape33)进行探索。该知识图谱还可用于预测性分析(例如未报道的蛋白质-疾病关系的链接预测、蛋白质网络的社区检测、奖励收集路径遍历方法)。
我们评估了预测的蛋白质-疾病关联的模型评价指标(表5)。该模型为每种蛋白质-疾病关联分配一个介于0.0到1.0之间的概率评分,评分越接近1.0,表示预测的置信度越高。基于AUROC、准确率、平衡准确率、特异性与召回率等多种指标对模型性能进行的内部评估表明,本研究中模型的整体性能优异。然而,评估结果也显示出模型的精确率(precision)较低(0.15),导致AUPRC和F1分数均偏低。未来改进该指标的研究将有助于提升模型的整体性能。我们预计可通过采用更先进的知识图谱嵌入方法和图预测模型来实现这一目标。根据模型0.15的精确率,研究者应预期约有15%的阳性识别结果;具体而言,在模型预测出的12,688个蛋白质-疾病关联中,约15%为真阳性关联。这一问题可通过仅考虑高概率评分的蛋白质-疾病关联(例如,>0.90)加以缓解;在我们的应用案例中,使用0.90作为概率阈值筛选后,获得了1,583个高置信度的预测关联。研究者还可手动检查这些预测结果以确保其高度有效性(参见图7作为示例)。我们对预测结果进行的外部评估表明,在来自广泛 curated 数据库DisGeNet19的310个蛋白质-疾病关联中,有103个在我们的文本挖掘研究中被识别出,另有88个关联由我们的知识图谱分析预测得出,且其概率评分>0.90。
总体而言,CaseOLAP LIFT 在设计针对大型文本语料库中功能蛋白组与多种疾病类别之间关联的定制化分析方面,具有更高的灵活性和可用性。该软件包采用全新的用户友好型命令行界面,并以 Docker 容器形式发布,从而减少了配置编程环境和软件依赖项相关的问题。用于研究心血管疾病中线粒体蛋白的 CaseOLAP LIFT 分析流程可轻松调整;例如,该技术未来的应用可扩展至探究任何与基因本体(GO)术语相关的蛋白与任何生物医学类别之间的关联。此外,该文本挖掘平台所识别出的蛋白-疾病关联排序结果,对于为高级自然语言处理技术准备数据集具有重要意义。由此生成的知识图谱可帮助研究人员将这些发现转化为具有生物学意义的知识,并为后续基于图谱的分析奠定基础。
作者无任何利益冲突需要披露。
本工作由美国国立卫生研究院(NIH)R35 HL135772(授予P.P.)、NIH T32 HL13945(授予A.R.P.和D.S.)、NIH T32 EB016640(授予A.R.P.)、美国国家科学基金会研究培训项目(NRT)1829071(授予A.R.P.和D.S.)、NIH R01 HL146739(授予I.A.、J.R.、A.V.、K.B.)以及加州大学洛杉矶分校(UCLA)TC Laubisch基金(授予P.P.)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 软件 - Docker | Docker | N/A | docker.com |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可