在这里,我们介绍了一种利用网络建模工具NetDecoder构建特定情境蛋白质相互作用网络和构建基因效用模型(GUM)的协议。利用转录组数据,结合经过精心管理的蛋白质-蛋白质相互作用(PPI)网络,NetDecoder 能够识别关键靶点和亚网络。
方法文章
在这里,我们介绍了一种利用网络建模工具NetDecoder构建特定情境蛋白质相互作用网络和构建基因效用模型(GUM)的协议。利用转录组数据,结合经过精心管理的蛋白质-蛋白质相互作用(PPI)网络,NetDecoder 能够识别关键靶点和亚网络。
差异表达分析是确定潜在治疗靶点的常用技术,但它忽视了跨生物通路基因网络的复杂性。通常,高度表达的基因不一定能解释生物表型的性质。NetDecoder 是一款网络生物学工具,将转录组数据与蛋白质-蛋白质相互作用(PPI)网络集成,以建模情境特异性信息流、基因效用、关键边缘和差异利用基因网络,正是为解决差异表达分析这一局限而开发的。
该协议是一份适合初学者的逐步使用指南,涵盖数据预处理、NetDecoder 执行及输出分析等全面指南。该工作流程包括软件配置、网络构建和基于流的建模分析,以量化生物条件间基因(节点)和基因间相互作用(边缘层面)差异。由此产生的输出包括关键靶点和路由器、差分流子网以及边缘流分布,从而能够识别与特定生物状态相关的关键调控基因和通路。遵循上述步骤后,研究人员将能够独立开展研究,利用转录组数据和精心策划的PPI网络,揭示跨表型的表型基因流动。
基因及相关通路的选择通常由差异表达分析驱动:1.该分析方法有效确定两种或多种条件下基因表达的差异。然而,基因在复杂且相互关联的生物网络中运作,这意味着单个基因表达无法完全捕捉基因在网络中的相互作用及其基因间关系2.网络传播方法将基因表达与相互作用网络整合,以识别仅靠差异表达可能遗漏的生物学重要基因3.当前的方法尚未明确量化基因的功能重要性,以及生物信息如何在蛋白质-蛋白质相互作用(PPI)网络中跨生物条件下重新分布。因此,需要一种建模条件特定网络行为并量化生物系统间信息流变化的方法。为了解释基因在更广泛生物网络中的相互作用,NetDecoder网络生物学平台被开发出来,旨在揭示各条件信息流差异最大的基因。NetDecoder 使用过程引导的流算法,结合体量 RNA 测序数据,将人类 PPI 网络的现有知识转化为构建信息流驱动交互模型。
利用表型网络的信息流数据,可以开发基因效用模型(GUM)5,识别信息流较高的基因在网络中具有最高的整体基因效用,无论其表达值如何。这种方法支持更有效的目标优先排序策略和识别,提供了传统分析常忽略的洞见。与传统的差分表达或基于相关的网络方法不同,NetDecoder 能够量化基因(节点级)和交互(边缘级)信息流的变化,使得即使没有大量表达变化,也能识别功能重要的基因 4,5。NetDecoder 广泛适用于涉及两种生物状况比较分析的体型 RNA 测序数据集,能够识别信息流和网络组织的变化。虽然NetDecoder支持整合其他组学数据集,包括蛋白质组学和表观基因组学,但当前协议专门演示了使用转录组数据的工作流程。在这些应用中,用户可以基于蛋白质或表观遗传调控基因定义源基因,从而从这些分子特征启动信息流分析。这种灵活性使多组学证据能够被纳入基于网络的分析,并促进发现表型差异背后的跨模态调控机制。
常见的研究设计包括二元比较,包括但不限于疾病与健康状况、治疗反应者与无反应者、药物治疗、敲除或敲除实验与对照组实验,以及发育或细胞状态转变的分析。该协议的目标是展示一个可重复的框架,用于应用NetDecoder以发现在生物条件下对网络影响改变的基因。这通过设置和运行 NetDecoder 的简单步骤实现,协议中还提供了基础故障排除技巧和结果解释方法。
本研究使用了公开可得的RNA测序数据集,未直接涉及人类或动物受试者。因此,无需机构审查委员会批准和知情同意。
注意:NetDecoder 需要以下输入文件:两种定义生物条件下的基因表达规范化;描述生物条件的元数据文件;网络构建和建模的源基因列表;来自公共领域的蛋白质-蛋白质相互作用(PPI)网络;以及为每种生物状况构建的边缘加权网络(EWN)。
1. 数据准备
2. 安装和配置NetDecoder
3. 运行NetDecoder
如 图1所示,NetDecoder 通过结构化工作流程运行,包括数据处理、网络配置和基于流量的分析,输出被组织到对应流水线各阶段的不同目录中。这种模块化结构使得系统性验证输出成为可能,确保结果可追溯到每个计算步骤,并支持整体可重复性。
NetDecoder的成功执行(见图2)会在四个目录 (分析、 收集、 网络和“your_shortname”) 产生输出,包含对应不同条件的数据,包括流量值、子网络及其他流-交互输出的图形和定量输出(图1、 图2和 图3).这些目录中文件和数据的填充表明管道运行正常。相比之下,失败运行的特点是缺少输出和/或数据不完整。由于NetDecoder在PPI网络中评估数千个基因,成功的运行通常需要数小时的计算,具体取决于数据集大小和可用资源。对于这里展示的代表性人类胆道癌分析,NetDecoder的运行时间约为4至6小时,运行时间为基于Linux的Puget3(Puget Systems)工作站。异常短的运行时间可能表明输入数据格式不正确或流水线执行不完整。输入数据格式错误或流水线执行失败可能导致错误信息,这些信息可追溯到问题根源。 图3 展示了成功执行NetDecoder后出现的代表性输出。本分析采用了来自255个胆道癌样本(OEP001105)6的RNA测序数据,能够比较I–II期和III–IV期疾病状态及疾病间信息流的改变。
图4中的三个热图总结了基因间网络信息流在不同条件下的整体变化,包括在网络内传递大量信息流的路由器基因、重要的下游目标基因或高度受影响的整体基因。正负差分流分布广泛表明信息是通过网络重新分布的,而非均匀增加或减少。这种异质性和多样的基因类型支持了NetDecoder识别不同表型间功能重要性改变基因的能力。
图4还展示了边缘层面条形图,量化了各条件间基因-基因对相互作用的流动变化。这些结果表明,特定相互作用中的流量会因条件而异,反映了上下文相关的网络重布线。因此,边缘流捕捉信息传递中交互层的变化,而差异流则提供节点级的这些变化总结,从而优先排序网络影响整体变化最大的基因。
这些输出综合展示了NetDecoder能够捕捉基因(节点级)、基因-基因(边缘级)和网络层面信息流的变化(见图4)。热图识别出信息传播、路由和接收在网络中发生变化的基因,而边缘层分析则揭示驱动这些变化的具体相互作用。表型特异性信息网络提供了条件间网络重布线的可视化表现,节点代表基因,边缘厚度对应信息流的大小(见图4)。这种系统层面的表征支持识别与研究疾病相关的关键调控基因和通路。此外,这些数据的成功生产表明NetDecoder的执行是正确的。
由于NetDecoder产生大量输出文件,识别最相关的结果对于解释至关重要。例如,为了检查各条件之间的流量差异(例如低阶段与高位阶段),可以使用两个关键文件(导航步骤由 图3的文件结构指导)。第一个是“EDGE_CENTERED_SUBNET_flowDifference_疾病.txt”(位于分析/疾病 目录中),用于识别在各条件之间流动变化最大的相互作用(边)。第二个“flowDifference_PRIORITIZED_NETWORK.txt”(位于“your_shortname” 目录中)用于识别流量差异最大的基因(节点)。这些文件共同提供了网络行为交互层面和基因层面变化的全面视图。
更广泛地说,“分析”文件夹包含网络路由器、关键目标和重要差分流基因的信息。“your_shortname” 文件夹包含具有表型特定数据的原始文本文件,如总流量值、关键目标和路由器。networks文件夹包含NetDecoder生成的子网络,可以在Cytoscape7中进一步分析和可视化。最后,“collect”文件夹包含整合数据和数据,提供结果的总体总结。NetDecoder 结果的进一步可视化和分析还可以通过 ggplot2、igraph、pheatmap 等 R 软件包进行。

图1:NetDecoder 流水线及一般功能的表示。 NetDecoder 需要三个一般阶段(黄框):数据处理、NetDecoder 配置和执行。这些阶段的每一步都必须严格遵循,以确保成功的结果。NetDecoder 需要两种条件的表达数据(绿色框中的示例)来预测哪些基因可能与高信息流和基因效用相关。在水龙头的类比中,基因表达水平通过水龙头的大小(即开口宽度)来表示,而基因效用或活性则反映了水龙头实际流水量,说明该路径的功能使用程度。如图所示,高表达基因(大水龙头大小)可能具有低基因效用(水流水平低),而表达水平低(水龙头大小小)的基因效用可能较高(水流水平高)。这说明了即使表达水平低于其他基因,基因在特定条件下也可能具有更高的整体重要性。底部中间的插图展示了基因如何相互连接,并经历不同程度的流动(颜色),无论它们表达多少(大小)。用BioRender创建。Blissenbach, E. (2026) https://BioRender.com/8okynbu。请点击此处查看该图的放大版本。

图2:NetDecoder通用工作流程。NetDecoder 算法的核心原则是通过信息流分析来模拟蛋白质-蛋白质相互作用(PPI)网络中的基因效用。工作流程始于数据预处理和边缘加权网络(EWN)构建。来自两种生物状态——表型1(P1)和表型2(P2)的基因表达数据,通过差异表达或模板匹配方法进行处理,以识别源基因。然后使用归一化表达矩阵构建条件特异性的EWN,其中边缘权重反映了每个表型中的基因对关系。NetDecoder 随后量化了各条件间信息流的差异,从而能够识别网络重接事件和基因效用的变化。输出包括差异信息流评分、情境特定信息网络、影响评分热图,以及促进下游生物学解释和机制发现的额外网络层级和基因层级指标。用BioRender创建。科雷亚,C.(2026)https://BioRender.com/29cmswf。请点击此处查看该图的放大版本。

图3:NetDecoder输出与文件夹结构。 该图表示用于访问结果文件以供解释的输出目录结构。斜体表示文件夹名称(在文件夹图标上),引号内的名称专门用于分析术语。收件箱图标上的数值根据颜色编码表示文件或文件类型。红色表示每个文件夹中可找到的文件类型,密钥文件以加粗并带下划线显示(flowDifference_PRIORITIZED_NETWORK.txt和EDGE_CENTERED_SUBNET_flowDifference_疾病.txt)。文件夹图标来源于 icons8(https://icons8.com)。用BioRender创建。Blissenbach, E. (2026) https://BioRender.com/8okynbu。请点击此处查看该图的放大版本。

图4:NetDecoder生成的结果示例。影响基因(A)、网络路由器(B)、关键目标(C)热量图,以及上下文特定网络(D)和边缘流条形图(E)是NetDecoder的关键输出。在本例中,使用了胆道癌表达数据集(OEP001105)比较了早期疾病(I-II期,低期)和晚期病(III-IV期,高龄)患者,并应用NetDecoder识别两组间信息差异较大的基因。每张图中红色表示流量增加,蓝色表示流量减少。网络路由器(B)是关键的中间基因,大量流量通过(收集/Disease_Network_routers.pdf),关键目标(C)是重要的下游调节因子(收集/Disease_Key_targets.pdf),流量差热图表示基因层信息流在各条件下的整体变化(分析/分析/flowDifference_heatmap.pdf)。可以可视化一个表型特异性信息网络(D),每个基因代表一个节点,基因-基因相互作用用边(线)表示(分析/EDGE_CENTERED_SUBNET_Disease)。边缘厚度对应基因间信息流动的大小。条形图(E)显示了两种选定表型之间基因-基因相互作用的边缘流动差异,低阶段对以青绿色表示,高阶段对以橙色表示(分析/Disease_keyEdges.pdf)。请点击此处查看该图的放大版本。
该协议概述了NetDecoder的实现,该网络生物学框架将基因表达数据与蛋白质-蛋白质相互作用(PPI)网络整合,以建模病症特异性信息流,并根据基因在生物系统中的功能影响优先排序。该方法的成功应用依赖于多个关键步骤、谨慎的方法选择以及对输出的正确解读。
协议的初始阶段包括检索表达式数据、生成元数据以及构建统一表达式矩阵。这些步骤对于确保与下游分析的兼容性至关重要。表达矩阵必须格式化,行为基因,列为样本,矩阵中的样本名称和元数据文件必须完全匹配。此阶段的任何不一致(如样本标识不匹配或基因名重复)将通过流程传播,导致后续步骤失败。
过滤低质量数据(如计数低、缺失值或低方差基因)尤为重要,因为这些特征会在基于相关性的网络构建中引入噪声。成功的预处理步骤通过一个干净的表达矩阵、无缺失值且基因标识符一致,与PPI网络中使用的匹配来表示。
该方案中的关键决策点是选择差异表达分析与模板匹配,以选择用于边缘加权网络(EWN)构建的源基因。差异表达分析最适合比较具有足够复制次数的明确实验组。该方法识别出在各条件间表现出统计显著表达变化的基因,并提供如log2折叠变化(log2FC)和调整p值等定量结果。成功执行通过显著和非显著基因的分布来判断,而非均匀无效结果。相比之下,当目标是识别与连续或参考谱相关的表达模式基因时,模板匹配更为适用。该方法保留基于相关强度而非差异表达大小的基因。成功的模板匹配步骤会产生一组与参考条件具有统计学显著相关性的基因。这些方法的选择会影响下游网络拓扑;差分表达强调幅度变化,而模板匹配强调协调的表达模式。
EWN构建步骤是该协议中最关键的组成部分之一。在这里,归一化的基因表达数据与PPI网络集成,计算网络中所有相互作用的成对基因-基因相关性。仅保留表达数据集与PPI网络共享的基因,确保生物学相关性和计算一致性。对于每个条件,计算所有边的皮尔逊相关系数,以及对应的p值和绝对相关系数。这些指标定义了NetDecoder使用的边缘权重。成功的EWN构建通过数千个基因-基因相关性、广泛分布的相关值以及过滤后缺失值极小来表明。此阶段失败通常由基因标识不匹配、样本量不足或表达数据归一化不当所致。常见的NetDecoder故障点通常可以通过系统验证输入文件和软件配置来解决。如果 NetDecoder 意外终止或输出不完整,用户需要检查表达矩阵和元数据文件之间的样本标识符是否相同,基因标识符在表达数据集、源基因列表和 PPI 网络间是否一致,并且表达矩阵中是否存在缺失值。如果出现错误或截断结果,用户可以验证软件安装和版本兼容性,检查执行过程中生成的日志消息,并确认每个中间步骤成功完成后再进行下游分析。检查输出文件和/或控制台消息有助于在后续分析前定位错误源头。NetDecoder 需要对文件路径、输入参数和依赖关系进行细致配置。关键步骤包括指定工作目录和库路径、基因本体和注释文件、条件特定 EWN 输入以及源基因列表。
由于流水线分阶段执行(网络条件生成、分析和结果收集),早期阶段的错误将阻碍后续阶段的成功完成。正常运行时会产生四个目录(分析、收集、网络、“your_shortname”),每个目录包含条件特定的结果。另一个实际操作正确的指标是运行时。成功的运行通常需要数小时处理,因为NetDecoder评估的是大型交互网络;极短的运行时间通常表示输入配置错误或计算步骤被跳过。
NetDecoder 与传统的基因优先级和网络分析方法有根本不同。诸如加权基因共表达网络分析(WGCNA)8 基于相关结构聚类基因的方法,但不包含方向流动或量化信息如何在网络中传播。同样,通路富集分析9发现 了功能过度代表,但未考虑交互层动态或网络连接性的变化。
NetDecoder 采用综合方法,将基因表达数据与 PPI 网络结合,以模拟病症特异性信息流。通过量化单个基因(节点级)评分和交互(边缘级)流量变化,它捕捉了网络结构和信息路由如何在各条件间重新布线。这使得识别出可能不表现出强烈差异表达但仍在介导网络行为中居中心的基因,这与基因效用模型(GUM)5相符,该模型认为信息流差异高的基因驱动条件特异性网络功能。
尽管有其优势,NetDecoder 仍有若干局限性。首先,它是一个基于建模网络信息流而非直接实验证据推断基因重要性的计算框架10。因此,其预测应被解读为需要通过生物学实验验证的假说。功能验证方法,如基因敲除研究11 或靶向扰动测定12,对于确认NetDecoder识别的高度效用基因是否真实影响所研究的生物过程或疾病状态至关重要。其次,该方法高度依赖于底层PPI网络的质量和完整性。由于PPI数据库常偏向研究充分的基因,较少被描述的相互作用可能被低估,可能限制新调控关系的发现。样本量、实验设计和数据质量的变异性也会影响网络建设和下游流量计算。第三,NetDecoder 并不假设静态边缘完全捕捉动态信息流。相反,NetDecoder 通过推断上下文特定的活动,并利用 PPI 网络作为结构先验来量化信息流,PPI 作为定义生物合理相互作用空间的支架。动态行为通过叠加状态特异性分子数据(例如基因表达)引入,有效地以上下文依赖的方式重新加权或激活网络子集。
NetDecoder 的主要目标是在静态 PPI 支架上模拟信息传播,同时保持基因(节点)之间的定量且连续的关系。相比之下,布尔网络等方法通过将蛋白质活动建模为离散的开/关状态,并由逻辑相互作用支配,提供了一种简化且可解释的动力学表示方式13。这些方法已被广泛用于在不同条件下研究基因调控和信号网络 14,15,16。然而,它们通常需要预定义的逻辑规则和蛋白质状态的离散化,这在大规模、异质的生物PPI网络中定义可能具有挑战性17。在此背景下,布尔网络建模是NetDecoder的互补方向。虽然NetDecoder捕捉的是连续的定量信息流,但整合基于逻辑规则的动态或混合离散-连续模型,可以提升条件特定信号行为的可解释性。因此,开发布尔式信息流算法为未来工作提供了有前景的方向。
NetDecoder 的未来方向包括整合更多组学数据类型,并扩展到单细胞转录组学,以提升分辨率和生物背景。例如,基于深度学习的空间转录组表达预测和补补方法旨在提升数据质量和信号恢复,但并未显式模拟交互网络间的信息流18,19。纳入多组学层级分析不仅能进一步增强预测能力,还能获得更可靠的结果。随着方法论的持续发展,NetDecoder将能够生成多层信息流,为研究科学家提供多组学验证。
作者之间没有财务利益的竞争。
图1和图2的插图使用BioRender(BioRender.com)绘制。
这项工作得到了梅奥诊所生物医学发现中心、梅奥诊所综合癌症中心(NIH;P30 CA015083)、梅奥诊所胃肠病学细胞信号中心(NIH:P30DK084567)、格伦医学研究基金会、V癌症研究基金会(S.Z.)、梅奥诊所营养肥胖研究项目、David F. 和 Margaret T. Grohne 癌症免疫学与免疫治疗项目、Schmidt Sciences,以及创新组织和美国国立卫生研究院(NIH;U19AG74879,P50CA136393,R01CA240323,R03OD038392)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AnnotationDbi | Bioconductor | 版本 1.68.0 | 注释和基因映射 |
| Bioconductor | Bioconductor | 版本 3.19 | 转录组数据分析框架和支持 DESeq2、edgeR、limma、AnnotationDbi 和生物数据库等的软件包生态系统 |
| Cytoscape | The Cytoscape Consoritum | 版本 3.10.4 | 网络可视化和分析 |
| DESeq2 | Bioconductor | 版本 1.46.0 | 差异表达分析(使用负二项分布建模) |
| dplyr | Posit Software, PBC formerly RStudio, PBC | 版本 1.1.4 | 数据操作和转换 |
| edgeR | Bioconductor | 版本 4.4.2 | 基于计数的差异表达分析 |
| ggplot2 | Posit Software, PBC formerly RStudio, PBC | 版本 4.0.0 | 数据可视化和绘图 |
| GNU Bash | GNU Project | 系统默认 | Bash,执行 NetDecoder 管道脚本 |
| igraph | igraph Development Team | 版本 2.1.4 | 网络构建和图分析 |
| Limma | Bioconductor | 版本 3.62.2 | 基因表达分析的线性建模 |
| NetDecoder | Hu Li 实验室,梅奥诊所 | (2024 Hu Li 实验室) | 通过信息流建模构建特定上下文的蛋白质相互作用网络 |
| org.Hs.eg.db | Bioconductor | 版本 3.20.0 | 人类基因注释数据库 |
| Oracle JDK | Oracle Corporation | ≥ 版本 1.8 | NetDecoder 执行的运行时环境 |
| pheatmap | Raivo Kolde | 版本 1.0.13 | 表达和相关结构的可视化 |
| R | The R Foundation | 版本 4.4.2 | 转录组和网络分析的核心环境 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可