方法文章

NetDecoder 协议,利用信息流建模从转录组数据构建上下文特异性蛋白质相互作用网络

DOI:

10.3791/70869

2026年7月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在这里,我们介绍了一种利用网络建模工具NetDecoder构建特定情境蛋白质相互作用网络和构建基因效用模型(GUM)的协议。利用转录组数据,结合经过精心管理的蛋白质-蛋白质相互作用(PPI)网络,NetDecoder 能够识别关键靶点和亚网络。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

差异表达分析是确定潜在治疗靶点的常用技术,但它忽视了跨生物通路基因网络的复杂性。通常,高度表达的基因不一定能解释生物表型的性质。NetDecoder 是一款网络生物学工具,将转录组数据与蛋白质-蛋白质相互作用(PPI)网络集成,以建模情境特异性信息流、基因效用、关键边缘和差异利用基因网络,正是为解决差异表达分析这一局限而开发的。

该协议是一份适合初学者的逐步使用指南,涵盖数据预处理、NetDecoder 执行及输出分析等全面指南。该工作流程包括软件配置、网络构建和基于流的建模分析,以量化生物条件间基因(节点)和基因间相互作用(边缘层面)差异。由此产生的输出包括关键靶点和路由器、差分流子网以及边缘流分布,从而能够识别与特定生物状态相关的关键调控基因和通路。遵循上述步骤后,研究人员将能够独立开展研究,利用转录组数据和精心策划的PPI网络,揭示跨表型的表型基因流动。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基因及相关通路的选择通常由差异表达分析驱动:1.该分析方法有效确定两种或多种条件下基因表达的差异。然而,基因在复杂且相互关联的生物网络中运作,这意味着单个基因表达无法完全捕捉基因在网络中的相互作用及其基因间关系2.网络传播方法将基因表达与相互作用网络整合,以识别仅靠差异表达可能遗漏的生物学重要基因3.当前的方法尚未明确量化基因的功能重要性,以及生物信息如何在蛋白质-蛋白质相互作用(PPI)网络中跨生物条件下重新分布。因此,需要一种建模条件特定网络行为并量化生物系统间信息流变化的方法。为了解释基因在更广泛生物网络中的相互作用,NetDecoder网络生物学平台被开发出来,旨在揭示各条件信息流差异最大的基因。NetDecoder 使用过程引导的流算法,结合体量 RNA 测序数据,将人类 PPI 网络的现有知识转化为构建信息流驱动交互模型。

利用表型网络的信息流数据,可以开发基因效用模型(GUM)5,识别信息流较高的基因在网络中具有最高的整体基因效用,无论其表达值如何。这种方法支持更有效的目标优先排序策略和识别,提供了传统分析常忽略的洞见。与传统的差分表达或基于相关的网络方法不同,NetDecoder 能够量化基因(节点级)和交互(边缘级)信息流的变化,使得即使没有大量表达变化,也能识别功能重要的基因 4,5。NetDecoder 广泛适用于涉及两种生物状况比较分析的体型 RNA 测序数据集,能够识别信息流和网络组织的变化。虽然NetDecoder支持整合其他组学数据集,包括蛋白质组学和表观基因组学,但当前协议专门演示了使用转录组数据的工作流程。在这些应用中,用户可以基于蛋白质或表观遗传调控基因定义源基因,从而从这些分子特征启动信息流分析。这种灵活性使多组学证据能够被纳入基于网络的分析,并促进发现表型差异背后的跨模态调控机制。

常见的研究设计包括二元比较,包括但不限于疾病与健康状况、治疗反应者与无反应者、药物治疗、敲除或敲除实验与对照组实验,以及发育或细胞状态转变的分析。该协议的目标是展示一个可重复的框架,用于应用NetDecoder以发现在生物条件下对网络影响改变的基因。这通过设置和运行 NetDecoder 的简单步骤实现,协议中还提供了基础故障排除技巧和结果解释方法。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用了公开可得的RNA测序数据集,未直接涉及人类或动物受试者。因此,无需机构审查委员会批准和知情同意。

注意:NetDecoder 需要以下输入文件:两种定义生物条件下的基因表达规范化;描述生物条件的元数据文件;网络构建和建模的源基因列表;来自公共领域的蛋白质-蛋白质相互作用(PPI)网络;以及为每种生物状况构建的边缘加权网络(EWN)。

1. 数据准备

  1. 检索大批量RNA测序表达数据和元数据
    1. 从公共仓库(如基因表达汇总集(GEO)下载RNA测序数据(原始基因表达计数和样本名称矩阵)及相应元数据(样本名称、条件等),或使用实验室生成的实验数据集。通常,这是一个矩阵,其中行对应基因名,列对应样本名称。
      注意:用于演示该协议的示例数据集来自国家组学数据百科全书(NODE)仓库(BioSino数据库)的访问编号OEP0011056。用户可以替换自己的大批量RNA测序数据集。
    2. 通过包含示例名称及其组或相关条件生成示例注释文件(元数据);例如,“对照”和“疾病”是常见的疾病类型。确认元数据和表达文件之间的样本名称是否匹配。
  2. 汇总表达数据与元数据
    1. 确保生成的数据矩阵包含表达计数、基因名称以及包含样本名称和条件的元数据文件。如果需要,可以使用像org这样的R包。Hs.eg.db(人类)或AnnotationDbi以匹配不同的基因标识符。
    2. 使用R或类似编程语言,从元数据文件中剔除非必要信息。
    3. 将表达式计数文件中的信息合并为一个文件,便于操作。
  3. 过滤表达式数据
    1. 通过排除基因重复、零值(NA)、低表达(<10个总计数)和/或低方差基因等,对基因表达数据矩阵进行预处理。
  4. 数据预处理
    1. RNA测序归一化与差异表达分析
      注意:这一步是两种(1.4.2)方法之一,用于选择用于边缘加权网络(EWN)创建和源基因选择(步骤1.5–1.6),适用于从大批量RNA测序数据开始分析时。另外,跳到步骤1.4.3可以使用基于Pearson相关的模板匹配。
      1. 在此阶段使用R软件包AnnotationDbi,配合单个生物体包进行基因ID转换。NetDecoder 使用与示例 PPI 相匹配的基因符号(即基因 ID)。
      2. 使用R软件包Limma、edgeR、DESeq2或类似工具,在两种条件下进行归一化和微分表达式分析。
      3. 如果使用 DESeq2,请使用 DESeqDataSetFromMatrix() 函数构建一个 DESeq 数据集,输入为计数矩阵(基因和样本)和样本元数据(条件)。
      4. 在步骤1.4.1.3创建的对象上使用DESeq()函数,默认设置来计算微分表达式值。
      5. 将结果保存在一个数据矩阵中,列名中包含基因标识符(Gene ID)和关键输出(log2折叠变更(log2FC)、p值和调整后的p值。
      6. 可选地,使用dplyr或类似工具通过调整后的p值(<0.05)和/或log2FC值(例如:|log2FC| > 1)来过滤结果。
      7. 确保所有处理过的基因列表和log2折叠变化矩阵都导出为制表符分隔(.txt或.csv)文件,输入到NetDecoder中。
      8. 如果使用了超过2种生物条件,则在步骤1.4.1进行成对比较,并使用步骤1.4.1.5中生成的DESeq对象的results()函数获得成对结果。
    2. 微阵列表达式归一化——可选
      注意:如果使用微阵列数据,请执行此步骤进行数据归一化。
      1. 通过打开NetDecoder规范化脚本(HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize进行数据规范化。R),在R开发平台上从 https://github.com/HuLiLab/NetDecoder_Example/tree/main 访问,并编辑斜体部分以匹配包含单元强度文件(CEL)的工作目录。
        setWD(~/NetDecoder_Example/raw_data/CEL_files)
    3. 模板匹配 - 可选
      注意:如果不进行差分表达式分析(如“数据准备”步骤1.1–1.4.1中所述),这是第二个可选方法。
      1. 对于未通过limma、edgeR和DESeq2处理的RNA测序数据,应在外部进行归一化后再应用模板匹配。对于微阵列数据,直接使用步骤1.1–1.4.2中生成的归一化表达式值。
      2. 选择对照条件作为基因表达的基线模板,并比较所有其他相关条件的归一化基因表达值。
      3. 计算每个基因表达谱与所选模板之间的Pearson相关系数。建议保留具有统计显著相关性(p < 0.05)且绝对相关系数高于用户定义阈值的基因(如 |r| > 0.7)。
  5. 源基因的选择
    注意:本步输入为第1.1–1.4步中开发的归一化基因表达矩阵。
    1. 选择一组重要基因作为来源基因。对于基于差分表达式的工作流程,选择调整后的p值和log2FC阈值(例如adj p值<0.05和|log2FC| > 2)。对于模板匹配工作流程,使用选定的相关性和显著性阈值,从步骤1.4.3.3中识别出的显著相关基因中选择源基因。应选择阈值以产生约300–1000个基因,用于下游网络构建。
      注意:源基因是信息流的起点,并通过网络传播。
  6. 为每个表型构建一个边缘加权网络(EWN)
    注意:此步骤需要以下输入:步骤1.1–1.4中开发的归一化基因表达矩阵;蛋白质-蛋白质相互作用(PPI)网络,格式化为边缘列表(基因A-geneB对);一个标注样本文件(元数据),指定每个样本的生物状态标签。PPI网络作为R对象共享,基于iRefIndex蛋白质数据库构建。该协议中使用的版本包含所有直接交互,但排除了自环和多边。PPI网络包含15,608个蛋白质和180,044个相互作用。更多细节请参见NetDecoder-方法第4节。
    1. 打开NetDecoder边缘加权网络(EWN)脚本(HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN。R,可通过 https:/github.com/HuLiLab/NetDecoder_Example/tree/main)4 访问,在 R-development 平台中访问。
    2. 编辑脚本中注释(下方斜体)的部分,以设置用户专用路径和输入文件,用于EWN开发。
      路径<~/NetDecoder_Example/输入/
      这是通往工作目录的路径
      expQuery <- get(load(“expBreastCancer_15Set2014.R”)
      这是一个归一化表达式矩阵 Rdata 对象的一个例子
      stQuery < read.csv(“stBreastCancer.csv”
      这是样本元数据
    3. 对表达矩阵进行过滤,只保留PPI网络中的基因。
    4. 对于每种条件,按表型筛选子集样本,并利用Pearson相关计算PPI网络中所有定义边的两对基因相关性。使用步骤1.4生成的处理、归一化表达式矩阵计算相关性。
    5. 对每对基因,计算相关系数、绝对相关及相关的p值。
    6. 删除不完整的案例(例如,NA值)。
    7. 每个条件导出一个边权网络,作为带制表符分隔的文件(无头部),列为:proteinA、proteinB、abs_cor、cor 和 pvalue。
    8. 执行R脚本,为所有相关条件创建共表达式网络。

2. 安装和配置NetDecoder

  1. 下载NetDecoder
    1. 在(https://netdecoder.hulilab.org/#ver)访问NetDecoder软件,选择R或Java。
  2. 安装必需软件
    1. 安装Oracle JDK和R来处理工作/分析环境。
    2. 使用Bioconductor (https://netdecoder.hulilab.org/#ver)4,安装NetDecoder文档中列出的必需R包。
  3. 下载依赖
    1. 下载NetDecoder所需的依赖,包括基因本体数据(可从 https://geneontology.org/docs/download-ontology/ 访问)以及基因关联参考指南(可从 https://www.ebi.ac.uk/GOA/human_release 访问)。
  4. 建立工作目录
    1. 将所有下载的文件(表达数据、每种条件生成的共表达网络、基因本体数据和关联参考指南)转移到一个文件夹中,该文件夹将成为NetDecoder工作目录。
  5. 添加必要的文件夹
    1. 将NetDecoder文件夹(https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip)下载到NetDecoder工作目录中。
    2. 解压NetDecoder文件夹。

3. 运行NetDecoder

  1. 打开分析bash脚本
    1. 打开运行GNU Bash的终端,导航到NetDecoder工作目录。
    2. 运行 命令nano NetDecoder_Analysis.sh 打开bash脚本。
  2. 修改脚本
    注意:大部分代码已经写好了。在此步骤中,脚本中指定位置的参数。
    1. 简短命名:
      将斜体部分编辑为比较条件:myshortname='Your_shortname_here'
    2. 设置软件路径:
      通过编辑斜体部分,将以下三个路径定义编辑为正确的路径:
      JAVA=“/your/path/here”
      导出 R=”/你的/路径/在这里”
      别名 R=“/your/path/here”
    3. 设置工作目录:
      将斜体部分编辑为所有文件访问的工作流程目录:INPUT_DIR=“/your/path/here”
    4. Set NetDecoder 库:
      将斜体部分编辑为从zip文件中安装的NetDecoder库路径:LIB_DIR=“/your/path/here/netdecoder_lib”
    5. 设定基因本体和关联路径:
      将以下斜体化的两个目录部分编辑为首选基因本体/关联文件的位置。
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_file
    6. 设置输入参数:
      根据参考NetDecoder脚本中注释的指示,更新以下五行斜体部分。
      geneList=$INPUT_DIR/gene_file
      state_trt=治疗状况
      state_ref=参考条件

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/reference_co_expression_network_file
    7. 设置合适的舞台:
      取消注释(去除#符号)执行阶段,完成后重新注释。第一阶段是gen_net_trt,然后是gen_net_ref,然后是分析阶段,最后是收集阶段。
      设定执行阶段,从第一阶段开始。
      #STAGE=“gen_net_trt”
      #STAGE=“gen_net_ref”
      #STAGE=“分析”
      #STAGE=“收款”
    8. 导航至主Bash终端:
      按Ctrl+X,然后按Y,保存并退出bash脚本。
  3. 执行NetDecoder
    注意:如果运行成功,日志消息会显示在终端中。
    1. 导航到终端并运行 ./NetDecoder_Analysis.sh。
    2. 按照步骤3.2.7中列出的顺序执行这些阶段,直到四个阶段单独完成。
  4. 检索结果
    1. 导航到输出文件和图形摘要。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

图1所示,NetDecoder 通过结构化工作流程运行,包括数据处理、网络配置和基于流量的分析,输出被组织到对应流水线各阶段的不同目录中。这种模块化结构使得系统性验证输出成为可能,确保结果可追溯到每个计算步骤,并支持整体可重复性。

NetDecoder的成功执行(见图2)会在四个目录 (分析收集网络和“your_shortname”) 产生输出,包含对应不同条件的数据,包括流量值、子网络及其他流-交互输出的图形和定量输出(图1图2图3).这些目录中文件和数据的填充表明管道运行正常。相比之下,失败运行的特点是缺少输出和/或数据不完整。由于NetDecoder在PPI网络中评估数千个基因,成功的运行通常需要数小时的计算,具体取决于数据集大小和可用资源。对于这里展示的代表性人类胆道癌分析,NetDecoder的运行时间约为4至6小时,运行时间为基于Linux的Puget3(Puget Systems)工作站。异常短的运行时间可能表明输入数据格式不正确或流水线执行不完整。输入数据格式错误或流水线执行失败可能导致错误信息,这些信息可追溯到问题根源。 图3 展示了成功执行NetDecoder后出现的代表性输出。本分析采用了来自255个胆道癌样本(OEP001105)6的RNA测序数据,能够比较I–II期和III–IV期疾病状态及疾病间信息流的改变。

图4中的三个热图总结了基因间网络信息流在不同条件下的整体变化,包括在网络内传递大量信息流的路由器基因、重要的下游目标基因或高度受影响的整体基因。正负差分流分布广泛表明信息是通过网络重新分布的,而非均匀增加或减少。这种异质性和多样的基因类型支持了NetDecoder识别不同表型间功能重要性改变基因的能力。

图4还展示了边缘层面条形图,量化了各条件间基因-基因对相互作用的流动变化。这些结果表明,特定相互作用中的流量会因条件而异,反映了上下文相关的网络重布线。因此,边缘流捕捉信息传递中交互层的变化,而差异流则提供节点级的这些变化总结,从而优先排序网络影响整体变化最大的基因。

这些输出综合展示了NetDecoder能够捕捉基因(节点级)、基因-基因(边缘级)和网络层面信息流的变化(见图4)。热图识别出信息传播、路由和接收在网络中发生变化的基因,而边缘层分析则揭示驱动这些变化的具体相互作用。表型特异性信息网络提供了条件间网络重布线的可视化表现,节点代表基因,边缘厚度对应信息流的大小(见图4)。这种系统层面的表征支持识别与研究疾病相关的关键调控基因和通路。此外,这些数据的成功生产表明NetDecoder的执行是正确的。

由于NetDecoder产生大量输出文件,识别最相关的结果对于解释至关重要。例如,为了检查各条件之间的流量差异(例如低阶段与高位阶段),可以使用两个关键文件(导航步骤由 图3的文件结构指导)。第一个是“EDGE_CENTERED_SUBNET_flowDifference_疾病.txt”(位于分析/疾病 目录中),用于识别在各条件之间流动变化最大的相互作用(边)。第二个“flowDifference_PRIORITIZED_NETWORK.txt”(位于“your_shortname” 目录中)用于识别流量差异最大的基因(节点)。这些文件共同提供了网络行为交互层面和基因层面变化的全面视图。

更广泛地说,“分析”文件夹包含网络路由器、关键目标和重要差分流基因的信息。“your_shortname” 文件夹包含具有表型特定数据的原始文本文件,如总流量值、关键目标和路由器。networks文件夹包含NetDecoder生成的子网络,可以在Cytoscape7中进一步分析和可视化。最后,“collect”文件夹包含整合数据和数据,提供结果的总体总结。NetDecoder 结果的进一步可视化和分析还可以通过 ggplot2、igraph、pheatmap 等 R 软件包进行。

figure-results-1
图1NetDecoder 流水线及一般功能的表示。 NetDecoder 需要三个一般阶段(黄框):数据处理、NetDecoder 配置和执行。这些阶段的每一步都必须严格遵循,以确保成功的结果。NetDecoder 需要两种条件的表达数据(绿色框中的示例)来预测哪些基因可能与高信息流和基因效用相关。在水龙头的类比中,基因表达水平通过水龙头的大小(即开口宽度)来表示,而基因效用或活性则反映了水龙头实际流水量,说明该路径的功能使用程度。如图所示,高表达基因(大水龙头大小)可能具有低基因效用(水流水平低),而表达水平低(水龙头大小小)的基因效用可能较高(水流水平高)。这说明了即使表达水平低于其他基因,基因在特定条件下也可能具有更高的整体重要性。底部中间的插图展示了基因如何相互连接,并经历不同程度的流动(颜色),无论它们表达多少(大小)。用BioRender创建。Blissenbach, E. (2026) https://BioRender.com/8okynbu。请点击此处查看该图的放大版本。

figure-results-2
图2NetDecoder通用工作流程。NetDecoder 算法的核心原则是通过信息流分析来模拟蛋白质-蛋白质相互作用(PPI)网络中的基因效用。工作流程始于数据预处理和边缘加权网络(EWN)构建。来自两种生物状态——表型1(P1)和表型2(P2)的基因表达数据,通过差异表达或模板匹配方法进行处理,以识别源基因。然后使用归一化表达矩阵构建条件特异性的EWN,其中边缘权重反映了每个表型中的基因对关系。NetDecoder 随后量化了各条件间信息流的差异,从而能够识别网络重接事件和基因效用的变化。输出包括差异信息流评分、情境特定信息网络、影响评分热图,以及促进下游生物学解释和机制发现的额外网络层级和基因层级指标。用BioRender创建。科雷亚,C.(2026)https://BioRender.com/29cmswf。请点击此处查看该图的放大版本。

figure-results-3
图3NetDecoder输出与文件夹结构。 该图表示用于访问结果文件以供解释的输出目录结构。斜体表示文件夹名称(在文件夹图标上),引号内的名称专门用于分析术语。收件箱图标上的数值根据颜色编码表示文件或文件类型。红色表示每个文件夹中可找到的文件类型,密钥文件以加粗并带下划线显示(flowDifference_PRIORITIZED_NETWORK.txt和EDGE_CENTERED_SUBNET_flowDifference_疾病.txt)。文件夹图标来源于 icons8(https://icons8.com)。用BioRender创建。Blissenbach, E. (2026) https://BioRender.com/8okynbu。请点击此处查看该图的放大版本。

figure-results-4
图4NetDecoder生成的结果示例。影响基因(A)、网络路由器(B)、关键目标(C)热量图,以及上下文特定网络(D)和边缘流条形图(E)是NetDecoder的关键输出。在本例中,使用了胆道癌表达数据集(OEP001105)比较了早期疾病(I-II期,低期)和晚期病(III-IV期,高龄)患者,并应用NetDecoder识别两组间信息差异较大的基因。每张图中红色表示流量增加,蓝色表示流量减少。网络路由器(B)是关键的中间基因,大量流量通过(收集/Disease_Network_routers.pdf),关键目标(C)是重要的下游调节因子(收集/Disease_Key_targets.pdf),流量差热图表示基因层信息流在各条件下的整体变化(分析/分析/flowDifference_heatmap.pdf)。可以可视化一个表型特异性信息网络(D),每个基因代表一个节点,基因-基因相互作用用边(线)表示(分析/EDGE_CENTERED_SUBNET_Disease)。边缘厚度对应基因间信息流动的大小。条形图(E)显示了两种选定表型之间基因-基因相互作用的边缘流动差异,低阶段对以青绿色表示,高阶段对以橙色表示(分析/Disease_keyEdges.pdf)。请点击此处查看该图的放大版本。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议概述了NetDecoder的实现,该网络生物学框架将基因表达数据与蛋白质-蛋白质相互作用(PPI)网络整合,以建模病症特异性信息流,并根据基因在生物系统中的功能影响优先排序。该方法的成功应用依赖于多个关键步骤、谨慎的方法选择以及对输出的正确解读。

协议的初始阶段包括检索表达式数据、生成元数据以及构建统一表达式矩阵。这些步骤对于确保与下游分析的兼容性至关重要。表达矩阵必须格式化,行为基因,列为样本,矩阵中的样本名称和元数据文件必须完全匹配。此阶段的任何不一致(如样本标识不匹配或基因名重复)将通过流程传播,导致后续步骤失败。

过滤低质量数据(如计数低、缺失值或低方差基因)尤为重要,因为这些特征会在基于相关性的网络构建中引入噪声。成功的预处理步骤通过一个干净的表达矩阵、无缺失值且基因标识符一致,与PPI网络中使用的匹配来表示。

该方案中的关键决策点是选择差异表达分析与模板匹配,以选择用于边缘加权网络(EWN)构建的源基因。差异表达分析最适合比较具有足够复制次数的明确实验组。该方法识别出在各条件间表现出统计显著表达变化的基因,并提供如log2折叠变化(log2FC)和调整p值等定量结果。成功执行通过显著和非显著基因的分布来判断,而非均匀无效结果。相比之下,当目标是识别与连续或参考谱相关的表达模式基因时,模板匹配更为适用。该方法保留基于相关强度而非差异表达大小的基因。成功的模板匹配步骤会产生一组与参考条件具有统计学显著相关性的基因。这些方法的选择会影响下游网络拓扑;差分表达强调幅度变化,而模板匹配强调协调的表达模式。

EWN构建步骤是该协议中最关键的组成部分之一。在这里,归一化的基因表达数据与PPI网络集成,计算网络中所有相互作用的成对基因-基因相关性。仅保留表达数据集与PPI网络共享的基因,确保生物学相关性和计算一致性。对于每个条件,计算所有边的皮尔逊相关系数,以及对应的p值和绝对相关系数。这些指标定义了NetDecoder使用的边缘权重。成功的EWN构建通过数千个基因-基因相关性、广泛分布的相关值以及过滤后缺失值极小来表明。此阶段失败通常由基因标识不匹配、样本量不足或表达数据归一化不当所致。常见的NetDecoder故障点通常可以通过系统验证输入文件和软件配置来解决。如果 NetDecoder 意外终止或输出不完整,用户需要检查表达矩阵和元数据文件之间的样本标识符是否相同,基因标识符在表达数据集、源基因列表和 PPI 网络间是否一致,并且表达矩阵中是否存在缺失值。如果出现错误或截断结果,用户可以验证软件安装和版本兼容性,检查执行过程中生成的日志消息,并确认每个中间步骤成功完成后再进行下游分析。检查输出文件和/或控制台消息有助于在后续分析前定位错误源头。NetDecoder 需要对文件路径、输入参数和依赖关系进行细致配置。关键步骤包括指定工作目录和库路径、基因本体和注释文件、条件特定 EWN 输入以及源基因列表。

由于流水线分阶段执行(网络条件生成、分析和结果收集),早期阶段的错误将阻碍后续阶段的成功完成。正常运行时会产生四个目录(分析、收集、网络、“your_shortname”),每个目录包含条件特定的结果。另一个实际操作正确的指标是运行时。成功的运行通常需要数小时处理,因为NetDecoder评估的是大型交互网络;极短的运行时间通常表示输入配置错误或计算步骤被跳过。

NetDecoder 与传统的基因优先级和网络分析方法有根本不同。诸如加权基因共表达网络分析(WGCNA)8 基于相关结构聚类基因的方法,但不包含方向流动或量化信息如何在网络中传播。同样,通路富集分析9发现 了功能过度代表,但未考虑交互层动态或网络连接性的变化。

NetDecoder 采用综合方法,将基因表达数据与 PPI 网络结合,以模拟病症特异性信息流。通过量化单个基因(节点级)评分和交互(边缘级)流量变化,它捕捉了网络结构和信息路由如何在各条件间重新布线。这使得识别出可能不表现出强烈差异表达但仍在介导网络行为中居中心的基因,这与基因效用模型(GUM)5相符,该模型认为信息流差异高的基因驱动条件特异性网络功能。

尽管有其优势,NetDecoder 仍有若干局限性。首先,它是一个基于建模网络信息流而非直接实验证据推断基因重要性的计算框架10。因此,其预测应被解读为需要通过生物学实验验证的假说。功能验证方法,如基因敲除研究11 或靶向扰动测定12,对于确认NetDecoder识别的高度效用基因是否真实影响所研究的生物过程或疾病状态至关重要。其次,该方法高度依赖于底层PPI网络的质量和完整性。由于PPI数据库常偏向研究充分的基因,较少被描述的相互作用可能被低估,可能限制新调控关系的发现。样本量、实验设计和数据质量的变异性也会影响网络建设和下游流量计算。第三,NetDecoder 并不假设静态边缘完全捕捉动态信息流。相反,NetDecoder 通过推断上下文特定的活动,并利用 PPI 网络作为结构先验来量化信息流,PPI 作为定义生物合理相互作用空间的支架。动态行为通过叠加状态特异性分子数据(例如基因表达)引入,有效地以上下文依赖的方式重新加权或激活网络子集。

NetDecoder 的主要目标是在静态 PPI 支架上模拟信息传播,同时保持基因(节点)之间的定量且连续的关系。相比之下,布尔网络等方法通过将蛋白质活动建模为离散的开/关状态,并由逻辑相互作用支配,提供了一种简化且可解释的动力学表示方式13。这些方法已被广泛用于在不同条件下研究基因调控和信号网络 14,15,16。然而,它们通常需要预定义的逻辑规则和蛋白质状态的离散化,这在大规模、异质的生物PPI网络中定义可能具有挑战性17。在此背景下,布尔网络建模是NetDecoder的互补方向。虽然NetDecoder捕捉的是连续的定量信息流,但整合基于逻辑规则的动态或混合离散-连续模型,可以提升条件特定信号行为的可解释性。因此,开发布尔式信息流算法为未来工作提供了有前景的方向。

NetDecoder 的未来方向包括整合更多组学数据类型,并扩展到单细胞转录组学,以提升分辨率和生物背景。例如,基于深度学习的空间转录组表达预测和补补方法旨在提升数据质量和信号恢复,但并未显式模拟交互网络间的信息流18,19。纳入多组学层级分析不仅能进一步增强预测能力,还能获得更可靠的结果。随着方法论的持续发展,NetDecoder将能够生成多层信息流,为研究科学家提供多组学验证。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者之间没有财务利益的竞争。
图1和图2的插图使用BioRender(BioRender.com)绘制。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

这项工作得到了梅奥诊所生物医学发现中心、梅奥诊所综合癌症中心(NIH;P30 CA015083)、梅奥诊所胃肠病学细胞信号中心(NIH:P30DK084567)、格伦医学研究基金会、V癌症研究基金会(S.Z.)、梅奥诊所营养肥胖研究项目、David F. 和 Margaret T. Grohne 癌症免疫学与免疫治疗项目、Schmidt Sciences,以及创新组织和美国国立卫生研究院(NIH;U19AG74879,P50CA136393,R01CA240323,R03OD038392)。

材料

本文使用的材料清单
姓名公司目录编号评论
AnnotationDbiBioconductor版本 1.68.0注释和基因映射
BioconductorBioconductor版本 3.19转录组数据分析框架和支持 DESeq2、edgeR、limma、AnnotationDbi 和生物数据库等的软件包生态系统
CytoscapeThe Cytoscape Consoritum版本 3.10.4网络可视化和分析
DESeq2Bioconductor版本 1.46.0差异表达分析(使用负二项分布建模)
dplyrPosit Software, PBC formerly RStudio, PBC版本 1.1.4数据操作和转换
edgeRBioconductor版本 4.4.2基于计数的差异表达分析
ggplot2Posit Software, PBC formerly RStudio, PBC版本 4.0.0数据可视化和绘图
GNU BashGNU Project系统默认Bash,执行 NetDecoder 管道脚本
igraphigraph Development Team版本 2.1.4网络构建和图分析
LimmaBioconductor版本 3.62.2基因表达分析的线性建模
NetDecoderHu Li 实验室,梅奥诊所(2024 Hu Li 实验室)通过信息流建模构建特定上下文的蛋白质相互作用网络
org.Hs.eg.dbBioconductor版本 3.20.0人类基因注释数据库
Oracle JDKOracle Corporation≥ 版本 1.8NetDecoder 执行的运行时环境
pheatmapRaivo Kolde版本 1.0.13表达和相关结构的可视化
RThe R Foundation版本 4.4.2转录组和网络分析的核心环境

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
视频即将推出

相关文章