需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于信息流建模的转录组数据构建情境特异性蛋白质相互作用网络的NetDecoder实验方案

85 次观看

DOI:

10.3791/70869

2026年7月31日

本文内容

摘要

本文介绍了一种利用网络建模工具NetDecoder构建特定上下文的蛋白质相互作用网络并建立基因效用模型(GUMs)的实验方案。通过整合转录组学数据与经过人工审编的蛋白质-蛋白质相互作用(PPI)网络,NetDecoder能够识别关键靶点和子网络。

摘要

差异表达分析是一种常用于确定潜在治疗靶点的技术,但它忽略了生物通路中基因网络的复杂性。通常,高表达的基因并不一定能够解释生物表型的特性。为解决差异表达分析的这一局限性,开发了NetDecoder这一网络生物学工具,该工具将转录组数据与蛋白质-蛋白质相互作用(PPI)网络相结合,用于建模特定生物学背景下的信息流、基因功能重要性以及关键连接边和差异利用的基因网络。

本方案为初学者提供了一个循序渐进使用 NetDecoder 的详细指南,涵盖数据预处理、NetDecoder 执行及输出结果分析的完整流程。该工作流程包括软件配置、网络构建以及基于流的建模分析,用于量化不同生物条件下基因(节点)及基因-基因相互作用(边水平)的差异。最终输出结果包括关键靶点和路由基因、差异流子网络以及边流分布情况,有助于识别与特定生物状态相关的关键调控基因和通路。在完成所述步骤后,研究人员将能够利用转录组数据和 curated PPI 网络独立开展研究,揭示跨表型的表型基因流动特征。

引言

用于治疗研究的基因及其相关通路的选择通常由差异表达分析驱动1。该分析方法在确定两个或多个条件下基因表达的差异方面具有较高有效性。然而,基因在复杂且相互关联的生物网络中发挥作用,这意味着单个基因的表达并不能充分反映基因在网络中的相互作用及其基因-基因关系2。网络传播方法将基因表达数据与相互作用网络相结合,以识别仅通过差异表达分析可能遗漏的具有重要生物学意义的基因3。目前的方法并未明确量化基因的功能重要性,以及在不同生物学条件下生物信息在蛋白质-蛋白质相互作用(PPI)网络中的重新分布情况。因此,亟需一种能够建模特定条件下网络行为并量化跨生物系统信息流变化的方法。为了系统性地考虑基因在更广泛的生物网络中的相互作用,研究人员开发了NetDecoder这一网络生物学平台,用于识别在不同条件之间具有最大信息流差异的基因。NetDecoder采用一种过程引导的流算法,整合人类PPI网络的已有知识与批量RNA测序数据,构建基于信息流驱动的相互作用模型4

利用表型网络的信息流数据,可构建基因效用模型(GUM)5,以识别在网络中信息流最高的基因,这些基因具有最高的整体基因效用,而无需考虑其差异表达水平。该方法支持更有效的靶点优先排序策略与识别,能够提供传统分析方法常忽略的生物学洞见。与传统的差异表达分析或基于相关性的网络方法不同,NetDecoder 可量化基因(节点水平)和相互作用(边水平)在信息流上的变化,从而识别功能上重要的基因,即使其表达水平未发生显著改变4,5。NetDecoder 可广泛应用于涉及两种生物学条件之间比较的批量 RNA 测序数据集,用于识别信息流和网络结构的变化。尽管 NetDecoder 支持整合其他组学数据集(如蛋白质组学和表观基因组学),本实验方案重点以转录组数据为例演示其工作流程。在这些应用中,用户可根据蛋白质或表观遗传调控的基因定义源基因,从而从这些分子特征启动信息流分析。这种灵活性使得多组学证据可被整合到基于网络的分析中,有助于揭示表型差异背后的跨模态调控机制。

常见的研究设计包括二元比较,涵盖但不限于疾病与健康状态、治疗应答者与非应答者、药物处理、基因敲低或敲除与对照实验之间的比较,以及发育过程或细胞状态转变的分析。本实验方案旨在展示一个可重复的框架,用于应用 NetDecoder 来揭示在不同生物学条件下网络影响力发生改变的基因。本方案提供了易于遵循的步骤,指导 NetDecoder 的设置与运行,同时包含示例以辅助操作,并介绍了基本的故障排除技术以及结果解读方法。

访问受限。请登录或开始试用以查看此内容。

方案

本研究使用了公开可用的RNA测序数据集,未直接涉及人类或动物受试者,因此无需机构审查委员会批准和知情同意。

注意:NetDecoder 需要以下输入文件:两种特定生物条件下标准化的基因表达数据;描述生物条件的元数据文件;用于网络构建和建模的源基因列表;来自公共领域的蛋白质-蛋白质相互作用(PPI)网络;以及为每种生物条件构建的边加权网络(EWN)。

1. 数据准备

  1. 获取批量 RNA 测序表达数据和元数据
    1. 从公共数据库(例如基因表达综合数据库 Gene Expression Omnibus, GEO)下载 RNA 测序数据(原始基因表达计数矩阵及样本名称)以及相应的元数据(样本名称、实验条件等),或使用实验室自产的实验数据集。通常,该数据矩阵的行对应基因名称,列对应样本名称。
      注:本方案示例所用数据集来自国家组学数据百科全书(NODE)数据库(BioSino 数据库),编号 OEP0011056。用户可替换为自有的批量 RNA 测序数据集。
    2. 通过包含样本名称及其分组或相关条件(例如“对照”和“疾病”)生成样本注释文件(元数据)。确认元数据文件与表达数据文件中的样本名称一致。
  2. 整合表达数据与元数据
    1. 确保生成的数据矩阵包含表达计数、基因名称,以及包含样本名称和实验条件的元数据文件。如有需要,可使用 R 软件包(如 org.Hs.eg.db(人类)或 AnnotationDbi)匹配不同的基因标识符。
    2. 使用 R 或类似编程语言修剪元数据文件中的非必要信息。
    3. 将表达计数文件中的信息合并为单个文件,以便于后续操作。
  3. 过滤表达数据
    1. 对基因表达数据矩阵进行预处理,排除基因重复项、空值(NA)、低表达(<10 总计数)和/或低方差基因等。
  4. 数据预处理
    1. RNA 测序数据归一化与差异表达分析
      注:此步骤是基于批量 RNA 测序数据开始分析时,用于构建边加权网络(EWN)及选择源基因(步骤 1.5–1.6)的两种方法中的第一种(1.4.1)。作为替代方案,可跳至步骤 1.4.3,采用基于皮尔逊相关性的模板匹配方法。
      1. 在此阶段使用 R 软件包 AnnotationDbi 及针对特定生物体的配套软件包进行基因 ID 转换。NetDecoder 使用与示例 PPI 匹配的基因符号(即 Gene ID)。
      2. 使用 R 软件包 limma、edgeR、DESeq2 或类似工具,在两种实验条件之间进行数据归一化和差异表达分析。
      3. 若使用 DESeq2,需使用 DESeqDataSetFromMatrix() 函数构建 DESeq 数据集,输入为计数矩阵(基因与样本)和样本元数据(实验条件)。
      4. 对步骤 1.4.1.3 中创建的对象使用 DESeq() 函数并采用默认设置,以计算差异表达值。
      5. 将结果保存为数据矩阵,其中行名为基因标识符(Gene ID),列为关键输出项,包括 log2 倍数变化(log2FC)、p 值和校正后 p 值。
      6. 可选:使用 dplyr 或类似工具,根据校正后 p 值(<0.05)和/或 log2FC 值(例如:|log2FC| > 1)对结果进行筛选。
      7. 确保所有处理后的基因列表和 log2 倍数变化矩阵均导出为制表符分隔的(.txt 或 .csv)文件,以便输入 NetDecoder。
      8. 若使用超过两种生物学条件,需在步骤 1.4.1 中执行成对比较,并使用步骤 1.4.1.5 中生成的 DESeq 对象的 results() 函数获取成对比较结果。
    2. 微阵列表达数据归一化 — 可选
      注:若使用微阵列数据,请执行此步骤进行数据归一化。
      1. 在 R 开发平台中打开 NetDecoder 归一化脚本(HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize.R),该脚本可通过 https://github.com/HuLiLab/NetDecoder_Example/tree/main 获取,并编辑斜体部分,使其匹配包含细胞强度文件(CEL)的工作目录。
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. 模板匹配 — 可选
      注:若未执行“数据准备”部分中步骤 1.1–1.4.1 所述的差异表达分析,则此为第二种可选方法。
      1. 对于未通过 limma、edgeR 或 DESeq2 处理的 RNA 测序数据,应在应用模板匹配前进行外部归一化。对于微阵列数据,可直接使用步骤 1.1–1.4.2 生成的归一化表达值。
      2. 选择对照条件作为基因表达的基准模板,并将所有其他感兴趣条件的归一化基因表达值与该模板进行比较。
      3. 计算每个基因表达谱与所选模板之间的皮尔逊相关系数。建议保留具有统计学显著相关性(p < 0.05)且绝对相关系数高于用户自定义阈值(例如 |r| > 0.7)的基因。
  5. 源基因的选择
    注:此步骤的输入为步骤 1.1–1.4 中生成的归一化基因表达矩阵。
    1. 选择一组显著基因作为源基因。对于基于差异表达的工作流程,设定校正后 p 值和 log2FC 阈值(例如 adj p-value < 0.05 且 |log2FC| > 2)。对于基于模板匹配的工作流程,则从步骤 1.4.3.3 中识别出的显著相关基因中,依据选定的相关性和显著性阈值选择源基因。应选择适当的阈值,使下游网络构建时包含约 300–1,000 个基因。
      注:源基因是信息流在网络中起始并传播的起点。
  6. 为每种表型构建边加权网络(EWN)
    注:此步骤需要以下输入:步骤 1.1–1.4 中生成的归一化基因表达矩阵;以边列表格式(geneA-geneB 对)表示的蛋白质-蛋白质相互作用(PPI)网络;指定每个样本生物学条件标签的样本注释文件(元数据)。PPI 网络以 R 对象形式提供,基于 iRefIndex 蛋白质数据库构建。本方案所用版本包含所有直接相互作用,但排除了自环和多重边。该 PPI 网络包含 15,608 个蛋白质和 180,044 条相互作用。更多细节请参见 NetDecoder-Methods 部分4
    1. 在 R 开发平台中打开 NetDecoder 边加权网络(EWN)脚本(HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN.R,可通过 https:/github.com/HuLiLab/NetDecoder_Example/tree/main 获取)4
    2. 编辑脚本中由注释标明的部分(如下所示斜体部分),设置用户特定的路径和用于构建 EWN 的输入文件。
      path<~/NetDecoder_Example/input/
      这是工作目录的路径
      expQuery <- get(load("expBreastCancer_15Set2014.R"))
      这是一个归一化表达矩阵 Rdata 对象的示例
      stQuery < read.csv(“stBreastCancer.csv")
      这是样本元数据
    3. 对表达矩阵进行过滤,仅保留存在于 PPI 网络中的基因。
    4. 针对每种条件,按表型对样本进行子集划分,并使用皮尔逊相关性计算 PPI 网络中所有定义边上的基因-基因成对相关性。相关性计算应基于步骤 1.4 生成的已处理、归一化表达矩阵。
    5. 对每对基因,计算相关系数、绝对相关值及其对应的 p 值。
    6. 移除不完整案例(例如 NA 值)。
    7. 将每种条件的边加权网络导出为制表符分隔文件(无表头),包含以下列:proteinA、proteinB、abs_cor、cor 和 pvalue。
    8. 运行 R 脚本,为所有相关条件创建共表达网络。

2. 安装和配置 NetDecoder

  1. 下载 NetDecoder
    1. 访问 NetDecoder 软件网站(https://netdecoder.hulilab.org/#ver),选择 R 或 Java 版本。
  2. 安装所需软件
    1. 为工作/分析环境安装 Oracle JDK 和 R。
    2. 根据 NetDecoder 文档中列出的清单,使用 Bioconductor(https://netdecoder.hulilab.org/#ver)4 安装所需的 R 软件包。
  3. 下载依赖文件
    1. 下载 NetDecoder 所需的依赖文件,包括基因本体数据(可从 https://geneontology.org/docs/download-ontology/ 获取)以及基因关联参考指南(可从 https://www.ebi.ac.uk/GOA/human_release 获取)。
  4. 设置工作目录
    1. 将所有下载的文件(表达数据、每种条件下生成的共表达网络、基因本体数据和关联参考指南)移至同一个文件夹,该文件夹将作为 NetDecoder 的工作目录。
  5. 添加必要文件夹
    1. 将 NetDecoder 文件夹(https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip)下载至 NetDecoder 工作目录中。
    2. 解压 NetDecoder 文件夹。

3. 运行 NetDecoder

  1. 打开分析用 bash 脚本
    1. 打开一个运行 GNU Bash 的终端,并导航至 NetDecoder 工作目录。
    2. 运行命令 nano NetDecoder_Analysis.sh 以打开该 bash 脚本。
  2. 修改脚本
    注意:大部分代码已经编写完成。在此步骤中,需在脚本中指定相应位置的必要参数。
    1. 设置简短名称:
      将斜体部分修改为待比较的条件:myshortname=‘此处填写您的简短名称’
    2. 设置软件路径:
      通过编辑斜体部分,将以下三个路径定义修改为正确的路径:
      JAVA=“/此处填写您的路径”
      export R=“/此处填写您的路径”
      alias R=“/此处填写您的路径”
    3. 设置工作目录:
      将斜体部分修改为所有文件将被访问的工作目录路径:INPUT_DIR=“/此处填写您的路径”
    4. 设置 NetDecoder 库路径:
      将斜体部分修改为步骤 2.4 中从 zip 文件安装的 NetDecoder 库的路径:LIB_DIR=“/此处填写您的路径/netdecoder_lib”
    5. 设置基因本体和关联文件路径:
      将以下两个目录中的斜体部分修改为首选的基因本体/关联文件所在位置:
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_file
    6. 设置输入参数:
      根据数据情况,按照参考 NetDecoder 脚本中的注释说明,更新以下五行中斜体部分的内容:
      geneList=$INPUT_DIR/gene_file
      state_trt=处理条件
      state_ref=对照条件

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/reference_co_expression_network_file
    7. 设置正确的执行阶段:
      取消注释(通过删除 # 符号)所需执行的阶段,并在该阶段完成后重新注释。第一阶段为 gen_net_trt,随后是 gen_net_ref,然后是 analysis 阶段,最后是 collect 阶段。
      设置要执行的阶段,从第一阶段开始。
      #STAGE=“gen_net_trt”
      #STAGE=“gen_net_ref”
      #STAGE=“analysis”
      #STAGE=“collect”
    8. 返回主 Bash 终端:
      按下 Ctrl+X,然后按 Y,保存并退出 bash 脚本。
  3. 执行 NetDecoder
    注意:如果运行成功,终端中将显示日志信息。
    1. 切换到终端并运行 ./NetDecoder_Analysis.sh
    2. 按照步骤 3.2.7 中列出的顺序依次执行各个阶段,直至四个阶段均单独完成。
  4. 获取结果
    1. 导航至输出文件和图形摘要。

访问受限。请登录或开始试用以查看此内容。

结果

图1所示,NetDecoder 通过一个包含数据处理、网络配置和基于流的分析的结构化工作流程运行,其输出按流程各阶段分别组织到不同的目录中。这种模块化结构能够对输出结果进行系统性验证,确保结果可追溯至每一个计算步骤,从而支持整体的可重复性。

NetDecoder 成功执行后(图2),会在四个目录中生成输出结果:analysiscollectnetworks 以及“your_shortname”,这些目录包含对应于不同条件的数据,包括流值、子网络及其他流相互作用输出的图表和定量结果(图1图2图3)。若这些目录中存在完整填充的文件和图表,则表明...

访问受限。请登录或开始试用以查看此内容。

讨论

本方案概述了NetDecoder的实施方法,NetDecoder是一种网络生物学框架,可将基因表达数据与蛋白质-蛋白质相互作用(PPI)网络相整合,用于建模特定条件下的信息流,并根据基因在生物系统中的功能影响对其进行优先排序。该方法的成功应用依赖于若干关键步骤、严谨的方法学选择以及对输出结果的正确解读。

本方案的初始阶段包括获取表达数据、生成元数据以及构建统一的表达矩阵。这些步骤对于确保与下游分析的兼容性至关重要。表达矩阵必须以基因为行、样本为列为格式,且矩阵中的样本名称必须与元数据文件中的样本名称完全一致。此阶段的任何不一致(例如样本标识符不匹配或基因名称重复)都将在流程中传递,并导致后续步骤失败。

过滤低质量数据(例如计数较低的基因、缺失值或低方差基因)尤为重要,因为这些特征可能会在基于相关性的网络构建中引入噪声。成功的预处理步骤应得到一个干净的表达矩阵,其中无缺失值,且基因标识符一致,与蛋白质相互作用网络中所使用的标识符相匹配。

该实验方案中的一个关键决策点是,在构...

访问受限。请登录或开始试用以查看此内容。

披露

作者无财务利益冲突。
图1和图2的示意图使用BioRender(BioRender.com)制作。

致谢

本工作获得了以下机构资助:梅奥诊所生物医学发现中心、梅奥诊所综合癌症中心(美国国立卫生研究院;P30 CA015083)、梅奥诊所胃肠道细胞信号转导中心(美国国立卫生研究院:P30DK084567)、格伦医学研究基金会 、V癌症研究基金会(S.Z.)、 梅奥诊所营养与肥胖研究项目、大卫·F·和玛格丽特·T·格罗赫内癌症免疫学与免疫治疗项目、施密特科学与创新项目,以及美国国立卫生研究院(NIH;U19AG74879、P50CA136393、 R01CA240323、 R03OD038392)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
AnnotationDbiBioconductorversion 1.68.0注释与基因映射
BioconductorBioconductorversion 3.19转录组数据分析框架及支持 DESeq2、edgeR、limma、AnnotationDbi 和物种数据库等的软件包生态系统
CytoscapeThe Cytoscape Consoritumversion 3.10.4网络可视化与分析
DESeq2Bioconductorversion 1.46.0差异表达分析(基于负二项分布建模)
dplyrPosit Software, PBC 前身为 RStudio, PBCversion 1.1.4数据操作与转换
edgeRBioconductorversion 4.4.2基于计数的差异表达分析
ggplot2Posit Software, PBC 前身为 RStudio, PBCversion 4.0.0数据可视化与绘图  
GNU BashGNU 项目系统默认Bash,用于执行 NetDecoder 流程脚本
igraphigraph 开发团队version 2.1.4网络构建与图分析
LimmaBioconductorversion 3.62.2基因表达分析的线性模型
NetDecoderHu Li 实验室,梅奥诊所(2024 Hu Li 实验室)通过信息流建模构建特定上下文的蛋白质相互作用网络
org.Hs.eg.dbBioconductorversion 3.20.0人类基因注释数据库
Oracle JDKOracle 公司≥ version 1.8NetDecoder 运行所需的运行环境
pheatmapRaivo Koldeversion 1.0.13表达与相关性结构的可视化
RR 基金会version 4.4.2转录组与网络分析的核心环境

参考文献

  1. Rosati D et al. Differential gene expression analysis pipelines and bioinformatic tools for the identification of specific biomarkers: A review. Comput Struct Biotechnol J. 2024;23:1154–68.
  2. Barabási A-L, Oltvai ZN. Network biology: understanding the cell's functional organization. Nat Rev Genet. 2004;5(2):101–13.
  3. Cowen L, Ideker T, Raphael BJ, Sharan R. Network propagation: a universal amplifier of genetic associations. Nat Rev Genet. 2017;18(9):551–62.
  4. Rocha DLE, Ung YC, Mcgehee DC, Correia C, Li H. NetDecoder: a network biology platform that decodes context-specific biological networks and gene activities. Nucleic Acids Res. 2016;44(10):e100.
  5. Ung YC et al. Gene utility recapitulates chromosomal aberrancies in advanced stage neuroblastoma. Comput Struct Biotechnol J. 2022;20:3291–303.
  6. Dong L et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 2022;40(1):70–87.e15.
  7. Ono K et al. Cytoscape Web: bringing network biology to the browser. Nucleic Acids Res. 2025;53(W1):W203–W212.
  8. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9(1):559.
  9. Ma J, Shojaie A, Michailidis G. A comparative study of topology-based pathway enrichment analysis methods. BMC Bioinformatics. 2019;20(1):546.
  10. Ideker T, Krogan NJ. Differential network biology. Mol Syst Biol. 2012;8(1):565.
  11. Tong C et al. Review of knockout technology approaches in bacterial drug resistance research. PeerJ. 2023;11:e15790.
  12. Wei Z et al. PerturBase: a comprehensive database for single-cell perturbation data analysis and visualization. Nucleic Acids Res. 2025;53(D1):D1099–D1111.
  13. Chevalier S et al. Data-driven inference of Boolean networks from transcriptomes to predict cellular differentiation and reprogramming. NPJ Sys Biol Appl. 2025;11(1):105.
  14. Kadelka C, Butrie T-M, Hilton E, Kinseth J, Schmidt A, Serdarevic H. A meta-analysis of Boolean network models reveals design principles of gene regulatory networks. Sci Adv. 2024;10(2)::eadj0822.
  15. Klamt S, Saez-Rodriguez J, Lindquist JA, Simeoni L, Gilles ED. A methodology for the structural and functional analysis of signaling and regulatory networks. BMC Bioinformatics. 2006;7(1):56.
  16. Saez-Rodriguez J et al. Discrete logic modelling as a means to link protein signalling networks with functional analysis of mammalian signal transduction. Mol Syst Biol. 2009;5(1):331.
  17. Bornholdt S. Boolean network models of cellular regulation: prospects and limitations. J R Soc Interface. 2008;5(suppl_1):S85–S94.
  18. Yuan L, Jiang Y, Meng B, Wang Q, Wang C, Huang D-S. SpaLSTF: Diffusion-based generative model with BiLSTM and XCA-Transformer for spatial transcriptomics imputation. PLoS Comput Biol. 2026;22(2):e1013954.
  19. Yuan L, Jiang Y, Wang Q, Hu C, Li G, Zheng C-H. DeepSGE: predicting spatial gene expression using residual network with efficient channel attention and dynamic graph attention network. BMC Genomics. 2026;27(1):293.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

医学第233期第233期空值建模转录组学流算法整合

本文已发表

视频即将推出