需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

高通量转录组分析用于研究宿主-病原体相互作用

4K 次观看

DOI:

10.3791/62324

2022年3月5日

本文内容

摘要

本文介绍了一种从原始测序数据到功能分析的完整RNA测序转录组数据分析流程,包括质量控制和预处理步骤,以及高级统计分析方法。

摘要

病原体可引起多种多样的传染性疾病。宿主在感染后所诱导的生物学过程决定了疾病的严重程度。 为了研究这些过程,研究人员可以采用高通量测序技术(RNA-seq),以检测宿主转录组在感染不同阶段、临床结果或疾病严重程度下的动态变化。此类研究有助于更深入地理解疾病机制,并揭示潜在的药物靶点和治疗方法。本文所介绍的方案描述了一个从原始测序数据到功能分析的完整RNA测序数据分析流程。该流程分为五个步骤:(1)数据质量控制;(2)基因比对与注释;(3)统计分析以鉴定差异表达基因和共表达基因;(4)确定样本分子扰动程度;(5)功能分析。第一步旨在去除可能影响下游分析质量的技术性干扰因素。在第二步中,根据标准文库协议对基因进行比对和注释。 第三步的统计分析用于识别感染样本与非感染样本之间差异表达或共表达的基因。第四步采用分子扰动程度方法验证样本变异性和潜在生物学异常值的存在。最后,第五步的功能分析揭示与疾病表型相关的通路。本流程旨在支持研究人员开展宿主-病原体相互作用研究中的RNA-seq数据分析,并推动未来必要的 in vitroin vivo 实验,以深入理解感染的分子机制。

引言

登革热病毒、黄热病病毒、基孔肯雅病毒和寨卡病毒等虫媒病毒已广泛与多次地方性暴发相关,并成为近几十年来导致人类感染的主要病原体之一1,2。感染基孔肯雅病毒(CHIKV)的个体常出现发热、头痛、皮疹、多关节痛和关节炎等症状3,4,5。病毒可扰乱细胞的基因表达,并影响多种宿主信号通路。近期,血液转录组研究利用RNA-seq技术,将急性CHIKV感染期与恢复期6或健康对照组7进行比较,以鉴定差异表达基因(DEGs)。感染CHIKV的儿童中,与天然免疫相关的基因表达上调,例如参与病毒RNA细胞感应、JAK/STAT信号通路以及Toll样受体信号通路的基因6。急性感染CHIKV的成人也表现出与天然免疫相关的基因上调,例如与单核细胞和树突状细胞活化以及抗病毒反应相关的基因7。表达下调基因富集的信号通路则包括与适应性免疫相关的通路,例如T细胞活化与分化,以及T细胞和B细胞富集相关的通路7

有多种方法可用于分析宿主和病原体基因的转录组数据。通常,RNA-seq文库构建始于成熟poly-A转录本的富集。该步骤可去除大部分核糖体RNA(rRNA),在某些情况下也可去除病毒或细菌RNA。然而,当研究问题涉及病原体转录本检测,并且RNA测序不依赖于前述选择步骤时,测序可检测到更多种类的转录本。例如,亚基因组mRNA已被证明是验证疾病严重程度的重要因素8。此外,对于某些病毒(如CHIKV和SARS-CoV-2),即使使用poly-A富集文库,也能产生可用于下游分析的病毒序列读段9,10。当聚焦于宿主转录组分析时,研究人员可探究样本间的生物学扰动,鉴定差异表达基因和富集通路,并构建共表达模块7,11,12。本实验方案重点介绍利用不同生物信息学方法对CHIKV感染患者与健康个体进行转录组分析的过程(图1A)。代表性结果基于一项先前发表的研究数据7生成,该数据包括20名健康个体和39名急性CHIKV感染个体。

访问受限。请登录或开始试用以查看此内容。

方案

本方案所用样本已获得圣保罗大学生物医学科学研究所微生物学系和塞尔希培联邦大学伦理委员会的批准(方案编号分别为:54937216.5.0000.5467 和 54835916.2.0000.5546)。

1. Docker Desktop 安装

注意:准备 Docker 环境的步骤因操作系统(OS)而异。因此,Mac 用户必须遵循 1.1 中列出的步骤,Linux 用户必须遵循 1.2 中列出的步骤,Windows 用户必须遵循 1.3 中列出的步骤。

  1. 在 MacOS 上安装。
    1. 访问 Get Docker 网站(材料表),点击 适用于 Mac 的 Docker Desktop 然后点击 从 Docker Hub 下载 链接。
    2. 单击以下载安装文件 获取 Docker 按钮
    3. 运行 Docker.dmg 文件以打开安装程序,然后将图标拖至 应用 文件夹中定位并执行 Docker.app 应用 文件夹以启动程序。
      注意:顶部状态栏中的软件专用菜单表明软件正在运行,并且可以从终端访问。
  2. 在 Linux 操作系统上安装容器程序。
    1. 访问 Get Docker Linux 网站(材料表)并按照仓库部分提供的安装说明进行操作 Docker Linux 仓库 链接。
    2. 使用命令行更新所有 Linux 软件包:
      sudo apt-get update
    3. 在 Docker 中安装所需的软件包:
      sudo apt-get install apt-transport-https ca-certificates curl gnupg lsb-release
    4. 创建一个软件归档密钥环文件:
      curl -fsSL https://download.docker.com/linux/ubuntu/gpg | sudo gpg --dearmor -o /usr/share/keyrings/docker-archive-keyring.gpg
    5. 在 source.list 文件中添加 Docker 的 deb 信息:
      回声 "deb [arch=amd64 signed-by=/usr/share/keyrings/docker-archive-keyring.gpg] https://download.docker.com/linux/ubuntu $(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
    6. 再次更新所有软件包,包括最近添加的软件包:
      sudo apt-get update
    7. 安装桌面版:
      sudo apt-get install docker-ce docker-ce-cli containerd.io
    8. 选择地理区域和时区以完成安装过程。
  3. 在 Windows 操作系统上安装容器程序。
    1. 访问 Get Docker 网站(材料表)并点击 开始使用. 查找适用于 Windows 的 Docker Desktop 安装程序。下载文件并在计算机上本地安装。
    2. 下载完成后,启动安装文件(.exe)并保留默认参数。确保以下两个选项 安装 WSL 2 所需的 Windows 组件添加快捷方式到桌面 已标记。
      注意:在某些情况下,当此软件尝试启动服务时,会显示错误提示:“WSL 安装不完整”。要解决此错误,请访问网站 WSL2-Kernel(材料表).
    3. 下载并安装最新的 WSL2 Linux 内核。
    4. 以管理员身份打开 PowerShell 终端并执行以下命令:
      dism.exe /online /enable-feature /featurename:Microsoft-Windows-Subsystem-Linux /all /norestart
    5. 确保已成功安装软件 Docker Desktop。
  4. 从 Docker Hub 的 CSBL 仓库下载该镜像(材料表).
    1. 打开 Docker Desktop 并确认其状态为 "跑胶" 位于工具栏左下角。
    2. 前往 Windows PowerShell 终端命令行。从 Docker Hub 上的 CSBL 仓库下载本实验方案的 Linux 容器镜像。执行以下命令以下载该镜像:
      docker pull csblusp/transcriptome
      注意:下载镜像后,可在 Docker Desktop 中查看该文件。创建容器时,Windows 用户必须执行步骤 1.5,而 Linux 用户必须执行步骤 1.6。
  5. 在 Windows 操作系统上初始化服务器容器。
    1. 从工具栏的桌面应用程序管理器中查看 Docker 镜像文件,并访问镜像页面。
      注意:如果管道镜像下载成功,将会有可用的 csblusp/transcriptome 镜像。
    2. 通过点击 csblusp/transcriptome 镜像启动容器 运行 按钮。展开 可选设置 配置容器。
    3. 定义容器名称(例如,server)。
    4. 将本地计算机中的文件夹与 Docker 内的文件夹关联。为此,需确定主机路径,在本地计算机上设置一个文件夹,用于存储最终下载的已处理数据;设置容器路径,将 csblusp/transcriptome 容器文件夹定义并链接到本地计算机路径(使用名称 "/opt/转移数据" 容器路径)。
    5. 此后,单击 运行 创建 csblusp/transcriptome 容器。
    6. 要从 csblusp/transcriptome 容器访问 Linux 终端,请点击 CLI 按钮。
    7. 在 bash 终端中输入以获得更好的体验。为此,请执行以下命令:
      bash
    8. 执行 bash 命令后,确保终端显示 (root@<containerID>:/#):
      root@ac12c583b731:/#
  6. 初始化适用于 Linux 操作系统的服务器容器。
    1. 执行此命令以基于该镜像创建 Docker 容器:
      docker run -d -it --rm --name server -v <宿主病原体>:/opt/transferdata csblusp/transcriptome
      注意: <宿主-病原体通路>:定义 本地文件夹机器的路径
    2. 执行此命令以访问 Docker 容器的命令终端:
      docker exec -it server bash
    3. 确保可使用 Linux 终端,以便通过命令行执行程序或脚本。
    4. 执行 bash 命令后,确保终端显示 (root@<containerID>:/#):
      root@ac12c583b731:/#
      注意:根密码为 "转录组" 默认情况下。如有需要,可通过执行以下命令更改 root 密码:
      passwd
    5. 首先,执行 source 命令加载 addpath.sh,以确保所有工具均可使用。执行以下命令:
      source /opt/addpath.sh
  7. 检查RNA测序文件夹的结构。
    1. 访问转录组分析流程脚本文件夹,并确保所有来自RNA测序的数据均存储在以下文件夹内:/home/transcriptome-pipeline/data。
    2. 确保分析获得的所有结果均存储在路径 /home/transcriptome-pipeline/results 的文件夹内。
    3. 确保基因组和注释参考文件存储在路径 /home/transcriptome-pipeline/datasets 的文件夹内。这些文件将用于支持所有分析。
    4. 确保所有脚本均存储在路径 /home/transcriptome-pipeline/scripts 的文件夹中,并按如下所述的各个步骤分别存放。
  8. 下载注释文件和人类基因组。
    1. 访问脚本文件夹:
      cd /home/transcriptome-pipeline/scripts
    2. 执行以下命令以下载参考人类基因组:
      bash downloadGenome.sh
    3. 要下载注释,请执行以下命令:
      bash downloadAnnotation.sh
  9. 更改参考基因组的注释或版本。
    1. 打开 downloadAnnotation.sh 和 downloadGenome.sh 以修改每个文件的 URL。
    2. 将 downloadAnnotation.sh 和 downloadGenome.sh 文件复制到传输区域,并在本地操作系统中进行编辑。
      cd /home/transcriptome-pipeline/scripts
      cp downloadAnnotation.sh downloadGenome.sh /opt/transferdata
    3. 打开 宿主路径 步骤1.5.4中选择的用于在宿主与Docker容器之间建立链接的文件夹
    4. 使用首选的编辑软件修改文件并保存。最后,将修改后的文件放入脚本文件夹中。执行以下命令:
      cd /opt/transferdata
      将 downloadAnnotation.sh 和 downloadGenome.sh 复制到 /home/transcriptome-pipeline/scripts 目录

      注意:可使用 vim 或 nano Linux 编辑器直接编辑这些文件。
  10. 接下来,使用命令行配置 fastq-dump 工具:
    vdb-config --interactive
    注意:此步骤允许从示例数据中下载测序文件。
    1. 导航 工具 使用 Tab 键翻页并选择当前文件夹选项。导航至 保存 选项并单击 好的然后, 退出 fastq-dump 工具
  11. 启动从先前已发表论文中下载测序读段7每个样本的SRA登录号是必需的。从SRA NCBI网站获取SRA编号(材料表).
    注意:要分析公共数据库中可用的RNA-Seq数据,请遵循步骤1.12;要分析私有RNA-seq数据,请遵循步骤1.13。
  12. 分析特定的公共数据。
    1. 访问美国国家生物技术信息中心(NCBI)网站,搜索特定主题的关键词。
    2. 点击 结果 BioProject 的链接在 基因组 部分
    3. 选择并点击一项具体研究。点击 SRA 实验新页面打开,显示该研究中所有可用的样本。
    4. 点击 "发送至:" 上述登录号。在 "选择目的地" 选项选择 文件 格式 选项,选择 运行信息. 点击 "创建文件" 导出所有图书馆信息。
    5. 将 SraRunInfo.csv 文件保存至第 1.5.4 步中定义的宿主路径,并执行下载脚本:
      cp /opt/transferdata/SraRunInfo.csv /home/transcriptome-pipeline/data
      cd /home/transcriptome-pipeline/scripts
      bash downloadAllLibraries.sh
  13. 分析私有且未发表的测序数据。
    1. 将测序数据整理到一个名为的文件夹中 读数.
      注意:内部的 读数 文件夹,为每个样本创建一个文件夹。这些文件夹的名称必须与各样本名称一致。将每个样本的数据存放在对应的目录中。如果是配对末端RNA测序(paired-end RNA-Seq),每个样本目录应包含两个FASTQ文件,文件名必须分别以{sample}_1.fastq.gz和{sample}_2.fastq.gz结尾,对应正向和反向序列。例如,一个命名为 "健康对照组" 必须有一个同名目录,且包含命名为 Healthy_control_1.fastq.gz 和 Healthy_control_2.fastq.gz 的 FASTQ 文件。然而,如果文库测序采用单端测序策略,则仅需保存一个读段文件用于下游分析。例如,同一样本 "健康对照组",必须有一个名为 Healthy_control.fastq.gz 的唯一 FASTQ 文件。
    2. 创建一个包含所有样本名称的表型文件:将第一列命名为“样本”(Sample),第二列命名为“类别”(Class)。在“样本”列中填入样本名称,这些名称必须与样本目录的名称完全一致;在“类别”列中填入每个样本的表型分组(例如,对照组或感染组)。最后,将文件保存为以下名称 "metadata.tsv" 并将其发送至 /home/transcriptome-pipeline/data/ 目录。查看现有的 metadata.tsv 文件以了解表型文件的格式。
      cp /opt/transferdata/metadata.tsv
      /home/transcriptome-pipeline/data/metadata.tsv
    3. 访问 宿主路径 在步骤1.5.4中定义的目录内创建新的结构化目录samples,并将其复制。最后,将samples从/opt/transferdata移动至管道数据目录。
      cp -rf /opt/transferdata/reads/*
      /home/transcriptome-pipeline/data/reads/
  14. 观察到所有测序读段均存储在文件夹 /home/transcriptome-pipeline/data/reads 中。

2. 数据质量控制

注意:通过图形化方法评估测序读长中错误的概率。去除所有技术性序列,例如接头序列。

  1. 使用 FastQC 工具评估文库的测序质量。
    1. 为生成质量图表,运行 fastqc 程序。执行以下命令:
      bash FastQC.sh
      注意:结果将保存在 /home/transcriptome-pipeline/results/FastQC 文件夹中。由于文库构建和测序过程中使用了序列接头,在某些情况下,接头序列的片段可能会干扰比对过程。
  2. 去除接头序列和低质量读段。进入 Scripts 文件夹,并执行 Trimmomatic 工具的命令:
    cd /home/transcriptome-pipeline/scripts
    bash trimmomatic.sh

    注意:用于测序过滤的参数包括:去除前端低质量碱基或前 3 个碱基(质量值低于 3)(LEADING:3);去除末端低质量碱基或后 3 个碱基(质量值低于 3)(TRAILING:3);使用 4 个碱基宽度的滑动窗口扫描读段,当每个碱基的平均质量值低于 20 时进行剪切(SLIDINGWINDOW:4:20);丢弃长度短于 36 个碱基的读段(MINLEN:36)。这些参数可通过编辑 Trimmomatic 脚本文件进行修改。
    1. 确认结果已保存至以下文件夹:/home/transcriptome-pipeline/results/trimreads。执行以下命令:
      ls /home/transcriptome-pipeline/results/trimreads

3. 样本的比对与注释

注意:在获得高质量的测序读段后,需要将其比对到参考基因组。在此步骤中,使用 STAR 比对工具对示例样本进行比对。STAR 比对工具需要 32 GB 的 RAM 内存来加载并执行读段与基因组的比对。对于不具备 32 GB 内存的用户,可使用已比对好的读段数据。在此情况下,请跳转至步骤 3.3 或使用 Bowtie2 比对工具。本节提供了用于 STAR(所有图示结果均基于此工具)和 Bowtie2(低内存需求的比对工具)的脚本。

  1. 首先为比对过程建立参考基因组索引:
    1. 使用命令行进入 Scripts 文件夹:
      cd /home/transcriptome-pipeline/scripts
    2. 对于 STAR 比对工具,执行以下命令:
      bash indexGenome.sh
    3. 对于 Bowtie 比对工具,执行以下命令:
      bash indexGenomeBowtie2.sh
  2. 执行以下命令,将过滤后的测序读段(来自步骤 2)比对到参考基因组(GRCh38 版本)。STAR 和 Bowtie2 比对工具均使用默认参数进行操作。
    1. 对于 STAR 比对工具,执行以下命令:
      bash mapSTAR.sh
    2. 对于 Bowtie2 比对工具,执行以下命令:
      bash mapBowtie2.sh
      注意:最终结果为每个样本生成的二进制比对图(BAM)文件,存储于 /home/transcriptome-pipeline/results/mapreads 目录中。
  3. 使用 FeatureCounts 工具对已比对的读段进行注释,以获得每个基因的原始计数。运行注释读段的脚本。
    注意:FeatureCounts 工具负责将比对后的测序读段分配至基因组特征。根据具体生物学问题,可调整基因组注释中的若干关键参数,包括:检测转录本异构体、允许多重比对读段以及外显子-外显子连接位点的识别,分别对应参数 GTF.attrType="gene_name"(用于基因注释,或不指定参数以进行元特征层级分析)、allowMultiOverlap=TRUE 和 juncCounts=TRUE。
    1. 使用命令行进入脚本文件夹:
      cd /home/transcriptome-pipeline/scripts
    2. 为注释已比对读段并获得每个基因的原始计数,请执行以下命令:
      Rscript annotation.R
      注意:本注释过程使用的参数包括:返回基因简称(GTF.attrType="gene_name");允许多重重叠(allowMultiOverlap = TRUE);并指定文库为双端测序(isPairedEnd=TRUE)。若采用单端测序策略,则应使用参数 isPairedEnd=FALSE。结果将保存在 /home/transcriptome-pipeline/countreads 文件夹中。
  4. 对基因表达数据进行标准化。
    注意:标准化基因表达对于比较不同样本间的结果(例如健康与感染样本)至关重要。此外,标准化也是进行共表达分析和分子扰动程度分析的前提条件。
    1. 使用命令行进入 Scripts 文件夹:
      cd /home/transcriptome-pipeline/scripts
    2. 对基因表达数据进行标准化。为此,请执行以下命令:
      Rscript normalizesamples.R
      注意:本实验中,原始计数数据采用修剪均值 M 值法(Trimmed Mean of M-values, TMM)和每百万计数(Count Per Million, CPM)方法进行标准化。该步骤旨在通过文库大小标准化,消除由技术因素引起的基因表达差异。结果将保存在 /home/transcriptome-pipeline/countreads 文件夹中。

4. 差异表达基因与共表达基因

  1. 使用开源的 EdgeR 软件包鉴定差异表达基因。该步骤包括寻找与对照相比表达水平更高或更低的基因。
    1. 使用命令行访问 Scripts 文件夹:
      cd /home/transcriptome-pipeline/scripts
    2. 为了鉴定差异表达基因,使用命令行执行 DEG_edgeR R 脚本:
      Rscript DEG_edgeR.R
      注意:包含差异表达基因的结果将保存在 /home/transcriptome-pipeline/results/degs 文件夹中。数据可传输至个人计算机。
  2. 从 csblusp/transcriptome 容器下载数据。
    1. 将已处理的数据从 /home/transcriptome-pipeline 转移至 /opt/transferdata 文件夹(本地计算机)。
    2. 通过执行以下命令行将所有文件复制到本地计算机:
      cp -rf /home/transcriptome-pipeline/results /opt/transferdata/pipeline
      cp -rf /home/transcriptome-pipeline/data /opt/transferdata/pipeline

      注意:现在,请转至本地计算机,确认所有结果、数据集和数据均已可在主机路径(Host Path)中下载。
  3. 鉴定共表达模块。
    1. 访问共表达模块鉴定工具(CEMiTool)网站(材料表
      )。该工具可从用户提供的表达数据集中鉴定共表达模块。在主页面上,点击右上角的 运行 按钮,将打开一个用于上传表达文件的新页面。
    2. 表达文件 部分下方点击 选择文件 ,并从主机路径上传标准化后的基因表达矩阵文件 'tmm_expression.tsv'。
      注意:步骤 4.4 为非必选步骤。
  4. 探索共表达模块的生物学意义。
    1. 样本表型 部分点击 选择文件 ,并上传来自“下载数据”步骤 4.2.2 的样本表型元数据文件 metadata_cemitool.tsv,以进行基因集富集分析(GSEA)。
    2. 基因相互作用 部分点击 选择文件 ,上传包含基因相互作用的文件(cemitool-interactions.tsv)。也可使用 webCEMiTool 提供的示例基因相互作用文件。这些相互作用可以是蛋白质-蛋白质相互作用、转录因子及其靶基因,或代谢通路。此步骤将为每个共表达模块生成一个相互作用网络。
    3. 基因集 部分点击 选择文件 ,上传以基因矩阵转置(GMT)格式存储的功能相关基因列表文件。基因集文件使该工具能够对每个共表达模块进行富集分析,即过表达分析(ORA)。
      注意:该基因列表可包含通路、GO 术语或 miRNA-靶基因。研究人员可使用血液转录模块(BTM)作为该分析的基因集。BTM 文件名为 BTM_for_GSEA.gmt。
  5. 设置共表达分析参数并获取结果。
    1. 点击加号展开 参数 部分,以显示默认参数。如有必要,可进行修改。勾选 应用 VST 选项。
    2. 电子邮件 部分填写邮箱地址,以便通过电子邮件接收结果。此步骤为可选。
    3. 点击 运行 CEMiTool 按钮。
    4. 点击右上角的 下载完整报告 以下载完整的分析报告,将获得一个压缩文件 cemitool_results.zip。
    5. 使用 WinRAR 解压 cemitool_results.zip 文件。
      注意:解压后的文件夹包含多个文件,其中包含分析的所有结果及其设定的参数。

5. 样品分子扰动程度的测定

  1. 分子扰动程度(Molecular Degree of Perturbation, MDP)网络版本。
    1. 要运行 MDP,请访问 MDP 网站(材料表)。MDP 会计算每个样本相对于参考样本的分子距离。点击 运行 按钮。
    2. 选择文件 链接处,上传表达文件 tmm_expression.tsv。然后,从“下载数据”步骤 4.2.2 中上传表型数据文件 metadata.tsv。还可以提交 GMT 格式的通路注释文件,以计算与疾病相关的通路的扰动评分。
    3. 数据上传完成后,定义包含 MDP 所用表型信息的“Class”列,并通过选择对应于对照组的标签来定义对照组。
      注意:有一些可选参数会影响样本评分的计算方式。如有需要,用户可更改统计平均方法、标准差以及扰动基因的前百分比。
    4. 之后,点击 运行 MDP 按钮,即可显示 MDP 结果。用户可通过每个图中的 下载图表 按钮下载图像,也可通过 下载 MDP 评分文件 按钮下载 MDP 评分文件。
      注意:如果对如何提交文件或 MDP 的工作原理有任何疑问,请参阅教程和关于网页中的说明。

6. 功能富集分析

  1. 创建一个下调差异表达基因(DEG)列表和一个上调差异表达基因(DEG)列表。基因名称必须采用 Entrez 基因符号。每个列表中的每个基因应单独占一行。
  2. 将基因列表保存为 txt 或 tsv 格式。
  3. 访问 Enrichr 网站(材料表)以进行功能分析。
  4. 点击 选择文件 按钮来上传基因列表。选择一个 DEG 列表,然后点击 提交 按钮。
  5. 点击网页顶部的 通路 选项,使用 ORA 方法进行功能富集分析。
  6. 选择一个通路数据库。"Reactome 2016" 通路数据库广泛用于解析人类数据的生物学意义。
  7. 再次点击所选通路数据库的名称。选择 柱状图,并检查其是否按 p 值排序。若未按 p 值排序,请点击柱状图直至其按 p 值排序。该柱状图显示根据 p 值排序的前 10 条通路。
  8. 点击 配置 按钮,为上调基因分析选择红色,或为下调基因分析选择蓝色。通过点击 svgpngjpg 按钮,以多种格式保存柱状图。
  9. 选择 表格 选项,并在柱状图左下角点击 导出条目至表格,以 txt 文件格式获取功能富集分析结果。
    注意:该功能富集结果文件的每一行包含一条通路的名称、提交的 DEG 列表与该通路之间重叠的基因数量、p 值、校正后的 p 值、优势比、综合评分,以及参与该通路且存在于 DEG 列表中的基因的基因符号。
  10. 对另一个 DEG 列表重复上述步骤。
    注意:下调 DEG 的分析提供富集下调基因的通路,而上调基因的分析提供富集上调基因的通路。

访问受限。请登录或开始试用以查看此内容。

结果

转录组分析的计算环境在 Docker 平台上创建并配置。该方法使 Linux 初学者用户无需预先掌握系统管理知识即可使用 Linux 终端系统。Docker 平台利用宿主操作系统的资源,创建包含特定用户工具的服务容器图1B)。基于 Linux 操作系统 Ubuntu 20.04 发行版创建了一个容器,并已为其完整配置转录组分析环境,该容器可被访问 通过 命令行终端。在此容器中,存在一个预定义的数据集和脚本文件夹结构,该结构是所有流程分析所必需的(图1C)。我们研究团队发表的一项研究7 用于分析,包括20份来自健康个体的样本和39份来自急性CHIKV感染个体的样本(图1D).

全转录组RNA测序过程可能产生读取错误,这些错误可能由含有两个或更多转录本的簇或试剂耗尽所引起。测序平台会生成一组“FASTQ”文件,其中包含每条核苷酸碱基的序列(读段...

访问受限。请登录或开始试用以查看此内容。

讨论

测序文库的制备是尽可能好地回答生物学问题的关键步骤。研究中感兴趣的转录本类型将决定所选择的测序文库类型,并影响后续的生物信息学分析。例如,在病原体与宿主相互作用的研究中,根据测序类型的不同,有可能同时鉴定出病原体和宿主的转录本序列,或仅鉴定出宿主的转录本序列。

新一代测序设备(例如Illumina平台)会测定测序质量值,该值代表碱基被错误识别的概率。下游分析对低质量序列非常敏感,可能导致基因表达的读取不足或误读。进行正确分析和解释的另一个障碍是接头序列。接头序列有助于文库构建和测序,在大多数情况下,接头本身也会被测序。近期研究发现,比对工具对最终结果的影响较小13。然而,在病原体-宿主研究中,通过测试不同的阈值以尽量减少多位置比对序列的问题,比对过程可能会产生略好的结果。

差异基因表达结果的解读需持一定谨慎态度,尤其是在每组样本数量非常少、且样本来自不同检测实验并受到批次效应干扰的情况下,这会影响差异表达基因(DEGs)的分析结果。这些结果对多个因素较为敏感:(i)所应用的数据过...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

HN 由 FAPESP(资助编号:#2017/50137-3、2012/19278-6、2018/14933-2、2018/21934-5 和 2013/08216-2)和 CNPq(313662/2017-7)资助。

我们特别感谢以下资助项目对研究员的支持:ANAG(FAPESP 项目编号 2019/13880-5)、VEM(FAPESP 项目编号 2019/16418-0)、IMSC(FAPESP 项目编号 2020/05284-0)、APV(FAPESP 项目编号 2019/27146-1)以及 RLTO(CNPq 项目编号 134204/2019-0)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
CEMiTool计算系统生物学实验室1.12.2以完全自动化的方式发现和分析共表达基因模块,并生成包含高质量图表的用户友好型 HTML 报告。
EdgeRBioconductor(维护者:Yunshun Chen [yuchen at wehi.edu.au])3.30.3对具有生物学重复的 RNA-seq 表达谱进行差异表达分析
EnhancedVolcanoBioconductor(维护者:Kevin Blighe [kevin at clinicalbioinformatics.co.uk])1.6.0生成适合发表的火山图,具有增强的着色和标签功能
FastQCBabraham 生物信息学中心0.11.9旨在为来自高通量测序的原始序列数据提供简便的质量控制检查方法
FeatureCounts生物信息学部,沃尔特与伊丽莎·霍尔医学研究所2.0.0将比对后的测序读段分配到指定的基因组特征区域
MDP计算系统生物学实验室1.8.0分子扰动程度(Molecular Degree of Perturbation)根据样本相对于对照组的转录组扰动情况计算评分
RR 核心团队4.0.3用于统计计算和图形展示的编程语言及自由软件环境
STAR生物信息学部,沃尔特与伊丽莎·霍尔医学研究所2.7.6a一种比对工具,采用可处理剪接比对的策略,专门应对 RNA-seq 数据比对中的诸多挑战
Bowtie2约翰斯·霍普金斯大学2.4.2一种超快速且内存效率高的工具,用于将测序读段比对至长参考序列
TrimmomaticUSADEL 实验室0.39对 Illumina 双端和单端测序数据执行接头序列修剪任务
Get DockerDocker20.10.2创建可重现且可预测的生物信息学环境(https://docs.docker.com/get-docker/)
WSL2-KernelWindowsNAhttps://docs.microsoft.com/zh-cn/windows/wsl/wsl2-kernel
Get Docker LinuxDockerNAhttps://docs.docker.com/engine/install/ubuntu/
Docker Linux RepositoryDockerNAhttps://docs.docker.com/engine/install/ubuntu/#install-using-the-repository
MDP Website计算系统生物学实验室NAhttps://mdp.sysbio.tools
Enrichr WebsiteMaayanLabNAhttps://maayanlab.cloud/Enrichr/
webCEMiTool计算系统生物学实验室NAhttps://cemitool.sysbio.tools/
gProfiler生物信息学、算法与数据挖掘研究组NAhttps://biit.cs.ut.ee/gprofiler/gost
goseqBioconductor(维护者:Matthew Young [my4 at sanger.ac.uk])NAhttp://bioconductor.org/packages/release/bioc/html/goseq.html
SRA NCBI studyNCBINAhttps://www.ncbi.nlm.nih.gov/bioproject/PRJNA507472/

参考文献

  1. Weaver, S. C., Charlier, C., Vasilakis, N., Lecuit, M. Zika, Chikungunya, and Other Emerging Vector-Borne Viral Diseases. Annual Review of Medicine. 69, 395-408 (2018).
  2. Burt, F. J., et al. Chikungunya virus: an update on the biology and pathogenesis of this emerging pathogen. The Lancet. Infectious Diseases. 17 (4), 107-117 (2017).
  3. Hua, C., Combe, B. Chikungunya virus-associated disease. Current Rheumatology Reports. 19 (11), 69(2017).
  4. Suhrbier, A., Jaffar-Bandjee, M. -C., Gasque, P. Arthritogenic alphaviruses-an overview. Nature Reviews Rheumatology. 8 (7), 420-429 (2012).
  5. Nakaya, H. I., et al. Gene profiling of chikungunya virus arthritis in a mouse model reveals significant overlap with rheumatoid arthritis. Arthritis and Rheumatism. 64 (11), 3553-3563 (2012).
  6. Michlmayr, D., et al. Comprehensive innate immune profiling of chikungunya virus infection in pediatric cases. Molecular Systems Biology. 14 (8), 7862(2018).
  7. Soares-Schanoski, A., et al. Systems analysis of subjects acutely infected with the Chikungunya virus. PLOS Pathogens. 15 (6), 1007880(2019).
  8. Alexandersen, S., Chamings, A., Bhatta, T. R. SARS-CoV-2 genomic and subgenomic RNAs in diagnostic samples are not an indicator of active replication. Nature Communications. 11 (1), 6059(2020).
  9. Wang, D., et al. The SARS-CoV-2 subgenome landscape and its novel regulatory features. Molecular Cell. 81 (10), 2135-2147 (2021).
  10. Wilson, J. A. C., et al. RNA-Seq analysis of chikungunya virus infection and identification of granzyme A as a major promoter of arthritic inflammation. PLOS Pathogens. 13 (2), 1006155(2017).
  11. Gonçalves, A. N. A., et al. Assessing the impact of sample heterogeneity on transcriptome analysis of human diseases using MDP webtool. Frontiers in Genetics. 10, 971(2019).
  12. Russo, P. S. T., et al. CEMiTool: a Bioconductor package for performing comprehensive modular co-expression analyses. BMC Bioinformatics. 19 (1), 56(2018).
  13. Costa-Silva, J., Domingues, D., Lopes, F. M. RNA-Seq differential expression analysis: An extended review and a software tool. PloS One. 12 (12), 0190152(2017).
  14. Seyednasrollah, F., Laiho, A., Elo, L. L. Comparison of software packages for detecting differential expression in RNA-seq studies. Briefings in Bioinformatics. 16 (1), 59-70 (2015).
  15. Zhang, B., Horvath, S. A general framework for weighted gene co-expression network analysis. Statistical Applications in Genetics and Molecular Biology. 4, Article17 (2005).
  16. Cheng, C. W., Beech, D. J., Wheatcroft, S. B. Advantages of CEMiTool for gene co-expression analysis of RNA-seq data. Computers in Biology and Medicine. 125, 103975(2020).
  17. Cardozo, L. E., et al. webCEMiTool: Co-expression modular analysis made easy. Frontiers in Genetics. 10, 146(2019).
  18. de Lima, D. S., et al. Long noncoding RNAs are involved in multiple immunological pathways in response to vaccination. Proceedings of the National Academy of Sciences of the United States of America. 116 (34), 17121-17126 (2019).
  19. Prada-Medina, C. A., et al. Systems immunology of diabetes-tuberculosis comorbidity reveals signatures of disease complications. Scientific Reports. 7 (1), 1999(2017).
  20. Chen, E. Y., et al. Enrichr: interactive and collaborative HTML5 gene list enrichment analysis tool. BMC Bioinformatics. 14, 128(2013).
  21. Kuleshov, M. V., et al. Enrichr: a comprehensive gene set enrichment analysis web server 2016 update. Nucleic Acids Research. 44, 90-97 (2016).
  22. Raudvere, U., et al. g:Profiler: a web server for functional enrichment analysis and conversions of gene lists (2019 update). Nucleic Acids Research. 47, 191-198 (2019).
  23. Young, M. D., Wakefield, M. J., Smyth, G. K., Oshlack, A. Gene ontology analysis for RNA-seq: accounting for selection bias. Genome Biology. 11 (2), 14(2010).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

RNA测序差异基因表达共表达分析质量控制功能富集分子扰动血液转录组基因注释