2022年3月5日
本文介绍了一种从原始测序数据到功能分析的完整RNA测序转录组数据分析流程,包括质量控制和预处理步骤,以及高级统计分析方法。
欢迎使用用于研究宿主-病原体相互作用的高通量转录组分析实验方案。本方案分为以下步骤:质量控制,用于过滤低质量的测序读段并去除接头序列;测序与注释,需将测序读段比对至参考基因组,并将读段注释到基因中。
统计学与共表达分析,用于鉴定差异表达基因并发现共表达模块。分子扰动程度分析,用于识别潜在的离群样本。最后,进行功能分析以确定差异表达基因的生物学功能。
所有利用这些流程的工具均已预先安装在 Linux 系统中,并封装到一个 Docker 容器中。使用这些方案的样本来源于我们课题组发表在 PLOS Pathogens 上的一篇论文。样本包括 20 名健康人群和 39 名感染了基孔肯雅病毒(Chikungunya virus)的患者。
采集了血液样本,并进行了RNA测序。要在Windows系统中安装Docker,您需要遵循以下步骤:访问Docker的官方网站,然后点击“Get Started”。
查找适用于 Windows 的 Docker Desktop 安装程序。下载该文件。在您的计算机上本地安装。
确保选中这两个选项。安装程序后,下载本实验方案所需的 Docker 镜像。进入 Windows 终端。
执行命令以下载镜像。下载镜像后,您可以在 Docker Desktop 中看到该文件,并且我们可以基于此镜像启动容器。点击圆形按钮后,您需要展开原始参数和选项,以定义容器的名称,并将本地计算机上的文件夹与 Docker 内部的文件夹进行关联。
此后,单击“运行”以启动容器。然后可以访问终端,该终端位于 Docker 内部的 Linux 系统中。输入 bash 命令,即可执行本实验方案中的所有命令。
首先,我们需要执行源文件以启用本实验方案中的所有工具。您应进入 scripts 目录。要进行转录组分析,您必须首先下载参考基因组。
为此,您需要执行以下命令。基因组下载完成后,您还需要下载基因的注释文件。为此,您需要输入以下命令。
接下来,您需要配置 fastq-dump。这将允许您下载示例的测序文件。输入以下命令后,您必须使用 Tab 键进入 Tools 选项,并选中当前目录(currents directory)选项。
使用 Tab 按钮保存,然后按 ok。接着快速退出 fastq-dump 工具。现在我们可以通过输入以下命令来启动读段的下载。
质量控制包括以图形方式评估测序读段中的错误概率。在此步骤中,你还必须去除接头等技术性序列。要生成质量控制图,需运行 FastQC 程序。
为了去除接头序列和低质量序列,您需要输入以下命令。在获得高质量的测序读段后,我们现在需要将这些读段比对到参考基因组上。比对完成后,需根据人类基因对基因进行注释,然后统计比对到每个人类基因上的读段数量。
第一步是通过输入以下命令来索引参考基因组。然后输入这些命令,将测序读段比对到人类基因组上。接下来,应运行对读段进行注释的脚本。
完成比对和注释后,可进行差异表达分析,即找出在一组中表达水平高于或低于另一组的基因。为了鉴定差异表达基因(DEGs),你需要运行以下命令。完成后,可将Docker中的结果数据传输至本地计算机。
为此,请进入终端并输入以下命令,将所有结果保存到本地文件夹中。为了进行后续分析,您还需要将 data 目录中的所有文件复制到本地计算机的某个目录中。在本地计算机上,您将能够查看从 Docker 保存数据的各个目录。
如您所见,您可以访问所有文库。您还可以打开包含质量控制报告的 HTML 文件。此外,您还可以访问包含差异表达基因的目录。
在此目录中,您将找到火山图,图中显示了某一组相对于另一组上调或下调的基因,在本例中为感染基孔肯雅病毒的患者与健康对照组之间的比较。该实验方案的其余所有步骤都将在浏览器中使用网络工具执行。我们首先从 CEMiTool 开始。
转到浏览器并输入以下地址。CEMiTool 可根据用户提供的表达数据集识别共表达模块。在主页面上,您可以进入菜单并点击“运行”按钮。
这将打开一个新页面,您可以在其中上传表达文件。该文件位于您本地计算机的 data 目录中。您会看到有三个表达文件,我们将用于 CEMiTool 的是经过 tmm 标准化处理的文件。
然后需要选择表型数据文件,同样选择包含蛋白质-蛋白质相互作用的文件,最后上传包含基因集或通路的文件。基因集文件使 CEMiTool 能够对每个共表达模块进行富集分析。接下来,应展开参数部分并点击应用 VST。
之后,您只需点击“运行 CEMiTool”。运行 CEMiTool 后,您将看到已鉴定出 12 个共表达模块。通过点击此处,您可以下载这些分析的全部结果。
本实验方案中将使用的另一个工具是 MDP(Molecular Degree of Perturbation,分子扰动程度)。只需在浏览器中输入 mdp.sysbio.tools 即可访问。MDP 可计算每个样本相对于一组参考样本(本例中为健康对照组)的分子距离,从而不仅能够识别潜在的离群样本,还能评估各样本相对于该对照组的扰动程度。
在运行页面,只需点击按钮并选择文件,即可上传表达数据文件。然后需要上传表型数据文件。接着需定义哪一列包含分组或类别信息,以及哪个类别或分组对应于对照组。
此后,即可直接运行 MDP。柱状图中,每个样本以一根柱子表示其分子扰动程度得分,不同颜色代表不同的组别。箱线图则是可视化相同结果的另一种方式,其中每个点代表一个样本,并按两个组别分开显示。
为了进行功能分析,我们将使用 Enrichr 工具。为此,您需要选择差异表达的基因列表(包括上调或下调的基因),并将其作为输入基因列表导入 Enrichr 工具中。您会看到该工具包含不同的选项卡。
所有结果也可下载到您的本地计算机。转录组分析的计算机环境已部署在 Docker 平台上。该方法使得没有 Linux 系统使用经验的用户也能够使用终端。
该容器中包含用于数据集和脚本的预定义文件夹结构,这些文件对于所有分析都是必需的。在分析流程中,用户将使用来自20名健康个体和39名急性感染基孔肯雅病毒患者的血液转录组数据。测序平台会返回一组包含DNA序列的FASTQ文件,即
测序读段及其对应每个核苷酸碱基的质量值。Phred质量评分用于表示每个碱基被错误读取的概率。工具可识别并去除样本中的低质量读段,以提高读段比对的成功率。
在此步骤中,利用回收的高质量测序读段作为输入,通过比对模块将其与人类参考基因组进行比对。CEMiTool 用于识别和分析共表达模块。同一模块内的基因具有共表达关系,即这些基因在数据集的各个样本中表现出相似的表达模式。
网络分析提供了关于连接度最高的基因(即枢纽基因)的信息,这些基因的名称在网络中显示。
节点的大小与其连接度成正比。差异表达基因分析的结果以火山图形式进行总结。分子扰动程度分析能够识别来自健康个体和感染个体的扰动样本。
MDP 可提示哪些样本可能是生物学上的离群样本。移除这些样本将影响下游分析结果。可使用 AURA 结合 Enrichr 工具进行功能富集分析。
这些步骤有助于通过揭示多个差异表达基因的共同功能作用来解读结果。条形图中显示的生物学过程是根据其 p 值排序得出的前 10 个富集基因集。总之,这些实验方案涵盖了 RNA-Seq 分析的全部步骤。
该流程已开发并封装到名为 Docker 的非商业系统中,以镜像形式提供,供科学界使用。由于采用了容器系统,所有脚本和工具均处于相同的特定版本下,以确保可重复性。
此外,部分生物信息学分析通过免费且用户友好的网络工具完成。
查看完整文字稿并访问数千部科学视频
本文介绍了一种用于研究宿主-病原体相互作用的高通量转录组分析的综合性实验方案,具体基于RNA测序(RNA-seq)数据。该分析流程指导研究人员从原始测序读段出发,依次完成质量控制、序列比对、统计分析和功能注释,结合使用命令行工具和用户友好的网页工具,并将所有工具封装于Docker容器中,以确保实验的可重复性和易用性。
高通量转录组分析使生物制药团队能够系统地研究宿主与病原体之间的相互作用,有助于早期识别疾病机制及潜在的治疗靶点。该分析流程可提供可重复、定量的基因表达动态信息,直接支持靶点验证以及基于风险评估的研发管线决策。在发现阶段整合稳健的RNA测序工作流程,可增强传染病研究项目中预测结果的可信度及转化研究的连续性。
该RNA-seq分析流程涵盖从早期发现到临床前研究的全过程,在可重复的Docker环境中整合了质量控制、序列比对、统计分析和功能注释。