本文介绍了一种从原始测序数据到功能分析的完整RNA测序转录组数据分析流程,包括质量控制和预处理步骤,以及高级统计分析方法。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种从原始测序数据到功能分析的完整RNA测序转录组数据分析流程,包括质量控制和预处理步骤,以及高级统计分析方法。
病原体可引起多种多样的传染性疾病。宿主在感染后所诱导的生物学过程决定了疾病的严重程度。 为了研究这些过程,研究人员可以采用高通量测序技术(RNA-seq),以检测宿主转录组在感染不同阶段、临床结果或疾病严重程度下的动态变化。此类研究有助于更深入地理解疾病机制,并揭示潜在的药物靶点和治疗方法。本文所介绍的方案描述了一个从原始测序数据到功能分析的完整RNA测序数据分析流程。该流程分为五个步骤:(1)数据质量控制;(2)基因比对与注释;(3)统计分析以鉴定差异表达基因和共表达基因;(4)确定样本分子扰动程度;(5)功能分析。第一步旨在去除可能影响下游分析质量的技术性干扰因素。在第二步中,根据标准文库协议对基因进行比对和注释。 第三步的统计分析用于识别感染样本与非感染样本之间差异表达或共表达的基因。第四步采用分子扰动程度方法验证样本变异性和潜在生物学异常值的存在。最后,第五步的功能分析揭示与疾病表型相关的通路。本流程旨在支持研究人员开展宿主-病原体相互作用研究中的RNA-seq数据分析,并推动未来必要的 in vitro 或 in vivo 实验,以深入理解感染的分子机制。
登革热病毒、黄热病病毒、基孔肯雅病毒和寨卡病毒等虫媒病毒已广泛与多次地方性暴发相关,并成为近几十年来导致人类感染的主要病原体之一1,2。感染基孔肯雅病毒(CHIKV)的个体常出现发热、头痛、皮疹、多关节痛和关节炎等症状3,4,5。病毒可扰乱细胞的基因表达,并影响多种宿主信号通路。近期,血液转录组研究利用RNA-seq技术,将急性CHIKV感染期与恢复期6或健康对照组7进行比较,以鉴定差异表达基因(DEGs)。感染CHIKV的儿童中,与天然免疫相关的基因表达上调,例如参与病毒RNA细胞感应、JAK/STAT信号通路以及Toll样受体信号通路的基因6。急性感染CHIKV的成人也表现出与天然免疫相关的基因上调,例如与单核细胞和树突状细胞活化以及抗病毒反应相关的基因7。表达下调基因富集的信号通路则包括与适应性免疫相关的通路,例如T细胞活化与分化,以及T细胞和B细胞富集相关的通路7。
有多种方法可用于分析宿主和病原体基因的转录组数据。通常,RNA-seq文库构建始于成熟poly-A转录本的富集。该步骤可去除大部分核糖体RNA(rRNA),在某些情况下也可去除病毒或细菌RNA。然而,当研究问题涉及病原体转录本检测,并且RNA测序不依赖于前述选择步骤时,测序可检测到更多种类的转录本。例如,亚基因组mRNA已被证明是验证疾病严重程度的重要因素8。此外,对于某些病毒(如CHIKV和SARS-CoV-2),即使使用poly-A富集文库,也能产生可用于下游分析的病毒序列读段9,10。当聚焦于宿主转录组分析时,研究人员可探究样本间的生物学扰动,鉴定差异表达基因和富集通路,并构建共表达模块7,11,12。本实验方案重点介绍利用不同生物信息学方法对CHIKV感染患者与健康个体进行转录组分析的过程(图1A)。代表性结果基于一项先前发表的研究数据7生成,该数据包括20名健康个体和39名急性CHIKV感染个体。
访问受限。请登录或开始试用以查看此内容。
本方案所用样本已获得圣保罗大学生物医学科学研究所微生物学系和塞尔希培联邦大学伦理委员会的批准(方案编号分别为:54937216.5.0000.5467 和 54835916.2.0000.5546)。
1. Docker Desktop 安装
注意:准备 Docker 环境的步骤因操作系统(OS)而异。因此,Mac 用户必须遵循 1.1 中列出的步骤,Linux 用户必须遵循 1.2 中列出的步骤,Windows 用户必须遵循 1.3 中列出的步骤。
2. 数据质量控制
注意:通过图形化方法评估测序读长中错误的概率。去除所有技术性序列,例如接头序列。
3. 样本的比对与注释
注意:在获得高质量的测序读段后,需要将其比对到参考基因组。在此步骤中,使用 STAR 比对工具对示例样本进行比对。STAR 比对工具需要 32 GB 的 RAM 内存来加载并执行读段与基因组的比对。对于不具备 32 GB 内存的用户,可使用已比对好的读段数据。在此情况下,请跳转至步骤 3.3 或使用 Bowtie2 比对工具。本节提供了用于 STAR(所有图示结果均基于此工具)和 Bowtie2(低内存需求的比对工具)的脚本。
4. 差异表达基因与共表达基因
5. 样品分子扰动程度的测定
6. 功能富集分析
访问受限。请登录或开始试用以查看此内容。
转录组分析的计算环境在 Docker 平台上创建并配置。该方法使 Linux 初学者用户无需预先掌握系统管理知识即可使用 Linux 终端系统。Docker 平台利用宿主操作系统的资源,创建包含特定用户工具的服务容器图1B)。基于 Linux 操作系统 Ubuntu 20.04 发行版创建了一个容器,并已为其完整配置转录组分析环境,该容器可被访问 通过 命令行终端。在此容器中,存在一个预定义的数据集和脚本文件夹结构,该结构是所有流程分析所必需的(图1C)。我们研究团队发表的一项研究7 用于分析,包括20份来自健康个体的样本和39份来自急性CHIKV感染个体的样本(图1D).
全转录组RNA测序过程可能产生读取错误,这些错误可能由含有两个或更多转录本的簇或试剂耗尽所引起。测序平台会生成一组“FASTQ”文件,其中包含每条核苷酸碱基的序列(读段...
访问受限。请登录或开始试用以查看此内容。
测序文库的制备是尽可能好地回答生物学问题的关键步骤。研究中感兴趣的转录本类型将决定所选择的测序文库类型,并影响后续的生物信息学分析。例如,在病原体与宿主相互作用的研究中,根据测序类型的不同,有可能同时鉴定出病原体和宿主的转录本序列,或仅鉴定出宿主的转录本序列。
新一代测序设备(例如Illumina平台)会测定测序质量值,该值代表碱基被错误识别的概率。下游分析对低质量序列非常敏感,可能导致基因表达的读取不足或误读。进行正确分析和解释的另一个障碍是接头序列。接头序列有助于文库构建和测序,在大多数情况下,接头本身也会被测序。近期研究发现,比对工具对最终结果的影响较小13。然而,在病原体-宿主研究中,通过测试不同的阈值以尽量减少多位置比对序列的问题,比对过程可能会产生略好的结果。
差异基因表达结果的解读需持一定谨慎态度,尤其是在每组样本数量非常少、且样本来自不同检测实验并受到批次效应干扰的情况下,这会影响差异表达基因(DEGs)的分析结果。这些结果对多个因素较为敏感:(i)所应用的数据过...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
HN 由 FAPESP(资助编号:#2017/50137-3、2012/19278-6、2018/14933-2、2018/21934-5 和 2013/08216-2)和 CNPq(313662/2017-7)资助。
我们特别感谢以下资助项目对研究员的支持:ANAG(FAPESP 项目编号 2019/13880-5)、VEM(FAPESP 项目编号 2019/16418-0)、IMSC(FAPESP 项目编号 2020/05284-0)、APV(FAPESP 项目编号 2019/27146-1)以及 RLTO(CNPq 项目编号 134204/2019-0)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CEMiTool | 计算系统生物学实验室 | 1.12.2 | 以完全自动化的方式发现和分析共表达基因模块,并生成包含高质量图表的用户友好型 HTML 报告。 |
| EdgeR | Bioconductor(维护者:Yunshun Chen [yuchen at wehi.edu.au]) | 3.30.3 | 对具有生物学重复的 RNA-seq 表达谱进行差异表达分析 |
| EnhancedVolcano | Bioconductor(维护者:Kevin Blighe [kevin at clinicalbioinformatics.co.uk]) | 1.6.0 | 生成适合发表的火山图,具有增强的着色和标签功能 |
| FastQC | Babraham 生物信息学中心 | 0.11.9 | 旨在为来自高通量测序的原始序列数据提供简便的质量控制检查方法 |
| FeatureCounts | 生物信息学部,沃尔特与伊丽莎·霍尔医学研究所 | 2.0.0 | 将比对后的测序读段分配到指定的基因组特征区域 |
| MDP | 计算系统生物学实验室 | 1.8.0 | 分子扰动程度(Molecular Degree of Perturbation)根据样本相对于对照组的转录组扰动情况计算评分 |
| R | R 核心团队 | 4.0.3 | 用于统计计算和图形展示的编程语言及自由软件环境 |
| STAR | 生物信息学部,沃尔特与伊丽莎·霍尔医学研究所 | 2.7.6a | 一种比对工具,采用可处理剪接比对的策略,专门应对 RNA-seq 数据比对中的诸多挑战 |
| Bowtie2 | 约翰斯·霍普金斯大学 | 2.4.2 | 一种超快速且内存效率高的工具,用于将测序读段比对至长参考序列 |
| Trimmomatic | USADEL 实验室 | 0.39 | 对 Illumina 双端和单端测序数据执行接头序列修剪任务 |
| Get Docker | Docker | 20.10.2 | 创建可重现且可预测的生物信息学环境(https://docs.docker.com/get-docker/) |
| WSL2-Kernel | Windows | NA | https://docs.microsoft.com/zh-cn/windows/wsl/wsl2-kernel |
| Get Docker Linux | Docker | NA | https://docs.docker.com/engine/install/ubuntu/ |
| Docker Linux Repository | Docker | NA | https://docs.docker.com/engine/install/ubuntu/#install-using-the-repository |
| MDP Website | 计算系统生物学实验室 | NA | https://mdp.sysbio.tools |
| Enrichr Website | MaayanLab | NA | https://maayanlab.cloud/Enrichr/ |
| webCEMiTool | 计算系统生物学实验室 | NA | https://cemitool.sysbio.tools/ |
| gProfiler | 生物信息学、算法与数据挖掘研究组 | NA | https://biit.cs.ut.ee/gprofiler/gost |
| goseq | Bioconductor(维护者:Matthew Young [my4 at sanger.ac.uk]) | NA | http://bioconductor.org/packages/release/bioc/html/goseq.html |
| SRA NCBI study | NCBI | NA | https://www.ncbi.nlm.nih.gov/bioproject/PRJNA507472/ |
访问受限。请登录或开始试用以查看此内容。