需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于大量RNA测序数据的转录组分析

620 次观看

DOI:

10.3791/69611

2026年1月16日

* These authors contributed equally

本文内容

摘要

本方案建立了一个完整的分析流程,用于从原始数据到功能富集分析的批量RNA测序(bulk RNA-seq)研究。

摘要

非酒精性脂肪肝(NAFL)通常被认为是一种良性疾病;然而,一旦进展为非酒精性脂肪性肝炎(NASH),患者发展为终末期肝病的风险将显著增加。目前许多研究正致力于阐明NAFL向NASH转变的分子机制。高通量测序技术(如批量RNA测序,bulk RNA-seq)通过分析转录组,揭示了与疾病进展相关的分子表达、信号通路激活及其他因素,使研究人员获得了更深入的理解。目前已有大量开源数据可供研究人员分析,以识别潜在的疾病治疗靶点。然而,相关研究受限于缺乏高效且可靠的转录组上游分析流程。本文提供了一种高度可重复且用户友好的上游分析流程及后续差异基因分析流程,以实现对私有或公共数据的标准化处理与深度解析。该流程分为四个步骤:(1)数据质量控制;(2)基因比对;(3)差异基因分析;(4)功能分析。该流程旨在揭示疾病转变的分子机制,并通过批量RNA-seq数据分析,帮助研究人员筛选潜在的药物靶点和治疗策略。

引言

非酒精性脂肪性肝病(NAFLD)是全球最常见的慢性肝病,影响超过四分之一的人口。近几十年来,其发病率显著上升1,2,3。该疾病的负担日益加重,尤其是其更严重的形态——非酒精性脂肪性肝炎(NASH),已成为重大的全球健康挑战,并带来沉重的经济负担4。NAFLD 的第一阶段为非酒精性脂肪肝(NAFL),常伴随炎症和纤维化,可进一步发展为 NASH。后者显著增加了进展为终末期肝病(包括肝硬化和肝细胞癌(HCC))的风险5,6,7。HCC 的发病率和死亡率与 NASH 的增加密切相关8,9,预计到 2030 年,NAFLD/NASH 将成为肝移植的首要指征10。然而,NAFLD 的临床进展具有高度异质性11,严重阻碍了相关药物的研发12,因此,精确探究其涉及的分子机....

访问受限。请登录或开始试用以查看此内容。

方案

为演示目的,本研究使用Lan Bai等人生成的公开可用数据集PRJNA1023502,以展示上游和下游分析的每一步流程20。由于该数据集来源于开放获取的NCBI SRA数据库,因此无需额外的许可或伦理审批。请参见材料表以确认所有必需的软件及R包版本。公开可用数据集PRJNA1023502包含6个非NASH、6个NAFL和6个NASH肝组织RNA-seq样本。在本实验方案中,该数据集用于演示批量RNA-seq工作流程的全部步骤,包括从SRA数据库获取数据、质量控制(fastp)、比对(HISAT2)、定量(featureCounts),以及下游的差异表达分析和功能富集分析。

1. SRA 工具包安装

  1. 访问 SRA Toolkit 官方网站并下载 3.2.1 版本。

2. 公共数据下载

  1. 获取SRA编号。
    1. 在文章的补充材料20、数据可用性部分,或通过在NCBI SRA数据库中搜索关键词来获取。
    2. 在终端中输入 prefetch <SRA编号> 以下载数据。

访问受限。请登录或开始试用以查看此内容。

结果

批量RNA测序的上游分析流程如图1A所示。该流程在Linux平台上依次执行以下关键步骤:首先,使用fastp对原始测序数据进行严格的质控,以去除低质量读段和接头序列;随后,HISAT2将高质量读段比对至参考基因组,并由Samtools转换和排序比对文件;最后,FeatureCounts进行基因水平的定量分析,生成基因表达矩阵,为下游分析提供高质量输入数据。所得表达矩阵的后续处理与统计分析在R环境中进行,相关流程及所需软件包如图1B所示。分析所用数据来自一项已发表的研究,包括6个非NASH样本、6个NAFL样本和6个NASH样本20图1C)。非NASH对照样本来自不符合肝移植标准且无NAFLD或NASH的个体。

需要注意的是,由于 Bai 等人公开提供的数据未包含明确的批次信息(例如测序批次或文库制备日期),也未提供显著差异表达基因的可下载列表,本研究无法直.......

访问受限。请登录或开始试用以查看此内容。

讨论

大规模RNA测序数据分析是一项跨学科任务,涉及基因组学、生物信息学、统计学和计算机科学的整合。一个完整的分析流程包括多个上游和下游步骤,如原始数据预处理、质量控制、序列比对、基因水平定量、数据标准化、差异表达分析以及生物学解释。在这些步骤中,将原始测序读段准确转化为高质量的基因表达矩阵尤为关键,因为在上游处理过程中引入的任何错误都可能传递至所有下游的生物学结论中。因此,建立透明且标准化的上游分析流程对于提高转录组学研究的可重复性至关重要。

本方案提供了一种简化的、完全基于脚本的工作流程,整合了多种广泛使用的工具,如 fastp(用于读段修剪和质量控制)、HISAT2(用于可变剪接感知的比对)以及 featureCounts(用于基因水平的定量)。这些工具已在成熟的 RNA-seq 分析框架中得到广泛应用——包括源自 Tuxedo 的分析流程和普遍采用的实验方案流程——并经过了对准确性与效率的严格验证21,22。在这些基础方法的基础上,该工作流程通过引入明确的文件处理.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在利益冲突。

致谢

作者感谢本研究中所使用的公开数据库的维护人员。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
biomaRtBioconductor2.64.0来自 Ensembl 的基因注释
clusterProfilerBioconductor4.16.0功能富集分析
DESeq2Bioconductor1.48.1差异表达分析
FactoMineRAgroParisTech2.11.0主成分分析和多变量分析
fastpOpenGene1.0.1FASTQ 数据的质量控制与过滤
FeatureCountsBioinformatics Division, The Walter and Eliza Hall Institute of Medical Research2.0.0 对映射到每个基因的读段进行计数,用于基因表达定量
ggplot2Posit3.5.2数据可视化
ggrepelKamil Slowikowski0.9.6避免重叠的文本标签
ggridgesClaus O. Wilke0.5.6绘制山脊图
HISAT2Johns Hopkins University2.2.1将过滤后的高质量读段比对至参考基因组
RR Core Team 4.5.0用于数据计算、分析和可视化的环境
RColorBrewerErich Neuwirth1.1.3绘图用配色方案
samtoolsLarge Scale Genomics work stream1.22.0转换和处理 SAM 文件以实现高效检索与访问
SRA ToolkitNational Center for Biotechnology Information3.2.1从 NCBI SRA 数据库获取并预处理原始测序数据

参考文献

  1. Asrani, S. K., Devarbhavi, H., Eaton, J., Kamath, P. S. Burden of liver diseases in the world. J Hepatol. 70 (1), 151-171 (2019).
  2. Friedman, S. L., Neuschwander-Tetri, B. A., Rinella, M., Sanyal, A. J. Mechanisms of NAFLD development and therapeutic strategies. Nat Med. 24 (7), 908-922 (2018).
  3. <....

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签