本文介绍了一种可重复的基于 Seurat 的分析流程,用于分析外周血单个核细胞中 CD4⁺ T 细胞的单细胞 RNA 测序数据,以表征疟疾再感染期间的转录异质性及功能性免疫程序。该流程能够对不同条件下动态变化的 CD4⁺ T 细胞状态和免疫反应进行一致性的鉴定、比较和生物学解读。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种可重复的基于 Seurat 的分析流程,用于分析外周血单个核细胞中 CD4⁺ T 细胞的单细胞 RNA 测序数据,以表征疟疾再感染期间的转录异质性及功能性免疫程序。该流程能够对不同条件下动态变化的 CD4⁺ T 细胞状态和免疫反应进行一致性的鉴定、比较和生物学解读。
本文介绍了一种可重复的基于 Seurat 的分析流程,用于分析疟疾再感染不同时间点的外周血单个核细胞(PBMC)中 CD4⁺ T 细胞的单细胞 RNA 测序数据。该流程展示了一个基于 Seurat 的可重复工作流,用于分析疟疾再感染各时间点 PBMC 中 CD4⁺ T 细胞的单细胞 RNA 测序(scRNA-seq)数据,并利用公开的代表性数据集演示其应用:一个针对疟原虫特异性的 T 细胞受体转基因 CD4⁺ T 细胞数据集(GSE233703),以及一个比较再感染相关时间点的多克隆 CD4⁺ T 细胞数据集(GSE233713;D27₍₃₎ 与 D30)。该工作流包含在统一计算框架下的标准化预处理、数据整合、聚类分析及下游转录组分析。该方法可系统计算预定义的免疫及 CD4⁺ T 细胞功能模块的评分,识别各聚类特异性的标志基因,进行时间点解析的差异表达分析,并开展下游的基因本体(Gene Ontology)和 KEGG 通路富集分析。应用此工作流可识别出不同的 CD4⁺ T 细胞功能状态,并揭示疟疾再感染过程中动态的转录变化。该流程生成标准化的可视化结果和表格化输出,并提供参数选择与问题排查的实用指导,有助于在疟疾及相关免疫学研究背景下对 CD4⁺ T 细胞 scRNA-seq 数据集进行一致且可重复的分析。本方案支持可重复且具有生物学解释性的免疫应答分析,亦可推广应用于免疫学研究中的其他类似单细胞数据集。
疟疾仍然是全球重大公共卫生负担,反复感染以复杂且尚未完全阐明的方式塑造宿主免疫应答1。CD4⁺ T细胞在抗疟疾免疫应答中发挥核心作用,通过协调效应细胞因子的产生、辅助B细胞功能以及调控炎症反应2,3。在疟疾再感染过程中,CD4⁺ T细胞经历动态的转录重编程,反映出效应、调节、记忆、增殖及耗竭状态之间的转换,这些状态影响着寄生虫控制和免疫病理过程4,5。准确解析这种异质性,对于理解免疫保护机制、免疫功能障碍以及自然获得性或疫苗诱导的针对疟原虫感染的免疫力持久性至关重要。本文介绍了一种可重复的基于Seurat的分析流程,用于分析疟疾再感染不同时间点的CD4⁺ T细胞单细胞RNA测序(scRNA-seq)数据。
单细胞RNA测序(scRNA-seq)能够高分辨率地表征免疫异质性,并已在疟疾研究中鉴定出对寄生虫有响应的CD4⁺ T细胞亚群、耗竭程序以及调控网络6,7,8,9。然而,由于在质量控制、标准化、聚类和数据整合等分析步骤中存在变异性,可能限制结果的可重复性,并使跨研究的比较变得复杂10,11。目前仍缺乏一种专门针对疟疾再感染过程中CD4⁺ T细胞动态分析而优化的标准且基于生物学指导的工作流程。
现有的单细胞RNA测序(scRNA-seq)分析计算框架(如 Seurat 和 Scanpy)为单细胞数据的预处理、聚类及下游分析提供了全面的工具集12,13,14。Seurat 基于 R 语言开发,提供了一整套紧密集成的工作流程,涵盖标准化、数据整合和可视化,其中包括方差稳定化方法(如 SCTransform),可提升在异质性免疫数据集中信号的检测能力13。Scanpy 基于 Python 开发,提供了可扩展的解决方案,针对大规模数据集和高效内存使用进行了优化,特别适用于高通量或基于云的分析12,14。尽管已有上述进展,目前仍缺乏标准化且可重复的工作流程,能够明确针对感染环境中的生物学问题,同时在不同数据集之间保持透明性、可适应性和一致性。本实验方案通过结合基于 Seurat 的稳健预处理流程与针对疟疾再感染过程中 CD4⁺ T 细胞应答的结构化生物学解析,填补了这一空白。与现有的通用型工作流程相比,本方案更加强调可重复性、基于生物学依据的参数选择,以及针对感染模型设计的一致性跨时间点分析。
本方案的一个关键特征是强调可重复性和实际可用性。质量控制阈值并非固定不变,而是基于中位绝对偏差采用数据自适应方法进行推导,从而使转录本复杂性、测序深度和线粒体含量的阈值能够根据数据集特异性的分布进行调整。该设计使得该工作流程适用于不同规模的数据集,通常涵盖从数千到数万个细胞,并适用于基于微滴的单细胞RNA测序实验中常见的广泛测序深度范围。工作流程中嵌入的指导原则有助于合理选择降维、聚类分辨率和数据整合的参数,确保分析结果既具有生物学意义,又具备技术上的稳健性。然而,该工作流程依赖于数据质量和测序深度,对于稀疏性极高或存在显著批次效应的数据集,可能需要进行相应调整。
本方案适用于具备R语言和单细胞分析基础知识的中级至高级用户,同时通过其结构化的分步实施方式和完全可重复的输出结果,也便于有积极性的初学者学习使用。该工作流程在每个阶段均生成标准化的表格和图表,包括质控汇总、聚类结果、差异表达分析结果以及富集分析结果,从而有助于在协作研究或多研究整合的背景下实现透明化、验证和结果复用。本方案特别适用于在感染与免疫学研究中,针对不同时间点或条件下免疫异质性进行的研究。
该方法提供了一种可重复的、端到端的基于 Seurat 的 CD4⁺ T 细胞单细胞 RNA 测序(scRNA-seq)分析流程,适用于疟疾再感染不同时间点的研究。该流程在适当时整合了自适应质量控制、方差稳定化、降维、聚类以及多样本整合13,15。为增强生物学可解释性,流程中引入了免疫相关及 CD4⁺ T 细胞亚群基因模块评分,用于量化功能程序,包括 Th1、Tfh、Tr1、Treg、中央记忆、效应记忆、增殖、细胞毒性及耗竭状态16,17,18。此外,还包括互补的聚类标志物鉴定、时间点间的差异表达分析,以及利用 Gene Ontology 和 KEGG 数据库进行通路富集分析,以支持对 T 细胞状态的可靠注释与比较19,20。尽管本方案使用公开可用的疟原虫(Plasmodium)单细胞 RNA 测序数据集进行演示,但该实验方案广泛适用于其他疟疾再感染模型及免疫扰动研究,尤其适用于需要对 CD4⁺ T 细胞进行可重复且具生物学解释性的单细胞分析的情境。总体而言,本方案为 CD4⁺ T 细胞应答的单细胞分析提供了可重复且具生物学解释性的分析框架,有助于对疟疾及相关系统中免疫动态的稳健研究。
访问受限。请登录或开始试用以查看此内容。
伦理声明:
本研究使用的所有数据均来自公开可用的数据集(GSE233703 和 GSE233713)。原始研究遵循了机构和动物实验的伦理准则。本研究涉及对从基因表达综合数据库(Gene Expression Omnibus, GEO)获取的公开、去标识化的单细胞RNA测序数据集(GSE233703 和 GSE233713)进行二次生物信息学分析。本研究未涉及新的研究参与者、临床样本或可识别的患者信息。根据机构和国家关于使用公开可用匿名数据集开展研究的相关规定,本次生物信息学分析无需额外的伦理审批和知情同意。与这些数据集相关的原始研究均按照相关机构的伦理标准及生物医学研究适用指南进行。
1. 基于 Seurat 的 GSE233703 和 GSE233713 数据集 CD4⁺ T 细胞单细胞 RNA 测序可重复分析流程
注意:此工作流程作为补充文件 S1提供。另请参见示意图,以了解整个工作流程的概览(图 1)。
2. 创建项目结构
3. 导入计数矩阵并验证输入完整性
4. 定义标记物和模块面板
5. 创建 Seurat 对象并计算质控指标
6. 推导自适应质控阈值并过滤低质量细胞
7. 数据标准化并执行主成分分析(PCA)
8. 构建邻域、选择分辨率并聚类细胞
9. 对 GSE233713 进行基于 SCT 的整合
10. 注释聚类并验证标记物结构
11. 鉴定标志物并进行差异表达分析。
12. 保存最终输出结果并归档会话
访问受限。请登录或开始试用以查看此内容。
测序质量与细胞水平质控(抗原特异性(PcAS反应性)TCR转基因CD4⁺ T细胞(GSE233703))
预过滤的质量控制分布(图 2A)显示转录本复杂性存在异质性,大多数细胞表现出中等水平的基因数和UMI数,而较小的细胞亚群呈现出高计数的离群特征,符合潜在的多重细胞(multiplets)情况。散点图(图 2B)显示nCount_RNA与nFeature_RNA之间存在强烈的正相关关系,而percent.mt与总计数之间的关联较弱,表明文库复杂性可接受,且在过滤前未见广泛的细胞应激迹象。
为避免任意过滤,采用基于中位绝对偏差(MAD)的方法对经对数转换的 nFeature_RNA 和 nCount_RNA 值设定自适应阈值,并结合稳健的线粒体含量截断值。对于 GSE233703,最终的过滤阈值为每细胞检测到 441–3,054 个基因、每细胞 653–12,137 个 UM...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种基于 Seurat 的标准化且可重复的工作流程,用于分析疟疾再感染期间 CD4⁺ T 细胞的转录动态。该方案在一个统一的计算框架内整合了自适应质量控制、标准化、降维、聚类、数据集整合、标志物验证、模块评分以及差异表达分析。上述分析步骤共同实现了在抗原特异性和多克隆数据集中对具有生物学意义的 CD4⁺ T 细胞状态进行可重复的识别与解读13,14,15。
代表性结果表明,与疟疾再感染相关的协调性 CD4⁺ T 细胞程序包括 Th1 效应、滤泡辅助性 T(Tfh)、调节性、耗竭相关、增殖性、干扰素应答以及类记忆状态。Ifng 和 Tbx21 的富集支持了与寄生虫控制相关的促炎性 Th1 应答,而 Bcl6、Cxcr5、Pdcd1 和 Il21 的表达则鉴定了与 B 细胞辅助和体液免疫相关的 Tfh 程序。包括 Ctla4、Lag3、Pdcd1 和 Il10 在内的调节性和耗竭相关标志物...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 材料/设备名称 | 公司/来源 | 目录编号 | 备注/描述 |
| 10x Genomics–格式化的计数矩阵 | NCBI GEO | N/A | Matrix Market 文件(matrix.mtx、features.tsv、barcodes.tsv) |
| clusterProfiler(R 软件包) | Bioconductor | N/A | RRID:SCR_016884;功能富集分析(GO、KEGG) |
| enrichplot(R 软件包) | Bioconductor | N/A | RRID:SCR_017030;富集分析结果的可视化 |
| GEO 数据集 GSE233703 | NCBI 基因表达综合数据库 | GSE233703 | PcAS特异性TCR转基因CD4+ T细胞单细胞RNA测序数据集 |
| GEO 数据集 GSE233713 | NCBI 基因表达综合数据库 | GSE233713 | 多克隆CD4+ T细胞单细胞RNA测序数据集(D273 与 D30 比较) |
| GitHub(可选) | GitHub 公司 | N/A | RRID:SCR_002630;版本控制与可重复性(可选) |
| glmGamPoi(R 软件包) | Bioconductor | N/A | RRID:SCR_021001;加速的 SCTransform 模型拟合 |
| Matrix(R 软件包) | CRAN | N/A | RRID:SCR_008389;用于单细胞RNA测序数据的稀疏矩阵处理 |
| 操作系统 | Microsoft / Apple / Linux | N/A | 支持 Windows 10+、macOS 或 Linux |
| org.Mm.eg.db(R 软件包) | Bioconductor | N/A | RRID:SCR_002643;小鼠基因注释数据库 |
| patchwork(R 软件包) | CRAN | N/A | RRID:SCR_018787;多图组合成图 |
| PDF 查看器 | 任意 | N/A | 用于查看质控图、UMAP 图和热图 |
| 个人计算机或工作站 | 任意 | N/A | 建议集成分析时至少配备 16–32 GB 内存 |
| pheatmap(R 软件包) | CRAN | N/A | RRID:SCR_016418;基因表达热图可视化 |
| R 统计软件(版本 ≥ 4.2) | R 基金会统计计算组织 | N/A | RRID:SCR_001905;核心计算环境 |
| RStudio Desktop | Posit 软件公司 | N/A | RRID:SCR_000432;R 语言集成开发环境 |
| Seurat(R 软件包,v4 或更高版本) | Satija 实验室 | N/A | RRID:SCR_016341;单细胞RNA测序分析 |
| tidyverse(R 软件包套件) | CRAN | N/A | RRID:SCR_019186;数据处理与可视化 |
访问受限。请登录或开始试用以查看此内容。
本文已发表
视频即将推出