需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

一种可重复的基于Seurat的单细胞RNA测序分析疟疾再感染期间外周血单个核细胞CD4+ T细胞的实验方案

106 次观看

DOI:

10.3791/70858

2026年7月31日

本文内容

摘要

本文介绍了一种可重复的基于 Seurat 的分析流程,用于分析外周血单个核细胞中 CD4⁺ T 细胞的单细胞 RNA 测序数据,以表征疟疾再感染期间的转录异质性及功能性免疫程序。该流程能够对不同条件下动态变化的 CD4⁺ T 细胞状态和免疫反应进行一致性的鉴定、比较和生物学解读。

摘要

本文介绍了一种可重复的基于 Seurat 的分析流程,用于分析疟疾再感染不同时间点的外周血单个核细胞(PBMC)中 CD4⁺ T 细胞的单细胞 RNA 测序数据。该流程展示了一个基于 Seurat 的可重复工作流,用于分析疟疾再感染各时间点 PBMC 中 CD4⁺ T 细胞的单细胞 RNA 测序(scRNA-seq)数据,并利用公开的代表性数据集演示其应用:一个针对疟原虫特异性的 T 细胞受体转基因 CD4⁺ T 细胞数据集(GSE233703),以及一个比较再感染相关时间点的多克隆 CD4⁺ T 细胞数据集(GSE233713;D27₍₃₎ 与 D30)。该工作流包含在统一计算框架下的标准化预处理、数据整合、聚类分析及下游转录组分析。该方法可系统计算预定义的免疫及 CD4⁺ T 细胞功能模块的评分,识别各聚类特异性的标志基因,进行时间点解析的差异表达分析,并开展下游的基因本体(Gene Ontology)和 KEGG 通路富集分析。应用此工作流可识别出不同的 CD4⁺ T 细胞功能状态,并揭示疟疾再感染过程中动态的转录变化。该流程生成标准化的可视化结果和表格化输出,并提供参数选择与问题排查的实用指导,有助于在疟疾及相关免疫学研究背景下对 CD4⁺ T 细胞 scRNA-seq 数据集进行一致且可重复的分析。本方案支持可重复且具有生物学解释性的免疫应答分析,亦可推广应用于免疫学研究中的其他类似单细胞数据集。

引言

疟疾仍然是全球重大公共卫生负担,反复感染以复杂且尚未完全阐明的方式塑造宿主免疫应答1。CD4⁺ T细胞在抗疟疾免疫应答中发挥核心作用,通过协调效应细胞因子的产生、辅助B细胞功能以及调控炎症反应2,3。在疟疾再感染过程中,CD4⁺ T细胞经历动态的转录重编程,反映出效应、调节、记忆、增殖及耗竭状态之间的转换,这些状态影响着寄生虫控制和免疫病理过程4,5。准确解析这种异质性,对于理解免疫保护机制、免疫功能障碍以及自然获得性或疫苗诱导的针对疟原虫感染的免疫力持久性至关重要。本文介绍了一种可重复的基于Seurat的分析流程,用于分析疟疾再感染不同时间点的CD4⁺ T细胞单细胞RNA测序(scRNA-seq)数据。

单细胞RNA测序(scRNA-seq)能够高分辨率地表征免疫异质性,并已在疟疾研究中鉴定出对寄生虫有响应的CD4⁺ T细胞亚群、耗竭程序以及调控网络6,7,8,9。然而,由于在质量控制、标准化、聚类和数据整合等分析步骤中存在变异性,可能限制结果的可重复性,并使跨研究的比较变得复杂10,11。目前仍缺乏一种专门针对疟疾再感染过程中CD4⁺ T细胞动态分析而优化的标准且基于生物学指导的工作流程。

现有的单细胞RNA测序(scRNA-seq)分析计算框架(如 Seurat 和 Scanpy)为单细胞数据的预处理、聚类及下游分析提供了全面的工具集12,13,14。Seurat 基于 R 语言开发,提供了一整套紧密集成的工作流程,涵盖标准化、数据整合和可视化,其中包括方差稳定化方法(如 SCTransform),可提升在异质性免疫数据集中信号的检测能力13。Scanpy 基于 Python 开发,提供了可扩展的解决方案,针对大规模数据集和高效内存使用进行了优化,特别适用于高通量或基于云的分析12,14。尽管已有上述进展,目前仍缺乏标准化且可重复的工作流程,能够明确针对感染环境中的生物学问题,同时在不同数据集之间保持透明性、可适应性和一致性。本实验方案通过结合基于 Seurat 的稳健预处理流程与针对疟疾再感染过程中 CD4⁺ T 细胞应答的结构化生物学解析,填补了这一空白。与现有的通用型工作流程相比,本方案更加强调可重复性、基于生物学依据的参数选择,以及针对感染模型设计的一致性跨时间点分析。

本方案的一个关键特征是强调可重复性和实际可用性。质量控制阈值并非固定不变,而是基于中位绝对偏差采用数据自适应方法进行推导,从而使转录本复杂性、测序深度和线粒体含量的阈值能够根据数据集特异性的分布进行调整。该设计使得该工作流程适用于不同规模的数据集,通常涵盖从数千到数万个细胞,并适用于基于微滴的单细胞RNA测序实验中常见的广泛测序深度范围。工作流程中嵌入的指导原则有助于合理选择降维、聚类分辨率和数据整合的参数,确保分析结果既具有生物学意义,又具备技术上的稳健性。然而,该工作流程依赖于数据质量和测序深度,对于稀疏性极高或存在显著批次效应的数据集,可能需要进行相应调整。

本方案适用于具备R语言和单细胞分析基础知识的中级至高级用户,同时通过其结构化的分步实施方式和完全可重复的输出结果,也便于有积极性的初学者学习使用。该工作流程在每个阶段均生成标准化的表格和图表,包括质控汇总、聚类结果、差异表达分析结果以及富集分析结果,从而有助于在协作研究或多研究整合的背景下实现透明化、验证和结果复用。本方案特别适用于在感染与免疫学研究中,针对不同时间点或条件下免疫异质性进行的研究。

该方法提供了一种可重复的、端到端的基于 Seurat 的 CD4⁺ T 细胞单细胞 RNA 测序(scRNA-seq)分析流程,适用于疟疾再感染不同时间点的研究。该流程在适当时整合了自适应质量控制、方差稳定化、降维、聚类以及多样本整合13,15。为增强生物学可解释性,流程中引入了免疫相关及 CD4⁺ T 细胞亚群基因模块评分,用于量化功能程序,包括 Th1、Tfh、Tr1、Treg、中央记忆、效应记忆、增殖、细胞毒性及耗竭状态16,17,18。此外,还包括互补的聚类标志物鉴定、时间点间的差异表达分析,以及利用 Gene Ontology 和 KEGG 数据库进行通路富集分析,以支持对 T 细胞状态的可靠注释与比较19,20。尽管本方案使用公开可用的疟原虫(Plasmodium)单细胞 RNA 测序数据集进行演示,但该实验方案广泛适用于其他疟疾再感染模型及免疫扰动研究,尤其适用于需要对 CD4⁺ T 细胞进行可重复且具生物学解释性的单细胞分析的情境。总体而言,本方案为 CD4⁺ T 细胞应答的单细胞分析提供了可重复且具生物学解释性的分析框架,有助于对疟疾及相关系统中免疫动态的稳健研究。

访问受限。请登录或开始试用以查看此内容。

方案

伦理声明:

本研究使用的所有数据均来自公开可用的数据集(GSE233703 和 GSE233713)。原始研究遵循了机构和动物实验的伦理准则。本研究涉及对从基因表达综合数据库(Gene Expression Omnibus, GEO)获取的公开、去标识化的单细胞RNA测序数据集(GSE233703 和 GSE233713)进行二次生物信息学分析。本研究未涉及新的研究参与者、临床样本或可识别的患者信息。根据机构和国家关于使用公开可用匿名数据集开展研究的相关规定,本次生物信息学分析无需额外的伦理审批和知情同意。与这些数据集相关的原始研究均按照相关机构的伦理标准及生物医学研究适用指南进行。

1. 基于 Seurat 的 GSE233703 和 GSE233713 数据集 CD4⁺ T 细胞单细胞 RNA 测序可重复分析流程

注意:此工作流程作为补充文件 S1提供。另请参见示意图,以了解整个工作流程的概览(图 1)

  1. 在开始本实验方案之前,明确其适用范围和目标用户
  2. 定义目标用户
    1. 若用户具备 R 语言及单细胞 RNA 测序(scRNA-seq)分析的中级至高级经验,可使用本实验方案。
    2. 将本工作流程应用于以 10x 风格矩阵格式生成的小鼠脾脏 CD4⁺ T 细胞数据集。利用逐步结构和预期输出结果,在进入下一步前验证每个阶段的正确性。
      注意:处理大规模测序数据集时,务必遵循适当的数据管理规范,并确保数据的安全存储。
  3. 定义单细胞 RNA 测序(scRNA-seq)
    1. 将单细胞 RNA 测序(scRNA-seq)视为一种转录组学方法²¹,用于量化单个细胞中的基因表达水平。
    2. 利用 scRNA-seq 识别复杂组织中的离散细胞状态、过渡性细胞群体以及异质性免疫程序。
  4. 准备软件及程序包需求
  5. 安装核心软件
    1. 安装 R 4.2 或更高版本。
    2. 打开 RStudio 界面,使用 setwd() 设置工作目录。
    3. 使用 source() 函数按顺序执行脚本。在项目记录中注明所使用的 R、RStudio 及操作系统的具体版本。
  6. 安装 R 程序包
    1. 安装所需的 CRAN 程序包:Seurat、Matrix、tidyverse、patchwork、pheatmap、RColorBrewer、cluster、glmGamPoi 和 ggplot2。
    2. 安装所需的 Bioconductor 程序包:clusterProfiler、org.Mm.eg.db、enrichplot 和 DESeq2。
    3. 仅在需要时安装可选程序包:DoubletFinder 用于去除双细胞(doublet),monocle3 用于轨迹分析。在分析会话开始时加载所有必需的程序包。
  7. 记录版本信息
    1. 在工作流程结束时,使用 sessionInfo() 或等效函数保存程序包及会话信息。
    2. 在论文中明确报告关键分析组件的版本,包括 R 版本、Seurat 版本、DESeq2 版本和 clusterProfiler 版本。
  8. 运行 补充文件 2 中提到的示例安装命令
  9. 确认硬件与存储需求
  10. 确认最低资源配置
    1. 对于包含数千至数万个细胞的数据集的常规分析,应使用至少配备 16 GB 内存、4 个 CPU 核心和 20 GB 可用磁盘空间的工作站。
  11. 确认推荐资源配置
    1. 对于整合分析、重复绘图或可选的双细胞检测,建议使用 32 GB 或更多内存。
    2. 若因大对象或整合数据集导致内存相关错误,应增加 future.globals.maxSize 的设置值。
    3. 应用示例内存设置
  12. 运行以下命令,设置 补充文件 2 中提到的内存选项

2. 创建项目结构

  1. 创建根项目目录
    1. 为分析创建一个项目目录。
    2. 创建名为 data/、scripts/ 和 results_spleen_cd4/ 的子目录。
  2. 使用标准化的输出结构
    1. 确保工作流程将输出写入以下目录:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/tables/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/tables/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. 使用一致的文件命名方式
    1. 重命名 GEO 输入文件,使其与脚本预期的路径匹配。
    2. 使用以下确切的文件名:
      data/GSE233703_matrix.mtx.gz
      data/GSE233703_genes.tsv.gz
      data/GSE233703_barcodes.tsv.gz
      data/GSE233713_d27_3_matrix.mtx.gz
      data/GSE233713_d27_3_features.tsv.gz
      data/GSE233713_d27_3_barcodes.tsv.gz
      data/GSE233713_d30_matrix.mtx.gz
      data/GSE233713_d30_features.tsv.gz
      data/GSE233713_d30_barcodes.tsv.gz
    3. 将可选的元数据文件命名为:
      data/GSE233703_cell_metadata.csv
      data/GSE233713_cell_metadata.csv
  4. 确认元数据要求
    1. 确认每个元数据文件均包含 barcode 列。在可用时添加 sample、timepoint 和 replicate 等可选列。
    2. 确保元数据与计数矩阵之间的 barcode 完全匹配。
      注意:在开始导入前,请确认矩阵三元组和元数据文件存在于预期路径中。

3. 导入计数矩阵并验证输入完整性

  1. 读取 10x 样式矩阵
    1. 将每个 matrix.mtx.gz 文件作为稀疏矩阵读取。
    2. 将对应的 features(或 genes)文件和 barcode 文件作为制表符分隔的表格读取。
    3. 若 features 文件的第二列可用,则使用该列将基因符号分配给矩阵的行。使用 make.unique() 确保基因符号的唯一性。
    4. 将 barcode 标识符分配给矩阵的列。
  2. 运行示例导入函数
    1. 执行 补充文件 2 中提到的代码,以导入矩阵并分配标识符。
  3. 验证矩阵完整性
    1. 验证矩阵的行数是否等于 features 的数量,列数是否等于 barcodes 的数量。
    2. 若发现任何不匹配,则停止工作流程。
      注意:若检测到不匹配,请验证文件完整性,并确保在重新运行该步骤前,features 文件与 barcodes 文件正确对齐。
      检查点:仅当行数与 features 数量匹配、列数与 barcodes 数量匹配时,方可继续。

4. 定义标记物和模块面板

  1. 定义与疟疾相关的 CD4⁺ T 细胞基因面板
    1. 为以下类别定义命名的基因面板:Th1、Tfh、Tr1、Treg、Tcm、Tem、耗竭(Exhaustion)、增殖(Proliferation)、细胞毒性(Cytotoxic)、早期活化(Activation_early)、干扰素应答(Interferon_response)、免疫调节(Immune_regulation)
    2. 将这些面板存储在一个命名的 R 列表中,用于下游模块评分。
  2. 运行 补充文件 2 中提到的 R 代码以定义基因面板。
  3. 定义标志物验证基因
    1. 定义一个独立的验证面板,包含经典的标志物基因,如 Foxp3、Bcl6、Cxcr5、Il21、Ifng、Ctla4、Pdcd1、Lag3、Tbx21、Tcf7 和 Lef1。

5. 创建 Seurat 对象并计算质控指标

  1. 初始化 Seurat 对象
    1. 对每个数据集使用 min.cells = 3 和 min.features = 0 创建 Seurat 对象。在导入时不要施加任意的基因特征数量截断。
    2. 添加数据集、样本和时间点的元数据。通过条形码匹配合并可选的元数据。
  2. 运行示例 Seurat 对象初始化
    1. 执行 补充文件 2 中提到的 R 代码,以创建 Seurat 对象并分配元数据。
  3. 计算质量控制指标
    1. 使用小鼠线粒体基因前缀 ^mt- 计算线粒体转录本比例。
    2. 量化以下指标
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. 运行 补充文件 2 中提到的示例代码。
  5. 可视化过滤前的质量控制结果
    1. 生成 nFeature_RNA、nCount_RNA 和 percent.mt 的小提琴图。生成 nCount_RNA 与 nFeature_RNA 以及 nCount_RNA 与 percent.mt 的特征散点图。
    2. 使用标准化名称保存过滤前的图像,例如 QC_pre_filter_AllCells_vln.png 和 QC_pre_filter_AllCells_scatter.png。
      ​注意:预期过滤前分布较宽,可能存在低质量尾部及高计数异常值。

6. 推导自适应质控阈值并过滤低质量细胞

  1. 推导数据集特异性阈值
    1. 对 nFeature_RNA + 1 和 nCount_RNA + 1 进行对数转换。计算这两个转换后变量的中位数和中位绝对偏差(MAD)。
    2. 定义以下阈值:
      min_features = 10^(中位数 - 3 × MAD) - 1
      max_features = 10^(中位数 + 3 × MAD) - 1
      min_counts = 10^(中位数 - 3 × MAD) - 1
      max_counts = 10^(中位数 + 3 × MAD) – 1
    3. 将线粒体阈值定义为 percent.mt 的第95百分位数加上 3 × MAD,且限制在 5 % 至 20 % 之间
    4. 运行函数前,请确保正确指定了 dataset_id、sample_id 和 out_dir。
      ​qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. 应用过滤
    1. 保留满足所有自适应标准的细胞:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. 运行补充文件2中提到的示例代码。
  3. 保存过滤结果
    1. 保存 QC_thresholds_*.csv 和 cell_counts_summary_*.csv。
      暂停点:可保存中间结果,以便在需要时从此步骤恢复分析。
    2. 生成并保存过滤后的质控小提琴图和散点图。
      ​检查点预期过滤后分布更集中,低复杂度细胞被去除,极端离群值减少。

7. 数据标准化并执行主成分分析(PCA)

  1. 标准化与方差稳定化
    1. 在进行细胞周期评分前,对RNA检测数据进行标准化。若已启用,则运行细胞周期评分。使用SCTransform()进行方差稳定化。
    2. 仅在具有生物学依据并明确启用的情况下,对线粒体含量进行回归校正。
    3. 仅在研究设计需要时,对细胞周期评分进行回归校正。
  2. 按照补充文件2中所述运行示例标准化。
  3. 定义参数值
    1. 使用 n_variable_features = 3000。
    2. 使用 dims_max_for_pca = 50。
    3. 在稿件中明确说明这些参数值。
  4. 运行PCA并选择主成分
    1. 在标准化后的检测数据上运行PCA。通过检查解释方差和主成分载荷,确认PCA成功执行。
    2. 计算每个主成分所解释的方差。
  5. 使用以下三项标准选择主成分(PCs):
    1. 保留解释方差至少为1 %的主成分,
    2. 确保累计解释方差达到约80 %,
    3. 将最终选择的主成分数量限制在10至40之间。
    4. 保存PCA_variance_table_*.csv、PCA_selection_rationale_*.csv和PCA_Elbow_*.png文件。
  6. 运行示例PCA
    1. 参见补充文件2中所述示例。
      检查点:预期肘部图在选定的截断点之后,边际方差增益出现明显下降。

8. 构建邻域、选择分辨率并聚类细胞

  1. 构建图结构
    1. 使用选定的主成分(PCs)构建共享最近邻图。
    2. 如果双重细胞检测需要簇标签,则运行初始的低分辨率聚类。
  2. 可选:去除双重细胞
    1. 仅在已安装且兼容的情况下运行 DoubletFinder。
      ​注意:仅对细胞数量较高、预期存在多重细胞污染的数据集进行双重细胞检测。
    2. 在去除双重细胞后重新计算标准化和主成分分析(PCA)。
  3. 选择聚类分辨率
    1. 评估分辨率 0.2、0.4、0.6、0.8、1.0 和 1.2.8.3.2
    2. 计算每种测试分辨率下的平均轮廓宽度。在至少包含两个簇的聚类结果中,选择轮廓系数最高的分辨率。
    3. 保存 resolution_sweep_*.csv、resolution_selection_rationale_*.csv 和 resolution_sweep_*.png 文件。
  4. 通过执行 补充文件 2 中提到的代码来运行示例分辨率选择
  5. 运行 UMAP 和最终聚类。
    1. 使用选定的主成分(PCs)运行 UMAP。
    2. 重建最近邻图,并使用选定的分辨率对细胞进行聚类。
    3. 保存按簇标注并按样本或时间点分组的 UMAP 图。执行 补充文件 2 中提到的以下代码。
      警告:应观察到稳定的簇分离以及与主要免疫状态一致的可解释 UMAP 结构。

9. 对 GSE233713 进行基于 SCT 的整合

  1. 准备独立的对象
    1. 分别为 D27_3 和 D30 创建独立的 Seurat 对象。
    2. 对每个样本独立进行质量控制和过滤。使用 SCTransform() 对每个样本分别进行标准化。
  2. 论证整合的合理性
    1. 采用基于 SCT 的整合方法,以减少不同时间点之间的技术差异,同时保留共有的生物学结构。
    2. 不要假定整合必然有益,需明确验证其效果。
  3. 整合样本
    1. 使用 SelectIntegrationFeatures() 选择整合特征。使用 PrepSCTIntegration() 准备对象。
    2. 通过 FindIntegrationAnchors(normalization.method = "SCT") 寻找锚点。使用 IntegrateData(normalization.method = "SCT") 整合数据集。
  4. 运行 补充文件 2 中提到的示例整合
  5. 验证整合结果
    1. 生成按时间点分组的整合前和整合后 UMAP 图。若观察到不同时间点的细胞混合更均匀,则表明整合成功。
    2. 计算整合前后的邻近细胞混合情况。按时间点计算聚类组成,并生成堆叠式组成图。
    3. 保存以下输出:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      ​注意:整合后应观察到时间点分离减少、邻近细胞混合增加,且大多数聚类包含多个时间点的细胞贡献,但不应完全丧失具有生物学意义的结构。

10. 注释聚类并验证标记物结构

  1. 评分与疟疾相关的模块
    1. 对预定义的疟疾 CD4⁺ T 细胞面板运行 AddModuleScore()。
    2. 保存簇层级的模块均值及模块排序。
  2. 运行 补充文件 2 中提到的示例模块评分
  3. 分配预测的簇标签
    1. 将每个簇中排名最高的模块作为其预测标签进行分配。
    2. 保存:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. 使用经典标志物验证簇
    1. 使用经典标志物面板运行标志物验证的 DotPlot 和 FeaturePlot。
    2. 保存:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      ​注意:预期每种功能状态中多个经典基因具有一致的表达,而非孤立的单基因信号。

11. 鉴定标志物并进行差异表达分析。

  1. 寻找聚类标志物
    1. 仅使用阳性标志物运行 FindAllMarkers()。
    2. 保存 markers_all_clusters_*.csv。
  2. 执行补充文件中提到的代码以运行示例标志物鉴定
  3. 在可用时使用考虑重复样本的差异表达分析
    1. 检查是否具有有效的重复样本元数据。如果存在重复样本,按每个重复样本和条件汇总计数,并使用 DESeq2 运行伪批量差异表达分析(pseudobulk DE)。
    2. 保存 DE_pseudobulk_*。
  4. 在缺乏重复样本时使用探索性单细胞水平差异表达分析
    1. 若重复样本元数据缺失或不足,则运行单细胞差异表达分析作为探索性分析。
    2. 保存 DE_WARNING_* 以记录其探索性状态,并将探索性结果保存为 DE_exploratory_celllevel_*。
  5. 生成全局差异表达输出结果
    1. 为差异表达结果创建火山图并保存为 Volcano_*。
    2. 将显著的差异表达结果保存为筛选后的表格。
  6. 生成功能富集输出结果
    1. 运行 GO 生物过程(GO Biological Process)富集分析并保存为 GO_BP_*;运行 KEGG 富集分析并保存为 KEGG_*。
    2. 使用排序后的 log2 fold-change 值运行 GSEA 分析,并保存为 GSEA_GO_*;同时保存相应的条形图和点图。
  7. 生成聚类特异性差异表达输出结果
    1. 在每个聚类内比较不同时间点之间的差异表达。
    2. 保存 DE_cluster_* 和 DE_cluster_specific_combined_*。
  8. 生成聚焦免疫相关基因的差异表达输出结果
    1. 提取选定免疫相关基因(如 Ifng、Cxcl10、Ctla4、Il10、Foxp3、Bcl6、Cxcr5、Pdcd1、Lag3、Havcr2、Il21 和 Tbx21)的差异表达结果。
    2. 保存为 DE_immune_focus_*。
    3. 生成并保存以下输出结果:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      注意:应确保全局差异表达、功能富集结果、聚类特异性差异表达以及免疫相关特征之间具有一致性。

12. 保存最终输出结果并归档会话

  1. 保存 Seurat 对象
    1. 将每个数据集的最终 Seurat 对象以 .rds 格式保存。
  2. 保存会话信息
    1. 将会话信息 sessionInfo() 写入输出目录中的文本文件。
  3. 执行 补充文件 2 中提到的代码,以运行示例会话导出
  4. 验证输出完整性
    1. 确认预期的 fig/、tables/ 和 rds/ 目录中包含相应的文件。
    2. 将脚本、会话信息和输出结果一并归档。
      注意:在质量控制汇总、PCA 输出、分辨率选择输出、整合诊断、模块注释文件、差异表达输出以及富集分析文件全部齐备且内部一致之前,不得开始撰写报告。

访问受限。请登录或开始试用以查看此内容。

结果

测序质量与细胞水平质控(抗原特异性(PcAS反应性)TCR转基因CD4⁺ T细胞(GSE233703))

预过滤的质量控制分布(图 2A)显示转录本复杂性存在异质性,大多数细胞表现出中等水平的基因数和UMI数,而较小的细胞亚群呈现出高计数的离群特征,符合潜在的多重细胞(multiplets)情况。散点图(图 2B)显示nCount_RNA与nFeature_RNA之间存在强烈的正相关关系,而percent.mt与总计数之间的关联较弱,表明文库复杂性可接受,且在过滤前未见广泛的细胞应激迹象。

为避免任意过滤,采用基于中位绝对偏差(MAD)的方法对经对数转换的 nFeature_RNA 和 nCount_RNA 值设定自适应阈值,并结合稳健的线粒体含量截断值。对于 GSE233703,最终的过滤阈值为每细胞检测到 441–3,054 个基因、每细胞 653–12,137 个 UM...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出了一种基于 Seurat 的标准化且可重复的工作流程,用于分析疟疾再感染期间 CD4⁺ T 细胞的转录动态。该方案在一个统一的计算框架内整合了自适应质量控制、标准化、降维、聚类、数据集整合、标志物验证、模块评分以及差异表达分析。上述分析步骤共同实现了在抗原特异性和多克隆数据集中对具有生物学意义的 CD4⁺ T 细胞状态进行可重复的识别与解读13,14,15

代表性结果表明,与疟疾再感染相关的协调性 CD4⁺ T 细胞程序包括 Th1 效应、滤泡辅助性 T(Tfh)、调节性、耗竭相关、增殖性、干扰素应答以及类记忆状态。Ifng 和 Tbx21 的富集支持了与寄生虫控制相关的促炎性 Th1 应答,而 Bcl6、Cxcr5、Pdcd1 和 Il21 的表达则鉴定了与 B 细胞辅助和体液免疫相关的 Tfh 程序。包括 Ctla4、Lag3、Pdcd1 和 Il10 在内的调节性和耗竭相关标志物...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
材料/设备名称公司/来源目录编号备注/描述
10x Genomics–格式化的计数矩阵NCBI GEON/AMatrix Market 文件(matrix.mtx、features.tsv、barcodes.tsv)
clusterProfiler(R 软件包)BioconductorN/ARRID:SCR_016884;功能富集分析(GO、KEGG)
enrichplot(R 软件包)BioconductorN/ARRID:SCR_017030;富集分析结果的可视化
GEO 数据集 GSE233703NCBI 基因表达综合数据库GSE233703PcAS特异性TCR转基因CD4+ T细胞单细胞RNA测序数据集
GEO 数据集 GSE233713NCBI 基因表达综合数据库GSE233713多克隆CD4+ T细胞单细胞RNA测序数据集(D273 与 D30 比较)
GitHub(可选)GitHub 公司N/ARRID:SCR_002630;版本控制与可重复性(可选)
glmGamPoi(R 软件包)BioconductorN/ARRID:SCR_021001;加速的 SCTransform 模型拟合
Matrix(R 软件包)CRANN/ARRID:SCR_008389;用于单细胞RNA测序数据的稀疏矩阵处理
操作系统Microsoft / Apple / LinuxN/A支持 Windows 10+、macOS 或 Linux
org.Mm.eg.db(R 软件包)BioconductorN/ARRID:SCR_002643;小鼠基因注释数据库
patchwork(R 软件包)CRANN/ARRID:SCR_018787;多图组合成图
PDF 查看器任意N/A用于查看质控图、UMAP 图和热图
个人计算机或工作站任意N/A建议集成分析时至少配备 16–32 GB 内存
pheatmap(R 软件包)CRANN/ARRID:SCR_016418;基因表达热图可视化
R 统计软件(版本 ≥ 4.2)R 基金会统计计算组织N/ARRID:SCR_001905;核心计算环境
RStudio DesktopPosit 软件公司N/ARRID:SCR_000432;R 语言集成开发环境
Seurat(R 软件包,v4 或更高版本)Satija 实验室N/ARRID:SCR_016341;单细胞RNA测序分析
tidyverse(R 软件包套件)CRANN/ARRID:SCR_019186;数据处理与可视化

参考文献

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

免疫学与感染第233期第233期空值期号scRNA-seqPBMC转录组整合免疫模块评分

本文已发表

视频即将推出