本方案描述了为基于微滴的高通量单细胞RNA测序制备健康的成年哺乳动物单细胞所需的常规操作步骤及质量控制检测。同时提供了测序参数、序列比对以及下游单细胞生物信息学分析方法。
方法文章
* These authors contributed equally
本方案描述了为基于微滴的高通量单细胞RNA测序制备健康的成年哺乳动物单细胞所需的常规操作步骤及质量控制检测。同时提供了测序参数、序列比对以及下游单细胞生物信息学分析方法。
对组织或微环境中数千个单个细胞的基因表达进行分析,是识别细胞组成、区分功能状态以及揭示组织功能和动物行为背后分子通路的有力工具。然而,从成年哺乳动物组织中分离出完整且健康的单细胞,用于后续的单细胞分子分析,往往具有挑战性。本实验方案描述了从神经系统或皮肤获取高质量成年单细胞悬液所需的一般步骤和质量控制要点,从而实现后续无偏倚的单细胞RNA测序与分析。本文还提供了下游生物信息学分析的指导原则。
随着高通量单细胞技术1,2以及过去十年中用户友好型生物信息学工具的进步3,一种高分辨率基因表达分析的新领域应运而生——单细胞RNA测序(scRNA-Seq)。单细胞基因表达的研究最初旨在识别特定细胞群体内的异质性,例如干细胞或癌细胞中的异质性,或识别稀有细胞群体4,5,而这些目标是传统的大规模RNA测序技术无法实现的。生物信息学工具使得研究人员能够识别新的亚群(Seurat)2,可视化细胞在拟时间空间中的排列顺序(Monocle)6,定义细胞群体内部或群体之间的活跃信号网络(SCENIC)7 ,以及预测单细胞在人工三维空间中的组装模式(Seurat及其他工具)8。随着这些新颖且令人振奋的分析方法向科学界开放,scRNA-Seq 正迅速成为基因表达分析的新标准方法。
尽管单细胞RNA测序(scRNA-Seq)具有巨大的潜力,但对于初学者而言,获得高质量数据集并准确解读结果所需的技术技能可能颇具挑战性。本文提供了一项基础但全面的实验方案,涵盖从原代组织中分离单细胞,到数据可视化与发表级图表呈现的完整流程(图1)。首先,健康单细胞的分离常被视为难点,因为不同组织对酶消化及后续机械解离的敏感程度各不相同。本方案对这些分离步骤提供了详细指导,并明确了整个过程中关键的质量控制节点。其次,单细胞技术与高通量测序平台之间的兼容性及技术要求可能令人困惑。本方案提供了基于液滴的单细胞条形码技术平台的操作指南,并指导如何进行测序。最后,计算机编程是分析单细胞转录组数据集的重要前提。本方案提供了R语言编程的入门资源,并指导如何使用两种广泛使用的针对scRNA-Seq的R软件包。综上所述,本方案可帮助初学者开展scRNA-Seq分析,获得清晰且可解释的结果。该方案适用于小鼠的大多数组织,更重要的是,可经适当修改后用于其他生物体,包括人类组织。具体调整需根据组织类型和使用者需求进行。
在执行本实验方案时,需注意以下几点:1)建议严格遵循本方案第1步和第2步中的所有质量控制指南,以确保获得样本中所有细胞的可行单细胞悬液,并准确计数总细胞数量(总结见图2)。一旦达到此目标,且在遵循所有优化条件的前提下,后续可省略质量控制步骤(以节省时间,同时保持RNA质量和减少细胞损失)。在进行任何下游操作之前,强烈建议确认已成功从目标组织中分离出高活力的单细胞。2)由于某些细胞类型对压力比其他细胞更敏感,过度的解离操作可能无意中导致细胞群体出现偏差,从而干扰下游分析。因此,轻柔解离、避免不必要的细胞剪切和消化,对于获得高细胞得率以及准确反映组织组成至关重要。在吹打、流式细胞分选(FACS)和重悬步骤中均可能产生剪切力。3)与所有RNA相关操作一样,在样本制备过程中应尽可能减少外源RNase的引入,以维持高质量的RNA。建议使用核糖核酸酶抑制剂溶液清洗工具及非无RNase的设备,但应避免使用DEPC处理的产品。4)应尽可能快速完成制备操作,以维持高质量RNA并减少细胞死亡。根据组织解剖所需时间和动物数量,可考虑同时开始多个解剖和制备流程。5)在可能的情况下,应在冰上进行细胞处理,以维持高质量RNA、减少细胞死亡,并减缓细胞信号传导和转录活性。尽管冰上操作适用于大多数细胞类型,但某些细胞类型(例如,中性粒细胞)在室温下处理效果更佳。6)在细胞制备过程中应避免使用钙、镁、EDTA以及DEPC处理的产品。
本文所述所有实验方案均符合卡尔加里大学动物护理委员会的规定,并已获得其批准。
1. 组织解离(第1天)
2. 分离有活力且健康的细胞(第1天)
3. GEM(乳液中的凝胶珠)生成与条形码标记(第1天)
注意:本方案的步骤 3-6 旨在与 10X Genomics 公司生产的最常用的基于微滴的单细胞平台联合使用。步骤 3 和 4 的详细指南见厂商提供的方案 (参见 Chromium 单细胞 3' 方案)11,12,必须结合本方案一并遵循。为获得最佳结果,步骤 3 必须在本方案第 1 天完成细胞解离(步骤 1)和细胞分离(步骤 2)后立即进行。
4. 纯化、扩增、文库构建及文库定量(第2天及以后)
注意:步骤 4 的详细指南已在制造商的方案 11,12, 中列出,必须结合本方案一并遵循。
5. 文库测序(第3天及之后)
注意:本实验方案中使用的单细胞转录组条形码平台可生成兼容Illumina的双端文库,其序列起始和终止端分别为P5和P7序列。尽管分辨细胞类型身份所需的最低测序深度可低至10,000–50,000条读长/细胞15,16,但为在成本与覆盖度之间取得最佳平衡,建议对成年个体的体内细胞采用约100,000条读长/细胞的测序深度(需注意某些细胞类型或最低程度活化的细胞状态在30,000–50,000条读长/细胞时即可达到饱和)。
6. 处理测序读段文件
注意:使用本方案对单细胞 3’ 文库进行测序将生成二进制碱基识别(BCL)格式的原始数据。Cell Ranger 软件包用于将 BCL 文件转换为基于文本的 FASTQ 文件,并进行基因组和转录组比对、基因计数、样本解复用以及样本整合。本节介绍关键步骤,以帮助用户从测序机构下载原始 BCL 数据,并生成可用于下游生物信息学分析的过滤后基因-条形码矩阵。
7. scRNA-Seq 数据集的高级分析
注意:完整的单细胞 RNA 测序(scRNA-Seq)工具数据库可在 scRNA-tools3,27 中找到。以下是使用 Seurat2 进行无监督细胞聚类和使用 Monocle6 进行拟时序分析的框架。尽管大部分工作可在本地计算机上完成,但以下步骤假设计算将在机构服务器上完成。
8. NCBI 的 GEO 和 SRA 提交
注意:由于原始测序数据的便捷获取能够确保研究的可重复性和重新分析,因此建议或要求在提交稿件前将数据存入在线公开数据库。美国国家生物技术信息中心(NCBI)的基因表达综合数据库(Gene Expression Omnibus,GEO)和序列读取档案库(Sequence Read Archive,SRA)是可用于存储高通量测序数据的公开数据库35,36。
用于分析单细胞RNA测序(scRNA-Seq)数据集的开源软件包种类已显著增加40,其中大多数软件包采用基于R的语言3。本文展示了使用其中两个软件包所得的代表性结果:基于基因表达对单细胞进行无监督分组,以及将单细胞沿轨迹排序,以解析细胞异质性并解构生物学过程。
图4 展示了使用 Seurat 进行预处理质量检查及下游生物信息学分析的方法。首先,过滤并从分析中剔除异常细胞是质量检查的关键步骤。本研究通过小提琴图(图4a)和散点图(图4b)可视化线粒体基因百分比、基因数量(nGene)和UMI数量(nUMI),以识别细胞双联体及离群值。对于基因数、UMI数或线粒体基因百分比明显偏离的细胞,均使用 Seurat 的 FilterCells 函数予以剔除。由于 Seurat 利用主成分(PC)分析得分对细胞进行聚类,因此确定具有统计学意义的主成分数量是关键步骤。本研究采用肘部图(图4c)进行主成分选择,排除“主成分标准差”坐标轴中 plateau 区域之后的主成分。同时调整了聚类分辨率,以展示聚类数量的变化,范围从 0.4(低分辨率,导致较少的细胞簇,图4d)到 4(高分辨率,导致更多的细胞簇,图4e)。在低分辨率下,每个簇通常代表一种明确的细胞类型;而在高分辨率下,可能还反映了细胞群体的亚型或过渡状态。本研究采用低分辨率聚类设置,进一步利用 Seurat 的 DoHeatmap 函数分析表达热图(图4f),以鉴定特定簇中表达水平最高的基因。在此过程中,通过评估某一簇相对于其余所有簇合并后的差异表达,识别出各簇均由特定基因独特表征。此外,还可利用 Seurat 的 FeaturePlot 函数在 tSNE 图上可视化单个候选基因的表达(图4g),从而判断是否存在代表巨噬细胞的簇。通过 FeaturePlot 分析发现,簇 2 和簇 4 均表达 Cd68——一种泛巨噬细胞标志物。
使用 Monocle 软件包验证 Seurat 鉴定出的细胞簇,并构建细胞轨迹(即拟时序排序),以重现生物学过程(图 5)。拟时序排序适用于预期单细胞表达谱遵循生物学时间进程的样本。通过将细胞沿拟时序连续体进行排序,可解析中间状态、两种不同细胞命运的分支点,并识别每种命运获得过程中相关的基因特征。首先,类似于 Seurat 的过滤方法,去除低质量细胞,使所有细胞中 mRNA 的分布呈对数正态,并位于 图 5a 所确定的上下界之间。然后,利用 Monocle 的 newCellTypeHierarchy 函数,根据已知的谱系标志基因对单细胞进行分类和计数(图 5b、5c)。例如,表达 PDGF 受体 alpha 或成纤维细胞特异性蛋白 1 的细胞被归入细胞类型 #1,以此作为定义成纤维细胞的标准。接下来,对该群体(细胞类型 #1)进行评估,以解析成纤维细胞的发育轨迹。为此,使用了 Monocle 的差异基因检验(GeneTest)功能,该方法比较群体内代表极端状态的细胞,识别出用于对群体中其余细胞进行排序的差异表达基因(图 5d)。通过在所有细胞上应用流形学习方法(一种非线性降维技术),为每个细胞分配沿拟时序路径的坐标。随后,该轨迹通过细胞状态(图 5e)和拟时序(图 5f)进行可视化。

图1:流程图。从整体动物样本制备到单细胞RNA-Seq数据集分析,最终将数据提交至公开可用数据库的完整步骤。乳液中的凝胶微珠(GEMs)指带有条形码寡核苷酸的微珠,可包裹数千个单细胞。请点击此处查看此图的放大版本。

图 2:从神经组织制备具有活力的单细胞悬液。(a)质量控制检测的示意图。(b)细胞与碎片,其中部分细胞仍嵌入碎片中(红箭头所示)。(c)从碎片中释放出的细胞(红箭头所示)。(d)通过FACS进行细胞分离。P0:碎片组分;P1:类细胞组分;P3:排除双联体;P4:活率染料(Sytox Orange)阴性组分。(e)无活率染料的对照。(f)P0组分的图像,代表分离出的碎片。(g)P4组分的图像,代表分离出的活细胞(红箭头所示)。(b)(c)(f)和(g)在成像前20分钟添加了核染料。比例尺:80 µm。请点击此处查看该图的放大版本。

图3:浅层测序可预测经10X处理样本中回收细胞的数量。 (a) MiSeq 生成的 csv 文件示例(样本 1.6),列出由高置信比对读段确定的细胞条形码及其对应的 UMI 计数。(b) 样本 1.6 的条形码排序图显示,UMI 计数随细胞条形码排序呈一次显著下降。虚线与实线分别表示通过视觉检查确定的细胞与背景的截断阈值。(c) 使用 HiSeq 后的 Cell Ranger 分析流程所观测到的细胞条形码表明,浅层测序可准确估算样本 1.6 的细胞数量。(d) 基于浅层测序推算的细胞数所设计的流动池配置示例。对于样本 1.6,由于浅层测序预测出 3480 个细胞,因此分配了 1.17 个通道以确保 >HiSeq 中每个细胞测序覆盖深度为 100,000 个读段。注:所有通道加总必须为 100%。 请点击此处以查看此图的放大版本。

图4:使用Seurat R软件包对单细胞RNA测序数据集进行质量控制与生物信息学分析。(a) 质量控制指标图,包括基因数量、唯一分子标识符(UMIs)数量以及比对到线粒体基因组的转录本百分比。(b) 检测线粒体转录本和UMI水平异常细胞的示例基因图。(c) 示例“肘部图”,用于经验性确定具有统计学意义的主成分(PCs)。虚线和点划线表示图中明显“肘部”出现的截断值,该肘部之前的PC维度将被纳入后续分析。(d, e) 在低维空间中使用tSNE图以两种不同分辨率可视化基于图的细胞聚类。(f) 利用Seurat的DoHeatmap功能,在表达热图上可视化各聚类的前导标记基因(黄色)。(g) 使用Seurat的FeaturePlot功能可视化标记基因表达,例如代表巨噬细胞的Cd68基因(紫色),提示该数据集中的第2和第4聚类(见d图)为巨噬细胞。请点击此处查看该图的高清版本。

图5:使用 Monocle 工具包沿拟时轨迹对细胞进行分类和排序。(a)检查样本中所有细胞的mRNA分布情况(根据UMI计数推断)。仅使用mRNA数量在0 - ~20,000范围内的细胞进行下游分析。(b, c)基于已知谱系细胞标志物对细胞类型进行指派和计数。例如,表达PDGF受体α或成纤维细胞特异性蛋白1的细胞被指派为细胞类型#1,代表泛成纤维细胞,使用Monocle的newCellTypeHierarchy函数实现。不同细胞类型的数量可通过饼图(b)和表格(c)进行可视化。(d)以细胞类型#1(成纤维细胞)为例,用于细胞排序的基因可通过散点图进行可视化,展示基因离散度与平均表达水平的关系。红色曲线表示根据Monocle的estimateDispersions函数利用均值-方差模型计算出的用于排序基因的阈值。满足该阈值的基因被用于下游的拟时序排序。(e, f)在降维后的二维空间中可视化细胞轨迹,按细胞的“状态”着色(e),以及按Monocle分配的“拟时”着色(f)。请点击此处查看该图的放大版本。
本方案展示了如何通过适当的单细胞制备,揭示数千个单细胞的转录异质性,并区分组织内不同的功能状态或独特的细胞身份。该方案无需荧光报告蛋白或转基因工具,可适用于包括人类在内的多种目标组织的单细胞分离;但需注意 每种组织均具有独特性,因此本方案需要一定程度的调整或修改。
细胞内多样且高度动态的转录程序凸显了单细胞基因组学的重要性。除了分离高质量的RNA外,获得高质量数据集所需的关键样本制备步骤还包括确保细胞从组织中完全释放,并且细胞保持健康和完整。对于易于释放的细胞(例如循环细胞或淋巴组织等细胞结合较松散的组织中的细胞),这一过程相对简单。但对于其他成年组织而言,由于存在跨越较大距离的复杂细胞结构、周围的细胞外基质以及常为刚性的细胞骨架蛋白来维持细胞形态,实现这一点则具有挑战性。即使采用适当的解离技术以实现细胞的完全释放,繁琐且通常耗时较长的处理过程仍有可能影响mRNA质量和细胞完整性。此外,酶辅助解离过程中使用的高温也会影响转录特征29,30。本实验方案旨在通过使用髓鞘化的成年神经组织以及富含细胞外基质的成年皮肤组织作为示例,介绍质量控制检测方法,以展示如何通过 优化来克服这些障碍。
设计任何单细胞RNA测序(scRNA-Seq)实验时,一个主要考虑因素是测序深度的选择。测序可以高度多重化,读长深度可从使用Drop-Seq方法时的极低水平2,到使用全长RNA-Seq方法(如Smart-Seq)时高达每细胞500万条读长14不等。大多数scRNA-Seq实验在每细胞仅1万条读长的测序深度下即可检测到中等到高表达水平的转录本,这通常足以用于细胞类型分类41,42。当需要在复杂的组织中检测稀有细胞群体,且需分析数千个细胞才能可靠识别这些稀有群体时,采用较浅的测序深度有助于节省测序成本。然而,当需要获取与细微转录特征相关的基因表达和生物学过程的详细信息时,较浅的测序深度则不足够。目前估计,每细胞50万条读长可检测到细胞中绝大多数基因,但这一数值可能因实验方案和组织类型而异43,44。虽然全长转录本测序避免了拼接组装的需要,因而能够检测新的或罕见的剪接变异体,但测序成本通常限制了此类方法在分析由数千个细胞组成的复杂组织系统中的大规模应用。相比之下,本方案中描述的3'端标记的单细胞文库通常复杂度较低,所需的测序深度也更浅。需要注意的是,使用本方案生成的文库可在以下五种支持的测序仪之一上进行测序:1)NovaSeq,2)HiSeq 3000/4000,3)HiSeq 2500快速运行和高输出模式,4)NextSeq 500/550,以及5)MiSeq。
一种单细胞RNA测序的替代方法是通过对单个细胞核进行RNA分析,该方法减少了对精细组织 和细胞操作的需求,同时仍保留了单细胞RNA测序的部分优势45。该方法 可实现更快的样本处理,减少RNA降解,并可采用更剧烈的手段确保细胞核的充分释放,因此更有可能可靠地捕获代表特定组织中所有细胞的转录谱。当然,这种方法仅能提供特定细胞内部分转录活性的信息,因此是否适用取决于具体的实验目标。
除了对特定组织内细胞身份进行全面表征外,最具价值的分析之一是 scRNA-Seq 数据集的一个重要应用是评估“已定义”细胞群体中的中间转录状态。这些中间状态可为已鉴定细胞群体内细胞间的谱系关系提供重要见解,这曾是 传统批量RNA测序方法无法实现这一点。目前已有多种单细胞RNA测序(scRNA-Seq)生物信息学工具被开发出来以阐明此类问题。这些工具可用于分析例如癌细胞向致癌/转移状态转变、干细胞分化为多种终末命运或免疫细胞在活跃与静息状态之间转换等过程。细胞间细微的转录组差异也可能提示谱系偏向性,而近期开发的生物信息学工具(如FateID)能够推断此类偏向性。47由于过渡状态细胞之间的差异较难确定,且转录差异可能较为细微,因此可能需要进行更深度的测序。46幸运的是,如果希望进一步探究数据集,可以通过在另一个流动池上重新运行文库来增加浅层测序文库的覆盖度。
综上所述,本方案提供了一种易于调整的工作流程,使研究人员能够在一次实验中对数百至数千个单细胞进行转录组分析。单细胞RNA测序(scRNA-Seq)数据集的最终质量取决于优化的细胞分离、流式细胞术、cDNA文库构建以及对原始基因-条形码矩阵的解析。为此,本方案全面概述了所有关键步骤,且这些步骤可轻松修改,以适用于不同类型组织的研究。
我们感谢卡尔加里大学UCDNA服务设施的支持人员以及动物护理设施的工作人员。感谢Matt Workentine提供的生物信息学支持,以及Jens Durruthy提供的技术支持。本研究由加拿大卫生研究院(CIHR)资助项目(R.M. 和 J.B.)、J.B. 获得的加拿大卫生研究院新研究者奖,以及阿尔伯塔儿童健康研究所博士后奖学金(J.S.)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 产品 | |||
| RNase out | Biosciences | 786-70 | |
| 戊巴比妥钠 | Euthanyl | 50mg/kg | |
| HBSS | Gibco | 14175-095 | |
| Dispase 5U/ml | StemCell Technologies | 7913 | 5 mg/ml |
| 胶原酶-4 125 CDU/mg | Sigma-Aldrich | C5138 | 2 mg/ml |
| DNase | Sigma-Aldrich | DN25 | 10mg/ml |
| BSA | Sigma-Aldrich | A7906 | |
| 15 ml 窄底管 VWR® 高性能离心管 | VWR | 89039-666 | |
| Sytox Orange 活性染料 | Molecular Probes | 11320972 | 1.3 nM/µl |
| Nuc Blue Live ReadyProbes | Invitrogen | R37605 | |
| Agilent 2100 Bioanalyzer 高灵敏度 DNA 试剂 | Agilent | 5067-4626 | |
| Kapa DNA 定量试剂盒 | Kapa Biosystems | KK4844 | |
| Chromium 单细胞 3' 试剂 | 10x Genomics | ||
| 设备 | |||
| BD FACSAria III | BD Biosciences | ||
| Agilent 2100 Bioanalyzer 平台 | Agilent | ||
| Illumina® HiSeq 4000 | Illumina | ||
| Illumina® MiSeq SR50 | Illumina | ||
| 10X 控制器 + 配件 | 10x Genomics | ||
| 软件 | |||
| Cell Ranger | 10x GENOMICS | support.10xgenomics.com/single-cell-gene-expression/software/overview/welcome | |
| Loupe Cell Browser | 10x GENOMICS | support.10xgenomics.com/single-cell-gene-expression/software/downloads/latest | |
| R | https://anaconda.org/r/r |