方法文章

基于液滴条形码的成年哺乳动物组织单细胞转录组学

19.8K 次观看

DOI:

10.3791/58709

2019年1月10日

* These authors contributed equally

本文内容

摘要

本方案描述了为基于微滴的高通量单细胞RNA测序制备健康的成年哺乳动物单细胞所需的常规操作步骤及质量控制检测。同时提供了测序参数、序列比对以及下游单细胞生物信息学分析方法。

摘要

对组织或微环境中数千个单个细胞的基因表达进行分析,是识别细胞组成、区分功能状态以及揭示组织功能和动物行为背后分子通路的有力工具。然而,从成年哺乳动物组织中分离出完整且健康的单细胞,用于后续的单细胞分子分析,往往具有挑战性。本实验方案描述了从神经系统或皮肤获取高质量成年单细胞悬液所需的一般步骤和质量控制要点,从而实现后续无偏倚的单细胞RNA测序与分析。本文还提供了下游生物信息学分析的指导原则。

引言

随着高通量单细胞技术1,2以及过去十年中用户友好型生物信息学工具的进步3,一种高分辨率基因表达分析的新领域应运而生——单细胞RNA测序(scRNA-Seq)。单细胞基因表达的研究最初旨在识别特定细胞群体内的异质性,例如干细胞或癌细胞中的异质性,或识别稀有细胞群体4,5,而这些目标是传统的大规模RNA测序技术无法实现的。生物信息学工具使得研究人员能够识别新的亚群(Seurat)2,可视化细胞在拟时间空间中的排列顺序(Monocle)6,定义细胞群体内部或群体之间的活跃信号网络(SCENIC)7 ,以及预测单细胞在人工三维空间中的组装模式(Seurat及其他工具)8。随着这些新颖且令人振奋的分析方法向科学界开放,scRNA-Seq 正迅速成为基因表达分析的新标准方法。

尽管单细胞RNA测序(scRNA-Seq)具有巨大的潜力,但对于初学者而言,获得高质量数据集并准确解读结果所需的技术技能可能颇具挑战性。本文提供了一项基础但全面的实验方案,涵盖从原代组织中分离单细胞,到数据可视化与发表级图表呈现的完整流程(图1)。首先,健康单细胞的分离常被视为难点,因为不同组织对酶消化及后续机械解离的敏感程度各不相同。本方案对这些分离步骤提供了详细指导,并明确了整个过程中关键的质量控制节点。其次,单细胞技术与高通量测序平台之间的兼容性及技术要求可能令人困惑。本方案提供了基于液滴的单细胞条形码技术平台的操作指南,并指导如何进行测序。最后,计算机编程是分析单细胞转录组数据集的重要前提。本方案提供了R语言编程的入门资源,并指导如何使用两种广泛使用的针对scRNA-Seq的R软件包。综上所述,本方案可帮助初学者开展scRNA-Seq分析,获得清晰且可解释的结果。该方案适用于小鼠的大多数组织,更重要的是,可经适当修改后用于其他生物体,包括人类组织。具体调整需根据组织类型和使用者需求进行。

在执行本实验方案时,需注意以下几点:1)建议严格遵循本方案第1步和第2步中的所有质量控制指南,以确保获得样本中所有细胞的可行单细胞悬液,并准确计数总细胞数量(总结见图2)。一旦达到此目标,且在遵循所有优化条件的前提下,后续可省略质量控制步骤(以节省时间,同时保持RNA质量和减少细胞损失)。在进行任何下游操作之前,强烈建议确认已成功从目标组织中分离出高活力的单细胞。2)由于某些细胞类型对压力比其他细胞更敏感,过度的解离操作可能无意中导致细胞群体出现偏差,从而干扰下游分析。因此,轻柔解离、避免不必要的细胞剪切和消化,对于获得高细胞得率以及准确反映组织组成至关重要。在吹打、流式细胞分选(FACS)和重悬步骤中均可能产生剪切力。3)与所有RNA相关操作一样,在样本制备过程中应尽可能减少外源RNase的引入,以维持高质量的RNA。建议使用核糖核酸酶抑制剂溶液清洗工具及非无RNase的设备,但应避免使用DEPC处理的产品。4)应尽可能快速完成制备操作,以维持高质量RNA并减少细胞死亡。根据组织解剖所需时间和动物数量,可考虑同时开始多个解剖和制备流程。5)在可能的情况下,应在冰上进行细胞处理,以维持高质量RNA、减少细胞死亡,并减缓细胞信号传导和转录活性。尽管冰上操作适用于大多数细胞类型,但某些细胞类型(例如,中性粒细胞)在室温下处理效果更佳。6)在细胞制备过程中应避免使用钙、镁、EDTA以及DEPC处理的产品。

方案

本文所述所有实验方案均符合卡尔加里大学动物护理委员会的规定,并已获得其批准。

1. 组织解离(第1天)

  1. 根据动物伦理协议,通过腹腔注射过量戊巴比妥钠(50 mg/kg)或其他适当方法处死小鼠。随后去除小鼠背部和腿部不需要的毛发,并用乙醇对解剖区域进行消毒。
  2. 解剖目标组织或微环境。本方案以皮肤和神经组织为例,展示成年组织解离后基于液滴条形码技术的单细胞转录组学的通用性。
    1. 对于坐骨神经,请参考 Stratton et al.9 中的详细方案。简而言之,从鼠后肢背部/腿部区域切开皮肤,沿大腿长度方向用无菌手术刀片做切口,使用精细镊子和剪刀暴露并取出坐骨神经。
    2. 对于背部皮肤,请参考 Biernaskie et al.10 中的详细方案。简而言之,使用精细镊子和剪刀从肩部到肩部、横跨臀部并沿背部向下做切口,解剖背侧皮肤,并用无菌手术刀片将其切成薄片(厚度约 0.5 cm)。
  3. 用冰浴的 HBSS 洗涤组织两次,并在解剖显微镜下去除不需要的结缔组织、脂肪沉积物或碎片。
    1. 仅针对皮肤真皮层,将切片漂浮于含 dispase(5 mg/mL,5 U/mL)的 HBSS 中,在 37 °C 下孵育 30–40 分钟。手术分离表皮与真皮,弃去表皮;若需要,可进一步使用胰蛋白酶解离表皮。
  4. 使用 无菌手术刀片将样品切碎成 1–2 mm 大小的组织块,并放入新解冻的冷胶原酶 IV 溶液(2 mg/mL,125 CDU/mg,溶于 F12 培养基)中。
    1. 对于神经组织,每 2 根坐骨神经使用约 500 µL 酶液;对于皮肤组织,每只小鼠背部皮肤使用约 8 mL 酶液。
      注意:组织应完全浸没在胶原酶 IV 溶液中。必须正确操作、储存和配制消化酶。若酶液在室温下放置过久,将导致单细胞分离过程中需要过度机械吹打,从而降低细胞活力。胶原酶 IV 也可配制于细胞培养基中以获得最佳细胞活力,但这可能影响酶活性或转录特征,因此需由使用者自行优化。
  5. 将样品在 37 °C 水浴中孵育 30 分钟,每 10 分钟轻轻振荡一次。也可使用置于 37 °C 的摇床作为替代方案。
  6. 在加入酶后 30 分钟,使用 P1000 移液器吹打 20–30 次。
  7. 每隔 30 分钟重复吹打一次,直至溶液变浑浊且组织块基本解离。
    注意:确保细胞完全释放(图 2b、2c)。为确认细胞是否完全释放,可将细胞与 Nuc Blue(每 1 mL 加 2 滴)共孵育,20 分钟后在显微镜下观察,确保所有细胞核均与单个细胞相关联而非碎片。在特定实验中,必须检查每种组织类型或条件下的细胞释放程度。在纤维化组织(即 慢性损伤)或未受伤的成年组织中,细胞释放程度与急性损伤或胚胎组织相比差异显著。这一点尤为重要,因为某些细胞类型较难从组织中释放,从而可能在下游分析中被优先排除。
    1. 对于神经组织,总解离时间为 0.5–1.5 小时;对于皮肤组织,总解离时间为 2 小时(在最后 1 小时孵育期间,向皮肤样品中加入 DNase(1 mg/mL))。
  8. 使用 40 µm 滤膜过滤两次,并用冰浴的 1% BSA/HBSS 冲洗滤膜。
  9. 以 260 × g 离心 8 分钟,随后弃去上清液。
    1. 使用宽口吸头将细胞沉淀重悬于含 1% BSA 的 HBSS 中,并置于冰上。重悬体积依据组织体积确定(皮肤湿重 800 mg 对应 800 µL 体积;神经湿重 10 mg 对应 100 µL 体积)。
    2. 可选:初始使用较低体积重悬,再根据流式细胞分选仪上的流速(每秒事件数)进行调整。最高效的分选密度(在最短时间内收集最多细胞)为 3,000–7,000 事件/秒。
  10. 若使用活率染料,先取出一份子样作为未染色对照。然后使用宽口吸头加入 1:15,000 稀释的活率染料(原液:20,000 nM/µL),使终浓度为 1.3 nM/µL,以减少剪切损伤。
    注意:在特定实验中,必须检查每种组织类型或条件下的细胞死亡程度。样品中某些细胞类型比其他类型更容易死亡,从而可能在下游分析中被优先排除。
    1. 将样品与活率染料在冰上避光孵育 5–10 分钟,然后向样品中加入 4 mL 冰浴的 1% BSA/HBSS。以 260 × g 离心 8 分钟以去除多余染料。未加活率染料的子样对照组也应进行相同处理。

2. 分离有活力且健康的细胞(第1天)

  1. 确保流式细胞分选(FACS)设施遵循适当的荧光激活细胞分选(FACS)参数。
    1. 提前准备好流式细胞分选仪,确保在步骤1的最后一次离心完成时仪器已就绪,并使用冰块保持收集室处于低温状态。
    2. 使用以下参数:流速: 1.0(大约相当于10 µ升/分钟);滤光片:1.5 ND;喷嘴尺寸:100 µm;前向散射: 80 - 180 V(根据需要调整,以区分事件的大小);侧向散射:150 - 220 V(根据需要调整,以区分事件的颗粒度/形态);激光:100 - 400 V(根据需要调整,以区分活率染料阳性与阴性事件) & 与无活力染料对照进行比较);门控:根据需要进行调整,以确保收集所有细胞。参见 图2d-2g.
      注意:FACS 参数高度依赖于细胞类型和所使用的分选仪,因此需要由用户进行优化。
  2. 准备15 mL尖底管,每管加入8 mL预冷的1% BSA/HBSS用于样品收集。静置状态下的管内液体及表面张力可能影响收集效率。收集前将管倒置,确保液体表面与管内壁之间的界面保持湿润。
    注意:若处理的细胞数量极少,应根据需要调整为使用小型收集容器。
  3. 所有细胞收集完毕后,以 260 x g 离心 8 分钟。
    注意:离心前,加入1% BSA/HBSS以冲洗/将细胞从管壁表面推下,并在FACS后立即颠倒混匀管内液体。
  4. 将细胞沉淀重悬于 1% BSA/HBSS 中,置于冰上保存。每份样本的最大体积为 33.8,此体积与步骤 3 的处理兼容。 µL,因此请确保最终的细胞稀释/重悬体积适当,以在33.8中获得理想的细胞数量 µL. 此步骤(以及在1% BSA/HBSS中所有先前稀释步骤)的其他稀释介质可选DMEM,或含血清量不超过40%的溶液,但应避免含有钙、镁或EDTA的试剂。
    1. 将细胞置于冰上的时间应尽可能短。理想情况下,合作者应在步骤2的最后阶段开始准备步骤3所需的所有设备和试剂。 
  5. 细胞制备关键检查步骤
    1. 验证通过流式细胞术(FACS)获得的细胞数量估计值。由于组织类型和解离时间的不同,碎片与细胞在大小和形态上可能非常相似。因此,除非使用荧光报告分子,FACS 无法完全排除所有碎片。建议在 FACS 收集后进行最终的细胞计数,以明确在特定样本制备中,FACS 所记录的事件中有多少百分比实际为细胞图2g). 使用血细胞计数板或自动细胞计数仪进行细胞计数(重复两次),并根据流式细胞仪收集的总事件数计算活细胞所占百分比。
    2. 验证细胞制备。验证无大颗粒(>100 µm) 是否存在,因其可能堵塞后续步骤中的设备。若未充分去除碎片,可能会导致单细胞微流控芯片堵塞。将剩余细胞用 Nuc Blue 染色(同上),以确保无大块碎片存在。这也有助于确认细胞为单细胞状态(即,不发生粘连),以确保后续的单细胞基因分析反映的是单个细胞而非多个细胞的信号。
    3. 确定测序细胞数量:每份样本可上样来自成年组织的细胞数量范围较广,系统最多可同时运行8个样本。作者曾每样本上样500至50,000个细胞,并获得高质量的单细胞RNA测序数据集。关于最适上样细胞数量的进一步讨论详见讨论部分。最终测序获得的细胞数量在很大程度上取决于所分离单细胞的质量。上样10,000个来自成年组织的细胞,通常可获得1,000至4,000个测序细胞(回收率为10%–40%)。若希望测序较高数量的细胞(约10,000个,此系统推荐的最大数量),则需上样25,000至100,000个细胞。

3. GEM(乳液中的凝胶珠)生成与条形码标记(第1天)

注意:本方案的步骤 3-6 旨在与 10X Genomics 公司生产的最常用的基于微滴的单细胞平台联合使用。步骤 3 和 4 的详细指南见厂商提供的方案 (参见 Chromium 单细胞 3' 方案)11,12,必须结合本方案一并遵循。为获得最佳结果,步骤 3 必须在本方案第 1 天完成细胞解离(步骤 1)和细胞分离(步骤 2)后立即进行。

  1. 根据制造商方案准备芯片 11,12。该基于微液滴的单细胞平台采用技术对约 750,000 个条形码进行采样,以分别索引每个细胞的转录组。此过程通过将细胞分配至乳液中的凝胶珠(GEMs)中实现,在生成的 cDNA 中共享相同的条形码。在 GEM 生成过程中,细胞被递送至系统,使得绝大多数(90 - 99%)生成的 GEM 不含细胞,而其余 GEM 大部分仅包含单个细胞。
    1. 将芯片放入芯片架中。
    2. 在冰上制备细胞主混合液。
    3. 向未使用的孔中加入 50% 甘油,并向第 1 孔加入 90 µL 细胞主混合液,向第 2 孔加入 90 µL 凝胶珠,向第 3 孔加入 270 µL 分隔油。
    4. 用垫圈覆盖芯片。
  2. 将芯片装入单细胞控制器并运行。
    1. 推出托盘,将芯片放入托盘中,收回托盘,然后按下 播放。单个细胞 3’ 凝胶珠在 GEM 中包含引物,其序列包括部分 Illumina R1 序列(读段 1 测序引物)、16 个核苷酸(nt)的 10x 条形码、10 个核苷酸的唯一分子标识符(UMI)以及 poly-dT 引物序列。在运行过程中,控制器中的凝胶珠被释放,并与细胞裂解液和主混合液混合。
    2. 收集 100 µL 样品 并置于 PCR 管中。
    3. 将 PCR 管放入预设好的 PCR 仪中,并按照试剂盒说明进行 PCR 扩增。孵育后,GEM 中将包含来自 poly-腺苷酸化 mRNA 的全长、带条形码的 cDNA。
  3. 运行结束后,将样品置于 -20 °C 保存过夜,最多可保存 1 周,然后再进行下一步操作。

4. 纯化、扩增、文库构建及文库定量(第2天及以后)

注意:步骤 4 的详细指南已在制造商的方案 11,12, 中列出,必须结合本方案一并遵循。

  1. 使用硅烷磁珠去除GEM反应混合物中残留的生化试剂/引物。
  2. 扩增全长的带条形码cDNA,以获得足够质量用于文库构建。
  3. 评估DNA产量。在建库前,需评估样品的DNA产量,以确定后续PCR步骤(建库过程中的样本指数PCR)所需的循环数。该数值可能因样本的RNA含量而异,而RNA含量又取决于细胞的激活状态(例如对照组与损伤组 等等),细胞类型和细胞得率,推荐的循环次数可能会有所调整。
    1. 对于测序约 3,000 个组织来源的细胞(与激活状态无关),作者发现 14 个循环(样本:约 10 - 100 ng DNA)为标准操作。
    2. 使用 Bioanalyzer 进行 DNA 分析。请参考用户指南13.
  4. 对样本进行片段化并选择DNA片段大小。在文库构建之前,采用酶法片段化和片段大小选择方案,以获得合适的cDNA扩增子大小。
  5. 准备文库构建样品。在GEM孵育过程中加入R1(读段1引物序列);P5、P7(样本索引)和R2(读段2引物序列)则在文库构建过程中加入。
  6. 评估DNA产量。大多数测序机构要求提交最终文库时提供DNA产量和质量信息。因此,在完成整个实验流程后、运送至测序机构前,应进行生物分析仪检测。
  7. 将样品在 -80 ℃ 保存 °C下最多可保存2个月。
  8. 测序前,使用DNA定量试剂盒对样品进行定量。此步骤可在测序机构完成。

5. 文库测序(第3天及之后)

注意:本实验方案中使用的单细胞转录组条形码平台可生成兼容Illumina的双端文库,其序列起始和终止端分别为P5和P7序列。尽管分辨细胞类型身份所需的最低测序深度可低至10,000–50,000条读长/细胞15,16,但为在成本与覆盖度之间取得最佳平衡,建议对成年个体的体内细胞采用约100,000条读长/细胞的测序深度(需注意某些细胞类型或最低程度活化的细胞状态在30,000–50,000条读长/细胞时即可达到饱和)。

  1. 将cDNA文库置于干冰中运输至配备相应Illumina测序仪的测序平台。
  2. 向测序机构提供以下信息:
    1. 提供样品详细信息:每个文库对应的样品索引ID;物种;用于初级组装的基因组数据库即,小鼠使用GRCm38);生物分析仪显示的片段大小电泳图(200–9,000 bp);cDNA浓度(ng/µL)和总文库浓度(总产量范围为 200 – 1400 ng);体积(µ样本的 L)
    2. 提供测序请求:使用DNA定量试剂盒对样本进行定量;接头/索引类型(TruSeq DNA);板型(Eppendorf twin.tec,全裙边——推荐用于DNA);测序技术/文库类型(10x,完整测序说明及循环数建议)17.
  3. 进行浅层测序(可选):分析多个生物样本的研究可通过合并样本(整合)以生成包含所有样本数据的单个基因-条形码矩阵而获益。为在样本合并时尽量减少批次效应,应标准化不同文库之间的测序深度。为此,需要对单细胞数量进行准确估算。MiSeq 测序仪可实现浅层测序,是一种经济、实用且能获得准确细胞数量估计的方法。
    注意:一次运行 使用 MiSeq SR50 测序仪可提供足够的测序深度,以准确估计约 20,000 个细胞。此次测序将估算每个唯一分子标识符(UMI)回收的数量。在 图3a示例(Sample 1.6)输出文件(.csv)的标题如图所示,列出了条形码及其对应的UMI计数,这些数据由可靠比对的读段确定。
    1. 咨询生物信息学专家以熟悉 R 编程语言。有关更多信息,请参考 DataCamp 教程。18.
    2. 使用提供的 R 脚本作为模板评估测序仪获得的原始数据19原始数据指比对到每个唯一细胞条形码的UMI数量。该脚本读取一个.csv文件,其中第一列为条形码列表,第二列为对应的UMI计数。该脚本将生成一张图(图3b以及每个样本中带条形码的细胞的预估数量。调整脚本,确保输入的某个样本的UMI计数位于第一个急剧下降点的三分之一处。 图3b,该拐点约为225个UMI,对应3,480个带条形码的细胞。
    3. 与使用HiSeq进行的全深度测序相当(其中3,516个细胞成功测序), 图 3c),浅层测序估计预测了 3,480 个细胞。
  4. 使用细胞回收量估算值(来自步骤 5.3),或使用制造商方案中提供的回收量图表20 规划测序通道分布以实现更深的测序。每个样本应获得相当的测序覆盖度,因此若浅层测序结果显示各样本中的细胞数量存在差异(通常如此),则应据此计算通道分布。一个HiSeq芯片(包含8个通道)最多可测序24亿条定制双端读长。示例芯片配置如下所示 图3d.

6. 处理测序读段文件

注意:使用本方案对单细胞 3’ 文库进行测序将生成二进制碱基识别(BCL)格式的原始数据。Cell Ranger 软件包用于将 BCL 文件转换为基于文本的 FASTQ 文件,并进行基因组和转录组比对、基因计数、样本解复用以及样本整合。本节介绍关键步骤,以帮助用户从测序机构下载原始 BCL 数据,并生成可用于下游生物信息学分析的过滤后基因-条形码矩阵。

  1. 使用中央服务器运行程序。BCL 文件、FASTQ 文件以及大部分下游生物信息学分析均需要强大的计算能力。
  2. 将所有原始测序读长文件下载到服务器(或直接下载可用的FASTQ文件)。
    1. 咨询服务器管理员以在中央服务器或集群上设置账户,并熟悉 Unix 系统21.
    2. 使用适用于服务器操作系统的 fetch 命令,从测序机构的服务器下载所有文件。
      1. 大多数测序机构提供从安全路径下载文件的命令,该命令可通过命令行运行(见下文示例)。
      2. 替换 "<用户名>" 和 "<password>" 命令行中的占位符需替换为提供的凭据。
        wget -O - "https://your_sequencing_facilitys_server.com/path_to_raw_read_files/ --no-cookies --no-check-certificate --post-data 'j_username=username&j_password=password' | wget --no-cookies --no-check-certificate --post-data 'j_username=username&j_password=password' -ci -
    3. 如果仅提供了文件的绝对路径(即 https://your_sequencing_facilitys_server.com/path_to_raw_read_files/),将此路径插入获取命令中。
  3. 解压文件:如果下载的文件以 ".gz" 延伸部分,已使用以下方法进行压缩 "gzip" 命令。要解压缩,请在命令行中运行 unzip 命令(见以下示例)。
    解压 raw_read_files.gz 文件
  4. 将最新版本的 Cell Ranger 作为独立的 .tar 文件下载到服务器上22.
    1. 关键: 下载之前,请确保 Linux 系统满足最低要求23确保使用至少8核的Intel处理器,配备64 GB内存和1 TB的可用磁盘空间。
      注意:Cell Ranger 提供了预构建的人类和啮齿类参考转录组。这些参考转录组可使用 cellranger mkref 检测 GFP 等基因的命令24.
  5. 使用 cellranger mkfastq 命令从测序仪的碱基识别文件(BCLs)生成 FASTQ 文件。
    注意:该程序将把原始测序读段(来自 FASTQ 文件)比对至参考基因组,并生成基因-细胞矩阵以用于下游分析。程序使用 STAR 比对工具,可实现对参考基因组的剪接感知比对。仅高置信度比对的读段(即,与单个基因注释兼容的读段)用于UMI计数。
    1. 例如,使用 cellranger mkfastq 命令:
      cellranger mkfastq --id=样本名称 \
                --run=/path/to/sample
                --csv=包含测序通道样本索引的csv文件.csv
  6. 在生成的 FASTQ 文件上运行 cellranger count 使用 mkfastq 生成单细胞基因计数。
    1. 例如,使用 cellranger count 命令:
      cellranger count --id=样本名称 \
                --transcriptome=refdata-cellranger-mm10-1.2.0 \
                --fastqs=/fastq文件的绝对路径/
                --sample=提供给cellranger_mkfastq的相同样本名称 \
                --localcores=30
  7. 多文库整合(可选):为合并样本,使用 cellranger aggr 将 cellranger count 的输出结果进行整合。此步骤将生成一个包含来自多个文库数据的单一基因-条形码矩阵。cellranger aggr 示例命令:
    cellranger aggr --id=样本名称 \
              --csv=csv_with_libraryID_&_path_to_molecule_h5.csv
              --normalize=已比对
    注意:文库可通过三种标准化模式(mapped、raw、none)进行合并。推荐使用 mapped 模式,该模式会对测序深度较高的文库进行下采样,直至所有文库的测序深度相等25.
  8. 如需立即可视化/分析数据,可将 .cloupe 输出文件(通过 cellranger count 或 cellranger aggr 生成)导入 10x Loupe Cell Browser26.

7. scRNA-Seq 数据集的高级分析

注意:完整的单细胞 RNA 测序(scRNA-Seq)工具数据库可在 scRNA-tools3,27 中找到。以下是使用 Seurat2 进行无监督细胞聚类和使用 Monocle6 进行拟时序分析的框架。尽管大部分工作可在本地计算机上完成,但以下步骤假设计算将在机构服务器上完成。

  1. 使用 Linux 平台在服务器账户上下载最新版本的 Miniconda28
  2. 使用 conda 安装最新版本的 R29
  3. 以提供的 Seurat R 脚本为模板绘制数据30
    注意:Seurat 是一个基于 R 的工具包,可用于质控检查、聚类、差异基因表达分析、标志基因识别、降维以及单细胞 RNA 测序(scRNA-Seq)数据的可视化。Seurat 编程的详细说明和教程可在 Satija 实验室网站上找到31
  4. 以提供的 Monocle R 脚本为模板绘制 数据32
    注意:Monocle 是另一个基于 R 的工具包,可用于可视化拟时序过程中的基因表达变化,并识别驱动细胞命运决定的关键基因。Monocle 编程的详细说明和教程可在 Monocle 官方网站上找到33
  5. 可使用 kBET 等 R 软件包来检测并校正因整合数据集而产生的批次效应34

8. NCBI 的 GEO 和 SRA 提交

注意:由于原始测序数据的便捷获取能够确保研究的可重复性和重新分析,因此建议或要求在提交稿件前将数据存入在线公开数据库。美国国家生物技术信息中心(NCBI)的基因表达综合数据库(Gene Expression Omnibus,GEO)和序列读取档案库(Sequence Read Archive,SRA)是可用于存储高通量测序数据的公开数据库35,36

  1. 注册 NCBI 的 GEO 提交者账户37
  2. 完成 GEO 提交,提交内容包括三个部分,需整理到一个目录/文件夹中(目录名称为 GEO 提交者的用户名):1) 元数据记录(每个项目提交对应一个电子表格);2) 原始数据文件;3) 处理后的数据文件。
    1. 下载并填写元数据电子表格38。可参考以下公开的 GEO 提交示例(GSE100320)39。将填写好的电子表格放入该目录中。
    2. 将所有文库通过 cellranger count 脚本生成的原始数据文件放入该目录中。
    3. 将所有文库通过 cellranger count 脚本生成的处理后数据文件(包括过滤后的 barcodes.tsv、genes.tsv 和 matrix.mtx 文件)放入该目录中。
  3. 使用 GEO 提交者的 FTP 服务器凭据,将包含上述三个部分的目录上传。对于 Linux/Unix 用户:可使用 ncftp、lftp、ftp、sftp 或 ncftpput 工具进行传输。
  4. 在所有传输完成后,通知 GEO 38

结果

用于分析单细胞RNA测序(scRNA-Seq)数据集的开源软件包种类已显著增加40,其中大多数软件包采用基于R的语言3。本文展示了使用其中两个软件包所得的代表性结果:基于基因表达对单细胞进行无监督分组,以及将单细胞沿轨迹排序,以解析细胞异质性并解构生物学过程。

图4 展示了使用 Seurat 进行预处理质量检查及下游生物信息学分析的方法。首先,过滤并从分析中剔除异常细胞是质量检查的关键步骤。本研究通过小提琴图(图4a)和散点图(图4b)可视化线粒体基因百分比、基因数量(nGene)和UMI数量(nUMI),以识别细胞双联体及离群值。对于基因数、UMI数或线粒体基因百分比明显偏离的细胞,均使用 Seurat 的 FilterCells 函数予以剔除。由于 Seurat 利用主成分(PC)分析得分对细胞进行聚类,因此确定具有统计学意义的主成分数量是关键步骤。本研究采用肘部图(图4c)进行主成分选择,排除“主成分标准差”坐标轴中 plateau 区域之后的主成分。同时调整了聚类分辨率,以展示聚类数量的变化,范围从 0.4(低分辨率,导致较少的细胞簇,图4d)到 4(高分辨率,导致更多的细胞簇,图4e)。在低分辨率下,每个簇通常代表一种明确的细胞类型;而在高分辨率下,可能还反映了细胞群体的亚型或过渡状态。本研究采用低分辨率聚类设置,进一步利用 Seurat 的 DoHeatmap 函数分析表达热图(图4f),以鉴定特定簇中表达水平最高的基因。在此过程中,通过评估某一簇相对于其余所有簇合并后的差异表达,识别出各簇均由特定基因独特表征。此外,还可利用 Seurat 的 FeaturePlot 函数在 tSNE 图上可视化单个候选基因的表达(图4g),从而判断是否存在代表巨噬细胞的簇。通过 FeaturePlot 分析发现,簇 2 和簇 4 均表达 Cd68——一种泛巨噬细胞标志物。

使用 Monocle 软件包验证 Seurat 鉴定出的细胞簇,并构建细胞轨迹(即拟时序排序),以重现生物学过程(图 5)。拟时序排序适用于预期单细胞表达谱遵循生物学时间进程的样本。通过将细胞沿拟时序连续体进行排序,可解析中间状态、两种不同细胞命运的分支点,并识别每种命运获得过程中相关的基因特征。首先,类似于 Seurat 的过滤方法,去除低质量细胞,使所有细胞中 mRNA 的分布呈对数正态,并位于 图 5a 所确定的上下界之间。然后,利用 Monocle 的 newCellTypeHierarchy 函数,根据已知的谱系标志基因对单细胞进行分类和计数(图 5b5c)。例如,表达 PDGF 受体 alpha 或成纤维细胞特异性蛋白 1 的细胞被归入细胞类型 #1,以此作为定义成纤维细胞的标准。接下来,对该群体(细胞类型 #1)进行评估,以解析成纤维细胞的发育轨迹。为此,使用了 Monocle 的差异基因检验(GeneTest)功能,该方法比较群体内代表极端状态的细胞,识别出用于对群体中其余细胞进行排序的差异表达基因(图 5d)。通过在所有细胞上应用流形学习方法(一种非线性降维技术),为每个细胞分配沿拟时序路径的坐标。随后,该轨迹通过细胞状态(图 5e)和拟时序(图 5f)进行可视化。

单细胞RNA测序工作流程图;包括FACS分选、文库测序和数据分析。
图1:流程图。从整体动物样本制备到单细胞RNA-Seq数据集分析,最终将数据提交至公开可用数据库的完整步骤。乳液中的凝胶微珠(GEMs)指带有条形码寡核苷酸的微珠,可包裹数千个单细胞。请点击此处查看此图的放大版本。

细胞释放与鉴定流程;流式细胞术图谱;显微镜图像;碎片分离。
图 2:从神经组织制备具有活力的单细胞悬液。(a)质量控制检测的示意图。(b)细胞与碎片,其中部分细胞仍嵌入碎片中(红箭头所示)。(c)从碎片中释放出的细胞(红箭头所示)。(d)通过FACS进行细胞分离。P0:碎片组分;P1:类细胞组分;P3:排除双联体;P4:活率染料(Sytox Orange)阴性组分。(e)无活率染料的对照。(f)P0组分的图像,代表分离出的碎片。(g)P4组分的图像,代表分离出的活细胞(红箭头所示)。(b)(c)(f)和(g)在成像前20分钟添加了核染料。比例尺:80 µm。请点击此处查看该图的放大版本。

UMI 计数分析;MiSeq 条形码图谱与转录组比对;数据表;RNA 测序
图3:浅层测序可预测经10X处理样本中回收细胞的数量。 (a) MiSeq 生成的 csv 文件示例(样本 1.6),列出由高置信比对读段确定的细胞条形码及其对应的 UMI 计数。(b) 样本 1.6 的条形码排序图显示,UMI 计数随细胞条形码排序呈一次显著下降。虚线与实线分别表示通过视觉检查确定的细胞与背景的截断阈值。(c) 使用 HiSeq 后的 Cell Ranger 分析流程所观测到的细胞条形码表明,浅层测序可准确估算样本 1.6 的细胞数量。(d) 基于浅层测序推算的细胞数所设计的流动池配置示例。对于样本 1.6,由于浅层测序预测出 3480 个细胞,因此分配了 1.17 个通道以确保 >HiSeq 中每个细胞测序覆盖深度为 100,000 个读段。注:所有通道加总必须为 100%。 请点击此处以查看此图的放大版本。

单细胞RNA测序分析;点图、PCA、tSNE聚类、基因表达热图。
图4:使用Seurat R软件包对单细胞RNA测序数据集进行质量控制与生物信息学分析。(a) 质量控制指标图,包括基因数量、唯一分子标识符(UMIs)数量以及比对到线粒体基因组的转录本百分比。(b) 检测线粒体转录本和UMI水平异常细胞的示例基因图。(c) 示例“肘部图”,用于经验性确定具有统计学意义的主成分(PCs)。虚线和点划线表示图中明显“肘部”出现的截断值,该肘部之前的PC维度将被纳入后续分析。(d, e) 在低维空间中使用tSNE图以两种不同分辨率可视化基于图的细胞聚类。(f) 利用Seurat的DoHeatmap功能,在表达热图上可视化各聚类的前导标记基因(黄色)。(g) 使用Seurat的FeaturePlot功能可视化标记基因表达,例如代表巨噬细胞的Cd68基因(紫色),提示该数据集中的第2和第4聚类(见d图)为巨噬细胞。请点击此处查看该图的高清版本。

使用直方图、饼图、数据表、分散图和PCA图进行基因表达分析。
图5:使用 Monocle 工具包沿拟时轨迹对细胞进行分类和排序。(a)检查样本中所有细胞的mRNA分布情况(根据UMI计数推断)。仅使用mRNA数量在0 - ~20,000范围内的细胞进行下游分析。(b, c)基于已知谱系细胞标志物对细胞类型进行指派和计数。例如,表达PDGF受体α或成纤维细胞特异性蛋白1的细胞被指派为细胞类型#1,代表泛成纤维细胞,使用Monocle的newCellTypeHierarchy函数实现。不同细胞类型的数量可通过饼图(b)和表格(c)进行可视化。(d)以细胞类型#1(成纤维细胞)为例,用于细胞排序的基因可通过散点图进行可视化,展示基因离散度与平均表达水平的关系。红色曲线表示根据Monocle的estimateDispersions函数利用均值-方差模型计算出的用于排序基因的阈值。满足该阈值的基因被用于下游的拟时序排序。(e, f)在降维后的二维空间中可视化细胞轨迹,按细胞的“状态”着色(e),以及按Monocle分配的“拟时”着色(f)。请点击此处查看该图的放大版本。

讨论

本方案展示了如何通过适当的单细胞制备,揭示数千个单细胞的转录异质性,并区分组织内不同的功能状态或独特的细胞身份。该方案无需荧光报告蛋白或转基因工具,可适用于包括人类在内的多种目标组织的单细胞分离;但需注意 每种组织均具有独特性,因此本方案需要一定程度的调整或修改。

细胞内多样且高度动态的转录程序凸显了单细胞基因组学的重要性。除了分离高质量的RNA外,获得高质量数据集所需的关键样本制备步骤还包括确保细胞从组织中完全释放,并且细胞保持健康和完整。对于易于释放的细胞(例如循环细胞或淋巴组织等细胞结合较松散的组织中的细胞),这一过程相对简单。但对于其他成年组织而言,由于存在跨越较大距离的复杂细胞结构、周围的细胞外基质以及常为刚性的细胞骨架蛋白来维持细胞形态,实现这一点则具有挑战性。即使采用适当的解离技术以实现细胞的完全释放,繁琐且通常耗时较长的处理过程仍有可能影响mRNA质量和细胞完整性。此外,酶辅助解离过程中使用的高温也会影响转录特征29,30。本实验方案旨在通过使用髓鞘化的成年神经组织以及富含细胞外基质的成年皮肤组织作为示例,介绍质量控制检测方法,以展示如何通过 优化来克服这些障碍。

设计任何单细胞RNA测序(scRNA-Seq)实验时,一个主要考虑因素是测序深度的选择。测序可以高度多重化,读长深度可从使用Drop-Seq方法时的极低水平2,到使用全长RNA-Seq方法(如Smart-Seq)时高达每细胞500万条读长14不等。大多数scRNA-Seq实验在每细胞仅1万条读长的测序深度下即可检测到中等到高表达水平的转录本,这通常足以用于细胞类型分类41,42。当需要在复杂的组织中检测稀有细胞群体,且需分析数千个细胞才能可靠识别这些稀有群体时,采用较浅的测序深度有助于节省测序成本。然而,当需要获取与细微转录特征相关的基因表达和生物学过程的详细信息时,较浅的测序深度则不足够。目前估计,每细胞50万条读长可检测到细胞中绝大多数基因,但这一数值可能因实验方案和组织类型而异43,44。虽然全长转录本测序避免了拼接组装的需要,因而能够检测新的或罕见的剪接变异体,但测序成本通常限制了此类方法在分析由数千个细胞组成的复杂组织系统中的大规模应用。相比之下,本方案中描述的3'端标记的单细胞文库通常复杂度较低,所需的测序深度也更浅。需要注意的是,使用本方案生成的文库可在以下五种支持的测序仪之一上进行测序:1)NovaSeq,2)HiSeq 3000/4000,3)HiSeq 2500快速运行和高输出模式,4)NextSeq 500/550,以及5)MiSeq。

一种单细胞RNA测序的替代方法是通过对单个细胞核进行RNA分析,该方法减少了对精细组织 和细胞操作的需求,同时仍保留了单细胞RNA测序的部分优势45。该方法 可实现更快的样本处理,减少RNA降解,并可采用更剧烈的手段确保细胞核的充分释放,因此更有可能可靠地捕获代表特定组织中所有细胞的转录谱。当然,这种方法仅能提供特定细胞内部分转录活性的信息,因此是否适用取决于具体的实验目标。

除了对特定组织内细胞身份进行全面表征外,最具价值的分析之一是 scRNA-Seq 数据集的一个重要应用是评估“已定义”细胞群体中的中间转录状态。这些中间状态可为已鉴定细胞群体内细胞间的谱系关系提供重要见解,这曾是 传统批量RNA测序方法无法实现这一点。目前已有多种单细胞RNA测序(scRNA-Seq)生物信息学工具被开发出来以阐明此类问题。这些工具可用于分析例如癌细胞向致癌/转移状态转变、干细胞分化为多种终末命运或免疫细胞在活跃与静息状态之间转换等过程。细胞间细微的转录组差异也可能提示谱系偏向性,而近期开发的生物信息学工具(如FateID)能够推断此类偏向性。47由于过渡状态细胞之间的差异较难确定,且转录差异可能较为细微,因此可能需要进行更深度的测序。46幸运的是,如果希望进一步探究数据集,可以通过在另一个流动池上重新运行文库来增加浅层测序文库的覆盖度。

综上所述,本方案提供了一种易于调整的工作流程,使研究人员能够在一次实验中对数百至数千个单细胞进行转录组分析。单细胞RNA测序(scRNA-Seq)数据集的最终质量取决于优化的细胞分离、流式细胞术、cDNA文库构建以及对原始基因-条形码矩阵的解析。为此,本方案全面概述了所有关键步骤,且这些步骤可轻松修改,以适用于不同类型组织的研究。

致谢

我们感谢卡尔加里大学UCDNA服务设施的支持人员以及动物护理设施的工作人员。感谢Matt Workentine提供的生物信息学支持,以及Jens Durruthy提供的技术支持。本研究由加拿大卫生研究院(CIHR)资助项目(R.M. 和 J.B.)、J.B. 获得的加拿大卫生研究院新研究者奖,以及阿尔伯塔儿童健康研究所博士后奖学金(J.S.)资助。

材料

本文使用的材料清单
姓名公司目录编号评论
产品
RNase outBiosciences786-70
戊巴比妥钠Euthanyl50mg/kg
HBSSGibco14175-095
Dispase 5U/mlStemCell Technologies79135 mg/ml
胶原酶-4 125 CDU/mgSigma-AldrichC51382 mg/ml
DNaseSigma-AldrichDN2510mg/ml
BSASigma-AldrichA7906
15 ml 窄底管 VWR® 高性能离心管VWR89039-666
Sytox Orange 活性染料Molecular Probes113209721.3 nM/µl
Nuc Blue Live ReadyProbesInvitrogenR37605
Agilent 2100 Bioanalyzer 高灵敏度 DNA 试剂Agilent5067-4626
Kapa DNA 定量试剂盒Kapa BiosystemsKK4844
Chromium 单细胞 3' 试剂10x Genomics
设备
BD FACSAria IIIBD Biosciences
Agilent 2100 Bioanalyzer 平台Agilent
Illumina® HiSeq 4000Illumina
Illumina® MiSeq SR50Illumina
10X 控制器 + 配件10x Genomics
软件
Cell Ranger10x GENOMICSsupport.10xgenomics.com/single-cell-gene-expression/software/overview/welcome
Loupe Cell Browser10x GENOMICSsupport.10xgenomics.com/single-cell-gene-expression/software/downloads/latest
Rhttps://anaconda.org/r/r

参考文献

  1. Shalek, A. K., et al. Single-cell RNA-seq reveals dynamic paracrine control for cellular variation. Nature. 510, 363-369 (2014).
  2. Macosko, E. Z., et al. Highly parallel genome-wide expression profiling of individual cells using nanoliter droplets. Cell. 161, 1202-1214 (2015).
  3. Zappia, L., Phipson, B., Oshlack, A. Exploring the single-cell RNA-seq analysis landscape with the scRNA-tools database. bioRxiv:206573. , (2018).
  4. Dulken, B. W., Leeman, D. S., Boutet, S. C., Hebestreit, K., Brunet, A. Single cell transcriptomic analysis defines heterogeneity and transcriptional dynamics in the adult neural stem cell lineage. Cell Reports. 18 (3), 777-790 (2017).
  5. Llorens-Bobadilla, E., et al. Single-Cell Transcriptomics Reveals a Population of Dormant Neural Stem Cells that Become Activated upon Brain Injury. Cell Stem Cell. 17 (3), 329-340 (2015).
  6. Trapnell, C., et al. The dynamics and regulators of cell fate decisions are revealed by pseudotemporal ordering of single cells. Nature Biotechnology. 32, 381-386 (2014).
  7. Aibar, S., et al. SCENIC: single-cell regulatory network inference and clustering. Nature Methods. 14, 1083-1086 (2017).
  8. Mayer, C., et al. Developmental diversification of cortical inhibitory interneurons. Nature. 555 (7697), 457-462 (2018).
  9. Stratton, J. A., et al. Purification and Characterization of Schwann Cells from Adult Human Skin and Nerve. eNeuro. 4 (3), (2017).
  10. Biernaskie, J. A., McKenzie, I. A., Toma, J. G., Miller, F. D. Isolation of skin-derived precursors (SKPs) and differentiation and enrichment of their Schwann cell progeny. Nature Protocols. 1 (6), 2803-2812 (2007).
  11. 10X Genomics. User Guides. , Available from: https://www.10xgenomics.com/resources/user-guides/ (2018).
  12. 10X Genomics. Chromium Single Cell 3' Training Module. , Available from: http://go.10xgenomics.com/training-modules/single-cell-gene-expression (2018).
  13. Agilent. , Available from: https://www.agilent.com/en-us/library/usermanuals?N=135 (2018).
  14. Kolodziejczyk, A. A. Single Cell RNA-Sequencing of Pluripotent States Unlocks Modular Transcriptional Variation. Cell Stem Cell. 17, 471-485 (2015).
  15. Jaitin, D. A., et al. Massively parallel single-cell RNA-seq for marker-free decomposition of tissues into cell types. Science. 343, 776-779 (2014).
  16. Pollen, A. A., et al. Low-coverage single-cell mRNA sequencing reveals cellular heterogeneity and activated signaling pathways in developing cerebral cortex. Nature Biotechnology. 32, 1053-1058 (2014).
  17. 10X Genomics. Sequencing Requirements for Single Cell 3'. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/sequencing/doc/specifications-sequencing-requirements-for-single-cell-3 (2018).
  18. Datacamp. Introduction to R. , Available from: https://www.datacamp.com/courses/free-introduction-to-r (2018).
  19. Droplet-based, high-throughput single cell transcriptional analysis of adult mouse tissue using 10X Genomics#39; Chromium Single Cell 3' (v2) system: From tissue preparation to bioinformatic analysis. , Available from: https://figshare.com/s/97b83e649e5eefd01357 (2018).
  20. 10X Genomics. User Guides. , Available from: https://www.10xgenomics.com/resources/user-guides/ (2018).
  21. UNIX Tutorial for Beginners. , Available from: http://www.ee.surrey.ac.uk/Teaching/Unix/ (2018).
  22. 10X Genomics. Creating a Reference Package with cellranger mkref. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/software/pipelines/latest/advanced/references (2018).
  23. 10X Genomics. System Requirements. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/software/overview/system-requirements (2018).
  24. 10X Genomics. Software Downloads. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/software/downloads/latest (2018).
  25. 10X Genomics. Aggregating Multiple Libraries with cellranger aggr. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/software/pipelines/latest/using/aggregate#depth_normalization (2018).
  26. 10X Genomics. Loupe Cell Browser Gene Expression Tutorial. , Available from: https://support.10xgenomics.com/single-cell-gene-expression/software/visualization/latest/tutorial (2018).
  27. scRNA-tools. A table of tools for the analysis of single-cell RNA-seq data. , Available from: https://www.scrna-tools.org/ (2018).
  28. Conda. Downloading conda. , Available from: https://conda.io/docs/user-guide/install/download.html (2018).
  29. Anaconda. r / packages / r 3.5.1. , Available from: https://anaconda.org/r/r (2018).
  30. Droplet-based, high-throughput single cell transcriptional analysis of adult mouse tissue using 10X Genomics' Chromium Single Cell 3' (v2) system: From tissue preparation to bioinformatic analysis. , Available from: https://figshare.com/s/97b83e649e5eefd01357 (2018).
  31. Satija Lab. Seurat - Guided Clustering Tutorial. , https://satijalab.org/seurat/pbmc3k_tutorial.html (2018).
  32. Droplet-based, high-throughput single cell transcriptional analysis of adult mouse tissue using 10X Genomics' Chromium Single Cell 3' (v2) system: From tissue preparation to bioinformatic analysis. , Available from: https://figshare.com/s/97b83e649e5eefd01357 (2018).
  33. Monocle. , Available from: http://cole-trapnell-lab.github.io/monocle-release/docs/#constructing-single-cell-trajectories (2018).
  34. Github. An R package to test for batch effects in high-dimensional single-cell RNA sequencing data. , (2018).
  35. Edgar, R. Gene Expression Omnibus: NCBI gene expression and hybridization array data repository. Nucleic Acids Research. 30, 207-210 (2002).
  36. Leinonen, R., Sugawara, H., Shumway, M. The sequence read archive. Nucleic Acids Research. 39, D19-D21 (2011).
  37. NIH. GenBank Submission Portal Wizards. , Available from: https://www.ncbi.nlm.nih.gov/account/register/?back_url=/geo/submitter/ (2018).
  38. NIH. Submitting data. , Available from: https://submit.ncbi.nlm.nih.gov/geo/submission/ (2018).
  39. Shah, P. T., et al. Single-Cell Transcriptomics and Fate Mapping of Ependymal Cells Reveals an Absence of Neural Stem Cell Function. Cell. 173, 1045-1057 (2018).
  40. Anon, Method of the Year 2013. Nature Methods. 11, 1(2013).
  41. Adam, M., Potter, A. S., Potter, S. S. Psychrophilic proteases dramatically reduce single-cell RNA-seq artifacts: a molecular atlas of kidney development. Development. 144, 3625-3632 (2017).
  42. Wu, Y. E., Pan, L., Zuo, Y., Li, X., Hong, W. Detecting activated cell populations using single-cell RNA-seq. Neuron. 96, 313-329 (2017).
  43. Zeigenhain, C., et al. Comparative Analysis of Single-Cell RNA Sequencing Methods. Molecular Cell. 65 (4), 631-643 (2017).
  44. Wu, A. R., et al. Quantitative assessment of single-cell RNA-sequencing methods. Nature Methods. 11 (1), 41-46 (2014).
  45. Habib, N., et al. Div-Seq: Single-nucleus RNA-Seq reveals dynamics of rare adult newborn neurons. Science. 353 (6302), 925-928 (2016).
  46. Janes, K. A. Single-cell states versus single-cell atlases - two classes of heterogeneity that differ in meaning and method. Current Opinions in Biotechnology. 39, 120-125 (2016).
  47. Herman, J. S., Sagar,, Grün, D. FateID infers cell fate bias in multipotent progenitors from single-cell RNA-seq data. Nature Methods. 15 (5), 379-386 (2018).

重印与许可

标签

FACS GEM Seurat R Cell Ranger