方法文章

ExCYT:用于简化高维细胞术数据分析的图形用户界面

DOI:

10.3791/57473

2019年1月16日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ExCYT 是一个基于 MATLAB 的图形用户界面(GUI),可让用户通过常用的高维数据分析技术来分析其流式细胞术数据,包括通过 t-SNE 进行降维、多种自动和手动聚类方法、热图以及新型高维流式图。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着流式细胞仪能够检测的参数数量不断增加,科研人员持续开发更大的抗体组合,以对细胞样本进行表型特征分析。然而,这些技术进步产生了高维度的数据集,使得在传统的基于手动设门的分析软件中客观地分析数据变得愈发困难。为了更好地分析和展示数据,科学家们常与擅长高维数据分析的生物信息学专家合作,共同解析其流式细胞术数据。尽管这些方法已被证明在流式细胞术研究中极具价值,但尚未被整合为一种简单直观、易于使用的工具包,供缺乏计算或编程背景的科研人员使用。为满足这一需求,我们开发了ExCYT——一个基于MATLAB的图形用户界面(GUI),通过集成常用的高维数据分析技术,简化了高维流式细胞术数据的分析流程,这些技术包括t-SNE降维、多种自动与手动聚类方法、热图以及新型高维流式图。此外,ExCYT还提供传统设门功能,允许用户选择感兴趣的细胞群体,进一步进行t-SNE和聚类分析,并支持直接在t-SNE图上应用设门。该软件的另一优势在于可处理已补偿或未补偿的FCS文件。若需在数据采集后进行补偿,用户可提供单染样本文件夹及未染色对照样本,程序将自动识别各通道中的阳性事件,并利用这些选定数据更客观地计算补偿矩阵。综上所述,ExCYT提供了一套完整的分析流程,能够以FCS文件形式导入流式细胞术数据,使任何具备或不具备计算背景的研究人员均可应用最新的算法手段深入理解其数据。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

流式细胞术的进步以及质谱流式细胞术的出现,使得临床医生和科研人员能够以前所未有的分辨率快速识别并进行生物学和临床相关样本的表型表征,从而产生信息丰富的大规模高维数据集1,2,3。尽管传统的流式细胞术数据分析方法(如人工设门)在标记物较少且各标记物可清晰分辨出细胞群的实验中较为直接有效,但在分析高维数据集或标记物染色呈连续谱分布的数据时,该方法往往难以生成可重复的结果。例如,在一项多中心研究中,研究人员采用胞内细胞因子染色(ICS)实验评估抗原特异性T细胞反应定量结果的可重复性,尽管各实验室之间的检测精密度良好,但数据分析过程(尤其是设门策略)引入了显著的变异来源4。此外,人工设门鉴定目标细胞群的过程不仅高度依赖主观判断,而且耗时且劳动强度大。然而,以稳健、高效且及时的方式分析高维数据集的问题,在科研领域并非新挑战。基因表达研究通常会产生极高维度的数据集(通常涉及数百个基因),在这些数据集中采用人工方式进行分析根本不可行。为应对这类数据集的分析难题,已有大量工作致力于开发用于解析基因表达数据的生物信息学工具5。随着检测参数数量的增加,这些算法化方法最近已被引入细胞术数据分析中,并在高维数据集的分析中展现出不可替代的价值6,7

尽管已有多种算法和软件包被开发并应用于高维生物信息学方法,使科研人员能够将其应用于流式细胞术数据,但这些分析技术在细胞计数数据中的应用仍远未普及。尽管可能存在多种因素限制了这些方法在细胞计数数据分析中的广泛采用8,我们推测科学家在使用这些方法时面临的主要障碍是缺乏计算知识。事实上,许多这些软件包(即, flowCore、flowMeans 和 OpenCyto 等工具需在 R 等编程语言环境中实现,仍要求使用者具备较强的编程知识。而 FlowJo 等软件因其操作简便、“即插即用”的特性以及与 PC 操作系统的良好兼容性,受到科研人员的青睐。为了使不熟悉编程的科研人员也能使用一系列已被广泛认可且具有价值的分析技术,我们开发了 ExCYT——一种图形用户界面(GUI)软件,可轻松安装于 PC 或 Mac 系统,集成了多种最新分析方法,包括用于直观可视化的降维技术、文献中广泛引用的多种聚类方法,以及通过热图和新型高维流式图/箱线图探索聚类算法输出结果的新功能。

ExCYT 是一个基于 MATLAB 构建的图形用户界面,因此可直接在 MATLAB 中运行,也可通过提供的安装程序在任意 PC 或 Mac 上安装使用。该软件可在 https://github.com/sidhomj/ExCYT 获取。本文提供了一套详细的操作流程,介绍如何导入数据、进行预处理、执行 t-SNE 降维、聚类数据以及排序 & 根据用户偏好筛选聚类,并通过热图及新型高维流式/箱线图展示目标聚类的信息 (图1)t-SNE 图中的坐标轴是任意的,单位也是任意的,因此为了简化用户界面,图中并不总是显示坐标轴。数据点的着色在 "t-SNE 热图" 根据所示标记的信号,颜色从蓝色变为黄色。在聚类分析结果中,数据点的颜色根据聚类编号任意设定。工作流程的全部步骤均可在单一面板的图形用户界面(GUI)中完成 (图2 & 表1)最后,我们将展示 ExCYT 在文献中已发表的肾细胞癌免疫图谱数据上的应用,这些数据此前也使用了类似方法进行分析。本文用于生成图表的示例数据集及以下实验方案可在注册账户后于 https://premium.cytobank.org/cytobank/projects/875 获取。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 收集和准备流式细胞术数据

  1. 将所有单染样本单独放置在一个文件夹中,并按通道名称(以荧光染料命名,而非标记物)进行标记。

2. 数据导入 & 预处理

  1. 在整个分析流程中如需暂停或保存,请使用程序左下角的保存工作区按钮,将工作区保存为“*.MAT”文件,之后可通过加载工作区按钮重新载入。请勿同时运行程序的多个实例。因此,在加载新的工作区时,务必确认没有其他 ExCYT 实例正在运行。
  2. 开始分析流程时,首先在文件选择参数下选择细胞仪类型(流式细胞仪或质谱流式细胞仪 – CYTOF),并选择从文件中采样的事件数量(本示例中使用 2,000 个事件)。数据成功导入后,将弹出一个对话框,提示用户数据已成功导入。
  3. 点击自动补偿按钮,执行可选的自动补偿步骤,该步骤由 Bagwell & Adams9 提出。选择包含单染样本的目录,并在用户界面对话框中选择未染色样本。
    1. 在该目录中的任意样本上设置前向/侧向散射门,用于选择用于计算补偿矩阵的事件。建议使用未染色样本完成此步骤。此时,算法已实现,在未染色样本的第 99th 百分位数处设定一致的阈值,以定义各单染样本中的阳性事件,从而计算补偿矩阵。完成后,对话框将提示用户补偿已完成。
  4. 接下来,点击设门分群,选择感兴趣的细胞群,这是流式细胞分析中的常规操作。选定细胞群后,输入用于下游分析的事件数量(本示例中为 10,000 个事件)。
  5. 随后,在预处理框最右侧的列表框中选择用于分析的通道数量(使用示例中所示的具体通道)。

3. t-SNE 分析

  1. 按压 t-SNE 点击按钮,使程序开始计算降维数据集,以便在 t-SNE 按钮下方的窗口中进行可视化。如需保存 t-SNE 图像,请按 保存t-SNE图像在一台配备8个3.4 GHz CPU和8 GB内存的机器上,处理10,000个事件约需2分钟,处理50,000个事件约需10分钟,处理100,000个事件约需20分钟。
  2. 创建“t-SNE热图”,如在多项CYTOF出版物中所见10,11,从以下选项中选择一个 特异性标记物t-SNE分析 弹出菜单(使用示例中所示的特定标记 CD64 或 CD3)。将弹出一个热图形式的 t-SNE 图谱,可用于保存并生成图片。
  3. 通过用户在 t-SNE 图中选择感兴趣的区域,用于进一步的下游分析 门控 t-SNE 按钮。

4. 聚类分析

  1. 开始聚类分析时,在聚类方法下拉列表中选择一个选项(本示例中,在下拉列表右侧的对话框中选择距离因子为5的DBSCAN)。然后点击聚类按钮。
  2. 在“自动聚类参数”面板中使用以下选项之一进行自动聚类算法:
    1. 硬K均值(基于t-SNE):对降维后的二维t-SNE数据应用k均值聚类,需向算法提供聚类数量12
    2. 硬K均值(基于高维数据):对输入至t-SNE算法的原始高维数据应用k均值聚类。同样需要向算法提供聚类数量。
    3. DBSCAN:应用一种名为“基于密度的带噪声空间聚类”(Density-Based Spatial Clustering of Applications with Noise)的聚类方法13,该方法对降维后的二维t-SNE数据进行聚类,需要一个无量纲的距离因子来决定聚类的一般大小。此类聚类算法特别适用于t-SNE降维结果的聚类,因为它能够识别非球形结构的聚类,而这类结构在t-SNE降维表示中常有出现。此外,由于其作用于二维数据,因此是速度较快的聚类算法之一。
    4. 层次聚类:对高维数据应用传统的层次聚类方法,首先计算所有事件之间的完整欧氏距离矩阵,然后向算法提供一个决定聚类大小的距离因子。
    5. 基于网络图:应用一种最近引入的聚类方法,用于分析流式细胞术数据中用户希望检测的稀有亚群11,14。该方法首先构建一个图,以确定数据中所有事件之间的连接关系。此步骤需要提供一个初始参数来构建图,即k近邻数量。该参数通常控制聚类的大小。此时,会弹出另一个对话框,要求用户从应用于该图的5种聚类算法中选择一种。这些算法包括3种最大化图模块度的方法、Danon方法和一种谱聚类算法14,15,16,17,18。若需要较快的聚类解决方案,推荐使用谱聚类或快速贪婪模块度最大化方法。模块度最大化方法和Danon方法可自动确定最优聚类数量,而谱聚类则需要用户向程序提供聚类数量。
    6. 自组织映射:使用人工神经网络对高维数据进行聚类。
    7. GMM – 期望最大化:利用期望最大化(EM)技术构建高斯混合模型(Gaussian Mixture Model)对高维数据进行聚类19。此类聚类方法也要求用户输入聚类数量。
    8. 基于变分贝叶斯推断的GMM:构建高斯混合模型,但与EM不同,它可自动确定混合成分k的数量20。尽管程序仍需用户提供一个聚类数量(应大于预期聚类数),但算法将自行确定最优数量。
  3. 若要研究t-SNE图的特定区域,可点击手动选择聚类按钮,以绘制一组用户自定义的聚类。需要注意的是,聚类之间不能共享成员(每个事件只能属于一个聚类)。

5. 簇过滤

  1. 可通过以下方式对通过手动或上述自动方法识别出的聚类组进行筛选。
    1. 若要根据实验中检测的任意标记物对聚类(在聚类筛选面板中)进行排序,请从排序下拉菜单中选择一个选项。若要设定排序为升序或降序,请点击排序下拉菜单右侧的升序/降序按钮。此操作将更新“聚类(筛选)”列表框中的聚类列表,并按照该标记物的聚类中位表达值的降序重新排列。在“聚类(筛选)”列表框中显示的百分比表示该聚类所占总体细胞群体的比例。
    2. 若要为特定通道中的某个聚类设定最小阈值,请从阈值下拉菜单中选择一个选项(本示例中使用标记物CD65,并将阈值设为0.75)。可通过在图下方的数值框中输入数值,或使用滑动条设定阈值。设定阈值后,点击添加高于阈值添加低于阈值以指定阈值方向。一旦设定完成,该阈值将列于“聚类筛选”面板旁的“阈值”框中,其中会显示标记物名称、阈值数值及方向,以便用户了解当前应用的筛选条件。最后,t-SNE图将更新,未满足筛选条件的聚类将被模糊显示,而“聚类(筛选)”列表框也将更新,仅显示满足筛选条件的聚类。
    3. 若要设定聚类频率的最小阈值,请在聚类筛选面板的聚类频率阈值 (%)框中输入一个数值截断点(本示例中使用1%)。

6. 聚类分析 & 可视化

  1. 要选择簇以进行进一步分析和可视化,请在 Clusters (Filtration) 列表框中选择簇,然后按 Select à 按钮将其移至 Cluster Analyze 列表框中。
  2. 要创建簇的热图,请在 Cluster Analyze 列表框中选择感兴趣的簇,然后按 HeatMap of Clusters 按钮。按下该按钮后,将弹出一个包含热图以及簇轴和参数轴上树状图的图形。垂直轴上的树状图将根据相似性对簇进行分组,而水平轴上的树状图将对共相关的标记物进行分组。要保存热图,请按 File | Export Setup | Export
  3. 要创建“高维箱线图”或“高维流式图”,请在 Cluster Analyze 列表框中选择感兴趣的簇,然后按 High Dimensional Box Plot 按钮或 High Dimensional Flow Plot 按钮。这些图可用于直观评估各个簇在所有维度上特定通道的分布情况。
  4. 要在传统二维流式图中显示簇,请在 Conventional Flow Plot 面板中选择变换方式(线性、log10、arcsinh)和通道,然后按 Conventional Flow Plot

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了测试 ExCYT 的可用性,我们分析了 Chevrier et al. 发表的一个经过整理的数据集,题为“透明细胞肾细胞癌的免疫图谱”,该研究团队对来自 73 名患者的肿瘤样本使用了广泛的免疫标记组合进行了质谱流式细胞术(CyTOF)分析11。该研究采用两个独立的抗体组合——髓系和淋巴系组合,对肿瘤微环境进行了表型表征。我们研究的目的是重现其 t-SNE 和聚类分析结果,以证明 ExCYT 能够得出相同的结论,同时展示其他可视化和聚类分析方法。

在原始论文中,该研究团队通过淋巴细胞面板鉴定了22个T细胞簇,通过髓系面板鉴定了17个细胞簇。在该出版物的图3图4中,研究团队展示了细胞簇的热图、以不同颜色编码聚类结果的t-SNE图,以及分图A、B和C中的t-SNE热图。...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了 ExCYT,这是一种新型的图形用户界面,运行基于 MATLAB 的算法,可简化高维细胞术数据的分析流程,使无编程背景的用户也能应用最新的高维数据分析算法。该软件向更广泛的科学界开放,将使科研人员能够以直观且简便的工作流程探索其流式细胞术数据。通过执行 t-SNE 降维、应用聚类方法、快速筛选和排序这些聚类结果,并生成灵活且可自定义的热图以及高维流式图/箱形图,科研人员不仅能够识别样本中独特定义的亚群,还能创建出直观且易于被同行理解的可视化结果。

尽管该程序在处理多种数据类型(传统流式细胞术与质谱流式细胞术)方面具有灵活性,但在最大限度发挥程序效用时仍需考虑若干因素。首要因素是数据质量,特别是流式细胞术数据的质量。正确补偿以及对重叠发射光谱的有效分辨至关重要。补偿不当的数据可能无意中导致标记物的虚假共关联,以及形成并无真实生物学意义的聚类。因此,在进行 t-SNE 分析及后续下游分析之前,强烈建议输入的数据应具备良好的质量。此外,ExCYT 中实现的自动补偿算法需要所有通道均具备清晰的单染样本,以准确计算补偿参数。

...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
台式机SuperMicro定制组装用于运行分析的计算机
MATLABMathworks不适用用于开发 ExCYT 的软件

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Benoist, C., Hacohen, N. Flow cytometry, amped up. Science. 332 (6030), 677-678 (2011).
  2. Ornatsky, O., et al. Highly multiparametric analysis by mass cytometry. Journal of immunological methods. 361 (1), 1-20 (2010).
  3. Tanner, S. D., et al. Flow cytometer with mass spectrometer detection for massively multiplexed single-cell biomarker assay. Pure and Applied Chemistry. 80 (12), 2627-2641 (2008).
  4. Maecker, H. T., et al. Standardization of cytokine flow cytometry assays. BMC immunology. 6 (1), 13(2005).
  5. Brazma, A., Vilo, J. Gene expression data analysis. FEBS letters. 480 (1), 17-24 (2000).
  6. Pyne, S., et al. Automated high-dimensional flow cytometric data analysis. Proceedings of the National Academy of Sciences. 106 (21), 8519-8524 (2009).
  7. Ge, Y., Sealfon, S. C. flowPeaks: a fast unsupervised clustering for flow cytometry data via K-means and density peak finding. Bioinformatics. 28 (15), 2052-2058 (2012).
  8. Venkatesh, V. Determinants of perceived ease of use: Integrating control, intrinsic motivation, and emotion into the technology acceptance model. Information systems research. 11 (4), 342-365 (2000).
  9. Bagwell, C. B., Adams, E. G. Fluorescence spectral overlap compensation for any number of flow cytometry parameters. Annals of the New York Academy of Sciences. 677 (1), 167-184 (1993).
  10. Lavin, Y., et al. Innate immune landscape in early lung adenocarcinoma by paired single-cell analyses. Cell. 169 (4), 750-765 (2017).
  11. Chevrier, S., et al. An immune atlas of clear cell renal cell carcinoma. Cell. 169 (4), 736-749 (2017).
  12. Hartigan, J. A., Wong, M. A. Algorithm AS 136: A k-means clustering algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics). 28 (1), 100-108 (1979).
  13. Ester, M., Kriegel, H. P., Sander, J., Xu, X. Density-based spatial clustering of applications with noise. International Conference Knowledge Discovery and Data Mining. 240, (1996).
  14. Levine, J. H., et al. Data-driven phenotypic dissection of AML reveals progenitor-like cells that correlate with prognosis. Cell. 162 (1), 184-197 (2015).
  15. Blondel, V. D., Guillaume, J. L., Lambiotte, R., Lefebvre, E. Fast unfolding of communities in large networks. Journal of statistical mechanics: theory and experiment. 2008 (10), P10008(2008).
  16. Le Martelot, E., Hankin, C. Fast multi-scale detection of relevant communities in large-scale networks. The Computer Journal. 56 (9), 1136-1150 (2013).
  17. Newman, M. E. Fast algorithm for detecting community structure in networks. Physical review E. 69 (6), 066133(2004).
  18. Hespanha, J. P. An efficient matlab algorithm for graph partitioning. , University of California. 1-8 (2004).
  19. Moon, T. K. The expectation-maximization algorithm. IEEE Signal processing. 13 (6), 47-60 (1996).
  20. Bishop, C. M. Pattern recognition and machine learning. , Springer. (2006).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

t SNE

相关文章