$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El repertorio de paquetes de código abierto diseñado para analizar conjuntos de datos scRNA-Seq ha disparado40 con la mayoría de estos uso de paquetes de lenguajes basados en R3. Aquí, se presentan resultados representativos usando dos de estos paquetes: evaluar agrupamiento no supervisado de basado en la expresión génica de células y ordenar a las células a lo largo de una trayectoria para resolver heterogeneidad de células y deconstruir biológico procesos.
Figura 4 ilustra el uso de Seurat para el procesamiento de los controles de calidad y análisis bioinformáticos posteriores. En primer lugar, filtración y eliminación de las células desviadas del análisis es esencial para el control de calidad. Esto se hizo utilizando la violín (figura 4a) y la dispersión de parcelas (Figura 4b) para visualizar el porcentaje de genes mitocondriales, número de genes (nGene) y número de UMI (nUMI) para identificar los dobletes de la célula y afloramientos. Cualquier célula con un número claro aislados de genes, UMI o el porcentaje de genes mitocondriales fue quitada usando la función FilterCells de Seurat. Puesto que Seurat utiliza componentes principales (PC) resultados de análisis a racimos de células, determinar estadísticamente significativa PC incluir es un paso crítico. Parcelas de codo (figura 4 c) fueron utilizados para la selección de PC, en que PC más allá de la meseta de la desviación estándar de la PC, eje se excluyeron. La resolución de la agrupación también fue manipulada demostrando que puede cambiarse el número de racimos, que van desde 0.4 (baja resolución a menos racimos de célula, figura 4 d) a 4 (de alta resolución a racimos de célula mayor, Figura 4e ). En baja resolución, es probable que cada grupo representa un tipo de celda definida, mientras que en alta resolución esto puede representar también subtipos o Estados transicionales de una población celular. En este caso, se utilizaba cluster baja resolución configuración para el análisis adicional de expresión heatmaps (usando la función DoHeatmap de Seurat) para identificar los genes más altamente expresados en un conjunto dado (figura 4f). En este caso, los genes más altamente expresados fueron identificados mediante la evaluación de expresión diferencial en un clúster determinado frente a todos los demás grupos combinados, demostrando que cada cluster estuvo representada únicamente por genes definidos. Además, se pueden visualizar genes candidatos individuales en parcelas de tSNE función de FeaturePlot de Seurat (figura 4 g). Esto permitió descifrar si hubo grupos que representan a los macrófagos. Usando el FeaturePlot, encontramos que ambos cluster 2 y 4 se expresan Cd68 - un marcador de pan-macrófago.
El paquete de monóculo se utilizó para corroborar racimos de célula identificados en Seurat y para la construcción de trayectorias de la célula, u ordenar pseudotemporal, recapitular procesos biológicos (figura 5). Ordenar pseudotemporal puede utilizarse para muestras donde perfiles de expresión unicelular se esperan que siga un curso de tiempo biológico. Las células pueden ordenarse a lo largo de un continuum pseudotemporal para resolver Estados intermedios, puntos de bifurcación de dos destinos alternativos de la célula e identifican firmas de genes subyacentes de adquisición de cada destino. En primer lugar, similar a la filtración de Seurat, células de mala calidad se retiraron tal que la distribución de mRNA a través de todas las células fue la log normal y cayó entre los límites superiores e inferiores identificadas en la figura 5a. Luego, mediante de monóculo newCellTypeHierarchy, las células fueron clasificadas y contaron utilizando genes marcadores de linaje conocido (figura 5b, 5C). Por ejemplo, las células alfa del receptor PDGF o fibroblastos específicos proteína 1 fueron asignadas a células tipo #1 para crear un criterio para la definición de fibroblastos. A continuación, esta población (célula tipo #1) se evaluó para descifrar trayectorias del fibroblasto. Para ello, se utilizó función diferencial de GeneTest de monóculo, que en comparación con las células que representan los Estados extremos dentro de la población y encontrar genes diferencial para ordenar las celdas restantes de la población (figura 5 d). Mediante la aplicación de métodos de aprendizaje múltiple (un tipo de reducción no lineal de la dimensionalidad) a través de todas las células, fue asignada una coordenada a lo largo de un camino pseudotemporal. Esta trayectoria se visualizó entonces por estado de la célula (figura 5e) y pseudotime (figura 5f).

Figura 1: Diagrama de flujo. Pasos de la preparación de todo animal a analizar solo células RNA-Seq datasets a presentar final conjuntos de datos en un repositorio público. Perlas de gel en emulsión (GEMs) se refieren a cuentas con oligonucleótidos con código de barras que encapsulan miles de células individuales. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: creación de suspensión unicelular viable del tejido nervioso. (a) Resumen de controles de calidad de la historieta. (b) células y desechos con las células todavía incorporan en escombros (flechas rojas). (c) células de escombros (flechas rojas). (d) célula de aislamiento por FACS. P0: fracción de escombros; P1: célula-como fracción; P3: exclusión de duplas; P4: fracción negativa de viabilidad tinte (Sytox Orange). (e) ningún control de tinte de viabilidad. (f) imagen de P0 fracción que representan restos aislados. (g) imagen de P4 fracción representar aislado células viables (flechas rojas). (b) .co (f) y (g) tenía tinte nuclear agrega 20 minutos antes de la proyección de imagen. Barras de escala: 80 μm. haga clic aquí para ver una versión más grande de esta figura.

Figura 3: secuenciación superficial predice el número de células recuperadas en 10 X muestras procesadas. un ejemplo (muestra 1.6) de csv generado MiSeq lista de códigos de barras de la célula y su correspondiente UMI cuenta según lecturas asignadas con confianza. (b) código de barras fila para 1.6 muestra muestra una gota significativa en el conteo de la UMI en función de códigos de barras de la célula. Las líneas sólidas y punteadas representan el límite entre las células y fondo según lo determinado por inspección visual. (c) códigos de barras célula observan usando el Cell Ranger tubería post-HiSeq revela secuencia superficial con precisión aproximada el número de células por ejemplo 1.6. (d) un ejemplo de una configuración de celda de flujo basado en la secuencia baja deriva las estimaciones de la célula. Para muestra 1.6, desde secuencias someras predijeron 3480 células, 1,17 carriles fueron asignados para garantizar > 100.000 lecturas por cobertura de la secuencia de células en HiSeq. Nota: Todos los carriles se deben agregar a 100%. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: control de calidad y bioinformática de unicelular RNA-Seq dataset mediante paquete Seurat R. (a) parcelas de métricas de control de calidad que incluyen el número de genes, número de identificadores únicos de moleculares (UMIs) y el porcentaje de las transcripciones con el genoma mitocondrial. (b) gen muestra parcelas detectar células con niveles desviadas de las transcripciones mitochondrial y UMIs. (c) parcela de codo de la muestra utilizado para la determinación especial de PC estadísticamente significativa. Las líneas discontinuas y discontinua de punto representan el límite donde un "codo" de claro se hace evidente en el gráfico. Dimensiones del PC antes de este codo se incluyen en análisis posteriores. (d, e) Racimos de célula basada en gráfico visualizados en dos resoluciones diferentes en un espacio de baja dimensión con una parcela de tSNE. (f) mejores genes marcadores (amarillos) para cada cluster visualizados en un mapa de calor de expresión usando la función DoHeatmap de Seurat. g visualizar la expresión de marcadores de, por ejemplo, Cd68 gen representando macrófagos (morados) con función de FeaturePlot de Seurat. Esto sugiere que cluster 2 y 4 (panel d) de este conjunto de datos representa los macrófagos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: célula de categorización y ordenamiento a lo largo de la trayectoria de peudotemporal usan monóculo herramientas. (a) inspeccionar la distribución de mRNA (deducido de la cuenta UMI) a través de todas las células en una muestra. Sólo las células con el mRNA entre 0 - ~ 20.000 fueron utilizados para el análisis de aguas abajo. (b, c) Asignar y contando los tipos de la célula basados en marcadores de la célula de linaje conocido. Por ejemplo, las células alfa del receptor PDGF o fibroblastos específicos proteína 1 fueron asignadas a células tipo #1 que representan fibroblastos de pan usando la función newCellTypeHierarchy de monóculo. Número de diferentes tipos de células se puede visualizar como un gráfico de sectores (b) y como una tabla (c). (d) con célula tipo #1 (fibroblastos), por ejemplo, los genes utilizados para ordenar las células pueden ser visualizadas usando un terreno de dispersión que demuestra el dispersión génica vs expresión media. La curva roja muestra el atajo de genes utilizados para ordenar calculado por el modelo de media varianza usando la función estimateDispersions de monóculo. Genes que cumplen con este atajo se utilizaron para ordenar pseudotime aguas abajo. (e, f) Visualización de trayectorias de la célula en un reducido espacio bidimensional de color "Estado" de la celda (e) y monóculo asignado "Pseudotime" (f). Haga clic aquí para ver una versión más grande de esta figura.