$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O repertório de pacotes de código aberto projetado para analisar conjuntos de dados scRNA-Seq aumentou dramaticamente a40 , com a maioria de uso esses pacotes de idiomas baseados em R3. Aqui, apresentam-se resultados representativos usando dois desses pacotes: avaliar agrupamento sem supervisão de único baseadas na expressão gênica de células e ordenação de células únicas ao longo de uma trajetória para resolver heterogeneidade de célula e desconstruir biológico processos.
A Figura 4 ilustra o uso de Seurat para pré-processamento de controlos de qualidade e análise de Bioinformática a jusante. Primeiro, filtragem e remoção de células desviantes de análise é essencial para o controlo de qualidade. Isto foi feito usar o violino (figura 4a) e dispersão parcelas (figura 4b) para visualizar a porcentagem de genes mitocondriais e número de genes (nGene) número de UMI (nUMI) para identificar parelhas de célula e exceções. Qualquer célula com um número de outlier clara de genes, UMI ou a porcentagem de genes mitocondriais foi removida usando a função FilterCells de Seurat. Desde que Seurat usa o componente principal (PC) resultados de análise de aglomerados de células, determinando estatisticamente significativas PCs para incluir é uma etapa crítica. Parcelas de cotovelo (Figura 4C) foram usadas para a seleção de PC, no quais PCs além do planalto do 'desvio padrão de PC' eixo foram excluídos. A resolução de cluster foi manipulada também demonstrando que o número de clusters pode ser alterado, variando de 0,4 (baixa resolução, levando a menos aglomerados de células, Figura 4D) a 4 (resolução alta, levando a maiores aglomerados de células, Figura 4e ). Em baixa resolução, é provável que cada cluster representa um tipo de célula definida, Considerando que, em alta resolução isso também pode representar subtipos ou Estados de transição de uma população celular. Nesta instância, configurações de baixa resolução cluster foram utilizadas para analisar mais expressão heatmaps (usando a função DoHeatmap de Seurat) para identificar os genes mais altamente expressos em um determinado cluster (Figura 4f). Neste caso, os mais altamente expressos genes foram identificados através da avaliação de expressão diferencial em um determinado cluster contra todos os outros grupos combinados, demonstrando que cada cluster foi exclusivamente representada por genes definidos. Além disso, genes candidatos individuais podem ser visualizados nas parcelas de tSNE usando a função FeaturePlot de Seurat (Figura 4 g). Isto permitiu decifrar se houve clusters que representou os macrófagos. Usando FeaturePlot, descobrimos que ambos cluster 2 e 4 foram expressando Cd68 - um marcador de pan-macrófago.
O pacote de monóculo foi usado para corroborando aglomerados de células identificados em Seurat e para a construção de trajetórias de célula, ou encomendar pseudotemporal, recapitular os processos biológicos (Figura 5). Ordenação pseudotemporal pode ser usado para amostras onde perfis de expressão de célula única são esperados para seguir um curso de tempo biológico. Células podem ser encomendadas ao longo de um continuum pseudotemporal para resolver Estados intermediários, pontos de bifurcação de dois destinos alternativos da célula e identificam as assinaturas de gene subjacente a aquisição de cada destino. Em primeiro lugar, semelhante à filtragem de Seurat, células de má qualidade foram removidas de tal forma que a distribuição do mRNA através de todas as células foi log normal e caiu entre os limites superiores e inferiores, conforme identificado na Figura 5a. Em seguida, usando a função de newCellTypeHierarchy do monóculo, células únicas foram classificadas e contados usando genes marcadores de linhagem conhecida (Figura 5b, 5C). Por exemplo, células expressando PDGF receptor alfa ou fibroblasto específico da proteína 1 foram atribuídas a célula tipo #1 para criar um critério para a definição de fibroblastos. Em seguida, esta população (célula tipo #1) foi avaliada para decifrar as trajetórias de fibroblasto. Para fazer isso, a função de GeneTest diferencial do monóculo foi utilizada, que comparou as células que representam os Estados extremos no seio da população e encontrado genes diferenciais para ordenar as células restantes na população (Figura 5D). Através da aplicação de métodos de aprendizagem múltipla (um tipo de redução de dimensionalidade não-linear) em todas as células, foi atribuída uma coordenada ao longo do caminho pseudotemporal. Esta trajetória foi depois visualizada pelo estado da célula (Figura 5e) e pseudotime (Figura 5f).

Figura 1: fluxograma. Etapas de preparação todo animal para analisar uma única célula RNA-Seq datasets para apresentação de conjuntos de dados finais para um repositório disponível publicamente. Grânulos do gel em emulsão (gemas) consulte contas com código de barras oligonucleotides que encapsulam milhares de células únicas. Clique aqui para ver uma versão maior desta figura.

Figura 2: criando suspensão viável única célula do tecido nervoso. (a) desenho animado visão geral dos controlos do controlo de qualidade. (b) células e restos com células ainda incorporados em escombros (setas vermelhas). (c) células lançadas de detritos (setas vermelhas). (d) célula isolamento pela FACS. P0: fração de detritos; P1: célula-como fração; P3: exclusão de duplets; P4: negativo fração viabilidade tintura (Sytox Orange). (e) não há controle de tintura de viabilidade. (f) a imagem da fração P0 representando fragmentos isolados. (g) imagem da fração de P4, que representa células viáveis isoladas (setas vermelhas). (b) (c) (f) e (g) tinha corante nuclear adicionado 20 minutos antes de imagem. Barras de escala: 80 µm. clique aqui para ver uma versão maior desta figura.

Figura 3: sequenciamento superficial prevê o número de células recuperadas em 10 X de amostras processadas. um exemplo (1.6 de amostra) de csv gerado pelo MiSeq listando célula códigos de barras e sua correspondente UMI conta conforme determinado pela leituras confiàvel mapeadas. (b) enredo de classificação do código de barras para amostra 1.6 mostra uma significativa queda na contagem UMI em função de códigos de barras do celular. As linhas tracejadas e sólidas representam o corte entre as células e fundo, conforme determinado pela inspeção visual. (c) códigos de barras célula observaram usando a célula Ranger gasoduto post-HiSeq revela raso sequenciamento aproximados com precisão o número de células por exemplo 1.6. (d) um exemplo de uma configuração de célula de fluxo baseado no sequenciamento superficial derivada estimativas de célula. Por exemplo 1.6, desde sequenciamento superficial previu 3480 células, 1,17 pistas foram designadas para assegurar > 100.000 leituras por cobertura de sequenciamento de celular em HiSeq. Nota: Todas as faixas devem adicionar a 100%. Clique aqui para ver uma versão maior desta figura.

Figura 4: controle de qualidade e bioinformática de célula única RNA-Seq dataset usando o pacote de Seurat R. (a) parcelas de métricas de controle de qualidade que incluem o número de genes, o número de identificadores exclusivos moleculares (UMIs) e a porcentagem de transcrições de mapeamento de genoma mitocondrial. (b) gene amostra parcelas detectar células com níveis desviantes de transcrições mitocondriais e UMIs. (c) enredo de cotovelo amostra utilizado para determinação de ad hoc dos PCs estatisticamente significativas. As linhas tracejadas e ponto-tracejado representam o corte onde um claro "cotovelo" torna-se evidente no gráfico. Dimensões do PC antes esse cotovelo são incluídos na análise a jusante. (d, e) Aglomerados de células gráfico baseado visualizados em duas resoluções diferentes em um baixo-dimensional espaço usando um enredo tSNE. (f) superior genes marcadores (amarelos) para cada cluster visualizados em uma expressão heatmap usando a função DoHeatmap de Seurat. (g) visualizando a expressão do marcador de, por exemplo, Cd68 gene representando os macrófagos (roxos) usando a função FeaturePlot de Seurat. Isto sugere que o cluster 2 e 4 (no painel d) deste dataset representa os macrófagos. Clique aqui para ver uma versão maior desta figura.

Figura 5: categorização e ordenando ao longo da trajetória de peudotemporal usando o toolkit de monóculo celular. (a) fiscalizar a distribuição de mRNA (inferido UMI contagens) em todas as células em uma amostra. Somente as células com mRNA entre 0 - ~ 20.000 foram utilizados para análise a jusante. (b, c) Atribuindo e contando os tipos de células com base em marcadores de células de linhagem conhecida. Por exemplo, células expressando PDGF receptor alfa ou fibroblasto específico da proteína 1 foram atribuídas a célula tipo #1 representando panfibroblastos usando a função de newCellTypeHierarchy do monóculo. Número de diferentes tipos de células pode ser visualizado como um gráfico de pizza (b) e como uma tabela (c). (d) usando a célula tipo #1 (fibroblastos), por exemplo, os genes usados para ordenar as células podem ser visualizadas usando um gráfico de dispersão que demonstra a dispersão de gene vs expressão significa. A curva vermelha mostra o corte para genes usados para requisitar calculado pelo modelo de média-variância usando a função de estimateDispersions do monóculo. Genes que atendam este corte foram usados para requisitar pseudotime a jusante. (e, f) Visualização trajectórias de célula em um espaço reduzido bidimensional colorido por "Estado" do célula (e) e pelo monóculo atribuído "Pseudotime" (f). Clique aqui para ver uma versão maior desta figura.