$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il repertorio di pacchetti open source progettato per analizzare DataSet scRNA-Seq è aumentato drammaticamente40 con la maggior parte di questi uso di pacchetti di linguaggi basati su R3. Qui, vengono presentati risultati rappresentativi utilizzando due di questi pacchetti: valutando raggruppamento senza supervisione di basato sull'espressione genica di cellule singole e singole cellule lungo una traiettoria di ordinazione al fine di risolvere delle cellule di eterogeneità e decostruire biologico processi.
La figura 4 illustra l'uso di Seurat per controlli di qualità e l'analisi bioinformatica a valle di pre-elaborazione. In primo luogo, filtrazione e rimozione delle cellule devianti dall'analisi è essenziale per il controllo qualità. Questo è stato fatto utilizzando violino (Figura 4a) e dispersione trame (Figura 4b) per visualizzare la percentuale di geni mitocondriali, numero di geni (cuore) e numero di UMI (nUMI) per identificare la cella doppietti e outlier. Ogni cella con un numero di chiaro valore erratico dei geni, UMI o percentuale di geni mitocondriali è stato rimosso utilizzando la funzione FilterCells di Seurat. Dal momento che Seurat utilizza componenti principali (PC) gol di analisi alle cellule di cluster, determinare statisticamente significativa pz da includere è un passo fondamentale. Trame di gomito (Figura 4c) sono stati utilizzati per la selezione di PC, in quali PC oltre l'altopiano della 'deviazione standard del PC' asse sono stati esclusi. La risoluzione di clustering è stata maneggiata anche dimostrando che è possibile modificare il numero di cluster, che vanno da 0.4 (bassa risoluzione che conduce a meno mazzi delle cellule, Figura 4D) a 4 (alta risoluzione che porta maggiore mazzi delle cellule, Figura 4e ). A bassa risoluzione, è probabile che ogni cluster rappresenta un tipo di cella definita, mentre ad alta risoluzione questo può rappresentare anche sottotipi o stati transitori di una popolazione delle cellule. In questo caso, le impostazioni del cluster a bassa risoluzione sono state utilizzate per analizzare ulteriormente espressione heatmaps (utilizzando la funzione DoHeatmap di Seurat) per identificare i geni più altamente espressi in un determinato cluster (Figura 4f). In questo caso, sono stati identificati i geni più altamente espressi valutando l'espressione differenziale in un determinato cluster contro tutti gli altri gruppi combinati, dimostrando che ogni cluster è stato rappresentato in modo univoco dai geni definiti. Inoltre, i geni candidati individuali possono essere fruiti su tSNE trame utilizzando la funzione di FeaturePlot di Seurat (Figura 4 g). Questo ha permesso per decifrare se c'erano i cluster che rappresentato i macrofagi. Usando FeaturePlot, abbiamo trovato che entrambi cluster 2 e 4 sono state esprimendo Cd68 - un marcatore pan-macrofago.
Il pacchetto di Monocle è stato utilizzato per corroborare la mazzi delle cellule identificate in Seurat e per la costruzione di traiettorie delle cellule, o ordinare pseudotemporal, ricapitolare i processi biologici (Figura 5). Ordinazione pseudotemporal può essere utilizzato per gli esempi dove i profili di espressione di singole cellule sono tenuti a seguire un corso di tempo biologico. Le cellule possono essere ordinate lungo un continuum pseudotemporal per risolvere stati intermedi, punti di biforcazione di due destini cellulari alternativi e identificano firme di gene alla base di acquisizione di ogni destino. In primo luogo, simile a filtrazione di Seurat, scarsa qualità celle sono state rimosse tali che la distribuzione di mRNA attraverso tutte le cellule è stato registro normale ed è caduto tra i limiti superiore e inferiore come indicato in Figura 5a. Quindi, utilizzando la funzione newCellTypeHierarchy di Monocle, singole cellule sono state classificate e contati usando geni marcatori noti lignaggio (Figura 5b, 5C). Ad esempio, le cellule che esprimono PDGF recettore alfa o del fibroblasto specifico della proteina 1 sono state assegnate a Cell tipo #1 per creare un criterio per la definizione di fibroblasti. Successivamente, questa popolazione (Cell tipo #1) è stata valutata per decifrare le traiettorie del fibroblasto. Per effettuare questa operazione, è stata utilizzata la funzione GeneTest differenziale di Monocle, che rispetto le cellule che rappresentano gli stati estremi all'interno della popolazione e trovati geni differenziale per ordinare le celle rimanenti nella popolazione (Figura 5 d). Applicando i metodi di apprendimento collettore (un tipo di riduzione della dimensionalità non lineare) su tutte le celle, è stata assegnata una coordinata lungo un percorso di pseudotemporal. Questa traiettoria quindi è stata visualizzata da stato della cellula (Figura 5e) e pseudotime (Figura 5f).

Figura 1: diagramma di flusso. Passi dall'animale intero preparazione all'analisi di singole cellule RNA-Seq DataSet alla presentazione finale di set di dati in un repository pubblicamente disponibile. Perline di gel in emulsione (gemme) riferiscono a perline con oligonucleotidi con codice a barre che racchiudono migliaia di singole cellule. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 2: creazione di sospensione unicellulare praticabile da tessuto nervoso. (a) del fumetto Panoramica dei controlli di qualità. (b) cellule e detriti con cellule ancora incorporato in detriti (frecce rosse). (c) cellule rilasciate da detriti (frecce rosse). (d) isolamento delle cellule di FACS. P0: frazione detriti; P1: cellula-come frazione; P3: esclusione di Duine; P4: frazione negativo colorante (Sytox Orange) di attuabilità. (e) nessun controllo di tintura di attuabilità. (f) immagine di P0 frazione rappresentare isolato detriti. (g) immagine di P4 frazione rappresentare isolato cellule vitali (frecce rosse). (b) (c) (f) e (g) aveva nucleare colorante aggiunto 20 minuti prima di formazione immagine. Barre della scala: 80 µm. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 3: sequenziamento superficiale predice il numero delle cellule recuperate in campioni trattati: 10x. (a) un esempio (esempio 1.6) di csv generati MiSeq Inserzione cellulare i codici a barre e suo corrispondente UMI conta come determinato da letture con fiducia mappate. (b) codice a barre trama rango per esempio 1.6 Mostra un calo significativo nel conteggio UMI in funzione del cellulare i codici a barre. Le linee tratteggiate e solide rappresentano il cut-off tra cellule e sfondo come determinato mediante ispezione visiva. (c) codici a barre delle cellule osservate utilizzando la cella Ranger pipeline post-HiSeq rivela superficiale sequenziamento approssimata con precisione il numero di cellule per esempio 1.6. (d) un esempio di un set-up di cella di flusso basato sul sequenziamento poco profonda derivate stime delle cellule. Per esempio 1.6, poiché poco profonda sequenziamento predetto 3480 cellule, 1,17 corsie sono state assegnate per garantire > 100.000 letture per copertura di sequenziamento di cella in HiSeq. Nota: Tutte le corsie devono aggiungere al 100%. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 4: controllo di qualità e bioinformatica di singola cellula RNA-Seq dataset utilizzando pacchetto Seurat R. (un) trame di metriche di controllo di qualità che includono il numero di geni, numero di identificatori univoci molecolari (UNMIS) e la percentuale di trascrizioni mappatura al genoma mitocondriale. (b) gene campione tracciate individuare celle con livelli deviante di trascrizioni mitocondriali e UNMIS. (c) trama di gomito campione utilizzato per la determinazione ad hoc di PC statisticamente significativa. Le linee tratteggiate e dot-tratteggiata rappresentano il taglio dove un chiaro "gomito" diventa evidente nel grafico. Dimensioni PC prima questo gomito sono inclusi nell'analisi a valle. (d, e) Aggregati di cellule basato su grafico visualizzati in due diverse risoluzioni in uno spazio basso-dimensionale utilizzando una trama tSNE. (f) top geni marcatori (gialli) per ogni cluster visualizzati su un'espressione heatmap utilizzando la funzione DoHeatmap di Seurat. (g) visualizzazione dell'espressione dei marker di, ad esempio, Cd68 gene che rappresenta i macrofagi (viola) utilizzando la funzione FeaturePlot di Seurat. Ciò suggerisce che quel cluster 2 e 4 (in pannello d) di questo dataset rappresenta i macrofagi. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 5: cellulare categorizzazione e ordinazione lungo la traiettoria di peudotemporal utilizzando il toolkit di Monocle. (a) controllare la distribuzione di mRNA (derivata dal conteggi UMI) su tutte le celle in un campione. Solo le celle con mRNA tra 0 - ~ 20.000 sono stati usati per l'analisi a valle. (b, c) Assegnazione e contando tipi cellulari basati su indicatori delle cellule lignaggio noto. Ad esempio, le cellule che esprimono PDGF recettore alfa o del fibroblasto specifico della proteina 1 erano assegnate a Cell tipo #1 che rappresentano pan-fibroblasti utilizzando la funzione newCellTypeHierarchy di Monocle. Numero di diversi tipi di cellule possa essere visualizzato come un grafico a torta (b) e come una tabella (c). (d) mediante cella tipo n. 1 (fibroblasti) ad esempio, i geni per ordinare le celle possono essere visualizzate utilizzando un grafico a dispersione che illustra la dispersione del gene vs espressione media. La curva rossa mostra il taglio per geni utilizzati per l'ordinamento calcolato dal modello media-varianza mediante la funzione estimateDispersions di Monocle. Geni che soddisfano questa frequenza di taglio sono stati utilizzati per l'ordinazione pseudotime a valle. (e, f) Visualizzazione delle traiettorie di cella in un ridotto spazio bidimensionale colorata della cella "stato" (e) e di Monocle-assegnato "Pseudotime" (f). Clicca qui per visualizzare una versione più grande di questa figura.