August 1st, 2025
Qui, presentiamo un flusso di lavoro visivo passo-passo per l'analisi di un set di dati di trascrittomica con andamento temporale a singola cellula della guarigione delle ferite cutanee di topo utilizzando R. Il protocollo include una pipeline standard per il download di set di dati, il controllo qualità, le visualizzazioni e le annotazioni del tipo di cella utilizzando Seurat e l'analisi dell'interazione cellula-cellula utilizzando CellChat.
Nel nostro laboratorio, utilizziamo strumenti emergenti come la trascrittomica a singola cellula e spaziale con approcci di biologia dei sistemi e bioinformatica per studiare le dinamiche cellulari spazio-temporali degli esiti di guarigione differenziale. Negli ultimi anni, abbiamo assistito a una rapida adozione della trascrittomica a singola cellula per lo studio della guarigione delle ferite nell'uomo e negli organismi modello, come i topi. L'analisi completa di set di dati a singola cellula è proibitiva per gli scienziati di laboratorio con poca o nessuna esperienza di bioinformatica. Ciò significa che troppo spesso i set di dati a singola cellula sono sottoutilizzati dagli scienziati nel campo della guarigione delle ferite. Questo è il primo protocollo completo che presuppone l'assenza di esperienza precedente con la bioinformatica, che accompagna l'utente dal download del set di dati all'output di analisi rilevanti nel contesto della ricerca sulla guarigione delle ferite. Il nostro protocollo dovrebbe fungere da modello per i ricercatori di guarigione delle ferite per analizzare in modo più completo i propri set di dati a singola cellula ed essere in grado di estrarre nuove intuizioni da set di dati disponibili pubblicamente.
[Shalyn] Per iniziare, passare ai file del set di dati dal repository omnibus dell'espressione genica utilizzando il numero di accesso GSE204777. Fare clic sul primo set di dati intitolato GSM6190913. Scorri fino alla fine della pagina GSM6190913 e scarica i tre file elencati utilizzando i collegamenti FTP o HTML. Utilizzando Esplora file del computer, spostare i file scaricati in una directory denominata b1, assicurandosi che si trovi all'interno della directory di lavoro. Recupera le informazioni sul percorso della directory per i file di sequenziazione a cella singola che sono stati scaricati. Ora, carica i file di sequenziamento a cella singola nell'ambiente di lavoro. Quindi, separare l'espressione genica e il multiplexing dei dati HTO dal set di dati di lavoro. Crea un oggetto Seurat utilizzando i dati di espressione genica filtrando i geni rilevati in meno di cinque cellule e le cellule con meno di 200 geni. Per i set di dati privi di dati HTO, creare l'oggetto Seurat con gli stessi parametri di filtraggio e passare al test di espressione genica. Calcola la percentuale di gene mitocondriale in ciascuna cellula e assegna questo valore come variabile di metadati. Visualizza la distribuzione della conta genica, dell'RNA totale e della percentuale di geni mitocondriali in tutte le cellule. Rimuovere le cellule con contenuto mitocondriale superiore al 25% utilizzando una soglia e visualizzare le distribuzioni aggiornate dopo aver filtrato queste cellule di bassa qualità. Rileva probabili doppietti utilizzando il metodo di ricerca del doppietto SC. Esegui la pipeline di ricerca del doppietto SC utilizzando i comandi e assegna i punteggi del doppietto risultanti come nuova variabile di metadati. Ora, visualizza la distribuzione dei punteggi del doppietto in tutte le cellule. Rimuovi tutte le celle con punteggi di doppietta superiori a 0,25 e salva l'oggetto Seurat pulito come file RDS nella directory di lavoro. Esegui la normalizzazione dei dati, il ridimensionamento e l'analisi dei componenti principali. Visualizza il contributo della varianza tra i primi 50 componenti principali. Raggruppa le celle utilizzando i primi 13 componenti principali e una risoluzione di clustering di 0,1. Eseguire l'approssimazione e la proiezione uniformi delle varietà, o riduzione UMAP nell'analisi dei vicini, utilizzando i primi 13 componenti principali e impostare il numero di inizializzazione su 123. A questo punto, è possibile visualizzare il clustering delle celle su un grafico IMAP, seguito dalle annotazioni relative al tempo e allo spazio delle avvolte su un grafico IMAP. Quindi, generare una tabella che associ i cluster di celle alle annotazioni relative al tempo e allo spazio delle ferite. Determinare le principali identità dei tipi di cellule dopo aver calcolato i geni espressi in modo differenziale tra tutti i cluster e assegnare gli elenchi DEG risultanti a una variabile prima di salvarli come file di testo delimitato nella directory di lavoro. A questo punto, aprire il file dei marcatori del cluster di set di dati in un'applicazione per fogli di calcolo. Utilizzare l'Importazione guidata testo per impostare la virgola come delimitatore e formattare le colonne dei nomi dei geni come testo per impedire la conversione automatica dei nomi dei geni in date. In un foglio di calcolo, classificare la colonna FC media del log due dalla più grande alla più piccola per ordinare le righe diminuendo i valori di modifica del log di due volte, seguita dalla colonna del cluster dal più piccolo al più grande. Per ordinare le righe aumentando i numeri dei cluster Seurat, filtrare la colonna FC media del log due in modo da includere solo i valori maggiori o uguali a 2,5, quindi filtrare la colonna PCT 1 in modo da includere i valori maggiori o uguali a 0,4. Quindi, filtrare la colonna PCT 2 per includere valori minori o uguali a 0,2. Infine, filtrare la colonna Valore P rettificato per includere valori inferiori o uguali a 0,01. A questo punto, apri lo strumento di analisi dell'arricchimento basato sul Web Enrichr. Per ogni cluster, copiare l'elenco dei geni differenzialmente espressi in una finestra Enrichr separata e fare clic su Analizza. Quindi, fai clic sulla scheda dei tipi di cella sopra l'output dell'analisi e concentrati sui primi cinque arricchimenti all'interno dei tre database di marcatori di cella curati. In base agli arricchimenti principali dell'analisi Enrichr, assegnare le identità probabili agli otto cluster. Combina i cluster due e sei in un'unica annotazione etichettata come fibroblasti e assegna queste annotazioni come una nuova variabile di metadati denominata tipi di cellule. Quindi, visualizza i tipi di cellule annotati su un grafico UMAP e visualizza la localizzazione dei geni marcatori del cluster superiore in grassetto su una serie di grafici IMAP. Visualizza i geni espressi in modo differenziale del marcatore del cluster superiore su un grafico a punti raggruppato per numero di cluster originale, quindi i geni del marcatore superiore di nuovo in un grafico a punti, questa volta raggruppati per tipi di cellule annotati. Per prepararsi all'analisi delle serie temporali, rimuovere l'annotazione spaziale e semplificare il set di dati. Riassegna i metadati del tempo e dello spazio della ferita in una nuova variabile denominata DPW per Days Post Wounding. Visualizza i nuovi raggruppamenti dell'andamento temporale DPW su un grafico UMAP e genera tabelle che mostrano il numero di celle di ciascun tipo all'interno di ciascun gruppo DPW. Successivamente, converti la conta delle cellule in proporzioni per valutare i cambiamenti relativi nella composizione del tipo di cellula durante la guarigione e visualizzare la proporzione di ciascuna categoria DPW all'interno di ciascun tipo di cellula. Infine, visualizza la proporzione di ogni tipo di cella all'interno di ciascun gruppo DPW e salva l'oggetto Seurat finale contenente tutte le annotazioni e i filtri come file RDS nella directory di lavoro. Tutte le celle del set di dati sono raggruppate distintamente nei principali tipi di celle codificate a colori sul grafico IMAP, confermando il successo dell'annotazione basata sulle firme del tipo di cella arricchite. L'alta espressione dei geni marcatori del cluster superiore è stata localizzata all'interno dei rispettivi cluster di tipi cellulari sui grafici UMAP. La visualizzazione con grafico a punti ha confermato che i livelli di espressione più elevati dei geni marcatori a grappolo erano limitati ai loro tipi di cellule principali annotati. Il grafico a barre impilate ha rivelato che i neutrofili e i macrofagi erano dominanti al primo giorno dopo la ferita, mentre i fibroblasti, le cellule epiteliali ed endoteliali sono diventati più prevalenti in punti temporali successivi, riflettendo la nota cascata cellulare di guarigione delle ferite.
Questo articolo presenta un protocollo completo per l'analisi di dataset transcriptomici a corso temporale su singola cellula relativi alla guarigione delle ferite cutanee del topo utilizzando R. Il workflow guida i ricercatori attraverso il download dei dataset, il controllo di qualità, le visualizzazioni e le annotazioni dei tipi di cellule.
Single-cell transcriptomics enables high-resolution mapping of cellular heterogeneity and dynamic cell-cell interactions during tissue repair, directly informing target validation and mechanistic de-risking in regenerative medicine. This protocol operationalizes robust, reproducible workflows for analyzing wound healing datasets, lowering barriers for cross-functional teams to extract actionable insights from complex single-cell data. By standardizing quality control, annotation, and interaction analysis, the workflow enhances predictive confidence and supports risk-adjusted portfolio decisions in early discovery and translational research.
This workflow bridges early discovery, screening, and translational research by enabling standardized single-cell analysis from dataset acquisition to cell-cell interaction mapping.