Acquisizione dal database TCGA
I dati di sequenziamento dell'RNA e le informazioni cliniche per il gruppo di carcinoma mammario invasivo del TCGA (TCGA-BRCA) sono stati ottenuti dal portale Genomic Data Commons14. I dati RNA-seq del flusso di lavoro STAR nel formato di trascritti per milione (TPM) sono stati estratti insieme alle annotazioni cliniche corrispondenti. Sono stati esclusi i campioni di RNA-seq privi di informazioni cliniche associate. Per le analisi basate sull'espressione, i valori TPM sono stati trasformati come log2(TPM + 1). L'espressione di MPO è stata estratta utilizzando il simbolo genico MPO e l'ID genico Ensembl ENSG00000005381.8. Per le analisi che richiedevano il raggruppamento in MPO-alto e MPO-basso, sono stati inclusi solo i campioni tumorali TCGA-BRCA, mentre i campioni normali adiacenti sono stati esclusi dall'assegnazione al gruppo. I campioni tumorali sono stati suddivisi in base al valore mediano dell'espressione di MPO, trasformata in log2(TPM + 1), tra i campioni tumorali TCGA-BRCA. I campioni con espressione di MPO maggiore o uguale alla mediana sono stati assegnati al gruppo MPO-alto, mentre i campioni al di sotto della mediana sono stati assegnati al gruppo MPO-basso. Questa strategia di raggruppamento basata sulla mediana è stata utilizzata per l'analisi della sopravvivenza, l'analisi dell'espressione differenziale, l'analisi di arricchimento, il raggruppamento per metilazione e i confronti di arricchimento delle cellule immunitarie, salvo diversa indicazione. Le caratteristiche clinico-patologiche, compresi sesso, età, etnia, stadio patologico T, grado istologico, sottotipo PAM50, stadio patologico, stato del tumore e endpoint di sopravvivenza, inclusa la sopravvivenza globale (OS), l'intervallo libero da progressione (PFI) e la sopravvivenza specifica per malattia (DSS), sono state analizzate utilizzando R versione 4.2.1.
Ricerca di immagini pubbliche di immunoeistochemia
Immagini rappresentative di immunoeistochemia (IHC) per MPO di tessuto mammario normale adiacente e di tessuto di cancro al seno sono state utilizzate come riferimenti qualitativi a livello proteico. Queste immagini non sono state incluse in analisi morfometriche quantitative o in analisi statistiche. Le aree racchiuse in box indicano le regioni mostrate a ingrandimento maggiore. Le barre della scala indicano 100 µm nelle immagini a 20× e 50 µm nelle immagini a 40×.
Analisi della correlazione di espressione
Il set di dati TCGA-BRCA è stato utilizzato per esaminare i geni che variano concomitantemente all'espressione di MPO nel cancro al seno. Sono stati calcolati i coefficienti di correlazione di Pearson a livello genoma intero tra MPO e i geni codificanti proteine, e sono stati selezionati i 30 geni con correlazione positiva più elevata e i 30 geni con correlazione negativa più elevata per la visualizzazione. Per le analisi di correlazione che coinvolgono multipli geni testati, i valori p nominali sono stati corretti utilizzando il metodo Benjamini-Hochberg per il tasso di scoperta di falsi positivi. La rete di interazione proteina-proteina (PPI) associata a MPO è stata costruita utilizzando il database STRUMENTO DI RICERCA PER IL RECUPERO DI GENI/PROTEINE INTERAGENTI (STRING), mantenendo le coppie di proteine con punteggi di interazione superiori a 0,40 per la visualizzazione15.
Analisi di arricchimento funzionale
I geni differenzialmente espressi (DEG) sono stati identificati confrontando i gruppi tumorali MPO-alto e MPO-basso di TCGA-BRCA utilizzando soglie di |log2FC| > 1 e un valore p aggiustato con il metodo di Benjamini-Hochberg < 0,05. L'analisi di arricchimento funzionale dei DEG è stata eseguita utilizzando il pacchetto R clusterProfiler versione 4.4.4, comprendente analisi dei processi biologici, componenti cellulari e funzioni molecolari dell'ontologia genica (GO), nonché analisi dei percorsi dell'Enciclopedia di Kyoto dei geni e dei genomi (KEGG)16,17,18,19,20. I termini GO e KEGG risultati arricchiti sono stati considerati significativi quando il valore p aggiustato era < 0,05.
È stata eseguita un'analisi di arricchimento di set di geni (GSEA) utilizzando un elenco di geni preordinati basato su statistiche di espressione differenziale tra i gruppi MPO-alto e MPO-basso. È stata utilizzata la raccolta di percorsi canonici C2 di MSigDB c2.cp.all.v2022.1.Hs.symbols.gmt, corrispondente a MSigDB v2022.1.Hs e contenente 3.050 set di geni21,22. I termini arricchiti sono stati considerati significativi in base al valore p aggiustato con il metodo di Benjamini–Hochberg < 0,05, valore q FDR < 0,25 e |punteggio di arricchimento normalizzato| > 1. Ove applicabile, i punteggi Z per i termini significativamente arricchiti sono stati calcolati utilizzando il pacchetto GOplot per la visualizzazione.
Analisi dell'arricchimento di cellule immunitarie nei tumori
I componenti immunitari e stromali nella coorte TCGA-BRCA sono stati valutati utilizzando l'algoritmo ESTIMATE implementato nel pacchetto R estimate versione 1.0.13. Sono stati utilizzati come input dati di espressione trasformati in log2(TPM + 1) e sono stati calcolati, per ogni campione tumorale, il punteggio immunitario, il punteggio stromale e il punteggio ESTIMATE. TIMER/TIMER2.0 è stato utilizzato per valutare le associazioni tra l'espressione di MPO e i livelli stimati di infiltrazione delle principali popolazioni di cellule immunitarie nella coorte TCGA-BRCA, inclusi linfociti B, linfociti T CD8+, linfociti T CD4+, macrofagi, neutrofili e cellule dendritiche23,24,25. I risultati basati su TIMER sono stati interpretati come stime dell'infiltrazione immunitaria derivate dalla corrispondente risorsa online. Per l'analisi di arricchimento delle cellule immunitarie su 24 tipi di cellule immunitarie, è stata implementata l'analisi di arricchimento dei set genici su singolo campione (ssGSEA) utilizzando il pacchetto R GSVA versione 1.46.026. La matrice delle firme immunitarie LM22 utilizzata per la deconvoluzione basata su CIBERSORT di 22 tipi di cellule immunitarie è riportata in Tabella Supplementare 1. Le correlazioni tra l'espressione di MPO e i punteggi di arricchimento delle cellule immunitarie sono state valutate mediante il coefficiente di correlazione di Spearman. Le differenze nei punteggi di arricchimento delle cellule immunitarie tra i gruppi tumorali con MPO alto e MPO basso, definiti in base alla mediana, sono state confrontate utilizzando il test della somma dei ranghi di Wilcoxon. Per le analisi che coinvolgono più tipi di cellule immunitarie, i valori p sono stati corretti mediante il metodo Benjamini–Hochberg per il tasso di falsa scoperta.
Metilazione del DNA del gene MPO
I modelli di metilazione del DNA all'interno del locus MPO sono stati valutati utilizzando MethSurv. I valori beta di metilazione dei siti CpG e le associazioni con la sopravvivenza per TCGA-BRCA sono stati ottenuti dalla piattaforma MethSurv. I siti CpG relativi a MPO selezionati sono stati visualizzati e le loro associazioni con gli esiti di sopravvivenza sono state valutate mediante gli output dell'analisi di sopravvivenza forniti da MethSurv27. Per le analisi che coinvolgevano più siti CpG, i valori p sono stati corretti su tutti i siti CpG relativi a MPO testati utilizzando il metodo Benjamini-Hochberg per il tasso di scoperte false. Queste analisi di metilazione sono state interpretate come annotazioni epigenetiche esplorative.
Costruzione della rete PPI e analisi della correlazione dei geni associati ai neutrofili
Per esaminare l'associazione tra MPO e la biologia correlata ai neutrofili, è stata effettuata un'analisi di rete sistematica. Un insieme genico comprendente mediatori accertati dell'attivazione dei neutrofili e dei processi infiammatori associati è stato selezionato dalla letteratura scientifica recente. L'elenco completo dei geni correlati ai neutrofili è riportato nella Tabella Supplementare 2. I simboli genici sono stati uniformati ai simboli ufficiali, sono state rimosse le voci duplicate ed i geni disponibili sono stati incrociati con la matrice di espressione TCGA-BRCA prima dell'analisi STRING/PPI, della priorizzazione dei geni hub e dell'analisi di correlazione tra MPO e geni hub. La rete di interazioni proteina-proteina (PPI) tra questi geni è stata costruita utilizzando il database STRING (versione 11.5) con una soglia media di punteggio di interazione (>0.40). I geni hub all'interno di questa rete sono stati prioritizzati in modo algoritmico in base alla centralità di grado, che quantifica il numero di interazioni dirette per ogni nodo. I primi 20 geni con i punteggi di grado più elevati sono stati selezionati per l'analisi di correlazione successiva.
Successivamente, i profili di espressione di questi geni hub e della MPO sono stati estratti dal dataset trascrittomico TCGA-BRCA. L'associazione tra la MPO e ciascun gene hub è stata valutata statisticamente mediante correlazione rank di Spearman. Per caratterizzare i modelli di correlazione tra i geni hub stessi, è stata calcolata una matrice di correlazione di Spearman a coppie su tutti i campioni tumorali. Queste analisi di correlazione hanno fornito la base quantitativa per le visualizzazioni successive, incluse il grafico a lecca-lecca delle correlazioni tra MPO e geni hub e il diagramma a corde/mappa termica che rappresenta i modelli di correlazione tra geni hub.
Predizione di fattori di trascrizione e miRNA a monte che bersagliano MPO
Il database KnockTF (https://bio.liclab.net/KnockTF/index.php)28,29, il database ChIP (http://chip-atlas.org/)30,31 e il database GTRD32,33 (https://gtrd.biouml.org/#!) sono stati utilizzati per prevedere i fattori trascrizionali bersaglio di MPO. Inoltre, il database TargetScan (https://www.targetscan.org/vert_80/) è stato impiegato per prevedere potenziali siti di legame per miRNA che bersagliano MPO. I diagrammi di Venn sono stati generati utilizzando il sito web MicroBioinformatics (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
Analisi a singola cellula di MPO
Il set di dati specifico GSE161529 proviene da Gene Expression Omnibus (GEO). La pre-elaborazione dei dati ha innanzitutto eseguito un filtraggio a livello cellulare per escludere le cellule di bassa qualità—quelle che soddisfano uno dei seguenti criteri: espressione genica mitocondriale superiore al 25%, conteggio totale di identificatori molecolari unici (UMI) inferiore a 5000 o meno di 2500 geni rilevati. Successivamente, sono state corrette la contaminazione da RNA ambientale e le variazioni tecniche dovute ai lotti sperimentali35. È stata eseguita un'analisi delle componenti principali (PCA) per la riduzione della dimensionalità al fine di valutare la similarità cellulare, seguita da UMAP per il raggruppamento e la visualizzazione delle cellule. Quindi, in base ai geni marcatore tipici delle cellule, i diversi cluster sono stati annotati come tipi cellulari11. L'insieme di geni associati a MPO utilizzato per il punteggio di firma a singola cellula è fornito nel File Supplementare 1. Prima del calcolo del punteggio, i simboli genici sono stati armonizzati con i simboli ufficiali, sono state rimosse le voci duplicate e i geni disponibili sono stati incrociati con la matrice di espressione di GSE161529. Sono stati utilizzati AUCell, Seurat AddModuleScore e ssGSEA per calcolare i punteggi associati a MPO per ogni cellula. I punteggi ottenuti dai tre metodi sono stati normalizzati con il punteggio Z, scalati in un intervallo comparabile e integrati per generare un punteggio composito associato a MPO per le analisi descrittive successive. Le reti di interazione tra cellule sono state analizzate per confrontare i modelli di comunicazione ligando-recettore inferiti che coinvolgono cellule tumorali epiteliali stratificate in base al segnale associato a MPO e diversi tipi cellulari partner. Questi risultati sono stati interpretati come modelli descrittivi di comunicazione piuttosto che come prova che le cellule che esprimono MPO mediano direttamente la comunicazione intercellulare.
Knockdown virtuale a singola cellula di MPO e analisi di arricchimento del percorso mediante scTenifoldKnk
Il silenziamento virtuale a livello di singola cellula del gene MPO è stato eseguito integrando Seurat e scTenifoldKnk. Dopo un controllo di qualità standard (200–6.000 geni per cellula; frazione mitocondriale < 10%), i dati sono stati normalizzati mediante logaritmo e sono stati selezionati 2.000 geni altamente variabili per la riduzione della dimensionalità e il clustering. Per arricchire i contesti rilevanti per MPO, sono state mantenute le cellule con punteggi compresi nel 50% superiore per un modulo genico mieloide/neutrofilo. A partire da queste cellule, un sottoinsieme prossimo a MPO è stato definito espandendo a partire da semi positivi per MPO utilizzando k = 40 vicini più prossimi nello spazio PCA. Il sottoinsieme espanso non è stato considerato una popolazione pura di cellule positive per MPO, e nessuna conclusione riguardo alle proporzioni dei tipi cellulari è stata tratta da questo passaggio di espansione KNN. Questo sottoinsieme è stato sottoposto ad analisi di silenziamento virtuale tramite scTenifoldKnk, utilizzando l'unione dei geni altamente variabili e di MPO (espresso in ≥25 cellule) come insieme genico. Sono stati identificati geni significativamente perturbati (FDR < 0,05, corretto con metodo BH). I geni risultanti sono stati ulteriormente analizzati per l'arricchimento funzionale nei processi biologici GO e nei percorsi KEGG (q < 0,05).
Ricerca esplorativa di interazioni farmaco-gene e annotazione ADMET
È stato interrogato DGIdb per ottenere registrazioni preliminari di interazioni farmaco-gene o chimico-gene associate a MPO. Poiché gli elenchi di interazioni derivati da database possono includere voci supportate da tipi eterogenei di evidenze e potrebbero non corrispondere direttamente ad agenti terapeutici clinicamente utilizzabili, i composti recuperati sono stati considerati come annotazioni esplorative piuttosto che come candidati terapeutici prioritari. Successivamente, SwissADME e ADMETlab sono stati utilizzati per riassumere le proprietà fisico-chimiche, farmacocinetiche e tossicologiche previste. Queste annotazioni in silico sono state impiegate per fornire un contesto preliminare all'interpretazione a livello di composto e per evidenziare la necessità di ulteriori analisi farmacologiche, tossicologiche e cliniche prima che possa essere valutata qualsiasi rilevanza terapeutica36.