Il benchmarking basato su passaggi ancorati ha separato gli effetti genici specifici del tessuto da quelli pan-tessutali
La matrice ancorata curata GSE117827 conteneva 27.685 geni approvati da HGNC. Il confronto principale nasale includeva 15 campioni infetti sintomatici e 6 campioni di controllo negativi al virus; il confronto ematico includeva 13 campioni infetti sintomatici e 6 controlli (Tabella 1). Poiché questa piccola coorte non può supportare una scoperta stabile a livello di singolo gene, è stata utilizzata come ancoraggio a compartimenti accoppiati. La stabilità è stata valutata a livello di modulo mediante ricampionamento bootstrap, test nulli con geni casuali, validazione esterna e analisi di sensibilità alla dimensione del modulo.
| Origine | Gruppo | Condizione | Confronto principale | n |
| Sangue | RSV | Infetto | Sì | 4 |
| Sangue | Picornavirus asintomatico | Secondario | No | 5 |
| Sangue | Picornavirus sintomatico | Infetto | Sì | 9 |
| Sangue | Controllo negativo al virus | Controllo | Sì | 6 |
| Nasale | RSV | Infetto | Sì | 6 |
| Nasale | Picornavirus asintomatico | Secondario | No | 5 |
| Nasale | Picornavirus sintomatico | Infetto | Sì | 9 |
| Nasale | Controllo negativo al virus | Controllo | Sì | 6 |
Tabella 1: Progettazione dell'ancora GSE117827 dopo la cura del contrasto primario. Distribuzione dei campioni tra i compartimenti ematici e nasali nel dataset dell'ancora abbinata dopo la cura del contrasto primario. I campioni di virus respiratorio sinciziale (RSV) sintomatici e i campioni di picornavirus sintomatici sono stati classificati come infetti e inclusi nel contrasto primario, mentre i controlli negativi al virus sono stati classificati come controlli e inclusi nel contrasto primario. I campioni di picornavirus asintomatici sono stati designati come secondari ed esclusi dalla costruzione dei moduli; sono stati utilizzati esclusivamente nell'analisi esplorativa del gradiente dei sintomi. Due casi di RSV non disponevano di campioni ematici, risultando in quattro campioni ematici e sei campioni nasali di RSV.
Tra i 27.685 geni condivisi, le stime di Hedges g per naso e sangue erano quasi scorrelate (Pearson r = 0,015; Figura 1). Questo risultato è emerso all'interno di un singolo studio ed è meno influenzato dalle differenze tra studi rispetto a un confronto transversale aggregato tra coorti. La densa nuvola centrale mostra che la maggior parte dei geni non ha mostrato un comportamento simile in entrambi i compartimenti. I geni sovrapposti evidenziati rappresentano eccezioni poste in cima a entrambe le liste di rango. Questo schema sostiene la costruzione separata di moduli per naso e sangue.

Figura 1. Dimensioni dell'effetto a livello genico nel naso e nel sangue nella coorte ancoretta accoppiata GSE117827. I valori di Hedges g confrontano l'infezione sintomatica con controlli negativi al virus per 27.685 geni. Le stime nasali (15 infetti, 6 controlli) sono riportate sull'asse x, mentre le stime ematiche (13 infetti, 6 controlli) sull'asse y. La tonalità dei bin esagonali indica il numero di geni per ogni bin. I punti rossi indicano i sei geni condivisi tra i primi 50 moduli nasali ed ematici. Pearson r = 0,015. Cliccare qui per visualizzare una versione ingrandita di questa figura.
La costruzione dei moduli ha prodotto un piccolo sovrapposizione centrata sugli interferoni
I 50 principali moduli nasali e sanguigni condividevano sei geni: ISG15, ACRBP, IFIT1, RSAD2, CCRL2 e XAF1 (indice di Jaccard = 0,064; Tabella 2; Figura 2). ISG15, IFIT1, RSAD2 e XAF1 sono compatibili con una biologia antivirale associata agli interferoni32,33,34. CCRL2 è meglio interpretato nel contesto della migrazione dei leucociti infiammatori35. ACRBP non ha un ruolo antivirale stabilito. Tutti e sei i geni sono riportati per trasparenza, ma nessuno è indicato come biomarcatore validato trasversale ai tessuti. I valori FDR di questi singoli geni non erano significativi nel piccolo coorte di riferimento. L'interpretazione principale si basa quindi sulla validazione a livello di modulo bloccato, e non sull'elenco delle sovrapposizioni.
| Gene | Hedges g nasale | FDR nasale | Hedges g ematico | FDR ematico | Interpretazione |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.442 | Gene antivirale stimolato dall'interferone; sovrapposizione esplorativa |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | Nessun ruolo antivirale accertato; mantenuto per trasparenza |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.442 | Gene antivirale stimolato dall'interferone; sovrapposizione esplorativa |
| RSAD2 | 1.663 | 0.213 | 1.532 | 0.442 | Gene antivirale stimolato dall'interferone; sovrapposizione esplorativa |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.442 | Contesto infiammatorio di migrazione dei leucociti; non specifico per i virus |
| XAF1 | 1.603 | 0.226 | 1.47 | 0.442 | Fattore dell'apoptosi associato all'interferone; sovrapposizione esplorativa |
Tabella 2: Sovrapposizione esplorativa completa tra i moduli principali del naso e del sangue. Tutti e sei i geni condivisi sono riportati con i valori di Hedges g per naso e sangue e i valori FDR specifici per gene. Tutti e sei i geni sono considerati candidati esplorativi di sovrapposizione nel rango poiché i valori FDR specifici per gene non erano significativi nel piccolo coorte di ancoraggio. ACRBP è mantenuto per trasparenza nonostante non abbia un ruolo antivirale stabilito. Nessuno dei sei geni è presentato come biomarcatore universale validato; l'evidenza principale si basa sulla validazione esterna a livello di modulo.

Figura 2. Dimensioni dell'effetto dei sei geni sovrapposti esplorativi tra naso e sangue. Sono mostrate le stime di Hedges g per naso e sangue per ACRBP, CCRL2, IFIT1, ISG15, RSAD2 e XAF1 nel dataset GSE117827. Valori positivi indicano un'espressione maggiore nell'infezione sintomatica rispetto ai controlli negativi al virus. È mostrata l'intera sovrapposizione per trasparenza; i valori FDR per singolo gene non erano significativi, e questi geni non sono presentati come biomarcatori universali validati. Cliccare qui per visualizzare una versione ingrandita di questa figura.
L'arricchimento funzionale ha fornito un controllo biologico sul contenuto dei moduli
Entrambi i moduli mostravano un arricchimento per le vie di interferone e antivirali, anche se la composizione genica e l'intensità dell'arricchimento differivano (Figura 3). Vengono visualizzati gli otto termini più significativi per modulo. Per il modulo nasale, risposta caratteristica all'interferone-gamma (aggiustato P = 2.23 × 10⁻24), risposta caratteristica all'interferone-alfa (aggiustata P = 1.40 × 10⁻22), segnalazione dell'interferone-alfa/beta in Reactome (aggiustato P = 3.64 × 10⁻19) e risposta di difesa GO al virus (aggiustato P = 5.47 × 10⁻15) classificati tra i termini principali. Il modulo del sangue ha mostrato la stessa biologia generale, ma con un'intensità di arricchimento inferiore: risposta all'interferone-alfa (aggiustato P = 3.87 × 10⁻6), segnalazione dell'interferone-alfa/beta in Reactome (aggiustato P = 5.70 × 10⁻6), risposta all'interferone-gamma (aggiustata P = 8.89 × 10⁻6) e risposta difensiva al virus (aggiustato P = 1.07 × 10⁻4). Questi risultati supportano una coerenza biologica senza implicare un identico ordinamento genico nei compartimenti.

Figura 3. Termini di arricchimento selezionati per i moduli nasale ed ematico. È stata eseguita un'analisi di sovrarappresentazione utilizzando Enrichr con Hallmark 2020, Reactome 2022 e GO Biological Process 2023. Sono mostrati gli otto termini con i valori di P aggiustati secondo Benjamini–Hochberg più piccoli per ciascun modulo. La lunghezza delle barre rappresenta −log10(valore di P aggiustato). I pannelli sinistro e destro mostrano rispettivamente i moduli nasale ed ematico. I termini sono visualizzati in minuscolo iniziale. L'analisi di arricchimento non ha modificato l'appartenenza ai moduli. Cliccare qui per visualizzare una versione ingrandita di questa figura.
I moduli bloccati sono stati testati in una validazione esterna con tessuti abbinati
Il modulo nasale bloccato ha raggiunto valori di AUROC di 0.749 in GSE41374, 0.693 in GSE152075 e 0.609 in GSE156063 (Tabella 3; Figura 4). Il modulo ematico bloccato ha raggiunto valori di AUROC di 0.832 in GSE171110, 0.924 nell'unità GSE38900 GPL10558 e 0.870 nell'unità GPL6884. Le prestazioni degli ancoraggi interni sono omesse poiché sono ottimisticamente distorte per costruzione. Gli AUROC esterni sono considerati riassuntivi della portabilità. Essi non stabiliscono la sensibilità clinica, la specificità o l'idoneità per la diagnosi.
| Cohorte | Campione/virus | Modulo | n positivi | n negativi | Geni rappresentati | AUROC | Precisione media | FDR del test di Welch |
| GSE152075 | SARS-CoV-2 delle vie aeree superiori | Nasale | 430 | 54 | 50 | 0.693 | 0.935 | 2.20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 delle vie aeree superiori | Nasale | 93 | 100 | 49 | 0.609 | 0.551 | 1.38 × 10⁻² |
| GSE171110 | SARS-CoV-2 del sangue intero | Sangue | 44 | 10 | 50 | 0.832 | 0.959 | 7.94 × 10⁻⁴ |
| GSE38900-GPL10558 | RSV del sangue intero | Sangue | 28 | 8 | 50 | 0.924 | 0.979 | 7.94 × 10⁻⁴ |
| GSE38900-GPL6884 | RSV del sangue intero | Sangue | 107 | 31 | 49 | 0.87 | 0.962 | 3.47 × 10⁻¹⁵ |
| GSE41374 | Lavaggio nasale per RSV | Nasale | 76 | 10 | 50 | 0.749 | 0.951 | 2.63 × 10⁻² |
Tabella 3: Validazione del punteggio del modulo esterno abbinato al tessuto. Il modulo nasale bloccato è stato testato in GSE41374, GSE152075 e GSE156063, e il modulo sanguigno bloccato è stato testato nelle unità della piattaforma GSE171110 e in GSE38900, GPL10558 e GPL6884. La tabella riporta i numeri di campioni positivi e negativi, i geni del modulo rappresentati, l’AUROC, la precisione media e il FDR del test di Welch. Le prestazioni dell’ancora interna sono omesse. L’AUROC e la precisione media sono riportate come riepilogo della portabilità e non come stime delle prestazioni diagnostiche cliniche.

Figura 4. Portabilità dei punteggi dei moduli abbinati a tessuti esterni. Gli AUROC sono mostrati per il modulo nasale nei dataset GSE41374 (76 RSV, 10 controlli), GSE152075 (430 SARS-CoV-2, 54 controlli) e GSE156063 (93 SARS-CoV-2, 100 controlli), e per il modulo ematico nei dataset GSE171110 (44 SARS-CoV-2, 10 controlli), GSE38900-GPL10558 (28 RSV, 8 controlli) e GSE38900-GPL6884 (107 RSV, 31 controlli). I punteggi corrispondono alle medie non pesate dei valori z per gene rappresentati. La linea tratteggiata indica un AUROC = 0,5. I valori rappresentano riepiloghi di portabilità, non stime diagnostiche cliniche. Cliccare qui per visualizzare una versione ingrandita di questa figura.
La validazione longitudinale ha verificato se i punteggi diminuiscono durante il recupero
I set di dati complementari GSE97741/GSE97742 hanno fornito un contesto indipendente di validazione in caso di infezione naturale, con campioni prelevati in fase acuta e al momento della dimissione da bambini ricoverati27. Questi campioni non sono stati utilizzati come dati di scoperta per controlli sani. Sono stati impiegati per valutare se i punteggi dei moduli derivati dagli ancoraggi diminuissero dalla fase acuta della malattia fino alla dimissione.
Per il gruppo predefinito combinato di singola infezione da RSV e rinovirus, sono stati analizzati 68 soggetti appaiati per ogni tessuto (Tabella 4; Figura 5). Il modulo del sangue è diminuito dalla fase acuta della malattia al momento della dimissione nel sangue (delta medio = 0,330; Cohen dz = 0,740; FDR del test appaiato = 1,98 × 10⁻7; AUROC = 0,765). Il modulo nasale è diminuito anche nei campioni nasofaringei (delta medio = 0,436; Cohen dz = 0,477; FDR del test appaiato = 3,06 × 10⁻4; AUROC = 0,679). Le traiettorie appaiate e i loro errori standard mostrano che il calo a livello di gruppo non è stato determinato da pochi valori estremi non appaiati.
| Dataset | Fonte del campione | Modulo | Tessuto abbinato | n coppie | Delta medio acuto-dimissione | Cohen dz | AUROC | FDR del test accoppiato |
| GSE97741 | Blood | Blood | Sì | 68 | 0.330 | 0.740 | 0.765 | 1.98 × 10⁻⁷ |
| GSE97741 | Blood | Nasal | No | 68 | 0.479 | 0.721 | 0.755 | 3.19 × 10⁻⁷ |
| GSE97742 | Nasopharyngeal | Blood | No | 68 | 0.361 | 0.914 | 0.845 | 9.42 × 10⁻¹⁰ |
| GSE97742 | Nasopharyngeal | Nasal | Sì | 68 | 0.436 | 0.477 | 0.679 | 3.06 × 10⁻⁴ |
Tabella 4: Validazione longitudinale indipendente acuto-versus-dimissione. La tabella riporta il numero di coppie complete, la differenza media tra punteggio acuto e punteggio alla dimissione, il Cohen dz, l'AUROC e il valore FDR del test appaiato per i moduli fissi nei dataset GSE97741 e GSE97742. Un delta positivo indica un punteggio del modulo più elevato durante la fase acuta della malattia. I valori FDR del test appaiato sono valori P aggiustati secondo Benjamini–Hochberg per il test t appaiato bilaterale, calcolati su tutti e 20 i test t appaiati validi nell'output longitudinale completo.

Figura 5. Variazioni accoppiate del punteggio del modulo dalla malattia acuta alla dimissione. (A) Punteggi del modulo ematico nel sangue intero (GSE97741). (B) Punteggi del modulo nasale in campioni nasofaringei (GSE97742). Ogni pannello contiene 68 coppie complete di soggetti: 38 infezioni singole da RSV e 30 infezioni da rhinovirus. Linee sottili collegano le misurazioni appaiate per soggetto. I punti arancioni indicano le medie del gruppo e le barre di errore arancioni indicano l'errore standard della media. Sono stati eseguiti test t appaiati bilaterali e test di Wilcoxon per ranghi con segno; è stata applicata la correzione FDR di Benjamini–Hochberg su 20 test t appaiati longitudinali validi. Cliccare qui per visualizzare una versione ingrandita di questa figura.
I test su compartimenti incrociati hanno rivelato una sfumatura utile. Il modulo sanguigno applicato a campioni nasofaringei ha prodotto un AUROC di 0,845, anche se le dimensioni degli effetti individuali nel naso e nel sangue erano debolmente concordanti nell'ancora. L'analisi delle traiettorie abbinate ha mostrato un declino costante del punteggio, piuttosto che una distribuzione inversa delle etichette. Pertanto, il risultato non costituisce evidenza che gli stessi geni individuali dominino entrambi i tessuti. Indica invece che un programma interferonico/infiammatorio coordinato può essere riassunto da insiemi genici diversi ma parzialmente ridondanti. La specificità del compartimento è più marcata a livello del posizionamento dei geni ed è non assoluta a livello di percorso o di punteggio.
Rilevazioni asintomatiche escluse hanno verificato il comportamento del gradiente sintomatologico
Le rilevazioni asintomatiche di picornavirus in GSE117827 sono state escluse dalla costruzione del modulo per evitare di inserirle nel gruppo di controllo principale. Questo gruppo escluso ha successivamente fornito un controllo biologico. In entrambi i compartimenti, i punteggi dei moduli sono aumentati attraverso i gruppi ordinati di controlli negativi al virus, rilevazione asintomatica di picornavirus e infezione sintomatica (Figura 6A,B).

Figura 6. Punteggi dei moduli lungo il gradiente sintomatologico escluso. (A) Modulo nasale: 6 controlli negativi ai virus, 5 rilevazioni asintomatiche di picornavirus e 15 infezioni sintomatiche. (B) Modulo ematico: 6 controlli negativi ai virus, 5 rilevazioni asintomatiche di picornavirus e 13 infezioni sintomatiche. I punti rappresentano campioni individuali. Le linee centrali indicano le mediane; i riquadri si estendono dal 25° al 75° percentile; i baffi si protrudono fino ai valori più estremi entro 1,5 volte l'intervallo interquartile. Le etichette riportano i confronti post-hoc a due code di Mann-Whitney U con correzione di Benjamini-Hochberg effettuati su tre confronti per compartimento. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Il modulo nasale era correlato con il punteggio ordinale dei sintomi (rho di Spearman = 0,818, P = 3,28 × 10⁻7; Kruskal-Wallis P = 1,57 × 10⁻4). Il modulo ematico mostrava un gradiente simile (rho = 0,861, P = 6,89 × 10⁻8; Kruskal-Wallis P = 1,92 × 10⁻4). Dopo la correzione all'interno di ciascuna famiglia di tre confronti, l'infezione sintomatica differiva dai controlli e dalle rilevazioni asintomatiche in entrambi i compartimenti. Le rilevazioni asintomatiche non differivano dai controlli negativi al virus (FDR nasale = 0,792; FDR ematico = 0,082). I moduli riflettevano quindi l'attività della risposta dell'ospite sintomatico in modo più chiaro rispetto alla sola rilevazione virale.
I parametri clinici hanno definito il confine tra la risposta dell'ospite e la specificità del patogeno
I parametri clinici hanno definito la distinzione tra l'attività della risposta dell'ospite e la classificazione del patogeno (Tabella 5; Figura 7). Nel dataset GSE63990, il modulo nasale ha prodotto valori di AUROC pari a 0,782 per la distinzione tra malattia virale e batterica e 0,791 per la distinzione tra malattia virale e non infettiva. Il modulo ematico ha prodotto rispettivamente valori di AUROC pari a 0,678 e 0,753. Il comparatore basato sulle 33 mRNA di Pandya ha ottenuto prestazioni migliori, con valori di AUROC pari a 0,867 e 0,852 rispettivamente. Questo risultato era previsto per un insieme progettato per discriminare tra infezioni virali e non virali, e dimostra che i moduli di ancoraggio non dovrebbero essere presentati come classificatori diagnostici sostitutivi.
| Dataset | Confronto | Nasale di riferimento | Sangue di riferimento | Pandya 33 mRNA | Andres-Terre ISG | Interferone-alfa Hallmark |
| GSE63990 | Virale vs batterico | 0.782 | 0.678 | 0.867 | 0.833 | 0.831 |
| GSE63990 | Virale vs non infettivo | 0.791 | 0.753 | 0.852 | 0.851 | 0.848 |
| GSE40012 | Polmonite virale vs batterica | 0.755 | 0.789 | 0.893 | 0.867 | 0.872 |
| GSE40012 | Polmonite virale vs SIRS | 0.897 | 0.907 | 0.985 | 0.965 | 0.956 |
| GSE40012 | Polmonite virale vs sano | 0.804 | 0.986 | 0.923 | 0.906 | 0.891 |
| GSE40012 | Polmonite batterica vs sano | 0.476 | 0.917 | 0.465 | 0.391 | 0.378 |
| GSE53543 | PMBC stimolati ex vivo con rhinovirus vs non stimolati | 1 | 0.957 | 1 | 1 | 1 |
Tabella 5: Benchmark AUROC per i moduli ancorati e i set di risposta del sistema ospite di riferimento. GSE63990 e GSE40012 sono coorti cliniche di sangue intero. GSE53543 è un esperimento di perturbazione di PBMC ex vivo che coinvolge 98 soggetti appaiati ed è riportato separatamente dalle coorti cliniche naturali. I set di riferimento sono stati valutati come medie geniche non pesate, anziché come i loro classificatori pesati originali. I valori AUROC sono riportati come metriche di benchmarking e non come stime della performance diagnostica clinica.

Figura 7. Confronto AUROC dei moduli di ancoraggio e dei set di risposta ospite di riferimento. Le righe rappresentano confronti predeterminati nei dataset GSE63990, GSE40012 e GSE53543; le colonne rappresentano i due moduli di ancoraggio e i tre set di riferimento non pesati. Il dataset GSE53543 è etichettato come PBMC stimolati ex vivo con rhinovirus rispetto a non stimolati ed è presentato separatamente dai cohort clinici naturali. Il comparatore Hallmark è etichettato come Hallmark interferone-alfa. I valori nelle celle indicano gli AUROC utilizzati per il confronto dei metodi e non devono essere interpretati come stime delle prestazioni diagnostiche cliniche. Cliccare qui per visualizzare una versione ingrandita di questa figura.
GSE40012 ha definito con maggiore precisione questo limite. Il comparatore Pandya ha raggiunto valori di AUROC pari a 0,893 per polmonite virale rispetto a polmonite batterica e 0,985 per polmonite virale rispetto a SIRS. Il modulo del sangue ha distinto la polmonite da influenza A dai controlli sani (AUROC = 0,986) e da SIRS (AUROC = 0,907), ma ha anche distinto la polmonite batterica dai controlli sani (AUROC = 0,917). Il modulo del sangue misura quindi un'attività infiammatoria sistemica e associata agli interferoni di ampia portata. Non è specifico per i virus e un punteggio elevato non consente di assegnare la classe del patogeno.
Nel benchmark separato GSE53543 su PBMC es vivo, il modulo nasale e i comparatori dell'interferone hanno raggiunto un AUROC di 1,000 per i PBMC stimolati dal rhinovirus rispetto ai PBMC trattati solo con mezzo; il modulo sanguigno ha raggiunto un AUROC di 0,957. Tutti e 98 i soggetti hanno contribuito con condizioni accoppiate. Questo risultato controllato supporta la reattività dei programmi valutati alla stimolazione da rhinovirus. Non stima tuttavia la performance diagnostica clinica.
Verifiche di robustezza hanno testato la dimensione del modulo, alternative casuali e la stabilità della selezione
La separazione degli ancoraggi è rimasta invariata considerando i primi 10, 25, 50, 100 e 200 geni in classifica (Figura 8A). Queste AUROC interne non costituiscono una validazione esterna, ma mostrano che il risultato qualitativo non dipendeva dalla scelta esatta di 50 geni. In 500 insiemi casuali di 50 geni, le mediane AUROC nulle erano 0.489 per il tessuto nasale e 0.705 per il sangue; i corrispondenti percentili al 99° erano 0.722 e 0.872 (Figura 8B). I moduli osservati superavano queste distribuzioni nulle. Le frequenze di selezione ottenute con il metodo bootstrap erano distribuite piuttosto che concentrate in un’unica lista invariante (Figura 8C). Questo risultato riflette direttamente la piccola dimensione del campione di ancoraggio. Esso supporta un segnale aggregato stabile, ma mette in guardia contro il considerare ogni gene selezionato come fisso.

Figura 8. Analisi della robustezza rispetto alle dimensioni del modulo, ai geni casuali e al metodo bootstrap. (A) Valore medio AUROC al variare delle dimensioni del modulo (10, 25, 50, 100 e 200 geni); questi valori rappresentano controlli interni di sensibilità. (B) Distribuzioni dell’AUROC ottenute da 500 insiemi casuali di 50 geni codificanti proteine, estratti senza reimmissione dai geni presenti in GSE117827 (seed = 20260622). I punti arancioni indicano i valori osservati di AUROC per ciascun modulo. Le linee orizzontali all’interno di ogni diagramma a violino indicano il 25° percentile, la mediana e il 75° percentile. (C) La riselezione tramite bootstrap è stata limitata ai 1.000 geni codificanti proteine con effetto positivo, ordinati in base al punteggio più alto nell’analisi iniziale dell’ancoraggio per ciascun compartimento. Le barre mostrano i 20 geni con la frequenza di selezione più elevata per compartimento; la frequenza di selezione è stata calcolata come numero di selezioni diviso per 100. Cliccare qui per visualizzare una versione ingrandita di questa figura.
L'analisi dei marcatori e della varianza ha chiarito cosa misurano i punteggi
Nei dataset GSE40012, GSE53543 e GSE63990, entrambi i moduli hanno mostrato correlazioni più consistenti con il programma dell'interferone mieloide (Figura 9A). Le correlazioni per il modulo nasale sono state rispettivamente 0,812, 0,878 e 0,882; quelle per il modulo ematico sono state 0,517, 0,843 e 0,774. La ripartizione della varianza è stata descrittiva (Tabella 6; Figura 9B). Per il modulo ematico, la condizione e il gruppo dettagliato hanno spiegato una varianza maggiore (eta-quadrato = 0,282 e 0,250, rispettivamente) rispetto al dataset (0,066), al tipo di campione (0,026) o al gruppo di provenienza (0,025). Per il modulo nasale, il gruppo dettagliato e la condizione hanno spiegato anch'essi una varianza maggiore rispetto al dataset, al tipo di campione o al gruppo di provenienza. La condizione biologica e il gruppo dettagliato hanno quindi spiegato frazioni più elevate della varianza dei punteggi dei moduli rispetto al dataset o al tipo di campione, anche se effetti residui legati al dataset e alla composizione rappresentano una limitazione nell'uso ripetuto di dati pubblici in bulk.

Figura 9. Correlazioni tra marcatori e programmi e partizione descrittiva della varianza. (A) Correlazioni di Spearman tra i punteggi dei moduli e i punteggi di sei programmi marcatore in GSE40012, GSE53543 e GSE63990. I programmi richiedevano almeno tre geni rappresentati. I valori di P sono stati corretti per tutte le correlazioni tra dataset, modulo e programma. Le celle vuote indicano combinazioni non disponibili o non stimabili dopo i requisiti di geni e campioni. (B) Eta-quadrato unidirezionale (η2; somma dei quadrati tra gruppi / somma totale dei quadrati) per condizione, gruppo dettagliato, dataset, tipo di campione e gruppo di origine. L'analisi ha incluso 934 punteggi di modulo del sangue e 1.469 punteggi di modulo nasale ed è descrittiva, non causale. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Modulo | Fattore | Eta-quadrato | n campioni |
| Sangue di ancoraggio | Condizione | 0.282 | 934 |
| Sangue di ancoraggio | Gruppo dettagliato | 0.25 | 934 |
| Sangue di ancoraggio | Set di dati | 0.066 | 934 |
| Sangue di ancoraggio | Tipo di campione | 0.026 | 934 |
| Sangue di ancoraggio | Gruppo di origine | 0.025 | 934 |
| Nasale di ancoraggio | Gruppo dettagliato | 0.17 | 1469 |
| Nasale di ancoraggio | Condizione | 0.13 | 1469 |
| Nasale di ancoraggio | Set di dati | 0.021 | 1469 |
| Nasale di ancoraggio | Tipo di campione | 0.006 | 1469 |
| Nasale di ancoraggio | Gruppo di origine | 0.002 | 1469 |
Tabella 6: Partizione descrittiva della varianza dei punteggi dei moduli. È riportata una riga per ogni coppia modulo-fattore, con il corrispondente valore di eta-quadrato e la dimensione del campione. L'eta-quadrato è stato calcolato come la somma dei quadrati tra i gruppi divisa per la somma totale dei quadrati, dopo l'esclusione delle righe con punteggio del modulo o del fattore mancante. I fattori sono stati valutati singolarmente; pertanto, l'analisi è descrittiva, non corregge per fattori mutuamente correlati e non deve essere interpretata in senso causale.
Disponibilità dei dati:
Tutti i set di dati trascrittomici analizzati in questo studio sono disponibili pubblicamente presso il Gene Expression Omnibus con i numeri di accessione GSE117827, GSE41374, GSE152075, GSE156063, GSE171110, GSE38900, GSE97741, GSE97742, GSE63990, GSE40012 e GSE53543. I dati derivati dall'analisi alla base delle figure e tabelle principali e il codice di analisi sono disponibili presso l'autore corrispondente su richiesta ragionevole. In questo studio non sono stati utilizzati dati a livello individuale nuovi o soggetti a restrizioni.