Benchmarking der Anker-Schritte trennte gewebespezifische von pan-geweblichen Gen-Effekten
Die kuratierte GSE117827-Anker-Matrix enthielt 27.685 von der HGNC genehmigte Gene. Der primäre nasale Vergleich umfasste 15 symptomatische infizierte und 6 virusnegative Kontrollproben; der Blutvergleich enthielt 13 symptomatische infizierte und 6 Kontrollen (Tabelle 1). Da diese kleine Kohorte keine stabile Einzelgen-Entdeckung ermöglicht, wurde sie als gepaarter Kompartments-Anker verwendet. Die Stabilität wurde auf Modul-Ebene durch Bootstrap-Resampling, zufallsbasierte Gen-Null-Tests, externe Validierung sowie Analysen der Empfindlichkeit gegenüber der Modulgröße bewertet.
| Quelle | Gruppe | Zustand | Primärer Vergleich | n |
| Blut | RSV | Infiziert | Ja | 4 |
| Blut | Asymptomatisches Picornavirus | Sekundär | Nein | 5 |
| Blut | Symptomatisches Picornavirus | Infiziert | Ja | 9 |
| Blut | Virusnegativer Kontrollwert | Kontrolle | Ja | 6 |
| Nasal | RSV | Infiziert | Ja | 6 |
| Nasal | Asymptomatisches Picornavirus | Sekundär | Nein | 5 |
| Nasal | Symptomatisches Picornavirus | Infiziert | Ja | 9 |
| Nasal | Virusnegativer Kontrollwert | Kontrolle | Ja | 6 |
Tabelle 1: GSE117827 Anker-Design nach der Kuration des primären Kontrasts. Probenverteilung über Blut- und Nasenkompartimente in dem gepaarten Anker-Datensatz nach der Kuration des primären Kontrasts. Symptomatische Proben von Respiratorischem Synzytialvirus (RSV) und symptomatische Picornavirus-Proben wurden als infiziert klassifiziert und in den primären Kontrast eingeschlossen, während virusnegative Kontrollen als Kontrollen klassifiziert und ebenfalls in den primären Kontrast eingeschlossen wurden. Asymptomatische Picornavirus-Proben wurden als sekundär eingestuft und von der Modulkonstruktion ausgeschlossen; sie wurden nur in der explorativen Analyse des Symptomgradienten verwendet. Bei zwei RSV-Fällen fehlten Blutproben, sodass insgesamt vier Blut- und sechs Nasenproben für RSV vorlagen.
Bei den 27.685 gemeinsamen Genen waren die Hedges-g-Schätzungen für Nasen- und Blutproben nahezu unkorreliert (Pearson-r = 0,015; Abbildung 1). Dieses Ergebnis stammt aus einer einzelnen Studie und ist weniger von Unterschieden zwischen Studien betroffen als ein gepoolter vergleichender Querschnittsvergleich. Die dichte zentrale Wolke zeigt, dass die meisten Gene in beiden Kompartimenten nicht gleichartig reguliert wurden. Die hervorgehobenen überlappenden Gene stellen Ausnahmen dar, die jeweils an der Spitze beider Ranglisten liegen. Dieses Muster spricht für die getrennte Konstruktion von Nasen- und Blutmodulen.

Abbildung 1. Nasale und blutbasierte Gen-Effektgrößen in der gepaarten Anker-Kohorte GSE117827. Hedges g-Werte vergleichen symptomatische Infektionen mit virusnegativen Kontrollen für 27.685 Gene. Nasale Schätzungen (15 infiziert, 6 Kontrollen) sind auf der x-Achse dargestellt, blutbasierte Schätzungen (13 infiziert, 6 Kontrollen) auf der y-Achse. Die Schattierung der hexagonalen Bin-Flächen zeigt die Anzahl der Gene pro Bin an. Rote Punkte kennzeichnen die sechs Gene, die sowohl in den Top-50-Modulen der Nasen- als auch der Blutproben vorkommen. Pearson r = 0,015. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Die Modulkonstruktion ergab eine kleine, um Interferone zentrierte Überlappung
Die jeweils 50 stärksten Nasen- und Blutmodule teilten sich sechs Gene: ISG15, ACRBP, IFIT1, RSAD2, CCRL2 und XAF1 (Jaccard-Index = 0,064; Tabelle 2; Abbildung 2). ISG15, IFIT1, RSAD2 und XAF1 passen zu einer interferonvermittelten antiviralen Biologie32,33,34. CCRL2 lässt sich besser im Kontext der entzündlichen Leukozytenwanderung interpretieren35. ACRBP hat keine etablierte antivirale Funktion. Alle sechs Gene werden zur Transparenz genannt, aber keines wird als validierter Biomarker für beide Gewebe beansprucht. Ihre Einzelgen-FDR-Werte waren in der kleinen Ankerkohorte nicht signifikant. Die wesentliche Schlussfolgerung beruht daher auf der gesicherten Modul-Ebene-Validierung und nicht auf der Überlappungsliste.
| Gen | Nasale Hedges g | Nasale FDR | Blood Hedges g | Blood FDR | Interpretation |
| ISG15 | 2.215 | 0.213 | 1.369 | 0.442 | Interferonstimuliertes antivirales Gen; explorativer Überlapp |
| ACRBP | 1.69 | 0.205 | 1.748 | 0.429 | Keine etablierte antivirale Funktion; beibehalten aus Transparenzgründen |
| IFIT1 | 1.875 | 0.213 | 1.35 | 0.442 | Interferonstimuliertes antivirales Gen; explorativer Überlapp |
| RSAD2 | 1.663 | 0.213 | 1.532 | 0.442 | Interferonstimuliertes antivirales Gen; explorativer Überlapp |
| CCRL2 | 1.396 | 0.217 | 1.782 | 0.442 | Immunologischer Kontext der Leukozytenmigration; nicht virus-spezifisch |
| XAF1 | 1.603 | 0.226 | 1.47 | 0.442 | Mit Interferon assoziiertes Apoptosefaktor; explorativer Überlapp |
Tabelle 2: Vollständige explorative Überschneidung zwischen den am höchsten bewerteten nasalen und blutbasierten Modulen. Alle sechs gemeinsamen Gene werden mit nasalen und blutbasierten Hedges g sowie genweisen FDR-Werten angegeben. Alle sechs Gene gelten als explorative Kandidaten für eine Rangüberschneidung, da die genweisen FDR-Werte in der kleinen Ankerkohorte nicht signifikant waren. ACRBP wird der Transparenz halber beibehalten, obwohl ihm keine etablierte antivirale Funktion zugeschrieben wird. Keines der sechs Gene wird als validierter universeller Biomarker präsentiert; der primäre Nachweis basiert auf einer externen Validierung auf Modulebene.

Abbildung 2. Effektgrößen der sechs explorativen Gene mit Überschneidung zwischen Nasen- und Blutproben. Dargestellt sind die Schätzungen der Hedges-g-Effektgrößen für ACRBP, CCRL2, IFIT1, ISG15, RSAD2 und XAF1 aus GSE117827 in Nasen- und Blutproben. Positive Werte zeigen eine höhere Expression bei symptomatischer Infektion im Vergleich zu virusnegativen Kontrollen an. Die vollständige Überschneidung ist der Transparenz halber dargestellt; die FDR-Werte für Einzelgene waren jedoch nicht signifikant, und diese Gene werden daher nicht als validierte universelle Biomarker präsentiert. Bitte klicken Sie hier, um eine vergrößerte Ansicht dieser Abbildung einzusehen.
Die funktionelle Anreicherung bot eine biologische Überprüfung des Modulinhalts
Beide Module zeigten eine Anreicherung für Interferon- und antivirale Signalwege, wobei sich jedoch die Genzusammensetzung und die Stärke der Anreicherung unterschieden (Abbildung 3). Die acht signifikantesten Terme pro Modul sind dargestellt. Für das nasale Modul gehörten die Hallmark-Interferon-gamma-Antwort (adjustierter P = 2,23 × 10⁻24), die Hallmark-Interferon-alpha-Antwort (adjustierter P = 1,40 × 10⁻22), die Reactome-Interferon-alpha/beta-Signalübertragung (adjustierter P = 3,64 × 10⁻19) und die GO-Abwehrantwort gegen Viren (adjustierter P = 5,47 × 10⁻15) zu den führenden Begriffen. Das Blutmodul zeigte dieselbe übergeordnete Biologie bei geringerer Anreicherungsstärke: Interferon-alpha-Antwort (adjustierter P = 3,87 × 10⁻6), Reactome-Interferon-alpha/beta-Signalübertragung (adjustierter P = 5,70 × 10⁻6), Interferon-gamma-Antwort (adjustierter P = 8,89 × 10⁻6) und Abwehrantwort gegen Viren (adjustierter P = 1,07 × 10⁻4). Diese Ergebnisse stützen die biologische Kohärenz, ohne identische genetische Rangfolgen in den Kompartimenten zu implizieren.

Abbildung 3. Ausgewählte Anreicherungsbegriffe für die nasalen und blutbasierten Module. Eine Überrepräsentanzanalyse wurde mittels Enrichr unter Verwendung von Hallmark 2020, Reactome 2022 und GO Biological Process 2023 durchgeführt. Die acht Begriffe mit den jeweils niedrigsten, nach Benjamini–Hochberg adjustierten P-Werten für jedes Modul sind dargestellt. Die Balkenlänge entspricht −log10(adjustierter P-Wert). Die linken und rechten Diagramme zeigen die nasalen bzw. die blutbasierten Module. Die Begriffe sind in Satzschreibweise angegeben. Die Anreicherungsanalyse führte nicht zu einer Änderung der Modulzugehörigkeit. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Gesperrte Module wurden in einer gewebematchenden externen Validierung getestet
Das gesperrte nasale Modul erreichte AUC-Werte (AUROC) von 0,749 in GSE41374, 0,693 in GSE152075 und 0,609 in GSE156063 (Tabelle 3; Abbildung 4). Das gesperrte Blutmodul erreichte AUC-Werte (AUROC) von 0,832 in GSE171110, 0,924 in der GSE38900 GPL10558-Einheit und 0,870 in der GPL6884-Einheit. Die Leistung der internen Anker wird weggelassen, da sie aufgrund der Konstruktion optimistisch verzerrt ist. Externe AUC-Werte (AUROC) werden als Zusammenfassung der Übertragbarkeit betrachtet. Sie belegen weder klinische Sensitivität noch Spezifität oder die Eignung für die Diagnose.
| Kohorte | Probe/Virus | Modul | n positiv | n negativ | Vertretene Gene | AUROC | Durchschnittliche Präzision | Welch-Test FDR |
| GSE152075 | SARS-CoV-2 oberer Atemweg | Nasal | 430 | 54 | 50 | 0.693 | 0.935 | 2.20 × 10⁻⁴ |
| GSE156063 | SARS-CoV-2 oberer Atemweg | Nasal | 93 | 100 | 49 | 0.609 | 0.551 | 1.38 × 10⁻² |
| GSE171110 | SARS-CoV-2 Vollblut | Blut | 44 | 10 | 50 | 0.832 | 0.959 | 7.94 × 10⁻⁴ |
| GSE38900-GPL10558 | RSV Vollblut | Blut | 28 | 8 | 50 | 0.924 | 0.979 | 7.94 × 10⁻⁴ |
| GSE38900-GPL6884 | RSV Vollblut | Blut | 107 | 31 | 49 | 0.87 | 0.962 | 3.47 × 10⁻¹⁵ |
| GSE41374 | RSV Nasalspülung | Nasal | 76 | 10 | 50 | 0.749 | 0.951 | 2.63 × 10⁻² |
Tabelle 3: Externe, gewebematchende Modul-Score-Validierung. Das fixierte nasale Modul wurde in GSE41374, GSE152075 und GSE156063 getestet, und das fixierte Blutmodul wurde in GSE171110 sowie in den GSE38900-Plattformeinheiten GPL10558 und GPL6884 überprüft. In der Tabelle sind die Anzahlen positiver und negativer Proben, die repräsentierten Modulgene, AUROC, durchschnittliche Präzision und Welch-Test-FDR aufgeführt. Die Leistung des internen Ankers wird nicht angegeben. AUROC und durchschnittliche Präzision werden als Portabilitätszusammenfassungen angegeben und nicht als Schätzwerte der klinischen diagnostischen Leistungsfähigkeit.

Abbildung 4. Externe, gewebematchende Übertragbarkeit von Modulscores. Dargestellt sind die AUROCs für das Nasenmodul in GSE41374 (76 RSV, 10 Kontrollen), GSE152075 (430 SARS-CoV-2, 54 Kontrollen) und GSE156063 (93 SARS-CoV-2, 100 Kontrollen) sowie für das Blutmodul in GSE171110 (44 SARS-CoV-2, 10 Kontrollen), GSE38900-GPL10558 (28 RSV, 8 Kontrollen) und GSE38900-GPL6884 (107 RSV, 31 Kontrollen). Die Scores entsprechen ungewichteten Mittelwerten der repräsentativen z-Werte pro Gen. Die gestrichelte Linie zeigt AUROC = 0,5 an. Die Werte stellen Zusammenfassungen zur Übertragbarkeit dar, keine klinischen diagnostischen Schätzungen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Die longitudinale Validierung prüfte, ob die Werte während der Genesung abnehmen
Die begleitenden Datensätze GSE97741/GSE97742 boten eine unabhängige Validierung unter natürlicher Infektion mit Proben aus der akuten Phase und beim Krankenhausaufenthalt von hospitalisierten Kindern27. Diese Proben wurden nicht als Entdeckungsdaten von gesunden Kontrollen verwendet. Stattdessen dienten sie dazu zu bewerten, ob sich die anhand der Anker abgeleiteten Modulwerte von der akuten Erkrankung bis zur Entlassung verringerten.
Für die vorgegebene kombinierte Gruppe mit alleinigem RSV-Infekt und Rhinovirus-Infektion wurden jeweils 68 gepaarte Probanden in jedem Gewebe analysiert (Tabelle 4; Abbildung 5). Das Blutmodul nahm von der akuten Erkrankung bis zur Entlassung im Blut ab (mittlere Differenz = 0,330; Cohen dz = 0,740; gepaarter Test, FDR = 1,98 × 10⁻7; AUROC = 0,765). Das nasale Modul nahm ebenfalls in nasopharyngealen Proben ab (mittlere Differenz = 0,436; Cohen dz = 0,477; gepaarter Test, FDR = 3,06 × 10⁻4; AUROC = 0,679). Gepaarte Verläufe und ihre Standardfehler zeigen, dass der gruppenbezogene Rückgang nicht durch wenige ungepaarte Extremwerte verursacht wurde.
| Datensatz | Probenquelle | Modul | Gewebe abgeglichen | n Paare | Mittlere akute-Entlassungs-Differenz | Cohen dz | AUROC | FDR des gepaarten Tests |
| GSE97741 | Blut | Blut | Ja | 68 | 0,330 | 0,740 | 0,765 | 1,98 × 10⁻⁷ |
| GSE97741 | Blut | Nasal | Nein | 68 | 0,479 | 0,721 | 0,755 | 3,19 × 10⁻⁷ |
| GSE97742 | Nasopharyngeal | Blut | Nein | 68 | 0,361 | 0,914 | 0,845 | 9,42 × 10⁻¹⁰ |
| GSE97742 | Nasopharyngeal | Nasal | Ja | 68 | 0,436 | 0,477 | 0,679 | 3,06 × 10⁻⁴ |
Tabelle 4: Unabhängige longitudinale Akut- versus Entlassungs-Validierung. In der Tabelle sind die Anzahl der vollständigen Paare, die durchschnittliche Differenz zwischen Akut- und Entlassungswert, Cohens dz, die AUROC sowie der FDR-Wert des gepaarten Tests für die festen Module in GSE97741 und GSE97742 angegeben. Ein positiver Delta-Wert zeigt einen höheren Modulwert während der akuten Erkrankung an. Die FDR-Werte des gepaarten Tests entsprechen den mit der Methode von Benjamini–Hochberg angepassten zweiseitigen P-Werten des gepaarten t-Tests, berechnet über alle 20 gültigen gepaarten t-Tests in der vollständigen longitudinalen Ausgabe.

Abbildung 5. GePaarte Änderungen der Modul-Scores von der akuten Erkrankung bis zur Entlassung. (A) Modul-Scores im Vollblut (GSE97741). (B) Nasale Modul-Scores in nasopharyngealen Proben (GSE97742). Jedes Diagramm enthält 68 vollständige Probenpaare: 38 RSV-Einzelinfektionen und 30 Rhinovirus-Infektionen. Dünne Linien verbinden die den Probanden zugeordneten Messungen. Orangefarbene Punkte zeigen die Gruppenmittelwerte, orangefarbene Fehlerbalken die Standardfehler des Mittelwerts. Zweiseitige gepaarte t-Tests und Wilcoxon-gepaarte Rangtests wurden durchgeführt; die FDR-Korrektur nach Benjamini–Hochberg wurde auf die 20 gültigen longitudinalen gepaarten t-Tests angewandt. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Die Kreuzkompartimenttests zeigten eine nützliche Feinheit. Das Blutmodul, angewendet auf nasopharyngeale Proben, ergab eine AUROC von 0,845, obwohl die individuellen Effektstärken von Nase und Blut im Anker nur schwach übereinstimmten. Die Untersuchung gepaarter Verläufe zeigte einen durchgängigen Abfall der Werte, anstatt einer umgekehrten Verteilung der Beschriftungen. Das Ergebnis ist daher kein Hinweis darauf, dass dieselben Einzelgene in beiden Geweben dominieren. Es zeigt vielmehr, dass ein koordiniertes Interferon-/Entzündungsprogramm durch unterschiedliche, aber teilweise redundante Gen-Sets zusammengefasst werden kann. Die Kompartiment-Spezifität ist auf der Ebene der Gen-Rangfolge am stärksten ausgeprägt, jedoch nicht absolut auf der Ebene von Pfadwegen oder Scores.
Ausgeschlossene asymptomatische Nachweise zur Überprüfung des Symptomengradientenverhaltens getestet
Asymptomatische Picornavirus-Nachweise in GSE117827 wurden von der Modulkonstruktion ausgeschlossen, um sie nicht in die primäre Kontrollgruppe einzubeziehen. Diese ausgeschlossene Gruppe diente anschließend als biologische Überprüfung. In beiden Kompartimenten stiegen die Modulwerte über die geordneten Gruppen hinweg an: virusnegative Kontrollen, asymptomatischer Picornavirus-Nachweis und symptomatische Infektion (Abbildung 6A,B).

Abbildung 6. Modulscores entlang des ausgelassenen Symptomgradienten. (A) Nasenmodul: 6 virusnegative Kontrollen, 5 asymptomatische Picornavirus-Nachweise und 15 symptomatische Infektionen. (B) Blutmodul: 6 virusnegative Kontrollen, 5 asymptomatische Picornavirus-Nachweise und 13 symptomatische Infektionen. Die Punkte repräsentieren einzelne Proben. Die mittleren Linien zeigen die Mediane an; die Boxen erstrecken sich vom 25. bis zum 75. Perzentil; die Whisker reichen bis zu den extremsten Werten innerhalb des 1,5-fachen des Interquartilsabstands. Die Beschriftungen geben zweiseitige post-hoc-Vergleiche nach Mann–Whitney U mit Benjamini–Hochberg-Korrektur für jeweils drei Vergleiche pro Kompartiment an. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
Das nasale Modul korrelierte mit dem ordinalen Symptom-Score (Spearman-Rho = 0,818, P = 3,28 × 10⁻7; Kruskal-Wallis P = 1,57 × 10⁻4). Das Blutmodul zeigte einen ähnlichen Gradienten (Rho = 0,861, P = 6,89 × 10⁻8; Kruskal-Wallis P = 1,92 × 10⁻4). Nach Korrektur innerhalb jeder Dreivergleichsgruppe unterschied sich die symptomatische Infektion sowohl im nasalen als auch im Blutkompartiment von den Kontrollen und den asymptomatischen Nachweisen. Asymptomatische Nachweise unterschieden sich nicht von virusnegativen Kontrollen (nasales FDR = 0,792; Blut-FDR = 0,082). Die Module verfolgten somit die symptomatische Wirtsantwortaktivität deutlicher als der alleinige virale Nachweis.
Klinische Referenzwerte definierten die Grenze zwischen Wirtsantwort und Pathogenspezifität
Klinische Referenzwerte definierten den Unterschied zwischen Aktivität der Wirtsantwort und Pathogenklassifizierung (Tabelle 5; Abbildung 7). In GSE63990 erzielte das nasale Modul AUROCs von 0,782 für virale versus bakterielle Erkrankungen und 0,791 für virale versus nichtinfektiöse Erkrankungen. Das Blutmodul ergab entsprechend AUROCs von 0,678 und 0,753. Der Pandya-33-mRNA-Vergleichsansatz zeigte bessere Werte mit AUROCs von 0,867 bzw. 0,852. Dieses Ergebnis ist bei einem für die Unterscheidung von viral und nicht-viral konzipierten Satz zu erwarten und zeigt, dass die Ankermodule nicht als Ersatz-Diagnoseklassifikatoren dargestellt werden sollten.
| Datensatz | Kontrast | Nasal-Anker | Blut-Anker | Pandya 33 mRNA | Andres-Terre ISG | Hallmark Interferon-alpha |
| GSE63990 | Viral vs. bakteriell | 0,782 | 0,678 | 0,867 | 0,833 | 0,831 |
| GSE63990 | Viral vs. nicht-infektiös | 0,791 | 0,753 | 0,852 | 0,851 | 0,848 |
| GSE40012 | Virale Pneumonie vs. bakterielle Pneumonie | 0,755 | 0,789 | 0,893 | 0,867 | 0,872 |
| GSE40012 | Virale Pneumonie vs. SIRS | 0,897 | 0,907 | 0,985 | 0,965 | 0,956 |
| GSE40012 | Virale Pneumonie vs. gesund | 0,804 | 0,986 | 0,923 | 0,906 | 0,891 |
| GSE40012 | Bakterielle Pneumonie vs. gesund | 0,476 | 0,917 | 0,465 | 0,391 | 0,378 |
| GSE53543 | Ex vivo Rhinovirus-stimulierte vs. unstimulierte PBMCs | 1 | 0,957 | 1 | 1 | 1 |
Tabelle 5: AUROC-Benchmark für Ankermodule und Referenz-Sets zur Wirtsantwort. GSE63990 und GSE40012 sind klinische Ganzblut-Kohorten. GSE53543 ist ein ex vivo PBMC-Störungsexperiment mit 98 gepaarten Probanden und wird separat von den natürlichen klinischen Kohorten berichtet. Die Referenz-Sets wurden als ungewichtete Genmittelwerte bewertet, anstelle ihrer ursprünglichen gewichteten Klassifikatoren. AUROC-Werte werden als Benchmarking-Maßzahlen angegeben und nicht als Schätzwerte der klinischen diagnostischen Leistung.

Abbildung 7. AUROC-Benchmarking von Ankermodulen und Referenz-Host-Response-Sets. Die Zeilen repräsentieren vorab festgelegte Vergleiche in GSE63990, GSE40012 und GSE53543; die Spalten repräsentieren die beiden Ankermodule und drei ungewichtete Referenzsets. GSE53543 ist als ex vivo Rhinovirus-stimulierte im Vergleich zu unstimulierten PBMCs gekennzeichnet und separat von den natürlichen klinischen Kohorten dargestellt. Der Hallmark-Vergleichsset ist als Hallmark-Interferon-alpha gekennzeichnet. Die Zellenwerte geben die zur Methodenbewertung verwendeten AUROC-Werte an und sollten nicht als Schätzwerte der klinischen diagnostischen Leistung interpretiert werden. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
GSE40012 präzisierte diese Grenze. Der Pandya-Vergleichsalgorithmus erreichte AUC-Werte (AUROC) von 0,893 für virale versus bakterielle Pneumonie und von 0,985 für virale Pneumonie versus SIRS. Das Blutmodul unterschied Influenza-A-Pneumonie von gesunden Kontrollen (AUROC = 0,986) sowie von SIRS (AUROC = 0,907), trennte aber auch bakterielle Pneumonie von gesunden Kontrollen (AUROC = 0,917). Das Blutmodul misst somit eine breite, systemische entzündliche und interferonassoziierte Aktivität. Es ist nicht virus-spezifisch, und ein hoher Wert kann keine Zuweisung zur Erregerklasse ermöglichen.
In dem separaten ex vivo PBMC-Benchmark GSE53543 erreichten das nasale Modul und die Interferon-Vergleichsparameter für Rhinovirus-stimulierte gegenüber nur mit Medium behandelten PBMCs einen AUROC von 1,000; das Blutmodul erreichte einen AUROC von 0,957. Alle 98 Probanden trugen gepaarte Bedingungen bei. Dieses kontrollierte Ergebnis untermauert die Ansprechbarkeit der bewerteten Programme auf Rhinovirus-Stimulation. Es schätzt jedoch nicht die klinische diagnostische Leistungsfähigkeit ab.
Robustheitsprüfungen testeten Modulgröße, zufällige Alternativen und Stabilität der Auswahl
Die Ankerseparation blieb unverändert bei den jeweils 10, 25, 50, 100 und 200 am höchsten bewerteten Genen (Abbildung 8A). Diese internen AUROC-Werte stellen keine externe Validierung dar, zeigen aber, dass das qualitative Ergebnis nicht davon abhängt, exakt 50 Gene auszuwählen. Bei 500 zufälligen 50-Gen-Sätzen lagen die medianen Null-AUROC-Werte bei 0,489 für nasales Gewebe und 0,705 für Blut; die entsprechenden 99. Perzentile betrugen 0,722 bzw. 0,872 (Abbildung 8B). Die beobachteten Module lagen über diesen Nullverteilungen. Die Häufigkeiten der Bootstrap-Auswahl waren breit verteilt und nicht auf eine einzige invariable Liste konzentriert (Abbildung 8C). Dieses Ergebnis spiegelt direkt die geringe Größe der Ankerstichprobe wider. Es untermauert ein stabiles Gesamtsignal, warnt jedoch davor, jedes ausgewählte Gen als feststehend zu betrachten.

Abbildung 8. Analysen zur Modulgröße, Zufalls-Gen- und Bootstrap-Robustheit. (A) Anchor-AUROC über Modulgrößen von 10, 25, 50, 100 und 200 Genen; diese Werte stellen interne Sensitivitätsprüfungen dar. (B) AUROC-Verteilungen aus 500 zufälligen, protein-kodierenden 50-Gen-Sätzen, die ohne Zurücklegen aus den in GSE117827 vertretenen Genen gezogen wurden (Zufallskeimzahl = 20260622). Die orangefarbenen Punkte zeigen die beobachteten Modul-AUROCs an. Horizontale Linien innerhalb jedes Violin-Plots kennzeichnen das 25. Perzentil, den Median und das 75. Perzentil. (C) Bei der Bootstrap-Neuauswahl wurden nur die 1.000 protein-kodierenden Gene mit positivem Effekt berücksichtigt, die in der ursprünglichen Anchor-Analyse für jeden Kompartiment am höchsten eingestuft wurden. Die Balken zeigen die 20 Gene mit der höchsten Selektionshäufigkeit pro Kompartiment an; die Selektionshäufigkeit wurde als Anzahl der Auswahlen dividiert durch 100 berechnet. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Marker-Programm- und Varianzanalysen verdeutlichten, was die Werte messen
In den Datensätzen GSE40012, GSE53543 und GSE63990 korrelierten beide Module am stärksten und konsistentest mit dem myeloischen Interferon-Programm (Abbildung 9A). Die Korrelationen des Nasal-Moduls betrugen 0,812, 0,878 und 0,882; die des Blut-Moduls 0,517, 0,843 und 0,774. Die Varianzaufteilung war beschreibend (Tabelle 6; Abbildung 9B). Für das Blut-Modul erklärten die biologische Bedingung und die detaillierte Gruppe mehr Varianz (Eta² = 0,282 bzw. 0,250) als der Datensatz (0,066), der Proben-Typ (0,026) oder die Quellgruppe (0,025). Für das Nasal-Modul erklärten ebenfalls die detaillierte Gruppe und die biologische Bedingung mehr Varianz als der Datensatz, der Proben-Typ oder die Quellgruppe. Biologische Bedingung und detaillierte Gruppe trugen somit zu einem größeren Anteil an der Varianz der Modulwerte bei als der Datensatz oder der Proben-Typ, obwohl nicht vernachlässigbare Effekte des Datensatzes und der Probengruppenzusammensetzung eine Limitation der erneuten Nutzung öffentlicher Bulk-Daten darstellen.

Abbildung 9. Korrelationen zwischen Markern und Programmen sowie deskriptive Varianzzerlegung. (A) Spearman-Korrelationen zwischen Modul-Scores und sechs Marker-Programm-Scores in GSE40012, GSE53543 und GSE63990. Für die Programme wurden mindestens drei vertretene Gene benötigt. P-Werte wurden über alle Dataset-Modul-Programm-Korrelationen hinweg adjustiert. Leere Zellen zeigen nicht verfügbare oder nicht schätzbare Kombinationen nach Gen- und Stichprobenanforderungen an. (B) Einfaktorielles Eta-Quadrat (η2; Anteil der Quadratsumme zwischen den Gruppen an der gesamten Quadratsumme) für Bedingung, detaillierte Gruppe, Datensatz, Probenart und Quellgruppe. Die Analyse umfasste 934 Blut-Modul- und 1.469 Nasen-Modul-Scores und ist deskriptiv, nicht kausal. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.
| Modul | Faktor | Eta-Quadrat | n Stichproben |
| Ankerblut | Bedingung | 0.282 | 934 |
| Ankerblut | Detaillierte Gruppe | 0.25 | 934 |
| Ankerblut | Datensatz | 0.066 | 934 |
| Ankerblut | Probenart | 0.026 | 934 |
| Ankerblut | Quellgruppe | 0.025 | 934 |
| Ankernasal | Detaillierte Gruppe | 0.17 | 1469 |
| Ankernasal | Bedingung | 0.13 | 1469 |
| Ankernasal | Datensatz | 0.021 | 1469 |
| Ankernasal | Probenart | 0.006 | 1469 |
| Ankernasal | Quellgruppe | 0.002 | 1469 |
Tabelle 6: Deskriptive Varianzaufteilung der Modulwerte. Für jedes Modul-Faktor-Paar ist eine Zeile mit dem entsprechenden Eta-Quadrat und der Stichprobengröße angegeben. Eta-Quadrat wurde berechnet als die Quadratsumme zwischen den Gruppen dividiert durch die gesamte Quadratsumme, nachdem Zeilen mit fehlenden Werten für den jeweiligen Modulwert oder Faktor ausgeschlossen wurden. Die Faktoren wurden einzeln bewertet; daher ist die Analyse deskriptiv, berücksichtigt keine gegenseitig korrelierten Faktoren und darf nicht kausal interpretiert werden.
Datenverfügbarkeit:
Alle in dieser Studie analysierten transkriptomischen Datensätze sind öffentlich über die Gene Expression Omnibus unter den Zugangsnummern GSE117827, GSE41374, GSE152075, GSE156063, GSE171110, GSE38900, GSE97741, GSE97742, GSE63990, GSE40012 und GSE53543 verfügbar. Die aus der Analyse gewonnenen Daten, die den Hauptabbildungen und -tabellen zugrunde liegen, sowie der Analysecode sind auf begründete Anfrage beim entsprechenden Autor erhältlich. In dieser Studie wurden keine eingeschränkten oder neu generierten daten auf Ebene der Teilnehmer verwendet.