Erwerb aus der TCGA-Datenbank
RNA-Sequenzierungsdaten und klinische Informationen für die TCGA-Brust-invasiven-Karzinom-Kohorte (TCGA-BRCA) wurden vom Genomic Data Commons-Portal bezogen14. STAR-Workflow-RNA-Seq-Daten im Format Transkripte pro Million (TPM) wurden zusammen mit den passenden klinischen Annotationen extrahiert. RNA-Seq-Proben ohne entsprechende klinische Informationen wurden ausgeschlossen. Für expressionsbasierte Analysen wurden die TPM-Werte als log2(TPM + 1) transformiert. Die MPO-Expression wurde mithilfe des Gen-Symbols MPO und der Ensembl-Gen-ID ENSG00000005381.8 extrahiert. Für Analysen, die eine Einteilung in MPO-hoch und MPO-niedrig erforderten, wurden ausschließlich TCGA-BRCA-Tumorproben einbezogen, während benachbarte normale Proben von der Gruppeneinteilung ausgeschlossen wurden. Die Tumorproben wurden anhand des Medianwerts der log2(TPM + 1)-transformierten MPO-Expression unter den TCGA-BRCA-Tumorproben aufgeteilt. Proben mit einer MPO-Expression größer oder gleich dem Medianwert wurden der MPO-hoch-Gruppe zugeordnet, während Proben unterhalb des Medians der MPO-niedrig-Gruppe zugeordnet wurden. Diese medianbasierte Gruppierungsmethode wurde für die Überlebensanalyse, differentielle Expressionsanalyse, Anreicherungsanalyse, Methylierungsgruppierung und Vergleiche der Immunzellanreicherung verwendet, sofern nicht anders angegeben. Klinisch-pathologische Merkmale, einschließlich Geschlecht, Alter, ethnische Zugehörigkeit, pathologischer T-Stadium, histologischer Grad, PAM50-Subtyp, pathologisches Stadium, Tumorstatus und Überlebensendpunkte wie Gesamtüberleben (OS), progressionsfreies Intervall (PFI) und krankheitsspezifisches Überleben (DSS), wurden mit R-Version 4.2.1 analysiert.
Öffentliche Immunhistochemie-Bildabfrage
Repräsentative MPO-Immunhistochemie-(IHC-)Bilder benachbarter normale Brustgewebe und Brustkrebsgewebe wurden als qualitative Referenzen auf Proteinebene verwendet. Diese Bilder wurden nicht in quantitative morphometrische oder statistische Analysen einbezogen. Die markierten Felder zeigen Bereiche, die in höherer Vergrößerung dargestellt sind. Maßstabsbalken entsprechen 100 µm in den 20×-Bildern und 50 µm in den 40×-Bildern.
Expressionskorrelationsanalyse
Der TCGA-BRCA-Datensatz wurde verwendet, um Gene zu untersuchen, die gemeinsam mit der MPO-Expression im Brustkrebs variieren. Genomweite Pearson-Korrelationskoeffizienten wurden zwischen MPO und protein-kodierenden Genen berechnet, und die 30 am stärksten positiv sowie die 30 am stärksten negativ korrelierten Gene wurden zur Visualisierung ausgewählt. Bei Korrelationsanalysen, an denen mehrere Gene getestet wurden, wurden die nominalen p-Werte mittels der False-Discovery-Rate-Methode nach Benjamini-Hochberg korrigiert. Das MPO-assoziierte Protein-Protein-Interaktionsnetzwerk (PPI) wurde mithilfe der Suchplattform für die Rückgewinnung interagierender Gene/Proteine (STRING-Datenbank) erstellt, wobei Proteinpaare mit Interaktionsscores über 0,40 für die Visualisierung beibehalten wurden15.
Funktionelle Anreicherungsanalyse
Differenziell exprimierte Gene (DEGs) wurden durch den Vergleich der MPO-hohen und MPO-niedrigen TCGA-BRCA-Tumorgruppen unter Verwendung der Schwellenwerte |log2FC| > 1 und ein nach Benjamini-Hochberg adjustierter p-Wert < 0,05 identifiziert. Die funktionelle Anreicherungsanalyse der DEGs wurde mit dem R-Paket clusterProfiler Version 4.4.4 durchgeführt, einschließlich Analysen der genetischen Ontologie (GO) für biologische Prozesse, zelluläre Komponenten, molekulare Funktionen sowie Analysen des Kyoto-Encyclopedia-of-Genes-and-Genomes-(KEGG)-Signalwegs16,17,18,19,20. Angereicherte GO- und KEGG-Terme galten als signifikant, wenn der adjustierte p-Wert < 0,05 war.
Die Gen-Set-Enrichment-Analyse (GSEA) wurde unter Verwendung einer vorab sortierten Genliste basierend auf Differenzialexpressionsstatistiken zwischen MPO-hohen und MPO-niedrigen Gruppen durchgeführt. Die MSigDB C2 Canonical Pathways-Sammlung c2.cp.all.v2022.1.Hs.symbols.gmt, die MSigDB v2022.1.Hs entspricht und 3.050 Gensätze enthält, wurde verwendet21,22. Bereicherte Terme wurden als signifikant betrachtet gemäß Benjamini–Hochberg-angepasstem p-Wert < 0,05, FDR q-Wert < 0,25 und |normalisierter Enrichment-Score| > 1. Gegebenenfalls wurden Z-Scores für signifikant angereicherte Terme mithilfe des GOplot-Pakets zur Visualisierung berechnet.
Analyse der Anreicherung von Immunzellen in Tumoren
Immun- und stromale Komponenten im TCGA-BRCA-Kollektiv wurden mithilfe des ESTIMATE-Algorithmus bewertet, der im R-Paket estimate Version 1.0.13 implementiert ist. Als Eingabedaten dienten log2(TPM + 1)-transformierte Expressionsdaten, und für jede Tumorprobe wurden der Immun-Score, der stromale Score sowie der ESTIMATE-Score berechnet. TIMER/TIMER2.0 wurde verwendet, um Zusammenhänge zwischen der MPO-Expression und den geschätzten Infiltrationsniveaus der wichtigsten Immunzellpopulationen im TCGA-BRCA-Kollektiv zu untersuchen, einschließlich B-Zellen, CD8+ T-Zellen, CD4+ T-Zellen, Makrophagen, Neutrophilen und dendritischen Zellen23,24,25. Die auf TIMER basierenden Ergebnisse wurden als Schätzungen der Immuninfiltration interpretiert, die aus der entsprechenden Online-Ressource stammen. Für die Analyse der Anreicherung von Immunzellen über 24 Immunzelltypen hinweg wurde eine single-sample Gen-Satz-Anreicherungsanalyse (ssGSEA) mithilfe des R-Pakets GSVA Version 1.46.026 durchgeführt. Die LM22-Immunzell-Signaturmatrix, die für die CIBERSORT-basierte Dekonvolution von 22 Immunzelltypen verwendet wurde, ist in Supplementärer Tabelle 1 enthalten. Die Korrelationen zwischen MPO-Expression und Anreicherungsscores der Immunzellen wurden mittels Spearman-Rangkorrelation bewertet. Unterschiede in den Anreicherungsscores der Immunzellen zwischen den medianbasiert definierten MPO-hohen und MPO-niedrigen Tumorgruppen wurden mit dem Wilcoxon-Rangsummentest verglichen. Bei Analysen, die mehrere Immunzelltypen umfassten, wurden die p-Werte mittels der Benjamini–Hochberg-Methode zur Fehlentdeckungsrate angepasst.
DNA-Methylierung des MPO-Gens
DNA-Methylierungsmuster innerhalb des MPO-Lokus wurden mithilfe von MethSurv analysiert. CpG-Methylierungs-Beta-Werte und Überlebensassoziationen für TCGA-BRCA wurden von der MethSurv-Plattform bezogen. Ausgewählte MPO-bezogene CpG-Stellen wurden visualisiert, und ihre Assoziationen mit Überlebensergebnissen wurden anhand der von MethSurv bereitgestellten Ergebnisse der Überlebensanalyse bewertet27. Bei Analysen, die mehrere CpG-Stellen umfassten, wurden die p-Werte über die getesteten MPO-bezogenen CpG-Stellen hinweg mittels der Benjamini-Hochberg-Methode zur Kontrolle der falschen Entdeckungsrate angepasst. Diese Methylierungsanalysen wurden als explorative epigenetische Annotationen interpretiert.
Konstruktion des PPI-Netzwerks und Korrelationsanalyse neutrophiler verwandter Gene
Um die Assoziation zwischen MPO und neutrophilenbezogener Biologie zu untersuchen, wurde eine systematische Netzwerkanalyse durchgeführt. Ein Gen-Set, bestehend aus etablierten Mediatoren der Neutrophilenaktivierung und assoziierten entzündlichen Prozessen, wurde aus der aktuellen Literatur zusammengestellt. Die vollständige Liste neutrophilenbezogener Gene ist in Supplementär-Tabelle 2 enthalten. Die Gensymbole wurden auf offizielle Gensymbole harmonisiert, doppelte Einträge entfernt, und verfügbare Gene mit der TCGA-BRCA-Expressionsmatrix geschnitten, bevor die STRING/PPI-Analyse, die Hub-Gen-Priorisierung und die MPO–Hub-Gen-Korrelationsanalyse durchgeführt wurden. Das PPI-Netzwerk zwischen diesen Genen wurde mithilfe der STRING-Datenbank (Version 11.5) mit einer mittleren Konfidenzschwelle für Interaktionen (>0.40) erstellt. Hub-Gene innerhalb dieses Netzwerks wurden algorithmisch basierend auf der Gradzentralität priorisiert, die die Anzahl direkter Interaktionen pro Knoten quantifiziert. Die 20 Gene mit den höchsten Gradwerten wurden für die nachgeschaltete Korrelationsanalyse ausgewählt.
Anschließend wurden die Expressionsprofile dieser Hub-Gene und von MPO aus dem transkriptomischen Datensatz TCGA-BRCA extrahiert. Die Assoziation zwischen MPO und jedem Hub-Gen wurde statistisch mittels Spearman-Rangkorrelation bewertet. Um die Korrelationsmuster zwischen den Hub-Genen selbst zu charakterisieren, wurde eine paarweise Spearman-Korrelationsmatrix über alle Tumorproben berechnet. Diese Korrelationsanalysen bildeten die quantitative Grundlage für nachfolgende Visualisierungen, darunter das Lollipop-Diagramm der MPO-Hub-Gen-Korrelationen sowie das Chord-Diagramm beziehungsweise die Heatmap zur Darstellung der Korrelationsmuster unter den Hub-Genen.
Vorhersage upstreamliegender Transkriptionsfaktoren und miRNAs mit MPO als Zielgen
Die KnockTF-Datenbank (https://bio.liclab.net/KnockTF/index.php)28,29, die ChIP-Datenbank (http://chip-atlas.org/)30,31 und die GTRD-Datenbank32,33 (https://gtrd.biouml.org/#!) wurden zur Vorhersage der Ziel-Transkriptionsfaktoren von MPO verwendet. Zusätzlich wurde die TargetScan-Datenbank (https://www.targetscan.org/vert_80/) genutzt, um potenzielle miRNA-Bindungsstellen, die MPO targeten, vorherzusagen. Venn-Diagramme wurden mithilfe der MicroBioinformatik-Website (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34 erstellt.
Einzelzell-Analyse von MPO
Der spezifische Datensatz GSE161529 stammt aus dem Gene Expression Omnibus (GEO). Bei der Datenpräprozessierung wurde zunächst eine Filterung auf Zellebene durchgeführt, um Zellen von geringer Qualität auszuschließen – also solche, die eines der folgenden Kriterien erfüllten: mitochondriale Genexpression über 25 %, Gesamtanzahl eindeutiger molekularer Identifikatoren (UMI) unter 5000 oder weniger als 2500 nachgewiesene Gene. Anschließend wurden Kontaminationen durch umgebende RNA sowie technische Batch-Effekte korrigiert35. Zur Dimensionsreduktion und Beurteilung der zellulären Ähnlichkeit wurde eine Hauptkomponentenanalyse (PCA) durchgeführt, gefolgt von UMAP zur Zellclustern und Visualisierung. Danach wurden die verschiedenen Cluster anhand der typischen Markergene den entsprechenden Zelltypen zugeordnet11. Der für die Signaturbewertung auf Einzelzellniveau verwendete MPO-assozierte Gen-Satz ist in Zusatzdatei 1 enthalten. Vor der Bewertung wurden die Gensymbole auf offizielle Gensymbole harmonisiert, doppelte Einträge entfernt und die verfügbaren Gene mit der Expressionsmatrix von GSE161529 abgeglichen. AUCell, Seurat AddModuleScore und ssGSEA wurden verwendet, um MPO-assozierte Scores pro Zelle zu berechnen. Die aus den drei Methoden resultierenden Scores wurden mittels Z-Score normalisiert, in einen vergleichbaren Wertebereich skaliert und kombiniert, um einen zusammengesetzten MPO-assozierten Score für nachfolgende deskriptive Analysen zu erzeugen. Zell-Zell-Interaktionsnetzwerke wurden untersucht, um abgeleitete Ligand-Rezeptor-Kommunikationsmuster zwischen epithelialen Tumorzellen, die nach MPO-assoziertem Signal stratifiziert waren, und verschiedenen Partnerzelltypen zu vergleichen. Diese Ergebnisse wurden als deskriptive Kommunikationsmuster interpretiert, nicht jedoch als Beleg dafür, dass MPO-exprimierende Zellen die interzelluläre Kommunikation direkt vermitteln.
Virtueller Knockdown einzelner Zellen von MPO und Pfadbereicherungsanalyse unter Verwendung von scTenifoldKnk
Der virtuelle Knockdown von MPO auf Einzelzellniveau wurde durch Integration von Seurat und scTenifoldKnk durchgeführt. Nach standardmäßiger Qualitätskontrolle (200–6.000 Gene pro Zelle; mitochondriale Fraktion < 10 %) wurden die Daten log-normalisiert und 2.000 hochvariable Gene zur Dimensionsreduktion und zum Clustering ausgewählt. Um MPO-relevante Kontexte anzureichern, wurden Zellen beibehalten, die innerhalb der oberen 50 % für ein myeloisches/Neutrophil-Genmodul lagen. Aus diesen Zellen wurde ein MPO-Nachbarschafts-Teilensemble definiert, indem ausgehend von MPO-positiven Ausgangszellen mittels k = 40 nächstgelegenen Nachbarn im PCA-Raum erweitert wurde. Das erweiterte Teilensemble wurde nicht als reine MPO-positive Population betrachtet, und aus diesem KNN-Erweiterungsschritt wurden keine Schlussfolgerungen über Zelltyp-Proportionen gezogen. Dieses Teilensemble wurde einer virtuellen Knockdown-Analyse mittels scTenifoldKnk unter Verwendung der Vereinigung aus hochvariablen Genen und MPO (in ≥25 Zellen exprimiert) als Genmenge unterzogen. Signifikant gestörte Gene wurden identifiziert (FDR < 0,05, BH-angepasst). Die resultierenden Gene wurden anschließend hinsichtlich funktioneller Anreicherung in GO-Biologischen Prozessen und KEGG-Wegen analysiert (q < 0,05).
Explorative Arzneimittel-Gen-Rückgewinnung und ADMET-Anmerkung
DGIdb wurde abgefragt, um vorläufige MPO-assoziierte Wechselwirkungseinträge zwischen Arzneistoffen und Genen bzw. chemischen Substanzen und Genen zu erhalten. Da aus Datenbanken stammende Interaktionslisten Einträge enthalten können, die durch heterogene Evidenztypen gestützt werden und möglicherweise nicht direkt klinisch relevante therapeutische Wirkstoffe darstellen, wurden die abgerufenen Verbindungen als explorative Annotationen und nicht als priorisierte Behandlungskandidaten behandelt. Anschließend wurden SwissADME und ADMETlab verwendet, um vorhergesagte physikochemische, pharmakokinetische und toxikologische Eigenschaften zusammenzufassen. Diese in-silico-Annotationen dienten dazu, einen vorläufigen Kontext für die Interpretation auf Ebene der Verbindungen bereitzustellen und darauf hinzuweisen, dass eine weitere pharmakologische, toxikologische und klinische Aufbereitung erforderlich ist, bevor eine therapeutische Relevanz in Betracht gezogen werden kann36.