Acquisitie uit de TCGA-database
RNA-sequencinggegevens en klinische informatie voor de TCGA breast invasive carcinoma (TCGA-BRCA) cohort zijn verkregen uit het genomic data commons portaal14. STAR workflow RNA-seq gegevens in transcripts per million (TPM) formaat werden geëxtraheerd samen met de bijbehorende klinische annotaties. RNA-seq monsters zonder overeenkomstige klinische informatie werden uitgesloten. Voor expressiegebaseerde analyses werden TPM-waarden getransformeerd als log2(TPM + 1). MPO-expressie werd geëxtraheerd met behulp van het gensymbool MPO en Ensembl gen-ID ENSG00000005381.8. Voor analyses waarbij een indeling in MPO-hoog en MPO-laag vereist was, werden alleen TCGA-BRCA tumor-monsters opgenomen en werden aangrenzende normale monsters uitgesloten van de groepsindeling. Tumor-monsters werden verdeeld op basis van de mediaanwaarde van de log2(TPM + 1)-getransformeerde MPO-expressie binnen de TCGA-BRCA tumor-monsters. Monsters met een MPO-expressie groter dan of gelijk aan de mediaan werden toegewezen aan de MPO-hoge groep, terwijl monsters onder de mediaan werden toegewezen aan de MPO-lage groep. Deze op de mediaan gebaseerde groeperingsstrategie werd gebruikt voor overlevingsanalyse, differentiële expressieanalyse, verrijkingsanalyse, methyleringsgroepering en vergelijkingen van immuuncelverrijking, tenzij anders aangegeven. Klinisch-pathologische kenmerken, waaronder geslacht, leeftijd, etniciteit, pathologisch T-stadium, histologische graad, PAM50-subtype, pathologisch stadium, tumorstatus en overlevingsuitkomsten, waaronder algehele overleving (OS), progressievrije interval (PFI) en ziektespecifieke overleving (DSS), werden geanalyseerd met R versie 4.2.1.
Openbare zoekfunctie voor immunohistochemie-afbeeldingen
Representatieve immunohistochemie-afbeeldingen (IHC) van MPO van aangrenzend normaal borstweefsel en borstkankerweefsel werden gebruikt als kwalitatieve referenties voor het eiwitniveau. Deze afbeeldingen zijn niet opgenomen in kwantitatieve morfometrische of statistische analyses. De omkaderde gebieden geven regio's aan die bij een hogere vergroting worden getoond. Schaalbalken geven 100 µm aan in de 20× afbeeldingen en 50 µm in de 40× afbeeldingen.
Analyse van expressiecorrelatie
De TCGA-BRCA-dataset werd gebruikt om genen te onderzoeken die samen variëren met de MPO-expressie bij borstkanker. Genoombrede Pearson-correlatiecoëfficiënten werden berekend tussen MPO en proteencoderende genen, waarbij de top 30 positief en de top 30 negatief gecorreleerde genen werden geselecteerd voor visualisatie. Voor correlatieanalyses met meerdere geteste genen werden de nominale p-waarden gecorrigeerd met de Benjamini-Hochberg-methode voor de false discovery rate. Het MPO-geassocieerde proteïne-proteïne interactie (PPI) netwerk werd geconstrueerd met behulp van de Search Tool for the Retrieval of Interacting Genes/Proteins (STRING) database, waarbij proteïne-paren met interactiescores groter dan 0,40 werden behouden voor visualisatie15.
Functionele verrijkingsanalyse
Differentieel tot expressie gekomen genen (DEGs) werden geïdentificeerd door de MPO-hoge en MPO-lage TCGA-BRCA tumorgroepen te vergelijken met drempelwaarden van |log2FC| > 1 en een volgens Benjamini-Hochberg gecorrigeerde p-waarde < 0,05. Functionele enrichment-analyse van de DEGs werd uitgevoerd met het R-pakket clusterProfiler versie 4.4.4, inclusief gene ontology (GO) biologische processen, cellulaire componenten, moleculaire functies en Kyoto encyclopedia of genes and genomes (KEGG) pathway-analyses16,17,18,19,20. Verrijkte GO- en KEGG-termen werden als significant beschouwd wanneer de gecorrigeerde p-waarde < 0,05 was.
Gene set enrichment analysis (GSEA) werd uitgevoerd met behulp van een vooraf gerangschikte genenlijst op basis van differentiële expressiestatistieken tussen MPO-high en MPO-low groepen. De MSigDB C2 Canonical Pathways collectie c2.cp.all.v2022.1.Hs.symbols.gmt, overeenkomend met MSigDB v2022.1.Hs en bevattend 3.050 gene sets, werd gebruikt21,22. Verrijkte termen werden als significant beschouwd op basis van een Benjamini–Hochberg gecorrigeerde p-waarde < 0,05, FDR q-waarde < 0,25 en |genormaliseerde verrijkingsscore| > 1. Indien van toepassing werden Z-scores voor significant verrijkte termen berekend met het GOplot-pakket voor visualisatie.
Analyse van immuuncelverrijking in tumoren
De immuun- en stromale componenten in de TCGA-BRCA cohort werden geëvalueerd met behulp van het ESTIMATE-algoritme, geïmplementeerd in het R-pakket estimate versie 1.0.13. Log2(TPM + 1)-getransformeerde expressiegegevens werden als input gebruikt, en de immuunscore, stromale score en ESTIMATE-score werden voor elk tumoronderzoek berekend. TIMER/TIMER2.0 werd gebruikt om associaties te evalueren tussen MPO-expressie en de geschatte infiltratieniveaus van belangrijke immuuncelpopulaties in de TCGA-BRCA cohort, waaronder B-cellen, CD8+ T-cellen, CD4+ T-cellen, macrofagen, neutrofielen en dendritische cellen23,24,25. Resultaten op basis van TIMER werden geïnterpreteerd als schattingen van immuuninfiltratie afgeleid van de overeenkomstige online bron. Voor de analyse van immuuncelverrijking over 24 immuunceltypen werd single-sample gene set enrichment analysis (ssGSEA) geïmplementeerd met behulp van het R-pakket GSVA versie 1.46.026. De LM22-immuuncel-signatuurmatrix die werd gebruikt voor CIBERSORT-gebaseerde deconvolutie van 22 immuunceltypen is opgenomen in Supplementary Table 1. Correlaties tussen MPO-expressie en immuuncelverrijkingsscores werden geëvalueerd met de Spearman-rangcorrelatie. Verschillen in immuuncelverrijkingsscores tussen de op de mediaan gedefinieerde MPO-hoge en MPO-lage tumorgroepen werden vergeleken met de Wilcoxon-rangsomtoets. Voor analyses met meerdere immuunceltypen werden p-waarden gecorrigeerd met de Benjamini-Hochberg methode voor de false discovery rate.
DNA-methylering van het MPO-gen
DNA-methylatiepatronen binnen de MPO-locus werden geëvalueerd met MethSurv. CpG-methylatie beta-waarden en overlevingsassociaties voor TCGA-BRCA werden verkregen via het MethSurv-platform. Geselecteerde MPO-gerelateerde CpG-sites werden gevisualiseerd, en hun associaties met overlevingsuitkomsten werden geëvalueerd met behulp van de resultaten van de overlevingsanalyse verstrekt door MethSurv27. Voor analyses met meerdere CpG-sites werden de p-waarden gecorrigeerd over de geteste MPO-gerelateerde CpG-sites met de Benjamini-Hochberg-methode voor de false discovery rate. Deze methylatieanalyses werden geïnterpreteerd als exploratieve epigenetische annotaties.
Constructie van een PPI-netwerk en correlatieanalyse van neutrofiel-gerelateerde genen
Om de associatie tussen MPO en neutrofiel-gerelateerde biologie te onderzoeken, werd een systematische netwerkanalyse uitgevoerd. Een genset bestaande uit gevestigde mediatoren van neutrofielactivatie en geassocieerde ontstekingsprocessen werd samengesteld op basis van de huidige literatuur. De volledige lijst met neutrofiel-gerelateerde genen is opgenomen in Aanvullende Tabel 2. Gensymbolen werden geharmoniseerd naar officiële gensymbolen, dubbele vermeldingen werden verwijderd en de beschikbare genen werden gekruist met de TCGA-BRCA expressiematrix voorafgaand aan de STRING/PPI-analyse, prioritering van hub-genen en de correlatieanalyse tussen MPO en hub-genen. Het PPI-netwerk tussen deze genen werd geconstrueerd met behulp van de STRING-database (versie 11.5) met een drempelwaarde voor de interactiescore van gemiddelde betrouwbaarheid (>0,40). Hub-genen binnen dit netwerk werden algoritmisch geprioriteerd op basis van de graadcentraliteit (degree centrality), wat het aantal directe interacties per knoop kwantificeert. De 20 genen met de hoogste graadscores werden geselecteerd voor de daaropvolgende correlatieanalyse.
Vervolgens werden de expressieprofielen van deze hub-genen en MPO geëxtraheerd uit de TCGA-BRCA transcriptomische dataset. De associatie tussen MPO en elk hub-gen werd statistisch geëvalueerd met behulp van de rankcorrelatie van Spearman. Om de correlatiepatronen tussen de hub-genen onderling te karakteriseren, werd een paarsgewijze Spearman-correlatiematrix berekend over alle tumorstalen. Deze correlatieanalyses vormden de kwantitatieve basis voor de daaropvolgende visualisaties, waaronder de lollipop-plot van de correlaties tussen MPO en de hub-genen en het chord-diagram/heatmap dat de correlatiepatronen van de hub-genen weergeeft.
Voorspelling van upstream transcriptiefactoren en miRNA's die MPO targeten
De KnockTF-database (https://bio.liclab.net/KnockTF/index.php)28,29, de ChIP-database (http://chip-atlas.org/)30,31 en de GTRD-database32,33 (https://gtrd.biouml.org/#!) werden gebruikt om de doelwit-TF's van MPO te voorspellen. Daarnaast werd de TargetScan-database (https://www.targetscan.org/vert_80/) gebruikt om potentiële miRNA-bindingsplaatsen die MPO targeten te voorspellen. Venn-diagrammen werden gegenereerd met behulp van de MicroBioinformatics-website (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
Single-cell analyse van MPO
De specifieke dataset GSE161529 is afkomstig van de Gene Expression Omnibus (GEO). Bij de preprocessing van de gegevens werd eerst filtering op celniveau uitgevoerd om cellen van lage kwaliteit uit te sluiten; dit betrof cellen die voldeden aan een van de volgende criteria: een mitochondriale genexpressie van meer dan 25%, een totaal aantal unique molecular identifiers (UMI) lager dan 5000, of minder dan 2500 gedetecteerde genen. Vervolgens werden ambient RNA-contaminatie en technische batch-effecten gecorrigeerd35. Voor dimensiereductie werd een principal component analysis (PCA) uitgevoerd om de cellulaire gelijkenis te beoordelen, gevolgd door UMAP voor celclustering en visualisatie. Daarna werden de verschillende clusters, op basis van de typische markergenen van cellen, geannoteerd naar celtypen11. De MPO-geassocieerde genset die is gebruikt voor de single-cell signature scoring is opgenomen in Supplementary File 1. Voorafgaand aan de scoring werden gensymbolen geharmoniseerd naar officiële gensymbolen, werden dubbele vermeldingen verwijderd en werden de beschikbare genen geïntersecteerd met de expressiematrix van GSE161529. AUCell, Seurat AddModuleScore en ssGSEA werden gebruikt om de MPO-geassocieerde scores per cel te berekenen. De scores van deze drie methoden werden Z-score genormaliseerd, geschaald naar een vergelijkbaar bereik en geïntegreerd om een samengestelde MPO-geassocieerde score te genereren voor verdere beschrijvende analyses. Cel-cel interactienetwerken werden onderzocht om de afgeleide ligand-receptor communicatiepatronen te vergelijken tussen epitheliale tumorcellen, gestratificeerd naar MPO-geassocieerd signaal, en diverse partnerceltypen. Deze resultaten werden geïnterpreteerd als beschrijvende communicatiepatronen en niet als bewijs dat MPO-expresserende cellen direct intercellulaire communicatie mediëren.
Virtuele knockdown op single-cell niveau van MPO en pad-verrijkingsanalyse met behulp van scTenifoldKnk
Virtuele knockdown van MPO op single-cell niveau werd uitgevoerd door de integratie van Seurat en scTenifoldKnk. Na standaard kwaliteitscontrole (200–6.000 genen per cel; mitochondriaal fractie < 10%) werden de gegevens log-genormaliseerd en werden 2.000 sterk variabele genen geselecteerd voor dimensionaliteitsreductie en clustering. Om MPO-relevante contexten te verrijken, werden cellen behouden die in de top 50% scoorden voor een myeloïde/neutrofiele genmodule. Vanuit deze cellen werd een MPO-buurtsubset gedefinieerd door uit te breiden vanaf MPO-positieve seeds met behulp van k = 40 dichtstbijzijnde buren in de PCA-ruimte. Deze uitgebreide subset werd niet beschouwd als een zuivere MPO-positieve populatie, en er zijn geen conclusies getrokken over de celtypeproporties op basis van deze KNN-expansiestap. Deze subset werd onderworpen aan virtuele knockdown-analyse via scTenifoldKnk, waarbij de unie van sterk variabele genen en MPO (geëxpresseerd in ≥25 cellen) als genset werd gebruikt. Significant verstoorde genen werden geïdentificeerd (FDR < 0,05, BH-gecorrigeerd). De resulterende genen werden verder geanalyseerd op functionele verrijking in GO Biological Processes en KEGG-paden (q < 0,05).
Exploratief medicijn-gen-opvraagproces en ADMET-annotatie
DGIdb werd geraadpleegd om voorlopige records van MPO-geassocieerde interacties tussen geneesmiddel-gen of chemische stof-gen te verkrijgen. Omdat interactielijsten uit databases vermeldingen kunnen bevatten die worden ondersteund door heterogene bewijstypen en mogelijk niet direct overeenkomen met klinisch toepasbare therapeutische middelen, werden de opgehaalde verbindingen behandeld als verkennende annotaties in plaats van als geprioriteerde behandelkandidaten. SwissADME en ADMETlab werden vervolgens gebruikt om de voorspelde fysisch-chemische, farmacokinetische en toxicologische eigenschappen samen te vatten. Deze in silico annotaties werden gebruikt om een voorlopige context te bieden voor de interpretatie op verbindingniveau en om de noodzaak van verdere farmacologische, toxicologische en klinische curatie te benadrukken voordat er enige therapeutische relevantie kan worden overwogen36.