Diese Studie wurde vom Institutional Review Board des First Affiliated Hospital of Bengbu Medical University genehmigt (Genehmigungsnummer: 2023YJS162). Vor der Probenentnahme wurde von allen Teilnehmern eine schriftliche informierte Zustimmung eingeholt.
Datenerhebung
Die in dieser Studie verwendeten Transkriptomdaten stammen aus der Gene Expression Omnibus (GEO)-Datenbank (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). Der primäre Trainingsdatensatz, GSE150910, wurde mit der Illumina NovaSeq 6000-Plattform (GPL24676) erstellt und umfasste 103 IPF- und 103 normale Lungengewebeproben. Zur Validierung der Ergebnisse wurden unabhängige Datensätze GSE24206, GSE110147, GSE93606 und GSE38958 verwendet. Detaillierte Informationen zu jedem Datensatz finden sich in Tabelle 1. Zusätzlich wurden aus einer zuvor veröffentlichtenStudie insgesamt 636 GRGs ausgewählt.
Differentialexpressionsanalyse und funktionale Charakterisierung glykosylationsbezogener DEGs
Die differentielle Expressionsanalyse zwischen IPF und normalen Lungengewebeproben aus dem GSE150910-Datensatz wurde mit dem R-Paket DESeq2 (RRID: SCR_015687) durchgeführt. Gene mit einem angepassten P-Wert (padj) < 0,05 und |log2FoldChange| > 0,5 wurden als differentiell exprimierte Gene (DEGs) betrachtet. Glykosylationsbezogene DEGs (GR-DEGs) wurden identifiziert, indem die DEGs mit einem vordefinierten Set von 636 GRGs geschnitten wurden. Um die biologischen Rollen dieser Gene weiter zu untersuchen, wurden eine Analyse der Genontologie (GO) Anreicherung und die Kyoto Encyclopedia of Genes and Genomes (KEGG) Signalweganalysen durchgeführt, um ihre funktionellen Funktionen und die Beteiligung an den Signalwegen zu klären. Ein Protein-Protein-Interaktionsnetzwerk (PPI) wurde mithilfe der STRING-Datenbank (RRID: SCR_005223)15 mit einem Interaktionskonfidenzwert von > 0,7 erstellt, um die molekularen Wechselwirkungen und potenziellen regulatorischen Mechanismen der GR-DEGs im IPF zu erläutern.
Screening von Schlüsselgenen und Erstellung eines diagnostischen Modells
Um wichtige Gene für IPF aus GR-DEGs zu screenen, verwendeten wir mehrere maschinelle Lernalgorithmen. Anfangs wurde die LASSO-Regression (RRID: SCR_003418) mit binärer logistischer Regression (Familie = "binomial") ausgestattet, und der optimale Strafparameter λ wurde mittels 10-facher Kreuzvalidierung (nfold = 10) ausgewählt. Die endgültigen Auswahlergebnisse waren die Merkmale mit von null verschiedenen Koeffizienten, die λ_(min) (0,01700442) entsprechen. Für SVM-RFE wurde die RFE-Funktion aus dem R-Paket Caret verwendet. Die rekursive Feature-Elimination erfolgte durch 10-fache Kreuzvalidierung (Methode = "cv", Anzahl = 10), wobei Features schrittweise von 1 bis 126 gefiltert wurden, wobei mit Genauigkeit die optimale Feature-Teilmenge bestimmt wurde. In XGBoost wurde die Zielfunktion auf binäre logistische Regression gesetzt (Ziel = "binär: logistisch"), wobei die Auswertungsmetrik auf Log Loss (eval_metric = "Logloss" gesetzt, die Anzahl der Iterationen (nrounds) auf 100 und die Lernrate (ETA) auf 0,1 gesetzt wurde. Die Top 20 Gene wurden basierend auf ihren Merkmals-Wichtigkeitswerten (Gain) ausgewählt. Durch das Überschneiden der Ergebnisse dieser Methoden wurde ein verfeinerter Satz von Schlüsselgenen identifiziert. Auf Basis dieses Gensatzes wurde ein XGBoost-Diagnosemodell mit dem Trainingsdatensatz (GSE150910) erstellt, dessen prädiktive Leistung mittels Analyse der Empfänger-Betriebseigenschaften (ROC) auf externen Validierungsdatensätzen (GSE110147, GSE24206, GSE93606 und GSE38958) bewertet wurde. Zusätzlich wurde ein Nomogramm entwickelt, um den Beitrag jedes ausgewählten Gens zur Krankheitswahrscheinlichkeit zu visualisieren, und der klinische Nutzen des Modells wurde durch Kalibrierungskurven und Entscheidungskurvenanalyse (DCA) weiter bewertet.
Erforschung der biologischen Wege wichtiger Gene
Den biologischen Kontext der durch maschinelles Lernen identifizierten Schlüsselgene zu erforschen. Die Gene Set Enrichment Analysis (GSEA)16 wurde auf Basis der Genlisten aus der Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17durchgeführt und die Signalwege wurden auf NES > 1 getestet. Die oberen angereicherten Wege wurden mit der Enrichplot-Funktion visualisiert.
Untersuchung der biologischen Funktion und der Unterschiede in der Immunlandschaft in IPF-Subtypen basierend auf wichtigen Genwerten
Basierend auf den Expressionsprofilen der identifizierten Schlüsselgene wurden Einzelstichproben-Gene Set Enrichment Analysis (ssGSEA)-Scores berechnet und verwendet, um IPF-Patienten basierend auf dem Medianwert in hoch- und niedrig bewertete Gruppen zu schichten. Zwischen den beiden Gruppen wurde eine differentielle Expressionsanalyse durchgeführt, gefolgt von GSEA (RRID: SCR_003199)18 , um GO Biological Processes (GOBP) und KEGG Pathway-Anreicherungsanalysen an den DEGs durchzuführen.
Analyse der Immunzellinfiltration und wichtiger Genexpressionsunterschiede
Nach einer Untergruppenstratifizierung basierend auf ssGSEA-Scores wurden die Unterschiede in der Immuninfiltration zwischen den High- und Low-Score-Gruppen bewertet. Zunächst berechneten wir die relativen Häufigkeiten von 22 Immunzelltypen in den Proben mit dem CIBERSORT-Algorithmus (RRID: SCR_016955)19 in Kombination mit der LM22-Merkmalsmatrix. Konkret wurde die deconv_tme-Funktion im R-Paket IOBR (Parameter: method = "cibersort", Arrays = FALSE, perm = 200) für die Berechnungen verwendet, und mit dem ggpubr-Paket (RRID: SCR_021139) wurden Boxplots erstellt, um Unterschiede in der Immunzellinfiltration zwischen den High-Score- und Lowscore-Gruppen zu bewerten. Zusätzlich wurde die GSVA-Funktion im R-Paket GSVA (unter Verwendung der ssGSEA-Methode) verwendet, um Anreicherungswerte für 28 Immunzelltypen zu berechnen. Diese Werte wurden dann mittels Min-Max-Skalierung normalisiert, um sie dem [0, 1]-Intervall zuzuordnen und so Vergleiche zwischen Zelltypen zu erleichtern. Schließlich wurden Wilcoxon-Rangsummentests durchgeführt, um die Expression wichtiger Gene zwischen normalen Proben und IPF-Patienten in den GSE150910- und GSE110147-Datensätzen zu vergleichen und eine umfassende Analyse der Unterschiede in Immunzellinfiltration und Genexpression zwischen IPF-Untergruppen zu bieten.
Validierung von Schlüsselgenen bei IPF-Patienten mittels RT-qPCR-Analyse
Um die diagnostische Relevanz der identifizierten Gene zu validieren, wurden sechs Gene mit den höchsten Wichtigkeitswerten aus dem XGBoost-Algorithmus für die Expression Level-Validierung bei IPF-Patienten und gesunden Kontrollpersonen mittels Reverse Transcription Quantitative PCR (RT-qPCR) ausgewählt. Insgesamt wurden 20 Blutproben entnommen, darunter 9 von IPF-Patienten und 11 von gesunden Personen, vom First Affiliated Hospital der Bengbu Medical University. Die Gesamt-RNA wurde aus den Blutproben extrahiert und die RNA-Konzentration mit einem multifunktionalen Mikroplattenleser gemessen. Die RNA-Qualität wurde vor Downstream-Analysen bewertet. Genomische DNA wurde während der Reverse-Transkription entfernt, und die für RT-qPCR verwendeten Primersequenzen sind in Tabelle 2 aufgeführt. Die Primer-Spezifität wurde durch eine Analyse der Schmelzkurve bestätigt. GAPDH wurde als internes Referenzgen verwendet. Die relativen Genexpressionsniveaus wurden mit der 2-ΔΔCt-Methode berechnet. Dieser Validierungsschritt liefert vorläufige experimentelle Unterstützung für die differenzielle Expression und potenzielle diagnostische Relevanz der identifizierten Gene im IPF.
Statistische Analyse
Die Daten wurden in R analysiert, und der Wilcoxon-Test wurde verwendet, um Unterschiede zwischen den beiden Gruppen zu erkennen. Die GSEA-, GO- und KEGG-Anreicherungsanalysen wurden mit dem R-Paket clusterProfiler (RRID: SCR_016884) durchgeführt. Ein p-Wert < 0,05 galt als signifikant, sofern nicht anders angegeben.