Deze studie is goedgekeurd door de Institutional Review Board van het Eerste Geaffilieerde Ziekenhuis van de Bengbu Medical University (Goedkeuringsnummer: 2023YJS162). Schriftelijke geïnformeerde toestemming werd van alle deelnemers verkregen voorafgaand aan de monsterafname.
Dataverzameling
De transcriptoomgegevens die in deze studie werden gebruikt, zijn verkregen uit de Gene Expression Omnibus (GEO) database (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). De primaire trainingsdataset, GSE150910, werd gegenereerd met het Illumina NovaSeq 6000-platform (GPL24676) en bestond uit 103 IPF- en 103 normale longweefselmonsters. Om de bevindingen te valideren werden onafhankelijke datasets GSE24206, GSE110147, GSE93606 en GSE38958 gebruikt. Gedetailleerde informatie over elke dataset is te vinden in Tabel 1. Daarnaast werden in totaal 636 GRG's geselecteerd uit een eerder gepubliceerde studie14.
Differentiële expressieanalyse en functionele karakterisering van glycosyleringsgerelateerde DEG's
Differentiële expressieanalyse tussen IPF- en normale longweefselmonsters uit de GSE150910-dataset werd uitgevoerd met behulp van het R-pakket DESeq2 (RRID: SCR_015687). Genen met een aangepaste P-waarde (padj) < 0,05 en |log2FoldChange| > 0,5 werden beschouwd als differentieel expressieve genen (DEGs). Glycosyleringsgerelateerde DEG's (GR-DEGs) werden geïdentificeerd door de DEG's te kruisen met een vooraf gedefinieerde set van 636 GRG's. Om de biologische rollen van deze genen verder te onderzoeken, werden Gene Ontology (GO) verrijkingsanalyse en Kyoto Encyclopedia of Genes and Genomes (KEGG) routeanalyse uitgevoerd om hun functionele rollen en padbetrokkenheid te verduidelijken. Een eiwit-eiwitinteractie (PPI) netwerk werd gegenereerd met behulp van de STRING-database (RRID: SCR_005223)15 met een interactiebetrouwbaarheidsscore van > 0,7, om de moleculaire interacties en mogelijke regulerende mechanismen van de GR-DEG's in IPF te verduidelijken.
Screening van sleutelgenen en constructie van een diagnostisch model
Om belangrijke genen voor IPF te screenen van GR-DEG's, maakten we gebruik van meerdere machine learning-algoritmen. Aanvankelijk werd LASSO-regressie (RRID: SCR_003418) voorzien van binaire logistische regressie (familie = "binomiaal") en werd de optimale strafparameter λ geselecteerd via 10-voudige kruisvalidatie (nfold = 10). De uiteindelijke selectieresultaten waren de kenmerken met niet-nul coëfficiënten die overeenkwamen met λ_(min) (0,01700442). Voor SVM-RFE werd de RFE-functie van het R-pakket caret gebruikt. Recursieve feature-eliminatie werd uitgevoerd via 10-voudige kruisvalidatie (methode = "cv", aantal = 10), waarbij features progressief werden gefilterd van 1 tot 126, met nauwkeurigheid om de optimale feature-subset te bepalen. In XGBoost werd de doelfunctie ingesteld op binaire logistische regressie (doelwit = "binair: logistisch"), met de evaluatiemetriek op log loss (eval_metric = "logloss"), het aantal iteraties (nrounds) op 100, en de leersnelheid (eta) op 0,1. De top 20 genen werden geselecteerd op basis van hun feature-belangrijkheidsscores (Gain). Door de resultaten van deze methoden te combineren, werd een verfijnde set sleutelgenen geïdentificeerd. Op basis van deze genset werd een XGBoost-diagnostisch model opgesteld met behulp van de trainingsdataset (GSE150910), en de voorspellende prestaties werden geëvalueerd met behulp van receiver operating characteristic (ROC)-analyse op externe validatiedatasets (GSE110147, GSE24206, GSE93606 en GSE38958). Daarnaast werd een nomogram ontwikkeld om de bijdrage van elk geselecteerd gen aan de ziektekans te visualiseren, en het klinische nut van het model werd verder beoordeeld via kalibratiecurves en beslissingscurveanalyse (DCA).
Verkenning van de biologische routes van belangrijke genen
Het verkennen van de biologische context van de belangrijkste genen die door machine learning zijn geïdentificeerd. Gene Set Enrichment Analysis (GSEA)16 werd uitgevoerd op basis van de genlijsten uit de Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17en de routes werden gescreend op NES > 1. De bovenste verrijkte paden werden weergegeven met behulp van de enrichplot-functie.
Onderzoek naar biologische functies en verschillen in immuunlandschap in IPF-subtypes op basis van belangrijke genscores
Op basis van de expressieprofielen van de geïdentificeerde sleutelgenen werden single-sample Gene Set Enrichment Analysis (ssGSEA) scores berekend en gebruikt om IPF-patiënten te stratificeren in groepen met hoge en lage scores op basis van de mediane score. Differentiële expressieanalyse werd uitgevoerd tussen de twee groepen, gevolgd door GSEA (RRID: SCR_003199)18 om GO Biological Processes (GOBP) en KEGG pathway verrijkingsanalyses uit te voeren op de TEG's.
Analyse van immuuncelinfiltratie en belangrijke verschillen in genexpressie
Na subgroepstratificatie op basis van ssGSEA-scores werden immuuninfiltratieverschillen tussen de hoog- en laagscoregroepen geëvalueerd. Eerst berekenden we de relatieve abundanties van 22 immuunceltypen in de monsters met behulp van het CIBERSORT-algoritme (RRID: SCR_016955)19 in combinatie met de LM22-featurematrix. Specifiek werd de deconv_tme functie in het R-pakket IOBR (parameters: method = "cibersort", arrays = FALSE, perm = 200) gebruikt voor de berekeningen, en werden box plots gegenereerd met het ggpubr-pakket (RRID: SCR_021139) om verschillen in immuuncelinfiltratie tussen de high-score en low-score groepen te beoordelen. Daarnaast werd de GSVA-functie in het R-pakket GSVA (met de ssGSEA-methode) gebruikt om verrijkingsscores te berekenen voor 28 immuunceltypen. Deze scores werden vervolgens genormaliseerd met Min-Max-schaal om ze toe te wijzen op het [0, 1] interval, wat vergelijkingen tussen celtypen vergemakkelijkte. Ten slotte werden Wilcoxon rang-somtesten uitgevoerd om de expressie van sleutelgenen tussen normale monsters en IPF-patiënten in de GSE150910- en GSE110147 datasets te vergelijken, wat een uitgebreide analyse van immuuncelinfiltratie en genexpressieverschillen tussen IPF-subgroepen opleverde.
Validatie van sleutelgenen bij IPF-patiënten met behulp van RT-qPCR-analyse
Om de diagnostische relevantie van de geïdentificeerde genen te valideren, werden zes genen met de hoogste significantiescores uit het XGBoost-algoritme geselecteerd voor expressievalidatie bij IPF-patiënten en gezonde controles met behulp van reverse transcription quantitative PCR (RT-qPCR). In totaal werden 20 bloedmonsters afgenomen, waaronder 9 van IPF-patiënten en 11 van gezonde personen, van het First Affiliated Hospital van de Bengbu Medical University. Totaal RNA werd uit de bloedmonsters geëxtraheerd en de RNA-concentratie werd gemeten met een multifunctionele microplaatlezer. De kwaliteit van RNA werd beoordeeld voorafgaand aan downstream analyses. Genomisch DNA werd verwijderd tijdens reverse transcriptie, en primersequenties gebruikt voor RT-qPCR zijn vermeld in Tabel 2. De specificiteit van de primer werd bevestigd door smeltcurveanalyse. GAPDH werd gebruikt als het interne referentiegen. Relatieve genexpressieniveaus werden berekend met de 2-ΔΔCt-methode . Deze validatiestap biedt voorlopige experimentele ondersteuning voor de differentiële expressie en potentiële diagnostische relevantie van de geïdentificeerde genen in IPF.
Statistische analyse
De gegevens werden in R geanalyseerd en de Wilcoxon-test werd gebruikt om verschillen tussen de twee groepen te detecteren. De verrijkingsanalyse van GSEA, GO en KEGG werd uitgevoerd met behulp van het R-pakket clusterProfiler (RRID: SCR_016884). Een p-waarde < 0,05 werd als significant beschouwd, tenzij anders vermeld.