To badanie zostało zatwierdzone przez Instytucjonalną Komisję Etyczną Pierwszego Szpitala Uniwersytetu Medycznego w Bengbu (Numer zgody: 2023YJS162). Pisemną, poinformowaną zgodę wszyscy uczestnicy wyrazili przed zebraniem próbek.
Zbieranie danych
Dane transkryptomu użyte w tym badaniu zostały uzyskane z bazy danych Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). Główny zestaw danych treningowych, GSE150910, został wygenerowany przy użyciu platformy Illumina NovaSeq 6000 (GPL24676) i obejmował 103 próbki tkanki płucnej IPF i 103 normalne próbki tkanki płucnej. Aby zweryfikować wyniki, zastosowano niezależne zestawy danych GSE24206, GSE110147, GSE93606 i GSE38958. Szczegółowe informacje na temat każdego zestawu danych są dostępne w Tabeli 1. Dodatkowo, łącznie 636 GRG zostało wybranych z wcześniej opublikowanego badania14.
Analiza różnicowej ekspresji i charakterystyka funkcjonalna glikozylacji-związanych DEG
Analiza różnicowej ekspresji między próbkami tkanki płucnej IPF i normalnej z zestawu danych GSE150910 została przeprowadzona za pomocą pakietu R DESeq2 (RRID: SCR_015687). Geny o wartości P-value (padj) < 0.05 i |log2FoldChange| > 0.5 zostały uznane za geny o zróżnicowanej ekspresji (DEG). Glikozylacja-związane DEG (GR-DEG) zostały zidentyfikowane przez przecięcie DEG z wstępnie zdefiniowanym zestawem 636 GRG. Aby dalsze zbadać biologiczne role tych genów, przeprowadzono analizę wzbogacenia Gene Ontology (GO) oraz analizę ścieżek Kyoto Encyclopedia of Genes and Genomes (KEGG), aby wyjaśnić ich funkcjonalne role i zaangażowanie w ścieżki. Sieć interakcji białko-białko (PPI) została wygenerowana przy użyciu bazy danych STRING (RRID: SCR_005223)15 z progiem pewności interakcji na poziomie > 0.7, aby wyjaśnić molekularne interakcje i potencjalne mechanizmy regulacyjne GR-DEG w IPF.
Ekranowanie kluczowych genów i budowa modelu diagnostycznego
Aby ekranować kluczowe geny IPF z GR-DEG, zastosowaliśmy wiele algorytmów uczenia maszynowego. Początkowo, regresja LASSO (RRID: SCR_003418) została dopasowana do regresji logistycznej binarnej (family = “binomial”) i optymalny parametr kary λ został wybrany poprzez 10-krotną walidację krzyżową (nfold = 10). Ostateczne wyniki selekcji to funkcje z niezerowymi współczynnikami odpowiadającymi λ_(min) (0.01700442). W przypadku SVM-RFE zastosowano funkcję rfe z pakietu R caret. Rekurrencyjne usuwanie funkcji zostało przeprowadzone poprzez 10-krotną walidację krzyżową (method = “cv”, number = 10), stopniowo filtrowano funkcje od 1 do 126, przy czym do określenia optymalnego podzbioru funkcji używano dokładności. W XGBoost funkcja celu została ustalona na regresję logistyczną binarną (objective = “binary: logistic”), z metryką ewaluacyjną ustawioną na log loss (eval_metric = “logloss”), liczbą iteracji (nrounds) ustawioną na 100, a stałą uczenia (eta) ustawioną na 0.1. Top 20 genów zostało wybranych na podstawie ich wyników ważności funkcji (Gain). Przecinając wyniki z tych metod, zidentyfikowano rafinowany zestaw kluczowych genów. Na podstawie tego zestawu genów skonstruowano model diagnostyczny XGBoost za pomocą zestawu treningowego (GSE150910), a jego wydajność predykcyjną oceniono za pomocą analizy charakterystyki operacyjnej odbiornika (ROC) na zewnętrznych zestawach walidacyjnych (GSE110147, GSE24206, GSE93606 i GSE38958). Dodatkowo, stworzono nomogram, aby wizualizować wkład każdego wybranego genu w prawdopodobieństwo choroby, a użyteczność kliniczna modelu została dodatkowo oszacowana za pomocą krzywych kalibracji i analizy krzywych decyzyjnych (DCA).
Eksplorowanie biologicznych ścieżek kluczowych genów
Aby zbadać biologiczny kontekst kluczowych genów zidentyfikowanych przez uczenie maszynowe. Analiza wzbogacenia zestawu genów (GSEA)16 została przeprowadzona na podstawie list genów z Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17 i ścieżki były przesiewane na NES > 1. Najbardziej wzbogacone ścieżki zostały zwizualizowane za pomocą funkcji enrichplot.
Eksplorowanie funkcji biologicznej i różnic w otoczeniu immunologicznym w podtypach IPF na podstawie wyników kluczowych genów
Na podstawie profili ekspresji zidentyfikowanych kluczowych genów, obliczono wyniki pojedynczego zestawu genów (ssGSEA) i użyto ich do stratyfikacji pacjentów z IPF na grupy o wysokim i niskim wynikach na podstawie mediany. Analiza różnicowej ekspresji została przeprowadzona między dw