Bu çalışma, Bengbu Tıp Üniversitesi İlk Bağlı Hastanesi Kurumsal İnceleme Kurulu tarafından onaylandı (Onay Numarası: 2023YJS162). Örnek toplamadan önce tüm katılımcılardan yazılı bilgilendirilmiş onay alındı.
Veri toplama
Bu çalışmada kullanılan transkriptom verileri, Gen İfadesi Omnibüs (GEO) veritabanından (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). Birincil eğitim veri seti GSE150910, Illumina NovaSeq 6000 platformu (GPL24676) kullanılarak oluşturuldu ve 103 IPF ile 103 normal akciğer dokusu örneğinden oluşuyordu. Bulguları doğrulamak için bağımsız veri setleri GSE24206, GSE110147, GSE93606 ve GSE38958 kullanıldı. Her veri seti hakkında ayrıntılı bilgiler Tablo 1'de verilmiştir. Ayrıca, daha önce yayımlanmış14 çalışmadan toplam 636 GRG seçildi.
Glikozilasyona bağlı DEG'lerin diferansiyel ifade analizi ve fonksiyonel karakterizasyonu
GSE150910 veri setinden IPF ile normal akciğer dokusu örnekleri arasında farklı ekspresyon analizi, R paketi DESeq2 (RRID: SCR_015687) kullanılarak gerçekleştirildi. Ayarlanmış P-değeri (padj) olan genler < 0.05 ve |log2FoldChange| > 0.5 farklı ekspresyon genler (DEG) olarak kabul edildi. Glikozilasyona bağlı DEG'ler (GR-DEG'ler), DEG'lerin önceden tanımlanmış 636 GRG setiyle kesişmesiyle tanımlanmıştır. Bu genlerin biyolojik rollerini daha da araştırmak için, fonksiyonel rollerini ve yol katılımını açıklamak için Gen Ontolojisi (GO) zenginleştirme analizi ve Kyoto Genler ve Genomlar Ansiklopedisi (KEGG) yol analizi yapıldı. IPF'deki GR-DEG'lerin moleküler etkileşimlerini ve potansiyel düzenleyici mekanizmalarını açıklamak için STRING veritabanı (RRID: SCR_005223)15 kullanılarak etkileşim güven puanı 0.7 > eşik ile oluşturuldu.
Anahtar genlerin taraması ve tanı modelinin oluşturulması
GR-DEG'lerden IPF için anahtar genleri taramak için birden fazla makine öğrenimi algoritması kullandık. Başlangıçta, LASSO regresyonu (RRID: SCR_003418) ikili lojistik regresyon (aile = "binomial") ile donatıldı ve optimal ceza parametresi λ 10 kat çapraz doğrulama ile seçildi (nfold = 10). Nihai seçim sonuçları, λ_(min) (0.01700442) ile uyumlu sıfır olmayan katsayılara sahip özelliklerdi. SVM-RFE için, R paket karetinden RFE fonksiyonu kullanılmıştır. Recursif özellik eleme, 10 katlı çapraz doğrulama (yöntem = "cv", sayı = 10) ile gerçekleştirildi; özellikler kademeli olarak 1'den 126'ya kadar filtrelendi ve optimal özellik alt kümesi belirlenmek için doğruluk kullanıldı. XGBoost'ta amaç fonksiyonu ikili lojistik regresyon olarak ayarlandı (amaç = "ikili: lojistik"), değerlendirme metriği log kaybı (eval_metric = "logloss") olarak ayarlandı, yineleme sayısı (nrounds) 100 ve öğrenme oranı (eta) 0.1 olarak ayarlandı. En iyi 20 gen, özellik önem puanlarına (Kazanç) göre seçildi. Bu yöntemlerin sonuçları kesiştirilerek, temel genlerden oluşan rafine bir seti tanımlandı. Bu gen seti temelinde, eğitim veri seti (GSE150910) kullanılarak bir XGBoost tanı modeli oluşturuldu ve öngörücü performansı, harici doğrulama veri setlerinde (GSE110147, GSE24206, GSE93606 ve GSE38958) alıcı çalışma karakteristikleri (ROC) analiziyle değerlendirildi. Ayrıca, her seçilen genin hastalık olasılığına katkısını görselleştirmek için bir nomogram geliştirildi ve modelin klinik faydası kalibrasyon eğrileri ve karar eğrisi analizi (DCA) ile daha da değerlendirildi.
Ana genlerin biyolojik yollarının keşfi
Makine öğrenimi ile tanımlanan anahtar genlerin biyolojik bağlamını keşfetmek. Gen Seti Zenginleştirme Analizi (GSEA)16 , Moleküler İmzalar Veritabanı (MSigDB) (RRID: SCR_016863)17gen listelerine dayanarak gerçekleştirildi ve yollar NES > 1 için tarandı. Üstten zenginleştirilmiş yollar, enrichplot fonksiyonu kullanılarak görselleştirildi.
IPF alt tiplerinde ana gen puanlarına dayalı biyolojik fonksiyon ve bağışıklık ortamı farklılıklarının araştırılması
Belirlenen anahtar genlerin ifade profillerine dayanarak, tek örneklemli Gen Seti Zenginleştirme Analizi (ssGSEA) skorları hesaplandı ve IPF hastalarını medyan puana göre yüksek ve düşük puanlı gruplara katmanlamak için kullanıldı. İki grup arasında farklı ekspresyon analizi yapıldı, ardından GSEA (RRID: SCR_003199)18 ile GO Biyolojik Süreçleri (GOBP) ve DEG'ler üzerinde KEGG yol zenginleştirme analizleri yapıldı.
Bağışıklık hücresi sızması ve temel gen ifade farklılıklarının analizi
ssGSEA puanlarına dayalı alt grup tabakalaşması ardından, yüksek ve düşük puanlı gruplar arasındaki bağışıklık infiltrasyon farkları değerlendirildi. İlk olarak, örneklerdeki 22 bağışıklık hücre tipinin göreli bolluklarını CIBERSORT algoritması (RRID: SCR_016955)19 ile LM22 özellik matrisi kombinasyonuyla hesapladık. Özellikle, R paketi IOBR'deki deconv_tme fonksiyonu (parametreler: yöntem = "cibersort", dizileri = YANLI, perm = 200) hesaplamalar için kullanıldı ve kutu grafikleri ggpubr paketi (RRID: SCR_021139) kullanılarak yüksek ve düşük puanlı gruplar arasındaki bağışıklık hücresi sızma farklarını değerlendirmek için oluşturuldu. Ayrıca, R paketindeki GSVA (ssGSEA yöntemi kullanılarak) gsva fonksiyonu 28 bağışıklık hücre tipi için zenginleştirme puanları hesaplamak için kullanıldı. Bu puanlar daha sonra Min-Max ölçeklendirmesiyle normalleştirilerek [0, 1] aralığına eşlendi ve hücre tipleri arasında karşılaştırmalar yapıldı. Son olarak, GSE150910 ve GSE110147 veri setlerinde normal örnekler ile IPF hastaları arasındaki anahtar genlerin ekspresyonunu karşılaştırmak için Wilcoxon sıralama toplamı testleri yapıldı ve IPF alt grupları arasında bağışıklık hücresi infiltrasyonu ve gen ifade farklılıklarının kapsamlı analizini sağladı.
IPF hastalarında anahtar genlerin RT-qPCR analiziyle doğrulanması
Tanımlanan genlerin tanısal önemini doğrulamak için, XGBoost algoritmasından en yüksek önem puanlarına sahip altı gen, ters transkripsiyon nicel PCR (RT-qPCR) kullanılarak IPF hastalarında ve sağlıklı kontrollerde ifade seviyesi doğrulaması için seçildi. Bengbu Tıp Üniversitesi Birinci Bağlı Hastanesi'nden toplam 20 kan örneği alındı; bunların 9'u IPF hastalarından ve 11'i sağlıklı bireylerden alındı. Kan örneklerinden toplam RNA çıkarıldı ve RNA konsantrasyonu çok fonksiyonlu mikroplaka okuyucu kullanılarak ölçüldü. RNA kalitesi, sonraki analizlerden önce değerlendirildi. Genomik DNA ters transkripsiyon sırasında çıkarıldı ve RT-qPCR için kullanılan primer dizileri Tablo 2'de listelenmiştir. Astar özgüllüğü, erime eğrisi analiziyle doğrulandı. GAPDH, dahili referans gen olarak kullanıldı. Göreli gen ifade seviyeleri 2-ΔΔCt yöntemiyle hesaplandı. Bu doğrulama adımı, IPF'de tanımlanan genlerin farklı ifadesi ve potansiyel tanısal önemi için ön deneysel destek sağlar.
İstatistiksel analiz
Veriler R'de analiz edildi ve iki grup arasındaki farkları tespit etmek için Wilcoxon testi kullanıldı. GSEA, GO ve KEGG zenginleştirme analizi R paket kümesi Profiler (RRID: SCR_016884) kullanılarak gerçekleştirildi. P-değeri < 0.05 aksi belirtilmedikçe anlamlı olarak kabul edilmiştir.