Örtüşen genlerin belirlenmesi, zenginleştirme analizi ve PPI ağı oluşturulması
GSE54837 veri setinden, 1.675'i yukarıye düzenlenmiş (upregulated) ve 1.696'sı aşağıye düzenlenmiş (downregulated) olmak üzere toplam 3.371 DEG belirlenmiştir. En anlamlı yukarı ve aşağı düzenlenme gösteren ilk 10 gen Şekil 1A'da gösterilmiştir. GSE54837 verilerinin hiyerarşik kümelemesi gerçekleştirilmiş (Ek Şekil 1A) ve ölçekten bağımsız ağ topolojisini sağlamak için 10 değerinde bir yumuşak eşikleme gücü uygulanmıştır (Şekil 1B). Gen eş-ifade modülleri, minimum modül boyutu 50 gen olacak şekilde dinamik ağaç kesme yöntemi kullanılarak oluşturulmuş ve her bir modüle ayrı bir renk atanmıştır (Ek Şekil 1B). Özgen (eigengene) korelasyonları > 0,75 olan modüller daha sonra birleştirilmiş (Ek Şekil 1C, Şekil 1C) ve sonuç olarak 14 farklı modül elde edilmiştir. Modül özgenleri ile klinik özellikler arasındaki Pearson korelasyon analizine dayanarak, MEsalmon modülü (5.226 gen içerir), KOAH ile en anlamlı pozitif korelasyonu göstermiştir (r = 0,35, p = 7 x 10⁻8, Şekil 1D). Venn analizi; 3.371 DEG, 5.226 MEsalmon modül geni ve 2.118 ac4C-RG arasında örtüşen 160 gen belirlemiştir (Şekil 1E). Bu 160 genin fonksiyonel zenginleştirme analizi, anlamlı GO terimlerinin tek zincirli RNA bağlanması, mRNA metabolik süreçlerinin düzenlenmesi ve RIG-I sinyal yolu olduğunu göstermiştir (Şekil 1F). Ayrıca KEGG analizi, bu genlerin temel olarak Fc gama R aracılı fagositoz, mRNA gözetim yolu ve fokal adezyon süreçlerinde zenginleştiğini ortaya koymuştur (Şekil 1G). Örtüşen genlerin PPI ağı 118 düğüm ve 196 kenar içermektedir (Şekil 1H).
KOAH'ta altı ana genin tanımlanması
160 örtüşen aday arasından potansiyel kilit genleri daha ayrıntılı belirlemek için üç makine öğrenimi algoritması uygulandı. İlk olarak LASSO regresyonu uygulandı ve optimal ceza parametresini (λ) ≈ 0,091 belirlemek için çapraz doğrulama kullanıldı (Şekil 2A). Katsayı profili grafiği, optimal λ değerinde 17 genin korunduğunu gösterdi (Şekil 2B). XGBoost analizi, en yüksek kazanca sahip ilk 30 geni belirledi ve bunlar arasında PTRF, WBP11 ve LDOC1L yüksek öngörücü değer sergiledi (Şekil 2C). RF algoritması da benzer şekilde, ilk 30 geni Gini önem skorlarına göre sıraladı ve PTRF, RFX5 ile PRKCDBP en öngörücü olanlar arasında yer aldı (Şekil 2D). Üç yöntemle seçilen genlerin kesişim analizi sonucunda altı kilit örtüşen gen belirlendi: PTRF, PRKCDBP, UPP1, TOR3A, FAM168B ve B4GALT2 (Şekil 2E).
Tanısal model oluşturma ve temel genlerin ekspresyon analizi
GSE54837 veri setinin %70'i eğitim seti olarak kullanılarak, altı temel geni içeren bir lojistik regresyon modeli oluşturuldu. ROC eğrisi analizi, eğitim, iç test ve dış doğrulama setleri için sırasıyla 0,766 ( %95 GA: 0,691–0,8417), 0,759 ( %95 GA: 0,6368–0,8817) ve 0,723 ( %95 GA: 0,6085–0,8596) AUC değerleri ile orta düzeyde tanısal performans olduğunu göstermiştir (Şekil 3A–C). Kalibrasyon analizi yüksek güvenilirliği doğrulamış ve DCA, hem eğitim (Şekil 3D–E) hem de doğrulama setlerinde (Şekil 3F–G) geniş bir eşik olasılık aralığında net bir klinik fayda olduğunu göstermiştir. Her bir genin katkısını görselleştirmek ve bireyselleştirilmiş risk tahminini kolaylaştırmak için bir nomogram oluşturulmuştur (Şekil 3H). Ekspresyon analizi, COPD örneklerinde B4GALT2, PRKCDBP ve UPP1 genlerinin anlamlı düzeyde yukarı regüle olduğunu, FAM168B, PTRF ve TOR3A genlerinin ise aşağı regüle olduğunu ortaya koymuştur (Şekil 3I).
KOAH'taki ana genlerin düzenleyici ağı ve fonksiyonel analizi
Tanımlanan hub genlerle en ilişkili ilk 20 geni içeren fonksiyonel bir etkileşim ağı, GeneMANIA analizi kullanılarak oluşturulmuştur (Şekil 4A). Bağlantıların çoğunluğunu fiziksel etkileşimler oluşturmuş, bunları ko-ekspresyon korelasyonları ve ortak protein domainleri izlemiştir. Fonksiyonel anotasyon; nükleobaz içeren küçük molekül katabolik süreç, nükleozid katabolik süreç ve plazma membranı salı (raft) gibi süreçlerde anlamlı bir zenginleşme olduğunu göstermiştir. Transkripsiyon sonrası düzenleme, DIANA-microT ve miRanda veri tabanlarından elde edilen miRNA tahminleri kesiştirilerek araştırılmış ve sekiz örtüşen miRNA tanımlanmıştır (Şekil 4B). Ardından bir lncRNA-miRNA-mRNA düzenleyici ekseni oluşturulmuştur. Sankey diyagramına göre, tanımlanan miRNA'lardan her ikisi de FAM168B düzenlemesi ile ilişkili olan iki tanesinin yedi lncRNA tarafından hedeflendiği öngörülmüş; kalan beş hub gen için böyle bir düzenleyici etkileşim tanımlanmamıştır (Şekil 4C). Transkripsiyonel düzenleme, B4GALT2, UPP1, FAM168B ve TOR3A için yukarı akış transkripsiyon faktörlerini (TF'ler) öngören ChEA3 platformu kullanılarak daha detaylı incelenmiştir. Bir TF-hedef düzenleyici ağı oluşturmak için her gen için en üstteki on TF seçilmiştir (Şekil 4D). Altı temel genin biyolojik fonksiyonlarını araştırmak için GSEA uygulanmıştır. UPP1; diyasilgliserol metabolik süreç ve purin nükleozid trifosfat biyosentetik süreç gibi biyolojik süreçlerin yanı sıra proteozom ve sitokrom P450 tarafından ksenobiyotiklerin metabolizması dahil olan yolaklarda anlamlı şekilde zenginleşmiştir (Şekil 4E–F). Kalan beş temel gen için zenginleşme sonuçları Ek Şekil 2A–J'de sunulmuştur.
KOAH'ta UPP1'in immün infiltrasyonu ve ilaç hedeflerinin öngörülmesi
Kontrol ve KOAH gruplarında 28 immün hücre tipinin immün infiltrasyon seviyeleri ssGSEA algoritması kullanılarak değerlendirilmiştir. KOAH hastalarında bellek B hücreleri, myeloid kaynaklı baskılayıcı hücreler ve aktive dendritik hücreler anlamlı derecede daha yüksek zenginleşme skorları göstermiştir. Buna karşılık, tip 1 T yardımcı hücreleri, aktive B hücreleri ve immatür B hücreleri anlamlı derecede daha düşük zenginleşme skorları sergilemiştir (Şekil 5A). ssGSEA'nın, immün hücre oranlarının doğrudan ölçümlerinden ziyade transkriptomik verilere dayalı göreceli immün hücre zenginleşme tahminleri sağladığı belirtilmelidir. Korelasyon analizi, altı ana genin immün hücre alt kümeleriyle farklı ilişki örüntüleri sergilediğini ortaya koymuştur. Spesifik olarak UPP1, PRKCDBP ve B4GALT2; bellek B hücreleri, aktive dendritik hücreler ve myeloid kaynaklı baskılayıcı hücrelerin infiltrasyon seviyeleriyle pozitif korelasyon göstermiş (Spearman ρ > 0.4, p < 0.05), PTRF, TOR3A ve FAM168B ise tip 1 T yardımcı hücreleri ve aktive B hücreleri ile negatif korelasyonlar sergilemiştir (Spearman ρ < −0.3, p < 0.05). Tam korelasyon matrisi ısı haritasında sunulmuştur (Şekil 5B). İlaç tahmin analizi, altı aday gen arasından sadece UPP1'in küçük moleküllerle öngörülen etkileşimlere sahip olduğunu belirlemiştir. Veritabanından fluorouracil, capecitabine ve 5-benzylacyclouridine dahil olmak üzere üç bileşik, potansiyel UPP1-etkileşimli bileşikler olarak tanımlanmıştır (Şekil 5C). Bu bileşikler öncelikle onkolojide veya deneysel ortamlarda kullanılmaktadır ve KOAH ile olan ilgileri daha fazla araştırma gerektirmektedir. Bağlanma serbest enerjisi hesaplamaları, 5-benzylacyclouridine'in en güçlü bağlanma afinitesini sergilediğini ve nispeten daha yüksek bir öngörülen bağlanma afinitesine sahip olduğunu ortaya koymuştur (Tablo 3). Her üç bileşik için yapılan moleküler docking görselleştirmeleri, deneysel doğrulamadan ziyade hesaplamalı docking tahminleriyle uyumlu olarak, UPP1 ile uygun öngörülen bağlanma konformasyonları olduğunu göstermiştir (Şekil 5D–F). Ayrıca, CTD analizi, altı ana genin tamamının; prenatal maruziyetin gecikmiş etkileri, kilo kaybı, hepatomegali ve inflamasyon dahil olmak üzere çeşitli hastalık fenotipleriyle güçlü bir şekilde ilişkili olduğunu göstermiştir (Şekil 5G–L).
Klinik örneklerde temel tanısal genlerin RT-qPCR validasyonu
Kilit genlerin ekspresyon seviyelerini doğrulamak için sekiz KOAH hastası ve sekiz kontrol deneğinden kan örnekleri toplanmış olup, sınırlı örneklem boyutu nedeniyle bu analiz ön bir doğrulama olarak değerlendirilmiştir. Şekil 6A–F'de gösterildiği üzere, biyoinformatik analizlerde gözlemlenen eğilimlerle tutarlı olarak, KOAH örneklerinde PTRF, TOR3A ve FAM168B anlamlı düzeyde downregüle olurken, PRKCDBP ve UPP1 anlamlı düzeyde upregüle olmuştur. Buna karşın, iki grup arasında B4GALT2 ekspresyonu için anlamlı bir fark gözlemlenmemiştir. Bu tutarsızlık, sınırlı örneklem boyutuna veya veri setleri ile klinik örnekler arasındaki örnek türü farklılıklarına bağlanabilir.
VERİ KULLANILABİLİRLİK BEYANI:
Tüm RNA dizileme verileri Gene Expression Omnibus veri tabanından (GEO, https://www.ncbi.nlm.nih.gov) elde edilmiş olup, eğitim seti olarak GSE54837 ve doğrulama seti olarak GSE112811 seçilmiştir. Bu analizde kullanılan kodlar https://doi.org/10.5281/zenodo.21771476 adresinden temin edilebilir.

Şekil 1: Örtüşen genlerin belirlenmesi, zenginleştirme analizi ve PPI ağı oluşturma. (A) GSE54837 veri setindeki DEG'lerin volcano grafiği. (B) Yumuşak eşik taraması. (C) Modül kümeleme dendrogramı (birleştirme sonrası). (D) Modüller ve özellikler arasındaki korelasyonun ısı haritası. (E) Örtüşen genlerin belirlenmesi için Venn diyagramı. (F) MF, CC ve BP'deki kesişim genlerinin temel zenginleştirme sonuçlarını gösteren GO zenginleştirme analizinin Mulberry diyagramı. (G) KEGG sinyal yolu zenginleştirme analizinin lollipop diyagramı, balon boyutu zenginleştirilmiş gen sayısını temsil eder. (H) Örtüşen genlerin PPI ağı; düğümler proteinleri, kenarlar ise protein-protein etkileşimlerini temsil eder. Kısaltmalar: DEGs = diferansiyel olarak eksprese edilen genler; PPI = protein-protein etkileşimi; GO = Gen Ontolojisi; MF = moleküler fonksiyon; CC = hücresel bileşen; BP = biyolojik süreç; KEGG = Kyoto Gen ve Genom Ansiklopedisi; ac4C-RGs = N4-asetilsitidin ile ilişkili genler. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.

Şekil 2: KOAH'taki altı temel genin tanımlanması. (A) LASSO çapraz doğrulama eğrisi. (B) LASSO regresyon katsayısı yol diyagramı. λ arttıkça, önemsiz genlerin katsayıları 0'a yakınsar. (C) XGBoost özellik önem sıralaması. x-ekseni kazanç değerini, y-ekseni gen adını ve renk derinliği önemi temsil eder. (D) RF özellik önem sıralaması. x-ekseni Gini'deki ortalama azalmayı temsil eder. (E) Üç algoritmanın çapraz analiziyle elde edilen örtüşen genlerin Venn diyagramı. Kısaltmalar: LASSO = least absolute shrinkage and selection operator; XGBoost = extreme gradient boosting; RF = random forest. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 3: Bir tanı modelinin oluşturulması ve anahtar genlerin ekspresyon analizi. (A) Eğitim setinin ROC eğrisi. (B) Dahili test setinin ROC eğrisi. (C) Harici doğrulama setinin ROC eğrisi. (D) Eğitim setinin kalibrasyon eğrisi. (E) Eğitim setinin DCA analizi. (F) Harici doğrulama setinin kalibrasyon eğrisi. (G) Harici doğrulama setinin DCA analizi. (H) Altı anahtar genin nomogramı. Bireysel COPD riskinin öngörülmesi için her gene karşılık gelen bir puan atanır. (I) GSE54837 veri setindeki COPD ve kontrol örneklerinde altı anahtar genin ekspresyon analizi. Kısaltmalar: ROC = alıcı işletim karakteristiği; AUC = eğri altında kalan alan; DCA = karar eğrisi analizi; COPD = kronik obstrüktif akciğer hastalığı. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 4: KOAH'taki ana genlerin düzenleyici ağı ve fonksiyonel önemi. (A) 6 ana genin GeneMANIA analiz sonuçları. Çizgilerin rengi genler arasındaki korelasyonu, düğümlerin rengi ise farklı fonksiyonel kategorileri göstermektedir. (B) DIANA-microT ve miRanda veri tabanlarının çapraz analizine ait Venn diyagramı. (C) ceRNA düzenleyici ağının Mulberry diyagramı. (D) Potansiyel transkripsiyon faktörü düzenleyici ağı. Mavi düğümler transkripsiyon faktörlerini, turuncu düğümler ise hedef genleri temsil etmektedir. (E) UPP1'in GO'yu içeren tek gen GSEA zenginleştirme analizi. (F) UPP1'in KEGG'i içeren tek gen GSEA zenginleştirme analizi. Kısaltmalar: GO = Gene Ontology; KEGG = Kyoto Encyclopedia of Genes and Genomes. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 5: KOAH'ta temel genlerin immün infiltrasyonu ve ilaç hedeflerinin öngörülmesi. (A) Gruplar arasındaki immün hücre bolluğu farkları. (B) İmmün hücreler ile temel genler arasındaki korelasyonun ısı haritası. (C) Temel genler ve öngörülen ilaçlar arasındaki etkileşim ağı. (D) Fluorouracil'in UPP1 ile moleküler kenetlenmesi. (E) Capecitabine'in UPP1 ile moleküler kenetlenmesi. (F) 5-benzylacyclouridine'in UPP1 ile moleküler kenetlenmesi. Her bir bileşik için sol taraftaki görüntü genel kenetlenme konformasyonunu, sağ taraftaki görüntü ise yerel bağlanma etkileşimlerini göstermektedir. (G) B4GALT2'nin CTD analizi. (H) FAM168B'nin CTD analizi. (I) PRKCDBP'nin CTD analizi. (J) PTRF'nin CTD analizi. (K) TOR3A'nın CTD analizi. (L) UPP1'in CTD analizi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 6: KOAH ve kontrol örneklerinde temel gen ekspresyonunun RT-qPCR doğrulaması. (A) PTRF'nin bağıl ekspresyonu. (B) PRKCDBP'nin bağıl ekspresyonu. (C) UPP1'in bağıl ekspresyonu. (D) TOR3A'nın bağıl ekspresyonu. (E) FAM168B'nin bağıl ekspresyonu. (F) B4GALT2'nin bağıl ekspresyonu. ns = anlamlı değil, p > 0.05; * p < 0.05; ** p < 0.01; *** p < 0.001; **** p < 0.0001. Kısaltma: RT-qPCR = ters transkripsiyon kantitatif polimeraz zincir reaksiyonu. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Ek Şekil 1: GSE54837 veri seti örnekleri ve gen modülü kümelemesi. (A) GSE54837 veri setinin örnek kümeleme diyagramı. (B) Birleştirme öncesi modül kümeleme dendrogramı. Belirgin modülleri tanımlamak için genler dinamik ağaç kesme yöntemi kullanılarak gruplandırılmıştır. (C) Modül özgenlerinin hiyerarşik kümeleme dendrogramı. Benzer ifade modellerine sahip modüller, özgen benzerliklerine göre kümelenmiştir.Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Şekil 2: GSEA zenginleştirme analizi. (A) PRKCDBP'nin GO analizi. (B) PRKCDBP'nin KEGG analizi. (C) PTRF'nin GO analizi. (D) PTRF'nin KEGG analizi. (E) TOR3A'nın GO analizi. (F) TOR3A'nın KEGG analizi. (G) FAM168B'nin GO analizi. (H) FAM168B'nin KEGG analizi. (I) B4GALT2'nin GO analizi. (J) B4GALT2'nin KEGG analizi. Kısaltmalar: GO = Gen Ontolojisi; KEGG = Kyoto Gen ve Genom Ansiklopedisi.Lütfen bu dosyayı indirmek için buraya tıklayın.
| Veri Seti | Kontroller | Hastalar | Sekanslama platformu |
| GSE54837 | 90 | 136 | GPL570 |
| GSE112811 | 44 | 20 | GPL570 |
Tablo 1: Çalışmada kullanılan gen ekspresyon veri setleri. Model geliştirme/dahili test ve harici doğrulama için sırasıyla kullanılan GSE54837 ve GSE112811 veri setlerinin özellikleri.
| Hasta | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| Cinsiyet (K/E) | M | M | M | F | M | M | M | M |
| Yaş (yıl) | 69 | 72 | 75 | 73 | 68 | 70 | 69 | 71 |
| Sigara içme durumu | Evet | Evet | Sigarayı bırakma (2 yıl) | Hayır | Evet | Evet | Evet | Sigarayı bırakma (5 yıl) |
| Paket-yıl | günlük 20 / 30 yıl | günlük 15 / 35 yıl | günlük 20 / 50 yıl | | günlük 20 /40 yıl | günlük 30 / 40 yıl | günlük 15 / 40 yıl | günlük 20 / 30 yıl |
| KOAH grubu | 2 | 3 | 3 | 2 | 2 | 3 | 2 | 3 |
Tablo 2: Çalışma katılımcılarının temel özellikleri. RT-qPCR validasyonuna dahil edilen KOAH hastalarının ve sağlıklı kontrollerin temel demografik ve klinik özellikleri.
| Moleküler ad | Gen | Skor(kcal/mol) |
| 5-Benzilasiklouridin | UPP1 | -9.6 |
| Kapecitabin | UPP1 | -6.1 |
| Florourasil | UPP1 | -5.5 |
Tablo 3: UPP1 ve aday bileşikler için moleküler kenetlenme sonuçları.
UPP1'in fluorouracil, capecitabine ve 5-benzylacyclouridine ile etkileşimine ilişkin, bağlanma afinitelerini de içeren öngörülen moleküler kenetlenme sonuçları.