Kurumsal inceleme kurulu beyanı
Bu çalışma Helsinki Deklarasyonu'na uygun olarak yürütülmüştür. Protokol, Shenzhen Luohu Geleneksel Çin Tıbbı Hastanesi Etik Kurulu tarafından onaylanmış (onay no. 2024-LHQZYYYXLL-KY-039) ve kayıt öncesinde tüm katılımcılardan yazılı bilgilendirilmiş onam alınmıştır. Bu protokolde kullanılan araştırma araçlarının ve malzemelerinin ayrıntıları Malzemeler Tablosunda sunulmuştur.
Veri kaynağı ve işleme
KOAH ile ilişkili gen ekspresyon veri setleri Gene Expression Omnibus (GEO) üzerinden elde edilmiştir. Transkriptom veri seti olarak GSE54837 veri seti, doğrulama seti olarak ise GSE112811 veri seti kullanılmıştır (Tablo 1). ac4C-RG'ler literatürden derlenmiştir18. KOAH ve kontrol grupları arasındaki diferansiyel olarak eksprese edilen genler (DEG'ler), limma R paketi kullanılarak belirlenmiştir. |log2FC| > 0 ve p < 0,05 olması durumunda DEG'ler istatistiksel olarak anlamlı kabul edilmiştir. Gen ekspresyon değişikliklerinin genel dağılımını görselleştirmek için yanardağ (volcano) grafikleri oluşturulmuştur.
WGCNA'nın Oluşturulması
KOAH ile ilişkili modülleri belirlemek amacıyla, R kullanılarak GSE54837 veri seti üzerinde WGCNA gerçekleştirilmiştir. Ağ yapımından önce, ortalama bağlama yöntemi ve Öklid mesafe metriği ile hclust fonksiyonu kullanılarak yapılan hiyerarşik kümeleme analizi yoluyla aykırı örnekler tespit edilmiş ve çıkarılmıştır. Optimal yumuşak eşikleme gücü (β ölçeksiz topoloji uyum indeksi R'yi elde etmek için (= 10) seçilmiştir2 ölçeksiz topoloji ve ortalama bağlantısallığı dengeleyen ≥ 0,85 değeri kullanılmıştır. Bir komşuluk matrisi oluşturulmuş ve topolojik örtüşme matrisine (TOM) dönüştürülmüştür. Gen modülleri, dinamik ağ kesme algoritması (deepSplit = 2, minClusterSize = 50) kullanılarak tanımlanmıştır. Eigengene korelasyonlarına sahip modüller > 0,75 değeri, ardından mergeCloseModules fonksiyonu kullanılarak birleştirilmiştir. Daha sonra, sonraki analizler için KOAH ile ilişkili modülleri belirlemek amacıyla modül özgenleri, Pearson korelasyon katsayıları kullanılarak klinik özelliklerle (KOAH durumu, yaş, cinsiyet ve sigara içme durumu) korele edilmiştir.
Örtüşen genlerin taranması, zenginleştirme analizi ve PPI ağ analizi
DEG'ler, MEsalmon modül genleri ve ac4C-RG'ler arasındaki örtüşen genleri belirlemek için ggvenn R paketi kullanılarak bir Venn diyagramı oluşturulmuştur. Örtüşen genlerin fonksiyonel zenginleştirme analizi, clusterProfiler R paketi ile Gene Ontology (GO) ve Kyoto Encyclopedia of Genes and Genomes (KEGG) veri tabanları kullanılarak gerçekleştirilmiştir. Örtüşen genler arasındaki protein düzeyindeki etkileşimleri analiz etmek için protein-protein etkileşim (PPI) bilgileri STRING veri tabanından (https://string-db.org/) elde edilmiştir. Elde edilen PPI ağını görselleştirmek için Cytoscape yazılımı kullanılmıştır.
Makine öğrenimi aracılığıyla anahtar genlerin belirlenmesi
Üç makine öğrenimi tekniği uygulanmıştır: en küçük mutlak büzülme ve seçme operatörü (LASSO) regresyonu, ekstremi gradyan artırma (XGBoost) ve rastgele orman (RF). LASSO regresyonu, optimal ceza parametresi λ'yi belirlemek için 10 katlı çapraz doğrulama ile glmnet paketi kullanılarak gerçekleştirilmiştir. type.measure parametresi "deviance" ve family parametresi "binomial" olarak ayarlanmıştır. Optimal λ, çapraz doğrulanmış sapmayı minimize eden λmin kriteri kullanılarak seçilmiş ve sonuçta 17 gen elde edilmiştir. XGBoost, xgboost paketi kullanılarak şu hiperparametrelerle uygulanmıştır: nrounds = 100, max_depth = 6, eta = 0.3, subsample = 0.8, colsample_bytree = 0.8 ve eval_metric = "logloss". Özellik önemi gain metriği ile sıralanmış ve en iyi 30 gen seçilmiştir. Rastgele orman, randomForest paketi kullanılarak ntree = 200 ile uygulanmıştır. Özellik önemi, Gini'deki ortalama azalma ile sıralanmış ve en iyi 30 gen seçilmiştir. Sonraki analizler için anahtar genleri belirlemek amacıyla, üç makine öğrenimi yöntemiyle seçilen genlerin kesişimi alınmıştır.
Risk tahmini için lojistik regresyon modelinin oluşturulması ve değerlendirilmesi
GSE54837 veri seti, rastgele olarak bir eğitim seti (%70) ve bir test seti (%30) şeklinde ikiye ayrılmıştır. Temel genlerin ekspresyon seviyeleri girdi özellikleri olarak kullanılarak, MASS paketindeki glm fonksiyonu ile eğitim seti üzerinde bir lojistik regresyon modeli oluşturulmuştur. Model performansı, pROC paketi ile oluşturulan ROC eğrileri kullanılarak değerlendirilmiştir. AUC için %95 güven aralıkları, 2.000 bootstrap tekrarı ile hesaplanmıştır. Model kalibrasyonu, 1.000 bootstrap yeniden örneklemesiyle (rms paketi) oluşturulan kalibrasyon eğrileri kullanılarak değerlendirilmiştir. Bir dizi eşik olasılığı boyunca net klinik faydayı değerlendirmek için dca paketi kullanılarak DCA gerçekleştirilmiştir. Bireyselleştirilmiş risk tahminini kolaylaştırmak amacıyla, rms paketindeki nomogram fonksiyonu kullanılarak bir nomogram oluşturulmuştur.
Regresyon denklemi şuydu:
logit(P) = 0.5823 + 0.6010 × UPP1 - 0.6563 × PTRF + 0.3853 × B4GALT2 - 0.3972 × FAM168B + 0.1848 × PRKCDBP - 0.4787 × TOR3A. (1)
Burada P, KOAH'ın öngörülen olasılığını temsil eder ve her bir katsayı, ilgili gen ekspresyon değerinin KOAH log oranlarına (log odds) olan katkısını temsil eder.
Ekspresyon analizi, GeneMANIA ağı ve moleküler düzenleyici ağ
GSE54837 veri setindeki KOAH ve kontrol grupları arasındaki gen ekspresyon seviyeleri, Wilcoxon sıra toplamı testi kullanılarak karşılaştırıldı. Ekspresyon seviyelerinin dağılımını görselleştirmek için, medyan, çeyrekler arası aralık (IQR) ve bireysel veri noktalarının üzerine eklendiği kutu grafikleri ggplot2 paketi kullanılarak oluşturuldu. Gen ağlarını kurmak ve fonksiyonel etkileşimleri tahmin etmek için GeneMANIA kullanıldı. Arama, varsayılan parametrelerle gerçekleştirildi: tür = Homo sapiens, maksimum ilgili gen sayısı = 20. Ortaya çıkan ağ indirildi ve görselleştirildi; kenar renkleri etkileşim türlerini belirtmektedir. Transkripsiyon sonrası düzenleyici mekanizmaları incelemek için rekabetçi endojen RNA (ceRNA) ağı kuruldu. Altı ana geni hedefleyen miRNA'lar, iki bağımsız veri tabanı kullanılarak tahmin edildi: DIANA-microT (skor ≥ 0,8) ve miRanda (skor ≥ 140, enerji ≤ −20 kcal/mol). Her iki veri tabanı tarafından tanımlanan miRNA'ların kesişimi, miRNA-mRNA çiftlerini oluşturmak için kullanıldı. Ardından, bu miRNA'ları hedefleyen lncRNA'lar StarBase veri tabanı kullanılarak tahmin edildi. Bir lncRNA-miRNA-mRNA düzenleyici ağı kuruldu ve Cytoscape kullanılarak görselleştirildi. Transkripsiyonel düzenleyici ilişkiler, ChIP-X Enrichment Analysis Version 3 (ChEA3) kullanılarak tahmin edildi. TF tahmini yapılan her bir ana gen için, en yüksek zenginleştirme skoruna sahip ilk 10 transkripsiyon faktörü seçildi. Cytoscape'de bir TF-hedef düzenleyici ağı kuruldu.
Gen seti zenginleştirme analizi ve immün hücre infiltrasyon değerlendirmesi
Her bir ana genin biyolojik fonksiyonlarını incelemek için clusterProfiler paketi kullanılarak gen seti zenginleştirme analizi (GSEA) gerçekleştirilmiştir. Her bir ana gen için örnekler, medyan değere göre yüksek ve düşük ekspresyon gruplarına ayrılmıştır. İki grup arasındaki diferansiyel ekspresyon analizi limma kullanılarak yapılmış ve elde edilen gen listesi, işaretli log₂ kat değişimine (fold-change) göre sıralanmıştır. GSEA, GO biyolojik süreç terimleri için gseGO fonksiyonu ve KEGG yolakları için gseKEGG fonksiyonu kullanılarak şu parametrelerle yürütülmüştür: minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0.05 ve nPerm = 1.000. 28 immün hücre tipinin göreceli bolluğu, GSVA paketinde yer alan tek örnek gen seti zenginleştirme analizi (ssGSEA) kullanılarak tahmin edilmiştir. 28 immün hücre tipi için marker genleri içeren küratörlü bir gen seti imza matrisi, önceki literatürden19 elde edilmiştir. Her bir örnek için gsva fonksiyonu; method = "ssgsea", ssgsea.norm = TRUE ve kcdf = "Gaussian" parametreleri ile uygulanmıştır. ssGSEA zenginleştirme skorları ile altı ana genin ekspresyon seviyeleri arasındaki Spearman korelasyon katsayıları cor.test fonksiyonu kullanılarak hesaplanmıştır. p değerleri, Benjamini-Hochberg yöntemi kullanılarak çoklu testler için düzeltilmiştir. Korelasyon matrisi, pheatmap paketi kullanılarak bir ısı haritası (heatmap) şeklinde görselleştirilmiştir.
İlaç tahmini, moleküler kenetleme ve hastalık ilişkisi analizi
Temel genleri hedefleyen potansiyel terapötik bileşikler DrugBank veri tabanı kullanılarak belirlendi. Tahmin edilen ilaç-gen etkileşimlerini görselleştirmek için Cytoscape programında bir “temel gen hedefli ilaç” etkileşim ağı oluşturuldu. Bağlanma afinitelerini değerlendirmek için CB-Dock2 platformu kullanılarak moleküler kenetleme gerçekleştirildi. İnsan UPP1 proteininin 3D yapısı Protein Veri Bankası'ndan (PDB ID: 7B8T) alındı. İlaç moleküler yapıları (SMILES formatında) PubChem'den elde edildi. Kenetleme işlemi AutoDock Vina motoru kullanılarak gerçekleştirildi ve çıktılar bağlanma serbest enerjisine (ΔG, kcal/mol cinsinden) göre sıralandı. Kenetleme kompleksleri PyMOL kullanılarak görselleştirildi. Temel genler ile çevresel maruziyetlerle ilişkili insan hastalıkları arasındaki ilişkiler Karşılaştırmalı Toksikogenomik Veri Tabanı (CTD) kullanılarak incelendi. Her gen için ayrı ayrı sorgulama yapıldı ve en güçlü ilişkili ilk on hastalık çıkarılarak radar grafikleri ile görselleştirildi.
RT-qPCR protokolü
Sekiz KOAH hastası ve sekiz sağlıklı kontrolden periferik venöz kan örnekleri Shenzhen Luohu Geleneksel Çin Tıbbı Hastanesi'nde toplanmıştır. KOAH, post-bronkodilatör FEV1/FVC < 0,70 olarak tanımlanan Global Initiative for Chronic Obstructive Lung Disease (GOLD) kriterlerine göre teşhis edilmiştir. Kontrol grubu, solunum yolu hastalığı öyküsü olmayan ve pulmoner fonksiyon testleri normal (tahmin edilen FEV1% ≥ %80 ve FEV1/FVC ≥ 0,70) olan, yaş ve cinsiyetten eşleştirilmiş sağlıklı gönüllülerden oluşmuştur. Hastaların temel bilgileri Tablo 2'de gösterilmektedir. Toplam RNA, bir kan RNA ekstraksiyon kiti kullanılarak KOAH kan örneklerinden ekstrakte edilmiştir. cDNA sentezi için, 500 ng toplam RNA, genetik DNA uzaklaştırma özellikli bir cDNA sentez kiti kullanılarak sağlanan protokole uygun şekilde ters yazıma uğratılmıştır. Elde edilen cDNA, 150 ng/μL olacak şekilde seyreltilmiştir.
RT-qPCR, bir gerçek zamanlı PCR sisteminde SYBR Green bazlı bir qPCR master mix kullanılarak gerçekleştirildi. Her 10 μL'lik reaksiyon; 5 μL 2x SYBR Green master mix, 0.5 μL'lik ileri ve geri primerler (10 μM), 1 μL seyreltilmiş cDNA (15 ng/μL) ve 3 μL nükleaz içermeyen su içeriyordu. Döngü koşulları; 5 dk boyunca 95 °C'de başlangıç denatürasyonunu, ardından 10 s 95 °C ve 30 s 60 °C şeklinde 40 döngüyü ve amplifikasyon özgünlüğünü doğrulamak için 60 °C'den 95 °C'ye kadar yapılan final erime eğrisi analizini içeriyordu. Tüm reaksiyonlar teknik olarak üç tekrar şeklinde gerçekleştirildi. İç referans gen olarak β-actin kullanıldı. Her bir hedef gen için primer verimliliği, standart eğri dilüsyon serileri kullanılarak doğrulandı ve %90 ile %110 arasında değişti. Gen ekspresyon seviyeleri β-actin'e göre normalize edildi ve göreceli ekspresyon 2-ΔΔCt yöntemi kullanılarak hesaplandı. KOAH ve kontrol grupları arasındaki istatistiksel karşılaştırmalar Mann-Whitney U testi kullanılarak gerçekleştirildi.
İstatistiksel analiz
Ağ görselleştirmeleri Cytoscape kullanılarak oluşturulmuş ve istatistiksel analizler R yazılımı ile gerçekleştirilmiştir. Aksi belirtilmedikçe, normal dağılım göstermeyen veriler için Mann-Whitney U testi, iki grubun karşılaştırılması için normal dağılım gösteren verilerde ise Student t-testi kullanılmıştır. p < 0.05 değeri istatistiksel olarak anlamlı kabul edilmiştir.