Bu çalışmada analiz edilen halka açık Gene Expression Omnibus (GEO) veri setleri, daha önce yayınlanmış çalışmalardan elde edilen kimliksizleştirilmiş transkriptomik verileri içeriyordu ve ek bir etik onay gerektirmedi. Huaihua Üniversitesi Etik Kurulu, bağımsız insan akciğer dokusu kantitatif ters transkripsiyon PCR (qRT-PCR) doğrulama çalışmasını onaylamıştır (onay no. 2024(A05112)). Örnek toplama işleminden önce tüm katılımcılardan veya yasal olarak yetkilendirilmiş temsilcilerinden yazılı bilgilendirilmiş onam alınmıştır. Onay ve rıza prosedürleri, qRT-PCR doğrulamasına dahil edilen tüm 20 pulmoner arteriyel hipertansiyon (PAH) ve 20 kontrol akciğer dokusu örneği için uygulanmıştır. Bu protokol için kullanılan araştırma araçları Materyaller Tablosunda listelenmiştir.
1. Kamu transkriptomik veri setlerinin toplanması ve ön işlemesi
Pulmoner hipertansiyon (PH) ile ilişkili GSE22356, GSE33463 ve GSE48149 mikroarray veri setleri GEO veri tabanından elde edilmiştir. PH/pulmoner arteriyel hipertansiyon (PAH) ve kontrol örnekleri, orijinal fenotip açıklamalarına göre ayıklanmıştır. Ekspresyon matrisleri ve platform açıklama dosyaları, tekrarlanabilir R betikleri ve GEOquery paketi kullanılarak indirilmiştir.
Prob anotasyonu ve gen sembolü eşleştirmeleri tüm veri setleri genelinde tutarlı bir şekilde gerçekleştirilmiştir. Birden fazla prob aynı gene eşleştiğinde, ortalama ekspresyon değeri hesaplanmıştır. Kantil normalizasyonu uygulanmış, düşük ekspresyona veya düşük varyansa sahip genler çıkarılmıştır. Veri setleri birleştirilmiş ve grup etkileri (batch effects), sva paketindeki8 ComBat algoritması kullanılarak düzeltilmiştir. Düzeltme işlemi, kutu grafikleri (boxplots) ve temel bileşenler analizi (principal component analysis) kullanılarak değerlendirilmiştir.
2. Diferansiyel ekspresyon gösteren genlerin belirlenmesi
Yığın düzeltmeli ekspresyon matrisindeki PH ve kontrol örnekleri arasındaki ekspresyon seviyelerini karşılaştırmak için limma paketi kullanılmıştır9. Bir doğrusal model kurulmuş ve ampirik Bayes istatistikleri uygulanmıştır. Diferansiyel ekspresyon gösteren genler, düzeltilmiş P değeri <0,05 ve mutlak log2 kat değişimi > 0,585 kriterlerine göre tanımlanmıştır. Sonuçlar, volkan grafikleri ve ısı haritaları kullanılarak görselleştirilmiştir.
3. Ağırlıklı gen eş-ifade ağı oluşturma
WGCNA paketi10 kullanılarak ağırlıklı bir gen eş-ifade ağı oluşturulmuştur. Aykırı değerleri tespit etmek için örnek kümelemesi yapılmıştır. Yumuşak eşikleme gücü, ölçeksiz topoloji uyum indeksine göre seçilmiştir. Gen modülleri, dinamik ağaç kesme algoritması kullanılarak tanımlanmıştır. Modül özgenleri PH fenotipi ile korele edilmiş ve en güçlü korelasyona sahip hastalıkla ilişkili modül seçilmiştir. Konsensüs genleri elde etmek için ana modüldeki genler ile diferansiyel olarak ifade edilen genlerin kesişimi alınmıştır.
4. Fonksiyonel zenginleştirme analizi
Gen Ontolojisi biyolojik süreç, hücresel bileşen ve moleküler fonksiyon kategorileri clusterProfiler11 kullanılarak analiz edildi. Sinyal yolaklarını belirlemek için Kyoto Gen ve Genom Ansiklopedisi yolak zenginleştirme analizi gerçekleştirildi12. Zenginleştirme eşikleri olarak P değeri < 0.05 ve q değeri < 0.2 kullanıldı ve zenginleşen terimler balon grafikleri kullanılarak görselleştirildi11.
5. Protein-protein etkileşim ağının oluşturulması ve hub-genlerin belirlenmesi
Konsensüs gen listesi, STRING veri tabanına şu parametrelerle sunulmuştur: Homo sapiens tür olarak seçilen ve bir etkileşim güven eşiği > 0.413Etkileşim dosyası Cytoscape'e aktarıldı ve genleri düğüm derecesine göre sıralamak için CytoHubba eklentisi kullanıldı. Yüksek bağlantılı genler, hub genler olarak tanımlandı.
6. Makine öğrenimi kullanılarak tanısal özellik genlerinin seçimi
Üç bağımsız özellik seçimi algoritması uygulandı. İlk olarak, sıfır olmayan katsayılara sahip genleri belirlemek için glmnet paketi ve 10 katlı çapraz doğrulama kullanılarak en küçük mutlak küçültme ve seçme operatörü (LASSO) lojistik regresyonu gerçekleştirildi14. İkinci olarak, gereksiz özellikleri çıkarmak ve en yüksek çapraz doğrulama doğruluğuna ulaşan özellik alt kümesini seçmek için destek vektör makineleri ile özyinelemeli özellik elemesi uygulandı15. Üçüncü olarak, bir rastgele orman modeli oluşturuldu ve özellikler, Gini safsızlığındaki ortalama azalmaya göre sıralandı16. Üç algoritmadan elde edilen gen setlerinin kesişimi, nihai çekirdek özellik genleri setini tanımlamak için kullanıldı. Alıcı işletim karakteristik eğrilerini oluşturmak ve eğri altındaki alan değerlerini hesaplamak için pROC paketi kullanıldı17.
7. Bağımsız bulk ve tek hücreli veri setleri kullanılarak çekirdek genlerin doğrulanması
58 PAH örneği ve 25 başarısız donör kontrol örneği içeren GSE117261, bağımsız bir harici akciğer dokusu doğrulama kohortu olarak kullanılmıştır18. Bu veri seti; keşif diferansiyel ekspresyon analizinde, ağırlıklı gen ko-ekspresyon ağının oluşturulmasında veya makine öğrenimi özellik seçiminde kullanılmamıştır. Ekspresyon matrisi normalize edilmiş ve açıklanmış, diferansiyel ekspresyon ise limma v3.68.0 kullanılarak analiz edilmiştir. Tüm açıklanmış transkriptom genelinde Benjamini-Hochberg yanlış keşif oranı düzeltmesi uygulanmıştır. Tek genli alıcı işletim karakteristik (ROC) eğrileri; pROC v1.19.0.1, DeLong %95 güven aralıkları ve Youden indeksi kesim değerleri kullanılarak hesaplanmıştır. GSE117261 kapsamında keşif amaçlı beş genli bir lojistik regresyon modeli kurulmuş ve modelin dahili performansı ek olarak tekrarlanan iç içe çapraz doğrulama ile değerlendirilmiştir.
PAH olan üç hasta ve üç sağlıklı donörden alınan örnekleri içeren GSE210248 (Tablo 1), tek hücreli pulmoner arter doğrulama veri seti olarak kullanılmıştır19. Veriler; kalite kontrolü, normalizasyon, boyut indirgeme, kümeleme ve hücre anotasyonu için Seurat v5.5.1 kullanılarak işlenmiştir20. Endotel hücreleri, düz kas hücreleri, fibroblastlar, monositler/makrofajlar ve T/doğal öldürücü hücreler dahil olmak üzere ana hücre popülasyonları tanımlanmıştır. Hücre-hücre iletişimi, CellChat v2.1.2 ve CellChatDB.human ligand-reseptör veri tabanı kullanılarak analiz edilmiştir21. Normalleştirilmiş Seurat ekspresyon matrisi ve hücre tipi meta verilerinden bir CellChat nesnesi oluşturulmuştur. Aşırı eksprese olan genler ve ligand-reseptör etkileşimleri tanımlanmış; iletişim olasılıkları hesaplanmış; 10 hücreden az olan hücre gruplarını içeren etkileşimler çıkarılmış; yolak düzeyindeki iletişim ağları çıkarılmış ve birleştirilmiştir. Bu veri seti sadece harici mekanistik doğrulama için kullanılmış olup model eğitimi için kullanılmamıştır.
| Öğe | Açıklama |
| Veri seti | GSE210248 |
| Veri tipi | 10x Genomics/damlacık tabanlı tek hücre RNA sekanslama; yüksek hacimli transkriptomik profilleme |
| İnsan örnekleri | Üç PAH pulmoner arter örneği ve üç sağlıklı donör pulmoner arter örneği |
| Doku kaynağı | Temel olarak pulmoner vasküler duvarın hücresel ekolojisini ve vasküler yeniden şekillenme sürecini yansıtan ex vivo pulmoner arter dokusu |
| Ana analitik amaç | Hücre tipi lokalizasyonu, düz kas hücresi fenotipik geçişi, immün-yapısal hücre iletişimi ve aday genlerin mekanistik tutarlılık doğrulaması |
Tablo 1: GSE210248 tek hücreli doğrulama veri seti için temel bilgiler. Tablo; tek hücreli pulmoner arter doğrulama analizinin veri seti erişim numarasını, sekanslama platformunu, doku kaynağını, örnek bileşimini ve analitik amacını özetlemektedir.
8. Gen ekspresyonunun qRT-PCR ile doğrulanması
qRT-PCR doğrulaması, PH/PAH hastalarından alınan 20 biyolojik olarak bağımsız PAH akciğer dokusu örneğini ve 20 biyolojik olarak bağımsız kontrol akciğer dokusu örneğini içermiştir. Toplam RNA, Total RNA Extraction Kit kullanılarak ekstrakte edilmiştir. RNA konsantrasyonu ve saflığı bir spektrofotometre ile değerlendirilmiş, RNA bütünlüğü ise agaroz jel elektroforezi ile incelenmiştir. Yalnızca A260/280 değerleri 1.8 ile 2.1 arasında olan ve görünür bir degradasyon göstermeyen RNA örnekleri çalışmaya dahil edilmiştir.
Eşit miktardaki RNA, Solarbio Universal RT-PCR Kit (AMV; katalog no. RP1200) kullanılarak tamamlayıcı DNA'ya tersine transkribe edildi. CXCL10, JUN, IFIH1, MX1 ve TLR7 için kantitatif PCR, bir Real-Time PCR Sistemi üzerinde SYBR Green PCR Master Mix kullanılarak gerçekleştirildi. Her biyolojik örnek, kalıp içermeyen ve ters transkripsiyon içermeyen kontrollerle birlikte üç teknik tekrar halinde analiz edildi. Sonraki analizler için üç teknik tekrarın ortalama Ct değeri kullanıldı; teknik tekrarlar bağımsız gözlemler olarak değerlendirilmedi. Ekzon-ekzon bağlantılarını kapsayan ve 80–200 bp amplikonlar üreten primerler kullanıldı (Tablo 2). Primer özgüllüğü, NCBI Primer-BLAST ve erime eğrisi analizi kullanılarak doğrulandı22.
Hedef genlerin ekspresyon seviyelerini normalize etmek için iç referans gen olarak β-actin (ACTB) kullanılmıştır. Relatif ekspresyon, 2-ΔΔCt yöntemi kullanılarak hesaplanmıştır23. Veri dağılımına bağlı olarak gruplar arası karşılaştırmalar için iki yönlü Mann-Whitney U testleri kullanılmış ve beş gen üzerinden Benjamini-Hochberg yanlış keşif oranı (false-discovery-rate) düzeltmesi uygulanmıştır. Tek genli ROC eğrileri DeLong %95 güven aralıkları ile oluşturulmuş ve optimal kesme noktaları Youden indeksi kullanılarak seçilmiştir. Beş genli lojistik regresyon modeli başlangıçta aynı 40 biyolojik örnek üzerinde kurulmuş ve değerlendirilmiştir; bu nedenle bu tahmin, görünür örnek içi performans (apparent in-sample performance) olarak tanımlanmıştır. Olası aşırı öğrenmeyi (overfitting) değerlendirmek için L2-regülerize lojistik regresyon modeli kullanılarak 100 katmanlı beşli çapraz doğrulama (stratified five-fold cross-validation) tekrarı gerçekleştirilmiş ve birleştirilmiş örnek dışı (out-of-fold) ROC performansı hesaplanmıştır.
| Gen | RefSeq erişim numarası | İleri primer (5′–3′) | Geri primer (5′–3′) | Ürün boyutu (bp) | Tm (°C) | Ekzon kapsamlı |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Evet |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Evet |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Evet |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Evet |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Evet |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Evet |
Tablo 2: Kantitatif ters transkripsiyon PCR için kullanılan primer dizileri. Tablo, qRT-PCR için kullanılan primerlerin hedef genlerini, RefSeq erişim numaralarını, ileri ve geri primer dizilerini, ürün boyutlarını, erime sıcaklıklarını ve ekzon kapsamı durumlarını listelemektedir.
9. Aday bileşik taraması ve moleküler kenetleme
PH ile ilişkili ekspresyon profilini tersine çevireceği öngörülen küçük molekülleri belirlemek için, artmış ve azalmış temel gen imzaları Connectivity Map veri tabanına sunulmuştur7. Adaylar, Logit puanına ve öngörü olasılığına göre sıralanmıştır.
BRD-K91900765/VX-745'in üç boyutlu yapısı PubChem'den CID 3038525 altında elde edilmiştir24. Bileşikle ilgili farmakolojik bilgiler halka açık ilaç veri tabanlarından derlenmiş ve yapısal tanımlayıcılar DrugBank ve SwissADME kullanılarak hesaplanmıştır25,26. Protein yapıları, şu PDB tanımlayıcıları kullanılarak RCSB Protein Data Bank'ten temin edilmiştir: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN ve MAPK14/p38α, 1OUK27. Kör boşluk tespiti ve moleküler kenetleme, AutoDock Vina v1.2.0 skorlama motoruna sahip CB-Dock2 v2.0 kullanılarak gerçekleştirilmiştir28,29. Protein ve ligand dosyaları CB-Dock2'ye yüklenmiş, aday boşluklar otomatik olarak tespit edilmiş ve kenetleme işlemi sunucu tarafından oluşturulan boşluğa özgü kutular içerisinde gerçekleştirilmiştir. Her bir protein için boşluk tanımlayıcısı, Vina skoru, boşluk hacmi, kenetleme kutusu merkezi, kenetleme kutusu boyutları ve protein-ligand kompleks dosyası kaydedilmiştir. En negatif Vina skoruna sahip poz, en yüksek sıralamaya sahip öngörülen konformasyon olarak seçilmiştir. MAPK14/p38α, VX-745 için belirlenmiş farmakolojik hedef ve pozitif referans kenetleme proteini olarak dahil edilmiştir. CXCL10, JUN, IFIH1, MX1 ve TLR7'ye karşı yapılan kenetlemeler keşif amaçlıdır ve doğrudan farmakolojik hedefleme, bağlanma, inhibisyon veya etkinlik kanıtı olarak yorumlanmamıştır.
10. İstatistiksel analiz ve tekrarlanabilirlik kontrolü
Aksi belirtilmedikçe tüm istatistiksel analizler R programında gerçekleştirilmiştir. İki yönlü P değerleri < 0.05 olan sonuçlar istatistiksel olarak anlamlı kabul edilmiştir. Yukarıda belirtildiği üzere; diferansiyel ekspresyon, zenginleştirme, harici doğrulama ve qRT-PCR analizlerine çoklu test düzeltmesi uygulanmıştır. Makine öğrenimi ve kombine qRT-PCR modellerinin stabilitesini değerlendirmek için çapraz doğrulama kullanılmıştır.