$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Çalışma, Helsinki Bildirgesi'ne uygun olarak yürütüldü ve protokol Kasım 2024'te Hebei Tıp Üniversitesi Üçüncü Hastanesi Etik Komitesi (W2025-065-1) tarafından onaylandı. Çalışmaya katılan tüm deneklerden bilgilendirilmiş onay alındı.
Veri kaynağı ve ön işleme
HF ile ilişkili RNA-seq verileri elde edildi; bunlar arasında Gen İfadesi Omnibus'tan (https://www.ncbi.nlm.nih.gov/geo/) iki mikroarray veri seti de bulundu. İki periferik kan mikroarray veri seti seçildi: GSE59867 (34 HF örneği ve 30 kontrol) eğitim veri seti olarak kullanıldı; GSE57338 (177 HF örneği ve 136 kontrol) doğrulama veri seti olarak kullanıldı. GSE57338 için mevcut olan yaş, cinsiyet ve hastalık durumu dahil klinik bilgiler GEO'dan alınmış ve Ek Tablo 1'de özetlenmiştir. Ayrıca, dbPTM veritabanından (https://awi.cuhk.edu.cn/dbPTM/index.php) toplamda 3.893 SUMOylasyon ile ilgili gen (SRG) alındı (Ek Tablo 2), önceki bir çalışma24 (Ek Tablo 3) temelinde ise 2.030 mitokondri ile ilişkili gen (MRG) toplandı. Sonrasında, R paketi GEOquery (v 2.72.0)25 kullanılarak GEO veritabanından veri setleri indirildi, ifade matrisi çıkarıldı ve örnek fenotip bilgisi elde edildi. Annotasyon, annotasyon dosyasının eşlenmesiyle ve gen kimliklerinin eşleştirilmesiyle gerçekleştirildi. Geçersiz gen kimlikleri çıkarıldı ve en yüksek ekspresyona sahip problar korundu.
Makine öğrenimi yoluyla anahtar gen seçimi
HF, SUMOylasyon ve mitokondri ile ilişkili genleri seçmek için çok adımlı bir yaklaşım kullanıldı. İlk olarak, eğitim veri seti olan SRG'ler ve MRG'ler arasındaki ortak genler kesişim analiziyle tanımlandı. Yaygın genlerin potansiyel fonksiyonu, Gen Ontolojisi (GO) ve Kyoto Genler ve Genomlar Ansiklopedisi (KEGG) zenginleştirme analiziyle R paketi ClusterProfiler (v 4.12.6)26 kullanılarak tanımlanmıştır. Daha sonra, genleri daha fazla filtrelemek için LASSO regresyonu, XGBoost ve rastgele orman (RF) olmak üzere üç makine öğrenimi yaklaşımı kullanıldı. LASSO regresyonunda, en yüksek öngörücü değere sahip genetik özellikler belirlemek için çapraz doğrulama yoluyla optimal düzenleme parametresi λ seçildi. Sıfır olmayan katsayıya sahip genler sonraki analizler için seçildi. Daha sonra, XGBoost ve RF algoritmaları kullanılarak özellik önemi puanları hesaplandı ve en iyi 20 gen tarandı.
Tanı modellerinin inşası ve değerlendirilmesi
GSE59867 veri setine dayalı Lojistik regresyon kullanılarak bir tanı modeli oluşturuldu. Model daha sonra hastalık durumunu tahmin etmek ve olasılık puanlarını hesaplamak için uygulandı. Modeli doğrulamak için, aynı anahtar genler GSE57338 veri setinden çıkarıldı, eğitim veri setine uyacak şekilde normalleştirildi ve harici tahmin için kullanıldı. Model performansı, Alıcı Çalışma Karakteristikası (ROC) eğrileri, Kafa Karışıklığı Matrisi, Kalibrasyon Eğrisi ve Karar Eğrisi Analizi (DCA) kullanılarak değerlendirildi.
Gen seti zenginleştirme analizi (GSEA) ve hücrealtı lokalizasyon
Her anahtar gen için korelasyonlu genleri belirlemek amacıyla Spearman korelasyon analizi kullanıldı. GSEA analizi, anahtar genlerin ilişkili genleri üzerinde R paketi ClusterProfiler (v 4.12.6) kullanılarak gerçekleştirildi. Bu arada, hücre içindeki anahtar genlerin tam alt hücresel lokalizasyonunu belirlemek için GeneCards veritabanı (https://www.genecards.org/) kullanılarak subhücre lokalizasyonu belirlendi.
Gen-hastalık ilişkisi ve ilaç tahmini
Tanımlanan anahtar genlerin klinik önemini değerlendirmek için sistematik hastalık ilişkisi ve ilaç etkileşim analizleri yapıldı. Hastalık-gen ilişkileri, Karşılaştırmalı Toksikogenomik Veritabanı (CTD; https://ctdbase.org/) kullanılarak sorgulandı ve sonuçlar hem çıkarım puanları hem de referans sayıları (ilk 10 ilişki rapor edildi) göre sıralandı. Anahtar genler için gen-ilaç etkileşim verileri İlaç-Gen Etkileşimi veritabanından (DGIdb) alındı ve ilaçlar 0.5 < etkileşim puanına göre hariç tutuldu. Daha sonra, PDB veritabanından (https://www.rcsb.org/) anahtar genlere karşılık gelen proteinlerin 3D yapılarını ve PubChem'den (https://pubchem.ncbi.nlm.nih.gov/) potansiyel ilaçların moleküler yapılarını indirdik. Sonrasında, potansiyel ilaçlar ile proteinler arasındaki bağlanma skorları hesaplanmak için CB-Dock227 (https://cadd.labshare.cn/cb-dock2/php/index.php) kullanılarak moleküler kenetlenme analizi yapıldı. Daha düşük bağlanma serbest enerjisi, daha stabil bir etkileşime işaret eder ve bu da bileşiğin daha yüksek hedefleme potansiyeline sahip olabileceğini gösterir.
İmmün infiltrasyon analizi
İmpün hücre sızması, üç tamamlayıcı yöntemle değerlendirildi: Mikro Ortam Hücre Popülasyonları sayacı (MCP-sayacı)28, RNA transkriptlerinin göreceli alt kümelerinin tahmin edilmesiyle hücre tipi tanımlama (CIBERSORT)29 ve tek örnek zenginleştirme analizi (ssGSEA)30. MCP-sayacı ve CIBERSORT analizi, R paketi IOBR (v 0.99.0)31 kullanılarak gerçekleştirilmiştir. MCP-sayacı bağışıklık ve stromal hücre bolluğunu tahmin etmek için kullanılırken, CIBERSORT ise 22 bağışıklık hücre tipinin göreli oranlarını niceltmek için kullanıldı. ssGSEA, bağışıklık hücre alt tiplerinin örnek düzeyinde zenginleştirilmesini değerlendirmek için GSVA paketi (v1.52.3)32 kullanılarak gerçekleştirildi.
Rakip endojen RNA (ceRNA) düzenleyici ağının inşası
Daha önce tanımlanan anahtar genlerle ilişkili potansiyel miRNA–lncRNA düzenleyici rollerini araştırmak için bir ceRNA düzenleyici ağı oluşturuldu. R paketi multiMiR (v 1.26.0)33 , ana genler için potansiyel mikroRNA (miRNA)–mRNA etkileşimlerini tahmin etmek için kullanıldı; PITA (https://omictools.com/pita-tool/) ve miRDB veritabanından (https://mirdb.org/) alınan veriler entegre edildi. yüksek güven ve tutarlılığa sahip miRNA–mRNA çiftleri seçildi. Daha sonra, lncRNA–miRNA etkileşimleri StarBase veritabanından (https://rnasysu.com/encori/) alındı ve ≥ 10 CLIP-seq deneyi tarafından desteklenen etkileşimler için filtrelenerek lincRNA olarak kategorize edildi. lncRNA-miRNA-mRNA etkileşimlerinin entegre edilmesiyle bir ceRNA ağı oluşturuldu.
qPCR doğrulaması
Ana genlerin ifadesini doğrulamak için, HF'li hastalardan ve sağlıklı kontrol gruplarından alınan kan örnekleri, Hebei Tıp Üniversitesi Üçüncü Hastanesi'nde (W2025-065-1) onaylanmış protokoller ve bilgilendirilmiş onay kapsamında klinik kohorttan (n = 6 grup başına) alındı. Toplam RNA, TRIzol reaktifi ile kloroform ve izopropanol kombinasyonuyla izole edildi. Ekstraksiyondan sonra RNA, DEPC ile arındırılmış suda çözünür ve konsantrasyonu ile saflığı NanoDrop spektrofotometresi kullanılarak değerlendirildi. Transkripsiyonel analiz için, RNA, RT için Hızlı İlk Zincirli cDNA Sentez Karışımı (dsDNaz ile) kullanılarak cDNA'ya ters transkribe edildi. Daha sonra Fast Taq qPCR SYBR Green Mix kullanılarak nicel PCR yapıldı. Özel primer dizileri Materyaller Tablosu'nda detaylandırılmıştır. Göreli gen ifade seviyeleri, uygun normalizasyon ile 2-ΔΔCT yöntemiyle hesaplandı.
İstatistiksel analiz
Tüm istatistiksel analizler R yazılımı ve GraphPad Prism kullanılarak gerçekleştirildi. İki bağımsız grup arasındaki istatistiksel karşılaştırmalar, veri dağılımına bağlı olarak ya Öğrenci t-testi ya da Mann-Whitney U testi kullanılarak gerçekleştirildi. 0.05'ten küçük bir p-değeri istatistiksel anlamlılığı göstermek olarak kabul edildi.