$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, Kanser Genomu Atlası ve Gen İfadesi Omnibus'tan kamuya açık olan, kimliği silinmiş klinik ve transkriptomik verileri kullandı. Tüm katkı sağlayan çalışmalar önceden kurumsal inceleme kurulu onayı ve bilgilendirilmiş onayı almıştır. Anonimleştirilmiş verilerin sadece ikincil analizi yapıldığı için ek etik onay gerekmemiştir. Kullanılan veritabanları ve yazılımlar Materyaller Tablosu'nda listelenmiştir.
1. Veri indirme
Araştırma, 589 örnekten oluşan EC (TCGA-Uterin Corpus Endometrial Carcinom (TCGA-UCEC)) veriseti 10'u kullandı; bu veri seti 589 örnekten oluşuyordu; bunlar arasında UCEC hastalarından (UCEC grubu) alınan 554 tümör dokusu örneği ve 35 bitişik normal dokudan (Normal grup) dizileme verileri yer almaktadır. UCSC Xena veritabanı, ilgili klinik verileri11 kurtarmak için kullanıldı, tam klinik bilgiye sahip olmayanlar hariç tutuldu. Sonuç olarak, klinik verilerle birlikte analiz için 577 örnek mevcut oldu. Ayrıntılı temel bilgiler Tablo 1'de verilmiştir.
EC, GSE115810 ve GSE6367812 ile ilgili ek veri setleri GEOquerypaketi 13 kullanılarak indirildi. GSE115810 veri seti ve GSE63678 birleştirilerek daha fazla analiz için Birleşik Veri Setleri oluşturuldu (Tablo 2).
NAD+ metabolizmaya bağlı genler (NMRG'ler), GeneCardrecord14 ve ilgililiteratürden sonra yer alır 15. GeneCards'ta arama terimi olarak "Niacinamide metabolizması" kullanıldığında, 4'ün üzerinde alaka puanı olan 345 NMRG tespit edildi. Literatürde bulunan 42 NMRG'den kopyaların birleştirilip çıkarılmasıyla toplam 371 NMRG derlenmiştir (Ek Tablo 1). Klinik veriler .tsv fenotipik dosyaları olarak alındı; veriler HTSeq-FPKM formatında indirildi. Dışlanan örneklerde klinik verilerin %20'sinden fazlası eksikti. FPKM log2 dönüştürülerek TPM'ye dönüştürüldü (milyonluk transkript). Prob kimlikleri, GEO veri setleri için gen sembollerine eşlendi ve tekrarlanan problar ortalamalandı.
2. Nikotinamid metabolizmasının farklı ekspresyon genleri
Araştırma, GSE115810 ve GSE63678 veri setlerinden sonra küme sahipliklerini ortadan kaldırmak için Rseti sva16'nın uygulanmasıyla başladı ve sonuçta 31 EC (UCEC) ve 8 bitişik normal örnek içeren ortak bir veri seti ortaya çıktı. Sonra, TCGA-UCEC veri setinde uyumsuzluk gen ekspresyonu incelemesi için limmaset 17'nin kullanılması.
TCGA-UCEC analizinden DEG'lerin 337 NMRG ile kesişimi, nikotinamid metabolizmasına bağlı DEG'leri tespit etmek. Bu, Venn illüstrasyonuyla resmedilen Niacinamide metabolizmasına bağlı farklı ekspresyon genlerin (NMRDEG) bir listesini oluşturdu. Uyumsuzluk görünüm incelemesinin sonuçları ggplot2 Rpaketi 18 ile gösterilmiş, NMRDEG'lerin ısı haritası ise pheatmapkümesi 19 kullanılarak oluşturulmuştur. Veri kümeleri arası varyans, ComBat (ampirik Bayes) kullanılarak toplu düzeltme yoluyla ortadan kaldırılır. Limma ampirik Bayes doğrusal model çerçevesi DEG analizinde kullanılmıştır. Açıkça uygulanan diferansiyel ifade eşikleri:
|log2FC| ≥ 1
FDR 0.05'ten az.
NMRG listesi yalnızca her iki gereksinimi karşılayan DEG'lerle kesişiyordu. Volkan haritaları ve ggplot2 ile yapılan ısı haritaları.
3. NMRDEG'lerin fonksiyonu (GO), yol (KEGG) geliştirme muayenesi
GO20 ve KEGG21geliştirme incelemeleri, clusterProfiler kümesi 22 tarafından tamamlandı. Her iki analiz için de p. ayarlama< 0,05 ve FDR (q değeri) 0,25 < anlamlılık eşikleri tespit edildi. Araştırmalar ayrıca logFC değerlerini zenginleştirme analizine entegre ederek sonuçları dairesel ve akor diyagramlarında temsil etti. Zenginleştirme anlamlılığı için eşikler: p-değeri 0,05 FDR < 0,25 (q-değeri) < düzeltildi. Küme Profileri GO ve KEGG çalışmaları için kullanıldı. Gen yönü, log2 kat değişim verisini içeren kord ve daire grafikleri kullanılarak gösterilir.
4. Gen Seti Zenginleştirme Analizi (GSEA)
Fenotipe en çok katkıda bulunan kalıtsal faktör kümeleri türü GSEA23 kullanılarak tanımlanabilir. Bu analiz için TCGA-UCEC veri seti logFC değerlerine göre sıralanmış ve clusterProfiler paketi kullanılarak iyileştirme incelemesi yapılmıştır. Ana kısıtlamalar arasında 2022 tohum değeri ve 10.000 permütasyon yer alıyordu. MSigDB gen seti "c2.all.v2022.1.Hs.symbols.gmt"24 kez kullanılmıştır. Manalo hipoksisiyle indüklenen genler, oksidatif stresle tetiklenen yaşlanma, glikoliz ve apoptoz yolları dahil olmak üzere en zenginleşmiş yollar, dağ grafiki kullanılarak görselleştirildi. GSEA'dan önce, genler log2 kat değişime göre sıralanıyordu. Analizde 10.000 permütasyon kullanıldı.c2.all.v2022.1.Hs.symbols.gmt MSigDB koleksiyonudur. Tekrarlanabilirlik için sabit rastgele bir tohum (2022) kullanılmıştır. Önemli yollar p < 0.05 ve q < 0.25 olanlardı.
5. Cox model inşası ve ilgili prognoz incelemesi
Endometriyal karsinomda (UCEC) nikotinamid metabolizmasına bağlı farklı ekspresyon genlerin (NMRDEG) öngörücü değerini belirlemek için, araştırmacılar tek değişkenli Cox regresyon analizini kullanarak başvuran kalıtsal faktörleri ilk olarak sınıflandırdı; Tehlike oranı (HR) > 1 ve p-değeri < 0.1 olanlar, çok değişkenli Cox göreceli riskler çerçevesi için uygun olarak belirlendi.
Tek değişkenli Cox seçimi kriterler: p < 0.10 ve 1.Log 2-TPM-normalize ekspresyon >değerleri çok değişkenli Cox modelinde kullanıldı. Risk skoru belirlenmek için Cox katsayıları × gen ifadesinin doğrusal bir kombinasyonu kullanılır. Nomogram kalibrasyonunda 1-, 3- ve 5 yıllık OS olasılıkları kullanıldı. Zamana bağlı ROC'da 1-, 3- ve 5 yıllık AUC değerleri kullanıldı. surv_cutpoint maksimum istatistiksel yaklaşımı hayatta kalma kesme değerlerini bulmak için kullanıldı. Hem KM hem de ROC analizleri aynı eşikleri kullandı.
Çok değişkenli Cox modelinden bir nomograf, doğruluğunu veya tahmin kapasitesini değerlendirmek ve 1, 3 ve 5 yıllık toplam varlık olasılıklarını hesaplamak için oluşturulmuştur. Tahmin edilen beklentiler ile gerçek sonuçlar arasındaki istikrarı değerlendirmek için standartlaştırma yayları kullanılır ve karar eğrisi analizi (DCA) yapının tıbbi faydalılığını ölçmek içinkullanılmıştır 25.
mRNA ifade seviyeleri, DESeq2 paketi aracılığıyla normalleştirilmiş log₂-dönüştürülmüş kayıt per milyon (TPM) değerleri olarak belirlendi. TPM'ler, dizileme karmaşıklığı ve gen ölçümünü hesaba katarak örnekler arasında sağlam ve tarafsız ifade seviyeleri tahminleri sağladı.
Çok değişkenli Cox modelinin katsayıları kullanılarak, her hastanın prognostik risk derecesi şu şekilde belirlendi:
riskScore = Σi Katsayısı (gen i) *mRNA İfadesi (geni) (1)
Kaplan-Meier (KM) varoluş yayları, belirlenmiş tehlike derecelerine göre oluşturulan uzun ve düşük tehlike kümelerinin genel dayanıklılığını değerlendirmek için hazırlandı. Zamana bağlı alıcı çalışma karakteristikleri (ROC) arkları, çerçevelerin rutininin 1, 3 ve 5 yıllık dönemlerde değerlendirilmesinde üretilmiştir26,27.
Gen ifadesini yüksek ve düşük ekspresyonlu koleksiyonlarla kategorize etmek için, hayatta kalma tabakası için surv_cut puan rolünün kullanılması kullanılır. Bu fonksiyon, standartlaştırılmış log-rank istatistikini maksimize ederek en büyük kesme değerini belirler; böylece tarafsız, istatistiksel olarak optimal bir kesme noktası elde eder.
Her prognostik gen için elde edilen kesme değerleri, ROC eğrilerinde kesik çizgiler olarak gösterilir. Araştırmalar, tüm sağ kalma ve ROC analizlerinde aynı eşikleri uygulamıştır.
TCGA RNA-seq HTSeq-FPKM formatında indirildi; klinik veriler TSV fenotip dosyaları olarak ithale getirildi; FPKM TPM'ye dönüştürüldü ve log₂ dönüştürüldü; GEO veri setleri, platform açıklamaları kullanılarak prob kimliklerinden gen sembollerine eşlendi; Tek bir gen değeri için kopya problar ortalanmıştır; %20'den fazla eksik klinik bilgiye sahip örnekler hariç tutuldu; ComBat (ampirik Bayes) GSE veri setleri için toplu düzeltme amacıyla kullanıldı; Toplu düzeltmenin başarılı olduğunu doğrulamak için PCA ve kutu grafikleri kullanıldı. Standart ifade dönüşüm teknikleriyle TPM normalizasyonu; toplu değişken olarak veri seti kökenini içeren ComBat kullanılarak toplu düzeltme; limma lineer modelleme (tümör vs. normal tasarım matrisi) kullanılarak hesaplanan diferansiyel ifade; GSEA girdisi için log₂ katlama değişikliklerinden oluşturulan sıralanmış gen listeleri; ve hayatta kalma analiz araçları kullanılarak yapılan tek değişkenli ve çok değişkenli Cox regresyonları
6. Gen kümesi varyasyon analizi (GSVA)
GSVA28 , kümeler arasındaki gelişim şeklini ölçmek için kullanıldı. TCGA-UCEC veri setinde, 50 önemli yol zenginleştirildi ve 41'inde ikili montajlar arasında önemli değişiklikler görüldü. GSVA, örnek başına yol aktivitesi elde etmek için kendine özgü gen setleriyle kullanıldı; STRING protein etkileşim verileri Cytoscape'e aktarıldı; MCC algoritması hub genlerini tanımlamak için kullanıldı; risk puanları, gen ifade değerlerinin Cox katsayılarıyla çarpılması olarak hesaplandı; zamana bağlı ROC eğrileri, hayatta kalma süresi ROC rutinleri kullanılarak oluşturuldu. Her örnek için GSVA, yol düzeyinde zenginleştirme puanlarını hesapladı. Wilcoxon sıralama toplamı testi, alişal yol aktivitesindeki farklılıkları değerlendirmek için kullanılır. Elli imza yolundan kırk biri önemli ölçüde farklıydı (ayarlanmış p < 0.05).
7. Protein-protein etkileşimi (PPI) sistemi
Önemli genleri (AURKA, CDKN3, FOXM1, CDKN2A, TK1 ve CDK1) içeren bir PPI sistemi, STRINGdosyası 29 ve yüksek güveni gösteren 0.70 iletişim değeri eşiği kullanılarak oluşturulmuştur. Bu ağ, UCEC patogenezinde kritik rol oynayabilecek etkileşimleri vurgulayan Cytoscape30 kullanılarak oluşturulmuştur. Maksimum Klique Merkeziyeti (MCC)yöntemi 31 , internet içindeki etkileşim puanlarında oluşan kalıtsal faktörü sıralamak için faydalıydı. En üst arayüz skorlarına sahip üst 10 protein dizisi tanındı; bunlar arasında CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 ve FOXM1 bulundu. Bu genler, kritik biyolojik süreçlerdeki rolleri açısından daha fazla analiz edildi. GeneMANIAplatformu 32 , ek protein etkileşimlerini tahmin etmek ve anahtar genlerin UCEC ilerlemesindeki rollerine daha geniş bir bağlam sağlamak için de kullanıldı. STRING güven puanı için eşik değeri: >0.70 (yüksek güven). Cytoscape ağı gösterir. Maksimum Klique Merkeziyeti (MCC) tekniği, hub genlerini sıralamak için kullanılır. MCC sıralaması, en üst etkileşimli genleri (CDK2, CCNA2, TP53 vb.) belirlemek için kullanıldı. GeneMANIA kullanılarak ek etkileşim tahminleri yapılır.
8. Teknoloji yol haritası
Bu çalışmada kullanılan genel iş akışı ve yöntemler, Şekil 1'de gösterilen teknoloji yol haritasında özetlenmiştir. Bu yol haritası, veri seti edinimi ve diferansiyel ifade analizinden prognostik modeller ve zenginleştirme analizlerinin oluşturulmasına kadar olan adımları özetlemektedir.
9. İstatistiksel analiz
Veri işleme ve istatistiksel tahmin R programı (v4.3.0) kullanılarak gerçekleştirildi. İki grup karşılaştırmaları için Mann-Whitney U testi veya Bağımsız Öğrenci t-testi kullanıldı; Kruskal-Wallis testi üç veya daha fazla montaj için kullanılmıştır. Betimleyici veriler, chi-square veya Fisher'ın tam testi kullanılarak değerlendirildi. Ayrıca, Spearman korelasyonu ve Kaplan-Meier hayatta kalma analizi yapıldı; p < 0.05 anlamlı olarak kabul edildi.
Veri dağılımına göre istatistiksel testlerin uygulanması: Öğrencinin t-testi kullanılarak normal veriler. Mann-Whitney U normal olmayan veriler için test yapar. Kruskal-Wallis testleri üçten fazla grup için yapılır. Fisher'ın tam ve kategorik veriler için ki-karesidir. İstatistiksel anlamlılık p < 0.05 olarak tanımlanır.
Veri güvenilirliği, kutu grafiklerinin örnekler arasında tutarlı ifade varyansı göstermesi ve PCA grafiklerinin ComBat ayarlamasından sonra toplu kümelerin olmadığını göstermesi gereken ön işlem kontrol noktaları tarafından korunur. Tümör-normal gruplaşmasını gösteren ısı haritaları ve gen yukarı/aşağı regülasyonunu açıkça gösteren volkan grafikleri DEG doğrulaması için gereklidir. Projeksiyon Cox modeli için, kalibrasyon grafikleri tahmin edilen ve gerçek hayatta kalma ile eşleşmeli, ROC AUC değerleri 0.65'ten büyük olmalı ve KM yayları önemli bir hayatta kalma farkı göstermelidir. Risk grupları arasındaki farklı rota faaliyetleri, genişleme veya hücre döngüsü yolları gibi yerleşik mekanizmalara uygun olarak GSVA analiziyle gösterilmelidir. Ağ dayanıklılığını doğrulamak için, PPI ağındaki yüksek bağlı düğümler merkezi olarak görünmelidir ve MCC tarafından belirlenen hub genleri fizyolojik olarak önemli düzenleyicilerle eşleşmelidir.