Çalışma, Helsinki Deklarasyonu'na uygun olarak yürütülmüş ve protokol, 22 Nisan 2025 tarihinde Anhui Göğüs Hastanesi Etik Kurulu tarafından onaylanmıştır (K2025-007). Çalışmaya katılan tüm öznelerden bilgilendirilmiş onam alınmıştır.
Veri çıkarımı ve normalizasyonu
LUAD için transkriptomik profiller ve ilgili klinik veri setleri TCGA ve GEO kohortlarından elde edilmiştir. TCGA-LUAD veri seti eğitim seti olarak belirlenmiş; GSE72094, GSE31210 ve GSE26939 ise dış doğrulama kohortları olarak kullanılmıştır (Tablo 1). Ek olarak, önceki bir çalışmadan 900 MCRG toplanmıştır12(Ek Tablo 1). Transkriptom verileri GENCODE v36 veya ilgili GPL platform anotasyon dosyaları kullanılarak açıklanmıştır. Prob ID'leri gen sembollerine dönüştürülmüş, yinelenen genler avereps fonksiyonu kullanılarak birleştirilmiş ve gen düzeyinde ekspresyon matrisleri oluşturmak için yalnızca protein kodlayan genler tutulmuştur. TCGA-LUAD eğitim seti için, örneklerin %50'den fazlasında milyon eşleşmiş fragman başına ekzon modelinin kilobazı başına fragman sayısı (FPKM) < 1 olan genler filtrelenmiş ve kalan ekspresyon değerlerine log2 dönüşümü uygulanmıştır (log2[FPKM+1]). GEO doğrulama kohortları için ham ekspresyon verileri indirilmiş, prob ID'leri ilgili platform anotasyon dosyaları kullanılarak gen sembollerine eşlenmiş ve aynı gene karşılık gelen çoklu problar, ekspresyon değerlerinin ortalaması alınarak birleştirilmiştir. Bu veri setlerine gerektiğinde log2 dönüşümü uygulanmıştır. Göreli karşılaştırılabilirliği sağlamak amacıyla her kohort için ayrı bir standardizasyon stratejisi benimsendiğinden, TCGA ve GEO arasında platformlar arası toplu etki (batch effect) düzeltmesi uygulanmamıştır. Spesifik olarak, hem eğitim hem de doğrulama kohortları için gen ekspresyon değerleri, her veri setinin ortalaması ve standart sapması kullanılarak merkezlenmiş ve ölçeklendirilmiştir (z-skoru dönüşümü). Daha sonra, eğitim setinden elde edilen aynı Cox regresyon katsayıları, tüm kohortlar için risk skorlarını hesaplamak amacıyla kullanılmıştır. Klinik uygulanabilirliği korumak ve herhangi bir doğrulama setine aşırı uyum sağlamaktan (overfitting) kaçınmak için, eğitim kohortunun medyan risk skoru, tüm dış doğrulama kohortlarındaki hastaları yüksek ve düşük riskli gruplara ayırmak için sabit bir kesme noktası olarak kullanılmıştır. Yaş, cinsiyet, patolojik evre, Tümör-Nod-Metastaz (TNM) evresi, histolojik tip, sağkalım süresi, sağkalım durumu ve doku tipi dahil olmak üzere klinik bilgiler, mevcut olduğunda çıkarılmıştır. Son nokta genel sağkalım (OS) olarak belirlenmiştir. Eksik sağkalım bilgisi olan veya sağkalım süresi < 30 gün olan örnekler hariç tutulmuştur. Sağkalım süresi yıla çevrilmiş ve sağkalım durumu hayatta olanlar için 0, ölenler için 1 olarak kodlanmıştır.
Aday genlerin tanımlanması ve fonksiyonel analizleri
Limma paketi, eğitim setindeki LUAD tümör ve normal örnekler arasındaki farklı ifade edilen genleri (DEG'ler) belirlemiştir13. DEG'ler, |log2FC| > 0.5 ve düzeltilmiş p-değeri < 0.05 kriterlerine göre tanımlanmıştır. Ardından, DEG'leri farklı ekspresyon kümelerine ayırmak için ClusterGVis R paketindeki mfuzz bulanık kümeleme algoritması kullanılmıştır. Üyelik puanlarına dayanarak her kümedeki en temsili beş gen üzerinde Gen Ontolojisi–Biyolojik Süreç (GO-BP) analizi tamamlanmıştır. DEG'ler ile MCRG'lerin kesişimi alınarak ortak gen seti türetilmiştir. Örtüşen genlerin biyolojik uygunluğu, Gen Ontolojisi/Kyoto Genler ve Genomlar Ansiklopedisi (GO/KEGG) kullanılarak yapılan fonksiyonel zenginleştirme analizi ile değerlendirilmiştir. Protein-protein etkileşim (PPI) ağları STRING veri tabanından elde edilmiştir14. Ağ güvenilirliğini artırmak için yalnızca güven puanı > 0.7 olan etkileşimler tutulmuştur.
Prognostik gen taraması
LUAD'da genel sağkalımla ilişkili olması muhtemel genleri belirlemek için tek değişkenli Cox regresyon analizi gerçekleştirmek amacıyla Survival paketi kullanılmıştır15. p-değeri < 0.05 olan genler potansiyel prognostik göstergeler olarak değerlendirilmiştir. TCGA-LUAD eğitim kohortu, tam sağkalım verilerine sahip 500 hastayı içermekte olup, bunlardan 216'sı (%43,2) izlem sırasında ölüm olayları yaşamıştır. Aday genlerin (n = 108) olaylara (n = 216) oranı yaklaşık 1:2 olup bu durum Cox regresyon analizi için kabul edilebilir düzeydedir. Ardından, öznitelikleri daha fazla seçmek için En Küçük Mutlak Büzülme ve Seçim Operatörü (LASSO) regresyon analizi ve Ekstrem Gradyan Artırma (XGBoost) modeli kullanılmıştır. Cox orantılı risk modelleri, glmnet paketinin cv.glmnet fonksiyonu aracılığıyla family = "cox" şeklinde oluşturulmuştur. Optimal düzenlileştirme parametresi, 10 katlı çapraz doğrulama kullanılarak belirlenmiş ve minimum çapraz doğrulama hatasını temsil eden λ.min değeri, optimal λ değeri olarak seçilmiştir. Sıfır olmayan regresyon katsayılarına sahip genler aday öznitelikler olarak çıkarılmıştır. XGBoost modeli için sağkalım süresi ve sağkalım durumu sonuç değişkeni olarak birleştirilmiş; ölüm olaylarına pozitif değerler, sansürlü vakalara ise negatif değerler atanmıştır. Parametreler objective = "survival: cox" ve eval_metric = "cox-nloglik" olarak, 100 iterasyon ve 0,1 öğrenme hızıyla ayarlanmıştır. Model eğitiminden sonra, öznitelik kazanç değerleri kullanılarak gen önem skorları hesaplanmıştır. Öznitelik boyutunu ve model karmaşıklığını azaltmak için önem skorları azalan sırada sıralanmış ve ilk 20 gen tutulmuştur. LASSO ve XGBoost sonuçları arasında örtüşen genler, aday prognostik genler olarak tanımlanmıştır.
Prognostik bir modelin oluşturulması ve değerlendirilmesi
Belirlenen aday genlerin çok değişkenli Cox regresyon analizi kullanılarak bir prognostik model geliştirilmiştir. Risk skorları şu şekildele bireysel olarak hesaplanmıştır:
.
burada Coefi i geni için katsayıyı ve Expi ilgili gen ekspresyon değerini belirtir. Bireyler daha sonra, medyan risk skoru kesme noktası olarak kullanılarak yüksek riskli ve düşük riskli olmak üzere iki gruba ayrılmıştır. Ardından, zamana bağlı alıcı işletim karakteristiği (ROC) eğrileri oluşturulmuştur. Aşırı uyum (overfitting) potansiyelini değerlendirmek için, 1.000 yeniden örnekleme iterasyonu ile bootstrap dahili doğrulaması gerçekleştirilerek, %95 güven aralıkları ile yanlılığı düzeltilmiş C-indeksi ve zamana bağlı AUC'ler hesaplanmıştır. 2, 3 ve 5 yıllık tahmin edilen ve gözlemlenen sağkalım olasılıkları arasındaki uyumu değerlendirmek için kalibrasyon eğrileri oluşturulmuştur. Ayrıca, farklı eşik olasılıklarında risk skorunun klinik karar verme sürecindeki potansiyel değerini nicelleştirmek amacıyla, modelin 2, 3 ve 5 yıllık zaman noktalarındaki klinik net faydasını değerlendirmek için R'daki ggDCA paketi kullanılarak karar eğrisi analizi (DCA) yapılmıştır. Riskle tabakalandırılmış gruplar ve diğer klinik kategoriler arasındaki sağkalım farklılıkları, log-rank testi ile Kaplan–Meier (KM) sağkalım eğrileri kullanılarak karşılaştırılmıştır. Ayrıca, bireysel genlerin model performansına katkılarını aydınlatmak için post-hoc açıklayıcı yorumlama amacıyla Shapley Additive exPlanations (SHAP) analizi kullanılmıştır.
Nomogram geliştirme ve dış doğrulama
Modelin klinik uygulanabilirliğini değerlendirmek amacıyla, hesaplanan risk skorları ile çeşitli klinik özellikler (cinsiyet, yaş ve TNM evresi dahil) arasındaki ilişkiler Wilcoxon sıra toplamı veya Kruskal-Wallis testleri kullanılarak incelenmiştir. Risk skorunun bağımsız bir prognostik faktör olarak işlev görüp görmediğini değerlendirmek için klinik değişkenler ve risk skoru çok değişkenli Cox regresyon modellemesine dahil edilmiştir. Ardından, hayatta kalma olasılığı tahminlerini bireyselleştirmek için bağımsız klinik risk faktörlerini (örneğin, Evre) ve genetik risk skorunu birleştiren bir prognostik nomogram, regplot R paketi aracılığıyla oluşturulmuştur. Nomogram tarafından öngörülen hayatta kalma olasılığının gerçek hayatta kalma sonuçlarıyla uyumunu değerlendirmek için kalibrasyon eğrileri kullanılmıştır. Son olarak, entegre nomogram sisteminin nihai öngörü kapasitesi ve genellenebilirliği, zaman bağımlı ROC eğrileri ve kohortlar genelinde kapsamlı KM klinik alt grup analizleri ile titizlikle doğrulanmıştır.
İmmün infiltrasyon ve immün alt tip analizleri
LUAD hastalarındaki immün hücre infiltrasyonunu değerlendirmek amacıyla, lökosit gen (LM22) imza matrisi kullanılarak 22 immün hücre tipinin göreceli oranlarını tahmin etmek için CIBERSORT kullanılmıştır. Prognostik gen ekspresyon seviyeleri ile immünolojik infiltrasyon arasındaki ilişkiler Spearman korelasyon analizi ile değerlendirilmiştir. İmmün, stromal, tümör saflığı ve ESTIMATE skorları ESTIMATE algoritması aracılığıyla türetilmiş ve risk grupları arasındaki farklar Wilcoxon testi ile değerlendirilmiştir. LUAD hastaları, ImmuneSubtypeClassifier paketi16 kullanılarak altı immün alt tipe ayrılmıştır. Risk grupları arasındaki immün alt tip dağılımlarını karşılaştırmak için ek olarak Wilcoxon testi kullanılmıştır.
İmmün kontrol noktası, immünofenoskor ve kanser immünite döngüsü analizleri
Bu çalışmada, LUAD immün manzarasını karakterize etmek amacıyla, riskle stratifiye edilmiş gruplar genelinde 21 immün kontrol noktası genini17 değerlendirmek için Wilcoxon sıra toplamı testi kullanılmıştır. Aday prognostik genler, Spearman korelasyonu ile immün kontrol noktası genlerine ilişkilendirilmiştir. Farklı risk seviyelerindeki LUAD hastalarında immün kontrol noktası inhibitörlerine (ICI'lar) verilen yanıttaki farklılıkları değerlendirmek için, anti-PD-1 ve anti-CTLA-4 tedavilerine ait immünofenospuan (IPS) verileri The Cancer Immunome Atlas (TCIA)18 üzerinden elde edilmiş ve kanser-immünite döngüsü aktivitesini değerlendirmek ile risk grupları arasındaki ilgili puanları karşılaştırmak için Tracking Tumor Immunophenotype (TIP)19 veri tabanı kullanılmıştır.
Somatik mutasyon ve ilaç duyarlılık analizi
Risk grupları arasındaki mutasyon modellerindeki varyasyonları incelemek için TCGA mutasyonları aracı kullanılarak TCGA-LUAD vakalarına ait somatik mutasyon profilleri elde edildi. Mutasyon verileri maftools paketi ile işlendi ve görselleştirildi. Her bir örnek için tümör mutasyon yükü (TMB) seviyeleri belirlendi ve iki risk kategorisi arasında karşılaştırıldı. Farmakogenomik duyarlılık analizi, Genomics of Drug Sensitivity in Cancer (GDSC) veri tabanına20 uygun olarak pRRophetic paketi kullanılarak gerçekleştirildi. Her bir LUAD hastası için antikanser ilaçların yarı maksimal inhibisyon konsantrasyonu (IC50) değerleri tahmin edildi ve risk grubu arasındaki farklılıklar Wilcoxon sıra toplam testi kullanılarak nicelendirildi.
Prognostik genlerin ekspresyon seviyelerinin değerlendirilmesi
Her bir veri seti, seçilen aday sonuçla ilişkili genlerin transkript düzeylerini değerlendirmek için kullanılmıştır. Gen ekspresyonunu hasta prognozu ile ilişkilendirmek amacıyla, survminer R paketindeki surv_cutpoint fonksiyonu aracılığıyla optimal kesim noktaları belirlenmiştir. Bu eşik değerlere dayanarak, LUAD vakaları sonraki sağkalım analizi için yüksek ve düşük ekspresyonlu alt gruplara ayrılmıştır.
Ayrıca, Anhui Göğüs Hastanesi'nden eşleşmiş beş LUAD tümörü ve komşu normal doku çifti temin edilmiş ve ardından qPCR doğrulaması gerçekleştirilmiştir. Tüm katılımcılar yazılı bilgilendirilmiş onay vermiştir. qPCR doğrulaması için altı aday prognostik gen (PDGFB, LDHA, ZEB2, FKBP4, DMD ve S100B) seçilmiştir. RNA, RNA ekstraksiyon reaktifi kullanılarak homojenize edilmiş doku örneklerinden ekstrakte edilmiş, ardından kloroform ekstraksiyonu ve izopropanol çöktürmesi uygulanmıştır. RNA konsantrasyonu ve saflığı spektrofotometre ile ölçülmüştür. Altı aday prognostik genin qPCR doğrulaması, bir real-time PCR sisteminde SYBR Green tabanlı PCR master mix kullanılarak gerçekleştirilmiştir: 95 °C'de 30 s boyunca başlangıç denatürasyonunu takiben 40 döngü boyunca 95 °C'de 20 s, 55 °C'de 20 s ve 72 °C'de 20 s uygulanmıştır. Relatif ekspresyon hesaplanmış ve 2-ΔΔCt tekniği ile Glyceraldehyde-3-Phosphate Dehydrogenase(GAPDH) genine göre standardize edilmiştir. Tüm reaktiflerin ve cihazların detayları Malzemeler Tablosunda verilmiştir.
İstatistiksel analiz
İstatistiksel analizler, istatistiksel hesaplama ve grafikleme yazılımı kullanılarak gerçekleştirilmiştir. Protein-protein etkileşim ağı, ağ analiz yazılımı kullanılarak görselleştirilmiştir. Normalite değerlendirmesinin ardından, normal dağılım gösteren sürekli değişkenler için Student t-testi, normal dağılım göstermeyenler için ise Mann-Whitney U testi kullanılmıştır.