Çin'de 18 Şubat 2023'te yayımlanan İnsan Özekleri İçeren Yaşam Bilimleri ve Tıbbi Araştırmaların Etik İnceleme Ölçümleri'ne göre, kamuya açık veriler kullanılarak yapılan araştırmalar, etik incelemeden muafiyet kriterlerini karşılayabilir. Bu çalışma yalnızca kamuya açık olan, kimliği yok olan ikincil transkriptomik verileri kullandı ve yeni insan katılımcı alımı, insan örnek toplama veya hayvan deneyleri içermedi. Bu nedenle, ek kurumsal etik onay gerekmiyordu. Bu çalışmada hayvan deneyleri yapılmadı. Bu nedenle, kurumsal hayvan bakım ve kullanım komitesinin onayı geçerli değildi.
Atrial fibrilasyonda endoplazmik retikülüm stresine bağlı genler için veri kaynakları
Bu çalışmada, GEO veritabanından kamuya açık AF ile ilgili transkriptomik veri setleri alındı; bunlar arasında GSE41177, GSE79768, GSE115574, GSE14975 ve GSE165838 yer aldı. GSE veri setleri hakkında ayrıntılı bilgiler, Ek Dosya 1—Ek Tablo S1'de sunulmaktadır. GSE41177 ve GSE79768 entegre toplu transkriptomik eğitim kohortunu oluşturmak için kullanılırken, GSE115574 ve GSE14975 iki bağımsız dış doğrulama kohortu olarak kullanıldı. GSE165838 tek hücreli transkriptomik analiz için kullanıldı. Bu veri setleri farklı platformlarda oluşturulduğu ve doku kaynağı, klinik arka plan ve örnek bileşimi açısından farklılık gösterebileceği için, her veri seti platform özelliklerine göre entegrasyon veya doğrulama öncesinde ayrı ayrı ön işlenmiş durumda. Toplu etki düzeltmesi, birleşen eğitim grubu için sva R paketiyle gerçekleştirildi. Endoplazmik retikulum stresle ilişkili gen seti, GeneCards veritabanından 3 ≥ alaka puanı ile alındı ve dedlikalisiyondan sonra bu çalışmada kullanılan hedef gen listesini oluşturdu.
Diferansiyel olarak ifade edilen genlerin analizi
Veri standartlaştırılması ve normalizasyonundan sonra, entegre eğitim setinde farklı olarak eksprese edilen genleri (DEG) tanımlamak için R paket limma kullanıldı. DEG'ler aşağıdaki anlamlılık kriterleriyle tanımlanmıştır: yanlış keşif oranına göre ayarlanmış P değeri (sıf. P.Val) < 0.05 ve |log2FC| > 0.58510. DEG'lerin ifade desenlerini görselleştirmek için, sırasıyla ggplot2 ve pheatmap paketleri kullanılarak volkan grafikleri ve ısı haritaları oluşturuldu.
WGCNA analizi
Koordineli gen düzenlemesinin potansiyel mekanizmalarını aydınlatmak, ortak ekspresyon modülleri ile klinik özellik değişkenleri arasındaki ilişki kalıplarını tanımlamak ve translasyon potansiyeline sahip çekirdek biyobelirteçleri veya terapötik hedefleri belirlemek için WGCNAuygulanmıştır 11.
R'deki WGCNA paketi kullanılarak ağırlıklı bir ortak ifade ağı oluşturuldu. Yumuşak eşik gücü (β) ölçeksiz topoloji kriterine göre seçildi; karşılık gelen β değeri, ölçeksiz topoloji uyum indeksi (R 2) 0.8512'ye ulaştığında ve üzerinde kaldığında sonraki analizler için seçildi. Modül tanımlama sırasında, dinamik ağaç kesimi ve modül algılama hassasiyetiyle ilgili parametreler, modül sınır çözünürlüğü ve kararlılığını artırmak için optimize edildi. Son olarak, hedef özellikle anlamlı ilişkili modüller çıkarıldı ve modüler içi genler, sonraki analizler için aday gen setleri olarak tanımlandı.
AF ile ilgili DEG'lerin zenginleştirme analizi
Hub genlerini kesin olarak tanımlamak için, DEG'ler önce anahtar WGCNA modüllerinden genlerle kesiştirilerek AF patogenezinde rol oynayan bir gen seti tanımlandı. Sonrasında, bu AF gen seti ERS ile ilgili genlerle daha fazla kesiştirildi ve ortaya çıkan örtüşen genler sonraki analizler için korundu.
Tarama genlerinin fonksiyonel zenginleşmesi, Gen Ontolojisi (GO) ve Kyoto Genler ve Genomlar Ansiklopedisi (KEGG) analizleri kullanılarak değerlendirildi. GO terimleri, biyolojik süreç (BP), hücresel bileşen (CC) ve moleküler fonksiyon (MF) kategorileri13 boyunca zenginleşmeyi özetlemek için R paket clusterProfiler ile analiz edildi. KEGG analizi daha sonra hedef genlerle ilişkili zenginleştirilmişyolları belirlemek için kullanıldı 14. Düzeltilmiş P değeri 0,05 < zenginleştirme sonuçları istatistiksel olarak anlamlı olarak kabul edildi. Önde gelen GO terimleri ve KEGG yolları, ggplot2 kullanılarak bar grafikleri ve baloncuk grafikleri olarak gösterildi.
Protein-protein etkileşimi (PPI) analizi
PPI analizi, kesişen gen setinin STRING veritabanına yüklenmesiyle gerçekleştirildi ve organizma Homo sapiens ile sınırlandırıldı. Bağlantısı kopuk düğümler kaldırıldı ve etkileşimler orta bir güven puanı eşiği kullanılarak (birleşik puan 0,4≥ alındı). Ortaya çıkan PPI ağı, daha sonra ana düğümleri belirlemek için topolojik analiz için bir ağ görselleştirme ve analiz aracına aktarıldı.
12 makine öğrenimi algoritmasına dayalı bir aday AF-ERS sınıflandırma modelinin oluşturulması
Bu çalışmada, AF ile ilişkili ERS ile ilişkili aday imza genlerini taramak ve sınıflandırma performansını optimize etmek için on iki geleneksel makine öğrenimi algoritmasına dayalı bir topluluk sınıflandırma çerçevesi geliştirilmiştir. Veri bölmesi için, standartlaştırma ve normalizasyondan sonra, GSE41177 ve GSE79768 birleştirilerek eğitim kohortu ifade matrisi oluşturuldu. GSE115574, model genellenebilirliğini değerlendirmek için bağımsız bir dış doğrulama kohortu olarak kullanıldı. Özellikle, DEG'ler ilk olarak eğitim kohortunda tanımlanmıştır (|log2FC| >0.585, p < 0.05 olarak ayarlanmıştır). Bu DEG'ler, daha sonra anahtar WGCNA modüllerinden ve ERS ile ilgili genlerden gelen genlerle kesiştirildi ve ortaya çıkan gen seti model inşası için giriş özellikleri olarak kullanıldı.
ERS ile ilgili genleri AF fenotipiyle bağlamak için, 12 makine öğrenimi yaklaşımı kullanılarak bir aday sınıflandırma modeli geliştirildi: Lasso, Ridge, adımlı genelleştirilmiş doğrusal model (Stepglm), aşırı gradyan güçlendirme (XGBoost), rastgele orman (RF), elastik ağ (Enet), genelleştirilmiş doğrusal modeller için kısmi en küçük kare regresyon (plsRglm), genelleştirilmiş yükseltilmiş regresyon modelleme (GBM), saf Bayes, lineer ayrımcı analiz (LDA), glmBoost, ve vektör makinesini (SVM) destekledi. Sistematik bir kombinatoryal modelleme stratejisi, birincisine ikinci bir algoritma eklenip bunları α ayar parametresi üzerinden entegre ederek benimsendi ve kapsamlı şekilde değerlendirilen 113 özellik seçimi ve model uyumu kombinasyonu elde edildi. Model ayırtıcılığı, alıcının çalışma karakteristik eğrisinin (AUC) altındaki alan hesaplanarak değerlendirildi. Daha önce bildirilen model seçim kriterlerine göre, nihai aday çerçevesi, eğitim ve doğrulama kohortları arasında ortalama AUC ile değerlendirilen en iyi genel performansa sahip model olarak tanımlanmıştır.
Bu kombinatoryal modelleme stratejisi, biyomedikal makine öğrenimi (15,16,17) üzerine yapılan önceki çalışmalardan şekillenmiştir. Bu çalışmalar toplamda, veri setleri ve analitik görevlerde hiçbir algoritmanın diğerlerinden sürekli üstün performans göstermediğini göstermektedir. Bu varsayıma dayanarak, topluluk öğrenme ve kombinatoryal modelleme çerçevesinin benimsenmesi, daha kararlı genellenebilirliğe sahip yüksek performanslı bir aday modeli elde etme olasılığını artırabilir ve model seçiminin sağlamlığını artırabilir.
Daha sonra, makine öğrenimi modelini yorumlamak için SHapley Additive exPlanations (SHAP) değerleri uygulandı; AF sınıflandırmasını yönlendiren temel özellikler görselleştirildi; böylece her bir özelliğin tahmin edilen sonuca katkısını niceleştirdi ve bireysel imza genlerinin nihai modelçıktısını nasıl etkilediğini gösterdi 18.
Model performansının değerlendirilmesi ve optimal modelin dış doğrulaması
Optimal modelin performansı, eğitim kohortunda ve bağımsız dış doğrulama kohortunda (GSE115574) değerlendirildi. Model düzeyinde, tahmin edilen sınıf etiketlerine dayalı bir karışıklık matrisi oluşturuldu ve ilgili sınıflandırma metrikleri raporlandı. Alıcı çalışma karakteristikası (ROC) eğrileri R paketi pROC kullanılarak oluşturuldu ve AUC, ayırt edici performansı nicelikle ölçmek için hesaplandı.
Biyobelirteç düzeyinde, optimal modeldeki her anahtar gen için tek genli ROC eğrileri çizildi ve ilgili AUC'ler bireysel ayırt edici yeteneklerini değerlendirmek için hesaplandı. Ayrıca, anahtar genlerin farklı ekspresyonu volkan grafiki kullanılarak özetlenmiş ve hastalık ile sağlıklı örneklerdeki ifade dağılımlarını göstermek için kutu grafikleri kullanılmıştır. Daha önce tanımlanmış optimal model türetilmiş gen imzasının genellenebilirliğini daha fazla değerlendirmek için, GSE14975 kullanılarak ek bağımsız bir dış doğrulama gerçekleştirildi. GSE14975, sol atriyal ek örneklerinden alınan transkriptomik veriler içerir; beş atriyal fibrilasyon örneği ve beş sinüs ritmi/kontrol örneği bulunur. Kilitli imzaya dahil edilen tüm genler bu veri setinde mevcuttu. Orijinal çapraz kohort analitik iş akışıyla tutarlılığı korumak için, geliştirme grubu ve GSE14975, ComBat kullanılarak veri seti kaynağı olarak toplu değişken olarak uyumlandırıldı. Bu uyum denetimsiz bir şekilde gerçekleştirildi. Önemli olarak, GSE14975 hastalık/kontrol etiketleri özellik seçimi, katsayıyı tahmini, eşik belirleme veya hiperparametre ayarlaması için kullanılmamıştır.
Optimal modelden türetilen puanlama modeli yalnızca geliştirme grubu kullanılarak uygulandı ve ardından dış doğrulama için GSE14975'ye uygulandı. GSE14975 model performansı, alıcı çalışma karakteristik eğrisi analizi, eğri altındaki alan, %95 güven aralığı (CI), hassasiyet, özgülük, doğruluk, pozitif ve negatif öngörü değerleri ile Brier skoru kullanılarak değerlendirildi. Ayrıca, GSE14975'de tüm optimal model kökeni genleri için bireysel ayırt etme yeteneklerini göstermek için tek gen ROC eğrileri oluşturuldu. Geliştirme kohortunda olası aşırı uyumu daha iyi değerlendirmek için, kilitli optimal modelden türetilen gen imzası kullanılarak tekrarlanan 10 katlı çapraz doğrulama ve bootstrap iyimserlik düzeltmesi gerçekleştirildi. Tekrarlanan çapraz doğrulama için, geliştirme kohortu tekrar tekrar 10 kata bölündü ve model ayrımcılığı tüm yinelemelerde özetlendi. Bootstrap doğrulaması için, görünüş geliştirme seti performansının iyimserliğini tahmin etmek ve iyimserlik düzeltilmiş AUC'yi hesaplamak amacıyla 1.000 bootstrap yeniden örnekleme oluşturuldu. Son imza optimal modelden türetildiği için, her genin katkısı öncelikle model katsayılarının mutlak büyüklüğü ve yönüne göre yorumlanmıştır. Ayrıca, her bileşen genin bireysel ayırt etme yeteneğini göstermek için GSE14975 tek gen ROC analizleri yapıldı. Görselleştirme amaçları için, tek genli ROC eğrileri, AF ile ilişkili yüksek ya da düşük ekspresyonun ilişkili olup olmamasına bakılmaksızın ayırt edici yeteneği yansıtacak şekilde yönlendirildi.
Gen seti zenginleştirme analizi (GSEA)
Ana genlerin işlevsel etkilerini incelemek için, GSEA hastalık grubu19'dan örneklerle gerçekleştirildi. Her anahtar gen için, örnekler hastalık grubundaki medyan ekspresyon değeri kullanılarak yüksek ve düşük ekspresyonlu alt gruplara ayrıldı. Her gen için iki alt grup arasındaki ortalama ifade farkı hesaplandı ve zenginleştirme analizi için girdi olarak azalan sıralanmış bir gen listesi oluşturuldu. GSEA, MSigDB koleksiyonu c2.cp.kegg.Hs.symbols.gmt'den alınan gen setleriyle R paket kümesi Profiler kullanılarak gerçekleştirildi. İstatistiksel anlamlılık p < 0.05 olarak tanımlandı. Zenginleştirme yönü, normalleştirilmiş zenginleştirme skorunun (NES) işaretiyle belirlendi ve temsil yolları için zenginleştirme grafikleri oluşturuldu.
İmmün hücre alt tip bolluğu ve diferansiyel ifadenin değerlendirilmesi
CIBERSORT dekonvolüsyon algoritması, infiltrasyon yapan bağışıklık hücresi alt kümelerinin göreceli bolluğunu ve örnekler arasındaki ilişkilerini tahmin etmek için uygulanmıştır. LM22 lökosit imza matrisine dayanarak, bağışıklık hücresi bileşimi gen ifade profillerinden R paketi CIBERSORT20 kullanılarak nicel olarak çıkarılmıştır. Sonuçları filtrelemek için p < 0.05 eşiği kullanıldı ve sadece bu kriterden geçen örnekler sonraki analizler için tutuldu. AF ve kontrol grupları arasındaki tahmini immigr-hücre alt kümelerinin göreli fraksiyonlarını karşılaştırmak için kutu grafikleri oluşturuldu. Ayrıca, Spearman'ın korelasyon analizi, bağışıklık hücresi infiltrasyon seviyeleri ile hub gen ekspresyonu arasındaki ilişkileri değerlendirmek için yapılmıştır.
Tek hücreli analiz
Tek hücreli transkriptomik analiz, GEO veri seti GSE165838 kullanılarak gerçekleştirildi. Ham gen hücresi sayı matrisleri R'ye ithal edilip Seurat v4.4.0 kullanılarak işlendi. Her örnek için, min.cells = 5 ve min.features = 300 olan CreateSeuratObject kullanılarak bir Seurat nesnesi oluşturuldu. Her hücre için tespit edilen genlerin sayısı, toplam benzersiz moleküler tanımlayıcı (UMI) sayıları, mitokondriyal gen yüzdesi, ribozomal gen yüzdesi ve hemoglobin gen yüzdesi gibi kalite kontrol metrikleri hesaplandı. Hücreler, 500'den fazla tespit edilen gen, 5.000'den az UMI sayısı, mitokondriyal gen yüzdesi < 25, ribozomal gen yüzdesi %3 >ve hemoglobin gen oranı %1< varsa tutulurdu. Üçten az hücrede tespit edilen genler çıkarıldı. MALAT1 ve mitokondriyal genler de aşağı akış analizinden önce dışlandı. DoubletFinder, potansiyel dubletleri tespit etmek ve dışlamak için kullanıldı. Kısaca, hücreler örnek kimliğine göre ayrıldı ve her örnek için ayrı ayrı olarak ana bileşenler 1–30 kullanılarak dublet tespiti yapıldı.
pN parametresi 0.25 olarak ayarlandı ve optimal pK değeri, parametre süpürmesinden elde edilen maksimum BC metriğine göre seçildi. Beklenen çift tutma oranı, her örnekteki kurtarılan hücre sayısına göre tahmin edildi; oranlar sırasıyla %2,5, %5 ve %6,5 olarak nispeten düşük, orta ve yüksek hücre sayılarına sahip örnekler için kullanıldı. Sadece tekil olarak sınıflandırılan hücreler tutuldu. Çevresel RNA kontaminasyonu DecontX kullanılarak ayrıca tahmin edildi ve 0,2 ≥ kontaminasyon puanına sahip hücreler hariç tutuldu. Kalite kontrol, çift kat çıkarma ve ortam RNA filtrelemesinden sonra, 40.886 hücre ve 23.947 gen sonraki analiz için tutuldu. Filtrelenmiş tek hücreli veri seti, 10.000 ölçek faktörü kullanılarak LogNormalize yöntemiyle normalleştirildi ve ardından yüksek değişkenlikli genler tanımlandı. Veriler ana bileşen analizinden önce ölçeklendirildi.
Örnekle ilgili toplu etkileri azaltmak için, Harmony parti değişkeni olarak orig.ident kullanılarak uygulanmıştır. Uniform Manifold Yaklaşımı ve Projeksiyon (UMAP) görselleştirmesi ve en yakın komşu grafik yapısı, ilk 15 Harmony düzeltilmişboyut 21 kullanılarak gerçekleştirildi. Kümeleme işlemi Louvain algoritması kullanılarak gerçekleştirildi ve birden fazla kümeleme çözünürlüğü değerlendirildi. Son ana hücre tipi notasyon, 0.05 çözünürlükteki küme sonucuna dayanıyordu. Hücre kümeleri, kanonik işaret-gen ifadesine göre manuel olarak notlandı. Bu belirteç tabanlı açıklama stratejisi, önceki tek hücreli bağışıklık profilleme çalışmalarıylatutarlıdır 22. T hücreleri CD3D, CD3E ve TRAC ile tanımlandı; doğal katil (NK) hücreleri NKG7, GNLY, NCAM1 ve KLRG1 tarafından; LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8 ve S100A9 tarafından monosit-makrofaj hücreleri; MS4A1 ve CD79A tarafından B hücreleri; plazma hücreleri MZB1 ve XBP1 ile uygulandı; endotel hücreleri PECAM1, VWF ve CDH5 ile; damar düz kas hücreleri ACTA2, TAGLN, MYH11 ve MYL9 ile; DCN, LUM, COL1A1, COL1A2 ve PDGFRA tarafından kullanılan fibroblastlar; FCGR3B, CXCR2, S100A8 ve MPO tarafından nötrofil benzeri hücreler; mast hücreleri TPSB2 ile; ve LILRA4, CD1C ve XCR1 tarafından dendritik hücreler kullanıldı. Kümeler arasında belirteç-gen ifadesi nokta grafikleri kullanılarak görselleştirildi ve son ERS ile ilgili hub genlerinin ifade dağılımı UMAP gömmelerinde görselleştirildi.
ERS ile ilgili transkripsiyon aktivitesini tek hücre düzeyinde nicelendirmek için, son merkez-gen seti AUCell, tek örneklem gen seti zenginleştirme analizi ve Seurat AddModuleScore kullanılarak hücre bazında imza puanlarını hesaplamak için kullanıldı. AUCell için hücre sıralamaları normalize edilmiş RNA ekspresyon matrisinden oluşturuldu ve AUC puanları, sıralanan genlerin en üst %10'u maksimum sıralama eşiği olarak kullanılan merkez-gen seti kullanılarak hesaplandı. ssGSEA için, zenginleştirme puanları GSVA paketi kullanılarak hesaplandı. Üç puanlama çıktısı ortalanıp ölçeklendirildi, ardından minimum maksimumu normalleştirildi ve sonunda her hücre için entegre ERS ile ilgili bileşik skor oluşturuldu. Bileşik skorun dağılımı annotasyonlu hücre popülasyonları arasında karşılaştırıldı ve ERS ile ilgili programın hücre tipi heterojenliği değerlendirildi. Monosit-makrofaj hattı belirgin ERS ile ilgili imza zenginleşmesi gösterdiği ve bağışıklık inflamatuar yeniden şekillendirme ile yakından ilişkili olduğu için, sonraki hatlar içi analizler için seçildi. Monosit-makrofaj hücreleri, medyan ERS ile ilgili bileşik skora göre yüksek ve düşük puanlı gruplara ayrıldı. Daha sonra monosit-makrofaj hücreleri üzerinde Monocle kullanılarak pseudotime yörünge analizi yapıldı.
Sözde zaman analizi için, ham sayım matrisinden negatif binomial ifade modeli kullanılarak bir CellDataSet nesnesi oluşturuldu. Boyut faktörleri ve dağılım daha sonra tahmin edildi. Sıralayan genler, ortalama ekspresyon eşiği ≥ 0.1 ve ampirik dispersiyanın uygun dispersyondan daha yüksek olması kullanılarak seçildi. DDRTree algoritması ile boyutluluk azaltıldı ve hücreler çıkarılan yörüng boyunca sıralandı. ERS ile ilgili hub genlerinin sözde zaman boyunca dinamik ifade desenleri görselleştirildi. Hücre-hücre iletişim analizi, farklı ERS ile ilgili skorlara sahip monosit-makrofaj hücrelerini içeren potansiyel ligand-reseptör etkileşimlerini incelemek için CellChat kullanılarak gerçekleştirildi. Bu analiz için, monosit-makrofaj hücreleri medyan bileşik skoruna göre yüksek veya düşük puanlı olarak etiketlenmiş, diğer hücreler ise orijinal hücre tipi etiketlerini korudu. Normalize RNA ifade matrisi ve buna karşılık gelen hücre grubu açıklamaları kullanılarak CellChat nesnesi oluşturuldu. Hücre-hücre iletişim analizi için insan CellChatDB veritabanı seçildi ve yalnızca salgılanan sinyal etkileşimleri değerlendirildi. İletişim olasılıkları hesaplanmadan önce aşırı ekspreslenen genler ve ligand-reseptör çiftleri tespit edildi. 10'dan az hücre içeren hücre grupları etkileşim analizinden dışlandı. Yol düzeyindeki iletişim olasılıkları daha sonra tahmin edilip hücre popülasyonları arasındaki etkileşim sayısı ve gücü karşılaştırılmak için toplanmıştır. Tekrarlanabilirliği kolaylaştırmak için, aşağıda her protokol adımını kendi beklenen çıktı şekli veya tablosuna (Ek Dosya 1—Ek Tablo S2) bağlayan bir kontrol noktası tablosu sunulmaktadır.