$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Etik bildirisi
Bu çalışma doğrudan insan katılımcıları veya hayvan denekleri dahil etmedi.
BaP Hedef Edinimi
BaP, birden fazla veritabanından gelen verileri entegre etmesiyle karakterize edildi. PubChem veritabanı (https://pubchem.ncbi.nlm.nih.gov/), kimyasal yapısını ve kanonik 2B yapısını elde etmek için "Benzo[a]pyrene" anahtar kelimesi kullanılarak sorgulandı (SMILES dizisi: C1=CC=C2C3=C4C(=CC2=C1)C=CC5=C4C(=CC=C5)C=C3)14. Potansiyel BaP hedefleri ChEMBL (https://www.ebi.ac.uk/chembl/), SEA (https://sea.bkslab.org/) ve PharmMapper (http://lilab-ecust.cn/pharmmapper)veritabanlarından 15,16,17 alındı. Tahmin edilen tüm hedefler Homo sapiens proteomuyla sınırlıydı. Tahmin edilen BaP hedeflerinin tam listesi (n = 474) Ek Tablo S1'de sunulmaktadır. Tam analitik iş akışı Şekil 1'de şematik olarak temsil edilmiştir.

Şekil 1. Bu makalede veri seti analizinin akış şeması yer alarak, veri toplama, ön işleme, diferansiyel ifade analizi, ağ oluşturma ve doğrulama adımları dahil olmak üzere genel iş akışını göstermektedir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
RA ile ilgili hedeflerin edinilmesi
Bu çalışmada, NCBI Gen İfadesi Omnibüsü (GEO) veritabanından (https://www.ncbi.nlm.nih.gov/gds/) beş RA veri seti "Romatoid artrit" ve "Homo sapiens" anahtar kelimeleri kullanılarak alındı18. Veri seti büyüklüğü ve deneysel tasarıma dayanarak, GSE77298 (RA: 16 örnek; Kontrol: 7 örnek), GSE1919 (RA: 5 örnek; Kontrol: 5 örnek), ve GSE55235 (RA: 10 örnek; Kontrol: 10 örnek) farklı olarak ifade edilen genleri (DEG) tanımlamak için eğitim setini oluştururken, GSE12021 (RA: 24 örnek; Kontrol: 13 örnek) ve GSE55457 (RA: 13 örnek; Kontrol: 10 örnek) doğrulama seti olarak kullanıldı. Bu veri setleri hakkında platformlar, örnekler ve GSE serileri gibi daha fazla detay Tablo 1'de bulunabilir.
Veriler, GEO2R çevrimiçi aracı kullanılarak standartlaştırıldı ve sonraki analizler için log2 dönüştürülmüş ifade matrisleri oluşturuldu. Farklı deneysel gruplardan gelen paraziti ortadan kaldırmak için, veri setleri arasındaki sistematik önyargılar, parametrik ampirik Bayes çerçevesine dayalı SVA paketinden ComBat fonksiyonu kullanılarak düzeltildi. Düzeltme etkisini doğrulamak için Ana Bileşen Analizi (PCA) kullanıldı ve partiler arası örneklem kümelenmesinde önemli ölçüde iyileşme gösterdi ve böylece parti etkilerinin etkili şekilde kaldırıldığını doğruladı. Birleştirilmiş ve düzeltilmiş veri matrisi, sonraki diferansiyel analiz için kullanılmıştır.
| GSE serisi | Örnekler | Platform | Grup |
| GSE77298 | 16 RA ve 7 kontrol | GPL570 | Eğitim grubu |
| GSE1919 | 5 RA ve 5 kontrol | GPL91 | Eğitim grubu |
| GSE55235 | 10 RA ve 10 kontrol | GPL96 | Eğitim grubu |
| GSE12021 | 24 RA ve 13 kontrol | GPL96 | Doğrulama kohortu |
| GSE55457 | 13 RA ve 10 kontrol | GPL9 | Doğrulama kohortu |
Tablo 1: Bu çalışmada kullanılan beş GEO veri setinin özeti.
Tablo, her veri seti için GEO erişim sayısını (GSE serisi), örnek bileşimini (romatoid artrit hastalarının ve sağlıklı kontrol sayısını), platform tanımlayıcısını (GPL) ve eğitim kohortu veya doğrulama kohortuna atamayı sağlar.
Ağırlıklı gen ortak ifade ağı analizi (WGCNA)
WGCNA, RA19 ile ilişkili DEG'lerin ortak ifade ağı özelliklerini değerlendirmek için kullanıldı. Toplu etki düzeltmeli ifade matrisine dayanarak, veri ön işleme yapıldı: standart sapması 0.5'ten az olan düşük varyanslı genler çıkarıldı, örnek ve gen kalitesi ise iyi örnekler ve genlerin değerlendirilmesi fonksiyonuyla değerlendirildi. Daha sonra, hiyerarşik kümeleme uygulanarak aykırı örnekleri tespit etmek ve çıkarmak için kullanıldı. Ağırlıklı bir ortak ifade ağı oluşturmak için, yumuşak eşik güç değerlerinin sistematik olarak değerlendirilmesi için bir fonksiyon kullanıldı ve 1'den 20'ye kadar değişen yumuşak eşik güç değerlerini sistematik olarak değerlendirdi. Güç = 12, optimal yumuşak eşik olarak seçildi (ölçeksiz topoloji uyum indeksi R2 = 0.90), böylece ağ topolojisi ölçeksiz bir kritere uydu. Bu güç değerine dayanarak, bir bitişiklik matrisi oluşturuldu ve topolojik örtüşme matrisi (TOM) hesaplandı. Genler hiyerarşik olarak kümelendi ve başlangıç gen modüllerini tanımlamak için dinamik bir ağaç kesme algoritması kullanıldı. Daha sonra, benzer modüller modül özgenlerinin kümelenmesiyle birleştirilerek sağlam bir gen modülü ağı oluşturuldu. Tüm analizler, ağ yapısının güvenilirliği ve tekrarlanabilirliğini sağlamak için ağırlıklı ortak ifade ağı analizi için özel bir R paketiyle gerçekleştirildi. DEG/WGCNA hub genleri ile tahmin edilen BaP hedefleri arasındaki kesişimin analizi, RA patogenezi ile ilişkili BaP'nin temel hedeflerini belirlemek için yapıldı ve bunlar Venn diyagram yazılımı kullanılarak görselleştirildi.
RA patogenezi ile ilişkili BaP ile ilişkili hedeflerin tanımlanması
Kesişim analizi, RA patogenezi ile örtüşen BaP hedeflerini belirlemek için Venn diyagramları için R paketi kullanılarak gerçekleştirildi. Bunlar, STRING veritabanına aktarıldı ve protein-protein etkileşimi (PPI) ağı oluşturuldu; tür "Homo sapiens" olarak ayarlandı ve etkileşim güven puanı yüksek ağ güvenilirliği için 0.7 >ayarlandı. 20. Bu eşik, STRING veritabanında "yüksek güven" seviyesine karşılık geldiği için seçilmiştir; bu da biyolojik olarak ilgili etkileşimlerin tutulmasını dengelerken, genellikle düşük güven puanlarıyla ilişkili yanlış pozitifleri en aza indirir. Ağ toksikoloji çalışmalarında sağlam ve tekrarlanabilir protein ilişkilerine öncelik vermek amacıyla > 0.7 kesintisi yaygın olarak benimsenmiştir. Ortaya çıkan TSV dosyası, protein-protein etkileşim veritabanından (STRING) indirildi ve ağ görselleştirme yazılımına (Cytoscape) aktarıldı ve ağ görselleştirme için aktarıldı. Ağdaki çekirdek proteinler, CytoHubba eklentisindeki Degree algoritması tarafından oluşturulan sıralama sonuçlarına dayanarak belirlendi ve sonraki analizler için kullanıldı.
KEGG ve GO zenginleştirme analizi
BaP modülasyonu ve RA patogenezi ile ilişkili genlerin kısaltmaları, "org. Hs.eg.db" annotation package in R. Daha sonra, KEGG yol zenginleştirme analizi clusterProfiler aracı kullanılarak gerçekleştirildi ve anlamlılık eşiği 0.05 olarak belirlendi. Bu arada, GO fonksiyonel açıklaması üç ana GO kategorisini kapsıyordu: Biyolojik Süreç (BP), Hücresel Bileşen (CC) ve Moleküler Fonksiyon (MF), ve hem P-değeri hem de Q-değeri kesim sınırları 0.05 olarak ayarlanmış enrichGO fonksiyonu kullanılarak gerçekleştirildi. Belirtmek gerekir ki, çoklu test düzeltmesi uygulanmamıştır; çünkü bu keşif analizinin temel amacı, potansiyel olarak ilgili biyolojik yolların ve fonksiyonel terimlerin keşfini en üst düzeye çıkarmak, böylece gelecekteki deneysel doğrulama için daha geniş bir test edilebilir hipotez seti oluşturmaktı. Son olarak, zenginleştirme analizi sonuçları, enrichplot paketinden barplot ve dotplot fonksiyonları kullanılarak grafik olarak gösterildi.
Çekirdek genlerin makine öğrenimi tabanlı doğrulaması
BaP ve RA ile ilişkili çekirdek genlerin öngörü kapasitesini değerlendirmek ve model şeffaflığını korumak için sistematik bir makine öğrenimi iş akışı uyguladık. Seçilen çekirdek genlerin ifade profilleri kullanılarak, öngörücü modeller 11 farklı makine öğrenimi algoritması ile oluşturuldu: Lasso regresyonu (LR), Destek Vektör Makinesi (SVM), rastgele orman (RF), glmBoost, adım adım Genelleştirilmiş Doğrusal Model (GLM), sırt regresyonu, elastik ağ (Enet), Gradient Boosting Machine (GBM), Lineer Diskriminant Analysis (LDA), eXtreme Gradient Boosting (XGBoost) ve naif Bayes. Hiperparametreler, beş katlı çapraz doğrulama yoluyla optimize edildi; veriler eğitim ve dahili doğrulama setlerine bölünmek için katmanlı örnekleme kullanıldı. Makine öğrenimi iş akışı boyunca sabit rastgele bir tohum (set.seed(123)) kullanılarak veri bölünmesi, çapraz doğrulama katlamaları ve model eğitiminin tekrarlanabilirliği sağlandı. Her algoritma için temel hiperparametreler, Ek Tablo S2'de sağlanmıştır. Model performansı, eğri altı alan (AUC), doğruluk ve F1 puanı dahil olmak üzere birden fazla ölçütle değerlendirildi. Tek model yaklaşımlarının sınırlamalarını gidermek için, en iyi performans gösteren temel modellerden tahminleri entegre eden bir yığma topluluk stratejisi uyguladık. Birçok makine öğrenimi modelinin "kara kutu" doğasını fark ederek, her genin tahminlere katkısını nicelendirmek için SHapley Additive ExPlanations (SHAP) algoritmasını kullandık. SHAP değerlerinin büyüklüğü ve yönü, sınıflandırma kararlarında genlerin önemini yorumlamak için kullanıldı ve böylece model çıktılarının yorumlanabilirliğini artırdı.
BaP'nin çekirdek hedeflerle moleküler kenetlenmesi
BaP ile çekirdek gen ürünleri arasındaki bağlanma özelliklerini incelemek için moleküler kenetlenme simülasyonları yapıldı. BaP'nin (ligand) üç boyutlu yapısı, PubChem veritabanından SDF formatında elde edilmiştir. Çekirdek hedeflere karşılık gelen protein yapıları, RCSB Protein Veri Bankası'ndan (https://www.rcsb.org/) PDB formatında alındı; UniProt tanımlayıcılarına göre seçildi; tercih ise birlikte kristalleşmiş ligandlar veya yüksek çözünürlüklü koordinatlar içeren yapılara verildi. Kenetlenmeden önce, protein hazırlığı PyMol kullanılarak gerçekleştirildi; bu süreçte su molekülleri, birlikte kristalleşmiş ligandlar ve iyonlar gibi protein dışı bileşenler girişimiönlemek için çıkarıldı. Orijinal PDB yapılarında birlikte kristalleşmiş ligandlara sahip proteinler için, aktif bölge merkezi bağlı ligandın atomik koordinatları kullanılarak tanımlanmıştır. Birlikte kristalleşmiş ligandları olmayan proteinler için, aktif bölge merkezi, literatürde katalitik aktivite veya inhibitör bağlanması için kritik olduğu bildirilen anahtar kalıntıların koordinatlarına dayanarak belirlenmiştir. Kenetlenme ızgarası, tanımlanmış aktif saha koordinatlarında merkezlenmişti ve her hedefe 25 × 25 × 25 şboyutlu kübik bir kutu uygulanıyordu. Bu standart 25 şkutu boyutu, her aktif alanın tam kapsamını sağlar ve ligand örnekleme için yeterli marjı sağlarken, aşırı hesaplama maliyetinden kaçınır. Tüm kenetlenme hesaplamaları AutoDock Vina (sürüm 1.2.5) ile gerçekleştirildi. En avantajlı Vina skorunu gösteren konformasyon temsil edici bağlanma modu olarak seçildi ve ilgili bağlanma enerjisi kaydedildi. PyMol (sürüm 2.5.7) kullanılarak üç boyutlu bağlanma pozları oluşturuldu ve Discovery Studio (sürüm 2021) kullanılarak hidrojen bağları ve hidrofobik temaslar dahil olmak üzere temel etkileşimleri görselleştirmek için iki boyutlu etkileşim diyagramları üretildi.
Moleküler dinamik simülasyonu
Moleküler dinamik simülasyonları, Gromacs 2025.3 ile yapıldı ve kenetlenme kaynaklı kompleksler başlangıç yapıları olarak kullanıldı. Protein atomları AMBER14SB kuvvet alanı ile modellendi ve su molekülleri TIP3P modeliyle temsil edildi. Her protein–ligand kompleksi, protein yüzeyi ile kutu sınırı arasında minimum 1 nm mesafe olan kübik su kutusunda çözüldü. Sistemin elektronötrlüğünü sağlamak için gerektiğinde sodyum veya klorür iyonları eklendi. İlk enerji en minimizasyonu, en dik iniş ve konjuge gradyan algoritmalarının birleşimi kullanılarak gerçekleştirildi; her biri 10.000 adıma kadar çalıştı. Uzun menzilli elektrostatik etkileşimler Parçacık-Mesh Ewald (PME) yöntemiyle hesaplandı, ayrıca hem van der Waals hem de kısa menzilli elektrostatik etkileşimlere 1.0 nm kesim mesafesi uygulandı. Enerji en düşük seviyelerinin ardından, sistemler NVT (sabit hacim ve sıcaklık) ve NPT (sabit basınç ve sıcaklık) koşullarında kademeli olarak dengelendi. 100 ns üretim serileri sabit sıcaklık ve basınç altında, 0.002 ps (2 fs) zaman adımı ve toplamda 50.000.000 adımla gerçekleştirildi. Her simülasyon bir kez yapıldı (tekrarlanmadı), çünkü birincil amaç bağlanma komplekslerinin standart koşullarda stabilitesini değerlendirmekti. Sıcaklık V-yeniden ölçekleme termostatı kullanılarak korundu ve basınç Parrinello–Rahman barostatı ile kontrol edildi. Simülasyon boyunca, bağlanmamış etkileşimler için tutarlı bir şekilde 1.0 nm kesme uygulandı. Yapısal kararlılık ve esnekliği değerlendirmek için, atomik konumların kök ortalama kare sapmasını (RMSD), kalıntı başına kök ortalama kare dalgalanmasını (RMSF), yapısal kompaktlık ölçüsü olarak dönme yarıçapını (Rg) ve çözücüye erişilebilir yüzey alanını (SASA) hesapladık. Tüm grafikler QtGrace kullanılarak oluşturuldu.