Bir makine öğrenimi algoritması kullanarak keloid için aday tanısal biyobelirteçlerin taranması
Bu çalışmaya toplam 283 hem metabolizmasıyla ilişkili gen dahil edilmiştir. Keloid ve normal cilt dokularını karşılaştıran GSE44270 veri setinin diferansiyel ekspresyon analizi, anlamlı düzeyde diferansiyel ekspresyon gösteren 25 gen belirlemiştir (Şekil 1A ve Ek Tablo S3). Hastalıkla ilişkili biyobelirteçleri daha ayrıntılı taramak amacıyla yapılan LASSO regresyonu ile 9 aday gen tanımlanmış (Şekil 1B,C ve Ek Tablo S3), rastgele orman (RF) algoritması ise yüksek öngörü önemine sahip 11 gen seçmiştir (Şekil 1D ve Ek Tablo S3). LASSO ve RF sonuçları arasındaki örtüşme bir Venn diyagramı kullanılarak görselleştirilmiş ve sonuç olarak FLVCR1, TMCC2, EIF2AK1, XK, HPX ve KEL olmak üzere altı temel biyobelirteç elde edilmiştir (Şekil 1E ve Ek Tablo S3). GSE44270 kohortunda yapılan alıcı işletim karakteristiği (ROC) analizi, altı biyobelirtecin tamamı için başarılı bir tanısal performans ortaya koymuştur; AUC değerleri FLVCR1 için 0.8016, TMCC2 için 0.7063, EIF2AK1 için 0.7817, XK için 0.7460, HPX için 0.7500 ve KEL için 0.7857 olarak bulunmuştur (Şekil 1F). Bu altı biyobelirtece dayanarak, R dilindeki rms paketi kullanılarak keloid için bir tanısal nomogram oluşturulmuştur (Şekil 1G).

Şekil 1: Makine öğrenimi algoritmaları kullanılarak keloid ile ilişkili aday hem metabolizmasıyla ilgili genlerin tanımlanması. (A) Keloid ve normal dokular arasında hem metabolizmasıyla ilgili genlerin diferansiyel ekspresyonunu gösteren kutu grafiği. (B,C) Aday diyagnostik markerların taranması için LASSO lojistik regresyon analizi. (D) RF algoritması tarafından seçilen aday biyobelirteçler. (E) İki makine öğrenimi algoritması tarafından tanımlanan örtüşen genleri gösteren Venn diyagramı. (F) Aday biyobelirteçlerin diyagnostik performansını değerlendiren ROC eğrisi analizi. (G) Altı gen imzasına dayalı keloid öngörüsü için nomogram. Kısaltmalar: LASSO, least absolute shrinkage and selection operator; RF, random forest; ROC, receiver operating characteristic. İstatistiksel anlamlılık: ns, P > 0.05; *, P < 0.05; **, P < 0.01; ***, P < 0.001; ve ****, P < 0.0001. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Tanısal nomogramın öngörü performansı, hem eğitim kohortunda (GSE44270) hem de doğrulama kohortunda (GSE7890) değerlendirilmiştir. Model, sırasıyla 0,984 (%95 GA: 0,950–1,000) ve 0,922 (%95 GA: 0,806–1,000) AUC değerlerine ulaşarak mükemmel tanısal doğruluk göstermiştir (Şekil 2A,D). Altı genli tanısal imzanın sağlamlığını ve potansiyel aşırı öğrenme (overfitting) durumunu daha ayrıntılı değerlendirmek amacıyla, keşif kohortunda (GSE44270) ek dahili doğrulama analizleri gerçekleştirilmiştir. Beş katlı çapraz doğrulama, alt kümeler arasında 0,925 ortalama AUC ile tutarlı bir ayırt edici performans sergilemiş ve bu durum, modelin eğitim örneklerindeki varyasyonlara rağmen stabil bir sınıflandırma performansı koruduğunu göstermiştir. Ayrıca, 1.000 yeniden örnekleme yinelemesi ile yapılan bootstrap doğrulaması 0,930 ortalama AUC (%95 GA: 0,794–1,000) sağlamıştır. Sınırlı örneklem boyutunun neden olduğu potansiyel iyimserlik (optimism) için yapılan düzeltme sonrası, iyimserlikten arındırılmış AUC 0,930 olarak kalmış; bu da altı genli imzanın tanısal performansının dahili doğrulama sonrası nispeten stabil olduğunu göstermiştir. Dahası, karar eğrisi analizi (DCA), sınırlı örneklem boyutu nedeniyle bulguların dikkatle yorumlanması gerekse de, nomogramın bir dizi eşik olasılığı boyunca alternatif tanı stratejilerine göre daha yüksek potansiyel net fayda sergilediğini ortaya koymuştur (Şekil 2B,E). Ek olarak, keloid örnekleri hem eğitim hem de doğrulama kohortlarında sağlıklı kontrollere göre anlamlı derecede daha yüksek risk skorları sergilemiş (Şekil 2C,F), bu da tanısal modelin stabilitesini ve güvenilirliğini daha da kanıtlamıştır.

Şekil 2: Keloid öngörüsü için nomogramın doğrulanması. (A) GSE44270 veri setinde nomogramın öngörücü performansını değerlendiren ROC eğrisi. (B) GSE44270'de nomogramın klinik faydasını değerlendiren DCA. (C) GSE44270'deki keloid ve sağlıklı örnekleri karşılaştıran risk skoru dağılımı. (D) Bağımsız GSE7890 veri setinde nomogramın öngörücü performansını değerlendiren ROC eğrisi. (E) GSE7890'da nomogramın klinik faydasını değerlendiren DCA. (F) GSE7890'daki keloid ve sağlıklı örnekleri karşılaştıran risk skoru dağılımı. Kısaltmalar: ROC = alıcı işletim karakteristiği; DCA = karar eğrisi analizi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Tanısal biyobelirteçler keloidin bağışıklık özellikleri ile ilişkilidir
Altı tanısal biyobelirteç ile immün mikroçevre arasındaki ilişkiyi araştırmak amacıyla, biyobelirteç ekspresyonu ile immün hücre infiltrasyonu arasındaki ilişkileri değerlendirmek için korelasyon analizi gerçekleştirilmiştir. Sonuçlar, altı biyobelirtecin tamamının birden fazla infiltre immün hücre popülasyonu ile anlamlı düzeyde ilişkili olduğunu ortaya koymuştur (Şekil 3A). Özellikle, FLVCR1 ekspresyonu, T foliküler yardımcı hücrelerle negatif ilişkiliydi (Şekil 3B). TMCC2 doğal öldürücü hücreler ve aktive olmuş dendritik hücrelerle pozitif korelasyon gösterirken, olgunlaşmamış dendritik hücreler ve olgunlaşmamış B hücreleri ile negatif korelasyon göstermiştir (Şekil 3C–F). Ayrıca, EIF2AK1 ekspresyon, CD56 ile negatif yönde ilişkiliydiboyut doğal öldürücü hücreler (Şekil 3G), öte yandan XK eosinofillerle negatif ilişkiliydi (Şekil 3H).

Şekil 3Aday hem metabolizmasıyla ilişkili genler ile immün hücre infiltrasyonu arasındaki korelasyon. (A) Aday genler ile bağışıklık hücresi popülasyonları arasındaki korelasyonları gösteren ısı haritası. Kırmızı pozitif korelasyonları, mavi ise negatif korelasyonları göstermektedir. (B). Arasındaki korelasyon FLVCR1 ekspresyonu ve T foliküler yardımcı hücreler. (C-F) Arasındaki korelasyonlar TMCC2 sırasıyla ekspresyon ve doğal öldürücü hücreler, aktive dendritik hücreler, immatür dendritik hücreler ve immatür B hücreleri. (G) Arasındaki korelasyon EIF2AK1 ekspresyonu ve CD56dim doğal öldürücü hücreler. (H). Arasındaki korelasyon XK ekspresyon ve eozinofiller. Kısaltmalar: FLVCR1 = kedi lösemi virüsü alt grubu C reseptörü 1; TMCC2 = transmembran ve sarmal-bobin bölgeleri 2; EIF2AK1 = ökaryotik translasyon başlatma faktörü 2 alfa kinaz 1; CD56boyut = farklılaşma kümesi 56 dim. Lütfen bu şeklin daha büyük bir versiyonunu görüntülemek için buraya tıklayın.
Tek hücreli transkriptom veri analizi
Tanımlanan diyagnostik biyobelirteçlerin keloid mikroçevresindeki ekspresyon modellerini karakterize etmek için GSE163973 tek hücre RNA sekanslama veri setini analiz ettik. Kalite kontrol ve veri entegrasyonunun ardından, sonraki analizler için 21.488 yüksek kaliteli hücre tutuldu. Toplam benzersiz moleküler tanımlayıcı (UMI) sayıları 200'den az veya 6.000'den fazla olan hücreler hariç tutuldu ve potansiyel dubletler DoubletDetection paketi kullanılarak belirlenip çıkarıldı. En yüksek ekspresyon değişkenliği gösteren 2.000 gen seçildi ve ardından boyut indirgeme ve Uniform Manifold Approximation and Projection (UMAP) ile görselleştirme yapıldı. Endotelyal hücreler, fibroblastlar, kas lifleri, keratinositler, bağışıklık hücreleri, lenfatik endotelyal hücreler, glandüler hücreler, nöral hücreler, melanositler ve sınıflandırılmamış bir hücre popülasyonu dahil olmak üzere toplam 10 ana hücre popülasyonu belirlendi (Şekil 4A,B). Ekspresyon profilleme, diyagnostik biyobelirteçlerin hücre tipine özgü belirgin dağılım modellerini ortaya çıkardı. FLVCR1 ağırlıklı olarak endotelyal hücrelerde ve melanositlerde eksprese edilirken, EIF2AK1 nöral hücrelerde, glandüler hücrelerde ve fibroblastlarda nispeten yüksek ekspresyon gösterdi. HPX temel olarak melanositlerde zenginleşmişken, KEL glandüler hücrelerde baskın ekspresyon sergiledi (Şekil 4C,D).

Şekil 4: Keloid tek hücre transkriptomunda hem metabolizmasıyla ilişkili tanısal biyobelirteçlerin dağılımı. (A) Keloid örneklerinden alınan 21.488 hücreden oluşan 21 hücre kümesini gösteren UMAP grafiği. (B) Orijinal çalışmada rapor edilen açıklamalara dayalı hücre tipi anotasyonları. (C) Farklı hücre tipleri genelinde hem metabolizmasıyla ilişkili tanısal biyobelirteçlerin ekspresyonunu gösteren özellik grafikleri. (D) Farklı hücre tipleri genelinde hem metabolizmasıyla ilişkili tanısal biyobelirteçleri eksprese eden hücrelerin yüzdelerini ve ortalama ekspresyon seviyelerini gösteren balon grafiği. Kısaltma: UMAP = uniform manifold approximation and projection. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Aday tanısal biyobelirteçlerin tanımlanması ve etkileşim ağı analizi
Aday tanısal biyobelirteçlerin temelindeki düzenleyici mekanizmaları incelemek için bir miRNA–mRNA düzenleyici ağı oluşturulmuştur. Öngörülen etkileşimlerin güvenilirliğini artırmak amacıyla, aday biyobelirteçleri hedefleyen örtüşen miRNA'lar belirlenmiştir. Altı tanısal biyobelirteç ile etkileşime giren toplam 282 miRNA elde edilmiş olup, ortaya çıkan düzenleyici ağ Şekil 5'te gösterilmiştir. Özellikle hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p ve hsa-miR-26b-5p'nin altı aday biyobelirtecin tamamını eş zamanlı olarak düzenlediği öngörülmüştür.

Şekil 5: Hem metabolizmasıyla ilişkili diyagnostik biyobelirteçlerin miRNA düzenleyici ağı. Ağ, altı diyagnostik biyobelirteç geni (FLVCR1, HPX, TMCC2, KEL, XK ve EIF2AK1) ile bunlarla ilişkili miRNA'lar arasındaki düzenleyici ilişkileri göstermektedir. Gen düğümleri diyagnostik biyobelirteçleri, çevreleyen düğümler ise miRNA'ları temsil eder. Kenarlar, deneysel olarak desteklenen miRNA–mRNA etkileşimlerini belirtir. Kısaltmalar: FLVCR1 = feline leukemia virus subgroup C receptor 1; HPX = hemopexin; TMCC2 = transmembrane and coiled-coil domains 2; KEL = Kell metallo-endopeptidase; XK = X-linked Kx blood group; EIF2AK1 = eukaryotic translation initiation factor 2 alpha kinase 1; miRNA = mikroRNA; mRNA = haberci RNA. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
FLVCR1 ekspresyonunun deneysel doğrulaması ve potansiyel terapötik bileşiklerin moleküler kenetleme analizi
Biyoinformatik bulguları doğrulamak ve tanımlanan merkez genin fonksiyonel ilgisini teyit etmek amacıyla, PKF ve NHDF'de FLVCR1 ekspresyonunu deneysel olarak değerlendirdik. Hem qRT-PCR hem de western blot analizleri, FLVCR1'in keloid fibroblastlerinde normal kontrollere kıyasla anlamlı düzeyde artırıldığını tutarlı bir şekilde göstermiştir (Şekil 6A–C, Ek Şekil S1 ve Ek Tablo S4). Bu artmış hücresel ekspresyon, FLVCR1 ile ilişkili hem metabolik disregülasyonun keloid patogenezindeki potansiyel rolünü desteklemektedir.
FLVCR1'in hem metabolizmasıyla ilişkili immün değişikliklerdeki potansiyel rolü göz önüne alındığında, bir sonraki aşamada bu patojenik ekseni kesmek amacıyla doğrudan FLVCR1'i hedefleyebilecek potansiyel terapötik bileşiklerin belirlenmesi hedeflenmiştir. Hazırlanan protein yapısı ve bir geleneksel Çin tıbbı (TCM) bileşik kütüphanesi kullanılarak yüksek çıktılı sanal tarama gerçekleştirilmiştir. En elverişli docking skorlarına sahip 20 bileşik, ileri değerlendirme için seçilmiştir (Ek Tablo S5). Genel olarak, daha düşük bağlanma enerjisi daha güçlü bir bağlanma afinitesini gösterir ve −5 kcal/mol altındaki docking enerjileri stabil ligand-protein etkileşimlerinin göstergesi olarak kabul edilir. Taranan bileşikler arasında (+)-Gallocatechin, (−)-Epicatechin, (−)-Gallocatechin ve Cyanidin (klorür), FLVCR1'e karşı elverişli bağlanma afiniteleri sergilemiştir. Özellikle (+)-Gallocatechin; GLU214, ASN245, GLN246 ve GLN471 ile dört hidrojen bağı oluşturarak FLVCR1 ile en güçlü etkileşimi göstermiş ve bu durum stabil bir ligand-protein bağlanma moduna işaret etmiştir (Şekil 6D–G). Bu bulgular, (+)-gallocatechin'in FLVCR1'i hedefleyen mekanizma tabanlı terapötik müdahale için gelecek vadeden bir aday olduğunu vurgulamaktadır.

Şekil 6: FLVCR1 ekspresyonunun deneysel doğrulaması ve FLVCR1'i hedefleyen potansiyel bileşiklerin moleküler kenetlenmesi. (A) CON ve keloid örneklerinde FLVCR1 protein ekspresyonunu gösteren temsili western blot görüntüleri. GAPDH yükleme kontrolü olarak kullanılmıştır. (B) GAPDH'ye göre normalize edilmiş FLVCR1 protein düzeylerinin kantifikasyonu. (C) CON ve keloid fibroblastlarında FLVCR1'in göreli mRNA ekspresyon düzeyleri qRT-PCR ile belirlenmiştir. GAPDH internal referans olarak kullanılmıştır. (D–G) FLVCR1 ile seçilen küçük moleküllü bileşikler arasındaki öngörülen bağlanma modlarının üç boyutlu temsilleri: (D) (+)-Gallocatechin. (E) (-)-Epicatechin. (F) (-)-Gallocatechin. (G) Cyanidin (Chloride). Kısaltmalar: FLVCR1 = feline leukemia virus subgroup C receptor 1; CON, kontrol; GAPDH, glyceraldehyde-3-phosphate dehydrogenase; qRT-PCR, quantitative reverse transcription polymerase chain reaction; SD, standart sapma. Veriler ortalama ± SD olarak sunulmuştur. İstatistiki anlamlılık: ns, P > 0.05; *, P < 0.05; **, P < 0.01; ***, P < 0.001; ve ****, P < 0.0001. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Moleküler dinamik simülasyonu ile FLVCR1–(+)-Gallocatechin kompleksinin stabilitesinin doğrulanması
Tahmin edilen ligand–protein bağlanma modunun güvenilirliğini incelemek için FLVCR1–(+)-gallocatechin kompleksi için moleküler dinamik (MD) simülasyonu gerçekleştirilmiştir. Analiz; RMSD, RMSF, jiro yarıçapı (Rg), SASA, hidrojen bağı analizi ve MM/GBSA hesaplamaları kullanılarak, kompleksin zamanla yapısal olarak stabil kalıp kalmadığına ve ligand bağlanmasının proteinin konformasyonel davranışını değiştirip değiştirmediğine odaklanmıştır. RMSD analizi (Şekil 7A), hem apo proteinin hem de liganda bağlı kompleksin ilk 20 ns içinde başlangıç dalgalanmaları yaşadığını, ardından kademeli bir stabilizasyon gerçekleştiğini göstermiş ve bu durum sistemlerin simülasyon sırasında dengeye ulaştığına işaret etmiştir. Dengelenmeden sonra, FLVCR1–(+)-Gallocatechin kompleksinin RMSD değeri 0.2 nm'nin altında kalmış ve bu da ligand bağlanmasının FLVCR1'in yapısal stabilitesinin korunmasına katkıda bulunduğunu göstermiştir. RMSF analizi (Şekil 7B), kalıntıların çoğunun simülasyon boyunca sınırlı dalgalanmalar sergilediğini göstererek genel protein bütünlüğünün korunduğuna işaret ederken, birkaç esnek bölge ligand yerleşiminde rol oynayan loop bölgelerini temsil etmiş olabilir. Ayrıca, stabil Rg ve SASA profilleri (Şekil 7C,D), kompleksin belirgin bir yapısal genişleme veya çözücü maruziyetinde değişiklik olmaksızın kompakt bir konformasyonu koruduğunu göstermiştir. Hidrojen bağı analizi (Şekil 7E), FLVCR1–(+)-Gallocatechin kompleksinin simülasyon sırasında yaklaşık 3–4 hidrojen bağı ile kalıcı intermoleküler etkileşimleri sürdürdüğünü ortaya koyarak ligand–protein birlikteliğinin stabilitesini desteklemiştir. MM/GBSA analizi ayrıca, FLVCR1–(+)-Gallocatechin kompleksinin elverişli bir bağlanma serbest enerjisi (ΔGtotal = −34.87 ± 4.13 kcal/mol) sergilediğini göstermiştir (Ek Tablo S6). Enerji ayrıştırma analizi, polar solvatasyon enerjisinden gelen elverişsiz katkıya (ΔGsolvation = 25.55 ± 0.74 kcal/mol) rağmen (Ek Tablo S6), van der Waals etkileşimlerinin (ΔVDWAALS = −46.34 ± 2.16 kcal/mol) ve elektrostatik etkileşimlerin (ΔEelec = −14.09 ± 3.45 kcal/mol) bağlanmaya temel elverişli katkılar olduğunu göstermiştir. Toplu olarak, bu MD simülasyon sonuçları (+)-Gallocatechin'in FLVCR1 ile stabil bir kompleks oluşturduğunu kanıtlamış ve docking ile tahmin edilen bağlanma modunun güvenilirliğini daha da desteklemiştir.

Şekil 7: FLVCR1–(+)-Gallocatechin kompleksinin moleküler dinamik simülasyon analizi. (A) 100 ns süren moleküler dinamik simülasyonu sırasında apo FLVCR1 ve FLVCR1–(+)-Gallocatechin kompleksinin RMSD profilleri. (B) Simülasyon sırasında FLVCR1'in kalıntı düzeyindeki dalgalanmalarını gösteren RMSF profili. (C) FLVCR1–(+)-Gallocatechin kompleksinin çözücüye erişilebilir yüzey alanındaki değişimleri gösteren SASA profili. (D) Simülasyon sırasında FLVCR1–(+)-Gallocatechin kompleksinin kompaktlığını değerlendiren Rg profili. (E) Simülasyon boyunca FLVCR1 ve (+)-Gallocatechin arasındaki dinamik moleküller arası etkileşimleri gösteren hidrojen bağı analizi. Kısaltmalar: FLVCR1 = feline leukemia virus subgroup C receptor 1; RMSD = root mean square deviation; RMSF = root mean square fluctuation; SASA = solvent-accessible surface area; Rg = radius of gyration. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Veri Kullanılabilirliği:
Bu çalışmada analiz edilen halka açık transkriptomik veri setlerine Gene Expression Omnibus (GEO) üzerinden GSE44270, GSE7890 ve GSE163973 erişim numaraları ile ulaşılabilir. qRT-PCR ölçümleri, orijinal western blot görüntüleri ve western blot kantifikasyon verileri dahil olmak üzere, bu çalışmada üretilen ve deneysel doğrulamaya temel oluşturan kaynak veriler Ek Şekil S1, Ek Tablo S1, Ek Tablo S2, Ek Tablo S3 ve Ek Tablo S4 olarak sunulmuştur. Moleküler kenetlenme sonuçları ve MM/GBSA bağlanma serbest enerjisi verileri ise Ek Tablo S5 ve Ek Tablo S6'da verilmiştir.
Ek Şekil S1: Western blotting orijinal verileri.Bu dosyayı indirmek için lütfen buraya tıklayın.
Ek Tablo S1: Hem metabolizması ile ilişkili genler.Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo S2: Seçilen genlerin primer dizileri. Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo S3: Keloidde potansiyel tanısal biyobelirteçlerin belirlenmesi için makine öğrenimi yaklaşımları.Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo S4: FLVCR1 ekspresyonunun deneysel doğrulamasını destekleyen ham veriler.Bu dosyayı indirmek için lütfen buraya tıklayınız.
Ek Tablo S5: FLVCR1 ile moleküler kenetleme yoluyla belirlenen en iyi 20 aday bileşik.Lütfen bu dosyayı indirmek için buraya tıklayın.
Ek Tablo S6: FLVCR1–(+)-Gallocatechin kompleksinin MM/GBSA bağlanma serbest enerjisi analizi.Bu dosyayı indirmek için lütfen buraya tıklayın.