$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Hastalar ve çalışma tasarımı
Bu çalışmanın ilk veri seti, 2017–2018 dönemi için Ulusal Sağlık ve Beslenme Muayene Anketi (NHANES) veri tabanından alınmıştır. Bu özel zaman dilimi seçildi çünkü anket verileri FibroScan® teknolojisiyle karaciğer ultrasonu geçici elastografi ölçümlerini içeriyordu. NHANES, katmanlı, çok aşamalı olasılık örnekleme tasarımı kullanır ve iki yılda bir yapılan ülke genelinde, nüfus temelli bir anket olarak hizmet vermektedir. Kurumsallaşmamış ABD nüfusu hakkında ulusal düzeyde temsil etkileyici sağlıkla ilgili verileri sistematik olarak toplayarak Amerika Birleşik Devletleri'ndeki genel sivil nüfusun beslenme ve sağlık durumunudeğerlendirir 1. NHANES, Ulusal Sağlık İstatistikleri Merkezi (NCHS) tarafından yönetilen ulusal düzeyde temsil bir kesitsel çalışmadır. Anket protokolü, NCHS Araştırma Etik İnceleme Kurulu'ndan onay aldı ve tüm katılımcılardan belgelenmiş bilgilendirilmiş onay alındı. Çalışma, Helsinki ve İstanbul Bildirgelerine uygun olarak yürütülmüş, Wenzhou Tıp Üniversitesi Birinci Bağlı Hastanesi etik komitesi tarafından onaylanmış (2016–246, 1 Aralık 2016) ve her katılımcıdan yazılı bilgilendirilmiş onayı alınmıştır.
İlk veri seti, NHANES 2017–2018 anketinden FibroScan testi geçiren 5494 kişiden oluşuyordu. Aşağıdaki hariç tutmadan sonra, analize toplam 2677 katılımcı dahil edildi; bunlardan 718'i NAFLD'li ve 1959'u NAFLD olmayan bireyden oluşuyordu. Bu katılımcılar rastgele olarak bir eğitim seti (n = 1785) ve bir test seti (n = 892) olarak ayrıldı. İkinci veri seti ise Wenzhou Tıp Üniversitesi Birinci Bağlı Hastanesi Enfeksiyon Hastalıkları Bölümü'nden 582 kişiyi (2018–2020) içeriyordu. Aynı dışlama kriterleri uygulandıktan sonra, toplam 200 kişi dahil edildi; bunların 159'u NAFLD'li ve 41'i NAFLD olmayan bireylerden oluştu. Bu kohort bağımsız bir doğrulama seti olarak kullanıldı. Çalışma tasarımı, çok merkezli veriler kullanarak modeli oluşturmak ve doğrulamak için geliştirildi; böylece bulguların güvenilirliği ve genellenebilirliği artırıldı. NAFLD ve NAFLD dışı grupların başlangıç klinik özellikleri, tablo birinci paket kullanılarak özetlenmiştir (Tablo 1). Ayrıca, hasta seçimi süreci ve genel çalışma akışı Şekil 1'de gösterilmiştir.
NAFLD için tanı kriterleri ve dışlama kriterleri
NAFLD tanısı şu kriterleredayandı 16: 18 yaş ve üzeri, önceki 12 ayda haftada haftada ≤140 g, erkekler için haftada 210 ≤g ile sınırlı alkol alımıyla sınırlı geçici elastografi (FibroScan) taramasına katılım, FibroScan 502 V2 Touch sistemi kullanılarak ölçülmüş kontrollü zayıflatma parametresi (CAP) değeri ≥ 302 dB/m (Echosens, Paris, Fransa) ile ya orta (M) ya da ekstra büyük (XL) bir sonda, ya da Wenzhou Tıp Üniversitesi Birinci Bağlı Hastanesi23 Enfeksiyon Hastalıkları Bölümü'nde karaciğer biyopsi patolojisiyle doğrulanan bir teşhis ile gerçekleşti.
NAFLD için dışlama kriterleri aşağıdaki şekilde özetlenmiştir:.yüksek alkol tüketimi (NHANES alkol kullanımanketi 5'e göre kadınlarda ortalama günlük alım 20 g> erkeklerde 30 g >), hepatit B veya C varlığı, HIV enfeksiyonu, otoimmün hepatit, primer safra kolanjiti, Wilson hastalığı, uzun süreli steroid olmayan anti-enflamatuar ilaçların kullanımı, kalsiyum kanal blokerleri, tamoksifen, amiodaron, kortikosteroidler, izoniasid veya metotreksat, hamilelik veya emzirme, ve karaciğer kanseri veya başka iyi huylu veya kötü huylu tümör teşhisi konması.
Veri toplama ve değişken seçimi
Bu çalışmaya dahil edilen potansiyel öngörücü değişkenler aşağıda listelenmiştir:
Demografik özellikler (yani yaş ve cinsiyet); Vücut kitle indeksi (BMI); NHANES veritabanındaki katılımcıların CAP değerleri; Genel biyokimya testleri [örneğin, Albümin (ALB), Globulin (GLO), Toplam Protein (TP), Laktat Dehidrojenaz (LDH), Kan Urea Azotu (BUN), Ürik Asit (UA), Gama-Glutamil Transferaz (GGT), Trigliserid (TG), Serum-Glikoz (Glu), Serum Kreatinin (SCr), Toplam Bilirubin (TBIL), Sodyum (Na⁺), Klorür (Cl⁻), Potasyum (K⁺), Kalsiyum (Ca), Bikarbonat (HCO₃), Toplam Kolesterol (TC), Aspartat Aminotransferaz (AST) ve Alanin Aminotransferaz (ALT)]; Standart hematolojik parametreler [yani, Kırmızı Kan Hücresi Sayısı (RBC), Beyaz Kan Hücresi Sayısı (WBC), Nötrofil Sayısı (NEUT), Eozinofil Sayıları (EOS), Lenfosit Sayıları (LYM), Monosit Sayıları (MON), Kırmızı Kan Hücresi Genişliği (RDW) ve Trombosit Sayıları (PLT)]; Hipertansiyon ve diyabet geçmişi (DM). Çalışmaya dahil edilen denekler arasında, diyabet ve hipertansiyon için tanı kriterleri, NAFLD24'e odaklanan önceki makine öğrenimi tabanlı tahmin modeli çalışmasından alınmıştır.
Eksik veri işleme ve özellik seçimi
Bu çalışmada kullanılan kohort verileri eksik değerleri içeriyordu. Tüm eksik kayıtların hariç tutulması, analiz örneklem büyüklüğünü azaltmakla kalmaz, aynı zamanda veri kalitesini de tehlikeye atır ve tahmin sonuçlarını potansiyel olarak yanlışlaştırır. Bu nedenle, %20'yi aşan eksik değerleri olan veriler hariç tutuldu. Eksik değerleri olan veri setleri için ≤%20, veri tipine göre farklı ödünç yöntemleri uygulanmıştır: sürekli değişkenler için "norm", ikili sınıflandırma değişkenleri için "logreg" ve çok sınıflı değişkenler için "polyreg". Bu ödümlemeler, çokluemputasyon 25 için R'deki "fare" paketi kullanılarak gerçekleştirilmiştir. Bu çalışmada, tüm sürekli değişkenler ikili değişkenlere bölündü ve alıcı çalışma karakteristikası (ROC) eğrisi analiziyle optimal sınıflandırma eşikleri belirlendi. Özellikle, ROC eğrisinde maksimum Youden Endeksi'ne karşılık gelen kesim noktası optimal sınıflandırma kriteri olarak seçilmiş, böylece sınıflandırma performansını optimize etmiş ve hassasiyet ile özgüllük arasında uygun bir denge sağlanmıştır. Daha sonra, verileri etkili bir şekilde kümelemek için kısmi en küçük kare ayrımcı analizi (PLS-DA) kullanıldı.
Daha fazla özellik seçimi için, bireyler "caret" paketi kullanılarak 7:3 oranında rastgele eğitim ve test setlerine yerleştirildi. İlk olarak, özellik seçimi için en az mutlak küçülme ve seçim operatörü (LASSO) regresyonu kullanıldı ve sonraki analizler için 14 ana değişken belirlendi. Sonra, ChatGPT-4 her değişkene bir önem puanı atanmak için uygulandı. Özellik önemini sistematik olarak değerlendirirken potansiyel yanlılık ve stokastik varyasyonu kontrol etmek için standart bir değerlendirme protokolü uygulandı. Modele verilen özel prompt şuydu: "Alkolsüz yağlı karaciğer hastalığı (NAFLD) ile ilgili yerleşik klinik literatüre dayanarak, LASSO regresyonuyla tanımlanan aşağıdaki 14 değişkenin her biri için 1 (en düşük) ile 10 (en yüksek) arasında bir önem puanı verin." Değerlendirme, LASSO regresyonuyla önceden seçilen değişkenlerle sınırlandırılarak, halüsinasyonlu veya alakasız özelliklerin dahil edilme riski en aza indirildi. Olası veri sızıntısını ve sonuç yaygınlığının yanlışlıkla kullanılmasını kesin bir şekilde önlemek için, dil modeli ampirik veri setine tamamen kör edildi. Puanlama, değişken isimleriyle ilgili önceden var olan tıbbi bilginin sentezlenmesine odaklandı. Bu prosedür, tamamen veri odaklı özelliklerin nihai model entegrasyonundan önce sağlam patofizyolojik makullük göstermesini sağlayarak LASSO kararlılık seçimi veya SHAP tabanlı budama gibi geleneksel metodolojileri geliştirir. Ayrıca, tek yanıtlı varyansı azaltmak için bu prosedür bağımsız olarak 10 kez tekrarlandı. Her değişken için ortalama puan bu yinelemeler boyunca hesaplandı ve böylece hedef önceliklendirme sağlandı. Değişkenler ortalama puanlarına göre azalan sırayla sıralandı. Son olarak, seçim sadece ortalama önem puanı 5'i aşan değişkenleri kapsayacak şekilde daraltıldı ve 8 ana değişken ortaya çıktı: SCr, UA, GGT, Glu, Hipertansiyon, Diyabet, TG ve BMI.
NAFLD için AutoML tabanlı tahmin modellerinin geliştirilmesi
Bu çalışmada, NAFLD'nin etkili tanısı için H2O AutoML kullanılarak kapsamlı klasik ve gelişmiş makine öğrenimi algoritmaları entegre edilmiştir. H2O.ai platformunun AutoML yeteneklerinden yararlanarak, ikili sınıflandırma görevleri için makine öğrenimi analizleri yapıldı. Kullanılan algoritmalar arasında eXtreme Gradient Boosting (XGBoost), Gradient Boosting Machine (GBM), Genelleştirilmiş Lineer Model (GLM), Aşırı Rastgele Ağaçlar (XRT), Derin Öğrenme (DL) ve Stacked Ensemble yer almaktadır. Bu algoritmalar, hastalık tanısı için optimal modeli belirlemek amacıyla sistematik olarak değerlendirildi. Titiz metodolojik tekrarlanabilirliği sağlamak için, H2O AutoML'nin yürütme parametreleri açıkça tanımlanmıştır. Otomatik arama, maksimum 11.687 saniye çalışma süresi ve maksimum 302 model ile sınırlıydı; sabit rastgele tohum 13 kullanılıyordu. İç ön işleme bayrakları, ortalama/mod algoritmaları kullanılarak eksik kalıntı değerlerin otomatik olarak atama edilmesini ve yüksek kardinaliteli kategorik değişkenler için hedef kodlamayı içeriyordu. Seçilen optimal mimari (GBM_grid_1_model77 olarak etiketlenmiş) aşağıdaki spesifik hiperparametrelere sahip bir gradyan güçlendirme makinesiydi: toplam 28 ağaç, maksimum ağaç derinliği 5 ve öğrenme oranı 0.1.
Model dayanıklılığını artırmak ve aşırı uyum risklerini azaltmak için, sistematik hiperparametre ayarlama ve doğrulama protokollerini içeren bir AutoML çerçevesi uygulandı. Süreç, hiperparametre optimizasyonu yoluyla 200 farklı model konfigürasyonunun otomatik olarak keşfedilmesiyle başladı; 5 katlı çapraz doğrulama uygulanarak eğitim veri seti birbirini dışlayan beş alt kümeye ayrıldı. Yinelemeli eğitim sırasında, her yapılandırma model oluşturma için dört alt küme (%80) kullanırken, doğrulama için bir alt küme (%20) ayrılmış ve bu doğrulama rolü tüm katlar arasında sıralı olarak döner. Hesaplama verimliliği ile performans optimizasyonunu dengelemek için, ROC eğrisi (AUC) metriğinin altındaki alana göre dinamik erken durdurma uygulandı. Bu mekanizma, AUC iyileştirmeleri üç üst üste 0.001 eşiğinin altına düştüğünde eğitimi askıya aldı; hem bireysel model iyileştirmesi hem de genel AutoML arama süreci için geçerlidir. Son model seçimi, hem eğitim hem de doğrulama setlerinde maksimum ortalama AUC gösteren yapılandırmaları önceliklendirdi; aynı zamanda bu kümeler arasında tutarlı performans ve çapraz doğrulama yinelemelerinde minimum metrik varyansı gerektirdi. Bu entegre yaklaşım, titiz doğrulama protokolleri ve otomatik optimizasyon kısıtlamaları sayesinde güçlü genellenebilirliği korurken optimal tahmin doğruluğunu sağladı.
Model performans değerlendirmesi ve tahmin sonuçlarının yorumlanması
Model performansı ve tahmin sonuçlarının yorumlanması, ROC eğrileri, F1 puanları ve SHapley ekleme açıklaması (SHAP) analizi kullanılarak kapsamlı şekilde değerlendirildi. Modelin performansı ve tahmin sonuçlarının yorumu, ROC eğrileri, F1 puanları ve SHapley Additive Explanation (SHAP) analizi kullanılarak kapsamlı şekilde değerlendirildi. Başlangıçta, test veri setinde eğitilen model kullanılarak tahminler oluşturuldu ve pozitif sınıf (yani sınıf 1) için tahmin edilen olasılıklar çıkarıldı (pred_prob). ROC eğrisi pROC paketi kullanılarak oluşturulmuş ve modelin AUC'si %95 güven aralığı ile birlikte hesaplanmıştır. ROC eğrisi üzerindeki optimal eşik, ikili sınıflandırma etiketi belirlemesi için Youden'in J istatistiği (J = Hassasiyet + Özgüllük − 1) kullanılarak belirlenmiştir. ROC eğrisinden türetilen bu eşik temelinde, öngörülen olasılıklar ikili tahmin etiketlerine (0 veya 1) dönüştürüldü ve ardından bir karışıklık matrisi oluşturuldu. Test setindeki F1 puanı, karışıklık matrisi fonksiyonu kullanılarak hesaplandı ve karışıklık matrisinin görselleştirilmesi üretilip kaydedildi. Ayrıca, model 200 vakadan oluşan bağımsız bir dış doğrulama veri seti üzerinde (Wenzhou Tıp Üniversitesi Birinci Bağlı Hastanesi'nden) daha da doğrulandı. SHAP değerleri, her değişkenin modelin tahmin sonuçları üzerindeki etkisini aydınlatmak için "shapviz" paketi kullanılarak analiz edildi ve böylece bireysel NAFLD olasılık tahminlerinin yorumlanışına dair içgörüler sağlandı.
İstatistiksel yöntemler
"İstatistiksel analiz ve yazılım geliştirme, R sürüm 4.2.3 (R Foundation for Statistical Computing, Viyana, Avusturya) kullanılarak gerçekleştirildi. Sürekli değişkenler normallik açısından başlangıçta Shapiro-Wilk testi veya Q-Q grafiklerinin görsel incelemesi kullanılarak değerlendirildi. Normal dağılımlı veriler ortalama ± standart sapma (SD) olarak sunuldu ve iki bağımsız grup arasında karşılaştırmalar bağımsız örneklemler t-testleriyle yapıldı. Birden fazla grup karşılaştırması için, uygun olduğunda post-hoc Tukey HSD testleriyle tek yönlü ANOVA kullanıldı. Normal dağılım olmayan sürekli veriler medyan [interquartil range (IQR), P25–P75] olarak özetlendi ve grup karşılaştırmaları iki bağımsız grup için Mann-Whitney U testi veya birden fazla grup için Kruskal-Wallis testi kullanılarak yapıldı; gerekirse Dunn'ın post-hoc testi yapıldı. Kategorik değişkenler sıklık ve yüzde (%) olarak ifade edildi ve gruplar arasındaki oran karşılaştırmaları, beklenen hücre sayısı 5'ten az olduğunda ki-kare testi (χ2 testi) veya Fisher'ın tam testi kullanılarak analiz edildi. Anlamlılık seviyesi α = 0.05 (iki kuyruklu) olarak belirlendi ve p-değeri < 0.05 istatistiksel olarak anlamlı olarak kabul edildi.