$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Veri kaynağı ve etik beyanı
Bu geriye dönük çalışma, PhysioNet'te barındırılan, kamuya açık ve kimliği silinmiş kritik bakım EHR veritabanı MIMIC-IV (sürüm 3.1) verilerini kullandı. Veritabanı demografik bilgiler, hayati belirtiler, laboratuvar testleri, tanılar, prosedürler ve ilaçları içerir.
MIMIC-IV'e erişim, yetkili yetkilendirme ve PhysioNet veri kullanım anlaşması ile eğitim gereksinimlerine uyum gerektirir. Soruşturmacılar gerekli eğitimi tamamladı ve erişim hakkı aldılar (sertifika numarası: 68351548). Veritabanı kimliği yok edildiği için, bu çalışma anonimleştirilmiş verileri analiz etti ve hastalarla doğrudan temas içermedi; bu nedenle, bilgilendirilmiş onay gerekmiyordu. Tam, adım adım yürütülebilir modelleme iş akışı Şekil 1'de gösterilmiştir.

Şekil 1. Diyabetli hastalarda osteoporoz (OP) risk tahmini için genel modelleme iş akışı. Çalışma sürecinin şematik temsili; kohort tanımlama, veri çıkarma, özellik mühendisliği, çoklu model kıyaslama, doğrulama performansına dayalı model seçimi ve nihai modelin SHAP tabanlı yorumlanabilirliği dahil. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Çalışma popülasyonu ve veri çıkarımı
Veriler, bir veritabanı yönetim aracı kullanılarak Yoğun Bakım için Tıbbi Bilgi Merkezi IV (MIMIC-IV) veritabanından çıkarıldı. Tekrarlanabilirliği sağlamak için, kohort alımı için kullanılan tablo adları ve filtreleme mantığı dahil olmak üzere tam SQL sorguları Ek Dosya 1'de sağlanır. Diyabet teşhisi konan yetişkin hastalar (≥18 yaşında) ICD-9 kodları (249, 250) ve ICD-10 kodları (E08–E13) kullanılarak tanımlandı. Birincil sonuç, OP, ICD-9 kodları (733.x) ve ICD-10 kodları (M80, M81, M82) kullanılarak tanımlandı. İlk uygun diyabet kohortunda (n = 46.226) 3.672 pozitif olay (OP olan hastalar) ve 42.554 negatif olay (OP olmayan hastalar) tespit edildi. Ayrıntılı bir hasta seçimi ve kayıp akış şeması Şekil 2'de sunulmaktadır.

Şekil 2. Hasta seçimi ve kohort yapısı akış şeması. Akış şeması, MIMIC-IV (v3.1) veritabanından adımlı kohort türetimini göstermektedir. Yetişkin diyabet hastaları ICD kodları kullanılarak tanımlandı, ardından yaş ve lt; 18 yıl, kritik veriler eksik & gt; %30 veya geçersiz kayıtlar. Son grup OP (pozitif olaylar) ve OP olmayan (olumsuz olaylar) olarak ayrıldı. Sınıf dengesizliği, stratifikasyon veri seti bölünmeden önce eğitim verilerine uygulanan rastgele eksiklendirme ve SMOTE kullanılarak ele alındı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Özellik mühendisliği
Birden fazla ML algoritmasında adil kıyaslama ve kesin tekrarlanabilirlik sağlamak için, özellik seçimi, eksik değer atama işlem, sürekli özellik ölçeklendirme, sınıf dengeleme ve veri seti bölmesi gibi aynı ön işleme adımları uygulandı. Değişken isimleri, birimler ve veri kaynakları dahil olmak üzere giriş özelliklerinin tam listesi Tablo 1'de detaylandırılmıştır.
| Özellikler | Toplam (n = 14.688) | Eğitim seti (n = 9.546) | Doğrulama kümesi (n = 2.204) | Test seti (n = 2.938) | P değeri |
| Cinsiyet | | | | | 0.345 |
| Erkek | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| Kadın | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| Yaş | 0.28 (−0.40, 0.94) | 0.28 (−0.43, 0.94) | 0.23 (−0.46, 0.89) | 0.28 (−0.39, 0.95) | 0.1655 |
| Kırmızı Kan Hücreleri | −0.14 (−0.79, 0.49) | −0.13 (−0.79, 0.49) | −0.17 (−0.83, 0.48) | −0.14 (−0.76, 0.49) | 0.3641 |
| Hematokrit | −0.14 (−0.81, 0.52) | −0.13 (−0.80, 0.52) | −0.14 (−0.87, 0.51) | −0.16 (−0.81, 0.52) | 0.3709 |
| Hemoglobin | −0.12 (−0.79, 0.52) | −0.12 (−0.79, 0.51) | −0.15 (−0.86, 0.53) | −0.13 (−0.78, 0.52) | 0.3616 |
| RDW | −0.16 (−0.59, 0.45) | −0.17 (−0.59, 0.46) | −0.14 (−0.59, 0.45) | −0.17 (−0.60, 0.42) | 0.5803 |
| Fosfat | −0.14 (−0.60, 0.38) | −0.15 (−0.61, 0.38) | −0.11 (−0.57, 0.38) | −0.13 (−0.56, 0.34) | 0.415 |
| MCV | 0.05 (−0.50, 0.63) | 0.06 (−0.50, 0.65) | 0.03 (−0.49, 0.65) | 0.02 (−0.50, 0.59) | 0.5408 |
| Magnezyum | −0.10 (−0.52, 0.37) | −0.10 (−0.52, 0.37) | −0.10 (−0.52, 0.37) | −0.09 (−0.50, 0.37) | 0.7797 |
| Beyaz Kan Hücreleri | −0.16 (−0.47, 0.21) | −0.16 (−0.47, 0.20) | −0.15 (−0.48, 0.25) | −0.16 (−0.46, 0.20) | 0.6856 |
| Anion Boşluğu | −0.12 (−0.64, 0.45) | −0.13 (−0.64, 0.45) | −0.07 (−0.61, 0.48) | −0.13 (−0.64, 0.45) | 0.1217 |
| Kreatinin | −0.30 (−0.48, 0.01) | −0.30 (−0.48, 0.01) | −0.30 (−0.46, 0.01) | −0.30 (−0.48, −0.00) | 0.3323 |
| MCH | 0.11 (−0.48, 0.62) | 0.12 (−0.48, 0.62) | 0.11 (−0.47, 0.62) | 0.09 (−0.48, 0.61) | 0.5195 |
| Trombosit Sayısı | −0.09 (−0.61, 0.49) | −0.09 (−0.61, 0.49) | −0.08 (−0.62, 0.47) | −0.10 (−0.62, 0.48) | 0.9709 |
| MCHC | −0.00 (−0.59, 0.59) | −0.00 (−0.60, 0.59) | −0.00 (−0.57, 0.58) | 0.00 (−0.57, 0.60) | 0.9263 |
| Klorür | 0.05 (−0.54, 0.64) | 0.05 (−0.52, 0.65) | 0.03 (−0.59, 0.62) | 0.07 (−0.52, 0.62) | 0.4675 |
| Potasyum | −0.07 (−0.67, 0.53) | −0.09 (−0.67, 0.53) | −0.07 (−0.67, 0.53) | −0.07 (−0.62, 0.53) | 0.3071 |
| Sodyum | 0.05 (−0.56, 0.60) | 0.05 (−0.55, 0.60) | −0.00 (−0.60, 0.60) | 0.07 (−0.57, 0.61) | 0.3492 |
| Urea Azotu | −0.28 (−0.60, 0.29) | −0.28 (−0.60, 0.29) | −0.26 (−0.59, 0.31) | −0.28 (−0.59, 0.25) | 0.6826 |
| Toplam Kalsiyum | 0.02 (−0.61, 0.59) | 0.02 (−0.61, 0.59) | −0.01 (−0.59, 0.56) | 0.01 (−0.61, 0.60) | 0.8203 |
Tablo 1. Çalışma grubunun temel özellikleri ve mühendislik özellikleri. Kategorik değişkenler n (%) olarak sunulur. Sürekli değişkenler, standartlaştırılmış değerlerin medyanı (çeyreklerarası aralık) olarak sunulur. P değerleri, uygun istatistiksel testler kullanılarak eğitim, doğrulama ve test setleri arasındaki dağılımları karşılaştırmak için hesaplandı.
Sürekli ölçümlerle sürekli değişkenler, tüm yoğun bakım bakım gözlem penceresi içindeki aritmetik ortalama kullanılarak toplanarak hasta başına tek bir özellik vektörü elde edildi. Eksiklik oranı %30'u aşan değişkenler hariç tutuldu. Kalan sayısal değişkenler için, eksik değerler K-En Yakın Komşular (KNN) algoritması kullanılarak atfedilirdi (n_neighbors = 5, ağırlıklar = 'tekdüze'). Kategorik değişkenler en sık kullanılan kategori kullanılarak atfedilir ve daha sonra ikili eşleme ile dönüştürülür, görünmeyen kategorilere sıfır vektörü atanmıştır.
Sürekli değişkenler, z-puan ölçeklendirme formülü (). kullanılarak standartlaştırıldı. Sıfır varyans gösteren özellikler, ölçeklendirmeden önce açıkça kaldırılmıştır. Tüm ön işleme parametreleri (μ ve σ.) eğitim setinde kesin olarak tahmin edilip, doğrulama ve test setlerine tutarlı şekilde uygulandı.
Şiddetli sınıf dengesizliği (3.672 vs. 42.554) göz önüne alındığında, performans tahminlerinin abartılı olmasını önlemek için yalnızca eğitim verilerine hibrit bir dengeleme stratejisi uygulandı. İlk olarak, rastgele eksik numune kullanılarak çoğunluk negatif sınıfı azaltıldı ve 1:2 (pozitif:negatif) oranı elde edildi (7.344 negatif örneklem elde edildi). Sonrasında, pozitif sınıfa Sentetik Azınlık Aşırı Örnekleme Tekniği (SMOTE) uygulanarak nihai 1:1 dengeli oran (7.344 vs. 7.344) elde edildi.
Son olarak, hasta düzeyinde grup eğitim (%65), doğrulama (%15) ve test (%20) gruplarına ayrıldı; bu grup stratifikasyonlu örnekleme kullanıldı. Tüm rastgele süreçleri kesin şekilde kontrol etmek için, hesaplama, dengeleme ve bölme süreçlerini kesin şekilde kontrol etmek için küresel rastgele tohum (random_state = 42) uygulandı.
Model mimarisi
Diyabetli hastalarda OP riski için en uygun öngörücü modeli belirlemek için, aynı veri temsili ve değerlendirme protokolü altında 70 ML algoritma varyantını karşılaştırmak için büyük ölçekli bir kıyaslama çerçevesi kullanıldı. Aday model aileleri arasında düzenli doğrusal sınıflandırıcılar, destek vektör makineleri (SVM'ler), kNN, ağaç toplulukları, gradyan güçlendirme mimarileri ve çok katmanlı perceptronlar 9,10,11,12,13,14,15,16,17 yer almaktadır.
Geleneksel bir ızgara araması yerine, hiperparametre optimizasyonu, eğitim bölünmesinde bu 70 model varyantı boyunca önceden tanımlanmış, sağlam yapılandırmalar değerlendirilerek gerçekleştirildi. Seçim, doğrulama setinde alıcı çalışma karakteristikli (ROC) eğrisinin (AUC) altındaki alanı en üst düzeye çıkarmaya dayanıyordu. En iyi performanslı son model n_estimators = 200 ile yapılandırılmış, diğer parametreler ise Materyaller Tablosu'nda listelenen yazılım paketinin varsayılan ayarlarında kalıyordu. AUC, doğruluk, F1 puanı, hassasiyet ve geri çağırma gibi değerlendirme metrikleri, varsayılan 0.5 olasılık eşiği kullanılarak hesaplandı.
Klinik şeffaflığı desteklemek için SHAP seçilen modele TreeExplainer yöntemiyle uygulanmıştır. Son modelin ağaç temelli yapısı göz önüne alındığında, arka plan yapılandırması olarak tam ağac yoluna bağlı beklenen değerler kullanılmıştır.