$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, İnsan Araştırmaları Katılımcılarını Koruma sınavını (Kayıt Kimliği: 44151052) tamamladıktan sonra Yoğun Bakım IV için Tıbbi Bilgi Merkezi (MIMIC-IV)Veritabanı 11 (Sürüm 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) ve Telehealth Yoğun Bakım Birimi (eICU)Veritabanı 12 (Sürüm 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) erişimine ulaştı. Bu çalışma, Helsinki Bildirgesi (2013) ilkelerine uygun olarak yürütüldü ve hastalar verilerinin iki veritabanında kaydedilmesi için onay verdiler. Bu çalışma için etik onay kaldırıldı çünkü eICU ve MIMIC-IV veritabanlarındaki veriler tamamen anonimleştirildi (kişisel tanımlayıcılar tutulmadı).
Malzemeler ve araçlar
Veri Kaynakları: MIMIC-IV Veritabanı: Sürüm 1.0, 76.540 yoğun bakım bakım yatışını içeren tek merkezli açık erişim kayıt defteri (2008-2019), PhysioNet üzerinden erişilmiştir. eICU Veritabanı: Sürüm 2.0, 2014-2015 yılları arasında ABD'deki 208 hastaneden 335 birimden 200.000 elektronik tıbbi kayıt >içeren çok merkezli veritabanı, PhysioNet üzerinden erişilmiştir. Yazılım ve Yürütme Ortamı: RapidMiner Studio: Sürüm 9.10.001 (yürütme ortamı: Windows 10 Pro 64-bit), model oluşturma (sınıflandırma/kümeleme) ve özellik seçimi için kullanılır; IBM SPSS Statistics: Sürüm 23.0 (yürütme ortamı: Windows 10 Pro 64-bit), istatistiksel analiz ve eksik değer ödemesi için kullanılmıştır; Java Geliştirme Kiti (JDK): Sürüm Java SE 8u381 (yürütme ortamı: Windows 10 Pro 64-bit), Web uygulama geliştirme için kullanılır; destekleyici IDE: Eclipse IDE 2023-09; Apache Tomcat: Web tabanlı uygulamanın dağıtımı için kullanılan sürüm 9.0.85.
Çalışma tasarımı ve ortamları
Bu çalışmanın konsepti, Ek Şekil 1'de açıklanmıştır. Bu çalışma, iki büyük kaynaktan alınan verileri analiz ederek Yoğun Bakım IV için Tıbbi Bilgi Merkezi (MIMIC-IV) ve Telehealth Yoğun Bakım Ünitesi (eICU) veri tabanlarından alınan veriler, zatürre ile ilişkili ARDS'nin öngörücü modelini oluşturdu ve etkilenen hastaları klinik fenotiplere göre sınıflandırdı. Bu çalışma, Bireysel Prognoz veya Tanı için Çok Değişkenli Tahmin Modelinin Şeffaf Raporlanması (TRIPOD) yönergelerini takip etti.
Çalışma örnekleri
Bu çalışmanın eğitim ve test verileri MIMIC-IV'den alınmıştır. Dış doğrulama kaynağı çok merkezli eICU veritabanıydı. Bu çalışma, zatürre ve zatürre ile ilişkili ARDS hastaları hakkında veri çıkarmak için Uluslararası Hastalıklar Sınıflandırması (Dokuzuncu ve Onuncu Revizyon) kullanıldı. 24 saatten kısa süreyle yatırılan hastalar hariç tutuldu.
Tahminciler
MIMIC-IV ve eICU veri setlerinde veri erişilebilirliği ve eksik klinik değişkenlerin oranı değerlendirildikten sonra, pnömoni ile ilişkili ARDS için 52 değişken, makine öğreniminde kullanılmak üzere aday eğitim değişkenleri olarak seçildi; bunlar arasında hastaların demografik özellikleri, laboratuvar bulguları ve hastalık şiddeti puanları yer aldı. Bu çalışma, değişkenler ve sonuçlar arasındaki korelasyon ağırlığına dayalı bir ağırlık algoritması kullanarak 52 aday değişkenin ana tahmin edicilerini (modellere nihayetinde dahil edilen değişkenler) taramak için kullanıldı ve ardından ana tahmin edicilerden alt grup kümeleme faktörlerini seçti.
Bunu yapmak için RapidMiner Studio'yu açın, yeni bir süreç oluşturun ve Process > Operators > Feature Selection > Weight by Correlation (Weight by Correlation seçeneği) seçeneklerine tıklayarak Weight by Correlation operatörünü ekleyin. Parametreyi ayarlayın: Korelasyon eşiği = 0.04 (ağırlıklı değişkenler > 0.04 korun). Modeli hastalığın erken evrelerini ve zamanında olmalarını hesaba katmaya zorlamak için, laboratuvar göstergelerinin maksimum ve minimum değerleri hastaneye kabul edildikten sonraki 24 saat içinde alındı. Akut Fizyoloji Skoru III (APSIII) eICU veritabanına dahil edilmediği için, bunun yerine Akut Fizyoloji ve Kronik Sağlık Değerlendirmesi IV (APACHE) puanları kullanıldı. Bu çalışma, verileri temizledi ve eksik değerleri çoklu ödüm yöntemiyle interpolasyon yaptı ve tahmin ile alt fenotipleme modelleri geliştirilirken giriş değişkenlerini standartlaştırdı.
İstatistiksel analiz
SPSS 23.0'ı açın, önceden işlenmiş veri setini içe aktarın ve Analyze > Descriptive Statistics > Explore'ı seçin. Kolmogorov-Smirnov testini sürekli değişkenler için gerçekleştirmek için Normallik Grafiklerini Testlerle kontrol edin. Çarpık dağılımlı değişkenler medyan olarak bildirilir (çeyreklerarası aralık, IQR); Kategorik değişkenler sayım olarak bildirilir (yüzde %), %. Gruplar arasındaki sürekli değişkenleri karşılaştırmak için, uygun olduğunda Mann-Whitney U testi veya Kruskal-Wallis testi kullanıldı. Gruplar arasındaki kategorik değişkenleri karşılaştırmak için, uygun olduğunda Pearson'ın ki-kare testi veya Fisher'ın tam testi kullanıldı.
Model geliştirme ve web sunumu
Model geliştirme için, bu çalışma MIMIC-IV türetim kohortunu bir eğitim seti (model geliştirme ve hiperparametre ayarlaması için rastgele seçilen tam örneklerin %90'ı) ve bir test setine (dahili test için rastgele seçilen tam seçmenin %10'u) olarak ayırdı; bu çalışma eICU'da dış doğrulama gerçekleştirdi. Bu çalışma, makine öğrenimini beş yöntemle uyguladı: karar ağacı, lojistik regresyon, naif baye, stacking (temel öğrenenler lojistik regresyon, naif bayes ve rastgele orman yöntemleri; stacking öğrenen karar ağacı yöntemi) ve rastgele orman. Karar ağacı: Süreç > Operatörleri> Modelleme > Sınıflandırma > Karar Ağacı'na tıklayın; Algoritma = C4.5, Minimum yaprak boyutu = 5. Lojistik regresyon için: Süreç > Operatörleri > Modelleme > Sınıflandırma > Düzenlenme gücü = 0.1, Maksimum yineleme = 100 ile Lojistik Regresyon seçeneğine tıklayın. Naive Bayes için: Process > Operators > Modelleme > Sınıflandırma > Naive Bayes ile Çekirdek tipi = Gaussian seçeneğine tıklayın. Rastgele orman için: Süreç > Operatörleri> Modelleme > Sınıflandırma seçeneğine tıklayın > Rastgele Orman ile ağaç sayısı = 100, maksimum derinlik = 20. Stacking için: Process > Operators > Modelleme > Ensemble > Stacking with Base learners = Logistik Regresyon + Naive Bayes + Random Forest; Stacking learner = Karar Ağacı. Bu çalışma, geliştirilmiş modelin tahmin performansını alıcı çalışma karakteristik eğrisinin (AUC) altındaki alanı, doğruluğu, hassasiyeti ve geri çağırmayı hesaplayarak ölçtü.
Zazarre ile ilişkili ARDS klinik alt gruplarının sınıflandırılmasını oluştururken, bu çalışma temel öngörücülerle k-mean kümelenmesini kullandı. Küme k için optimal sayı belirlenmek için, Gap istatistiklerinin değeri Gap istatistikleri grafikindeki incelendi ve bu da optimal küme sayısını önerdi. Bu çalışma, farklı fenotiplerin klinik özelliklerini ve sonuçlarını analiz etti ve erken düşük ve orta doz kortikosteroid tedavisi alan ve almayan farklı kümelere sahip hastalar arasında hastane içi ölüm oranlarındaki farkları karşılaştırdık.
RapidMiner Studio'da, Dosya > Dışa Aktarma Modeli'ni seçin ve tanı tahmini ile alt grup sınıflandırma modellerini .model dosyaları olarak kaydedin. Java dilinde web sayfaları yazmak için JDK Java SE 8u381 ve Eclipse IDE 2023-09 kullanın; .model dosyalarını projeye aktarın. Bu çalışma, Java dilini kullanarak tanısal model ve klinik alt grup kümeleme modelinin gömüldüğü bir web sayfası geliştirdi ve modeli çevrimiçi olarak yükledik.