$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questo studio ha avuto accesso al Medical Information Mart for Intensive Care IV (MIMIC-IV) Database11 (Versione 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) e al Database12 dell'Unità di Terapia Intensiva di Telemedicina (eICU) (Versione 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) dopo aver completato l'esame Protecting Human Research Participants (ID Registrazione: 44151052). Questo studio è stato condotto in conformità con i principi della Dichiarazione di Helsinki (2013), e i pazienti avevano dato il consenso affinché i loro dati venissero raccolti nei due database. L'approvazione etica è stata revocata per questo studio perché i dati nei database dell'eICU e MIMIC-IV erano completamente anonimizzati (nessun identificatore personale conservato).
Materiali e strumenti
Fonti dati: MIMIC-IV Database: Versione 1.0, registro open-access a centro unico contenente 76.540 ricoveri in terapia intensiva (2008-2019), accessibile tramite PhysioNet. Database eICU: Versione 2.0, database multicentro contenente >200.000 cartelle cliniche elettroniche provenienti da 335 unità in 208 ospedali statunitensi (2014-2015), accessibile tramite PhysioNet. Software e Ambiente di Esecuzione: RapidMiner Studio: Versione 9.10.001 (ambiente di esecuzione: Windows 10 Pro 64-bit), utilizzato per la costruzione di modelli (classificazione/clustering) e la selezione delle funzionalità; IBM SPSS Statistics: Versione 23.0 (ambiente di esecuzione: Windows 10 Pro 64-bit), utilizzato per analisi statistiche e imputazione di valori mancanti; Java Development Kit (JDK): Versione Java SE 8u381 (ambiente di esecuzione: Windows 10 Pro 64-bit), utilizzata per lo sviluppo di applicazioni Web; supporto IDE: Eclipse IDE 2023-09; Apache Tomcat: Versione 9.0.85, utilizzata per la distribuzione dell'applicazione web.
Progettazione dello studio e ambientazioni
Il concetto di questo studio è illustrato nella Figura Supplementare 1. Questo studio ha analizzato dati provenienti da due grandi fonti, il Medical Information Mart for Intensive Care IV (MIMIC-IV) e il database della Telehealth Intensive Care Unit (eICU), per costruire un modello predittivo dell'ARDS associato alla polmonite e classificare i pazienti colpiti in base ai fenotipi clinici. Questo studio ha seguito le linee guida del Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis (TRIPOD).
Campioni di studio
I dati di addestramento e test di questo studio sono stati ottenuti da MIMIC-IV. La fonte della verifica esterna era il database multicentro eICU. Questo studio ha utilizzato la Classificazione Internazionale delle Malattie (Nona e Decima Revisione) per estrarre dati sui pazienti con polmonite e ARDS associato alla polmonite. I pazienti ricoverati per meno di 24 ore sono stati esclusi.
Predittori
Dopo aver valutato la disponibilità dei dati e il tasso di variabili cliniche mancanti nei dataset MIMIC-IV ed eICU, sono state selezionate 52 variabili per l'ARDS associato alla polmonite come variabili di addestramento candidate da utilizzare nel machine learning, incluse le caratteristiche demografiche dei pazienti, i risultati di laboratorio e i punteggi di gravità della malattia. Questo studio ha utilizzato un algoritmo ponderazione per correlazione (basato sul peso di correlazione tra variabili ed esiti) per selezionare i principali predittori (variabili che vengono poi incluse nei modelli) delle 52 variabili candidate e poi selezionato i fattori di raggruppamento dei sottogruppi dai principali predittori.
Per farlo, apri RapidMiner Studio, crea un nuovo processo e aggiungi l'operatore Weight by Correlation cliccando su Process > Operators > Feature Selection > Weight by Correlation. Imposta il parametro: soglia di correlazione = 0,04 (conservare variabili con peso > 0,04). Per costringere il modello a tenere conto delle fasi iniziali della malattia e della tempestività, sono stati ottenuti i valori massimi e minimi degli indicatori di laboratorio entro 24 ore dall'ammissione. Poiché il Punteggio di Fisiologia Acuta III (APSIII) non era incluso nel database dell'eICU, sono stati utilizzati invece i punteggi dell'Acuta Fisiologia e della Valutazione della Salute Cronica IV (APACHE IV). Questo studio ha pulito i dati e interpolato i valori mancanti utilizzando il metodo di imputazione multipla e ha standardizzato le variabili di input nello sviluppo di modelli di previsione e sotto-fenotipizzazione.
Analisi statistica
Apri SPSS 23.0, importa il dataset preelaborato e seleziona Analizza > Statistiche Descrittive > Esplora. Controlla i grafici di normalità con i test per eseguire il test di Kolmogorov-Smirnov per variabili continue. Le variabili distribuite asimiche sono riportate come mediana (intervallo interquartile, IQR); Le variabili categoriche sono riportate come conteggio (percentuale, %). Per confrontare le variabili continue tra gruppi, si utilizzava il test U di Mann-Whitney o il test di Kruskal-Wallis, a seconda dei conti. Per confrontare le variabili categoriche tra gruppi, si utilizzò il test chi-quadrato di Pearson o il test esatto di Fisher, secondo i criteri.
Sviluppo di modelli e presentazione web
Per lo sviluppo del modello, questo studio ha suddiviso la coorte di derivazione MIMIC-IV in un set di addestramento (il 90% del campione completo scelto casualmente per lo sviluppo del modello e la sintonizzazione degli iperparametri) e un set di test (il 10% del campione completo scelto casualmente per test interni); questo studio ha effettuato la verifica esterna nell'eICU. Questo studio ha implementato il machine learning con cinque metodi: albero decisionale, regressione logistica, naïve bayes, stacking (i base learners erano la regressione logistica, naïve bayes e i metodi della foresta casuale; lo stacking learner era il metodo dell'albero decisionale) e random forest. Albero decisionale: clicca su Process > Operators > Modellazione > Classificazione > Albero Decisionale con Algoritmo = C4.5, Dimensione minima della foglia = 5. Per la regressione logistica: clicca su Process > Operators > Modellazione > Classificazione > Regressione Logistica con forza di regolarizzazione = 0,1, Iterazioni massime = 100. Per i Naive Bayes: clicca su Process > Operators > Modellazione > Classificazione > Naive Bayes con tipo Kernel = Gaussian. Per la foresta casuale: clicca su Operatori > Processo > Modellazione > Classificazione > Foresta Casuale con Numero di alberi = 100, Profondità massima = 20. Per lo stacking: clicca su Process > Operators > Modeling > Ensemble > Stacking with Base learners = Logistic Regression + Naive Bayes + Random Forest; Stacking learner = Albero decisionale. Questo studio ha misurato le prestazioni di previsione del modello sviluppato calcolando l'area sotto la curva caratteristica operativa del ricevitore (AUC), precisione, precisione e richiamo.
Nel costruire la classificazione dei sottogruppi clinici ARDS associati alla polmonite, questo studio ha utilizzato il clustering k-means con i principali predittori. Per determinare il numero ottimale di cluster k, è stato esaminato il valore delle statistiche Gap nel grafico delle statistiche Gap che suggeriva il numero ottimale di cluster. Questo studio ha analizzato le caratteristiche cliniche e gli esiti di diversi fenotipi, confrontando le differenze nei tassi di mortalità ospedaliera tra pazienti con cluster diversi che hanno ricevuto e non hanno ricevuto un trattamento precoce a dosaggio basso o medio con corticosteroidi.
In RapidMiner Studio, seleziona File > Export Model e salva i modelli di previsione della diagnosi e la classificazione dei sottogruppi come file .model. Usa JDK Java SE 8u381 ed Eclipse IDE 2023-09 per scrivere pagine Web in linguaggio Java; Importa i file .model nel progetto. Questo studio ha utilizzato il linguaggio Java per sviluppare una pagina web in cui il modello diagnostico e il modello di clustering dei sottogruppi clinici sono stati incorporati, e abbiamo caricato il modello online.