$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio accedió a la base de datos11 (Versión 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/) y a la base de datos12 de la Unidad de Cuidados Intensivos de Telemedicina (eICU) (Versión 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/) tras completar el examen Protecting Human Research Participants (ID de registro: 44151052). Este estudio se llevó a cabo conforme a los principios de la Declaración de Helsinki (2013), y los pacientes dieron su consentimiento para que sus datos fueran recogidos en ambas bases de datos. Se eximió la aprobación ética para este estudio porque los datos en las bases de datos de la eICU y MIMIC-IV estaban completamente anonimizados (no se conservaron identificadores personales).
Materiales y herramientas
Fuentes de datos: Base de datos MIMIC-IV: Versión 1.0, registro de acceso abierto de centro único que contiene 76.540 ingresos en UCI (2008-2019), consultado a través de PhysioNet. Base de Datos de la eUTI: Versión 2.0, base de datos multicéntrica que contiene >200.000 historiales médicos electrónicos de 335 unidades en 208 hospitales de EE. UU. (2014-2015), consultada a través de PhysioNet. Software y entorno de ejecución: RapidMiner Studio: Versión 9.10.001 (entorno de ejecución: Windows 10 Pro 64 bits), utilizado para la construcción de modelos (clasificación/clúster) y selección de características; IBM SPSS Statistics: Versión 23.0 (entorno de ejecución: Windows 10 Pro 64 bits), utilizado para análisis estadístico y imputación de valores faltantes; Java Development Kit (JDK): Versión Java SE 8u381 (entorno de ejecución: Windows 10 Pro 64 bits), utilizada para el desarrollo de aplicaciones web; soporte para IDE: Eclipse IDE 2023-09; Apache Tomcat: Versión 9.0.85, utilizado para desplegar la aplicación web.
Diseño del estudio y entornos
El concepto de este estudio se ilustra en la Figura Suplementaria 1. Este estudio analizó datos de dos grandes fuentes, las bases de datos del Medical Information Mart for Intensive Care IV (MIMIC-IV) y la Telehealth Intensive Care Unit (eICU), para construir un modelo predictivo del SDRA asociado a la neumonía y clasificar a los pacientes afectados según los fenotipos clínicos. Este estudio siguió las directrices del Informe Transparente de un Modelo de Predicción Multivariable para el Pronóstico o Diagnóstico Individual (TRIPOD).
Muestras de estudio
Los datos de entrenamiento y pruebas de este estudio se obtuvieron de MIMIC-IV. La fuente de verificación externa fue la base de datos multicéntrica de eICU. Este estudio utilizó la Clasificación Internacional de Enfermedades (Novena y Décima Revisión) para extraer datos sobre pacientes con neumonía y SDRA asociado a la neumonía. Se excluyeron a los pacientes que estuvieron ingresados menos de 24 horas.
Predictores
Tras evaluar la disponibilidad de datos y la tasa de variables clínicas ausentes en los conjuntos de datos MIMIC-IV y eICU, se seleccionaron 52 variables para el SDRA asociado a la neumonía como variables de entrenamiento candidatas para su uso en aprendizaje automático, incluyendo características demográficas de los pacientes, hallazgos de laboratorio y puntuaciones de gravedad de la enfermedad. Este estudio utilizó un algoritmo de ponderación por correlación (basado en el peso de correlación entre variables y resultados) para filtrar predictores clave (variables que finalmente se incluyen en los modelos) de las 52 variables candidatas y luego seleccionó factores de agrupación de subgrupos a partir de los predictores clave.
Para ello, abre RapidMiner Studio, crea un nuevo proceso y añade el operador Peso por Correlación haciendo clic en Operadores de > de Proceso > Selección de Características > Peso por Correlación. Establezca el parámetro: umbral de correlación = 0,04 (conservar variables con peso > 0,04). Para forzar que el modelo tenga en cuenta las fases tempranas de la enfermedad y la puntualidad, se obtuvieron los valores máximos y mínimos de los indicadores de laboratorio en un plazo de 24 horas tras la admisión. Como la Puntuación de Fisiología Aguda III (APSIII) no se incluyó en la base de datos de la UCI electrónica, se utilizaron en su lugar las puntuaciones de la Evaluación de Fisiología Aguda y Salud Crónica IV (APACHE IV). Este estudio limpió los datos e interpoló los valores faltantes utilizando el método de imputación múltiple y estandarizó las variables de entrada al desarrollar modelos de predicción y subfenotipado.
Análisis estadístico
Abre SPSS 23.0, importa el conjunto de datos preprocesado y selecciona Analizar > Estadísticas Descriptivas > Explorar. Revisa los gráficos de normalidad con pruebas para realizar la prueba de Kolmogorov-Smirnov para variables continuas. Las variables distribuidas sesgadas se reportan como mediana (rango intercuartílico, IQR); Las variables categóricas se reportan como conteo (porcentaje, %). Para comparar variables continuas entre grupos, se utilizó la prueba U de Mann-Whitney o la prueba de Kruskal-Wallis, según correspondá. Para comparar variables categóricas entre grupos, se utilizó la prueba del chi-cuadrado de Pearson o la prueba exacta de Fisher, según correspondá.
Desarrollo de modelos y presentación web
Para el desarrollo de modelos, este estudio dividió la cohorte de derivación MIMIC-IV en un conjunto de entrenamiento (el 90% de la muestra completa elegido aleatoriamente para el desarrollo del modelo y la optimización de hiperparámetros) y un conjunto de pruebas (el 10% de la muestra completa seleccionado aleatoriamente para pruebas internas); este estudio realizó verificación externa en la UCI electrónica. Este estudio implementó aprendizaje automático con cinco métodos: árbol de decisión, regresión logística, naïve bayes, apilamiento (los aprendices base fueron la regresión logística, los bayes naïve y los métodos de bosque aleatorio; el aprendiz apilado fue el método del árbol de decisión) y el bosque aleatorio. Árbol de decisión: haz clic en Process > Operadores > Modelado > Clasificación > Árbol de Decisión con algoritmo = C4.5, Tamaño mínimo de hoja = 5. Para regresión logística: haz clic en Operadores de > Procesos > Modelado > Clasificación > Regresión Logística con fuerza de regularización = 0,1, Iteraciones máximas = 100. Para Naive Bayes: haz clic en Process > Operators > Modeling > Classification > Naive Bayes con tipo kernel = Gaussian. Para bosque aleatorio: haz clic en Operadores de > de proceso > Modelado > Clasificación > Bosque Aleatorio con número de árboles = 100, profundidad máxima = 20. Para apilamiento: haz clic en Operadores de > de Proceso > Modelado > Conjunto > Apilamiento con aprendices base = Regresión logística + Bayes naive + Bosque aleatorio; Apilamiento del aprendiz = Árbol de decisión. Este estudio midió el rendimiento predictivo del modelo desarrollado calculando el área bajo la curva característica de funcionamiento del receptor (AUC), la precisión, precisión y recuerdo.
Al construir la clasificación de subgrupos clínicos de SDRA asociado a la neumonía, este estudio utilizó agrupamiento k-media con predictores clave. Para determinar el número óptimo de clústeres k, se examinó el valor de las estadísticas de brechas en el gráfico de estadísticas de brecha, lo que sugirió el número óptimo de conglomerados. Este estudio analizó las características clínicas y los resultados de diferentes fenotipos, y comparamos las diferencias en las tasas de mortalidad hospitalaria entre pacientes con distintos grupos que recibieron y no recibieron tratamiento temprano con corticosteroides de dosis bajas a medias.
En RapidMiner Studio, selecciona File > Export Model y guarda los modelos de predicción de diagnóstico y clasificación de subgrupos como archivos .model. Utiliza JDK Java SE 8u381 y Eclipse IDE 2023-09 para escribir páginas web en lenguaje Java; Importa los archivos .model al proyecto. Este estudio utilizó el lenguaje Java para desarrollar una página web en la que se incrustaron el modelo diagnóstico y el modelo de agrupación de subgrupos clínicos, y subimos el modelo en línea.