$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Acceso a bases de datos y entorno de software
Obtenga acceso autorizado a la base de datos Medical Information Mart for Intensive Care IV (MIMIC-IV, v3.1) tras completar la formación requerida sobre uso ético de datos (ID de certificación: 69002811). Según las Medidas para la Revisión Ética de la Investigación en Ciencias de la Vida y Médica que Involucre a Sujetos Humanos (18 de febrero de 2023, China), el Artículo 32 estipula que la investigación que utiliza datos públicos obtenidos legalmente, datos generados sin interferir con el comportamiento público o información anonimizada está exenta de revisión ética. En consonancia con estas disposiciones, este estudio estuvo exento de la aprobación ética institucional. Se siguieron estrictamente el protocolo de uso de datos y las directrices éticas, y el estudio se llevó a cabo únicamente con fines de investigación científica. Configura el entorno de la base de datos usando PostgreSQL (v17.1.11). Utiliza Navicat Premium (v17) como interfaz de gestión de bases de datos y consultas para ejecutar consultas SQL y exportar conjuntos de datos extraídos para su análisis.
Selección de pacientes
Identificar pacientes con cáncer de pulmón en MIMIC-IV utilizando los códigos17 de la Clasificación Internacional de Enfermedades, Novena y Décima Revisión (CIE-9 e CIE-10). Aplicar los siguientes criterios de exclusión de forma secuencial: Edad <18 años o >90 años; Falta de mediciones de albúmina sérica en las primeras 24 horas tras el ingreso en UCI; Múltiples ingresos en UCI o hospitales; Duración de la estancia en UCI <24 horas.
Extracción variable
Extrae variables de MIMIC-IV (v3.1) usando PostgreSQL (v17.1.11) a través de Navicat Premium (v17), incluyendo: demografía, signos vitales, pruebas de laboratorio, comorbilidades, intervenciones terapéuticas, puntuaciones de gravedad y resultados. Demografía: edad, género. Signos vitales en las primeras 24 horas tras el ingreso en la UCI: frecuencia cardíaca (FC), frecuencia respiratoria (RR), saturación de oxígeno (SpO₂) y temperatura. Variables de laboratorio en las primeras 24 horas: albúmina sérica, glucosa, creatinina, nitrógeno urea, bilirrubina total, hemoglobina, recuento de glóbulos rojos (glóbulos rojos), recuento de glóbulos blancos (GBB), recuento de plaquetas, ancho de distribución de glóbulos rojos (RDW), alanina aminotransferasa (ALT), aspartato aminotransferasa (AST), tiempo de protrombina (PT), calcio, potasio, sodio y cloruro. Comorbilidades según los registros diagnósticos: hipertensión, cirrosis hepática, enfermedad renal crónica, diabetes mellitus, bronquitis crónica, insuficiencia cardíaca congestiva y enfermedad pulmonar obstructiva crónica (EPOC). Puntuaciones de gravedad en el ingreso en UCI: Evaluación Secuencial de Insuficiencia Orgánica (SOFA), Puntuación Simplificada de Fisiología Aguda II (SAPS II), Índice de Comorbilidad Charlson, Evaluación de Fisiología Aguda y Salud Crónica II (APACHE II). Intervenciones terapéuticas: corticosteroides sistémicos, antibióticos, vasopresores. Factor de estilo de vida: historial de tabaquismo. Para todas las variables de laboratorio y puntuaciones de severidad en las primeras 24 horas, si hay múltiples mediciones disponibles, calcular el valor medio durante elprimer día y utilizar este valor para el análisis. Excluye variables con más del 20% de datos faltantes. Para variables con ausencia ≤20%, realiza la imputación utilizando el algoritmo missForest, un método de aprendizaje automático basado en bosque aleatorio para manejar datos clínicos de tipo mixto. La proporción de datos faltantes para variables clave se proporciona en la Tabla Suplementaria 1.
Definición del resultado
Defina el resultado principal como mortalidad por todas las causas dentro de los 28 días posteriores al ingreso en UCI. Determinar el estado de mortalidad utilizando los registros de defunción disponibles en la base de datos MIMIC-IV. Clasificar a los pacientes como supervivientes o no supervivientes en función del estado de mortalidad a los 28 días.
Análisis estadístico
Evalúa la distribución de variables continuas utilizando la prueba de Shapiro–Wilk. Comparar variables distribuidas normalmente usando la prueba t de Student y variables distribuidas no normalmente usando la prueba de suma de rangos de Wilcoxon. Compara variables categóricas usando la prueba del chi-cuadrado. Realizar la regresión de menor contracción absoluta y operador de selección (LASSO) con validación cruzada de 10 veces para seleccionar variables candidatas y reducir la multicolinealidad. Construir modelos de riesgos proporcionales de Cox multivariables para evaluar la asociación independiente entre la albúmina sérica y la mortalidad a 28 días. La albúmina sérica se introdujo tanto como variable continua como categórica, e incluyeron covariables seleccionadas por regresión LASSO para su ajuste. Se estimaron razones de riesgo (HR) e intervalos de confianza (IC) del 95%. Explora asociaciones no lineales utilizando el análisis de spline cúbica restringida (RCS). Se colocaron nudos en percentiles predefinidos de la distribución de albúmina y se evaluó la no linealidad mediante la prueba de los términos de la spline. Genera curvas de supervivencia de Kaplan–Meier y compara distribuciones de supervivencia usando la prueba log-rank.
Desarrollo y validación de modelos de aprendizaje automático
Divide aleatoriamente el conjunto de datos a nivel de paciente en un conjunto de entrenamiento (70%), un conjunto de validación (15%) y un conjunto de pruebas independiente (15%). Realizar la selección de características usando el conjunto de entrenamiento únicamente identificando la intersección de variables seleccionadas por la regresión LASSO y el algoritmo Boruta, asegurando que solo se conserven predictores estables y relevantes. Entrenar ocho clasificadores de aprendizaje automático en el conjunto de entrenamiento, incluyendo regresión logística, bosque aleatorio, árbol de decisiones, máquina de vectores de soporte, XGBoost, LightGBM, Bayes naïve complementario y clasificador de vectores de soporte. El rendimiento del modelo se evaluó primero en el conjunto de validación y posteriormente se confirmó en el conjunto de pruebas independiente utilizando el AUC-ROC, AUC-PR, precisión, sensibilidad, especificidad, curvas de calibración, análisis de curvas de decisión y curvas de aprendizaje.
Interpretación del modelo y punto final
Identificar el modelo de aprendizaje automático con mejor rendimiento basándose en métricas de validación. Aplicar las Explicaciones Aditivas de Shapley (SHAP) para cuantificar la contribución de cada característica a la predicción de la mortalidad. Genera gráficos de resumen y dependencia de SHAP para visualizar la importancia relativa y la dirección de la albúmina sérica y otros predictores. Completar el análisis integrando resultados estadísticos y de aprendizaje automático para establecer un marco interpretable de estratificación de riesgos.