Artículo de investigación

Aprendizaje automático interpretable multimodelo para la predicción de osteoporosis en diabetes utilizando una gran base de datos electrónica de historiales clínicos de cuidados críticos

DOI:

10.3791/71386

30 de junio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe el desarrollo y la evaluación de un modelo de aprendizaje automático basado en árboles en conjunto interpretable, utilizando datos clínicos recogidos rutinariamente para predecir el riesgo de osteoporosis en pacientes con diabetes.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La diabetes mellitus se asocia con un aumento de la fragilidad ósea y un mayor riesgo de fracturas; sin embargo, la identificación temprana de la osteoporosis (OP) en poblaciones diabéticas sigue siendo un reto. Este estudio tenía como objetivo desarrollar y comparar múltiples modelos de aprendizaje automático (ML) para predecir la OP entre pacientes con diabetes, evaluando su utilidad clínica y mejorando la transparencia del modelo utilizando SHapley Additives ExPlanations (SHAP). Utilizando datos demográficos y de laboratorio recogidos rutinariamente de la base de datos MIMIC-IV, se entrenaron y validaron múltiples algoritmos de aprendizaje automático, incluyendo conjuntos de árboles, aumento de gradientes y líneas base lineales. El rendimiento del modelo se evaluó de forma exhaustiva utilizando métricas de discriminación, incluyendo el área bajo la curva característica de operación del receptor (AUC) y análisis precisión-recuerdo, así como curvas de calibración de probabilidad y análisis de curvas de decisión (DCA) para evaluar el beneficio clínico neto. El modelo de mejor rendimiento se interpretó además utilizando SHAP para cuantificar y visualizar las contribuciones de características tanto a nivel global como individual. Entre todos los modelos evaluados, los métodos basados en árboles de conjunto mostraron un mejor rendimiento. El clasificador ExtraTrees alcanzó el mayor rendimiento de validación (AUC = 0,862; precisión media = 0,866). Además, el modelo seleccionado mostró una excelente calibración de probabilidad (puntuación Brier = 0,154) y demostró un beneficio clínico neto sustancial en una amplia gama de umbrales de riesgo en la DCA. El análisis SHAP identificó el género y la edad como los predictores más influyentes, seguidos de indicadores hematológicos y metabólicos rutinarios de laboratorio. Las explicaciones locales proporcionaron información clínicamente interpretable sobre predicciones individuales. Un modelo interpretable basado en árboles de conjunto predice eficazmente el riesgo de OP en pacientes con diabetes utilizando variables clínicas disponibles rutinariamente. La integración de SHAP mejora la transparencia clínica, y una calibración sólida junto con un beneficio clínico neto positivo apoya su posible implementación como herramienta fiable de apoyo a la toma de decisiones para la estratificación temprana del riesgo de OP en poblaciones diabéticas.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La diabetes mellitus y la osteoporosis (OP) son enfermedades crónicas muy prevalentes que coexisten cada vez más, generando una carga considerable a través de fracturas por fragilidad, discapacidad y costes sanitarios. En pacientes con diabetes tipo 2 (T2D), el riesgo de fractura es paradójicamente elevado incluso cuando la densidad mineral ósea areal (DMO) medida mediante absorptiometría de rayos X de doble energía (DXA) se mantiene o es superior a lo esperado, lo que pone de manifiesto que la "calidad" ósea y los factores metabólicos sistémicos contribuyen de manera importante a la fragilidadósea 1,2. A pesar de que la DXA es el estándar clínico para diagnosticar la OP, su accesibilidad y adopción siguen siendo limitadas en muchos entornos, y la evaluación basada en DXA puede subestimar el riesgo esquelético relacionado con la diabetes. A nivel poblacional, la evidencia metaanalítica sugiere que la OP es común entre personas con diabetes, aunque las estimaciones de prevalencia varían según las cohortes y los contextosclínicos 3. Por ello, existe una necesidad clínica crítica y una fuerte motivación para desarrollar herramientas pragmáticas y escalables de predicción de riesgos que aprovechen los datos clínicos recogidos rutinariamente para identificar los pacientes de alto riesgo más temprano, guiando así estrategias de detección dirigidas y de prevención individualizada.

En los últimos años, los métodos de aprendizaje automático (ML) se han utilizado cada vez más para modelar relaciones complejas y no lineales en datos clínicos y para construir predictores de riesgo OP en pacientes con diabetes. Estudios previos han demostrado una discriminación prometedora utilizando algoritmos como el aumento de gradiente, máquinas de vectores de soporte, redes neuronales y herramientas tipo nomograma. En concreto, los avances recientes han explorado estrategias innovadoras de modelado, como la fusión del aprendizaje automático con lógica difusa, para predecir los riesgos OP y relacionados con la diabetes basándose en factoresmodificables 4,5,6. Sin embargo, persiste una brecha significativa en la investigación: muchos modelos existentes se desarrollaron en subgrupos restringidos (por ejemplo, mujeres exclusivamente posmenopáusicas o pacientes mayores con diabetes tipo 2) y evaluados dentro de un conjunto limitado de algoritmos candidatos, dejando incertidumbre sobre qué opciones de modelado son óptimas para poblaciones diabéticas más amplias y datos heterogéneos de historias clínicas electrónicas (EHR). Además, una barrera crítica para la adopción clínica de estos modelos de aprendizaje automático de alto rendimiento es su naturaleza de "caja negra", que limita la confianza de los clínicos y dificulta su traducción a un apoyo a la decisión accionable. Las explicaciones aditivas SHapley (SHAP) proporcionan una solución al ofrecer explicaciones a nivel de caso, atribuyendo cada predicción a características individuales usando valores de Shapley, permitiendo así a los clínicos verificar si el razonamiento del modelo se alinea con la plausibilidad clínica.

Para abordar estas carencias, desarrollamos y validamos un marco de predicción de riesgos OP para pacientes con diabetes utilizando la base de datos de HCE de cuidados críticos Medical Information Mart for Intensive Care IV (MIMIC-IV) 7. La novedad de este estudio radica en la evaluación integral de múltiples familias de modelos de aprendizaje automático combinada con una interpretabilidad transparente basada en SHAP dentro de una gran cohorte diabética clínicamente compleja. A diferencia de los estudios centrados en un único algoritmo, nuestro enfoque integral selecciona sistemáticamente el modelo con mejor rendimiento basándose en una validación rigurosa y proporciona explicaciones transparentes a nivel de paciente. Este marco pretende ofrecer tanto un rendimiento predictivo robusto como conocimientos clínicamente accionables, apoyando una estratificación más temprana del riesgo para la OP entre los pacientes con diabetes.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Fuente de datos y declaración ética
Este estudio retrospectivo utilizó datos del MIMIC-IV (versión 3.1), una base de datos pública de HCE de cuidados críticos desidentificada alojada en PhysioNet. La base de datos incluye información demográfica, signos vitales, pruebas de laboratorio, diagnósticos, procedimientos y medicamentos.

El acceso a MIMIC-IV requiere autorización acreditada y cumplimiento del acuerdo de uso de datos y los requisitos de formación de PhysioNet. Los investigadores completaron la formación requerida y obtuvieron acceso (número de certificado: 68351548). Debido a que la base de datos está desidentificada, este estudio analizó datos anonimizados y no implicó contacto directo con pacientes; por lo tanto, no se requería consentimiento informado. El flujo de trabajo completo de modelado ejecutable paso a paso se ilustra en la Figura 1.

figure-protocol-1
Figura 1. Flujo de trabajo global de modelización para la predicción del riesgo de osteoporosis (OP) en pacientes con diabetes. Representación esquemática de la cadena de estudios, incluyendo identificación de cohortes, extracción de datos, ingeniería de características, benchmarking multimodelo, selección de modelos basada en el rendimiento de validación y interpretabilidad del modelo final basada en SHAP. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Estudio de población y extracción de datos
Los datos se extrajeron de la base de datos Medical Information Mart for Intensive Care IV (MIMIC-IV) utilizando una herramienta de gestión de bases de datos. Para garantizar la reproducibilidad, las consultas SQL exactas, incluyendo nombres de tablas y lógica de filtrado utilizadas para la recuperación de cohortes, se proporcionan en el Archivo Suplementario 1. Los pacientes adultos (≥18 años) diagnosticados con diabetes mellitus fueron identificados utilizando los códigos CIE-9 (249, 250) y los códigos CIE-10 (E08–E13). El resultado principal, OP, se definió usando los códigos ICD-9 (733.x) y los códigos ICD-10 (M80, M81, M82). Dentro de la cohorte diabética inicial elegible (n = 46.226), se identificaron 3.672 eventos positivos (pacientes con OP) y 42.554 eventos negativos (pacientes sin OP). En la Figura 2 se presenta un diagrama de flujo detallado de selección de pacientes y deserción.

figure-protocol-2
Figura 2. Diagrama de flujo de la selección de pacientes y construcción de cohortes. El diagrama ilustra la derivación de cohortes paso a paso a partir de la base de datos MIMIC-IV (v3.1). Los pacientes adultos con diabetes mellitus fueron identificados mediante códigos CIE, seguidos de la exclusión de pacientes con edad y Teniente; 18 años, datos críticos y datos críticos perdidos gt; 30%, o registros inválidos. La última cohorte se dividió en OP (eventos positivos) y no OP (eventos negativos). El desequilibrio de clases se abordó mediante submuestreo aleatorio y SMOTE aplicado a los datos de entrenamiento antes de la división estratificada de conjuntos de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Ingeniería de características
Para garantizar una comparación justa entre múltiples algoritmos de aprendizaje automático y una reproducibilidad precisa, se aplicó una secuencia idéntica de pasos de preprocesamiento: selección de características, imputación de valores faltantes, escalado continuo de características, balanceo de clases y división de conjuntos de datos. La lista completa de características de entrada, incluyendo nombres de variables, unidades y fuentes de datos, se detalla en la Tabla 1.

CaracterísticasTotal
(n = 14.688)
Conjunto de entrenamiento
(n = 9.546)
Conjunto de validación
(n = 2.204)
Conjunto de pruebas
(n = 2.938)
Valor P
Género0.345
Masculino6222 (42.36%)4045 (42.37%)935 (42.42%)1242 (42.27%)
Femenino8466 (57.64%)5501 (57.63%)1269 (57.58%)1696 (57.73%)
Edad0,28 (−0,40, 0,94)0,28 (−0,43, 0,94)0,23 (−0,46, 0,89)0,28 (−0,39, 0,95)0.1655
Glóbulos rojos−0,14 (−0,79, 0,49)−0,13 (−0,79, 0,49)−0,17 (−0,83, 0,48)−0,14 (−0,76, 0,49)0.3641
Hematócrito−0,14 (−0,81, 0,52)−0,13 (−0,80, 0,52)−0,14 (−0,87, 0,51)−0,16 (−0,81, 0,52)0.3709
Hemoglobina−0,12 (−0,79, 0,52)−0,12 (−0,79, 0,51)−0,15 (−0,86, 0,53)−0,13 (−0,78, 0,52)0.3616
RDW−0,16 (−0,59, 0,45)−0,17 (−0,59, 0,46)−0,14 (−0,59, 0,45)−0,17 (−0,60, 0,42)0.5803
Fosfato−0,14 (−0,60, 0,38)−0,15 (−0,61, 0,38)−0,11 (−0,57, 0,38)−0,13 (−0,56, 0,34)0.415
MCV0,05 (−0,50, 0,63)0,06 (−0,50, 0,65)0,03 (−0,49, 0,65)0,02 (−0,50, 0,59)0.5408
Magnesio−0,10 (−0,52, 0,37)−0,10 (−0,52, 0,37)−0,10 (−0,52, 0,37)−0,09 (−0,50, 0,37)0.7797
Glóbulos blancos−0,16 (−0,47, 0,21)−0,16 (−0,47, 0,20)−0,15 (−0,48, 0,25)−0,16 (−0,46, 0,20)0.6856
Brecha Aniónica−0,12 (−0,64, 0,45)−0,13 (−0,64, 0,45)−0,07 (−0,61, 0,48)−0,13 (−0,64, 0,45)0.1217
Creatinina−0,30 (−0,48, 0,01)−0,30 (−0,48, 0,01)−0,30 (−0,46, 0,01)−0,30 (−0,48, −0,00)0.3323
MCH0,11 (−0,48, 0,62)0,12 (−0,48, 0,62)0,11 (−0,47, 0,62)0,09 (−0,48, 0,61)0.5195
Recuento de plaquetas−0,09 (−0,61, 0,49)−0,09 (−0,61, 0,49)−0,08 (−0,62, 0,47)−0,10 (−0,62, 0,48)0.9709
MCHC−0,00 (−0,59, 0,59)−0,00 (−0,60, 0,59)−0,00 (−0,57, 0,58)0,00 (−0,57, 0,60)0.9263
Cloruro0,05 (−0,54, 0,64)0,05 (−0,52, 0,65)0,03 (−0,59, 0,62)0,07 (−0,52, 0,62)0.4675
Potasio−0,07 (−0,67, 0,53)−0,09 (−0,67, 0,53)−0,07 (−0,67, 0,53)−0,07 (−0,62, 0,53)0.3071
Sodio0,05 (−0,56, 0,60)0,05 (−0,55, 0,60)−0,00 (−0,60, 0,60)0,07 (−0,57, 0,61)0.3492
Nitrógeno ureico−0,28 (−0,60, 0,29)−0,28 (−0,60, 0,29)−0,26 (−0,59, 0,31)−0,28 (−0,59, 0,25)0.6826
Calcio total0,02 (−0,61, 0,59)0,02 (−0,61, 0,59)−0,01 (−0,59, 0,56)0,01 (−0,61, 0,60)0.8203

Tabla 1. Características de referencia y características ingenierizadas de la cohorte del estudio. Las variables categóricas se presentan como n (%). Las variables continuas se presentan como mediana (rango intercuartílico) de valores estandarizados. Se calcularon valores P para comparar las distribuciones entre los conjuntos de entrenamiento, validación y prueba utilizando pruebas estadísticas apropiadas.

Las variables continuas con mediciones repetidas se agregaron usando la media aritmética durante toda la ventana de observación de estancia en la UCI para obtener un único vector de característica por paciente. Se excluyeron variables con una tasa de desaparición superior al 30%. Para las variables numéricas restantes, los valores faltantes se imputaron usando el algoritmo de K-Nearest Neighbors (KNN) (n_neighbors = 5, pesos = 'uniforme'). Las variables categóricas se imputaban usando la categoría más frecuente y posteriormente se transformaban mediante mapeo binario, asignando a cualquier categoría no vista un vector de ceros.

Las variables continuas se estandarizaron usando la fórmula de escala z-score (). Las características que mostraban varianza nula fueron eliminadas explícitamente antes del escalado. Todos los parámetros de preprocesamiento (μ y σ.) se estimaron estrictamente en el conjunto de entrenamiento y se aplicaron de forma consistente a los conjuntos de validación y prueba.

Dado el grave desequilibrio de clases (3.672 frente a 42.554), se aplicó una estrategia de balanceo híbrida exclusivamente a los datos de entrenamiento para evitar inflar las estimaciones de rendimiento. Primero, se utilizó un submuestreo aleatorio para reducir la mayoría de la clase negativa y lograr una proporción 1:2 (positivo:negativo) (dando 7.344 muestras negativas). A continuación, se aplicó la Técnica de Sobremuestreo de Minorías Sintéticas (SMOTE) a la clase positiva para lograr una proporción equilibrada final de 1:1 (7.344 frente a 7.344)8.

Finalmente, la cohorte se dividió a nivel de paciente en entrenamiento (65%), validación (15%) y pruebas (20%) usando muestreo estratificado. Para controlar estrictamente todos los procesos aleatorios a través de la imputación, el equilibrio y la división, se aplicó una semilla aleatoria global (random_state = 42).

Arquitectura del modelo
Para identificar el modelo predictivo más adecuado para el riesgo de OP en pacientes con diabetes, se utilizó un marco de comparación a gran escala para comparar 70 variantes de algoritmos de ML bajo un protocolo idéntico de representación de datos y evaluación. Las familias de modelos candidatas incluían clasificadores lineales regularizados, máquinas de vectores de soporte (SVMs), kNN, conjuntos de árboles, arquitecturas de aumento de gradiente y perceptrones multicapa 9,10,11,12,13,14,15,16,17.

En lugar de utilizar una búsqueda tradicional en cuadrícula, la optimización de hiperparámetros se realizó evaluando configuraciones predefinidas y robustas entre estas 70 variantes de modelo en la división de entrenamiento. La selección se basaba estrictamente en maximizar el área bajo la curva de característica de funcionamiento del receptor (AUC) en el conjunto de validación. El modelo final con mejor rendimiento se configuró con n_estimators = 200, manteniendo otros parámetros en la configuración predeterminada del paquete de software que figuran en la Tabla de Materiales. Las métricas de evaluación, incluyendo AUC, precisión, puntuación F1, precisión y recuerdo, se calcularon usando un umbral de probabilidad por defecto de 0,5.

Para apoyar la transparencia clínica, se aplicó SHAP al modelo seleccionado utilizando el método TreeExplainer. Dada la naturaleza basada en árboles del modelo final, se usaron valores esperados exactos dependientes del camino del árbol como configuración de fondo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparación de rendimiento de modelos
Para identificar el enfoque predictivo óptimo para la OP en pacientes con diabetes, se compararon sistemáticamente múltiples modelos de aprendizaje automático. Se incluyó un clasificador lineal regularizado (regresión logística) como modelo de control base. La comparación general del rendimiento se resume en las Figuras 3–6. En todos los modelos evaluados, los métodos basados en árboles de conjunto superaron la lí...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este estudio, se compararon sistemáticamente múltiples algoritmos de aprendizaje automático para identificar un modelo predictivo óptimo para la OP entre pacientes con diabetes. Los métodos basados en árboles de conjunto, especialmente el modelo ExtraTrees, mostraron una mejor discriminación, calibración de probabilidad fiable y un mayor beneficio clínico neto en comparación con líneas base lineales y otras familias de algoritmos. Estos hallazgos indican que las interacciones no linea...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores afirman que la investigación se realizó en ausencia de relaciones comerciales o financieras que pudieran considerarse un posible conflicto de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen sinceramente el apoyo financiero del Proyecto Municipal de Ciencia y Tecnología de Nantong (Subvención nº JC2023039) y el Programa de Orientación para el Desarrollo Social de la Oficina de Ciencia y Tecnología de Nantong (Grant No. MSZ2023054).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CatBoostYandexv1.2 (o aplicable)Algoritmo de gradiente de impulso optimizado para características categóricas
imbalanced-learn (SMOTE)Scikit-learn Contribv0.11 (o aplicable)Biblioteca utilizada para realizar la Técnica de Sobremuestreo Sintético de Minoría para el equilibrio de clases
LightGBMMicrosoft Corporationv4.0 (o aplicable)Marco de impulso de gradiente basado en árboles de decisión
MatplotlibMatplotlib Development Teamv3.7 (o aplicable)Biblioteca de visualización utilizada para trazar figuras y curvas de rendimiento
MIMIC-IV Clinical DatabasePhysioNetv3.1Conjunto de datos de registros de salud electrónicos de cuidados críticos de acceso público utilizado como fuente de datos
Navicat PremiumPremiumSoft CyberTech Ltd.v17.0Herramienta de gestión de bases de datos utilizada para la extracción de datos basada en SQL
NumPyNumPy Developersv1.24 (o aplicable)Biblioteca de computación numérica utilizada para operaciones de matrices y procesamiento de datos
OpenPyXLEric Gazoni, Charlie Clarkv3.1 (o aplicable)Biblioteca utilizada para leer y escribir archivos Excel
PandasPandas Development Teamv2.0 (o aplicable)Biblioteca de manipulación y análisis de datos para conjuntos de datos estructurados
PostgreSQLPostgreSQL Global Development Groupv14 (o aplicable)Sistema de base de datos relacional utilizado para consultar y administrar datos MIMIC-IV
PythonPython Software Foundationv3.8+ (o aplicable)Lenguaje de programación utilizado para el procesamiento de datos, modelado y análisis
Scikit-learnScikit-learn Developersv1.3 (o aplicable)Biblioteca de aprendizaje automático utilizada para el desarrollo de modelos, preprocesamiento y evaluación
SciPySciPy Developersv1.10 (o aplicable)Biblioteca de computación científica utilizada para análisis estadístico
SeabornMichael Waskomv0.12 (o aplicable)Biblioteca de visualización de datos estadísticos para salidas gráficas mejoradas
SHAP (SHapley Additive exPlanations)Scott Lundbergv0.42 (o aplicable)Marco utilizado para interpretar predicciones de modelos utilizando valores de atribución de características
XGBoostDMLC (Distributed Machine Learning Community)v2.0 (o aplicable)Algoritmo de impulso de gradiente ampliamente utilizado para modelado de datos estructurados

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

MedicineAlldiabetes mellitusosteoporosisMachine learningExtraTreesExplainable Artificial IntelligenceRisk predictionBone fragility

Artículos relacionados