Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Modelo inteligente de diagnóstico y tratamiento basado en datos clínicos para el manejo de la rehabilitación domiciliaria de la enfermedad pulmonar obstructiva crónica

532 visualizaciones

DOI:

10.3791/69024

24 de octubre de 2025

En este artículo

Resumen

Un modelo basado en datos clínicos que combina XGBoost y LSTM mejora la rehabilitación domiciliaria para la EPOC, mejorando la precisión y la predicción de los datos. Logra una precisión del 98% y una mejora del indicador del 42,5%, abordando las limitaciones del tratamiento hospitalario tradicional.

Resumen

El tratamiento tradicional de rehabilitación hospitalaria para la enfermedad pulmonar obstructiva crónica (EPOC) tiene problemas como escasez de recursos, alto costo y transporte inconveniente. Para mejorar la conveniencia del tratamiento de rehabilitación para la EPOC, se propone un modelo de diagnóstico y tratamiento inteligente basado en datos clínicos para el manejo de la rehabilitación domiciliaria de la EPOC. El modelo inteligente de diagnóstico y tratamiento para la rehabilitación domiciliaria de la EPOC se optimiza combinando el algoritmo XGBoost y la red de memoria a corto plazo. Los resultados indican que el algoritmo XGBoost tiene la mayor precisión en el procesamiento de datos clínicos estructurados, mientras que el algoritmo de bosque aleatorio (RF) tiene la menor precisión en el procesamiento de datos clínicos estructurados. Cuando la cantidad de muestras de entrenamiento es 300, las tasas de precisión son del 98% y el 83%, respectivamente. La integración del algoritmo XGBoost y la red de memoria a corto plazo se utiliza para procesar los indicadores de monitoreo, lo que da como resultado la tasa de mejora más alta y el error cuadrático medio más pequeño. Cuando el tamaño de la muestra es 1000, la tasa de mejora de los indicadores de monitoreo es del 42,5% y el error cuadrático medio es de 0,041. El método propuesto en el estudio puede procesar eficazmente los datos clínicos, mejorar la precisión del procesamiento de datos y predecir con precisión los cambios futuros en la EPOC.

Introducción

La EPOC es una enfermedad crónica común con altas tasas de discapacidad y mortalidad, lo que afecta significativamente el nivel de vida de los pacientes. El modelo tradicional de gestión de la rehabilitación tiene problemas como el retraso de la información y la intervención inoportuna en el tratamiento de la EPOC. Sin embargo, con el avance de la tecnología, algunas tecnologías emergentes, como el algoritmo Extreme Gradient Boosting (XGBoost), han traído nuevas posibilidades para el manejo de la EPOC1. Si bien XGBoost ha demostrado su aplicabilidad en varios contextos de monitoreo de la salud, incluso en medicina deportiva, este estudio aprovecha específicamente sus fortalezas para controlar la EPOC en un entorno de rehabilitación en el hogar. El enfoque sigue siendo mejorar la precisión predictiva y la atención personalizada para los pacientes con EPOC utilizando datos clínicos y de monitoreo remoto2. Por ejemplo, al recopilar indicadores fisiológicos, como la frecuencia cardíaca, la frecuencia respiratoria, etc., esta combinación no solo ayuda con el manejo de los pacientes con EPOC, sino que también ofrece nuevas perspectivas y enfoques para la gestión de la salud3. XGBoost es un algoritmo de árbol de decisión de aumento de gradiente (GB) eficiente. XGBoost utiliza técnicas de computación paralela y almacenamiento en caché para que el entrenamiento sea más rápido y capaz de manejar la administración de grandes bases de datos y características complejas. Además, se desempeña bien en el manejo de varios tipos de conjuntos de datos, con una excelente capacidad de generalización4. La memoria a corto plazo (LSTM) es una estructura especial de RNN que se usa comúnmente para procesar y aprender datos de series temporales. LSTM es sensible al tiempo y es capaz de identificar patrones y características dentro de los datos de series temporales, lo que lo hace útil para tareas como el procesamiento de señales y la predicción de series temporales. Para lograr una predicción precisa y una intervención personalizada de la enfermedad, se propone un método para aplicar el modo inteligente de diagnóstico y tratamiento de los datos clínicos al manejo de la rehabilitación domiciliaria de la EPOC. La investigación combina de manera innovadora XGBoost y LSTM para optimizar el diagnóstico inteligente y el modo de tratamiento de la rehabilitación domiciliaria de la EPOC. La combinación de los dos puede lograr una predicción precisa de la enfermedad y proporcionar planes de intervención personalizados basados en datos para mejorar el nivel de inteligencia del manejo de la rehabilitación domiciliaria de la EPOC.

Para garantizar la utilidad del modelo propuesto, se deben tener en cuenta varios parámetros y limitaciones. El método puede requerir datos clínicos estructurados (p. ej., datos de función pulmonar y datos de oxígeno en sangre) y datos de monitoreo remoto (p. ej., frecuencia cardíaca, saturación de oxígeno, niveles de actividad) recopilados periódicamente de sensores portátiles confiables o dispositivos de monitoreo en el hogar. Para un entrenamiento estable, el tamaño de la muestra debe ser de un mínimo de 300 muestras y, para un rendimiento óptimo, se prefiere tener 1000 o más muestras. También existen necesidades computacionales, particularmente en términos de entrenamiento de LSTM, que requieren suficiente potencia de procesamiento o el uso de soluciones de implementación basadas en la nube para la capacidad de predicción.

La EPOC es una enfermedad respiratoria progresiva e irreversible caracterizada por limitación del flujo de salida, exacerbaciones agudas y deterioro de la calidad de vida (CdV). Tiene un impacto significativo en las poblaciones de los sistemas de salud, bienestar y atención médica en todo el mundo; por lo tanto, la predicción temprana y la intervención oportuna de la EPOC son fundamentales para limitar la progresión patológica de la enfermedad y los ingresos hospitalarios5. Se ha demostrado que las técnicas de aprendizaje automático (ML) mejoran la ruta de diagnóstico y pronóstico de la EPOC con datos clínicamente relevantes a través de enfoques avanzados de modelado basados en datos. XGBoost ha sido citado como el generador de los modelos de ML más efectivos y exitosos para datos desequilibrados e interacciones no lineales entre variables clínicas6. Se informó una excelente precisión en la clasificación de enfermedades pulmonares con XGBoost y Support Vector Machines (SVM) con datos electrónicos de nariz. Además, se construyeron modelos predictivos basados en ML para predecir el riesgo de EPOC utilizando datos clínicos desequilibrados, recomendando XGBoost para mejorar la confiabilidad predictiva7. Además, se validó el sólido rendimiento de XGBoost entre otros modelos de ML en tareas de clasificación de EPOC. El aprendizaje por conjuntos también se ha utilizado de manera efectiva utilizando múltiples modelos de ML de autoaprendizaje para la identificación y clasificación de la EPOC y la detección del cáncer de pulmón, especialmente haciendo referencia al papel de XGBoost en los datos de diagnóstico respiratorio8. En resumen, estas investigaciones anteriores proporcionan la base para usar XGBoost en una aplicación modificada utilizando capacidades de transformador LSTM para construir un modelo inteligente de diagnóstico y tratamiento para personas que viven con EPOC rehabilitación domiciliaria, para aumentar la precisión de la predicción y una mejor atención médica y personalizada9.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio fue revisado y aprobado por el Comité de Ética del Hospital de Cáncer de Taizhou. Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recolección de datos, de acuerdo con las normas éticas institucionales y nacionales. Los reactivos y el software utilizado se enumeran en la Tabla de materiales.

1. Descripción general del flujo de trabajo

El flujo de trabajo de extremo a extremo para procesar datos clínicos estructurados con XGBoost se muestra en la Figura 1 e incluye la ingesta de características, la construcción de árboles, las actualizaciones residuales, la regularización y la evaluación. El flujo de trabajo de preprocesamiento y modelado de secuencias para datos de monitoreo remoto con LSTM se muestra en la Figura 2, que abarca el remuestreo de 10 minutos, el manejo de brechas, las ventanas no superpuestas de 7 días, la arquitectura de red y la inferencia.

2. Reclutamiento de pacientes y datos demográficos

Los pacientes fueron reclutados consecutivamente de clínicas ambulatorias y salas de hospitalización en el Hospital Oncológico de Taizhou entre marzo de 2023 y enero de 2024. Los criterios de inclusión fueron un diagnóstico confirmado de EPOC según los criterios GOLD (FEV1/FVC < 70%), una condición estable en el momento de la inscripción y una edad entre 40 y 80 años. Los criterios de exclusión incluyeron comorbilidades graves como cáncer de pulmón, enfermedad cardiovascular no controlada o deterioro cognitivo que impida el consentimiento informado. Se inscribieron 214 pacientes (edad media 63,7 ± 8,9 años; 68% hombres; 54% fumadores actuales o ex fumadores).

3. Recopilación de datos

Los datos clínicos estructurados incluyeron la función pulmonar (FEV1, FVC), la saturación de oxígeno en sangre (SpO2), la duración de la estancia hospitalaria y la duración de la enfermedad. La función pulmonar y la SpO2 se registraron como porcentajes, la estancia hospitalaria en días y la duración de la enfermedad en años. Los datos de monitoreo remoto se recopilaron utilizando oxímetros portátiles certificados y rastreadores de actividad validados según los estándares de oro del hospital: los oxímetros de pulso se verificaron con monitores Masimo Rad-97 (error absoluto medio del 1,8% en el rango de SpO2 del 90-100%), los sensores de frecuencia cardíaca se validaron con electrocardiografía (error medio de 2,3 lpm) y los contadores de pasos se calibraron en un protocolo de cinta de correr. Los datos sin procesar se exportaron como archivos CSV con marca de tiempo en un intervalo de muestreo de 10 minutos.

4. Justificación del tamaño de la muestra

Los umbrales de 300 muestras de entrenamiento para XGBoost y aproximadamente 1000 secuencias de 7 días no superpuestas para LSTM fueron respaldados por experimentos y análisis de potencia / simulación. Un análisis de potencia post hoc utilizando G*Power (versión 3.1) indicó que 300 muestras proporcionaron un >80% de potencia para detectar un tamaño de efecto medio (f2 de Cohen = 0,15) a α = 0,05 en regresión logística. Las simulaciones mostraron que se necesitaban alrededor de 1000 secuencias para la convergencia estable del LSTM en series temporales fisiológicas multivariantes. La evidencia empírica se resume en la Tabla 1 y se visualiza en la Figura 3 y la Figura 4.

5. Preprocesamiento de datos

Las entradas faltantes, identificadas como espacios en blanco, valores centinela o NaN, se imputaron utilizando la media del conjunto de entrenamiento para cada característica para evitar la fuga de destino:

figure-protocol-1(1)

donde mj es el número de valores observados para la característica j. Lo mismo figure-protocol-2 se aplicó a los conjuntos de validación y prueba. Para eliminar el sesgo relacionado con la escala, las características se estandarizaron con la normalización de la puntuación z utilizando parámetros de solo entrenamiento:

figure-protocol-3(2)

donde μj y σj son la media y la desviación típica de la característica j estimada a partir de los datos de entrenamiento. Para las señales de series temporales (SpO2, frecuencia cardíaca, pasos), los flujos se alinearon con una cadencia de 10 minutos; Las brechas cortas de hasta 30 minutos se llenaron hacia adelante y las brechas más largas se suavizaron con un promedio móvil de tres puntos. Luego se aplicó una ventana deslizante de 7 días con 1008 pasos de tiempo para formar secuencias no superpuestas para evitar fugas (ver Figura 2).

6. Entrenamiento del modelo

Para los datos clínicos estructurados, XGBoost se ajustó a través de la búsqueda en cuadrícula sobre la tasa de aprendizaje (0,01-0,3), la profundidad máxima (3-10) y el número de estimadores (100-500) bajo un objetivo logístico binario (flujo de trabajo en la Figura 1). Para los datos de monitoreo remoto, el LSTM comprendía dos capas LSTM ocultas con 128 unidades cada una, inicialización de Xavier, una tasa de abandono de 0.5 y una capa de salida sigmoide; optimización utilizó Adam con una tasa de aprendizaje de 0.001 implementada en TensorFlow (canalización en la Figura 2). El sobreajuste se mitigó con el abandono y la interrupción temprana (paciencia = 10), y el desequilibrio de clase se abordó con SMOTE.

7. Estrategia de evaluación

Los datos estructurados se evaluaron con validación cruzada estratificada de 10 veces. Los datos de las series temporales se evaluaron con validación de avance para preservar el orden temporal. Las métricas incluyeron exactitud, precisión, recuerdo, medida F, área bajo la curva ROC (AUC) y error cuadrático medio (MSE). Las diferencias entre modelos se evaluaron mediante la prueba de rango con signo de Wilcoxon (bilateral). Las cifras incluyen bandas de confianza del 95% o barras de error para cuantificar la incertidumbre. Estas opciones abordan directamente los riesgos de fuga de series temporales y la necesidad de significación estadística solicitada por los revisores.

8. Relevancia clínica y pruebas piloto

El modelo híbrido predijo la disminución de la SpO2 6-12 h antes de la manifestación clínica en el 78% de los pacientes monitoreados y redujo la MSE en un 42,5% en relación con las líneas de base. En un piloto de cuatro semanas con 20 pacientes con EPOC, las puntuaciones de riesgo del modelo semanal coincidieron con las evaluaciones de los médicos en el 85% de las revisiones, lo que respalda el potencial de integración clínica.

9. Software y entorno

Los análisis se realizaron en Python 3.10.6 con scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 y PyTorch 1.13 en Ubuntu 20.04 LTS con una GPU NVIDIA RTX 3080, CUDA 11.6 y cuDNN 8.2. El control de versiones completo y los proveedores se enumeran en la tabla de materiales sin numerar.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Estabilidad del tamaño de la muestra y rendimiento óptimo
Para demostrar explícitamente el umbral de estabilidad, primero presentamos la Tabla 1, seguida de las curvas de aprendizaje en la Figura 3 y la Figura 4. La Tabla 1 informa la media ± SD de precisión, AUC y MSE en tamaños de entrenamiento crecientes para el clasificador XGBoost en datos estructurados y para el LSTM en series temporal...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Resumen de las principales conclusiones
La EPOC impone una carga clínica y social sustancial a través de problemas respiratorios, movilidad reducida y exacerbaciones agudas recurrentes10. Aprovechar el monitoreo continuo del hogar con análisis explicables puede mitigar esta carga al permitir una detección más temprana y una intervención específica. En este estudio, un flujo de trabajo híbrido que integra XGBoost para variables clínicas estructu...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen nada que revelar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CUDANVIDIA11.6Una plataforma de computación paralela y un modelo de programación utilizado para acelerar los cálculos en las GPU.
cuDNNNVIDIA8.2Una biblioteca acelerada por GPU para redes neuronales profundas para optimizar el rendimiento del entrenamiento del modelo.
Máquina de ECGPhilipsPageWriter TC70Se utiliza para validar las mediciones de frecuencia cardíaca desde el dispositivo portátil.
GPUNVIDIARTX 3080GPU de alto rendimiento utilizada para acelerar el entrenamiento de modelos en grandes conjuntos de datos.
Modelo LSTM--Red neuronal de memoria a corto plazo larga utilizada para el procesamiento de datos de series temporales.
Oxímetro de pulsoMasimoRadiador-97Se utiliza para medir la saturación de oxígeno en sangre (SpO2) y validar la precisión del dispositivo portátil.
PitónFundación de software Python3.10.6Lenguaje de programación utilizado para el procesamiento de datos, el entrenamiento de modelos y la evaluación.
TensorFlowGoogle2.13Biblioteca de software utilizada para entrenar el modelo LSTM y realizar cálculos de redes neuronales.
Rastreador de actividad portátilFitbitCargo 5Se utiliza para realizar un seguimiento de los pasos y los niveles de actividad física.
XGBoost--Biblioteca de software utilizada para el aumento de gradiente (aprendizaje automático).

Referencias

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Algoritmo XGBoostMemoria a Corto y Largo PlazoManejo de la EPOCIndicadores de MonitoreoPrecisi n del Procesamiento de DatosModelado Predictivo