Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Modèle intelligent de diagnostic et de traitement basé sur des données cliniques pour la prise en charge de la réadaptation à domicile de la bronchopneumopathie chronique obstructive

530 vues

DOI :

10.3791/69024

24 octobre 2025

Dans cet article

Résumé

Un modèle basé sur les données cliniques combinant XGBoost et LSTM améliore la réadaptation à domicile pour la BPCO, améliorant la précision et la prédiction des données. Il atteint une précision de 98 % et une amélioration de l’indicateur de 42,5 %, ce qui permet de remédier aux limites du traitement hospitalier traditionnel.

Résumé

Le traitement traditionnel de réadaptation à l’hôpital pour la bronchopneumopathie chronique obstructive (BPCO) présente des problèmes tels que le manque de ressources, le coût élevé et le transport peu pratique. Afin d’améliorer la commodité du traitement de réadaptation de la BPCO, un modèle de diagnostic et de traitement intelligent basé sur des données cliniques est proposé pour la prise en charge de la réadaptation à domicile de la BPCO. Le modèle intelligent de diagnostic et de traitement de la rééducation à domicile de la BPCO est optimisé en combinant l’algorithme XGBoost et le réseau de mémoire à long terme et à court terme. Les résultats indiquent que l’algorithme XGBoost a la plus grande précision dans le traitement des données structurées cliniques, tandis que l’algorithme de forêt aléatoire (RF) a la plus faible précision dans le traitement des données structurées cliniques. Lorsque la quantité d’échantillons d’apprentissage est de 300, les taux de précision sont respectivement de 98 % et 83 %. L’intégration de l’algorithme XGBoost et du réseau de mémoire à long terme à court terme est utilisée pour traiter les indicateurs de surveillance, ce qui permet d’obtenir le taux d’amélioration le plus élevé et la plus petite erreur quadratique moyenne. Lorsque la taille de l’échantillon est de 1000, le taux d’amélioration des indicateurs de suivi est de 42,5 % et l’erreur quadratique moyenne est de 0,041. La méthode proposée dans l’étude permet de traiter efficacement les données cliniques, d’améliorer la précision du traitement des données et de prédire avec précision les changements futurs de la BPCO.

Introduction

La BPCO est une maladie chronique courante avec des taux élevés d’invalidité et de mortalité, qui a un impact significatif sur le niveau de vie des patients. Le modèle traditionnel de gestion de la réadaptation présente des problèmes tels que le manque d’information et l’intervention inopportune dans le traitement de la MPOC. Cependant, avec les progrès de la technologie, certaines technologies émergentes, telles que l’algorithme XGBoost (Extreme Gradient Boosting), ont offert de nouvelles possibilités pour la gestion de la BPCO1. Bien que XGBoost ait démontré son applicabilité dans divers contextes de surveillance de la santé, y compris en médecine sportive, cette étude tire spécifiquement parti de ses forces pour la gestion de la MPOC dans un cadre de réadaptation à domicile. L’accent reste mis sur l’amélioration de la précision prédictive et des soins personnalisés pour les patients atteints de BPCO à l’aide de données cliniques et de surveillance à distance2. Par exemple, en recueillant des indicateurs physiologiques, tels que la fréquence cardiaque, la fréquence respiratoire, etc., cette combinaison aide non seulement à la prise en charge des patients atteints de BPCO, mais offre également de nouvelles perspectives et approches de la gestion de la santé3. XGBoost est un algorithme d’arbre de décision efficace de boosting de gradient (GB). XGBoost utilise des techniques de calcul parallèle et de mise en cache pour accélérer l’entraînement et permettre de gérer l’administration de bases de données volumineuses et de caractéristiques complexes. De plus, il fonctionne bien dans la gestion de divers types d’ensembles de données, avec une excellente capacité de généralisation4. La mémoire à long terme (LSTM) est une structure RNN spéciale couramment utilisée pour le traitement et l’apprentissage de données de séries chronologiques. LSTM est sensible au temps et est capable d’identifier des modèles et des caractéristiques dans les données de séries chronologiques, ce qui le rend utile pour des missions telles que le traitement des signaux et la prédiction de séries chronologiques. Pour obtenir une prédiction précise et une intervention personnalisée de la maladie, une méthode est proposée pour appliquer le mode de diagnostic et de traitement intelligent des données cliniques à la prise en charge de la réadaptation à domicile de la BPCO. La recherche combine de manière innovante XGBoost et LSTM pour optimiser le diagnostic intelligent et le mode de traitement de la réadaptation à domicile de la BPCO. La combinaison des deux permet de prédire avec précision la maladie et de fournir des plans d’intervention personnalisés basés sur les données afin d’améliorer le niveau d’intelligence de la gestion de la réadaptation à domicile de la BPCO.

Pour garantir l’utilité du modèle proposé, plusieurs paramètres et contraintes sont à prendre en compte. La méthode peut nécessiter des données cliniques structurées (par exemple, des données sur la fonction pulmonaire et des données sur l’oxygène dans le sang) et des données de surveillance à distance (par exemple, fréquence cardiaque, saturation en oxygène, niveaux d’activité) collectées périodiquement à partir de capteurs portables fiables ou d’appareils de surveillance à domicile. Pour un entraînement stable, la taille de l’échantillon doit être d’au moins 300 échantillons, et pour des performances optimales, il est préférable d’avoir 1000 échantillons ou plus. Il existe également des besoins de calcul, notamment en termes de formation LSTM, qui nécessitent une puissance de traitement suffisante ou l’utilisation de solutions de déploiement basées sur le cloud pour la capacité de prédiction.

La BPCO est une maladie respiratoire progressive et irréversible caractérisée par une limitation du débit sortant, des exacerbations aiguës et une altération de la qualité de vie (QdV). Il a un impact significatif sur les populations dans les domaines de la santé, du bien-être et des systèmes de santé à travers le monde ; par conséquent, la prédiction précoce et l’intervention rapide de la BPCO font partie intégrante de la limitation de la progression pathologique de la maladie et des admissions à l’hôpital5. Il a été démontré que les techniques d’apprentissage automatique (ML) améliorent le diagnostic et le pronostic de la MPOC avec des données cliniquement pertinentes grâce à des approches de modélisation avancées axées sur les données. XGBoost a été cité pour générer les modèles ML les plus efficaces et les plus réussis pour les données déséquilibrées et les interactions non linéaires entre les variables cliniques6. Ils ont signalé une excellente précision de classification des maladies pulmonaires avec XGBoost et les machines à vecteurs de support (SVM) avec des données électroniques sur le nez. De plus, des modèles prédictifs basés sur l’apprentissage automatique ont été construits pour prédire le risque de BPCO à l’aide de données cliniques déséquilibrées, recommandant XGBoost pour améliorer la fiabilité prédictive7. De plus, la forte performance de XGBoost parmi d’autres modèles ML dans les tâches de classification de la BPCO a été validée. L’apprentissage d’ensemble a également été utilisé efficacement à l’aide de plusieurs modèles d’apprentissage automatique auto-apprenants pour l’identification et la classification de la BPCO et la détection du cancer du poumon, en faisant particulièrement référence au rôle de XGBoost dans les données de diagnostic respiratoire8. En résumé, ces recherches précédentes fournissent la base pour utiliser XGBoost dans une application modifiée utilisant les capacités du transformateur LSTM afin de construire un modèle intelligent de diagnostic et de traitement pour les personnes atteintes de réadaptation à domicile de la BPCO, d’augmenter la précision des prédictions et d’améliorer la prestation de soins et de soins personnalisés9.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a été examinée et approuvée par le comité d’éthique de l’hôpital de cancérologie de Taizhou. Le consentement éclairé écrit de tous les participants a été obtenu avant la collecte des données, conformément aux normes éthiques institutionnelles et nationales. Les réactifs et les logiciels utilisés sont répertoriés dans la table des matériaux.

1. Vue d’ensemble du flux de travail

Le flux de travail de bout en bout pour le traitement des données cliniques structurées avec XGBoost est illustré à la figure 1 et comprend l’ingestion de fonctionnalités, la construction d’arbres, les mises à jour résiduelles, la régularisation et l’évaluation. Le flux de travail de prétraitement et de modélisation de séquence pour les données de surveillance à distance avec LSTM est illustré à la figure 2, englobant le rééchantillonnage en 10 minutes, la gestion des écarts, le fenêtrage sans chevauchement sur 7 jours, l’architecture réseau et l’inférence.

2. Recrutement des patients et données démographiques

Entre mars 2023 et janvier 2024, les patients ont été recrutés consécutivement dans les cliniques externes et les services d’hospitalisation de l’hôpital de cancérologie de Taizhou. Les critères d’inclusion étaient un diagnostic confirmé de BPCO selon les critères GOLD (VEMS 1/CVF < 70 %), une condition stable au moment de l’inscription et un âge compris entre 40 et 80 ans. Les critères d’exclusion comprenaient des comorbidités graves telles que le cancer du poumon, une maladie cardiovasculaire non contrôlée ou une déficience cognitive empêchant le consentement éclairé. Au total, 214 patients ont été recrutés (âge moyen de 63,7 ± 8,9 ans ; 68 % d’hommes ; 54 % de fumeurs actuels ou anciens).

3. Collecte des données

Les données cliniques structurées comprenaient la fonction pulmonaire (VEMS1, CVF), la saturation en oxygène du sang (SpO2), la durée du séjour à l’hôpital et la durée de la maladie. La fonction pulmonaire et la SpO2 ont été enregistrées en pourcentage, en jours de séjour à l’hôpital et en durée de la maladie en années. Les données de surveillance à distance ont été collectées à l’aide d’oxymètres portables certifiés et de trackers d’activité validés par rapport aux normes d’excellence des hôpitaux : les oxymètres de pouls ont été vérifiés avec les moniteurs Masimo Rad-97 (erreur absolue moyenne de 1,8 % dans la plage de 90 à 100 % de SpO2 ), les capteurs de fréquence cardiaque ont été validés par rapport à l’électrocardiographie (erreur moyenne de 2,3 bpm) et les compteurs de pas ont été calibrés sur un protocole de tapis roulant. Les données brutes ont été exportées sous forme de fichiers CSV horodatés à un intervalle d’échantillonnage de 10 minutes.

4. Justification de la taille de l’échantillon

Les seuils de 300 échantillons d’apprentissage pour XGBoost et d’environ 1000 séquences de 7 jours non chevauchantes pour LSTM ont été étayés par des expériences et des analyses de puissance/simulation. Une analyse de puissance a posteriori à l’aide de G*Power (version 3.1) a indiqué que 300 échantillons fournissaient une puissance de >80 % pour détecter une taille d’effet moyenne (f2 de Cohen = 0,15) à α = 0,05 en régression logistique. Les simulations ont montré qu’environ 1000 séquences étaient nécessaires pour une convergence stable du LSTM sur des séries temporelles physiologiques multivariées. Les preuves empiriques sont résumées dans le tableau 1 et visualisées dans les figures 3 et 4.

5. Prétraitement des données

Les entrées manquantes, identifiées comme des blancs, des valeurs sentinelles ou NaN, ont été imputées à l’aide de la moyenne de l’ensemble d’apprentissage pour chaque caractéristique afin d’éviter les fuites cibles :

figure-protocol-1(1)

mj est le nombre de valeurs observées pour la caractéristique j. Il en a été de même figure-protocol-2 pour les kits de validation et de test. Pour éliminer le biais lié à l’échelle, les caractéristiques ont été normalisées avec la normalisation du score z à l’aide de paramètres d’entraînement uniquement :

figure-protocol-3(2)

μj et σj sont la moyenne et l’écart-type de la caractéristique j estimés à partir des données d’entraînement. Pour les signaux de séries temporelles (SpO2, fréquence cardiaque, pas), les flux ont été alignés sur une cadence de 10 minutes ; Les écarts courts jusqu’à 30 minutes ont été comblés vers l’avant, et les écarts plus longs ont été lissés avec une moyenne mobile à trois points. Une fenêtre glissante de 7 jours avec 1008 pas de temps a ensuite été appliquée pour former des séquences qui ne se chevauchent pas afin d’éviter les fuites (voir figure 2).

6. Formation du modèle

Pour les données cliniques structurées, XGBoost a été ajusté via la recherche par grille sur le taux d’apprentissage (0,01-0,3), la profondeur maximale (3-10) et le nombre d’estimateurs (100-500) dans le cadre d’un objectif logistique binaire (flux de travail dans la figure 1). Pour les données de surveillance à distance, le LSTM comprenait deux couches LSTM cachées de 128 unités chacune, l’initialisation Xavier, un taux d’abandon de 0,5 et une couche de sortie sigmoïde ; l’optimisation a utilisé Adam avec un taux d’apprentissage de 0,001 implémenté dans TensorFlow (pipeline dans la figure 2). Le surajustement a été atténué par l’abandon et l’arrêt précoce (patience = 10), et le déséquilibre de classe a été corrigé avec SMOTE.

7. Stratégie d’évaluation

Les données structurées ont été évaluées par validation croisée stratifiée en 10 parties. Les données de séries chronologiques ont été évaluées à l’aide d’une validation préalable afin de préserver l’ordre temporel. Les mesures comprenaient l’exactitude, la précision, le rappel, la mesure F, l’aire sous la courbe ROC (AUC) et l’erreur quadratique moyenne (MSE). Les différences entre les modèles ont été évaluées à l’aide du test de Wilcoxon (bilatéral). Les chiffres comprennent des bandes de confiance à 95 % ou des barres d’erreur pour quantifier l’incertitude. Ces choix abordent directement les risques de fuite de séries chronologiques et le besoin de signification statistique demandé par les examinateurs.

8. Pertinence clinique et essais pilotes

Le modèle hybride a prédit le déclin de la SpO2 6 à 12 heures avant la manifestation clinique chez 78 % des patients suivis et a réduit la MSE de 42,5 % par rapport aux lignes de base. Dans le cadre d’un projet pilote de quatre semaines mené auprès de 20 patients atteints de BPCO, les scores de risque hebdomadaires du modèle concordaient avec les évaluations des médecins dans 85 % des évaluations, ce qui soutient le potentiel d’intégration clinique.

9. Logiciel et environnement

Les analyses ont été effectuées en Python 3.10.6 avec scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 et PyTorch 1.13 sur Ubuntu 20.04 LTS avec un GPU NVIDIA RTX 3080, CUDA 11.6 et cuDNN 8.2. La version complète et les fournisseurs sont répertoriés dans la table des matériaux non numérotée.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Stabilité de la taille de l’échantillon et performances optimales
Pour démontrer explicitement le seuil de stabilité, nous présentons d’abord le tableau 1, suivi des courbes d’apprentissage de la figure 3 et de la figure 4. Le tableau 1 présente la ± SD moyenne de la précision, de l’AUC et de l’EQM pour des tailles d’entraînement croissantes pour le classificateur XGBoost sur les données str...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Résumé des principales constatations
La BPCO impose un lourd fardeau clinique et sociétal en raison d’une respiration altérée, d’une mobilité réduite et d’exacerbations aiguës récurrentes10. L’utilisation de la surveillance continue à domicile avec des analyses explicables peut alléger ce fardeau en permettant une détection plus précoce et une intervention ciblée. Dans cette étude, un flux de travail hybride intégrant XGBoost pour les variables...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont rien à divulguer.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
CUDANVIDIA11.6Plate-forme de calcul parallèle et modèle de programmation utilisés pour accélérer les calculs sur les GPU.
cuDNNNVIDIA8.2Une bibliothèque accélérée par GPU pour les réseaux de neurones profonds afin d’optimiser les performances d’entraînement des modèles.
Appareil ECGPhilipsPageWriter TC70Utilisé pour valider les mesures de fréquence cardiaque à partir de l’appareil portable.
GPUNVIDIARTX 3080GPU hautes performances utilisé pour accélérer l’entraînement des modèles sur de grands ensembles de données.
Modèle LSTM--Réseau neuronal à mémoire longue et à court terme utilisé pour le traitement de données de séries chronologiques.
Oxymètre de poulsMasimoRad-97Utilisé pour mesurer la saturation en oxygène du sang (SpO2) et valider la précision de l’appareil portable.
PythonFondation du logiciel Python3.10.6Langage de programmation utilisé pour le traitement des données, l’entraînement des modèles et l’évaluation.
TensorFlowGoogle (en anglais)2.13Bibliothèque logicielle utilisée pour l’entraînement du modèle LSTM et l’exécution de calculs de réseaux neuronaux.
Tracker d’activité portableFitbitChef d’accusation 5Utilisé pour suivre les pas et les niveaux d’activité physique.
XGBoost--Bibliothèque logicielle utilisée pour le gradient boosting (apprentissage automatique).

Références

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Algorithme XGBoostm moire court et long termeprise en charge de la BPCOindicateurs de suivipr cision du traitement des donn esmod lisation pr dictive