È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo di ricerca

Modello intelligente di diagnosi e trattamento basato su dati clinici per la gestione della riabilitazione domiciliare della broncopneumopatia cronica ostruttiva

529 visualizzazioni

DOI:

10.3791/69024

24 ottobre 2025

In questo articolo

Sommario

Un modello clinico basato sui dati che combina XGBoost e LSTM migliora la riabilitazione domiciliare per la BPCO, migliorando l'accuratezza e la previsione dei dati. Raggiunge un'accuratezza del 98% e un miglioramento dell'indicatore del 42,5%, affrontando i limiti del trattamento ospedaliero tradizionale.

Abstract

Il tradizionale trattamento di riabilitazione ospedaliera per la broncopneumopatia cronica ostruttiva (BPCO) presenta problemi come carenza di risorse, costi elevati e trasporti scomodi. Per migliorare la convenienza del trattamento riabilitativo per la BPCO, viene proposto un modello di diagnosi e trattamento intelligente basato sui dati clinici per la gestione della BPCO in riabilitazione domiciliare. Il modello intelligente di diagnosi e trattamento per la riabilitazione domiciliare della BPCO è ottimizzato combinando l'algoritmo XGBoost e la rete di memoria a breve termine. I risultati indicano che l'algoritmo XGBoost ha la massima precisione nell'elaborazione dei dati clinici strutturati, mentre l'algoritmo della foresta casuale (RF) ha la più bassa accuratezza nell'elaborazione dei dati clinici strutturati. Quando la quantità di campioni di training è 300, i tassi di accuratezza sono rispettivamente del 98% e dell'83%. L'integrazione dell'algoritmo XGBoost e della rete di memoria a breve termine viene utilizzata per elaborare gli indicatori di monitoraggio, ottenendo il più alto tasso di miglioramento e il più piccolo errore quadratico medio. Quando la dimensione del campione è 1000, il tasso di miglioramento degli indicatori di monitoraggio è del 42,5% e l'errore quadratico medio è 0,041. Il metodo proposto nello studio può elaborare efficacemente i dati clinici, migliorare l'accuratezza dell'elaborazione dei dati e prevedere con precisione i futuri cambiamenti nella BPCO.

Introduzione

La BPCO è una malattia cronica comune con alti tassi di disabilità e mortalità, che ha un impatto significativo sul tenore di vita dei pazienti. Il modello tradizionale di gestione della riabilitazione presenta problemi come il ritardo informativo e l'intervento intempestivo nella gestione della BPCO. Tuttavia, con il progresso della tecnologia, alcune tecnologie emergenti, come l'algoritmo Extreme Gradient Boosting (XGBoost), hanno portato nuove possibilità per la gestione della BPCO1. Sebbene XGBoost abbia dimostrato l'applicabilità in vari contesti di monitoraggio della salute, anche nella medicina dello sport, questo studio sfrutta specificamente i suoi punti di forza per la gestione della BPCO in un contesto di riabilitazione domiciliare. L'attenzione rimane sul miglioramento dell'accuratezza predittiva e dell'assistenza personalizzata per i pazienti con BPCO utilizzando dati clinici e di monitoraggio remoto2. Ad esempio, raccogliendo indicatori fisiologici, come la frequenza cardiaca, la frequenza respiratoria, ecc., questa combinazione non solo aiuta nella gestione dei pazienti con BPCO, ma offre anche nuove prospettive e approcci alla gestione della salute3. XGBoost è un efficiente algoritmo di albero decisionale per l'aumento del gradiente (GB). XGBoost utilizza tecniche di calcolo parallelo e di memorizzazione nella cache per rendere l'addestramento più veloce e in grado di gestire l'amministrazione di database di grandi dimensioni e caratteristiche complesse. Inoltre, si comporta bene nella gestione di vari tipi di set di dati, con un'eccellente capacità di generalizzazione4. La memoria a breve termine lunga (LSTM) è una speciale struttura RNN comunemente utilizzata per l'elaborazione e l'apprendimento di dati di serie temporali. LSTM è sensibile al tempo ed è in grado di identificare modelli e caratteristiche all'interno dei dati delle serie temporali, il che lo rende utile per compiti come l'elaborazione di segnali e la previsione di serie temporali. Per ottenere una previsione accurata e un intervento personalizzato della malattia, viene proposto un metodo per applicare la diagnosi intelligente e la modalità di trattamento dei dati clinici alla gestione della riabilitazione domiciliare della BPCO. La ricerca combina in modo innovativo XGBoost e LSTM per ottimizzare la diagnosi intelligente e la modalità di trattamento della riabilitazione domiciliare della BPCO. La combinazione dei due può ottenere una previsione accurata della malattia e fornire piani di intervento personalizzati basati sui dati per migliorare il livello di intelligenza della gestione della riabilitazione domiciliare della BPCO.

Per garantire l'utilità del modello proposto, è necessario tenere conto di diversi parametri e vincoli. Il metodo può richiedere dati clinici strutturati (ad esempio, dati sulla funzionalità polmonare e dati sull'ossigeno nel sangue) e dati di monitoraggio remoto (ad esempio, frequenza cardiaca, saturazione di ossigeno, livelli di attività) raccolti periodicamente da sensori indossabili affidabili o dispositivi di monitoraggio domestico. Per un addestramento stabile, la dimensione del campione dovrebbe essere un minimo di 300 campioni e per prestazioni ottimali, è preferibile avere 1000 o più campioni. Ci sono anche esigenze computazionali, in particolare in termini di addestramento LSTM, che richiedono una potenza di elaborazione sufficiente o l'uso di soluzioni di distribuzione basate su cloud per la capacità di previsione.

La BPCO è una malattia respiratoria progressiva e irreversibile, caratterizzata da limitazione del deflusso, esacerbazioni acute e compromissione della qualità della vita (QoL). Ha un impatto significativo sulle popolazioni dei sistemi sanitari, sanitari e sanitari di tutto il mondo; pertanto, la previsione precoce e l'intervento tempestivo della BPCO sono parte integrante della limitazione della progressione patologica della malattia e dei ricoveri ospedalieri5. È stato dimostrato che le tecniche di apprendimento automatico (ML) migliorano il percorso diagnostico e prognostico della BPCO con dati clinicamente rilevanti attraverso approcci avanzati di modellazione basati sui dati. XGBoost è stato citato per generare i modelli di ML più efficaci e di successo per dati sbilanciati e interazioni non lineari tra variabili cliniche6. L'eccellente accuratezza della classificazione delle malattie polmonari riportata con XGBoost e Support Vector Machines (SVM) con dati nasali elettronici. Inoltre, sono stati costruiti modelli predittivi basati su ML per prevedere il rischio di BPCO utilizzando dati clinici sbilanciati, raccomandando XGBoost per migliorare l'affidabilità predittiva7. Inoltre, sono state convalidate le ottime prestazioni di XGBoost tra gli altri modelli ML nelle attività di classificazione della BPCO. L'apprendimento d'insieme è stato utilizzato in modo efficace anche utilizzando più modelli di ML ad autoapprendimento per l'identificazione e la classificazione della BPCO e il rilevamento del cancro del polmone, facendo riferimento in particolare al ruolo di XGBoost nei dati diagnostici respiratori8. In sintesi, queste indagini precedenti forniscono la base per utilizzare XGBoost in un'applicazione modificata utilizzando le funzionalità LSTM del trasformatore per costruire un modello di diagnosi e trattamento intelligente per le persone che vivono con la riabilitazione domiciliare della BPCO, per aumentare l'accuratezza della previsione e una migliore fornitura personalizzata di salute e assistenza9.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo studio è stato esaminato e approvato dal Comitato Etico del Taizhou Cancer Hospital. Il consenso informato scritto è stato ottenuto da tutti i partecipanti prima della raccolta dei dati, in conformità con gli standard etici istituzionali e nazionali. I reagenti e il software utilizzati sono elencati nella Tabella dei Materiali.

1. Panoramica del flusso di lavoro

Il flusso di lavoro end-to-end per l'elaborazione di dati clinici strutturati con XGBoost è illustrato nella Figura 1 e include l'acquisizione di funzionalità, la costruzione di alberi, gli aggiornamenti residui, la regolarizzazione e la valutazione. Il flusso di lavoro di pre-elaborazione e modellazione delle sequenze per i dati di monitoraggio remoto con LSTM è illustrato nella Figura 2, che comprende il ricampionamento di 10 minuti, la gestione dei gap, la finestra non sovrapposta di 7 giorni, l'architettura di rete e l'inferenza.

2. Reclutamento dei pazienti e dati demografici

I pazienti sono stati reclutati consecutivamente da cliniche ambulatoriali e reparti di degenza presso il Taizhou Cancer Hospital tra marzo 2023 e gennaio 2024. I criteri di inclusione erano una diagnosi confermata di BPCO secondo i criteri GOLD (FEV1/FVC < 70%), una condizione stabile all'arruolamento e un'età compresa tra 40 e 80 anni. I criteri di esclusione includevano gravi comorbidità come il cancro ai polmoni, malattie cardiovascolari incontrollate o deterioramento cognitivo che impediva il consenso informato. Sono stati arruolati un totale di 214 pazienti (età media 63,7 ± 8,9 anni; 68% maschi; 54% fumatori o ex fumatori).

3. Raccolta dei dati

I dati clinici strutturati includevano la funzione polmonare (FEV1, FVC), la saturazione di ossigeno nel sangue (SpO2), la durata della degenza ospedaliera e la durata della malattia. La funzione polmonare e la SpO2 sono state registrate in percentuale, la degenza ospedaliera in giorni e la durata della malattia in anni. I dati del monitoraggio remoto sono stati raccolti utilizzando ossimetri indossabili certificati e tracker di attività convalidati rispetto agli standard ospedalieri: i pulsossimetri sono stati sottoposti a controllo incrociato con i monitor Masimo Rad-97 (errore assoluto medio 1,8% nell'intervallo SpO2 al 90-100%), i sensori di frequenza cardiaca sono stati convalidati rispetto all'elettrocardiografia (errore medio 2,3 bpm) e i contapassi sono stati calibrati su un protocollo di tapis roulant. I dati grezzi sono stati esportati come file CSV con data e ora a un intervallo di campionamento di 10 minuti.

4. Giustificazione della dimensione del campione

Soglie di 300 campioni di addestramento per XGBoost e circa 1000 sequenze di 7 giorni non sovrapposte per LSTM sono state supportate da esperimenti e analisi di potenza/simulazione. Un'analisi post hoc della potenza utilizzando G*Power (versione 3.1) ha indicato che 300 campioni hanno fornito >80% di potenza per rilevare una dimensione dell'effetto media (f2 di Cohen = 0,15) a α = 0,05 nella regressione logistica. Le simulazioni hanno mostrato che erano necessarie circa 1000 sequenze per una convergenza stabile della LSTM su serie temporali fisiologiche multivariate. L'evidenza empirica è riassunta nella Tabella 1 e visualizzata nella Figura 3 e nella Figura 4.

5. Pre-elaborazione dei dati

Le voci mancanti, identificate come spazi vuoti, valori sentinella o NaN, sono state imputate utilizzando la media del set di addestramento per ciascuna funzione per evitare perdite target:

figure-protocol-1(1)

dove mj è il numero di valori osservati per la funzione j. Lo stesso figure-protocol-2 è stato applicato ai set di convalida e di test. Per rimuovere il bias correlato alla scala, le funzionalità sono state standardizzate con la normalizzazione z-score utilizzando parametri di sola formazione:

figure-protocol-3(2)

dove μj e σj sono la media e la deviazione standard della funzione j stimata dai dati di addestramento. Per i segnali delle serie temporali (SpO2, frequenza cardiaca, passi), i flussi sono stati allineati a una cadenza di 10 minuti; Gli intervalli brevi fino a 30 minuti sono stati riempiti in avanti e gli intervalli più lunghi sono stati attenuati con una media mobile a tre punti. È stata quindi applicata una finestra scorrevole di 7 giorni con 1008 intervalli temporali per formare sequenze non sovrapposte per evitare perdite (vedi Figura 2).

6. Formazione del modello

Per i dati clinici strutturati, XGBoost è stato ottimizzato tramite la ricerca a griglia rispetto al tasso di apprendimento (0,01-0,3), alla profondità massima (3-10) e al numero di stimatori (100-500) in base a un obiettivo logistico binario (flusso di lavoro nella Figura 1). Per i dati di monitoraggio remoto, l'LSTM comprendeva due livelli LSTM nascosti con 128 unità ciascuno, inizializzazione Xavier, un tasso di dropout di 0,5 e un livello di uscita sigmoide; l'ottimizzazione ha utilizzato Adam con una velocità di apprendimento di 0,001 implementata in TensorFlow (pipeline nella Figura 2). L'overfitting è stato mitigato con l'abbandono e l'arresto anticipato (pazienza = 10) e lo squilibrio di classe è stato risolto con SMOTE.

7. Strategia di valutazione

I dati strutturati sono stati valutati con una convalida incrociata stratificata di 10 volte. I dati delle serie temporali sono stati valutati con la convalida walk-forward per preservare l'ordine temporale. Le metriche includevano accuratezza, precisione, richiamo, misura F, area sotto la curva ROC (AUC) e errore quadratico medio (MSE). Le differenze tra i modelli sono state valutate utilizzando il test del rango firmato di Wilcoxon (a due lati). Le cifre includono bande di confidenza o barre di errore del 95% per quantificare l'incertezza. Queste scelte affrontano direttamente i rischi di perdita di serie temporali e la necessità di significatività statistica richiesta dai revisori.

8. Rilevanza clinica e test pilota

Il modello ibrido ha previsto il declino della SpO2 6-12 ore prima della manifestazione clinica nel 78% dei pazienti monitorati e ha ridotto l'MSE del 42,5% rispetto ai valori basali. In un progetto pilota di quattro settimane con 20 pazienti con BPCO, i punteggi di rischio settimanali del modello concordavano con le valutazioni dei medici nell'85% delle revisioni, supportando il potenziale per l'integrazione clinica.

9. Software e ambiente

Le analisi sono state eseguite in Python 3.10.6 con scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 e PyTorch 1.13 su Ubuntu 20.04 LTS con GPU NVIDIA RTX 3080, CUDA 11.6 e cuDNN 8.2. Il controllo completo delle versioni e i fornitori sono elencati nella tabella dei materiali non numerata.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Stabilità delle dimensioni del campione e prestazioni ottimali
Per dimostrare esplicitamente la soglia di stabilità, presentiamo prima la Tabella 1, seguita dalle curve di apprendimento nella Figura 3 e nella Figura 4. La tabella 1 riporta la media ± SD di accuratezza, AUC e MSE in dimensioni di training crescenti per il classificatore XGBoost su dati strutturati e per LSTM su serie temporali...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Sintesi dei principali risultati
La BPCO impone un notevole onere clinico e sociale attraverso la respirazione compromessa, la mobilità ridotta e le riacutizzazioni ricorrenti10. Sfruttare il monitoraggio continuo della casa con analisi spiegabili può mitigare questo onere consentendo un rilevamento precoce e un intervento mirato. In questo studio, un flusso di lavoro ibrido che integra XGBoost per variabili cliniche strutturate e LSTM per segn...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori non hanno nulla da rivelare.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
CUDANVIDIA11.6Una piattaforma di calcolo parallelo e un modello di programmazione utilizzati per velocizzare i calcoli sulle GPU.
cuDNNNVIDIA8.2Una libreria accelerata da GPU per reti neurali profonde per ottimizzare le prestazioni di addestramento dei modelli.
Macchina ECGPhilipsPageWriter TC70Utilizzato per convalidare le misurazioni della frequenza cardiaca dal dispositivo indossabile.
GPUNVIDIARTX 3080GPU ad alte prestazioni utilizzata per accelerare l'addestramento del modello su set di dati di grandi dimensioni.
Modello LSTM--Rete neurale Long Short-Term Memory utilizzata per l'elaborazione di dati di serie temporali.
PulsossimetroMasimoRad-97Utilizzato per misurare la saturazione di ossigeno nel sangue (SpO2) e convalidare l'accuratezza del dispositivo indossabile.
PitoneFondazione del software Python3.10.6Linguaggio di programmazione utilizzato per l'elaborazione dei dati, l'addestramento dei modelli e la valutazione.
Flusso di TensoreAlessio2.13Libreria software utilizzata per l'addestramento del modello LSTM e l'esecuzione di calcoli di reti neurali.
Tracker di attività indossabileFitbitCarica 5Utilizzato per monitorare i passi e i livelli di attività fisica.
XGBoost--Libreria software utilizzata per l'aumento del gradiente (apprendimento automatico).

Riferimenti

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Algoritmo XGBoostLong Short Term Memorygestione della BPCOindicatori di monitoraggioaccuratezza dell elaborazione dei datimodellazione predittiva