Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

Intelligent diagnose- en behandelmodel op basis van klinische gegevens voor thuisrevalidatie van chronische obstructieve longziekte

532 weergaven

DOI:

10.3791/69024

24 oktober 2025

In dit artikel

Samenvatting

Een klinisch, datagestuurd model dat XGBoost en LSTM combineert, verbetert de thuisrevalidatie voor COPD en verbetert de nauwkeurigheid en voorspelling van gegevens. Het bereikt een nauwkeurigheid van 98% en een indicatorverbetering van 42,5%, waarmee de beperkingen van traditionele ziekenhuisbehandeling worden aangepakt.

Samenvatting

Traditionele revalidatiebehandeling in het ziekenhuis voor chronische obstructieve longziekte (COPD) heeft problemen zoals een tekort aan middelen, hoge kosten en onhandig vervoer. Om het gemak van revalidatiebehandeling voor COPD te verbeteren, wordt een klinisch, datagestuurd intelligent diagnose- en behandelmodel voorgesteld voor thuisrevalidatiebeheer van COPD. Het intelligente diagnose- en behandelmodel voor thuisrevalidatie van COPD wordt geoptimaliseerd door het XGBoost-algoritme te combineren met het netwerk van het lange kortetermijngeheugen. De resultaten geven aan dat het XGBoost-algoritme de hoogste nauwkeurigheid heeft bij het verwerken van klinische gestructureerde gegevens, terwijl het random forest (RF)-algoritme de laagste nauwkeurigheid heeft bij het verwerken van klinische gestructureerde gegevens. Wanneer het aantal trainingsvoorbeelden 300 is, zijn de nauwkeurigheidspercentages respectievelijk 98% en 83%. De integratie van het XGBoost-algoritme en het netwerk van het langetermijnkortetermijngeheugen wordt gebruikt om de monitoringsindicatoren te verwerken, wat resulteert in het hoogste verbeteringspercentage en de kleinste gemiddelde kwadratische fout. Wanneer de steekproefomvang 1000 is, is het verbeteringspercentage van monitoringindicatoren 42,5% en is de gemiddelde kwadratische fout 0,041. De methode die in het onderzoek wordt voorgesteld, kan klinische gegevens effectief verwerken, de nauwkeurigheid van de gegevensverwerking verbeteren en toekomstige veranderingen in COPD nauwkeurig voorspellen.

Inleiding

COPD is een veel voorkomende chronische ziekte met hoge invaliditeits- en sterftecijfers, wat een aanzienlijke invloed heeft op de levensstandaard van patiënten. Het traditionele revalidatiemanagementmodel heeft problemen zoals informatieachterstand en vroegtijdig ingrijpen bij het omgaan met COPD. Met de vooruitgang van de technologie hebben sommige opkomende technologieën, zoals het Extreme Gradient Boosting (XGBoost)-algoritme, echter nieuwe mogelijkheden gebracht voor het beheer van COPD1. Hoewel XGBoost toepasbaarheid heeft aangetoond in verschillende contexten voor gezondheidsmonitoring, waaronder in de sportgeneeskunde, maakt deze studie specifiek gebruik van de sterke punten ervan voor de behandeling van COPD in een thuisrevalidatieomgeving. De focus blijft liggen op het verbeteren van voorspellende nauwkeurigheid en gepersonaliseerde zorg voor COPD-patiënten met behulp van klinische en externe monitoringgegevens2. Door bijvoorbeeld fysiologische indicatoren te verzamelen, zoals hartslag, ademhalingsfrequentie, enz., helpt deze combinatie niet alleen bij de behandeling van COPD-patiënten, maar biedt het ook nieuwe perspectieven en benaderingen voor gezondheidsmanagement3. XGBoost is een efficiënt algoritme voor het verhogen van de gradiënt (GB). XGBoost maakt gebruik van parallelle computer- en cachingtechnieken om training sneller te maken en in staat te zijn om het beheer van grote databases en ingewikkelde kenmerken aan te kunnen. Bovendien presteert het goed bij het omgaan met verschillende soorten datasets, met een uitstekend generalisatievermogen4. Long Short-Term Memory (LSTM) is een speciale RNN-structuur die vaak wordt gebruikt voor het verwerken en leren van tijdreeksgegevens. LSTM is tijdgevoelig en is in staat om patronen en kenmerken binnen tijdreeksgegevens te identificeren, waardoor het nuttig is voor opdrachten zoals het verwerken van signalen en het voorspellen van tijdreeksen. Om een nauwkeurige voorspelling en gepersonaliseerde interventie van de ziekte te bereiken, wordt een methode voorgesteld om de intelligente diagnose en behandelingsmodus van klinische gegevens toe te passen op het beheer van thuisrevalidatie van COPD. Het onderzoek combineert op innovatieve wijze XGBoost en LSTM om de intelligente diagnose- en behandelingsmodus van COPD-thuisrevalidatie te optimaliseren. De combinatie van de twee kan een nauwkeurige ziektevoorspelling bereiken en gegevensgestuurde gepersonaliseerde interventieplannen bieden om het intelligentieniveau van COPD-thuisrevalidatiebeheer te verbeteren.

Om het nut van het voorgestelde model te garanderen, moet rekening worden gehouden met verschillende parameters en beperkingen. De methode kan gestructureerde klinische gegevens vereisen (bijv. longfunctiegegevens en bloedzuurstofgegevens) en bewakingsgegevens op afstand (bijv. hartslag, zuurstofverzadiging, activiteitsniveaus) die periodiek worden verzameld van betrouwbare draagbare sensoren of apparaten voor thuisbewaking. Voor een stabiele training moet de steekproefomvang minimaal 300 monsters zijn, en voor optimale prestaties heeft de voorkeur aan 1000 of meer monsters. Er zijn ook computationele behoeften, met name op het gebied van LSTM-training, die voldoende verwerkingskracht vereisen of het gebruik van cloudgebaseerde implementatieoplossingen voor voorspellingsmogelijkheden.

COPD is een progressieve, onomkeerbare luchtwegaandoening die wordt gekenmerkt door uitstroombeperking, acute exacerbaties en verslechtering van de kwaliteit van leven (QoL). Het heeft een aanzienlijke invloed op de bevolking in de gezondheidszorg, het welzijn en de gezondheidszorg over de hele wereld; daarom zijn vroege voorspelling en tijdige interventie van COPD een integraal onderdeel van het beperken van pathologische ziekteprogressie en ziekenhuisopnames5. Het is aangetoond dat machine learning (ML)-technieken het diagnostische en prognostische pad van COPD verbeteren met klinisch relevante gegevens door middel van geavanceerde datagestuurde modelleringsbenaderingen. XGBoost is geciteerd om de meest effectieve en succesvolle ML-modellen te genereren voor onevenwichtige gegevens en niet-lineaire interacties tussen klinische variabelen6. De gerapporteerde uitstekende classificatienauwkeurigheid voor longziekten met XGBoost en Support Vector Machines (SVM) met elektronische neusgegevens. Ook werden op ML gebaseerde voorspellende modellen geconstrueerd om het risico op COPD te voorspellen met behulp van onevenwichtige klinische gegevens, waarbij XGBoost werd aanbevolen om de voorspellende betrouwbaarheid te verbeteren7. Bovendien werden de sterke prestaties van XGBoost ten opzichte van andere ML-modellen in COPD-classificatietaken gevalideerd. Ensemble leren is ook effectief gebruikt met behulp van meerdere zelflerende ML-modellen voor de identificatie en classificatie van COPD en de detectie van longkanker, met name verwijzend naar de rol van XGBoost in respiratoire diagnostische gegevens8. Samenvattend vormen deze voorgaande onderzoeken de basis om XGBoost te gebruiken in een aangepaste toepassing met behulp van transformator LSTM-mogelijkheden om een intelligent diagnose- en behandelmodel te bouwen voor mensen met COPD thuisrevalidatie, om de nauwkeurigheid van de voorspelling te vergroten en een betere gepersonaliseerde gezondheids- en zorgverleningte verbeteren 9.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Deze studie werd beoordeeld en goedgekeurd door de ethische commissie van het Taizhou Cancer Hospital. Van alle deelnemers werd schriftelijke geïnformeerde toestemming verkregen voordat de gegevens werden verzameld, in overeenstemming met institutionele en nationale ethische normen. De gebruikte reagentia en de gebruikte software staan vermeld in de materiaaltabel.

1. Overzicht van de workflow

De end-to-end workflow voor het verwerken van gestructureerde klinische gegevens met XGBoost wordt weergegeven in figuur 1 en omvat functie-opname, boomconstructie, resterende updates, regularisatie en evaluatie. De workflow voor voorverwerking en sequentiemodellering voor het op afstand bewaken van gegevens met LSTM wordt weergegeven in figuur 2, die 10-minuten herbemonstering, gap-afhandeling, 7-daagse niet-overlappende windowing, netwerkarchitectuur en inferentie omvat.

2. Werving van patiënten en demografie

Patiënten werden tussen maart 2023 en januari 2024 achtereenvolgens gerekruteerd uit poliklinieken en intramurale afdelingen van het Taizhou Cancer Hospital. Inclusiecriteria waren een bevestigde COPD-diagnose volgens GOLD-criteria (FEV1/FVC < 70%), een stabiele toestand bij inschrijving en een leeftijd tussen 40 en 80 jaar. Uitsluitingscriteria waren onder meer ernstige comorbiditeiten zoals longkanker, ongecontroleerde hart- en vaatziekten of cognitieve stoornissen die geïnformeerde toestemming verhinderden. In totaal werden 214 patiënten geïncludeerd (gemiddelde leeftijd 63,7 ± 8,9 jaar; 68% man; 54% huidige of voormalige rokers).

3. Verzameling van gegevens

Klinisch gestructureerde gegevens omvatten longfunctie (FEV1, FVC), zuurstofverzadiging in het bloed (SpO2), duur van het ziekenhuisverblijf en ziekteduur. Longfunctie en SpO2 werden geregistreerd als percentages, ziekenhuisverblijf in dagen en ziekteduur in jaren. Gegevens voor monitoring op afstand werden verzameld met behulp van gecertificeerde draagbare oximeters en activity trackers die waren gevalideerd volgens de gouden normen van ziekenhuizen: pulsoximeters werden gecontroleerd met Masimo Rad-97-monitoren (gemiddelde absolute fout 1,8% in het bereik van 90-100% SpO2 ), hartslagsensoren werden gevalideerd aan de hand van elektrocardiografie (gemiddelde fout 2,3 bpm) en stappentellers werden gekalibreerd op een loopbandprotocol. Onbewerkte gegevens werden geëxporteerd als CSV-bestanden met een tijdstempel met een bemonsteringsinterval van 10 minuten.

4. Rechtvaardiging van de steekproefomvang

Drempels van 300 trainingssamples voor XGBoost en ongeveer 1000 niet-overlappende 7-daagse sequenties voor LSTM werden ondersteund door experimenten en power/simulatie-analyses. Een post hoc poweranalyse met behulp van G*Power (versie 3.1) gaf aan dat 300 monsters >80% power leverden om een gemiddelde effectgrootte te detecteren (Cohen's f2 = 0,15) bij α = 0,05 in logistische regressie. Simulaties toonden aan dat ongeveer 1000 sequenties nodig waren voor een stabiele convergentie van de LSTM op multivariate fysiologische tijdreeksen. Het empirische bewijs is samengevat in Tabel 1 en gevisualiseerd in Figuur 3 en Figuur 4.

5. Voorverwerking van gegevens

Ontbrekende vermeldingen, geïdentificeerd als lege plekken, sentinelwaarden of NaN, werden toegerekend met behulp van het gemiddelde van de trainingsset voor elke functie om doellekkage te voorkomen:

figure-protocol-1(1)

waarbij mj het aantal waargenomen waarden voor kenmerk j is. figure-protocol-2 Hetzelfde werd toegepast op de validatie- en testsets. Om schaalgerelateerde vertekening te verwijderen, werden kenmerken gestandaardiseerd met z-score-normalisatie met behulp van parameters die alleen voor training waren:

figure-protocol-3(2)

waarbij μj en σj het gemiddelde en de standaarddeviatie zijn van kenmerk j, geschat op basis van de trainingsgegevens. Voor tijdreekssignalen (SpO2, hartslag, stappen) werden streams uitgelijnd op een cadans van 10 minuten; Korte gaten tot 30 minuten werden naar voren opgevuld en langere gaten werden gladgestreken met een voortschrijdend gemiddelde van drie punten. Vervolgens werd een glijdend venster van 7 dagen met 1008 tijdstappen toegepast om niet-overlappende sequenties te vormen om lekkage te voorkomen (zie figuur 2).

6. Model training

Voor gestructureerde klinische gegevens werd XGBoost via rasteronderzoek afgestemd op leersnelheid (0,01-0,3), maximale diepte (3-10) en aantal schatters (100-500) onder een binaire logistieke doelstelling (workflow in figuur 1). Voor bewakingsgegevens op afstand bestond de LSTM uit twee verborgen LSTM-lagen met elk 128 eenheden, Xavier-initialisatie, een uitvalpercentage van 0,5 en een sigmoïde uitvoerlaag; optimalisatie gebruikte Adam met een leersnelheid van 0,001 geïmplementeerd in TensorFlow (pijplijn in Figuur 2). Overfitting werd beperkt met uitval en vroegtijdig stoppen (geduld = 10), en onbalans in de klas werd aangepakt met SMOTE.

7. Evaluatie strategie

Gestructureerde gegevens werden geëvalueerd met gestratificeerde 10-voudige kruisvalidatie. Tijdreeksgegevens werden geëvalueerd met walk-forward-validatie om de temporele volgorde te behouden. De statistieken omvatten nauwkeurigheid, precisie, herinnering, F-meting, gebied onder de ROC-curve (AUC) en gemiddelde kwadratische fout (MSE). Verschillen tussen modellen werden beoordeeld met behulp van de Wilcoxon signed-rank-test (tweezijdig). De cijfers omvatten 95% betrouwbaarheidsbanden of foutbalken om de onzekerheid te kwantificeren. Deze keuzes hebben rechtstreeks betrekking op de risico's van het lekken van tijdreeksen en de behoefte aan statistische significantie waar de beoordelaars om vragen.

8. Klinische relevantie en pilottests

Het hybride model voorspelde een afname van SpO2 6-12 uur vóór klinische manifestatie bij 78% van de gemonitorde patiënten en verminderde MSE met 42,5% ten opzichte van de uitgangswaarden. In een vier weken durende pilot met 20 COPD-patiënten kwamen de wekelijkse modelrisicoscores in 85% van de beoordelingen overeen met de beoordelingen van artsen, wat het potentieel voor klinische integratie ondersteunt.

9. Software en omgeving

Analyses werden uitgevoerd in Python 3.10.6 met scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 en PyTorch 1.13 op Ubuntu 20.04 LTS met een NVIDIA RTX 3080 GPU, CUDA 11.6 en cuDNN 8.2. Volledig versiebeheer en leveranciers worden vermeld in de ongenummerde Materiaaltabel.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Stabiliteit van de steekproefomvang en optimale prestaties
Om de stabiliteitsdrempel expliciet aan te tonen, presenteren we eerst Tabel 1, gevolgd door leercurves in Figuur 3 en Figuur 4. Tabel 1 rapporteert de gemiddelde ± SD van nauwkeurigheid, AUC en MSE over toenemende trainingsgroottes voor de XGBoost-classificatie op gestructureerde gegevens en voor de ...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Samenvatting van de belangrijkste bevindingen
COPD vormt een aanzienlijke klinische en maatschappelijke belasting door verminderde ademhaling, verminderde mobiliteit en terugkerende acute exacerbaties10. Door gebruik te maken van continue thuismonitoring met verklaarbare analyses kan deze last worden verminderd door eerdere detectie en gerichte interventie mogelijk te maken. In deze studie behaalde een hybride workflow die XGBoost integreerde v...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs hebben niets te onthullen.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
CUDANVIDIA11.6Een parallelle computing platform en programmeermodel die wordt gebruikt om berekeningen op GPU's te versnellen.
cuDNNNVIDIA8.2Een GPU-versnelde bibliotheek voor diepe neurale netwerken om de prestaties van modeltraining te optimaliseren.
ECG MachinePhilipsPageWriter TC70Wordt gebruikt om de hartslagmetingen van het draagbare apparaat te valideren.
GPUNVIDIARTX 3080Hoge prestatie GPU die wordt gebruikt voor het versnellen van modeltraining op grote datasets.
LSTM Model--Long Short-Term Memory neurale netwerk die wordt gebruikt voor verwerking van tijdreeksgegevens.
Pulse OximeterMasimoRad-97Wordt gebruikt om de zuurstofverzadiging in het bloed (SpO2) te meten en de nauwkeurigheid van het draagbare apparaat te valideren.
PythonPython Software Foundation3.10.6Programmeertaal die wordt gebruikt voor gegevensverwerking, modeltraining en evaluatie.
TensorFlowGoogle2.13Softwarebibliotheek die wordt gebruikt voor het trainen van het LSTM-model en het uitvoeren van neurale netwerkberekeningen.
Wearable Activity TrackerFitbitCharge 5Wordt gebruikt voor het volgen van stappen en fysieke activiteitsniveaus.
XGBoost--Softwarebibliotheek die wordt gebruikt voor gradient boosting (machine learning).

Referenties

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

XGBoost algoritmeLong Short Term MemoryCOPD managementmonitoringindicatorennauwkeurigheid van gegevensverwerkingpredictieve modellering