Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Forschungsartikel

Intelligentes Diagnose- und Behandlungsmodell auf der Grundlage klinischer Daten für die häusliche Rehabilitation bei chronisch obstruktiver Lungenerkrankung

529 Ansichten

DOI:

10.3791/69024

24. Oktober 2025

In diesem Artikel

Zusammenfassung

Ein klinisches datengesteuertes Modell, das XGBoost und LSTM kombiniert, verbessert die häusliche Rehabilitation bei COPD und verbessert die Datengenauigkeit und Vorhersage. Es erreicht eine Genauigkeit von 98 % und eine Verbesserung der Indikatoren von 42,5 % und überwindet damit die Einschränkungen der traditionellen Krankenhausbehandlung.

Zusammenfassung

Die traditionelle Rehabilitationsbehandlung im Krankenhaus bei chronisch obstruktiver Lungenerkrankung (COPD) ist mit Problemen wie Ressourcenknappheit, hohen Kosten und unbequemen Transportmöglichkeiten verbunden. Um den Komfort der Rehabilitationsbehandlung bei COPD zu verbessern, wird ein klinisches, datengestütztes, intelligentes Diagnose- und Behandlungsmodell für das Rehabilitationsmanagement von COPD zu Hause vorgeschlagen. Das intelligente Diagnose- und Behandlungsmodell für die Heimrehabilitation der COPD wird durch die Kombination des XGBoost-Algorithmus und des Long Short-Term Memory-Netzwerks optimiert. Die Ergebnisse deuten darauf hin, dass der XGBoost-Algorithmus die höchste Genauigkeit bei der Verarbeitung klinisch strukturierter Daten aufweist, während der Random Forest (RF)-Algorithmus die geringste Genauigkeit bei der Verarbeitung klinisch strukturierter Daten aufweist. Wenn die Anzahl der Trainingsgebiete 300 beträgt, betragen die Genauigkeitsraten 98 % bzw. 83 %. Die Integration des XGBoost-Algorithmus und des Long-Short-Term-Memory-Netzwerks wird zur Verarbeitung der Überwachungsindikatoren verwendet, was zu der höchsten Verbesserungsrate und dem kleinsten mittleren quadratischen Fehler führt. Bei einem Stichprobenumfang von 1000 beträgt die Verbesserungsrate der Überwachungsindikatoren 42,5 % und der mittlere quadratische Fehler 0,041. Die in der Studie vorgeschlagene Methode kann klinische Daten effektiv verarbeiten, die Genauigkeit der Datenverarbeitung verbessern und zukünftige Veränderungen bei COPD genau vorhersagen.

Einleitung

COPD ist eine häufige chronische Krankheit mit hohen Behinderungs- und Sterblichkeitsraten, die den Lebensstandard der Patienten erheblich beeinträchtigt. Das traditionelle Rehabilitationsmanagementmodell weist Probleme wie Informationsverzögerungen und vorzeitige Interventionen im Umgang mit COPD auf. Mit dem Fortschritt der Technologie haben jedoch einige neue Technologien, wie z. B. der Extreme Gradient Boosting (XGBoost)-Algorithmus, neue Möglichkeiten für das Management von COPD1 eröffnet. Während XGBoost seine Anwendbarkeit in verschiedenen Kontexten der Gesundheitsüberwachung, einschließlich der Sportmedizin, gezeigt hat, nutzt diese Studie speziell seine Stärken für die Behandlung von COPD in einer häuslichen Rehabilitationsumgebung. Der Schwerpunkt liegt weiterhin auf der Verbesserung der Vorhersagegenauigkeit und der personalisierten Versorgung von COPD-Patienten unter Verwendung klinischer und Fernüberwachungsdaten2. Durch die Erhebung physiologischer Indikatoren, wie Herzfrequenz, Atemfrequenz etc., hilft diese Kombination nicht nur bei der Behandlung von COPD-Patienten, sondern bietet auch neue Perspektiven und Ansätze für das Gesundheitsmanagement3. XGBoost ist ein effizienter Gradient Boosting (GB) Entscheidungsbaum-Algorithmus. XGBoost verwendet parallele Computing- und Caching-Techniken, um das Training zu beschleunigen und die Verwaltung großer Datenbanken und komplizierter Merkmale zu bewältigen. Darüber hinaus eignet es sich gut für den Umgang mit verschiedenen Arten von Datensätzen und verfügt über eine hervorragende Verallgemeinerungsfähigkeit4. Long Short-Term Memory (LSTM) ist eine spezielle RNN-Struktur, die häufig zur Verarbeitung und zum Erlernen von Zeitreihendaten verwendet wird. LSTM ist zeitkritisch und in der Lage, Muster und Merkmale in Zeitreihendaten zu identifizieren, was es für Aufgaben wie die Verarbeitung von Signalen und die Vorhersage von Zeitreihen nützlich macht. Um eine genaue Vorhersage und personalisierte Intervention der Krankheit zu erreichen, wird eine Methode vorgeschlagen, die den intelligenten Diagnose- und Behandlungsmodus klinischer Daten auf das Management der Heimrehabilitation von COPD anwendet. Die Forschung kombiniert auf innovative Weise XGBoost und LSTM, um die intelligente Diagnose und den Behandlungsmodus der COPD-Heimrehabilitation zu optimieren. Die Kombination aus beidem kann eine genaue Krankheitsvorhersage erzielen und datengestützte personalisierte Interventionspläne bereitstellen, um das Intelligenzniveau des COPD-Heimrehabilitationsmanagements zu verbessern.

Um die Nützlichkeit des vorgeschlagenen Modells zu gewährleisten, sollten mehrere Parameter und Einschränkungen berücksichtigt werden. Die Methode kann strukturierte klinische Daten (z. B. Lungenfunktionsdaten und Blutsauerstoffdaten) und Fernüberwachungsdaten (z. B. Herzfrequenz, Sauerstoffsättigung, Aktivitätsniveau) erfordern, die regelmäßig von zuverlässigen tragbaren Sensoren oder Heimüberwachungsgeräten erfasst werden. Für ein stabiles Training sollte die Stichprobengröße mindestens 300 Stichproben betragen, und für eine optimale Leistung werden 1000 oder mehr Stichproben bevorzugt. Es gibt auch Rechenanforderungen, insbesondere in Bezug auf das LSTM-Training, die eine ausreichende Rechenleistung oder den Einsatz von Cloud-basierten Bereitstellungslösungen für die Vorhersagefähigkeit erfordern.

COPD ist eine fortschreitende, irreversible Atemwegserkrankung, die durch Abflussbegrenzung, akute Exazerbationen und Beeinträchtigung der Lebensqualität (QoL) gekennzeichnet ist. Sie wirkt sich erheblich auf die Bevölkerung in den Bereichen Gesundheit, Wohlbefinden und Gesundheitsversorgung auf der ganzen Welt aus. Daher sind eine frühzeitige Vorhersage und rechtzeitige Intervention der COPD ein wesentlicher Bestandteil der Begrenzung des pathologischen Fortschreitens der Erkrankung und der Krankenhauseinweisungen5. Es hat sich gezeigt, dass Techniken des maschinellen Lernens (ML) den diagnostischen und prognostischen Weg von COPD mit klinisch relevanten Daten durch fortschrittliche datengestützte Modellierungsansätze verbessern. XGBoost wurde zitiert, um die effektivsten und erfolgreichsten ML-Modelle für unausgeglichene Daten und nichtlineare Wechselwirkungen zwischen klinischen Variablenzu generieren 6. Die berichtete über eine ausgezeichnete Genauigkeit bei der Klassifizierung von Lungenerkrankungen mit XGBoost und Support Vector Machines (SVM) mit elektronischen Nasendaten. Außerdem wurden ML-basierte Vorhersagemodelle entwickelt, um das COPD-Risiko anhand unausgewogener klinischer Daten vorherzusagen, wobei XGBoost zur Verbesserung der Vorhersagezuverlässigkeit empfohlenwurde 7. Darüber hinaus wurde die starke Leistung von XGBoost im Vergleich zu anderen ML-Modellen bei COPD-Klassifikationsaufgaben validiert. Ensemble-Lernen wurde auch effektiv eingesetzt, indem mehrere selbstlernende ML-Modelle für die Identifizierung und Klassifizierung von COPD und die Erkennung von Lungenkrebs verwendet wurden, insbesondere unter Bezugnahme auf die Rolle von XGBoost in diagnostischen Daten der Atemwege8. Zusammenfassend lässt sich sagen, dass die vorangegangenen Untersuchungen die Grundlage für die Verwendung von XGBoost in einer modifizierten Anwendung unter Verwendung von Transformer-LSTM-Funktionen bilden, um ein intelligentes Diagnose- und Behandlungsmodell für Menschen mit COPD-Heimrehabilitation zu erstellen, die Vorhersagegenauigkeit zu erhöhen und die personalisierte Gesundheits- und Pflegeversorgung zu verbessern9.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Diese Studie wurde von der Ethikkommission des Taizhou Cancer Hospital geprüft und genehmigt. Vor der Datenerhebung wurde von allen Teilnehmern eine schriftliche Einverständniserklärung eingeholt, die den institutionellen und nationalen ethischen Standards entspricht. Die verwendeten Reagenzien und die verwendete Software sind in der Materialtabelle aufgeführt.

1. Überblick über den Workflow

Der End-to-End-Workflow für die Verarbeitung strukturierter klinischer Daten mit XGBoost ist in Abbildung 1 dargestellt und umfasst die Erfassung von Funktionen, die Erstellung von Baumstrukturen, Restaktualisierungen, die Regularisierung und die Bewertung. Der Arbeitsablauf für die Vorverarbeitung und Sequenzmodellierung für die Fernüberwachung von Daten mit LSTM ist in Abbildung 2 dargestellt und umfasst 10-minütiges Resampling, Gap-Handling, 7-tägiges nicht überlappendes Windowing, Netzwerkarchitektur und Inferenz.

2. Patientenrekrutierung und Demografie

Die Patienten wurden zwischen März 2023 und Januar 2024 nacheinander aus Ambulanzen und stationären Stationen des Taizhou Cancer Hospital rekrutiert. Einschlusskriterien waren eine gesicherte COPD-Diagnose nach GOLD-Kriterien (FEV1/FVC < 70%), ein stabiler Zustand bei Aufnahme und ein Alter zwischen 40 und 80 Jahren. Zu den Ausschlusskriterien gehörten schwere Komorbiditäten wie Lungenkrebs, unkontrollierte Herz-Kreislauf-Erkrankungen oder kognitive Beeinträchtigungen, die eine Einwilligung nach Aufklärung verhindern. Insgesamt wurden 214 Patienten eingeschlossen (Durchschnittsalter 63,7 ± 8,9 Jahre; 68% männlich; 54% aktuelle oder ehemalige Raucher).

3. Datenerhebung

Zu den klinisch strukturierten Daten gehörten die Lungenfunktion (FEV1, FVC), die Blutsauerstoffsättigung (SpO2), die Dauer des Krankenhausaufenthalts und die Krankheitsdauer. Lungenfunktion und SpO2 wurden in Prozent, der Krankenhausaufenthalt in Tagen und die Krankheitsdauer in Jahren erfasst. Die Daten zur Fernüberwachung wurden mit zertifizierten tragbaren Oximetern und Aktivitätstrackern gesammelt, die nach den Goldstandards der Krankenhäuser validiert wurden: Pulsoximeter wurden mit Masimo Rad-97-Monitoren abgeglichen (mittlerer absoluter Fehler 1,8 % im Bereich von 90-100 % SpO2 ), Herzfrequenzsensoren wurden gegen Elektrokardiographie validiert (mittlerer Fehler 2,3 Schläge pro Minute) und Schrittzähler wurden auf einem Laufbandprotokoll kalibriert. Die Rohdaten wurden als CSV-Dateien mit Zeitstempel in einem Sampling-Intervall von 10 Minuten exportiert.

4. Begründung des Stichprobenumfangs

Schwellenwerte von 300 Trainingsstichproben für XGBoost und ca. 1000 nicht überlappende 7-Tage-Sequenzen für LSTM wurden durch Experimente und Leistungs-/Simulationsanalysen unterstützt. Eine Post-hoc-Power-Analyse mit G*Power (Version 3.1) zeigte, dass 300 Samples >80% Power lieferten, um eine mittlere Effektstärke (Cohens f2 = 0,15) bei α = 0,05 in der logistischen Regression zu detektieren. Simulationen zeigten, dass etwa 1000 Sequenzen für eine stabile Konvergenz der LSTM auf multivariaten physiologischen Zeitreihen notwendig sind. Die empirische Evidenz ist in Tabelle 1 zusammengefasst und in den Abbildungen 3 und 4 visualisiert.

5. Datenvorverarbeitung

Fehlende Einträge, die als Leerzeichen, Sentinel-Werte oder NaN identifiziert wurden, wurden unter Verwendung des Trainingssatzmittelwerts für jedes Merkmal imputiert, um Zielverluste zu vermeiden:

figure-protocol-1(1)

Dabei ist mj die Anzahl der beobachteten Werte für das Merkmal J. Das Gleiche figure-protocol-2 galt für die Validierungs- und Testsets. Um skalenbezogene Verzerrungen zu entfernen, wurden die Merkmale mit einer Z-Score-Normalisierung unter Verwendung von reinen Trainingsparametern standardisiert:

figure-protocol-3(2)

Dabei sind μj und σj der Mittelwert und die Standardabweichung des Merkmals j, die aus den Trainingsdaten geschätzt werden. Für Zeitreihensignale (SpO2, Herzfrequenz, Schritte) wurden die Ströme auf eine Kadenz von 10 Minuten ausgerichtet; Kurze Lücken bis zu 30 Minuten wurden nach vorne gefüllt, und längere Lücken wurden mit einem gleitenden Drei-Punkte-Durchschnitt geglättet. Anschließend wurde ein 7-tägiges gleitendes Fenster mit 1008 Zeitschritten angewendet, um nicht überlappende Sequenzen zu bilden, um Leckagen zu verhindern (siehe Abbildung 2).

6. Modell-Training

Für strukturierte klinische Daten wurde XGBoost über eine Rastersuche über die Lernrate (0,01-0,3), die maximale Tiefe (3-10) und die Anzahl der Schätzer (100-500) unter einem binären logistischen Ziel abgestimmt (Workflow in Abbildung 1). Für Fernüberwachungsdaten bestand das LSTM aus zwei versteckten LSTM-Schichten mit jeweils 128 Einheiten, Xavier-Initialisierung, einer Dropout-Rate von 0,5 und einer Sigmoid-Ausgabeschicht; Bei der Optimierung wurde Adam mit einer Lernrate von 0,001 verwendet, die in TensorFlow implementiert ist (Pipeline in Abbildung 2). Die Überanpassung wurde durch Abbruch und frühes Abbrechen (Geduld = 10) gemildert, und das Klassenungleichgewicht wurde mit SMOTE behoben.

7. Evaluierungsstrategie

Strukturierte Daten wurden mit einer stratifizierten 10-fachen Kreuzvalidierung ausgewertet. Zeitreihendaten wurden mit Walk-Forward-Validierung ausgewertet, um die zeitliche Reihenfolge beizubehalten. Zu den Metriken gehörten Genauigkeit, Präzision, Abruf, F-Maß, Fläche unter der ROC-Kurve (AUC) und mittlerer quadratischer Fehler (). Die Unterschiede zwischen den Modellen wurden mit dem Wilcoxon-Vorzeichen-Rang-Test (beidseitig) bewertet. Die Zahlen beinhalten 95 %-Konfidenzbänder oder Fehlerbalken zur Quantifizierung der Unsicherheit. Diese Entscheidungen gehen direkt auf das Risiko von Zeitreihenlecks und die von den Gutachtern geforderte Notwendigkeit statistischer Signifikanz ein.

8. Klinische Relevanz und Pilotversuche

Das Hybridmodell prognostizierte bei 78 % der überwachten Patienten einen Rückgang vonSpO 2 6-12 Stunden vor der klinischen Manifestation und reduzierte die um 42,5 % im Vergleich zum Ausgangswert. In einem vierwöchigen Pilotprojekt mit 20 COPD-Patienten stimmten die wöchentlichen Modellrisiko-Scores in 85 % der Überprüfungen mit den Einschätzungen der Ärzte überein, was das Potenzial für eine klinische Integration unterstützt.

9. Software und Umwelt

Die Analysen wurden in Python 3.10.6 mit scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 und PyTorch 1.13 auf Ubuntu 20.04 LTS mit einer NVIDIA RTX 3080 GPU, CUDA 11.6 und cuDNN 8.2 durchgeführt. Die vollständige Versionierung und die Lieferanten sind in der nicht nummerierten Materialtabelle aufgeführt.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Stabilität der Stichprobengröße und optimale Leistung
Um die Stabilitätsschwelle explizit zu veranschaulichen, stellen wir zunächst Tabelle 1 vor, gefolgt von Lernkurven in Abbildung 3 und Abbildung 4. Tabelle 1 zeigt den mittleren ± SD von Genauigkeit, AUC und über zunehmende Trainingsgrößen für den XGBoost-Klassifikator für strukturierte Daten und für den LSTM für multivariate Zeitreihen. W...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Zusammenfassung der wichtigsten Ergebnisse
COPD stellt eine erhebliche klinische und gesellschaftliche Belastung durch Atemstörungen, eingeschränkte Mobilität und wiederkehrende akute Exazerbationen dar10. Die Nutzung einer kontinuierlichen Heimüberwachung mit erklärbaren Analysen kann diese Belastung verringern, indem eine frühere Erkennung und gezielte Intervention ermöglicht wird. In dieser Studie erzielte ein hybrider Workflow, der XGBoost ...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren haben nichts offenzulegen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
CUDANVIDIA11.6Eine parallele Computing-Plattform und ein Programmiermodell, das zur Beschleunigung von Berechnungen auf GPUs verwendet wird.
cuDNNNVIDIA8.2Eine GPU-beschleunigte Bibliothek für tiefe neuronale Netze zur Optimierung der Modelltrainingsleistung.
EKG-GerätPhilipsPageWriter TC70Wird verwendet, um Herzfrequenzmessungen vom tragbaren Gerät zu validieren.
GPUNVIDIARTX 3080Hochleistungs-GPU zur Beschleunigung des Modelltrainings für große Datensätze.
LSTM-Modell--Neuronales Netzwerk mit langem Kurzzeitgedächtnis, das für die Verarbeitung von Zeitreihendaten verwendet wird.
PulsoximeterMasimoRad-97Wird verwendet, um die Blutsauerstoffsättigung (SpO2) zu messen und die Genauigkeit des tragbaren Geräts zu validieren.
PythonPython-Software-Stiftung3.10.6Programmiersprache, die für die Datenverarbeitung, das Modelltraining und die Auswertung verwendet wird.
TensorFlowGoogeln2.13Softwarebibliothek, die zum Trainieren des LSTM-Modells und zum Durchführen von Berechnungen neuronaler Netze verwendet wird.
Tragbarer AktivitätstrackerFitbit (Englisch)Ladung 5Wird zur Verfolgung von Schritten und körperlicher Aktivität verwendet.
XGBoost--Softwarebibliothek, die für das Gradient Boosting (maschinelles Lernen) verwendet wird.

Referenzen

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Schlagwörter

XGBoost AlgorithmusLong Short Term MemoryCOPD ManagementberwachungsindikatorenGenauigkeit der Datenverarbeitungpr diktive Modellierung