Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Inteligentny model diagnostyki i leczenia oparty na danych klinicznych do prowadzenia rehabilitacji domowej w przewlekłej obturacyjnej chorobie płuc

529 wyświetleń

DOI:

10.3791/69024

24 października 2025

W tym artykule

Podsumowanie

Model oparty na danych klinicznych łączący XGBoost i LSTM usprawnia rehabilitację domową w przypadku POChP, poprawiając dokładność danych i predykcję. Osiąga 98% dokładności i 42,5% poprawę wskaźników, eliminując ograniczenia tradycyjnego leczenia szpitalnego.

Streszczenie

Tradycyjne wewnątrzszpitalne leczenie rehabilitacyjne przewlekłej obturacyjnej choroby płuc (POChP) wiąże się z takimi problemami, jak brak zasobów, wysokie koszty i niewygodny transport. Aby zwiększyć wygodę leczenia rehabilitacyjnego POChP, zaproponowano inteligentny model diagnostyki i leczenia oparty na danych klinicznych do leczenia POChP w domu. Inteligentny model diagnostyki i leczenia domowej rehabilitacji POChP jest optymalizowany poprzez połączenie algorytmu XGBoost i sieci długiej pamięci krótkotrwałej. Wyniki wskazują, że algorytm XGBoost ma najwyższą dokładność w przetwarzaniu klinicznych danych strukturalnych, podczas gdy algorytm lasu losowego (RF) ma najniższą dokładność w przetwarzaniu klinicznych danych strukturalnych. Gdy liczba próbek treningowych wynosi 300, wskaźniki dokładności wynoszą odpowiednio 98% i 83%. Integracja algorytmu XGBoost i sieci pamięci długotrwałej jest wykorzystywana do przetwarzania wskaźników monitorowania, co skutkuje najwyższym wskaźnikiem poprawy i najmniejszym błędem średniokwadratowym. Gdy wielkość próby wynosi 1000, wskaźnik poprawy wskaźników monitorowania wynosi 42,5%, a błąd średniokwadratowy wynosi 0,041. Zaproponowana w badaniu metoda może skutecznie przetwarzać dane kliniczne, poprawiać dokładność przetwarzania danych i dokładnie przewidywać przyszłe zmiany w POChP.

Wprowadzenie

POChP jest powszechną chorobą przewlekłą charakteryzującą się wysoką niepełnosprawnością i śmiertelnością, która znacząco wpływa na standard życia pacjentów. Tradycyjny model zarządzania rehabilitacją wiąże się z takimi problemami, jak opóźnienia informacyjne i przedwczesna interwencja w radzeniu sobie z POChP. Jednak wraz z postępem technologicznym niektóre nowe technologie, takie jak algorytm Extreme Gradient Boosting (XGBoost), przyniosły nowe możliwości leczenia POChP1. Chociaż XGBoost wykazał możliwość zastosowania w różnych kontekstach monitorowania zdrowia, w tym w medycynie sportowej, to badanie w szczególności wykorzystuje jego mocne strony w leczeniu POChP w warunkach rehabilitacji domowej. Nadal koncentrujemy się na zwiększeniu dokładności predykcyjnej i spersonalizowanej opiece nad pacjentami z POChP przy użyciu danych klinicznych i zdalnego monitorowania2. Na przykład, zbierając wskaźniki fizjologiczne, takie jak tętno, częstość oddechów itp., połączenie to nie tylko pomaga w leczeniu pacjentów z POChP, ale także oferuje świeże perspektywy i podejścia do zarządzania zdrowiem3. XGBoost to wydajny algorytm drzewa decyzyjnego zwiększający gradient (GB). XGBoost wykorzystuje techniki obliczeń równoległych i buforowania, aby trenowanie było szybsze i było w stanie obsłużyć administrowanie dużymi bazami danych i skomplikowanymi charakterystykami. Ponadto dobrze radzi sobie z obsługą różnych typów zbiorów danych, z doskonałą zdolnością uogólniania4. Pamięć długotrwała (LSTM) to specjalna struktura RNN powszechnie używana do przetwarzania i uczenia się danych szeregów czasowych. LSTM jest wrażliwy na czas i jest w stanie identyfikować wzorce i cechy w danych szeregów czasowych, co czyni go przydatnym do zadań, takich jak przetwarzanie sygnałów i przewidywanie szeregów czasowych. Aby uzyskać dokładne przewidywanie i spersonalizowaną interwencję w chorobie, zaproponowano metodę zastosowania inteligentnego trybu diagnozowania i leczenia danych klinicznych do leczenia POChP w domu. Badania w innowacyjny sposób łączą XGBoost i LSTM w celu optymalizacji inteligentnej diagnostyki i trybu leczenia domowej rehabilitacji POChP. Połączenie tych dwóch metod może zapewnić dokładne przewidywanie choroby i zapewnić spersonalizowane plany interwencji oparte na danych w celu zwiększenia poziomu inteligencji w leczeniu domowej rehabilitacji POChP.

Aby zagwarantować przydatność proponowanego modelu, należy wziąć pod uwagę kilka parametrów i ograniczeń. Metoda może wymagać ustrukturyzowanych danych klinicznych (np. danych dotyczących czynności płuc i tlenu we krwi) oraz danych ze zdalnego monitorowania (np. tętna, saturacji tlenem, poziomów aktywności) zbieranych okresowo z niezawodnych czujników noszonych na ciele lub urządzeń do monitorowania w domu. Aby zapewnić stabilny trening, wielkość próby powinna wynosić co najmniej 300 próbek, a dla optymalnej wydajności preferowane jest posiadanie 1000 lub więcej próbek. Istnieją również potrzeby obliczeniowe, szczególnie w zakresie szkolenia LSTM, które wymagają wystarczającej mocy obliczeniowej lub wykorzystania rozwiązań wdrożeniowych opartych na chmurze w celu przewidywania.

POChP jest postępującą, nieodwracalną chorobą układu oddechowego charakteryzującą się ograniczeniem odpływu, ostrymi zaostrzeniami i pogorszeniem jakości życia (QoL). Ma znaczący wpływ na populacje w systemach zdrowia, dobrego samopoczucia i opieki zdrowotnej na całym świecie; w związku z tym wczesne przewidywanie i szybka interwencja POChP są integralną częścią ograniczania progresji choroby patologicznej i przyjęć do szpitala5. Wykazano, że techniki uczenia maszynowego (ML) usprawniają ścieżkę diagnostyczną i prognostyczną, dostarczając klinicznie istotnych danych dzięki zaawansowanym podejściom do modelowania opartego na danych. XGBoost został wymieniony w celu wygenerowania najbardziej efektywnych i udanych modeli uczenia maszynowego dla niezrównoważonych danych i nieliniowych interakcji między zmiennymi klinicznymi6. Zgłoszono doskonałą dokładność klasyfikacji chorób płuc za pomocą XGBoost i maszyn wektorów nośnych (SVM) z elektronicznymi danymi z nosa. Ponadto skonstruowano modele predykcyjne oparte na uczeniu maszynowym w celu przewidywania ryzyka POChP na podstawie niezrównoważonych danych klinicznych, zalecając XGBoost w celu poprawy niezawodności predykcyjnej7. Ponadto potwierdzono wysoką wydajność XGBoost wśród innych modeli ML w zadaniach klasyfikacji POChP. Uczenie zespołowe zostało również skutecznie wykorzystane przy użyciu wielu samouczących się modeli uczenia maszynowego do identyfikacji i klasyfikacji POChP oraz wykrywania raka płuc, w szczególności odnosząc się do roli XGBoost w danych diagnostycznych układu oddechowego8. Podsumowując, powyższe badania stanowią podstawę do wykorzystania XGBoost w zmodyfikowanej aplikacji wykorzystującej możliwości transformatora LSTM do skonstruowania inteligentnego modelu diagnozy i leczenia dla osób żyjących z POChP w domu, w celu zwiększenia dokładności przewidywania i lepszego spersonalizowanego świadczenia opieki zdrowotnej i opieki9.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Badanie to zostało ocenione i zatwierdzone przez Komisję Etyczną Szpitala Onkologicznego w Taizhou. Przed zebraniem danych uzyskano pisemną świadomą zgodę od wszystkich uczestników, zgodnie z instytucjonalnymi i krajowymi standardami etycznymi. Stosowane odczynniki i oprogramowanie są wymienione w Tabeli materiałów.

1. Przegląd przepływu pracy

Kompleksowy przepływ pracy przetwarzania ustrukturyzowanych danych klinicznych za pomocą XGBoost jest pokazany na rysunku 1 i obejmuje pozyskiwanie funkcji, konstrukcję drzewa, aktualizacje szczątkowe, regularyzację i ocenę. Przepływ pracy wstępnego przetwarzania i modelowania sekwencyjnego dla danych zdalnego monitorowania za pomocą LSTM pokazano na rysunku 2, obejmującym 10-minutowe ponowne próbkowanie, obsługę luk, 7-dniowe nienakładające się okna, architekturę sieci i wnioskowanie.

2. Rekrutacja pacjentów i dane demograficzne

Pacjenci byli rekrutowani kolejno z przychodni i oddziałów stacjonarnych w Taizhou Cancer Hospital w okresie od marca 2023 r. do stycznia 2024 r. Kryteriami włączenia były: potwierdzone rozpoznanie POChP zgodnie z kryteriami GOLD (FEV1/FVC < 70%), stabilny stan w momencie włączenia do badania oraz wiek od 40 do 80 lat. Kryteria wykluczenia obejmowały ciężkie choroby współistniejące, takie jak rak płuc, niekontrolowane choroby układu krążenia lub upośledzenie funkcji poznawczych uniemożliwiające świadomą zgodę. Do badania włączono łącznie 214 pacjentów (średnia wieku 63,7 ± 8,9 lat; 68% mężczyzn; 54% obecnych lub byłych palaczy).

3. Gromadzenie danych

Ustrukturyzowane dane kliniczne obejmowały czynność płuc (FEV1, FVC), wysycenie krwi tlenem (SpO2), długość pobytu w szpitalu i czas trwania choroby. Czynność płuc i SpO2 były rejestrowane w procentach, pobyt w szpitalu w dniach, a czas trwania choroby w latach. Dane ze zdalnego monitorowania zostały zebrane za pomocą certyfikowanych pulsoksymetrów noszonych na ciele i monitorów aktywności zweryfikowanych zgodnie ze szpitalnymi złotymi standardami: pulsoksymetry zostały sprawdzone krzyżowo z monitorami Masimo Rad-97 (średni błąd bezwzględny 1,8% w zakresie 90-100% SpO2 ), czujniki tętna zostały zweryfikowane pod kątem elektrokardiografii (średni błąd 2,3 bpm), a liczniki kroków zostały skalibrowane na protokole bieżni. Nieprzetworzone dane zostały wyeksportowane jako pliki CSV ze znacznikiem czasu w 10-minutowym interwale próbkowania.

4. Uzasadnienie wielkości próby

Progi 300 próbek treningowych dla XGBoost i około 1000 nienakładających się 7-dniowych sekwencji dla LSTM zostały poparte eksperymentami i analizami mocy/symulacji. Analiza mocy post hoc przy użyciu G*Power (wersja 3.1) wykazała, że 300 próbek dostarczyło >80% mocy do wykrycia średniej wielkości efektu (f2 Cohena = 0,15) przy α = 0,05 w regresji logistycznej. Symulacje wykazały, że około 1000 sekwencji było niezbędnych do stabilnej zbieżności LSTM w wielowymiarowych fizjologicznych szeregach czasowych. Dowody empiryczne podsumowano w tabeli 1 i zwizualizowano na rysunkach 3 i 4.

5. Wstępne przetwarzanie danych

Brakujące wpisy, zidentyfikowane jako puste miejsca, wartości wskaźnikowe lub NaN, zostały przypisane przy użyciu średniej zestawu treningowego dla każdej funkcji, aby uniknąć wycieku celu:

figure-protocol-1     (1)

gdzie mj jest liczbą obserwowanych wartości dla cechy j. To samo figure-protocol-2 dotyczyło zestawów walidacyjnych i testowych. Aby usunąć odchylenie związane ze skalą, funkcje zostały ustandaryzowane z normalizacją wskaźnika z przy użyciu parametrów tylko do trenowania:

figure-protocol-3     (2)

gdzie μj i σj są średnią i odchyleniem standardowym cechy j oszacowanymi na podstawie danych treningowych. W przypadku sygnałów szeregów czasowych (SpO2, tętno, kroki) strumienie zostały wyrównane do 10-minutowej kadencji; Krótkie luki do 30 minut były wypełniane do przodu, a dłuższe luki były wygładzane trzypunktową średnią kroczącą. Następnie zastosowano 7-dniowe okno przesuwne z 1008 krokami czasowymi, aby utworzyć nienakładające się sekwencje, aby zapobiec wyciekom (patrz rysunek 2).

6. Trening modelowy

W przypadku ustrukturyzowanych danych klinicznych XGBoost został dostrojony za pomocą wyszukiwania w siatce pod kątem szybkości uczenia się (0,01-0,3), maksymalnej głębokości (3-10) i liczby estymatorów (100-500) w ramach binarnego celu logistycznego (przepływ pracy na rysunku 1). W przypadku danych zdalnego monitorowania LSTM składał się z dwóch ukrytych warstw LSTM po 128 jednostek każda, inicjalizacji Xavier, współczynnika zaniku 0,5 i warstwy wyjściowej sigmoidalnej; optymalizacja używana przez Adama ze współczynnikiem uczenia się 0,001 zaimplementowanym w TensorFlow (potok na rysunku 2). Nadmierne dopasowanie zostało złagodzone poprzez rezygnację i wczesne zatrzymanie (cierpliwość = 10), a nierównowaga klas została naprawiona za pomocą SMOTE.

7. Strategia oceny

Dane ustrukturyzowane zostały ocenione za pomocą warstwowej 10-krotnej walidacji krzyżowej. Dane szeregów czasowych zostały ocenione z walidacją przejścia do przodu w celu zachowania porządku czasowego. Metryki obejmowały dokładność, precyzję, kompletność, miarę F, pole pod krzywą ROC (AUC) i błąd średniokwadratowy (MSE). Różnice między modelami oceniano za pomocą testu rang ze znakiem Wilcoxona (dwustronnego). Dane liczbowe obejmują 95% przedziały ufności lub słupki błędów w celu ilościowego określenia niepewności. Wybory te bezpośrednio odnoszą się do ryzyka wycieku szeregów czasowych i potrzeby istotności statystycznej wymaganej przez recenzentów.

8. Znaczenie kliniczne i badania pilotażowe

Model hybrydowy przewidywał spadek SpO2 na 6-12 godzin przed wystąpieniem objawów klinicznych u 78% monitorowanych pacjentów i zmniejszył MSE o 42,5% w stosunku do wartości wyjściowych. W czterotygodniowym programie pilotażowym z udziałem 20 pacjentów z POChP, tygodniowe modelowe oceny ryzyka zgadzały się z ocenami lekarzy w 85% przeglądów, co potwierdza potencjał integracji klinicznej.

9. Oprogramowanie i środowisko

Analizy przeprowadzono w Pythonie 3.10.6 z scikit-learn 1.2.2, XGBoost 1.7.5, TensorFlow 2.13 i PyTorch 1.13 na Ubuntu 20.04 LTS z procesorem graficznym NVIDIA RTX 3080, CUDA 11.6 i cuDNN 8.2. Pełne wersje i dostawcy są wymienieni w nienumerowanym Tabeli materiałów.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Stabilność wielkości próbki i optymalna wydajność
Aby jednoznacznie zademonstrować próg stabilności, najpierw przedstawiamy tabelę 1, a następnie krzywe uczenia się na rys. 3 i rys. 4. Tabela 1 przedstawia średnią ± SD dokładności, AUC i MSE przy rosnących rozmiarach trenowania dla klasyfikatora XGBoost na danych ustrukturyzowanych i dla LSTM dla wielowymiarowych szeregów czasowych. Jak

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Streszczenie głównych ustaleń
POChP stanowi znaczne obciążenie kliniczne i społeczne poprzez zaburzenia oddychania, ograniczoną ruchomość i nawracające ostre zaostrzenia10. Wykorzystanie ciągłego monitorowania domu z wytłumaczalną analizą może złagodzić to obciążenie, umożliwiając wcześniejsze wykrywanie i ukierunkowaną interwencję. W tym badaniu hybrydowy przepływ pracy integrujący XGBoost dla ustrukturyzowanych zmiennych klinicznych i LSTM dla wielowymiarowych sygnałów szer...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CUDA (Międzynarodowa Organizacja TTechnologia NVIDIA11.6Równoległa platforma obliczeniowa i model programowania służący do przyspieszenia obliczeń na procesorach graficznych.
cuDNN powiedział:Technologia NVIDIA8.2Akcelerowana przez procesor GPU biblioteka dla głębokich sieci neuronowych w celu optymalizacji wydajności trenowania modelu.
Aparat EKGPhilipsEdytor stron TC70Służy do sprawdzania poprawności pomiarów tętna z urządzenia ubieralnego.
GPUTechnologia NVIDIAKarta graficzna RTX 3080Procesor GPU o wysokiej wydajności używany do przyspieszania trenowania modelu na dużych zestawach danych.
LSTM Model--Sieć neuronowa Long Short-Term Memory używana do przetwarzania danych szeregów czasowych.
PulsoksymetrMasimoSamolot Rad-97Służy do pomiaru nasycenia krwi tlenem (SpO2) i walidacji dokładności urządzenia ubieralnego.
PytonFundacja oprogramowania Python3.10.6Język programowania używany do przetwarzania danych, trenowania modelu i oceny.
Technologia TensorFlowWyszukiwarka Google2.13Biblioteka oprogramowania służąca do trenowania modelu LSTM i wykonywania obliczeń sieci neuronowych.
Monitor aktywności do noszeniaFitbit (Język angielski)Opłata 5Służy do śledzenia kroków i poziomów aktywności fizycznej.
XGBoost powiedział:--Biblioteka oprogramowania służąca do zwiększania gradientu (uczenie maszynowe).

Bibliografia

  1. Stolz, D., et al. Towards the elimination of chronic obstructive pulmonary disease: A Lancet Commission. Lancet. 400 (10356), 921-972 (2022).
  2. Adeloye, D., et al. Global, regional, and national prevalence of, and risk factors for, chronic obstructive pulmonary disease (COPD) in 2019: A systematic review and modelling analysis. Lancet Respir Med. 10 (5), 447-458 (2022).
  3. Asselman, A., Khaldi, M., Aammou, S. Enhancing the prediction of student performance based on the machine learning XGBoost algorithm. Interact Learn Environ. 31 (6), 3360-3379 (2023).
  4. Deng, Y., Lumley, T. Multiple imputation through xgboost. J Comput Graph Stat. 33 (2), 352-363 (2024).
  5. Binson, V. A., Subramoniam, M., Sunny, Y., Mathew, L. Prediction of pulmonary diseases with electronic nose using SVM and XGBoost. IEEE Sens J. 21 (18), 20886-20895 (2021).
  6. Wang, X., et al. Machine learning-enabled risk prediction of chronic obstructive pulmonary disease with un-balanced data. Comput Methods Programs Biomed. 230, 107340(2023).
  7. Non-invasive diagnosis of COPD with E-nose using XGBoost algorithm. Binson, V. A., et al. Proc Int Conf Adv Comput Commun Embedded Secure Syst, , 297-301 (2021).
  8. Feng, Y., et al. Predicting chronic obstructive pulmonary disease (COPD) with optimized machine learning via leveraging comparative analysis of XGBoost and CatBoost. J Ambient Intell Humaniz Comput. 16 (4), 613-627 (2025).
  9. Binson, V. A., Subramoniam, M., Mathew, L. Detection of COPD and lung cancer with electronic nose using ensemble learning methods. Clin Chim Acta. 523, 231-238 (2021).
  10. Boers, E., et al. Forecasting the global economic and health burden of COPD from 2025 through 2050. Chest J. , (2025).
  11. Lones, M. A. Avoiding common machine learning pitfalls. Patterns (N Y). 5 (10), 101046(2024).
  12. Patharkar, A., Cai, F., Al-Hindawi, F., Wu, T. Predictive modeling of biomedical temporal data in healthcare applications: Review and future directions. Front Physiol. 15, 1386760(2024).
  13. Prater, R., Hanne, T., Dornberger, R. Generalized performance of LSTM in time-series forecasting. Appl Artif Intell. 38 (1), 2377510(2024).
  14. Lima Marinho, T., do Nascimento, D. C., Pimentel, B. A. Optimization on selecting XGBoost hyperparameters using meta-learning. Expert Syst. 41 (9), e13611(2024).
  15. Jang, Y. Feature-based ensemble modeling for addressing diabetes data imbalance using the SMOTE, RUS, and random forest methods: A prediction study. Ewha Med J. 48 (2), e32(2025).
  16. Tian, H., Yuan, H., Yan, K., Guo, J. A cosine adaptive particle swarm optimization based long-short term memory method for urban green area prediction. PeerJ Comput Sci. 10, e2048(2024).
  17. Johnston, H., Nair, N., Du, D. Estimating calibrated risks using focal loss and gradient-boosted trees for clinical risk prediction. Electronics (Basel). 14 (9), 1838(2025).
  18. Del Chicca, S., et al. Wearable and thermal drift-compensated monitoring system based on fiber bragg grating sensors for a 3D-printed foot prosthesis. Sensors (Basel). 25 (3), 885(2025).
  19. Wu, X., et al. Optimizing recurrent neural networks: A study on gradient normalization of weights for enhanced training efficiency. Appl Sci (Basel). 14 (15), 6578(2024).
  20. Agarwal, M., Anand, S., Patro, M., Gothi, D. Early versus non-early desaturation during 6MWT in COPD patients: A follow-up study. Lung India. 40 (3), 235-241 (2023).
  21. Thölke, P., et al. Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data. Neuroimage. 277, 120253(2023).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Algorytm XGBoostd uga kr tkotrwa a pami LSTMleczenie POChPwska niki monitorowaniadok adno przetwarzania danychmodelowanie predykcyjne