Artykuł badawczy

Poprawa prognozowania chorób serca poprzez klastry wizualizowane paradygmaty rozproszonego uczenia maszynowego dla bezpiecznej opieki zdrowotnej

DOI:

10.3791/69857

7 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie opracowuje skalowalną ramę przewidywania chorób serca przy użyciu technologii Hadoop MapReduce oraz klastrowania K-Means. Dostosowywanie progów klasyfikacji wpływa na czułość wykrywania. CViHDKNN poprawia wykrywanie prawdziwych dodatnich przypadków, kontrolując wyniki fałszywie dodatnie, podczas gdy CViHDDT zmniejsza wyniki fałszywie dodatnie, ale może pominąć niektóre przypadki chorób serca.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Choroby serca pozostają jedną z głównych przyczyn zgonów na całym świecie, co stwarza pilną potrzebę dokładnych i skalowalnych systemów predykcyjnych, które umożliwiają wczesne rozpoznanie i terminowe ingerencje kliniczne. Tradycyjne podejścia do uczenia maszynowego często mają trudności z wydajnym przetwarzaniem dużych zestawów danych medycznych i brak interpretowalności, co ogranicza ich przydatność do wspierania podejmowania decyzji klinicznych. Aby sprostać tym wyzwaniom, w niniejszym badaniu zaproponowano klastrowy sklastryzowany rozproszony uczenie maszynowe framework do przewidywania chorób serca. Framework zawiera dwa rozproszone algorytmy: Klastrowy Sklastryzowany Hadoop Rozproszony Drzewo Decyzyjne (CViHDDT) i Klastrowy Sklastryzowany Hadoop Rozproszone K-Najbliższych Sąsiadów (CViHDKNN). Zaproponowane modele wykorzystują framework MapReduce Hadoop do rozproszonego obliczania na dużych zbiorach danych, integrując jednocześnie klasteryzację K-Means dla lepszej organizacji danych i wizualizacji. Ta klastrowo oparta wizualizacja poprawia interpretowalność, umożliwiając lekarzom lepsze zrozumienie relacji między czynnikami ryzyka pacjentów a wynikami predykcji. Ocena eksperymentalna przeprowadzona została za pomocą zbioru danych UCI Heart Disease w środowisku rozproszonym opartym na Hadoop. Wyniki pokazują, że CViHDKNN osiągnął lepszą wydajność predykcyjną, osiągając 85,25% dokładności i 88% odzysku, przewyższając model CViHDDT, który osiągnął 80,33% dokładności. Dostosowanie wartości progów klasyfikacji wpłynęło również na czułość i współczynnik wykrywania: niższe progi poprawiały wykrywanie prawdziwych dodatnich, zachowując akceptowalne poziomy fałszywie dodatnich. Te wyniki pokazują, że klasteryzacja poprawiająca rozproszone uczenie poprawia skalowalność, dokładność predykcyjną i interpretowalność kliniczną w przewidywaniu chorób serca.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Choroby serca są jedną z głównych przyczyn zgonów na świecie i stanowią poważne wyzwanie dla zdrowia publicznego. Wzrastająca częstość występowania chorób układu krążenia podkreśla pilną potrzebę zaawansowanych modeli diagnostycznych, które wspierają wczesne wykrywanie i leczenie. Tradycyjne podejścia diagnostyczne opierają się w dużej mierze na ewaluacji manualnej i osądach klinicznych, które często mają trudności z efektywnym zarządzaniem dużymi ilościami danych medycznych. Ostatnio sztuczne inteligencje (AI) i techniki uczenia maszynowego (ML) odegrały ważną rolę w analityce przewidywania opieki zdrowotnej, umożliwiając predykcje chorób oparte na danych i poprawę dokładności oceny ryzyka w systemach medycznych1,2.

Konwencjonalne metody diagnostyczne i systemy decyzyjne oparte na zasadach często cierpią na ograniczoną skalowalność i niższą precyzję, gdy są stosowane do złożonych zestawów danych medycznych. Chociaż techniki uczenia maszynowego poprawiły wydajność predykcji, wiele modeli nadal staje przed wyzwaniami w przetwarzaniu dużych danych medycznych i utrzymywaniu interpretowalności dla podejmowania decyzji klinicznych. Modele głębokiego uczenia mogą osiągać wysoką dokładność predykcji, ale często funkcjonują jako systemy “czarnej skrzynki”, co sprawia, że dla profesjonalistów opieki zdrowotnej trudno jest zrozumieć założenia za przewidywaniami3,4,5. Ta brak przejrzystości ogranicza ich przyjęcie w środowiskach klinicznych, gdzie wyjaśnialność jest istotna6,7,8,9,10.

Aby przezwyciężyć te wyzwania, coraz częściej stosuje się rozproszone ramy obliczeniowe, takie jak Hadoop, do analityki opieki zdrowotnej na dużą skalę. Rozproszona architektura Hadoop’u umożliwia równoległe przetwarzanie dużych zestawów danych za pomocą Systemu Plików Hadoop Distributed File System (HDFS) i MapReduce, poprawiając wydajność obliczeniową i skalowalność w analizie danych medycznych. Jednak rozproszone modele uczenia maszynowego nadal wymagają mechanizmów, które zwiększają interpretowalność i przejrzystość. Integracja technik klastrowania i wizualizacji może pomóc w ujawnieniu ukrytych wzorców w danych pacjentów i wesprzeć klinicystów w bardziej efektywnym rozumieniu wyników predykcyjnych11,12,13,14,15,16.

Kilka badaczy zbadała rozproszone techniki uczenia maszynowego w przewidywaniu chorób serca przy użyciu algorytmów takich jak drzewa decyzyjne i K-Najbliższych Sąsiadów (KNN). Modele rozproszonych drzew decyzyjnych (HDDT) implementowane na ramach Hadoopa wykazały poprawioną skalowalność i dokładność klasyfikacji w porównaniu z tradycyjnymi podejściami do drzew decyzyjnych17,18,19,20,21,22,23. Podobnie metody Hadoop Distributed KNN (HDKNN) wykorzystują przetwarzanie równoległe w celu poprawy wydajności klasyfikacji dużych, wielowymiarowych zestawów danych medycznych24,25,26. Jednak te modele często brakuje silnej interpretowalności i mechanizmów wizualizacji, które są niezbędne do efektywnej decyzji klinicznej i rozumienia profili ryzyka pacjentów. Pomimo tych postępów, istniejące rozproszone modele nadal nie mają zintegrowanych mechanizmów interpretowalności i wizualnego zrozumienia wzorców ryzyka pacjentów.

Aby przeciwdziałać tym ograniczeniom, niniejsze badanie proponuje ramy rozproszonego uczenia maszynowego z wizualizacja klastrów (CVDML) do przewidywania chorób serca. Ramy wprowadzają dwa rozproszone modele predykcyjne: Rozproszone Drzewo Decyzji z Wizualizacja Klastrów (CViHDDT) oraz Rozproszone K-Najbliższych Sąsiadów z Wizualizacja Klastrów (CViHDKNN). CViHDDT stosuje rozproszone konstruowanie drzew decyzyjnych, aby zoptymalizować selekcję cech medycznych, takich jak objawy i wcześniejsza historia medyczna, podczas gdy CViHDKNN implementuje rozproszoną, paralelizowaną metodę KNN do klasyfikacji pacjentów na podstawie podobnych cech medycznych. Integracja technik klastrowania i wizualizacji poprawia wydajność klasyfikacji i zwiększa interpretowalność poprzez grupowanie pacjentów o podobnych wzorcach chorób.

Głównym celem tego badania jest opracowanie skalowalnego i interpretowalnego rozproszonego frameworku uczenia maszynowego do dokładnego przewidywania chorób serca przy użyciu dużych zestawów danych medycznych. Kluczowe wkłady tego badania obejmują: (1) Opracowanie frameworku uczenia maszynowego opartego na Hadoopie, zdolnego do efektywnego przetwarzania dużych zestawów danych zdrowotnych. (2) Integra

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Uzyskiwanie danych

Zestaw danych UCI Heart Disease to szeroko stosowany zestaw danych w badaniach medycznych i nauce maszynowym do przewidywania chorób serca. Zawiera różne kliniczne i diagnostyczne cechy pacjentów, umożliwiając specjalistom medycznym i badaczom opracowanie modeli predykcyjnych opartych na danych. Zestaw danych klasyfikuje osoby jako prawdopodobne lub mało prawdopodobne na chorobę serca na podstawie kilku atrybutów pacjenta, w tym wieku, płci, rodzaju bólu w klatce piersiowej, ciśnienia krwi, poziomu cholesterolu i wyników elektrokardiogramu (https://archive.ics.uci.edu/dataset/45/heart+disease)29. Ogólny przepływ proponowanego działania przewidywania choroby serca, w tym przetwarzanie danych, wdrożenie rozproszonego modelu i etapy oceny, przedstawiono na Rysunku 1.

Konfiguracja środowiska eksperymentalnego

Środowisko eksperymentalne zostało wdrożone na Apache Hadoop 3.x jako podstawowa infrastruktura obliczeniowa rozproszona dla wszystkich implementacji. Klaster korzystał z architektury master-worker z jednym dedykowanym węzłem master i wieloma węzłami worker. Węzeł master zarządzał harmonogramem zadań, alokacją zasobów i koordynacją klastra za pomocą YARN (Yet Another Resource Negotiator), podczas gdy węzły worker wykonywały zadania obliczeniowe rozproszone równolegle, aby efektywnie przetwarzać duże zbiory danych medycznych. Każdy węzeł w klastrze został zaopatrzony w procesory Intel Core i7 (lub odpowiednik), 16–32 GB pamięci RAM i około 1 TB pamięci masowej.

Wprowadzanie danych do HDFS

Przechowywanie zestawu danych

Eksperymentalny zestaw danych był przechowywany w HDFS w formacie rozproszonym na bloki, przy czym zmienna docelowa wskazująca obecność lub brak choroby serca była oddzielona od niezależnego zestawu cech przed przechowywaniem na węzłach klastra. Przetwarzanie specyficzne dla cech zostało zastosowane do wszystkich przechowywanych bloków danych za pomocą przepływów pracy MapReduce. Cechy numeryczne, w tym wiek, ciśnienie krwi, poziom cholesterolu i tętno, zostały znormalizowane za pomocą skalera opartego na odstępie międzykwartylowym, zmniejszając wpływ wartości ekstremalnych, które są szczególnie powszechne w zbiorach danych medycznych, gdzie wartości skrajne mogą reprezentować rzadkie lub poważne stany kliniczne. Zmienne kategoryczne z więcej niż dwoma kategoriami, takie jak cp, restecg i thal, zostały przekształcone za pomocą kodowania one-hot, zamieniając atrybuty kategoryczne na binarne reprezentacje numeryczne zgodne z wejściami algorytmów uczenia maszynowego30,31,32. Wszystkie operacje przetwarzania wstępnego były wykonywane jako rozproszone zadania MapReduce na blokach danych HDFS, zapewniając jednolite zastosowanie pełnego potoku bez centralizowania surowych danych w żadnym pojedynczym punkcie.

Rozdzielenie na węzły

Zestaw danych został podzielony na zbiory treningowe i testowe przy użyciu podziału 80:20, z 80% przydzieloną do treningu i 20% zarezerwowaną na ewaluację na niewidzianych danych. Ta metoda podziału była spójnie stosowana na wszystkich rozproszonych węzłach worker, aby zapewnić, że każdy węzeł przetwarzał proporcjonalną i reprezentatywną część pełnego zestawu danych, zapobiegając zniekształceniu danych i wspierając zrównoważoną generalizację modelu. Skalowanie zapewniało, że wszystkie zmienne numeryczne współpracowały równo w trakcie rozproszonego treningu, zapobiegając dominacji procesu uczenia przez cechy o większych wartościach w całym klastrze. Ta strukturalna strategia podziału zwiększyła niezawodność predykcyjną i pomogła zapobiec przetrenowaniu, utrzymując jasną separację między danymi treningowymi a ewaluacyjnymi w całym rozproszonym klastrze.

Przetwarzanie wstępne danych

Obsługa brakujących wartości

Zestawy danych medycznych często zawierają niekompletne zapisy z powodu błędów wprowadzania danych, awarii urządzeń lub braku odpowiedzi pacjenta podczas zbierania danych klinicznych. Przed treningiem modelu wszystkie atrybuty zestawu danych zostały sprawdzone pod kątem brakujących lub pustych wartości. Wiersze z brakującymi wartościami w krytycznych cechach klinicznych, takich jak ciśnienie krwi, cholesterol i tętno, zostały zidentyfikowane i przetworzone za pomocą średniej imputeacji dla zmiennych numerycznych i imputeacji modalnej dla zmiennych kategorycznych. To podejście zachowało statystyczną dystrybucję zestawu danych, zapewniając jednocześnie, że żaden przypadek treningowy nie został odrzucony bez potrzeby, utrzymując maksymalną dostępność danych dla uczenia modelu na rozproszonych węzłach HDFS.

Skalowanie cech

Cecha numeryczne, w tym wiek, ciśnienie krwi, poziom cholesterolu i maksymalne tętno, wykazują znacznie różne zakresy wartości, co może powodować, że cechy o większych wartościach będą nieproporcjonalnie

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ocena eksperymentalna wykazuje, że model CViHDKNN osiąga lepszą wydajność predykcyjną niż model CViHDDT w klasyfikacji chorób serca. Model CViHDKNN osiągnął dokładność testową 85,25%, podczas gdy model CViHDDT osiągnął 80,33%, co wskazuje na lepsze zdolności predykcyjne w przypadku rozproszonego podejścia K-najbliższych sąsiadów. Te porównawcze wyniki wydajności są podsumowane w Tabeli 1.

Wydajność klasyfikacji modelu CViHDDT wykazuje umiarkow...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Skuteczna metoda przewidywania chorób serca oparta na technice klastrowania CViHDDT została opracowana i wyceniona przy użyciu ram dla rozproszonego drzewa decyzyjnego opartego na Hadoop. Model osiągnął dokładność trenowania około 75,62% i dokładność testowania 80,33%, pokazując swoją zdolność do generalizacji na niewidzianych danych. Nieco wyższa dokładność testów sugeruje, że równoległe przetwarzanie Hadoop efektywnie radzi sobie z dużymi zbiorami danych, minimalizując przetrenowanie. Poprzednie badania podobnie wskazy...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych konfliktów interesów do zadeklarowania.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy chcą wyrazić swoją szczerą wdzięczność Uniwersytetowi SR, Warangal, Indie, Wydziałowi Inżynierii Komputerowej za udzielenie zgody oraz ciągłe wsparcie i zachętę w trakcie tej pracy badawczej. Autorzy dziękują również Zespołowi Badawczo-Rozwojowemu Uniwersytetu (R&D), laboratoriom R&D, starszym członkom kadry naukowej i mentorom za cenne wskazówki, wsparcie techniczne oraz motywację, które w dużym stopniu przyczyniły się do pomyślnego zakończenia tej pracy badawczej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Apache SparkApache Software Foundation3.xPrzetwarzanie danych rozproszonych
HDFSApache Software FoundationZałączone w Hadoop 3.xRozproszone przechowywanie plików
YARNApache Software FoundationZałączone w Hadoop 3.xZarządzanie zasobami i planowanie zadań
MatplotlibMatplotlib Development TeamWizualizacja danych
SeabornSeaborn DevelopersWykreślanie statystyczne
Ubuntu OSCanonical Ltd.20.04 LTSSystem operacyjny
RobustScalerScikit-learnNormalizacja funkcji
UCI Heart Disease DatasetUCI Machine Learning RepositoryIdentyfikator zestawu danych 45Eksperymentalny zestaw danych

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

EngineeringHadoopDistributed systemshealth careAI
Film wkrótce dostępny

Powiązane artykuły