Protokół ten określa proces obliczeniowy do tworzenia i oceny zespołowych modeli uczenia maszynowego dla przewidywania chorób serca, wykorzystując publicznie dostępne dane referencyjne w ramach powtarzalnej struktury wstępnego przetwarzania i oceny.
Research Article
Protokół ten określa proces obliczeniowy do tworzenia i oceny zespołowych modeli uczenia maszynowego dla przewidywania chorób serca, wykorzystując publicznie dostępne dane referencyjne w ramach powtarzalnej struktury wstępnego przetwarzania i oceny.
Niniejszy artykuł przedstawia obliczeniową ocenę laboratoryjną algorytmów uczenia zespołowego w przewidywaniu chorób serca, łącząc różne algorytmy uczenia maszynowego, takie jak głosowanie twarde, głosowanie miękkie i stacking, w jednej ramie. Ocena została przeprowadzona na podstawie publicznie dostępnego zestawu danych kardiologicznych uzyskanych z repozytorium Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), obejmującego 1 190 przypadków i 11 cech klinicznych. Proces ten obejmuje wstępne przetwarzanie danych, które obejmuje obsługę brakujących wartości, usuwanie wartości odstających, skalowanie zmiennych oraz balansowanie klas, aby zapewnić jednolity wybór cech wejściowych oparty na Losowym Lesie (RF), aby wyeliminować niepotrzebne cechy. Spośród ocenianych modeli klasyfikator zespołu stacking osiągnął najwyższą ogólną dokładność na testowym zbiorze danych wynoszącą 91,88%. Chociaż do analizy porównawczej obliczono dodatkowe wskaźniki, takie jak precyzja, przypominanie i wynik F1, nacisk tego badania pozostaje na metodologicznych benchmarkingach, a nie na walidacji klinicznej.
Różne podstawowe klasyfikatory, w tym Decision Tree, Random Forest, AdaBoost i XGBoost, są stosowane i testowane niezależnie. Modele te są następnie łączone za pomocą technik zespołowych z głosowaniem twardym, miękkim i stackingiem. W stackingu regresja logistyczna jest używana jako meta-model, który jest trenowany na krzyżowo zweryfikowanych przewidywaniach próbek poza składem, aby uniknąć nadmiernego dopasowania.
Oceny przeprowadzane są z dokładnością jako głównym kryterium porównania, tak aby poszczególne systemy klasyfikacji i ich strategie łączenia mogły być porównywane jednolicie w tym samym środowisku wstępnego przetwarzania i walidacji. Chociaż metryki wydajności są dostarczane jako porównawcze wskazania, nacisk podejścia kładzie się na rozwój i ocenę strategii, a nie na ich ocenę kliniczną.
Protokół ten ułatwia porównywanie algorytmów uczenia maszynowego zespołowego na publicznie dostępnych zbiorach danych sercowo-naczyniowych oraz pomaga w systematycznym porównaniu podejść do wstępnego przetwarzania danych i konfiguracji zespołu.
Publicznie dostępne zbiory danych o chorobach sercowo-naczyniowych są szeroko wykorzystywane jako zadania referencyjne w badaniach nad uczeniem maszynowym do oceny algorytmów klasyfikacji i technik modelowania predykcyjnego 1,2,3. Takie zbiory danych, zawierające atrybuty kliniczne i demograficzne, stanowią standaryzowaną i powtarzalną podstawę do porównywania strategii wstępnego przetwarzania, metod wyboru cech oraz architektur uczenia zespołowego w kontrolowanych warunkach eksperymentalnych. W związku z tym są one powszechnie wykorzystywane do oceny zachowań algorytmicznych, a nie do wspierania wnioskowania klinicznego czy wdrożenia w praktyce 4,5.
Wcześniejsze badania dotyczyły różnych metod uczenia maszynowego do przewidywania chorób sercowo-naczyniowych, takich jak regresja logistyczna (LR), maszyny wektorowe wspierające (SVM), losowe lasy (RF) oraz modele gradient boosting 6,7,8,9. W ostatnich latach badania koncentrują się na technikach uczenia zespołowego, takich jak głosowanie twarde, głosowanie miękkie i stacking, aby uczynić modele bardziej stabilnymi i poprawić ich wydajność 10,11,12,13,14. Jednak różnice w sposobie przygotowywania danych, obsługiwania cech, walidacji oraz pomiaru wyników w tych badaniach utrudniają bezpośrednie porównanie raportowanych wyników. Aby zapewnić ogólnopoziomowy kontekstowy przegląd kategorii chorób sercowo-naczyniowych powszechnie opisywanych w literaturze, przedstawiono ilustrację koncepcyjną na Rysunku 1.

Rysunek 1: Koncepcyjne ilustracje najczęściej zgłaszanych kategorii chorób sercowo-naczyniowych, uwzględnione wyłącznie dla kontekstu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Rysunek 1 jest zamieszczony wyłącznie dla odniesienia kontekstowego na wysokim poziomie i nie reprezentuje danych pochodzących z analizowanego zbioru danych ani żadnych wyników proponowanego protokołu obliczeniowego.
W szczególności wiele istniejących prac kładzie nacisk na wyniki wykonawcze, nie izolując wyraźnego wkładu poszczególnych komponentów metodologicznych, takich jak czas wyboru cech, balans klas czy konfiguracja zespołu 15,16,17,18. Ta zmienność podkreśla potrzebę tworzenia powtarzalnego frameworka benchmarkingowego, który systematycznie ocenia metody uczenia maszynowego zespołowego, wykorzystując spójny pipeline wstępnego przetwarzania i protokół oceny na publicznie dostępnym zbiorze danych.
Hipoteza zakłada, że podejścia do uczenia zespołowego, szczególnie metody stackingu, wykazują lepszą dokładność klasyfikacji i zrównoważone wyniki w poszczególnych klasach w porównaniu z pojedynczymi klasyfikatorami bazowymi przy ocenie w warunkach standaryzowanego wstępnego przetwarzania i walidacji.
W związku z tym celem tego badania jest przeprowadzenie obliczeniowej analizy porównawczej zespołowych metod uczenia maszynowego do przewidywania chorób sercowo-naczyniowych, wykorzystując publicznie dostępny zbiór danych Kaggle. Proces ten obejmuje standaryzowane wstępne przetwarzanie danych, użycie algorytmu Random Forest do szeregowania znaczenia cech oraz stosowanie różnych technik zespołowych, takich jak głosowanie twarde, miękkie i stacking. Regresja logistyczna jest używana jako algorytm meta-klasyfikatora w stosowaniu. Zapewnia to brak nadmiernego dopasowania, ponieważ wykorzystuje przewidywania walidowane krzyżowo.
To badanie ma na celu wyłącznie publiczne porównanie zbiorów danych. Jego wyniki są ograniczone przez poleganie na jednym zbiorze danych oraz potencjalne specyficzne dla niego uprzedzenia, dlatego nie oznaczają walidacji klinicznej ani wdrożenia. Przed rozpatrzeniem jakiejkolwiek aplikacji klinicznej wymagane byłoby zewnętrzne walidacja z wykorzystaniem niezależnych zbiorów danych oraz prospektywna ocena.
Następujące pytania badawcze kierują tym badaniem:
Badanie to analizuje, jak różne podejścia do uczenia maszynowego zespołowego, w tym głosowanie twarde, miękkie i stacking, wypadają pod względem dokładności klasyfikacji w odniesieniu do publicznie dostępnych danych o chorobach sercowo-naczyniowych.
Access restricted. Please log in or start a trial to view this content.
Protokół ten opisywał powtarzalny przepływ obliczeniowy do benchmarkingu modeli uczenia maszynowego zespołowego z wykorzystaniem publicznie dostępnego zbioru danych o chorobach sercowo-naczyniowych.
Wybór zbioru danych
Badanie wykorzystało publicznie dostępny zbiór danych o chorobach sercowo-naczyniowych pochodzący z repozytorium Kaggle. Zbiór danych obejmował 1190 instancji i 11 cech. Do treningu modeli wykorzystano 80% danych, a pozostałe 20% przeznaczono na ocenę wydajności. Tabela 1 przedstawiała szczegółowy opis cech zbioru danych. Zbiór danych został załadowany do Pythona (wersja 3.9) przy użyciu biblioteki pandas (wersja 1.5.3). Integralność zbioru danych weryfikowano poprzez analizę brakujących wartości, duplikatów rekordów oraz niespójnych typów danych.
Tabela 1 podsumowuje cechy demograficzne, kliniczne i eksperymentalne zawarte w zbiorze danych o chorobach sercowo-naczyniowych, wraz z ich typami danych i zakodowanymi formatami. Te cechy stanowiły zmienne wejściowe dla wszystkich kolejnych procedur treningu i oceny modelu.
| Sl. Nie | Nazwa obiektu | Typ danych | Opis |
| 1 | Wiek | Numeryczne | Wiek pacjenta w latach. |
| 2 | Seks | Nominalne | Mężczyzna reprezentowany jako 1, a kobieta jako 0. |
| 3 | Typ bólu w klatce piersiowej | Kategorie | 1: Typowy 2: Typowa duszica 3: Ból nieanginalny 4: Bezobjawowy |
| 4 | Ciśnienie spoczynkowe | Numeryczne | Ciśnienie krwi w spoczynku mierzone w milimetrach rtęci (mmHg). |
| 5 | Poziom cholesterolu | Numeryczne | Cholesterol w surowicy w miligramach na decylitr (mg/dL). |
| 6 | Poziom cukru na czczo | Nominalne | Poziom cukru we krwi powyżej 120 mg/dl podczas postu jest przedstawiany jako 1 dla prawdziwego i 0 dla fałszywego. |
| 7 | EKG spoczynkowe | Kategoria | Przypisuje się trzy różne wartości w następujący sposób: 0 dla normalnej, 1 dla nieprawidłowości w fali ST-T oraz 2 dla przerostu lewej komory. |
| 8 | Maksymalne tętno | Numeryczne | Osiągnięte szczytowe tętno |
| 9 | Ćwiczenie dusznicy | Nominalne | Duszica wywołana ćwiczeniami, gdzie 0 oznacza NIE, a 1 oznacza Tak. |
| 10 | Oldpeak | Numeryczne | ST-depresja podczas ćwiczeń w porównaniu do stanu spoczynku. |
| 11 | Stok ST | Kategoria | Nachylenie odcinka ST podczas szczytowego ćwiczenia kategoryzowane następująco: 0: Normalne 1: Wznoszące się 2: Płaskie 3: Opadające |
Tabela 1: Opis cech zbioru danych wykorzystywanych do przewidywania chorób serca.
Wstępne przetwarzanie danych
Wstępne przetwarzanie danych było wykonywane przy użyciu bibliotek Pythona. Wiersze zawierające brakujące wartości były usuwane za pomocą pandas. Funkcja DataFrame.dropna(). Odstawłe wartości w cechach liczbowych zostały zidentyfikowane i usunięte za pomocą metody zakresu międzykwartylowego (IQR) oraz wizualizacji opartej na wykresie pudełkowym, która ilustruje rozkład i wykryte wartości odstające między cechami (Rysunek 2). Wszystkie zmienne numeryczne były skalowane za pomocą funkcji StandardScaler z biblioteki scikit-learn (wersja 1.2.2). Nierównowaga klas została rozwiązana poprzez losowe niedopróbkowanie, aby uzyskać zrównoważony rozkład klas przed trenowaniem modelu.

Rysunek 2: Wykres pudełkowy wszystkich atrybutów w zbiorze danych o chorobach sercowo-naczyniowych. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Współczynnik korelacji Pearsona (PCC) został wykorzystany do oceny zależności między cechami. Powstała macierz korelacji, zobrazowana jako mapa cieplna, ilustruje siłę i kierunek parowych korelacji cech oraz podkreśla redundantne atrybuty do eliminacji (Rysunek 3).

Rysunek 3: Macierz korelacji dla zbioru danych o chorobach serca. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Model daje mapę cieplną macierzy korelacji, która jest estetycznie przyjemna i umożliwia szybsze zrozumienie korelacji między różnymi cechami danych. Ta mapa ciepła wykorzystuje kolory do pokazania, jak bardzo i w jakim kierunku wartości są skorelowane, co czyni ją ważnym narzędziem w eksploracyjnej analizie danych. Jaśniejsze kolory wykazują wyższe korelacje dodatnie, ciemniejsze więcej ujemnych, a więcej zieleni bliskie zeru.
Ekstrakcja cech
Wybór cech był wykonywany za pomocą znaczenia funkcji Random Forest, implementowanego za pomocą RandomForestClassifier w otwartoźródłowych bibliotekach uczenia maszynowego. Oceny znaczenia cech zostały obliczone na podstawie średniego spadku zanieczyszczeń, a cechy zostały odpowiednio sklasyfikowane. Cechy z najwyższej półki N zostały zachowane do dalszej analizy. Wybór cech był stosowany po zakończeniu wszystkich etapów wstępnego przetwarzania oraz przed podziałem train–test, zapewniając ustalony i spójny zestaw cech we wszystkich modelach klasyfikacyjnych i konfiguracjach zespołowych (Rysunek 4).

Rysunek 4: Oceny ważności cech obliczone za pomocą znaczenia cech Random Forest. Cechy są klasyfikowane według znormalizowanej wartości ważności. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Cechy były klasyfikowane na podstawie średniego spadku zanieczyszczeń z wykorzystaniem znaczenia cech lasu losowego z random_state = 42; jednak wszystkie dostępne funkcje (N = 11) zostały zachowane do kolejnego trenowania modelu. Wybór cech był stosowany po wstępnym przetwarzaniu oraz przed podziałem train–test, zapewniając stały zestaw funkcji we wszystkich modelach.
Trening modeli i budowa zespołów
Zbiór danych został podzielony na podzbiory treningowe i testowe przy użyciu stosunku 80:20 z funkcją train_test_split(). Dane treningowe były wykorzystywane wyłącznie do tworzenia modeli i konstrukcji zespołu, natomiast dane testowe zarezerwowano do oceny wydajności. Podstawowe klasyfikatory, w tym Decision Tree, Random Forest, AdaBoost i XGBoost, były trenowane na zbiorze danych treningowych przy użyciu domyślnych ustawień hiperparametrów, chyba że zakreślono inaczej.
Modele głosowania twardego i miękkiego głosowania zostały skonstruowane przy użyciu VotingClassifier, z równymi wagami przypisanymi wszystkim klasyfikatorom bazowym, aby zapewnić obiektywne porównanie. Model stacking ensemble został zaimplementowany z wykorzystaniem regresji logistycznej jako meta-klasyfikatora. Meta-klasyfikator był trenowany na przewidywaniach poza składem generowanych poprzez pięciokrotną walidację krzyżową klasyfikatorów bazowych, co zmniejszało nadfitowanie i umożliwiało bezstronne oszacowanie wydajności zespołu.
Proponowany model
Proponowany framework ensemble został zaimplementowany w celu stworzenia klasyfikatora złożonego z wykorzystaniem wielu strategii uczenia zespołowego. Wszystkie dane treningowe zostały ustandaryzowane, a identyczne etapy wstępnego przetwarzania zastosowano do danych testowych, aby zapewnić spójność między fazami treningu i oceny. Klasyfikatory bazowe były integrowane przy użyciu twardego głosowania, miękkiego głosowania i mechanizmów stackowania, a meta-klasyfikator stosowania był trenowany za pomocą regresji logistycznej na przewidywaniach krzyżowych. Ogólna architektura i przepływ danych frameworku ensemble (Rysunek 5).

Rysunek 5: Architektura proponowanego modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Poziom I:
Na poziomie I frameworka ensemble wytrenowano cztery podstawowe klasyfikatory — Random Forest, Decision Tree, XGBoost i AdaBoost — korzystając ze skalowanego zbioru danych treningowych. Te klasyfikatory bazowe zostały połączone, aby stworzyć zarówno modele zespołu głosowania twardego, jak i miękkiego. Wszystkie podstawowe klasyfikatory miały równe wagi, aby zachować obiektywizm i zapobiec biedności wynikającej z różnego strojenia masowego podczas konstrukcji zespołu.
Poziom II:
Na poziomie II zaimplementowano klasyfikator zespołu stosującego poprzez łączenie przewidywań generowanych przez klasyfikatory bazowe. Podstawowe klasyfikatory były trenowane za pomocą 5-krotnej walidacji krzyżowej, a dla każdego foldu generowano przewidywania poza składem. Te nieprzewidywane prognozy były następnie wykorzystywane jako cechy wejściowe do trenowania meta-klasyfikatora regresji logistycznej, co zmniejszało nadfitowanie i umożliwiało bezstronne oszacowanie wydajności zespołu.
Access restricted. Please log in or start a trial to view this content.
Ta sekcja przedstawia efekty wstępnego przetwarzania danych i wyboru cech, porównuje wyniki indywidualnych i zespołowych klasyfikatorów oraz podsumowuje wyniki benchmarkingu w standardowych metrykach ewaluacji. Wstępne przetwarzanie danych, w tym usuwanie brakujących wartości, balansowanie klas i skalowanie cech, powodowało spójne rozkłady wejściowe dla wszystkich klasyfikatorów. Modele trenowane na danych wstępnie przetworzonych wykazywały zmniejszoną zmienność wydajności pomiędzy powtarzającymi się 5-krotnymi testami i...
Access restricted. Please log in or start a trial to view this content.
Badanie to wykazuje, że uczenie zespołowe oparte na stosowaniu konsekwentnie osiągało lepsze i bardziej stabilne wyniki klasyfikacji w porównaniu z indywidualnymi klasyfikatorami oraz zespołami opartymi na głosowaniu w warunkach standaryzowanego wstępnego przetwarzania i benchmarkingu.
Spójność wyników zespołu zaobserwowana w tym badaniu podkreśla znaczenie rzetelności metodologicznej w porównawczych badaniach uczenia maszynowego 19,20,21,22,23,24,25.
Access restricted. Please log in or start a trial to view this content.
Autorzy deklarują, że nie mają konfliktów interesów związanych z tą pracą badawczą. Żadne relacje finansowe, osobiste ani zawodowe nie wpłynęły na wyniki, analizę ani wnioski przedstawione w tym manuskrypcie.
Autorzy podkreślają wykorzystanie publicznie dostępnych zbiorów danych oraz zasobów programistycznych open-source, które wspierały to badanie. Autorzy dziękują również swoim instytucjom, w tym Sri Sri University w Bhubaneswar oraz SOA University w Bhubaneswar, za zapewnienie środowiska akademickiego i zasobów badawczych niezbędnych do prowadzenia tej pracy.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| AdaBoostClassifier | Deweloperzy scikit-learn | Nie ma | Klasyfikator wzmacniający zespół używany do benchmarkingu |
| Jupyter Notebook | Projekt Jupyter | Nie ma | Środowisko notatników obliczeniowych |
| Statystyki Kaggle Heart (Cleveland– Węgry) zbioru danych | Kaggle | Nie ma | Publiczny zbiór danych o sercowo-naczyniowych (1190 przypadków, 11 cech). URL: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final |
| Regresja logistyczna | Deweloperzy scikit-learn | Nie ma | Meta-klasyfikator stosowany w zbiorze stacking |
| Matplotlib | Zespół Rozwojowy Matplotlib | Nie ma | Biblioteka wizualizacji danych |
| NumPy | Deweloperzy NumPy | Nie ma | Biblioteka obliczeń numerycznych |
| pandas (wersja 1.5.3) | Zespół Rozwojowy Pandas | Nie ma | Wstępne przetwarzanie i obsługa danych |
| Python (wersja 3.9) | Python Software Foundation | Nie ma | Środowisko programistyczne używane do implementacji |
| LosowyLasowyKlasyfikator | Deweloperzy scikit-learn | Nie ma | Obliczanie ważności klasyfikatora bazowego i cechy |
| Seaborn | Zespół Rozwojowy Seaborn | Nie ma | Wizualizacja mapy ciepła macierzy korelacji |
| StandardScaler | Deweloperzy scikit-learn | Nie ma | Funkcja skalowania cech |
| Klasyfikator Głosowania | Deweloperzy scikit-learn | Nie ma | Implementacja zespołów głosowania twardego i miękkiego |
| XGBoostClassifier | DMLC | Nie ma | Klasyfikator gradient boosting używany jako podstawowy uczeń |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission