Research Article

Porównawcza ocena zespołowych metod uczenia maszynowego do przewidywania chorób serca

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten określa proces obliczeniowy do tworzenia i oceny zespołowych modeli uczenia maszynowego dla przewidywania chorób serca, wykorzystując publicznie dostępne dane referencyjne w ramach powtarzalnej struktury wstępnego przetwarzania i oceny.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy artykuł przedstawia obliczeniową ocenę laboratoryjną algorytmów uczenia zespołowego w przewidywaniu chorób serca, łącząc różne algorytmy uczenia maszynowego, takie jak głosowanie twarde, głosowanie miękkie i stacking, w jednej ramie. Ocena została przeprowadzona na podstawie publicznie dostępnego zestawu danych kardiologicznych uzyskanych z repozytorium Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), obejmującego 1 190 przypadków i 11 cech klinicznych. Proces ten obejmuje wstępne przetwarzanie danych, które obejmuje obsługę brakujących wartości, usuwanie wartości odstających, skalowanie zmiennych oraz balansowanie klas, aby zapewnić jednolity wybór cech wejściowych oparty na Losowym Lesie (RF), aby wyeliminować niepotrzebne cechy. Spośród ocenianych modeli klasyfikator zespołu stacking osiągnął najwyższą ogólną dokładność na testowym zbiorze danych wynoszącą 91,88%. Chociaż do analizy porównawczej obliczono dodatkowe wskaźniki, takie jak precyzja, przypominanie i wynik F1, nacisk tego badania pozostaje na metodologicznych benchmarkingach, a nie na walidacji klinicznej.

Różne podstawowe klasyfikatory, w tym Decision Tree, Random Forest, AdaBoost i XGBoost, są stosowane i testowane niezależnie. Modele te są następnie łączone za pomocą technik zespołowych z głosowaniem twardym, miękkim i stackingiem. W stackingu regresja logistyczna jest używana jako meta-model, który jest trenowany na krzyżowo zweryfikowanych przewidywaniach próbek poza składem, aby uniknąć nadmiernego dopasowania.

Oceny przeprowadzane są z dokładnością jako głównym kryterium porównania, tak aby poszczególne systemy klasyfikacji i ich strategie łączenia mogły być porównywane jednolicie w tym samym środowisku wstępnego przetwarzania i walidacji. Chociaż metryki wydajności są dostarczane jako porównawcze wskazania, nacisk podejścia kładzie się na rozwój i ocenę strategii, a nie na ich ocenę kliniczną.

Protokół ten ułatwia porównywanie algorytmów uczenia maszynowego zespołowego na publicznie dostępnych zbiorach danych sercowo-naczyniowych oraz pomaga w systematycznym porównaniu podejść do wstępnego przetwarzania danych i konfiguracji zespołu.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Publicznie dostępne zbiory danych o chorobach sercowo-naczyniowych są szeroko wykorzystywane jako zadania referencyjne w badaniach nad uczeniem maszynowym do oceny algorytmów klasyfikacji i technik modelowania predykcyjnego 1,2,3. Takie zbiory danych, zawierające atrybuty kliniczne i demograficzne, stanowią standaryzowaną i powtarzalną podstawę do porównywania strategii wstępnego przetwarzania, metod wyboru cech oraz architektur uczenia zespołowego w kontrolowanych warunkach eksperymentalnych. W związku z tym są one powszechnie wykorzystywane do oceny zachowań algorytmicznych, a nie do wspierania wnioskowania klinicznego czy wdrożenia w praktyce 4,5.

Wcześniejsze badania dotyczyły różnych metod uczenia maszynowego do przewidywania chorób sercowo-naczyniowych, takich jak regresja logistyczna (LR), maszyny wektorowe wspierające (SVM), losowe lasy (RF) oraz modele gradient boosting 6,7,8,9. W ostatnich latach badania koncentrują się na technikach uczenia zespołowego, takich jak głosowanie twarde, głosowanie miękkie i stacking, aby uczynić modele bardziej stabilnymi i poprawić ich wydajność 10,11,12,13,14. Jednak różnice w sposobie przygotowywania danych, obsługiwania cech, walidacji oraz pomiaru wyników w tych badaniach utrudniają bezpośrednie porównanie raportowanych wyników. Aby zapewnić ogólnopoziomowy kontekstowy przegląd kategorii chorób sercowo-naczyniowych powszechnie opisywanych w literaturze, przedstawiono ilustrację koncepcyjną na Rysunku 1.

Rysunek 1
Rysunek 1: Koncepcyjne ilustracje najczęściej zgłaszanych kategorii chorób sercowo-naczyniowych, uwzględnione wyłącznie dla kontekstu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Rysunek 1 jest zamieszczony wyłącznie dla odniesienia kontekstowego na wysokim poziomie i nie reprezentuje danych pochodzących z analizowanego zbioru danych ani żadnych wyników proponowanego protokołu obliczeniowego.

W szczególności wiele istniejących prac kładzie nacisk na wyniki wykonawcze, nie izolując wyraźnego wkładu poszczególnych komponentów metodologicznych, takich jak czas wyboru cech, balans klas czy konfiguracja zespołu 15,16,17,18. Ta zmienność podkreśla potrzebę tworzenia powtarzalnego frameworka benchmarkingowego, który systematycznie ocenia metody uczenia maszynowego zespołowego, wykorzystując spójny pipeline wstępnego przetwarzania i protokół oceny na publicznie dostępnym zbiorze danych.

Hipoteza zakłada, że podejścia do uczenia zespołowego, szczególnie metody stackingu, wykazują lepszą dokładność klasyfikacji i zrównoważone wyniki w poszczególnych klasach w porównaniu z pojedynczymi klasyfikatorami bazowymi przy ocenie w warunkach standaryzowanego wstępnego przetwarzania i walidacji.

W związku z tym celem tego badania jest przeprowadzenie obliczeniowej analizy porównawczej zespołowych metod uczenia maszynowego do przewidywania chorób sercowo-naczyniowych, wykorzystując publicznie dostępny zbiór danych Kaggle. Proces ten obejmuje standaryzowane wstępne przetwarzanie danych, użycie algorytmu Random Forest do szeregowania znaczenia cech oraz stosowanie różnych technik zespołowych, takich jak głosowanie twarde, miękkie i stacking. Regresja logistyczna jest używana jako algorytm meta-klasyfikatora w stosowaniu. Zapewnia to brak nadmiernego dopasowania, ponieważ wykorzystuje przewidywania walidowane krzyżowo.

To badanie ma na celu wyłącznie publiczne porównanie zbiorów danych. Jego wyniki są ograniczone przez poleganie na jednym zbiorze danych oraz potencjalne specyficzne dla niego uprzedzenia, dlatego nie oznaczają walidacji klinicznej ani wdrożenia. Przed rozpatrzeniem jakiejkolwiek aplikacji klinicznej wymagane byłoby zewnętrzne walidacja z wykorzystaniem niezależnych zbiorów danych oraz prospektywna ocena.

Następujące pytania badawcze kierują tym badaniem:

Badanie to analizuje, jak różne podejścia do uczenia maszynowego zespołowego, w tym głosowanie twarde, miękkie i stacking, wypadają pod względem dokładności klasyfikacji w odniesieniu do publicznie dostępnych danych o chorobach sercowo-naczyniowych.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten opisywał powtarzalny przepływ obliczeniowy do benchmarkingu modeli uczenia maszynowego zespołowego z wykorzystaniem publicznie dostępnego zbioru danych o chorobach sercowo-naczyniowych.

Wybór zbioru danych
Badanie wykorzystało publicznie dostępny zbiór danych o chorobach sercowo-naczyniowych pochodzący z repozytorium Kaggle. Zbiór danych obejmował 1190 instancji i 11 cech. Do treningu modeli wykorzystano 80% danych, a pozostałe 20% przeznaczono na ocenę wydajności. Tabela 1 przedstawiała szczegółowy opis cech zbioru danych. Zbiór danych został załadowany do Pythona (wersja 3.9) przy użyciu biblioteki pandas (wersja 1.5.3). Integralność zbioru danych weryfikowano poprzez analizę brakujących wartości, duplikatów rekordów oraz niespójnych typów danych.

Tabela 1 podsumowuje cechy demograficzne, kliniczne i eksperymentalne zawarte w zbiorze danych o chorobach sercowo-naczyniowych, wraz z ich typami danych i zakodowanymi formatami. Te cechy stanowiły zmienne wejściowe dla wszystkich kolejnych procedur treningu i oceny modelu.

Sl. NieNazwa obiektuTyp danychOpis
1WiekNumeryczneWiek pacjenta w latach.
2SeksNominalneMężczyzna reprezentowany jako 1, a kobieta jako 0.
3Typ bólu w klatce piersiowejKategorie1: Typowy 2: Typowa duszica 3: Ból nieanginalny 4: Bezobjawowy
4Ciśnienie spoczynkoweNumeryczneCiśnienie krwi w spoczynku mierzone w milimetrach rtęci (mmHg).
5Poziom cholesteroluNumeryczneCholesterol w surowicy w miligramach na decylitr (mg/dL).
6Poziom cukru na czczoNominalnePoziom cukru we krwi powyżej 120 mg/dl podczas postu jest przedstawiany jako 1 dla prawdziwego i 0 dla fałszywego.
7EKG spoczynkoweKategoriaPrzypisuje się trzy różne wartości w następujący sposób: 0 dla normalnej, 1 dla nieprawidłowości w fali ST-T oraz 2 dla przerostu lewej komory.
8Maksymalne tętnoNumeryczneOsiągnięte szczytowe tętno
9Ćwiczenie dusznicyNominalneDuszica wywołana ćwiczeniami, gdzie 0 oznacza NIE, a 1 oznacza Tak.
10OldpeakNumeryczneST-depresja podczas ćwiczeń w porównaniu do stanu spoczynku.
11Stok STKategoriaNachylenie odcinka ST podczas szczytowego ćwiczenia kategoryzowane następująco: 0: Normalne 1: Wznoszące się 2: Płaskie 3: Opadające

Tabela 1: Opis cech zbioru danych wykorzystywanych do przewidywania chorób serca.

Wstępne przetwarzanie danych
Wstępne przetwarzanie danych było wykonywane przy użyciu bibliotek Pythona. Wiersze zawierające brakujące wartości były usuwane za pomocą pandas. Funkcja DataFrame.dropna(). Odstawłe wartości w cechach liczbowych zostały zidentyfikowane i usunięte za pomocą metody zakresu międzykwartylowego (IQR) oraz wizualizacji opartej na wykresie pudełkowym, która ilustruje rozkład i wykryte wartości odstające między cechami (Rysunek 2). Wszystkie zmienne numeryczne były skalowane za pomocą funkcji StandardScaler z biblioteki scikit-learn (wersja 1.2.2). Nierównowaga klas została rozwiązana poprzez losowe niedopróbkowanie, aby uzyskać zrównoważony rozkład klas przed trenowaniem modelu.

Rysunek 2
Rysunek 2: Wykres pudełkowy wszystkich atrybutów w zbiorze danych o chorobach sercowo-naczyniowych. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Współczynnik korelacji Pearsona (PCC) został wykorzystany do oceny zależności między cechami. Powstała macierz korelacji, zobrazowana jako mapa cieplna, ilustruje siłę i kierunek parowych korelacji cech oraz podkreśla redundantne atrybuty do eliminacji (Rysunek 3).

Rysunek 3
Rysunek 3: Macierz korelacji dla zbioru danych o chorobach serca. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Model daje mapę cieplną macierzy korelacji, która jest estetycznie przyjemna i umożliwia szybsze zrozumienie korelacji między różnymi cechami danych. Ta mapa ciepła wykorzystuje kolory do pokazania, jak bardzo i w jakim kierunku wartości są skorelowane, co czyni ją ważnym narzędziem w eksploracyjnej analizie danych. Jaśniejsze kolory wykazują wyższe korelacje dodatnie, ciemniejsze więcej ujemnych, a więcej zieleni bliskie zeru.

Ekstrakcja cech
Wybór cech był wykonywany za pomocą znaczenia funkcji Random Forest, implementowanego za pomocą RandomForestClassifier w otwartoźródłowych bibliotekach uczenia maszynowego. Oceny znaczenia cech zostały obliczone na podstawie średniego spadku zanieczyszczeń, a cechy zostały odpowiednio sklasyfikowane. Cechy z najwyższej półki N zostały zachowane do dalszej analizy. Wybór cech był stosowany po zakończeniu wszystkich etapów wstępnego przetwarzania oraz przed podziałem train–test, zapewniając ustalony i spójny zestaw cech we wszystkich modelach klasyfikacyjnych i konfiguracjach zespołowych (Rysunek 4).

Rysunek 4
Rysunek 4: Oceny ważności cech obliczone za pomocą znaczenia cech Random Forest. Cechy są klasyfikowane według znormalizowanej wartości ważności. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Cechy były klasyfikowane na podstawie średniego spadku zanieczyszczeń z wykorzystaniem znaczenia cech lasu losowego z random_state = 42; jednak wszystkie dostępne funkcje (N = 11) zostały zachowane do kolejnego trenowania modelu. Wybór cech był stosowany po wstępnym przetwarzaniu oraz przed podziałem train–test, zapewniając stały zestaw funkcji we wszystkich modelach.

Trening modeli i budowa zespołów
Zbiór danych został podzielony na podzbiory treningowe i testowe przy użyciu stosunku 80:20 z funkcją train_test_split(). Dane treningowe były wykorzystywane wyłącznie do tworzenia modeli i konstrukcji zespołu, natomiast dane testowe zarezerwowano do oceny wydajności. Podstawowe klasyfikatory, w tym Decision Tree, Random Forest, AdaBoost i XGBoost, były trenowane na zbiorze danych treningowych przy użyciu domyślnych ustawień hiperparametrów, chyba że zakreślono inaczej.

Modele głosowania twardego i miękkiego głosowania zostały skonstruowane przy użyciu VotingClassifier, z równymi wagami przypisanymi wszystkim klasyfikatorom bazowym, aby zapewnić obiektywne porównanie. Model stacking ensemble został zaimplementowany z wykorzystaniem regresji logistycznej jako meta-klasyfikatora. Meta-klasyfikator był trenowany na przewidywaniach poza składem generowanych poprzez pięciokrotną walidację krzyżową klasyfikatorów bazowych, co zmniejszało nadfitowanie i umożliwiało bezstronne oszacowanie wydajności zespołu.

Proponowany model
Proponowany framework ensemble został zaimplementowany w celu stworzenia klasyfikatora złożonego z wykorzystaniem wielu strategii uczenia zespołowego. Wszystkie dane treningowe zostały ustandaryzowane, a identyczne etapy wstępnego przetwarzania zastosowano do danych testowych, aby zapewnić spójność między fazami treningu i oceny. Klasyfikatory bazowe były integrowane przy użyciu twardego głosowania, miękkiego głosowania i mechanizmów stackowania, a meta-klasyfikator stosowania był trenowany za pomocą regresji logistycznej na przewidywaniach krzyżowych. Ogólna architektura i przepływ danych frameworku ensemble (Rysunek 5).

Rysunek 5
Rysunek 5: Architektura proponowanego modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Poziom I:
Na poziomie I frameworka ensemble wytrenowano cztery podstawowe klasyfikatory — Random Forest, Decision Tree, XGBoost i AdaBoost — korzystając ze skalowanego zbioru danych treningowych. Te klasyfikatory bazowe zostały połączone, aby stworzyć zarówno modele zespołu głosowania twardego, jak i miękkiego. Wszystkie podstawowe klasyfikatory miały równe wagi, aby zachować obiektywizm i zapobiec biedności wynikającej z różnego strojenia masowego podczas konstrukcji zespołu.

Poziom II:
Na poziomie II zaimplementowano klasyfikator zespołu stosującego poprzez łączenie przewidywań generowanych przez klasyfikatory bazowe. Podstawowe klasyfikatory były trenowane za pomocą 5-krotnej walidacji krzyżowej, a dla każdego foldu generowano przewidywania poza składem. Te nieprzewidywane prognozy były następnie wykorzystywane jako cechy wejściowe do trenowania meta-klasyfikatora regresji logistycznej, co zmniejszało nadfitowanie i umożliwiało bezstronne oszacowanie wydajności zespołu.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta sekcja przedstawia efekty wstępnego przetwarzania danych i wyboru cech, porównuje wyniki indywidualnych i zespołowych klasyfikatorów oraz podsumowuje wyniki benchmarkingu w standardowych metrykach ewaluacji. Wstępne przetwarzanie danych, w tym usuwanie brakujących wartości, balansowanie klas i skalowanie cech, powodowało spójne rozkłady wejściowe dla wszystkich klasyfikatorów. Modele trenowane na danych wstępnie przetworzonych wykazywały zmniejszoną zmienność wydajności pomiędzy powtarzającymi się 5-krotnymi testami i...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to wykazuje, że uczenie zespołowe oparte na stosowaniu konsekwentnie osiągało lepsze i bardziej stabilne wyniki klasyfikacji w porównaniu z indywidualnymi klasyfikatorami oraz zespołami opartymi na głosowaniu w warunkach standaryzowanego wstępnego przetwarzania i benchmarkingu.

Spójność wyników zespołu zaobserwowana w tym badaniu podkreśla znaczenie rzetelności metodologicznej w porównawczych badaniach uczenia maszynowego 19,20,21,22,23,24,25.

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają konfliktów interesów związanych z tą pracą badawczą. Żadne relacje finansowe, osobiste ani zawodowe nie wpłynęły na wyniki, analizę ani wnioski przedstawione w tym manuskrypcie.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy podkreślają wykorzystanie publicznie dostępnych zbiorów danych oraz zasobów programistycznych open-source, które wspierały to badanie. Autorzy dziękują również swoim instytucjom, w tym Sri Sri University w Bhubaneswar oraz SOA University w Bhubaneswar, za zapewnienie środowiska akademickiego i zasobów badawczych niezbędnych do prowadzenia tej pracy.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierDeweloperzy scikit-learnNie maKlasyfikator wzmacniający zespół używany do benchmarkingu
Jupyter NotebookProjekt JupyterNie maŚrodowisko notatników obliczeniowych
Statystyki Kaggle Heart (Cleveland– Węgry) zbioru danychKaggleNie maPubliczny zbiór danych o sercowo-naczyniowych (1190 przypadków, 11 cech). URL: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
Regresja logistycznaDeweloperzy scikit-learnNie maMeta-klasyfikator stosowany w zbiorze stacking
MatplotlibZespół Rozwojowy MatplotlibNie maBiblioteka wizualizacji danych
NumPyDeweloperzy NumPyNie maBiblioteka obliczeń numerycznych
pandas (wersja 1.5.3)Zespół Rozwojowy PandasNie maWstępne przetwarzanie i obsługa danych
Python (wersja 3.9)Python Software FoundationNie maŚrodowisko programistyczne używane do implementacji
LosowyLasowyKlasyfikatorDeweloperzy scikit-learnNie maObliczanie ważności klasyfikatora bazowego i cechy
SeabornZespół Rozwojowy SeabornNie maWizualizacja mapy ciepła macierzy korelacji
StandardScalerDeweloperzy scikit-learnNie maFunkcja skalowania cech
Klasyfikator GłosowaniaDeweloperzy scikit-learnNie maImplementacja zespołów głosowania twardego i miękkiego
XGBoostClassifierDMLCNie maKlasyfikator gradient boosting używany jako podstawowy uczeń

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles