Research Article

Valutazione comparativa degli approcci di machine learning in ensemble per la previsione delle malattie cardiache

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo delinea un processo computazionale per creare e valutare modelli di machine learning in ensemble per la previsione delle malattie cardiache utilizzando dati di benchmark accessibili al pubblico all'interno di una struttura riproducibile di preprocessing e valutazione.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo articolo presenta una valutazione computazionale di benchmarking degli algoritmi di Ensemble Learning nella previsione delle malattie cardiache, combinando diversi algoritmi di Machine Learning, come hard voting, soft voting e stacking, in un unico quadro. La valutazione è stata condotta utilizzando un dataset cardiovascolare pubblicamente disponibile ottenuto dal repository Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), comprendente 1.190 casi e 11 caratteristiche cliniche. Il processo prevede la pre-elaborazione dei dati, che include la gestione dei valori mancanti, la rimozione degli outlier, la scalabilità delle variabili e il bilanciamento delle classi per garantire che una selezione uniforme delle caratteristiche di input, basata sulla Random Forest (RF), venga utilizzata per eliminare funzionalità inutili. Tra i modelli valutati, il classificatore di ensemble a stacking ha raggiunto la massima accuratezza complessiva del 91,88% sul dataset di test. Sebbene metriche aggiuntive come precisione, ricordo e punteggio F1 siano state calcolate per l'analisi comparativa, l'enfasi di questo studio rimane sul benchmarking metodologico piuttosto che sulla validazione clinica.

Vari classificatori di base, tra cui Decision Tree, Random Forest, AdaBoost e XGBoost, vengono applicati e testati in modo indipendente. Questi modelli vengono poi combinati utilizzando tecniche di ensemble con voto duro, voto morbido e stacking. Nello stacking, la Regressione Logistica viene utilizzata come meta-modello, addestrata su previsioni incrociate dei campioni out-of-fold per evitare il sovrafitting.

Le valutazioni vengono effettuate utilizzando l'accuratezza come criterio principale per il confronto, così che i singoli sistemi di classificazione e le loro strategie di combinazione possano essere confrontati uniformemente nello stesso ambiente di pre-elaborazione e validazione. Sebbene vengano fornite metriche di performance per indicazioni comparative, l'enfasi dell'approccio risiede nello sviluppo e nella valutazione delle strategie e non nella loro valutazione clinica.

Questo protocollo rende facile confrontare algoritmi di machine learning di ensemble su dataset cardiovascolari disponibili pubblicamente e aiuta a effettuare un confronto sistematico tra la preprocessing dei dati e gli approcci di configurazione dell'ensemble.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I dataset pubblici di malattie cardiovascolari sono ampiamente utilizzati come problemi di riferimento nella ricerca sul machine learning per la valutazione di algoritmi di classificazione e tecniche di modellazionepredittiva 1,2,3. Tali dataset, che contengono attributi clinici e demografici, forniscono una base standardizzata e riproducibile per confrontare strategie di preelaborazione, metodi di selezione delle caratteristiche e architetture di apprendimento a ensemble in condizioni sperimentali controllate. Di conseguenza, sono comunemente impiegati per valutare il comportamento algoritmico piuttosto che per supportare inferenze cliniche o applicazioni reali 4,5.

Ricerche precedenti hanno esaminato vari metodi di apprendimento automatico per la previsione delle malattie cardiovascolari, come la Regressione Logistica (LR), le Support Vector Machines (SVM), le Foreste Random (RF) e i modellidi gradiente 6,7,8,9. Più recentemente, gli studi si sono concentrati su tecniche di apprendimento in ensemble, come il voto duro, il soft voting e lo stacking, per rendere i modelli più stabili e migliorarne le prestazioni 10,11,12,13,14. Tuttavia, le differenze nel modo in cui i dati vengono preparati, nelle funzionalità gestite, nella validazione e nella misurazione dei risultati in questi studi rendono difficile confrontare direttamente gli esiti riportati. Per fornire una panoramica contestuale ad alto livello delle categorie di malattie cardiovascolari comunemente riportate in letteratura, è presentata un'illustrazione concettuale nella Figura 1.

Figura 1
Figura 1: Illustrazione concettuale delle categorie di malattie cardiovascolari comunemente segnalate, inclusa solo a scopo contestuale. Clicca qui per visualizzare una versione più grande di questa figura.

La Figura 1 è inclusa esclusivamente come riferimento contestuale di alto livello e non rappresenta dati derivati dal dataset analizzato in questo studio né da eventuali output del protocollo computazionale proposto.

In particolare, molti lavori esistenti enfatizzano i risultati esecutivi senza isolare chiaramente il contributo di singoli componenti metodologici, come il tempismo della selezione delle caratteristiche, il bilanciamento delle classi o la configurazionedell'ensemble 15,16,17,18. Questa variabilità evidenzia la necessità di un framework di benchmarking riproducibile che valuti sistematicamente i metodi di machine learning in ensemble utilizzando una pipeline di preprocessing coerente e un protocollo di valutazione su un dataset pubblicamente disponibile.

Si ipotizza che gli approcci di apprendimento in ensemble, in particolare i metodi di stacking, dimostrino una migliore accuratezza nella classificazione e prestazioni bilanciate a classe rispetto ai singoli classificatori base quando valutati in condizioni standardizzate di preelaborazione e validazione.

Di conseguenza, l'obiettivo di questo studio è condurre un'analisi computazionale di benchmarking degli approcci di machine learning in ensemble per la previsione delle malattie cardiovascolari utilizzando un dataset Kaggle pubblicamente disponibile. Il processo prevede la pre-elaborazione standardizzata dei dati, l'uso dell'algoritmo Random Forest per classificare l'importanza delle caratteristiche, nonché l'impiego di diverse tecniche di ensemble, che includono voto rigido, voto morbido e stacking. La regressione logistica viene utilizzata come algoritmo meta-classificatore nello stacking. Questo garantisce che non ci sia sovrafitting, poiché utilizza previsioni convalidate incrociatamente.

Questo studio è inteso esclusivamente come un'indagine di benchmarking pubblica di dataset. I suoi risultati sono limitati dalla dipendenza da un singolo dataset e da potenziali bias specifici del dataset, e quindi non implicano validazione o distribuzione clinica. Sarebbe necessaria una validazione esterna tramite dataset indipendenti e una valutazione prospettica prima che qualsiasi applicazione clinica possa essere considerata.

Le seguenti domande di ricerca guidano questo studio:

Questo studio esamina come diversi approcci di machine learning in ensemble, inclusi voto duro, voto morbido e stacking, si confrontino in termini di accuratezza della classificazione quando applicati a un dataset pubblico sulle malattie cardiovascolari.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descriveva un flusso di lavoro computazionale riproducibile per il benchmarking di modelli di machine learning in ensemble utilizzando un dataset di malattie cardiovascolari pubblicamente disponibile.

Selezione del dataset
Lo studio ha utilizzato un dataset pubblico sulle malattie cardiovascolari ottenuto dal repository Kaggle. Il dataset comprendeva 1190 istanze e includeva 11 funzionalità. Per l'addestramento del modello, l'80% dei dati è stato utilizzato, mentre il restante 20% è stato destinato alla valutazione delle prestazioni. La Tabella 1 presentava una descrizione dettagliata delle caratteristiche del dataset. Il dataset è stato caricato in Python (versione 3.9) utilizzando la libreria pandas (versione 1.5.3). L'integrità del dataset è stata verificata esaminando valori mancanti, record duplicati e tipi di dati incoerenti.

La Tabella 1 riassume gli attributi demografici, clinici ed esperimentali inclusi nel dataset sulle malattie cardiovascolari, insieme ai loro tipi di dati e formati codificati. Queste caratteristiche costituivano le variabili di input per tutte le successive procedure di addestramento e valutazione del modello.

Sl. NoNome della caratteristicaTipo di DatiDescrizione
1EtàNumericoEtà del paziente in anni.
2SessoNominaleMaschio rappresentato come 1, e femmina come 0.
3Tipo di dolore toracicoCategoriale1: Tipico 2: Angina tipica 3: Dolore non anginale 4: Asintomatico
4Pressione a riposoNumericoPressione sanguigna a riposo misurata in millimetri di mercurio (mmHg).
5Livello di colesteroloNumericoColesterolo sierico in milligrammi per decilitro (mg/dL).
6Zucchero nel sangue a digiunoNominaleI livelli di zucchero nel sangue superiori a 120 mg/dl durante il digiuno sono rappresentati come 1 per il vero e 0 per il falso.
7ECG a riposoCategorialeTre valori distinti sono assegnati come segue: 0 per Normale, 1 per Anomalia nell'onda ST-T e 2 per Ipertrofia ventricolare sinistra.
8Frequenza cardiaca massimaNumericoFrequenza cardiaca massima raggiunta
9Angina di esercizioNominaleAngina indotta dall'esercizio, dove 0 rappresenta NO e 1 rappresenta Sì.
10OldpeakNumericoST-depressione durante l'esercizio fisico rispetto allo stato di riposo.
11Pendio STCategorialeLa pendenza del segmento ST durante l'esercizio di picco è classificata come segue: 0: Normale 1: Inclinazione in salita 2: Piatta 3: Discesa

Tabella 1: Descrizione delle caratteristiche del dataset utilizzate per la previsione delle malattie cardiache.

Preprocessing dei dati
La pre-elaborazione dei dati veniva eseguita utilizzando librerie Python. Le righe contenenti valori mancanti sono state rimosse usando pandas. Funzione DataFrame.dropna(). Gli outlier nelle caratteristiche numeriche sono stati identificati e rimossi utilizzando il metodo dell'intervallo interquartile (IQR) e la visualizzazione basata su boxplot, che illustra la distribuzione e gli outlier rilevati tra le caratteristiche (Figura 2). Tutte le variabili numeriche sono state scalate utilizzando la funzione StandardScaler dalla libreria scikit-learn (versione 1.2.2). Il disequilibrio di classe è stato affrontato tramite sottocampionamento casuale per ottenere una distribuzione bilanciata delle classi prima dell'addestramento del modello.

Figura 2
Figura 2: Diagramma a scatola di tutti gli attributi nel dataset sulle malattie cardiovascolari. Clicca qui per visualizzare una versione più grande di questa figura.

Il coefficiente di correlazione (PCC) di Pearson è stato utilizzato per valutare le relazioni tra le caratteristiche. La matrice di correlazione risultante, visualizzata come una mappa termica, illustra la forza e la direzione delle correlazioni di caratteristiche a coppie e evidenzia attributi ridondanti per l'eliminazione (Figura 3).

Figura 3
Figura 3: Matrice di correlazione per il dataset sulle malattie cardiache. Clicca qui per visualizzare una versione più grande di questa figura.

Il modello produce una mappa termica della matrice di correlazione esteticamente gradevole e consente una comprensione più rapida delle correlazioni tra le diverse caratteristiche nei dati. Questa mappa termica utilizza i colori per mostrare quanto e in quale direzione i valori sono correlati, rendendola uno strumento importante nell'Analisi Esplorativa dei Dati. I colori più chiari mostrano correlazioni positive più elevate, i colori scuri mostrano correlazioni negative più elevate e più verdi mostrano correlazioni vicine a zero.

Estrazione delle caratteristiche
La selezione delle caratteristiche veniva effettuata utilizzando l'importanza delle caratteristiche Random Forest implementata tramite il RandomForestClassifier nelle librerie di machine learning open source. I punteggi di importanza delle caratteristiche sono stati calcolati sulla base della diminuzione media dell'impurità e le caratteristiche sono state classificate di conseguenza. Le caratteristiche tra le prime N, classificate, sono state mantenute per analisi successive. La selezione delle caratteristiche è stata applicata dopo il completamento di tutti i passaggi di preelaborazione e prima della divisione treno–test, garantendo che un set di caratteristiche fisso e coerente fosse utilizzato in tutti i modelli di classificazione e le configurazioni degli ensemble (Figura 4).

Figura 4
Figura 4: Punteggi di importanza delle caratteristiche calcolati utilizzando l'importanza delle caratteristiche della Foresta Casuale. Le caratteristiche sono classificate in base al valore di importanza normalizzato. Clicca qui per visualizzare una versione più grande di questa figura.

Le caratteristiche sono state classificate in base alla diminuzione media dell'impurità usando l'importanza delle caratteristiche della Foresta Casuale con random_state = 42; tuttavia, tutte le caratteristiche disponibili (N = 11) furono mantenute per l'addestramento successivo del modello. La selezione delle caratteristiche veniva applicata dopo la pre-elaborazione e prima della divisione treno-test, garantendo un set di funzionalità fisso su tutti i modelli.

Addestramento al modello e costruzione dell'ensemble
Il dataset è stato suddiviso in sottoinsiemi di addestramento e test utilizzando un rapporto di divisione 80:20 con la funzione train_test_split(). I dati di addestramento venivano utilizzati esclusivamente per lo sviluppo del modello e la costruzione di ensemble, mentre i dati di test erano riservati alla valutazione delle prestazioni. I classificatori base, inclusi Decision Tree, Random Forest, AdaBoost e XGBoost, venivano addestrati sul dataset di addestramento usando le impostazioni predefinite degli iperparametri, salvo diversa specificazione.

I modelli di ensemble hard voting e soft voting sono stati costruiti utilizzando il VotingClassifier, con pesi uguali assegnati a tutti i classificatori base per garantire un confronto oggettivo. Un modello di ensemble a impilamento è stato implementato utilizzando la Regressione Logistica come meta-classificatore. Il meta-classificatore è stato addestrato su previsioni out-of-fold generate tramite la validazione incrociata 5-fold dei classificatori base, che ha ridotto l'overfitting e permesso una stima imparziale della performance dell'ensemble.

Modello proposto
Il framework di ensemble proposto è stato implementato per costruire un classificatore composito utilizzando strategie di apprendimento multiple in ensemble. Tutti i dati di addestramento sono stati standardizzati e sono stati applicati passaggi di pre-elaborazione identici ai dati di test per garantire la coerenza tra le fasi di addestramento e quella di valutazione. I classificatori base sono stati integrati utilizzando meccanismi di voto rigido, voto soft e stacking, mentre il meta-classificatore di stacking è stato addestrato usando la Regressione Logistica su previsioni convalidate incrociatamente. L'architettura complessiva e il flusso di dati del framework dell'ensemble (Figura 5).

Figura 5
Figura 5: Architettura del modello proposto. Clicca qui per visualizzare una versione più grande di questa figura.

Livello I:
Al Livello I del framework ensemble, quattro classificatori base—Random Forest, Decision Tree, XGBoost e AdaBoost—sono stati addestrati utilizzando il dataset scaled training. Questi classificatori di base sono stati combinati per costruire sia modelli di ensemble hard voting che soft vote. Pesi uguali sono stati assegnati a tutti i classificatori base per mantenere l'obiettività e prevenire bias derivanti dalla regolazione differenziale del peso durante la costruzione dell'ensemble.

Livello II:
Al Livello II, un classificatore a combinazione di sovraprevisioni generate dai classificatori base è stato implementato combinando le previsioni generate dai classificatori di base. I classificatori base sono stati addestrati utilizzando la validazione incrociata a 5 volte e sono state generate previsioni out-of-fold per ciascuna piegatura. Queste previsioni out-of-fold sono state poi utilizzate come caratteristiche di input per addestrare un meta-classificatore di Regressione Logistica, riducendo così l'overfitting e consentendo una stima imparziale della performance dell'ensemble.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa sezione presenta gli effetti della preelaborazione dei dati e della selezione delle caratteristiche, confronta le prestazioni dei classificatori individuali e dell'ensemble e riassume i risultati del benchmarking attraverso metriche standard di valutazione. La preelaborazione dei dati, inclusa la rimozione di valori mancanti, il bilanciamento delle classi e la scalatura delle caratteristiche, ha prodotto distribuzioni di input coerenti su tutti i classificatori. I modelli addestrati su dati preprocessati hanno mos...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio dimostra che l'apprendimento d'ensemble basato sullo stacking ha costantemente raggiunto prestazioni di classificazione superiori e più stabili rispetto ai singoli classificatori e agli ensemble basati su votazione in condizioni standardizzate di preprocessing e benchmarking.

La coerenza della performance dell'ensemble osservata in questo studio rafforza l'importanza del rigore metodologico nella ricerca comparativa sul machine

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere conflitti di interesse legati a questo lavoro di ricerca. Nessuna relazione finanziaria, personale o professionale ha influenzato i risultati, l'analisi o le conclusioni presentate in questo manoscritto.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori riconoscono l'uso di dataset pubblicamente disponibili e risorse software open source che hanno supportato questo studio. Gli autori ringraziano inoltre le rispettive istituzioni, tra cui la Sri Sri University di Bhubaneswar e la SOA University di Bhubaneswar, per aver fornito l'ambiente accademico e le strutture di ricerca necessarie per condurre questo lavoro.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierscikit-learn SviluppatoriN/AClassificatore di ensemble boosting utilizzato per il benchmarking
Jupyter NotebookProgetto JupyterN/AAmbiente di notebook computazionale
Registro statistico del cuore di Kaggle (Cleveland– Ungheria) DatasetKaggleN/ADataset cardiovascolare pubblico (1190 casi, 11 funzionalità). URL: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
Regressione Logisticascikit-learn SviluppatoriN/AMeta-classificatore usato nell'ensemble di impilamento
MatplotlibTeam di sviluppo MatplotlibN/ALibreria di visualizzazione dei dati
NumPySviluppatori NumPyN/ALibreria di calcolo numerico
pandas (Versione 1.5.3)Team di sviluppo pandasN/APreprocessing e gestione dei dati
Python (Versione 3.9)Python Software FoundationN/AAmbiente di programmazione utilizzato per l'implementazione
ClassificatoreRandomForestClassificatorescikit-learn SviluppatoriN/AClassificatore base e calcolo dell'importanza delle caratteristiche
SeabornTeam di Sviluppo SeabornN/AVisualizzazione della mappa termica della matrice di correlazione
StandardScalerscikit-learn SviluppatoriN/AFunzione di scalabilità delle caratteristiche
Classificatore di Votoscikit-learn SviluppatoriN/AImplementazione dell'ensemble hard e soft voting
XGBoostClassifierDMLCN/AClassificatore di gradiente di potenziamento utilizzato come apprendente base

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles