Research Article

Évaluation comparative des approches d’apprentissage automatique d’ensemble pour la prédiction des maladies cardiaques

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit un processus computationnel pour créer et évaluer des modèles d’apprentissage automatique d’ensemble pour la prédiction des maladies cardiaques en utilisant des données de référence accessibles au public au sein d’une structure reproductible de prétraitement et d’évaluation.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cet article présente une évaluation de benchmarking computationnelle des algorithmes d’apprentissage en ensemble dans la prédiction des maladies cardiaques, combinant différents algorithmes d’apprentissage automatique, tels que le vote dur, le vote souple et l’empilement, dans un seul cadre. L’évaluation a été réalisée à partir d’un ensemble de données cardiovasculaires publiquement accessibles provenant du dépôt Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), comprenant 1 190 cas et 11 caractéristiques cliniques. Le processus implique un prétraitement des données, qui comprend la gestion des valeurs manquantes, la suppression des valeurs aberrantes, la mise à l’échelle des variables et l’équilibrage des classes afin d’assurer une sélection uniforme des caractéristiques d’entrée, basée sur la Forêt Aléatoire (RF), afin d’éliminer les fonctionnalités inutiles. Parmi les modèles évalués, le classificateur par ensemble empilé a obtenu la plus grande précision globale de 91,88 % sur l’ensemble de données test. Bien que des métriques supplémentaires telles que la précision, la mémoire et le score F1 aient été calculées pour une analyse comparative, l’accent de cette étude reste sur le benchmarking méthodologique plutôt que sur la validation clinique.

Divers classificateurs de base, dont Arbre de décision, Forêt aléatoire, AdaBoost et XGBoost, sont appliqués et testés de manière indépendante. Ces modèles sont ensuite combinés à l’aide de techniques d’ensemble avec le vote dur, le vote doux et le cumulatif. En empilement, la régression logistique est utilisée comme méta-modèle, entraîné sur des prédictions validées croisément des échantillons hors du pliage afin d’éviter le surapprentissage.

Les évaluations sont réalisées en utilisant la précision comme critère principal de comparaison, afin que les systèmes de classification individuels et leurs stratégies de combinaison puissent être comparés uniformément dans le même environnement de prétraitement et de validation. Bien que des indicateurs de performance soient fournis pour des indications comparatives, l’accent de l’approche porte sur le développement et l’évaluation des stratégies et non sur leur évaluation clinique.

Ce protocole facilite la comparaison des algorithmes d’apprentissage automatique d’ensemble sur des ensembles de données cardiovasculaires accessibles publiquement et permet de comparer systématiquement les approches de prétraitement des données et de configuration d’ensemble.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les ensembles de données publics sur les maladies cardiovasculaires sont largement utilisés comme problèmes de référence dans la recherche en apprentissage automatique pour évaluer les algorithmes de classification et les techniques de modélisationprédictive 1,2,3. Ces ensembles de données, qui contiennent des attributs cliniques et démographiques, fournissent une base standardisée et reproductible pour comparer les stratégies de prétraitement, les méthodes de sélection des caractéristiques et les architectures d’apprentissage d’ensemble dans des conditions expérimentales contrôlées. Par conséquent, ils sont couramment employés pour évaluer le comportement algorithmique plutôt que pour soutenir l’inférence clinique ou un déploiement dans le monderéel 4,5.

Des recherches antérieures ont exploré diverses méthodes d’apprentissage automatique pour prédire les maladies cardiovasculaires, telles que la régression logistique (LR), les machines à vecteurs de support (SVM), les forêts aléatoires (RF) et les modèles d’amplification de gradient 6,7,8,9. Plus récemment, des études se sont concentrées sur des techniques d’apprentissage en ensemble, telles que le vote dur, le vote souple et le stacking, afin de rendre les modèles plus stables et d’améliorer leurs performances 10,11,12,13,14. Cependant, les différences dans la manière dont les données sont préparées, les fonctionnalités sont traitées, la validation effectuée et les résultats mesurés dans ces études rendent difficile la comparaison directe des résultats rapportés. Pour fournir un aperçu contextuel de haut niveau des catégories de maladies cardiovasculaires couramment rapportées dans la littérature, une illustration conceptuelle est présentée à la Figure 1.

Figure 1
Figure 1 : Illustration conceptuelle des catégories de maladies cardiovasculaires couramment rapportées, incluse uniquement à titre contextuel. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La figure 1 est incluse uniquement pour un référent contextuel de haut niveau et ne représente pas les données issues du jeu de données analysé dans cette étude ni des résultats du protocole computationnel proposé.

En particulier, de nombreux travaux existants mettent l’accent sur les résultats de performance sans isoler clairement la contribution des composants méthodologiques individuels, tels que le timing de la sélection des caractéristiques, l’équilibrage des classes ou la configurationdes ensembles 15,16,17,18. Cette variabilité met en lumière la nécessité d’un cadre de benchmarking reproductible qui évalue systématiquement les méthodes d’apprentissage automatique d’ensemble en utilisant un pipeline de prétraitement cohérent et un protocole d’évaluation sur un ensemble de données public.

On suppose que les approches d’apprentissage en ensemble, en particulier les méthodes d’empilement, démontreront une meilleure précision de classification et une performance équilibrée par classe par rapport aux classificateurs de base individuels lorsqu’elles sont évaluées dans des conditions standardisées de prétraitement et de validation.

En conséquence, l’objectif de cette étude est de réaliser une analyse comparative computationnelle des approches d’apprentissage automatique d’ensemble pour la prédiction des maladies cardiovasculaires en utilisant un jeu de données Kaggle accessible publiquement. Le processus implique un prétraitement standardisé des données, l’utilisation de l’algorithme Random Forest pour classer l’importance des fonctionnalités, ainsi que l’utilisation de différentes techniques d’ensemble, qui incluent le vote dur, le vote doux et l’empilement. La régression logistique est utilisée comme algorithme de méta-classificateur en empilement. Cela garantit qu’il n’y a pas de surapprovision, car il utilise des prédictions validées en croisement.

Cette étude est strictement destinée à être une étude publique de benchmarking de jeux de données. Ses résultats sont limités par la dépendance à un seul ensemble de données et à des biais potentiels spécifiques à chaque ensemble, et n’impliquent donc pas une validation ou un déploiement clinique. Une validation externe à l’aide de jeux de données indépendants et d’une évaluation prospective serait nécessaire avant qu’une application clinique puisse être envisagée.

Les questions de recherche suivantes guident cette étude :

Cette étude examine comment différentes approches d’apprentissage automatique en ensemble, y compris le vote dur, le vote souple et l’empilement, se comparent en termes de précision de classification lorsqu’elles sont appliquées à un ensemble de données public sur les maladies cardiovasculaires.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrivait un flux de travail computationnel reproductible pour l’évaluation des modèles d’apprentissage automatique d’ensemble à l’aide d’un ensemble de données de maladies cardiovasculaires accessible au public.

Sélection du jeu de données
L’étude utilisait un ensemble de données sur les maladies cardiovasculaires accessible au public obtenu à partir du dépôt Kaggle. Le jeu de données comprenait 1190 instances et comprenait 11 fonctionnalités. Pour l’entraînement du modèle, 80 % des données ont été utilisées, tandis que les 20 % restants ont été alloués à l’évaluation de la performance. Le tableau 1 présentait une description détaillée des caractéristiques du jeu de données. Le jeu de données a été chargé en Python (version 3.9) via la bibliothèque pandas (version 1.5.3). L’intégrité du jeu de données a été vérifiée en examinant les valeurs manquantes, les enregistrements en double et les types de données incohérents.

Le tableau 1 résume les attributs démographiques, cliniques et expérimentaux inclus dans l’ensemble de données sur les maladies cardiovasculaires, ainsi que leurs types de données et formats encodés. Ces caractéristiques constituaient les variables d’entrée pour toutes les procédures ultérieures d’entraînement et d’évaluation des modèles.

Sl. NonNom de la fonctionnalitéType de donnéesDescription
1ÂgeNumériqueL’âge du patient en années.
2SexeNominalL’homme représenté comme 1, et la femme représentée par 0.
3Type de douleur thoraciqueCatégorique1 : Typique 2 : Angine typique 3 : Douleur non anginale 4 : Asymptomatique
4Tension au reposNumériqueLa pression artérielle au repos mesurée en millimètres de mercure (mmHg).
5Taux de cholestérolNumériqueCholestérol sérique en milligrammes par décilitre (mg/dL).
6Glycémie à jeunNominalLes taux de sucre dans le sang supérieurs à 120 mg/dl pendant le jeûne sont représentés par 1 pour vrai et 0 pour faux.
7ECG au reposCatégoriqueTrois valeurs distinctes sont attribuées comme suit : 0 pour la normale, 1 pour l’anomalie de l’onde ST-T, et 2 pour l’hypertrophie du ventricule gauche.
8Fréquence cardiaque maximaleNumériqueFréquence cardiaque maximale atteinte
9Angine d’exerciceNominalAngine induite par l’exercice, où 0 représente NON et 1 représente Oui.
10OldpeakNumériqueST-dépression pendant l’exercice comparée à l’état de repos.
11Pente STCatégoriqueLa pente du segment ST pendant l’exercice de pointe est classée comme suit : 0 : Normal 1 : En pente ascendante 2 : Plat 3 : En pente descendante

Tableau 1 : Description des caractéristiques du jeu de données utilisées pour la prédiction des maladies cardiaques.

Prétraitement des données
Le prétraitement des données était effectué à l’aide de bibliothèques Python. Les lignes contenant des valeurs manquantes ont été supprimées à l’aide de pandas. Fonction DataFrame.dropna(). Les valeurs aberrantes dans les caractéristiques numériques ont été identifiées et supprimées à l’aide de la méthode de la plage interquartile (IQR) et de la visualisation basée sur le boxplot, qui illustre la distribution et les valeurs aberrantes détectées entre les caractéristiques (Figure 2). Toutes les variables numériques étaient mises à l’échelle à l’aide de la fonction StandardScaler de la bibliothèque scikit-learn (version 1.2.2). Le déséquilibre de classe a été corrigé par un sous-échantillonnage aléatoire afin d’obtenir une répartition équilibrée des classes avant l’entraînement du modèle.

Figure 2
Figure 2 : Diagramme en boîte de tous les attributs du jeu de données sur les maladies cardiovasculaires. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le coefficient de corrélation (PCC) de Pearson a été utilisé pour évaluer les relations entre les caractéristiques. La matrice de corrélation résultante, visualisée sous forme de carte thermique, illustre la force et la direction des corrélations par paires et met en évidence les attributs redondants à éliminer (Figure 3).

Figure 3
Figure 3 : Matrice de corrélation pour le jeu de données sur les maladies cardiaques. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le modèle donne une carte thermique de la matrice de corrélation esthétiquement agréable et permet une compréhension plus rapide des corrélations entre différentes caractéristiques des données. Cette carte thermique utilise des couleurs pour indiquer dans quelle mesure et dans quelle direction les valeurs sont corrélées, ce qui en fait un outil important en analyse exploratoire des données. Les couleurs plus claires montrent des corrélations positives plus élevées, les couleurs foncées des corrélations négatives plus élevées, et plus de verts montrent des corrélations proches de zéro.

Extraction des caractéristiques
La sélection des caractéristiques a été réalisée en utilisant l’importance des caractéristiques Random Forest, implémentée via le RandomForestClassifier dans des bibliothèques open source d’apprentissage automatique. Les scores d’importance des caractéristiques ont été calculés en fonction de la diminution moyenne des impuretés, et les caractéristiques ont été classées en conséquence. Les caractéristiques classées parmi les N meilleures ont été conservées pour une analyse ultérieure. La sélection des caractéristiques a été appliquée après l’achèvement de toutes les étapes de prétraitement et avant la division train–test, garantissant qu’un ensemble de caractéristiques fixe et cohérent était utilisé dans tous les modèles de classification et configurations d’ensemble (Figure 4).

Figure 4
Figure 4 : Scores d’importance des caractéristiques calculés à l’aide de l’importance des caractéristiques de la forêt aléatoire. Les caractéristiques sont classées selon la valeur d’importance normalisée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Les caractéristiques ont été classées selon la diminution moyenne de l’impureté en utilisant l’importance des caractéristiques de la Forêt Aléatoire avec random_state = 42 ; cependant, toutes les fonctionnalités disponibles (N = 11) ont été conservées pour l’entraînement ultérieur du modèle. La sélection des caractéristiques était appliquée après prétraitement et avant la séparation train–test, garantissant un ensemble de fonctionnalités fixe sur tous les modèles.

Formation de modèles et construction d’ensembles
Le jeu de données a été partitionné en sous-ensembles d’entraînement et de test à l’aide d’un ratio de répartition 80:20 avec la fonction train_test_split(). Les données d’entraînement étaient utilisées exclusivement pour le développement de modèles et la construction d’ensembles, tandis que les données de test étaient réservées à l’évaluation des performances. Les classificateurs de base, y compris Decision Tree, Random Forest, AdaBoost et XGBoost, étaient entraînés sur le jeu de données d’entraînement en utilisant les paramètres hyperparamètres par défaut, sauf indication contraire.

Les modèles d’ensemble de vote dur et de vote souple ont été construits à l’aide du VotingClassifier, avec des poids égaux attribués à tous les classificateurs de base afin d’assurer une comparaison objective. Un modèle d’ensemble empilé a été implémenté en utilisant la régression logistique comme méta-classificaneur. Le méta-classificateur a été entraîné sur des prédictions hors de pliage générées par une validation croisée 5-multipliée des classificateurs de base, ce qui a réduit le surapprentissage et permis une estimation impartiale de la performance de l’ensemble.

Modèle proposé
Le cadre d’ensemble proposé a été mis en œuvre pour construire un classificateur composite utilisant plusieurs stratégies d’apprentissage en ensemble. Toutes les données d’entraînement ont été standardisées, et des étapes de prétraitement identiques ont été appliquées aux données de test afin d’assurer la cohérence entre les phases d’entraînement et d’évaluation. Les classificateurs de base ont été intégrés à l’aide de votes durs, de votes doux et de mécanismes d’empilement, et le méta-classificateur d’empilement a été entraîné à l’aide de la régression logistique sur des prédictions validées croisément. L’architecture globale et le flux de données du cadre d’ensemble (Figure 5).

Figure 5
Figure 5 : Architecture du modèle proposé. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Niveau I :
Au niveau I du cadre d’ensemble, quatre classificateurs de base — Random Forest, Decision Tree, XGBoost et AdaBoost — ont été entraînés à l’aide du jeu de données d’entraînement à grande échelle. Ces classificateurs de base ont été combinés pour construire à la fois des modèles de vote dur et d’ensemble à vote souple. Des poids égaux ont été attribués à tous les classificateurs de base afin de maintenir l’objectivité et d’éviter les biais résultant de l’ajustement différentiel des poids lors de la construction de l’ensemble.

Niveau II :
Au niveau II, un classificateur d’ensemble empilé a été implémenté en combinant les prédictions générées par les classificateurs de base. Les classificateurs de base ont été entraînés à l’aide d’une validation croisée à 5 fois et des prédictions hors de pliage ont été générées pour chaque pli. Ces prédictions hors du pliage ont ensuite été utilisées comme caractéristiques d’entrée pour entraîner un méta-classificateur de régression logistique, réduisant ainsi le surapprentissage et permettant une estimation impartiale de la performance de l’ensemble.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette section présente les effets du prétraitement des données et de la sélection des caractéristiques, compare la performance des classificateurs individuels et d’ensemble, et résume les résultats de benchmarking à travers les métriques d’évaluation standard. Le prétraitement des données, y compris la suppression des valeurs manquantes, l’équilibrage des classes et la mise à l’échelle des caractéristiques, produisait des distributions d’entrée cohérentes sur tous les classificateurs. Les modèles entraînés sur des donnée...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude démontre que l’apprentissage d’ensembles basé sur l’empilement a constamment obtenu des performances de classification supérieures et plus stables comparées aux classificateurs individuels et aux ensembles basés sur le vote, sous des conditions standardisées de prétraitement et de benchmarking.

La constance de la performance d’ensemble observée dans cette étude renforce l’importance de la rigueur méthodologique dans la recherche comparative en appr...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts concernant ce travail de recherche. Aucune relation financière, personnelle ou professionnelle n’a influencé les résultats, analyses ou conclusions présentés dans ce manuscrit.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs reconnaissent l’utilisation de jeux de données publiques et de ressources logicielles open source qui ont soutenu cette étude. Les auteurs remercient également leurs institutions respectives, notamment l’Université Sri Sri de Bhubaneswar et l’Université SOA de Bhubaneswar, pour leur mise en place l’environnement académique et les installations de recherche nécessaires à la réalisation de ce travail.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierscikit-learn DéveloppeursN/AClassificateur d’ensemble boosting utilisé pour le benchmarking
Cahier JupyterProjet JupyterN/AEnvironnement de notebook informatique
Journal statistique de Kaggle Heart (Cleveland&ndash ; Hongrie) Jeu de donnéesKaggleN/AEnsemble de données cardiovasculaires publics (1190 cas, 11 fonctionnalités). URL : https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
Régression logistiquescikit-learn DéveloppeursN/AMéta-classificateur utilisé dans l’ensemble d’empilement
MatplotlibÉquipe de développement MatplotlibN/ABibliothèque de visualisation de données
NumPyDéveloppeurs NumPyN/ABibliothèque de calcul numérique
pandas (Version 1.5.3)Équipe de développement de pandasN/APrétraitement et gestion des données
Python (Version 3.9)Fondation Python SoftwareN/AEnvironnement de programmation utilisé pour la mise en œuvre
RandomForestClassifierscikit-learn DéveloppeursN/ACalcul du classificateur de base et de l’importance des caractéristiques
SeabornÉquipe de développement SeabornN/AVisualisation de la matrice de corrélation par carte thermique
StandardScalerscikit-learn DéveloppeursN/AFonction de mise à l’échelle des caractéristiques
Classificateur de votescikit-learn DéveloppeursN/AImplémentation de l’ensemble à vote dur et souple
XGBoostClassifierDMLCN/AClassificateur d’amplification de gradient utilisé comme apprenant de base

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles