Research Article

心脏病预测中集合机器学习方法的比较评估

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议提出了一种计算流程,利用公开可访问的基准数据在可重复的预处理和评估结构中创建和评估用于心脏病预测的集合机器学习模型。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文提出了对集成学习算法在心脏病预测中的计算基准评估,结合了硬投票、软投票和堆叠等多种机器学习算法,形成一个统一框架。评估使用来自Kaggle数据库(https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final)的公开心血管数据集,包含1190个实例和11项临床特征。该过程涉及数据预处理,包括处理缺失值、去除离群值、缩放变量和类平衡,以确保基于随机森林(RF)的统一输入特征选择,以消除不必要的特征。在评估模型中,堆叠集合分类器在测试数据集上实现了最高的整体准确率,达到91.88%。尽管还计算了准确率、回忆率和F1分数等额外指标进行比较分析,但本研究仍强调方法学基标分析,而非临床验证。

包括决策树、随机森林、AdaBoost和XGBoost在内的多种基础分类器被独立应用和测试。这些模型随后通过集合技术结合硬投票、软投票和堆叠。在堆叠中,逻辑回归作为元模型,基于对非折叠样本的交叉验证预测进行训练,以避免过拟合。

评估以准确性为主要比较标准,以便在同一预处理和验证环境中统一比较各个分类系统及其组合策略。虽然提供了绩效指标用于比较适应症,但该方法的重点在于策略的制定和评估,而非临床评估。

该协议便于在公开心血管数据集上比较集合机器学习算法,并有助于系统地比较数据预处理和集合配置方法。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

公开可用的心血管疾病数据集被广泛用作机器学习研究中的基准问题,用于评估分类算法和预测建模技术 1,2,3。这些包含临床和人口属性的数据集,为在受控实验条件下比较预处理策略、特征选择方法和集合学习架构提供了标准化且可重复的基础。因此,它们通常用于评估算法行为,而非支持临床推断或实际应用 4,5

此前的研究探讨了多种机器学习方法用于预测心血管疾病,如逻辑回归(LR)、支持向量机(SVM)、随机森林(RF)以及梯度提升模型6789。近年来,研究重点转向集合学习技术,如硬投票、软投票和堆叠,以使模型更稳定并提升性能 10,11,12,13,14。然而,这些研究在数据准备、特征处理、验证和结果测量方式上存在差异,这使得直接比较报告的结果变得困难。为提供文献中常见心血管疾病类别的高级背景概述,图1中展示了概念性示意。

图1
图1 常见心血管疾病类别的概念性示意,仅作为背景介绍。 请点击此处查看该图的放大版本。

图1 仅供高级上下文参考,不代表本研究分析数据集或拟议计算方案的任何输出数据。

特别是,许多现有研究强调性能结果,却未明确区分单个方法学组成部分的贡献,如特征选择时机、类平衡或集合配置15161718。这种变异性凸显了需要一个可重复的基准测试框架,系统地通过一致的预处理流水线和公开数据集的评估协议来评估集合机器学习方法。

假设集合学习方法,特别是堆叠方法,在标准化的预处理和验证条件下评估时,将展示出比单个基分类器更好的分类准确性和均衡的类别性能。

因此,本研究的目标是利用公开的Kaggle数据集,对心血管疾病预测中的集成机器学习方法进行计算基准分析。该过程包括标准化的数据预处理、使用随机森林算法对特征重要性进行排序,以及采用不同的集合技术,包括硬投票、软投票和叠加。逻辑回归被用作堆栈中的元分类器算法。这确保了不存在过拟合,因为它使用交叉验证的预测。

本研究纯粹作为公开数据集基准分析。其发现受限于单一数据集及潜在数据集特异性偏差,因此不意味着临床验证或部署。在考虑任何临床应用之前,必须通过独立数据集进行外部验证和前瞻性评估。

以下研究问题指导本研究:

本研究考察了不同的集合机器学习方法,包括硬投票、软投票和堆叠,在应用于公开心血管疾病数据集时,分类准确度的比较。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议描述了一种可重复的计算流程,用于利用公开的心血管疾病数据集进行集成机器学习模型的基准测试。

数据集选择
该研究采用了从Kaggle数据库获得的公开心血管疾病数据集。该数据集包含1190个实例,包含11个特征。模型训练中,80%的数据被利用,剩余20%用于性能评估。 表1 详细描述了数据集特征。数据集通过 pandas 库(版本 1.5.3)加载到 Python(版本 3.9)。通过检查缺失值、重复记录和不一致的数据类型,验证了数据集完整性。

表1 总结了心血管疾病数据集中包含的人口统计、临床和实验属性,以及它们的数据类型和编码格式。这些特征构成了所有后续模型训练和评估程序的输入变量。

SL. 不特色名称数据类型描述
1年龄数值患者的年龄(以年龄计)。
2名义上男性表示为1,女性表示为0。
3胸痛类型范畴1:典型 2:典型心绞痛 3:非心绞痛疼痛 4:无症状
4静息血压数值静息时的血压以毫米汞柱(mmHg)为单位测量。
5胆固醇水平数值血清胆固醇(毫克/分升)指标。
6空腹血糖名义上空腹期间血糖超过120 mg/dl的血糖表示为1(真值)和0(假值)。
7静息心电图分类分配三个不同的数值如下:正常为0,ST-T波异常为1,左心室肥厚为2。
8最大心率数值达到峰值心率
9运动心绞痛名义上运动诱发的心绞痛,0代表NO,1代表Yes。
10老峰数值运动时ST抑制与静息状态的比较。
11ST坡分类高峰运动时的ST段坡度分类如下:0:正常 1:上坡 2:平坦 3:下坡

表1: 用于心脏病预测的数据集特征描述。

数据预处理
数据预处理使用Python库完成。包含缺失值的行则用pandas去除。DataFrame.dropna() 函数。数值特征中的离群值通过四分位数范围(IQR)方法和基于箱形图的可视化方法识别并去除,该方法展示了特征间的分布和检测到的异常值(见图2)。所有数值变量均通过scikit-learn库(版本1.2.2)中的StandardScaler函数进行缩放。类别不平衡通过随机样解决,以获得平衡的类别分布,随后才进行模型训练。

图2
图2 心血管疾病数据集中所有属性的箱型图。 请点击此处查看该图的放大版本。

采用皮尔逊相关系数(PCC)来评估特征间的关系。由此产生的相关矩阵以热力图形式可视化,展示了两对特征相关性的强度和方向,并突出显示了冗余属性以便消除(见图3)。

图3
图3 心脏病数据集的相关矩阵。 请点击此处查看该图的放大版本。

该模型生成的相关矩阵热图美观,有助于更快理解数据中不同特征之间的相关性。该热力图利用颜色显示值之间的相关性和方向,是探索性数据分析中的重要工具。浅色表示更高的正相关,深色表示较强的负相关,绿色的相关性接近零。

特征提取
特征选择是通过开源机器学习库中的RandomForestClassifier实现的随机森林特征重要性实现的。特征重要性评分基于杂质的平均减少度计算,并据此对特征进行排名。排名前N的特征被保留用于后续分析。特征选择是在所有预处理步骤完成后、列车-测试拆分之前进行的,确保所有分类模型和集合配置中使用固定且一致的特征集(见图4)。

图4
图4 使用随机森林特征重要性计算的特征重要性评分。特征按归一化重要性值进行排名。 请点击此处查看该图的放大版本。

特征根据随机森林特征重要性的平均减少率进行排名,random_state = 42;但所有可用特征(N = 11)都被保留用于后续模型训练。特征选择是在预处理后、列车-测试拆分前进行的,确保所有模型的特征集固定。

模型训练与集合构建
数据集被按80:20的比例与train_test_split()函数划分为训练和测试子集。训练数据专门用于模型开发和集成构建,测试数据则保留用于性能评估。基础分类器,包括决策树、随机森林、AdaBoost和XGBoost,除非另有说明,均使用默认超参数设置在训练数据集上进行训练。

使用投票分类器构建了硬投票和软投票集合模型,所有基础分类器权重相等,以确保客观比较。采用逻辑回归作为元分类器实现了堆叠集成模型。该元分类器基于通过对基础分类器进行五重交叉验证生成的非折叠预测训练,减少了过度拟合,并实现了对集合性能的无偏估计。

拟议模型
所提出的集合框架被实现为利用多种集合学习策略构建复合分类器。所有训练数据均经过标准化,测试数据采用相同的预处理步骤,以确保训练与评估阶段的一致性。基础分类器通过硬投票、软投票和叠加机制进行了集成,堆叠元分类器则通过逻辑回归对交叉验证的预测进行训练。集合框架的整体架构和数据流(见图5)。

图5
图5 拟议模型的架构。 请点击此处查看该图的放大版本。

一级
在集合框架的第一级,四个基础分类器——随机森林、决策树、XGBoost和AdaBoost——使用缩放训练数据集进行训练。这些基础分类器被组合起来构建了硬投票和软投票的集合模型。为保持客观性并防止在集成构建过程中因权重差异而产生的偏差,所有基础分类器均被赋予相等权重。

第二级:
在第二级,通过结合基础分类器生成的预测实现了堆叠集合分类器。基础分类器通过五折交叉验证训练,每个折叠生成了非折叠预测。这些折叠外的预测随后被用作输入特征,用于训练逻辑回归元分类器,从而减少过拟合,实现对集合性能的无偏估计。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本节介绍了数据预处理和特征选择的影响,比较单个和集合分类器的性能,并总结了跨标准评估指标的基准测试结果。数据预处理,包括缺失值消除、类平衡和特征缩放,使所有分类器之间的输入分布保持一致。在预处理数据上训练的模型在重复的5折交叉验证运行和训练-测试分段中表现变异性低于未处理基线。特别是,阶级平衡在所有评估模型中持续提升了少数族裔阶级的回忆率。

采用基于随机森林的特征重要性排序来评估每个特征的相对贡献;但所有可用的输入特征都被保留用于模型训练,并在所有分类器中统一应用。特征选择提高了模型稳定性并减少了过拟合,表现为5重交叉验证运行中性能指标的更低标准差。在本研究中,“优化”特指对特征集和集合配置的细化,而非超参数调优。

在性能评估中,使用分类准确性、类别特定精度、召回率和F1分数等指标以确保错误感知性能评估。.RF、DT、XGBoost和AdaBoost等个别分类器的性能因类别而异,而硬投票、软投票和堆叠等集合技术则提升了准确性和召回性的权衡,尤其是对少数群体而言。

比较了单...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究表明,基于堆叠的集合学习在标准化的预处理和基准测试条件下,始终优于单个分类器和基于投票的集合实现了更优越且更稳定的分类性能。

本研究观察到的集合表现一致性,强化了方法论严谨性在比较机器学习研究中的重要性(19,20,21,22,23,24,25)。通过控制所有模型的预处理、特征选择和验证程序,所提框架最大限度地减少了实验偏差,并使得对集合学习策略的评估更加可靠,这与以往基准研究中已确立的最佳实践一致(26,27

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明与本研究工作无利益冲突。本稿中呈现的结果、分析或结论,均未受到任何财务、个人或职业关系的影响。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者承认使用了支持本研究的公开数据集和开源软件资源。作者还感谢各自机构,包括布巴内斯瓦尔斯里斯里大学和SOA大学,为开展这项工作提供了必要的学术环境和研究设施。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoost分类器scikit-learn 开发者用于基准测试的集合提升分类器
朱皮特笔记本朱比特计划计算笔记本环境
Kaggle Heart 统计日志(克利夫兰–匈牙利)数据集卡格尔公开心血管数据集(1190个实例,11个特征)。网址:https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
逻辑回归scikit-learn 开发者堆叠集合中使用的元分类器
MatplotlibMatplotlib 开发团队数据可视化库
数字派NumPy 开发者数值计算库
pandas(版本 1.5.3)熊猫开发团队数据预处理与处理
Python(版本3.9)Python 软件基础用于实现的编程环境
随机森林分类器scikit-learn 开发者基分类器和特征重要性计算
海本海本开发团队相关矩阵的热图可视化
标准缩放器scikit-learn 开发者特征缩放函数
投票分类器scikit-learn 开发者硬投票和软投票集合的实现
XGBoost分类器DMLC梯度提升分类器作为基础学习器使用

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles