Research Article

Сравнительная оценка подходов ансамблевого машинного обучения для прогнозирования сердечно-сосудистых заболеваний

DOI:

10.3791/70124

April 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывает вычислительный процесс создания и оценки моделей машинного обучения ансамбля для прогнозирования сердечно-сосудистых заболеваний с использованием общедоступных эталонных данных в воспроизводимой структуре предварительной обработки и оценки.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной статье представлена вычислительная оценка алгоритмов ансамблевого обучения при прогнозировании сердечных заболеваний, объединяя различные алгоритмы машинного обучения, такие как жёсткое голосование, мягкое голосование и стекирование, в одном фреймворке. Оценка проводилась на основе общедоступного набора сердечно-сосудистых данных, полученных из репозитория Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), включающего 1 190 экземпляров и 11 клинических признаков. Процесс включает предварительную обработку данных, которая включает обработку отсутствующих значений, удаление выбросов, масштабирование переменных и балансировку классов для обеспечения единообразного выбора входных признаков на основе Random Forest (RF) и устранения ненужных признаков. Среди оценённых моделей классификатор стекового ансамбля достиг самой высокой общей точности — 91,88% на тестовом наборе. Хотя для сравнительного анализа были рассчитаны дополнительные метрики, такие как точность, воспоминание и оценка F1, акцент в этом исследовании по-прежнему уделяется методологическому бенчмаркингу, а не клинической валидации.

Различные базовые классификаторы, включая Decision Tree, Random Forest, AdaBoost и XGBoost, применяются и тестируются независимо. Эти модели затем комбинируются с помощью ансамблевых техник с жёстким голосованием, мягким голосованием и стекированием. В стекировании в качестве метамодели используется логистическая регрессия, которая обучается на перекрёстно валидированных прогнозах вне-фолдированных выборок для предотвращения перенагона.

Оценки проводятся с использованием точности в качестве основного критерия сравнения, чтобы отдельные системы классификации и их комбинационные стратегии можно было сравнивать одинаково, в одной среде предварительной обработки и валидации. Хотя показатели эффективности предоставляются для сравнительных показаний, акцент подхода делается на разработке и оценке стратегий, а не на их клинической оценке.

Этот протокол облегчает сравнение алгоритмов ансамблевого машинного обучения с общедоступными наборами сердечно-сосудистых данных и помогает систематически сравнивать подходы к предварительной обработке данных и конфигурации ансамбля.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Общедоступные наборы данных по сердечно-сосудистым заболеваниям широко используются в качестве эталонных задач в исследованиях машинного обучения для оценки алгоритмов классификации и методов предиктивногомоделирования 1,2,3. Такие наборы данных, содержащие клинические и демографические характеристики, предоставляют стандартизированную и воспроизводимую основу для сравнения стратегий предварительной обработки, методов выбора признаков и архитектур ансамблевого обучения в контролируемых экспериментальных условиях. В результате их обычно применяют для оценки алгоритмического поведения, а не для поддержки клинических выводов или реальногоприменения 4,5.

Ранее исследования касались различных методов машинного обучения для прогнозирования сердечно-сосудистых заболеваний, таких как логистическая регрессия (LR), поддерживающие векторные машины (SVM), случайные леса (RF) и модели градиентного бустинга 6,7,8,9. В последнее время исследования сосредоточены на методах ансамблевого обучения, таких как жёсткое голосование, мягкое голосование и стекирование, чтобы сделать модели более стабильными и улучшить ихпроизводительность 10,11,12,13,14. Однако различия в том, как подготовляются данные, обрабатываются особенности, проводится валидация и измеряются результаты в этих исследованиях, затрудняют прямое сравнение опубликованных результатов. Для получения высокоуровневого контекстного обзора категорий сердечно-сосудистых заболеваний, часто описанных в литературе, концептуальная иллюстрация представлена на рисунке 1.

Рисунок 1
Рисунок 1: Концептуальная иллюстрация часто сообщаемых категорий сердечно-сосудистых заболеваний, включена только для контекста. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 1 включён исключительно для контекста на высоком уровне и не представляет данные, полученные из анализируемого в данном исследовании набора данных или любых результатов предлагаемого вычислительного протокола.

В частности, многие существующие работы делают акцент на результатах исполнения, не выделяя чётко вклад отдельных методологических компонентов, таких как тайминг выбора признаков, балансировка классов или конфигурацияансамбля 15,16,17,18. Эта вариабельность подчёркивает необходимость воспроизводимого фреймворка бенчмаркинга, который систематически оценивает методы ансамблевого машинного обучения с использованием согласованного конвейера предварительной обработки и протокола оценки на общедоступном наборе данных.

Существует гипотеза, что методы ансамблевого обучения, особенно методы стекирования, продемонстрируют повышенную точность классификации и сбалансированную производительность по классам по сравнению с отдельными базовыми классификаторами при стандартизированных условиях предварительной обработки и валидации.

Соответственно, цель данного исследования — провести вычислительный бенчмаркинговый анализ методов машинного обучения ансамбля для прогнозирования сердечно-сосудистых заболеваний с использованием общедоступного набора данных Kaggle. Процесс включает стандартизированную предобработку данных, использование алгоритма Random Forest для ранжирования важности признаков, а также применение различных ансамблевых техник, включая жёсткое голосование, мягкое голосование и стекирование. Логистическая регрессия используется в качестве алгоритма метаклассификатора при стекировании. Это гарантирует отсутствие перенагона, поскольку используется перекрёстно проверенные прогнозы.

Это исследование предназначено исключительно как исследование публичного бенчмаркинга наборов данных. Её результаты ограничены зависимостью от одного набора данных и возможными специфическими для него предвзятости, поэтому не подразумевают клиническую валидацию или внедрение. Перед рассмотрением любого клинического применения требуется внешняя валидация с использованием независимых наборов данных и проспективная оценка.

Следующие исследовательские вопросы направляют это исследование:

В данном исследовании рассматривается, как различные подходы к ансамблевому машинному обучению, включая жёсткое голосование, мягкое голосование и стекирование, сравниваются по точности классификации при применении к общедоступному набору данных по сердечно-сосудистым заболеваниям.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол описывал воспроизводимый вычислительный рабочий процесс для бенчмаркинга ансамблевых моделей машинного обучения с использованием общедоступного набора данных по сердечно-сосудистым заболеваниям.

Выбор набора данных
В исследовании использовался общедоступный набор данных по сердечно-сосудистым заболеваниям, полученный из репозитория Kaggle. Набор данных включал 1190 экземпляров и 11 функций. Для обучения моделей использовалось 80% данных, а оставшиеся 20% — для оценки эффективности. В таблице 1 подробно описаны особенности набора данных. Набор данных был загружен в Python (версия 3.9) с использованием библиотеки pandas (версия 1.5.3). Целостность набора данных проверялась путём анализа отсутствующих значений, дублирующихся записей и несогласованных типов данных.

Таблица 1 суммирует демографические, клинические и экспериментальные характеристики, включённые в набор данных по сердечно-сосудистым заболеваниям, а также их типы данных и кодированные форматы. Эти особенности стали входными переменными для всех последующих процедур обучения и оценки моделей.

Сл. НетНазвание объектаТип данныхОписание
1ВозрастЧисленныеВозраст пациента в годах.
2ПолНоминальныйМужчина — как 1, а женщина — как 0.
3Тип боли в грудиКатегорическая1: Типичная 2: Типичная стенокардия 3: Нестенокардическая боль 4: Бессимптомная
4Отдыхающий тискЧисленныеАртериальное давление в покое измеряется в миллиметрах ртуть (мм рт. ст.).
5Уровень холестеринаЧисленныеХолестерин в сыворотке в миллиграммах на децилитр (мг/дл).
6Уровень сахара натощакНоминальныйУровень сахара в крови выше 120 мг/дл во время голодания обозначается как 1 для истинного и 0 для ложного.
7Покоящая ЭКГкатегорическиТри различных значения присваиваются следующим образом: 0 — нормально, 1 — аномалия в волне ST-T, и 2 — гипертрофия левого желудочка.
8Максимальная частота сердечных сокращенийЧисленныеДостигнутая максимальная частота сердечных сокращений
9Упражнения на стенокардиюНоминальныйСтенокардия, вызванная физическими упражнениями, где 0 означает НЕТ, а 1 — да.
10ОлдпикЧисленныеST-депрессия во время упражнений по сравнению с состоянием покоя.
11Уклон STкатегорическиУклон сегмента ST во время пиковой нагрузки классифицируется следующим образом: 0: Норма 1: Восходящий уклон 2: Плоский 3: Нисходящий

Таблица 1: Описание особенностей набора данных, используемых для прогнозирования сердечно-сосудистых заболеваний.

Предварительная обработка данных
Предварительная обработка данных проводилась с использованием библиотек Python. Строки с отсутствующими значениями удалялись с помощью panda. DataFrame.dropna() функция. Выбросы в числовых признаках были выявлены и удалены с помощью метода межквартильного диапазона (IQR) и визуализации на основе boxplot, что иллюстрирует распределение и выявленные выбросы между объектами (рисунок 2). Все числовые переменные масштабировались с помощью функции StandardScaler из библиотеки scikit-learn (версия 1.2.2). Дисбаланс классов устранялся случайным недовыборкой для получения сбалансированного распределения классов до обучения модели.

Рисунок 2
Рисунок 2: График всех атрибутов в наборе данных по сердечно-сосудистым заболеваниям. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Коэффициент корреляции Пирсона (PCC) использовался для оценки взаимосвязей между признаками. Полученная матрица корреляции, визуализированная в виде тепловой карты, иллюстрирует силу и направление парных корреляций признаков и выделяет избыточные атрибуты для исключения (см. рисунок 3).

Рисунок 3
Рисунок 3: Корреляционная матрица для набора данных по сердечно-сосудистым заболеваниям. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Модель создаёт тепловую карту матрицы корреляции, которая выглядит эстетически приятно и позволяет быстрее понимать корреляции между различными признаками в данных. Эта тепловая карта использует цвета, чтобы показать, насколько и в каком направлении значения коррелированы, что делает её важным инструментом в исследовательском анализе данных. Светлые цвета показывают более высокие положительные корреляции, тёмные — более отрицательные корреляции, а больше зелёных — корреляции близко к нулю.

Извлечение признаков
Выбор признаков осуществлялся с использованием важности признаков случайного леса, реализуемого через RandomForestClassifier в открытых библиотеках машинного обучения. Оценки важности признаков рассчитывались на основе среднего снижения примесей и ранжировались соответственно. Лучшие рейтинговые характеристики были сохранены для последующего анализа. Выбор признаков применялся после завершения всех этапов предварительной обработки и до разделения «train–test», что обеспечивало использование фиксированного и согласованного набора признаков во всех моделях классификации и конфигурациях ансамбля (рисунок 4).

Рисунок 4
Рисунок 4: Показатели важности признаков, рассчитанные с использованием случайного леса. Признаки ранжируются по нормированному значению важности. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Признаки ранжировались на основе среднего снижения примесей по важности признаков случайного леса с random_state = 42; однако все доступные функции (N = 11) были сохранены для последующего обучения моделей. Выбор признаков применялся после предварительной обработки и до разделения «тренировка–тест», обеспечивая фиксированный набор признаков для всех моделей.

Обучение моделям и создание ансамбля
Набор данных был разбит на учебные и тестовые подмножества с использованием соотношения 80:20 с функцией train_test_split(). Обучающие данные использовались исключительно для разработки моделей и создания ансамбля, а данные тестирования были зарезервированы для оценки производительности. Базовые классификаторы, включая Decision Tree, Random Forest, AdaBoost и XGBoost, тренировались на обучающем наборе данных с использованием стандартных настроек гиперпараметров, если не указано иное.

С использованием VotingClassifier были построены модели жёсткого голосования и мягкого голосования с равными весами, присвоенными всем базовым классификаторам для обеспечения объективного сравнения. Была реализована модель стекового ансамбля с использованием логистической регрессии в качестве метаклассификатора. Метаклассификатор тренировался на вне-развершённых предсказаниях, полученных через пятикратную перекрестную валидацию базовых классификаторов, что снизило перенагонку и позволило объективно оценивать производительность ансамбля.

Предлагаемая модель
Предлагаемая ансамблевая структура была реализована для создания составного классификатора с использованием нескольких стратегий обучения ансамбля. Все обучающие данные были стандартизированы, и идентичные этапы предварительной обработки применялись к тестовым данным для обеспечения согласованности между этапами обучения и оценки. Базовые классификаторы были интегрированы с использованием механизмов жёсткого голосования, мягкого голосования и стекирования, а мета-классификатор стекирования обучался с использованием логистической регрессии на перекрёстно-валидированных прогнозах. Общая архитектура и поток данных ансамблевой структуры (рисунок 5).

Рисунок 5
Рисунок 5: Архитектура предлагаемой модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Уровень I:
На уровне I ансамблевого фреймворка четыре базовых классификатора — Random Forest, Decision Tree, XGBoost и AdaBoost — были обучены с использованием масштабируемого обучающего набора данных. Эти базовые классификаторы были объединены для создания как моделей жёсткого, так и мягкого голосования. Всем базовым классификаторам присваивались равные веса для сохранения объективности и предотвращения смещения, возникающего при дифференциальной настройке весов при построении ансамбля.

Уровень-II:
На втором уровне классификатор ансамблевого стека реализовывался путём объединения предсказаний, сгенерированных базовыми классификаторами. Базовые классификаторы обучались с помощью пятикратной перекрестной валидации, и для каждого сворачивания генерировались предсказания вне разворок. Эти прогнозы вне разворачивания затем использовались как входные характеристики для обучения метаклассификатора логистической регрессии, что снижало переподгонку и обеспечивало беспристрастную оценку работы ансамбля.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом разделе представлены эффекты предварительной обработки данных и выбора признаков, сравниваются результаты отдельных и ансамблевых классификаторов и резюмируются результаты бенчмаркинга по стандартным метрикам оценки. Предварительная обработка данных, включая удаление отсутствующих значений, балансировку классов и масштабирование признаков, обеспечивала единообразные входные распределения между всеми классификаторами. Модели, обучающиеся на предварительно обработанных данных, демонстрировали меньшую вариабельность ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование демонстрирует, что ансамблевое обучение на основе стека стабильно обеспечивало более высокие и стабильные результаты классификации по сравнению с отдельными классификаторами и ансамблями на основе голосования при стандартизированных условиях предварительной обработки и бенчмаркинга.

Согласованность ансамблевого исполнения, наблюдаемая в этом исследовании, подчёркивает важность методологической строгости в сравнительных исследованиях машинного<...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликтов интересов, связанных с этим исследованием. Никакие финансовые, личные или профессиональные отношения не повлияли на результаты, анализ или выводы, представленные в этой рукописи.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы признают использование общедоступных наборов данных и открытых программных ресурсов, которые поддерживали это исследование. Авторы также благодарят свои учреждения, включая Университет Шри Шри в Бхубанешваре и Университет SOA в Бхубанешваре, за предоставление академической среды и исследовательских возможностей, необходимых для проведения этой работы.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AdaBoostClassifierРазработчики scikit-learnН/ДКлассификатор усиления ансамбля, используемый для бенчмаркинга
Блокнот JupyterПроект JupyterН/ДСреда вычислительной тетради
Kaggle Heart Statlog (Cleveland– Венгрия) Набор данныхКагглН/ДПубличный набор данных по сердечно-сосудистым заболеваниям (1190 случаев, 11 особенностей). URL: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
Логистическая регрессияРазработчики scikit-learnН/ДМета-классификатор, используемый в стекировании ансамбля
MatplotlibКоманда разработчиков MatplotlibН/ДБиблиотека визуализации данных
NumPyРазработчики NumPyН/ДБиблиотека численных вычислений
Панды (версия 1.5.3)Команда разработки пандН/ДПредварительная обработка и обработка данных
Python (версия 3.9)Фонд программного обеспечения PythonН/ДПрограммная среда, используемая для реализации
RandomForestClassifierРазработчики scikit-learnН/ДВычисление базового классификатора и важности признаков
СиборнКоманда разработчиков SeabornН/ДВизуализация тепловой карты матрицы корреляции
StandardScalerРазработчики scikit-learnН/ДФункция масштабирования признаков
Классификатор голосованияРазработчики scikit-learnН/ДРеализация жёсткой и мягкой системы голосования
XGBoostClassifierDMLCН/ДКлассификатор усилия градиента, используемый как базовый обучающийся

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intelligent Techniques. IGI Global. , IGI Global. 147-165 (2023).
  3. Gaidai, O., Yan, P., Xing, Y. Future world cancer death rate prediction. Sci Rep. 13 (1), 303(2023).
  4. Imran, M., et al. A hybrid ensemble framework for cardiac disease risk stratification with machine learning. J Popul Ther Clin Pharmacol. 30 (18), 1336-1353 (2023).
  5. Elhneiti, M., Al-Hussami, M. Predicting risk factors of heart disease among Jordanian patients. Health. 9 (2), 237-247 (2017).
  6. Sevakula, R. K., Verma, N. K. Assessing generalization ability of majority vote point classifiers. IEEE Trans Neural Netw Learn Syst. 28 (12), 2985-2997 (2017).
  7. Li, H., et al. Ensemble learning for overall power conversion efficiency of all-organic dye-sensitized solar cells. IEEE Access. 6, 34118-34126 (2018).
  8. Chicco, D., Jurman, G. Machine learning can predict survival of patients with heart failure from serum creatinine and ejection fraction alone. BMC Med Inform Decis Mak. 20 (1), 16(2020).
  9. Predicting the survival of heart failure patients in unbalanced data sets. Türkmenoğlu, B. K., Yildiz, O. In Proc. 29th Signal Process Commun Appl Conf (SIU), , IEEE. 1-4 (2021).
  10. Wang, B., et al. A multi-task neural network architecture for renal dysfunction prediction in heart failure patients with electronic health records. IEEE Access. 7, 178392-178400 (2019).
  11. Amin, M. S., Chiam, Y. K., Varathan, K. D. Identification of significant features and data mining techniques in predicting heart disease. Telemat Inform. 36, 82-93 (2019).
  12. Gao, X. Y., et al. Improving the accuracy for analyzing heart diseases prediction based on the ensemble method. Complexity. 2021, 1-10 (2021).
  13. Hasan, N., Bao, Y. Comparing different feature selection algorithms for cardiovascular disease prediction. Health Technol. 11, 49-62 (2021).
  14. Pan, C., et al. Impact of categorical and numerical features in ensemble machine learning frameworks for heart disease prediction. Biomed Signal Process Control. 76, 103666(2022).
  15. Renugadevi, G., et al. Predicting heart disease using hybrid machine learning model. J Phys Conf. 1916 (1), 012208(2021).
  16. Rani, P., et al. A decision support system for heart disease prediction based upon machine learning. J Reliab Intell Environ. 7 (3), 263-275 (2021).
  17. Fayez, M., Kurnaz, S. Novel method for diagnosis diseases using advanced high-performance machine learning system. Appl Nanosci. 11, 1-7 (2021).
  18. Mohri, M., Rostamizadeh, A., Talwalkar, A. Introduction. Foundations of Machine Learning. , 2nd ed, MIT Press. 1-7 (2018).
  19. Kelleher, J. D., Mac Namee, B., D’Arcy, A. Fundamentals of Machine Learning for Predictive Data Analytics. , MIT Press. (2020).
  20. Wittek, P. Quantum Machine Learning: What Quantum Computing Means to Data Mining. , Academic Press. (2014).
  21. Sridhar, C., et al. Optimal medical image size reduction model creation using recurrent neural network and GenPSOWVQ. J Healthc Eng. 2022, 1-12 (2022).
  22. Dalal, S., et al. A hybrid machine learning model for timely prediction of breast cancer. Int J Model Simul Sci Comput. 14 (4), 2341023(2023).
  23. Edeh, M. O., et al. Artificial intelligence-based ensemble learning model for prediction of hepatitis C disease. Front Public Health. 10, 892371(2022).
  24. Latha, C. B. C., Jeeva, S. C. Improving the accuracy of prediction of heart disease risk based on ensemble classification techniques. Inform Med Unlocked. 16, 100203(2019).
  25. Bhatt, C. M., et al. Effective heart disease prediction using machine learning techniques. Algorithms. 16 (2), 88(2023).
  26. Khan, A., et al. A novel study on machine learning algorithm-based cardiovascular disease prediction. Health Soc Care Community. 2023, 1-12 (2023).
  27. García-Ordás, M. T., et al. Heart disease risk prediction using deep learning techniques with feature augmentation. Multimed Tools Appl. 82, 1-15 (2023).
  28. Tiwari, A., Chugh, A., Sharma, A. Ensemble framework for cardiovascular disease prediction. Comput Biol Med. 146, 105624(2022).
  29. Chowdary, K. R., et al. Early heart disease prediction using ensemble learning techniques. J Phys Conf Ser. 2325 (1), 012051(2022).
  30. Alqahtani, A., et al. Cardiovascular disease detection using ensemble learning. Comput Intell Neurosci. 2022, 1-10 (2022).
  31. Naser, M. A., et al. A review of machine learning’s role in cardiovascular disease prediction: recent advances and future challenges. Algorithms. 17 (2), 78(2024).
  32. Vara, N. V. D. S. S., et al. AI-assisted medical imaging and heart disease diagnosis using ensemble classifiers. J Artif Intell Gen Sci. 6 (1), 210-229 (2024).
  33. Gnanavelu, A., et al. Cardiovascular disease prediction using machine learning metrics. J Young Pharm. 17 (1), 226-233 (2025).
  34. Pal, P., et al. Interactive cardiovascular disease prediction system using learning techniques. Results Control Optim. 19, 100560(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Ensemble LearningHeart Disease PredictionMachine Learning AlgorithmsStacking ClassifierHard VotingSoft VotingRandom ForestData PreprocessingFeature SelectionCardiovascular Dataset

Related Articles