Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Сравнительная оценка подходов ансамблевого машинного обучения для прогнозирования сердечно-сосудистых заболеваний

216 просмотров

DOI:

10.3791/70124

10 апреля 2026 г.

В этой статье

Краткое содержание

Этот протокол описывает вычислительный процесс создания и оценки моделей машинного обучения ансамбля для прогнозирования сердечно-сосудистых заболеваний с использованием общедоступных эталонных данных в воспроизводимой структуре предварительной обработки и оценки.

Аннотация

В данной статье представлена вычислительная оценка алгоритмов ансамблевого обучения при прогнозировании сердечных заболеваний, объединяя различные алгоритмы машинного обучения, такие как жёсткое голосование, мягкое голосование и стекирование, в одном фреймворке. Оценка проводилась на основе общедоступного набора сердечно-сосудистых данных, полученных из репозитория Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), включающего 1 190 экземпляров и 11 клинических признаков. Процесс включает предварительную обработку данных, которая включает обработку отсутствующих значений, удаление выбросов, масштабирование переменных и балансировку классов для обеспечения единообразного выбора входных признаков на основе Random Forest (RF) и устранения ненужных признаков. Среди оценённых моделей классификатор стекового ансамбля достиг самой высокой общей точности — 91,88% на тестовом наборе. Хотя для сравнительного анализа были рассчитаны дополнительные метрики, такие как точность, воспоминание и оценка F1, акцент в этом исследовании по-прежнему уделяется методологическому бенчмаркингу, а не клинической валидации.

Различные базовые классификаторы, включая Decision Tree, Random Forest, AdaBoost и XGBoost, применяются и тестируются независимо. Эти модели затем комбинируются с помощью ансамблевых техник с жёстким голосованием, мягким голосованием и стекированием. В стекировании в качестве метамодели используется логистическая регрессия, которая обучается на перекрёстно валидированных прогнозах вне-фолдированных выборок для предотвращения перенагона.

Оценки проводятся с использованием точности в качестве основного критерия сравнения, чтобы отдельные системы классификации и их комбинационные стратегии можно было сравнивать одинаково, в одной среде предварительной обработки и валидации. Хотя показатели эффективности предоставляются для сравнительных показаний, акцент подхода делается на разработке и оценке стратегий, а не на их клинической оценке.

Этот протокол облегчает сравнение алгоритмов ансамблевого машинного обучения с общедоступными наборами сердечно-сосудистых данных и помогает систематически сравнивать подходы к предварительной обработке данных и конфигурации ансамбля.

Введение

Общедоступные наборы данных по сердечно-сосудистым заболеваниям широко используются в качестве эталонных задач в исследованиях машинного обучения для оценки алгоритмов классификации и методов предиктивногомоделирования 1,2,3. Такие наборы данных, содержащие клинические и демографические характеристики, предоставляют стандартизированную и воспроизводимую основу для сравнения стратегий предварительной обработки, методов выбора признаков и архитектур ансамблевого обучения в контролируемых экспериментальных условиях. В результате их обычно применяют для оценки алгоритмического по....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Этот протокол описывал воспроизводимый вычислительный рабочий процесс для бенчмаркинга ансамблевых моделей машинного обучения с использованием общедоступного набора данных по сердечно-сосудистым заболеваниям.

Выбор набора данных
В исследовании использовался общедоступный набор данных по сердечно-сосудистым заболеваниям, полученный из репозитория Kaggle. Набор данных включал 1190 экземпляров и 11 функций. Для обучения моделей использовалось 80% данных, а оставшиеся 20% — для оценки эффективности. В таблице 1 подробно описаны особенности набора данных. Набор данных был загружен в Python (версия 3.9) с испо....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

В этом разделе представлены эффекты предварительной обработки данных и выбора признаков, сравниваются результаты отдельных и ансамблевых классификаторов и резюмируются результаты бенчмаркинга по стандартным метрикам оценки. Предварительная обработка данных, включая удаление отсутствующих значений, балансировку классов и масштабирование признаков, обеспечивала единообразные входные распределения между всеми классификаторами. Модели, обучающиеся на предварительно обработанных данных, демонстрировали меньшую вариабельность .......

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Это исследование демонстрирует, что ансамблевое обучение на основе стека стабильно обеспечивало более высокие и стабильные результаты классификации по сравнению с отдельными классификаторами и ансамблями на основе голосования при стандартизированных условиях предварительной обработки и бенчмаркинга.

Согласованность ансамблевого исполнения, наблюдаемая в этом исследовании, подчёркивает важность методологической строгости в сравнительных исследованиях машинного<.......

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы заявляют, что у них нет конфликтов интересов, связанных с этим исследованием. Никакие финансовые, личные или профессиональные отношения не повлияли на результаты, анализ или выводы, представленные в этой рукописи.

Благодарности

Авторы признают использование общедоступных наборов данных и открытых программных ресурсов, которые поддерживали это исследование. Авторы также благодарят свои учреждения, включая Университет Шри Шри в Бхубанешваре и Университет SOA в Бхубанешваре, за предоставление академической среды и исследовательских возможностей, необходимых для проведения этой работы.

....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
AdaBoostClassifierРазработчики scikit-learnН/ДКлассификатор усиления ансамбля, используемый для бенчмаркинга
Блокнот JupyterПроект JupyterН/ДСреда вычислительной тетради
Kaggle Heart Statlog (Cleveland– Венгрия) Набор данныхКагглН/ДПубличный набор данных по сердечно-сосудистым заболеваниям (1190 случаев, 11 особенностей). URL: https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final
Логистическая регрессияРазработчики scikit-learnН/ДМета-классификатор, используемый в стекировании ансамбля
MatplotlibКоманда разработчиков MatplotlibН/ДБиблиотека визуализации данных
NumPyРазработчики NumPyН/ДБиблиотека численных вычислений
Панды (версия 1.5.3)Команда разработки пандН/ДПредварительная обработка и обработка данных
Python (версия 3.9)Фонд программного обеспечения PythonН/ДПрограммная среда, используемая для реализации
RandomForestClassifierРазработчики scikit-learnН/ДВычисление базового классификатора и важности признаков
СиборнКоманда разработчиков SeabornН/ДВизуализация тепловой карты матрицы корреляции
StandardScalerРазработчики scikit-learnН/ДФункция масштабирования признаков
Классификатор голосованияРазработчики scikit-learnН/ДРеализация жёсткой и мягкой системы голосования
XGBoostClassifierDMLCН/ДКлассификатор усилия градиента, используемый как базовый обучающийся

Ссылки

  1. Libby, P., Bonow, R. O., et al. Braunwald’s Heart Disease: A Textbook of Cardiovascular Medicine. Elsevier Health Sci. 9, (2011).
  2. Nayak, O., Pallapothala, T., Gupta, G. P. Heart disease prediction framework using soft voting-based ensemble learning techniques. Convergence of Big Data Technologies and Computational Intellig....

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги