В данной статье представлена вычислительная оценка алгоритмов ансамблевого обучения при прогнозировании сердечных заболеваний, объединяя различные алгоритмы машинного обучения, такие как жёсткое голосование, мягкое голосование и стекирование, в одном фреймворке. Оценка проводилась на основе общедоступного набора сердечно-сосудистых данных, полученных из репозитория Kaggle (https://www.kaggle.com/datasets/sid321axn/heart-statlog-cleveland-hungary-final), включающего 1 190 экземпляров и 11 клинических признаков. Процесс включает предварительную обработку данных, которая включает обработку отсутствующих значений, удаление выбросов, масштабирование переменных и балансировку классов для обеспечения единообразного выбора входных признаков на основе Random Forest (RF) и устранения ненужных признаков. Среди оценённых моделей классификатор стекового ансамбля достиг самой высокой общей точности — 91,88% на тестовом наборе. Хотя для сравнительного анализа были рассчитаны дополнительные метрики, такие как точность, воспоминание и оценка F1, акцент в этом исследовании по-прежнему уделяется методологическому бенчмаркингу, а не клинической валидации.
Различные базовые классификаторы, включая Decision Tree, Random Forest, AdaBoost и XGBoost, применяются и тестируются независимо. Эти модели затем комбинируются с помощью ансамблевых техник с жёстким голосованием, мягким голосованием и стекированием. В стекировании в качестве метамодели используется логистическая регрессия, которая обучается на перекрёстно валидированных прогнозах вне-фолдированных выборок для предотвращения перенагона.
Оценки проводятся с использованием точности в качестве основного критерия сравнения, чтобы отдельные системы классификации и их комбинационные стратегии можно было сравнивать одинаково, в одной среде предварительной обработки и валидации. Хотя показатели эффективности предоставляются для сравнительных показаний, акцент подхода делается на разработке и оценке стратегий, а не на их клинической оценке.
Этот протокол облегчает сравнение алгоритмов ансамблевого машинного обучения с общедоступными наборами сердечно-сосудистых данных и помогает систематически сравнивать подходы к предварительной обработке данных и конфигурации ансамбля.