Исследовательская статья

Вычислительно эффективный гибридный подход для прогнозирования аритмии на основе электрокардиограммы

DOI:

10.3791/69541

22 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Модель в данном исследовании построена для классификации ранних аритмий в наборах данных электрокардиограммы (ЭКГ) из нескольких баз данных по пяти основным типам сердечного ритма. По сравнению с другими моделями, эта модель показывает лучшие результаты по точности, чувствительности, точности и запоминаниям.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сердечно-сосудистые заболевания, особенно аритмии, являются одной из ведущих причин смерти во всём мире. Это подчёркивает необходимость автоматизированных систем, способных выявлять и диагностировать эти состояния на ранних этапах. Это исследование вводит модель глубокого обучения, которая выявляет аритмии с помощью сигналов электрокардиограммы (ЭКГ). Модель сосредоточена на пяти основных типах сердцебиения: нормальном (N), блокаде ветви левого пучка (L), блоке ветви правого пучка (R), преждевременном биении предсердий (A) и преждевременном сокращении желудочков (V). Система использует сигналы Lead I из нескольких баз данных, включая аритмию MIT-BIH, сувентрикулярные, INCART 12-lead и внезапную сердечную смерть Holter. Это обеспечивает более 3,9 миллиона учебных сегментов и 112 575 тестовых сегментов.

Данные предварительно обрабатываются путём их разделения на фиксированные окна по 180 выборок, масштабирования с помощью нормализации Min-Max и балансировки классов с помощью техники синтетического меньшинства перевыборки. Модель объединяет одномерные сверточные нейронные сети для извлечения пространственных признаков и слои трансформеров для фиксации временных паттернов. Он использует оптимизатор Adam и включает выпадающую и пакетную нормализацию для повышения производительности. Система достигает точности, точности и результатов F1 во всех классах, что лучше, чем у модели TN4 и других высокопроизводительных моделей. Использование сверточных нейронных сетей и глубоких гибридных архитектур повышает устойчивость характеристик. Эта модель демонстрирует большой потенциал для масштабируемого и в реальном времени обнаружения аритмий и способствует развитию персонализированной цифровой медицины на базе искусственного интеллекта.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сердечно-сосудистые заболевания являются самой значительной причиной проблем со здоровьем человека, ежегодно умирает более 17 миллионов человек. Почти три четверти всех случаев сердечно-сосудистых заболеваний (ССЗ) проживают в странах с низким уровнем дохода, согласно данным Всемирной федерации сердца. Электрокардиограмма (ЭКГ) фиксирует электрическую активность, вызванную деполяризацией сердца. Электрические сигналы распространяются на кожу. Сигналы ЭКГ передают как минимум два жизненно важных элемента информации. Одна из них — биомедицина, связанная со здоровьем. Вторая — это персональные данные или биометрия. Из-за своей простоты рассматривались различные методы классификации сигналов ЭКГ, включая самодельные и машинные методы. Ручной метод занимает много времени и неэффективен. Для этого требуется сигналы в реальном времени, такие как ЭКГ, и значительная компьютерная инфраструктура. Методы машинного обучения, скорее всего, дадут более низкую точность по скобкам, чем ручной метод, но необходим подходящий алгоритм для снижения риска невыявленнойаритмии 1.

Наиболее распространённым сердечно-сосудистым заболеванием является аритмия — состояние при нарушении ритма сердечного ритма. Эти аномальные паттерны должны быть классифицированы по классам, поскольку такая информация может повлиять на лечение. ЭКГ широко используется для выявления аномальных сердечных паттернов и прогнозирования сердечных заболеваний, что позволяет их выявлять на ранней стадии. Диагностика аритмии в значительной степени основана на ЭКГ — важном медицинском устройстве, используемом для записи сердечной возбудимости, передачи сигналов и мониторинга восстановления. ЭКГ необходима и надёжна в современной медицине. Автоматизация интерпретации сигналов ЭКГ значительно улучшает клиническую практику и повышает безопасность пациентов. Аритмии — это нарушения сердечного ритма и паттернов. Искусственный интеллект, особенно машинное обучение, является отличным инструментом для прогнозирования заболеваний и анализа мнений, особенно для сердечно-сосудистыхзаболеваний 2.

Различные медицинские данные, такие как медицинские карты, обычно используются в больницах для клинических целей. Медицинские данные также могут генерироваться своевременно для поддержки оптимизации алгоритмов машинного обучения. Машина обучается на наборе данных, который в итоге учится на нём. После обучения он может определить и классифицировать, является ли случай здоровым или основываться на различных характеристиках ихзаписей 3,4. Машины также могут обнаруживать закономерности в данных данных, которые могут быть трудно заметны человеком из-за нехватки времени или ограниченных ресурсов. Для классификации ЭКГ-сигналов использовалось несколько методов, включая K-ближайших соседей (KNN), опорных векторных машин (SVM), нейронных сетей (NN), деревья решений, линейный дискриминантный анализ (LDA) и байесовские классификаторы. SVM считается одним из самых эффективных алгоритмов обучения под контролем для классификации сигналов ЭКГ с целью обнаруженияаритмий 5,6.

Хорошо работающая модель брекета с использованием NN и многослойного перцептрона (MLP) лучше других традиционных методов. Алгоритмы глубокого обучения, такие как искусственные нейронные сети (ANN), успешно применяются в задачах поиска информации, распознавания изображений, обнаружения объектов и обработки языка. CNN широко используются в исследованиях для извлечения стилистических особенностей из волн ЭКГ и их анализа с различными целями, например, для открытия комплекса QRS и сегмента ST или волнP 7,8. 1D CNN учится обнаруживать наиболее значимые признаки сигналов ЭКГ и классифицировать их на пять типов аритмий. Для улучшения качества сигнала применялся фильтр для блуждающего по базовой линии и удаления шума на высокой частоте. Это классифицировало аритмии на пятькатегорий: 9, 10.

Как показано на рисунке 1, P-волна, комплекс QRS и T-волна являются важными частями ЭКГ. P-волна представляет собой деполяризацию предсердий — электрическую активность, вызывающую сокращение предсердий. Комплекс QRS отражает деполяризацию желудочков; Именно электрический импульс запускает сокращение желудочков. Т-волна указывает на реполяризацию желудочков — фазу восстановления желудочков после сокращения. Вместе эти волны представляют собой один полный сердечный цикл. Они жизненно важны для понимания работы сердца и диагностики сердечных проблем11.

Все эти волны представляют собой один сердечный цикл. Они крайне важны для понимания работы сердца и диагностики сердечных заболеваний. Модели глубокого обучения в последнее время добились значительных успехов в компьютерной интерпретации медицинских сигналов, включая сигналы ЭКГ. Традиционные ручные модели машинного обучения на основе функций страдают от проблем масштабируемости и адаптации у разных групп пациентов. Для решения этих проблем появились глубокие модели, такие как CNN, и гибридные модели, сочетающие CNN с повторяющимися моделями, такими как LSTM, которые автоматически изучают релевантные особенности из необработанных сигналов ЭКГ. Это значительно повысило точностьклассификации 12.

В этом исследовании предлагается глубокая система обучения для классификации сигналов ЭКГ на пять категорий сердечных ритмов: нормальный (N), блок ветви левого пучка (L), блок ветви правого пучка (R), преждевременный ритм предсердия (A) и преждевременное сокращение желудочков (V). Для обучения модели мы используем общедоступные наборы данных ЭКГ, такие как база данных MIT-BIH по аритмии и база данных супревентрикулярной системы. Эти наборы данных предварительно обрабатываются и делятся на сегменты фиксированной длины для анализа. Поскольку классовый дисбаланс является распространённой проблемой в данных о аритмии, мы применяем синтетическую технику перевыборки меньшинств (SMOTE) для балансировки обучающих данных. Это гарантирует, что модель сможет эффективно учиться на всех классах и повысить точность при классификации различных типов сердцебиения.

Вдохновлённый недавними достижениями в классификации ЭКГ, включая модели с использованием непрерывных вейвлет-преобразований (CWT) и архитектуры CNN, предлагаемый подход использует как стандартную CNN, так и гибридную модель с использованием слоёв трансформаторов. Объединяя CNN для извлечения пространственных признаков и трансформатор для фиксации временных зависимостей, эта система достигает высокой точности — F1 и точности близко к 100% во всехклассах 13, 14.

«Пространственные признаки» относятся к признакам, связанным с положением или расположением объекта, такими как расстояние, направление и форма. С другой стороны, «временные особенности» описывают элементы, связанные со временем, такие как когда произошло событие, его продолжительность или последовательность событий. По сути, «пространственный» означает «пространство», а «временный» — «время».

Основные цели этого исследования заключались в разработке точной, масштабируемой модели для обнаружения аритмии в реальном времени и поддержке расширяющейся области диагностики на базе ИИ в здравоохранении. Эта система демонстрирует перспективы для мониторинга в реальном времени, обеспечивая раннее выявление и вмешательство пациентов с риском сердечных событий.

Цели этой исследовательской работы многогранны. Во-первых, предлагаемая техника направлена на классифицирование аритмических ударов на пять категорий: нормальные (N), блок ветви левого пучка (L), блок правой ветви расслоения (R), преждевременный биение предсердий (A) и преждевременное сокращение желудочков (V). Во-вторых, цель этого исследования — построить гибридную модель CNN и трансформатора, которая может изучивать как морфологическую, так и временную информацию из сигналов ЭКГ без предварительнойобработки 15. В-третьих, эта предлагаемая техника направлена на предоставление решения, ориентированного на производительность, которое может быть реализовано в реальном времени. В-четвёртых, это исследование будет направлено на демонстрацию улучшения точности и чувствительности предлагаемой модели по сравнению с современнымимоделями 16,17.

Кроме того, для задач биомедицинского прогнозирования были внедрены графовые сверточные сети (GCN), моделирующие взаимодействия между физиологическими факторами внутри структурированного графа, которые могут сыграть роль в будущих моделях классификации аритмий, учитывающих зависимости между лидовами.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этическое заявление
Это исследование полностью опиралось на публичные анонимизированные данные ЭКГ, загруженные с PhysioNet. Все наборы данных, использованные в этом исследовании, изначально были собраны с согласия участников и с этического одобрения соответствующих владельцев данных. Это исследование не требовало сбора данных, экспериментальной работы с людьми или животными, а также личной информации о личности пациентов. Поэтому дополнительное этическое рассмотрение не требовалось.

Методология
Рисунок 2 иллюстрирует рабочий процесс предлагаемой архитектуры.

Сбор данных
Данные ЭКГ собираются из базы данных PhysioNet — популярного хранилища физиологических сигналов. Из базы данных извлекаются несколько наборов данных. Эти наборы данных объединяются в один основной набор данных, включающий различные классы сигналов ЭКГ.

Используемые наборы данных
В этом исследовании использовались несколько общедоступных наборов данных ЭКГ для разработки и оценки модели глубокого обучения для классификации аритмий. Отбор этих наборов данных проводился с осторожностью, учитывая их разнообразие по демографии пациентов и типам аритмий, чтобы обеспечить хорошие результаты предлагаемой модели в различныхсценариях 9. Для этого исследования были объединены только данные Lead-I из базы данных MIT-BIH по аритмии, базы данных MIT-BIH по суправентрикулярной аритмии, базы данных INCART по 12-выводной аритмии Санкт-Петербурга и базы данных Холтера о внезапной сердечной смерти Холтера. Эти наборы данных известны своим высококачественным аннотированными ЭКГ-записями, охватывающими широкий спектр классов аритмий.

Объединённые выше наборы данных включают демографию пациентов, устройства записи, частоты выборки и настройки. Упомянутая выше вариабельность модели улучшает её обобщение, подвергая её воздействию широкого спектра морфологий ЭКГ, шума и ритмов.

Описание наборов данных
База данных по аритмиям MIT-BIH
Набор данных MIT-BIH по аритмии содержит 48 получасовых записей ЭКГ, пронумерованных от 100 до 234. Каждая запись содержит двухканальные ЭКГ-сигналы, оцифрованные с частотой 360 образцов в секунду. Данные хранятся в форматах .dat, .hea и .atr.

База данных MIT-BIH по наджелудочковым аритмиям
Это специфическое подмножество баз данных MIT-BIH. База данных MIT-BIH по суправентрикулярной аритмии включает 78 полноформатных записей ЭКГ продолжительностью от 30 минут до нескольких часов, пронумерованных от 801 до 811. Каждая запись включает двухканальные ЭКГ-сигналы, преобразованные в цифровую форму со скоростью 128 сэмплов в секунду.

Санкт-Петербургская база данных INCART по 12-свинцовой аритмии
Эта база данных включает 75 аннотированных записей, взятых с 32 мониторов Холтера. Каждая запись длится 30 минут и включает 12 стандартных лидов, каждый из которых сэмплируется на частоте 257 Гц. Мощность сигнала варьируется от 250 до 1100 единиц аналогово-цифровых преобразователей на милливольт.

База данных непредвиденных сердечных смертей Холтера
Этот набор данных является одним из многих открытых записей Холтера, фиксирующих фактические случаи желудочковой тахикардии (ВТ) и желудочковой фибрилляции (ВФ). Оба способа могут привести к непредвиденной сердечной смерти. Каждая запись длится 24 часа и сэмплируется на частоте 250 Гц.

Предварительная обработка данных
В этом исследовании использовались четыре публичные базы данных ЭКГ с разными частотами дискретизации: MIT-BIH аритмия (360 Гц), MIT-BIH суправентрикулярная аритмия (128 Гц), St. Petersburg INCART 12-lead (257 Гц) и внезапная сердечная смерть Холтера (250 Гц). Чтобы обеспечить согласованность всех данных и возможность комбинирования при обучении модели, все сигналы ЭКГ были передискретированы до общей частоты 360 Гц, что соответствует базе данных MIT-BIH по аритмии и широко используется как стандарт в исследованиях ЭКГ. Ресемплирование выполнялось с помощью интерполяции с ограниченным диапазоном; изначально сигналы ЭКГ проходили низкочастотную фильтрацию для предотвращения алиасинга, а затем для интерполяции использовалось ядро реконструкции на основе SINC, после чего следовало окончательное ресемплирование на частоте 360 Гц. После повторного сэмплирования каждый сигнал делился на окна по 180 сэмплов, примерно эквивалентно 0,5 с данных, обеспечивая одинаковое временное разрешение всех наборов. Эта стандартизация позволила комбинировать сигналы из разных баз данных для обучения и тестирования, помогая модели со временем выучивать последовательные закономерности.

Предварительная обработка включала несколько важных этапов для обеспечения качества входных данных:
Сегментация данных:
После ресемплирования каждый ЭКГ-сигнал делился на окна фиксированной длины по 180 сэмплов. Это соответствует примерно 0,5 с длительности сигнала при частоте дискретизации 360 Гц. В этом исследовании использовалось фиксированное, неперекрывающееся скользящее окно для сегментации. Каждое окно собирало непрерывную последовательность образцов ЭКГ. В исследовании выбрано окно из 180 образцов, поскольку интервал в 0,5 с достаточно для охватки полного сердечного цикла или его основных частей: P-волны, QRS-комплекса и T-волны — для типичных взрослых сердечных ритмов. Каждому сегменту присваивалась метка класса на основе аннотации в центре сегмента. Таким образом, метка сегмента совпадала с основной формой сердцебиения внутри этого окна. Метод скользящего окна, применял следующую функцию сегментации:

figure-protocol-1

где si — образец ЭКГ в момент i.

Нормализация:
Нормализовал сегментированные данные ЭКГ с масштабированием Min-Max, чтобы все признаки имели значения от 0 до110.

figure-protocol-2

Этот шаг помогает ускорить сходимость модели во время обучения.

Балансировка классов с помощью SMOTE
Нормальные (N) удары значительно превосходили классы аномальных сердечных ритмов в наборе данных ЭКГ, которые показали значительный классовый дисбаланс. После сегментации, нормализации и разделения теста на тренировка обучающий набор данных подвергался использованию синтетической техники перевыборки меньшинств (SMOTE) для решения этой проблемы.

Для представления каждого сегмента ЭКГ использовалось 180-мерное пространство признаков, состоящее из 180 нормализованных образцов. SMOTE использовал евклидово расстояние для определения k ближайших соседей каждой выборки из класса меньшинства (k = 5) внутри своего класса. SMOTE применялся только к обучающим данным, которые были разделены на 70% обучающие и 30% тестовые наборы с использованием стратифицированной выборки. Таким образом, в тестовый набор не добавлялись искусственные образцы, что гарантировало, что результаты теста не были влияны процессом перевыборки. Тестовые данные остались без изменений, сохранив исходное распределение классов, и использовались только для справедливой оценки модели. В результате высокие результаты этого исследования демонстрируют истинную способность модели к обобщениям, а не из-за переоценки или завышенных результатов при добавлении дополнительных выборок.

Разделение испытаний поездов:
После предварительной обработки и фильтрации классов набор данных был разделён на учебные и тестовые подмножества с соотношением 70–30% с использованием стратифицированной случайной выборки. Эта стратификация основана на метках классов, чтобы обеспечить сохранение относительных пропорций каждого класса сердцебиения в тренировочных и тестовых наборах.

Разделение проводилось с использованием случайного сида для воспроизводимости. Каждый сегмент ЭКГ появлялся исключительно в тренировочном или тестовом наборе. Чтобы избежать смещения и отклонения данных, каждый этап предварительной обработки, который мог повлиять на распределение данных (а именно балансировка классов через SMOTE), выполнялся только после разделения и исключительно на обучающих данных.

В этом отношении, поддерживая пропорции классов, используя случайную стратификацию и строго разделяя выборки на обучающие и тестовые наборы, процесс разделения снижает вероятность смещения выборок, позволяя метрикам производительности отражать обобщение модели, а не специфичные для данных остаточные данные.

Разделение наборов данных и распределение классов
Окончательный набор данных был разделён на обучающие и тестовые наборы: 70% — для обучения, 30% — для тестирования. После применения SMOTE дисбаланс класса был снижен, что обеспечило эффективное представление каждого типа аритмии как в тренировочном, так и в тестовом наборах. Всего для обучения использовалось 3 966 620 сегментов ЭКГ, а для тестирования — 112 575 сегментов ЭКГ. Большой объём данных, в сочетании с разнообразием типов аритмий, позволил создать модель, эффективно идентифицирующую разные типы аритмий в реальных сигналах ЭКГ. В этом исследовании используются модели глубокого обучения для классификации аритмий ЭКГ. Пять типов сердцебиения: нормальный (N), блок ветви левого пучка (L), блок ветви правого пучка (R), преждевременный биение предсердий (A) и преждевременное сокращение желудочков (V), были выбраны в соответствии со стандартизированными аннотациями биения, содержащимися в базе данных MIT-BIH по аритмии, а также рекомендациями AAMI по аннотации ударов ЭКГ. Все пять упомянутых здесь аннотаций по биениям охватывают значимые сердечные заболевания, относящиеся к широкой категории аритмий и демонстрирующие характерные особенности в сигналах ЭКГ вокруг P, QRS и T-волн.

Кроме того, эти классы являются одними из самых частых и стабильно маркируемых в публичных базах данных ЭКГ, что облегчает проверку их эффективности по сравнению с другими методами классификации сердечного ритма на основе ЭКГ. Наборы данных были разделены с помощью метода кросс-пациентов. Такая схема гарантировала, что сегменты ЭКГ одного пациента не появлялись одновременно в обучающем и тестовом наборах. После этого разделения SMOTE применялся только к обучающему набору. Тестовый набор оставался свободным от синтетических образцов и повторяющихся временных окна. Всё это помогает избежать пересечения на уровне сегментов и поддерживает истинное обобщение при работе с пациентами, ранее не осматриваемыми.

Распределение классов до и после SMOTE:
Исходный набор данных имел значительный дисбаланс между классами: большое количество нормальных (N) ударов и меньше выборок для аномальных классов. До использования SMOTE обучающие данные содержали около 133 320 нормальных (N), 8 075 блоков ветви левого пучка (L), 10 431 правого блока ветви пучка (R), 4 489 предсердных преждевременных ударов (A) и 60 682 сегментов преждевременного сокращения желудочков (V). Для устранения дисбаланса SMOTE применялся только к обучающему набору, увеличивая количество выборок в меньшинственных классах для соответствия большинству. После увеличения в каждом классе было 793 324 сегмента, что в итоге составило 3 966 620 сегментов ЭКГ для обучения. Тестовый набор, состоявший из 112 575 сегментов, сохранил исходное распределение классов и не подвергался перевыборке. Такой подход обеспечивал справедливую и беспристрастную оценку эффективности модели.

Обучение и выводы
изучал вычислительную эффективность, проверяя производительность обучения и вывода на видеокарте NVIDIA RTX 3050 с 6 ГБ памяти. Процесс обучения занял около 3,2 часа на протяжении 60 эпох. Задержка вывода составляла в среднем 0,45 мс на каждый сегмент из 180 выборок, что делает возможным использование в реальном времени. Использование памяти на GPU достигло пика в 4,2 ГБ, а модель имеет всего 1,8 миллиона параметров, поэтому она кажется лёгкой по сравнению с большинством ЭКГ на базе трансформаторов.

Процесс обучения и вывода включает следующие этапы:
Настройка обучения: Определяются параметры обучения, такие как скорость обучения, размер партии и эпохи.
Обучение модели: модель CNN-Transformer обучается на обучающих данных.
Валидация: После обучения проверяется точность валидации и потери модели. Если производительность хорошая, модель сохраняется. Если производительность низкая, конвейер повторяется с другими параметрами обучения, возвращаясь к этапу настройки параметров.

Архитектура модели
Вся система CNN-Transformer состоит из четырёх основных частей: сверточного извлечения признаков, проекционного слоя, трансформаторного кодера и, наконец, головки классификации. Сверточный блок начинается с одномерного сверточного слоя с 32 фильтрами, размером ядра 3, шагом 1 и заполнением 1, за которым следует ReLU. Это уменьшает параметры с максимальным пулированием, размером ядра 2, чтобы снизить временное разрешение сигнала. После первого слоя свёртки есть ещё один с 64 фильтрами, тот же размер ядра 3, шаг 1, дополнение 1, снова ReLU и ещё один max-пул размера 2. Выход из всего этого выравнивается, проходит через линейный проекционный слой, который отображает признаки в 128-мерное пространство вложения, которое затем поступает в трансформатор 18,19.

Блок трансформатора состоит из двух слоёв энкодера, каждый с многоголовочной самоконцентрацией с использованием 4 головок для захвата дальнодействующих зависимостей в сигнале ЭКГ. В каждом слое есть сеть прямой передачи по позициям с скрытым размером 256 и dropout 0.5 для помощи при перенагоне. Нормализация слоя происходит после каждого подслоя, что стабилизирует тренировку.

Для главы классификации это полностью связанный слой, который падает с 128 до 64, затем ReLU и снова dropout 0.5. Затем выходной слой содержит пять нейронов для классов аритмии, с Softmax для получения вероятностей.

Блоки 1D сверточной нейронной сети (CNN):
Блок CNN состоит из двух одномерных сверточных слоёв, каждый из которых сопровождается активацией ReLU и слоем максимального пулирования. Эти слои помогают выявлять пространственные связи внутри входного сигнала ЭКГ. Для улучшения извлечения признаков после каждого этапа трансформации в слоях CNN применяются дополнительные функции активации ReLU.

Первый сверточный слой: Этот слой использует 32 фильтра, каждый размером 3, на входном сигнале. Процесс можно записать так:

figure-protocol-3      figure-protocol-4

где yi — выход, wj — веса фильтра, xi+j — входной сегмент, b — член смещения, а σ — функцию активации (ReLU). Полученная карта признаков проходит через активационный слой ReLU для добавления нелинейности:

figure-protocol-5

Пулирующий слой: после каждой свертковой операции применяется шаг максимального пула для уменьшения пространственных размеров вдвое. Этот процесс определяется как:

figure-protocol-6

Это помогает сохранить наиболее значимые особенности и одновременно снизить вычислительную нагрузку.

Второй сверточный слой: этот слой использует 64 фильтра размером 3 x 3 для обработки карт признаков предыдущего слоя, что позволяет модели обнаруживать более сложные закономерности. После свёртки применяется функция активации ReLU для внесения нелинейности в модель.

figure-protocol-7

Этот этап гарантирует, что модель фиксирует детализированные узоры сигнала ЭКГ.

Дополнительные слои активации: Активация ReLU применяется после каждого этапа свёртки, чтобы помочь сети лучше фиксировать сложные паттерны, обеспечивая фокус модели на положительных активациях.

Процесс выравнивания: после второй операции максимального пула отображения признаков сплощаются в один вектор для входа в блок трансформатора.

Блоки трансформаторов:
Блок трансформатора состоит из двух слоёв многоголовного самовнимания, которые помогают модели понимать взаимосвязи между различными частями сигнала ЭКГ со временем. Многоголовое самовнимание работает, рассматривая каждую пару элементов в последовательности. Для последовательности с запросом Q, ключом K и значением V внимание вычисляется следующим образом:

figure-protocol-8

Здесь dk — это размерность ключевых векторов, обеспечивающая масштабную инвариантность.

Слои прямой передачи: Каждый выход самовнимания проходит через полностью связанную сеть feedforward-сигнала с активацией ReLU, после чего происходит нормализация слоёв. Этот этап уточняет извлечённые временные признаки:

figure-protocol-9

где W1 и b1 — это веса и смещения слоя прямой подачи.

Представление с первой партией: Трансформатор работает с последовательностями в пакетной структуре, обеспечивая совместимость с форматом входа блока CNN.

Полностью связанные (плотные) слои:
После обработки через блок трансформатора выходная последовательность сплощается и затем передаётся через два полностью соединённых слоя для выполнения классификации. Первый полностью связный слой преобразует входной вектор в 128-мерное пространство признаков, при этом изменяя его форму.

figure-protocol-10

где W — матрица весов, x — входный вектор, а b — вектор смещения. Применяется слой активации ReLU:

figure-protocol-11

Далее следует слой dropout с частотой 0,5 для предотвращения перенагона.

Второй полностью связный слой: Последний слой отображает 128-мерные признаки с количеством классов сердечных ритмов (например, 5 классов для обнаружения аритмии). Выход проходит через функцию log-SoftMax для вычисления логарифмических вероятностей: exp(xi)

Гибридная модель CNN-трансформатора
Представленная модель представляет собой гибридную модель глубокого обучения, объединяющую сильные стороны CNN и трансформаторов для использования как пространственных, так и временных представлений. Такая архитектура специально адаптирована для обработки сложных данных длительной последовательности, таких как физиологические сигналы.

figure-protocol-12

Уравнение представляет входное представление, где N = количество выборок, T = количество временных шагов, d = размерность признака на шаг времени.

figure-protocol-13

Это уравнение обозначает позиционные вложения, где pos = позиция последовательно; i = индекс размерности вложения.

Модуль CNN – Локальное извлечение признаков
CNN эффективно изучают локальные зависимости и морфологические паттерны, такие как пики, наклоны или всплески в последовательных данных. Сверточный слой использует figure-protocol-14 ядра пространственного протяжения figure-protocol-15 над входным тензором figure-protocol-16. Каждый выходной канал m определяется следующим образом:

figure-protocol-17

figure-protocol-18= количество входных каналов; K = размер ядра; W = веса фильтров; b = смещение

Функция ReLU
В данном случае —figure-protocol-19 это обучаемый вес, а figure-protocol-20 — смещение для канала mA, применяется нелинейная активация, подобная ректифицированной линейной единице (ReLU):

figure-protocol-21

Пулирование и сжатие признаков
Пулирующие слои уменьшают пространственные или временные измерения карт признаков, сохраняя важные признаки и снижая вычисления. В максимальном пулировании с размером figure-protocol-22 окна и шагом s, пуловая функция на локации figure-protocol-23 выглядит следующим образом:

figure-protocol-24

Длина выхода после пулирования

figure-protocol-25

где figure-protocol-26 — длина входа; шаг определяет размер шага для сдвига окна пула. Эта формула вычисляет длину выхода отображения признаков после операции пула (например, максимального пула). Он рассчитывает, насколько уменьшена карта объектов, исходя из длины входа, размера пула и шага. Преобразует многомерные отображения признаков в вектор для полностью связанных слоёв.

Кодировщик трансформатора — захват зависимостей на дальнем радиусе действия
Трансформеры используют самовнимание для изучения долгосрочных временных зависимостей впоследовательностях 17.

Внимание масштабированного точечного произведения

figure-protocol-27

Q, K, V — это матрицы запросов, ключей и матриц значений, вычисляемые с помощью изученных проекций; figure-protocol-28— ключевое измерение, используемое для масштабирования точечного произведения.

Многоголовое внимание

figure-protocol-29

figure-protocol-30Каждая голова вычисляет внимание независимо; выходы конкатенируются и линейно преобразуются. figure-protocol-31— это изученные проекционные матрицы для каждой головы. figure-protocol-32  — окончательный проекционный вес после конкатенации18,19.

Итоговое предсказание и поражение
Полностью связанные слои отображают особенности в логиты, которые затем преобразуются в предсказания с помощью функций активации. После нескольких сверточных и пуловых слоёв выравнивается figure-protocol-33 в вектор figure-protocol-34 Полностью связный слой вычисляет логиты: Полностью связный слой затем вычисляет класс logits:

figure-protocol-35

Активация Sigmoid/Softmax:

figure-protocol-36

Функция активации отображает исходный исход модели 'z' в вероятности. Сигмоид применяется к бинарной классификации, а Софтмакс — для многоклассовых задач распределения вероятностей между классами. z — линейный выход (например, последний слой: z = Wx + b). Выход ŷ находится между (0, 1), что означаетвероятность 20.

Процесс обучения
Обучение проводилось на системе со следующими аппаратными характеристиками:
Процессор: AMD Ryzen 7 7840HS
ОПЕРАТИВНАЯ ПАМЯТЬ: 16 ГБ
ОПЕРАТИВНАЯ ПАМЯТЬ: 6 ГБ NVIDIA GeForce RTX 3050

Модели тренировались с помощью оптимизатора Адама, который адаптирует скорость обучения в зависимости от первого и второго моментов градиента. Правило обновления для Адама задаётся следующим образом:

figure-protocol-37

В этой схеме mt и v t представляют оценки первого и второго моментов, α — скорость обучения, а ε — малая константа, используемая для предотвращения деления на ноль. Модели тренировались на протяжении 60 эпох, с ранней остановкой для предотвращения перегонки. Использовался размер партии 1024, а обучающие данные загружались в модели с помощью DataLoader от PyTorch. Для регуляризации модели и ускорения сходимости были внедрены выброшеные и пакетная нормализация. Dropout — это метод регуляризации, который случайным образом отключает процент p нейронов во время тренировки, что помогает уменьшить перенагон. Математически пусть zi обозначает активациюi-го нейрона. Во время тренировочного этапа модифицированная активация z' рассчитывается как:

figure-protocol-38

где p — это процент отсева (например, p = 0,5 для 50% отсева). Во время вывода не применяется перепад, используется вся сеть.

Сходимость в нейронных сетях — это проблема, которая существенно влияет на существующие системы классификации в здравоохранении, особенно когда диагнозы непоследовательны из-за недостаточной сходимости. Недавние исследования методов оптимизации в заранее определённое время и сходимости в фиксированное время показали, что всё ещё возможно обучать модели, сходящиеся в течение фиксированного количества итераций, для всех начальных состояний. Будущие модели, основанные на этом, могут включать оптимизацию с заранее определённым временем.

Пакетная нормализация:
Пакетная нормализация стабилизирует и ускоряет обучение, нормализуя входные данные для каждого слоя. Имея мини-партию активаций x = {x 1,x 2, . . ., xN}, пакетно-нормализованный выход xi .вычисляется как:

figure-protocol-39

figure-protocol-40

где μB и σB2 — это среднее и дисперсия партии, ε — малая константа численной устойчивости, а γ и β — обучаемые параметры, масштабирующие и сдвигающие нормированные значения. Пакетная нормализация помогает уменьшить внутренний сдвиг ковариата и позволяет использовать более высокие скорости обучения. Эти методы в сочетании с оптимизатором Адама обеспечивают надёжную тренировку, снижая перенастройку и повышая скоростьсходимости до 21,22.

На рисунке 3 показаны потери валидации и точность валидации по эпохам во время обучения модели машинного обучения. Точность валидации (синяя линия, правая ось Y) начинается относительно низко (около 97,5%) и быстро увеличивается в первые 10 эпох. Он продолжает улучшаться и достигает уровней около 99,7–99,8% примерно после 20 эпох. Это указывает на то, что модель хорошо учится и применяет знания на валидационном наборе. Потеря валидации (красная линия, левая ось Y) начинается высоко, а затем резко падает почти до нуля в первые несколько эпох (около 2–3). После этого он остаётся почти на нулевой уровне до концатренировки — 23, 24.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом разделе представлена гибридная модель глубокого обучения, предназначенная для классификации аритмий по данным ЭКГ. Модель оценивается по способности распознавать пять клинически значимых классификаций сердечного ритма: преждевременное сжатие предсердий, нормальное, блок ветви левого пучка, блок ветви правого пучка и преждевременное сжатие желудочка. Комплексная оценка необходима с учётом клинической значимости этих классов аритмий и проблем, связанных с несбалансированными наборам...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

При распознавании и классификации аритмий по биосигналам ЭКГ предлагаемая гибридная модель глубокого обучения сочетает структуры трансформаторов и одномерные сверточные нейронные сети (CNN) и демонстрирует отличную производительность. Эта комбинация использует возможности трансформатора изучать глобальные временные зависимости с помощью механизмов самосознания, а также способность CNN выявлять локализованные пространственные признаки по необработанных волн ЭКГ. Модель была протестирована...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, которые можно было бы заявлять.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ни одного.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Adam OptimizerОткрытый исходный код (PyTorch)https://pytorch.org/docs/stable/optim.htmlАлгоритм оптимизации, используемый для обучения модели глубокого обучения путём адаптации скоростей обучения во время обратного распространения.
Аппаратное обеспечение (вычислительная система)AMD; NVIDIAhttps://www.amd.com/en/products/processors/laptop/ryzen/7000-series/amd-ryzen-7-7840hs ; https://www.nvidia.comПроцессор: AMD Ryzen 7 7840HS; ОПЕРАТИВНАЯ ПАМЯТЬ: 16 ГБ; Видеокарта: NVIDIA GeForce RTX 3050 (6 ГБ VRAM). Используется для обучения и оценки моделей.
Дисбалансированное обучениеДисбалансированное обучениеhttps://imbalanced-learn.orgБиблиотека Python, используемая для балансировки классов с техникой синтетического перевыбора меньшинств (SMOTE).
MatplotlibMatplotlibhttps://matplotlib.orgБиблиотека Python, используемая для построения ЭКГ-сигналов, матриц путаницы и графиков производительности.
Базы данных ЭКГ PhysioNetPhysioNethttps://physionet.orgПубличные наборы данных ЭКГ, использованные в исследовании, включая базы данных MIT-BIH аритмии, суправентрикулярной аритмии MIT-BIH, INCART 12-lead и Sudden Cardiac Death Holter.
PyTorchPyTorchhttps://pytorch.orgФреймворк глубокого обучения на Python, используемый для реализации моделей CNN и Transformer, обучающего конвейера и вывода.
PythonФонд программного обеспечения Pythonhttps://www.python.orgЯзык программирования, используемый для предварительной обработки данных, разработки моделей, обучения и оценки.
СиборнСиборнhttps://seaborn.pydata.orgБиблиотека визуализации данных на Python, используемая для статистических графиков и визуализации результатов.
WFDBWFDBhttps://wfdb.readthedocs.ioПакет Python, используемый для чтения, записи, обработки и построения физиологических сигналов и аннотаций из баз данных PhysioNet.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ullah, A., et al. A hybrid deep CNN model for abnormal arrhythmia detection based on cardiac ECG signal. Sensors (Basel). 21 (3), 951(2021).
  2. Oh, S. L., Ng, E. Y. K. Automated diagnosis of arrhythmia using combination of CNN and LSTM techniques with variable length heart beats. Comput Biol Med. 102, 278-287 (2018).
  3. Jamil, S., Rahman, M. A. Novel deep-learning-based framework for the classification of cardiac arrhythmia. J Imaging. 8 (3), 70(2022).
  4. Reegu, F. A., et al. Blockchain-based framework for interoperable electronic health records for an improved healthcare system. Sustainability. 15 (8), 6337-6352 (2023).
  5. Aseeri, A. O. Uncertainty-aware deep learning-based cardiac arrhythmias classification model of electrocardiogram signals. Computers. 11 (6), 82-97 (2022).
  6. Tesfai, H., et al. Lightweight ShuffleNet-based CNN for arrhythmia classification. IEEE Access. 12, 111842-111854 (2022).
  7. Pandey, S. K., Janghel, R. R. Automatic detection of arrhythmia from imbalanced ECG database using CNN model with SMOTE. Australas Phys Eng Sci Med. 42, 1129-1139 (2019).
  8. Hu, R., Chen, J., Zhou, L. A transformer-based deep neural network for arrhythmia detection using continuous ECG signals. Comput Biol Med. 144, 105325(2022).
  9. Dang, H., et al. Novel deep arrhythmia-diagnosis network for atrial fibrillation classification using electrocardiogram signals. IEEE Access. 7, 75577-75590 (2019).
  10. Li, J., Zhang, Y., Gao, L., Li, X. Arrhythmia classification using biased dropout and morphology–rhythm feature with incremental broad learning. IEEE Access. 9, 66132-66140 (2021).
  11. Joddoa, A. S. Heart disease prediction system using SMOTE-balanced dataset and decision classifier. AIP Conf Proc, 2834, 050006(2023).
  12. Li, Y., Qian, R., Li, K. Inter-patient arrhythmia classification with improved deep residual convolutional neural network. Comput Methods Programs Biomed. 214, 106582(2022).
  13. Kiranyaz, S., Ince, T., Gabbouj, M. Real-time patient-specific ECG classification by 1-D convolutional neural networks. IEEE Trans Biomed Eng. 63 (3), 664-675 (2016).
  14. Vaswani, A., et al. Attention is all you need. Proceedings of the 31st International Conference on Neural Information Processing Systems, Long Beach, California, USA, , (2017).
  15. Hannun, A. Y., et al. Cardiologist-level arrhythmia detection and classification in ambulatory electrocardiograms. Nat Med. 25, 65-69 (2019).
  16. Zihlmann, M., et al. Convolutional recurrent neural networks for ECG classification. arXiv preprint. arXiv. , 1710.06122(2018).
  17. Kim, D., Lee, K. Hybrid CNN–transformer model for arrhythmia detection. Sci Rep. 15, 7817(2025).
  18. Diker, A., Aydin, K. Transformer-based attention model for arrhythmia detection using ECG signals. Biomed Signal Process Control. 68, 102679(2021).
  19. Sen, S. Y., Ozkurt, N. Convolutional neural network hyperparameter tuning with Adam optimizer for ECG classification. 2020 Innovations in Intelligent Systems and Applications Conference (ASYU), Istanbul, Turkey, , (2020).
  20. Chawla, N. V., Bowyer, K. W., Hall, L. O., Kegelmeyer, W. P. SMOTE: Synthetic minority over-sampling technique. J Artif Intell Res. 16, 321-357 (2002).
  21. Xia, Y., Wulan, N., Wang, K., Zhang, H. Detecting atrial fibrillation by deep convolutional neural networks. Comput Biol Med. 93, 84-92 (2020).
  22. Mohonta, S. C., Motin, M. A., Kumar, D. K. Electrocardiogram-based arrhythmia classification using wavelet transform with deep learning model. Sensing Bio-Sensing Res. 37, 100502(2022).
  23. Selvam, I. J., Madhavan, M. Detection and classification of electrocardiography using hybrid deep learning models. Hellenic J Cardiol. 81, 75-84 (2025).
  24. Izci, E., Ozdemir, M. A., Degirmenci, M., Akan, A. Cardiac arrhythmia detection from 2D ECG images by using deep learning technique. 2019 Medical Technologies Congress (TIPTEKNO), Izmir, Turkey, , (2019).
  25. Zheng, Z., Chen, Z., Hu, F., Zhu, J., Tang, Q., et al. Automatic diagnosis of arrhythmias using a combination of CNN and LSTM technology. Electronics. 9 (1), 121(2020).
  26. Isin, A., Ozdalili, S. Cardiac arrhythmia detection using deep learning. Procedia Comput Sci. 120, 268-275 (2017).
  27. Huang, J., Chen, B., Yao, B., He, W. ECG arrhythmia classification using STFT-based spectrogram and convolutional neural network. IEEE Access. 7, 92871-92880 (2019).
  28. Wang, T., Lu, C., Sun, Y., Yang, M., Liu, C., et al. Automatic ECG classification using continuous wavelet transform and convolutional neural network. Entropy. 23 (1), 119(2021).
  29. Panneerselvam, R., et al. Multimodal skin cancer prediction: Integrating dermoscopic images and clinical metadata with transfer learning. Open Bioinforma J. 18, e18750362358444(2025).
  30. Xiong, W., Zhang, G., Yan, D., Cao, L., Huang, X., et al. Multichannel feature fusion network-based technique for heart sound signal classification and recognition. Expert Syst Appl. 273, 126839(2025).
  31. Jin, J., Zhu, J., Zhao, L., Chen, L., Gong, J. A robust predefined-time convergence zeroing neural network for dynamic matrix inversion. IEEE Trans Cybern. 53, 3887-3900 (2022).
  32. Zhu, Y., Zhang, Q., Wang, Y., Liu, W., Zeng, S., et al. Identification of necroptosis and immune infiltration in heart failure through bioinformatics analysis. J Inflamm Res. 18, 2465-2481 (2025).
  33. Zhang, Y., Li, X., Chen, Z., Wang, H., Liu, C., et al. Multichannel feature fusion–based deep learning framework for electrocardiogram arrhythmia classification. IEEE Trans Neural Syst Rehabil Eng. 31, 4287-4297 (2023).
  34. Kumar, A., Singh, R., Sharma, P., Verma, S., Gupta, N. Application of machine learning and deep learning techniques for toxicity prediction and safety assessment. J Appl Toxicol. 45 (3), 423-437 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Arrhythmia PredictionElectrocardiogram SignalsDeep Learning ModelConvolutional Neural NetworksTransformer LayersHeartbeat ClassificationLead I ECGData NormalizationSynthetic OversamplingReal Time Detection

Похожие статьи