Research Article

Ein rechnerisch effizienter hybrider Ansatz zur elektrokardiogrammbasierten Vorhersage von Arrhythmien

DOI:

10.3791/69541

May 22nd, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das Modell in dieser Studie ist darauf ausgelegt, frühe Arrhythmien in Elektrokardiogramm-(EKG)-Datensätzen aus mehreren Datenbanken in fünf Haupttypen des Herzschlags zu klassifizieren. Im Vergleich zu anderen Modellen schneidet dieses Modell in Bezug auf Genauigkeit, Empfindlichkeit, Präzision und Rückruf besser ab.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Herz-Kreislauf-Erkrankungen, insbesondere Arrhythmien, sind weltweit eine der häufigsten Todesursachen. Dies unterstreicht die Notwendigkeit automatisierter Systeme, die diese Erkrankungen frühzeitig erkennen und diagnostizieren können. Diese Forschung führt ein Deep-Learning-Modell ein, das Arrhythmien mithilfe von Elektrokardiogramm-(EKG)-Signalen identifiziert. Das Modell konzentriert sich auf fünf Haupttypen von Herzschlägen: Normaler (N), Linker Bündel-Astblock (L), Rechter Bündel-Astblock (R), Vorzeitiger Vorschlag (A) und Vorzeitige ventrikuläre Kontraktion (V). Das System verwendet Lead-I-Signale aus mehreren Datenbanken, darunter MIT-BIH Arrhythmia, Supraventricular, INCART 12-lead und Sudden Cardiac Death Holter. Dies bietet mehr als 3,9 Millionen Trainingssegmente und 112.575 Testsegmente.

Die Daten werden vorverarbeitet, indem sie in feste Fenster von 180 Stichproben unterteilt, mit Min-Max-Normalisierung skaliert und die Klassen mit der Synthetic Minority Over-sampling Technique ausbalanciert werden. Das Modell kombiniert 1D-konvolutionelle neuronale Netzwerke, um räumliche Merkmale zu extrahieren, und Transformatorschichten, um zeitbasierte Muster zu erfassen. Es verwendet den Adam-Optimierer und beinhaltet Dropout- und Batch-Normalisierung, um die Leistung zu verbessern. Das System erreicht 99,99 % Genauigkeit, Präzision und F1-Wert in allen Klassen, was besser ist als das TN4-Modell und andere leistungsstarke Modelle. Der Einsatz von Convolutional Neural Networks und tiefen hybriden Architekturen verbessert die Robustheit der Features. Dieses Modell zeigt großes Potenzial für skalierbare und Echtzeit-Arrhythmienerkennung und trägt zur Weiterentwicklung der KI-gesteuerten, personalisierten digitalen Gesundheitsversorgung bei.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Herz-Kreislauf-Erkrankungen sind die bedeutendste Ursache menschlicher Gesundheitsprobleme, mit mehr als 17 Millionen Todesfällen pro Jahr. Fast drei Viertel aller Fälle von Herz-Kreislauf-Erkrankungen (CVD) leben laut der World Heart Federation in einkommensschwachen Ländern der Welt. Ein Elektrokardiogramm (EKG) erfasst die elektrische Aktivität, die durch die Depolarisation des Herzens erzeugt wird. Die elektrischen Signale breiten sich zur Haut aus. EKG-Signale übertragen mindestens zwei wichtige Informationen. Eine davon ist die gesundheitsbezogene Biomedizin. Das andere sind personenbezogene Qualifikationen oder Biometrie. Aufgrund seiner Einfachheit wurden verschiedene Methoden zur Klassifikation von EKG-Signalen in Betracht gezogen, darunter selbstgebaute und maschinelle Lernmethoden. Die manuelle Methode ist zeitaufwendig und ineffizient. Es erfordert Echtzeitsignale wie EKG und umfangreiche Computerinfrastruktur. Maschinelle Lernmethoden liefern wahrscheinlich eine geringere Bracket-Genauigkeit als die manuelle Methode, aber ein geeigneter Algorithmus wird benötigt, um das Risiko unentdeckter Arrhythmie1 zu verringern.

Die häufigste Herz-Kreislauf-Erkrankung ist eine Arrhythmie, eine Erkrankung, bei der das Herzschlagmuster abnormal ist. Diese abnormen Muster müssen in Klassen eingeteilt werden, da solche Informationen die Behandlung beeinflussen können. Das EKG wird weit verbreitet eingesetzt, um abnormale Herzmuster zu erkennen und Herzkrankheiten vorherzusagen, was eine frühzeitige Erkennung ermöglicht. Die Diagnose von Arrhythmien basiert weitgehend auf dem EKG, einem wichtigen medizinischen Gerät zur Aufzeichnung der Herzerregung, zur Übertragung von Signalen und zur Überwachung der Genesung. Das EKG ist in der modernen Medizin notwendig und zuverlässig. Die Automatisierung der EKG-Signalinterpretation verbessert die klinische Praxis erheblich und erhöht die Patientensicherheit. Arrhythmien sind abnormale Herzrhythmen und -muster. Künstliche Intelligenz, insbesondere maschinelles Lernen, ist ein ausgezeichnetes Werkzeug zur Krankheitsvorhersage und Meinungsanalyse, insbesondere für Herz-Kreislauf-Erkrankungen2.

Verschiedene medizinische Daten, wie Patientenakten, werden in Krankenhäusern in der Regel für klinische Zwecke verwendet. Medizinische Daten können auch zeitnah generiert werden, um die Optimierung von maschinellen Lernalgorithmen zu unterstützen. Die Maschine wird auf einem Datensatz trainiert, der schließlich daraus lernt. Einmal geschult, kann es feststellen und klassifizieren, ob ein Fall gesund ist oder auf verschiedenen Merkmalen seiner Unterlagenbasiert 3,4. Maschinen können auch Muster in den gegebenen Daten erkennen, die von Menschen aufgrund von Zeitmangel oder begrenzten Ressourcen möglicherweise nicht leicht wahrgenommen werden. Verschiedene Methoden wurden zur Klassifikation von EKG-Signalen eingesetzt, darunter K-nächstgelegene Nachbarn (KNN), Support-Vektormaschinen (SVM), neuronale Netze (NN), Entscheidungsbäume, lineare Diskriminantenanalyse (LDA) und Bayessche Klassifikatoren. SVM gilt als einer der effektivsten überwachten Lernalgorithmen zur Klassifikation von EKG-Signalen zur Erkennung von Arrhythmien 5,6.

Ein leistungsfähiges Bracket-Modell mit NN und dem Mehrschicht-Perzeptron (MLP) ist besser als andere konventionelle Methoden. Deep-Learning-Algorithmen wie künstliche neuronale Netze (ANNs) wurden erfolgreich bei Aufgaben wie Informationsabruf, Bilderkennung, Objekterkennung und Sprachverarbeitung eingesetzt. CNNs werden in der Forschung weit verbreitet eingesetzt, um stilistische Merkmale aus EKG-Wellenformen zu extrahieren und diese für verschiedene Zwecke zu analysieren, wie etwa zur Entdeckung des QRS-Komplexes und des ST-Segments oder der P-Wellen 7,8. Das 1D-CNN lernt, die relevantesten Merkmale in EKG-Signalen zu erkennen und sie in fünf Arrhythmietypen zu klassifizieren. Ein Baseline-Wander- und Hochfrequenz-Rauschbeseitigungsfilter wurde eingesetzt, um die Signalqualität zu verbessern. Dies unterteilte Arrhythmien in fünf Kategorien: 9,10.

Wie in Abbildung 1 gezeigt, sind die P-Welle, der QRS-Komplex und die T-Welle wichtige Bestandteile eines EKG. Die P-Welle steht für die atriale Depolarisation, die elektrische Aktivität, die die Vorhöfe zusammenziehen lässt. Der QRS-Komplex spiegelt die ventrikuläre Depolarisation wider; Es ist der elektrische Impuls, der die ventrikuläre Kontraktion auslöst. Die T-Welle zeigt die ventrikuläre Repolarisation an, also die Erholungsphase der Ventrikel nach der Kontraktion. Zusammen stellen diese Wellen einen vollständigen Herzzyklus dar. Sie sind entscheidend, um zu verstehen, wie das Herz funktioniert, und um Herzproblemezu diagnostizieren.

All diese Wellen repräsentieren einen Herzzyklus. Sie sind äußerst wichtig, um zu verstehen, wie das Herz funktioniert, und um Herzerkrankungen zu diagnostizieren. Deep-Learning-Modelle haben in letzter Zeit bedeutende Fortschritte in der computergestützten medizinischen Signalinterpretation erzielt, einschließlich EKG-Signalen. Traditionelle, handgefertigte, feature-basierte Machine-Learning-Modelle leiden unter Skalierbarkeits- und Anpassungsproblemen bei verschiedenen Patientengruppen. Um diese Herausforderungen zu bewältigen, sind tiefgründige Modelle wie CNNs und hybride Modelle entstanden, die CNNs mit rekurrenten Modellen wie LSTMs kombinieren, um automatisch relevante Merkmale aus rohen EKG-Signalen zu lernen. Dies hat die Klassifikationsgenauigkeiterheblich verbessert.

Diese Studie schlägt einen Deep-Learning-Rahmen zur Klassifizierung von EKG-Signalen in fünf Kategorien von Herzschlägen vor: Normaler (N), Linker Bündel-Branch-Block (L), Rechter Bündel-Astblock (R), Vorvorzeitiger Schlag (A) und Vorzeitige ventrikuläre Kontraktion (V). Um das Modell zu trainieren, nutzen wir öffentlich verfügbare EKG-Datensätze wie die MIT-BIH Arrhythmia Database und die Supraventricular Database. Diese Datensätze werden vorverarbeitet und in Segmente mit fester Länge zur Analyse unterteilt. Da Klassenungleichgewicht ein häufiges Problem bei Arrhythmiedaten ist, wenden wir die Synthetic Minority Over-sampling Technique (SMOTE) an, um die Trainingsdaten auszubalancieren. Dies stellt sicher, dass das Modell effektiv von allen Klassen lernen kann und seine Genauigkeit bei der Klassifikation verschiedener Herzschläge verbessert.

Inspiriert von jüngsten Fortschritten in der EKG-Klassifikation, einschließlich Modellen mit kontinuierlichen Wavelet-Transformationen (CWT) und CNN-Architekturen, verwendet der vorgeschlagene Ansatz sowohl ein Standard-CNN als auch ein hybrides Modell mit Transformatorschichten. Durch die Kombination eines CNN zur räumlichen Merkmalsextraktion und eines Transformators zur Erfassung zeitlicher Abhängigkeiten erreicht dieses System eine hohe Genauigkeit, mit F1 und einer Genauigkeit von nahezu 100 % in allen Klassen 13,14.

"Räumliche Merkmale" beziehen sich auf Merkmale, die mit der Position oder Lage von etwas zusammenhängen, wie Entfernung, Richtung und Form. Andererseits beschreiben "zeitliche Merkmale" Elemente, die mit der Zeit zusammenhängen, wie zum Beispiel wann ein Ereignis stattfand, dessen Dauer oder die Abfolge von Ereignissen. Im Wesentlichen bedeutet "räumlich" "Raum" und "zeitlich" bedeutet "Zeit".

Die Hauptziele dieser Forschung waren es, ein genaues, skalierbares Modell zur Echtzeit-Arrhythmieerkennung zu entwickeln und das wachsende Feld der KI-gesteuerten Diagnostik im Gesundheitswesen zu unterstützen. Dieses System zeigt vielversprechende Echtzeitüberwachung und ermöglicht eine frühzeitige Erkennung und Intervention für Patienten mit Risiko für Herzereignisse.

Die Ziele dieser Forschungsarbeit sind vielfältig. Erstens zielt diese vorgeschlagene Technik darauf ab, arrhythmische Schläge in fünf Kategorien zu unterteilen: normaler (N), linker Bündelblock (L), rechter Bündelblock (R), vorzeitiger Vorschlag (A) und vorzeitige ventrikuläre Kontraktion (V). Zweitens zielt diese Forschung darauf ab, ein hybrides CNN- und Transformatormodell zu entwickeln, das sowohl morphologische als auch zeitliche Informationen aus EKG-Signalen erlernen kann, ohne15 vorzuverarbeiten. Drittens zielt diese vorgeschlagene Technik darauf ab, eine leistungsorientierte Lösung bereitzustellen, die in Echtzeit implementiert werden kann. Viertens zielt diese Forschung darauf ab, Verbesserungen in der Genauigkeit und Empfindlichkeit des vorgeschlagenen Modells im Vergleich zu den modernsten Modellen16,17 zu demonstrieren.

Zusätzlich wurden Graph Convolutional Networks (GCNs), die Interaktionen zwischen physiologischen Faktoren innerhalb eines strukturierten Graphen modellieren, für biomedizinische Vorhersageaufgaben eingeführt und könnten in zukünftigen Arrhythmien-Klassifikationsmodellen eine Rolle spielen, die interlead-Abhängigkeiten berücksichtigen.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ethische Aussage
Diese Studie stützte sich vollständig auf öffentliche, anonymisierte EKG-Daten, die von PhysioNet heruntergeladen wurden. Alle in dieser Studie verwendeten Datensätze wurden ursprünglich mit Zustimmung der Probanden und mit ethischer Zustimmung der jeweiligen Datenträger erhoben. Diese Forschung erforderte keine Datenerhebung, keine experimentelle Arbeit mit weder menschlichen noch tierischen Probanden oder persönliche Identitätsdaten der Patienten. Daher wurde keine weitere ethische Überprüfung beantragt.

Methodik
Abbildung 2 veranschaulicht den Arbeitsablauf der vorgeschlagenen Architektur.

Datenerhebung
EKG-Daten werden aus der PhysioNet-Datenbank gesammelt, einem beliebten Archiv physiologischer Signale. Mehrere Datensätze werden aus der Datenbank abgerufen. Diese Datensätze werden zu einem einzigen Hauptdatensatz zusammengeführt, der verschiedene EKG-Signalklassen umfasst.

Verwendete Datensätze
Diese Studie nutzte mehrere öffentlich zugängliche EKG-Datensätze, um ein Deep-Learning-Modell zur Arrhythmieklassifikation zu entwickeln und zu evaluieren. Die Auswahl dieser Datensätze erfolgte mit Sorgfalt unter Berücksichtigung ihrer Vielfalt hinsichtlich der Patientendemografie und der Vielfalt der Arrhythmietypen, um sicherzustellen, dass das vorgeschlagene Modell in verschiedenen Szenarien gut abschneidet9. Für diese Studie wurden nur Lead-I-Daten aus der MIT-BIH Arrhythmia Database, der MIT-BIH Supraventricular Arrhythmia Database, der St. Petersburg INCART 12-lead Arrhythmia Database und der Sudden Cardiac Death Holter Database kombiniert. Diese Datensätze sind bekannt für ihre hochwertigen, annotierten EKG-Aufzeichnungen, die ein breites Spektrum an Arrhythmieklassen abdecken.

Die oben kombinierten Datensätze umfassen Patientendemografie, Aufzeichnungsgeräte, Abtastfrequenzen und Einstellungen. Die oben erwähnte Variabilität im Modell verbessert seine Verallgemeinerung, indem sie es einer Vielzahl von EKG-Morphologien, Rauschen und Rhythmen aussetzt.

Beschreibung von Datensätzen
Datenbank für MIT-BIH-Arrhythmien
Der MIT-BIH-Arrhythmie-Datensatz enthält 48 halbstündige EKG-Aufnahmen, nummeriert 100–234. Jeder Datensatz enthält Zweikanal-EKG-Signale, die mit 360 Samples pro Sekunde digitalisiert werden. Die Daten werden in den Formaten .dat, .hea und .atr gespeichert.

MIT-BIH supraventrikuläre Arrhythmie-Datenbank
Dies ist eine spezifische Teilmenge der MIT-BIH-Datenbanken. Die MIT-BIH Supraventrikuläre Arrhythmie-Datenbank umfasst 78 vollständige EKG-Aufnahmen, die von 30 Minuten bis zu mehreren Stunden dauern, nummeriert 801-811. Jeder Datensatz enthält zweikanalige EKG-Signale, die mit 128 Samples pro Sekunde in digitale Form umgewandelt werden.

Die Datenbank der INCART 12-Lead-Arrhythmie in St. Petersburg
Diese Datenbank enthält 75 annotierte Aufnahmen, die von 32 Holter-Monitoren aufgenommen wurden. Jede Aufnahme dauert 30 Minuten und enthält 12 Standard-Leads, die jeweils mit 257 Hz gesampelt werden. Die Signalstärke variiert zwischen 250 und 1100 Analog-Digital-Wandlereinheiten pro Millivolt.

Unvorhergesehener Herztod Holter-Datenbank
Dieser Datensatz ist einer von vielen Open-Access-Holter-Aufnahmen, die faktische Vorkommen von ventrikulärer Tachykardie (VT) und ventrikulärem Fibrillieren (VF) erfassen. Beides kann zu einem unvorhergesehenen Herztod führen. Jede Platte ist 24 Stunden lang und wird mit 250 Hz abgesampelt.

Datenvorverarbeitung
In dieser Studie wurden vier öffentliche EKG-Datenbanken mit unterschiedlichen Stichprobenraten verwendet: MIT-BIH-Arrhythmie (360 Hz), MIT-BIH Supraventrikuläre Arrhythmie (128 Hz), St. Petersburg INCART 12-Lead (257 Hz) und Sudden Cardiac Death Holter (250 Hz). Um sicherzustellen, dass alle Daten konsistent sind und während des Modelltrainings kombiniert werden können, wurden alle EKG-Signale auf eine gemeinsame Frequenz von 360 Hz neu gesampelt, was mit der MIT-BIH-Arrhythmiedatenbank übereinstimmt und häufig als Standard in der EKG-Forschung verwendet wird. Das Resampling erfolgte mittels bandbegrenzter Interpolation; anfangs wurden die EKG-Signale mit Tiefpassfilter gefiltert, um Aliasing zu verhindern, und anschließend wurde ein sinc-basierter Rekonstruktionskern für die Interpolation verwendet, gefolgt von der endgültigen Wiederbeschaffung bei 360 Hz. Nach dem Resampling wurde jedes Signal in Fenster mit 180 Samples unterteilt, was ungefähr 0,5 s Datenvolumen entspricht, sodass alle Datensätze die gleiche Zeitauflösung hatten. Diese Standardisierung ermöglichte die Kombination von Signalen aus verschiedenen Datenbanken für Training und Test, wodurch das Modell konsistente Muster im Laufe der Zeit lernte.

Die Vorverarbeitung umfasste mehrere wichtige Schritte, um die Qualität der Eingabedaten sicherzustellen:
Datensegmentierung:
Nach der Neuabnahme wurde jedes EKG-Signal in feste Fenster mit jeweils 180 Proben unterteilt. Dies entspricht etwa 0,5 s Signaldauer bei einer Abtastrate von 360 Hz. Diese Forschung verwendete ein festes, nicht überlappendes gleitendes Fenster zur Segmentierung. Jedes Fenster sammelte eine kontinuierliche Abfolge von EKG-Proben. Die Studie wählte ein Fenster von 180 Stichproben, da ein 0,5-S-Intervall ausreicht, um einen vollständigen Herzzyklus oder seine Hauptbestandteile – die P-Welle, QRS-Komplex und T-Welle – für typische Herzfrequenzen im Erwachsenenalter zu erfassen. Jedem Abschnitt wurde basierend auf der Annotation in der Mitte des Segments ein Klassenlabel zugewiesen. So entsprach das Segment-Label der Hauptform des Herzschlags innerhalb dieses Fensters. Die Schiebefenstermethode wurde folgende Segmentierungsfunktion angewendet:

figure-protocol-1

wobei si die EKG-Probe zum Zeitpunkt i ist.

Normalisierung:
Ich habe die segmentierten EKG-Daten mit Min-Max-Skalierung normalisiert, um sicherzustellen, dass alle Merkmale Werte zwischen 0 und 1 bis10 haben.

figure-protocol-2

Dieser Schritt hilft, die Konvergenz des Modells während des Trainings zu beschleunigen.

Klassenausgleich mit SMOTE
Normale (N) Schläge überstiegen die abnormalen Herzschlagklassen im EKG-Datensatz deutlich, der ein signifikantes Klassenungleichgewicht zeigte. Nach Segmentierung, Normalisierung und Train-Test-Splitting wurde der Trainingsdatensatz der Synthetic Minority Over-sampling Technique (SMOTE) unterzogen, um dieses Problem zu lösen.

Ein 180-dimensionaler Merkmalsraum wurde verwendet, um jedes EKG-Segment darzustellen und bestand aus 180 normalisierten Proben. SMOTE verwendete die euklidische Distanz, um die k nächstgelegenen Nachbarn jeder Minderheitenklasse (k = 5) innerhalb ihrer eigenen Klasse zu bestimmen. SMOTE wurde nur auf die Trainingsdaten angewendet, die in 70 % Training und 30 % Testsets mittels geschichteter Stichprobe aufgeteilt wurden. So wurden keine künstlichen Proben zum Testset hinzugefügt, sodass die Testergebnisse nicht vom Überprobenverfahren beeinflusst wurden. Die Testdaten blieben unverändert, bewahrten ihre ursprüngliche Klassenverteilung und wurden nur zur fairen Bewertung des Modells verwendet. Daher zeigen die High-Performance-Ergebnisse dieser Studie die tatsächliche Fähigkeit des Modells zur Verallgemeinerung, nicht aufgrund von Overfitting oder überhöhten Werten durch zusätzliche Stichproben.

Zug-Test-Aufteilung:
Nach der Vorverarbeitung und der Klassenfilterung wurde der Datensatz in Trainings- und Testteilmengen unterteilt, wobei eine Aufteilung von 70 % bis 30 % mittels stratifizierter Zufallsstichprobe verwendet wurde. Diese Schichtung basiert auf den Klassenbezeichnungen, um sicherzustellen, dass die relativen Anteile jeder Herzschlagklasse in den Trainings- und Testsätzen beibehalten werden.

Die Aufteilung wurde mit einem zufälligen Seed zur Reproduzierbarkeit durchgeführt. Jedes EKG-Segment erschien ausschließlich entweder im Trainings- oder im Testset. Um Verzerrungen und Datenabweichungen zu vermeiden, wurde jeder Vorverarbeitungsschritt, der die Datenverteilung beeinflussen könnte (nämlich die Klassenverteilung mittels SMOTE), erst nach der Aufteilung und ausschließlich auf den Trainingsdaten durchgeführt.

In diesem Zusammenhang verringert der Aufteilungsprozess durch die Beibehaltung von Klassenanteilen, die Verwendung von Zufallsstratifizierung und der strikten Trennung der Stichproben in Trainings- und Testsets die Wahrscheinlichkeit von Verzerrungen in den Stichproben, sodass Leistungsmetriken die Verallgemeinerung des Modells statt datenspezifischer Residuen widerspiegeln können.

Datensatzaufteilung und Klassenverteilung
Der endgültige Datensatz wurde in Trainings- und Testsets aufgeteilt, wobei 70 % für Training und 30 % für Tests verwendet wurden. Nach Anwendung von SMOTE wurde das Klassenungleichgewicht reduziert, sodass jeder Arrhythmietyp sowohl im Training als auch im Testset gut vertreten war. Insgesamt wurden 3.966.620 EKG-Segmente für das Training verwendet, während 112.575 EKG-Segmente für Tests verwendet wurden. Das große Datenvolumen, kombiniert mit der Vielzahl der Arrhythmietypen, ermöglichte die Erstellung eines Modells, das verschiedene Arrhythmietypen in realen EKG-Signalen effektiv identifiziert. Diese Studie verwendet Deep-Learning-Modelle, um EKG-Arrhythmien zu klassifizieren. Die fünf Herzschlagtypen, nämlich Normal (N), Left Bundle Branch Block (L), Right Bundle Branch Block (R), Atrial Premature Beat (A) und Premature Ventricular Contraction (V), wurden entsprechend den standardisierten Beat-Annotationen der MIT-BIH Arrhythmia Database sowie den AAMI-Richtlinien für ECG Beat-Annotation ausgewählt. Alle fünf hier erwähnten Beat-Annotationen umfassen bedeutende Herzerkrankungen, die in die breite Kategorie der Arrhythmien fallen und charakteristische Wellenformmerkmale in den EKG-Signalen rund um die P-, QRS- und T-Wellen aufweisen.

Darüber hinaus gehören diese Klassen zu den häufigsten und beständigsten in öffentlichen EKG-Datenbanken, was es erleichtert, ihre Wirksamkeit im Vergleich zu anderen EKG-basierten Herzrhythmusklassifikationsansätzen zu testen. Die Datensätze wurden nach einer patientenübergreifenden Methode aufgeteilt. Dieses Setup stellte sicher, dass EKG-Segmente eines einzelnen Patienten nicht gleichzeitig in den Trainings- und Testsets auftauchten. Nachdem diese Aufteilung stattgefunden hatte, wurde SMOTE nur noch auf das Trainingsset angewendet. Der Testsatz blieb frei von synthetischen Proben und wiederholten zeitlichen Fenstern. All dies hilft, Überschneidungen auf Segmentebene zu vermeiden und unterstützt eine echte Verallgemeinerung bei der Behandlung von Patienten, die bisher nicht gesehen wurden.

Klassenverteilung vor und nach SMOTE:
Der ursprüngliche Datensatz wies ein erhebliches Ungleichgewicht zwischen den Klassen auf, mit einer großen Anzahl von Normal (N) Schlägen und weniger Stichproben für die abnormalen Klassen. Vor der Verwendung von SMOTE enthielten die Trainingsdaten etwa 133.320 Normal (N), 8.075 Left Bundle Branch Block (L), 10.431 Right Bundle Branch Block (R), 4.489 Atriale Premative Beat (A) und 60.682 Pretire Ventricular Contraction (V) Segmente. Um das Ungleichgewicht zu beheben, wurde SMOTE nur auf den Trainingssatz angewendet, wodurch die Anzahl der Stichproben in den Minderheitenklassen erhöht wurde, um mit der Mehrheitsklasse übereinzustimmen. Nach der Erweiterung hatte jede Klasse 793.324 Abschnitte, was insgesamt 3.966.620 EKG-Abschnitte für die Ausbildung ergab. Das Testset, das 112.575 Segmente umfasste, behielt seine ursprüngliche Klassenverteilung bei und wurde nicht überbestückt. Dieser Ansatz gewährleistete eine faire und unvoreingenommene Bewertung der Leistung des Modells.

Ausbildung und Schlussfolgerung
untersuchte die Recheneffizienz, indem sie die Trainings- und Inferenzleistung einer NVIDIA RTX 3050 GPU mit 6 GB Speicher überprüfte. Der Trainingsprozess dauerte etwa 3,2 Stunden für 60 Epochen. Die Inferenzlatenz lag durchschnittlich bei 0,45 ms pro 180-Sample-Segment, was die Echtzeitnutzung ermöglicht. Der Speicherverbrauch der GPU erreichte einen Höhepunkt von 4,2 GB, und das Modell hat nur 1,8 Millionen Parameter, sodass es sich im Vergleich zu den meisten transformatorbasierten EKG-Setups leicht anfühlt.

Der Trainings- und Inferenzprozess besteht aus folgenden Schritten:
Trainingsaufbau: Trainingsparameter wie Lernrate, Batchgröße und Epochen sind definiert.
Modelltraining: Das CNN-Transformer-Modell wird auf den Trainingsdaten trainiert.
Validierung: Nach dem Training werden die Validierungsgenauigkeit und der Verlust des Modells überprüft. Wenn die Leistung gut ist, wird das Modell gerettet. Ist die Leistung schlecht, wiederholt sich die Pipeline mit anderen Trainingsparametern und kehrt zum Parameter-Einstellungsschritt zurück.

Modellarchitektur
Das gesamte CNN-Transformator-Setup besteht aus vier Hauptteilen: der Extraktion von Faltungsmerkmalen, einer Projektionsschicht, dem Transformatorencoder und schließlich dem Klassifikationskopf. Der Faltungsblock beginnt mit einer eindimensionalen Faltungsschicht mit 32 Filtern, einer Kerngröße von 3, einem Stride von 1 und einer Auffüllung von 1, gefolgt von einer ReLU. Es reduziert Werte mit Max-Pooling, Kernelgröße 2, um die zeitliche Auflösung des Signals zu verkürzen. Nach dieser ersten Faltungsschicht folgt eine weitere mit 64 Filtern, gleicher Kernelgröße 3, Stride 1, Padding 1, erneut ReLU und ein weiteres Max-Pooling mit Größe 2. Die Ausgabe von all dem wird abgeflacht, durch eine lineare Projektionsschicht geleitet, die Merkmale auf einen 128-dimensionalen Einbettungsraum abbildet, der dann in denTransformator 18,19 eingespeist wird.

Der Transformatorblock besteht aus zwei Encoder-Schichten, jede mit Mehrkopf-Selbstaufmerksamkeit und 4 Köpfen verwendet, um Langstreckenabhängigkeiten im EKG-Signal zu erfassen. In jeder Schicht gibt es ein positionsweise Feedforward-Netzwerk mit einer versteckten Größe von 256 und einem Dropout bei 0,5, um das Overfitting zu unterstützen. Nach jeder Unterschicht findet eine Schichtnormalisierung statt, was das Training stabilisiert.

Für den Klassifikationskopf handelt es sich um eine vollständig verbundene Schicht, die von 128 auf 64 fällt, gefolgt von ReLU und erneut Dropout 0,5. Dann hat die Ausgangsschicht fünf Neuronen für die Arrhythmieklassen, wobei Softmax die Wahrscheinlichkeiten berechnet.

1D Convolutional Neural Network (CNN)-Blöcke:
Der CNN-Block besteht aus zwei 1D-Faltungsschichten, jeweils gefolgt von einer ReLU-Aktivierung und einer Max-Pooling-Schicht. Diese Schichten helfen, räumliche Beziehungen im Eingangs-EKG-Signal zu identifizieren. Um die Merkmalsextraktion zu verbessern, werden nach jedem Transformationsschritt in den CNN-Schichten zusätzliche ReLU-Aktivierungsfunktionen angewendet.

Erste Faltungsschicht: Diese Schicht verwendet 32 Filter, jeweils von Größe 3, auf dem Eingangssignal. Der Prozess kann wie folgt geschrieben werden:

figure-protocol-3      figure-protocol-4

wobei yi der Ausgang ist, wj die Gewichte des Filters, xi+j das Eingangssegment, b der Vorspannterm und σ die Aktivierungsfunktion (ReLU) darstellt. Die resultierende Feature-Map durchläuft eine ReLU-Aktivierungsschicht, um Nichtlinearität hinzuzufügen:

figure-protocol-5

Pooling-Schicht: Nach jeder Faltungsoperation wird ein Max-Pooling-Schritt angewendet, um die räumlichen Dimensionen zu halbieren. Dieser Prozess ist definiert als:

figure-protocol-6

Dies hilft, die wichtigsten Funktionen zu erhalten und gleichzeitig die Rechenlast zu reduzieren.

Zweite Faltungsschicht: Diese Schicht verwendet 64 Filter der Größe 3 x 3, um die Merkmalskarten der vorherigen Schicht zu verarbeiten, sodass das Modell komplexere Muster erkennen kann. Nach der Faltung wird eine ReLU-Aktivierungsfunktion angewendet, um Nichtlinearität ins Modell einzuführen.

figure-protocol-7

Dieser Schritt stellt sicher, dass das Modell detaillierte Muster aus dem EKG-Signal erfasst.

Zusätzliche Aktivierungsschichten: Die ReLU-Aktivierung wird nach jedem Schritt nach dem Faltungsprozess angewendet, um dem Netzwerk zu helfen, komplexe Muster besser zu erfassen und sicherzustellen, dass das Modell auf positive Aktivierungen fokussiert.

Abflachungsprozess: Nach der zweiten Max-Pooling-Operation werden die Merkmalsabbildungen zu einem einzigen Vektor abgeflacht, um den Transformatorblock einzugeben.

Transformatorblöcke:
Der Transformatorblock besteht aus zwei Schichten mehrköpfiger Selbstaufmerksamkeit, die dem Modell helfen, die Beziehungen zwischen verschiedenen Teilen des EKG-Signals über die Zeit zu verstehen. Multi-Head Self-Attention funktioniert, indem jedes Paar von Elementen in einer Sequenz betrachtet wird. Für eine Folge mit Abfrage Q, Schlüssel K und Wert V wird die Aufmerksamkeit berechnet als:

figure-protocol-8

Hier ist dk die Dimensionalität der Schlüsselvektoren, was die Skaleninvarianz sicherstellt.

Feedforward-Schichten: Jeder Self-Attention-Ausgang durchläuft ein vollständig verbundenes Feedforward-Netzwerk mit ReLU-Aktivierung, gefolgt von Layer-Normalisierung. Dieser Schritt verfeinert die extrahierten temporalen Merkmale:

figure-protocol-9

wobei W1 und b1 die Gewichte und Verspannungen der Vorwärtsschicht sind.

Batch-First-Darstellung: Der Transformator arbeitet auf Sequenzen in einem Batch-First-Layout und gewährleistet so die Kompatibilität mit dem Eingangsformat des CNN-Blocks.

Vollständig verbundene (dichte) Schichten:
Nach der Verarbeitung durch den Transformatorblock wird die Ausgangssequenz abgeflacht und dann durch zwei vollständig verbundene Schichten geschickt, um die Klassifikation durchzuführen. Die erste vollständig verbundene Schicht verwandelt den Eingabevektor in einen 128-dimensionalen Merkmalsraum und formt ihn dabei um.

figure-protocol-10

wobei W die Gewichtsmatrix ist, x der Eingangsvektor und b der Biasvektor. Eine ReLU-Aktivierungsschicht wird angewendet:

figure-protocol-11

Es folgt eine Dropout-Schicht mit einer Rate von 0,5, um Überanpassungen zu verhindern.

Zweite vollständig verbundene Schicht: Die letzte Schicht bildet die 128-dimensionalen Merkmale auf die Anzahl der Herzschlagklassen ab (z. B. 5 Klassen zur Arrhythmieerkennung). Die Ausgabe durchläuft eine log-SoftMax-Funktion, um die logaritmischen Wahrscheinlichkeiten zu berechnen: exp(xi)

Hybrides CNN-Transformator-Modell
Das vorgestellte Modell ist ein hybrides Deep-Learning-Modell, das die Stärken von CNNs und Transformern kombiniert, um sowohl räumliche als auch zeitliche Darstellungen zu verwenden. Diese Architektur ist speziell für die Verarbeitung komplexer, langsequenziger Daten wie physiologische Signale geeignet.

figure-protocol-12

Die Gleichung stellt die Eingabedarstellung dar, wobei N = Anzahl der Stichproben, T = Anzahl der Zeitschritte, d = Merkmalsdimension pro Zeitschritt.

figure-protocol-13

Diese Gleichung bezeichnet die Positionseinbettungen, wobei pos = Position in der Sequenz gilt; i = Einbettungsdimensionsindex.

CNN-Modul – Lokale Merkmalsextraktion
CNNs lernen effizient lokale Abhängigkeiten und morphologische Muster wie Spitzen, Steigungen oder Spitzen in sequentiellen Daten. Die Faltungsschicht verwendet figure-protocol-14 Kerne räumlicher Ausdehnung figure-protocol-15 über einem Eingabetensor figure-protocol-16. Jeder Ausgangskanal m wird bestimmt durch:

figure-protocol-17

figure-protocol-18= Anzahl der Eingangskanäle; K = Größe des Kerns; W = Filtergewichte; b = Verzerrung

ReLU-Funktion
In diesem Fallfigure-protocol-19 stellt das lernbare Gewicht dar und figure-protocol-20 ist die Verspannung für Kanal mA, wird nichtlineare Aktivierung, wie die Rectified Linear Unit (ReLU), angewendet:

figure-protocol-21

Pooling und Feature-Kompression
Pooling-Schichten verringern die räumliche oder zeitliche Dimension von Merkmalskarten, bewahren wichtige Merkmale und reduzieren die Berechnung. Beim Max-Pooling mit Fenstergröße figure-protocol-22 und Schritten S ist das Pool-Merkmal am Standort:figure-protocol-23

figure-protocol-24

Ausgabelänge nach dem Pooling

figure-protocol-25

Dabei ist figure-protocol-26 die Eingabelänge; der Schritt definiert eine Schrittlänge für das Verschieben des Pooling-Fensters. Diese Formel berechnet die Ausgabelänge einer Merkmalskarte nach einer Pooling-Operation (z. B. Max-Pooling). Es berechnet, wie stark die Merkmalskarte verkleinert wird, basierend auf Eingabelänge, Poolgröße und Schritt. Transformiert multidimensionale Merkmalsabbildungen in einen Vektor für vollständig zusammenhängende Schichten.

Transformatorencoder – Erfassung von Langstreckenabhängigkeiten
Transformer nutzen Selbstaufmerksamkeit, um langreichweitige zeitliche Abhängigkeiten in Sequenzen17 zu lernen.

Skalierte Dot-Produkt-Aufmerksamkeit

figure-protocol-27

Q, K, V sind Abfrage-, Schlüssel- und Wertmatrizen, die durch gelernte Projektionen berechnet werden; figure-protocol-28 ist die Schlüsseldimension, die zur Skalierung des Skalierungsprodukts verwendet wird.

Multi-Kopf-Aufmerksamkeit

figure-protocol-29

figure-protocol-30Jeder Kopf berechnet unabhängig von der Aufmerksamkeit; Die Ausgaben sind verkettet und linear transformiert. figure-protocol-31 sind für jeden Kopf erlernte Projektionsmatrizen. figure-protocol-32  ist das endgültige Projektionsgewicht nachder Verkettung von 18,19.

Endgültige Vorhersage und Niederlage
Vollständig verbundene Schichten ordnen Merkmale den Logits zu, die dann mithilfe von Aktivierungsfunktionen in Vorhersagen umgewandelt werden. Nach einigen Faltungs- und Poolschichten wird zu einem Vektor figure-protocol-33 abgeflacht. figure-protocol-34 Eine vollständig zusammenhängende Schicht berechnet die Logits: Eine vollständig zusammenhängende Schicht berechnet dann die Klassenlogits:

figure-protocol-35

Sigmoid/Softmax-Aktivierung:

figure-protocol-36

Die Aktivierungsfunktion ordnet die rohe Ausgabe des Modells 'z' den Wahrscheinlichkeiten zu. Sigmoid wird auf binäre Klassifikation angewandt, Softmax auf Multiklassenprobleme zur Wahrscheinlichkeitsverteilung über Klassen hinweg. z ist der lineare Ausgang (z. B. letzte Schicht: z = Wx + b). Ausgabe ŷ liegt zwischen (0, 1), was die Wahrscheinlichkeit20 bedeutet.

Ausbildungsprozess
Das Training wurde auf einem System mit folgenden Hardware-Spezifikationen durchgeführt:
Prozessor: AMD Ryzen 7 7840HS
CPU-RAM: 16 GB
GPU-RAM: 6 GB NVIDIA GeForce RTX 3050

Die Modelle wurden mit dem Adam-Optimierer trainiert, der die Lernrate während des Trainings basierend auf dem ersten und zweiten Moment des Gradienten anpasst. Die Update-Regel für Adam wird gegeben von:

figure-protocol-37

In diesem Aufbau stellen mt und vt die Erst- und Zweitmoment-Schätzungen dar, α ist die Lernrate, und ε ist eine kleine Konstante, die verwendet wird, um Division durch Null zu verhindern. Die Modelle wurden über 60 Epochen trainiert, mit vorzeitigem Stoppen, um Überanpassungen zu verhindern. Eine Batchgröße von 1024 wurde verwendet, und die Trainingsdaten wurden mit PyTorchs DataLoader in die Modelle geladen. Dropout- und Batch-Normalisierung wurden integriert, um das Modell zu regulieren und die Konvergenz zu beschleunigen. Dropout ist eine Regularisierungsmethode, bei der während des Trainings zufällig ein prozentualer Prozentsatz der Neuronen abgeschaltet wird, was hilft, Überanpassungen zu reduzieren. Mathematisch sei zi die Aktivierung desi-ten Neurons bezeichnet. Während der Trainingsphase wird die modifizierte Aktivierung z' wie folgt berechnet:

figure-protocol-38

wobei p die Abbruchrate ist (z. B. p = 0,5 für einen Ausbruch von 50 %). Während der Inferenz wird kein Dropout angewendet und das gesamte Netzwerk wird genutzt.

Konvergenz in neuronalen Netzen ist ein Problem, das bestehende Klassifikationssysteme im Gesundheitssektor erheblich beeinflusst, insbesondere wenn Diagnosen aufgrund unzureichender Konvergenz inkonsistent sind. Neuere Forschungen zu vordefinierten Optimierungsansätzen und Konvergenz zu einer festen Zeit haben gezeigt, dass es weiterhin möglich ist, Modelle zu trainieren, die innerhalb einer festen Anzahl von Iterationen für alle Anfangszustände konvergieren. Zukünftige Modelle, die darauf basieren, können eine vordefinierte Zeitoptimierung enthalten.

Batch-Normalisierung:
Die Batch-Normalisierung stabilisiert und beschleunigt das Training, indem die Eingaben zu jeder Schicht normalisiert werden. Gegeben eine Mini-Charge von Aktivierungen x = {x1, x2, . . ., xN}, ist der batch-normalisierte Output xi .wird berechnet als:

figure-protocol-39

figure-protocol-40

wobei μB und σB2 der Mittelwert und die Varianz der Charge sind, ε eine kleine Konstante für numerische Stabilität ist, und γ sowie β lernbare Parameter sind, die die normalisierten Werte skalieren und verschieben. Batch-Normalisierung hilft, interne Kovariatenverschiebungen zu reduzieren und ermöglicht die Nutzung höherer Lernraten. Diese Techniken, kombiniert mit dem Adam-Optimierer, gewährleisten ein robustes Training, indem sie Überanpassungen mindern und die Konvergenzgeschwindigkeit21,22 verbessern.

Abbildung 3 zeigt Validierungsverlust und Validierungsgenauigkeit über Epochen während des Trainings eines Machine-Learning-Modells. Die Validierungsgenauigkeit (blaue Linie, rechte Y-Achse) beginnt relativ niedrig (etwa 97,5 %) und steigt innerhalb der ersten 10 Epochen schnell an. Sie verbessert sich weiter und erreicht nach etwa 20 Epochen Werte von etwa 99,7 % bis 99,8 %. Dies zeigt an, dass das Modell Wissen gut auf der Validierungsmenge lernt und anwendet. Der Validierungsverlust (rote Linie, linke Y-Achse) beginnt hoch und fällt dann innerhalb der ersten paar Epochen (etwa 2 bis 3) stark auf nahezu null. Danach bleibt sie für den Rest des Trainings fast bei nullstabil, 23,24.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Abschnitt stellt ein hybrides Deep-Learning-Modell vor, das entwickelt wurde, um Arrhythmien aus EKG-Daten zu kategorisieren. Das Modell wird hinsichtlich seiner Fähigkeit bewertet, fünf klinisch signifikante Herzschlagklassifikationen zu erkennen: Vorzeitige Atriale Kontraktion, Normal, Block des linken Bündels, Block des rechten Bündels und vorzeitige ventrikuläre Kontraktion. Eine umfassende Bewertung ist angesichts der klinischen Relevanz dieser Arrhythmieklassen und der Herau...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bei der Erkennung und Kategorisierung von Arrhythmien aus EKG-Biosignalen kombiniert das vorgeschlagene Deep-Learning-Hybridmodell Transformatorstrukturen und 1D-Convolutional Neural Networks (CNNs) und zeigt eine hervorragende Leistung. Diese Kombination nutzt die Fähigkeit des Transformators, globale Zeitabhängigkeiten durch Selbstaufmerksamkeitsmechanismen zu erlernen, sowie die Fähigkeit des CNN, lokalisierte räumliche Merkmale aus rohen EKG-Wellenformen zu identifizieren. Das Modell...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben keine Interessenkonflikte zu erklären.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Adam OptimizerOpen-Source (PyTorch)https://pytorch.org/docs/stable/optim.htmlOptimierungsalgorithmus, der verwendet wird, um das Deep-Learning-Modell zu trainieren, indem er die Lernraten während der Backpropagation anpasst.
Hardware (Computational System)AMD; NVIDIAhttps://www.amd.com/en/products/processors/laptop/ryzen/7000-series/amd-ryzen-7-7840hs ; https://www.nvidia.comProzessor: AMD Ryzen 7 7840HS; CPU-RAM: 16 GB; GPU: NVIDIA GeForce RTX 3050 (6 GB VRAM). Verwendet für Modelltraining und -bewertung.
Unausgewogenes LernenUnausgewogenes Lernenhttps://imbalanced-learn.orgPython-Bibliothek, die für das Klassenbalancing mit der Synthetic Minority Over-sampling Technique (SMOTE) verwendet wird.
MatplotlibMatplotlibhttps://matplotlib.orgPython-Bibliothek, die zum Plotten von EKG-Signalen, Verwirrungsmatrizen und Leistungsdiagrammen verwendet wird.
PhysioNet-EKG-DatenbankenPhysioNethttps://physionet.orgÖffentliche EKG-Datensätze, die in der Studie verwendet wurden, darunter MIT-BIH-Arrhythmien, MIT-BIH Supraventrikulärarrhythmie, INCART 12-Lead und Sudden Cardiac Death Holter-Datenbanken.
PyTorchPyTorchhttps://pytorch.orgPython Deep-Learning-Framework, das zur Implementierung von CNN- und Transformer-Modellen, Trainingspipeline und Inferenz verwendet wird.
PythonPython Software Foundationhttps://www.python.orgProgrammiersprache, die für Datenvorverarbeitung, Modellentwicklung, Training und Auswertung verwendet wird.
SeabornSeabornhttps://seaborn.pydata.orgPython-Datenvisualisierungsbibliothek, die für statistische Diagramme und Ergebnisvisualisierung verwendet wird.
WFDBWFDBhttps://wfdb.readthedocs.ioPython-Paket, das zum Lesen, Schreiben, Verarbeiten und Darstellen physiologischer Signale und Annotationen aus PhysioNet-Datenbanken verwendet wird.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ullah, A., et al. A hybrid deep CNN model for abnormal arrhythmia detection based on cardiac ECG signal. Sensors (Basel). 21 (3), 951(2021).
  2. Oh, S. L., Ng, E. Y. K. Automated diagnosis of arrhythmia using combination of CNN and LSTM techniques with variable length heart beats. Comput Biol Med. 102, 278-287 (2018).
  3. Jamil, S., Rahman, M. A. Novel deep-learning-based framework for the classification of cardiac arrhythmia. J Imaging. 8 (3), 70(2022).
  4. Reegu, F. A., et al. Blockchain-based framework for interoperable electronic health records for an improved healthcare system. Sustainability. 15 (8), 6337-6352 (2023).
  5. Aseeri, A. O. Uncertainty-aware deep learning-based cardiac arrhythmias classification model of electrocardiogram signals. Computers. 11 (6), 82-97 (2022).
  6. Tesfai, H., et al. Lightweight ShuffleNet-based CNN for arrhythmia classification. IEEE Access. 12, 111842-111854 (2022).
  7. Pandey, S. K., Janghel, R. R. Automatic detection of arrhythmia from imbalanced ECG database using CNN model with SMOTE. Australas Phys Eng Sci Med. 42, 1129-1139 (2019).
  8. Hu, R., Chen, J., Zhou, L. A transformer-based deep neural network for arrhythmia detection using continuous ECG signals. Comput Biol Med. 144, 105325(2022).
  9. Dang, H., et al. Novel deep arrhythmia-diagnosis network for atrial fibrillation classification using electrocardiogram signals. IEEE Access. 7, 75577-75590 (2019).
  10. Li, J., Zhang, Y., Gao, L., Li, X. Arrhythmia classification using biased dropout and morphology–rhythm feature with incremental broad learning. IEEE Access. 9, 66132-66140 (2021).
  11. Joddoa, A. S. Heart disease prediction system using SMOTE-balanced dataset and decision classifier. AIP Conf Proc, 2834, 050006(2023).
  12. Li, Y., Qian, R., Li, K. Inter-patient arrhythmia classification with improved deep residual convolutional neural network. Comput Methods Programs Biomed. 214, 106582(2022).
  13. Kiranyaz, S., Ince, T., Gabbouj, M. Real-time patient-specific ECG classification by 1-D convolutional neural networks. IEEE Trans Biomed Eng. 63 (3), 664-675 (2016).
  14. Vaswani, A., et al. Attention is all you need. Proceedings of the 31st International Conference on Neural Information Processing Systems, Long Beach, California, USA, , (2017).
  15. Hannun, A. Y., et al. Cardiologist-level arrhythmia detection and classification in ambulatory electrocardiograms. Nat Med. 25, 65-69 (2019).
  16. Zihlmann, M., et al. Convolutional recurrent neural networks for ECG classification. arXiv preprint. arXiv. , 1710.06122(2018).
  17. Kim, D., Lee, K. Hybrid CNN–transformer model for arrhythmia detection. Sci Rep. 15, 7817(2025).
  18. Diker, A., Aydin, K. Transformer-based attention model for arrhythmia detection using ECG signals. Biomed Signal Process Control. 68, 102679(2021).
  19. Sen, S. Y., Ozkurt, N. Convolutional neural network hyperparameter tuning with Adam optimizer for ECG classification. 2020 Innovations in Intelligent Systems and Applications Conference (ASYU), Istanbul, Turkey, , (2020).
  20. Chawla, N. V., Bowyer, K. W., Hall, L. O., Kegelmeyer, W. P. SMOTE: Synthetic minority over-sampling technique. J Artif Intell Res. 16, 321-357 (2002).
  21. Xia, Y., Wulan, N., Wang, K., Zhang, H. Detecting atrial fibrillation by deep convolutional neural networks. Comput Biol Med. 93, 84-92 (2020).
  22. Mohonta, S. C., Motin, M. A., Kumar, D. K. Electrocardiogram-based arrhythmia classification using wavelet transform with deep learning model. Sensing Bio-Sensing Res. 37, 100502(2022).
  23. Selvam, I. J., Madhavan, M. Detection and classification of electrocardiography using hybrid deep learning models. Hellenic J Cardiol. 81, 75-84 (2025).
  24. Izci, E., Ozdemir, M. A., Degirmenci, M., Akan, A. Cardiac arrhythmia detection from 2D ECG images by using deep learning technique. 2019 Medical Technologies Congress (TIPTEKNO), Izmir, Turkey, , (2019).
  25. Zheng, Z., Chen, Z., Hu, F., Zhu, J., Tang, Q., et al. Automatic diagnosis of arrhythmias using a combination of CNN and LSTM technology. Electronics. 9 (1), 121(2020).
  26. Isin, A., Ozdalili, S. Cardiac arrhythmia detection using deep learning. Procedia Comput Sci. 120, 268-275 (2017).
  27. Huang, J., Chen, B., Yao, B., He, W. ECG arrhythmia classification using STFT-based spectrogram and convolutional neural network. IEEE Access. 7, 92871-92880 (2019).
  28. Wang, T., Lu, C., Sun, Y., Yang, M., Liu, C., et al. Automatic ECG classification using continuous wavelet transform and convolutional neural network. Entropy. 23 (1), 119(2021).
  29. Panneerselvam, R., et al. Multimodal skin cancer prediction: Integrating dermoscopic images and clinical metadata with transfer learning. Open Bioinforma J. 18, e18750362358444(2025).
  30. Xiong, W., Zhang, G., Yan, D., Cao, L., Huang, X., et al. Multichannel feature fusion network-based technique for heart sound signal classification and recognition. Expert Syst Appl. 273, 126839(2025).
  31. Jin, J., Zhu, J., Zhao, L., Chen, L., Gong, J. A robust predefined-time convergence zeroing neural network for dynamic matrix inversion. IEEE Trans Cybern. 53, 3887-3900 (2022).
  32. Zhu, Y., Zhang, Q., Wang, Y., Liu, W., Zeng, S., et al. Identification of necroptosis and immune infiltration in heart failure through bioinformatics analysis. J Inflamm Res. 18, 2465-2481 (2025).
  33. Zhang, Y., Li, X., Chen, Z., Wang, H., Liu, C., et al. Multichannel feature fusion–based deep learning framework for electrocardiogram arrhythmia classification. IEEE Trans Neural Syst Rehabil Eng. 31, 4287-4297 (2023).
  34. Kumar, A., Singh, R., Sharma, P., Verma, S., Gupta, N. Application of machine learning and deep learning techniques for toxicity prediction and safety assessment. J Appl Toxicol. 45 (3), 423-437 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Arrhythmia PredictionElectrocardiogram SignalsDeep Learning ModelConvolutional Neural NetworksTransformer LayersHeartbeat ClassificationLead I ECGData NormalizationSynthetic OversamplingReal Time Detection

Related Articles