Research Article

Un approccio ibrido computazionalmente efficiente per la previsione dell'aritmia basata su elettrocardiogramma

DOI:

10.3791/69541

May 22nd, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il modello in questo studio è costruito per classificare le aritmie precoci nei dataset elettrocardiografici (ECG) da diversi database in cinque principali tipi di battito cardiaco. Rispetto ad altri modelli, questo modello offre prestazioni migliori in termini di accuratezza, sensibilità, precisione e richiamo.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le malattie cardiovascolari, in particolare le aritmie, sono una delle principali cause di morte a livello mondiale. Questo evidenzia la necessità di sistemi automatizzati in grado di rilevare e diagnosticare queste condizioni in modo precoce. Questa ricerca introduce un modello di deep learning che identifica le aritmie utilizzando segnali elettrocardiografici (ECG). Il modello si concentra su cinque tipi principali di battiti cardiaci: normale (N), blocco ramo sinistro (L), blocco ramo destro (R), battito precoce atriale (A) e contrazione ventricolare prematura (V). Il sistema utilizza segnali Lead I provenienti da diversi database, tra cui MIT-BIH Arrhythmia, Supraventricular, INCART 12-lead e Sudden Cardiac Death Holter. Questo fornisce più di 3,9 milioni di segmenti di formazione e 112.575 segmenti di test.

I dati vengono preelaborati dividendoli in finestre fisse di 180 campioni, scalandoli tramite la normalizzazione Min-Max e bilanciando le classi con la Tecnica di Sovracampionamento delle Minoranze Sintetiche. Il modello combina Reti Neurali Convoluzionali 1D per estrarre caratteristiche spaziali e strati trasformatori per catturare schemi basati sul tempo. Utilizza l'ottimizzatore Adam e include dropout e normalizzazione batch per migliorare le prestazioni. Il sistema raggiunge una precisione, precisione e un punteggio F1 del 99,99% in tutte le classi, meglio del modello TN4 e di altri modelli di alto livello. L'uso di Reti Neurali Convoluzionali e architetture ibride profonde migliora la robustezza delle caratteristiche. Questo modello mostra un grande potenziale per il rilevamento scalabile e in tempo reale delle aritmie e contribuisce all'avanzamento dell'assistenza sanitaria digitale personalizzata guidata dall'IA.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le malattie cardiovascolari sono la causa più significativa di problemi di salute umana, con oltre 17 milioni di morti ogni anno. Quasi tre quarti di tutti i casi di malattie cardiovascolari (CVD) vivono in paesi a basso reddito del mondo, come affermato dalla World Heart Federation. Un elettrocardiogramma (ECG) cattura l'attività elettrica generata dalla depolarizzazione del cuore. I segnali elettrici si propagano alla pelle. I segnali ECG trasmettono almeno due informazioni vitali. Uno è la biomedicina legata alla salute. L'altra riguarda le credenziali legate alla persona o la biometria. Grazie alla sua semplicità, sono stati presi in considerazione vari metodi per classificare i segnali ECG, inclusi approcci artigianali e apprendimento automatico. Il metodo manuale richiede tempo ed è inefficiente. Richiede segnali in tempo reale come l'ECG e un'infrastruttura informatica significativa. Gli approcci di apprendimento automatico probabilmente offriranno una precisione dei bracket inferiore rispetto al metodo manuale, ma è necessario un algoritmo adeguato per ridurre il rischio di aritmienon rilevate 1.

La malattia cardiovascolare più comune è l'aritmia, una condizione in cui il battito cardiaco è anomalo. Questi modelli anomali devono essere classificati in categorie perché questo tipo di informazioni può influenzare il trattamento. L'ECG è ampiamente utilizzato per rilevare modelli cardiaci anomali e prevedere le malattie cardiache, consentendo una diagnosi precoce. La diagnosi di aritmia si basa in gran parte sull'ECG, un importante dispositivo medico utilizzato per registrare l'eccitabilità cardiaca, trasmettere segnali e monitorare il recupero. L'ECG è necessario e affidabile nella medicina moderna. L'automazione dell'interpretazione dei segnali ECG migliora notevolmente la pratica clinica e la sicurezza del paziente. Le aritmie sono ritmi e modelli cardiaci anomali. L'intelligenza artificiale, in particolare il machine learning, è uno strumento eccellente per la previsione delle malattie e l'analisi delle opinioni, soprattutto per le malattiecardiovascolari 2.

Diversi dati medici, come le cartelle cliniche dei pazienti, sono generalmente utilizzati negli ospedali per scopi clinici. I dati medici possono anche essere generati in tempi rapidi per supportare l'ottimizzazione degli algoritmi di machine learning. La macchina viene addestrata su un dataset che alla fine ne apprende la mano. Una volta addestrato, può identificare e classificare se un caso è sano o basato su diversi attributi dei loro dati 3,4. Le macchine possono anche rilevare schemi nei dati forniti, che potrebbero non essere facilmente percepiti dagli esseri umani a causa della mancanza di tempo o delle risorse limitate. Sono stati impiegati diversi metodi per classificare i segnali ECG, tra cui K-vicini più prossimi (KNN), macchine a vettori di supporto (SVM), reti neurali (NN), alberi decisionali, analisi discriminante lineare (LDA) e classificatori bayesiani. La SVM è considerata uno degli algoritmi di apprendimento supervisionato più efficaci per classificare i segnali ECG al fine di rilevarearitmie 5,6.

Un modello a bracket ben performante che utilizza NN e il perceptrone multistrato (MLP) è migliore di altri metodi convenzionali. Algoritmi di deep learning come le reti neurali artificiali (ANN) sono stati impiegati con successo in compiti come il recupero delle informazioni, il riconoscimento di immagini, il rilevamento di oggetti e l'elaborazione del linguaggio. Le CNN sono state ampiamente utilizzate nella ricerca per estrarre caratteristiche stilistiche dalle forme d'onda ECG e analizzarle per vari scopi, come la scoperta del complesso QRS e del segmento ST o delle onde P 7,8. La CNN 1D impara a rilevare le caratteristiche più rilevanti nei segnali ECG e a classificarle in cinque tipi di aritmie. È stato applicato un filtro di rimozione del rumore ad alta frequenza e a deriva della linea di base per migliorare la qualità del segnale. Questo ha classificato le aritmie in cinque categorie 9,10.

Come mostrato nella Figura 1, l'onda P, il complesso QRS e l'onda T sono parti importanti di un ECG. L'onda P rappresenta la depolarizzazione atriale, l'attività elettrica che causa la contrazione degli atri. Il complesso QRS riflette la depolarizzazione ventricolare; È l'impulso elettrico che scatena la contrazione ventricolare. L'onda T indica la ripolarizzazione ventricolare, la fase di recupero dei ventricoli dopo la contrazione. Insieme, queste onde rappresentano un ciclo cardiaco completo. Sono fondamentali per comprendere come funziona il cuore e per diagnosticare problemicardiaci 11.

Tutte queste onde rappresentano un unico ciclo cardiaco. Sono estremamente importanti per comprendere come funziona il cuore e per diagnosticare le condizioni cardiache. I modelli di deep learning hanno recentemente compiuto progressi significativi nell'interpretazione dei segnali medici assistiti dal computer, inclusi i segnali ECG. I modelli tradizionali di machine learning basati su funzionalità e realizzati a mano soffrono di problemi di scalabilità e adattamento tra diverse popolazioni di pazienti. Per affrontare queste sfide, sono emersi modelli profondi come le CNN e modelli ibridi che combinano CNN con modelli ricorrenti come gli LSTM, per apprendere automaticamente le caratteristiche rilevanti dai segnali ECG grezzi. Questo ha notevolmente migliorato l'accuratezza dellaclassificazione 12.

Questo studio propone un quadro di deep learning per classificare i segnali ECG in cinque categorie di battiti cardiaci: normale (N), blocco ramo sinistro (L), blocco ramo destro (R), battito atriale prematuro (A) e contrazione ventricolare prematura (V). Per addestrare il modello, utilizziamo dataset ECG pubblici come il MIT-BIH Arrhythmia Database e il Supraventricular Database. Questi dataset sono pre-elaborati e suddivisi in segmenti di lunghezza fissa per l'analisi. Poiché lo squilibrio di classe è un problema comune nei dati sulle aritmie, applichiamo la Tecnica di Sovracampionamento delle Minoranze Sintetiche (SMOTE) per bilanciare i dati di addestramento. Questo garantisce che il modello possa apprendere efficacemente da tutte le classi e migliorare la sua accuratezza nella classificazione dei diversi tipi di battiti cardiaci.

Ispirandosi ai recenti progressi nella classificazione ECG, inclusi modelli che utilizzano trasformate wavelet continue (CWT) e architetture CNN, l'approccio proposto impiega sia un modello CNN standard che un modello ibrido che incorpora strati trasformatori. Combinando una CNN per l'estrazione delle caratteristiche spaziali e un trasformatore per la cattura delle dipendenze temporali, questo sistema raggiunge un'elevata precisione, con F1 e precisione vicine al 100% in tutte leclassi 13,14.

"Caratteristiche spaziali" si riferiscono a tratti legati alla posizione o alla posizione di qualcosa, come distanza, direzione e forma. D'altra parte, le "caratteristiche temporali" descrivono elementi legati al tempo, come quando si è verificato un evento, la sua durata o la sequenza degli eventi. In sostanza, "spaziale" significa "spazio" e "temporale" significa "tempo".

Gli obiettivi principali di questa ricerca erano sviluppare un modello accurato e scalabile per il rilevamento in tempo reale delle aritmie e supportare il campo in espansione della diagnostica basata sull'IA nel settore sanitario. Questo sistema mostra potenziali risultati per il monitoraggio in tempo reale, consentendo la diagnosi precoce e l'intervento per i pazienti a rischio di eventi cardiaci.

Gli obiettivi di questo lavoro di ricerca sono multifaccettati. Innanzitutto, questa tecnica proposta mira a classificare i battiti aritmici in cinque categorie: normale (N), blocco del ramo sinistro (L), blocco del ramo destro (R), battito prematuro atriale (A) e contrazione ventricolare prematura (V). In secondo luogo, questa ricerca mira a costruire un modello ibrido CNN e transformer che possa apprendere sia informazioni morfologiche che temporali dai segnali ECG senzapreelaborazione 15. In terzo luogo, questa tecnica proposta mira a fornire una soluzione orientata alle prestazioni che possa essere implementata in tempo reale. In quarto luogo, questa ricerca mira a dimostrare miglioramenti nell'accuratezza e nella sensibilità del modello proposto rispetto ai modelliall'avanguardia 16,17.

Inoltre, le Reti Convoluzionali di Grafi (GCN), che modellano le interazioni tra fattori fisiologici all'interno di un grafo strutturato, sono state introdotte per compiti di predizione biomedica e potrebbero svolgere un ruolo nei futuri modelli di classificazione delle aritmie che considerano le dipendenze tra le conduttori.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dichiarazione etica
Questo studio si è basato interamente su dati ECG pubblici e anonimizzati scaricati da PhysioNet. Tutti i dataset utilizzati in questo studio sono stati originariamente raccolti con il consenso dei soggetti e con l'approvazione etica dei rispettivi titolari dei dati. Questa ricerca non ha richiesto alcuna raccolta di dati, lavoro sperimentale con soggetti umani o animali, né informazioni sull'identità personale del paziente. Pertanto, non è stata richiesta alcuna revisione etica aggiuntiva.

Metodologia
La Figura 2 illustra il flusso di lavoro dell'architettura proposta.

Raccolta dati
I dati ECG sono raccolti dal PhysioNet Database, un popolare archivio di segnali fisiologici. Dal database vengono recuperati molteplici dataset. Questi dataset vengono uniti in un unico dataset principale che include varie classi di segnali ECG.

Dataset utilizzati
Questo studio ha utilizzato diversi dataset ECG disponibili pubblicamente per sviluppare e valutare un modello di deep learning per la classificazione delle aritmie. La selezione di questi dataset è stata effettuata con attenzione, considerando la loro diversità in termini di demografia dei pazienti e la varietà di tipi di aritmie, per garantire che il modello proposto funzioni bene in diversi scenari9. Per questo studio, sono stati combinati solo i dati Lead-I del Database Aritmia MIT-BIH, del Database Supraventricolare Aritmica MIT-BIH, del Database Aritmia INCART di St. Petersburg a 12 derivazioni e del Database Holter per Morte Cardiaca Subita. Questi dataset sono noti per le registrazioni ECG annotate di alta qualità che comprendono un ampio spettro di classi di aritmie.

I dataset combinati sopra includono la demografia dei pazienti, i dispositivi di registrazione, le frequenze di campionamento e le impostazioni. La variabilità sopra menzionata nel modello ne migliora la generalizzazione esponendolo a una vasta gamma di morfologie ECG, rumore e ritmi.

Descrizione dei dataset
Database delle aritmie del MIT-BIH
Il dataset di aritmie del MIT-BIH contiene 48 registrazioni ECG di mezz'ora, numerate da 100 a 234. Ogni record contiene segnali ECG a due canali digitalizzati a 360 campioni al secondo. I dati sono memorizzati nei formati .dat, .hea e .atr.

Database delle aritmie supraventricolari del MIT-BIH
Questo è un sottoinsieme specifico dei database MIT-BIH. Il database delle aritmie supraventricolari del MIT-BIH include 78 registrazioni ECG a lunghezza intera, che vanno da 30 minuti a diverse ore, numerate da 801 a 811. Ogni record include segnali ECG a due canali, convertiti in formato digitale a 128 campioni al secondo.

Il database delle aritmie a 12 derivazioni INCART di San Pietroburgo
Questo database include 75 registrazioni annotate prese da 32 monitor Holter. Ogni registrazione dura 30 minuti e include 12 lead standard, ciascuno campionato a 257 Hz. La potenza del segnale varia tra 250 e 1100 unità di convertitore analogico-digitale per millivolt.

Database Holter per morte cardiaca imprevista
Questo dataset è uno dei tanti registri Holter ad accesso aperto che catturano le occorrenze fattuali di tachicardia ventricolare (TV) e fibrillazione ventricolare (FV). Entrambi possono portare a morte cardiaca imprevista. Ogni disco dura 24 ore ed è campionato a 250 Hz.

Preprocessing dei dati
In questo studio sono stati utilizzati quattro database pubblici ECG con diverse velocità di campionamento: MIT-BIH Aritmia (360 Hz), MIT-BIH Aritmia Supraventricolare (128 Hz), St. Petersburg INCART 12-derivazione (257 Hz) e Morte Cardiaca Subita Holter (250 Hz). Per garantire che tutti i dati fossero coerenti e potessero essere combinati durante l'addestramento del modello, tutti i segnali ECG venivano ricampionati a una frequenza comune di 360 Hz, che corrisponde al database MIT-BIH Aritmia ed è comunemente utilizzata come standard nella ricerca ECG. Il ricampionamento veniva eseguito tramite interpolazione a banda limitata; inizialmente, i segnali ECG erano filtrati passa-basso per prevenire l'aliasing, e successivamente è stato utilizzato un kernel di ricostruzione basato su SINC per l'interpolazione, seguito dal ricampionamento finale a 360 Hz. Dopo il ricampionamento, ogni segnale è stato suddiviso in finestre di 180 campioni, equivalenti approssimativamente a 0,5 s di dati, assicurando che tutti i dataset avessero la stessa risoluzione temporale. Questa standardizzazione ha permesso di combinare segnali provenienti da diversi database per addestramento e test, aiutando il modello a apprendere schemi coerenti nel tempo.

La pre-elaborazione ha coinvolto diversi passaggi importanti per garantire la qualità dei dati di input:
Segmentazione dei dati:
Dopo il ricampionamento, ogni segnale ECG è stato suddiviso in finestre di lunghezza fissa di 180 campioni. Questo corrisponde a circa 0,5 s di durata del segnale a una frequenza di campionamento di 360 Hz. Questa ricerca utilizzava una finestra scorrevole fissa e non sovrapposta per la segmentazione. Ogni finestra ha raccolto una sequenza continua di campioni ECG. Lo studio ha scelto una finestra di 180 campioni perché un intervallo di 0,5 s è sufficiente per catturare un ciclo cardiaco completo o le sue parti principali: l'onda P, il complesso QRS e l'onda T, per la frequenza cardiaca tipica degli adulti. A ciascun segmento veniva assegnata un'etichetta di classe in base all'annotazione al centro del segmento. In questo modo, l'etichetta del segmento corrispondeva alla forma principale del battito cardiaco all'interno di quella finestra. Metodo della finestra scorrevole, applicato questa funzione di segmentazione:

figure-protocol-1

dove si è il campione ECG al tempo i.

Normalizzazione:
Ho normalizzato i dati ECG segmentati con scaling Min-Max per assicurarmi che tutte le caratteristiche avessero valori compresi tra 0 e1 10.

figure-protocol-2

Questo passaggio aiuta ad accelerare la convergenza del modello durante l'addestramento.

Bilanciamento delle classi con SMOTE
I battiti normali (N) superavano di gran lunga le classi di battito cardiaco anomale nel dataset ECG, che mostrava un significativo squilibrio di classe. Dopo segmentazione, normalizzazione e divisione train-test, il dataset di addestramento è stato sottoposto alla Synthetic Minority Over-sampling Technique (SMOTE) per affrontare questo problema.

Uno spazio delle caratteristiche a 180 dimensioni veniva utilizzato per rappresentare ogni segmento ECG, composto da 180 campioni normalizzati. SMOTE utilizzava la distanza euclidea per determinare i k vicini più prossimi (k = 5) di ogni campione di classe minoritaria all'interno della propria classe. SMOTE veniva applicato solo ai dati di addestramento, suddivisi in set di addestramento del 70% e set di test del 30% utilizzando campionamento stratificato. In questo modo, non venivano aggiunti campioni artificiali al set di test, assicurando che i risultati del test non fossero influenzati dal processo di sovracampionamento. I dati di test rimasero invariati, mantenendo la distribuzione originale delle classi, e venivano utilizzati solo per valutare il modello in modo equo. Di conseguenza, i risultati ad alta prestazione di questo studio dimostrano la vera capacità del modello di generalizzare, non dovuta a un sovrafitting o a punteggi gonfiati derivanti dall'aggiunta di campioni aggiuntivi.

Divisione dei test del treno:
Dopo la preelaborazione e il filtraggio delle classi, il dataset è stato suddiviso in sottoinsiemi di addestramento e test con una suddivisione 70%–30% utilizzando campionamento casuale stratificato. Questa stratificazione si basa sulle etichette delle classi per garantire che le proporzioni relative di ogni classe cardiaca siano mantenute nei set di addestramento e test.

La scissione è stata eseguita utilizzando un seed casuale per la riproducibilità. Ogni segmento ECG è apparso esclusivamente sia nel set di addestramento che nel set di test. Per evitare bias e deviazioni dei dati, ogni passaggio di pre-elaborazione che potrebbe influenzare la distribuzione dei dati (in particolare, il bilanciamento delle classi tramite SMOTE) veniva eseguito solo dopo la divisione e esclusivamente sui dati di addestramento.

A tal proposito, mantenendo le proporzioni di classe, utilizzando la stratificazione casuale e separando rigorosamente i campioni in set di addestramento e test, il processo di divisione riduce la probabilità di bias nei campioni, permettendo alle metriche di performance di riflettere la generalizzazione del modello piuttosto che i residui specifici dei dati.

Suddivisione dei dataset e distribuzione delle classi
Il dataset finale è stato suddiviso in set di addestramento e di test, con il 70% per l'addestramento e il 30% per i test. Dopo l'applicazione del SMOTE, lo squilibrio di classe veniva ridotto, assicurando che ogni tipo di aritmia fosse ben rappresentato sia nel set di addestramento che in quello di test. Un totale di 3.966.620 segmenti ECG sono stati utilizzati per l'addestramento, mentre 112.575 segmenti ECG sono stati impiegati per i test. L'elevato volume di dati, combinato con la varietà di tipi di aritmie, ha permesso la creazione di un modello che identifica efficacemente diversi tipi di aritmie nei segnali ECG reali. Questo studio utilizza modelli di deep learning per classificare le aritmie ECG. I cinque tipi di battito cardiaco, ovvero Normale (N), Blocco Ramo Sinistro (L), Blocco Ramo Destro (R), Battito Prematuro Atriale (A) e Contrazione Ventricolare Precoce (V), sono stati scelti in conformità con le annotazioni standardizzate del battito fornite nel Database Aritmia MIT-BIH e con le linee guida AAMI per l'annotazione del battito ECG. Tutte e cinque le annotazioni del battito menzionate qui comprendono condizioni cardiache significative che rientrano nella categoria ampia delle aritmie e mostrano caratteristiche distintive della forma d'onda nei segnali ECG attorno alle onde P, QRS e T.

Inoltre, queste classi sono tra le più frequenti e costantemente etichettate nei database pubblici ECG, il che rende più facile testarne l'efficacia rispetto ad altri approcci di classificazione del ritmo cardiaco basati su ECG. I dataset sono stati suddivisi utilizzando un metodo cross-patient. Questa configurazione garantiva che i segmenti ECG di un singolo paziente non comparissero contemporaneamente sia nel set di addestramento che in quello di test. Una volta avvenuta quella divisione, SMOTE veniva applicato solo al set di addestramento. Il set di test rimase privo di campioni sintetici e finestre temporali ripetute. Tutto ciò aiuta a evitare sovrapposizioni a livello di segmento e supporta una vera generalizzazione quando si tratta di pazienti non visti prima.

Distribuzione delle classi prima e dopo SMOTE:
Il dataset originale presentava uno squilibrio significativo tra le classi, con un gran numero di battiti Normali (N) e meno campioni per le classi anomale. Prima dell'uso di SMOTE, i dati di addestramento avevano circa 133.320 segmenti normali (N), 8.075 blocchi di ramo a sinistra (L), 10.431 blocchi di ramo a destra (R), 4.489 battito prematuro atriale (A) e 60.682 segmenti di contrazione ventricolare prematura (V). Per colmare lo squilibrio, SMOTE è stato applicato solo al set di addestramento, aumentando il numero di campioni nelle classi minoritarie per corrispondere alla classe di maggioranza. Dopo l'augmentazione, ogni classe aveva 793.324 segmenti, per un totale di 3.966.620 segmenti ECG per l'addestramento. Il set di prova, che aveva 112.575 segmenti, mantenne la sua distribuzione originale delle classi e non fu sovracampionato. Questo approccio ha garantito una valutazione equa e imparziale delle prestazioni del modello.

Addestramento e inferenza
ha esaminato l'efficienza computazionale controllando le prestazioni di addestramento e inferenza su una GPU NVIDIA RTX 3050 con 6 GB di memoria. Il processo di addestramento durava circa 3,2 ore per 60 epoche. La latenza di inferenza era di una media di 0,45 ms per ogni segmento di 180 campioni, il che rende possibile l'uso in tempo reale. L'uso di memoria sulla GPU ha raggiunto un picco di 4,2 GB, e il modello ha solo 1,8 milioni di parametri, quindi risulta leggero rispetto alla maggior parte dei sistemi ECG basati su trasformatori.

Il processo di addestramento e inferenza prevede i seguenti passaggi:
Configurazione dell'addestramento: Parametri di addestramento, come tasso di apprendimento, dimensione del lotto ed epoche, sono definiti.
Addestramento del modello: Il modello CNN-Transformer viene addestrato sui dati di addestramento.
Validazione: Dopo l'addestramento, vengono verificate l'accuratezza e la perdita di validazione del modello. Se le prestazioni sono buone, il modello viene salvato. Se le prestazioni sono scarse, la pipeline si ripete con parametri di addestramento diversi, tornando al passaggio di impostazione dei parametri.

Architettura del modello
L'intera configurazione CNN-Transformer è composta da quattro parti principali: estrazione convoluzionale delle caratteristiche, uno strato di proiezione, l'encoder del trasformatore e infine la testa di classificazione. Il blocco convoluzionale inizia con uno strato convoluzionale unidimensionale con 32 filtri, una dimensione del nucleo di 3, un passo di 1 e un riempimento di 1, seguito da un ReLU. Riduce le cose con il max-pooling, dimensione kernel 2, per ridurre la risoluzione temporale del segnale. Dopo quel primo strato di convoluzione, ce n'è un altro con 64 filtri, stessa dimensione kernel 3, stride 1, padding 1, ReLU di nuovo e un altro max-pooling con dimensione 2. L'output di tutto ciò viene appiattito, passato attraverso uno strato di proiezione lineare che mappa le caratteristiche in uno spazio di embedding a 128 dimensioni, che poi alimenta il trasformatore18,19.

Il blocco trasformatore ha due livelli di encoder, ciascuno con autoattenzione multi-testa utilizzando 4 testine per catturare le dipendenze a lungo raggio nel segnale ECG. In ogni livello c'è una rete feedforward posizione per posizione con una dimensione nascosta di 256 e un dropout a 0,5 per aiutare con l'overfitting. La normalizzazione dei strati avviene dopo ogni sottostrato, stabilizzando l'addestramento.

Per la testa di classificazione, è uno strato completamente connesso che scende da 128 a 64, seguito da ReLU e dropout di nuovo 0,5. Poi lo strato di output ha cinque neuroni per le classi di aritmie, con Softmax per ottenere le probabilità.

Blocchi di Reti Neurali Convoluzionali 1D (CNN):
Il blocco CNN è composto da due strati convoluzionali 1D, ciascuno seguito da un'attivazione ReLU e uno strato di max pooling. Questi strati aiutano a identificare le relazioni spaziali all'interno del segnale ECG di ingresso. Per migliorare l'estrazione delle caratteristiche, vengono applicate ulteriori funzioni di attivazione ReLU dopo ogni fase di trasformazione nei livelli CNN.

Primo strato convoluzionale: Questo strato utilizza 32 filtri, ciascuno di dimensione 3, sul segnale di ingresso. Il processo può essere scritto come:

figure-protocol-3      figure-protocol-4

dove yi è l'uscita, wj rappresenta i pesi del filtro, xi+j è il segmento di ingresso, b è il termine di bias e σ rappresenta la funzione di attivazione (ReLU). La mappa di caratteristiche risultante attraversa uno strato di attivazione ReLU per aggiungere non linearità:

figure-protocol-5

Layer di pooling: Dopo ogni operazione convoluzionale, viene applicato un passo di max-pooling per dimezzare le dimensioni spaziali. Questo processo è definito come:

figure-protocol-6

Questo aiuta a mantenere le caratteristiche più significative riducendo al contempo il carico di calcolo.

Secondo strato convoluzionale: Questo livello utilizza 64 filtri di dimensione 3 x 3 per elaborare le feature map del livello precedente, permettendo al modello di rilevare pattern più complessi. Dopo la convoluzione, viene applicata una funzione di attivazione ReLU per introdurre la non linearità nel modello.

figure-protocol-7

Questo passaggio garantisce che il modello catturi i pattern dettagliati del segnale ECG.

Livelli aggiuntivi di attivazione: l'attivazione di ReLU viene applicata dopo ogni fase successiva al processo di convoluzione per aiutare la rete a catturare meglio pattern complessi, assicurando che il modello si concentri su attivazioni positive.

Processo di appiattimento: Dopo la seconda operazione di max-pooling, le feature map vengono appiattite in un unico vettore per l'ingresso al blocco del trasformatore.

Blocchi per trasformatori:
Il blocco trasformatore è composto da due strati di autoattenzione multi-testa, che aiutano il modello a comprendere le relazioni tra le diverse parti del segnale ECG nel tempo. L'Auto-Attenzione Multi-Teste funziona osservando ogni coppia di elementi in una sequenza. Per una sequenza con query Q, chiave K e valore V, l'attenzione si calcola come:

figure-protocol-8

Qui, dk è la dimensionalità dei vettori chiave, garantendo l'invarianza di scala.

Livelli feedforward: Ogni output di auto-attenzione passa attraverso una rete feedforward completamente connessa con attivazione ReLU, seguita dalla normalizzazione dei livelli. Questo passaggio affina le caratteristiche temporali estratte:

figure-protocol-9

dove W1 e b1 sono i pesi e i bias dello strato feedforward.

Rappresentazione batch-first: Il trasformatore opera su sequenze in un layout batch-first, garantendo compatibilità con il formato di input del blocco CNN.

Strati completamente connessi (densi):
Dopo l'elaborazione attraverso il blocco del trasformatore, la sequenza di uscita viene appiattita e poi inviata attraverso due strati completamente collegati per effettuare la classificazione. Il primo strato completamente connesso trasforma il vettore di input in uno spazio di caratteristiche a 128 dimensioni, rimodellandolo nel processo.

figure-protocol-10

dove W è la matrice di peso, x è il vettore di input e b è il vettore di bias. Viene applicato uno strato di attivazione ReLU:

figure-protocol-11

Segue uno strato di dropout con una velocità di 0,5 per evitare il sovrafitting.

Secondo strato completamente connesso: L'ultimo strato mappa le caratteristiche a 128 dimensioni al numero di classi di battito cardiaco (ad esempio, 5 classi per il rilevamento delle aritmie). L'output passa attraverso una funzione log-SoftMax per calcolare le probabilità logaritariche: exp(xi)

Modello ibrido CNN-Trasformatore
Il modello presentato è un modello ibrido di deep learning che combina i punti di forza delle CNN e dei transformer per utilizzare sia rappresentazioni spaziali che temporali. Tale architettura è particolarmente adattata per elaborare dati complessi e di lunga sequenza come segnali fisiologici.

figure-protocol-12

L'equazione rappresenta la rappresentazione in ingresso, dove N = numero di campioni, T = numero di passi temporali, d = dimensione delle caratteristiche per passo temporale.

figure-protocol-13

Questa equazione indica le immersioni posizionali, dove pos = posizione in sequenza; i = indice di dimensione di incorporamento.

Modulo CNN – Estrazione delle caratteristiche locali
Le CNN apprendono in modo efficiente dipendenze locali e schemi morfologici come picchi, pendenze o picchi nei dati sequenziali. Lo strato convoluzionale utilizza figure-protocol-14 nuclei di estensione figure-protocol-15 spaziale su un tensore figure-protocol-16di ingresso . Ogni canale di uscita m è determinato da:

figure-protocol-17

figure-protocol-18= numero di canali di ingresso; K = dimensione del nucleo; W = pesi del filtro; b = bias

Funzione ReLU
In questo caso,figure-protocol-19 rappresenta il peso apprendibile e figure-protocol-20 è il bias per il canale mA, si applica un'attivazione non lineare, come la Rettifica Linear Unit (ReLU):

figure-protocol-21

Pooling e compressione delle funzionalità
Gli strati di pooling riducono la dimensione spaziale o temporale delle mappe di caratteristiche, preservando elementi importanti e riducendo il calcolo. Nel max pooling con dimensione figure-protocol-22 della finestra e passo s, la caratteristica aggregata in posizione figure-protocol-23 è:

figure-protocol-24

Lunghezza di uscita dopo il pooling

figure-protocol-25

Dove figure-protocol-26 è la lunghezza in ingresso; il passo definisce una dimensione di passo per lo scorrere la finestra di pooling. Questa formula calcola la lunghezza di uscita di una feature map dopo un'operazione di pooling (ad esempio, max pooling). Calcola quanto la feature map viene ridotta in base alla lunghezza di input, alla dimensione del pool e alla stride. Trasforma mappe di caratteristiche multidimensionali in un vettore per strati completamente connessi.

Codificatore a trasformatore – cattura di dipendenze a lungo raggio
I Transformer usano l'autoattenzione per apprendere le dipendenze temporali a lungo raggio nelle sequenze17.

Attenzione scalata a prodotto scalare

figure-protocol-27

Q, K, V sono matrici di query, key e value calcolate tramite proiezioni apprese; figure-protocol-28 è la dimensione chiave utilizzata per scalare il prodotto scalare.

Attenzione multi-testa

figure-protocol-29

figure-protocol-30Ogni testa calcola l'attenzione in modo indipendente; gli output sono concatenati e trasformati linearmente. figure-protocol-31 sono matrici di proiezione apprese per ciascuna testa. figure-protocol-32  è il peso finale di proiezione dopo laconcatenazione 18,19.

Pronostico finale e sconfitta
Strati completamente connessi mappano le caratteristiche ai logiti, che vengono poi trasformati in previsioni tramite funzioni di attivazione. Dopo alcuni strati convoluzionali e di pooling, figure-protocol-33 viene appiattito in un vettore figure-protocol-34 Un strato completamente connesso calcola i logiti: Un livello completamente connesso poi calcola i logit di classe:

figure-protocol-35

Attivazione Sigmoid/Softmax:

figure-protocol-36

La funzione di attivazione mappa l'output grezzo del modello 'z' alle probabilità. Sigmoid viene applicato alla classificazione binaria, e Softmax ai problemi multiclasse per la distribuzione della probabilità tra le classi. z è l'uscita lineare (ad esempio, ultimo strato: z = Wx + b). L'output ŷ è compreso tra (0, 1), il che indica probabilità20.

Processo di formazione
L'addestramento veniva svolto su un sistema con le seguenti specifiche hardware:
Processore: AMD Ryzen 7 7840HS
RAM CPU: 16 GB
RAM GPU: 6 GB NVIDIA GeForce RTX 3050

I modelli sono stati addestrati utilizzando l'ottimizzatore Adam, che adatta la velocità di apprendimento durante l'addestramento in base al primo e secondo momento del gradiente. La regola di aggiornamento per Adam è data da:

figure-protocol-37

In questa configurazione, mt e vt rappresentano le stime del primo e secondo momento, α è il tasso di apprendimento e ε è una piccola costante usata per evitare la divisione per zero. I modelli furono addestrati per 60 epoche, con arresti anticipati per evitare sovraattacchi. Veniva utilizzato un lotto di 1024 unità e i dati di addestramento venivano caricati nei modelli usando il DataLoader di PyTorch. Dropout e normalizzazione batch sono state incorporate per regolarizzare il modello e accelerare la convergenza. Il dropout è un metodo di regolarizzazione che disattiva casualmente una percentuale p dei neuroni durante l'allenamento, aiutando a ridurre l'overfitting. Matematicamente, sia zi l'attivazione deli-esimo neurone. Durante la fase di addestramento, l'attivazione modificata z' viene calcolata come:

figure-protocol-38

dove p è il tasso di abbandono (ad esempio, p = 0,5 per un abbandono del 50%). Durante l'inferenza non viene applicato alcun dropout e viene utilizzata l'intera rete.

La convergenza nelle reti neurali è un problema che impatta significativamente i sistemi di classificazione esistenti nel settore sanitario, specialmente quando le diagnosi sono incoerenti a causa di una convergenza insufficiente. Ricerche recenti su approcci di ottimizzazione a tempo predefinito e sulla convergenza a tempo fisso hanno dimostrato che è ancora possibile addestrare modelli che convergono entro un numero fisso di iterazioni per tutti gli stati iniziali. I modelli futuri basati su questo possono includere l'ottimizzazione a tempo predefinito.

Normalizzazione batch:
La normalizzazione batch stabilizza e accelera l'addestramento normalizzando gli input a ciascun livello. Dato un mini-lotto di attivazioni x = {x 1, x2, . . ., xN}, l'output normalizzato a batch xi .si calcola come:

figure-protocol-39

figure-protocol-40

doveμ B e σB2 sono la media e la varianza del lotto, ε è una piccola costante per la stabilità numerica, e γ e β sono parametri apprendibili che scalano e spostano i valori normalizzati. La normalizzazione a batch aiuta a ridurre lo spostamento interno delle covarie e consente l'uso di tassi di apprendimento più elevati. Queste tecniche, combinate con l'ottimizzatore Adam, garantiscono un addestramento robusto mitigando l'overfitting e migliorando la velocità diconvergenza 21,22.

La Figura 3 mostra la Perdita di Validazione e la Precisione della Convalida in Epoche durante l'addestramento di un modello di machine learning. L'accuratezza della validazione (linea blu, asse Y destro) inizia relativamente bassa (circa 97,5%) e aumenta rapidamente nelle prime 10 epoche. Continua a migliorare e raggiunge livelli intorno al 99,7% - 99,8% dopo circa 20 epoche. Ciò indica che il modello sta apprendendo e applicando bene le conoscenze sul set di validazione. La perdita di validazione (linea rossa, asse Y sinistro) inizia alta, poi scende bruscamente fino a quasi zero nelle prime epoche (circa 2-3). Dopo di ciò, rimane quasi a zero per il restodell'allenamento 23,24.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa sezione introduce un modello ibrido di deep learning progettato per categorizzare le aritmie dai dati ECG. Il modello viene valutato in base alla sua capacità di riconoscere cinque classificazioni clinicamente significative del battito cardiaco: contrazione atriale precoce, blocco normale, blocco del ramo del fascio sinistro, blocco del ramo del fascio destro e contrazione ventricolare prematura. Una valutazione completa è essenziale, data la rilevanza clinica di queste classi di ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nel riconoscere e categorizzare le aritmie dai segnali biologici ECG, il modello ibrido di deep learning proposto combina strutture di trasformatori e Reti Neurali Convoluzionali 1D (CNN) e mostra prestazioni eccellenti. Questa combinazione sfrutta la capacità del trasformatore di apprendere dipendenze temporali globali tramite meccanismi di auto-attenzione e la capacità della CNN di identificare caratteristiche spaziali localizzate da forme d'onda ECG grezze. Il modello è stato testato ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse da dichiarare.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Adam OttimizzatoreOpen-source (PyTorch)https://pytorch.org/docs/stable/optim.htmlAlgoritmo di ottimizzazione utilizzato per addestrare il modello di deep learning adattando i tassi di apprendimento durante la retropropagazione.
Hardware (Sistema di calcolo)AMD; NVIDIAhttps://www.amd.com/en/products/processors/laptop/ryzen/7000-series/amd-ryzen-7-7840hs ; https://www.nvidia.comProcessore: AMD Ryzen 7 7840HS; RAM CPU: 16 GB; GPU: NVIDIA GeForce RTX 3050 (6 GB VRAM). Utilizzato per l'addestramento e la valutazione dei modelli.
Apprendimento sbilanciatoApprendimento sbilanciatohttps://imbalanced-learn.orgLibreria Python utilizzata per il bilanciamento delle classi con la Synthetic Minority Over-sampling Technique (SMOTE).
MatplotlibMatplotlibhttps://matplotlib.orgLibreria Python utilizzata per tracciare segnali ECG, matrici di confusione e grafici di performance.
Banche dati ECG PhysioNetPhysioNethttps://physionet.orgDataset pubblici ECG utilizzati nello studio, tra cui MIT-BIH Aritmia, MIT-BIH Aritmia Supraventricolare, INCART a 12 derivazioni e Sudden Cardiac Death Holter.
PyTorchPyTorchhttps://pytorch.orgFramework di deep learning Python utilizzato per implementare modelli CNN e Transformer, pipeline di addestramento e inferenza.
PythonPython Software Foundationhttps://www.python.orgLinguaggio di programmazione utilizzato per la preelaborazione dei dati, lo sviluppo di modelli, l'addestramento e la valutazione.
SeabornSeabornhttps://seaborn.pydata.orgLibreria di visualizzazione dati in Python utilizzata per grafici statistici e visualizzazione dei risultati.
WFDBWFDBhttps://wfdb.readthedocs.ioPacchetto Python utilizzato per leggere, scrivere, elaborare e tracciare segnali fisiologici e annotazioni dai database PhysioNet.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ullah, A., et al. A hybrid deep CNN model for abnormal arrhythmia detection based on cardiac ECG signal. Sensors (Basel). 21 (3), 951(2021).
  2. Oh, S. L., Ng, E. Y. K. Automated diagnosis of arrhythmia using combination of CNN and LSTM techniques with variable length heart beats. Comput Biol Med. 102, 278-287 (2018).
  3. Jamil, S., Rahman, M. A. Novel deep-learning-based framework for the classification of cardiac arrhythmia. J Imaging. 8 (3), 70(2022).
  4. Reegu, F. A., et al. Blockchain-based framework for interoperable electronic health records for an improved healthcare system. Sustainability. 15 (8), 6337-6352 (2023).
  5. Aseeri, A. O. Uncertainty-aware deep learning-based cardiac arrhythmias classification model of electrocardiogram signals. Computers. 11 (6), 82-97 (2022).
  6. Tesfai, H., et al. Lightweight ShuffleNet-based CNN for arrhythmia classification. IEEE Access. 12, 111842-111854 (2022).
  7. Pandey, S. K., Janghel, R. R. Automatic detection of arrhythmia from imbalanced ECG database using CNN model with SMOTE. Australas Phys Eng Sci Med. 42, 1129-1139 (2019).
  8. Hu, R., Chen, J., Zhou, L. A transformer-based deep neural network for arrhythmia detection using continuous ECG signals. Comput Biol Med. 144, 105325(2022).
  9. Dang, H., et al. Novel deep arrhythmia-diagnosis network for atrial fibrillation classification using electrocardiogram signals. IEEE Access. 7, 75577-75590 (2019).
  10. Li, J., Zhang, Y., Gao, L., Li, X. Arrhythmia classification using biased dropout and morphology–rhythm feature with incremental broad learning. IEEE Access. 9, 66132-66140 (2021).
  11. Joddoa, A. S. Heart disease prediction system using SMOTE-balanced dataset and decision classifier. AIP Conf Proc, 2834, 050006(2023).
  12. Li, Y., Qian, R., Li, K. Inter-patient arrhythmia classification with improved deep residual convolutional neural network. Comput Methods Programs Biomed. 214, 106582(2022).
  13. Kiranyaz, S., Ince, T., Gabbouj, M. Real-time patient-specific ECG classification by 1-D convolutional neural networks. IEEE Trans Biomed Eng. 63 (3), 664-675 (2016).
  14. Vaswani, A., et al. Attention is all you need. Proceedings of the 31st International Conference on Neural Information Processing Systems, Long Beach, California, USA, , (2017).
  15. Hannun, A. Y., et al. Cardiologist-level arrhythmia detection and classification in ambulatory electrocardiograms. Nat Med. 25, 65-69 (2019).
  16. Zihlmann, M., et al. Convolutional recurrent neural networks for ECG classification. arXiv preprint. arXiv. , 1710.06122(2018).
  17. Kim, D., Lee, K. Hybrid CNN–transformer model for arrhythmia detection. Sci Rep. 15, 7817(2025).
  18. Diker, A., Aydin, K. Transformer-based attention model for arrhythmia detection using ECG signals. Biomed Signal Process Control. 68, 102679(2021).
  19. Sen, S. Y., Ozkurt, N. Convolutional neural network hyperparameter tuning with Adam optimizer for ECG classification. 2020 Innovations in Intelligent Systems and Applications Conference (ASYU), Istanbul, Turkey, , (2020).
  20. Chawla, N. V., Bowyer, K. W., Hall, L. O., Kegelmeyer, W. P. SMOTE: Synthetic minority over-sampling technique. J Artif Intell Res. 16, 321-357 (2002).
  21. Xia, Y., Wulan, N., Wang, K., Zhang, H. Detecting atrial fibrillation by deep convolutional neural networks. Comput Biol Med. 93, 84-92 (2020).
  22. Mohonta, S. C., Motin, M. A., Kumar, D. K. Electrocardiogram-based arrhythmia classification using wavelet transform with deep learning model. Sensing Bio-Sensing Res. 37, 100502(2022).
  23. Selvam, I. J., Madhavan, M. Detection and classification of electrocardiography using hybrid deep learning models. Hellenic J Cardiol. 81, 75-84 (2025).
  24. Izci, E., Ozdemir, M. A., Degirmenci, M., Akan, A. Cardiac arrhythmia detection from 2D ECG images by using deep learning technique. 2019 Medical Technologies Congress (TIPTEKNO), Izmir, Turkey, , (2019).
  25. Zheng, Z., Chen, Z., Hu, F., Zhu, J., Tang, Q., et al. Automatic diagnosis of arrhythmias using a combination of CNN and LSTM technology. Electronics. 9 (1), 121(2020).
  26. Isin, A., Ozdalili, S. Cardiac arrhythmia detection using deep learning. Procedia Comput Sci. 120, 268-275 (2017).
  27. Huang, J., Chen, B., Yao, B., He, W. ECG arrhythmia classification using STFT-based spectrogram and convolutional neural network. IEEE Access. 7, 92871-92880 (2019).
  28. Wang, T., Lu, C., Sun, Y., Yang, M., Liu, C., et al. Automatic ECG classification using continuous wavelet transform and convolutional neural network. Entropy. 23 (1), 119(2021).
  29. Panneerselvam, R., et al. Multimodal skin cancer prediction: Integrating dermoscopic images and clinical metadata with transfer learning. Open Bioinforma J. 18, e18750362358444(2025).
  30. Xiong, W., Zhang, G., Yan, D., Cao, L., Huang, X., et al. Multichannel feature fusion network-based technique for heart sound signal classification and recognition. Expert Syst Appl. 273, 126839(2025).
  31. Jin, J., Zhu, J., Zhao, L., Chen, L., Gong, J. A robust predefined-time convergence zeroing neural network for dynamic matrix inversion. IEEE Trans Cybern. 53, 3887-3900 (2022).
  32. Zhu, Y., Zhang, Q., Wang, Y., Liu, W., Zeng, S., et al. Identification of necroptosis and immune infiltration in heart failure through bioinformatics analysis. J Inflamm Res. 18, 2465-2481 (2025).
  33. Zhang, Y., Li, X., Chen, Z., Wang, H., Liu, C., et al. Multichannel feature fusion–based deep learning framework for electrocardiogram arrhythmia classification. IEEE Trans Neural Syst Rehabil Eng. 31, 4287-4297 (2023).
  34. Kumar, A., Singh, R., Sharma, P., Verma, S., Gupta, N. Application of machine learning and deep learning techniques for toxicity prediction and safety assessment. J Appl Toxicol. 45 (3), 423-437 (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Arrhythmia PredictionElectrocardiogram SignalsDeep Learning ModelConvolutional Neural NetworksTransformer LayersHeartbeat ClassificationLead I ECGData NormalizationSynthetic OversamplingReal Time Detection

Related Articles