Articolo di ricerca

Un framework basato su IA generativa per lo screening COVID-19 dai segnali audio della tosse

DOI:

10.3791/69874

10 marzo 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio propone un framework basato su IA generativa che integra GAN, VAE e reti convoluzionali profonde basate sull'attenzione per rilevare il COVID-19 dai segnali audio di tosse, migliorando la robustezza, l'equilibrio dei dati e la generalizzazione cross-dataset per uno screening scalabile e non invasivo.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'analisi audio della tosse fornisce un percorso pratico per sviluppare strumenti automatizzati a supporto dello screening della malattia COVID-19. Nonostante un interesse crescente, molti approcci esistenti rimangono sensibili al rumore, allo squilibrio di classe e alla variabilità del dataset, limitandone la riproducibilità. Questo lavoro presenta una metodologia strutturata guidata dall'intelligenza artificiale generativa per il rilevamento del COVID-19 utilizzando registrazioni sonore per la tosse. Gli esperimenti vengono condotti utilizzando due dataset pubblicamente accessibili, COUGHVID e Virufy, entrambi composti da campioni di tosse etichettati. Il protocollo proposto consiste in fasi di preprocessing sequenziali, tra cui segmentazione della tosse, riduzione del rumore e normalizzazione del segnale. Le caratteristiche acustiche vengono poi catturate tramite i Coefficienti Cepstrali a Mel-Frequenza, i descrittori di crominanza e le caratteristiche di contrasto spettrale. Per migliorare l'apprendimento delle rappresentazioni e mitigare lo squilibrio dei dati, viene utilizzato un framework generativo ibrido che integra Autoencoder variazionali e reti generative adversariali per sintetizzare campioni a livello di caratteristiche. La classificazione viene successivamente eseguita utilizzando Reti Neurali Convoluzionali Profonde e modelli DCNN basati sull'Attenzione. La valutazione delle prestazioni indica che l'incorporazione dell'aumento generativo migliora costantemente rispetto alle basi non generative, raggiungendo una precisione massima della classificazione del 97,2% e un AUROC di 0,953 nei dataset valutati. Questi risultati dimostrano l'efficacia della modellazione generativa per migliorare la rilevazione del COVID-19 basata sulla tosse e stabiliscono una pipeline analitica riproducibile per future ricerche nel monitoraggio della salute acustica.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'acustica respiratoria è stata sempre più esplorata come fonte non invasiva di informazioni per la valutazione della salute, in particolare nel contesto delle malattie infettive e polmonari. I progressi nell'elaborazione del segnale e nell'intelligenza artificiale (IA) hanno permesso l'analisi automatica dei suoni di tosse e respirazione, supportandone l'uso come biomarcatori digitali. Studi recenti dimostrano che i suoni respiratori catturati tramite microfoni integrati in smartphone, dispositivi indossabili o sensori clinici possono essere analizzati efficacemente utilizzando modelli di deep learning per rilevare l'infezione daCOVID-19 1,5. Questi sviluppi evidenziano il potenziale dello screening audio-based come complemento rapido, senza contatto e scalabile alle procedure diagnostiche convenzionali. La Malattia da Coronavirus 2019 (COVID-19), causata dal virus SARS-CoV-2, colpisce principalmente il sistema respiratorio e induce cambiamenti misurabili nella dinamica del flusso d'aria, nella funzione polmonare e nel comportamento del tratto vocale. Sebbene il test a trascrizione inversa–reazione a catena della polimerasi (RT-PCR) rimanga lo standard di riferimento per la diagnosi, i suoi vincoli logistici e i tempi di risposta ritardati ne limitano l'idoneità per uno screening su larga scala o continuo, motivando l'esplorazione di approcci alternativi basati sull'analisi del suono respiratorio.

Un numero crescente di letteratura ha studiato la rilevazione del COVID-19 guidata dall'IA utilizzando segnali di tosse, respirazione e linguaggio. Come riassunto nella Tabella 1, studi precedenti hanno esplorato diversi dataset, rappresentazioni di caratteristiche acustiche (ad esempio, MFCC, STFT, caratteristiche basate su spettrogrammi) e paradigmi di apprendimento che spaziano dai classici modelli di machine learning alle architetture profonde convoluzionali, ricorrenti, basate sull'attenzione etrasformer 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45 . Diversi lavori hanno dimostrato promettenti prestazioni di screening utilizzando audio respiratorio raccolto dal crowdsourcing e clinicamente. Al contrario, altri hanno sottolineato l'importanza dell'apprendimento tramite trasferimento, dell'aumento dei dati e dell'IA spiegabile per migliorare la robustezza e l'affidabilità. Invece di ripetere una discussione dettagliata studio per studio, la Tabella 1 fornisce una panoramica comparativa consolidata di questi approcci rappresentativi, consentendo il confronto diretto di dataset, metodologie ed esiti riportati.

Nonostante questi progressi, diverse limitazioni ostacolano la robustezza e l'applicabilità reale degli approcci esistenti. I dataset audio respiratori vengono frequentemente raccolti in condizioni di registrazione eterogenee, portando a una notevole variabilità tra dispositivi, ambienti acustici e popolazionidi soggetti 2,3,4. Molti dataset pubblicamente disponibili si basano sullo stato auto-dichiarato COVID-19, introducendo incertezza sull'affidabilitàdell'etichetta 7. Inoltre, il marcato squilibrio di classe e la limitata disponibilità di campioni clinicamente validati limitano la capacità di generalizzazione dei modelli discriminativi addestrati esclusivamente sui datiosservati 4,5. Di conseguenza, le prestazioni del modello riportate in contesti sperimentali controllati non si traducono costantemente in un'implementazione affidabile in diversi scenari reali.

Insieme, queste limitazioni mettono in evidenza una lacuna fondamentale nella ricerca: l'assenza di un quadro unificato che affronti contemporaneamente la scarsità di dati, lo squilibrio di classe e una generalizzazione robusta tra dataset eterogenei. Sebbene modelli generativi come le Reti Generative Adversariali (GAN) e gli Autoencoder Variazionali (VAE) siano stati esplorati per apprendere rappresentazioni latenti e sintetizzare segnali biomedicirealistici 6,7, studi esistenti tipicamente impiegano questi modelli in modo indipendente e li valutano all'interno di un unico dataset. Inoltre, la loro integrazione con architetture convoluzionali migliorate all'attenzione e la valutazione sotto condizioni cross-dataset rimane insufficientemente inesplorata.

Per colmare questa lacuna, il presente studio propone un quadro generativo assistito dall'IA per la rilevazione del COVID-19 dai suoni di tosse che integra l'estrazione delle caratteristiche acustiche con un modello ibrido GAN–VAE e reti neurali profonde convoluzionali basate sull'attenzione (DCNN). La componente generativa mitiga lo squilibrio di classe e la disponibilità limitata del campione attraverso l'apprendimento strutturato della rappresentazione latente e la generazione di dati sintetici, mentre i modelli discriminativi migliorano la robustezza della classificazione tra dataset eterogenei. A differenza di lavori precedenti che si basano prevalentemente sulla validazione all'interno del dataset, il framework proposto viene valutato utilizzando test cross-dataset su un dataset indipendente, consentendo una valutazione più rigorosa delle prestazioni di generalizzazione. Il framework è pensato come un approccio orientato allo screening piuttosto che come uno strumento diagnostico autonomo, e il suo design tiene esplicitamente conto della variabilità e dell'incertezza delle etichette per supportare un deployment riproducibile e affidabile.

In questo contesto, i contributi innovativi del presente studio sono tripli. Innanzitutto, un framework generativo ibrido unificato GAN–VAE è integrato con classificatori DCNN basati sull'attenzione per affrontare congiuntamente lo squilibrio di classe, la disponibilità limitata dei dati e un apprendimento robusto della rappresentazione delle caratteristiche nello screening COVID-19 basato sulla tosse. In secondo luogo, l'approccio proposto viene valutato sistematicamente utilizzando la validazione cross-dataset, fornendo una valutazione più realistica della generalizzazione del modello rispetto ai test convenzionali all'interno del dataset. In terzo luogo, lo studio presenta un'analisi dettagliata dell'impatto dell'aumento generativo in condizioni di registrazione eterogenee, posizionando così il quadro come una prova di concetto riproducibile per uno screening scalabile e pratico del COVID-19.

Autore/i & AnnoDatasetTecniche / Caratteristiche utilizzateModello / ClassificatoreAccuratezza / MetricheLimitazioni / Note
Imran et al., 20208Dataset di tosse crowdsourced (AI4COVID-19)MFCC, transfer learning, funzionalità domain-awareMulti-classificatore risk-averse (DL + ML ensemble)Accuratezza: 92,6%Dipende dalla qualità della tosse; Validazione clinica limitata
Brown et al., 20209Suoni respiratori crowdsourced (>7.000 utenti)Caratteristiche audio artigianali, embedding in stile VGGModelli ML superficialiAUC > 80%Rumore delle etichette nei dati crowdsourced
Laguarta et al., 202010Dataset MIT Open Voice (5.320 soggetti)MFCC, biomarcatori acusticiCNN (ResNet50, transfer learning)Sensibilità: 98,5%, Specificità: 94,2%Richiede un ampio dataset di preaddestramento
Quartieri et al., 202011Interviste vocali (5 soggetti, pre/post COVID)Intensità respiratoria, F0, CPP, formantiAnalisi statistica effetto-dimensioneraggiungere un AUC superiore all'80% su tutti i compitiCampione molto piccolo
Hassan et al., 202012Suoni respiratoriCaratteristiche del parlato temporaleRNNTosse: 97%, respiro: 98,2%, voce: 88,2%Mancanza di statistiche dettagliate sui dataset
Khamparia et al., 201913ESC-10, ESC-50Caratteristiche basate sull'immagine dello spettrogrammaCNN, TDSNCNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10)Solo suoni ambientali; Prestazioni inferiori su dataset complessi
Aykanat et al., 20171417.930 suoni polmonari da 1.630 soggetti (stetoscopio elettronico)Caratteristiche MFCC, immagini di spettrogrammiSVM, CNNCNN/SVM: 86% (sano vs patologico), 76%/75% (rale–rhonchus–normale), 80%/80% (tipo singolo), 62%/62% (tutti i tipi)Richiede hardware specializzato; Non specifico per una malattia
Ponomarchuk et al., 202215Coswara, VirufyMFCC, mel-spettrogramma, caratteristiche delle waveletCNN, RNN, modelli di ensembleAUC: 0,93 (interno), 0,79 (esterno)La generalizzazione tra i dataset rimane una sfida
Feng et al., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNAccuratezza 81,25% (AUC di 0,79)Prestazioni dipendenti dal dataset
Islam et al., 202217Registrazioni cliniche della tosseCaratteristiche spettrali e tempo-frequenzaReti neurali profondeAccuratezza: 89,2%Dataset limitato
Manshouri,2022 18VirufyCaratteristiche di analisi spettraleClassificatori ML classiciPrecisione: 95,86%Studio sperimentale su piccola scala
Huang et al., 202019Suoni polmonari di 10 pazienti COVID-19Analisi del suono respiratorio tempo-frequenzaAnalisi degli esperti cliniciValidazione qualitativaPiccolo dataset; Nessun modello ML
W. D. Puja et al., 202420Coswara, Virufy (dataset sui suoni di tosse)STFT, spettrogramma Mel, MFCC, energia RMS, larghezza di banda spettrale, baricentroide spettrale, roll-off spettrale, ZCR; Estrazione profonda delle caratteristiche basata su CNNCNN 1D (estrattore di caratteristiche) + Foresta CasualeAccuratezza: 93%Le prestazioni dipendono dalla qualità della tosse; progettato per lo screening piuttosto che per la diagnosi clinica; Variabilità dei dati tramite crowdsourcing
Chadaga et al., 202321Registrazioni audio di tosse crowdsourcedMel-spettrogramma e caratteristiche acustiche tempo-frequenzaRete Neurale Convoluzionale (CNN)Precisione: 84%, Precisione: 85%, Richiamo: 84%, F1-punteggio: 84%Le prestazioni sono limitate da squilibri dei dati, etichette auto-riportate, sensibilità alle condizioni di registrazione
Chadaga et al., 202322Marcatori clinici per COVID-19 da lieve a moderato e altre malattie respiratorieSelezione delle caratteristiche (Pearson, PSO); Marcatori chiave: Eosinofilo, Albumina, T. Bilirubina, ALP, ALT, AST, HbA1c, TWBCEnsemble impilato; 1D CNN, LSTM, DNN, MLP RESIDUOPrecisione: 89%Esclusi i casi gravi; alternativa alla RT-PCR; IA spiegabile applicata
Dar et al. 202423COVID-19 DatasetOttimizzazione SJHBO (Jaya+HBO+SO), molte caratteristiche spettraliRete Q Profonda (DQN)Accuratezza: 95,11%, Sensibilità: 95,06%, Specificità: 94,69%Alta complessità; La messa a punto viene migliorata tramite un ottimizzatore ibrido
Jing Quian et al 202024Registrazioni del linguaggio di pazienti COVID-19Set di contenuti acustici; analisi della gravità della malattia, qualità del sonno, affaticamento, ansiaSupport Vector Machines (SVM)0,69 (gravità della malattia)Limitato alle funzionalità audio; accuratezza moderata; dimensione del dataset non specificata; Sono considerati solo quattro aspetti della salute
Sharma, J., et al. 202025UrbanSound8K, ESC-10, ESC-50Canali multi-funzionalità: MFCC, GFCC, CQT, Chromagram; Aumento dei dati per confusioneCNN profondo con convoluzioni e moduli di attenzione spazialmente separabiliUrbanSound8K: 97,52%, ESC-10: 94,75%, ESC-50: 87,45%Non testato su dataset non benchmark o reali; complessità computazionale dovuta a moduli CNN e di attenzione più profondi
Lella KK, et al. 202126 Suoni respiratori; COVID-19, asma, salute)Aumento dei dati; funzionalità profonde utilizzando il Data De-noising Auto Encoder (DDAE) invece del MFCCRete neurale convoluzionale 1D (CNN 1D)~90%Dettagli limitati sul dataset; ~4% di miglioramento rispetto al MFCC; Generalizzabilità non testata
Orlandic et al., 202127COUGHVID (25k+ tosse)MFCC, PSD, caratteristiche spettrali e temporaliXGBoostAUC 96,5%, Precisione 95,5%COVID auto-dichiarato; Etichette esperti su sottoinsieme
Zhang et al., 202343Casi di HLH pubblicati dopo la vaccinazione contro il COVID-19 (database della letteratura)Revisione sistematica; aggregazione delle caratteristiche cliniche; Analisi dell'aggancio molecolareNon applicabile (revisione clinica)Statistica descrittiva; Esiti cliniciAnalisi di eventi rari; piccolo campione; La dipendenza dai casi segnalati può introdurre un bias di segnalazione
Xu et al., 202344Casi segnalati di malattia VKH associata al vaccino dalla letteraturaRevisione retrospettiva del caso; Analisi delle caratteristiche cliniche e di imagingNon applicabile (studio clinico osservazionale)Risposta al trattamento ed esiti di recupero clinicoNumero limitato di casi; mancanza di gruppo di controllo; La relazione causale non può essere stabilita con certezza
Hu et al., 202545Dati a livello aziendale–madre-sussidiaria delle aziende di dispositivi medici SRDI in Cina (database Qixinbao)analisi dei social network; metriche di rete spaziale; Analisi geografica del rivelatoreNon applicabile (analisi di rete e politiche)Densità della rete, centralità, indici di diffusioneProgettazione a sezione trasversale; la pari ponderazione delle imprese; Nessuna metrica diretta di performance o di esito clinico

Tabella 1: Riepilogo degli studi esistenti di rilevamento audio del COVID-19. Panoramica comparativa degli approcci precedenti per lo screening per tosse/audio, inclusi dataset, metodi e prestazioni riportate. Clicca qui per scaricare questa tabella.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Metodologia proposta

Questo studio propone un quadro basato sull'IA generativa per rilevare il COVID-19 dai segnali di tosse. Il framework integra modelli generativi con classificatori discriminativi, mantenendo i dati di addestramento e valutazione strettamente separati. La Figura 1 illustra l'architettura dettagliata del framework proposto GAN–VAE–ADCNN, mostrando il flusso dalla pre-elaborazione audio e dall'estrazione delle caratteristiche attraverso l'apprendimento di rappresentazioni latenti tramite un Autoencoder Variazionale (VAE), la generazione di caratteristiche sintetiche tramite una Generative Adversarial Network (GAN), e la classificazione finale tramite Deep Convolutional Neural Networks (DCNN) e Attention-based DCNN (ADCNN). La figura mostra che i componenti generativi vengono utilizzati solo durante l'addestramento, mentre la classificazione viene eseguita utilizzando modelli discriminativi.

figure-protocol-1
Figura 1: Panoramica architettonica GAN–VAE–ADCNN. Schema della pipeline ibrida proposta, in cui le caratteristiche acustiche derivate dalla tosse sono codificate usando un VAE, integrate tramite generazione di campioni sintetici basate su GAN e classificate utilizzando modelli DCNN e DCNN basato sull'attenzione (ADCNN). Clicca qui per visualizzare una versione più grande di questa figura.

Architettura del modello e implementazione

I modelli generativi e discriminativi utilizzati in questo quadro sono stati implementati con architetture fisse e riproducibili. Il GAN è composto da un generatore con tre strati completamente connessi (128, 256 e 512 unità) che utilizza l'attivazione ReLU, e un discriminatore con tre strati completamente connessi (512, 256 e 128 unità) che utilizza l'attivazione LeakyReLU seguita da un'uscita sigmoide.

L'encoder VAE comprende due strati completamente connessi con 256 e 128 unità, seguiti da una media latente e una stima della varianza con una dimensionalità latente di 64. Il decodificatore rispecchia questa struttura ed è addestrato utilizzando una combinazione di perdita ricostrutiva e divergenza di Kullback–Leibler per apprendere uno spazio latente strutturato e probabilistico.

Il classificatore DCNN include quattro blocchi convoluzionali con kernel 3x3 e filtri rispettivamente 32, 64, 128 e 256. Ogni blocco è seguito da una normalizzazione batch, un'attivazione ReLU e un pool 2x2 max. L'ADCNN estende il DCNN incorporando un meccanismo di attenzione canale dopo il blocco convoluzionale finale. Tutti i modelli sono stati ottimizzati utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001 e una dimensione di lotto di 32. Come mostrato nella Figura 1, il VAE e il GAN operano solo durante l'addestramento, mentre DCNN e ADCNN sono utilizzati per la classificazione. L'intera procedura di addestramento e valutazione è riassunta nell'Algoritmo 1.

Algoritmo 1: Framework di rilevamento COVID-19 basato su GAN–VAE

Input: Registrazioni audio pre-elaborate per la tosse

Output: Etichetta di classificazione binaria (COVID-19 positivo/negativo)

Le procedure di addestramento e valutazione seguivano una pipeline fissa e riproducibile. Tutte le registrazioni audio della tosse sono state ricampionate a 16 kHz, sottoposte a riduzione del rumore e normalizzazione dell'ampiezza. Le registrazioni sono state segmentate in segmenti di lunghezza fissa, dai quali sono state estratte MFCC, cromaticità e caratteristiche spettrali. Sono stati estratti in totale 40 coefficienti cepstrali a frequenza mel-frequenza (MFCC) da ogni segmento audio. Inoltre, sono state calcolate 12 caratteristiche di crominanza. La rappresentazione risultante forma un vettore di caratteristiche a 52 dimensioni per ogni segmento di tosse. È stata eseguita una suddivisione a livello di soggetto per suddividere i dati in set di addestramento, validazione e test. Il VAE è stato addestrato per apprendere rappresentazioni latenti probabilistiche, e i vettori latenti risultanti sono stati utilizzati per addestrare il GAN alla generazione di caratteristiche sintetiche. Il dataset di addestramento è stato arricchito utilizzando campioni generati da GAN–VAE, mentre i dati sintetici sono stati esclusi dalla validazione e dai test. I classificatori DCNN e ADCNN sono stati addestrati sui dati di addestramento aumentati, e la valutazione finale è stata condotta sul set di test applicato utilizzando metriche di performance standard.

Configurazione dell'addestramento, divisione dei dati e prevenzione delle perdite

Tutti gli esperimenti sono stati condotti con una configurazione di addestramento fissa e riproducibile. La suddivisione dei dati veniva eseguita a livello di soggetto prima della segmentazione audio per prevenire la fuga di dati. Il dataset era suddiviso in set di addestramento, validazione e test con un rapporto 80:10:10, garantendo che tutti i segmenti della stessa registrazione fossero assegnati a un unico sottoinsieme. Il set di addestramento veniva utilizzato per l'apprendimento dei modelli e l'aumento generativo dei dati, il set di validazione per la regolazione degli iperparametri e il early stopping, e il set di test veniva tenuto per la valutazione finale delle prestazioni. I campioni sintetici generati dal framework GAN–VAE sono stati utilizzati esclusivamente durante l'addestramento e sono stati rigorosamente esclusi dalla validazione e dai test per garantire una valutazione equa.

I modelli venivano addestrati per un massimo di 100 epoche, con arresto precoce basato sulla perdita di validazione e una pazienza di 10 epoche. L'ottimizzazione è stata eseguita utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001 e una dimensione di lotto di 32. Per la classificazione veniva applicata la perdita binaria di entropia incrociata, mentre per l'addestramento rispettivamente delle componenti VAE e GAN venivano utilizzate la perdita binaria e avversaria. Questo protocollo unificato di addestramento e valutazione garantisce la riproducibilità, previene la fuga di dati e mantiene una rigida separazione tra le fasi di addestramento e valutazione.

Descrizione del dataset

Due dataset audio per la tosse disponibili pubblicamente—COUGHVID e Virufy—sono stati utilizzati per bilanciare la diversità acustica su larga scala con etichette clinicamente riferite, con ruoli chiaramente separati nella formazione e nella valutazione.

COUGHVID è una raccolta crowdsourced di registrazioni di tosse con annotazione parziale di esperti e metadati auto-riportati. Per garantire la qualità dei dati, sono state selezionate 428 registrazioni dopo aver applicato criteri di controllo qualità predefiniti, tra cui la durata minima del segnale, un adeguato rapporto segnale-rumore, la rimozione di campioni corrotti o ambigui e la presenza di eventi di tosse identificabili con metadati dei sintomi. Dopo preprocessing e segmentazione, queste registrazioni hanno prodotto 1.719 segmenti di tosse, standardizzati in formato WAV a una frequenza di campionamento di 16 kHz. COUGHVID è stato utilizzato per addestrare sia i modelli generativi sia i classificatori discriminativi.

Virufy consiste in registrazioni della tosse supervisionate dal medico etichettate come RT-PCR positive o negative per COVID-19. Tutte e 16 le registrazioni disponibili furono incluse, risultando in 234 segmenti di tosse dopo la segmentazione, anch'essi standardizzati a 16 kHz. Virufy è stato utilizzato esclusivamente per la valutazione esterna di incroci di dataset per valutare le prestazioni di generalizzazione e non è stato impiegato per addestramento, fine-tuning o aumento generativo.

Il quadro proposto dovrebbe quindi essere interpretato come un approccio di screening proof-of-concept valutato in condizioni sperimentali controllate, piuttosto che come un sistema diagnostico clinicamente validato.

Preprocessing e segmentazione dei dati

Tutte le registrazioni sono state ricampionate a 16 kHz, convertite in mono e sottoposte a rimozione del silenzio, riduzione del rumore spettrale e normalizzazione dell'ampiezza. La segmentazione veniva eseguita dopo la divisione a livello di soggetto per prevenire perdite di dati. Ogni registrazione era suddivisa in segmenti sovrapposti da 2–4 s, e i segmenti a bassa energia o silenziosi venivano scartati.

Protocollo di Validazione Esterna

La validazione esterna è stata effettuata tramite valutazione cross-dataset. I modelli addestrati su COUGHVID sono stati valutati su Virufy per la validazione esterna. Questo protocollo valuta la generalizzazione tra dataset raccolti in condizioni diverse, piuttosto che la convalida clinica prospettica. La Figura 2 fornisce una panoramica a livello di protocollo di questo flusso di lavoro, illustrando l'uso del dataset, la pre-elaborazione, l'estrazione delle funzionalità, l'addestramento dei classificatori e scenari di valutazione. Mentre la Figura 1 si concentra sull'architettura interna del modello, la Figura 2 enfatizza il design sperimentale e il flusso dei dati attraverso le fasi di addestramento e test.

figure-protocol-2
Figura 2: Flusso di lavoro del framework proposto per lo screening della tosse COVID-19. Illustrazione dell'intera pipeline di elaborazione, inclusa preprocessing, estrazione di caratteristiche (MFCC, chroma, caratteristiche spettrali), apprendimento e aumento di rappresentazioni basati su GAN–VAEs (solo addestramento), e classificazione finale sotto suddivisione a livello di soggetto e valutazione cross-dataset. Clicca qui per visualizzare una versione più grande di questa figura.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Composizione del dataset e analisi della distribuzione delle classi

Dopo preprocessing e segmentazione, i dataset COUGHVID e Virufy hanno mostrato differenze sostanziali sia nella scala del dataset che nella densità dei segmenti. COUGHVID ha contribuito con 428 su 444 registrazioni (96,4%) e 1.719 su 1.953 segmenti di tosse estratti (88,0%), confermando il proprio ruolo come dataset principale per l'addestramento dei modelli e l'aumento genera...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

I risultati dimostrano che il framework proposto basato su IA generativa può rilevare il COVID-19 dai segnali di tosse attraverso dataset eterogenei. Come mostrato nelle Tabelle 4 e 6, il modello ibrido GAN–VAE ha raggiunto le migliori prestazioni, con una precisione del 97,2% e un AUROC di 0,953, insieme ad alta precisione, richiamo, punteggio F1 e specificità, indicando prestazioni di classificazione bilanciate.

Le prestazio...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Non è stato segnalato alcun potenziale conflitto di interessi dall'autore o degli autori.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esprimiamo la nostra sincera gratitudine ai docenti e ai mentori di ricerca della School of Computer Science and Engineering per la loro preziosa guida, il supporto continuo e i feedback costruttivi durante la preparazione di questo articolo.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
COUGHVID DatasetÉ cole Polytechnique Fé dé Rale de Lausanne (EPFL)Distribuzione pubblica (2021)Dataset audio di tosse crowdsourceato con metadati auto-riportati e annotazioni parziali del medico; Utilizzato principalmente per addestramento e aumento dei dati.
Kit degli attrezzi CUDANVIDIA11.3Il framework di accelerazione GPU è usato per accelerare l'addestramento e l'inferenza del modello.
LibROSAOpen Source0.9Libreria di analisi audio utilizzata per il campionamento, segmentazione, estrazione MFCC e calcolo di caratteristiche spettrali.
Sistema operativo LinuxCanonicoUbuntu 20.04 LTSSistema operativo utilizzato per tutti gli esperimenti e l'addestramento dei modelli.
MatplotlibOpen Source3.5Libreria di visualizzazione utilizzata per tracciare distribuzioni di dataset e risultati di valutazione.
NumPyOpen Source1.21Libreria numerica utilizzata per la manipolazione di array e operazioni di elaborazione del segnale.
NVIDIA GPUNVIDIAClasse Tesla / RTXUnità di elaborazione grafica utilizzata per l'addestramento di modelli profondi e generativi.
Linguaggio di programmazione PythonPython Software Foundation3.8Ambiente di programmazione core utilizzato per la pre-elaborazione dei dati, l'estrazione di funzionalità, lo sviluppo e la valutazione dei modelli.
PyTorchMeta (Ricerca su Facebook AI)1.12Framework di deep learning utilizzato per implementare modelli GAN, VAE, DCNN e DCNN basati sull'attenzione.
Scikit-learnOpen Source1Libreria di machine learning utilizzata per la suddivisione dei dati, la ponderazione delle classi e il calcolo di metriche di prestazioni.
SciPyOpen Source1.7Libreria di calcolo scientifico utilizzata per la preelaborazione audio e le trasformazioni di segnali.
Virufy DatasetVirufyDistribuzione pubblica (2021)Registrazioni cliniche raccolte con RT-PCR e ndash; ha verificato le etichette COVID-19; Utilizzato esclusivamente per la validazione esterna e la valutazione cross-dataset.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Cough Audio AnalysisCOVID 19 ScreeningGenerative AICough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

Articoli correlati