$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodologia proposta
Questo studio propone un quadro basato sull'IA generativa per rilevare il COVID-19 dai segnali di tosse. Il framework integra modelli generativi con classificatori discriminativi, mantenendo i dati di addestramento e valutazione strettamente separati. La Figura 1 illustra l'architettura dettagliata del framework proposto GAN–VAE–ADCNN, mostrando il flusso dalla pre-elaborazione audio e dall'estrazione delle caratteristiche attraverso l'apprendimento di rappresentazioni latenti tramite un Autoencoder Variazionale (VAE), la generazione di caratteristiche sintetiche tramite una Generative Adversarial Network (GAN), e la classificazione finale tramite Deep Convolutional Neural Networks (DCNN) e Attention-based DCNN (ADCNN). La figura mostra che i componenti generativi vengono utilizzati solo durante l'addestramento, mentre la classificazione viene eseguita utilizzando modelli discriminativi.

Figura 1: Panoramica architettonica GAN–VAE–ADCNN. Schema della pipeline ibrida proposta, in cui le caratteristiche acustiche derivate dalla tosse sono codificate usando un VAE, integrate tramite generazione di campioni sintetici basate su GAN e classificate utilizzando modelli DCNN e DCNN basato sull'attenzione (ADCNN). Clicca qui per visualizzare una versione più grande di questa figura.
Architettura del modello e implementazione
I modelli generativi e discriminativi utilizzati in questo quadro sono stati implementati con architetture fisse e riproducibili. Il GAN è composto da un generatore con tre strati completamente connessi (128, 256 e 512 unità) che utilizza l'attivazione ReLU, e un discriminatore con tre strati completamente connessi (512, 256 e 128 unità) che utilizza l'attivazione LeakyReLU seguita da un'uscita sigmoide.
L'encoder VAE comprende due strati completamente connessi con 256 e 128 unità, seguiti da una media latente e una stima della varianza con una dimensionalità latente di 64. Il decodificatore rispecchia questa struttura ed è addestrato utilizzando una combinazione di perdita ricostrutiva e divergenza di Kullback–Leibler per apprendere uno spazio latente strutturato e probabilistico.
Il classificatore DCNN include quattro blocchi convoluzionali con kernel 3x3 e filtri rispettivamente 32, 64, 128 e 256. Ogni blocco è seguito da una normalizzazione batch, un'attivazione ReLU e un pool 2x2 max. L'ADCNN estende il DCNN incorporando un meccanismo di attenzione canale dopo il blocco convoluzionale finale. Tutti i modelli sono stati ottimizzati utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001 e una dimensione di lotto di 32. Come mostrato nella Figura 1, il VAE e il GAN operano solo durante l'addestramento, mentre DCNN e ADCNN sono utilizzati per la classificazione. L'intera procedura di addestramento e valutazione è riassunta nell'Algoritmo 1.
Algoritmo 1: Framework di rilevamento COVID-19 basato su GAN–VAE
Input: Registrazioni audio pre-elaborate per la tosse
Output: Etichetta di classificazione binaria (COVID-19 positivo/negativo)
Le procedure di addestramento e valutazione seguivano una pipeline fissa e riproducibile. Tutte le registrazioni audio della tosse sono state ricampionate a 16 kHz, sottoposte a riduzione del rumore e normalizzazione dell'ampiezza. Le registrazioni sono state segmentate in segmenti di lunghezza fissa, dai quali sono state estratte MFCC, cromaticità e caratteristiche spettrali. Sono stati estratti in totale 40 coefficienti cepstrali a frequenza mel-frequenza (MFCC) da ogni segmento audio. Inoltre, sono state calcolate 12 caratteristiche di crominanza. La rappresentazione risultante forma un vettore di caratteristiche a 52 dimensioni per ogni segmento di tosse. È stata eseguita una suddivisione a livello di soggetto per suddividere i dati in set di addestramento, validazione e test. Il VAE è stato addestrato per apprendere rappresentazioni latenti probabilistiche, e i vettori latenti risultanti sono stati utilizzati per addestrare il GAN alla generazione di caratteristiche sintetiche. Il dataset di addestramento è stato arricchito utilizzando campioni generati da GAN–VAE, mentre i dati sintetici sono stati esclusi dalla validazione e dai test. I classificatori DCNN e ADCNN sono stati addestrati sui dati di addestramento aumentati, e la valutazione finale è stata condotta sul set di test applicato utilizzando metriche di performance standard.
Configurazione dell'addestramento, divisione dei dati e prevenzione delle perdite
Tutti gli esperimenti sono stati condotti con una configurazione di addestramento fissa e riproducibile. La suddivisione dei dati veniva eseguita a livello di soggetto prima della segmentazione audio per prevenire la fuga di dati. Il dataset era suddiviso in set di addestramento, validazione e test con un rapporto 80:10:10, garantendo che tutti i segmenti della stessa registrazione fossero assegnati a un unico sottoinsieme. Il set di addestramento veniva utilizzato per l'apprendimento dei modelli e l'aumento generativo dei dati, il set di validazione per la regolazione degli iperparametri e il early stopping, e il set di test veniva tenuto per la valutazione finale delle prestazioni. I campioni sintetici generati dal framework GAN–VAE sono stati utilizzati esclusivamente durante l'addestramento e sono stati rigorosamente esclusi dalla validazione e dai test per garantire una valutazione equa.
I modelli venivano addestrati per un massimo di 100 epoche, con arresto precoce basato sulla perdita di validazione e una pazienza di 10 epoche. L'ottimizzazione è stata eseguita utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001 e una dimensione di lotto di 32. Per la classificazione veniva applicata la perdita binaria di entropia incrociata, mentre per l'addestramento rispettivamente delle componenti VAE e GAN venivano utilizzate la perdita binaria e avversaria. Questo protocollo unificato di addestramento e valutazione garantisce la riproducibilità, previene la fuga di dati e mantiene una rigida separazione tra le fasi di addestramento e valutazione.
Descrizione del dataset
Due dataset audio per la tosse disponibili pubblicamente—COUGHVID e Virufy—sono stati utilizzati per bilanciare la diversità acustica su larga scala con etichette clinicamente riferite, con ruoli chiaramente separati nella formazione e nella valutazione.
COUGHVID è una raccolta crowdsourced di registrazioni di tosse con annotazione parziale di esperti e metadati auto-riportati. Per garantire la qualità dei dati, sono state selezionate 428 registrazioni dopo aver applicato criteri di controllo qualità predefiniti, tra cui la durata minima del segnale, un adeguato rapporto segnale-rumore, la rimozione di campioni corrotti o ambigui e la presenza di eventi di tosse identificabili con metadati dei sintomi. Dopo preprocessing e segmentazione, queste registrazioni hanno prodotto 1.719 segmenti di tosse, standardizzati in formato WAV a una frequenza di campionamento di 16 kHz. COUGHVID è stato utilizzato per addestrare sia i modelli generativi sia i classificatori discriminativi.
Virufy consiste in registrazioni della tosse supervisionate dal medico etichettate come RT-PCR positive o negative per COVID-19. Tutte e 16 le registrazioni disponibili furono incluse, risultando in 234 segmenti di tosse dopo la segmentazione, anch'essi standardizzati a 16 kHz. Virufy è stato utilizzato esclusivamente per la valutazione esterna di incroci di dataset per valutare le prestazioni di generalizzazione e non è stato impiegato per addestramento, fine-tuning o aumento generativo.
Il quadro proposto dovrebbe quindi essere interpretato come un approccio di screening proof-of-concept valutato in condizioni sperimentali controllate, piuttosto che come un sistema diagnostico clinicamente validato.
Preprocessing e segmentazione dei dati
Tutte le registrazioni sono state ricampionate a 16 kHz, convertite in mono e sottoposte a rimozione del silenzio, riduzione del rumore spettrale e normalizzazione dell'ampiezza. La segmentazione veniva eseguita dopo la divisione a livello di soggetto per prevenire perdite di dati. Ogni registrazione era suddivisa in segmenti sovrapposti da 2–4 s, e i segmenti a bassa energia o silenziosi venivano scartati.
Protocollo di Validazione Esterna
La validazione esterna è stata effettuata tramite valutazione cross-dataset. I modelli addestrati su COUGHVID sono stati valutati su Virufy per la validazione esterna. Questo protocollo valuta la generalizzazione tra dataset raccolti in condizioni diverse, piuttosto che la convalida clinica prospettica. La Figura 2 fornisce una panoramica a livello di protocollo di questo flusso di lavoro, illustrando l'uso del dataset, la pre-elaborazione, l'estrazione delle funzionalità, l'addestramento dei classificatori e scenari di valutazione. Mentre la Figura 1 si concentra sull'architettura interna del modello, la Figura 2 enfatizza il design sperimentale e il flusso dei dati attraverso le fasi di addestramento e test.

Figura 2: Flusso di lavoro del framework proposto per lo screening della tosse COVID-19. Illustrazione dell'intera pipeline di elaborazione, inclusa preprocessing, estrazione di caratteristiche (MFCC, chroma, caratteristiche spettrali), apprendimento e aumento di rappresentazioni basati su GAN–VAEs (solo addestramento), e classificazione finale sotto suddivisione a livello di soggetto e valutazione cross-dataset. Clicca qui per visualizzare una versione più grande di questa figura.