Onderzoeksartikel

Een generatief AI-gebaseerd kader voor COVID-19-screening op basis van hoestgeluiden

DOI:

10.3791/69874

10 maart 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie stelt een generatief AI-gebaseerd kader voor dat GAN's, VAE's en aandachtsgebaseerde diepe convolutionele netwerken integreert om COVID-19 te detecteren via hoestgeluidsignalen, wat de robuustheid, databalans en generalisatie van verschillende datasets verbetert voor schaalbare, niet-invasieve screening.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hoestaudio-analyse biedt een praktische manier om geautomatiseerde tools te ontwikkelen ter ondersteuning van COVID-19-screening. Ondanks groeiende interesse blijven veel bestaande benaderingen gevoelig voor ruis, klassenonevenwicht en variabiliteit in datasets, waardoor hun reproduceerbaarheid beperkt wordt. Dit werk presenteert een gestructureerde, generatieve, door kunstmatige intelligentie gedreven methodologie voor het opsporen van COVID-19 met behulp van hoestgeluidsopnames. Experimenten worden uitgevoerd met twee openbaar toegankelijke datasets, COUGHVID en Virufy, die beide gelabelde hoestmonsters bevatten. Het voorgestelde protocol bestaat uit sequentiële preprocessing-fasen, waaronder hoestsegmentatie, denoising en signaalnormalisatie. Akoestische eigenschappen worden vervolgens vastgelegd via Mel-frequentie Cepstral Coëfficiënten, chroma-descriptoren en spectrale contrastkenmerken. Om representatie-leren te verbeteren en data-onevenwicht te beperken, wordt een hybride generatief kader gebruikt dat Variational Autoencoders en Generative Adversarial Networks integreert om feature-level samples te synthetiseren. Vervolgens wordt de classificatie uitgevoerd met behulp van Deep Convolutional Neural Networks en Attention-gebaseerde DCNN-modellen. Prestatie-evaluatie geeft aan dat het integreren van generatieve augmentatie consequent verbetert ten opzichte van niet-generatieve baselines, met een piekclassificatienauwkeurigheid van 97,2% en een AUROC van 0,953 over de geëvalueerde datasets. Deze resultaten tonen de effectiviteit van generatieve modellering aan voor het verbeteren van hoest-gebaseerde COVID-19-detectie en creëren een reproduceerbare analytische pijplijn voor toekomstig onderzoek naar akoestische gezondheidsmonitoring.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ademhalingsakoestiek wordt steeds vaker onderzocht als een niet-invasieve informatiebron voor gezondheidsbeoordeling, met name in de context van infectieuze en longziekten. Vooruitgang in signaalverwerking en kunstmatige intelligentie (AI) heeft geautomatiseerde analyse van hoest- en ademhalingsgeluiden mogelijk gemaakt, wat hun gebruik als digitale biomarkers ondersteunt. Recente studies tonen aan dat ademhalingsgeluiden die worden vastgelegd met microfoons in smartphones, draagbare apparaten of klinische sensoren, effectief kunnen worden geanalyseerd met deep learning-modellen om COVID-19-infectie 1,5 te detecteren. Deze ontwikkelingen benadrukken het potentieel van audio-gebaseerde screening als een snelle, contactloze en schaalbare aanvulling op conventionele diagnostische procedures. Coronavirusziekte 2019 (COVID-19), veroorzaakt door het SARS-CoV-2-virus, treft voornamelijk het ademhalingssysteem en veroorzaakt meetbare veranderingen in luchtstroomdynamiek, longfunctie en het gedrag van de vocale kanaal. Hoewel reverse transcription–polymerase chain reaction (RT-PCR) testen de referentiestandaard voor diagnose blijft, beperken de logistieke beperkingen en vertraagde doorlooptijd de geschiktheid voor grootschalige of continue screening, wat het verkennen van alternatieve benaderingen op basis van ademhalingsgeluidsanalyse motiveert.

Een groeiende hoeveelheid literatuur heeft de door AI aangestuurde COVID-19-detectie onderzocht met behulp van hoest-, ademhalings- en spraaksignalen. Zoals samengevat in Tabel 1, hebben eerdere studies diverse datasets, akoestische feature-representaties (bijv. MFCC, STFT, spectrogram-gebaseerde kenmerken) en leerparadigma's onderzocht, variërend van klassieke machine learning-modellen tot diepe convolutionele, recurrente, aandachtgebaseerde en transformer-architecturen 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. Verschillende werken hebben veelbelovende screeningsprestaties aangetoond met behulp van crowdsourced en klinisch verzameld ademhalingsaudio. Daarentegen hebben anderen het belang benadrukt van transfer learning, data-augmentatie en verklaarbare AI voor het verbeteren van robuustheid en betrouwbaarheid. In plaats van een gedetailleerde studie voor studie te herhalen, biedt Tabel 1 een geconsolideerd vergelijkend overzicht van deze representatieve benaderingen, waardoor datasets, methodologieën en gerapporteerde uitkomsten direct kunnen worden vergeleken.

Ondanks deze vooruitgang belemmeren verschillende beperkingen de robuustheid en toepasbaarheid van bestaande benaderingen. Respiratorische audiodatasets worden vaak verzameld onder heterogene opnameomstandigheden, wat leidt tot aanzienlijke variabiliteit tussen apparaten, akoestische omgevingen en proefpersonenpopulaties 2,3,4. Veel publiek beschikbare datasets zijn afhankelijk van zelfgerapporteerde COVID-19-status, wat onzekerheid veroorzaakt over labelbetrouwbaarheid7. Daarnaast beperken een uitgesproken klassenonbalans en beperkte beschikbaarheid van klinisch gevalideerde steekproeven het generalisatievermogen van discriminatiemodellen die uitsluitend op geobserveerde gegevens zijn getraind 4,5. Daardoor vertaalt modelprestatie die onder gecontroleerde experimentele settings wordt gerapporteerd zich niet consequent tot betrouwbare implementatie in diverse realistische scenario's.

Gezamenlijk benadrukken deze beperkingen een cruciale onderzoekskloof: het ontbreken van een uniform kader dat tegelijkertijd dataschaarste, klassenonevenwicht en robuuste generalisatie over heterogene datasets aanpakt. Hoewel generatieve modellen zoals Generative Adversarial Networks (GANs) en Variational Autoencoders (VAEs) zijn onderzocht om latente representaties te leren en realistische biomedische signalen 6,7 te synthetiseren, gebruiken bestaande studies deze modellen doorgaans onafhankelijk en evalueren ze binnen één dataset. Bovendien is hun integratie met aandachtsversterkte convolutionele architecturen en evaluatie onder cross-dataset-voorwaarden onvoldoende onderzocht.

Om deze kloof aan te pakken, stelt de huidige studie een generatief AI-ondersteund kader voor COVID-19-detectie uit hoestgeluiden voor, dat akoestische feature-extractie integreert met een hybride GAN–VAE-model en aandachtgebaseerde diepe convolutionele neurale netwerken (DCNN's). De generatieve component vermindert een klasse-onevenwicht en beperkte beschikbaarheid van steekproeven door gestructureerde latte representatie-leren en synthetische datageneratie, terwijl de discriminatiemodellen de classificatierobuustheid over heterogene datasets verbeteren. In tegenstelling tot eerdere werken die voornamelijk vertrouwen op validatie binnen de dataset, wordt het voorgestelde kader geëvalueerd met cross-datasettesten op een onafhankelijke dataset, wat een rigoureuzere beoordeling van de generalisatieprestaties mogelijk maakt. Het framework is bedoeld als een screeninggerichte benadering in plaats van een zelfstandig diagnostisch hulpmiddel, en het ontwerp houdt expliciet rekening met het registreren van variabiliteit en labelonzekerheid om reproduceerbare en betrouwbare implementatie te ondersteunen.

In deze context zijn de nieuwe bijdragen van deze studie drieledig. Ten eerste is een uniform GAN–VAE hybride generatief kader geïntegreerd met aandachtgebaseerde DCNN-classifiers om gezamenlijk klasse-onevenwichtigheid, beperkte databeschikbaarheid en robuust feature-representatieleren in hoestgebaseerde COVID-19-screening aan te pakken. Ten tweede wordt de voorgestelde aanpak systematisch geëvalueerd met behulp van cross-datasetvalidatie, wat een realistischere beoordeling van modelgeneralisatie biedt in vergelijking met conventioneel testen binnen de dataset. Ten derde presenteert de studie een gedetailleerde analyse van de impact van generatieve augmentatie onder heterogene opnamecondities, waarmee het kader wordt gepositioneerd als een reproduceerbaar proof-of-concept voor schaalbare, praktische COVID-19-screening.

Auteur(s) & JaarDataset(s)Gebruikte technieken / KenmerkenModel / ClassifierNauwkeurigheid / MetriekenBeperkingen / Noten
Imran et al., 20208Crowdsourced hoestdataset (AI4COVID-19)MFCC, transfer learning, domeinbewuste functiesRisico-averse multiclassifier (DL + ML ensemble)Nauwkeurigheid: 92,6%Afhankelijk van de hoestkwaliteit; Beperkte klinische validatie
Brown et al., 20209Crowdsourced ademhalingsgeluiden (>7.000 gebruikers)Handgemaakte audiofuncties, VGGish-embeddingsOndiepe ML-modellenAUC > 80%Labelruis in crowdsourced data
Laguarta et al., 202010MIT Open Voice dataset (5.320 proefpersonen)MFCC, akoestische biomarkersCNN (ResNet50, overdrachtsleer)Gevoeligheid: 98,5%, Specificiteit: 94,2%Vereist een grote pretraining-dataset
Quartieri et al., 202011Spraakinterviews (5 onderwerpen, voor/na COVID)Ademhalingsintensiteit, F0, CPP, formantenStatistische effectgrootte-analysebehaal een AUC van meer dan 80% over alle takenZeer kleine steekproefgrootte
Hassan et al., 202012AdemhalingsgeluidenKenmerken van temporele spraakRNNHoest: 97%, adem: 98,2%, stem: 88,2%Gebrek aan gedetailleerde datasetstatistieken
Khamparia et al., 201913ESC-10, ESC-50Spectrogrambeeld-gebaseerde functiesCNN, TDSNCNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10)Alleen omgevingsgeluiden; Lagere prestaties op complexe datasets
Aykanat et al., 20171417.930 longgeluiden van 1.630 proefpersonen (elektronische stethoscoop)MFCC-functies, spectrogrambeeldenSVM, CNNCNN/SVM: 86% (gezond versus pathologisch), 76%/75% (rale–rhonchus–normaal), 80%/80% (enkel type), 62%/62% (alle typen)Vereist gespecialiseerde hardware; niet ziekte-specifiek
Ponomarchuk et al., 202215Coswara, VirufyMFCC, mel-spectrogram, waveletkenmerkenCNN, RNN, ensemblemodellenAUC: 0,93 (intern), 0,79 (extern)Generaliseren over datasets blijft een uitdaging
Feng et al., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNNauwkeurigheid 81,25% (AUC van 0,79)Dataset-afhankelijke prestaties
Islam et al., 202217Klinische hoestopnamesSpectrale en tijd-frequentiekenmerkenDiepe neurale netwerkenNauwkeurigheid: 89,2%Beperkte dataset
Manshouri, 202218VirufySpectrale analysekenmerkenKlassieke ML-classifiersNauwkeurigheid: 95,86%Kleinschalige experimentele studie
Huang et al., 202019Longgeluiden van 10 COVID-19-patiëntenTijd-frequentie ademhalingsgeluidanalyseKlinische deskundige analyseKwalitatieve validatieKleine dataset; geen ML-model
W. D. Puja et al., 202420Coswara, Virufy (hoestgeluidsdatasets)STFT, Mel-spectrogram, MFCC, RMS-energie, spectrale bandbreedte, spectraal centroid, spectrale roll-off, ZCR; CNN-gebaseerde deep feature extractie1D CNN (feature extractor) + Random ForestNauwkeurigheid: 93%De prestaties hangen af van de kwaliteit van de hoest; ontworpen voor screening in plaats van klinische diagnose; Variabiliteit in crowdsourced data
Chadaga et al., 202321Crowdsourced hoestgeluidsopnamenMel-spectrogram en tijd-frequentie akoestische kenmerkenConvolutioneel Neuraal Netwerk (CNN)Nauwkeurigheid: 84%, Precisie: 85%, Herinnering: 84%, F1-score: 84%De prestaties worden beperkt door data-onevenwichtigheden, zelfgerapporteerde labels en gevoeligheid voor opnamecondities
Chadaga et al., 202322Milde tot matige COVID-19 en andere klinische markers voor luchtwegaandoeningenSelectie van speelfilms (Pearson, PSO); Belangrijke markers: Eosinophil, Albumine, T. Bilirubine, ALP, ALT, AST, HbA1c, TWBCGestackt ensemble; 1D CNN, LSTM, DNN, Residuele MLPNauwkeurigheid: 89%Ernstige gevallen uitgesloten; alternatief voor RT-PCR; verklaarbare AI toegepast
Dar et al. 202423COVID-19 DatasetSJHBO-optimalisatie (Jaya+HBO+SO), veel spectrale kenmerkenDeep Q Netwerk (DQN)Nauwkeurigheid: 95,11%, Gevoeligheid: 95,06%, Specificiteit: 94,69%Hoge complexiteit; De afstemming wordt verbeterd via een hybride optimizer
Jing Quian et al 202024Spraakopnames van COVID-19-patiëntenAkoestische features sets; Analyse van de ernst van de ziekte, slaapkwaliteit, vermoeidheid, angstSupport Vector Machines (SVM)0,69 (ernst van de ziekte)Beperkt tot audiofuncties; matige nauwkeurigheid; datasetgrootte niet gespecificeerd; Slechts vier gezondheidsaspecten worden meegenomen
Sharma, J., et al. 202025UrbanSound8K, ESC-10, ESC-50Multi-feature kanalen: MFCC, GFCC, CQT, Chromagram; Mix-up data-augmentatieDiepe CNN met ruimtelijk scheidbare convoluties en aandachtsmodulesUrbanSound8K: 97,52%, ESC-10: 94,75%, ESC-50: 87,45%Niet getest op niet-benchmark of echte datasets; computationele complexiteit door diepere CNN- en aandachtmodules
Lella KK, et al. 202126 Ademhalingsgeluiden; COVID-19, astma, gezond)Data-augmentatie; diepgaande functies met behulp van Data De-noising Auto Encoder (DDAE) in plaats van MFCC1D Convolutioneel Neuraal Netwerk (1D CNN)~90%Beperkte gegevenssetdetails; ~4% verbetering ten opzichte van MFCC; Generaliseerbaarheid niet getest
Orlandic et al., 202127HOEST (25k+ hoest)MFCC's, PSD, spectrale en tijdkenmerkenXGBoostAUC 96,5%, Precisie 95,5%Zelfgerapporteerde COVID; expertlabels op deelverzameling
Zhang et al., 202343Gepubliceerde casusrapporten van HLH na COVID-19-vaccinatie (literatuurdatabases)Systematische review; klinische feature-aggregatie; Moleculaire koppelingsanalyseNiet van toepassing (klinische review)Beschrijvende statistiek; Klinische uitkomstenAnalyse van zeldzame gebeurtenissen; kleine steekproefgrootte; Vertrouwen op gerapporteerde gevallen kan rapportagebias veroorzaken
Xu et al., 202344Gerapporteerde gevallen van vaccin-geassocieerde VKH-ziekte uit de literatuurRetrospectieve casusbeoordeling; Klinische en beeldvormingsanalyseNiet van toepassing (klinische observationele studie)Behandelingsrespons en klinische herstelresultatenBeperkt aantal zaken; gebrek aan controlegroep; Een causaal verband kan niet met zekerheid worden vastgesteld
Hu et al., 202545Gegevens op bedrijfsniveau van moeder-dochterondernemingen van SRDI-medische hulpmiddelbedrijven in China (Qixinbao-database)Analyse van sociale netwerken; ruimtelijke netwerkmetriek; Analyse van geografische detectorenNiet van toepassing (netwerk- en beleidsanalyse)Netwerkdichtheid, centraliteit, diffusie-indicesDwarsdoorsnedeontwerp; gelijke weging van bedrijven; Geen directe prestatie- of klinische uitkomstindicatoren

Tabel 1: Samenvatting van bestaande COVID-19 audio-gebaseerde detectiestudies. Vergelijkend overzicht van eerdere hoest-/audioscreening-methoden, inclusief datasets, methoden en gerapporteerde prestaties. Klik hier om deze tabel te downloaden.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Voorgestelde methodologie

Deze studie stelt een generatief AI-gebaseerd kader voor om COVID-19 te detecteren aan de hand van hoestsignalen. Het framework integreert generatieve modellen met discriminerende classifiers, waarbij trainings- en evaluatiegegevens strikt gescheiden worden gehouden. Figuur 1 illustreert de gedetailleerde architectuur van het voorgestelde GAN–VAE–ADCNN-framework, en toont de stroom van audio-preprocessing en feature-extractie via latent representation learning via een Variational Autoencoder (VAE), synthetische feature-generatie met een Generative Adversarial Network (GAN), en de uiteindelijke classificatie met Deep Convolutional Neural Networks (DCNN) en Attention-based DCNN (ADCNN). De figuur toont aan dat generatieve componenten alleen tijdens training worden gebruikt, terwijl classificatie wordt uitgevoerd met behulp van discriminatiemodellen.

figure-protocol-1
Figuur 1: GAN–VAE–ADCNN architectuuroverzicht. Schema van de voorgestelde hybride pijplijn, waarbij hoest-afgeleide akoestische kenmerken worden gecodeerd met een VAE, aangevuld met GAN-gebaseerde synthetische monstergeneratie en geclassificeerd met DCNN- en aandachtgebaseerde DCNN (ADCNN)-modellen. Klik hier om een grotere versie van deze figuur te bekijken.

Modelarchitectuur en implementatie

De generatieve en discriminatieve modellen die in dit kader worden gebruikt, zijn geïmplementeerd met vaste en reproduceerbare architecturen. De GAN bestaat uit een generator met drie volledig verbonden lagen (128, 256 en 512 eenheden) die ReLU-activatie gebruiken, en een discriminator met drie volledig verbonden lagen (512, 256 en 128 eenheden) met LeakyReLU-activatie gevolgd door een sigmoid-uitvoer.

De VAE-encoder bestaat uit twee volledig verbonden lagen met 256 en 128 eenheden, gevolgd door schatting van het latente gemiddelde en de variantie met een latente dimensionaliteit van 64. De decoder weerspiegelt deze structuur en wordt getraind met een combinatie van reconstructieverlies en Kullback–Leibler-divergentie om een gestructureerde en probabilistische latente ruimte te leren.

De DCNN-classifier bevat vier convolutionele blokken met respectievelijk 3x3 kernen en 32, 64, 128 en 256 filters. Elk blok wordt gevolgd door batchnormalisatie, een ReLU-activatie en 2x2 max pooling. De ADCNN breidt de DCNN uit door een kanaalgewijze aandachtsmechanisme te integreren na het laatste convolutionele blok. Alle modellen werden geoptimaliseerd met de Adam-optimizer met een leersnelheid van 0,0001 en een batchgrootte van 32. Zoals weergegeven in Figuur 1, opereren de VAE en GAN alleen tijdens de training, terwijl DCNN en ADCNN worden gebruikt voor classificatie. De volledige trainings- en evaluatieprocedure wordt samengevat in Algoritme 1.

Algoritme 1: GAN–VAE-gebaseerd COVID-19 detectiekader

Input: Voorbewerkte hoestgeluidsopnamen

Output: Binaire classificatielabel (COVID-19 positief/negatief)

De trainings- en evaluatieprocedures volgden een vaste, reproduceerbare pijplijn. Alle hoestgeluidsopnamen werden opnieuw gesampled tot 16 kHz, onderworpen aan ruisreductie en amplitude genormaliseerd. De opnames werden gesegmenteerd in segmenten van vaste lengte, waaruit MFCC, chroma en spectrale kenmerken werden geëxtraheerd. In totaal werden 40 Mel-Frequency Cepstral Coëfficiënten (MFCC's) uit elk audiosegment geëxtraheerd. Daarnaast werden 12 chroma-kenmerken berekend. De resulterende representatie vormt een 52-dimensionale kenmerkvector voor elk hoestsegment. Er werd een splitsing op proefpersoonsniveau uitgevoerd om de gegevens te verdelen in trainings-, validatie- en testsets. De VAE werd getraind om probabilistische latente representaties te leren, en de resulterende latente vectoren werden gebruikt om de GAN te trainen voor synthetische featuregeneratie. De trainingsdataset werd uitgebreid met GAN–VAE-gegenereerde steekproeven, terwijl synthetische data werden uitgesloten van validatie en testen. DCNN- en ADCNN-classifiers werden getraind op de augmented trainingsgegevens, en de eindevaluatie werd uitgevoerd op de vastgehouden testset met behulp van standaard prestatie-metrics.

Trainingsopzet, datasplitsing en lekpreventie

Alle experimenten werden uitgevoerd met een vaste, reproduceerbare trainingsconfiguratie. Datasplitsing werd uitgevoerd op proefpersoonniveau vóór audiosegmentatie om datalekkage te voorkomen. De dataset werd verdeeld in trainings-, validatie- en testsets in een verhouding van 80:10:10, zodat alle segmenten uit dezelfde opname aan één subset werden toegewezen. De trainingsset werd gebruikt voor modelleren en generatieve data-augmentatie, de validatieset voor hyperparameterafstemming en vroegtijdig stoppen, en de testset werd vastgelegd voor de definitieve prestatie-evaluatie. Synthetische monsters die door het GAN–VAE-kader werden gegenereerd, werden exclusief gebruikt tijdens de training en werden strikt uitgesloten van validatie en testen om een eerlijke evaluatie te waarborgen.

Modellen werden getraind voor maximaal 100 epochs, met vroegtijdige stopzetten op basis van validatieverlies en een geduld van 10 epochs. Optimalisatie werd uitgevoerd met de Adam-optimizer met een leersnelheid van 0,0001 en een batchgrootte van 32. Binair kruis-entropieverlies werd toegepast voor classificatie, terwijl reconstructie en adversariale verliezen werden gebruikt voor het trainen van respectievelijk de VAE- en GAN-componenten. Dit uniforme trainings- en evaluatieprotocol zorgt voor reproduceerbaarheid, voorkomt datalekken en handhaaft een strikte scheiding tussen trainings- en evaluatiefasen.

Datasetbeschrijving

Twee publiek beschikbare hoestaudiodatasets—COUGHVID en Virufy—werden gebruikt om grootschalige akoestische diversiteit in balans te brengen met klinisch geraadpleegde labels, met duidelijk gescheiden rollen in training en evaluatie.

COUGHVID is een crowdsourced verzameling hoestopnames met gedeeltelijke expertannotatie en zelfgerapporteerde metadata. Om de datakwaliteit te waarborgen, werden 428 opnames geselecteerd na toepassing van vooraf gedefinieerde kwaliteitscontrolecriteria, waaronder minimale signaalduur, een adequate signaal-ruisverhouding, verwijdering van corrupte of ambigue monsters en de aanwezigheid van identificeerbare hoestincidenten met symptoommetadata. Na preprocessing en segmentatie leverden deze opnames 1.719 hoestsegmenten op, gestandaardiseerd naar WAV-formaat met een samplefrequentie van 16 kHz. COUGHVID werd gebruikt voor het trainen van zowel generatieve modellen als discriminatieve classifiers.

Virufy bestaat uit door artsen begeleide hoestopnames die als RT-PCR positief of negatief zijn gelabeld voor COVID-19. Alle 16 beschikbare opnames werden opgenomen, wat resulteerde in 234 hoestsegmenten na segmentatie, eveneens gestandaardiseerd op 16 kHz. Virufy werd uitsluitend gebruikt voor externe cross-dataset-evaluatie om de generalisatieprestaties te beoordelen en werd niet gebruikt voor training, fine-tuning of generatieve augmentatie.

Het voorgestelde kader moet daarom worden geïnterpreteerd als een proof-of-concept screeningsbenadering geëvalueerd onder gecontroleerde experimentele omstandigheden, in plaats van als een klinisch gevalideerd diagnostisch systeem.

Voorverwerking en segmentatie van gegevens

Alle opnames werden opnieuw gesampled naar 16 kHz, omgezet naar mono en onderworpen aan stilteverwijdering, spectrale ruisreductie en amplitudenormalisatie. Segmentatie werd uitgevoerd na splitsing op proefpersoonsniveau om datalekkage te voorkomen. Elke opname werd verdeeld in overlappende segmenten van 2–4 s, en laag-energetische of stille segmenten werden weggegooid.

Extern Validatieprotocol

Externe validatie werd uitgevoerd door middel van cross-dataset-evaluatie. Modellen die getraind zijn met COUGHVID werden geëvalueerd op Virufy voor externe validatie. Dit protocol beoordeelt generalisatie over datasets die onder verschillende omstandigheden zijn verzameld, in plaats van prospectieve klinische validatie. Figuur 2 geeft een overzicht op protocolniveau van deze workflow, waarin het gebruik van datasets, voorverwerking, feature-extractie, classifiertraining en evaluatiescenario's worden geïllustreerd. Terwijl Figuur 1 zich richt op de interne modelarchitectuur, legt Figuur 2 de nadruk op experimenteel ontwerp en datastroom over trainings- en testfasen.

figure-protocol-2
Figuur 2: Workflow van het voorgestelde COVID-19 hoestscreeningsraamwerk. Illustratie van de volledige verwerkingspijplijn, inclusief preprocessing, feature-extractie (MFCC, chroma, spectrale kenmerken), GAN–VAE-gebaseerde representatieleer en -augmentatie (alleen training), en definitieve classificatie onder onderwerpniveau splitsing en cross-dataset-evaluatie. Klik hier om een grotere versie van deze figuur te bekijken.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Analyse van datasetcompositie en klassenverdeling

Na preprocessing en segmentatie toonden de COUGHVID- en Virufy-datasets aanzienlijke verschillen in zowel de schaal van de datasets als de segmentdichtheid. COUGHVID leverde 428 van de 444 opnames (96,4%) en 1.719 van de 1.953 geëxtraheerde hoestsegmenten (88,0%), waarmee het zijn rol als primaire dataset voor modeltraining en generatieve augmentatie bevestigt (Figuur 3

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De resultaten tonen aan dat het voorgestelde generatieve AI-gebaseerde framework COVID-19 kan detecteren aan de hand van hoestsignalen over heterogene datasets. Zoals weergegeven in Tabel 4 en Tabel 6, behaalde het GAN–VAE hybride model de beste prestaties, met 97,2% nauwkeurigheid en een AUROC van 0,953, samen met hoge precisie, recall, F1-score en specificiteit, wat wijst op gebalanceerde classificatieprestaties.

De prestati...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Er werd geen mogelijk belangenconflict gemeld door de auteur(s).

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wij spreken onze oprechte dank uit aan de docenten en onderzoeksmentoren van de School of Computer Science and Engineering voor hun waardevolle begeleiding, voortdurende ondersteuning en constructieve feedback tijdens de voorbereiding van dit artikel.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
COUGHVID DatasetÉcole Polytechnique Fédérale de Lausanne (EPFL)Public release (2021)Crowdsourced cough audio dataset met zelfgerapporteerde metadata en gedeeltelijke artsenannotatie; voornamelijk gebruikt voor training en data-augmentatie.
CUDA ToolkitNVIDIA11.3GPU-versnellingsframework dat wordt gebruikt om het modeltrainings- en inferenceproces te versnellen.
LibROSAOpen Source0.9Audio-analysebibliotheek die wordt gebruikt voor hersampling, segmentatie, MFCC-extractie en spectrale functieberekening.
Linux Operating SystemCanonicalUbuntu 20.04 LTSBesturingssysteem dat wordt gebruikt voor alle experimenten en modeltraining.
MatplotlibOpen Source3.5Visualisatiebibliotheek die wordt gebruikt voor het plotten van datasetverdelingen en evaluatieresultaten.
NumPyOpen Source1.21Numerieke rekenbibliotheek die wordt gebruikt voor array-manipulatie en signaalverwerkingsbewerkingen.
NVIDIA GPUNVIDIATesla / RTX-klasseGrafische verwerkingseenheid die wordt gebruikt voor het trainen van diepe en generatieve modellen.
Python Programming LanguagePython Software Foundation3.8Kernprogrammeeromgeving die wordt gebruikt voor gegevensvoorverwerking, functie-extractie, modelontwikkeling en evaluatie.
PyTorchMeta (Facebook AI Research)1.12Deep learning-framework dat wordt gebruikt om GAN-, VAE-, DCNN- en op aandacht gebaseerde DCNN-modellen te implementeren.
Scikit-learnOpen Source1Machine learning-bibliotheek die wordt gebruikt voor het splitsen van gegevens, klasse-gewichting en berekening van prestatiemetrieken.
SciPyOpen Source1.7Wetenschappelijke rekenbibliotheek die wordt gebruikt voor audiovoorverwerking en signaalovergangen.
Virufy DatasetVirufyPublic release (2021)Klinisch verzamelde hoestrecensies met RT-PCR–geverifieerde COVID-19-labels; uitsluitend gebruikt voor externe validatie en evaluatie tussen datasets.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

Gerelateerde artikelen