Article de recherche

Un cadre basé sur l’IA générative pour le dépistage du COVID-19 à partir des signaux audio de toux

DOI :

10.3791/69874

10 mars 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude propose un cadre basé sur l’IA générative qui intègre les GAN, les AVE et des réseaux convolutionnels profonds basés sur l’attention pour détecter la COVID-19 à partir des signaux audio de tousse, améliorant la robustesse, l’équilibre des données et la généralisation inter-jeux de données pour un dépistage évolutif et non invasif.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’analyse audio de la toux offre une voie pratique pour développer des outils automatisés afin de soutenir le dépistage de la maladie COVID-19. Malgré un intérêt croissant, de nombreuses approches existantes restent sensibles au bruit, au déséquilibre de classes et à la variabilité des ensembles de données, limitant leur reproductibilité. Ce travail présente une méthodologie structurée guidée par l’intelligence artificielle générative pour la détection du COVID-19 à l’aide d’enregistrements sonores de toux. Les expériences sont menées à l’aide de deux ensembles de données accessibles au public, COUGHVID et Virufy, qui comprennent tous deux des échantillons de toux marqués. Le protocole proposé se compose d’étapes de prétraitement séquentielles, incluant la segmentation de la toux, la réduction du bruit et la normalisation du signal. Les caractéristiques acoustiques sont ensuite capturées à l’aide des coefficients cépstraux à fréquence Mel, des descripteurs de chrominance et des caractéristiques de contraste spectral. Pour améliorer l’apprentissage des représentations et atténuer le déséquilibre des données, un cadre génératif hybride intégrant des autoencodeurs variationnels et des réseaux adversaires génératifs est utilisé pour synthétiser des échantillons au niveau des caractéristiques. La classification est ensuite réalisée à l’aide de réseaux neuronaux convolutionnels profonds et de modèles DCNN basés sur l’attention. L’évaluation des performances indique que l’intégration d’augmentation générative s’améliore systématiquement par rapport aux bases non génératives, atteignant une précision maximale de classification de 97,2 % et un AUROC de 0,953 sur les ensembles de données évalués. Ces résultats démontrent l’efficacité de la modélisation générative pour améliorer la détection de la COVID-19 basée sur la toux et établissent un pipeline analytique reproductible pour les recherches futures en surveillance acoustique.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’acoustique respiratoire a de plus en plus été explorée comme une source d’information non invasive pour l’évaluation de la santé, en particulier dans le contexte des maladies infectieuses et pulmonaires. Les avancées en traitement du signal et en intelligence artificielle (IA) ont permis l’analyse automatisée des bruits de toux et de respiration, soutenant leur utilisation comme biomarqueurs numériques. Des études récentes démontrent que les sons respiratoires captés à l’aide de microphones intégrés dans les smartphones, les appareils portables ou les capteurs cliniques peuvent être analysés efficacement à l’aide de modèles d’apprentissage profond pour détecter l’infection auCOVID-19 1,5. Ces avancées mettent en lumière le potentiel du dépistage audio comme complément rapide, sans contact et évolutif aux procédures diagnostiques conventionnelles. La maladie à coronavirus 2019 (COVID-19), causée par le virus SARS-CoV-2, affecte principalement le système respiratoire et induit des changements mesurables dans la dynamique du flux d’air, la fonction pulmonaire et le comportement des voies vocales. Bien que le test de transcription inverse-réaction en chaîne par polymérase (RT-PCR) reste la norme de référence pour le diagnostic, ses contraintes logistiques et le délai de délai limitent son adéquation pour un dépistage à grande échelle ou continu, ce qui motive l’exploration d’approches alternatives basées sur l’analyse du son respiratoire.

Un nombre croissant de littératures ont étudié la détection du COVID-19 par IA à l’aide de signaux de toux, de respiration et de parole. Comme résumé dans le tableau 1, des études antérieures ont exploré divers ensembles de données, des représentations de caractéristiques acoustiques (par exemple, MFCC, STFT, caractéristiques basées sur des spectrogrammes) et des paradigmes d’apprentissage allant des modèles classiques d’apprentissage automatique aux architectures profondes convolutionnelles, récurrentes, basées sur l’attention ettransformateurs 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. Plusieurs travaux ont démontré des performances prometteuses au dépistage grâce à des audios respiratoires collectés par la participation participative et cliniquement. En revanche, d’autres ont souligné l’importance de l’apprentissage par transfert, de l’augmentation des données et de l’IA explicable pour améliorer la robustesse et la fiabilité. Plutôt que de répéter une discussion détaillée étude par étude, le Tableau 1 offre un aperçu comparatif consolidé de ces approches représentatives, permettant une comparaison directe des ensembles de données, des méthodologies et des résultats rapportés.

Malgré ces avancées, plusieurs limitations entravent la robustesse et l’applicabilité concrète des approches existantes. Les ensembles de données audio respiratoires sont fréquemment collectés dans des conditions d’enregistrement hétérogènes, ce qui entraîne une variabilité substantielle entre les appareils, les environnements acoustiques et les populationsde sujets 2,3,4. De nombreux ensembles de données accessibles publiquement reposent sur le statut COVID-19 auto-déclaré, ce qui introduit une incertitude quant à la fiabilité desétiquettes 7. De plus, un déséquilibre de classe prononcé et la disponibilité limitée d’échantillons validés cliniquement restreignent la capacité de généralisation des modèles discriminatifs entraînés uniquement sur des donnéesobservées 4,5. Par conséquent, la performance du modèle rapportée dans des contextes expérimentaux contrôlés ne se traduit pas systématiquement par un déploiement fiable dans divers scénarios réels.

Pris ensemble, ces limites mettent en lumière un manque crucial de recherche : l’absence d’un cadre unifié qui traite simultanément la rareté des données, le déséquilibre de classes et une généralisation robuste à travers des ensembles de données hétérogènes. Bien que des modèles génératifs tels que les réseaux antagonistes génératifs (GAN) et les autoencodeurs variationnels (VAE) aient été explorés pour apprendre les représentations latentes et synthétiser des signaux biomédicauxréalistes 6,7, les études existantes utilisent généralement ces modèles de manière indépendante et les évaluent au sein d’un seul ensemble de données. De plus, leur intégration avec des architectures convolutionnelles à attention améliorée et leur évaluation sous des conditions croisées de jeux de données reste insuffisamment étudiée.

Pour combler cette lacune, la présente étude propose un cadre assisté par IA générative pour la détection du COVID-19 à partir des sons de toux, intégrant l’extraction des caractéristiques acoustiques avec un modèle hybride GAN–VAE et des réseaux neuronaux convolutionnels profonds (DCNN) basés sur l’attention. La composante générative atténue le déséquilibre de classes et la disponibilité limitée des échantillons grâce à l’apprentissage structuré de représentations latentes et à la génération de données synthétiques, tandis que les modèles discriminatifs renforcent la robustesse de la classification à travers des ensembles de données hétérogènes. Contrairement aux travaux précédents qui reposent principalement sur la validation interne des ensembles de données, le cadre proposé est évalué par des tests inter-ensembles de données sur un ensemble de données indépendant, permettant une évaluation plus rigoureuse de la performance en généralisation. Le cadre est conçu comme une approche orientée dépistage plutôt qu’un outil de diagnostic autonome, et sa conception prend explicitement en compte la variabilité de l’enregistrement et l’incertitude des étiquettes afin de soutenir un déploiement reproductible et fiable.

Dans ce contexte, les contributions novatrices de la présente étude sont triples. Tout d’abord, un cadre génératif hybride unifié GAN–VAE est intégré à des classificateurs DCNN basés sur l’attention afin de traiter conjointement le déséquilibre de classe, la disponibilité limitée des données et l’apprentissage robuste de la représentation des caractéristiques dans le dépistage COVID-19 basé sur la toux. Deuxièmement, l’approche proposée est systématiquement évaluée à l’aide de la validation croisée des jeux de données, offrant une évaluation plus réaliste de la généralisation du modèle comparée aux tests conventionnels dans les ensembles de données. Troisièmement, l’étude présente une analyse détaillée de l’impact de l’augmentation générative dans des conditions d’enregistrement hétérogènes, positionnant ainsi le cadre comme une preuve de concept reproductible pour un dépistage du COVID-19 évolutif et pratique.

Auteur(s) & AnnéeEnsemble(s) de donnéesTechniques / Caractéristiques utiliséesModèle / ClassificateurPrécision / MétriquesLimitations / Notes
Imran et al., 20208Ensemble de données sur la toux participative (AI4COVID-19)MFCC, apprentissage par transfert, fonctionnalités conscientes du domaineMulti-classificateur averse au risque (ensemble DL + ML)Précision : 92,6 %Selon la qualité de la toux ; Validation clinique limitée
Brown et al., 20209Sons respiratoires participatifs (>7 000 utilisateurs)Fonctionnalités audio artisanales, embeddings à la VGGModèles ML superficielsAUC > 80 %Bruit d’étiquette dans les données participatives
Laguarta et al., 202010Jeu de données MIT Open Voice (5 320 sujets)MFCC, biomarqueurs acoustiquesCNN (ResNet50, transfert d’apprentissage)Sensibilité : 98,5 %, spécificité : 94,2 %Nécessite un grand ensemble de données de préentraînement
Quartieri et al., 202011Entretiens de discours (5 sujets, avant/après le COVID)Intensité respiratoire, F0, CPP, formantsAnalyse statistique par taille d’effetatteindre un AUC supérieur à 80 % sur toutes les tâchesTaille d’échantillon très petite
Hassan et al., 202012Bruits respiratoiresCaractéristiques de la parole temporelleRNNToux : 97 %, respiration : 98,2 %, voix : 88,2 %Manque de statistiques détaillées sur les ensembles de données
Khamparia et al., 201913ESC-10, ESC-50Fonctionnalités basées sur l’image du spectrogrammeCNN, TDSNCNN : 77 % (ESC-10), 49 % (ESC-50) ; TDSN : 56 % (ESC-10)Uniquement les sons environnementaux ; Performances inférieures sur des ensembles de données complexes
Aykanat et al., 20171417 930 bruits pulmonaires provenant de 1 630 sujets (stéthoscope électronique)Fonctionnalités MFCC, images de spectrogrammesSVM, CNNCNN/SVM : 86 % (sain vs pathologique), 76 %/75 % (rale–rhonchus–normal), 80 %/80 % (type unique), 62 %/62 % (tous types)Nécessite du matériel spécialisé ; Pas spécifique à la maladie
Ponomarchuk et al., 202215Coswara, VirufyMFCC, mel-spectrogramme, caractéristiques d’ondelettesCNN, RNN, modèles d’ensembleAUC : 0,93 (interne), 0,79 (externe)La généralisation entre ensembles de données reste un défi
Feng et al., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNPrécision 81,25 % (AUC de 0,79)Performance dépendante de l’ensemble de données
Islam et al., 202217Enregistrements cliniques de la touxCaractéristiques spectrales et temps-fréquenceRéseaux de neurones profondsPrécision : 89,2 %Jeu de données limité
Manshouri,2022 18VirufyCaractéristiques d’analyse spectraleClassificateurs ML classiquesPrécision : 95,86 %Étude expérimentale à petite échelle
Huang et al., 202019Bruits pulmonaires de 10 patients atteints de COVID-19Analyse du son respiratoire temps-fréquenceAnalyse d’experts cliniquesValidation qualitativePetit jeu de données ; pas de modèle ML
W. D. Puja et al., 202420Coswara, Virufy (ensembles de données sur le son de tousse)STFT, spectrogramme Mel, MFCC, énergie RMS, largeur de bande passante spectrale, centroïde spectral, roulement spectral, ZCR ; Extraction profonde de caractéristiques basée sur CNNCNN 1D (extracteur de caractéristiques) + Forêt aléatoirePrécision : 93 %La performance dépend de la qualité de la toux ; conçu pour le dépistage plutôt que pour le diagnostic clinique ; Variabilité des données participatives
Chadaga et al., 202321Enregistrements audio de tousse participatifsMél-spectrogramme et caractéristiques acoustiques temps-fréquenceRéseau de neurones convolutionnel (CNN)Précision : 84 %, Précision : 85 %, Rappel : 84 %, F1-score : 84 %La performance est limitée par le déséquilibre des données, les labels auto-déclarés, la sensibilité aux conditions d’enregistrement
Chadaga et al., 202322Marqueurs cliniques du COVID-19 léger à modéré et d’autres maladies respiratoiresSélection des fonctionnalités (Pearson, PSO) ; Marqueurs clés : Éosinophile, Albumine, T. Bilirubine, ALP, ALT, AST, HbA1c, TWBCEnsemble superposé ; 1D CNN, LSTM, DNN, MLP RÉSIDUELPrécision : 89 %Les cas graves exclus ; alternative à la RT-PCR ; IA explicable appliquée
Dar et al. 202423Ensemble de données COVID-19Optimisation SJHBO (Jaya+HBO+SO), de nombreuses caractéristiques spectralesRéseau Q profond (DQN)Précision : 95,11 %, Sensibilité : 95,06 %, Spécificité : 94,69 %Complexité élevée ; L’ajustement est amélioré via un optimiseur hybride
Jing Quian et al. 202024Enregistrements de la parole de patients atteints de COVID-19Ensembles de longs shows acoustiques ; analyse de la gravité de la maladie, de la qualité du sommeil, de la fatigue, de l’anxiétéMachines à vecteurs de support (SVM)0,69 (gravité de la maladie)Limité aux fonctionnalités audio ; précision modérée ; taille du jeu de données non spécifiée ; Seuls quatre aspects de santé pris en compte
Sharma, J., et al. 202025UrbanSound8K, ESC-10, ESC-50Chaînes multi-fonctionnalités : MFCC, GFCC, CQT, Chromagram ; Augmentation des données par mélangeCNN profond avec convolutions spatialement séparables et modules d’attentionUrbanSound8K : 97,52 %, ESC-10 : 94,75 %, ESC-50 : 87,45 %Non testé sur des ensembles de données non benchmark ou réels ; complexité computationnelle due à des modules CNN et d’attention plus profonds
Lella KK, et al. 202126 Sons respiratoires ; COVID-19, asthme, santé)augmentation des données ; fonctionnalités profondes utilisant le Data De-noising Auto Encoder (DDAE) au lieu du MFCCRéseau de neurones convolutionnel 1D (CNN 1D)~90 %Détails limités sur le jeu de données ; ~4 % d’amélioration par rapport à MFCC ; Généralisabilité non testée
Orlandic et al., 202127TOUSSE (25 000+ toux)MFCC, PSD, caractéristiques spectrales et temporellesXGBoostAUC 96,5 %, Précision 95,5 %COVID auto-déclaré ; Étiquettes d’experts sur sous-ensemble
Zhang et al., 202343Rapports de cas publiés d’HLH après la vaccination contre la COVID-19 (bases de données de littérature)Revue systématique ; l’agrégation des caractéristiques cliniques ; Analyse du docking moléculaireNon applicable (revue clinique)Statistiques descriptives ; Résultats cliniquesAnalyse d’événements rares ; petit échantillon ; La dépendance aux cas signalés peut entraîner un biais de signalement
Xu et al., 202344Cas rapportés de maladie VKH associée au vaccin dans la littératureExamen rétrospectif des affaires ; Analyse clinique et d’imagerie des caractéristiquesNon applicable (étude observationnelle clinique)Réponse au traitement et résultats cliniques de la récupérationNombre limité d’affaires ; absence de groupe témoin ; La relation causale ne peut pas être fermement établie
Hu et al., 202545Données mères-filiales au niveau de l’entreprise des entreprises de dispositifs médicaux SRDI en Chine (base de données Qixinbao)Analyse des réseaux sociaux ; métriques de réseaux spatiaux ; Analyse géographique des détecteursNon applicable (analyse réseau et politique)Densité du réseau, centralité, indices de diffusionConception en section transversale ; pondération égale des entreprises ; Aucun indicateur direct de performance ou de résultats cliniques

Tableau 1 : Résumé des études existantes de détection audio du COVID-19. Aperçu comparatif des approches antérieures de dépistage de la toux/audio, incluant les ensembles de données, les méthodes et les performances rapportées. Veuillez cliquer ici pour télécharger ce tableau.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Méthodologie proposée

Cette étude propose un cadre basé sur l’IA générative pour détecter la COVID-19 à partir des signaux de toux. Le cadre intègre des modèles génératifs avec des classificateurs discriminatifs, les données d’entraînement et d’évaluation étant strictement séparées. La figure 1 illustre l’architecture détaillée du cadre proposé GAN–VAE–ADCNN, montrant le flux du prétraitement audio et de l’extraction de caractéristiques jusqu’à l’apprentissage de représentations latentes via un Autoencodeur Variationnel (VAE), la génération de caractéristiques synthétiques à l’aide d’un réseau antagoniste génératif (GAN), et la classification finale via les réseaux neuronaux convolutionnels profonds (DCNN) et le DCNN basé sur l’attention (ADCNN). La figure montre que les composantes génératives ne sont utilisées que pendant l’entraînement, tandis que la classification est réalisée à l’aide de modèles discriminatifs.

figure-protocol-1
Figure 1 : Aperçu de l’architecture GAN–VAE–ADCNN. Schéma du pipeline hybride proposé, où les caractéristiques acoustiques dérivées de la tousse sont encodées à l’aide d’un VAE, augmentées par génération d’échantillons synthétiques à base de GAN, et classifiées selon les modèles DCNN et DCNN basé sur l’attention (ADCNN). Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Architecture et implémentation des modèles

Les modèles génératifs et discriminatifs utilisés dans ce cadre ont été implémentés avec des architectures fixes et reproductibles. Le GAN se compose d’un générateur avec trois couches entièrement connectées (128, 256 et 512 unités) utilisant l’activation ReLU, et d’un discriminateur avec trois couches entièrement connectées (512, 256 et 128 unités) utilisant l’activation LeakyReLU suivie d’une sortie sigmoïde.

L’encodeur VAE comprend deux couches entièrement connectées de 256 et 128 unités, suivies d’une estimation de la moyenne latente et de la variance avec une dimensionnalité latente de 64. Le décodeur reflète cette structure et est entraîné en utilisant une combinaison de perte de reconstruction et de divergence de Kullback–Leibler pour apprendre un espace latent structuré et probabiliste.

Le classificateur DCNN comprend quatre blocs convolutionnels avec des noyaux 3x3 et des filtres 32, 64, 128 et 256, respectivement. Chaque bloc est suivi d’une normalisation batch, d’une activation ReLU et d’un pooling 2x2 max. L’ADCNN étend le DCNN en incorporant un mécanisme d’attention canal par canal après le dernier bloc convolutionnel. Tous les modèles étaient optimisés à l’aide de l’optimiseur Adam avec un taux d’apprentissage de 0,0001 et une taille de lot de 32. Comme montré à la Figure 1, le VAE et le GAN ne fonctionnent que pendant la formation, tandis que le DCNN et l’ADCNN sont utilisés pour la classification. La procédure complète d’entraînement et d’évaluation est résumée dans l’Algorithme 1.

Algorithme 1 : Cadre de détection COVID-19 basé sur le GAN et le VAE

Entrée : Enregistrements audio prétraités de la toux

Sortie : Étiquette binaire de classification (COVID-19 positif/négatif)

Les procédures de formation et d’évaluation suivaient un pipeline fixe et reproductible. Tous les enregistrements audio de la toux ont été rééchantillonnés à 16 kHz, soumis à une réduction du bruit, et normalisation de l’amplitude. Les enregistrements étaient segmentés en segments de longueur fixe, d’où l’on extrayait MFCC, chroma et caractéristiques spectrales. Un total de 40 coefficients cépstraux à fréquence mélel (MFCC) ont été extraits de chaque segment audio. De plus, 12 caractéristiques de chroma ont été calculées. La représentation résultante forme un vecteur de caractéristiques en 52 dimensions pour chaque segment de toux. La séparation au niveau des sujets a été réalisée pour diviser les données en ensembles d’entraînement, de validation et de test. Le VAE a été entraîné à apprendre des représentations latentes probabilistes, et les vecteurs latents résultants ont été utilisés pour entraîner le GAN à la génération de caractéristiques synthétiques. L’ensemble de données d’entraînement a été complété à l’aide d’échantillons générés par GAN–VAE, tandis que les données synthétiques ont été exclues de la validation et des tests. Les classificateurs DCNN et ADCNN ont été entraînés sur les données d’entraînement augmentées, et l’évaluation finale a été réalisée sur l’ensemble de tests en attente à l’aide de métriques de performance standard.

Installation de formation, division des données et prévention des fuites

Toutes les expériences étaient menées avec une configuration d’entraînement fixe et reproductible. La division des données était effectuée au niveau du sujet avant la segmentation audio afin d’éviter la fuite de données. Le jeu de données était divisé en ensembles d’entraînement, de validation et de test avec un ratio de 80:10:10, garantissant que tous les segments du même enregistrement étaient assignés à un seul sous-ensemble. L’ensemble d’entraînement était utilisé pour l’apprentissage des modèles et l’augmentation générative des données, le jeu de validation pour l’ajustement des hyperparamètres et l’arrêt précoce, et l’ensemble de test était réservé pour l’évaluation finale des performances. Les échantillons synthétiques générés par le cadre GAN–VAE ont été utilisés exclusivement pendant la formation et ont été strictement exclus de la validation et des tests afin d’assurer une évaluation équitable.

Les modèles ont été entraînés pour un maximum de 100 époques, avec un arrêt précoce basé sur la perte de validation et une patience de 10 époques. L’optimisation a été réalisée à l’aide de l’optimiseur Adam avec un taux d’apprentissage de 0,0001 et une taille de lot de 32. La perte binaire d’entropie croisée a été appliquée pour la classification, tandis que la reconstruction et les pertes adversaires ont été utilisées pour entraîner respectivement les composantes VAE et GAN. Ce protocole d’entraînement et d’évaluation unifié assure la reproductibilité, évite les fuites de données et maintient une séparation stricte entre les étapes d’entraînement et d’évaluation.

Description du jeu de données

Deux ensembles de données audio pour la toux disponibles publiquement — COUGHVID et Virufy — ont été utilisés pour équilibrer la diversité acoustique à grande échelle avec des étiquettes cliniquement référencées, avec des rôles clairement séparés dans la formation et l’évaluation.

COUGHVID est une collection participative d’enregistrements de toux avec une annotation partielle d’experts et des métadonnées auto-déclarées. Pour garantir la qualité des données, 428 enregistrements ont été sélectionnés après application de critères prédéfinis de contrôle qualité, incluant la durée minimale du signal, un rapport signal/bruit adéquat, la suppression d’échantillons corrompus ou ambigus, ainsi que la présence d’événements de toux identifiables avec des métadonnées symptomatiques. Après prétraitement et segmentation, ces enregistrements ont produit 1 719 segments de toux, standardisés au format WAV à un taux d’échantillonnage de 16 kHz. COUGHVID a été utilisé pour entraîner à la fois les modèles génératifs et les classificateurs discriminatifs.

Virufy consiste en des enregistrements de toux supervisés par un médecin, étiquetés comme RT-PCR positif ou négatif pour le COVID-19. Les 16 enregistrements disponibles ont été inclus, ce qui a donné 234 segments de toux après segmentation, également standardisés à 16 kHz. Virufy était utilisé exclusivement pour l’évaluation externe de jeux de données croisées afin d’évaluer la performance de généralisation et n’était pas utilisé pour l’entraînement, l’ajustement fin ou l’augmentation générative.

Le cadre proposé doit donc être interprété comme une approche de preuve de concept évaluée dans des conditions expérimentales contrôlées, plutôt que comme un système diagnostique validé cliniquement.

Prétraitement et segmentation des données

Tous les enregistrements ont été rééchantillonnés à 16 kHz, convertis en mono, et soumis à la suppression du silence, à la réduction du bruit spectrale et à la normalisation d’amplitude. La segmentation était réalisée après la division au niveau des sujets afin d’éviter la fuite de données. Chaque enregistrement était divisé en segments de 2 à 4 s qui se chevauchent, et les segments à faible énergie ou silencieux étaient abandonnés.

Protocole de validation externe

La validation externe a été réalisée par une évaluation croisée de jeux de données. Les modèles entraînés sur COUGHVID ont été évalués sur Virufy pour validation externe. Ce protocole évalue la généralisation entre les ensembles de données collectés sous différentes conditions plutôt que la validation clinique prospective. La figure 2 offre un aperçu au niveau du protocole de ce flux de travail, illustrant l’utilisation des ensembles de données, le prétraitement, l’extraction de caractéristiques, l’entraînement des classificateurs et les scénarios d’évaluation. Alors que la Figure 1 se concentre sur l’architecture interne du modèle, la Figure 2 met l’accent sur la conception expérimentale et le flux des données à travers les étapes d’entraînement et de test.

figure-protocol-2
Figure 2 : Flux de travail du cadre proposé pour le dépistage de la toux COVID-19. Illustration de l’ensemble du pipeline de traitement, incluant le prétraitement, l’extraction de caractéristiques (MFCC, chroma, caractéristiques spectrales), l’apprentissage et l’augmentation de représentation basés sur GAN–VAE (entraînement uniquement), et la classification finale sous découpage au niveau sujet et évaluation croisée de jeux de données. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Composition des jeux de données et analyse de la répartition des classes

Après prétraitement et segmentation, les ensembles de données COUGHVID et Virufy ont montré des différences substantielles tant à l’échelle du jeu de données qu’à la densité des segments. COUGHVID a contribué à 428 des 444 enregistrements (96,4 %) et à 1 719 des 1 953 segments de toux extraits (88,0 %), confirmant ainsi son rôle de jeu de données principal pour l’entraîne...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les résultats démontrent que le cadre proposé basé sur l’IA générative peut détecter la COVID-19 à partir des signaux de toux à travers des ensembles de données hétérogènes. Comme le montrent les Tableaux 4 et 6, le modèle hybride GAN–VAE a obtenu les meilleures performances, avec une précision de 97,2 % et un AUROC de 0,953, ainsi qu’une grande précision, rappel, score F1 et spécificité, indiquant une performance équilibrée dans la classification.

<...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aucun conflit d’intérêts potentiel n’a été signalé par l’auteur(s).

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nous exprimons notre sincère gratitude aux enseignants et aux mentors de recherche de l’École d’informatique et d’ingénierie pour leurs précieux conseils, leur soutien continu et leurs retours constructifs lors de la préparation de cet article.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Jeu de données COUGHVID& Eacute ; Cole Polytechnique Fé ; dé ; Rale de Lausanne (EPFL)Sortie publique (2021)Jeu de données audio de toux participatif avec métadonnées auto-déclarées et annotation partielle du médecin ; utilisé principalement pour l’entraînement et l’augmentation des données.
Boîte à outils CUDANVIDIA11.3Cadre d’accélération GPU utilisé pour accélérer l’entraînement et l’inférence du modèle.
LibROSAOpen Source0.9Bibliothèque d’analyse audio utilisée pour le rééchantillonnage, la segmentation, l’extraction MFCC et le calcul de caractéristiques spectrales.
Système d’exploitation LinuxCanoniqueUbuntu 20.04 LTSSystème d’exploitation utilisé pour toutes les expériences et l’entraînement des modèles.
MatplotlibOpen Source3.5Bibliothèque de visualisation utilisée pour tracer les distributions de jeux de données et les résultats d’évaluation.
NumPyOpen Source1.21Bibliothèque de calcul numérique utilisée pour la manipulation de réseaux et les opérations de traitement du signal.
NVIDIA GPUNVIDIAClasse Tesla / RTXUnité de traitement graphique utilisée pour entraîner des modèles profonds et génératifs.
Langage de programmation PythonFondation Python Software3.8Environnement de programmation de base utilisé pour le prétraitement des données, l’extraction de fonctionnalités, le développement de modèles et l’évaluation.
PyTorchMeta (recherche sur l’IA sur Facebook)1.12Cadre d’apprentissage profond utilisé pour implémenter des modèles GAN, VAE, DCNN et DCNN basés sur l’attention.
Scikit-learnOpen Source1Bibliothèque d’apprentissage automatique utilisée pour la division des données, la pondération des classes et le calcul de métriques de performance.
SciPyOpen Source1.7Bibliothèque de calcul scientifique utilisée pour le prétraitement audio et la transformation de signaux.
Virufy DatasetVirufySortie publique (2021)Des enregistrements cliniques de toux recueillis par RT-PCR et ndash ; les labels COVID-19 vérifiés ; utilisé exclusivement pour la validation externe et l’évaluation croisée de jeux de données.

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Analyse audio de la touxEnregistrements sonores de la touxCepstre fr quence MelAutoencodeurs variationnelsR seaux antagonistes g n ratifsR seaux convolutifs profondsSurveillance acoustique de la santD bruitage du signal

Articles connexes