Artículo de investigación

Un marco basado en IA generativa para el cribado de COVID-19 a partir de señales de audio de tos

DOI:

10.3791/69874

10 de marzo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio propone un marco basado en IA generativa que integra GANs, VAEs y redes convolucionales profundas basadas en la atención para detectar la COVID-19 a partir de señales de audio de tos, mejorando la robustez, el equilibrio de datos y la generalización entre conjuntos de datos para un cribado escalable y no invasivo.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El análisis de audio de tos proporciona una vía práctica para desarrollar herramientas automatizadas que apoyen el cribado de la enfermedad COVID-19. A pesar del creciente interés, muchos enfoques existentes siguen siendo sensibles al ruido, el desequilibrio de clases y la variabilidad del conjunto de datos, limitando su reproducibilidad. Este trabajo presenta una metodología estructurada impulsada por inteligencia artificial generativa para la detección de la COVID-19 utilizando grabaciones de sonido de tos. Los experimentos se realizan utilizando dos conjuntos de datos de acceso público, COUGHVID y Virufy, ambos compuestos por muestras de tos etiquetadas. El protocolo propuesto consta de etapas de preprocesamiento secuencial, incluyendo segmentación de tos, reducción de ruido y normalización de señales. Las características acústicas se capturan a través de coeficientes cepstrales de frecuencia Mel, descriptores de cromancia y características de contraste espectral. Para mejorar el aprendizaje de representaciones y mitigar el desequilibrio de datos, se emplea un marco generativo híbrido que integra Autoencoders variacionales y redes generativas adversariales para sintetizar muestras a nivel de características. La clasificación se realiza posteriormente utilizando Redes Neuronales Convolucionales Profundas y modelos DCNN basados en atención. La evaluación del rendimiento indica que incorporar aumentos generativos mejora de forma consistente respecto a las líneas base no generativas, alcanzando una precisión máxima de clasificación del 97,2% y un AUROC de 0,953 en los conjuntos de datos evaluados. Estos resultados demuestran la eficacia de la modelización generativa para mejorar la detección de la COVID-19 basada en la tos y establecen una línea analítica reproducible para futuras investigaciones en monitorización acústica de la salud.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La acústica respiratoria se ha explorado cada vez más como una fuente no invasiva de información para la evaluación de la salud, especialmente en el contexto de enfermedades infecciosas y pulmonares. Los avances en el procesamiento de señales e inteligencia artificial (IA) han permitido el análisis automatizado de sonidos de tos y respiración, apoyando su uso como biomarcadores digitales. Estudios recientes demuestran que los sonidos respiratorios captados con micrófonos integrados en smartphones, dispositivos portátiles o sensores clínicos pueden analizarse eficazmente utilizando modelos de aprendizaje profundo para detectar la infección porCOVID-19 1,5. Estos avances ponen de manifiesto el potencial del cribado basado en audio como un complemento rápido, sin contacto y escalable a los procedimientos diagnósticos convencionales. La enfermedad por coronavirus 2019 (COVID-19), causada por el virus SARS-CoV-2, afecta principalmente al sistema respiratorio e induce cambios medibles en la dinámica del flujo de aire, la función pulmonar y el comportamiento del tracto vocal. Aunque la prueba de transcripción inversa–reacción en cadena de la polimerasa (RT-PCR) sigue siendo el estándar de referencia para el diagnóstico, sus limitaciones logísticas y el tiempo de respuesta tardía limitan su idoneidad para un cribado a gran escala o continuo, lo que motiva la exploración de enfoques alternativos basados en el análisis del sonido respiratorio.

Un creciente cuerpo de literatura ha investigado la detección de COVID-19 impulsada por IA mediante señales de tos, respiración y habla. Como se resume en la Tabla 1, estudios previos han explorado conjuntos de datos diversos, representaciones de características acústicas (por ejemplo, MFCC, STFT, características basadas en espectrogramas) y paradigmas de aprendizaje que van desde modelos clásicos de aprendizaje automático hasta arquitecturas profundas convolucionales, recurrentes, basadas en la atención ytransformadoras 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45 . Varios trabajos han demostrado un rendimiento prometedor en el cribado utilizando audio respiratorio recopilado por crowdsourcing y clínicamente. En cambio, otros han enfatizado la importancia del aprendizaje por transferencia, la ampliación de datos y la IA explicable para mejorar la robustez y la fiabilidad. En lugar de repetir una discusión detallada estudio por estudio, la Tabla 1 ofrece una visión comparativa consolidada de estos enfoques representativos, permitiendo la comparación directa de conjuntos de datos, metodologías y resultados reportados.

A pesar de estos avances, varias limitaciones dificultan la robustez y aplicabilidad real de los enfoques existentes. Los conjuntos de datos de audio respiratorio se recopilan frecuentemente bajo condiciones de grabación heterogéneas, lo que conduce a una variabilidad considerable entre dispositivos, entornos acústicos y poblaciones de sujetos 2,3,4. Muchos conjuntos de datos disponibles públicamente dependen del estado de COVID-19 auto-reportado, lo que introduce incertidumbre en la fiabilidad de la etiqueta7. Además, el pronunciado desequilibrio de clases y la disponibilidad limitada de muestras validadas clínicamente restringen la capacidad de generalización de modelos discriminativos entrenados únicamente con datosobservados 4,5. En consecuencia, el rendimiento del modelo reportado en entornos experimentales controlados no se traduce de forma consistente en un despliegue fiable en diversos escenarios reales.

En conjunto, estas limitaciones ponen de manifiesto una brecha crítica en la investigación: la ausencia de un marco unificado que aborde simultáneamente la escasez de datos, el desequilibrio de clases y la generalización robusta entre conjuntos de datos heterogéneos. Aunque se han explorado modelos generativos como las Redes Generativas Adversariales (GANs) y los Autoencoders Variacionales (VAEs) para aprender representaciones latentes y sintetizar señales biomédicasrealistas 6,7, los estudios existentes suelen emplear estos modelos de forma independiente y evaluarlos dentro de un único conjunto de datos. Además, su integración con arquitecturas convolucionales mejoradas por atención y su evaluación bajo condiciones de conjunto de datos cruzados sigue siendo insuficientemente investigada.

Para abordar esta brecha, el presente estudio propone un marco generativo asistido por IA para la detección de COVID-19 a partir de sonidos de tos que integra la extracción de características acústicas con un modelo híbrido GAN–VAE y redes neuronales profundas convolucionales basadas en la atención (DCNNs). El componente generativo mitiga el desequilibrio de clases y la disponibilidad limitada de muestras mediante aprendizaje estructurado de representaciones latentes y generación de datos sintéticos, mientras que los modelos discriminativos mejoran la robustez de la clasificación entre conjuntos de datos heterogéneos. A diferencia de trabajos anteriores que se basan predominantemente en la validación dentro del conjunto de datos, el marco propuesto se evalúa mediante pruebas cruzadas de conjuntos de datos sobre un conjunto de datos independiente, lo que permite una evaluación más rigurosa del rendimiento de generalización. El marco está pensado como un enfoque orientado al cribado más que como una herramienta diagnóstica independiente, y su diseño tiene en cuenta explícitamente la variabilidad del registro y la incertidumbre de etiquetas para apoyar un despliegue reproducible y fiable.

En este contexto, las contribuciones novedosas del presente estudio son tres. En primer lugar, un marco generativo híbrido unificado GAN–VAE está integrado con clasificadores DCNN basados en la atención para abordar conjuntamente el desequilibrio de clases, la disponibilidad limitada de datos y el aprendizaje robusto de representación de características en el cribado de COVID-19 basado en la tos. En segundo lugar, el enfoque propuesto se evalúa sistemáticamente mediante validación cruzada de conjuntos de datos, proporcionando una evaluación más realista de la generalización del modelo en comparación con las pruebas convencionales dentro del conjunto de datos. En tercer lugar, el estudio presenta un análisis detallado del impacto de la ampliación generativa bajo condiciones de registro heterogéneas, posicionando así el marco como una prueba de concepto reproducible para un cribado escalable y práctico de la COVID-19.

Autor(es) y añoConjunto de datosTécnicas / Características utilizadasModelo / ClasificadorPrecisión / MétricasLimitaciones / Notas
Imran et al., 20208Conjunto de datos de tos colaborativo (AI4COVID-19)MFCC, aprendizaje por transferencia, características conscientes del dominioMulticlasificador averso al riesgo (DL + ML ensemble)Precisión: 92,6%Depende de la calidad de la tos; Validación clínica limitada
Brown et al., 20209Sonidos respiratorios colaborativos (>7.000 usuarios)Funciones de audio artesanales, incrustaciones tipo VGGModelos de aprendizaje automático superficialesAUC > 80%Ruido de etiquetas en datos colaborativos
Laguarta et al., 202010Conjunto de datos MIT Open Voice (5.320 sujetos)MFCC, biomarcadores acústicosCNN (ResNet50, aprendizaje por transferencia)Sensibilidad: 98,5%, Especificidad: 94,2%Requiere un gran conjunto de datos de preentrenamiento
Quartieri et al., 202011Entrevistas de discurso (5 asignaturas, antes/después del COVID)Intensidad respiratoria, F0, CPP, formantesAnálisis estadístico-tamaño de efectolograr un AUC superior al 80% en todas las tareasTamaño de muestra muy pequeño
Hassan et al., 202012Sonidos respiratoriosCaracterísticas del habla temporalRNNTos: 97%, respiración: 98,2%, voz: 88,2%Falta de estadísticas detalladas de los conjuntos de datos
Khamparia et al., 201913ESC-10, ESC-50Características basadas en imágenes de espectrogramasCNN, TDSNCNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10)Solo sonidos ambientales; Menor rendimiento en conjuntos de datos complejos
Aykanat et al., 20171417.930 sonidos pulmonares de 1.630 sujetos (estetoscopio electrónico)Características MFCC, imágenes de espectrogramasSVM, CNNCNN/SVM: 86% (sano vs patológico), 76%/75% (rale–rhonchus–normal), 80%/80% (tipo único), 62%/62% (todos los tipos)Requiere hardware especializado; no específico de la enfermedad
Ponomarchuk et al., 202215Coswara, VirufyMFCC, mel-espectrograma, características de waveletCNN, RNN, modelos de conjuntoAUC: 0,93 (interno), 0,79 (externo)La generalización entre conjuntos de datos sigue siendo un reto
Feng et al., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNPrecisión 81,25% (AUC de 0,79)Rendimiento dependiente del conjunto de datos
Islam et al., 202217Registros clínicos de tosCaracterísticas espectrales y tiempo-frecuenciaRedes neuronales profundasPrecisión: 89,2%Conjunto de datos limitado
Manshouri,2022 18VirufyCaracterísticas de análisis espectralClasificadores clásicos de aprendizaje automáticoPrecisión: 95,86%Estudio experimental a pequeña escala
Huang et al., 202019Sonidos pulmonares de 10 pacientes con COVID-19Análisis de sonidos respiratorios tiempo-frecuenciaAnálisis clínico especializadoValidación cualitativaConjunto de datos pequeño; No hay modelo de aprendizaje automático
W. D. Puja et al., 202420Coswara, Virufy (conjuntos de datos de sonidos para la tos)STFT, espectrograma Mel, MFCC, energía RMS, ancho de banda espectral, centroide espectral, reducción espectral, ZCR; Extracción profunda de características basada en CNNCNN 1D (extractor de características) + Bosque AleatorioPrecisión: 93%El rendimiento depende de la calidad de la tos; diseñada para el cribado más que para el diagnóstico clínico; Variabilidad de datos por crowdsourcing
Chadaga et al., 202321Grabaciones de audio colaborativas de tosMel-espectrograma y características acústicas tiempo-frecuenciaRed Neuronal Convolucional (CNN)Precisión: 84%, Precisión: 85%, Recordación: 84%, F1-puntuación: 84%El rendimiento está limitado por el desequilibrio de datos, las etiquetas auto-informadas y la sensibilidad a las condiciones de registro
Chadaga et al., 202322Marcadores clínicos de COVID-19 leve a moderado y otras enfermedades respiratoriasSelección de características (Pearson, PSO); Marcadores clave: Eosinófilos, Albúmina, T. Bilirrubina, ALP, ALT, AST, HbA1c, TWBCConjunto apilado; 1D CNN, LSTM, DNN, MLP RESIDUALPrecisión: 89%Excluyendo casos graves; alternativa a RT-PCR; IA explicable aplicada
Dar et al. 202423Conjunto de datos COVID-19Optimización SJHBO (Jaya+HBO+SO), muchas características espectralesRed Q Profunda (DQN)Precisión: 95,11%, Sensibilidad: 95,06%, Especificidad: 94,69%Alta complejidad; El ajuste se mejora mediante un optimizador híbrido
Jing Quian et al 202024Grabaciones de voz de pacientes con COVID-19Conjuntos de largometrajes acústicos; análisis de la gravedad de la enfermedad, calidad del sueño, fatiga, ansiedadMáquinas de Vectores de Soporte (SVM)0,69 (gravedad de la enfermedad)Limitado a funciones de audio; precisión moderada; tamaño del conjunto de datos no especificado; Solo se consideran cuatro aspectos de salud
Sharma, J., et al. 202025UrbanSound8K, ESC-10, ESC-50Canales multifuncional: MFCC, GFCC, CQT, Chromagram; Aumento de datos por mezclaCNN profundo con convoluciones y módulos de atención espacialmente separablesUrbanSound8K: 97,52%, ESC-10: 94,75%, ESC-50: 87,45%No se ha probado en conjuntos de datos no de referencia o del mundo real; complejidad computacional debida a módulos de CNN y atención más profundos
Lella KK, et al. 202126 Sonidos respiratorios; COVID-19, asma, saludable)aumento de datos; características profundas usando el codificador automático de reducción de ruido de datos (DDAE) en lugar de MFCCRed Neuronal Convolucional 1D (CNN 1D)~90%Detalles limitados del conjunto de datos; ~4% de mejora respecto a MFCC; Generalidad no probada
Orlandic et al., 202127TOSVID (25k+ tos)MFCCs, PSD, espectrales y temporalesXGBoostAUC 96,5%, Precisión 95,5%COVID autodeclarado; Etiquetas expertas en subconjunto
Zhang et al., 202343Informes de casos publicados de HLH tras la vacunación contra la COVID-19 (bases de datos de la literatura)Revisión sistemática; agregación de características clínicas; Análisis de acoplamiento molecularNo aplicable (revisión clínica)Estadística descriptiva; Resultados clínicosAnálisis de eventos raros; tamaño de muestra pequeño; La dependencia de casos reportados puede introducir sesgo en la notificación
Xu et al., 202344Casos reportados de enfermedad VKH asociada a vacunas en la literaturaRevisión retrospectiva del caso; Análisis de características clínicas e imagenísticasNo aplicable (estudio observacional clínico)Respuesta al tratamiento y resultados clínicos de recuperaciónNúmero limitado de casos; la falta de grupo de control; La relación causal no puede establecerse con firmeza
Hu et al., 202545Datos matriz-subsidiaria a nivel de empresa de empresas de dispositivos médicos SRDI en China (base de datos Qixinbao)Análisis de redes sociales; métricas de redes espaciales; Análisis geográfico del detectorNo aplicable (análisis de redes y políticas)Índice de densidad de red, centralidad, difusiónDiseño en sección transversal; ponderación igual de las empresas; No hay métricas directas de rendimiento ni de resultados clínicos

Tabla 1: Resumen de los estudios existentes de detección basada en audio de COVID-19. Visión comparativa de enfoques previos de cribado de tos/audio, incluyendo conjuntos de datos, métodos y rendimiento reportado. Por favor, haz clic aquí para descargar esta tabla.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Metodología propuesta

Este estudio propone un marco basado en IA generativa para detectar la COVID-19 a partir de señales de tos. El marco integra modelos generativos con clasificadores discriminativos, manteniendo los datos de entrenamiento y evaluación estrictamente separados. La Figura 1 ilustra la arquitectura detallada del marco propuesto GAN–VAE–ADCNN, mostrando el flujo desde el preprocesamiento de audio y la extracción de características hasta el aprendizaje de representaciones latentes mediante un Autoencoder Variacional (VAE), la generación de características sintéticas usando una Red Generativa Adversarial (GAN), y la clasificación final usando Redes Neuronales Convolucionales Profundas (DCNN) y DCNN basada en la atención (ADCNN). La figura muestra que los componentes generativos se usan solo durante el entrenamiento, mientras que la clasificación se realiza mediante modelos discriminativos.

figure-protocol-1
Figura 1: Visión general de la arquitectura GAN–VAE–ADCNN. Esquema de la tubería híbrida propuesta, donde las características acústicas derivadas de la tos se codifican usando un VAE, se aumentan mediante generación de muestras sintéticas basadas en GAN y se clasifican usando modelos DCNN y DCNN basado en atención (ADCNN). Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Arquitectura e implementación del modelo

Los modelos generativos y discriminativos utilizados en este marco se implementaron con arquitecturas fijas y reproducibles. El GAN consta de un generador con tres capas totalmente conectadas (128, 256 y 512 unidades) que utiliza activación ReLU, y un discriminador con tres capas totalmente conectadas (512, 256 y 128 unidades) que utiliza activación LeakyReLU seguida de una salida sigmoide.

El codificador VAE comprende dos capas completamente conectadas con 256 y 128 unidades, seguidas de estimación de media latente y varianza con una dimensionalidad latente de 64. El decodificador refleja esta estructura y se entrena usando una combinación de pérdida por reconstrucción y divergencia de Kullback–Leibler para aprender un espacio latente estructurado y probabilístico.

El clasificador DCNN incluye cuatro bloques convolucionales con núcleos 3x3 y 32, 64, 128 y 256 filtros, respectivamente. A cada bloque le sigue la normalización por lotes, la activación de ReLU y el agrupamiento máximo 2x2. El ADCNN amplía la DCNN incorporando un mecanismo de atención canal a canal tras el bloque convolucional final. Todos los modelos se optimizaron usando el optimizador Adam con una tasa de aprendizaje de 0,0001 y un tamaño de lote de 32. Como se muestra en la Figura 1, el VAE y el GAN solo operan durante el entrenamiento, mientras que el DCNN y el ADCNN se utilizan para la clasificación. El procedimiento completo de entrenamiento y evaluación se resume en el Algoritmo 1.

Algoritmo 1: Marco de detección de COVID-19 basado en GAN–VAE

Entrada: Grabaciones de audio preprocesadas para la tos

Salida: Etiqueta binaria de clasificación (COVID-19 positivo/negativo)

Los procedimientos de formación y evaluación seguían una cadena fija y reproducible. Todas las grabaciones de audio de tos se remuestrearon a 16 kHz, se sometieron a reducción de ruido y se normalizaron la amplitud. Las grabaciones se segmentaron en segmentos de longitud fija, de los cuales se extrajeron MFCC, croma y características espectrales. Se extrajeron un total de 40 coeficientes cepstrales de frecuencia melídica (MFCC) de cada segmento de audio. Además, se calcularon 12 características de croma. La representación resultante forma un vector de características de 52 dimensiones para cada segmento de tos. Se realizó división a nivel de sujeto para dividir los datos en conjuntos de entrenamiento, validación y prueba. El VAE fue entrenado para aprender representaciones latentes probabilísticas, y los vectores latentes resultantes se utilizaron para entrenar el GAN para la generación de características sintéticas. El conjunto de datos de entrenamiento se amplió utilizando muestras generadas por GAN–VAE, mientras que los datos sintéticos se excluyeron de la validación y prueba. Los clasificadores DCNN y ADCNN se entrenaron con los datos de entrenamiento aumentados, y la evaluación final se realizó sobre el conjunto de pruebas extendido utilizando métricas estándar de rendimiento.

Configuración de entrenamiento, división de datos y prevención de fugas

Todos los experimentos se realizaron con una configuración de entrenamiento fija y reproducible. La división de datos se realizaba a nivel de sujeto antes de la segmentación de audio para evitar fugas de datos. El conjunto de datos se dividió en conjuntos de entrenamiento, validación y prueba con una proporción de 80:10:10, asegurando que todos los segmentos de la misma grabación se asignaran a un único subconjunto. El conjunto de entrenamiento se utilizó para el aprendizaje de modelos y la ampliación generativa de datos, el conjunto de validación para la optimización de hiperparámetros y la parada temprana, y el conjunto de prueba se mantuvo para la evaluación final del rendimiento. Las muestras sintéticas generadas por el marco GAN–VAE se utilizaron exclusivamente durante la formación y se excluyeron estrictamente de la validación y prueba para garantizar una evaluación justa.

Los modelos se entrenaron durante un máximo de 100 épocas, con una parada temprana basada en la pérdida de validación y una paciencia de 10 épocas. La optimización se realizó utilizando el optimizador Adam con una tasa de aprendizaje de 0,0001 y un tamaño de lote de 32. Se aplicó la pérdida binaria de entropía cruzada para la clasificación, mientras que la reconstrucción y las pérdidas adversariales se emplearon para entrenar los componentes VAE y GAN, respectivamente. Este protocolo unificado de entrenamiento y evaluación garantiza la reproducibilidad, previene fugas de datos y mantiene una estricta separación entre las etapas de entrenamiento y evaluación.

Descripción del conjunto de datos

Se utilizaron dos conjuntos de datos de audio para la tos disponibles públicamente—COUGHVID y Virufy—para equilibrar la diversidad acústica a gran escala con etiquetas referenciadas clínicamente, con roles claramente separados en la formación y la evaluación.

COUGHVID es una colección colaborativa de grabaciones de tos con anotación parcial de expertos y metadatos autoinformados. Para garantizar la calidad de los datos, se seleccionaron 428 grabaciones tras aplicar criterios predefinidos de control de calidad, incluyendo duración mínima de la señal, relación señal-ruido adecuada, eliminación de muestras corruptas o ambiguas y la presencia de eventos de tos identificables con metadatos de síntomas. Tras el preprocesamiento y la segmentación, estas grabaciones produjeron 1.719 segmentos de tos, estandarizados a formato WAV a una frecuencia de muestreo de 16 kHz. COUGHVID se utilizó para entrenar tanto los modelos generativos como los clasificadores discriminativos.

Virufy consiste en grabaciones de tos supervisadas por un médico etiquetadas como RT-PCR positivas o negativas para COVID-19. Se incluyeron las 16 grabaciones disponibles, resultando en 234 segmentos de tos tras la segmentación, también estandarizados a 16 kHz. Virufy se utilizó exclusivamente para la evaluación externa de conjuntos de datos para evaluar el rendimiento de generalización y no se empleó para entrenamiento, ajuste fino ni aumento generativo.

Por tanto, el marco propuesto debe interpretarse como un enfoque de prueba de concepto evaluado bajo condiciones experimentales controladas, en lugar de como un sistema diagnóstico clínicamente validado.

Preprocesamiento y segmentación de datos

Todas las grabaciones se remuestrearon a 16 kHz, se convirtieron a mono y se sometieron a eliminación de silencios, reducción de ruido espectral y normalización de amplitud. La segmentación se realizaba tras la división a nivel de sujeto para evitar fugas de datos. Cada grabación se dividía en segmentos superpuestos de 2 a 4 s, y los segmentos de baja energía o silenciosos se descartaban.

Protocolo de Validación Externa

La validación externa se realizó mediante evaluación entre conjuntos de datos. Los modelos entrenados con COUGHVID fueron evaluados en Virufy para validación externa. Este protocolo evalúa la generalización entre conjuntos de datos recogidos bajo diferentes condiciones en lugar de la validación clínica prospectiva. La Figura 2 ofrece una visión general a nivel de protocolo de este flujo de trabajo, ilustrando el uso de conjuntos de datos, preprocesamiento, extracción de características, entrenamiento de clasificadores y escenarios de evaluación. Mientras que la Figura 1 se centra en la arquitectura interna del modelo, la Figura 2 enfatiza el diseño experimental y el flujo de datos a través de las etapas de entrenamiento y prueba.

figure-protocol-2
Figura 2: Flujo de trabajo del marco propuesto para el cribado de tos por COVID-19. Ilustración de toda la cadena de procesamiento, incluyendo preprocesamiento, extracción de características (MFCC, croma, características espectrales), aprendizaje y aumento de representaciones basadas en GAN–VAE (solo entrenamiento), y clasificación final bajo división a nivel de sujeto y evaluación entre conjuntos de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Composición de conjuntos de datos y análisis de distribución por clases

Tras el preprocesamiento y la segmentación, los conjuntos de datos COUGHVID y Virufy mostraron diferencias sustanciales tanto en la escala del conjunto como en la densidad de segmentos. COUGHVID aportó 428 de 444 registros (96,4%) y 1.719 de 1.953 segmentos de tos extraídos (88,0%), confirmando su papel como el conjunto de datos principal para el entrenamiento de modelos y...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los resultados demuestran que el marco propuesto basado en IA generativa puede detectar la COVID-19 a partir de señales de tos a través de conjuntos de datos heterogéneos. Como se muestra en las Tablas 4 y 6, el modelo híbrido GAN–VAE logró el mejor rendimiento, con un 97,2% de precisión y un AUROC de 0,953, junto con alta precisión, recuerdo, puntuación F1 y especificidad, lo que indica un rendimiento equilibrado en la clasificación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

No se informó de ningún posible conflicto de intereses por parte del(los) autor(es).

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Expresamos nuestro sincero agradecimiento al profesorado y a los mentores de investigación de la Escuela de Ciencias de la Computación e Ingeniería por su valiosa orientación, apoyo continuo y comentarios constructivos durante la preparación de este artículo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos COUGHVIDÉ Cole Polytechnique Fé dé Rale de Lausanne (EPFL)Lanzamiento público (2021)Conjunto de datos de audio de tos realizado por crowdsourcing con metadatos autoinformados y anotación parcial del médico; Utilizado principalmente para entrenamiento y aumento de datos.
Kit de herramientas CUDANVIDIA11.3Marco de aceleración de GPU utilizado para acelerar el entrenamiento y la inferencia del modelo.
LibROSACódigo abierto0.9Biblioteca de análisis de audio utilizada para remuestreo, segmentación, extracción MFCC y cálculo de características espectrales.
Sistema operativo LinuxCanónicoUbuntu 20.04 LTSSistema operativo utilizado para todos los experimentos y entrenamiento de modelos.
MatplotlibCódigo abierto3.5Biblioteca de visualización utilizada para graficar distribuciones de conjuntos de datos y resultados de evaluación.
NumPyCódigo abierto1.21Biblioteca de computación numérica utilizada para manipulación de matrices y operaciones de procesamiento de señales.
NVIDIA GPUNVIDIAClase Tesla / RTXUnidad de procesamiento gráfico utilizada para entrenar modelos profundos y generativos.
Lenguaje de programación PythonFundación de Software Python3.8Entorno de programación central utilizado para el preprocesamiento de datos, extracción de características, desarrollo de modelos y evaluación.
PyTorchMeta (Investigación de IA en Facebook)1.12Marco de aprendizaje profundo utilizado para implementar modelos GAN, VAE, DCNN y DCNN basados en la atención.
Scikit-learnCódigo abierto1Biblioteca de aprendizaje automático utilizada para la división de datos, ponderación de clases y cálculo de métricas de rendimiento.
SciPyCódigo abierto1.7Biblioteca de computación científica utilizada para preprocesamiento de audio y transformaciones de señales.
Conjunto de datos VirufyVirufyLanzamiento público (2021)Registros clínicos de tos recogidos con RT-PCR y dash; etiquetas verificadas de COVID-19; se utiliza exclusivamente para validación externa y evaluación entre conjuntos de datos.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

Artículos relacionados