$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Metodología propuesta
Este estudio propone un marco basado en IA generativa para detectar la COVID-19 a partir de señales de tos. El marco integra modelos generativos con clasificadores discriminativos, manteniendo los datos de entrenamiento y evaluación estrictamente separados. La Figura 1 ilustra la arquitectura detallada del marco propuesto GAN–VAE–ADCNN, mostrando el flujo desde el preprocesamiento de audio y la extracción de características hasta el aprendizaje de representaciones latentes mediante un Autoencoder Variacional (VAE), la generación de características sintéticas usando una Red Generativa Adversarial (GAN), y la clasificación final usando Redes Neuronales Convolucionales Profundas (DCNN) y DCNN basada en la atención (ADCNN). La figura muestra que los componentes generativos se usan solo durante el entrenamiento, mientras que la clasificación se realiza mediante modelos discriminativos.

Figura 1: Visión general de la arquitectura GAN–VAE–ADCNN. Esquema de la tubería híbrida propuesta, donde las características acústicas derivadas de la tos se codifican usando un VAE, se aumentan mediante generación de muestras sintéticas basadas en GAN y se clasifican usando modelos DCNN y DCNN basado en atención (ADCNN). Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Arquitectura e implementación del modelo
Los modelos generativos y discriminativos utilizados en este marco se implementaron con arquitecturas fijas y reproducibles. El GAN consta de un generador con tres capas totalmente conectadas (128, 256 y 512 unidades) que utiliza activación ReLU, y un discriminador con tres capas totalmente conectadas (512, 256 y 128 unidades) que utiliza activación LeakyReLU seguida de una salida sigmoide.
El codificador VAE comprende dos capas completamente conectadas con 256 y 128 unidades, seguidas de estimación de media latente y varianza con una dimensionalidad latente de 64. El decodificador refleja esta estructura y se entrena usando una combinación de pérdida por reconstrucción y divergencia de Kullback–Leibler para aprender un espacio latente estructurado y probabilístico.
El clasificador DCNN incluye cuatro bloques convolucionales con núcleos 3x3 y 32, 64, 128 y 256 filtros, respectivamente. A cada bloque le sigue la normalización por lotes, la activación de ReLU y el agrupamiento máximo 2x2. El ADCNN amplía la DCNN incorporando un mecanismo de atención canal a canal tras el bloque convolucional final. Todos los modelos se optimizaron usando el optimizador Adam con una tasa de aprendizaje de 0,0001 y un tamaño de lote de 32. Como se muestra en la Figura 1, el VAE y el GAN solo operan durante el entrenamiento, mientras que el DCNN y el ADCNN se utilizan para la clasificación. El procedimiento completo de entrenamiento y evaluación se resume en el Algoritmo 1.
Algoritmo 1: Marco de detección de COVID-19 basado en GAN–VAE
Entrada: Grabaciones de audio preprocesadas para la tos
Salida: Etiqueta binaria de clasificación (COVID-19 positivo/negativo)
Los procedimientos de formación y evaluación seguían una cadena fija y reproducible. Todas las grabaciones de audio de tos se remuestrearon a 16 kHz, se sometieron a reducción de ruido y se normalizaron la amplitud. Las grabaciones se segmentaron en segmentos de longitud fija, de los cuales se extrajeron MFCC, croma y características espectrales. Se extrajeron un total de 40 coeficientes cepstrales de frecuencia melídica (MFCC) de cada segmento de audio. Además, se calcularon 12 características de croma. La representación resultante forma un vector de características de 52 dimensiones para cada segmento de tos. Se realizó división a nivel de sujeto para dividir los datos en conjuntos de entrenamiento, validación y prueba. El VAE fue entrenado para aprender representaciones latentes probabilísticas, y los vectores latentes resultantes se utilizaron para entrenar el GAN para la generación de características sintéticas. El conjunto de datos de entrenamiento se amplió utilizando muestras generadas por GAN–VAE, mientras que los datos sintéticos se excluyeron de la validación y prueba. Los clasificadores DCNN y ADCNN se entrenaron con los datos de entrenamiento aumentados, y la evaluación final se realizó sobre el conjunto de pruebas extendido utilizando métricas estándar de rendimiento.
Configuración de entrenamiento, división de datos y prevención de fugas
Todos los experimentos se realizaron con una configuración de entrenamiento fija y reproducible. La división de datos se realizaba a nivel de sujeto antes de la segmentación de audio para evitar fugas de datos. El conjunto de datos se dividió en conjuntos de entrenamiento, validación y prueba con una proporción de 80:10:10, asegurando que todos los segmentos de la misma grabación se asignaran a un único subconjunto. El conjunto de entrenamiento se utilizó para el aprendizaje de modelos y la ampliación generativa de datos, el conjunto de validación para la optimización de hiperparámetros y la parada temprana, y el conjunto de prueba se mantuvo para la evaluación final del rendimiento. Las muestras sintéticas generadas por el marco GAN–VAE se utilizaron exclusivamente durante la formación y se excluyeron estrictamente de la validación y prueba para garantizar una evaluación justa.
Los modelos se entrenaron durante un máximo de 100 épocas, con una parada temprana basada en la pérdida de validación y una paciencia de 10 épocas. La optimización se realizó utilizando el optimizador Adam con una tasa de aprendizaje de 0,0001 y un tamaño de lote de 32. Se aplicó la pérdida binaria de entropía cruzada para la clasificación, mientras que la reconstrucción y las pérdidas adversariales se emplearon para entrenar los componentes VAE y GAN, respectivamente. Este protocolo unificado de entrenamiento y evaluación garantiza la reproducibilidad, previene fugas de datos y mantiene una estricta separación entre las etapas de entrenamiento y evaluación.
Descripción del conjunto de datos
Se utilizaron dos conjuntos de datos de audio para la tos disponibles públicamente—COUGHVID y Virufy—para equilibrar la diversidad acústica a gran escala con etiquetas referenciadas clínicamente, con roles claramente separados en la formación y la evaluación.
COUGHVID es una colección colaborativa de grabaciones de tos con anotación parcial de expertos y metadatos autoinformados. Para garantizar la calidad de los datos, se seleccionaron 428 grabaciones tras aplicar criterios predefinidos de control de calidad, incluyendo duración mínima de la señal, relación señal-ruido adecuada, eliminación de muestras corruptas o ambiguas y la presencia de eventos de tos identificables con metadatos de síntomas. Tras el preprocesamiento y la segmentación, estas grabaciones produjeron 1.719 segmentos de tos, estandarizados a formato WAV a una frecuencia de muestreo de 16 kHz. COUGHVID se utilizó para entrenar tanto los modelos generativos como los clasificadores discriminativos.
Virufy consiste en grabaciones de tos supervisadas por un médico etiquetadas como RT-PCR positivas o negativas para COVID-19. Se incluyeron las 16 grabaciones disponibles, resultando en 234 segmentos de tos tras la segmentación, también estandarizados a 16 kHz. Virufy se utilizó exclusivamente para la evaluación externa de conjuntos de datos para evaluar el rendimiento de generalización y no se empleó para entrenamiento, ajuste fino ni aumento generativo.
Por tanto, el marco propuesto debe interpretarse como un enfoque de prueba de concepto evaluado bajo condiciones experimentales controladas, en lugar de como un sistema diagnóstico clínicamente validado.
Preprocesamiento y segmentación de datos
Todas las grabaciones se remuestrearon a 16 kHz, se convirtieron a mono y se sometieron a eliminación de silencios, reducción de ruido espectral y normalización de amplitud. La segmentación se realizaba tras la división a nivel de sujeto para evitar fugas de datos. Cada grabación se dividía en segmentos superpuestos de 2 a 4 s, y los segmentos de baja energía o silenciosos se descartaban.
Protocolo de Validación Externa
La validación externa se realizó mediante evaluación entre conjuntos de datos. Los modelos entrenados con COUGHVID fueron evaluados en Virufy para validación externa. Este protocolo evalúa la generalización entre conjuntos de datos recogidos bajo diferentes condiciones en lugar de la validación clínica prospectiva. La Figura 2 ofrece una visión general a nivel de protocolo de este flujo de trabajo, ilustrando el uso de conjuntos de datos, preprocesamiento, extracción de características, entrenamiento de clasificadores y escenarios de evaluación. Mientras que la Figura 1 se centra en la arquitectura interna del modelo, la Figura 2 enfatiza el diseño experimental y el flujo de datos a través de las etapas de entrenamiento y prueba.

Figura 2: Flujo de trabajo del marco propuesto para el cribado de tos por COVID-19. Ilustración de toda la cadena de procesamiento, incluyendo preprocesamiento, extracción de características (MFCC, croma, características espectrales), aprendizaje y aumento de representaciones basadas en GAN–VAE (solo entrenamiento), y clasificación final bajo división a nivel de sujeto y evaluación entre conjuntos de datos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.