Artigo de investigação

Uma Estrutura Baseada em IA Gerativa para Triagem de COVID-19 a partir de Sinais de Áudio de Tosse

DOI:

10.3791/69874

10 de março de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo propõe uma estrutura baseada em IA generativa que integra GANs, VAEs e redes convolucionais profundas baseadas em atenção para detectar COVID-19 a partir de sinais de áudio de tosse, melhorando a robustez, o balanceamento de dados e a generalização entre conjuntos de dados para triagem escalável e não invasiva.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A análise de áudio da tosse oferece um caminho prático para desenvolver ferramentas automatizadas que apoiem a triagem da doença COVID-19. Apesar do crescente interesse, muitas abordagens existentes permanecem sensíveis a ruído, desequilíbrio de classes e variabilidade do conjunto de dados, limitando sua reprodutibilidade. Este trabalho apresenta uma metodologia estruturada e gerativa orientada por inteligência artificial para a detecção da COVID-19, utilizando gravações sonoras de tosse. Os experimentos são realizados usando dois conjuntos de dados públicos acessíveis, COUGHVID e Virufy, ambos compostos por amostras de tosse rotuladas. O protocolo proposto consiste em etapas sequenciais de pré-processamento, incluindo segmentação de tosse, redução de ruído e normalização de sinal. As características acústicas são então capturadas por meio dos Coeficientes Cepstrais de Mel-Frequência, descritores de croma e características de contraste espectral. Para melhorar o aprendizado de representações e mitigar o desequilíbrio de dados, é empregado um framework generativo híbrido que integra Autoencoders variacionais e Redes Generativas Adversariais para sintetizar amostras em nível de características. A classificação é posteriormente realizada usando Redes Neurais Convolucionais Profundas e modelos DCNN baseados em Atenção. A avaliação de desempenho indica que incorporar aumento generativo melhora consistentemente em relação às linhas de base não generativas, alcançando uma precisão máxima de classificação de 97,2% e um AUROC de 0,953 em todos os conjuntos de dados avaliados. Esses resultados demonstram a eficácia da modelagem generativa para aprimorar a detecção da COVID-19 baseada na tosse e estabelecem um pipeline analítico reprodutível para futuras pesquisas em monitoramento acústico da saúde.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A acústica respiratória tem sido cada vez mais explorada como uma fonte não invasiva de informações para avaliação de saúde, especialmente no contexto de doenças infecciosas e pulmonares. Avanços no processamento de sinais e na inteligência artificial (IA) possibilitaram a análise automatizada de sons de tosse e respiração, apoiando seu uso como biomarcadores digitais. Estudos recentes demonstram que sons respiratórios capturados usando microfones embutidos em smartphones, dispositivos vestíveis ou sensores clínicos podem ser analisados de forma eficaz usando modelos de aprendizado profundo para detectar infecção porCOVID-19 1,5. Esses avanços destacam o potencial da triagem baseada em áudio como um complemento rápido, sem contato e escalável aos procedimentos diagnósticos convencionais. Doença do Coronavírus 2019 (COVID-19), causada pelo vírus SARS-CoV-2, afeta principalmente o sistema respiratório e induz mudanças mensuráveis na dinâmica do fluxo de ar, função pulmonar e comportamento do trato vocal. Embora o teste de reação em cadeia por transcrição reversa e polimerase (RT-PCR) permaneça o padrão de referência para diagnóstico, suas restrições logísticas e o tempo de resposta atrasado limitam sua adequação para triagem em larga escala ou contínua, motivando a exploração de abordagens alternativas baseadas na análise do som respiratório.

Um corpo crescente de literatura tem investigado a detecção de COVID-19 impulsionada por IA usando sinais de tosse, respiração e fala. Como resumido na Tabela 1, estudos anteriores exploraram conjuntos de dados diversos, representações de características acústicas (por exemplo, MFCC, STFT, características baseadas em espectrogramas) e paradigmas de aprendizado que vão desde modelos clássicos de aprendizado de máquina até arquiteturas profundas convolucionais, recorrentes, baseadas em atenção e transformadoras 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45 . Vários trabalhos demonstraram desempenho promissor em triagem usando áudio respiratório coletado por crowdsourcing e clinicamente. Em contraste, outros enfatizaram a importância do aprendizado por transferência, aumento de dados e IA explicável para melhorar a robustez e a confiabilidade. Em vez de repetir uma discussão detalhada estudo a estudo, a Tabela 1 oferece uma visão comparativa consolidada dessas abordagens representativas, permitindo a comparação direta de conjuntos de dados, metodologias e resultados relatados.

Apesar desses avanços, várias limitações dificultam a robustez e a aplicabilidade prática das abordagens existentes. Conjuntos de dados de áudio respiratório são frequentemente coletados sob condições de gravação heterogêneas, levando a uma variabilidade substancial entre dispositivos, ambientes acústicos e populaçõesde sujeitos 2,3,4. Muitos conjuntos de dados públicos dependem do status de COVID-19 auto-reportado, introduzindo incerteza na confiabilidade dosrótulos 7. Além disso, o desequilíbrio de classe pronunciado e a disponibilidade limitada de amostras clinicamente validadas restringem a capacidade de generalização de modelos discriminativos treinados exclusivamente com dadosobservados 4,5. Consequentemente, o desempenho do modelo relatado em ambientes experimentais controlados não se traduz consistentemente em implantação confiável em diversos cenários do mundo real.

Juntas, essas limitações destacam uma lacuna crítica na pesquisa: a ausência de uma estrutura unificada que aborde simultaneamente a escassez de dados, o desequilíbrio de classes e a generalização robusta entre conjuntos de dados heterogêneos. Embora modelos generativos como Redes Generativas Adversariais (GANs) e Autoencoders Variacionais (VAEs) tenham sido explorados para aprender representações latentes e sintetizar sinais biomédicosrealistas 6,7, estudos existentes normalmente empregam esses modelos de forma independente e os avaliam dentro de um único conjunto de dados. Além disso, sua integração com arquiteturas convolucionais aprimoradas por atenção e avaliação sob condições de conjunto de dados cruzados permanece insuficientemente investigada.

Para suprir essa lacuna, o presente estudo propõe uma estrutura generativa assistida por IA para a detecção de COVID-19 a partir de sons de tosse, que integra extração de características acústicas com um modelo híbrido GAN–VAE e redes neurais profundas convolucionais (DCNNs) baseadas em atenção. O componente generativo mitiga o desequilíbrio de classes e a disponibilidade limitada de amostras por meio de aprendizado estruturado de representação latente e geração de dados sintéticos, enquanto os modelos discriminativos aumentam a robustez da classificação entre conjuntos de dados heterogêneos. Ao contrário de trabalhos anteriores que dependem predominantemente da validação dentro do conjunto de dados, o framework proposto é avaliado por meio de testes cross-dataset em um conjunto de dados independente, permitindo uma avaliação mais rigorosa do desempenho da generalização. A estrutura é pensada como uma abordagem orientada à triagem, e não como uma ferramenta de diagnóstico independente, e seu design leva explicitamente em conta a variabilidade e a incerteza do rótulo para apoiar a implantação reproduzível e confiável.

Nesse contexto, as contribuições inovadoras do presente estudo são triplas. Primeiro, uma estrutura híbrida generativa unificada GAN–VAE é integrada com classificadores DCNN baseados em atenção para abordar conjuntamente o desequilíbrio de classes, a disponibilidade limitada de dados e o aprendizado robusto de representação de características na triagem de COVID-19 baseada em tosse. Segundo, a abordagem proposta é avaliada sistematicamente usando validação entre conjuntos de dados, proporcionando uma avaliação mais realista da generalização do modelo em comparação com os testes convencionais dentro do conjunto de dados. Terceiro, o estudo apresenta uma análise detalhada do impacto do aumento generativo sob condições heterogêneas de registro, posicionando assim a estrutura como uma prova de conceito reprodutível para uma triagem escalável e prática da COVID-19.

Autor(es) & AnoConjunto de dadosTécnicas / Recursos UsadosModelo / ClassificadorPrecisão / MétricasLimitações / Notas
Imran et al., 20208Conjunto de dados de tosse colaborativo (AI4COVID-19)MFCC, aprendizado por transferência, recursos conscientes de domínioMulti-classificador averso ao risco (DL + ML ensemble)Precisão: 92,6%Depende da qualidade da tosse; Validação clínica limitada
Brown et al., 20209Sons respiratórios colaborativos (>7.000 usuários)Recursos de áudio artesanal, embeddings ao estilo VGGModelos de ML rasosAUC > 80%Ruído de rótulos em dados colaborativos
Laguarta et al., 202010Conjunto de dados MIT Open Voice (5.320 participantes)MFCC, biomarcadores acústicosCNN (ResNet50, aprendizado por transferência)Sensibilidade: 98,5%, Especificidade: 94,2%Requer um grande conjunto de dados de pré-treinamento
Quartieri et al., 202011Entrevistas de discurso (5 disciplinas, pré/pós COVID)Intensidade respiratória, F0, CPP, formantesAnálise estatística de tamanho de efeitoalcançar um AUC acima de 80% em todas as tarefasAmostra muito pequena
Hassan et al., 202012Sons respiratóriosCaracterísticas da fala temporalRNNTosse: 97%, respiração: 98,2%, voz: 88,2%Falta de estatísticas detalhadas de conjuntos de dados
Khamparia et al., 201913ESC-10, ESC-50Recursos baseados em imagens de espectrogramaCNN, TDSNCNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10)Apenas sons ambientais; Menor desempenho em conjuntos de dados complexos
Aykanat et al., 20171417.930 sons pulmonares de 1.630 sujeitos (estetoscópio eletrônico)Características MFCC, imagens de espectrogramaSVM, CNNCNN/SVM: 86% (saudável vs patológico), 76%/75% (rale–rhonchus–normal), 80%/80% (tipo único), 62%/62% (todos os tipos)Requer hardware especializado; não específico da doença
Ponomarchuk et al., 202215Coswara, VirufyMFCC, mel-espectrograma, características waveletCNN, RNN, modelos de conjuntoAUC: 0,93 (interno), 0,79 (externo)A generalização entre conjuntos de dados continua sendo desafiadora
Feng et al., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNPrecisão 81,25% (AUC de 0,79)Desempenho dependente do conjunto de dados
Islam et al., 202217Registros clínicos de tosseCaracterísticas espectrais e tempo-frequênciaRedes neurais profundasPrecisão: 89,2%Conjunto de dados limitado
Manshouri,2022 18VirufyCaracterísticas de análise espectralClassificadores clássicos de MLPrecisão: 95,86%Estudo experimental em pequena escala
Huang et al., 202019Sons pulmonares de 10 pacientes com COVID-19Análise de som respiratório tempo-frequênciaAnálise clínica especializadaValidação qualitativaConjunto de dados pequeno; sem modelo de ML
W. D. Puja et al., 202420Coswara, Virufy (conjuntos de dados de som de tosse)STFT, espectrograma Mel, MFCC, energia RMS, largura de banda espectral, centroide espectral, redução espectral, ZCR; Extração profunda de características baseada na CNNCNN 1D (extrator de características) + Floresta AleatóriaPrecisão: 93%O desempenho depende da qualidade da tosse; projetado para triagem, e não para diagnóstico clínico; Variabilidade dos dados colaborativas
Chadaga et al., 202321Gravações de áudio de tosse colaborativasEspectrograma de mel e características acústicas tempo-frequênciaRede Neural Convolucional (CNN)Precisão: 84%, Precisão: 85%, Recordação: 84%, F1-pontuação: 84%O desempenho é limitado por desequilíbrio de dados, rótulos auto-reportados e sensibilidade às condições de gravação
Chadaga et al., 202322Marcadores clínicos de COVID-19 leve a moderado e outras doenças respiratóriasSeleção de longas (Pearson, PSO); Marcadores-chave: Eosinófilo, Albumina, T. Bilirrubina, ALP, ALT, AST, HbA1c, TWBCConjunto empilhado; 1D CNN, LSTM, DNN, MLP RESIDUALPrecisão: 89%Casos graves excluídos; alternativa à RT-PCR; IA explicável aplicada
Dar et al. 202423Conjunto de Dados COVID-19Otimização SJHBO (Jaya+HBO+SO), muitas características espectraisRede Q Profunda (DQN)Precisão: 95,11%, Sensibilidade: 95,06%, Especificidade: 94,69%Alta complexidade; O ajuste é aprimorado por meio de um otimizador híbrido
Jing Quian et al 202024Gravações de fala de pacientes com COVID-19Conjuntos acústicos de destaque; análise da gravidade da doença, qualidade do sono, fadiga, ansiedadeMáquinas Vetoriais de Suporte (SVM)0,69 (gravidade da doença)Limitado a recursos de áudio; precisão moderada; tamanho do conjunto de dados não especificado; Apenas quatro aspectos de saúde considerados
Sharma, J., et al. 202025UrbanSound8K, ESC-10, ESC-50Canais multifuncionais: MFCC, GFCC, CQT, Chromagram; Aumento de dados por misturaCNN profundo com convoluções e módulos de atenção espacialmente separáveisUrbanSound8K: 97,52%, ESC-10: 94,75%, ESC-50: 87,45%Não testado em conjuntos de dados que não sejam benchmark ou do mundo real; complexidade computacional devido a módulos mais profundos de CNN e atenção
Lella KK, et al. 202126 Sons respiratórios; COVID-19, asma, saudável)Aumento de dados; recursos profundos usando o Data De-noising Auto Encoder (DDAE) em vez do MFCCRede Neural Convolucional 1D (CNN 1D)~90%Detalhes limitados do conjunto de dados; ~4% de melhoria em relação ao MFCC; Generalizabilidade não testada
Orlandic et al., 202127TOSSE (25k+ tosse)MFCCs, PSD, características espectrais e temporaisXGBoostAUC 96,5%, Precisão 95,5%COVID auto-relatada; Rótulos especialistas no subconjunto
Zhang et al., 202343Relatórios de casos publicados de HLH após a vacinação contra a COVID-19 (bancos de dados da literatura)Revisão sistemática; agregação de características clínicas; Análise de acoplamento molecularNão aplicável (revisão clínica)Estatísticas descritivas; Desfechos clínicosAnálise de eventos raros; amostra pequena; A dependência de casos reportados pode introduzir viés de denúncia
Xu et al., 202344Casos relatados de doença VKH associada à vacina na literaturaRevisão retrospectiva de casos; Análise de características clínicas e de imagemNão aplicável (estudo observacional clínico)Resposta ao tratamento e resultados de recuperação clínicaNúmero limitado de casos; falta de grupo de controle; A relação causal não pode ser firmemente estabelecida
Hu et al., 202545Dados de empresa-mãe-subsidiária de empresas de dispositivos médicos SRDI na China (banco de dados Qixinbao)análise de redes sociais; métricas de redes espaciais; Análise geográfica de detectoresNão aplicável (análise de rede e políticas)Índices de densidade, centralidade e difusão da redeProjeto em seção transversal; ponderação igual das empresas; Sem métricas diretas de desempenho ou resultados clínicos

Tabela 1: Resumo dos estudos existentes de detecção baseada em áudio da COVID-19. Visão comparativa das abordagens anteriores de triagem de tosse/áudio, incluindo conjuntos de dados, métodos e desempenho relatado. Por favor, clique aqui para baixar esta Tabela.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Metodologia Proposta

Este estudo propõe uma estrutura baseada em IA generativa para detectar a COVID-19 a partir de sinais de tosse. A estrutura integra modelos generativos com classificadores discriminativos, mantendo os dados de treinamento e avaliação estritamente separados. A Figura 1 ilustra a arquitetura detalhada do framework proposto GAN–VAE–ADCNN, mostrando o fluxo do pré-processamento de áudio e extração de características até o aprendizado de representações latentes via um Autoencoder Variacional (VAE), geração de características sintéticas usando uma Rede Generativa Adversarial (GAN), e a classificação final usando Redes Neurais Convolucionais Profundas (DCNN) e DCNN baseada em atenção (ADCNN). A figura mostra que componentes generativos são usados apenas durante o treinamento, enquanto a classificação é realizada usando modelos discriminativos.

figure-protocol-1
Figura 1: Visão geral da arquitetura GAN–VAE–ADCNN. Esquema do pipeline híbrido proposto, onde características acústicas derivadas da tosse são codificadas usando um VAE, ampliadas por geração de amostras sintéticas baseadas em GAN e classificadas usando modelos DCNN e DCNN baseado em atenção (ADCNN). Por favor, clique aqui para ver uma versão ampliada desta figura.

Arquitetura e Implementação do Modelo

Os modelos generativos e discriminativos usados nesse framework foram implementados com arquiteturas fixas e reprodutíveis. O GAN consiste em um gerador com três camadas totalmente conectadas (128, 256 e 512 unidades) usando ativação ReLU, e um discriminador com três camadas totalmente conectadas (512, 256 e 128 unidades) usando ativação LeakyReLU seguida por uma saída sigmoide.

O codificador VAE é composto por duas camadas totalmente conexas com 256 e 128 unidades, seguidas por estimativas de média latente e variância com dimensionalidade latente de 64. O decodificador espelha essa estrutura e é treinado usando uma combinação de perda por reconstrução e divergência de Kullback–Leibler para aprender um espaço latente estruturado e probabilístico.

O classificador DCNN inclui quatro blocos convolucionais com kernels 3x3 e 32, 64, 128 e 256 filtros, respectivamente. Cada bloco é seguido por normalização em lote, ativação do ReLU e 2x2 max pooling. O ADCNN estende o DCNN incorporando um mecanismo de atenção canal a canal após o bloco convolucional final. Todos os modelos foram otimizados usando o otimizador Adam, com taxa de aprendizado de 0,0001 e tamanho de lote de 32. Como mostrado na Figura 1, o VAE e o GAN operam apenas durante o treinamento, enquanto DCNN e ADCNN são usados para classificação. O procedimento completo de treinamento e avaliação é resumido no Algoritmo 1.

Algoritmo 1: Estrutura de Detecção de COVID-19 Baseada em GAN e VAE

Entrada: Gravações de áudio pré-processadas para a tosse

Saída: Rótulo de classificação binária (COVID-19 positivo/negativo)

Os procedimentos de treinamento e avaliação seguiram um pipeline fixo e reproduzível. Todas as gravações de áudio da tosse foram reamostradas para 16 kHz, submetidas a redução de ruído e normalizadas em amplitude. As gravações foram segmentadas em segmentos de comprimento fixo, dos quais foram extraídas MFCC, chroma e características espectrais. Um total de 40 Coeficientes Cepstrais de Mel-Frequência (MFCCs) foram extraídos de cada segmento de áudio. Além disso, 12 características de cromina foram calculadas. A representação resultante forma um vetor de características de 52 dimensões para cada segmento de tosse. Foi realizada a divisão em nível de sujeito para dividir os dados em conjuntos de treinamento, validação e teste. O VAE foi treinado para aprender representações latentes probabilísticas, e os vetores latentes resultantes foram usados para treinar o GAN para geração de características sintéticas. O conjunto de dados de treinamento foi ampliado usando amostras geradas pelo GAN–VAE, enquanto dados sintéticos foram excluídos da validação e dos testes. Classificadores DCNN e ADCNN foram treinados com os dados de treinamento aumentados, e a avaliação final foi realizada no conjunto de testes estendido usando métricas padrão de desempenho.

Configuração de Treinamento, Divisão de Dados e Prevenção de Vazamentos

Todos os experimentos foram conduzidos com uma configuração de treinamento fixa e reprodutível. A divisão de dados era realizada no nível do sujeito antes da segmentação de áudio para evitar vazamento de dados. O conjunto de dados foi dividido em conjuntos de treinamento, validação e teste em uma proporção de 80:10:10, garantindo que todos os segmentos da mesma gravação fossem atribuídos a um único subconjunto. O conjunto de treinamento era usado para aprendizado de modelos e aumento de dados generativos, o conjunto de validação para ajuste de hiperparâmetros e parada precoce, e o conjunto de teste era mantido para avaliação final de desempenho. Amostras sintéticas geradas pelo framework GAN–VAE foram usadas exclusivamente durante o treinamento e foram estritamente excluídas da validação e dos testes para garantir uma avaliação justa.

Os modelos foram treinados por um máximo de 100 épocas, com paradas precoces baseadas na perda de validação e uma paciência de 10 épocas. A otimização foi realizada usando o otimizador Adam com taxa de aprendizado de 0,0001 e tamanho de lote de 32. A perda binária de entropia cruzada foi aplicada para classificação, enquanto perdas de reconstrução e adversariais foram usadas para treinar os componentes VAE e GAN, respectivamente. Esse protocolo unificado de treinamento e avaliação garante reprodutibilidade, previne vazamento de dados e mantém uma separação rigorosa entre as etapas de treinamento e avaliação.

Descrição do Conjunto de Dados

Dois conjuntos de dados de áudio para tosse disponíveis publicamente — COUGHVID e Virufy — foram usados para equilibrar a diversidade acústica em grande escala com rótulos clinicamente referenciados, com papéis claramente separados no treinamento e avaliação.

COUGHVID é uma coletânea colaborativa de gravações de tosse, com anotação parcial de especialistas e metadados autorrelatados. Para garantir a qualidade dos dados, 428 gravações foram selecionadas após aplicação de critérios pré-definidos de controle de qualidade, incluindo duração mínima do sinal, relação sinal-ruído adequada, remoção de amostras corrompidas ou ambíguas e presença de eventos identificáveis de tosse com metadados de sintomas. Após pré-processamento e segmentação, essas gravações renderam 1.719 segmentos de tosse, padronizados para o formato WAV com uma taxa de amostragem de 16 kHz. O COUGHVID foi usado para treinar tanto os modelos generativos quanto os classificadores discriminativos.

O Virufy consiste em gravações de tosse supervisionadas por médicos, rotuladas como RT-PCR positiva ou negativa para COVID-19. Todas as 16 gravações disponíveis foram incluídas, resultando em 234 segmentos de tosse após segmentação, também padronizados para 16 kHz. O Virufy foi usado exclusivamente para avaliação externa de conjuntos de dados cruzados para avaliar o desempenho de generalização e não foi usado para treinamento, ajuste fino ou aumento generativo.

O arcabouço proposto deve, portanto, ser interpretado como uma abordagem de triagem de prova de conceito avaliada sob condições experimentais controladas, em vez de um sistema diagnóstico clinicamente validado.

Pré-processamento e segmentação de dados

Todas as gravações foram reamostradas para 16 kHz, convertidas para mono e submetidas à remoção de silêncio, redução de ruído espectral e normalização de amplitude. A segmentação era realizada após a divisão em nível de sujeito para evitar vazamento de dados. Cada gravação era dividida em segmentos sobrepostos de 2 a 4 s, e segmentos de baixa energia ou silenciosos eram descartados.

Protocolo de Validação Externa

A validação externa foi realizada por meio de avaliação cruzada de conjuntos de dados. Modelos treinados com COUGHVID foram avaliados no Virufy para validação externa. Esse protocolo avalia a generalização entre conjuntos de dados coletados sob condições diferentes, em vez da validação clínica prospectiva. A Figura 2 oferece uma visão geral em nível de protocolo desse fluxo de trabalho, ilustrando o uso do conjunto de dados, pré-processamento, extração de características, treinamento de classificadores e cenários de avaliação. Enquanto a Figura 1 foca na arquitetura interna do modelo, a Figura 2 enfatiza o projeto experimental e o fluxo de dados entre as etapas de treinamento e teste.

figure-protocol-2
Figura 2: Fluxo de trabalho do framework proposto para rastreamento de tosse COVID-19. Ilustração de todo o pipeline de processamento, incluindo pré-processamento, extração de características (MFCC, croma, características espectrais), aprendizado e aumento de representações baseados em GAN–VAE (apenas treinamento), e classificação final sob divisão em nível de sujeito e avaliação cruzada de conjuntos de dados. Por favor, clique aqui para ver uma versão ampliada desta figura.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Composição do Conjunto de Dados e Análise de Distribuição de Classes

Após pré-processamento e segmentação, os conjuntos de dados COUGHVID e Virufy apresentaram diferenças substanciais tanto na escala quanto na densidade de segmentos. O COUGHVID contribuiu com 428 de 444 registros (96,4%) e 1.719 de 1.953 segmentos de tosse extraídos (88,0%), confirmando seu papel como o principal conjunto de dados para treinamento de modelos e aumento generati...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os resultados demonstram que a estrutura proposta baseada em IA generativa pode detectar a COVID-19 a partir de sinais de tosse em conjuntos de dados heterogêneos. Como mostrado nas Tabelas 4 e 6, o modelo híbrido GAN–VAE alcançou o melhor desempenho, com 97,2% de precisão e um AUROC de 0,953, além de alta precisão, recall, pontuação F1 e especificidade, indicando desempenho equilibrado na classificação.

O desempenho melhorou ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nenhum potencial conflito de interesses foi relatado pelos autores.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Expressamos nossa sincera gratidão ao corpo docente e aos mentores de pesquisa da Escola de Ciência da Computação e Engenharia por sua valiosa orientação, apoio contínuo e feedback construtivo durante a preparação deste artigo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Conjunto de Dados COUGHVIDÉ cole Polytechnique Fé dé Rale de Lausanne (EPFL)Lançamento público (2021)Conjunto de dados de áudio para tosse coletivo com metadados autorrelatados e anotação parcial do médico; Usado principalmente para treinamento e ampliação de dados.
Kit de Ferramentas CUDANVIDIA11.3Estrutura de aceleração de GPU usada para acelerar o treinamento e a inferência do modelo.
LibROSACódigo Aberto0.9Biblioteca de análise de áudio usada para reamostragem, segmentação, extração MFCC e computação de características espectrais.
Sistema Operacional LinuxCanônicoUbuntu 20.04 LTSSistema operacional usado para todos os experimentos e treinamento de modelos.
MatplotlibCódigo Aberto3.5Biblioteca de visualização usada para plotar distribuições de conjuntos de dados e resultados de avaliação.
NumPyCódigo Aberto1.21Biblioteca numérica de computação usada para manipulação de matrizes e operações de processamento de sinais.
NVIDIA GPUNVIDIAClasse Tesla / RTXUnidade de processamento gráfico usada para treinar modelos profundos e generativos.
Linguagem de Programação PythonFundação de Software Python3.8Ambiente de programação central usado para pré-processamento de dados, extração de recursos, desenvolvimento de modelos e avaliação.
PyTorchMeta (Pesquisa de IA no Facebook)1.12Framework de deep learning usado para implementar modelos GAN, VAE, DCNN e DCNN baseados em atenção.
Scikit-learnCódigo Aberto1Biblioteca de aprendizado de máquina usada para divisão de dados, ponderação de classes e cálculo de métricas de desempenho.
SciPyCódigo Aberto1.7Biblioteca de computação científica usada para pré-processamento de áudio e transformações de sinais.
Conjunto de Dados VirufyVirufyLançamento público (2021)Registros clínicos de tosse coletados com RT-PCR e dash; rótulos verificados da COVID-19; Usado exclusivamente para validação externa e avaliação cruzada de conjuntos de dados.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

Artigos relacionados