本研究提出了一种基于生成式人工智能的框架,整合了GAN、VAE和基于注意力的深度卷积网络,通过咳嗽音频信号检测COVID-19,提升了鲁棒性、数据平衡和跨数据集泛化性,实现可扩展、无创筛查。
研究文章
本研究提出了一种基于生成式人工智能的框架,整合了GAN、VAE和基于注意力的深度卷积网络,通过咳嗽音频信号检测COVID-19,提升了鲁棒性、数据平衡和跨数据集泛化性,实现可扩展、无创筛查。
咳咳音频分析为开发支持COVID-19疾病筛查的自动化工具提供了切实可行的途径。尽管兴趣日益增长,许多现有方法仍对噪声、类别不平衡和数据集变异性敏感,限制了其重复性。本研究提出了一种结构化的生成式人工智能驱动方法,利用咳嗽声音录音进行COVID-19检测。实验使用两个公开数据集COUGHVID和Virufy进行,均包含标记咳嗽样本。该方案由顺序预处理阶段组成,包括咳嗽分段、去噪和信号归一化。随后通过Mel频率天谱系数、色度描述符和频谱对比特征捕捉声学特性。为改善表征学习并减少数据不平衡,采用了整合变分自编码器和生成对抗网络的混合生成框架,用于综合特征级样本。随后,分类使用深度卷积神经网络和基于注意力的DCNN模型进行。性能评估表明,生成式增强在评估数据集中持续优于非生成基线,达到97.2%的分类准确率峰值,AUROC为0.953。这些结果证明了生成建模在增强基于咳嗽的新冠病毒检测方面的有效性,并为未来声学健康监测研究建立了可重复的分析流程。
呼吸声学越来越多地被探索为健康评估的非侵入性信息来源,尤其是在传染病和肺部疾病背景下。信号处理和人工智能(AI)的进步使得咳嗽和呼吸声的自动化分析成为可能,支持其作为数字生物标志物的应用。最新研究表明,使用嵌入智能手机、可穿戴设备或临床传感器的麦克风捕捉的呼吸声,可以通过深度学习模型有效分析以检测COVID-19感染1,5。这些发展凸显了基于音频的筛查作为快速、无接触且可扩展的传统诊断程序补充的潜力。冠状病毒病2019(COVID-19)由SARS-CoV-2病毒引起,主要影响呼吸系统,并引发气流动力学、肺功能和声道行为的可测量变化。尽管逆转录聚合酶链式反应(RT-PCR)仍是诊断的参考标准,但其后勤限制和延迟的周转时间限制了其适合大规模或连续筛查,促使基于呼吸声分析的替代方法被探索。
越来越多的文献研究了利用咳嗽、呼吸和语音信号进行AI驱动的新冠检测。如表1所述,先前研究探索了多样化的数据集、声学特征表示(如MFCC、STFT、基于频谱图的特征)以及从经典机器学习模型到深度卷积、循环、注意力和变换器架构的学习范式(8,9,10,11,12,13,14,15),16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45.多项研究已证明,利用众包和临床收集的呼吸音频,显示出有前景的筛查表现。相比之下,也有人强调迁移学习、数据增强和可解释人工智能在提升稳健性和可信度方面的重要性。表1不再重复逐项详细讨论,而是对这些代表性方法进行了综合比较,便于直接比较数据集、方法和报告结果。
尽管取得了这些进步,但现有方法的鲁棒性和实际应用性仍存在若干限制。呼吸音频数据集常在异质记录条件下收集,导致设备、声学环境和受试者群体之间存在较大差异 2,3,4。许多公开数据集依赖自我报告的COVID-19状态,这带来了标签可靠性的不确定性7.此外,明显的类别失衡和临床验证样本的有限性限制了仅基于观察数据训练的判别模型的泛化能力 4,5。因此,在受控实验环境下报告的模型性能并不总是能稳定地在不同现实场景中实现可靠部署。
综合来看,这些局限凸显了一个关键的研究空白:缺乏一个统一框架,能够同时应对数据稀缺性、类别不平衡以及跨异构数据集的稳健泛化。尽管生成模型如生成对抗网络(GAN)和变分自编码器(VAEs)已被探索用于学习潜在表征和合成真实的生物医学信号 6,7,但现有研究通常独立使用这些模型,并在单一数据集中进行评估。此外,它们与注意力增强卷积架构的集成以及跨数据集条件下的评估仍未得到充分研究。
为弥补这一空白,本研究提出了一种生成式人工智能辅助的COVID-19检测框架,结合声学特征提取与混合GAN–VAE模型及基于注意力的深度卷积神经网络(DCNNs)进行检测。生成部分通过结构化潜在表示学习和合成数据生成,缓解了类别失衡和样本可用性有限,而判别模型则提升了异构数据集间的分类鲁棒性。与以往主要依赖数据集内验证的研究不同,本框架通过跨数据集测试在独立数据集上进行评估,从而实现了对泛化性能的更严谨评估。该框架旨在作为筛查导向的方法,而非独立的诊断工具,其设计明确考虑了记录变异性和标签不确定性,以支持可重复且可靠的部署。
在此背景下,本研究的新颖贡献有三方面。首先,将统一的GAN–VAE混合生成框架与基于注意力的DCNN分类器集成,共同解决基于咳嗽的新冠筛查中的类别不平衡、有限的数据可用性以及稳健的特征表示学习。其次,所提方法通过跨数据集验证系统评估,相比传统数据集内测试,提供了更现实的模型泛化评估。第三,研究详细分析了生成增强在异质记录条件下的影响,从而将该框架定位为可重复的可扩展、实用COVID-19筛查概念验证。
| 作者与年份 | 数据集 | 使用的技术/特征 | 模型 / 分类器 | 准确性 / 指标 | 局限性 / 注释 |
| Imran 等,2020年第8页 | 众包咳嗽数据集(AI4COVID-19) | MFCC、迁移学习、领域感知特性 | 风险规避多分类器(DL + 机器学习集合) | 准确率:92.6% | 这取决于咳嗽的质量;有限的临床验证 |
| Brown 等,2020年第9页 | 众包呼吸声(>7,000用户) | 手工制作的音频特性,VGGish 嵌入 | 浅层机器学习模型 | AUC > 80% | 众包数据中的标签噪声 |
| Laguarta 等,2020年,第10页 | 麻省理工学院开放声音数据集(5,320名受试者) | MFCC,声学生物标志物 | CNN(ResNet50,迁移学习) | 敏感度:98.5%,特异度:94.2% | 需要大量预训练数据集 |
| Quartieri 等,202011 | 演讲面试(5个受试者,疫情前后) | 呼吸强度,F0,CPP,共振峰 | 统计效应规模分析 | 在所有任务中实现超过80%的实际行动能力(AUC) | 样本量非常小 |
| Hassan 等,202012 | 呼吸音 | 时间语音特征 | RNN(注册营养师) | 咳嗽:97%,呼气:98.2%,声音:88.2% | 缺乏详细的数据集统计数据 |
| Khamparia 等,2019年,第13页 | ESC-10,ESC-50 | 基于声谱图图像的特征 | CNN,TDSN | CNN:77%(ESC-10),49%(ESC-50);TDSN:56%(ESC-10) | 仅播放环境音;复杂数据集性能较低 |
| Aykanat 等,2017,第14页 | 来自1630名受试者的17,930个肺噪声(电子听诊器) | MFCC特征,频谱图像 | SVM,CNN | CNN/SVM:86%(健康与病理),76%/75%(拉莱-隆库斯-正常),80%/80%(单一类型),62%/62%(所有类型) | 需要专用硬件;非疾病特异性 |
| Ponomarchuk 等,202215 | 科斯瓦拉,维鲁菲 | MFCC、mel 频谱图、小波特征 | 卷积神经网(CNN)、RNN、集合模型 | AUC:0.93(内部),0.79(外部) | 跨数据集的泛化仍然具有挑战性 |
| Feng 等,2021第16页 | 科斯瓦拉,维鲁菲 | STFT,MFCC | SVM(RBF),CNN | 准确率81.25%(AUC 0.79) | 数据集依赖性能 |
| Islam 等,2022年,第17页 | 临床咳嗽记录 | 频谱与时频特征 | 深度神经网络 | 准确率:89.2% | 有限数据集 |
| 曼舒里,2022年18月 | 维鲁菲 | 谱分析特征 | 经典机器学习分类器 | 准确率:95.86% | 小规模实验研究 |
| Huang 等,2020年,第19页 | 10名新冠患者的肺音 | 时频呼吸声分析 | 临床专家分析 | 定性验证 | 小型数据集;无机器学习模型 |
| W. D. Puja 等,2024年,第20页 | Coswara, Virufy(咳嗽音数据集) | STFT、Mel频谱图、MFCC、均方根能量、频谱带宽、谱质心、谱滚出、ZCR;基于卷积神经网络的深度特征提取 | 1D CNN(特征提取器)+ 随机森林 | 准确率:93% | 表现取决于咳嗽质量;设计用于筛查而非临床诊断;众包数据变异性 |
| Chadaga 等,202321 | 众包咳嗽音频录音 | Mel频谱图与时频声学特征 | 卷积神经网络(CNN) | 准确率:84%,准确度:85%,召回率:84%,F1评分:84% | 性能受限于数据不平衡、自我报告标签以及对记录条件的敏感性 |
| Chadaga等,2023年,第22页 | 轻中度COVID-19及其他呼吸系统疾病的临床标志物 | 专题选择(Pearson,PSO);关键标志:嗜酸性粒细胞、白蛋白、胆红素、ALP、ALT、AST、HbA1c、TWBC | 叠叠的整体;1D CNN、LSTM、DN、残余MLP | 准确率:89% | 重症病例除外;RT-PCR的替代方案;可解释人工智能应用 |
| Dar 等,2024年,第23页 | COVID-19数据集 | SJHBO优化(Jaya+HBO+SO),许多频谱特征 | 深Q网络(DQN) | 准确率:95.11%,灵敏度:95.06%,特异性:94.69% | 高度复杂;调优通过混合优化器得到改进 |
| 景泉等 202024 | COVID-19患者的语音录音 | 声学功能集;疾病严重程度、睡眠质量、疲劳和焦虑的分析 | 支持向量机(SVM) | 0.69(疾病严重度) | 仅限音频功能;中等精度;数据集大小未指定;仅考虑四个健康方面 |
| Sharma, J. 等,2020年,第25页 | 城市之声8K、ESC-10、ESC-50 | 多功能频道:MFCC、GFCC、CQT、Chromagram;混合数据增强 | 具有空间可分离卷积和注意力模的深度CNN | UrbanSound8K:97.52%,ESC-10:94.75%,ESC-50:87.45% | 未在非基准或现实世界数据集上测试;由于更深层次的CNN和注意力模块带来的计算复杂性 |
| Lella KK 等,2021年,第26页 | 呼吸音;COVID-19,哮喘,健康) | 数据增强;使用数据去噪自动编码器(DDAE)代替MFCC | 一维卷积神经网络(一维CNN) | ~90% | 数据集细节有限;比MFCC提升约4%;未检验的泛化性 |
| Orlandic 等,202127 | 咳嗽病毒(25k+次咳嗽) | MFCCs、PSD、频谱与时间特征 | XGBoost | AUC 96.5%,Precision(精度)95.5% | 自我报告新冠;专家标签在子集上 |
| Zhang 等,202343 | COVID-19疫苗接种后HLH已发表病例报告(文献数据库) | 系统综述;临床特征聚合;分子对接分析 | 不适用(临床综述) | 描述性统计;临床结局 | 稀有事件分析;样本量小;依赖报告案例可能导致报告偏差 |
| Xu 等,202344 | 文献中报道的疫苗相关VKH病病例 | 回顾性案件审查;临床与影像特征分析 | 不适用(临床观察性研究) | 治疗反应与临床康复结果 | 病例数量有限;缺乏对照组;因果关系无法被确立 |
| Hu 等,2025年,第45页 | 中国SRDI医疗器械公司企业级母公司与子公司数据(七新宝数据库) | 社交网络分析;空间网络指标;地理探测器分析 | 不适用(网络与政策分析) | 网络密度、中心性、扩散指标 | 横断面设计;企业权重均等;没有直接的绩效或临床结果指标 |
表1:现有基于音频的COVID-19检测研究总结。 对以往咳嗽/音频筛查方法的比较概述,包括数据集、方法及报告的表现。 请点击此处下载此表格。
访问受限。请登录或开始试用以查看此内容。
拟议方法论
本研究提出了一种基于生成式人工智能的框架,用于通过咳嗽信号检测COVID-19。该框架将生成模型与判别分类器集成,训练和评估数据严格分开。 图1 展示了所提出的GAN–VAE–ADCNN框架的详细架构,展示了从音频预处理和特征提取到通过变分自编码器(VAE)进行潜在表示学习的流程,再到使用生成对抗网络(GAN)进行合成特征生成,最终使用深度卷积神经网络(DCNN)和基于注意力的DCNN(ADCNN)进行分类。图示显示生成组件仅在训练时使用,而分类则使用判别模型进行。

图1:GAN–VAE–ADCNN架构概述。 拟议的混合流程示意图,该流程通过VAE编码咳嗽衍生的声学特征,通过基于GAN的合成样本生成增强,并使用DCNN和基于注意力的DCNN(ADCNN)模型进行分类。 请点击此处查看该图的放大版本。
模型架构与实现
该框架中使用的生成和判别模型采用固定且可重现的架构实现。GAN由一个拥有三层全连通层(128、256和512单元)的发生器组成,使用ReLU激活;以及一个由三层全连通层(512、256和128单元)组成的鉴频器,使用LeakyReLU激活后再输出S形输出。
VAE编码器由两层全连通层组成,分别为256和128单元,随后进行潜在均值和方差估计,潜在维数为64。解码器镜像该结构,并通过重建损失和库尔巴克–莱布勒散度的结合训练,学习结构化且概率化的潜在空间。
DCNN 分类器包含四个卷积块,核为 3x3,以及 32、64、128 和 256 个滤波器。每个区块后都会进行批量归一化、ReLU 激活和 2x2 最大池化。ADCNN通过在最终卷积块后引入按信道的注意力机制来扩展DCNN。所有模型均使用Adam优化器进行优化,学习率为0.0001,批次大小为32。如 图1所示,VAE和GAN仅在培训期间工作,而DCNN和ADCNN用于分类。完整的训练和评估过程总结在算法1中。
算法1:基于GAN–VAE的新冠病毒检测框架
输入: 预处理咳嗽音频录音
输出: 二元分类标签(COVID-19阳性/阴性)
培训和评估程序遵循固定且可重复的流程。所有咳嗽音频录音均重新采样至16 kHz,进行降噪并对振幅进行归一化。记录被分割成固定长度段,从中提取MFCC、色度和光谱特征。每个音频段共提取了40个Mel频率的Cepstral系数(MFCCs)。此外,还计算了12个色度特征。所得表示为每个咳嗽段形成一个52维特征矢量。进行了受试者层级拆分,将数据划分为训练、验证和测试集。VAE被训练用于学习概率潜在表示,所得的潜在向量用于训练GAN进行合成特征生成。训练数据集通过GAN–VAE生成的样本进行了补充,而合成数据则被排除在验证和测试之外。DCNN和ADCNN分类器基于增强后的训练数据进行训练,最终评估基于保留的测试集,使用标准性能指标进行。
训练设置、数据拆分与泄漏预防
所有实验均采用固定且可重复的训练配置进行。数据分割在音频分段前于受试者层面进行,以防止数据泄漏。数据集按80:10:10的比例划分为训练、验证和测试集,确保同一记录的所有片段都被分配到一个子集。训练集用于模型学习和生成数据增强,验证集用于超参数调优和提前停止,测试集则保留用于最终性能评估。GAN–VAE框架生成的合成样本仅在培训期间使用,严格排除在验证和测试中,以确保公平评估。
模型最多训练了100个时代,早期停止基于验证丢失和耐心10个时代。优化使用Adam优化器,学习率为0.0001,批次大小为32。分类采用二元交叉熵损失,VAE和GAN组件分别采用重建和对抗性损失。这一统一的培训与评估协议确保了可重复性,防止数据泄露,并严格区分了培训和评估阶段。
数据集描述
使用了两个公开的咳嗽音频数据集——COUGHVID和Virufy——以平衡大规模声学多样性与临床参考标签,并在培训和评估中明确区分。
COUGHVID是一个众包的咳嗽录音集,带有部分专家注释和自我报告的元数据。为确保数据质量,选取了428个录音,并应用预设的质量控制标准,包括最小信号时长、足够的信噪比、去除损坏或模糊样本,以及是否存在可识别的咳嗽事件及症状元数据。经过预处理和分段后,这些录音产生了1,719个咳嗽片段,标准化为16 kHz采样率的WAV格式。COUGHVID被用于训练生成模型和判别分类器。
Virufy由医生监督的咳嗽记录组成,标记为新冠病毒RT-PCR阳性或阴性。全部16个可用录音都被收录,分段后共计234个咳嗽片段,同样标准化为16 kHz。Virufy仅用于外部跨数据集评估泛化性能,未用于训练、微调或生成增强。
因此,拟议框架应被解读为在受控实验条件下评估的概念验证筛查方法,而非临床验证的诊断系统。
数据预处理与分段
所有录音均被重新采样至16 kHz,转换为单声道,并进行了静音去除、频谱噪声降低和幅度归一化处理。在主体层级拆分后进行了分割,以防止数据泄露。每个录音被分割成重叠的2至4 s段,低能耗或静音段被舍弃。
外部验证协议
外部验证通过跨数据集评估进行。在 Virufy 上对训练的模型进行了外部验证。该方案评估的是在不同条件下收集的数据集间的泛化性,而非前瞻性临床验证。 图2 提供了该工作流程的协议级概述,展示了数据集的使用、预处理、特征提取、分类器训练和评估场景。 图1 侧重于内部模型架构, 图2 则强调实验设计和跨训练和测试阶段的数据流。

图2:拟议COVID-19咳嗽筛查框架的工作流程。 完整处理流程的示意,包括预处理、特征提取(MFCC、色度、谱特征)、基于GAN–VAE的表征学习与增强(仅训练),以及在受试者层级拆分和跨数据集评估下的最终分类。 请点击此处查看该图的放大版本。
访问受限。请登录或开始试用以查看此内容。
数据集组成与类别分布分析
经过预处理和分割后,COUGHVID和Virufy数据集在数据集规模和片段密度上均有显著差异。在444个记录中贡献了428个(96.4%)和1953个提取的咳嗽片段中的1719个(88.0%),确认了其作为模型训练和生成增强主要数据集的角色(见图3)。相比之下,Virufy仅贡献了16条记录(3.6%)和234条咳嗽片段(12.0%),且仅供外部跨数据集评估使用。值得注意的是,尽管体积较小,Virufy每记录平均产生的片段数高于COUGHVID,反映了记录结构和分割结果的差异(见图3)。
除了数据集大小的差异外,类别分布分析还强调了不平衡对训练稳定性和评估可靠性的影响。评估的不平衡情景(平衡、轻微不平衡、医院和社区)展示了班级比例偏差如何降低有效学习多样性并增加对多数班级的偏见(
访问受限。请登录或开始试用以查看此内容。
结果表明,提出的基于生成式人工智能的框架能够通过跨异构数据集的咳嗽信号检测COVID-19。如 表4 和 表6所示,GAN–VAE混合模型表现最佳,准确率97.2%,AUROC为0.953,同时具有高精度、召回率、F1评分和特异性,显示出分类性能平衡。
当生成模型与判别分类器结合时,性能持续提升。GAN–DCNN和VAE–ADCNN均优于各自基线模型,表明生成增强增强了特征学习和泛化,尤其是在类别失衡和有限的临床验证数据中。MFCC特征在数据集中提供了最强的个体判别表现。虽然色度和光谱对比度特征单独表现较低,但与MFCCS结合后,在异质记录条件下提升了鲁棒性。
数据集评估确认了COUGHVID在训练中与Virufy在外部验证上的互补作用。个体、跨数据集及综合评估的稳定结果表明具有合理的泛化能力。该系统应被解释为非侵入性筛查和决策支持工具,而非RT-PCR检测的诊断替代品,并有望用于初步风险评估...
访问受限。请登录或开始试用以查看此内容。
作者未报告潜在利益冲突。
我们衷心感谢计算机科学与工程学院的教师和研究导师在撰写本文期间给予的宝贵指导、持续支持和建设性反馈。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 咳嗽病毒数据集 | & Eacute;科尔理工学院Fé和可爱;洛桑联邦理工学院(EPFL) | 公开发行(2021年) | 众包咳嗽音频数据集,含自我报告元数据和部分医生注释;主要用于训练和数据增强。 |
| CUDA 工具包 | NVIDIA | 11.3 | GPU加速框架用于加速模型训练和推理。 |
| LibROSA | 开源 | 0.9 | 音频分析库,用于重采样、分割、MFCC提取和频谱特征计算。 |
| Linux 操作系统 | 正典 | Ubuntu 20.04 LTS | 操作系统用于所有实验和模型训练。 |
| Matplotlib | 开源 | 3.5 | 用于绘制数据集分布和评估结果的可视化库。 |
| 数字派 | 开源 | 1.21 | 用于数组操作和信号处理操作的数值计算库。 |
| NVIDIA GPU | NVIDIA | 特斯拉 / RTX 级别 | 用于训练深度和生成式模型的图形处理单元。 |
| Python 编程语言 | Python 软件基础 | 3.8 | 用于数据预处理、特征提取、模型开发和评估的核心编程环境。 |
| PyTorch | Meta(Facebook 人工智能研究) | 1.12 | 用于实现GAN、VAE、DCNN及基于注意力的DCNN模型的深度学习框架。 |
| Scikit-learn | 开源 | 1 | 用于数据拆分、类权重和性能指标计算的机器学习库。 |
| 科幻 | 开源 | 1.7 | 用于音频预处理和信号转换的科学计算库。 |
| Virufy 数据集 | 维鲁菲 | 公开发行(2021年) | 临床采集的咳嗽记录,使用RT-PCR–经过验证的COVID-19标签;仅用于外部验证和跨数据集评估。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可