研究文章

基于生成式人工智能的COVID-19筛查框架,用于咳嗽音频信号

DOI:

10.3791/69874

2026年3月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种基于生成式人工智能的框架,整合了GAN、VAE和基于注意力的深度卷积网络,通过咳嗽音频信号检测COVID-19,提升了鲁棒性、数据平衡和跨数据集泛化性,实现可扩展、无创筛查。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

咳咳音频分析为开发支持COVID-19疾病筛查的自动化工具提供了切实可行的途径。尽管兴趣日益增长,许多现有方法仍对噪声、类别不平衡和数据集变异性敏感,限制了其重复性。本研究提出了一种结构化的生成式人工智能驱动方法,利用咳嗽声音录音进行COVID-19检测。实验使用两个公开数据集COUGHVID和Virufy进行,均包含标记咳嗽样本。该方案由顺序预处理阶段组成,包括咳嗽分段、去噪和信号归一化。随后通过Mel频率天谱系数、色度描述符和频谱对比特征捕捉声学特性。为改善表征学习并减少数据不平衡,采用了整合变分自编码器和生成对抗网络的混合生成框架,用于综合特征级样本。随后,分类使用深度卷积神经网络和基于注意力的DCNN模型进行。性能评估表明,生成式增强在评估数据集中持续优于非生成基线,达到97.2%的分类准确率峰值,AUROC为0.953。这些结果证明了生成建模在增强基于咳嗽的新冠病毒检测方面的有效性,并为未来声学健康监测研究建立了可重复的分析流程。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

呼吸声学越来越多地被探索为健康评估的非侵入性信息来源,尤其是在传染病和肺部疾病背景下。信号处理和人工智能(AI)的进步使得咳嗽和呼吸声的自动化分析成为可能,支持其作为数字生物标志物的应用。最新研究表明,使用嵌入智能手机、可穿戴设备或临床传感器的麦克风捕捉的呼吸声,可以通过深度学习模型有效分析以检测COVID-19感染1,5。这些发展凸显了基于音频的筛查作为快速、无接触且可扩展的传统诊断程序补充的潜力。冠状病毒病2019(COVID-19)由SARS-CoV-2病毒引起,主要影响呼吸系统,并引发气流动力学、肺功能和声道行为的可测量变化。尽管逆转录聚合酶链式反应(RT-PCR)仍是诊断的参考标准,但其后勤限制和延迟的周转时间限制了其适合大规模或连续筛查,促使基于呼吸声分析的替代方法被探索。

越来越多的文献研究了利用咳嗽、呼吸和语音信号进行AI驱动的新冠检测。如表1所述,先前研究探索了多样化的数据集、声学特征表示(如MFCC、STFT、基于频谱图的特征)以及从经典机器学习模型到深度卷积、循环、注意力和变换器架构的学习范式(8,9,10,11,12,13,14,15

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

拟议方法论

本研究提出了一种基于生成式人工智能的框架,用于通过咳嗽信号检测COVID-19。该框架将生成模型与判别分类器集成,训练和评估数据严格分开。 图1 展示了所提出的GAN–VAE–ADCNN框架的详细架构,展示了从音频预处理和特征提取到通过变分自编码器(VAE)进行潜在表示学习的流程,再到使用生成对抗网络(GAN)进行合成特征生成,最终使用深度卷积神经网络(DCNN)和基于注意力的DCNN(ADCNN)进行分类。图示显示生成组件仅在训练时使用,而分类则使用判别模型进行。

figure-protocol-1
图1:GAN–VAE–ADCNN架构概述。 拟议的混合流程示意图,该流程通过VAE编码咳嗽衍生的声学特征,通过基于GAN的合成样本生成增强,并使用DCNN和基于注意力的DCNN(ADCNN)模型....

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

数据集组成与类别分布分析

经过预处理和分割后,COUGHVID和Virufy数据集在数据集规模和片段密度上均有显著差异。在444个记录中贡献了428个(96.4%)和1953个提取的咳嗽片段中的1719个(88.0%),确认了其作为模型训练和生成增强主要数据集的角色(见图3)。相比之下,Virufy仅贡献了16条记录(3.6%)和234条咳嗽片段(12.0%),且仅供外部跨数据集评估使用。值得注意的是,尽管体积较小,Virufy每记录平均产生的片段数高于COUGHVID,反映了记录结构和分割结果的差异(见图3)。

除了数据集大小的差异外,类别分布分析还强调了不平衡对训练稳定性和评估可靠性的影响。评估的不平衡情景(平衡、轻微不平衡、医院和社区)展示了班级比例偏差如何降低有效学习多样性并增加对多数班级的偏见(

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

结果表明,提出的基于生成式人工智能的框架能够通过跨异构数据集的咳嗽信号检测COVID-19。如 表4表6所示,GAN–VAE混合模型表现最佳,准确率97.2%,AUROC为0.953,同时具有高精度、召回率、F1评分和特异性,显示出分类性能平衡。

当生成模型与判别分类器结合时,性能持续提升。GAN–DCNN和VAE–ADCNN均优于各自基线模型,表明生成增强增强了特征学习和泛化,尤其是在类别失衡和有限的临床验证数据中。MFCC特征在数据集中提供了最强的个体判别表现。虽然色度和光谱对比度特征单独表现较低,但与MFCCS结合后,在异质记录条件下提升了鲁棒性。

数据集评估确认了COUGHVID在训练中与Virufy在外部验证上的互补作用。个体、跨数据集及综合评估的稳定结果表明具有合理的泛化能力。该系统应被解释为非侵入性筛查和决策支持工具,而非RT-PCR检测的诊断替代品,并有望用于初步风险评估.......

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者未报告潜在利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们衷心感谢计算机科学与工程学院的教师和研究导师在撰写本文期间给予的宝贵指导、持续支持和建设性反馈。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
咳嗽病毒数据集& Eacute;科尔理工学院Fé和可爱;洛桑联邦理工学院(EPFL)公开发行(2021年)众包咳嗽音频数据集,含自我报告元数据和部分医生注释;主要用于训练和数据增强。
CUDA 工具包NVIDIA11.3GPU加速框架用于加速模型训练和推理。
LibROSA开源0.9音频分析库,用于重采样、分割、MFCC提取和频谱特征计算。
Linux 操作系统正典Ubuntu 20.04 LTS操作系统用于所有实验和模型训练。
Matplotlib开源3.5用于绘制数据集分布和评估结果的可视化库。
数字派开源1.21用于数组操作和信号处理操作的数值计算库。
NVIDIA GPUNVIDIA特斯拉 / RTX 级别用于训练深度和生成式模型的图形处理单元。
Python 编程语言Python 软件基础3.8用于数据预处理、特征提取、模型开发和评估的核心编程环境。
PyTorchMeta(Facebook 人工智能研究)1.12用于实现GAN、VAE、DCNN及基于注意力的DCNN模型的深度学习框架。
Scikit-learn开源1用于数据拆分、类权重和性能指标计算的机器学习库。
科幻开源1.7用于音频预处理和信号转换的科学计算库。
Virufy 数据集维鲁菲公开发行(2021年)临床采集的咳嗽记录,使用RT-PCR–经过验证的COVID-19标签;仅用于外部验证和跨数据集评估。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al.

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

相关文章