需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

一种基于生成式人工智能的咳嗽音频信号新冠筛查框架

263 次观看

DOI:

10.3791/69874

2026年3月10日

本文内容

摘要

本研究提出了一种基于生成式人工智能的框架,该框架整合了生成对抗网络(GANs)、变分自编码器(VAEs)以及基于注意力机制的深度卷积网络,用于从咳嗽音频信号中检测新型冠状病毒肺炎(COVID-19),从而提升检测的鲁棒性、数据平衡性以及跨数据集的泛化能力,实现可扩展的无创筛查。

摘要

咳嗽音频分析为开发支持新冠肺炎(COVID-19)疾病筛查的自动化工具提供了切实可行的途径。尽管相关研究日益增多,但许多现有方法仍对噪声、类别不平衡和数据集差异性较为敏感,限制了其可重复性。本研究提出一种基于结构化生成式人工智能的新冠肺炎检测方法,利用咳嗽声音录音进行识别。实验采用两个公开可用的数据集 COUGHVID 和 Virufy 进行,这两个数据集均包含标注的咳嗽样本。所提出的方案包括依次进行的预处理阶段,如咳嗽片段分割、去噪和信号归一化。随后通过梅尔频率倒谱系数、音色特征和频谱对比度特征提取声学特性。为提升表征学习能力并缓解数据不平衡问题,采用一种融合变分自编码器(Variational Autoencoders)与生成对抗网络(Generative Adversarial Networks)的混合生成框架,用于合成特征层级的样本。分类任务则通过深度卷积神经网络(Deep Convolutional Neural Networks)和基于注意力机制的 DCNN 模型实现。性能评估结果表明,引入生成式数据增强后,模型表现持续优于非生成式基线方法,在所评估的数据集上最高分类准确率达到 97.2%,AUROC 达 0.953。这些结果验证了生成式建模在提升基于咳嗽声音的新冠肺炎检测性能方面的有效性,并为未来在声学健康监测领域的研究建立了可重复的分析流程。

引言

呼吸声学 increasingly 被探索作为健康评估的非侵入性信息来源,特别是在感染性和肺部疾病背景下。信号处理和人工智能(AI)的进步使得咳嗽和呼吸声音的自动分析成为可能,支持其作为数字生物标志物的应用。最近的研究表明,使用智能手机、可穿戴设备或临床传感器中嵌入的麦克风采集的呼吸声音,可通过深度学习模型有效分析以检测 COVID-19 感染1,5。这些进展凸显了基于音频的筛查作为常规诊断程序的一种快速、无接触且可扩展的补充手段的潜力。由 SARS-CoV-2 病毒引起的 2019 冠状病毒病(COVID-19)主要影响呼吸系统,并引起气流动力学、肺功能和声道行为的可测量变化。尽管逆转录-聚合酶链式反应(RT-PCR)检测仍是诊断的参考标准,但其在物流上的限制和较长的周转时间限制了其在大规模或持续筛查中的适用性,从而推动了基于呼吸声音分析的替代方法的研究。

越来越多的研究文献探讨了利用咳嗽、呼吸和语音信号进行人工智能驱动的新冠肺炎检测。如表1所示,先前的研究探索了多种数据集、声学特征表示方法(例如MFCC、STFT、基于频谱图的特征)以及从经典机器学习模型到深度卷积、循环神经网络、基于注意力机制和Transformer架构等多种学习范式8,

访问受限。请登录或开始试用以查看此内容。

方案

拟议方法

本研究提出了一种基于生成式人工智能的框架,用于通过咳嗽信号检测新型冠状病毒肺炎(COVID-19)。该框架将生成模型与判别分类器相结合,并在训练和评估过程中严格分离数据。图1展示了所提出的GAN–VAE–ADCNN框架的详细架构,显示了从音频预处理和特征提取,到通过变分自编码器(VAE)进行潜在表示学习,再利用生成对抗网络(GAN)生成合成特征,最终通过深度卷积神经网络(DCNN)和基于注意力机制的深度卷积神经网络(ADCNN)进行分类的完整流程。该图表明,生成组件仅在训练阶段使用,而分类则由判别模型完成。

用于 COVID-19 咳嗽检测的 VAE、GAN、ADCNN 音频信号处理示意图。
图 1:GAN–VAE–ADCNN 架构概述。所提出的混合流程示意图,其中....

访问受限。请登录或开始试用以查看此内容。

结果

数据集构成与类别分布分析

经过预处理和分割后,COUGHVID 和 Virufy 数据集在数据集规模和片段密度方面均表现出显著差异。COUGHVID 提供了 444 条录音中的 428 条(96.4%),以及提取出的 1,953 个咳嗽片段中的 1,719 个(88.0%),证实其作为模型训练和生成式增强的主要数据集的作用(图 3)。相比之下,Virufy 仅贡献了 16 条录音(3.6%)和 234 个咳嗽片段(12.0%),专门保留用于外部跨数据集评估。值得注意的是,尽管 Virufy 规模较小,但其每条录音平均产生的片段数量高于 COUGHVID,反映出录音结构和分割结果的差异(图 3)。

除了数据集规模的差异外,类别分布分析还凸显了类别不平衡对训练稳定性和评估可靠性的影响。所评估的不平衡场景(平衡、轻度不平衡、基于医院和基于社区)表明,类别比例的偏斜可能降低有效学习的.......

访问受限。请登录或开始试用以查看此内容。

讨论

结果表明,所提出的基于生成式人工智能的框架能够从异构数据集的咳嗽信号中检测出新冠肺炎。如表4表6所示,GAN-VAE混合模型表现最佳,准确率达到97.2%,AUROC为0.953,同时具有高精确率、高召回率、高F1分数和高特异性,表明其分类性能均衡。

当生成模型与判别分类器结合时,性能持续提升。GAN–DCNN 和 VAE–ADCNN 均优于各自的基线模型,表明生成式数据增强能够提升特征学习能力与泛化性能,尤其是在类别不平衡和临床验证数据有限的情况下。MFCC 特征在各数据集上均表现出最强的单独判别性能。尽管 chroma 和 spectral contrast 特征单独使用时性能较低,但将其与 MFCC 特征结合可提高在异质录音条件下的鲁棒性。

按数据集的评估证实了COUGHVID在训练中的作用与Virufy在外部验证中的作用具有互补性。个体、跨数据集及联合评估中稳定的结果表明模型具有合理的泛化能力。该系统应被视为一种非侵入性的筛查和决策支持工具,而非RT.......

访问受限。请登录或开始试用以查看此内容。

披露

作者未报告任何潜在的利益冲突。

致谢

我们诚挚感谢计算机科学与工程学院的教职员工和科研导师在本文撰写过程中提供的宝贵指导、持续支持和建设性意见。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
COUGHVID 数据集École Polytechnique Fédérale de Lausanne (EPFL)公开发布(2021年)一个通过众包方式收集的咳嗽音频数据集,包含自我报告的元数据和部分医生标注,主要用于模型训练和数据增强。
CUDA ToolkitNVIDIA11.3用于加速模型训练和推理的GPU加速框架。
LibROSA开源0.9音频分析库,用于重采样、分段、MFCC提取和频谱特征计算。
Linux 操作系统CanonicalUbuntu 20.04 LTS所有实验和模型训练所使用的操作系统。
Matplotlib开源3.5可视化库,用于绘制数据集分布和评估结果。
NumPy开源1.21数值计算库,用于数组操作和信号处理运算。
NVIDIA GPUNVIDIATesla / RTX 系列用于训练深度模型和生成模型的图形处理器。
Python 编程语言Python 软件基金会3.8核心编程环境,用于数据预处理、特征提取、模型开发与评估。
PyTorchMeta(Facebook AI Research)1.12深度学习框架,用于实现生成对抗网络(GAN)、变分自编码器(VAE)、深度卷积神经网络(DCNN)以及基于注意力机制的DCNN模型。
Scikit-learn开源1机器学习库,用于数据划分、类别加权和性能指标计算。
SciPy开源1.7科学计算库,用于音频预处理和信号变换。
Virufy 数据集Virufy公开发布(2021年)临床采集的咳嗽录音数据,附有经RT-PCR–验证的COVID-19标签,仅用于外部验证和跨数据集评估。

参考文献

  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签