本研究通过采集慢性阻塞性肺疾病(COPD)和呼吸道感染(RTI)患者咳嗽声音数据,结合语音信号处理技术与机器学习算法,成功实现了对两种不同类别的自动分类。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
方法文章
* These authors contributed equally
本研究通过采集慢性阻塞性肺疾病(COPD)和呼吸道感染(RTI)患者咳嗽声音数据,结合语音信号处理技术与机器学习算法,成功实现了对两种不同类别的自动分类。
本研究旨在开发并评估一种基于语音信号分析和机器学习的非侵入性方法,用于区分慢性阻塞性肺疾病(COPD)患者与呼吸道感染(RTI)患者。研究采集了25名COPD患者和25名RTI患者(作为对照/比较组)的固定模式语音信号。通过多维度语音特征分析,识别出在两组间具有显著差异的特征。筛选出具有统计学显著性的特征后,进行降维处理。随后训练并评估逻辑回归(LR)和随机森林(RF)模型在区分COPD与RTI任务中的分类性能。最初分析了超过400个语音特征,其中有18个特征在COPD与RTI患者之间表现出高度显著差异(P < 0.05)。在区分COPD患者与RTI患者的任务中,LR模型在测试集上达到曲线下面积AUC为0.95,显著优于RF模型(AUC = 0.76)。本研究证明了利用语音分析结合机器学习,尤其是LR模型,作为区分COPD与RTI的一种有前景的非侵入性工具的可行性,为该语音分析方法在需要进行呼吸系统疾病鉴别诊断的临床环境中的实际应用和进一步优化奠定了基础。
慢性阻塞性肺疾病(COPD)和呼吸道感染是全球范围内导致死亡和疾病负担的重要原因。COPD 是一种主要由吸烟引起的、影响气道和肺实质的慢性炎症性疾病,其特征包括持续性咳嗽、呼吸困难以及痰液分泌增多1。世界卫生组织预计,到2030年,COPD 将成为全球第三大死因,带来巨大的经济负担2,3。相比之下,呼吸道感染(RTI)约占全球疾病负担的6%,超过了缺血性心脏病、HIV 感染、癌症、疟疾和腹泻类疾病的疾病负担4。
由于这两种疾病的临床表现具有显著相似性,尤其是咳嗽这一常见症状,因此在早期对这些疾病进行准确鉴别对于有效治疗至关重要5,6。传统的诊断方法主要依赖于临床症状评估、肺功能检测以及实验室分析7。尽管慢性阻塞性肺疾病(COPD)的传统诊断方法在识别和评估病情方面是有效的,但在临床实践中仍存在若干局限性,包括诊断准确性不足、早期诊断能力有限、对疾病异质性的理解不充分以及缺乏动态监测手段8,9,10,11。与传统的COPD诊断方法相比,语音诊断技术作为一种新兴的辅助工具,在早期检测、无创诊断和动态监测方面具有诸多优势。
随着语音分析技术的进步,尤其是咳嗽声音的自动分析,快速诊断应用展现出新兴潜力。研究表明,咳嗽声音包含大量关于肺部疾病的信息,其声学特征能够反映气道健康状况的变化12。近年来,基于机器学习的语音特征分析技术已被用于慢性阻塞性肺病(COPD)及其他疾病的诊断,并取得了显著成果13,14,15。这些方法通过从咳嗽声音中提取频率、持续时间、振幅等音频特征,并结合机器学习算法进行模式识别,从而实现对疾病的高效分类。
尽管已有部分研究探讨了咳嗽声音分析在疾病诊断中的潜力,但在区分慢性阻塞性肺疾病(COPD)患者与呼吸道感染(RTI)患者方面仍存在显著挑战。这一困难源于两组患者咳嗽声音特征的重叠,加之个体间存在差异。因此,开发能够从咳嗽声音中提取更精确、更具区分度特征的方法,仍是该领域亟待解决的关键问题。
本研究旨在通过采集25名慢性阻塞性肺疾病(COPD)患者和25名呼吸道感染(RTI)患者的咳嗽音频,探索一种咳嗽声音的自动分类方法。通过结合语音特征分析与机器学习算法,我们力求提高COPD与RTI之间疾病鉴别的准确性,从而提升对这两种疾病的早期诊断能力。
访问受限。请登录或开始试用以查看此内容。
本研究经北京中医药大学及其第三附属医院伦理委员会批准。所有参与者均签署书面知情同意书,自愿参加研究。2024年7月至8月期间,从北京中医药大学第三附属医院呼吸内科招募了25名慢性阻塞性肺疾病(COPD)患者组成的队列。同时,组建了一个由25名典型上呼吸道感染(RTI)患者组成的对照组。
1. 受试者选择
2. 研究设计
3. 声学特征库的构建
注意:语音特征指标数据库是一个用于比较分析慢性阻塞性肺疾病(COPD)与呼吸道感染(RTI)患者语音模式的声学特征集合。其方法学架构详见表1。该数据库构建所用的开源代码库已在GitHub上发布并可公开获取(https://github.com/Liteng811/speech-feature-index-database-construction)。以下步骤详细说明了代码的下载与执行过程。
4. 数据分析
注意:在构建语音特征指标数据库后,进行了统计分析。分析方法见表2。采用曼-惠特尼U检验评估慢性阻塞性肺疾病(COPD)组与呼吸道感染(RTI)组之间语音信号特征的差异。
5. 构建逻辑回归(LR)和随机森林(RF)模型
注意:构建逻辑回归(LR)和随机森林(RF)模型的具体方法学框架详见表3。同时,本研究中的LR和RF模型已上传至GitHub(https://github.com/Liteng811/The-distinction-between-COPD-and-respiratory-infections)。下文将主要描述如何从GitHub下载并运行代码。RF模型以Python 3.12.3作为主要编程语言构建。
访问受限。请登录或开始试用以查看此内容。
数据分析结果
本研究成功采用时域分析、频域分析、梅尔频率倒谱系数(MFCC)提取等方法,结合中医诊断理论对特征指标进行调整,分离出超过400个语音特征指标。时域分析是语音信号处理中的关键环节,其重点在于直接处理信号的时间序列数据,以直观理解信号的能量、过零率、线性趋势与包络、自相关特性、幅度调制等属性16,17,18,19,20。频域分析则是通过傅里叶变换将时域信号转换为频域信号,以考察信号的频率组成。该变换可揭示频谱中信号的各个频率成分,从而加深对其特性的理解。常见的频域分析方法包括短时傅里叶变...
访问受限。请登录或开始试用以查看此内容。
本研究探讨通过语音信号分析和机器学习技术无创检测慢性阻塞性肺疾病(COPD)的方法。研究收集了25名COPD患者和25名呼吸道感染(RTI)患者的语音数据,使用逻辑回归(LR)和随机森林(RF)算法构建模型。两个模型在总体正确分类样本方面表现出相似的准确性,但AUC值的差异表明,LR模型可能在敏感性和特异性之间提供更优的平衡。后续部分将详细阐述研究结果。
研究表明,LR 模型在测试集上的准确率达到 90%,而 RF 模型为 80%;其中 LR 模型对应的 AUC 值为 0.95,RF 模型对应的 AUC 值为 0.76。这可能是因为 LR 模型固有的简洁性使其对过拟合具有更强的抵抗力,并在小样本数据场景下表现出更高的鲁棒性,从而能够高效利用 18 个关键特征实现精确分类。相反,RF 模型结构较为复杂,在数据量有限的情况下容易对训练集中的噪声过拟合,导致在测试集上的泛化性能显著下降。
最初,在采集数据时管理环境至关重要。在安静的问诊区域采集咳嗽声音,可避免任何外部干扰,确保咳嗽音频的清晰度和精确性。在采样过程中选择并调整录音设备...
访问受限。请登录或开始试用以查看此内容。
作者声明,本研究的发表不存在任何利益冲突。未从任何可能影响本研究结果或解释的商业组织获得财务或非财务支持。本研究的所有方面,包括设计、数据收集、分析和稿件撰写,均独立于任何外部影响而完成。
本研究由国家自然科学基金青年科学基金项目(项目批准号:82104739)和河北省中医药管理局科研项目(项目编号:B2025032)资助。作者谨此感谢在实验过程中提供帮助的所有老师和同学。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数字录音机 | ZOOM | H6 | ZOOM 音频商店 |
| GitHub | Git | 2.47.1.2 | 官方网站 |
| Matlab | MathWorks | R2024b | 官方网站 |
| PyCharm | JetBrains | 2024.1 | 官方网站 |
| Python | Python | 3.12 | 官方网站 |
访问受限。请登录或开始试用以查看此内容。