本研究在沙特阿拉伯数据集上探讨了多种用于哮喘检测的机器学习算法。与采用机器学习在临床数据集上进行哮喘诊断的先进方法相比,该方案在诊断准确率上提升了3.9%,表现更佳。
研究文章
本研究在沙特阿拉伯数据集上探讨了多种用于哮喘检测的机器学习算法。与采用机器学习在临床数据集上进行哮喘诊断的先进方法相比,该方案在诊断准确率上提升了3.9%,表现更佳。
研究表明,慢性疾病(包括哮喘)的增加已被发现。沙特哮喘患者的数量令人担忧,原因是气候条件和生活方式,尤其是在疫情后时代。它需要通过开发智能系统来早期检测哮喘,从而预防疾病或实现早期治疗,从而减少感染。本研究利用机器学习开发早期追踪哮喘症状的工具。尽管此前已有多种尝试将机器学习应用于预测哮喘的发生。然而,关注疾病在症状出现前阶段的识别,尤其是在沙特阿拉伯的背景下,是一个相对被忽视的领域。本次研究的数据集来自沙特阿拉伯达曼的法哈德国王大学医院,包含对患者进行的标准检测,包括血液检测、病毒检测和生物化学检测。该数据集包含17项显著特征,涵盖328名哮喘患者:165人为阳性,163人为阴性。这里选择的应用方法包括随机森林(RF)、人工神经网络(ANN)、支持向量机(SVM)和朴素贝叶斯(NB)。这些方法的选择均基于其独特特征。实验结果显示,射频、垂直磁性微调和人工神经网络(ANN)方法均获得94%的准确率,为最高准确率,且比技术水平提升了3.9%。值得注意的是,17个可能特征中有9个被用来实现上述准确性。尽管射频、垂直磁场和人工神经网络的精度相同,人工神经网络的误差代价更高。因此,基于结果模式,射频和垂直望必叶显影更优,因此建议用于该问题。
经过广泛研究,研究人员观察到慢性疾病变得越来越普遍,1.哮喘是一种慢性气道炎症性疾病,其特征是反复出现呼吸困难和喘息发作。哮喘的患病率在全球范围内有所不同,儿童和成人均为1%至20%,影响着数百万人。这些大规模变化与环境差异有关,包括各国的差异,以及不同评估工具的使用和哮喘流行病学定义的不同。与其他几种知名慢性疾病相比,哮喘的致死率相对较低2。然而,报告指出沙特阿拉伯的哮喘发病率正在上升3.4%。
哮喘是一种慢性炎症性疾病,会导致腔内狭窄。航空路线的狭窄是由于体液释放的扩展以及支气管分隔带因水肿、上皮下纤维化和平滑肌肥大而增厚所致。由多种细胞类型驱动的病理生理装置,包括免疫细胞,已被用于评估这些疾病5。由于恶劣的天气条件以及沙特阿拉伯主要的室内生活生活方式,哮喘是最普遍的慢性疾病之一。多项调查显示哮喘的压倒性发病率为6。该疾病已成为一个重大问题,需要早期响应系统,以帮助减少事件数量,并使早期干预能够预防或治愈疾病。
与个人不同,哮喘对社区和家庭有深远影响。如果不加以控制,它会对患者的生活施加严峻限制,并阻止他们进行许多日常活动。在沙特阿拉伯,恶劣的天气条件,包括炎热的气候、广泛的沙尘暴以及过度使用室内空调/制冷系统,都是哮喘的重要诱因。沙特胸腺学会(STS)在提供最佳呼吸道感染药物方面做出了显著努力。然而,在疫情后(COVID-19)情境下,积极诊断哮喘仍需降低感染率。进一步推断,家族史、吸烟和过敏性鼻炎是沙特成年人患哮喘最重要的风险因素之一。建议进行更多研究,以探讨奠定研究基础的其他因素。
本研究结合以往关于哮喘诊断的研究,旨在提升诊断准确性。提出的技术包括随机森林(RF)、人工神经网络(ANN)、支持向量机(SVM)和朴素贝叶斯(NB),已被早期研究采用,显著提升了诊断结果。例如,研究人员在第8、9、10项研究中使用了人工神经线(ANN)、垂直量函数(SVM)和抗衡(NB)。在本次研究中,机器学习方法被研究为辅助预警系统,能够在最早阶段(症状出现前期)检测哮喘疾病的细微迹象。沙特阿拉伯哮喘疾病的普遍性,尤其是在疫情后时期,主要因素包括因恶劣天气导致的室内生活方式、空调管道和沙尘暴等因素。然而,目前尚无值得关注的研究探讨近期观察到的关键因素。为弥补这一研究空白,本研究旨在探讨机器学习在沙特成年人哮喘早期检测中的作用。此外,主要目标是以最少的特征实现尽可能高的准确性。尽管过去已有可识别的尝试利用机器学习预测哮喘疾病8,9,10。本研究旨在首次利用从东部省份一家公立医院获得的沙特阿拉伯数据集,重点关注早期诊断(预防性诊断)。机器学习(ML)被认为是从收集到的数据中提取知识的方法11,12。它通过使用多种机器学习技术,通过学习早期实例获得的预测精度。机器学习涵盖多种方法、算法和策略,用于解决广泛医学领域的分析和预测问题,如疾病早期检测13,14。
已有多项研究利用各种技术预测哮喘疾病。研究人员开发了一种人工神经网络(ANN),用于根据动态和静态患者测试进行哮喘分类。人工神经网络利用肺功能测量、冲动振荡仪(IOS)、听诊、过敏结果及症状信息等测量参数。这些明确的信息使人工神经网络能够建议合适的哮喘分类。同样,研究人员开展了一项研究,以应对诊断胸部疾病的挑战。支持载体机(SVM)和自适应SVM(ASVM)方法被用于诊断哮喘等胸部疾病。所有胸部疾病的分类准确性均采用ASVM方法实现。研究人员使用了多种神经网络结构,如多层神经网络(MLNN)配合反向传播算法(BPA),具有一层和两层隐藏层,概率性 神经网络(PNN)、学习向量量化(LVQ)和一般回归神经网络(GRNN),用于胸部疾病诊断,包括哮喘疾病15。此外,一些机构还开展了一项比较研究,旨在利用人工免疫系统(AIS)诊断胸部疾病。上述研究利用各自不同的数据集实施了多种结构来诊断胸部疾病问题。哮喘方面,使用AIS获得最高效果,整体准确率为90.91%。此外,研究人员还考察了深度神经网络(DNN)在提高哮喘诊断准确性的有效性,并比较了不同机器学习算法的预测性能,特别是逻辑回归和SVM的应用。研究显示,利用哮喘体征模型进行实证测试,更能准确诊断哮喘9。另一项研究展示了利用远程监测数据的机器学习在哮喘恶化发生前预测的显著能力,采用SVM和Naïve Bayes等机器学习方法实施实验10。
除此之外,研究人员还采用了多种机器学习技术来预防性诊断阿尔茨海默病(AD),包括SVM、k-NN、自适应增强(AdaBoost)和极端梯度增强(XGBoost)17。研究人员还进行了一项初步诊断糖尿病的研究,探讨了四种机器学习方法,分别是NB、SVM、K-NN和ANN。沙特阿拉伯数据集的前三个特征平均准确率最高,达到68%。测量技术的表现基于准确性、精度、回忆率和F1评分进行比较。ANN获得了最高的分类准确率,达到77.5%。同样,同一组研究人员还尝试了四种分类技术——即NB、SVM、K-NN和ANN——来预防性诊断慢性肾病,应用于沙特阿拉伯数据集19。此外,作者还进行了一项研究,利用四种机器学习技术:ANN、SVM、RF和NB,初步诊断甲状腺癌。作者利用沙特阿拉伯数据集中的14个特征,获得了最高的平均准确率95%。测量技术的表现通过准确性、精度、回忆率和F1评分进行了比较。RF获得了最高的分类准确率90.91%。研究人员还进行了两项研究,在主动诊断类风湿关节炎方面取得了显著成果。多种机器学习技术,如SVM、逻辑回归(LR)和AdaBoost,被列入候选并作为投票集合的候选技术。最初,使用一个数据集,另一个通过应用SMOTE进行平衡。这种新型投票集合技术通过两种顺序特征选择方法进行了测试。也就是说,采用前向和后向选择,寻找特征空间中呈现最高指标的最佳子集。使用原始数据中的30个特征和顺序前向特征选择技术,获得的百分比具有希望,准确率、召回率和精度分别为94.03%、96%和93.51%21。同样,医学及相关领域的其他智能方法也见于许多研究中,22、23、24、25、26。
本研究提出的技术包括射频、虚拟显影分析、ANN和NB,因为它们在类似问题上取得了卓越成果。在本次研究中,通过实验获得的结果。经过多项优化步骤和特征选择,所提出的技术在针对目标数据集的哮喘诊断方面具有前景。
访问受限。请登录或开始试用以查看此内容。
本节介绍了在拟议哮喘诊断方法中研究的机器学习算法。选择该方法的标准和原因基于全面的文献综述以及长期处理多种慢性病预防性诊断的历史,27、28、29、30、31。这些算法产生了有希望的结果。本研究中使用的所有材料和工具均列于 材料表中。
支持矢量机(SVM)
SVM算法是模式识别和分类领域最成功的算法之一,32。它采用二元分类,将训练的向量集合分为两类。它属于监督学习算法家族,期望输出在监督32下生成。与其他机器学习分类算法相比,SVM在分类性能方面提供了更好的结果。因此,它被广泛应用于语音识别、人脸识别和手写识别等多种领域。此外,SVM也被应用于疾病预测和资源预测等多个领域。此外,由于其对噪声或过拟合不敏感,SVM能够处理不平衡数据,这在医疗诊断中是典型情况,阳性病例数量少于阴性病例32。
在分类中,SVM通过绘制决策边界来区分两类,通过区分一个或多个特征向量来预测标签32。决策边界称为超平面,它是每个类中距离最近数据点最远的部分。这些数据点被称为支撑向量。 图1 显示了线性可分数据中的一些候选超平面。方程1展示了超平面方程,方程2和方程3显示了位于平面32上下的元素:
超平面方程(1)
这里, w 是表示权重的矢量, x 是表示输入的矢量, b. 表示潜在偏置。
对于所有j,满足
= +1(2)
对于所有i,满足
= -1(3)

图1:一个典型的SVM,具有两个可分离类。 图示展示了一个典型的 SVM,其可分为两个可分离类。缩写;SVM = 支持向量机。 请点击此处查看该图的放大版本。
人工神经网络(ANN)
人工神经网络是一种软计算中的计算智能技术,模拟人脑系统的功能。它拥有大量相互连接的神经元,33。它是可监督机器学习算法之一,能够从示例数据集中学习并通过学习提升其性能,产生有用的输出33。ANN的架构由多个层组成:输入层、隐藏层和输出层。每个核均由一组相连神经元组成33。
接收外部数据的神经元会进行一些处理,然后将数据发送到另一层,称为输入层。输入层的目的不是对数据执行复杂处理;它只是复制输入值并将其发送到下一层33。输出层包含为用户程序生成数据的神经元。在这两层之间,隐藏层作为可选层用于执行计算过程。隐藏层作为中间层,接收输入神经元的输入,对其进行数学运算,然后将结果传递给另一个第33层。 图2 展示了人工神经网络的架构。

图2:典型人工神经网络结构中的前馈与反向传播。 图示中展示了典型人工神经网络结构中带有反向传播的前馈网络。 缩写;ANN = 人工神经网络。请点击此处查看该图的放大版本。
前馈神经网络是一种将输入数据以正向存储的方法。反向则发生反向传播过程,神经网络权重以倒退方式更新以获得梯度,使用具有多个隐藏层的神经网络。这一过程的缺点是梯度会消失或爆炸。激活函数保持其人工神经网络的非线性特性,使其能够学习输入和输出数据之间的详细关系,这被宣告为通用近似。 图3 展示了人工神经网络的主要架构。它还展示了对每个神经元输出施加的激活函数,该输出代表所有输入权重的总和。偏置包含所有权重的总和,包含在神经元输入中。

图3:ANN的典型单感知神经元。 图示典型人工神经网络中的单个感知元。缩写:ANN = 人工神经网络。 请点击此处查看该图的放大版本。
随机森林(RF)
射频是机器学习中著名的分类算法之一。它由多个独立的决策树组成,作为一个整体协作,最终产生29个最终输出。RF成功运行的基本理念是它由许多中度无关联的树木组成(形成森林),它们充当一个委员会。因此,它们将比所有独立运行的模型更高效。射频算法主要由一组研究人员开发。为了更好地理解射频的工作原理,必须了解决策树35。它同样适用于离散和连续问题,具体来说,分别是分类、检测和回归。森林中树木越多,结果越接近准确,但计算复杂度增加36,如图4所示。

图4:随机森林示意图。 此图展示了典型随机森林的示意图。 请点击此处查看该图的放大版本。
天真贝叶斯(NB)
朴素贝叶斯(NB)是一种利用贝叶斯定理来分类物体的分类算法。这是一种在大多数医学领域非常流行的方法,尤其是在症状诊断方面。在这种方法中,对象采用了主要独立性假设,这使得属性之间的关系彼此独立。由于其天真性质,它是机器学习中最简单的分类算法之一。基于给定数据集,NB确定了某一特定输出的概率。NB模型易于开发,能够管理大量数据,是一种复杂且计算量较轻的算法。此外,它还能提供有限的功能,因此获得了数值和名义上的知识。鲁棒性和简单的学习解释也是NB分类器的潜在优势。如果仅针对有限的数据量,结果将相对不准确。它依赖于巨大的记录,而这些记录被认为不如其他技术精确37。
统计分析
对数据集进行统计分析有助于可视化和理解数据集的模式,从而更好地进行数据预处理和建模。为此,采取了以下步骤。首先,为了调查人口特征在积极和负面群体之间是否不平衡,包括年龄和性别,会在SPSS软件上进行统计分析。其次,如果满足正态分布和方差均匀性,则使用独立样本t检验汇总定量数据,或者使用Man-Whitney U检验。最后,分类数据采用卡方检验或费舍尔精确检验38进行汇总。
实现
数据集描述
本研究数据集由沙特阿拉伯达曼的法哈德国王大学医院获得,经机构审查委员会(IRB)批准。上述数据是根据患者标准测试收集的。哮喘通常通过患者中的标准检测来诊断,包括血液检测、病毒检测和生物化学检测。本研究招募患者及健康对照组(HC)基于医院内医生建议进行的标准分诊和病理检测进行临床评估。临床纳入和排除标准由医生根据实验室结果确定。随后,提供了合格且经验证的数据用于研究。数据集包含十七个属性,因为所有哮喘患者都可用。数据集共包含328个实例,其中165个哮喘阳性,163个哮喘阴性。正负组的性别和年龄分布见 表1。
| 实例 | 阳性 | 阴性 | |
| 男性 | 145 | 107 | 38 |
| 女性 | 183 | 57 | 126 |
| 总计 | 328 | 164 | 164 |
表1:数据集性别分布。下表显示了数据集中的性别分布。
表2 显示了两组之间的年龄分布。
| 年龄范围 | 年龄分布(班级=1) | 年龄分布(班级=0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
表2:数据集年龄分布。 下表显示了数据集中的年龄分布。
年龄(曼-惠特尼U测试中p < 0.001)和性别(卡方检验中p < 0.001)在阳性组和阴性组之间存在不平衡。然而,招聘过程中没有偏见。据认为,这种不平衡分布可能反映了该患者群体独特的年龄分布。纳入标准包括疾病存在与缺失的临床因素;会考虑包括性别、年龄和当地人口在内的人口统计。此外,这些数据是在知情同意下收集的。年龄和性别作为功能集的潜在特征,如下所述。然而,明确的基于年龄和性别的分析不在研究范围内,留待未来工作。
数据集以数值形式存储。“类别”列包含0和1的值,其中0代表“正常患者”,1代表“哮喘患者”。
为此,使用了以下十七项属性:
类别:(0 = “正常”,1 = “哮喘患者”)
1. 以年龄为单位的年龄(AGE)
2. 性别(1 = 男性,0 = 女性):性别
3. 嗜碱性粒细胞(BASO)
4. 嗜酸性粒细胞(EOS)
5. 血细胞比容(HCT)
6. 血红蛋白(HGB)
7. 淋巴细胞(LYM)
8. 平均血球血红蛋白(MCH)
9. 平均血球血红蛋白浓度(MCHC)
10. 平均微粒体积(MCV)
11. 单核细胞(MONO)
12. 平均血小板体积(MPV)
13. 中性粒细胞功能(NEUT)
14. 血小板计数(PLATELET_COUNT)
15. 红细胞计数(RBC)
16. 红细胞分布宽度(RDW)
17. 白细胞(WBC)
数据集的统计特征
为更好地理解,后续表38中展示了该数据集的统计分析。 表3 显示了所考虑数据集的平均值、中位数、标准差、最大值和最小值。
| 狠 | 中位数 | 标准差 | 马克斯 | 敏 | |
| 年龄 | 39.1 | 36 | 18.136 | 93 | 2 |
| 性别 | 0.442 | 0 | 0.4974 | 1 | 0 |
| 巴索 | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| 林普 | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| 多重价值 | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| 莫诺 | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| 多用途车 | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| 中极 | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| 皇家加拿大皇家银行 | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| 级别 | 0.5 | 0.5 | 0.5008 | 1 | 0 |
表3:数据集的统计特征。 下表列出了数据的统计特征。
此外, 表4 显示了每个属性与类属性之间获得的相关系数。其值介于0(相关性最低)到1(相关性最高)之间。它作为初步统计分析添加,用以解释数据集属性。MPV、性别、HGB、MCHC和年龄是最重要的特征。
| 属性对 | 相关系数 |
| 年龄 | 0.212473 |
| 性别 | 0.423584 |
| 巴索 | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| 林普 | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| 多重价值 | 0.013022 |
| 莫诺 | 0.055476 |
| 多用途车 | 0.564992 |
| 中极 | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| 皇家加拿大皇家银行 | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| 级别 | 1 |
表4:与类属性的相关性。 下表显示了属性(特征)与类属性之间的相关性。
实验装置
在本次研究中,使用了Python编程语言对收集到的数据集进行预处理。由于人为错误,数据录入和选择过程中会缺少特定数值。已使用补补技术处理数据集中的缺失值。它是通过用属性的平均值替换缺失值来实现的。由于其简单性、模型兼容性以及样本均值的保持,正如与医疗专业人员讨论的那样。此外,特征选择还通过相关系数来对属性进行排序。选择相关值较高的特征与完整特征集一同进行分析。Python 库已被用于实现所提方法、超参数调优以及获得结果。特征选择和消除通过属性选择方法完成,以最准确地识别特征组。此外,Python还使用10重交叉验证和直接配分比率评估方法来评估准确率,具体方法由给定的方程39,40所规定。最后,计算了所有评估方法的产出均值,以比较所用评估方法,并确定平均准确率最高的方法38。此外,还利用SVM、ANN、RF和NB等最优参数生成了混淆矩阵。随后,通过计算F1评分进行假阳性(FP)、假阴性(FN)、真阳性(TP)和真阴性(TN)比率的比较,F1评分是比较最佳方法41,42的高效指标。
评估指标
为了评估所提方法的性能,考虑了四个知名的性能指标。具体来说,是准确性、精准度、回忆和F1分数。分类准确性是主要衡量标准,因为每个实例计算正确分类的百分比。精度是预期的TP总点数。回忆是指TP的数量超过每个实际阳性。每个级别的F1分数表现。根据输出能力,得到以下指标43、44、45:
真阳性(TP):正确诊断为哮喘的结果。
假阳性(FP):因被误诊为哮喘而产生的结果。
真阴性(TN):正确诊断为非哮喘的病例结果。
假阴性(FN):因被误诊为非哮喘而产生的结果。
(4)
(5)
(6)
优化策略
为了确定每种提议方法的最优参数,采用了网格搜索技术。网格搜索方法中会放置特定的参数可能值。因此,它能够发展出最佳的性能以提升精度。
图5–7 展示了网格搜索技术在所有四种提议方法的成果,以及在数据集上与前18个属性的辅助下实现过程。 图5 展示了不同参数值下获得的SVM精度。对应多种核类型的成本和伽马的输入值如下:
核类型:线性核、径核核、S形核和多项式核。
伽马值:0.001和0.0001。
费用:1、10、100和1000。

图5:不同成本和伽马类型的单向标量机(SVM)。 此图展示了不同成本和伽马类型的SVM行为。缩写;SVM = 支持向量机。 请点击此处查看该图的放大版本。
对于射频, 图6 中系统性输入值如下:
参数名称及其相应值如下:
功能数量:“自动”、“sqrt”。
最大深度:1、3、5、7。
MIN样本分配:2、3、4、5。
MIN样本叶片:2、3、4、5。

图6:不同深度值和最小样品叶的射频。 图中展示了不同深度和最小采样叶值下的射频行为。缩写;RF = 随机森林。 请点击此处查看该图的放大版本。
对于人工神经网络,分析输入值如图7所示。
参数名称及其相应值如下:
隐藏图层尺寸:(50, 50, 50), (50, 100, 50) 和 (100,)。
激活:'tanh'和'relu'。
解算器:'sgd','adam'。
阿尔法:0.1、0.01、0.001、0.0001、0.5、0.005、0.0005和0.05。
学习速度:“恒定”和“适应性”。

图7:具有不同α值和隐藏层尺寸的人工神经网络。 图示了人工神经网络在不同α值和隐藏层尺寸下的行为。缩写;ANN = 人工神经网络。 请点击此处查看该图的放大版本。
| 分类器 | 参数 | 价值 |
| 特别空间管理 | 伽马 | 0.0001 |
| 内核类型 | “RBF” | |
| 成本'C” | 10 | |
| 随机状态 | 42 | |
| 射频 | 最大深度 | 3 |
| Min 样本叶片 | 2 | |
| 最小样本拆分 | 2 | |
| 随机状态 | 42 | |
| 安 | 激活 | “雷鲁” |
| 阿尔法 | 0.001 | |
| 隐藏层的大小 | (50,50,50) | |
| 学习速率 | “恒常” | |
| 求解器 | “亚当” | |
| 随机状态 | 42 |
表5:拟议分类器的最优参数总结。 下表总结了所提出分类器中获得的最优参数。
访问受限。请登录或开始试用以查看此内容。
特征选择的影响
在本研究中,特征选择采用递归特征消除相关系数方法。相关系数用于根据相关系数从高到低排序特征。递归特征消除用于帮助选择适合模型的特征,因为它会逐步剔除最弱的特征,直到只剩下一个特征。每个过程都运行四个选定的分类器,进行十重交叉验证,以找到准确率最高的组别。以下是消元法的过程:
首先,包括NB、RF、SVM和ANN在内的算法包含N个特征。其次,计算所有特征的相关系数,并选取顶部N/2特征。第三阶段重复,直到只剩下一处遗迹。最后,通过直接划分选择表现最好的特征集。此外,为了确保性能的公正衡量,在交叉验证过程中每个折叠都进行了特征选择。这是因为所选特征仅基于训练实例,验证实例完全“未被看见”。一半的特征用于获得平均结果,即九个特征。使用九个特征,NB、RF、SVM和ANN算法的平均准确率为91.29%。然而,人工神经网络、射频和单行微量模型使用九个特征实现了93.94%的准确率,高于早期使用更大特征集的研究报告的准确率,如 表6所示。...
访问受限。请登录或开始试用以查看此内容。
本研究采用了多种机器学习算法,包括SVM、ANN、RF和NB。经过多次实验、微调超参数和特征选择,得出SVM、人工神经网络(ANN)和射频(RF)诊断准确率为94%,而NB则较低,仅为83.33%。结果通过10折交叉验证和优化特征选择以及最佳分离比进行了验证。根据现有数据,患者17项参数按相关系数排序,结果显示低MPV和GENDER与哮喘正相关性最高。另一方面,HCT和BASO显示强烈负相关,表明呼吸应激下存在全身性炎症和细胞迁移。其他常见的免疫因素包括EOS,其中高周酸性粒细胞计数表明疾病的严重程度。
与利用机器学习进行哮喘诊断的临床数据集的先进方法相比,该方案表现更佳,诊断准确率提升了3.9%。值得注意的是,16.17年的研究均达到了90.91%的最高准确率。值得注意的是,当前的研究是计算机科学家与临床医生之间的合作成果。从数据集获取到结果和讨论,每个阶段都有临床团队参与,并持续收集反馈。他们对...
访问受限。请登录或开始试用以查看此内容。
数据集由医院根据IRB-2020-09-429获取。作者声明他们对本研究没有利益冲突报告。该研究作为预印本被添加到Research Square仓库,引用为50。
作者贡献:
构思由S.O.、M.I.B.A.和A.R.完成;监督由S.O.、M.I.B.A.和J.A.负责;原稿由S.S.A.、E.A.和Z.A.共同完成;实施工作由S.A.A.、Y.A.和R.A.负责;验证由J.A.、M.A.和S.D.完成;数据整理由A.B.、Y.A.、E.A.和Z.A.负责;评论与编辑由A.R.、S.D.和A.B.负责;项目管理由A.R.、S.D.和M.A.负责,资金获取则由A.B.、S.D.和A.R.负责。
作者感谢医疗专业人员在验证研究结果方面的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Excel 365 | Microsoft | Excel 365 | 用于存储csv格式的原始数据 |
| Laptop/Machine | Dell | XPS9320 | RAM 16GB, 12代Intel(R) Core(TM) i7-1260P |
| Mlxtend 0.23.4 | Google colab Notebook | Mlxtend 0.23.4 | 用于模型构建和训练 |
| Numpy 2.0.2 | Google colab Notebook | Numpy 2.0.2 | 用于模型构建和训练 |
| Pandas 2.2.2 | Google colab Notebook | Pandas 2.2.2 | 用于模型构建和训练 |
| Python 3.12.12 | Google colab Notebook | Python 3.12.12 | 用于模型构建和训练 |
| Sklearn 1.6.1 | Google colab Notebook | Sklearn 1.6.1 | 用于模型构建和训练 |
| SPSS | IBM, 美国 | 版本 26.0 | 用于统计分析 |
| XGbbost 3.1.2 | Google colab Notebook | XGbbost 3.1.2 | 用于模型构建和训练 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可