Article de recherche

Un diagnostic précoce de la maladie asthmatique basée sur l’intelligence computationnelle : une étude de cas saoudite

DOI :

10.3791/70040

16 juin 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’étude actuelle étudie plusieurs algorithmes d’apprentissage automatique sur un ensemble de données saoudien pour la détection de l’asthme. Contrairement aux approches de pointe qui utilisent l’apprentissage automatique sur des ensembles de données cliniques pour le diagnostic de l’asthme, le dispositif proposé obtient de meilleures performances, avec une amélioration de 3,9 % de la précision du diagnostic.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Selon des recherches, une augmentation des maladies chroniques, dont l’asthme, a été identifiée. Le nombre de patients asthmatiques en Arabie Saoudite est préoccupant en raison des conditions météorologiques et du mode de vie, notamment à l’ère post-pandémique. Elle exige une solution pour réduire les infections en développant un système intelligent pour détecter l’asthme à un stade précoce, prévenant ainsi la maladie ou permettant un traitement précoce. Dans cette étude, l’apprentissage automatique a été utilisé pour développer des outils permettant de suivre les symptômes de l’asthme à un stade précoce. Bien qu’il y ait eu plusieurs tentatives antérieures d’application de l’apprentissage automatique pour prédire l’apparition de l’asthme. Néanmoins, se concentrer sur l’identification de la maladie au stade pré-symptôme, en particulier dans le contexte saoudien, est un domaine relativement négligé. L’ensemble de données de l’étude actuelle a été obtenu à l’hôpital universitaire King Fahad, Dammam, Arabie Saoudite, et comprenait des tests standards réalisés sur les patients, notamment des analyses sanguines, des tests viraux et des tests biochimiques. Le jeu de données contient 17 attributs significatifs et comprend des informations sur 328 patients asthmatiques : 165 sont positifs et 163 négatifs. Les méthodes sélectionnées pour l’application ici sont les forêts aléatoires (RF), les réseaux de neurones artificiels (ANN), les machines à vecteurs de support (SVM) et les Bayes naïves (NB). Chacune de ces méthodes a été choisie en fonction de ses caractéristiques distinctives. Le résultat expérimental a révélé que les approches RF, SVM et ANN ont donné 94 %, ce qui est la plus grande précision, et ont amélioré l’état de l’art de 3,9 %. Il convient de noter que neuf des dix-sept caractéristiques possibles ont été utilisées pour atteindre la précision mentionnée ci-dessus. Bien que RF, SVM et ANN atteignent la même précision, ANN a un coût d’erreur plus élevé. Par conséquent, la RF et la SVM sont supérieures selon le schéma des résultats, et elles sont donc suggérées pour ce problème.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Après des recherches approfondies, les chercheurs ont observé que les maladies chroniques sont devenues de plus en pluscourantes 1. L’asthme est une maladie inflammatoire chronique des voies respiratoires caractérisée par des épisodes récurrents d’essoufflement et de sifflement. La prévalence de l’asthme varie à l’échelle mondiale, allant de 1 à 20 % chez les enfants comme chez les adultes, touchant des millions de personnes dans lemonde 2. Ces changements à grande échelle sont liés aux variations environnementales, y compris dans divers pays, ainsi qu’à l’utilisation de différents instruments d’évaluation et de diverses définitions épidémiologiques de l’asthme. L’asthme présente un taux de mortalité relativement faible comparé à plusieurs autres maladies chroniques bienconnues 2. Cependant, des rapports indiquent que le schéma de l’asthme dans le Royaume d’Arabie Saoudite augmentede 3,4.

L’asthme est une affection inflammatoire chronique qui entraîne un rétrécissement de la lumière. Le rétrécissement de la voie aérienne est causé par l’expansion des émissions de fluides corporels, ainsi que par l’épaississement des séparateurs bronchiques dû à l’œdème, à la fibrose sous-épithéliale et à l’hypertrophie du muscle lisse. Des appareils physiopathologiques pilotés par divers types cellulaires, y compris les cellules immunitaires, ont été utilisés pour évaluer cesaffections 5. En raison des conditions météorologiques sévères et d’un mode de vie principalement en intérieur en Arabie Saoudite, l’asthme est l’une des maladies chroniques les plus répandues. Plusieurs enquêtes ont démontré le taux écrasant d’asthme6. La maladie est devenue un problème majeur, nécessitant un système d’intervention précoce pour aider à réduire le nombre d’incidents et permettre une médiation précoce pour prévenir ou guérir la maladie à un stade plus précoce.

Contrairement aux individus, l’asthme a un impact profond sur les communautés et les familles. Si elle n’est pas contrôlée, elle impose des limitations sévères à la vie du patient et l’empêche de s’engager dans de nombreuses activités quotidiennes. En Arabie Saoudite, les conditions météorologiques difficiles, notamment une atmosphère chaude, des tempêtes de sable généralisées et une utilisation excessive des systèmes de climatisation et de climatisation intérieure, sont des facteurs importants de l’asthme. La société thoracique saoudienne (STS) a fait des efforts notables pour fournir les meilleurs médicaments contre les infectionsrespiratoires 7. Cependant, un diagnostic proactif de l’asthme est nécessaire pour réduire le taux d’infection, surtout dans un contexte post-pandémique (COVID-19). Il a également été déduit que les antécédents familiaux, le tabagisme et la rhinite allergique figurent parmi les facteurs de risque les plus importants pour le développement de l’asthme chez les adultes saoudiens. Des recherches supplémentaires ont été recommandées pour examiner d’autres facteurs qui ont posé les bases de l’étude.

Dans cette recherche, en tenant compte des études antérieures sur le diagnostic de l’asthme, l’objectif est d’améliorer la précision diagnostique. Les techniques proposées, incluant la forêt aléatoire (RF), le réseau de neurones artificiels (ANN), la machine à vecteurs de support (SVM) et la naïve Bayes (NB), ont été utilisées dans des études antérieures, apportant des améliorations notables des résultats de diagnostic. Par exemple, des chercheurs ont utilisé l’ANN, la MVS et la NB dans les études8, 9, 10. Dans l’étude actuelle, des approches d’apprentissage automatique ont été étudiées pour servir de système d’alerte précoce détectant même les petits signes de la maladie asthmatique aux premiers stades (stade présymptomatique). La prévalence de l’asthme en Arabie Saoudite, notamment à l’ère post-pandémique, avec des facteurs tels qu’un mode de vie orienté vers l’intérieur dû aux conditions météorologiques extrêmes, les conduits de climatisation et les tempêtes de sable, figurent parmi les principaux facteurs. Cependant, aucune étude remarquable n’examine les facteurs cruciaux observés récemment. Pour combler cette lacune de recherche, la présente étude vise à étudier le rôle de l’apprentissage automatique dans la détection précoce de l’asthme chez les adultes saoudiens. De plus, l’objectif principal est d’atteindre la plus grande précision possible avec le moins de caractéristiques possible. Bien qu’il y ait eu des efforts reconnaissables par le passé pour utiliser l’apprentissage automatique afin de prédire la présence de maladiesasthmatiques 8,9,10. L’étude actuelle vise à utiliser un ensemble de données saoudien, obtenu pour la première fois dans un hôpital public de la province orientale, en se concentrant sur le diagnostic précoce de la maladie (diagnostic préventif). L’apprentissage automatique (ML) est reconnu comme une méthode d’extraction de connaissances à partir de donnéescollectées 11,12. Il fournit une précision de prédiction obtenue à partir du processus d’apprentissage des instances antérieures en utilisant diverses techniques d’apprentissage automatique. L’apprentissage automatique automatique englobe plusieurs méthodes, algorithmes et stratégies pour traiter des problèmes analytiques et prédictifs dans de vastes domaines médicaux, tels que la détection précoce de la présence de maladies13,14.

Plusieurs études ont été menées pour prédire la maladie asthmatique en utilisant différentes techniques. Les chercheurs ont développé un réseau neuronal artificiel (RNA) pour la classification de l’asthme en fonction des tests dynamiques et statiques sur les patients. Les paramètres mesurés de spirométrie, d’oscillométrie impulsionnelle (IOS), d’auscultation, de résultats d’allergie et d’informations sur les symptômes sont utilisés dans le RNA. Les informations définies permettent à l’ANNA de suggérer la classification appropriée de l’asthme. De même, des chercheurs ont mené une étude visant à relever les défis liés au diagnostic des maladies pulmonaires7. Les machines à vecteurs de support (SVM) et les méthodes SVM adaptatives (ASVM) étaient utilisées pour diagnostiquer des maladies pulmonaires telles que l’asthme. La meilleure précision de classification pour toutes les maladies pulmonaires a été obtenue en utilisant la méthode ASVM. Les chercheurs ont utilisé plusieurs structures de réseaux neuronaux, telles que le NN multi-couches (MLNN) avec algorithme de rétropropagation (BPA) à une ou deux couches cachées, le NN probabiliste (PNN), la quantification vectorielle d’apprentissage (LVQ) et la régression générale NN (GRNN), pour le diagnostic des maladies pulmonaires, y compris la maladieasthmatice 15. De plus, certains ont mené une étude comparative visant à diagnostiquer les maladies pulmonaires à l’aide d’un système immunitaire artificiel (AIS). Les études mentionnées ont mis en place diverses structures pour diagnostiquer les problèmes de maladie pulmonaire à l’aide de leurs différents ensembles de données. Pour l’asthme, le meilleur résultat a été obtenu grâce à l’AIS avec une précision globale de 90,91 %. De plus, les chercheurs ont étudié l’efficacité d’un NN profond (DNN) pour améliorer la précision du diagnostic de l’asthme et ont comparé la performance de prédiction de différents algorithmes d’apprentissage automatique, en particulier avec la régression logistique et la SVM. L’étude a montré que le test empirique utilisant le modèle des signes de l’asthme était plus efficace pour un diagnostic précis del’asthme 9. Une autre étude a démontré la capacité significative de l’apprentissage automatique utilisant des données de télésurveillance pour prédire les exacerbations de l’asthme avant qu’elles ne surviennent, grâce à des approches d’apprentissage automatique choisies telles que SVM et Naïve Bayes pour mettre en œuvre leur expérience10.

Par ailleurs, les chercheurs ont utilisé plusieurs techniques d’apprentissage automatique pour diagnostiquer préventivement la maladie d’Alzheimer (MA), notamment SVM, k-NN, boosting adaptatif (AdaBoost) et eXtreme gradient boosting (XGBoost)17. Les chercheurs ont également mené une étude pour diagnostiquer préliminairement le diabète, en étudiant quatre approches d’apprentissage automatique, à savoir NB, SVM, K-NN et ANN. Les trois principales caractéristiques de l’ensemble de données saoudiennes ont affiché la plus grande précision moyenne de 68 %. La performance des techniques de mesure a été comparée en fonction de la précision, de la précision, du rappel et du score F1. L’ANN a obtenu la plus grande précision de classification de 77,5 %18. De même, ce même groupe de chercheurs a expérimenté l’exécution de quatre techniques de classification — à savoir NB, SVM, K-NN et ANN — pour diagnostiquer préventivement la maladie rénale chronique, appliquée au jeu de donnéessaoudien 19. De plus, les auteurs ont mené une étude visant à diagnostiquer primitivement le cancer de la thyroïde en utilisant quatre techniques d’apprentissage automatique : ANN, SVM, RF et NB. En utilisant 14 caractéristiques de l’ensemble de données saoudien, les auteurs ont obtenu la plus grande précision moyenne de 95 %. La performance des techniques de mesure a été comparée en utilisant la précision, la précision, la mémoire et le score F1. Le RF a obtenu la plus grande précision de classification de 90,91 %20. Les chercheurs ont également mené deux études qui ont donné des résultats remarquables dans le diagnostic proactif de la polyarthrite rhumatoïde. Plusieurs techniques d’apprentissage automatique, telles que SVM, régression logistique (LR) et AdaBoost, ont été présélectionnées et utilisées comme techniques candidates pour un ensemble de vote. Au départ, un ensemble de données était utilisé, et l’autre était équilibré en appliquant le SMOTE. La nouvelle technique d’ensemble de vote a été testée par deux méthodes séquentielles de sélection de caractéristiques. En effet, la sélection avant et arrière est utilisée pour trouver le meilleur sous-ensemble de l’espace de caractéristiques qui présente les indicateurs les plus élevés pour chaque technique. En utilisant 30 caractéristiques des données originales et la technique de sélection séquentielle des caractéristiques en avant, les pourcentages obtenus étaient prometteurs, avec des valeurs de précision, de rappel et de précision de 94,03 %, 96 % et 93,51 %, respectivement21. De même, d’autres méthodes intelligentes en médecine et dans des domaines connexes se trouvent dans de nombreuses études22, 23, 24, 25, 26.

Les techniques proposées dans ce travail sont RF, SVM, ANNA et NB en raison de leurs résultats remarquables pour des problèmes similaires. Dans l’étude actuelle, les résultats obtenus grâce aux expériences. Après diverses étapes d’optimisation et sélection de caractéristiques, il est démontré que les techniques proposées sont prometteuses pour le diagnostic de l’asthme grâce à l’ensemble de données ciblé.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette section décrit les algorithmes d’apprentissage automatique étudiés dans l’approche proposée de diagnostic de l’asthme. Les critères et les raisons du choix de la méthode proposée reposent sur une revue complète de la littérature et une longue histoire de diagnostic préventif de plusieurs maladieschroniques 27,28,29,30,31. Ces algorithmes ont donné des résultats prometteurs. Tous les matériaux et outils utilisés dans cette étude sont listés dans le tableau des matériaux.

Machines à vecteurs de support (SVM)
L’algorithme SVM est l’un des algorithmes les plus performants en reconnaissance et classificationde motifs 32. Il utilise une classification binaire, où il classe un ensemble d’entraînement de vecteurs en deux classes. Il appartient à la famille des algorithmes d’apprentissage supervisé, où la sortie souhaitée est générée sous supervision32. Comparé à d’autres algorithmes de classification en apprentissage automatique, la SVM offre de meilleurs résultats pour la performance de la classification. C’est pourquoi il a été largement utilisé dans de nombreuses applications telles que la reconnaissance de la parole, du visage et de l’écriture manuscrite. De plus, la SVM a également été appliquée dans divers domaines, notamment la prédiction des maladies et la prédiction des stocks. De plus, en raison de son insensibilité au bruit ou au sur-ajustement, la SVM peut traiter des données déséquilibrées, ce qui est typique en diagnostic médical, où les cas positifs sont moins nombreux queles cas négatifs 32.

En classification, la SVM sépare deux classes en traçant une frontière de décision, dans laquelle elle peut prévoir les étiquettes en distinguant un ou plusieurs vecteurs de caractéristiques32. La frontière de décision est appelée hyperplan, qui est le plus éloigné des points de données les plus proches de chaque classe. Ces points de données sont appelés vecteurs de soutien. La figure 1 montre certains hyperplans candidats dans des données linéairement séparables. L’équation 1 démontre l’équation de l’hyperplan, tandis que les équations 2 et 3 montrent les éléments situés au-dessus et en dessous du plan32 :

figure-protocol-1Équation de l’hyperplan (1)

Ici, w est un vecteur représentant le poids, x est un vecteur représentant l’entrée, et b. représente un biais potentiel.

figure-protocol-2Pour tout j, tel que figure-protocol-3 = +1 (2)

figure-protocol-4Pour tout i, tel que figure-protocol-5 = -1 (3)

figure-protocol-6
Figure 1 : Une SVM typique avec deux classes séparables. Cette figure visualise une SVM typique avec deux classes séparables. Abréviations ; SVM = machine à vecteurs de support. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Réseau de neurones artificiels (ANN)
L’ANN est une technique d’intelligence computationnelle en informatique douce qui imite la fonctionnalité du système cérébral humain. Il possède un grand nombre de neuronesinterconnectés 33. Il fait partie des algorithmes d’apprentissage automatique supervisés qui peuvent apprendre à partir d’exemples de jeux de données et améliorer leurs performances grâce à l’apprentissage, générant des résultatsutiles 33. L’architecture de l’ANN comprend plusieurs couches : une couche d’entrée, une couche cachée et une couche de sortie. Chacun d’eux est formé par un ensemble de neuronesconnectés 33.

Le neurone qui reçoit les données de l’extérieur effectue un traitement puis envoie les données vers une autre couche appelée couche d’entrée. Le but de la couche d’entrée n’est pas d’effectuer un processus complexe sur les données ; il s’agit simplement de dupliquer la valeur d’entrée et de l’envoyer à la couchesuivante 33. La couche de sortie contient des neurones qui produisent des données pour le programme utilisateur. Entre ces deux couches, la couche cachée est située comme une couche optionnelle pour effectuer des processus de calcul. La couche cachée sert de couche intermédiaire qui reçoit les entrées des neurones d’entrée, effectue des opérations mathématiques sur ceux-ci, puis transmet les résultats à une autrecouche 33. La figure 2 montre l’architecture ANN.

figure-protocol-7
Figure 2 : Avance et rétropropagation dans une structure typique de RNA. Cette figure visualise un réseau en avance avec rétropropagation dans une structure ANN typique. Abréviations ; ANN = réseau de neurones artificiels. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le réseau de retransmission en avant est une approche qui stocke les données d’entrée dans une direction directe. Dans la direction opposée, le processus de rétropropagation se produit lorsque les poids du réseau de neurones se mettent à jour en rétrogradation pour obtenir les gradients, en utilisant un réseau de neurones à plusieurs couches cachées. L’inconvénient de ce processus est l’annulation ou l’explosion des gradients. La fonction d’activation conserve les caractéristiques non linéaires de leur ANN, ce qui lui permet d’apprendre des relations détaillées entre les données d’entrée et de sortie, telles qu’une approximation universelle déclarée. La figure 3 illustre l’architecture principale du réseau de neurones artificiels. Il illustre également la fonction d’activation appliquée à la sortie de chaque neurone, qui représente la somme de tous les poids d’entrée. Le biais contient la somme de tous les poids et est inclus dans l’entréeneuronale 33.

figure-protocol-8
Figure 3 : Un neurone perceptron unique typique pour un RNA. Cette figure représente un seul neurone perceptron d’un RNA typique. Abréviations ; ANN = réseau de neurones artificiels. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Forêt aléatoire (RF)
La RF fait partie des algorithmes de classification les plus importants en apprentissage automatique. Il se compose de plusieurs arbres de décision individuels travaillant ensemble en ensemble et produisant le résultatfinal 29. Le concept de base derrière la réussite de la RF est qu’elle est composée de nombreux arbres modérément non corrélés (formant une forêt), qui agissent comme un comité. Ainsi, ils seront plus efficaces que tous les modèles qui fonctionnentindépendamment à 34. L’algorithme RF a été principalement développé par un groupe dechercheurs 35. Pour mieux comprendre le fonctionnement de la RF, il est essentiel de comprendre les arbres de décision35. Il est également applicable aux problèmes discrets et continus, en particulier à la classification, à la détection et à la régression,respectivement 36. Plus il y a d’arbres dans la forêt, plus le résultat sera proche de la précision, mais avec une complexité de calcul supplémentairede 36, comme illustré à la Figure 4.

figure-protocol-9
Figure 4 : Schéma de la forêt aléatoire. Cette figure illustre un schéma d’une forêt aléatoire typique. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Naïve Bayes (NB)
Naïve Bayes (NB) est un algorithme de classification qui utilise le théorème de Bayes pour classer les objets. C’est une méthode très populaire appliquée dans la plupart des domaines médicaux, notamment pour diagnostiquer les symptômes. Dans cette méthode, les objets prennent les hypothèses principales d’indépendance, ce qui rend la relation entre les attributs indépendante les uns des autres. En raison de sa nature naïve, il fait partie des algorithmes de classification les plus simples en apprentissageautomatique 37. Sur la base du jeu de données donné, NB détermine la probabilité d’un résultat particulier. Le modèle NB est simple à développer, peut gérer des données substantielles et est un algorithme sophistiqué et peu calculé. De plus, il offre des fonctions modestes, ce qui permet des données numériques et nominales. La robustesse et les interprétations d’apprentissage simples sont également les avantages potentiels du classificateur NB. Si elle est utilisée sur une quantité limitée de données, elle aboutira à un résultat relativement inexact. Cela dépend d’énormes archives, considérées comme moins précises que d’autres techniques37.

Analyse statistique
L’analyse statistique de l’ensemble de données aide à visualiser et comprendre le schéma de l’ensemble de données pour un meilleur prétraitement et modélisation des données. À cet égard, les étapes suivantes ont été mises en œuvre. Tout d’abord, pour vérifier si les caractéristiques démographiques sont déséquilibrées entre les groupes positifs et négatifs, y compris l’âge et le genre, une analyse statistique est réalisée sur le logiciel SPSS. Ensuite, compiler les données quantitatives à l’aide d’un test t d’échantillon indépendant si la distribution normale et l’homogénéité de la variance étaient satisfaites, ou le test Man-Whitney U. Enfin, les données catégorielles ont été compilées à l’aide du test du chi-carré ou du test exactde Fisher 38.

Mise en œuvre
Description du jeu de données
L’ensemble de données pour l’étude actuelle a été obtenu auprès de l’hôpital universitaire King Fahad à Dammam, en Arabie Saoudite, après approbation par le comité d’examen institutionnel (IRB). Ces données ont été collectées selon des tests standards chez les patients. L’asthme est souvent diagnostiqué par des tests standards chez les patients, notamment des analyses sanguines, des tests viraux et des tests biochimiques. Pour la présente étude, les patients et les témoins en santé (HC) ont été recrutés et évalués cliniquement sur la base du triage standard et des tests pathologiques réalisés à l’hôpital sur recommandation des médecins du département. Les critères d’inclusion et d’exclusion cliniques ont été définis par les médecins sur la base des résultats de laboratoire. Par la suite, les données qualifiées et vérifiées ont été fournies pour l’étude. Le jeu de données contient dix-sept attributs, car ils sont disponibles pour tous les patients asthmatiques. Le jeu de données comprend 328 cas au total, dont 165 asthme positifs et 163 asthme négatif. La répartition du genre et de l’âge dans les groupes positifs et négatifs est listée dans le tableau 1.

InstancesPositifNégatif
Homme14510738
Féminin18357126
Total328164164

Tableau 1 : Répartition par genre dans les ensembles de données. Ce tableau montre la répartition des genres dans l’ensemble de données.

Le tableau 2 montre la répartition des âges entre les deux classes.

Tranche d’âgeRépartition par âge (classe = 1)Répartition par âge (classe = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tableau 2 : Répartition par âge du jeu de données. Ce tableau montre la répartition par âge dans le jeu de données.

L’âge (p < 0,001 dans le test Man-Whitney U) et le sexe (p < 0,001 dans le test du chi-carré) étaient déséquilibrés entre les groupes positif et négatif. Cependant, il n’y a aucun biais dans le processus de recrutement. On pense que cette répartition déséquilibrée reflète la répartition par âge unique de cette cohorte de patients. Les critères d’inclusion incluent les facteurs cliniques de la présence et de l’absence de la maladie ; Les données démographiques, notamment le genre, l’âge et la population locale, sont prises en compte. De plus, les données ont été recueillies sous consentement éclairé. L’âge et le genre sont inclus comme caractéristiques potentielles dans l’ensemble des fonctionnalités, comme mentionné ci-dessous. Cependant, des analyses explicites basées sur l’âge et le genre ne font pas partie du champ de l’étude et sont restées comme travaux futurs.

Le jeu de données est stocké sous forme de valeurs numériques. La colonne « Classe » contient les valeurs 0 et 1, où 0 représente le « patient normal » et 1 le « patient asthmatique ».
À cet égard, les dix-sept attributs suivants ont été utilisés :
Classe : (0 = « Normal », 1 = « Patient asthmatique »)

1. âge en années (ÂGE)

2. genre (1 = homme, 0 = femme) : GENRE

3. Basophiles (BASO)

4. Éosinophiles (EOS)

5. Hématocrite (HCT)

6. Hémoglobine (HGB)

7. Lymphocytes (LYM)

8. Hémoglobine corpusculaire moyenne (CHM)

9. Concentration moyenne d’hémoglobine corpusculaire (MCHC)

10. Volume corpusculaire moyen (MCV)

11. Monocytes (MONO)

12. Volume moyen des plaquettes (MPV)

13. Fonction des neutrophiles (NEUT)

14. Nombre de plaquettes (PLATELET_COUNT)

15. Numération des globules rouges (RBC)

16. Largeur de distribution des globules rouges (RDW)

17. Globules blancs (globules blancs)

Caractéristiques statistiques de l’ensemble de données
Pour une meilleure compréhension, une analyse statistique de l’ensemble de données est présentée dans les tableaux38 suivants. Le tableau 3 montre la moyenne, la médiane, l’écart-type, le maximum et les valeurs minimales pour le jeu de données examiné.

MéchantMédianeÉcart-typeMaxMin
ÂGE39.13618.136932
GENRE0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Classe0.50.50.500810

Tableau 3 : Caractéristiques statistiques de l’ensemble de données. Ce tableau liste les caractéristiques statistiques des données.

De plus, le tableau 4 montre le coefficient de corrélation obtenu entre chaque attribut et l’attribut de classe. Ses valeurs se situent entre 0 (le moins corrélé) et 1 (le plus corrélé). Il est ajouté comme une analyse statistique préliminaire pour expliquer les attributs du jeu de données. Le MPV, le genre, le HGB, le MCHC et l’âge comptent parmi les caractéristiques les plus importantes.

Paires d’attributsCoefficient de corrélation
ÂGE0.212473
GENRE0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Classe1

Tableau 4 : corrélation avec l’attribut de la classe. Ce tableau montre la corrélation entre les attributs (caractéristiques) et l’attribut classe.

Installation expérimentale
Dans l’étude actuelle, le langage de programmation Python est utilisé pour prétraiter le jeu de données collecté. En raison d’une erreur humaine, des valeurs spécifiques manquent lors de la saisie et de la sélection des données. Des techniques d’imputation ont été utilisées pour traiter les valeurs manquantes dans le jeu de données. Cela se fait en remplaçant les valeurs manquantes par la moyenne de l’attribut. En raison de sa simplicité, de la compatibilité des modèles et de la préservation des valeurs moyennes de l’échantillon, comme discuté avec les professionnels de santé. De plus, la sélection des caractéristiques est effectuée à l’aide de coefficients de corrélation pour classer les attributs. Les caractéristiques ayant des valeurs de corrélation plus élevées ont été sélectionnées pour analyse en même temps que l’ensemble complet des caractéristiques. Les bibliothèques Python ont été utilisées pour la mise en œuvre de l’approche proposée, l’ajustement des hyperparamètres et l’obtention de résultats. La sélection et l’élimination des caractéristiques ont été effectuées par une méthode de sélection d’attributs afin d’identifier les groupes de caractéristiques avec la plus grande précision. De plus, Python a été utilisé pour évaluer la précision en utilisant des méthodes de validation croisée 10 fois et d’évaluation par rapport de partition directe, comme spécifié par les équationsdonnées 39,40. Enfin, la moyenne des résultats de toutes les méthodes d’évaluation a été calculée pour comparer les méthodes utilisées et déterminer celle avec la meilleure précisionmoyenne 38. De plus, des matrices de confusion ont été générées en utilisant les paramètres optimaux de SVM, ANN, RF et NB. Ensuite, une comparaison des faux positifs (FP), des faux négatifs (FN), des vrais positifs (TP) et des véritables négatifs (TN) a été réalisée via le calcul du score F1, qui est une mesure efficace pour comparer la meilleure méthode41,42.

Indicateurs d’évaluation
Pour évaluer la performance de l’approche proposée, quatre métriques de performance bien connues sont prises en compte. À savoir, la précision, la mémoire et le score en F1. La précision de la classification est la principale mesure car le pourcentage d’instances correctement classifiées est calculé pour chaque instance. La précision correspond au nombre total de points TP attendus. Le rappel correspond au nombre de TP supérieur à chaque véritable positif. Performance de score F1 de chaque classe. Selon la capacité des résultats, les indicateurs suivants sontobtenus 43, 44, 45 :

Vrai positif (TP) : résultat d’un diagnostic correctement diagnostiqué comme asthme.

Faux positif (FP) : résultat d’un diagnostic erroné d’asthme.

Vrai négatif (TN) : résultat des cas corrects diagnostiqués comme non asthmatiques.

Faux négatif (FN) : résultat d’un diagnostic erroné de non-asthme.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Stratégie d’optimisation
Pour déterminer les paramètres optimaux pour chacune des approches proposées, la technique de recherche en grille a été employée. Des valeurs possibles spécifiques aux paramètres sont placées dans la méthode de recherche en grille. Par conséquent, il peut développer les meilleures performances possibles pour améliorer la précision.

Les figures 5 à 7 illustrent le résultat de la technique de recherche en grille pour les quatre approches proposées ainsi que la procédure de mise en œuvre sur le jeu de données avec l’aide des dix-huit attributs les plus importants. La figure 5 présente les précisions SVM obtenues avec différentes valeurs de paramètres. Les valeurs d’entrée pour le Cost et le Gamma correspondant à plusieurs types de noyaux sont les suivantes :

Types de noyau : linéaire, radial, sigmoïde et polynôme.

Gamma : 0,001 et 0,0001.

Coût : 1, 10, 100 et 1000.

figure-protocol-13
Figure 5 : SVM avec différents types de coûts et gamma. Cette figure démontre le comportement des SVM avec différents types de coûts et gamma. Abréviations ; SVM = machine à vecteurs de support. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Pour la RF, les valeurs d’entrée systématiques indiquées à la Figure 6 sont les suivantes :

Les noms des paramètres, ainsi que leurs valeurs respectives, sont fournis ci-dessous :

Nombre de caractéristiques : « auto », « sqrt. »

Profondeur maximale : 1, 3, 5, 7.

Répartition des échantillons MIN : 2, 3, 4, 5.

Feuilles d’échantillons MIN : 2, 3, 4, 5.

figure-protocol-14
Figure 6 : RF avec des valeurs de profondeur différentes et un minimum de feuilles d’échantillon. Cette figure illustre le comportement de la RF avec différentes profondeurs et des valeurs minimales de feuilles d’échantillon. Abréviations ; RF = forêt aléatoire. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Pour le RNA, les valeurs d’entrée analytiques sont indiquées à la Figure 7.

Les noms des paramètres, ainsi que leurs valeurs respectives, sont les suivants :

Tailles de couches cachées : (50, 50, 50), (50, 100, 50) et (100,).
Activation : 'tanh' et 'relu'.
Solveur : 'sgd' et 'adam'.
Alpha : 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 et 0,05.
Taux d’apprentissage : « constant » et « adaptatif ».

figure-protocol-15
Figure 7 : ANN avec différentes valeurs alpha et tailles de couches cachées. Cette figure illustre le comportement de l’ANN avec différentes valeurs alpha et tailles de couches cachées. Abréviations ; ANN = réseau de neurones artificiels. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

ClassificateurParamètreValeur
SVMGamma0.0001
Type de noyau'RBF'
Coût 'C'10
État aléatoire42
RFProfondeur maximale3
Un nombre minimum de feuilles2
Répartition des échantillons en min2
État aléatoire42
ANNActivation« Ralu »
Alpha0.001
Taille de la couche cachée(50,50,50)
Taux d’apprentissage« constant »
Solveur'Adam'
État aléatoire42

Tableau 5 : Résumé des paramètres optimaux pour les classificateurs proposés. Ce tableau résume les paramètres optimaux obtenus pour les classificateurs proposés.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Influence de la sélection des caractéristiques
Dans l’étude actuelle, la méthode récursive basée sur l’élimination des caractéristiques basée sur les coefficients de corrélation est utilisée pour la sélection des caractéristiques. Le coefficient de corrélation est utilisé pour ordonner les caractéristiques du plus élevé au plus bas selon leurs valeurs de corrélation. L’élimination des caractéristiques récursive est utilisée pour aider à sélectionner les caractéristiqu...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’étude actuelle utilise plusieurs algorithmes d’apprentissage automatique, notamment SVM, ANN, RF et NB. Après plusieurs expériences, affiné des hyperparamètres et la sélection des caractéristiques, il est conclu que SVM, RNA et RF affichent une précision diagnostique remarquable de 94 %, tandis que NB est relativement plus basse, à 83,33 %. Les résultats ont été validés grâce à une validation croisée de 10 fois et une sélection optimisée des fonctionnalités, ainsi qu’au meilleur ratio ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le jeu de données a été obtenu auprès de l’hôpital sous le cadre de l’IRB-2020-09-429. Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts à signaler concernant l’étude en cours. L’étude a été ajoutée au dépôt Research Square en tant que prépublication avec la citationsuivante 50.

CONTRIBUTIONS DES AUTEURS :
La conceptualisation a été réalisée par S.O., M.I.B.A. et A.R. ; La supervision a été assurée par S.O., M.I.B.A. et J.A. ; La rédaction du brouillon original a été réalisée par S.S.A., E.A. et Z.A. ; La mise en œuvre a été assurée par la S.A.A., Y.A. et R.A. ; La validation a été réalisée par J.A., M.A. et S.D. ; La curation des données a été réalisée par A.B., Y.A., E.A. et Z.A. ; La revue et la révision ont été réalisées par A.R., S.D. et A.B. ; L’administration du projet était assurée par A.R., S.D. et M.A., et l’acquisition de financement par A.B., S.D. et A.R.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs souhaitent reconnaître le soutien des professionnels de santé pour valider les conclusions de l’étude.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Excel 365MicrosoftExcel 365Utilisé pour stocker des données brutes au format csv
Laptop/MachineDellXPS9320RAM 16GB, 12th Gen Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Utilisé pour la construction et l'entraînement du modèle 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Utilisé pour la construction et l'entraînement du modèle 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Utilisé pour la construction et l'entraînement du modèle 
Python 3.12.12Google colab Notebook Python 3.12.12Utilisé pour la construction et l'entraînement du modèle 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Utilisé pour la construction et l'entraînement du modèle 
SPSS IBM, USAVersion 26.0Utilisé pour l'analyse statistique
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Utilisé pour la construction et l'entraînement du modèle 

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Diagnostic de l asthmeApprentissage automatiqueD tection pr coceAsthme en Arabie saouditeFor ts al atoiresMachines vecteurs de supportR seaux de neurones artificielsAnalyse de donn es m dicalesPr diction des maladies chroniques

Articles connexes