Onderzoeksartikel

Een op computationele intelligentie gebaseerde vroege diagnose van astma: een Saoedische casestudy

DOI:

10.3791/70040

16 juni 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De huidige studie onderzoekt verschillende machine learning-algoritmen op een Saoedische dataset voor astmadetectie. In tegenstelling tot geavanceerde benaderingen die machine learning gebruiken op klinische datasets voor astmadiagnostiek, behaalt het voorgestelde schema betere prestaties, met een verbetering van 3,9% in diagnosenauwkeurigheid.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Volgens onderzoek is een toename van chronische ziekten, waaronder astma, vastgesteld. Het aantal astmapatiënten in Saoedi-Arabië baart zorgen, vooral vanwege de weersomstandigheden en de levensstijl, vooral in het post-pandemische tijdperk. Het vereist een oplossing om infecties te verminderen door een intelligent systeem te ontwikkelen om astma in een vroeg stadium te detecteren, waardoor de ziekte wordt voorkomen of vroege behandeling mogelijk wordt. In deze studie is machine learning gebruikt om tools te ontwikkelen om astmasymptomen in een vroeg stadium te volgen. Hoewel er verschillende eerdere pogingen zijn geweest om machine learning toe te passen om het ontstaan van astma te voorspellen. Desalniettemin is de focus op de identificatie van de ziekte in de pre-symptomenfase, vooral in de Saoedische context, een relatief verwaarloosd gebied. De dataset voor de huidige studie is verkregen van het King Fahad University Hospital in Dammam, Saoedi-Arabië, en bevatte standaardtests bij patiënten, waaronder bloedtesten, virale tests en biochemische tests. De dataset bevat 17 significante kenmerken en bevat informatie voor 328 astmapatiënten: 165 zijn positief en 163 zijn negatief. De hier geselecteerde methoden zijn random forests (RF), kunstmatige neurale netwerken (ANN), support vector machines (SVM) en naïeve Bayes (NB). Elk van deze methoden is gekozen op basis van zijn kenmerkende eigenschappen. De experimentele uitkomst toonde aan dat de RF-, SVM- en ANN-benaderingen 94% opleverden, wat de hoogste nauwkeurigheid is en de stand van de techniek met 3,9% verbeterde. Het is vermeldenswaard dat negen van de zeventien mogelijke kenmerken zijn gebruikt om bovenstaande nauwkeurigheid te bereiken. Ondanks dat RF, SVM en ANN dezelfde nauwkeurigheid bereiken, heeft ANN een hoger foutpercentage. Daarom zijn RF en SVM superieur op basis van het patroon van de resultaten, en worden ze daarom voor dit probleem voorgesteld.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Na uitgebreid onderzoek observeerden de onderzoekers dat chronische ziekten steeds vaker voorkomen1. Astma is een chronische ontstekingsziekte van de luchtwegen die wordt gekenmerkt door terugkerende episodes van kortademigheid en piepende ademhaling. De prevalentie van astma varieert wereldwijd en varieert van 1–20% voor zowel kinderen als volwassenen, en treft miljoenen mensen wereldwijd2. Deze grootschalige veranderingen hangen samen met omgevingsvariaties, waaronder die in verschillende landen, evenals het gebruik van verschillende beoordelingsinstrumenten en diverse epidemiologische definities van astma. Astma heeft een relatief laag sterftecijfer in tegenstelling tot verschillende andere bekende chronischeziekten. Uit rapporten blijkt echter dat het astmapatroon in het Koninkrijk Saoedi-Arabië met 3,4 toeneemt.

Astma is een chronische ontstekingsaandoening die leidt tot een vernauwd lumen. De vernauwing van de luchtvaartroute wordt veroorzaakt door de uitbreiding van lichaamsvloeistofuitstoot, evenals het verdikken van bronchiale delers door oedeem, subepitheliale fibrose en gladde spierhypertrofie. Pathofysiologische apparaten die door verschillende celtypen, waaronder immuuncellen, worden aangestuurd, zijn gebruikt om deze aandoeningen te beoordelen5. Door zware weersomstandigheden en voornamelijk een binnenlevensstijl in Saoedi-Arabië is astma een van de meest voorkomende chronische ziekten. Verschillende onderzoeken hebben het overweldigende aantal astma6 aangetoond. De ziekte is een belangrijk probleem geworden, waardoor een vroegtijdig responssysteem nodig is om het aantal incidenten te beperken en het mogelijk te maken om vroegtijdig te helpen de ziekte in een eerder stadium te voorkomen of te genezen.

In tegenstelling tot individuen heeft astma een diepgaande impact op gemeenschappen en gezinnen. Als het niet wordt gecontroleerd, legt het harde beperkingen op aan het leven van de patiënt en verhindert het dat zij aan veel dagelijkse activiteiten deelnemen. In Saoedi-Arabië dragen strenge weersomstandigheden, waaronder een hete atmosfeer, wijdverspreide zandstormen en overmatig gebruik van binnenairconditioning-/koelsystemen, belangrijke bijdrage aan astma. De Saoedische thoracale vereniging (STS) heeft opvallende inspanningen geleverd om de beste medicijnen voor luchtweginfectieste bieden 7. Een proactieve diagnose van astma is echter nodig om het infectiepercentage te verlagen, vooral in een post-pandemisch (COVID-19) scenario. Verder werd vastgesteld dat familiegeschiedenis, roken en allergische rhinitis tot de belangrijkste risicofactoren voor het ontwikkelen van astma bij Saoedische volwassenen behoren. Er werd aanvullend onderzoek aanbevolen om andere factoren te onderzoeken die de basis voor het onderzoek vormden.

In dit onderzoek, rekening houdend met eerdere studies over astmadiagnose, is het doel om de diagnostische nauwkeurigheid te verbeteren. De voorgestelde technieken, waaronder random forest (RF), kunstmatig neuraal netwerk (ANN), support vector machine (SVM) en naïeve Bayes (NB), zijn in eerdere studies gebruikt, wat tot merkbare verbeteringen in diagnoseresultaten heeft geleid. Zo hebben onderzoekers ANN, SVM en NB gebruikt in studies 8,9,10. In de huidige studie zijn machine learning-benaderingen onderzocht om te dienen als een vroegwaarschuwingssysteem dat zelfs de kleine tekenen van astmaziekte in de vroegste stadia (pre-symptomatische fase) detecteert. De prevalentie van astmaziekte in Saoedi-Arabië, vooral in het post-pandemische tijdperk, met factoren als een binnenshuise levensstijl door zware weersomstandigheden, airconditioningkanalen en zandstormen behoren tot de belangrijkste factoren. Er is echter geen noemenswaardige studie die de cruciale factoren onderzoekt die in het recente verleden zijn waargenomen. Om deze onderzoekskloof aan te pakken, is de huidige studie bedoeld om de rol van machine learning bij de vroege opsporing van astma onder Saoedische volwassenen te onderzoeken. Bovendien is het primaire doel om de hoogst mogelijke nauwkeurigheid te bereiken met zo min mogelijk kenmerken. Hoewel er in het verleden herkenbare pogingen zijn geweest om machine learning te gebruiken om de aanwezigheid van astmaziektete voorspellen 8,9,10. De huidige studie heeft als doel gebruik te maken van een Saoedische dataset, voor het eerst verkregen uit een openbaar ziekenhuis in de oostelijke provincie, met de focus op het vroegtijdig diagnosticeren van de ziekte (preventieve diagnose). Machine learning (ML) wordt erkend als een methode om kennis uit verzamelde data te halen11,12. Het biedt voorspellingsnauwkeurigheid die is verkregen uit het leerproces van eerdere instanties door gebruik te maken van verschillende machine learning-technieken. ML omvat meerdere methoden, algoritmen en strategieën om analytische en voorspellende problemen in brede medische vakgebieden aan te pakken, zoals de vroege detectie van het bestaan van ziekten13,14.

Er zijn verschillende studies uitgevoerd om astmaziekte te voorspellen met behulp van verschillende technieken. Onderzoekers ontwikkelden een kunstmatig neuraal netwerk (ANN) voor astmaclassificatie op basis van de dynamische en statische patiënttesten8. De gemeten parameters van spirometrie, impulsoscillometrie (IOS), auscultatie, allergieresultaten en informatie over symptomen worden gebruikt in de ANN. De gedefinieerde informatie stelt de ANN in staat de juiste astmaclassificatie voor te stellen. Evenzo voerden onderzoekers een studie uit om de uitdagingen bij het diagnosticeren van borstziektenaan te pakken. Support vector machines (SVM) en de adaptieve SVM (ASVM) methoden werden gebruikt om borstziekten zoals astma te diagnosticeren. De beste classificatienauwkeurigheid voor alle borstziekten werd behaald met behulp van de ASVM-methode. De onderzoekers gebruikten verschillende neurale netwerkstructuren, zoals multi-layer NN (MLNN) met backpropagation algorithm (BPA) met één en twee verborgen lagen, probabilistic NN (PNN), learning vector quantization (LVQ) en general regression NN (GRNN), voor de diagnose van borstziekten, waaronder astma15. Daarnaast voerden sommigen een vergelijkend onderzoek uit om borstziekten te diagnosticeren met behulp van een kunstmatig immuunsysteem (AIS). De genoemde studies hebben verschillende structuren geïmplementeerd voor het diagnosticeren van borstziekteproblemen met behulp van hun verschillende datasets. Voor astma werd het hoogste resultaat behaald met AIS met een algehele nauwkeurigheid van 90,91%. Bovendien onderzochten onderzoekers de effectiviteit van een diep NN (DNN) voor het verbeteren van de nauwkeurigheid bij astmadiagnose en vergeleken ze de voorspellingsprestaties van verschillende machine learning-algoritmen, met name met logistische regressie en SVM. De studie toonde aan dat de empirische test met het model van astma-tekenen effectiever was voor de nauwkeurige diagnose van astma9. Een andere studie toonde het significante vermogen aan van machine learning door telemonitoringgegevens te gebruiken om astma-verergeringen te voorspellen voordat ze optreden, via gekozen machine learning-benaderingen zoals SVM en Naïve Bayes om hun experiment10 uit te voeren.

Daarnaast gebruikten onderzoekers verschillende machine learning-technieken om Alzheimer ziekte (AD) preventief vast te stellen, waaronder SVM, k-NN, adaptive boosting (AdaBoost) en eXtreme gradient boosting (XGBoost)17. Onderzoekers voerden ook een studie uit om diabetes voorlopig vast te stellen, door vier machine learning-benaderingen te onderzoeken, namelijk NB, SVM, K-NN en ANN. De drie belangrijkste kenmerken van de Saoedi-Arabische dataset vertoonden de hoogste gemiddelde nauwkeurigheid van 68%. De prestaties van de meettechnieken werden vergeleken op basis van nauwkeurigheid, precisie, herinnering en F1-score. De ANN behaalde de hoogste classificatienauwkeurigheid van 77,5%. Evenzo experimenteerde dezelfde groep onderzoekers met de uitvoering van vier classificatietechnieken— namelijk NB, SVM, K-NN en ANN— om chronische nierziekte preventief te diagnosticeren, toegepast op de Saoedische dataset19. Bovendien voerden de auteurs een studie uit om schildklierkanker primitief te diagnosticeren met behulp van vier machine learning-technieken: ANN, SVM, RF en NB. Met gebruik van 14 kenmerken van de Saoedi-Arabische dataset behaalden de auteurs de hoogste gemiddelde nauwkeurigheid van 95%. De prestaties van meettechnieken werden vergeleken met behulp van nauwkeurigheid, precisie, herinnering en F1-score. De RF behaalde de hoogste classificatienauwkeurigheid van 90,91%. De onderzoekers voerden ook twee studies uit die opmerkelijke resultaten opleverden in de proactieve diagnose van reumatoïde artritis. Verschillende machine learning-technieken, zoals SVM, logistische regressie (LR) en AdaBoost, werden geselecteerd en gebruikt als kandidaattechnieken voor een stemensemble. Aanvankelijk werd één dataset gebruikt, en de andere werd in balans gebracht door SMOTE toe te passen. De nieuwe stemensembletechniek werd getest met twee sequentiële methoden voor het selecteren van kenmerken. Namelijk wordt voor- en achteruitselectie gebruikt om de beste deelverzameling van de featureruimte te vinden die de hoogste indicatoren voor elke techniek presenteert. Met behulp van 30 kenmerken van de oorspronkelijke gegevens en de sequentiële voorwaartse feature-selectietechniek waren de verkregen percentages veelbelovend, met nauwkeurigheid, herinnering en precisie van respectievelijk 94,03%, 96% en 93,51%. Evenzo zijn andere intelligente methoden in de geneeskunde en aanverwante vakgebieden te vinden in veel studies 22,23,24,25,26.

De voorgestelde technieken in dit werk zijn RF, SVM, ANN en NB vanwege hun uitstekende resultaten voor vergelijkbare problemen. In de huidige studie zijn de resultaten verkregen via de experimenten. Na verschillende optimalisatiestappen en het selecteren van functies blijkt dat de voorgestelde technieken veelbelovend zijn voor de diagnose van astma met de beoogde dataset.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze sectie beschrijft de machine learning-algoritmen die zijn onderzocht in de voorgestelde astmadiagnostische benadering. De criteria en redenen achter de keuze van de voorgestelde methode zijn gebaseerd op een uitgebreide literatuurstudie en een lange geschiedenis van preventieve diagnose van verschillende chronische ziekten 27,28,29,30,31. Deze algoritmes leverden veelbelovende resultaten op. Alle materialen en gereedschappen die in deze studie zijn gebruikt, staan vermeld in de Materiaallijst.

Ondersteuningsvectormachines (SVM)
Het SVM-algoritme behoort tot de meest succesvolle algoritmen op het gebied van patroonherkenning en classificatie32. Het gebruikt binaire classificatie, waarbij een trainingsset vectoren in twee klassen wordt geclassificeerd. Het behoort tot de familie van supervised learning-algoritmen, waarbij de gewenste output wordt gegenereerd onder supervisie32. In vergelijking met andere classificatie-algoritmen in machine learning levert SVM betere resultaten voor classificatieprestaties. Daarom is het uitgebreid gebruikt in tal van toepassingen, zoals spraak-, gezichts- en handschriftherkenning. Bovendien is SVM ook toegepast op verschillende gebieden, waaronder ziektevoorspelling en voorraadvoorspelling. Daarnaast kan SVM door zijn ongevoeligheid voor ruis of overfitting onevenwichtige data verwerken, wat een typisch geval is in medische diagnostiek, waar positieve gevallen minder zijn dan negatieve gevallen32.

In classificatie scheidt SVM twee klassen door een beslissingsgrens te trekken, waarin het de labels kan voorspellen door één of meer featurevectorente onderscheiden 32. De beslissingsgrens wordt het hypervlak genoemd, dat het verst verwijderd is van de dichtstbijzijnde datapunten van elke klasse. Die datapunten worden ondersteuningsvectoren genoemd. Figuur 1 toont enkele kandidaat-hypervlakken in lineair scheidbare data. Vergelijking 1 toont de hypervlakvergelijking, terwijl vergelijkingen 2 en 3 de elementen boven en onder vlak32 tonen:

figure-protocol-1Hypervlakvergelijking (1)

Hier is w een vector die gewicht voorstelt, x is een vector die de invoer voorstelt, en b. vertegenwoordigt een potentiële bias.

figure-protocol-2Voor alle j, zodanig dat figure-protocol-3 = +1 (2)

figure-protocol-4Voor alle i, zodanig dat figure-protocol-5 = -1 (3)

figure-protocol-6
Figuur 1: Een typische SVM met twee scheidbare klassen. Deze figuur visualiseert een typische SVM met twee scheidbare klassen. Afkortingen; SVM = ondersteuningsvectormachine. Klik hier om een grotere versie van deze figuur te bekijken.

Kunstmatig neuraal netwerk (ANN)
ANN is een computationele intelligentietechniek in soft computing die de functionaliteit van het menselijk hersensysteem nabootst. Het heeft een groot aantal onderling verbonden neuronen33. Het behoort tot de begeleide machine learning-algoritmen die kunnen leren van voorbeelddatasets en hun prestaties verbeteren door te leren, waarbij nuttige output wordt gegenereerd33. De architectuur van ANN bestaat uit meerdere lagen: een invoerlaag, een verborgen laag en een uitvoerlaag. Elk van hen wordt gevormd door een set verbonden neuronen33.

De neuron die de data van buitenaf ontvangt, voert wat verwerking uit en stuurt de data vervolgens naar een andere laag, bekend als de inputlaag. Het doel van de invoerlaag is niet om een complex proces op de data uit te voeren; Het is simpelweg om de invoerwaarde te dupliceren en deze naar de volgende laag33 te sturen. De uitvoerlaag bevat neuronen die data produceren voor het gebruikersprogramma. Tussen deze twee lagen bevindt zich de verborgen laag als een optionele laag om computationele processen uit te voeren. De verborgen laag fungeert als een tussenlaag die input ontvangt van de invoerneuronen, wiskundige bewerkingen op hen uitvoert en vervolgens de resultaten doorgeeft aan een andere laag33. Figuur 2 toont de ANN-architectuur.

figure-protocol-7
Figuur 2: Feed-forward en backpropagatie in een typische ANN-structuur. Deze figuur visualiseert een feed-forward netwerk met backpropagatie in een typische ANN-structuur. Afkortingen; ANN = kunstmatig neuraal netwerk. Klik hier om een grotere versie van deze figuur te bekijken.

Het feed-forward NN is een benadering waarbij invoergegevens in een voorwaartse richting worden opgeslagen. In de tegenovergestelde richting vindt het terugpropagatieproces plaats wanneer de gewichten van het neurale netwerk in een achterwaartse benadering worden bijgewerkt om de gradiënten te verkrijgen, met behulp van een neuraal netwerk met meerdere verborgen lagen. Het nadeel van dit proces is het verdwijnen of exploderen van gradiënten. De activatiefunctie behoudt de niet-lineaire kenmerken van hun ANN, waardoor het gedetailleerde relaties tussen invoer- en uitvoerdata kan leren, zoals een universele benadering is verklaard. Figuur 3 toont de hoofdarchitectuur van het kunstmatige neurale netwerk. Het illustreert ook de activatiefunctie die op de output van elke neuron wordt toegepast, die de som van alle inputgewichten vertegenwoordigt. De bias bevat de som van alle gewichten en is opgenomen in de neuroninput33.

figure-protocol-8
Figuur 3: Een typische enkele perceptronneuron voor een ANN. Deze figuur toont een enkele perceptronneuron van een typische ANN. Afkortingen; ANN = kunstmatig neuraal netwerk. Klik hier om een grotere versie van deze figuur te bekijken.

Willekeurig bos (RF)
RF behoort tot de prominente classificatie-algoritmen in machine learning. Het bestaat uit verschillende individuele Decision Trees die samenwerken als een ensemble en de uiteindelijke output29 produceren. Het basisconcept achter de succesvolle prestaties van de RF is dat deze bestaat uit veel matig niet-gecorreleerde bomen (die een bos vormen), die als een commissie fungeren. Daardoor zullen ze efficiënter zijn dan alle modellen die onafhankelijk draaien34. Het RF-algoritme werd voornamelijk ontwikkeld door een groep onderzoekers35. Om beter te begrijpen hoe RF werkt, is het essentieel om beslissingsbomen35 te begrijpen. Het is even toepasbaar op zowel discrete als continue problemen, specifiek classificatie, detectie en regressie,respectievelijk 36. Hoe meer bomen in het bos, hoe dichter bij de nauwkeurigheid het resultaat zal zijn, maar met een extra rekencomplexiteitvan 36, zoals weergegeven in Figuur 4.

figure-protocol-9
Figuur 4: Schema van het willekeurige bos. Deze figuur toont een schema van een typisch willekeurig bos. Klik hier om een grotere versie van deze figuur te bekijken.

Naïeve Bayes (NB)
Naïeve Bayes (NB) is een classificatie-algoritme dat de stelling van Bayes gebruikt om objecten te classificeren. Het is een zeer populaire methode die in de meeste medische vakgebieden wordt toegepast, vooral voor het diagnosticeren van symptomen. In deze methode nemen objecten de aannames van de hoofdonafhankelijkheid, waardoor de relatie tussen de attributen onafhankelijk van elkaar wordt. Vanwege zijn naïeve aard behoort het tot de eenvoudigste classificatie-algoritmen in machine learning37. Op basis van de gegeven dataset bepaalt NB de kans van een bepaalde output. Het NB-model is eenvoudig te ontwikkelen, kan aanzienlijke data beheren en is een geavanceerd en computationeel licht algoritme. Daarnaast levert het bescheiden functies, wat resulteert in numerieke en nominale kennis. Robuustheid en eenvoudige leerinterpretaties zijn ook de potentiële voordelen van de NB-classifier. Als het wordt toegepast op een beperkte hoeveelheid data, zal dit resulteren in een relatief onnauwkeurig resultaat. Het is afhankelijk van enorme gegevens, die als minder nauwkeurig worden beschouwd dan andere technieken37.

Statistische analyse
Statistische analyse van de dataset helpt het patroon van de dataset te visualiseren en te begrijpen voor betere data-voorverwerking en modellering. In dit verband werden de volgende stappen uitgevoerd. Ten eerste wordt er een statistische analyse uitgevoerd op SPSS-software om te onderzoeken of de demografische kenmerken onevenwichtig zijn tussen positieve en negatieve groepen, inclusief leeftijd en geslacht. Ten tweede, verzamel de kwantitatieve gegevens met een onafhankelijke steekproef t-test als aan de normale verdeling en homogeniteit van variantie voldaan zijn, of met de Man-Whitney U-test. Ten slotte zijn de categorische gegevens samengesteld met behulp van chi-kwadraattest of Fisher's exacte test38.

Implementatie
Datasetbeschrijving
De dataset voor de huidige studie is verkregen van het King Fahad University Hospital in Dammam, Saoedi-Arabië, na goedkeuring door de institutionele beoordelingscommissie (IRB). De genoemde gegevens werden verzameld volgens standaardtests onder de patiënten. Astma wordt vaak vastgesteld via standaardtests bij patiënten, waaronder bloedonderzoek, virustesten en biochemische tests. Voor de huidige studie werden patiënten en gezonde controles (HC) gerekruteerd en klinisch geëvalueerd op basis van de standaard triage en pathologische tests die in het ziekenhuis werden uitgevoerd op aanbeveling van artsen van de afdeling. De klinische inclusie- en exclusiecriteria werden door de artsen vastgesteld op basis van de laboratoriumresultaten. Vervolgens werden de gekwalificeerde en geverifieerde gegevens voor het onderzoek verstrekt. De dataset bevat zeventien attributen, aangezien deze beschikbaar zijn voor alle astmapatiënten. De dataset bevat in totaal 328 gevallen, waarvan 165 astma-positief en 163 astma-negatieve gevallen. De verdeling van geslacht en leeftijd in de positieve en negatieve groepen is weergegeven in Tabel 1.

VoorbeeldenPositiefNegatief
Mannelijk14510738
Vrouwelijk18357126
Totaal328164164

Tabel 1: Genderverdeling in de dataset. Deze tabel toont de geslachtsverdeling in de dataset.

Tabel 2 toont de leeftijdsverdeling tussen de twee klassen.

LeeftijdscategorieLeeftijdsverdeling (Klasse = 1)Leeftijdsverdeling (klasse = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tabel 2: Ouderdomsverdeling van de dataset. Deze tabel toont de leeftijdsverdeling in de dataset.

De leeftijd (p < 0,001 in de Man-Whitney U-test) en het geslacht (p < 0,001 in de Chi-kwadraattest) waren onevenwichtig tussen de positieve en negatieve groepen. Er is echter geen vooringenomenheid in het wervingsproces. Men denkt dat de onevenwichtige verdeling de unieke leeftijdsverdeling van deze cohort kan weerspiegelen. Inclusiecriteria omvatten klinische factoren voor de aanwezigheid en afwezigheid van de ziekte; Demografie, waaronder geslacht, leeftijd en lokale bevolking, worden meegenomen. Bovendien zijn de gegevens verzameld onder informed consent. Leeftijd en geslacht zijn opgenomen als mogelijke kenmerken in de featureset, zoals hieronder vermeld. Expliciete leeftijds- en gendergebaseerde analyses vallen echter niet binnen de scope van de studie en blijven als toekomstig werk.

De dataset wordt opgeslagen als numerieke waarden. De kolom "Klasse" bevat de waarden 0 en 1, waarbij 0 de "Normale patiënt" vertegenwoordigt en 1 de "Astmapatiënt".
In dit verband werden de volgende zeventien attributen gebruikt:
Klasse: (0 = "Normaal", 1 = "Astmapatiënt")

1. leeftijd in jaren (LEEFTIJD)

2. geslacht (1 = man, 0 = vrouw): GESLACHT

3. Basofielen (BASO)

4. Eosinofielen (EOS)

5. Hematocriet (HCT)

6. Hemoglobine (HGB)

7. Lymfocyten (LYM)

8. Gemiddelde corpusculaire hemoglobine (MCH)

9. Gemiddelde corpusculaire hemoglobineconcentratie (MCHC)

10. Gemiddeld corpusculair volume (MCV)

11. Monocyten (MONO)

12. Gemiddeld bloedplaatjesvolume (MPV)

13. Neutrofielfunctie (NEUT)

14. Aantal bloedplaatjes (PLATELET_COUNT)

15. Aantal rode bloedcellen (RBC)

16. Breedte van de verspreiding van rode cellen (RDW)

17. Witte bloedcellen (WBC)

Statistische kenmerken van de dataset
Voor een beter begrip wordt een statistische analyse van de dataset weergegeven in de volgende tabellen38. Tabel 3 toont de gemiddelde, mediaan-, standaarddeviatie-, maximum- en minimumwaarden voor de betreffende dataset.

GemiddeldMediaanStandaarddeviatieMaxMin
LEEFTIJD39.13618.136932
GESLACHT0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Klasse0.50.50.500810

Tabel 3: Statistische kenmerken van de dataset. Deze tabel geeft de statistische kenmerken van de gegevens weer weer.

Daarnaast toont Tabel 4 de verkregen correlatiecoëfficiënt tussen elk attribuut en het klasse-attribuut. De waarden liggen tussen 0 (minst gecorreleerd) en 1 (meest gecorreleerd). Het wordt toegevoegd als een voorlopige statistische analyse om de attributen van de dataset uit te leggen. MPV, geslacht, HGB, MCHC en leeftijd behoren tot de belangrijkste kenmerken.

AttributenparenCorrelatiecoëfficiënt
LEEFTIJD0.212473
GESLACHT0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Klasse1

Tabel 4: Correlatie met klasse-attribuut. Deze tabel toont de correlatie tussen de attributen (features) en het klasse-attribuut.

Experimentele opstelling
In de huidige studie wordt de programmeertaal Python gebruikt om de verzamelde dataset vooraf te verwerken. Door menselijke fouten ontbreken specifieke waarden tijdens gegevensinvoer en selectie. Imputatietechnieken zijn gebruikt om ontbrekende waarden in de dataset te behandelen. Dit gebeurt door ontbrekende waarden te vervangen door het gemiddelde van het attribuut. Vanwege de eenvoud, modelcompatibiliteit en het behoud van steekproefgemiddelde waarden, zoals besproken met zorgprofessionals. Bovendien wordt de selectie van kenmerken uitgevoerd met behulp van correlatiecoëfficiënten om de attributen te rangschikken. De kenmerken met hogere correlatiewaarden werden geselecteerd voor analyse samen met de volledige featureset. Python-bibliotheken zijn gebruikt voor de implementatie van de voorgestelde aanpak, hyperparameterafstemming en het verkrijgen van resultaten. De selectie en eliminatie van kenmerken werden uitgevoerd met een attribuutselectiemethode om de featuregroepen met de hoogste nauwkeurigheid te identificeren. Daarnaast werd Python gebruikt om nauwkeurigheid te evalueren met behulp van 10-voudige kruisvalidatie en Direct Partition Ratio-evaluatiemethoden, zoals gespecificeerd in de gegeven vergelijkingen39,40. Ten slotte werd het gemiddelde van alle evaluatiemethoden berekend om de gebruikte beoordelingsmethoden te vergelijken en de methode met de beste gemiddelde nauwkeurigheidvan 38 te bepalen. Daarnaast werden verwarringsmatrices gegenereerd met behulp van de optimale parameters SVM, ANN, RF en NB. Vervolgens werd een vergelijking uitgevoerd van vals-positieven (FP), vals-negatieven (FN), echte positieven (TP) en ware negatieven (TN) ratio's door de F1-score te berekenen, wat een efficiënte maat is om de beste methode41,42 te vergelijken.

Evaluatiemetrieken
Om de prestaties van de voorgestelde aanpak te evalueren, worden vier bekende prestatiemaatstaven beschouwd. Namelijk: nauwkeurigheid, precisie, terugroepen en F1-score. Classificatienauwkeurigheid is de primaire maatstaf omdat het percentage correct geclassificeerde gevallen per geval wordt berekend. Precisie is het aantal verwachte totale TP-punten. De recall is het aantal TP dat hoger is dan elk daadwerkelijk positief punt. F1-score prestaties van elke klasse. Volgens de capaciteit van de uitvoeren worden de volgende metrieken verkregen: 43,44,45:

True positive (TP): Resultaat van correct gediagnosticeerde astma.

Vals-positief (FP): Het gevolg van een onterecht diagnose van astma.

True negative (TN): Resultaat van correcte gevallen die als niet-astma zijn vastgesteld.

Vals-negatief (FN): Gevolg van een onterechte diagnose als niet-astma.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Optimalisatiestrategie
Om de optimale parameters voor elk van de voorgestelde benaderingen te bepalen, werd de Grid Search-techniek toegepast. Specifieke parameter-mogelijke waarden worden geplaatst in de Grid Search-methode. Daarom kan het de best mogelijke prestaties ontwikkelen voor precisieverbetering.

Figuren 5–7 tonen het resultaat van de Grid Search-techniek voor alle vier de voorgestelde benaderingen en de implementatieprocedure op de dataset met behulp van de top achttien attributen. Figuur 5 toont de SVM-nauwkeurigheden verkregen met verschillende parameterwaarden. De invoerwaarden voor de Kostprijs en Gamma die overeenkomen met meerdere typen kernels zijn als volgt:

Kerneltypes: Lineair, Radiaal, Sigmoïd en Polynomiaal.

Gamma: 0,001 en 0,0001.

Kosten: 1, 10, 100 en 1000.

figure-protocol-13
Figuur 5: SVM met verschillende kosten en gamma-types. Deze figuur toont SVM-gedrag met verschillende kosten- en gamma-types. Afkortingen; SVM = ondersteuningsvectormachine. Klik hier om een grotere versie van deze figuur te bekijken.

Voor de RF zijn de systematisch invoerwaarden die in Figuur 6 worden aangegeven als volgt:

De parameternamen, samen met hun respectievelijke waarden, worden hieronder gegeven:

Aantal functies: 'auto', 'sqrt'.

Maximale diepte: 1, 3, 5, 7.

MIN-monsters verdeeld: 2, 3, 4, 5.

MIN-monsterblad: 2, 3, 4, 5.

figure-protocol-14
Figuur 6: RF met verschillende dieptewaarden en minimale monsterbladeren. Deze figuur toont RF-gedrag met verschillende dieptes en minimale bladwaarden van het monsterblad. Afkortingen; RF = willekeurig bos. Klik hier om een grotere versie van deze figuur te bekijken.

Voor de ANN zijn de analytische invoerwaarden aangegeven in Figuur 7.

De parameternamen, samen met hun respectievelijke waarden, zijn als volgt:

Verborgen laaggroottes: (50, 50, 50), (50, 100, 50) en (100,).
Activatie: 'tanh' en 'relu'.
Solver: 'sgd' en 'adam'.
Alpha: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 en 0,05.
Leertempo: 'constant' en 'adaptief'.

figure-protocol-15
Figuur 7: ANN met verschillende alfawaarden en verborgen laaggroottes. Deze figuur toont het gedrag van de ANN met verschillende alfawaarden en verborgen laaggroottes. Afkortingen; ANN = kunstmatig neuraal netwerk. Klik hier om een grotere versie van deze figuur te bekijken.

ClassifierParameterWaarde
SVMGamma0.0001
Kerneltype'RBF'
Kosten 'C"10
Willekeurige toestand42
RFMaximale diepte3
Min monster blad2
Min samples splitsen2
Willekeurige toestand42
ANNActivering'relu'
alpha0.001
Grootte van de verborgen laag(50,50,50)
Leertempo'constant'
solver'Adam'
Willekeurige toestand42

Tabel 5: Samenvatting van optimale parameters voor de voorgestelde classificatoren. Deze tabel vat de optimale parameters samen die zijn verkregen voor de voorgestelde classifiers.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Invloed van de keuze van kenmerken
In de huidige studie wordt de recursieve feature-eliminatie-gebaseerde correlatiecoëfficiëntmethode gebruikt voor de feature-selectie. De correlatiecoëfficiënt wordt gebruikt om de kenmerken van het hoogste naar het laagste te ordenen volgens hun correlatiewaarden. Recursieve feature-eliminatie wordt gebruikt om te helpen bij het selecteren van geschikte features voor het model, waarbij de zwakste features geleidelijk worden geëlimin...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De huidige studie maakt gebruik van verschillende machine learning-algoritmen, waaronder SVM, ANN, RF en NB. Na het uitvoeren van verschillende experimenten, het fijn afstemmen van hyperparameters en de selectie van kenmerken, wordt geconcludeerd dat SVM, ANN en RF een opmerkelijke diagnostische nauwkeurigheid van 94% vertonen, terwijl NB relatief lager is met 83,33%. De resultaten werden gevalideerd met 10-voudige kruisvalidatie en geoptimaliseerde featureselectie, evenals de beste spli...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De dataset is verkregen van het ziekenhuis onder IRB-2020-09-429. De auteurs geven aan dat zij geen belangenconflicten hebben om te melden met betrekking tot de huidige studie. De studie is toegevoegd aan de Research Square-repository als preprint met de volgende citatie50.

BIJDRAGEN VAN AUTEURS:
De conceptualisatie is gedaan door S.O., M.I.B.A. en A.R.; Toezicht werd gedaan door S.O., M.I.B.A. en J.A.; Het schrijven van de originele versie werd uitgevoerd door S.S.A., E.A. en Z.A.; De implementatie werd gedaan door S.A.A., Y.A. en R.A.; De validatie werd uitgevoerd door J.A., M.A. en S.D.; Datacuratie werd gedaan door A.B., Y.A., E.A. en Z.A.; Review en redactie werden uitgevoerd door A.R., S.D. en A.B.; De projectadministratie werd uitgevoerd door A.R., S.D. en M.A. en de financiering werd verwerven door A.B., S.D. en A.R.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs willen graag de steun van zorgprofessionals erkennen bij het valideren van de bevindingen van de studie.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Excel 365MicrosoftExcel 365Wordt gebruikt om onbewerkte gegevens op te slaan in csv-indeling
Laptop/MachineDellXPS9320RAM 16GB, 12th Gen Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Wordt gebruikt voor het trainen van modelbouw
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Wordt gebruikt voor het trainen van modelbouw
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Wordt gebruikt voor het trainen van modelbouw
Python 3.12.12Google colab Notebook Python 3.12.12Wordt gebruikt voor het trainen van modelbouw
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Wordt gebruikt voor het trainen van modelbouw
SPSS IBM, USAVersie 26.0Wordt gebruikt voor statistische analyse
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Wordt gebruikt voor het trainen van modelbouw

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

AstmadiagnoseMachine LearningVroegtijdige DetectieAstma in Saudi ArabiRandom ForestsSupport Vector MachinesArtifici le Neurale NetwerkenMedische Data analyseVoorspelling van Chronische Ziekten

Gerelateerde artikelen