Forschungsartikel

Eine auf Computerintelligenz basierende frühe Diagnose von Asthma: Eine Fallstudie aus Saudi-Arabien

DOI:

10.3791/70040

16. Juni 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die aktuelle Studie untersucht mehrere maschinelle Lernalgorithmen auf einem saudischen Datensatz zur Asthmaerkennung. Im Gegensatz zu modernen Ansätzen, die maschinelles Lernen auf klinischen Datensätzen für Asthmadiagnostik verwenden, erzielt das vorgeschlagene Verfahren eine bessere Leistung mit einer Verbesserung der Diagnosegenauigkeit um 3,9 %.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Forschungen zufolge wurde ein Anstieg chronischer Krankheiten, einschließlich Asthma, festgestellt. Die Zahl der Asthmapatienten in Saudi-Arabien ist aufgrund der Wetterbedingungen und des Lebensstils, insbesondere in der Zeit nach der Pandemie, besorgniserregend. Es erfordert eine Lösung zur Reduzierung von Infektionen, indem ein intelligentes System entwickelt wird, um Asthma frühzeitig zu erkennen und so die Krankheit zu verhindern oder eine frühzeitige Behandlung zu ermöglichen. In dieser Studie wurde maschinelles Lernen genutzt, um Werkzeuge zu entwickeln, die Asthmasymptome in einem frühen Stadium verfolgen. Obwohl es bereits verschiedene frühere Versuche gab, maschinelles Lernen anzuwenden, um das Auftreten von Asthma vorherzusagen. Dennoch ist der Fokus auf die Identifizierung der Krankheit in der Vorsymptomphase, insbesondere im saudischen Kontext, ein relativ vernachlässigter Bereich. Der Datensatz der aktuellen Studie wurde vom King Fahad University Hospital in Dammam, Saudi-Arabien, bezogen und enthält Standardtests an Patienten, darunter Bluttests, Virentests und biochemische Tests. Der Datensatz enthält 17 signifikante Merkmale und Informationen für 328 Asthmapatienten: 165 positiv und 163 negativ. Die hier für die Anwendung ausgewählten Methoden sind Random Forests (RF), künstliche neuronale Netze (ANN), Support Vector Machines (SVM) und naive Bayes (NB). Jede dieser Methoden wurde aufgrund ihrer charakteristischen Merkmale ausgewählt. Das experimentelle Ergebnis zeigte, dass die RF-, SVM- und ANN-Ansätze 94 % lieferten, was die höchste Genauigkeit ist und den Stand der Technik um 3,9 % verbesserte. Es ist erwähnenswert, dass neun der siebzehn möglichen Merkmale verwendet wurden, um die oben genannte Genauigkeit zu erreichen. Obwohl RF, SVM und ANN die gleiche Genauigkeit erreichen, hat ANN eine höhere Fehlerquote. Daher sind RF und SVM basierend auf dem Ergebnismuster überlegen und werden daher für dieses Problem vorgeschlagen.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nach umfangreichen Forschungen stellten die Forscher fest, dass chronische Krankheitenimmer häufiger werden. Asthma ist eine chronisch entzündliche Erkrankung der Atemwege, die durch wiederkehrende Episoden von Atemnot und Keuchen gekennzeichnet ist. Die Prävalenz von Asthma variiert weltweit und liegt bei Kindern und Erwachsenen zwischen 1 und 20 % und betrifft weltweit Millionen von Menschen2. Diese großflächigen Veränderungen stehen im Zusammenhang mit Umweltschwankungen, einschließlich solcher in verschiedenen Ländern, sowie mit der Verwendung unterschiedlicher Bewertungsinstrumente und unterschiedlicher epidemiologischer Definitionen von Asthma. Asthma hat eine relativ niedrige Sterblichkeitsrate im Vergleich zu mehreren anderen bekannten chronischenKrankheiten. Berichte geben jedoch an, dass das Asthmamuster im Königreich Saudi-Arabien um 3,4 zunimmt.

Asthma ist eine chronisch entzündliche Erkrankung, die zu einer Verengung des Lumens führt. Die Verengung des Luftfahrtwegs wird durch die Ausweitung der Körperflüssigkeitsausstoßung sowie durch die Verdickung der Bronchienteiler durch Ödem, subepitheliale Fibrose und glatte Muskelhypertrophie verursacht. Pathophysiologische Mechanismen, die von verschiedenen Zelltypen, einschließlich Immunzellen, gesteuert werden, wurden zur Bewertung dieser Erkrankungeneingesetzt. Aufgrund der extremen Wetterbedingungen und hauptsächlich eines Lebensstils in Innenräumen in Saudi-Arabien gehört Asthma zu den am weitesten verbreiteten chronischen Krankheiten. Mehrere Umfragen haben die überwältigende Rate vonAsthma 6 gezeigt. Die Krankheit ist zu einem bedeutenden Problem geworden, das ein Frühreaktionssystem erfordert, um die Anzahl der Vorfälle zu verringern und eine frühzeitige Mediation zur Vorbeugung oder Heilung der Krankheit in einem früheren Stadium zu ermöglichen.

Im Gegensatz zu Einzelpersonen hat Asthma tiefgreifende Auswirkungen auf Gemeinschaften und Familien. Wenn sie nicht kontrolliert wird, setzt sie dem Leben des Patienten harte Grenzen und verhindert, dass er viele tägliche Aktivitäten ausübt. In Saudi-Arabien sind harte Wetterbedingungen, darunter eine heiße Atmosphäre, weitverbreitete Sandstürme und übermäßiger Einsatz von Innenklimaanlagen/-kühlsystemen, wesentliche Ursachen für Asthma. Die saudische Thoraxgesellschaft (STS) hat deutliche Anstrengungen unternommen, um die besten Medikamente für Atemwegsinfektionenbereitzustellen. Allerdings ist eine proaktive Diagnose von Asthma notwendig, um die Infektionsrate zu senken, insbesondere in einer postpandemischen (COVID-19-)Situation. Es wurde weiter festgestellt, dass familiäre Vorgeschichte, Rauchen und allergische Rhinitis zu den bedeutendsten Risikofaktoren für die Entwicklung von Asthma bei saudischen Erwachsenen gehören. Zusätzliche Forschung wurde empfohlen, um weitere Faktoren zu untersuchen, die die Grundlage für die Studie bildeten.

In dieser Forschung, unter Berücksichtigung früherer Studien zur Asthmadiagnose, ist das Ziel, die diagnostische Genauigkeit zu verbessern. Die vorgeschlagenen Techniken, darunter Random Forest (RF), künstliches neuronales Netzwerk (ANN), Support Vector Machine (SVM) und naive Bayes (NB), wurden in früheren Studien eingesetzt und führten zu spürbaren Verbesserungen bei den Diagnoseergebnissen. So haben Forscher beispielsweise ANN, SVM und NB in den Studien 8,9,10 verwendet. In der aktuellen Studie wurden maschinelle Lernmethoden untersucht, um als Frühwarnsystem zu dienen, das selbst die kleinen Anzeichen einer Asthmaerkrankung bereits in den frühesten Stadien (präsymptomatisches Stadium) erkennt. Die Häufigkeit von Asthma in Saudi-Arabien, besonders in der Zeit nach der Pandemie, mit Faktoren wie einem drinnen ausgerichteten Lebensstil aufgrund schwerer Wetterbedingungen, Klimaanlagenkanälen und Sandstürmen gehören zu den Hauptfaktoren. Es gibt jedoch keine nennenswerte Studie, die die entscheidenden Faktoren untersucht, die in der jüngeren Vergangenheit beobachtet wurden. Um diese Forschungslücke zu schließen, zielt die aktuelle Studie darauf ab, die Rolle des maschinellen Lernens bei der Früherkennung von Asthma bei saudischen Erwachsenen zu untersuchen. Darüber hinaus ist das Hauptziel, mit möglichst wenigen Merkmalen die höchstmögliche Genauigkeit zu erreichen. Obwohl es in der Vergangenheit erkennbare Bemühungen gab, maschinelles Lernen zur Vorhersage von Asthma 8,9,10 einzusetzen. Die aktuelle Studie zielt darauf ab, einen saudischen Datensatz zu nutzen, der erstmals aus einem öffentlichen Krankenhaus in der östlichen Provinz stammt, mit Fokus auf die frühzeitige Diagnose der Krankheit (präventive Diagnose). Maschinelles Lernen (ML) gilt als Methode zur Extraktion von Wissen aus gesammelten Daten11,12. Sie liefert eine Vorhersagegenauigkeit, die aus dem Lernprozess früherer Instanzen durch verschiedene maschinelle Lerntechniken gewonnen wird. ML umfasst mehrere Methoden, Algorithmen und Strategien, um analytische und prädiktive Probleme in breiten medizinischen Bereichen zu adressieren, wie etwa die frühzeitige Erkennung von Krankheitsexistenz13,14.

Mehrere Studien wurden durchgeführt, um Asthmaerkrankungen mit verschiedenen Techniken vorherzusagen. Forscher entwickelten ein künstliches neuronales Netzwerk (ANN) zur Asthmaklassifizierung basierend auf den dynamischen und statischen Patiententests8. Die gemessenen Parameter Spirometrie, Impulsoszillometrie (IOS), Auskultation, Allergieergebnisse und Informationen zu den Symptomen werden im ANN verwendet. Die definierten Informationen ermöglichen es der ANN, die entsprechende Asthmaklassifikation vorzuschlagen. Ebenso führten Forscher eine Studie durch, um die Herausforderungen bei der Diagnose von Brustkrankheitenzu untersuchen 7. Unterstützungsvektormaschinen (SVM) und die adaptiven SVM-Methoden (ASVM) wurden zur Diagnose von Brusterkrankungen wie Asthma eingesetzt. Die beste Klassifikationsgenauigkeit für alle Brusterkrankungen wurde mit der ASVM-Methode erreicht. Die Forscher verwendeten mehrere neuronale Netzwerkstrukturen, wie zum Beispiel mehrschichtiges NN (MLNN) mit Backpropagation-Algorithmus (BPA) mit einer und zwei versteckten Schichten, probabilistisches NN (PNN), Lernvektorquantisierung (LVQ) und allgemeine Regression NN (GRNN) zur Diagnose von Brusterkrankungen, einschließlich Asthma15. Zusätzlich führten einige eine vergleichende Studie zur Diagnose von Brusterkrankungen mit einem künstlichen Immunsystem (AIS) durch. Die genannten Studien haben verschiedene Strukturen zur Diagnose von Brusterkrankungen anhand ihrer unterschiedlichen Datensätze implementiert. Bei Asthma wurde das höchste Ergebnis mit AIS mit einer Gesamtgenauigkeit von 90,91 % erzielt. Darüber hinaus untersuchten Forscher die Wirksamkeit eines tiefen NN (DNN) zur Verbesserung der Genauigkeit bei der Asthmadiagnostik und verglichen die Vorhersageleistung verschiedener maschineller Lernalgorithmen, insbesondere mit logistischer Regression und SVM. Die Studie zeigte, dass der empirische Test, der das Modell der Asthmasymptome verwendet, effektiver für die genaue Diagnose von Asthma9 war. Eine weitere Studie zeigte die bedeutende Fähigkeit des maschinellen Lernens mit Telemonitoring-Daten zur Vorhersage von Asthma-Exazerbationen vorher, indem gewählte Machine-Learning-Ansätze wie SVM und Naïve Bayes ihr Experiment10 umsetzten.

Darüber hinaus setzten Forscher verschiedene maschinelle Lerntechniken ein, um Alzheimer-Krankheit (AD) präventiv zu diagnostizieren, darunter SVM, k-NN, adaptive Boosting (AdaBoost) und eXtreme gradient boosting (XGBoost)17. Die Forscher führten auch eine Studie durch, um Diabetes vorläufig zu diagnostizieren, indem sie vier Machine-Learning-Ansätze untersuchten, nämlich NB, SVM, K-NN und ANN. Die drei wichtigsten Merkmale des saudischen Datensatzes wiesen mit 68 % die höchste durchschnittliche Genauigkeit auf. Die Leistung der Messtechniken wurde anhand von Genauigkeit, Präzision, Rückruf und F1-Wert verglichen. Die ANN erreichte mit 77,5 % die höchste Klassifikationsgenauigkeit. Ebenso experimentierte dieselbe Forschergruppe mit der Durchführung von vier Klassifikationstechniken – nämlich NB, SVM, K-NN und ANN –, um chronische Nierenerkrankungen präventiv zu diagnostizieren, angewandt auf den saudischen Datensatz19. Darüber hinaus führten die Autoren eine Studie durch, um Schilddrüsenkrebs primitiv mit vier maschinellen Lerntechniken zu diagnostizieren: ANN, SVM, RF und NB. Mit 14 Merkmalen des saudischen Datensatzes erzielten die Autoren die höchste durchschnittliche Genauigkeit von 95 %. Die Leistung von Messtechniken wurde anhand von Genauigkeit, Präzision, Rückruf und F1-Score verglichen. Der RF erreichte mit 90,91 % die höchste Klassifikationsgenauigkeit. Die Forscher führten außerdem zwei Studien durch, die bemerkenswerte Ergebnisse bei der proaktiven Diagnose von rheumatoider Arthritis erzielten. Mehrere maschinelle Lerntechniken, wie SVM, logistische Regression (LR) und AdaBoost, wurden ausgewählt und als Kandidatentechniken für ein Wahlensemble verwendet. Anfangs wurde ein Datensatz verwendet, und der andere wurde durch Anwendung von SMOTE ausbalanciert. Die neuartige Methode des Abstimmungsensembles wurde mit zwei sequentiellen Merkmalsauswahlmethoden getestet. Nämlich werden Vorwärts- und Rückwärtsauswahl verwendet, um die beste Teilmenge des Merkmalsraums zu finden, die für jede Technik die höchsten Indikatoren präsentiert. Mit 30 Merkmalen der Originaldaten und der sequentiellen Vorwärtsauswahltechnik waren die erhaltenen Prozentsätze vielversprechend, mit Genauigkeits-, Abruf- und Präzisionswerten von 94,03 %, 96 % bzw. 93,51 %. Ebenso finden sich in vielen Studien weitere intelligente Methoden in der Medizin und verwandten Bereichen: 22,23,24,25,26.

Die vorgeschlagenen Techniken in dieser Arbeit sind RF, SVM, ANN und NB, da sie bei ähnlichen Problemen hervorragende Ergebnisse haben. In der aktuellen Studie werden die Ergebnisse durch die Experimente erzielt. Nach verschiedenen Optimierungsschritten und der Auswahl von Merkmalen zeigt sich, dass die vorgeschlagenen Techniken für die Asthmadiagnose mit dem Zielsatz vielversprechend sind.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Abschnitt beschreibt die maschinellen Lernalgorithmen, die im vorgeschlagenen Asthmadiagnoseansatz untersucht werden. Die Kriterien und Gründe für die Auswahl der vorgeschlagenen Methode basieren auf einer umfassenden Literaturübersicht und einer langen Geschichte in der präventiven Diagnose mehrerer chronischer Erkrankungen 27,28,29,30,31. Diese Algorithmen lieferten vielversprechende Ergebnisse. Alle in dieser Studie verwendeten Materialien und Werkzeuge sind in der Materialtabelle aufgeführt.

Unterstützende Vektormaschinen (SVM)
Der SVM-Algorithmus gehört zu den erfolgreichsten Algorithmen in der Mustererkennung und Klassifikation32. Sie verwendet binäre Klassifikation, bei der eine Trainingsmenge von Vektoren in zwei Klassen klassifiziert wird. Er gehört zur Familie der überwachten Lernalgorithmen, bei denen das gewünschte Ergebnis unter Supervision32 generiert wird. Im Vergleich zu anderen Klassifikationsalgorithmen im maschinellen Lernen liefert SVM bessere Ergebnisse für die Klassifikationsleistung. Daher wurde es in zahlreichen Anwendungen wie Sprach-, Gesichts- und Handschrifterkennung umfangreich eingesetzt. Darüber hinaus wurde SVM auch in verschiedenen Bereichen angewandt, darunter Krankheitsprognose und Aktienvorhersage. Zusätzlich kann SVM aufgrund seiner Unempfindlichkeit gegenüber Rauschen oder Überanpassung unsymmetrische Daten verarbeiten, was ein typischer Fall in der medizinischen Diagnostik ist, wo positive Fälle weniger sind als negative32.

In der Klassifikation trennt SVM zwei Klassen, indem es eine Entscheidungsgrenze zieht, bei der es die Bezeichnungen vorhersagen kann, indem ein oder mehrere Merkmalsvektoren32 unterschieden werden. Die Entscheidungsgrenze wird als Hyperebene bezeichnet, die am weitesten von den nächstgelegenen Datenpunkten jeder Klasse entfernt ist. Diese Datenpunkte werden als Unterstützungsvektoren bezeichnet. Abbildung 1 zeigt einige Kandidaten-Hyperebenen in linear separierbaren Daten. Gleichung 1 zeigt die Hyperebenengleichung, während die Gleichungen 2 und 3 die Elemente zeigen, die sich oberhalb und unterhalb der Ebene32 befinden:

figure-protocol-1Hyperebenengleichung (1)

Hier ist w ein Vektor, der das Gewicht darstellt, x ein Vektor, der die Eingabe darstellt, und b. eine potenzielle Verspannung.

figure-protocol-2Für alle j, so dass figure-protocol-3 = +1 (2) gilt

figure-protocol-4Für alle i, so dass figure-protocol-5 = -1 (3) gilt

figure-protocol-6
Abbildung 1: Ein typisches SVM mit zwei trennbaren Klassen. Diese Abbildung stellt eine typische SVM mit zwei separierbaren Klassen dar. Abkürzungen; SVM = Unterstützungsvektormaschine. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Künstliches neuronales Netzwerk (ANN)
ANN ist eine Computerintelligenz-Technik im Soft Computing, die die Funktionalität des menschlichen Gehirnsystems nachahmt. Es verfügt über eine große Anzahl miteinander verbundener Neuronen33. Er gehört zu den überwachten maschinellen Lernalgorithmen, die aus Beispieldatensätzen lernen und ihre Leistung durch Lernen verbessern können, wodurch nützliche Ausgaben33 generiert werden. Die Architektur von ANN besteht aus mehreren Schichten: einer Eingabeschicht, einer versteckten Schicht und einer Ausgabeschicht. Jeder von ihnen besteht aus einer Gruppe verbundenerNeuronen 33.

Das Neuron, das die Daten von außen empfängt, verarbeitet etwas und sendet die Daten dann an eine andere Schicht, die als Eingabeschicht bekannt ist. Der Zweck der Eingabeschicht ist es nicht, einen komplexen Prozess auf den Daten durchzuführen; Es geht einfach darum, den Eingabewert zu duplizieren und an die nächsteSchicht 33 zu senden. Die Ausgabeschicht enthält Neuronen, die Daten für das Benutzerprogramm erzeugen. Zwischen diesen beiden Schichten befindet sich die versteckte Schicht als optionale Schicht zur Durchführung von Rechenprozessen. Die versteckte Schicht dient als Zwischenschicht, die Eingaben der Eingabeneuronen empfängt, mathematische Operationen an ihnen durchführt und die Ergebnisse dann an eine andereSchicht 33 weitergibt. Abbildung 2 zeigt die ANN-Architektur.

figure-protocol-7
Abbildung 2: Vorwärts- und Rückpropagation in einer typischen ANN-Struktur. Diese Abbildung stellt ein Feedforward-Netzwerk mit Backpropagation in einer typischen ANN-Struktur dar. Abkürzungen; ANN = künstliches neuronales Netzwerk. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Das Vorwärts-NN ist ein Ansatz, der Eingabedaten in eine Vorwärtsrichtung speichert. In die entgegengesetzte Richtung findet der Rückpropagationsprozess statt, wenn die Gewichte des neuronalen Netzwerks rückwärts aktualisiert werden, um die Gradienten zu erhalten, wobei ein neuronales Netzwerk mit mehreren verborgenen Schichten verwendet wird. Der Nachteil dieses Prozesses ist das Verschwinden oder Explodieren von Gradienten. Die Aktivierungsfunktion erhält die nichtlinearen Eigenschaften ihres ANN, was es ihr ermöglicht, detaillierte Beziehungen zwischen Ein- und Ausgabedaten zu lernen, wie sie als universelle Näherung deklariert ist. Abbildung 3 zeigt die Hauptarchitektur des künstlichen neuronalen Netzwerks. Es veranschaulicht auch die Aktivierungsfunktion, die auf den Ausgang jedes Neurons angewendet wird und die Summe aller Eingabegewichte darstellt. Der Bias umfasst die Summe aller Gewichte und ist im Neuroneninput33 enthalten.

figure-protocol-8
Abbildung 3: Ein typisches einzelnes Perzeptronneuron für eine ANN. Diese Abbildung zeigt ein einzelnes Perzeptronneuron eines typischen ANN. Abkürzungen; ANN = künstliches neuronales Netzwerk. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Zufallswald (RF)
RF gehört zu den führenden Klassifikationsalgorithmen im maschinellen Lernen. Es besteht aus mehreren einzelnen Entscheidungsbäumen, die als Ensemble zusammenarbeiten und das endgültige Ergebnis29 produzieren. Das Grundkonzept hinter der erfolgreichen Leistung der RF besteht darin, dass sie aus vielen mäßig unkorrelierten Bäumen besteht (die einen Wald bilden), die als Ausschuss fungieren. Daher sind sie effizienter als alle Modelle, die unabhängig34 laufen. Der RF-Algorithmus wurde hauptsächlich von einerForschergruppe entwickelt. Um besser zu verstehen, wie RF funktioniert, ist es unerlässlich, Entscheidungsbäume35 zu verstehen. Sie ist gleichermaßen für diskrete und kontinuierliche Probleme anwendbar, insbesondere für Klassifikation, Detektion und Regression,36. Je mehr Bäume im Wald, desto näher wird das Ergebnis an der Genauigkeit sein, allerdings mit einer zusätzlichen Rechenkomplexitätvon 36, wie in Abbildung 4 dargestellt.

figure-protocol-9
Abbildung 4: Schema des zufälligen Waldes. Diese Abbildung zeigt ein Schema eines typischen Zufallswaldes. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Naive Bayes (NB)
Naïves Bayes (NB) ist ein Klassifikationsalgorithmus, der den Bayes-Satz zur Klassifizierung von Objekten verwendet. Es ist eine sehr beliebte Methode, die in den meisten medizinischen Bereichen angewandt wird, insbesondere zur Diagnose von Symptomen. Bei dieser Methode nehmen die Objekte die Hauptannahmen der Unabhängigkeit an, wodurch die Beziehung zwischen den Attributen voneinander unabhängig wird. Aufgrund seiner naiven Natur gehört er zu den einfachsten Klassifikationsalgorithmen im Machine Learning37. Basierend auf dem gegebenen Datensatz bestimmt NB die Wahrscheinlichkeit eines bestimmten Outputs. Das NB-Modell ist einfach zu entwickeln, kann umfangreiche Daten verwalten und ist ein ausgeklügelter und rechnerisch leichter Algorithmus. Zusätzlich liefert es bescheidene Funktionen, was zu numerischem und nominalem Wissen führt. Robustheit und einfache Lerninterpretationen sind ebenfalls potenzielle Vorteile des NB-Klassifikators. Wenn es auf eine begrenzte Datenmenge angewendet wird, führt das zu einem relativ ungenauen Ergebnis. Es beruht auf riesigen Datensätzen, die als weniger präzise gelten als andereTechniken 37.

Statistische Analyse
Die statistische Analyse des Datensatzes hilft, das Muster des Datensatzes zu visualisieren und zu verstehen, um die Datenvorverarbeitung und Modellierung zu verbessern. In diesem Zusammenhang wurden die folgenden Schritte umgesetzt. Zunächst wird eine statistische Analyse mit SPSS-Software durchgeführt, um zu untersuchen, ob die demografischen Merkmale zwischen positiven und negativen Gruppen, einschließlich Alter und Geschlecht, unausgewogen sind. Zweitens werden die quantitativen Daten mit einem unabhängigen Stichproben-t-Test zusammengestellt, wenn die Normalverteilung und Varianzhomogenität erfüllt sind, oder mit dem Man-Whitney-U-Test. Schließlich wurden die kategorialen Daten mit Chi-Quadrat-Test oder Fishers exaktem Test38 zusammengestellt.

Implementierung
Datensatzbeschreibung
Der Datensatz für die aktuelle Studie wurde nach Genehmigung durch das institutionelle Überprüfungsgremium (IRB) vom King Fahad University Hospital in Dammam, Saudi-Arabien, bezogen. Die genannten Daten wurden gemäß Standardtests bei den Patienten erhoben. Asthma wird häufig durch Standardtests bei Patienten diagnostiziert, darunter Bluttests, Virustests und biochemische Tests. Für die aktuelle Studie wurden Patienten und gesunde Kontrollpersonen (HC) rekrutiert und klinisch auf Basis der standardmäßigen Triage- und pathologischen Tests im Krankenhaus auf Empfehlung der Ärzte der Abteilung untersucht. Die klinischen Einschluss- und Ausschlusskriterien wurden von den Ärzten basierend auf den Laborergebnissen festgelegt. Anschließend wurden qualifizierte und verifizierte Daten für die Studie bereitgestellt. Der Datensatz enthält siebzehn Attribute, da sie für alle Asthmapatienten verfügbar sind. Der Datensatz umfasst insgesamt 328 Fälle, davon 165 asthma-positive und 163 asthma-negative Fälle. Die Verteilung von Geschlecht und Alter in den positiven und negativen Gruppen ist in Tabelle 1 aufgeführt.

FällePositivNegativ
Männlich14510738
Weiblich18357126
Gesamt328164164

Tabelle 1: Geschlechterverteilung des Datensatzes. Diese Tabelle zeigt die Geschlechterverteilung im Datensatz.

Tabelle 2 zeigt die Altersverteilung zwischen den beiden Klassen.

AltersgruppeAltersverteilung (Klasse = 1)Altersverteilung (Klasse = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tabelle 2: Altersverteilung der Datensätze. Diese Tabelle zeigt die Altersverteilung im Datensatz.

Das Alter (p < 0,001 im Man-Whitney U-Test) und das Geschlecht (p < 0,001 im Chi-Quadrat-Test) waren zwischen den positiven und negativen Gruppen unausgewogen. Es gibt jedoch keine Voreingenommenheit im Rekrutierungsprozess. Es wird angenommen, dass die unausgewogene Verteilung die einzigartige Altersverteilung dieser Patientengruppe widerspiegeln könnte. Zu den Einschlusskriterien gehören klinische Faktoren für das Vorhandensein und Fehlen der Krankheit; Demografie, einschließlich Geschlecht, Alter und lokaler Bevölkerung, werden berücksichtigt. Außerdem wurden die Daten unter informierter Einwilligung erhoben. Alter und Geschlecht sind als mögliche Merkmale im Funktionsset enthalten, wie unten angegeben. Explizite alters- und geschlechtsspezifische Analysen fallen jedoch nicht in den Rahmen der Studie und bleiben als zukünftige Arbeit.

Der Datensatz wird als numerische Werte gespeichert. Die Spalte "Klasse" enthält die Werte 0 und 1, wobei 0 den "normalen Patienten" und 1 den "Asthmapatient" darstellt.
In diesem Zusammenhang wurden folgende siebzehn Attribute verwendet:
Klasse: (0 = "Normal", 1 = "Asthmapatient")

1. Alter in Jahren (AGE)

2. Geschlecht (1 = männlich, 0 = weiblich): GESCHLECHT

3. Basophile (BASO)

4. Eosinophile (EOS)

5. Hämatokrit (HCT)

6. Hämoglobin (HGB)

7. Lymphozyten (LYM)

8. Mittleres korpuskuläres Hämoglobin (MCH)

9. Mittlere korpuskuläre Hämoglobinkonzentration (MCHC)

10. Mittleres Korpuskulärvolumen (MCV)

11. Monocyten (MONO)

12. Mittleres Thrombozytenvolumen (MPV)

13. Funktion der Neutrophile (NEUT)

14. Thrombozytenzahl (PLATELET_COUNT)

15. Rote Blutkörperchen (RBC)

16. Verteilungsbreite der roten Blutkörperchen (RDW)

17. Weiße Blutkörperchen (WBC)

Statistische Merkmale des Datensatzes
Für ein besseres Verständnis ist eine statistische Analyse des Datensatzes in den folgendenTabellen 38 dargestellt. Tabelle 3 zeigt den Mittelwert, Median, Standardabweichung, Maximum und Minimum für den betrachteten Datensatz.

MittelMedianStandardabweichungMaxMin
ALTER39.13618.136932
GESCHLECHT0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Baureihe0.50.50.500810

Tabelle 3: Statistische Merkmale des Datensatzes. Diese Tabelle listet die statistischen Merkmale der Daten auf.

Zusätzlich zeigt Tabelle 4 den erhaltenen Korrelationskoeffizienten zwischen jedem Attribut und dem Klassenattribut. Seine Werte liegen zwischen 0 (am wenigsten korreliert) und 1 (am meisten korreliert). Sie wird als vorläufige statistische Analyse hinzugefügt, um die Datensatzattribute zu erklären. MPV, Geschlecht, HGB, MCHC und Alter gehören zu den wichtigsten Merkmalen.

Paare von AttributenKorrelationskoeffizient
ALTER0.212473
GESCHLECHT0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Baureihe1

Tabelle 4: Korrelation mit dem Klassenattribut. Diese Tabelle zeigt die Korrelation zwischen den Attributen (Merkmalen) und dem Klassenattribut.

Experimenteller Aufbau
In der aktuellen Studie wird die Programmiersprache Python verwendet, um den gesammelten Datensatz vorzuverarbeiten. Aufgrund menschlicher Fehler fehlen bei der Dateneingabe und -auswahl bestimmte Werte. Imputationstechniken wurden verwendet, um fehlende Werte im Datensatz zu behandeln. Dies geschieht, indem fehlende Werte durch den Durchschnitt des Attributs ersetzt werden. Aufgrund ihrer Einfachheit, Modellkompatibilität und Erhaltung der Stichprobenmittelwerte, wie sie mit medizinischem Fachpersonal besprochen werden. Außerdem wird die Merkmalsauswahl mithilfe von Korrelationskoeffizienten durchgeführt, um die Attribute zu rangieren. Die Features mit höheren Korrelationswerten wurden zusammen mit dem vollständigen Feature-Set für die Analyse ausgewählt. Python-Bibliotheken wurden für die Implementierung des vorgeschlagenen Ansatzes, zur Abstimmung von Hyperparametern und zur Ergebnisgewinnung verwendet. Die Merkmalsauswahl und -eliminierung wurden mit einer Attributauswahlmethode durchgeführt, um die Merkmalsgruppen mit höchster Genauigkeit zu identifizieren. Zusätzlich wurde Python verwendet, um die Genauigkeit mittels 10-facher Kreuzvalidierung und Direct Partition Ratio Evaluationsmethoden zu bewerten, wie in den gegebenen Gleichungen39,40 angegeben. Schließlich wurde der Mittelwert aller Ergebnisse der Bewertungsmethoden berechnet, um die verwendeten Bewertungsmethoden zu vergleichen und die Methode mit der besten Durchschnittsgenauigkeit38 zu bestimmen. Zusätzlich wurden Verwirrungsmatrizen mit den optimalen Parametern SVM, ANN, RF und NB erzeugt. Anschließend wurde ein Vergleich von falsch-positiven (FP), falsch-negativen (FN), echt-positiven (TP) und echt-negativen (TN-)-Verhältnissen durch die Berechnung des F1-Scores durchgeführt, der ein effizientes Maß zum Vergleich der besten Methode41,42 ist.

Bewertungsmetriken
Um die Leistung des vorgeschlagenen Ansatzes zu bewerten, werden vier bekannte Leistungskennzahlen berücksichtigt. Nämlich Genauigkeit, Präzision, Rückruf und F1-Wert. Die Klassifikationsgenauigkeit ist das primäre Maß, da der Prozentsatz korrekt klassifizierter Fälle für jede Instanz berechnet wird. Präzision ist die Gesamtzahl der erwarteten TP-Punkte. Der Rückruf ist die Anzahl der TP höher als jedes tatsächliche Plus. F1-Score-Leistung jeder Klasse. Je nach Leistungsfähigkeit der Ausgaben ergeben sich folgende Metriken: 43,44,45:

True Positive (TP): Ergebnis einer korrekten Diagnose als Asthma.

Falsch-positiv (FP): Folge einer fälschlicherweise diagnostizierten Asthma.

Wahrnegativ (TN): Ergebnis korrekter Fälle, die als Nicht-Asthma diagnostiziert wurden.

Falsch-negativ (FN): Folge einer fälschlichen Diagnose als Nicht-Asthma.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Optimierungsstrategie
Um die optimalen Parameter für jeden der vorgeschlagenen Ansätze zu bestimmen, wurde die Grid Search-Technik eingesetzt. Spezifische mögliche Parameterwerte werden in der Grid Search-Methode eingegeben. Daher kann es die bestmögliche Leistung für präzise Verbesserungen entwickeln.

Die Abbildungen 5–7 zeigen das Ergebnis der Grid Search-Technik für alle vier vorgeschlagenen Ansätze sowie das Implementierungsverfahren des Datensatzes mit Hilfe der achtzehn wichtigsten Attribute. Abbildung 5 zeigt die SVM-Genauigkeiten mit verschiedenen Parameterwerten. Die Eingabewerte für Kosten und Gamma, die mehreren Kerneltypen entsprechen, sind wie folgt:

Kerntypen: Linear, Radial, Sigmoid und Polynom.

Gamma: 0,001 und 0,0001.

Kosten: 1, 10, 100 und 1000.

figure-protocol-13
Abbildung 5: SVM mit unterschiedlichen Kosten und Gamma-Typen. Diese Abbildung zeigt das SVM-Verhalten mit unterschiedlichen Kosten- und Gamma-Typen. Abkürzungen; SVM = Unterstützungsvektormaschine. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Für das RF sind die systematisch in Abbildung 6 dargestellten Eingabewerte wie folgt:

Die Parameternamen zusammen mit ihren jeweiligen Werten sind unten angegeben:

Anzahl der Funktionen: 'Auto', 'Sqrt'.

Maximale Tiefe: 1, 3, 5, 7.

MIN-Proben geteilt: 2, 3, 4, 5.

MIN-Proben Blatt: 2, 3, 4, 5.

figure-protocol-14
Abbildung 6: HF mit unterschiedlichen Tiefenwerten und minimalen Probenblättern. Diese Abbildung zeigt das HF-Verhalten mit unterschiedlichen Tiefen und minimalen Blattwerten der Probe. Abkürzungen; RF = Zufallswald. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Für die ANN sind die analytischen Eingabewerte in Abbildung 7 dargestellt.

Die Parameternamen zusammen mit ihren jeweiligen Werten sind wie folgt:

Versteckte Schichtgrößen: (50, 50, 50), (50, 100, 50) und (100,).
Aktivierung: 'tanh' und 'relu'.
Solver: 'sgd' und 'adam'.
Alpha: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 und 0,05.
Lernrate: 'konstant' und 'adaptiv'.

figure-protocol-15
Abbildung 7: ANN mit unterschiedlichen Alpha-Werten und verborgenen Schichtgrößen. Diese Abbildung zeigt das Verhalten des ANN mit unterschiedlichen Alpha-Werten und versteckten Schichtgrößen. Abkürzungen; ANN = künstliches neuronales Netzwerk. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

KlassifikatorParameterWert
SVMGamma0.0001
Kerntyp'RBF'
Kosten 'C"10
Zufallszustand42
RFMaximale Tiefe3
Min-Proben des Blattes2
Min-Proben spalten sich2
Zufallszustand42
ANNAktivierung'relu'
Alpha0.001
Größe der versteckten Schicht(50,50,50)
Lernrate'Konstant'
Solver'Adam'
Zufallszustand42

Tabelle 5: Zusammenfassung der optimalen Parameter für die vorgeschlagenen Klassifikatoren. Diese Tabelle fasst die optimalen Parameter zusammen, die für die vorgeschlagenen Klassifikatoren erhalten wurden.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Einfluss der Merkmalsauswahl
In der aktuellen Studie wird für die Merkmalsauswahl die rekursive, auf Merkmale basierende Korrelationskoeffizientenmethode verwendet. Der Korrelationskoeffizient wird verwendet, um die Merkmale von der höchsten bis zur niedrigsten nach ihren Korrelationswerten zu ordnen. Rekursive Merkmalsausschaltung wird verwendet, um bei der Auswahl geeigneter Merkmale für das Modell zu helfen, indem die schwächsten Merkmale schrittweise eliminiert we...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die aktuelle Studie verwendet mehrere maschinelle Lernalgorithmen, darunter SVM, ANN, RF und NB. Nach mehreren Experimenten, Feinabstimmung der Hyperparameter und Merkmalsauswahl wird festgestellt, dass SVM, ANN und RF eine bemerkenswerte diagnostische Genauigkeit von 94 % aufweisen, während NB mit 83,33 % vergleichsweise niedriger ist. Die Ergebnisse wurden mittels 10-facher Kreuzvalidierung und optimierter Merkmalauswahl sowie dem besten Aufteilungsverhältnis validiert. Laut den angege...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Der Datensatz wurde vom Krankenhaus unter IRB-2020-09-429 bezogen. Die Autoren erklären, dass sie keine Interessenkonflikte in Bezug auf die aktuelle Studie zu berichten haben. Die Studie wurde als Preprint mit folgender Zitation50 in das Research Square-Repository aufgenommen.

BEITRÄGE DER AUTOREN:
Die Konzeptualisierung wurde von S.O., M.I.B.A. und A.R. durchgeführt; Die Aufsicht wurde von S.O., M.I.B.A. und J.A. durchgeführt; Das Schreiben des Originalentwurfs wurde von S.S.A., E.A. und Z.A. übernommen; Die Umsetzung erfolgte durch S.A.A., Y.A. und R.A.; Die Validierung erfolgte durch J.A., M.A. und S.D.; Die Datenkuratierung erfolgte durch A.B., Y.A., E.A. und Z.A.; Review und Editing wurden von A.R., S.D. und A.B. durchgeführt; Die Projektverwaltung wurde von A.R., S.D. und M.A. übernommen, und die Finanzierungsbeschaffung erfolgte durch A.B., S.D. und A.R.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren möchten die Unterstützung der medizinischen Fachkräfte bei der Validierung der Ergebnisse der Studie anerkennen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Excel 365MicrosoftExcel 365Zum Speichern von Rohdaten im CSV-Format
Laptop/MaschineDellXPS9320RAM 16GB, 12th Gen Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Zum Erstellen von Modellbautraining 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Zum Erstellen von Modellbautraining 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Zum Erstellen von Modellbautraining 
Python 3.12.12Google colab Notebook Python 3.12.12Zum Erstellen von Modellbautraining 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Zum Erstellen von Modellbautraining 
SPSS IBM, USAVersion 26.0Zur statistischen Analyse verwendet
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Zum Erstellen von Modellbautraining 

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Asthma DiagnosisMachine LearningEarly DetectionSaudi Arabia AsthmaRandom ForestsSupport Vector MachinesArtificial Neural NetworksMedical Data AnalysisChronic Disease Prediction

Verwandte Artikel