Articolo di ricerca

Una diagnosi precoce basata sull'intelligenza computazionale della malattia asmatica: uno studio di caso saudita

DOI:

10.3791/70040

16 giugno 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'attuale studio indaga diversi algoritmi di machine learning su un dataset saudita per la rilevazione dell'asma. A differenza degli approcci all'avanguardia che impiegano il machine learning su dataset clinici per la diagnostica dell'asma, lo schema proposto ottiene prestazioni migliori, con un miglioramento del 3,9% nell'accuratezza della diagnosi.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Secondo le ricerche, è stato identificato un aumento delle malattie croniche, inclusa l'asma. Il numero di pazienti asmatici in Arabia Saudita è motivo di preoccupazione a causa delle condizioni meteorologiche e dello stile di vita, specialmente nell'era post-pandemica. Richiede una soluzione per ridurre le infezioni sviluppando un sistema intelligente per rilevare l'asma in una fase precoce, prevenendo così la malattia o permettendo un trattamento precoce. In questo studio, il machine learning è stato utilizzato per sviluppare strumenti che monitorino i sintomi dell'asma nelle prime fasi iniziali. Sebbene ci siano stati vari tentativi precedenti di applicare il machine learning per prevedere la comparsa dell'asma. Tuttavia, concentrarsi sull'identificazione della malattia nella fase pre-sintomale, in particolare nel contesto saudita, è un ambito relativamente trascurato. Il dataset per il presente studio è stato ottenuto presso il King Fahad University Hospital di Dammam, Arabia Saudita, e includeva test standard eseguiti sui pazienti, tra cui esami del sangue, test virali e test biochimici. Il dataset contiene 17 attributi significativi e include informazioni su 328 pazienti asmatici: 165 sono positivi e 163 negativi. I metodi selezionati per l'applicazione qui sono le foreste casuali (RF), le reti neurali artificiali (ANN), le macchine a vettori di supporto (SVM) e i Bayes ingenui (NB). Ognuno di questi metodi è stato scelto in base alle sue caratteristiche distintive. L'esito sperimentale ha rivelato che gli approcci RF, SVM e ANN hanno prodotto il 94%, che rappresenta la massima accuratezza e hanno migliorato lo stato dell'arte del 3,9%. Vale la pena notare che nove delle diciassette possibili caratteristiche sono state utilizzate per raggiungere la precisione sopra citata. Nonostante RF, SVM e ANN raggiungano la stessa precisione, ANN ha un costo di errore più elevato. Pertanto, RF e SVM sono superiori in base al modello dei risultati, e quindi vengono suggerite per questo problema.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dopo aver condotto ricerche approfondite, i ricercatori hanno osservato che le malattie croniche sono diventate sempre piùcomuni. L'asma è una malattia infiammatoria cronica delle vie aeree caratterizzata da episodi ricorrenti di mancanza di respiro e respiro sibilante. La prevalenza dell'asma varia a livello globale, variando dall'1 al 20% sia per bambini che per adulti, colpendo milioni di persone intutto il mondo 2. Questi cambiamenti su larga scala sono legati alle variazioni ambientali, incluse quelle in vari paesi, nonché all'uso di diversi strumenti di valutazione e a diverse definizioni epidemiologiche di asma. L'asma ha un tasso di mortalità relativamente basso rispetto ad altre malattie croniche bennote 2. Tuttavia, i rapporti indicano che il modello dell'asma nel Regno dell'Arabia Saudita sta aumentandodi 3,4.

L'asma è una condizione infiammatoria cronica che provoca un restringimento della lumine. Il restringimento della rotta aeronautica è causato dall'espansione delle emissioni di fluidi corporei, così come dall'ispessimento dei divisori bronchiali dovuto a edema, fibrosi sottoepiteliale e ipertrofia muscolare liscia. Sono stati utilizzati apparati fisiopatologici azionati da vari tipi cellulari, incluse le cellule immunitarie, per valutare questecondizioni 5. A causa delle condizioni meteorologiche severe e di uno stile di vita principalmente al chiuso in Arabia Saudita, l'asma è tra le malattie croniche più diffuse. Diverse indagini hanno dimostrato il tasso schiacciante diasma 6. La malattia è diventata un problema significativo, richiedendo un sistema di risposta precoce per ridurre il numero di incidenti e rendere possibile una mediazione precoce per prevenire o curare la malattia in una fase precoce.

A differenza degli individui, l'asma ha un impatto profondo sulle comunità e sulle famiglie. Se non controllata, impone gravi limiti alla vita del paziente e gli impedisce di impegnarsi in molte attività quotidiane. In Arabia Saudita, condizioni meteorologiche avverse, tra cui un'atmosfera calda, tempeste di sabbia diffuse e un uso eccessivo di sistemi di condizionamento e raffreddamento al chiuso, sono fattori significativi che contribuiscono all'asma. La società toracica saudita (STS) ha fatto sforzi evidenti per fornire i migliori farmaci per le infezionirespiratorie. Tuttavia, è necessaria una diagnosi proattiva dell'asma per ridurre il tasso di infezione, soprattutto in uno scenario post-pandemico (COVID-19). È stato inoltre dedotto che la storia familiare, il fumo e la rinite allergica sono tra i fattori di rischio più significativi per lo sviluppo dell'asma tra gli adulti sauditi. Sono state raccomandate ulteriori ricerche per indagare altri fattori che hanno gettato le basi dello studio.

In questa ricerca, considerando studi precedenti sulla diagnosi dell'asma, l'obiettivo è migliorare l'accuratezza diagnostica. Le tecniche proposte, tra cui la foresta casuale (RF), la rete neurale artificiale (ANN), la macchina a vettori di supporto (SVM) e la Bayes ingenua (NB), sono state utilizzate in studi precedenti, portando a miglioramenti evidenti nei risultati della diagnosi. Ad esempio, i ricercatori hanno utilizzato ANN, SVM e NB negli studi 8,9,10. Nel studio attuale sono stati studiati approcci di apprendimento automatico per servire come sistema di allerta precoce che rileva anche i piccoli indicatori di malattia asmatica nelle fasi più precoci (pre-sintomatiche). La prevalenza dell'asma in Arabia Saudita, specialmente nell'era post-pandemica, con fattori come uno stile di vita orientato all'interno dovuto alle condizioni meteorologiche severe, condotti dell'aria condizionata e tempeste di sabbia, sono tra i principali fattori. Tuttavia, non esiste uno studio degno di nota che indaghi i fattori cruciali osservati recentemente. Per colmare questa lacuna nella ricerca, l'attuale studio mira a indagare il ruolo del machine learning nella diagnosi precoce dell'asma tra gli adulti sauditi. Inoltre, l'obiettivo principale è raggiungere la massima precisione possibile con il minor numero possibile di caratteristiche. Sebbene in passato ci siano stati tentativi riconoscibili per utilizzare il machine learning per prevedere la presenza della malattiaasmatica 8,9,10. L'attuale studio mira a utilizzare un dataset saudita, ottenuto per la prima volta da un ospedale pubblico nella provincia orientale, concentrandosi sulla diagnosi della malattia in una fase precoce (diagnosi preventiva). Il machine learning (ML) è riconosciuto come un metodo per estrarre conoscenza dai datiraccolti 11,12. Fornisce una precisione predittiva ottenuta dal processo di apprendimento di istanze precedenti utilizzando varie tecniche di machine learning. L'ML comprende molteplici metodi, algoritmi e strategie per affrontare problemi analitici e predittivi in ampi campi medici, come la diagnosi precoce della presenza di malattie13,14.

Sono stati condotti diversi studi per prevedere la malattia asmatica utilizzando varie tecniche. I ricercatori hanno sviluppato una rete neurale artificiale (ANN) per la classificazione dell'asma basandosi sui test dinamici e statici suipazienti 8. I parametri misurati di spirometria, oscillometria impulsiva (IOS), auscultazione, risultati allergici e informazioni sui sintomi sono utilizzati nell'ANN. Le informazioni definite permettono all'ANN di suggerire la classificazione adeguata dell'asma. Allo stesso modo, i ricercatori hanno condotto uno studio per affrontare le difficoltà nella diagnosi delle malattietoracici 7. Le macchine a vettore di supporto (SVM) e i metodi adattivi SVM (ASVM) sono stati utilizzati per diagnosticare malattie toraciche come l'asma. La migliore accuratezza di classificazione per tutte le malattie toraciche è stata ottenuta utilizzando il metodo ASVM. I ricercatori hanno utilizzato diverse strutture di reti neurali, come la multi-layer NN (MLNN) con algoritmo di retropropagazione (BPA) con uno o due strati nascosti, la probabilistica NN (PNN), la quantizzazione dei vettori di apprendimento (LVQ) e la regressione generale NN (GRNN), per la diagnosi di malattie toraciche, inclusa la malattiaasmatica 15. Inoltre, alcuni hanno condotto uno studio comparativo volto alla diagnosi delle malattie toraciche utilizzando un sistema immunitario artificiale (AIS). Gli studi menzionati hanno implementato varie strutture per diagnosticare problemi di malattie toraciche utilizzando i loro diversi dataset. Per l'asma, il risultato più alto è stato ottenuto utilizzando l'AIS con una precisione complessiva del 90,91%16. Inoltre, i ricercatori hanno indagato l'efficacia di una NN profonda (DNN) per migliorare l'accuratezza nella diagnosi dell'asma e hanno confrontato le prestazioni di previsione di diversi algoritmi di apprendimento automatico, in particolare con la regressione logistica e la SVM. Lo studio ha dimostrato che il test empirico che utilizzava il modello dei segni dell'asma era più efficace per una diagnosi accurata diasma 9. Un altro studio ha dimostrato la significativa capacità del machine learning utilizzando dati di telemonitoraggio per prevedere le esacerbazioni dell'asma prima che si verifichino, attraverso approcci di machine learning scelti come SVM e Naïve Bayes per implementare il loroesperimento 10.

Oltre a ciò, i ricercatori hanno utilizzato diverse tecniche di machine learning per diagnosticare preventivamente la malattia di Alzheimer (AD), tra cui SVM, k-NN, adaptive boosting (AdaBoost) e eXtreme gradient boosting (XGBoost)17. I ricercatori hanno condotto uno studio per diagnosticare preliminarmente anche il diabete, indagando quattro approcci di apprendimento automatico, ovvero NB, SVM, K-NN e ANN. Le tre principali caratteristiche del dataset saudita hanno mostrato la massima accuratezza media del 68%. Le prestazioni delle tecniche di misurazione sono state confrontate in base a accuratezza, precisione, richiamo e punteggio F1. L'ANN ha ottenuto la massima accuratezza di classificazione, pari al 77,5%18. Allo stesso modo, lo stesso gruppo di ricercatori ha sperimentato l'esecuzione di quattro tecniche di classificazione — ovvero NB, SVM, K-NN e ANN — per diagnosticare preventivamente la malattia renale cronica, applicata al datasetsaudita 19. Inoltre, gli autori hanno condotto uno studio per diagnosticare primitivamente il cancro alla tiroide utilizzando quattro tecniche di machine learning: ANN, SVM, RF e NB. Utilizzando 14 caratteristiche del dataset saudita, gli autori hanno ottenuto la massima accuratezza media del 95%. Le prestazioni delle tecniche di misurazione sono state confrontate utilizzando accuratezza, precisione, richiamo e punteggio F1. La RF ha ottenuto la massima accuratezza di classificazione, pari al 90,91%20. I ricercatori hanno inoltre condotto due studi che hanno prodotto risultati notevoli nella diagnosi proattiva dell'artrite reumatoide. Diverse tecniche di machine learning, come SVM, regressione logistica (LR) e AdaBoost, sono state selezionate e utilizzate come tecniche candidate per un ensemble di votazione. Inizialmente veniva utilizzato un set di dati e l'altro bilanciato applicando SMOTE. La nuova tecnica dell'ensemble di votazione è stata testata con due metodi sequenziali di selezione delle caratteristiche. In particolare, la selezione avanti e indietro viene utilizzata per trovare il miglior sottoinsieme dello spazio delle caratteristiche che presenta gli indicatori più alti per ciascuna tecnica. Utilizzando 30 caratteristiche dei dati originali e la tecnica sequenziale di selezione delle caratteristiche in seguito, le percentuali ottenute erano promettenti, con valori di accuratezza, richiamo e precisione rispettivamente del 94,03%, 96% e 93,51%. Analogamente, altri metodi intelligenti in medicina e campi correlati si trovano in molti studi 22,23,24,25,26.

Le tecniche proposte in questo lavoro sono RF, SVM, ANN e NB grazie ai loro risultati eccezionali per problemi simili. Nello studio attuale, i risultati ottenuti tramite gli esperimenti. Dopo vari passaggi di ottimizzazione e selezione delle caratteristiche, si dimostra che le tecniche proposte sono promettenti per la diagnosi dell'asma con il dataset target.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa sezione descrive gli algoritmi di machine learning studiati nell'approccio diagnostico dell'asma proposto. I criteri e le ragioni alla base della scelta del metodo proposto si basano su una revisione completa della letteratura e su una lunga storia di diagnosi preventiva di diverse malattie croniche 27,28,29,30,31. Questi algoritmi hanno prodotto risultati promettenti. Tutti i materiali e gli strumenti utilizzati in questo studio sono elencati nella Tabella dei Materiali.

Macchine a vettori di supporto (SVM)
L'algoritmo SVM è tra gli algoritmi di maggior successo nel riconoscimento e classificazionedi pattern 32. Utilizza la classificazione binaria, dove classifica un insieme di vettori di addestramento in due classi. Appartiene alla famiglia degli algoritmi di apprendimento supervisionato, dove l'output desiderato viene generato sotto lasupervisione 32. Rispetto ad altri algoritmi di classificazione nel machine learning, SVM fornisce risultati migliori per le prestazioni di classificazione. Perciò, è stato ampiamente utilizzato in numerose applicazioni come il riconoscimento del parlato, del volto e della calligrafia. Inoltre, la SVM è stata applicata anche in vari ambiti, tra cui la previsione delle malattie e la previsione delle scorte. Inoltre, a causa della sua insensibilità al rumore o al sovrafitting, la SVM può gestire dati sbilanciati, un caso tipico nella diagnostica medica, dove i casi positivi sono meno numerosi rispetto ai casinegativi 32.

Nella classificazione, SVM separa due classi tracciando un bordo decisionale, in cui può prevedere le etichette distinguendo uno o più vettori dicaratteristica 32. Il bordo decisionale è chiamato iperpiano, che è il più lontano dai punti dati più vicini di ciascuna classe. Questi punti dati sono chiamati vettori di supporto. La Figura 1 mostra alcuni iperpiani candidati in dati linearmente separabili. L'equazione 1 dimostra l'equazione dell'iperpiano, mentre le equazioni 2 e 3 mostrano gli elementi situati sopra e sotto il piano32:

figure-protocol-1Equazione dell'iperpiano (1)

Qui, w è un vettore che rappresenta il peso, x è un vettore che rappresenta l'ingresso, e b. rappresenta un potenziale bias.

figure-protocol-2Per ogni j, tale che figure-protocol-3 = +1 (2)

figure-protocol-4Per ogni i, tale che figure-protocol-5 = -1 (3)

figure-protocol-6
Figura 1: Un tipico SVM con due classi separabili. Questa figura visualizza una tipica SVM con due classi separabili. Abbreviazioni; SVM = macchina a vettori di supporto. Clicca qui per visualizzare una versione più grande di questa figura.

Reti neurali artificiali (ANN)
L'ANN è una tecnica di intelligenza computazionale nel soft computing che imita la funzionalità del sistema cerebrale umano. Ha un vasto numero di neuroniinterconnessi 33. È tra gli algoritmi di machine learning supervisionati che possono apprendere da dataset di esempio e migliorarne le prestazioni attraverso l'apprendimento, generando risultati utili33. L'architettura di ANN comprende più livelli: un livello di input, uno nascosto e uno di output. Ognuno di essi è formato da un insieme di neuroniconnessi 33.

Il neurone che riceve i dati dall'esterno esegue una parte di elaborazione e poi invia i dati a un altro livello noto come strato di input. Lo scopo dello strato di input non è eseguire alcun processo complesso sui dati; consiste semplicemente nel duplicare il valore di input e inviarlo al livellosuccessivo 33. Il livello di output contiene neuroni che producono dati per il programma utente. Tra questi due livelli, il livello nascosto si trova come strato opzionale per eseguire processi computazionali. Lo strato nascosto funge da strato intermedio che riceve input dai neuroni di ingresso, esegue operazioni matematiche su di essi e poi passa i risultati a un altro livello33. La Figura 2 mostra l'architettura ANN.

figure-protocol-7
Figura 2: Feed-forward e retropropagazione in una tipica struttura ANN. Questa figura visualizza una rete feed-forward con retropropagazione in una tipica struttura ANN. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.

La NN feed-forward è un approccio che memorizza i dati in ingresso in direzione diretta. Nella direzione opposta, il processo di retropropagazione avviene quando i pesi della rete neurale si aggiornano in modo retroattivo per ottenere i gradienti, utilizzando una rete neurale con diversi strati nascosti. Lo svantaggio di questo processo è la nullità o l'esplosione dei gradienti. La funzione di attivazione mantiene le caratteristiche non lineari del loro ANN, il che le consente di apprendere relazioni dettagliate tra dati di input e output, come dichiarata approssimazione universale. La Figura 3 mostra l'architettura principale della rete neurale artificiale. Illustra anche la funzione di attivazione applicata all'uscita di ogni neurone, che rappresenta la somma di tutti i pesi di ingresso. Il bias contiene la somma di tutti i pesi ed è incluso nell'inputneuronale 33.

figure-protocol-8
Figura 3: Un tipico singolo neurone perceptrone per un ANN. Questa figura raffigura un singolo neurone perceptrone di una tipica ANN. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.

Foresta casuale (RF)
La RF è tra gli algoritmi di classificazione più importanti nel machine learning. Consiste in diversi Decision Trees individuali che lavorano insieme come un ensemble e producono il risultatofinale 29. Il concetto di base alla base della performance di successo della RF è che essa è composta da molti alberi moderatamente non correlati (che formano una foresta), che agiscono come un comitato. Pertanto, saranno più efficienti di tutti i modelli che giranoindipendentemente con il 34. L'algoritmo RF è stato sviluppato principalmente da un gruppo diricercatori 35. Per comprendere meglio come funziona la RF, è essenziale comprendere gli alberidecisionali 35. È ugualmente applicabile sia a problemi discreti che continui, in particolare classificazione, rilevamento e regressione,rispettivamente 36. Più alberi ci sono nella foresta, più il risultato sarà accurato, ma con una complessità computazionaleaggiuntiva di 36, come mostrato nella Figura 4.

figure-protocol-9
Figura 4: Schema della Foresta Casuale. Questa figura mostra uno schema di una tipica foresta casuale. Clicca qui per visualizzare una versione più grande di questa figura.

Naive Bayes (NB)
Naïve Bayes (NB) è un algoritmo di classificazione che impiega il teorema di Bayes per classificare gli oggetti. È un metodo molto popolare applicato nella maggior parte dei campi medici, specialmente per diagnosticare i sintomi. In questo metodo, gli oggetti assumono le assunzioni principali di indipendenza, il che rende la relazione tra gli attributi indipendente tra loro. A causa della sua natura ingenua, è tra gli algoritmi di classificazione più semplici nel machinelearning 37. In base al dataset fornito, NB determina la probabilità di un determinato output. Il modello NB è semplice da sviluppare, può gestire dati consistenti ed è un algoritmo sofisticato e computazionalmente leggero. Inoltre, offre funzionalità contenute, che portano a dati numerici e nominali. La robustezza e le interpretazioni semplici dell'apprendimento sono anche i potenziali vantaggi del classificatore NB. Se viene impiegato su una quantità limitata di dati, porterà a un risultato relativamente impreciso. Dipende da enormi registri, considerati meno precisi rispetto ad altre tecniche.

Analisi statistica
L'analisi statistica del dataset aiuta a visualizzare e comprendere il modello del dataset per una migliore pre-elaborazione e modellazione dei dati. A tal proposito, sono stati eseguiti i seguenti passaggi. Innanzitutto, per verificare se le caratteristiche demografiche siano squilibrate tra gruppi positivi e negativi, inclusi età e genere, viene effettuata un'analisi statistica su software SPSS. In secondo luogo, compilare i dati quantitativi utilizzando un test t a campione indipendente se la distribuzione normale e l'omogeneità della varianza fossero soddisfatte, oppure il test Man-Whitney U. Infine, i dati categorici sono stati compilati usando il test chi-quadrato o il test esatto diFisher 38.

Implementazione
Descrizione del dataset
Il dataset per l'attuale studio è stato ottenuto dall'Ospedale Universitario King Fahad di Dammam, Arabia Saudita, dopo l'approvazione da parte del comitato di revisione istituzionale (IRB). I dati detti sono stati raccolti secondo test standard tra i pazienti. L'asma viene spesso diagnosticata tramite test standard tra i pazienti, inclusi esami del sangue, test virali e test biochimici. Per il presente studio, i pazienti e i controlli sani (HC) sono stati reclutati e valutati clinicamente sulla base del triage standard e dei test patologici condotti in ospedale su raccomandazione dei medici del reparto. I criteri di inclusione ed esclusione clinica sono stati definiti dai medici sulla base dei risultati di laboratorio. Successivamente, sono stati forniti i dati qualificati e verificati per lo studio. Il dataset contiene diciassette attributi, poiché sono disponibili per tutti i pazienti asmatici. Il dataset include 328 casi complessivi, di cui 165 asma positiva e 163 asma negativa. La distribuzione di genere ed età nei gruppi positivi e negativi è elencata nella Tabella 1.

IstanzePositivoNegativo
Maschio14510738
Femmina18357126
Totale328164164

Tabella 1: Distribuzione di genere nel dataset. Questa tabella mostra la distribuzione di genere nel dataset.

La Tabella 2 mostra la distribuzione per età tra le due classi.

Fascia d'etàDistribuzione per età (classe = 1)Distribuzione per età (classe = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tabella 2: Distribuzione per età del dataset. Questa tabella mostra la distribuzione per età nel dataset.

L'età (p < 0,001 nel test Man-Whitney U) e il genere (p < 0,001 nel test Chi-quadrato) erano sbilanciati tra i gruppi positivo e negativo. Tuttavia, non vi è alcun pregiudizio nel processo di reclutamento. Si ritiene che la distribuzione sbilanciata possa riflettere la distribuzione unica per età di questa coorte di pazienti. I criteri di inclusione includono fattori clinici per la presenza e assenza della malattia; vengono considerate le caratteristiche demografiche, tra cui genere, età e popolazione locale. Inoltre, i dati sono stati raccolti con consenso informato. Età e genere sono inclusi come potenziali caratteristiche nel set di funzionalità, come indicato di seguito. Tuttavia, analisi esplicite basate su età e genere non sono nell'ambito dello studio e sono lasciate come lavoro futuro.

Il dataset è memorizzato come valori numerici. La colonna "Classe" contiene i valori 0 e 1, dove 0 rappresenta il "paziente normale" e 1 rappresenta il "paziente asmatico".
A tal proposito, sono stati utilizzati i seguenti diciassette attributi:
Classe: (0 = "Normale", 1 = "Paziente asmatico")

1. età in anni (AGE)

2. genere (1 = maschio, 0 = femmina): GENERE

3. Basofili (BASO)

4. Eosinofili (EOS)

5. Ematocrito (HCT)

6. Emoglobina (HGB)

7. Linfociti (LYM)

8. Emoglobina corpuscolare media (MCH)

9. Concentrazione media di emoglobina corpuscolare (MCHC)

10. Volume medio corpuscolare (MCV)

11. Monociti (MONO)

12. Volume medio piastrinico (MPV)

13. Funzione dei neutrofili (NEUT)

14. Conteggio piastrinico (PLATELET_COUNT)

15. Conteggio dei globuli rossi (RBC)

16. Larghezza di distribuzione dei globuli rossi (RDW)

17. Globuli Bianchi (WBC)

Caratteristiche statistiche del dataset
Per una migliore comprensione, un'analisi statistica del dataset è illustrata nelle successive tabelle38. La Tabella 3 mostra la media, mediana, deviazione standard, massimo e minimo per il dataset in esame.

MediocreMedianaDeviazione standardMaxMin
ETÀ39.13618.136932
GENERE0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Classe0.50.50.500810

Tabella 3: Caratteristiche statistiche del dataset. Questa tabella elenca le caratteristiche statistiche dei dati.

Inoltre, la Tabella 4 mostra il coefficiente di correlazione ottenuto tra ciascun attributo e l'attributo classe. I suoi valori si collocano tra 0 (meno correlato) e 1 (più correlato). Viene aggiunta come analisi statistica preliminare per spiegare gli attributi del dataset. MPV, genere, HGB, MCHC ed età sono tra le caratteristiche più significative.

Coppie degli attributiCoefficiente di correlazione
ETÀ0.212473
GENERE0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Classe1

Tabella 4: Correlazione con l'attributo della classe. Questa tabella mostra la correlazione tra gli attributi (caratteristiche) e l'attributo classe.

Configurazione sperimentale
Nel studio attuale, il linguaggio di programmazione Python viene utilizzato per preelaborare il dataset raccolto. A causa di errori umani, valori specifici sono mancanti durante l'inserimento e la selezione dei dati. Sono state utilizzate tecniche di imputazione per gestire i valori mancanti nel dataset. Ciò si fa sostituendo i valori mancanti con la media dell'attributo. Grazie alla sua semplicità, compatibilità del modello e conservazione dei valori medi del campione, come discusso con i professionisti sanitari. Inoltre, la selezione delle caratteristiche viene effettuata utilizzando coefficienti di correlazione per classificare gli attributi. Le caratteristiche con valori di correlazione più alti sono state selezionate per l'analisi insieme all'insieme completo delle caratteristiche. Le librerie Python sono state utilizzate per l'implementazione dell'approccio proposto, la sintonia degli iperparametri e l'ottenimento di risultati. La selezione e l'eliminazione delle caratteristiche sono state eseguite tramite un metodo di selezione degli attributi per identificare i gruppi di caratteristiche con la massima accuratezza. Inoltre, Python è stato utilizzato per valutare l'accuratezza utilizzando metodi di validazione incrociata a 10 volte e valutazione del Direct Partition Ratio, come specificato dalle equazionifornite 39,40. Infine, è stata calcolata la media di tutti i risultati dei metodi di valutazione per confrontare i metodi di valutazione utilizzati e determinare il metodo con la migliore accuratezzamedia 38. Inoltre, le matrici di confusione sono state generate utilizzando i parametri ottimali di SVM, ANN, RF e NB. Successivamente, è stato effettuato un confronto tra falsi positivi (FP), falsi negativi (FN), veri positivi (TP) e veri negativi (TN) attraverso il calcolo del punteggio F1, che è una misura efficiente per confrontare il miglior metodo41,42.

Metriche di valutazione
Per valutare le prestazioni dell'approccio proposto, vengono considerate quattro metriche di performance ben note. Ovvero, precisione, richiamo e punteggio F1. L'accuratezza della classificazione è la misura principale perché la percentuale di istanze correttamente classificate viene calcolata per ogni istanza. La precisione è il numero totale di punti TP attesi. Il richiamo è il numero di TP più di ogni effettivo positivo. Prestazioni con punteggio F1 di ogni classe. Secondo la capacità degli output, si ottengono le seguentimetriche 43,44,45:

Vero positivo (TP): Risultato di una diagnosi corretta come asma.

Falso positivo (FP): Risultato di una diagnosi errata di asma.

Vero negativo (TN): Risultato dei casi corretti diagnosticati come non asmatici.

Falso negativo (FN): Risultato di una diagnosi errata come non asmatica.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Strategia di ottimizzazione
Per determinare i parametri ottimali per ciascuno degli approcci proposti, è stata utilizzata la tecnica della Grid Search. I parametri specifici possibili sono inseriti nel metodo Grid Search. Pertanto, può sviluppare le migliori prestazioni possibili per migliorare la precisione.

Le Figure 5–7 mostrano l'esito della tecnica Grid Search per tutti e quattro gli approcci proposti e la procedura di implementazione sul dataset con l'assistenza dei primi diciotto attributi. La Figura 5 presenta le accuratezze SVM ottenute con vari valori di parametri. I valori di input per il Costo e il Gamma corrispondenti a molteplici tipi di kernel sono i seguenti:

Tipi di kernel: Lineare, Radiale, Sigmoide e Polinomiale.

Gamma: 0,001 e 0,0001.

Costo: 1, 10, 100 e 1000.

figure-protocol-13
Figura 5: SVM con diversi costi e tipi gamma. Questa figura dimostra il comportamento delle SVM con diversi tipi di costo e gamma. Abbreviazioni; SVM = macchina a vettori di supporto. Clicca qui per visualizzare una versione più grande di questa figura.

Per la RF, i valori di input sistematicamente indicati nella Figura 6 sono i seguenti:

I nomi dei parametri, insieme ai rispettivi valori, sono forniti di seguito:

Numero di caratteristiche: 'auto', 'sqrt'.

Profondità massima: 1, 3, 5, 7.

Campioni MIN suddivisi: 2, 3, 4, 5.

Campioni MIN fogliano: 2, 3, 4, 5.

figure-protocol-14
Figura 6: RF con valori di profondità diversi e foglie minime del campione. Questa figura mostra il comportamento della RF con diverse profondità e valori minimi delle foglie del campione. Abbreviazioni; RF = foresta casuale. Clicca qui per visualizzare una versione più grande di questa figura.

Per l'ANN, i valori analitici di input sono indicati nella Figura 7.

I nomi dei parametri, insieme ai rispettivi valori, sono i seguenti:

Dimensioni dei layer nascosti: (50, 50, 50), (50, 100, 50) e (100,).
Attivazione: 'tanh' e 'relu'.
Risolutore: 'sgd' e 'adam'.
Alpha: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 e 0,05.
Tasso di apprendimento: 'costante' e 'adattivo'.

figure-protocol-15
Figura 7: ANN con valori alfa diversi e dimensioni nascoste dei layer. Questa figura mostra il comportamento dell'ANN con diversi valori alfa e dimensioni nascoste dei layer. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.

ClassificatoreParametroValore
SVMGamma0.0001
Tipo di kernel'rbf'
Costo 'C'10
Stato casuale42
RFProfondità massima3
Min campioni di foglie2
Divisione minima dei campioni2
Stato casuale42
ANNAttivazione'relu'
Alpha0.001
dimensione dello strato nascosto(50,50,50)
Tasso di apprendimento'costante'
Solver'Adam'
Stato casuale42

Tabella 5: Riassunto dei parametri ottimali per i classificatori proposti. Questa tabella riassume i parametri ottimali ottenuti per i classificatori proposti.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Influenza della selezione delle caratteristiche
Nello studio attuale, per la selezione delle caratteristiche viene utilizzato il metodo ricorsivo basato sull'eliminazione delle caratteristiche basato sull'eliminazione delle caratteristiche. Il coefficiente di correlazione viene utilizzato per ordinare le caratteristiche dal più alto al più basso in base ai loro valori di correlazione. L'eliminazione ricorsiva delle caratteristiche viene utilizzata per aiutare nella se...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'attuale studio impiega diversi algoritmi di machine learning, tra cui SVM, ANN, RF e NB. Dopo aver condotto diversi esperimenti, ottimizzato iperparametri e selezione delle caratteristiche, si conclude che SVM, ANN e RF mostrano una notevole accuratezza diagnostica del 94%, mentre NB è relativamente inferiore, con l'83,33%. I risultati sono stati convalidati utilizzando una validazione incrociata di 10 volte e selezione ottimizzata delle caratteristiche, oltre al miglior rapporto di di...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il dataset è stato ottenuto dall'ospedale tramite IRB-2020-09-429. Gli autori dichiarano di non avere conflitti di interesse da segnalare riguardo allo studio attuale. Lo studio è stato aggiunto al repository di Research Square come preprint con la seguentecitazione 50.

CONTRIBUTI DEGLI AUTORI:
La concettualizzazione è stata realizzata da S.O., M.I.B.A. e A.R.; La supervisione è stata svolta da S.O., M.I.B.A. e J.A.; La stesura della bozza originale fu eseguita da S.S.A., E.A. e Z.A.; L'implementazione è stata effettuata da S.A.A., Y.A. e R.A.; La validazione è stata effettuata da J.A., M.A. e S.D.; La cura dei dati è stata effettuata da A.B., Y.A., E.A. e Z.A.; La revisione e la revisione furono eseguite da A.R., S.D. e A.B.; L'amministrazione del progetto è stata svolta da A.R., S.D. e M.A. e l'acquisizione dei fondi da A.B., S.D. e A.R.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori desiderano riconoscere il sostegno dei professionisti sanitari nella validazione dei risultati dello studio.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Excel 365MicrosoftExcel 365Usato per memorizzare dati grezzi in formato csv
Laptop/MachineDellXPS9320RAM 16GB, Intel(R) Core(TM) i7-1260P di 12a generazione
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Usato per la modellazione e l'addestramento del modello 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Usato per la modellazione e l'addestramento del modello 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Usato per la modellazione e l'addestramento del modello 
Python 3.12.12Google colab Notebook Python 3.12.12Usato per la modellazione e l'addestramento del modello 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Usato per la modellazione e l'addestramento del modello 
SPSS IBM, USAVersione 26.0Usato per l'analisi statistica
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Usato per la modellazione e l'addestramento del modello 

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Asthma DiagnosisMachine LearningEarly DetectionSaudi Arabia AsthmaRandom ForestsSupport Vector MachinesArtificial Neural NetworksMedical Data AnalysisChronic Disease Prediction

Articoli correlati