$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questa sezione descrive gli algoritmi di machine learning studiati nell'approccio diagnostico dell'asma proposto. I criteri e le ragioni alla base della scelta del metodo proposto si basano su una revisione completa della letteratura e su una lunga storia di diagnosi preventiva di diverse malattie croniche 27,28,29,30,31. Questi algoritmi hanno prodotto risultati promettenti. Tutti i materiali e gli strumenti utilizzati in questo studio sono elencati nella Tabella dei Materiali.
Macchine a vettori di supporto (SVM)
L'algoritmo SVM è tra gli algoritmi di maggior successo nel riconoscimento e classificazionedi pattern 32. Utilizza la classificazione binaria, dove classifica un insieme di vettori di addestramento in due classi. Appartiene alla famiglia degli algoritmi di apprendimento supervisionato, dove l'output desiderato viene generato sotto lasupervisione 32. Rispetto ad altri algoritmi di classificazione nel machine learning, SVM fornisce risultati migliori per le prestazioni di classificazione. Perciò, è stato ampiamente utilizzato in numerose applicazioni come il riconoscimento del parlato, del volto e della calligrafia. Inoltre, la SVM è stata applicata anche in vari ambiti, tra cui la previsione delle malattie e la previsione delle scorte. Inoltre, a causa della sua insensibilità al rumore o al sovrafitting, la SVM può gestire dati sbilanciati, un caso tipico nella diagnostica medica, dove i casi positivi sono meno numerosi rispetto ai casinegativi 32.
Nella classificazione, SVM separa due classi tracciando un bordo decisionale, in cui può prevedere le etichette distinguendo uno o più vettori dicaratteristica 32. Il bordo decisionale è chiamato iperpiano, che è il più lontano dai punti dati più vicini di ciascuna classe. Questi punti dati sono chiamati vettori di supporto. La Figura 1 mostra alcuni iperpiani candidati in dati linearmente separabili. L'equazione 1 dimostra l'equazione dell'iperpiano, mentre le equazioni 2 e 3 mostrano gli elementi situati sopra e sotto il piano32:
Equazione dell'iperpiano (1)
Qui, w è un vettore che rappresenta il peso, x è un vettore che rappresenta l'ingresso, e b. rappresenta un potenziale bias.
Per ogni j, tale che
= +1 (2)
Per ogni i, tale che
= -1 (3)

Figura 1: Un tipico SVM con due classi separabili. Questa figura visualizza una tipica SVM con due classi separabili. Abbreviazioni; SVM = macchina a vettori di supporto. Clicca qui per visualizzare una versione più grande di questa figura.
Reti neurali artificiali (ANN)
L'ANN è una tecnica di intelligenza computazionale nel soft computing che imita la funzionalità del sistema cerebrale umano. Ha un vasto numero di neuroniinterconnessi 33. È tra gli algoritmi di machine learning supervisionati che possono apprendere da dataset di esempio e migliorarne le prestazioni attraverso l'apprendimento, generando risultati utili33. L'architettura di ANN comprende più livelli: un livello di input, uno nascosto e uno di output. Ognuno di essi è formato da un insieme di neuroniconnessi 33.
Il neurone che riceve i dati dall'esterno esegue una parte di elaborazione e poi invia i dati a un altro livello noto come strato di input. Lo scopo dello strato di input non è eseguire alcun processo complesso sui dati; consiste semplicemente nel duplicare il valore di input e inviarlo al livellosuccessivo 33. Il livello di output contiene neuroni che producono dati per il programma utente. Tra questi due livelli, il livello nascosto si trova come strato opzionale per eseguire processi computazionali. Lo strato nascosto funge da strato intermedio che riceve input dai neuroni di ingresso, esegue operazioni matematiche su di essi e poi passa i risultati a un altro livello33. La Figura 2 mostra l'architettura ANN.

Figura 2: Feed-forward e retropropagazione in una tipica struttura ANN. Questa figura visualizza una rete feed-forward con retropropagazione in una tipica struttura ANN. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.
La NN feed-forward è un approccio che memorizza i dati in ingresso in direzione diretta. Nella direzione opposta, il processo di retropropagazione avviene quando i pesi della rete neurale si aggiornano in modo retroattivo per ottenere i gradienti, utilizzando una rete neurale con diversi strati nascosti. Lo svantaggio di questo processo è la nullità o l'esplosione dei gradienti. La funzione di attivazione mantiene le caratteristiche non lineari del loro ANN, il che le consente di apprendere relazioni dettagliate tra dati di input e output, come dichiarata approssimazione universale. La Figura 3 mostra l'architettura principale della rete neurale artificiale. Illustra anche la funzione di attivazione applicata all'uscita di ogni neurone, che rappresenta la somma di tutti i pesi di ingresso. Il bias contiene la somma di tutti i pesi ed è incluso nell'inputneuronale 33.

Figura 3: Un tipico singolo neurone perceptrone per un ANN. Questa figura raffigura un singolo neurone perceptrone di una tipica ANN. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.
Foresta casuale (RF)
La RF è tra gli algoritmi di classificazione più importanti nel machine learning. Consiste in diversi Decision Trees individuali che lavorano insieme come un ensemble e producono il risultatofinale 29. Il concetto di base alla base della performance di successo della RF è che essa è composta da molti alberi moderatamente non correlati (che formano una foresta), che agiscono come un comitato. Pertanto, saranno più efficienti di tutti i modelli che giranoindipendentemente con il 34. L'algoritmo RF è stato sviluppato principalmente da un gruppo diricercatori 35. Per comprendere meglio come funziona la RF, è essenziale comprendere gli alberidecisionali 35. È ugualmente applicabile sia a problemi discreti che continui, in particolare classificazione, rilevamento e regressione,rispettivamente 36. Più alberi ci sono nella foresta, più il risultato sarà accurato, ma con una complessità computazionaleaggiuntiva di 36, come mostrato nella Figura 4.

Figura 4: Schema della Foresta Casuale. Questa figura mostra uno schema di una tipica foresta casuale. Clicca qui per visualizzare una versione più grande di questa figura.
Naive Bayes (NB)
Naïve Bayes (NB) è un algoritmo di classificazione che impiega il teorema di Bayes per classificare gli oggetti. È un metodo molto popolare applicato nella maggior parte dei campi medici, specialmente per diagnosticare i sintomi. In questo metodo, gli oggetti assumono le assunzioni principali di indipendenza, il che rende la relazione tra gli attributi indipendente tra loro. A causa della sua natura ingenua, è tra gli algoritmi di classificazione più semplici nel machinelearning 37. In base al dataset fornito, NB determina la probabilità di un determinato output. Il modello NB è semplice da sviluppare, può gestire dati consistenti ed è un algoritmo sofisticato e computazionalmente leggero. Inoltre, offre funzionalità contenute, che portano a dati numerici e nominali. La robustezza e le interpretazioni semplici dell'apprendimento sono anche i potenziali vantaggi del classificatore NB. Se viene impiegato su una quantità limitata di dati, porterà a un risultato relativamente impreciso. Dipende da enormi registri, considerati meno precisi rispetto ad altre tecniche.
Analisi statistica
L'analisi statistica del dataset aiuta a visualizzare e comprendere il modello del dataset per una migliore pre-elaborazione e modellazione dei dati. A tal proposito, sono stati eseguiti i seguenti passaggi. Innanzitutto, per verificare se le caratteristiche demografiche siano squilibrate tra gruppi positivi e negativi, inclusi età e genere, viene effettuata un'analisi statistica su software SPSS. In secondo luogo, compilare i dati quantitativi utilizzando un test t a campione indipendente se la distribuzione normale e l'omogeneità della varianza fossero soddisfatte, oppure il test Man-Whitney U. Infine, i dati categorici sono stati compilati usando il test chi-quadrato o il test esatto diFisher 38.
Implementazione
Descrizione del dataset
Il dataset per l'attuale studio è stato ottenuto dall'Ospedale Universitario King Fahad di Dammam, Arabia Saudita, dopo l'approvazione da parte del comitato di revisione istituzionale (IRB). I dati detti sono stati raccolti secondo test standard tra i pazienti. L'asma viene spesso diagnosticata tramite test standard tra i pazienti, inclusi esami del sangue, test virali e test biochimici. Per il presente studio, i pazienti e i controlli sani (HC) sono stati reclutati e valutati clinicamente sulla base del triage standard e dei test patologici condotti in ospedale su raccomandazione dei medici del reparto. I criteri di inclusione ed esclusione clinica sono stati definiti dai medici sulla base dei risultati di laboratorio. Successivamente, sono stati forniti i dati qualificati e verificati per lo studio. Il dataset contiene diciassette attributi, poiché sono disponibili per tutti i pazienti asmatici. Il dataset include 328 casi complessivi, di cui 165 asma positiva e 163 asma negativa. La distribuzione di genere ed età nei gruppi positivi e negativi è elencata nella Tabella 1.
| Istanze | Positivo | Negativo |
| Maschio | 145 | 107 | 38 |
| Femmina | 183 | 57 | 126 |
| Totale | 328 | 164 | 164 |
Tabella 1: Distribuzione di genere nel dataset. Questa tabella mostra la distribuzione di genere nel dataset.
La Tabella 2 mostra la distribuzione per età tra le due classi.
| Fascia d'età | Distribuzione per età (classe = 1) | Distribuzione per età (classe = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
Tabella 2: Distribuzione per età del dataset. Questa tabella mostra la distribuzione per età nel dataset.
L'età (p < 0,001 nel test Man-Whitney U) e il genere (p < 0,001 nel test Chi-quadrato) erano sbilanciati tra i gruppi positivo e negativo. Tuttavia, non vi è alcun pregiudizio nel processo di reclutamento. Si ritiene che la distribuzione sbilanciata possa riflettere la distribuzione unica per età di questa coorte di pazienti. I criteri di inclusione includono fattori clinici per la presenza e assenza della malattia; vengono considerate le caratteristiche demografiche, tra cui genere, età e popolazione locale. Inoltre, i dati sono stati raccolti con consenso informato. Età e genere sono inclusi come potenziali caratteristiche nel set di funzionalità, come indicato di seguito. Tuttavia, analisi esplicite basate su età e genere non sono nell'ambito dello studio e sono lasciate come lavoro futuro.
Il dataset è memorizzato come valori numerici. La colonna "Classe" contiene i valori 0 e 1, dove 0 rappresenta il "paziente normale" e 1 rappresenta il "paziente asmatico".
A tal proposito, sono stati utilizzati i seguenti diciassette attributi:
Classe: (0 = "Normale", 1 = "Paziente asmatico")
1. età in anni (AGE)
2. genere (1 = maschio, 0 = femmina): GENERE
3. Basofili (BASO)
4. Eosinofili (EOS)
5. Ematocrito (HCT)
6. Emoglobina (HGB)
7. Linfociti (LYM)
8. Emoglobina corpuscolare media (MCH)
9. Concentrazione media di emoglobina corpuscolare (MCHC)
10. Volume medio corpuscolare (MCV)
11. Monociti (MONO)
12. Volume medio piastrinico (MPV)
13. Funzione dei neutrofili (NEUT)
14. Conteggio piastrinico (PLATELET_COUNT)
15. Conteggio dei globuli rossi (RBC)
16. Larghezza di distribuzione dei globuli rossi (RDW)
17. Globuli Bianchi (WBC)
Caratteristiche statistiche del dataset
Per una migliore comprensione, un'analisi statistica del dataset è illustrata nelle successive tabelle38. La Tabella 3 mostra la media, mediana, deviazione standard, massimo e minimo per il dataset in esame.
| Mediocre | Mediana | Deviazione standard | Max | Min |
| ETÀ | 39.1 | 36 | 18.136 | 93 | 2 |
| GENERE | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| MONO | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Classe | 0.5 | 0.5 | 0.5008 | 1 | 0 |
Tabella 3: Caratteristiche statistiche del dataset. Questa tabella elenca le caratteristiche statistiche dei dati.
Inoltre, la Tabella 4 mostra il coefficiente di correlazione ottenuto tra ciascun attributo e l'attributo classe. I suoi valori si collocano tra 0 (meno correlato) e 1 (più correlato). Viene aggiunta come analisi statistica preliminare per spiegare gli attributi del dataset. MPV, genere, HGB, MCHC ed età sono tra le caratteristiche più significative.
| Coppie degli attributi | Coefficiente di correlazione |
| ETÀ | 0.212473 |
| GENERE | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| MONO | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Classe | 1 |
Tabella 4: Correlazione con l'attributo della classe. Questa tabella mostra la correlazione tra gli attributi (caratteristiche) e l'attributo classe.
Configurazione sperimentale
Nel studio attuale, il linguaggio di programmazione Python viene utilizzato per preelaborare il dataset raccolto. A causa di errori umani, valori specifici sono mancanti durante l'inserimento e la selezione dei dati. Sono state utilizzate tecniche di imputazione per gestire i valori mancanti nel dataset. Ciò si fa sostituendo i valori mancanti con la media dell'attributo. Grazie alla sua semplicità, compatibilità del modello e conservazione dei valori medi del campione, come discusso con i professionisti sanitari. Inoltre, la selezione delle caratteristiche viene effettuata utilizzando coefficienti di correlazione per classificare gli attributi. Le caratteristiche con valori di correlazione più alti sono state selezionate per l'analisi insieme all'insieme completo delle caratteristiche. Le librerie Python sono state utilizzate per l'implementazione dell'approccio proposto, la sintonia degli iperparametri e l'ottenimento di risultati. La selezione e l'eliminazione delle caratteristiche sono state eseguite tramite un metodo di selezione degli attributi per identificare i gruppi di caratteristiche con la massima accuratezza. Inoltre, Python è stato utilizzato per valutare l'accuratezza utilizzando metodi di validazione incrociata a 10 volte e valutazione del Direct Partition Ratio, come specificato dalle equazionifornite 39,40. Infine, è stata calcolata la media di tutti i risultati dei metodi di valutazione per confrontare i metodi di valutazione utilizzati e determinare il metodo con la migliore accuratezzamedia 38. Inoltre, le matrici di confusione sono state generate utilizzando i parametri ottimali di SVM, ANN, RF e NB. Successivamente, è stato effettuato un confronto tra falsi positivi (FP), falsi negativi (FN), veri positivi (TP) e veri negativi (TN) attraverso il calcolo del punteggio F1, che è una misura efficiente per confrontare il miglior metodo41,42.
Metriche di valutazione
Per valutare le prestazioni dell'approccio proposto, vengono considerate quattro metriche di performance ben note. Ovvero, precisione, richiamo e punteggio F1. L'accuratezza della classificazione è la misura principale perché la percentuale di istanze correttamente classificate viene calcolata per ogni istanza. La precisione è il numero totale di punti TP attesi. Il richiamo è il numero di TP più di ogni effettivo positivo. Prestazioni con punteggio F1 di ogni classe. Secondo la capacità degli output, si ottengono le seguentimetriche 43,44,45:
Vero positivo (TP): Risultato di una diagnosi corretta come asma.
Falso positivo (FP): Risultato di una diagnosi errata di asma.
Vero negativo (TN): Risultato dei casi corretti diagnosticati come non asmatici.
Falso negativo (FN): Risultato di una diagnosi errata come non asmatica.
(4)
(5)
(6)
Strategia di ottimizzazione
Per determinare i parametri ottimali per ciascuno degli approcci proposti, è stata utilizzata la tecnica della Grid Search. I parametri specifici possibili sono inseriti nel metodo Grid Search. Pertanto, può sviluppare le migliori prestazioni possibili per migliorare la precisione.
Le Figure 5–7 mostrano l'esito della tecnica Grid Search per tutti e quattro gli approcci proposti e la procedura di implementazione sul dataset con l'assistenza dei primi diciotto attributi. La Figura 5 presenta le accuratezze SVM ottenute con vari valori di parametri. I valori di input per il Costo e il Gamma corrispondenti a molteplici tipi di kernel sono i seguenti:
Tipi di kernel: Lineare, Radiale, Sigmoide e Polinomiale.
Gamma: 0,001 e 0,0001.
Costo: 1, 10, 100 e 1000.

Figura 5: SVM con diversi costi e tipi gamma. Questa figura dimostra il comportamento delle SVM con diversi tipi di costo e gamma. Abbreviazioni; SVM = macchina a vettori di supporto. Clicca qui per visualizzare una versione più grande di questa figura.
Per la RF, i valori di input sistematicamente indicati nella Figura 6 sono i seguenti:
I nomi dei parametri, insieme ai rispettivi valori, sono forniti di seguito:
Numero di caratteristiche: 'auto', 'sqrt'.
Profondità massima: 1, 3, 5, 7.
Campioni MIN suddivisi: 2, 3, 4, 5.
Campioni MIN fogliano: 2, 3, 4, 5.

Figura 6: RF con valori di profondità diversi e foglie minime del campione. Questa figura mostra il comportamento della RF con diverse profondità e valori minimi delle foglie del campione. Abbreviazioni; RF = foresta casuale. Clicca qui per visualizzare una versione più grande di questa figura.
Per l'ANN, i valori analitici di input sono indicati nella Figura 7.
I nomi dei parametri, insieme ai rispettivi valori, sono i seguenti:
Dimensioni dei layer nascosti: (50, 50, 50), (50, 100, 50) e (100,).
Attivazione: 'tanh' e 'relu'.
Risolutore: 'sgd' e 'adam'.
Alpha: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 e 0,05.
Tasso di apprendimento: 'costante' e 'adattivo'.

Figura 7: ANN con valori alfa diversi e dimensioni nascoste dei layer. Questa figura mostra il comportamento dell'ANN con diversi valori alfa e dimensioni nascoste dei layer. Abbreviazioni; ANN = rete neurale artificiale. Clicca qui per visualizzare una versione più grande di questa figura.
| Classificatore | Parametro | Valore |
| SVM | Gamma | 0.0001 |
| Tipo di kernel | 'rbf' |
| Costo 'C' | 10 |
| Stato casuale | 42 |
| RF | Profondità massima | 3 |
| Min campioni di foglie | 2 |
| Divisione minima dei campioni | 2 |
| Stato casuale | 42 |
| ANN | Attivazione | 'relu' |
| Alpha | 0.001 |
| dimensione dello strato nascosto | (50,50,50) |
| Tasso di apprendimento | 'costante' |
| Solver | 'Adam' |
| Stato casuale | 42 |
Tabella 5: Riassunto dei parametri ottimali per i classificatori proposti. Questa tabella riassume i parametri ottimali ottenuti per i classificatori proposti.