$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Esta seção descreve os algoritmos de aprendizado de máquina investigados na abordagem proposta de diagnóstico de asma. Os critérios e razões por trás da escolha do método proposto baseiam-se em uma revisão abrangente da literatura e em um longo histórico de diagnóstico preventivo de várias doenças crônicas 27,28,29,30,31. Esses algoritmos produziram resultados promissores. Todos os materiais e ferramentas utilizados neste estudo estão listados na Tabela de Materiais.
Máquinas vetoriais de suporte (SVM)
O algoritmo SVM está entre os mais bem-sucedidos em reconhecimento e classificaçãode padrões 32. Ele utiliza classificação binária, onde classifica um conjunto de vetores de treinamento em duas classes. Ele pertence à família dos algoritmos de aprendizado supervisionado, onde a saída desejada é gerada sob supervisão32. Em comparação com outros algoritmos de classificação em aprendizado de máquina, a SVM oferece melhores resultados para o desempenho da classificação. Por isso, tem sido amplamente utilizado em diversas aplicações, como reconhecimento de fala, rosto e caligrafia. Além disso, a SVM também tem sido aplicada em várias áreas, incluindo a previsão de doenças e a previsão de estoques. Além disso, devido à sua insensibilidade ao ruído ou sobreajuste, a SVM pode lidar com dados desbalanceados, o que é um caso típico em diagnósticos médicos, onde os casos positivos são menores do que osnegativos 32.
Na classificação, a SVM separa duas classes desenhando uma borda de decisão, na qual pode prever os rótulos distinguindo um ou mais vetores de características32. A fronteira de decisão é chamada de hiperplano, que é o mais distante dos pontos de dados mais próximos de cada classe. Esses pontos de dados são chamados de vetores de suporte. A Figura 1 mostra alguns hiperplanos candidatos em dados linearmente separáveis. A equação 1 demonstra a equação do hiperplano, enquanto as equações 2 e 3 mostram os elementos localizados acima e abaixo do plano32:
Equação do hiperplano (1)
Aqui, w é um vetor que representa o peso, x é um vetor que representa a entrada, e b. representa um viés potencial.
Para todo j, tal que
= +1 (2)
Para todo i, tal que
= -1 (3)

Figura 1: Um SVM típico com duas classes separáveis. Essa figura visualiza um SVM típico com duas classes separáveis. Abreviações; SVM = máquina de vetores de suporte. Por favor, clique aqui para ver uma versão ampliada desta figura.
Rede neural artificial (RNA)
RNA é uma técnica de inteligência computacional em computação suave que imita a funcionalidade do sistema cerebral humano. Possui um vasto número de neurôniosinterconectados 33. Está entre os algoritmos supervisionados de aprendizado de máquina que podem aprender a partir de conjuntos de dados de exemplo e melhorar seu desempenho por meio do aprendizado, gerando resultados úteis33. A arquitetura da ANN compreende múltiplas camadas: uma camada de entrada, uma camada oculta e uma camada de saída. Cada um deles é formado por um conjunto de neurôniosconectados 33.
O neurônio que recebe os dados de fora realiza algum processamento e então envia os dados para outra camada conhecida como camada de entrada. O propósito da camada de entrada não é realizar nenhum processo complexo sobre os dados; é simplesmente duplicar o valor de entrada e enviá-lo para a próxima camada33. A camada de saída contém neurônios que produzem dados para o programa do usuário. Entre essas duas camadas, a camada oculta está localizada como uma camada opcional para realizar processos computacionais. A camada oculta serve como uma camada intermediária que recebe entradas dos neurônios de entrada, realiza operações matemáticas neles e então passa os resultados para outra camada33. A Figura 2 mostra a arquitetura ANN.

Figura 2: Feed-forward e retropropagação em uma estrutura típica de RNA. Esta figura visualiza uma rede feed-forward com retropropagação em uma estrutura típica de RNA. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.
A NN feed-forward é uma abordagem que armazena dados de entrada em direção direta. Na direção oposta, ocorre o processo de retropropagação à medida que os pesos da rede neural se atualizam em uma abordagem retroativa para obter os gradientes, usando uma rede neural com várias camadas ocultas. A desvantagem desse processo é a anulação ou explosão dos gradientes. A função de ativação mantém as características não lineares do seu ANN, o que permite aprender relações detalhadas entre dados de entrada e saída, conforme declarado uma aproximação universal. A Figura 3 demonstra a arquitetura principal da rede neural artificial. Também ilustra a função de ativação aplicada à saída de cada neurônio, que representa a soma de todos os pesos de entrada. O viés mantém a soma de todos os pesos e está incluído na entrada doneurônio 33.

Figura 3: Um neurônio perceptrônico único típico para uma RNA. Esta figura representa um único neurônio perceptron de uma ANNA típica. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.
Floresta aleatória (RF)
RF está entre os algoritmos de classificação mais proeminentes em aprendizado de máquina. Consiste em várias Árvores de Decisão individuais trabalhando juntas como um conjunto e produzindo o resultadofinal 29. O conceito básico por trás do desempenho bem-sucedido do RF é que ele é composto por muitas árvores moderadamente não correlacionadas (formando uma floresta), que atuam como um comitê. Assim, eles serão mais eficientes do que todos os modelos que rodamindependentemente do 34. O algoritmo RF foi desenvolvido principalmente por um grupo depesquisadores 35. Para entender melhor como a RF funciona, é essencial compreender as árvores de decisão35. É igualmente aplicável tanto a problemas discretos quanto contínuos, especificamente classificação, detecção e regressão,respectivamente 36. Quanto mais árvores na floresta, mais próximo será da precisão do resultado, mas com uma complexidade computacionaladicional de 36, como mostrado na Figura 4.

Figura 4: Esquema da Floresta Aleatória. Esta figura demonstra um esquema de uma floresta aleatória típica. Por favor, clique aqui para ver uma versão ampliada desta figura.
Naive Bayes (NB)
Naïve Bayes (NB) é um algoritmo de classificação que emprega o teorema de Bayes para classificar objetos. É um método muito popular aplicado na maioria das áreas médicas, especialmente para diagnosticar sintomas. Nesse método, os objetos assumem as principais suposições de independência, o que torna a relação entre os atributos independente entre si. Devido à sua natureza ingênua, está entre os algoritmos de classificação mais simples em aprendizadode máquina 37. Com base no conjunto de dados fornecido, NB determina a probabilidade de um determinado resultado. O modelo NB é simples de desenvolver, pode gerenciar dados substanciais e é um algoritmo sofisticado e computacionalmente leve. Além disso, oferece funções modestas, resultando em conhecimento numérico e nominal. Robustez e interpretações simples de aprendizagem também são vantagens potenciais do classificador NB. Se for empregado em uma quantidade limitada de dados, resultará em um resultado relativamente impreciso. Depende de registros enormes, que são considerados menos precisos em comparação com outrastécnicas 37.
Análise estatística
A análise estatística do conjunto de dados ajuda a visualizar e entender o padrão do conjunto para melhor pré-processamento e modelagem dos dados. Nesse sentido, foram realizados os seguintes passos. Primeiramente, para investigar se as características demográficas estão desequilibradas entre grupos positivos e negativos, incluindo idade e gênero, é realizada uma análise estatística no software SPSS. Em segundo lugar, compilar os dados quantitativos usando um teste t de amostra independente se a distribuição normal e a homogeneidade da variância forem satisfeitas, ou o teste Man-Whitney U. Por fim, os dados categóricos foram compilados usando o teste qui-quadrado ou o teste exatode Fisher 38.
Implementação
Descrição do conjunto de dados
O conjunto de dados para o estudo atual foi obtido no Hospital Universitário King Fahad em Dammam, Arábia Saudita, após aprovação pelo conselho de revisão institucional (IRB). Esses dados foram coletados de acordo com testes padrão entre os pacientes. A asma é frequentemente diagnosticada por meio de exames padrão entre pacientes, incluindo exames de sangue, testes de vírus e testes bioquímicos. Para o estudo atual, os pacientes e controles saudáveis (HC) foram recrutados e clinicamente avaliados com base na triagem padrão e nos testes patológicos realizados no hospital sob recomendação dos médicos do departamento. Os critérios clínicos de inclusão e exclusão foram definidos pelos médicos com base nos resultados laboratoriais. Posteriormente, os dados qualificados e verificados foram fornecidos para o estudo. O conjunto de dados contém dezessete atributos, pois estão disponíveis para todos os pacientes com asma. O conjunto de dados inclui 328 casos totais, sendo 165 positivos para asma e 163 para asma negativa. A distribuição de gênero e idade nos grupos positivo e negativo está listada na Tabela 1.
| Instâncias | Positivo | Negativo |
| Masculino | 145 | 107 | 38 |
| Feminino | 183 | 57 | 126 |
| Total | 328 | 164 | 164 |
Tabela 1: Distribuição de gênero do conjunto de dados. Esta tabela mostra a distribuição de gênero no conjunto de dados.
A Tabela 2 mostra a distribuição etária entre as duas classes.
| Faixa etária | Distribuição etária (classe = 1) | Distribuição etária (classe = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
Tabela 2: Distribuição etária do conjunto de dados. Esta tabela mostra a distribuição etária no conjunto de dados.
A idade (p < 0,001 no teste Man-Whitney U) e o gênero (p < 0,001 no teste de Qui-quadrado) estavam desequilibrados entre os grupos positivo e negativo. No entanto, não há viés no processo de recrutamento. Acredita-se que a distribuição desequilibrada possa refletir a distribuição etária única dessa coorte de pacientes. Os critérios de inclusão incluem fatores clínicos para a presença e ausência da doença; Demografia, incluindo gênero, idade e população local, são considerados. Além disso, os dados foram coletados com consentimento informado. Idade e gênero estão incluídos como possíveis características no conjunto de recursos, conforme mencionado abaixo. No entanto, análises explícitas baseadas em idade e gênero não estão no escopo do estudo e permanecem como trabalho futuro.
O conjunto de dados é armazenado como valores numéricos. A coluna "Classe" contém os valores 0 e 1, onde 0 representa o "paciente normal" e 1 representa o "paciente asma".
Nesse sentido, os seguintes dezessete atributos foram utilizados:
Classe: (0 = "Normal", 1 = "Paciente com Asma")
1. idade em anos (IDADE)
2. gênero (1 = masculino, 0 = feminino): GÊNERO
3. Basófilos (BASO)
4. Eosinófilos (EOS)
5. Hematócrito (HCT)
6. Hemoglobina (HGB)
7. Linfócitos (LYM)
8. Hemoglobina corpuscular média (MCH)
9. Concentração média de hemoglobina corpuscular (MCHC)
10. Volume corpuscular médio (MCV)
11. Monócitos (MONO)
12. Volume médio de plaquetas (MPV)
13. Função dos Neutrófilos (NEUT)
14. Contagem de plaquetas (PLATELET_COUNT)
15. Contagem de glóbulos vermelhos (RBC)
16. Largura de distribuição de células vermelhas (RDW)
17. Glóbulos Brancos (WBC)
Características estatísticas do conjunto de dados
Para melhor compreensão, uma análise estatística do conjunto de dados é apresentada nas tabelasseguintes 38. A Tabela 3 mostra a média, mediana, desvio padrão, máximo e mínimo para o conjunto de dados em consideração.
| Mean | Mediana | Desvio padrão | Max | Min |
| IDADE | 39.1 | 36 | 18.136 | 93 | 2 |
| GÊNERO | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| MONO | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Classe | 0.5 | 0.5 | 0.5008 | 1 | 0 |
Tabela 3: Características estatísticas do conjunto de dados. Esta tabela lista as características estatísticas dos dados.
Além disso, a Tabela 4 mostra o coeficiente de correlação obtido entre cada atributo e o atributo da classe. Seus valores ficam entre 0 (menos correlacionado) e 1 (mais correlacionado). Ele é adicionado como uma análise estatística preliminar para explicar os atributos do conjunto de dados. MPV, gênero, HGB, MCHC e idade estão entre os aspectos mais significativos.
| Pares de atributos | Coeficiente de correlação |
| IDADE | 0.212473 |
| GÊNERO | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| MONO | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Classe | 1 |
Tabela 4: Correlação com o atributo classe. Esta tabela mostra a correlação entre os atributos (características) e o atributo classe.
Configuração experimental
No estudo atual, a linguagem de programação Python é usada para pré-processar o conjunto de dados coletado. Devido a erro humano, valores específicos estão ausentes durante a entrada e seleção de dados. Técnicas de imputação têm sido usadas para lidar com valores ausentes no conjunto de dados. Isso é feito substituindo valores ausentes pela média do atributo. Por causa de sua simplicidade, compatibilidade do modelo e preservação dos valores médios amostrais, conforme discutido com profissionais de saúde. Além disso, a seleção de características é realizada usando coeficientes de correlação para ranquear os atributos. As características com valores de correlação mais altos foram selecionadas para análise junto com o conjunto completo de características. Bibliotecas em Python têm sido utilizadas para a implementação da abordagem proposta, ajuste de hiperparâmetros e obtenção de resultados. A seleção e eliminação de características foram realizadas por um método de seleção de atributos para identificar os grupos de características com maior precisão. Além disso, o Python foi usado para avaliar a precisão usando métodos de validação cruzada 10 vezes e avaliação por Razão de Partição Direta, conforme especificado pelas equações39,40 fornecidas. Por fim, a média dos resultados de todos os métodos de avaliação foi calculada para comparar os métodos utilizados e determinar qual com a melhor média de precisão38. Além disso, matrizes de confusão foram geradas usando os parâmetros ótimos de SVM, ANN, RF e NB. Em seguida, foi realizada uma comparação de falsos positivos (FP), falsos negativos (FN), verdadeiros positivos (TP) e verdadeiros negativos (TN) por meio do cálculo do escore F1, que é uma medida eficiente para comparar o melhor método 41,42.
Métricas de avaliação
Para avaliar o desempenho da abordagem proposta, são consideradas quatro métricas de desempenho bem conhecidas. Ou seja, precisão, precisão, recall e pontuação F1. A precisão da classificação é a principal medida porque a porcentagem de instâncias corretamente classificadas é calculada para cada instância. Precisão é o número total de pontos de TP esperados. A recall é o número de TP a mais do que cada positivo real. Desempenho na pontuação F1 de cada classe. De acordo com a capacidade dos resultados, as seguintes métricas sãoobtidas 43, 44, 45:
Verdadeiro positivo (TP): Resultado do diagnóstico correto de asma.
Falso positivo (FP): Resultado de diagnóstico incorreto de asma.
Verdadeiro negativo (ET): Resultado dos casos corretos diagnosticados como não asmáticas.
Falso negativo (FN): Resultado de diagnóstico incorreto como não asma.
(4)
(5)
(6)
Estratégia de otimização
Para determinar os parâmetros ideais para cada uma das abordagens propostas, foi empregada a técnica de Busca em Grade. Valores possíveis de parâmetros específicos são colocados no método de Busca em Grade. Portanto, pode desenvolver o melhor desempenho possível para melhoria de precisão.
As Figuras 5–7 mostram o resultado da técnica de Busca em Grade para todas as quatro abordagens propostas e o procedimento de implementação no conjunto de dados com a ajuda dos dezoito principais atributos. A Figura 5 apresenta as precisões do SVM obtidas com vários valores de parâmetro. Os valores de entrada para o Custo e o Gama, correspondentes a múltiplos tipos de núcleos, são os seguintes:
Tipos de núcleo: Linear, Radial, Sigmoide e Polinômio.
Gama: 0,001 e 0,0001.
Custo: 1, 10, 100 e 1000.

Figura 5: SVM com diferentes tipos de custo e gama. Esta figura demonstra o comportamento das SVM com diferentes tipos de custo e gama. Abreviações; SVM = máquina de vetores de suporte. Por favor, clique aqui para ver uma versão ampliada desta figura.
Para a RF, os valores de entrada sistematicamente indicados na Figura 6 são os seguintes:
Os nomes dos parâmetros, juntamente com seus respectivos valores, são fornecidos abaixo:
Número de recursos: 'auto', 'sqrt'.
Profundidade máxima: 1, 3, 5, 7.
Amostras MIN divididas: 2, 3, 4, 5.
Amostras MIN folhetem: 2, 3, 4, 5.

Figura 6: RF com diferentes valores de profundidade e folhas mínimas de amostra. Esta figura mostra o comportamento da RF com diferentes profundidades e valores mínimos das folhas da amostra. Abreviações; RF = floresta aleatória. Por favor, clique aqui para ver uma versão ampliada desta figura.
Para o RNA, os valores analíticos de entrada são indicados na Figura 7.
Os nomes dos parâmetros, juntamente com seus respectivos valores, são os seguintes:
Tamanhos de camadas ocultas: (50, 50, 50), (50, 100, 50) e (100,).
Ativação: 'tanh' e 'relu'.
Solucionador: 'sgd' e 'adam'.
Alfa: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 e 0,05.
Taxa de aprendizado: 'constante' e 'adaptativa'.

Figura 7: ANN com diferentes valores alfa e tamanhos ocultos de camadas. Esta figura mostra o comportamento do ANN com diferentes valores alfa e tamanhos de camada ocultos. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.
| Classificador | Parâmetro | Valor |
| SVM | Gama | 0.0001 |
| Tipo de núcleo | 'RBF' |
| Custo 'C' | 10 |
| Estado aleatório | 42 |
| RF | Profundidade máxima | 3 |
| Amostras mínimas de folha | 2 |
| Amostras mínimas divididas | 2 |
| Estado aleatório | 42 |
| ANN | Ativação | 'Relu' |
| Alpha | 0.001 |
| Tamanho da camada oculta | (50,50,50) |
| Taxa de aprendizado | 'constante' |
| Solucionador | 'Adam' |
| Estado aleatório | 42 |
Tabela 5: Resumo dos parâmetros ótimos para os classificadores propostos. Esta tabela resume os parâmetros ótimos obtidos para os classificadores propostos.