Artigo de investigação

Um Diagnóstico Precoce de Doença da Asma Baseado em Inteligência Computacional: Um Estudo de Caso da Arábia Saudita

DOI:

10.3791/70040

16 de junho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O estudo atual investiga vários algoritmos de aprendizado de máquina em um conjunto de dados saudita para detecção de asma. Em contraste com abordagens de ponta que empregam aprendizado de máquina em conjuntos de dados clínicos para diagnóstico de asma, o esquema proposto alcança melhor desempenho, com uma melhora de 3,9% na precisão do diagnóstico.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segundo pesquisas, foi identificado um aumento nas doenças crônicas, incluindo asma. O número de pacientes com asma na Arábia Saudita é motivo de preocupação devido às condições climáticas e ao estilo de vida, especialmente na era pós-pandemia. Exige uma solução para reduzir infecções desenvolvendo um sistema inteligente para detectar a asma em estágio inicial, prevenindo assim a doença ou possibilitando o tratamento precoce. Neste estudo, o aprendizado de máquina foi utilizado para desenvolver ferramentas que monitorem sintomas de asma em estágio inicial. Embora já tenham existido várias tentativas anteriores de aplicar aprendizado de máquina para prever a ocorrência da asma. No entanto, focar na identificação da doença no estágio pré-sintoma, especialmente no contexto saudita, é uma área relativamente negligenciada. O conjunto de dados do estudo atual foi obtido do Hospital Universitário King Fahad, em Dammam, Arábia Saudita, e incluiu testes padrão realizados em pacientes, incluindo exames de sangue, testes virais e testes bioquímicos. O conjunto de dados contém 17 atributos significativos e inclui informações para 328 pacientes com asma: 165 são positivos e 163 negativos. Os métodos selecionados para aplicação aqui são florestas aleatórias (RF), redes neurais artificiais (ANN), máquinas vetoriais de suporte (SVM) e Bayes ingênuo (NB). Cada um desses métodos foi escolhido com base em suas características distintas. O resultado experimental revelou que as abordagens RF, SVM e ANN apresentaram 94%, que é a maior precisão, e melhoraram o estado da arte em 3,9%. Vale notar que nove das dezessete possíveis características foram usadas para alcançar a precisão acima. Apesar de RF, SVM e ANN alcançarem a mesma precisão, o ANN tem um custo de erro maior. Portanto, RF e SVM são superiores com base no padrão dos resultados, e por isso são sugeridos para esse problema.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Após realizar pesquisas extensas, os pesquisadores observaram que doenças crônicas se tornaram cada vez maiscomuns 1. A asma é uma doença inflamatória crônica das vias aéreas caracterizada por episódios recorrentes de falta de ar e chiado. A prevalência da asma varia globalmente, variando de 1 a 20% tanto em crianças quanto em adultos, afetando milhões de pessoas nomundo 2. Essas mudanças em grande escala estão relacionadas a variações ambientais, incluindo as de vários países, bem como ao uso de diferentes instrumentos de avaliação e diversas definições epidemiológicas de asma. A asma tem uma taxa de letalidade relativamente baixa em contraste com várias outras doenças crônicas bemconhecidas 2. No entanto, relatos indicam que o padrão de asma no Reino da Arábia Saudita está aumentandoem 3,4.

A asma é uma condição inflamatória crônica que resulta em estreitamento do lúmen. O estreitamento da rota da aviação é causado pela expansão da emissão de fluidos corporais, bem como pelo espessamento dos divisores brônquicos devido a edema, fibrose subepitelial e hipertrofia muscular lisa. Aparelhos fisiopatológicos movidos por vários tipos celulares, incluindo células imunes, têm sido utilizados para avaliar essascondições 5. Devido às condições climáticas severas e ao estilo de vida principalmente dentro de casa na Arábia Saudita, a asma está entre as doenças crônicas mais comuns. Diversas pesquisas demonstraram a taxa esmagadora deasma 6. A doença tornou-se um problema significativo, exigindo um sistema de resposta precoce para ajudar a mitigar o número de incidentes e tornar viável a mediação precoce para prevenir ou curar a doença em um estágio mais precoce.

Em contraste com os indivíduos, a asma tem um impacto profundo nas comunidades e nas famílias. Se não for controlada, impõe limitações severas à vida do paciente e impede que ele realize muitas atividades diárias. Na Arábia Saudita, condições climáticas adversas, incluindo atmosfera quente, tempestades de areia generalizadas e uso excessivo de sistemas de ar-condicionado/resfriamento internos, são fatores significativos para a asma. A sociedade torácica saudita (STS) tem feito esforços notáveis para fornecer os melhores medicamentos para infecçõesrespiratórias 7. No entanto, é necessário um diagnóstico proativo de asma para reduzir a taxa de infecção, especialmente em um cenário pós-pandemia (COVID-19). Foi ainda deduzido que histórico familiar, tabagismo e rinite alérgica estão entre os fatores de risco mais significativos para o desenvolvimento de asma entre adultos sauditas. Pesquisas adicionais foram recomendadas para investigar outros fatores que estabeleceram a base do estudo.

Nesta pesquisa, considerando estudos anteriores sobre diagnóstico de asma, o objetivo é aumentar a precisão diagnóstica. As técnicas propostas, incluindo floresta aleatória (RF), rede neural artificial (ANN), máquina de vetores de suporte (SVM) e Naïve Bayes (NB), foram utilizadas em estudos anteriores, resultando em melhorias perceptíveis nos resultados do diagnóstico. Por exemplo, pesquisadores usaram ANN, SVM e NB nos estudos8, 9 e 10. No estudo atual, abordagens de aprendizado de máquina foram investigadas para servir como um sistema de alerta precoce que detecta até mesmo pequenos indicadores de doença asmática nos estágios mais iniciais (estágio pré-sintomático). A prevalência da doença da asma na Arábia Saudita, especialmente no período pós-pandemia, com fatores como um estilo de vida voltado para ambientes internos devido a condições climáticas severas, dutos de ar-condicionado e tempestades de areia, estão entre os principais fatores. No entanto, não há nenhum estudo relevante que investigue os fatores cruciais que foram testemunhados recentemente. Para suprir essa lacuna de pesquisa, o estudo atual visa investigar o papel do aprendizado de máquina na detecção precoce da asma entre adultos sauditas. Além disso, o objetivo principal é alcançar a maior precisão possível com o menor número possível de características. Embora já tenham havido esforços reconhecíveis no passado para utilizar aprendizado de máquina para prever a presença de doençaasmática 8,9,10. O estudo atual visa utilizar um conjunto de dados da Arábia Saudita, obtido pela primeira vez em um hospital do setor público na província oriental, focando no diagnóstico da doença em estágio inicial (diagnóstico preventivo). Aprendizado de Máquina (ML) é reconhecido como um método para extrair conhecimento de dadoscoletados 11,12. Ele fornece precisão de previsão obtida a partir do processo de aprendizado de instâncias anteriores utilizando várias técnicas de aprendizado de máquina. O ML abrange múltiplos métodos, algoritmos e estratégias para enfrentar problemas analíticos e preditivos em amplos campos médicos, como a detecção precoce da existência de doenças13,14.

Diversos estudos foram realizados para prever doenças asmáticas usando diversas técnicas. Pesquisadores desenvolveram uma rede neural artificial (RNA) para classificação de asma, dependendo dos testes dinâmicos e estáticos dos pacientes8. Os parâmetros medidos de espirometria, oscilometria de impulso (IOS), auscultação, resultados de alergia e informações sobre sintomas são utilizados na RNA. As informações definidas permitem que a RNA sugira a classificação adequada de asma. Da mesma forma, pesquisadores realizaram um estudo para enfrentar os desafios no diagnóstico de doençastorácicas 7. Máquinas de vetor de suporte (SVM) e os métodos adaptativos SVM (ASVM) foram usados para diagnosticar doenças torácicas, como asma. A melhor precisão de classificação para todas as doenças torácicas foi obtida utilizando o método ASVM. Os pesquisadores utilizaram várias estruturas de redes neurais, como NN multicamadas (MLNN) com algoritmo de retropropagação (BPA) com uma ou duas camadas ocultas, NN probabilística (PNN), quantização vetorial de aprendizado (LVQ) e NN de regressão geral (GRNN), para diagnóstico de doença torácica, incluindo doençaasmática 15. Além disso, alguns realizaram um estudo comparativo com o objetivo de diagnosticar doenças torácicas usando um sistema imunológico artificial (AIS). Os estudos mencionados implementaram diversas estruturas para diagnosticar problemas de doença torácica usando seus diferentes conjuntos de dados. Para asma, o maior resultado foi alcançado usando AIS, com uma precisão geral de 90,91%16. Além disso, pesquisadores investigaram a eficácia de uma NN profunda (DNN) para melhorar a precisão no diagnóstico de asma e compararam o desempenho da predição de diferentes algoritmos de aprendizado de máquina, especialmente com regressão logística e SVM. O estudo mostrou que o teste empírico utilizando o modelo dos sinais de asma foi mais eficaz para o diagnóstico preciso deasma 9. Outro estudo demonstrou a capacidade significativa do aprendizado de máquina utilizando dados de telemonitoramento para prever exacerbações de asma antes que ocorram, por meio de abordagens de aprendizado de máquina escolhidas, como SVM e Naïve Bayes, para implementar seuexperimento 10.

Além disso, pesquisadores empregaram várias técnicas de aprendizado de máquina para diagnosticar preventivamente a doença de Alzheimer (DA), incluindo SVM, k-NN, boosting adaptativo (AdaBoost) e eXtreme gradient boosting (XGBoost)17. Pesquisadores também realizaram um estudo para diagnosticar preliminarmente o diabetes, investigando quatro abordagens de aprendizado de máquina, a saber, NB, SVM, K-NN e RNA. As três principais características do conjunto de dados saudita apresentaram a maior precisão média, de 68%. O desempenho das técnicas de medição foi comparado com base em precisão, exatião, recordação e pontuação F1. A ANN obteve a maior precisão de classificação de 77,5%18. Da mesma forma, o mesmo grupo de pesquisadores experimentou a realização de quatro técnicas de classificação — a saber, NB, SVM, K-NN e ANN — para diagnosticar preventivamente a doença renal crônica, aplicada ao conjunto de dadossaudita 19. Além disso, os autores conduziram um estudo para diagnosticar primitivamente câncer de tireoide usando quatro técnicas de aprendizado de máquina: ANN, SVM, RF e NB. Utilizando 14 recursos do conjunto de dados saudita, os autores obtiveram a maior precisão média de 95%. O desempenho das técnicas de medição foi comparado usando precisão, exatidão, recordação e pontuação F1. O RF obteve a maior precisão de classificação de 90,91%20. Os pesquisadores também realizaram dois estudos que apresentaram resultados notáveis no diagnóstico proativo da artrite reumatoide. Várias técnicas de aprendizado de máquina, como SVM, regressão logística (LR) e AdaBoost, foram selecionadas e usadas como técnicas candidatas para um conjunto de votação. Inicialmente, um conjunto de dados era usado e o outro era balanceado aplicando SMOTE. A nova técnica de conjunto de votação foi testada por dois métodos sequenciais de seleção de características. Ou seja, a seleção para frente e para trás é usada para encontrar o melhor subconjunto do espaço de características que apresenta os indicadores mais altos para cada técnica. Usando 30 características dos dados originais e a técnica sequencial de seleção direta de características, as porcentagens obtidas foram promissoras, com valores de precisão, recordação e precisão de 94,03%, 96% e 93,51%, respectivamente21. De forma semelhante, outros métodos inteligentes na medicina e áreas relacionadas podem ser encontrados em muitos estudos 22,23,24,25,26.

As técnicas propostas neste trabalho são RF, SVM, ANN e NB devido aos seus resultados excepcionais para problemas semelhantes. No estudo atual, os resultados obtidos por meio dos experimentos. Após várias etapas de otimização e seleção de características, é demonstrado que as técnicas propostas são promissoras para o diagnóstico de asma com o conjunto de dados alvo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta seção descreve os algoritmos de aprendizado de máquina investigados na abordagem proposta de diagnóstico de asma. Os critérios e razões por trás da escolha do método proposto baseiam-se em uma revisão abrangente da literatura e em um longo histórico de diagnóstico preventivo de várias doenças crônicas 27,28,29,30,31. Esses algoritmos produziram resultados promissores. Todos os materiais e ferramentas utilizados neste estudo estão listados na Tabela de Materiais.

Máquinas vetoriais de suporte (SVM)
O algoritmo SVM está entre os mais bem-sucedidos em reconhecimento e classificaçãode padrões 32. Ele utiliza classificação binária, onde classifica um conjunto de vetores de treinamento em duas classes. Ele pertence à família dos algoritmos de aprendizado supervisionado, onde a saída desejada é gerada sob supervisão32. Em comparação com outros algoritmos de classificação em aprendizado de máquina, a SVM oferece melhores resultados para o desempenho da classificação. Por isso, tem sido amplamente utilizado em diversas aplicações, como reconhecimento de fala, rosto e caligrafia. Além disso, a SVM também tem sido aplicada em várias áreas, incluindo a previsão de doenças e a previsão de estoques. Além disso, devido à sua insensibilidade ao ruído ou sobreajuste, a SVM pode lidar com dados desbalanceados, o que é um caso típico em diagnósticos médicos, onde os casos positivos são menores do que osnegativos 32.

Na classificação, a SVM separa duas classes desenhando uma borda de decisão, na qual pode prever os rótulos distinguindo um ou mais vetores de características32. A fronteira de decisão é chamada de hiperplano, que é o mais distante dos pontos de dados mais próximos de cada classe. Esses pontos de dados são chamados de vetores de suporte. A Figura 1 mostra alguns hiperplanos candidatos em dados linearmente separáveis. A equação 1 demonstra a equação do hiperplano, enquanto as equações 2 e 3 mostram os elementos localizados acima e abaixo do plano32:

figure-protocol-1Equação do hiperplano (1)

Aqui, w é um vetor que representa o peso, x é um vetor que representa a entrada, e b. representa um viés potencial.

figure-protocol-2Para todo j, tal que figure-protocol-3 = +1 (2)

figure-protocol-4Para todo i, tal que figure-protocol-5 = -1 (3)

figure-protocol-6
Figura 1: Um SVM típico com duas classes separáveis. Essa figura visualiza um SVM típico com duas classes separáveis. Abreviações; SVM = máquina de vetores de suporte. Por favor, clique aqui para ver uma versão ampliada desta figura.

Rede neural artificial (RNA)
RNA é uma técnica de inteligência computacional em computação suave que imita a funcionalidade do sistema cerebral humano. Possui um vasto número de neurôniosinterconectados 33. Está entre os algoritmos supervisionados de aprendizado de máquina que podem aprender a partir de conjuntos de dados de exemplo e melhorar seu desempenho por meio do aprendizado, gerando resultados úteis33. A arquitetura da ANN compreende múltiplas camadas: uma camada de entrada, uma camada oculta e uma camada de saída. Cada um deles é formado por um conjunto de neurôniosconectados 33.

O neurônio que recebe os dados de fora realiza algum processamento e então envia os dados para outra camada conhecida como camada de entrada. O propósito da camada de entrada não é realizar nenhum processo complexo sobre os dados; é simplesmente duplicar o valor de entrada e enviá-lo para a próxima camada33. A camada de saída contém neurônios que produzem dados para o programa do usuário. Entre essas duas camadas, a camada oculta está localizada como uma camada opcional para realizar processos computacionais. A camada oculta serve como uma camada intermediária que recebe entradas dos neurônios de entrada, realiza operações matemáticas neles e então passa os resultados para outra camada33. A Figura 2 mostra a arquitetura ANN.

figure-protocol-7
Figura 2: Feed-forward e retropropagação em uma estrutura típica de RNA. Esta figura visualiza uma rede feed-forward com retropropagação em uma estrutura típica de RNA. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.

A NN feed-forward é uma abordagem que armazena dados de entrada em direção direta. Na direção oposta, ocorre o processo de retropropagação à medida que os pesos da rede neural se atualizam em uma abordagem retroativa para obter os gradientes, usando uma rede neural com várias camadas ocultas. A desvantagem desse processo é a anulação ou explosão dos gradientes. A função de ativação mantém as características não lineares do seu ANN, o que permite aprender relações detalhadas entre dados de entrada e saída, conforme declarado uma aproximação universal. A Figura 3 demonstra a arquitetura principal da rede neural artificial. Também ilustra a função de ativação aplicada à saída de cada neurônio, que representa a soma de todos os pesos de entrada. O viés mantém a soma de todos os pesos e está incluído na entrada doneurônio 33.

figure-protocol-8
Figura 3: Um neurônio perceptrônico único típico para uma RNA. Esta figura representa um único neurônio perceptron de uma ANNA típica. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.

Floresta aleatória (RF)
RF está entre os algoritmos de classificação mais proeminentes em aprendizado de máquina. Consiste em várias Árvores de Decisão individuais trabalhando juntas como um conjunto e produzindo o resultadofinal 29. O conceito básico por trás do desempenho bem-sucedido do RF é que ele é composto por muitas árvores moderadamente não correlacionadas (formando uma floresta), que atuam como um comitê. Assim, eles serão mais eficientes do que todos os modelos que rodamindependentemente do 34. O algoritmo RF foi desenvolvido principalmente por um grupo depesquisadores 35. Para entender melhor como a RF funciona, é essencial compreender as árvores de decisão35. É igualmente aplicável tanto a problemas discretos quanto contínuos, especificamente classificação, detecção e regressão,respectivamente 36. Quanto mais árvores na floresta, mais próximo será da precisão do resultado, mas com uma complexidade computacionaladicional de 36, como mostrado na Figura 4.

figure-protocol-9
Figura 4: Esquema da Floresta Aleatória. Esta figura demonstra um esquema de uma floresta aleatória típica. Por favor, clique aqui para ver uma versão ampliada desta figura.

Naive Bayes (NB)
Naïve Bayes (NB) é um algoritmo de classificação que emprega o teorema de Bayes para classificar objetos. É um método muito popular aplicado na maioria das áreas médicas, especialmente para diagnosticar sintomas. Nesse método, os objetos assumem as principais suposições de independência, o que torna a relação entre os atributos independente entre si. Devido à sua natureza ingênua, está entre os algoritmos de classificação mais simples em aprendizadode máquina 37. Com base no conjunto de dados fornecido, NB determina a probabilidade de um determinado resultado. O modelo NB é simples de desenvolver, pode gerenciar dados substanciais e é um algoritmo sofisticado e computacionalmente leve. Além disso, oferece funções modestas, resultando em conhecimento numérico e nominal. Robustez e interpretações simples de aprendizagem também são vantagens potenciais do classificador NB. Se for empregado em uma quantidade limitada de dados, resultará em um resultado relativamente impreciso. Depende de registros enormes, que são considerados menos precisos em comparação com outrastécnicas 37.

Análise estatística
A análise estatística do conjunto de dados ajuda a visualizar e entender o padrão do conjunto para melhor pré-processamento e modelagem dos dados. Nesse sentido, foram realizados os seguintes passos. Primeiramente, para investigar se as características demográficas estão desequilibradas entre grupos positivos e negativos, incluindo idade e gênero, é realizada uma análise estatística no software SPSS. Em segundo lugar, compilar os dados quantitativos usando um teste t de amostra independente se a distribuição normal e a homogeneidade da variância forem satisfeitas, ou o teste Man-Whitney U. Por fim, os dados categóricos foram compilados usando o teste qui-quadrado ou o teste exatode Fisher 38.

Implementação
Descrição do conjunto de dados
O conjunto de dados para o estudo atual foi obtido no Hospital Universitário King Fahad em Dammam, Arábia Saudita, após aprovação pelo conselho de revisão institucional (IRB). Esses dados foram coletados de acordo com testes padrão entre os pacientes. A asma é frequentemente diagnosticada por meio de exames padrão entre pacientes, incluindo exames de sangue, testes de vírus e testes bioquímicos. Para o estudo atual, os pacientes e controles saudáveis (HC) foram recrutados e clinicamente avaliados com base na triagem padrão e nos testes patológicos realizados no hospital sob recomendação dos médicos do departamento. Os critérios clínicos de inclusão e exclusão foram definidos pelos médicos com base nos resultados laboratoriais. Posteriormente, os dados qualificados e verificados foram fornecidos para o estudo. O conjunto de dados contém dezessete atributos, pois estão disponíveis para todos os pacientes com asma. O conjunto de dados inclui 328 casos totais, sendo 165 positivos para asma e 163 para asma negativa. A distribuição de gênero e idade nos grupos positivo e negativo está listada na Tabela 1.

InstânciasPositivoNegativo
Masculino14510738
Feminino18357126
Total328164164

Tabela 1: Distribuição de gênero do conjunto de dados. Esta tabela mostra a distribuição de gênero no conjunto de dados.

A Tabela 2 mostra a distribuição etária entre as duas classes.

Faixa etáriaDistribuição etária (classe = 1)Distribuição etária (classe = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tabela 2: Distribuição etária do conjunto de dados. Esta tabela mostra a distribuição etária no conjunto de dados.

A idade (p < 0,001 no teste Man-Whitney U) e o gênero (p < 0,001 no teste de Qui-quadrado) estavam desequilibrados entre os grupos positivo e negativo. No entanto, não há viés no processo de recrutamento. Acredita-se que a distribuição desequilibrada possa refletir a distribuição etária única dessa coorte de pacientes. Os critérios de inclusão incluem fatores clínicos para a presença e ausência da doença; Demografia, incluindo gênero, idade e população local, são considerados. Além disso, os dados foram coletados com consentimento informado. Idade e gênero estão incluídos como possíveis características no conjunto de recursos, conforme mencionado abaixo. No entanto, análises explícitas baseadas em idade e gênero não estão no escopo do estudo e permanecem como trabalho futuro.

O conjunto de dados é armazenado como valores numéricos. A coluna "Classe" contém os valores 0 e 1, onde 0 representa o "paciente normal" e 1 representa o "paciente asma".
Nesse sentido, os seguintes dezessete atributos foram utilizados:
Classe: (0 = "Normal", 1 = "Paciente com Asma")

1. idade em anos (IDADE)

2. gênero (1 = masculino, 0 = feminino): GÊNERO

3. Basófilos (BASO)

4. Eosinófilos (EOS)

5. Hematócrito (HCT)

6. Hemoglobina (HGB)

7. Linfócitos (LYM)

8. Hemoglobina corpuscular média (MCH)

9. Concentração média de hemoglobina corpuscular (MCHC)

10. Volume corpuscular médio (MCV)

11. Monócitos (MONO)

12. Volume médio de plaquetas (MPV)

13. Função dos Neutrófilos (NEUT)

14. Contagem de plaquetas (PLATELET_COUNT)

15. Contagem de glóbulos vermelhos (RBC)

16. Largura de distribuição de células vermelhas (RDW)

17. Glóbulos Brancos (WBC)

Características estatísticas do conjunto de dados
Para melhor compreensão, uma análise estatística do conjunto de dados é apresentada nas tabelasseguintes 38. A Tabela 3 mostra a média, mediana, desvio padrão, máximo e mínimo para o conjunto de dados em consideração.

MeanMedianaDesvio padrãoMaxMin
IDADE39.13618.136932
GÊNERO0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Classe0.50.50.500810

Tabela 3: Características estatísticas do conjunto de dados. Esta tabela lista as características estatísticas dos dados.

Além disso, a Tabela 4 mostra o coeficiente de correlação obtido entre cada atributo e o atributo da classe. Seus valores ficam entre 0 (menos correlacionado) e 1 (mais correlacionado). Ele é adicionado como uma análise estatística preliminar para explicar os atributos do conjunto de dados. MPV, gênero, HGB, MCHC e idade estão entre os aspectos mais significativos.

Pares de atributosCoeficiente de correlação
IDADE0.212473
GÊNERO0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Classe1

Tabela 4: Correlação com o atributo classe. Esta tabela mostra a correlação entre os atributos (características) e o atributo classe.

Configuração experimental
No estudo atual, a linguagem de programação Python é usada para pré-processar o conjunto de dados coletado. Devido a erro humano, valores específicos estão ausentes durante a entrada e seleção de dados. Técnicas de imputação têm sido usadas para lidar com valores ausentes no conjunto de dados. Isso é feito substituindo valores ausentes pela média do atributo. Por causa de sua simplicidade, compatibilidade do modelo e preservação dos valores médios amostrais, conforme discutido com profissionais de saúde. Além disso, a seleção de características é realizada usando coeficientes de correlação para ranquear os atributos. As características com valores de correlação mais altos foram selecionadas para análise junto com o conjunto completo de características. Bibliotecas em Python têm sido utilizadas para a implementação da abordagem proposta, ajuste de hiperparâmetros e obtenção de resultados. A seleção e eliminação de características foram realizadas por um método de seleção de atributos para identificar os grupos de características com maior precisão. Além disso, o Python foi usado para avaliar a precisão usando métodos de validação cruzada 10 vezes e avaliação por Razão de Partição Direta, conforme especificado pelas equações39,40 fornecidas. Por fim, a média dos resultados de todos os métodos de avaliação foi calculada para comparar os métodos utilizados e determinar qual com a melhor média de precisão38. Além disso, matrizes de confusão foram geradas usando os parâmetros ótimos de SVM, ANN, RF e NB. Em seguida, foi realizada uma comparação de falsos positivos (FP), falsos negativos (FN), verdadeiros positivos (TP) e verdadeiros negativos (TN) por meio do cálculo do escore F1, que é uma medida eficiente para comparar o melhor método 41,42.

Métricas de avaliação
Para avaliar o desempenho da abordagem proposta, são consideradas quatro métricas de desempenho bem conhecidas. Ou seja, precisão, precisão, recall e pontuação F1. A precisão da classificação é a principal medida porque a porcentagem de instâncias corretamente classificadas é calculada para cada instância. Precisão é o número total de pontos de TP esperados. A recall é o número de TP a mais do que cada positivo real. Desempenho na pontuação F1 de cada classe. De acordo com a capacidade dos resultados, as seguintes métricas sãoobtidas 43, 44, 45:

Verdadeiro positivo (TP): Resultado do diagnóstico correto de asma.

Falso positivo (FP): Resultado de diagnóstico incorreto de asma.

Verdadeiro negativo (ET): Resultado dos casos corretos diagnosticados como não asmáticas.

Falso negativo (FN): Resultado de diagnóstico incorreto como não asma.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Estratégia de otimização
Para determinar os parâmetros ideais para cada uma das abordagens propostas, foi empregada a técnica de Busca em Grade. Valores possíveis de parâmetros específicos são colocados no método de Busca em Grade. Portanto, pode desenvolver o melhor desempenho possível para melhoria de precisão.

As Figuras 5–7 mostram o resultado da técnica de Busca em Grade para todas as quatro abordagens propostas e o procedimento de implementação no conjunto de dados com a ajuda dos dezoito principais atributos. A Figura 5 apresenta as precisões do SVM obtidas com vários valores de parâmetro. Os valores de entrada para o Custo e o Gama, correspondentes a múltiplos tipos de núcleos, são os seguintes:

Tipos de núcleo: Linear, Radial, Sigmoide e Polinômio.

Gama: 0,001 e 0,0001.

Custo: 1, 10, 100 e 1000.

figure-protocol-13
Figura 5: SVM com diferentes tipos de custo e gama. Esta figura demonstra o comportamento das SVM com diferentes tipos de custo e gama. Abreviações; SVM = máquina de vetores de suporte. Por favor, clique aqui para ver uma versão ampliada desta figura.

Para a RF, os valores de entrada sistematicamente indicados na Figura 6 são os seguintes:

Os nomes dos parâmetros, juntamente com seus respectivos valores, são fornecidos abaixo:

Número de recursos: 'auto', 'sqrt'.

Profundidade máxima: 1, 3, 5, 7.

Amostras MIN divididas: 2, 3, 4, 5.

Amostras MIN folhetem: 2, 3, 4, 5.

figure-protocol-14
Figura 6: RF com diferentes valores de profundidade e folhas mínimas de amostra. Esta figura mostra o comportamento da RF com diferentes profundidades e valores mínimos das folhas da amostra. Abreviações; RF = floresta aleatória. Por favor, clique aqui para ver uma versão ampliada desta figura.

Para o RNA, os valores analíticos de entrada são indicados na Figura 7.

Os nomes dos parâmetros, juntamente com seus respectivos valores, são os seguintes:

Tamanhos de camadas ocultas: (50, 50, 50), (50, 100, 50) e (100,).
Ativação: 'tanh' e 'relu'.
Solucionador: 'sgd' e 'adam'.
Alfa: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 e 0,05.
Taxa de aprendizado: 'constante' e 'adaptativa'.

figure-protocol-15
Figura 7: ANN com diferentes valores alfa e tamanhos ocultos de camadas. Esta figura mostra o comportamento do ANN com diferentes valores alfa e tamanhos de camada ocultos. Abreviações; ANN = rede neural artificial. Por favor, clique aqui para ver uma versão ampliada desta figura.

ClassificadorParâmetroValor
SVMGama0.0001
Tipo de núcleo'RBF'
Custo 'C'10
Estado aleatório42
RFProfundidade máxima3
Amostras mínimas de folha2
Amostras mínimas divididas2
Estado aleatório42
ANNAtivação'Relu'
Alpha0.001
Tamanho da camada oculta(50,50,50)
Taxa de aprendizado'constante'
Solucionador'Adam'
Estado aleatório42

Tabela 5: Resumo dos parâmetros ótimos para os classificadores propostos. Esta tabela resume os parâmetros ótimos obtidos para os classificadores propostos.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Influência da seleção de características
No estudo atual, o método recursivo baseado em eliminação de características do coeficiente de correlação é utilizado para a seleção de características. O coeficiente de correlação é usado para ordenar as características do maior para o menor de acordo com seus valores de correlação. A eliminação recursiva de características é usada para ajudar na seleção das características adequadas para o modelo, pois elimina progressivament...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O estudo atual emprega vários algoritmos de aprendizado de máquina, incluindo SVM, ANN, RF e NB. Após realizar vários experimentos, ajustar hiperparâmetros e seleção de características, concluiu-se que SVM, RNA e RF apresentam uma precisão diagnóstica notável de 94%, enquanto NB é comparativamente menor, com 83,33%. Os resultados foram validados usando validação cruzada de 10 vezes e seleção otimizada de características, além da melhor razão de divisão. De acordo com os dados fornecidos,...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O conjunto de dados foi obtido do hospital sob o IRB-2020-09-429. Os autores declaram que não têm conflitos de interesse a relatar em relação ao estudo atual. O estudo foi adicionado ao repositório Research Square como um preprint com a seguintecitação 50.

CONTRIBUIÇÕES DOS AUTORES:
A conceituação foi feita por S.O., M.I.B.A. e A.R.; A supervisão foi realizada pelo S.O., M.I.B.A. e J.A.; A escrita do rascunho original foi realizada pela S.S.A., E.A. e Z.A.; A implementação foi feita pela S.A.A., Y.A. e R.A.; A validação foi feita por J.A., M.A. e S.D.; A curadoria de dados foi realizada por A.B., Y.A., E.A. e Z.A.; A revisão e edição foram realizadas por A.R., S.D. e A.B.; A administração do projeto foi realizada por A.R., S.D. e M.A., e a aquisição de recursos foi realizada por A.B., S.D. e A.R.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores gostariam de reconhecer o apoio dos profissionais de saúde na validação das conclusões do estudo.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Excel 365MicrosoftExcel 365Usado para armazenar dados brutos no formato csv
Laptop/MáquinaDellXPS9320RAM 16GB, 12th Gen Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Usado para modelagem e treinamento de modelos 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Usado para modelagem e treinamento de modelos 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Usado para modelagem e treinamento de modelos 
Python 3.12.12Google colab Notebook Python 3.12.12Usado para modelagem e treinamento de modelos 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Usado para modelagem e treinamento de modelos 
SPSS IBM, USAVersão 26.0Usado para análise estatística
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Usado para modelagem e treinamento de modelos 

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Diagn stico de AsmaAprendizado de M quinaDetec o PrecoceAsma na Ar bia SauditaFlorestas Aleat riasM quinas de Vetores de SuporteRedes Neurais ArtificiaisAn lise de Dados M dicosPredi o de Doen as Cr nicas

Artigos relacionados