Artículo de investigación

Un diagnóstico temprano basado en inteligencia computacional de la enfermedad asmática: un estudio de caso saudí

DOI:

10.3791/70040

16 de junio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio actual investiga varios algoritmos de aprendizaje automático en un conjunto de datos saudí para la detección del asma. En contraste con los enfoques de última generación que emplean aprendizaje automático en conjuntos de datos clínicos para el diagnóstico del asma, el esquema propuesto logra un mejor rendimiento, con una mejora del 3,9% en la precisión del diagnóstico.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Según la investigación, se ha identificado un aumento de enfermedades crónicas, incluido el asma. El número de pacientes asmáticos en Arabia Saudí es motivo de preocupación debido a las condiciones meteorológicas y el estilo de vida, especialmente en la era pospandémica. Exige una solución para reducir las infecciones desarrollando un sistema inteligente para detectar el asma en una fase temprana, preveniendo así la enfermedad o facilitando un tratamiento precoz. En este estudio, el aprendizaje automático se ha utilizado para desarrollar herramientas que rastreen los síntomas del asma en una etapa temprana. Aunque ha habido varios intentos previos de aplicar el aprendizaje automático para predecir la aparición del asma. No obstante, centrarse en la identificación de la enfermedad en la etapa previa a los síntomas, especialmente en el contexto saudí, es un área relativamente descuidada. El conjunto de datos para el estudio actual se obtuvo del Hospital Universitario King Fahad, Dammam, Arabia Saudí, e incluyó pruebas estándar realizadas en pacientes, como análisis de sangre, análisis virales y pruebas bioquímicas. El conjunto de datos contiene 17 atributos significativos e incluye información de 328 pacientes con asma: 165 son positivos y 163 negativos. Los métodos seleccionados para su aplicación aquí son los bosques aleatorios (RF), las redes neuronales artificiales (ANN), las máquinas de vectores de soporte (SVM) y el Bayes ingenuo (NB). Cada uno de estos métodos ha sido elegido en función de sus características distintivas. El resultado experimental reveló que los enfoques RF, SVM y RNA arrojaron un 94%, que es la mayor precisión y mejoraron el estado del arte en un 3,9%. Cabe destacar que nueve de las diecisiete características posibles se utilizaron para lograr la precisión mencionada. A pesar de que RF, SVM y ANN logran la misma precisión, ANN tiene un coste de error más alto. Por lo tanto, RF y SVM son superiores en función del patrón de resultados, y por ello se sugieren para este problema.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tras realizar una investigación exhaustiva, los investigadores observaron que las enfermedades crónicas se han vuelto cada vez máscomunes. El asma es una enfermedad inflamatoria crónica de las vías respiratorias caracterizada por episodios recurrentes de falta de aire y sibilancias. La prevalencia del asma varía a nivel global, oscilando entre el 1 y el 20% tanto en niños como en adultos, afectando a millones de personas en todoel mundo 2. Estos cambios a gran escala están relacionados con variaciones ambientales, incluidas las de varios países, así como con el uso de diferentes instrumentos de evaluación y diversas definiciones epidemiológicas del asma. El asma tiene una tasa de letalidad relativamente baja en comparación con varias otras enfermedades crónicas bienconocidas 2. Sin embargo, los informes indican que el patrón de asma en el Reino de Arabia Saudí está aumentandoen 3,4.

El asma es una condición inflamatoria crónica que provoca un estrechamiento de la luz. El estrechamiento de la ruta aérea se debe a la expansión de las emisiones de fluidos corporales, así como al engrosamiento de los divisores bronquiales debido al edema, la fibrosis subepitelial y la hipertrofia del músculo liso. Se han utilizado aparatos fisiopatológicos impulsados por diversos tipos celulares, incluidas las células inmunitarias, para evaluar estascondiciones 5. Debido a las condiciones meteorológicas severas y a un estilo de vida principalmente en interiores en Arabia Saudí, el asma es una de las enfermedades crónicas más extendidas. Varias encuestas han demostrado la abrumadora tasa deasma 6. La enfermedad se ha convertido en un problema importante, requiriendo un sistema de respuesta temprana para ayudar a mitigar el número de incidentes y hacer posible una mediación temprana para prevenir o curar la enfermedad en una etapa más temprana.

A diferencia de los individuos, el asma tiene un impacto profundo en las comunidades y las familias. Si no se controla, impone limitaciones severas a la vida del paciente y le impide participar en muchas actividades diarias. En Arabia Saudí, las condiciones meteorológicas adversas, incluyendo una atmósfera calurosa, tormentas de arena generalizadas y el uso excesivo de sistemas de aire acondicionado/refrigeración interiores, contribuyen significativamente al asma. La sociedad torácica saudí (STS) ha realizado esfuerzos notables para proporcionar los mejores medicamentos para las infeccionesrespiratorias. Sin embargo, es necesario un diagnóstico proactivo del asma para reducir la tasa de infección, especialmente en un escenario post-pandemia (COVID-19). Se dedujo además que los antecedentes familiares, el tabaquismo y la rinitis alérgica están entre los factores de riesgo más significativos para desarrollar asma entre los adultos saudíes. Se recomendó investigación adicional para investigar otros factores que sentaron las bases del estudio.

En esta investigación, teniendo en cuenta estudios previos sobre el diagnóstico del asma, el objetivo es mejorar la precisión diagnóstica. Las técnicas propuestas, incluyendo el bosque aleatorio (RF), la red neuronal artificial (ANN), la máquina de vectores de soporte (SVM) y el Bayes naïve (NB), se han utilizado en estudios anteriores, lo que ha producido mejoras notables en los resultados de diagnóstico. Por ejemplo, los investigadores han utilizado ANN, SVM y NB en los estudios8, 9 y 10. En el estudio actual, se han investigado enfoques de aprendizaje automático para ayudar como un sistema de alerta temprana que detecta incluso los pequeños indicadores de enfermedad asmática en las primeras etapas (pre-sintomáticas). La prevalencia de la enfermedad asmática en Arabia Saudí, especialmente en la era pospandémica, con factores como un estilo de vida orientado al interior debido a condiciones meteorológicas severas, conductos de aire acondicionado y tormentas de arena, son algunos de los principales factores. Sin embargo, no existe ningún estudio destacable que investigue los factores cruciales observados en el pasado reciente. Para abordar esta brecha de investigación, el estudio actual pretende investigar el papel del aprendizaje automático en la detección temprana del asma entre adultos saudíes. Además, el objetivo principal es lograr la máxima precisión posible con el menor número de rasgos. Aunque en el pasado ha habido esfuerzos reconocibles para utilizar el aprendizaje automático y predecir la presencia de la enfermedadasmática 8,9,10. El estudio actual pretende utilizar un conjunto de datos saudí, obtenido por primera vez de un hospital público en la provincia oriental, centrado en el diagnóstico de la enfermedad en una fase temprana (diagnóstico preventivo). El aprendizaje automático (ML) es reconocido como un método para extraer conocimiento a partir de datosrecopilados 11,12. Proporciona una precisión de predicción obtenida a partir del proceso de aprendizaje de instancias anteriores mediante el uso de diversas técnicas de aprendizaje automático. El aprendizaje automático abarca múltiples métodos, algoritmos y estrategias para abordar problemas analíticos y predictivos en amplios campos médicos, como la detección temprana de la existencia de enfermedades13,14.

Se han realizado varios estudios para predecir la enfermedad asmática utilizando diversas técnicas. Los investigadores desarrollaron una red neuronal artificial (RNA) para la clasificación del asma basada en las pruebas dinámicas y estáticas del paciente8. Los parámetros medidos de espirometría, oscilometría de impulso (IOS), auscultación, resultados de alergias e información sobre los síntomas se utilizan en la RNA. La información definida permite al ANN sugerir la clasificación adecuada de asma. Asimismo, los investigadores realizaron un estudio para abordar los retos en el diagnóstico de enfermedadestorácicas. Se utilizaron máquinas de vectores de soporte (SVM) y los métodos adaptativos SVM (ASVM) para diagnosticar enfermedades torácicas como el asma. La mejor precisión de clasificación para todas las enfermedades torácicas se obtuvo utilizando el método ASVM. Los investigadores utilizaron varias estructuras de redes neuronales, como la NN multicapa (MLNN) con algoritmo de retropropagación (BPA) con una o dos capas ocultas, la NN probabilística (PNN), cuantización de vectores de aprendizaje (LVQ) y la regresión general NN (GRNN), para el diagnóstico de enfermedades torácicas, incluyendo la enfermedadasmática 15. Además, algunos realizaron un estudio comparativo orientado al diagnóstico de enfermedades torácicas utilizando un sistema inmunitario artificial (AIS). Los estudios mencionados han implementado diversas estructuras para diagnosticar problemas de enfermedad torácica utilizando sus diferentes conjuntos de datos. Para el asma, el resultado más alto se obtuvo usando AIS con una precisión global del 90,91%16. Además, los investigadores investigaron la eficacia de una NN profunda (DNN) para mejorar la precisión en el diagnóstico del asma y compararon el rendimiento predictivo de diferentes algoritmos de aprendizaje automático, especialmente con regresión logística y SVM. El estudio mostró que la prueba empírica que utilizaba el modelo de signos de asma fue más eficaz para un diagnóstico preciso delasma 9. Otro estudio demostró la capacidad significativa del aprendizaje automático utilizando datos de telemonitorización para predecir exacerbaciones del asma antes de que ocurran, mediante enfoques de aprendizaje automático como SVM y Naïve Bayes para implementar suexperimento 10.

Además, los investigadores emplearon varias técnicas de aprendizaje automático para diagnosticar preventivamente la enfermedad de Alzheimer (EA), incluyendo SVM, k-NN, adaptive boosting (AdaBoost) y eXtreme gradient boosting (XGBoost)17. Los investigadores también realizaron un estudio para diagnosticar preliminarmente la diabetes, investigando cuatro enfoques de aprendizaje automático, a saber, NB, SVM, K-NN y ANN. Las tres principales características del conjunto de datos saudí mostraron la mayor precisión media, del 68%. El rendimiento de las técnicas de medición se comparó en función de la precisión, la exactitud, la memoria y la puntuación F1. El RNA obtuvo la máxima precisión de clasificación del 77,5%18. Asimismo, el mismo grupo de investigadores experimentó con la realización de cuatro técnicas de clasificación — a saber, NB, SVM, K-NN y ANN — para diagnosticar preventivamente la enfermedad renal crónica, aplicada al conjunto de datossaudí 19. Además, los autores realizaron un estudio para diagnosticar primitivamente el cáncer de tiroides utilizando cuatro técnicas de aprendizaje automático: ANN, SVM, RF y NB. Utilizando 14 características del conjunto de datos saudí, los autores obtuvieron la mayor precisión media del 95%. El rendimiento de las técnicas de medición se comparó utilizando precisión, exactitud, recuerdo y puntuación F1. El RF obtuvo la mayor precisión de clasificación del 90,91%20. Los investigadores también realizaron dos estudios que arrojaron resultados notables en el diagnóstico proactivo de la artritis reumatoide. Varias técnicas de aprendizaje automático, como SVM, regresión logística (LR) y AdaBoost, fueron preseleccionadas y utilizadas como técnicas candidatas para un conjunto de votación. Inicialmente, se utilizaba un conjunto de datos y el otro se equilibraba aplicando SMOTE. La novedosa técnica de conjunto de votación fue probada mediante dos métodos secuenciales de selección de características. Es decir, la selección hacia adelante y hacia atrás se utiliza para encontrar el mejor subconjunto del espacio de características que presenta los indicadores más altos para cada técnica. Utilizando 30 características de los datos originales y la técnica secuencial de selección directa de características, los porcentajes obtenidos fueron prometedores, con valores de precisión, recuerdo y precisión del 94,03%, 96% y 93,51%, respectivamente21. De manera similar, otros métodos inteligentes en medicina y campos relacionados pueden encontrarse en muchos estudios 22,23,24,25,26.

Las técnicas propuestas en este trabajo son RF, SVM, ANN y NB debido a sus resultados sobresalientes para problemas similares. En el estudio actual, los resultados obtenidos a través de los experimentos. Tras varios pasos de optimización y selección de características, se demuestra que las técnicas propuestas son prometedoras para el diagnóstico del asma con el conjunto de datos objetivo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta sección describe los algoritmos de aprendizaje automático investigados en el enfoque propuesto de diagnóstico del asma. Los criterios y razones detrás de la selección del método propuesto se basan en una revisión bibliográfica exhaustiva y en una larga historia de tratamiento con el diagnóstico preventivo de varias enfermedadescrónicas 27,28,29,30,31. Estos algoritmos produjeron resultados prometedores. Todos los materiales y herramientas utilizados en este estudio están listados en la Tabla de Materiales.

Máquinas de vectores de soporte (SVM)
El algoritmo SVM es uno de los más exitosos en reconocimiento de patrones yclasificación 32. Utiliza clasificación binaria, donde clasifica un conjunto de vectores de entrenamiento en dos clases. Pertenece a la familia de algoritmos de aprendizaje supervisado, donde la salida deseada se genera bajo la supervisión32. En comparación con otros algoritmos de clasificación en aprendizaje automático, SVM ofrece mejores resultados en el rendimiento de la clasificación. Por ello, se ha utilizado ampliamente en numerosas aplicaciones como el reconocimiento de voz, rostros y escritura a mano. Además, la SVM también se ha aplicado en diversas áreas, incluyendo la predicción de enfermedades y la predicción de población. Además, debido a su insensibilidad al ruido o sobreajuste, la SVM puede manejar datos desbalanceados, lo cual es un caso típico en diagnósticos médicos, donde los casos positivos son menos numerosos quelos negativos 32.

En la clasificación, SVM separa dos clases dibujando un borde de decisión, en el que puede predecir las etiquetas distinguiendo uno o más vectores de características32. El límite de decisión se denomina hiperplano, que es el más alejado de los puntos de datos más cercanos de cada clase. Esos puntos de datos se denominan vectores de soporte. La Figura 1 muestra algunos hiperplanos candidatos en datos linealmente separables. La ecuación 1 demuestra la ecuación del hiperplano, mientras que las ecuaciones 2 y 3 muestran los elementos situados por encima y por debajo del plano32:

figure-protocol-1Ecuación del hiperplano (1)

Aquí, w es un vector que representa el peso, x es un vector que representa la entrada, y b. representa un sesgo potencial.

figure-protocol-2Para todo j, tal que figure-protocol-3 = +1 (2)

figure-protocol-4Para todo i, tal que figure-protocol-5 = -1 (3)

figure-protocol-6
Figura 1: Una SVM típica con dos clases separables. Esta figura visualiza una SVM típica con dos clases separables. Abreviaturas; SVM = máquina de vectores de soporte. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Red neuronal artificial (RNA)
La RNA es una técnica de inteligencia computacional en computación blanda que imita la funcionalidad del sistema cerebral humano. Tiene un gran número de neuronasinterconectadas 33. Está entre los algoritmos supervisados de aprendizaje automático que pueden aprender de conjuntos de datos de ejemplo y mejorar su rendimiento mediante el aprendizaje, generando resultadosútiles 33. La arquitectura de ANN comprende múltiples capas: una capa de entrada, una capa oculta y una capa de salida. Cada una de ellas está formada por un conjunto de neuronasconectadas 33.

La neurona que recibe los datos del exterior realiza cierto procesamiento y luego envía los datos a otra capa conocida como capa de entrada. El propósito de la capa de entrada no es realizar ningún proceso complejo sobre los datos; simplemente duplica el valor de entrada y lo envía a la siguiente capa33. La capa de salida contiene neuronas que producen datos para el programa de usuario. Entre estas dos capas, la capa oculta se encuentra como una capa opcional para realizar procesos computacionales. La capa oculta actúa como una capa intermedia que recibe las entradas de las neuronas de entrada, realiza operaciones matemáticas sobre ellas y luego pasa los resultados a otra capa33. La Figura 2 muestra la arquitectura de ANN.

figure-protocol-7
Figura 2: Retropropagación y avance en una estructura típica de RNA. Esta figura visualiza una red de avance de alimentación con retropropagación en una estructura típica de ANN. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La NN feed-forward es un enfoque que almacena los datos de entrada en una dirección directa. En la dirección opuesta, el proceso de retropropagación ocurre cuando los pesos de la red neuronal se actualizan en un enfoque hacia atrás para obtener los gradientes, utilizando una red neuronal con varias capas ocultas. La desventaja de este proceso es la anulación o explosión de los gradientes. La función de activación mantiene las características no lineales de su ANN, lo que le permite aprender relaciones detalladas entre los datos de entrada y salida, declarada una aproximación universal. La Figura 3 demuestra la arquitectura principal de la red neuronal artificial. También ilustra la función de activación aplicada a la salida de cada neurona, que representa la suma de todos los pesos de entrada. El sesgo contiene la suma de todos los pesos y está incluido en la entradaneuronal 33.

figure-protocol-8
Figura 3: Una neurona típica de perceptrón único para una RNA. Esta figura representa una única neurona perceptrón de una ANNA típica. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Bosque aleatorio (RF)
La RF es uno de los algoritmos de clasificación más destacados en el aprendizaje automático. Consiste en varios Árboles de Decisión individuales que trabajan juntos como un conjunto y producen la salidafinal 29. El concepto básico detrás del éxito del Partido Rojo es que está formado por muchos árboles moderadamente no correlacionados (formando un bosque), que actúan como un comité. Por tanto, serán más eficientes que todos los modelos que funcionen deforma independiente en 34. El algoritmo RF fue desarrollado principalmente por un grupo deinvestigadores 35. Para entender mejor cómo funciona la RF, es esencial comprender los árboles de decisión35. Es igualmente aplicable tanto a problemas discretos como continuos, específicamente a clasificación, detección y regresión,respectivamente 36. Cuantos más árboles haya en el bosque, más cercano será la precisión del resultado, pero con una complejidad computacionalañadida de 36, como se muestra en la Figura 4.

figure-protocol-9
Figura 4: Esquema del Bosque Aleatorio. Esta figura muestra un esquema de un bosque aleatorio típico. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Naive Bayes (NB)
Naïve Bayes (NB) es un algoritmo de clasificación que emplea el teorema de Bayes para clasificar objetos. Es un método muy popular aplicado en la mayoría de los campos médicos, especialmente para diagnosticar síntomas. En este método, los objetos adoptan las principales suposiciones de independencia, lo que hace que la relación entre los atributos sea independiente entre sí. Debido a su naturaleza ingenua, es uno de los algoritmos de clasificación más simples en aprendizajeautomático 37. En función del conjunto de datos dado, NB determina la probabilidad de un resultado concreto. El modelo NB es sencillo de desarrollar, puede gestionar datos sustanciales y es un algoritmo sofisticado y computacionalmente ligero. Además, ofrece funciones modestas, lo que resulta en datos numéricos y nominales. La robustez y las interpretaciones sencillas del aprendizaje son también las posibles ventajas del clasificador NB. Si se emplea en una cantidad limitada de datos, resultará en un resultado relativamente inexacto. Depende de registros enormes, que se consideran menos precisos en comparación con otrastécnicas 37.

Análisis estadístico
El análisis estadístico del conjunto de datos ayuda a visualizar y comprender el patrón del conjunto para mejorar el preprocesamiento y modelado de los datos. En este sentido, se llevaron a cabo los siguientes pasos. En primer lugar, para investigar si las características demográficas están desequilibradas entre grupos positivos y negativos, incluyendo edad y género, se realiza un análisis estadístico con el software SPSS. En segundo lugar, compilar los datos cuantitativos usando una prueba t de muestra independiente si se cumplieron la distribución normal y la homogeneidad de la varianza, o la prueba Man-Whitney U. Finalmente, los datos categóricos se han compilado usando la prueba chi-cuadrado o la pruebaexacta de Fisher 38.

Implementación
Descripción del conjunto de datos
El conjunto de datos para el estudio actual se obtuvo del Hospital Universitario King Fahad en Dammam, Arabia Saudí, tras su aprobación por parte del comité de revisión institucional (IRB). Estos datos se recogieron según pruebas estándar entre los pacientes. El asma suele diagnosticarse mediante pruebas estándar entre los pacientes, incluyendo análisis de sangre, virus y bioquímica. Para el estudio actual, los pacientes y controles sanos (HC) fueron reclutados y evaluados clínicamente basándose en el triaje estándar y las pruebas patológicas realizadas en el hospital bajo las recomendaciones de los médicos del departamento. Los criterios clínicos de inclusión y exclusión fueron definidos por los médicos basándose en los resultados de laboratorio. Posteriormente, se proporcionaron los datos cualificados y verificados para el estudio. El conjunto de datos contiene diecisiete atributos, ya que están disponibles para todos los pacientes con asma. El conjunto de datos incluye un total de 328 casos, con 165 casos positivos para asma y 163 negativos. La distribución de género y edad en los grupos positivo y negativo se enumera en la Tabla 1.

InstanciasPositivoNegativo
Masculino14510738
Femenino18357126
Total328164164

Tabla 1: Distribución por género en el conjunto de datos. Esta tabla muestra la distribución por género en el conjunto de datos.

La Tabla 2 muestra la distribución de edades entre ambas clases.

Rango de edadDistribución por edades (clase = 1)Distribución por edades (clase = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

Tabla 2: Distribución por edades del conjunto de datos. Esta tabla muestra la distribución por edades en el conjunto de datos.

La edad (p < 0,001 en la prueba Man-Whitney U) y el género (p < 0,001 en la prueba de chi cuadrado) no estuvieron desequilibrados entre los grupos positivo y negativo. Sin embargo, no hay sesgo en el proceso de reclutamiento. Se cree que la distribución desequilibrada puede reflejar la distribución única por edades de esta cohorte de pacientes. Los criterios de inclusión incluyen factores clínicos para la presencia y ausencia de la enfermedad; Se tienen en cuenta los datos demográficos, incluyendo género, edad y población local. Además, los datos se recogieron con consentimiento informado. La edad y el género se incluyen como posibles características en el conjunto de características, como se menciona a continuación. Sin embargo, los análisis explícitos basados en la edad y el género no están en el ámbito del estudio y se mantienen como trabajo futuro.

El conjunto de datos se almacena como valores numéricos. La columna "Clase" contiene los valores 0 y 1, donde 0 representa el "paciente normal" y 1 representa el "paciente asma".
En este sentido, se utilizaron los siguientes diecisiete atributos:
Clase: (0 = "Normal", 1 = "Paciente con asma")

1. edad en años (EDAD)

2. género (1 = hombre, 0 = mujer): GÉNERO

3. Basófilos (BASO)

4. Eosinófilos (EOS)

5. Hematócrito (HCT)

6. Hemoglobina (HGB)

7. Linfocitos (LYM)

8. Hemoglobina corpuscular media (MCH)

9. Concentración media de hemoglobina corpuscular (MCHC)

10. Volumen corpuscular medio (MCV)

11. Monócitos (MONO)

12. Volumen medio de plaquetas (MPV)

13. Función de los neutrófilos (NEUT)

14. Recuento de plaquetas (PLATELET_COUNT)

15. Recuento de glóbulos rojos (glóbulos rojos)

16. Ancho de distribución de glóbulos rojos (RDW)

17. Glóbulos blancos (glóbulos blancos)

Características estadísticas del conjunto de datos
Para una mejor comprensión, un análisis estadístico del conjunto de datos se muestra en las tablas38 siguientes. La Tabla 3 muestra los valores media, mediana, desviación estándar, máximo y mínimo para el conjunto de datos en cuestión.

PromedioMedianaDesviación estándarMaxMin
EDAD39.13618.136932
GÉNERO0.44200.497410
BASO0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
LYMP2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
MONO1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
NEUT4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
Clase0.50.50.500810

Tabla 3: Características estadísticas del conjunto de datos. Esta tabla muestra las características estadísticas de los datos.

Además, la Tabla 4 muestra el coeficiente de correlación obtenido entre cada atributo y el atributo de clase. Sus valores están entre 0 (menos correlacionado) y 1 (más correlacionado). Se añade como un análisis estadístico preliminar para explicar los atributos del conjunto de datos. El MPV, el género, el HGB, el MCHC y la edad están entre las características más significativas.

Pares de atributosCoeficiente de correlación
EDAD0.212473
GÉNERO0.423584
BASO-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
LYMP0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
MONO0.055476
MPV0.564992
NEUT0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
Clase1

Tabla 4: Correlación con el atributo de clase. Esta tabla muestra la correlación entre los atributos (características) y el atributo de clase.

Montaje experimental
En el estudio actual, se utiliza el lenguaje de programación Python para preprocesar el conjunto de datos recopilado. Debido a un error humano, faltan valores específicos durante la introducción y selección de datos. Se han utilizado técnicas de imputación para manejar los valores ausentes en el conjunto de datos. Se hace reemplazando los valores faltantes por el promedio del atributo. Debido a su simplicidad, compatibilidad de modelos y conservación de los valores medios muestrales, tal como se ha discutido con los profesionales sanitarios. Además, la selección de características se realiza utilizando coeficientes de correlación para clasificar los atributos. Las características con valores de correlación más altos se seleccionaron para su análisis junto con el conjunto completo de características. Se han utilizado bibliotecas de Python para la implementación del enfoque propuesto, el ajuste de hiperparámetros y la obtención de resultados. La selección y eliminación de características se realizaban mediante un método de selección de atributos para identificar los grupos de características con mayor precisión. Además, Python se utilizó para evaluar la precisión mediante métodos de validación cruzada de 10 veces y evaluación de la Proporción de Partición Directa, según lo especificado en las ecuaciones39,40. Finalmente, se calculó la media de todos los resultados de los métodos de evaluación para comparar los métodos utilizados y determinar el método con la mejor precisión media38. Además, se generaron matrices de confusión utilizando los parámetros óptimos de SVM, ANN, RF y NB. Después, se realizó una comparación de falsos positivos (FP), falsos negativos (FN), verdaderos positivos (TP) y verdaderos negativos (TN) mediante el cálculo de la puntuación F1, que es una medida eficiente para comparar el mejor método41,42.

Métricas de evaluación
Para evaluar el rendimiento del enfoque propuesto, se consideran cuatro métricas de rendimiento bien conocidas. Concretamente, precisión, recalle y puntuación F1. La precisión de la clasificación es la medida principal porque se calcula el porcentaje de instancias correctamente clasificadas para cada instancia. La precisión es el número total de puntos de TP esperados. La llamada es el número de TP más que cada positivo real. Rendimiento en la puntuación F1 de cada clase. Según la capacidad de los resultados, se obtienen las siguientesmétricas 43,44,45:

Positivo verdadero (TP): Resultado de un diagnóstico correcto de asma.

Falso positivo (FP): Resultado de un diagnóstico incorrecto de asma.

Negativo verdadero (TN): Resultado de casos correctos diagnosticados como no asma.

Falso negativo (FN): Resultado de ser diagnosticado incorrectamente como no asma.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

Estrategia de optimización
Para determinar los parámetros óptimos para cada uno de los enfoques propuestos, se empleó la técnica de búsqueda en cuadrícula. Los valores posibles de parámetros específicos se colocan en el método de búsqueda en cuadrícula. Por tanto, puede desarrollar el mejor rendimiento posible para mejorar la precisión.

Las figuras 5–7 muestran el resultado de la técnica de búsqueda en cuadrícula para los cuatro enfoques propuestos y el procedimiento de implementación en el conjunto de datos, con la ayuda de los dieciocho atributos principales. La Figura 5 presenta las precisiones de SVM obtenidas con varios valores de parámetro. Los valores de entrada para el Coste y el Gamma correspondientes a múltiples tipos de núcleos son los siguientes:

Tipos de núcleo: Lineal, Radial, Sigmoide y Polinomio.

Gamma: 0,001 y 0,0001.

Coste: 1, 10, 100 y 1000.

figure-protocol-13
Figura 5: SVM con diferentes tipos de coste y gamma. Esta figura demuestra el comportamiento de SVM con diferentes tipos de coste y gamma. Abreviaturas; SVM = máquina de vectores de soporte. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Para la RF, los valores de entrada sistemáticamente indicados en la Figura 6 son los siguientes:

Los nombres de los parámetros, junto con sus respectivos valores, se proporcionan a continuación:

Número de características: 'auto', 'sqrt'.

Profundidad máxima: 1, 3, 5, 7.

Muestras MIN divididas: 2, 3, 4, 5.

Hojas de muestra MIN: 2, 3, 4, 5.

figure-protocol-14
Figura 6: RF con diferentes valores de profundidad y hojas mínimas de muestra. Esta figura muestra el comportamiento de la RF con diferentes profundidades y valores mínimos de hojas muestrales. Abreviaturas; RF = bosque aleatorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Para el ANN, los valores analíticos de entrada se indican en la Figura 7.

Los nombres de los parámetros, junto con sus respectivos valores, son los siguientes:

Tamaños de capas ocultas: (50, 50, 50), (50, 100, 50) y (100,).
Activación: 'tanh' y 'relu'.
Solucionador: 'sgd' y 'adam'.
Alfa: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 y 0,05.
Tasa de aprendizaje: 'constante' y 'adaptativa'.

figure-protocol-15
Figura 7: ANN con diferentes valores alfa y tamaños de capa ocultos. Esta figura muestra el comportamiento de la RNA con diferentes valores alfa y tamaños ocultos de capa. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

ClasificadorParámetroValor
SVMGamma0.0001
Tipo de núcleo'RBF'
Coste 'C"10
Estado aleatorio42
RFProfundidad máxima3
Muestras mínimas de hojas2
División mínima de muestras2
Estado aleatorio42
ANNActivación'relu'
Alfa0.001
Tamaño de la capa oculta(50,50,50)
Tasa de aprendizaje'constante'
solucionador'Adam'
Estado aleatorio42

Tabla 5: Resumen de los parámetros óptimos para los clasificadores propuestos. Esta tabla resume los parámetros óptimos obtenidos para los clasificadores propuestos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Influencia de la selección de características
En el estudio actual, se utiliza el método recursivo basado en eliminación de características para la selección de características. El coeficiente de correlación se utiliza para ordenar las características de la más alta a la más baja según sus valores de correlación. La eliminación de características recursivas se utiliza para ayudar a seleccionar las características adecuadas para el modelo, ya que elimina progresivament...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio actual emplea varios algoritmos de aprendizaje automático, incluyendo SVM, ANN, RF y NB. Tras realizar varios experimentos, ajustar hiperparámetros y seleccionar características, se concluye que SVM, RNA y RF muestran una notable precisión diagnóstica del 94%, mientras que NB es comparativamente inferior, con un 83,33%. Los resultados se validaron mediante validación cruzada de 10 veces y selección optimizada de características, así como la mejor ratio de distribución. Según l...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El conjunto de datos ha sido obtenido del hospital bajo la norma IRB-2020-09-429. Los autores declaran que no tienen conflictos de interés que informar respecto al estudio actual. El estudio ha sido añadido al repositorio de Research Square como preprint con la siguientecita 50.

CONTRIBUCIONES DE LOS AUTORES:
La conceptualización ha sido realizada por S.O., M.I.B.A. y A.R.; La supervisión ha sido realizada por S.O., M.I.B.A. y J.A.; La escritura del borrador original la realizaron S.S.A., E.A. y Z.A.; La implementación fue realizada por S.A.A., Y.A. y R.A.; La validación fue realizada por J.A., M.A. y S.D.; La curación de datos fue realizada por A.B., Y.A., E.A. y Z.A.; La revisión y edición fueron realizadas por A.R., S.D. y A.B.; La administración del proyecto fue realizada por A.R., S.D. y M.A., y la adquisición de fondos la realizaron A.B., S.D. y A.R.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores desean reconocer el apoyo de los profesionales sanitarios para validar los hallazgos del estudio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Excel 365MicrosoftExcel 365Usado para almacenar datos sin procesar en formato csv
Laptop/MáquinaDellXPS9320RAM 16GB, Intel(R) Core(TM) i7-1260P de 12.ª generación
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4Usado para la construcción y entrenamiento de modelos 
Numpy 2.0.2Google colab Notebook Numpy 2.0.2Usado para la construcción y entrenamiento de modelos 
Pandas 2.2.2Google colab Notebook Pandas 2.2.2Usado para la construcción y entrenamiento de modelos 
Python 3.12.12Google colab Notebook Python 3.12.12Usado para la construcción y entrenamiento de modelos 
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1Usado para la construcción y entrenamiento de modelos 
SPSS IBM, EE. UU.Versión 26.0Usado para análisis estadístico
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2Usado para la construcción y entrenamiento de modelos 

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Diagn stico del asmaaprendizaje autom ticodetecci n tempranaasma en Arabia Sauditabosques aleatoriosm quinas de vectores de soporteredes neuronales artificialesan lisis de datos m dicospredicci n de enfermedades cr nicas

Artículos relacionados