$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Esta sección describe los algoritmos de aprendizaje automático investigados en el enfoque propuesto de diagnóstico del asma. Los criterios y razones detrás de la selección del método propuesto se basan en una revisión bibliográfica exhaustiva y en una larga historia de tratamiento con el diagnóstico preventivo de varias enfermedadescrónicas 27,28,29,30,31. Estos algoritmos produjeron resultados prometedores. Todos los materiales y herramientas utilizados en este estudio están listados en la Tabla de Materiales.
Máquinas de vectores de soporte (SVM)
El algoritmo SVM es uno de los más exitosos en reconocimiento de patrones yclasificación 32. Utiliza clasificación binaria, donde clasifica un conjunto de vectores de entrenamiento en dos clases. Pertenece a la familia de algoritmos de aprendizaje supervisado, donde la salida deseada se genera bajo la supervisión32. En comparación con otros algoritmos de clasificación en aprendizaje automático, SVM ofrece mejores resultados en el rendimiento de la clasificación. Por ello, se ha utilizado ampliamente en numerosas aplicaciones como el reconocimiento de voz, rostros y escritura a mano. Además, la SVM también se ha aplicado en diversas áreas, incluyendo la predicción de enfermedades y la predicción de población. Además, debido a su insensibilidad al ruido o sobreajuste, la SVM puede manejar datos desbalanceados, lo cual es un caso típico en diagnósticos médicos, donde los casos positivos son menos numerosos quelos negativos 32.
En la clasificación, SVM separa dos clases dibujando un borde de decisión, en el que puede predecir las etiquetas distinguiendo uno o más vectores de características32. El límite de decisión se denomina hiperplano, que es el más alejado de los puntos de datos más cercanos de cada clase. Esos puntos de datos se denominan vectores de soporte. La Figura 1 muestra algunos hiperplanos candidatos en datos linealmente separables. La ecuación 1 demuestra la ecuación del hiperplano, mientras que las ecuaciones 2 y 3 muestran los elementos situados por encima y por debajo del plano32:
Ecuación del hiperplano (1)
Aquí, w es un vector que representa el peso, x es un vector que representa la entrada, y b. representa un sesgo potencial.
Para todo j, tal que
= +1 (2)
Para todo i, tal que
= -1 (3)

Figura 1: Una SVM típica con dos clases separables. Esta figura visualiza una SVM típica con dos clases separables. Abreviaturas; SVM = máquina de vectores de soporte. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Red neuronal artificial (RNA)
La RNA es una técnica de inteligencia computacional en computación blanda que imita la funcionalidad del sistema cerebral humano. Tiene un gran número de neuronasinterconectadas 33. Está entre los algoritmos supervisados de aprendizaje automático que pueden aprender de conjuntos de datos de ejemplo y mejorar su rendimiento mediante el aprendizaje, generando resultadosútiles 33. La arquitectura de ANN comprende múltiples capas: una capa de entrada, una capa oculta y una capa de salida. Cada una de ellas está formada por un conjunto de neuronasconectadas 33.
La neurona que recibe los datos del exterior realiza cierto procesamiento y luego envía los datos a otra capa conocida como capa de entrada. El propósito de la capa de entrada no es realizar ningún proceso complejo sobre los datos; simplemente duplica el valor de entrada y lo envía a la siguiente capa33. La capa de salida contiene neuronas que producen datos para el programa de usuario. Entre estas dos capas, la capa oculta se encuentra como una capa opcional para realizar procesos computacionales. La capa oculta actúa como una capa intermedia que recibe las entradas de las neuronas de entrada, realiza operaciones matemáticas sobre ellas y luego pasa los resultados a otra capa33. La Figura 2 muestra la arquitectura de ANN.

Figura 2: Retropropagación y avance en una estructura típica de RNA. Esta figura visualiza una red de avance de alimentación con retropropagación en una estructura típica de ANN. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La NN feed-forward es un enfoque que almacena los datos de entrada en una dirección directa. En la dirección opuesta, el proceso de retropropagación ocurre cuando los pesos de la red neuronal se actualizan en un enfoque hacia atrás para obtener los gradientes, utilizando una red neuronal con varias capas ocultas. La desventaja de este proceso es la anulación o explosión de los gradientes. La función de activación mantiene las características no lineales de su ANN, lo que le permite aprender relaciones detalladas entre los datos de entrada y salida, declarada una aproximación universal. La Figura 3 demuestra la arquitectura principal de la red neuronal artificial. También ilustra la función de activación aplicada a la salida de cada neurona, que representa la suma de todos los pesos de entrada. El sesgo contiene la suma de todos los pesos y está incluido en la entradaneuronal 33.

Figura 3: Una neurona típica de perceptrón único para una RNA. Esta figura representa una única neurona perceptrón de una ANNA típica. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Bosque aleatorio (RF)
La RF es uno de los algoritmos de clasificación más destacados en el aprendizaje automático. Consiste en varios Árboles de Decisión individuales que trabajan juntos como un conjunto y producen la salidafinal 29. El concepto básico detrás del éxito del Partido Rojo es que está formado por muchos árboles moderadamente no correlacionados (formando un bosque), que actúan como un comité. Por tanto, serán más eficientes que todos los modelos que funcionen deforma independiente en 34. El algoritmo RF fue desarrollado principalmente por un grupo deinvestigadores 35. Para entender mejor cómo funciona la RF, es esencial comprender los árboles de decisión35. Es igualmente aplicable tanto a problemas discretos como continuos, específicamente a clasificación, detección y regresión,respectivamente 36. Cuantos más árboles haya en el bosque, más cercano será la precisión del resultado, pero con una complejidad computacionalañadida de 36, como se muestra en la Figura 4.

Figura 4: Esquema del Bosque Aleatorio. Esta figura muestra un esquema de un bosque aleatorio típico. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Naive Bayes (NB)
Naïve Bayes (NB) es un algoritmo de clasificación que emplea el teorema de Bayes para clasificar objetos. Es un método muy popular aplicado en la mayoría de los campos médicos, especialmente para diagnosticar síntomas. En este método, los objetos adoptan las principales suposiciones de independencia, lo que hace que la relación entre los atributos sea independiente entre sí. Debido a su naturaleza ingenua, es uno de los algoritmos de clasificación más simples en aprendizajeautomático 37. En función del conjunto de datos dado, NB determina la probabilidad de un resultado concreto. El modelo NB es sencillo de desarrollar, puede gestionar datos sustanciales y es un algoritmo sofisticado y computacionalmente ligero. Además, ofrece funciones modestas, lo que resulta en datos numéricos y nominales. La robustez y las interpretaciones sencillas del aprendizaje son también las posibles ventajas del clasificador NB. Si se emplea en una cantidad limitada de datos, resultará en un resultado relativamente inexacto. Depende de registros enormes, que se consideran menos precisos en comparación con otrastécnicas 37.
Análisis estadístico
El análisis estadístico del conjunto de datos ayuda a visualizar y comprender el patrón del conjunto para mejorar el preprocesamiento y modelado de los datos. En este sentido, se llevaron a cabo los siguientes pasos. En primer lugar, para investigar si las características demográficas están desequilibradas entre grupos positivos y negativos, incluyendo edad y género, se realiza un análisis estadístico con el software SPSS. En segundo lugar, compilar los datos cuantitativos usando una prueba t de muestra independiente si se cumplieron la distribución normal y la homogeneidad de la varianza, o la prueba Man-Whitney U. Finalmente, los datos categóricos se han compilado usando la prueba chi-cuadrado o la pruebaexacta de Fisher 38.
Implementación
Descripción del conjunto de datos
El conjunto de datos para el estudio actual se obtuvo del Hospital Universitario King Fahad en Dammam, Arabia Saudí, tras su aprobación por parte del comité de revisión institucional (IRB). Estos datos se recogieron según pruebas estándar entre los pacientes. El asma suele diagnosticarse mediante pruebas estándar entre los pacientes, incluyendo análisis de sangre, virus y bioquímica. Para el estudio actual, los pacientes y controles sanos (HC) fueron reclutados y evaluados clínicamente basándose en el triaje estándar y las pruebas patológicas realizadas en el hospital bajo las recomendaciones de los médicos del departamento. Los criterios clínicos de inclusión y exclusión fueron definidos por los médicos basándose en los resultados de laboratorio. Posteriormente, se proporcionaron los datos cualificados y verificados para el estudio. El conjunto de datos contiene diecisiete atributos, ya que están disponibles para todos los pacientes con asma. El conjunto de datos incluye un total de 328 casos, con 165 casos positivos para asma y 163 negativos. La distribución de género y edad en los grupos positivo y negativo se enumera en la Tabla 1.
| Instancias | Positivo | Negativo |
| Masculino | 145 | 107 | 38 |
| Femenino | 183 | 57 | 126 |
| Total | 328 | 164 | 164 |
Tabla 1: Distribución por género en el conjunto de datos. Esta tabla muestra la distribución por género en el conjunto de datos.
La Tabla 2 muestra la distribución de edades entre ambas clases.
| Rango de edad | Distribución por edades (clase = 1) | Distribución por edades (clase = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
Tabla 2: Distribución por edades del conjunto de datos. Esta tabla muestra la distribución por edades en el conjunto de datos.
La edad (p < 0,001 en la prueba Man-Whitney U) y el género (p < 0,001 en la prueba de chi cuadrado) no estuvieron desequilibrados entre los grupos positivo y negativo. Sin embargo, no hay sesgo en el proceso de reclutamiento. Se cree que la distribución desequilibrada puede reflejar la distribución única por edades de esta cohorte de pacientes. Los criterios de inclusión incluyen factores clínicos para la presencia y ausencia de la enfermedad; Se tienen en cuenta los datos demográficos, incluyendo género, edad y población local. Además, los datos se recogieron con consentimiento informado. La edad y el género se incluyen como posibles características en el conjunto de características, como se menciona a continuación. Sin embargo, los análisis explícitos basados en la edad y el género no están en el ámbito del estudio y se mantienen como trabajo futuro.
El conjunto de datos se almacena como valores numéricos. La columna "Clase" contiene los valores 0 y 1, donde 0 representa el "paciente normal" y 1 representa el "paciente asma".
En este sentido, se utilizaron los siguientes diecisiete atributos:
Clase: (0 = "Normal", 1 = "Paciente con asma")
1. edad en años (EDAD)
2. género (1 = hombre, 0 = mujer): GÉNERO
3. Basófilos (BASO)
4. Eosinófilos (EOS)
5. Hematócrito (HCT)
6. Hemoglobina (HGB)
7. Linfocitos (LYM)
8. Hemoglobina corpuscular media (MCH)
9. Concentración media de hemoglobina corpuscular (MCHC)
10. Volumen corpuscular medio (MCV)
11. Monócitos (MONO)
12. Volumen medio de plaquetas (MPV)
13. Función de los neutrófilos (NEUT)
14. Recuento de plaquetas (PLATELET_COUNT)
15. Recuento de glóbulos rojos (glóbulos rojos)
16. Ancho de distribución de glóbulos rojos (RDW)
17. Glóbulos blancos (glóbulos blancos)
Características estadísticas del conjunto de datos
Para una mejor comprensión, un análisis estadístico del conjunto de datos se muestra en las tablas38 siguientes. La Tabla 3 muestra los valores media, mediana, desviación estándar, máximo y mínimo para el conjunto de datos en cuestión.
| Promedio | Mediana | Desviación estándar | Max | Min |
| EDAD | 39.1 | 36 | 18.136 | 93 | 2 |
| GÉNERO | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| MONO | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Clase | 0.5 | 0.5 | 0.5008 | 1 | 0 |
Tabla 3: Características estadísticas del conjunto de datos. Esta tabla muestra las características estadísticas de los datos.
Además, la Tabla 4 muestra el coeficiente de correlación obtenido entre cada atributo y el atributo de clase. Sus valores están entre 0 (menos correlacionado) y 1 (más correlacionado). Se añade como un análisis estadístico preliminar para explicar los atributos del conjunto de datos. El MPV, el género, el HGB, el MCHC y la edad están entre las características más significativas.
| Pares de atributos | Coeficiente de correlación |
| EDAD | 0.212473 |
| GÉNERO | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| MONO | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Clase | 1 |
Tabla 4: Correlación con el atributo de clase. Esta tabla muestra la correlación entre los atributos (características) y el atributo de clase.
Montaje experimental
En el estudio actual, se utiliza el lenguaje de programación Python para preprocesar el conjunto de datos recopilado. Debido a un error humano, faltan valores específicos durante la introducción y selección de datos. Se han utilizado técnicas de imputación para manejar los valores ausentes en el conjunto de datos. Se hace reemplazando los valores faltantes por el promedio del atributo. Debido a su simplicidad, compatibilidad de modelos y conservación de los valores medios muestrales, tal como se ha discutido con los profesionales sanitarios. Además, la selección de características se realiza utilizando coeficientes de correlación para clasificar los atributos. Las características con valores de correlación más altos se seleccionaron para su análisis junto con el conjunto completo de características. Se han utilizado bibliotecas de Python para la implementación del enfoque propuesto, el ajuste de hiperparámetros y la obtención de resultados. La selección y eliminación de características se realizaban mediante un método de selección de atributos para identificar los grupos de características con mayor precisión. Además, Python se utilizó para evaluar la precisión mediante métodos de validación cruzada de 10 veces y evaluación de la Proporción de Partición Directa, según lo especificado en las ecuaciones39,40. Finalmente, se calculó la media de todos los resultados de los métodos de evaluación para comparar los métodos utilizados y determinar el método con la mejor precisión media38. Además, se generaron matrices de confusión utilizando los parámetros óptimos de SVM, ANN, RF y NB. Después, se realizó una comparación de falsos positivos (FP), falsos negativos (FN), verdaderos positivos (TP) y verdaderos negativos (TN) mediante el cálculo de la puntuación F1, que es una medida eficiente para comparar el mejor método41,42.
Métricas de evaluación
Para evaluar el rendimiento del enfoque propuesto, se consideran cuatro métricas de rendimiento bien conocidas. Concretamente, precisión, recalle y puntuación F1. La precisión de la clasificación es la medida principal porque se calcula el porcentaje de instancias correctamente clasificadas para cada instancia. La precisión es el número total de puntos de TP esperados. La llamada es el número de TP más que cada positivo real. Rendimiento en la puntuación F1 de cada clase. Según la capacidad de los resultados, se obtienen las siguientesmétricas 43,44,45:
Positivo verdadero (TP): Resultado de un diagnóstico correcto de asma.
Falso positivo (FP): Resultado de un diagnóstico incorrecto de asma.
Negativo verdadero (TN): Resultado de casos correctos diagnosticados como no asma.
Falso negativo (FN): Resultado de ser diagnosticado incorrectamente como no asma.
(4)
(5)
(6)
Estrategia de optimización
Para determinar los parámetros óptimos para cada uno de los enfoques propuestos, se empleó la técnica de búsqueda en cuadrícula. Los valores posibles de parámetros específicos se colocan en el método de búsqueda en cuadrícula. Por tanto, puede desarrollar el mejor rendimiento posible para mejorar la precisión.
Las figuras 5–7 muestran el resultado de la técnica de búsqueda en cuadrícula para los cuatro enfoques propuestos y el procedimiento de implementación en el conjunto de datos, con la ayuda de los dieciocho atributos principales. La Figura 5 presenta las precisiones de SVM obtenidas con varios valores de parámetro. Los valores de entrada para el Coste y el Gamma correspondientes a múltiples tipos de núcleos son los siguientes:
Tipos de núcleo: Lineal, Radial, Sigmoide y Polinomio.
Gamma: 0,001 y 0,0001.
Coste: 1, 10, 100 y 1000.

Figura 5: SVM con diferentes tipos de coste y gamma. Esta figura demuestra el comportamiento de SVM con diferentes tipos de coste y gamma. Abreviaturas; SVM = máquina de vectores de soporte. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Para la RF, los valores de entrada sistemáticamente indicados en la Figura 6 son los siguientes:
Los nombres de los parámetros, junto con sus respectivos valores, se proporcionan a continuación:
Número de características: 'auto', 'sqrt'.
Profundidad máxima: 1, 3, 5, 7.
Muestras MIN divididas: 2, 3, 4, 5.
Hojas de muestra MIN: 2, 3, 4, 5.

Figura 6: RF con diferentes valores de profundidad y hojas mínimas de muestra. Esta figura muestra el comportamiento de la RF con diferentes profundidades y valores mínimos de hojas muestrales. Abreviaturas; RF = bosque aleatorio. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Para el ANN, los valores analíticos de entrada se indican en la Figura 7.
Los nombres de los parámetros, junto con sus respectivos valores, son los siguientes:
Tamaños de capas ocultas: (50, 50, 50), (50, 100, 50) y (100,).
Activación: 'tanh' y 'relu'.
Solucionador: 'sgd' y 'adam'.
Alfa: 0,1, 0,01, 0,001, 0,0001, 0,5, 0,005, 0,0005 y 0,05.
Tasa de aprendizaje: 'constante' y 'adaptativa'.

Figura 7: ANN con diferentes valores alfa y tamaños de capa ocultos. Esta figura muestra el comportamiento de la RNA con diferentes valores alfa y tamaños ocultos de capa. Abreviaturas; ANN = red neuronal artificial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Clasificador | Parámetro | Valor |
| SVM | Gamma | 0.0001 |
| Tipo de núcleo | 'RBF' |
| Coste 'C" | 10 |
| Estado aleatorio | 42 |
| RF | Profundidad máxima | 3 |
| Muestras mínimas de hojas | 2 |
| División mínima de muestras | 2 |
| Estado aleatorio | 42 |
| ANN | Activación | 'relu' |
| Alfa | 0.001 |
| Tamaño de la capa oculta | (50,50,50) |
| Tasa de aprendizaje | 'constante' |
| solucionador | 'Adam' |
| Estado aleatorio | 42 |
Tabla 5: Resumen de los parámetros óptimos para los clasificadores propuestos. Esta tabla resume los parámetros óptimos obtenidos para los clasificadores propuestos.