La enfermedad más amenazante en el mundo es el tumor cerebral. Un diagnóstico preciso puede beneficiar la supervivencia de los pacientes. Sin embargo, existe la necesidad de un sistema diagnóstico exacto que pueda detectar tumores cerebrales en una etapa temprana. Para abordar este problema, se ha propuesto una técnica más confiable para detectar con precisión tumores cerebrales en sus etapas iniciales, utilizando un mecanismo híbrido de aprendizaje profundo dual con hiperparámetros optimizados y capas ajustadas finamente basadas en los modelos DenseNet121 y EfficientNetB7. El enfoque propuesto toma imágenes de resonancia magnética 2D como entrada y genera una predicción de presencia o ausencia de tumor para el conjunto de datos de clasificación binaria Br35H, y la categorización del tumor para otros cuatro conjuntos de datos de clasificación multiclase. Por lo tanto, esta sección demuestra los pasos principales del enfoque propuesto, desde la recolección de datos hasta la salida final, incluyendo la adquisición de datos, el preprocesamiento de datos, la división de datos, la selección del modelo, la extracción de características, la predicción del tumor y la evaluación del modelo propuesto, como se muestra en Figura 1.

Figura 1: Flujo de trabajo de la metodología propuesta. Este diagrama muestra la arquitectura general del modelo propuesto, incluyendo la adquisición y el preprocesamiento de datos; dos modelos previamente entrenados para la extracción de características; la concatenación de sus características; y el ajuste fino de hiperparámetros para la clasificación y tipo de tumor. Haga clic aquí para ver una versión más grande de esta figura.
Adquisición de datos
En cualquier investigación experimental, el primer paso es la adquisición de datos. Para ello, se han seleccionado cinco conjuntos de datos diferentes disponibles públicamente, incluyendo Br35H24, Figshare25, Sartaj26, Masoud27 y el conjunto de datos basado en imágenes de resonancia magnética de tumores cerebrales de la biblioteca de código abierto Kaggle28, que ya han sido utilizados por muchos investigadores para el diagnóstico de detección de tumores cerebrales. El conjunto de datos Br35H tiene 3.000 imágenes que comprenden dos clases: imágenes de cerebro sanas y no sanas (con tumor), con 1.500 imágenes en cada clase, mientras que el conjunto de datos Figshare comprende 3.064 imágenes, divididas en tres grupos según el tipo de tumor: 1.426 imágenes de glioma, 708 imágenes de meningioma y 930 imágenes de tumores pituitarios. El conjunto de datos Sartaj tiene 3.264 imágenes categorizadas en cuatro clases de tumores: gliomas (926 imágenes), meningiomas (937 imágenes), tumores pituitarios (901 imágenes) y sin tumor o saludables (500 imágenes). Además, el conjunto de datos Masoud también comprende cuatro clases diferentes de tumores, y sus imágenes fueron tomadas de los tres conjuntos de datos anteriormente mencionados, con un total de 7023 imágenes, que se categorizan además en glioma (con 1621 imágenes), meningioma (con 1645 imágenes), pituitario (con 1757 imágenes) y saludable o sin tumor (con 2000 imágenes). El último conjunto de datos seleccionado es un conjunto de datos basado en imágenes de resonancia magnética, que también comprende cuatro clases con un total de 5248 imágenes, que se dividen además en tipos de tumores, incluyendo 1312 imágenes de glioma, 1312 imágenes de meningioma, 1312 imágenes de pituitario y 1312 imágenes de cerebro sano o sin tumor, que ya están divididas equitativamente según los tipos de tumor y se considera un conjunto de datos equilibrado.
Preprocesamiento de datos
Después de la adquisición de datos, el siguiente paso es el preprocesamiento, que es esencial para obtener mejores resultados y resulta más útil para los enfoques computacionales a fin de extraer y aprender las mejores características a partir de los datos, produciendo resultados más precisos. El primer paso aplicado fue el cambio de tamaño de las imágenes. Se seleccionaron cinco conjuntos de datos disponibles públicamente con diferentes clases y tamaños de imagen, incluso dentro del mismo conjunto de datos, para distintas clases de tumores, y todos fueron redimensionados uniformemente a 224 x 224 para mejorar la interpretación y el aprendizaje del modelo. Además, se aplicó aumentación de datos a todos los conjuntos de datos generando muestras adicionales desde diferentes ángulos, mejorando así la extracción de características y el aprendizaje por parte de los modelos de aprendizaje profundo (DL). Para ello, se aplicó un rango de rotación del 7 % a todas las imágenes, rotándolas hasta 7 grados. Asimismo, se aplicó un desplazamiento aleatorio del 5 % a todas las imágenes en sentido horizontal y vertical, con un desplazamiento del 5 % en altura y anchura respecto a las imágenes originales. A continuación, las imágenes se acercaron (zoom) en un 10 % respecto a las imágenes originales, y finalmente, todas las imágenes se voltearon horizontal y verticalmente. La razón principal para realizar la aumentación de datos29 es superar el sobreajuste y mejorar la generalización de los modelos mediante el entrenamiento con diversas versiones transformadas de las muestras de datos originales. Antes de dividir los conjuntos de datos en entrenamiento y validación, se aplicó codificación de etiquetas, lo cual es más útil para calcular la pérdida durante el entrenamiento y la validación, además de hacer que las muestras de datos sean más adecuadas para que los modelos procesen correctamente las etiquetas. Adicionalmente, el conjunto de datos se dividió en conjuntos de entrenamiento y validación, con una proporción del 80 % para entrenamiento y del 20 % para validación30, y Tabla 2 muestra la distribución general de las muestras de datos y sus proporciones de entrenamiento y validación.
| Conjunto de datos | Clases de tumor | Imágenes totales | Imágenes de entrenamiento | Imágenes de validación |
| Br35H | Sano | 1500 | 1200 | 300 |
| Tumor | 1500 | 1200 | 300 |
| Imágenes totales | 3000 | 2400 | 600 |
| Figshare | Glioma | 1426 | 1141 | 285 |
| Meningioma | 708 | 566 | 142 |
| Pituitario | 930 | 744 | 186 |
| Imágenes totales | 3064 | 2451 | 613 |
| Sartaj | Glioma | 926 | 741 | 185 |
| Meningioma | 937 | 749 | 188 |
| Sin tumor | 500 | 400 | 100 |
| Pituitario | 901 | 721 | 180 |
| Imágenes totales | 3264 | 2611 | 653 |
| Masoud | Glioma | 1621 | 1297 | 324 |
| Meningioma | 1645 | 1316 | 329 |
| Sin tumor | 2000 | 1600 | 400 |
| Pituitario | 1757 | 1405 | 352 |
| Imágenes totales | 7023 | 5618 | 1405 |
| Conjunto de datos equilibrado de tumores cerebrales (BBT-Dataset) | Glioma | 1312 | 1050 | 262 |
| Meningioma | 1312 | 1050 | 262 |
| Sin tumor | 1312 | 1050 | 262 |
| Pituitario | 1312 | 1050 | 262 |
| Imágenes totales | 5248 | 4200 | 1048 |
Tabla 2: Distribución del conjunto de datos. La tabla muestra estadísticas por clase sobre el número total de imágenes, así como las cantidades de imágenes de entrenamiento y validación en los conjuntos de datos de tumores cerebrales..
El conjunto de datos Br35H consta de 3000 imágenes, de las cuales 2400 se seleccionaron para entrenamiento y 600 para validación. El conjunto de datos Figshare comprende 3064 imágenes. De todas las imágenes, 2451 se seleccionaron para entrenamiento y las restantes 613 para validación. El conjunto de datos Sartaj tiene un total de 3264 imágenes, de las cuales 2611 se utilizaron para entrenamiento y las restantes 653 para validación. El conjunto de datos Masoud tiene un total de 7023 imágenes; de estas, 5618 se utilizaron para entrenamiento y las restantes 1405 para validación. El conjunto de datos BBT tiene un total de 5248 imágenes. De todas las imágenes, 4200 se consideraron para fines de entrenamiento, mientras que las otras 1048 imágenes restantes se consideraron para fines de validación. Además, Figura 2 a continuación ilustra las diversas imágenes de tumores cerebrales.

Figura 2: Imágenes de tumores cerebrales, incluyendo tipos de tumores. El conjunto de datos contiene cuatro imágenes de tejido cerebral sano y tres imágenes tumorales: glioma, meningioma e hipófisis. Haga clic aquí para ver una versión más grande de esta figura.
Modelo propuesto
Tras la etapa de preprocesamiento, el siguiente paso consiste en proponer un modelo de entrenamiento eficaz únicamente para la clasificación de tumores cerebrales. Para ello, se ha propuesto un modelo eficiente de entrenamiento, diseñado específicamente para clasificar tumores cerebrales. En este sentido, se presenta un modelo novedoso y eficiente basado en fusión híbrida de características previamente entrenado, que incluye DenseNet12131,32 y EfficientNetB733, los cuales se utilizaron para extraer características de las imágenes; posteriormente, dichas características extraídas se concatenaron y se introdujeron en diferentes hiperparámetros ajustados finamente, incluyendo capas entrenables y no entrenables, con el fin de diagnosticar tumores cerebrales con precisión. Este enfoque se ha implementado en cinco conjuntos de datos diferentes disponibles públicamente, que fueron discutidos en las secciones relacionadas anteriores. Además, el modelo DenseNet121 fue desarrollado por Gao Huang y sus colaboradores en 2017 y consta de 121 capas. El objetivo principal de este modelo fue centrarse en maximizar el reuso de características y evitar el problema del gradiente que desaparece34. Las capas de este modelo están organizadas en bloques densos, cada uno compuesto por múltiples capas convolucionales que extraen y aprenden características. Cada capa toma el mapa de características de todas las capas anteriores como entrada, y su salida se conecta con las salidas de esas capas y se transmite como entrada a las capas siguientes dentro del mismo bloque de manera feed-forward. Además, se añaden capas de transición entre los bloques densos, cada una compuesta por una capa convolucional 1 × 1, una capa de normalización por lotes (BatchNormalization) y capas de agrupamiento promedio (pooling) de 2 × 2, que reducen el mapa de características para controlar la complejidad del modelo. Asimismo, se añade una capa final con una función de activación SoftMax (AF) antes de una capa de agrupamiento promedio global para la clasificación. El diseño fundamental del modelo DenseNet121 se muestra en Figura 334 a continuación.

Figura 3: Detalle arquitectónico de DenseNet12134. Esta figura muestra el detalle arquitectónico del modelo DenseNet121, incluyendo todos los bloques densos y de transición. Haga clic aquí para ver una versión más grande de esta figura.
Además, el modelo EfficientNetB7 fue inventado por Tan y Lee en 2019. Pertenece a la familia EfficientNet, con variantes desde B0 hasta B7, y su objetivo principal es superar a otros modelos utilizando menos parámetros y menor potencia de procesamiento. La anchura del modelo (número de canales por capa), profundidad (número de capas) y resolución pueden ajustarse mediante escalado compuesto, que es la característica principal del modelo. Además, este modelo consta de bloques MBConv (convolución con cuello de botella invertido móvil), que incluyen una capa de expansión convolucional de 1 × 1 encargada de ampliar los canales, una convolución separable por profundidad responsable de aplicar la convolución a cada canal por separado, y una capa de proyección convolucional de 1 × 1 que reduce el número de canales al original. Asimismo, cada bloque MBConv incluye bloques de Compresión y Excitación (Squeeze and Excitation, SE)35, que recalibran las características por canal, ayudando a la red a enfocarse en las más importantes. Además, en lugar de la función sigmoide o cualquier otra FA, se utiliza la función Swish, que tiene un mejor desempeño que ReLU al permitir valores negativos, lo cual favorece el flujo del gradiente. Por otra parte, se añade una capa de salida final con una FA SoftMax antes de una capa de agrupamiento promedio global para fines de clasificación. Figura 435 muestra el diseño básico del modelo EfficientNetB7, mientras que Figura 5 muestra la arquitectura del modelo recomendada.

Figura 4: Detalle arquitectónico de EfficientNetB735. Esta figura muestra el detalle arquitectónico del modelo EfficientNetB7, incluyendo todos los bloques convolucionales invertidos de cuello de botella móviles. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Arquitectura propuesta del modelo híbrido fusionado. La arquitectura propuesta ilustra cómo las imágenes preprocesadas se envían al extractor de características, que consta de tres bloques personalizados con diferentes hiperparámetros, seguidos por una capa de salida. Haga clic aquí para ver una versión más grande de esta figura.
Además, primero se extrajeron características de los modelos previamente entrenados DenseNet121 y EfficientNetB7. Los pesos actualizados de los modelos previamente entrenados se cargaron en los modelos entrenados, y se congelaron las capas base no entrenables de los modelos para evitar que el modelo se volviera a entrenar. Esto debería ayudar al modelo a conservar sus mejores conocimientos previos, adaptarlos a la luz de nuevas muestras de datos para mejorar la convergencia y centrarse en las capas adicionales para entrenarlas y extraer características avanzadas. Las ecuaciones 1 y 2 siguientes muestran el funcionamiento de los modelos DenseNet121 y EfficientNetB7.
(1)
(2)
Las ecuaciones 1 y 2 anteriores muestran el funcionamiento del modelo previamente entrenado en cuanto a la extracción de características; F1 denota los mapas de características de salida producidos por el modelo DenseNet121 previamente entrenado y F2 denota los mapas de características de salida producidos por el modelo EfficientNetB7 previamente entrenado al aplicar procesamiento a las imágenes de entrada, representadas por X. Además, W1 y W2 son los parámetros entrenables o pesos asociados con los primeros bloques y capas de los modelos DenseNet121 y EfficientNetB7, respectivamente. Asimismo, ∈ RN ×H1×W1×C1 y ∈ RN ×H2×W2×C2 representan la dimensionalidad de los mapas de características de salida de los modelos DenseNet121 y EfficientNetB7, respectivamente, con dimensiones de H1 ×N×W1×C1 y H2 ×N×W2×C2, donde N representa el tamaño del lote de imágenes, que se consideró igual a 16. Además, H1×W1 representa la altura y anchura de las imágenes, respectivamente, para el modelo DenseNet121, y H2×W2 representa la altura y anchura de las imágenes para el modelo EfficientNetB7, seleccionadas con tamaños de 224 × 224. C1 y C2 representan el canal de color para los modelos DenseNet121 y EfficientNetB7, respectivamente. Tras obtener los mapas de características de salida del modelo, con 2560 canales de EfficientNetB7 y 1024 de DenseNet121, se aplica la capa de agrupamiento promedio global 2D36 a los mapas de características de salida para reducir la dimensión espacial mediante el cálculo del promedio de todas las dimensiones espaciales en un único vector, lo cual resulta más conveniente para transmitirlo a la siguiente capa y así mejorar la extracción de características y el reconocimiento de patrones en términos de características interpretables.
(3)
(4)
Las ecuaciones anteriores 3 y 4 muestran el funcionamiento de la capa de agrupamiento promedio global 2D aplicada a los modelos DenseNet121 y EfficientNetB7, respectivamente, donde
y
muestran el procedimiento de normalización de la suma mediante la división entre el número total de ubicaciones espaciales para ambos modelos, asegurando que la salida agrupada sea un promedio y no una suma simple.
y
representan la sumatoria a través de las dimensiones espaciales de los mapas de características, mientras que i y j simplemente indican la iteración sobre la altura y el ancho, respectivamente, para sumar los mapas de características en ambos modelos. Además, F1(i, j, :) y F2(i, j, :) representan los valores de los mapas de características en posiciones espaciales específicas (i, j) a través de todos los canales para los modelos DenseNet121 y EfficientNetB7, respectivamente. Esta operación de agrupamiento agrega información espacial en una representación más compacta y precisa, conservando las características más importantes de cada imagen. Además, las salidas de las capas de agrupamiento promedio global se concatenan para producir un único vector de características para cada muestra, lo cual se utiliza frecuentemente para fusionar características de diferentes modelos y mejorar el rendimiento aprovechando las fortalezas de ambos; la ecuación 5 muestra cómo funciona este proceso.
(5)
La ecuación 5 anterior muestra el procedimiento de concatenación de dos vectores de características de modelos diferentes [G1, G2], donde G1 representa el vector de características del modelo DenseNet121 y G2 representa el vector de características del modelo EfficientNetB7, mientras que la forma del vector de características concatenado se representa mediante RN ×(C1+ C2), donde N es el tamaño del lote, que representa el número de muestras que se procesan en paralelo, y (C1+ C2) es el número total de características obtenidas de los modelos 1 y 2, respectivamente, que suman aproximadamente 3584, las cuales se procesan en paralelo, y el vector de características de salida concatenado se representa mediante G. Además, se han añadido tres bloques diferentes para modificar el modelo fusionado con el fin de extraer características más complejas, mejorar la generalización y prevenir el sobreajuste, todo ello para obtener resultados más precisos y eficientes. Cada bloque está compuesto por una capa densa con un número distinto de neuronas: el primer bloque tiene 1024 neuronas en su capa densa, lo que permite capturar una amplia gama de características y patrones más genéricos en los datos; el segundo bloque tiene 512 neuronas en su capa densa, que refinan específicamente las características al reducir la dimensionalidad y centrarse en patrones más específicos. El tercer bloque contiene 256 neuronas en su capa densa, que destilan aún más las características para asegurar que solo las características y patrones más relevantes se transmitan a la capa de salida y realicen una tarea más pertinente. Además, se aplican enfoques de regularización L237 a cada capa densa en cada bloque para prevenir el sobreajuste mediante la penalización de pesos mayores, lo cual también incrementa la complejidad del modelo. Se introduce asimismo una capa de dropout38 después de cada bloque para ignorar aleatoriamente el 30 %, 20 % y 10 % de las neuronas en los bloques 1, 2 y 3, respectivamente, lo que obliga a las redes a desarrollar características más robustas que no dependan de una única neurona. Además, para estabilizar el proceso de entrenamiento, se aplica una capa de BatchNormalization39 tras cada capa densa, lo que garantiza que las activaciones permanezcan dentro de un rango estable y también ayuda al modelo a evitar problemas como el gradiente que desaparece o el gradiente que explota durante la fase de entrenamiento. Adicionalmente, esta capa de BatchNormalization acelera también el proceso de entrenamiento, permitiendo que el modelo converja más rápidamente al suavizar el paisaje de la función de pérdida, lo que facilita que los optimizadores alcancen mínimos globales. Finalmente, en cada bloque, para generar no linealidad, se utiliza la activación leaky ReLU40, que permite al modelo aprender patrones complejos, y leaky ReLU presenta ventajas frente a otras funciones de activación al garantizar que la neurona no quede inactiva, permitiendo un pequeño gradiente distinto de cero para entradas negativas. Además, la ecuación 6 siguiente muestra el funcionamiento de los diferentes bloques integrados en el modelo híbrido fusionado.
(6)
Después de obtener el vector concatenado, G pasa por la capa densa (totalmente conectada) del bloque 1 con 1024 neuronas, donde la matriz de pesos W1 transforma el vector de entrada G en un vector de salida de 1024 dimensiones y cada elemento del vector de salida es una combinación lineal de las características de entrada. Además, al vector de sesgo b1 se le suma a cada uno de los 1024 elementos del vector de salida, lo que permite al modelo desplazar la salida de las características de entrada de forma independiente. Asimismo, el término de regularización L2: λ||W1||22 penaliza los pesos grandes, lo que desincentiva al modelo a depender excesivamente de una sola neurona, ayudando así a evitar el sobreajuste. Donde la matriz de pesos de una capa determinada es W1 en la red neuronal, mientras que ||W1||22 denota la norma L2 al cuadrado de la matriz de pesos W1 y λ es el parámetro de regularización que controla el grado de regularización aplicado, el cual se ha establecido en 0,1 en todos los bloques. Z1 se convierte en la nueva representación de características tras aplicar la capa densa así como la regularización L2 a la entrada proveniente del vector concatenado G, como se muestra en la ecuación 6.
Después de obtener la salida de la capa densa del bloque 1 como Z1, se aplicó la capa BatchNormalization, que se utilizó para acelerar el proceso de entrenamiento, y la ecuación 7 siguiente muestra cómo funciona.
(7)
σ2 representa la varianza de la salida de la última capa Z1 a través del lote, mientras que μ es la media de la salida Z1, que se calcula por separado para cada neurona, siendo 1024 en la primera capa densa. Por otro lado, ε es una constante pequeña que se incorpora para garantizar la estabilidad numérica y evitar la división por cero. La salida normalizada puede ajustarse mediante el modelo al modificar el parámetro de escala aprendible γ, mientras que la salida normalizada puede desplazarse mediante el parámetro de desplazamiento aprendible β. Finalmente, tras aplicar la capa de normalización por lotes (BatchNormalization) a la salida de la capa densa, la salida normalizada Z1 asegura que las activaciones tengan una distribución consistente a través de las diferentes capas, lo que ayuda a estabilizar y acelerar el entrenamiento. Tras la normalización por lotes, la salida normalizada Z1 pasa a través de la función de activación ReLU con fugas (leaky ReLU), que introduce no linealidad en la red y permite aprender patrones complejos en los datos. En lugar de elegir ReLU u otra función de activación, se optó por leaky ReLU, que es una versión modificada de la función ReLU que considera también pequeños valores negativos en lugar de convertirlos en 0 como hace la función de activación ReLU, superando así el problema de la neurona ReLU muerta. La ecuación 8 que aparece a continuación muestra cómo funciona.
(8)
Donde Z1 pertenece a la salida de la capa de normalización por lotes, que se transmite a Leaky ReLU como entrada para realizar la no linealidad, mientras que ∝ es una constante pequeña que se utiliza para determinar la pendiente de la parte negativa de la función. Además, A1 muestra la salida obtenida tras aplicar la no linealidad. Finalmente, se aplica una capa de dropout a la salida A1 recibida como entrada desde la activación Leaky ReLU, lo cual se muestra en la ecuación 9.
(9)
Donde A1 es la salida original de la función de activación recibida de la última función de activación ReLu, y donde p es la tasa de dropout, que varía entre 0 y 1 y se ha seleccionado como 0,3, 0,2 y 0,1 para tres capas de bloques, respectivamente, con el fin exclusivo de descartar una fracción de neuronas. Además, A1′ muestra la salida modificada tras aplicar la capa de dropout, en la cual algunas neuronas se han establecido en 0. La principal ventaja de utilizarla es prevenir problemas de sobreajuste, así como reducir la co-adaptación. Asimismo, la salida del bloque1 A1′ se transfiere al siguiente bloque nuevamente para extraer características más abstractas, aplicando los mismos parámetros que en el bloque 1, con la diferencia de contar con 512 neuronas en la capa densa en lugar de 1024 y una tasa de dropout de 0,2 en lugar de 0,3; las demás secuencias operativas son idénticas, tal como se describe en las ecuaciones 10 a 13 siguientes.
(10)
(11)
(12)
(13)
Después de obtener la salida del bloque 1 como A1′, que pasa por la capa densa (totalmente conectada) del bloque 2 con 512 neuronas, donde la matriz de pesos W2 transforma el vector de entrada A1′ en un vector de salida de 512 dimensiones, y cada elemento del vector de salida es una combinación lineal de las características de entrada. Además, al sesgo b2 se le suma a cada uno de los 512 elementos del vector de salida, lo que permite al modelo desplazar la salida de las características de entrada de forma independiente. Asimismo, se aplica regularización L2, donde: λ||W2||22 penaliza los pesos grandes, lo cual sirve para mitigar el sobreajuste al impedir que el modelo dependa excesivamente de alguna neurona particular en este bloque específico. Aquí, W2 es la matriz de pesos de una capa determinada en la red neuronal, mientras que λ es el parámetro de regularización que controla el grado de regularización aplicado, establecido en 0,1. Z2 se convierte en la nueva representación de características tras aplicar la capa densa y la regularización L2 a la entrada procedente del bloque 1, como se muestra en la ecuación 10.
Además, se aplicó la capa de normalización por lotes al nuevo atributo Z2, lo cual se utilizó para acelerar el proceso de entrenamiento; σ22 representa la varianza a través del lote, mientras que μ2 es la media de la salida Z2. Aunque ε es una constante pequeña incorporada para garantizar la estabilidad numérica, γ es un parámetro de escala aprendible que permite al modelo modificar la salida normalizada, y β es un parámetro de desplazamiento aprendible que permite al modelo trasladar la salida normalizada. Finalmente, tras aplicar la capa de normalización por lotes, que se muestra en la ecuación 11, la salida normalizada Z2 pasó a través de la función de activación ReLU con fugas, lo cual introdujo no linealidad en la red, como se muestra en la ecuación 12. Donde Z2 corresponde a la salida de la capa de normalización por lotes, que se introduce como entrada en ReLU con fugas para generar la no linealidad. Mientras tanto, A2 muestra la salida obtenida tras aplicar la no linealidad.
Finalmente, se aplica una capa de dropout a la salida A2 recibida como entrada desde la activación Leaky ReLU, lo cual se muestra en la ecuación 13. Donde A2 es la salida recibida de la última función de activación ReLU, y donde p2 es la tasa de dropout, que se ha seleccionado como 0,2 para este bloque, simplemente para descartar una fracción de neuronas. Además, A2′ muestra la salida modificada tras aplicar la capa de dropout, en la cual algunas neuronas se han establecido en 0. Posteriormente, la salida del bloque 2, A2′, se transfiere al tercer bloque nuevamente para extraer características aún más abstractas, aplicando los mismos parámetros que en el bloque 2, con la diferencia de contar con 256 neuronas en la capa densa en lugar de 512 y una tasa de dropout de 0,1 en lugar de 0,2; el resto de las secuencias operativas son iguales, como se describe en las ecuaciones siguientes 14 a 17.
(14)
(15)
(16)
(17)
Después de obtener la salida del bloque 2 como A2′, que pasa por la capa densa (totalmente conectada) del bloque 3 con 256 neuronas, donde la matriz de pesos W3 transforma el vector de entrada A2′ en un vector de salida de 256 dimensiones, y cada elemento del vector de salida es una combinación lineal de las características de entrada. Además, al sesgo b3 se le suma a cada uno de los 256 elementos del vector de salida, lo que permite al modelo desplazar la salida de las características de entrada de forma independiente. Asimismo, se aplica regularización L2, donde: λ||W3||22 penaliza los pesos grandes, lo que desincentiva al modelo a depender excesivamente de una sola neurona, ayudando así a evitar el sobreajuste. Aquí, W3 es la matriz de pesos de una capa particular en la red neuronal, mientras que el grado de regularización empleado está controlado por el parámetro de regularización λ, que se ha establecido en 0,01. Z3 se convierte en la nueva representación de características tras aplicar la capa densa, así como la regularización L2, a la entrada proveniente del bloque 3, como se muestra en la ecuación 14.
Además, se aplicó la capa de normalización por lotes (BatchNormalization) a la nueva característica Z3, la cual se utilizó para acelerar el proceso de entrenamiento; σ32 representa la varianza a través del lote, mientras que μ3 es la media de la salida Z3. Asimismo, ε es una constante pequeña que se añade para garantizar la estabilidad numérica. La salida normalizada puede ajustarse mediante el parámetro de escala aprendible γ3 y desplazarse mediante el parámetro de traslación aprendible β3. Finalmente, tras aplicar la capa de normalización por lotes, que se muestra en la ecuación 15, la salida normalizada Z3 pasa a través de la función de activación ReLU con fugas (leaky ReLU), que introduce no linealidad en la red, como se muestra en la ecuación 16. Aquí, Z3 corresponde a la salida de la capa de normalización por lotes, que se introduce como entrada en Leaky ReLU para generar la no linealidad. Por su parte, A3 muestra la salida obtenida tras aplicar la no linealidad.
Finalmente, se aplica una capa de dropout a la salida A3 recibida como entrada desde la activación Leaky ReLU, lo cual se muestra en la ecuación 17. Donde A3 es la salida recibida de la última función de activación ReLU, y donde p3 es la tasa de dropout, que se ha seleccionado como 0,1 para este bloque, únicamente para anular una fracción de las neuronas. Además, A3′ muestra la salida modificada tras aplicar la capa de dropout, en la cual algunas neuronas se han establecido en 0.
Además, la salida del bloque 3 A3′ pasa a través de la última capa densa con fines de clasificación, con un número K de neuronas que representa el número real de clases en el conjunto de datos, lo cual se describe en la ecuación 18 a continuación.
(18)
La matriz de pesos asociada a la capa densa es Wk, que se encarga de transformar el vector de 256 dimensiones A3′ en un vector de k dimensiones, el cual representa las características aprendidas del bloque anterior y se obtiene como salida. Además, bk representa el vector de sesgo que ajusta la predicción para garantizar que la función de activación tenga una salida distinta de cero cuando la entrada es cero, y Zk es la salida de la capa final antes de aplicar la función de activación, generando los logit para cada clase. Finalmente, se ha aplicado un clasificador SoftMax41 que convierte el logit Zk en la probabilidad de cada clase, como se muestra en las ecuaciones 19 y 20.
(19)
(20)
Donde la probabilidad predicha de la clase iª está representada por yi, K es el número de clases, mientras que Zk, i es el logit para la clase iª, y eZk, i es la exponencial del logit de la clase iª. y muestra la distribución de probabilidad de todas las clases posibles y asegura que la suma de las probabilidades sea 1. Tabla 3 a continuación proporciona los detalles de los hiperparámetros utilizados para entrenar el modelo híbrido propuesto, incluyendo los detalles arquitectónicos adoptados para mejorar la reproducibilidad y el rendimiento.
| Parámetros hiper | Modelo propuesto (FusionNetX) |
| Tamaño de la imagen | 224 × 224 |
| Arquitectura del backbone | EfficientNetB7 y DenseNet121 preentrenados como BBA1 y BBA2 |
| Aumento de datos | Rango de rotación = 7, |
| Rango de desplazamiento de ancho/alto hasta 0.05, |
| Rango de zoom hasta 0.01, |
| Inversión horizontal/vertical |
| Relación de división de datos | 80 % para entrenamiento y 20 % para validación mediante muestreo estratificado con un estado aleatorio fijo = 42 |
| Extracción y fusión de características | Se aplica un agrupamiento promedio global en la salida de cada backbone: 2560 para BBA1 y 1024 para BBA2, y se fusionan para obtener vectores de características conjuntas de 3584. |
| Composición del bloque completamente conectado | 3 bloques completamente conectados con 1 capa de salida. Cada bloque contiene regularización L2 (λ=0,01), normalización por lotes, LeakyReLU (α=0,01), dropout de (0,3, 0,2 y 0,1) y dimensiones ocultas de (1024, 512 y 256) respectivamente. No se introducen conexiones de salto adicionales en la cabeza de fusión. |
| Función de activación | Leaky ReLU y SoftMax |
| Optimizador y tasa de aprendizaje | Adam con una tasa fija de 0,00001 sin planificador de tasa de aprendizaje. |
| Función de pérdida | sparse_categorical_crossentropy |
| Tamaño del lote | 16 |
| Épocas | 100 épocas fijas para cada conjunto de datos |
| Plataforma utilizada | Cuaderno de Kaggle con una GPU P100 y 16 GB de VRAM, utilizando las plataformas TensorFlow y Keras. |
Tabla 3: Hiperparámetros utilizados para entrenar el modelo propuesto y detalles arquitectónicos propuestos. Esta tabla proporciona los detalles estructurales y arquitectónicos del modelo propuesto, junto con los parámetros ajustados finamente y el entorno de implementación.