$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio utilizó un conjunto de datos anonimizado disponible públicamente; por lo tanto, no se requirió consentimiento informado. El enfoque propuesto consta de seis componentes: preprocesamiento, módulo de convolución, módulo de atención, integración de módulos de convolución y atención, y capas completamente conectadas (FC). La Figura 1 ilustra el flujo de trabajo completo de nuestro método.
Adquisición de datos
Las imágenes de resonancia magnética cerebral etiquetadas se obtuvieron de un conjunto de datos Kaggle disponible públicamente que comprende cuatro categorías de tumores y tejido normal.
Preprocesamiento de datos
Las imágenes se redimensionan a una resolución uniforme y se normalizan la intensidad. Se aplica una mejora opcional (rotación, volteo, zoom) para mejorar la generalización. El conjunto de datos se divide en conjuntos de entrenamiento (70%) y prueba (30%).
Arquitectura del modelo
Se utilizaron tres CNN de red de neuronas preentrenadas en ImageNet—MobileNetV2, EfficientNetV1 e Inception-ResNet-V2—para clasificar tumores cerebrales en cuatro categorías utilizando imágenes de resonancia magnética. MobileNetV2 y EfficientNetV1 se configuraron con una dimensión de entrada de 224 × 224 píxeles, mientras que Inception-ResNet-V2 requirió un tamaño de entrada de 299 × 299 píxeles. En el proceso de aprendizaje por transferencia, las capas convolutionales iniciales se congelaron al principio para retener características de imagen generalizadas, mientras que las capas superiores se ajustaron para adaptar el modelo para la clasificación de tumores cerebrales. Cada red principal se emparejó con una cabeza de clasificación ligera que incluía Global Average Pooling, capas densas, dropout para regularización y una función de activación Softmax para predecir cuatro clases. El dropout se implementó para mitigar el sobreajuste y mejorar la generalización. La arquitectura diseñada fusionó eficazmente la extracción de características eficientes con demandas computacionales más bajas, facilitando una clasificación precisa mientras permanecía adecuada para su implementación en escenarios con recursos limitados y de prueba de concepto.
Extracción de características basada en atención
Las imágenes de entrada se procesan a través de una capa convolutional inicial seguida de un módulo de atención personalizado. El agrupamiento máximo y promedio paralelo captura características salientes y contextuales, que se concatenan y refinan mediante convolución para enfatizar las regiones relevantes para el tumor.
Base convolutional y fusión
Las características ponderadas por atención se envían a redes base preentrenadas (MobileNetV2, EfficientNetV1 o Inception-ResNet-V2). Las capas convolutionales de alto nivel se fusionan lógicamente para reducir el acceso a la memoria y mejorar la eficiencia computacional.
Clasificación
Las características aplanadas pasan por capas completamente conectadas con activación ReLU6 y dropout, produciendo una representación compacta para la clasificación final de cuatro clases softmax.
Evaluación
El rendimiento del modelo se evalúa en el conjunto de prueba utilizando precisión, exactitud, recuperación, F1-score y matrices de confusión.
Desarrollo del marco
La solución propuesta se implementa en Python y utiliza Keras para la ejecución. La Tabla 1 ilustra los hiperparámetros. El conjunto de datos se divide en un conjunto de entrenamiento y un conjunto de prueba siguiendo una proporción de 70:30. Se utilizan cinco divisiones arbitrarias diferentes de entrenamientos/pruebas para mostrar el rendimiento equilibrado final para cada conjunto de datos.
Preprocesamiento
Las imágenes de entrada deben actualizarse porque el marco MobileNetV2 sirve como base para la solución propuesta. Para extraer características de alta resolución de fotografías, se utiliza el modelo MobileNetV2 preentrenado con su dimensión de entrada. Cada imagen de entrada se escala luego a 224×224 píxeles en el rango [-1, 1].
El modelo convolutional
MobileNetV2 mejora el reconocimiento de imágenes al aprovechar una arquitectura eficiente de Red Neuronal Convolutional (CNN) diseñada para minimizar las demandas computacionales. Si bien las CNN tradicionales logran una alta precisión, a menudo requieren una cantidad sustancial de memoria y potencia de procesamiento. MobileNetV1 introdujo el concepto de convolución separable por profundidad, que separa la convolución estándar en dos operaciones distintas: convolución por profundidad para filtrar entradas y convolución puntual para integrar características. MobileNetV2 se basa en esta idea incorporando bloques residuales de cuello de botella que consisten en capas de expansión, convolución por profundidad, capas de proyección y conexiones residuales. La capa de proyección comprime los canales de características, mientras que las conexiones residuales facilitan un mejor flujo de información en toda la red. Para mejorar la estabilidad y mejorar el rendimiento de aprendizaje, se aplican la función de activación ReLU6 y la normalización por lotes después de las operaciones convolutionales.
En esta investigación, MobileNetV2, preentrenado en ImageNet, se utilizó como modelo base para extraer características, proporcionando representaciones semánticas de alto nivel efectivas mientras se mantienen bajos los costos computacionales para la clasificación de tumores cerebrales. Después de cada capa convolutional, hay una capa de activación ReLU6, que es una adaptación de la función de activación ReLU, donde el tamaño se maximiza en seis, y una capa de normalización por lotes. La convolución común de 1x1, el agrupamiento promedio y las capas de clasificación se aplican a 17 de los bloques de cuello de botella restantes, formando la arquitectura completa de MobileNetV2. Utilizamos MobileNetV2 como red base preentrenada en ImageNet. En tal caso, el mapa convolutional se obtiene del último bloque residual después de pasar por la capa convolutional de MobileNetV2. Los bloques residuales de nivel inferior producen mapas de características más pequeños. Dichos bloques no contribuyen a nuestra investigación porque no recopilan datos de alto nivel para la identificación general de la imagen. Durante la construcción y el entrenamiento del modelo, las capas que preceden a las capas convolutionales que generan un mapa de características 3D de 7 × 7 se mantienen fijas. En términos matemáticos, esto se expresa como se indica a continuación en la Eq (1):
F1(I) = Conv(I) (1)
Aquí, F1(I) representa la característica convolutional extraída de la imagen de entrada, I.
El módulo de enfoque
El mecanismo de atención del cerebro humano, que implica que las personas se enfocan naturalmente más en los inputs visuales significativos que en cada detalle de una imagen, sirve como base para el diseño de esta red de transformación. Se han creado numerosos modelos basados en atención en la investigación de aprendizaje profundo debido a esta idea. El mecanismo de atención propuesto destaca las correlaciones espaciales observadas en las representaciones de tumores cerebrales. Mientras que el módulo de atención de canal captura la información más importante relacionada con el tumor a través de los canales de características, la unidad de atención regional identifica las regiones más informativas de la imagen de resonancia magnética. Mediante un método de atención estructurada, la unidad de enfoque propuesta se centra en áreas que contienen información discriminativa del tumor.
Para mejorar la representación de características, se utilizan técnicas como Top Activation Pooling y extracción de características equilibrada antes de la fase de detección de características espaciales. Esta estrategia mejora la capacidad del modelo para enfatizar las regiones tumorales clínicamente significativas mientras se minimizan los detalles irrelevantes del fondo, mejorando así la precisión de la clasificación y la eficiencia del aprendizaje de características. La segunda es la concatenación de los tensores agrupados máximos y promedio. Por último, la función de activación sigma, combinada con un filtro convolutional de 7x7, se