$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio utilizó un conjunto de datos anonimizado y disponible públicamente; por lo tanto, no se requería consentimiento informado. El enfoque propuesto consta de seis componentes: preprocesamiento, módulo de convolución, módulo de atención, integración de módulos de convolución y atención, y capas totalmente conectadas (FC). La Figura 1 ilustra el flujo de trabajo completo de nuestro método.
Adquisición de conjuntos de datos
Las imágenes etiquetadas de la resonancia magnética cerebral se obtienen de un conjunto de datos de Kaggle disponible públicamente que comprende cuatro categorías tumorales y tejido normal.
Preprocesamiento de datos
Las imágenes se redimensionan a una resolución uniforme y la intensidad normalizada. Se aplica una ampliación opcional (rotación, volteo, zoom) para mejorar la generalización. El conjunto de datos se divide en conjuntos de entrenamiento (70%) y de prueba (30%).
Arquitectura del modelo
Se utilizaron tres CNN de columna vertebral preentrenadas en ImageNet — MobileNetV2, EfficientNetV1 e Inception-ResNet-V2 — para clasificar tumores cerebrales en cuatro categorías mediante imágenes de resonancia magnética. MobileNetV2 y EfficientNetV1 estaban configurados con una dimensión de entrada de 224 × 224 píxeles, mientras que Inception-ResNet-V2 requería un tamaño de entrada de 299 × 299 píxeles. En el proceso de aprendizaje por transferencia, las capas convolucionales iniciales se congelaron al principio para conservar las características generales de la imagen, mientras que las capas superiores se ajustaron finamente para adaptar el modelo a la clasificación de tumores cerebrales. Cada columna vertebral se combinó con un cabezal de clasificación ligero que incluía Global Average Pooling, capas densas, dropout para regularización y una función de activación Softmax para predecir cuatro clases. El abandono se implementó para mitigar el sobreajuste y mejorar la generalización. La arquitectura diseñada combinó eficazmente la extracción eficiente de características con menores demandas computacionales, facilitando una clasificación precisa y siendo adecuada para su despliegue en escenarios con recursos limitados y pruebas de concepto.
Extracción de características basada en la atención
Las imágenes de entrada se procesan a través de una capa convolucional inicial seguida de un módulo de atención personalizado. El agrupamiento paralelo de max y el agrupamiento promedio capturan características salientes y contextuales, que se concatenan y refinan mediante convolución para enfatizar regiones relevantes para tumores.
Columna vertebral convolucional y fusión
Las características ponderadas en la atención se envían a esquemas preentrenadas (MobileNetV2, EfficientNetV1 o Inception-ResNet-V2). Las capas convolucionales de alto nivel se fusionan lógicamente para reducir el acceso a la memoria y mejorar la eficiencia computacional.
Clasificación
Las características aplanadas pasan a través de capas totalmente conectadas con activación y desaparición de ReLU6, produciendo una representación compacta para la clasificación final de softmax de cuatro clases.
Evaluación
El rendimiento del modelo se evalúa en el conjunto de pruebas utilizando matrices de precisión, precisión, recuerdo, puntuación F1 y confusión.
Desarrollo del marco
La solución propuesta está implementada en Python y utiliza Keras para su ejecución. La Tabla 1 ilustra los hiperparámetros. El conjunto de datos se divide en un conjunto de entrenamiento y un conjunto de prueba siguiendo una proporción 70:30. Se utilizan cinco divisiones arbitrarias diferentes de trenes/pruebas para mostrar el rendimiento equilibrado final de cada conjunto de datos.
Preprocesamiento
Las imágenes de entrada deben actualizarse porque el framework MobileNetV2 sirve como base para la solución propuesta. Para extraer características de alta resolución de fotografías, se utiliza el modelo preentrenado MobileNetV2 con su dimensión de entrada. Cada imagen de entrada se escala a 224×224 píxeles en el rango [-1, 1].
El modelo de convolución
MobileNetV2 mejora el reconocimiento de imágenes aprovechando una arquitectura eficiente de Red Neuronal Convolucional (CNN) diseñada para minimizar las demandas computacionales. Aunque las CNN tradicionales alcanzan una alta precisión, a menudo requieren una memoria y potencia de procesamiento considerables. MobileNetV1 introdujo el concepto de convolución separable en profundidad, que separa la convolución estándar en dos operaciones distintas: convolución en profundidad para filtrar entradas y convolución puntual para integrar características. MobileNetV2 desarrolla esta idea incorporando bloques residuales de cuello de botella que consisten en capas de expansión, convolución en profundidad, capas de proyección y conexiones residuales. La capa de proyección comprime los canales de características, mientras que las conexiones residuales facilitan un mejor flujo de información a lo largo de la red. Para mejorar la estabilidad y el rendimiento en el aprendizaje, se aplican activaciones y normalización por lotes de ReLU6 tras operaciones convolucionales.
En esta investigación, MobileNetV2, preentrenado en ImageNet, se utilizó como modelo principal para extraer características, proporcionando representaciones semánticas efectivas de alto nivel mientras mantenía bajos los costes computacionales para la clasificación de tumores cerebrales. Después de cada capa de convolución, hay una capa de activación de ReLU6, que es una adaptación de la función de activación de ReLU, donde el tamaño se maximiza en seis, y una capa de normalización por lotes. Las capas comunes de convolución 1x1, agrupación media y clasificación se aplican a 17 de los bloques restantes de cuello de botella, formando la arquitectura completa de MobileNetV2. Usamos MobileNetV2 como red troncal preentrenada en ImageNet. En tal caso, la aplicación convolucional se obtiene del último bloque residual tras pasar por la capa convolucional de MobileNetV2. Los bloques residuales de nivel inferior producen mapas de características más pequeños. Estos bloques no contribuyen a nuestra investigación porque no recogen datos de alto nivel para la identificación global de la imagen. Durante la construcción y entrenamiento del modelo, las capas anteriores a las capas convolucionales que generan un mapa de características 3D 7 × 7 se mantienen fijas. En términos matemáticos, esto se expresa de la siguiente manera en la Ecuación (1):
F1(I) = Conv(I) (1)
Aquí, F1(I) representa la característica convolucional extraída de la imagen de entrada, I.
El módulo de enfoque
El mecanismo de atención del cerebro humano, que implica que las personas se centran de forma natural más en los estímulos visuales significativos que en cada detalle de una imagen, sirve de base para el diseño de esta red de transformación. Se han creado numerosos modelos basados en la atención en la investigación en aprendizaje profundo gracias a esta idea. Las correlaciones espaciales observadas en las representaciones de tumores cerebrales se destacan con el mecanismo de atención sugerido. Mientras que el módulo de atención de canales captura la información tumoral más importante a través de los canales de características, la unidad regional de atención identifica las regiones más informativas de la imagen de la resonancia magnética. Utilizando un método de atención estructurada, la unidad de enfoque sugerida se centra en áreas que contienen información tumoral discriminativa.
Para mejorar la representación de características, se utilizan técnicas como el Top Activation Pooling y la extracción balanceada de características antes de la fase de detección espacial de características. Esta estrategia mejora la capacidad del modelo para enfatizar regiones tumorales clínicamente significativas minimizando los detalles de fondo irrelevantes, mejorando así la precisión de la clasificación y la eficiencia del aprendizaje de características. La segunda es la concatenación de los tensores agrupados máximo y agrupados en la media. Por último, la función de activación sigma, combinada con un filtro convolucional 7x7, se utilizará para activar estímulos visuales dentro de los visuales. Las diferentes etapas del módulo de enfoque se indican en las ecuaciones (2) y (3). donde Pool(F) ∈ RHxWx1 balanceado representa la operación media de pooling y MaxPool(F) ∈ RHxWx1 describe la operación de pooling máximo.
F2(I) = [Promedio de Pool(F); MaxPool (F)] (2)
Estos dos mapas de elementos pueden combinarse en 3D para crear un mapa de elementos
F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)
donde σ es la función de activación que indica sigma. Las características de atención, que se representan por un tensor codificado en altura (V), anchura (W) y grosor (C) codificados HxWxC, se representan por F3(I), mientras que f7x7 representa la operación de convolución de tamaño del filtro (7x7).
Fusión de la atención y un modelo de convolución
A diferencia de una red que depende de un único codificador, una Unidad de Fusión multimodal podría extraer información mucho más eficiente y completa para la gran mayoría de modalidades. El bloque de fusión está destinado a guiar hacia las máximas características esenciales cruzadas de modales; por lo tanto, señalará las áreas de atención para la extracción de la región tumoral. Se trata de una simple concatenación de representaciones latentes individuales, pero se perdería parte de la información. Así, se generó un mapa combinado de objetos combinando los mapas de características de los módulos de convolución y observación utilizando el método básico de concatenación de características de Sitaula et al. Estos dos mapas de características capturaron diferencias en varias propiedades de imagen, así que decidimos usar un método simple de concatenación en lugar de estrategias basadas en max, min o suma. Esto también lo hace computacionalmente más ligero que los métodos alternativos que utilizan métodos bilineales como forma de cálculo del producto tensorial. Cuando se combinan dos características, el resultante se denomina tensor de características. La expresión matemática de la salida tensorial agregada de caracteres T está dada por la Ecuación (4).
[F1(I), F3(I)] = T(I) (4)
Donde F1(I) ∈ RHxWx1 y F2(I) ∈ RHxWx1280. Estos son tensores 3D con el mismo ancho (W) y altura (H). Además, pueden concatenarse en la creación 3D k de tensores 3D, donde T(I) ∈ LxWx1281.
Capas totalmente conectadas (FC)
Utilizamos una serie de capas de FC tras la fusión de características para convertir un tensor volumétrico remodelado en un vector lineal de características. El cabezal de clasificación consta de una capa de Global Average Pooling, capas densas totalmente conectadas, regularización dropout y una capa de salida Softmax. Se utiliza la función de activación de ReLU6, con 128 unidades y una probabilidad de abandono del 50%.