Method Article

Framework de aprendizaje por transferencia guiado por atención para la clasificación de tumores cerebrales de cuatro clases mediante resonancia magnética

DOI:

10.3791/69087

July 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un marco de aprendizaje profundo basado en atención ligero para la clasificación de tumores cerebrales de cuatro clases a partir de imágenes de resonancia magnética utilizando aprendizaje transferido con MobileNetV2, EfficientNetV1 e Inception-ResNet-V2. El modelo logra una alta precisión de clasificación con una complejidad computacional reducida, lo que respalda las aplicaciones de soporte para la toma de decisiones clínicas con recursos limitados.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El objetivo de esta investigación es desarrollar un marco de aprendizaje profundo liviano pero preciso para clasificar tumores cerebrales en cuatro categorías—gliomas, meningiomas, tumores hipofisarios y tejido cerebral sano—utilizando datos de imágenes de resonancia magnética (IRM). La metodología propuesta combina el aprendizaje transferido con tres modelos de red neuronal convolucional preentrenados—MobileNetV2, EfficientNetV1 e Inception-ResNet-V2—integrados con un mecanismo de atención que emula la capacidad del sistema visual humano para enfocarse en regiones clínicamente relevantes de una imagen. Este enfoque guiado por la atención mejora la localización del tumor mientras suprime información de fondo irrelevante. El marco se evalúa en un gran conjunto de datos de IRM cerebrales públicamente disponible que contiene miles de imágenes etiquetadas en las cuatro clases. Se emplean procedimientos estándar de preprocesamiento, aumento de datos y protocolos de entrenamiento para permitir una replicación directa del método propuesto. Los resultados experimentales demuestran que EfficientNetV1 logra el mejor rendimiento de clasificación, alcanzando una precisión superior en comparación con MobileNetV2 e Inception-ResNet-V2. El estudio concluye que el marco basado en atención y liviano propuesto equilibra eficazmente la precisión y la complejidad computacional, haciéndolo altamente adecuado para aplicaciones de atención médica en tiempo real y móvil, particularmente en entornos con recursos limitados.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

La clasificación precisa de los tumores cerebrales mediante imágenes de resonancia magnética (IRM) juega un papel fundamental en el diagnóstico clínico, la planificación del tratamiento y la estimación del pronóstico1. Los tumores cerebrales, incluidos el glioma, el meningioma y los tumores hipofisarios, presentan características patológicas y respuestas al tratamiento distintas; por lo tanto, la identificación temprana y confiable es esencial para mejorar los resultados terapéuticos y reducir la progresión de la enfermedad. La IRM es ampliamente preferida para la evaluación de tumores cerebrales debido a su excelente contraste de tejidos blandos, naturaleza no invasiva y capacidad para visualizar la morfología del tumor en múltiples planos anatómicos. Sin embargo, la interpretación manual de las imágenes de resonancia magnética suele ser lenta y depende en gran medida de la experiencia radiológica, especialmente cuando los límites del tumor son irregulares o cuando existen similitudes visuales entre las clases de tumores. En consecuencia, los sistemas automatizados de diagnóstico asistido por computadora se han vuelto cada vez más importantes para ayudar a los radiólogos en la clasificación precisa y eficiente de los tumores.

Las técnicas de análisis de imágenes basadas en el aprendizaje profundo (DL) han avanzado significativamente la clasificación automatizada de enfermedades en aplicaciones biomédicas y de visión por computadora2,3. En neuro-oncología, las técnicas de aprendizaje automático y de transferencia han demostrado un rendimiento prometedor para tareas de detección, segmentación y clasificación de tumores4. Las redes neuronales convolucionales (CNN), en particular, han mostrado una capacidad superior para extraer automáticamente características jerárquicas de imágenes directamente de las imágenes de resonancia magnética sin depender de la ingeniería de características manual. Las arquitecturas de CNN pueden aprender representaciones discriminativas relacionadas con tumores a partir de datos de imágenes, mejorando así el rendimiento de la clasificación en comparación con los enfoques de aprendizaje automático convencionales. Los avances recientes en DL han permitido el desarrollo de sistemas de clasificación de imágenes de alto rendimiento capaces de procesar conjuntos de datos de imágenes a gran escala con mayor precisión y menos intervención humana.

A pesar de estos avances, las arquitecturas de CNN profundas convencionales a menudo requieren recursos computacionales sustanciales, incluida una alta consumo de memoria, mayor complejidad de parámetros y un tiempo de entrenamiento extenso5. Tales demandas computacionales limitan su implementación en entornos clínicos con recursos limitados y sistemas de salud móviles. Además, las arquitecturas de redes neuronales convolucionales ligeras han atraído una atención creciente debido a su complejidad computacional reducida y su idoneidad para su implementación en aplicaciones con recursos limitados5. Varios estudios recientes han explorado estrategias de CNN optimizadas, mecanismos eficientes de extracción de características y marcos de implementación ligera para mejorar la eficiencia de la clasificación sin comprometer significativamente la precisión predictiva6,7,8. Sin embargo, equilibrar la eficiencia computacional con un rendimiento robusto de clasificación de múltiples clases de tumores sigue siendo un desafío importante en el análisis de tumores cerebrales basado en IRM9.

Los marcos de aprendizaje profundo basados en atención han surgido como soluciones efectivas para mejorar la representación de características en el análisis de imágenes médicas10. Los mecanismos de atención permiten que las redes neuronales enfaticen selectivamente las regiones de la imagen diagnósticamente relevantes mientras suprimen la información de fondo irrelevante. Inspirados en el sistema visual humano, las arquitecturas guiadas por la atención mejoran el aprendizaje de características discriminativas al dirigir el enfoque computacional hacia regiones espaciales específicas del tumor y características contextuales. Dichos mecanismos son particularmente beneficiosos para el análisis de imágenes de resonancia magnética de tumores cerebrales porque los tejidos tumorales frecuentemente presentan patrones de intensidad heterogéneos, morfología irregular y características visuales superpuestas entre categorías de tumores. En consecuencia, la integración de módulos de atención en arquitecturas basadas en CNN puede mejorar la precisión de la clasificación y mejorar el rendimiento de localización de características.

Varios estudios recientes han demostrado el potencial de los marcos de DL para el diagnóstico automatizado de tumores cerebrales y la clasificación de tumores basada en IRM11,12. Gao et al. desarrollaron y validaron un modelo de DL para el diagnóstico de tumores cerebrales utilizando datos de IRM, demostrando una fuerte capacidad de clasificación para el análisis automatizado de neuroimágenes11. De manera similar, Abdusalomov et al. investigaron enfoques de detección de tumores cerebrales basados en DL utilizando imágenes de resonancia magnética e informaron un rendimiento diagnóstico prometedor12. Aunque estos estudios lograron una mayor precisión de clasificación, las limitaciones relacionadas con la diversidad del conjunto de datos, la generalización del modelo y los requisitos computacionales siguen sin resolverse. En muchos casos, los conjuntos de datos de entrenamiento eran de tamaño limitado o se derivaban de fuentes clínicas restringidas, lo que aumentaba el riesgo de sobreajuste y reducía la robustez en poblaciones heterogéneas de pacientes.

Para mejorar la visualización y la extracción de características de los tumores, también se han explorado técnicas de análisis y reconstrucción multimodal de IRM13,14. Sun et al. investigaron la evaluación de gliomas basada en IRM multimodal utilizando un marco de reconstrucción de aprendizaje profundo combinado con estrategias de eliminación de ruido13. Su trabajo demostró la importancia de la mejora de la calidad de la imagen para mejorar la precisión de detección de gliomas. De manera similar, Srinivas y Rao propusieron un marco de segmentación basado en DL para el análisis de subregiones de tumores cerebrales en IRM multimodal14. Su enfoque mejoró la delineación de las subregiones del tumor y contribuyó a la planificación del tratamiento individualizado. Sin embargo, los marcos multimodales generalmente requieren un procesamiento extensivo, mayores recursos computacionales y un registro preciso de imágenes entre modalidades de imagen, lo que puede limitar su aplicabilidad en entornos clínicos prácticos.

También se han propuesto métodos de fusión multimodal guiados por atención para mejorar la precisión de la segmentación y la integración de características de IRM15,16,17,18. Zhou et al. introdujeron un marco de fusión basado en mecanismos de atención para la segmentación multimodal de tumores cerebrales15. El estudio demostró un mejor rendimiento de segmentación mediante el aprendizaje de características contextuales; sin embargo, el enfoque se centró principalmente en la segmentación en lugar de la clasificación ligera de tumores. De manera similar, Zhou y Du propusieron una red multimodal 3D para la reconstrucción acelerada de IRM16, mientras que Huang et al. desarrollaron AMF-Net, una red de fusión adaptativa de multisecuencia para el diagnóstico de tumores cerebrales por IRM17. Zhou et al. propusieron además MLMFNet para la reconstrucción acelerada de IRM multimodal18. Aunque estos métodos mejoraron la calidad de la reconstrucción y la capacidad de fusión de características, dependían en gran medida de múltiples modalidades de IRM, arquitecturas profundas y operaciones de fusión computacionalmente costosas. Tales requisitos pueden reducir su viabilidad para la implementación en sistemas de salud con recursos limitados y plataformas de diagnóstico basadas en bordes.

Estudios adicionales han investigado marcos de DL específicamente para clasificar glioma, meningioma y tumores hipofisarios utilizando imágenes de IRM19. Mokri et al. desarrollaron un sistema de clasificación basado en DL para identificar tres tipos principales de tumores cerebrales

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó un conjunto de datos anonimizado disponible públicamente; por lo tanto, no se requirió consentimiento informado. El enfoque propuesto consta de seis componentes: preprocesamiento, módulo de convolución, módulo de atención, integración de módulos de convolución y atención, y capas completamente conectadas (FC). La Figura 1 ilustra el flujo de trabajo completo de nuestro método.

Adquisición de datos
Las imágenes de resonancia magnética cerebral etiquetadas se obtuvieron de un conjunto de datos Kaggle disponible públicamente que comprende cuatro categorías de tumores y tejido normal.

Preprocesamiento de datos
Las imágenes se redimensionan a una resolución uniforme y se normalizan la intensidad. Se aplica una mejora opcional (rotación, volteo, zoom) para mejorar la generalización. El conjunto de datos se divide en conjuntos de entrenamiento (70%) y prueba (30%).

Arquitectura del modelo
Se utilizaron tres CNN de red de neuronas preentrenadas en ImageNet—MobileNetV2, EfficientNetV1 e Inception-ResNet-V2—para clasificar tumores cerebrales en cuatro categorías utilizando imágenes de resonancia magnética. MobileNetV2 y EfficientNetV1 se configuraron con una dimensión de entrada de 224 × 224 píxeles, mientras que Inception-ResNet-V2 requirió un tamaño de entrada de 299 × 299 píxeles. En el proceso de aprendizaje por transferencia, las capas convolutionales iniciales se congelaron al principio para retener características de imagen generalizadas, mientras que las capas superiores se ajustaron para adaptar el modelo para la clasificación de tumores cerebrales. Cada red principal se emparejó con una cabeza de clasificación ligera que incluía Global Average Pooling, capas densas, dropout para regularización y una función de activación Softmax para predecir cuatro clases. El dropout se implementó para mitigar el sobreajuste y mejorar la generalización. La arquitectura diseñada fusionó eficazmente la extracción de características eficientes con demandas computacionales más bajas, facilitando una clasificación precisa mientras permanecía adecuada para su implementación en escenarios con recursos limitados y de prueba de concepto.

Extracción de características basada en atención
Las imágenes de entrada se procesan a través de una capa convolutional inicial seguida de un módulo de atención personalizado. El agrupamiento máximo y promedio paralelo captura características salientes y contextuales, que se concatenan y refinan mediante convolución para enfatizar las regiones relevantes para el tumor.

Base convolutional y fusión
Las características ponderadas por atención se envían a redes base preentrenadas (MobileNetV2, EfficientNetV1 o Inception-ResNet-V2). Las capas convolutionales de alto nivel se fusionan lógicamente para reducir el acceso a la memoria y mejorar la eficiencia computacional.

Clasificación
Las características aplanadas pasan por capas completamente conectadas con activación ReLU6 y dropout, produciendo una representación compacta para la clasificación final de cuatro clases softmax.

Evaluación
El rendimiento del modelo se evalúa en el conjunto de prueba utilizando precisión, exactitud, recuperación, F1-score y matrices de confusión.

Desarrollo del marco
La solución propuesta se implementa en Python y utiliza Keras para la ejecución. La Tabla 1 ilustra los hiperparámetros. El conjunto de datos se divide en un conjunto de entrenamiento y un conjunto de prueba siguiendo una proporción de 70:30. Se utilizan cinco divisiones arbitrarias diferentes de entrenamientos/pruebas para mostrar el rendimiento equilibrado final para cada conjunto de datos.

Preprocesamiento
Las imágenes de entrada deben actualizarse porque el marco MobileNetV2 sirve como base para la solución propuesta. Para extraer características de alta resolución de fotografías, se utiliza el modelo MobileNetV2 preentrenado con su dimensión de entrada. Cada imagen de entrada se escala luego a 224×224 píxeles en el rango [-1, 1].

El modelo convolutional
MobileNetV2 mejora el reconocimiento de imágenes al aprovechar una arquitectura eficiente de Red Neuronal Convolutional (CNN) diseñada para minimizar las demandas computacionales. Si bien las CNN tradicionales logran una alta precisión, a menudo requieren una cantidad sustancial de memoria y potencia de procesamiento. MobileNetV1 introdujo el concepto de convolución separable por profundidad, que separa la convolución estándar en dos operaciones distintas: convolución por profundidad para filtrar entradas y convolución puntual para integrar características. MobileNetV2 se basa en esta idea incorporando bloques residuales de cuello de botella que consisten en capas de expansión, convolución por profundidad, capas de proyección y conexiones residuales. La capa de proyección comprime los canales de características, mientras que las conexiones residuales facilitan un mejor flujo de información en toda la red. Para mejorar la estabilidad y mejorar el rendimiento de aprendizaje, se aplican la función de activación ReLU6 y la normalización por lotes después de las operaciones convolutionales.

En esta investigación, MobileNetV2, preentrenado en ImageNet, se utilizó como modelo base para extraer características, proporcionando representaciones semánticas de alto nivel efectivas mientras se mantienen bajos los costos computacionales para la clasificación de tumores cerebrales. Después de cada capa convolutional, hay una capa de activación ReLU6, que es una adaptación de la función de activación ReLU, donde el tamaño se maximiza en seis, y una capa de normalización por lotes. La convolución común de 1x1, el agrupamiento promedio y las capas de clasificación se aplican a 17 de los bloques de cuello de botella restantes, formando la arquitectura completa de MobileNetV2. Utilizamos MobileNetV2 como red base preentrenada en ImageNet. En tal caso, el mapa convolutional se obtiene del último bloque residual después de pasar por la capa convolutional de MobileNetV2. Los bloques residuales de nivel inferior producen mapas de características más pequeños. Dichos bloques no contribuyen a nuestra investigación porque no recopilan datos de alto nivel para la identificación general de la imagen. Durante la construcción y el entrenamiento del modelo, las capas que preceden a las capas convolutionales que generan un mapa de características 3D de 7 × 7 se mantienen fijas. En términos matemáticos, esto se expresa como se indica a continuación en la Eq (1):

F1(I) = Conv(I)      (1)

Aquí, F1(I) representa la característica convolutional extraída de la imagen de entrada, I.

El módulo de enfoque
El mecanismo de atención del cerebro humano, que implica que las personas se enfocan naturalmente más en los inputs visuales significativos que en cada detalle de una imagen, sirve como base para el diseño de esta red de transformación. Se han creado numerosos modelos basados en atención en la investigación de aprendizaje profundo debido a esta idea. El mecanismo de atención propuesto destaca las correlaciones espaciales observadas en las representaciones de tumores cerebrales. Mientras que el módulo de atención de canal captura la información más importante relacionada con el tumor a través de los canales de características, la unidad de atención regional identifica las regiones más informativas de la imagen de resonancia magnética. Mediante un método de atención estructurada, la unidad de enfoque propuesta se centra en áreas que contienen información discriminativa del tumor.

Para mejorar la representación de características, se utilizan técnicas como Top Activation Pooling y extracción de características equilibrada antes de la fase de detección de características espaciales. Esta estrategia mejora la capacidad del modelo para enfatizar las regiones tumorales clínicamente significativas mientras se minimizan los detalles irrelevantes del fondo, mejorando así la precisión de la clasificación y la eficiencia del aprendizaje de características. La segunda es la concatenación de los tensores agrupados máximos y promedio. Por último, la función de activación sigma, combinada con un filtro convolutional de 7x7, se

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tres modelos de aprendizaje profundo preentrenados, a saber, MobileNetV2, EfficientNetV1 e Inception-ResNet-V2, se evaluaron para la clasificación de tumores cerebrales de cuatro clases utilizando imágenes de resonancia magnética.

Conjunto de datos utilizado
El marco propuesto se evaluó utilizando un conjunto de datos de resonancia magnética de tumores cerebrales disponible públicamente obtenido de la plataforma Kaggle. El conjunto de datos constaba de 835 imágenes de resonancia magnética de cerebros normales, 826 imágenes de glioma, 822 imágenes de meningioma e 827 imágenes de tumores hipofisarios. Se muestran muestras representativas de MRI del conjunto de datos en la Figura 2.

MobileNetV2
El modelo MobileNetV2 contenía 2,263,108 parámetros totales, incluyendo 2,228,996 entrenables y 34,112 no entrenables. Los indicadores de rendimiento de clasificación se presentan en la Tabla 2. El modelo alcanzó una precisión de clasificación general del 97%, con puntuaciones F1 macro y ponderadas comparables. La matriz de confusión que se muestra en la Tabla 3 demuestra un fuerte rendimiento de clasificación en todas las cuatro categorías de tumores, con relativamente pocas clasificaciones erróneas entre glioma y meningioma.

La Figura 3 presenta las curvas de precisión/pérdida de entrenamiento y validación para MobileNetV2. El modelo demostró una convergencia estable después de varios ciclos de entrenamiento, con un rendimiento de validación que mejora gradualmente.

Inception-ResNet-V2
El modelo Inception-ResNet-V2 tenía 54,342,884 parámetros totales, incluyendo 54,282,340 entrenables y 60,544 no entrenables. Los indicadores de clasificación se resumen en la Tabla 4. El modelo alcanzó una precisión de clasificación general del 98%, demostrando un mejor rendimiento en comparación con MobileNetV2.

La matriz de confusión en la Tabla 5 indica una alta precisión de clasificación en todas las categorías de tumores con tasas de clasificación errónea reducidas. Se observó una mejor discriminación entre las clases de tumor en comparación con el modelo MobileNetV2. La Figura 4 ilustra las curvas de rendimiento de entrenamiento y validación para Inception-ResNet-V2. El modelo exhibió un comportamiento de aprendizaje estable y una convergencia constante a lo largo de los ciclos de entrenamiento.

EfficientNetV1
El modelo EfficientNetV1 contenía 6,580,363 parámetros totales, incluyendo 6,518,308 entrenables y 62,055 no entrenables. Los indicadores de clasificación resumidos en la Tabla 6 demuestran el mejor rendimiento entre los modelos evaluados, logrando aproximadamente un 99% de precisión, exactitud, recuperación y puntuación F1.

La matriz de confusión en la Tabla 7 demuestra un fuerte rendimiento de clasificación en todas las cuatro clases de tumores, con una mínima clasificación errónea. El modelo clasificó correctamente la mayoría de las imágenes de glioma, meningioma, sin tumor e hipofisiario.

La Figura 5 presenta las curvas de precisión/pérdida de entrenamiento y validación para EfficientNetV1. El modelo alcanzó una convergencia estable con menores fluctuaciones de validación en comparación con las otras arquitecturas evaluadas.

Comparación general
Entre los modelos evaluados, EfficientNetV1 logró el mejor rendimiento de clasificación manteniendo una menor complejidad computacional que Inception-ResNet-V2. MobileNetV2 demostró un rendimiento ligero eficiente con requisitos de parámetros reducidos, mientras que Inception-ResNet-V2 logró una mejor precisión de clasificación a costa de una complejidad de modelo sustancialmente mayor. Los resultados indican que EfficientNetV1 proporciona el mejor equilibrio entre precisión de clasificación y eficiencia computacional para la clasificación de tumores cerebrales de cuatro clases con imágenes de resonancia magnética.

Disponibilidad de datos
El conjunto de datos de resonancia magnética cerebral analizado en este estudio está disponible públicamente a través de la plataforma Kaggle. Todos los datos generados y analizados durante este estudio, incluyendo resultados de clasificación, métricas de rendimiento, matrices de confusión y resultados de entrenamiento/validación, se presentan en las figuras y tablas de este artículo. El código personalizado utilizado para el desarrollo y la evaluación del modelo está disponible por parte del autor correspondiente previa solicitud razonable.

Figura 1
Figura 1: Marco de aprendizaje por transferencia guiado por la atención para la clasificación de tumores cerebrales de cuatro clases. El flujo de trabajo ilustra el preprocesamiento, la extracción de características basada en la atención, el aprendizaje de características convolucionales, la fusión de características y las capas de clasificación completamente conectadas utilizadas para la clasificación de tumores basada en resonancia magnética. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2
Figura 2: Imágenes de resonancia magnética representativas del conjunto de datos de tumores cerebrales de cuatro clases.
Se presentan muestras de escaneos de resonancia magnética correspondientes a clases de glioma, meningioma, tumor hipofisario y cerebro normal utilizadas para el entrenamiento y la evaluación del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3
Figura 3: Curvas de precisión/pérdida de entrenamiento y validación para MobileNetV2. Los gráficos demuestran el comportamiento de convergencia de MobileNetV2 durante el entrenamiento, incluidos los cambios en la precisión de clasificación y la pérdida a lo largo de los ciclos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4
Figura 4: Curvas de precisión/pérdida de entrenamiento y validación para Inception-ResNet-V2. Los gráficos ilustran el rendimiento de aprendizaje y la estabilidad de convergencia del modelo Inception-ResNet-V2 durante el entrenamiento y la validación.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

La evaluación del rendimiento, basada en precisión, recuperación, puntuación F1 y exactitud, revela que tanto MobileNetV2 como Inception-ResNet-V2 logran resultados comparables en la clasificación de tumores cerebrales, alcanzando cada uno una exactitud global y media ponderada del 97-98%. En contraste, EfficientNet supera a los otros modelos, logrando un 99% de exactitud en métricas macro y media ponderada, gracias a su mejora en la generalización y estrategia de escalado compuesto. Estos hallazgos son consistentes con estudios anteriores que demuestran la eficacia de las arquitecturas EfficientNet para la clasificación de tumores por RMN multiclase y el aprendizaje de características computacionalmente eficiente22. De manera similar, los marcos MobileNetV2 basados en transferencia de aprendizaje han demostrado anteriormente un rendimiento sólido en tareas de clasificación de tumores cerebrales ligeras mientras mantienen una complejidad computacional menor21.

El mejor rendimiento de EfficientNetV1 puede atribuirse a su escalado equilibrado de la profundidad de la red, el ancho y la resolución de entrada, lo que permite una extracción eficiente de características discriminativas relacionadas con el tumor. Observaciones comparables sobre las ventajas de las estrategias de escalado compuesto se han reportado en estudios anteriores de optimización de CNN7,8. Además, la integración del módulo de extracción de características guiado por atención probablemente contribuyó a una mejor localización de las regiones relevantes del tumor al suprimir la información de fondo irrelevante, lo que se alinea con los hallazgos de estudios de clasificación de imágenes médicas basados en atención10,15.

A pesar de estos resultados, quedan varios desafíos en la clasificación de tumores cerebrales, incluyendo la diferenciación precisa de tumores irregulares, la segmentación de subrregiones más allá del núcleo del tumor y la clasificación precisa entre diversos tipos de tejido cerebral. Estudios anteriores han destacado de manera similar limitaciones relacionadas con la diversidad del conjunto de datos, la capacidad de generalización y la complejidad computacional en los sistemas de clasificación de tumores basados en RMN9,11,12. Además, los marcos de RMN multimodales han demostrado una mejor representación de características y visualización de tumores, aunque estos métodos a menudo requieren un precprocesamiento extenso y mayores recursos computacionales13,17,18,20.

La Tabla 8 muestra un análisis consolidado de validación cruzada de MobileNetV2, Inception-ResNet-V2 y EfficientNetV1 con validación de 5 divisiones. La tabla presenta la media y la desviación estándar de exactitud, precisión, recuperación y puntuación F1, junto con las exactitudes por división. MobileNetV2 muestra un rendimiento estable pero comparativamente menor, mientras que Inception-ResNet-V2 mejora tanto la exactitud como la consistencia. EfficientNetV1 alcanza la mayor exactitud media (0,989 ± 0,003) con la menor varianza, lo que indica una excelente capacidad de generalización. Sus exactitudes por división constantemente altas (0,986-0,992) demuestran un rendimiento robusto y estable a través de múltiples divisiones de datos, estableciéndolo como el modelo más eficaz para la clasificación de tumores cerebrales de cuatro clases por RMN en este estudio.

Limitaciones del estudio
La evaluación actual del marco se basa únicamente en la ampliación de datos en línea, lo que puede limitar su robustez para manejar una mayor variabilidad de datos en escenarios del mundo real. Además, el estudio explora principalmente la extracción de características de las capas convolutivas finales, sin evaluar los posibles beneficios de incorporar la fusión de características de múltiples capas. La investigación también se limita a conjuntos de datos de RMN estáticos y no ha sido validada en un flujo de trabajo clínico en vivo, lo que puede presentar desafíos de integración.

Direcciones de investigación futura
El trabajo futuro debe explorar la agregación de características de múltiples capas de MobileNetV2 y otros backbones para mejorar aún más la precisión de la clasificación. Extender el marco para admitir datos de imágenes multimodales y validar su rendimiento en entornos clínicos en tiempo real fortalecerá su aplicabilidad práctica. Además, la optimización de la arquitectura para su implementación en plataformas móviles y de IoT, junto con técnicas avanzadas de ampliación y conjuntos de datos de pacientes del mundo real, puede permitir diagnósticos de tumores cerebrales escalables y de alto rendimiento en diversos entornos de atención médica.

Conclusión
Este estudio presenta un marco ligero de transferencia de aprendizaje guiado por atención para la clasificación de tumores cerebrales de cuatro clases utilizando imágenes de RMN. Al aprovechar la transferencia de aprendizaje con MobileNetV2, EfficientNetV1 e Inception-ResNet-V2, el modelo logra una alta exactitud manteniendo la eficiencia computacional, lo que lo hace potencialmente adecuado para entornos clínicos con recursos limitados. Los experimentos en un conjunto de datos de RMN equilibrado de cuatro clases demuestran que EfficientNetV1 ofrece los mejores resultados, logrando un 99% de exactitud, precisión, recuperación y puntuación F1. La arquitectura propuesta equilibra eficazmente el rendimiento y el uso de recursos, ofreciendo un enfoque prometedor para escenarios de imágenes médicas con recursos limitados.

```

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

No se recibió financiación externa para este estudio.

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
Brain MRI DatasetIEEEhttps://dx.doi.org/10.21227/q2vt-tf46El conjunto de datos se descarga con acceso del instituto. El conjunto de datos de resonancia magnética contiene cuatro clases: glioma, meningioma, tumor hipofisario y cerebro normal
Acelerador CNN (Fusión de capas)Trabajo propuestoFusión lógica de las capas convolucionales superiores para reducir el acceso a la memoria y mejorar la eficiencia computacional
Módulo de atención personalizadaTrabajo propuestoMecanismo de atención que integra max-pooling y average-pooling para enfatizar las regiones relevantes del tumor
EfficientNetV1GooglePre-entrenado (ImageNet)Arquitectura de CNN escalable que proporciona un equilibrio óptimo entre precisión y eficiencia
Google ColaboratoryGooglehttps://colab.research.google.com/Entorno basado en la nube utilizado para el entrenamiento de modelos, evaluación y experimentación con soporte GPU
Inception-ResNet-V2GooglePre-entrenado (ImageNet)Arquitectura CNN híbrida profunda que combina módulos Inception con conexiones residuales
KerasGooglev2.6.0API de red neuronal de alto nivel construida sobre TensorFlow para el rápido prototipado de modelos
MatplotlibMatplotlib Developersv3.4.3Biblioteca de visualización utilizada para trazar curvas de entrenamiento, matrices de confusión y métricas de rendimiento
MobileNetV2GooglePre-entrenado (ImageNet)Estructura base de CNN ligera optimizada para implementación móvil y en el borde
NumPyNumPy Developersv1.21.4Biblioteca principal de computación científica utilizada para operaciones numéricas
PandasPandas Development Teamv1.3.4Biblioteca de manejo y manipulación de datos utilizada para la organización del conjunto de datos y el procesamiento de metadatos
PythonPython Software Foundationv3.8.10Lenguaje de programación principal utilizado para el preprocesamiento de datos, desarrollo de modelos y evaluación
Scikit-learnScikit-learn DevelopersLatest stableUtilizado para métricas de evaluación de rendimiento como precisión, recall, F1-score y matrices de confusión
SeabornSeaborn DevelopersLatest stableBiblioteca de visualización estadística de alto nivel utilizada para un análisis gráfico mejorado
TensorFlowGooglev2.6.0Marco de trabajo de aprendizaje profundo de extremo a extremo utilizado para implementar estructuras base CNN y módulos de atención
```

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cancer ResearchMobileNetV2EfficientNetV1Inception ResNet V2transfer learningbrain tumor

Related Articles