Artículo de investigación

Marco de aprendizaje por transferencia guiada por atención para la clasificación de tumores cerebrales de cuatro clases mediante resonancia magnética

DOI:

10.3791/69087

10 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un marco ligero de aprendizaje profundo basado en la atención para la clasificación de tumores cerebrales de cuatro clases a partir de imágenes de resonancia magnética utilizando aprendizaje por transferencia con MobileNetV2, EfficientNetV1 e Inception-ResNet-V2. El modelo alcanza una alta precisión en la clasificación con una complejidad computacional reducida, apoyando aplicaciones de apoyo a la decisión clínica con recursos limitados.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El objetivo de esta investigación es desarrollar un marco de aprendizaje profundo ligero pero preciso para clasificar los tumores cerebrales en cuatro categorías: gliomas, meningiomas, tumores hipofisarios y tejido cerebral sano, utilizando datos de resonancia magnética (IRM). La metodología propuesta combina el aprendizaje por transferencia con tres modelos de redes neuronales convolucionales preentrenados —MobileNetV2, EfficientNetV1 e Inception-ResNet-V2— integrados con un mecanismo de atención que emula la capacidad del sistema visual humano para enfocarse en regiones clínicamente relevantes de una imagen. Este enfoque guiado por la atención mejora la localización tumoral mientras suprime información de fondo irrelevante. El marco se evalúa sobre un gran conjunto de datos de resonancia magnética cerebral de acceso público que contiene miles de imágenes etiquetadas a lo largo de las cuatro clases. Se emplean protocolos estándar de preprocesamiento, aumento de datos y entrenamiento para permitir una replicación sencilla del método propuesto. Los resultados experimentales demuestran que EfficientNetV1 logra el mayor rendimiento en clasificación, alcanzando una precisión superior en comparación con MobileNetV2 e Inception-ResNet-V2. El estudio concluye que el marco ligero y basado en la atención propuesto equilibra eficazmente la precisión y la complejidad computacional, haciéndolo muy adecuado para aplicaciones sanitarias en tiempo real y móviles, especialmente en entornos con recursos limitados.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La clasificación precisa de tumores cerebrales mediante resonancia magnética (RM) desempeña un papel fundamental en el diagnóstico clínico, la planificación del tratamiento y la estimación delpronóstico 1. Los tumores cerebrales, incluyendo glioma, meningioma e hipofisis, presentan características patológicas y respuestas al tratamiento distintas; Por ello, una identificación temprana y fiable es esencial para mejorar los resultados terapéuticos y reducir la progresión de la enfermedad. La resonancia magnética es ampliamente preferida para la evaluación de tumores cerebrales debido a su superior contraste de tejidos blandos, naturaleza no invasiva y capacidad para visualizar la morfología tumoral a lo largo de múltiples planos anatómicos. Sin embargo, la interpretación manual de las resonancias magnéticas suele ser lenta y depender en gran medida de la experiencia radiológica, especialmente cuando los límites tumorales son irregulares o cuando existen similitudes visuales entre clases tumorales. En consecuencia, los sistemas automatizados de diagnóstico asistido por ordenador se han vuelto cada vez más importantes para ayudar a los radiólogos a clasificar tumores de forma precisa y eficiente.

Las técnicas de análisis de imágenes basadas en aprendizaje profundo (DL) han avanzado significativamente la clasificación automatizada de enfermedades en aplicaciones biomédicas y de visión porordenador 2,3. En neurooncología, el aprendizaje automático y las técnicas de aprendizaje por transferencia han demostrado un rendimiento prometedor en tareas de detección, segmentación y clasificación detumores 4. Las redes neuronales convolucionales (CNN), en particular, han demostrado una capacidad superior para extraer automáticamente características jerárquicas de imágenes directamente de escaneos de resonancia magnética sin depender de la ingeniería de características artesanal. Las arquitecturas CNN pueden aprender representaciones discriminativas relacionadas con tumores a partir de datos de imagen, mejorando así el rendimiento de clasificación en comparación con los enfoques convencionales de aprendizaje automático. Los avances recientes en DL han permitido el desarrollo de sistemas de clasificación de imágenes de alto rendimiento capaces de procesar conjuntos de datos de imágenes a gran escala con mayor precisión y reducción de la intervención humana.

A pesar de estos avances, las arquitecturas CNN profundas convencionales suelen requerir recursos computacionales sustanciales, incluyendo un alto consumo de memoria, mayor complejidad de parámetros y un tiempo de entrenamientoextenso 5. Estas demandas computacionales limitan su implementación en entornos clínicos con recursos limitados y sistemas móviles de salud. Además, las arquitecturas ligeras de redes neuronales convolucionales han atraído cada vez más atención debido a su menor complejidad computacional y su idoneidad para su despliegue en aplicaciones de pocos recursos5. Varios estudios recientes han explorado estrategias optimizadas de CNN, mecanismos eficientes de extracción de características y marcos ligeros de despliegue para mejorar la eficiencia de clasificación sin comprometer significativamente la precisiónpredictiva 6,7,8. Sin embargo, equilibrar la eficiencia computacional con un rendimiento robusto en la clasificación de tumores multiclase sigue siendo un gran desafío en el análisis de tumores cerebrales basados en resonanciamagnética.

Los marcos de aprendizaje profundo basados en la atención han surgido como soluciones eficaces para mejorar la representación de características en el análisis de imágenesmédicas 10. Los mecanismos de atención permiten que las redes neuronales enfaticen selectivamente regiones de imagen relevantes para el diagnóstico mientras suprimen información de fondo irrelevante. Inspiradas en el sistema visual humano, las arquitecturas guiadas por la atención mejoran el aprendizaje discriminativo de características al dirigir el enfoque computacional hacia regiones espaciales específicas del tumor y características contextuales. Estos mecanismos son especialmente beneficiosos para el análisis de resonancia magnética de tumores cerebrales porque los tejidos tumorales presentan frecuentemente patrones de intensidad heterogéneos, morfología irregular y características visuales superpuestas entre categorías tumorales. En consecuencia, integrar módulos de atención en arquitecturas basadas en CNN puede mejorar la precisión de la clasificación y el rendimiento de la localización de características.

Varios estudios recientes han demostrado el potencial de los marcos de DL para el diagnóstico automatizado de tumores cerebrales y la clasificación tumoral basada en resonanciamagnética 11,12. Gao et al. desarrollaron y validaron un modelo DL para el diagnóstico de tumores cerebrales utilizando datos de resonancia magnética, demostrando una fuerte capacidad de clasificación para el análisis automatizado deneuroimagen 11. De manera similar, Abdusalomov et al. investigaron enfoques de detección de tumores cerebrales basados en DL mediante resonancias magnéticas y reportaron un rendimiento diagnósticoprometedor. Aunque estos estudios lograron una mayor precisión en la clasificación, las limitaciones relacionadas con la diversidad de conjuntos de datos, la generalización de modelos y los requisitos computacionales siguen sin resolverse. En muchos casos, los conjuntos de datos de entrenamiento fueron limitados en tamaño o derivados de fuentes clínicas restringidas, aumentando así el riesgo de sobreajuste y reduciendo la robustez entre poblaciones heterogéneas de pacientes.

Para mejorar la visualización tumoral y la extracción de características, también se han explorado técnicas de análisis y reconstrucción multimodalcon resonancia magnética 13,14. Sun et al. investigaron la evaluación multimodal de glioma basada en resonancia magnética utilizando un marco de reconstrucción de aprendizaje profundo combinado con estrategias de reducción de ruido13. Su trabajo demostró la importancia de la mejora de la calidad de imagen para mejorar la precisión de la detección de gliomas. De manera similar, Srinivas y Rao propusieron un marco de segmentación basado en DL para el análisis de subregiones de tumores cerebrales por resonancia magnéticamultimodal 14. Su enfoque mejoró la delimitación de subregiones tumorales y contribuyó a la planificación individualizada del tratamiento. No obstante, los marcos multimodales generalmente requieren un preprocesamiento extenso, mayores recursos computacionales y un registro preciso de imágenes entre modalidades de imagen, lo que puede limitar su aplicabilidad en entornos clínicos prácticos.

También se han propuesto métodos de fusión multimodal guiada por la atención para mejorar la precisión de segmentación y la integración de características de la resonanciamagnética 15,16,17,18. Zhou et al. introdujeron un marco de fusión basado en mecanismos de atención para la segmentación multimodal de tumorescerebrales 15. El estudio demostró una mejora en el rendimiento de la segmentación mediante el aprendizaje de características contextuales; sin embargo, el enfoque se centró principalmente en la segmentación en lugar de la clasificación de tumores ligeros. De manera similar, Zhou y Du propusieron una red multimodal 3D para la reconstrucción acelerada de la resonanciamagnética 16, mientras que Huang et al. desarrollaron AMF-Net, una red adaptativa de fusión multisecuencia para el diagnóstico multimodal de tumorescerebrales 17. Zhou et al. propusieron además MLMFNet para la reconstrucción acelerada multimodal de la resonanciamagnética 18. Aunque estos métodos mejoraron la calidad de la reconstrucción y la capacidad de fusión de características, dependían en gran medida de múltiples modalidades de resonancia magnética, arquitecturas profundas y operaciones de fusión computacionalmente costosas. Estos requisitos pueden reducir su viabilidad para su despliegue en sistemas sanitarios con recursos limitados y plataformas de diagnóstico basadas en edge.

Estudios adicionales han investigado marcos DL específicamente para clasificar gliomas, meningiomas y tumores hipofisarios mediante imágenes de resonanciamagnética 19. Mokri et al. desarrollaron un sistema de clasificación basado en DL para identificar tres tipos principales de tumores cerebrales utilizando las resonanciasmagnéticas 19. Aunque el estudio demostró un rendimiento alentador, el modelo se basó en conjuntos de datos relativamente pequeños y careció de comparaciones con marcos ligeros de aprendizaje por transferencia. Las arquitecturas basadas en transformadores también han atraído recientemente la atención en la imagen médica debido a su capacidad para modelar dependencias de características a largo alcance y relacionescontextuales 20. Feng et al. propusieron un marco multimodal de transformadores para la reconstrucción acelerada de imágenespor RM 20. Su enfoque mejoró el rendimiento de reconstrucción en comparación con los métodos convencionales; sin embargo, las arquitecturas de transformadores generalmente requieren recursos computacionales extensos y conjuntos de datos de entrenamiento a gran escala, lo que puede limitar su despliegue práctico en sistemas médicos con recursos limitados.

Las arquitecturas CNN ligeras basadas en aprendizaje por transferencia han mostrado un potencial considerable para reducir la complejidad computacional manteniendo la precisión de clasificación 21,22,23. Rahman et al. demostraron un mejor rendimiento en la clasificación de tumores cerebrales utilizando MobileNetV2, combinado con enfoques avanzados de preprocesamiento y ajustefino 21. MobileNetV2 es especialmente adecuado para aplicaciones ligeras de imagen médica debido a sus convoluciones separables en profundidad, menor número de parámetros y extracción eficiente de características. De manera similar, los frameworks basados en EfficientNet han demostrado un fuerte rendimiento en clasificación multiclase mediante estrategias de escalado compuesto que optimizan simultáneamente la profundidad, el ancho y la resolución de entradade la red 22. Las arquitecturas EfficientNet logran una mayor eficiencia en la clasificación manteniendo una menor sobrecarga computacional en comparación con las CNN convencionales. Además, las arquitecturas Inception-ResNet integran el aprendizaje residual con mecanismos eficientes de extracción de características para mejorar el rendimiento en la clasificaciónde imágenes 23. Estas arquitecturas híbridas permiten una propagación efectiva de gradientes y un aprendizaje más profundo de representación de redes mientras preservan la eficiencia computacional.

Aunque se han logrado avances significativos en la clasificación de tumores cerebrales mediante resonancia magnética, siguen sin resolver varias limitaciones. Muchos enfoques existentes priorizan la precisión de clasificación con arquitecturas computacionalmente intensivas, sin abordar adecuadamente la eficiencia del despliegue ni las restricciones computacionales. Otros estudios se centran principalmente en la segmentación, la reconstrucción multimodal o la fusión de características, más que en la clasificación directa de tumores de cuatro clases. Además, relativamente pocos marcos integran arquitecturas ligeras de aprendizaje por transferencia con aprendizaje de características guiado por atención para una clasificación eficiente de tumores cerebrales multiclase. Por lo tanto, sigue siendo necesario un marco computacionalmente eficiente que equilibre la precisión de la clasificación, el despliegue ligero y la extracción discriminativa de características en entornos clínicos con recursos limitados.

Por ello, este estudio propone un marco ligero de aprendizaje por transferencia guiada por atención para la clasificación de tumores cerebrales en cuatro clases utilizando imágenes de resonancia magnética. El marco propuesto integra MobileNetV2, EfficientNetV1 e Inception-ResNet-V2 con un mecanismo de atención que enfatiza selectivamente las regiones tumorales relevantes diagnósticamente mientras suprime características de fondo irrelevantes. El marco tiene como objetivo mejorar la discriminación de características y el rendimiento en la clasificación, al tiempo que reduce la complejidad computacional. Al combinar esqueletas ligeras de aprendizaje por transferencia con la extracción de características guiadas por atención, el enfoque propuesto pretende ofrecer una solución eficiente y escalable para la clasificación automatizada de tumores cerebrales basada en resonancia magnética en entornos clínicos de apoyo a la decisión con recursos limitados.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó un conjunto de datos anonimizado y disponible públicamente; por lo tanto, no se requería consentimiento informado. El enfoque propuesto consta de seis componentes: preprocesamiento, módulo de convolución, módulo de atención, integración de módulos de convolución y atención, y capas totalmente conectadas (FC). La Figura 1 ilustra el flujo de trabajo completo de nuestro método.

Adquisición de conjuntos de datos
Las imágenes etiquetadas de la resonancia magnética cerebral se obtienen de un conjunto de datos de Kaggle disponible públicamente que comprende cuatro categorías tumorales y tejido normal.

Preprocesamiento de datos
Las imágenes se redimensionan a una resolución uniforme y la intensidad normalizada. Se aplica una ampliación opcional (rotación, volteo, zoom) para mejorar la generalización. El conjunto de datos se divide en conjuntos de entrenamiento (70%) y de prueba (30%).

Arquitectura del modelo
Se utilizaron tres CNN de columna vertebral preentrenadas en ImageNet — MobileNetV2, EfficientNetV1 e Inception-ResNet-V2 — para clasificar tumores cerebrales en cuatro categorías mediante imágenes de resonancia magnética. MobileNetV2 y EfficientNetV1 estaban configurados con una dimensión de entrada de 224 × 224 píxeles, mientras que Inception-ResNet-V2 requería un tamaño de entrada de 299 × 299 píxeles. En el proceso de aprendizaje por transferencia, las capas convolucionales iniciales se congelaron al principio para conservar las características generales de la imagen, mientras que las capas superiores se ajustaron finamente para adaptar el modelo a la clasificación de tumores cerebrales. Cada columna vertebral se combinó con un cabezal de clasificación ligero que incluía Global Average Pooling, capas densas, dropout para regularización y una función de activación Softmax para predecir cuatro clases. El abandono se implementó para mitigar el sobreajuste y mejorar la generalización. La arquitectura diseñada combinó eficazmente la extracción eficiente de características con menores demandas computacionales, facilitando una clasificación precisa y siendo adecuada para su despliegue en escenarios con recursos limitados y pruebas de concepto.

Extracción de características basada en la atención
Las imágenes de entrada se procesan a través de una capa convolucional inicial seguida de un módulo de atención personalizado. El agrupamiento paralelo de max y el agrupamiento promedio capturan características salientes y contextuales, que se concatenan y refinan mediante convolución para enfatizar regiones relevantes para tumores.

Columna vertebral convolucional y fusión
Las características ponderadas en la atención se envían a esquemas preentrenadas (MobileNetV2, EfficientNetV1 o Inception-ResNet-V2). Las capas convolucionales de alto nivel se fusionan lógicamente para reducir el acceso a la memoria y mejorar la eficiencia computacional.

Clasificación
Las características aplanadas pasan a través de capas totalmente conectadas con activación y desaparición de ReLU6, produciendo una representación compacta para la clasificación final de softmax de cuatro clases.

Evaluación
El rendimiento del modelo se evalúa en el conjunto de pruebas utilizando matrices de precisión, precisión, recuerdo, puntuación F1 y confusión.

Desarrollo del marco
La solución propuesta está implementada en Python y utiliza Keras para su ejecución. La Tabla 1 ilustra los hiperparámetros. El conjunto de datos se divide en un conjunto de entrenamiento y un conjunto de prueba siguiendo una proporción 70:30. Se utilizan cinco divisiones arbitrarias diferentes de trenes/pruebas para mostrar el rendimiento equilibrado final de cada conjunto de datos.

Preprocesamiento
Las imágenes de entrada deben actualizarse porque el framework MobileNetV2 sirve como base para la solución propuesta. Para extraer características de alta resolución de fotografías, se utiliza el modelo preentrenado MobileNetV2 con su dimensión de entrada. Cada imagen de entrada se escala a 224×224 píxeles en el rango [-1, 1].

El modelo de convolución
MobileNetV2 mejora el reconocimiento de imágenes aprovechando una arquitectura eficiente de Red Neuronal Convolucional (CNN) diseñada para minimizar las demandas computacionales. Aunque las CNN tradicionales alcanzan una alta precisión, a menudo requieren una memoria y potencia de procesamiento considerables. MobileNetV1 introdujo el concepto de convolución separable en profundidad, que separa la convolución estándar en dos operaciones distintas: convolución en profundidad para filtrar entradas y convolución puntual para integrar características. MobileNetV2 desarrolla esta idea incorporando bloques residuales de cuello de botella que consisten en capas de expansión, convolución en profundidad, capas de proyección y conexiones residuales. La capa de proyección comprime los canales de características, mientras que las conexiones residuales facilitan un mejor flujo de información a lo largo de la red. Para mejorar la estabilidad y el rendimiento en el aprendizaje, se aplican activaciones y normalización por lotes de ReLU6 tras operaciones convolucionales.

En esta investigación, MobileNetV2, preentrenado en ImageNet, se utilizó como modelo principal para extraer características, proporcionando representaciones semánticas efectivas de alto nivel mientras mantenía bajos los costes computacionales para la clasificación de tumores cerebrales. Después de cada capa de convolución, hay una capa de activación de ReLU6, que es una adaptación de la función de activación de ReLU, donde el tamaño se maximiza en seis, y una capa de normalización por lotes. Las capas comunes de convolución 1x1, agrupación media y clasificación se aplican a 17 de los bloques restantes de cuello de botella, formando la arquitectura completa de MobileNetV2. Usamos MobileNetV2 como red troncal preentrenada en ImageNet. En tal caso, la aplicación convolucional se obtiene del último bloque residual tras pasar por la capa convolucional de MobileNetV2. Los bloques residuales de nivel inferior producen mapas de características más pequeños. Estos bloques no contribuyen a nuestra investigación porque no recogen datos de alto nivel para la identificación global de la imagen. Durante la construcción y entrenamiento del modelo, las capas anteriores a las capas convolucionales que generan un mapa de características 3D 7 × 7 se mantienen fijas. En términos matemáticos, esto se expresa de la siguiente manera en la Ecuación (1):

F1(I) = Conv(I) (1)

Aquí, F1(I) representa la característica convolucional extraída de la imagen de entrada, I.

El módulo de enfoque
El mecanismo de atención del cerebro humano, que implica que las personas se centran de forma natural más en los estímulos visuales significativos que en cada detalle de una imagen, sirve de base para el diseño de esta red de transformación. Se han creado numerosos modelos basados en la atención en la investigación en aprendizaje profundo gracias a esta idea. Las correlaciones espaciales observadas en las representaciones de tumores cerebrales se destacan con el mecanismo de atención sugerido. Mientras que el módulo de atención de canales captura la información tumoral más importante a través de los canales de características, la unidad regional de atención identifica las regiones más informativas de la imagen de la resonancia magnética. Utilizando un método de atención estructurada, la unidad de enfoque sugerida se centra en áreas que contienen información tumoral discriminativa.

Para mejorar la representación de características, se utilizan técnicas como el Top Activation Pooling y la extracción balanceada de características antes de la fase de detección espacial de características. Esta estrategia mejora la capacidad del modelo para enfatizar regiones tumorales clínicamente significativas minimizando los detalles de fondo irrelevantes, mejorando así la precisión de la clasificación y la eficiencia del aprendizaje de características. La segunda es la concatenación de los tensores agrupados máximo y agrupados en la media. Por último, la función de activación sigma, combinada con un filtro convolucional 7x7, se utilizará para activar estímulos visuales dentro de los visuales. Las diferentes etapas del módulo de enfoque se indican en las ecuaciones (2) y (3). donde Pool(F) ∈ RHxWx1 balanceado representa la operación media de pooling y MaxPool(F) ∈ RHxWx1 describe la operación de pooling máximo.

F2(I) = [Promedio de Pool(F); MaxPool (F)] (2)

Estos dos mapas de elementos pueden combinarse en 3D para crear un mapa de elementos

F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)

donde σ es la función de activación que indica sigma. Las características de atención, que se representan por un tensor codificado en altura (V), anchura (W) y grosor (C) codificados HxWxC, se representan por F3(I), mientras que f7x7 representa la operación de convolución de tamaño del filtro (7x7).

Fusión de la atención y un modelo de convolución
A diferencia de una red que depende de un único codificador, una Unidad de Fusión multimodal podría extraer información mucho más eficiente y completa para la gran mayoría de modalidades. El bloque de fusión está destinado a guiar hacia las máximas características esenciales cruzadas de modales; por lo tanto, señalará las áreas de atención para la extracción de la región tumoral. Se trata de una simple concatenación de representaciones latentes individuales, pero se perdería parte de la información. Así, se generó un mapa combinado de objetos combinando los mapas de características de los módulos de convolución y observación utilizando el método básico de concatenación de características de Sitaula et al. Estos dos mapas de características capturaron diferencias en varias propiedades de imagen, así que decidimos usar un método simple de concatenación en lugar de estrategias basadas en max, min o suma. Esto también lo hace computacionalmente más ligero que los métodos alternativos que utilizan métodos bilineales como forma de cálculo del producto tensorial. Cuando se combinan dos características, el resultante se denomina tensor de características. La expresión matemática de la salida tensorial agregada de caracteres T está dada por la Ecuación (4).

[F1(I), F3(I)] = T(I) (4)

Donde F1(I) ∈ RHxWx1 y F2(I) ∈ RHxWx1280. Estos son tensores 3D con el mismo ancho (W) y altura (H). Además, pueden concatenarse en la creación 3D k de tensores 3D, donde T(I) ∈ LxWx1281.

Capas totalmente conectadas (FC)
Utilizamos una serie de capas de FC tras la fusión de características para convertir un tensor volumétrico remodelado en un vector lineal de características. El cabezal de clasificación consta de una capa de Global Average Pooling, capas densas totalmente conectadas, regularización dropout y una capa de salida Softmax. Se utiliza la función de activación de ReLU6, con 128 unidades y una probabilidad de abandono del 50%.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se evaluaron tres modelos de aprendizaje profundo preentrenados, a saber: MobileNetV2, EfficientNetV1 e Inception-ResNet-V2, para la clasificación de tumores cerebrales de cuatro clases utilizando imágenes de resonancia magnética.

Conjunto de datos utilizado
El marco propuesto fue evaluado utilizando un conjunto de datos de resonancia magnética de tumores cerebrales disponible públicamente obtenido de la plataforma Kaggle. El conjunto de da...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La evaluación del rendimiento, basada en la precisión, la memoria, la puntuación F1 y la exactitud, revela que tanto MobileNetV2 como Inception-ResNet-V2 logran resultados comparables en la clasificación de tumores cerebrales, alcanzando cada uno una precisión agregada y media ponderada del 97–98%. En cambio, EfficientNet supera a los otros modelos, alcanzando un 99% de precisión en métricas macro y medias ponderadas, gracias a su estrategia mejorada de generalización y escalado compuest...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

No se recibió financiación externa para este estudio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

```html

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos de RM cerebralIEEEhttps://dx.doi.org/10.21227/q2vt-tf46El conjunto de datos se descarga con acceso del instituto. El conjunto de datos de RM contiene cuatro clases: glioma, meningioma, tumor pituitario y cerebro normal
Acelerador CNN (fusión de capas)Trabajo propuestoFusión lógica de las capas convolucionales superiores para reducir el acceso a la memoria y mejorar la eficiencia computacional
Módulo de atención personalizadaTrabajo propuestoMecanismo de atención que integra max-pooling y average-pooling para enfatizar las regiones relevantes del tumor
EfficientNetV1GooglePreentrenado (ImageNet)Arquitectura CNN escalable que proporciona un equilibrio óptimo entre precisión y eficiencia
Google ColaboratoryGooglehttps://colab.research.google.com/Entorno basado en la nube utilizado para el entrenamiento de modelos, evaluación y experimentación con soporte de GPU
Inception-ResNet-V2GooglePreentrenado (ImageNet)Arquitectura CNN híbrida profunda que combina módulos Inception con conexiones residuales
KerasGooglev2.6.0API de red neuronal de alto nivel construida sobre TensorFlow para el rápido prototipado de modelos
MatplotlibMatplotlib Developersv3.4.3Biblioteca de visualización utilizada para trazar curvas de entrenamiento, matrices de confusión y métricas de rendimiento
MobileNetV2GooglePreentrenado (ImageNet)Estructura de red neuronal convolucional ligera optimizada para la implementación en dispositivos móviles y de borde
NumPyNumPy Developersv1.21.4Biblioteca de computación científica básica utilizada para operaciones numéricas
PandasPandas Development Teamv1.3.4Biblioteca de manipulación y manejo de datos utilizada para la organización del conjunto de datos y el procesamiento de metadatos
PythonPython Software Foundationv3.8.10Lenguaje de programación principal utilizado para el preprocesamiento de datos, desarrollo y evaluación de modelos
Scikit-learnScikit-learn DevelopersÚltima estableUtilizado para métricas de evaluación del rendimiento como precisión, recall, F1-score y matrices de confusión
SeabornSeaborn DevelopersÚltima estableBiblioteca de visualización estadística de alto nivel utilizada para el análisis gráfico mejorado
TensorFlowGooglev2.6.0Marco de aprendizaje profundo de extremo a extremo utilizado para la implementación de estructuras CNN y módulos de atención
```

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Investigaci n del C ncerN mero 233N mero 233MobileNetV2EfficientNetV1Inception ResNet V2

Artículos relacionados