Research Article

Preprocesamiento de imágenes y sensibilidad a los optimizadores: implicaciones para las redes neuronales convolucionales en el diagnóstico de tumores cerebrales

DOI:

10.3791/69459

February 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio emplea un marco controlado para evaluar las canalizaciones de preprocesamiento y optimizadores dentro de una arquitectura fija, con el objetivo de determinar cómo el preprocesamiento clásico afecta a los optimizadores y a las Redes Neuronales Convolucionales (CNN) en la clasificación de tumores cerebrales.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La clasificación de tumores cerebrales mediante resonancia magnética (IRM) presenta desafíos debido a las variaciones en el tamaño, forma y textura del tumor. Aunque los métodos tradicionales de preprocesamiento de imágenes se emplean comúnmente para mejorar la calidad de entrada, su impacto en el comportamiento de los optimizadores y en el rendimiento de las CNN aún no ha sido investigado a fondo. Esta investigación examina el efecto del preprocesamiento en la convergencia, generalización y precisión de clasificación entre varios optimizadores. Utilizamos un conjunto de datos de Kaggle disponible públicamente para crear dos canales de preprocesamiento: un pipeline base que solo redimensiona imágenes y un pipeline tradicional que convierte imágenes a escala de grises, las difumina y aplica filtrado morfológico. Luego probamos cómo estas canalizaciones afectan a tres optimizadores: Adam, Propagación Cuadrática Media Raíz (RMSProp) y Descenso Estocástico del Gradiente (SGD). Para separar las variables del protocolo, se utiliza una arquitectura CNN fija en todo el sistema. El rendimiento se evalúa utilizando precisión, exactitud, recuerdo y puntuación F1, validados mediante una validación cruzada de cinco vías. Los resultados muestran que el preprocesamiento base proporciona consistentemente mayor precisión y una convergencia más estable entre todos los optimizadores, con RMSProp y SGD logrando la mayor precisión media del 99,53% bajo la validación cruzada de cinco veces. Los hallazgos abordan el efecto poco estudiado del preprocesamiento en el rendimiento del optimizador, subrayando la necesidad de estrategias de entrenamiento conscientes del preprocesamiento para mejorar la robustez y la interpretabilidad en el análisis de imágenes médicas.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La clasificación de tumores cerebrales mediante imagen por resonancia magnética (RM) es una tarea crucial en neurooncología, donde un diagnóstico precoz y preciso influye directamente en la planificación del tratamiento y en los resultados delpaciente 1. Las CNN se han convertido en el enfoque dominante para automatizar este proceso debido a su capacidad para aprender características jerárquicas espaciales y texturales directamente a partir de datos de imagenen bruto 2. Sin embargo, la calidad de los datos de entrada sigue siendo un factor clave que determina el rendimiento del modelo. Las técnicas clásicas de preprocesamiento —como la conversión en escala de grises, el desenfoque gaussiano, el umbral y las operaciones morfológicas— se aplican rutinariamente para reducir el ruido y enfatizar los límites estructurales 3,4,5. Gangadharan et al. realizaron un análisis comparativo de modelos de aprendizaje profundo para la predicción de tumores cerebrales, destacando la variabilidad en el rendimiento entre arquitecturas y la importancia de las características del conjunto de datos en la configuración de resultados6. Qureshi et al. propusieron una CNN ultraligera para la detección de tumores multiclase, enfatizando la eficiencia computacional y la aplicabilidad en tiempo real sin comprometer la precisióndiagnóstica 7. Yendo más allá de la imagen estructural, Qureshi et al. exploraron la clasificación radiogenómica utilizando características multiómicas fusionadas de exploraciones de resonancia magnética multiparamétricas para predecir el estado de metilación del promotor metilguanina-ADN metiltransferasa (MGMT), demostrando el potencial de modalidades de datos integradas para el perfilado tumoralno invasivo 8. A pesar de su ubicuidad, el impacto posterior de estas transformaciones en la dinámica de entrenamiento CNN, el comportamiento de los optimizadores y la interpretabilidad sigue sin explorarse.

Los avances recientes en la clasificación de tumores cerebrales se han centrado en la complejidad arquitectónica, los híbridos segmentación-clasificación y el aprendizaje por transferencia. MultiFeNet, por ejemplo, emplea fusión de características a escala múltiple para mejorar la representación espacial9, mientras que los modelos de conjunto y las CNN 3D ofrecen alta fidelidad a costa de un aumento de la sobrecargacomputacional 10,11. Estudios recientes sobre métodos híbridos, como la transformación de wavelet con Support Vector Machine (SVM) y la detección de bordes basada en autómatas celulares, suelen requerir características hechas a mano o procesamiento multietapa12,13. La investigación comparativa sobre conjuntos de datos desequilibrados ha puesto de manifiesto los desafíos para lograr la generalización porclase 14. Los enfoques de aprendizaje por transferencia utilizando redes preentrenadas, como VGG y ResNet, han mostrado potencial en la clasificaciónMRI 15, 16, 17; sin embargo, a menudo tratan el preprocesamiento como un paso fijo aguas arriba. Estos modelos rara vez aíslan cómo las transformaciones de entrada afectan a la convergencia del optimizador o a la retención semántica.

Los estudios conscientes del preprocesamiento han comenzado a poner de manifiesto esta brecha. Ivanescu et al. demostraron que un filtrado excesivo puede degradar la sensibilidad de la CNN a patrones tumoralessutiles 3. Vu et al. demostraron que la conversión y el redimensionamiento en escala de grises pueden descartar información contextual, afectando así la precisióndiagnóstica 4. Hooper et al. revelaron que el filtrado por Tomografía Computarizada (TC) a nivel ascendente induce variabilidad del rendimiento, subrayando la fragilidad de las CNN frente a los desplazamientos de dominio5. Kundu et al. propusieron transformaciones de intensidad basadas en Gaussas para mejorar lasegmentación 18; sin embargo, no evaluaron la sensibilidad del optimizador. Mientras tanto, Asiri et al. y Aamir et al. optimizaron los hiperparámetros CNN para la detección de tumorescerebrales 16,17, destacando el rendimiento superior de Adam sin analizar cómo responde a los cambios de preprocesamiento. Herramientas de explicabilidad como el Gradient-weighted Class Activation Mapping (Grad-CAM) y las SHapley Additives ExPlanations (SHAP) han avanzado nuestra comprensión de la toma de decisiones CNN al visualizar regiones discriminativas porclase 19,20. Estos métodos son esenciales para validar si el preprocesamiento mejora o distorsiona la retención semántica.

Sin embargo, pocos estudios han examinado sistemáticamente cómo el preprocesamiento afecta a la convergencia, generalización e interpretabilidad de los optimizadores bajo una arquitectura fija, cuestiones que son tanto clínicas como computacionalmente significativas. Clínicamente, un suavizado excesivo o transformaciones de intensidad pueden atenuar gradientes de textura y espaciales relevantes para el diagnóstico, reduciendo la fidelidad de localización y la confianza del clínico. Computacionalmente, los optimizadores reaccionan de forma diferente a los cambios en la escala de características y la varianza del gradiente; los desajustes entre la complejidad de entrada y la dinámica del optimizador pueden producir convergencia inestable o una generalización peor.

Para abordar esto, introducimos un marco de doble camino que compara sistemáticamente las pipelines de preprocesamiento base (solo por redimensionamiento) y las tradicionales entre tres optimizadores —Adam, RMSProp y SGD— utilizando una arquitectura CNN coherente y el conjunto de datosBR35H Kaggle 21. Evaluamos el rendimiento en la clasificación, la velocidad de convergencia y la interpretabilidad utilizando Grad-CAM, validado mediante cinco validaciones cruzadas. A diferencia de trabajos anteriores que confunden cambios arquitectónicos y de preprocesamiento, este protocolo aísla el preprocesamiento como una variable independiente, revelando que un filtrado agresivo puede dificultar el rendimiento del optimizador y la atención espacial.

El marco presentado aquí ofrece varias ventajas respecto a los modelos existentes. En primer lugar, evalúa explícitamente las interacciones entre las estrategias de preprocesamiento y los optimizadores, una dimensión que a menudo se pasa por alto en los estudios de aprendizaje en conjunto ytransferencia 15,16,17. En segundo lugar, mantiene una arquitectura CNN fija, simulando así restricciones de despliegue en el mundo real donde la reconfiguración suele ser poco práctica22. Tercero, integra métodos de atribución visual para evaluar la retención semántica, complementando trabajos previos en estudios radiómicos y de característicasartesanales 23. Por último, el marco ofrece información reproducible sobre estrategias de entrenamiento conscientes del preprocesamiento, mejorando así tanto la robustez como la interpretabilidad.

Al sintetizar conocimientos de los métodos de preprocesamiento 3,4,5, estudiosoptimizadores 16,17 y herramientas deexplicabilidad 19,20, este trabajo presenta una vía práctica e interpretable para la clasificación de tumores cerebrales que equilibra precisión, estabilidad y relevancia clínica.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La Figura 1 muestra una visión general del flujo de trabajo del Protocolo. Este estudio examina el efecto del preprocesamiento clásico de imágenes en el rendimiento de las CNN y el comportamiento de los optimizadores en la clasificación de tumores cerebrales mediante resonancia magnética. El protocolo abarca la preparación de conjuntos de datos, las canalizaciones de preprocesamiento de doble camino, la arquitectura del modelo, la configuración del optimizador, la evaluación del rendimiento y la validación de la interpretabilidad. Todos los experimentos se ejecutaron en Python 3.10.12 usando Keras versión 2.13.1 con backend TensorFlow, OpenCV versión 4.8.0 y Matplotlib versión 3.8.0.

Preparación del conjunto de datos
El conjunto de datos BR35H de resonancia magnética para tumores cerebrales de Kaggle21, compuesto por 3.000 imágenes divididas a partes iguales en clases de tumor presente ("sí") y de ausencia de tumor ("no"), se utilizó en este estudio. Todas las imágenes se redimensionaron a 128 × 128 píxeles usando la función cv2.resize de OpenCV para estandarizar las dimensiones de entrada entre experimentos. El muestreo estratificado con la train_test_split de Scikit-learn aseguró una representación equilibrada entre el conjunto de entrenamiento (80%) y el conjunto de validación (20%), manteniendo así la consistencia en la distribución de clases en cada pliegue.

Además del conjunto de datos público BR35H, validamos este protocolo utilizando un conjunto de datos independiente recogido del Ultralytics Brain Tumor Dataset (https://docs.ultralytics.com/datasets/detect/brain-tumor/). Este conjunto de datos consta de un conjunto de entrenamiento válido de 878 imágenes y un conjunto de pruebas de 223 imágenes, con dos clases claramente definidas: Negativas (imágenes sin tumores cerebrales) y Positivas (imágenes con tumores cerebrales). La inclusión de este conjunto de datos independiente nos permitió evaluar aún más la generalización y robustez del marco más allá de los datos originales.

Canalizaciones de preprocesamiento
Se implementaron dos pipelines de preprocesamiento distintas para evaluar el impacto del preprocesamiento clásico de imágenes. La tubería de Preprocesamiento de Línea Base (BP) simplemente redimensionaba las imágenes a 128 × 128 píxeles sin más transformaciones, preservando así la intensidad bruta del píxel y las características estructurales como condición de control. La tubería de Preprocesamiento Tradicional (TP) aplicó una secuencia de pasos clásicos de procesamiento de imágenes usando funciones OpenCV: conversión en escala de grises (cv2.cvtColor) para reducir la dimensionalidad del canal, desenfoque gaussiano (cv2). GaussianBlur) para suprimir el ruido y mejorar elcontraste 24, umbral (cv2.threshold) para segmentar estructuras de altaintensidad 25, operaciones morfológicas (cv2.erode, cv2.dilate) para refinar bordes y reducir artefactos26, y detección de contornos (cv2.findContours) para identificar regiones de interés. Esta canalización mejoraba el contraste y reducía el desorden visual, aunque corría el riesgo de suprimir la textura relevante para el diagnóstico.

Arquitectura del modelo
Se implementó una CNN personalizada que se mantuvo constante en todos los experimentos para aislar los efectos del preprocesamiento y la elección del optimizador. La arquitectura consistía en una capa de entrada (128 × 128 × 1), tres capas convolucionales (la primera con 32 filtros y las siguientes dos con 64 filtros, todos usando 2 × 2 núcleos y activación de Unidad Lineal Rectificada (ReLU), cada una seguida de 2 × 2 pooling máximo. La salida se aplanaba y pasaba a través de una capa densa de 128 unidades con activación de ReLU, seguida de una capa de dropout (tasa = 0,5) y finalmente una única unidad sigmoide para clasificación binaria. Este diseño logra un equilibrio entre interpretabilidad y eficiencia computacional, lo que lo hace adecuado para hardware clínico con recursos limitados.

Configuración del optimizador
Se evaluaron tres optimizadores con hiperparámetros fijos: Adam (tasa de aprendizaje = 0,001, β1 = 0,9, β2 = 0,999, épsilon = 1e−07), RMSProp (tasa de aprendizaje = 0,001, rho = 0,9, épsilon = 1e−07) y SGD (tasa de aprendizaje = 0,005, momento = 0,9, Nesterov desactivado). Los parámetros de entrenamiento se mantuvieron constantes entre los experimentos, con un tamaño de lote de 32.50 épocas y una parada temprana (paciencia = 10) implementada mediante callbacks Keras para evitar sobreajustes.

Evaluación del desempeño
El rendimiento se evaluó utilizando precisión, exactitud, recuerdo y puntuación F1, calculados con la classification_report de Scikit-learn. Se graficaron curvas de pérdida de entrenamiento y validación con Matplotlib para evaluar la velocidad de convergencia y detectar sobreajustes. Los resultados se tabularon y visualizaron para comparar la sensibilidad del optimizador bajo diferentes condiciones de preprocesamiento.

Validación de interpretabilidad
La interpretabilidad se validó utilizando visualizaciones Grad-CAM generadas a partir de la capa convolucional final. Los mapas de calor se generaron usando funciones Keras y TensorFlow y luego se superpusieron a las imágenes originales de la resonancia magnética usando Matplotlib. Este paso aseguró que la atención espacial de la CNN estuviera alineada con las regiones tumorales clínicamente relevantes, apoyando así la transparencia y la confianza diagnóstica.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Optimizador Adam - Preprocesamiento de línea base:
La Figura 2 ilustra el rendimiento de un modelo de clasificación de tumores cerebrales utilizando el optimizador Adam con preprocesamiento basal. La matriz de confusión muestra una separación casi perfecta entre casos tumorales y no tumorales, con solo 8 clasificaciones erróneas de 600 muestras. El informe de clasificación adjunto lo confirma con precisión, recuerdo y puntuaciones F1, to...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El éxito de la clasificación de tumores cerebrales basada en CNN en este estudio estuvo impulsado principalmente por dos componentes del protocolo: el diseño del preprocesamiento y la selección del optimizador. El preprocesamiento de línea base —que consiste únicamente en el redimensionamiento de la imagen— preservó la intensidad nativa de los píxeles y la estructura espacial, permitiendo al modelo aprender características clínicamente relevantes. En contraste, los métodos tradicionales ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores expresan su agradecimiento y sincero agradecimiento a la Universidad GITAM, al equipo directivo, al Decano y al Jefe del Departamento de Informática e Ingeniería del campus de Visakhapatnam, por su continuo apoyo y estímulo a la investigación y el desarrollo.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
API WrapperKeras2.13.1(RRID:SCR_016345)API de alto nivel para arquitectura y formación CNN
Herramienta de AtribuciónImplementación de Grad-CAMPersonalizado (vía Keras)Explicación visual de la atención de CNN
Conjunto de datos de resonancia magnética de tumores cerebrales BR35H  Kagglehttps://www.kaggle.com/ahmedhamada0/brain-tumor-detectionFuente de imágenes de resonancia magnética etiquetadas para clasificación 
Conjunto de datos de tumores cerebrales  Ultralíticoshttps://docs.ultralytics.com/datasets/detect/brain-tumor/
Biblioteca de Aprendizaje ProfundoTensorFlow2.15.0 (RRID:SCR_018345)Backend para la implementación del modelo CNN
Procesamiento de imágenesOpenCV4.8.0 (RRID:SCR_015526)Preprocesado: escala de grises, desenfoque, umbral, morfología
Lenguaje de programaciónPython3.10.12 (RRID:SCR_008394)Entorno de ejecución para todos los experimentos
VisualizaciónMatplotlib3.8.0 (RRID:SCR_008624)Trazando curvas de pérdida y superposiciones Grad-CAM

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Devkota, B., et al. Image segmentation for early stage brain tumor detection using mathematical morphological reconstruction. Procedia Comput Sci. 125, 115-123 (2018).
  2. Antony, A., Minla, K. S. Brain tumor detection from MRI images using CNN. Int J Creat Res Thoughts. 10 (4), 95-100 (2022).
  3. Ivanescu, R. C. A statistical evaluation of the preprocessing medical images impact on a deep learning network's performance. Ann Univ Craiova Math Comput Sci Ser. 49 (2), 411-421 (2022).
  4. Vu, H. A. Integrating preprocessing methods and convolutional neural networks for effective tumor detection in medical imaging. arXiv. , (2024).
  5. Hooper, S. M., et al. Impact of upstream medical image processing on downstream performance of a head CT triage neural network. Radiol Artif Intell. 3 (4), e200229(2021).
  6. Comparative analysis of deep learning-based brain tumor prediction models using MRI scan. Gangadharan, S. M. P., et al. 2023 3rd International Conference on Innovative Sustainable Computational Technologies (CISCT), Dehradun, India, , (2023).
  7. Qureshi, S. A., et al. Intelligent ultra-light deep learning model for multi-class brain tumor detection. Appl Sci. 12 (8), 1-22 (2022).
  8. Qureshi, S. A., et al. Radiogenomic classification for MGMT promoter methylation status using multi-omics fused feature space for least invasive diagnosis through mpMRI scans. Sci Rep. 13, 3291(2023).
  9. Agrawal, T., et al. MultiFeNet: multi-scale feature scaling in deep neural network for the brain tumour classification in MRI images. Int J Imaging Syst Technol. 34 (1), 1-15 (2023).
  10. Brain tumor detection using U-Net and 3D CNN architecture. Ghanshala, A., et al. 2022 International Conference on Computing, Communication, and Intelligent Systems (ICCCIS), Greater Noida, India, , (2022).
  11. Medical image denoising and brain tumor detection using CNN and U-Net. Shivahare, B. D., et al. 2023 3rd International Conference on Innovative Sustainable Computational Technologies (CISCT), , Dehradun, India. (2023).
  12. Kumar, S., et al. Enhancing brain tumor segmentation using Berkeley wavelet transformation and improved SVM. Open Bioinform J. 18, e18750362358232(2025).
  13. Cellular automata based edge-detection for brain tumor. Diwakar, M., Patel, P. K., Gupta, K. 2013 International Conference on Advances in Computing, Communications and Informatics (ICACCI, Mysore, India, , (2013).
  14. Agrawal, T., et al. A comparative study of brain tumor classification on unbalanced dataset using deep neural networks. Biomed Signal Process Control. 94, 106256(2024).
  15. Khan, M. A., et al. Transfer learning for accurate brain tumor classification in MRI: a step forward in medical diagnostics. Discov Onc. 16, 1040(2025).
  16. Asiri, A. A., et al. Enhancing brain tumor diagnosis: an optimized CNN hyperparameter model for improved accuracy and reliability. PeerJ Comput Sci. 10, e1878(2024).
  17. Aamir, M., et al. Brain tumor detection and classification using an optimized convolutional neural network. Diagnostics. 14 (16), 1714(2024).
  18. Kundu, S., Das, B., Balas, V. E. Data conditioning to improve segmentation of brain MRI using CNN. Computer Vision and Image Processing. CVIP 2024. Communications in Computer and Information Science. , Springer. Cham. (2025).
  19. Grad-CAM: visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. 2017 IEEE International Conference on Computer Vision (ICCV), Venice, Italy, , (2017).
  20. Iftikhar, S., et al. Explainable CNN for brain tumor detection and classification through XAI based key features identification. Brain Inform. 12, 10(2025).
  21. BR35H: brain tumor detection 2020. , Kaggle Dataset. https://www.kaggle.com/ahmedhamada0/brain-tumor-detection (2021).
  22. Zhang, D., et al. Neural networks-based fixed-time control for a robot with uncertainties and input dead zone. Neurocomputing. 390, 139-147 (2020).
  23. Tabassum, M., et al. Radiomics and machine learning in brain tumors and their habitat: a systematic review. Cancers. 15 (15), 3845(2023).
  24. Gonzalez, R. C., Woods, R. E. Digital Image Processing. , Pearson. Upper Saddle River, NJ. (2008).
  25. Otsu, N. A threshold selection method from gray-level histograms. IEEE Trans Syst Man Cybern. 9 (1), 62-66 (1979).
  26. Haralick, R. M., et al. Image analysis using mathematical morphology. IEEE Trans Pattern Anal Mach Intell. 9 (4), 532-550 (1987).
  27. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542, 115-118 (2017).
  28. Tjoa, E., Guan, C. A survey on explainable artificial intelligence (XAI): toward medical XAI. IEEE Trans Neural Netw Learn Syst. 32 (11), 4793-4813 (2021).
  29. Maier-Hein, L., et al. Metrics reloaded: recommendations for image analysis validation. Nat Methods. 21 (2), 195-212 (2024).
  30. Pineau, J., et al. Improving reproducibility in machine learning research. J Mach Learn Res. 22 (164), 1-20 (2021).
  31. Yaqub, M., et al. State-of-the-art CNN optimizer for brain tumor segmentation in magnetic resonance images. Brain Sci. 10 (7), 1-20 (2020).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Brain Tumor ClassificationImage PreprocessingConvolutional Neural NetworksMRI Brain TumorsOptimizer SensitivityCNN PerformanceRMSProp OptimizerStochastic Gradient DescentFive Fold Cross ValidationMedical Image Analysis

Related Articles