$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La clasificación de tumores cerebrales mediante imagen por resonancia magnética (RM) es una tarea crucial en neurooncología, donde un diagnóstico precoz y preciso influye directamente en la planificación del tratamiento y en los resultados delpaciente 1. Las CNN se han convertido en el enfoque dominante para automatizar este proceso debido a su capacidad para aprender características jerárquicas espaciales y texturales directamente a partir de datos de imagenen bruto 2. Sin embargo, la calidad de los datos de entrada sigue siendo un factor clave que determina el rendimiento del modelo. Las técnicas clásicas de preprocesamiento —como la conversión en escala de grises, el desenfoque gaussiano, el umbral y las operaciones morfológicas— se aplican rutinariamente para reducir el ruido y enfatizar los límites estructurales 3,4,5. Gangadharan et al. realizaron un análisis comparativo de modelos de aprendizaje profundo para la predicción de tumores cerebrales, destacando la variabilidad en el rendimiento entre arquitecturas y la importancia de las características del conjunto de datos en la configuración de resultados6. Qureshi et al. propusieron una CNN ultraligera para la detección de tumores multiclase, enfatizando la eficiencia computacional y la aplicabilidad en tiempo real sin comprometer la precisióndiagnóstica 7. Yendo más allá de la imagen estructural, Qureshi et al. exploraron la clasificación radiogenómica utilizando características multiómicas fusionadas de exploraciones de resonancia magnética multiparamétricas para predecir el estado de metilación del promotor metilguanina-ADN metiltransferasa (MGMT), demostrando el potencial de modalidades de datos integradas para el perfilado tumoralno invasivo 8. A pesar de su ubicuidad, el impacto posterior de estas transformaciones en la dinámica de entrenamiento CNN, el comportamiento de los optimizadores y la interpretabilidad sigue sin explorarse.
Los avances recientes en la clasificación de tumores cerebrales se han centrado en la complejidad arquitectónica, los híbridos segmentación-clasificación y el aprendizaje por transferencia. MultiFeNet, por ejemplo, emplea fusión de características a escala múltiple para mejorar la representación espacial9, mientras que los modelos de conjunto y las CNN 3D ofrecen alta fidelidad a costa de un aumento de la sobrecargacomputacional 10,11. Estudios recientes sobre métodos híbridos, como la transformación de wavelet con Support Vector Machine (SVM) y la detección de bordes basada en autómatas celulares, suelen requerir características hechas a mano o procesamiento multietapa12,13. La investigación comparativa sobre conjuntos de datos desequilibrados ha puesto de manifiesto los desafíos para lograr la generalización porclase 14. Los enfoques de aprendizaje por transferencia utilizando redes preentrenadas, como VGG y ResNet, han mostrado potencial en la clasificaciónMRI 15, 16, 17; sin embargo, a menudo tratan el preprocesamiento como un paso fijo aguas arriba. Estos modelos rara vez aíslan cómo las transformaciones de entrada afectan a la convergencia del optimizador o a la retención semántica.
Los estudios conscientes del preprocesamiento han comenzado a poner de manifiesto esta brecha. Ivanescu et al. demostraron que un filtrado excesivo puede degradar la sensibilidad de la CNN a patrones tumoralessutiles 3. Vu et al. demostraron que la conversión y el redimensionamiento en escala de grises pueden descartar información contextual, afectando así la precisióndiagnóstica 4. Hooper et al. revelaron que el filtrado por Tomografía Computarizada (TC) a nivel ascendente induce variabilidad del rendimiento, subrayando la fragilidad de las CNN frente a los desplazamientos de dominio5. Kundu et al. propusieron transformaciones de intensidad basadas en Gaussas para mejorar lasegmentación 18; sin embargo, no evaluaron la sensibilidad del optimizador. Mientras tanto, Asiri et al. y Aamir et al. optimizaron los hiperparámetros CNN para la detección de tumorescerebrales 16,17, destacando el rendimiento superior de Adam sin analizar cómo responde a los cambios de preprocesamiento. Herramientas de explicabilidad como el Gradient-weighted Class Activation Mapping (Grad-CAM) y las SHapley Additives ExPlanations (SHAP) han avanzado nuestra comprensión de la toma de decisiones CNN al visualizar regiones discriminativas porclase 19,20. Estos métodos son esenciales para validar si el preprocesamiento mejora o distorsiona la retención semántica.
Sin embargo, pocos estudios han examinado sistemáticamente cómo el preprocesamiento afecta a la convergencia, generalización e interpretabilidad de los optimizadores bajo una arquitectura fija, cuestiones que son tanto clínicas como computacionalmente significativas. Clínicamente, un suavizado excesivo o transformaciones de intensidad pueden atenuar gradientes de textura y espaciales relevantes para el diagnóstico, reduciendo la fidelidad de localización y la confianza del clínico. Computacionalmente, los optimizadores reaccionan de forma diferente a los cambios en la escala de características y la varianza del gradiente; los desajustes entre la complejidad de entrada y la dinámica del optimizador pueden producir convergencia inestable o una generalización peor.
Para abordar esto, introducimos un marco de doble camino que compara sistemáticamente las pipelines de preprocesamiento base (solo por redimensionamiento) y las tradicionales entre tres optimizadores —Adam, RMSProp y SGD— utilizando una arquitectura CNN coherente y el conjunto de datosBR35H Kaggle 21. Evaluamos el rendimiento en la clasificación, la velocidad de convergencia y la interpretabilidad utilizando Grad-CAM, validado mediante cinco validaciones cruzadas. A diferencia de trabajos anteriores que confunden cambios arquitectónicos y de preprocesamiento, este protocolo aísla el preprocesamiento como una variable independiente, revelando que un filtrado agresivo puede dificultar el rendimiento del optimizador y la atención espacial.
El marco presentado aquí ofrece varias ventajas respecto a los modelos existentes. En primer lugar, evalúa explícitamente las interacciones entre las estrategias de preprocesamiento y los optimizadores, una dimensión que a menudo se pasa por alto en los estudios de aprendizaje en conjunto ytransferencia 15,16,17. En segundo lugar, mantiene una arquitectura CNN fija, simulando así restricciones de despliegue en el mundo real donde la reconfiguración suele ser poco práctica22. Tercero, integra métodos de atribución visual para evaluar la retención semántica, complementando trabajos previos en estudios radiómicos y de característicasartesanales 23. Por último, el marco ofrece información reproducible sobre estrategias de entrenamiento conscientes del preprocesamiento, mejorando así tanto la robustez como la interpretabilidad.
Al sintetizar conocimientos de los métodos de preprocesamiento 3,4,5, estudiosoptimizadores 16,17 y herramientas deexplicabilidad 19,20, este trabajo presenta una vía práctica e interpretable para la clasificación de tumores cerebrales que equilibra precisión, estabilidad y relevancia clínica.