$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Características del conjunto de datos
El estudio utilizó el conjunto de datos público Breast Ultrasound Images (BUSI), que proporcionó un repositorio bien documentado para el análisis y clasificación del cáncerde mama 29. Este conjunto de datos resultó especialmente apropiado porque incorporaba una vasta colección de imágenes de ultrasonido necesarias para establecer y validar modelos de aprendizaje profundo para la imagen médica. El conjunto de datos comprendía 780 imágenes de ecografía recogidas de 600 mujeres de entre 25 y 75 años, representando una población diversa para el diagnóstico de cáncer de mama. Todas las imágenes mantenían una resolución media de 500 x 500 píxeles y utilizaban el formato PNG para preservar datos visuales de alta calidad para su análisis. La Figura 1 ilustra el flujo de trabajo general del marco propuesto, incluyendo preprocesamiento, aumentación, extracción de características EfficientNet-B0, clasificación e interpretabilidad Grad-CAM.

Figura 1: Muestras representativas del conjunto de datos BUSI. (A) Imágenes benignas, (B) malignas y (C) normales. Los paneles ilustran la diversidad morfológica utilizada para la formación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
2. Flujo de trabajo experimental
Para garantizar la reproducibilidad, la investigación ejecutó la cadena de procesamiento en etapas secuenciales. Primero, el sistema cargó las imágenes de ultrasonido BUSI y las correspondientes máscaras de verificación en tierra y las redimensionó a 224×224 píxeles, seguido de la normalización ImageNet. En segundo lugar, el marco superpuso cada imagen con su máscara para enfatizar las regiones de la lesión antes de dividir el conjunto de datos en subconjuntos de entrenamiento (70%), validación (15%) y pruebas (15%) usando muestreo estratificado. En tercer lugar, el estudio aplicó aumentos dirigidos que consistían en volteo horizontal, rotación (±15°) y vibración de color principalmente a las clases minoritarias. En cuarto lugar, los investigadores ajustaron finamente el modelo EfficientNet-B0, que estaba preentrenado en ImageNet, reemplazando la capa final de clasificación por una capa de salida de tres clases. El proceso de entrenamiento empleó el optimizador Adam (tasa de aprendizaje 0,00005), decaimiento de la tasa de aprendizaje escalonado (γ = 0,1 cada 7 épocas), pérdida de entropía cruzada, un tamaño de lote de 8 y parada temprana con una paciencia de 2. Finalmente, Grad-CAM generó mapas de calor de atención a partir de la última capa convolucional para visualizar regiones diagnósticamente relevantes y apoyar la interpretación clínica. La Tabla de Materiales enumera los conjuntos de datos esenciales, bibliotecas de software y configuraciones de hardware necesarias para reproducir el marco de clasificación e interpretabilidad por ecografía mamaria del estudio.
El conjunto de datos BUSI mostró un desequilibrio natural de clases, una característica frecuentemente observada en los conjuntos médicos. La distribución favoreció la clase benigna, seguida de casos malignos y normales. Específicamente, el conjunto de datos contenía 487 imágenes benignas, 210 malignas y 133 normales. Aunque la mejora de datos aumentó la variabilidad del entrenamiento, no alteró el recuento fundamental de muestras en cada clase. Esta distribución reflejaba escenarios clínicos reales donde las condiciones benignas ocurren con mayor frecuencia que los tumores malignos. Aunque dicho desequilibrio reflejaba con precisión la prevalencia de anomalías mamarias en entornos clínicos, presentaba desafíos para el entrenamiento en aprendizaje profundo, ya que podía conducir a predicciones sesgadas y a un rendimiento subóptimo para las clases minoritarias. En consecuencia, mitigar este desequilibrio se volvió esencial para formular un modelo eficaz y generalizable que funcionara de manera eficiente en todas las categorías diagnósticas. La Figura 2 muestra imágenes representativas de ecografía del conjunto de datos, ilustrando ejemplos de muestras de tejido mamario benigno, maligno y normal.

Figura 2: Flujo de trabajo propuesto del modelo. Pipeline secuencial desde el preprocesamiento de entrada y superposición de máscaras hasta el entrenamiento EfficientNet-B0 y la salida Grad-CAM. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
3. Preprocesamiento de datos
El estudio redimensionó todas las imágenes a 224 x 224 píxeles, cumpliendo con las dimensiones estándar de entrada para la arquitectura EfficientNet-B0. Este redimensionamiento aseguró la consistencia del conjunto de datos y redujo los requisitos computacionales, tal y como se define en la ecuación 1.
El marco normalizó los valores de píxeles usando la media y desviación estándar del conjunto de datos ImageNet ([0,485, 0,456, 0,406] para la media y [0,229, 0,224, 0,225] para la std). Esta normalización escaló los datos de entrada para mejorar la estabilidad del entrenamiento y la velocidad de convergencia, calculada según la ecuación 2.
Para mejorar la extracción de características y la identificación de regiones de interés, los investigadores superpusieron las imágenes originales sobre sus correspondientes máscaras de verdad de terreno. La Figura 3 ilustra las mascarillas de lesiones de base y las imágenes ecografias superpuestas resultantes que resaltaron los límites tumorales.

Figura 3: Máscara e imágenes superpuestas. (A) Ecografía original, (B) mascarilla de precisión en el terreno y (C) superposición resultante que resalta los límites tumorales para la atención espacial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Esta superposición identificó regiones críticas, como márgenes tumorales y patrones de texturas, proporcionando al modelo un contexto espacial localizado para mejorar la precisión de la clasificación, como se muestra en la ecuación 3.
El estudio utilizó la operación de superposición de máscara exclusivamente durante la preparación de datos de entrenamiento para complementar el conocimiento del límite de la lesión durante el aprendizaje de características. En cambio, las fases de validación e inferencia emplearon únicamente las imágenes originales de ultrasonido sin máscaras, manteniendo una línea convencional de clasificación de imágenes. Debido a que las máscaras de segmentación binaria en el conjunto de datos BUSI representaban estructuras ya inherentes a las imágenes de ultrasonido, no introdujeron nuevas etiquetas de clase. Para evitar fugas de información, la investigación dividió el conjunto de datos en conjuntos de entrenamiento, validación y prueba, asegurando que no se compartieran pares superpuestos de imágenes o máscaras entre subconjuntos. En consecuencia, la superposición funcionó como una guía de atención espacial que resaltaba áreas anatómicamente significativas sin comprometer la independencia de los datos de evaluación.
4. Aumento de datos
El estudio implementó aumentos de datos dirigidos para mitigar el desequilibrio de clases dentro del conjunto de entrenamiento, centrándose específicamente en las clases malignas y normales de minorías. El marco utilizó una amplia gama de transformaciones para aumentar artificialmente la variabilidad de los datos de entrenamiento y mejorar la capacidad del modelo para generalizar entre diversas condiciones de imagen.
Primero, el sistema realizó inversiones horizontales con una probabilidad de 0,9 (90%), permitiendo al modelo reconocer características independientemente de la dirección de escaneo. Esta transformación siguió la ecuación 4:
En segundo lugar, la investigación aplicó rotaciones aleatorias dentro de un rango de ±15° para simular variaciones en los ángulos de escaneo y la posición del paciente. Este proceso obligó al modelo a aprender características invariantes a la rotación, como márgenes tumorales y patrones de texturas, tal como se define en la ecuación 5:
En tercer lugar, los investigadores utilizaron el vibración de color para simular variaciones en la iluminación, el contraste y el equilibrio de color. El marco ajustaba el brillo, el contraste y la saturación por un factor de 0,2, y el matiz por 0,1. Estos ajustes estocásticos mejoraron la robustez del modelo a los cambios de apariencia, calculados según la ecuación 6:
La selección de estos rangos específicos de hiperparámetros (invertido horizontal 0,9, rotación +15, -15, brillo/contraste/saturación 0,2, matiz 0,1) resultó de una evaluación empírica de estabilidad. La investigación determinó que estos ajustes optimizaban el equilibrio entre la generación de diversidad y el realismo anatómico, asegurando una convergencia constante y una precisión de validación estables sin inducir deformaciones irreales de las lesiones.
5. Arquitectura de modelos
El estudio utilizó EfficientNet-B0, un modelo CNN moderno reconocido por su eficiencia, escalabilidad y rendimiento en comparación con otras arquitecturas de clasificación de imágenes. Este modelo empleaba un método para escalar proporcionalmente la profundidad, el ancho y la resolución de la red, lo que permitía una alta precisión con un número significativamente reducido de parámetros en comparación con arquitecturas estándar como ResNet y VGG. Este enfoque de escalado permitió al marco manejar imágenes de alta resolución manteniendo la eficiencia computacional, adaptándose a las necesidades específicas de la imagen médica. La Figura 4 ilustra la arquitectura de EfficientNet-B0, destacando la secuencia de bloques convolucionales y MBConv usados para la extracción jerárquica de características.

Figura 4: Arquitectura EfficientNet-B0. Esquema de bloques MBConv y factores de escalado compuestos usados para la extracción jerárquica de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Para modificar EfficientNet-B0 para la tarea de clasificación por ecografía de mama, los investigadores introdujeron ajustes específicos en la estructura del modelo. El sistema sustituyó la capa inicial de clasificación, destinada al conjunto de datos de 1.000 clases ImageNet, por una capa totalmente conectada (densa) compuesta por 3 neuronas de salida. La investigación estableció todas las capas de la columna vertebral preentrenada EfficientNet-B0 como entrenables y las optimizó conjuntamente con la nueva capa de clasificación, siguiendo una estrategia completa de ajuste fino. El proceso de entrenamiento no aplicó congelación por etapas ni descongelación gradual. El framework realizaba entrenamiento usando el optimizador Adam con una tasa de aprendizaje de 0,00005 y un programador de tasa de aprendizaje por pasos que reducía la tasa por un factor de 0,1 cada 7 épocas. Estas neuronas correspondían a las tres clases objetivo dentro del conjunto de datos de BUSI: benignas, normales y malignas. El modelo utilizaba una activación SoftMax en la capa de salida, transformando las puntuaciones brutas en distribuciones de probabilidad, tal y como se calcula en la ecuación 7. La Tabla 2 muestra la descripción de la arquitectura del modelo.
| Tipo de capa | Descripción |
| Capa de entrada | Acepta imágenes de tamaño 224 x 224 x 3 |
| Capas convolucionales | Incluye convolución inicial y bloques MBConv para la extracción de características. |
| Agrupación Media Global | Reduce las dimensiones espaciales a un vector de características 1D. |
| Capa totalmente conectada | Asigna el vector característica a 3 neuronas de salida (normal, benigna, maligna). |
| Activación de SoftMax | Convierte logits en probabilidades para clasificación multiclase. |
Tabla 2: Muestra la descripción de la arquitectura del modelo.
Los parámetros utilizados para entrenar el modelo fueron el optimizador de Adam, una tasa de aprendizaje inicial de 0,00005, y la pérdida categórica de entropía cruzada (tres clases), calculada matemáticamente según la ecuación 9. Se usaron pesos preentrenados de ImageNet para inicializar EfficientNet-B0, y se entrenaron completamente, y todas las capas de columna vertebral se entrenaron sin aplicar congelación por etapas. El clasificador inicial fue sustituido por una capa totalmente conectada y tres neuronas de salida y, finalmente, activación SoftMax, que representaba las clases benigna, maligna y normal. Las imágenes se redujeron a 224 x 224 píxeles, luego se normalizaron mediante la media y desviación estándar de ImageNet y se cargaron en mini-lotes de 8. Un planificador de tasa de aprendizaje por pasos reducía la tasa de aprendizaje en 0,1 cada 7 épocas. La pérdida de validación se utilizó para detener temprano con paciencia de 2 épocas para evitar sobreajustes. Las activaciones Grad-CAM se produjeron basándose en la última capa convolucional calculando gradientes, agrupación de medias globales para obtener pesos de canales y escalado de los mapas de activación a la resolución de entrada.
Para confirmar esa estabilidad, el entrenamiento se repetía a lo largo de varias partidas con rendimiento de validación Matching. Se utilizó el seguimiento de las curvas de pérdida de entrenamiento y validación para identificar sobreajustes, y se utilizó un conjunto de pruebas estratificado de retención que no dependía del entrenamiento para realizar la evaluación final. La diferencia entre el rendimiento de validación y el rendimiento de la prueba es pequeña, lo que muestra convergencia consistente y reproducibilidad de optimización. La ecuación 10 define un calendario de tasas de aprendizaje escalonado. La ecuación 15 indica dos aumentos consecutivos en la pérdida de validación, lo que indica posible sobreajuste.
EfficientNet-B0 es especialmente flexible para la tarea de clasificación por ecografía mamaria, ya que la arquitectura incluye varios aspectos arquitectónicos innovadores que permiten la eficiencia y rapidez de la arquitectura. La parte central es el MBConv, que une convoluciones separables en profundidad con módulos de compresión y excitación para proporcionar menor complejidad computacional sin pérdida de precisión. El modelo también soporta una escala de compuestos que escala profundidad, anchura y resolución de forma uniforme para lograr un rendimiento óptimo en todo tipo de restricciones de recursos, y el modelo también es ágil en tareas, que se deriva matemáticamente como en la siguiente ecuación 8. El modelo ya contiene pesos entrenados con el conjunto de datos ImageNet y, por tanto, puede transferirse para aprender y, en gran medida, no es necesario entrenar el modelo con conjuntos de datos médicos pequeños. Esta combinación de características de alto nivel, así como el entorno de entrenamiento personalizado, que también contiene los cambios en la capa final de clasificación, el uso del optimizador Adam, el planificador de tasa de aprendizaje y la parada temprana, aseguran que el modelo sea altamente preciso, pero al mismo tiempo eficiente computacionalmente. Esta combinación de inventiva arquitectónica y enfoques formativos permitirá al modelo aprender de forma eficiente basándose en la mala información de imagen médica y, por tanto, resultará ser un instrumento útil en la categorización de la ecografía mamaria.
Algoritmo 1: Clasificación de imágenes por ecografía mamaria usando EfficientNet-B0 y Grad-CAM
Entrada: Imágenes de ecografía mamaria.
Salida: Clasificación (normal, benigno, maligno) y mapas de calor Grad-CAM.
1. Preprocesar imágenes:
Redimensiona a 224×224224×224.
Normaliza usando la media y la ETS de ImageNet.
Aumenta con volteo, rotación y vibraciones de color.
2. Inicializar modelo:
Load Efficient Net-B0 (preentrenada, excluye la capa superior).
Añade Global Average Pooling y una capa densa (3 neuronas, SoftMax).
3. Modelo de tren:
Optimizador: Adam (tasa de aprendizaje = 0,00005).
Pérdida: Entropía cruzada.
Entrena durante 18 épocas con paradas tempranas (paciencia = 2).
4. Visualización Grad-CAM:
Calcula los gradientes de la clase objetivo.
Genera y superpone mapas de calor sobre las imágenes de entrada.
El algoritmo proporciona el flujo de trabajo de clasificación de imágenes de ultrasonido mamario con EfficientNet-B0 y Grad-CAM, incluyendo preprocesamiento, entrenamiento e inferencia del modelo, así como el mapa de calor interpretable para validar clínicamente.
6. Grad-CAM como IA explicable
Una herramienta sólida utilizada en el estudio es capaz de añadir interpretabilidad al modelo de aprendizaje profundo, el Mapeo de Activación de Clases ponderado por gradiente. Considerando una solución a la urgente necesidad actual de XAI en la imagen clínica, el método emplea Grad-CAM para permitir a los clínicos comprender intuitivamente la toma de decisiones del modelo que se ha realizado mediante mapas de calor visualmente explicables alrededor de las regiones más significativas de una imagen utilizada en la predicción del modelo. Dicha convergencia de interpretabilidad será fundamental para generar confianza en los sistemas de IA, especialmente en los de alto riesgo como la sanidad, donde la rendición de cuentas y la transparencia son esenciales. La Figura 5 presenta mapas de calor Grad-CAM que destacan las regiones de imagen que más influyeron en las predicciones del modelo para casos benignos, malignos y normales.

Figura 5: Mapas de calor de activación Grad-CAM. (A) Benignos, (B) Malignos y (C) Normales. Los colores cálidos (rojo) indican una alta influencia diagnóstica; los colores fríos (azul) indican menor atención. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Todas las imágenes Grad-CAM se muestran además de la imagen de entrada que se le ha dado al modelo. La Figura 5 muestra la imagen original de ultrasonido y la imagen de entrada del modelo para asegurar que las regiones de atención cercana estén directamente relacionadas con la entrada procesada que se considera en la predicción. Para obtener importancia por canal, Grad-CAM se utiliza para calcular gradientes de la clase predicha utilizando mapas de características de la capa convolucional final. Estos gradientes se promedian a nivel mundial para obtener los coeficientes de ponderación y luego se multiplican con los mapas de características respectivos para producir un mapa de calor de localización (ecuaciones 16 y 17). El mapa de calor se muestra luego a la resolución de entrada y se superpone a la imagen de ultrasonido para indicar áreas de interés diagnóstico (por ejemplo, márgenes tumorales, cambios en la textura, etc.) en la imagen. Esta visualización ofrece una comprensión espacial de las áreas que se utilizan para hacer la predicción en el modelo. Este artículo mide la interpretabilidad mediante análisis visual de la localización de la atención. No incluyeron medidas cuantitativas de localización ni evaluación basada en el clínico, que siguen siendo vías valiosas para la validación futura de la relevancia clínica.
Grad-CAM ofrece predicciones sobre cómo funciona visualmente un modelo resaltando áreas de una imagen que contribuyeron a la predicción. Los mapas de calor pueden usarse para confirmar que la red se concentra en estructuras clínicamente relevantes que incluyen márgenes tumorales y patrones acústicos. En las falsas alarmas, las visualizaciones pueden ayudar a detectar el foco en áreas irrelevantes, asistiendo en la evaluación y optimización del modelo. Esta correspondencia entre las características médicas y la atención del modelo mejora la interpretabilidad del diagnóstico asistido por IA. La Figura 6 muestra la visualización de GradCAM.

Figura 6: Visualización de GradCAM. Mapa de calor Grad-CAM que muestra regiones importantes (rojo = alto, azul = bajo) para la clasificación; La intensidad del color indica la importancia de las características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Se añade Grad-CAM para aumentar la interpretabilidad del modelo EfficientNet-B0 destacando regiones de imagen que aportan la mayor contribución a las elecciones de clasificación. Los mapas de calor resultantes indican estructuras clínicamente significativas de los márgenes tumorales y cambios en la textura, lo que facilita un análisis claro de las predicciones del modelo. Esta alta precisión en la clasificación y la interpretabilidad visual hacen que este marco propuesto sea más sólido en cuanto a fiabilidad en el análisis de las imágenes de ecografía mamaria.
7. Análisis estadístico
El modelo se evalúa sobre un amplio conjunto de métricas, como la precisión, como medida de la exactitud de las predicciones positivas; recordar, como medida de la efectividad del modelo para identificar todos los casos relevantes; y la puntuación F1, la media armónica de precisión y recuerdo, que proporciona una medida equilibrada del rendimiento global que se calcula matemáticamente según las ecuaciones 18–21.
El Error Absoluto Medio (EMA) cuantifica la diferencia absoluta media entre predicciones y valores verdaderos, calculada matemáticamente según la ecuación 22.
El Error Cuadrático Medio Raíz (RMSE) mide la desviación media de las predicciones respecto a los valores verdaderos, calculada matemáticamente según la ecuación 23.
El Error Absoluto Medio (MAE) cuantifica la diferencia absoluta media entre predicciones y valores verdaderos, calculada matemáticamente según la ecuación 24.
La matriz de confusión se utiliza para proporcionar un desglose detallado de los verdaderos positivos, verdaderos negativos, falsos positivos y falsos negativos por clase, proporcionando más información sobre cómo el modeloclasifica el 30. Estas medidas de evaluación combinadas proporcionan una evaluación global del error del modelo, la fuerza y la generalización sobre datos no observados, convirtiéndolas en una herramienta fiable para clasificar imágenes de una ecografía mamaria. La disponibilidad de mascarillas de lesión en el conjunto de datos BUSI implica que en el futuro se podrán introducir medidas cuantitativas de localización, por ejemplo, la intersección sobre la unión, para evaluar objetivamente la precisión de la explicación. La validación estratificada de retención se había elegido para preservar la independencia entre los subconjuntos de entrenamiento y evaluación que mantenían la distribución de clases. La razón para no utilizar la validación cruzada era evitar la exposición repetitiva de muestras de validación al proceso de optimización, pero en futuros estudios se utilizará la validación cruzada repetida o anidada para determinar aún más las variaciones en el rendimiento.