Artículo de método

Un método explicable de aprendizaje por transferencia basado en IA para la predicción del cáncer de mama

DOI:

10.3791/70011

22 de junio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se desarrolla un protocolo explicable de aprendizaje por transferencia utilizando EfficientNet-B0 y Grad-CAM para clasificar las imágenes de ecografía mamaria en categorías benignas, malignas y normales, proporcionando mapas de calor diagnósticos interpretables adecuados para aplicaciones de apoyo a la decisión clínica.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La identificación del cáncer de mama mediante imágenes ultrasónicas requiere alta precisión y transparencia para ayudar a los clínicos a tomar decisiones adecuadas. Este trabajo demuestra un sistema de aprendizaje profundo para la clasificación de imágenes de ultrasonido mamario en imágenes benignas, malignas y normales utilizando la arquitectura EfficientNet-B0 ajustada con el conjunto de datos Breast Ultrasound Identification (BUSI). Para mitigar el desequilibrio de clases y estabilizar la red, se aplica aumento de datos, incluyendo inversiones horizontales aleatorias, rotación y vibraciones de color. El mapeo de activación por clases ponderado por gradiente (Grad-CAM) se utiliza para generar explicaciones visuales identificando regiones de interés como márgenes tumorales y patrones de texturas. El modelo alcanzó una precisión media del 99%, demostrando una alta eficacia en la detección de lesiones. La integración de la IA Explicable (XAI) no solo mejora la confianza en el diagnóstico, sino que también conecta la práctica clínica con la IA. Los resultados demuestran el potencial de combinar modelos de aprendizaje profundo de alto rendimiento con métodos de interpretabilidad para desarrollar herramientas fiables de diagnóstico del cáncer de mama adecuadas para la práctica clínica real.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de mama es una de las enfermedades potencialmente mortales más significativas que afectan a las mujeres en todo el mundo. Según la Organización Mundial de la Salud (OMS), el cáncer de mama contribuye a la mayoría de las muertes relacionadas con el cáncer, y el diagnóstico precoz es fundamental para mejorar la tasa desupervivencia 1. La ecografía se ha convertido en un procedimiento diagnóstico rutinario para el cáncer de mama porque es segura, económica y puede producir imágenes en tiempo real. A diferencia de la mamografía, la ecografía es extremadamente eficaz para diferenciar masas sólidas y crecimientos que contienen líquido y, por tanto, sirve como una excelente ayuda diagnóstica en presencia de patologías mamarias. La interpretación de imágenes por ultrasonido es altamente subjetiva y depende de un nivel avanzado de conocimiento, y causa variabilidad en el diagnóstico y posible error humano.

En los últimos años, la IA y el aprendizaje profundo han demostrado vastas capacidades en la automatización del análisis de imágenes médicas. Los modelos basados en aprendizaje profundo, especialmente las CNN, destacan en segmentación, detección y clasificaciónde objetos 2. Sin embargo, la adopción de la IA en la sanidad está limitada por la naturaleza de "caja negra" de estos modelos. El término "caja negra" se refiere a la falta de transparencia en cómo un modelo llega a una conclusión específica; Aunque se conocen las entradas y salidas, la lógica interna y las características específicas utilizadas para hacer una predicción clínica permanecen ocultas al usuario.

La motivación para este trabajo proviene de la urgente necesidad de instrumentos fiables para apoyar el diagnóstico precoz del cáncer de mama, que sigue siendo una de las principales causas de mortalidad femenina a nivel mundial. Aunque los modelos de aprendizaje profundo son muy efectivos, su falta de interpretabilidad limita la integración en entornosclínicos 3. El trabajo actual aborda estas carencias empleando EfficientNet-B0 para la clasificación de alto rendimiento e integrando técnicas de IA Explicable (XAI), como Grad-CAM, para proporcionar información visual sobre el proceso de toma de decisiones del modelo. Equilibrando transparencia y precisión, este estudio pretende desarrollar un sistema de IA fiable que proporcione un sólido apoyo diagnóstico a los clínicos. Los métodos XAI revelan el razonamiento subyacente de las predicciones de modelos, permitiendo a los clínicos verificar resultados y cerrar la brecha entre la práctica clínica y los sistemasautomatizados 4. En la clasificación por ecografía mamaria, esta interpretabilidad garantiza que los diagnósticos basados en IA sean tanto precisos como clínicamente justificables.

A pesar de los avances en el aprendizaje profundo, la clasificación de imágenes por ecografía mamaria no está exenta de desafíos, incluyendo el desequilibrio de clases, donde las clases minoritarias como tumores malignos están infrarrepresentadas, lo que conduce a modelossesgados 5. La falta de interpretabilidad en los modelos de deep learning dificulta su aplicación en la práctica clínica, ya que los clínicos requieren una toma de decisiones transparente. Las limitaciones del conjunto de datos, como el tamaño y la diversidad limitados, limitan la generalizabilidad de los modelos, mientras que las características complejas de las imágenes en ultrasonidos, como los bordes tumorales y la textura, son difíciles de aprender6. Las soluciones a los problemas mencionados requieren un marco robusto e interpretable que garantice alta precisión con una clara comprensión de la prediccióndel modelo 7.

El estudio pretende desarrollar un marco de aprendizaje profundo capaz de clasificar las imágenes de ecografía mamaria en categorías benignas, malignas y normales, al tiempo que mejora la generalización mediante aumentos dirigidos para las clases minoritarias. El marco integra el Mapeo de Activación de Clases ponderado por gradiente para proporcionar explicaciones visuales de las predicciones y evalúa el rendimiento utilizando precisión, precisión, recuerdo y puntuación F1, demostrando su idoneidad como sistema de apoyo a la decisión clínica interpretable. En contraste con los estudios explicables basados en ultrasonidos sobre cáncer de mama realizados anteriormente, donde Grad-CAM se utiliza principalmente como visualizaciónpost-hoc 8, el marco propuesto combina el preprocesamiento consciente de la lesión y el aprendizaje consciente de clase en la fase de entrenamiento. Las mascarillas de referencia del conjunto de datos Breast Ultrasound Images (BUSI) se superponen sobre las imágenes de ecografía para resaltar los límites de las lesiones y los patrones internos de eco al extraer características, y se utiliza aumento selectivo en grupos diagnósticos minoritarios para reducir el desequilibrio en las clases sin cambiar características de apariencia clínicamentesignificativas 9. Esta combinación de mejora de lesiones impulsada por lesiones, aprendizaje por transferencia EfficientNet-B0 y explicabilidad Grad-CAM es una combinación que mejora la robustez diagnóstica y produce interpretaciones coherentes con la morfología de la lesión, lo que justifica la hipótesis de que el aumento y explicabilidad anatómicamente guiada de la lesión pueden hacer que el diagnóstico del cáncer de mama asistido por IA sea fiable y dignode confianza 10.

La imagen médica tradicional se basaba tradicionalmente en métodos convencionales de procesamiento de imágenes, incorporando filtrado, segmentación y operaciones morfológicas para identificar estructuras visibles para el diagnóstico11. Sin embargo, estos procesos generalmente requerían ajuste manual y tenían dificultades para adaptarse a la variabilidad y complejidad inherentes de las imágenes médicas. Por ejemplo, la interpretación por ecografía mamaria dependía históricamente de la experiencia subjetiva de los radiólogos, donde la identificación de lesiones malignas y benignas se basaba en representaciones visuales propensas a errores humanos o mala interpretación.

La llegada del aprendizaje profundo ha catalizado una revolución transformadora en la imagen médica, principalmente a través del despliegue de Redes Neuronales Convolucionales (CNNs)12. Entre ellas, EfficientNet-B0 representa una innovación significativa, utilizando un método de escalado compuesto que equilibra la profundidad, el ancho y la resolución de la red para lograr cálculos altamente eficientes y precisos. En el contexto de la ecografía mamaria, el modelo utiliza capas convolucionales secuenciales para aprender automáticamente las características jerárquicas, eliminando efectivamente la necesidad de extracción manual subjetiva de características y mejorando significativamente la precisión y fiabilidaddiagnóstica. A pesar de este impresionante potencial, el aprendizaje profundo en imagen médica sigue siendo un campo en evolución con desafíos sin resolver. La calidad y disponibilidad de los datos son fundamentales, ya que los modelos de aprendizaje profundo requieren grandes repositorios de imágenes anotadas para garantizar una generalización exitosa. Además, la naturaleza de "caja negra" de estos modelos supone importantes obstáculos para la aceptación clínica; Las preocupaciones éticas sobre posibles sesgos en los datos de entrenamiento también pueden conducir a predicciones diagnósticas sesgadaso discriminatorias 14. En consecuencia, esta investigación requiere protocolos rigurosos de pruebas y validación para garantizar que los modelos se mantengan objetivos y clínicamente sólidos. Para abordar estas limitaciones, los desarrollos actuales en aprendizaje profundo se centran en mejorar la interpretabilidad y robustez de los modelos. Técnicas como el Gradient-weighted Class Activation Mapping (Grad-CAM), aplicadas en este estudio, permiten la visualización de regiones específicas de la imagen que influyen en los resultados del modelo, fomentando así una comprensión más profunda del comportamiento del modelo y apoyando la toma de decisiones clínicas. Además, los avances en marcos de aprendizaje federado facilitan colaboraciones conscientes de la privacidad entre instituciones, permitiendo el uso de datos heterogéneos sin necesidad de compartir conjuntos de datos en bruto. Estos avances están permitiendo cada vez más aplicaciones de aprendizaje profundo fiables, interpretables e imparciales en imagen médica, mejorando en última instancia los criterios clínicos y la atención al paciente 15.

La importancia de los sistemas de decisión médicainterpretables 16 se ha puesto de manifiesto gracias a los avances recientes en inteligencia artificial explicable. Marcos interpretables: los marcos interpretables basados en fusión han mostrado mejor clasificación y transparencia mediante la combinación de más de una representación de características y más de un mecanismo deexplicación 17. Investigaciones recientes han demostrado un alto potencial de utilizar modelos de aprendizaje profundo junto con los métodos XAI para aumentar la confianza diagnóstica en el diagnóstico del cáncer de mama y otras tareas de predicción médica. Estos artículos respaldan la necesidad de contar tanto con un razonamiento predictivo como interpretable por parte de los clínicos, lo cual es coherente con el objetivo del estudio actual de crear un sistema de clasificación por ecografías eficaz ycomprensible 18.

La Tabla 1 presenta la revisión bibliográfica y las tecnologías existentes.

EstudioObjetivoObservación
Humayra Afrin et al. (2023)19Revisa aplicaciones de aprendizaje profundo para el diagnóstico y pronóstico de ecografías de masa mamaria.La clasificación de las lesiones mostró el mayor rendimiento, con menos estudios sobre el pronóstico.
Gelan Ayana et al. (2022)20Revisa los nanoportadores guiados por ultrasonidos para la quimioterapia contra el cáncer de mama.Los nanoportadores sensibles a la ecografía mejoran la administración de fármacos pero enfrentan barreras fisiológicas.
Valerio Di Paola et al. (2022)21Analizar técnicas de imagen para obtener una estadificación N-precisa en el cáncer de mama.La resonancia magnética y la ecografía juegan papeles clave, pero los falsos positivos o negativos afectan a la precisión diagnóstica.
Adyasha Sahu et al. (2024)22Propone un clasificador de aprendizaje profundo conjunto para la detección del cáncer de mama.Alcanzó alta precisión usando AlexNet, ResNet y MobileNetV2 con LoG y alta potenciación.
Alireza Rezazadeh et al.(2022)23Desarrollar una cadena explicable de aprendizaje automático para el diagnóstico del cáncer de mama utilizando imágenes por ecografía.Utiliza características de texturas y conjuntos de árboles de decisión para mejorar la interpretabilidad de las predicciones.
Asaf Raza et al. (2023)24Desarrolla DeepBreastCancerNet para una detección robusta del cáncer de mama.Alcanzó una precisión del 99,63% usando arquitectura de 24 capas con múltiples optimizaciones.
Kiran Jabeen et al. (2022)25Proponer un marco de aprendizaje profundo usando DarkNet-53 y fusión de características.Logró un 99,1% de precisión utilizando técnicas optimizadas de selección de características.
Gelan Ayana et al. (2022)26Desarrollar aprendizaje por transferencia multietapa (MSTL) para la clasificación por ecografía del cáncer de mama.Mejora de la precisión usando aprendizaje de transferencia basado en imágenes médicas con EfficientNetB2, InceptionV3 y ResNet50.
Saksham Gupta et al. (2023)27Utiliza ResNet50 modificado para la clasificación por ecografía del cáncer de mama.Logró un 97,8% de precisión, reduciendo el tiempo de diagnóstico y mejorando la detección precoz.
Karl Kratkiewicz et al. (2022)28Revisa métodos avanzados de imagen como la tomografía por ultrasonido (UST) y la tomografía fotoacústica (PAT).La UST y la PAT mejoran la detección del cáncer de mama mediante imágenes cuantitativas.

Tabla 1: Muestra la literatura y la revisión de tecnologías existentes.

El modelo sugerido se basa en los logros del aprendizaje profundo en la clasificación de imágenes de ultrasonido mamario, que supera los principales retos de esta investigación, incluyendo la calidad de los datos, la interpretabilidad de un modelo y la eficiencia de los cálculos. En contraste con las técnicas antiguas, donde se utiliza la extracción manual de características, en este trabajo los autores aprovechan EfficientNet-B0, la arquitectura más reciente, que combina profundidad, anchura y resolución para crear el mejor esquema de trabajo. El modelo utiliza Grad-CAM para visualizar la explicación de su predicción, lo que aumenta su transparencia y confianza clínica. Aunque las soluciones actuales, incluidos los modelos de conjunto y el aprendizaje por transferencia, se han vuelto muy precisas, no pueden interpretarse fácilmente o pueden requerir una gran cantidad de potencia de cálculo. El trabajo presentado aborda estas carencias ya que es altamente preciso (99) e interpretable para garantizar que el modelo sea fiable y viable en aspectos prácticos de la toma de decisiones clínicas. El enfoque propuesto centrándose en el desequilibrio entre las clases y el uso práctico es un nuevo estándar de diagnóstico de cáncer de mama impulsado por IA.

El artículo utiliza un BUSI disponible públicamente, un conjunto previamente recopilado de imágenes clínicas anonimizadas. No hubo sujetos humanos ni animales directos en este estudio, por lo que no fue necesario obtener la aprobación ética institucional (IRB/IACUC). Todas las operaciones se realizan conforme a estándares comunes sobre el uso secundario de los datos de imagen médica disponibles públicamente.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Características del conjunto de datos

El estudio utilizó el conjunto de datos público Breast Ultrasound Images (BUSI), que proporcionó un repositorio bien documentado para el análisis y clasificación del cáncerde mama 29. Este conjunto de datos resultó especialmente apropiado porque incorporaba una vasta colección de imágenes de ultrasonido necesarias para establecer y validar modelos de aprendizaje profundo para la imagen médica. El conjunto de datos comprendía 780 imágenes de ecografía recogidas de 600 mujeres de entre 25 y 75 años, representando una población diversa para el diagnóstico de cáncer de mama. Todas las imágenes mantenían una resolución media de 500 x 500 píxeles y utilizaban el formato PNG para preservar datos visuales de alta calidad para su análisis. La Figura 1 ilustra el flujo de trabajo general del marco propuesto, incluyendo preprocesamiento, aumentación, extracción de características EfficientNet-B0, clasificación e interpretabilidad Grad-CAM.

figure-protocol-1
Figura 1: Muestras representativas del conjunto de datos BUSI. (A) Imágenes benignas, (B) malignas y (C) normales. Los paneles ilustran la diversidad morfológica utilizada para la formación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

2. Flujo de trabajo experimental

Para garantizar la reproducibilidad, la investigación ejecutó la cadena de procesamiento en etapas secuenciales. Primero, el sistema cargó las imágenes de ultrasonido BUSI y las correspondientes máscaras de verificación en tierra y las redimensionó a 224×224 píxeles, seguido de la normalización ImageNet. En segundo lugar, el marco superpuso cada imagen con su máscara para enfatizar las regiones de la lesión antes de dividir el conjunto de datos en subconjuntos de entrenamiento (70%), validación (15%) y pruebas (15%) usando muestreo estratificado. En tercer lugar, el estudio aplicó aumentos dirigidos que consistían en volteo horizontal, rotación (±15°) y vibración de color principalmente a las clases minoritarias. En cuarto lugar, los investigadores ajustaron finamente el modelo EfficientNet-B0, que estaba preentrenado en ImageNet, reemplazando la capa final de clasificación por una capa de salida de tres clases. El proceso de entrenamiento empleó el optimizador Adam (tasa de aprendizaje 0,00005), decaimiento de la tasa de aprendizaje escalonado (γ = 0,1 cada 7 épocas), pérdida de entropía cruzada, un tamaño de lote de 8 y parada temprana con una paciencia de 2. Finalmente, Grad-CAM generó mapas de calor de atención a partir de la última capa convolucional para visualizar regiones diagnósticamente relevantes y apoyar la interpretación clínica. La Tabla de Materiales enumera los conjuntos de datos esenciales, bibliotecas de software y configuraciones de hardware necesarias para reproducir el marco de clasificación e interpretabilidad por ecografía mamaria del estudio.

El conjunto de datos BUSI mostró un desequilibrio natural de clases, una característica frecuentemente observada en los conjuntos médicos. La distribución favoreció la clase benigna, seguida de casos malignos y normales. Específicamente, el conjunto de datos contenía 487 imágenes benignas, 210 malignas y 133 normales. Aunque la mejora de datos aumentó la variabilidad del entrenamiento, no alteró el recuento fundamental de muestras en cada clase. Esta distribución reflejaba escenarios clínicos reales donde las condiciones benignas ocurren con mayor frecuencia que los tumores malignos. Aunque dicho desequilibrio reflejaba con precisión la prevalencia de anomalías mamarias en entornos clínicos, presentaba desafíos para el entrenamiento en aprendizaje profundo, ya que podía conducir a predicciones sesgadas y a un rendimiento subóptimo para las clases minoritarias. En consecuencia, mitigar este desequilibrio se volvió esencial para formular un modelo eficaz y generalizable que funcionara de manera eficiente en todas las categorías diagnósticas. La Figura 2 muestra imágenes representativas de ecografía del conjunto de datos, ilustrando ejemplos de muestras de tejido mamario benigno, maligno y normal.

figure-protocol-2
Figura 2: Flujo de trabajo propuesto del modelo. Pipeline secuencial desde el preprocesamiento de entrada y superposición de máscaras hasta el entrenamiento EfficientNet-B0 y la salida Grad-CAM. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

3. Preprocesamiento de datos

El estudio redimensionó todas las imágenes a 224 x 224 píxeles, cumpliendo con las dimensiones estándar de entrada para la arquitectura EfficientNet-B0. Este redimensionamiento aseguró la consistencia del conjunto de datos y redujo los requisitos computacionales, tal y como se define en la ecuación 1.

figure-protocol-3     

El marco normalizó los valores de píxeles usando la media y desviación estándar del conjunto de datos ImageNet ([0,485, 0,456, 0,406] para la media y [0,229, 0,224, 0,225] para la std). Esta normalización escaló los datos de entrada para mejorar la estabilidad del entrenamiento y la velocidad de convergencia, calculada según la ecuación 2.

figure-protocol-4      

Para mejorar la extracción de características y la identificación de regiones de interés, los investigadores superpusieron las imágenes originales sobre sus correspondientes máscaras de verdad de terreno. La Figura 3 ilustra las mascarillas de lesiones de base y las imágenes ecografias superpuestas resultantes que resaltaron los límites tumorales.

figure-protocol-5
Figura 3: Máscara e imágenes superpuestas. (A) Ecografía original, (B) mascarilla de precisión en el terreno y (C) superposición resultante que resalta los límites tumorales para la atención espacial. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Esta superposición identificó regiones críticas, como márgenes tumorales y patrones de texturas, proporcionando al modelo un contexto espacial localizado para mejorar la precisión de la clasificación, como se muestra en la ecuación 3.

figure-protocol-6      

El estudio utilizó la operación de superposición de máscara exclusivamente durante la preparación de datos de entrenamiento para complementar el conocimiento del límite de la lesión durante el aprendizaje de características. En cambio, las fases de validación e inferencia emplearon únicamente las imágenes originales de ultrasonido sin máscaras, manteniendo una línea convencional de clasificación de imágenes. Debido a que las máscaras de segmentación binaria en el conjunto de datos BUSI representaban estructuras ya inherentes a las imágenes de ultrasonido, no introdujeron nuevas etiquetas de clase. Para evitar fugas de información, la investigación dividió el conjunto de datos en conjuntos de entrenamiento, validación y prueba, asegurando que no se compartieran pares superpuestos de imágenes o máscaras entre subconjuntos. En consecuencia, la superposición funcionó como una guía de atención espacial que resaltaba áreas anatómicamente significativas sin comprometer la independencia de los datos de evaluación.

4. Aumento de datos

El estudio implementó aumentos de datos dirigidos para mitigar el desequilibrio de clases dentro del conjunto de entrenamiento, centrándose específicamente en las clases malignas y normales de minorías. El marco utilizó una amplia gama de transformaciones para aumentar artificialmente la variabilidad de los datos de entrenamiento y mejorar la capacidad del modelo para generalizar entre diversas condiciones de imagen.

Primero, el sistema realizó inversiones horizontales con una probabilidad de 0,9 (90%), permitiendo al modelo reconocer características independientemente de la dirección de escaneo. Esta transformación siguió la ecuación 4:

figure-protocol-7      

En segundo lugar, la investigación aplicó rotaciones aleatorias dentro de un rango de ±15° para simular variaciones en los ángulos de escaneo y la posición del paciente. Este proceso obligó al modelo a aprender características invariantes a la rotación, como márgenes tumorales y patrones de texturas, tal como se define en la ecuación 5:

figure-protocol-8      

En tercer lugar, los investigadores utilizaron el vibración de color para simular variaciones en la iluminación, el contraste y el equilibrio de color. El marco ajustaba el brillo, el contraste y la saturación por un factor de 0,2, y el matiz por 0,1. Estos ajustes estocásticos mejoraron la robustez del modelo a los cambios de apariencia, calculados según la ecuación 6:

figure-protocol-9      

La selección de estos rangos específicos de hiperparámetros (invertido horizontal 0,9, rotación +15, -15, brillo/contraste/saturación 0,2, matiz 0,1) resultó de una evaluación empírica de estabilidad. La investigación determinó que estos ajustes optimizaban el equilibrio entre la generación de diversidad y el realismo anatómico, asegurando una convergencia constante y una precisión de validación estables sin inducir deformaciones irreales de las lesiones.

5. Arquitectura de modelos

El estudio utilizó EfficientNet-B0, un modelo CNN moderno reconocido por su eficiencia, escalabilidad y rendimiento en comparación con otras arquitecturas de clasificación de imágenes. Este modelo empleaba un método para escalar proporcionalmente la profundidad, el ancho y la resolución de la red, lo que permitía una alta precisión con un número significativamente reducido de parámetros en comparación con arquitecturas estándar como ResNet y VGG. Este enfoque de escalado permitió al marco manejar imágenes de alta resolución manteniendo la eficiencia computacional, adaptándose a las necesidades específicas de la imagen médica. La Figura 4 ilustra la arquitectura de EfficientNet-B0, destacando la secuencia de bloques convolucionales y MBConv usados para la extracción jerárquica de características.

figure-protocol-10
Figura 4: Arquitectura EfficientNet-B0. Esquema de bloques MBConv y factores de escalado compuestos usados para la extracción jerárquica de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Para modificar EfficientNet-B0 para la tarea de clasificación por ecografía de mama, los investigadores introdujeron ajustes específicos en la estructura del modelo. El sistema sustituyó la capa inicial de clasificación, destinada al conjunto de datos de 1.000 clases ImageNet, por una capa totalmente conectada (densa) compuesta por 3 neuronas de salida. La investigación estableció todas las capas de la columna vertebral preentrenada EfficientNet-B0 como entrenables y las optimizó conjuntamente con la nueva capa de clasificación, siguiendo una estrategia completa de ajuste fino. El proceso de entrenamiento no aplicó congelación por etapas ni descongelación gradual. El framework realizaba entrenamiento usando el optimizador Adam con una tasa de aprendizaje de 0,00005 y un programador de tasa de aprendizaje por pasos que reducía la tasa por un factor de 0,1 cada 7 épocas. Estas neuronas correspondían a las tres clases objetivo dentro del conjunto de datos de BUSI: benignas, normales y malignas. El modelo utilizaba una activación SoftMax en la capa de salida, transformando las puntuaciones brutas en distribuciones de probabilidad, tal y como se calcula en la ecuación 7. La Tabla 2 muestra la descripción de la arquitectura del modelo.

figure-protocol-11      

Tipo de capaDescripción
Capa de entradaAcepta imágenes de tamaño 224 x 224 x 3
Capas convolucionalesIncluye convolución inicial y bloques MBConv para la extracción de características.
Agrupación Media GlobalReduce las dimensiones espaciales a un vector de características 1D.
Capa totalmente conectadaAsigna el vector característica a 3 neuronas de salida (normal, benigna, maligna).
Activación de SoftMaxConvierte logits en probabilidades para clasificación multiclase.

Tabla 2: Muestra la descripción de la arquitectura del modelo.

Los parámetros utilizados para entrenar el modelo fueron el optimizador de Adam, una tasa de aprendizaje inicial de 0,00005, y la pérdida categórica de entropía cruzada (tres clases), calculada matemáticamente según la ecuación 9. Se usaron pesos preentrenados de ImageNet para inicializar EfficientNet-B0, y se entrenaron completamente, y todas las capas de columna vertebral se entrenaron sin aplicar congelación por etapas. El clasificador inicial fue sustituido por una capa totalmente conectada y tres neuronas de salida y, finalmente, activación SoftMax, que representaba las clases benigna, maligna y normal. Las imágenes se redujeron a 224 x 224 píxeles, luego se normalizaron mediante la media y desviación estándar de ImageNet y se cargaron en mini-lotes de 8. Un planificador de tasa de aprendizaje por pasos reducía la tasa de aprendizaje en 0,1 cada 7 épocas. La pérdida de validación se utilizó para detener temprano con paciencia de 2 épocas para evitar sobreajustes. Las activaciones Grad-CAM se produjeron basándose en la última capa convolucional calculando gradientes, agrupación de medias globales para obtener pesos de canales y escalado de los mapas de activación a la resolución de entrada.

Para confirmar esa estabilidad, el entrenamiento se repetía a lo largo de varias partidas con rendimiento de validación Matching. Se utilizó el seguimiento de las curvas de pérdida de entrenamiento y validación para identificar sobreajustes, y se utilizó un conjunto de pruebas estratificado de retención que no dependía del entrenamiento para realizar la evaluación final. La diferencia entre el rendimiento de validación y el rendimiento de la prueba es pequeña, lo que muestra convergencia consistente y reproducibilidad de optimización. La ecuación 10 define un calendario de tasas de aprendizaje escalonado. La ecuación 15 indica dos aumentos consecutivos en la pérdida de validación, lo que indica posible sobreajuste.

figure-protocol-12      

figure-protocol-13      

figure-protocol-14      

figure-protocol-15      

figure-protocol-16      

figure-protocol-17      

figure-protocol-18      

EfficientNet-B0 es especialmente flexible para la tarea de clasificación por ecografía mamaria, ya que la arquitectura incluye varios aspectos arquitectónicos innovadores que permiten la eficiencia y rapidez de la arquitectura. La parte central es el MBConv, que une convoluciones separables en profundidad con módulos de compresión y excitación para proporcionar menor complejidad computacional sin pérdida de precisión. El modelo también soporta una escala de compuestos que escala profundidad, anchura y resolución de forma uniforme para lograr un rendimiento óptimo en todo tipo de restricciones de recursos, y el modelo también es ágil en tareas, que se deriva matemáticamente como en la siguiente ecuación 8. El modelo ya contiene pesos entrenados con el conjunto de datos ImageNet y, por tanto, puede transferirse para aprender y, en gran medida, no es necesario entrenar el modelo con conjuntos de datos médicos pequeños. Esta combinación de características de alto nivel, así como el entorno de entrenamiento personalizado, que también contiene los cambios en la capa final de clasificación, el uso del optimizador Adam, el planificador de tasa de aprendizaje y la parada temprana, aseguran que el modelo sea altamente preciso, pero al mismo tiempo eficiente computacionalmente. Esta combinación de inventiva arquitectónica y enfoques formativos permitirá al modelo aprender de forma eficiente basándose en la mala información de imagen médica y, por tanto, resultará ser un instrumento útil en la categorización de la ecografía mamaria.

Algoritmo 1: Clasificación de imágenes por ecografía mamaria usando EfficientNet-B0 y Grad-CAM

Entrada: Imágenes de ecografía mamaria.
Salida: Clasificación (normal, benigno, maligno) y mapas de calor Grad-CAM.
1. Preprocesar imágenes:
Redimensiona a 224×224224×224.
Normaliza usando la media y la ETS de ImageNet.
Aumenta con volteo, rotación y vibraciones de color.
2. Inicializar modelo:
Load Efficient Net-B0 (preentrenada, excluye la capa superior).
Añade Global Average Pooling y una capa densa (3 neuronas, SoftMax).
3. Modelo de tren:
Optimizador: Adam (tasa de aprendizaje = 0,00005).
Pérdida: Entropía cruzada.
Entrena durante 18 épocas con paradas tempranas (paciencia = 2).
4. Visualización Grad-CAM:
Calcula los gradientes de la clase objetivo.
Genera y superpone mapas de calor sobre las imágenes de entrada.

El algoritmo proporciona el flujo de trabajo de clasificación de imágenes de ultrasonido mamario con EfficientNet-B0 y Grad-CAM, incluyendo preprocesamiento, entrenamiento e inferencia del modelo, así como el mapa de calor interpretable para validar clínicamente.

6. Grad-CAM como IA explicable

Una herramienta sólida utilizada en el estudio es capaz de añadir interpretabilidad al modelo de aprendizaje profundo, el Mapeo de Activación de Clases ponderado por gradiente. Considerando una solución a la urgente necesidad actual de XAI en la imagen clínica, el método emplea Grad-CAM para permitir a los clínicos comprender intuitivamente la toma de decisiones del modelo que se ha realizado mediante mapas de calor visualmente explicables alrededor de las regiones más significativas de una imagen utilizada en la predicción del modelo. Dicha convergencia de interpretabilidad será fundamental para generar confianza en los sistemas de IA, especialmente en los de alto riesgo como la sanidad, donde la rendición de cuentas y la transparencia son esenciales. La Figura 5 presenta mapas de calor Grad-CAM que destacan las regiones de imagen que más influyeron en las predicciones del modelo para casos benignos, malignos y normales.

figure-protocol-19
Figura 5: Mapas de calor de activación Grad-CAM. (A) Benignos, (B) Malignos y (C) Normales. Los colores cálidos (rojo) indican una alta influencia diagnóstica; los colores fríos (azul) indican menor atención. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Todas las imágenes Grad-CAM se muestran además de la imagen de entrada que se le ha dado al modelo. La Figura 5 muestra la imagen original de ultrasonido y la imagen de entrada del modelo para asegurar que las regiones de atención cercana estén directamente relacionadas con la entrada procesada que se considera en la predicción. Para obtener importancia por canal, Grad-CAM se utiliza para calcular gradientes de la clase predicha utilizando mapas de características de la capa convolucional final. Estos gradientes se promedian a nivel mundial para obtener los coeficientes de ponderación y luego se multiplican con los mapas de características respectivos para producir un mapa de calor de localización (ecuaciones 16 y 17). El mapa de calor se muestra luego a la resolución de entrada y se superpone a la imagen de ultrasonido para indicar áreas de interés diagnóstico (por ejemplo, márgenes tumorales, cambios en la textura, etc.) en la imagen. Esta visualización ofrece una comprensión espacial de las áreas que se utilizan para hacer la predicción en el modelo. Este artículo mide la interpretabilidad mediante análisis visual de la localización de la atención. No incluyeron medidas cuantitativas de localización ni evaluación basada en el clínico, que siguen siendo vías valiosas para la validación futura de la relevancia clínica.

figure-protocol-20      

figure-protocol-21      

Grad-CAM ofrece predicciones sobre cómo funciona visualmente un modelo resaltando áreas de una imagen que contribuyeron a la predicción. Los mapas de calor pueden usarse para confirmar que la red se concentra en estructuras clínicamente relevantes que incluyen márgenes tumorales y patrones acústicos. En las falsas alarmas, las visualizaciones pueden ayudar a detectar el foco en áreas irrelevantes, asistiendo en la evaluación y optimización del modelo. Esta correspondencia entre las características médicas y la atención del modelo mejora la interpretabilidad del diagnóstico asistido por IA. La Figura 6 muestra la visualización de GradCAM.

figure-protocol-22
Figura 6: Visualización de GradCAM. Mapa de calor Grad-CAM que muestra regiones importantes (rojo = alto, azul = bajo) para la clasificación; La intensidad del color indica la importancia de las características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Se añade Grad-CAM para aumentar la interpretabilidad del modelo EfficientNet-B0 destacando regiones de imagen que aportan la mayor contribución a las elecciones de clasificación. Los mapas de calor resultantes indican estructuras clínicamente significativas de los márgenes tumorales y cambios en la textura, lo que facilita un análisis claro de las predicciones del modelo. Esta alta precisión en la clasificación y la interpretabilidad visual hacen que este marco propuesto sea más sólido en cuanto a fiabilidad en el análisis de las imágenes de ecografía mamaria.

7. Análisis estadístico

El modelo se evalúa sobre un amplio conjunto de métricas, como la precisión, como medida de la exactitud de las predicciones positivas; recordar, como medida de la efectividad del modelo para identificar todos los casos relevantes; y la puntuación F1, la media armónica de precisión y recuerdo, que proporciona una medida equilibrada del rendimiento global que se calcula matemáticamente según las ecuaciones 18–21.

figure-protocol-23      

figure-protocol-24      

figure-protocol-25      

figure-protocol-26      

El Error Absoluto Medio (EMA) cuantifica la diferencia absoluta media entre predicciones y valores verdaderos, calculada matemáticamente según la ecuación 22.

figure-protocol-27      

El Error Cuadrático Medio Raíz (RMSE) mide la desviación media de las predicciones respecto a los valores verdaderos, calculada matemáticamente según la ecuación 23.

figure-protocol-28      

El Error Absoluto Medio (MAE) cuantifica la diferencia absoluta media entre predicciones y valores verdaderos, calculada matemáticamente según la ecuación 24.

figure-protocol-29      

La matriz de confusión se utiliza para proporcionar un desglose detallado de los verdaderos positivos, verdaderos negativos, falsos positivos y falsos negativos por clase, proporcionando más información sobre cómo el modeloclasifica el 30. Estas medidas de evaluación combinadas proporcionan una evaluación global del error del modelo, la fuerza y la generalización sobre datos no observados, convirtiéndolas en una herramienta fiable para clasificar imágenes de una ecografía mamaria. La disponibilidad de mascarillas de lesión en el conjunto de datos BUSI implica que en el futuro se podrán introducir medidas cuantitativas de localización, por ejemplo, la intersección sobre la unión, para evaluar objetivamente la precisión de la explicación. La validación estratificada de retención se había elegido para preservar la independencia entre los subconjuntos de entrenamiento y evaluación que mantenían la distribución de clases. La razón para no utilizar la validación cruzada era evitar la exposición repetitiva de muestras de validación al proceso de optimización, pero en futuros estudios se utilizará la validación cruzada repetida o anidada para determinar aún más las variaciones en el rendimiento.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La estandarización de las dimensiones de entrada a 24 x 224 píxeles y la normalización basada en ImageNet facilitaron un comportamiento de entrenamiento estable y una convergencia suave de las curvas de pérdida. La aplicación de la operación de superposición de máscara en muestras de entrenamiento aumentó significativamente la visibilidad de los límites de la lesión en comparación con las imágenes ultrasónicas en bruto. Esta observación apoyaba la hipótesis de que la mejora anatómica gui...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El marco propuesto utiliza una arquitectura EfficientNet-B0 ajustada integrada con Gradient-weighted Class Activation Mapping (Grad-CAM) para proporcionar un sistema de alto rendimiento e interpretable para la clasificación por ecografía mamaria. Esta investigación avanza en el campo científico al tender puentes entre los modelos de aprendizaje profundo "caja negra" y la transparencia clínica, demostrando que la eficiencia computacional no tiene que sacrificarse por lae...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen ningún conflicto de interés.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores desean expresar su sincero agradecimiento a sus respectivas instituciones y colegas por su apoyo y ánimo continuos a lo largo de esta investigación. Los autores también reconocen a los creadores del conjunto de datos de ultrasonido mamario BUSI por proporcionar el conjunto de datos disponible públicamente que permitió este estudio. Este trabajo contó con el apoyo de los investigadores de la Universidad Princess Nourahbint Abdulrahman Supporting Project Number (PNURSP2026R432), Universidad Princess Nourah bint Abdulrahman, Riad, Arabia Saudí. Los autores expresan su agradecimiento al Decano de Investigación y Estudios de Posgrado de la Universidad King Khalid por financiar este trabajo a través de Large Group Research bajo la subvención número RGP2/749/46.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Imágenes de ultrasonido de mama (conjunto de datos BUSI)N/A780 imágenes PNG (487 benignos, 210 malignos, 133 normales)
MatplotlibDesarrolladores de MatplotlibN/AVersión 3.7.1
NumPyDesarrolladores de NumPyN/AVersión 1.23.5
NVIDIA Tesla T4 GPUNVIDIAN/A16GB VRAM
OpenCVOpenCV.orgN/AVersión 4.7.0
Pillow (PIL)Python Imaging LibraryN/AVersión 9.4.0
PythonPython Software FoundationN/AVersión 3.9.12
PyTorchMeta AIN/AVersión 2.0.1+cu117
Scikit-learnDesarrolladores de Scikit-learnN/AVersión 1.2.2
SeabornDesarrolladores de SeabornN/AVersión 0.12.2
Sistema operativo UbuntuCanonicalN/A64 bits

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wilkinson, L., Gathani, T. Understanding breast cancer as a global health concern. Br J Radiol. 95 (1130), 20211033(2021).
  2. Ud din, N. M., Dar, R. A., Rasool, M., Assad, A. Breast cancer detection using deep learning: datasets, methods, and challenges ahead. Comput Biol Med. 149, 106073(2022).
  3. Jin, W., Li, X., Fatehi, M., Hamarneh, G. Guidelines and evaluation of clinical explainable AI in medical image analysis. Med Image Anal. 84, 102684(2023).
  4. Ghasemi, A., Hashtarkhani, S., Schwartz, D. L., Shaban-Nejad, A. Explainable artificial intelligence in breast cancer detection and risk prediction: a systematic scoping review. Cancer Innov. 3 (5), (2024).
  5. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimedia tools and applications. 84 (21), 24079-24190 (2025).
  6. Singh, V. K., et al. Breast tumor segmentation in ultrasound images using contextual-information-aware deep adversarial learning framework. Expert Systems with Applications. 162, 113870(2020).
  7. Wani, N. A., Kumar, R., Bedi, J. Harnessing fusion modeling for enhanced breast cancer classification through interpretable artificial intelligence and in-depth explanations. Engineering Applications of Artificial Intelligence. 136, 108939(2024).
  8. Kikani, K., Desai, M., Desai, B. Early Detection and Personalized Risk Assessment of Breast Cancer: An Integrative Review and Comparative Evaluation of AI Models Using Clinical and Imaging Data. Archives of Computational Methods in Engineering. , 1-29 (2025).
  9. Singh, R., Gupta, S., Yamsani, N., Manwal, M., Bansal, G. Automated Breast Cancer Classification using a Custom CNN Architecture on the BUSI Dataset. IEEE Xplore. , 1185-1190 (2025).
  10. Ali, A., et al. Exploring AI approaches for breast cancer detection and diagnosis: A review Article. Breast Cancer: Targets and Therapy. , 927-947 (2025).
  11. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  12. Sienicki, K. Comment on the paper titled ‘The origin of quantum mechanical statistics: insights from research on human language’. Preprints. , (2024).
  13. Ahn, J. S., et al. Artificial intelligence in breast cancer diagnosis and personalized medicine. Journal of breast cancer. 26 (5), 405(2023).
  14. Qureshi, S. A., et al. Breast cancer detection using mammography: image processing to deep learning. IEEE Access. , (2024).
  15. Dihmani, H., Bousselham, A., Bouattane, O. A new computer-aided diagnosis system for breast cancer detection from thermograms using metaheuristic algorithms and explainable AI. Algorithms. 17 (10), 462(2024).
  16. Nakach, F. Z., Idri, A., Goceri, E. A comprehensive investigation of multimodal deep learning fusion strategies for breast cancer classification. Artif Intell Rev. 57 (12), 327(2024).
  17. Mondol, R. K. Deep learning based prognosis and explainability for breast cancer. , UNSW Sydney. Doctoral dissertation (2025).
  18. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  19. Afrin, H., Larson, N. B., Fatemi, M., Alizad, A. Deep Learning in Different Ultrasound Methods for Breast Cancer, from Diagnosis to Prognosis: Current Trends, Challenges, and an Analysis. Cancers. 15 (12), 3139(2023).
  20. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  21. Di Paola, V., et al. Beyond N staging in breast cancer: importance of MRI and ultrasound-based imaging. Cancers. 14 (17), 4270(2022).
  22. Sahu, A., Das, P. K., Meher, S. Efficient deep learning scheme for breast cancer detection using mammogram and ultrasound images. Biomed Signal Process Control. 87, 105377(2024).
  23. Rezazadeh, A., Jafarian, Y., Kord, A. Explainable ensemble machine learning for breast cancer diagnosis using ultrasound texture features. Forecasting. 4 (1), 262-274 (2022).
  24. Raza, A., et al. Deep Breast Cancer Net: a novel deep learning model for ultrasound breast cancer detection. Appl Sci. 13 (4), 2082(2023).
  25. Jabeen, K., et al. Breast cancer classification from ultrasound images using optimal deep learning feature fusion. Sensors. 22 (3), 807(2022).
  26. Ayana, G., Park, J., Jeong, J. W., Choe, S. Multistage transfer learning for ultrasound breast cancer image classification. Diagnostics. 12 (1), 135(2022).
  27. Gupta, S., Agrawal, S., Singh, S. K., Kumar, S. Transfer learning-based model for ultrasound breast cancer classification. Comput Vis Bio-Inspired Comput. , 511-523 (2023).
  28. Kratkiewicz, K., Pattyn, A., Alijabbari, N., Mehrmohammadi, M. Ultrasound and photoacoustic imaging of breast cancer: clinical systems and challenges. J Clin Med. 11 (5), 1165(2022).
  29. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  30. R, M. T. Enhancing Diagnostic Accuracy in Breast Ultrasound Imaging through Deep Learning and Image Augmentation Techniques. IEEE ICERCS, , 1-6 (2024).
  31. Balasubramaniam, S., Velmurugan, Y., Jaganathan, D., Dhanasekaran, S. A Modified LeNet CNN for Breast Cancer Diagnosis in Ultrasound Images. Diagnostics. 13 (17), 2746(2023).
  32. Atrey, K., Singh, B. K., Bodhey, N. K. Multimodal classification of breast cancer using feature level fusion of mammogram and ultrasound images in machine learning paradigm. Multimedia Tools and Applications. 83 (7), 21347-21368 (2023).
  33. Vigil, N., et al. Dual-Intended Deep Learning Model for Breast Cancer Diagnosis in Ultrasound Imaging. Cancers. 14 (11), 2663(2022).
  34. Uysal, F., Köse, M. M. Classification of Breast Cancer Ultrasound Images with Deep Learning-Based Models. ASEC 2022, , 8(2022).
  35. Boulenger, A., et al. Deep learning-based system for automatic prediction of triple-negative breast cancer from ultrasound images. Medical & Biological Engineering & Computing. 61 (2), 567-578 (2022).
  36. Işık, G., Paçal, İ Few-shot classification of ultrasound breast cancer images using meta-learning algorithms. Neural Computing and Applications. 36 (20), 12047-12059 (2024).
  37. Liu, H., et al. Artificial Intelligence-Based Breast Cancer Diagnosis Using Ultrasound Images and Grid-Based Deep Feature Generator. International Journal of General Medicine. 15, 2271-2282 (2022).
  38. Zourhri, M., et al. Deep Learning Technique for Classification of Breast Cancer using Ultrasound Images. IEEE IRASET, , (2023).
  39. Taleghamar, H., Jalalifar, S. A., Czarnota, G. J., Sadeghi-Naini, A. Deep learning of quantitative ultrasound multi-parametric images at pre-treatment to predict breast cancer response to chemotherapy. Scientific Reports. 12 (1), (2022).
  40. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  41. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  42. Mondol, S. S., Hasan, M. K. Enhancing B-mode-based breast cancer diagnosis via cross-attention fusion of H-scan and Nakagami imaging with multi-CAM-QUS-Driven XAI. Physics in Medicine & Biology. 70 (17), 175011(2025).
  43. Shifa, N. Explainable breast cancer detection in mammograms using lightweight EfficientNet-B0 with Grad-CAM and LIME. , Qatar University. (2025).
  44. Haghighat, F., Nemati, Z., Rambodrad, A., Negareshifard, P., Jafari, E. Multimodal deep learning and data fusion in precision breast oncology: clinical Applications, fusion Strategies, and future directions. InfoScience Trends. 2 (10), 81-115 (2025).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Ultrasound ImagesDeep LearningEfficientNet B0Data AugmentationGrad CAMLesion DetectionClinical Diagnosis

Artículos relacionados