La evaluación del rendimiento del marco de clasificación desarrollado se basa en medidas tradicionales de evaluación derivadas de la matriz de confusión. Una matriz de confusión permite obtener una comprensión completa del rendimiento del clasificador mediante la representación del número de clasificaciones correctas e incorrectas realizadas para cada clase definida. De este modo, se pueden analizar todos los tipos de errores. Por ejemplo, tanto los falsos positivos como los falsos negativos son especialmente importantes en el diagnóstico de enfermedades. Valores elevados de falsos positivos pueden indicar una alta sensibilidad del clasificador, pero al mismo tiempo, una gran cantidad de falsos negativos indican una baja sensibilidad y suponen riesgos potenciales para la salud. Las siguientes métricas de rendimiento se utilizan en este artículo: exactitud, precisión, recuperación, puntuación F1, especificidad, tasa de verdaderos positivos (TPR) y tasa de falsos positivos (FPR). A continuación se enumeran las fórmulas de estas métricas:
Precisión=(VP+VN)/(VP+VN+FP+FN) (3)
Precisión = TP/(TP+FP) (4)
(5)
(6)
(7)
(8)
En este caso, TP muestra el número de cánceres de piel malignos detectados por el marco, mientras que TN indica el número de lesiones benignas. A su vez, FP demuestra el número de decisiones incorrectas cuando las lesiones se clasifican como malignas aunque en realidad sean benignas. FN refleja el número de muestras benignas reconocidas erróneamente. En lo que respecta a la clasificación del cáncer de piel, minimizar los falsos negativos es extremadamente importante debido a los posibles efectos adversos que esto puede provocar.
Rendimiento de los modelos de referencia
Todos los experimentos computacionales se realizaron en el entorno basado en la nube de Google Colab. Vale la pena destacar que esta plataforma permite ejecutar instancias de máquinas virtuales utilizando una versión predefinida de Ubuntu 20.04 como sistema operativo. Para entrenar los modelos de referencia, se utilizó Python versión 3.9 y el entorno PyTorch versión 2.3.1. Además, todos los nodos de cómputo tenían especificaciones idénticas, a saber, una CPU Intel Xeon con una frecuencia de 2,2 GHz, GPU NVIDIA Tesla T4, 16 GB de RAM y una capacidad de almacenamiento de 70 GB. Por lo tanto, esta configuración experimental permitió reducir la variabilidad introducida por diferentes plataformas de hardware y aumentar la fiabilidad y la reproducibilidad de los resultados. Un resumen completo del entorno experimental se puede encontrar en Tabla 3.
Figura 4 muestra las curvas de aprendizaje correspondientes a 100 épocas de entrenamiento para la arquitectura ResNet-50. El entrenamiento se realizó basándose en un conjunto de datos que contenía 2.110 imágenes, mientras que el tamaño del conjunto de validación fue igual a 660 imágenes. Como puede observarse, durante el entrenamiento, la precisión aumentó constantemente hasta alcanzar casi el 90,0 %. Al mismo tiempo, se observó una mejora en la precisión durante las primeras 50 épocas; después de este punto, la precisión se volvió casi constante, lo que puede considerarse un indicio de convergencia del modelo. Para la validación, el modelo mostró un valor de AUC igual al 86,0 %, demostrando así propiedades discriminativas razonables.
La matriz de confusión presentada en la Figura 5 caracteriza el rendimiento del modelo ResNet-50 en términos de precisión de clasificación en el caso de un conjunto de prueba con 660 imágenes. Durante la evaluación, el modelo reconoció correctamente 310 de 360 muestras benignas y 239 de 300 muestras malignas. Sin embargo, un número relativamente alto de muestras malignas se clasificaron incorrectamente, lo que condujo a un valor relativamente alto de falsos negativos. Este resultado debe considerarse con mayor detalle debido a las graves implicaciones de este tipo de error al utilizar el clasificador en la práctica. En total, el modelo alcanzó una precisión del 83,0 %, con una exactitud del 83,3 %, una recuperación del 83,3 % y una puntuación F1 del 83,3 %.
Tabla 4 contiene una descripción detallada de las características de rendimiento del modelo ResNet-50 en términos de ambas clases. El clasificador mostró un comportamiento relativamente equilibrado en cuanto a la precisión: para muestras benignas, su valor fue del 83,0 %, mientras que las muestras malignas arrojaron una precisión del 84,0 %. De manera similar, los valores de recuperación alcanzaron el 88,0 % para lesiones benignas y el 78,0 % para las malignas. El soporte en la tabla representa el número de muestras correspondientes a cada clase.
Modelo EDLF-SLC propuesto
Figura 6 ilustra el AUC de entrenamiento y validación del modelo propuesto durante 300 épocas. La métrica AUC refleja la capacidad del modelo para distinguir entre clases benignas y malignas, siendo valores más altos indicativos de un mejor rendimiento discriminativo. Como se observa, el AUC de entrenamiento aumenta de forma constante a lo largo del proceso de entrenamiento, alcanzando un valor máximo de 1,00 aproximadamente en la época 200. El AUC de validación también mejora progresivamente durante las etapas iniciales del entrenamiento; sin embargo, comienza a estabilizarse después de aproximadamente 150 épocas, lo que sugiere la convergencia del modelo. El AUC final de validación de 0,95 demuestra una fuerte capacidad de generalización y una separabilidad efectiva entre clases.
La matriz de confusión del modelo propuesto, presentada en la Figura 7, muestra que el modelo clasificó correctamente 299 muestras benignas y 272 muestras malignas, mientras que clasificó erróneamente 28 casos benignos como malignos y 61 casos malignos como benignos. En total, el modelo logró 571 predicciones correctas y 89 clasificaciones erróneas. Destacable es el mayor número de falsos negativos (casos malignos clasificados erróneamente como benignos), lo que resalta una limitación crítica, ya que tales errores pueden tener implicaciones clínicas significativas. No obstante, el rendimiento general de la clasificación sigue siendo robusto. A diferencia de los enfoques de selección de características que eliminan intencionalmente dimensiones antes de la clasificación, el marco propuesto conserva la representación profunda completa y fusionada generada por múltiples arquitecturas heterogéneas de CNN. Este diseño se adoptó porque cada arquitectura extrae características complementarias de las lesiones, y conservar la representación completa permite que el clasificador SVM aproveche la información discriminativa combinada sin excluir características potencialmente informativas. En consecuencia, la estrategia de fusión de características adoptada prioriza el aprendizaje de representaciones complementarias manteniendo la viabilidad computacional.
Figura 8 presenta ejemplos representativos de resultados de clasificación producidos por el modelo propuesto. Los resultados demuestran que el modelo asigna puntuaciones de alta confianza a las instancias clasificadas correctamente. Específicamente, los casos benignos muestran altas probabilidades predichas (por ejemplo, 99,84 % y 99,85 %), mientras que los casos malignos también presentan niveles elevados de confianza (por ejemplo, 99,98 % y 99,96 %). Estos hallazgos indican que el modelo puede diferenciar eficazmente entre lesiones benignas y malignas, incluso en escenarios visualmente desafiantes. Para mejorar la interpretabilidad, se emplea el marco LIME para generar explicaciones localizadas de las predicciones del modelo, como se muestra en Figura 9A–D. LIME aproxima el límite de decisión complejo del modelo utilizando un modelo lineal localmente interpretable. Para cada imagen de entrada, el método genera muestras perturbadas mediante el enmascaramiento selectivo de superpíxeles y evalúa las predicciones correspondientes. Luego, se ajusta un modelo lineal ponderado a estas muestras, donde los pesos se determinan en función de la proximidad a la entrada original utilizando un núcleo de función de base radial. Los coeficientes resultantes representan la contribución de cada superpíxel a la predicción final y se definen como:
(9)
donde Xj ∈ {0, 1} denota la presencia o ausencia del superpíxel j-ésimo, Bj representa el peso de contribución correspondiente, y B0 es la predicción de referencia. Los coeficientes positivos (Bj > 0) indican regiones que contribuyen a la clase maligna, mientras que los coeficientes negativos (Bj < 0) corresponden a características benignas. Las visualizaciones basadas en LIME, mostradas en la Figura 9B, D, resaltan las regiones más influyentes que contribuyen a cada decisión de clasificación. Para lesiones benignas, el modelo enfatiza regiones caracterizadas por una pigmentación uniforme y bordes bien definidos. En contraste, para casos malignos, las regiones resaltadas corresponden a características clínicamente significativas, como bordes irregulares, heterogeneidad del color y texturas atípicas. La intensidad de las regiones resaltadas refleja la magnitud de los coeficientes correspondientes Bj.
Estos resultados demuestran que el modelo EDLF-SLC se centra en características clínicamente significativas que coinciden con criterios dermatológicos establecidos, como la regla ABCD. Esta concordancia mejora la interpretabilidad y confiabilidad del modelo, lo que lo hace más adecuado para la asistencia en la toma de decisiones clínicas. Además, Figura 10 presenta resultados comparativos de visualización obtenidos mediante técnicas adicionales de explicabilidad, incluyendo Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM y EigenCAM, lo que valida aún más la consistencia de las regiones relevantes identificadas a través de diferentes métodos. Con respecto al desempeño del modelo propuesto EDLF-SLC y siete modelos de referencia tras el entrenamiento durante 100 épocas, se puede observar una comparación en la Tabla 5. EDLF-SLC obtuvo un desempeño competitivo de 0.88 en cada métrica evaluada en comparación con las arquitecturas de referencia evaluadas según el contexto experimental. EfficientNetB0 y ResNet50 también tuvieron buenos resultados, con precisiones de 0.85 y 0.83, respectivamente. Por el contrario, Inception-ResNetV2 tuvo el peor desempeño de clasificación entre los modelos evaluados. Por otro lado, a pesar de una precisión de clasificación relativamente baja, su eficiencia computacional fue aún comparable a la de los modelos de referencia. El modelo propuesto EDLF-SLC demostró un desempeño competitivo en relación con los modelos de referencia evaluados bajo las condiciones experimentales adoptadas.
Para evaluar el rendimiento del marco propuesto en comparación con enfoques existentes, Tabla 6 presenta una comparación con métodos representativos de última generación para la clasificación de lesiones cutáneas. Por ejemplo47, se informó una precisión de 0,86, mientras que48 empleó un modelo basado en ensambles que alcanzó una precisión similar pero menor exactitud, recuperación y puntuación F1. Estudios recientes basados en aprendizaje por ensambles y múltiples arquitecturas CNN25,49 informaron precisiones de hasta 0,87. Bajo las condiciones experimentales adoptadas, el marco propuesto EDLF-SLC logró una precisión de 0,88 utilizando una arquitectura unificada interpretable sin requerir componentes adicionales como modelos de segmentación de lesiones.
DISPONIBILIDAD DE LOS DATOS
Los datos que respaldan los hallazgos de este estudio están disponibles públicamente en Kaggle en https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Figura 1: Imágenes dermatoscópicas representativas del conjunto de datos ISIC que ilustran las dos clases diagnósticas utilizadas en este estudio. Las muestras están etiquetadas como benignas (0) y malignas (1), destacando la variabilidad en la morfología, el color y la textura de las lesiones a lo largo del conjunto de datos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Flujo de trabajo completo del marco EDLF-SLC propuesto. El protocolo comienza con la adquisición de imágenes ISIC 2020, seguido de preprocesamiento, aumento de datos, particionamiento del conjunto de datos, extracción de características profundas mediante cuatro arquitecturas CNN preentrenadas, fusión de características, clasificación mediante SVM, evaluación del rendimiento y generación de explicaciones basadas en LIME. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Ejemplos de imágenes aumentadas de lesiones cutáneas generadas mediante técnicas de aumento de datos. Esto incluye inversión horizontal y vertical, rotación, escalado y ajuste de brillo. Estas transformaciones aumentan la diversidad del conjunto de datos, mejoran la robustez del modelo y reducen el riesgo de sobreajuste durante el entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Área bajo la curva de característica operativa del receptor (ROC-AUC) del entrenamiento y validación del modelo ResNet-50 durante 100 épocas de entrenamiento. La curva azul representa el AUC del entrenamiento, mientras que la curva naranja representa el AUC de validación. Las curvas muestran una convergencia rápida durante las primeras épocas de entrenamiento, seguida de una optimización estable con un rendimiento de validación consistentemente alto, lo que indica un aprendizaje efectivo y una generalización satisfactoria en el conjunto de datos de validación. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Matriz de confusión del modelo ResNet-50 en el conjunto de datos de prueba. Las filas representan las etiquetas de clase reales (0 = benigno, 1 = maligno), mientras que las columnas representan las etiquetas de clase predichas. Los elementos diagonales indican muestras clasificadas correctamente (310 benignas y 239 malignas), mientras que los elementos fuera de la diagonal representan muestras mal clasificadas, incluyendo 50 falsos positivos y 61 falsos negativos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Curva característica de operación del receptor y área bajo la curva (ROC-AUC) de entrenamiento y validación del modelo EDLF-SLC propuesto durante 300 épocas de entrenamiento. La curva azul representa el AUC de entrenamiento, mientras que la curva naranja representa el AUC de validación. El modelo muestra una convergencia rápida durante las primeras épocas de entrenamiento, seguida de una optimización estable con valores de AUC de entrenamiento y validación consistentemente altos durante las épocas restantes. El rendimiento sostenido en la validación demuestra una buena capacidad de generalización y un comportamiento de aprendizaje estable del marco EDLF-SLC propuesto en el conjunto de datos de validación. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 7: Matriz de confusión del modelo EDLF-SLC propuesto en el conjunto de datos de prueba. Las filas representan las etiquetas de clase reales (0 = benigno, 1 = maligno), mientras que las columnas representan las etiquetas de clase predichas. Los elementos diagonales indican muestras clasificadas correctamente (299 benignas y 272 malignas), mientras que los elementos fuera de la diagonal corresponden a muestras mal clasificadas, incluyendo 61 falsos positivos y 28 falsos negativos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Predicciones de ejemplo generadas por el modelo EDLF-SLC propuesto. Esta figura ilustra los niveles de confianza en la clasificación de lesiones benignas y malignas y demuestra la capacidad discriminativa del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Explicaciones locales basadas en LIME del modelo EDLF-SLC propuesto. La figura resalta las regiones de superpíxeles más influyentes que contribuyen a las decisiones de clasificación del modelo. (A) Imagen dermatoscópica original de una lesión cutánea benigna. (B) Explicación mediante LIME para la lesión benigna, con superpíxeles resaltados que indican las regiones que más contribuyeron a la predicción de benignidad. (C) Imagen dermatoscópica original de una lesión cutánea maligna. (D) Explicación mediante LIME para la lesión maligna, que muestra las regiones de superpíxeles discriminativas que influyeron predominantemente en la clasificación como maligna. Los límites amarillos delimitan los superpíxeles influyentes identificados por LIME, mientras que las regiones grises representan áreas con contribución mínima a la predicción. Haga clic aquí para ver una versión más grande de esta figura.

Figura 10: Comparación de métodos de explicabilidad basados en mapas de activación de clase (CAM) aplicados al modelo EDLF-SLC propuesto. La figura compara los mapas de localización generados por GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM y EigenCAM para la misma imagen dermatoscópica. El primer panel muestra la imagen de entrada original, seguida por los mapas de activación brutos correspondientes y las superposiciones de mapas de calor producidos por cada método de explicabilidad. Las visualizaciones ilustran las diferencias en la localización espacial y resaltan las regiones de la imagen que contribuyen más fuertemente a la decisión de clasificación del marco EDLF-SLC propuesto. Haga clic aquí para ver una versión más grande de esta figura.
| Ref. | Año | Conjunto de datos | Tamaño de los datos | Extracción de características | Método | Precisión |
| 9 | 2022 | Conjunto de datos HAM10000 | 10015 imágenes de lesiones cutáneas | Características de color y forma | Algoritmos de ML y modelos de redes neuronales convolucionales | 95,1% |
| 19 | 2023 | Conjunto de datos PH2 | 200 imágenes anotadas | Características de asimetría, estrías, puntos/globulos, áreas de regresión | Modelos de ML | 94,0% |
| 30 | 2024 | Conjunto de datos HAM10000 | 10000 imágenes | Características de color y forma | S-MobileNet | 97,7% |
| 28 | 2025 | Conjuntos de datos ISIC2020 y HAM10000 | ISIC2020 (12.670 imágenes) y HAM10000 (10.015 imágenes) | Color y forma | Red residual con memoria a corto plazo (R-LSTM50) | 95,7% (ISIC2020); 94,2% (HAM10000) |
| 32 | 2026 | Conjunto de datos de lesiones cutáneas por viruela del mono (MSLD) | 770 imágenes | Contexto y textura | DenseNet121, Xception, InceptionV3 y CBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38.569 imágenes | Contexto y textura | MobileNet, ResNet50, InceptionV3 y EfficientNet | 93,6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 imágenes | Contexto y espacial | Red profunda multimodal basada en CNN y transformador | 98,71% |
| 41 | 2026 | ISIC 2019 | 25.000 imágenes | Contexto y textura | TransXV2S | 95,26% |
| 42 | 2025 | HAM10000 | 10.015 imágenes | Color y forma | ViT con YOLOv8 | 93% |
Tabla 1: Comparación bibliográfica. Resumen de algunos trabajos publicados recientemente que utilizan algoritmos de aprendizaje profundo para la clasificación de lesiones cutáneas.
| Conjunto de datos | Benigno | Maligno | Total |
| Datos de entrenamiento | 1440 | 1197 | 2637 |
| Datos de prueba | 360 | 300 | 660 |
| Datos totales | 1800 | 1497 | 3297 |
Tabla 2: Distribución del conjunto de datos. Distribución de muestras benignas y malignas en el conjunto de datos ISIC 2020, incluyendo las divisiones de entrenamiento y prueba.
| Componente | Especificación |
| Sistema operativo | Ubuntu 20.04 |
| Lenguaje de programación | Python 3.9 |
| Framework de aprendizaje profundo | PyTorch 2.3.1 |
| Optimizador | Adam |
| Programación de la tasa de aprendizaje | 1e−3 |
| Número de épocas | 100/300 |
| CPU | 2 vCPU 2.2 GHz |
| GPU | Tesla T4 (16 GB) × 1 |
| RAM | 16 GB |
| Parámetros entrenables | 2,430,353 (9.27 MB) |
| Parámetros no entrenables | 133,434,397 (509.01 MB) |
Tabla 3: Especificaciones del sistema. Especificaciones detalladas del entorno computacional, incluyendo los entornos de software y los recursos hardware utilizados para el entrenamiento y la evaluación del modelo.
| Clase | Precisión | Recuperación | Puntaje F1 | Soporte |
| Clase benigna | 0.83 | 0.88 | 0.85 | 360 |
| Clase maligna | 0.84 | 0.78 | 0.81 | 300 |
| Exactitud | - | - | 0.832 | 660 |
| Promedio macro | 0.84 | 0.83 | 0.83 | 660 |
| Promedio ponderado | 0.84 | 0.83 | 0.83 | 660 |
Tabla 4: Informe de clasificación. Rendimiento de clasificación del modelo ResNet-50 en el conjunto de datos de prueba, que incluye precisión, recuperación, puntuación F1 y soporte para cada clase.
| Modelo | Precisión | Exactitud | Recuperación | Puntuación F1 | Tiempo (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tabla 5: Comparación del rendimiento del modelo. Rendimiento comparativo del modelo EDLF-SLC propuesto y de los modelos básicos de aprendizaje profundo en cuanto a precisión, exactitud, recuperación, puntuación F1 y tiempo computacional.
| Modelo | Precisión | Exactitud | Recuperación | Puntuación F1 |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 con SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Modelos híbridos de DL + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Modelos híbridos de DL + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| EDLF-SLC propuesto | 0.88 | 0.89 | 0.87 | 0.88 |
Tabla 6: Métricas de comparación de modelos. Comparación de rendimiento entre el marco propuesto EDLF-SLC y enfoques recientes de última generación para la clasificación de lesiones cutáneas.
Archivo suplementario 1: Algoritmo 1. Flujo de trabajo del marco EDLF-SLC propuesto, que describe el preprocesamiento de datos, la extracción de características profundas mediante múltiples arquitecturas CNN, la clasificación basada en SVM y la explicabilidad basada en LIME para la predicción de lesiones cutáneas. Haga clic aquí para descargar este archivo.
Archivo suplementario 2: Algoritmo 2. Flujo de trabajo del proceso de explicación local basado en LIME, que ilustra la generación de superpíxeles, el muestreo de perturbaciones, la construcción del modelo sustituto y la visualización de las regiones de la imagen que más contribuyen a la decisión de clasificación. Haga clic aquí para descargar este archivo.