Artículo de investigación

Un marco informático explicable para la clasificación de lesiones cutáneas mediante aprendizaje profundo

60 visualizaciones

DOI:

10.3791/72639

25 de agosto de 2026

En este artículo

Resumen

Este artículo presenta un marco basado en CNN explicable para la clasificación de lesiones cutáneas que combina una alta precisión diagnóstica con interpretabilidad del modelo. Clasifica imágenes de lesiones y genera explicaciones visuales para sus predicciones. Los resultados demuestran un rendimiento sólido y una transparencia mejorada, lo que apoya la toma de decisiones clínicas y ayuda a los dermatólogos en la detección temprana de enfermedades de la piel.

Resumen

La utilización de redes neuronales convolucionales profundas con fines de diagnosticar enfermedades en el área de la piel ha demostrado alcanzar niveles de precisión similares a los obtenidos por dermatólogos en diversos estudios. Sin embargo, aún persisten muchos desafíos, incluyendo bajo rendimiento y mala generalización en algunos casos, así como baja interpretabilidad relacionada con el uso de modelos de caja negra. Esto crea obstáculos importantes para la implementación práctica, ya que se requiere explicabilidad además de diagnósticos precisos, lo que hace necesario encontrar una solución. Para superar las dificultades mencionadas, se desarrolla en este estudio un marco de aprendizaje profundo interpretable para la clasificación de lesiones cutáneas (EDLF-SLC). El marco utiliza diversos enfoques de aprendizaje automático e inteligencia artificial interpretable (XAI) para garantizar mejoras tanto en precisión como en interpretabilidad, mediante un proceso de tres etapas. En la primera etapa, se fusionan representaciones profundas extraídas de múltiples arquitecturas de CNN preentrenadas para preservar información discriminativa complementaria aprendida por diferentes arquitecturas de red antes de la clasificación mediante un SVM con kernel de función de base radial. A continuación, se emplean clasificadores de Máquina de Vectores de Soporte (SVM) con kernel de función de base radial para clasificar las características obtenidas. Finalmente, las predicciones realizadas por el modelo se interpretan mediante explicaciones locales interpretables agnósticas de modelos (LIME). Los resultados experimentales muestran que EDLF-SLC alcanza un 88,0 % de precisión, un 89,0 % de exactitud, un 87,0 % de recuperación y un 88,0 % de puntuación F1, demostrando un rendimiento competitivo en comparación con varios métodos recientemente reportados bajo las condiciones experimentales consideradas en este estudio.

Introducción

Las lesiones cutáneas son una preocupación importante en dermatología y oncología porque abarcan desde anomalías benignas hasta cánceres malignos como el melanoma, la forma más letal de cáncer de piel. En 2020, el melanoma representó aproximadamente 325.000 casos nuevos y más de 57.000 muertes en todo el mundo1. Aunque los avances en detección y tratamiento han mejorado los resultados en pacientes, el diagnóstico tardío y el acceso limitado a la atención médica siguen contribuyendo a una alta mortalidad y a la pérdida de años de vida, particularmente entre las poblaciones más jóvenes2,3.

El diagnóstico tradicional depende principalmente del examen visual y la dermatoscopia, lo que hace que el proceso dependa de la experiencia de los clínicos y sea propenso a subjetividad, variabilidad entre observadores, biopsias innecesarias y tiempos prolongados de examen4,5,6. Para abordar estas limitaciones, el aprendizaje profundo, particularmente las CNN, ha surgido como una solución efectiva para la clasificación automatizada de lesiones cutáneas. Los modelos basados en CNN, incluyendo DDCNN-F7, YOLOv7-XAI8 y varias otras arquitecturas9,10,11,12,13, han demostrado una alta precisión diagnóstica mediante el aprendizaje automático de características discriminativas de las imágenes. A pesar de su éxito, la mayoría de los modelos de aprendizaje profundo funcionan como "cajas negras", lo que limita la confianza de los clínicos y dificulta su adopción en la práctica médica habitual. Por ello, se han introducido técnicas de inteligencia artificial explicable para mejorar la transparencia del modelo proporcionando explicaciones visuales de las predicciones. Entre estos métodos, las Explicaciones Locales Model-Agnósticas e Interpretables generan explicaciones locales interpretables al identificar las regiones de la imagen que más influyen en las decisiones del modelo14.

La clasificación de lesiones cutáneas ha evolucionado desde la evaluación clínica tradicional hasta sistemas diagnósticos avanzados basados en inteligencia artificial, impulsada por la necesidad de una detección precisa, confiable y temprana del cáncer de piel. Esta evolución ha avanzado a través de cinco etapas principales: métodos diagnósticos tradicionales, diagnóstico asistido por computadora (CAD), aprendizaje automático (ML), aprendizaje profundo (DL) y, más recientemente, inteligencia artificial explicable (XAI) y aprendizaje federado (FL), reflejando esfuerzos continuos por mejorar la precisión diagnóstica, la consistencia, la escalabilidad y la confiabilidad clínica, al tiempo que se superan las limitaciones del examen convencional. Los primeros métodos computacionales intentaron emular el razonamiento clínico mediante descriptores de imagen manualmente diseñados derivados de la regla ABCD, que incluye asimetría, irregularidad del borde, variación del color y diámetro de la lesión. Estas características se combinaron con redes bayesianas, árboles de decisión, sistemas expertos y modelos de inferencia difusa para apoyar el diagnóstico de melanoma, con varios estudios que informaron exactitudes de clasificación superiores al 90%15,16,17. A pesar de proporcionar una base importante para el diagnóstico asistido por computadora, estos métodos dependían completamente de características manualmente diseñadas y reglas diagnósticas predefinidas. En consecuencia, mostraron una robustez limitada frente a variaciones en la calidad de la imagen, la morfología de la lesión, la iluminación y las condiciones de adquisición.

Para abordar estas limitaciones, surgieron los sistemas clásicos de CAD como una etapa intermedia entre el análisis de imágenes convencional y los marcos modernos basados en inteligencia artificial. Los sistemas de CAD combinaron la extracción manual de características con clasificadores convencionales para mejorar la consistencia diagnóstica y asistir en la toma de decisiones clínicas. Varios enfoques híbridos integraron agrupamiento jerárquico con redes neuronales recurrentes y arquitecturas de memoria a corto y largo plazo, logrando precisión en la clasificación cercana al 99,5 %18. Otros marcos basados en CAD incorporaron clasificadores de potenciación del gradiente con explicaciones basadas en SHAP, demostrando una precisión diagnóstica competitiva mientras mejoraban la transparencia del modelo19. Aunque estos sistemas representaron una mejora significativa respecto a los enfoques puramente basados en reglas, continuaron dependiendo en gran medida de la extracción manual de características, un preprocesamiento extenso, conjuntos de datos cuidadosamente anotados y tuberías de procesamiento de múltiples etapas.

Las técnicas de aprendizaje automático avanzaron aún más en la clasificación automatizada de lesiones cutáneas al permitir un aprendizaje basado en datos en lugar de un diseño explícito de reglas. Los marcos híbridos que combinan redes neuronales convolucionales con clasificadores convencionales de aprendizaje automático, incluyendo regresión logística y vecinos más cercanos (k-nearest neighbors), demostraron un alto rendimiento en la clasificación utilizando conjuntos de datos de referencia, alcanzando precisiones superiores al 95%9. El aprendizaje multimodal auto-supervisado mejoró aún más la representación de características al aprovechar conjuntamente imágenes dermatoscópicas y clínicas, reduciendo así la dependencia de anotaciones manuales extensas y mejorando al mismo tiempo el rendimiento de clasificación20. Otros estudios combinaron redes CNN con análisis discriminante generalizado, descriptores SURF y algoritmos de optimización para mejorar la discriminación de características y la precisión de clasificación21. Técnicas de selección automática de características que emplean DenseNet-201, InceptionV3 y algoritmos de optimización basados en árboles binarios mejoraron adicionalmente la representación de características manteniendo un rendimiento diagnóstico competitivo22. Los enfoques de aprendizaje por transferencia que utilizan arquitecturas preentrenadas, como AlexNet y GoogLeNet, también mostraron una capacidad prometedora de clasificación a pesar de contar con datos de entrenamiento limitados23. Sin embargo, la mayoría de los métodos de aprendizaje automático siguieron dependiendo de procedimientos de preprocesamiento cuidadosamente diseñados, estrategias de optimización manual, conjuntos de datos equilibrados y ajustes extensos de hiperparámetros. Su limitada validación externa y sensibilidad al desequilibrio de clases restringieron aún más su aplicabilidad práctica en diversos entornos clínicos.

La introducción del aprendizaje profundo transformó fundamentalmente la clasificación automatizada de lesiones cutáneas al permitir el aprendizaje directo a partir de datos de imágenes en bruto. Las CNN eliminaron la necesidad de ingeniería manual de características y mejoraron sustancialmente el rendimiento diagnóstico en múltiples conjuntos de datos de referencia. La mayoría de los enfoques basados en CNN demostraron mejoras significativas en la clasificación de lesiones mediante arquitecturas cada vez más sofisticadas. Los modelos de CNN sensibles a la simetría exploraron características clínicamente relevantes de las lesiones, pero lograron solo una precisión equilibrada moderada24. Otros integraron arquitecturas EfficientNet con explicaciones LIME y SHAP para mejorar la interpretabilidad, introduciendo al mismo tiempo medidas cuantitativas de confiabilidad25. Sistemas híbridos de aprendizaje profundo que combinan segmentación de lesiones, aprendizaje en conjunto y CNN lograron un excelente rendimiento en múltiples conjuntos de datos ISIC, pero siguieron siendo sensibles a la calidad de la segmentación y al desequilibrio de clases26.

Más recientemente, arquitecturas híbridas cada vez más sofisticadas han mejorado aún más la precisión de clasificación mediante la integración de técnicas complementarias de aprendizaje profundo (DL). Las redes generativas antagónicas condicionales combinadas con YOLOv5 y el análisis de componentes independientes lograron precisiones de clasificación superiores al 99 %, aunque su complejidad computacional limitó su implementación práctica27. De manera similar, las arquitecturas híbridas LSTM–ResNet aprendieron eficazmente representaciones espacio-temporales, pero requirieron recursos computacionales considerablemente mayores28. Los modelos basados en transformadores, incluido Sap-Former, aprovecharon la información contextual global para mejorar la representación de características, pero necesitaron un preprocesamiento extenso, conjuntos de datos anotados a gran escala y una potencia computacional significativa29. Alternativas ligeras como S-MobileNet intentaron equilibrar la eficiencia computacional con la precisión diagnóstica30, mientras que los métodos de adaptación de dominio no supervisados mejoraron la generalización entre dominios, a pesar de su menor eficacia cuando solo se disponía de un número limitado de muestras de entrenamiento31. Las redes híbridas mejoradas con mecanismos de atención que incorporan módulos de atención convolucionales modificados y el aprendizaje por conjuntos en instantes (snapshot ensemble learning) también mostraron un rendimiento prometedor para la clasificación de lesiones cutáneas por viruela del mono, aunque persistieron desafíos relacionados con el desequilibrio de clases, la diversidad de imágenes y la escasa explicabilidad32. Arquitecturas residuales personalizadas que emplean diseños de redes más profundas y funciones de pérdida híbridas mejoraron aún más la precisión de clasificación por encima del 99 %, pero conllevan un costo computacional considerablemente mayor y tiempos de entrenamiento más largos33. Estudios de revisión exhaustivos concluyeron consistentemente que el aprendizaje profundo supera ampliamente a los enfoques tradicionales basados en características manualmente diseñadas, al aprender automáticamente representaciones discriminativas de imágenes, identificando simultáneamente desafíos persistentes asociados con artefactos de imagen, variabilidad de iluminación, complejidad computacional y limitada generalización clínica34.

Aunque el aprendizaje profundo (DL) ha mejorado notablemente la precisión diagnóstica, las preocupaciones sobre la transparencia del modelo, la estimación de incertidumbre y la implementación clínica confiable han estimulado un creciente interés en el aprendizaje federado y en la inteligencia artificial explicable (XAI). Varios estudios han investigado técnicas de cuantificación de incertidumbre, incluyendo la predicción conforme, el dropout de Monte Carlo y el aprendizaje profundo basado en evidencia, demostrando que una estimación de confianza confiable puede mejorar sustancialmente la toma de decisiones, a pesar de imponer restricciones adicionales computacionales y relacionadas con los datos35. También se han propuesto marcos de aprendizaje mutuo basados en transformadores para abordar el desequilibrio de clases mientras se mejora la eficiencia del aprendizaje de características36. Otros enfoques combinaron CNN con resolución completa con técnicas de optimización basadas en grafos para mejorar la segmentación y clasificación de lesiones37, mientras que marcos híbridos de aprendizaje profundo que integran múltiples representaciones complementarias de características lograron precisión de clasificación cercanas al 99,5 %, a pesar de requerir un procesamiento previo extenso38.

Investigaciones recientes se han centrado cada vez más en integrar la explicabilidad directamente en los marcos de aprendizaje profundo (DL) para aumentar la confianza de los clínicos y facilitar la adopción clínica práctica. Los sistemas explicables que emplean múltiples arquitecturas de redes neuronales convolucionales junto con Grad-CAM y Score-CAM localizaron con éxito regiones de lesiones diagnósticamente relevantes, manteniendo al mismo tiempo un rendimiento competitivo en clasificación tanto en conjuntos de datos internos como externos39. Los marcos híbridos CNN–Transformador que combinan imágenes dermatoscópicas con metadatos clínicos mejoraron aún más el rendimiento predictivo, utilizando al mismo tiempo SHAP y Grad-CAM para generar explicaciones visuales clínicamente significativas40. Otras arquitecturas híbridas basadas en transformadores, que integran EfficientNetV2S, Transformadores Swin, redes Xception modificadas y mecanismos de atención en grafos, capturaron eficazmente características complementarias globales y locales de las lesiones, aunque sus grandes cantidades de parámetros y rendimiento limitado en clases minoritarias restringieron su implementación práctica41. De manera similar, los marcos híbridos YOLOv8–Transformador de Visión demostraron una mejor localización de lesiones, clasificación multiclase e interpretabilidad visual mediante aumentación adaptativa junto con explicaciones SHAP y Grad-CAM; sin embargo, estos métodos continuaron dependiendo principalmente de conjuntos de datos de referencia y mostraron robustez limitada para categorías minoritarias de lesiones42. Varios artículos de revisión han resumido estos avances, destacando tanto el progreso notable logrado por las técnicas modernas de aprendizaje profundo como los desafíos persistentes relacionados con la eficiencia computacional, la explicabilidad, la dependencia de los conjuntos de datos y la validación clínica43,44,45. Tabla 1 resume algunos trabajos publicados recientemente que utilizan algoritmos de aprendizaje profundo para la clasificación de lesiones cutáneas.

A pesar de los notables avances logrados por los recientes métodos de aprendizaje profundo en la clasificación de lesiones cutáneas, la mayoría de los enfoques existentes siguen limitados por una alta complejidad computacional, dependencia de grandes conjuntos de datos anotados, escasa interpretabilidad del modelo y validación insuficiente en diversos entornos clínicos del mundo real. Para superar estas limitaciones, este artículo propone el marco EDLF-SLC, que integra características complementarias extraídas de múltiples arquitecturas CNN con un clasificador SVM para una clasificación robusta y precisa. El marco emplea además un preprocesamiento mejorado para aumentar la calidad de las imágenes y abordar el desequilibrio de clases, e incorpora la técnica LIME para proporcionar explicaciones visuales de predicciones individuales, mejorando así la transparencia del modelo y su confiabilidad clínica.

Las contribuciones de este estudio son triples. En primer lugar, los autores proponen un marco robusto, EDLF-SLC, que integra redes neuronales convolucionales avanzadas (CNN) con un clasificador de máquinas de vectores de soporte (SVM) para lograr una clasificación precisa y confiable de lesiones cutáneas. En segundo lugar, los autores implementan técnicas mejoradas de preprocesamiento para abordar el desequilibrio entre clases y reducir el ruido en las imágenes, mejorando así la calidad de las imágenes de entrada y el rendimiento general del modelo de clasificación. En tercer lugar, los autores incorporan el método de Explicaciones Locales Modelo-agnósticas (LIME) para visualizar e interpretar predicciones individuales del modelo, resaltando las regiones de la imagen que influyen más fuertemente en las decisiones de clasificación, mejorando así la transparencia y la interpretabilidad del marco propuesto.

Protocolo

Este estudio no implicó la reclutación de participantes humanos ni la recopilación de datos identificables de pacientes. Todos los experimentos se realizaron utilizando el conjunto de datos público de lesiones cutáneas ISIC 2020 obtenido del repositorio de Kaggle; por lo tanto, no se requirió la aprobación del comité de ética institucional ni el consentimiento informado. Todos los materiales utilizados en este estudio se encuentran en la Tabla de Materiales.

Extracción y fusión de características
Las imágenes de lesiones cutáneas se procesaron utilizando múltiples modelos CNN preentrenados. Los vectores de características profundas extraídos de las arquitecturas CNN preentrenadas seleccionadas se concatenan para construir una representación unificada de características para cada imagen de lesión cutánea. La estrategia de fusión adoptada conserva la información visual complementaria aprendida por diferentes arquitecturas CNN, permitiendo que el clasificador SVM subsiguiente aproveche tanto las características texturales de bajo nivel como las representaciones semánticas de nivel superior. Aunque técnicas de reducción de dimensionalidad, como el análisis de componentes principales o la selección de características basada en información mutua, podrían reducir la dimensionalidad de las características, se mantuvo intencionadamente la representación completa fusionada porque el espacio de características fusionado sigue siendo computacionalmente tratable para el clasificador RBF-SVM empleado, a la vez que preserva la información diagnóstica complementaria extraída de los diferentes modelos CNN base.

Clasificación
Los vectores de características fusionados se utilizaron para entrenar un clasificador SVM con un kernel RBF. Se emplearon técnicas de optimización de hiperparámetros para determinar la configuración óptima de clasificación. Luego, el clasificador categorizó las lesiones cutáneas en sus clases respectivas.

Explicabilidad
Para mejorar la interpretabilidad, se aplicó LIME para generar explicaciones visuales que resaltan las regiones de la imagen que contribuyen de manera más significativa a los resultados de clasificación. Estas explicaciones ayudarían a los clínicos a comprender y validar las decisiones del modelo.

Plan de evaluación
El marco propuesto se evaluó utilizando un conjunto de datos de referencia de lesiones cutáneas. El rendimiento se evaluó mediante Exactitud, Precisión, Exhaustividad y Puntaje F1. Se realizaron experimentos comparativos frente a enfoques existentes de aprendizaje automático y aprendizaje profundo para demostrar la eficacia del marco propuesto.

Resultados esperados
Se esperaba que el estudio produjera un sistema preciso e interpretable de clasificación de lesiones cutáneas. Los resultados experimentales preliminares indican que EDLF-SLC alcanza una exactitud del 88,0 %, una precisión del 89,0 %, una recuperación del 87,0 % y una puntuación F1 del 88,0 %, superando a varios métodos competidores. Se anticipó que la integración de explicaciones LIME mejoraría la confiabilidad y facilitaría la adopción de sistemas de diagnóstico asistidos por inteligencia artificial en la práctica clínica.

Importancia
Esta investigación contribuye al creciente campo de la inteligencia artificial explicativa en atención médica al abordar tanto los desafíos de rendimiento como los de transparencia en el diagnóstico de lesiones cutáneas. El marco propuesto tiene el potencial de ayudar a los dermatólogos a tomar decisiones diagnósticas más confiables e interpretables, mejorando así la atención al paciente. Además, en esta sección, los autores proporcionaron información sobre los materiales y la metodología aplicada en este estudio de investigación. En concreto, los autores comenzaron con la descripción del conjunto de datos utilizado para los experimentos y continuaron con la discusión detallada del marco de aprendizaje profundo explicativo para la clasificación de lesiones cutáneas.

Conjunto de datos
El trabajo presentado se basa en el conjunto de datos ISIC 2020 (Colaboración Internacional de Imágenes Dermatológicas), disponible públicamente, al que se puede acceder en el sitio web de Kaggle (https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign). El repositorio ISIC ha sido reconocido como uno de los mejores recursos en el campo de la imagenología dermatológica, ya que proporciona una gran variedad de imágenes dermatoscópicas de diferentes tipos de lesiones cutáneas, como se muestra en Figura 1. Es importante destacar que el conjunto de datos incluye imágenes tanto de condiciones benignas como malignas, lo que lo hace útil para realizar tareas de clasificación binaria en cáncer de piel 46. En el conjunto de datos actual hay 3.297 imágenes, de las cuales 1.800 son benignas y 1.497 son malignas. Para experimentos más eficientes, fue necesario dividir los datos en un conjunto de entrenamiento y un conjunto de prueba. En particular, hay 2.637 imágenes de entrenamiento, incluyendo 1.440 benignas y 1.197 malignas, mientras que el conjunto de prueba consta de 660 imágenes, de las cuales 360 son benignas y 300 son malignas. Un resumen del conjunto de datos se muestra en Tabla 2.

El modelo propuesto EDLF-SLC
En este artículo se propone una solución eficiente y comprensible para clasificar lesiones cutáneas en categorías benignas y malignas, utilizando una técnica novedosa de aprendizaje profundo interpretable basada en un enfoque híbrido que combina las ventajas de múltiples modelos de redes neuronales convolucionales preentrenados. Las redes neuronales convolucionales han demostrado ser altamente efectivas para extraer características semánticas de alto nivel a partir de imágenes médicas. Aprovechando esta capacidad, el marco de aprendizaje profundo interpretable propuesto para la clasificación de lesiones cutáneas (EDLF-SLC) utiliza múltiples modelos CNN preentrenados para lograr un rendimiento superior. Para garantizar la transparencia necesaria en el proceso de toma de decisiones médicas, se ha adoptado LIME en el enfoque propuesto para generar explicaciones locales comprensibles para los resultados obtenidos. El marco completo puede dividirse en tres etapas principales, como se ilustra en Figura 2, a saber, (1) preprocesamiento de datos, (2) extracción de características y clasificación, y (3) interpretabilidad.

Arquitectura del modelo e integración
Como paso preliminar, se seleccionaron y evaluaron siete modelos populares de aprendizaje profundo (MobileNetV2, ResNet50, EfficientNetB0, Xception, InceptionResNetV2, NASNetLarge y MobileNet) en el conjunto de datos de validación de forma independiente, y se eligieron los cuatro modelos más efectivos (ResNet50, EfficientNetB0, MobileNet y Xception) para la etapa de extracción de características. En el marco propuesto, cada imagen de entrada x se procesa de manera independiente a través de los modelos preentrenados seleccionados. Se ha eliminado la última capa completamente conectada de cada uno de estos modelos, y se han obtenido vectores de características a partir de las capas anteriores. fResNet50(x), fEfficientNetB0(x), fMobileNet(x) y fXception(x) hacen referencia a los vectores de características de salida de cada uno de los modelos mencionados anteriormente. Al concatenar esos vectores de características, se obtiene un nuevo vector de características agregado F(xi):

F(xi) = [f(ResNet50)(xi);f(EfficientNetB0)(xi);f(MobileNet)(xi);f(Xception)(xi)] (1)

Posteriormente, F(xi) se introdujo en un clasificador SVM con un kernel de función de base radial (RBF) para obtener el resultado de clasificación. Todo el algoritmo del marco propuesto se presenta en el Archivo Suplementario 1.

El marco propuesto adopta la fusión directa a nivel de características porque cada arquitectura de CNN preentrenada captura características discriminativas diferentes de las lesiones cutáneas mediante su arquitectura de red y jerarquía de características aprendida. En consecuencia, la concatenación de estas representaciones de características heterogéneas conserva información complementaria que contribuye a una caracterización más completa de la lesión antes de la clasificación. Aunque técnicas de reducción de dimensionalidad, como el análisis de componentes principales (PCA) o la selección de características basada en información mutua, pueden reducir la dimensionalidad de la representación fusionada, se mantuvo intencionalmente el vector completo de características fusionadas porque su dimensionalidad sigue siendo computacionalmente tratable para el clasificador RBF-SVM adoptado, a la vez que preserva la información diagnóstica complementaria extraída por los diferentes modelos de CNN. Por lo tanto, este diseño prioriza la retención de representaciones profundas complementarias en lugar de eliminar características potencialmente informativas antes de la clasificación.

Preparación de los datos
La preparación de los datos ha incluido el preprocesamiento y la división del conjunto de datos en conjuntos de entrenamiento y prueba. El preprocesamiento tiene como objetivo mejorar la calidad de los datos eliminando inconsistencias, suprimiendo elementos duplicados, formateando las imágenes de entrada y realizando una normalización de características para un entrenamiento estable de un buen modelo. Todas las imágenes se han normalizado al rango [−1, 1] mediante la normalización por puntuación Z:

Fórmula del valor normalizado (X-μ)/σ, concepto estadístico, diagrama de ecuación. (2)

donde µ y σ representan el valor medio y la desviación estándar de la imagen correspondiente, respectivamente. El conjunto de datos se ha dividido en dos subconjuntos, es decir, un conjunto de entrenamiento (70,0 %) y un conjunto de prueba (30,0 %).

Aumento de datos
Para evitar el sobreajuste y aumentar la capacidad de generalización del modelo, se han utilizado algunas ampliaciones para el conjunto de entrenamiento. Las ampliaciones de imágenes implican modificar las imágenes para expandir artificialmente el conjunto de datos sin alterar las características esenciales de las afecciones médicas. La canalización de ampliación se ha construido utilizando la API secuencial de Keras. Se han empleado transformaciones como volteo horizontal aleatorio, rotación dentro de un ángulo pequeño, cambio de tamaño, escalado, ajuste de brillo y contraste, zoom y algunos movimientos menores. En Figura 3 se ilustran ejemplos representativos de imágenes aumentadas.

Modelos preentrenados
Varios modelos de aprendizaje profundo preentrenados se han adoptado en el marco propuesto para extraer características de imágenes de entrada. Dichos modelos incluyen MobileNet, ResNet50, EfficientNetB0, Xception, NASNetLarge, Inception-ResNet-v2 y MobileNetV2. MobileNet y MobileNetV2 son modelos de aprendizaje profundo ligeros diseñados para realizar cálculos eficientes mediante convoluciones separables por profundidad. ResNet50 emplea el mecanismo de conexiones residuales para entrenar el modelo, evitando así el problema del gradiente que desaparece durante el entrenamiento. EfficientNetB0 logra un equilibrio entre eficiencia y precisión mediante el enfoque de escalado compuesto. Xception extiende la red Inception utilizando convoluciones separables por profundidad. NASNetLarge implica el uso de búsqueda de arquitectura neuronal para construir estructuras óptimas de redes neuronales profundas, e Inception-ResNet-v2 crea una hibridación del modelo Inception y el mecanismo de conexiones residuales. Los vectores de características extraídos de ResNet50 (1.024 características), EfficientNetB0 (1.280 características), MobileNet (1.024 características) y Xception (2.048 características) se concatenan para producir una representación unificada de 5.376 dimensiones. Esta estrategia de fusión se seleccionó para preservar las representaciones complementarias aprendidas por las diferentes arquitecturas de CNN, en lugar de reducir la representación antes de la clasificación. El vector de características resultante se proporciona posteriormente al clasificador RBF-SVM, que determina el límite de decisión no lineal óptimo dentro del espacio de características fusionado.

Modelo de IA interpretable (LIME)
Con el fin de proporcionar cierta interpretabilidad local de las predicciones del modelo, los autores adoptan el método de generar explicaciones localizadas y comprensibles para el ser humano para cada predicción particular del modelo, denominado LIME47. Para cualquier imagen de entrada, LIME primero la divide en unidades más pequeñas llamadas superpíxeles. Luego se generan perturbaciones a partir de la imagen original, y se estiman las predicciones del modelo neuronal profundo para cada una de estas perturbaciones. A continuación, se ajusta un modelo lineal ponderado sobre las perturbaciones, utilizando pesos que dependen de su proximidad a la instancia original de entrada. Tras ajustar el modelo lineal, se estiman las puntuaciones de importancia de las características, lo que indica el papel de cada superpíxel en la predicción de la etiqueta final. Estas puntuaciones de importancia se resaltan visualmente en la imagen final de explicación. El algoritmo LIME se muestra en Archivo Suplementario 2.

Resultados

La evaluación del rendimiento del marco de clasificación desarrollado se basa en medidas tradicionales de evaluación derivadas de la matriz de confusión. Una matriz de confusión permite obtener una comprensión completa del rendimiento del clasificador mediante la representación del número de clasificaciones correctas e incorrectas realizadas para cada clase definida. De este modo, se pueden analizar todos los tipos de errores. Por ejemplo, tanto los falsos positivos como los falsos negativos son especialmente importantes en el diagnóstico de enfermedades. Valores elevados de falsos positivos pueden indicar una alta sensibilidad del clasificador, pero al mismo tiempo, una gran cantidad de falsos negativos indican una baja sensibilidad y suponen riesgos potenciales para la salud. Las siguientes métricas de rendimiento se utilizan en este artículo: exactitud, precisión, recuperación, puntuación F1, especificidad, tasa de verdaderos positivos (TPR) y tasa de falsos positivos (FPR). A continuación se enumeran las fórmulas de estas métricas:

Precisión=(VP+VN)/(VP+VN+FP+FN) (3)

Precisión TP/(TP+FP) (4)

Fórmula de cálculo de recuperación, TP/(TP+FN), utilizada en el análisis de datos para métricas de rendimiento. (5)

fórmula de la puntuación F1; F1=(2×Precision×Recall)/(Precision+Recall); evaluación de eficiencia(6)

Fórmula de especificidad, ecuación para el cálculo de la tasa de verdaderos negativos, diagrama educativo. (7)

Ecuaciones de la tasa de verdaderos positivos y la tasa de falsos positivos, tabla de fórmulas para el análisis estadístico. (8)

En este caso, TP muestra el número de cánceres de piel malignos detectados por el marco, mientras que TN indica el número de lesiones benignas. A su vez, FP demuestra el número de decisiones incorrectas cuando las lesiones se clasifican como malignas aunque en realidad sean benignas. FN refleja el número de muestras benignas reconocidas erróneamente. En lo que respecta a la clasificación del cáncer de piel, minimizar los falsos negativos es extremadamente importante debido a los posibles efectos adversos que esto puede provocar.

Rendimiento de los modelos de referencia
Todos los experimentos computacionales se realizaron en el entorno basado en la nube de Google Colab. Vale la pena destacar que esta plataforma permite ejecutar instancias de máquinas virtuales utilizando una versión predefinida de Ubuntu 20.04 como sistema operativo. Para entrenar los modelos de referencia, se utilizó Python versión 3.9 y el entorno PyTorch versión 2.3.1. Además, todos los nodos de cómputo tenían especificaciones idénticas, a saber, una CPU Intel Xeon con una frecuencia de 2,2 GHz, GPU NVIDIA Tesla T4, 16 GB de RAM y una capacidad de almacenamiento de 70 GB. Por lo tanto, esta configuración experimental permitió reducir la variabilidad introducida por diferentes plataformas de hardware y aumentar la fiabilidad y la reproducibilidad de los resultados. Un resumen completo del entorno experimental se puede encontrar en Tabla 3.

Figura 4 muestra las curvas de aprendizaje correspondientes a 100 épocas de entrenamiento para la arquitectura ResNet-50. El entrenamiento se realizó basándose en un conjunto de datos que contenía 2.110 imágenes, mientras que el tamaño del conjunto de validación fue igual a 660 imágenes. Como puede observarse, durante el entrenamiento, la precisión aumentó constantemente hasta alcanzar casi el 90,0 %. Al mismo tiempo, se observó una mejora en la precisión durante las primeras 50 épocas; después de este punto, la precisión se volvió casi constante, lo que puede considerarse un indicio de convergencia del modelo. Para la validación, el modelo mostró un valor de AUC igual al 86,0 %, demostrando así propiedades discriminativas razonables.

La matriz de confusión presentada en la Figura 5 caracteriza el rendimiento del modelo ResNet-50 en términos de precisión de clasificación en el caso de un conjunto de prueba con 660 imágenes. Durante la evaluación, el modelo reconoció correctamente 310 de 360 muestras benignas y 239 de 300 muestras malignas. Sin embargo, un número relativamente alto de muestras malignas se clasificaron incorrectamente, lo que condujo a un valor relativamente alto de falsos negativos. Este resultado debe considerarse con mayor detalle debido a las graves implicaciones de este tipo de error al utilizar el clasificador en la práctica. En total, el modelo alcanzó una precisión del 83,0 %, con una exactitud del 83,3 %, una recuperación del 83,3 % y una puntuación F1 del 83,3 %.

Tabla 4 contiene una descripción detallada de las características de rendimiento del modelo ResNet-50 en términos de ambas clases. El clasificador mostró un comportamiento relativamente equilibrado en cuanto a la precisión: para muestras benignas, su valor fue del 83,0 %, mientras que las muestras malignas arrojaron una precisión del 84,0 %. De manera similar, los valores de recuperación alcanzaron el 88,0 % para lesiones benignas y el 78,0 % para las malignas. El soporte en la tabla representa el número de muestras correspondientes a cada clase.

Modelo EDLF-SLC propuesto
Figura 6 ilustra el AUC de entrenamiento y validación del modelo propuesto durante 300 épocas. La métrica AUC refleja la capacidad del modelo para distinguir entre clases benignas y malignas, siendo valores más altos indicativos de un mejor rendimiento discriminativo. Como se observa, el AUC de entrenamiento aumenta de forma constante a lo largo del proceso de entrenamiento, alcanzando un valor máximo de 1,00 aproximadamente en la época 200. El AUC de validación también mejora progresivamente durante las etapas iniciales del entrenamiento; sin embargo, comienza a estabilizarse después de aproximadamente 150 épocas, lo que sugiere la convergencia del modelo. El AUC final de validación de 0,95 demuestra una fuerte capacidad de generalización y una separabilidad efectiva entre clases.

La matriz de confusión del modelo propuesto, presentada en la Figura 7, muestra que el modelo clasificó correctamente 299 muestras benignas y 272 muestras malignas, mientras que clasificó erróneamente 28 casos benignos como malignos y 61 casos malignos como benignos. En total, el modelo logró 571 predicciones correctas y 89 clasificaciones erróneas. Destacable es el mayor número de falsos negativos (casos malignos clasificados erróneamente como benignos), lo que resalta una limitación crítica, ya que tales errores pueden tener implicaciones clínicas significativas. No obstante, el rendimiento general de la clasificación sigue siendo robusto. A diferencia de los enfoques de selección de características que eliminan intencionalmente dimensiones antes de la clasificación, el marco propuesto conserva la representación profunda completa y fusionada generada por múltiples arquitecturas heterogéneas de CNN. Este diseño se adoptó porque cada arquitectura extrae características complementarias de las lesiones, y conservar la representación completa permite que el clasificador SVM aproveche la información discriminativa combinada sin excluir características potencialmente informativas. En consecuencia, la estrategia de fusión de características adoptada prioriza el aprendizaje de representaciones complementarias manteniendo la viabilidad computacional.

Figura 8 presenta ejemplos representativos de resultados de clasificación producidos por el modelo propuesto. Los resultados demuestran que el modelo asigna puntuaciones de alta confianza a las instancias clasificadas correctamente. Específicamente, los casos benignos muestran altas probabilidades predichas (por ejemplo, 99,84 % y 99,85 %), mientras que los casos malignos también presentan niveles elevados de confianza (por ejemplo, 99,98 % y 99,96 %). Estos hallazgos indican que el modelo puede diferenciar eficazmente entre lesiones benignas y malignas, incluso en escenarios visualmente desafiantes. Para mejorar la interpretabilidad, se emplea el marco LIME para generar explicaciones localizadas de las predicciones del modelo, como se muestra en Figura 9A–D. LIME aproxima el límite de decisión complejo del modelo utilizando un modelo lineal localmente interpretable. Para cada imagen de entrada, el método genera muestras perturbadas mediante el enmascaramiento selectivo de superpíxeles y evalúa las predicciones correspondientes. Luego, se ajusta un modelo lineal ponderado a estas muestras, donde los pesos se determinan en función de la proximidad a la entrada original utilizando un núcleo de función de base radial. Los coeficientes resultantes representan la contribución de cada superpíxel a la predicción final y se definen como:

Fórmula de la ecuación de regresión lineal, E(Y)=B0+ΣBjXj, que muestra los elementos del modelo estadístico. (9)

donde Xj ∈ {0, 1} denota la presencia o ausencia del superpíxel j-ésimo, Bj representa el peso de contribución correspondiente, y B0 es la predicción de referencia. Los coeficientes positivos (Bj > 0) indican regiones que contribuyen a la clase maligna, mientras que los coeficientes negativos (Bj < 0) corresponden a características benignas. Las visualizaciones basadas en LIME, mostradas en la Figura 9B, D, resaltan las regiones más influyentes que contribuyen a cada decisión de clasificación. Para lesiones benignas, el modelo enfatiza regiones caracterizadas por una pigmentación uniforme y bordes bien definidos. En contraste, para casos malignos, las regiones resaltadas corresponden a características clínicamente significativas, como bordes irregulares, heterogeneidad del color y texturas atípicas. La intensidad de las regiones resaltadas refleja la magnitud de los coeficientes correspondientes Bj.

Estos resultados demuestran que el modelo EDLF-SLC se centra en características clínicamente significativas que coinciden con criterios dermatológicos establecidos, como la regla ABCD. Esta concordancia mejora la interpretabilidad y confiabilidad del modelo, lo que lo hace más adecuado para la asistencia en la toma de decisiones clínicas. Además, Figura 10 presenta resultados comparativos de visualización obtenidos mediante técnicas adicionales de explicabilidad, incluyendo Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM y EigenCAM, lo que valida aún más la consistencia de las regiones relevantes identificadas a través de diferentes métodos. Con respecto al desempeño del modelo propuesto EDLF-SLC y siete modelos de referencia tras el entrenamiento durante 100 épocas, se puede observar una comparación en la Tabla 5. EDLF-SLC obtuvo un desempeño competitivo de 0.88 en cada métrica evaluada en comparación con las arquitecturas de referencia evaluadas según el contexto experimental. EfficientNetB0 y ResNet50 también tuvieron buenos resultados, con precisiones de 0.85 y 0.83, respectivamente. Por el contrario, Inception-ResNetV2 tuvo el peor desempeño de clasificación entre los modelos evaluados. Por otro lado, a pesar de una precisión de clasificación relativamente baja, su eficiencia computacional fue aún comparable a la de los modelos de referencia. El modelo propuesto EDLF-SLC demostró un desempeño competitivo en relación con los modelos de referencia evaluados bajo las condiciones experimentales adoptadas.

Para evaluar el rendimiento del marco propuesto en comparación con enfoques existentes, Tabla 6 presenta una comparación con métodos representativos de última generación para la clasificación de lesiones cutáneas. Por ejemplo47, se informó una precisión de 0,86, mientras que48 empleó un modelo basado en ensambles que alcanzó una precisión similar pero menor exactitud, recuperación y puntuación F1. Estudios recientes basados en aprendizaje por ensambles y múltiples arquitecturas CNN25,49 informaron precisiones de hasta 0,87. Bajo las condiciones experimentales adoptadas, el marco propuesto EDLF-SLC logró una precisión de 0,88 utilizando una arquitectura unificada interpretable sin requerir componentes adicionales como modelos de segmentación de lesiones.

DISPONIBILIDAD DE LOS DATOS
Los datos que respaldan los hallazgos de este estudio están disponibles públicamente en Kaggle en https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Análisis de lesiones cutáneas, clasificación de melanoma; imágenes diagnósticas, resultados del examen dermatoscópico.
Figura 1: Imágenes dermatoscópicas representativas del conjunto de datos ISIC que ilustran las dos clases diagnósticas utilizadas en este estudio. Las muestras están etiquetadas como benignas (0) y malignas (1), destacando la variabilidad en la morfología, el color y la textura de las lesiones a lo largo del conjunto de datos. Haga clic aquí para ver una versión más grande de esta figura.

Análisis del flujo de trabajo del conjunto de datos de lesiones cutáneas; extracción de características basada en CNN, diagrama de clasificación SVM.
Figura 2: Flujo de trabajo completo del marco EDLF-SLC propuesto. El protocolo comienza con la adquisición de imágenes ISIC 2020, seguido de preprocesamiento, aumento de datos, particionamiento del conjunto de datos, extracción de características profundas mediante cuatro arquitecturas CNN preentrenadas, fusión de características, clasificación mediante SVM, evaluación del rendimiento y generación de explicaciones basadas en LIME. Haga clic aquí para ver una versión más grande de esta figura.

Técnica de microscopía que examina patrones de lesiones cutáneas, imágenes aumentadas de múltiples vistas, análisis médico.
Figura 3: Ejemplos de imágenes aumentadas de lesiones cutáneas generadas mediante técnicas de aumento de datos. Esto incluye inversión horizontal y vertical, rotación, escalado y ajuste de brillo. Estas transformaciones aumentan la diversidad del conjunto de datos, mejoran la robustez del modelo y reducen el riesgo de sobreajuste durante el entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.

Resultado del entrenamiento de la curva ROC, AUC frente a época, diagrama que muestra las tendencias de validación del modelo y precisión del entrenamiento.
Figura 4: Área bajo la curva de característica operativa del receptor (ROC-AUC) del entrenamiento y validación del modelo ResNet-50 durante 100 épocas de entrenamiento. La curva azul representa el AUC del entrenamiento, mientras que la curva naranja representa el AUC de validación. Las curvas muestran una convergencia rápida durante las primeras épocas de entrenamiento, seguida de una optimización estable con un rendimiento de validación consistentemente alto, lo que indica un aprendizaje efectivo y una generalización satisfactoria en el conjunto de datos de validación. Haga clic aquí para ver una versión más grande de esta figura.

Diagrama de matriz de confusión para ResNet-50 en el análisis de clasificación de lesiones benignas frente a malignas.
Figura 5: Matriz de confusión del modelo ResNet-50 en el conjunto de datos de prueba. Las filas representan las etiquetas de clase reales (0 = benigno, 1 = maligno), mientras que las columnas representan las etiquetas de clase predichas. Los elementos diagonales indican muestras clasificadas correctamente (310 benignas y 239 malignas), mientras que los elementos fuera de la diagonal representan muestras mal clasificadas, incluyendo 50 falsos positivos y 61 falsos negativos. Haga clic aquí para ver una versión más grande de esta figura.

curvas ROC-AUC, modelo EDLF-SLC, entrenamiento frente a validación, gráfico, 300 épocas, análisis de datos.
Figura 6: Curva característica de operación del receptor y área bajo la curva (ROC-AUC) de entrenamiento y validación del modelo EDLF-SLC propuesto durante 300 épocas de entrenamiento. La curva azul representa el AUC de entrenamiento, mientras que la curva naranja representa el AUC de validación. El modelo muestra una convergencia rápida durante las primeras épocas de entrenamiento, seguida de una optimización estable con valores de AUC de entrenamiento y validación consistentemente altos durante las épocas restantes. El rendimiento sostenido en la validación demuestra una buena capacidad de generalización y un comportamiento de aprendizaje estable del marco EDLF-SLC propuesto en el conjunto de datos de validación. Haga clic aquí para ver una versión ampliada de esta figura.

Diagrama de matriz de confusión para el modelo EDLF-SLC que muestra la precisión de clasificación de lesiones benignas y malignas.
Figura 7: Matriz de confusión del modelo EDLF-SLC propuesto en el conjunto de datos de prueba. Las filas representan las etiquetas de clase reales (0 = benigno, 1 = maligno), mientras que las columnas representan las etiquetas de clase predichas. Los elementos diagonales indican muestras clasificadas correctamente (299 benignas y 272 malignas), mientras que los elementos fuera de la diagonal corresponden a muestras mal clasificadas, incluyendo 61 falsos positivos y 28 falsos negativos. Haga clic aquí para ver una versión más grande de esta figura.

Análisis de dermatología: imágenes que muestran predicciones de clasificación de lesiones cutáneas, benignas frente a malignas.
Figura 8: Predicciones de ejemplo generadas por el modelo EDLF-SLC propuesto. Esta figura ilustra los niveles de confianza en la clasificación de lesiones benignas y malignas y demuestra la capacidad discriminativa del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Análisis del límite de lesiones cutáneas; los diagramas A-D muestran el proceso de diferenciación entre lesión y contorno en dermatología.
Figura 9: Explicaciones locales basadas en LIME del modelo EDLF-SLC propuesto. La figura resalta las regiones de superpíxeles más influyentes que contribuyen a las decisiones de clasificación del modelo. (A) Imagen dermatoscópica original de una lesión cutánea benigna. (B) Explicación mediante LIME para la lesión benigna, con superpíxeles resaltados que indican las regiones que más contribuyeron a la predicción de benignidad. (C) Imagen dermatoscópica original de una lesión cutánea maligna. (D) Explicación mediante LIME para la lesión maligna, que muestra las regiones de superpíxeles discriminativas que influyeron predominantemente en la clasificación como maligna. Los límites amarillos delimitan los superpíxeles influyentes identificados por LIME, mientras que las regiones grises representan áreas con contribución mínima a la predicción. Haga clic aquí para ver una versión más grande de esta figura.

Análisis de imágenes con métodos GradCAM; diagrama de resultados brutos y superpuestos para explicaciones visuales.
Figura 10: Comparación de métodos de explicabilidad basados en mapas de activación de clase (CAM) aplicados al modelo EDLF-SLC propuesto. La figura compara los mapas de localización generados por GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM y EigenCAM para la misma imagen dermatoscópica. El primer panel muestra la imagen de entrada original, seguida por los mapas de activación brutos correspondientes y las superposiciones de mapas de calor producidos por cada método de explicabilidad. Las visualizaciones ilustran las diferencias en la localización espacial y resaltan las regiones de la imagen que contribuyen más fuertemente a la decisión de clasificación del marco EDLF-SLC propuesto. Haga clic aquí para ver una versión más grande de esta figura.

Ref.AñoConjunto de datosTamaño de los datosExtracción de característicasMétodoPrecisión
92022Conjunto de datos HAM1000010015 imágenes de lesiones cutáneasCaracterísticas de color y formaAlgoritmos de ML y modelos de redes neuronales convolucionales95,1%
192023Conjunto de datos PH2200 imágenes anotadasCaracterísticas de asimetría, estrías, puntos/globulos, áreas de regresiónModelos de ML94,0%
302024Conjunto de datos HAM1000010000 imágenesCaracterísticas de color y formaS-MobileNet97,7%
282025Conjuntos de datos ISIC2020 y HAM10000ISIC2020 (12.670 imágenes) y HAM10000 (10.015 imágenes)Color y formaRed residual con memoria a corto plazo (R-LSTM50)95,7% (ISIC2020); 94,2% (HAM10000)
322026Conjunto de datos de lesiones cutáneas por viruela del mono (MSLD)770 imágenesContexto y texturaDenseNet121, Xception, InceptionV3 y CBAM88% (DenseNet121)
392025HAM1000038.569 imágenesContexto y texturaMobileNet, ResNet50, InceptionV3 y EfficientNet93,6% (MobileNet)
402025ISIC 20192357 imágenesContexto y espacialRed profunda multimodal basada en CNN y transformador98,71%
412026ISIC 201925.000 imágenesContexto y texturaTransXV2S95,26%
422025HAM1000010.015 imágenesColor y formaViT con YOLOv893%

Tabla 1: Comparación bibliográfica. Resumen de algunos trabajos publicados recientemente que utilizan algoritmos de aprendizaje profundo para la clasificación de lesiones cutáneas.

Conjunto de datosBenignoMalignoTotal
Datos de entrenamiento144011972637
Datos de prueba360300660
Datos totales180014973297

Tabla 2: Distribución del conjunto de datos. Distribución de muestras benignas y malignas en el conjunto de datos ISIC 2020, incluyendo las divisiones de entrenamiento y prueba.

ComponenteEspecificación
Sistema operativoUbuntu 20.04
Lenguaje de programaciónPython 3.9
Framework de aprendizaje profundoPyTorch 2.3.1
OptimizadorAdam
Programación de la tasa de aprendizaje1e−3
Número de épocas100/300
CPU2 vCPU 2.2 GHz
GPUTesla T4 (16 GB) × 1
RAM16 GB
Parámetros entrenables2,430,353 (9.27 MB)
Parámetros no entrenables133,434,397 (509.01 MB)

Tabla 3: Especificaciones del sistema. Especificaciones detalladas del entorno computacional, incluyendo los entornos de software y los recursos hardware utilizados para el entrenamiento y la evaluación del modelo.

ClasePrecisiónRecuperaciónPuntaje F1Soporte
Clase benigna0.830.880.85360
Clase maligna0.840.780.81300
Exactitud--0.832660
Promedio macro0.840.830.83660
Promedio ponderado0.840.830.83660

Tabla 4: Informe de clasificación. Rendimiento de clasificación del modelo ResNet-50 en el conjunto de datos de prueba, que incluye precisión, recuperación, puntuación F1 y soporte para cada clase.

ModeloPrecisiónExactitudRecuperaciónPuntuación F1Tiempo (s)
NASNetLarge0.770.760.770.762002.47
EfficientNetB00.850.850.850.85734.8
Xception0.80.810.80.8732.23
ResNetV20.630.640.630.6111072.34
MobileNet0.790.80.790.79629.29
MobileNetV20.770.790.770.77660.5
ResNet500.830.830.830.83749.77
EDLF-SLC0.880.890.870.883279.77

Tabla 5: Comparación del rendimiento del modelo. Rendimiento comparativo del modelo EDLF-SLC propuesto y de los modelos básicos de aprendizaje profundo en cuanto a precisión, exactitud, recuperación, puntuación F1 y tiempo computacional.

ModeloPrecisiónExactitudRecuperaciónPuntuación F1
ResNet-18 [25]0.850.850.850.85
ResNet-50 con SVM [50]0.870.880.980.93
Modelos híbridos de DL + SVM [48]0.860.840.80.84
Modelos híbridos de DL + SVM [49]0.860.80.60.68
EDLF-SLC propuesto0.880.890.870.88

Tabla 6: Métricas de comparación de modelos. Comparación de rendimiento entre el marco propuesto EDLF-SLC y enfoques recientes de última generación para la clasificación de lesiones cutáneas.

Archivo suplementario 1: Algoritmo 1. Flujo de trabajo del marco EDLF-SLC propuesto, que describe el preprocesamiento de datos, la extracción de características profundas mediante múltiples arquitecturas CNN, la clasificación basada en SVM y la explicabilidad basada en LIME para la predicción de lesiones cutáneas. Haga clic aquí para descargar este archivo.

Archivo suplementario 2: Algoritmo 2. Flujo de trabajo del proceso de explicación local basado en LIME, que ilustra la generación de superpíxeles, el muestreo de perturbaciones, la construcción del modelo sustituto y la visualización de las regiones de la imagen que más contribuyen a la decisión de clasificación. Haga clic aquí para descargar este archivo.

Discusión

El marco propuesto de aprendizaje profundo interpretable para la clasificación de lesiones cutáneas (EDLF-SLC) demuestra que combinar representaciones complementarias de características profundas con inteligencia artificial interpretable puede mejorar tanto el rendimiento de clasificación como la transparencia del modelo. Al integrar múltiples arquitecturas de CNN preentrenadas (ResNet50, EfficientNetB0, MobileNet y Xception) para la extracción de características y emplear una máquina de vectores de soporte (SVM) para la clasificación final, el marco aprovecha las fortalezas de diferentes extractores de características para generar representaciones de lesiones más ricas y discriminativas que las obtenidas a partir de una única red base. Además, la integración de explicaciones locales interpretables independientes del modelo (LIME) proporciona explicaciones visuales localizadas, lo que permite a los clínicos comprender las regiones de la imagen que más contribuyen a cada predicción y aumenta la confianza en las decisiones diagnósticas del modelo.

Los resultados experimentales demuestran que EDLF-SLC alcanza un rendimiento competitivo en comparación con modelos CNN de referencia, incluyendo MobileNet, Xception y ResNet50, destacando la eficacia de la fusión de características complementarias y de la clasificación basada en SVM. La comparación con enfoques recientes de última generación confirma además la competitividad del marco propuesto. Por ejemplo, dos estudios48,49 reportaron precisiones de aproximadamente 0,86 utilizando métodos basados en ensambles, mientras que otros marcos híbridos CNN-SVM25,50,51,52,53 alcanzaron precisiones de hasta 0,87, pero dependieron de arquitecturas más complejas y módulos adicionales de preprocesamiento o segmentación. En contraste, el marco propuesto logra una precisión de 0,88 utilizando una arquitectura relativamente simplificada, sin requerir segmentación explícita de lesiones, y al mismo tiempo proporciona predicciones interpretables mediante LIME. Estos resultados indican que combinar extractores de características CNN complementarios antes de la clasificación con SVM puede mejorar el rendimiento diagnóstico manteniendo la simplicidad y transparencia arquitectónica.

Aunque el marco propuesto mejora la precisión y la interpretabilidad de la clasificación, esta mejora se logra a costa de un mayor costo computacional. El tiempo total de entrenamiento de EDLF-SLC es aproximadamente 3279.77 s, considerablemente más alto que el de modelos CNN individuales como ResNet50 (749.77 s) y MobileNet (629.29 s). Este costo computacional adicional resulta del entrenamiento de múltiples CNN preentrenadas y de la realización de la fusión de características antes de la clasificación. Dicho compromiso es comúnmente observado en enfoques híbridos y de aprendizaje conjunto, donde se logra un mejor desempeño predictivo a expensas de mayores requisitos computacionales. Sin embargo, en sistemas clínicos de apoyo a la toma de decisiones, la precisión diagnóstica, la robustez y la confiabilidad generalmente se consideran más importantes que la eficiencia del entrenamiento, ya que afectan directamente los resultados en los pacientes.

Otra ventaja importante del marco propuesto es su explicabilidad. A diferencia de los modelos convencionales de aprendizaje profundo que a menudo funcionan como cajas negras, EDLF-SLC incorpora LIME para proporcionar explicaciones visuales específicas por caso del proceso de predicción. Estas explicaciones ayudan a los clínicos a verificar si el modelo se enfoca en regiones de lesiones clínicamente relevantes, mejorando así la transparencia, apoyando la interpretación clínica y facilitando la confianza en el diagnóstico asistido por inteligencia artificial. Por consiguiente, el marco propuesto ofrece un equilibrio práctico entre el rendimiento predictivo y la interpretabilidad del modelo, lo que lo convierte en una herramienta prometedora de apoyo informático a la toma de decisiones para la clasificación de lesiones cutáneas.

A pesar de estos resultados alentadores, deben reconocerse varias limitaciones. En primer lugar, el marco se evaluó utilizando únicamente el conjunto de datos ISIC disponible públicamente, y su capacidad de generalización en imágenes obtenidas bajo diferentes condiciones clínicas, dispositivos de imagen y poblaciones de pacientes aún debe validarse. En segundo lugar, emplear múltiples arquitecturas de CNN previamente entrenadas aumenta inevitablemente la complejidad computacional y el tiempo de entrenamiento en comparación con modelos de una sola base. En tercer lugar, se adoptaron configuraciones fijas de hiperparámetros durante todos los experimentos, y una mayor optimización podría mejorar el rendimiento y la adaptabilidad en diferentes conjuntos de datos. Por último, aunque LIME mejora la transparencia del modelo, sus explicaciones son locales y dependientes de las perturbaciones, lo que significa que la consistencia de las explicaciones puede variar entre ejecuciones y debe validarse más a fondo con expertos en dermatología antes de su implementación clínica rutinaria.

La investigación futura se centrará en validar el marco propuesto utilizando múltiples conjuntos de datos a gran escala y multicéntricos de lesiones cutáneas, optimizando la eficiencia computacional mediante técnicas de fusión ligera de características y compresión de modelos, investigando estrategias avanzadas de optimización de hiperparámetros y extendiendo el marco a la clasificación multiclase de lesiones cutáneas. Además, la integración de técnicas adicionales de inteligencia artificial explicable y la realización de evaluaciones clínicas prospectivas con dermatólogos fortalecerán aún más la confiabilidad, interpretabilidad y aplicabilidad práctica del marco propuesto en entornos clínicos del mundo real.

Divulgaciones

Los autores declaran que no existe ningún conflicto de intereses.

Agradecimientos

Los autores desean expresar su sincero agradecimiento a la Universidad de Taif por proporcionar el entorno de investigación y el apoyo institucional que facilitaron la realización de este trabajo.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos de lesiones cutáneas ISIC 2020Colaboración Internacional de Imágenes Cutáneas (ISIC)Conjunto de datos del desafío ISIC 2020Conjunto de imágenes dermatoscópicas utilizado para el desarrollo y evaluación del modelo.
KerasEquipo de KerasIntegrado con TensorFlowConstrucción y entrenamiento de modelos de aprendizaje profundo.
LIME (Explicaciones Locales Interpretables Independientes del Modelo)Ribeiro et al.Paquete de PythonGeneración de explicaciones visuales locales para las predicciones del modelo.
MatplotlibDesarrolladores de MatplotlibÚltima versión compatibleVisualización de curvas de aprendizaje, matrices de confusión y gráficos de evaluación.
NumPyDesarrolladores de NumPyÚltima versión compatibleCálculo numérico y manipulación de matrices.
GPU NVIDIA Tesla T4Corporación NVIDIA16 GB de VRAMAceleración del entrenamiento del modelo y la inferencia.
PandasEquipo de desarrollo de PandasÚltima versión compatibleProcesamiento de datos y gestión de resultados experimentales.
Modelos CNN preentrenadosAplicaciones de TensorFlow/KerasResNet50, EfficientNetB0, MobileNet, XceptionExtracción de características profundas a partir de imágenes dermatoscópicas.
PythonFundación del Software PythonVersión 3.9Lenguaje de programación utilizado para la implementación.
PyTorchFundación PyTorchVersión 2.3.1Entorno de aprendizaje profundo utilizado para la extracción de características y la implementación del modelo.
Scikit-learnDesarrolladores de Scikit-learnÚltima versión compatibleMáquina de vectores de soporte (SVM), métricas de evaluación y preprocesamiento de datos.
Máquina de vectores de soporte (kernel RBF)Scikit-learnSVCClasificación de representaciones de características profundas fusionadas.
TensorFlowGoogle LLCVersión 2.xEntorno de aprendizaje profundo para el entrenamiento y la inferencia del modelo.
Sistema operativo UbuntuCanonical Ltd.Ubuntu 20.04Entorno operativo experimental.

Referencias

  1. Chan S, Reddy V, Myers B, Thibodeaux Q, Brown-Stone N, Liao W. Machine learning in dermatology: current applications, opportunities, and limitations. Dermatol Ther (Heidelb). 2020;10:365-386.
  2. Olsen CM. Global trends in melanoma mortality differ by sex and age. Br J Dermatol. 2020;183(6):985-986.
  3. Sun Y, Shen Y, Liu Q, Zhang H, Jia L, Chai Y, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021. J Am Acad Dermatol. 2025;92(1):100-107.
  4. Monika MK, Vignesh NA, Kumari CU, Kumar M, Lydia EL. Skin cancer detection and classification using machine learning. Mater Today Proc. 2020;33:4266-4270.
  5. Hosny KM, Elshora D, Mohamed ER, Vrochidou E, Papakostas GA. Deep learning and optimization-based methods for skin lesions segmentation: a review. IEEE Access. 2023.
  6. Baghdadi NA, Farghaly Abdelaliem SM, Malki A, Gad I, Ewis A, Atlam ES. Advanced machine learning techniques for cardiovascular disease early detection and diagnosis. J Big Data. 2023;10(1):144.
  7. Veeramani N, Jayaraman P, Krishankumar R, Ravichandran KS, Gandomi AH. DDCNN-F: double decker convolutional neural network feature fusion as a medical image classification framework. Sci Rep. 2024;14(1).
  8. Veeramani N, Jayaraman P. YOLOv7-XAI: multiclass skin lesion diagnosis using explainable artificial intelligence with fair decision making. Int J Imaging Syst Technol. 2024;34(6).
  9. Shetty B, Fernandes R, Rodrigues AP, Chengoden R, Bhattacharya S, Lakshmanna K. Skin lesion classification of dermoscopic images using machine learning and convolutional neural network. Sci Rep. 2022;12(1):18134.
  10. Ali AR, Li J, Yang G, O'Shea SJ. A machine learning approach to automatic detection of irregularity in skin lesion border using dermoscopic images. PeerJ Comput Sci. 2020;6:e268.
  11. Pham TTH, Luu TN, Nguyen TV, Huynh NT, Phan QH, Le TH. Polarimetric imaging combining optical parameters for classification of mice non-melanoma skin cancer tissue using machine learning. Heliyon. 2023;9(11).
  12. Liu N, Rejeesh M, Sundararaj V, Gunasundari B. ACO-KELM: anti coronavirus optimized kernel-based softplus extreme learning machine for classification of skin cancer. Expert Syst Appl. 2023;232:120719.
  13. Masud M, Almars AM, Rokaya MB, Meshref H, Gad I, Atlam ES. A novel lightweight convolutional neural network model to predict Alzheimer's disease applying weighted loss function. J Disabil Res. 2024;3(4):20240042.
  14. Kumar A, Veeraiah V, Gongada TN, Ahamad S, Khan H, Gupta A. Explainable machine learning models for clinical decision support systems. In: 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT). Piscataway (NJ): IEEE; 2024. p. 1-6.
  15. Shahzad K, Wasim M, Pires IM, Garcia NM. Multi-classification of skin lesions using a deep learning-based convolutional neural network. Procedia Comput Sci. 2024;241:588-593.
  16. Celebi ME, Kingravi HA, Uddin B, Iyatomi H, Aslandogan YA, Stoecker WV, et al. A methodological approach to the classification of dermoscopy images. Comput Med Imaging Graph. 2007;31(6):362-373.
  17. Li CX, Shen CB, Xue K, Shen X, Jing Y, Wang ZY, et al. Artificial intelligence in dermatology: past, present, and future. Chin Med J (Engl). 2019;132(17):2017-2020.
  18. Ramprasad M, Nagesh S, Sahith V, Lankalapalli RK. Hierarchical agglomerative clustering based skin lesion detection with region-based neural networks classification. Meas Sens. 2023;29:100865.
  19. Khater T, Ansari S, Mahmoud S, Hussain A, Tawfik H. Skin cancer classification using explainable artificial intelligence on pre-extracted image features. Intell Syst Appl. 2023;20:200275.
  20. Wang H, Ahn E, Bi L, Kim J. Self-supervised multi-modality learning for multi-label skin lesion classification. Comput Methods Programs Biomed. 2025;265:108729.
  21. Thapar P, Rakhra M, Alsaadi M, Quraishi A, Deka A, Naga Ramesh JV. A hybrid grasshopper optimization algorithm for skin lesion segmentation and melanoma classification using deep learning. Healthc Anal. 2024;5:100326.
  22. Kumar S, Nath VK, Hazarika D. Blend of deep features and binary tree growth algorithm for skin lesion classification. Symmetry (Basel). 2023;15(12):2213.
  23. Chandrahaas BV, Mohanty SN, Panda SK, et al. An empirical study on classification of monkeypox skin lesion detection. EAI Endorsed Trans Pervasive Health Technol. 2023;9:e4.
  24. Talavera-Martínez L, Bibiloni P, Giacaman A, Taberner R, de Paz Hernando LJD, González-Hidalgo M. A novel approach for skin lesion symmetry classification with a deep learning model. Comput Biol Med. 2022;145:105450.
  25. Ieracitano C, Morabito FC, Hussain A, Suffian M, Mammone N. TIXAI: a trustworthiness index for explainable artificial intelligence in skin lesion classification. Neurocomputing. 2025;630:129701.
  26. Hasan MK, Elahi MTE, Alam MA, Jawad MT, Martí R. DermoExpert: skin lesion classification using a hybrid convolutional neural network through segmentation, transfer learning, and augmentation. Inform Med Unlocked. 2022;28:100819.
  27. Koparde S, Kotwal J, Deshmukh S, Adsure S, Chaudhari P, Kimbahune V. Conditional generative adversarial networks and YOLOv5 Darknet-based skin lesion localization and classification using an independent component analysis model. Inform Med Unlocked. 2024;47:101515.
  28. Padhy S, Dash S, Kumar N, Singh SP, Kumar G, Moral P. Temporal integration of ResNet features with LSTM for enhanced skin lesion classification. Results Eng. 2025;25:104201.
  29. Xin C, Liu Z, Ma Y, Wang D, Zhang J, Li L, et al. Transformer-guided self-adaptive network for multi-scale skin lesion image segmentation. Comput Biol Med. 2024;169:107846.
  30. Sulthana R, Chamola V, Hussain Z, Albalwy F, Hussain A. A novel end-to-end deep convolutional neural network-based skin lesion classification framework. Expert Syst Appl. 2024;246:123056.
  31. Chamarthi S, Fogelberg K, Brinker TJ, Niebling J. Mitigating the influence of domain shift in skin lesion classification: a benchmark study of unsupervised domain adaptation methods. Inform Med Unlocked. 2024;44:101430.
  32. Maity S, Paul S, Guha S, Dasgupta S, Ghosh M. Automated classification of monkeypox skin lesions using a hybrid deep learning model. Biomed Signal Process Control. 2026;126:110955.
  33. Nasir S, Bilal M, Khalidi H. Detection and classification of skin cancer by using CNN-enabled cloud storage data access control algorithm based on blockchain technology. Int J Theor Appl Comput Intell. 2025:145-169.
  34. Saba T. Computer vision for microscopic skin cancer diagnosis using handcrafted and non-handcrafted features. Microsc Res Tech. 2021;84(6):1272-1283.
  35. Fayyad J, Alijani S, Najjaran H. Empirical validation of conformal prediction for trustworthy skin lesion classification. Comput Methods Programs Biomed. 2024;253:108231.
  36. Liu P, Qian W, Li H, Cao J. A relationship-aware mutual learning method for lightweight skin lesion classification. Digit Commun Netw. 2025;11(3):603-612.
  37. Adla D, Reddy GVR, Nayak P, Karuna G. A full-resolution convolutional network with a dynamic graph cut algorithm for skin cancer classification and detection. Healthc Anal. 2023;3:100154.
  38. Thamizhamuthu R, Maniraj SP. Deep learning-based dermoscopic image classification system for robust skin lesion analysis. Trait Signal. 2023;40(3).
  39. Di Giammarco M, Santone A, Cesarelli M, Martinelli F, Mercaldo F. A method for skin lesion detection and localization by means of deep learning and reliable prediction explainability. Image Vis Comput. 2025;162:105675.
  40. Haq IU, Joarder HA, Khan AA, Shi X, Alsayaydeh JAJ, Yusof MFB, et al. XAAI-ledger: an explainable CNN-transformer-based multimodal deep learning framework for early detection of melanoma and non-melanoma skin cancers using dermoscopic and clinical data. Biomed Signal Process Control. 2026;123:110410.
  41. Saeed K, Shehzad M, Malik MGA, Ahmed S, Azar AT. TransXV2S-NET: a novel hybrid deep learning architecture with dual-contextual graph attention for multi-class skin lesion classification. Knowl Based Syst. 2026;337:115407.
  42. AbuAlkebash H, Saleh RAA, Ertunç HM. Automated explainable deep learning framework for multiclass skin cancer detection and classification using hybrid YOLOv8 and vision transformer (ViT). Biomed Signal Process Control. 2025;108:107934.
  43. Hasan MK, Ahamad MA, Yap CH, Yang G. A survey, review, and future trends of skin lesion segmentation and classification. Comput Biol Med. 2023;155:106624.
  44. Li H, Pan Y, Zhao J, Zhang L. Skin disease diagnosis with deep learning: a review. Neurocomputing. 2021;464:364-393.
  45. Wu Y, Chen B, Zeng A, Pan D, Wang R, Zhao S. Skin cancer classification with deep learning: a systematic review. Front Oncol. 2022;12:893972.
  46. Fanconic. Skin cancer: malignant vs benign dataset. Kaggle; 2023. Available from: https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign
  47. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16). New York (NY): ACM; 2016. p. 1135-1144.
  48. Bassel A, Abdulkareem AB, Alyasseri ZAA, Sani NS, Mohammed HJ. Automatic malignant and benign skin cancer classification using a hybrid deep learning approach. Diagnostics (Basel). 2022;12(10):2472.
  49. Bhardwaj A, Rege PP. Skin lesion classification using deep learning. In: Advances in Signal and Data Processing: Select Proceedings of ICSDP 2019. Singapore: Springer; 2021. p. 575-589.
  50. Keerthana D, Venugopal V, Nath MK, Mishra M. Hybrid convolutional neural networks with SVM classifier for classification of skin cancer. Biomed Eng Adv. 2023;5:100069.
  51. Ahmed A, Siam AI, Atwa MA, Atwa EM, Abdelrahim EM, Atlam ES. An explainable YOLO-based deep learning framework for pneumonia detection from chest X-ray images. Algorithms. 2025;18(11):703.
  52. Farsi M, ZainEldin H, Sayed RF, El-Agamy ES, Atlam SA, Alsaedi M, et al. Deep learning for pathology: YOLOv8 with EigenCAM for reliable colorectal cancer diagnostics. Bioengineering (Basel). 2025;12(11):1203.
  53. Atwa EA, Atlam ES, Ahmed A, Atwa MA, Abdelrahim EM, Siam AI. Interpretable deep learning models for arrhythmia classification based on ECG signals using the PTB-XL dataset. Diagnostics (Basel). 2025;15(15):1950.

Reimpresiones y permisos

Etiquetas

IA explicableredes neuronales convolucionalesmáquina de vectores de soporteinterpretabilidad de modelosfusión de característicasCNN preentrenadaexplicaciones LIMEdiagnóstico de enfermedades