A avaliação de desempenho do framework de classificação desenvolvido baseia-se em medidas tradicionais de avaliação derivadas da matriz de confusão. Uma matriz de confusão permite obter uma compreensão completa do desempenho do classificador por meio da representação do número de classificações corretas e incorretas feitas para cada classe definida. Dessa forma, todos os tipos de erros podem ser analisados. Por exemplo, tanto os falsos positivos quanto os falsos negativos são especialmente importantes no diagnóstico de doenças. Valores elevados de falsos positivos podem indicar alta sensibilidade do classificador, mas, ao mesmo tempo, grandes quantidades de falsos negativos indicam baixa sensibilidade e representam riscos potenciais à saúde. As seguintes métricas de desempenho são utilizadas neste artigo: acurácia, precisão, revocação (recall), pontuação F1, especificidade, taxa de verdadeiros positivos (TVP) e taxa de falsos positivos (TFP). As fórmulas dessas métricas são listadas abaixo:
Precisão=(VP+VN)/(VP+VN+FP+FN) (3)
Precisão = VP/(VP+FP) (4)
(5)
(6)
(7)
(8)
Neste caso, VP mostra o número de cânceres de pele malignos detectados pela estrutura, enquanto VN indica o número de lesões benignas. Por sua vez, FP demonstra o número de decisões incorretas quando lesões são classificadas como malignas, embora na verdade sejam benignas. FN reflete o número de amostras benignas reconhecidas incorretamente. No que diz respeito à classificação de câncer de pele, minimizar os falsos negativos é extremamente importante devido aos potenciais efeitos adversos decorrentes disso.
Desempenho dos modelos de referência
Todos os experimentos computacionais foram realizados no ambiente baseado em nuvem do Google Colab. Vale ressaltar que esta plataforma permite executar instâncias de máquinas virtuais utilizando um Ubuntu 20.04 pré-definido como sistema operacional. Para treinar os modelos de referência, foram utilizados Python versão 3.9 e o framework PyTorch versão 2.3.1. Além disso, todos os nós de computação tinham especificações idênticas, ou seja, uma CPU Intel Xeon com frequência de 2,2 GHz, GPU NVIDIA Tesla T4, 16 GB de RAM e capacidade de armazenamento de 70 GB. Assim, essa configuração experimental permitiu reduzir a variabilidade introduzida por diferentes plataformas de hardware e aumentar a confiabilidade e reprodutibilidade dos resultados. Um resumo completo do ambiente experimental pode ser encontrado na Tabela 3.
Figura 4 mostra as curvas de aprendizado correspondentes a 100 épocas de treinamento para a arquitetura ResNet-50. O treinamento foi realizado com base em um conjunto de dados contendo 2.110 imagens, enquanto o tamanho do conjunto de validação foi igual a 660 imagens. Como pode-se observar, durante o treinamento, a precisão aumentou constantemente até quase 90,0%. Ao mesmo tempo, houve melhoria na precisão nas primeiras 50 épocas; após esse ponto, a precisão tornou-se quase constante, o que pode ser visto como um sinal de convergência do modelo. Para validação, o modelo demonstrou um valor de AUC igual a 86,0%, demonstrando, portanto, propriedades discriminativas razoáveis.
A matriz de confusão apresentada na Figura 5 caracteriza o desempenho do modelo ResNet-50 em termos de precisão de classificação no caso de um conjunto de testes com 660 imagens. Durante a avaliação, o modelo reconheceu corretamente 310 de 360 amostras benignas e 239 de 300 amostras malignas. No entanto, um número relativamente alto de amostras malignas foi classificado incorretamente, o que resultou em um valor relativamente elevado de falsos negativos. Esse resultado deve ser analisado com mais detalhes devido às sérias implicações desse tipo de erro ao utilizar o classificador na prática. No total, o modelo alcançou uma precisão de 83,0%, com uma exatidão de 83,3%, uma sensibilidade de 83,3% e uma pontuação F1 de 83,3%.
Tabela 4 contém uma descrição detalhada das características de desempenho do modelo ResNet-50 em relação às duas classes. O classificador apresentou um comportamento relativamente equilibrado em termos de precisão: para amostras benignas, o valor foi de 83,0%, enquanto amostras malignas apresentaram uma precisão de 84,0%. Da mesma forma, os valores de revocação atingiram 88,0% para lesões benignas e 78,0% para as malignas. O suporte na tabela representa o número de amostras correspondentes a cada classe.
Modelo EDLF-SLC proposto
Figura 6 ilustra a AUC de treinamento e validação do modelo proposto ao longo de 300 épocas. A métrica AUC reflete a capacidade do modelo de distinguir entre classes benignas e malignas, com valores mais altos indicando melhor desempenho discriminativo. Como observado, a AUC de treinamento aumenta constantemente ao longo do processo de treinamento, atingindo um valor máximo de 1,00 em aproximadamente 200 épocas. A AUC de validação também melhora progressivamente nas fases iniciais do treinamento; no entanto, começa a se estabilizar após aproximadamente 150 épocas, sugerindo convergência do modelo. A AUC final de validação de 0,95 demonstra forte capacidade de generalização e separabilidade eficaz entre classes.
A matriz de confusão do modelo proposto, apresentada na Figura 7, mostra que o modelo classificou corretamente 299 amostras benignas e 272 amostras malignas, enquanto classificou incorretamente 28 casos benignos como malignos e 61 casos malignos como benignos. No total, o modelo obteve 571 predições corretas e 89 classificações incorretas. Notavelmente, o maior número de falsos negativos (casos malignos classificados incorretamente como benignos) destaca uma limitação crítica, já que tais erros podem ter implicações clínicas significativas. Apesar disso, o desempenho geral da classificação permanece robusto. Diferentemente das abordagens de seleção de características que removem intencionalmente dimensões antes da classificação, a estrutura proposta preserva a representação profunda completa e fundida gerada por múltiplas arquiteturas heterogêneas de CNN. Essa abordagem foi adotada porque cada estrutura básica extrai características complementares da lesão, e manter a representação completa permite que o classificador SVM aproveite as informações discriminativas combinadas sem excluir características potencialmente informativas. Consequentemente, a estratégia de fusão de características adotada prioriza a aprendizagem de representações complementares, mantendo a viabilidade computacional.
Figura 8 apresenta exemplos representativos dos resultados de classificação produzidos pelo modelo proposto. Os resultados demonstram que o modelo atribui pontuações de alta confiança às instâncias classificadas corretamente. Especificamente, os casos benignos exibem altas probabilidades previstas (por exemplo, 99,84% e 99,85%), enquanto os casos malignos também mostram níveis elevados de confiança (por exemplo, 99,98% e 99,96%). Esses achados indicam que o modelo pode diferenciar efetivamente entre lesões benignas e malignas, mesmo em cenários visualmente desafiadores. Para aumentar a interpretabilidade, o framework LIME é empregado para gerar explicações localizadas das previsões do modelo, conforme mostrado em Figura 9A–D. O LIME aproxima o limite de decisão complexo do modelo utilizando um modelo linear localmente interpretável. Para cada imagem de entrada, o método gera amostras perturbadas ao mascarar seletivamente superpixels e avaliar as previsões correspondentes. Um modelo linear ponderado é então ajustado a essas amostras, em que os pesos são determinados com base na proximidade com a entrada original, utilizando um kernel de função de base radial. Os coeficientes resultantes representam a contribuição de cada superpixel para a previsão final e são definidos como:
(9)
em que Xj ∈ {0, 1} denota a presença ou ausência do j-ésimo superpixel, Bj representa o peso de contribuição correspondente e B0 é a previsão de referência. Coeficientes positivos (Bj > 0) indicam regiões que contribuem para a classe maligna, enquanto coeficientes negativos (Bj < 0) correspondem a características benignas. As visualizações baseadas no LIME, mostradas na Figura 9B, D, destacam as regiões mais influentes que contribuem para cada decisão de classificação. Para lesões benignas, o modelo enfatiza regiões caracterizadas por pigmentação uniforme e bordas bem definidas. Em contraste, nos casos malignos, as regiões destacadas correspondem a características clinicamente significativas, como bordas irregulares, heterogeneidade de cor e texturas atípicas. A intensidade das regiões destacadas reflete a magnitude dos coeficientes correspondentes Bj.
Esses resultados demonstram que o modelo EDLF-SLC se concentra em características clinicamente significativas que estão alinhadas aos critérios dermatológicos estabelecidos, como a regra ABCD. Esse alinhamento aumenta a interpretabilidade e a confiabilidade do modelo, tornando-o mais adequado para suporte à decisão clínica. Além disso, Figura 10 apresenta resultados comparativos de visualização obtidos utilizando técnicas adicionais de explicabilidade, incluindo Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM e EigenCAM, validando ainda mais a consistência das regiões salientes identificadas entre diferentes métodos. Em relação ao desempenho do modelo proposto EDLF-SLC e de sete modelos de referência após o treinamento de 100 épocas, uma comparação pode ser observada na Tabela 5. O EDLF-SLC obteve um desempenho competitivo de 0,88 em cada métrica avaliada, comparado às arquiteturas de referência, com base no contexto experimental. O EfficientNetB0 e o ResNet50 também obtiveram bons resultados, com precisões de 0,85 e 0,83, respectivamente. Por outro lado, o Inception-ResNetV2 apresentou o pior desempenho de classificação entre os modelos avaliados. No entanto, apesar da precisão de classificação relativamente baixa, sua eficiência computacional ainda foi comparável à dos modelos de referência. O modelo proposto EDLF-SLC demonstrou um desempenho competitivo em relação aos modelos de referência avaliados nas condições experimentais adotadas.
Para avaliar o desempenho do framework proposto em relação a abordagens existentes, Tabela 6 apresenta uma comparação com métodos representativos de última geração para classificação de lesões cutâneas. Por exemplo47, relatou uma acurácia de 0,86, enquanto48 empregou um modelo baseado em conjunto que alcançou acurácia semelhante, mas menor precisão, revocação e pontuação F1. Estudos recentes baseados em aprendizado em conjunto e múltiplas arquiteturas CNN25,49 relataram acurácias de até 0,87. Nas condições experimentais adotadas, o framework EDLF-SLC proposto alcançou uma acurácia de 0,88, utilizando uma arquitetura unificada explicável, sem necessidade de componentes adicionais, como modelos de segmentação de lesões.
DISPONIBILIDADE DE DADOS
Os dados que apoiam as descobertas deste estudo estão livremente disponíveis no Kaggle em https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Figura 1: Imagens dermatoscópicas representativas do conjunto de dados ISIC ilustrando as duas classes diagnósticas utilizadas neste estudo. As amostras são rotuladas como benignas (0) e malignas (1), destacando a variabilidade na morfologia, cor e textura das lesões ao longo do conjunto de dados. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Fluxo de trabalho completo do framework EDLF-SLC proposto. O protocolo começa com a aquisição de imagens do ISIC 2020, seguida por pré-processamento, aumento de dados, partição do conjunto de dados, extração de características profundas utilizando quatro arquiteturas CNN pré-treinadas, fusão de características, classificação por SVM, avaliação de desempenho e geração de explicações baseadas em LIME. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Exemplos de imagens de lesões cutâneas aumentadas geradas utilizando técnicas de aumento de dados. Isso inclui inversão horizontal e vertical, rotação, redimensionamento e ajuste de brilho. Essas transformações aumentam a diversidade do conjunto de dados, melhoram a robustez do modelo e reduzem o risco de superajuste durante o treinamento. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Área sob a curva da característica operacional do receptor (ROC-AUC) para treinamento e validação do modelo ResNet-50 ao longo de 100 épocas de treinamento. A curva azul representa a AUC do treinamento, enquanto a curva laranja representa a AUC da validação. As curvas demonstram convergência rápida nas épocas iniciais de treinamento, seguida por otimização estável com desempenho de validação consistentemente alto, indicando aprendizado eficaz e boa generalização no conjunto de dados de validação. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Matriz de confusão do modelo ResNet-50 no conjunto de dados de teste. As linhas representam os rótulos de classe reais (0 = benigno, 1 = maligno), enquanto as colunas representam os rótulos de classe previstos. Os elementos diagonais indicam amostras corretamente classificadas (310 benignas e 239 malignas), enquanto os elementos fora da diagonal representam amostras mal classificadas, incluindo 50 falsos positivos e 61 falsos negativos. Clique aqui para visualizar uma versão maior desta figura.

Figura 6: Curva da característica de operação do receptor (ROC-AUC) para treinamento e validação do modelo EDLF-SLC proposto ao longo de 300 épocas de treinamento. A curva azul representa a AUC de treinamento, enquanto a curva laranja representa a AUC de validação. O modelo exibe convergência rápida nas épocas iniciais de treinamento, seguida por otimização estável com valores consistentemente altos de AUC de treinamento e validação ao longo das épocas restantes. O desempenho sustentado na validação demonstra boa capacidade de generalização e comportamento de aprendizado estável do framework proposto EDLF-SLC no conjunto de dados de validação. Clique aqui para visualizar uma versão maior desta figura.

Figura 7: Matriz de confusão do modelo EDLF-SLC proposto no conjunto de dados de teste. As linhas representam os rótulos de classe reais (0 = benigno, 1 = maligno), enquanto as colunas representam os rótulos de classe previstos. Os elementos diagonais indicam amostras corretamente classificadas (299 benignas e 272 malignas), enquanto os elementos fora da diagonal correspondem às amostras mal classificadas, incluindo 61 falsos positivos e 28 falsos negativos. Clique aqui para visualizar uma versão maior desta figura.

Figura 8: Predições exemplares geradas pelo modelo EDLF-SLC proposto. Esta figura ilustra os níveis de confiança na classificação de lesões benignas e malignas e demonstra a capacidade discriminativa do modelo. Clique aqui para visualizar uma versão maior desta figura.

Figura 9: Explicações locais baseadas em LIME do modelo EDLF-SLC proposto. A figura destaca as regiões de superpixels mais influentes que contribuem para as decisões de classificação do modelo. (A) Imagem dermatoscópica original de uma lesão cutânea benigna. (B) Explicação LIME para a lesão benigna, com superpixels destacados indicando as regiões que mais contribuíram para a predição de benignidade. (C) Imagem dermatoscópica original de uma lesão cutânea maligna. (D) Explicação LIME para a lesão maligna, mostrando as regiões de superpixels discriminativas que influenciaram predominantemente a classificação como maligna. Contornos amarelos delimitam os superpixels influentes identificados pelo LIME, enquanto áreas cinzas representam regiões com contribuição mínima para a predição. Clique aqui para visualizar uma versão maior desta figura.

Figura 10: Comparação de métodos de explicabilidade baseados em mapeamento de ativação de classe (CAM) aplicados ao modelo EDLF-SLC proposto. A figura compara os mapas de localização gerados por GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM e EigenCAM para a mesma imagem dermatoscópica. O primeiro painel mostra a imagem de entrada original, seguida pelos respectivos mapas de ativação brutos e sobreposições de mapa de calor produzidos por cada método de explicabilidade. As visualizações ilustram as diferenças na localização espacial e destacam as regiões da imagem que contribuem mais fortemente para a decisão de classificação do framework EDLF-SLC proposto. Clique aqui para visualizar uma versão maior desta figura.
| Ref. | Ano | Conjunto de dados | Tamanho dos dados | Extração de características | Método | Precisão |
| 9 | 2022 | HAM10000 dataset | 10015 imagens de lesões cutâneas | Características de cor e forma | Algoritmos de ML e modelos de RN convolucionais | 95,1% |
| 19 | 2023 | PH2 dataset | 200 imagens anotadas | Características de assimetria, estrias, pontos/glóbulos e áreas de regressão | Modelos de ML | 94,0% |
| 30 | 2024 | HAM10000 dataset | 10000 imagens | Características de cor e forma | S-MobileNet | 97,7% |
| 28 | 2025 | Conjuntos de dados ISIC2020 e HAM10000 | ISIC2020 (12.670 imagens) e HAM10000 (10.015 imagens) | Cor e forma | Rede residual com memória de longo e curto prazo (R-LSTM50) | 95,7% (ISIC2020); 94,2% (HAM10000) |
| 32 | 2026 | Monkeypox Skin Lesion Dataset (MSLD) | 770 imagens | Contexto e textura | DenseNet121, Xception, InceptionV3 e CBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38.569 imagens | Contexto e textura | MobileNet, ResNet50, InceptionV3 e EfficientNet | 93,6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 imagens | Contexto e espacial | Rede profunda multimodal baseada em CNN e transformador | 98,71% |
| 41 | 2026 | ISIC 2019 | 25.000 imagens | Contexto e textura | TransXV2S | 95,26% |
| 42 | 2025 | HAM10000 | 10.015 imagens | Cor e forma | ViT com YOLOv8 | 93% |
Tabela 1: Comparação da literatura. Resumo de alguns trabalhos publicados recentemente que utilizam algoritmos de aprendizado profundo para a classificação de lesões cutâneas.
| Conjunto de dados | Benigno | Maligno | Total |
| Dados de treinamento | 1440 | 1197 | 2637 |
| Dados de teste | 360 | 300 | 660 |
| Dados totais | 1800 | 1497 | 3297 |
Tabela 2: Distribuição do conjunto de dados. Distribuição das amostras benignas e malignas no conjunto de dados ISIC 2020, incluindo as divisões de treinamento e teste.
| Componente | Especificação |
| Sistema Operacional | Ubuntu 20.04 |
| Linguagem de Programação | Python 3.9 |
| Framework de Aprendizado Profundo | PyTorch 2.3.1 |
| Otimizador | Adam |
| Agendamento da taxa de aprendizado | 1e−3 |
| Número de épocas | 100/300 |
| CPU | 2 vCPU 2,2 GHz |
| GPU | Tesla T4 (16 GB) × 1 |
| RAM | 16 GB |
| Parâmetros Treináveis | 2.430.353 (9,27 MB) |
| Parâmetros Não Treináveis | 133.434.397 (509,01 MB) |
Tabela 3: Especificações do sistema. Especificações detalhadas do ambiente computacional, incluindo estruturas de software e recursos de hardware utilizados para o treinamento e avaliação do modelo.
| Classe | Precisão | Revocação | Pontuação F1 | Suporte |
| Classe benigna | 0.83 | 0.88 | 0.85 | 360 |
| Classe maligna | 0.84 | 0.78 | 0.81 | 300 |
| Exatidão | - | - | 0.832 | 660 |
| Média macro | 0.84 | 0.83 | 0.83 | 660 |
| Média ponderada | 0.84 | 0.83 | 0.83 | 660 |
Tabela 4: Relatório de classificação. Desempenho da classificação do modelo ResNet-50 no conjunto de dados de teste, incluindo precisão, revocação, pontuação F1 e suporte para cada classe.
| Modelo | Precisão | Exatidão | Recuperação | Pontuação F1 | Tempo (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tabela 5: Comparação do desempenho do modelo. Desempenho comparativo do modelo EDLF-SLC proposto e dos modelos de aprendizado profundo de referência em relação à acurácia, precisão, revocação, pontuação F1 e tempo computacional.
| Modelo | Precisão | Exatidão | Sensibilidade | Pontuação F1 |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 com SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Modelos DL híbridos + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Modelos DL híbridos + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| EDLF-SLC proposto | 0.88 | 0.89 | 0.87 | 0.88 |
Tabela 6: Métricas de comparação de modelos. Comparação de desempenho entre o framework proposto EDLF-SLC e abordagens recentes de última geração para classificação de lesões cutâneas.
Arquivo Suplementar 1: Algoritmo 1. Fluxo de trabalho do framework EDLF-SLC proposto, descrevendo o pré-processamento dos dados, a extração de características profundas utilizando múltiplas arquiteturas CNN, a classificação baseada em SVM e a explicabilidade baseada em LIME para a predição de lesões cutâneas. Clique aqui para baixar este arquivo.
Arquivo Suplementar 2: Algoritmo 2. Fluxo de trabalho do processo de explicação local baseado em LIME, ilustrando a geração de superpixels, amostragem de perturbação, construção do modelo substituto e visualização das regiões da imagem que mais contribuem para a decisão de classificação. Clique aqui para baixar este arquivo.