Artigo de investigação

Um Framework de Apoio Computacional Explicável para Classificação de Lesões Cutâneas Utilizando Aprendizagem Profunda

60 visualizações

DOI:

10.3791/72639

25 de agosto de 2026

Neste artigo

Resumo

Este artigo apresenta uma estrutura baseada em CNN explicável para classificação de lesões cutâneas que combina alta precisão diagnóstica com interpretabilidade do modelo. Ele classifica imagens de lesões e gera explicações visuais para suas previsões. Os resultados demonstram um desempenho robusto e uma transparência aprimorada, apoiando a tomada de decisões clínicas e auxiliando dermatologistas na detecção precoce de doenças de pele.

Resumo

A utilização de redes neurais convolucionais profundas com a finalidade de diagnosticar doenças na área da pele demonstrou apresentar níveis de precisão semelhantes aos obtidos por dermatologistas em diversos estudos. No entanto, muitos desafios ainda persistem, incluindo desempenho inferior e baixa generalização em alguns casos, além de baixa interpretabilidade relacionada ao uso de modelos do tipo caixa-preta. Isso cria grandes obstáculos para a implementação prática, uma vez que se exige explicabilidade além de diagnósticos precisos, tornando necessário encontrar uma solução. Para superar as dificuldades mencionadas, um framework explicável de aprendizado profundo para classificação de lesões cutâneas (EDLF-SLC) foi desenvolvido neste estudo. O framework utiliza diversas abordagens em aprendizado de máquina e inteligência artificial explicável (XAI) para garantir melhorias tanto em precisão quanto em interpretabilidade, de maneira dividida em três etapas. Na etapa inicial, representações profundas extraídas de múltiplas arquiteturas de CNN pré-treinadas são fundidas para preservar informações discriminativas complementares aprendidas por diferentes arquiteturas de rede antes da classificação, utilizando uma SVM com kernel de função de base radial. Em seguida, classificadores de Máquina de Vetores de Suporte (SVM) com kernel de função de base radial são utilizados para classificar as características obtidas. Por fim, as previsões realizadas pelo modelo são interpretadas por meio de explicações locais, interpretáveis e independentes de modelo (LIME). Os resultados experimentais mostram que o EDLF-SLC atinge 88,0% de precisão, 89,0% de exatidão, 87,0% de revocação e 88,0% de pontuação F1, demonstrando desempenho competitivo em comparação com diversos métodos recentemente relatados nas condições experimentais consideradas neste estudo.

Introdução

Lesões cutâneas são uma preocupação importante em dermatologia e oncologia, pois variam desde anormalidades benignas até cânceres malignos, como o melanoma, a forma mais letal de câncer de pele. Em 2020, o melanoma representou aproximadamente 325.000 novos casos e mais de 57.000 mortes em todo o mundo1. Embora os avanços no rastreamento e tratamento tenham melhorado os resultados para os pacientes, o diagnóstico tardio e o acesso limitado aos cuidados de saúde continuam contribuindo para a alta mortalidade e perda de anos de vida, especialmente entre populações mais jovens2,3.

O diagnóstico tradicional baseia-se principalmente no exame visual e na dermatoscopia, tornando o processo dependente da expertise dos clínicos e suscetível à subjetividade, variabilidade entre observadores, biópsias desnecessárias e tempos prolongados de exame4,5,6. Para superar essas limitações, a aprendizagem profunda, particularmente as CNNs, surgiu como uma solução eficaz para a classificação automatizada de lesões cutâneas. Modelos baseados em CNN, incluindo DDCNN-F7, YOLOv7-XAI8 e diversas outras arquiteturas9,10,11,12,13, demonstraram alta precisão diagnóstica ao aprender automaticamente características discriminativas das imagens. Apesar do seu sucesso, a maioria dos modelos de aprendizagem profunda opera como "caixas pretas", limitando a confiança dos clínicos e dificultando sua adoção na prática médica rotineira. Técnicas de inteligência artificial explicável foram, portanto, introduzidas para melhorar a transparência dos modelos, fornecendo explicações visuais das previsões. Entre esses métodos, as Explicações Locais, Interpretáveis e Agnósticas em relação ao Modelo geram explicações locais interpretáveis ao identificar as regiões da imagem que mais influenciam as decisões do modelo14.

A classificação de lesões cutâneas evoluiu desde a avaliação clínica tradicional até sistemas diagnósticos avançados baseados em IA, impulsionada pela necessidade de detecção precisa, confiável e precoce do câncer de pele. Essa evolução percorreu cinco estágios principais — métodos diagnósticos tradicionais, diagnóstico assistido por computador (CAD), aprendizado de máquina (ML), aprendizado profundo (DL) e, mais recentemente, IA explicável (XAI) e aprendizado federado (FL) — refletindo esforços contínuos para melhorar a precisão diagnóstica, a consistência, a escalabilidade e a confiabilidade clínica, ao mesmo tempo que supera as limitações do exame convencional. Os primeiros métodos computacionais tentaram emular o raciocínio clínico por meio de descritores de imagem manualmente elaborados derivados da regra ABCD, incluindo assimetria, irregularidade de borda, variação de cor e diâmetro da lesão. Essas características foram combinadas com redes bayesianas, árvores de decisão, sistemas especialistas e modelos de inferência difusa para auxiliar no diagnóstico de melanoma, com diversos estudos relatando precisões de classificação superiores a 90%15,16,17. Apesar de terem fornecido uma base importante para o diagnóstico auxiliado por computador, esses métodos dependiam inteiramente de características manualmente projetadas e regras diagnósticas pré-definidas. Consequentemente, apresentavam robustez limitada frente a variações na qualidade da imagem, morfologia da lesão, iluminação e condições de aquisição.

Para superar essas limitações, os sistemas clássicos de CAD surgiram como uma etapa intermediária entre a análise convencional de imagens e as estruturas modernas baseadas em IA. Os sistemas de CAD combinaram extração de características manual com classificadores convencionais para melhorar a consistência diagnóstica e auxiliar na tomada de decisões clínicas. Diversas abordagens híbridas integraram agrupamento hierárquico com redes neurais recorrentes e arquiteturas de memória de curto e longo prazo, alcançando precisões de classificação próximas a 99,5%18. Outras estruturas baseadas em CAD incorporaram classificadores por reforço de gradiente com explicações baseadas em SHAP, demonstrando precisão diagnóstica competitiva enquanto aumentavam a transparência do modelo19. Embora esses sistemas representassem uma melhoria significativa em relação às abordagens puramente baseadas em regras, continuaram a depender fortemente da extração manual de características, pré-processamento extenso, conjuntos de dados cuidadosamente anotados e pipelines de processamento multifásicos.

Técnicas de aprendizado de máquina aprimoraram ainda mais a classificação automatizada de lesões cutâneas ao permitir um aprendizado baseado em dados, em vez de um design explícito de regras. Estruturas híbridas que combinam redes neurais convolucionais com classificadores de aprendizado de máquina convencionais, incluindo regressão logística e k-vizinhos mais próximos, demonstraram alto desempenho de classificação em conjuntos de dados de referência, alcançando precisões superiores a 95%9. O aprendizado multimodal auto-supervisionado aprimorou ainda mais a representação de características ao explorar conjuntamente imagens dermatoscópicas e clínicas, reduzindo assim a dependência de anotações manuais extensivas enquanto melhora o desempenho da classificação20. Estudos adicionais combinaram CNNs com análise discriminante generalizada, descritores SURF e algoritmos de otimização para melhorar a discriminação de características e a precisão da classificação21. Técnicas de seleção automática de características que empregam DenseNet-201, InceptionV3 e algoritmos de otimização por árvore binária aprimoraram ainda mais a representação de características, mantendo um desempenho diagnóstico competitivo22. Abordagens de aprendizado por transferência que utilizam arquiteturas pré-treinadas, como AlexNet e GoogLeNet, também demonstraram capacidade promissora de classificação, mesmo com dados de treinamento limitados23. No entanto, a maioria dos métodos de aprendizado de máquina continuou dependendo de procedimentos de pré-processamento cuidadosamente projetados, estratégias de otimização manuais, conjuntos de dados balanceados e ajuste extensivo de hiperparâmetros. Sua validação externa limitada e sensibilidade ao desequilíbrio de classes restringiram ainda mais sua aplicabilidade prática em diferentes contextos clínicos.

A introdução do DL transformou fundamentalmente a classificação automatizada de lesões cutâneas ao permitir o aprendizado end-to-end diretamente a partir de dados de imagem brutos. As CNNs eliminaram a necessidade de engenharia de características manual, ao mesmo tempo que melhoraram substancialmente o desempenho diagnóstico em diversos conjuntos de dados de referência. A maioria das abordagens baseadas em CNN demonstrou melhorias significativas na classificação de lesões por meio de arquiteturas cada vez mais sofisticadas. Modelos de CNN sensíveis à simetria exploraram características clinicamente relevantes das lesões, mas alcançaram apenas uma precisão balanceada moderada24. Outros integraram arquiteturas EfficientNet com explicações LIME e SHAP para melhorar a interpretabilidade, ao mesmo tempo que introduziram medidas quantitativas de confiabilidade25. Sistemas híbridos de DL que combinam segmentação de lesões, aprendizado em conjunto e CNNs alcançaram excelente desempenho em múltiplos conjuntos de dados ISIC, mas permaneceram sensíveis à qualidade da segmentação e ao desequilíbrio de classes26.

Mais recentemente, arquiteturas híbridas cada vez mais sofisticadas têm aprimorado ainda mais a precisão de classificação ao integrar técnicas complementares de aprendizado profundo. Redes adversárias generativas condicionais combinadas com YOLOv5 e análise de componentes independentes alcançaram precisões de classificação superiores a 99%, embora sua complexidade computacional tenha limitado a implantação prática 27. Da mesma forma, arquiteturas híbridas LSTM–ResNet aprenderam efetivamente representações espaço-temporais, mas exigiram recursos computacionais substancialmente maiores28. Modelos baseados em transformadores, incluindo o Sap-Former, exploraram informações contextuais globais para aprimorar a representação de características, mas exigiram pré-processamento extensivo, conjuntos de dados anotados em larga escala e grande poder computacional29. Alternativas leves, como a S-MobileNet, tentaram equilibrar eficiência computacional com precisão diagnóstica30, enquanto métodos de adaptação de domínio não supervisionados melhoraram a generalização entre domínios, apesar da eficácia reduzida quando disponíveis apenas amostras limitadas de treinamento31. Redes híbridas aprimoradas por mecanismos de atenção, incorporando módulos modificados de atenção convolucional e aprendizado por conjunto de instantâneos, também demonstraram desempenho promissor na classificação de lesões cutâneas de varíola dos macacos, embora desafios associados ao desequilíbrio de classes, diversidade de imagens e baixa explicabilidade permaneçam sem solução32. Arquiteturas residuais personalizadas, empregando designs de rede mais profundos e funções de perda híbridas, aprimoraram ainda mais a precisão de classificação além de 99%, mas acarretaram sobrecarga computacional e tempo de treinamento consideravelmente maiores33. Estudos de revisão abrangentes concluíram consistentemente que o aprendizado profundo supera substancialmente as abordagens tradicionais baseadas em características manualmente projetadas, ao aprender automaticamente representações discriminativas de imagens, identificando simultaneamente desafios persistentes associados a artefatos de imagem, variabilidade de iluminação, complexidade computacional e limitada generalização clínica34.

Embora o aprendizado profundo (DL) tenha melhorado drasticamente a precisão diagnóstica, preocupações sobre a transparência do modelo, estimativa de incerteza e implantação clínica confiável têm estimulado um crescente interesse na explicação de IA (XAI) e no aprendizado federado. Vários estudos investigaram técnicas de quantificação de incerteza, incluindo predição conforme, dropout de Monte Carlo e aprendizado profundo evidencial, demonstrando que uma estimativa confiável de confiança pode melhorar substancialmente o suporte à decisão, apesar de impor restrições adicionais computacionais e relacionadas a dados35. Também foram propostas estruturas de aprendizado mútuo baseadas em transformadores para lidar com o desequilíbrio de classes, ao mesmo tempo que melhoram a eficiência da aprendizagem de características36. Outras abordagens combinaram CNNs de resolução total com técnicas de otimização baseadas em grafos para melhorar a segmentação e classificação de lesões37, enquanto estruturas híbridas de aprendizado profundo que integram múltiplas representações complementares de características alcançaram precisões de classificação próximas a 99,5%, apesar de exigirem pré-processamento extensivo38.

Pesquisas recentes têm se concentrado cada vez mais na integração da explicabilidade diretamente nos frameworks de aprendizado profundo (DL) para aumentar a confiança dos clínicos e facilitar a adoção clínica prática. Sistemas explicáveis que empregam múltiplas arquiteturas de redes neurais convolucionais juntamente com Grad-CAM e Score-CAM localizaram com sucesso regiões de lesões clinicamente relevantes, mantendo um desempenho competitivo de classificação em conjuntos de dados internos e externos39. Frameworks híbridos CNN–Transformer que combinam imagens dermatoscópicas com metadados clínicos aprimoraram ainda mais o desempenho preditivo, utilizando SHAP e Grad-CAM para gerar explicações visuais clinicamente significativas40. Outras arquiteturas híbridas baseadas em transformadores, integrando EfficientNetV2S, Swin Transformers, redes Xception modificadas e mecanismos de atenção em grafos, capturaram eficazmente características complementares globais e locais das lesões, embora sua grande quantidade de parâmetros e desempenho limitado em classes minoritárias tenham restringido a implantação prática41. Da mesma forma, frameworks híbridos YOLOv8–Transformer de Visão demonstraram melhorias na localização de lesões, classificação multiclasse e interpretabilidade visual por meio de aumento adaptativo juntamente com explicações SHAP e Grad-CAM; no entanto, esses métodos continuaram a depender principalmente de conjuntos de dados de referência e exibiram robustez limitada para categorias minoritárias de lesões42. Vários artigos de revisão resumiram esses avanços, enfatizando tanto os notáveis progressos alcançados pelas técnicas modernas de aprendizado profundo quanto os desafios persistentes relacionados à eficiência computacional, explicabilidade, dependência de conjuntos de dados e validação clínica43,44,45. Tabela 1 resume alguns trabalhos publicados recentemente que utilizam algoritmos de aprendizado profundo para classificação de lesões cutâneas.

Apesar dos notáveis avanços alcançados pelos métodos recentes de aprendizado profundo na classificação de lesões cutâneas, a maioria das abordagens existentes permanece limitada pela alta complexidade computacional, dependência de grandes conjuntos de dados anotados, baixa interpretabilidade do modelo e validação insuficiente em diversos ambientes clínicos do mundo real. Para superar essas limitações, este artigo propõe o framework EDLF-SLC, que integra características complementares extraídas de múltiplas arquiteturas CNN com um classificador SVM para uma classificação robusta e precisa. O framework emprega ainda um pré-processamento aprimorado para melhorar a qualidade da imagem e lidar com o desequilíbrio entre classes, além de incorporar a técnica LIME para fornecer explicações visuais das previsões individuais, aumentando assim a transparência do modelo e a confiança clínica.

As contribuições deste estudo são triplices. Primeiro, os autores propõem um framework robusto, EDLF-SLC, que integra redes neurais convolucionais avançadas (CNNs) com um classificador máquina de vetores de suporte (SVM) para alcançar uma classificação precisa e confiável de lesões cutâneas. Segundo, os autores implementam técnicas aprimoradas de pré-processamento para lidar com o desequilíbrio de classes e reduzir o ruído nas imagens, melhorando assim a qualidade das imagens de entrada e o desempenho geral do modelo de classificação. Terceiro, os autores incorporam o método Local Interpretable Model-agnostic Explanations (LIME) para visualizar e interpretar predições individuais do modelo, destacando as regiões da imagem que mais fortemente influenciam as decisões de classificação, aumentando assim a transparência e a interpretabilidade do framework proposto.

Protocolo

Este estudo não envolveu a recrutamento de participantes humanos nem a coleta de dados identificáveis de pacientes. Todos os experimentos foram realizados utilizando o conjunto de dados público de lesões cutâneas ISIC 2020 obtido do repositório Kaggle; portanto, não foi necessária a aprovação do comitê de ética institucional nem o consentimento informado. Todos os materiais utilizados neste estudo estão na Tabela de Materiais.

Extração e fusão de características
As imagens de lesões cutâneas foram processadas utilizando múltiplos modelos de CNN pré-treinados. Vetores de características profundas extraídos das arquiteturas de CNN pré-treinadas selecionadas são concatenados para construir uma representação unificada de características para cada imagem de lesão cutânea. A estratégia de fusão adotada preserva informações visuais complementares aprendidas por diferentes arquiteturas de CNN, permitindo que o classificador SVM subsequente explore tanto características de textura de baixo nível quanto representações semânticas de nível superior. Embora técnicas de redução de dimensionalidade, como análise de componentes principais ou seleção de características baseada em informação mútua, possam reduzir a dimensionalidade das características, a representação completa fundida foi intencionalmente mantida porque o espaço de características fundido permanece computacionalmente tratável para o classificador RBF-SVM empregado, ao mesmo tempo que preserva informações diagnósticas complementares extraídas dos diferentes modelos de base CNN.

Classificação
Os vetores de características fundidos foram utilizados para treinar um classificador SVM com um kernel RBF. Técnicas de otimização de hiperparâmetros foram empregadas para determinar as configurações ideais de classificação. O classificador então categorizou lesões cutâneas em suas respectivas classes.

Explicabilidade
Para melhorar a interpretabilidade, o LIME foi aplicado para gerar explicações visuais que destacam as regiões da imagem que contribuem de forma mais significativa para os resultados da classificação. Essas explicações ajudariam os clínicos a compreender e validar as decisões do modelo.

Plano de avaliação
A estrutura proposta foi avaliada utilizando um conjunto de dados de referência de lesões cutâneas. O desempenho foi avaliado por meio de Acurácia, Precisão, Revocação (Recall) e Pontuação F1. Foram realizados experimentos comparativos contra abordagens existentes de aprendizado de máquina e aprendizado profundo para demonstrar a eficácia da estrutura proposta.

Resultados esperados
Esperava-se que o estudo produzisse um sistema preciso e interpretável de classificação de lesões cutâneas. Resultados experimentais preliminares indicam que o EDLF-SLC alcança uma acurácia de 88,0%, precisão de 89,0%, revocação de 87,0% e pontuação F1 de 88,0%, superando diversos métodos concorrentes. A integração de explicações LIME foi considerada capaz de aumentar a confiabilidade e facilitar a adoção de sistemas diagnósticos assistidos por IA na prática clínica.

Significância
Esta pesquisa contribui para o campo em expansão da inteligência artificial explicável em saúde, abordando desafios de desempenho e transparência no diagnóstico de lesões cutâneas. A estrutura proposta tem o potencial de auxiliar dermatologistas a tomarem decisões diagnósticas mais confiáveis e interpretáveis, melhorando, em última instância, o atendimento ao paciente. Além disso, nesta seção, os autores forneceram informações sobre os materiais e a metodologia aplicados neste estudo de pesquisa. Especificamente, os autores iniciaram com a descrição do conjunto de dados utilizado nos experimentos e avançaram para a discussão detalhada do Framework de Aprendizado Profundo Explicável para Classificação de Lesões Cutâneas.

Conjunto de dados
O trabalho apresentado baseia-se no conjunto de dados ISIC 2020 (International Skin Imaging Collaboration), disponível publicamente e acessível no site do Kaggle (https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign). O repositório ISIC é reconhecido como um dos melhores recursos na área de imagens dermatológicas, pois fornece uma grande variedade de imagens dermatoscópicas de diferentes tipos de lesões cutâneas, conforme mostrado na Figura 1. Importante destacar que o conjunto de dados inclui imagens de condições tanto benignas quanto malignas, tornando-o útil para a realização de tarefas de classificação binária de câncer de pele 46. O conjunto de dados atual contém 3.297 imagens, das quais 1.800 são benignas e 1.497 são malignas. Para experimentos mais eficientes, os dados precisaram ser divididos em um conjunto de treinamento e um conjunto de testes. Em particular, há 2.637 imagens de treinamento, incluindo 1.440 benignas e 1.197 malignas, enquanto o conjunto de testes consiste em 660 imagens, das quais 360 são benignas e 300 são malignas. Um resumo do conjunto de dados é apresentado na Tabela 2.

O modelo EDLF-SLC proposto
Neste artigo, foi proposta uma solução eficiente e compreensível para classificar lesões cutâneas em categorias benignas e malignas, utilizando uma nova técnica de aprendizado profundo explicável baseada em uma abordagem híbrida que combina as vantagens de múltiplos modelos de redes neurais convolucionais pré-treinados. As redes neurais convolucionais demonstraram-se altamente eficazes na extração de características semânticas de alto nível de imagens médicas. Aproveitando essa capacidade, o framework de aprendizado profundo explicável proposto para classificação de lesões cutâneas (EDLF-SLC) utiliza múltiplos modelos de CNN pré-treinados para alcançar um desempenho superior. Para garantir a transparência necessária no processo de tomada de decisão médica, foi adotado o LIME na abordagem proposta, a fim de gerar explicações locais legíveis por humanos para os resultados obtidos. O framework completo pode ser dividido em três etapas principais, conforme ilustrado na Figura 2, a saber: (1) pré-processamento dos dados, (2) extração de características e classificação, e (3) interpretabilidade.

Arquitetura e integração do modelo
Como etapa preliminar, sete modelos populares de aprendizado profundo (MobileNetV2, ResNet50, EfficientNetB0, Xception, InceptionResNetV2, NASNetLarge e MobileNet) foram selecionados e avaliados separadamente no conjunto de dados de validação, e os quatro modelos mais eficazes (ResNet50, EfficientNetB0, MobileNet e Xception) foram escolhidos para a etapa de extração de características. No framework proposto, cada imagem de entrada x é passada independentemente pelos modelos pré-treinados selecionados. A última camada totalmente conectada foi removida de cada um desses modelos, e vetores de características foram obtidos a partir das camadas anteriores. fResNet50(x), fEfficientNetB0(x), fMobileNet(x) e fXception(x) referem-se aos vetores de características de saída de cada um dos modelos mencionados acima. Ao concatenar esses vetores de características, obtém-se um novo vetor de características agregado F(xi):

F(xi) = [f(ResNet50)(xi);f(EfficientNetB0)(xi);f(MobileNet)(xi);f(Xception)(xi)] (1)

Posteriormente, F(xi) foi submetido a um classificador SVM com um kernel de função de base radial (RBF) para obter o resultado da classificação. Todo o algoritmo da estrutura proposta é apresentado no Arquivo Suplementar 1.

A estrutura proposta adota a fusão direta no nível de características, pois cada arquitetura de CNN pré-treinada capta características discriminativas diferentes das lesões cutâneas por meio de sua arquitetura de rede distinta e hierarquia de características aprendidas. Consequentemente, a concatenação dessas representações heterogêneas de características preserva informações complementares que contribuem para uma caracterização mais abrangente da lesão antes da classificação. Embora técnicas de redução de dimensionalidade, como a análise de componentes principais (PCA) ou a seleção de características baseada em informação mútua, possam reduzir a dimensionalidade da representação fundida, o vetor completo de características fundidas foi intencionalmente mantido, pois sua dimensionalidade permanece computacionalmente tratável para o classificador RBF-SVM adotado, ao mesmo tempo que preserva informações diagnósticas complementares extraídas pelos diferentes backbones de CNN. Assim, este projeto prioriza a manutenção de representações profundas complementares em vez de eliminar características potencialmente informativas antes da classificação.

Preparação dos dados
A preparação dos dados incluiu o pré-processamento e a divisão do conjunto de dados em conjuntos de treinamento e teste. O pré-processamento tem como objetivo melhorar a qualidade dos dados eliminando inconsistências, removendo elementos duplicados, formatando as imagens de entrada e realizando a normalização de características para um treinamento estável de um bom modelo. Todas as imagens foram normalizadas para a faixa [−1, 1] por meio da normalização Z-score:

Fórmula do valor normalizado (X-μ)/σ, conceito estatístico, diagrama de equação. (2)

onde µ e σ representam o valor médio e o desvio padrão da imagem correspondente, respectivamente. O conjunto de dados foi dividido em dois subconjuntos, ou seja, um conjunto de treinamento (70,0%) e um conjunto de teste (30,0%).

Aumento de dados
Para evitar o sobreajuste e aumentar a capacidade de generalização do modelo, algumas técnicas de aumento foram utilizadas para o conjunto de treinamento. Os aumentos de imagens envolvem a modificação de imagens para expandir artificialmente o conjunto de dados sem alterar características essenciais das condições médicas. O pipeline de aumento foi construído utilizando a API Sequencial do Keras. Transformações como inversão horizontal aleatória, rotação dentro de um pequeno ângulo, redimensionamento, escalonamento, ajuste de brilho/contraste, zoom e pequenos deslocamentos foram utilizadas. Exemplos representativos de imagens aumentadas são ilustrados na Figura 3.

Modelos pré-treinados
Vários modelos de aprendizado profundo pré-treinados foram adotados na estrutura proposta para extração de características de imagens de entrada. Esses modelos incluem MobileNet, ResNet50, EfficientNetB0, Xception, NASNetLarge, Inception-ResNet-v2 e MobileNetV2. O MobileNet e o MobileNetV2 são modelos de aprendizado profundo leves, projetados para cálculos eficientes por meio de convoluções separáveis por profundidade. O ResNet50 utiliza o mecanismo de conexões residuais para treinar o modelo, evitando assim o problema do gradiente que desaparece durante o treinamento. O EfficientNetB0 alcança um equilíbrio entre eficiência e precisão por meio da abordagem de escalonamento composto. O Xception estende a rede Inception utilizando convoluções separáveis por profundidade. O NASNetLarge envolve o uso de busca de arquitetura neural para construir estruturas ótimas de redes neurais profundas, enquanto o Inception-ResNet-v2 combina o modelo Inception com o mecanismo de conexões residuais. Vetores de características extraídos do ResNet50 (1.024 características), EfficientNetB0 (1.280 características), MobileNet (1.024 características) e Xception (2.048 características) são concatenados para produzir uma representação unificada de 5.376 dimensões. Essa estratégia de fusão foi escolhida para preservar representações complementares aprendidas pelas diferentes arquiteturas de CNN, em vez de reduzir a representação antes da classificação. O vetor de características resultante é posteriormente fornecido ao classificador RBF-SVM, que determina o limite de decisão não linear ótimo dentro do espaço de características fundido.

Modelo de IA explicável (LIME)
Para fornecer alguma interpretabilidade local das previsões do modelo, os autores adotam o método de gerar explicações locais e legíveis para humanos para cada previsão específica do modelo, denominado LIME47. Para qualquer imagem de entrada, o LIME primeiro a divide em unidades menores chamadas superpixels. Em seguida, são geradas perturbações a partir da imagem original e as previsões do modelo neural profundo são estimadas para cada uma dessas perturbações. Então, um modelo linear ponderado é ajustado às perturbações, utilizando pesos que dependem da proximidade com a instância original de entrada. Após o ajuste do modelo linear, são estimadas as pontuações de importância das características, indicando o papel de cada superpixel na previsão da etiqueta final. Essas pontuações de importância são destacadas visualmente na imagem final de explicação. O algoritmo LIME é apresentado no Arquivo Suplementar 2.

Resultados

A avaliação de desempenho do framework de classificação desenvolvido baseia-se em medidas tradicionais de avaliação derivadas da matriz de confusão. Uma matriz de confusão permite obter uma compreensão completa do desempenho do classificador por meio da representação do número de classificações corretas e incorretas feitas para cada classe definida. Dessa forma, todos os tipos de erros podem ser analisados. Por exemplo, tanto os falsos positivos quanto os falsos negativos são especialmente importantes no diagnóstico de doenças. Valores elevados de falsos positivos podem indicar alta sensibilidade do classificador, mas, ao mesmo tempo, grandes quantidades de falsos negativos indicam baixa sensibilidade e representam riscos potenciais à saúde. As seguintes métricas de desempenho são utilizadas neste artigo: acurácia, precisão, revocação (recall), pontuação F1, especificidade, taxa de verdadeiros positivos (TVP) e taxa de falsos positivos (TFP). As fórmulas dessas métricas são listadas abaixo:

Precisão=(VP+VN)/(VP+VN+FP+FN) (3)

Precisão = VP/(VP+FP) (4)

Fórmula de cálculo de revocação, TP/(TP+FN), usada na análise de dados para métricas de desempenho. (5)

fórmula do escore F1; F1=(2×Precisão×Revocação)/(Precisão+Revocação); avaliação de eficiência(6)

Fórmula de especificidade, equação para o cálculo da taxa de verdadeiros negativos, diagrama educacional. (7)

Equações de taxa de verdadeiro positivo e taxa de falso positivo, tabela de fórmulas para análise estatística. (8)

Neste caso, VP mostra o número de cânceres de pele malignos detectados pela estrutura, enquanto VN indica o número de lesões benignas. Por sua vez, FP demonstra o número de decisões incorretas quando lesões são classificadas como malignas, embora na verdade sejam benignas. FN reflete o número de amostras benignas reconhecidas incorretamente. No que diz respeito à classificação de câncer de pele, minimizar os falsos negativos é extremamente importante devido aos potenciais efeitos adversos decorrentes disso.

Desempenho dos modelos de referência
Todos os experimentos computacionais foram realizados no ambiente baseado em nuvem do Google Colab. Vale ressaltar que esta plataforma permite executar instâncias de máquinas virtuais utilizando um Ubuntu 20.04 pré-definido como sistema operacional. Para treinar os modelos de referência, foram utilizados Python versão 3.9 e o framework PyTorch versão 2.3.1. Além disso, todos os nós de computação tinham especificações idênticas, ou seja, uma CPU Intel Xeon com frequência de 2,2 GHz, GPU NVIDIA Tesla T4, 16 GB de RAM e capacidade de armazenamento de 70 GB. Assim, essa configuração experimental permitiu reduzir a variabilidade introduzida por diferentes plataformas de hardware e aumentar a confiabilidade e reprodutibilidade dos resultados. Um resumo completo do ambiente experimental pode ser encontrado na Tabela 3.

Figura 4 mostra as curvas de aprendizado correspondentes a 100 épocas de treinamento para a arquitetura ResNet-50. O treinamento foi realizado com base em um conjunto de dados contendo 2.110 imagens, enquanto o tamanho do conjunto de validação foi igual a 660 imagens. Como pode-se observar, durante o treinamento, a precisão aumentou constantemente até quase 90,0%. Ao mesmo tempo, houve melhoria na precisão nas primeiras 50 épocas; após esse ponto, a precisão tornou-se quase constante, o que pode ser visto como um sinal de convergência do modelo. Para validação, o modelo demonstrou um valor de AUC igual a 86,0%, demonstrando, portanto, propriedades discriminativas razoáveis.

A matriz de confusão apresentada na Figura 5 caracteriza o desempenho do modelo ResNet-50 em termos de precisão de classificação no caso de um conjunto de testes com 660 imagens. Durante a avaliação, o modelo reconheceu corretamente 310 de 360 amostras benignas e 239 de 300 amostras malignas. No entanto, um número relativamente alto de amostras malignas foi classificado incorretamente, o que resultou em um valor relativamente elevado de falsos negativos. Esse resultado deve ser analisado com mais detalhes devido às sérias implicações desse tipo de erro ao utilizar o classificador na prática. No total, o modelo alcançou uma precisão de 83,0%, com uma exatidão de 83,3%, uma sensibilidade de 83,3% e uma pontuação F1 de 83,3%.

Tabela 4 contém uma descrição detalhada das características de desempenho do modelo ResNet-50 em relação às duas classes. O classificador apresentou um comportamento relativamente equilibrado em termos de precisão: para amostras benignas, o valor foi de 83,0%, enquanto amostras malignas apresentaram uma precisão de 84,0%. Da mesma forma, os valores de revocação atingiram 88,0% para lesões benignas e 78,0% para as malignas. O suporte na tabela representa o número de amostras correspondentes a cada classe.

Modelo EDLF-SLC proposto
Figura 6 ilustra a AUC de treinamento e validação do modelo proposto ao longo de 300 épocas. A métrica AUC reflete a capacidade do modelo de distinguir entre classes benignas e malignas, com valores mais altos indicando melhor desempenho discriminativo. Como observado, a AUC de treinamento aumenta constantemente ao longo do processo de treinamento, atingindo um valor máximo de 1,00 em aproximadamente 200 épocas. A AUC de validação também melhora progressivamente nas fases iniciais do treinamento; no entanto, começa a se estabilizar após aproximadamente 150 épocas, sugerindo convergência do modelo. A AUC final de validação de 0,95 demonstra forte capacidade de generalização e separabilidade eficaz entre classes.

A matriz de confusão do modelo proposto, apresentada na Figura 7, mostra que o modelo classificou corretamente 299 amostras benignas e 272 amostras malignas, enquanto classificou incorretamente 28 casos benignos como malignos e 61 casos malignos como benignos. No total, o modelo obteve 571 predições corretas e 89 classificações incorretas. Notavelmente, o maior número de falsos negativos (casos malignos classificados incorretamente como benignos) destaca uma limitação crítica, já que tais erros podem ter implicações clínicas significativas. Apesar disso, o desempenho geral da classificação permanece robusto. Diferentemente das abordagens de seleção de características que removem intencionalmente dimensões antes da classificação, a estrutura proposta preserva a representação profunda completa e fundida gerada por múltiplas arquiteturas heterogêneas de CNN. Essa abordagem foi adotada porque cada estrutura básica extrai características complementares da lesão, e manter a representação completa permite que o classificador SVM aproveite as informações discriminativas combinadas sem excluir características potencialmente informativas. Consequentemente, a estratégia de fusão de características adotada prioriza a aprendizagem de representações complementares, mantendo a viabilidade computacional.

Figura 8 apresenta exemplos representativos dos resultados de classificação produzidos pelo modelo proposto. Os resultados demonstram que o modelo atribui pontuações de alta confiança às instâncias classificadas corretamente. Especificamente, os casos benignos exibem altas probabilidades previstas (por exemplo, 99,84% e 99,85%), enquanto os casos malignos também mostram níveis elevados de confiança (por exemplo, 99,98% e 99,96%). Esses achados indicam que o modelo pode diferenciar efetivamente entre lesões benignas e malignas, mesmo em cenários visualmente desafiadores. Para aumentar a interpretabilidade, o framework LIME é empregado para gerar explicações localizadas das previsões do modelo, conforme mostrado em Figura 9A–D. O LIME aproxima o limite de decisão complexo do modelo utilizando um modelo linear localmente interpretável. Para cada imagem de entrada, o método gera amostras perturbadas ao mascarar seletivamente superpixels e avaliar as previsões correspondentes. Um modelo linear ponderado é então ajustado a essas amostras, em que os pesos são determinados com base na proximidade com a entrada original, utilizando um kernel de função de base radial. Os coeficientes resultantes representam a contribuição de cada superpixel para a previsão final e são definidos como:

Fórmula da equação de regressão linear, E(Y)=B0+ΣBjXj, que representa os elementos do modelo estatístico. (9)

em que Xj ∈ {0, 1} denota a presença ou ausência do j-ésimo superpixel, Bj representa o peso de contribuição correspondente e B0 é a previsão de referência. Coeficientes positivos (Bj > 0) indicam regiões que contribuem para a classe maligna, enquanto coeficientes negativos (Bj < 0) correspondem a características benignas. As visualizações baseadas no LIME, mostradas na Figura 9B, D, destacam as regiões mais influentes que contribuem para cada decisão de classificação. Para lesões benignas, o modelo enfatiza regiões caracterizadas por pigmentação uniforme e bordas bem definidas. Em contraste, nos casos malignos, as regiões destacadas correspondem a características clinicamente significativas, como bordas irregulares, heterogeneidade de cor e texturas atípicas. A intensidade das regiões destacadas reflete a magnitude dos coeficientes correspondentes Bj.

Esses resultados demonstram que o modelo EDLF-SLC se concentra em características clinicamente significativas que estão alinhadas aos critérios dermatológicos estabelecidos, como a regra ABCD. Esse alinhamento aumenta a interpretabilidade e a confiabilidade do modelo, tornando-o mais adequado para suporte à decisão clínica. Além disso, Figura 10 apresenta resultados comparativos de visualização obtidos utilizando técnicas adicionais de explicabilidade, incluindo Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM e EigenCAM, validando ainda mais a consistência das regiões salientes identificadas entre diferentes métodos. Em relação ao desempenho do modelo proposto EDLF-SLC e de sete modelos de referência após o treinamento de 100 épocas, uma comparação pode ser observada na Tabela 5. O EDLF-SLC obteve um desempenho competitivo de 0,88 em cada métrica avaliada, comparado às arquiteturas de referência, com base no contexto experimental. O EfficientNetB0 e o ResNet50 também obtiveram bons resultados, com precisões de 0,85 e 0,83, respectivamente. Por outro lado, o Inception-ResNetV2 apresentou o pior desempenho de classificação entre os modelos avaliados. No entanto, apesar da precisão de classificação relativamente baixa, sua eficiência computacional ainda foi comparável à dos modelos de referência. O modelo proposto EDLF-SLC demonstrou um desempenho competitivo em relação aos modelos de referência avaliados nas condições experimentais adotadas.

Para avaliar o desempenho do framework proposto em relação a abordagens existentes, Tabela 6 apresenta uma comparação com métodos representativos de última geração para classificação de lesões cutâneas. Por exemplo47, relatou uma acurácia de 0,86, enquanto48 empregou um modelo baseado em conjunto que alcançou acurácia semelhante, mas menor precisão, revocação e pontuação F1. Estudos recentes baseados em aprendizado em conjunto e múltiplas arquiteturas CNN25,49 relataram acurácias de até 0,87. Nas condições experimentais adotadas, o framework EDLF-SLC proposto alcançou uma acurácia de 0,88, utilizando uma arquitetura unificada explicável, sem necessidade de componentes adicionais, como modelos de segmentação de lesões.

DISPONIBILIDADE DE DADOS
Os dados que apoiam as descobertas deste estudo estão livremente disponíveis no Kaggle em https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Análise de lesões cutâneas, classificação de melanoma; imagens diagnósticas, resultados de exame dermatoscópico.
Figura 1: Imagens dermatoscópicas representativas do conjunto de dados ISIC ilustrando as duas classes diagnósticas utilizadas neste estudo. As amostras são rotuladas como benignas (0) e malignas (1), destacando a variabilidade na morfologia, cor e textura das lesões ao longo do conjunto de dados. Clique aqui para visualizar uma versão maior desta figura.

Análise do fluxo de trabalho do conjunto de dados de lesões cutâneas; extração de características baseada em CNN, diagrama de classificação SVM.
Figura 2: Fluxo de trabalho completo do framework EDLF-SLC proposto. O protocolo começa com a aquisição de imagens do ISIC 2020, seguida por pré-processamento, aumento de dados, partição do conjunto de dados, extração de características profundas utilizando quatro arquiteturas CNN pré-treinadas, fusão de características, classificação por SVM, avaliação de desempenho e geração de explicações baseadas em LIME. Clique aqui para visualizar uma versão maior desta figura.

Técnica de microscopia examinando padrões de lesões cutâneas, imagens ampliadas em múltiplas visualizações, análise médica.
Figura 3: Exemplos de imagens de lesões cutâneas aumentadas geradas utilizando técnicas de aumento de dados. Isso inclui inversão horizontal e vertical, rotação, redimensionamento e ajuste de brilho. Essas transformações aumentam a diversidade do conjunto de dados, melhoram a robustez do modelo e reduzem o risco de superajuste durante o treinamento. Clique aqui para visualizar uma versão maior desta figura.

Curva ROC resultado do treinamento, AUC versus época, diagrama mostrando tendências de validação e precisão no treinamento.
Figura 4: Área sob a curva da característica operacional do receptor (ROC-AUC) para treinamento e validação do modelo ResNet-50 ao longo de 100 épocas de treinamento. A curva azul representa a AUC do treinamento, enquanto a curva laranja representa a AUC da validação. As curvas demonstram convergência rápida nas épocas iniciais de treinamento, seguida por otimização estável com desempenho de validação consistentemente alto, indicando aprendizado eficaz e boa generalização no conjunto de dados de validação. Clique aqui para visualizar uma versão maior desta figura.

Diagrama da matriz de confusão para o ResNet-50 na análise de classificação de lesões benignas versus malignas.
Figura 5: Matriz de confusão do modelo ResNet-50 no conjunto de dados de teste. As linhas representam os rótulos de classe reais (0 = benigno, 1 = maligno), enquanto as colunas representam os rótulos de classe previstos. Os elementos diagonais indicam amostras corretamente classificadas (310 benignas e 239 malignas), enquanto os elementos fora da diagonal representam amostras mal classificadas, incluindo 50 falsos positivos e 61 falsos negativos. Clique aqui para visualizar uma versão maior desta figura.

Curvas ROC-AUC, modelo EDLF-SLC, treinamento versus validação, gráfico, 300 épocas, análise de dados.
Figura 6: Curva da característica de operação do receptor (ROC-AUC) para treinamento e validação do modelo EDLF-SLC proposto ao longo de 300 épocas de treinamento. A curva azul representa a AUC de treinamento, enquanto a curva laranja representa a AUC de validação. O modelo exibe convergência rápida nas épocas iniciais de treinamento, seguida por otimização estável com valores consistentemente altos de AUC de treinamento e validação ao longo das épocas restantes. O desempenho sustentado na validação demonstra boa capacidade de generalização e comportamento de aprendizado estável do framework proposto EDLF-SLC no conjunto de dados de validação. Clique aqui para visualizar uma versão maior desta figura.

Diagrama da matriz de confusão para o modelo EDLF-SLC mostrando a precisão da classificação de lesões benignas e malignas.
Figura 7: Matriz de confusão do modelo EDLF-SLC proposto no conjunto de dados de teste. As linhas representam os rótulos de classe reais (0 = benigno, 1 = maligno), enquanto as colunas representam os rótulos de classe previstos. Os elementos diagonais indicam amostras corretamente classificadas (299 benignas e 272 malignas), enquanto os elementos fora da diagonal correspondem às amostras mal classificadas, incluindo 61 falsos positivos e 28 falsos negativos. Clique aqui para visualizar uma versão maior desta figura.

Análise de dermatologia: imagens mostrando predições de classificação de lesões cutâneas, benignas versus malignas.
Figura 8: Predições exemplares geradas pelo modelo EDLF-SLC proposto. Esta figura ilustra os níveis de confiança na classificação de lesões benignas e malignas e demonstra a capacidade discriminativa do modelo. Clique aqui para visualizar uma versão maior desta figura.

Análise do contorno da lesão cutânea; os diagramas A-D mostram o processo de diferenciação entre lesão e contorno em dermatologia.
Figura 9: Explicações locais baseadas em LIME do modelo EDLF-SLC proposto. A figura destaca as regiões de superpixels mais influentes que contribuem para as decisões de classificação do modelo. (A) Imagem dermatoscópica original de uma lesão cutânea benigna. (B) Explicação LIME para a lesão benigna, com superpixels destacados indicando as regiões que mais contribuíram para a predição de benignidade. (C) Imagem dermatoscópica original de uma lesão cutânea maligna. (D) Explicação LIME para a lesão maligna, mostrando as regiões de superpixels discriminativas que influenciaram predominantemente a classificação como maligna. Contornos amarelos delimitam os superpixels influentes identificados pelo LIME, enquanto áreas cinzas representam regiões com contribuição mínima para a predição. Clique aqui para visualizar uma versão maior desta figura.

Análise de imagem com métodos GradCAM; diagrama dos resultados brutos e sobrepostos para explicações visuais.
Figura 10: Comparação de métodos de explicabilidade baseados em mapeamento de ativação de classe (CAM) aplicados ao modelo EDLF-SLC proposto. A figura compara os mapas de localização gerados por GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM e EigenCAM para a mesma imagem dermatoscópica. O primeiro painel mostra a imagem de entrada original, seguida pelos respectivos mapas de ativação brutos e sobreposições de mapa de calor produzidos por cada método de explicabilidade. As visualizações ilustram as diferenças na localização espacial e destacam as regiões da imagem que contribuem mais fortemente para a decisão de classificação do framework EDLF-SLC proposto. Clique aqui para visualizar uma versão maior desta figura.

Ref.AnoConjunto de dadosTamanho dos dadosExtração de característicasMétodoPrecisão
92022HAM10000 dataset10015 imagens de lesões cutâneasCaracterísticas de cor e formaAlgoritmos de ML e modelos de RN convolucionais95,1%
192023PH2 dataset200 imagens anotadasCaracterísticas de assimetria, estrias, pontos/glóbulos e áreas de regressãoModelos de ML94,0%
302024HAM10000 dataset10000 imagensCaracterísticas de cor e formaS-MobileNet97,7%
282025Conjuntos de dados ISIC2020 e HAM10000ISIC2020 (12.670 imagens) e HAM10000 (10.015 imagens)Cor e formaRede residual com memória de longo e curto prazo (R-LSTM50)95,7% (ISIC2020); 94,2% (HAM10000)
322026Monkeypox Skin Lesion Dataset (MSLD)770 imagensContexto e texturaDenseNet121, Xception, InceptionV3 e CBAM88% (DenseNet121)
392025HAM1000038.569 imagensContexto e texturaMobileNet, ResNet50, InceptionV3 e EfficientNet93,6% (MobileNet)
402025ISIC 20192357 imagensContexto e espacialRede profunda multimodal baseada em CNN e transformador98,71%
412026ISIC 201925.000 imagensContexto e texturaTransXV2S95,26%
422025HAM1000010.015 imagensCor e formaViT com YOLOv893%

Tabela 1: Comparação da literatura. Resumo de alguns trabalhos publicados recentemente que utilizam algoritmos de aprendizado profundo para a classificação de lesões cutâneas.

Conjunto de dadosBenignoMalignoTotal
Dados de treinamento144011972637
Dados de teste360300660
Dados totais180014973297

Tabela 2: Distribuição do conjunto de dados. Distribuição das amostras benignas e malignas no conjunto de dados ISIC 2020, incluindo as divisões de treinamento e teste.

ComponenteEspecificação
Sistema OperacionalUbuntu 20.04
Linguagem de ProgramaçãoPython 3.9
Framework de Aprendizado ProfundoPyTorch 2.3.1
OtimizadorAdam
Agendamento da taxa de aprendizado1e−3
Número de épocas100/300
CPU2 vCPU 2,2 GHz
GPUTesla T4 (16 GB) × 1
RAM16 GB
Parâmetros Treináveis2.430.353 (9,27 MB)
Parâmetros Não Treináveis133.434.397 (509,01 MB)

Tabela 3: Especificações do sistema. Especificações detalhadas do ambiente computacional, incluindo estruturas de software e recursos de hardware utilizados para o treinamento e avaliação do modelo.

ClassePrecisãoRevocaçãoPontuação F1Suporte
Classe benigna0.830.880.85360
Classe maligna0.840.780.81300
Exatidão--0.832660
Média macro0.840.830.83660
Média ponderada0.840.830.83660

Tabela 4: Relatório de classificação. Desempenho da classificação do modelo ResNet-50 no conjunto de dados de teste, incluindo precisão, revocação, pontuação F1 e suporte para cada classe.

ModeloPrecisãoExatidãoRecuperaçãoPontuação F1Tempo (s)
NASNetLarge0.770.760.770.762002.47
EfficientNetB00.850.850.850.85734.8
Xception0.80.810.80.8732.23
ResNetV20.630.640.630.6111072.34
MobileNet0.790.80.790.79629.29
MobileNetV20.770.790.770.77660.5
ResNet500.830.830.830.83749.77
EDLF-SLC0.880.890.870.883279.77

Tabela 5: Comparação do desempenho do modelo. Desempenho comparativo do modelo EDLF-SLC proposto e dos modelos de aprendizado profundo de referência em relação à acurácia, precisão, revocação, pontuação F1 e tempo computacional.

ModeloPrecisãoExatidãoSensibilidadePontuação F1
ResNet-18 [25]0.850.850.850.85
ResNet-50 com SVM [50]0.870.880.980.93
Modelos DL híbridos + SVM [48]0.860.840.80.84
Modelos DL híbridos + SVM [49]0.860.80.60.68
EDLF-SLC proposto0.880.890.870.88

Tabela 6: Métricas de comparação de modelos. Comparação de desempenho entre o framework proposto EDLF-SLC e abordagens recentes de última geração para classificação de lesões cutâneas.

Arquivo Suplementar 1: Algoritmo 1. Fluxo de trabalho do framework EDLF-SLC proposto, descrevendo o pré-processamento dos dados, a extração de características profundas utilizando múltiplas arquiteturas CNN, a classificação baseada em SVM e a explicabilidade baseada em LIME para a predição de lesões cutâneas. Clique aqui para baixar este arquivo.

Arquivo Suplementar 2: Algoritmo 2. Fluxo de trabalho do processo de explicação local baseado em LIME, ilustrando a geração de superpixels, amostragem de perturbação, construção do modelo substituto e visualização das regiões da imagem que mais contribuem para a decisão de classificação. Clique aqui para baixar este arquivo.

Discussão

O framework proposto de aprendizado profundo explicável para classificação de lesões cutâneas (EDLF-SLC) demonstra que a combinação de representações complementares de características profundas com inteligência artificial explicável pode melhorar tanto o desempenho da classificação quanto a transparência do modelo. Ao integrar múltiplas arquiteturas de CNN pré-treinadas (ResNet50, EfficientNetB0, MobileNet e Xception) para extração de características e empregar uma Máquina de Vetores de Suporte (SVM) para a classificação final, o framework aproveita as forças de diferentes extratores de características para gerar representações de lesões mais ricas e mais discriminativas do que aquelas obtidas a partir de uma única rede base. Além disso, a integração de explicações locais, interpretáveis e independentes de modelo (LIME) fornece explicações visuais localizadas, permitindo que clínicos compreendam as regiões da imagem que mais contribuem para cada previsão e aumentando a confiança nas decisões diagnósticas do modelo.

Os resultados experimentais demonstram que o EDLF-SLC alcança desempenho competitivo em comparação com modelos CNN de referência, incluindo MobileNet, Xception e ResNet50, destacando a eficácia da fusão de características complementares e da classificação baseada em SVM. A comparação com abordagens recentes de última geração confirma ainda mais a competitividade do framework proposto. Por exemplo, dois estudos48,49 relataram precisões de aproximadamente 0,86 utilizando métodos baseados em ensemble, enquanto outras estruturas híbridas CNN-SVM25,50,51,52,53 alcançaram precisões de até 0,87, mas dependiam de arquiteturas mais complexas e módulos adicionais de pré-processamento ou segmentação. Em contraste, o framework proposto alcança uma precisão de 0,88 utilizando uma arquitetura comparativamente simplificada, sem necessidade de segmentação explícita de lesões, ao mesmo tempo em que fornece previsões interpretáveis por meio do LIME. Esses resultados indicam que combinar extratores de características CNN complementares antes da classificação por SVM pode aprimorar o desempenho diagnóstico, mantendo a simplicidade e a transparência da arquitetura.

Embora o framework proposto melhore a precisão e a interpretabilidade da classificação, essa melhoria ocorre à custa de um aumento no custo computacional. O tempo total de treinamento do EDLF-SLC é de aproximadamente 3279,77 s, consideravelmente maior do que o de modelos individuais de CNN, como ResNet50 (749,77 s) e MobileNet (629,29 s). Esse custo computacional adicional resulta do treinamento de múltiplas CNNs pré-treinadas e da realização da fusão de características antes da classificação. Esse tipo de compensação é comumente observado em abordagens híbridas e de aprendizado em conjunto, nas quais um desempenho preditivo aprimorado é obtido ao custo de requisitos computacionais mais elevados. No entanto, em sistemas clínicos de apoio à decisão, a precisão diagnóstica, a robustez e a confiabilidade são geralmente consideradas mais importantes do que a eficiência no treinamento, pois afetam diretamente os resultados para o paciente.

Outra vantagem importante do framework proposto é sua explicabilidade. Diferentemente dos modelos convencionais de aprendizado profundo, que muitas vezes funcionam como caixas pretas, o EDLF-SLC incorpora o LIME para fornecer explicações visuais específicas para cada caso sobre o processo de predição. Essas explicações ajudam os clínicos a verificar se o modelo está focado em regiões da lesão clinicamente relevantes, aumentando assim a transparência, apoiando a interpretação clínica e facilitando a confiança no diagnóstico assistido por IA. Consequentemente, o framework proposto oferece um equilíbrio prático entre desempenho preditivo e interpretabilidade do modelo, tornando-o uma ferramenta promissora de suporte à decisão assistida por computador para classificação de lesões cutâneas.

Apesar desses resultados encorajadores, várias limitações devem ser reconhecidas. Primeiro, a estrutura foi avaliada utilizando apenas o conjunto de dados ISIC de acesso público, e sua capacidade de generalização em imagens adquiridas sob diferentes condições clínicas, dispositivos de imagem e populações de pacientes permanece a ser validada. Segundo, o uso de múltiplas arquiteturas de CNN pré-treinadas aumenta inevitavelmente a complexidade computacional e o tempo de treinamento em comparação com modelos de única base. Terceiro, foram adotadas configurações fixas de hiperparâmetros ao longo dos experimentos, e uma otimização adicional pode melhorar o desempenho e a adaptabilidade em diferentes conjuntos de dados. Por fim, embora o LIME aumente a transparência do modelo, suas explicações são locais e dependentes de perturbações, o que significa que a consistência das explicações pode variar entre execuções e deve ser validada com especialistas em dermatologia antes da implantação clínica de rotina.

Pesquisas futuras se concentrarão na validação do framework proposto utilizando múltiplos conjuntos de dados de lesões cutâneas em larga escala e multicêntricos, na otimização da eficiência computacional por meio de técnicas de fusão de características leves e compressão de modelos, na investigação de estratégias avançadas de otimização de hiperparâmetros e na extensão do framework para classificação multiclasse de lesões cutâneas. Além disso, a integração de técnicas adicionais de IA explicável e a realização de avaliações clínicas prospectivas com dermatologistas fortalecerão ainda mais a confiabilidade, a interpretabilidade e a aplicabilidade prática do framework proposto em ambientes clínicos do mundo real.

Divulgações

Os autores declaram que não há conflito de interesses.

Agradecimentos

Os autores gostariam de expressar sua sincera gratidão à Universidade de Taif pelo fornecimento do ambiente de pesquisa e do apoio institucional que facilitaram a conclusão deste trabalho.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Conjunto de Dados de Lesões Cutâneas ISIC 2020Colaboração Internacional de Imagem em Dermatologia (ISIC)Conjunto de Dados do Desafio ISIC 2020Conjunto de imagens dermatoscópicas utilizado para desenvolvimento e avaliação de modelos.
KerasEquipe KerasIntegrado com TensorFlowConstrução e treinamento de modelos de aprendizado profundo.
LIME (Explicações Locais Interpretáveis e Independes de Modelo)Ribeiro et al.Pacote PythonGeração de explicações visuais locais para previsões do modelo.
MatplotlibDesenvolvedores do MatplotlibÚltima versão compatívelVisualização de curvas de aprendizado, matrizes de confusão e gráficos de avaliação.
NumPyDesenvolvedores do NumPyÚltima versão compatívelComputação numérica e manipulação de arrays.
GPU NVIDIA Tesla T4Corporação NVIDIA16 GB de VRAMAceleração do treinamento e inferência do modelo.
PandasEquipe de Desenvolvimento do PandasÚltima versão compatívelProcessamento de dados e gerenciamento de resultados experimentais.
Modelos CNN Pré-treinadosAplicações TensorFlow/KerasResNet50, EfficientNetB0, MobileNet, XceptionExtração de características profundas de imagens dermatoscópicas.
PythonFundação Software PythonVersão 3.9Linguagem de programação utilizada para implementação.
PyTorchFundação PyTorchVersão 2.3.1Framework de aprendizado profundo utilizado para extração de características e implementação do modelo.
Scikit-learnDesenvolvedores do Scikit-learnÚltima versão compatívelMáquina de Vetores de Suporte (SVM), métricas de avaliação e pré-processamento de dados.
Máquina de Vetores de Suporte (Kernel RBF)Scikit-learnSVCClassificação de representações fundidas de características profundas.
TensorFlowGoogle LLCVersão 2.xFramework de aprendizado profundo para treinamento e inferência de modelos.
Sistema Operacional UbuntuCanonical Ltd.Ubuntu 20.04Ambiente operacional experimental.

Referências

  1. Chan S, Reddy V, Myers B, Thibodeaux Q, Brown-Stone N, Liao W. Machine learning in dermatology: current applications, opportunities, and limitations. Dermatol Ther (Heidelb). 2020;10:365-386.
  2. Olsen CM. Global trends in melanoma mortality differ by sex and age. Br J Dermatol. 2020;183(6):985-986.
  3. Sun Y, Shen Y, Liu Q, Zhang H, Jia L, Chai Y, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021. J Am Acad Dermatol. 2025;92(1):100-107.
  4. Monika MK, Vignesh NA, Kumari CU, Kumar M, Lydia EL. Skin cancer detection and classification using machine learning. Mater Today Proc. 2020;33:4266-4270.
  5. Hosny KM, Elshora D, Mohamed ER, Vrochidou E, Papakostas GA. Deep learning and optimization-based methods for skin lesions segmentation: a review. IEEE Access. 2023.
  6. Baghdadi NA, Farghaly Abdelaliem SM, Malki A, Gad I, Ewis A, Atlam ES. Advanced machine learning techniques for cardiovascular disease early detection and diagnosis. J Big Data. 2023;10(1):144.
  7. Veeramani N, Jayaraman P, Krishankumar R, Ravichandran KS, Gandomi AH. DDCNN-F: double decker convolutional neural network feature fusion as a medical image classification framework. Sci Rep. 2024;14(1).
  8. Veeramani N, Jayaraman P. YOLOv7-XAI: multiclass skin lesion diagnosis using explainable artificial intelligence with fair decision making. Int J Imaging Syst Technol. 2024;34(6).
  9. Shetty B, Fernandes R, Rodrigues AP, Chengoden R, Bhattacharya S, Lakshmanna K. Skin lesion classification of dermoscopic images using machine learning and convolutional neural network. Sci Rep. 2022;12(1):18134.
  10. Ali AR, Li J, Yang G, O'Shea SJ. A machine learning approach to automatic detection of irregularity in skin lesion border using dermoscopic images. PeerJ Comput Sci. 2020;6:e268.
  11. Pham TTH, Luu TN, Nguyen TV, Huynh NT, Phan QH, Le TH. Polarimetric imaging combining optical parameters for classification of mice non-melanoma skin cancer tissue using machine learning. Heliyon. 2023;9(11).
  12. Liu N, Rejeesh M, Sundararaj V, Gunasundari B. ACO-KELM: anti coronavirus optimized kernel-based softplus extreme learning machine for classification of skin cancer. Expert Syst Appl. 2023;232:120719.
  13. Masud M, Almars AM, Rokaya MB, Meshref H, Gad I, Atlam ES. A novel lightweight convolutional neural network model to predict Alzheimer's disease applying weighted loss function. J Disabil Res. 2024;3(4):20240042.
  14. Kumar A, Veeraiah V, Gongada TN, Ahamad S, Khan H, Gupta A. Explainable machine learning models for clinical decision support systems. In: 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT). Piscataway (NJ): IEEE; 2024. p. 1-6.
  15. Shahzad K, Wasim M, Pires IM, Garcia NM. Multi-classification of skin lesions using a deep learning-based convolutional neural network. Procedia Comput Sci. 2024;241:588-593.
  16. Celebi ME, Kingravi HA, Uddin B, Iyatomi H, Aslandogan YA, Stoecker WV, et al. A methodological approach to the classification of dermoscopy images. Comput Med Imaging Graph. 2007;31(6):362-373.
  17. Li CX, Shen CB, Xue K, Shen X, Jing Y, Wang ZY, et al. Artificial intelligence in dermatology: past, present, and future. Chin Med J (Engl). 2019;132(17):2017-2020.
  18. Ramprasad M, Nagesh S, Sahith V, Lankalapalli RK. Hierarchical agglomerative clustering based skin lesion detection with region-based neural networks classification. Meas Sens. 2023;29:100865.
  19. Khater T, Ansari S, Mahmoud S, Hussain A, Tawfik H. Skin cancer classification using explainable artificial intelligence on pre-extracted image features. Intell Syst Appl. 2023;20:200275.
  20. Wang H, Ahn E, Bi L, Kim J. Self-supervised multi-modality learning for multi-label skin lesion classification. Comput Methods Programs Biomed. 2025;265:108729.
  21. Thapar P, Rakhra M, Alsaadi M, Quraishi A, Deka A, Naga Ramesh JV. A hybrid grasshopper optimization algorithm for skin lesion segmentation and melanoma classification using deep learning. Healthc Anal. 2024;5:100326.
  22. Kumar S, Nath VK, Hazarika D. Blend of deep features and binary tree growth algorithm for skin lesion classification. Symmetry (Basel). 2023;15(12):2213.
  23. Chandrahaas BV, Mohanty SN, Panda SK, et al. An empirical study on classification of monkeypox skin lesion detection. EAI Endorsed Trans Pervasive Health Technol. 2023;9:e4.
  24. Talavera-Martínez L, Bibiloni P, Giacaman A, Taberner R, de Paz Hernando LJD, González-Hidalgo M. A novel approach for skin lesion symmetry classification with a deep learning model. Comput Biol Med. 2022;145:105450.
  25. Ieracitano C, Morabito FC, Hussain A, Suffian M, Mammone N. TIXAI: a trustworthiness index for explainable artificial intelligence in skin lesion classification. Neurocomputing. 2025;630:129701.
  26. Hasan MK, Elahi MTE, Alam MA, Jawad MT, Martí R. DermoExpert: skin lesion classification using a hybrid convolutional neural network through segmentation, transfer learning, and augmentation. Inform Med Unlocked. 2022;28:100819.
  27. Koparde S, Kotwal J, Deshmukh S, Adsure S, Chaudhari P, Kimbahune V. Conditional generative adversarial networks and YOLOv5 Darknet-based skin lesion localization and classification using an independent component analysis model. Inform Med Unlocked. 2024;47:101515.
  28. Padhy S, Dash S, Kumar N, Singh SP, Kumar G, Moral P. Temporal integration of ResNet features with LSTM for enhanced skin lesion classification. Results Eng. 2025;25:104201.
  29. Xin C, Liu Z, Ma Y, Wang D, Zhang J, Li L, et al. Transformer-guided self-adaptive network for multi-scale skin lesion image segmentation. Comput Biol Med. 2024;169:107846.
  30. Sulthana R, Chamola V, Hussain Z, Albalwy F, Hussain A. A novel end-to-end deep convolutional neural network-based skin lesion classification framework. Expert Syst Appl. 2024;246:123056.
  31. Chamarthi S, Fogelberg K, Brinker TJ, Niebling J. Mitigating the influence of domain shift in skin lesion classification: a benchmark study of unsupervised domain adaptation methods. Inform Med Unlocked. 2024;44:101430.
  32. Maity S, Paul S, Guha S, Dasgupta S, Ghosh M. Automated classification of monkeypox skin lesions using a hybrid deep learning model. Biomed Signal Process Control. 2026;126:110955.
  33. Nasir S, Bilal M, Khalidi H. Detection and classification of skin cancer by using CNN-enabled cloud storage data access control algorithm based on blockchain technology. Int J Theor Appl Comput Intell. 2025:145-169.
  34. Saba T. Computer vision for microscopic skin cancer diagnosis using handcrafted and non-handcrafted features. Microsc Res Tech. 2021;84(6):1272-1283.
  35. Fayyad J, Alijani S, Najjaran H. Empirical validation of conformal prediction for trustworthy skin lesion classification. Comput Methods Programs Biomed. 2024;253:108231.
  36. Liu P, Qian W, Li H, Cao J. A relationship-aware mutual learning method for lightweight skin lesion classification. Digit Commun Netw. 2025;11(3):603-612.
  37. Adla D, Reddy GVR, Nayak P, Karuna G. A full-resolution convolutional network with a dynamic graph cut algorithm for skin cancer classification and detection. Healthc Anal. 2023;3:100154.
  38. Thamizhamuthu R, Maniraj SP. Deep learning-based dermoscopic image classification system for robust skin lesion analysis. Trait Signal. 2023;40(3).
  39. Di Giammarco M, Santone A, Cesarelli M, Martinelli F, Mercaldo F. A method for skin lesion detection and localization by means of deep learning and reliable prediction explainability. Image Vis Comput. 2025;162:105675.
  40. Haq IU, Joarder HA, Khan AA, Shi X, Alsayaydeh JAJ, Yusof MFB, et al. XAAI-ledger: an explainable CNN-transformer-based multimodal deep learning framework for early detection of melanoma and non-melanoma skin cancers using dermoscopic and clinical data. Biomed Signal Process Control. 2026;123:110410.
  41. Saeed K, Shehzad M, Malik MGA, Ahmed S, Azar AT. TransXV2S-NET: a novel hybrid deep learning architecture with dual-contextual graph attention for multi-class skin lesion classification. Knowl Based Syst. 2026;337:115407.
  42. AbuAlkebash H, Saleh RAA, Ertunç HM. Automated explainable deep learning framework for multiclass skin cancer detection and classification using hybrid YOLOv8 and vision transformer (ViT). Biomed Signal Process Control. 2025;108:107934.
  43. Hasan MK, Ahamad MA, Yap CH, Yang G. A survey, review, and future trends of skin lesion segmentation and classification. Comput Biol Med. 2023;155:106624.
  44. Li H, Pan Y, Zhao J, Zhang L. Skin disease diagnosis with deep learning: a review. Neurocomputing. 2021;464:364-393.
  45. Wu Y, Chen B, Zeng A, Pan D, Wang R, Zhao S. Skin cancer classification with deep learning: a systematic review. Front Oncol. 2022;12:893972.
  46. Fanconic. Skin cancer: malignant vs benign dataset. Kaggle; 2023. Available from: https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign
  47. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16). New York (NY): ACM; 2016. p. 1135-1144.
  48. Bassel A, Abdulkareem AB, Alyasseri ZAA, Sani NS, Mohammed HJ. Automatic malignant and benign skin cancer classification using a hybrid deep learning approach. Diagnostics (Basel). 2022;12(10):2472.
  49. Bhardwaj A, Rege PP. Skin lesion classification using deep learning. In: Advances in Signal and Data Processing: Select Proceedings of ICSDP 2019. Singapore: Springer; 2021. p. 575-589.
  50. Keerthana D, Venugopal V, Nath MK, Mishra M. Hybrid convolutional neural networks with SVM classifier for classification of skin cancer. Biomed Eng Adv. 2023;5:100069.
  51. Ahmed A, Siam AI, Atwa MA, Atwa EM, Abdelrahim EM, Atlam ES. An explainable YOLO-based deep learning framework for pneumonia detection from chest X-ray images. Algorithms. 2025;18(11):703.
  52. Farsi M, ZainEldin H, Sayed RF, El-Agamy ES, Atlam SA, Alsaedi M, et al. Deep learning for pathology: YOLOv8 with EigenCAM for reliable colorectal cancer diagnostics. Bioengineering (Basel). 2025;12(11):1203.
  53. Atwa EA, Atlam ES, Ahmed A, Atwa MA, Abdelrahim EM, Siam AI. Interpretable deep learning models for arrhythmia classification based on ECG signals using the PTB-XL dataset. Diagnostics (Basel). 2025;15(15):1950.

Reimpressões e permissões

Etiquetas

IA ExplicávelRedes Neurais ConvolucionaisMáquina de Vetores de SuporteInterpretabilidade de ModeloFusão de CaracterísticasCNN Pré-treinadaExplicações LIMEDiagnóstico de Doenças