L'évaluation des performances du cadre de classification développé repose sur des mesures traditionnelles issues de la matrice de confusion. Une matrice de confusion permet de comprendre complètement les performances du classifieur en représentant le nombre de classifications correctes et incorrectes effectuées pour chaque classe définie. De cette manière, tous les types d'erreurs peuvent être analysés. Par exemple, les faux positifs et les faux négatifs sont particulièrement importants dans le diagnostic des maladies. Des valeurs élevées de faux positifs peuvent indiquer une sensibilité élevée du classifieur, mais parallèlement, un grand nombre de faux négatifs révèle une faible sensibilité et pose des risques potentiels pour la santé. Les métriques de performance suivantes sont utilisées dans cet article : l'exactitude, la précision, le rappel, le score F1, la spécificité, le taux de vrais positifs (TPR) et le taux de faux positifs (FPR). Les formules de ces métriques sont indiquées ci-dessous :
Précision=(VP+VN)/(VP+VN+FP+FN) (3)
Précision = VP/(VP+FP) (4)
(5)
(6)
(7)
(8)
Dans ce cas, VP indique le nombre de cancers cutanés malins détectés par le système, tandis que VN indique le nombre de lésions bénignes. En revanche, FP représente le nombre de décisions erronées où des lésions sont classées comme malignes alors qu'elles sont en réalité bénignes. FN reflète le nombre d'échantillons bénins incorrectement identifiés. En ce qui concerne la classification du cancer de la peau, la minimisation des faux négatifs est extrêmement importante en raison des effets indésirables potentiels qui en résultent.
Performance des modèles de référence
Toutes les expériences informatiques ont été menées dans l'environnement basé sur le cloud de Google Colab. Il convient de noter que cette plateforme permet d'exécuter des instances de machines virtuelles utilisant une version prédéfinie d'Ubuntu 20.04 comme système d'exploitation. Pour entraîner les modèles de référence, la version 3.9 de Python et le framework PyTorch version 2.3.1 ont été utilisés. De plus, tous les nœuds de calcul avaient des spécifications identiques, à savoir un processeur Intel Xeon fonctionnant à une fréquence de 2,2 GHz, un GPU NVIDIA Tesla T4, 16 Go de RAM et une capacité de stockage de 70 Go. Ainsi, ce dispositif expérimental a permis de réduire la variabilité introduite par différentes plateformes matérielles et d'améliorer la fiabilité et la reproductibilité des résultats. Un résumé complet de l'environnement expérimental est disponible dans le tableau 3.
Figure 4 montre les courbes d'apprentissage correspondant à 100 époques d'entraînement pour l'architecture ResNet-50. L'entraînement a été effectué à partir d'un ensemble de données contenant 2 110 images, tandis que la taille de l'ensemble de validation était égale à 660 images. Comme on peut le voir, l'exactitude a constamment augmenté pendant l'entraînement jusqu'à atteindre près de 90,0 %. Parallèlement, une amélioration de l'exactitude a été observée durant les 50 premières époques ; après ce point, l'exactitude est devenue presque constante, ce qui peut être considéré comme un signe de convergence du modèle. Pour la validation, le modèle a démontré une valeur d'AUC égale à 86,0 %, montrant ainsi des propriétés discriminantes raisonnables.
La matrice de confusion présentée dans la Figure 5 caractérise les performances du modèle ResNet-50 en termes de précision de classification dans le cas d'un ensemble de test composé de 660 images. Lors de l'évaluation, le modèle a correctement reconnu 310 des 360 échantillons bénins et 239 des 300 échantillons malins. Toutefois, un nombre relativement élevé d'échantillons malins a été classé de manière incorrecte, ce qui a conduit à une valeur relativement élevée de faux négatifs. Ce résultat doit être examiné plus en détail en raison des conséquences graves qu'entraîne ce type d'erreur lors de l'utilisation du classificateur en pratique. Au total, le modèle a atteint une exactitude de 83,0 %, avec une précision de 83,3 %, un rappel de 83,3 % et un score F1 de 83,3 %.
Tableau 4 contient une description détaillée des caractéristiques de performance du modèle ResNet-50 en ce qui concerne les deux classes. Le classificateur a montré un comportement relativement équilibré en termes de précision : pour les échantillons bénins, sa valeur était de 83,0 %, tandis que les échantillons malins présentaient une précision de 84,0 %. De même, les valeurs de rappel ont atteint 88,0 % pour les lésions bénignes et 78,0 % pour les lésions malignes. Le support indiqué dans le tableau représente le nombre d'échantillons correspondant à chaque classe.
Modèle EDLF-SLC proposé
Figure 6 illustre l'AUC d'apprentissage et de validation du modèle proposé sur 300 époques. La métrique AUC reflète la capacité du modèle à distinguer entre classes bénignes et malignes, des valeurs plus élevées indiquant une meilleure performance discriminatoire. Comme observé, l'AUC d'apprentissage augmente régulièrement tout au long du processus d'entraînement, atteignant une valeur maximale de 1,00 vers l'époque 200. L'AUC de validation s'améliore également progressivement durant les premières phases d'entraînement ; toutefois, elle commence à stagner après environ 150 époques, suggérant une convergence du modèle. L'AUC finale de validation de 0,95 démontre une forte capacité de généralisation et une séparabilité efficace des classes.
La matrice de confusion du modèle proposé, présentée dans la Figure 7, montre que le modèle a correctement classé 299 échantillons bénins et 272 échantillons malins, tout en classant incorrectement 28 cas bénins comme malins et 61 cas malins comme bénins. Au total, le modèle a réalisé 571 prédictions correctes et 89 classifications erronées. Notamment, le nombre plus élevé de faux négatifs (cas malins classés à tort comme bénins) souligne une limitation critique, car de telles erreurs peuvent avoir des implications cliniques importantes. Néanmoins, la performance globale de classification reste robuste. Contrairement aux approches de sélection de caractéristiques qui suppriment intentionnellement des dimensions avant la classification, le cadre proposé préserve la représentation profonde fusionnée complète générée par plusieurs architectures de CNN hétérogènes. Ce choix de conception a été adopté car chaque architecture de base extrait des caractéristiques lésionnelles complémentaires, et le fait de conserver la représentation complète permet au classifieur SVM d'exploiter l'information discriminante combinée sans exclure de caractéristiques potentiellement informatives. Par conséquent, la stratégie de fusion de caractéristiques adoptée privilégie l'apprentissage de représentations complémentaires tout en maintenant la faisabilité computationnelle.
Figure 8 présente des exemples représentatifs de résultats de classification produits par le modèle proposé. Les résultats montrent que le modèle attribue des scores de confiance élevés aux instances correctement classées. Plus précisément, les cas bénins présentent de fortes probabilités prédites (par exemple, 99,84 % et 99,85 %), tandis que les cas malins affichent également des niveaux de confiance élevés (par exemple, 99,98 % et 99,96 %). Ces résultats indiquent que le modèle est capable de distinguer efficacement les lésions bénignes des lésions malignes, même dans des scénarios visuellement difficiles. Afin d'améliorer l'interprétabilité, le cadre LIME est utilisé pour générer des explications localisées des prédictions du modèle, comme illustré dans les Figure 9A–D. LIME approche la frontière de décision complexe du modèle à l'aide d'un modèle linéaire localement interprétable. Pour chaque image d'entrée, la méthode génère des échantillons perturbés en masquant sélectivement des superpixels et en évaluant les prédictions correspondantes. Un modèle linéaire pondéré est ensuite ajusté à ces échantillons, les poids étant déterminés en fonction de la proximité par rapport à l'entrée initiale à l'aide d'un noyau de fonction de base radiale. Les coefficients obtenus représentent la contribution de chaque superpixel à la prédiction finale et sont définis par :
(9)
où Xj ∈ {0, 1} indique la présence ou l'absence de la j-ème superpixel, Bj représente le poids de contribution correspondant, et B0 est la prédiction de base. Les coefficients positifs (Bj > 0) désignent des régions contribuant à la classe maligne, tandis que les coefficients négatifs (Bj < 0) correspondent à des caractéristiques bénignes. Les visualisations fondées sur LIME, présentées dans la Figure 9B, D, mettent en évidence les régions les plus influentes dans chaque décision de classification. Pour les lésions bénignes, le modèle met l'accent sur des régions caractérisées par une pigmentation uniforme et des limites bien définies. En revanche, dans les cas malins, les régions mises en surbrillance correspondent à des caractéristiques cliniquement significatives telles que des bords irréguliers, une hétérogénéité de couleur et des textures atypiques. L'intensité des régions mises en surbrillance reflète l'ampleur des coefficients correspondants Bj.
Ces résultats démontrent que le modèle EDLF-SLC se concentre sur des caractéristiques cliniquement significatives qui s'alignent sur des critères dermatologiques établis, tels que la règle ABCD. Cet alignement améliore l'interprétabilité et la fiabilité du modèle, le rendant ainsi plus adapté au soutien des décisions cliniques. De plus, Figure 10 présente des résultats de visualisation comparatifs obtenus à l'aide de techniques supplémentaires d'explicabilité, notamment Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM et EigenCAM, confirmant davantage la cohérence des régions saillantes identifiées à travers différentes méthodes. En ce qui concerne les performances du modèle proposé EDLF-SLC et de sept modèles de référence après un entraînement de 100 époques, une comparaison peut être observée dans Tableau 5. EDLF-SLC a obtenu une performance compétitive de 0,88 sur chaque métrique évaluée par rapport aux architectures de référence évaluées selon le contexte expérimental. EfficientNetB0 et ResNet50 ont également donné de bons résultats, avec des précisions respectives de 0,85 et 0,83. En revanche, Inception-ResNetV2 a présenté la plus faible performance de classification parmi les modèles évalués. D'un autre côté, malgré une précision de classification relativement plus faible, son efficacité computationnelle restait comparable à celle des modèles de référence. Le modèle proposé EDLF-SLC a démontré une performance compétitive par rapport aux modèles de référence évalués dans les conditions expérimentales adoptées.
Pour évaluer les performances du cadre proposé par rapport aux approches existantes, le tableau 6 présente une comparaison avec des méthodes représentatives à l'état de l'art pour la classification des lésions cutanées. Par exemple47, a signalé une exactitude de 0,86, tandis que48 a utilisé un modèle basé sur un ensemble qui a atteint une exactitude similaire mais une précision, un rappel et un score F1 plus faibles. Des études récentes fondées sur l'apprentissage par ensemble et plusieurs architectures de CNN25,49 ont signalé des exactitudes allant jusqu'à 0,87. Dans les conditions expérimentales adoptées, le cadre EDLF-SLC proposé a atteint une exactitude de 0,88 tout en utilisant une architecture explicative unifiée sans nécessiter de composants supplémentaires tels que des modèles de segmentation des lésions.
DISPONIBILITÉ DES DONNÉES
Les données qui soutiennent les résultats de cette étude sont librement accessibles sur Kaggle à l'adresse https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Figure 1 : Images dermatoscopiques représentatives provenant du jeu de données ISIC illustrant les deux classes diagnostiques utilisées dans cette étude. Les échantillons sont étiquetés comme bénins (0) et malins (1), mettant en évidence la variabilité de la morphologie, de la couleur et de la texture des lésions à travers l'ensemble des données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Flux de travail complet du cadre EDLF-SLC proposé. Le protocole commence par l'acquisition d'images ISIC 2020, suivie du prétraitement, de l'augmentation des données, de la partition du jeu de données, de l'extraction de caractéristiques profondes à l'aide de quatre architectures CNN préentraînées, de la fusion de caractéristiques, de la classification par SVM, de l'évaluation des performances et de la génération d'explications basées sur LIME. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Exemples d'images de lésions cutanées augmentées générées à l'aide de techniques d'augmentation de données. Celles-ci incluent le retournement horizontal et vertical, la rotation, le redimensionnement et l'ajustement de la luminosité. Ces transformations augmentent la diversité du jeu de données, améliorent la robustesse du modèle et réduisent le risque de surapprentissage pendant l'entraînement. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Aire sous la courbe caractéristique de fonctionnement du récepteur (ROC-AUC) pour l'entraînement et la validation du modèle ResNet-50 au cours de 100 époques d'entraînement. La courbe bleue représente l'AUC d'entraînement, tandis que la courbe orange représente l'AUC de validation. Les courbes montrent une convergence rapide durant les premières époques d'entraînement, suivie d'une optimisation stable avec des performances de validation constamment élevées, indiquant un apprentissage efficace et une bonne généralisation sur l'ensemble de données de validation. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 5 : Matrice de confusion du modèle ResNet-50 sur le jeu de données de test. Les lignes représentent les étiquettes de classe réelles (0 = bénin, 1 = malin), tandis que les colonnes représentent les étiquettes de classe prédites. Les éléments diagonaux indiquent les échantillons correctement classés (310 bénins et 239 malins), tandis que les éléments hors diagonale représentent les échantillons mal classés, incluant 50 faux positifs et 61 faux négatifs. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Courbe caractéristique de fonctionnement du récepteur (ROC) et aire sous la courbe (AUC) pour l'entraînement et la validation du modèle EDLF-SLC proposé, sur 300 époques d'entraînement. La courbe bleue représente l'AUC d'entraînement, tandis que la courbe orange représente l'AUC de validation. Le modèle présente une convergence rapide durant les premières époques d'entraînement, suivie d'une optimisation stable avec des valeurs d'AUC élevées et constantes, tant pour l'entraînement que pour la validation, tout au long des époques restantes. La performance stable en validation démontre une bonne capacité de généralisation et un comportement d'apprentissage stable du cadre EDLF-SLC proposé sur l'ensemble de données de validation. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 7 : Matrice de confusion du modèle EDLF-SLC proposé sur l'ensemble de données de test. Les lignes représentent les étiquettes de classe réelles (0 = bénin, 1 = malin), tandis que les colonnes représentent les étiquettes de classe prédites. Les éléments diagonaux indiquent les échantillons correctement classés (299 bénins et 272 malins), tandis que les éléments hors diagonale correspondent aux échantillons mal classés, incluant 61 faux positifs et 28 faux négatifs. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 8 : Prédictions types générées par le modèle EDLF-SLC proposé. Cette figure illustre les niveaux de confiance en matière de classification pour les lésions bénignes et malignes et démontre la capacité discriminante du modèle. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 9 : Explications locales basées sur LIME du modèle EDLF-SLC proposé. La figure met en évidence les régions de superpixels les plus influentes contribuant aux décisions de classification du modèle. (A) Image dermoscopique originale d'une lésion cutanée bénigne. (B) Explication LIME pour la lésion bénigne, avec les superpixels mis en surbrillance indiquant les régions ayant le plus contribué à la prédiction de bénignité. (C) Image dermoscopique originale d'une lésion cutanée maligne. (D) Explication LIME pour la lésion maligne, montrant les régions de superpixels discriminantes ayant principalement influencé la classification comme maligne. Les limites jaunes délimitent les superpixels influents identifiés par LIME, tandis que les régions grises représentent des zones ayant une contribution minimale à la prédiction. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 10 : Comparaison des méthodes d'explicabilité basées sur la cartographie d'activation de classe (CAM) appliquées au modèle EDLF-SLC proposé. La figure compare les cartes de localisation générées par GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM et EigenCAM pour la même image dermoscopique. Le premier panneau montre l'image d'entrée originale, suivie des cartes d'activation brutes correspondantes et des superpositions de cartes thermiques produites par chaque méthode d'explicabilité. Les visualisations illustrent les différences en matière de localisation spatiale et mettent en évidence les régions de l'image qui contribuent le plus fortement à la décision de classification du cadre EDLF-SLC proposé. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
| Réf. | Année | Jeu de données | Taille des données | Extraction de caractéristiques | Méthode | Précision |
| 9 | 2022 | HAM10000 dataset | 10015 images de lésions cutanées | Caractéristiques de couleur et de forme | Algorithmes d'apprentissage automatique et modèles de réseaux neuronaux convolutifs | 95,1 % |
| 19 | 2023 | PH2 dataset | 200 images annotées | Caractéristiques d'asymétrie, de stries, de points/globules et de zones de régression | Modèles d'apprentissage automatique | 94,0 % |
| 30 | 2024 | HAM10000 dataset | 10 000 images | Caractéristiques de couleur et de forme | S-MobileNet | 97,7 % |
| 28 | 2025 | Jeux de données ISIC2020 et HAM10000 | ISIC2020 (12 670 images) et HAM10000 (10 015 images) | Couleur et forme | Réseau résiduel avec mémoire à long court terme (R-LSTM50) | 95,7 % (ISIC2020) ; 94,2 % (HAM10000) |
| 32 | 2026 | Monkeypox Skin Lesion Dataset (MSLD) | 770 images | Contexte et texture | DenseNet121, Xception, InceptionV3 et CBAM | 88 % (DenseNet121) |
| 39 | 2025 | HAM10000 | 38 569 images | Contexte et texture | MobileNet, ResNet50, InceptionV3 et EfficientNet | 93,6 % (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2 357 images | Contexte et spatial | Apprentissage profond multimodal basé sur CNN et transformeur | 98,71 % |
| 41 | 2026 | ISIC 2019 | 25 000 images | Contexte et texture | TransXV2S | 95,26 % |
| 42 | 2025 | HAM10000 | 10 015 images | Couleur et forme | ViT avec YOLOv8 | 93 % |
Tableau 1 : Comparaison bibliographique. Résumé de quelques travaux récemment publiés utilisant des algorithmes d'apprentissage profond pour la classification des lésions cutanées.
| Jeu de données | Bénin | Maligne | Total |
| Données d'entraînement | 1440 | 1197 | 2637 |
| Données de test | 360 | 300 | 660 |
| Données totales | 1800 | 1497 | 3297 |
Tableau 2 : Répartition du jeu de données. Répartition des échantillons bénins et malins dans le jeu de données ISIC 2020, incluant les subdivisions en ensembles d'apprentissage et de test.
| Composant | Spécification |
| Système d'exploitation | Ubuntu 20.04 |
| Langage de programmation | Python 3.9 |
| Framework d'apprentissage profond | PyTorch 2.3.1 |
| Optimiseur | Adam |
| Planification du taux d'apprentissage | 1e−3 |
| Nombre d'époques | 100/300 |
| Processeur (CPU) | 2 vCPU 2,2 GHz |
| Processeur graphique (GPU) | Tesla T4 (16 Go) × 1 |
| Mémoire vive (RAM) | 16 Go |
| Paramètres entraînables | 2 430 353 (9,27 Mo) |
| Paramètres non entraînables | 133 434 397 (509,01 Mo) |
Tableau 3 : Spécifications du système. Spécifications détaillées de l'environnement informatique, incluant les frameworks logiciels et les ressources matérielles utilisés pour l'entraînement et l'évaluation du modèle.
| Classe | Précision | Rappel | Score F1 | Support |
| Classe bénigne | 0.83 | 0.88 | 0.85 | 360 |
| Classe maligne | 0.84 | 0.78 | 0.81 | 300 |
| Exactitude | - | - | 0.832 | 660 |
| Moyenne macro | 0.84 | 0.83 | 0.83 | 660 |
| Moyenne pondérée | 0.84 | 0.83 | 0.83 | 660 |
Tableau 4 : Rapport de classification. Performance de classification du modèle ResNet-50 sur le jeu de données de test, incluant la précision, le rappel, le score F1 et le nombre d'échantillons pour chaque classe.
| Modèle | Précision | Exactitude | Rappel | Score F1 | Temps (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tableau 5 : Comparaison des performances des modèles. Performance comparative du modèle EDLF-SLC proposé et des modèles de base d'apprentissage profond selon l'exactitude, la précision, le rappel, le score F1 et le temps de calcul.
| Modèle | Précision | Exactitude | Rappel | Score F1 |
| ResNet-18 [25] | 0,85 | 0,85 | 0,85 | 0,85 |
| ResNet-50 avec SVM [50] | 0,87 | 0,88 | 0,98 | 0,93 |
| Modèles DL hybrides + SVM [48] | 0,86 | 0,84 | 0,8 | 0,84 |
| Modèles DL hybrides + SVM [49] | 0,86 | 0,8 | 0,6 | 0,68 |
| EDLF-SLC proposé | 0,88 | 0,89 | 0,87 | 0,88 |
Tableau 6 : Métriques de comparaison des modèles. Comparaison des performances entre le cadre EDLF-SLC proposé et les approches récentes à l'état de l'art pour la classification des lésions cutanées.
Fichier supplémentaire 1 : Algorithme 1. Flux de travail du cadre EDLF-SLC proposé, décrivant le prétraitement des données, l'extraction de caractéristiques profondes à l'aide de plusieurs architectures CNN, la classification basée sur SVM et l'explicabilité fondée sur LIME pour la prédiction des lésions cutanées. Veuillez cliquer ici pour télécharger ce fichier.
Fichier supplémentaire 2 : Algorithme 2. Flux de travail du processus d'explication locale basé sur LIME, illustrant la génération de superpixels, l'échantillonnage par perturbation, la construction du modèle de substitution et la visualisation des régions de l'image contribuant le plus à la décision de classification. Veuillez cliquer ici pour télécharger ce fichier.