De prestatiebeoordeling van het ontwikkelde classificatiekader is gebaseerd op traditionele evaluatiematen afgeleid van de verwarringsmatrix. Een verwarringsmatrix maakt het mogelijk om een volledig inzicht te krijgen in de prestaties van de classifier door de weergave van het aantal juiste en onjuiste classificaties per gedefinieerde klasse. Op deze manier kunnen alle typen fouten worden geanalyseerd. Zo zijn zowel fout-positieven als fout-negatieven bijzonder belangrijk bij de diagnose van ziekten. Hoge waarden voor fout-positieven kunnen duiden op een hoge sensitiviteit van een classifier, maar tegelijkertijd wijzen grote hoeveelheden fout-negatieven op een lage sensitiviteit en vormen zij potentiële gezondheidsrisico's. In dit artikel worden de volgende prestatiegegevens gebruikt: nauwkeurigheid, precisie, recall, F1-score, specificiteit, true positive rate (TPR) en false positive rate (FPR). De formules voor deze metrieken staan hieronder vermeld:
Nauwkeurigheid=(TP+TN)/(TP+TN+FP+FN) (3)
Precisie = TP/(TP+FP) (4)
(5)
(6)
(7)
(8)
In dit geval geeft TP het aantal maligne huidkankers aan dat door het framework is gedetecteerd, terwijl TN het aantal benigne laesies aangeeft. Op hun beurt demonstreert FP het aantal onjuiste beslissingen waarbij laesies als maligne worden geclassificeerd, hoewel ze in werkelijkheid benigne zijn. FN weerspiegelt het aantal onjuist herkende benigne monsters. Met betrekking tot de classificatie van huidkanker is het minimaliseren van fout-negatieven uiterst belangrijk vanwege de mogelijke nadelige effecten die daaruit voortvloeien.
Prestaties van basismodellen
Alle computationele experimenten werden uitgevoerd in de cloudgebaseerde omgeving van Google Colab. Het is vermeldenswaard dat dit platform het mogelijk maakt om virtuele machine-instanties uit te voeren met een vooraf gedefinieerde Ubuntu 20.04 als besturingssysteem. Voor het trainen van de basismodellen werden Python versie 3.9 en het PyTorch-framework versie 2.3.1 gebruikt. Daarnaast hadden alle computernodes identieke specificaties, namelijk een Intel Xeon CPU met een frequentie van 2.2 GHz, een NVIDIA Tesla T4 GPU, 16 GB RAM en een opslagcapaciteit van 70 GB. Deze experimentele opzet maakte het mogelijk om de variabiliteit die door verschillende hardwareplatforms wordt geïntroduceerd te verminderen en de betrouwbaarheid en reproduceerbaarheid van de resultaten te verhogen. Een volledig overzicht van de experimentele omgeving is te vinden in Tabel 3.
Figuur 4 toont de leercurves die overeenkomen met 100 epochs training voor de ResNet-50 architectuur. De training werd uitgevoerd op basis van een dataset met 2.110 afbeeldingen, terwijl de grootte van de validatiedataset gelijk was aan 660 afbeeldingen. Zoals te zien is, nam de nauwkeurigheid tijdens de training constant toe tot bijna 90,0%. Tegelijkertijd werd er een verbetering in de nauwkeurigheid waargenomen gedurende de eerste 50 epochs; na dit punt werd de nauwkeurigheid vrijwel constant, wat kan worden beschouwd als een teken van convergentie van het model. Voor de validatie demonstreerde het model een AUC-waarde van 86,0%, waarmee redelijke discriminatieve eigenschappen werden aangetoond.
De verwarringsmatrix in Figuur 5 kenmerkt de prestaties van het ResNet-50-model in termen van classificatienauwkeurigheid voor een testset met 660 afbeeldingen. Tijdens de evaluatie herkende het model 310 van de 360 goedaardige monsters en 239 van de 300 kwaadaardige monsters correct. Er werd echter een relatief hoog aantal kwaadaardige monsters onjuist geclassificeerd, wat leidde tot een relatief grote waarde voor fout-negatieven. Dit resultaat moet nauwer worden bestudeerd vanwege de ernstige implicaties van dit type fout bij het praktisch gebruik van de classifier. In totaal bereikte het model een nauwkeurigheid van 83,0%, met een precisie van 83,3%, een recall van 83,3% en een F1-score van 83,3%.
Tabel 4 bevat een gedetailleerde beschrijving van de prestatiekenmerken voor het ResNet-50-model voor beide klassen. De classifier vertoonde een relatief gebalanceerd gedrag wat betreft de precisie; voor goedaardige monsters was deze waarde 83,0%, terwijl kwaadaardige monsters een precisie van 84,0% opleverden. Op dezelfde wijze bereikten de recall-waarden 88,0% voor goedaardige laesies en 78,0% voor kwaadaardige laesies. Support in de tabel staat voor het aantal monsters dat overeenkomt met elke klasse.
Voorgesteld EDLF-SLC model
Figuur 6 illustreert de AUC voor training en validatie van het voorgestelde model over 300 epochs. De AUC-metriek weerspiegelt het vermogen van het model om onderscheid te maken tussen benigne en maligne klassen, waarbij hogere waarden duiden op een betere discriminatieve prestatie. Zoals waargenomen neemt de trainings-AUC gestaag toe gedurende het trainingsproces en bereikt deze een maximale waarde van 1,00 rond epoch 200. De validatie-AUC verbetert eveneens progressief tijdens de beginfasen van de training; deze begint echter af te vlakken na ongeveer 150 epochs, wat wijst op convergentie van het model. De uiteindelijke validatie-AUC van 0,95 demonstreert een sterk generalisatievermogen en een effectieve scheidbaarheid van klassen.
De verwarringsmatrix van het voorgestelde model, weergegeven in Figuur 7, laat zien dat het model 299 benigne monsters en 272 maligne monsters correct classificeerde, terwijl 28 benigne gevallen onterecht als maligne en 61 maligne gevallen onterecht als benigne werden geclassificeerd. In totaal behaalde het model 571 correcte voorspellingen en 89 misclassificaties. Opvallend is dat het hogere aantal fout-negatieven (maligne gevallen die onterecht als benigne werden geclassificeerd) een kritieke beperking onderstreept, aangezien dergelijke fouten significante klinische implicaties kunnen hebben. Desondaan blijft de algehele classificatieprestatie robuust. In tegenstelling tot benaderingen voor kenmerkselectie, waarbij dimensies vóór de classificatie doelbewust worden verwijderd, behoudt het voorgestelde raamwerk de volledige gefuseerde diepe representatie die door meerdere heterogene CNN-architecturen is gegenereerd. Voor dit ontwerp is gekozen omdat elke backbone complementaire kenmerken van de laesie extraheert, en het behouden van de volledige representatie de SVM-classifier in staat stelt om de gecombineerde discriminerende informatie te benutten zonder potentieel informatieve kenmerken uit te sluiten. Bijgevolg geeft de gehanteerde strategie voor kenmerkfusie prioriteit aan complementair representatie-leren, terwijl de computationele haalbaarheid behouden blijft.
Figuur 8 presenteert representatieve voorbeelden van classificatieresultaten geproduceerd door het voorgestelde model. De resultaten tonen aan dat het model hoge betrouwbaarheidsscores toekent aan correct geclassificeerde instanties. Specifiek vertonen benigne gevallen hoge voorspelde waarschijnlijkheden (bijv. 99,84% en 99,85%), terwijl maligne gevallen eveneens sterke betrouwbaarheidsniveaus laten zien (bijv. 99,98% en 99,96%). Deze bevindingen geven aan dat het model effectief kan differentiëren tussen benigne en maligne laesies, zelfs in visueel uitdagende scenario's. Om de interpreteerbaarheid te verbeteren, wordt het LIME-framework gebruikt om gelokaliseerde verklaringen voor modelvoorspellingen te genereren, zoals weergegeven in Figuur 9A–D. LIME benadert de complexe beslissingsgrens van het model met behulp van een lokaal interpreteerbaar lineair model. Voor elke invoerafbeelding genereert de methode verstoorde monsters door selectief superpixels te maskeren en de overeenkomstige voorspellingen te evalueren. Vervolgens wordt een gewogen lineair model op deze monsters aangepast, waarbij de gewichten worden bepaald op basis van de nabijheid tot de oorspronkelijke invoer met behulp van een radial basis function-kernel. De resulterende coëfficiënten representeren de bijdrage van elke superpixel aan de uiteindelijke voorspelling en zijn gedefinieerd als:
(9)
waarbij Xj ∈ {0, 1} de aanwezigheid of afwezigheid van de j-de superpixel aanduidt, Bj het overeenkomstige wegingsgewicht vertegenwoordigt en B0 de basisvoorspelling is. Positieve coëfficiënten (Bj > 0) duiden op regio's die bijdragen aan de maligne klasse, terwijl negatieve coëfficiënten (Bj < 0) overeenkomen met benigne kenmerken. De op LIME gebaseerde visualisaties, getoond in Figuur 9B, D, markeren de meest invloedrijke regio's die bijdragen aan elke classificatiebeslissing. Voor benigne laesies legt het model de nadruk op regio's die worden gekenmerkt door een uniforme pigmentatie en duidelijk gedefinieerde randen. Daarentegen komen bij maligne gevallen de gemarkeerde regio's overeen met klinisch significante kenmerken zoals onregelmatige randen, kleurheterogeniteit en atypische texturen. De intensiteit van de gemarkeerde regio's weerspiegelt de grootte van de overeenkomstige coëfficiënten Bj.
Deze resultaten tonen aan dat het EDLF-SLC-model zich richt op klinisch relevante kenmerken die overeenstemmen met vastgestelde dermatologische criteria, zoals de ABCD-regel. Deze overeenstemming vergroot de interpreteerbaarheid en betrouwbaarheid van het model, waardoor het geschikter is voor klinische beslissingsondersteuning. Bovendien presenteert Figuur 10 vergelijkende visualisatieresultaten verkregen met aanvullende technieken voor uitlegbaarheid, waaronder Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM en EigenCAM, wat de consistentie van de geïdentificeerde saillante regio's over verschillende methoden heen verder valideert. Wat betreft de prestaties van het voorgestelde EDLF-SLC-model en zeven baselinemodellen na training voor 100 epochs, is een vergelijking te zien in Tabel 5. EDLF-SLC behaalde een concurrerende prestatie van 0,88 op elke geëvalueerde metriek in vergelijking met de baselinearchitecturen die op basis van de experimentele context zijn geëvalueerd. EfficientNetB0 en ResNet50 behaalden eveneens goede resultaten, met nauwkeurigheden van respectievelijk 0,85 en 0,83. Omgekeerd vertoonde Inception-ResNetV2 de slechtste classificatieprestaties van de geëvalueerde modellen. Aan de andere kant was, ondanks de relatief lagere classificatienauwkeurigheid, de computationele efficiëntie nog steeds vergelijkbaar met die van de baselinemodellen. Het voorgestelde EDLF-SLC-model vertoonde een concurrerende prestatie ten opzichte van de geëvalueerde baselinemodellen onder de gehanteerde experimentele omstandigheden.
Om de prestaties van het voorgestelde raamwerk te beoordelen ten opzichte van bestaande benaderingen, presenteert Tabel 6 een vergelijking met representatieve state-of-the-art methoden voor de classificatie van huidlaesies. Zo werd bijvoorbeeld47 een nauwkeurigheid van 0,86 gerapporteerd, terwijl48 een ensemble-gebaseerd model gebruikte dat een vergelijkbare nauwkeurigheid behaalde, maar een lagere precisie, recall en F1-score. Recente studies gebaseerd op ensemble learning en meerdere CNN-architecturen25,49 rapporteerden nauwkeurigheden tot 0,87. Onder de gehanteerde experimentele omstandigheden behaalde het voorgestelde EDLF-SLC raamwerk een nauwkeurigheid van 0,88, terwijl er gebruik werd gemaakt van een uniforme uitlegbare architectuur zonder dat aanvullende componenten, zoals modellen voor laesie-segmentatie, vereist waren.
DATABESCHIKBAARHEID
De gegevens die de bevindingen van deze studie ondersteunen, zijn openbaar beschikbaar op Kaggle via https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Figuur 1: Representatieve dermoscopische beelden uit de ISIC-dataset die de twee diagnostische klassen illustreren die in deze studie zijn gebruikt. Monsters zijn gelabeld als goedaardig (0) en kwaadaardig (1), waarbij de variabiliteit in laesiomorfologie, kleur en textuur over de dataset wordt benadrukt. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Volledige workflow van het voorgestelde EDLF-SLC-framework. Het protocol begint met de acquisitie van ISIC 2020-beelden, gevolgd door preprocessing, data-augmentatie, datasetpartitionering, diepe kenmerkextractie met behulp van vier vooraf getrainde CNN-architecturen, kennerfusie, SVM-classificatie, prestatie-evaluatie en het genereren van verklaringen op basis van LIME. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Voorbeelden van uitgebreide afbeeldingen van huidlaesies, gegenereerd met behulp van data-augmentatietechnieken. Dit omvat horizontaal en verticaal spiegelen, rotatie, schaling en aanpassing van de helderheid. Deze transformaties vergroten de diversiteit van de dataset, verbeteren de robuustheid van het model en verminderen het risico op overfitting tijdens de training. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Trainings- en validatie-area under the curve van de receiver operating characteristic (ROC-AUC) van het ResNet-50 model over 100 trainingsepochs. De blauwe curve vertegenwoordigt de trainings-AUC, terwijl de oranje curve de validatie-AUC vertegenwoordigt. De curves tonen een snelle convergentie tijdens de initiële trainingsepochs, gevolgd door een stabiele optimalisatie met consistent hoge validatieprestaties, wat wijst op effectief leren en een bevredigende generalisatie op de validatiedataset. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Confusionmatrix van het ResNet-50 model op de testdataset. De rijen vertegenwoordigen de werkelijke klasslabels (0 = goedaardig, 1 = kwaadaardig), terwijl de kolommen de voorspelde klasslabels vertegenwoordigen. De diagonale elementen geven de correct geclassificeerde monsters aan (310 goedaardig en 239 kwaadaardig), terwijl de niet-diagonale elementen de foutief geclassificeerde monsters vertegenwoordigen, waaronder 50 fout-positieven en 61 fout-negatieven. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6: Training- en validatie-receiver operating characteristic area under the curve (ROC-AUC) van het voorgestelde EDLF-SLC-model over 300 training-epochs. De blauwe curve vertegenwoordigt de training-AUC, terwijl de oranje curve de validatie-AUC vertegenwoordigt. Het model vertoont een snelle convergentie tijdens de initiële training-epochs, gevolgd door een stabiele optimalisatie met consistent hoge training- en validatie-AUC-waarden gedurende de resterende epochs. De aanhoudende validatieprestaties tonen een goed generalisatievermogen en stabiel leergedrag van het voorgestelde EDLF-SLC-framework op de validatiedataset. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Confusiematrix van het voorgestelde EDLF-SLC-model op de testdataset. De rijen vertegenwoordigen de werkelijke klasselabels (0 = goedaardig, 1 = kwaadaardig), terwijl de kolommen de voorspelde klasselabels vertegenwoordigen. De diagonale elementen geven correct geclassificeerde monsters aan (299 goedaardig en 272 kwaadaardig), terwijl de off-diagonale elementen overeenkomen met foutief geclassificeerde monsters, waaronder 61 fout-positieven en 28 fout-negatieven. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8: Voorbeeldvoorspellingen gegenereerd door het voorgestelde EDLF-SLC-model. Deze figuur illustreert de betrouwbaarheidsniveaus van de classificatie voor goedaardige en kwaadaardige laesies en demonstreert het onderscheidend vermogen van het model. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 9: LIME-gebaseerde lokale verklaringen van het voorgestelde EDLF-SLC-model. De figuur markeert de meest invloedrijke superpixelregio's die bijdragen aan de classificatiebeslissingen van het model. (A) Originele dermoscopische afbeelding van een goedaardige huidlaesie. (B) LIME-verklaring voor de goedaardige laesie, waarbij gemarkeerde superpixels de regio's aangeven die het meest bijdroegen aan de voorspelling 'goedaardig'. (C) Originele dermoscopische afbeelding van een kwaadaardige huidlaesie. (D) LIME-verklaring voor de kwaadaardige laesie, die de discriminerende superpixelregio's toont die hoofdzakelijk de kwaadaardige classificatie beïnvloedden. Gele begrenzingen bakenen de invloedrijke superpixels af die door LIME zijn geïdentificeerd, terwijl grijze regio's gebieden vertegenwoordigen met een minimale bijdrage aan de voorspelling. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 10: Vergelijking van explainability-methoden op basis van class activation mapping (CAM) toegepast op het voorgestelde EDLF-SLC-model. De figuur vergelijkt de lokalisatiekaarten gegenereerd door GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM en EigenCAM voor dezelfde dermoscopische afbeelding. Het eerste paneel toont de oorspronkelijke inputafbeelding, gevolgd door de overeenkomstige ruwe activatiekaarten en heatmap-overlays geproduceerd door elke explainability-methode. De visualisaties illustreren de verschillen in ruimtelijke lokalisatie en markeren de beeldregio's die het sterkst bijdragen aan de classificatiebeslissing van het voorgestelde EDLF-SLC-framework. Klik hier om een grotere versie van deze figuur te bekijken.
| Ref. | Jaar | Dataset | Datagrootte | Kenmerkextractie | Methode | Nauwkeurigheid |
| 9 | 2022 | HAM10000 dataset | 10015 afbeeldingen van huidlaesies | Kleur- en vormkenmerken | ML-algoritmen en Convolutional NN-modellen | 95.1% |
| 19 | 2023 | PH2 dataset | 200 geannoteerde afbeeldingen | Kenmerken voor asymmetrie, strepen, stippen/globuli en regressiegebieden | ML-modellen | 94.0% |
| 30 | 2024 | HAM10000 dataset | 10000 afbeeldingen | Kleur- en vormkenmerken | S-MobileNet | 97.7% |
| 28 | 2025 | ISIC2020 en HAM10000 datasets | ISIC2020 (12,670 afbeeldingen) en HAM10000 (10,015 afbeeldingen) | Kleur en vorm | Residual network-Long Short-Term Memory (R-LSTM50) | 95.7% (ISIC2020); 94.2% (HAM10000) |
| 32 | 2026 | Monkeypox Skin Lesion Dataset (MSLD) | 770 afbeeldingen | Context en textuur | DenseNet121, Xception, InceptionV3 en CBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38,569 afbeeldingen | Context en textuur | MobileNet, ResNet50, InceptionV3 en EfficientNet | 93.6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 afbeeldingen | Contextueel en ruimtelijk | CNN-transformer-gebaseerde multi-modale DL | 98.71% |
| 41 | 2026 | ISIC 2019 | 25,000 afbeeldingen | Context en textuur | TransXV2S | 95.26% |
| 42 | 2025 | HAM10000 | 10,015 afbeeldingen | Kleur en vorm | ViT met YOLOv8 | 93% |
Tabel 1: Vergelijking met literatuur.Samenvatting van enkele recent gepubliceerde werken waarin deep learning-algoritmen worden gebruikt voor de classificatie van huidlaesies.
| Dataset | Goedaardig | Maligne | Totaal |
| Trainingsgegevens | 1440 | 1197 | 2637 |
| Testgegevens | 360 | 300 | 660 |
| Totale gegevens | 1800 | 1497 | 3297 |
Tabel 2: Datasetdistributie. Distributie van benigne en maligne monsters in de ISIC 2020-dataset, inclusief de splitsing in trainings- en testsets.
| Component | Specificatie |
| Besturingssysteem | Ubuntu 20.04 |
| Programmeertaal | Python 3.9 |
| DL-framework | PyTorch 2.3.1 |
| Optimizer | Adam |
| Learning rate scheduling | 1e−3 |
| Aantal epochs | 100/300 |
| CPU | 2 vCPU 2.2 GHz |
| GPU | Tesla T4 (16 GB) × 1 |
| RAM | 16 GB |
| Trainbare parameters | 2,430,353 (9.27 MB) |
| Niet-trainbare parameters | 133,434,397 (509.01 MB) |
Tabel 3: Systeemspecificaties. Gedetailleerde specificaties van de computationele omgeving, inclusief softwareframeworks en hardwarebronnen die zijn gebruikt voor modeltraining en evaluatie.
| Klasse | Precisie | Recall | F1-score | Support |
| Benigne klasse | 0.83 | 0.88 | 0.85 | 360 |
| Maligne klasse | 0.84 | 0.78 | 0.81 | 300 |
| Nauwkeurigheid | - | - | 0.832 | 660 |
| Macro-gemiddelde | 0.84 | 0.83 | 0.83 | 660 |
| Gewogen gemiddelde | 0.84 | 0.83 | 0.83 | 660 |
Tabel 4: Classificatierapport. Classificatieprestaties van het ResNet-50 model op de testdataset, inclusief precisie, recall, F1-score en support voor elke klasse.
| Model | Nauwkeurigheid | Precisie | Recall | F1-score | Tijd (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tabel 5: Vergelijking van modelprestaties. Vergelijkende prestaties van het voorgestelde EDLF-SLC-model en baseline deep learning-modellen op basis van nauwkeurigheid, precisie, recall, F1-score en computationele tijd.
| Model | Nauwkeurigheid | Precisie | Recall | F1-score |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 met SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Hybride DL-modellen + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Hybride DL-modellen + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| Voorgestelde EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 |
Tabel 6: Metrieken voor modelvergelijking. Prestatievergelijking tussen het voorgestelde EDLF-SLC-raamwerk en recente state-of-the-art benaderingen voor de classificatie van huidlaesies.
Aanvullend bestand 1: Algoritme 1. Workflow van het voorgestelde EDLF-SLC-framework, met een overzicht van de gegevensvoorverwerking, deep feature-extractie met behulp van meerdere CNN-architecturen, SVM-gebaseerde classificatie en LIME-gebaseerde uitlegbaarheid voor de voorspelling van huidlaesies. Klik hier om dit bestand te downloaden.
Aanvullend bestand 2: Algoritme 2. Workflow van het op LIME gebaseerde lokale verklaringsproces, waarin de generatie van superpixels, perturbatie-steekproeven, de constructie van het surrogaatmodel en de visualisatie van de beeldregio's die het meest bijdragen aan de classificatiebeslissing worden geïllustreerd. Klik hier om dit bestand te downloaden.