Die Leistungsbeurteilung des entwickelten Klassifizierungsrahmens basiert auf traditionellen Evaluationsmaßen, die sich aus der Konfusionsmatrix ergeben. Eine Konfusionsmatrix ermöglicht ein vollständiges Verständnis der Klassifiziererleistung, indem sie die Anzahl der richtigen und falschen Klassifizierungen für jede definierte Klasse darstellt. Auf diese Weise können alle Fehlerarten analysiert werden. Beispielsweise sind sowohl falsch positive als auch falsch negative Ergebnisse bei der Diagnose von Krankheiten besonders wichtig. Hohe Werte bei falsch positiven Ergebnissen können auf eine hohe Empfindlichkeit des Klassifizierers hinweisen, während gleichzeitig eine große Anzahl falsch negativer Ergebnisse auf eine geringe Sensitivität hindeutet und potenzielle Gesundheitsrisiken darstellt. In dieser Arbeit werden die folgenden Leistungskennzahlen verwendet: Genauigkeit, Präzision, Sensitivität (Recall), F1-Score, Spezifität, True-Positive-Rate (TPR) und False-Positive-Rate (FPR). Die Formeln dieser Kennzahlen sind unten aufgeführt:
Genauigkeit=(TP+TN)/(TP+TN+FP+FN) (3)
Präzision = TP/(TP+FP) (4)
(5)
(6)
(7)
(8)
In diesem Fall zeigt TP die Anzahl der vom Framework erkannten bösartigen Hautkrebsfälle an, während TN die Anzahl der gutartigen Läsionen angibt. FP zeigt hingegen die Anzahl falscher Entscheidungen an, bei denen Läsionen als bösartig klassifiziert werden, obwohl sie tatsächlich gutartig sind. FN spiegelt die Anzahl falsch als gutartig erkannter Proben wider. Bei der Klassifizierung von Hautkrebs ist die Minimierung von falsch negativen Ergebnissen äußerst wichtig, da dies potenziell schwerwiegende Folgen haben kann.
Leistung der Baseline-Modelle
Alle rechnergestützten Experimente wurden in der cloudbasierten Umgebung von Google Colab durchgeführt. Dabei ist hervorzuheben, dass diese Plattform das Ausführen von virtuellen Maschineninstanzen ermöglicht, die ein vordefiniertes Ubuntu 20.04 als Betriebssystem verwenden. Zum Trainieren der Baseline-Modelle kamen Python-Version 3.9 und das PyTorch-Framework in Version 2.3.1 zum Einsatz. Zudem verfügten alle Recheneinheiten über identische Spezifikationen, nämlich eine Intel Xeon CPU mit einer Taktfrequenz von 2,2 GHz, eine NVIDIA Tesla T4 GPU, 16 GB RAM und eine Speicherkapazität von 70 GB. Dadurch konnte die durch unterschiedliche Hardwareplattformen verursachte Variabilität verringert und die Zuverlässigkeit sowie Reproduzierbarkeit der Ergebnisse erhöht werden. Eine vollständige Übersicht über die experimentelle Umgebung ist in Tabelle 3 enthalten.
Abbildung 4 zeigt Lernkurven, die 100 Trainingsepochen für die ResNet-50-Architektur entsprechen. Das Training wurde anhand eines Datensatzes mit 2.110 Bildern durchgeführt, während die Größe des Validierungsdatensatzes 660 Bilder betrug. Wie man sehen kann, stieg die Genauigkeit während des Trainings kontinuierlich auf nahezu 90,0 % an. Gleichzeitig wurde eine Verbesserung der Genauigkeit in den ersten 50 Epochen beobachtet; danach blieb die Genauigkeit nahezu konstant, was als Zeichen für die Konvergenz des Modells angesehen werden kann. Bei der Validierung erreichte das Modell einen AUC-Wert von 86,0 %, wodurch es angemessene diskriminative Eigenschaften zeigte.
Die in Abbildung 5 dargestellte Konfusionsmatrix beschreibt die Leistung des ResNet-50-Modells hinsichtlich der Klassifikationsgenauigkeit anhand eines Testdatensatzes mit 660 Bildern. Während der Auswertung erkannte das Modell 310 von 360 gutartigen Proben korrekt sowie 239 von 300 bösartigen Proben. Allerdings wurden vergleichsweise viele bösartige Proben falsch klassifiziert, was zu einem relativ hohen Anteil an falsch negativen Ergebnissen führte. Dieses Ergebnis sollte aufgrund der schwerwiegenden Konsequenzen dieser Fehlerart bei praktischer Anwendung des Klassifikators genauer betrachtet werden. Insgesamt erreichte das Modell eine Genauigkeit von 83,0 %, eine Präzision von 83,3 %, einen Rückruf von 83,3 % und einen F1-Score von 83,3 %.
Tabelle 4 enthält eine detaillierte Beschreibung der Leistungsmerkmale des ResNet-50-Modells bezüglich beider Klassen. Der Klassifikator zeigte ein relativ ausgewogenes Verhalten hinsichtlich der Präzision: Bei gutartigen Proben betrug der Wert 83,0 %, während bösartige Proben eine Präzision von 84,0 % aufwiesen. Ebenso erreichten die Sensitivitätswerte 88,0 % für gutartige Läsionen und 78,0 % für bösartige. Die Angabe „Support“ in der Tabelle stellt die Anzahl der Proben dar, die jeder Klasse entsprechen.
Vorgeschlagenes EDLF-SLC-Modell
Abbildung 6 zeigt die Trainings- und Validierungs-AUC des vorgeschlagenen Modells über 300 Epochen hinweg. Die AUC-Metrik spiegelt die Fähigkeit des Modells wider, zwischen benignen und malignen Klassen zu unterscheiden, wobei höhere Werte eine bessere Diskriminierungsleistung anzeigen. Wie zu erkennen ist, steigt die Trainings-AUC während des gesamten Trainingsprozesses stetig an und erreicht einen maximalen Wert von 1,00 bei etwa der 200. Epoche. Die Validierungs-AUC verbessert sich ebenfalls progressiv in den anfänglichen Trainingsphasen; sie beginnt jedoch nach etwa 150 Epochen zu stagnieren, was auf eine Konvergenz des Modells hindeutet. Die endgültige Validierungs-AUC von 0,95 demonstriert eine starke Generalisierungsfähigkeit und effektive Klassentrennbarkeit.
Die in Abbildung 7 dargestellte Konfusionsmatrix des vorgeschlagenen Modells zeigt, dass das Modell 299 gutartige Proben und 272 bösartige Proben korrekt klassifizierte, während 28 gutartige Fälle fälschlicherweise als bösartig und 61 bösartige Fälle fälschlicherweise als gutartig klassifiziert wurden. Insgesamt erzielte das Modell 571 korrekte Vorhersagen und 89 Fehlklassifikationen. Auffällig ist die höhere Anzahl an falsch-negativen Ergebnissen (bösartige Fälle, die fälschlicherweise als gutartig klassifiziert wurden), die eine entscheidende Einschränkung darstellt, da solche Fehler erhebliche klinische Auswirkungen haben können. Dennoch bleibt die Gesamtleistung der Klassifizierung robust. Im Gegensatz zu Ansätzen zur Merkmalsauswahl, bei denen Dimensionen vor der Klassifizierung gezielt entfernt werden, bewahrt das vorgeschlagene Framework die vollständige fusionierte, tiefe Repräsentation, die von mehreren heterogenen CNN-Architekturen erzeugt wird. Dieser Ansatz wurde gewählt, weil jeder Backbone komplementäre Läsionsmerkmale extrahiert, und die Beibehaltung der vollständigen Repräsentation es dem SVM-Klassifikator ermöglicht, die kombinierten diskriminativen Informationen zu nutzen, ohne potenziell informative Merkmale auszuschließen. Folglich priorisiert die verwendete Strategie zur Merkmalsfusion das Lernen komplementärer Repräsentationen, während gleichzeitig die rechnerische Machbarkeit gewahrt bleibt.
Abbildung 8 zeigt repräsentative Beispiele für Klassifizierungsergebnisse, die vom vorgeschlagenen Modell erzeugt wurden. Die Ergebnisse zeigen, dass das Modell korrekt klassifizierten Fällen hohe Konfidenzwerte zuweist. Insbesondere weisen gutartige Fälle hohe vorhergesagte Wahrscheinlichkeiten auf (z. B. 99,84 % und 99,85 %), während auch maligne Fälle starke Konfidenzniveaus aufweisen (z. B. 99,98 % und 99,96 %). Diese Befunde deuten darauf hin, dass das Modell gutartige und maligne Läsionen effektiv voneinander unterscheiden kann, selbst in visuell anspruchsvollen Szenarien. Zur Verbesserung der Interpretierbarkeit wird das LIME-Framework verwendet, um lokalisierte Erklärungen für Modellvorhersagen zu generieren, wie in Abbildung 9A–D dargestellt. LIME approximiert die komplexe Entscheidungsgrenze des Modells mithilfe eines lokal interpretierbaren linearen Modells. Für jedes Eingabebild erzeugt die Methode gestörte Stichproben, indem selektiv Superpixel maskiert und die entsprechenden Vorhersagen ausgewertet werden. Anschließend wird ein gewichtetes lineares Modell an diese Stichproben angepasst, wobei die Gewichte basierend auf der Nähe zum ursprünglichen Eingangssignal mithilfe eines radialen Basisfunktionskernels bestimmt werden. Die resultierenden Koeffizienten repräsentieren den Beitrag jedes Superpixels zur endgültigen Vorhersage und sind definiert als:
(9)
wobei Xj ∈ {0, 1} das Vorhandensein oder Fehlen des j-ten Superpixels bezeichnet, Bj das entsprechende Gewichtungsgewicht darstellt und B0 die Baseline-Vorhersage ist. Positive Koeffizienten (Bj > 0) weisen auf Bereiche hin, die zur malignen Klasse beitragen, während negative Koeffizienten (Bj < 0) benignen Merkmalen entsprechen. Die auf LIME basierenden Visualisierungen, dargestellt in Abbildung 9B, D, heben die einflussreichsten Regionen hervor, die zu jeder Klassifizierungsentscheidung beitragen. Bei benignen Läsionen betont das Modell Bereiche, die sich durch gleichmäßige Pigmentierung und klar definierte Grenzen auszeichnen. Im Gegensatz dazu entsprechen die hervorgehobenen Bereiche bei malignen Fällen klinisch signifikanten Merkmalen wie unregelmäßigen Grenzlinien, Farbheterogenität und atypischen Texturen. Die Intensität der hervorgehobenen Bereiche spiegelt die Größe der entsprechenden Koeffizienten Bj wider.
Diese Ergebnisse zeigen, dass das EDLF-SLC-Modell auf klinisch bedeutsame Merkmale fokussiert, die mit etablierten dermatologischen Kriterien wie der ABCD-Regel übereinstimmen. Diese Übereinstimmung erhöht die Interpretierbarkeit und Vertrauenswürdigkeit des Modells und macht es besser für die Unterstützung klinischer Entscheidungsfindung geeignet. Darüber hinaus zeigt Abbildung 10 vergleichende Visualisierungsergebnisse, die mithilfe zusätzlicher Erklärbarkeitstechniken gewonnen wurden, darunter Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM und EigenCAM, wodurch die Konsistenz der identifizierten aussagekräftigen Bereiche über verschiedene Methoden hinweg weiter bestätigt wird. Hinsichtlich der Leistung des vorgeschlagenen EDLF-SLC-Modells und sieben Baseline-Modellen nach dem Training über 100 Epochen ist ein Vergleich in Tabelle 5 ersichtlich. EDLF-SLC erzielte im Vergleich zu den Baseline-Architekturen im Rahmen des experimentellen Kontexts bei jeder evaluierten Metrik eine wettbewerbsfähige Leistung von 0,88. EfficientNetB0 und ResNet50 erzielten ebenfalls gute Ergebnisse mit Genauigkeiten von 0,85 bzw. 0,83. Umgekehrt wies Inception-ResNetV2 die schlechteste Klassifikationsleistung aller evaluierten Modelle auf. Dennoch war seine Recheneffizienz trotz relativ niedrigerer Klassifikationsgenauigkeit mit der der Baseline-Modelle vergleichbar. Das vorgeschlagene EDLF-SLC-Modell zeigte unter den verwendeten experimentellen Bedingungen eine wettbewerbsfähige Leistung im Vergleich zu den evaluierten Baseline-Modellen.
Um die Leistung des vorgeschlagenen Frameworks im Vergleich zu bestehenden Ansätzen zu bewerten, zeigt Tabelle 6 einen Vergleich mit repräsentativen Methoden des aktuellen Forschungsstandes zur Klassifizierung von Hautläsionen. Beispielsweise47 wurde eine Genauigkeit von 0,86 berichtet, während48 ein ensemblebasiertes Modell verwendete, das eine ähnliche Genauigkeit, jedoch geringere Präzision, Sensitivität und F1-Score erreichte. Neuere Studien, die auf Ensemble-Learning und mehreren CNN-Architekturen basieren25,49, berichteten Genauigkeiten von bis zu 0,87. Unter den verwendeten experimentellen Bedingungen erreichte das vorgeschlagene EDLF-SLC-Framework eine Genauigkeit von 0,88, wobei es eine einheitliche, erklärbare Architektur nutzt, ohne zusätzliche Komponenten wie Läsions-Segmentierungsmodelle zu benötigen.
VERFÜGBARKEIT VON DATEN
Die Daten, die die Ergebnisse dieser Studie unterstützen, sind öffentlich in Kaggle unter https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign verfügbar.

Abbildung 1: Repräsentative dermatoskopische Bilder aus dem ISIC-Datensatz, die die beiden diagnostischen Klassen veranschaulichen, die in dieser Studie verwendet wurden. Die Proben sind als gutartig (0) und bösartig (1) gekennzeichnet und zeigen die Variabilität der Läsionsmorphologie, -farbe und -textur innerhalb des Datensatzes auf. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 2: Vollständiger Workflow des vorgeschlagenen EDLF-SLC-Frameworks. Das Protokoll beginnt mit der Bildakquise aus ISIC 2020, gefolgt von der Vorverarbeitung, Datenaugmentierung, Aufteilung des Datensatzes, tiefen Merkmalsextraktion mithilfe von vier vortrainierten CNN-Architekturen, Merkmalsfusion, SVM-Klassifizierung, Leistungsbewertung und der Erzeugung von Erklärungen basierend auf LIME. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3: Beispiele erweiterter Hautläsionsbilder, die mithilfe von Datenaugmentierungstechniken erzeugt wurden. Dazu gehören horizontales und vertikales Spiegeln, Drehung, Skalierung sowie Helligkeitsanpassung. Diese Transformationen erhöhen die Vielfalt des Datensatzes, verbessern die Robustheit des Modells und verringern das Risiko einer Überanpassung während des Trainings. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 4: Trainings- und Validierungs-Receiver-Operating-Characteristic-Fläche unter der Kurve (ROC-AUC) des ResNet-50-Modells über 100 Trainingsepochen. Die blaue Kurve stellt die Trainings-AUC dar, während die orangefarbene Kurve die Validierungs-AUC darstellt. Die Kurven zeigen eine schnelle Konvergenz in den ersten Trainingsepochen, gefolgt von einer stabilen Optimierung mit durchgängig hoher Validierungsleistung, was auf effektives Lernen und zufriedenstellende Generalisierung auf dem Validierungsdatensatz hinweist. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 5: Konfusionsmatrix des ResNet-50-Modells auf dem Testdatensatz. Die Zeilen repräsentieren die tatsächlichen Klassenbezeichnungen (0 = gutartig, 1 = bösartig), während die Spalten die vorhergesagten Klassenbezeichnungen darstellen. Die Elemente auf der Diagonalen zeigen korrekt klassifizierte Proben an (310 gutartige und 239 bösartige), während die Elemente außerhalb der Diagonalen falsch klassifizierte Proben darstellen, darunter 50 falsch positive und 61 falsch negative Ergebnisse. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 6: Trainings- und Validierungs-Receiver-Operating-Characteristic-Fläche unter der Kurve (ROC-AUC) des vorgeschlagenen EDLF-SLC-Modells über 300 Trainingsepochen. Die blaue Kurve stellt die Trainings-AUC dar, während die orangefarbene Kurve die Validierungs-AUC darstellt. Das Modell zeigt eine schnelle Konvergenz in den ersten Trainingsepochen, gefolgt von einer stabilen Optimierung mit durchgängig hohen AUC-Werten sowohl im Training als auch in der Validierung über die verbleibenden Epochen hinweg. Die anhaltend gute Validierungsleistung demonstriert die gute Generalisierungsfähigkeit und stabiles Lernverhalten des vorgeschlagenen EDLF-SLC-Frameworks auf dem Validierungsdatensatz. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 7: Konfusionsmatrix des vorgeschlagenen EDLF-SLC-Modells auf dem Testdatensatz. Die Zeilen repräsentieren die tatsächlichen Klassenbezeichnungen (0 = gutartig, 1 = bösartig), während die Spalten die vorhergesagten Klassenbezeichnungen darstellen. Die Elemente auf der Diagonalen zeigen korrekt klassifizierte Proben an (299 gutartige und 272 bösartige), während die Elemente außerhalb der Diagonalen falsch klassifizierte Proben entsprechen, darunter 61 falsch positive und 28 falsch negative Ergebnisse. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 8: Beispielhafte Vorhersagen, erzeugt durch das vorgeschlagene EDLF-SLC-Modell. Diese Abbildung veranschaulicht die Konfidenzniveaus der Klassifizierung für gutartige und bösartige Läsionen und demonstriert die Unterscheidungsfähigkeit des Modells. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 9: Lokale Erklärungen des vorgeschlagenen EDLF-SLC-Modells basierend auf LIME. Die Abbildung zeigt die einflussreichsten Superpixel-Bereiche, die zu den Klassifizierungsentscheidungen des Modells beitragen. (A) Ursprüngliches dermatoskopisches Bild einer benignen Hautläsion. (B) LIME-Erklärung für die benigne Läsion, wobei hervorgehobene Superpixel die Bereiche anzeigen, die am stärksten zur benignen Vorhersage beigetragen haben. (C) Ursprüngliches dermatoskopisches Bild einer malignen Hautläsion. (D) LIME-Erklärung für die maligne Läsion, die die diskriminativen Superpixel-Bereiche zeigt, die maßgeblich die maligne Klassifizierung beeinflusst haben. Gelbe Ränder grenzen die von LIME identifizierten einflussreichen Superpixel ab, während graue Bereiche Regionen mit geringem Beitrag zur Vorhersage darstellen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 10: Vergleich von auf Klassenaktivierungskartierung (CAM) basierenden Erklärbarkeitsmethoden, angewendet auf das vorgeschlagene EDLF-SLC-Modell. Die Abbildung vergleicht die von GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM und EigenCAM erzeugten Lokalisierungskarten für dasselbe dermoskopische Bild. Im ersten Feld ist das ursprüngliche Eingabebild dargestellt, gefolgt von den entsprechenden rohen Aktivierungskarten und Heatmap-Überlagerungen, die von jeder Erklärbarkeitsmethode erzeugt wurden. Die Visualisierungen verdeutlichen die Unterschiede in der räumlichen Lokalisierung und heben die Bildbereiche hervor, die am stärksten zur Klassifizierungsentscheidung des vorgeschlagenen EDLF-SLC-Frameworks beitragen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
| Ref. | Jahr | Datensatz | Datengröße | Merkmalsextraktion | Methode | Genauigkeit |
| 9 | 2022 | HAM10000-Datensatz | 10015 Bilder von Hautläsionen | Farb- und Formmerkmale | ML-Algorithmen und faltungsneuronale NN-Modelle | 95,1 % |
| 19 | 2023 | PH2-Datensatz | 200 annotierte Bilder | Asymmetrie, Striche, Punkte/Globuli, Regressionsareal-Merkmale | ML-Modelle | 94,0 % |
| 30 | 2024 | HAM10000-Datensatz | 10.000 Bilder | Farb- und Formmerkmale | S-MobileNet | 97,7 % |
| 28 | 2025 | ISIC2020- und HAM10000-Datensätze | ISIC2020 (12.670 Bilder) und HAM10000 (10.015 Bilder) | Farbe und Form | Residualnetzwerk mit langem Kurzzeitgedächtnis (R-LSTM50) | 95,7 % (ISIC2020); 94,2 % (HAM10000) |
| 32 | 2026 | Monkeypox-Hautläsions-Datensatz (MSLD) | 770 Bilder | Kontext und Textur | DenseNet121, Xception, InceptionV3 und CBAM | 88 % (DenseNet121) |
| 39 | 2025 | HAM10000 | 38.569 Bilder | Kontext und Textur | MobileNet, ResNet50, InceptionV3 und EfficientNet | 93,6 % (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2.357 Bilder | Kontext und räumliche Merkmale | mehrmodales Deep Learning basierend auf CNN-Transformer | 98,71 % |
| 41 | 2026 | ISIC 2019 | 25.000 Bilder | Kontext und Textur | TransXV2S | 95,26 % |
| 42 | 2025 | HAM10000 | 10.015 Bilder | Farbe und Form | ViT mit YOLOv8 | 93 % |
Tabelle 1: Literaturvergleich. Zusammenfassung einiger kürzlich veröffentlichter Arbeiten, in denen Deep-Learning-Algorithmen zur Klassifizierung von Hautläsionen verwendet wurden.
| Datensatz | Benigne | Maligne | Gesamt |
| Trainingsdaten | 1440 | 1197 | 2637 |
| Testdaten | 360 | 300 | 660 |
| Gesamtdaten | 1800 | 1497 | 3297 |
Tabelle 2: Datensatzverteilung. Verteilung gutartiger und bösartiger Proben im ISIC-2020-Datensatz, einschließlich der Aufteilung in Trainings- und Testdatensätze.
| Komponente | Spezifikation |
| Betriebssystem | Ubuntu 20.04 |
| Programmiersprache | Python 3.9 |
| Tiefe-Lern-Plattform | PyTorch 2.3.1 |
| Optimierer | Adam |
| Lernratenanpassung | 1e−3 |
| Anzahl der Epochen | 100/300 |
| CPU | 2 vCPU 2,2 GHz |
| GPU | Tesla T4 (16 GB) × 1 |
| Arbeitsspeicher (RAM) | 16 GB |
| Trainierbare Parameter | 2.430.353 (9,27 MB) |
| Nicht-trainierbare Parameter | 133.434.397 (509,01 MB) |
Tabelle 3: Systemspezifikationen. Detaillierte Spezifikationen der Rechenumgebung, einschließlich der Software-Frameworks und Hardware-Ressourcen, die für das Training und die Bewertung des Modells verwendet wurden.
| Klasse | Präzision | Recall | F1-Score | Unterstützung |
| gutartige Klasse | 0.83 | 0.88 | 0.85 | 360 |
| bösartige Klasse | 0.84 | 0.78 | 0.81 | 300 |
| Genauigkeit | - | - | 0.832 | 660 |
| Macro-Durchschnitt | 0.84 | 0.83 | 0.83 | 660 |
| gewichteter Durchschnitt | 0.84 | 0.83 | 0.83 | 660 |
Tabelle 4: Klassifizierungsbericht. Klassifizierungsleistung des ResNet-50-Modells auf dem Testdatensatz, einschließlich Präzision, Sensitivität, F1-Score und Support für jede Klasse.
| Modell | Genauigkeit | Präzision | Erinnerung | F1-Wert | Zeit (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tabelle 5: Modellleistung im Vergleich. Vergleichende Leistung des vorgeschlagenen EDLF-SLC-Modells und der Baseline-Deep-Learning-Modelle hinsichtlich Genauigkeit, Präzision, Sensitivität, F1-Score und Rechenzeit.
| Modell | Genauigkeit | Präzision | Recall | F1-Score |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 mit SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Hybride DL-Modelle + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Hybride DL-Modelle + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| Vorgeschlagenes EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 |
Tabelle 6: Metriken zum Modellvergleich. Vergleich der Leistung zwischen dem vorgeschlagenen EDLF-SLC-Framework und aktuellen modernen Ansätzen zur Klassifizierung von Hautläsionen.
Zusatzdatei 1: Algorithmus 1. Arbeitsablauf des vorgeschlagenen EDLF-SLC-Frameworks, der die Datenvorverarbeitung, die Extraktion tiefer Merkmale mithilfe mehrerer CNN-Architekturen, die SVM-basierte Klassifizierung und die LIME-basierte Erklärbarkeit für die Vorhersage von Hautläsionen darlegt. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Zusatzdatei 2: Algorithmus 2. Arbeitsablauf des LIME-basierten lokalen Erklärungsverfahrens, der die Generierung von Superpixeln, die Stichprobenerhebung durch Perturbation, den Aufbau des Surrogatmodells und die Visualisierung der Bildbereiche veranschaulicht, die am stärksten zur Klassifizierungsentscheidung beitragen. Bitte klicken Sie hier, um diese Datei herunterzuladen.