La valutazione delle prestazioni del framework di classificazione sviluppato si basa su misure di valutazione tradizionali derivate dalla matrice di confusione. Una matrice di confusione consente di ottenere una comprensione completa delle prestazioni del classificatore attraverso la rappresentazione del numero di classificazioni corrette e scorrette effettuate per ciascuna classe definita. In questo modo, tutti i tipi di errori possono essere analizzati. Ad esempio, sia i falsi positivi che i falsi negativi sono particolarmente importanti nella diagnosi delle malattie. Valori elevati di falsi positivi possono indicare un'elevata sensibilità del classificatore, ma allo stesso tempo, un'elevata quantità di falsi negativi indica una bassa sensibilità e comporta potenziali rischi per la salute. Le seguenti metriche di prestazione vengono utilizzate in questo articolo: accuratezza, precisione, richiamo (recall), punteggio F1, specificità, tasso di veri positivi (TPR) e tasso di falsi positivi (FPR). Di seguito sono riportate le formule di queste metriche:
Precisione=(VP+VN)/(VP+VN+FP+FN) (3)
Precisione = VP/(VP+FP) (4)
(5)
(6)
(7)
(8)
In questo caso, VP indica il numero di tumori cutanei maligni rilevati dal sistema, mentre VN indica il numero di lesioni benigne. Allo stesso modo, FP rappresenta il numero di decisioni errate in cui le lesioni vengono classificate come maligne nonostante siano in realtà benigne. FN riflette il numero di campioni benigni classificati erroneamente. Per quanto riguarda la classificazione dei tumori della pelle, ridurre al minimo i falsi negativi è estremamente importante a causa degli effetti avversi potenzialmente derivanti da tali errori.
Prestazioni dei modelli di base
Tutti gli esperimenti computazionali sono stati condotti nell'ambiente basato su cloud di Google Colab. Vale la pena notare che questa piattaforma consente di eseguire istanze di macchina virtuale utilizzando un sistema operativo Ubuntu 20.04 predefinito. Per addestrare i modelli di base, sono stati utilizzati Python versione 3.9 e il framework PyTorch versione 2.3.1. Inoltre, tutti i nodi di calcolo avevano specifiche identiche, ovvero una CPU Intel Xeon con una frequenza di 2,2 GHz, una GPU NVIDIA Tesla T4, 16 GB di RAM e una capacità di archiviazione di 70 GB. Pertanto, questa configurazione sperimentale ha permesso di ridurre la variabilità introdotta da diverse piattaforme hardware e di aumentare l'affidabilità e la riproducibilità dei risultati. Un riassunto completo dell'ambiente sperimentale è disponibile in Tabella 3.
Figura 4 mostra le curve di apprendimento corrispondenti a 100 epoche di addestramento per l'architettura ResNet-50. L'addestramento è stato eseguito utilizzando un dataset contenente 2.110 immagini, mentre la dimensione del dataset di validazione era pari a 660 immagini. Come si può osservare, durante l'addestramento l'accuratezza è aumentata costantemente fino a raggiungere quasi il 90,0%. Allo stesso tempo, si è verificato un miglioramento dell'accuratezza nelle prime 50 epoche; dopo questo punto, l'accuratezza è diventata quasi costante, il che può essere considerato un segno di convergenza del modello. Per la validazione, il modello ha mostrato un valore AUC pari all'86,0%, dimostrando così proprietà discriminative ragionevoli.
La matrice di confusione presentata in Figura 5 descrive le prestazioni del modello ResNet-50 in termini di accuratezza nella classificazione per un insieme di test composto da 660 immagini. Durante la valutazione, il modello ha correttamente riconosciuto 310 su 360 campioni benigni e 239 su 300 campioni maligni. Tuttavia, un numero relativamente elevato di campioni maligni è stato classificato in modo errato, determinando un valore relativamente alto di falsi negativi. Questo risultato dovrebbe essere analizzato più approfonditamente a causa delle gravi implicazioni di questo tipo di errore nell'uso pratico del classificatore. In totale, il modello ha raggiunto un'accuratezza del 83,0%, con una precisione dell'83,3%, un richiamo dell'83,3% e un punteggio F1 dell'83,3%.
Tabella 4 contiene una descrizione dettagliata delle caratteristiche prestazionali del modello ResNet-50 in riferimento a entrambe le classi. Il classificatore ha mostrato un comportamento relativamente bilanciato in termini di precisione: per i campioni benigni, il valore era pari all'83,0%, mentre per i campioni maligni la precisione è risultata dell'84,0%. Analogamente, i valori di richiamo (recall) hanno raggiunto l'88,0% per le lesioni benigne e il 78,0% per quelle maligne. Il supporto indicato in tabella rappresenta il numero di campioni corrispondenti a ciascuna classe.
Modello EDLF-SLC proposto
Figura 6 illustra l'AUC di addestramento e di validazione del modello proposto su 300 epoche. La metrica AUC riflette la capacità del modello di distinguere tra classi benigne e maligne, con valori più elevati che indicano prestazioni discriminatorie migliori. Come osservato, l'AUC di addestramento aumenta costantemente durante il processo di apprendimento, raggiungendo un valore massimo di 1.00 all'incirca all'epoca 200. L'AUC di validazione migliora anch'essa progressivamente nelle fasi iniziali dell'addestramento; tuttavia, inizia a stabilizzarsi dopo circa 150 epoche, suggerendo una convergenza del modello. L'AUC finale di validazione pari a 0,95 dimostra una forte capacità di generalizzazione e una efficace separabilità delle classi.
La matrice di confusione del modello proposto, presentata in Figura 7, mostra che il modello ha correttamente classificato 299 campioni benigni e 272 campioni maligni, mentre ha erroneamente classificato 28 casi benigni come maligni e 61 casi maligni come benigni. In totale, il modello ha ottenuto 571 previsioni corrette e 89 errori di classificazione. In particolare, l'elevato numero di falsi negativi (casi maligni classificati erroneamente come benigni) evidenzia un limite critico, poiché tali errori potrebbero avere significative implicazioni cliniche. Tuttavia, la prestazione complessiva nella classificazione rimane robusta. A differenza degli approcci di selezione delle caratteristiche che rimuovono intenzionalmente alcune dimensioni prima della classificazione, il framework proposto preserva l'intera rappresentazione profonda fusa generata da diverse architetture CNN eterogenee. Questa scelta progettuale è stata adottata perché ciascun modello di base estrae caratteristiche complementari della lesione, e mantenere l'intera rappresentazione consente al classificatore SVM di sfruttare l'informazione discriminante combinata senza escludere caratteristiche potenzialmente informative. Di conseguenza, la strategia di fusione delle caratteristiche adottata privilegia l'apprendimento di rappresentazioni complementari mantenendo la fattibilità computazionale.
Figura 8 presenta esempi rappresentativi di risultati di classificazione prodotti dal modello proposto. I risultati dimostrano che il modello assegna punteggi di confidenza elevati alle istanze classificate correttamente. In particolare, i casi benigni mostrano alte probabilità predette (ad esempio, 99,84% e 99,85%), mentre i casi maligni presentano anch'essi livelli di confidenza elevati (ad esempio, 99,98% e 99,96%). Questi risultati indicano che il modello è in grado di distinguere efficacemente tra lesioni benigne e maligne, anche in scenari visivamente complessi. Per migliorare l'interpretabilità, il framework LIME viene utilizzato per generare spiegazioni localizzate delle predizioni del modello, come mostrato in Figura 9A–D. LIME approssima il confine decisionale complesso del modello utilizzando un modello lineare localmente interpretabile. Per ogni immagine in ingresso, il metodo genera campioni perturbati mascherando selettivamente i superpixel e valutando le corrispondenti predizioni. Viene quindi adattato un modello lineare pesato a questi campioni, in cui i pesi sono determinati in base alla vicinanza all'ingresso originale mediante un kernel a funzione base radiale. I coefficienti risultanti rappresentano il contributo di ciascun superpixel alla predizione finale e sono definiti come:
(9)
dove Xj ∈ {0, 1} indica la presenza o l'assenza del j-esimo superpixel, Bj rappresenta il peso di contributo corrispondente e B0 è la previsione di base. Coefficienti positivi (Bj > 0) indicano regioni che contribuiscono alla classe maligna, mentre coefficienti negativi (Bj < 0) corrispondono a caratteristiche benigne. Le visualizzazioni basate su LIME, mostrate in Figura 9B, D, evidenziano le regioni più influenti nel contribuire a ciascuna decisione di classificazione. Per lesioni benigne, il modello enfatizza regioni caratterizzate da pigmentazione uniforme e bordi ben definiti. Al contrario, nei casi maligni, le regioni evidenziate corrispondono a caratteristiche clinicamente significative come bordi irregolari, eterogeneità cromatica e trame atipiche. L'intensità delle regioni evidenziate riflette l'entità dei coefficienti corrispondenti Bj.
Questi risultati dimostrano che il modello EDLF-SLC si concentra su caratteristiche clinicamente significative che sono in linea con criteri dermatologici consolidati, come la regola ABCD. Questa coerenza migliora l'interpretabilità e l'affidabilità del modello, rendendolo più adatto a supportare decisioni cliniche. Inoltre, Figura 10 presenta risultati visivi comparativi ottenuti utilizzando ulteriori tecniche di spiegabilità, tra cui Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM ed EigenCAM, ulteriormente confermando la coerenza delle regioni rilevanti identificate attraverso diversi metodi. Per quanto riguarda le prestazioni del modello proposto EDLF-SLC e di sette modelli di base dopo l'addestramento per 100 epoche, un confronto è visibile in Tabella 5. EDLF-SLC ha ottenuto prestazioni competitive pari a 0,88 su ciascuna metrica valutata, rispetto alle architetture di base analizzate nel contesto sperimentale. EfficientNetB0 e ResNet50 hanno ottenuto anch'essi buoni risultati, con accuratezze rispettivamente di 0,85 e 0,83. Al contrario, Inception-ResNetV2 ha mostrato le prestazioni peggiori in termini di classificazione tra i modelli valutati. D'altro canto, nonostante un'accuratezza di classificazione relativamente più bassa, la sua efficienza computazionale è risultata comunque paragonabile a quella dei modelli di base. Il modello proposto EDLF-SLC ha dimostrato prestazioni competitive rispetto ai modelli di base valutati nelle condizioni sperimentali adottate.
Per valutare le prestazioni del framework proposto rispetto agli approcci esistenti, Tabella 6 presenta un confronto con metodi rappresentativi allo stato dell'arte per la classificazione delle lesioni cutanee. Ad esempio47, ha riportato un'accuratezza di 0,86, mentre48 ha utilizzato un modello basato su ensemble che ha raggiunto un'accuratezza simile ma precisione, richiamo e punteggio F1 inferiori. Studi recenti basati sull'apprendimento ensemble e su molteplici architetture CNN25,49 hanno riportato accuratezze fino a 0,87. Nelle condizioni sperimentali adottate, il framework EDLF-SLC proposto ha raggiunto un'accuratezza di 0,88 utilizzando un'architettura unificata interpretabile, senza richiedere componenti aggiuntivi come modelli di segmentazione delle lesioni.
DISPONIBILITÀ DEI DATI
I dati che supportano i risultati di questo studio sono disponibili pubblicamente su Kaggle all'indirizzo https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

Figura 1: Immagini dermatoscopiche rappresentative del dataset ISIC che illustrano le due classi diagnostiche utilizzate in questo studio. I campioni sono etichettati come benigni (0) e maligni (1), evidenziando la variabilità nella morfologia, colore e trama delle lesioni all'interno del dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Flusso di lavoro completo del framework EDLF-SLC proposto. Il protocollo inizia con l'acquisizione delle immagini da ISIC 2020, seguita da pre-elaborazione, aumento dei dati, partizionamento del dataset, estrazione di caratteristiche profonde mediante quattro architetture CNN pre-addestrate, fusione delle caratteristiche, classificazione tramite SVM, valutazione delle prestazioni e generazione di spiegazioni basate su LIME. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Esempi di immagini di lesioni cutanee aumentate generate mediante tecniche di aumento dei dati. Queste includono inversione orizzontale e verticale, rotazione, ridimensionamento e regolazione della luminosità. Queste trasformazioni aumentano la diversità del dataset, migliorano la robustezza del modello e riducono il rischio di overfitting durante l'addestramento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Area sotto la curva caratteristica operativa del ricevitore (ROC-AUC) per il training e la validazione del modello ResNet-50 su 100 epoche di training. La curva blu rappresenta l'AUC del training, mentre la curva arancione rappresenta l'AUC della validazione. Le curve mostrano una rapida convergenza durante le prime epoche di training, seguita da un'ottimizzazione stabile con prestazioni di validazione costantemente elevate, indicando un apprendimento efficace e una generalizzazione soddisfacente sul dataset di validazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Matrice di confusione del modello ResNet-50 sul dataset di test. Le righe rappresentano le etichette delle classi reali (0 = benigno, 1 = maligno), mentre le colonne rappresentano le etichette delle classi previste. Gli elementi sulla diagonale indicano i campioni correttamente classificati (310 benigni e 239 maligni), mentre gli elementi fuori dalla diagonale rappresentano i campioni classificati in modo errato, inclusi 50 falsi positivi e 61 falsi negativi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Curva caratteristica operativa del ricevitore (ROC-AUC) per l'addestramento e la validazione del modello EDLF-SLC proposto su 300 epoche di training. La curva blu rappresenta l'AUC di addestramento, mentre la curva arancione rappresenta l'AUC di validazione. Il modello mostra una rapida convergenza durante le prime epoche di addestramento, seguita da un'ottimizzazione stabile con valori costantemente elevati di AUC per l'addestramento e la validazione nel corso delle epoche rimanenti. La performance sostenuta nella validazione dimostra una buona capacità di generalizzazione e un comportamento di apprendimento stabile del framework EDLF-SLC proposto sul dataset di validazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Matrice di confusione del modello EDLF-SLC proposto sul dataset di test. Le righe rappresentano le etichette delle classi reali (0 = benigno, 1 = maligno), mentre le colonne rappresentano le etichette delle classi previste. Gli elementi sulla diagonale indicano i campioni correttamente classificati (299 benigni e 272 maligni), mentre gli elementi fuori diagonale corrispondono ai campioni classificati in modo errato, inclusi 61 falsi positivi e 28 falsi negativi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Esempi di previsioni generate dal modello EDLF-SLC proposto. Questa figura illustra i livelli di confidenza nella classificazione per lesioni benigne e maligne e dimostra la capacità discriminativa del modello. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9: Spiegazioni locali basate su LIME del modello EDLF-SLC proposto. La figura evidenzia le regioni di superpixel più influenti nel determinare le decisioni di classificazione del modello. (A) Immagine dermoscopica originale di una lesione cutanea benigna. (B) Spiegazione LIME per la lesione benigna, con superpixel evidenziati che indicano le aree che hanno contribuito maggiormente alla previsione di tipo benigno. (C) Immagine dermoscopica originale di una lesione cutanea maligna. (D) Spiegazione LIME per la lesione maligna, che mostra le regioni discriminative di superpixel che hanno influenzato prevalentemente la classificazione come maligna. I contorni gialli delimitano i superpixel influenti identificati da LIME, mentre le aree grigie rappresentano zone con contributo minimo alla previsione. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 10: Confronto tra metodi di interpretabilità basati sulla mappatura dell'attivazione di classe (CAM) applicati al modello EDLF-SLC proposto. La figura confronta le mappe di localizzazione generate da GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM ed EigenCAM per la stessa immagine dermatoscopica. Il primo pannello mostra l'immagine iniziale di input, seguita dalle corrispondenti mappe di attivazione grezze e dalle sovrapposizioni di mappa termica prodotte da ciascun metodo di interpretabilità. Le visualizzazioni illustrano le differenze nella localizzazione spaziale e mettono in evidenza le regioni dell'immagine che contribuiscono maggiormente alla decisione di classificazione del framework EDLF-SLC proposto. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Rif. | Anno | Dataset | Dimensione dei dati | Estrazione delle caratteristiche | Metodo | Precisione |
| 9 | 2022 | Dataset HAM10000 | 10015 immagini di lesioni cutanee | Caratteristiche di colore e forma | Algoritmi di ML e modelli di reti neurali convoluzionali | 95,1% |
| 19 | 2023 | Dataset PH2 | 200 immagini annotate | Caratteristiche di asimmetria, striature, punti/globuli, aree di regressione | Modelli di ML | 94,0% |
| 30 | 2024 | Dataset HAM10000 | 10000 immagini | Caratteristiche di colore e forma | S-MobileNet | 97,7% |
| 28 | 2025 | Dataset ISIC2020 e HAM10000 | ISIC2020 (12.670 immagini) e HAM10000 (10.015 immagini) | Colore e forma | Rete residuale-Reti neurali ricorrenti a lungo termine (R-LSTM50) | 95,7% (ISIC2020); 94,2% (HAM10000) |
| 32 | 2026 | Dataset di lesioni cutanee da monkeypox (MSLD) | 770 immagini | Contesto e trama | DenseNet121, Xception, InceptionV3 e CBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38.569 immagini | Contesto e trama | MobileNet, ResNet50, InceptionV3 ed EfficientNet | 93,6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 immagini | Contesto e spaziale | Apprendimento profondo multimodale basato su CNN-transformer | 98,71% |
| 41 | 2026 | ISIC 2019 | 25.000 immagini | Contesto e trama | TransXV2S | 95,26% |
| 42 | 2025 | HAM10000 | 10.015 immagini | Colore e forma | ViT con YOLOv8 | 93% |
Tabella 1: Confronto con la letteratura. Riepilogo di alcuni lavori pubblicati di recente che utilizzano algoritmi di apprendimento profondo per la classificazione delle lesioni cutanee.
| Dataset | Benigno | Maligno | Totale |
| Dati di addestramento | 1440 | 1197 | 2637 |
| Dati di test | 360 | 300 | 660 |
| Dati totali | 1800 | 1497 | 3297 |
Tabella 2: Distribuzione del dataset. Distribuzione dei campioni benigni e maligni nel dataset ISIC 2020, inclusa la suddivisione in training e testing.
| Componente | Specifica |
| Sistema operativo | Ubuntu 20.04 |
| Linguaggio di programmazione | Python 3.9 |
| Framework di apprendimento profondo | PyTorch 2.3.1 |
| Ottimizzatore | Adam |
| Programmazione del tasso di apprendimento | 1e−3 |
| Numero di epoche | 100/300 |
| CPU | 2 vCPU 2.2 GHz |
| GPU | Tesla T4 (16 GB) × 1 |
| RAM | 16 GB |
| Parametri addestrabili | 2.430.353 (9,27 MB) |
| Parametri non addestrabili | 133.434.397 (509,01 MB) |
Tabella 3: Specifiche del sistema. Specifiche dettagliate dell'ambiente computazionale, inclusi i framework software e le risorse hardware utilizzate per l'addestramento e la valutazione del modello.
| Classe | Precisione | Recupero | Punteggio F1 | Supporto |
| Classe benigna | 0.83 | 0.88 | 0.85 | 360 |
| Classe maligna | 0.84 | 0.78 | 0.81 | 300 |
| Accuratezza | - | - | 0.832 | 660 |
| Media macro | 0.84 | 0.83 | 0.83 | 660 |
| Media pesata | 0.84 | 0.83 | 0.83 | 660 |
Tabella 4: Rapporto di classificazione. Prestazioni di classificazione del modello ResNet-50 sul set di dati di test, compresi precisione, richiamo, punteggio F1 e supporto per ciascuna classe.
| Modello | Precisione | Accuratezza | Richiamo | Punteggio F1 | Tempo (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
Tabella 5: Confronto delle prestazioni del modello. Confronto delle prestazioni del modello EDLF-SLC proposto e dei modelli di apprendimento profondo di riferimento in termini di accuratezza, precisione, richiamo, punteggio F1 e tempo computazionale.
| Modello | Accuratezza | Precisione | Recupero | Punteggio F1 |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 con SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| Modelli DL ibridi + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| Modelli DL ibridi + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| EDLF-SLC proposto | 0.88 | 0.89 | 0.87 | 0.88 |
Tabella 6: Metriche di confronto tra modelli. Confronto delle prestazioni tra il framework EDLF-SLC proposto e approcci recenti allo stato dell'arte per la classificazione delle lesioni cutanee.
File Supplementare 1: Algoritmo 1. Flusso di lavoro del framework EDLF-SLC proposto, che illustra la pre-elaborazione dei dati, l'estrazione di caratteristiche profonde mediante l'utilizzo di diverse architetture CNN, la classificazione basata su SVM e l'interpretazione basata su LIME per la previsione delle lesioni cutanee. Cliccare qui per scaricare questo file.
File Supplementare 2: Algoritmo 2. Flusso di lavoro del processo di spiegazione locale basato su LIME, che illustra la generazione di superpixel, il campionamento mediante perturbazione, la costruzione del modello surrogato e la visualizzazione delle regioni dell'immagine che contribuiscono maggiormente alla decisione di classificazione. Cliccare qui per scaricare questo file.