Confronto con i metodi di base
Per valutare il framework RareCode, sono stati selezionati diversi metodi rappresentativi di UAD come basi di confronto, comprendendo metodi basati sulla ricostruzione (CAE32, VAE12, SAE33, MAE34, PatchSAE35), ricostruzione con memoria aumentata (MemAE36), distillazione della conoscenza (STFPM37), generazione sintetica di anomalie (DRAEM38) ed estrazione di caratteristiche preaddestrate (PatchCore18). La selezione dei metodi di base si è concentrata su approcci addestrabili o applicabili con budget computazionali e assunzioni sui dati comparabili (accesso esclusivamente a campioni normali non etichettati per l'addestramento), garantendo così che le differenze di prestazione riflettano contributi metodologici piuttosto che disparità nella scala dei dati di preaddestramento. Per assicurare un confronto equo, tutti i metodi sono stati valutati utilizzando le stesse suddivisioni dei dati in 5 gruppi, la stessa pipeline di preelaborazione, le stesse metriche di valutazione e lo stesso ambiente computazionale. I modelli sono stati addestrati seguendo lo stesso protocollo UAD utilizzando soltanto campioni normali per l'addestramento, con iperparametri e soglie selezionati sul set di validazione e le prestazioni finali valutate esclusivamente sul set di test trattenuto. Tabella 1 riassume i risultati della validazione incrociata in 5 gruppi, mentre Figura 5 fornisce confronti sotto forma di grafici radar multimetrichi.
Come mostrato in Tabella 1 e Figura 5, RareCode raggiunge prestazioni di rilevamento favorevoli e una stabilità statistica elevata nel dataset CRC. In termini di AUC, RareCode (96,82 ± 0,23%) supera diversi modelli di base basati sulla ricostruzione, inclusi MemAE (94,97 ± 0,81%). L'analisi statistica conferma che RareCode supera tutti i modelli di riferimento basati sulla ricostruzione (test t appaiati, p < 0,05), con un miglioramento rispetto a MemAE che raggiunge la significatività statistica (p < 0,01). RareCode mostra una bassa varianza di prestazione (deviazione standard dello 0,23%), indicativa di una stabilità costante tra le diverse suddivisioni incrociate. L'efficacia limitata di DRAEM, basato su anomalie sintetiche, probabilmente riflette il fatto che semplici strategie di sovrapposizione di texture non riescono a simulare adeguatamente l'atipia patologica complessa.
Per quanto riguarda la specificità, RareCode raggiunge un valore del 58,24 ± 5,99%, superando tutti i metodi di confronto nella riduzione dei tassi di falsi positivi. Questo risultato rappresenta un miglioramento di circa 25 punti percentuali rispetto al modello di riferimento basato esclusivamente sulla ricostruzione (NoCAR, 33,76%), dimostrando il contributo del meccanismo CAR nella riduzione dei falsi positivi. La specificità più bassa di STFPM e PatchCore, che si basano su caratteristiche preaddestrate su immagini naturali, potrebbe riflettere parzialmente il divario tra i domini delle immagini naturali e quelle istopatologiche. Da notare che STFPM e DRAEM mostrano una varianza elevata nella specificità (±33,53% e ±7,09%), con valori di specificità per ciascun fold compresi tra livelli prossimi allo zero e livelli moderati, sollevando preoccupazioni riguardo all'affidabilità del loro utilizzo pratico.
Prestazioni di rilevamento per classe
L'analisi per classe è stata condotta confrontando separatamente i campioni di cancro e di infiammazione con i campioni normali (Tabella 2). RareCode ha ottenuto prestazioni superiori nel rilevamento del cancro (AUC = 99,44 ± 0,12%, recall = 98,13 ± 0,29%, specificità = 94,21 ± 2,22%) rispetto al rilevamento dell'infiammazione (AUC = 94,30 ± 0,44%, recall = 96,55 ± 0,78%, specificità = 60,44 ± 4,34%). Questi risultati suggeriscono che RareCode possa mostrare una maggiore capacità discriminatoria per anomalie maligne rispetto a modificazioni infiammatorie, mentre il confine tra infiammazione e stato normale sembra contribuire in modo significativo alla ridotta specificità complessiva.
Studio di ablazione
Per analizzare i contributi dei componenti chiave all'interno del framework RareCode, sono stati condotti esperimenti di ablazione al fine di valutare l'impatto del meccanismo CAR e del modulo MHC sulle prestazioni di rilevamento. I risultati sono riportati in Tabella 3. Come mostrato in Figura 6A, l'aggiunta di CAR al baseline basato esclusivamente sulla ricostruzione ha migliorato l'AUC dal 92,81% al 95,92%, e la fusione del codebook a più scale ha ulteriormente aumentato l'AUC al 96,82%. Figura 6B mostra che il CAR ha migliorato anche la specificità, aumentandola dal 33,76% del baseline NoCAR al 58,24% nel modello completo FourScales. Questi risultati confermano il valore complementare della rarità nell'attivazione del codebook e della fusione a più scale.
Inoltre, è stata effettuata un'analisi di ablazione relativa alla complessità del decodificatore utilizzando la configurazione FourScales. Come mostrato nella Tabella 3, la variante con decodificatore complesso, dotata di blocchi di convoluzione depthwise multi-risoluzione e moduli di attenzione basati su convoluzioni (CBAM), ha ottenuto un AUC inferiore rispetto al modello FourScales di base (95,17 ± 0,44% contro 96,82 ± 0,23%). Questo risultato suggerisce che, nell'ambito dell'attuale impostazione RareCode basata su VQ-AE, l'aumento della capacità del decodificatore non ha migliorato le prestazioni nel rilevamento delle anomalie e potrebbe ridurre l'efficacia della rappresentazione vincolata dalla codebook.
Analisi gerarchica della risposta spaziale
Per esaminare le risposte spaziali generate da RareCode, gli errori di ricostruzione a livello di patch e le mappe di rarità del codebook sono stati aggregati a livello di immagine e confrontati tra campioni normali e anomali. Il rapporto energetico, la d di Cohen e l'AUC sono stati utilizzati per quantificare la separazione della risposta a livello di immagine. I risultati dettagliati sono presentati nella Tabella 4 e nella Figura 7 e Figura 8.
I risultati mostrano che i punteggi di rarità del codebook a tutte le scale presentano un aumento della risposta su campioni anomali (rapporti energetici > 1). I codebook con capacità inferiore (Codebook 64) raggiungono una discriminazione più forte a livello di localizzazione (AUC del 78,79%), in linea con l'aspettativa che tassi di compressione più elevati favoriscano l'apprendimento di modelli prototipici più astratti, maggiormente sensibili alle deviazioni dai prototipi normali dei tessuti. L'errore di ricostruzione da solo offre una notevole capacità di rilevamento delle anomalie (AUC del 93,31%), mentre i punteggi CAR forniscono segnali complementari derivanti dalla dimensione della frequenza semantica.
L'esame qualitativo di Figura 7 ha mostrato che le risposte elevate nei campioni tumorali si sovrapponevano a ghiandole irregolari e affollate, ingrandimento nucleare, ipercromasia, pseudostratificazione e perdita della polarità epiteliale. Nei campioni infiammatori, risposte più intense sono state osservate intorno a cripte distorti e infiltrati densi di cellule infiammatorie. Le codice a capacità inferiore tendevano a catturare deviazioni architetturali più ampie, mentre le codice a capacità superiore producevano risposte più localizzate a livello cellulare. Questi risultati forniscono un'interpretazione morfologica qualitativa, ma non una validazione a livello di pixel.
Analisi dei parametri di fusione
Il peso di fusione α bilancia i contributi dell'errore di ricostruzione spaziale e del punteggio CAR nel punteggio di anomalia finale. I valori ottimali di α per ciascun fold sono stati determinati mediante una ricerca a griglia (dimensione del passo 0,05) sui set di validazione, con i risultati presentati nella Tabella 5 e Figura 9. I valori ottimali di α si concentrano principalmente nell'intervallo 0,85-0,95, con una media di 0,90 ± 0,05. In condizioni ottimali, il modello raggiunge un AUC medio del 96,82 ± 0,23% sui set di test. Pesi ottimali più elevati (circa 0,90) indicano che i punteggi CAR contribuiscono maggiormente al rilevamento finale rispetto all'errore di ricostruzione, mentre l'errore di ricostruzione fornisce vincoli locali ausiliari. Rispetto al caso α = 0 nell'analisi di sensibilità (AUC = 93,29%), l'impostazione di fusione selezionata tramite validazione ha migliorato l'AUC di circa 3,53 punti percentuali.
Per riassumere, questo studio presenta il framework RareCode per il rilevamento non supervisionato di anomalie in immagini istopatologiche, con l'obiettivo di mitigare il problema dell'identity-mapping riscontrato dai modelli generativi tradizionali. Il meccanismo CAR riduce l'eccessiva dipendenza dagli errori di ricostruzione a livello di pixel, mentre il modulo MHC fornisce rappresentazioni gerarchiche delle caratteristiche a diverse granularità, consentendo una discriminazione complementare delle anomalie a diversi livelli di astrazione. Gli esperimenti effettuati sul dataset CRC dimostrano che RareCode raggiunge un AUC del 96,82%, con un'analisi per classe che mostra un efficace rilevamento del cancro (AUC = 99,44%) e una discriminazione più forte per il cancro rispetto all'infiammazione, suggerendo che l'overlap tra infiammazione e normale rimane una sfida significativa. Gli studi di ablazione confermano che l'integrazione di caratteristiche semantiche discrete da VQ con rappresentazioni morfologiche del tessuto a più scale migliora le prestazioni di rilevamento. L'elevato richiamo (recall) di RareCode (98,40%) e la specificità moderata (58,24%) indicano il suo potenziale come strumento di pre-screening per la selezione di immagini istopatologiche sospette; tuttavia, il suo effetto reale sul carico di lavoro del patologo richiederà una valutazione prospettica del flusso di lavoro.
Disponibilità dei dati:
Il dataset di immagini istopatologiche di CRC utilizzato in questo studio è stato ottenuto dall'Ospedale Popolare di Shenzhen in base all'approvazione etica istituzionale (Numero di approvazione LL-KY-2025300-01). A causa della privacy dei pazienti e delle politiche istituzionali sulla condivisione dei dati, il dataset non è disponibile pubblicamente. L'accesso può essere concesso previa richiesta motivata all'autore corrispondente, soggetto all'approvazione istituzionale e a accordi sull'utilizzo dei dati. Il codice sorgente del framework RareCode è disponibile pubblicamente all'indirizzo https://github.com/XL-alg/RareCode.

Figura 1: Architettura generale e flusso dei dati del framework RareCode. A 512 × 512 H&L'immagine istopatologica colorata con ematossilina ed eosina viene suddivisa in 32 aree non sovrapposte × 32 e 64 × 64 patch come input a scala fine e grossolana. I due rami codificano i patch in embedding latenti, applicano la discretizzazione mediante Codebook Gerarchica Multiscala (MHC) e ricostruiscono i patch per calcolare i punteggi di errore di ricostruzione. In parallelo, il meccanismo di Rarità dell'Attivazione del Codebook (CAR) stima la rarità semantica a partire dai profili di frequenza di attivazione del codebook appresi dai campioni normali di addestramento. I punteggi di ricostruzione e CAR, opportunamente normalizzati, vengono quindi combinati per generare il punteggio finale di anomalia a livello di immagine, mentre le risposte a livello di patch vengono proiettate nuovamente sul piano dell'immagine per una localizzazione gerarchica. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Meccanismo di quantizzazione vettoriale multiscala. (A) Calcolo della distanza tra le caratteristiche in uscita dall'encoder e i vettori di incorporamento del codebook. (B) Selezione del vicino più prossimo e fusione pesata attraverso codebook con capacità di 64, 128, 256 e 512. (C) Ricostruzione a partire da caratteristiche quantizzate mediante un decoder convoluzionale trasposto. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Meccanismo di calcolo del punteggio CAR. Questa figura illustra quattro fasi: Fase 1: le statistiche sulla frequenza di attivazione vengono calcolate esclusivamente su campioni normali di addestramento. Fase 2: i campioni di test ottengono indici di attivazione e distanze attraverso l'encoder e la quantizzazione vettoriale. Fase 3: vengono calcolati punteggi di rarità e punteggi di distanza in base ai profili di frequenza del set di addestramento. Fase 4: i punteggi provenienti da ciascuna scala della codebook vengono combinati mediante pesi apprendibili per produrre il punteggio CAR finale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Composizione del dataset CRC e protocollo sperimentale. (A–C) Esempio di H&Immagini istopatologiche colorate con ematossilina ed eosina (H&E) di tessuto colorettale normale, cancro del colon-retto e infiammazione colorettale.DProtocollo di cross-validation a 5 ripetizioni per UAD, in cui i campioni normali sono stati utilizzati per l'addestramento e la validazione, mentre i campioni normali e anomali tenuti in riserva sono stati utilizzati per il test. Le immagini sono state digitalizzate a un ingrandimento di 40x e suddivise in ritagli di dimensioni 32 x 32 e 64 x 64. Il verde, il verde chiaro e l'arancione indicano rispettivamente i set di addestramento, validazione e test. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Grafico a ragnatela con confronto multiplo tra metodi di rilevamento delle anomalie. Grafico a ragnatela che confronta RareCode con metodi di riferimento in base ad AUC, precisione media (AP), punteggio F1, precisione, richiamo e precisione al 90% di richiamo (P@R90). Tutti i valori rappresentano la prestazione media ottenuta con una validazione incrociata a 5 ripiegamenti. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Analisi del contributo incrementale dei componenti dello studio di ablazione. (A) Confronto delle prestazioni in termini di AUC che mostra il miglioramento progressivo dalla baseline basata esclusivamente sulla ricostruzione (NoCAR) fino alle configurazioni con codebook singolo e multi-scala. (B) Confronto delle prestazioni in termini di specificità che dimostra l'effetto del meccanismo CAR sulla riduzione dei falsi positivi. Tutte le barre di errore rappresentano la deviazione standard (SD) calcolata su una validazione incrociata a 5 ripetizioni. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Mappe termiche gerarchiche di localizzazione basate su codebook multi-livello. Sono mostrati esempi rappresentativi per campioni di tipo (A) normale, (B) tumorale e (C) infiammatorio. Ogni riga include l'immagine originale, la sovrapposizione, la mappa dell'errore di ricostruzione, le mappe del punteggio di rarità provenienti da codebook di diverse capacità (64, 128, 256 e 512) e la mappa finale di localizzazione fusa. I codebook con capacità inferiore evidenziano pattern a grana più grossolana grazie a un'astrazione più spinta derivante dalla compressione, mentre i codebook con capacità maggiore preservano dettagli strutturali più fini. Le regioni con risposta elevata corrispondono qualitativamente a caratteristiche istopatologiche associate al cancro o all'infiammazione, ma non sono state validate mediante annotazioni esperte a livello di pixel. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Istogrammi di distribuzione di diversi tipi di punteggio. Gli istogrammi confrontano le distribuzioni dei punteggi tra campioni normali e anomali per (A) errore di ricostruzione, (B) punteggio CAR combinato, (C) Codebook 64, (D) Codebook 128, (E) Codebook 256 e (F) Codebook 512. Gli istogrammi verdi e rossi indicano rispettivamente campioni normali e anomali. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9: Analisi della sensibilità del parametro alfa. (A) AUC del set di validazione utilizzata per la selezione di α. (B) AUC del set di test in corrispondenza di diversi valori di α. I valori di α selezionati mediante validazione sono compresi tra 0,85 e 0,95, con una media di 0,90 ± 0,05, coerentemente con quanto riportato nella Tabella 5. La variazione dell’AUC è rimasta inferiore allo 0,5% quando α è variato nell’intervallo [0,70, 1,00], indicando una prestazione stabile su un ampio intervallo di parametri. Cliccare qui per visualizzare una versione ingrandita di questa figura.
| Metodo | AUC (%) | AP (%) | F1 (%) | Precisione (%) | Recupero (%) | Specificità (%) | P@R90 (%) |
| CAE | 90,37 ± 0,94 | 98,62 ± 0,18 | 95,34 ± 0,15 | 91,64 ± 0,40 | 99,35 ± 0,22 | 28,14 ± 3,88 | 95,66 ± 0,32 |
| SAE | 90,58 ± 0,94 | 98,66 ± 0,18 | 95,34 ± 0,15 | 91,67 ± 0,40 | 99,32 ± 0,24 | 28,46 ± 3,97 | 95,71 ± 0,30 |
| VAE | 93,60 ± 0,82 | 99,13 ± 0,12 | 95,86 ± 0,19 | 92,81 ± 0,49 | 99,12 ± 0,29 | 39,07 ± 4,70 | 96,94 ± 0,43 |
| MAE | 91,65 ± 2,75 | 98,76 ± 0,50 | 95,61 ± 0,60 | 92,87 ± 1,56 | 98,55 ± 0,55 | 39,74 ± 14,32 | 96,55 ± 0,97 |
| MemAE | 94,97 ± 0,81 | 99,35 ± 0,11 | 95,78 ± 0,33 | 92,82 ± 1,07 | 98,95 ± 0,60 | 39,15 ± 9,99 | 97,57 ± 0,33 |
| PatchSAE | 94,86 ± 0,36 | 99,34 ± 0,05 | 95,39 ± 0,13 | 92,32 ± 0,27 | 98,67 ± 0,12 | 34,91 ± 2,57 | 98,13 ± 0,24 |
| STFPM | 90,23 ± 3,05 | 98,70 ± 0,44 | 94,32 ± 0,21 | 91,90 ± 3,51 | 97,14 ± 3,38 | 29,82 ± 33,53 | 95,93 ± 1,96 |
| DRAEM | 76,34 ± 2,82 | 95,34 ± 0,90 | 94,19 ± 0,07 | 89,39 ± 0,65 | 99,56 ± 0,65 | 6,19 ± 7,09 | 92,69 ± 0,57 |
| PatchCore | 74,64 ± 1,82 | 94,76 ± 0,55 | 94,73 ± 0,05 | 90,52 ± 0,15 | 99,36 ± 0,12 | 17,49 ± 1,54 | 92,54 ± 0,15 |
| RareCode | 96,82 ± 0,23 | 99,59 ± 0,03 | 96,63 ± 0,15 | 94,93 ± 0,67 | 98,40 ± 0,48 | 58,24 ± 5,99 | 98,80 ± 0,10 |
Tabella 1: Risultati del confronto con i metodi di base (convalida incrociata a 5 fold). Prestazioni di rilevamento di RareCode e di nove metodi UAD di base sul dataset CRC. Le metriche includono AUC, precisione media (AP), richiamo, specificità, punteggio F1, precisione al 90% di richiamo (P@R90) e precisione. Tutti i valori rappresentano la media ± DS calcolata sulla convalida incrociata a 5 fold. I valori in grassetto indicano le migliori prestazioni per ciascuna metrica.
| Categoria | AUC (%) | AP (%) | F1 (%) | Richiamo (%) | Specificità (%) |
| Cancro | 99.44 ± 0.12 | 99.86 ± 0.03 | 98.34 ± 0.17 | 98.13 ± 0.29 | 94.21 ± 2.22 |
| Infiammazione | 94.30 ± 0.44 | 98.48 ± 0.12 | 93.44 ± 0.29 | 96.55 ± 0.78 | 60.44 ± 4.34 |
Tabella 2: Prestazioni di rilevamento per classe attraverso i sottotipi di anomalie. Valutazione separata delle prestazioni di rilevamento di RareCode per campioni di cancro e infiammazione rispetto ai campioni normali. Le metriche per classe, incluse AUC, AP, punteggio F1, richiamo e specificità, sono state calcolate utilizzando soglie ottimali specifiche per ciascuna classe.
| Varianti | Configurazione del codebook | CAR | AUC (%) | AP (%) | F1 (%) | Specificità (%) | P@R90 (%) |
| NoCAR |  |  | 92.81 ± 0.12 | 99.05 ± 0.02 | 95.30 ± 0.08 | 33.76 ± 3.82 | 96.72 ± 0.12 |
| SingleCodebook | [256] |  | 95.92 ± 0.40 | 99.47 ± 0.05 | 96.25 ± 0.14 | 55.37 ± 6.51 | 98.31 ± 0.43 |
| TwoScales | [128, 512] |  | 96.57 ± 0.27 | 99.56 ± 0.04 | 96.45 ± 0.12 | 57.75 ± 4.14 | 98.75 ± 0.12 |
| ThreeScales | [128, 256, 512] |  | 96.36 ± 0.37 | 99.53 ± 0.05 | 96.52 ± 0.17 | 57.99 ± 4.65 | 98.60 ± 0.23 |
| FourScales | [64, 128, 256, 512] |  | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 58.24 ± 5.99 | 98.80 ± 0.10 |
| FourScales + decodificatore complesso | [64, 128, 256, 512] |  | 95.17 ± 0.44 | 99.39 ± 0.06 | 95.32 ± 0.20 | 53.83 ± 21.45 | 98.40 ± 0.37 |
Tabella 3: Risultati dello studio di ablazione. Confronto delle prestazioni delle configurazioni di RareCode con aggiunta progressiva di componenti: baseline basata solo sulla ricostruzione (NoCAR), CAR con un singolo codebook (SingleCodebook) e configurazioni multi-risoluzione (TwoScales, ThreeScales, FourScales). È inclusa anche un'ulteriore analisi di ablazione sulla complessità del decodificatore utilizzando la configurazione FourScales. Le metriche includono AUC, precisione media (AP), punteggio F1, specificità e precisione al 90% di richiamo (P@R90).
| Tipo di punteggio | Rapporto energetico | d di Cohen | AUC (%) |
| Errore di ricostruzione | 2.623 | 2.006 | 93.31 |
| CAR combinato | 1.078 | 1.002 | 74.85 |
| Codebook 64 | 1.109 | 1.207 | 78.79 |
| Codebook 128 | 1.085 | 1.067 | 76.19 |
| Codebook 256 | 1.065 | 0.916 | 72.80 |
| Codebook 512 | 1.064 | 0.833 | 70.38 |
Tabella 4: Analisi a livello di immagine delle risposte derivate dalla localizzazione. Gli errori di ricostruzione mediati sull'immagine e le risposte di rarità del codice sono stati confrontati tra campioni normali e anomali utilizzando il rapporto energetico, il d di Cohen e l'AUC.
| Piega | α ottimale | AUC di validazione (%) | AUC di test (%) |
| 1 | 0.95 | 96,22 | 96,91 |
| 2 | 0,9 | 96,38 | 96,39 |
| 3 | 0,85 | 96,71 | 96,82 |
| 4 | 0,85 | 96,22 | 96,93 |
| 5 | 0,95 | 96,72 | 97,05 |
| Media | 0,90 ± 0,05 | 96,45 ± 0,23 | 96,82 ± 0,23 |
Tabella 5: Valori ottimali di alpha nei diversi fold. Valore ottimale del peso di fusione alpha determinato tramite ricerca a griglia (dimensione del passo 0.05) sui set di validazione per ciascun fold della cross-validazione, con statistiche di media e deviazione standard.