Vergelijking met basismethoden
Om het RareCode-framework te evalueren, werden meerdere representatieve UAD-methoden geselecteerd als basismethoden, variërend van reconstructie-gebaseerde methoden (CAE32, VAE12, SAE33, MAE34, PatchSAE35), geheugenversterkte reconstructie (MemAE36), kennisdistillatie (STFPM37), synthetische anomaliegeneratie (DRAEM38) en vooraf getrainde functie-extractie (PatchCore18). De selectie van basismethoden richtte zich op methoden die kunnen worden getraind of toegepast binnen vergelijkbare computationele budgetten en data-aannames (alleen toegang tot ongelabelde normale trainingsmonsters), zodat prestatieverschillen methodologische bijdragen weerspiegelen in plaats van verschillen in de omvang van vooraf getrainde data. Om een eerlijke vergelijking te waarborgen, werden alle methoden beoordeeld met dezelfde 5-voudige data-opdeling, dezelfde preprocessing-pijplijn, dezelfde evaluatiemetingen en in dezelfde computationele omgeving. Modellen werden getraind volgens hetzelfde UAD-protocol, gebruikmakend van alleen normale trainingsmonsters, waarbij hyperparameters en drempelwaarden werden geselecteerd op de validatieset en de uiteindelijke prestaties uitsluitend werden beoordeeld op de apart gehouden testset. Tabel 1 vat de resultaten van 5-voudige kruisvalidatie samen, en Figuur 5 biedt vergelijkingen in multi-metrische radardiagrammen.
Zoals weergegeven in Tabel 1 en Figuur 5, bereikt RareCode gunstige prestaties qua detectie en statistische stabiliteit op de CRC-dataset. Wat betreft AUC, RareCode (96,82 ± 0,23%) presteert beter dan meerdere op reconstructie gebaseerde basismodellen, inclusief MemAE (94,97 ± 0,81%). Statistische analyse bevestigt dat RareCode alle op reconstructie gebaseerde basismodellen overtreft (gepaarde t-toetsen, p < 0,05), waarbij de verbetering ten opzichte van MemAE statistisch significant was (p < 0,01). RareCode vertoont een lage prestatievariantie (standaardafwijking van 0,23%), wat wijst op consistente stabiliteit over de verschillende validatievouwen heen. De beperkte effectiviteit van DRAEM, gebaseerd op synthetische afwijkingen, weerspiegelt waarschijnlijk het feit dat eenvoudige textuur-overlaystrategieën niet voldoende in staat zijn complexe pathologische atypieën adequaat te simuleren.
Wat betreft specificiteit bereikt RareCode 58,24 ± 5,99%, wat beter presteert dan alle vergelijkingsmethoden bij het verlagen van het percentage fout-positieve resultaten. Dit vertegenwoordigt een verbetering van ongeveer 25 procentpunten ten opzichte van de baseline die alleen reconstructie gebruikt (NoCAR, 33,76%), wat de CAR-mechanisme demonstreert's bijdrage aan het verminderen van valse positieven. De lagere specificiteit van STFPM en PatchCore, die afhankelijk zijn van kenmerken die zijn getraind op natuurlijke beelden, weerspiegelt mogelijk gedeeltelijk de domeingap tussen natuurlijke en histopathologische afbeeldingen. Opvallend is dat STFPM en DRAEM een hoge specificiteitsvariantie vertonen±33,53% en ±7,09%), waarbij de specificiteit per fold varieert van bijna nul tot matige niveaus, hetgeen zorg wekt over hun betrouwbaarheid bij toepassing.
Prestaties van detectie per klasse
Per klasse-analyse werd uitgevoerd door kanker- en ontstekingsmonsters afzonderlijk te vergelijken met normale monsters (Tabel 2). RareCode behaalde een betere prestatie voor de detectie van kanker (AUC = 99,44 ± 0,12%, herroeping = 98,13 ± 0,29%, specificiteit = 94,21 ± 2,22%) dan voor de detectie van ontsteking (AUC = 94,30 ± 0,44%, herinnering = 96,55 ± 0,78%, specificiteit = 60,44 ± 4,34%). Deze bevindingen suggereren dat RareCode een sterker onderscheid kan tonen voor maligne afwijkingen dan voor inflammatoire veranderingen, terwijl de grens tussen inflammatie en normaal weefsel aanzienlijk bijdraagt aan de verlaagde algehele specificiteit.
Ablatiestudie
Om de bijdragen van de belangrijke componenten binnen het RareCode-kader te onderzoeken, zijn ablatie-experimenten uitgevoerd om het effect van het CAR-mechanisme en de MHC-module op de detectieprestaties te beoordelen. De resultaten zijn beschreven in Tabel 3. Zoals weergegeven in Figuur 6A, het toevoegen van CAR aan de alleen-reconstructie-basellijn verbeterde de AUC van 92,81% naar 95,92%, en multi-schaal codebook-fusie verhoogde de AUC verder naar 96,82%. Figuur 6B laat zien dat CAR ook de specificiteit verbeterde, deze verhogend van 33,76% in de NoCAR-basellijn naar 58,24% in het volledige FourScales-model. Deze resultaten ondersteunen de aanvullende waarde van zeldzaamheid van codebook-activatie en multi-schaalfusie.
Daarnaast is een decoder-complexiteitsafbraak uitgevoerd met behulp van de FourScales-configuratie. Zoals weergegeven in Tabel 3, de complex-decoder variant met multi-schaal depthwise convolutieblokken en Convolutional Block Attention Modules (CBAM) liet een lagere AUC zien dan het basismodel FourScales (95,17 ± 0,44% versus 96,82 ± 0,23%). Dit resultaat suggereert dat, binnen de huidige VQ-AE-gebaseerde RareCode-instelling, het vergroten van de decodercapaciteit de prestaties van anomaliedetectie niet verbeterde en de effectiviteit van de codebook-beperkte representatie mogelijk verlaagde.
Hiërarchische ruimtelijke responsanalyse
Om de ruimtelijke responsen te onderzoeken die worden gegenereerd door RareCode, werden op vlak van afbeelding de reconstructiefouten op patch-niveau en de zeldzaamheidskaarten van de codebook geaggregeerd en vergeleken tussen normale en afwijkende monsters. Energieverhouding, Cohen's d en AUC werden gebruikt om de responsafscheiding op beeldniveau te kwantificeren. Gedetailleerde resultaten zijn gepresenteerd in Tabel 4 en Figuur 7 en Figuur 8.
De resultaten tonen aan dat codebook-rariteitscores op alle schalen een verhoogde respons vertonen bij anomalieën (energieverhoudingen > 1). Codeboeken met een kleinere capaciteit (Codeboek 64) bereiken een betere differentiatie op lokalisatieniveau (78,79% AUC), wat overeenkomt met de verwachting dat hogere compressietarieven het leren van meer abstracte, prototypische patronen bevorderen die gevoeliger zijn voor afwijkingen van normale weefselarchetypen. Reconstructiefout alleen biedt een aanzienlijke capaciteit voor het detecteren van afwijkingen (93,31% AUC), terwijl CAR-scores aanvullende signalen leveren uit de semantische frequentiedimensie.
Kwalitatief onderzoek van Figuur 7 toonde aan dat verhoogde responsen in kankerspecimens overlaptten met onregelmatige en dichte klieren, nucleaire vergroting, hyperchromasie, pseudostratificatie en verlies van epitheliale polariteit. In inflammatoire monsters werden sterkere responsen waargenomen rond vervormde klieren en dichte infiltraten van ontstekingscellen. Codeboeken met een lagere capaciteit neigden ernaar bredere architectonische afwijkingen vast te leggen, terwijl codeboeken met een hogere capaciteit meer gelokaliseerde, op cellulair niveau gerichte responsen opleverden. Deze bevindingen bieden een kwalitatieve morfologische interpretatie, maar geen pixelniveau-validatie.
Analyse van fusieparameters
Het fusiegewicht α balanceert de bijdragen van de ruimtelijke reconstructiefout en de CAR-score aan de uiteindelijke anomalie-score. Optimaal α waarden voor elke fold werden bepaald via een rasterzoekopdracht (stapgrootte 0,05) op de validatiesets, met de resultaten weergegeven in Tabel 5 en Figuur 9. Optimaal α waarden concentreren zich voornamelijk in het bereik van 0,85 tot 0,95, met een gemiddelde van 0,90 ± 0,05. Bij optimale configuraties bereikt het model een gemiddelde AUC van 96,82 ± 0,23% op testsets. Hogere optimale gewichten (ongeveer 0,90) geven aan dat CAR-scores meer bijdragen aan de uiteindelijke detectie dan de reconstructiefout, terwijl de reconstructiefout aanvullende lokale beperkingen biedt. In vergelijking met de α = 0 in de gevoeligheidsanalyse (AUC = 93,29%), verbeterde de validatie-geselecteerde fusie-instelling de AUC met ongeveer 3,53 procentpunten.
Samenvattend, wordt in dit onderzoek het RareCode-raamwerk gepresenteerd voor ongecontroleerde anomaliedetectie in histopathologische beelden, met als doel het identiteitsafbeeldingsprobleem dat traditionele generatieve modellen tegenkomen, te verlichten. Het CAR-mechanisme vermindert de overmatige afhankelijkheid van pixelniveau-reconstructiefouten, terwijl de MHC-module hiërarchische functievoorstellingen op meerdere granulariteitsniveaus biedt, waardoor aanvullende anomaliediscriminatie op verschillende abstractieniveaus mogelijk wordt. Experimenten op de CRC-dataset tonen aan dat RareCode een AUC van 96,82% behaalt, waarbij per-klasse-analyse effectieve kankerdetectie aantoont (AUC = 99,44%) en een sterkere discriminatie voor kanker dan voor ontsteking, wat suggereert dat de overlapping tussen ontsteking en normaal weefsel nog steeds een grote uitdaging vormt. Ablatiestudies bevestigen dat de integratie van discrete semantische kenmerken uit VQ met multischaal weefselmorfologische representaties de detectieprestaties verbetert. RareCode'een hoge sensitiviteit (98,40%) en matige specificiteit (58,24%) duiden op het potentieel als voorselectietool voor het prioriteren van verdachte histopathologische afbeeldingen; echter zal het daadwerkelijke effect op de werkdruk van pathologen een prospectieve beoordeling van de werksstroom vereisen.
Gegevensbeschikbaarheid:
De histopathologische beeldgegevensset van CRC die in dit onderzoek is gebruikt, is verkregen van Shenzhen People's Hospital onder instellingsethische goedkeuring (Goedkeuringsnummer LL-KY-2025300-01). Vanwege patiëntprivacy en instellingsspecifieke beleidsregels voor gegevensdeling is de dataset niet openbaar beschikbaar. Toegang kan worden verleend op redelijke aanvraag aan de corresponderende auteur, onder voorbehoud van instellingsethische goedkeuring en gegevensgebruiksafspraken. De broncode voor het RareCode-framework is openbaar beschikbaar op https://github.com/XL-alg/RareCode.

Figuur 1: Algemene architectuur en gegevensstroom van het RareCode-framework. A 512 × 512 H&E-gekleurd histopathologisch beeld wordt verdeeld in niet-overlappende 32 × 32 en 64 × 64 patches als input op fijne en grove schaal. De twee takken coderen de patches naar latente embeddings, passen Multi-schaal Hiërarchische Codebook (MHC) discretisatie toe en reconstrueren de patches om reconstrueerfout-scores te berekenen. Parallel daaraan schat het Codebook Activatie Zeldzaamheid (CAR)-mechanisme semantische zeldzaamheid af op basis van codebook activatiefrequentieprofielen die zijn geleerd uit normale trainingsmonsters. Gegenormeerde reconstrueerscores en CAR-scores worden vervolgens gecombineerd om de uiteindelijke anomalie-score op beeldniveau te genereren, terwijl responsen op patch-niveau terug worden geprojecteerd naar het beeldvlak voor hiërarchische lokalizatie. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 2: Multischaal vector kwantisatiemechanisme. (A) Afstandsberekening tussen coderingsuitvoerfuncties en codeboek-embeddingsvectoren. (B) Selectie van de dichtstbijzijnde buur en gewogen fusie over codeboeken met capaciteiten van 64, 128, 256 en 512.C) Reconstructie uit gekwantiseerde kenmerken via getransponeerde convolutiedecoder. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 3: CAR-scoremechanisme Deze afbeelding illustreert vier stadia: Stadium 1: activatiefrequentiestatistieken worden uitsluitend berekend op normale trainingsmonsters. Stadium 2: testmonsters verkrijgen activatie-indexen en -afstanden via de encoder en vectorkwantisering. Stadium 3: zeldzaamheidsscores en afstandsscores worden berekend op basis van frequentieprofielen van de trainingsset. Stadium 4: scores van elke codeboekschaal worden gecombineerd via leerbare gewichten om de uiteindelijke CAR-score te produceren. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 4: Samenstelling van de CRC-dataset en experimenteel protocol (A–C) Representatief H&E-gekleurde histopathologische afbeeldingen van normaal colorectaal weefsel, colorectaal carcinoom en colorectale ontsteking.D) 5-voudige cross-validatieprotocol voor UAD, waarbij normale monsters werden gebruikt voor training en validatie, terwijl achtergehouden normale en afwijkende monsters werden gebruikt voor testen. Afbeeldingen werden gedigitaliseerd bij 40x vergroting en verwerkt tot 32 × 32 en 64 × 64 blokken. Groen, lichtgroen en oranje geven respectievelijk de trainings-, validatie- en testsets aan. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 5: Radargrafiek met multi-metrische vergelijking van anomaliedetectiemethoden. Radargrafiek met vergelijking van RareCode en basismethoden op basis van AUC, gemiddelde precisie (AP), F1-score, precisie, recall en precisie bij 90% recall (P@R90). Alle waarden geven het gemiddelde prestatieniveau weer over 5-voudige cross-validatie. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 6: Incrementele bijdrage-analyse van componenten van een ablatiestudie. (A) Vergelijking van AUC-prestaties die de geleidelijke verbetering weergeeft van de alleen-reconstructie-benaderlijn (NoCAR) via enkele-codeboek naar multi-schaalconfiguraties.B) Vergelijking van de specificiteitsprestaties ter illustratie van het CAR-mechanisme's effect op de reductie van valse positieven. Alle foutmarges geven de standaarddeviatie (SD) weer over 5-voudige kruisvalidatie. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 7: Hiërarchische localisatiewarmtekaarten op basis van een multischaal codeboek. Representatieve voorbeelden worden getoond voor (A) normaal, (B) kanker, en (C) ontstekingsmonsters. Elke rij bevat de originele afbeelding, de overlay, de reconstructiefout-kaart, zeldzaamheidsscore-kaarten van codeboeken met verschillende capaciteiten (64, 128, 256 en 512), en de uiteindelijke gefuseerde lokaliseringskaart. Codeboeken met een kleinere capaciteit benadrukken grofkorrelige patronen door sterkere compressie-abstractie, terwijl codeboeken met een grotere capaciteit fijnere structurele details behouden. Gebieden met een hoge respons komen kwalitatief overeen met histopathologische kenmerken gerelateerd aan kanker of ontsteking, maar zijn niet gevalideerd met pixelniveau-expertannotaties. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 8: Distributionshistogrammen van verschillende scoretypes. Histogrammen vergelijken scoreverdelingen tussen normale en afwijkende monsters voor (A) reconstructiefout, (B) gecombineerde CAR-score, (C) Codeboek 64, (D) Codeboek 128, (E) Codeboek 256, en (F) Codeboek 512. Groene en rode histogrammen geven respectievelijk normale en afwijkende monsters aan. Klik hier om een grotere versie van deze afbeelding te bekijken.

Figuur 9: Gevoeligheidsanalyse van de alfa-parameter (A) Validatie-set AUC gebruikt voor α selectie (B) AUC van testset onder verschillende α waarden. De validatie-geselecteerde α waarden varieerden van 0,85 tot 0,95, met een gemiddelde van 0,90 ± 0,05, in overeenstemming met Tabel 5. De AUC-variatie bleef onder de 0,5% wanneer α varieerde binnen het bereik [0,70; 1,00], wat wijst op een stabiele prestatie over een breed parameterbereik. Klik hier om een grotere versie van deze afbeelding te bekijken.
| Methode | AUC (%) | AP (%) | F1 (%) | Precisie (%) | Terugroepen (%) | Specificiteit (%) | P@R90 (%) |
| CAE | 90.37 ± 0.94 | 98.62 ± 0.18 | 95.34 ± 0.15 | 91.64 ± 0.40 | 99.35 ± 0.22 | 28.14 ± 3.88 | 95.66 ± 0.32 |
| SAE | 90.58 ± 0.94 | 98.66 ± 0.18 | 95.34 ± 0.15 | 91.67 ± 0.40 | 99.32 ± 0.24 | 28.46 ± 3.97 | 95.71 ± 0.30 |
| VAE | 93.60 ± 0.82 | 99.13 ± 0.12 | 95.86 ± 0.19 | 92.81 ± 0.49 | 99.12 ± 0.29 | 39.07 ± 4.70 | 96.94 ± 0.43 |
| MAE | 91.65 ± 2.75 | 98.76 ± 0.50 | 95.61 ± 0.60 | 92.87 ± 1.56 | 98.55 ± 0.55 | 39.74 ± 14.32 | 96.55 ± 0.97 |
| MemAE | 94.97 ± 0.81 | 99.35 ± 0.11 | 95.78 ± 0.33 | 92.82 ± 1.07 | 98.95 ± 0.60 | 39.15 ± 9.99 | 97.57 ± 0.33 |
| PatchSAE | 94.86 ± 0.36 | 99.34 ± 0.05 | 95.39 ± 0.13 | 92.32 ± 0.27 | 98.67 ± 0.12 | 34.91 ± 2.57 | 98.13 ± 0.24 |
| STFPM | 90.23 ± 3.05 | 98.70 ± 0.44 | 94.32 ± 0.21 | 91.90 ± 3.51 | 97.14 ± 3.38 | 29.82 ± 33.53 | 95.93 ± 1.96 |
| DRAEM | 76.34 ± 2.82 | 95.34 ± 0.90 | 94.19 ± 0.07 | 89.39 ± 0.65 | 99.56 ± 0.65 | 6.19 ± 7.09 | 92.69 ± 0.57 |
| PatchCore | 74.64 ± 1.82 | 94.76 ± 0.55 | 94.73 ± 0.05 | 90.52 ± 0.15 | 99.36 ± 0.12 | 17.49 ± 1.54 | 92.54 ± 0.15 |
| RareCode | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 94.93 ± 0.67 | 98.40 ± 0.48 | 58.24 ± 5.99 | 98.80 ± 0.10 |
Tabel 1: Vergelijkingsresultaten met basismethoden (5-voudige kruisvalidatie). Prestaties van RareCode en negen basismethoden voor UAD bij detectie op de CRC-dataset. De metrieken omvatten AUC, gemiddelde precisie (AP), recall, specificiteit, F1-score, precisie bij 90% recall (P@R90) en precisie. Alle waarden geven het gemiddelde weer ± SD over 5-voudige cross-validatie. Vetgedrukte waarden geven de beste prestatie aan voor elke metriek.
| Categorie | AUC (%) | AP (%) | F1 (%) | Recall (%) | Specificiteit (%) |
| Kanker | 99.44 ± 0.12 | 99.86 ± 0.03 | 98.34 ± 0.17 | 98.13 ± 0.29 | 94.21 ± 2.22 |
| Ontsteking | 94.30 ± 0.44 | 98.48 ± 0.12 | 93.44 ± 0.29 | 96.55 ± 0.78 | 60.44 ± 4.34 |
Tabel 2: Detectieprestaties per klasse over anomalie-subtypen. Afzonderlijke evaluatie van RareCode's detectieprestaties voor kanker- en ontstekingsmonsters ten opzichte van normale monsters. Per-klasse-metrieken, inclusief AUC, AP, F1-score, recall en specificiteit, werden berekend met behulp van klasse-specifieke optimale drempels.
| Variant | Codeboekconfiguratie | CAR | AUC (%) | AP (%) | F1 (%) | Specificiteit (%) | P@R90 (%) |
| NoCAR |  |  | 92.81 ± 0.12 | 99.05 ± 0.02 | 95.30 ± 0.08 | 33.76 ± 3.82 | 96.72 ± 0.12 |
| SingleCodebook | [256] |  | 95.92 ± 0.40 | 99.47 ± 0.05 | 96.25 ± 0.14 | 55.37 ± 6.51 | 98.31 ± 0.43 |
| TwoScales | [128, 512] |  | 96.57 ± 0.27 | 99.56 ± 0.04 | 96.45 ± 0.12 | 57.75 ± 4.14 | 98.75 ± 0.12 |
| DrieSchaal | [128, 256, 512] |  | 96.36 ± 0.37 | 99.53 ± 0.05 | 96.52 ± 0.17 | 57.99 ± 4.65 | 98.60 ± 0.23 |
| FourScales | [64, 128, 256, 512] |  | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 58.24 ± 5.99 | 98.80 ± 0.10 |
| FourScales + complex decoder | [64, 128, 256, 512] |  | 95.17 ± 0.44 | 99.39 ± 0.06 | 95.32 ± 0.20 | 53.83 ± 21.45 | 98.40 ± 0.37 |
Tabel 3: Resultaten van ablatiestudie. Prestatievergelijking van RareCode-configuraties met progressieve toevoeging van componenten: alleen-reconstructie-basismodel (NoCAR), single-codebook CAR (SingleCodebook) en multi-schaalconfiguraties (TwoScales, ThreeScales, FourScales). Er is ook een extra afbraak van decodercomplexiteit opgenomen met gebruik van de FourScales-configuratie. De gebruikte metrieken zijn AUC, gemiddelde precisie (AP), F1-score, specificiteit en precisie bij 90% herinnering (P@R90).
| Scoretype | Energieverhouding | Cohen's d | AUC (%) |
| Reconstructiefout | 2.623 | 2.006 | 93.31 |
| Gecombineerde CAR | 1.078 | 1.002 | 74.85 |
| Codeboek 64 | 1.109 | 1.207 | 78.79 |
| Codeboek 128 | 1.085 | 1.067 | 76.19 |
| Codeboek 256 | 1.065 | 0.916 | 72.80 |
| Codeboek 512 | 1.064 | 0.833 | 70.38 |
Tabel 4: Analyse op beeldniveau van op lokalisatie gebaseerde responsen. De fout in de gemiddelde beeldreconstructie en de reacties op zeldzaamheid van de codeboeken werden vergeleken tussen normale en afwijkende monsters met behulp van de energieverhouding, Cohen's d, en AUC.
| Vouw | Optimaal α | Val AUC (%) | Test AUC (%) |
| 1 | 0.95 | 96.22 | 96.91 |
| 2 | 0.9 | 96.38 | 96.39 |
| 3 | 0.85 | 96.71 | 96.82 |
| 4 | 0.85 | 96.22 | 96.93 |
| 5 | 0.95 | 96.72 | 97.05 |
| Gemiddelde | 0.90 ± 0.05 | 96.45 ± 0.23 | 96.82 ± 0.23 |
Tabel 5: Optimale alfa-waarden over de verschillende delen. Optimale fusiegewicht alpha bepaald via grid search (stapgrootte 0,05) op validatiesets voor elke cross-validatie-fold, met gemiddelde en SD-statistieken.