Porównanie z metodami bazowymi
Aby ocenić framework RareCode, jako metody bazowe wybrano kilka reprezentatywnych metod UAD, obejmujących metody oparte na rekonstrukcji (CAE32, VAE12, SAE33, MAE34, PatchSAE35), rekonstrukcję wspomaganą pamięcią (MemAE36), destylację wiedzy (STFPM37), syntetyczne generowanie anomalii (DRAEM38) oraz ekstrakcję cech z modeli wstępnie wytrenowanych (PatchCore18). Dobór metod bazowych skupił się na rozwiązaniach, które mogą być trenowane lub stosowane przy porównywalnych budżetach obliczeniowych i założeniach dotyczących danych (dostęp wyłącznie do nieoznakowanych próbek treningowych stanu normalnego), co zapewniło, że różnice w wydajności odzwierciedlają wkład metodologiczny, a nie różnice w skali danych do wstępnego trenowania. W celu zapewnienia sprawiedliwego porównania wszystkie metody oceniono przy użyciu tych samych 5-krotnych podziałów danych, tego samego potoku przetwarzania wstępnego, tych samych metryk oceny i tego samego środowiska obliczeniowego. Modele trenowano zgodnie z tym samym protokołem UAD, wykorzystując wyłącznie normalne próbki treningowe, przy czym hiperparametry i progi wybrano na zbiorze walidacyjnym, a ostateczną wydajność oceniono wyłącznie na wydzielonym zbiorze testowym. Tabela 1 podsumowuje wyniki 5-krotnej walidacji krzyżowej, a Rycina 5 przedstawia porównania na wielokryterialnych wykresach radarowych.
Jak pokazano w Tabela 1 i Rycina 5RareCode osiąga korzystną wydajność detekcji oraz stabilność statystyczną w zbiorze danych CRC. Pod względem AUC, RareCode (96,82 ± 0,23%) przewyższa wiele bazowych modeli opartych na rekonstrukcji, w tym MemAE (94,97 ± 0,81%). Analiza statystyczna potwierdza, że RareCode przewyższa wszystkie modele bazowe oparte na rekonstrukcji (testy t dla prób zależnych, p < 0,05), przy czym poprawa w stosunku do MemAE osiągnęła istotność statystyczną (p < 0,01). RareCode wykazuje niską wariancję wyników (odchylenie standardowe wynoszące 0,23%), co wskazuje na spójną stabilność między fałdami. Ograniczona skuteczność DRAEM, opartego na syntetycznych anomaliach, prawdopodobnie wynika z faktu, że proste strategie nakładania tekstur nie są w stanie w sposób odpowiedni symulować złożonej atypii patologicznej.
Jeśli chodzi o specyficzność, RareCode osiąga 58,24 ± 5,99%, przewyższając wszystkie porównywane metody w zakresie redukcji wskaźników wyników fałszywie dodatnich. Reprezentuje to poprawę o około 25 punktów procentowych w stosunku do linii bazowej opartej wyłącznie na rekonstrukcji (NoCAR, 33,76%), co wykazuje wkład mechanizmu CAR w redukcję wyników fałszywie dodatnich. Niższa specyficzność metod STFPM i PatchCore, które opierają się na cechach wstępnie wytrenowanych na obrazach naturalnych, może częściowo odzwierciedlać lukę domenową między obrazami naturalnymi a histopatologicznymi. Warto zauważyć, że STFPM i DRAEM wykazują wysoką wariancję specyficzności (±33,53% i ±7,09%), przy czym specyficzność dla poszczególnych fałdów waha się od wartości bliskich zeru do poziomów umiarkowanych, co budzi obawy co do niezawodności ich wdrożenia.
Wydajność detekcji w poszczególnych klasach>
Analizę w poszczególnych klasach przeprowadzono poprzez oddzielne porównanie próbek z nowotworem i stanem zapalnym z próbkami prawidłowymi (Tabela 2). RareCode osiągnął wyższą wydajność w detekcji nowotworów (AUC = 99,44 ± 0,12%, recall = 98,13 ± 0,29%, specyficzność = 94,21 ± 2,22%) niż w detekcji stanów zapalnych (AUC = 94,30 ± 0,44%, recall = 96,55 ± 0,78%, specyficzność = 60,44 ± 4,34%). Wyniki te sugerują, że RareCode może wykazywać silniejszą dyskryminację w przypadku zmian złośliwych niż zmian zapalnych, podczas gdy granica między stanem zapalnym a stanem prawidłowym wydaje się w znacznym stopniu przyczyniać do obniżenia ogólnej specyficzności.
Badanie ablacyjne
Aby zbadać wkład kluczowych komponentów w ramach struktury RareCode, przeprowadzono eksperymenty ablacyjne w celu oceny wpływu mechanizmu CAR oraz modułu MHC na wydajność detekcji. Wyniki szczegółowo przedstawiono w Tabeli 3. Jak pokazano na Rysunku 6A, dodanie CAR do bazowego modelu opartego wyłącznie na rekonstrukcji poprawiło AUC z 92,81% do 95,92%, a fuzja wieloskalowych książek kodowych (codebooks) dodatkowo zwiększyła AUC do 96,82%. Rysunek 6B pokazuje, że CAR poprawił również swoistość, zwiększając ją z 33,76% w modelu bazowym NoCAR do 58,24% w pełnym modelu FourScales. Wyniki te potwierdzają komplementarną wartość rzadkości aktywacji książki kodowej oraz fuzji wieloskalowej.
Dodatkowo, przy użyciu konfiguracji FourScales przeprowadzono analizę ablacyjną złożoności dekodera. Jak pokazano w Tabeli 3, wariant z rozbudowanym dekoderem, wykorzystujący wieloskalowe bloki splotów głębinowych (depthwise convolution) oraz moduły uwagi bloków splotowych (CBAM), wykazał niższą wartość AUC niż podstawowy model FourScales (95,17 ± 0,44% vs. 96,82 ± 0,23%). Wynik ten sugeruje, że w ramach obecnej konfiguracji RareCode opartej na VQ-AE, zwiększenie pojemności dekodera nie poprawiło wydajności detekcji anomalii i może obniżać skuteczność reprezentacji ograniczonej przez książkę kodową (codebook).
Hierarchiczna analiza odpowiedzi przestrzennej
Aby zbadać odpowiedzi przestrzenne generowane przez RareCode, błąd rekonstrukcji na poziomie fragmentów oraz mapy rzadkości książki kodów zostały zagregowane na poziomie obrazu i porównane pomiędzy próbkami normalnymi a anomalnymi. Do ilościowego określenia separacji odpowiedzi na poziomie obrazu wykorzystano stosunek energii, d Cohena oraz AUC. Szczegółowe wyniki przedstawiono w Tabeli 4, Rysunku 7 oraz Rysunku 8.
Wyniki pokazują, że wskaźniki rzadkości książki kodowej (codebook rarity scores) na wszystkich skalach wykazują podwyższoną odpowiedź w przypadku próbek anomalnych (stosunki energii > 1). Książki kodowe o mniejszej pojemności (Codebook 64) osiągają silniejszą dyskryminację na poziomie lokalizacji (78,79% AUC), co jest zgodne z oczekiwaniem, że wyższe stopnie kompresji sprzyjają uczeniu się bardziej abstrakcyjnych wzorców prototypowych, które są bardziej czułe na odchylenia od archetypów prawidłowej tkanki. Sam błąd rekonstrukcji zapewnia znaczną zdolność wykrywania anomalii (93,31% AUC), podczas gdy wyniki CAR dostarczają uzupełniających sygnałów z wymiaru częstotliwości semantycznej.
Analiza jakościowa Rysunku 7 wykazała, że podwyższone odpowiedzi w próbkach nowotworowych pokrywały się z obecnością gruczołów nieregularnych i zagęszczonych, powiększeniem jąder komórkowych, hiperchromazją, pseudostratyfikacją oraz utratą polaryzacji nabłonka. W próbkach zapalnych silniejsze odpowiedzi obserwowano wokół zniekształconych krypt oraz gęstych nacieków komórek zapalnych. Książki kodowe o mniejszej pojemności miały tendencję do wychwytywania szerszych odchyleń architektonicznych, natomiast książki kodowe o większej pojemności generowały bardziej zlokalizowane odpowiedzi na poziomie komórkowym. Wyniki te stanowią jakościową interpretację morfologiczną, a nie walidację na poziomie pikseli.
Analiza parametrów fuzji
Waga fuzji α równoważy wkłady błędu rekonstrukcji przestrzennej oraz wyniku CAR do końcowego wyniku anomalii. Optymalne wartości α dla każdego folderu określono za pomocą przeszukiwania siatki (krok 0,05) na zestawach walidacyjnych, a wyniki przedstawiono w Tabeli 5 oraz Rysunku 9. Optymalne wartości α koncentrują się głównie w zakresie 0,85-0,95, przy średniej 0,90 ± 0,05. W optymalnych konfiguracjach model osiąga średnią wartość AUC na poziomie 96,82 ± 0,23% na zestawach testowych. Wyższe optymalne wagi (około 0,90) sugerują, że wyniki CAR w większym stopniu przyczyniają się do końcowej detekcji niż błąd rekonstrukcji, podczas gdy błąd rekonstrukcji zapewnia pomocnicze ograniczenia lokalne. W porównaniu z ustawieniem α = 0 w analizie czułości (AUC = 93,29%), wybrane w procesie walidacji ustawienie fuzji poprawiło AUC o około 3,53 punktu procentowego.
Podsumowując, niniejsza praca przedstawia framework RareCode do nienadzorowanego wykrywania anomalii w obrazach histopatologicznych, którego celem jest złagodzenie problemu mapowania tożsamościowego (identity-mapping) występującego w tradycyjnych modelach generatywnych. Mechanizm CAR ogranicza nadmierne poleganie na błędach rekonstrukcji na poziomie pikseli, natomiast moduł MHC zapewnia hierarchiczne reprezentacje cech o wielu poziomach granulacji, co umożliwia komplementarną dyskryminację anomalii na różnych poziomach abstrakcji. Eksperymenty na zbiorze danych CRC wykazują, że RareCode osiąga AUC na poziomie 96,82%, przy czym analiza per-klasa wskazuje na skuteczne wykrywanie nowotworów (AUC = 99,44%) oraz silniejszą dyskryminację nowotworów w stosunku do stanów zapalnych, co sugeruje, że nakładanie się obrazów stanów zapalnych i tkanek prawidłowych pozostaje głównym wyzwaniem. Badania ablacyjne potwierdzają, że integracja dyskretnych cech semantycznych z VQ z wieloskalowymi reprezentacjami morfologicznymi tkanki poprawia wydajność detekcji. Wysoka czułość (98,40%) i umiarkowana swoistość (58,24%) modelu RareCode wskazują na jego potencjał jako narzędzia do wstępnej przesiewowej selekcji w celu priorytetyzacji podejrzanych obrazów histopatologicznych; jednak jego rzeczywisty wpływ na obciążenie pracą patologów będzie wymagał prospektywnej oceny przepływu pracy.
Dostępność danych:
Zbiór obrazów histopatologicznych CRC wykorzystany w niniejszym badaniu pozyskano ze szpitala Shenzhen People's Hospital na podstawie instytucjonalnej zgody komisji etycznej (nr zatwierdzenia LL-KY-2025300-01). Ze względu na prywatność pacjentów oraz instytucjonalną politykę udostępniania danych, zbiór ten nie jest publicznie dostępny. Dostęp może zostać przyznany na uzasadnioną prośbę skierowaną do autora korespondencyjnego, pod warunkiem uzyskania zgody instytucjonalnej i podpisania umów o wykorzystaniu danych. Kod źródłowy frameworku RareCode jest publicznie dostępny pod adresem https://github.com/XL-alg/RareCode.

Rycina 1Ogólna architektura i przepływ danych w ramach frameworka RareCode. A 512 × 512 H&Obraz histopatologiczny barwiony hematoksyliną i eozyną (H&E) zostaje podzielony na niezachodzące na siebie fragmenty o wymiarach 32 × 32 i 64 × 64 fragmenty obrazu jako wejścia w skali drobnej i grubej. Dwie gałęzie kodują fragmenty do osadzeń latentnych, stosują dyskretyzację za pomocą wieloskalowego hierarchicznego słownika kodowego (Multi-scale Hierarchical Codebook, MHC) i rekonstruują fragmenty w celu obliczenia wyników błędu rekonstrukcji. Równolegle mechanizm rzadkości aktywacji słownika (Codebook Activation Rarity, CAR) szacuje rzadkość semantyczną na podstawie profili częstotliwości aktywacji słownika wyuczonych z normalnych próbek treningowych. Znormalizowane wyniki rekonstrukcji i CAR są następnie łączone w celu wygenerowania końcowego wyniku anomalii na poziomie obrazu, natomiast odpowiedzi na poziomie fragmentów są rzutowane z powrotem na płaszczyznę obrazu w celu lokalizacji hierarchicznej. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Rycina 2: Mechanizm wieloskalowej kwantyzacji wektorowej. (A) Obliczanie odległości między cechami wyjściowymi kodera a wektorami osadzeń książki kodowej. (B) Wybór najbliższego sąsiada i ważona fuzja w obrębie książek kodowych o pojemnościach 64, 128, 256 i 512. (C) Rekonstrukcja z kwantyzowanych cech za pomocą transponowanego dekodera konwolucyjnego. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Mechanizm oceny CAR. Na tym schemacie przedstawiono cztery etapy: Etap 1: statystyki częstotliwości aktywacji są obliczane wyłącznie na podstawie normalnych próbek treningowych. Etap 2: próbki testowe otrzymują indeksy aktywacji i odległości za pomocą kodera i kwantyzacji wektorowej. Etap 3: wyniki rzadkości i wyniki odległości są obliczane na podstawie profili częstotliwości zbioru treningowego. Etap 4: wyniki z każdej skali książki kodowej są łączone za pomocą wag adaptacyjnych w celu uzyskania końcowego wyniku CAR. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 4Skład zbioru danych CRC oraz protokół eksperymentalny. (A–C) Reprezentatywne H&Obrazy histopatologiczne tkanek normalnego jelita grubego, raka jelita grubego oraz stanu zapalnego jelita grubego, barwione H&E. (D) protokół 5-krotnej walidacji krzyżowej dla UAD, w którym próbki prawidłowe wykorzystano do uczenia i walidacji, natomiast wydzielone próbki prawidłowe i anomalne posłużyły do testowania. Obrazy zostały zdigitalizowane przy powiększeniu 40x i podzielone na fragmenty o rozmiarach 32 x 32 oraz 64 x 64. Kolor zielony, jasnozielony i pomarańczowy oznaczają odpowiednio zbiory treningowy, walidacyjny i testowy. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 5: Wykres radarowy wielometrycznego porównania metod detekcji anomalii. Wykres radarowy porównujący RareCode z metodami bazowymi pod kątem AUC, średniej precyzji (AP), wyniku F1, precyzji, czułości oraz precyzji przy 90% czułości (P@R90). Wszystkie wartości reprezentują średnią wydajność w 5-krotnej walidacji krzyżowej. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 6: Analiza przyrostowego wkładu komponentów badania ablacyjnego. (A) Porównanie wyników AUC wykazujące stopniową poprawę od linii bazowej opartej wyłącznie na rekonstrukcji (NoCAR), poprzez konfiguracje z pojedynczą książką kodową, aż po konfiguracje wieloskalowe. (B) Porównanie specyficzności wykazujące wpływ mechanizmu CAR na redukcję wyników fałszywie dodatnich. Wszystkie słupki błędów reprezentują odchylenie standardowe (SD) dla 5-krotnej walidacji krzyżowej. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rycina 7: Hierarchiczne mapy ciepła lokalizacji dla wielkoskalowych książek kodowych. Przedstawiono reprezentatywne przykłady dla próbek (A) prawidłowych, (B) nowotworowych i (C) zapalnych. Każdy wiersz zawiera obraz oryginalny, nałożoną warstwę (overlay), mapę błędów rekonstrukcji, mapy wyników rzadkości z książek kodowych o różnych pojemnościach (64, 128, 256 i 512) oraz końcową scaloną mapę lokalizacji. Książki kodowe o mniejszej pojemności podkreślają wzorce o grubszym ziarnie poprzez silniejszą abstrakcję kompresji, podczas gdy książki kodowe o większej pojemności zachowują drobniejsze szczegóły strukturalne. Regiony o wysokiej odpowiedzi jakościowo odpowiadają histopatologicznym cechom związanym z nowotworem lub zapaleniem, ale nie zostały one zwalidowane za pomocą adnotacji eksperckich na poziomie pikseli. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

Rysunek 8: Histogramy rozkładu różnych typów wyników. Histogramy porównują rozkłady wyników między próbkami normalnymi a anomalnymi dla (A) błędu rekonstrukcji, (B) połączonego wyniku CAR, (C) Codebook 64, (D) Codebook 128, (E) Codebook 256 oraz (F) Codebook 512. Zielone i czerwone histogramy oznaczają odpowiednio próbki normalne i anomalne. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 9: Analiza czułości parametru Alpha. (A) AUC zestawu walidacyjnego wykorzystane do wyboru α. (B) AUC zestawu testowego dla różnych wartości α. Wybrane w walidacji wartości α mieściły się w zakresie od 0,85 do 0,95, ze średnią 0,90 ± 0,05, co jest zgodne z Tabelą 5. Zmienność AUC pozostała poniżej 0,5% przy zmianie α w zakresie [0,70, 1,00], co wskazuje na stabilną wydajność w szerokim zakresie parametrów. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
| Metoda | AUC (%) | AP (%) | F1 (%) | Precyzja (%) | Czułość (%) | Swoistość (%) | P@R90 (%) |
| CAE | 90.37 ± 0.94 | 98.62 ± 0.18 | 95.34 ± 0.15 | 91.64 ± 0.40 | 99.35 ± 0.22 | 28.14 ± 3.88 | 95.66 ± 0.32 |
| SAE | 90.58 ± 0.94 | 98.66 ± 0.18 | 95.34 ± 0.15 | 91.67 ± 0.40 | 99.32 ± 0.24 | 28.46 ± 3.97 | 95.71 ± 0.30 |
| VAE | 93.60 ± 0.82 | 99.13 ± 0.12 | 95.86 ± 0.19 | 92.81 ± 0.49 | 99.12 ± 0.29 | 39.07 ± 4.70 | 96.94 ± 0.43 |
| MAE | 91.65 ± 2.75 | 98.76 ± 0.50 | 95.61 ± 0.60 | 92.87 ± 1.56 | 98.55 ± 0.55 | 39.74 ± 14.32 | 96.55 ± 0.97 |
| MemAE | 94.97 ± 0.81 | 99.35 ± 0.11 | 95.78 ± 0.33 | 92.82 ± 1.07 | 98.95 ± 0.60 | 39.15 ± 9.99 | 97.57 ± 0.33 |
| PatchSAE | 94.86 ± 0.36 | 99.34 ± 0.05 | 95.39 ± 0.13 | 92.32 ± 0.27 | 98.67 ± 0.12 | 34.91 ± 2.57 | 98.13 ± 0.24 |
| STFPM | 90.23 ± 3.05 | 98.70 ± 0.44 | 94.32 ± 0.21 | 91.90 ± 3.51 | 97.14 ± 3.38 | 29.82 ± 33.53 | 95.93 ± 1.96 |
| DRAEM | 76.34 ± 2.82 | 95.34 ± 0.90 | 94.19 ± 0.07 | 89.39 ± 0.65 | 99.56 ± 0.65 | 6.19 ± 7.09 | 92.69 ± 0.57 |
| PatchCore | 74.64 ± 1.82 | 94.76 ± 0.55 | 94.73 ± 0.05 | 90.52 ± 0.15 | 99.36 ± 0.12 | 17.49 ± 1.54 | 92.54 ± 0.15 |
| RareCode | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 94.93 ± 0.67 | 98.40 ± 0.48 | 58.24 ± 5.99 | 98.80 ± 0.10 |
Tabela 1: Wyniki porównania z metodami bazowymi (5-krotna walidacja krzyżowa). Wydajność detekcji algorytmu RareCode oraz dziewięciu bazowych metod UAD na zbiorze danych CRC. Metryki obejmują AUC, średnią precyzję (AP), czułość (recall), swoistość (specificity), wynik F1, precyzję przy 90% czułości (P@R90) oraz precyzję. Wszystkie wartości przedstawiają średnią ± SD z 5-krotnej walidacji krzyżowej. Pogrubione wartości wskazują najlepszą wydajność dla danej metryki.
| Kategoria | AUC (%) | AP (%) | F1 (%) | Czułość (%) | Swoistość (%) |
| Nowotwór | 99.44 ± 0.12 | 99.86 ± 0.03 | 98.34 ± 0.17 | 98.13 ± 0.29 | 94.21 ± 2.22 |
| Zapalenie | 94.30 ± 0.44 | 98.48 ± 0.12 | 93.44 ± 0.29 | 96.55 ± 0.78 | 60.44 ± 4.34 |
Tabela 2: Wyniki detekcji dla poszczególnych klas w zależności od podtypów anomalii. Oddzielna ocena wydajności detekcji RareCode dla próbek nowotworowych i zapalnych w zestawieniu z próbkami prawidłowymi. Metryki dla poszczególnych klas, w tym AUC, AP, F1-score, recall oraz swoistość, obliczono przy użyciu optymalnych progów specyficznych dla danej klasy.
| Wariant | Konfiguracja książki kodowej | CAR | AUC (%) | AP (%) | F1 (%) | Swoistość (%) | P@R90 (%) |
| NoCAR |  |  | 92.81 ± 0.12 | 99.05 ± 0.02 | 95.30 ± 0.08 | 33.76 ± 3.82 | 96.72 ± 0.12 |
| Pojedyncza Księga Kodów | [256] |  | 95.92 ± 0.40 | 99.47 ± 0.05 | 96.25 ± 0.14 | 55.37 ± 6.51 | 98.31 ± 0.43 |
| DwieSkale | [128, 512] |  | 96.57 ± 0.27 | 99.56 ± 0.04 | 96.45 ± 0.12 | 57.75 ± 4.14 | 98.75 ± 0.12 |
| ThreeScales | [128, 256, 512] |  | 96.36 ± 0.37 | 99.53 ± 0.05 | 96.52 ± 0.17 | 57.99 ± 4.65 | 98.60 ± 0.23 |
| CzterySkale | [64, 128, 256, 512] |  | 96.82 ± 0.23 | 99.59 ± 0.03 | 96.63 ± 0.15 | 58.24 ± 5.99 | 98.80 ± 0.10 |
| FourScales + złożony dekoder | [64, 128, 256, 512] |  | 95.17 ± 0.44 | 99.39 ± 0.06 | 95.32 ± 0.20 | 53.83 ± 21.45 | 98.40 ± 0.37 |
Tabela 3: Wyniki badania ablacyjnego. Porównanie wydajności konfiguracji RareCode wraz z progresywnym dodawaniem komponentów: bazowy model z samą rekonstrukcją (NoCAR), CAR z pojedynczą książką kodową (SingleCodebook) oraz konfiguracje wieloskalowe (TwoScales, ThreeScales, FourScales). Uwzględniono również dodatkową ablację złożoności dekodera z wykorzystaniem konfiguracji FourScales. Metryki obejmują AUC, średnią precyzję (AP), wynik F1, swoistość oraz precyzję przy 90% czułości (P@R90).
| Typ wyniku | Stosunek energii | d Cohena | AUC (%) |
| Błąd rekonstrukcji | 2.623 | 2.006 | 93.31 |
| Połączony CAR | 1.078 | 1.002 | 74.85 |
| Książka kodów 64 | 1.109 | 1.207 | 78.79 |
| Codebook 128 | 1.085 | 1.067 | 76.19 |
| Książka kodów 256 | 1.065 | 0.916 | 72.80 |
| Książka kodów 512 | 1.064 | 0.833 | 70.38 |
Tabela 4: Analiza na poziomie obrazów odpowiedzi wynikających z lokalizacji. Średni błąd rekonstrukcji obrazu oraz odpowiedzi rzadkości książki kodowej porównano pomiędzy próbkami prawidłowymi a anomalnymi, wykorzystując stosunek energii, d Cohena oraz AUC.
| Złożyć | Optymalny α | Val AUC (%) | AUC testu (%) |
| 1 | 0.95 | 96.22 | 96.91 |
| 2 | 0.9 | 96.38 | 96.39 |
| 3 | 0.85 | 96.71 | 96.82 |
| 4 | 0.85 | 96.22 | 96.93 |
| 5 | 0.95 | 96.72 | 97.05 |
| Średnia | 0.90 ± 0.05 | 96.45 ± 0.23 | 96.82 ± 0.23 |
Tabela 5: Optymalne wartości alfa w poszczególnych fałdach. Optymalna waga fuzji alfa wyznaczona za pomocą przeszukiwania siatki (krok 0,05) na zestawach walidacyjnych dla każdego fałdu walidacji krzyżowej, wraz ze statystykami średniej i SD.