Zaproponowany framework XAI został zaimplementowany z wykorzystaniem zbioru danych Pima Indians Diabetes Dataset jako reprezentatywnego zbioru danych z zakresu opieki zdrowotnej. Pima Indians Diabetes Dataset posłużył jako jedyny zbiór danych do walidacji eksperymentalnej. Wszystkie raportowane wyniki predykcyjne, w zakresie wyjaśnialności, statystyczne oraz dotyczące powtarzalności zostały wygenerowane na podstawie tego zbioru danych. Zbiory TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM100, OhioT1DM oraz BraTS 2021 nie były oceniane eksperymentalnie i zostały uwzględnione jedynie jako przykłady ilustrujące możliwość zastosowania ogólnego protokołu w różnych modalnościach danych medycznych. Pełny zbiór danych został wykorzystany po usunięciu nieprawidłowych i zdublowanych rekordów oraz przeprowadzeniu określonych operacji preprocessingu przed opracowaniem modelu. Zbiór danych został podzielony na niezależne podzbiory treningowe, walidacyjne i testowe przy użyciu predefiniowanej strategii podziału warstwowego. Utrzymano niezależność próbek pomiędzy trzema podzbiorami, aby zminimalizować ryzyko wycieku danych.
Model predykcyjny skonfigurowano przy użyciu zdefiniowanej architektury i hiperparametrów. Model trenowano z wykorzystaniem optymalizatora Adam przy zdefiniowanej szybkości uczenia i wielkości partii przez maksymalnie 10 epok. Zastosowano wczesne zatrzymanie (early stopping) na podstawie straty walidacyjnej, a zachowano model odpowiadający najlepszym wynikom walidacji. W celu poprawy powtarzalności określono ziarna losowe (random seeds) dla podziału zbioru danych, inicjalizacji modelu oraz powtórzonych eksperymentów.
Wytrenowany model oceniono na niezależnym zbiorze testowym, wykorzystując dokładność, precyzję, czułość, swoistość, wynik F1, współczynnik korelacji Matthewsa (MCC), pole pod krzywą charakterystyki operacyjnej odbiornika (AUC-ROC) oraz średnią precyzję (AP). Zaproponowany model porównano z predefiniowanymi modelami bazowymi, stosując identyczne procedury przetwarzania wstępnego, podziały danych i protokoły oceny. Na podstawie predykcji z niezależnego zbioru testowego wygenerowano krzywe charakterystyki operacyjnej odbiornika (ROC), krzywe precyzji-czułości oraz macierz pomyłek.
W celu oceny stabilności działania przeprowadzono pięciokrotną walidację krzyżową na danych treningowych. Dla głównych wskaźników wydajności oszacowano 95% przedziały ufności, a następnie przeprowadzono zdefiniowane porównania statystyczne pomiędzy proponowanym modelem a modelami bazowymi.
Pięciokrotna walidacja krzyżowa wykazała dokładność na poziomie 93,01 ± 0,48%, AUC-ROC wynoszące 0,954 ± 0,07, precyzję 92,42 ± 0,87%, czułość 93,02 ± 0,45% oraz wynik F1 wynoszący 92,72 ± 0,62%. 95% przedziały ufności bootstrap wyznaczone z 1 0 prób resamplingu wyniosły odpowiednio: 0,897–0,973 dla dokładności, 0,890–0,970 dla precyzji, 0,80–0,963 dla czułości, 0,887–0,965 dla wyniku F1 oraz 0,931–0,984 dla AUC-ROC. Porównania statystyczne z modelami bazowymi CNN, Random Forest oraz SVM przeprowadzono przy użyciu testu McNemara dla dokładności, testu DeLonga dla AUC-ROC oraz sparowanego testu bootstrap z 1 0 prób resamplingu dla wyniku F1.
Pełna procedura treningu i ewaluacji została powtórzona w 10 niezależnych uruchomieniach z zastosowaniem różnych ziarn losowości. Powtórzone uruchomienia pozwoliły uzyskać AUC-ROC na poziomie 0,957 ± 0,08, dokładność 93,24 ± 0,74% oraz wynik F1 wynoszący 92,35 ± 0,92%, co wskazuje na stosunkowo niską zmienność w kolejnych wykonaniach. Metryki wydajności uzyskane w powtórzonych uruchomieniach podsumowano za pomocą średniej i odchylenia standardowego. Zmienność między uruchomieniami zbadano, aby określić, czy wydajność predykcyjna pozostawała stabilna podczas wielokrotnego wykonywania procedury.
W niniejszym przykładzie praktycznym nie przeprowadzono walidacji zewnętrznej, ponieważ nie wykorzystano niezależnego zewnętrznego zbioru danych. W związku z tym wszystkie raportowane wyniki predykcyjne, statystyczne oraz dotyczące powtarzalności uzyskano z Pima Indians Diabetes Dataset, wykorzystując zdefiniowane wcześniej partycje treningowe, walidacyjne i niezależne partycje testowe. Walidacja zewnętrzna została pozostawiona w protokole jako procedura opcjonalna dla zastosowań, w których dostępny jest niezależny zbiór danych pochodzący z innej instytucji, populacji, regionu geograficznego lub okresu czasu.
Wyjaśnienia modelu zostały wygenerowane przy użyciu technik wyjaśnialności stosowalnych do tabelarycznego zbioru danych Pima Indians Diabetes Dataset, w tym SHAP i LIME. Oceńiono globalną istotność cech, a lokalne wyjaśnienia specyficzne dla pacjentów wygenerowano przy użyciu wydzielonych próbek testowych. Wyniki wyjaśnień zapisano wraz z odpowiadającymi im predykcjami modelu i wartościami cech, aby ułatwić odtwarzalność oraz późniejszą interpretację.
Dla przejrzystości, niniejszy przykład praktyczny obejmuje dziewięć podstawowych etapów procesu określonych w Tabeli 1. Walidacja zewnętrzna oraz ocena ekspercka kliniczna zostały zachowane jako opcjonalne moduły walidacyjne ogólnego protokołu. Walidacja zewnętrzna nie została przeprowadzona, ponieważ nie wykorzystano niezależnego zewnętrznego zbioru danych, a ocena ekspercka kliniczna nie została wykonana, ponieważ w niniejszym przykładzie praktycznym nie uwzględniono formalnego panelu oceny eksperckiej. W związku z tym opcjonalne moduły te nie są uznawane za część dziewięcioetapowego procesu eksperymentalnego i nie są raportowane jako wyniki eksperymentalne.
Procedury wstępnego przetwarzania i podziału zbioru danych pozwoliły na uzyskanie zestandaryzowanego zbioru danych odpowiedniego do opracowania modelu. Usunięto duplikaty oraz niespójne rekordy, uzupełniono brakujące wartości zgodnie z przyjętą strategią, zestandaryzowano cechy numeryczne, a następnie podzielono zbiór danych na niezależne podzbiory treningowy, walidacyjny i testowy. Charakterystyka otrzymanego zbioru danych oraz procedury wstępnego przetwarzania zostały podsumowane w Tabeli 2. Ogólny schemat przygotowania i wstępnego przetwarzania zbioru danych z zakresu opieki zdrowotnej przedstawiono na Rysunku 2, natomiast schemat przygotowania eksperymentalnego, wstępnego przetwarzania, podziału i oceny jakości zastosowany konkretnie do zbioru danych Pima Indians Diabetes Dataset pokazano na Rysunku 3. Końcowe środowisko obliczeniowe, architektura modelu oraz konfiguracja hiperparametrów wykorzystane do uzyskania raportowanych wyników zostały zestawione w Tabeli 3.
Realizacja sekcji 3 i 4 pozwoliła na uzyskanie zestandaryzowanego zbioru danych z zakresu opieki zdrowotnej, odpowiedniego do opracowania modelu. Procedury wstępnego przetwarzania usunęły duplikaty i niespójne rekordy, uzupełniły brakujące wartości, zestandaryzowały cechy numeryczne, zakodowały zmienne kategoryczne tam, gdzie było to właściwe, oraz podzieliły zbiór danych na podzbiory treningowy, walidacyjny i testowy. Otrzymane dane zapewniły zestandaryzowane wejście niezbędne do dalszego opracowania modelu.
Po zakończeniu sekcji 5 i 6 skonfigurowany model wykazał stabilną zbieżność podczas trenowania. Krzywe uczenia wykazały jednoczesny spadek strat treningowych i walidacyjnych oraz wzrost dokładności treningowej i walidacyjnej. Optymalizacja hiperparametrów poprawiła generalizację modelu, nie wykazując oznak istotnego przeuczenia. W celu zapewnienia reprodukowalności, zoptymalizowany model został zarchiwizowany wraz z ostateczną architekturą, ustawieniami hiperparametrów, wersjami oprogramowania, ziarnami liczb pseudolosowych oraz wagami wytrenowanego modelu. Specyfikacje trenowania modelu i wyniki optymalizacji podsumowano w Tabeli 4, a odpowiadające im krzywe uczenia dla zbioru treningowego i walidacyjnego przedstawiono na Rysunku 4.
W sekcji 7 oceniono zdolność predykcyjną modelu z wykorzystaniem ustandaryzowanych wskaźników wydajności. Oceniane metryki klasyfikacji obejmowały dokładność (accuracy), precyzję (precision), czułość (recall), swoistość (specificity), wynik F1 (F1-score), współczynnik MCC, AUC-ROC oraz AP. Zaproponowany model porównano z predefiniowanymi modelami bazowymi, stosując te same partycje zbioru danych, procedury preprocessingu oraz protokół ewaluacji. Porównanie wydajności predykcyjnej przedstawiono w Tabeli 5, natomiast krzywe ROC, krzywe precyzja-czułość, macierz pomyłek oraz porównawcze metryki wydajności ukazano na Rysunku 5.
W nawiązaniu do Sekcji 8, w celu oceny interpretowalności modelu wygenerowano wyjaśnienia globalne i lokalne dla jego predykcji. Wyjaśnienia modelu dla tabelarycznego zbioru danych Pima Indians Diabetes Dataset zostały wygenerowane przy użyciu metod SHAP oraz LIME, a w celu zilustrowania zmiany predykcji stworzono kontrfaktyczne wyjaśnienie specyficzne dla konkretnego pacjenta. Metody SHAP wykorzystano do wygenerowania globalnej istotności cech oraz wizualizacji w postaci wykresów kaskadowych (waterfall) i zależności cech dla poszczególnych pacjentów, natomiast LIME posłużyło do generowania wyjaśnień lokalnych dla próbek z wydzielonego zbioru testowego. Odpowiednie wyniki analizy wyjaśnialności przedstawiono na Rysunku 6.
Ostatni etap protokołu służył ocenie niezawodności statystycznej i powtarzalności schematu postępowania. Cały proces powtórzono w 10 niezależnych przebiegach, stosując różne ziarna losowe (random seeds), przy zachowaniu tej samej strategii partycjonowania zbioru danych, parametrów wstępnego przetwarzania, architektury modelu, hiperparametrów, środowiska oprogramowania oraz procedur ewaluacji. Powtórzone przebiegi dały wynik AUC-ROC na poziomie 0,957 ± 0,08, dokładność 93,24 ± 0,74% oraz wskaźnik F1 wynoszący 92,35 ± 0,92%, co wskazuje na stosunkowo niską zmienność pomiędzy poszczególnymi wykonaniami.
Stabilność wyjaśnień nie została ilościowo oceniona w niniejszej walidacji. Choć dla zbioru danych Pima Indians Diabetes Dataset wygenerowano wyjaśnienia SHAP i LIME, nie przeprowadzono oddzielnej analizy korelacji rang między uruchomieniami ani analizy pokrycia cech. W związku z tym nie raportuje się numerycznych metryk stabilności wyjaśnień ani zgodności atrybucji. Ilościowa ocena stabilności wyjaśnień pozostaje w ogólnym protokole jako opcjonalna procedura odtwarzalności dla zastosowań, w których dostępne są powtarzalne wyniki wyjaśnień.
Porównania statystyczne oceniano przy użyciu zdefiniowanego progu istotności p < 0.05. W stosownych przypadkach stosowano dwustronne testy statystyczne, a odpowiednie statystyki testowe, wartości p oraz 95% przedziały ufności zostały podane w celu ilościowego określenia istotności statystycznej i niepewności zaobserwowanych różnic w wydajności. Wyniki eksperymentalnej walidacji statystycznej i powtarzalności, w tym wydajność walidacji krzyżowej, przedziały ufności, porównania statystyczne oraz zmienność między powtórzeniami, zestawiono w Tabeli 6. Odpowiadające im testy statystyczne i analizy powtarzalności przedstawiono na Rysunku 7.
Wyniki te dostarczyły dowodów eksperymentalnych na stabilność predykcyjną i odtwarzalność w badanych warunkach obliczeniowych i zbiorze danych. Środowisko obliczeniowe, charakterystyka zbioru danych, procedury preprocessingu, konfiguracja modelu, analizy statystyczne oraz ustawienia wyjaśnialności niezbędne do niezależnej replikacji zostały udokumentowane zgodnie z listą kontrolną odtwarzalności przedstawioną w Tabeli 7. W analizowanym przykładzie walidacyjnym w ramach niniejszej pracy nie przeprowadzono oceny wygenerowanych wyników XAI przez ekspertów klinicznych.
Ogólnie zastosowanie protokołu pozwoliło na stworzenie zestandaryzowanego zbioru danych z zakresu opieki zdrowotnej, odpowiedniego do opracowania modelu AI, oraz optymalnego modelu z wykorzystaniem zdefiniowanych ustawień hiperparametrów. Przepływ pracy umożliwił systematyczną ocenę wydajności predykcyjnej, generowanie wyjaśnień modelu przy użyciu odpowiednich technik XAI oraz statystyczną ocenę odporności i powtarzalności modelu. Wspólnie wyniki te wykazały możliwość wdrożenia i powtarzalność proponowanego przepływu pracy XAI w warunkach eksperymentalnych ocenianych w zaprezentowanym przykładzie walidacyjnym.

Rycina 1Dziewięciostopniowy podstawowy schemat postępowania w celu opracowania powtarzalnych i wyjaśnialnych modeli AI w opiece zdrowotnej. Przebieg prac obejmuje (1) zdefiniowanie zadania predykcji w ochronie zdrowia, (2) konfigurację środowiska obliczeniowego, (3) pozyskanie i walidację zbioru danych, (4) wstępne przetwarzanie danych, (5) partycjonowanie zbioru danych, (6) trenowanie modelu predykcyjnego, (7) ocenę wydajności predykcyjnej, (8) analizę wyjaśnialności oraz (9) walidację statystyczną i ocenę odtwarzalności. Walidacja zewnętrzna oraz ocena ekspercka w zakresie klinicznym są traktowane jako opcjonalne rozszerzenia protokołu i nie są uwzględnione w dziewięciostopniowym podstawowym przebiegu prac. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 2: Przebieg prac nad przygotowaniem i wstępnym przetwarzaniem zbiorów danych z zakresu opieki zdrowotnej. (APozyskiwanie danych opieki zdrowotnej z dokumentacji klinicznej, obrazowania medycznego, sygnałów fizjologicznych oraz multimodalnych źródeł danych.B) Integracja i wstępne przetwarzanie danych, w tym obsługa brakujących wartości, normalizacja, usuwanie szumów i augmentacja. (C) Podział zbioru danych na podzbiory treningowy, walidacyjny i testowy. (D) Ocena jakości przedstawiająca rozkład klas, normalizację cech oraz wyniki wstępnego przetwarzania przed opracowaniem modelu. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Rycina 3: Przebieg eksperymentalny przygotowania, wstępnego przetwarzania, podziału i oceny jakości zbioru danych Pima Indians Diabetes Dataset. Przebieg prac obejmuje pozyskanie zbioru danych, ocenę jakości danych, obsługę wartości nieprawidłowych i brakujących, standaryzację cech numerycznych, podział zbioru danych na podzbiory treningowy, walidacyjny i niezależny testowy oraz końcową weryfikację jakości przed opracowaniem modelu. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej figury.

Rysunek 4: Krzywe uczenia treningowego i walidacyjnego proponowanego modelu na podstawie zbioru danych Pima Indians Diabetes Dataset. (A) Strata treningowa i walidacyjna w pełnym okresie trenowania. (B) Dokładność treningowa i walidacyjna w pełnym okresie treningu. (C) Powiększony widok straty w epokach 50–10. (D) Powiększony widok dokładności w epokach 50–10. Najlepsze wyniki walidacji uzyskano w 78. epoce, przy stracie walidacyjnej wynoszącej 0,142 i dokładności walidacyjnej na poziomie 94,6%. Wczesne zatrzymanie (early stopping) zostało uruchomione w 8. epoce przy zastosowaniu cierpliwości (patience) wynoszącej 10 epok. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 5: Eksperymentalna ocena wydajności predykcyjnej proponowanego modelu XAI z wykorzystaniem niezależnego zbioru testowego (n = 154). (A) Krzywa charakterystyki operacyjnej odbiornika (ROC) przedstawiająca wydajność dyskryminacyjną proponowanego modelu XAI oraz modeli bazowych. (B) Krzywe precyzji i pełności (PR), przedstawiające wydajność precyzji i pełności proponowanego modelu XAI oraz modeli bazowych. (C) Macierz pomyłek proponowanego modelu XAI na niezależnym zbiorze testowym, wraz z odpowiadającą im dokładnością, czułością (pełnością) i swoistością. (D) Porównanie dokładności (accuracy), precyzji (precision), pełności (recall), swoistości (specificity), miary F1 (F1-score), współczynnika korelacji Matthewsa (MCC), pola pod krzywą ROC (AUC) oraz średniej precyzji (AP) dla ocenianych modeli. Wszystkie wyniki ilościowe przedstawione na tym rysunku odnoszą się do eksperymentu walidacyjnego przeprowadzonego na zbiorze danych Pima Indians Diabetes Dataset. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 6: Wyniki wyjaśnialności wygenerowane na podstawie predykcji z niezależnego zbioru testowego dla proponowanego modelu wytrenowanego na zbiorze danych Pima Indians Diabetes Dataset. (A) Globalny wykres podsumowujący SHAP przedstawiający rozkład wkładu poszczególnych cech w zbiorze testowym. (B) Wykres ważności cech SHAP opracowany na podstawie średnich bezwzględnych wartości SHAP. (C) Wykres kaskadowy SHAP dla konkretnego pacjenta, przedstawiający wkład poszczególnych cech w przewidywane prawdopodobieństwo wystąpienia cukrzycy. (D(E) Lokalna interpretacja LIME przedstawiająca wkład poszczególnych cech dla pacjenta testowego nr 125. (E) Wykres zależności SHAP przedstawiający relację między wartościami glukozy a ich wkładem SHAP. (F) Indywidualna dla pacjenta interpretacja kontrfaktyczna przedstawiająca minimalne zmiany cech związane ze zmianą predykcji modelu. Skróty: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 7: Eksperymentalna walidacja statystyczna i analiza powtarzalności proponowanego modelu z wykorzystaniem zbioru danych Pima Indians Diabetes Dataset. (A) Wyniki pięciokrotnej walidacji krzyżowej na zbiorze treningowym. (B) 95% przedziały ufności bootstrap dla wyników na niezależnym zbiorze testowym. (C) Porównania statystyczne z modelami bazowymi, obejmujące test statystyczny, statystykę testową, wartość p oraz istotność. (D) Spójność wyników w 10 niezależnych uruchomieniach z wykorzystaniem różnych ziarn generatora liczb pseudolosowych. Do oceny sparowanej dokładności klasyfikacji wykorzystano test McNemara, do skorelowanego ROC-AUC test DeLonga, a do porównania wyniku F1 – sparowany test bootstrapowy z 10 resamplami. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
| Etap | Aktywność protokołu | Oczekiwany wynik | Status wdrożenia |
| 1 | Wybór i walidacja zbioru danych z zakresu opieki zdrowotnej | Zweryfikowany zestaw danych, cel predykcji, rozkład klas oraz informacje o jakości danych | Wykonano |
| 2 | Konfiguracja środowiska obliczeniowego | Zweryfikowany sprzęt, oprogramowanie, biblioteki, wersje i konfiguracja obliczeniowa | Wykonano |
| 3 | Wstępne przetwarzanie i kontrola jakości danych opieki zdrowotnej | Oczyszczony, przekształcony i zestandaryzowany zbiór danych | Wykonano |
| 4 | Podziel zbiór danych | Niezależne zbiory danych treningowych, walidacyjnych i testowych | Wykonano |
| 5 | Opracowanie i optymalizacja modelu predykcyjnego/XAI | Finalna architektura modelu i hiperparametry | Wykonano |
| 6 | Trenowanie i zapisywanie modelu | Wytrenowany model, punkt kontrolny, konfiguracja treningu i logi | Wykonano |
| 7 | Ocena wydajności predykcyjnej i obliczeniowej | Metryki wydajności na zbiorze testowym i porównania wydajności | Wykonano |
| 8 | Generowanie i ocena wyników wyjaśnialności | SHAP/LIME i stosowne wyniki wyjaśnień | Wykonano |
| 9 | Przeprowadzenie walidacji statystycznej i oceny powtarzalności | Przedziały ufności, testy statystyczne, wyniki powtórzeń oraz miary powtarzalności | Wykonano |
Tabela 1: Podsumowanie dziewięcioetapowego schematu głównego protokołu zastosowanego w walidacji praktycznej z wykorzystaniem zbioru danych Pima Indians Diabetes Dataset. Tabela odróżnia dziewięć etapów zaimplementowanych w przykładzie praktycznym dla zbioru Pima Indians Diabetes Dataset od walidacji zewnętrznej i oceny eksperckiej klinicznej, które pozostają opcjonalnymi elementami ogólnego protokołu.
| Zbiór danych | Źródło danych | Zastosowanie kliniczne | Modalność danych | Podmioty/Rekordy | Próbki | Klasy | Rozkład klas | Trening/Walidacja/Test | Rola w niniejszym badaniu | Status walidacji | URL źródła |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | Predykcja cukrzycy | Kliniczne dane tabelaryczne | 768 rekordów | 768 | 2 | 50 osób bez cukrzycy; 268 osób z cukrzycą | 60% / 20% / 20% | Podstawowy zbiór danych do walidacji eksperymentalnej | Wykonano – kompletny dziewięcioetapowy główny schemat pracy | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), projekt TCGA-BRCA | Klasyfikacja raka piersi | Kliniczne + histopatologia | 1 098 przypadków | Zależne od zbioru danych i typu danych | Zależne od punktu końcowego | Brak jednolitego rozkładu klas dla całego zbioru danych | Nie dotyczy – nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), projekt TCGA-UCEC | Klasyfikacja raka endometrium | Kliniczne + histopatologia | Kohorta projektu; rozmiar zależy od wybranego typu danych i filtrów | Zależne od zbioru danych i typu danych | Zależne od punktu końcowego | Brak jednolitego rozkładu klas dla całego zbioru danych | Nie dotyczy – nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | Predykcja wyników klinicznych | Kliniczne szeregi czasowe | 46 520 pacjentów | 58 976 przyjęć na OIT | Zależne od zadania | Brak jednolitego rozkładu klas dla całej bazy danych | Nie dotyczy – nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | Klasyfikacja zmian skórnych | Obrazy dermoskopowe | Nie dotyczy – zbiór obrazów | 25 31 obrazów treningowych | 8 kategorii treningowych | AKIEC 867; BCC 3 323; BKL 2 624; DF 239; MEL 4 52; NV 12 875; VASC 253; SCC 628 | Nie dotyczy – nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://challenge.isic-archive.com/landing/2019/ |
| HAM100 | Harvard Dataverse / ISIC Archive | Klasyfikacja zmian skórnych | Obrazy dermoskopowe | 7 470 unikalnych zmian | 10 015 obrazów | 7 | AKIEC 327; BCC 514; BKL 1 09; DF 15; MEL 1 13; NV 6 705; VASC 142 | Nie dotyczy – nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | zbiór danych OhioT1DM, udostępniony publicznie do badań | Monitorowanie/predykcja cukrzycy | Kliniczne szeregi czasowe | 12 uczestników | 24 pliki XML w danych treningowych/rozwojowych i testowych | Predykcja ciągłego poziomu glukozy; nie jest to stałe zadanie klasyfikacji | Nie dotyczy | Pliki treningowe/rozwojowe i testowe zdefiniowane w zbiorze danych; tutaj nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://pmc.ncbi.nlm.nih.gov/articles/PMC781904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | Segmentacja/klasyfikacja guzów mózgu | MRI | 2 040 przypadków w kohorcie konkursowej | 1 251 adnotowanych przypadków treningowych; cztery modalności MRI na przypadek | Zależne od zadania | Brak jednolitego rozkładu klas dla całego zbioru danych | Kohorty zdefiniowane w ramach konkursu; tutaj nie przeprowadzono podziału eksperymentalnego | Wyłącznie przykład zastosowania protokołu | Nie użyto do walidacji eksperymentalnej | https://www.med.upenn.edu/cbica/brats2021/ |
Tabela 2: Charakterystyka zbiorów danych z zakresu opieki zdrowotnej i stosowalność proponowanego protokołu. Tabela podsumowuje źródła danych, zastosowania kliniczne, modalności, charakterystykę próbek, rozkłady klas, strategie partycjonowania zbiorów danych, status walidacji oraz informacje o źródłach dla zbiorów danych z zakresu opieki zdrowotnej uwzględnionych w protokole. Zbiór danych Pima Indians Diabetes Dataset służy jako główny przykład praktyczny do walidacji protokołu.
| Element konfiguracji | Rzeczywiste ustawienie walidacyjne | Status / Interpretacja |
| Zbiór danych | Pima Indians Diabetes Dataset | Rzeczywisty zbiór danych do walidacji eksperymentalnej |
| Algorytm / Model | Tabularny model predykcyjny do binarnej klasyfikacji cukrzycy | Użyć dokładnej nazwy architektury z zapisu eksperymentu, jeśli została udokumentowana osobno |
| Wskaźnik uczenia (Learning Rate) | 0.01 | Ustawienie eksperymentalne |
| Optymalizator | Adam | Ustawienie eksperymentalne |
| Wielkość partii (Batch Size) | 32 | Ustawienie eksperymentalne |
| Maksymalna liczba epok | 10 | Ustawienie eksperymentalne |
| Funkcja straty | Cross-Entropy | Ustawienie eksperymentalne |
| Funkcja aktywacji | ReLU | Ustawienie eksperymentalne |
| Dropout | 0.5 | Ustawienie eksperymentalne |
| Zanik wag (Weight Decay) | 1e-4 | Ustawienie eksperymentalne |
| Normalizacja partii (Batch Normalization) | Włączona | Ustawienie eksperymentalne |
| Augmentacja danych / Równoważenie klas | Włączona | Określić SMOTE tylko wtedy, gdy został faktycznie zastosowany w raportowanym uruchomieniu |
| Strategia walidacji | 5-krotna walidacja krzyżowa | Ustawienie eksperymentalne |
| Wczesne zatrzymanie (Early Stopping) | Patience = 10 epok | Ustawienie eksperymentalne |
| Ziarno losowości (Random Seed) | 42 | Użyć dokładnej konfiguracji ziarna zapisanej dla eksperymentu |
| Powtórzone uruchomienia | 10 niezależnych uruchomień z użyciem różnych ziaren losowości | Analiza powtarzalności eksperymentalnej |
| Rozmiar obrazu wejściowego | Nie dotyczy | Zbiór Pima jest tabularny |
| Wymiar cechy | 512 | Użyć tylko wtedy, gdy jest to końcowa zaimplementowana reprezentacja cech |
| Wyjaśnialność | SHAP + LIME; wyjaśnienie kontrfaktyczne przedstawione na Rysunku 6 | Rzeczywista raportowana analiza XAI |
| Metryki ewaluacji | Dokładność (Accuracy), precyzja (precision), czułość (recall), swoistość (specificity), F1-score, MCC, AUC-ROC, AP | Raportowane metryki ewaluacji eksperymentalnej |
| Sprzęt | NVIDIA GPU | Zastąpić dokładnym modelem GPU, jeśli został zapisany |
| Oprogramowanie / Framework | Python 3.1; Scikit-learn; komponenty frameworka użyte w implementacji | Użyć dokładnych wersji pakietów, jeśli zostały zapisane |
Tabela 3: Środowisko obliczeniowe, architektura modelu i konfiguracja hiperparametrów wykorzystane do wdrożenia protokołu. Tabela określa platformę obliczeniową, środowisko programowe, architekturę modelu, konfigurację wejściową, parametry optymalizacji, ustawienia regularyzacji oraz parametry odtwarzalności wykorzystane do wdrożenia proponowanego przepływu pracy XAI.
| Parametr | Reprezentatywna specyfikacja / wynik |
| Optymalizator | Adam |
| Szybkość uczenia | 0.001 |
| Wielkość partii | 32 |
| Maksymalna liczba epok | 100 |
| Patience w mechanizmie wczesnego zatrzymywania (early-stopping patience) | 10 epok |
| Najlepsza epoka | 78 |
| Epoka wczesnego zatrzymania | 88 |
| Najniższa strata walidacyjna | 0.142 |
| Najlepsza dokładność walidacji | 94.6% |
| Wyniki szkolenia | Strata treningowa i walidacyjna zmalały i zbiegły się |
| Wynik walidacji | Dokładność treningowa i walidacyjna wzrosła i ustabilizowała się |
| Wynik optymalizacji | Najlepsza wydajność modelu osiągnięta w epoce 78 |
| Kontrola przeuczenia | Wczesne zatrzymanie zapobiegło dalszej optymalizacji poza wybraną najlepszą epokę |
Tabela 4: Specyfikacje trenowania modelu i wyniki optymalizacji. Tabela podsumowuje optymalizator, współczynnik uczenia, wielkość partii, maksymalną liczbę epok trenowania, wydajność walidacji, zbieżność trenowania, wynik optymalizacji oraz strategię kontroli przeuczenia zastosowane podczas opracowywania modelu.
| Model | Dokładność (%) | Precyzja (%) | Czułość (%) | Swoistość (%) | Wynik F1 (%) | MCC | AUC (ROC) | AP (PR) |
| Proponowany model XAI | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| Deep Learning (CNN) | 89.1 | 89.8 | 88.1 | 90 | 8.9 | 0.78 | 0.92 | 0.9 |
| Random Forest | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| Maszyna wektorów nośnych (SVM) | 78.6 | 79.3 | 7.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| Baseline (klasa większościowa) | 62.1 | 62.1 | 10 | 0 | 76.6 | 0 | 0.5 | 0.5 |
Tabela 5: Porównanie wydajności predykcyjnej ocenianych modeli. Tabela porównuje proponowany model XAI z ocenianymi modelami bazowymi przy użyciu dokładności, precyzji, czułości, swoistości, wyniku F1, współczynnika korelacji Matthewsa, pola pod krzywą charakterystyki operacyjnej odbiornika oraz średniej precyzji.
| Analiza walidacyjna | Porównanie / Metryka | Test statystyczny | Statystyka testowa | pwartość p | Wynik eksperymentalny / 95% CI |
| Pięciokrotna walidacja krzyżowa | Dokładność | Opisowe (średnia ± SD) | — | — | 93.01 ± 0.48% |
| Pięciokrotna walidacja krzyżowa | AUC-ROC | Opisowe (średnia ± SD) | — | — | 0.954 ± 0.007 |
| Pięciokrotna walidacja krzyżowa | Precyzja | Opisowe (średnia ± SD) | — | — | 92.42 ± 0.87% |
| Pięciokrotna walidacja krzyżowa | Czułość (Recall) | Opisowe (średnia ± SD) | — | — | 93.02 ± 0.45% |
| Pięciokrotna walidacja krzyżowa | wskaźnik F1 | Opisowe (średnia ± SD) | — | — | 92.72 ± 0.62% |
| 95% przedział ufności bootstrapowy | Dokładność | Bootstrap (1 0 re-sampli) | — | — | 0.935 [0.897, 0.973] |
| 95% przedział ufności bootstrapowy | Precyzja | Bootstrap (10 prób wielokrotnych) | — | — | 0.930 [0.890, 0.970] |
| 95% przedział ufności bootstrapowy | Czułość | Bootstrap (1 0 reprobowań) | — | — | 0.922 [0.880, 0.963] |
| 95% przedział ufności bootstrapowy | wskaźnik F1 | Metoda bootstrap (1 0 re-sampli) | — | — | 0.926 [0.887, 0.965] |
| 95% przedział ufności bootstrapowy | AUC-ROC | Bootstrap (10 reprobek) | — | — | 0.958 [0.931, 0.984] |
| Proponowany model a CNN | Dokładność (%) | Test McNemara | 9.32 | 0.0023 | Istotne (α = 0,05) |
| Proponowany model a CNN | AUC-ROC | Test DeLonga | 3.87 | 0.0001 | Istotne (α = 0,05) |
| Proponowany model a CNN | miara F1 | Bootstrapping sparowany (1 0 re-sampli) | 2.81 | 0.0044 | Istotne (α = 0,05) |
| Proponowany model a las losowy | Dokładność (%) | Test McNemara | 14.27 | 0.0002 | Istotne (α = 0,05) |
| Proponowany model a las losowy | AUC-ROC | Test DeLonga | 5.86 | <0.0001 | Istotne (α = 0,05) |
| Proponowany model a las losowy | wskaźnik F1 | Krosowana metoda bootstrapowa (1 0 re-sampli) | 4.03 | 0.0003 | Istotne (α = 0,05) |
| Proponowany model a SVM | Dokładność (%) | Test McNemara | 16.08 | <0.0001 | Istotne (α = 0,05) |
| Proponowany model a SVM | AUC-ROC | test DeLonga | 6.95 | <0.0001 | Istotne (α = 0,05) |
| Proponowany model a SVM | wskaźnik F1 | Sparowany bootstrap (10 reprobacji) | 4.62 | <0.0001 | Istotne (α = 0,05) |
| Powtarzalność serii pomiarowych (10 niezależnych serii) | AUC-ROC | Opisowe (średnia ± SD) | — | — | 0.957 ± 0.008 |
| Powtarzalność serii pomiarowych (10 niezależnych serii) | Dokładność (%) | Opisowe (średnia ± SD) | — | — | 93.24 ± 0.74% |
| Powtarzalność serii pomiarowych (10 niezależnych serii) | miara F1 (%) | Opisowe (średnia ± SD) | — | — | 92.35 ± 0.92% |
Tabela 6: Wyniki walidacji statystycznej i powtarzalności uzyskane z implementacji eksperymentalnej przy użyciu zbioru danych Pima Indians Diabetes Dataset. Tabela podsumowuje wydajność pięciokrotnej walidacji krzyżowej, 95% przedziały ufności oparte na metodzie bootstrap, porównania statystyczne proponowanego modelu z modelami bazowymi oraz powtarzalność w serii powtórzeń przy użyciu 10 niezależnych ziarn losowania. W ramach niniejszej walidacji nie przeprowadzono walidacji zewnętrznej ani oceny eksperckiej klinicznej.
| Nie. | Punkt listy kontrolnej | Wymagana dokumentacja | Zalecane nagrywanie / weryfikacja |
| 1 | Środowisko oprogramowania | System operacyjny, język programowania i środowisko programistyczne | Zapisz dokładne wersje systemu operacyjnego i języka programowania. |
| 2 | Wersje oprogramowania i bibliotek | Wersje głównych bibliotek i pakietów oprogramowania | Zapisz dokładne nazwy i wersje pakietów/bibliotek. |
| 3 | Specyfikacja sprzętowa | Specyfikacje CPU, GPU, pamięci RAM, pamięci masowej i akceleratorów | Zapisz parametry wykorzystanego sprzętu obliczeniowego. |
| 4 | Identyfikacja zbioru danych | Nazwa zbioru danych, źródło, wersja i informacje o dostępie | Należy odnotować dokładne źródło/wersję zbioru danych oraz datę dostępu, jeżeli jest to właściwe. |
| 5 | Charakterystyka zbioru danych | Wielkość próby i rozkład klas | Zapisz całkowitą liczbę próbek oraz rozkład klas dla każdego podziału. |
| 6 | Partycjonowanie zbioru danych | Strategia zbioru treningowego, walidacyjnego i niezależnego zbioru testowego | Zadokumentuj proporcje/liczbę podziałów oraz stratyfikację. |
| 7 | Zapobieganie wyciekom danych | Procedura stosowana w celu zapobiegania wyciekowi informacji | Separacja dokumentów/próbek oraz szacowanie parametrów preprocessingu wyłącznie dla zbioru treningowego. |
| 8 | Parametry przetwarzania wstępnego | Ustawienia czyszczenia, obsługi brakujących wartości, normalizacji, kodowania i transformacji | Należy zarejestrować wszystkie operacje preprocessingu oraz wartości parametrów. |
| 9 | Augmentacja danych | Metody augmentacji i ustawienia parametrów, jeśli mają zastosowanie | Dokumentuj metody, prawdopodobieństwa i zakresy parametrów. |
| 10 | Architektura modelu | Końcowa architektura i konfiguracja modelu | Zdokumentuj typ modelu, warstwy/komponenty, wymiary oraz funkcje aktywacji. |
| 11 | Hiperparametry | Hiperparametry treningu i optymalizacji | Zapisz szybkość uczenia, wielkość partii, optymalizator, liczbę epok, wczesne zatrzymanie oraz dostrojone parametry. |
| 12 | Ziarna losowości | Ziarna losowe wykorzystane w celu zapewnienia powtarzalności wykonania | Zapisz ziarna (seeds) dla podziału danych, inicjalizacji oraz powtórnych uruchomień. |
| 13 | Konfiguracja szkolenia | Procedura trenowania i strategia wyboru modelu | Walidacja dokumentacji, punkty kontrolne i kryteria wyboru modelu. |
| 14 | Metryki oceny | Predefiniowane metryki ewaluacji predykcyjnej i statystycznej | Zapisz wszystkie zgłoszone mierniki wydajności. |
| 15 | Przedziały ufności | Przedziały niepewności dla miar wydajności | Należy udokumentować procedurę szacowania przedziałów ufności (CI) oraz próbek bootstrapowych, jeśli mają one zastosowanie. |
| 16 | Testy statystyczne | Procedury statystyczne do porównywania modeli | Dokumentuj test, statystykę, wartość p, próg istotności oraz założenia. |
| 17 | Analiza powtórnych pomiarów | Niezależne wykonania z użyciem różnych ziarn losowości | Zapisz liczbę powtórzeń oraz średnią ± SD kluczowych parametrów. |
| 18 | Konfiguracja wyjaśnialności | Metody wyjaśnialności i ustawienia parametrów | Dokumentuj SHAP, LIME, Grad-CAM, mechanizmy uwagi, analizy kontrfaktyczne lub inne odpowiednie ustawienia. |
| 19 | Ocena wyjaśnialności | Obiektywna ocena wiarygodności i użyteczności wyjaśnień | Dokumentacja wierności, stabilności, niewierności, lokalizacji oraz ocena ekspercka, jeżeli dotyczy. |
| 20 | Artefakty modelu | Wagi wytrenowanego modelu i pliki konfiguracyjne | Zarchiwizuj finalny wytrenowany model, architekturę/konfigurację oraz informacje dotyczące selekcji. |
| 21 | Dostępność kodu | Kod wymagany do preprocessingu, trenowania, ewaluacji i generowania wyjaśnień | Repozytorium zapisów lub informacje o kontrolowanym dostępie do kodu, jeżeli są dotyczy. |
| 22 | Dokumentacja wykonania | Polecenia, skrypty, pliki konfiguracyjne i instrukcje | Zapisz polecenia i konfigurację niezbędną do odtworzenia schematu postępowania. |
| 23 | Dokumentacja wyjściowa | Prognozy, wyniki ewaluacji, ryciny i wyniki wyjaśnień | Archiwizuj wygenerowane wyniki i powiąż je z odpowiadającym im eksperymentem/uruchomieniem. |
| 24 | Weryfikacja odtwarzalności | Weryfikacja spójności pomiędzy niezależnymi wykonaniami | Porównaj wyniki z powtórzeń i raportuj zdefiniowane miary zmienności. |
Tabela 7: Lista kontrolna powtarzalności dla niezależnej replikacji proponowanego przepływu pracy XAI. Lista kontrolna określa wymagania obliczeniowe, dotyczące zbiorów danych, wstępnego przetwarzania, opracowania modelu, ewaluacji, walidacji statystycznej, wyjaśnialności oraz dokumentacji, które są niezbędne do odtworzenia eksperymentalnego przepływu pracy.