Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Reprodukowalny protokół rozwijania i oceniania wyjaśnialnych sztucznych ram inteligencji w analityce opieki zdrowotnej

93 wyświetleń

DOI:

10.3791/71999

31 lipca 2026

W tym artykule

Podsumowanie

Przedstawiamy tutaj odtwarzalny protokół do opracowywania i oceny modeli wyjaśnialnej sztucznej inteligencji dla analityki opieki zdrowotnej. Przepływ pracy integruje przetwarzanie danych, modelowanie predykcyjne, wyjaśnialność opartą na SHAP-, LIME- i Grad-CAM, ocenę ilościową oraz walidację zorientowaną na człowieka, aby wspierać przejrzyste i godne zaufania podejmowanie decyzji klinicznych.

Streszczenie

Wyjaśnialna Sztuczna Inteligencja (XAI) jest coraz bardziej rozpoznawana jako niezbędne narzędzie do budowy zaufanych systemów AI w opiece zdrowotnej, gdzie przejrzystość i zdolność wyjaśniania decyzji są istotnymi składnikami podejmowania klinicznych decyzji. Niniejsza publikacja przedstawia powtarzalne podejście eksperymentalne do opracowywania i ewaluacji wyjaśnialnych systemów AI dla analityki opieki zdrowotnej. Opracowany potok integruje kroki przetwarzania danych, modelowania predykcyjnego, generowania interpretacji i ewaluacji w jeden bezproblemowy przepływ pracy, który można zastosować zarówno do strukturalnych danych klinicznych, jak i zestawów danych z obrazowania medycznego. Modele uczenia maszynowego zespołowego wykazały wysoką wydajność predykcyjną w strukturalnych zbiorach danych tabelarycznych, podczas gdy modele głębokiego uczenia są skuteczne w uczeniu się złożonych wzorców w danych z obrazowania medycznego. Techniki takie jak SHAP, LIME i Grad-CAM to globalne i lokalne wyjaśnienia, które ułatwiają interpretację modelu. Bardzo pomocne. Ilościowa ocena ramówki obejmuje wiele różnych metryk, takich jak dokładność, precyzja, odzyskanie, wynik F1, ROC-AUC, metryki wyjaśnień, wierność i stabilność. Wyniki wskazują, że gdy warunki eksperymentalne są kontrolowane, ramówka wykazała poprawę wydajności predykcyjnej i jakości wyjaśnień w warunkach ewaluacji eksperymentalnej. Jako dokument przewodni, niniejsza praca wspiera powtarzalność i skalowalność, trwałe wdrażanie przez inne żywe istoty. Ta przejrzysta, zrozumiała dla ludzi inteligencja sztucznna jest fundamentem, na którym wsparcie podejmowania decyzji klinicznych i systemy analityki opieki zdrowotnej zdobywają zaufanie i szerokie zastosowanie.

Wprowadzenie

Inteligencja sztucznna (AI) stała się ważnym elementem współczesnej opieki zdrowotnej poprzez wsparcie diagnozy chorób, prognozowania, stratyfikacji ryzyka, analizy obrazów medycznych oraz podejmowania decyzji klinicznych1. Postępy w uczeniu maszynowym i głębokim nauce umożliwiły systemom opieki zdrowotnej przetwarzanie dużych objętości strukturalizowanych i niestrukturalizowanych danych, często osiągając wydajność predykcyjną zbliżoną lub przewyższającą konwencjonalne podejścia statystyczne2. Mimo tych osiągnięć, wiele modeli AI działa jako złożone systemy typu czarna skrzynka, co utrudnia klinikom i interesariuszom sektora opieki zdrowotnej zrozumienie, jak generowane są prognozy3. Ta niedostateczna przejrzystość może ograniczać zaufanie, przyjęcie i odpowiedzialność w wymagających środowiskach opieki zdrowotnej4,5.

Wyjaśnialna inteligencja sztucznna (XAI) pojawiła się jako obiecujące podejście do poprawy przejrzystości i interpretowalności modeli uczenia maszynowego6. Powszechnie stosowane techniki wyjaśniania, w tym SHAP (Shapley additive explanations), LIME (Local interpretable model-agnostic explanations) i Gradient-weighted class activation mapping (Grad-CAM), zapewniają wgląd w zachowanie modelu poprzez mechanizmy przypisywania cech i wizualnych wyjaśnień7,8,9. Metody te są coraz częściej stosowane w zastosowaniach medycznych w celu wsparcia interpretacji klinicznych, audytów modeli i wsparcia decyzyjnego10,11. Jednak samo wyjaśnianie nie gwarantuje niezawodności, powtarzalności ani przydatności klinicznej. Ostatnie badania wskazują na wyzwania związane z niestabilnością wyjaśnień, wrażliwością na zmiany, ograniczonym weryfikowaniem przez kliników oraz niespójnościami między wynikami wyjaśnień a prawdziwym rozumowaniem modelu12,13,14,15.

Oprócz wyzwań związanych z wyjaśnialnością, powtarzalność pozostaje istotnym problemem w badaniach nad uczeniami maszynowym w opiece zdrowotnej16,17,18. Wiele opublikowanych badań dostarcza ograniczonych informacji dotyczących procedur przetwarzania wstępnego, środowisk oprogramowania, konfiguracji hiperparametrów, strategii walidacji i przepływów pracy implementacyjnych, co utrudnia niezależne powtórzenie19,20,21. Ponadto, badania nad AI w opiece zdrowotnej często koncentrują się na wydajności predykcyjnej, zapewniając jednocześnie ograniczone wytyczne dotyczące oceny jakości wyjaśnień, ewaluacji zorientowanej na klienta i praktycznych kwestii implementacyjnych22. Ograniczenia te mogą utrudniać translację systemów AI z wyjaśniania z środowisk badawczych do rzeczywistych ustawień opieki zdrowotnej23,24,25,26,27.

Obecne XAI w opiece zdrowotnej często oceniają pojedyncze techniki wyjaśniania lub modele predykcyjne w izolacji i rzadko dostarczają zstandardyzowanych protokołów, które integrują przygotowanie danych, modelowanie predykcyjne, ocenę wyjaśnialności, ewaluację zorientowaną na człowieka i zasoby dotyczące powtarzalności28,29,30,31. W konsekwencji, badacze i praktycy mogą napotkać trudności przy odtwarzaniu przepływów pracy, porównywaniu metod wyjaśniania lub ocenie praktycznej przydatności systemów AI z wyjaśnianiem w różnych zbiorach danych i dziedzinach zastosowań w opiece zdrowotnej. Dlatego potrzebny jest kompleksowy i powtarzalny protokół, aby ułatwić spójną implementację, ewaluację i raportowanie przepływów pracy z wyjaśnialną sztuczną inteligencją w opiece zdrowotnej32,33,34,35.

Przedstawiamy protokół powtarzalny do rozwijania, ewaluacji i interpretacji systemów sztucznej inteligencji z wyjaśnianiem w analityce zdrowotnej. Protokół integruje przetwarzanie wstępne danych, modelowanie predykcyjne, ocenę wyjaśnialności przy użyciu SHAP, LIME i Grad-CAM, ewaluację zorientowaną na klienta, procedury walidacji i zasoby dotyczące powtarzalności w jednolitym przepływie pracy. Celem jest zapewnienie zstandardyzowanego ramowania, które wspiera przejrzysty rozwój modeli, ocenę jakości wyjaśnień i powtarzalną implementację w różnorodnych zbiorach danych opieki zdrowotnej36,37,38,39. Metodologiczny wkład tej pracy polega na integracji analityki predykcyjnej, ewaluacji wyjaśnial

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Wszystkie zestawy danych wykorzystane w niniejszym badaniu zostały pobrane z publicznie dostępnych i w pełni zanonimizowanych repozytoriów, w tym z UCI Machine Learning Repository, bazy danych PhysioNet MIMIC-III oraz zbiorów danych NIH Chest X-ray. Nie uzyskano dostępu do żadnych danych umożliwiających identyfikację pacjentów. Badanie zostało przeprowadzone zgodnie z instytucjonalnymi wytycznymi etyki badań dotyczącymi wtórnej analizy publicznie dostępnych, zanonimizowanych danych. Formalna zgoda Komisji Bioetycznej nie była wymagana, ponieważ nie rekrutowano bezpośrednio uczestników będących ludźmi i nie wykorzystano chronionych informacji zdrowotnych.

1. Przegląd schematów eksperymentalnych

  1. Opracować odtwarzalny i wyjaśnialny potok sztucznej inteligencji (XAI) dla przejrzystej analityki w opiece zdrowotnej. Zorganizować przepływ pracy w ramach Warstwy Danych, Warstwy Wstępnego Przetwarzania, Warstwy Modelowania, Warstwy Wyjaśnialności, Warstwy Ewaluacji oraz Warstwy Wizualizacji.
  2. Zintegrować te moduły w jednolity przepływ pracy zdolny do przetwarzania ustrukturyzowanych danych klinicznych, elektronicznej dokumentacji medycznej oraz zestawów danych z obrazowania medycznego.
  3. Zapewnić, aby każdy moduł przyczyniał się do odtwarzalności, interpretowalności, skalowalności oraz standaryzacji realizacji eksperymentów.
  4. Zaprojektować modularną architekturę w sposób wspierający ciągły strumieniowanie danych i zapewnić, aby każdy etap potoku przyczyniał się do odtwarzalności, interpretowalności i skalowalności w całym przepływie pracy eksperymentalnej.

2. Środowisko obliczeniowe i konfiguracja systemu

  1. Przed uruchomieniem przepływu pracy zainstaluj wymagane zależności oprogramowania, otwierając terminal wiersza poleceń i wykonując następujące polecenie:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Przed przystąpieniem do wstępnego przetwarzania danych i opracowywania modelu zweryfikuj pomyślną instalację wszystkich pakietów oprogramowania i potwierdź ich kompatybilność z wersjami wymienionymi w Tabeli Materiałów.
  3. Jako główne środowisko programistyczne wykorzystaj Python 3.11. Zainstaluj i skonfiguruj NumPy 1.26 oraz Pandas 2.1 do manipulacji danymi i zadań inżynierii cech. Zainstaluj Scikit-learn 1.5 do opracowywania i ewaluacji modeli uczenia maszynowego.
  4. Zainstaluj TensorFlow 2.15 do trenowania i wnioskowania modeli głębokiego uczenia. Zainstaluj SHAP 0.46 oraz LIME 0.2.0 do analizy wyjaśnialności. Zainstaluj OpenCV 4.10 do zadań przetwarzania obrazów. Zainstaluj Matplotlib 3.9 oraz Seaborn 0.13 do wizualizacji danych i raportowania wyników. Szczegółowe specyfikacje oprogramowania i szczegóły implementacji niezbędne do odtworzenia wyników znajdują się w Tabeli Materiałów.
  5. Skonfiguruj środowisko obliczeniowe, korzystając ze stacji roboczej wyposażonej w procesor wielordzeniowy, akcelerację jednostką przetwarzania graficznego (GPU) oraz zasoby pamięci wystarczające do obsługi dużych zbiorów danych medycznych i obciążeń związanych z głębokim uczeniem.
  6. Ustaw stałe ziarna losowości (random seeds) dla partycjonowania danych, inicjalizacji modelu i procedur trenowania, aby zapewnić odtwarzalność pomiędzy seriami eksperymentów. Włącz mechanizmy logowania w celu rejestrowania operacji wstępnego przetwarzania danych, konfiguracji modeli, ustawień hiperparametrów, procedur trenowania i wyników ewaluacji w całym przepływie pracy.
  7. Skonfiguruj architektury modeli, parametry optymalizacji, szybkości uczenia, rozmiary partii (batch sizes), ustawienia trenowania i wartości hiperparametrów zgodnie ze specyfikacjami podsumowanymi w Tabeli 1. Przestrzegaj tych ustawień podczas eksperymentów replikacyjnych, aby zapewnić spójność z raportowanymi wynikami.
  8. Oczekiwany wynik – w pełni skonfigurowane i odtwarzalne środowisko obliczeniowe z wszystkimi wymaganymi pakietami oprogramowania, zasobami sprzętowymi, mechanizmami logowania i ustawieniami konfiguracji modelu, gotowe do późniejszego wstępnego przetwarzania danych, opracowywania modelu, analizy wyjaśnialności i procedur ewaluacji.
KomponentParametrWartośćOpis
Las Losowyliczba estymatorów100Liczba drzew
Losowy Lasmaksymalna głębokośćProszę podać tekst źródłowy do tłumaczenia.Głębokość drzewa
XGBoostwskaźnik uczenia0.01Szybkość uczenia
XGBoostliczba estymatorów100Rundy wzmacniające
CNN (konwolucyjna sieć neuronowa)epoki25Epoki trenowania
CNNwielkość partii32Wielkość partii
CNNoptymalizatorAdamAlgorytm optymalizacji
MLP (wielowarstwowy perceptron)warstwy ukryte2Liczba warstw ukrytych
wielowarstwowy perceptronaktywacjaReLU (liniowa jednostka prostowana)Funkcja aktywacji
Ogólnepodział zbioru treningowego70%Stosunek danych treningowych
Ogólnepodział walidacyjny15%Współczynnik walidacji
Ogólnepodział_zbioru_testowego15%Wskaźnik testowy

Tabela 1: Szczegóły implementacji i konfiguracja hiperparametrów.

W poniższej tabeli podsumowano środowisko obliczeniowe, biblioteki programowe, konfiguracje modeli uczenia maszynowego i głębokiego uczenia, ustawienia optymalizacji, szybkości uczenia, rozmiary partii, parametry treningowe oraz wartości hiperparametrów wykorzystane podczas ewaluacji eksperymentalnej proponowanego wyjaśnialnego frameworka AI.

3. Przygotowanie i wstępne przetwarzanie zbioru danych

  1. Wybierz publicznie dostępne zbiory danych z zakresu opieki zdrowotnej, aby zapewnić przejrzystość i powtarzalność przepływu pracy eksperymentalnej.;
  2. Wykorzystaj cztery reprezentatywne scenariusze opieki zdrowotnej w celu walidacji proponowanego schematu: (i) diagnostyka raka piersi z wykorzystaniem Wisconsin Breast Cancer Dataset, (ii) przewidywanie ryzyka cukrzycy z wykorzystaniem Pima Indians Diabetes Dataset, (iii) przewidywanie wyników klinicznych z wykorzystaniem elektronicznej dokumentacji medycznej MIMIC-III oraz (iv) klasyfikacja chorób klatki piersiowej z wykorzystaniem NIH Chest X-ray Dataset. Wybierz te zbiory danych, aby ocenić schemat w odniesieniu do ustrukturyzowanych rekordów klinicznych, podłużnej elektronicznej dokumentacji medycznej oraz obrazowania medycznego, powszechnie stosowanych w systemach wspomagania decyzji w opiece zdrowotnej.
  3. Zaimportuj każdy zbiór danych do środowiska Python i rozdziel rekordy na cechy wejściowe oraz zmienne celu. Zorganizuj ustrukturyzowane dane kliniczne dla zadań przewidywania chorób, elektroniczną dokumentację medyczną dla podłużnej analizy wyników oraz zbiory obrazowania medycznego dla zadań klasyfikacji diagnostycznej. Zweryfikuj integralność każdego zbioru danych przed przystąpieniem do operacji preprocessingu.
  4. Zidentyfikuj i uzupełnij brakujące wartości, stosując odpowiednie techniki imputacji. Zestandaryzuj cechy numeryczne poprzez procedury skalowania i normalizacji cech, aby zapewnić porównywalność zmiennych.
  5. Zakoduj zmienne kategoryczne, stosując odpowiednie metody kodowania w zależności od charakterystyki zbioru danych. Przeprowadź selekcję cech za pomocą analizy korelacji i miar istotności cech opartych na modelu, aby zidentyfikować najistotniejsze zmienne i zredukować wymiarowość danych.
  6. Zmień rozmiar wszystkich obrazów medycznych do 224, 224 pikseli przed trenowaniem modelu. Znormalizuj wartości intensywności pikseli zgodnie z wymaganiami wybranej architektury głębokiego uczenia. Zastosuj techniki augmentacji danych, w tym rotację obrazu i poziome odbicie lustrzane, aby poprawić generalizację modelu i zmniejszyć przeuczenie. Zweryfikuj jakość obrazów i zapewnij spójność wymiarów obrazów w całym zbiorze danych.
  7. Oceń integralność danych, analizując kompletność zbioru danych, spójność oraz dopasowanie cech do etykiet. Zweryfikuj, czy wszystkie rekordy zostały prawidłowo przypisane do odpowiadających im klas celu. Przejrzyj charakterystykę zbioru danych, w tym wielkość próby, liczbę cech i modalność danych, zgodnie z podsumowaniem w Tabeli 2.
  8. Wdróż procedury walidacji specyficzne dla danego zbioru danych, aby zapewnić rygor metodologiczny i powtarzalność. Zapisz wielkość próby, rozkład klas, strategię podziału na zbiory treningowy, walidacyjny i testowy, środki zapobiegające wyciekowi danych, procedury optymalizacji hiperparametrów, projekt walidacji krzyżowej oraz protokół testowania zewnętrznego dla każdego zbioru danych. Podsumuj te procedury walidacji w Tabeli 3.
  9. Przeprowadź kontrolę jakości preprocessingu, oceniając obsługę brakujących wartości, usuwanie wartości odstających, skalowanie cech, kodowanie kategoryczne, zachowanie rozkładu klas oraz procedury partycjonowania zbioru danych. Zweryfikuj, czy operacje preprocessingu są stosowane spójnie we wszystkich zbiorach danych.
  10. Potwierdź brak istotnego wycieku danych podczas partycjonowania zbioru danych. Przeanalizuj wyniki walidacji preprocessingu przedstawione na Rysunku 1, aby upewnić się, że wygenerowano zestandaryzowane zbiory danych do późniejszych analiz uczenia maszynowego i wyjaśnialności.
  11. Oczekiwany wynik – wygenerowanie oczyszczonych i zestandaryzowanych zbiorów danych z odpowiednio uzupełnionymi brakującymi wartościami, zakodowanymi zmiennymi kategorycznymi, znormalizowanymi cechami numerycznymi oraz rekordami podzielonymi na podzbiory treningowe, walidacyjne i testowe. Upewnij się, że charakterystyka zbioru danych, rozkłady klas i procedury walidacji odpowiadają tym raportowanym w Tabeli 2 i Tabeli 3, oraz potwierdź pomyślną walidację preprocessingu, jak zilustrowano na Rysunku 1.
Zbiór danychTypPróbkiCechyCel
Rak piersiTabularny56930Łagodny/Złośliwy
CukrzycaTabularny7688Wynik choroby cukrzycowej
MIMIC-IIIelektroniczna dokumentacja medyczna~60,000Zmienne kliniczneŚmiertelność
RTG klatki piersiowejObrazowanie~112,000ObrazyEtykiety chorób

Tabela 2: Charakterystyka zbiorów danych i przypadki użycia w opiece zdrowotnej.

Tabela ta zawiera podsumowanie zbiorów danych z zakresu opieki zdrowotnej wykorzystanych w badaniu, w tym typ zbioru danych, liczbę próbek, liczbę cech, zmienne docelowe, domenę zastosowań w opiece zdrowotnej oraz powiązane kliniczne przypadki użycia. Zbiory danych obejmują ustrukturyzowane rekordy kliniczne, elektroniczną dokumentację medyczną oraz dane z obrazowania medycznego, aby zademonstrować możliwość zastosowania struktury w różnych scenariuszach analityki opieki zdrowotnej.

Zbiór danychWielkość próbyRozkład klasStrategia podziałuZapobieganie wyciekomWyszukiwanie hiperparametrówWalidacja krzyżowaTest zewnętrzny
Rak piersi (UCI Wisconsin)569357 łagodne / 212 złośliwe70/15/15Preprocessing wyłącznie dla zbioru treningowegoPrzeszukiwanie siatki (Grid Search)5-krotna stratyfikowana walidacja krzyżowaNiezależny zbiór walidacyjny
Cukrzyca u Indian Pima768500 osób bez cukrzycy / 268 osób z cukrzycą70/15/15Preprocessing tylko dla zbioru treningowegoPrzeszukiwanie siatki5-krotna stratyfikowana walidacja krzyżowaNiezależny zbiór walidacyjny
Elektroniczna Dokumentacja Medyczna (EHR) MIMIC-III5274Kohorty stratyfikowane według wyników70/15/15 na poziomie pacjentaSeparacja na poziomie pacjentaLosowe przeszukiwanie5-krotna walidacja krzyżowa na poziomie pacjentaNiezależny zbiór walidacyjny
RTG klatki piersiowej NIH112120Zapalenie płuc/Normalna tkanka wielowarstwowa70/15/15Separacja na poziomie obrazuLosowe przeszukiwanie5-krotna stratyfikowana walidacja krzyżowaNiezależny zbiór walidacyjny

Tabela 3: Walidacja na poziomie zbioru danych i projekt eksperymentalny.

W poniższej tabeli podsumowano metodologię walidacji zastosowaną dla każdego zbioru danych, w tym wielkość próby, rozkład klas, strategię podziału na zbiory treningowy, walidacyjny i testowy, procedury zapobiegania wyciekowi danych, metody optymalizacji hiperparametrów, projekt walidacji krzyżowej oraz protokoły testów zewnętrznych. Środki te zostały wdrożone w celu zapewnienia rygoru metodologicznego, powtarzalności oraz bezstronnej oceny modelu.

Wstępne przetwarzanie danych dla uczenia maszynowego; wykresy; obsługa brakujących wartości i wartości odstających, skalowanie, kodowanie.
Rysunek 1: Walidacja potoku wstępnego przetwarzania danych.
Wyniki walidacji kluczowych operacji wstępnego przetwarzania wykonanych przed opracowaniem modelu. (A) Analiza brakujących wartości w reprezentatywnych cechach opieki zdrowotnej. (B) Rozkład zmiennej numerycznej przed i po obsłudze wartości odstających. (C) Walidacja skalowania cech z wykorzystaniem standaryzacji. (D) Walidacja kodowania kategorycznego. (E) Rozkład klas po wstępnym przetwarzaniu. (F) Walidacja podziału danych na zbiory treningowy, walidacyjny i testowy. Wyniki te potwierdzają pomyślne wstępne przetwarzanie i przygotowanie zbiorów danych do modelowania predykcyjnego oraz analizy wyjaśnialności. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

4. Architektura systemu ramowego wyjaśnialnej sztucznej inteligencji (Explainable AI)

  1. Zorganizuj strukturę w oparciu o architekturę warstwową, aby ułatwić modułowe przetwarzanie, poprawić przejrzystość przepływu pracy i wesprzeć odtwarzalność implementacji. Skonfiguruj warstwę danych (Data Layer) do odbierania i zarządzania surowymi zbiorami danych medycznych. Kieruj wszystkie przychodzące zbiory danych przez warstwę danych przed rozpoczęciem operacji wstępnego przetwarzania.
  2. Przeprowadź procedury czyszczenia, transformacji, normalizacji, inżynierii cech i kodowania danych w warstwie wstępnego przetwarzania (Preprocessing Layer). Upewnij się, że wszystkie operacje wstępnego przetwarzania zostały zakończone przed przystąpieniem do opracowywania modelu.
  3. Opracuj modele predykcyjne w warstwie modelowania (Modeling Layer), wykorzystując algorytmy uczenia maszynowego i głębokiego uczenia. Wytrenuj modele Gradient Boosting, Random Forest, wielowarstwowy perceptron (MLP) oraz splotową sieć neuronową (CNN), wykorzystując przetworzone zbiory danych i zoptymalizowane konfiguracje hiperparametrów.
  4. Zastosuj techniki wyjaśnialności w warstwie wyjaśnialności (Explainability Layer) w celu interpretacji predykcji modelu. Generuj wyjaśnienia atrybucji cech za pomocą SHAP i LIME dla ustrukturyzowanych zbiorów danych. Generuj mapy ciepła Grad-CAM dla modeli opartych na obrazach, aby zwizualizować obszary wpływające na predykcje modelu.
  5. Oceń wydajność predykcyjną i wyjaśnialność w warstwie ewaluacji (Evaluation Layer). Oblicz dokładność (accuracy), precyzję (precision), czułość (recall), wynik F1 (F1-score), ROC-AUC, wierność (fidelity), stabilność oraz metryki oceny zorientowane na klinicystę. Zapisz wszystkie wyniki ewaluacji do późniejszej analizy i raportowania.
  6. Generuj klinicznie interpretowalne wyniki wizualne w warstwie wizualizacji (Visualization Layer). Twórz wykresy porównawcze wydajności, wizualizacje istotności cech, zbiorcze wykresy SHAP, wyjaśnienia LIME, mapy ciepła Grad-CAM oraz pulpity raportowe dla klinicystów. Przechowuj wszystkie wyniki wizualne w celu dołączenia ich do końcowego raportu eksperymentalnego.
  7. Przejrzyj kompletną architekturę struktury przedstawioną na Rysunku 2 przed rozpoczęciem realizacji przepływu pracy.
  8. Oczekiwany wynik – wygenerowanie w pełni wytrenowanych modeli uczenia maszynowego i głębokiego uczenia, w tym architektur Gradient Boosting, Random Forest, CNN i MLP. Przechowuj konfiguracje modeli, zoptymalizowane hiperparametry, logi treningowe, pliki punktów kontrolnych (checkpoint), wyniki wyjaśnialności oraz artefakty wizualizacji do późniejszej ewaluacji i analizy interpretowalności.

Przepływ przetwarzania danych z warstwami: dane, wstępne przetwarzanie, modelowanie, wyjaśnialność, wizualizacja.
Rysunek 2: Architektura systemu ramowego wyjaśnialnej sztucznej inteligencji (Explainable AI) dla analityki opieki zdrowotnej. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

5. Wykonanie przepływu pracy

  1. Pobrać zestawy danych z zakresu opieki zdrowotnej z publicznie dostępnych repozytoriów i zapisać je w ustrukturyzowanych formatach odpowiednich do analizy za pomocą uczenia maszynowego i głębokiego uczenia. Przed rozpoczęciem procedury eksperymentalnej zapoznać się z pełnym schematem postępowania przedstawionym na Rysunku 3.
  2. Przeprowadzić oczyszczanie i wstępne przetwarzanie danych zgodnie z procedurami opisanymi w sekcji 3. Znormalizować zmienne numeryczne przy użyciu odpowiednich metod skalowania. Zakodować zmienne kategoryczne za pomocą właściwych technik kodowania. Zidentyfikować i uzupełnić brakujące wartości, stosując strategie imputacji specyficzne dla danego zbioru danych. Przed przystąpieniem do opracowania modelu zweryfikować jakość danych, spójność cech z etykietami oraz kompletność zbioru danych.
  3. Podzielić każdy zbiór danych na podzbiory treningowe, walidacyjne i testowe, aby zapewnić obiektywną ocenę modelu. Zachować rozkład klas podczas podziału zbioru danych i wdrożyć środki zapobiegające wyciekowi danych (leakage), jeśli jest to możliwe. Podzbiór testowy zarezerwować wyłącznie do końcowej oceny modelu.
  4. Wytrenować modele uczenia maszynowego na ustrukturyzowanych zbiorach danych, korzystając z algorytmów zespołowych, w tym Gradient Boosting oraz Random Forest. Wytrenować modele głębokiego uczenia na zbiorach danych obrazowych, wykorzystując architektury splotowych sieci neuronowych (CNN) zdolnych do uczenia się przestrzennych cech obrazu. Iteracyjnie aktualizować parametry modelu podczas trenowania i monitorować wyniki walidacji po każdej epoce treningowej. Zastosować mechanizm wczesnego zatrzymania (early stopping), gdy wyniki walidacji pogorszą się lub przestaną ulegać poprawie zgodnie z predefiniowanymi kryteriami zatrzymania.
  5. Zoptymalizować hiperparametry modelu za pomocą systematycznych strategii przeszukiwania, w tym grid search oraz randomized search. Dostosować szybkość uczenia (learning rate), liczbę estymatorów, głębokość drzew, wielkość partii (batch size), liczbę epok oraz inne parametry specyficzne dla modelu w oparciu o wyniki walidacji. Wybrać końcowy model na podstawie zdolności predykcyjnych i możliwości generalizacji w odniesieniu do zbiorów walidacyjnych.
  6. Zastosować metody wyjaśnialności po zakończeniu trenowania modelu. Wygenerować wyjaśnienia globalne przy użyciu technik atrybucji cech w celu zidentyfikowania zmiennych, które mają najsilniejszy wpływ na predykcje modelu. Wygenerować wyjaśnienia lokalne, aby przeanalizować poszczególne przypadki predykcji i ocenić zachowanie modelu na poziomie pojedynczej próbki. Utworzyć mapy ciepła Grad-CAM dla modeli klasyfikacji obrazów, aby wyróżnić obszary obrazu wpływające na przewidziany wynik. Zapisać wszystkie wyniki wyjaśnień do późniejszej analizy i raportowania.
  7. Ocenić wydajność predykcyjną za pomocą wskaźników dokładności (accuracy), precyzji (precision), pełności (recall), miary F1 (F1-score) oraz pola pod krzywą charakterystyki pracy odbiornika (ROC-AUC). Ocenić jakość wyjaśnień za pomocą metryk wierności (fidelity) i stabilności, aby zweryfikować wiarygodność i spójność wyjaśnień. Porównać wydajność modelu w różnych zbiorach danych i metodach wyjaśnialności, aby ocenić odporność i generalizowalność opracowanego schematu.
  8. Wygenerować wyniki wizualizacji i raporty analityczne, aby przedstawić wyniki w sposób interpretowalny klinicznie. Utworzyć wykresy porównawcze wydajności, wykresy istotności cech, wizualizacje podsumowujące SHAP, wyniki wyjaśnień LIME, mapy ciepła Grad-CAM oraz inne istotne klinicznie wizualizacje. Przejrzeć wszystkie wyniki wizualne, aby zapewnić ich przejrzystość i spójność przed raportowaniem.
  9. Udokumentować wszystkie operacje wstępnego przetwarzania, konfiguracje modeli, ustawienia hiperparametrów, procedury wyjaśnialności, strategie walidacji oraz wyniki oceny. Prowadzić szczegółową dokumentację eksperymentalną w celu umożliwienia reprodukowalności i niezależnej replikacji schematu postępowania. Zweryfikować spójność wyników w powtórzonych seriach eksperymentalnych i zarchiwizować wszystkie artefakty procesu do przyszłych referencji.
  10. Oczekiwany wynik – wygenerowanie w pełni wytrenowanego modelu predykcyjnego z zoptymalizowanymi hiperparametrami, zapisanych wag modelu, logów treningowych, metryk wydajności oraz wyników wyjaśnialności, w tym wyjaśnień SHAP, wyjaśnień LIME i map ciepła Grad-CAM. Zapisać wszystkie artefakty modelu, raporty z oceny i wyniki wizualizacji do późniejszej analizy i oceny reprodukowalności.

Schemat przepływu przetwarzania danych z warstwami modelowania, wyjaśnialności, oceny i prognoz.
Rycina 3: Kompleksowy schemat przepływu rurociągu wyjaśnialnej sztucznej inteligencji (Explainable AI). Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

6. Ewaluacja modelu i ocena wyjaśnialności

  1. Oceń wydajność modelu predykcyjnego przy użyciu standardowych metryk klasyfikacji, w tym dokładności (accuracy), precyzji (precision), czułości (recall), wyniku F1 (F1-score) oraz pola pod krzywą charakterystyki operacyjnej odbiornika (ROC-AUC). Oblicz dokładność, aby zmierzyć ogólną poprawność klasyfikacji.
  2. Oblicz precyzję, aby ocenić proporcję poprawnie zidentyfikowanych predykcji pozytywnych. Oblicz czułość, aby ocenić zdolność modelu do identyfikacji przypadków pozytywnych. Oblicz wynik F1, aby zrównoważyć precyzję i czułość. Oblicz ROC-AUC, aby ocenić zdolność dyskryminacyjną przy różnych progach klasyfikacji.
  3. Zastosuj te metryki oceny konsekwentnie we wszystkich zbiorach danych i architekturach modeli, aby ułatwić obiektywne porównanie wydajności. Zapisz wszystkie wartości metryk i przechowuj wyniki oceny do późniejszej analizy statystycznej i raportowania.
  4. Oceń wydajność wyjaśnialności przy użyciu metryk wierności (fidelity) i stabilności (stability). Oblicz wierność, aby określić stopień, w jakim wygenerowane wyjaśnienia dokładnie odzwierciedlają predykcje modelu i mechanizmy podejmowania decyzji.
  5. Oblicz stabilność, porównując wyjaśnienia wygenerowane z podobnych próbek wejściowych i kwantyfikując spójność wyników wyjaśnień. Zweryfikuj, czy wartości wierności i stabilności spełniają zdefiniowane kryteria jakości przed interpretacją wyjaśnień modelu.
  6. Porównaj wydajność wyjaśnialności wyników uzyskanych za pomocą SHAP, LIME i Grad-CAM.
  7. Oczekiwany wynik – wygeneruj ilościowe wyniki oceny, w tym metryki dokładności, precyzji, czułości, wyniku F1, ROC-AUC, wierności i stabilności. Przygotuj wyniki wyjaśnialności oraz wizualizacje odpowiednie do raportowania naukowego, oceny powtarzalności i interpretacji klinicznej.

7. Ewaluacja zorientowana na człowieka

  1. Zrekrutuj 12 pracowników ochrony zdrowia, w tym 6 lekarzy, 3 radiologów oraz 3 analityków danych klinicznych. Wybierz uczestników z wcześniejszym doświadczeniem w podejmowaniu decyzji klinicznych, interpretacji obrazów medycznych, analityce opieki zdrowotnej lub przeglądzie elektronicznej dokumentacji medycznej. Uzyskaj świadomą zgodę od wszystkich uczestników przed rozpoczęciem procedury oceny.
  2. Po zakończeniu trenowania modelu i analizy wyjaśnialności, losowo wybierz 100 przypadków ze zbiorów testowych. Wygeneruj dwa warunki oceny dla każdego przypadku:
    1. wynik zawierający tylko predykcję oraz
    2. predykcję wraz z informacjami dotyczącymi wyjaśnialności. Zrandomizuj kolejność prezentacji przypadków i warunków oceny, aby zminimalizować błąd prezentacji oraz efekty uczenia się.
  3. Przygotuj zestandaryzowane formularze oceny zawierające wyniki predykcji, wyniki wyjaśnień oraz kwestionariusze oceny. Prezentuj przypadki uczestnikom indywidualnie, korzystając z komputerowego interfejsu oceny.
  4. Poleć uczestnikom samodzielne przeanalizowanie każdego przypadku bez omawiania odpowiedzi z innymi oceniającymi. Umożliw uczestnikom przeprowadzenie wszystkich ocen w identycznych warunkach eksperymentalnych.
  5. Przeprowadź ankietę w pięciostopniowej skali Likerta, dostosowaną do opublikowanych badań nad oceną wyjaśnialnej sztucznej inteligencji. Poleć uczestnikom ocenę zaufania, interpretowalności i użyteczności dla każdego analizowanego przypadku. Zapisz odpowiedzi z kwestionariuszy elektronicznie i zweryfikuj wypełnienie wszystkich punktów ankiety przed przejściem do analizy statystycznej.
  6. Podczas procesu oceny zmierz obiektywne wskaźniki użyteczności klinicznej. Zarejestruj zgodność decyzji poprzez porównanie decyzji uczestników z odpowiadającymi im etykietami referencyjnymi lub wynikami rzeczywistymi (ground-truth). Oblicz zgodność decyzji jako procent decyzji uczestników zgodnych z wynikiem referencyjnym.
  7. Zarejestruj czas analizy każdego przypadku, mierząc odstęp między prezentacją przypadku a przesłaniem końcowej odpowiedzi. Oblicz średni czas analizy oddzielnie dla warunku tylko predykcji oraz warunku predykcji z wyjaśnieniem.
  8. Oblicz średnie wyniki zaufania, interpretowalności i użyteczności dla wszystkich uczestników i przypadków oceny. Porównaj wyniki uzyskane w warunku tylko predykcji oraz w warunku predykcji z wyjaśnieniem.
  9. Po zakończeniu wszystkich ocen uczestników przeprowadź sparowane testy t, aby ustalić, czy różnice w zaufaniu, interpretowalności, użyteczności, zgodności decyzji i czasie analizy są istotne statystycznie. Przyjmij próg istotności p 0.05 dla wszystkich porównań statystycznych.
  10. Po zebraniu odpowiedzi od wszystkich uczestników oblicz współczynnik Kappa Fleissa w celu oceny zgodności między sędziami. Wykorzystaj zagregowane oceny uczestników, aby określić spójność ocen poszczególnych recenzentów. Zinterpretuj wartości Kappa Fleissa zgodnie z uznanymi wytycznymi dotyczącymi zgodności i zapisz wynikowe statystyki zgodności.
  11. Podsumuj dane demograficzne uczestników, metodologię oceny, projekt kwestionariusza, procedury analizy statystycznej, obiektywne miary wydajności oraz wyniki zgodności między sędziami w Tabeli 4.
  12. Przeanalizuj wyniki modelu w obu warunkach oceny i porównaj odpowiedzi uczestników pomiędzy tymi warunkami. Zweryfikuj, czy wyjaśnienia zwiększają zaufanie, interpretowalność i użyteczność, nie wpływając negatywnie na jakość decyzji.
  13. Potwierdź spójność ocen uczestników, korzystając z obliczonej statystyki Kappa Fleissa. Zapisz wszystkie wyniki oceny do późniejszego raportowania i oceny powtarzalności.
  14. Oczekiwany wynik – Wygeneruj wyniki zaufania klinicystów, oceny interpretowalności, oceny użyteczności, miary zgodności decyzji, statystyki czasu analizy, wyniki sparowanych testów t oraz statystyki zgodności między sędziami. Przedstaw ilościowe dowody opisujące użyteczność kliniczną, interpretowalność i wiarygodność frameworka wyjaśnialnej sztucznej inteligencji.
ParametrWartość
Eksperci12
Lekarze6
Radiolodzy3
Analitycy danych klinicznych3
Analiza przypadków100
Projekt ewaluacjiRandomizowane (tylko predykcja vs predykcja + wyjaśnienie)
Narzędzie badawcze5-stopniowa skala Likerta
Ocena zaufaniaInterpretowalność, zaufanie, użyteczność
Test statystycznyTest t dla prób zależnych (p < 0,05)
Rzetelność międzyosobowaKappa Fleissa
Obiektywne miaryZgodność decyzji, czas recenzji

Tabela 4: Protokół oceny zorientowanej na człowieka i projekt oceny klinicznej.

Tabela ta przedstawia ramy oceny klinicznej wykorzystane do analizy interpretowalności, wiarygodności oraz użyteczności systemu wyjaśnialnej sztucznej inteligencji (explainable AI). Podsumowano w niej informacje dotyczące demografii uczestników, metodologii przeglądu przypadków, projektu ankiety, procedur analizy statystycznej, oceny niezawodności między sędziami oraz obiektywnych miar ewaluacji.

8. Walidacja i ocena powtarzalności

  1. Przeprowadź badania walidacyjne i ablacyjne w celu oceny odporności i niezawodności proponowanego modelu. Zidentyfikuj cechy o wysokich wynikach istotności, korzystając z wybranych metod wyjaśnialności. Usuwaj istotne cechy stopniowo i ponownie trenuj modele predykcyjne po każdym etapie usunięcia cechy.
  2. Oceń wydajność modelu po każdym eksperymencie ablacyjnym, korzystając z metryk dokładności (accuracy), precyzji (precision), pełności (recall), wyniku F1 (F1-score) oraz ROC-AUC. Porównaj uzyskane wartości wydajności z wydajnością modelu bazowego, aby określić wkład poszczególnych cech w wyniki predykcyjne.
  3. Oceń stabilność wyjaśnień poprzez generowanie wyjaśnień dla podobnych próbek wejściowych przy użyciu SHAP, LIME i Grad-CAM. Porównaj wyniki wyjaśnień w ramach powtórzonych ewaluacji i określ spójność, korzystając z predefiniowanych metryk stabilności. Zweryfikuj, czy wyjaśnienia pozostają stabilne przy niewielkich zmianach danych wejściowych i powtórzonych przebiegach eksperymentalnych.
  4. Zarejestruj wszystkie procedury eksperymentalne w całym przepływie pracy. Udokumentuj operacje wstępnego przetwarzania danych, procedury podziału zbioru danych, architektury modeli, ustawienia hiperparametrów, konfiguracje trenowania, metody wyjaśnialności, strategie walidacji oraz metryki oceny. Przechowuj wszystkie parametry konfiguracji i wyniki eksperymentalne w ustrukturyzowanym formacie, aby ułatwić reprodukowalność i niezależną weryfikację.
  5. Przejrzyj wszystkie zapisy eksperymentalne, aby zapewnić ich kompletność i spójność. Zweryfikuj, czy przepływ pracy może zostać powtórzony przy użyciu udokumentowanych procedur, plików konfiguracyjnych i specyfikacji oprogramowania. Utrzymuj modularną strukturę przepływu pracy, aby ułatwić adaptację protokołu w przyszłych badaniach i wesprzeć konwersję na wideo-protokół eksperymentalny zgodny z wymogami metodologicznymi JoVE.

9. Zasoby dotyczące powtarzalności

  1. Wszystkie eksperymenty należy przeprowadzać przy użyciu stałych ziarn losowości (random seeds), aby zapewnić powtarzalność wyników w kolejnych uruchomieniach. Kod źródłowy, skrypty preprocessingu, pliki konfiguracyjne, specyfikacje środowiska, parametry modelu oraz skrypty wizualizacji należy przechowywać w publicznie dostępnym repozytorium.
  2. Należy dostarczyć szczegółowe instrukcje dotyczące pozyskiwania zbiorów danych, preprocessingu, przeprowadzania eksperymentów, trenowania modeli, generowania wyjaśnień (explainability), procedur walidacji oraz odtwarzania wszystkich raportowanych tabel i rysunków. Wszystkie komponenty przepływu pracy niezbędne do niezależnej replikacji należy zarchiwizować, w tym specyfikacje oprogramowania, przepływy pracy preprocessingu, pliki konfiguracyjne, instrukcje dostępu do zbiorów danych, punkty kontrolne (checkpoints) modelu oraz zasoby wizualizacyjne.
  3. Zasoby oprogramowania, przepływy pracy preprocessingu, pliki konfiguracyjne, instrukcje dostępu do zbiorów danych oraz zasoby zapewniające powtarzalność wykorzystane w ramach struktury zestawiono w Tabeli 5.
  4. Oczekiwany wynik- Wygenerowanie kompletnego, powtarzalnego pakietu eksperymentalnego zawierającego skrypty preprocessingu, pliki konfiguracyjne, wytrenowane modele, punkty kontrolne modelu, wyniki wyjaśnień, raporty z walidacji, artefakty wizualizacyjne, specyfikacje oprogramowania oraz dokumentację niezbędną do niezależnej replikacji i weryfikacji proponowanej struktury.
ZasóbOpis
Kod źródłowySkrypty implementacyjne w języku Python do wstępnego przetwarzania danych, trenowania modelu, wyjaśnialności i ewaluacji
Plik środowiskowyplik requirements.txt zawierający zależności pakietów i ich wersje
Pliki konfiguracyjneUstawienia architektury modelu, hiperparametry i konfiguracje eksperymentów
Stałe ziarna liczb pseudolosowychUżyto ziarna (seed) = 42 w celu zapewnienia powtarzalności eksperymentów
Instrukcje dostępu do zbioru danychLinki i procedury pozyskiwania publicznych zbiorów danych z zakresu opieki zdrowotnej
Skrypty do wstępnego przetwarzaniaSkrypty do czyszczenia, normalizacji, kodowania i selekcji cech danych
Skrypty do generowania rycinSkrypty do regeneracji wszystkich rycin do manuskryptu
Skrypty do generowania tabelSkrypty do reprodukcji przedstawionych tabel i wskaźników
Przykładowe dane wejściowePrzykładowe zestawy danych i pliki wejściowe
Przykładowe wynikiWyniki predykcji, objaśnienia i raporty ewaluacyjne

Tabela 5: Zasoby do odtwarzalności i materiały eksperymentalne.

Tabela ta podsumowuje zasoby udostępnione w celu zapewnienia powtarzalności eksperymentalnej, w tym kod źródłowy, skrypty do wstępnego przetwarzania danych, pliki konfiguracyjne, specyfikacje środowiska, instrukcje dostępu do zbiorów danych, ustawienia stałego ziarna generatora liczb pseudolosowych, skrypty do generowania rycin oraz przykładowe pliki wejściowe i wyjściowe niezbędne do odtworzenia przedstawionych wyników.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Dokładnie oceniliśmy komponent wyjaśnialnej sztucznej inteligencji (AI) w całym naszym potoku przetwarzania, analizując skuteczność predykcji dla różnych typów danych opieki zdrowotnej, w tym ustrukturyzowanych danych klinicznych oraz obrazów medycznych. Wyniki wykazały spójną wydajność predykcyjną we wszystkich ocenianych zbiorach danych. spośród przetestowanych modeli, model wzmacniania gradientowego (gradient boosting) osiągnął najwyższą dokładność na poziomie 97,4%, a następnie model lasu losowego (random forest) z w...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

To badanie opracowało i oceniło spostrzegalny przepływ pracy sztucznej inteligencji z możliwością wyjaśnienia (XAI) dla analityki opieki zdrowotnej, który integruje modelowanie predykcyjne, ocenę możliwości wyjaśnienia, ocenę ukierunkowaną na klinicyna i zasoby dotyczące powtarzalności w jednym protokole. Wyniki wykazały, że modele uczenia maszynowego oparte na ensemblu, szczególnie Gradient Boosting i Random Forest, osiągnęły najwyższą wydajność predykcyjną na ocenionych strukturalnych zbiorach danych dotyczących opieki...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy deklarują, że nie mają żadnych konkurencyjnych interesów finansowych ani konfliktów interesów związanych z tą pracą. Badania przeprowadzono niezależnie bez żadnych komercyjnych lub finansowych relacji, które mogłyby być uznane za potencjalny konflikt interesów.

Deklaracja użycia sztucznej inteligencji

Narzędzia sztucznej inteligencji zostały wykorzystane do doskonalenia języka, sprawdzania gramatyki i pomocy edytorskiej podczas przygotowywania rękopisu. Cały naukowy treść, projekt eksperymentu, analiza danych, interpretacja i ostateczna weryfikacja rękopisu zostały wykonane przez autorów. Autorzy przejrzeli i zweryfikowali wszystkie wyniki wspomaganej sztuczną inteligencją, aby zapewnić dokładność, integralność i zgodność z wytycznymi czasopisma.

Podziękowania

Autorzy dziękują swoim odpowiednim instytucjom za zapewnienie niezbędnej infrastruktury i wsparcia badawczego w celu przeprowadzenia tego badania. Autorzy z okazji wykorzystania publicznie dostępnych zestawów danych i narzędzi open-source, które ułatwiły opracowanie i ocenę proponowanego wyjaśnialnego frameworku AI. Szczególne podziękowania kierujemy do ekspertów z dziedziny, którzy dostarczyli cenny wgląd podczas fazy oceny zorientowanej na człowieka.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
GPU WorkstationProducentN/DTrening modeli uczenia się głębokiego
Jupyter NotebookProject JupyterNajnowsza stabilna wersjaInteraktywne wykonywanie eksperymentów
LIMELIMEWersja 0.2.0Lokalne interpretowalne wyjaśnienia
MatplotlibMatplotlib ProjectWersja 3.9Wizualizacja danych
MIMIC-III DatabasePhysioNetWersja 1.4Analiza elektronicznych dokumentów zdrowotnych
NIH Chest X-ray DatasetNIH Clinical CenterPubliczny zestaw danychKlasyfikacja chorób klatki piersiowej
NumPyNumPy DevelopersWersja 1.26Obliczenia numeryczne i operacje na tablicach
OpenCVOpenCV FoundationWersja 4.10Przetwarzanie obrazów
PandasPandas Development TeamWersja 2.1Manipulacja danymi i przetwarzanie wstępne
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryPubliczny zestaw danychPrzewidywanie ryzyka cukrzycy
Python 3.11Python Software FoundationWersja 3.11Główne środowisko programistyczne
Scikit-learnscikit-learnWersja 1.5Algorytmy uczenia maszynowego i ewaluacja
SeabornSeabornWersja 0.13Wizualizacja statystyczna
SHAPSHAPWersja 0.46Atrybucja funkcji i wyjaśnialność
TensorFlowTensorFlowWersja 2.15Rozwój modeli uczenia się głębokiego
Windows / Ubuntu LinuxMicrosoft / CanonicalN/DSystem operacyjny
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryPubliczny zestaw danychDiagnoza raka piersi

Bibliografia

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

In ynieriaNumer 233Numer 233Warto pustaNumerWyja nialna sztuczna inteligencja XAIUczenie maszynoweg bokie uczenieInterpretowalno modeliSystemy wspomagania decyzji klinicznychPowtarzalny protok eksperymentalny