Artykuł badawczy

Reprodukowalny protokół rozwijania i oceniania wyjaśnialnych sztucznych ram inteligencji w analityce opieki zdrowotnej

DOI:

10.3791/71999

31 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiamy tutaj odtwarzalny protokół do opracowywania i oceny modeli wyjaśnialnej sztucznej inteligencji dla analityki opieki zdrowotnej. Przepływ pracy integruje przetwarzanie danych, modelowanie predykcyjne, wyjaśnialność opartą na SHAP-, LIME- i Grad-CAM, ocenę ilościową oraz walidację zorientowaną na człowieka, aby wspierać przejrzyste i godne zaufania podejmowanie decyzji klinicznych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyjaśnialna Sztuczna Inteligencja (XAI) jest coraz bardziej rozpoznawana jako niezbędne narzędzie do budowy zaufanych systemów AI w opiece zdrowotnej, gdzie przejrzystość i zdolność wyjaśniania decyzji są istotnymi składnikami podejmowania klinicznych decyzji. Niniejsza publikacja przedstawia powtarzalne podejście eksperymentalne do opracowywania i ewaluacji wyjaśnialnych systemów AI dla analityki opieki zdrowotnej. Opracowany potok integruje kroki przetwarzania danych, modelowania predykcyjnego, generowania interpretacji i ewaluacji w jeden bezproblemowy przepływ pracy, który można zastosować zarówno do strukturalnych danych klinicznych, jak i zestawów danych z obrazowania medycznego. Modele uczenia maszynowego zespołowego wykazały wysoką wydajność predykcyjną w strukturalnych zbiorach danych tabelarycznych, podczas gdy modele głębokiego uczenia są skuteczne w uczeniu się złożonych wzorców w danych z obrazowania medycznego. Techniki takie jak SHAP, LIME i Grad-CAM to globalne i lokalne wyjaśnienia, które ułatwiają interpretację modelu. Bardzo pomocne. Ilościowa ocena ramówki obejmuje wiele różnych metryk, takich jak dokładność, precyzja, odzyskanie, wynik F1, ROC-AUC, metryki wyjaśnień, wierność i stabilność. Wyniki wskazują, że gdy warunki eksperymentalne są kontrolowane, ramówka wykazała poprawę wydajności predykcyjnej i jakości wyjaśnień w warunkach ewaluacji eksperymentalnej. Jako dokument przewodni, niniejsza praca wspiera powtarzalność i skalowalność, trwałe wdrażanie przez inne żywe istoty. Ta przejrzysta, zrozumiała dla ludzi inteligencja sztucznna jest fundamentem, na którym wsparcie podejmowania decyzji klinicznych i systemy analityki opieki zdrowotnej zdobywają zaufanie i szerokie zastosowanie.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Inteligencja sztucznna (AI) stała się ważnym elementem współczesnej opieki zdrowotnej poprzez wsparcie diagnozy chorób, prognozowania, stratyfikacji ryzyka, analizy obrazów medycznych oraz podejmowania decyzji klinicznych1. Postępy w uczeniu maszynowym i głębokim nauce umożliwiły systemom opieki zdrowotnej przetwarzanie dużych objętości strukturalizowanych i niestrukturalizowanych danych, często osiągając wydajność predykcyjną zbliżoną lub przewyższającą konwencjonalne podejścia statystyczne2. Mimo tych osiągnięć, wiele modeli AI działa jako złożone systemy typu czarna skrzynka, co utrudnia klinikom i interesariuszom sektora opieki zdrowotnej zrozumienie, jak generowane są prognozy3. Ta niedostateczna przejrzystość może ograniczać zaufanie, przyjęcie i odpowiedzialność w wymagających środowiskach opieki zdrowotnej4,5.

Wyjaśnialna inteligencja sztucznna (XAI) pojawiła się jako obiecujące podejście do poprawy przejrzystości i interpretowalności modeli uczenia maszynowego6. Powszechnie stosowane techniki wyjaśniania, w tym SHAP (Shapley additive explanations), LIME (Local interpretable model-agnostic explanations) i Gradient-weighted class activation mapping (Grad-CAM), zapewniają wgląd w zachowanie modelu poprzez mechanizmy przypisywania cech i wizualnych wyjaśnień7,8,9. Metody te są coraz częściej stosowane w zastosowaniach medycznych w celu wsparcia interpretacji klinicznych, audytów modeli i wsparcia decyzyjnego10,11. Jednak samo wyjaśnianie nie gwarantuje niezawodności, powtarzalności ani przydatności klinicznej. Ostatnie badania wskazują na wyzwania związane z niestabilnością wyjaśnień, wrażliwością na zmiany, ograniczonym weryfikowaniem przez kliników oraz niespójnościami między wynikami wyjaśnień a prawdziwym rozumowaniem modelu12,13,14,15.

Oprócz wyzwań związanych z wyjaśnialnością, powtarzalność pozostaje istotnym problemem w badaniach nad uczeniami maszynowym w opiece zdrowotnej16,17,18. Wiele opublikowanych badań dostarcza ograniczonych informacji dotyczących procedur przetwarzania wstępnego, środowisk oprogramowania, konfiguracji hiperparametrów, strategii walidacji i przepływów pracy implementacyjnych, co utrudnia niezależne powtórzenie19,20,21. Ponadto, badania nad AI w opiece zdrowotnej często koncentrują się na wydajności predykcyjnej, zapewniając jednocześnie ograniczone wytyczne dotyczące oceny jakości wyjaśnień, ewaluacji zorientowanej na klienta i praktycznych kwestii implementacyjnych22. Ograniczenia te mogą utrudniać translację systemów AI z wyjaśniania z środowisk badawczych do rzeczywistych ustawień opieki zdrowotnej23,24,25,26,27.

Obecne XAI w opiece zdrowotnej często oceniają pojedyncze techniki wyjaśniania lub modele predykcyjne w izolacji i rzadko dostarczają zstandardyzowanych protokołów, które integrują przygotowanie danych, modelowanie predykcyjne, ocenę wyjaśnialności, ewaluację zorientowaną na człowieka i zasoby dotyczące powtarzalności28,29,30,31. W konsekwencji, badacze i praktycy mogą napotkać trudności przy odtwarzaniu przepływów pracy, porównywaniu metod wyjaśniania lub ocenie praktycznej przydatności systemów AI z wyjaśnianiem w różnych zbiorach danych i dziedzinach zastosowań w opiece zdrowotnej. Dlatego potrzebny jest kompleksowy i powtarzalny protokół, aby ułatwić spójną implementację, ewaluację i raportowanie przepływów pracy z wyjaśnialną sztuczną inteligencją w opiece zdrowotnej32,33,34,35.

Przedstawiamy protokół powtarzalny do rozwijania, ewaluacji i interpretacji systemów sztucznej inteligencji z wyjaśnianiem w analityce zdrowotnej. Protokół integruje przetwarzanie wstępne danych, modelowanie predykcyjne, ocenę wyjaśnialności przy użyciu SHAP, LIME i Grad-CAM, ewaluację zorientowaną na klienta, procedury walidacji i zasoby dotyczące powtarzalności w jednolitym przepływie pracy. Celem jest zapewnienie zstandardyzowanego ramowania, które wspiera przejrzysty rozwój modeli, ocenę jakości wyjaśnień i powtarzalną implementację w różnorodnych zbiorach danych opieki zdrowotnej36,37,38,39. Metodologiczny wkład tej pracy polega na integracji analityki predykcyjnej, ewaluacji wyjaśnial

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie zbiory danych użyte w tej pracy zostały uzyskane z publicznie dostępnych i w pełni anonimizowanych repozytoriów, w tym UCI Machine Learning Repository, bazy danych PhysioNet MIMIC-III oraz zbiorów zdjęć rentgenowskich klatki piersiowej NIH. Nie uzyskano żadnych informacji o pacjentach. Badanie przestrzegło wytycznych etycznych badań instytucjonalnych dotyczących wtórnej analizy publicznie dostępnych, anonimizowanych danych. Formalna zgoda Instytucjonalnej Komisji ds. Badań nad Człowiekiem nie była wymagana, ponieważ nie rekrutowano bezpośrednio uczestników badania, a także nie używano chronionych informacji zdrowotnych.

1. Przegląd ram eksperymentalnych

  1. Opracować rejestratory sztuczna inteligencja (XAI) o charakterze przejrzystym dla analizy zdrowia, których można się nauczyć. Uporządkować przepływ pracy w warstwy danych, przetwarzania, modelowania, wyjaśnialności, oceny i wizualizacji.
  2. Zintegrować te moduły w jednolity przepływ pracy, zdolny do przetwarzania strukturalnych danych klinicznych, elektronicznych rejestrów zdrowotnych i zbiorów danych z obrazami medycznymi.
  3. Zapewnić, aby każdy moduł przyczyniał się do powtarzalności, interpretowalności, skalowalności i standaryzowanego wykonania eksperymentów.
  4. Zaprojektować modułową architekturę, aby wspierać ciągłe przesyłanie strumieniowe danych i upewnić się, że każdy etap przepływu pracy przyczynia się do powtarzalności, interpretowalności i skalowalności w całym przepływie eksperymentalnym.

2. Środowisko obliczeniowe i konfiguracja systemu

  1. Zainstalować wymagane zależności oprogramowania przed uruchomieniem przepływu pracy, otworzywszy terminal wiersza poleceń i uruchomiwszy następujące polecenie:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. Weryfikować pomyślne zainstalowanie wszystkich pakietów oprogramowania i potwierdzać zgodność z wersjami oprogramowania wymienionymi w Tabeli materiałów przed przejściem do przetwarzania danych i opracowywania modeli.
  3. Używać Pythona 3.11 jako podstawowego środowiska programistycznego. Zainstalować i skonfigurować NumPy 1.26 i Pandas 2.1 do zadań manipulacji danymi i inżynierii funkcji. Zainstalować Scikit-learn 1.5 do opracowywania i ewaluacji modeli uczenia maszynowego.
  4. Zainstalować TensorFlow 2.15 do szkolenia i wnioskowania modeli uczenia głębokiego. Zainstalować SHAP 0.46 i LIME 0.2.0 do analizy wyjaśnialności. Zainstalować OpenCV 4.10 do zadań przetwarzania obrazów. Zainstalować Matplotlib 3.9 i Seaborn 0.13 do wizualizacji danych i raportowania wyników. Zapoznać się z Tabelą materiałów w celu uzyskania pełnych specyfikacji oprogramowania i szczegółów implementacji wymaganych do powtarzalności.
  5. Skonfigurować środowisko obliczeniowe za pomocą stacji roboczej wyposażonej w wieloprocesorowy procesor, przyspieszanie procesora graficznego (GPU) i wystarczające zasoby pamięci, aby pomieścić duże zbiory danych zdrowotnych i obciążenia uczenia głębokiego.
  6. Ustawić stałe losowe nasiona dla podziału danych, inicjalizacji modelu i procedur szkoleniowych w celu zapewnienia powtarzalności w różnych uruchomieniach eksperymentów. Włączyć mechanizmy rejestracji w celu rejestrowania operacji przetwarzania danych, konfiguracji modeli, ustawień hiperparametrów, procedur szkoleniowych i wyników ewaluacji w całym przepływie pracy.
  7. Skonfigurować architektury modeli, parametry optymalizacji, tempo uczenia, rozmiary partii, ustawienia szkoleniowe i wartości hiperparametrów zgodnie ze specyfikacjami podsumowanymi w Tabeli 1. Przestrzegać tych ustawień podczas eksperymentów replikacyjnych w celu zapewnienia spójności z podanym wynikiem.
  8. Spodziewany wynik - w pełni skonfigurowane i powtarzalne środowisko obliczeniowe ze wszystkimi wymaganymi pakietami oprogramowania, zasobami sprzętowymi, mechanizmami rejestracji i ustawieniami konfiguracji modelu dostępnymi do dalszego przetwarzania danych, opracowywania modeli, analizy wyjaśnialności i procedur ewaluacji.
SkładnikParametrWartośćOpis
Random Forestn_estimators100Liczba drzew
Random Forestmax_depthNoneGłębokość drzewa
XGBoostlearning_rate0.01Tempo uczenia
XGBoostn_estimators100Rundy wzmacniania
CNNepochs25Epoki treningowe
CNNbatch_size32Rozmiar partii
CNNoptimizerAdamAlgorytm optymalizacji
MLPhidden_layers2Liczba warstw ukrytych
MLPactivationReLUFunkcja aktywacji
Ogólnetrain_split70%Współczynnik danych treningowych

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dokonaliśmy dokładnej oceny komponentu wyjaśniającej AI w całym naszym pipeline, ocenianej pod kątem jak dobrze przewidywała na różnych typach danych opieki zdrowotnej, obejmujących zarówno strukturalne dane kliniczne, jak i obrazy medyczne. Wyniki wskazały na jednolite wyniki predykcyjne na wszystkich ocenionych zbiorach danych. Wśród testowanych modeli, model gradientowego wzmacniania osiągnął najwyższą dokładność na poziomie 97,4%, za którym szedł model lasu losowego na poziomie 94,2%. Metody uczenia głębokiego zastosowane do zestawów obrazów osiągnęły 91,3% dokładności, podczas gdy modele wielowarstwowe perceptronów dały nieco niższe wyniki, 90,8%. Sugeruje to, że modele uczenia zbiorowego wykonują się najlepiej na strukturalnych danych opiece zdrowotnej, podczas gdy architektury uczenia głębokiego wyróżniają się w zadaniach związanych z obrazowaniem. Tabela 6 przedstawia szczegółowo różne metryki wydajności dla funkcji predykcyjnych, w tym dokładność, precyzję, odzyskanie i wynik F1, jak również metryki wyjaśnialności takie jak wierność i stabilność. Do tych wyników dotarliśmy stosując pięciokrotną walidację krzyżową i prezentując wyniki jako wartości średnie (z 95% przedziałami ufności). Przedziały ufności nie tylko wskazują na niepewność modelu, ale także sprawiają, że porównanie predykcyjnych wyników jest bardziej wiarygodne, uwzględniając pamięć zestawu danych i różnice w architektur modeli.

ModelDokładność (%)PrecyzjaOdzyskanieWynik F1WiernośćStabilność95% CI
Las losowy94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN (Obrazowanie)91.30.900.910.900.880.8690.1–92.5

Tabela 6: Porównawcza wydajność modeli predykcyjnych i metod wyjaśnialności.
Tabela przedstawia porównawczą ocenę modeli uczenia maszynowego i uczenia głębokiego przy użyciu metryk predykcyjnych, w tym dokładność, precyzję, odzyskanie, wynik F1 i ROC-AUC. Ponadto zgłaszane są metryki wyjaśnialności takie jak wierność, stabilność, czytelność i wyniki zaufania ludzkiego, aby zapewnić kompleksową ocenę zarówno efektywności predykcyjnej, jak i interpretowalności.

Wyniki wskazują, że Gradient Boosting osiągnął najwyższą ogólną wydajność predykcyjną (97,4% dokładności), przewyższając Las losowy o 3,2 punktu procentowego i modele uczenia głębokiego o ponad 6 punktów procentowych. To obserwacja sugeruje, że metody uczenia zbiorowego były szczególnie skuteczne dla strukturalnych zestawów danych opieki zdrowotnej uwzględnionych w tym badaniu. Mniejsza różnica w wydajności między modelami CNN i MLP wskazuje, że zwiększona złożoność modelu sama w sobie niekoniecznie przekładała się na lepszą wydajność predykcyjną w ocenionych warunkach eksperymentu. 
Aby pokazać przydatność naszego proponowanego frameworku w różnorodnych zadaniach analitycznych opieki zdrowotnej, przedstawiamy wyniki predykcyjnych wyników dla konkretnego zestawu danych w Tabeli 7. 

Analiza specyficzna dla zestawu danych.
Wynik różnił się w zależności od zestawów danych z powodu różnic w złożoności funkcji, wielkości próbki, rozkładzie klas i modalności danych. Zestaw danych na raka piersi osiągnął najwyższą dokładność predykcyjną, prawdopodobnie ze względu na dobrze zdefiniowaną separację funkcji. Nieco niższy wydajność na zestawach danych MIMIC-III i NIH Chest X-ray odzwierciedla większą złożoność wpisów klinicznych i danych obrazowania medycznego. Te ustalenia pokazują, że wydajność framework jest wpływana przez cechy zestawu danych i kontekst kliniczny.

Zestaw danychDokładność (%)Precyzja (%)Odzyskanie (%)Wynik F1 (%)
Rak piersi97.497.297.697.1
Cukrzyca94.293.994.494
MIMIC-III91.391

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie opracowało i oceniło spostrzegalny przepływ pracy sztucznej inteligencji z możliwością wyjaśnienia (XAI) dla analityki opieki zdrowotnej, który integruje modelowanie predykcyjne, ocenę możliwości wyjaśnienia, ocenę ukierunkowaną na klinicyna i zasoby dotyczące powtarzalności w jednym protokole. Wyniki wykazały, że modele uczenia maszynowego oparte na ensemblu, szczególnie Gradient Boosting i Random Forest, osiągnęły najwyższą wydajność predykcyjną na ocenionych strukturalnych zbiorach danych dotyczących opieki zdrowotnej, podczas gdy modele głębokiego uczenia się były bardziej odpowiednie dla analiz opartych na obrazach. Te wyniki podkreślają znaczenie doboru architektur modeli zgodnie z cechami danych, zamiast zakładać, że bardziej skomplikowane modele zawsze dają lepsze wyniki. Kluczowym wkładem tej pracy jest integracja modelowania predykcyjnego, oceny możliwości wyjaśnienia, oceny ukierunkowanej na człowieka i praktyk powtarzalności w standardowym przepływie pracy. W przeciwieństwie do badań, które oceniają techniki wyjaśniania w izolacji, proponowany framework zapewnia metodykę opartą na protokołach, która wspiera przejrzyste i powtarzalne eksperymentowanie na różnorodnych zbiorach danych dotyczących opieki zdrowotnej.

Analiza możliwości wyjaśnienia wykazała mierzalne różnice między ocenianymi metodami. SHAP osiągnęło najwyższe wyniki wierności i stabilności w ocenionych warunkach eksperymentalnych, wskazując na bliższą zgodność między wygenerowanymi wyjaśnieniami a przewidywaniami modelu. LIME zapewniło przydatne lokalne wyjaśnienia, ale wykazywało niższą stabilność, podczas gdy Grad-CAM generowało intuicyjne wizualne wyjaśnienia dla danych obrazowych. Te wyniki sugerują, że jakość wyjaśnienia zależy zarówno od wybranej metody wyjaśniania, jak i od podstawowego modelu predykcyjnego. Ocena ukierunkowana na człowieka dodatkowo wykazała, że włączenie wyjaśnień poprawiło zaufanie klincyna i interpretowalność. Zaobserwowany wzrost wyników zaufania i znaczna zgoda między oceniającymi (Fleiss’ κ = 0,81) wskazują na spójną ocenę użyteczności wyjaśnień wśród uczestników. Te wyniki wspierają potencjalną wartość metod wyjaśniania w poprawianiu przejrzystości i akceptacji użytkowników w systemach wspomagania decyzji w dziedzinie opieki zdrowotnej.

Kilka ograniczeń należy wziąć pod uwagę przy interpretacji wyników. Po pierwsze, framework został oceniony przy użyciu ograniczonej liczby publicznie dostępnych zbiorów danych i może nie w pełni reprezentować zmienność spotykaną w rzeczywistych środowiskach klinicznych. Po drugie, ocena klincyna obejmowała stosunkowo małą grupę uczestników, co może ograniczać generalność. Po trzecie, metody wyjaśniania badane w tej pracy są technikami post-hoc i dlatego podlegają znanym ograniczeniom, w tym wrażliwości na zmiany i potencjalnym rozbieżnościom między wyjaśnieniami a prawdziwym rozumowaniem modelu. Wreszcie, weryfikacja zewnętrzna w niezależnych instytucjach opieki zdrowotnej wykraczała poza zakres niniejszego badania.

Przyszłe badania powinny skupić się na multimodalnej analityce opieki zdrowotnej integrującej rekordy kliniczne, obrazowanie medyczne, sygnały fizjologiczne i dane z czujników przenośnych. Potrzebne są dodatkowe prace nad oceną metod wyjaśniania przyczynowego i alternatywnego, ilością niepewności, oceną uczciwości, analizą kalibracji i perspektywiczną weryfikacją kliniczną. Takie badania mogą dalej poprawić przejrzystość, niezawodność i przydatność systemów sztucznej inteligencji z możliwością wyjaśnienia w opiece zdrowotnej.

Oprócz oceny wydajności, należy wziąć pod uwagę kilka praktycznych wyzwań dotyczących wdrożenia i modyfikacji protokołu, aby zapewnić solidne wdrożenie proponowanego frameworku sztucznej inteligencji z możliwością wyjaśnienia w różnorodnych środowiskach opieki zdrowotnej.

Ograniczenia metod wyjaśniania

SHAP, LIME i Grad-CAM, choć dostarczają pomocnych informacji dotyczących zachowania modelu, mają również kilka wad. W literaturze zauważono, że narzędzia te mogą być niestabilne w wielokrotnym uruchomieniu, bardzo wrażliwe na zakłócenia, różnić się między zbiorami danych i czasami nie dokładnie odzwierciedlać prawdziwych powodów modelu. Dlatego wyjaśnienia post-hoc należy traktować tylko jako uzupełniające dowody, a nie jako faktyczne przedstawienie przyczynowych mechanizmów decyzyjnych. Właściwa weryfikacja wiarygodności wyjaśnień jest nadal kluczowy krok przed ich zastosowaniem w bardzo wpływowych środowiskach klinicznych.

Jest to również zgodne z wynikami ostatnich badań nad sztuczną inteligencją w dziedzinie biomedycyny, które podkreślają potrzebę wyjaśnienia walidacji niezawodności przed wdrożeniem w środowiskach klinicznych. Włączenie możliwości wyjaśnienia było używane jako kluczowy aspekt walidacji w systemach przewidywania zatrzymania krążenia, aby były bardziej przejrzyste i zyskiwały zaufanie klincyna41. W ten sam sposób, segmentacja obrazów ultrasonograficznych wątroby przy użyciu technik wyjaśniania sterowanych wizualizacją miała na celu zwiększenie interpretowalności bez ignorowania faktu, że wyja

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konkurencyjnych interesów finansowych ani konfliktów interesów związanych z tą pracą. Badania przeprowadzono niezależnie bez żadnych komercyjnych lub finansowych relacji, które mogłyby być uznane za potencjalny konflikt interesów.

Deklaracja użycia sztucznej inteligencji

Narzędzia sztucznej inteligencji zostały wykorzystane do doskonalenia języka, sprawdzania gramatyki i pomocy edytorskiej podczas przygotowywania rękopisu. Cały naukowy treść, projekt eksperymentu, analiza danych, interpretacja i ostateczna weryfikacja rękopisu zostały wykonane przez autorów. Autorzy przejrzeli i zweryfikowali wszystkie wyniki wspomaganej sztuczną inteligencją, aby zapewnić dokładność, integralność i zgodność z wytycznymi czasopisma.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy dziękują swoim odpowiednim instytucjom za zapewnienie niezbędnej infrastruktury i wsparcia badawczego w celu przeprowadzenia tego badania. Autorzy z okazji wykorzystania publicznie dostępnych zestawów danych i narzędzi open-source, które ułatwiły opracowanie i ocenę proponowanego wyjaśnialnego frameworku AI. Szczególne podziękowania kierujemy do ekspertów z dziedziny, którzy dostarczyli cenny wgląd podczas fazy oceny zorientowanej na człowieka.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
GPU WorkstationProducentN/DTrening modeli uczenia się głębokiego
Jupyter NotebookProject JupyterNajnowsza stabilna wersjaInteraktywne wykonywanie eksperymentów
LIMELIMEWersja 0.2.0Lokalne interpretowalne wyjaśnienia
MatplotlibMatplotlib ProjectWersja 3.9Wizualizacja danych
MIMIC-III DatabasePhysioNetWersja 1.4Analiza elektronicznych dokumentów zdrowotnych
NIH Chest X-ray DatasetNIH Clinical CenterPubliczny zestaw danychKlasyfikacja chorób klatki piersiowej
NumPyNumPy DevelopersWersja 1.26Obliczenia numeryczne i operacje na tablicach
OpenCVOpenCV FoundationWersja 4.10Przetwarzanie obrazów
PandasPandas Development TeamWersja 2.1Manipulacja danymi i przetwarzanie wstępne
Pima Indians Diabetes DatasetUCI Machine Learning RepositoryPubliczny zestaw danychPrzewidywanie ryzyka cukrzycy
Python 3.11Python Software FoundationWersja 3.11Główne środowisko programistyczne
Scikit-learnscikit-learnWersja 1.5Algorytmy uczenia maszynowego i ewaluacja
SeabornSeabornWersja 0.13Wizualizacja statystyczna
SHAPSHAPWersja 0.46Atrybucja funkcji i wyjaśnialność
TensorFlowTensorFlowWersja 2.15Rozwój modeli uczenia się głębokiego
Windows / Ubuntu LinuxMicrosoft / CanonicalN/DSystem operacyjny
Wisconsin Breast Cancer DatasetUCI Machine Learning RepositoryPubliczny zestaw danychDiagnoza raka piersi

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

Powiązane artykuły