$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Inteligencja sztucznna (AI) stała się ważnym elementem współczesnej opieki zdrowotnej poprzez wsparcie diagnozy chorób, prognozowania, stratyfikacji ryzyka, analizy obrazów medycznych oraz podejmowania decyzji klinicznych1. Postępy w uczeniu maszynowym i głębokim nauce umożliwiły systemom opieki zdrowotnej przetwarzanie dużych objętości strukturalizowanych i niestrukturalizowanych danych, często osiągając wydajność predykcyjną zbliżoną lub przewyższającą konwencjonalne podejścia statystyczne2. Mimo tych osiągnięć, wiele modeli AI działa jako złożone systemy typu czarna skrzynka, co utrudnia klinikom i interesariuszom sektora opieki zdrowotnej zrozumienie, jak generowane są prognozy3. Ta niedostateczna przejrzystość może ograniczać zaufanie, przyjęcie i odpowiedzialność w wymagających środowiskach opieki zdrowotnej4,5.
Wyjaśnialna inteligencja sztucznna (XAI) pojawiła się jako obiecujące podejście do poprawy przejrzystości i interpretowalności modeli uczenia maszynowego6. Powszechnie stosowane techniki wyjaśniania, w tym SHAP (Shapley additive explanations), LIME (Local interpretable model-agnostic explanations) i Gradient-weighted class activation mapping (Grad-CAM), zapewniają wgląd w zachowanie modelu poprzez mechanizmy przypisywania cech i wizualnych wyjaśnień7,8,9. Metody te są coraz częściej stosowane w zastosowaniach medycznych w celu wsparcia interpretacji klinicznych, audytów modeli i wsparcia decyzyjnego10,11. Jednak samo wyjaśnianie nie gwarantuje niezawodności, powtarzalności ani przydatności klinicznej. Ostatnie badania wskazują na wyzwania związane z niestabilnością wyjaśnień, wrażliwością na zmiany, ograniczonym weryfikowaniem przez kliników oraz niespójnościami między wynikami wyjaśnień a prawdziwym rozumowaniem modelu12,13,14,15.
Oprócz wyzwań związanych z wyjaśnialnością, powtarzalność pozostaje istotnym problemem w badaniach nad uczeniami maszynowym w opiece zdrowotnej16,17,18. Wiele opublikowanych badań dostarcza ograniczonych informacji dotyczących procedur przetwarzania wstępnego, środowisk oprogramowania, konfiguracji hiperparametrów, strategii walidacji i przepływów pracy implementacyjnych, co utrudnia niezależne powtórzenie19,20,21. Ponadto, badania nad AI w opiece zdrowotnej często koncentrują się na wydajności predykcyjnej, zapewniając jednocześnie ograniczone wytyczne dotyczące oceny jakości wyjaśnień, ewaluacji zorientowanej na klienta i praktycznych kwestii implementacyjnych22. Ograniczenia te mogą utrudniać translację systemów AI z wyjaśniania z środowisk badawczych do rzeczywistych ustawień opieki zdrowotnej23,24,25,26,27.
Obecne XAI w opiece zdrowotnej często oceniają pojedyncze techniki wyjaśniania lub modele predykcyjne w izolacji i rzadko dostarczają zstandardyzowanych protokołów, które integrują przygotowanie danych, modelowanie predykcyjne, ocenę wyjaśnialności, ewaluację zorientowaną na człowieka i zasoby dotyczące powtarzalności28,29,30,31. W konsekwencji, badacze i praktycy mogą napotkać trudności przy odtwarzaniu przepływów pracy, porównywaniu metod wyjaśniania lub ocenie praktycznej przydatności systemów AI z wyjaśnianiem w różnych zbiorach danych i dziedzinach zastosowań w opiece zdrowotnej. Dlatego potrzebny jest kompleksowy i powtarzalny protokół, aby ułatwić spójną implementację, ewaluację i raportowanie przepływów pracy z wyjaśnialną sztuczną inteligencją w opiece zdrowotnej32,33,34,35.
Przedstawiamy protokół powtarzalny do rozwijania, ewaluacji i interpretacji systemów sztucznej inteligencji z wyjaśnianiem w analityce zdrowotnej. Protokół integruje przetwarzanie wstępne danych, modelowanie predykcyjne, ocenę wyjaśnialności przy użyciu SHAP, LIME i Grad-CAM, ewaluację zorientowaną na klienta, procedury walidacji i zasoby dotyczące powtarzalności w jednolitym przepływie pracy. Celem jest zapewnienie zstandardyzowanego ramowania, które wspiera przejrzysty rozwój modeli, ocenę jakości wyjaśnień i powtarzalną implementację w różnorodnych zbiorach danych opieki zdrowotnej36,37,38,39. Metodologiczny wkład tej pracy polega na integracji analityki predykcyjnej, ewaluacji wyjaśnial