Artykuł badawczy

Zespół wag czasowych, wnioskowanie przyczynowe i hierarchiczna atrybucja w optymalizacji SHAP

DOI:

10.3791/69125

18 listopada 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy artykuł ma na celu ocenę wpływu wagowania czasowego, wnioskowania przyczynowego oraz hierarchicznego przypisywania na optymalizację interpretowalności.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W ciągu ostatnich kilku lat potrzeba przejrzystości i interpretowalności wzrosła dzięki znaczącym postępom w modelach opartych na danych, co doprowadziło do powstania Wyjaśnialnej Sztucznej Inteligencji (XAI). Dominuje kilka tradycyjnych podejść XAI; jednak mają one ograniczone kompetencje w interpretacji relacji dynamicznych. Obecne badania mają na celu rozwiązanie tego ograniczenia poprzez propozycję nowatorskiego frameworka Ensemble SHapley Additive ExPlanations (SHAP), który koncentruje się na ważeniu czasowym, wnioskowaniu przyczynowym, hierarchicznym przypisaniu oraz optymalizacji interpretowalności, znanym jako TCHSHAP. TCHSHAP priorytetowo traktuje informacje bieżące nad historycznymi poprzez ważenie czasowe poprzez wykładnicze zanikanie. Ponadto wnioskowanie przyczynowe oddziela korelację od przyczynowości, aby uzyskać praktyczne wnioski. Dodatkowo, hierarchiczna atrybucja pozwala na analizę na poziomie szczegółowym (na poziomie regionu) i agregowanym (wpływ na grupy cech). Te podejścia są zintegrowane, aby uzyskać bardziej interpretowalny i wyjaśniający model. Aby zweryfikować skuteczność proponowanego modelu, przeprowadzamy eksperyment na zbiorze danych o plonach zebranych z Kaggle. Przed eksperymentalną oceną wstępne przetwarzanie danych odbywa się za pomocą kodowania one-hot. Normalizacja danych odbywa się poprzez skalowanie min-max, a wartości odstające są usuwane w zakresie interkwartylowym. Dla celów oceny eksperymentalnej autorzy wykorzystali model SHAP XAI dla Random Forest. Podczas oceny skuteczności proponowanego modelu TCHSHAP zaobserwowano, że podczas gdy średnia prognoza dla tradycyjnego SHAP wynosi 161,137, wzrasta do 161,506 po uwzględnieniu ważenia czasowego i wnioskowania przyczynowego, co podkreśla skuteczność stosowania istotności czasowej i przyczynowej. Dodatkowo, podczas hierarchicznej atrybucji zaobserwowano, że cechy rolnicze mają najsilniejszą dominację nad zmienną docelową. Ta dominacja jest następowana przez czynniki geograficzne i środowiskowe w kolejności. W ten sposób uzyskane wyniki upoważniają do skuteczności proponowanego podejścia w celu zwiększenia globalnej i lokalnej interpretowalności, wzmacniając zaufanie użytkownika do prognoz modelu. Obecne prace oferują sposoby na poprawę przejrzystości i interpretowalności bez wpływu na wydajność modelu. Sugerowany model umożliwia również interpretowalne i efektywne modelowanie regresyjne w złożonych, opartych na danych aplikacjach, umożliwiając jego szerokie zastosowanie w rzeczywistych warunkach.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Regresja odgrywa kluczową rolę w analityce predykcyjnej, obejmując kilka dziedzin, w tym modelowanie klimatu, prognozowanie finansowe, diagnostykę medyczną oraz szacowanie plonów rolnych 1,2. Jednak niewyjaśnione wyniki modeli regresji, zwłaszcza nieliniowych i o dużej pojemności, takich jak Gradient Boosting Machines (GBM), losowe lasy i głębokie sieci neuronowe (DNN), stwarzają poważne wyzwania, zwłaszcza dla zastosowań wymagających przejrzystości i praktycznych wniosków. Lukę w interpretowalności można zniwelować, stosując Explainable Artificial Intelligence (XAI), technikę, która wciąż jest w powijakach. Obecnie konwencjonalne frameworki XAI, takie jak SHAP i Local Interpretable Model Agnostic Explanation (LIME), oferują jedynie statyczne wyjaśnienia cech3. Obecnie te techniki XAI nie wyjaśniają zawiłości zadań regresji związanych z zależnościami czasowymi, hierarchicznymi strukturami cech i przyczynowościami, tworząc ścieżkę badań 4,5. Z powodu braku uwzględnienia tych czynników, XAI czasem może wyciągać błędne wnioski. Na przykład tradycyjny SHAP uwzględnia jedynie korelację atrybutów z zmienną docelową, nie uwzględniając przyczynowości. Rozważmy zbiór danych z dwoma wejściami binarnymi, mianowicie spożyciem tytoniu i zabarwionymi zębami. Zmienną docelową w tym zbiorze danych jest prawdopodobieństwo zachorowania na raka. W takim scenariuszu, jeśli uzyskamy korelację między cechami wejściowymi a zmienną docelową, rak będzie silnie skorelowany z obiema cechami (spożyciem tytoniu i zabarwionymi zębami). Obecnie dość mylące jest wnioskowanie, że przebarwione zęby powodują raka, ponieważ jest on spowodowany regularnym spożywaniem tytoniu. Można więc podsumować, że pomimo znaczącego postępu w dziedzinie XAI, główne kwestie, które należy rozwiązać w kontekście regresji, to:

Brak możliwości uwzględnienia zależności czasowych prowadzi jedynie do wyjaśnień statycznych, które mogą nie działać w kontekstach z danymi dynamicznymi.

Brak włączenia wnioskowania przyczynowego do tradycyjnych adaptacji SHAP powoduje fałszywe korelacje zamiast cennych wniosków przyczynowych.

Brak uwagi poświęconej interpretacji hierarchicznej prowadzi do niewystarczających wyjaśnień wyższego poziomu zagregowanych.

Aby rozwiązać te problemy, obecne badania mają na celu zaproponowanie nowego frameworka XAI, TCHSHAP, obejmującego ważenie czasowe, wnioskowanie przyczynowe oraz hierarchiczną atrybucję, mające na celu zwiększenie interpretowalności i efektywności obliczeniowej obecnych modeli XAI. W tym samym przypadku proponowany model uwzględnia współczynnik wagi czasowej wt, który przypisuje wyższe wagi niedawnemu wkładowi cech w porównaniu do wartości z przeszłości. Ten współczynnik wagi ma na celu zapewnienie, że interpretowalność jest zgodna z czasowym znaczeniem kluczowych cech w problemach regresji dynamicznej, takich jak prognozowanie plonów i prognozowanie sprzedaży. Ponadto tradycyjne modele regresji nie wykazują zależności przyczynowych, co prowadzi do niejednoznacznych atrybucji6. Aby sprostać temu wyzwaniu, proponowane ramy stosują Strukturalne Modele Przyczynowe (SCM) do oceny przyczynowego wpływu cechy Fi na wynik. Dodatkowo, zbiory danych w czasie rzeczywistym często wykazują hierarchiczne relacje (przestrzenne lub kategoryczne) między cechami, które rzadko są prezentowane w istniejących frameworkach XAI 4,5,6. Przeciwnie, sugerowany framework XAI agreguje poszczególne cechy (Fi), aby uzyskać cechy wyższego poziomu (Hj), co pozwala na szczegółowość wyjaśnień.

Poza uwzględnieniem znaczenia czasowego, przyczynowego i hierarchicznego, proponowany zespół ma również na celu zwiększenie interpretowalności i wyjaśnienia. Taki cel ma na celu ustalenie kompromisu między interpretowalnością a dokładnością, zapewniając, że wyjaśnienia uzyskane z TCHSHAP są dokładne i łatwe do interpretacji4. Sugerowany framework XAI można matematycznie opisać następująco, natomiast opis użytych zmiennych przedstawiono w Tabeli 1. Tradycyjna wartość SHAP dla tej cechy oblicza się jako równanie (1)5,6.

figure-introduction-1   (1)

Ta tradycyjna formuła SHAP sumuje wkłady bez uwzględniania korekt czasowych, przyczynowych czy hierarchicznych.

ZmiennaDefinicja
FiCecha, której wartość Shap jest obliczana
ShapiWartość Shap cechy
SZestaw całkowitych cech
MPodzbiór wszystkich cech
FTŁączna liczba cech
P(M)Predykcja modelu, gdy używane są tylko cechy w M
λ > 0Tempo rozpadu
TCzas przewidywania odniesienia
YWyjście

Tabela 1: Opis używanych zmiennych. Ta tabela opisuje znaczenie różnych zmiennych.

Ta tradycyjna formuła SHAP została zmodyfikowana do obsługi zależności dynamicznych poprzez uwzględnienie ważenia czasowego. To ważenie czasowe uwzględnia się poprzez wprowadzenie współczynnika wagowego wt = e-λ |t - T|gdzie λ oznacza współczynnik zaniku (λ > 0). Jak wspomniano wcześniej, to wykładnicze ważenie nadaje większą wagę najnowszym wartościom w porównaniu do wcześniejszych. Ten wykładniczy spadek jest uwzględniony w kontekście zrozumienia, że najnowsze wartości cech mają większe znaczenie niż wartości z przeszłości. Zmodyfikowana wartość SHAP (po uwzględnieniu istotności czasowej) jest podana w równaniu (2).

figure-introduction-2  (2)

Te informacje czasowe są ważne dla zadań regresji dynamicznej, takich jak prognozowanie rentowności lub zapasów.

Ponadto, aby wyjaśnienia były bardziej solidne, stosuje się SCM do oceny przyczynowego wpływu cechy Fi na wyjście Y. Matematyczne sformułowanie dla przyczynowego SHAP przedstawiono w równaniu (3)

figure-introduction-3 (3)

Tutaj do(Fi) reprezentuje cechę, która przyczyniła się do zmiany. Dzięki temu model uzyskuje kompetencję do wyjaśnienia przyczynowości, a nie korelacji. Warto zauważyć, że obliczenia efektów przyczynowych oparte na SCM zapewniają, że przypisywane są tylko cechy o bezpośrednim wpływie przyczynowym, eliminując fałszywe korelacje.

Ponadto w sugerowanym modelu proponowana jest hierarchia agregująca atrybuty na różnych poziomach. Matematyczne sformułowanie hierarchicznego SHAP przedstawiono w równaniu (4).

figure-introduction-4  (4)

Włączenie hierarchii do sugerowanego modelu zapewnia osiągnięcie szczegółowości wyjaśnień. Sugerowany system przedstawiony jest na Rysunku 1.

figure-introduction-5
Rysunek 1: Ilustracja obrazowa różnych elementów proponowanego ramy. Ten rysunek przedstawia ilustrację obrazową różnych elementów proponowanego ramowego TCHSHAP, w tym wagowania czasowego, wnioskowania przyczynowego oraz hierarchicznego przypisywania. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Nowością proponowanego modelu TCHSHAP jest obsługa tych trzech niespójności poprzez zastosowanie wagowania czasowego (aby nadać większą wagę aktualnym informacjom), Strukturalnych Modeli Przyczynowych (SCM; do oceny efektów przyczynowych) oraz hierarchicznej agregacji wartości SHAP (w celu uzyskania wielopoziomowych wglądów). W ten sposób proponowany zespół rozszerza SHAP poza jego statyczne ograniczenia, zapewniając regresyjne zoptymalizowane ramy wyjaśniające.

Proponowany TCHSHAP ma potencjał, by zyskać ogromne znaczenie dla zastosowań w czasie rzeczywistym w scenariuszach wymagających lepszego podejmowania decyzji, ponieważ identyfikuje szczegółowe wyjaśnienia wyników w modelach regresji, płynnie łącząc modelowanie z podejmowaniem decyzji. Podsumowując, głównym wkładem tego manuskryptu jest zaprojektowanie nowatorskiego ram, które łączą wagę czasową, wnioskowanie przyczynowe oraz relacje hierarchiczne, aby wzbogacić praktyczne wyjaśnienia tradycyjnego modelu SHAP.

Powiązane dzieła

XAI wykorzystuje różne metodologie specjalnie zaprojektowane w celu zwiększenia przejrzystości i interpretowalności różnych modeli uczenia maszynowego. Strategie XAI budują zaufanie do wyników, dostarczając niezbędnych wniosków z nich. Na przykład znane metody XAI, takie jak LIME i SHAP, zwiększają interpretowalność i przejrzystość modeli, które zwykle są czarną skrzynką, w różnych dziedzinach, takich jak finanse, edukacja i sektor opieki zdrowotnej7. Ponadto techniki XAI są stosowane w zadaniach związanych z analizą oprogramowania, wykrywaniem klonów oraz przewidywaniem defektów Just-in-Time8. Dodatkowo Awal i Roy również zwróciły uwagę na rozbieżności i wykazały mniejszą wiarygodność w generowaniu wyjaśnień8. Tutaj autorzy zastosowali Metryki Oceny Poziomu Granularnego (Granular Level Evaluation Metrics) do zmniejszenia spójności w ocenie. XAI jest również szeroko stosowane w medycynie do zrozumienia najważniejszych czynników wpływających na wyniki zadania klasyfikacyjnego, a tym samym wzmacniania zaufania wśród pracowników służby zdrowia do stosowania diagnostyki opartej na AI 9,10,11,12. Ponadto, w sektorach takich jak belgijskie prognozowanie czynszu mieszkaniowego, podejścia XAI ułatwiają interpretację złożonych modeli, co zwiększa kontrolę jakości i minimalizuje błędy produkcyjne13. Bommer i in. wykazali, że integracja metod XAI z gradientami poprawia ich wydajność pod względem odporności, wierności, złożoności i randomizacji w nauce o klimacie14. Wielu badaczy próbowało tworzyć techniki zespołowe i hybrydowe. Oprócz proponowania technik zespołowych, naukowcy wykazali także skuteczność tych hybrydowych technik w dostarczaniu kompleksowego wglądu w złożone modele15,16. Szczegółowy przegląd technik, optymalizacji i różnych zastosowań przedstawiono w tabeli 2, która jasno wskazuje, że najczęściej stosowane techniki to LIME i SHAP. Przyszły kierunek badań wskazuje na zgłębianie optymalizacji w tych metodach w celu zwiększenia interpretowalności tych modeli. Kontynuując linię badań, autorzy obecnych badań koncentrują się na optymalizacji SHAP, dodając wnioskowanie przyczynowe, hierarchiczną atrybucję oraz wagę czasową.

CytatTechniki XAIOptymalizacjaSpostrzeżeniaAplikacjiPrzyszłe kierunki badań
(Anushree i in., 2024)WAPNONie udostępnionoZwiększenie interpretowalności i przejrzystości modeli czarnych skrzynek w różnych zastosowaniach w finansach, edukacji i sektorze opieki zdrowotnej.· Kompromis między dokładnością a interpretowalnością w sektorze finansów, edukacji i opieki zdrowotnej· Potrzeba opracowania listy szczegółowych wskaźników do oceny różnych modeli XAI
SHAP
Mechanizmy zaburzeń
Mechanizmy oparte na uwadze
(Awal & Roy, 2024)PyExplainerMetryki oceny na poziomie granularnym w celu zmniejszenia spójności w ocenie.Podkreśla rozbieżności i wykazuje mniejszą wiarygodność w generowaniu wyjaśnień.· Zadania związane z analityką oprogramowania· Zaawansowane metody badawcze są niezbędne do zwiększenia niezawodności modeli XAI w zadaniach związanych z analizą oprogramowania
WAPNO· wykrywanie klonów
· Przewidywanie defektów w samą porę
(Bommer i in., 2024)Zintegrowane gradientyIntegracja metod XAI z gradientamiIntegracja metod XAI z gradientami zwiększa wydajność pod względem odporności, wierności, złożoności i randomizacji w nauce o klimacie.· Prognozy nauk o klimacie· Skupienie się na ocenie specyficznej dla konkretnych zadań nauk o klimacie.
Warstwowa propagacja znaczenia· Prognoza map średniej temperatury rocznej
Czasy wejściowe gradienty
Metody czułości takie jak gradient, SmoothGrad, NoiseGrad i FusionGrad
(Bhatnagar & Agrawal, 2024)WAPNOZespół technik XAIEnsemble zapewnia kompleksowy wgląd oraz zwiększa interpretowalność i wyjaśnienie złożonych modeli.· Zastosowane na zbiorze danych moralnych w celu zwiększenia interpretowalności wyników· Eksploruj hybrydowe metody XAI poprzez łączenie wielu technik
SHAP· Personalizacja różnych algorytmów XAI dla konkretnych modeli, odpowiadając na potrzeby użytkowników
(Dias, 2024)WAPNOIntegracja technik XAIPoprawa interpretowalności i dokładności· Klasyfikacja toksycznych komentarzy· Wzmacnianie siły do celów klasyfikacji.
Eli5
(Hajare i in., 2024)SHAPNie udostępnionoSHAP oferuje szczegółowe informacje na temat czynników ryzyka przewidujących ostry zespół wieńcowy.· Ostry zespół wieńcowy (ACS)· Aby poznać nowe czynniki ryzyka w prognozowaniu ACS.
(Hamida i in., 2024)Kompleksowy przegląd różnych technik XAINie udostępnionoDostarcza informacji na temat zastosowań XAI XAI w sektorze opieki zdrowotnej, podkreślając znaczenie wyjaśnialności decyzji AI dla zrozumienia wyników dostarczanych przez AI.· Praktyczne spostrzeżenia w sektorze opieki zdrowotnej· Ulepszanie elementów XAI, czyli zrozumiałości, przejrzystości, interpretowalności i łatwości wyjaśnienia.
· Niestandardowe techniki XAI dla sektora opieki zdrowotnej z szczegółowymi informacjami dla branży medycznej
(Ihongbe i in., 2024)Grad-CAM (Gradient-weighted Class Activation Mapping)Gradientowe ważenie mapowania aktywacji klasLepsza dokładność w diagnozowaniu zapalenia płuc i COVID-19.· Poprawa dokładności diagnostyki medycznejZwiększenie świadomości użyteczności technik XAI w zastosowaniach w praktyce
(Lenaers i De Moor, 2023).6 technik XAIZespół 6 technik XAI na modelu CatBoostWiele technik zwiększa interpretowalność XAI do prognozowania czynszów.· Prognoza belgijskich czynszów mieszkaniowychXAI może być wykorzystywane do podejmowania decyzji
(Makumbura i in., 2024)SHAPZespół RF, LightGBM, XGBoost z SHAPSHAP ujawnia różne czynniki odpowiedzialne za ocenę i przewidywanie jakości wody.· Ocena i prognozowanie jakości wodyMożna go wykorzystać do podejmowania decyzji
(Schlegel & Keim, 2023).Techniki XAI z analizą perturbacjiAnaliza perturbacjiMożna skutecznie wykorzystać do zadań klasyfikacji danych szeregów czasowych· Dane szeregów czasowych z finansów, opieki zdrowotnej, nauk o klimacieŁączenie wielu technik XAI dla lepszej interpretowalności.
(Silva & Keller, 2023)XAINie udostępnionoModele XAI mają ograniczenie wyjaśniające wyniki w przypadku cech skorelowanych. Można je wykorzystać w naukach o Ziemi i atmosferze.· Nauki atmosferyczneXAI musi być zoptymalizowane pod kątem powiązanych cech, aby uniknąć fałszywych wyjaśnień.
Szybkość reakcji biomolekularnej· Chemia atmosferyczna
(Y, S., & Challa, M. 2023)SHAPNie udostępnionoTutaj modele XAI są porównywane pod względem interpretowalności i zrozumienia istotnych cech, a stwierdzono, że SHAP i LIME są najskuteczniejsze.· Zastosowania medycznePoprawa interpretowalności dla zaawansowanych zastosowań medycznych
WAPNO
PDP
GAM

Tabela 2: Kompleksowy przegląd różnych optymalizacji zastosowanych w technikach XAI. Ta tabela przedstawia kompleksowy przegląd różnych technik optymalizacji proponowanych przez różnych badaczy.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Ta sekcja omawia proponowaną metodę zespołową, w tym wszystkie proponowane poprawki przedstawione na Rysunku 1.

Przygotowanie danych

Aby zweryfikować skuteczność proponowanych ram, autorzy przeprowadzili eksperyment na zbiorze danych o plonach zebranych z Kaggle17. Ten zbiór danych zawiera indyjskie dane rolne dla różnych upraw z lat 1997–2020 i został udostępniony w marcu 2025 roku. Ten zbiór danych obejmuje wiele cech, takich jak sezon, crop_year, nawozy, pestycydy, uprawy oraz plon (zmienna docelowa) itd. Rozpatrywany zbiór danych jest wstępnie przetwarzany dla zwiększenia efektywności, wykorzystując kodowanie one-hot do obsługi wartości kategorycznych. Cechy kategoryczne, takie jak pora roku, plony i stan, są kodowane jako one-hot. Skalowanie MinMax jest również stosowane do skalowania cech liczbowych takich jak powierzchnia, produkcja, annual_rainfall, nawozy i pestycydy do zakresu [0,1]. Aby obsłużyć wartości odstające, zastosowaliśmy regułę zakresu międzykwartylowego z progiem Q1 - 1,5 • IQR17. Losowe ziarno 42 zostało zastosowane we wszystkich etapach wstępnego przetwarzania, aby uzyskać powtarzalność wyników. Ponadto zbiór danych został podzielony na zbiór treningowy (80%) oraz zbiór testowy (20%) po wstępnym przetwarzaniu.

Układ eksperymentalny

Eksperyment przeprowadzono przy użyciu Pythona 3.10 na serwerze GPU A100 z procesorem: Dual AMD Rome 7742, 128 rdzeniami, 1TB RAM. Biblioteki importowane do symulacji to scikit-learn 1.3.0, XGBoost 1.7.6, TensorFlow 2.13, SHAP 0.41.0, LIME 0.2.0.1 oraz ELI5 0.13.0.

Ocena modeli ML

Tutaj autorzy wykorzystali różne modele regresji, takie jak LinearRegression(), Ridge(alpha=1,random_state=42), Lasso(alpha=0,1,stan losowy = 42), Decision TreeRegressor(max_depth = 10, random_state= 42), RandomForestRegressor(max_depth = 15random_state = 42), GradientBoostingRegressor(n_estimators = 200, learning_rate = 0,1, random_state = 42), XGBoost oraz CNN, aby określić wpływ różnych zmiennych na zmienną docelową yield18. XGBoost używa 300 estymatorów i ma szybkość uczenia się 0,05. W modelu CNN używa się dwóch ukrytych warstw: aktywacji ReLU oraz optymalizatora Adama z częstotliwością uczenia 0,001. Efektywność tych modeli porównywana jest za pomocą różnych wskaźników wydajności. Modele te wykonują również dostrajanie hiperparametrów. Na przykład regresja grzbietowa i regresja Lasso są trenowane z alfa równa się odpowiednio 1,0 i alfa równa 0,1. W Drzewie Decyzyjnym i Losowym Lesie maksymalna głębokość była ustalana odpowiednio na 10 i 15. Gradient Boosting wykorzystuje 200 estymatorów i współczynnik uczenia się 0,1. Wydajność tych modeli oceniano za pomocą walidacji krzyżowej pięciokrotnej w kategoriach średniego błędu kwadratowego (MSE) oraz kwadratu R2.

Ocena modeli XAI

Jak wspomniano, obecne prace wykorzystują różne modele XAI do porównania wyników. Tutaj autorzy używają shap. TreeExplainer(model,data = crop_yield) dla modeli opartych na drzewie (Random Forest, Gradient Boosting i XGBoost). Z zestawu treningowego wybrano tło danych 100 losowo wybranych przypadków, aby ustabilizować atrybuacje. Dalej, Shap. KernelExplainer() był używany do modeli niedrzewnych (Linear, Ridge, Lasso i CNN) z 1000 perturbacjami, aby zbliżyć się do wartości SHAP. Wyjaśniacz tabelarny (lime.lime_tabular. LimeTabularExplainer) był używany z 5000 perturbacjami na instancję do uruchomienia LIME na tym samym zbiorze danych w tle, aby zapewnić stabilność lokalnych wyjaśnień. Szerokość jądra ustalano na podstawie cech, a funkcja predykcyjna modelu służyła do wnioskowania wyjaśnień. Lokalne wyjaśnienia generowano przez wywołanie explainer.explain_instance(x,model.predict). ELI5 zostało wykorzystane jako znaczenie permutacji z 10 powtórzeniami na podziale walidacyjnym, aby uniknąć nadmiernego dopasowania danych testowych, i symulowane za pomocą eli5.sklearn.PermutationImportance(estymator,random_state = 42). Znaczenie średniej i wariancji między powtórzeniami zostało wykazane podczas eksperymentu. Ostatecznie model dopasowany został użyty do podziału walidacyjnego w celu uzyskania wykresów częściowych zależności (PDP), które zostały zaimplementowane za pomocą PartialDependencyDisplay.from_estimator (model,X_val,cechy = [cecha]),

Utworzenie ram TCHSHAP

Następnie TCHSHAP został zaimplementowany poprzez zastosowanie różnych kroków w kolejności. Pierwszym krokiem w sekwencji było ważenie czasowe wykorzystujące funkcję wykładniczego zaniku o tempie zaniku λ = 0,85, wybraną na podstawie badania ablacji w λ figure-protocol-1 [0.7.0.95]. Czas odniesienia (T_current) został wybrany jako ostatni rok uprawy w zbiorze danych. Zapewnia to, że wyjaśnienia modelu uwzględniają dynamikę prognozy produkcji rolnej, gdzie ostatnie cechy (opady, stosowanie nawozów czy pestycydów) mają większe znaczenie przy podejmowaniu decyzji. Ważenie czasowe zostało następnie podjęte przez SCM, aby przyjmować wnioski przyczynowe. Sugerowana metodologia wykorzystuje operator punktowy do symulacji interwencji i obliczania średniego efektu przyczynowego. Wnioskowanie przyczynowe zostało zastosowane przy użyciu biblioteki python doWhy 0.13. Pomaga to łagodzić mylące powiązania wynikające z skorelowanych wejść, takich jak produkcja i powierzchnia, osiągając rzeczywiste powiązania przyczynowo-skutkowe. Ostatnim krokiem w pipeline była hierarchiczna atrybuacja, gdzie cechy były organizowane w domeny wyższego poziomu. W obecnym zbiorze danych wyróżniają się trzy cechy hierarchiczne: nakłady rolnicze (nawóz, pestycydy), czynniki geograficzne (stan, obszar, Crop_Year) oraz czynniki środowiskowe (Annual_Rainfall, sezon). Dzięki zastosowaniu znormalizowanego sumowania do grupowania danych SHAP można uzyskać wyjaśnienia na obu poziomach (szczegółowych i ogólnych).

Podsumowując, potok TCHSHAP łączy trzy kroki – korektę czasową, przypisanie przyczynowe oraz hierarchiczną grupację w jeden proces. Tutaj bazowy SHAP najpierw przedstawia wyjaśnienia, a następnie dodaje trzy ulepszenia. Ten uporządkowany pipeline zapewnia, że wyniki TCHSHAP są spójne, możliwe do powielania oraz dostarczają zarówno lokalnych, jak i globalnych wyjaśnień. Szczegółowy opis proponowanego frameworka znajduje się w poniższym pseudokodzie.

Wkład:
X: Zbiór danych z cechami X1,X 2,X 3,........,Xn.
t: zmienna czasowa w zbiorze danych
Prąd T: Czas odniesienia
λ: Szybkość zaniku
G: Grupy cech
Oblicz wagi czasowe
Dla każdego przypadku ifigure-protocol-2 X należy wyliczyć wt = e-λ|t-T|,
Oblicz wartości shapi
Oblicz ShapTempral = Shapi * wt
Oblicz wnioskowanie przyczynowe
Dla każdej cechy Xi figure-protocol-3 X
Oblicz ShapPrzyczynowy = Shapi * Efekt Przyczynowy(Xj →Y)
Hierarchiczna atrybucja
Dla każdej cechy Xi figure-protocol-4 X
Oblicz wartości shapi
Dla każdego Gi figure-protocol-5 G
figure-protocol-6

Wyjście: Zestaw hierarchicznie zagregowanych wartości SHAP

Ilościowy punkt kontrolny ułatwiający rozwiązywanie problemów przedstawiono poniżej: Losowy Las daje najniższy MSE i najwyższy R2 we wszystkich modelach ML. Uzyskano znaczenie cech > pestycydów > nawozów, przy minimalnym sezonie i Crop_Year. Globalna prognoza bazowa SHAP wyniosła 161,137. Ponadto, po zastosowaniu λ = 0,85, wkład Crop_year i Season wzrasta. Wkłady na poziomie grup są w kolejności: Wkłady rolnicze>Czynniki geograficzne> Czynniki środowiskowe.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta sekcja omawia wyniki uzyskane dzięki zastosowaniu różnych metod stosowanych podczas badania, obejmujących różne podsekcje, jak poniżej:

Zbieranie i wstępne przetwarzanie danych

Aby przeprowadzić eksperymentalną ocenę proponowanych ram, zebrano zbiór danych dotyczących plonów z Kaggle19. Zebrane dane były wstępnie przetwarzane...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Głównym celem obecnego badania jest uwzględnienie wagowania czasowego, wnioskowania przyczynowego oraz hierarchicznego znaczenia w tradycyjnym modelu SHAP, co daje model TCHSHAP. Celem włączenia tych elementów do technik XAI jest poprawa interpretowalności wyników. Dla ważenia czasowego rozważaliśmy technikę wykładniczego spadku, która nadaje większą wagę najnowszym wartościom w porównaniu do starych. W przypadku istotności przyczynowej autorzy starają się ocenić bezpośredni wpływ różnych cech na zmienną predykcyjną. Pon...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy twierdzą, że nie ma konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prace te są finansowane z funduszy krajowych poprzez FCT – Fundação para a Ciência e a Tecnologia, I.P., na podstawie umowy programowej UID/05105/2025.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
ELI50.13.0PyPI
WAPNO0.2.0.1PyPI
Serwer GPU Nvidia DGX A100CPU Dual AMD Rome 7742, łącznie 128 rdzeniNvidia
Pamięć systemowa 1TB
Pyton3.1Pyton
SHAP0.41.0PyPI
scikit-learn1.3.0PyPI
TensorFlow2.13Przepływ tensorowy
XGBoost1.7.6PyPI

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kaur, B., et al. N-Beats architecture for explainable forecasting of multi-dimensional poultry data. PloS One. 20 (4), e0320979(2025).
  2. Sharma, N., Mangla, M., Iqbal, M. M., Mohanty, S. N. Deep Learning Framework for Identification of Skin Lesions. EAI Endorsed Trans Perv Health Tech. 9, (2023).
  3. Sharma, N., Mohanty, S. N., Mahato, S., Pattanaik, C. R. A novel dataset and local interpretable model-agnostic explanations (LIME) for monkeypox prediction. Intell Decision Technol. 17 (4), 1297-1308 (2023).
  4. Makumbura, R. K., et al. Advancing Water Quality Assessment and Prediction Using Machine Learning Models, Coupled with Explainable Artificial Intelligence (XAI) Techniques Like Shapley Additive Explanations (SHAP) For Interpreting the Black-Box Nature. Results Eng. 23, 102831(2024).
  5. Schlegel, U., Keim, D. A. A Deep Dive into Perturbations as Evaluation Technique for Time Series XAI. Communic Comp Informat Sci. 1903, (2023).
  6. Silva, S. J., Keller, C. A. Limitations of XAI methods for process-level understanding in the atmospheric sciences. Artificial Intell Earth Syst. 3 (1), e230045(2024).
  7. Anushree, G., Madagaonkar, S. B., Ravili, C. H. Unveiling the Black Box: A Comprehensive Review of Explainable AI Techniques. Int J Sci Res Eng Manag. 8 (9), 1-11 (2024).
  8. Awal, M. A., Roy, C. K. EvaluateXAI: A framework to evaluate the reliability and consistency of rule-based XAI techniques for software analytics tasks. J Syst Software. 217, 112159(2024).
  9. Hajare, S. W., Rewatkar, R., Reddy, K. Design of an iterative method for enhanced early prediction of acute coronary syndrome using XAI analysis. AIMS Bioeng. 11 (3), 301-322 (2024).
  10. Hamida, S. U., Chowdhury, M. J. M., Chakraborty, N. R., Biswas, K., Sami, S. K. Exploring the landscape of explainable artificial intelligence (XAI): A systematic review of techniques and applications. Big Data Cognit Comput. 8 (11), 149(2024).
  11. Ihongbe, I. E., Fouad, S. F., Mahmoud, T., Rajasekaran, A., Bhatia, B. Evaluating Explainable Artificial Intelligence (XAI) techniques in chest radiology imaging through a human-centered Lens. PloS One. 19 (10), e0308758(2024).
  12. A Comparative Analysis of Explainable AI Techniques for Enhanced Model Interpretability. Swathi, Y., Challa, M. 3rd Int Conf Pervasive Comput Social Netw, , 229-234 (2023).
  13. Lenaers, I., De Moor, L. Exploring XAI techniques for enhancing model transparency and interpretability in real estate rent prediction: a comparative study. Finance Res Lett. 58 (Part A), 104306(2023).
  14. Bommer, P. L., Kretschmer, M., Hedström, A. K., Bareeva, D., Höhne, M. Finding the right XAI Method - A Guide for the Evaluation and Ranking of Explainable AI Methods in Climate Science. Artif Intell Earth Syst. 3, e230074(2024).
  15. Bhatnagar, S., Agrawal, R. Understanding explainable artificial intelligence techniques: a comparative analysis for practical application. Bullet Elect Eng Info. 13 (6), 4451-4455 (2024).
  16. Ennab, M., Mcheick, H. Enhancing interpretability and accuracy of AI models in healthcare: a comprehensive review on challenges and future directions. Front Robot AI. 11, 1444763(2024).
  17. Wan, X., Wang, W., Liu, J., Tong, T. Estimating the sample mean and standard deviation from the sample size, median, range and/or interquartile range. BMC Med Res Methodol. 14 (1), 135(2014).
  18. Mangla, M., Shinde, S. K., Mehta, V., Sharma, N., Mohanty, S. N. Handbook of Research on Machine Learning: Foundations and Applications. , CRC Press. (2022).
  19. Gupta, A. Agricultural Crop Yield in Indian States Dataset [Data set]. , Kaggle. https://www.kaggle.com/datasets/akshatgupta7/crop-yield-in-indian-states-dataset (2025).
  20. Shin, J., Miah, A. S. M., Konnai, S., Hoshitaka, S., Kim, P. Electromyography-Based Gesture Recognition with Explainable AI (XAI): Hierarchical Feature Extraction for Enhanced Spatial-Temporal Dynamics. IEEE Access. 13, 88930-88951 (2025).
  21. Das, A., Rad, P. Opportunities and challenges in explainable artificial intelligence (xai): A survey. arXiv. , (2020).
  22. Srinivasu, P. N., Sandhya, N., Jhaveri, R. H., Raut, R. From blackbox to explainable AI in healthcare: existing tools and case studies. Mobile Info Syst. 2022 (1), 8167821(2022).
  23. Fiok, K., Farahani, F. V., Karwowski, W., Ahram, T. Explainable artificial intelligence for education and training. J Defense Model Simulat. 19 (2), 133-144 (2022).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Wyja nialna sztuczna inteligencjainterpretowalno modeluatrybucja cechlas losowymodelowanie regresyjnenormalizacja danych

Powiązane artykuły