Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Zespół wag czasowych, wnioskowanie przyczynowe i hierarchiczna atrybucja w optymalizacji SHAP

498 wyświetleń

DOI:

10.3791/69125

18 listopada 2025

W tym artykule

Podsumowanie

Niniejszy artykuł ma na celu ocenę wpływu wagowania czasowego, wnioskowania przyczynowego oraz hierarchicznego przypisywania na optymalizację interpretowalności.

Streszczenie

W ciągu ostatnich kilku lat potrzeba przejrzystości i interpretowalności wzrosła dzięki znaczącym postępom w modelach opartych na danych, co doprowadziło do powstania Wyjaśnialnej Sztucznej Inteligencji (XAI). Dominuje kilka tradycyjnych podejść XAI; jednak mają one ograniczone kompetencje w interpretacji relacji dynamicznych. Obecne badania mają na celu rozwiązanie tego ograniczenia poprzez propozycję nowatorskiego frameworka Ensemble SHapley Additive ExPlanations (SHAP), który koncentruje się na ważeniu czasowym, wnioskowaniu przyczynowym, hierarchicznym przypisaniu oraz optymalizacji interpretowalności, znanym jako TCHSHAP. TCHSHAP priorytetowo traktuje informacje bieżące nad historycznymi poprzez ważenie czasowe poprzez wykładnicze zanikanie. Ponadto wnioskowanie przyczynowe oddziela korelację od przyczynowości, aby uzyskać praktyczne wnioski. Dodatkowo, hierarchiczna atrybucja pozwala na analizę na poziomie szczegółowym (na poziomie regionu) i agregowanym (wpływ na grupy cech). Te podejścia są zintegrowane, aby uzyskać bardziej interpretowalny i wyjaśniający model. Aby zweryfikować skuteczność proponowanego modelu, przeprowadzamy eksperyment na zbiorze danych o plonach zebranych z Kaggle. Przed eksperymentalną oceną wstępne przetwarzanie danych odbywa się za pomocą kodowania one-hot. Normalizacja danych odbywa się poprzez skalowanie min-max, a wartości odstające są usuwane w zakresie interkwartylowym. Dla celów oceny eksperymentalnej autorzy wykorzystali model SHAP XAI dla Random Forest. Podczas oceny skuteczności proponowanego modelu TCHSHAP zaobserwowano, że podczas gdy średnia prognoza dla tradycyjnego SHAP wynosi 161,137, wzrasta do 161,506 po uwzględnieniu ważenia czasowego i wnioskowania przyczynowego, co podkreśla skuteczność stosowania istotności czasowej i przyczynowej. Dodatkowo, podczas hierarchicznej atrybucji zaobserwowano, że cechy rolnicze mają najsilniejszą dominację nad zmienną docelową. Ta dominacja jest następowana przez czynniki geograficzne i środowiskowe w kolejności. W ten sposób uzyskane wyniki upoważniają do skuteczności proponowanego podejścia w celu zwiększenia globalnej i lokalnej interpretowalności, wzmacniając zaufanie użytkownika do prognoz modelu. Obecne prace oferują sposoby na poprawę przejrzystości i interpretowalności bez wpływu na wydajność modelu. Sugerowany model umożliwia również interpretowalne i efektywne modelowanie regresyjne w złożonych, opartych na danych aplikacjach, umożliwiając jego szerokie zastosowanie w rzeczywistych warunkach.

Wprowadzenie

Regresja odgrywa kluczową rolę w analityce predykcyjnej, obejmując kilka dziedzin, w tym modelowanie klimatu, prognozowanie finansowe, diagnostykę medyczną oraz szacowanie plonów rolnych 1,2. Jednak niewyjaśnione wyniki modeli regresji, zwłaszcza nieliniowych i o dużej pojemności, takich jak Gradient Boosting Machines (GBM), losowe lasy i głębokie sieci neuronowe (DNN), stwarzają poważne wyzwania, zwłaszcza dla zastosowań wymagających przejrzystości i praktycznych wniosków. Lukę w interpretowalności można zniwelować, stosując Explainable Artificial Intelligence (XAI), technikę, która wciąż jest w powijakach. O....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

UWAGA: Ta sekcja omawia proponowaną metodę zespołową, w tym wszystkie proponowane poprawki przedstawione na Rysunku 1.

Przygotowanie danych

Aby zweryfikować skuteczność proponowanych ram, autorzy przeprowadzili eksperyment na zbiorze danych o plonach zebranych z Kaggle17. Ten zbiór danych zawiera indyjskie dane rolne dla różnych upraw z lat 1997–2020 i został udostępniony w marcu 2025 roku. Ten zbiór danych obejmuje wiele cech, takich jak sezon, crop_year, nawozy, pestycydy, uprawy oraz plon (zmienna docelowa) itd. Rozpatrywany zbiór danych je....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Ta sekcja omawia wyniki uzyskane dzięki zastosowaniu różnych metod stosowanych podczas badania, obejmujących różne podsekcje, jak poniżej:

Zbieranie i wstępne przetwarzanie danych

Aby przeprowadzić eksperymentalną ocenę proponowanych ram, zebrano zbiór danych dotyczących plonów z Kaggle19. Zebrane dane były wstępnie przetwarzane.......

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Głównym celem obecnego badania jest uwzględnienie wagowania czasowego, wnioskowania przyczynowego oraz hierarchicznego znaczenia w tradycyjnym modelu SHAP, co daje model TCHSHAP. Celem włączenia tych elementów do technik XAI jest poprawa interpretowalności wyników. Dla ważenia czasowego rozważaliśmy technikę wykładniczego spadku, która nadaje większą wagę najnowszym wartościom w porównaniu do starych. W przypadku istotności przyczynowej autorzy starają się ocenić bezpośredni wpływ różnych cech na zmienną predykcyjną. Pon.......

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy twierdzą, że nie ma konfliktów interesów.

Podziękowania

Prace te są finansowane z funduszy krajowych poprzez FCT – Fundação para a Ciência e a Tecnologia, I.P., na podstawie umowy programowej UID/05105/2025.

....

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
ELI50.13.0PyPI
WAPNO0.2.0.1PyPI
Serwer GPU Nvidia DGX A100CPU Dual AMD Rome 7742, łącznie 128 rdzeniNvidia
Pamięć systemowa 1TB
Pyton3.1Pyton
SHAP0.41.0PyPI
scikit-learn1.3.0PyPI
TensorFlow2.13Przepływ tensorowy
XGBoost1.7.6PyPI

Bibliografia

  1. Kaur, B., et al. N-Beats architecture for explainable forecasting of multi-dimensional poultry data. PloS One. 20 (4), e0320979(2025).
  2. Sharma, N., Mangla, M., Iqbal, M. M., Mohanty, S. N. Deep Learning Framework for Identification of Skin Lesions.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Wyja nialna sztuczna inteligencjainterpretowalno modeluatrybucja cechlas losowymodelowanie regresyjnenormalizacja danych