Forschungsartikel

Ensemble von zeitlicher Gewichtung, kausaler Inferenz und hierarchischer Zuordnung zur SHAP-Optimierung

DOI:

10.3791/69125

18. November 2025

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Artikel zielt darauf ab, die Auswirkungen von zeitlicher Gewichtung, kausaler Inferenz und hierarchischer Attribution auf die Optimierung der Interpretierbarkeit zu bewerten.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In den letzten Jahren hat sich der Bedarf an Transparenz und Interpretierbarkeit durch bedeutende Fortschritte bei datengetriebenen Modellen verstärkt, was zur Entstehung der erklärbaren Künstlichen Intelligenz (XAI) geführt hat. Mehrere traditionelle XAI-Ansätze sind verbreitet; diese haben jedoch nur begrenzte Kompetenz bei der Interpretation dynamischer Beziehungen. Die aktuelle Forschung zielt darauf ab, diese Einschränkung zu beheben, indem ein neuartiges Ensemble SHapley Additive Explanations (SHAP)-Framework vorgeschlagen wird, das sich auf zeitliche Gewichtung, kausale Inferenz, hierarchische Attribution und Interpretierbarkeitsoptimierung konzentriert, bekannt als TCHSHAP. TCHSHAP priorisiert aktuelle Informationen über historische Informationen durch zeitliche Gewichtung durch exponentielle Zerfallsverteilung. Darüber hinaus trennt kausale Schlussfolgerung Korrelation von Kausalität, um praktische Einsichten zu gewinnen. Zusätzlich ermöglicht hierarchische Attribution Einblicke auf granularer (Regionsebene) und aggregierten Ebenen (Merkmalsgruppenauswirkungen). Diese Ansätze werden integriert, um ein interpretierbareres und erklärbareres Modell zu erreichen. Um die Wirksamkeit des vorgeschlagenen Modells zu validieren, führen wir ein Experiment mit dem von Kaggle gesammelten Ernteertragsdatensatz durch. Vor der experimentellen Auswertung wird die Datenvorverarbeitung mittels One-Hot-Codierung durchgeführt. Die Datennormalisierung erfolgt durch Min-Max-Skalierung, und Ausreißer werden über den Interquartilbereich entfernt. Zur experimentellen Bewertung verwendeten die Autoren das SHAP XAI-Modell für Random Forest. Bei der Bewertung der Wirksamkeit des vorgeschlagenen TCHSHAP-Modells wird festgestellt, dass die durchschnittliche Vorhersage für traditionelle SHAP zwar 161,137 beträgt, aber nach Einbeziehung zeitlicher Gewichtung und kausaler Inferenz auf 161,506 ansteigt, was die Wirksamkeit der Anwendung zeitlicher und kausaler Bedeutung befürwortet. Außerdem wird bei der hierarchischen Attribution beobachtet, dass landwirtschaftliche Merkmale die stärkste Dominanz über die Zielvariable haben. Auf diese Dominanz folgen geografische und ökologische Faktoren. Somit autorisieren die erzielten Ergebnisse die Wirksamkeit des vorgeschlagenen Ansatzes zur Verbesserung der globalen und lokalen Interpretierbarkeit und stärken das Vertrauen des Nutzers in Modellvorhersagen. Die aktuelle Arbeit bietet Möglichkeiten, Transparenz und Interpretierbarkeit zu verbessern, ohne die Modellleistung zu beeinträchtigen. Das vorgeschlagene Modell ermöglicht zudem interpretierbare und effiziente Regressionsmodellierung in komplexen, datengetriebenen Anwendungen und ermöglicht so eine weitverbreitete Anwendung in realen Umgebungen.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Regression spielt eine bedeutende Rolle in der prädiktiven Analytik und umfasst mehrere Bereiche, darunter Klimamodellierung, Finanzprognosen, Gesundheitsdiagnostik und landwirtschaftliche Ertragsschätzung 1,2. Die unerklärlichen Ergebnisse von Regressionsmodellen, insbesondere nichtlinearer und hochkapazitabler Modelle wie Gradient Boosting Machines (GBMs), Random Forests und Deep Neural Networks (DNNs), stellen jedoch erhebliche Herausforderungen dar, insbesondere für Anwendungen, die Transparenz und umsetzbare Erkenntnisse erfordern. Diese Interpretierbarkeitslücke kann durch den Einsatz von Explainable Artificial Intelligence (XAI) geschlossen werden, einer Technik, die sich noch in den Kinderschuhen befindet. Derzeit liefern konventionelle XAI-Frameworks wie SHAP und Local Interpretable Model Agnostic Explanation (LIME) nur statische Merkmalserklärungen3. Diese XAI-Techniken erklären derzeit nicht die Feinheiten von Regressionsaufgaben, die zeitliche Abhängigkeiten, hierarchische Merkmalstrukturen und Kausalitäten betreffen, und schaffen so eine Forschungsrichtung 4,5. Aufgrund der Nichtberücksichtigung dieser Faktoren kann XAI manchmal falsche Schlussfolgerungen ziehen. Zum Beispiel berücksichtigt das traditionelle SHAP nur die Korrelation der Attribute mit der Zielvariablen, ohne die Kausalität zu berücksichtigen. Betrachten wir einen Datensatz mit zwei binären Eingabemerkmalen, nämlich Tabakkonsum und verfärbte Zähne. Die Zielvariable in diesem Datensatz ist die Krebswahrscheinlichkeit. In einem solchen Szenario, wenn eine Korrelation zwischen den Eingabemerkmalen und der Zielvariablen hergestellt wird, ist der Krebs stark mit beiden Merkmalen (Tabakkonsum und gefärbte Zähne) korreliert. Es ist jedoch ziemlich irreführend zu schließen, dass gefärbte Zähne Krebs verursachen, da sie durch regelmäßigen Tabakkonsum verursacht werden. Daher lässt sich zusammenfassen, dass trotz erheblicher Fortschritte im Bereich XAI die wichtigsten Probleme, die in Regressionskontexten angegangen werden müssen, gehören:

Die Unfähigkeit, zeitliche Abhängigkeiten zu berücksichtigen, führt nur zu statischen Erklärungen, die in Kontexten mit dynamischen Daten möglicherweise nicht funktionieren.

Das Nichteinschließen kausaler Inferenz in traditionelle SHAP-Adaptationen führt zu falschen Korrelationen statt zu wertvollen kausalen Einsichten.

Mangelnde Aufmerksamkeit für hierarchische Interpretation führt zu unzureichenden, aggregierten Erklärungen auf höherer Ebene.

Um diese Probleme anzugehen, zielt die aktuelle Forschung darauf ab, ein neuartiges XAI-Rahmenwerk, TCHSHAP, vorzuschlagen, das zeitliche Gewichtung, kausale Inferenz und hierarchische Attribution umfasst, mit dem Ziel, die Interpretierbarkeit und Recheneffizienz aktueller XAI-Modelle zu verbessern. Dafür berücksichtigt das vorgeschlagene Rahmenwerk einen zeitlichen Gewichtungsfaktor wt, der dem aktuellen Merkmalsbeitrag höhere Gewichtungen zuweist im Vergleich zu früheren Werten. Dieser Gewichtungsfaktor soll sicherstellen, dass die Interpretierbarkeit mit der zeitlichen Bedeutung entscheidender Merkmale in dynamischen Regressionsproblemen wie Renditeprognosen und Umsatzvorhersagen übereinstimmt. Darüber hinaus zeigen traditionelle Regressionsmodelle keine kausalen Zusammenhänge auf, was zu mehrdeutigen Zuschreibungenführt 6. Um diese Herausforderung zu bewältigen, verwendet der vorgeschlagene Rahmen strukturelle kausale Modelle (SCMs), um die kausale Auswirkung eines Merkmals Fi auf das Ergebnis zu bewerten. Darüber hinaus zeigen die Echtzeitdatensätze oft hierarchische Beziehungen (räumlich oder kategorisch) zwischen den Merkmalen, die in bestehenden XAI-Frameworks 4,5,6 selten gezeigt werden. Im Gegensatz dazu aggregiert das vorgeschlagene XAI-Framework einzelne Merkmale (Fi), um höherstufige Merkmale (Hj) zu erhalten, um die Granularität der Erklärungen zu erreichen.

Neben der Einbeziehung zeitlicher, kausaler und hierarchischer Bedeutung zielt das vorgeschlagene Ensemble auch darauf ab, die Interpretierbarkeit und Erklärbarkeit zu verbessern. Ein solches Ziel ist ein Versuch, den Kompromiss zwischen Interpretierbarkeit und Genauigkeit herzustellen und sicherzustellen, dass die aus TCHSHAP gewonnenen Erklärungen genau und interpretierbar sind4. Das vorgeschlagene XAI-Framework kann mathematisch wie folgt beschrieben werden, während die Beschreibung der verwendeten Variablen in Tabelle 1 angegeben ist. Der traditionelle SHAP-Wert für das Merkmal wird als Gleichung (1)5,6 berechnet.

figure-introduction-1(1)

Diese traditionelle SHAP-Formulierung summiert Beiträge, ohne zeitliche, kausale oder hierarchische Anpassungen zu berücksichtigen.

VariableDefinition
FiMerkmal, dessen Shap-Wert berechnet wird
ShapiShap-Wert des Merkmals
SGesamtausstattung der Merkmale
MTeilmenge aller Merkmale
FTGesamtzahl der Funktionen
P(M)Modellvorhersage, wenn nur Merkmale in M verwendet werden
λ > 0Abbaurate
TReferenzvorhersagezeit
YAusgabe

Tabelle 1: Beschreibung der verwendeten Variablen. Diese Tabelle beschreibt die Bedeutung verschiedener verwendeter Variablen.

Diese traditionelle SHAP-Formulierung wird modifiziert, um dynamische Abhängigkeiten durch zeitliche Gewichtung zu bewältigen. Diese zeitliche Gewichtung wird durch die Einführung des Gewichtungskoeffizienten wt = e-λ |t - T| wobei λ den Zerfallsfaktor (λ > 0) darstellt. Wie bereits erläutert, gibt diese exponentielle Gewichtung den aktuellen Werten mehr Gewicht im Vergleich zu früheren Werten. Dieser exponentielle Abfall ist mit dem Verständnis verbunden, dass aktuelle Merkmalswerte eine höhere Signifikanz haben als frühere Werte. Der modifizierte SHAP-Wert (nach Einbeziehung der zeitlichen Bedeutung) ist in Gleichung (2) angegeben.

figure-introduction-2(2)

Diese zeitlichen Informationen sind wichtig für dynamische Regressionsaufgaben wie die Vorhersage von Renditen oder Aktien.

Um die Erklärungen robuster zu machen, wird zudem SCM angewendet, um die kausale Auswirkung des Merkmals Fi auf das Ergebnis Y zu bewerten. Die mathematische Formulierung für kausale SHAP ist in Gleichung (3) gegeben

figure-introduction-3(3)

Hier repräsentiert do(Fi) das Merkmal, das zur Änderung beigetragen hat. Durch diese Anwendung erreicht das Modell die Kompetenz, die Kausalität und nicht die Korrelation zu erklären. Es ist erwähnenswert, dass SCM-basierte Berechnung kausaler Effekte sicherstellt, dass nur Merkmale mit direktem kausalen Einfluss anerkannt werden, wodurch falsche Korrelationen eliminiert werden.

Darüber hinaus wird im vorgeschlagenen Modell die Hierarchie vorgeschlagen, um Attribute über verschiedene Ebenen hinweg zu aggregieren. Die mathematische Formulierung für das hierarchische SHAP ist in Gleichung (4) gegeben.

figure-introduction-4(4)

Die Einbeziehung von Hierarchie in das vorgeschlagene Modell stellt die Erreichung der Granularität der Erklärungen sicher. Der vorgeschlagene Rahmen ist in Abbildung 1 dargestellt.

figure-introduction-5
Abbildung 1: Bildliche Darstellung verschiedener Elemente im vorgeschlagenen Rahmen. Diese Abbildung zeigt eine bildliche Darstellung verschiedener Elemente im vorgeschlagenen Rahmen TCHSHAP, darunter zeitliche Gewichtung, kausale Inferenz und hierarchische Zuordnung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Die Neuheit des vorgeschlagenen Modells TCHSHAP liegt darin, diese drei Inkonsistenzen durch zeitliche Gewichtung (um aktuellen Informationen mehr Gewicht zu geben), strukturelle kausale Modelle (SCM; zur Bewertung kausale Effekte) und hierarchische Aggregation von SHAP-Werten (um mehrstufige Einblicke zu gewinnen) zu bewältigen. Somit erweitert das vorgeschlagene Ensemble SHAP über seine statischen Einschränkungen hinaus und bietet einen regressionsoptimierten erklärenden Rahmen.

Das vorgeschlagene TCHSHAP hat das Potenzial, für Echtzeitanwendungen in Szenarien, die bessere Entscheidungen erfordern, große Bedeutung zu erlangen, da es die detaillierten Erklärungen der Ergebnisse in Regressionsmodellen identifiziert und Modellierung nahtlos mit Entscheidungsfindung verknüpft. Zusammenfassend ist der wichtigste Beitrag dieses Manuskripts die Entwicklung eines neuartigen Rahmens, der zeitliche Gewichtung, kausale Inferenz und hierarchische Beziehungen kombiniert, um die handlungsbaren Erklärungen des traditionellen SHAP-Modells zu verbessern.

Verwandte Arbeiten

XAI integriert verschiedene Methoden, die speziell entwickelt wurden, um die Transparenz und Interpretierbarkeit verschiedener Machine-Learning-Modelle zu verbessern. Diese XAI-Strategien schaffen Vertrauen in die Ergebnisse, indem sie die erforderlichen Erkenntnisse aus den Ergebnissen liefern. So verbessern beispielsweise bemerkenswerte XAI-Methoden wie LIME und SHAP die Interpretierbarkeit und Transparenz von ansonsten Black-Box-Modellen in verschiedenen Bereichen, insbesondere Finanzen, Bildung undGesundheitssektor. Außerdem werden XAI-Techniken in Aufgaben wie Softwareanalyse, Klonerkennung und Just-in-Time-Fehlervorhersage8 eingesetzt. Außerdem hoben Awal und Roy auch die Diskrepanzen hervor und zeigten eine geringere Zuverlässigkeit bei der Erzeugung derErklärungen 8. Hier wandten die Autoren granulare Bewertungsmetriken an, um die Konsistenz in der Bewertung zu verringern. XAI wurde auch im medizinischen Bereich häufig eingesetzt, um die wichtigsten Faktoren zu verstehen, die die Ergebnisse der Klassifikationsaufgabe beeinflussen, und so das Vertrauen unter Gesundheitsfachkräften zu stärken, KI-basierte Diagnostikeinzusetzen. Darüber hinaus erleichtern XAI-Ansätze in Sektoren wie der belgischen Wohnungsmietvorhersage die Interpretation komplexer Modelle, wodurch die Qualitätskontrolle verbessert und Produktionsfehler minimiertwerden. Bommer et al. zeigten, dass die Integration von XAI-Methoden mit Gradienten die Leistung der XAI-Methoden in Bezug auf Robustheit, Treue, Komplexität und Randomisierung in der Klimawissenschaft verbessert14. Viele Forscher haben versucht, Ensemble- und Hybridtechniken zu entwickeln. Neben der Vorschläge von Ensemble-Techniken zeigten Forscher auch die Wirksamkeit dieser hybriden Techniken, um umfassende Einblicke für komplexe Modelle15,16 zu liefern. Eine detaillierte Übersicht über die Techniken, Optimierungen und verschiedenen Anwendungen ist in Tabelle 2 dargestellt, die klar zeigt, dass die am weitesten verbreiteten Techniken LIME und SHAP sind. Die zukünftige Forschungsrichtung weist darauf hin, Optimierung in diesen Methoden zu erforschen, um die Interpretierbarkeit dieser Modelle zu verbessern. In diesem Forschungsfeld konzentrieren sich die Autoren der aktuellen Forschung auf SHAP-Optimierung, indem sie kausale Inferenz, hierarchische Attribution und zeitliche Gewichtung hinzufügen.

ZitatXAI-TechnikenOptimierungEinblickeAnträgeZukünftige Forschungsrichtungen
(Anushree et al., 2024)LIMONENicht bereitgestelltVerbesserung der Interpretierbarkeit und Transparenz von Black-Box-Modellen in verschiedenen Anwendungen im Finanz-, Bildungs- und Gesundheitssektor.· Abwägung zwischen Genauigkeit und Interpretierbarkeit im Finanz-, Bildungs- und Gesundheitssektor· Es muss eine Liste detaillierter Metriken zur Bewertung verschiedener XAI-Modelle erstellt werden.
SHAP
Störungsmechanismen
Aufmerksamkeitsbasierte Mechanismen
(Awal & Roy, 2024)PyExplainerGranulare Bewertungsmetriken zur Reduzierung der Konsistenz in der Bewertung.Hebt die Unstimmigkeiten hervor und zeigt eine geringere Zuverlässigkeit bei der Erzeugung der Erklärungen.· Aufgaben im Bereich Softwareanalyse· Fortschrittliche Forschungsmethoden sind erforderlich, um die Zuverlässigkeit von XAI-Modellen für Aufgaben im Bereich Softwareanalyse zu verbessern
LIMONE· Klonerkennung
· Just-in-Time-Defektvorhersage
(Bommer et al., 2024)Integrierte SteigungenIntegration von XAI-Methoden mit GradientenDie Integration von XAI-Methoden mit Gradienten verbessert die Leistung in Bezug auf Robustheit, Treue, Komplexität und Randomisierung in der Klimawissenschaft.· Klimawissenschaftliche Vorhersage· Konzentrieren Sie sich auf die aufgabenspezifische Bewertung der Klimawissenschaft.
Schichtweise Relevanzpropagation· Jahresmittelwert Vorhersage von Temperaturkarten
Eingangs-Zeit-Gradienten
Sensitivitätsmethoden wie Gradient, SmoothGrad, NoiseGrad und FusionGrad
(Bhatnagar & Agrawal, 2024)LIMONEEnsemble der XAI-TechnikenEnsemble liefert umfassende Einblicke und verbessert die Interpretierbarkeit und Erklärbarkeit komplexer Modelle.· Angewandt auf Moral-Dataset, um die Interpretierbarkeit der Ergebnisse zu verbessern· Entdecken Sie hybride XAI-Methoden, indem Sie mehrere Techniken kombinieren
SHAP· Anpassung verschiedener XAI-Algorithmen für spezifische Modelle, die unterschiedlichen Bedürfnissen der Nutzer gerecht werden
(Dias, 2024)LIMONEIntegration von XAI-TechnikenVerbesserte Interpretierbarkeit und Genauigkeit· Klassifizierung des toxischen Kommentars· Stärke für Klassifikationszwecke erhöhen.
Eli5
(Hajare et al., 2024)SHAPNicht bereitgestelltSHAP bietet detaillierte Einblicke in die Risikofaktoren bei der Vorhersage des akuten koronaren Syndroms.· Akutes Koronarsyndrom (ACS)· Um neue Risikofaktoren bei der ACS-Vorhersage herauszufinden.
(Hamida et al., 2024)Umfassende Übersicht verschiedener XAI-TechnikenNicht bereitgestelltBietet Einblicke in XAI-Anwendungen XAI im Gesundheitswesen und betont die Bedeutung der Erklärbarkeit von KI-Entscheidungen, um die Ergebnisse von KI zu verstehen.· Umsetzbare Erkenntnisse im Gesundheitswesen· Verbesserung der XAI-Komponenten, nämlich Verständlichkeit, Transparenz, Interpretierbarkeit und Erklärbarkeit.
· Individuelle XAI-Techniken für den Gesundheitssektor für detaillierte Einblicke im Gesundheitsbereich
(Ihongbe et al., 2024)Grad-CAM (Gradient-gewichtete Klassenaktivierungskartierung)Gradientengewichtete KlassenaktivierungsabbildungBessere Genauigkeit bei der Diagnose einer Lungenentzündung und COVID-19.· Verbesserte Genauigkeit bei der medizinischen DiagnoseUm das Bewusstsein für die Nutzbarkeit von XAI-Techniken für reale Anwendungen zu erhöhen
(Lenaers, & De Moor, 2023).6 XAI-TechnikenEnsemble der 6 XAI-Techniken im CatBoost-ModellMehrere Techniken verbessern die Interpretierbarkeit von XAI zur Mietvorhersage.· Prognos der belgischen WohnungsmietenXAI kann für Entscheidungsfindung genutzt werden
(Makumbura et al., 2024)SHAPEnsemble aus RF, LightGBM, XGBoost mit SHAPSHAP zeigt die verschiedenen Faktoren auf, die für die Bewertung und Vorhersage der Wasserqualität verantwortlich sind.· Bewertung und Vorhersage der WasserqualitätKann für Entscheidungsfindung eingesetzt werden
(Schlegel & Keim, 2023).XAI-Techniken mit StörungsanalyseStörungsanalyseKann effektiv für Klassifikationsaufgaben von Zeitreihendaten eingesetzt werden· Zeitreihendaten aus Finanzen, Gesundheitswesen und KlimawissenschaftenMehrere XAI-Techniken zu kombinieren, um die Interpretierbarkeit zu verbessern.
(Silva & Keller, 2023)XAINicht bereitgestelltXAI-Modelle haben eine Einschränkung, um die Ergebnisse im Falle korrelierter Merkmale zu erklären. Kann für Erd- und Atmosphärenwissenschaften eingesetzt werden.· AtmosphärenwissenschaftenXAI muss für korrelierte Merkmale optimiert werden, um falsche Erklärungen zu vermeiden.
Biomolekulare Reaktionsgeschwindigkeit· Atmosphärenchemie
(Y, S. & Challa, M. 2023)SHAPNicht bereitgestelltHier werden XAI-Modelle hinsichtlich Interpretierbarkeit und Verständnis wichtiger Merkmale verglichen, und es kommt zu dem Schluss, dass SHAP und LIME am effektivsten sind.· Medizinische AnwendungenVerbesserung der Interpretierbarkeit für fortgeschrittene medizinische Anwendungen
LIMONE
PDP
GAM

Tabelle 2: Umfassende Übersicht verschiedener Optimierungen mit XAI-Techniken. Diese Tabelle präsentiert eine umfassende Übersicht verschiedener Optimierungstechniken, die von verschiedenen Forschern vorgeschlagen wurden.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

HINWEIS: Dieser Abschnitt behandelt die vorgeschlagene Ensemble-Methode, einschließlich aller vorgeschlagenen Änderungen, wie in Abbildung 1 dargestellt.

Datenaufbereitung

Um die Wirksamkeit des vorgeschlagenen Rahmens zu validieren, führten die Autoren ein Experiment mit dem Ernteertragsdatensatz aus Kaggle17 durch. Dieser Datensatz besteht aus indischen landwirtschaftlichen Daten für verschiedene Kulturen von 1997 bis 2020 und wurde im März 2025 abgerufen. Dieser Datensatz umfasst zahlreiche Merkmale, nämlich Saison, crop_year, Düngemittel, Pestizid, Ernte und Ertrag (Zielvariable) usw. Der betrachtete Datensatz wird vorverarbeitet, um die Effizienz zu steigern, indem eine One-Hot-Codierung verwendet wird, um kategorische Werte zu verarbeiten. Die kategorialen Merkmale wie Saison, Ernte und Zustand sind ein-Heiß-codiert. MinMax-Skalierung wird auch verwendet, um numerische Merkmale wie Fläche, Produktion, annual_rainfall, Dünger und Pestizid auf den Bereich [0,1] zu skalieren. Um die Ausreißer zu bewältigen, verwendeten wir die Interquartil-Range-Regel mit einer Schwelle Q1 - 1,5 • IQR17. Ein zufälliger Seed von 42 wurde über alle Vorverarbeitungsschritte hinweg angewendet, um die Reproduzierbarkeit der Ergebnisse zu erhalten. Darüber hinaus wurde der Datensatz nach der Vorverarbeitung in einen Trainingsdatensatz (80 %) und einen Testdatensatz (20 %) aufgeteilt.

Experimenteller Aufbau

Das Experiment wurde mit Python 3.10 auf einem A100-GPU-Server mit CPU durchgeführt: Dual AMD Rome 7742, 128 Kerne, 1 TB RAM. Für die Simulation importierte Bibliotheken sind scikit-learn 1.3.0, XGBoost 1.7.6, TensorFlow 2.13, SHAP 0.41.0, LIME 0.2.0.1 und ELI5 0.13.0.

Bewertung von ML-Modellen

Hier haben die Autoren verschiedene Regressionsmodelle verwendet, nämlich LinearRegression(), Ridge(alpha=1,random_state=42), Lasso (alpha=0,1,RandomState = 42), Decision TreeRegressor(max_depth = 10, random_state = 42), RandomForestRegressor(max_depth = 15random_state = 42), GradientBoostingRegressor(n_estimators = 200, learning_rate = 0,1, random_state = 42), XGBoost und CNN, um den Einfluss verschiedener Variablen auf die Zielvariable Yield18 zu bestimmen. XGBoost verwendet 300 Schätzer und eine Lernrate von 0,05. Im CNN-Modell werden zwei versteckte Schichten, ReLU-Aktivierungen und Adam-Optimierer mit einer Lernrate von 0,001 verwendet. Die Effizienz dieser Modelle wird mit unterschiedlichen Leistungskennzahlen verglichen. Diese Modelle führen auch Hyperparameter-Tuning durch. Zum Beispiel werden Ridge-Regression und Lasso-Regression mit Alpha gleich 1,0 bzw. Alpha gleich 0,1 trainiert. In Decision Tree und Random Forest wurde die maximale Tiefe auf 10 bzw. 15 gesetzt. Gradient Boosting verwendet 200 Schätzer und eine Lernrate von 0,1. Die Leistung dieser Modelle wurde mittels 5-facher Kreuzvalidierung in Bezug auf den mittleren quadratischen Fehler () und das R2-Quadrat bewertet.

Bewertung der XAI-Modelle

Wie besprochen, verwendet die aktuelle Arbeit verschiedene XAI-Modelle zum Vergleich der Ergebnisse. Hier verwenden die Autoren Shap. TreeExplainer(model,data = crop_yield) für baumbasierte Modelle (Random Forest, Gradient Boosting und XGBoost). Ein Hintergrunddatensatz mit 100 zufällig ausgewählten Fällen wurde aus dem Trainingsdatensatz ausgewählt, um die Attributionen zu stabilisieren. Weiter, Shap. KernelExplainer() wurde für Nicht-Baum-Modelle (Linear, Ridge, Lasso und CNN) mit 1000 Störungen verwendet, um SHAP-Werte nahe zu kommen. Tabular-Erklärung (lime.lime_tabular. LimeTabularExplainer) wurde mit 5000 Störungen pro Instanz verwendet, um LIME auf demselben Hintergrunddatensatz auszuführen, um sicherzustellen, dass lokale Erklärungen stabil sind. Die Kernbreite wurde anhand von Eigenschaften festgelegt, und die Vorhersagefunktion des Modells wurde verwendet, um Erklärungen zu leiten. Lokale Erklärungen wurden erzeugt, indem explainer.explain_instance(x,model.predict) aufgerufen wurde. ELI5 wurde als Permutationswichtigkeit mit 10 Wiederholungen im Validierungssplit verwendet, um Überanpassung der Testdaten zu vermeiden, und mit eli5.sklearn.PermutationImportance(Schätzer,random_state = 42 simuliert). Die Bedeutung von Mittelwert und Varianz zwischen den Wiederholungen wurde während des Experiments gezeigt. Schließlich wurde das angepasste Modell für die Validierungsaufteilung verwendet, um Partial Dependence Plots (PDPs) zu erhalten, die mit PartialDependencyDisplay.from_estimator implementiert wurden (model,X_val,features = [feature]),

Aufbau des TCHSHAP-Frameworks

Anschließend wurde TCHSHAP durch das Anwenden verschiedener Schritte nacheinander implementiert. Der erste Schritt in der Sequenz war die zeitliche Gewichtung, die eine exponentielle Zerfallsfunktion mit einer Zerfallsrate von λ = 0,85 verwendet, die auf Grundlage einer Ablationsstudie über λ figure-protocol-1 [0.7.0.95] ausgewählt wurde. Die Referenzzeit (T_current) wurde als aktuelles Erntejahr im Datensatz ausgewählt. Dies stellt sicher, dass die Modellerklärungen die Dynamik der landwirtschaftlichen Produktionsprognose berücksichtigen, wobei aktuelle Merkmale (Niederschlag, Düngemittelverwendung oder Pestizid) für Entscheidungen eine größere Bedeutung haben. Der zeitlichen Gewichtung folgte SCM, um kausale Inferenzen zu übernehmen. Die vorgeschlagene Methodik verwendet den Dot-Operator, um Interventionen zu simulieren und den durchschnittlichen kausalen Effekt zu berechnen. Die kausale Inferenz wurde mit der Python doWhy 0.13-Bibliothek angewendet. Dies hilft, irreführende Zusammenhänge durch korrelierte Inputs wie Produktion und Fläche zu verringern und reale Ursache-Wirkungs-Zusammenhänge zu erzeugen. Der letzte Schritt in der Pipeline war die hierarchische Attribution, bei der Merkmale in höherwertige Domänen organisiert wurden. Für den aktuellen Datensatz gibt es drei hierarchische Merkmale, nämlich landwirtschaftliche Betriebsmittel (Dünger, Pestizid), geografische Faktoren (Bundesstaat, Fläche, Crop_Year) und Umweltfaktoren (Annual_Rainfall, Jahreszeit). Durch die Verwendung einer normalisierten Summe zur Gruppen-SHAP-Daten können auf beiden Ebenen (detaillierte und allgemeine) Erklärungen gewonnen werden.

Zusammenfassend kombiniert die TCHSHAP-Pipeline drei Schritte – zeitliche Anpassung, kausale Attribution und hierarchische Gruppierung – in einem einzigen Prozess. Hier gibt Baseline-SHAP zunächst Erklärungen, gefolgt von der Hinzufügung von drei Verbesserungen. Diese strukturierte Pipeline stellt sicher, dass die Ausgaben von TCHSHAP konsistent sind, reproduziert werden können und sowohl lokale als auch globale Erklärungen liefern. Die Schritt-für-Schritt-Beschreibung des vorgeschlagenen Frameworks findet sich im untenstehenden Pseudocode.

Eingabe:
X: Datensatz mit Merkmalen X1,X 2,X 3,........,Xn.
t: zeitliche Variable im Datensatz
T-Strom: Referenzzeit
λ: Zerfallsrate
G: Merkmalsgruppen
Berechnen Sie temporale Gewichte
Für jede Instanz ifigure-protocol-2X wird wt = e-λ|t-T|, 
Berechnen Sie die Shap-Werte Shapi
Berechnen Sie ShapTempral = Shapi * wt
Berechnen Sie kausale Inferenz
Für jedes Merkmal gilt Xi figure-protocol-3 X
Berechnen Sie ShapCausal = Shapi * Kausaleffekt(Xj →Y)
Hierarchische Zuschreibung
Für jedes Merkmal gilt Xi figure-protocol-4 X
Berechnen Sie die Shap-Werte Shapi
Für jedes Gi figure-protocol-5 G
figure-protocol-6

Ausgabe: Menge hierarchisch aggregierter SHAP-Werte

Der quantitative Checkpoint zur Erleichterung der Fehlersuche ist unten angegeben: Random Forest liefert den niedrigsten und den höchsten R2 in allen ML-Modellen. Die erhaltene Merkmalsbedeutung war Flächen > Pestizide > Düngemittel, wobei Saison und Crop_Year minimal waren. Die globale SHAP-Basisprognose lag bei 161,137. Außerdem steigt nach Anwendung von λ = 0,85 der Beitrag von Crop_year und Season. Beiträge auf Gruppenebene folgen der Reihenfolge Agrarinputs>Geographische Faktoren> Umweltfaktoren.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dieser Abschnitt behandelt die Ergebnisse, die durch die Anwendung verschiedener während der Experimentstudie verwendeter Methoden erzielt wurden, die aus folgenden Unterabschnitten bestehen:

Datenerhebung und Vorverarbeitung

Um eine experimentelle Bewertung des vorgeschlagenen Rahmens durchzuführen, wurde ein Datensat...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Das Hauptziel der aktuellen Studie ist es, zeitliche Gewichtung, kausale Inferenz und hierarchische Bedeutung in das traditionelle SHAP-Modell zu integrieren, was das TCHSHAP-Modell ergibt. Der Grund für die Integration dieser Komponenten in XAI-Techniken ist es, die Interpretierbarkeit der Ergebnisse zu verbessern. Für die zeitliche Gewichtung haben wir eine exponentielle Abklingungstechnik betrachtet, die aktuellen Werten mehr Gewicht zuteilt im Vergleich zu alten Werten. In der kausal...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren erklären, dass keine Interessenkonflikte vorliegen.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wird durch nationale Mittel über FCT – Fundação para a Ciência e a Tecnologia, I.P., im Rahmen des Programmvertrags UID/05105/2025 finanziert.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
ELI50.13.0PyPI
LIMONE0.2.0.1PyPI
Nvidia DGX A100 GPU ServerCPU Dual AMD Rome 7742, insgesamt 128 KerneNvidia
Systemspeicher 1TB
Python3.1Python
SHAP0.41.0PyPI
scikit-learn1.3.0PyPI
TensorFlow2.13Tensorfluss
XGBoost1.7.6PyPI

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kaur, B., et al. N-Beats architecture for explainable forecasting of multi-dimensional poultry data. PloS One. 20 (4), e0320979(2025).
  2. Sharma, N., Mangla, M., Iqbal, M. M., Mohanty, S. N. Deep Learning Framework for Identification of Skin Lesions. EAI Endorsed Trans Perv Health Tech. 9, (2023).
  3. Sharma, N., Mohanty, S. N., Mahato, S., Pattanaik, C. R. A novel dataset and local interpretable model-agnostic explanations (LIME) for monkeypox prediction. Intell Decision Technol. 17 (4), 1297-1308 (2023).
  4. Makumbura, R. K., et al. Advancing Water Quality Assessment and Prediction Using Machine Learning Models, Coupled with Explainable Artificial Intelligence (XAI) Techniques Like Shapley Additive Explanations (SHAP) For Interpreting the Black-Box Nature. Results Eng. 23, 102831(2024).
  5. Schlegel, U., Keim, D. A. A Deep Dive into Perturbations as Evaluation Technique for Time Series XAI. Communic Comp Informat Sci. 1903, (2023).
  6. Silva, S. J., Keller, C. A. Limitations of XAI methods for process-level understanding in the atmospheric sciences. Artificial Intell Earth Syst. 3 (1), e230045(2024).
  7. Anushree, G., Madagaonkar, S. B., Ravili, C. H. Unveiling the Black Box: A Comprehensive Review of Explainable AI Techniques. Int J Sci Res Eng Manag. 8 (9), 1-11 (2024).
  8. Awal, M. A., Roy, C. K. EvaluateXAI: A framework to evaluate the reliability and consistency of rule-based XAI techniques for software analytics tasks. J Syst Software. 217, 112159(2024).
  9. Hajare, S. W., Rewatkar, R., Reddy, K. Design of an iterative method for enhanced early prediction of acute coronary syndrome using XAI analysis. AIMS Bioeng. 11 (3), 301-322 (2024).
  10. Hamida, S. U., Chowdhury, M. J. M., Chakraborty, N. R., Biswas, K., Sami, S. K. Exploring the landscape of explainable artificial intelligence (XAI): A systematic review of techniques and applications. Big Data Cognit Comput. 8 (11), 149(2024).
  11. Ihongbe, I. E., Fouad, S. F., Mahmoud, T., Rajasekaran, A., Bhatia, B. Evaluating Explainable Artificial Intelligence (XAI) techniques in chest radiology imaging through a human-centered Lens. PloS One. 19 (10), e0308758(2024).
  12. A Comparative Analysis of Explainable AI Techniques for Enhanced Model Interpretability. Swathi, Y., Challa, M. 3rd Int Conf Pervasive Comput Social Netw, , 229-234 (2023).
  13. Lenaers, I., De Moor, L. Exploring XAI techniques for enhancing model transparency and interpretability in real estate rent prediction: a comparative study. Finance Res Lett. 58 (Part A), 104306(2023).
  14. Bommer, P. L., Kretschmer, M., Hedström, A. K., Bareeva, D., Höhne, M. Finding the right XAI Method - A Guide for the Evaluation and Ranking of Explainable AI Methods in Climate Science. Artif Intell Earth Syst. 3, e230074(2024).
  15. Bhatnagar, S., Agrawal, R. Understanding explainable artificial intelligence techniques: a comparative analysis for practical application. Bullet Elect Eng Info. 13 (6), 4451-4455 (2024).
  16. Ennab, M., Mcheick, H. Enhancing interpretability and accuracy of AI models in healthcare: a comprehensive review on challenges and future directions. Front Robot AI. 11, 1444763(2024).
  17. Wan, X., Wang, W., Liu, J., Tong, T. Estimating the sample mean and standard deviation from the sample size, median, range and/or interquartile range. BMC Med Res Methodol. 14 (1), 135(2014).
  18. Mangla, M., Shinde, S. K., Mehta, V., Sharma, N., Mohanty, S. N. Handbook of Research on Machine Learning: Foundations and Applications. , CRC Press. (2022).
  19. Gupta, A. Agricultural Crop Yield in Indian States Dataset [Data set]. , Kaggle. https://www.kaggle.com/datasets/akshatgupta7/crop-yield-in-indian-states-dataset (2025).
  20. Shin, J., Miah, A. S. M., Konnai, S., Hoshitaka, S., Kim, P. Electromyography-Based Gesture Recognition with Explainable AI (XAI): Hierarchical Feature Extraction for Enhanced Spatial-Temporal Dynamics. IEEE Access. 13, 88930-88951 (2025).
  21. Das, A., Rad, P. Opportunities and challenges in explainable artificial intelligence (xai): A survey. arXiv. , (2020).
  22. Srinivasu, P. N., Sandhya, N., Jhaveri, R. H., Raut, R. From blackbox to explainable AI in healthcare: existing tools and case studies. Mobile Info Syst. 2022 (1), 8167821(2022).
  23. Fiok, K., Farahani, F. V., Karwowski, W., Ahram, T. Explainable artificial intelligence for education and training. J Defense Model Simulat. 19 (2), 133-144 (2022).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Erkl rbare KIModellinterpretierbarkeitFeature AttributionRandom ForestRegressionsmodellierungDatennormalisierung

Verwandte Artikel