Articolo di ricerca

Insieme di ponderazione temporale, inferenza causale e attribuzione gerarchica per l'ottimizzazione SHAP

DOI:

10.3791/69125

18 novembre 2025

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo articolo mira a valutare l'impatto della ponderazione temporale, dell'inferenza causale e dell'attribuzione gerarchica sull'ottimizzazione dell'interpretabilità.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Negli ultimi anni, la necessità di trasparenza e interpretabilità si è intensificata grazie ai significativi progressi nei modelli basati sui dati, portando all'emergere dell'Intelligenza Artificiale Spiegabile (XAI). Sono diffusi diversi approcci XAI tradizionali; tuttavia, questi hanno una competenza limitata nell'interpretare le relazioni dinamiche. La ricerca attuale mira a risolvere questa limitazione proponendo un nuovo framework Ensemble SHapley Additive ExPlanations (SHAP) che si concentra su ponderazione temporale, inferenza causale, attribuzione gerarchica e ottimizzazione della interpretabilità, noto come TCHSHAP. Il TCHSHAP dà priorità alle informazioni attuali rispetto a quelle storiche, pesando temporalmente attraverso il decadimento esponenziale. Inoltre, l'inferenza causale separa correlazione dalla causalità per ottenere intuizioni pratiche. Inoltre, l'attribuzione gerarchica consente insight a livello granulare (a livello regionale) e aggregato (impatti dei gruppi di caratteristiche). Questi approcci sono integrati per ottenere un modello più interpretabile e spiegabile. Per convalidare l'efficacia del modello proposto, conduciamo un esperimento sul dataset di rese delle colture raccolto da Kaggle. Prima della valutazione sperimentale, la pre-elaborazione dei dati viene effettuata utilizzando la codifica one-hot. La normalizzazione dei dati avviene tramite scalatura min-max, e gli outlier vengono rimossi attraverso l'intervallo Interquartile. Per scopi di valutazione sperimentale, gli autori hanno utilizzato il modello SHAP XAI per la Foresta Casuale. Quando si valuta l'efficacia del modello TCHSHAP proposto, si osserva che, mentre la previsione media per lo SHAP tradizionale è di 161,137, essa sale a 161,506 dopo aver incorporato la ponderazione temporale e l'inferenza causale, sostenendo l'efficacia dell'impiego di significati temporali e causali. Inoltre, durante l'attribuzione gerarchica, si osserva che le caratteristiche agricole hanno la maggiore predominanza sulla variabile target. A questo predominio segue in ordine fattori geografici e ambientali. Pertanto, i risultati ottenuti autorizzano l'efficacia dell'approccio proposto per migliorare l'interpretabilità globale e locale, rafforzando la fiducia dell'utente nelle previsioni dei modelli. Il lavoro attuale offre modi per migliorare la trasparenza e l'interpretabilità senza compromettere le prestazioni del modello. Il modello suggerito consente anche una modellazione di regressione interpretabile ed efficiente in applicazioni complesse basate sui dati, consentendone un'applicazione diffusa in contesti reali.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La regressione svolge un ruolo fondamentale nell'analisi predittiva, comprendendo diversi ambiti tra cui la modellazione climatica, la previsione finanziaria, la diagnostica sanitaria e la stima della resaagricola 1,2. Tuttavia, i risultati inspiegabili dei modelli di regressione, in particolare quelli non lineari e ad alta capacità come le Gradient Boosting Machines (GBM), le Foreste Random e le Reti Neurali Profonde (DNN), rappresentano sfide significative, in particolare per applicazioni che richiedono trasparenza e insight azionabili. Questo divario di interpretabilità può essere colmato utilizzando l'Intelligenza Artificiale Spiegabile (XAI), una tecnica ancora agli inizi. Attualmente, i framework XAI convenzionali come SHAP e Local Interpretable Model Agnostic Explanation (LIME) forniscono solo spiegazioni statiche3. Queste tecniche XAI attualmente non spiegano le complessità dei compiti di regressione che coinvolgono dipendenze temporali, strutture gerarchiche di caratteristiche e causalità, creando una via di ricerca 4,5. A causa della mancata considerazione di questi fattori, XAI può talvolta trarre conclusioni errate. Ad esempio, lo SHAP tradizionale considera solo la correlazione degli attributi con la variabile target senza considerare la causalità. Consideriamo un dataset con due caratteristiche binarie di input, ovvero il consumo di tabacco e i denti colorati. La variabile target in questo dataset è la probabilità di cancro. In uno scenario del genere, se si ottiene correlazione tra le caratteristiche di ingresso e la variabile target, il cancro sarà fortemente correlato con entrambe le caratteristiche (consumo di tabacco e denti colorati). Ora è piuttosto fuorviante concludere che i denti macchiati causino il cancro, poiché sono causati dal consumo regolare di tabacco. Pertanto, si può riassumere che, nonostante i notevoli progressi nel campo della XAI, le principali questioni da affrontare nei contesti di regressione includono:

L'incapacità di considerare le dipendenze temporali porta solo a spiegazioni statiche che potrebbero non funzionare in contesti con dati dinamici.

La mancata inclusione di inferenza causale nelle adattamenti tradizionali di SHAP causa false correlazioni piuttosto che preziose intuizioni causali.

La mancanza di attenzione all'interpretazione gerarchica porta a spiegazioni aggregate di livello superiore insufficienti.

Per affrontare queste problematiche, i lavori di ricerca attuali mirano a proporre un nuovo framework XAI, TCHSHAP, che comprende la ponderazione temporale, l'inferenza causale e l'attribuzione gerarchica, con l'obiettivo di migliorare l'interpretabilità e l'efficienza computazionale dei modelli XAI attuali. Per lo stesso, il quadro proposto considera un fattore di pesatura temporale wt che assegna pesi maggiori al contributo recente delle caratteristiche rispetto ai valori passati. Questo fattore di ponderazione mira a garantire che l'interpretabilità sia in linea con il significato temporale di caratteristiche cruciali nei problemi di regressione dinamica come la previsione del rendimento e la previsione delle vendite. Inoltre, i modelli di regressione tradizionali non mostrano relazioni causali, portando ad attribuzioniambigue 6. Per affrontare questa sfida, il framework proposto adotta Modelli Causali Strutturali (SCM) per valutare l'impatto causale di una caratteristica Fi sull'output. Inoltre, i dataset in tempo reale spesso mostrano relazioni gerarchiche (spaziali o categoriche) tra le caratteristiche, che raramente sono mostrate nei framework XAIesistenti 4,5,6. Al contrario, il framework XAI suggerito aggrega singole caratteristiche (Fi) per ottenere caratteristiche di livello superiore (Hj), per ottenere la granularità delle spiegazioni.

Oltre a incorporare significati temporali, causali e gerarchici, l'ensemble proposto mira anche a migliorare l'interpretabilità e la spiegabilità. Tale obiettivo è uno sforzo per stabilire il compromesso tra interpretabilità e accuratezza, assicurando che le spiegazioni ottenute da TCHSHAP siano accurate einterpretabili 4. Il framework XAI suggerito può essere descritto matematicamente come segue, mentre la descrizione delle variabili utilizzate è fornita nella Tabella 1. Il valore tradizionale SHAP per la caratteristica viene calcolato come equazione (1)5,6.

figure-introduction-1(1)

Questa formulazione tradizionale di SHAP somma i contributi senza considerare aggiustamenti temporali, causali o gerarchici.

VariabileDefinizione
FiCaratteristica il cui valore Shap viene calcolato
ShapiValore di shap della Feature
SSet di caratteristiche totali
MSottoinsieme di tutte le caratteristiche
FTNumero totale di caratteristiche
P(M)Previsione del modello quando vengono utilizzate solo le caratteristiche in M
λ > 0Tasso di decadimento
TTempo di previsione di riferimento
YProdotto

Tabella 1: Descrizione delle variabili utilizzate. Questa tabella descrive il significato delle varie variabili utilizzate.

Questa formulazione tradizionale di SHAP viene modificata per gestire dipendenze dinamiche includendo la ponderazione temporale. Questa ponderazione temporale viene incorporata introducendo il coefficiente di ponderazione wt = e-λ |t - t| dove λ rappresenta il fattore di decadimento (λ > 0). Come discusso prima, questa ponderazione esponenziale dà più peso ai valori recenti rispetto ai valori passati. Questo decadimento esponenziale è incluso con la comprensione che i valori recenti delle caratteristiche hanno un significato maggiore rispetto ai valori passati. Il valore SHAP modificato (dopo aver incorporato la significanza temporale) è indicato nell'equazione (2).

figure-introduction-2(2)

Queste informazioni temporali sono importanti per compiti di regressione dinamica come la previsione di rendimenti o azioni.

Inoltre, per rendere le spiegazioni più solide, si applica la SCM per valutare l'impatto causale della caratteristica Fi sull'output Y. La formulazione matematica per lo SHAP causale è fornita nell'equazione (3)

figure-introduction-3(3)

Qui do(Fi) rappresenta la caratteristica che ha contribuito al cambiamento. Utilizzando questo, il modello acquisisce la competenza per spiegare la causalità piuttosto che la correlazione. Vale la pena notare che il calcolo degli effetti causali basato su SCM garantisce che solo le caratteristiche con influenza causale diretta vengano riconosciute, eliminando così false correlazioni.

Inoltre, la gerarchia è proposta nel modello suggerito per aggregare gli attributi su vari livelli. La formulazione matematica per lo SHAP gerarchico è data nell'equazione (4).

figure-introduction-4(4)

L'incorporazione della gerarchia nel modello suggerito garantisce il raggiungimento della granularità delle spiegazioni. Il quadro suggerito è raffigurato nella Figura 1.

figure-introduction-5
Figura 1: Illustrazione illustrata di vari elementi nel quadro proposto. Questa figura offre un'illustrazione illustrata di vari elementi nel quadro proposto TCHSHAP che includono la ponderazione temporale, l'inferenza causale e l'attribuzione gerarchica. Clicca qui per visualizzare una versione più grande di questa figura.

La novità del modello proposto TCHSHAP risiede nel gestire queste tre incongruenze utilizzando la ponderazione temporale (per dare maggiore peso alle informazioni attuali), i Modelli Causali Strutturali (SCM; per valutare gli effetti causali) e l'aggregazione gerarchica dei valori SHAP (per ottenere insight multilivello). Pertanto, l'ensemble proposto espande SHAP oltre i suoi vincoli statici, fornendo un quadro esplicativo ottimizzato per la regressione.

Il TCHSHAP proposto ha il potenziale di acquisire grande importanza per applicazioni in tempo reale in scenari che richiedono decisioni migliori, poiché identifica le spiegazioni dettagliate dell'output nei modelli di regressione, collegando senza soluzione di continuità la modellazione al processo decisionale. In sintesi, il contributo principale di questo manoscritto è progettare un quadro innovativo che combina ponderazione temporale, inferenza causale e relazioni gerarchiche per arricchire le spiegazioni pratiche del modello SHAP tradizionale.

Lavori correlati

XAI incorpora diverse metodologie appositamente progettate per migliorare la trasparenza e l'interpretabilità di diversi modelli di machine learning. Queste strategie XAI stabiliscono fiducia nei risultati fornendo le intuizioni necessarie a partire dai risultati. Ad esempio, metodologie XAI notevoli come LIME e SHAP migliorano l'interpretabilità e la trasparenza di modelli altrimenti black box in vari ambiti, in particolare finanza, istruzione e settoresanitario 7. Inoltre, le tecniche XAI sono applicate in compiti legati all'analisi del software, al rilevamento dei cloni e alla previsione dei difetti Just-in-Time8. Inoltre, Awal e Roy hanno evidenziato le discrepanze e dimostrato una minore affidabilità nella generazione dellespiegazioni 8. Qui, gli autori hanno applicato le Metriche di Valutazione a Livello Granulare per ridurre la coerenza nella valutazione. XAI è stato ampiamente impiegato anche nel campo medico per comprendere i fattori più rilevanti che influenzano i risultati del compito di classificazione e quindi per favorire la fiducia tra i professionisti sanitari nell'uso della diagnostica basata sull'IA 9,10,11,12. Inoltre, in settori come la previsione degli affitti residenziali belgi, gli approcci XAI facilitano l'interpretazione di modelli complessi, migliorando così il controllo qualità e minimizzando gli erroridi produzione 13. Bommer et al. hanno dimostrato che l'integrazione dei metodi XAI con gradienti migliora le prestazioni dei metodi XAI in termini di robustezza, fedeltà, complessità e randomizzazione nella scienza delclima 14. Molti ricercatori hanno tentato di creare tecniche di ensemble e ibride. Oltre a proporre tecniche di ensemble, i ricercatori hanno anche dimostrato l'efficacia di queste tecniche ibride nel fornire un'analisi completa per modelli complessi15,16. Una revisione dettagliata delle tecniche, ottimizzazioni e varie applicazioni è tabulata nella Tabella 2, che indica chiaramente che le tecniche più ampiamente applicate sono LIME e SHAP. La direzione futura della ricerca punta a esplorare l'ottimizzazione di questi metodi per migliorare l'interpretabilità di questi modelli. Proseguendo la linea di ricerca, gli autori dei lavori attuali si concentrano sull'ottimizzazione dello SHAP aggiungendo inferenza causale, attribuzione gerarchica e ponderazione temporale.

CitazioneTecniche XAIOttimizzazioneIntuizioniApplicazioniDirezioni future di ricerca
(Anushree et al., 2024)LIMONENon fornitoMiglioramento dell'interpretabilità e della trasparenza dei modelli black box in varie applicazioni nei settori finanziario, educativo e sanitario.· Compromesso tra accuratezza e interpretabilità nei settori Finanza, Istruzione e sanità· È necessario sviluppare un elenco dettagliato di metriche per valutare vari modelli XAI
SHAP
Meccanismi di perturbazione
Meccanismi basati sull'attenzione
(Awal & Roy, 2024)PyExplainerMetriche di valutazione a livello granulare per ridurre la coerenza nella valutazione.Evidenzia le discrepanze e dimostra una minore affidabilità nella generazione delle spiegazioni.· Compiti relativi all'analisi del software· Sono necessari metodi di ricerca avanzati per migliorare l'affidabilità dei modelli XAI per compiti legati all'analisi del software
LIMONE· Rilevamento dei cloni
· Previsione dei difetti Just in Time
(Bommer et al., 2024)Gradienti integratiIntegrazione dei metodi XAI con i gradientiL'integrazione dei metodi XAI con gradienti migliora le prestazioni in termini di robustezza, fedeltà, complessità e randomizzazione nella scienza del clima.· Previsione della Scienza del Clima· Concentrarsi sulla valutazione specifica della scienza del clima.
Propagazione della rilevanza a livello· Previsione delle mappe medie annuali della temperatura
Gradienti di tempi di input
metodi di sensibilità come Gradient, SmoothGrad, NoiseGrad e FusionGrad
(Bhatnagar & Agrawal, 2024)LIMONEEnsemble delle Tecniche XAIEnsemble offre approfondimenti completi e migliora l'interpretabilità e la spiegazione dei modelli complessi.· Applicato al dataset Morale per migliorare l'interpretabilità dei risultati· Esplora i metodi XAI ibridi combinando più tecniche
SHAP· Personalizzazione di vari algoritmi XAI per modelli specifici in base alle diverse esigenze degli utenti
(Dias, 2024)LIMONEIntegrazione delle tecniche XAIMiglioramento dell'interpretabilità e accuratezza· Classificazione dei commenti tossici· Aumentare la forza per scopi di classificazione.
Eli5
(Hajare et al., 2024)SHAPNon fornitoSHAP offre approfondimenti dettagliati sui fattori di rischio nella previsione della Sindrome Coronarica Acuta.· Sindrome coronarica acuta (ACS)· Per scoprire nuovi fattori di rischio nella previsione dell'ACS.
(Hamida et al., 2024)Revisione completa delle varie tecniche XAINon fornitoFornisce approfondimenti sulle applicazioni XAI nel settore sanitario, sottolineando l'importanza della spiegabilità delle decisioni di IA per comprendere i risultati forniti dall'IA.· Approfondimenti pratici nel settore sanitario· Miglioramento dei componenti XAI, ovvero comprensibilità, trasparenza, interpretabilità e spiegabilità.
· Tecniche XAI personalizzate per il settore sanitario per approfondimenti dettagliati nel settore sanitario
(Ihongbe et al., 2024)Grad-CAM (Mappatura di attivazione delle classi ponderata in gradiente)Mappatura di attivazione delle classi ponderata in gradienteMigliore accuratezza per la diagnosi di polmonite e COVID-19.· Precisione migliorata per la diagnosi medicaAumentare la consapevolezza dell'usabilità delle tecniche XAI per applicazioni reali
(Lenaers, & De Moor, 2023).6 Tecniche XAIEnsemble di 6 tecniche XAI sul modello CatBoostMolteplici tecniche migliorano l'interpretabilità di XAI per la previsione degli affitti.· Previsione degli affitti residenziali in BelgioXAI può essere utilizzato per il processo decisionale
(Makumbura et al., 2024)SHAPEnsemble di RF, LightGBM, XGBoost con SHAPSHAP rivela i vari fattori responsabili della valutazione e della previsione della qualità dell'acqua.· Valutazione e previsione della qualità dell'acquaPuò essere impiegato per il processo decisionale
(Schlegel & Keim, 2023).Tecniche XAI con analisi di perturbazioniAnalisi delle perturbazioniPuò essere impiegato efficacemente per compiti di classificazione dei Dati di Serie Temporale· Dati di serie temporali su Finanza, Sanità, Scienze del ClimaCombinare più tecniche XAI per una migliore interpretabilità.
(Silva & Keller, 2023)XAINon fornitoI modelli XAI hanno una limitazione nel spiegare i risultati nel caso di caratteristiche correlate. Può essere impiegato per le scienze della Terra e dell'atmosfera.· Scienze atmosfericheXAI deve essere ottimizzato per funzionalità correlate per evitare spiegazioni false.
Velocità di reazione biomolecolare· Chimica atmosferica
(Y, S., & Challa, M. 2023)SHAPNon fornitoQui, i modelli XAI vengono confrontati in termini di interpretabilità e comprensione di caratteristiche importanti e concludono che SHAP e LIME sono i più efficaci.· Applicazioni medicheMigliorare l'interpretabilità per applicazioni mediche avanzate
LIMONE
PDP
GAM

Tabella 2: Revisione completa delle varie ottimizzazioni effettuate sulle tecniche XAI. Questa tabella presenta una panoramica completa delle diverse tecniche di ottimizzazione suggerite da vari ricercatori.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Questa sezione discute il metodo di ensemble proposto, inclusi tutti gli emendamenti proposti come illustrato nella Figura 1.

Preparazione dei dati

Per convalidare l'efficacia del quadro proposto, gli autori hanno condotto un esperimento sul dataset di resa delle colture raccolto da Kaggle17. Questo dataset consiste in dati agricoli indiani per varie colture dal 1997 al 2020 ed è stato consultato nel marzo 2025. Questo dataset comprende numerose funzionalità, in particolare stagione, crop_year, fertilizzante, pesticida, coltura e resa (variabile target), ecc. Il dataset considerato viene pre-elaborato per una maggiore efficienza utilizzando la codifica one-hot per gestire i valori categoricici. Le caratteristiche categoriche come stagione, coltura e stato sono codificate a un solo hot. La scala MinMax viene inoltre impiegata per scalare le caratteristiche numeriche come area, produzione, annual_rainfall, fertilizzante e pesticida nell'intervallo [0,1]. Per gestire gli outlier, abbiamo utilizzato la regola dell'intervallo interquartile con una soglia Q1 - 1,5 • IQR17. Un seed casuale di 42 è stato applicato in tutti i passaggi di preprocessing per ottenere la riproducibilità dei risultati. Inoltre, il dataset è stato suddiviso in un dataset di addestramento (80%) e uno di test (20%) dopo la pre-elaborazione.

Configurazione sperimentale

L'esperimento è stato condotto utilizzando Python 3.10 su un server GPU A100 con CPU: Dual AMD Rome 7742, 128 core, 1TB di RAM. Le librerie importate per la simulazione sono scikit-learn 1.3.0, XGBoost 1.7.6, TensorFlow 2.13, SHAP 0.41.0, LIME 0.2.0.1 e ELI5 0.13.0.

Valutazione dei modelli ML

Qui, gli autori hanno utilizzato vari modelli di regressione, in particolare LinearRegression(), Ridge(alpha=1,random_state=42), Lasso(alpha=0,1,randomstate = 42), Decision TreeRegressor(max_depth = 10, random_state = 42), RandomForestRegressor(max_depth = 15random_state = 42), GradientBoostingRegressor(n_estimators = 200, learning_rate = 0,1, random_state = 42), XGBoost e CNN per determinare l'impatto di varie variabili sulla variabile target che ottiene18. XGBoost utilizza 300 stimatori e un tasso di apprendimento di 0,05. Nel modello CNN, vengono utilizzati due strati nascosti, attivazioni ReLU e ottimizzatore Adam con un tasso di apprendimento di 0,001. L'efficienza di questi modelli viene confrontata utilizzando diverse metriche di prestazione. Questi modelli eseguono anche l'accordatura degli iperparametri. Ad esempio, la regressione a cresta e la regressione a lasso sono addestrate con alfa uguale a 1,0 e alfa uguale a 0,1, rispettivamente. In Decision Tree e Random Forest, la profondità massima era impostata rispettivamente a 10 e 15. Il gradient Boosting utilizza 200 stimatori e una velocità di apprendimento di 0,1. Le prestazioni di questi modelli sono state valutate utilizzando la validazione incrociata a 5 volte in termini di Errore Quadratico Medio (MSE) e R2 quadrato.

Valutazione dei modelli XAI

Come discusso, il lavoro attuale utilizza vari modelli XAI per confrontare i risultati. Qui, gli autori usano shap. TreeExplainer(model,data = crop_yield) per modelli basati su alberi (Random Forest, Gradient Boosting e XGBoost). Un dataset di background di 100 casi selezionati casualmente è stato scelto dal dataset di addestramento per stabilizzare le attribuzioni. Inoltre, shap. KernelExplainer() è stato utilizzato per modelli non ad albero (Lineare, Ridge, Lasso e CNN) con 1000 perturbazioni per avvicinarsi ai valori SHAP. Spiegazione tabulare (lime.lime_tabular. LimeTabularExplainer) è stato utilizzato con 5000 perturbazioni per istanza per eseguire LIME sullo stesso dataset di background, al fine di garantire che le spiegazioni locale siano stabili. La larghezza del kernel veniva impostata in base alle caratteristiche, e la funzione di previsione del modello veniva utilizzata per dedurre spiegazioni. Le spiegazioni locali venivano generate chiamando explainer.explain_instance(x,model.predict). ELI5 è stato utilizzato come importanza per permutazione con 10 ripetizioni nella divisione di validazione per evitare il sovrafitting dei dati di test, ed è stato simulato usando eli5.sklearn.PermutationImportance(estimator,random_state = 42). Durante l'esperimento è stata evidenziata l'importanza della media e della varianza tra le ripetizioni. Infine, il modello adattato è stato utilizzato per la divisione di validazione per ottenere i Partial Dependence Plots (PDP), che sono stati implementati usando PartialDependencyDisplay.from_estimator (model, X_val, features = [caratteristica]),

Impostazione del framework TCHSHAP

Successivamente, TCHSHAP è stato implementato applicando vari passaggi in sequenza. Il primo passaggio della sequenza è stato il pesaggio temporale che utilizza una funzione di decadimento esponenziale con tasso di decadimento λ = 0,85, selezionata sulla base di uno studio di ablazione su λ figure-protocol-1 [0,7.0.95]. Il tempo di riferimento (T_current) è stato selezionato come anno colturale più recente nel dataset. Questo garantisce che le spiegazioni del modello considerino la dinamica della previsione della produzione agricola, dove le caratteristiche recenti (precipitazioni, uso di fertilizzanti o pesticidi) hanno maggiore importanza nelle decisioni. La ponderazione temporale è stata seguita dalla SCM per adottare inferenze causali. La metodologia suggerita utilizza l'operatore a punto per simulare interventi e calcolare l'Effetto Causale Medio. L'inferenza causale è stata applicata utilizzando la libreria python doWhy 0.13. Questo aiuta a ridurre le connessioni fuorvianti dovute a input correlati come produzione e area, ottenendo reali legami causa-effetto. L'ultimo passo della pipeline era l'attribuzione gerarchica, dove le funzionalità venivano organizzate in domini di livello superiore. Per l'attuale dataset, ci sono 3 caratteristiche gerarchiche, ovvero Input Agricoli (Fertilizzante, Pesticidi), Fattori Geografici (Stato, Area, Crop_Year) e Fattori Ambientali (Annual_Rainfall, Stagione). Utilizzando la sommazione normalizzata per raggruppare i dati SHAP, si possono ottenere spiegazioni a entrambi i livelli (dettagliate e generali).

In sintesi, la pipeline TCHSHAP combina tre passaggi — aggiustamento temporale, attribuzione causale e raggruppamento gerarchico — in un unico processo. Qui, lo SHAP di base fornisce prima spiegazioni, seguita dall'aggiunta di tre miglioramenti. Questa pipeline strutturata garantisce che gli output di TCHSHAP siano coerenti, possano essere riprodotti e forniscano spiegazioni sia locali che globali. La descrizione passo dopo passo del framework proposto è fornita nel pseudocodice qui sotto.

Immissione:
X: Dataset con caratteristicheX 1,X 2,X 3,........,X n.
T: variabile temporale nel dataset
Corrente T: Tempo di riferimento
λ: Tasso di decadimento
G: Gruppi di Funzionalità
Calcolare i pesi temporali
Per ogni istanza, ifigure-protocol-2 X, valutare wt = e-λ|t-T|,
Calcolare i valori di Shap
Calcolare ShapTempral = Shapi *w t
Calcolare l'inferenza causale
Per ogni Feature, Xi figure-protocol-3 X
Calcolare ShapCausale = Shap i * Effetto Causale(Xj →Y)
Attribuzione gerarchica
Per ogni Feature, Xi figure-protocol-4 X
Calcolare i valori di Shap
Per ogni Gi figure-protocol-5 G
figure-protocol-6

Prodotto: Insieme di valori SHAP gerarchicamente aggregati

Il checkpoint quantitativo per facilitare la risoluzione dei problemi è indicato di seguito: Random Forest che produce il MSE più basso e il massimoR 2 in tutti i modelli ML. L'importanza principale ottenuta è stata l'area > pesticidi > fertilizzanti, con stagione e Crop_Year minime. La previsione globale di base dello SHAP è stata di 161,137. Inoltre, dopo l'applicazione di λ = 0,85, il contributo di Crop_year e Stagione aumenta. I contributi a livello di gruppo seguono l'ordine Input agricoli>Fattori Geografici> Fattori Ambientali.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa sezione discute i risultati ottenuti applicando vari metodi utilizzati durante lo studio dell'esperimento, comprendendo varie sottosezioni come segue:

Raccolta e preelaborazione dei dati

Per effettuare una valutazione sperimentale del quadro proposto, è stato raccolto un dataset relativo alla resa delle colture ...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'obiettivo principale dell'attuale studio è incorporare la ponderazione temporale, l'inferenza causale e il significato gerarchico nel modello SHAP tradizionale, dando origine al modello TCHSHAP. Il motivo dell'inclusione di questi componenti nelle tecniche XAI è migliorare l'interpretabilità dei risultati. Per la ponderazione temporale, abbiamo considerato una tecnica di decadimento esponenziale, che dà maggiore peso ai valori recenti rispetto ai valori vecchi. Per quanto riguarda la s...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano che non ci sono conflitti di interesse.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è finanziato da fondi nazionali tramite FCT – Fundação para a Ciência e a Tecnologia, I.P., nell'ambito del Contratto di Programma UID/05105/2025.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
ELI50.13.0PyPI
LIMONE0.2.0.1PyPI
Nvidia DGX A100 GPU ServerCPU Dual AMD Rome 7742, 128 core totaliNvidia
Memoria di sistema 1TB
Pitone3.1Pitone
SHAP0.41.0PyPI
scikit-learn1.3.0PyPI
TensorFlow2.13Flusso tensoriale
XGBoost1.7.6PyPI

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kaur, B., et al. N-Beats architecture for explainable forecasting of multi-dimensional poultry data. PloS One. 20 (4), e0320979(2025).
  2. Sharma, N., Mangla, M., Iqbal, M. M., Mohanty, S. N. Deep Learning Framework for Identification of Skin Lesions. EAI Endorsed Trans Perv Health Tech. 9, (2023).
  3. Sharma, N., Mohanty, S. N., Mahato, S., Pattanaik, C. R. A novel dataset and local interpretable model-agnostic explanations (LIME) for monkeypox prediction. Intell Decision Technol. 17 (4), 1297-1308 (2023).
  4. Makumbura, R. K., et al. Advancing Water Quality Assessment and Prediction Using Machine Learning Models, Coupled with Explainable Artificial Intelligence (XAI) Techniques Like Shapley Additive Explanations (SHAP) For Interpreting the Black-Box Nature. Results Eng. 23, 102831(2024).
  5. Schlegel, U., Keim, D. A. A Deep Dive into Perturbations as Evaluation Technique for Time Series XAI. Communic Comp Informat Sci. 1903, (2023).
  6. Silva, S. J., Keller, C. A. Limitations of XAI methods for process-level understanding in the atmospheric sciences. Artificial Intell Earth Syst. 3 (1), e230045(2024).
  7. Anushree, G., Madagaonkar, S. B., Ravili, C. H. Unveiling the Black Box: A Comprehensive Review of Explainable AI Techniques. Int J Sci Res Eng Manag. 8 (9), 1-11 (2024).
  8. Awal, M. A., Roy, C. K. EvaluateXAI: A framework to evaluate the reliability and consistency of rule-based XAI techniques for software analytics tasks. J Syst Software. 217, 112159(2024).
  9. Hajare, S. W., Rewatkar, R., Reddy, K. Design of an iterative method for enhanced early prediction of acute coronary syndrome using XAI analysis. AIMS Bioeng. 11 (3), 301-322 (2024).
  10. Hamida, S. U., Chowdhury, M. J. M., Chakraborty, N. R., Biswas, K., Sami, S. K. Exploring the landscape of explainable artificial intelligence (XAI): A systematic review of techniques and applications. Big Data Cognit Comput. 8 (11), 149(2024).
  11. Ihongbe, I. E., Fouad, S. F., Mahmoud, T., Rajasekaran, A., Bhatia, B. Evaluating Explainable Artificial Intelligence (XAI) techniques in chest radiology imaging through a human-centered Lens. PloS One. 19 (10), e0308758(2024).
  12. A Comparative Analysis of Explainable AI Techniques for Enhanced Model Interpretability. Swathi, Y., Challa, M. 3rd Int Conf Pervasive Comput Social Netw, , 229-234 (2023).
  13. Lenaers, I., De Moor, L. Exploring XAI techniques for enhancing model transparency and interpretability in real estate rent prediction: a comparative study. Finance Res Lett. 58 (Part A), 104306(2023).
  14. Bommer, P. L., Kretschmer, M., Hedström, A. K., Bareeva, D., Höhne, M. Finding the right XAI Method - A Guide for the Evaluation and Ranking of Explainable AI Methods in Climate Science. Artif Intell Earth Syst. 3, e230074(2024).
  15. Bhatnagar, S., Agrawal, R. Understanding explainable artificial intelligence techniques: a comparative analysis for practical application. Bullet Elect Eng Info. 13 (6), 4451-4455 (2024).
  16. Ennab, M., Mcheick, H. Enhancing interpretability and accuracy of AI models in healthcare: a comprehensive review on challenges and future directions. Front Robot AI. 11, 1444763(2024).
  17. Wan, X., Wang, W., Liu, J., Tong, T. Estimating the sample mean and standard deviation from the sample size, median, range and/or interquartile range. BMC Med Res Methodol. 14 (1), 135(2014).
  18. Mangla, M., Shinde, S. K., Mehta, V., Sharma, N., Mohanty, S. N. Handbook of Research on Machine Learning: Foundations and Applications. , CRC Press. (2022).
  19. Gupta, A. Agricultural Crop Yield in Indian States Dataset [Data set]. , Kaggle. https://www.kaggle.com/datasets/akshatgupta7/crop-yield-in-indian-states-dataset (2025).
  20. Shin, J., Miah, A. S. M., Konnai, S., Hoshitaka, S., Kim, P. Electromyography-Based Gesture Recognition with Explainable AI (XAI): Hierarchical Feature Extraction for Enhanced Spatial-Temporal Dynamics. IEEE Access. 13, 88930-88951 (2025).
  21. Das, A., Rad, P. Opportunities and challenges in explainable artificial intelligence (xai): A survey. arXiv. , (2020).
  22. Srinivasu, P. N., Sandhya, N., Jhaveri, R. H., Raut, R. From blackbox to explainable AI in healthcare: existing tools and case studies. Mobile Info Syst. 2022 (1), 8167821(2022).
  23. Fiok, K., Farahani, F. V., Karwowski, W., Ahram, T. Explainable artificial intelligence for education and training. J Defense Model Simulat. 19 (2), 133-144 (2022).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Explainable AIModel InterpretabilityFeature AttributionRandom ForestRegression ModellingData Normalization

Articoli correlati