Cet article vise à évaluer l’impact de la pondération temporelle, de l’inférence causale et de l’attribution hiérarchique sur l’optimisation de l’interprétabilité.
Article de recherche
Cet article vise à évaluer l’impact de la pondération temporelle, de l’inférence causale et de l’attribution hiérarchique sur l’optimisation de l’interprétabilité.
Au cours des dernières années, le besoin de transparence et d’interprétabilité s’est intensifié grâce aux avancées significatives des modèles pilotés par les données, conduisant à l’émergence de l’Intelligence Artificielle Explicable (XAI). Plusieurs approches traditionnelles XAI sont courantes ; cependant, ils ont une compétence limitée dans l’interprétation des relations dynamiques. La recherche actuelle vise à remédier à cette limitation en proposant un nouveau cadre d’explications additives d’ensemble SHapley (SHAP) axé sur la pondération temporelle, l’inférence causale, l’attribution hiérarchique et l’optimisation de l’interprétabilité, appelée TCHSHAP. TCHSHAP privilégie l’information actuelle par rapport à l’historique par pondération temporelle par décroissance exponentielle. De plus, l’inférence causale sépare la corrélation de la causalité pour obtenir des connaissances pratiques. De plus, l’attribution hiérarchique permet des insights aux niveaux granulaire (région) et agrégé (impacts sur les groupes de caractéristiques). Ces approches sont intégrées pour obtenir un modèle plus interprétable et explicable. Pour valider l’efficacité du modèle proposé, nous réalisons une expérience sur le jeu de données sur le rendement des cultures collecté à Kaggle. Avant l’évaluation expérimentale, le prétraitement des données est effectué à l’aide d’un encodage one-hot. La normalisation des données se fait par mise à l’échelle min-max, et les valeurs aberrantes sont supprimées via la plage interquartile. Pour des fins d’évaluation expérimentale, les auteurs ont utilisé le modèle SHAP XAI pour la forêt aléatoire. Lors de l’évaluation de l’efficacité du modèle TCHSHAP proposé, on observe que si la prédiction moyenne pour le SHAP traditionnel est de 161,137, elle grimpe à 161,506 après avoir intégré la pondération temporelle et l’inférence causale, préconisant l’efficacité de l’utilisation de la signification temporelle et causale. De plus, lors de l’attribution hiérarchique, on observe que les caractéristiques agricoles dominent la plus forte sur la variable cible. Cette domination est suivie d’ordre par des facteurs géographiques et environnementaux. Ainsi, les résultats obtenus autorisent l’efficacité de l’approche proposée pour améliorer l’interprétabilité globale et locale, renforçant ainsi la confiance de l’utilisateur dans les prédictions des modèles. Les travaux actuels offrent des moyens d’améliorer la transparence et l’interprétabilité sans affecter la performance du modèle. Le modèle suggéré permet également une modélisation de régression interprétable et efficace dans des applications complexes et basées sur les données, ce qui permet une application généralisée dans des contextes réels.
La régression joue un rôle majeur en analytique prédicative, englobant plusieurs domaines, notamment la modélisation climatique, la prévision financière, le diagnostic de la santé et l’estimation du rendementagricole 1,2. Cependant, les résultats inexpliqués des modèles de régression, en particulier les modèles non linéaires et à haute capacité comme les Gradient Boosting Machines (GBM), les Forêts Aléatoires et les Réseaux de Neurones Profonds (DNN), posent des défis importants, notamment pour les applications nécessitant transparence et analyses exploitables. Ce fossé d’interprétabilité peut être comblé en utilisant l’Intelligence Artificielle Explicable (XAI), une technique encore à ses débuts. Actuellement, les frameworks XAI conventionnels comme SHAP et Local Interpretable Model Agnostic Explanation (LIME) ne fournissent que des explications statiques3. Ces techniques XAI ne parviennent actuellement pas à expliquer les subtilités des tâches de régression impliquant des dépendances temporelles, des structures de caractéristiques hiérarchiques et des causalités, créant ainsi une voie de recherche 4,5. En raison de l’absence de prise en compte de ces facteurs, XAI peut parfois tirer des conclusions erronées. Par exemple, le SHAP traditionnel ne considère que la corrélation des attributs avec la variable cible sans en tenir compte la causalité. Considérons un ensemble de données avec deux caractéristiques binaires d’entrée, à savoir la consommation de tabac et les dents teintées. La variable cible dans cet ensemble de données est la probabilité de cancer. Dans un tel scénario, si une corrélation est obtenue entre les caractéristiques d’entrée et la variable cible, le cancer sera fortement corrélé avec les deux caractéristiques (consommation de tabac et dents tachées). Il est donc assez trompeur de conclure que les dents tachées provoquent le cancer, car elles sont causées par la consommation régulière de tabac. Ainsi, on peut résumer que malgré des progrès significatifs dans le domaine de la XAI, les principaux problèmes à traiter dans les contextes de régression incluent :
L’incapacité à considérer les dépendances temporelles ne conduit qu’à des explications statiques qui peuvent ne pas fonctionner dans des contextes avec des données dynamiques.
L’absence d’inférence causale dans les adaptations traditionnelles de SHAP entraîne de fausses corrélations plutôt que des informations causales précieuses.
Le manque d’attention portée à l’interprétation hiérarchique conduit à un manque d’explications agrégées de haut niveau.
Pour répondre à ces questions, les recherches actuelles visent à proposer un nouveau cadre XAI, TCHSHAP, qui englobe la pondération temporelle, l’inférence causale et l’attribution hiérarchique, dans le but d’améliorer l’interprétabilité et l’efficacité computationnelle des modèles XAI actuels. Pour cela, le cadre proposé considère un facteur de pondération temporelle wt qui attribue des poids plus élevés à la contribution récente des caractéristiques par rapport aux valeurs passées. Ce facteur de pondération vise à garantir que l’interprétabilité correspond à l’importance temporelle des caractéristiques cruciales dans les problèmes de régression dynamique tels que la prévision des rendements et la prévision des ventes. De plus, les modèles de régression traditionnels ne présentent pas de relations causales, ce qui conduit à des attributionsambiguës 6. Pour relever ce défi, le cadre proposé adopte des modèles causals structuraux (SCM) afin d’évaluer l’impact causal d’une caractéristique Fi sur la sortie. De plus, les ensembles de données en temps réel démontrent souvent des relations hiérarchiques (spatiales ou catégoriques) entre les caractéristiques, rarement mises en avant dans les cadres XAI existants 4,5,6. Au contraire, le cadre XAI suggéré agrège des caractéristiques individuelles (Fi) pour obtenir des caractéristiques de niveau supérieur (Hj), afin d’atteindre la granularité des explications.
Outre l’intégration de significations temporelles, causales et hiérarchiques, l’ensemble proposé vise également à améliorer l’interprétabilité et l’explicabilité. Un tel objectif vise à établir le compromis entre interprétabilité et précision, en garantissant que les explications obtenues à partir de TCHSHAP soient exactes et interprétables4. Le cadre XAI suggéré peut être décrit mathématiquement comme suit, tandis que la description des variables utilisées est donnée dans le tableau 1. La valeur SHAP traditionnelle pour la caractéristique est calculée comme l’équation (1)5,6.
(1)
Cette formulation traditionnelle du SHAP additionne les contributions sans prendre en compte les ajustements temporels, causaux ou hiérarchiques.
| Variable | Définition |
| Fi | Caractéristique dont la valeur Shap est calculée |
| Shapi | Valeur de Shap de la Caractéristique |
| S | Ensemble des caractéristiques totales |
| M | Sous-ensemble de toutes les caractéristiques |
| FT | Nombre total de fonctionnalités |
| P(M) | Prédiction du modèle lorsque seules les caractéristiques de M sont utilisées |
| λ > 0 | Taux de décroissance |
| T | Temps de prédiction de référence |
| Y | Sortie |
Tableau 1 : Description des variables utilisées. Ce tableau décrit la signification des différentes variables utilisées.
Cette formulation traditionnelle du SHAP est modifiée pour gérer les dépendances dynamiques en incluant une pondération temporelle. Cette pondération temporelle est incorporée en introduisant le coefficient de pondération wt = e-λ |t - t| où λ représente le facteur de désintégration (λ > 0). Comme évoqué précédemment, cette pondération exponentielle donne plus de poids aux valeurs récentes comparé aux valeurs passées. Cette décroissance exponentielle s’accompagne de la compréhension que les valeurs récentes des caractéristiques ont une signification plus élevée que les valeurs passées. La valeur SHAP modifiée (après incorporation de la signification temporelle) est donnée dans l’équation (2).
(2)
Ces informations temporelles sont importantes pour les tâches de régression dynamique comme la prédiction des rendements ou des actions.
De plus, afin de rendre les explications plus robustes, la SCM est appliquée pour évaluer l’impact causal de la caractéristique Fi sur la sortie Y. La formulation mathématique du SHAP causal est donnée dans l’équation (3)
(3)
Ici , do(F i) représente la caractéristique qui a contribué au changement. En utilisant cela, le modèle acquiert la compétence nécessaire pour expliquer la causalité plutôt que la corrélation. Il convient de noter que le calcul des effets causaux basé sur la SCM garantit que seules les caractéristiques ayant une influence causale directe sont créditées, éliminant ainsi les fausses corrélations.
De plus, la hiérarchie est proposée dans le modèle suggéré pour agréger les attributs à différents niveaux. La formulation mathématique du SHAP hiérarchique est donnée dans l’équation (4).
(4)
L’intégration de la hiérarchie dans le modèle suggéré assure l’atteinte de la granularité des explications. Le cadre suggéré est illustré à la Figure 1.

Figure 1 : Illustration picturale de divers éléments du cadre proposé. Cette figure illustre visuellement divers éléments du cadre proposé par TCHSHAP, incluant la pondération temporelle, l’inférence causale et l’attribution hiérarchique. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
La nouveauté du modèle proposé TCHSHAP réside dans la gestion de ces trois incohérences en employant une pondération temporelle (pour donner plus de poids aux informations actuelles), des modèles causals structuraux (SCM ; pour évaluer les effets causals) et l’agrégation hiérarchique des valeurs SHAP (pour obtenir des insights multi-niveaux). Ainsi, l’ensemble proposé étend SHAP au-delà de ses contraintes statiques, fournissant un cadre explicatif optimisé pour la régression.
Le TCHSHAP proposé a le potentiel d’acquérir une grande importance pour les applications en temps réel dans des scénarios nécessitant une meilleure prise de décision, car il identifie les explications détaillées des résultats dans les modèles de régression, reliant de manière fluide la modélisation à la prise de décision. En résumé, la contribution principale de ce manuscrit est de concevoir un cadre novateur qui combine pondération temporelle, inférence causale et relations hiérarchiques afin d’enrichir les explications exploitables du modèle SHAP traditionnel.
Travaux connexes
XAI intègre différentes méthodologies spécialement conçues pour améliorer la transparence et l’interprétabilité de différents modèles d’apprentissage automatique. Ces stratégies XAI instaurent la confiance dans les résultats en fournissant les insights nécessaires à partir de ces résultats. Par exemple, des méthodologies XAI notables telles que LIME et SHAP améliorent l’interprétabilité et la transparence de modèles autrement en boîte noire dans divers domaines, notamment la finance, l’éducation et le secteurde la santé 7. De plus, les techniques XAI sont appliquées dans des tâches liées à l’analyse logicielle, à la détection de clones et à la prédiction de défauts Just-in-Time8. De plus, Awal et Roy ont également souligné les écarts et démontré une fiabilité moindre dans la génération desexplications 8. Ici, les auteurs ont appliqué des métriques d’évaluation au niveau granulaire pour réduire la cohérence dans l’évaluation. XAI a également été largement utilisé dans le domaine médical pour comprendre les facteurs les plus importants influençant les résultats de la tâche de classification et ainsi renforcer la confiance des professionnels de santé dans l’utilisation de diagnostics basés surl’IA 9,10,11,12. De plus, dans des secteurs comme la prévision des loyers résidentiels belges, les approches XAI facilitent l’interprétation de modèles complexes, améliorant ainsi le contrôle qualité et minimisant les erreursde production 13. Bommer et al. ont démontré que l’intégration des méthodes XAI avec les gradients améliore les performances des méthodes XAI en termes de robustesse, fidélité, complexité et randomisation en science du climat14. De nombreux chercheurs ont tenté de créer des techniques d’ensemble et hybrides. En plus de proposer des techniques d’ensemble, les chercheurs ont également démontré l’efficacité de ces techniques hybrides pour fournir une compréhension complète des modèlescomplexes 15,16. Une revue détaillée des techniques, des optimisations et des différentes applications est présentée dans le tableau 2, qui indique clairement que les techniques les plus largement appliquées sont la LIME et le SHAP. L’orientation future de la recherche vise à explorer l’optimisation de ces méthodes afin d’améliorer leur interprétabilité. Poursuivant cette recherche, les auteurs des travaux actuels se concentrent sur l’optimisation du SHAP en ajoutant l’inférence causale, l’attribution hiérarchique et la pondération temporelle.
| Citation | XAI Techniques | Optimisation | Idées | Applications | Orientations de recherche futures |
| (Anushree et al., 2024) | CHAUX | Non fourni | Amélioration de l’interprétabilité et de la transparence des modèles boîte noire dans diverses applications dans les secteurs de la finance, de l’éducation et de la santé. | · Compromis entre exactitude et interprétabilité dans les secteurs de la finance, de l’éducation et de la santé | · Il est nécessaire de développer une liste détaillée de métriques pour évaluer différents modèles XAI |
| SHAP | |||||
| Mécanismes de perturbation | |||||
| Mécanismes basés sur l’attention | |||||
| (Awal & Roy, 2024) | PyExplainer | Indicateurs d’évaluation au niveau granulaire pour réduire la cohérence dans l’évaluation. | Cela met en évidence les écarts et démontre une fiabilité moindre dans la génération des explications. | · Tâches liées à l’analyse logicielle | · Des méthodes de recherche avancées sont nécessaires pour améliorer la fiabilité des modèles XAI pour les tâches liées à l’analyse logicielle |
| CHAUX | · Détection de clones | ||||
| · Prédiction de défaut juste à temps | |||||
| (Bommer et al., 2024) | Gradients intégrés | Intégration des méthodes XAI avec les gradients | L’intégration des méthodes XAI avec les gradients améliore les performances en termes de robustesse, de fidélité, de complexité et de randomisation en science du climat. | · Prédiction en sciences du climat | · Concentrez-vous sur l’évaluation spécifique des tâches en science du climat. |
| Propagation de la pertinence par couches | · Prédiction annuelle des cartes moyennes de température | ||||
| Gradients de temps d’entrée | |||||
| des méthodes de sensibilité comme gradient, SmoothGrad, NoiseGrad et FusionGrad | |||||
| (Bhatnagar & Agrawal, 2024) | CHAUX | Ensemble des techniques XAI | Ensemble offre une vision complète et améliore l’interprétabilité et l’explicabilité des modèles complexes. | · Appliqué sur un ensemble de données morales pour améliorer l’interprétabilité des résultats | · Explorez les méthodes hybrides XAI en combinant plusieurs techniques |
| SHAP | · Personnalisation de divers algorithmes XAI pour des modèles spécifiques répondant à différents besoins des utilisateurs | ||||
| (Dias, 2024) | CHAUX | Intégration des techniques XAI | Meilleure interprétabilité et précision | · Classification des commentaires toxiques | · Renforcer la force à des fins de classification. |
| Explique-moi comme si j’avais 5 ans | |||||
| (Hajare et al., 2024) | SHAP | Non fourni | SHAP offre des informations détaillées sur les facteurs de risque dans la prédiction du syndrome coronarien aigu. | · Syndrome coronarien aigu (SCA) | · Pour découvrir les nouveaux facteurs de risque dans la prédiction de l’ACS. |
| (Hamida et al., 2024) | Revue complète des différentes techniques XAI | Non fourni | Fournit des analyses sur les applications XAI dans le secteur de la santé, en soulignant l’importance de l’explicabilité des décisions d’IA pour comprendre les résultats obtenus par l’IA. | · Analyses exploitables dans le secteur de la santé | · Amélioration des composantes XAI, à savoir la compréhension, la transparence, l’interprétabilité et l’explicabilité. |
| · Techniques XAI personnalisées pour le secteur de la santé, pour des analyses détaillées dans le domaine de la santé | |||||
| (Ihongbe et al., 2024) | Grad-CAM (Cartographie pondérée par gradient pour activation des classes) | Cartographie pondérée en gradient par activation des classes | Meilleure précision pour le diagnostic de pneumonie et de COVID-19. | · Amélioration de la précision pour le diagnostic médical | Accroître la sensibilisation à l’utilisabilité des techniques XAI pour des applications réelles |
| (Lenaers, & De Moor, 2023). | 6 Techniques XAI | Ensemble des 6 techniques XAI sur le modèle CatBoost | De multiples techniques améliorent l’interprétabilité du XAI pour la prédiction des loyers. | · Prédiction du loyer résidentiel belge | XAI peut être utilisé pour la prise de décision |
| (Makumbura et al., 2024) | SHAP | Ensemble de RF, LightGBM, XGBoost avec SHAP | SHAP révèle les différents facteurs responsables de l’évaluation et de la prédiction de la qualité de l’eau. | · Évaluation et prédiction de la qualité de l’eau | Peut être utilisé pour la prise de décision |
| (Schlegel & Keim, 2023). | Techniques XAI avec analyse de perturbations | Analyse des perturbations | Peut être utilisé efficacement pour des tâches de classification des données de séries temporelles | · Séries temporelles : Finance, Santé, Sciences du Climat | Combiner plusieurs techniques XAI pour une meilleure interprétabilité. |
| (Silva & Keller, 2023) | XAI | Non fourni | Les modèles XAI ont une limitation pour expliquer les résultats en cas de caractéristiques corrélées. Peut être utilisé pour les sciences de la Terre et de l’atmosphère. | · Sciences de l’atmosphère | XAI doit être optimisé pour des fonctionnalités corrélées afin d’éviter les explications fausses. |
| Vitesse de réaction biomoléculaire | · Chimie atmosphérique | ||||
| (Y, S., & Challa, M. 2023) | SHAP | Non fourni | Ici, les modèles XAI sont comparés en ce qui concerne l’interprétabilité et la compréhension des caractéristiques importantes, et concluent que SHAP et LIME sont les plus efficaces. | · Applications médicales | Améliorer l’interprétabilité pour des applications médicales avancées |
| CHAUX | |||||
| PDP | |||||
| GAM |
Tableau 2 : Revue complète des différentes optimisations réalisées sur les techniques XAI. Ce tableau présente un aperçu complet des différentes techniques d’optimisation suggérées par divers chercheurs.
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
REMARQUE : Cette section traite de la méthode d’ensemble proposée, incluant toutes les modifications proposées illustrées à la Figure 1.
Préparation des données
Afin de valider l’efficacité du cadre proposé, les auteurs ont mené une expérience sur le jeu de données sur le rendement des cultures collecté à partir de Kaggle17. Ce jeu de données comprend des données agricoles indiennes pour diverses cultures de 1997 à 2020 et a été consulté en mars 2025. Ce jeu de données comprend de nombreuses caractéristiques, à savoir la saison, la crop_year, l’engrais, le pesticide, la culture et le rendement (variable cible), etc. Le jeu de données considéré est pré-traité pour une efficacité accrue grâce à un encodage one-hot pour gérer les valeurs catégorielles. Les caractéristiques catégorielles telles que saison, culture et état sont encodées en un seul hot. L’échelle MinMax est également utilisée pour mettre en valeur les caractéristiques numériques telles que la surface, la production, le annual_rainfall, l’engrais et le pesticide dans la fourchette [0,1]. Pour gérer les valeurs aberrantes, nous avons utilisé la règle de la plage interquartile avec un seuil Q1 - 1,5 • IQR17. Une graine aléatoire de 42 a été appliquée à toutes les étapes de prétraitement afin d’obtenir la reproductibilité des résultats. De plus, le jeu de données a été divisé en un jeu de données d’entraînement (80 %) et un jeu de données de test (20 %) après prétraitement.
Installation expérimentale
L’expérience a été réalisée en Python 3.10 sur un serveur GPU A100 avec processeur : double AMD Rome 7742, 128 cœurs, 1 To de RAM. Les bibliothèques importées pour la simulation sont scikit-learn 1.3.0, XGBoost 1.7.6, TensorFlow 2.13, SHAP 0.41.0, LIME 0.2.0.1 et ELI5 0.13.0.
Évaluation des modèles d’apprentissage automatique
Ici, les auteurs ont utilisé divers modèles de régression, à savoir LinearRegression(), Ridge(alpha=1,random_state=42), Lasso(alpha=0,1,état aléatoire = 42), Decision TreeRegressor(max_depth = 10, random_state = 42), RandomForestRegressor(max_depth = 15random_state = 42), GradientBoostingRegressor(n_estimators = 200, learning_rate = 0,1, random_state = 42), XGBoost et CNN pour déterminer l’impact de diverses variables sur la variable cible donne18 . XGBoost utilise 300 estimateurs et un taux d’apprentissage de 0,05. Dans le modèle CNN, deux couches cachées, les activations ReLU et l’optimiseur Adam sont utilisées avec un taux d’apprentissage de 0,001. L’efficacité de ces modèles est comparée à l’aide de différents indicateurs de performance. Ces modèles effectuent également un réglage par hyperparamètres. Par exemple, la régression de crête et la régression de lasso sont entraînées avec alpha égal à 1,0 et alpha égale à 0,1, respectivement. Dans l’arbre de décision et la forêt aléatoire, la profondeur maximale était fixée respectivement à 10 et 15. Le gradient boosting utilise 200 estimateurs et un taux d’apprentissage de 0,1. Les performances de ces modèles ont été évaluées par validation croisée à 5 points en termes d’erreur quadratique moyenne (MSE) et de R2 au carré.
Évaluation des modèles XAI
Comme discuté, les travaux actuels utilisent divers modèles XAI pour comparer les résultats. Ici, les auteurs utilisent le shap. TreeExplainer(model,data = crop_yield) pour les modèles basés sur des arbres (Random Forest, Gradient Boosting et XGBoost). Un ensemble de données de fond de 100 cas sélectionnés au hasard a été choisi dans l’ensemble d’entraînement pour stabiliser les attributions. De plus, shap. KernelExplainer() a été utilisé pour des modèles non arboricoles (linéaire, ridge, lasso et CNN) avec 1000 perturbations pour s’approcher des valeurs SHAP. Explication tabulaire (lime.lime_tabular. LimeTabularExplainer) a été utilisé avec 5000 perturbations par instance pour exécuter LIME sur le même ensemble de données de fond afin de garantir la stabilité des explications locales. La largeur du noyau était fixée en fonction des caractéristiques, et la fonction de prédiction du modèle était utilisée pour déduire des explications. Les explications locales étaient générées en appelant explainer.explain_instance(x,model.predict). ELI5 a été utilisé comme importance de permutation avec 10 répétitions sur la répartition de validation afin d’éviter un surajustement des données testées, et a été simulé à l’aide de eli5.sklearn.PermutationImportance(estimator,random_state = 42). L’importance de la moyenne et de la variance entre les répétitions a été démontrée lors de l’expérience. Enfin, le modèle ajusté a été utilisé pour la répartition de validation afin d’obtenir des Graphiques de Dépendance Partielle (PDP), qui ont été implémentés en utilisant PartialDependencyDisplay.from_estimator (modèle,X_val,caractéristiques = [caractéristique]),
Mise en place du cadre TCHSHAP
Par la suite, TCHSHAP a été implémenté en appliquant plusieurs étapes successives. La première étape de la séquence a été la pondération temporelle utilisant une fonction de désintégration exponentielle avec un taux de désintégration de λ = 0,85, sélectionnée sur la base d’une étude d’ablation sur λ
[0,7.0.95]. Le temps de référence (T_current) a été sélectionné comme l’année de culture récente dans le jeu de données. Cela garantit que les explications du modèle prennent en compte la dynamique de la prévision de la production agricole, où les caractéristiques récentes (précipitations, utilisation d’engrais ou pesticide) ont une importance plus importante pour la prise de décision. La pondération temporelle a été suivie par la MSC pour adopter des inférences causales. La méthodologie suggérée utilise l’opérateur point pour simuler les interventions et calculer l’effet causal moyen. L’inférence causale a été appliquée à l’aide de la bibliothèque python doWhy 0.13. Cela aide à atténuer les liens trompeurs dus à des intrants corrélés comme la production et la surface, établissant de réels liens de cause à effet. La dernière étape du pipeline était l’attribution hiérarchique, où les caractéristiques étaient organisées en domaines de niveau supérieur. Pour le jeu de données actuel, il existe 3 caractéristiques hiérarchiques : les intrants agricoles (engrais, pesticides), les facteurs géographiques (État, superficie, Crop_Year) et les facteurs environnementaux (Annual_Rainfall, saison). En utilisant la sommation normalisée pour regrouper les données SHAP, des explications aux deux niveaux (détaillées et générales) peuvent être obtenues.
En résumé, le pipeline TCHSHAP combine trois étapes — ajustement temporel, attribution causale et regroupement hiérarchique — en un seul processus. Ici, le SHAP de base apporte d’abord des explications, suivi de l’ajout de trois améliorations. Ce pipeline structuré garantit que les sorties de TCHSHAP sont cohérentes, peuvent être reproduites et fournissent des explications locales et globales. La description étape par étape du cadre proposé est donnée dans le pseudocode ci-dessous.
Entrée:
X : Jeu de données avec des caractéristiquesX 1,X 2,X 3,........,X n.
T : variable temporelle dans le jeu de données
T courant : Temps de référence
λ : Taux de désintégration
G : Groupes de fonctionnalités
Calculer les poids temporels
Pour chaque instance, i
X, évaluons wt = e-λ|t-T|,
Calculer les valeurs de Shapi
Calculer Shap Tempral = Shapi *w t
Calculer l’inférence causale
Pour chaque Trait, Xi
X
Calculer Shap Causalité = Shapi * Effet causal(Xj →Y)
Attribution hiérarchique
Pour chaque Trait, Xi
X
Calculer les valeurs de Shapi
Pour chaque Gi
G

Sortie: Ensemble de valeurs SHAP hiérarchiquement agrégées
Le point de contrôle quantitatif pour faciliter le dépannage est donné ci-dessous : Random Forest produisant le MSE le plus bas et le plus hautR2 sur tous les modèles ML. L’importance principale obtenue était la zone > pesticides > engrais, avec la saison et la Crop_Year minimales. La prévision de référence globale du SHAP était de 161,137. De plus, après application de λ = 0,85, la contribution de Crop_year et de Saison augmente. Les contributions au niveau du groupe suivent l’ordre Intrants agricoles>Facteurs géographiques> Facteurs environnementaux.
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Cette section traite des résultats obtenus en appliquant diverses méthodes utilisées lors de l’étude expérimentale, comprenant différentes sous-sections comme suit :
Collecte et prétraitement des données
Afin de réaliser une évaluation expérimentale du cadre proposé, un ensemble de données sur le rendement des cultures...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
L’objectif principal de la présente étude est d’intégrer la pondération temporelle, l’inférence causale et la signification hiérarchique dans le modèle SHAP traditionnel, aboutissant ainsi au modèle TCHSHAP. L’objectif d’inclure ces composants dans les techniques XAI est d’améliorer l’interprétabilité des résultats. Pour la pondération temporelle, nous avons envisagé une technique de décroissance exponentielle, qui accorde plus de poids aux valeurs récentes comparées aux anciennes. En te...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Les auteurs déclarent qu’il n’y a pas de conflits d’intérêts.
Ce travail est financé par des fonds nationaux via FCT – Fundação para a Ciência e a Tecnologia, I.P., dans le cadre du contrat de programme UID/05105/2025.
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
| Nom | Entreprise | Numéro de catalogue | Commentaires |
|---|---|---|---|
| ELI5 | 0.13.0 | PyPI | |
| CHAUX | 0.2.0.1 | PyPI | |
| Serveur GPU Nvidia DGX A100 | CPU Dual AMD Rome 7742, 128 cœurs au total | Nvidia | |
| Mémoire système 1 To | |||
| Python | 3.1 | Python | |
| SHAP | 0.41.0 | PyPI | |
| scikit-learn | 1.3.0 | PyPI | |
| TensorFlow | 2.13 | Écoulement tensoriel | |
| XGBoost | 1.7.6 | PyPI |
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE
Demander une autorisation