需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

面向SHAP优化的时序加权、因果推断与分层归因集成方法

555 次观看

⸱

DOI:

10.3791/69125

⸱

2025年11月18日

 ,  ,  ,  ,  , 

本文内容

摘要

本文旨在评估时间加权、因果推断和层次归因对可解释性优化的影响。

摘要

近年来,由于数据驱动模型的显著进步,人们对透明性和可解释性的需求日益增强,从而催生了可解释人工智能(Explainable Artificial Intelligence, XAI)。目前已有多种传统的XAI方法被广泛应用,但这些方法在解释动态关系方面能力有限。本研究旨在通过提出一种新颖的集成SHapley Additive exPlanations(SHAP)框架来解决这一局限性,该框架聚焦于时间加权、因果推断、分层归因和可解释性优化,称为TCHSHAP。TCHSHAP通过指数衰减的时间加权机制,赋予当前信息比历史信息更高的优先级。此外,因果推断能够区分相关性与因果关系,从而获得更具实践意义的洞察。同时,分层归因支持在细粒度(区域层面)和聚合层面(特征组影响)进行深入分析。这些方法被整合在一起,以实现更具可解释性和可理解性的模型。为验证所提出模型的有效性,我们在来自Kaggle的作物产量数据集上开展实验。在实验评估之前,采用独热编码进行数据预处理,通过最小-最大缩放完成数据归一化,并利用四分位距法剔除异常值。在实验评估中,作者将SHAP XAI模型应用于随机森林算法。在评估所提出的TCHSHAP模型有效性时发现,传统SHAP的平均预测值为161.137,而在引入时间加权和因果推断后,该值提升至161.506,表明利用时间与因果重要性具有显著效果。此外,在分层归因过程中观察到,农业特征对目标变量具有最强的主导作用,其次依次为地理因素和环境因素。因此,所得结果证实了该方法在增强全局与局部可解释性方面的有效性,增强了用户对模型预测的信任。本研究提供了一种在不影响模型性能的前提下提升透明性与可解释性的途径。所建议的模型还能够在复杂的数据驱动应用中实现可解释且高效的回归建模,从而推动其在现实场景中的广泛应用。

引言

回归分析在预测性分析中发挥着重要作用,涵盖气候建模、金融预测、医疗诊断以及农作物产量估计等多个领域1,2。然而,回归模型的结果往往难以解释,尤其是对于梯度提升机(Gradient Boosting Machines, GBMs)、随机森林(Random Forests)和深度神经网络(Deep Neural Networks, DNNs)等非线性且高容量的模型,这在需要透明度和可操作洞察的应用中构成了重大挑战。这一可解释性鸿沟可通过采用可解释人工智能(Explainable Artificial Intelligence, XAI)技术来弥补,但该技术目前仍处于初级阶段。当前,诸如SHAP和局部可解释模型无关解释(Local Interpretable Model Agnostic Explanation, LIME)等传统XAI框架仅能提供静态的特征解释3。现有的这些XAI方法尚无法解释涉及时间依赖性、层次化特征结构以及因果关系的回归任务的复杂性,从而开辟了新的研究方向4,5。由于未考虑上述因素,XAI有时可能得出错误结论。例如,传统的SHAP方法仅考虑属性与目标变量之间的相关性,而忽略了因果关系。假设有一个数据集包含两个二元输入特征:烟草消费和牙齿....

访问受限。请登录或开始试用以查看此内容。

方案

注意:本节讨论所提出的集成方法,包括如图1所示的所有改进措施。

数据准备

为了验证所提出框架的有效性,作者在从 Kaggle 收集的作物产量数据集上开展了一项实验17。该数据集包含1997年至2020年间多种作物的印度农业数据,并于2025年3月获取。该数据集包含多个特征,例如季节(season)、作物年份(crop_year)、化肥(fertilizer)、农药(pesticide)、作物(crop)以及产量(yield,目标变量)等。为提高效率,对所采用的数据集进行了预处理,使用独热编码(one-hot encoding)处理分类变量。季节(season)、作物(crop)和州(state)等分类特征均进行了独热编码。同时采用最小-最大缩放(MinMax scaling)将面积(area)、产量(production)、年降雨量(annual_rainfall)、化肥(fertilizer)和农药(pesticide)等数值型特征缩放到[0,1]区间。为处理异常值,采用了四分位距(Interquartile Range)法则,阈值设为 Q1 - 1.5 • IQR17。所有预处理步骤均设置随机种子为42,以确....

访问受限。请登录或开始试用以查看此内容。

结果

本部分讨论了在实验研究中应用各种方法所获得的结果,包括以下若干小节:

数据收集与预处理

为了对所提出的框架进行实验评估,从 Kaggle19 收集了一个关于农作物产量的数据集。收集到的数据经过预处理,包括前文所述的标签编码、缩放以及异常值剔除等步骤。根据设定的目标,评估了各变量的特征重要性。所考虑数据集的特征重要性图如图2所示,该图明确表明肥料和农药与产量之间具有高度相关性。此外,为了评估数据规模对模型评估的影响,针对不同规模的数据集计算了MAE和R²得分,并将所得结果绘制在图3中。

访问受限。请登录或开始试用以查看此内容。

讨论

本研究的主要目标是在传统SHAP模型中引入时间权重、因果推断和层次重要性,从而构建TCHSHAP模型。将这些组件纳入可解释人工智能(XAI)技术的动机在于提升结果的可解释性。在时间权重方面,我们采用了指数衰减方法,使近期数值相比历史数值获得更高的权重。在因果重要性方面,作者试图评估各个特征对预测变量的直接影响。此外,输入参数还被划分为不同的层次化特征,以更深入地理解结果。为验证所提出方法的有效性,作者选用了Kaggle平台上的crop_yield数据集进行分析。所得结果明确表明,TCHSHAP中所提出的时间权重、因果推断和层次化归因机制通过克服传统SHAP模型的局限性,显著提升了其可解释性20,21。

然而,所提出的该方法也存在潜在的局限性。例如,目前该方法的有效性仅通过单一的作物产量数据集进行验证,而这一情况被认为具有一定的激励作用。为了进一步增强其有效性,所建议的方法需要在包括医疗保健、金融和教育在内的多种应用领域中进行测试2.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在利益冲突。

致谢

本工作由葡萄牙科学技术基金会(FCT – Fundação para a Ciência e a Tecnologia, I.P.)通过项目合同编号 UID/05105/2025 的国家资金资助。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
ELI50.13.0PyPI
LIME0.2.0.1PyPI
Nvidia DGX A100 GPU 服务器CPU 双路 AMD Rome 7742,共 128 核Nvidia
系统内存 1TB
Python3.1Python
SHAP0.41.0PyPI
scikit-learn1.3.0PyPI
TensorFlow2.13Tensor Flow
XGBoost1.7.6PyPI

参考文献

  1. Kaur, B., et al. N-Beats architecture for explainable forecasting of multi-dimensional poultry data. PloS One. 20 (4), e0320979(2025).
  2. Sharma, N., Mangla, M., Iqbal, M. M., Mohanty, S. N. Deep Learning Framework for Identification of Skin Lesions.

访问受限。请登录或开始试用以查看此内容。

重印与许可

探索更多文章

可解释人工智能模型可解释性特征归因随机森林回归建模数据归一化