需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

一种可重复的协议:用于开发和评估医疗数据分析中的可解释人工智能框架

93 次观看

DOI:

10.3791/71999

2026年7月31日

本文内容

摘要

本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。

摘要

可解释的人工智能(XAI)正日益被视为在医疗保健领域构建可信人工智能系统不可或缺的工具,因为在临床决策过程中,透明性以及解释决策的能力是至关重要的组成部分。本文介绍了一种可重复的实验方法,用于开发和评估面向医疗数据分析的可解释人工智能系统。所构建的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流,可同时适用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上表现出较强的预测性能,而深度学习模型则擅长从医学影像数据中学习复杂的模式。SHAP、LIME 和 Grad-CAM 等技术提供了全局和局部解释,有助于模型的理解。该框架的定量评估涵盖多种不同指标,包括准确率、精确率、召回率、F1 分数、ROC-AUC、解释性指标、保真度和稳定性。结果表明,在控制实验条件的情况下,该框架在所评估的实验条件下表现出更优的预测性能和解释质量。作为一份以实验方案为导向的文档,本研究支持其他研究者对方法进行可重复和可扩展的持续实施。这种透明且易于理解的人工智能模型,是临床决策支持系统和医疗数据分析系统获得广泛信任与应用的基础。

引言

人工智能(AI)通过支持疾病诊断、预后评估、风险分层、医学影像分析和临床决策,已成为现代医疗保健的重要组成部分1。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,其预测性能通常可达到甚至超过传统统计方法2。尽管取得了这些进展,许多AI模型仍以复杂的黑箱系统方式运行,导致临床医生和医疗利益相关者难以理解预测结果的生成过程3。这种缺乏透明性的问题可能限制高风险医疗环境中对AI的信任、采纳和责任追溯能力4,5

可解释性人工智能(XAI)已成为提高机器学习模型透明度和可解释性的有前景方法6。广泛应用的解释技术包括SHAP(Shapley加性解释)、LIME(局部可解释的模型无关解释)和梯度加权类激活映射(Grad-CAM),这些技术通过特征归因和可视化解释机制揭示模型行为7,8,9。这些方法 increasingly 被应用于医疗健康领域,以支持临床解释、模型审计和决策支持10,11。然而,仅具备可解释性并不能保证模型的可靠性、可重复性或临床实用性。近期研究指出了与解释结果不稳定性、对扰动敏感、临床医生验证有限以及解释输出与模型真实推理之间存在不一致等相关挑战12,13,14,15

除了可解释性方面的挑战外,可重复性在医疗机器学习研究中仍然是一个重要的问题16,17,18。许多已发表的研究在预处理流程、软件环境、超参数配置、验证策略和实现工作流方面提供的信息有限,导致独立重复实验十分困难19,20,21。此外,医疗人工智能研究往往侧重于预测性能,而在解释质量评估、以临床医生为中心的评价以及实际实施考虑方面提供的指导较为有限22。这些局限性可能会阻碍可解释人工智能系统从研究环境向真实世界医疗场景的转化23,24,25,26,27

当前医疗健康领域的可解释人工智能(XAI)工作流程通常孤立地评估单个解释方法或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为中心的评估以及可重复性资源的标准化协议28,29,30,31。因此,研究人员和实践者在不同医疗健康数据集和应用领域中重复工作流程、比较解释方法或评估可解释人工智能系统的实际效用时,可能会遇到困难。因此,亟需一种全面且可重复的协议,以促进医疗健康可解释人工智能工作流程的一致实施、评估和报告32,33,34,35

本文提出了一种可重复的协议,用于在医疗健康数据分析中开发、评估和解释可解释的人工智能系统。该协议在一个统一的工作流程中整合了数据预处理、预测建模、使用SHAP、LIME和Grad-CAM进行可解释性评估、以临床医生为中心的评估、验证程序以及可重复性资源。其目标是提供一个标准化框架,以支持在不同医疗健康数据集上实现透明的模型开发、解释质量评估和可重复的实施36,37,38,39。本研究的方法学贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合到单一协议中,适用于医疗健康人工智能领域的研究、教育及面向部署的研究项目40,41,42,43

本研究的主要贡献并非开发一种新的可解释性算法。

相反,本研究提供了一种标准化、可重复且经过实验验证的方案,将预测建模、可解释性评估、可视化、结果评价以及以人为中心的解释整合为统一的工作流程,适用于医疗健康数据分析及 JoVE 平台的方案传播。本研究的主要目标并非提出一种全新的预测算法,而是为在医疗健康数据分析中实施可解释人工智能工作流程提供一套标准化、可重复且经过实验验证的方案。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源整合为一个统一的框架,便于被采纳、复制和用于教学传播。

访问受限。请登录或开始试用以查看此内容。

方案

本研究中使用的所有数据集均来自公开且完全匿名的数据库,包括UCI机器学习库、PhysioNet MIMIC-III数据库和NIH胸部X光片数据集。未访问任何可识别的患者信息。本研究符合机构科研伦理指南中关于公开可用的去标识化数据二次分析的规定。由于未直接招募人类受试者,也未使用任何受保护的健康信息,因此无需正式的机构审查委员会批准。

1. 实验框架概述

  1. 构建一个可重复、可解释的人工智能(XAI)流程,用于透明的医疗健康数据分析。将工作流程划分为数据层、预处理层、建模层、可解释性层、评估层和可视化层。
  2. 将这些模块集成到一个统一的工作流程中,能够处理结构化临床数据、电子健康记录和医学影像数据集。
  3. 确保每个模块都有助于实现可重复性、可解释性、可扩展性以及标准化的实验执行。
  4. 设计模块化架构以支持连续的数据流,并确保流程中的每个阶段在整个实验工作流程中均有助于实现可重复性、可解释性和可扩展性。

2. 计算环境与系统配置

  1. 在执行工作流程之前,打开命令行终端并运行以下命令,以安装所需的软件依赖项:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. 在进行数据预处理和模型开发之前,验证所有软件包是否成功安装,并确认其与材料表中列出的软件版本兼容。
  3. 使用 Python 3.11 作为主要编程环境。安装并配置 NumPy 1.26 和 Pandas 2.1,用于数据处理和特征工程任务。安装 Scikit-learn 1.5 用于机器学习模型的开发与评估。
  4. 安装 TensorFlow 2.15 用于深度学习模型的训练与推理。安装 SHAP 0.46 和 LIME 0.2.0 用于可解释性分析。安装 OpenCV 4.10 用于图像处理任务。安装 Matplotlib 3.9 和 Seaborn 0.13 用于数据可视化和结果报告。有关可重复性所需的完整软件规格和实现细节,请参见材料表
  5. 使用配备多核处理器、图形处理单元(GPU)加速以及充足内存资源的工作站配置计算环境,以支持大规模医疗数据集和深度学习工作负载。
  6. 为数据划分、模型初始化和训练过程设置固定的随机种子,以确保多次实验运行之间的可重复性。启用日志记录机制,以记录整个工作流程中的数据预处理操作、模型配置、超参数设置、训练过程及评估结果。
  7. 根据表1中汇总的规范,配置模型架构、优化参数、学习率、批量大小、训练设置和超参数值。在重复实验中应遵循这些设置,以确保与报告结果的一致性。
  8. 预期输出——一个完全配置且可重复的计算环境,包含所有必需的软件包、硬件资源、日志记录机制以及模型配置参数,可用于后续的数据预处理、模型开发、可解释性分析和评估流程。
组件参数数值描述
随机森林n_estimators100树的数量
随机森林max_depthNone树的深度
XGBoostlearning_rate0.01学习率
XGBoostn_estimators100提升轮数
CNNepochs25训练轮数
CNNbatch_size32批量大小
CNNoptimizerAdam优化算法
MLPhidden_layers2隐藏层数量
MLPactivationReLU激活函数
通用train_split70%训练数据比例
通用validation_split15%验证集比例
通用test_split15%测试集比例

表1:实现细节与超参数配置。

本表格总结了在所提出的可解释人工智能框架的实验评估过程中,所使用的计算环境、软件库、机器学习与深度学习模型配置、优化设置、学习率、批量大小、训练参数以及超参数值。

3. 数据集准备与预处理

  1. 选择公开可用的医疗保健数据集,以确保实验流程的透明性和可重复性。
  2. 使用四个具有代表性的医疗保健场景来验证所提出的框架:(i) 使用威斯康星乳腺癌数据集进行乳腺癌诊断,(ii) 使用美国印第安人皮马糖尿病数据集进行糖尿病风险预测,(iii) 使用MIMIC-III电子健康记录进行临床结局预测,(iv) 使用NIH胸部X光数据集进行胸科疾病分类。选择这些数据集以评估该框架在结构化临床记录、纵向电子健康记录以及医疗影像模态中的表现,这些模态常见于医疗决策支持系统中。
  3. 将每个数据集导入Python环境,并将记录分离为输入特征和目标变量。针对疾病预测任务组织结构化临床数据,针对纵向结局分析整理电子健康记录,针对诊断分类任务处理医学影像数据集。在进行预处理操作前,验证每个数据集的完整性。
  4. 采用适当的插补技术识别并处理缺失值。通过特征缩放和归一化程序对数值型特征进行标准化,以确保变量间的可比性。
  5. 根据数据集特征,使用合适的编码方法对分类变量进行编码。通过相关性分析和基于模型的特征重要性度量进行特征选择,以识别最相关的变量并降低数据维度。
  6. 在模型训练前将所有医学图像调整为224 × 224像素。根据所选深度学习架构的要求对像素强度值进行归一化。应用数据增强技术,包括图像旋转和水平翻转,以提高模型泛化能力并减少过拟合。验证图像质量,并确保整个数据集中图像尺寸的一致性。
  7. 通过评估数据集的完整性、一致性以及特征与标签的对齐情况来评估数据完整性。验证所有记录均已正确分配至其对应的目标类别。审查数据集特征,包括样本量、特征数量和数据模态,如表2中所总结。
  8. 实施针对各数据集的验证程序,以确保方法学的严谨性和可重复性。记录每个数据集的样本量、类别分布、训练-验证-测试划分策略、防泄漏措施、超参数优化流程、交叉验证设计以及外部测试协议。将这些验证程序汇总于表3中。
  9. 通过评估缺失值处理、异常值剔除、特征缩放、分类变量编码、类别分布保持以及数据集划分程序,执行预处理质量控制检查。验证预处理操作在所有数据集中均一致应用。
  10. 确认在数据集划分过程中不存在显著的数据泄露。审查图1中展示的预处理验证结果,以确保已生成标准化数据集,用于后续的机器学习和可解释性分析。
  11. 预期输出——生成经过清理和标准化的数据集,其中缺失值已适当处理,分类变量已完成编码,数值特征已完成归一化,并将记录划分为训练、验证和测试子集。确保数据集特征、类别分布和验证程序与表2表3中报告的内容一致,并确认如图1所示的预处理验证已成功完成。
数据集类型样本数特征数目标变量
Breast CancerTabular56930良性/恶性
DiabetesTabular7688糖尿病结果
MIMIC-IIIEHR~60,000临床变量死亡率
Chest X-rayImaging~112,000图像疾病标签

表2:数据集特征与医疗应用场景。

本表总结了研究中使用的医疗保健数据集,包括数据集类型、样本数量、特征数量、目标变量、医疗保健应用领域以及相关临床应用场景。这些数据集涵盖结构化临床记录、电子健康记录和医学影像数据,以展示该框架在多种医疗保健分析场景中的适用性。

数据集样本量类别分布划分策略数据泄露预防超参数搜索交叉验证外部测试
Breast Cancer (UCI Wisconsin)569357 良性 / 212 恶性70/15/15仅训练集预处理网格搜索5折分层交叉验证独立保留集
Pima Indians Diabetes768500 非糖尿病 / 268 糖尿病70/15/15仅训练集预处理网格搜索5折分层交叉验证独立保留集
MIMIC-III EHR5274按结局分层的队列70/15/15 患者水平患者水平分离随机搜索5折患者水平交叉验证独立保留集
NIH Chest X-ray112120肺炎/正常分层70/15/15图像水平分离随机搜索5折分层交叉验证独立保留集

表3:数据集级别验证与实验设计。

本表格总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试集划分策略、数据泄露预防措施、超参数优化方法、交叉验证设计以及外部测试协议。这些措施的实施旨在确保方法学的严谨性、可重复性以及无偏倚的模型评估。

机器学习的数据预处理;图表;缺失值、异常值处理、缩放、编码。
图1:数据预处理流程的验证。
模型开发前关键预处理操作的验证结果。(A)代表性医疗特征中的缺失值分析。(B)数值变量在异常值处理前后的分布。(C)使用标准化进行特征缩放的验证。(D)分类变量编码的验证。(E)预处理后的类别分布。(F)训练集-验证集-测试集数据划分的验证。这些结果证实了数据集的预处理和准备工作已成功完成,可用于预测建模和可解释性分析。请点击此处查看该图的放大版本。

4. 可解释人工智能框架的系统架构

  1. 采用分层架构组织框架,以实现模块化处理,提高工作流程的透明度,并支持可重复的实施。配置数据层以接收和管理原始医疗健康数据集。在启动预处理操作之前,将所有输入数据集通过数据层进行路由。
  2. 在预处理层内执行数据清洗、转换、归一化、特征工程和编码操作。确保所有预处理操作在模型开发前完成。
  3. 在建模层中使用机器学习和深度学习算法开发预测模型。利用经过预处理的数据集和优化的超参数配置,训练梯度提升(Gradient Boosting)、随机森林(Random Forest)、多层感知机(MLP)和卷积神经网络(CNN)模型。
  4. 在可解释性层中应用可解释性技术以解读模型预测结果。对结构化数据集使用SHAP和LIME生成特征归因解释;对基于图像的模型生成Grad-CAM热图,以可视化对模型预测有贡献的区域。
  5. 在评估层中评估预测性能和可解释性性能。计算准确率、精确率、召回率、F1分数、ROC-AUC、保真度、稳定性以及面向临床医生的评估指标。记录所有评估输出,用于后续分析和报告。
  6. 在可视化层中生成临床可解读的可视化输出。创建性能对比图、特征重要性可视化图、SHAP汇总图、LIME解释图、Grad-CAM热图以及面向临床医生的报告仪表盘。存储所有可视化输出,以便纳入最终实验报告。
  7. 在执行工作流程之前,请先审阅 图2 中所示的完整框架架构。
  8. 预期输出——生成完全训练好的机器学习和深度学习模型,包括梯度提升、随机森林、CNN和MLP架构。存储模型配置、优化后的超参数、训练日志、检查点文件、可解释性输出以及可视化产物,用于后续的评估和可解释性分析。

包含各层的数据处理工作流程:数据、预处理、建模、可解释性、可视化。
图 2:用于医疗数据分析的可解释人工智能框架的系统架构。 请点击此处查看此图的放大版本。

5. 工作流程执行

  1. 从公开可用的数据库获取医疗健康数据集,并将这些数据集以适合机器学习和深度学习分析的结构化格式进行存储。查看图中所示的完整工作流程 图3 在开始实验步骤之前。
  2. 根据第3节所述步骤进行数据清洗与预处理。采用适当的缩放方法对数值型变量进行归一化。使用合适的编码技术对分类变量进行编码。根据数据集特定的填补策略识别并填补缺失值。在开展模型开发之前,验证数据质量、特征与标签的对应关系以及数据集的完整性。
  3. 将每个数据集划分为训练集、验证集和测试集,以支持对模型的无偏评估。在数据集划分过程中保持类别分布,并在适用情况下实施防止数据泄露的措施。测试集仅用于模型的最终评估。
  4. 使用基于集成的算法(包括梯度提升和随机森林)在结构化数据集上训练机器学习模型。使用能够学习图像空间特征的卷积神经网络(CNN)架构,在成像数据集上训练深度学习模型。在训练过程中迭代更新模型参数,并在每个训练周期后监控验证性能。当验证性能下降或未能根据预定义的停止标准改善时,应用早停策略。
  5. 使用系统性搜索策略(包括网格搜索和随机搜索)优化模型超参数。根据验证集性能调整学习率、估计器数量、树深度、批量大小、训练轮数及其他模型特定参数。基于模型在验证数据集上的预测性能和泛化能力选择最终模型。
  6. 在完成模型训练后应用可解释性方法。使用特征归因技术生成全局解释,以识别对模型预测贡献最大的变量。生成局部解释,用于分析单个预测案例,并在样本层面评估模型行为。为图像分类模型创建 Grad-CAM 热图,以突出显示对预测结果有贡献的图像区域。存储所有解释结果,供后续分析和报告使用。
  7. 使用准确率、精确率、召回率、F1分数和受试者工作特征曲线下面积(ROC-AUC)评估预测性能。通过保真度和稳定性指标评估解释质量,以衡量解释的可靠性和一致性。比较不同数据集和可解释性方法下的模型性能,以评估框架的鲁棒性和泛化能力。
  8. 生成可视化结果和分析报告,以临床可解读的方式传达研究结果。创建性能比较图表、特征重要性图、SHAP汇总可视化图、LIME解释输出、Grad-CAM热图以及其他具有临床相关性的可视化图像。在报告前,审阅所有可视化输出,确保其清晰性和一致性。
  9. 记录所有预处理操作、模型配置、超参数设置、可解释性分析流程、验证策略及评估结果。保留详细的实验记录,以促进工作流程的可重复性及独立复现。验证多次实验运行结果的一致性,并归档所有工作流程产物以供后续参考。
  10. 预期输出——生成一个经过充分训练的预测模型,包含优化的超参数、保存的模型权重、训练日志、性能指标以及可解释性输出,包括SHAP解释、LIME解释和Grad-CAM热图。存储所有模型产物、评估报告及可视化输出,以供后续分析和可重复性评估。

用于建模、可解释性分析、评估和预测的多层数据处理工作流程示意图
图 3:可解释人工智能流程的端到端工作流程。 请点击此处查看此图的放大版本。

6. 模型评估与可解释性评估

  1. 使用标准分类指标评估预测模型的性能,包括准确率、精确率、召回率、F1分数以及受试者工作特征曲线下面积(ROC-AUC)。计算准确率以衡量整体分类的正确性。
  2. 计算精确率以评估正确识别的阳性预测所占的比例。计算召回率以评估模型识别阳性样本的能力。计算F1分数以平衡精确率和召回率。计算ROC-AUC以评估在不同分类阈值下的区分性能。
  3. 在所有数据集和模型架构上一致地应用这些评估指标,以便进行客观的性能比较。记录所有指标数值,并保存评估结果,用于后续的统计分析和报告。
  4. 使用保真度和稳定性指标评估可解释性性能。计算保真度以确定生成的解释在多大程度上准确反映了模型的预测和决策行为。
  5. 通过比较相似输入样本生成的解释,并量化解释输出的一致性来计算稳定性。在解释模型解释结果之前,验证保真度和稳定性数值是否满足预定义的质量标准。
  6. 比较SHAP、LIME和Grad-CAM输出的可解释性性能。
  7. 预期输出:生成定量评估结果,包括准确率、精确率、召回率、F1分数、ROC-AUC、保真度和稳定性指标。生成适用于科学报告、可重复性评估和临床解释的可解释性输出及可视化结果。

7. 以人为中心的评估

  1. 招募12名医疗专业人员,包括6名医师、3名放射科医生和3名临床数据分析师。选择具有临床决策、医学影像解读、医疗数据分析或电子健康记录审查经验的参与者。在开始评估程序前,须获得所有参与者的知情同意。
  2. 在完成模型训练和可解释性分析后,从测试数据集中随机选取100个病例。为每个病例生成两种评估条件:
    1. 仅提供预测结果的输出,以及
    2. 包含可解释性信息的预测结果。随机化病例和评估条件的呈现顺序,以尽量减少呈现顺序偏差和学习效应。
  3. 准备包含预测结果、解释输出和评估问卷的标准化评估表。通过基于计算机的评估界面,逐一向参与者展示病例。
  4. 指导参与者独立审阅每个病例,不得与其他评估者讨论其回答。允许参与者在相同的实验条件下完成所有评估。
  5. 采用改编自已发表的可解释人工智能评估研究的五点李克特量表问卷。要求参与者对每个审阅病例的信任度、可解释性和可用性进行评分。以电子方式记录问卷回答,并在进入统计分析前核实所有调查项目均已填写完成。
  6. 在评估过程中测量临床实用性的客观指标。通过将参与者决策与相应的参考标签或真实结果进行比较,记录决策一致性。将决策一致性计算为参与者决策与参考结果一致的百分比。
  7. 通过测量病例呈现至最终响应提交之间的时间间隔,记录每个病例的审阅时间。分别计算仅预测条件和预测加解释条件下的平均审阅时间。
  8. 计算所有参与者和评估病例的平均信任度、可解释性和可用性评分。比较仅预测条件与预测加解释条件下获得的评分。
  9. 在所有参与者完成评估后,进行配对t检验,以确定信任度、可解释性、可用性、决策一致性和审阅时间的差异是否具有统计学显著性。所有统计比较均采用p < 0.05作为显著性阈值。
  10. 在收集所有参与者的响应后,计算Fleiss Kappa以评估评分者间一致性。利用汇总的参与者评分,确定不同评审者之间评估结果的一致性。根据既定的一致性指南解释Fleiss Kappa值,并记录相应的一致性统计结果。
  11. 表4中汇总参与者人口统计信息、评估方法、问卷设计、统计分析流程、客观性能指标以及评分者间一致性结果。
  12. 在两种评估条件下审查模型输出,并比较参与者在不同条件下的响应。验证解释信息是否在不影响决策质量的前提下提升了信任度、可解释性和可用性。
  13. 使用计算得到的Fleiss Kappa统计量确认参与者评估结果的一致性。记录所有评估结果,用于后续报告和可重复性评估。
  14. 预期输出——生成临床医生信任评分、可解释性评分、可用性评分、决策一致性指标、审阅时间统计、配对t检验结果以及评分者间一致性统计。产出定量证据,描述该可解释人工智能框架的临床实用性、可解释性和可信度。
参数数值
专家12
医师6
放射科医生3
临床数据分析师3
评审病例数100
评估设计随机化(仅预测 vs 预测+解释)
调查工具5点李克特量表
信任度评估可解释性、信任度、可用性
统计检验配对t检验(p 0.05)
评分者间信度Fleiss Kappa
客观指标决策一致性、评审时间

表4:以人类为中心的评估方案与临床医生评估设计。

本表格展示了用于评估可解释人工智能系统在可解释性、可信度和可用性方面的临床医生评估框架。内容总结了参与者人口统计学信息、病例审查方法、调查设计、统计分析流程、评分者间信度评估以及客观评价指标。

8. 验证与可重复性评估

  1. 进行验证与消融实验,以评估所提出框架的稳健性与可靠性。利用选定的可解释性方法识别具有高重要性评分的特征。逐步移除重要特征,并在每次移除特征后重新训练预测模型。
  2. 在每次消融实验后,使用准确率、精确率、召回率、F1分数和ROC-AUC指标评估模型性能。将所得性能值与基线模型性能进行比较,以确定各个特征对预测结果的贡献。
  3. 通过SHAP、LIME和Grad-CAM方法对相似输入样本生成解释,以评估解释的稳定性。在多次重复评估中比较解释结果,并使用预定义的稳定性指标量化一致性。验证在微小输入变化和重复实验运行下,解释结果仍保持稳定。
  4. 在整个工作流程中记录所有实验步骤。详细记录数据预处理操作、数据集划分方法、模型架构、超参数设置、训练配置、可解释性方法、验证策略及评估指标。将所有配置参数和实验结果以结构化格式存储,以支持结果的可重复性与独立验证。
  5. 审查所有实验记录,确保其完整性与一致性。验证所记录的流程、配置文件及软件规格是否足以复现整个工作流程。保持模块化的工作流程结构,以便于本方案在后续研究中的调整,并支持将其转化为符合JoVE方法学要求的视频实验方案。

9. 可重复性资源

  1. 使用固定的随机种子执行所有实验,以确保在重复运行中结果的可重复性。将源代码、预处理脚本、配置文件、环境规格、模型参数和可视化脚本保存在公开可访问的代码仓库中。
  2. 提供详细的数据集获取、预处理、实验执行、模型训练、可解释性生成、验证流程以及所有报告表格和图表再生的操作说明。归档独立复现所需的全部工作流程组件,包括软件规格、预处理流程、配置文件、数据集访问说明、模型检查点和可视化资源。
  3. 表5中总结本框架所使用的软件资源、预处理流程、配置文件、数据集访问说明以及可重复性相关资源。
  4. 预期输出- 生成一个完整的可重复实验包,包含预处理脚本、配置文件、训练好的模型、模型检查点、可解释性输出、验证报告、可视化产物、软件规格以及实现本框架独立复现和验证所需的全部文档。
资源描述
源代码用于数据预处理、模型训练、可解释性分析和评估的 Python 实现脚本
环境文件包含软件包依赖关系及版本的 requirements.txt 文件
配置文件模型结构设置、超参数和实验配置
固定随机种子使用 Seed = 42 以确保实验可重复性
数据集访问说明获取公开医疗数据集的链接和操作流程
预处理脚本用于数据清洗、归一化、编码和特征选择的脚本
图表生成脚本用于重新生成所有论文图表的脚本
表格生成脚本用于复现所报告表格和指标的脚本
示例输入样本数据集和输入文件
示例输出预测结果、解释性分析结果和评估报告

表5:可重复性资源与实验资源。

本表格总结了为支持实验可重复性而提供的资源,包括源代码、预处理脚本、配置文件、环境配置说明、数据集访问指南、固定的随机种子设置、图表生成脚本,以及重现报告结果所需的示例输入/输出文件。

访问受限。请登录或开始试用以查看此内容。

结果

我们对整个流程中的可解释人工智能组件进行了全面评估,考察了其在不同类型医疗数据上的预测性能,包括结构化临床数据和医学图像。结果表明,在所评估的数据集中,模型的预测性能表现一致。在测试的模型中,梯度提升模型的准确率最高,达到97.4%,其次是随机森林模型,准确率为94.2%。应用于图像数据集的深度学习方法准确率为91.3%,而多层感知机模型的结果略低,为90.8%。这表明,基于集成的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构在影像任务中更具优势。表6详细列出了预测功能的各项性能指标,包括准确率、精确率、召回率和F1分数,以及可解释性指标如保真度和稳定性。这些性能数值是通过五折交叉验证得出的,并以均值(含95%置信区间)形式呈现。置信区间不仅反映了模型的不确定性,还使预测性能的比较更加可靠,能够兼顾数据集的记忆效应以及模型架构之间的差异。

模型

访问受限。请登录或开始试用以查看此内容。

讨论

本研究开发并评估了一种可重复的、可解释的人工智能(XAI)工作流程,用于医疗数据分析。该流程在一个统一的协议中集成了预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源。结果表明,在所评估的结构化医疗数据集上,基于集成的机器学习模型(特别是梯度提升和随机森林)表现出最高的预测性能,而深度学习模型则更适用于基于图像的分析。这些发现强调了应根据数据特征选择模型架构的重要性,而非假设更复杂的模型总会带来更优的性能。本研究的一个关键贡献在于,将预测建模、可解释性评估、以人为中心的评估以及可重复性实践整合到一个标准化的工作流程中。与孤立评估可解释性技术的研究不同,所提出的框架提供了一种以协议为驱动的方法论,支持在多种医疗数据集上进行透明且可重复的实验。

可解释性分析在所评估的方法之间显示出可测量的差异。在所评估的实验条件下,SHAP 实现了最高的保真度和稳定性得分,表明其生成的解释与模型预测之间具有更紧密的一致性。LIME 提供了有用的局部解释,但表现出较低的稳定性,而 Grad-CAM 为影像数据生成了直观的可视化解释。这些发现表明,解释质量取决于所选择的可解释性方法以及底层的预...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明,他们对本研究不存在任何竞争性财务利益或相关利益冲突。本研究独立开展,未涉及任何可能被视为潜在利益冲突的商业或财务关系。

人工智能使用披露

在手稿撰写过程中,使用了人工智能工具进行语言润色、语法检查和编辑辅助。所有科学内容、实验设计、数据分析、结果解释以及最终手稿的核实均由作者完成。作者对所有人工智能辅助生成的内容进行了审阅和验证,以确保其准确性、完整性和符合期刊投稿指南。

致谢

作者感谢各自机构为开展本研究提供了必要的基础设施和科研支持。作者还感谢使用了公开可用的数据集和开源工具,这些资源促进了所提出的可解释人工智能框架的开发与评估。特别感谢领域专家在以人为中心的评估阶段提供的宝贵见解。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
GPU 工作站Manufacturer dependentNA训练深度学习模型
Jupyter NotebookProject JupyterLatest stable release交互式实验执行
LIMELIMEVersion 0.2.0局部可解释性分析
MatplotlibMatplotlib ProjectVersion 3.9数据可视化
MIMIC-III 数据库PhysioNetVersion 1.4电子健康记录分析
NIH 胸部 X 光数据集NIH 临床中心Public Dataset胸部疾病分类
NumPyNumPy 开发者团队Version 1.26数值计算与数组操作
OpenCVOpenCV 基金会Version 4.10图像预处理
PandasPandas 开发团队Version 2.1数据处理与预处理
Pima 印第安人糖尿病数据集UCI 机器学习知识库Public Dataset糖尿病风险预测
Python 3.11Python 软件基金会Version 3.11主要编程环境
Scikit-learnscikit-learnVersion 1.5机器学习算法与评估
SeabornSeabornVersion 0.13统计可视化
SHAPSHAPVersion 0.46特征归因与可解释性分析
TensorFlowTensorFlowVersion 2.15深度学习模型开发
Windows / Ubuntu LinuxMicrosoft / CanonicalNA操作系统
威斯康星乳腺癌数据集UCI 机器学习知识库Public Dataset乳腺癌诊断

参考文献

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

233 233 XAI