研究文章

用于开发和评估医疗分析中可解释人工智能框架的可重复协议

DOI:

10.3791/71999

2026年7月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在这里,我们提出了一个可重复的方案,用于开发和评估用于医疗分析的可解释人工智能模型。该工作流程集成了数据预处理、预测建模、SHAP、LIME和基于Grad-CAM的解释性、定量评估以及以人为本的验证,以支持透明且值得信赖的临床决策。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

可解释人工智能(XAI)越来越被认可为构建医疗中可信人工智能系统的不可或缺工具,在其中,透明度和决策解释能力是临床决策的重要组成部分。本出版物提出了一种可重复的实验方法,用于开发和评估用于医疗分析的可解释人工智能系统。开发的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流程,可应用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上展现出强大的预测性能,而深度学习模型则在学习医学影像数据中的复杂模式方面非常有效。SHAP、LIME和Grad-CAM等技术是全局和局部解释,有助于模型解释。非常有帮助。该框架的定量评估涵盖了许多不同指标,如准确性、精度、召回率、F1分数、ROC-AUC、解释指标、忠实度和稳定性。结果表明,当实验条件得到控制时,该框架在评估的实验条件下展现了更好的预测表现和解释质量。作为一份以协议为指导的文件,这部作品支持了可重复性和可扩展性,以及其他生物持续实施的基础。这一透明、易懂的AI模型是临床决策支持和医疗分析系统在大规模获得信任和应用的基础。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工智能(AI)已成为现代医疗的重要组成部分,支持疾病诊断、预后、风险分层、医学图像分析和临床决策。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,常常实现与传统统计方法相当甚至更优的预测性能2.尽管取得了这些进步,许多人工智能模型仍以复杂的黑箱系统运行,使临床医生和医疗利益相关者难以理解预测是如何生成的3.这种缺乏透明度可能限制高风险医疗环境中的信任、采纳和问责制 4,5

可解释人工智能(XAI)已成为提升机器学习模型透明度和可解释性的一种有前景的方法。广泛使用的解释技术,包括SHAP(Shapley加法解释)、LIME(局部可解释模型无关解释)和梯度加权类激活映射(Grad-CAM),通过特征归因和可视化解释机制789,提供了模型行为的洞见。这些方法越来越多地应用于医疗应用,以支持临床解读、模型审计和决策支持10,11。然而,仅凭可解释性并不能保证可靠性、可重复性或临床效用。近期研究强调了解释不稳定性、对干扰敏感性、临床医生验证有限以及解释输出与真实模型推理之间的不一致等挑战 12,13,14,15。

除了可解释性的挑战外,可重复性仍然是医疗机器学习研究中的重要关注点 16,17,18。许多已发表的研究对预处理过程、软件环境、超参数配置、验证策略和实现工作流提供了有限的信息,使得独立复制变得困难 19,20,21。此外,医疗人工智能研究常关注预测表现,但对解释质量评估、以临床医生为中心的评估及实际实施考虑提供有限指导22。这些局限可能阻碍可解释的人工智能系统从研究环境中转化到现实医疗环境中 23,24,25,26,27。

当前医疗XAI工作流程通常单独评估个别解释技术或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为本评估和可重复性资源的标准化协议 28,29,30,31.因此,研究人员和从业者在重现工作流程、比较解释方法或评估可解释人工智能系统在不同医疗数据集和应用领域的实际应用时可能会遇到困难。因此,需要一个全面且可重复的协议,以促进医疗可解释AI工作流程的一致实施、评估和报告,见32,33,34,35。

本文介绍了一个可重复的方案,用于开发、评估和解释医疗分析中可解释的人工智能系统。该方案将数据预处理、预测建模、使用SHAP、LIME和Grad-CAM的可解释性评估、以临床医生为中心的评估、验证程序和可重复性资源整合在统一的工作流程中。目标是提供一个标准化框架,支持透明的模型开发、解释质量评估以及在多样化医疗数据集36373839中实现可重复的实施。该工作的方法论贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合为一个适合医疗人工智能研究、教育和部署导向研究的单一方案 40,41,42,43。

这项工作的主要贡献并非开发了一种新的可解释性算法。

相反,它提供了一个标准化、可重复且经过实验验证的协议,将预测建模、可解释性评估、可视化、评估和以人为本的解读整合为一个统一的工作流程,适用于医疗分析和基于JoVE的协议传播。本研究的主要目标不是引入新的预测算法,而是提供一套标准化、可重复且经过实验验证的协议,用于实现医疗分析中的可解释人工智能工作流程。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合为一个统一框架,适合采用、复制和教育传播。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究所用的所有数据集均来自公开且完全匿名的存储库,包括UCI机器学习存储库、PhysioNet MIMIC-III数据库和NIH胸部X光数据集。未访问可识别的患者信息。该研究符合机构研究伦理指南,用于对公开可得的去标识化数据进行二次分析。由于未直接招募人类参与者且未使用受保护健康信息,因此未要求正式的机构审查委员会批准。

1. 实验框架概述

  1. 开发可重复、可解释的人工智能(XAI)流程,实现透明的医疗分析。将工作流程组织为数据层、预处理层、建模层、可解释层、评估层和可视化层。
  2. 将这些模块集成到一个统一的工作流程中,能够处理结构化临床数据、电子健康记录和医学影像数据集。
  3. 确保每个模块都有助于重复性、可解释性、可扩展性和标准化的实验执行。
  4. 设计模块化架构以支持连续数据流,确保流水线的每个阶段在实验工作流程中都有助于可重复性、可解释性和可扩展性。

2. 计算环境与系统配置

  1. 在执行工作流程前,先通过打开命令行终端并执行以下命令安装所需的软件依赖:
    PIP install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. 在进行数据预处理和模型开发前,请核实所有软件包的成功安装情况,并确认与 材料表 中列出的软件版本的兼容性。
  3. 使用Python 3.11作为主要编程环境。安装并配置 NumPy 1.26 和 Pandas 2.1,用于数据处理和特征工程任务。安装Scikit-learn 1.5,用于机器学习模型的开发和评估。
  4. 安装 TensorFlow 2.15 用于深度学习模型训练和推理。安装SHAP 0.46和LIME 0.2.0以进行解释性分析。安装OpenCV 4.10用于图像处理任务。安装 Matplotlib 3.9 和 Seaborn 0.13 以实现数据可视化和结果报告。请参阅 材料表 ,了解完整的软件规范和实现细节,以确保可重复性。
  5. 使用配备多核处理器、图形处理单元(GPU)加速和足够内存资源的工作站配置计算环境,以应对大型医疗数据集和深度学习工作负载。
  6. 为数据分区、模型初始化和训练过程设置固定的随机种子,以确保跨实验运行的可重复性。启用日志机制,记录数据预处理操作、模型配置、超参数设置、训练过程和整个工作流程中的评估结果。
  7. 根据 表1中总结的规格配置模型架构、优化参数、学习率、批处理大小、训练设置和超参数值。在重复实验中遵守这些设置,以确保与报告结果的一致性。
  8. 预期输出——一个完全配置且可复现的计算环境,配备所有必要的软件包、硬件资源、日志机制和模型配置设置,可用于后续数据预处理、模型开发、可解释性分析和评估程序。
组成部分参数价值描述
随机森林n_estimators100树的数量
随机森林max_depth没有树深
XGBoostlearning_rate0.01学习速率
XGBoostn_estimators100加速弹
CNN时代25训练时期
CNNbatch_size32批次大小
CNN优化器亚当优化算法
MLPhidden_layers2隐藏层的数量
MLP激活ReLU激活函数
概述train_split70%训练数据比例
概述validation_split15%验证比
概述test_split15%检测比

表1:实现细节及超参数配置。

本表总结了在实验评估中所用的计算环境、软件库、机器学习和深度学习模型配置、优化设置、学习率、批处理大小、训练参数和超参数值。

3. 数据集准备与预处理

  1. 选择公开可用的医疗数据集,以确保实验工作流程的透明性和可重复性。
  2. 使用四个具代表性的医疗场景验证所提出的框架:(i)使用威斯康星乳腺癌数据集进行乳腺癌诊断,(ii)使用Pima Indians糖尿病数据集进行糖尿病风险预测,(iii)使用MIMIC-III电子健康记录进行临床预报预测,以及(iv)使用NIH胸部X光数据集进行胸腔疾病分类。选择这些数据集,评估结构化临床记录、纵向电子健康记录以及医疗决策支持系统中常用的医学影像模式的框架。
  3. 将每个数据集导入 Python 环境,并将记录分成输入特征和目标变量。组织结构化的临床数据用于疾病预测任务,组织电子健康记录用于纵向结局分析,以及用于诊断分类任务的医学影像数据集。在进行预处理操作前,先验证每个数据集的完整性。
  4. 使用适当的补补技术识别并解决缺失值。通过特征缩放和归一化程序标准化数值特征,确保跨变量的可比性。
  5. 基于数据集特性,使用合适的编码方法编码类别变量。通过相关分析和基于模型的特征重要性度量进行特征选择,以识别最相关的变量并降低数据维度。
  6. 在模型训练前,将所有医学图像调整为224,224像素。根据所选深度学习架构的需求,对像素强度值进行归一化。应用数据增强技术,包括图像旋转和水平翻转,以提升模型泛化并减少过拟合。验证图像质量,并确保数据集中图像尺寸的一致性。
  7. 通过评估数据集的完整性、一致性和特征标签对齐性来评估数据完整性。确认所有记录均正确分配到对应的目标类别。回顾数据集特征,包括样本量、特征数和数据模态,如 表2总结。
  8. 实施针对数据集的验证程序,以确保方法学的严谨性和可重复性。记录每个数据集的样本量、类别分布、训练-验证-测试拆分策略、泄漏预防措施、超参数优化程序、交叉验证设计及外部测试协议。在表3中总结这些验证程序。
  9. 通过评估缺失值处理、异常值消除、特征缩放、类别编码、类分布保持和数据集划分程序,进行预处理质量控制检查。验证预处理操作在所有数据集中是否一致地应用。
  10. 确认数据集划分过程中没有显著的数据泄漏。请查看 图1 中展示的预处理验证结果,以确保已生成用于后续机器学习和可解释性分析的标准化数据集。
  11. 预期输出——生成已清理且标准化的数据集,缺失值得到适当处理,编码类别变量,归一化数值特征,并将记录划分为训练、验证和测试子集。确保数据集特征、类别分布和验证程序与表2表3报告一致,并确认如图1所示成功的预处理验证。
数据集类型采样特色目标
乳腺癌表格56930良性/恶性
糖尿病表格7688糖尿病结局
模仿三电子健康记录~60,000临床变量死亡
胸部X光成像~112,000图片疾病标签

表2:数据集特征与医疗应用场景。

本表格提供了研究中使用的医疗数据集摘要,包括数据集类型、样本数量、特征数量、目标变量、医疗应用领域及相关临床用例。数据集涵盖结构化临床记录、电子健康记录和医学影像数据,展示该框架在多种医疗分析场景中的适用性。

数据集样本量级别分布分裂策略泄漏预防超参数搜索交叉验证外部测试
乳腺癌(UCI威斯康星)569357 良性 / 212 恶性70/15/15仅列车预处理网格搜索五重分层CV独立保留集合
皮马印第安人糖尿病768500名非糖尿病患者 / 268名糖尿病患者70/15/15仅列车预处理网格搜索五重分层CV独立保留集合
模仿者三号电子病历5274结果分层队列70/15/15 患者级别患者层级分离随机搜索5折患者级简历独立保留集合
美国国立卫生研究院胸部X光112120肺炎/正常分层70/15/15图像级分离随机搜索五重分层CV独立保留集合

表3:数据集级验证与实验设计。

下表总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试拆分策略、泄漏预防程序、超参数优化方法、交叉验证设计及外部测试协议。这些措施旨在确保方法学严谨性、可重复性和模型评估的公正性。

figure-protocol-1
图1:数据预处理流水线的验证。
模型开发前关键预处理操作的验证结果。(A) 跨代表性医疗特征的缺失价值分析。(B) 数值变量在离群值处理前后的分布。(C) 使用标准化进行特征缩放验证。(D) 分类编码验证。(E) 预处理后的类别分布。(F) 列车-验证-测试数据分区的验证。这些结果证实了数据集的预处理和预测建模和可解释性分析的成功准备。 请点击此处查看该图的放大版本。

4. 可解释人工智能框架的系统架构

  1. 采用分层架构组织框架,促进模块化处理,提高工作流程透明度,并支持可重复实现。配置数据层以接收和管理原始医疗数据集。在启动预处理操作前,将所有入站数据集都经过数据层。
  2. 在预处理层内执行数据清理、转换、归一化、特征工程和编码过程。确保所有预处理操作在模型开发前完成。
  3. 在建模层内利用机器学习和深度学习算法开发预测模型。利用预处理数据集和优化的超参数配置,构建了列车梯度增强、随机森林、多层感知器(MLP)和卷积神经网络(CNN)模型。
  4. 在可解释层中应用可解释性技术来解释模型预测。利用SHAP和LIME生成结构化数据集的特征归因解释。生成基于图像的模型的Grad-CAM热图,以可视化对模型预测有贡献的区域。
  5. 评估评估层内的预测性和可解释性表现。计算准确性、准确性、回忆率、F1评分、ROC-AUC、保真度、稳定性以及以临床医生为中心的评估指标。记录所有评估结果,以便后续分析和报告。
  6. 在可视化层中生成临床可解读的视觉输出。创建性能比较图、特征重要性可视化、SHAP总结图、LIME解释、Grad-CAM热图以及面向临床医生的报告仪表盘。存储所有视觉输出,以便纳入最终实验报告。
  7. 在继续执行工作流之前,请先查看 图2 所示的完整框架架构。
  8. 预期输出——生成完全训练好的机器学习和深度学习模型,包括梯度增强、随机森林、CNN和MLP架构。存储模型配置、优化超参数、训练日志、检查点文件、可解释性输出和可视化工件,供后续评估和可解释性分析。

figure-protocol-2
图2:可解释人工智能框架用于医疗分析的系统架构。请点击此处查看该图的更大版本。

5. 工作流程执行

  1. 从公开的数据库获取医疗数据集,并以适合机器学习和深度学习分析的结构化格式存储。在开始实验程序前,请回顾 图3 所示的完整工作流程。
  2. 按照第3节描述的程序进行数据清理和预处理。使用适当的缩放方法对数值变量进行归一化。使用合适的编码技术编码类别变量。利用数据集特定的补值策略识别和补缺值。在继续模型开发前,请核实数据质量、特征标签对齐性和数据集完整性。
  3. 将每个数据集划分为训练、验证和测试三个子集,以支持无偏的模型评估。在数据集分区时保留类分布,并在适用时实施泄漏预防措施。将测试子集专门保留用于最终模型评估。
  4. 使用基于集成的算法(包括梯度增强和随机森林)在结构化数据集上训练机器学习模型。利用卷积神经网络(CNN)架构在成像数据集上训练深度学习模型,能够学习空间图像特征。在训练过程中迭代更新模型参数,并在每个训练阶段后监控验证性能。当验证性能下降或未能按照预设的停止标准改善时,应用提前停止。
  5. 利用系统搜索策略优化模型超参数,包括网格搜索和随机搜索。根据验证性能调整学习率、估计量数量、树状结构深度、批次大小、历期数及其他模型特定参数。根据预测性能和跨验证数据集的泛化能力选择最终模型。
  6. 完成模型训练后应用可解释性方法。利用特征归因技术生成全局解释,识别对模型预测贡献最强的变量。生成局部解释以分析个别预测案例,并在样本层面评估模型行为。为图像分类模型创建Grad-CAM热图,突出显示对预测结果有贡献的图像区域。存储所有解释输出以便后续分析和报告。
  7. 利用准确性、精度、召回率、F1分数和曲线下的受试者工作特征面积(ROC-AUC)评估预测性能。利用忠真度和稳定性指标评估解释质量,以评估解释的可靠性和一致性。比较不同数据集和可解释性方法的模型表现,以评估框架的稳健性和泛化性。
  8. 生成可视化输出和分析报告,以临床可解读的方式传达结果。创建性能比较图表、特征重要性图、SHAP总结可视化、LIME解释输出、Grad-CAM热图及其他临床相关可视化。在报告前,请审查所有视觉输出,以确保清晰和一致。
  9. 记录所有预处理操作、模型配置、超参数设置、可解释过程、验证策略及评估结果。保持详细的实验记录,以促进工作流程的可重复性和独立复制。验证多次实验运行结果的一致性,并将所有工作流程的产物归档以备将来参考。
  10. 预期输出——生成一个完全训练好的预测模型,包含优化的超参数、保存的模型权重、训练日志、性能指标和可解释性输出,包括SHAP解释、LIME解释和Grad-CAM热图。存储所有模型工件、评估报告和可视化输出,以便后续分析和可重复性评估。

figure-protocol-3
图3:可解释人工智能流程的端到端工作流程。请点击此处查看该图的更大版本。

6. 模型评估与可解释性评估

  1. 使用标准分类指标评估预测模型性能,包括准确性、精度、回忆率、F1评分和曲线下的受试者工作特征面积(ROC-AUC)。计算准确率以衡量整体分类正确性。
  2. 计算准确率以评估正确识别的正面预测比例。计算回忆率以评估模型识别阳性病例的能力。计算F1分数以平衡精度和回忆。计算ROC-AUC以评估不同分类阈值下的判别性能。
  3. 在所有数据集和模型架构中一致应用这些评估指标,以便实现客观的性能比较。记录所有指标值并存储评估结果,以便后续统计分析和报告。
  4. 使用保真度和稳定性指标评估可解释性性能。计算忠真度以确定生成的解释在多大程度上准确反映模型预测和决策行为。
  5. 通过比较由相似输入样本生成的解释并量化解释输出的一致性来计算稳定性。在解释模型解释前,请确认保真度和稳定性值是否符合预设的质量标准。
  6. 比较SHAP、LIME和Grad-CAM输出的可解释性表现。
  7. 预期输出——生成定量评估结果,包括准确性、精度、召回率、F1评分、ROC-AUC、保真度和稳定性指标。产出适合科学报告、可重复性评估和临床解释的可解释性输出和可视化。

7. 以人为本的评估

  1. 招聘12名医疗专业人员,包括6名医生、3名放射科医生和3名临床数据分析师。选择具有临床决策、医学图像解读、医疗分析或电子病历审查经验的参与者。在启动评估程序前,请获得所有参与者的知情同意。
  2. 完成模型训练和可解释性分析后,从测试数据集中随机选取100个案例。为每种情况生成两个评估条件:
    1. 仅预测输出和
    2. 预测并附有可解释性信息。随机化案例的呈现顺序和评估条件,以最大限度减少呈现偏差和学习效应。
  3. 准备包含预测结果、解释结果和评估问卷的标准化评估表格。通过基于计算机的评估界面,逐个向参与者展示案例。
  4. 指示参与者独立审查每个案例,不与其他评估者讨论回答。允许参与者在相同的实验条件下完成所有评估。
  5. 根据已发表的可解释人工智能评估研究,进行一份五点李克特量表问卷。指导参与者对每个审查案例的信任度、可解释性和可用性进行评估。电子记录问卷回答,并确认所有调查项目的完成情况,然后进行统计分析。
  6. 在评估过程中衡量临床有用的客观指标。通过比较参与者决策与相应的参考标签或真实结果,记录决策一致。计算决策一致为参与者决策中与参考结果相符的百分比。
  7. 通过测量案例展示与最终回复提交之间的间隔,记录每个案件的审阅时间。分别计算仅预测和带解释预测条件的平均审阅时间。
  8. 计算所有参与者和评估案例的平均信任度、可解释性和可用性评分。比较仅预测和带解释预测条件下获得的分数。
  9. 在完成所有参与者评估后进行配对t检验,以确定信任度、可解释性、可用性、决策一致性和审阅时间的差异是否具有统计学显著性。所有统计比较均使用p 0.05的显著性阈值。
  10. 收集所有参与者的反馈后计算Fleiss Kappa,以评估评审间的共识度。利用汇总的参与者评分来确定评审者间评价的一致性。根据既定协议指南解释Fleiss Kappa的价值观,并记录由此产生的协议统计数据。
  11. 表4中总结参与者人口统计、评估方法、问卷设计、统计分析程序、客观绩效指标及评定者间一致结果。
  12. 在两种评估条件下回顾模型输出,并比较不同条件下参与者的反应。验证解释是否能提升信任度、可解释性和可用性,同时不影响决策质量。
  13. 使用计算出的Fleiss Kappa统计量确认参与者评估的一致性。记录所有评估结果,以便后续报告和可重复性评估。
  14. 预期产出——生成临床医生信任评分、可解释性评分、可用性评分、决策一致指标、审核时间统计、配对t检验结果和评估者间一致统计。产出定量证据,描述可解释人工智能框架的临床实用性、可解释性和可信度。
参数价值
专家12
医生6
放射科医生3
临床数据分析师3
审查案例100
评估设计随机化(仅预测 vs 预测+解释)
测量仪器5点李克特量表
信托评估可解释性、信任度、可用性
统计检验配对t检验(p 0.05)
评级间可靠性弗莱斯卡帕
客观指标决策协议,审核时间

表4:以人为本的评估方案与临床医生评估设计。

本表展示了用于评估可解释人工智能系统可解释性、可信度和可用性的临床评估框架。总结了参与者人口统计、病例综述方法、调查设计、统计分析程序、评级间信度评估及客观评估指标的信息。

8. 验证与可重复性评估

  1. 进行验证和消融研究,以评估所提框架的稳健性和可靠性。使用所选的可解释性方法识别重要性分数较高的特征。逐步移除重要特征,并在每个特征移除步骤后重新训练预测模型。
  2. 每次消融实验后,利用准确性、精度、回忆率、F1评分和ROC-AUC指标评估模型表现。将得出的性能值与基线模型表现进行比较,以确定单个特征对预测结果的贡献。
  3. 通过使用 SHAP、LIME 和 Grad-CAM 生成类似输入样本的解释来评估解释稳定性。比较多次评估的解释输出,并利用预定义的稳定性指标量化一致性。验证解释在轻微输入变化和反复实验运行下是否保持稳定。
  4. 记录整个工作流程中的所有实验程序。文档数据预处理操作、数据集分区过程、模型架构、超参数设置、训练配置、可解释性方法、验证策略和评估指标。将所有配置参数和实验输出以结构化格式存储,便于重复性和独立验证。
  5. 审查所有实验记录以确保完整性和一致性。验证工作流程是否可以通过文档中的流程、配置文件和软件规范复制。维护模块化工作流程结构,以便协议适应未来研究,并支持转换为符合JoVE方法论要求的基于视频的实验协议。

9. 可重复性资源

  1. 所有实验都使用固定的随机种子,以确保在多次运行中结果可重复。维护源代码、预处理脚本、配置文件、环境规范、模型参数和可视化脚本,存储在公开可访问的仓库中。
  2. 提供详细的数据集获取、预处理、实验执行、模型训练、可解释性生成、验证程序及所有报告表格和图表的重生成说明。归档独立复制所需的所有工作流组件,包括软件规范、预处理工作流、配置文件、数据集访问指令、模型检查点和可视化资产。
  3. 总结表 5中整个框架中使用的软件资源、预处理工作流、配置文件、数据集访问指令和可重复性资产。
  4. 预期输出——生成一个完整的可重复实验包,包含预处理脚本、配置文件、训练模型、模型检查点、可解释输出、验证报告、可视化工件、软件规范以及独立复制和验证所提框架所需的文档。
资源描述
源代码用于数据预处理、模型训练、可解释性和评估的 Python 实现脚本
环境文件requirements.txt包含包依赖关系和版本
配置文件模型架构设置、超参数和实验配置
固定的随机种子种子 = 42 用于可重复实验
数据集访问说明获取公共医疗数据集的链接和流程
预处理脚本用于数据清理、规范化、编码和功能选择的脚本
图形生成脚本用于重生成所有手稿图形的脚本
表生成脚本用于重现报告表和度量的脚本
示例输入示例数据集和输入文件
示例输出预测结果、解释与评估报告

表5:可重复性资源与实验资产。

本表总结了支持实验可重复性的资源,包括源代码、预处理脚本、配置文件、环境规范、数据集访问指令、固定随机种子设置、图形生成脚本以及重现报告结果所需的示例输入/输出文件。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们全面评估了整个流程中的解释性人工智能部分,评估其在不同类型医疗数据(包括结构化临床数据和医学图像)上的预测效果。结果显示,评估数据集的预测表现一致。在测试的模型中,梯度提升模型的准确率最高,达到97.4%,其次是随机森林模型,准确率为94.2%。应用于图像集的深度学习方法实现了91.3%的准确率,而多层感知器模型的结果略低于90.8%。这表明基于集合的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构则在成像任务中表现出色。 表6 详细概述了预测函数的各种性能指标,包括准确性、精度、召回率和F1分数,以及如保真度和稳定性等可解释性指标。我们通过采用五重交叉验证并将结果以均值(含95%置信区间)呈现,得出了这些性能数据。置信区间不仅表明模型的不确定性,还使预测表现的比较更可靠,考虑了数据集内存和模型架构的差异。

模型准确率(%)精度召回F1评分忠实度稳定性95%信赖区间
随机森林94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN(成像)91.30.900.910.900.880.8690.1–92.5

表6:预测模型与可解释性方法的比较表现。
本表采用预测性能指标(包括准确率、精度、召回率、F1分数和ROC-AUC)对机器学习与深度学习模型进行了比较评估。此外,可解释性指标如忠实度、稳定性、理解度和人类信任评分也被报告为对预测效果和可解释性提供全面评估。

结果显示,梯度增强实现了最高的整体预测表现(97.4%准确率),比随机森林高出3.2个百分点,深度学习模型高出超过6个百分点。这一观察表明,基于集合的学习方法对本研究中包含的结构化医疗数据集尤为有效。CNN和MLP模型性能差异较小表明,仅仅增加模型复杂度并不一定能转化为在评估实验条件下更优的预测表现。
为了展示我们提出的框架在多种医疗分析任务中的实用性,我们在表7中展示了数据集特定的预测表现结果。

数据集特异性分析。
由于特征复杂度、样本量、类别分布和数据模态的不同,性能在不同数据集中存在差异。乳腺癌数据集实现了最高的预测准确性,这很可能得益于其明确的特征可分离性。MIMIC-III和NIH胸部X光数据集的性能略低反映了纵向临床记录和医学影像数据的复杂性。这些发现表明,框架性能受数据集特性和临床背景影响。

数据集准确率(%)精度(%)召回率(%)F1评分(%)
乳腺癌97.497.297.697.1
糖尿病94.293.994.494
模仿三91.39191.591.1
美国国立卫生研究院胸部X光90.890.491.290.6

表7:数据集特异性预测表现结果。
拟议的可解释人工智能框架在四个代表性医疗数据集上的预测性能。准确性、精度、召回率和F1分数以百分比(%)报告独立测试集。数值越高,分类性能越好。

为评估预测性能,分析了四个机器学习和深度学习模型,分别是梯度增强、随机森林、卷积神经网络(CNN)和多层感知器(MLP),涵盖四个具有代表性的医疗数据集。模型性能通过在独立测试数据集上进行的准确性、精度、召回率、F1分数和ROC-AUC指标评估,采用70:15:15的训练-验证-测试分割和五重交叉验证。通过比较相同预处理和验证条件下的模型特异性评估指标,预测性能的提升得以确定。
为了阐明模型在不同方法上的表现差异, 图4 以图示方式展示了集合、神经网络和深度学习模型的优缺点。

figure-results-1
图4:机器学习与深度学习模型在医疗预测任务中的表现比较。(a) 测试数据集上梯度增强、随机森林、CNN和MLP模型的准确性比较。 (B) 在测试数据集上对梯度增强、随机森林、CNN和MLP模型进行F1分数比较。(C) 在测试数据集上对梯度增强、随机森林、卷积神经网络和MLP模型进行精确比较。(D)回忆测试数据集上梯度增强、随机森林、CNN和MLP模型的比较。数值越高表示预测表现越好。梯度提升在所有评估指标中获得最高整体表现,其次是随机森林。请点击此处查看该图的放大版本。

可解释性表现的解释。
SHAP在评估的可解释性方法中始终获得最高的保真度和稳定性评分,表明生成的解释与底层模型预测之间的一致性更为一致。石灰梅的稳定性相对较低,表明对局部扰动和采样变异性更为敏感。Grad-CAM 为基于图像的模型提供了可直观解释,但其保真度略低于 SHAP。这些发现表明,解释质量既依赖于所选解释技术,也取决于其底层的预测模型架构。

管道中集成的可解释性技术已经过定量和定性评估。具体来说,特征归因方法在不同数据集中能够相当一致地揭示模型的内部逻辑。
研究中考虑的所有方法SHAP在评估的可解释性方法中均达到最高的保真度(0.92)和稳定性(0.89)。简单来说,这些解释非常准确地反映了模型实际预测的内容。局部解释方法是一种窗口,通过它我们可以看到具体的预测,并理解模型作为决策依据的是什么。

可解释性表现通过以人为本评估获得的忠实度、稳定性、理解性和临床医生信任评分进行评估。使用相同的数据集和训练模型比较了SHAP、LIME和Grad-CAM的解释。通过比较所评估解释能力方法的解释质量指标和临床医生评分,评估了可解释性提升。针对图像的深度学习模型的可视化技术本质上是生成热力图,识别与模型预测最相关的图像区域。不同方法间的特征重要性分布和可解释性性能比较见 图5。

figure-results-2
图5:可解释性绩效评估。图中展示了利用保真度和稳定性指标,解释性方法的性能。SHAP在保真度(0.92)和稳定性(0.89)方面领先,这反映了解释与模型预测之间的良好一致性。LIME是单一实例可解释性的最佳工具。另一方面,Grad-CAM输出主要用于影像模型的视觉热图,粗略显示对模型预测负责的最重要区域,从临床角度来看可能非常相关。请点击此处查看该图的放大版本。

在评估预测模型和可解释性技术后,发现模型的准确性与其解释的可靠性之间的相关性非常强。事实上,那些显示预测改进的模型,在正确应用可解释性技术时,也以更稳定和更一致的方式解释结果。集成模型在配合特征归因方法时最易解释,而深度学习模型则更适合基于可视化的可解释方法。将预测准确性与解释可靠性联系起来的联系可见于 图6,图中 详细勾勒了模型与可解释性的概念动态。

figure-results-3
图6:模型比较分析及能力解释方法。图表详细比较了各模型的准确率和能力测量。它包括一个散点图,展示了准确性与解释稳定性之间的相关性,一个表现的表格比较,以及一个适宜性矩阵,概述了不同解释能力方法(SHAP、LIME和Grad-CAM)及其在不同模型类型的有效性。可视化清楚表明,集合模型加上SHAP能提供极佳的可解释性,而深度学习模型则可以通过可视化技术进行解释。 请点击此处查看该图的放大版本。

以人为本的评估确认了该建议系统在医院及其他临床机构的实际应用价值。医学专业人员会审查模型输出,并有无说明。通过展示结果并附带解释,用户的信任度和可理解性大幅提升;平均信托价值从3.1升至4.7(1到5分)。信任评分从3.1提升到4.7,代表了大约51.6%的相对提升。评估者间高度一致(Fleiss' κ = 0.81)进一步表明临床医生对解释有效性的评估一致。这些发现表明,可解释性输出可能提升用户信心,并促进对AI辅助临床决策的解读。专业人士表示,他们对模型输出的理解更好,对AI支持的临床情境判断信任度更高,这表明可解释性在医疗实际实施中的重要性。

我们还通过消融分析进一步验证了框架的稳健性。通过可解释方法被认为至关重要的关键特征被移除,导致预测性能大幅下降。因此,这一发现反映了特征不仅相关,而且对预测任务具有重要意义。此外,解释结果在解释不同输入样本时仅显示可忽略的差异,显示了可解释方法的稳定性和可靠性。

为了验证该管道的实际应用,我们测量了其计算速度。可解释性的引入带来了计算时间的增加,尤其是在归因特征和创建可视化时。尽管如此,总执行时间仍然可行且不算太长。图7 展示了流程不同阶段(如预处理、模型训练、可解释性生成、评估和可视化)之间的计算时间分配。

figure-results-4
图7:流水线执行时间的细分。 该图表展示了计算时间如何分配到可解释人工智能流程的各个阶段,如预处理、模型训练、解释能力创建、评估和可视化。数据显示,大部分时间线被模型训练占据,随后是解释能力处理。另一方面,前期处理和报告所花费的时间相当有限。 请点击此处查看该图的放大版本。

我们还通过消融分析测试了该框架的强度。去除通过可解释性方法发现的关键特征后,预测表现明显下降,这清楚地表明这些特征不仅相关,而且非常重要。此外,即使输入样本略有变化,解释输出也相当稳定,这证明了可解释性技术的一致性和可靠性。

简而言之,通过结合预测性能测量、可解释性和以人为中心的验证,所提出的框架是有效的。该系统不仅预测非常准确,而且高度可解读且易于使用。引入可解释性方法使整个过程透明,同时不影响模型性能。我们看到的预测准确性和可解释性的提升不仅是在严格的实验控制下实现的,而且具有统计学上的显著性,这也说明了该方法的持久性和真实性。在预测模型间进行了成对比较,使用跨交叉验证折叠的配对t检验。梯度增强与竞争模型之间观察到统计学上显著差异(p < 0.05),证实了该配置的优越性。

总体发现。
综合来看,这些结果表明,预测表现、解释质量和临床医生信任度可以在统一且可重复的工作流程中进行评估。该框架在多个医疗数据集中保持稳定性能,同时支持通过SHAP、LIME和Grad-CAM解释实现透明解释。然而,这些发现应结合所选数据集和验证设置进行解释,且在实际部署前仍需额外外部验证。

数据可用性:
我们从公开来源获得了当前研究中使用的数据集,这些数据集可在知名数据库中找到。例如,乳腺癌和糖尿病相关数据可从UCI机器学习存储库下载:https://archive.ics.uci.edu/ml/index.php

可以通过Physio Net获取电子健康记录数据集(MIMIC-III):
https://physionet.org/content/mimiciii/1.4/

胸部X光影像数据来自美国国立卫生研究院胸部X光数据集,可于以下网站找到:https://www.kaggle.com/datasets/nih-chest-xrays/data

我们在本研究中探索的所有数据集均已匿名化并公开。我们在研究期间产生的预处理步骤、训练模型和解释能力输出,如果有合理请求,可以通过通讯作者提供。源代码、预处理脚本、配置文件和可重复性资源将在稿件被接受后存放到公共仓库中。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究开发并评估了一种可重复的可解释人工智能(XAI)医疗分析工作流程,将预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合在单一方案中。结果表明,基于集成的机器学习模型,特别是梯度增强和随机森林,在被评估的结构化医疗数据集中实现了最高的预测性能,而深度学习模型更适合基于图像的分析。这些发现强调了根据数据特性选择模型架构的重要性,而不是假设更复杂的模型总能带来更优越的性能。这项工作的关键贡献是将预测建模、可解释性评估、以人为本的评估和可重复性实践整合到标准化工作流程中。与单独评估可解释性技术的研究不同,本框架提供了一种以方案为驱动的方法,支持在不同医疗数据集中进行透明且可重复的实验。

可解释性分析显示,评估方法之间存在可测量的差异。SHAP在评估的实验条件下取得了最高的保真度和稳定性评分,表明生成的解释与模型预测之间更为一致。LIME提供了有用的局部解释,但稳定性较低,而Grad-CAM则为成像数据生成直观的视觉解释。这些发现表明解释质量取决于所选可解释性方法和其基础预测模型。以人为本的评估进一步表明,解释的纳入提升了临床医生的信任度和可解释性。信任评分的提升和评估者间显著的一致性(Fleiss' κ = 0.81)表明参与者对解释有用性的评估一致。这些发现支持了可解释方法在提升医疗决策支持系统透明度和用户接受度方面的潜在价值。

解读结果时应考虑若干限制因素。首先,该框架使用有限的公开数据集进行评估,可能无法完全反映现实临床环境中遇到的变异性。其次,临床评估参与者人数相对较少,可能限制了推广性。第三,本研究探讨的可解释性方法属于事后技术,因此仍受已知局限性影响,包括对扰动的敏感性以及解释与真实模型推理之间的潜在差异。最后,跨独立医疗机构进行外部验证超出本研究范围。

未来的研究应探讨整合临床记录、医学影像、生理信号和可穿戴传感器数据的多模态医疗分析。还需要进一步工作以评估因果和反事实解释方法、不确定性量化、公平性评估、校准分析以及前瞻性临床验证。此类研究有望进一步提升可解释人工智能系统在医疗领域的透明度、可靠性和适用性。

除了性能评估外,还应考虑若干实际实施挑战和协议修改,以确保所提可解释人工智能框架在多样化医疗环境中的稳健部署。

可解释性方法的局限性

SHAP、LIME 和 Grad-CAM 虽然提供了关于模型行为的有用见解,但也存在若干缺点。文献中指出,这些工具在重复运行时可能不稳定,对扰动较为敏感,不同数据集存在差异,有时甚至无法准确反映模型的真实原因。因此,事后解释应仅被视为补充证据,而非因果决策机制的实际描绘。在解释能够被高度影响的临床环境中应用之前,对解释可信度进行适当验证仍是非常重要的一步。

这也与近期生物医学人工智能研究的发现一致,该研究强调在临床应用前必须解释可靠性验证的必要性。可解释性的融入被用作心脏骤停预测系统验证的关键方面,使其更透明并赢得临床预测的信任(41)。同样,利用可视化驱动的可解释性技术进行肝脏超声图像分割,旨在提高解释性,同时忽视事后解释有限的事实。这些论文证实了解释一致性检查、解释鲁棒性测试以及临床有意义的可解释性验证对于达到最高临床使用准备水平的必要条件。

校准、公平性、鲁棒性与外部推广

拟议框架的未来版本将包括通过校准曲线和Brier评分评估概率校准,利用贝叶斯和基于集成的方法估计不确定性,对人口统计子群进行公平性审计,以及在噪声数据和变化领域条件下进行鲁棒性检查。这些分析在医疗环境中尤为重要,因为模型置信度、公平表现和在不断变化的临床环境中的可靠性直接影响患者安全和临床采纳。近期AI驱动的科学框架同样强调了可信、透明和可靠的决策支持系统的重要性,超越了传统的预测性绩效评估。近期人工智能驱动的科学框架同样强调了可信、透明和可靠的决策支持系统的重要性,超越了传统的预测绩效评估 43

故障排查与协议修改

为了成功推广拟议的可解释人工智能框架,需要考虑若干实际问题。一个典型问题是过拟合,例如在相对较小的医疗数据集上训练深度学习模型时。通过应用交叉验证、提前停止、退出正则化、数据增强和彻底的超参数优化,可以减少过拟合。在训练中观察验证性能是避免模型复杂且泛化能力差的好方法。

医疗数据集中另一个非常重要的问题是类别失衡,即积极的临床结果远少于负面病例。为了解决这一问题,分层抽样、类别权重调整、合成少数族裔过度抽样以及使用如F1分数和ROC-AUC等平衡评估指标,应成为建模流程的一部分。忽视阶级不平衡可能导致绩效指标无法真正代表模型,临床预测也可能存在偏见。

医学影像数据集通常并不完美,可能会被噪声、采集伪影、质量不稳定等影响。这些因素也因成像设备类型而异。这些因素可能对预测表现产生负面影响,也会影响可解释性输出。因此,应采用标准化的预处理步骤、图像归一化、质量控制检查和数据增强技术,以实现模型的鲁棒性和可靠性。

SHAP使得推导出高度信息丰富的特征归因解释成为可能。然而,不稳定性的发生不能被排除,尤其是在高度相关特征存在或模型结果对输入数据微小变化极为敏感时。为增强解释的一致性和可靠性,建议多次编写解释、评估多次运行中的稳定性、使用特征分组策略,并与其他可解释性方法如LIME进行检查。

在大规模医疗数据和庞大的深度神经网络架构中,GPU内存限制可能成为主要限制之一。通过批量大小调整、混合精密训练、模型修剪、降低特征维度以及采用高效数据加载,内存需求可以大幅降低。此外,在低资源系统上部署该框架的研究人员可能会考虑使用云计算环境或分布式训练。

该框架的模块化设计使得针对不同医疗应用可以轻松进行修改。根据临床任务的不同,科学家可以更改一个或多个单独的预测模型,增加新的解释方法,将不同类型的医疗数据结合使用,或在不改变整体工作流程的情况下加入不确定性量化和校准模块。这种灵活性使该框架能够在非常不同的医疗分析案例中使用,同时保持可重复性和可解释性。

监管与伦理考量:

让人工智能系统更易理解,在医疗领域会有很大帮助。但这还不够。监管机构的规定要求透明度、问责制、隐私和患者安全,必须得到遵守。即使可解释性能提升信任度和可解释性,单靠解释性也无法保证临床有效性。负责任的实施需要前瞻性的临床验证、公平性评估、监管审查以及部署后的监控。此外,未来部署该框架时应考虑患者隐私、临床医生监督以及跨人口群体的公平绩效。为了融入现实临床工作流程,人工智能系统与医疗专业人员必须无缝协作。因此,可解释性信息应成为当前电子健康记录和临床决策支持平台的一部分,而非仅能独立运作的工具。最终选择必须由医生做出,而可解释人工智能仅是一种辅助技术,提升透明度,支持基于证据的推理,并使医护人员与患者之间的沟通更加便捷。

本文提出了一个可重复的方案,用于开发、评估和解释医疗分析中可解释的人工智能系统。该贡献以方法论和工作流程为导向,为研究人员和临床医生提供了一个标准化框架,可复制、调整和扩展到多个医疗应用领域。它将数据预处理、预测建模、可解释性方法和性能评估等多个方面统一结合在一起。该方法论在多个医疗数据集中展现出强劲的预测性能。在结构化数据分析方面,模型集合表现最佳,而深度学习模型在医学影像任务中被发现非常有效。此外,使用解释技术也使用户更容易理解模型,因为它提供了预测结果的全局和局部解释。因此,这不仅提升了临床医生的信任度,也提升了模型的可用性。研究结果表明,可解释人工智能可以支持开发透明且可解释的医疗分析系统,在模型的准确性和可解释性之间找到折中,而这些对可靠和值得信赖的医疗分析至关重要。因此,这里提出的方法是一种非常有效且直接的医疗数据分析工具,可以帮助医疗专业人员使用他们信任的人工智能技术。本文提出了一个可重复的协议,用于开发、评估和解释医疗分析中可解释的人工智能模型。通过将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合在统一的工作流程中,该协议为透明的医疗人工智能研究提供了实用框架。该工作流程可适应多样化的医疗数据集和应用领域,支持可重复的实现、评估和报告可解释机器学习系统。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明他们与本研究无任何财务利益冲突或利益冲突。该研究独立进行,没有任何可能被视为潜在利益冲突的商业或财务关系。

人工智能使用披露

在稿件准备过程中,使用了人工智能工具进行语言优化、语法检查和编辑协助。所有科学内容、实验设计、数据分析、解释和最终稿件核对均由作者完成。作者审查并验证了所有AI辅助产出,以确保准确性、完整性并符合期刊指南。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者们感谢各自机构为开展本研究提供了必要的基础设施和研究支持。作者还承认,公开数据集和开源工具的使用促进了拟议可解释人工智能框架的开发与评估。特别感谢在以人为本的评估阶段提供宝贵见解的领域专家。

材料

本文使用的材料清单
姓名公司目录编号评论
GPU工作站制造商依赖训练深度学习模型
Jupyter NotebookProject Jupyter最新稳定版本交互式实验执行
LIMELIME版本0.2.0局部可解释性解释
MatplotlibMatplotlib项目版本3.9数据可视化
MIMIC-III数据库PhysioNet版本1.4电子健康记录分析
NIH胸部X光数据集NIH临床中心公共数据集胸腔疾病分类
NumPyNumPy开发者版本1.26数值计算和数组操作
OpenCVOpenCV基金会版本4.10图像预处理
PandasPandas开发团队版本2.1数据操作和预处理
皮马印第安人糖尿病数据集UCI机器学习存储库公共数据集糖尿病风险预测
Python 3.11Python软件基金会版本3.11主编程环境
Scikit-learnscikit-learn版本1.5机器学习算法和评估
SeabornSeaborn版本0.13统计可视化
SHAPSHAP版本0.46特征归因和可解释性
TensorFlowTensorFlow版本2.15深度学习模型开发
Windows / Ubuntu LinuxMicrosoft / Canonical操作系统
威斯康星乳腺癌数据集UCI机器学习存储库公共数据集乳腺癌诊断

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

EngineeringExplainable Artificial Intelligence XAIMachine learningdeep learningModel InterpretabilityClinical Decision Support SystemsReproducible Experimental Protocol

相关文章