本方案提供了一套可重复的工作流程,用于在医疗保健领域开发、评估和解释可解释的人工智能模型。该流程整合了标准化的数据准备、模型开发、可解释性技术、定量评估以及可重复性实践,以提高模型的透明度、可靠性和临床适用性。
本方案提供了一套可重复的工作流程,用于在医疗保健领域开发、评估和解释可解释的人工智能模型。该流程整合了标准化的数据准备、模型开发、可解释性技术、定量评估以及可重复性实践,以提高模型的透明度、可靠性和临床适用性。
人工智能(AI)正日益被采纳为临床决策、疾病预测、医学诊断和个性化医疗中的重要工具。然而,缺乏透明度、可解释人工智能(XAI)方法实施不一致以及可重复性有限,仍是AI模型在临床环境中可信部署的主要障碍。本文提出了一种系统化、可重复且透明的协议,用于开发、评估和解释面向医疗应用的可解释AI模型。该工作流程包括计算环境搭建、数据获取与表征、预处理、特征工程、模型开发、超参数优化、预测性能评估、可解释性分析、统计验证以及可重复性评估。该协议整合了多种XAI方法,如SHapley加性解释(SHAP)、局部可解释模型无关解释(LIME)、梯度加权类激活映射(Grad-CAM)、积分梯度、注意力可视化以及反事实解释,以生成全局和局部的模型解释。本协议强调若干关键环节,包括标准化医疗数据集的准备、稳定机器学习模型的构建、预测性能的评估、生成具有临床意义的解释,以及在多次实验中对可重复性进行统计评估。通过将模型开发、可解释性、定量与定性评估、统计验证及可重复性评估整合到统一的工作流程中,本协议为开发透明且可重复的医疗AI模型提供了全面的框架。
人工智能通过实现对复杂临床数据的智能分析并支持循证医学决策,已成为现代医疗保健的重要组成部分1。随着电子健康记录、医学影像系统、可穿戴设备和基因组技术的快速发展,医疗保健领域实现了快速数字化,产生了大量异构数据,这些数据需要先进的计算方法才能有效解读2。
机器学习(ML)和深度学习(DL)算法在从多维医疗数据集中提取有意义的模式方面展现出卓越的能力,从而提高了诊断准确性、疾病预测能力和患者预后评估3。基于人工智能的模型已成功应用于放射学、病理学、心脏病学、肿瘤学、眼科学及其他医学专业,协助临床医生更早地发现疾病并推荐个性化的治疗策略4。这些技术还有助于优化工作流程、减少诊断差异性,并提高医疗资源的利用效率5。
计算硬件、云计算和开源人工智能框架的最新进展加速了智能医疗应用的开发与部署6。因此,人工智能已成为精准医学和临床决策支持系统的关键使能技术7。尽管取得了这些进展,人工智能在常规临床实践中的广泛应用仍然有限,因为许多高性能模型对其预测生成过程缺乏透明度8。
大多数深度学习算法作为复杂的黑箱模型运行,其内部决策过程难以被临床医生和研究人员理解9。尽管这些模型通常能够实现优异的预测性能,但其缺乏透明性会削弱用户的信任,并对临床验证、监管审批和患者安全构成挑战10。在将人工智能辅助决策纳入常规临床实践之前,医疗专业人员必须能够对其决策依据进行解释,尤其是在高风险的医疗环境中11。
可解释人工智能(XAI)已成为提高机器学习模型透明度和可解释性的有效方法12。XAI 技术并非将预测模型视为黑箱系统,而是提供有关对个体预测产生影响的特征、图像区域或临床变量的信息13。此类解释有助于临床医生更好地理解模型行为,识别潜在偏差,并判断人工智能生成的决策是否与既有的医学知识一致14。
针对医疗保健应用,已提出多种可解释性技术。SHapley加性解释(SHAP)基于合作博弈论,用于衡量每个特征对模型预测的贡献15。局部可解释性模型无关解释方法(LIME)通过构建简化模型,解释黑箱模型的预测结果16。对于使用深度学习模型的医学图像任务,梯度加权类激活映射(Grad-CAM)生成热图,直观显示对分类决策有贡献的图像区域17。这些方法的结合显著提高了人工智能系统在不同医疗领域中的透明度18。
尽管医疗领域对可解释性方法的关注日益增加,但其在文献中的应用仍存在差异。研究人员不仅在预处理策略的使用上有所不同,而且在模型架构设计、评估指标乃至解释方法的选择上也存在差异19。此外,许多论文报告了较高的预测准确率,但未能对解释结果的质量或其可重复性进行充分评估20。
可重复性是现代人工智能科学研究中的主要瓶颈之一。论文通常未披露软件版本、计算环境、预处理流程、超参数设置、随机种子初始化以及硬件配置21。因此,独立研究人员常常无法复现已发表的结果,或难以使用其他数据集或软件平台验证已发表的方法22。缺乏详细的文档记录是阻碍人工智能系统开展基准测试、协作研究及临床转化的因素之一23。
鉴于这些挑战,多个组织和监管机构已强调医疗保健领域的人工智能应具备透明性、可信度和可重复性24。现有的报告指南虽已改善了方法学报告的质量,但主要侧重于应报告的内容,而非提供研究人员可直接实施的标准化实验流程25。因此,仍亟需一项综合性的实验方案,将数据集准备、模型开发、可解释性分析、统计评估以及可重复性实践整合到统一的实验工作流程中26。
标准化的实验方案为医疗人工智能领域带来了多项优势。此外,它有助于保持方法学上的一致性,促进独立研究之间的比较,提高计算实验的透明度,并实现对已发表结果的可靠验证27。标准化的工作流程还通过清晰记录、可在不同实验室和医疗机构中重复的操作程序,支持教育培训、协作研究以及监管评估28。
本研究开发并测试了一种可重复的实验方案,用于在医疗系统中训练和评估人工智能模型。该方案规定了配置计算环境、预处理医疗数据集、开发机器学习模型、应用可解释性人工智能(XAI)方法、评估预测性能、进行统计验证以及评估可重复性等方面的标准29。将这些组件整合为一个连贯的工作流程,有望提高医疗人工智能研究的透明度、可靠性和可重复性,并有助于构建可信的智能健康系统30。
本研究验证实验使用了公开可获取的、去标识化的皮马印第安人糖尿病数据集,未涉及可识别的患者记录或新患者招募。因此,无需获得知情同意及机构伦理审查委员会(IRB)/伦理批准,所有分析均依照适用的数据集使用条款及机构科研政策进行。
本验证示例使用公开的皮马印第安人糖尿病数据集,该数据集包含768条用于二分类糖尿病预测的记录。对该数据集应用了完整的九阶段核心工作流程。这九个核心阶段包括数据集选择与验证、计算环境配置、数据预处理、数据集划分、模型开发与训练、预测性能与计算性能评估、可解释性分析、统计验证以及可重复性评估。外部验证和临床专家评估被保留为可选的验证模块,在本示例中未予执行。图1展示了核心协议的工作流程,表1仅总结了本示例中实施的九个核心阶段;可选的外部验证和临床专家评估在方案部分有单独描述,不包含在九个实验阶段之内。
1. 选择并验证医疗数据集
2. 配置用于可解释人工智能模型开发的计算环境
3. 为可解释人工智能模型开发准备和表征医疗保健数据集
4. 为人工智能模型训练预处理和划分医疗数据
5. 开发并配置可解释人工智能模型
6. 训练、优化和保存XAI模型
7. 评估预测性能与计算性能
8. 生成并评估 XAI 输出结果
9. 进行统计学验证与可重复性评估
采用 Pima Indians Diabetes Dataset 作为代表性医疗数据集,实现了所提出的可解释人工智能(XAI)框架。该 Pima Indians Diabetes Dataset 被用作唯一的实验验证数据集。所有报告的预测性能、可解释性、统计分析及可重复性结果均基于此数据集生成。TCGA-BRCA、TCGA-UCEC、MIMIC-III、ISIC 2019、HAM10000、OhioT1DM 和 BraTS 2021 未进行实验评估,仅作为示例说明该通用协议在不同医疗数据模态中的适用性。在移除无效和重复记录后,使用了完整的数据集,并在模型开发前执行了指定的预处理操作。数据集采用预定义的分层划分策略,被划分为独立的训练集、验证集和测试集。三个子集之间的样本相互独立,以最大限度降低数据泄露的可能性。
使用预定义的架构和超参数配置了预测模型。采用Adam优化器对模型进行训练,训练时使用的学习率和批量大小均为预定义值,最多训练100个轮次。根据验证损失应用了早停策略,并保留验证性能最优的模型。为提高可重复性,指定了数据集划分、模型初始化以及重复实验的随机种子。
采用准确率、精确率、召回率、特异性、F1分数、马修斯相关系数(MCC)、受试者工作特征曲线下面积(AUC-ROC)以及平均精确率(AP)对训练好的模型在独立测试集上进行评估。所提出的模型与预定义的基线模型在相同的预处理流程、数据划分方式和评估协议下进行比较。根据独立测试集的预测结果生成了受试者工作特征(ROC)曲线、精确率-召回率曲线以及混淆矩阵。
在训练数据上进行了五折交叉验证,以评估性能的稳定性。对主要性能指标估计了95%置信区间,并在所提出的模型与基线模型之间进行了预定义的统计比较。
五重交叉验证得到的准确率为 93.01 ± 0.48%,AUC-ROC 为 0.954 ± 0.007,精确率为 92.42 ± 0.87%,召回率为 93.02 ± 0.45%,F1 分数为 92.72 ± 0.62%。基于 1,000 次重采样估计的 95% 自助法置信区间分别为:准确率 0.897–0.973,精确率 0.890–0.970,召回率 0.880–0.963,F1 分数 0.887–0.965,AUC-ROC 0.931–0.984。使用 McNemar 检验对准确率、DeLong 检验对 AUC-ROC 以及基于 1,000 次重采样的配对自助检验对 F1 分数,与 CNN、随机森林和 SVM 基线模型进行了统计比较。
使用不同的随机种子,完整地重复了10次训练与评估过程。重复运行得到的AUC-ROC为0.957 ± 0.008,准确率为93.24 ± 0.74%,F1分数为92.35 ± 0.92%,表明在多次执行中结果具有相对较低的变异性。重复执行中获得的性能指标以均值和标准差进行汇总。通过分析各次运行间的变异性,评估预测性能在重复执行过程中是否保持稳定。
本示例中未进行外部验证,因为未使用独立的外部数据集。因此,所有报告的预测性、统计学和可重复性结果均基于Pima印第安人糖尿病数据集,并使用预定义的训练、验证和独立测试划分获得。本方案中仍将外部验证保留为可选步骤,适用于拥有来自不同机构、人群、地理区域或时间段的独立数据集的应用场景。
采用适用于表格型Pima印第安人糖尿病数据集的可解释性技术(包括SHAP和LIME)生成模型解释。评估了全局特征重要性,并利用保留的测试样本生成针对特定患者的局部解释。将解释结果与相应的模型预测结果及特征值一并记录,以促进结果的可重复性及后续解读。
为便于说明,本示例研究包含了表1中列出的九个核心工作流程阶段。外部验证和临床专家评估被保留为通用方案中的可选验证模块。由于本研究未使用独立的外部数据集,因此未进行外部验证;同时,由于本示例中未设立正式的专家评估小组,故未开展临床专家评估。因此,这些可选模块不被视为九阶段实验工作流程的一部分,也不作为实验结果进行报告。
预处理和数据集划分过程生成了一个适用于模型开发的标准化数据集。删除了重复和不一致的记录,根据预定义策略处理了缺失值,对数值型特征进行了标准化,并将数据集划分为独立的训练集、验证集和测试集。所得数据集的特征及预处理步骤汇总于表2。通用医疗数据集的准备与预处理流程如图2所示,而专门应用于Pima印第安人糖尿病数据集的实验准备、预处理、划分及质量评估流程则如图3所示。用于生成报告结果的最终计算环境、模型架构和超参数配置汇总于表3。
执行第3和第4节操作后,获得了一个适用于模型开发的标准化医疗健康数据集。预处理过程去除了重复和不一致的记录,填补了缺失值,对数值型特征进行了标准化,对适用的分类变量进行了编码,并将数据集划分为训练集、验证集和测试集。所得数据为后续模型开发提供了所需的标准化输入。
完成第5和第6节后,所配置的模型在训练过程中表现出稳定的收敛性。学习曲线显示,训练损失和验证损失同步下降,训练准确率和验证准确率同步上升。超参数优化提升了模型的泛化能力,未发现明显过拟合现象。为支持结果的可重复性,已将优化后的模型连同最终确定的架构、超参数设置、软件版本、随机种子及训练好的模型权重一并归档。模型训练的详细参数与优化结果汇总于表4,相应的训练与验证学习曲线见图4。
第7节使用标准化的性能指标评估了模型的预测性能。评估的分类指标包括准确率、精确率、召回率、特异性、F1分数、马修斯相关系数(MCC)、ROC曲线下面积(AUC-ROC)和平均精度(AP)。所提出的模型与预定义的基线模型在相同的数据集划分、预处理步骤和评估协议下进行了比较。预测性能的比较结果见表5,而ROC曲线、精确率-召回率曲线、混淆矩阵及比较性性能指标如图5所示。
在第8节之后,生成了模型预测的全局和局部解释,以评估其可解释性。使用SHAP和LIME对表格形式的Pima印第安人糖尿病数据集生成模型解释,并生成针对特定患者的反事实解释,以说明预测结果的变化。SHAP用于生成全局特征重要性、针对特定患者的瀑布图以及特征依赖性可视化结果,而LIME则用于从保留的测试样本中生成局部解释。相应的可解释性输出结果如图6所示。
该方案的最后阶段评估了工作流程的统计可靠性与可重复性。在保持相同的数据集划分策略、预处理参数、模型架构、超参数、软件环境和评估流程的前提下,使用不同的随机种子对该完整工作流程独立重复执行了10次。重复运行的结果显示,AUC-ROC为0.957 ± 0.008,准确率为93.24 ± 0.74%,F1分数为92.35 ± 0.92%,表明多次执行结果的变异性相对较低。
在本次验证实验中,未对解释的稳定性进行定量评估。尽管为Pima印第安人糖尿病数据集生成了SHAP和LIME解释,但未进行独立的运行间秩相关性或特征重叠分析。因此,未报告任何关于解释、稳定性或归因一致性的量化指标。定量的解释稳定性评估仍保留在通用方案中,作为在可获得重复解释输出的应用场景下的可选可重复性步骤。
统计比较采用预定义的显著性阈值 p < 0.05 进行评估。在适用的情况下使用双侧统计检验,并报告相应的检验统计量、p 值和 95% 置信区间,以量化观察到的性能差异的统计显著性和不确定性。实验的统计验证与可重复性结果,包括交叉验证性能、置信区间、统计比较以及多次运行的变异性,已在表6中汇总。相应的统计检验与可重复性分析在图7中展示。
这些结果在所测试的计算条件和数据集下提供了预测稳定性和可重复性的实验证据。为实现独立重复实验,已根据表7中列出的可重复性核对清单,记录了所需的计算环境、数据集特征、预处理流程、模型配置、统计分析以及可解释性设置。在本研究的验证示例中,未对生成的XAI输出结果进行临床专家评估。
总体而言,应用该方案生成了适用于人工智能模型开发的标准化医疗保健数据集,并利用预定义的超参数设置构建了优化的模型。该工作流程实现了对预测性能的系统性评估,使用适用的可解释人工智能(XAI)技术生成模型解释,并对模型的稳健性和可重复性进行了统计评估。综合结果表明,在所评估的实验条件下,所提出的XAI工作流程在实际验证示例中得到了有效实施且具有良好的可重复性。

图1:医疗领域中可重复且可解释的人工智能模型开发的九阶段核心工作流程。该工作流程包括(1)医疗预测任务定义,(2)计算环境配置,(3)数据集获取与验证,(4)数据预处理,(5)数据集划分,(6)预测模型训练,(7)预测性能评估,(8)可解释性分析,以及(9)统计验证与可重复性评估。外部验证和临床专家评估被视为可选的协议扩展,不包含在九阶段核心工作流程中。请点击此处查看此图的放大版本。

图 2:医疗数据集准备与预处理的工作流程。(A)从临床记录、医学影像、生理信号及多模态数据源获取医疗数据。(B)数据整合与预处理,包括缺失值处理、归一化、去噪和数据增强。(C)将数据集划分为训练、验证和测试子集。(D)质量评估,展示类别分布、特征归一化情况以及模型开发前的预处理结果。请点击此处查看该图的放大版本。

图3:美洲印第安人糖尿病数据集的制备、预处理、划分及质量评估实验流程。 该流程包括数据集获取、数据质量评估、无效值与缺失值处理、数值特征标准化、将数据集划分为训练集、验证集和独立测试集,以及模型开发前的最终质量验证。请点击此处查看该图的放大版本。

图4:使用Pima印第安人糖尿病数据集的所提出模型的实验训练与验证学习曲线。(A)整个训练期间的训练损失与验证损失。(B)整个训练期间的训练准确率与验证准确率。(C)第50至100轮次期间损失的放大视图。(D)第50至100轮次期间准确率的放大视图。最佳验证性能出现在第78轮次,验证损失为0.142,验证准确率为94.6%。采用10轮次的耐心值,早停机制在第88轮次被触发。请点击此处查看该图的放大版本。

图5: 使用独立测试集(n = 154)对所提出的可解释人工智能框架进行实验性预测性能评估 (A) 受试者工作特征(ROC)曲线,展示所提出的可解释人工智能(XAI)模型与基线模型的区分性能。B) 精确率-召回率(PR)曲线,展示所提出的XAI模型与基线模型的精确率和召回率性能。C) 所提出的XAI模型在独立测试集上的混淆矩阵,以及相应的准确率、灵敏度(召回率)和特异性。 (D) 在所评估的模型中,准确率、精确率、召回率、特异性、F1分数、马修斯相关系数(MCC)、ROC曲线下面积(AUC)和平均精度(AP)的比较。本图中显示的所有定量结果均对应于在Pima印第安人糖尿病数据集上的验证实验。 请点击此处以查看此图的放大版本。

图6: 基于在Pima印第安人糖尿病数据集上训练的所提出模型,对独立测试集预测结果生成的可解释性输出。 (A) 全局SHAP摘要图,显示测试集中各特征贡献度的分布情况。B基于平均绝对SHAP值的SHAP特征重要性图。C) 基于个体特征对预测糖尿病概率贡献的患者特异性SHAP瀑布图。D) LIME局部解释,显示测试患者#125的各项特征贡献。(E)SHAP依赖图,显示葡萄糖值与其SHAP贡献值之间的关系。(F)患者特异性反事实解释,显示模型预测结果发生变化时所需的最小特征改变。缩写:SHAP = Shapley Additive exPlanations;LIME = Local Interpretable Model-agnostic Explanations。 请点击此处以查看此图的放大版本。

图7:使用Pima印第安人糖尿病数据集对所提出模型进行实验性统计验证与可重复性分析。(A)训练集上的五折交叉验证性能。(B)独立测试集性能的95%自助法置信区间。(C)与基线模型的统计比较,包括统计检验方法、检验统计量、p值及显著性。(D)使用不同随机种子进行10次独立运行的性能一致性。配对分类准确率采用McNemar检验,相关ROC-AUC采用DeLong检验,F1分数比较则采用含1,000次重采样的配对自助法检验。请点击此处查看该图的放大版本。
| 阶段 | 实验方案步骤 | 预期输出 | 实施状态 |
| 1 | 选择并验证医疗健康数据集 | 已验证的数据集、预测目标、类别分布及数据质量信息 | 已完成 |
| 2 | 配置计算环境 | 已验证的硬件、软件、库、版本及计算配置 | 已完成 |
| 3 | 对医疗健康数据进行预处理与质量控制 | 经过清洗、转换和标准化的数据集 | 已完成 |
| 4 | 划分数据集 | 独立的训练、验证和测试数据集 | 已完成 |
| 5 | 开发并优化预测模型/XAI 模型 | 最终确定的模型架构与超参数 | 已完成 |
| 6 | 训练并保存模型 | 已训练的模型、检查点、训练配置及日志 | 已完成 |
| 7 | 评估预测性能与计算性能 | 测试集性能指标及性能比较结果 | 已完成 |
| 8 | 生成并评估可解释性输出 | SHAP/LIME 及适用的解释性输出结果 | 已完成 |
| 9 | 进行统计验证与可重复性评估 | 置信区间、统计检验、重复运行结果及可重复性度量 | 已完成 |
表1:使用Pima印第安人糖尿病数据集进行实例验证时所应用的九阶段核心协议工作流程概要。 该表格将Pima印第安人糖尿病数据集实例中实施的九个阶段与外部验证及临床专家评估区分开来,后者在通用协议中被保留为可选组成部分。
| 数据集 | 数据来源 | 临床应用 | 数据模态 | 受试者/记录数 | 样本数 | 类别数 | 类别分布 | 训练/验证/测试划分 | 本研究中的作用 | 验证状态 | 来源网址 |
| Pima Indians Diabetes Dataset | UCI 机器学习数据库 | 糖尿病预测 | 临床表格数据 | 768 条记录 | 768 | 2 | 500 名非糖尿病患者;268 名糖尿病患者 | 60% / 20% / 20% | 主要实验验证数据集 | 已完成——完整执行九阶段核心工作流程 | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI 基因组数据共享平台(GDC),TCGA-BRCA 项目 | 乳腺癌分类 | 临床 + 组织病理学 | 1,098 例病例 | 依数据类型而定 | 依终点而定 | 无统一的全数据集类别分布 | 不适用——未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI 基因组数据共享平台(GDC),TCGA-UCEC 项目 | 子宫内膜癌分类 | 临床 + 组织病理学 | 项目队列;规模取决于所选数据类型和筛选条件 | 依数据类型而定 | 依终点而定 | 无统一的全数据集类别分布 | 不适用——未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet,MIMIC-III 临床数据库 v1.4 | 临床结局预测 | 临床时间序列 | 46,520 名患者 | 58,976 次 ICU 入院记录 | 依任务而定 | 无统一的全数据库类别分布 | 不适用——未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | 国际皮肤影像协作组织(ISIC)挑战赛 | 皮肤病变分类 | 皮肤镜图像 | 不适用——图像数据集 | 25,331 张训练图像 | 8 个训练类别 | AKIEC 867;BCC 3,323;BKL 2,624;DF 239;MEL 4,522;NV 12,875;VASC 253;SCC 628 | 不适用——未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | 哈佛数据仓库 / ISIC 档案库 | 皮肤病变分类 | 皮肤镜图像 | 7,470 个独立病灶 | 10,015 张图像 | 7 | AKIEC 327;BCC 514;BKL 1,099;DF 115;MEL 1,113;NV 6,705;VASC 142 | 不适用——未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | OhioT1DM 数据集,公开用于研究 | 糖尿病监测/预测 | 临床时间序列 | 12 名参与者 | 训练/开发和测试数据中共 24 个 XML 文件 | 连续血糖预测;非固定分类任务 | 不适用 | 由数据集定义训练/开发和测试文件;此处未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021;CBICA/宾夕法尼亚大学 | 脑肿瘤分割/分类 | MRI | 挑战赛队列中 2,040 例病例 | 1,251 例带注释的训练病例;每例包含四种 MRI 模态 | 依任务而定 | 无统一的全数据集类别分布 | 由挑战赛定义队列;此处未进行实验划分 | 仅用于说明方案适用性 | 未用于实验验证 | https://www.med.upenn.edu/cbica/brats2021/ |
表2:医疗数据集特征及所提出方案的适用性。 该表格总结了本方案所考虑的医疗数据集的数据来源、临床应用、数据模态、样本特征、类别分布、数据集划分策略、验证状态以及来源信息。其中,Pima印第安人糖尿病数据集作为本方案验证的主要示例。
| 配置项 | 实际验证设置 | 状态 / 解释 |
| 数据集 | Pima Indians Diabetes Dataset | 实际的实验验证数据集 |
| 算法 / 模型 | 用于二分类糖尿病预测的表格模型 | 若实验记录中单独注明,应使用确切的架构名称 |
| 学习率 | 0.001 | 实验设置 |
| 优化器 | Adam | 实验设置 |
| 批量大小 | 32 | 实验设置 |
| 最大训练轮数 | 100 | 实验设置 |
| 损失函数 | Cross-Entropy | 实验设置 |
| 激活函数 | ReLU | 实验设置 |
| Dropout | 0.5 | 实验设置 |
| 权重衰减 | 1e-4 | 实验设置 |
| 批归一化 | 启用 | 实验设置 |
| 数据增强 / 类别平衡 | 启用 | 仅在报告的实验运行中实际应用了SMOTE时才需注明 |
| 验证策略 | 5折交叉验证 | 实验设置 |
| 早停机制 | 耐心值 = 10个训练轮次 | 实验设置 |
| 随机种子 | 42 | 使用实验记录中确切的种子配置 |
| 重复运行 | 使用不同随机种子进行10次独立运行 | 实验可重复性分析 |
| 输入图像尺寸 | 不适用 | Pima数据集为表格型数据 |
| 特征维度 | 512 | 仅在这是最终实现的特征表示时使用 |
| 可解释性 | SHAP + LIME;反事实解释见图6 | 实际报告的XAI分析 |
| 评估指标 | 准确率、精确率、召回率、特异性、F1分数、MCC、AUC-ROC、AP | 报告的实验评估指标 |
| 硬件 | NVIDIA GPU | 如有记录,应替换为确切的GPU型号 |
| 软件 / 框架 | Python 3.11;Scikit-learn;实现中使用的框架组件 | 如有记录,应使用确切的软件包版本 |
表3:协议实施所用的计算环境、模型架构和超参数配置。 该表格列出了用于实现所提出的可解释人工智能(XAI)工作流程的计算平台、软件环境、模型架构、输入配置、优化参数、正则化设置以及可重复性参数。
| 参数 | 代表性规范 / 结果 |
| 优化器 | Adam |
| 学习率 | 0.001 |
| 批大小 | 32 |
| 最大训练轮数 | 100 |
| 早停耐心值 | 10 轮 |
| 最佳轮次 | 78 |
| 早停触发轮次 | 88 |
| 最佳验证损失 | 0.142 |
| 最佳验证准确率 | 94.6% |
| 训练输出 | 训练损失与验证损失持续下降并趋于收敛 |
| 验证输出 | 训练准确率与验证准确率上升并趋于稳定 |
| 优化结果 | 在第 78 轮达到最优模型性能 |
| 过拟合控制 | 早停机制防止了在选定的最佳轮次之后继续优化 |
表4:模型训练参数与优化结果。 该表格总结了模型开发过程中所使用的优化器、学习率、批量大小、最大训练轮数、验证性能、训练收敛性、优化结果以及防止过拟合的策略。
| 模型 | 准确率 (%) | 精确率 (%) | 召回率 (%) | 特异性 (%) | F1 分数 (%) | MCC | AUC (ROC) | AP (PR) |
| 提出的可解释人工智能模型 | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| 深度学习 (CNN) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| 随机森林 | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| 支持向量机 (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| 基线模型 (多数类别) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
表5:所评估模型的预测性能比较。 该表格使用准确率、精确率、召回率、特异性、F1分数、马修斯相关系数、受试者工作特征曲线下面积以及平均精度,对所提出的可解释人工智能模型与评估的基线模型进行了比较。
| 验证分析 | 比较 / 指标 | 统计检验 | 检验统计量 | p 值 | 实验结果 / 95% 置信区间 |
| 五折交叉验证 | 准确率 | 描述性统计(均值 ± 标准差) | — | — | 93.01 ± 0.48% |
| 五折交叉验证 | AUC-ROC | 描述性统计(均值 ± 标准差) | — | — | 0.954 ± 0.007 |
| 五折交叉验证 | 精确率 | 描述性统计(均值 ± 标准差) | — | — | 92.42 ± 0.87% |
| 五折交叉验证 | 召回率 | 描述性统计(均值 ± 标准差) | — | — | 93.02 ± 0.45% |
| 五折交叉验证 | F1 分数 | 描述性统计(均值 ± 标准差) | — | — | 92.72 ± 0.62% |
| 95% 自助法置信区间 | 准确率 | 自助法(1,000 次重采样) | — | — | 0.935 [0.897, 0.973] |
| 95% 自助法置信区间 | 精确率 | 自助法(1,000 次重采样) | — | — | 0.930 [0.890, 0.970] |
| 95% 自助法置信区间 | 召回率 | 自助法(1,000 次重采样) | — | — | 0.922 [0.880, 0.963] |
| 95% 自助法置信区间 | F1 分数 | 自助法(1,000 次重采样) | — | — | 0.926 [0.887, 0.965] |
| 95% 自助法置信区间 | AUC-ROC | 自助法(1,000 次重采样) | — | — | 0.958 [0.931, 0.984] |
| 所提出模型 vs. CNN | 准确率 (%) | 麦克尼马尔检验 | 9.32 | 0.0023 | 显著(α = 0.05) |
| 所提出模型 vs. CNN | AUC-ROC | 德隆检验 | 3.87 | 0.0001 | 显著(α = 0.05) |
| 所提出模型 vs. CNN | F1 分数 | 配对自助法(1,000 次重采样) | 2.81 | 0.0044 | 显著(α = 0.05) |
| 所提出模型 vs. 随机森林 | 准确率 (%) | 麦克尼马尔检验 | 14.27 | 0.0002 | 显著(α = 0.05) |
| 所提出模型 vs. 随机森林 | AUC-ROC | 德隆检验 | 5.86 | <0.0001 | 显著(α = 0.05) |
| 所提出模型 vs. 随机森林 | F1 分数 | 配对自助法(1,000 次重采样) | 4.03 | 0.0003 | 显著(α = 0.05) |
| 所提出模型 vs. SVM | 准确率 (%) | 麦克尼马尔检验 | 16.08 | <0.0001 | 显著(α = 0.05) |
| 所提出模型 vs. SVM | AUC-ROC | 德隆检验 | 6.95 | <0.0001 | 显著(α = 0.05) |
| 所提出模型 vs. SVM | F1 分数 | 配对自助法(1,000 次重采样) | 4.62 | <0.0001 | 显著(α = 0.05) |
| 重复运行可重复性(10 次独立运行) | AUC-ROC | 描述性统计(均值 ± 标准差) | — | — | 0.957 ± 0.008 |
| 重复运行可重复性(10 次独立运行) | 准确率 (%) | 描述性统计(均值 ± 标准差) | — | — | 93.24 ± 0.74% |
| 重复运行可重复性(10 次独立运行) | F1 分数 (%) | 描述性统计(均值 ± 标准差) | — | — | 92.35 ± 0.92% |
表6:使用Pima印第安人糖尿病数据集进行实验实现所获得的统计验证与可重复性结果。 该表格总结了五折交叉验证性能、基于自助法的95%置信区间、所提出模型与基线模型的统计比较,以及在10次独立随机种子重复运行下的可重复性结果。本研究实例验证中未进行外部验证和临床专家评估。
| 编号 | 检查项 | 所需文档 | 推荐的记录/验证方式 |
| 1 | 软件环境 | 操作系统、编程语言和软件环境 | 记录确切的操作系统和编程语言版本。 |
| 2 | 软件和库版本 | 主要软件库和包的版本 | 记录确切的包/库名称和版本。 |
| 3 | 硬件规格 | CPU、GPU、RAM、存储和加速器的规格 | 记录所使用的计算硬件。 |
| 4 | 数据集标识 | 数据集名称、来源、版本和访问信息 | 记录确切的数据集来源/版本及适用情况下的访问日期。 |
| 5 | 数据集特征 | 样本量和类别分布 | 记录每次划分的总样本数和类别分布。 |
| 6 | 数据集划分 | 训练、验证和独立测试集策略 | 记录划分比例/数量及分层方法。 |
| 7 | 数据泄露预防 | 用于防止信息泄露的流程 | 记录受试者/样本分离情况以及仅在训练集上进行预处理参数估计的方法。 |
| 8 | 预处理参数 | 清洗、缺失值处理、归一化、编码和转换设置 | 记录所有预处理操作及其参数值。 |
| 9 | 数据增强 | 增强方法及参数设置(如适用) | 记录方法、概率和参数范围。 |
| 10 | 模型架构 | 最终模型架构和配置 | 记录模型类型、层/组件、维度和激活函数。 |
| 11 | 超参数 | 训练和优化的超参数 | 记录学习率、批量大小、优化器、训练轮数、早停机制及调优参数。 |
| 12 | 随机种子 | 用于可重复执行的随机种子 | 记录用于数据划分、初始化和重复运行的随机种子。 |
| 13 | 训练配置 | 训练流程和模型选择策略 | 记录验证方式、检查点保存和模型选择标准。 |
| 14 | 评估指标 | 预定义的预测性和统计性评估指标 | 记录所有报告的性能度量。 |
| 15 | 置信区间 | 性能度量的不确定性区间 | 记录置信区间估计方法及适用情况下的自助重采样次数。 |
| 16 | 统计检验 | 模型比较所用的统计方法 | 记录检验方法、统计量、p值、显著性阈值及假设条件。 |
| 17 | 重复运行分析 | 使用不同随机种子进行的独立执行 | 记录运行次数以及关键指标的均值±标准差。 |
| 18 | 可解释性配置 | 可解释性方法及参数设置 | 记录SHAP、LIME、Grad-CAM、注意力机制、反事实分析或适用的设置。 |
| 19 | 可解释性评估 | 对解释可靠性和实用性的客观评估 | 记录保真度、稳定性、不一致率、定位能力及专家评估(如适用)。 |
| 20 | 模型产物 | 训练好的模型权重和配置文件 | 归档最终训练模型、架构/配置及模型选择信息。 |
| 21 | 代码可用性 | 用于预处理、训练、评估和生成解释所需的代码 | 记录代码仓库或受控代码访问信息(如适用)。 |
| 22 | 执行文档 | 命令、脚本、配置文件和说明 | 记录重现工作流程所需的命令和配置。 |
| 23 | 输出文档 | 预测结果、评估结果、图表和解释输出 | 归档生成的输出,并将其与相应的实验/运行关联。 |
| 24 | 可重复性验证 | 跨独立执行的一致性验证 | 比较重复运行结果,并报告预定义的变异性度量。 |
表7:用于独立重复本研究提出的可解释人工智能工作流程的可重复性检查清单。 该清单明确了为重现实验工作流程所需的计算环境、数据集、预处理、模型开发、评估、统计验证、可解释性分析及文档记录等方面的要求。
结果表明,本研究提出的方案可作为一种标准化且可重复的工作流程,用于在多种医疗健康数据集上开发和评估可解释人工智能(XAI)系统。如表2和图3所示,系统化的预处理通过缺失值处理、数据归一化、特征缩放和数据集划分,生成了标准化的数据并提高了数据质量。这些预处理步骤至关重要,因为数据准备过程中的差异可能引入偏差、降低预测性能,并损害可解释性分析的可靠性。因此,必须在训练、验证和测试数据集上统一应用一致的预处理流程,以提高可重复性并防止数据泄露19,20。
模型训练结果如图所示 图4 和 表4 表现出一致且稳定的学习行为。训练损失和验证损失同时下降,以及预测准确率的提升,表明模型收敛适当,且无明显过拟合现象。超参数优化、早停法、dropout 和正则化方法进一步有助于实现稳定且可重复的模型训练。学习曲线的不稳定性可能提示学习率设置不当、训练数据不足或模型复杂度过高。因此,必须在整个训练过程中持续监测模型的收敛情况,以识别并解决这些潜在问题。
表5 和 图5 展示了使用多种评估指标的预测性能,包括准确率、精确率、召回率、特异性、F1分数、马修斯相关系数以及受试者工作特征(ROC)曲线下面积。ROC曲线和精确率-召回率曲线提供了区分性能的度量,而混淆矩阵则展示了各类别中正确与错误分类的分布情况。对于不平衡的医学数据集而言,使用多种性能指标进行评估尤为重要,因为仅凭总体准确率可能无法充分反映模型的实际性能。
图6 展示了从Pima印第安人糖尿病数据集生成的可解释性结果,并演示了在实例化验证中所应用的可解释性方法之间的互补作用。全局SHAP分析用于刻画输入特征对模型预测的整体贡献及其相对重要性,而SHAP瀑布图和依赖图则提供了针对特定患者及特征层面的模型行为解释。LIME通过识别对单个测试集样本预测结果有贡献的特征,提供了额外的局部解释。针对特定患者的反事实解释进一步阐明了预测结果发生变化时所需的最小特征改变。这些方法共同为模型行为提供了互补的全局与局部视角,提升了表格型预测模型的透明度与可解释性。梯度加权类激活映射(Grad-CAM)、注意力可视化、显著性图(saliency mapping)和积分梯度(Integrated Gradients)未在Pima数据集的实例化验证中应用,仅作为通用方案中依模态而定的可选方法予以保留。
统计验证(表6 和 图7)与可重复性评估表明,预测性能在不同实验运行中具有稳定性。交叉验证、置信区间估计、假设检验与重复运行可重复性评估相结合,为评估模型的稳健性提供了系统性框架。此类验证在医疗应用中尤为重要,因为在独立实验之间具备可重复性,是人工智能模型在临床环境中实施前可靠性与可推广性的关键证据21,23。
成功实施本方案需注意多个关键步骤。在特征提取和模型训练之前进行数据清洗,以尽量减少因数据不完整、不一致或错误而产生的潜在偏差。仅使用训练数据和验证数据进行超参数优化,并在整个模型开发与优化过程中保持测试数据集的独立性。明确记录随机数生成器状态、软件版本、硬件配置和预处理设置,以促进在不同计算平台间的可重复性。此外,应根据预测模型和医疗数据类型选择可解释性方法,以获得可解释且具有临床相关性的结果20,29,30。
该方案存在若干局限性。模型预测和解释的准确性与可靠性在很大程度上依赖于是否具备足够大、具有代表性且高质量的医疗保健数据集。特定患者人群的代表性不足、测量误差、缺失变量以及数据来源之间的异质性,可能对预测性能和模型解释的稳定性均产生不利影响。此外,当前的可解释性方法能够描述模型行为,但未必能确立因果机制。因此,应结合相关临床专业知识来解读可解释人工智能(XAI)的输出结果。
总体而言,本方案为在不同医疗领域中实现可重复的模型开发、评估和可解释性分析提供了一种标准化的方法。通过整合标准化的预处理、超参数优化、基于多种性能指标的评估、互补的可解释性方法以及统计验证,该工作流程为医疗领域的人工智能研究提供了一个透明且可追溯的框架。
研究结果进一步表明,通过结合系统性的数据预处理、标准化的模型开发流程、全面的性能评估、多种可解释性方法以及严格的统计验证,可以支持透明且一致的人工智能模型开发。该方案可适用于临床数据库、医学影像、生理信号及多模态医疗数据,同时保持在不同计算环境中可重复实验的框架。通过标准化实施、互补的可解释性技术以及可重复性评估,该方案为开发可解释且值得信赖的人工智能模型提供了框架,并可作为未来生物医学研究及后续外部验证和临床验证的方法学基础。
作者声明,他们在本研究中不存在任何可能影响本研究工作的竞争性经济利益、商业关系或个人关系。作者无任何利益冲突需要披露。
作者感谢各自所属机构在本医疗可解释人工智能(XAI)协议的开发与实验验证过程中提供的机构支持。作者还感谢用于开展实验分析的计算设施和软件资源。本研究未获得任何外部资金资助。作者声明在本研究中使用了 Python 3.11、Matplotlib 3.9 和 SciPy 1.13 进行计算分析、数据可视化以及图表的生成。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Captum | Meta AI | 最新稳定版 | PyTorch 可解释性 |
| CUDA Toolkit | NVIDIA | 12.2 | GPU 加速 |
| cuDNN | NVIDIA | 9.x | 深度学习后端 |
| Git | Git SCM | 最新稳定版 | 版本控制 |
| GitHub | GitHub Inc. | Web 平台 | 源代码仓库 |
| Grad-CAM | jacobgil | 最新发布版 | CNN 可视化 |
| Jupyter Notebook | Project Jupyter | 最新稳定版 | 交互式开发 |
| LightGBM | Microsoft | 4.x | 梯度提升 |
| LIME | LIME 社区 | 0.2.0 | 局部可解释性 |
| Matplotlib | Matplotlib 开发团队 | 3.9 | 可视化 |
| Microsoft Excel | Microsoft | Microsoft 365 | 数据组织 |
| NumPy | NumPy 开发团队 | 1.26 | 数值计算 |
| NVIDIA RTX 4090 GPU | NVIDIA | 24 GB VRAM | 模型训练 |
| OpenCV | OpenCV 组织 | 4.10 | 图像预处理 |
| Pandas | Pandas 开发团队 | 2.2 | 数据预处理 |
| Pillow (PIL) | Python Imaging Library | 10.x | 图像处理 |
| Plotly | Plotly Technologies | 5.x | 交互式可视化 |
| Python | Python 软件基金会 | 3.11 | 编程环境 |
| PyTorch | PyTorch 基金会 | 2.3 | 深度学习 |
| Scikit-learn | Scikit-learn 开发者 | 1.5 | 机器学习 |
| SciPy | SciPy 开发团队 | 1.13 | 科学计算 |
| Seaborn | Seaborn 开发团队 | 0.13 | 统计图表 |
| SHAP | SHAP 社区 | 0.46 | 全局可解释性 |
| SimpleITK | Insight 软件联盟 | 2.x | 医学图像处理 |
| Statsmodels | Statsmodels 开发团队 | 0.14 | 统计分析 |
| 系统内存 (System RAM) | 任意厂商 | 32 GB 或更高 | 内存 |
| TensorBoard | 2.15 | 训练监控 | |
| TensorFlow | 2.15 | 深度学习 | |
| Ubuntu Linux / Windows 11 | Canonical / Microsoft | 22.04 LTS / 11 | 操作系统 |
| Visual Studio Code | Microsoft | 最新稳定版 | 代码开发 |
| XGBoost | XGBoost 开发团队 | 2.1 | 梯度提升 |