在这里,我们提出了一个可重复的方案,用于开发和评估用于医疗分析的可解释人工智能模型。该工作流程集成了数据预处理、预测建模、SHAP、LIME和基于Grad-CAM的解释性、定量评估以及以人为本的验证,以支持透明且值得信赖的临床决策。
研究文章
在这里,我们提出了一个可重复的方案,用于开发和评估用于医疗分析的可解释人工智能模型。该工作流程集成了数据预处理、预测建模、SHAP、LIME和基于Grad-CAM的解释性、定量评估以及以人为本的验证,以支持透明且值得信赖的临床决策。
可解释人工智能(XAI)越来越被认可为构建医疗中可信人工智能系统的不可或缺工具,在其中,透明度和决策解释能力是临床决策的重要组成部分。本出版物提出了一种可重复的实验方法,用于开发和评估用于医疗分析的可解释人工智能系统。开发的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流程,可应用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上展现出强大的预测性能,而深度学习模型则在学习医学影像数据中的复杂模式方面非常有效。SHAP、LIME和Grad-CAM等技术是全局和局部解释,有助于模型解释。非常有帮助。该框架的定量评估涵盖了许多不同指标,如准确性、精度、召回率、F1分数、ROC-AUC、解释指标、忠实度和稳定性。结果表明,当实验条件得到控制时,该框架在评估的实验条件下展现了更好的预测表现和解释质量。作为一份以协议为指导的文件,这部作品支持了可重复性和可扩展性,以及其他生物持续实施的基础。这一透明、易懂的AI模型是临床决策支持和医疗分析系统在大规模获得信任和应用的基础。
人工智能(AI)已成为现代医疗的重要组成部分,支持疾病诊断、预后、风险分层、医学图像分析和临床决策。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,常常实现与传统统计方法相当甚至更优的预测性能2.尽管取得了这些进步,许多人工智能模型仍以复杂的黑箱系统运行,使临床医生和医疗利益相关者难以理解预测是如何生成的3.这种缺乏透明度可能限制高风险医疗环境中的信任、采纳和问责制 4,5。
可解释人工智能(XAI)已成为提升机器学习模型透明度和可解释性的一种有前景的方法。广泛使用的解释技术,包括SHAP(Shapley加法解释)、LIME(局部可解释模型无关解释)和梯度加权类激活映射(Grad-CAM),通过特征归因和可视化解释机制7、8、9,提供了模型行为的洞见。这些方法越来越多地应用于医疗应用,以支持临床解读、模型审计和决策支持10,11。然而,仅凭可解释性并不能保证可靠性、可重复性或临床效用。近期研究强调了解释不稳定性、对干扰敏感性、临床医生验证有限以及解释输出与真实模型推理之间的不一致等挑战 12,13,14,15。
除了可解释性的挑战外,可重复性仍然是医疗机器学习研究中的重要关注点 16,17,18。许多已发表的研究对预处理过程、软件环境、超参数配置、验证策略和实现工作流提供了有限的信息,使得独立复制变得困难 19,20,21。此外,医疗人工智能研究常关注预测表现,但对解释质量评估、以临床医生为中心的评估及实际实施考虑提供有限指导22。这些局限可能阻碍可解释的人工智能系统从研究环境中转化到现实医疗环境中 23,24,25,26,27。
当前医疗XAI工作流程通常单独评估个别解释技术或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为本评估和可重复性资源的标准化协议 28,29,30,31.因此,研究人员和从业者在重现工作流程、比较解释方法或评估可解释人工智能系统在不同医疗数据集和应用领域的实际应用时可能会遇到困难。因此,需要一个全面且可重复的协议,以促进医疗可解释AI工作流程的一致实施、评估和报告,见32,33,34,35。
本文介绍了一个可重复的方案,用于开发、评估和解释医疗分析中可解释的人工智能系统。该方案将数据预处理、预测建模、使用SHAP、LIME和Grad-CAM的可解释性评估、以临床医生为中心的评估、验证程序和可重复性资源整合在统一的工作流程中。目标是提供一个标准化框架,支持透明的模型开发、解释质量评估以及在多样化医疗数据集36、37、38、39中实现可重复的实施。该工作的方法论贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合为一个适合医疗人工智能研究、教育和部署导向研究的单一方案 40,41,42,43。
这项工作的主要贡献并非开发了一种新的可解释性算法。
相反,它提供了一个标准化、可重复且经过实验验证的协议,将预测建模、可解释性评估、可视化、评估和以人为本的解读整合为一个统一的工作流程,适用于医疗分析和基于JoVE的协议传播。本研究的主要目标不是引入新的预测算法,而是提供一套标准化、可重复且经过实验验证的协议,用于实现医疗分析中的可解释人工智能工作流程。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合为一个统一框架,适合采用、复制和教育传播。
本研究所用的所有数据集均来自公开且完全匿名的存储库,包括UCI机器学习存储库、PhysioNet MIMIC-III数据库和NIH胸部X光数据集。未访问可识别的患者信息。该研究符合机构研究伦理指南,用于对公开可得的去标识化数据进行二次分析。由于未直接招募人类参与者且未使用受保护健康信息,因此未要求正式的机构审查委员会批准。
1. 实验框架概述
2. 计算环境与系统配置
| 组成部分 | 参数 | 价值 | 描述 |
| 随机森林 | n_estimators | 100 | 树的数量 |
| 随机森林 | max_depth | 没有 | 树深 |
| XGBoost | learning_rate | 0.01 | 学习速率 |
| XGBoost | n_estimators | 100 | 加速弹 |
| CNN | 时代 | 25 | 训练时期 |
| CNN | batch_size | 32 | 批次大小 |
| CNN | 优化器 | 亚当 | 优化算法 |
| MLP | hidden_layers | 2 | 隐藏层的数量 |
| MLP | 激活 | ReLU | 激活函数 |
| 概述 | train_split | 70% | 训练数据比例 |
| 概述 | validation_split | 15% | 验证比 |
| 概述 | test_split | 15% | 检测比 |
表1:实现细节及超参数配置。
本表总结了在实验评估中所用的计算环境、软件库、机器学习和深度学习模型配置、优化设置、学习率、批处理大小、训练参数和超参数值。
3. 数据集准备与预处理
| 数据集 | 类型 | 采样 | 特色 | 目标 |
| 乳腺癌 | 表格 | 569 | 30 | 良性/恶性 |
| 糖尿病 | 表格 | 768 | 8 | 糖尿病结局 |
| 模仿三 | 电子健康记录 | ~60,000 | 临床变量 | 死亡 |
| 胸部X光 | 成像 | ~112,000 | 图片 | 疾病标签 |
表2:数据集特征与医疗应用场景。
本表格提供了研究中使用的医疗数据集摘要,包括数据集类型、样本数量、特征数量、目标变量、医疗应用领域及相关临床用例。数据集涵盖结构化临床记录、电子健康记录和医学影像数据,展示该框架在多种医疗分析场景中的适用性。
| 数据集 | 样本量 | 级别分布 | 分裂策略 | 泄漏预防 | 超参数搜索 | 交叉验证 | 外部测试 |
| 乳腺癌(UCI威斯康星) | 569 | 357 良性 / 212 恶性 | 70/15/15 | 仅列车预处理 | 网格搜索 | 五重分层CV | 独立保留集合 |
| 皮马印第安人糖尿病 | 768 | 500名非糖尿病患者 / 268名糖尿病患者 | 70/15/15 | 仅列车预处理 | 网格搜索 | 五重分层CV | 独立保留集合 |
| 模仿者三号电子病历 | 5274 | 结果分层队列 | 70/15/15 患者级别 | 患者层级分离 | 随机搜索 | 5折患者级简历 | 独立保留集合 |
| 美国国立卫生研究院胸部X光 | 112120 | 肺炎/正常分层 | 70/15/15 | 图像级分离 | 随机搜索 | 五重分层CV | 独立保留集合 |
表3:数据集级验证与实验设计。
下表总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试拆分策略、泄漏预防程序、超参数优化方法、交叉验证设计及外部测试协议。这些措施旨在确保方法学严谨性、可重复性和模型评估的公正性。

图1:数据预处理流水线的验证。
模型开发前关键预处理操作的验证结果。(A) 跨代表性医疗特征的缺失价值分析。(B) 数值变量在离群值处理前后的分布。(C) 使用标准化进行特征缩放验证。(D) 分类编码验证。(E) 预处理后的类别分布。(F) 列车-验证-测试数据分区的验证。这些结果证实了数据集的预处理和预测建模和可解释性分析的成功准备。 请点击此处查看该图的放大版本。
4. 可解释人工智能框架的系统架构

图2:可解释人工智能框架用于医疗分析的系统架构。请点击此处查看该图的更大版本。
5. 工作流程执行

图3:可解释人工智能流程的端到端工作流程。请点击此处查看该图的更大版本。
6. 模型评估与可解释性评估
7. 以人为本的评估
| 参数 | 价值 |
| 专家 | 12 |
| 医生 | 6 |
| 放射科医生 | 3 |
| 临床数据分析师 | 3 |
| 审查案例 | 100 |
| 评估设计 | 随机化(仅预测 vs 预测+解释) |
| 测量仪器 | 5点李克特量表 |
| 信托评估 | 可解释性、信任度、可用性 |
| 统计检验 | 配对t检验(p 0.05) |
| 评级间可靠性 | 弗莱斯卡帕 |
| 客观指标 | 决策协议,审核时间 |
表4:以人为本的评估方案与临床医生评估设计。
本表展示了用于评估可解释人工智能系统可解释性、可信度和可用性的临床评估框架。总结了参与者人口统计、病例综述方法、调查设计、统计分析程序、评级间信度评估及客观评估指标的信息。
8. 验证与可重复性评估
9. 可重复性资源
| 资源 | 描述 |
| 源代码 | 用于数据预处理、模型训练、可解释性和评估的 Python 实现脚本 |
| 环境文件 | requirements.txt包含包依赖关系和版本 |
| 配置文件 | 模型架构设置、超参数和实验配置 |
| 固定的随机种子 | 种子 = 42 用于可重复实验 |
| 数据集访问说明 | 获取公共医疗数据集的链接和流程 |
| 预处理脚本 | 用于数据清理、规范化、编码和功能选择的脚本 |
| 图形生成脚本 | 用于重生成所有手稿图形的脚本 |
| 表生成脚本 | 用于重现报告表和度量的脚本 |
| 示例输入 | 示例数据集和输入文件 |
| 示例输出 | 预测结果、解释与评估报告 |
表5:可重复性资源与实验资产。
本表总结了支持实验可重复性的资源,包括源代码、预处理脚本、配置文件、环境规范、数据集访问指令、固定随机种子设置、图形生成脚本以及重现报告结果所需的示例输入/输出文件。
我们全面评估了整个流程中的解释性人工智能部分,评估其在不同类型医疗数据(包括结构化临床数据和医学图像)上的预测效果。结果显示,评估数据集的预测表现一致。在测试的模型中,梯度提升模型的准确率最高,达到97.4%,其次是随机森林模型,准确率为94.2%。应用于图像集的深度学习方法实现了91.3%的准确率,而多层感知器模型的结果略低于90.8%。这表明基于集合的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构则在成像任务中表现出色。 表6 详细概述了预测函数的各种性能指标,包括准确性、精度、召回率和F1分数,以及如保真度和稳定性等可解释性指标。我们通过采用五重交叉验证并将结果以均值(含95%置信区间)呈现,得出了这些性能数据。置信区间不仅表明模型的不确定性,还使预测表现的比较更可靠,考虑了数据集内存和模型架构的差异。
| 模型 | 准确率(%) | 精度 | 召回 | F1评分 | 忠实度 | 稳定性 | 95%信赖区间 |
| 随机森林 | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN(成像) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
表6:预测模型与可解释性方法的比较表现。
本表采用预测性能指标(包括准确率、精度、召回率、F1分数和ROC-AUC)对机器学习与深度学习模型进行了比较评估。此外,可解释性指标如忠实度、稳定性、理解度和人类信任评分也被报告为对预测效果和可解释性提供全面评估。
结果显示,梯度增强实现了最高的整体预测表现(97.4%准确率),比随机森林高出3.2个百分点,深度学习模型高出超过6个百分点。这一观察表明,基于集合的学习方法对本研究中包含的结构化医疗数据集尤为有效。CNN和MLP模型性能差异较小表明,仅仅增加模型复杂度并不一定能转化为在评估实验条件下更优的预测表现。
为了展示我们提出的框架在多种医疗分析任务中的实用性,我们在表7中展示了数据集特定的预测表现结果。
数据集特异性分析。
由于特征复杂度、样本量、类别分布和数据模态的不同,性能在不同数据集中存在差异。乳腺癌数据集实现了最高的预测准确性,这很可能得益于其明确的特征可分离性。MIMIC-III和NIH胸部X光数据集的性能略低反映了纵向临床记录和医学影像数据的复杂性。这些发现表明,框架性能受数据集特性和临床背景影响。
| 数据集 | 准确率(%) | 精度(%) | 召回率(%) | F1评分(%) |
| 乳腺癌 | 97.4 | 97.2 | 97.6 | 97.1 |
| 糖尿病 | 94.2 | 93.9 | 94.4 | 94 |
| 模仿三 | 91.3 | 91 | 91.5 | 91.1 |
| 美国国立卫生研究院胸部X光 | 90.8 | 90.4 | 91.2 | 90.6 |
表7:数据集特异性预测表现结果。
拟议的可解释人工智能框架在四个代表性医疗数据集上的预测性能。准确性、精度、召回率和F1分数以百分比(%)报告独立测试集。数值越高,分类性能越好。
为评估预测性能,分析了四个机器学习和深度学习模型,分别是梯度增强、随机森林、卷积神经网络(CNN)和多层感知器(MLP),涵盖四个具有代表性的医疗数据集。模型性能通过在独立测试数据集上进行的准确性、精度、召回率、F1分数和ROC-AUC指标评估,采用70:15:15的训练-验证-测试分割和五重交叉验证。通过比较相同预处理和验证条件下的模型特异性评估指标,预测性能的提升得以确定。
为了阐明模型在不同方法上的表现差异, 图4 以图示方式展示了集合、神经网络和深度学习模型的优缺点。

图4:机器学习与深度学习模型在医疗预测任务中的表现比较。(a) 测试数据集上梯度增强、随机森林、CNN和MLP模型的准确性比较。 (B) 在测试数据集上对梯度增强、随机森林、CNN和MLP模型进行F1分数比较。(C) 在测试数据集上对梯度增强、随机森林、卷积神经网络和MLP模型进行精确比较。(D)回忆测试数据集上梯度增强、随机森林、CNN和MLP模型的比较。数值越高表示预测表现越好。梯度提升在所有评估指标中获得最高整体表现,其次是随机森林。请点击此处查看该图的放大版本。
可解释性表现的解释。
SHAP在评估的可解释性方法中始终获得最高的保真度和稳定性评分,表明生成的解释与底层模型预测之间的一致性更为一致。石灰梅的稳定性相对较低,表明对局部扰动和采样变异性更为敏感。Grad-CAM 为基于图像的模型提供了可直观解释,但其保真度略低于 SHAP。这些发现表明,解释质量既依赖于所选解释技术,也取决于其底层的预测模型架构。
管道中集成的可解释性技术已经过定量和定性评估。具体来说,特征归因方法在不同数据集中能够相当一致地揭示模型的内部逻辑。
研究中考虑的所有方法SHAP在评估的可解释性方法中均达到最高的保真度(0.92)和稳定性(0.89)。简单来说,这些解释非常准确地反映了模型实际预测的内容。局部解释方法是一种窗口,通过它我们可以看到具体的预测,并理解模型作为决策依据的是什么。
可解释性表现通过以人为本评估获得的忠实度、稳定性、理解性和临床医生信任评分进行评估。使用相同的数据集和训练模型比较了SHAP、LIME和Grad-CAM的解释。通过比较所评估解释能力方法的解释质量指标和临床医生评分,评估了可解释性提升。针对图像的深度学习模型的可视化技术本质上是生成热力图,识别与模型预测最相关的图像区域。不同方法间的特征重要性分布和可解释性性能比较见 图5。

图5:可解释性绩效评估。图中展示了利用保真度和稳定性指标,解释性方法的性能。SHAP在保真度(0.92)和稳定性(0.89)方面领先,这反映了解释与模型预测之间的良好一致性。LIME是单一实例可解释性的最佳工具。另一方面,Grad-CAM输出主要用于影像模型的视觉热图,粗略显示对模型预测负责的最重要区域,从临床角度来看可能非常相关。请点击此处查看该图的放大版本。
在评估预测模型和可解释性技术后,发现模型的准确性与其解释的可靠性之间的相关性非常强。事实上,那些显示预测改进的模型,在正确应用可解释性技术时,也以更稳定和更一致的方式解释结果。集成模型在配合特征归因方法时最易解释,而深度学习模型则更适合基于可视化的可解释方法。将预测准确性与解释可靠性联系起来的联系可见于 图6,图中 详细勾勒了模型与可解释性的概念动态。

图6:模型比较分析及能力解释方法。图表详细比较了各模型的准确率和能力测量。它包括一个散点图,展示了准确性与解释稳定性之间的相关性,一个表现的表格比较,以及一个适宜性矩阵,概述了不同解释能力方法(SHAP、LIME和Grad-CAM)及其在不同模型类型的有效性。可视化清楚表明,集合模型加上SHAP能提供极佳的可解释性,而深度学习模型则可以通过可视化技术进行解释。 请点击此处查看该图的放大版本。
以人为本的评估确认了该建议系统在医院及其他临床机构的实际应用价值。医学专业人员会审查模型输出,并有无说明。通过展示结果并附带解释,用户的信任度和可理解性大幅提升;平均信托价值从3.1升至4.7(1到5分)。信任评分从3.1提升到4.7,代表了大约51.6%的相对提升。评估者间高度一致(Fleiss' κ = 0.81)进一步表明临床医生对解释有效性的评估一致。这些发现表明,可解释性输出可能提升用户信心,并促进对AI辅助临床决策的解读。专业人士表示,他们对模型输出的理解更好,对AI支持的临床情境判断信任度更高,这表明可解释性在医疗实际实施中的重要性。
我们还通过消融分析进一步验证了框架的稳健性。通过可解释方法被认为至关重要的关键特征被移除,导致预测性能大幅下降。因此,这一发现反映了特征不仅相关,而且对预测任务具有重要意义。此外,解释结果在解释不同输入样本时仅显示可忽略的差异,显示了可解释方法的稳定性和可靠性。
为了验证该管道的实际应用,我们测量了其计算速度。可解释性的引入带来了计算时间的增加,尤其是在归因特征和创建可视化时。尽管如此,总执行时间仍然可行且不算太长。图7 展示了流程不同阶段(如预处理、模型训练、可解释性生成、评估和可视化)之间的计算时间分配。

图7:流水线执行时间的细分。 该图表展示了计算时间如何分配到可解释人工智能流程的各个阶段,如预处理、模型训练、解释能力创建、评估和可视化。数据显示,大部分时间线被模型训练占据,随后是解释能力处理。另一方面,前期处理和报告所花费的时间相当有限。 请点击此处查看该图的放大版本。
我们还通过消融分析测试了该框架的强度。去除通过可解释性方法发现的关键特征后,预测表现明显下降,这清楚地表明这些特征不仅相关,而且非常重要。此外,即使输入样本略有变化,解释输出也相当稳定,这证明了可解释性技术的一致性和可靠性。
简而言之,通过结合预测性能测量、可解释性和以人为中心的验证,所提出的框架是有效的。该系统不仅预测非常准确,而且高度可解读且易于使用。引入可解释性方法使整个过程透明,同时不影响模型性能。我们看到的预测准确性和可解释性的提升不仅是在严格的实验控制下实现的,而且具有统计学上的显著性,这也说明了该方法的持久性和真实性。在预测模型间进行了成对比较,使用跨交叉验证折叠的配对t检验。梯度增强与竞争模型之间观察到统计学上显著差异(p < 0.05),证实了该配置的优越性。
总体发现。
综合来看,这些结果表明,预测表现、解释质量和临床医生信任度可以在统一且可重复的工作流程中进行评估。该框架在多个医疗数据集中保持稳定性能,同时支持通过SHAP、LIME和Grad-CAM解释实现透明解释。然而,这些发现应结合所选数据集和验证设置进行解释,且在实际部署前仍需额外外部验证。
数据可用性:
我们从公开来源获得了当前研究中使用的数据集,这些数据集可在知名数据库中找到。例如,乳腺癌和糖尿病相关数据可从UCI机器学习存储库下载:https://archive.ics.uci.edu/ml/index.php
可以通过Physio Net获取电子健康记录数据集(MIMIC-III):
https://physionet.org/content/mimiciii/1.4/
胸部X光影像数据来自美国国立卫生研究院胸部X光数据集,可于以下网站找到:https://www.kaggle.com/datasets/nih-chest-xrays/data
我们在本研究中探索的所有数据集均已匿名化并公开。我们在研究期间产生的预处理步骤、训练模型和解释能力输出,如果有合理请求,可以通过通讯作者提供。源代码、预处理脚本、配置文件和可重复性资源将在稿件被接受后存放到公共仓库中。
本研究开发并评估了一种可重复的可解释人工智能(XAI)医疗分析工作流程,将预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合在单一方案中。结果表明,基于集成的机器学习模型,特别是梯度增强和随机森林,在被评估的结构化医疗数据集中实现了最高的预测性能,而深度学习模型更适合基于图像的分析。这些发现强调了根据数据特性选择模型架构的重要性,而不是假设更复杂的模型总能带来更优越的性能。这项工作的关键贡献是将预测建模、可解释性评估、以人为本的评估和可重复性实践整合到标准化工作流程中。与单独评估可解释性技术的研究不同,本框架提供了一种以方案为驱动的方法,支持在不同医疗数据集中进行透明且可重复的实验。
可解释性分析显示,评估方法之间存在可测量的差异。SHAP在评估的实验条件下取得了最高的保真度和稳定性评分,表明生成的解释与模型预测之间更为一致。LIME提供了有用的局部解释,但稳定性较低,而Grad-CAM则为成像数据生成直观的视觉解释。这些发现表明解释质量取决于所选可解释性方法和其基础预测模型。以人为本的评估进一步表明,解释的纳入提升了临床医生的信任度和可解释性。信任评分的提升和评估者间显著的一致性(Fleiss' κ = 0.81)表明参与者对解释有用性的评估一致。这些发现支持了可解释方法在提升医疗决策支持系统透明度和用户接受度方面的潜在价值。
解读结果时应考虑若干限制因素。首先,该框架使用有限的公开数据集进行评估,可能无法完全反映现实临床环境中遇到的变异性。其次,临床评估参与者人数相对较少,可能限制了推广性。第三,本研究探讨的可解释性方法属于事后技术,因此仍受已知局限性影响,包括对扰动的敏感性以及解释与真实模型推理之间的潜在差异。最后,跨独立医疗机构进行外部验证超出本研究范围。
未来的研究应探讨整合临床记录、医学影像、生理信号和可穿戴传感器数据的多模态医疗分析。还需要进一步工作以评估因果和反事实解释方法、不确定性量化、公平性评估、校准分析以及前瞻性临床验证。此类研究有望进一步提升可解释人工智能系统在医疗领域的透明度、可靠性和适用性。
除了性能评估外,还应考虑若干实际实施挑战和协议修改,以确保所提可解释人工智能框架在多样化医疗环境中的稳健部署。
可解释性方法的局限性
SHAP、LIME 和 Grad-CAM 虽然提供了关于模型行为的有用见解,但也存在若干缺点。文献中指出,这些工具在重复运行时可能不稳定,对扰动较为敏感,不同数据集存在差异,有时甚至无法准确反映模型的真实原因。因此,事后解释应仅被视为补充证据,而非因果决策机制的实际描绘。在解释能够被高度影响的临床环境中应用之前,对解释可信度进行适当验证仍是非常重要的一步。
这也与近期生物医学人工智能研究的发现一致,该研究强调在临床应用前必须解释可靠性验证的必要性。可解释性的融入被用作心脏骤停预测系统验证的关键方面,使其更透明并赢得临床预测的信任(41)。同样,利用可视化驱动的可解释性技术进行肝脏超声图像分割,旨在提高解释性,同时忽视事后解释有限的事实。这些论文证实了解释一致性检查、解释鲁棒性测试以及临床有意义的可解释性验证对于达到最高临床使用准备水平的必要条件。
校准、公平性、鲁棒性与外部推广
拟议框架的未来版本将包括通过校准曲线和Brier评分评估概率校准,利用贝叶斯和基于集成的方法估计不确定性,对人口统计子群进行公平性审计,以及在噪声数据和变化领域条件下进行鲁棒性检查。这些分析在医疗环境中尤为重要,因为模型置信度、公平表现和在不断变化的临床环境中的可靠性直接影响患者安全和临床采纳。近期AI驱动的科学框架同样强调了可信、透明和可靠的决策支持系统的重要性,超越了传统的预测性绩效评估。近期人工智能驱动的科学框架同样强调了可信、透明和可靠的决策支持系统的重要性,超越了传统的预测绩效评估 43。
故障排查与协议修改
为了成功推广拟议的可解释人工智能框架,需要考虑若干实际问题。一个典型问题是过拟合,例如在相对较小的医疗数据集上训练深度学习模型时。通过应用交叉验证、提前停止、退出正则化、数据增强和彻底的超参数优化,可以减少过拟合。在训练中观察验证性能是避免模型复杂且泛化能力差的好方法。
医疗数据集中另一个非常重要的问题是类别失衡,即积极的临床结果远少于负面病例。为了解决这一问题,分层抽样、类别权重调整、合成少数族裔过度抽样以及使用如F1分数和ROC-AUC等平衡评估指标,应成为建模流程的一部分。忽视阶级不平衡可能导致绩效指标无法真正代表模型,临床预测也可能存在偏见。
医学影像数据集通常并不完美,可能会被噪声、采集伪影、质量不稳定等影响。这些因素也因成像设备类型而异。这些因素可能对预测表现产生负面影响,也会影响可解释性输出。因此,应采用标准化的预处理步骤、图像归一化、质量控制检查和数据增强技术,以实现模型的鲁棒性和可靠性。
SHAP使得推导出高度信息丰富的特征归因解释成为可能。然而,不稳定性的发生不能被排除,尤其是在高度相关特征存在或模型结果对输入数据微小变化极为敏感时。为增强解释的一致性和可靠性,建议多次编写解释、评估多次运行中的稳定性、使用特征分组策略,并与其他可解释性方法如LIME进行检查。
在大规模医疗数据和庞大的深度神经网络架构中,GPU内存限制可能成为主要限制之一。通过批量大小调整、混合精密训练、模型修剪、降低特征维度以及采用高效数据加载,内存需求可以大幅降低。此外,在低资源系统上部署该框架的研究人员可能会考虑使用云计算环境或分布式训练。
该框架的模块化设计使得针对不同医疗应用可以轻松进行修改。根据临床任务的不同,科学家可以更改一个或多个单独的预测模型,增加新的解释方法,将不同类型的医疗数据结合使用,或在不改变整体工作流程的情况下加入不确定性量化和校准模块。这种灵活性使该框架能够在非常不同的医疗分析案例中使用,同时保持可重复性和可解释性。
监管与伦理考量:
让人工智能系统更易理解,在医疗领域会有很大帮助。但这还不够。监管机构的规定要求透明度、问责制、隐私和患者安全,必须得到遵守。即使可解释性能提升信任度和可解释性,单靠解释性也无法保证临床有效性。负责任的实施需要前瞻性的临床验证、公平性评估、监管审查以及部署后的监控。此外,未来部署该框架时应考虑患者隐私、临床医生监督以及跨人口群体的公平绩效。为了融入现实临床工作流程,人工智能系统与医疗专业人员必须无缝协作。因此,可解释性信息应成为当前电子健康记录和临床决策支持平台的一部分,而非仅能独立运作的工具。最终选择必须由医生做出,而可解释人工智能仅是一种辅助技术,提升透明度,支持基于证据的推理,并使医护人员与患者之间的沟通更加便捷。
本文提出了一个可重复的方案,用于开发、评估和解释医疗分析中可解释的人工智能系统。该贡献以方法论和工作流程为导向,为研究人员和临床医生提供了一个标准化框架,可复制、调整和扩展到多个医疗应用领域。它将数据预处理、预测建模、可解释性方法和性能评估等多个方面统一结合在一起。该方法论在多个医疗数据集中展现出强劲的预测性能。在结构化数据分析方面,模型集合表现最佳,而深度学习模型在医学影像任务中被发现非常有效。此外,使用解释技术也使用户更容易理解模型,因为它提供了预测结果的全局和局部解释。因此,这不仅提升了临床医生的信任度,也提升了模型的可用性。研究结果表明,可解释人工智能可以支持开发透明且可解释的医疗分析系统,在模型的准确性和可解释性之间找到折中,而这些对可靠和值得信赖的医疗分析至关重要。因此,这里提出的方法是一种非常有效且直接的医疗数据分析工具,可以帮助医疗专业人员使用他们信任的人工智能技术。本文提出了一个可重复的协议,用于开发、评估和解释医疗分析中可解释的人工智能模型。通过将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估和可重复性资源整合在统一的工作流程中,该协议为透明的医疗人工智能研究提供了实用框架。该工作流程可适应多样化的医疗数据集和应用领域,支持可重复的实现、评估和报告可解释机器学习系统。
作者声明他们与本研究无任何财务利益冲突或利益冲突。该研究独立进行,没有任何可能被视为潜在利益冲突的商业或财务关系。
人工智能使用披露
在稿件准备过程中,使用了人工智能工具进行语言优化、语法检查和编辑协助。所有科学内容、实验设计、数据分析、解释和最终稿件核对均由作者完成。作者审查并验证了所有AI辅助产出,以确保准确性、完整性并符合期刊指南。
作者们感谢各自机构为开展本研究提供了必要的基础设施和研究支持。作者还承认,公开数据集和开源工具的使用促进了拟议可解释人工智能框架的开发与评估。特别感谢在以人为本的评估阶段提供宝贵见解的领域专家。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| GPU工作站 | 制造商依赖 | 无 | 训练深度学习模型 |
| Jupyter Notebook | Project Jupyter | 最新稳定版本 | 交互式实验执行 |
| LIME | LIME | 版本0.2.0 | 局部可解释性解释 |
| Matplotlib | Matplotlib项目 | 版本3.9 | 数据可视化 |
| MIMIC-III数据库 | PhysioNet | 版本1.4 | 电子健康记录分析 |
| NIH胸部X光数据集 | NIH临床中心 | 公共数据集 | 胸腔疾病分类 |
| NumPy | NumPy开发者 | 版本1.26 | 数值计算和数组操作 |
| OpenCV | OpenCV基金会 | 版本4.10 | 图像预处理 |
| Pandas | Pandas开发团队 | 版本2.1 | 数据操作和预处理 |
| 皮马印第安人糖尿病数据集 | UCI机器学习存储库 | 公共数据集 | 糖尿病风险预测 |
| Python 3.11 | Python软件基金会 | 版本3.11 | 主编程环境 |
| Scikit-learn | scikit-learn | 版本1.5 | 机器学习算法和评估 |
| Seaborn | Seaborn | 版本0.13 | 统计可视化 |
| SHAP | SHAP | 版本0.46 | 特征归因和可解释性 |
| TensorFlow | TensorFlow | 版本2.15 | 深度学习模型开发 |
| Windows / Ubuntu Linux | Microsoft / Canonical | 无 | 操作系统 |
| 威斯康星乳腺癌数据集 | UCI机器学习存储库 | 公共数据集 | 乳腺癌诊断 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可