本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。
可解释的人工智能(XAI)正日益被视为在医疗保健领域构建可信人工智能系统不可或缺的工具,因为在临床决策过程中,透明性以及解释决策的能力是至关重要的组成部分。本文介绍了一种可重复的实验方法,用于开发和评估面向医疗数据分析的可解释人工智能系统。所构建的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流,可同时适用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上表现出较强的预测性能,而深度学习模型则擅长从医学影像数据中学习复杂的模式。SHAP、LIME 和 Grad-CAM 等技术提供了全局和局部解释,有助于模型的理解。该框架的定量评估涵盖多种不同指标,包括准确率、精确率、召回率、F1 分数、ROC-AUC、解释性指标、保真度和稳定性。结果表明,在控制实验条件的情况下,该框架在所评估的实验条件下表现出更优的预测性能和解释质量。作为一份以实验方案为导向的文档,本研究支持其他研究者对方法进行可重复和可扩展的持续实施。这种透明且易于理解的人工智能模型,是临床决策支持系统和医疗数据分析系统获得广泛信任与应用的基础。
人工智能(AI)通过支持疾病诊断、预后评估、风险分层、医学影像分析和临床决策,已成为现代医疗保健的重要组成部分1。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,其预测性能通常可达到甚至超过传统统计方法2。尽管取得了这些进展,许多AI模型仍以复杂的黑箱系统方式运行,导致临床医生和医疗利益相关者难以理解预测结果的生成过程3。这种缺乏透明性的问题可能限制高风险医疗环境中对AI的信任、采纳和责任追溯能力4,5。
可解释性人工智能(XAI)已成为提高机器学习模型透明度和可解释性的有前景方法6。广泛应用的解释技术包括SHAP(Shapley加性解释)、LIME(局部可解释的模型无关解释)和梯度加权类激活映射(Grad-CAM),这些技术通过特征归因和可视化解释机制揭示模型行为7,8,9。这些方法 increasingly 被应用于医疗健康领域,以支持临床解释、模型审计和决策支持10,11。然而,仅具备可解释性并不能保证模型的可靠性、可重复性或临床实用性。近期研究指出了与解释结果不稳定性、对扰动敏感、临床医生验证有限以及解释输出与模型真实推理之间存在不一致等相关挑战12,13,14,15。
除了可解释性方面的挑战外,可重复性在医疗机器学习研究中仍然是一个重要的问题16,17,18。许多已发表的研究在预处理流程、软件环境、超参数配置、验证策略和实现工作流方面提供的信息有限,导致独立重复实验十分困难19,20,21。此外,医疗人工智能研究往往侧重于预测性能,而在解释质量评估、以临床医生为中心的评价以及实际实施考虑方面提供的指导较为有限22。这些局限性可能会阻碍可解释人工智能系统从研究环境向真实世界医疗场景的转化23,24,25,26,27。
当前医疗健康领域的可解释人工智能(XAI)工作流程通常孤立地评估单个解释方法或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为中心的评估以及可重复性资源的标准化协议28,29,30,31。因此,研究人员和实践者在不同医疗健康数据集和应用领域中重复工作流程、比较解释方法或评估可解释人工智能系统的实际效用时,可能会遇到困难。因此,亟需一种全面且可重复的协议,以促进医疗健康可解释人工智能工作流程的一致实施、评估和报告32,33,34,35。
本文提出了一种可重复的协议,用于在医疗健康数据分析中开发、评估和解释可解释的人工智能系统。该协议在一个统一的工作流程中整合了数据预处理、预测建模、使用SHAP、LIME和Grad-CAM进行可解释性评估、以临床医生为中心的评估、验证程序以及可重复性资源。其目标是提供一个标准化框架,以支持在不同医疗健康数据集上实现透明的模型开发、解释质量评估和可重复的实施36,37,38,39。本研究的方法学贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合到单一协议中,适用于医疗健康人工智能领域的研究、教育及面向部署的研究项目40,41,42,43。
本研究的主要贡献并非开发一种新的可解释性算法。
相反,本研究提供了一种标准化、可重复且经过实验验证的方案,将预测建模、可解释性评估、可视化、结果评价以及以人为中心的解释整合为统一的工作流程,适用于医疗健康数据分析及 JoVE 平台的方案传播。本研究的主要目标并非提出一种全新的预测算法,而是为在医疗健康数据分析中实施可解释人工智能工作流程提供一套标准化、可重复且经过实验验证的方案。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源整合为一个统一的框架,便于被采纳、复制和用于教学传播。
访问受限。请登录或开始试用以查看此内容。
本研究中使用的所有数据集均来自公开且完全匿名的数据库,包括UCI机器学习库、PhysioNet MIMIC-III数据库和NIH胸部X光片数据集。未访问任何可识别的患者信息。本研究符合机构科研伦理指南中关于公开可用的去标识化数据二次分析的规定。由于未直接招募人类受试者,也未使用任何受保护的健康信息,因此无需正式的机构审查委员会批准。
1. 实验框架概述
2. 计算环境与系统配置
| 组件 | 参数 | 数值 | 描述 |
| 随机森林 | n_estimators | 100 | 树的数量 |
| 随机森林 | max_depth | None | 树的深度 |
| XGBoost | learning_rate | 0.01 | 学习率 |
| XGBoost | n_estimators | 100 | 提升轮数 |
| CNN | epochs | 25 | 训练轮数 |
| CNN | batch_size | 32 | 批量大小 |
| CNN | optimizer | Adam | 优化算法 |
| MLP | hidden_layers | 2 | 隐藏层数量 |
| MLP | activation | ReLU | 激活函数 |
| 通用 | train_split | 70% | 训练数据比例 |
| 通用 | validation_split | 15% | 验证集比例 |
| 通用 | test_split | 15% | 测试集比例 |
表1:实现细节与超参数配置。
本表格总结了在所提出的可解释人工智能框架的实验评估过程中,所使用的计算环境、软件库、机器学习与深度学习模型配置、优化设置、学习率、批量大小、训练参数以及超参数值。
3. 数据集准备与预处理
| 数据集 | 类型 | 样本数 | 特征数 | 目标变量 |
| Breast Cancer | Tabular | 569 | 30 | 良性/恶性 |
| Diabetes | Tabular | 768 | 8 | 糖尿病结果 |
| MIMIC-III | EHR | ~60,000 | 临床变量 | 死亡率 |
| Chest X-ray | Imaging | ~112,000 | 图像 | 疾病标签 |
表2:数据集特征与医疗应用场景。
本表总结了研究中使用的医疗保健数据集,包括数据集类型、样本数量、特征数量、目标变量、医疗保健应用领域以及相关临床应用场景。这些数据集涵盖结构化临床记录、电子健康记录和医学影像数据,以展示该框架在多种医疗保健分析场景中的适用性。
| 数据集 | 样本量 | 类别分布 | 划分策略 | 数据泄露预防 | 超参数搜索 | 交叉验证 | 外部测试 |
| Breast Cancer (UCI Wisconsin) | 569 | 357 良性 / 212 恶性 | 70/15/15 | 仅训练集预处理 | 网格搜索 | 5折分层交叉验证 | 独立保留集 |
| Pima Indians Diabetes | 768 | 500 非糖尿病 / 268 糖尿病 | 70/15/15 | 仅训练集预处理 | 网格搜索 | 5折分层交叉验证 | 独立保留集 |
| MIMIC-III EHR | 5274 | 按结局分层的队列 | 70/15/15 患者水平 | 患者水平分离 | 随机搜索 | 5折患者水平交叉验证 | 独立保留集 |
| NIH Chest X-ray | 112120 | 肺炎/正常分层 | 70/15/15 | 图像水平分离 | 随机搜索 | 5折分层交叉验证 | 独立保留集 |
表3:数据集级别验证与实验设计。
本表格总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试集划分策略、数据泄露预防措施、超参数优化方法、交叉验证设计以及外部测试协议。这些措施的实施旨在确保方法学的严谨性、可重复性以及无偏倚的模型评估。

图1:数据预处理流程的验证。
模型开发前关键预处理操作的验证结果。(A)代表性医疗特征中的缺失值分析。(B)数值变量在异常值处理前后的分布。(C)使用标准化进行特征缩放的验证。(D)分类变量编码的验证。(E)预处理后的类别分布。(F)训练集-验证集-测试集数据划分的验证。这些结果证实了数据集的预处理和准备工作已成功完成,可用于预测建模和可解释性分析。请点击此处查看该图的放大版本。
4. 可解释人工智能框架的系统架构

图 2:用于医疗数据分析的可解释人工智能框架的系统架构。 请点击此处查看此图的放大版本。
5. 工作流程执行

图 3:可解释人工智能流程的端到端工作流程。 请点击此处查看此图的放大版本。
6. 模型评估与可解释性评估
7. 以人为中心的评估
| 参数 | 数值 |
| 专家 | 12 |
| 医师 | 6 |
| 放射科医生 | 3 |
| 临床数据分析师 | 3 |
| 评审病例数 | 100 |
| 评估设计 | 随机化(仅预测 vs 预测+解释) |
| 调查工具 | 5点李克特量表 |
| 信任度评估 | 可解释性、信任度、可用性 |
| 统计检验 | 配对t检验(p 0.05) |
| 评分者间信度 | Fleiss Kappa |
| 客观指标 | 决策一致性、评审时间 |
表4:以人类为中心的评估方案与临床医生评估设计。
本表格展示了用于评估可解释人工智能系统在可解释性、可信度和可用性方面的临床医生评估框架。内容总结了参与者人口统计学信息、病例审查方法、调查设计、统计分析流程、评分者间信度评估以及客观评价指标。
8. 验证与可重复性评估
9. 可重复性资源
| 资源 | 描述 |
| 源代码 | 用于数据预处理、模型训练、可解释性分析和评估的 Python 实现脚本 |
| 环境文件 | 包含软件包依赖关系及版本的 requirements.txt 文件 |
| 配置文件 | 模型结构设置、超参数和实验配置 |
| 固定随机种子 | 使用 Seed = 42 以确保实验可重复性 |
| 数据集访问说明 | 获取公开医疗数据集的链接和操作流程 |
| 预处理脚本 | 用于数据清洗、归一化、编码和特征选择的脚本 |
| 图表生成脚本 | 用于重新生成所有论文图表的脚本 |
| 表格生成脚本 | 用于复现所报告表格和指标的脚本 |
| 示例输入 | 样本数据集和输入文件 |
| 示例输出 | 预测结果、解释性分析结果和评估报告 |
表5:可重复性资源与实验资源。
本表格总结了为支持实验可重复性而提供的资源,包括源代码、预处理脚本、配置文件、环境配置说明、数据集访问指南、固定的随机种子设置、图表生成脚本,以及重现报告结果所需的示例输入/输出文件。
访问受限。请登录或开始试用以查看此内容。
我们对整个流程中的可解释人工智能组件进行了全面评估,考察了其在不同类型医疗数据上的预测性能,包括结构化临床数据和医学图像。结果表明,在所评估的数据集中,模型的预测性能表现一致。在测试的模型中,梯度提升模型的准确率最高,达到97.4%,其次是随机森林模型,准确率为94.2%。应用于图像数据集的深度学习方法准确率为91.3%,而多层感知机模型的结果略低,为90.8%。这表明,基于集成的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构在影像任务中更具优势。表6详细列出了预测功能的各项性能指标,包括准确率、精确率、召回率和F1分数,以及可解释性指标如保真度和稳定性。这些性能数值是通过五折交叉验证得出的,并以均值(含95%置信区间)形式呈现。置信区间不仅反映了模型的不确定性,还使预测性能的比较更加可靠,能够兼顾数据集的记忆效应以及模型架构之间的差异。
| 模型 |
访问受限。请登录或开始试用以查看此内容。
本研究开发并评估了一种可重复的、可解释的人工智能(XAI)工作流程,用于医疗数据分析。该流程在一个统一的协议中集成了预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源。结果表明,在所评估的结构化医疗数据集上,基于集成的机器学习模型(特别是梯度提升和随机森林)表现出最高的预测性能,而深度学习模型则更适用于基于图像的分析。这些发现强调了应根据数据特征选择模型架构的重要性,而非假设更复杂的模型总会带来更优的性能。本研究的一个关键贡献在于,将预测建模、可解释性评估、以人为中心的评估以及可重复性实践整合到一个标准化的工作流程中。与孤立评估可解释性技术的研究不同,所提出的框架提供了一种以协议为驱动的方法论,支持在多种医疗数据集上进行透明且可重复的实验。
可解释性分析在所评估的方法之间显示出可测量的差异。在所评估的实验条件下,SHAP 实现了最高的保真度和稳定性得分,表明其生成的解释与模型预测之间具有更紧密的一致性。LIME 提供了有用的局部解释,但表现出较低的稳定性,而 Grad-CAM 为影像数据生成了直观的可视化解释。这些发现表明,解释质量取决于所选择的可解释性方法以及底层的预...
访问受限。请登录或开始试用以查看此内容。
作者声明,他们对本研究不存在任何竞争性财务利益或相关利益冲突。本研究独立开展,未涉及任何可能被视为潜在利益冲突的商业或财务关系。
人工智能使用披露
在手稿撰写过程中,使用了人工智能工具进行语言润色、语法检查和编辑辅助。所有科学内容、实验设计、数据分析、结果解释以及最终手稿的核实均由作者完成。作者对所有人工智能辅助生成的内容进行了审阅和验证,以确保其准确性、完整性和符合期刊投稿指南。
作者感谢各自机构为开展本研究提供了必要的基础设施和科研支持。作者还感谢使用了公开可用的数据集和开源工具,这些资源促进了所提出的可解释人工智能框架的开发与评估。特别感谢领域专家在以人为中心的评估阶段提供的宝贵见解。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| GPU 工作站 | Manufacturer dependent | NA | 训练深度学习模型 |
| Jupyter Notebook | Project Jupyter | Latest stable release | 交互式实验执行 |
| LIME | LIME | Version 0.2.0 | 局部可解释性分析 |
| Matplotlib | Matplotlib Project | Version 3.9 | 数据可视化 |
| MIMIC-III 数据库 | PhysioNet | Version 1.4 | 电子健康记录分析 |
| NIH 胸部 X 光数据集 | NIH 临床中心 | Public Dataset | 胸部疾病分类 |
| NumPy | NumPy 开发者团队 | Version 1.26 | 数值计算与数组操作 |
| OpenCV | OpenCV 基金会 | Version 4.10 | 图像预处理 |
| Pandas | Pandas 开发团队 | Version 2.1 | 数据处理与预处理 |
| Pima 印第安人糖尿病数据集 | UCI 机器学习知识库 | Public Dataset | 糖尿病风险预测 |
| Python 3.11 | Python 软件基金会 | Version 3.11 | 主要编程环境 |
| Scikit-learn | scikit-learn | Version 1.5 | 机器学习算法与评估 |
| Seaborn | Seaborn | Version 0.13 | 统计可视化 |
| SHAP | SHAP | Version 0.46 | 特征归因与可解释性分析 |
| TensorFlow | TensorFlow | Version 2.15 | 深度学习模型开发 |
| Windows / Ubuntu Linux | Microsoft / Canonical | NA | 操作系统 |
| 威斯康星乳腺癌数据集 | UCI 机器学习知识库 | Public Dataset | 乳腺癌诊断 |
访问受限。请登录或开始试用以查看此内容。