本方案提出 FedMediFormer-XAI,一种通过联邦学习、多模态变换器、基于扩散的数据增强、基于图的个性化药物推荐以及可解释人工智能技术来保护隐私的多模态糖尿病智能框架,用于实现精准预测、透明决策和个性化糖尿病管理。
本方案提出 FedMediFormer-XAI,一种通过联邦学习、多模态变换器、基于扩散的数据增强、基于图的个性化药物推荐以及可解释人工智能技术来保护隐私的多模态糖尿病智能框架,用于实现精准预测、透明决策和个性化糖尿病管理。
糖尿病管理面临诸多障碍,例如医疗数据碎片化、隐私问题、可解释性差以及缺乏个性化的治疗指导。本研究提出了 FedMediFormer-XAI,这是一个统一且完善的框架,融合了联邦学习、多模态变换器、基于扩散的数据增强、用于药物推荐的图神经网络(GNN)以及可解释人工智能(XAI),以实现糖尿病智能管理。该系统利用多种类型的医疗健康数据,例如临床记录、人群健康指标、连续血糖监测数据、视网膜眼底图像、可穿戴传感器测量值以及药理学信息。为生成合成样本并解决类别不平衡问题,采用了扩散模型,并使用多模态变换器架构来学习不同数据源之间的关联。联邦学习使得在不共享原始患者数据的前提下,以保护隐私的方式协同训练模型。GNN 组件用于捕捉患者-药物和药物-药物相互作用,从而实现个性化药物推荐。SHapley 加性解释(SHAP)、注意力可视化、积分梯度和反事实推理等可解释性方法,为预测和推荐结果提供了透明的解释。在代表性实现中,所提出的框架达到了 94.2% 的准确率、93.1% 的精确率、92.8% 的召回率、92.9% 的 F1 分数、0.88 的马修斯相关系数(MCC)以及 0.96 的受试者工作特征曲线下面积(AUC-ROC)。基于图的推荐模块实现了精确率 = 0.89、召回率 = 0.84 和归一化折损累计增益(NDCG)= 0.91。该方案提供了一种结构化方法,用于整合异构医疗数据,结合多模态变换器、联邦学习、基于扩散的数据增强、基于图的推荐以及可解释人工智能。报告的计算结果表明,该框架在糖尿病预测和个性化用药推荐方面具有潜力,而联邦化设计支持去中心化的数据处理。未来仍需开展前瞻性多中心临床评估,以验证其临床实用性、泛化能力及实际应用价值。
糖尿病是影响人类健康的最主要的慢性代谢性疾病之一,其患病人数持续增长,长期后果严重,且患者治疗费用高昂,已成为重大的公共卫生问题1,2。据报告,目前全球有超过5.37亿成年人患有糖尿病,预计在未来几十年内这一数字将显著上升3。如果血糖水平得不到有效控制,患者将面临最严重的并发症,如冠心病4、肾功能损伤5、神经损伤6、视力丧失7和脑卒中8。因此,尽早识别疾病、定期监测患者病情,并通过先进的医疗手段对患者进行指导和干预,是帮助患者实现更健康生活的重要措施,同时也有助于减轻国家医疗系统的经济负担9,10。
如今,电子健康记录(EHR)、可穿戴设备、持续葡萄糖监测(CGM)系统、视网膜成像技术以及移动健康应用程序的使用正在迅速普及,产生了大量异构的医疗健康数据,可供分析利用11。这些不同的数据采集工具能够提供关于人体在疾病不同阶段的功能状态、患者对不同类型治疗的反应,以及其在现实生活中的行为模式等多方面的信息12。人工智能(AI)已被证明是处理高度复杂数据、预测糖尿病、监测疾病进展以及辅助医生进行临床决策的最佳解决方案13。此外,包括随机森林、支持向量机和梯度提升方法在内的机器学习算法,在评估糖尿病风险方面已取得优异成果14。近年来,深度学习架构实现了自动特征提取,并在多种医疗健康应用中显著提升了预测性能15。
通过多模态学习方法,糖尿病智能分析能力已得到显著提升,该方法将结构化临床记录、生理测量数据、视网膜图像和行为指标整合到一个统一的预测框架中16。利用多种信息来源,多模态模型能够识别出在单独分析每种模态时无法察觉的模式17。基于Transformer的模型最近已能非常有效地从多种类型的医疗健康数据中学习长距离依赖关系和上下文关联18。然而,类别不平衡、数据缺失、数据异质性以及泛化能力有限等问题,仍然阻碍了多模态人工智能系统在临床环境中的广泛应用19。
尽管取得了这些进展,许多现有的糖尿病智能系统仍依赖于集中式学习框架,这种框架本质上要求将来自不同机构的患者数据集中到一个单一的存储库中20。此类方法已引发关于患者隐私、数据保管、网络安全和法规合规性的争议21。事实上,由于法律和伦理方面的考虑,医疗机构在共享敏感患者数据方面常常受到限制22。在此背景下,联邦学习正成为一种可行的解决方案,因为它能够在不共享实际患者数据的情况下训练协作模型23。通过去中心化的优化和安全的参数聚合,联邦学习能够利用地理上分散的数据集进行知识整合,从而实现隐私保护下的健康数据分析24。然而,在联邦医疗场景中,通信开销、客户端异质性和收敛稳定性仍然是主要挑战25。
目前使用的糖尿病智能系统另一个缺点是缺乏透明度以及对个体化治疗的支持。许多深度学习模型表现得如同“黑箱”,这给希望了解预测和推荐背后逻辑的临床医生带来了困扰26。可解释性人工智能(XAI)方法,例如SHAP、积分梯度法、注意力可视化和反事实推理,正显示出在提升模型透明度和增强临床医生信任方面的巨大潜力27。此外,图神经网络(GNNs)已成为捕捉患者-药物和药物-药物相互作用的最先进工具,从而实现个体化用药推荐和药物安全性评估28。新兴的扩散模型还为生成真实的合成医疗数据以及解决类别不平衡问题提供了有效解决方案29。
Transformer、联邦学习、基于扩散的合成数据生成、图神经网络以及可解释的人工智能在医疗健康应用中均已展现出良好的前景;然而,这些技术在单一可重复的糖尿病智能框架内的整合仍十分有限。现有方法通常独立处理上述各个组成部分,例如仅关注隐私保护学习而缺乏个性化治疗推荐,或进行多模态预测但未采用去中心化训练,又或实现可解释性却缺少基于图结构的临床决策支持。尽管扩散模型可用于类别平衡,Transformer 架构能够学习异构医疗数据模态间的关联,但将这些互补技术进行标准化整合的方案仍然匮乏。因此,本研究提出一种统一的方法学流程,将多模态预测、基于扩散的数据增强、联邦优化、基于图结构的个性化药物推荐以及可解释的人工智能整合于一个可重复的工作流程中,为未来的临床验证与转化应用奠定基础。
与假设可获取患者层面多模态数据集的研究不同,本方案整合了异构的公开数据集,而无需进行直接的患者匹配。针对每个数据源分别训练独立的模态特异性模型,并通过跨模态注意力机制融合潜在特征嵌入。该设计在保持方法学严谨性的同时,实现了跨多种医疗数据仓库的多模态知识整合。
本方案主要适用于方法学开发和分布式医疗人工智能环境,在此类环境中,不同来源的异构数据分布于多个独立的存储库或机构中,且无法直接进行数据集中。在当前的实现中,模态特定的数据集相互独立,且未按患者进行匹配;因此,多模态融合是在学习得到的表征层面进行,而非通过患者层面的直接对应关系实现。实际应用时需具备适当关联的多模态患者数据、各参与单位间一致的数据预处理流程和结局定义、合适的计算基础设施,以及符合相关的伦理、隐私和监管要求。
本文介绍了FedMediFormer-XAI,一种联邦多模态Transformer框架,能够在统一架构下通过预测、推荐和可解释性功能实现保护隐私的糖尿病智能分析。该框架集成了基于扩散的数据增强技术以解决类别不平衡问题、用于糖尿病预测的多模态Transformer学习、用于协作式模型开发的联邦学习、基于图神经网络的个性化药物推荐,以及可解释的人工智能方法,以透明的方式支持临床决策。所提出的FedMediFormer-XAI框架的整体架构和工作流程如图1所示。
所提出的 FedMediFormer-XAI 框架的主要贡献总结如下:(1)提出了一种统一的协议,将联邦学习、多模态 Transformer、基于扩散的数据增强、基于图神经网络的个性化药物推荐以及可解释的人工智能整合到一个可重复的糖尿病智能工作流程中。(2)开发了一种保护隐私的联邦学习策略,能够在模拟的分布式医疗客户端之间进行协同模型训练,而无需共享原始患者数据。(3)引入了一种多模态 Transformer 架构,用于从结构化临床记录、连续血糖监测数据、眼底图像以及人群健康指标中联合学习互补表征。(4)采用基于扩散的合成数据生成方法,以减少类别不平衡问题,在保留原始训练数据统计特征的同时提升模型鲁棒性。(5)采用基于 GraphSAGE 的异质图学习模块,建模患者-药物和药物-药物关系,实现个性化用药推荐及考虑药物相互作用的治疗方案排序。(6)集成了多种可解释人工智能技术,包括 SHapley Additive exPlanations(SHAP)、积分梯度、注意力可视化和反事实解释,以提高模型透明度,并提供可解释的预测与推荐结果。(7)提供了一套全面的验证协议,包括预测性能评估、联邦学习效果评估、推荐系统评估、可解释性分析、以临床医生为中心的评估、外部验证以及可重复性评估。
本研究中使用的所有数据集均来自公开可用的存储库,并包含去标识化的患者信息。这些数据集包括Pima印第安人糖尿病数据集、美国疾病控制与预防中心(CDC)糖尿病健康指标数据集、OhioT1DM数据集、APTOS 2019致盲性检测数据集、药物评论数据集以及药物-药物相互作用数据集。本研究未涉及直接的患者招募、干预措施、样本采集或对可识别个人健康信息的访问。本研究仅限于对公开可用的匿名数据集进行二次分析,以用于方法学的开发与验证,并依照机构对这类数据使用的要求开展。本方案中所述的以人为中心的评估旨在未来实施,未在当前研究中进行。开展此类评估的研究人员应获得机构伦理委员会的适当批准,获取所有参与者的书面知情同意,并遵守适用的机构要求、数据使用协议及国家法规。
1. 配置计算环境
2. 准备并预处理数据集
3. 执行基于扩散的数据增强
4. 开发多模态变换器模型
如图4所示,为结构化临床数据、连续血糖监测(CGM)序列和眼底视网膜图像配置模态特异的编码器,构建多模态Transformer模型。利用跨模态注意力机制整合所得表征,用于糖尿病预测及基于图结构的个性化药物推荐。
5. 配置联邦学习
6. 构建个性化药物推荐模块
7. 进行可解释性评估
8. 评估模型性能
9. 进行前瞻性临床医生验证
10. 进行验证与可重复性评估
预测性能分析
与评估的单模态和传统基线模型相比,FedMediFormer-XAI 表现出更优的预测性能。基于扩散的数据增强改善了少数类别的表征,其最终的预测性能总结于表3中。重复运行评估表明,各模型的预测性能在多次实验中保持稳定。FedMediFormer-XAI 实现了最高的整体性能,准确率为 94.20 ± 0.34%(95% 可信区间:93.78–94.62),精确率为 93.10 ± 0.30%(95% 可信区间:92.73–93.47),召回率为 92.80 ± 0.28%(95% 可信区间:92.45–93.15),F1 分数为 92.90 ± 0.28%(95% 可信区间:92.55–93.25)。该模型的马修斯相关系数(MCC)为 0.88 ± 0.02(95% 可信区间:0.86–0.90),ROC 曲线下面积(AUC-ROC)为 0.96 ± 0.01(95% 可信区间:0.95–0.97)。集中式多模态 Transformer 模型取得了次优的整体性能,而单模态和传统机器学习模型的预测性能相对较低。这些结果表明,多模态表征学习结合联邦优化可实现更优且更稳定的糖尿病分类性能。
消融研究
采用逐项消融法评估了扩散增强、联邦学习、基于 GraphSAGE 的药物推荐以及多模态融合的贡献。完整的 FedMediFormer-XAI 框架在五次独立运行中达到了 94.20 ± 0.34% 的准确率、93.10 ± 0.30% 的精确率、92.80 ± 0.28% 的召回率、92.90 ± 0.28% 的 F1 分数、0.88 ± 0.02 的马修斯相关系数(MCC)以及 0.96 ± 0.01 的 AUC-ROC 值。移除扩散增强后,准确率下降至 91.80 ± 0.42%,相对下降了 2.40 个百分点,F1 分数和 AUC-ROC 分别下降至 90.30 ± 0.38% 和 0.94 ± 0.01。该性能下降表明基于扩散的增强方法对少数类样本表征和预测鲁棒性的贡献。
移除联邦学习后,准确率为93.10 ± 0.37%,相较于完整框架下降了1.10个百分点。精确率、召回率、F1分数、马修斯相关系数(MCC)和ROC曲线下面积(AUC-ROC)也分别降低至92.20 ± 0.34%、91.80 ± 0.32%、92.00 ± 0.33%、0.86 ± 0.02和0.95 ± 0.01。该对比表明联邦配置对预测性能具有贡献。
移除基于 GraphSAGE 的个性化药物推荐组件后,糖尿病预测性能仅出现相对较小的变化,准确率下降至 93.80 ± 0.35%,F1 分数下降至 92.60 ± 0.30%。相应的 MCC 和 AUC-ROC 分别为 0.87 ± 0.02 和 0.96 ± 0.01。该结果表明,GraphSAGE 主要贡献于个性化用药推荐,而非直接决定糖尿病分类性能。
当移除多模态融合时,性能下降最为显著。准确率降至87.60 ± 0.55%,下降了6.60个百分点;精确率、召回率、F1分数、马修斯相关系数(MCC)和受试者工作特征曲线下面积(AUC-ROC)分别降至86.80 ± 0.51%、85.90 ± 0.54%、86.30 ± 0.52%、0.76 ± 0.03和0.91 ± 0.01。该结果表明,联合建模来自临床、连续血糖监测(CGM)和视网膜模态的互补信息具有重要意义。
联邦学习分析
联邦学习框架支持在分布式客户端之间进行协作式模型训练,同时保持原始患者数据的去中心化处理。在训练过程中,每个客户端的本地模型被单独微调,并通过联邦平均(Federated Averaging)方法进行聚合。经过100轮通信后,全局模型收敛,其预测性能与集中式学习相当。尽管各客户端的数据分布存在异质性,联邦学习框架在多轮通信中仍表现出稳定的收敛性。受保护的参数交换机制保障了数据的去中心化处理,同时全局模型相对于集中式基线仍保持具有竞争力的预测性能。表4比较了集中式与联邦学习的实现方式。由于通信开销,联邦学习需要更长的训练时间,但其预测性能与集中式学习相当。
数据集级别性能分析
为评估在不同医疗模式下的泛化能力,我们分别在各个数据集上独立评估了模型性能。多模态 FedMediFormer-XAI 模型在所评估的数据集中表现出较强且总体具有竞争力的性能。其在 Pima Indians Diabetes、CDC Diabetes Health Indicators、OhioT1DM 和 APTOS 2019 数据集上的准确率分别为 91.8%、93.1%、92.4% 和 94.2%。尽管 APTOS 2019 数据集在准确率(94.7%)和精确率(93.9%)上略高于多模态模型,但所提出的多模态方法在所有数据集中均保持了具有竞争力的性能,并取得了 0.96 的 AUC-ROC 值,与各数据集中最高的 AUC-ROC 值相当。数据集层面的整体结果如表 5所示。对于单一数据集,单独使用视网膜图像分析时性能最佳,而多模态融合则产生了最稳定且均衡性最佳的预测结果。
个性化药物推荐分析
基于图神经网络的推荐组件利用药物有效性信息和药物相互作用数据进行评估,在生成推荐时根据学习得到的患者-药物适宜性评分对候选药物进行排序,并排除禁忌组合。通过采用异质图结构,能够充分建模患者-药物和药物-药物之间的相互作用,从而支持个性化的用药选择和安全性评估。GraphSAGE 推荐模型有效捕捉了患者、疾病、实验室检查结果与药物之间的复杂关系。个性化推荐在保持高排序性能的同时,通过图邻域分析和特征归因提供了具有临床意义的解释。
根据表6,个性化药物推荐模块使用 Precision@5、Recall@5 和 NDCG@5 进行评估。这些指标用于量化基于 GraphSAGE 的推荐模块生成的前五种个性化药物推荐的相关性与排序质量。该推荐系统表现出优异的排序性能,精确率为 0.89,召回率为 0.84,NDCG 为 0.91。
可解释性分析
该框架结合了SHAP、积分梯度、注意力可视化和反事实解释,以支持对多模态预测结果的解读。其中,SHAP用于量化特征层面的贡献,积分梯度用于将预测结果归因于输入特征,注意力可视化用于考察模型在不同模态上的关注区域,反事实解释则用于识别与替代性预测相关的特征变化。图8展示了由训练好的FedMediFormer-XAI模型生成的代表性SHAP汇总图,而图9展示了从训练好的Transformer模型中提取的代表性注意力可视化结果。这些图像均为模型评估过程中获得的实际输出,而非所提出架构的示意图。
在图8中展示了特征重要性的聚合层级排序。具有较高绝对SHAP值的特征对模型预测的影响更大,并且与现有的临床知识高度一致。
图9展示了从训练好的FedMediFormer-XAI模型中直接提取的代表性注意力可视化结果,该结果来自一个随机选择的独立测试样本。可视化内容包括临床特征注意力、连续血糖监测(CGM)时间注意力、眼底图像空间注意力,以及三种模态之间的跨模态注意力。注意力可视化进一步揭示了模型在多个模态之间学习到的注意力分配机制。所选样本在临床特征中相对更关注HbA1c、糖尿病病程和年龄;CGM注意力图谱突出了多个血糖变异性显著的时间段;眼底图像注意力图谱识别出对模型表征有贡献的特定图像区域;跨模态注意力矩阵则展示了模态内和跨模态的注意力模式。如图9所示,该代表性模型生成的注意力图谱在一个独立测试样本中突显了特定的时间血糖模式、具有影响力的临床变量以及具有诊断意义的眼底图像区域。
以人为中心的评估结果
设计了一项前瞻性以人为中心的评估方案,用于评估在仅提供预测结果以及同时提供预测与解释两种条件下,临床医生对系统的信任度、可解释性、可用性、临床实用性及解释相关性。本评估将邀请内分泌科医生、糖尿病专科医生和临床药理学家参与,并已获得机构伦理委员会的适当批准及参与者的知情同意。由于该评估旨在未来进行前瞻性实施,本方案中未报告针对临床医生层面的结局评分。
表7 总结了拟议的前瞻性临床医生评估设计,以及用于评估解释对临床医生信任度、可解释性和感知效用影响的预定义标准。该前瞻性评估将使用预定义的李克特量表标准,比较临床医生在有和没有相应解释的情况下对模型预测的评估。拟议的前瞻性以人为中心的可解释性评估框架见图10

图1:FedMediFormer-XAI 框架整体架构。 FedMediFormer-XAI 框架的示意图,展示了多模态数据采集与预处理、基于扩散的数据增强、模态特异性 Transformer 学习、联邦模型训练、基于 GraphSAGE 的个性化药物推荐以及可解释性分析。该框架可生成糖尿病预测结果、个性化用药建议以及可解释的模型输出。请点击此处查看该图的放大版本。

图 2:多模态数据集获取与预处理流程。 获取和预处理 FedMediFormer-XAI 中所用多模态数据集的示意图工作流程。临床与人群健康数据、连续血糖监测记录、视网膜图像以及药理学信息在转换为适合模型使用的表示形式以进行下游分析之前,需经过特定模态的质量控制、预处理、归一化、编码和数据增强。请点击此处查看该图的放大版本。

图3: 基于扩散模型的数据增强工作流程。使用 TabDDPM 对结构化表格训练数据进行基于扩散模型增强的示意图流程。生成的样本在与原始训练数据合并以改善类别平衡之前,需经过质量评估和分布相似性评估。请点击此处查看该图的放大版本。

图4:所提出的多模态Transformer框架的架构。示意图架构包括(A) 一种用于临床数据的 TabTransformer 编码器, (B) 用于CGM数据的时间变换器编码器,以及 (C) 用于视网膜图像的视觉Transformer编码器 (D) 模态特异性表征通过跨模态注意力机制进行整合,以生成统一的多模态表征。 (E) 任务特定的预测头生成模型输出。 (F) 正则化与优化组件支持模型训练, (G分类、回归和跨模态一致性损失共同指导优化过程。所得到的多模态表示可支持下游的预测、推荐和可解释性任务。 请点击此处以查看此图的放大版本。

图5:联邦学习通信框架。跨分布式医院客户端的联邦训练示意图。使用各客户端特定的数据训练本地多模态模型,并将受保护的模型更新传输至中央服务器进行联邦平均。聚合后的全局模型被重新分发至各客户端,用于后续的通信轮次。该框架还展示了安全的参数交换,以及对隐私性、通信和计算需求的评估。请点击此处查看此图的放大版本。

图6:基于图的个性化药物推荐工作流程。 基于GraphSAGE的个性化药物推荐示意图。药理学数据与患者表征数据被组织成一个包含相关医疗实体及其关系的异质图。GraphSAGE学习患者和药物的表征,并据此计算患者与药物之间的适用性评分,对候选药物进行排序。在生成最终的Top-K推荐结果之前,会过滤掉禁忌或不安全的药物组合,基于图的信息有助于解释推荐结果。请点击此处查看该图的放大版本。

图7:可解释性评估框架。可解释性工作流程的示意图。(A)SHAP分析评估全局和局部特征贡献;(B)集成梯度提供基于归因的解释;(C)注意力可视化识别关键特征及模态间相互作用;以及(D)反事实分析识别与预测结果变化相关的特征改变。所生成的解释输出有助于模型预测的解读及个性化推荐的制定。 请点击此处查看该图的放大版本。

图8:由训练好的 FedMediFormer-XAI 模型生成的代表性基于模型的 SHAP 特征重要性分析。SHAP 汇总图展示了在评估样本中 SHAP 值的分布情况,特征按其平均绝对 SHAP 贡献度进行排序。正 SHAP 值表示对预测糖尿病风险升高有贡献,而负值表示对预测风险降低有贡献。颜色代表相应的特征值,较高的特征值以红色表示,较低的特征值以蓝色表示。该图展示的是实际由模型生成的可解释性输出结果,而非示意图。请点击此处查看该图的放大版本。

图9:FedMediFormer-XAI 模型对一个随机选择的保留测试样本生成的代表性注意力输出。(A)来自多模态 Transformer 中一个注意力头的临床特征注意力,显示分配给各临床特征的相对注意力权重。(B)连续血糖监测(CGM)序列上的时间注意力,展示模型关注程度较高的时间段。(C)眼底图像的空间注意力,包括原始图像、注意力热图及注意力叠加图。(D)临床特征、CGM 和眼底模态标记之间的跨模态注意力,展示模态内与跨模态的信息加权。所示可视化结果为训练后模型生成的输出。注意力权重针对所选测试样本展示,应被解释为模型的注意力模式,而非临床因果关系的独立度量。请点击此处查看该图的放大版本。
| 数据集 | 数据类型 | 样本/记录数 | 特征/内容 | 用途 | 公开可用性 |
| Pima Indians Diabetes Dataset | 临床表格数据 | 768 名患者 | 8 个临床变量 | 糖尿病风险预测 | 公开 |
| CDC Diabetes Health Indicators | 人群健康数据 | 253,680 条记录 | 人口统计学、生活方式、健康指标 | 人群风险分析 | 公开 |
| OhioT1DM Dataset | 连续血糖监测时间序列数据 | 12 名受试者 | 血糖、胰岛素、饮食、运动、睡眠 | 糖尿病时序建模 | 公开 |
| APTOS 2019 Blindness Detection | 视网膜图像 | 3,662 张图像 | 带有严重程度标签的眼底照片 | 糖尿病视网膜病变分析 | 公开 |
| Drug Review Dataset | 药理学数据 | 215,063 条评论 | 药物疗效、评分、用户评论 | 药物推荐 | 公开 |
| DrugBank Open Data | 药物知识图谱 | 数千种药物 | 药物-药物相互作用、靶点、通路 | 图谱构建 | 公开/学术访问 |
表1:数据集特征。 本研究中使用的公开数据集的汇总信息,包括数据集类型、样本量、数据模态、特征内容、预期用途和可获取性。
| 数据集 | 模态 | 预测目标 | 融合层次 |
| Pima Indians Diabetes | 临床 | 糖尿病分类 | 特征嵌入 |
| CDC Diabetes Health Indicators | 人群健康 | 糖尿病风险预测 | 特征嵌入 |
| OhioT1DM | 连续血糖监测 | 血糖趋势预测 | 特征嵌入 |
| APTOS 2019 | 眼底视网膜图像 | 糖尿病视网膜病变分析 | 特征嵌入 |
| Drug Review + DrugBank | 药理学 | 药物推荐 | 图嵌入 |
表2:多模态数据集整合策略。 用于多模态糖尿病智能分析的数据集汇总,包括数据模态、预测目标以及模态特异性表征的整合层级。临床数据、人群健康数据、连续血糖监测数据和视网膜图像数据均表示为特征嵌入,而药理学信息则通过图嵌入进行整合,以实现个性化药物推荐。
| 模型 | 准确率,均值 ± 标准差(95% 置信区间) | 精确率,均值 ± 标准差(95% 置信区间) | 召回率,均值 ± 标准差(95% 置信区间) | F1 分数,均值 ± 标准差(95% 置信区间) | MCC,均值 ± 标准差(95% 置信区间) | AUC-ROC,均值 ± 标准差(95% 置信区间) |
| Random Forest | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| Temporal Transformer | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| Centralized Multimodal Transformer | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
表3:糖尿病预测性能。使用准确率、精确率、召回率、F1分数、MCC和AUC-ROC指标,对FedMediFormer-XAI与基线机器学习及深度学习模型的预测性能进行比较。
| 指标 | 集中式学习 | 联邦学习 |
| 准确率 (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| 隐私保护 | 否 | 是 |
| 是否需要共享原始数据 | 是 | 否 |
| 通信轮次 | N/A | 100 |
| 训练时间(小时) | 4.8 | 5.6 |
| 法规合规性 | 中等 | 高 |
表4:联邦学习与集中式学习的性能对比。 在预测性能、原始数据共享需求、通信轮次和训练时间方面,对集中式学习与联邦学习实现方式进行比较。
| 数据集 | 准确率 (%) | 精确率 (%) | 召回率 (%) | AUC-ROC |
| Pima Indians Diabetes Dataset | 91.8 | 90.5 | 89.8 | 0.93 |
| CDC Diabetes Health Indicators | 93.1 | 92.2 | 91.6 | 0.95 |
| OhioT1DM Dataset | 92.4 | 91.8 | 91.1 | 0.94 |
| APTOS 2019 Blindness Detection | 94.7 | 93.9 | 93.5 | 0.96 |
| Multimodal Fusion (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
表5:数据集层面的结果。在各个独立数据集及多模态融合设置下的性能分析。结果展示了不同数据模态对整体预测性能的贡献。
| 指标 | 数值 |
| Precision@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| 药物相互作用检测准确率 | 0.95 |
| 推荐覆盖率 | 0.88 |
| 平均倒数排名(MRR) | 0.86 |
| 安全性合规评分 | 0.94 |
表6:个性化药物推荐性能。基于图的个性化药物推荐在排序指标、相互作用检测准确率、推荐覆盖范围和用药安全性评估方面的评价。
| 评估标准 | 拟议的评估设计 |
| 临床医生信任度 | 五点李克特量表评估 |
| 可解释性 | 五点李克特量表评估 |
| 临床相关性 | 五点李克特量表评估 |
| 解释的有用性 | 五点李克特量表评估 |
| 感知效用 | 五点李克特量表评估 |
| 评价者间一致性 | Fleiss' kappa,将在前瞻性评估后计算 |
| 统计学比较 | 配对统计检验,根据数据收集后情况选择适当方法 |
| 参与者 | 12名临床医生,需获得伦理批准并签署知情同意书 |
| 评估状态 | 前瞻性/未来评估 |
表7:拟议的以人为中心的评估标准。 拟议的以临床医生为中心的前瞻性评估框架,用于评估 FedMediFormer-XAI 解释的有用性、临床相关性、可解释性、可信度和可用性。评估包括标准化的五点李克特量表评分、使用 Fleiss' kappa 进行评分者间一致性分析、仅预测与预测加解释条件的统计比较,以及 95% 置信区间。临床医生的评估必须在获得相应机构伦理委员会批准并取得知情同意后方可进行。
补充表 1:数据集验证策略。为确保可重复性及可靠的模型评估,采用了数据集划分、验证流程、类别平衡策略和质量控制措施。请点击此处下载该文件。
补充表 2:扩散模型参数。TabDDPM 扩散模型的配置设置,包括训练参数、优化设置、潜在维度、噪声调度策略以及合成样本生成规范。请点击此处下载该文件。
补充表 3:多模态 Transformer 配置。多模态 Transformer 架构的配置,包括临床、时序和图像编码器、嵌入与融合维度、注意力头数、优化器、学习率、批量大小、训练轮数、早停准则以及联合训练损失。请点击此处下载该文件。
补充表4:联邦学习配置。 用于隐私保护的联邦训练的参数,包括参与的医院数量、通信轮次、本地训练周期数、客户端参与率、聚合算法、优化器、学习率、加密方法、通信协议以及原始数据共享策略。请点击此处下载该文件。
补充表5:GraphSAGE 配置。 基于异构 GraphSAGE 的个性化药物推荐模块的配置,包括图类型、隐藏层维度与嵌入维度、图层数量、邻域采样大小、优化器、学习率、批量大小、训练轮数、贝叶斯个性化排序损失函数,以及推荐药物的前 N 个数量。请点击此处下载该文件。
补充表6:可解释性评估指标。 用于评估FedMediFormer-XAI框架可解释性的定量与以人为中心的指标。这些指标用于评估解释的保真度、稳定性、一致性、稀疏性、完整性、敏感性、不保真度、评分者间一致性以及临床医生感知的解释质量。请点击此处下载该文件。
补充表 7:评估指标。采用预测性、联邦学习、推荐和可解释性指标来评估框架的性能、鲁棒性、排序质量及可解释性。请点击此处下载该文件。
补充表 8:以人为中心的评估设计。以临床医生为中心的评估研究设计,包括参与者分组、评估条件、评估标准和统计分析流程。请点击此处下载该文件。
补充表 9:可重复性资源。支持所提出的 FedMediFormer-XAI 框架可重复性的数据集、实现规格、配置文件、评估流程、文档和实验记录的汇总。请点击此处下载该文件。
关键发现的解读
代表性结果表明,可以将多模态 Transformer 学习、联邦学习、基于扩散的数据增强、基于图神经网络的药物推荐以及可解释的人工智能整合为一个统一的糖尿病智能框架。通过整合临床记录、人群健康指标、连续血糖监测数据、视网膜眼底图像和药理学信息,所提出的 FedMediFormer-XAI 框架在支持可解释性和去中心化模型开发的同时,表现出强大的预测性能。该多模态学习方法从不同的医疗数据模态中提取出具有信息量的特征,从而实现了更准确的糖尿病预测和个性化的治疗推荐。
联邦学习的优势
所提出框架的一个重要贡献是整合了联邦学习,以实现去中心化的协作式模型构建。与传统的集中式学习方法不同,联邦学习允许多个机构参与模型训练,而无需直接共享原始患者数据。关键研究结果表明,联邦学习在支持去中心化数据处理的同时,仍能保持与集中式学习相当的预测准确性。这一特性在医疗场景中尤为重要,因为在这些场景中,数据共享常受到机构政策和隐私保护要求的限制。
可解释性分析
可解释性评估发现,SHAP分析、积分梯度法、注意力可视化以及反事实解释均能对模型行为提供具有临床意义的洞察。从临床角度来看,全局和局部解释在最重要的预测因子上基本一致(即血糖测量值、体重指数、年龄、胰岛素给药模式以及视网膜异常)。注意力可视化还显示,Transformer架构关注的是具有临床相关性的时间序列和影像特征。这些方法通过提供对模型预测结果及特征贡献的互补性解释,提升了模型的透明度。
个性化药物推荐分析
我们提出了一种基于图神经网络(GNN)的推荐模型,该模型在建模患者-药物和药物-药物关系的同时,提供个性化的药物推荐。事实上,异质图拓扑结构不仅有助于掌握治疗效果的模式,还能兼顾用药安全性。本研究取得的优异药物推荐结果表明,基于图的学习方法在糖尿病智能系统开发中具有广阔前景,不仅限于疾病预测,还可进一步构建个性化的治疗支持框架。
以人为核心的评估
该框架纳入了一项前瞻性以人为核心的评估方案,用于评估可解释性对临床医生信任度、可理解性、可用性及感知临床效用的影响。所提出的评估将采用标准化评估标准,比较仅提供预测结果与同时提供预测结果和解释两种条件下的表现。在未来获得机构伦理委员会的适当批准并取得知情同意后,实施此项评估将为临床医生对生成解释的接受程度及其实际应用价值提供实证依据。
成功且可重复实施的关键步骤
在所提出的方案中,多个阶段需要特别注意以确保可重复性。数据集的预处理与划分应保持以患者为单位的分离,防止数据泄露,同时在联邦学习过程中应保持规定的非独立同分布(non-IID)客户端数据分布。跨模态融合应维持预设的潜在维度、注意力配置、模态类型嵌入、归一化方法以及最终投影方式。基于扩散的增强方法应使用一致的预处理和训练参数,而基于 GraphSAGE 的推荐方法应保持患者-药物表征、相互作用筛选、相关项目定义以及 Top-K 排序标准的一致性。可解释性分析应采用固定的 SHAP 背景样本、Integrated Gradients 基线、注意力提取流程以及临床允许的反事实约束条件。软件版本、随机种子、模型配置、数据集划分及评估参数均应详细记录,以尽量减少因实现环境不同而带来的变异。
局限性
在解读本研究结果时,应考虑若干局限性。首先,该框架的开发与评估依赖于公开可用的数据集,这些数据集可能无法充分代表真实世界医疗人群和临床环境的多样性。其次,尽管联邦学习在模拟的医院客户端上进行了评估,但尚未在独立的医疗机构中开展大规模验证。第三,联邦学习会引入额外的通信和计算开销,可能影响在资源受限环境中的可扩展性。最后,本研究采用的可解释性技术主要是事后解释方法,可能无法完全捕捉复杂模型的行为。
拟议的以人为中心的验证方案包括一个由12名临床专家组成的初始专家组,成员涵盖内分泌学家、糖尿病专家和临床药理学家。该样本量旨在对可用性和可解释性进行初步评估,而非用于确证性临床验证。由于专家小组规模相对较小,可能会限制统计效能和结果的普适性。因此,未来应开展前瞻性研究,纳入更大规模、多中心的临床医生队列,以代表多样化的临床环境和专业领域。
该框架的一个关键局限性在于,临床数据、连续血糖监测(CGM)、视网膜影像和药物相关模态数据来源于独立的公开数据集,而非来自同一患者的匹配多模态记录。因此,跨模态融合组件应被理解为一种整合互补模态表征的方法学框架,而非基于同一患者同步采集的多模态测量数据所得出的证据。源数据集在人群特征、采集协议、特征分布以及疾病定义方面的差异可能引入分布偏差,并限制所学习到的跨模态关系真实反映患者个体层面关联的程度。尽管该方案明确避免在独立数据集之间进行人为的患者层面匹配,但这种设计限制了对患者特异性多模态交互作用的直接评估,并可能影响临床可推广性。因此,所报告的多模态性能不应被视为等同于在一个前瞻性收集的、患者匹配的多模态队列上的验证结果。未来的研究应使用更大规模、独立采集且包含同一患者同步临床、CGM、视网膜和治疗信息的数据集对该框架进行验证。
故障排除与方案优化
在实施本方案时,可能存在若干实际影响因素。当少数类别样本不足时,类别不平衡问题可能降低模型的预测性能;可通过基于扩散的数据增强和重采样策略缓解该问题。缺失值及数据格式不一致可能影响模型稳定性,需通过严格的预处理流程予以解决。在联邦学习中,若各客户端数据集存在显著异质性,可能导致收敛过程不稳定;调整本地训练轮数、学习率及聚合频率可提升稳定性。硬件资源限制也可能影响训练效率,尤其是在处理大规模多模态数据集和Transformer架构时。在此类情况下,降低批量大小或模型复杂度可在保持可重复性的同时提升计算可行性。
未来研究方向
未来的研究可能聚焦于整合数字孪生技术,用于个性化疾病模拟与治疗方案规划。基于大规模多模态医疗数据集训练的基础模型,有望进一步提升表征学习能力与模型泛化性能。因果可解释性技术可提供对疾病机制和治疗效应的深入理解,超越基于相关性的解释。此外,强化学习方法可能支持自适应治疗优化及动态药物推荐策略。这些进展有望进一步增强糖尿病智能系统的临床实用性和个性化能力。同时,人工智能生成的预测结果与药物推荐应被视为决策支持工具,而非专业临床判断的替代。适当的人为监督对于医疗人工智能系统的负责任和合乎伦理的部署至关重要。
结论
FedMediFormer-XAI 提供了一个可重复的框架,将多模态学习、联邦训练、个性化药物推荐和可解释性整合用于糖尿病智能分析。代表性结果支持了所提出工作流程的可行性,但在临床部署前,仍需通过患者匹配的多模态数据集、更大规模的临床环境以及前瞻性临床医生评估进行进一步验证。
作者声明,他们不存在可能影响本研究工作报道的任何竞争性财务利益、利益冲突或个人关系。在本文撰写过程中,人工智能工具仅用于协助语言润色、稿件组织、格式编排和编辑。所有科学内容、研究设计、方法、数据分析、结果解释和结论均由作者开发、验证并批准。作者对本稿件中所呈现工作的准确性、完整性和原创性负全部责任。
作者感谢本研究中使用的公开数据集和开源软件资源的开发者与维护者。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AES 加密 | NIST | AES-256 | 联邦学习中静态数据/受保护的模型参数加密 |
| APTOS 2019 盲症检测数据集 | Kaggle/APTOS | 2019年发布 | 视网膜眼底图像数据集;公开可用且去标识化;https://www.kaggle.com/competitions/aptos2019-blindness-detection/data |
| Captum | Meta AI | 版本 0.8 | 模型可解释性与归因分析 |
| CUDA 工具包 | NVIDIA | 版本 12.2 | GPU加速计算 |
| 糖尿病健康指标数据集(美国疾病控制与预防中心行为风险因素监测系统 2015) | 美国疾病控制与预防中心/行为风险因素监测系统;Kaggle | 2015年发布 | 人群健康指标;公开可用且去标识化;https://www.kaggle.com/datasets/alexteboul/diabetes-health-indicators-dataset |
| 糖尿病视网膜病变检测数据集 | Kaggle | 公开发布 | 视网膜图像数据集;公开可用且去标识化;https://www.kaggle.com/c/diabetic-retinopathy-detection/data |
| 数字证书 | - | - | 联邦学习中的客户端认证 |
| 药物相互作用数据集 | Kaggle | 公开发布 | 药物-药物相互作用图数据;公开可用且已去标识化;https://www.kaggle.com/datasets/rohanharode07/drug-drug-interaction |
| 药物评价数据集 | 加州大学欧文分校机器学习资料库 | 数据集 462 | 药物疗效与评论数据集;公开可用且已去标识化;https://archive.ics.uci.edu/dataset/462/drug+review+dataset+drugs+com |
| Matplotlib | Matplotlib 开发者 | 版本 3.9 | 可视化 |
| MTS 糖尿病数据集 | Kaggle | 公开发布 | 可穿戴传感器/糖尿病预测数据集;公开可用且已去标识化;https://www.kaggle.com/datasets/marshalpatel3558/diabetespredictiondataset |
| NetworkX | NetworkX 开发者 | 版本 3.3 | 药物相互作用图谱的构建与分析 |
| NumPy | NumPy 开发者 | 版本 1.26 | 数值计算 |
| NVIDIA RTX 4090 GPU | NVIDIA | RTX 4090 | 模型训练与推理;至少 32 GB 系统内存 |
| OhioT1DM 数据集 | 俄亥俄大学 | 公开发布 | 连续血糖监测数据集;公开可用且已去标识化;https://webpages.charlotte.edu/rbunescu/data/ohiot1dm/OhioT1DM-dataset.html |
| OpenCV | OpenCV 基金会 | 版本 4.10 | 图像处理 |
| Pandas | PyData | 版本 2.2 | 数据处理与预处理 |
| 皮马印第安人糖尿病数据集 | UCI 机器学习库 | 数据集 34 | 临床糖尿病预测数据集;公开可用且已去标识化;https://archive.ics.uci.edu/dataset/34/diabetes |
| Python | Python 软件基金会 | 版本 3.11 | 主要编程环境 |
| PyTorch | Meta AI | 版本 2.3 | 深度学习模型开发与训练 |
| PyTorch Geometric | PyG 团队 | 版本 2.5 | 图神经网络的构建与训练 |
| Scikit-learn | Scikit-learn 开发者 | 版本 1.5 | 机器学习工具与评估 |
| 安全聚合机制 | - | - | 联邦学习中局部模型参数的安全聚合 |
| SHAP | SHAP 开发者 | 版本 0.47 | 可解释人工智能与特征归因分析 |
| TensorFlow | 谷歌 | 版本 2.15 | 深度学习模型开发与训练 |
| 变换器 | Hugging Face | 4.45 版本 | 基于Transformer的架构实现 |
| 传输层安全 | IETF | TLS 1.3 | 用于联邦参数交换的加密通信通道 |
| 工作站 | 通用型 | - | 计算环境;至少 32 GB 系统内存 |