研究文章

利用大型重症监护电子病历数据库进行多模型可解释的糖尿病骨质疏松预测机器学习

DOI:

10.3791/71386

2026年6月30日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本协议描述了利用常规临床数据开发和评估可解释的集合树状机器学习模型,以预测糖尿病患者的骨质疏松风险。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

糖尿病与骨骼脆弱度增加和骨折风险升高相关;然而,在糖尿病人群中早期发现骨质疏松(OP)仍然具有挑战性。本研究旨在开发和比较多种机器学习模型,用于预测糖尿病患者的OP,同时评估其临床效用并利用SHapley加法解释(SHAP)提升模型透明度。利用MIMIC-IV数据库中常规收集的人口统计和实验室数据,训练并验证了多种机器学习算法,包括树系综、梯度提升和线性基线。模型表现通过判别指标全面评估,包括受试者工作特征曲线(AUC)下的面积和精确回忆分析,以及概率校准曲线和决策曲线分析(DCA),以评估临床净益处。利用SHAP进一步解释了表现最佳的模型,以量化和可视化特征贡献在全球和个体层面。在所有评估模型中,基于集合树的方法显示出性能提升。ExtraTrees 分类器实现了最高的验证性能(AUC = 0.862;平均精度 = 0.866)。此外,所选模型展现出优异的概率校准(Brier评分=0.154),并在DCA中展现出显著的净临床益处。SHAP分析确定性别和年龄为最具影响力的预测因子,其次是常规血液学和代谢实验室指标。局部解释为个体预测提供了临床可解读的洞见。一个可解释的集合树模型有效预测糖尿病患者的门诊风险,利用常规可用的临床变量。SHAP的整合提高了临床透明度,强有力的校准配合积极的临床净效益支持其作为糖尿病人群早期OP风险分层可靠决策支持工具的潜在应用。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

糖尿病和骨质疏松(OP)是高度普遍的慢性疾病,且日益共存,通过脆弱性骨折、残疾和医疗费用带来了沉重负担。在2型糖尿病(T2D)患者中,即使通过双能X射线吸收仪(DXA)测量的区域骨密度(BMD)保持或高于预期,骨折风险仍反常升高,凸显骨骼“质量”和全身代谢因素对骨骼脆弱性有重要贡献1,2。尽管DXA是诊断OP的临床标准,但其在许多环境中的可及性和应用仍然有限,基于DXA的评估可能低估糖尿病相关骨骼风险。在人群层面,荟广分析证据表明,OP在糖尿病患者中较为常见,尽管不同队列和临床背景的患病率估计有所不同3.因此,开发实用且可扩展的风险预测工具存在关键需求和强烈动力,这些工具利用常规收集的临床数据,提前识别高风险患者,从而指导有针对性筛查和个体化预防策略。

近年来,机器学习(ML)方法越来越多地被用于建模临床数据中的复杂非线性关系,并为糖尿病患者构建OP风险预测变量。以往的研究已证明,利用梯度增强、支持向量机、神经网络和类似命名图工具等算法,具有有前景的辨别效果。具体来说,近期进展探索了创新建模策略,如机器学习与模糊逻辑的融合,以基于可调整因素456预测门诊及糖尿病相关风险。然而,仍然存在显著的研究空白:许多现有模型是在有限的亚群中开发的(例如,仅限绝经后女性或老年2型糖尿病患者),并在有限的候选算法中进行评估,导致哪些建模选择最适合更广泛的糖尿病人群和异质电子健康记录(EHR)数据存在不确定性。此外,这些高效机器学习模型临床采用的一个关键障碍是其“黑匣子”特性,这限制了临床医生的信任,阻碍了转化为可操作的决策支持。SHapley加法解释(SHAP)通过提供病例级解释,利用Shapley值将每个预测归因于个别特征,从而帮助临床医生验证模型推理是否符合临床合理性。

为弥补这些空白,我们利用重症监护IV重症监护医疗信息市场(MIMIC-IV)重症监护EHR数据库开发并验证了糖尿病患者的OP风险预测框架7。本研究的新颖之处在于跨多个机器学习模型家族的全面基准测试,以及在大型临床复杂糖尿病队列中实现透明的基于SHAP的解释性。与仅依赖单一算法的研究不同,我们的端到端方法基于严格验证系统性地选择表现最佳的模型,并提供透明、患者层面的解释。该框架旨在提供强有力的预测表现和临床可操作的洞察,支持糖尿病患者对门诊患者的风险分层。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

数据来源与伦理声明
这项回顾性研究使用了MIMIC-IV(3.1版)的数据,该数据库是一个公开可用的去标识化重症监护EHR数据库,托管在PhysioNet上。数据库包含人口统计信息、生命体征、实验室检测、诊断、操作和用药信息。

访问MIMIC-IV需要获得资质授权,并遵守PhysioNet数据使用协议和培训要求。研究人员完成了所需的培训并获得了访问权(证书编号:68351548)。由于数据库已去标识化,本研究分析了匿名化数据,未涉及与患者的直接接触;因此,无需知情同意。完整的逐步可执行建模工作流程如 图1所示。

figure-protocol-1
图1。糖尿病患者骨质疏松(OP)风险预测的整体建模工作流程。 研究流程的示意表示,包括队列识别、数据提取、特征工程、多模型基准测试、基于验证性能的模型选择,以及基于SHAP的最终模型可解释性。 请点击此处查看该图的放大版本。

研究人群与数据提取
数据通过数据库管理工具从重症监护IV医疗信息市场(MIMIC-IV)数据库中提取。为确保可重复性,补充 文件1中提供了具体的SQL查询,包括用于队列检索的表名和过滤逻辑。诊断为糖尿病的成年患者(≥18岁)通过ICD-9编码(249,250)和ICD-10编码(E08–E13)进行识别。主要结局OP通过ICD-9代码(733.x)和ICD-10代码(M80、M81、M82)定义。在最初符合条件的糖尿病队列(n = 46,226)中,识别出3,672例阳性事件(有OP患者)和42,554例阴性事件(无OP患者)。详细的患者选择和流失流程图见 2。

figure-protocol-2
图2。患者选择和队列构建流程图。 流程图展示了从MIMIC-IV(v3.1)数据库中逐步推导队列的方法。通过ICD编码识别成年糖尿病患者,随后排除年龄和它;18年,关键数据缺失 >30%,或者无效记录。最后一批被分为OP(正面事件)和非OP(负面事件)。在分层数据集拆分前,通过随机欠采样和SMOTE对训练数据进行处理类别失衡。 请点击此处查看该图的放大版本。

特征工程
为确保多个机器学习算法间的公平基准和精确重复性,采用了相同的预处理步骤序列:特征选择、缺失值补补、连续特征尺度、类平衡和数据集拆分。完整的输入特征列表,包括变量名称、单元和数据源,详见 表1

特色总计
(n = 14,688)
训练集
(n = 9,546)
验证集
(n = 2,204)
测试集
(n = 2,938)
P值
性别0.345
男性6222 (42.36%)4045 (42.37%)935 (42.42%)1242 (42.27%)
女性8466 (57.64%)5501 (57.63%)1269 (57.58%)1696 (57.73%)
年龄0.28(−0.40,0.94)0.28(−0.43,0.94)0.23(−0.46,0.89)0.28(−0.39,0.95)0.1655
红细胞−0.14(−0.79,0.49)−0.13(−0.79,0.49)−0.17(−0.83,0.48)−0.14(−0.76,0.49)0.3641
血细胞比容−0.14(−0.81, 0.52)−0.13(−0.80,0.52)−0.14(−0.87,0.51)−0.16(−0.81,0.52)0.3709
血红蛋白−0.12(−0.79, 0.52)−0.12(−0.79, 0.51)−0.15(−0.86,0.53)−0.13(−0.78,0.52)0.3616
RDW−0.16(−0.59, 0.45)−0.17(−0.59,0.46)−0.14(−0.59,0.45)−0.17(−0.60,0.42)0.5803
磷酸盐−0.14(−0.60,0.38)−0.15(−0.61,0.38)−0.11(−0.57,0.38)−0.13 (−0.56, 0.34)0.415
多重价值0.05(−0.50,0.63)0.06(−0.50,0.65)0.03(−0.49,0.65)0.02(−0.50,0.59)0.5408
−0.10(−0.52,0.37)−0.10(−0.52,0.37)−0.10(−0.52,0.37)−0.09(−0.50,0.37)0.7797
白细胞−0.16(−0.47,0.21)−0.16(−0.47,0.20)−0.15(−0.48, 0.25)−0.16(−0.46,0.20)0.6856
阴离子间隙−0.12(−0.64,0.45)−0.13(−0.64,0.45)−0.07(−0.61,0.48)−0.13(−0.64,0.45)0.1217
肌酐−0.30(−0.48, 0.01)−0.30(−0.48, 0.01)−0.30(−0.46,0.01)−0.30(−0.48, −0.00)0.3323
MCH0.11(−0.48,0.62)0.12(−0.48,0.62)0.11(−0.47,0.62)0.09(−0.48,0.61)0.5195
血小板计数−0.09(−0.61,0.49)−0.09(−0.61,0.49)−0.08(−0.62,0.47)−0.10(−0.62,0.48)0.9709
MCHC−0.00(−0.59,0.59)−0.00(−0.60,0.59)−0.00(−0.57,0.58)0.00(−0.57,0.60)0.9263
氯化物0.05(−0.54,0.64)0.05(−0.52,0.65)0.03(−0.59,0.62)0.07(−0.52,0.62)0.4675
−0.07(−0.67,0.53)−0.09(−0.67,0.53)−0.07(−0.67,0.53)−0.07(−0.62,0.53)0.3071
0.05(−0.56,0.60)0.05(−0.55,0.60)−0.00(−0.60,0.60)0.07(−0.57,0.61)0.3492
尿素氮−0.28(−0.60,0.29)−0.28(−0.60,0.29)−0.26(−0.59,0.31)−0.28(−0.59,0.25)0.6826
总钙0.02(−0.61,0.59)0.02(−0.61,0.59)−0.01(−0.59,0.56)0.01(−0.61,0.60)0.8203

表1。研究队列的基线特征和工程特征。类别变量以n(%)表示。连续变量以标准化值的中位数(四分位区间)表示。通过适当的统计检验计算了P值以比较训练、验证和测试集的分布。

连续变量与重复测量结果在整个ICU住院观察窗口内使用算术平均值汇总,得出每位患者单一特征向量。缺失率超过30%的变量被排除。其余数值变量的缺失值则通过K最近邻(KNN)算法(n_neighbors = 5,权重=“均匀”)进行推值。类别变量用最常见的类别推算,然后用二元映射转换,任何未见的类别都被赋予零向量。

连续变量采用z分数尺度公式()标准化。在缩放前,表现出零方差的特征被明确移除。所有预处理参数(μ和σ)均严格在训练集上估计,并一致应用于验证集和测试集。

鉴于严重的类别不平衡(3,672人对42,554人),训练数据采用了混合平衡策略,以避免夸大性能估计。首先,采用随机样以减少多数负面类别,达到1:2(正负比)比例(共7,344个阴性样本)。接着,对正类应用合成少数族裔过采样技术(SMOTE),以实现最终1:1的平衡比值(7,344对7,344)8

最后,队列在患者层面被分为培训组(65%)、验证组(15%)和测试组(20%),采用分层抽样法。为了严格控制所有随机过程,涵盖补补、平衡和分裂,强制执行了全局随机种子(random_state = 42)。

模型架构
为确定糖尿病患者OP风险最合适的预测模型,采用了大规模基准测试框架,在相同的数据表示和评估协议下比较了70个ML算法变体。候选模型家族包括正则化线性分类器、支持向量机(SVM)、kNN、树系综、梯度增强架构以及多层感知器91011121314151617

与传统网格搜索不同,超参数优化是通过评估这70个训练分段模型变体中的预定义稳健配置来实现的。选择严格基于验证集上受试者工作特征(ROC)曲线(AUC)下的面积最大化。最终表现最佳的模型配置为n_estimators = 200,其他参数仍保留在 材料表中列出的软件包默认设置。评估指标,包括AUC、准确性、F1分数、准确率和召回率,采用默认的0.5概率阈值计算。

为支持临床透明度,采用TreeExplainer方法对所选模型应用了SHAP。鉴于最终模型的树状结构,采用了精确的树路径依赖期望值作为背景配置。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

模型性能比较
为确定糖尿病患者OP的最佳预测方法,系统比较了多个机器学习模型。包含了正则化线性分类器(逻辑回归)作为基线控制模型。整体性能比较总结见 图3–6。在所有评估模型中,基于集合树的方法在判别性能方面优于线性基线。

figure-results-1
图3。表现最佳模型的混淆矩阵。 在验证集上评估代表性模型的混淆矩阵,包括ET_200、ET_balanced、ET_100、RF_500、RF_entropy和RF_200。每个矩阵显示真阴性、假阳性、假阴性和真阳性计数,展示了不同模型的分类表现。

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究系统比较多种机器学习算法,以确定糖尿病患者OP的最佳预测模型。基于集合树的方法,特别是ExtraTrees模型,显示出比线性基线及其他算法家族更优的判别能力、可靠的概率校准以及更大的临床净收益。这些发现表明,非线性相互作用和复杂特征关系对于准确捕捉糖尿病人群的OP风险至关重要。

为提高临床透明度,应用了SHAP来解释所选模型。分析确定性别和年龄是最具影响力的预测因子,这与既有的生物学证据一致,这些证据表明衰老和激素变化(如雌激素缺乏或相对性性腺功能减退)与骨骼微观结构的退化有关。除了人口学因素外,血液学指标(如血红蛋白和红细胞分布宽度)及常规代谢化学指标也有助于风险预测。这些标志物可能反映了慢性炎症、肾功能障碍和酸碱失衡的累积生理效应,这些与糖尿病骨骼易感性相关。最新研究还强调了营养状况和可调整生活方式因素在糖尿病-OP共病中的作用18,19。常规收集的实验室变量的突出性表明该模型捕捉了与骨骼...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,该研究是在没有任何可能被解释为潜在利益冲突的商业或财务关系的情况下进行的。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢南通市科技项目(拨款编号)的财政支持 JC2023039)以及南通科技局社会发展指导项目(拨款号 MSZ2023054)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
CatBoostYandexv1.2 (或适用版本)针对分类特征优化的梯度提升算法
imbalanced-learn (SMOTE)Scikit-learn Contribv0.11 (或适用版本)用于执行合成少数类过采样技术以实现类平衡的库
LightGBMMicrosoft Corporationv4.0 (或适用版本)基于决策树的梯度提升框架
MatplotlibMatplotlib Development Teamv3.7 (或适用版本)用于绘制图形和性能曲线的可视化库
MIMIC-IV 临床数据库PhysioNetv3.1用作数据源的公开可用的重症监护电子健康记录数据集
Navicat PremiumPremiumSoft CyberTech Ltd.v17.0用于 SQL 基于数据提取的数据库管理工具
NumPyNumPy 开发者v1.24 (或适用版本)用于数组操作和数据处理的数值计算库
OpenPyXLEric Gazoni, Charlie Clarkv3.1 (或适用版本)用于读写 Excel 文件的库
PandasPandas 开发团队v2.0 (或适用版本)用于结构化数据集的数据处理和分析库
PostgreSQLPostgreSQL 全球开发组v14 (或适用版本)用于查询和管理 MIMIC-IV 数据的关系数据库系统
PythonPython 软件基金会v3.8+ (或适用版本)用于数据处理、建模和分析的编程语言
Scikit-learnScikit-learn 开发者v1.3 (或适用版本)用于模型开发、预处理和评估的机器学习库
SciPySciPy 开发者v1.10 (或适用版本)用于统计分析的科学计算库
SeabornMichael Waskomv0.12 (或适用版本)用于增强图形输出的统计数据可视化库
SHAP (SHapley Additive exPlanations)Scott Lundbergv0.42 (或适用版本)用于使用特征归因值解释模型预测的框架
XGBoostDMLC (分布式机器学习社区)v2.0 (或适用版本)广泛用于结构化数据建模的梯度提升算法

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

MedicineAlldiabetes mellitusosteoporosisMachine learningExtraTreesExplainable Artificial IntelligenceRisk predictionBone fragility

相关文章