$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
数据来源与伦理声明
这项回顾性研究使用了MIMIC-IV(3.1版)的数据,该数据库是一个公开可用的去标识化重症监护EHR数据库,托管在PhysioNet上。数据库包含人口统计信息、生命体征、实验室检测、诊断、操作和用药信息。
访问MIMIC-IV需要获得资质授权,并遵守PhysioNet数据使用协议和培训要求。研究人员完成了所需的培训并获得了访问权(证书编号:68351548)。由于数据库已去标识化,本研究分析了匿名化数据,未涉及与患者的直接接触;因此,无需知情同意。完整的逐步可执行建模工作流程如 图1所示。

图1。糖尿病患者骨质疏松(OP)风险预测的整体建模工作流程。 研究流程的示意表示,包括队列识别、数据提取、特征工程、多模型基准测试、基于验证性能的模型选择,以及基于SHAP的最终模型可解释性。 请点击此处查看该图的放大版本。
研究人群与数据提取
数据通过数据库管理工具从重症监护IV医疗信息市场(MIMIC-IV)数据库中提取。为确保可重复性,补充 文件1中提供了具体的SQL查询,包括用于队列检索的表名和过滤逻辑。诊断为糖尿病的成年患者(≥18岁)通过ICD-9编码(249,250)和ICD-10编码(E08–E13)进行识别。主要结局OP通过ICD-9代码(733.x)和ICD-10代码(M80、M81、M82)定义。在最初符合条件的糖尿病队列(n = 46,226)中,识别出3,672例阳性事件(有OP患者)和42,554例阴性事件(无OP患者)。详细的患者选择和流失流程图见 图2。

图2。患者选择和队列构建流程图。 流程图展示了从MIMIC-IV(v3.1)数据库中逐步推导队列的方法。通过ICD编码识别成年糖尿病患者,随后排除年龄和它;18年,关键数据缺失 >30%,或者无效记录。最后一批被分为OP(正面事件)和非OP(负面事件)。在分层数据集拆分前,通过随机欠采样和SMOTE对训练数据进行处理类别失衡。 请点击此处查看该图的放大版本。
特征工程
为确保多个机器学习算法间的公平基准和精确重复性,采用了相同的预处理步骤序列:特征选择、缺失值补补、连续特征尺度、类平衡和数据集拆分。完整的输入特征列表,包括变量名称、单元和数据源,详见 表1。
| 特色 | 总计 (n = 14,688) | 训练集 (n = 9,546) | 验证集 (n = 2,204) | 测试集 (n = 2,938) | P值 |
| 性别 | | | | | 0.345 |
| 男性 | 6222 (42.36%) | 4045 (42.37%) | 935 (42.42%) | 1242 (42.27%) | |
| 女性 | 8466 (57.64%) | 5501 (57.63%) | 1269 (57.58%) | 1696 (57.73%) | |
| 年龄 | 0.28(−0.40,0.94) | 0.28(−0.43,0.94) | 0.23(−0.46,0.89) | 0.28(−0.39,0.95) | 0.1655 |
| 红细胞 | −0.14(−0.79,0.49) | −0.13(−0.79,0.49) | −0.17(−0.83,0.48) | −0.14(−0.76,0.49) | 0.3641 |
| 血细胞比容 | −0.14(−0.81, 0.52) | −0.13(−0.80,0.52) | −0.14(−0.87,0.51) | −0.16(−0.81,0.52) | 0.3709 |
| 血红蛋白 | −0.12(−0.79, 0.52) | −0.12(−0.79, 0.51) | −0.15(−0.86,0.53) | −0.13(−0.78,0.52) | 0.3616 |
| RDW | −0.16(−0.59, 0.45) | −0.17(−0.59,0.46) | −0.14(−0.59,0.45) | −0.17(−0.60,0.42) | 0.5803 |
| 磷酸盐 | −0.14(−0.60,0.38) | −0.15(−0.61,0.38) | −0.11(−0.57,0.38) | −0.13 (−0.56, 0.34) | 0.415 |
| 多重价值 | 0.05(−0.50,0.63) | 0.06(−0.50,0.65) | 0.03(−0.49,0.65) | 0.02(−0.50,0.59) | 0.5408 |
| 镁 | −0.10(−0.52,0.37) | −0.10(−0.52,0.37) | −0.10(−0.52,0.37) | −0.09(−0.50,0.37) | 0.7797 |
| 白细胞 | −0.16(−0.47,0.21) | −0.16(−0.47,0.20) | −0.15(−0.48, 0.25) | −0.16(−0.46,0.20) | 0.6856 |
| 阴离子间隙 | −0.12(−0.64,0.45) | −0.13(−0.64,0.45) | −0.07(−0.61,0.48) | −0.13(−0.64,0.45) | 0.1217 |
| 肌酐 | −0.30(−0.48, 0.01) | −0.30(−0.48, 0.01) | −0.30(−0.46,0.01) | −0.30(−0.48, −0.00) | 0.3323 |
| MCH | 0.11(−0.48,0.62) | 0.12(−0.48,0.62) | 0.11(−0.47,0.62) | 0.09(−0.48,0.61) | 0.5195 |
| 血小板计数 | −0.09(−0.61,0.49) | −0.09(−0.61,0.49) | −0.08(−0.62,0.47) | −0.10(−0.62,0.48) | 0.9709 |
| MCHC | −0.00(−0.59,0.59) | −0.00(−0.60,0.59) | −0.00(−0.57,0.58) | 0.00(−0.57,0.60) | 0.9263 |
| 氯化物 | 0.05(−0.54,0.64) | 0.05(−0.52,0.65) | 0.03(−0.59,0.62) | 0.07(−0.52,0.62) | 0.4675 |
| 钾 | −0.07(−0.67,0.53) | −0.09(−0.67,0.53) | −0.07(−0.67,0.53) | −0.07(−0.62,0.53) | 0.3071 |
| 钠 | 0.05(−0.56,0.60) | 0.05(−0.55,0.60) | −0.00(−0.60,0.60) | 0.07(−0.57,0.61) | 0.3492 |
| 尿素氮 | −0.28(−0.60,0.29) | −0.28(−0.60,0.29) | −0.26(−0.59,0.31) | −0.28(−0.59,0.25) | 0.6826 |
| 总钙 | 0.02(−0.61,0.59) | 0.02(−0.61,0.59) | −0.01(−0.59,0.56) | 0.01(−0.61,0.60) | 0.8203 |
表1。研究队列的基线特征和工程特征。类别变量以n(%)表示。连续变量以标准化值的中位数(四分位区间)表示。通过适当的统计检验计算了P值以比较训练、验证和测试集的分布。
连续变量与重复测量结果在整个ICU住院观察窗口内使用算术平均值汇总,得出每位患者单一特征向量。缺失率超过30%的变量被排除。其余数值变量的缺失值则通过K最近邻(KNN)算法(n_neighbors = 5,权重=“均匀”)进行推值。类别变量用最常见的类别推算,然后用二元映射转换,任何未见的类别都被赋予零向量。
连续变量采用z分数尺度公式()标准化。在缩放前,表现出零方差的特征被明确移除。所有预处理参数(μ和σ)均严格在训练集上估计,并一致应用于验证集和测试集。
鉴于严重的类别不平衡(3,672人对42,554人),训练数据采用了混合平衡策略,以避免夸大性能估计。首先,采用随机样以减少多数负面类别,达到1:2(正负比)比例(共7,344个阴性样本)。接着,对正类应用合成少数族裔过采样技术(SMOTE),以实现最终1:1的平衡比值(7,344对7,344)8。
最后,队列在患者层面被分为培训组(65%)、验证组(15%)和测试组(20%),采用分层抽样法。为了严格控制所有随机过程,涵盖补补、平衡和分裂,强制执行了全局随机种子(random_state = 42)。
模型架构
为确定糖尿病患者OP风险最合适的预测模型,采用了大规模基准测试框架,在相同的数据表示和评估协议下比较了70个ML算法变体。候选模型家族包括正则化线性分类器、支持向量机(SVM)、kNN、树系综、梯度增强架构以及多层感知器9、10、11、12、13、14、15、16、17。
与传统网格搜索不同,超参数优化是通过评估这70个训练分段模型变体中的预定义稳健配置来实现的。选择严格基于验证集上受试者工作特征(ROC)曲线(AUC)下的面积最大化。最终表现最佳的模型配置为n_estimators = 200,其他参数仍保留在 材料表中列出的软件包默认设置。评估指标,包括AUC、准确性、F1分数、准确率和召回率,采用默认的0.5概率阈值计算。
为支持临床透明度,采用TreeExplainer方法对所选模型应用了SHAP。鉴于最终模型的树状结构,采用了精确的树路径依赖期望值作为背景配置。