本方案详细介绍了从 MIMIC-IV 数据库中提取重症监护病房(ICU)临床数据的方法,并逐步应用生存分析和可解释的机器学习模型,以评估血清白蛋白作为肺癌患者28天死亡率预测因子的价值。
研究文章
pinglele@sina.com
通讯作者: Ping Zhang <pinglele@sina.com>
* These authors contributed equally
本方案详细介绍了从 MIMIC-IV 数据库中提取重症监护病房(ICU)临床数据的方法,并逐步应用生存分析和可解释的机器学习模型,以评估血清白蛋白作为肺癌患者28天死亡率预测因子的价值。
血清白蛋白可反映营养状况、全身性炎症及疾病负担。然而,其在肺癌重症患者中的预后意义尚不明确。本研究旨在探讨肺癌重症监护病房(ICU)患者血清白蛋白水平与28天全因死亡率之间的关联,并评估其在机器学习(ML)模型中的预测价值。这项回顾性队列研究纳入了来自重症监护医疗信息集市数据库第四版(MIMIC-IV)的1,274名成年肺癌ICU患者。采用多变量Cox比例风险模型评估血清白蛋白与28天死亡率之间的关联。附加分析包括限制性立方样条、Kaplan–Meier生存曲线以及亚组分析。机器学习分类器使用最小绝对收缩与选择算子(LASSO)和Boruta方法进行特征筛选。最终选择逻辑回归作为最优模型,并采用SHapley加性解释(SHAP)值进行模型解读。在1,274名患者中,28天死亡率为26.9%。较低的血清白蛋白水平与较高的28天死亡率独立相关。每升高1 g/dL血清白蛋白,风险比为0.729(95% CI,0.597–0.891;p = 0.002)。在血清白蛋白四分位数间观察到逆向关联趋势(趋势性检验p <0.001),Kaplan–Meier分析显示白蛋白≥2.9 g/dL患者的死亡率较低(log-rank p < 0.0001)。逻辑回归模型在验证队列中AUC达到0.767,表明具有良好的区分度和校准能力。SHAP分析将血清白蛋白识别为28天死亡率的关键预测因子。较低的血清白蛋白水平与肺癌ICU患者的短期死亡率升高独立相关。血清白蛋白可作为该人群早期风险分层的实用生物标志物。整合白蛋白的机器学习模型表现出较强的预测性能和可解释性。
肺癌在全球范围内仍然是最常见且致死率最高的恶性肿瘤之一。根据全球癌症观察站(GLOBOCAN 2020)的报告,肺癌约占全球新确诊癌症病例的11.4%,并且是癌症相关死亡的首要原因,占全球癌症死亡总数的约18%1。尽管在早期诊断技术、化疗方案和靶向治疗策略方面已取得显著进展,但由于肺癌常在晚期才被发现且具有高度侵袭性,其总体5年生存率仍低于20%2。
大量被诊断为肺癌的患者在其疾病进程中需要进入重症监护室(ICU)接受治疗,最常见的原因是出现急性呼吸窘迫、严重感染或出血等并发症,这些并发症可能由癌症进展或治疗相关的不良反应引起。在这一患者群体中,入住ICU与不良的短期预后密切相关,报道的28天死亡率在30%至60%之间,显著高于普通ICU人群3。在既往针对肺癌患者的ICU队列研究中,合并症极为普遍,其中高血压和糖尿病分别在约46.1%和37.9%的患者中被报告。此外,近一半的患者存在中至重度的基础功能障碍(45.6%),这可能使ICU管理更加复杂,并导致较差的短期结局4。在ICU环境中对重症肺癌患者进行治疗面临显著的临床挑战。针对这些患者的临床决策通常需要对是否启动机械通气、使用血管加压药以及应用广谱抗生素等进行复杂评估,而所有这些决策都必须置于一种通常难以逆转的基础癌症背景下来综合考虑。多种因素导致此类患者早期死亡风险升高,包括广泛的肿瘤进展、持续的全身性炎症反应、器官功能受损以及营养缺乏5。低白蛋白血症常被认为是与该人群早期死亡相关的关键临床因素之一。血清白蛋白可反映癌症相关恶病质所致的慢性营养不良以及危重疾病期间的急性全身炎症反应,因此可能提供重要的预后信息6。尽管血清白蛋白在临床实践中常规检测,但其在入住ICU的肺癌患者中的预后价值尚未得到充分研究,且目前大多数风险预测工具中基本未纳入该指标7。鉴于此类患者短期死亡率高且管理复杂,迫切需要易于获取且具有实用性的生物标志物,以支持早期风险评估并指导治疗决策。在此背景下,血清白蛋白值得进一步研究,以明确其在重症肺癌患者中的预后意义8,9,10。
由于癌症相关风险因素具有复杂且相互关联的特性,传统的统计方法在有效建模高维临床数据集中内在的非线性关系方面常常面临挑战。机器学习(ML)方法的出现为提升癌症风险预测能力开辟了新的途径。包括随机森林(RF)、极端梯度提升(XGBoost)和支持向量机(SVM)在内的技术已在生物医学研究中得到广泛应用,展现出处理复杂数据模式和提供更高预测准确性的强大能力11,12。然而,这些模型的不透明性或“黑箱”特性限制了其可解释性,阻碍了其在临床环境中的应用。为克服这一缺陷,基于博弈论的SHapley加性解释(SHAP)方法被引入,作为一种增强模型透明度的有力工具13。通过计算每个特征的Shapley值,SHAP能够有效量化特定变量对模型输出的影响,从而提升模型的可解释性与可靠性14。该方法在生物医学研究中的应用日益广泛,有助于推动基于机器学习的模型在临床实践中的实际应用。
鉴于这些因素,本研究旨在利用来自重症监护医疗信息集市数据库第四版(Medical Information Mart for Intensive Care IV,MIMIC-IV)的临床信息,深入探讨血清白蛋白在肺癌危重症患者中的预后意义。为实现这一目标,我们采用了传统统计分析和机器学习(ML)方法。据我们所知,目前很少有研究将血清白蛋白作为独立的预后因素,同时评估其在机器学习模型中的临床可解释性贡献,尤其是在肺癌重症监护病房(ICU)患者中15。大多数现有研究集中于普通ICU人群或非ICU肿瘤队列,而针对危重症肿瘤患者的基于机器学习的预后模型,主要关注预测性能,却未明确评估单个生物标志物的临床贡献16。
在此背景下,本研究结合传统生存分析、机器学习方法及基于SHAP的解释技术,旨在阐明血清白蛋白与28天全因死亡率之间的关联,并在针对该高危人群量身定制的可解释性预测框架中量化其相对重要性。首先,采用多变量Cox比例风险模型评估血清白蛋白水平与28天全因死亡率之间的独立关系,并对相关混杂因素进行校正。同时,利用机器学习算法构建预测模型,以识别主要的预后决定因素,并考察血清白蛋白对整体预测能力的具体贡献。特别关注通过应用SHAP提高模型的可解释性,从而量化血清白蛋白相对于其他临床特征的相对影响。通过将血清白蛋白与常规收集的临床指标相结合,本研究旨在建立一种稳健且可解释的风险分层工具,以加强早期临床决策,为该高危人群提供个体化诊疗支持。
访问受限。请登录或开始试用以查看此内容。
数据库访问与软件环境
完成有关伦理数据使用的必要培训后(认证编号:69002811),获得对重症监护医学信息库 IV 数据库(MIMIC-IV,v3.1)的授权访问权限。根据中国《涉及人的生命科学和医学研究伦理审查办法》(2023年2月18日)第三十二条规定,使用合法获取的公开数据、在未干扰公众行为情况下产生的数据或匿名化信息的研究可免于伦理审查。本研究符合上述规定,因此豁免了机构伦理审批。研究过程中严格遵守数据使用协议和伦理准则,且研究仅用于科学目的。 使用 PostgreSQL(v17.1.11)搭建数据库环境,采用 Navicat Premium(v17)作为数据库管理与查询界面,执行 SQL 查询并导出提取的数据集用于分析。
患者选择
使用国际疾病分类第九版和第十版(ICD-9 和 ICD-10)编码在 MIMIC-IV 数据库中识别肺癌患者17。依次应用以下排除标准:年龄 <18 岁或 >90 岁;重症监护室(ICU)入院后 24 小时内缺乏血清白蛋白检测值;存在多次 ICU 或住院记录;ICU 住院时间 <24 小时。
可变提取
使用 Navicat Premium(v17)通过 PostgreSQL(v17.1.11)从 MIMIC-IV(v3.1)中提取变量,包括:人口统计学特征、生命体征、实验室检查、合并症、治疗干预、严重程度评分及结局指标。人口统计学特征:年龄、性别。入住重症监护室(ICU)后前 24 小时内的生命体征:心率(HR)、呼吸频率(RR)、血氧饱和度(SpO₂)和体温。入住 ICU 后前 24 小时内的实验室指标:血清白蛋白、葡萄糖、肌酐、尿素氮、总胆红素、血红蛋白、红细胞(RBC)计数、白细胞(WBC)计数、血小板计数、红细胞分布宽度(RDW)、丙氨酸氨基转移酶(ALT)、天冬氨酸氨基转移酶(AST)、凝血酶原时间(PT)、钙、钾、钠、氯。根据诊断记录确定的合并症:高血压、肝硬化、慢性肾病、糖尿病、慢性支气管炎、充血性心力衰竭和慢性阻塞性肺疾病(COPD)。ICU 入住时的严重程度评分:序贯器官衰竭评估(SOFA)、简化急性生理评分 II(SAPS II)、查尔森合并症指数、急性生理与慢性健康状况评分 II(APACHE II)。治疗干预措施:全身性糖皮质激素、抗生素、血管加压药。生活方式因素:吸烟史。对于所有入住 ICU 后前 24 小时内的实验室指标和严重程度评分,若存在多次测量值,则计算该时间段内所有数值的平均值st 天,并使用该值进行分析。排除缺失数据超过20%的变量。对于缺失比例≤20%的变量,采用missForest算法进行填补,该算法是一种基于随机森林的机器学习方法,适用于处理混合类型的临床数据。关键变量的缺失数据比例见下文 补充表1.
结局定义
将主要结局定义为重症监护病房(ICU)入院后28天内的全因死亡率。利用MIMIC-IV数据库中可获取的死亡记录确定死亡状态。根据28天死亡状态将患者分类为生存者或非生存者。
统计学分析
使用Shapiro–Wilk检验评估连续变量的分布情况。对于正态分布的变量,采用Student t检验进行比较;对于非正态分布的变量,采用Wilcoxon秩和检验进行比较。分类变量的比较采用卡方检验。采用10折交叉验证的最小绝对收缩与选择算子(LASSO)回归方法筛选候选变量并减少多重共线性。构建多变量Cox比例风险模型,以评估血清白蛋白与28天死亡率之间的独立关联。血清白蛋白以连续变量和分类变量两种形式纳入模型,并调整由LASSO回归筛选出的协变量。估计风险比(HR)及其95%置信区间(CI)。采用限制性立方样条(RCS)分析探索非线性关联。样条结点设置在白蛋白分布的预定义百分位数处,并通过检验样条项来评估非线性关系。绘制Kaplan–Meier生存曲线,并使用log-rank检验比较生存分布。
机器学习模型的开发与验证
在患者层面将数据集随机分为训练集(70%)、验证集(15%)和独立测试集(15%)。仅在训练集上进行特征选择,通过LASSO回归和Boruta算法所选出变量的交集确定特征,确保仅保留稳定且相关的预测变量。在训练集上训练八种机器学习分类器,包括逻辑回归、随机森林、决策树、支持向量机、XGBoost、LightGBM、互补朴素贝叶斯和支持向量分类器。模型性能首先在验证集中进行评估,随后在独立测试集中通过ROC曲线下面积(AUC-ROC)、PR曲线下面积(AUC-PR)、准确率、敏感性、特异性、校准曲线、决策曲线分析和学习曲线加以确认。
模型解释与终点
根据验证集的性能指标确定表现最优的机器学习模型。应用SHapley加性解释(SHAP)方法量化每个特征对死亡率预测的贡献程度。生成SHAP汇总图和依赖关系图,以可视化血清白蛋白及其他预测因子的相对重要性及其作用方向。通过整合统计学与机器学习结果,构建可解释的风险分层框架,完成分析。
访问受限。请登录或开始试用以查看此内容。
基线特征
共识别并提取了来自 MIMIC-IV 数据库的 1,274 例肺癌患者(图 1)。队列患者的中位年龄为 69 岁(IQR:61–77),男性占 51.18%。总体而言,343 例患者(26.92%)在进入重症监护室(ICU)后 28 天内死亡。按 28 天生存状态分层的基线特征见表 1。与存活者相比,非存活者的疾病严重程度显著更高,表现为 APACHE II、Charlson 合并症指数、SAPS II 和 SOFA 评分升高(均 p < 0.001)。在生命体征方面,非存活者的呼吸频率和心率更高,血氧饱和度更低(均 p < 0.01),而体温差异无统计学意义。实验室检查结果显示,非存活者的白细胞计数、红细胞分布宽度、尿素氮、肌酐、总胆红素、AST、ALT、钾离子浓度和凝血酶原时间显著升高,同时血红蛋白、血小板计数和血清白蛋白水平较低(均 p < 0.05)。值得注意的是,非存活者的血清白蛋白水平明显降低[非存活者中位数为...
访问受限。请登录或开始试用以查看此内容。
本研究利用MIMIC-IV数据库,探讨了肺癌重症监护病房(ICU)患者血清白蛋白水平与28天全因死亡率之间的关联。即使在调整了多种临床协变量后,较低的血清白蛋白水平仍独立地与较高的28天死亡风险相关。该关联在多种分析方法中均保持一致,包括Cox比例风险模型和机器学习方法。亚组分析进一步表明,该关联在多个临床相关分层中均具有稳定性,且未检测到显著的交互作用。此外,基于SHAP值的模型解释揭示了血清白蛋白在预测短期死亡率中的相对重要性,提示其在该人群临床风险评估中的潜在应用价值。
我们的研究结果与既往研究一致,均将低白蛋白血症确定为重症监护病房(ICU)患者不良预后的强有力预测因子6,18。低白蛋白血症在危重患者中始终与死亡率升高、ICU住院时间延长以及并发症风险增加相关19,20,21
访问受限。请登录或开始试用以查看此内容。
作者声明无竞争利益。
我们衷心感谢所有作者为本研究所做出的重要贡献;他们宝贵的努力对研究的成功起到了关键作用。本研究由国家自然科学基金(82174415,82405441)、中国中医科学院科技创新项目(CI2021A01818,C12021A03307,C12021A05054)以及中国中医科学院望京医院高水平中医医院建设项目——中医药临床循证研究专项(WJYY-XZKT-2023-25)资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 重症监护医疗信息集市 IV(MIMIC-IV)数据库 | 麻省理工学院 | http: //mimic.physionet.org/ | |
| Navicat Premium (v17) | PremiumSoft CyberTech Ltd. | ||
| PostgreSQL (v17.1.11) | PostgreSQL 全球开发小组 | ||
| Python (v3.10) | Python 软件基金会 | ||
| R 统计软件 (v4.2.3) | 统计计算 R 基金会 | ||
| SHapley 加性解释(SHAP) | 开源软件 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可