研究文章

急性胆管炎合并脓毒症的风险因素分析与死亡率预测的机器学习模型

38 次观看

DOI:

10.3791/72165

2026年9月8日

* These authors contributed equally

本文内容

摘要

本文介绍了一种可解释的机器学习工作流程,用于急性胆管炎的三项特定结局任务:普通病房脓毒症预测、普通病房住院死亡率预测以及重症监护病房(ICU)28天死亡率预测。该工作流程整合了特征选择、模型比较、SHAP解释、回归分析以及列线图构建。

摘要

本研究探讨了急性胆管炎中与脓毒症相关的因素,并建立了针对脓毒症和死亡率的特异性预后模型。我们回顾性分析了来自两个中心共1,999例患者的数据,其中包括1,561例收治于普通病房的患者和438例收治于重症监护室(ICU)的患者。针对每项预测任务,数据按7:3的比例划分为训练队列和内部验证队列。构建并比较了逻辑回归(LR)、随机森林(RF)、支持向量机(SVM)和极端梯度提升(XGBoost)模型,并采用SHAP(Shapley Additive Explanations)方法进行模型解释。普通病房患者中有544例(34.85%)发生脓毒症,ICU患者中有299例(68.3%)发生脓毒症。在普通病房脓毒症预测中,LR模型在内部验证中取得最高AUC值(0.826;训练集AUC为0.893)。在普通病房队列中,脓毒症与较低的院内生存率相关;在ICU队列中,脓毒症与较差的28天生存率相关。ICU患者28天死亡率列线图纳入了急性生理评分III(APS III)、血红蛋白(Hb)、丙氨酸氨基转移酶(ALT)、乳酸(Lac)、总胆红素(TBil)、白蛋白、脓毒症状态和肾损伤,其AUC为0.840。普通病房患者院内死亡率列线图纳入了白蛋白、肾损伤、脓毒症状态、血尿素氮(BUN)、TBil和天冬氨酸氨基转移酶(AST),其AUC为0.904。经内部验证的模型显示出初步的特异性结局风险分层判别能力。在临床应用前,尚需开展多中心前瞻性外部验证。

引言

急性胆管炎是一种由胆道梗阻和细菌增殖引起的潜在危及生命的胆道感染1。该病最早由Charcot于1877年描述为“肝热”,其典型表现为Charcot三联征:发热、右上腹疼痛和黄疸。重症患者可表现为Reynolds五联征,在三联征基础上增加低血压和意识状态改变2。常见病因包括胆总管结石、胆道狭窄、胆道肿瘤及寄生虫阻塞;其中胆总管结石约占病例的一半1。胆道梗阻导致胆汁淤积和胆管内压力升高,可损害胆道上皮屏障,促进细菌移位,并引发炎症反应3。总体病死率约为2.7%至10%,但在重症病例中可高达50%4。在重症急性胆管炎中,细菌和内毒素可进入血液循环,引发全身性炎症反应和脓毒症。

脓毒症的特征是由于宿主对感染产生失调的反应而导致危及生命的器官功能障碍,并可能进展为多器官衰竭5。全球每年约发生4890万例脓毒症病例,脓毒症相关死亡占所有死亡的约19.7%6。尽管急诊和重症监护领域已取得进展,脓毒症的病死率仍然较高7。2018年东京指南(TG18)被广泛用于诊断和评估急性胆管炎的严重程度2。然而,识别合并脓毒症并预测不良预后仍具有挑战性14。因此,改进的风险分层方法可能有助于识别需要更密切评估的患者。

既往研究已发现血液学指标以及肝肾功能检测指标可作为急性胆管炎严重程度和预后的潜在标志物8。序贯器官衰竭评分(Sequential Organ Failure Assessment, SOFA)被广泛用于量化器官功能障碍,在脓毒症中具有预后评估价值9。急性生理评分III(Acute Physiology Score III, APS III)是APACHE III中的急性生理学组成部分,用于汇总生理紊乱情况,有助于重症监护病房(ICU)患者的死亡风险评估10。心血管疾病、糖尿病和慢性肝病等合并症可能进一步增加不良结局的风险11。然而,针对急性胆管炎患者脓毒症和死亡结局的特异性预测模型,目前证据仍然有限。

机器学习 increasingly 被应用于结构化临床数据,以识别复杂模式并支持风险评估12,13。因此,我们开发并进行了内部验证,构建了三种可解释的机器学习模型,分别用于以下三项不同任务:普通病房脓毒症预测、普通病房住院死亡率预测以及重症监护病房(ICU)28天死亡率预测。我们比较了LR、RF、SVM和XGBoost模型,并使用SHAP方法量化特征重要性以及解释个体预测结果。本研究的目的是评估针对不同结局的预测性能和模型可解释性,而非建立临床决策系统。在这些模型可用于常规临床应用之前,尚需进行前瞻性多中心外部验证。

方案

本研究遵循《赫尔辛基宣言》的原则进行。滨海县人民医院伦理委员会批准了本研究(批准号:2024-BHKYLL-055)。

方法

患者

我们回顾性纳入了2020年1月至2024年8月期间在中国滨海县人民医院和淮安市第二人民医院两家中心诊断为急性胆管炎的1,999名成年患者。其中,1,561名患者收治于普通病房,438名患者入住重症监护病房(ICU)。本研究方案经滨海县人民医院伦理委员会批准(批件号:2024-BHKYLL-055)。所有研究参与者或其法定授权代表均签署了书面知情同意书。

如果患者满足以下条件,则具备入选资格:(1)经医师确诊为急性胆管炎;(2)年龄在18岁及以上;(3)具有完整的医疗记录以及与相关结局对应的随访数据。

如果患者(1)患有预期会显著影响生存的并发恶性肿瘤,(2)无法提供知情同意,或(3)失访,则被排除在外。

临床数据收集与随访

临床特征和实验室数据从滨海县人民医院和淮安市第二人民医院的病历资料中回顾性提取。人口统计学和病史变量包括性别、年龄、心血管疾病、糖尿病、肝炎、肝硬化、高脂血症和脑卒中。患者入住普通病房或重症监护室(ICU)后首次可获得的实验室检测指标包括白细胞计数(WBC)、血小板计数(PLT)、血红蛋白(Hb)、白蛋白、钠、钾、氯、乳酸(Lac)、总胆红素(TBil)、丙氨酸氨基转移酶(ALT)、天冬氨酸氨基转移酶(AST)、肌酐(CR)和血尿素氮(BUN)。记录的干预措施包括胆道支架置入、内镜逆行胰胆管造影(ERCP)和经皮穿刺引流。疾病严重程度评估指标包括SOFA评分、APS III评分以及是否需要机械通气。血液标本采用标准化的自动化实验室流程进行处理。对于出院存活的患者,根据随访需要通过门诊复诊或电话联系进行随访。根据Sepsis-3标准在整个住院期间评估脓毒症状态;因此,脓毒症组包括入院时已存在脓毒症的患者以及住院期间新发脓毒症的患者。由于无法获得脓毒症确切发病时间,且住院时间被保留在最终的普通病房脓毒症模型中,因此无法为该模型建立统一的前瞻性入院时间预测时间点。该模型应被理解为一种回顾性院内风险分层模型。

结果

该研究评估了三个相关但不同的预测任务。主要结局是根据Sepsis-3标准确定的急性胆管炎普通病房患者住院期间的脓毒症状态。次要结局包括普通病房队列中的全因住院死亡率(定义为出院前死亡)以及ICU队列中的全因28天死亡率(定义为进入ICU后28天内死亡)。

统计学分析

使用Shapiro-Wilk检验评估每个连续变量的分布情况。符合正态分布的变量以均值±标准差表示,并采用独立样本Student t检验进行比较;当方差齐性假设不满足时,则使用Welch t检验。不符合正态分布的变量以中位数和四分位距(IQR)表示,并采用Wilcoxon秩和检验进行比较。分类变量以频数和百分比表示,根据情况采用卡方检验或Fisher精确检验进行比较。所有检验均为双侧检验,P < 0.05被认为具有统计学意义。

根据是否存在脓毒症对患者进行分层。在普通病房队列中,采用多变量逻辑回归分析确定与脓毒症相关的因素;结果以比值比(OR)及95%置信区间(CI)表示。采用Kaplan-Meier生存曲线和log-rank检验比较普通病房队列中伴或不伴脓毒症患者的院内生存率,以及重症监护病房(ICU)队列中28天生存率。对两个队列分别建立Cox比例风险模型,结果以风险比(HR)及95% CI表示。

构建了四个逐步调整的Cox模型。模型1未进行任何调整。模型2对年龄和性别进行了调整。模型3进一步对高血压、糖尿病、心力衰竭、脑卒中和肾损伤进行了调整。在普通病房队列中,模型4 additionally 调整了白细胞计数(WBC)、血红蛋白(Hb)、血小板计数(PLT)、白蛋白、肌酐(CR)、尿素氮(BUN)、天冬氨酸转氨酶(AST)、丙氨酸转氨酶(ALT)、钠、钾、氯和乳酸(Lac)。在ICU队列中,模型4 additionally 包含了APS III和SOFA评分,因为这些严重程度评分仅对ICU患者可用。

针对每项预测任务,均使用固定的随机种子数500,将相应的完整病例数据集按7:3的比例划分为训练队列和内部验证队列。所有特征筛选过程仅在训练队列中进行;内部验证队列不参与预测变量的筛选。在训练队列中,采用10折交叉验证的LASSO回归和Boruta算法来识别候选预测因子。对于LASSO回归,保留lambda.min处系数非零的预测因子。Boruta算法独立运行,最多进行5,000次迭代。所得候选预测因子被一致用于构建每项任务的四种模型:LR(逻辑回归)、RF(随机森林)、SVM(支持向量机)和XGBoost。二分类临床变量编码为0或1。在拟合LR、RF或XGBoost模型前,未进行人工归一化或转换处理。LASSO和SVM的缩放处理遵循各自软件实现的默认设置,并将训练队列中得出的预处理参数直接应用于内部验证队列。未使用过采样、欠采样、合成少数类过采样技术(SMOTE)或人工指定的类别加权方法。表现最优的模型定义为在四种预设模型中内部验证总体性能最高的模型,而非每种算法的完全优化版本。拟合后的训练队列模型随后在内部验证队列中进行评估。完整的工作流程见补充图1,具体实现细节见补充表1

采用受试者工作特征曲线下面积(AUC)、敏感性、特异性、召回率、F1 分数和准确率来评估模型性能。AUC 概括了在所有可能分类阈值下的区分能力,其中 0.5 表示无区分能力,1.0 表示完全区分能力。在选定的阈值下,真阳性(TP)和真阴性(TN)分别为被正确分类为阳性和阴性的样本,而假阳性(FP)和假阴性(FN)则为被错误分类的样本。在二分类中,敏感性等同于召回率,计算公式为 TP/(TP + FN);特异性为 TN/(TN + FP);精确率为 TP/(TP + FP);F1 分数为 2 × 精确率 × 召回率/(精确率 + 召回率);准确率为 (TP + TN)/(TP + TN + FP + FN)。阳性类别分别为:普通病房脓毒症预测模型中的脓毒症(编码为 1)、普通病房院内死亡预测模型中的院内死亡(编码为 1),以及 ICU 28 天死亡预测模型中的 28 天内死亡(编码为 1)。相应的阴性类别分别为无脓毒症、存活出院和 28 天存活(均编码为 0)。

选择了四种有监督的机器学习算法,以代表针对结构化临床数据的互补性策略。逻辑回归(LR)作为可解释的参考模型,用于分析相加性线性关联。随机森林(RF)代表一种基于装袋(bagging)的集成方法,能够建模非线性关系和变量交互作用,同时降低方差。支持向量机(SVM)代表一种基于边界的分类器,可在中等规模数据集中适应非线性决策边界。XGBoost 代表一种正则化提升算法,能够捕捉高阶交互作用和非线性模式。所有算法均使用相同的候选预测变量集,并在每项预测任务的相同训练集和内部验证队列中进行评估。

针对每种结局的最佳模型进行SHAP分析,以量化全局特征重要性并解释个体预测。列线图的构建遵循特定结局的流程:对于普通病房脓毒症结局,将候选预测因子纳入多变量逻辑回归模型,保留统计学上显著(P < 0.05)的变量,并将其纳入最终的列线图;对于两种死亡率结局,预测因子的选择基于相应最佳模型的全局SHAP特征重要性结果,不再进行基于P值的额外剔除。

在回顾性数据库构建过程中,缺少相关分析所需的临床、实验室或结局数据的记录在纳入最终分析数据集之前被排除。未保留详细的纳入前筛选日志,因此无法重建因数据缺失而被排除的记录数量以及原始变量层面的缺失模式。最终确定的普通病房队列(n = 1,561)和重症监护病房(ICU)队列(n = 438)在相应分析所用变量中均无缺失值(缺失率为0%),且未进行任何统计学插补。所有1,561名普通病房患者均被纳入脓毒症和住院死亡率分析,所有438名ICU患者均被纳入28天死亡率分析。最终数据集中各变量的完整性情况见补充表2

采用机器学习分析平台进行机器学习分析。使用开源统计计算环境和统计软件进行传统的统计分析。所有统计检验均为双侧检验,以 P < 0.05 为差异具有统计学意义。

结果

研究队列的基线特征

本研究共纳入1,999例因急性胆管炎住院的患者:其中1,561例属于普通病房队列,438例属于重症监护病房(ICU)队列。在普通病房队列中,544例患者发生或已存在脓毒症,1,017例无脓毒症;在ICU队列中,299例患者存在脓毒症,139例无脓毒症。按脓毒症状态分层的基线特征见表1。在普通病房队列中,合并脓毒症的患者年龄更大,血钾、天冬氨酸氨基转移酶(AST)、肌酐(CR)和血尿素氮(BUN)水平高于无脓毒症患者(均P < 0.05),而血红蛋白(Hb)、血小板(PLT)和白蛋白水平较低(均P < 0.05)。糖尿病、心力衰竭、高脂血症、肾损伤及住院时间较长在脓毒症患者中更常见或程度更重(均P < 0.05);脑卒中、高血压和肝炎在两组间差异无统计学意义。在ICU队列中,合并脓毒症患者的血钾、总胆红素(TBil)、AST、CR和BUN水平更高,白蛋白水平更低(均P < 0.05)。肾损伤和ICU住院时间较长也与脓毒症状态相关(P < 0.05),而其他评估的合并症在组间差异无统计学意义。脓毒症ICU患者的SOFA评分和APS III评分均高于无脓毒症患者(均P < 0.05)。

普通病房脓毒症预测的特征选择

普通病房数据集被分为包含1,092例患者的训练队列和包含469例患者的内部验证队列。对于脓毒症结局,训练队列包括380例脓毒症患者和712例非脓毒症患者,内部验证队列包括164例脓毒症患者和305例非脓毒症患者。对于普通病房住院期间死亡结局,训练队列包括56例死亡病例和1,036例存活者,内部验证队列包括24例死亡病例和445例存活者。ICU训练队列包括306例患者(其中28天内死亡76例,存活230例),内部验证队列包括132例患者(28天时死亡33例,存活99例)。在普通病房脓毒症预测中,最初考虑了27个变量。Boruta算法将变量分类为确认重要、暂定或排除(图1A)。其中11个变量被判定为重要变量:白蛋白、肾损伤、住院时长、肌酐(CR)、白细胞计数(WBC)、血小板计数(PLT)、心力衰竭、年龄和血红蛋白(Hb)。采用10折交叉验证的LASSO回归保留了19个候选特征(图1B,C)。随后综合考虑特征选择结果与临床相关性,最终确定11个候选预测因子:尿素氮(BUN)、肌酐(CR)、白细胞计数(WBC)、血小板计数(PLT)、年龄、心力衰竭、白蛋白、肾损伤、住院时长、血红蛋白(Hb)和肝硬化。

普通病房脓毒症预测的模型比较与SHAP解释

在普通病房脓毒症预测任务中,使用相同的训练队列和内部验证队列对LR、RF、SVM和XGBoost模型进行了比较(图2)。训练队列的AUC分别为:LR为0.893,RF为0.853,SVM为0.718,XGBoost为0.767;相应的内部验证AUC分别为0.826、0.787、0.647和0.737(图2A、B)。在所评估的四种模型中,LR在内部验证中取得了最高的AUC值和最佳的整体性能,因此被选为后续解释的模型。详细性能指标见补充表3。在评估的概率阈值范围内,决策曲线分析显示LR具有更高的净收益(图2D),校准曲线显示预测的脓毒症概率与实际观察结果之间具有良好一致性(图2E)。上述结果基于内部验证,尚不能证明该模型已具备常规临床应用的条件。

采用SHAP分析来解释所选的LR模型。图2C、F展示了预测因子的全局贡献,预测因子按其对模型估计值的总体影响进行排序。按重要性从高到低依次为:BUN、CR、WBC、PLT、年龄、心力衰竭、白蛋白、肾损伤、住院时长、Hb和肝硬化。图2G提供了个体患者的力图(force plot)。红色特征增加了脓毒症估计概率,而蓝色特征则降低了该概率。术语f(x)表示相对于基线预期的个体模型输出值。

普通病房脓毒症列线图的构建

特征选择后保留的候选预测因子被纳入多变量逻辑回归模型(表2)。在 P < 0.05 水平仍具有统计学意义的变量被纳入最终的列线图(图3A):肾损伤、心力衰竭、白细胞计数(WBC)、血小板计数(PLT)、白蛋白以及住院时间。该列线图的AUC为0.791(图3B),校准曲线显示预测的脓毒症概率与实际观察结果之间具有良好一致性(图3C)。

脓毒症与生存结局之间的关联

采用Kaplan-Meier曲线根据脓毒症状态比较生存率(图4)。在ICU队列中,脓毒症患者的28天生存率低于无脓毒症患者(图4A;log-rank P < 0.001)。在普通病房队列中,脓毒症患者的住院生存率低于无脓毒症患者(图4B;log-rank P < 0.001)。

采用四个逐步调整的Cox比例风险模型来评估脓毒症与死亡率之间的关联(表3)。在普通病房队列中,未调整模型(模型1)显示脓毒症与院内死亡率相关(HR,4.48;95% CI,2.53–7.95;P < 0.001)。在进一步调整年龄和性别后(模型2:HR,4.11;95% CI,2.31–7.32;P < 0.001)、额外合并症(模型3:HR,3.51;95% CI,1.94–6.35;P < 0.001)以及实验室指标变量后(模型4:HR,2.18;95% CI,1.15–4.15;P = 0.018),该关联仍然存在。在ICU队列中,脓毒症在模型1(HR,5.94;95% CI,3.00–11.76;P < 0.001)、模型2(HR,5.89;95% CI,2.98–11.67;P < 0.001)、模型3(HR,4.81;95% CI,2.41–9.61;P < 0.001)和模型4(HR,4.54;95% CI,2.22–9.29;P < 0.001)中均与28天死亡率显著相关。这些结果与Kaplan-Meier分析结果一致。

死亡率模型的特征选择

采用 Boruta 和 LASSO 方法筛选普通病房住院死亡率和 ICU 28 天死亡率的候选预测因子(图 5)。对于 ICU 28 天死亡率,Boruta 识别出 10 个重要变量,包括 APS III、TBil、PLT、ALT、脓毒症状态和 Hb(图 5A)。通过 10 折交叉验证的 LASSO 保留了 15 个候选特征(图 5B,C)。综合考虑两种特征筛选方法及临床相关性,最终保留了 8 个预测因子:APS III、Hb、ALT、Lac、TBil、脓毒症状态、肾损伤和白蛋白。对于普通病房住院死亡率,保留了 6 个预测因子:白蛋白、肾损伤、脓毒症状态、BUN、TBil 和 AST(图 5D–F)。

死亡结局的模型比较与SHAP解释

使用相应的训练队列和内部验证队列,比较了LR、RF、SVM和XGBoost在重症监护病房(ICU)28天死亡率预测中的表现(图6)。训练队列的AUC分别为:LR为0.831,RF为0.883,SVM为0.481,XGBoost为0.862;相应的内部验证队列AUC分别为0.773、0.810、0.322和0.805(图6A,B)。基于验证AUC及整体性能指标,RF被选为表现最优的模型。详细结果见补充表4。在评估的阈值概率范围内,决策曲线分析表明RF具有潜在的净获益(图6D),而校准曲线显示预测与观察的28天死亡概率之间仅有中等程度的一致性(图6E)。全局SHAP分析对预测因子的重要性排序如下:APS III、Hb、ALT、Lac、TBil、白蛋白、脓毒症状态和肾损伤(图6C,F)。图6G展示了一个代表性的患者个体化解释示例。

对于普通病房住院死亡率,训练队列的AUC分别为:LR 0.951,RF 0.873,SVM 0.641,XGBoost 0.902;相应的内部验证AUC分别为0.900、0.829、0.564和0.871(图7A,B)。LR的内部验证AUC最高,被选为性能最优的模型。详细结果见补充表4。在评估的阈值概率范围内,决策曲线分析显示LR具有潜在的净获益(图7D),校准曲线显示预测与实际住院死亡概率之间具有中等程度的一致性(图7E)。全局SHAP分析对预测因子的重要性排序如下:白蛋白、肾损伤、脓毒症状态、尿素氮(BUN)、总胆红素(TBil)和天冬氨酸转氨酶(AST)(图7C,F)。图7G展示了一个代表性的患者个体化解释示例。

ICU 28天死亡率及普通病房住院死亡率列线图的构建

分别使用在最佳死亡率模型中基于全局SHAP特征重要性排序的预测因子构建了独立的列线图(图8)。ICU 28天死亡率列线图纳入了APS III评分、血红蛋白(Hb)、丙氨酸氨基转移酶(ALT)、乳酸(Lac)、总胆红素(TBil)、白蛋白、脓毒症状态和肾损伤(图8A)。该模型的AUC为0.840(图8B),校准曲线显示在研究队列中,预测的28天死亡概率与实际观察结果具有一致性(图8C)。普通病房住院死亡率列线图纳入了白蛋白、肾损伤、脓毒症状态、血尿素氮(BUN)、总胆红素(TBil)和天冬氨酸氨基转移酶(AST)(图8D)。该模型的AUC为0.904(图8E),校准曲线显示在研究队列中,预测的住院死亡概率与实际观察结果具有一致性(图8F)。由于这些估计值仅来源于内部验证,因此应视为初步结果,需在独立的外部队列中进一步验证。

相对于结局事件的模型复杂性评估

通过比较每个训练队列中的结局事件数量与相应最终列线图中的预测因子数量,评估了模型的复杂性。普通病房脓毒症预测模型包含380例脓毒症事件和6个预测因子(每个预测因子对应63.3个事件)。普通病房住院死亡模型包含56例死亡事件和6个预测因子(每个预测因子对应9.3个事件),而重症监护病房(ICU)28天死亡模型包含76例死亡事件和8个预测因子(每个预测因子对应9.5个事件)。因此,脓毒症模型的事件支持充分,而两个死亡率模型的事件支持较为有限,接近通常引用的经验法则,即每个预测因子约需10个事件。

数据可用性:

本研究中使用的所有去标识化患者水平数据均可在本文附带的补充文件中公开获取。补充表5包含普通病房队列的数据,补充表6包含重症监护病房队列的数据。在提交前,所有直接个人身份信息及其他可能识别身份的信息均已被删除。

脓毒症属性分析的Boruta特征选择、交叉验证、LASSO回归图。
图1:急性胆管炎患者普通病房脓毒症预测模型的特征选择。A)Boruta特征选择分析;(B,C)LASSO回归系数路径及10折交叉验证分析。请点击此处查看该图的放大版本。

ROC 曲线与校准分析,多图表;预测、验证、SHAP 值;医学数据。
图 2:急性胆管炎患者普通病房脓毒症预测的机器学习模型比较与解释。A,B)候选机器学习模型在训练队列和内部验证队列中的 ROC 曲线;(C,F)预测因子贡献的全局 SHAP 分析;(D)决策曲线分析;(E)校准曲线;(G)代表性患者的个体化 SHAP 解释。请点击此处查看该图的高清版本。

列线图预测模型与ROC曲线;风险评估、敏感性分析、校准图。
图3:普通病房脓毒症预测列线图的构建与评估。A)列线图;(B)ROC曲线;(C)校准曲线。 请点击此处查看该图的放大版本。

显示脓毒症随时间影响的生存概率的Kaplan-Meier生存分析图。
图4:根据脓毒症状态分层的急性胆管炎患者Kaplan-Meier生存曲线。A)重症监护病房队列中伴有与不伴有脓毒症患者的28天生存率比较;(B)普通病房队列中伴有与不伴有脓毒症患者的住院生存率比较。请点击此处查看该图的放大版本。

变量重要性、交叉验证、回归系数;统计数据分析,图 A-F。
图 5:ICU 28 天死亡率和普通病房住院死亡率模型的特征选择。A)ICU 28 天死亡率的 Boruta 特征选择分析;(B,C)ICU 28 天死亡率的 LASSO 系数路径及 10 折交叉验证分析;(D)普通病房住院死亡率的 Boruta 特征选择分析;(E,F)普通病房住院死亡率的 LASSO 系数路径及 10 折交叉验证分析。请点击此处查看此图的放大版本。

ROC曲线、随机森林评分、SHAP值、验证、校准以及特征影响图表。
图6:急性胆管炎患者重症监护病房28天死亡率的机器学习模型比较与解释。A,B)候选机器学习模型在训练队列和内部验证队列中的ROC曲线;(C,F)预测因子贡献的全局SHAP分析;(D)决策曲线分析;(E)校准曲线;(G)一位代表性患者的个体化SHAP解释。请点击此处查看该图的高清版本。

ROC 曲线、SHAP 分析、校准曲线、决策曲线用于模型验证,医学数据图表。
图7:急性胆管炎患者普通病房住院死亡率的机器学习模型比较与解释。A,B)候选机器学习模型在训练队列和内部验证队列中的ROC曲线;(C,F)预测因子贡献的全局SHAP分析;(D)决策曲线分析;(E)校准曲线;(G)一位代表性患者的个体化SHAP解释。请点击此处查看该图的高清版本。

用于生存预测的列线图、ROC曲线(AUC分别为0.840和0.904)以及显示模型性能的校准图。
图8:ICU 28天死亡率和普通病房住院死亡率列线图的构建与评估。A–C)ICU 28天死亡率的列线图、ROC曲线和校准曲线;(D–F)普通病房住院死亡率的列线图、ROC曲线和校准曲线。请点击此处查看该图的高清版本。

表1:纳入患者的基线特征。 临床和实验室特征分别按普通病房组和重症监护病房(ICU)组列出,并对脓毒症患者与非脓毒症患者进行比较。请点击此处下载该文件。

表2:胆管炎患者发生脓毒症的多因素分析。 缩写:WBC:白细胞;PLT:血小板。表示 p 值小于 0.05 的数字以粗体显示。请点击此处下载该文件。

表3:脓毒症与胆管炎患者预后之间的关系。 模型1未进行调整。模型2对年龄和性别进行了调整。模型3进一步对高血压、糖尿病、心力衰竭、脑卒中和肾损伤进行了调整。对于普通病房队列,模型4 additionally 调整了白细胞计数(WBC)、血红蛋白(Hb)、血小板计数(PLT)、白蛋白、肌酐(CR)、血尿素氮(BUN)、天冬氨酸氨基转移酶(AST)、丙氨酸氨基转移酶(ALT)、钠、钾、氯和乳酸(Lac)。对于重症监护病房(ICU)队列,模型4 additionally 调整了急性生理与慢性健康评分III(APS III)、序贯器官衰竭评分(SOFA)、白细胞计数(WBC)、血红蛋白(Hb)、血小板计数(PLT)、白蛋白、肌酐(CR)、血尿素氮(BUN)、天冬氨酸氨基转移酶(AST)、丙氨酸氨基转移酶(ALT)、钠、钾、氯和乳酸(Lac)。HR,风险比;CI,置信区间;APS III,急性生理与慢性健康评分III;SOFA,序贯器官衰竭评分;WBC,白细胞计数;Hb,血红蛋白;PLT,血小板计数;CR,肌酐;BUN,血尿素氮;AST,天冬氨酸氨基转移酶;ALT,丙氨酸氨基转移酶;Lac,乳酸。加粗数值表示在P < 0.05 水平上具有统计学意义。请点击此处下载该文件。

补充图1:整体研究及机器学习工作流程。 将急性胆管炎患者分为普通病房组和重症监护室(ICU)组,并定义了三项预测任务:普通病房脓毒症、普通病房住院死亡率和ICU 28天死亡率。针对每项任务,在特征选择前,数据按7:3的比例划分为训练队列和内部验证队列。LASSO和Boruta方法仅在训练队列中进行,随后构建并比较了LR、RF、SVM和XGBoost模型。根据内部验证的表现选择最佳模型,并使用SHAP进行解释。普通病房脓毒症列线图采用多变量逻辑回归中保留的变量,而死亡率列线图则采用基于全局SHAP特征重要性优先筛选的预测因子。请点击此处下载该文件。

补充表1:详细的计算实现、预处理步骤、特征选择设置和机器学习模型参数。 缩写:AUC,受试者工作特征曲线下面积;FN,假阴性;FP,假阳性;ICU,重症监护病房;LASSO,最小绝对收缩和选择算子;LR,逻辑回归;RF,随机森林;SHAP,Shapley加性解释;SMOTE,合成少数类过采样技术;SVM,支持向量机;TN,真阴性;TP,真阳性;XGBoost,极端梯度提升。注:机器学习分析最初通过基于云的平台完成。由于该平台后续进行了升级,无法再获取确切的历史后端软件包构建版本号;因此,无法回溯报告原始分析中所使用的Python软件包版本。上述列出的算法参数值代表文档记录的预设参数设置,而非针对特定结果进行的超参数优化。请点击此处下载该文件。

补充表 2:最终普通病房和重症监护病房分析数据集中变量级别的数据完整性。 最终数据集在相应分析所包含的变量中无任何缺失值,且未进行统计学插补。在回顾性数据库构建过程中,缺少必要数据的记录已被排除;但未保留进入分析前的排除数量及原始的缺失模式。请点击此处下载该文件。

补充表3:候选机器学习模型在急性胆管炎患者普通病房脓毒症预测中的性能。 评估机器学习模型在预测急性胆管炎患者发生脓毒症方面的有效性。请点击此处下载该文件。

补充表4:候选机器学习模型在急性胆管炎患者普通病房院内死亡率和重症监护病房28天死亡率预测中的性能。 使用AUC、敏感性、特异性、召回率、F1分数和准确率,总结了LR、RF、SVM和XGBoost模型在训练队列和内部验证队列中的表现。请点击此处下载该文件。

补充表5:普通病房队列的匿名患者水平数据。 该数据集包含用于脓毒症和住院死亡率分析的临床和实验室变量。请点击此处下载该文件。

补充表6:重症监护病房队列的匿名患者个体数据。 该数据集包含用于分析28天死亡率的临床和实验室变量。请点击此处下载该文件。

讨论

急性胆管炎是一种可能危及生命的胆道感染。尽管轻度疾病通常对治疗反应良好,但在重症病例中,报道的死亡率可高达50%1,5。当出现脓毒性休克时,死亡率可能接近40%14。脓毒症表明感染已不再局限于胆道,可能迅速进展为全身性炎症反应和多器官功能障碍。因此,识别与脓毒症及不良预后相关的因素尤为重要,特别是在需要重症监护病房(ICU)治疗的患者中。

本研究纳入的1,999例患者中,843例(42.17%)患有或发生了脓毒症。普通病房队列中的比例为34.85%,重症监护病房(ICU)队列中为68.3%;ICU中比例较高可能反映了基线疾病严重程度更高。脓毒症患者往往年龄更大,这与既往研究结果一致,且可能与年龄相关的生理功能衰退、免疫功能受损以及更高的共病负担有关。15 Liu 等16 采用年龄、呼吸机支持持续时间、糖尿病、凝血功能障碍和收缩压建立了急性胆管炎脓毒症的Logistic回归列线图,报道的训练队列AUC为0.700,验证队列AUC为0.647。本研究中,Logistic回归在训练队列和内部验证队列的AUC分别为0.893和0.826。随后构建了一个更为简洁的普通病房脓毒症列线图,采用肾损伤、心力衰竭、白细胞计数(WBC)、血小板计数(PLT)、白蛋白和住院时间作为变量,获得的AUC为0.791。尽管本研究中表现最优的机器学习模型在内部验证中的AUC数值上高于先前发表的列线图,但由于研究人群、预测因子、数据来源和验证方法存在差异,该比较为间接比较。在确立比较性能和普适性之前,尚需独立的外部验证。

即使经过连续调整,脓毒症仍与死亡率相关,这支持其在急性胆管炎中的预后意义。脓毒症被定义为由宿主对感染的失调反应所导致的危及生命的器官功能障碍17。内皮功能障碍、炎症反应、氧化应激以及凝血异常可能共同导致器官功能障碍和不良结局18,19。重症监护病房(ICU)28天死亡率列线图纳入了APS III评分、血红蛋白(Hb)、丙氨酸氨基转移酶(ALT)、乳酸(Lac)、总胆红素(TBil)、白蛋白、脓毒症状态和肾损伤,其AUC为0.840。普通病房住院死亡率列线图则纳入了白蛋白、肾损伤、脓毒症状态、尿素氮(BUN)、总胆红素(TBil)和天冬氨酸氨基转移酶(AST),其AUC为0.904。Schneider等人报道,急性胆管炎死亡风险模型的平均交叉验证AUC为0.915。该数值在数值上与普通病房列线图相近,但由于两个模型在不同队列中开发和验证,因此不宜直接比较。

APS III 是 APACHE III 的急性生理学组成部分,用于总结危重患者生理紊乱的严重程度10。APS III 和 SOFA 已被用于评估危重疾病和脓毒症的预后20,21,22。TG18 支持基于临床和实验室检查结果(包括发热、白细胞计数、胆红素和白蛋白)对急性胆管炎进行诊断及早期严重程度评估。然而,在对急性胆管炎患者进行脓毒症筛查时,全身炎症反应综合征标准可能提供额外信息14。血红蛋白水平降低也与老年急性胆管炎患者的死亡率相关23。乳酸是组织低灌注和器官功能障碍的重要临床标志物;在脓毒症期间,乳酸浓度升高可能反映氧输送受损、代谢改变以及清除率下降24,25

既往研究发现,升高的胆红素和转氨酶浓度与急性胆管炎的早期死亡率相关26。胆道梗阻可导致胆汁淤积及胆管内压力升高。胆红素反流入血液循环提示胆汁排泄功能受损,而转氨酶升高则可能反映由胆汁酸毒性、炎症或继发性肝缺血引起的肝细胞损伤。

既往针对急性胆管炎中脓毒症或死亡风险的预测模型有时依赖于有限的预测因子或变量,而这些变量可能不易获得,例如微生物培养结果16,27。这些针对特定结局构建的模型主要采用常规记录的临床和实验室变量;然而,这些变量的获取时间和可获得性因医疗环境不同而存在差异。APS III 评分仅在重症监护病房(ICU)中可用,而住院天数在入院时则无法获得。因此,这些模型的实际应用价值必须在明确定义的预测时间点进行前瞻性评估。肾损伤在临床上仍具有重要意义,因为在急性胆管炎中,其与全因死亡率独立相关28

我们采用分阶段建模框架,而非依赖单一算法。LASSO 和 Boruta 作为互补的特征选择方法:LASSO 通过系数收缩来降低维度和共线性,而 Boruta 旨在识别所有相关预测因子,包括参与非线性关系或交互作用的变量。随后,使用相同的候选预测因子以及相同的训练集/内部验证集划分,构建了 LR、RF、SVM 和 XGBoost 模型。模型选择侧重于内部验证性能,而不仅仅是训练性能,这可能减少但无法完全消除过拟合。此外,还采用校准分析和决策曲线分析来评估预测风险与实际观察风险之间的一致性,并评估在不同阈值概率下的潜在净收益。

在普通病房脓毒症预测中,逻辑回归(LR)在内部验证中取得了最高的AUC值,表明在此数据集中,更复杂的非线性算法并未提供额外的预测价值。该结果并不排除存在非线性关联的可能性,因为算法性能受样本量、预测变量分布、超参数设置以及队列特征的影响。针对每项任务表现最佳的模型,采用SHAP方法量化全局特征重要性,并解释个体患者的预测估计。该框架包含三个针对不同结局和临床场景的特异性模型:普通病房脓毒症预测模型、普通病房住院死亡率模型以及重症监护病房(ICU)28天死亡率模型。脓毒症列线图保留了多变量逻辑回归中具有显著性的变量,而死亡率列线图则采用基于全局SHAP特征重要性排序的预测因子,未进一步依据P值进行剔除。该策略使预测因子集合能够反映各临床场景中可获取的信息,同时避免将仅适用于ICU的指标(如APS III)应用于普通病房患者。然而,这些经过内部验证的模型仅为用于风险分层的研究工具,不应被解读为因果模型,也不能替代临床判断。

这三个模型分别针对不同的临床场景、结局指标和评估时间点。普通病房脓毒症预测模型纳入了肾损伤、心力衰竭、白细胞计数(WBC)、血小板计数(PLT)、白蛋白以及住院时长。由于入院时无法获得住院时长数据,且未记录脓毒症的确切发病时间,因此该模型应被视为一种回顾性的院内风险分层模型,而非入院时的预测工具。普通病房院内死亡率模型纳入了白蛋白、肾损伤、脓毒症状态、血尿素氮(BUN)、总胆红素(TBil)和天冬氨酸转氨酶(AST),仅可在住院期间上述变量获得后进行计算。ICU 28天死亡率模型纳入了急性生理评分III(APS III)、血红蛋白(Hb)、丙氨酸转氨酶(ALT)、乳酸(Lac)、总胆红素(TBil)、白蛋白、脓毒症状态和肾损伤,一旦在ICU入院后获得所需信息即可进行评估。列线图将预测变量的值转化为预后概率的估计值,而SHAP值则用于解释各个变量的贡献程度。目前,这些经过内部验证的模型应被视为研究工具,提供连续的风险估计,而非固定的治疗建议。它们旨在补充Sepsis-3标准、基于TG18的评估方法以及临床判断,在常规应用前仍需进行前瞻性、多中心的外部验证。

本研究存在若干局限性。首先,回顾性设计可能引入选择偏倚、缺失数据偏倚、测量变异以及残余混杂因素。脓毒症的分类依赖于现有的医疗记录,而发病时间的不确定性可能导致分类错误。在构建分析数据库之前,已排除了缺少必要数据的记录,但未保留详细的入组前筛选日志。因此,我们无法量化这些被排除的病例,也无法比较普通病房组与重症监护病房(ICU)队列之间原始的缺失数据模式。尽管最终的数据集无缺失值,但如果数据的完整性与疾病严重程度或结局相关,则完全病例选择可能引入偏倚。实验室检测结果并非均在入院、脓毒症发病或治疗后的统一时间点获取,抗菌药物治疗、胆道引流和器官支持等干预措施可能影响实验室指标和死亡率。院内死亡率也可能受到出院或转诊实践的影响,而28天死亡率的确定则依赖于随访的完整性。尽管对已测量的协变量进行了调整,但仍无法消除未测量或随时间变化的混杂因素;因此,所报告的关联性不应解释为因果关系。

其次,尽管患者来自两家机构,但模型性能仅通过随机内部验证划分进行评估。因此,报告的性能可能过于乐观,且该模型对其他机构和人群的适用性仍不确定。需要采用时间和地域上独立的队列进行前瞻性多中心验证。此外,无法获得脓毒症确切的发病时间,因此无法区分入院时已存在的脓毒症与住院期间新发的脓毒症,也无法计算脓毒症发生前后的住院时长。由于住院时长被纳入作为预测变量,普通病房脓毒症预测模型应被理解为一种回顾性的院内风险分层模型,而非入院时或前瞻性的事件发生时间模型。

第三,LR、RF、SVM 和 XGBoost 是已建立的算法,本研究并未引入新的架构或优化框架。选择这些算法是为了有意代表适用于结构化临床数据的互补性线性、基于边距、装袋和提升策略。然而,将分析限制于这些算法可能限制了对其他非线性模式或交互作用的检测。未来的研究可评估可解释的提升方法、堆叠集成模型或其他算法,其改进应通过外部区分能力、校准效果和净收益来评判,而不仅仅是 AUC。

第四,所采用的候选算法使用了预设的默认超参数,未进行系统的超参数优化。因此,观察到的差异反映了这些预设实现方式之间的比较,可能无法代表每种算法所能达到的最佳性能。未来的研究应将嵌套交叉验证与网格搜索、随机搜索或贝叶斯超参数优化相结合,并通过外部验证确认任何性能提升。

第五,尽管采用了特征选择和内部验证以降低模型复杂度,但普通病房和重症监护室(ICU)死亡率模型每个预测因子分别仅包含9.3和9.5个训练事件。这些比值接近回归建模中通常引用的下限;因此,无法排除过拟合、估计不稳定以及验证性能不精确的可能性。需要包含更多死亡事件的更大独立队列来进一步验证。

最后,SHAP 能够提高拟合模型预测结果的可解释性,但无法建立预测变量与结果之间的因果关系。因此,所提出的模型应被视为内部验证的风险分层工具,而非临床决策系统。其临床效用和普适性需在前瞻性独立队列中进一步评估。

总之,在急性胆管炎患者中,脓毒症与普通病房队列的院内生存率降低以及重症监护病房(ICU)队列的28天生存率降低相关。本研究建立了三个针对不同结局和医疗环境的预测模型:普通病房脓毒症预测模型、普通病房院内死亡率模型和ICU 28天死亡率模型。这些模型在内部验证过程中表现出良好的区分能力,SHAP方法有助于阐明各个预测因子对模型估计值的贡献。然而,由于死亡事件数量有限、研究为回顾性设计且缺乏外部验证,研究结果仍属初步,可能存在过拟合风险。在常规临床应用之前,尚需开展前瞻性、多中心的外部验证研究。

披露

作者声明不存在任何竞争性的经济或非经济利益。在稿件修改过程中,使用了 ChatGPT(OpenAI)协助语言润色、语法修正、表达清晰性及结构优化。该工具未用于生成或分析研究数据,也未用于独立推导科学结论。所有经人工智能辅助生成的内容均已被作者严格审阅并核实,作者对稿件的准确性、完整性和原创性负全部责任。参与同意:已从所有参与者或其法定授权代表处获得书面知情同意书。

致谢

感谢本文所有合作者在数据分析和撰写方面所做的贡献。基金支持:本工作得到江苏医学院2024年校地协同创新研究项目(202491011,202491007)以及常州市科学技术局(CJ20239026,CJ20244028)的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
Boruta (R 包)[version/CRAN]在训练队列中运行的特征选择算法
glmnet / LASSO (R 包)[version/CRAN]采用 10 折交叉验证的 LASSO 回归,用于特征选择
R统计计算 R 基金会version 4.3.2开源统计计算环境
SHAP 实现[version]用于模型解释的 Shapley 加性解释方法
StataStataCorpversion 17.0用于常规分析的统计软件
XGBoost 实现[version]极端梯度提升模型
Xsmart 分析平台[version]机器学习分析平台

参考文献

  1. An Z, Braseth AL, Sahar N. Acute cholangitis: causes, diagnosis, and management. Gastroenterol Clin North Am. 2021;50:403–14.
  2. Gravito-Soares E, et al. Clinical applicability of Tokyo Guidelines 2018/2013 in diagnosis and severity evaluation of acute cholangitis and determination of a new severity model. Scand J Gastroenterol. 2018;53:329–34.
  3. Cianci P, Restini E. Management of cholelithiasis with choledocholithiasis: endoscopic and surgical approaches. World J Gastroenterol. 2021;27:4536–54.
  4. Lan Cheong Wah D, Christophi C, Muralidharan V. Acute cholangitis: current concepts. ANZ J Surg. 2017;87:554–59.
  5. Cecconi M, Evans L, Levy M, Rhodes A. Sepsis and septic shock. Lancet. 2018;392:75–87.
  6. Rudd KE, et al. Global, regional, and national sepsis incidence and mortality, 1990–2017: analysis for the Global Burden of Disease Study. Lancet. 2020;395:200–11.
  7. Xie J, et al. The epidemiology of sepsis in Chinese ICUs: a national cross-sectional survey. Crit Care Med. 2020;48:e209–e218.
  8. Wilkins T, Agabin E, Varghese J, Talukder A. Gallbladder dysfunction: cholecystitis, choledocholithiasis, cholangitis, and biliary dyskinesia. Prim Care. 2017;44:575–97.
  9. Qiu X, Lei YP, Zhou RX. SIRS, SOFA, qSOFA, and NEWS in the diagnosis of sepsis and prediction of adverse outcomes: a systematic review and meta-analysis. Expert Rev Anti Infect Ther. 2023;21:891–900.
  10. Knaus WA, et al. The APACHE III prognostic system: risk prediction of hospital mortality for critically ill hospitalized adults. Chest. 1991;100:1619–36.
  11. Pötter-Lang S, et al. Modern imaging of cholangitis. Br J Radiol. 2021;94:20210417. doi:10.1259/bjr.20210417.
  12. Banerjee S. Generating complex explanations for artificial intelligence models: an application to clinical data on severe mental illness. Life (Basel). 2024;14:807. doi:10.3390/life14070807.
  13. Karako K, Tang W. Applications of and issues with machine learning in medicine: bridging the gap with explainable AI. Biosci Trends. 2024;18:497–504.
  14. Beliaev AM, Zyul'korneeva S, Rowbotham D, Bergin CJ. Screening acute cholangitis patients for sepsis. ANZ J Surg. 2019;89:1457–61.
  15. Fathi M, Markazi-Moghaddam N, Ramezankhani A. A systematic review on risk factors associated with sepsis in patients admitted to intensive care units. Aust Crit Care. 2019;32:155–64.
  16. Liu Q, et al. A nomogram for predicting the risk of sepsis in patients with acute cholangitis. J Int Med Res. 2020;48:300060519866100. doi:10.1177/0300060519866100.
  17. Singer M, et al. The third international consensus definitions for sepsis and septic shock (Sepsis-3). JAMA. 2016;315:801–10.
  18. Joffre J, Hellman J, Ince C, Ait-Oufella H. Endothelial responses in sepsis. Am J Respir Crit Care Med. 2020;202:361–70.
  19. Mitchell E, Pearce MS, Roberts A. Gram-negative bloodstream infections and sepsis: risk factors, screening tools and surveillance. Br Med Bull. 2019;132:5–15.
  20. Fan S, Ma J. The value of five scoring systems in predicting the prognosis of patients with sepsis-associated acute respiratory failure. Sci Rep. 2024;14:4760. doi:10.1038/s41598-024-55257-5.
  21. Pérez-Fernández X, et al. Clinical variables associated with poor outcome from sepsis-associated acute kidney injury and the relationship with timing of initiation of renal replacement therapy. J Crit Care. 2017;40:154–60.
  22. Lambden S, Laterre PF, Levy MM, François B. The SOFA score—development, utility and challenges of accurate assessment in clinical trials. Crit Care. 2019;23:374. doi:10.1186/s13054-019-2663-7.
  23. Inan O, Sahiner ES, Ates I. Factors associated with clinical outcome in geriatric acute cholangitis patients. Eur Rev Med Pharmacol Sci. 2023;27:3313–21.
  24. Bakker J, Postelnicu R, Mukherjee V. Lactate: where are we now? Crit Care Clin. 2020;36:115–24.
  25. Brooks GA. The science and translation of lactate shuttle theory. Cell Metab. 2018;27:757–85.
  26. Salek J, Livote E, Sideridis K, Bank S. Analysis of risk factors predictive of early mortality and urgent ERCP in acute cholangitis. J Clin Gastroenterol. 2009;43:171–75.
  27. Schneider J, et al. Mortality risk for acute cholangitis (MAC): a risk prediction model for in-hospital mortality in patients with acute cholangitis. BMC Gastroenterol. 2016;16:15. doi:10.1186/s12876-016-0428-1.
  28. Lee TW, et al. Incidence, risk factors, and prognosis of acute kidney injury in hospitalized patients with acute cholangitis. PLoS One. 2022;17:e0267023. doi:10.1371/journal.pone.0267023.

重印与许可

标签

XGBoost SHAP