연구 논문

패혈증을 동반한 급성 담관염의 위험 요인 분석 및 사망률 예측을 위한 머신러닝 모델

38 조회수

DOI:

10.3791/72165

2026년 9월 8일

* These authors contributed equally

이 논문에서

요약

본 논문에서는 급성 담관염의 세 가지 결과 특이적 과업, 즉 일반 병동 패혈증 예측, 일반 병동 내 사망률 예측, 그리고 ICU 28일 사망률 예측을 위한 해석 가능한 머신러닝 워크플로우를 설명합니다. 이 워크플로우는 특성 선택, 모델 비교, SHAP 해석, 회귀 분석 및 노모그램 구축을 통합합니다.

초록

본 연구에서는 급성 담관염 환자의 패혈증과 관련된 요인을 조사하고, 패혈증 및 사망률에 특화된 결과 예측 모델을 개발하였습니다. 일반 병동에 입원한 1,561명과 ICU에 입원한 438명을 포함하여 두 센터의 환자 1,999명으로부터 얻은 데이터를 후향적으로 분석하였습니다. 각 예측 과제에 대해 데이터는 7:3의 비율로 훈련 코호트와 내부 검증 코호트로 나누었습니다. 로지스틱 회귀(LR), 랜덤 포레스트(RF), 서포트 벡터 머신(SVM) 및 Extreme Gradient Boosting(XGBoost) 모델을 개발하여 비교하였으며, 해석을 위해 Shapley Additive Explanations(SHAP)를 사용하였습니다. 패혈증은 일반 병동 환자 544명(34.85%)과 ICU 환자 299명(68.3%)에서 발생하였습니다. 일반 병동의 패혈증 예측에서 LR이 가장 높은 내부 검증 AUC(0.826; 훈련 AUC, 0.893)를 달성하였습니다. 패혈증은 일반 병동 코호트의 원내 생존율 저하 및 ICU 코호트의 28일 생존율 저하와 관련이 있었습니다. ICU 28일 사망률 노모그램은 Acute Physiology Score III(APS III), hemoglobin(Hb), alanine aminotransferase(ALT), lactate(Lac), total bilirubin(TBil), albumin, 패혈증 상태 및 신손상을 통합하여 0.840의 AUC를 나타냈습니다. 일반 병동 원내 사망률 노모그램은 albumin, 신손상, 패혈증 상태, blood urea nitrogen(BUN), TBil 및 aspartate aminotransferase(AST)를 통합하여 0.904의 AUC를 나타냈습니다. 내부 검증된 모델들은 결과별 위험 층화에 대해 예비적인 판별 능력을 보여주었습니다. 임상 적용에 앞서 전향적 다기관 외부 검증이 필요합니다.

서론

급성 담관염은 담도 폐쇄와 세균 증식으로 인해 발생하는 잠재적으로 생명을 위협하는 담도 감염입니다1. 1877년 샤르코(Charcot)가 "간열(liver fever)"로 처음 기술하였으며, 전형적인 증상은 발열, 우상복부 통증, 황달로 구성된 샤르코 3징후(Charcot triad)입니다. 중증 질환의 경우 저혈압과 의식 변화가 추가된 레이놀즈 5징후(Reynolds pentad)로 나타날 수 있습니다2. 일반적인 원인으로는 총담관결석, 담도 협착, 담도 종양 및 기생충성 폐쇄가 있으며, 그 중 총담관결석이 전체 사례의 약 절반을 차지합니다1. 담도 폐쇄는 담즙 정체와 관 내 압력 증가를 유발하며, 이는 담관 상피 장벽을 손상시키고 세균 전위를 촉진하며 염증을 유발할 수 있습니다3. 전체 사망률은 약 2.7%에서 10% 사이이지만, 중증 질환의 경우 50%에 달할 수 있습니다4. 중증 급성 담관염에서는 세균과 내독소가 혈류로 유입되어 전신 염증과 패혈증을 유발할 수 있습니다.

패혈증은 감염에 대한 호스트 반응의 조절 장애로 인해 발생하는 생명을 위협하는 장기 기능 부전이 특징이며, 다장기 부전으로 진행될 수 있습니다5. 전 세계적으로 매년 약 4,890만 건의 패혈증 사례가 발생하는 것으로 추정되며, 패혈증 관련 사망은 전체 사망의 약 19.7%를 차지합니다6. 응급 및 중환자 치료의 발전에도 불구하고 패혈증 사망률은 여전히 상당한 수준입니다7. 도쿄 가이드라인 2018 (TG18)은 급성 담관염의 진단 및 중증도 분류에 널리 사용됩니다2. 그러나 동반된 패혈증을 식별하고 불량한 예후를 예측하는 것은 여전히 어려운 과제로 남아 있습니다14. 따라서 개선된 위험 계층화 접근 방식은 더욱 세밀한 평가가 필요한 환자를 식별하는 데 도움이 될 수 있습니다.

이전 연구들은 혈액학적 지표와 간 및 신장 기능 측정치를 급성 담관염의 중증도와 예후를 예측하는 잠재적 마커로 확인하였습니다8. 순차적 장기 부전 평가(SOFA) 점수는 장기 기능 부전을 정량화하는 데 널리 사용되며, 패혈증에서 예후적 가치를 가집니다9. APACHE III의 급성 생리학 구성 요소인 급성 생리학 점수 III(APS III)는 생리학적 이상 상태를 요약하며 ICU 환자의 사망 위험 평가에 기여합니다10. 심혈관 질환, 당뇨병, 만성 간 질환과 같은 동반 질환은 불량한 결과의 위험을 더욱 증가시킬 수 있습니다11. 그럼에도 불구하고, 급성 담관염에서 패혈증 및 사망률에 특화된 결과 예측 모델에 관한 근거는 여전히 제한적입니다.

정형 임상 데이터에서 복잡한 패턴을 식별하고 위험도 추정을 지원하기 위해 머신러닝이 점점 더 많이 적용되고 있습니다12,13. 이에 따라, 본 연구진은 일반 병동 패혈증 예측, 일반 병동 내 사망률 예측, 그리고 ICU 28일 사망률 예측이라는 세 가지 서로 다른 과제에 대해 해석 가능한 머신러닝 모델을 개발하고 내부적으로 검증하였습니다. LR, RF, SVM, XGBoost를 비교하였으며, 특성 중요도를 정량화하고 개별 예측을 설명하기 위해 SHAP을 사용하였습니다. 본 연구의 목적은 임상 의사결정 시스템을 구축하는 것이 아니라, 결과별 예측 성능과 모델의 해석 가능성을 평가하는 것이었습니다. 이러한 모델들이 일상적인 임상 진료에 고려되기 위해서는 전향적 다기관 외부 검증이 필요합니다.

프로토콜

본 연구는 헬싱키 선언의 원칙에 따라 수행되었습니다. 빈하이 현 인민병원 윤리위원회로부터 승인을 받았습니다(승인 번호 2024-BHKYLL-055).

방법론

환자

본 연구에서는 2020년 1월부터 2024년 8월 사이에 Binhai County People's Hospital과 Huai'an Second People's Hospital 두 곳에서 급성 담관염 진단을 받은 성인 1,999명을 후향적으로 모집하였습니다. 이들 환자 중 1,561명은 일반 병동에서 관리되었으며, 438명은 중환자실(ICU)에 입원하였습니다. 본 연구 프로토콜은 Binhai County People's Hospital 윤리위원회(승인 번호 2024-BHKYLL-055)의 승인을 받았습니다. 각 참여자 또는 법적 대리인으로부터 서면 동의서를 얻었습니다.

환자는 (1) 의사에 의해 급성 담관염 진단을 받았고, (2) 18세 이상이며, (3) 관련 결과에 대한 완전한 의료 기록 및 추적 관찰 데이터를 보유한 경우 적격한 것으로 간주되었습니다.

환자가 (1) 생존에 상당한 영향을 미칠 것으로 예상되는 동반 악성 종양이 있거나, (2) 고지된 동의를 제공할 수 없거나, (3) 추적 관찰이 불가능한 경우 대상에서 제외되었습니다.

임상 데이터 수집 및 추적 관찰

임상적 특성과 실험실 데이터는 Binhai County People's Hospital 및 Huai'an Second People's Hospital의 의무 기록에서 후향적으로 추출되었습니다. 인구통계학적 및 병력 변수에는 성별, 연령, 심혈관 질환, 당뇨병, 간염, 간경변증, 고지혈증 및 뇌졸중이 포함되었습니다. 일반 병동 또는 ICU 입원 후 처음으로 측정 가능한 실험실 수치에는 백혈구 수(WBC), 혈소판 수(PLT), 헤모글로빈(Hb), 알부민, 나트륨, 칼륨, 염소, 젖산(Lac), 총 빌리루빈(TBil), 알라닌 아미노전이효소(ALT), 아스파르테이트 아미노전이효소(AST), 크레아티닌(CR) 및 혈액 요소 질소(BUN)가 포함되었습니다. 기록된 중재술에는 담도 스텐트 삽입술, 내시경적 역행성 담췌관 조영술(ERCP) 및 경피적 배액술이 포함되었습니다. 질환 중증도 척도로는 SOFA 점수, APS III 및 기계적 환기 필요 여부가 포함되었습니다. 혈액 표본은 표준화된 자동화 실험실 절차를 사용하여 처리되었습니다. 생존 퇴원한 환자는 추적 관찰이 필요한 경우 외래 방문 또는 전화 연락을 통해 추적 관찰되었습니다. 패혈증 상태는 Sepsis-3 기준에 따라 입원 기간 동안 평가되었으며, 따라서 패혈증 군에는 입원 시 패혈증이 있었던 환자와 이후에 패혈증이 발생한 환자가 모두 포함되었습니다. 패혈증의 정확한 발생 시간을 알 수 없었고 최종 일반 병동 패혈증 모델에 병원 재원 기간이 유지되었기 때문에, 해당 모델에 대해 동일한 전향적 입원 시간 예측 랜드마크를 설정할 수 없었습니다. 따라서 본 모델은 후향적 원내 위험 층화 모델로 해석되어야 합니다.

결과

본 연구에서는 서로 연관되어 있으나 구별되는 세 가지 예측 과제를 평가하였습니다. 일차 결과 지표는 Sepsis-3 기준에 따라 판정한 급성 담관염 일반 병동 환자의 입원 중 패혈증 발생 여부였습니다. 이차 결과 지표는 일반 병동 코호트의 퇴원 전 사망으로 정의된 모든 원인에 의한 원내 사망률과, ICU 코호트의 ICU 입원 후 28일 이내 사망으로 정의된 모든 원인에 의한 28일 사망률이었습니다.

통계 분석

각 연속 변수의 분포는 Shapiro-Wilk 검정을 통해 평가하였습니다. 정규 분포를 따르는 변수는 평균 ± 표준 편차로 나타내었으며, 독립 표본 Student's t-test를 사용하여 비교하였습니다. 분산의 동질성 가정을 충족하지 않는 경우에는 Welch's t-test를 사용하였습니다. 정규 분포를 따르지 않는 변수는 중앙값과 사분위수 범위(IQR)로 나타내었으며, Wilcoxon rank-sum 검정을 사용하여 비교하였습니다. 범주형 변수는 빈도와 백분율로 나타내었으며, 적절한 경우 카이제곱 검정 또는 Fisher's exact 검정을 사용하여 비교하였습니다. 모든 검정은 양측 검정으로 수행하였으며, P < 0.05를 통계적으로 유의한 것으로 간주하였습니다.

환자들은 패혈증의 유무에 따라 층화되었습니다. 일반 병동 코호트에서는 다변량 로지스틱 회귀 분석을 사용하여 패혈증과 관련된 요인을 식별하였으며, 결과는 95% 신뢰구간(CIs)을 포함한 오즈비(ORs)로 보고되었습니다. 일반 병동 코호트의 원내 생존율과 ICU 코호트의 28일 생존율을 패혈증 유무에 따라 비교하기 위해 Kaplan-Meier 곡선과 로그 순위법(log-rank test)을 사용하였습니다. 두 코호트에 대해 각각 Cox 비례 위험 모델을 적용하였으며, 결과는 95% CIs를 포함한 위험비(HRs)로 보고되었습니다.

네 단계로 점진적으로 보정된 Cox 모델을 구축하였습니다. 모델 1은 보정하지 않은 모델입니다. 모델 2는 연령과 성별을 보정하였습니다. 모델 3은 여기에 고혈압, 당뇨병, 심부전, 뇌졸중 및 신장 손상을 추가로 보정하였습니다. 일반 병동 코호트의 경우, 모델 4에서 WBC, Hb, PLT, albumin, CR, BUN, AST, ALT, sodium, potassium, chloride 및 Lac를 추가로 보정하였습니다. ICU 코호트의 경우, 중증도 점수인 APS III와 SOFA가 ICU 환자에게만 해당되었으므로 모델 4에 이를 추가로 포함하였습니다.

각 예측 작업에 대해, 고정된 랜덤 시드 500을 사용하여 해당 완전 사례 데이터셋을 훈련 코호트와 내부 검증 코호트로 7:3 비율로 나누었습니다. 모든 특성 선택 절차는 오직 훈련 코호트에서만 수행되었으며, 내부 검증 코호트는 예측 변수 선택에 사용되지 않았습니다. 훈련 코호트 내에서는 10-겹 교차 검증을 이용한 LASSO 회귀와 Boruta 알고리즘을 사용하여 후보 예측 변수를 식별했습니다. LASSO의 경우, lambda.min에서 0이 아닌 계수를 가진 예측 변수를 유지했습니다. Boruta는 최대 5,000회 반복까지 독립적으로 실행되었습니다. 도출된 후보 예측 변수들은 각 작업에 대해 LR, RF, SVM 및 XGBoost의 네 가지 모델을 개발하는 데 일관되게 사용되었습니다. 이진 임상 변수는 0 또는 1로 인코딩되었습니다. LR, RF 또는 XGBoost를 적합시키기 전 단계에서 수동 정규화나 변환은 적용하지 않았습니다. LASSO 및 SVM의 스케일링은 각 소프트웨어 구현의 기본 설정을 따랐으며, 훈련 코호트에서 도출된 전처리 파라미터를 내부 검증 코호트에 변경 없이 적용했습니다. 오버샘플링, 언더샘플링, 합성 소수 오버샘플링 기법(SMOTE) 또는 수동으로 지정된 클래스 가중치는 사용하지 않았습니다. 가장 성능이 좋은 모델은 각 알고리즘의 완전 최적화 버전이 아니라, 미리 지정된 네 가지 구현 방식 중 전반적인 내부 검증 성능이 가장 높은 모델로 정의했습니다. 이렇게 적합된 훈련 코호트 모델들을 이후 내부 검증 코호트에서 평가했습니다. 전체 워크플로우는 Supplementary Figure 1에 제시되어 있으며, 구현 세부 사항은 Supplementary Table 1에 제공됩니다.

모델 성능은 수신자 조작 특성 곡선 아래 면적(AUC), 민감도, 특이도, 재현율, F1 스코어 및 정확도를 사용하여 평가되었습니다. AUC는 가능한 모든 분류 임계값에 대한 판별력을 요약하며, 0.5는 판별력이 없음을, 1.0은 완벽한 판별력을 나타냅니다. 선택된 임계값에서 진양성(TP)과 진음성(TN)은 각각 양성과 음성 사례를 정확하게 분류한 것이며, 위양성(FP)과 위음성(FN)은 잘못 분류된 사례입니다. 이진 분류에서 재현율과 동일한 민감도는 TP/(TP + FN)로, 특이도는 TN/(TN + FP)로, 정밀도는 TP/(TP + FP)로, F1 스코어는 2 × 정밀도 × 재현율/(정밀도 + 재현율)로, 정확도는 (TP + TN)/(TP + TN + FP + FN)으로 계산되었습니다. 양성 클래스는 일반 병동 패혈증 예측 모델의 경우 패혈증(1로 코딩), 일반 병동 원내 사망률 모델의 경우 원내 사망(1로 코딩), ICU 28일 사망률 모델의 경우 28일 이내 사망(1로 코딩)으로 정의되었습니다. 이에 대응하는 음성 클래스는 각각 패혈증 없음, 생존 퇴원, 28일 생존(모두 0으로 코딩)이었습니다.

구조화된 임상 데이터를 위한 상호 보완적인 전략을 대표하도록 네 가지 지도 학습 머신러닝 알고리즘이 선택되었습니다. LR은 가산적 선형 연관성을 위한 해석 가능한 참조 모델로 사용되었습니다. RF는 분산을 줄이면서 비선형 관계와 상호작용을 모델링할 수 있는 배깅 기반 앙상블을 대표했습니다. SVM은 중간 규모의 데이터셋에서 비선형 결정 경계를 수용할 수 있는 마진 기반 분류기를 대표했습니다. XGBoost는 고차 상호작용과 비선형 패턴을 캡처할 수 있는 정규화된 부스팅 알고리즘을 대표했습니다. 모든 알고리즘은 동일한 후보 예측 변수 세트를 사용했으며, 각 예측 과제에 대해 동일한 훈련 및 내부 검증 코호트에서 평가되었습니다.

전역 특성 중요도를 정량화하고 개별 예측을 설명하기 위해, 각 결과에 대해 가장 성능이 우수한 모델을 대상으로 SHAP 분석을 수행했습니다. 노모그램 개발은 결과별 특정 절차에 따라 진행되었습니다. 일반 병동 패혈증 결과의 경우, 후보 예측 변수들을 다변량 로지스틱 회귀 모델에 입력하였으며, P < 0.05에서 통계적 유의성이 유지된 변수들을 최종 노모그램에 포함했습니다. 두 가지 사망률 결과의 경우, 추가적인 P-값 기반 제거 없이 해당 최적 성능 모델의 전역 SHAP 특성 중요도 결과를 바탕으로 예측 변수를 포함했습니다.

회고적 데이터베이스 구축 과정에서, 관련 분석에 필요한 임상, 실험실 또는 결과 데이터가 누락된 기록은 최종 분석 데이터 세트에 입력되기 전에 제외되었습니다. 상세한 입력 전 스크리닝 로그가 보관되지 않았으므로, 데이터 누락으로 인해 제외된 기록의 수와 원래의 변수 수준별 누락 패턴은 재구성할 수 없었습니다. 최종 확정된 일반 병동 코호트(n = 1,561)와 ICU 코호트(n = 438)는 해당 분석에 사용된 변수에 대해 누락된 값이 없었으며(0% 누락), 통계적 대체법은 수행되지 않았습니다. 일반 병동 환자 1,561명 전원이 패혈증 및 원내 사망률 분석에 포함되었으며, ICU 환자 438명 전원이 28일 사망률 분석에 포함되었습니다. 최종 데이터 세트의 변수 수준별 완결성은 Supplementary Table 2에 보고되어 있습니다.

머신러닝 분석은 머신러닝 분석 플랫폼을 사용하여 수행되었습니다. 일반적인 통계 분석은 오픈 소스 통계 컴퓨팅 환경과 통계 소프트웨어를 사용하여 수행되었습니다. 모든 통계 검정은 양측 검정으로 진행되었으며, P < 0.05를 통계적으로 유의미한 것으로 간주하였습니다.

결과

연구 코호트의 기초 특성

본 연구에는 급성 담관염으로 입원한 환자 1,999명이 포함되었으며, 이 중 1,561명은 일반 병동 코호트에, 438명은 ICU 코호트에 속했다. 일반 병동 코호트에서는 544명의 환자가 패혈증이 발생했거나 앓고 있었으며, 1,017명은 그렇지 않았다. ICU 코호트에서는 299명의 환자가 패혈증을 앓았고, 139명은 그렇지 않았다. 패혈증 상태에 따라 층화한 기저 특성은 Table 1에 제시되어 있다. 일반 병동 코호트에서 패혈증 환자는 패혈증이 없는 환자에 비해 연령이 더 높았고 potassium, AST, CR 및 BUN 수치가 더 높았으나(모두 P < 0.05), Hb, PLT 및 albumin 수치는 더 낮았다(모두 P < 0.05). 당뇨병, 심부전, 고지혈증, 신장 손상 및 더 긴 입원 기간은 패혈증 환자에게서 더 흔하거나 더 길게 나타났다(모두 P < 0.05). 반면 뇌졸중, 고혈압 및 간염은 그룹 간에 유의미한 차이가 없었다. ICU 코호트에서 패혈증 환자는 패혈증이 없는 환자에 비해 potassium, TBil, AST, CR 및 BUN 수치가 더 높았고 albumin 수치는 더 낮았다(모두 P < 0.05). 신장 손상과 더 긴 ICU 체류 기간 또한 패혈증 상태와 연관이 있었으나(P < 0.05), 평가된 다른 동반 질환들은 유의미한 차이를 보이지 않았다. SOFA 및 APS III 점수는 패혈증이 없는 ICU 환자보다 패혈증이 있는 ICU 환자에서 더 높았다(둘 다 P < 0.05).

일반 병동 패혈증 예측을 위한 특성 선택

일반 병동 데이터셋은 1,092명의 환자로 구성된 훈련 코호트와 469명의 환자로 구성된 내부 검증 코호트로 나누어졌다. 패혈증 결과의 경우, 훈련 코호트에는 패혈증 환자 380명과 비패혈증 환자 712명이 포함되었으며, 내부 검증 코호트에는 패혈증 환자 164명과 비패혈증 환자 305명이 포함되었다. 일반 병동 내 원내 사망률의 경우, 훈련 코호트에는 사망자 56명과 생존자 1,036명이 포함되었으며, 내부 검증 코호트에는 사망자 24명과 생존자 445명이 포함되었다. ICU 훈련 코호트에는 306명의 환자(28일 이내 사망 76명, 생존 230명)가 포함되었고, 내부 검증 코호트에는 132명의 환자(28일 기준 사망 33명, 생존 99명)가 포함되었다. 일반 병동 패혈증 예측을 위해 초기에는 27개의 변수가 고려되었다. Boruta는 변수를 확정적 중요(confirmed important), 잠정적(tentative), 또는 거부(rejected)로 분류하였다 (그림 1A). 알부민, 신장 손상, 입원 기간, CR, WBC, PLT, 심부전, 연령 및 Hb의 11개 변수가 중요 변수로 분류되었다. 10겹 교차 검증을 이용한 LASSO 회귀 분석을 통해 19개의 후보 특성이 유지되었다 (그림 1B, C). 이후 특성 선택 결과와 임상적 관련성을 함께 고려하여 BUN, CR, WBC, PLT, 연령, 심부전, 알부민, 신장 손상, 입원 기간, Hb 및 간경변증의 11개 후보 예측 인자를 도출하였다.

일반 병동 패혈증 예측을 위한 모델 비교 및 SHAP 해석

동일한 훈련 및 내부 검증 코호트를 사용하여 일반 병동의 패혈증 예측 작업에 대해 LR, RF, SVM 및 XGBoost를 비교하였습니다(그림 2). 훈련 코호트의 AUC는 LR 0.893, RF 0.853, SVM 0.718, XGBoost 0.767였으며, 이에 상응하는 내부 검증 AUC는 각각 0.826, 0.787, 0.647, 0.737였습니다(그림 2A,B). LR은 평가된 4가지 모델 중 가장 높은 내부 검증 AUC와 최상의 전반적인 성능을 달성하였으므로, 추가 해석을 위해 선택되었습니다. 상세한 성능 측정 지표는 보충 표 3에 제공되어 있습니다. 평가된 임계 확률 범위 내에서 결정 곡선 분석 결과 LR의 순 이익(net benefit)이 더 큰 것으로 나타났으며(그림 2D), 보정 곡선(calibration plot)에서는 예측된 패혈증 확률과 실제 관찰된 확률 사이의 일치성이 확인되었습니다(그림 2E). 이러한 결과는 내부 검증을 기반으로 하며, 일상적인 임상 적용 준비가 완료되었음을 입증하는 것은 아닙니다.

선택된 LR 모델을 해석하기 위해 SHAP 분석을 사용하였습니다. 그림 2C,F는 모델 추정치에 미치는 전반적인 영향력에 따라 정렬된 예측 변수들의 전역 기여도를 보여줍니다. 중요도가 높은 순서대로 예측 변수는 BUN, CR, WBC, PLT, 연령, 심부전, 알부민, 신부전, 입원 기간, Hb, 간경변증 순이었습니다. 그림 2G는 환자 수준의 포스 플롯(force plot)을 제공합니다. 빨간색 특성은 패혈증의 추정 확률을 높였고, 파란색 특성은 확률을 낮췄습니다. f(x) 항은 기준 기대치 대비 해당 개인에 대한 모델 출력값을 나타냅니다.

일반 병동 패혈증 노모그램 구축

특성 선택 후 유지된 후보 예측 변수들을 다변량 로지스틱 회귀 모델에 입력하였습니다(표 2). P < 0.05에서 유의미하게 유지된 변수들을 최종 노모그램에 포함시켰습니다(그림 3A): 신장 손상, 심부전, WBC, PLT, 알부민 및 입원 기간. 노모그램 분석 결과 AUC는 0.791이었으며(그림 3B), 보정 곡선(calibration plot)은 예측된 패혈증 확률과 관찰된 확률 사이의 일치도를 보여주었습니다(그림 3C).

패혈증과 생존 결과 사이의 연관성

패혈증 상태에 따른 생존율을 비교하기 위해 Kaplan-Meier 곡선을 사용하였습니다(그림 4). ICU 코호트에서 패혈증 환자는 패혈증이 없는 환자보다 28일 생존율이 더 낮았습니다(그림 4A; log-rank P < 0.001). 일반 병동 코호트에서 패혈증 환자는 패혈증이 없는 환자보다 원내 생존율이 더 낮았습니다(그림 4B; log-rank P < 0.001).

패혈증과 사망률 사이의 연관성을 평가하기 위해 점진적으로 보정된 네 가지 Cox 비례 위험 모델을 사용하였습니다(표 3). 일반 병동 코호트의 경우, 보정하지 않은 모델(모델 1: HR, 4.48; 95% CI, 2.53-7.95; P < 0.001)에서 패혈증은 원내 사망률과 연관이 있었습니다. 이러한 연관성은 연령 및 성별 보정 후(모델 2: HR, 4.11; 95% CI, 2.31-7.32; P < 0.001), 추가적인 동반 질환 보정 후(모델 3: HR, 3.51; 95% CI, 1.94-6.35; P < 0.001), 그리고 실험실 변수 보정 후(모델 4: HR, 2.18; 95% CI, 1.15-4.15; P = 0.018)에도 계속 유지되었습니다. ICU 코호트에서는 패혈증이 모델 1(HR, 5.94; 95% CI, 3.00-11.76; P < 0.001), 모델 2(HR, 5.89; 95% CI, 2.98-11.67; P < 0.001), 모델 3(HR, 4.81; 95% CI, 2.41-9.61; P < 0.001) 및 모델 4(HR, 4.54; 95% CI, 2.22-9.29; P < 0.001) 모두에서 28일 사망률과 연관이 있었습니다. 이러한 결과는 Kaplan-Meier 분석 결과와 일치하였습니다.

사망률 모델을 위한 특성 선택

일반 병동 내 사망률 및 ICU 28일 사망률의 후보 예측 변수를 선정하기 위해 Boruta와 LASSO가 사용되었습니다 (그림 5). ICU 28일 사망률의 경우, Boruta는 APS III, TBil, PLT, ALT, 패혈증 상태 및 Hb를 포함하여 10개의 중요한 변수를 식별하였다(그림 5A). 10-겹 교차 검증을 통한 LASSO 분석 결과 15개의 후보 특성이 유지되었습니다 (그림 5B, C특성 선택 절차와 임상적 관련성을 모두 고려하여 APS III, Hb, ALT, Lac, TBil, 패혈증 상태, 신손상, 알부민의 8가지 예측 변수가 유지되었습니다. 일반 병동 내 사망률의 경우 알부민, 신손상, 패혈증 상태, BUN, TBil, AST의 6가지 예측 변수가 유지되었습니다.그림 5D-F).

사망률 결과에 대한 모델 비교 및 SHAP 해석

해당 훈련 및 내부 검증 코호트를 사용하여 ICU 28일 사망률에 대해 LR, RF, SVM 및 XGBoost를 비교하였다(그림 6). 훈련 코호트의 AUC는 LR 0.831, RF 0.883, SVM 0.481, XGBoost 0.862였으며, 이에 대응하는 내부 검증 AUC는 각각 0.773, 0.810, 0.322, 0.805였다(그림 6A,B). 검증 AUC와 전반적인 성능 지표를 바탕으로 RF가 가장 성능이 우수한 모델로 선정되었다. 자세한 결과는 보충 표 4에 제공되어 있다. 평가된 임계 확률 범위 내에서 결정 곡선 분석 결과 RF의 잠재적 순 이익이 확인되었으나(그림 6D), 보정 분석에서는 예측된 28일 사망 확률과 관찰된 확률 사이에 중간 정도의 일치도만이 나타났다(그림 6E). 전역 SHAP 분석 결과, 예측 변수의 순위는 APS III, Hb, ALT, Lac, TBil, albumin, 패혈증 상태, 신장 손상 순으로 나타났다(그림 6C,F). 그림 6G는 대표적인 환자 수준의 설명을 보여준다.

일반 병동의 원내 사망률에 대하여, 훈련 코호트의 AUC는 LR이 0.951, RF가 0.873, SVM이 0.641, XGBoost가 0.902였으며, 이에 대응하는 내부 검증 AUC는 각각 0.900, 0.829, 0.564, 0.871이었다(그림 7A,B). LR이 가장 높은 내부 검증 AUC를 기록하여 최적의 성능을 보이는 모델로 선정되었다. 상세 결과는 부록 표 4에 제공되어 있다. 평가된 임계 확률 범위 내에서 결정 곡선 분석 결과 LR의 잠재적 순 이득이 확인되었으며(그림 7D), 보정 분석에서는 예측된 원내 사망 확률과 관찰된 확률 사이에 중간 정도의 일치도가 나타났다(그림 7E). 전역 SHAP 분석 결과, 예측 변수의 순위는 albumin, kidney injury, sepsis status, BUN, TBil, AST 순이었다(그림 7C,F). 그림 7G는 대표적인 환자 수준의 설명 사례를 보여준다.

ICU 28일 사망률 및 일반 병동 내 병원 사망률 노모그램 구축

최적의 사망률 모델에서 전역 SHAP 특성 중요도에 따라 우선순위가 지정된 예측 변수들을 사용하여 각각의 노모그램을 구축하였습니다(그림 8). ICU 28일 사망률 노모그램에는 APS III, Hb, ALT, Lac, TBil, albumin, 패혈증 상태 및 신손상이 포함되었습니다(그림 8A). 이는 0.840의 AUC를 나타냈으며(그림 8B), 보정 곡선은 연구 코호트 내에서 예측된 28일 사망 확률과 관찰된 사망 확률이 일치함을 보여주었습니다(그림 8C). 일반 병동 내 원내 사망률 노모그램에는 albumin, 신손상, 패혈증 상태, BUN, TBil 및 AST가 포함되었습니다(그림 8D). 이는 0.904의 AUC를 나타냈으며(그림 8E), 보정 곡선은 연구 코호트 내에서 예측된 원내 사망 확률과 관찰된 사망 확률이 일치함을 보여주었습니다(그림 8F). 이러한 추정치들은 오직 내부 검증만을 통해 도출되었으므로, 예비적인 결과로 간주되어야 하며 독립적인 외부 코호트를 통한 확인이 필요합니다.

결과 사건에 따른 모델 복잡성 평가

모델 복잡성은 각 훈련 코호트의 결과 이벤트 수와 해당 최종 노모그램의 예측 변수 수를 비교하여 평가하였습니다. 일반 병동 패혈증 예측 모델에는 380건의 패혈증 이벤트와 6개의 예측 변수가 포함되었습니다(예측 변수당 63.3건의 이벤트). 일반 병동 내원 중 사망 모델에는 56건의 사망 사례와 6개의 예측 변수가 포함되었으며(예측 변수당 9.3건의 이벤트), ICU 28일 사망 모델에는 76건의 사망 사례와 8개의 예측 변수가 포함되었습니다(예측 변수당 9.5건의 이벤트). 따라서 패혈증 모델의 경우 이벤트 지원이 충분했으나, 두 사망 모델의 경우 예측 변수당 약 10건의 이벤트라는 일반적인 경험칙에 가까워 이벤트 지원이 상대적으로 제한적이었습니다.

데이터 가용성:

본 연구에 사용된 모든 익명화된 환자 수준 데이터는 이 논문에 첨부된 보충 파일에서 공개적으로 확인할 수 있습니다. 보충 표 5에는 일반 병동 코호트의 데이터가 포함되어 있으며, 보충 표 6에는 중환자실 코호트의 데이터가 포함되어 있습니다. 제출 전, 모든 직접적인 개인 식별 정보 및 기타 잠재적 식별 가능 정보는 삭제되었습니다.

패혈증 속성 분석을 위한 Boruta 특성 선택, 교차 검증, LASSO 회귀 플롯.
그림 1: 급성 담관염 환자의 일반 병동 패혈증 예측 모델을 위한 특성 선택. (A) Boruta 특성 선택 분석; (B,C) LASSO 계수 경로 및 10-겹 교차 검증 분석. 이 그림의 확대 버전을 보려면 여기를 클릭하십시오.

ROC 및 보정 분석, 여러 차트; 예측, 검증, SHAP 값; 의료 데이터.
그림 2: 급성 담관염 환자의 일반 병동 패혈증 예측을 위한 머신러닝 모델의 비교 및 해석. (A,B) 훈련 및 내부 검증 코호트의 후보 머신러닝 모델에 대한 ROC 곡선; (C,F) 예측 인자 기여도에 대한 전역 SHAP 분석; (D) 결정 곡선 분석; (E) 보정 곡선; (G) 대표 환자에 대한 개별 SHAP 설명. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

ROC 곡선을 포함한 노모그램 예측 모델; 위험 평가, 민감도 분석, 보정 플롯.
그림 3: 일반 병동 패혈증 예측 노모그램의 구축 및 평가. (A) 노모그램; (B) ROC 곡선; (C) 보정 곡선. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

시간 경과에 따른 생존 확률 곡선을 통해 패혈증의 영향을 보여주는 Kaplan-Meier 생존 분석 차트.
그림 4: 패혈증 여부에 따라 층화한 급성 담관염 환자의 Kaplan–Meier 생존 곡선. (A>) ICU 코호트에서 패혈증 유무에 따른 28일 생존율 비교; (B>) 일반 병동 코호트에서 패혈증 유무에 따른 원내 생존율 비교. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

변수 중요도, 교차 검증, 회귀 계수; 통계 데이터 분석, 그래프 A-F.
그림 5ICU 28일 사망률 및 일반 병동 내 사망률 모델을 위한 특성 선택. (A) ICU 28일 사망률에 대한 Boruta 특성 선택 분석; (B,C) ICU 28일 사망률에 대한 LASSO 계수 경로 및 10겹 교차 검증 분석; (D) 일반 병동 내 병원 사망률에 대한 Boruta 특성 선택 분석; (E, F) 일반 병동 내 병원 사망률에 대한 LASSO 계수 경로 및 10-겹 교차 검증 분석. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

ROC 곡선, 랜덤 포레스트 점수, SHAP 값, 검증, 보정 및 특성 영향 차트.
그림 6: 급성 담관염 환자의 ICU 28일 사망률에 대한 머신러닝 모델의 비교 및 해석. (A,B) 훈련 및 내부 검증 코호트 내 후보 머신러닝 모델의 ROC 곡선; (C,F) 예측 인자 기여도에 대한 전역 SHAP 분석; (D) 결정 곡선 분석; (E) 보정 곡선; (G) 대표 환자에 대한 개별 SHAP 설명. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

모델 검증을 위한 ROC 곡선, SHAP 분석, 보정 곡선, 결정 곡선, 의료 데이터 차트.
그림 7: 급성 담관염 환자의 일반 병동 내 사망률에 대한 머신러닝 모델의 비교 및 해석. (A,B) 훈련 및 내부 검증 코호트에서 후보 머신러닝 모델의 ROC 곡선; (C,F) 예측 변수 기여도에 대한 전역 SHAP 분석; (D) 결정 곡선 분석; (E) 보정 곡선; (G) 대표 환자에 대한 개별 SHAP 설명. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

생존 예측을 위한 노모그램 차트, ROC 곡선(AUC 0.840 및 0.904), 모델 성능을 보여주는 보정 곡선.
그림 8: ICU 28일 사망률 및 일반 병동 원내 사망률 노모그램의 구축 및 평가. (A–C) ICU 28일 사망률에 대한 노모그램, ROC 곡선 및 보정 곡선; (D–F) 일반 병동 원내 사망률에 대한 노모그램, ROC 곡선 및 보정 곡선. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

표 1: 포함된 환자들의 기저 특성. 임상 및 실험실 특성이 일반 병동 및 ICU 코호트별로 구분되어 제시되었으며, 패혈증 유무에 따른 환자 간 비교가 수행되었습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 2: 담관염 환자의 패혈증에 대한 다요인 분석.약어: WBC: 백혈구; PLT: 혈소판. p-값이 0.05 미만인 수치는 굵게 표시되었습니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

표 3: 패혈증과 담관염 환자의 예후 간의 관계.모델 1은 보정되지 않았음. 모델 2는 연령과 성별을 보정함. 모델 3은 고혈압, 당뇨병, 심부전, 뇌졸중 및 신장 손상을 추가로 보정함. 일반 병동 코호트의 경우, 모델 4는 WBC, Hb, PLT, albumin, CR, BUN, AST, ALT, sodium, potassium, chloride 및 Lac을 추가로 보정함. ICU 코호트의 경우, 모델 4는 APS III, SOFA, WBC, Hb, PLT, albumin, CR, BUN, AST, ALT, sodium, potassium, chloride 및 Lac을 추가로 보정함. HR, 위험비; CI, 신뢰 구간; APS III, 급성 생리 및 만성 건강 평가 III; SOFA, 순차적 장기 부전 평가; WBC, 백혈구 수; Hb, 헤모글로빈; PLT, 혈소판 수; CR, 크레아티닌; BUN, 혈액 요소 질소; AST, aspartate aminotransferase; ALT, alanine aminotransferase; Lac, 젖산. 굵게 표시된 값은 P < 0.05에서 통계적 유의성을 나타냄. 이 파일을 다운로드하려면 여기를 클릭하십시오.

부록 그림 1: 전체 연구 및 머신러닝 워크플로우. 급성 담관염 환자를 일반 병동 코호트와 ICU 코호트로 구분하고, 일반 병동 패혈증, 일반 병동 내 사망률, ICU 28일 사망률의 세 가지 예측 과제를 정의하였다. 각 과제에 대해, 특성 선택 전 데이터를 7:3 비율로 훈련 코호트와 내부 검증 코호트로 나누었다. LASSO와 Boruta는 훈련 코호트에서만 수행되었으며, 이후 LR, RF, SVM, XGBoost 모델을 개발하고 비교하였다. 내부 검증 성능을 바탕으로 가장 성능이 우수한 모델을 선택하고 SHAP을 사용하여 해석하였다. 일반 병동 패혈증 노모그램은 다변량 로지스틱 회귀 분석에서 유지된 변수들을 사용한 반면, 사망률 노모그램은 전역 SHAP 특성 중요도에 의해 우선순위가 정해진 예측 인자들을 사용하였다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 1: 세부적인 계산 구현, 전처리 절차, 특성 선택 설정 및 머신러닝 모델 파라미터.약어: AUC, 수신자 조작 특성 곡선 아래 면적; FN, 위음성; FP, 위양성; ICU, 중환자실; LASSO, 최소 절대 수축 및 선택 연산자; LR, 로지스틱 회귀; RF, 랜덤 포레스트; SHAP, Shapley Additive Explanations; SMOTE, 합성 소수 오버샘플링 기법; SVM, 서포트 벡터 머신; TN, 진음성; TP, 진양성; XGBoost, Extreme Gradient Boosting. 참고: 머신러닝 분석은 원래 클라우드 기반 플랫폼을 통해 수행되었습니다. 이후 플랫폼이 업그레이드되어 과거의 정확한 백엔드 패키지 빌드 번호를 더 이상 확인할 수 없으므로, 현재의 Python 패키지 버전을 원래 분석에 사용된 버전으로 소급하여 보고할 수 없습니다. 위에 표시된 알고리즘 값은 문서화된 기본 설정 파라미터를 나타내며, 결과 특이적 하이퍼파라미터 최적화 값이 아닙니다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 2: 최종 확정된 일반 병동 및 ICU 분석 데이터 세트의 변수 수준 데이터 완전성. 최종 데이터 세트에는 해당 분석에 포함된 변수에 대한 결측값이 없었으며, 통계적 대체법은 수행되지 않았다. 필수 데이터가 누락된 기록은 소급적 데이터베이스 구성 과정에서 제외되었으며, 입력 전 제외된 정확한 수와 원래의 결측 패턴은 유지되지 않았다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 3: 급성 담관염 환자의 일반 병동 패혈증 예측을 위한 후보 머신러닝 모델의 성능.급성 담관염 환자의 패혈증 예측에 있어 머신러닝 모델의 효과 평가.파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 4: 급성 담관염 환자의 일반 병동 내 사망률 및 ICU 28일 사망률에 대한 후보 머신러닝 모델의 성능. AUC, 민감도, 특이도, 재현율, F1 스코어 및 정확도를 사용하여 훈련 및 내부 검증 코호트에 대한 LR, RF, SVM 및 XGBoost의 성능을 요약하였다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 5: 일반 병동 코호트에 대한 익명화된 환자 수준 데이터.이 데이터 세트에는 패혈증 및 병원 내 사망률 분석에 사용된 임상 및 실험실 변수가 포함되어 있습니다.이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 표 6: ICU 코호트에 대한 익명화된 환자 수준 데이터.이 데이터셋에는 28일 사망률을 분석하는 데 사용된 임상 및 실험실 변수가 포함되어 있습니다.여기에서 이 파일을 다운로드하십시오.

토론

급성 담관염은 잠재적으로 생명을 위협할 수 있는 담도 감염입니다. 경증 질환은 대개 치료에 잘 반응하지만, 중증 사례의 경우 보고된 사망률이 50%에 달할 수 있습니다1,5. 패혈성 쇼크가 발생하면 사망률은 40%에 근접할 수 있습니다14. 패혈증은 감염이 더 이상 담도에 국한되지 않고 전신 염증 및 다기관 기능 부전으로 빠르게 진행될 수 있음을 나타냅니다. 따라서 패혈증 및 부정적인 결과와 관련된 요인을 식별하는 것이 중요하며, 특히 ICU 치료가 필요한 환자들 사이에서 더욱 그러합니다.

본 연구에 포함된 1,999명의 환자 중 843명(42.17%)이 패혈증을 앓았거나 패혈증이 발생했다. 그 비율은 일반 병동 코호트에서 34.85%, ICU 코호트에서 68.3%였으며, ICU의 더 높은 비율은 기저 질환의 중증도가 더 높았음을 반영하는 것으로 보인다. 패혈증 환자는 고령인 경향이 있었는데, 이는 이전의 연구 결과들과 일치하며 연령 관련 생리적 기능 저하, 면역 기능 손상 및 동반 질환의 증가와 관련이 있을 가능성이 있다.15 Liu 등16은 연령, 인공호흡기 유지 기간, 당뇨병, 응고병증 및 수축기 혈압을 사용하여 급성 담관염의 패혈증에 대한 로지스틱 회귀 노모그램을 개발했으며, 보고된 AUC는 훈련 코호트에서 0.700, 검증 코호트에서 0.647였다. 본 연구에서 LR은 훈련 코호트에서 0.893, 내부 검증 코호트에서 0.826의 AUC를 달성했다. 이후 신손상, 심부전, WBC, PLT, albumin 및 입원 기간을 사용하여 더 간결한 일반 병동 패혈증 노모그램을 구축하였으며, 0.791의 AUC를 얻었다. 가장 성능이 좋은 머신러닝 모델의 내부 검증 AUC가 수치상으로는 이전에 발표된 노모그램보다 높았으나, 대상 인구, 예측 변수, 데이터 소스 및 검증 절차가 서로 다르기 때문에 이 비교는 간접적이다. 비교 성능과 일반화 가능성을 입증하기 위해서는 독립적인 외부 검증이 필요하다.

순차적 보정 후에도 패혈증은 사망률과 연관성이 있는 것으로 나타났으며, 이는 급성 담관염에서 패혈증의 예후적 관련성을 뒷받침합니다. 패혈증은 감염에 대한 조절되지 않은 숙주 반응으로 인해 발생하는 생명을 위협하는 장기 기능 부전으로 정의됩니다17. 내피세포, 염증, 산화 및 응고 이상이 장기 기능 부전과 부정적인 결과의 원인이 될 수 있습니다18,19. ICU 28일 사망률 노모그램은 APS III, Hb, ALT, Lac, TBil, albumin, 패혈증 상태 및 신장 손상을 포함하였으며, AUC 0.840을 기록했습니다. 일반 병동의 원내 사망률 노모그램은 albumin, 신장 손상, 패혈증 상태, BUN, TBil 및 AST를 포함하였으며, AUC 0.904를 기록했습니다. Schneider 등은 급성 담관염 사망 위험 모델에 대해 평균 교차 검증 AUC 0.915를 보고했습니다. 이 수치는 일반 병동 노모그램의 수치와 유사하지만, 모델이 서로 다른 코호트에서 개발 및 평가되었으므로 직접적인 비교는 부적절합니다.

APS III는 APACHE III의 급성 생리학적 구성 요소이며, 중증 환자의 생리학적 이상 정도를 요약하여 나타냅니다10. APS III와 SOFA는 중증 질환 및 패혈증의 예후 평가를 위해 평가되어 왔습니다20,21,22. TG18은 발열, WBC 수치, 빌리루빈 및 알부민을 포함한 임상 및 실험실 소견을 사용하여 급성 담관염의 진단과 조기 중증도 평가를 지원합니다. 그러나 전신성 염증 반응 증후군 기준은 급성 담관염 환자의 패혈증 선별 검사 시 추가적인 정보를 제공할 수 있습니다14. 또한, 낮은 Hb 수치는 고령의 급성 담관염 환자의 사망률과 관련이 있는 것으로 나타났습니다23. 젖산은 조직 저관류 및 장기 기능 부전의 임상적으로 중요한 지표이며, 패혈증 동안 상승된 농도는 산소 공급 장애, 대사 변화 및 제거 능력 감소를 반영할 수 있습니다24,25.

빌리루빈 및 아미노전달효소 농도의 상승은 이전에 급성 담관염의 조기 사망률과 관련이 있는 것으로 보고되었습니다26. 담도 폐쇄는 담즙 정체와 관내 압력 증가를 유발합니다. 혈액 순환계로의 빌리루빈 역류는 담즙 배설 장애를 반영하며, 아미노전달효소의 상승은 담즙산 독성, 염증 또는 이차적 간 허혈로 인한 간세포 손상을 나타낼 수 있습니다.

급성 담관염에서 패혈증 또는 사망률에 대한 이전의 위험 모델들은 미생물 배양 결과와 같이 쉽게 얻을 수 없는 제한된 예측 인자나 변수에 의존하는 경우가 있었습니다16,27. 결과 특이적 모델들은 주로 일상적으로 기록되는 임상 및 실험실 변수들을 사용했으나, 이러한 변수들의 측정 시점과 가용성은 환경에 따라 달랐습니다. APS III는 중환자실(ICU)에서만 사용 가능했으며, 입원 당시에는 병원 재원 기간을 알 수 없었습니다. 따라서 이러한 모델들의 실질적인 가치는 명확하게 정의된 예측 시점에서 전향적으로 평가되어야 합니다. 신장 손상은 급성 담관염에서 모든 원인으로 인한 사망률과 독립적으로 연관되어 있으므로 임상적으로 여전히 중요합니다28.

본 연구에서는 단일 알고리즘에 의존하는 대신 단계적 모델링 프레임워크를 사용하였습니다. LASSO와 Boruta는 상호 보완적인 특성 선택 방법으로 활용되었습니다. LASSO는 계수 수축(coefficient shrinkage)을 통해 차원성과 공선성을 줄이는 반면, Boruta는 비선형 관계나 상호작용에 관여하는 변수를 포함하여 모든 관련 예측 변수를 식별하도록 설계되었습니다. 이후 동일한 후보 예측 변수와 동일한 훈련/내부 검증 분할 데이터를 사용하여 LR, RF, SVM 및 XGBoost 모델을 개발하였습니다. 모델 선택 시에는 훈련 성능만이 아니라 내부 검증 성능을 강조하였으며, 이는 과적합을 완전히 제거할 수는 없으나 어느 정도 줄일 수 있습니다. 또한, 예측 위험과 관찰 위험 간의 일치도를 평가하고 임계 확률에 따른 잠재적 순이익을 분석하기 위해 보정(Calibration) 및 결정 곡선 분석(decision-curve analyses)을 실시하였습니다.

일반 병동의 패혈증 예측의 경우, LR이 가장 높은 내부 검증 AUC를 기록했으며, 이는 해당 데이터셋에서 더 복잡한 비선형 알고리즘이 추가적인 예측 가치를 제공하지 않았음을 시사합니다. 알고리즘의 성능은 표본 크기, 예측 변수 분포, 하이퍼파라미터 설정 및 코호트 특성에 따라 달라지므로, 이러한 결과가 비선형 연관성의 가능성을 배제하는 것은 아닙니다. 전역적 특성 중요도를 정량화하고 환자 수준의 추정치를 설명하기 위해 각 작업별 최적 성능 모델에 SHAP을 적용하였습니다. 본 프레임워크는 결과 및 환경별로 특화된 세 가지 모델, 즉 일반 병동 패혈증 예측 모델, 일반 병동 원내 사망률 모델, ICU 28일 사망률 모델로 구성되었습니다. 패혈증 노모그램은 다변량 로지스틱 회귀 분석에서 유의미한 변수들을 유지한 반면, 사망률 노모그램은 추가적인 P-값 기반 제거 없이 전역적 SHAP 특성 중요도에 의해 우선순위가 지정된 예측 변수들을 사용하였습니다. 이러한 접근 방식은 각 환경에서 사용 가능한 정보가 예측 변수 집합에 반영되도록 하였으며, APS III와 같은 ICU 전용 지표가 일반 병동 환자에게 적용되는 것을 방지하였습니다. 그럼에도 불구하고, 내부적으로 검증된 이러한 모델들은 위험 층화를 위한 연구 도구이며, 인과 모델이나 임상적 판단의 대체제로 해석되어서는 안 됩니다.

세 가지 모델은 서로 다른 설정, 결과 및 평가 시점을 다룹니다. 일반 병동 패혈증 예측 모델에는 신장 손상, 심부전, WBC, PLT, 알부민 및 병원 입원 기간이 포함됩니다. 입원 시점에는 입원 기간을 알 수 없고 패혈증의 정확한 발병 시간이 기록되지 않았기 때문에, 이 모델은 입원 시점의 예측 도구가 아니라 retrospective한 원내 위험 층화 모델로 해석해야 합니다. 일반 병동 원내 사망률 모델에는 알부민, 신장 손상, 패혈증 상태, BUN, TBil 및 AST가 포함되며, 입원 중 이러한 변수들을 사용할 수 있게 된 후에만 계산할 수 있습니다. ICU 28일 사망률 모델에는 APS III, Hb, ALT, Lac, TBil, 알부민, 패혈증 상태 및 신장 손상이 포함되며, ICU 입원 후 필요한 정보가 확보되면 평가할 수 있습니다. 노모그램은 예측 변수 값을 추정 결과 확률로 변환하는 반면, SHAP은 개별 변수의 기여도를 설명합니다. 현재로서는 내부적으로 검증된 이 모델들을 고정된 치료 권고안보다는 연속적인 위험 추정치를 제공하는 연구 도구로 간주해야 합니다. 이 모델들은 Sepsis-3 기준, TG18 기반 평가 및 임상적 판단을 보완하기 위한 것이며, 일상적인 적용에 앞서 전향적, 다기관 외부 검증이 필요합니다.

본 연구에는 몇 가지 한계점이 있습니다. 첫째, 후향적 설계로 인해 선택 편향, 결측 데이터 편향, 측정 가변성 및 잔류 교란 변수가 발생했을 가능성이 있습니다. 패혈증 분류는 기존 의료 기록에 의존하였으며, 발병 시점에 대한 불확실성으로 인해 오분류가 발생했을 수 있습니다. 분석 데이터베이스 구축 전 필수 데이터가 불완전한 기록은 제외되었으나, 상세한 사전 입력 스크리닝 로그는 보존되지 않았습니다. 따라서 이러한 제외 사례를 정량화하거나 일반 병동 코호트와 ICU 코호트 간의 원래 결측 패턴을 비교할 수 없었습니다. 최종 데이터 세트에는 결측값이 포함되지 않았으나, 데이터의 완전성이 질병의 중증도나 결과와 연관되어 있었다면 완전 사례 선택(complete-case selection)으로 인해 편향이 도입되었을 수 있습니다. 실험실 측정값들이 반드시 입원, 패혈증 발병 또는 치료 시점에 맞춰 균일하게 얻어진 것은 아니며, 항생제 치료, 담도 배액 및 장기 지원과 같은 중재 조치가 실험실 수치와 사망률 모두에 영향을 미쳤을 수 있습니다. 원내 사망률은 퇴원 또는 전원 관행의 영향을 받았을 수 있으며, 28일 사망률 확인은 추적 관찰의 완전성에 따라 달라졌습니다. 측정된 공변량에 대한 보정만으로는 측정되지 않은 교란 변수나 시간 가변적 교란 변수를 제거할 수 없었으므로, 보고된 연관성을 인과 관계로 해석해서는 안 됩니다.

둘째, 환자들은 두 기관에서 모집되었으나 모델 성능은 무작위 내부 검증 분할만을 사용하여 평가되었습니다. 따라서 보고된 성능은 낙관적일 수 있으며, 다른 기관 및 인구 집단에 대한 일반화 가능성은 여전히 불확실합니다. 시간적 및 지리적으로 독립적인 코호트를 이용한 전향적 다기관 검증이 필요합니다. 또한, 패혈증의 정확한 발생 시간을 알 수 없어 입원 시 이미 존재했던 패혈증과 입원 중 발생한 패혈증을 구분할 수 없었으며, 패혈증 발생 전후의 입원 기간을 계산하는 것이 불가능했습니다. 병원 입원 기간이 예측 인자로 포함되었으므로, 일반 병동 패혈증 예측 모델은 입원 시점의 모델이나 전향적 사건 발생 시간 모델이라기보다 후향적 원내 위험 층화 모델로 해석되어야 합니다.

셋째, LR, RF, SVM 및 XGBoost는 이미 확립된 알고리즘이며, 본 연구에서는 새로운 아키텍처나 최적화 프레임워크를 도입하지 않았습니다. 이 알고리즘들은 구조화된 임상 데이터에 적합한 상호 보완적인 선형, 마진 기반, 배깅 및 부스팅 전략을 대표하기 위해 의도적으로 선택되었습니다. 그럼에도 불구하고 분석 대상을 이러한 알고리즘으로 제한한 것은 다른 비선형 패턴이나 상호작용의 탐지를 제한했을 수 있습니다. 향후 연구에서는 해석 가능한 부스팅 방법, 스태킹 앙상블 또는 기타 알고리즘을 평가할 수 있으며, 이때 개선 여부는 AUC 단독 지표보다는 외부 판별력, 보정 및 순이익(net benefit)을 통해 판단되어야 할 것입니다.

넷째, 후보 알고리즘들은 사전에 지정된 기본 하이퍼파라미터를 사용하였으며, 체계적인 하이퍼파라미터 최적화는 수행되지 않았습니다. 따라서 관찰된 차이는 이러한 사전 설정된 구현체 간의 비교를 반영하며, 각 알고리즘이 달성할 수 있는 최선의 성능을 나타내지 않을 수 있습니다. 향후 연구에서는 중첩 교차 검증(nested cross-validation)을 그리드, 랜덤 또는 베이지안 하이퍼파라미터 최적화와 결합하고, 외부 검증을 통해 개선 사항을 확인해야 합니다.

다섯째, 모델 복잡성을 줄이기 위해 특성 선택과 내부 검증을 수행하였으나, 일반 병동 및 ICU 사망률 모델의 예측 변수당 훈련 이벤트 수는 각각 9.3회와 9.5회에 불과했습니다. 이러한 비율은 회귀 모델링에서 흔히 인용되는 하한선에 근접한 수치이며, 따라서 과적합, 불안정한 추정치 및 부정확한 검증 성능의 가능성을 배제할 수 없습니다. 더 많은 사망 이벤트가 포함된 더 큰 규모의 독립적 코호트 연구가 필요합니다.

마지막으로, SHAP은 적합된 모델 예측의 해석 가능성을 향상시키지만, 예측 변수와 결과 사이의 인과 관계를 설정할 수는 없습니다. 따라서 제안된 모델은 임상 의사 결정 시스템이라기보다 내부적으로 검증된 위험 층화 도구로 간주되어야 합니다. 이러한 모델의 임상적 유용성과 일반화 가능성은 전향적 독립 코호트를 통한 평가가 필요합니다.

요약하자면, 급성 담관염 환자 중 일반 병동 코호트에서는 패혈증이 더 낮은 원내 생존율과 관련이 있었으며, ICU 코호트에서는 더 낮은 28일 생존율과 관련이 있었습니다. 결과 및 환경 특이적인 세 가지 모델이 개발되었는데, 이는 일반 병동 패혈증 예측 모델, 일반 병동 원내 사망률 모델, 그리고 ICU 28일 사망률 모델입니다. 이 모델들은 내부 검증 과정에서 판별 성능을 입증하였으며, SHAP를 통해 개별 예측 변수가 모델 추정치에 기여하는 특성을 분석할 수 있었습니다. 하지만 사망 사례 수의 제한, 후향적 설계 및 외부 검증의 부재로 인해, 본 연구 결과는 예비적인 수준이며 과적합의 가능성이 있습니다. 일상적인 임상 적용에 앞서 전향적 다기관 외부 검증이 필요합니다.

공개 사항

저자들은 경쟁 관계에 있는 재정적 또는 비재정적 이해관계가 없음을 밝힙니다. 원고 수정 과정에서 언어 편집, 문법, 명확성 및 구성을 돕기 위해 ChatGPT (OpenAI)가 사용되었습니다. 이는 연구 데이터를 생성하거나 분석하거나, 독립적으로 과학적 결론을 도출하는 데 사용되지 않았습니다. AI의 도움을 받은 모든 내용은 저자들이 비판적으로 검토하고 검증하였으며, 저자들이 원고의 정확성, 무결성 및 독창성에 대해 모든 책임을 집니다. 참여 동의: 모든 참여자 또는 그들의 법적 대리인으로부터 서면 동의를 얻었습니다.

감사의 글

데이터 분석와 논문 작성에 도움을 주신 모든 공동 연구자분들께 감사드립니다. 연구비 지원: 본 연구는 Jiangsu Medical College의 2024년 학교-지방 정부 간 협력 혁신 연구 프로젝트(202491011, 202491007)와 Changzhou Science and Technology Bureau(CJ20239026, CJ20244028)의 지원을 받아 수행되었습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Boruta (R package)[version/CRAN]훈련 코호트 내에서 실행되는 특성 선택 알고리즘
glmnet / LASSO (R package)[version/CRAN]특성 선택을 위한 10-fold 교차 검증 기반 LASSO 회귀
RR Foundation for Statistical Computingversion 4.3.2오픈 소스 통계 컴퓨팅 환경
SHAP implementation[version]모델 해석을 위한 Shapley Additive Explanations
StataStataCorpversion 17.0전통적 분석을 위한 통계 소프트웨어
XGBoost implementation[version]Extreme Gradient Boosting 모델
Xsmart Analysis platform[version]머신러닝 분석 플랫폼

참고문헌

  1. An Z, Braseth AL, Sahar N. Acute cholangitis: causes, diagnosis, and management. Gastroenterol Clin North Am. 2021;50:403–14.
  2. Gravito-Soares E, et al. Clinical applicability of Tokyo Guidelines 2018/2013 in diagnosis and severity evaluation of acute cholangitis and determination of a new severity model. Scand J Gastroenterol. 2018;53:329–34.
  3. Cianci P, Restini E. Management of cholelithiasis with choledocholithiasis: endoscopic and surgical approaches. World J Gastroenterol. 2021;27:4536–54.
  4. Lan Cheong Wah D, Christophi C, Muralidharan V. Acute cholangitis: current concepts. ANZ J Surg. 2017;87:554–59.
  5. Cecconi M, Evans L, Levy M, Rhodes A. Sepsis and septic shock. Lancet. 2018;392:75–87.
  6. Rudd KE, et al. Global, regional, and national sepsis incidence and mortality, 1990–2017: analysis for the Global Burden of Disease Study. Lancet. 2020;395:200–11.
  7. Xie J, et al. The epidemiology of sepsis in Chinese ICUs: a national cross-sectional survey. Crit Care Med. 2020;48:e209–e218.
  8. Wilkins T, Agabin E, Varghese J, Talukder A. Gallbladder dysfunction: cholecystitis, choledocholithiasis, cholangitis, and biliary dyskinesia. Prim Care. 2017;44:575–97.
  9. Qiu X, Lei YP, Zhou RX. SIRS, SOFA, qSOFA, and NEWS in the diagnosis of sepsis and prediction of adverse outcomes: a systematic review and meta-analysis. Expert Rev Anti Infect Ther. 2023;21:891–900.
  10. Knaus WA, et al. The APACHE III prognostic system: risk prediction of hospital mortality for critically ill hospitalized adults. Chest. 1991;100:1619–36.
  11. Pötter-Lang S, et al. Modern imaging of cholangitis. Br J Radiol. 2021;94:20210417. doi:10.1259/bjr.20210417.
  12. Banerjee S. Generating complex explanations for artificial intelligence models: an application to clinical data on severe mental illness. Life (Basel). 2024;14:807. doi:10.3390/life14070807.
  13. Karako K, Tang W. Applications of and issues with machine learning in medicine: bridging the gap with explainable AI. Biosci Trends. 2024;18:497–504.
  14. Beliaev AM, Zyul'korneeva S, Rowbotham D, Bergin CJ. Screening acute cholangitis patients for sepsis. ANZ J Surg. 2019;89:1457–61.
  15. Fathi M, Markazi-Moghaddam N, Ramezankhani A. A systematic review on risk factors associated with sepsis in patients admitted to intensive care units. Aust Crit Care. 2019;32:155–64.
  16. Liu Q, et al. A nomogram for predicting the risk of sepsis in patients with acute cholangitis. J Int Med Res. 2020;48:300060519866100. doi:10.1177/0300060519866100.
  17. Singer M, et al. The third international consensus definitions for sepsis and septic shock (Sepsis-3). JAMA. 2016;315:801–10.
  18. Joffre J, Hellman J, Ince C, Ait-Oufella H. Endothelial responses in sepsis. Am J Respir Crit Care Med. 2020;202:361–70.
  19. Mitchell E, Pearce MS, Roberts A. Gram-negative bloodstream infections and sepsis: risk factors, screening tools and surveillance. Br Med Bull. 2019;132:5–15.
  20. Fan S, Ma J. The value of five scoring systems in predicting the prognosis of patients with sepsis-associated acute respiratory failure. Sci Rep. 2024;14:4760. doi:10.1038/s41598-024-55257-5.
  21. Pérez-Fernández X, et al. Clinical variables associated with poor outcome from sepsis-associated acute kidney injury and the relationship with timing of initiation of renal replacement therapy. J Crit Care. 2017;40:154–60.
  22. Lambden S, Laterre PF, Levy MM, François B. The SOFA score—development, utility and challenges of accurate assessment in clinical trials. Crit Care. 2019;23:374. doi:10.1186/s13054-019-2663-7.
  23. Inan O, Sahiner ES, Ates I. Factors associated with clinical outcome in geriatric acute cholangitis patients. Eur Rev Med Pharmacol Sci. 2023;27:3313–21.
  24. Bakker J, Postelnicu R, Mukherjee V. Lactate: where are we now? Crit Care Clin. 2020;36:115–24.
  25. Brooks GA. The science and translation of lactate shuttle theory. Cell Metab. 2018;27:757–85.
  26. Salek J, Livote E, Sideridis K, Bank S. Analysis of risk factors predictive of early mortality and urgent ERCP in acute cholangitis. J Clin Gastroenterol. 2009;43:171–75.
  27. Schneider J, et al. Mortality risk for acute cholangitis (MAC): a risk prediction model for in-hospital mortality in patients with acute cholangitis. BMC Gastroenterol. 2016;16:15. doi:10.1186/s12876-016-0428-1.
  28. Lee TW, et al. Incidence, risk factors, and prognosis of acute kidney injury in hospitalized patients with acute cholangitis. PLoS One. 2022;17:e0267023. doi:10.1371/journal.pone.0267023.

재인쇄 및 허가

태그

XGBoostSHAP