본 연구는 폐렴 관련 ARDS의 조기 진단과 임상 표현형 분석을 위한 기계 학습 모델을 통합하여 정밀 치료를 촉진하는 웹 기반 시스템을 개발하고 외부 검증하는 것을 목표로 합니다.
Research Article
본 연구는 폐렴 관련 ARDS의 조기 진단과 임상 표현형 분석을 위한 기계 학습 모델을 통합하여 정밀 치료를 촉진하는 웹 기반 시스템을 개발하고 외부 검증하는 것을 목표로 합니다.
급성 호흡곤란 증후군(ARDS)은 임상적 증상이 중증 폐렴과 겹칠 수 있는 매우 이질적인 질환으로, 정확한 분별에 어려움을 줍니다. 따라서 ARDS 환자의 조기 예측과 신속한 아형 집집화가 시급히 필요합니다. 본 연구는 폐렴 관련 ARDS의 발병 및 표현형을 예측하기 위한 검증된 초기 진단 모델과 임상 하위 그룹 분류를 포함하는 웹 기반 시스템을 개발하는 것을 목표로 합니다. 진단 및 하위 그룹 모델은 두 개의 대형 데이터베이스인 Medical Information Mart for Concentration Care IV(MIMIC-IV)와 원격 의료 중환자실(eICU)에서 개발 및 검증되었으며, 웹 기반 예측 시스템에 통합되었습니다. 2008년부터 2019년까지 24시간 이상 입원한 폐렴 환자들의 데이터를 분석하였습니다. MIMIC-IV 유도 코호트에는 폐렴 환자 24,987명(폐렴 관련 ARDS 환자 14,121명)이 포함되었으며; eICU 검증 코호트에는 폐렴 환자 20,676명(폐렴 관련 ARDS 환자 9,946명)이 포함되었습니다. 진단 과정에서 머신러닝의 스태킹 방법은 MIMIC-IV 유도 코호트에서 AUC 0.919, 정확도 70.00%, 정확도 69.88%, 회상 82.27%로 가장 우수한 성능을 보였습니다. eICU 검증 코호트의 AUC, 정확성, 정밀도, 회상율은 각각 0.915, 70.87%, 69.70%, 69.70%였습니다. 폐렴 관련 ARDS는 서로 다른 임상 특성과 결과를 가진 세 가지 임상 표현형으로 분류되었으며, 이들 모두 치료에 대해 다르게 반응하였습니다. 0번과 1번 클러스터 환자들 사이에서는 조기 코르티코스테로이드 치료를 받은 환자들의 병원 내 사망률이 그렇지 않은 사람들보다 높았으며, 클러스터 2 환자들 사이에서는 코르티코스테로이드를 투여받은 환자의 병원 내 사망률이 그렇지 않은 사람들보다 낮았다. 폐렴 관련 ARDS의 진단, 예측 및 임상 하위 그룹 분류를 웹 변환으로 수행하였습니다. 폐렴 관련 ARDS의 초기 임상 진단 및 임상 하위 분류를 위한 웹 기반 모델은 임상의들이 질병 진단 및 치료, 그리고 개별화된 정밀 치료를 촉진하는 데 도움을 줄 수 있습니다.
급성 호흡부전, 특히 폐 감염 후 급성 호흡곤란 증후군(ARDS)은 중증 환자에서 흔히 겪는 치명적인 문제입니다. 연구에 따르면 중환자실(ICU) 환자 사이에서 ARDS 발생률이 최대 10%에 달하며, 사망률은 약 40%에 달합니다2,3. 중증 폐렴은 ARDS4의 주요 원인으로 널리 간주됩니다. 중증 폐렴과 ARDS의 임상 증상이 유사하기 때문에 ARDS와 중증 폐렴을 구분하기 어려운 경우가 많습니다. 따라서 폐렴 환자에서 ARDS 발병을 조기에 예측하면 ARDS 발생률과 사망률을 줄일 수 있습니다5. 또한 ARDS는 매우 이질적인 질병이기 때문에, 조기 및 정확한 하위 분류는 정밀 의학을 가능하게 합니다. 이러한 분류는 전 세계 호흡기 중증 질환 연구의 주요 방향 중 하나이기도 하며, 목표는 표적 하위 그룹 개입의 효과를 향상시키는 것입니다.
현재 ARDS의 독립적인 위험 인자는 광범위하게 연구되었으나, 폐렴 환자에서 ARDS의 예측에 초점을 맞춘 연구는 거의 없습니다. 더불어, 폐렴 관련 ARDS의 특정 임상 표현형에 대한 연구는 수행되지 않았습니다; 대부분의 표현형 연구는 ARDS 환자 전체를 대상으로 했습니다. Calfee 등은 ARDS를 과염증형과 저염증형 표현형으로 분류했습니다 . 이러한 생물학적 표현형을 정의하기 위해서는 혈장 바이오마커를 범주적 정의 변수로 사용해야 하지만, 이러한 연구는 임상 현장에서 쉽게 제공되지 않습니다. 한 연구에서는 쉽게 구할 수 있는 임상 지표를 사용하여 ARDS를 세 가지 임상 표현형으로 분류하고, 무작위 중재에 대한 반응도 평가했으나, 연구는 ARDS환자 전체 집단을 기반으로 했습니다. 폐렴과 같은 다양한 원인에 따라 ARDS의 임상 표현형을 정의하면 더 정밀하고 정확한 결과를 얻을 수 있습니다.
본 연구의 목적은 머신러닝을 활용해 초기 임상 데이터를 바탕으로 폐렴 관련 ARDS의 예측 모델을 구축하는 것이었습니다; 초기 및 쉽게 구할 수 있는 임상 데이터를 활용하여 폐렴 관련 ARDS를 임상 표현형으로 분류하고, 이들의 임상 특성, 결과 및 치료 반응의 차이를 탐구하는 것; 그리고 예측 모델 및 분류 모델을 웹 기반 애플리케이션으로 구현하여 폐렴 관련 ARDS의 진단 및 치료를 지원하고 추가 연구를 촉진하는 것.
Access restricted. Please log in or start a trial to view this content.
본 연구는 보호 인간 연구 참여자 검사(기록 번호: 44151052)를 완료한 후 중환자실 I(MIMIC-IV) 데이터베이스11(버전 1.0, PhysioNet: https://physionet.org/content/mimiciv/1.0/)과 원격 의료 중환자실(eICU) 데이터베이스12(버전 2.0, PhysioNet: https://physionet.org/content/eicu-crd/2.0/)에 접속하였습니다. 이 연구는 헬싱키 선언(2013)의 원칙에 따라 수행되었으며, 환자들은 두 데이터베이스에 자신의 데이터가 수집되는 데 동의를 제공했습니다. eICU 및 MIMIC-IV 데이터베이스의 데이터가 완전히 익명화되어 (개인 식별자 보존 없음) 윤리적 승인은 포기되었습니다.
재료와 도구
데이터 출처: MIMIC-IV 데이터베이스: 버전 1.0, 단일 센터 오픈 액세스 등록부, 76,540건의 ICU 입원 기록(2008-2019), PhysioNet을 통해 접근 가능. eICU 데이터베이스: 버전 2.0, 2014년부터 2015년까지 미국 208개 병원 335개 유닛에서 200,000건의 전자 의료 기록>을 포함한 다센터 데이터베이스, PhysioNet을 통해 접근 가능. 소프트웨어 및 실행 환경: RapidMiner Studio: 버전 9.10.001 (실행 환경: Windows 10 Pro 64비트), 모델 구축(분류/클러스터링) 및 기능 선택에 사용; IBM SPSS Statistics: 버전 23.0 (실행 환경: Windows 10 Pro 64비트), 통계 분석 및 누락값 보정에 사용; 자바 개발 키트(JDK): Java SE 8u381 버전(실행 환경: Windows 10 Pro 64비트), 웹 애플리케이션 개발에 사용; IDE 지원: Eclipse IDE 2023-09; Apache Tomcat: 버전 9.0.85, 웹 기반 애플리케이션 배포에 사용됩니다.
연구 설계 및 환경
이 연구의 개념은 보충 그림 1에 설명되어 있습니다. 이 연구는 중환자실 IV용 의료 정보 마트(MIMIC-IV)와 원격의료 중환자실(eICU) 데이터베이스 두 곳의 주요 출처에서 데이터를 분석하여 폐렴 관련 ARDS의 예측 모델을 구축하고 임상 표현형에 따라 영향을 받은 환자를 분류하였습니다. 이 연구는 개인 예후 또는 진단을 위한 다변수 예측 모델의 투명 보고(TRIPOD) 지침을 따랐습니다.
연구 샘플
이 연구의 훈련 및 시험 데이터는 MIMIC-IV에서 수집되었습니다. 외부 검증의 출처는 다센터 eICU 데이터베이스였습니다. 이 연구는 국제 질병 분류(9차 및 10차 개정판)를 사용하여 폐렴 및 폐렴 관련 ARDS 환자에 대한 데이터를 추출하였습니다. 입원 기간이 24시간 미만인 환자는 제외되었습니다.
예측 변수
MIMIC-IV 및 eICU 데이터셋에서 데이터 가용성과 임상 변수 누락률을 평가한 후, 폐렴 관련 ARDS의 52개 변수를 머신러닝에 사용할 후보 학습 변수로 선정되었으며, 여기에는 환자의 인구통계학적 특성, 실험실 소견, 질병 중증도 점수가 포함되었습니다. 본 연구는 변수와 결과 간 상관관계 가중치를 기반으로 가중치별 상관관계 알고리즘을 사용하여 52개의 후보 변수 중 핵심 예측 변수(최종적으로 모델에 포함되는 변수)를 선별하고, 주요 예측 변수들 중에서 하위 그룹 군집화 요인을 선별했습니다.
이를 위해서는 RapidMiner Studio를 열고 새 프로세스를 생성한 뒤, 상관관계에 따른 가중치(Weight: Weight) 연산자 >> Process > 연산자에 클릭해 상관관계에 따른 가중치(Weight: Weight)를 추가하세요. 매개변수를 설정: 상관관계 임계값 = 0.04(가중치 0.04 변수 유지)>. 질병 초기 단계와 시기 적시성을 모델에 반영하기 위해, 입원 후 24시간 이내에 실험실 지표의 최대값과 최소값을 얻었습니다. 급성 생리학 점수 III(APSIII)가 eICU 데이터베이스에 포함되지 않았기 때문에, 급성 생리학 및 만성 건강 평가 IV(APACHE IV) 점수가 대신 사용되었습니다. 이 연구는 다중 보정법을 사용해 데이터를 정리하고 누락값을 보간했으며, 예측 및 하위 표현형 모델 개발 시 입력 변수를 표준화하였습니다.
통계 분석
SPSS 23.0을 열고 전처리된 데이터셋을 가져오고, ' > 설명 통계 분석' > 탐색을 선택하세요. 연속 변수에 대해 콜모고로프-스미르노프 검정을 수행하려면 정 규성 플롯과 검정 을 확인하세요. 왜곡된 분포 변수는 중앙값(4분위 범위, IQR)으로 보고됩니다; 범주별 변수는 count (percentage, %)로 보고됩니다. 그룹 간 연속 변수를 비교하기 위해 Mann-Whitney U 검정 또는 Kruskal-Wallis 검정이 적절히 사용되었습니다. 그룹 간 범주 변수를 비교하기 위해 적절히 피어슨 카이제곱 검정 또는 피셔 정확 검정을 사용했습니다.
모델 개발 및 웹 프레젠테이션
모델 개발을 위해 본 연구는 MIMIC-IV 도출 코호트를 훈련 세트(전체 샘플의 90%가 모델 개발 및 하이퍼파라미터 튜닝을 위해 무작위로 선택됨)와 테스트 세트(전체 샘플의 10%가 내부 검사를 위해 무작위로 선택됨)로 나누었습니다; 이 연구는 eICU에서 외부 검증을 수행했습니다. 이 연구는 다섯 가지 방법으로 머신러닝을 구현했습니다: 의사결정 나무, 로지스틱 회귀, 나이브 베이즈, 스태킹(기본 학습자는 로지스틱 회귀, 나이브 베이즈, 랜덤 포레스트 방법이었으며, 스태킹 학습기는 결정 트리 방법이었습니다), 그리고 랜덤 포레스트입니다. 의사결정 트리: 프로세스 > 연산자> 모델링 > 분류 > 알고리즘 = C4.5, 최소 잎 크기 = 5의 결정 트리를 클릭하세요. 로지스틱 회귀를 위해: 정규화 강도 = 0.1, 최대 반복 = 100 > 모델링 > 분류 > 프로세스 > 연산 자를 클릭하세요. 나이브 베이즈에 대해: 과정 > 연산자 > 모델링 > 분류 > 커널 타입 = 가우시안의 나이브 베이즈를 클릭하세요. 랜덤 포레스트에 대해: 수> 수 = 100, 최대 깊이 = 20인 랜덤 포레스트 모델링 > >분류 과정 > 연산 자를 클릭하세요. 스태킹을 위해: 프로세스 > 연산자 > 모델링 > 앙상블 > 기본 학습자 스택 = 로지스틱 회귀 + 순진한 베이즈 + 랜덤 포레스트를 클릭하세요; 학습자 쌓기 = 결정 트리. 이 연구는 수신기 작동 특성 곡선(AUC) 하의 면적, 정확성, 정밀도, 호출율을 계산하여 개발된 모델의 예측 성능을 측정하였습니다.
폐렴 관련 ARDS 임상 하위군 분류를 구축하는 과정에서 본 연구는 주요 예측 변수가 포함된 k-평균 군집을 사용하였습니다. 최적의 클러스터 k의 수를 결정하기 위해 갭 통계 그래프의 갭 통계 값을 검토하여 최적의 클러스터 수를 제안했다. 이 연구는 다양한 표현형의 임상 특성과 결과를 분석하고, 조기 저용량에서 중용량 코르티코스테로이드 치료를 받은 환자와 받지 않은 환자 간 병원 내 사망률 차이를 비교했습니다.
RapidMiner Studio에서 파일 > 모델 내보내 기를 선택하고 진단 예측 및 하위 그룹 분류 모델을 .model 파일 파일로 저장하세요. JDK Java SE 8u381과 Eclipse IDE 2023-09를 사용하여 Java 언어로 웹 페이지를 작성할 수 있습니다; .model 파일을 프로젝트에 가져오세요. 이 연구는 Java 언어를 사용하여 진단 모델과 임상 하위 그룹 클러스터링 모델을 내장한 웹페이지를 개발했고, 모델을 온라인에 업로드했습니다.
Access restricted. Please log in or start a trial to view this content.
참가자
MIMIC-IV 데이터베이스에는 폐렴 환자 24,987명의 데이터가 포함되었으며, 이 중 14,121명이 폐렴 관련 ARDS를 앓고 있었습니다(표 1). eICU 데이터베이스에는 폐렴 환자 20,676명이 포함되었으며, 이 중 9,946명이 폐렴 관련 ARDS를 앓고 있었습니다(보충표 1).
폐렴 관련 ARDS 예측 모델의 확립 및 검증
우리는 MIMIC-IV 코호트의 데이터를 사용하여 폐렴 관련 ARDS 진단 모델을 구축하였습니다. 이 모델은 eICU 코호트 데이터를 통해 외부에서 검증되었습니다. MIMIC-IV 코호트 환자들은 무작위로 훈련 코호트(n = 22,488명 [90%])와 테스트 코호트(n = 2499명 [10%])로 나뉘었습니다. 우리는 상관관계에 의한 가중치(weight-by) 알고리즘을 사용하여 입력 변수 중 가중치가 높은...
Access restricted. Please log in or start a trial to view this content.
알다시피, 이 모델은 폐렴 환자에서 ARDS를 기계학습을 활용한 최초의 진단 모델 및 임상 하위 그룹 분류 모델이며, 폐렴 관련 ARDS의 진단 및 임상 하위 분류를 보고한 최대 규모의 연구입니다. 이 연구에서 우리는 두 가지 머신러닝 기반 모델을 도출하고 검증하여 임상 실무와 이후 연구를 위한 웹 기반 애플리케이션으로 전환했습니다. eICU 검증 코호트에서 폐렴 환자 중 폐렴 관련 ARDS가 발생할 예측은 AUC가 0.915, 정확도 70.87%, 정확도 69.70%, 기억 69.70%를 기록했습니다. 또한 폐렴 관련 ARDS 환자에 대해 간단하고 신속한 임상 예측 변수를 사용하여 임상 하위 그룹 군집화를 수행했습니다. 세 가지 표현형은 초기 저용량에서 중용량 코르티코스테로이드 치료에 대해 다르게 반응했습니다.
이 연구에서 기계 학습에 사용된 스태킹 방법은 본질적으로 k-fold 교차 검증 모델이었습니...
Access restricted. Please log in or start a trial to view this content.
저자들은 서로 상충하는 이해관계가 없다고 선언한다.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 아파치 톰캣 | Apache 소프트웨어 재단 | 버전 9.0.85 | |
| 이클립스 IDE | 일식 | 2023-09 | |
| Java Development Kit | 자바 | 버전 Java SE 8u381 | |
| 래피드마이너 스튜디오 | 알타이어 엔지니어링 주식회사 | 버전 9.10.001 | |
| SPSS 통계 | IBM | 버전 23.0 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission