연구 논문

비알코올성 지방간 질환 예측 및 외부 코호트 검증을 위한 자동화 머신러닝 모델

DOI:

10.3791/70033

2026년 7월 3일

* These authors contributed equally

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NHANES 데이터와 외부 코호트를 활용하여 비알코올성 지방간 질환을 선별하기 위한 단계별 AutoML 프로토콜이 제시됩니다. 이 방법은 기능 우선순위 지정 및 모델 선택(GBM)을 자동화하며, SHAP 기반 해석과 재현 가능한 임상 배포를 위한 외부 검증을 포함합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

비알코올성 지방간 질환(NAFLD)은 비만, 인슐린 저항성, 대사 증후군과 관련된 흔한 간 질환으로, 종종 진행된 단계까지 진단되지 않는 경우가 많습니다. 영상 검사와 간 생검을 포함한 전통적인 진단 방법은 조기 발견에 한계가 있습니다. 조기 NAFLD 선별을 위한 효율적이고 비침습적인 도구가 필요합니다. 자동화 머신러닝(AutoML) 기술을 사용하여 NHANES의 방대한 데이터셋(n = 2677)을 활용해 NAFLD 진단 모델이 개발되었습니다. 또한, 모델의 외부 타당성과 성능을 평가하기 위해 독립적인 외부 검증 코호트(n = 200명)가 사용되었습니다. 유망한 임상 특징 선정을 위해 LASSO 회귀와 ChatGPT 4 기반 지능형 분석을 결합한 2단계 특징 선택 방법을 적용하였습니다. 이후 여러 머신러닝 알고리즘을 통합한 AutoML 프로세스가 모델 학습과 검증을 위해 수행되었습니다. 모델의 성능은 ROC 곡선, F1 점수, SHapley 가법 설명(SHAP) 분석을 통해 평가되었습니다. GBM 모델은 학습 세트에서 AUC가 0.843, 테스트 세트에서 0.851, 외부 검증 세트에서 0.945를 달성하여 서로 다른 데이터셋에서 높은 진단 정확도를 보여주었습니다. BMI, 중성지방, GGT를 포함한 주요 예측 인자들이 모델 예측에 중요한 기여를 하는 것으로 확인되었습니다. SHAP 분석은 이러한 변수들이 NAFLD 예측에 중요함을 더욱 확인시켜 주었습니다. AutoML 기반 NAFLD 진단 모델은 조기 발견 성능이 크게 향상되었으며, 기존 진단 방법에 대한 신뢰할 수 있고 비침습적이며 효율적인 대안을 제시했습니다. 이 방법은 전문가 지식에 대한 의존도를 줄이고 진단 정확도를 높이며 NAFLD에서 더 넓은 임상 적용 가능성이 큽니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

비알코올성 지방간 질환(NAFLD)은 전 세계적으로 가장 흔한 간 질환 중 하나로, 현재 성인 인구의 약 35%에 영향을 미치고 있으며, 과도한 음주와는 관련이 없습니다1. 이 질환은 간세포의 5% 이상에 지방이 축적되는 것이 특징이며, 이는 염증, 간 섬유화, 간경변, 궁극적으로간부전과 같은 더 심각한 상태로 진행될 수 있습니다. 현재 NAFLD 진단의 전통적인 방법은 주로 비정상적인 간 생화학적 표지자와 초음파 영상에 의존하고 있습니다. 그러나 지방폐증 정도가 20% 미만일 때 초음파는 감도가 제한적이어서 경미한 지방 침투 감지의 신뢰성이 떨어지고, 종종 초기 단계의 NAFLD4 진단을 놓치게 됩니다. 간 생검은 NAFLD 진단의 골드 스탠다드로 여겨지지만, 그 침습적 특성과 통증, 감염, 출혈과 같은 합병증 위험 때문에 대규모 선별 검사는 제한적입니다. 따라서 NAFLD 선별을 촉진할 효율적이고 비침습적이며 비용 효율적이고 고민감도의 도구가 시급히 필요합니다.

인공지능(AI)과 머신러닝(ML) 기술의 급속한 발전과 함께, 데이터 기반 접근법은 NAFLD의 조기 진단과 위험 평가를 위한 새로운 해결책을 제공합니다. 대규모 복잡한 데이터를 분석함으로써 ML 기술은 잠재적인 패턴과 관계를 자동으로 식별할 수 있으며, 다양한 질병의 진단과 예측에 널리 적용되고 있습니다. 예를 들어, ML 알고리즘을 사용해 만성 B형 간염 바이러스 감염 환자의 간경변 위험을 예측하여 유망한 결과를 얻었습니다7. NAFLD 분야의 유사한 연구들은 지지 벡터 기계(SVM)와 무작위 숲(RF)과 같은 전통적인 머신러닝 알고리즘을 사용하여 진단 모델을 성공적으로 개발하여 높은 정확도를 달성하고 강력한 임상적 적용성을 입증했습니다 8,9,10,11,12,13,14,15,16,17, 18. 예를 들어, 연구자들은 일반 인구에서 일상적인 실험실 데이터를 분석하여 NAFLD를 효과적으로 선별하기 위해 실험실 매개변수를 활용한 머신러닝 모델을 개발했습니다. 일반 인구에서 일상적인 실험실 데이터를 분석하여 NAFLD를 효과적으로 선별하기 위해 실험실 매개변수를 활용한 ML 모델이 개발되었습니다. 미국에서 NAFLD의 유병률은 NHANES 2017–2018 데이터를 사용하여 일시적 탄성학과 머신러닝 기법을 결합하여 예측하였다16. 연구팀은 머신러닝 알고리즘을 활용해 일시적 탄성학과 다른 임상 변수 간의 상관관계를 조사하여, 다양한 인구에서 NAFLD의 유병률을 신뢰성 있게 추정하는 예측 모델을 개발했습니다.

하지만 전통적인 머신러닝 방법은 특히 특징 공학, 모델 선택, 파라미터 튜닝 등에서 상당한 수작업이 필요하며, 이는 전문적인 지식과 경험이 필요합니다. 이러한 한계를 해결하기 위해 자동화 머신러닝(AutoML)이 개발되었습니다. AutoML은 데이터 전처리, 특징 선택, 모델 선택, 하이퍼파라미터 최적화를 포함하는 전체 모델 구축 파이프라인을 자동화하여 머신러닝 프로세스의 효율성과 정확성을 크게 향상시킵니다19. 식도 정맥류 출혈에 대한 예측 모델이 H2O AutoML 플랫폼20을 사용하여 개발되고 검증되었습니다. 이 모델은 딥러닝(DL), 극한 그라디언트 부스팅(XGBoost), 일반화 선형 모델(GLM), 그래디언트 부스트 머신(GBM), 랜덤 포레스트(RF), 스태킹 앙상블 등 다양한 알고리즘을 사용하여 12개월 예측 범위를 가졌습니다. AutoML은 SEER 데이터베이스 데이터를 활용하여 위장관 기질종양 환자의 간 전이 위험을 예측하는 데 사용되었다21. AutoML 플랫폼은 일상적인 임상 데이터를 활용해 빠르고 비용 효율적인 전립선암 진단 도구를 개발하는 데 활용되었습니다22. AutoML의 등장 은 임상 진단에 더 효율적인 솔루션을 제공했으며, NAFLD 선별에서의 잠재력은 더 깊이 탐구할 가치가 있습니다. NAFLD의 조기 발견과 정확한 진단이 중요하지만, 이 질병의 무증상성은 진단에 큰 어려움을 안겨줍니다. AutoML 기술은 질병 진단에서 큰 잠재력을 보여주었지만, NAFLD 진단에서의 적용은 여전히 제한적이어서 이 연구 분야의 유망한 전망을 보여줍니다.

이 연구는 AutoML 기술과 일시적 탄성술을 결합하여 미국 NHANES 데이터베이스(2017–2018)의 데이터를 활용하여 비알코올성 지방간질환(NAFLD) 진단 모델을 개발했습니다. 이 모델은 원저우 의과대학 제1부속병원 감염병과 개인들의 데이터셋을 사용하여 외부에서 검증되었습니다(2018–2020). 연구는 외부 데이터셋에서 모델의 성능을 평가하고 기존 방법과 비교하여 기존 연구 격차를 해소했습니다. 여러 혈액 및 생화학적 표지자를 분석하여 로지스틱 회귀와 무작위 숲과 같은 알고리즘을 사용하여 예측 모델이 구축되었습니다. 결과는 비NAFLD 환자를 정확히 식별하는 데 있어 모델의 우수한 성과를 나타냈습니다. 이는 초기 NAFLD 선별을 위한 효율적이고 정밀한 도구를 제공할 뿐만 아니라 의료 응용 분야에서의 AutoML 통합을 진전시키는 데 기여합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

환자 및 연구 설계

이 연구의 첫 번째 데이터셋은 2017년부터 2018년까지 국립 건강 및 영양 검사 조사(NHANES) 데이터베이스에서 수집되었습니다. 이 특정 기간이 선정된 이유는 설문 데이터에 FibroScan® 기술을 이용한 간 초음파 일시적 탄성촬영 측정이 포함되어 있었기 때문입니다. NHANES는 층층화된 다단계 확률 표본 추출 설계를 사용하며, 전국적으로 2년마다 실시되는 인구 기반 조사 역할을 합니다. 이 연구소는 미국 내 비시설 수용 인구에 대한 국가대표성 건강 관련 데이터를 체계적으로 수집하여 미국 일반 민간인의 영양 및 건강 상태를 평가합니다. NHANES는 국가 건강통계 센터(NCHS)가 관리하는 전국적으로 대표적인 횡단면 연구입니다. 설문 프로토콜은 NCHS 연구 윤리 심사 위원회의 승인을 받았으며, 모든 참가자로부터 문서화된 사전 동의를 받았습니다. 이 연구는 헬싱키와 이스탄불 선언에 따라 수행되었으며, 원저우 의과대학 제1부속병원 윤리위원회(2016–246, 2016년 12월 1일)의 승인을 받았고, 각 참가자로부터 서면 동의를 받았습니다.

첫 번째 데이터셋은 20172018년 NHANES 설문조사에서 FibroScan 검사를 받은 5494명의 개인으로 구성되었습니다. 아래 제외 기준에 따라, 총 2677명의 참가자가 분석에 포함되었으며, 이 중 718명은 NAFLD 환자, 1959명은 비NAFLD 환자였습니다. 이 참가자들은 무작위로 훈련 세트(n = 1785)와 테스트 세트(n = 892)로 나누어졌습니다. 두 번째 데이터셋은 원저우 의과대학 제1부속병원 감염병과 소속 582명(2018–2020)으로 구성되었습니다. 동일한 제외 기준을 적용한 결과, 총 200명이 포함되었으며, 이 중 159명은 NAFLD 환자, 41명은 비NAFLD 환자였습니다. 이 코호트는 독립적인 검증 세트로 활용되었습니다. 연구 설계는 다센터 데이터를 활용해 모델을 구축하고 검증하기 위해 개발되었으며, 이를 통해 연구 결과의 신뢰성과 일반화 가능성을 높였습니다. NAFLD 그룹과 비NAFLD 그룹의 기초 임상 특성은 표 1 패키지(표 1)를 사용하여 요약하였습니다. 또한 환자 선정 과정과 전체 연구 흐름은 그림 1 나와 있습니다.

NAFLD의 진단 기준 및 제외 기준

NAFLD 진단은 다음 기준 16에 근거했습니다:18세 이상, 여성은 주당 ≤140g, 남성은 주당 210g≥≤ 알코올 섭취를 제한한 일시적 탄성검사(FibroScan) 선별 참여, FibroScan 502 V2 Touch 시스템(Echosens, 중형(M) 또는 초대형 (XL) 프로브를 사용하거나, 원저우의과대학 제1부속병원 감염병과에서 간 생검 병리학으로 확정된 진단을 받은 경우입니다.

NAFLD의 제외 기준은 다음과 같이 제시되어 있습니다:높은 음주량(NHANES 알코올 사용 조사5> 여성 평균 하루 섭취량 20g, 남성 > 30g), B 또는 C형 간염, HIV 감염, 자가면역 간염, 원발성 담관염, 윌슨병, 장기간 비스테로이드성 항염증제, 칼슘 채널 차단제, 타목시펜, 아미오다론, 코르티코스테로이드, 이소니아지드 또는 메토트렉세이트, 임신 또는 모유 수유, 간암 또는 기타 양성 또는 악성 종양 진단을 받은 경우.

자료 수집 및 변수 선택

이 연구에 포함된 잠재적 예측 변수는 아래에 나열되어 있습니다:

인구통계학적 특성(즉, 연령 및 성별); 체질량지수(BMI); NHANES 데이터베이스 내 참가자들의 CAP 값; 일반 생화학 검사 [예: 알부민(ALB), 글로불린(GLO), 총 단백질(TP), 락테이트 탈수소효소(LDH), 혈중 요소질소(BUN), 요산(UA), 감마-글루타밀 전이요법(GGT), 트리글리세라이드(TG), 혈청-포도당(Glu), 혈청 크레아티닌(SCr), 총 빌리루빈(TBIL), 나트륨(Na⁺), 염화물(Cl⁻), 칼륨(K⁺), 칼슘(Ca), 중탄산염(HCO₃), 총 콜레스테롤(TC), 아스파르트산 아미노트랜스퍼라제(AST), 알라닌 아미노트랜스퍼라제(ALT)]; 표준 혈액학적 지표 [예: 적혈구 수치(RBC), 백혈구 수치(WBC), 호중구 수치(NEUT), 호산구 수치(EOS), 림프구 수치(LYM), 단핵구 수치(MON), 적혈구 분포 폭(RDW) 및 혈소판 수치(PLT)]; 고혈압 및 당뇨병(DM) 병력. 연구에 포함된 피험자 중에서는 당뇨병과 고혈압의 진단 기준이 이전에 NAFLD24에 초점을 맞춘 머신러닝 기반 예측 모델 연구에서 얻어졌습니다.

누락된 데이터 처리 및 기능 선택

본 연구에 사용된 코호트 데이터에는 누락값이 포함되어 있었습니다. 모든 불완전 기록을 제외하면 분석 표본 크기가 줄어들 뿐만 아니라 데이터 품질을 저해하고 예측 결과에 편향이 발생할 수 있습니다. 따라서 누락 값이 20%를 초과하는 데이터는 제외되었습니다. 누락값이 있는 데이터셋≤20%)의 경우, 데이터 유형에 따라 다양한 치명법이 적용되었습니다: 연속 변수는 "norm", 이진 분류 변수는 "logreg", 다중 클래스 변수는 "polyreg"입니다. 이 보정은 다중 보정25에 대해 R의 "마우스" 패키지를 사용하여 수행되었습니다. 본 연구에서는 모든 연속 변수를 이분법으로 이분하여 이분법 변수로 나누었고, 최적의 분류 임계값은 수신자 운행특성(ROC) 곡선 분석을 통해 결정되었습니다. 구체적으로, ROC 곡선의 최대 유덴 지수에 해당하는 컷오프 포인트를 최적의 분류 기준으로 선택하여 분류 성능을 최적화하면서도 민감도와 특이성 간의 적절한 균형을 유지하였습니다. 이후 편소제곱판별분석(PLS-DA)을 사용하여 데이터를 효과적으로 군집화하였습니다.

추가 특징 선택을 위해, 개인들은 'caret' 패키지를 사용해 7:3 비율로 무작위로 훈련 및 시험 세트에 배정되었습니다. 첫째, 특징 선택에 최소 절대 축소 및 선택 연산자(LASSO) 회귀분석을 사용하여 14개의 주요 변수를 식별하여 후속 분석을 수행하였습니다. 다음으로 ChatGPT-4를 적용해 각 변수에 중요도 점수를 부여했습니다. 특징 중요도를 체계적으로 평가하면서 잠재적 편향과 확률적 변동을 통제하기 위해 표준화된 평가 프로토콜이 도입되었습니다. 모델에 제공된 구체적인 질문은 다음과 같았습니다: "비알코올성 지방간질환(NAFLD)에 관한 확립된 임상 문헌을 바탕으로, LASSO 회귀분석을 통해 확인된 다음 14개 변수 각각에 대해 1(최저)에서 10(최고)까지의 중요도 점수를 부여하라." 평가를 LASSO 회귀에서 미리 선택한 변수에만 엄격히 제한함으로써 환각이나 관련 없는 특징이 포함될 위험을 최소화했습니다. 잠재적인 데이터 유출과 결과 유병률의 부적절한 사용을 엄격히 방지하기 위해, 언어 모델은 경험적 데이터셋에 대해 완전히 눈을 가리지 않았습니다. 점수 산정은 변수 이름에 관한 기존 의학 지식을 종합하는 데 국한되었습니다. 이 절차는 LASSO 안정성 선택이나 SHAP 기반 가지치기와 같은 전통적인 방법론을 강화하여, 순수 데이터 기반 특징이 최종 모델 통합 전에 견고한 병태생리학적 타당성을 보여야 함을 보장합니다. 또한 단일 반응 분산을 완화하기 위해 이 절차를 10회 독립적으로 반복했습니다. 각 변수의 평균 점수는 이 반복들에 걸쳐 계산되어 객관적인 우선순위를 확보했습니다. 변수들은 평균 점수를 기준으로 내림차순으로 순위를 매겼습니다. 마지막으로, 평균 중요도 점수가 5를 초과하는 변수만 포함하도록 선정 범위를 좁혀 8개의 핵심 변수로 선정되었습니다: SCr, UA, GGT, Glu, 고혈압, 당뇨병, TG, BMI.

NAFLD를 위한 AutoML 기반 예측 모델 개발

본 연구에서는 고전 및 고급 머신러닝 알고리즘을 H2O AutoML을 활용하여 NAFLD의 효과적인 진단을 통합하였습니다. H2O.ai 플랫폼의 AutoML 기능을 활용하여 이진 분류 작업에 대한 머신러닝 분석이 수행되었습니다. 사용된 알고리즘에는 극한 그라디언트 부스팅(XGBoost), 그라디언트 부스팅 머신(GBM), 일반화 선형 모델(GLM), 극도로 무작위 트리(XRT), 딥러닝(DL), 스택드 앙상블 등이 포함됩니다. 이 알고리즘들은 질병 진단에 최적의 모델을 찾기 위해 체계적으로 평가되었습니다. 엄격한 방법론적 재현성을 보장하기 위해 H2O AutoML의 실행 매개변수가 명시적으로 정의되었습니다. 자동 검색은 최대 11,687초의 실행 시간과 최대 302개의 모델로 제한되었으며, 고정된 무작위 시드인 13개를 사용했습니다. 내부 전처리 플래그에는 평균/모드 알고리즘을 이용한 잔여 누락값의 자동 보철과 고탄수성 범주 변수에 대한 타겟 인코딩이 포함되었습니다. 선택된 최적 아키텍처(GBM_grid_1_model77로 표기됨)는 다음과 같은 구체적인 하이퍼파라미터를 가진 그라디언트 부스터팅 머신이었습니다: 총 28개의 트리, 최대 트리 깊이 5, 학습률 0.1.

모델의 견고성을 높이고 과적합 위험을 완화하기 위해 체계적인 하이퍼파라미터 튜닝 및 검증 프로토콜을 통합한 AutoML 프레임워크가 구현되었습니다. 이 과정은 하이퍼파라미터 최적화를 통해 200개의 서로 다른 모델 구성을 자동 탐색하는 것으로 시작되었으며, 5중 교차 검증을 통해 훈련 데이터셋을 다섯 개의 상호 배타적인 하위 집합으로 나누었습니다. 반복 훈련 동안 각 구성은 모델 구축에 4개의 하위 집합(80%)을 사용하고, 검증을 위해 1개의 하위 집합(20%)을 예약했으며, 이 검증 역할은 모든 폴드에 순차적으로 회전했습니다. 계산 효율성과 성능 최적화의 균형을 맞추기 위해, ROC 곡선(AUC) 지표 아래 면적을 기반으로 동적 조기 정지가 구현되었습니다. 이 메커니즘은 AUC 개선이 3주기 연속 0.001 임계값 이하로 떨어지면 개별 모델 정제와 전체 AutoML 검색 과정 모두에 적용되어 훈련을 중단시켰습니다. 최종 모델 선택은 훈련 및 검증 세트 모두에서 최대 평균 AUC를 보여주는 구성을 우선시하며, 동시에 이들 집합 간 일관된 성능과 교차 검증 반복 간 최소 메트릭 분산을 요구했습니다. 이 통합 접근법은 엄격한 검증 프로토콜과 자동 최적화 제약 조건을 통해 강력한 일반화성을 유지하면서 최적의 예측 정확도를 보장했습니다.

모델 성능 평가 및 예측 결과 해석

모델 성능과 예측 결과 해석은 ROC 곡선, F1 점수, SHapley 가법 설명(SHAP) 분석을 통해 포괄적으로 평가되었습니다. 모델의 성능과 예측 결과 해석은 ROC 곡선, F1 점수, SHapley 가법 설명(SHAP) 분석을 통해 포괄적으로 평가되었습니다. 초기에는 훈련된 모델을 사용해 테스트 데이터셋에서 예측을 생성하고, 양성 클래스(즉, 클래스 1)에 대한 예측 확률(pred_prob)을 추출했습니다. ROC 곡선은 pROC 패키지를 사용하여 구성되었고, 모델의 AUC와 95% 신뢰구간이 계산되었습니다. ROC 곡선의 최적 임계값은 이진 분류 레이블 결정에 있어 Youden의 J 통계량(J = 민감도 + 특이도 − 1)을 사용하여 결정되었습니다. ROC 곡선에서 도출된 이 임계값을 바탕으로 예측 확률을 이진 예측 라벨(0 또는 1)로 변환하고, 이후 혼동 행렬이 생성되었습니다. 시험 세트의 F1 점수는 혼동 행렬 함수를 사용해 계산했으며, 혼동 행렬의 시각화를 생성하여 저장하였습니다. 또한, 원저우 의과대학 제1부속병원에서 200건의 독립 외부 검증 데이터셋을 통해 모델이 추가로 검증되었습니다. SHAP 값은 "shapviz" 패키지를 사용하여 각 변수가 모델 예측 결과에 미치는 영향을 명확히 분석하였으며, 이를 통해 개별 NAFLD 가능도 예측 해석에 대한 통찰을 제공하였습니다.

통계적 방법

"통계 분석과 소프트웨어 개발은 R 버전 4.2.3(R 통계 컴퓨팅 재단, 비엔나, 오스트리아)을 사용하여 수행되었습니다. 연속 변수들은 처음에 Shapiro-Wilk 검정 또는 Q-Q 플롯의 육안 검사를 통해 정규성을 평가하였습니다. 정규분포 데이터는 평균 ± 표준편차(SD)로 제시되었고, 독립적인 두 그룹 간의 비교는 독립적인 표본 t-검정을 사용했습니다. 다중 그룹 비교의 경우, 적절할 경우 사후 Tukey's HSD 검사와 함께 일원 ANOVA를 사용하였습니다. 비정규 분포 연속 데이터는 중앙값 [4분위 범위(IQR), P25–P75]로 요약되었으며, 두 독립 그룹에 대해서는 Mann-Whitney U 검정, 다군에 대해서는 Kruskal-Wallis 검정을 사용한 뒤 필요시 Dunn의 사후 검정을 사용하였습니다. 범주별 변수는 빈도와 백분율(%)로 표현되었으며, 그룹 간 비율 비교는 예상 세포 수가 5 미만일 경우 카이제곱 검정(χ2 검정) 또는 피셔 정확 검정을 사용해 분석하였다. 유의수준은 α = 0.05(양측 기준)로 설정되었으며, p 값 0.05< 통계적으로 유의미한 것으로 간주되었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NAFLD의 임상적 특징

본 연구에서는 NAFLD가 있는 개인과 없는 개인의 임상 특성을 체계적으로 분석하였습니다. 표본 모집단 내에서 이러한 특징들의 분포와 차이를 명확히 보여주기 위해 다양한 방법이 사용되었습니다(표 1). 총 2,677명이 분석에 포함되었으며, 이 중 718명이 NAFLD를 앓고 있었습니다. 분석은 BMI, TG, GGT, UA 등 다양한 임상 지표를 포함했습니다( 그림 1에 나타난 참조). 임상 및 대사 변수에 대해 PLS-DA를 수행함으로써 NAFLD군과 비NAFLD 그룹 간에 유의미한 분리가 관찰되었으며(그림 2A), 이러한 임상 특징이 NAFLD와 비NAFLD를 구별하는 데 매우 중요함을 나타냅니다. 더불어, 히트맵(

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NAFLD는 전 세계적으로 만성 간 질환의 가장 흔한 원인이며, 유병률은 매년 약 1%씩 증가합니다26. 전 세계 인구의 약 30%가 영향을 받고 있어 NAFLD는 만성 간 질환의 주요 원인일 뿐만 아니라 간 이식 적응증으로 가장 빠르게 증가하는 질환입니다. 자동화 머신러닝(AutoML)은 의학에서 가치 있는 도구로 부상했으며, 그 주요 목표 중 하나는 입력 특징 간의 상관관계를 식별하여 예측 모델을 구축하는 것입니다. 점점 더 많은 연구들이 ML이 지방간 질환 진단 모델 개발에 강력한 잠재력을 가지고 있음을 강조하고 있습니다. 이 연구는 AutoML 기술을 효과적으로 활용하여 NAFLD 진단 모델을 구축하였습니다.

NHANES 2017–2018 데이터셋에 엄격...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 충돌이 없다고 선언합니다. 본 연구에서는 ChatGPT-4(OpenAI)가 LASSO 회귀로 확인된 변수의 임상적 관련성을 평가하기 위한 특징 선택 단계에서 지능형 분석 도구로 사용되었습니다. 모든 AI 생성 점수는 저자들에 의해 신중히 검토되었고, 이후 AutoML 과정을 통해 실증적으로 검증되었습니다. ChatGPT-4는 원시 데이터를 변경하거나 수학적 계산을 수행하는 데 사용되지 않았습니다. 저자들은 최종 결과의 무결성과 정확성에 대해 전적인 책임을 집니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 푸젠의과대학교 과학연구창업기금[2021QH1176]의 지원을 받았습니다. 저장성 임상실험실 진단 및 중개 연구 핵심 연구소 [2022E10022]; 저장성 의료보건기술계획 프로젝트[2024KY1265]; 원저우시 기초 공공복지 연구 프로젝트 [Y2023096].

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
NAFLD (2017–2018) 데이터 세트NHANES 데이터베이스 [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/A모델 구성을 위한 학습 세트
NAFLD (2018–2020) 데이터 세트중국 원저우 의학 대학교 제1부속병원(2018–2020), [https://doi.org/10.6084/m9.figshare.32105248.]N/A모델의 외부 검증을 위한 테스트 세트
R (버전 4.2.3)R 통계 컴퓨팅 재단N/A데이터 분석을 수행하고 시각적 및 그래픽 프레젠테이션을 생성하기 위해 다른 도구와 함께 사용
Adobe Illustrator 2025 (버전 29.2)Adobe Systems IncorporatedN/A이미지 레이아웃 및 편집
ChatGPT-4OpenAI Inc.N/A각 선택된 변수에 중요도 점수를 할당
H2O AutoML (3.44.0.3)H2O.aiN/A포괄적인 기계 학습 알고리즘 세트를 통합
```

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

233233JoVEAutoMLGradient Boosting Machine

관련 논문