본 연구는 네 가지 기계 학습 알고리즘, 즉 K-최근접 이웃(KNN), 지지 벡터 기계(SVM), 극한 구배 부스트(XGBoost), 그리고 소프트 투팅 앙상블 분류기를 통해 갑상선기능저하증의 선제적 진단을 연구합니다. 알고리즘은 비판적 문헌 검토를 바탕으로 최종 후보에 선정되었으며, 사우디아라비아에서 수집된 현지 데이터셋을 기반으로 사용되었습니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
본 연구는 네 가지 기계 학습 알고리즘, 즉 K-최근접 이웃(KNN), 지지 벡터 기계(SVM), 극한 구배 부스트(XGBoost), 그리고 소프트 투팅 앙상블 분류기를 통해 갑상선기능저하증의 선제적 진단을 연구합니다. 알고리즘은 비판적 문헌 검토를 바탕으로 최종 후보에 선정되었으며, 사우디아라비아에서 수집된 현지 데이터셋을 기반으로 사용되었습니다.
갑상선기능저하증은 사우디아라비아에서 가장 흔하지만 과소진단된 의학적 상태 중 하나입니다. 이는 노인과 임산부, 당뇨병 및 수면 무호흡증 환자에게서 더 흔하게 나타납니다. 갑상선기능저하증은 갑상선이 갑상선 호르몬을 부족하게 분비하는 것이 특징이며, 치료하지 않으면 다른 만성 질환으로 이어질 수 있습니다. 이러한 이유로, 본 연구는 사우디아라비아의 간단한 임상 데이터셋을 활용해 이 질병을 선제적으로 진단할 수 있는 머신러닝 기법을 제안합니다. 데이터 크기를 고려할 때, 이 연구는 개념 증명 역할을 합니다. KNN, SVM, Gradient boosting, 소프트 투팅 앙상블 분류기와 같은 알고리즘은 문헌에 나오는 다른 알고리즘에 비해 갑상선기능저하증 및 관련 질환의 선제적 진단 성능이 유망하다는 이유로 선택되었습니다. 가장 우수한 모델은 소프트 투팅 앙상블 분류기로 94.7%의 정확도를 달성했습니다. SVM, KNN, XGBoost는 각각 94%, 93.42%, 92.1%의 정확도를 달성했습니다. 이 결과는 10배 교차 검증과 순차적 특징 선택을 통해 얻어졌습니다.
갑상선 기능 장애(TD)는 가장 흔한 만성 내분비 질환 중 하나로, 개체군에 따라 유병률이 다양합니다1. 가장 흔한 갑상선 질환 두 가지는 갑상선기능저하증과 갑상선기능항진증입니다. 갑상선기능저하증은 갑상선 호르몬 분비 부족으로 인해 발생하는 흔한 질환입니다. 일반적으로 치료로 관리할 수 있지만, 심각한 경우에는 치료하지 않으면 치명적일 수 있습니다. 성인에서 갑상선기능저하증의 가장 흔한 증상으로는 피로, 변비, 무기력, 체중 증가, 건조한 피부, 목소리 변화가 있습니다. 하지만 임상 증상은 연령, 성별 및기타 요인에 따라 다를 수 있습니다. 3. 이 질병은 일반 인구의 5%에 영향을 미치며, 추가로 5%는 진단받지 못한 상태로 남아 있으며, 이 중 99%는 원발성 갑상선기능저하증을 앓고 있습니다. 아라비아걸프 국가들에서 널리 퍼져 있으나, 종종 과소진단되는 경우가 많습니다. 사우디아라비아에서는 선천성 갑상선기능저하증이 약 3,450명의 아기에게 영향을 미칩니다. 여성만을 대상으로 한 다른 단면 연구들은 13%에서 35%까지 더 높은 유병률을 보고했습니다5. 더 나아가 여성이 남성보다 더 취약하다는 것을 증명합니다. 갑상선기능저하증은 치료하지 않으면 지질이상 혈증, 인지 장애, 고혈압, 불임, 신경근기능 장애로 이어질 수 있습니다7. 따라서 본 연구는 사우디아라비아 담맘에 위치한 킹 파하드 전문 병원(KFUH)의 데이터셋을 활용하여 기계 학습 기법을 활용해 갑상선기능저하증을 선제적으로 진단하는 것을 목표로 합니다.
갑상선기능저하증은 증상이 종종 다른 질병과 혼동되기 때문에 진단이 어려울 수 있습니다.8. 더욱이, 갑상선기능저하증의 늦은 진단은 환자의지적 능력에 부정적인 영향을 미칠 수 있습니다. 갑상선 자극호르몬(TSH) 검사는 갑상선기능저하증 진단에 가장 많이 사용되는 방법입니다. 하지만 인공지능과 머신러닝 접근법, 전략, 도구의 등장은 다양한 의료 분야에서 진단 및 예후 문제를 해결하는 데 도움을 주었습니다. ML은 임상 요인과 그 조합이 예후에 미치는 중요성을 평가하는 데 사용되며, 예를 들어 질병 진행 예측, 결과 연구를 위한 의학 지식 추출, 치료 계획 및 지원, 전반적인 환자 관리 등이 포함됩니다10. 방대한 양의 의료 데이터가 제공되면서, 의료진은 이제 머신러닝을 통해 새롭고 잠재적으로 가치 있는 지식을 발견할 수 있는 소중한 자원을 갖게 되었습니다11,12.
사우디 데이터셋의 간단한 임상 데이터셋을 사용하여 본 연구는 해당 국가의 보건 종사자들이 갑상선기능저하증을 조기에 진단하고, 컴퓨터 자원과 장비가 제한된 병원에서 이 예측 시스템을 도입하는 데 도움을 주는 것을 목표로 합니다. 또한, 이 분야의 이전 연구들은 사우디 데이터셋을 활용하지 않았습니다. 이는 사우디 데이터셋을 이전 연구와 함께 통합할 기회를 제공합니다. 연구들은 사우디 데이터셋을 활용해 각각 신장 질환, 당뇨병, 갑상선 질환, 알츠하이머병을 예측했으며, 높은 정확도(13, 14, 15)를 달성했습니다. 이 경험은 이러한 방법들을 사우디아라비아의 다른 질병에 적용하는 동기를 부여합니다. 이 연구들은의료 분야의 기계 학습과 인공지능 분야의 최신 연구 중 하나로 평가받고 있습니다.
제안된 연구는 간단한 임상 사우디 데이터셋에 머신러닝 기법을 적용하여 갑상선기능저하증이 완전히 나타나기 전에 질병의 존재를 예측하는 방안을 논의합니다. 목표는 갑상선기능저하증 발생 가능성을 조기에 경고하는 기계 학습 기반 시스템을 개발하는 것입니다. 또한 장비가 제한된 지역 병원들이 이 진단 시스템을 더 쉽게 사용할 수 있도록 할 것입니다. 이 연구는 사우디 데이터셋을 사용하여 이 질병을 처음으로 조사했으며, 증상 전 단계에 초점을 맞추고 있습니다. 이 데이터셋은 사우디 지역 병원 환자 집단을 포함하며, 연령대가 넓고 양성 및 음성 갑상선 기능 항진증 사례가 혼합되어 있습니다.
이 연구는 네 가지 머신러닝 알고리즘을 활용했습니다: 지원 벡터 머신(SVM), K-최근근접 이웃(KNN), 극한 그라디언트 부스트(XGBoost), 그리고 SVM과 KNN으로 구성된 소프트 투팅 앙상블 분류기. 네 가지 알고리즘 각각은 의료 분야에서 그 역량을 입증했습니다. KNN 알고리즘은 단순함과 당뇨병(DM)의 선제적 진단에서 77.5%의 정확도를 달성한 점으로 선택되었습니다20. 동시에 SVM은 견고성 때문에 선택되었으며최근에는 COVID-19 환자의 사망 위험 예측에 사용되고 있습니다22. 더불어, XGBoost는 높은 성능23으로 선정되어 고혈압 결과에 대해 94%의 정확한 예측 점수를 달성했으며, 최고 성과를 내는 알고리즘의 결과를 향상시키기 위해 스태킹 방식을 사용했습니다. 또한, 투표 집단 분류기를 사용해 갑상선 질환을 100% 정확도로 식별하는 데 사용되었습니다24.
이번 연구의 주요 목적은 독창적인 임상 데이터와 최첨단 머신러닝 알고리즘을 사용하여 사우디 인구에서 갑상선기능저하증의 조기 진단을 돕는 것입니다. 이 연구에서 사용된 네 가지 기법은 주피터 플랫폼에서 Python 프로그래밍 언어와 갑상선 기능 저하증 데이터셋을 사용하여 구현되었습니다. 성능 향상을 위해 10배 교차 검증과 하이퍼파라미터 튜닝을 사용했습니다. 순차적 특징 선택과 순방향 선택 기법이 구현되어 투표 집단 분류기가 94.7%의 최고 정확도를 달성했습니다. SVM, KNN, XGBoost가 각각 그 뒤를 이었습니다. 소환 여부와 관련해, 소프트 투팅 앙상블 분류기가 95.5%로 가장 높은 점수를 기록했습니다. 전반적으로 선제적 갑상선기능저하증 진단에 최적의 모델은 소프트 투표 앙상블 분류기였으며, 이 분류기는 이 연구에서 평가된 모든 성과 지표에서 가장 높은 점수를 받았습니다.
일반 갑상선 질환 진단과 특히 머신러닝을 컴퓨터 지원 솔루션으로 도입하는 여러 연구가 수행되었습니다. LSTM-CNN, AlexNet, 조정된 GoogLeNet, IndRNN–CNN, 그리고 조정된 ResNet 딥러닝 모델이 라만 분광법을 사용하여 32명의 갑상선기능저하증 환자, 38명의 갑상선기능항진증 환자, 29명의 대조군으로부터 혈청 샘플을 구별하기 위해 배포되었습니다. 이 모델의 정확도는 각각 84%, 91%, 75%, 82%, 71%였습니다.
SVM, KNN, 로지스틱 회귀, 랜덤 포레스트와 같은 머신러닝 알고리즘이 비인두암 환자의 방사선 유발 갑상선기능저하증 발생률을 예측하는 데 활용되었습니다26. 그들의 모델은 AUC 값 0.7을 달성했습니다. 더불어, 연구진은 다양한 머신러닝 알고리즘을 활용해 LT4 치료를 받는 갑상선기능저하증 환자의 치료 추세를 예측하였습니다. 10개의 분류기 중 트리 외 분류기가 84%의 가장 높은 정확도를 기록했습니다.
또 다른 연구에서는 저자들이 즉각적인 의료 치료가 필요한 갑상선 기능 항진증 및 갑상선기능저하증 환자를 식별하기 위한 머신러닝 전략을 만들고 테스트했습니다27. 그들은 경배 부스트 의사결정 트리(GBDT), SVM, ANN, 그리고 로지스틱 회귀 알고리즘을 배포했습니다. 이들의 모델은 각각 갑상선 기능 항진증과 갑상선기능저하증에서 93.8%와 90.9%의 AUROC를 얻었습니다. 또 다른 연구에서는 저자들이 기계 학습을 이용해 갑상선 기능 저하증과 갑상선 기능 항진증을 포함한 갑상선 질환을 감지했습니다. 이들의 모델에는 SVM, ANN, KNN, 로지스틱 회귀, 의사결정 트리가 포함되었으며, LogisticRegression 28에서 96.92%의 최고 정확도를 달성했습니다. 최근 연구진 그룹은 SVM, 결정 트리, 나이브 베이즈, 앙상블 등 다양한 방법을 적용하여 갑상선기능저하증을 예측하고 감지했습니다. 결정 트리는 97.6%로 가장 높은 정확도를 기록했습니다. 또 다른 연구에서는 하이브리드 차등 진화 커널 기반 나이브 베이즈 알고리즘을 적용하여 갑상선 항진증 및 갑상선기능저하증 질환의 갑상선 데이터셋 속성을 21에서 10으로 줄였습니다. 이후 커널 기반 나이브 베이즈 분류기를 특징 부분집합에 적용하여 97.97%의 정확도30을 달성했습니다. 마찬가지로, 또 다른 연구에서는 캘리포니아 대학교의 질병-평갑상선 기반 데이터셋에서 여러 기계 학습 알고리즘을 사용해 갑상선 질환 위험을 예측했습니다. 이 실험은 ANN이 95%의 정확도를 달성하며 다른 모든 방법을 능가함을 입증했습니다. 더 나아가 Jha 등은 딥 뉴럴 네트워크를 기반으로 한 특징 증강 기법을 사용해 갑상선 질환을 예측하였으며, 99.95%라는 뛰어난 정확도를 달성했습니다32.
이전 문헌에 따르면, 다중 속성 선택이 가능한 동질적 투표 집단이 갑상선 질환을 식별하는 데 사용되었으며, 무작위 포레스트, 구배 부스트팅, 결정 트리, 로지스틱 회귀 알고리즘을 사용하여 100% 정확도를 달성했다. 더 나아가, 저자들은 Kaggle의 갑상선 기능 저하증 오픈 액세스 데이터셋에 극한 학습 기계 모델을 적용하여 92%의 정확도를 달성했습니다. 데이터셋에는 3772개의 샘플이 포함되어 있었으며, 이 중 3481개는 갑상선기능저하증, 나머지는33개가 음성이었습니다. 최근 연구에서 저자들은 봉지화된 CART를 이용해 갑상선기능저하증을 분류했습니다. 그들이 제안한 모델은 99.9%라는 인상적인 정확도를 달성했습니다. 또한 T4U, TSH, TBG가 갑상선기능저하증과 관련된 가장 중요한 요인으로 확인되었습니다34. 또 다른 연구에서는 저자들이 각각 99.5%와 99.3%의 정확도를 달성한 의사결정 트리와 무작위 포레스트의 다양한 머신러닝 및 딥러닝 모델을 제안하고 비교했습니다. 그들은 30개의 속성과3772개의 샘플 35를 포함하는 Weka 데이터셋을 사용했습니다.
이 간단한 문헌 검토는 대부분의 방법이 매우 우수하거나 우수한 결과를 얻었음을 보여주지만, 사우디아라비아의 간단한 임상 데이터셋을 사용한 연구는 없었음을 보여줍니다. 또한 검토 대상 논문 대부분이 영상 데이터셋을 사용해 데이터 수집 작업이 증가하고 비기술자가 만든 매우 복잡한 모델을 적용하는 어려움을 높였다는 점도 지적되었습니다. 더불어, 대부분의 연구는 일반 갑상선 질환에 관한 것이었으며, 갑상선기능저하증을 강조하는 논문은 매우 적었다. 이 상황은 사우디 데이터셋의 간단한 임상 데이터셋에서 기본 머신러닝 모델을 조사할 기회를 제공하여, 제한된 컴퓨터 장비를 갖춘 지역 병원이 질병을 사전에 진단하는 데 도움을 줍니다.
본 연구에서 조사된 알고리즘에 대한 간략한 소개는 보충 파일 1에 나와 있습니다. 네 가지 알고리즘은 K-최근접 이웃(KNN)36,37,38,39,40, 지지 벡터 기계(SVM)41,42,43,44,45, 극한 경사 부스트(XGBoost)46,47,48, 투표 앙상블 49,50입니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
1. 방법론
참고: Table of Materials에서 설명한 바와 같이, 이 연구의 실험은 Jupyter Notebook에서 Python으로 수행되었으며, 이 노트북은 갑상선기능저하증의 선제적 진단을 위한 머신러닝 모델 개발에 사용되었습니다. 마이크로소프트 엑셀과 파이썬 Scikit-Learn 라이브러리가 전처리 단계에서 사용되었습니다. 이후 K-최근접 이웃(KNN), 지지 벡터 기계(SVM), 극한 구배 부스트(XGBoost), 그리고 KNN과 SVM으로 구성된 소프트 투표 앙상블 분류기를 사용하여 데이터셋을 학습시켰으며, GridSearchCV와 10배 교차 검증을 통해 최적의 하이퍼파라미터를 얻었습니다. 또한 각 분류기의 특징 중요성은 순열 중요도를 사용해 그래프로 표시되었습니다.

그림 1: 실험적 틀. 이것이 연구의 실험적 틀입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
참고: 갑상선 기능 저하증에 관한 사우디 데이터셋은 사우디아라비아 담맘에 위치한 킹 파하드 전문 병원(KFSH)에서 수집되었습니다. 이 병원은 이맘 압둘라흐만 빈 파이살 대학교(이전 명칭: 담맘 대학교)와 연계된 공공 병원입니다. 담맘은 동부 지방에 위치해 있으며, 대부분의 환자들이 같은 지역에 속해 있습니다. 기관심의위원회(IRB)의 승인을 받아, 이 데이터셋은 병원에서 표준 분류 절차와 임상시험 중에 수집되었으며, 2020년부터 2021년까지 병원 관리 시스템에 환자 건강 기록(PHR)으로 기록되었습니다. 데이터셋에는 11세에서 92세 사이의 152명(여성 100명, 남성 52명)의 표준 임상 검사가 포함되어 있으며, 이 중 89명이 갑상선기능저하증으로 양성 진단을 받았습니다. 반면, 나머지 63명은 갑상선기능저하증 없이 알츠하이머병과 같은 다른 질환을 앓고 있는 진단을 받았습니다. 데이터셋에는 483개의 속성이 있었으며, 30%를 초과하는 누락 속성을 제거하여 전처리 과정에서 18개로 줄였습니다. 표 1은 이 연구에서 사용된 특징들을 개괄합니다.
| 특징 | 설명 |
| 연식 | 나이 단위. |
| 성 | 남성이든 여성이든. |
| 백혈구(WBC) | 백혈구 수치. |
| 온도 | 체온은 섭씨(°C) 단위입니다. |
| 적혈구(적혈구) | 적혈구 수치. |
| 혈소판 | 혈소판 수치. |
| MPV | 평균 혈소판 부피 |
| 맥박 황소 | 혈액 내 산소(산소 포화도) 측정입니다. |
| MCH | 미친 혈구 헤모글로빈. |
| RDW | 적색 세포 분포 폭. |
| MCV | 평균 소분 부피. |
| MCHC | 평균 소량 혈색소 농도 |
| 펄스 | 심박수. |
| 헤마토크릿 | 적혈구의 부피. |
| 혈압 – 수축기 | 가장 높은 혈압. |
| 헤모글로빈 | 혈액 내 헤모글로빈 수치. |
| 혈압 – 이완기 혈압 | 가장 낮은 압력. |
| 호흡 속도 | 분당 호흡 수. |
표 1: 데이터셋 설명. 이 표는 설명 데이터셋을 보여줍니다.
2. 통계 분석
참고: 데이터셋의 통계적 분석은 데이터셋의 패턴을 시각화하고 이해하는 데 도움을 주어 더 나은 데이터 전처리 및 모델링을 돕습니다. 표 2는 갑상선기능저하증 질환 데이터셋의 통계적 분석을 보여주며, HT 그룹과 비HT 그룹의 결과를 비교합니다.
| 가변 | 갑상선기능저하증 (n = 89) | 비갑상선 기능 저하증 (n = 63) | t / U 값 | P 값 |
| 연식 | 43.00 (33.00, 54.00) | 76.00 (70.00, 80.50) | 5.388 | < 0.001 |
| 호흡 속도 | 20.00 (20.00, 20.00) | 20.00 (20.00, 21.50) | 2.561 | 0.004 |
| 혈압 – 수축기 | 117.72 ± 16.46 | 127.85 ± 17.77 | 3.302 | 0.001 |
| 혈압 – 이완기 혈압 | 73.00 (68.00, 79.00) | 72.95 (65.00, 80.25) | 2.076 | 0.892 |
| 펄스 | 79.09 ± 12.19 | 82.35 ± 12.72 | 1.47 | 0.145 |
| 온도 | 36.60 (36.50, 36.80) | 36.70 (36.60, 36.90) | 2.576 | 0.029 |
| 맥박 황소 | 99.00 (99.00, 100.00) | 99.00 (98.00, 99.00) | 1.088 | 0.005 |
| 헤마토크릿 | 38.20 (35.88, 40.23) | 37.30 (31.30, 41.30) | 1.471 | 0.318 |
| 적혈구 | 4.52 (4.26, 4.81) | 4.37 (3.81, 4.89) | 1.36 | 0.104 |
| 헤모글로빈 | 12.70 (11.70, 13.53) | 12.30 (10.00, 13.85) | 1.481 | 0.345 |
| RDW | 13.80 (13.38, 14.93) | 14.90 (13.80, 16.45) | 2.212 | 0.002 |
| MCV | 83.54 ± 6.85 | 85.05 ± 8.53 | 1.042 | 0.3 |
| 혈소판 | 261.23 ± 63.97 | 223.62 ± 68.88 | −2.945 | 0.004 |
| MCHC | 33.60 (32.80, 34.02) | 33.20 (32.30, 34.00) | 1.314 | 0.06 |
| MCH | 28.00 (26.55, 29.57) | 28.10 (26.55, 30.20) | 1.78 | 0.468 |
| MPV | 8.81 ± 0.87 | 8.79 ± 1.38 | −0.074 | 0.941 |
| 백혈구 | 6.10 (4.80, 7.43) | 7.20 (5.70, 8.90) | 2.075 | 0.017 |
표 2: 특징의 통계적 분석. 이 표는 HT 그룹과 비HT 그룹 모두의 특징에 대한 통계적 분석을 보여줍니다. 약어; HT = 갑상선기능저하증.
참고: 표 2에서 HT 그룹과 비HT 그룹은 연령, 호흡수, 혈압 수축기, 체온, 산소포화도, RDW, 혈소판, 백혈구 수에서 유의미하게 차이가 있습니다. 따라서 생리학적 특징을 통해 두 그룹을 구분할 수 있습니다.
3. 데이터 전처리
4. 모델 구축 및 평가
참고: 교차 검증을 위한 데이터 분할: 여러 접힘에 대한 여러 실험 끝에 10배 교차 검증이 최적임이 밝혀졌고 이후 적용되었습니다.
(1)
(2)
(3)
(4)
(5)| 알고리즘 | 하이퍼 파라미터 이름 | 하이퍼 파라미터 범위 | 최고의 가치 | 최적 값 사용법의 정확도 |
| K-NN | 미터법 | '민코프스키', '맨해튼', '유클리드' | 민코프스키 | 84.21% |
| N_neighbors | 3, 5, 7, 9, 11, 13 | 5 | ||
| SVM | 커널 | '선형', '폴리', 'RBF', '시그모이드' | 선형 | 92.76% |
| 비용 (C) | 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 100 | 9 | ||
| 감마 | 1, 0.1, 0.01, 0.001, 0.0001 | 1 | ||
| XGBoost | N_estimators | 5,01,00,15,02,00,250 | 200 | 89.47% |
표 3: 최적 하이퍼파라미터. 이는 각 모델의 최적 하이퍼파라미터를 보여줍니다.
그림 2–4는 KNN, SVM, XGBoost 기법의 하이퍼파라미터 탐색을 위한 그리드 탐색 접근법과 모든 기능을 활용한 구현 방식을 보여줍니다.

그림 2: KNN 성과. 이는 다양한 지표와 이웃 수를 다룬 KNN의 성능입니다. 약어; KNN = K의 가장 가까운 이웃. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 3: SVM 성능. 이것은 커널 및 비용 함수 값과 함께한 SVM의 성능입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

그림 4: XGBoost 성능. 이것은 부스터와 N_estimator 값이 다른 XGBoost 성능입니다. 약어; XGBoost = 극단적인 경사 부스트. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
| 알고리즘 | 분류기 | 하이퍼 파라미터 | 정확성 | |
| 소프트 투표 분류기 | K-NN | 미터법 | 민코프스키 | |
| N_neighbors | 5 | |||
| SVM1 | 커널 | 선형 | ||
| 비용 (C) | 9 | 88.81% | ||
| 감마 | 1 | |||
| SVM2 | 커널 | RBF | ||
| 비용 (C) | 9 | |||
| 감마 | 1 | |||
표 4: 투표 분류기 하이퍼파라미터. 이는 투표 분류기 조합과 하이퍼파라미터를 보여줍니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
모델 성능
이 연구에서 생성된 네 가지 모델의 성능은 정확성, 회상률, 테스트 측면에서 비교 및 분석되었습니다. GridsearchCV 알고리즘을 사용하여 모든 특징을 활용한 각 모델의 최적 하이퍼파라미터를 식별하였습니다. 각 모델의 성능은 층별로 10배 교차 검증을 통해 평가되었습니다. 표 5는 각 모델의 성능 결과를 보여줍니다.
| 분류기 | 정확성 | 리콜 | 정밀도 | F1-점수 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구에서는 사우디 임상 데이터셋에 대한 머신러닝 알고리즘을 연구하여 갑상선기능저하증에 대한 선제적 진단 모델을 개발합니다. 네 가지 모델이 만들어졌습니다: KNN, SVM, XGBoost, 그리고 소프트 투팅 앙상블 분류기. 네 가지 모델 모두 연령과 호흡 박수가 질병의 선제적 진단에서 중요한 지표임을 확인했습니다. 네 가지 모델 중에서 투표 분류기는 이 연구에서 사용된 모든 지표에서 우수한 성능을 보였습니다. 단 다섯 가지 특징만을 활용하여 정확도는 94.73%, 회상율, 정확도, F1 점수 값은 각각 95.50%를 달성했습니다. 그 뒤를 이어 SVM이 있었는데, SVM은 6가지 특징에서 정확도가 0.66% 낮았습니다. SVM과 KNN 모두 94.38%의 동일한 리콜 점수를 기록했으며, 이는 투표 분류기보다 1.12% 낮은 수치입니다. KNN은 갑상선기능저하증의 선제진단에서 93.42%의 정확도로 3위를 차지했습니다. XGBoost는 정확도와 정밀도 면에서 가장 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 데이터셋은 병원에서 IRB-2020-09-429 하에 입수한 것입니다. 저자들은 본 연구와 관련하여 이해 상충을 보고할 수 없습니다.
저자들은 연구 결과의 검증을 위해 의료 전문가들의 지지에 감사드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 노트북/기계 | 델 | XPS9320 | RAM 16GB, 12세대 인텔(R) 코어(TM) i7-1260P |
| 엑셀 365 | 마이크로소프트 | 엑셀 365 | 원본 데이터를 csv 형식으로 저장하는 데 사용됨 |
| 파이썬 3.12.12 | 구글 콜랩 노트북 | 파이썬 3.12.12 | 모델 제작 교육에 사용됨; |
| Numpy 2.0.2 | 구글 콜랩 노트북 | Numpy 2.0.2 | 모델 제작 교육에 사용됨; |
| 판다스 2.2.2 | 구글 콜랩 노트북 | 판다스 2.2.2 | 모델 제작 교육에 사용됨; |
| Sklearn 1.6.1 | 구글 콜랩 노트북 | Sklearn 1.6.1 | 모델 제작 교육에 사용됨; |
| Mlxtend 0.23.4 | 구글 콜랩 노트북 | Mlxtend 0.23.4 | 모델 제작 교육에 사용됨; |
| XGbbost 3.1.2 | 구글 콜랩 노트북 | XGbbost 3.1.2 | 모델 제작 교육에 사용됨; |
| SPSS | IBM, 미국 | Sklearn 1.6.1 | 정치분석에 사용됨 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.