연구 논문

계산 지능 기반 천식 질환 조기 진단: 사우디아라비아 사례 연구

DOI:

10.3791/70040

2026년 6월 16일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이번 연구는 사우디아라비아 데이터셋에서 천식 감지를 위한 여러 머신러닝 알고리즘을 조사합니다. 임상 데이터셋을 이용한 최첨단 천식 진단 방식과 달리, 제안된 방식은 진단 정확도가 3.9% 향상되는 등 더 나은 성능을 보입니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

연구에 따르면 천식을 포함한 만성 질환의 증가가 확인되었습니다. 사우디아라비아의 천식 환자 수는 특히 팬데믹 이후 시대의 기상 조건과 생활 방식 때문에 우려를 낳고 있습니다. 천식을 조기에 감지할 수 있는 지능형 시스템을 개발하여 감염을 줄이고, 이를 통해 질병을 예방하거나 조기 치료를 가능하게 하는 해결책이 필요합니다. 이 연구에서는 머신러닝을 활용해 천식 증상을 조기에 추적할 수 있는 도구를 개발했습니다. 기계학습을 통해 천식 발생을 예측하려는 시도는 여러 차례 있었습니다. 그럼에도 불구하고, 특히 사우디아라비아 맥락에서 증상 전 단계에서 질병을 식별하는 데 집중하는 것은 상대적으로 소홀히 다뤄진 분야입니다. 이번 연구의 데이터셋은 사우디아라비아 담맘에 위치한 킹 파하드 대학교 병원에서 수집되었으며, 혈액 검사, 바이러스 검사, 생화학 검사 등 환자에게 시행된 표준 검사를 포함했습니다. 데이터셋에는 17개의 유의미한 속성이 포함되어 있으며, 328명의 천식 환자에 대한 정보도 포함되어 있습니다. 이 중 165명은 양성, 163명은 음성입니다. 여기서 적용할 방법들은 무작위 숲(RF), 인공 신경망(ANN), 지지 벡터 기계(SVM), 그리고 순진한 베이즈(NB)입니다. 각 방법은 고유한 특징을 바탕으로 선택되었습니다. 실험 결과는 RF, SVM, ANN 접근법이 94%의 정확도를 기록하며 최첨단 기술을 3.9% 향상시킨 것으로 나타났습니다. 17가지 가능한 특징 중 9가지가 위의 정확성을 달성하기 위해 사용되었다는 점도 주목할 만합니다. RF, SVM, ANN이 동일한 정확도를 달성함에도 불구하고, ANN은 오차 비용이 더 높습니다. 따라서 결과 패턴에 따라 RF와 SVM이 우수하며, 이 문제에 권장됩니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

광범위한 연구 끝에 연구진은 만성 질환이 점점 더 흔해지고 있음을 관찰했습니다1. 천식은 반복적인 호흡 곤쁨과 쌕쌕거림 에피소드가 특징인 만성 기도 염증성 질환입니다. 천식의 유병률은 전 세계적으로 다르며, 어린이와 성인 모두에서 1%에서 20%까지 다양하며, 전 세계 수백만 명에게 영향을 미칩니다.2. 이러한 대규모 변화는 다양한 국가별 환경 변이, 다양한 평가 도구의 사용, 그리고 천식에 대한 다양한 역학적 정의와 관련이 있습니다. 천식은 다른 잘 알려진 만성 질환들에 비해 치명률이 상대적으로 낮습니다. 하지만 보고에 따르면 사우디아라비아 왕국의 천식 패턴은 3,4 증가하고 있습니다.

천식은 만성 염증 질환으로, 내강이 좁아지는 현상입니다. 항공 경로의 좁아짐은 체액 분비의 확장과 부종, 상피하 섬유증, 평활근 비대로 인한 기관지 분열 두꺼움에 의해 발생합니다. 면역 세포를 포함한 다양한 세포 유형에 의해 구동되는 병태생리 장치가 이러한 상태를 평가하는 데 사용되어 왔습니다. 사우디아라비아의 심각한 기상 조건과 주로 실내 생활 방식 때문에 천식은 가장 널리 퍼진 만성 질환 중 하나입니다. 여러 조사에서 천식6의 압도적인 비율이 입증되었습니다. 이 질병은 심각한 문제로 자리 잡았으며, 발생 건수를 줄이고 조기 중재를 통해 조기 중재가 가능해질 수 있도록 조기 대응 시스템이 필요합니다.

개인과 달리 천식은 지역사회와 가족에 깊은 영향을 미칩니다. 통제되지 않으면 환자의 삶에 가혹한 제약을 가하고 일상 활동에 참여하는 것을 막습니다. 사우디아라비아에서는 뜨거운 대기, 광범위한 모래폭풍, 실내 에어컨/냉방 시스템의 과도한 사용 등 혹독한 기상 조건이 천식의 주요 원인입니다. 사우디 흉부학회(STS)는 호흡기 감염에 대한 최고의 약물을 제공하기 위해 눈에 띄는 노력을 기울여왔습니다. 하지만 감염률을 줄이기 위해서는 특히 팬데믹 이후(COVID-19) 상황에서 적대적인 천식 진단이 필요합니다. 또한 가족력, 흡연, 알레르기성 비염이 사우디 성인 천식 발병의 가장 중요한 위험 요인 중 하나임이 추론되었습니다. 연구의 기초를 마련한 다른 요인들을 조사하기 위한 추가 연구가 권장되었습니다.

이 연구에서는 천식 진단에 관한 이전 연구들을 고려하여 진단 정확도를 높이는 것을 목표로 합니다. 제안된 기법들, 즉 랜덤 포레스트(RF), 인공 신경망(ANN), 서포트 벡터 머신(SVM), 그리고 순진한 베이즈(NB) 기법은 이전 연구에서 사용되어 진단 결과에 눈에 띄는 개선을 가져왔습니다. 예를 들어, 연구자들은8, 9, 10 연구에서 ANN, SVM, NB를 사용했습니다. 이번 연구에서는 천식 질환의 작은 징후조차도 증상 전 단계(증상 전단계)에서 감지하는 조기 경보 시스템으로서 머신러닝 접근법이 연구되었습니다. 특히 팬데믹 이후 사우디아라비아에서 천식 질환의 유병률이 높으며, 심각한 기상 조건으로 인한 실내 생활 방식, 에어컨 덕트, 모래폭풍 등이 주요 요인 중 하나입니다. 하지만 최근 목격된 중요한 요인들을 조사한 주목할 만한 연구는 없습니다. 이 연구 격차를 해소하기 위해 본 연구는 사우디 성인 천식 조기 발견에 있어 머신러닝의 역할을 조사하는 것을 목표로 합니다. 더 나아가, 가장 적은 기능으로 가능한 최고의 정확도를 달성하는 것이 주요 목표입니다. 과거에 천식 질환의 존재를 예측하기 위해 머신러닝을 활용하려는 알려진 노력이 있었음에도 불구하고 8,9,10. 이번 연구는 동부 지방의 공공 병원에서 처음으로 사우디아라비아 데이터셋을 활용하여, 질병을 조기 진단(선제적 진단)하는 데 중점을 둡니다. 머신러닝(ML)은 수집된 데이터로부터 지식을 추출하는 방법으로 인정받고있습니다 11,12. 다양한 머신러닝 기법을 사용하여 이전 인스턴스의 학습 과정에서 얻은 예측 정확도를 제공합니다. ML은 질병 존재의 조기 발견과 같은 광범위한 의학 분야에서 분석 및 예측 문제를 해결하기 위한 다양한 방법, 알고리즘, 전략을 포함합니다13,14.

여러 연구가 다양한 기법을 사용하여 천식 질환을 예측하기 위해 수행되었습니다. 연구진은동적 및 정적 환자 검사에 따라 천식 분류를 위한 인공 신경망(ANN)을 개발했습니다. 폐활량, 임펄스 진동계(IOS), 청진, 알레르기 결과, 증상 정보 등 측정된 매개변수가 ANN에 활용됩니다. 정의된 정보는 ANN이 적절한 천식 분류를 제안할 수 있게 합니다. 마찬가지로, 연구자들은 흉부 질환 진단의 어려움을 해결하기 위한 연구를 수행했습니다7. 지지 벡터 기계(SVM)와 적응형 SVM(ASVM) 방법이 천식과 같은 흉부 질환 진단에 사용되었습니다. 모든 흉부 질환에 대해 ASVM 방법을 사용하여 최고의 분류 정확도를 얻었습니다. 연구진은 천식 질환을 포함한 흉부 질환 진단에 다중 층 NN(MLNN)과 역전파 알고리즘(BPA), 확률적 NN(PNN), 학습 벡터 양자화(LVQ), 일반 회귀 NN(GRNN) 등 여러 신경망 구조를 사용하여 천식 질환 진단을 수행했습니다. 또한, 일부 연구소는 인공 면역 체계(AIS)를 이용한 흉부 질환 진단을 위한 비교 연구를 수행했습니다. 앞서 언급한 연구들은 다양한 데이터셋을 활용해 흉부 질환 진단을 위한 다양한 구조를 구현했습니다. 천식에서는 AIS를 사용해 전체 정확도 90.91%로 가장 높은 결과를 얻었습니다16. 더불어, 연구자들은 천식 진단 정확도 향상에 대한 딥 NN(DNN)의 효능을 조사하고, 특히 로지스틱 회귀와 SVM과 비교한 다양한 머신러닝 알고리즘의 예측 성능을 비교했습니다. 연구는 천식 징후 모델을 이용한 경험적 검사가 천식9의 정확한 진단에 더 효과적임을 보여주었습니다. 또 다른 연구에서는 원격 모니터링 데이터를 활용한 머신러닝이 천식 악화를 예측할 수 있는 중요한 능력을 SVM과 Naïve Bayes와 같은 선택된 머신러닝 접근법을 통해 실험10을 구현했습니다.

그 외에도 연구자들은 SVM, k-NN, 적응형 부스팅(AdaBoost), 극한 그라디언트 부스팅(XGBoost) 등 여러 기계 학습 기법을 활용하여 알츠하이머병(AD)을 사전에 진단했습니다17. 연구진은 당뇨병 진단을 예비 진단하기 위해 NB, SVM, K-NN, ANN 네 가지 기계 학습 접근법을 조사하는 연구도 수행했습니다. 사우디아라비아 데이터셋의 상위 세 가지 특징이 평균 정확도 68%로 가장 높았습니다. 측정 기법의 성능은 정확성, 정밀도, 회상력, F1 점수를 기반으로 비교되었습니다. ANN은 77.5%로 가장 높은 분류 정확도를 기록했다. 마찬가지로, 같은 연구진은 사우디아라비아 데이터셋에 적용된 만성 신장 질환을 선제적으로 진단하기 위해 NB, SVM, K-NN, ANN 네 가지 분류 기법을 실험했다. 더불어, 저자들은 ANN, SVM, RF, NB의 네 가지 기계 학습 기법을 사용하여 갑상선암을 원시적으로 진단하는 연구를 수행했습니다. 사우디아라비아 데이터셋의 14가지 특징을 활용하여 저자들은 평균 정확도 95%를 기록했습니다. 측정 기법의 성능은 정확성, 정밀도, 회상력, F1 점수를 사용하여 비교되었습니다. RF는 90.91%로 가장 높은 분류 정확도를 기록했다. 연구진은 또한 류마티스 관절염의 적극적 진단에 있어 놀라운 결과를 낸 두 건의 연구를 수행했습니다. SVM, 로지스틱 회귀(LR), AdaBoost와 같은 여러 머신러닝 기법이 선정되어 투표 앙상블의 후보 기법으로 사용되었습니다. 초기에는 한 데이터 세트를 사용하고, 다른 데이터 세트는 SMOTE를 적용하여 균형을 맞췄습니다. 새로운 투표 집단 기법은 두 가지 순차적 특징 선택 방법으로 테스트되었습니다. 즉, 각 기법에 대해 가장 높은 지표를 제시하는 특징 공간의 최적 부분집합을 찾기 위해 전방 및 후방 선택을 사용합니다. 원본 데이터의 30가지 특징과 순차적 순방향 특성 선택 기법을 사용하여, 얻은 비율은 유망했으며, 정확도, 회상율, 정밀도는 각각 94.03%, 96%, 93.51%였습니다. 마찬가지로, 의학 및 관련 분야의 다른 지능적 방법들도 많은 연구에서 찾아볼 수 있습니다 22,23,24,25,26.

이 연구에서 제안된 기법들은 유사한 문제에 대한 뛰어난 결과를 바탕으로 RF, SVM, ANN, NB입니다. 이번 연구에서는 실험을 통해 얻은 결과가 다음과 같습니다. 여러 최적화 단계와 특징 선택 후, 제안된 기법들이 대상 데이터셋을 통한 천식 진단에 유망함을 입증하였습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 섹션에서는 제안된 천식 진단 접근법에서 조사된 머신러닝 알고리즘을 설명합니다. 제안된 방법의 기준과 선택의 이유는 포괄적인 문헌 검토와 여러 만성 질환의 선제적 진단 역사에 기반합니다27, 28, 29, 30, 31. 이 알고리즘들은 유망한 결과를 낳았습니다. 이 연구에 사용된 모든 재료와 도구는 재료표에 나열되어 있습니다.

지지 벡터 기계(SVM)
SVM 알고리즘은 패턴 인식 및 분류 분야에서 가장 성공적인 알고리즘 중 하나입니다. 이 방법은 이진 분류를 사용하여 벡터 훈련 집합을 두 클래스로 분류합니다. 이 알고리즘은 감독32 하에서 원하는 출력이 생성되는 감독 학습 알고리즘 계열에 속합니다. 머신러닝의 다른 분류 알고리즘과 비교할 때, SVM은 분류 성능에서 더 나은 결과를 제공합니다. 따라서 음성 인식, 얼굴 인식, 필기 인식 등 다양한 응용 분야에서 광범위하게 사용되어 왔습니다. 더 나아가, SVM은 질병 예측과 자원 예측 등 다양한 분야에 적용되어 왔습니다. 또한, 노이즈나 과적합에 대한 둔감성 때문에 SVM은 불균형 데이터를 처리할 수 있는데, 이는 의료 진단에서 양성 사례가 음수 사례보다 적은 경우가 많습니다.

분류에서 SVM은 결정 경계를 그리며 두 클래스를 구분하며, 하나 이상의 특징 벡터32를 구별하여 라벨을 예측할 수 있습니다. 결정 경계는 초평면(hyperplane)이라 불리며, 각 클래스의 가장 가까운 데이터 점에서 가장 먼 곳입니다. 이 데이터 포인트들을 지지 벡터라고 부릅니다. 그림 1 은 선형 분리 데이터에서 몇 가지 후보 초평면을 보여줍니다. 방정식 1은 초평면 방정식을 보여주고, 방정식 2와 3은평면 32 위아래에 위치한 원소들을 보여준다:

figure-protocol-1초평면 방정식 (1)

여기서 w 는 가중을 나타내는 벡터, x 는 입력을 나타내는 벡터, b. 는 잠재적 편향을 나타냅니다.

figure-protocol-2모든 j에 대해, = figure-protocol-3 +1 (2)

figure-protocol-4모든 i에 대해, figure-protocol-5 = -1 (3)

figure-protocol-6
그림 1: 두 개의 분리 가능한 클래스를 가진 전형적인 SVM. 이 그림은 두 개의 분리 가능한 클래스를 가진 전형적인 SVM을 시각화합니다. 약어; SVM = 지지 벡터 기계. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

인공 신경망(ANN)
ANN은 인간 뇌 시스템의 기능을 모방하는 소프트 컴퓨팅 분야의 계산 지능 기법입니다. 상호작용하는 뉴런 수는33개입니다. 예제 데이터셋에서 학습하고 학습을 통해 성능을 향상시키며 유용한 출력을 생성할 수 있는 감독 기반 머신러닝 알고리즘 중하나입니다. ANN의 아키텍처는 입력 계층, 숨겨진 계층, 출력 계층 등 여러 계층으로 구성되어 있습니다. 각뉴런은 연결된 뉴런들로 구성되어 있습니다.

외부로부터 데이터를 받는 뉴런은 일부 처리를 수행한 후 데이터를 입력 계층이라 불리는 또 다른 층으로 전송합니다. 입력 계층의 목적은 데이터에 대해 복잡한 과정을 수행하는 것이 아닙니다; 입력 값을 복제해서 다음레이어 33으로 보내는 것뿐입니다. 출력 계층에는 사용자 프로그램을 위한 데이터를 생성하는 뉴런이 포함되어 있습니다. 이 두 계층 사이에는 숨겨진 계층이 계산 과정을 수행하는 선택적 계층으로 위치합니다. 숨겨진 층은 입력 뉴런으로부터 입력을 받아 수학적 연산을 수행한 후 결과를 다른33층으로 전달하는 중간 계층 역할을 합니다. 그림 2 는 ANN 아키텍처를 보여줍니다.

figure-protocol-7
그림 2: 일반적인 ANN 구조에서의 피드포워드 및 역전파. 이 그림은 전형적인 ANN 구조에서 역전파가 포함된 피드 포워드 네트워크를 시각화합니다. 약어; ANN = 인공 신경망. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

피드포워드 NN은 입력 데이터를 전방 방향으로 저장하는 접근법입니다. 반대로, 여러 개의 숨겨진 계층을 가진 신경망을 이용해 신경망 가중치가 역방향으로 업데이트되어 구배를 얻는 과정에서 역전파 과정이 발생합니다. 이 과정의 단점은 경사가 사라지거나 폭발한다는 점입니다. 활성화 함수는 ANN의 비선형 특성을 유지하여, 입력과 출력 데이터 간의 상세한 관계를 학습할 수 있게 하며, 이는 보편적 근사라고 선언됩니다. 그림 3 은 인공 신경망의 주요 구조를 보여줍니다. 또한 모든 입력 가중치의 합을 나타내는 각 뉴런의 출력에 적용되는 활성화 함수를 보여줍니다. 이 편향은 모든 가중치의 합을 가지며, 뉴런 입력33에 포함된다.

figure-protocol-8
그림 3: ANN의 전형적인 단일 지각론 뉴런. 이 그림은 전형적인 ANN의 단일 지각론 뉴런을 나타냅니다. 약어; ANN = 인공 신경망. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

랜덤 포레스트 (RF)
RF는 머신러닝에서 대표적인 분류 알고리즘 중 하나입니다. 여러 개의 개별 의사결정 트리가 함께 작업하여 최종 결과물인 29로 구성됩니다. RF의 성공적인 수행 기본 개념은 여러 개의 상관관계가 적절하지 않은 나무들(숲을 형성)로 구성되어 위원회 역할을 한다는 점입니다. 따라서 독립적으로 작동하는 모든 모델보다 효율적일것입니다. RF 알고리즘은주로 연구자 그룹에 의해 개발되었습니다. RF가 어떻게 작동하는지 더 잘 이해하려면 의사결정 트리35를 이해하는 것이 필수적입니다. 이 방법은 이산 문제와 연속 문제 모두에 동일하게 적용할 수 있으며, 특히 분류, 검출, 회귀 문제입니다. 숲에 나무가 많을수록 결과는 정확도에 더 가까워지지만, 계산 복잡도는36이 추가됩니다. 이는 그림 4에 나타난 것입니다.

figure-protocol-9
그림 4: 랜덤 포레스트 도면. 이 그림은 전형적인 무작위 숲의 도식도를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

순진한 베이즈 (NB)
나이브 베이즈(NB)는 베이즈 정리를 이용해 객체를 분류하는 분류 알고리즘입니다. 이 방법은 대부분의 의료 분야에서 특히 증상 진단에 매우 널리 사용되는 방법입니다. 이 방법에서는 객체들이 주요 독립성 가정을 취하여 속성 간 관계가 서로 독립적으로 됩니다. 순진한 특성 때문에 기계 학습37에서 가장 단순한 분류 알고리즘 중 하나입니다. 주어진 데이터셋을 기반으로 NB는 특정 출력의 가능성을 결정합니다. NB 모델은 개발이 간단하고, 방대한 데이터를 관리할 수 있으며, 정교하고 계산 효율이 낮은 알고리즘입니다. 또한 소규모 기능을 제공하여 수치적 및 명목적 지식을 제공합니다. 견고성과 간단한 학습 해석도 NB 분류기의 잠재적 장점입니다. 제한된 데이터량에 적용하면 상대적으로 부정확한 결과를 초래할 수 있습니다. 이는 다른 기법에 비해 덜 정밀한 것으로 간주되는 거대한 기록에 의존합니다37.

통계 분석
데이터셋의 통계적 분석은 데이터셋의 패턴을 시각화하고 이해하는 데 도움을 주어 더 나은 데이터 전처리 및 모델링을 돕습니다. 이와 관련하여 다음과 같은 조치들이 수행되었다. 첫째, 연령과 성별을 포함한 긍정적 및 부정적 집단 간의 인구학적 특성이 불균형한지 조사하기 위해 SPSS 소프트웨어에서 통계 분석을 수행합니다. 둘째, 정규분포와 분산 균질성이 충족되면 독립 표본 t-검정을 사용해 정량적 데이터를 수집하거나, Man-Whitney U 검정을 사용한다. 마지막으로, 범주별 데이터는 카이제곱 검정 또는 피셔 정확 검정38을 사용해 집계되었다.

구현
데이터셋 설명
이번 연구의 데이터셋은 기관심사위원회(IRB)의 승인을 받아 사우디아라비아 담맘에 위치한 킹 파하드 대학교 병원에서 수집되었습니다. 해당 데이터는 환자들을 대상으로 한 표준 검사에 따라 수집되었습니다. 천식은 혈액 검사, 바이러스 검사, 생화학 검사 등 환자 간 표준 검사를 통해 진단되는 경우가 많습니다. 본 연구에서는 환자와 건강한 대조군(HC)을 모집하여 병원 내 의사들의 권고에 따라 병원에서 실시된 표준 분류 및 병리학적 검사를 바탕으로 임상 평가를 받았습니다. 임상 포함 및 제외 기준은 의사들이 실험실 결과를 바탕으로 정했습니다. 이후 자격을 갖춘 검증된 데이터가 연구를 위해 제공되었습니다. 이 데이터셋에는 모든 천식 환자에게 제공되는 17개의 속성이 포함되어 있습니다. 데이터셋에는 총 328개의 사례가 포함되어 있으며, 이 중 165건은 천식 양성 사례, 163건은 천식 음성 사례입니다. 양성 및 부정적 그룹의 성별과 연령 분포는 표 1에 나와 있습니다.

사례긍정적이야부정
남성14510738
여성18357126
328164164

표 1: 데이터셋 성별 분포. 이 표는 데이터셋 내 성별 분포를 보여줍니다.

표 2는 두 계급 간의 연령 분포를 보여줍니다.

연령대연령 분포 (클래스 = 1명)연령 분포 (클래스 = 0)
1–100.0591130
11–200.1133010.060869
21–300.0837430.177947
31–400.1576320.164912
41–500.177340.164912
51–600.1970440.099566
61–700.1083740.047619
71–800.0788170.025974
81–900.0197040.012987
91–1000.0049260.012987

표 2: 데이터셋 연령 분포. 이 표는 데이터셋 내 연령 분포를 보여줍니다.

나이(맨-휘트니 U 테스트에서 p < 0.001)와 성별(카이제곱 테스트에서 p < 0.001)은 양성군과 부정군 간에 불균형을 보였다. 하지만 채용 과정에는 편견이 없습니다. 불균형 분포는 이 환자 집단의 고유한 연령 분포를 반영할 수 있다고 여겨집니다. 포함 기준에는 질병의 존재 및 부재에 대한 임상적 요인; 성별, 연령, 지역 인구 등 인구 통계가 고려됩니다. 더불어, 데이터는 사전 동의 하에 수집되었습니다. 아래에 언급된 것처럼 연령과 성별이 기능 세트에 포함될 수 있습니다. 그러나 명시적인 연령 및 성별 기반 분석은 연구 범위에 포함되지 않으며 향후 연구로 남겨둡니다.

데이터셋은 숫자 값으로 저장됩니다. "클래스" 열에는 0과 1의 값이 포함되어 있으며, 0은 "정상 환자"를, 1은 "천식 환자"를 나타냅니다.
이와 관련하여 다음 17가지 속성이 사용되었습니다:
분류: (0 = "정상", 1 = "천식 환자")

1. 연수 기준 나이 (AGE)

2. 성별 (1 = 남성, 0 = 여성): 성별

3. 호염기구(BASO)

4. 호산구 (EOS)

5. 헤마토크릿(HCT)

6. 헤모글로빈 (HGB)

7. 림프구(LYM)

8. 평균 고구 헤모글로빈(MCH)

9. 평균 고격 헤모글로빈 농도(MCHC)

10. 평균 소분 부피(MCV)

11. 단핵구 (MONO)

12. 평균 혈소판 부피(MPV)

13. 호중구 기능(NEUT)

14. 혈소판 수치(PLATELET_COUNT)

15. 적혈구 수치(적혈구 수)

16. 적혈구 분포 폭(RDW)

17. 백혈구 (WBC)

데이터셋의 통계적 특징
더 나은 이해를 위해, 데이터셋에 대한 통계적 분석은 다음 표38에 나와 있습니다. 표 3은 고려 대상 데이터셋의 평균값, 중앙값, 표준편차, 최대값, 최소값을 보여줍니다.

심술궂은중앙값표준편차맥스
연대39.13618.136932
성별0.44200.497410
바소0.070.070.07010.720
EOS0.2310.2290.204820
HCT40.8840.76.031356.53.4
HGB13.6713.454.344681.35.9
림프2.5952.332.184333.40.4
MCH26.78273.317734.52.6
MCHC32.71332.101743.115
MCV81.1582.89.442610213
모노1.1890.6136.1198950.2
MPV9.2179.2171.729713.40
뉴트4.234.232.3074160.6
PLATELET_COUNT279.7272.585.4736850
RBC5.677511.6152152.1
RDW14.7213.415.7692960
WBC6.7776.5053.583633.41.1
클래스0.50.50.500810

표 3: 데이터셋의 통계적 특징. 이 표는 데이터의 통계적 특징을 나열합니다.

또한 표 4는 각 속성과 클래스 속성 간의 상관계수를 보여줍니다. 그 값은 0(가장 적은 상관)과 1(가장 상관이 가장 큰 값) 사이입니다. 데이터셋 속성을 설명하기 위한 예비 통계 분석으로 추가됩니다. MPV, 성별, 성별, 경화력, MCHC, 나이가 가장 중요한 특징들 중 하나입니다.

속성 쌍상관계수
연대0.212473
성별0.423584
바소-0.33242
EOS0.048184
HCT-0.376843
HGB0.275277
림프0.055856
MCH0.128111
MCHC0.272635
MCV0.013022
모노0.055476
MPV0.564992
뉴트0.031185
PLATELET_COUNT0.095253
RBC0.030787
RDW0.025979
WBC0.148842
클래스1

표 4: 클래스 속성과의 상관관계. 이 표는 속성(특징)과 클래스 속성 간의 상관관계를 보여줍니다.

실험 장치
본 연구에서는 수집된 데이터셋을 전처리하는 데 Python 프로그래밍 언어를 사용합니다. 인적 오류로 인해 데이터 입력 및 선택 시 특정 값이 누락됩니다. 데이터셋의 누락값을 처리하기 위해 보정 기법이 사용되었습니다. 이는 누락된 값을 속성의 평균으로 대체함으로써 이루어집니다. 단순함, 모델 호환성, 그리고 의료 전문가들과 논의한 표본 평균 값의 보존 때문입니다. 더불어, 특성 선택은 상관계수를 사용하여 속성을 순위 매깁니다. 상관관계 값이 높은 특징들이 전체 특징 집합과 함께 분석에 사용되었습니다. 제안된 접근법의 구현, 하이퍼파라미터 튜닝, 그리고 결과 얻기 위해 파이썬 라이브러리가 활용되었습니다. 특징 선택 및 제거는 속성 선택 방법을 통해 가장 높은 정확도를 가진 특징 그룹을 식별했습니다. 또한, 파이썬은 주어진 방정식39,40에 명시된 10배 교차 검증 및 직접 분할비 평가 방법을 사용하여 정확도를 평가하는 데 사용되었습니다. 마지막으로, 모든 평가 방법의 산출 평균을 계산하여 사용된 평가 방법을 비교하고 평균 정확도가 가장 좋은 방법을 결정했습니다38. 또한 SVM, ANN, RF, NB의 최적 매개변수를 사용하여 혼동 행렬을 생성하였습니다. 그 후, F1 점수를 계산하여 거짓 양성(FP), 거짓 음성(FN), 진양성(TP), 진음성(TN) 비율을 비교했는데, 이는 최선의 방법41,42를 비교하는 효율적인 지표입니다.

평가 지표
제안된 접근법의 성능을 평가하기 위해 네 가지 잘 알려진 성과 지표를 고려합니다. 즉, 정확성, 정확성, 회상력, 그리고 F1 점수입니다. 분류 정확도가 주요 측정 기준으로, 각 사례별로 올바르게 분류된 사례의 비율이 계산됩니다. 정밀도는 기대되는 총 TP 포인트 수입니다. 리콜은 실제 양성보다 TP 수가 더 많은 수입니다. 각 클래스의 F1 점수 성과. 출력 능력에 따라 다음 지표들이43, 44, 45를 얻습니다:

진양성(TP): 천식으로 정확히 진단된 결과입니다.

위양성(FP): 천식으로 잘못 진단된 결과입니다.

진음성(TN): 올바른 사례에서 비천식으로 진단된 결과입니다.

위음성(FN): 비천식으로 잘못 진단된 결과입니다.

figure-protocol-10(4)

figure-protocol-11(5)

figure-protocol-12(6)

최적화 전략
제안된 각 접근법에 대한 최적 매개변수를 결정하기 위해 그리드 탐색 기법이 사용되었습니다. 그리드 서치 메서드에는 특정 매개변수 가능한 값이 배치됩니다. 따라서 정밀도 향상을 위한 최상의 성능을 개발할 수 있습니다.

그림 5–7 은 네 가지 제안된 접근법 모두에 대한 그리드 탐색 기법의 결과와 상위 18개 속성을 활용한 데이터셋 구현 절차를 보여줍니다. 그림 5 는 다양한 매개변수 값으로 얻은 SVM 정확도를 보여줍니다. 여러 종류의 핵에 해당하는 비용과 감마의 입력값은 다음과 같습니다:

커널 유형: 선형, 방사형, 시그모이드, 다항식.

감마선: 0.001과 0.0001.

비용: 1, 10, 100, 그리고 1000.

figure-protocol-13
그림 5: 서로 다른 비용과 감마 유형을 가진 SVM. 이 그림은 서로 다른 비용과 감마 유형을 가진 SVM 동작을 보여줍니다. 약어; SVM = 지지 벡터 기계. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

RF의 경우, 그림 6 에 표시된 체계적으로 입력된 값은 다음과 같습니다:

매개변수 이름과 해당 값은 아래에 제공되어 있습니다:

기능 수: 'auto', 'sqrt'.

최대 깊이: 1, 3, 5, 7.

MIN 샘플 나눠짐: 2, 3, 4, 5.

MIN 샘플 잎: 2, 3, 4, 5.

figure-protocol-14
그림 6: 깊이 값과 최소 샘플 잎을 가진 RF. 이 그림은 깊이와 최소 샘플 잎 값을 가진 RF 거동을 나타냅니다. 약어; RF = 랜덤 포레스트. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

ANN의 경우, 분석 입력값은 그림 7 표시되어 있습니다.

매개변수 이름과 각각의 값은 다음과 같습니다:

숨겨진 층 크기: (50, 50, 50), (50, 100, 50), 그리고 (100,).
활성화: '탄'과 '렐루'.
솔버: 'sgd'와 'adam'.
알파: 0.1, 0.01, 0.001, 0.0001, 0.5, 0.005, 0.0005, 그리고 0.05.
학습 속도: '일정한', '적응적'.

figure-protocol-15
그림 7: 서로 다른 알파 값과 숨겨진 층 크기를 가진 ANN. 이 그림은 서로 다른 알파 값과 숨겨진 층 크기를 가진 ANN의 동작을 보여줍니다. 약어; ANN = 인공 신경망. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

분류기매개변수가치
SVM감마0.0001
커널 타입'RBF'
비용 'C"10
무작위 상태42
RF최대 깊이3
최소 샘플 잎2
최소 샘플 분할2
무작위 상태42
활성화'렐루'
알파0.001
숨겨진 층의 크기(50,50,50)
학습 속도'상관없음'
솔버'아담'
무작위 상태42

표 5: 제안된 분류기의 최적 매개변수 요약. 이 표는 제안된 분류기들에 대해 얻어진 최적 매개변수를 요약합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

특징 선택의 영향
본 연구에서는 재귀적 특징 제거 기반 상관계수 방법을 특징 선택에 사용한다. 상관계수는 특징을 상관계값에 따라 가장 높은 값에서 가장 낮은 값으로 정렬하는 데 사용됩니다. 재귀적 특징 제거는 모델에 적합한 특징을 선택하는 데 도움을 주기 위해 사용되며, 약한 특징을 점차 제거하여 단 하나만 남게 됩니다. 모든 프로세스는 네 개의 선택된 분류기를 10배 교차 검증으로 실행하여 가장 높은 정확도를 가진 그룹을 찾습니다. 다음은 소거 방법의 과정입니다:

첫째, NB, RF, SVM, ANN을 포함한 알고리즘은 N개의 특징으로 구성됩니다. 둘째, 모든 특징의 상관계수를 계산하고, 상위 N/2 특징을 선택합니다. 셋째, 두 번째 단계는 단일 지형이 남을 때까지 반복됩니다. 마지막으로, 가장 좋은 성능을 낸 기능 세트를 직접 분할(Direct Partition)을 사용하여 선택...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 SVM, ANN, RF, NB 등 여러 머신러닝 알고리즘을 사용합니다. 여러 실험을 수행하고 하이퍼파라미터와 특징 선택을 미세 조정한 결과, SVM, ANN, RF는 94%의 놀라운 진단 정확도를 보이는 반면, NB는 상대적으로 낮은 83.33%임을 결론지었습니다. 결과는 10배 교차 검증과 최적화된 특징 선택, 그리고 최적의 분할 비율을 통해 검증되었습니다. 주어진 데이터에 따르면, 환자의 17개 매개변수가 상관계수 값 순서대로 순위를 매겼으며, 낮은 MPV와 GENDER가 천식과 가장 높은 양성 연관성을 보였다. 반면, HCT와 BASO는 강한 부정적 연관성을 보여, 호흡 스트레스 하에서 전신 염증과 세포의 이동을 나타냈다. 다른 흔한 면역 요인으로는 말초 호산구 수치가 높으면 질병의 심각도를 나타내는 EOS가 있습니다.

기계 학습을 이용한 임상 데이터셋을 이용한 최첨단 천식 진단 접근법과 달리, 제안된 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 데이터셋은 병원에서 IRB-2020-09-429 하에 입수한 것입니다. 저자들은 본 연구와 관련하여 보고할 이해 상충이 없다고 선언합니다. 이 연구는 다음과 같은인용 50과 함께 리서치 스퀘어 저장소에 사전 인쇄본으로 추가되었습니다.

저자들의 기여:
개념화는 S.O., M.I.B.A., A.R.에 의해 이루어졌습니다; 감독은 S.O., M.I.B.A., J.A.가 담당했으며; 원작 초고는 S.S.A., E.A., Z.A.가 맡았으며; 실행은 S.A.A., Y.A., R.A.가 담당했으며; 검증은 J.A., M.A., S.D.가 수행했으며; 데이터 큐레이션은 A.B., Y.A., E.A., Z.A.가 담당했으며; 리뷰 및 편집은 A.R., S.D., A.B.가 담당했으며; 프로젝트 행정은 A.R., S.D., M.A.가 담당했고, 자금 조달은 A.B., S.D., A.R.이 담당했습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 연구 결과를 검증하는 데 있어 의료 전문가들의 지지에 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Excel 365MicrosoftExcel 365csv 형식의 원시 데이터 저장에 사용
Laptop/MachineDellXPS9320RAM 16GB, 12세대 Intel(R) Core(TM) i7-1260P
Mlxtend 0.23.4Google colab Notebook Mlxtend 0.23.4모델 빌딩 훈련에 사용
Numpy 2.0.2Google colab Notebook Numpy 2.0.2모델 빌딩 훈련에 사용
Pandas 2.2.2Google colab Notebook Pandas 2.2.2모델 빌딩 훈련에 사용
Python 3.12.12Google colab Notebook Python 3.12.12모델 빌딩 훈련에 사용
Sklearn 1.6.1Google colab Notebook Sklearn 1.6.1모델 빌딩 훈련에 사용
SPSS IBM, USA버전 26.0통계 분석에 사용
XGbbost 3.1.2Google colab Notebook XGbbost 3.1.2모델 빌딩 훈련에 사용
```

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

관련 논문