이 연구는 Hadoop MapReduce와 K-Means 클러스터링을 활용한 심장병 예측을 위한 확장 가능한 프레임워크를 개발합니다. 분류 컷오프 조정은 탐지 민감도에 영향을 미칩니다. CViHDKNN은 위양성을 조절하면서 진양성 검출을 향상시키는 반면, CViHDDT는 위양성을 줄이지만 일부 심장병 사례를 놓칠 수 있습니다.
연구 논문
이 연구는 Hadoop MapReduce와 K-Means 클러스터링을 활용한 심장병 예측을 위한 확장 가능한 프레임워크를 개발합니다. 분류 컷오프 조정은 탐지 민감도에 영향을 미칩니다. CViHDKNN은 위양성을 조절하면서 진양성 검출을 향상시키는 반면, CViHDDT는 위양성을 줄이지만 일부 심장병 사례를 놓칠 수 있습니다.
심장병은 전 세계적으로 사망률의 주요 원인 중 하나로 남아 있으며, 조기 진단과 적시에 임상적 개입을 가능하게 하는 정확하고 확장 가능한 예측 시스템의 긴급한 필요성을 만들어냅니다. 전통적인 머신러닝 접근법은 대규모 의료 데이터셋을 효율적으로 처리하는 데 어려움을 겪고 해석 가능성도 부족해 임상 의사결정 지원에 대한 유용성을 제한합니다. 이러한 도전 과제를 해결하기 위해 본 연구는 심장병 예측을 위한 클러스터 시각화 분산 기계 학습 프레임워크를 제안합니다. 이 프레임워크는 두 가지 분산 알고리즘을 포함하고 있습니다: 클러스터 시각화 하둡 분산 의사결정 트리(CViHDDT)와 클러스터 시각화 하둡 분산 K-최근이웃(CViHDKNN)입니다. 제안된 모델들은 대규모 데이터셋에 걸쳐 분산 연산을 위해 Hadoop의 MapReduce 프레임워크를 활용하고, 데이터 조직과 시각화를 개선하기 위해 K-Means 클러스터링을 통합합니다. 이 클러스터 기반 시각화는 임상의가 환자 위험 요인과 예측 결과 간의 관계를 더 잘 이해할 수 있도록 하여 해석 가능성을 높입니다. 실험적 평가는 UCI 심장병 데이터셋을 사용하여 하둡 기반 분산 환경에서 수행되었습니다. 결과는 CViHDKNN이 85.25%의 정확도와 88%의 회상률을 기록하는 우수한 예측 성능을 달성했으며, 80.33%의 정확도를 기록한 CViHDDT 모델을 능가했습니다. 분류 컷오프 값 조정도 민감도와 검출률에 영향을 미쳤습니다. 컷오프가 낮아질수록 진양성 검출이 향상되었으나 위양성 수준은 유지되었습니다. 이 연구 결과는 클러스터링 강화 분산 학습이 심장병 예측의 확장성, 예측 정확성, 임상 해석 가능성을 향상시킨다는 것을 보여줍니다.
심장병은 전 세계적으로 주요 사망 원인 중 하나이며, 주요 공중보건 과제를 대표합니다. 심혈관 질환의 유병률 증가는 조기 발견과 치료를 지원하는 첨단 진단 모델의 긴급한 필요성을 부각시킵니다. 전통적인 진단 접근법은 수작업 평가와 임상 판단에 크게 의존하며, 이는 대량의 의료 데이터를 효율적으로 관리하는 데 종종 어려움을 겪습니다. 최근에는 인공지능(AI)과 머신러닝(ML) 기법이 예측 의료 분석에서 중요한 역할을 하여 데이터 기반 질병 예측을 가능하게 하고 의료 시스템의 위험 평가 정확도를 향상시키고 있습니다 1,2.
기존의 진단 방법과 규칙 기반 의사결정 시스템은 복잡한 의료 데이터셋에 적용할 때 확장성이 제한되고 정밀도가 낮다는 문제를 겪는 경우가 많습니다. 기계 학습 기술이 예측 성능을 향상시켰음에도 불구하고, 많은 모델이 대규모 의료 데이터를 처리하고 임상 의사결정을 위한 해석 가능성을 유지하는 데 여전히 어려움을 겪고 있습니다. 딥러닝 모델은 높은 예측 정확도를 달성할 수 있지만, 종종 '블랙박스' 시스템처럼 작동하여 의료 전문가들이 예측 이면의 이유를 이해하기 어렵게 만듭니다 3,4,5. 이러한 투명성 부족은 설명 가능성이 필수인 임상 환경에서의 채택을 제한합니다 6,7,8,9,10.
이러한 도전을 극복하기 위해 Hadoop과 같은 분산 컴퓨팅 프레임워크가 대규모 의료 분석에 점점 더 많이 채택되고 있습니다. Hadoop의 분산 아키텍처는 Hadoop 분산 파일 시스템(HDFS)과 MapReduce를 사용하여 대규모 데이터셋을 병렬 처리할 수 있게 하여 의료 데이터 분석에서 계산 효율성과 확장성을 향상시킵니다. 하지만 분산 머신러닝 모델은 여전히 해석 가능성과 투명성을 높이는 메커니즘이 필요합니다. 클러스터링과 시각화 기법을 통합하면 환자 데이터 내에 숨겨진 패턴을 드러내고, 임상의가 예측 결과를 보다 효과적으로 이해할 수 있도록 지원할 수 있습니다. 11,12,13,14,15,16.
여러 연구자들이 의사결정 트리와 K-최근이웃(KNN)과 같은 알고리즘을 이용한 심장병 예측을 위한 분산 기계 학습 기법을 탐구해왔습니다. 하둡 프레임워크 위에 구현된 분산 의사결정나무(HDDT) 모델은 전통적인 의사결정나무 접근법17,18,19,20,21,22,23에 비해 확장성과 분류 정확도가 향상되었습니다. 마찬가지로, Hadoop 분산 KNN(HDKNN) 방법은 병렬 처리를 활용하여 대규모 고차원 의료 데이터셋의 분류 효율성을 향상시킵니다24, 25, 26. 하지만 이러한 모델들은 효과적인 임상 의사결정과 환자 위험 프로필 이해에 필요한 강력한 해석 가능성과 시각화 메커니즘이 부족한 경우가 많습니다. 이러한 발전에도 불구하고, 기존 분산 모델들은 환자 위험 패턴의 해석 가능성과 시각적 이해를 위한 통합 메커니즘이 여전히 부족합니다.
이러한 한계를 해결하기 위해 본 연구는 심장병 예측을 위한 클러스터 시각화 분산 기계 학습(CVDML) 프레임워크를 제안합니다. 이 프레임워크는 두 가지 분산 예측 모델을 소개합니다: 클러스터 시각화 하둡 분산 의사결정 트리(CViHDDT)와 클러스터 시각화된 하둡 분산 K-근접 이웃(CViHDKNN)입니다. CViHDDT는 분산 의사결정 트리 구성을 적용해 증상 및 이전 병력과 같은 의학적 특징 선택을 최적화하는 반면, CViHDKNN은 유사한 의학적 특성을 기반으로 환자를 분류하는 분산 병렬 KNN 방식을 구현합니다. 클러스터링과 시각화 기법의 통합은 유사한 질병 패턴을 가진 환자를 그룹화하여 분류 성능을 향상시키고 해석 가능성을 향상시킵니다.
이 연구의 주요 목표는 대규모 의료 데이터셋을 활용해 정확한 심장병 예측을 위한 확장 가능하고 해석 가능한 분산 기계 학습 프레임워크를 개발하는 것입니다. 이 연구의 주요 기여는 다음과 같습니다: (1) 대규모 의료 데이터셋을 효율적으로 처리할 수 있는 하둡 기반 분산 머신러닝 프레임워크 개발. (2) 클러스터링 시각화 기법을 분산 의사결정 트리 및 KNN 모델과 통합하여 예측 의료 분석에서 해석 가능성과 투명성 향상27. (3) 전통적인 머신러닝 접근법과 비교했을 때 정확도, 회상 및 이상 탐지 능력 향상을 통한 예측 성능 향상28.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
데이터셋 획득
UCI 심장병 데이터셋은 심장병 예측을 위해 의학 및 머신러닝 연구에서 널리 사용되는 데이터셋입니다. 이 도구는 환자의 다양한 임상 및 진단적 특성을 포함하고 있어 의료 전문가와 연구자가 데이터 기반 예측 모델을 개발할 수 있도록 합니다. 이 데이터셋은 연령, 성별, 흉통 유형, 혈압, 콜레스테롤 수치, 심전도 결과 (https://archive.ics.uci.edu/dataset/45/heart+disease)29 등 여러 환자 속성을 바탕으로 심장병 발병 가능성 또는 낮음으로 분류합니다. 제안된 심장병 예측 프레임워크의 전체 워크플로우(데이터 전처리, 분산 모델 구현, 평가 단계를 포함)는 그림 1에 나타난다.
실험 환경 설정
실험 환경은 Apache Hadoop 3.x에 배포되어 모든 구현의 핵심 분산 컴퓨팅 프레임워크로 사용되었습니다. 클러스터는 전용 마스터 노드 하나와 여러 워커 노드를 가진 마스터-워커 아키텍처를 사용했습니다. 마스터 노드는 YARN(Yet Another Resource Negotiator)을 사용하여 작업 스케줄링, 자원 할당, 클러스터 조정을 관리했고, 워커 노드는 대규모 의료 데이터셋을 효율적으로 처리하기 위해 분산 계산 작업을 병렬로 수행했습니다. 클러스터 내 각 노드는 인텔 코어 i7 프로세서(또는 동등한 프로세서), 16–32GB RAM, 약 1TB 저장 공간으로 프로비저닝되었습니다.
HDFS로의 데이터 인제이스
데이터셋 저장
실험 데이터셋은 HDFS에 블록 분산 형식으로 저장되었으며, 목표 변수는 심장병의 유무를 나타내는 독립적인 특징 집합과 분리되어 클러스터 노드 간에 저장되었습니다. MapReduce 워크플로우를 사용하여 모든 저장된 데이터 블록에 기능별 전처리가 적용되었습니다. 나이, 혈압, 콜레스테롤 수치, 심박수 등 수치적 특징은 4분위 범위 기반의 견고한 스케일러를 사용해 정규화하여, 극단적인 치가 드문 또는 심각한 임상 상태를 나타낼 수 있는 의료 데이터셋에서 특히 흔한 이상치의 영향을 줄였습니다. cp, restecg, thal과 같이 두 개 이상의 범주를 가진 범주 변수는 원핫 인코딩을 사용하여 범주 속성을 머신러닝 알고리즘 입력30, 31, 32와 호환되는 이진 수치 표현으로 변환했습니다. 모든 전처리 작업은 HDFS 데이터 블록 전반에 걸쳐 분산된 MapReduce 작업으로 실행되어, 원시 데이터를 어느 한 지점에도 중앙집중화하지 않고 파이프라인 전체를 균일하게 적용할 수 있도록 했습니다.
노드 간 분할
데이터셋은 80:20 비율로 훈련 세트와 테스트 세트로 나뉘었으며, 80%는 훈련에, 20%는 보이지 않는 데이터에 대한 평가용으로 예약되었습니다. 이 분할은 모든 분산 워커 노드에 일관되게 적용되어 각 노드가 전체 데이터셋의 비례적이고 대표적인 샤드를 처리하도록 하여 데이터 왜곡을 방지하고 균형 잡힌 모델 일반화를 지원했습니다. 스케일링은 노드 간 학습 과정에서 더 큰 크기의 특성이 학습 과정을 지배하지 않도록 하여 모든 수치 변수가 분산 학습 과정에서 동등하게 기여하도록 보장했습니다. 이 구조화된 분할 전략은 예측 신뢰성을 높이고, 분산된 클러스터 전반에 걸쳐 학습과 평가 데이터를 명확히 분리하여 과적합을 방지하는 데 도움을 주었습니다.
데이터 전처리
누락 값 처리
의료 데이터셋은 데이터 입력 오류, 기기 오작동, 임상 데이터 수집 중 환자의 무반응으로 인해 불완전한 기록을 포함하는 경우가 많습니다. 모델 학습 전에 모든 데이터셋 속성에 누락 또는 무효 값이 있는지 검사했습니다. 혈압, 콜레스테롤, 심박수와 같은 중요한 임상 특징에서 누락된 행은 수치 변수에 대해 평균 보철법, 범주 변수에 대해 모드 보철법을 사용하여 식별하고 처리하였습니다. 이 방법은 데이터셋의 통계적 분포를 유지하면서도 불필요하게 버려진 학습 샘플이 없도록 하여 분산된 HDFS 노드 간에 모델 학습을 위한 최대 데이터 가용성을 유지했습니다.
기능 스케일링
나이, 혈압, 콜레스테롤 수치, 최대 심박수 등 수치적 특징은 값 범위가 크게 다르며, 이로 인해 더 큰 크기의 특징이 모델 훈련에 불균형적으로 영향을 미칠 수 있습니다. 이를 해결하기 위해 사분위 범위 기반의 견고한 스케일러가 모든 연속 수치 속성에 적용되었습니다. 이 확장 전략은 극단적인 임상 값이 희귀하거나 심각한 상태를 나타내면 학습 과정을 왜곡할 수 있는 의료 데이터셋에 특히 적합합니다. 스케일링은 모든 수치 변수가 모델 학습 중 균등하게 기여하도록 보장했으며, MapReduce 워크플로우를 사용하여 모든 분산 워커 노드에 일관되게 적용되었습니다.
인코딩
cp(흉통 유형), restecg(안정 시 심전도) 결과, thal(지중해빈혈 유형) 등 두 개 이상의 서로 다른 범주를 가진 범주 변수들은 원-핫 인코딩을 통해 변환하였습니다. 이 과정은 각 범주 속성을 이진 수치 지표열의 집합으로 변환하여, 기계 학습 알고리즘이 범주 값 간에 인위적인 서수 관계를 강요하지 않고 효과적으로 처리할 수 있는 표현을 생성했습니다. 이진 범주 변수는 원래의 수치 형태로 유지되었습니다. 모든 인코딩 작업은 HDFS 데이터 블록 전반에 걸쳐 분산된 MapReduce 작업으로 실행되어, 모든 분할된 데이터셋 샤드에서 일관된 변환을 보장했습니다.
트레인/테스트 스플릿
사전 처리된 데이터셋은 80:20 분할로 훈련과 테스트 하위 집합으로 나뉘었으며, 80%는 모델 훈련에, 20%는 보이지 않는 데이터에 대한 성능 평가에 할당되었습니다. 심장병의 유무를 나타내는 목표 변수는 분리 전에 독립 특징 집합에서 분리되었습니다. 이 분할은 모든 분산 HDFS 노드에 균일하게 적용되어 각 워커 노드가 전체 데이터셋의 비례적이고 대표적인 샤드를 처리하도록 하여 데이터 왜곡을 방지했습니다. 80:20 분할 전략은 예측 신뢰도를 높이고 모델 일반화를 개선했으며, 분산 클러스터 환경 전반에서 훈련과 평가 데이터를 명확히 분리하여 과적합을 방지했습니다.
모델 구현
클러스터 시각화 하둡 분산 의사결정 트리(CViHDDT) 모델은 분산 의사결정 트리를 사용하여 환자를 위험 범주로 분류합니다. 결정 트리 알고리즘은 가장 유익한 특징을 기준으로 데이터셋을 재귀적으로 분할하여 심장병 환자와 없는 환자 간의 분리를 극대화합니다. Hadoop 분산 프레임워크 내에서 이 과정은 여러 컴퓨팅 노드에 걸쳐 실행되어 대규모 데이터셋을 효율적으로 처리할 수 있습니다. 분산 아키텍처는 계산 시간을 줄이면서 확장성을 향상시킵니다. 클러스터 시각화 하둡 분산 K-최근이웃(CViHDKNN) 알고리즘은 동일한 데이터셋을 사용하지만 다른 분류 전략을 적용합니다. 의사결정 트리를 구축하는 대신, 모델은 혈압, 콜레스테롤 수치, 운동 유발 협심증과 같은 의학적 속성을 바탕으로 가장 가까운 인근 환자를 식별합니다. 분산 계산을 사용하여 KNN 알고리즘은 유사한 의학적 특성을 가진 환자들을 효율적으로 클러스터링하면서 계산 복잡도를 관리합니다.
분산 K-최근접 이웃 모델의 분류 원리는 그림 2에서 보여주는데, 여기서 새로운 인스턴스가 최근접 이웃 중 다수 클래스에 따라 클래스에 할당됩니다. 클러스터 시각화 기법은 의료 전문가들이 유사한 임상 특성을 가진 환자 집단을 식별할 수 있게 하여 해석 가능성을 높이고 개인화된 치료 권고를 지원합니다. 제안된 심장병 예측 프레임워크는 데이터 전처리, 분산 머신러닝 알고리즘, 클러스터 시각화 기법을 통합합니다. Hadoop의 분산 컴퓨팅 기능을 활용하여 이 프레임워크는 대규모 의료 데이터셋을 효율적으로 처리하면서도 높은 예측 정확도와 해석 가능성을 유지하여 조기 심장병 발견과 임상 의사결정 개선을 가능하게 합니다.
클러스터 시각화된 하둡 분산 의사결정 트리(CViHDDT):
분산 의사결정 트리 교육
제안된 클러스터 시각화 하둡 분산 의사결정 트리(CViHDDT) 모델은 전통적인 의사결정 트리 구축과 근본적으로 차별화되어, 전체 트리를 단일 기계에 구축하는 대신 하둡 생태계 내 여러 노드에 트리 구축 과정을 분산시킵니다. 개별 워커 노드는 할당된 데이터셋 부분집합에서 MapReduce나 Apache Spark를 사용하여 병렬 처리를 위해 로컬에서 부분 의사결정 트리를 구성합니다. 이 국소적으로 구성된 부분 트리들은 이후 전체 분산 데이터셋을 포함하는 완전한 전역 의사결정 트리로 결합됩니다. 이 분산 학습 전략은 모델 학습을 크게 가속화하여 프레임워크가 대규모 다중 테라바이트 의료 데이터셋을 효율적으로 처리할 수 있게 합니다. Hadoop이 제공하는 병렬 컴퓨팅 인프라는 CViHDDT 모델이 본질적으로 확장 가능하며 빅데이터 기반 의료 솔루션에 적합함을 보장합니다. 분산 트리 구성 이후, k-means와 계층적 클러스터링과 같은 알고리즘을 사용하여 의사결정 트리 노드를 유사한 의학적 상태를 가진 환자 클러스터로 그룹화하여 모델 해석 가능성을 높이기 위해 클러스터 시각화 기법을 적용합니다. 이 클러스터링 과정은 경증, 중등도, 중증 심장병과 같은 임상적으로 의미 있는 위험 범주를 생성하여, 의료 전문가들이 환자 데이터의 패턴을 파악하고 질병 진행을 이해하며 맞춤형 치료 계획을 수립할 수 있게 합니다.
기능 선택
분산 의사결정 트리 학습 이전에, CViHDDT 모델은 HDFS에서 수집된 원시 의료 데이터에 구조화된 전처리 및 특징 선택 파이프라인을 적용합니다. 누락 값은 임페테이션 알고리즘을 통해 해결되어 불완전한 임상 기록을 관리하고 환자 샘플을 폐기하지 않고 데이터 손실을 방지합니다. 강경 스케일러 정규화는 혈압과 콜레스테롤 수치와 같은 수치 특성에 적용하여 의료 데이터셋에서 만연한 이상치의 불균형적 영향을 완화합니다. 성별과 심장병 가족력과 같은 범주 변수는 원핫 또는 라벨 인코딩을 통해 변환되어 머신러닝 알고리즘과 호환되는 수치 표현을 생성합니다. 전처리 후에는 특징 추출이 수행되어 심장병을 가장 예측하는 주요 임상 속성을 식별합니다. 이 단계는 데이터셋에서 무관하고 중복된 특징을 제거하여 이후 분산 훈련 단계의 계산 비용을 줄이고, 흉통 유형, 안정 혈압, 혈청 콜레스테롤, 최대 심박수, ST 우울증 등 진단적으로 가장 유용한 속성만이 분산 의사결정 트리 구축 과정의 입력으로 유지되도록 보장합니다. 이러한 체계적인 특징 감소는 모델 효율성을 높이고, 분산 노드 간 학습 시간을 단축하며, 임상 판별력이 가장 강한 속성에 학습 과정을 집중함으로써 CViHDDT 프레임워크의 전반적인 예측 신뢰성을 향상시킵니다.
MapReduce 워크플로우
MapReduce 프로그래밍 모델은 CViHDDT 분산 학습 파이프라인의 계산 중추를 형성하며, 하둡 클러스터 내 모든 워커 노드에서 심장병 데이터셋을 병렬 처리할 수 있게 합니다. 맵 단계에서 각 워커 노드는 할당된 HDFS 데이터 샤드를 독립적으로 처리하며, 각 후보 속성에 대해 부분 의사결정 트리 구조와 로컬 분할 통계(정보 획득 및 지니 인덱스 값 포함)를 계산하며, 다른 노드에 저장된 데이터에 접근할 필요가 없습니다. 감소 단계에서는 지역에서 계산된 부분 트리와 충분한 통계량을 모든 노드에 집계하여 각 노드에서 학습된 분산 지식을 하나의 통합 예측 모델로 통합하여 완전한 글로벌 의사결정 트리를 구성합니다. 이 트리 구축 과정의 맵 축소 분해는 CViHDDT 모델이 워커 노드 수에 따라 선형적으로 확장될 수 있게 하여, 대규모 의료 데이터셋의 실시간 분석이 계산적으로 가능해집니다. MapReduce 워크플로우는 클러스터 시각화 절차의 분산 실행도 지원하는데, 이는 클러스터링 알고리즘을 HDFS 데이터 블록 간에 병렬로 적용하여 의사결정 트리 노드 할당에 따라 환자 기록을 위험 범주로 그룹화하는 방식입니다. 결과 모델의 성능 평가는 정밀도, 회상률, F1 점수, 분류 정확도를 주요 지표로 사용하며, 분산 클러스터 시각화는 트리 내에서 더 세밀한 의사결정 경계를 가능하게 하여 위음성을 더욱 줄여 위험군 환자 식별의 민감도를 직접적으로 향상시키고 CViHDDT 심장병 예측 프레임워크의 임상 신뢰성을 높였습니다.
클러스터 시각화 하둡 분산 K-최근접 이웃 (CViHDKNN)
클러스터링
CViHDKNN(클러스터 시각화 하둡 분산 K-최근최근접 이웃) 프레임워크는 분류 전에 심장병 데이터셋에 클러스터링 기법을 적용하는 것부터 시작하며, KNN 검색이 수행되기 전에 유사한 의학적 특성을 가진 환자들을 일관된 클러스터로 그룹화합니다. 나이, 콜레스테롤 수치, 혈압, 심전도 결과, 심박수 등 임상 특징을 포함하는 심장병 데이터셋은 HDFS를 사용해 Hadoop 클러스터의 노드에 전처리되어 배포됩니다. K-평균 및 계층적 클러스터링 등 클러스터링 알고리즘을 이러한 분산 데이터 파티션에 적용하여 데이터셋을 관련 의료 프로필을 공유하는 환자 그룹으로 나눕니다. 이 사전 분류 클러스터링 단계는 중요한 계산 목적을 가지고 있습니다: KNN 검색 공간을 전체 데이터셋이 아닌 가장 관련 있는 클러스터로 제한함으로써 알고리즘은 쿼리 인스턴스당 필요한 거리 계산 수를 크게 줄입니다. 이러한 클러스터를 시각화하는 것은 밀접한 의학적 특성을 가진 환자 하위 그룹을 식별하고, 최근-이웃 분류 단계 이전에 위험 프로필을 보다 의미 있게 분류할 수 있도록 추가적인 임상적 이점을 제공합니다. 클러스터링 기반 최적화는 계산 오버헤드를 줄일 뿐만 아니라, 각 쿼리 인스턴스가 가장 맥락적으로 유사한 환자 기록과만 비교하도록 하여 분류 정확도를 높여, 전체 데이터셋에 걸친 광범위한 거리 계산이 어려울 대규모 심장병 데이터셋에 특히 적합합니다.
분산 KNN
CViHDKNN의 분산 KNN 구성 요소는 쿼리 인스턴스와 저장된 모든 데이터 포인트 간 거리를 계산하기 전에 전체 데이터셋을 메모리에 로드해야 하는 전통적인 KNN의 근본적인 확장성 한계를 해결합니다. CViHDKNN 프레임워크에서는 이 거리 계산이 HDFS 분산 데이터 파티션을 사용하여 Hadoop 클러스터 내 여러 워커 노드에 병렬화되어, 단일 노드가 전체 데이터셋을 처리할 필요가 없도록 보장합니다. 각 워커 노드는 독립적으로 쿼리 인스턴스와 로컬 할당된 HDFS 데이터 샤드에 저장된 환자 기록 간 거리를 계산하여 해당 파티션 내에서 가장 가까운 이웃을 식별합니다. Hadoop의 병렬 처리 능력을 활용함으로써 CViHDKNN은 확장성을 크게 향상시키고 방대한 양의 건강 관련 환자 데이터를 효율적으로 관리할 수 있게 합니다. 이 분산 아키텍처는 민감한 환자 기록이 외부 클라우드 서버나 중앙 집중식 로컬 머신으로 전송되지 않고 분산 클러스터 환경 내에 머무르기 때문에 데이터 보안을 강화합니다. 클러스터링 유도 탐색 공간 감소와 하둡 분산 거리 계산의 결합은 계산 효율성과 예측 정확도를 모두 달성하여 대규모 의료 데이터셋에서 실시간 심장병 예측을 가능하게 하는 시스템을 만들어냅니다. 실험 결과는 분산 구현이 85.25%의 분류 정확도를 달성하여, 전통적인 비분산 KNN 기준선에 비해 상당한 성능 향상을 나타내며, 이는 분산 클러스터링 강화 처리 전략 덕분임을 확인시켜 줍니다.
분류
CViHDKNN의 분류 단계는 분산 검색 과정을 통해 식별된 K개의 최근접 이웃 중 다수 투표를 바탕으로 각 쿼리 환자 인스턴스를 심장병 클래스에 할당합니다. K 값의 선택은 분류 결과와 예측 정확도에 직접적인 영향을 미칩니다. K = 1일 때, 쿼리 인스턴스는 단일 가장 가까운 이웃의 클래스 레이블에 할당되어, 훈련 데이터의 노이즈에 민감할 수 있는 매우 국소화된 결정 경계가 됩니다. K = 3일 때, 분류는 세 개의 가장 가까운 이웃 중 다수 클래스에 의해 결정됩니다. 예를 들어, 두 이웃이 1등급(심장병 없음)에 속하고 한 명이 2등급(심장병 존재)에 속한다면, 쿼리 인스턴스는 1등급으로 분류되어 더 견고하고 노이즈에 대한 결정을 제공합니다. MapReduce phase는 모든 워커 노드에서 국소적으로 식별된 최근접 이웃들을 전 세계적으로 순위 매긴 리스트로 집계하고, 그 중에서 K개의 최근접 이웃을 선택한 후 다수 투표를 계산하여 최종 클래스 예측을 산출합니다. CViHDKNN 분류 프레임워크의 성능은 정밀도, 회상율, F1 점수, 전체 분류 정확도를 주요 지표로 평가합니다. 클러스터 제약 검색과 분산 다수결 투표의 통합은 표준 KNN보다 더 세밀하고 정확한 의사결정 경계를 생성하여, 위험군 환자 식별에서 거짓 음성을 줄이고 민감도를 향상시키며, 이는 대규모 분산 의료 분석 환경에서 임상적으로 신뢰할 수 있는 심장병 예측에 필수적인 요구사항입니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 평가 결과 CViHDKNN 모델이 심장병 분류에서 CViHDDT 모델보다 더 높은 예측 성능을 달성함을 입증하였습니다. CViHDKNN 모델은 85.25%의 테스트 정확도를 달성한 반면, CViHDDT 모델은 80.33%를 달성하여 분산 K-최근접 이웃 접근법의 예측 능력이 향상되었음을 나타냅니다. 이러한 비교 성과 결과는 표 1에 요약되어 있습니다.
CViHDDT 모델의 분류 성능은 중간 정도의 예측 능력을 보여주며, 정확도와 회상 값은 질병 사례와 비질병 사례 모두를 균형 있게 감지했음을 나타냅니다. 특히 이 모델은 심장병 환자에서 75%, 비질환 환자에서 86%의 리콜을 달성했는데, 이는 심장병이 없는 환자를 비교적 잘 식별하는 데 있어 보이지만 일부 양성 사례를 놓칠 수 있음을 시사합니다. CViHDDT의 상세 분류 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
클러스터링 기법인 CViHDDT를 기반으로 한 효과적인 심장병 예측 방법이 Hadoop 기반 분산 의사결정 트리 프레임워크를 사용하여 개발되고 평가되었습니다. 이 모델은 약 75.62%의 훈련 정확도와 80.33%의 테스트 정확도를 달성하여 보이지 않는 데이터에 대한 일반화 능력을 입증했습니다. 약간 더 높은 테스트 정확도는 Hadoop의 병렬 처리가 대규모 데이터셋을 효율적으로 처리하면서 과적합을 최소화할 수 있음을 시사합니다. 이전 연구들도 하둡 기반 분산 시스템이 의료 분석의 확장성과 처리 효율성을 향상시킨다고 보고했습니다 1,8. MapReduce 프레임워크를 활용함으로써 데이터셋이 여러 노드에 분산되어 의사결정 트리 구성 시 엔트로피와 정보 획득 계산이 더 빠르게 가능해졌습니다.
분류 보고서는 두 클래스 모...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충을 선언할 필요가 없습니다.
저자들은 인도 와랑갈에 위치한 SR 대학교 컴퓨터 과학 및 공학과에 진심으로 감사의 뜻을 전하며, 이 연구 작업 전반에 걸쳐 지속적인 지원과 격려를 제공해 주신 것에 대해 감사드립니다. 저자들은 또한 대학 연구개발팀, 연구개발실, 고위 교수진, 멘토들에게 귀중한 지도, 기술 지원, 동기부여에 크게 기여하여 이 연구 논문의 성공적인 완성에 크게 기여했다고 말씀드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Apache Spark | Apache Software Foundation | 3.x | 분산 데이터 처리 |
| HDFS | Apache Software Foundation | Hadoop 3.x에 포함 | 분산 파일 저장소 |
| YARN | Apache Software Foundation | Hadoop 3.x에 포함 | 리소스 관리 및 작업 스케줄링 |
| Matplotlib | Matplotlib Development Team | 데이터 시각화 | |
| Seaborn | Seaborn Developers | 통계 시각화 | |
| Ubuntu OS | Canonical Ltd. | 20.04 LTS | 운영 체제 |
| RobustScaler | Scikit-learn | 특성 정규화 | |
| UCI Heart Disease Dataset | UCI Machine Learning Repository | 데이터세트 ID 45 | 실험 데이터세트 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청