여기서는 의료 분석을 위한 설명 가능한 인공지능 모델을 개발하고 평가하기 위한 재현 가능한 프로토콜을 제시합니다. 이 워크플로우는 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM 기반 설명 가능성, 정량적 평가, 인간 중심 검증을 통합하여 투명하고 신뢰할 수 있는 임상 의사결정을 지원합니다.
연구 논문
여기서는 의료 분석을 위한 설명 가능한 인공지능 모델을 개발하고 평가하기 위한 재현 가능한 프로토콜을 제시합니다. 이 워크플로우는 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM 기반 설명 가능성, 정량적 평가, 인간 중심 검증을 통합하여 투명하고 신뢰할 수 있는 임상 의사결정을 지원합니다.
설명 가능한 인공지능(XAI)은 투명성과 의사결정 설명 능력이 임상 의사결정의 필수 요소인 신뢰할 수 있는 AI 시스템 구축에 필수적인 도구로 점점 더 인정받고 있습니다. 이 출판물은 의료 분석을 위한 설명 가능한 AI 시스템 개발 및 평가를 위한 재현 가능한 실험적 접근법을 제시합니다. 개발된 파이프라인은 데이터 전처리, 예측 모델링, 해석 생성, 평가 단계를 하나의 원활한 워크플로우로 통합하여 구조화된 임상 데이터와 의료 영상 데이터셋 모두에 적용할 수 있습니다. 앙상블 머신러닝 모델은 구조화된 표 형식 데이터셋에서 강력한 예측 성능을 보여주었으며, 딥러닝 모델은 의료 영상 데이터의 복잡한 패턴을 학습하는 데 효과적입니다. SHAP, LIME, Grad-CAM과 같은 기법들은 모델 해석을 용이하게 하는 전역 및 국소적 설명입니다. 정말 도움이 많이 됐어요. 프레임워크의 정량적 평가는 정확성, 정밀도, 회상률, F1 점수, ROC-AUC, 설명 지표, 충실도, 안정성 등 다양한 지표를 아우릅니다. 결과는 실험 조건이 통제되었을 때, 프레임워크가 평가된 실험 조건 하에서 예측 성능과 설명 품질이 향상되었음을 보여줍니다. 프로토콜에 의해 이끄는 문서로서, 이 작업은 재현성과 확장성, 그리고 다른 생명체에 의한 지속적인 구현을 뒷받침합니다. 이 투명하고 이해하기 쉬운 AI 모델은 임상 의사결정 지원과 의료 분석 시스템이 대규모로 신뢰와 활용을 얻는 기반이 됩니다.
인공지능(AI)은 질병 진단, 예후, 위험 계층화, 의료 영상 분석 및 임상 의사결정을 지원함으로써 현대 의료의 중요한 구성 요소가 되었습니다. 머신러닝과 딥러닝의 발전으로 의료 시스템은 대량의 구조화 및 비구조화 데이터를 처리할 수 있게 되었으며, 종종 기존 통계 접근법과 동등하거나 그 이상으로 예측 성능을 달성할 수 있게 되었습니다2. 이러한 발전에도 불구하고, 많은 AI 모델은 복잡한 블랙박스 시스템처럼 작동하여 임상의와 의료 이해관계자가 예측이 어떻게 생성되는지 이해하기 어렵습니다. 이러한 투명성 부족은 고위험 의료 환경에서 신뢰, 채택, 책임성을 제한할 수 있습니다 4,5.
설명 가능한 인공지능(XAI)은 머신러닝 모델의 투명성과 해석 가능성을 향상시키는 유망한 접근법으로 떠올랐습니다6. SHAP(Shapley 가산 설명), LIME(국소 해석 가능한 모델 무관적 설명), 그리고 구배 가중 클래스 활성화 매핑(Grad-CAM) 등 널리 사용되는 설명 기법들은 특징 귀속과 시각적 설명 메커니즘 7,8,9를 통해 모델 행동에 대한 통찰을 제공합니다. 이러한 방법들은 임상 해석, 모델 감사, 의사결정 지원을 지원하는 의료 응용 분야에 점점 더 많이 적용되고 있습니다10,11. 하지만 설명 가능성만으로는 신뢰성, 재현성, 임상적 유용성을 보장하지 않습니다. 최근 연구들은 설명 불안정성, 교란에 대한 민감성, 임상의의 검증 부족, 설명 출력과 진정한 모델 추론 간의 불일치 등과 관련된 도전 과제를 강조했습니다 12,13,14,15.
설명 가능성 문제 외에도, 재현성은 의료 머신러닝 연구에서 여전히 중요한 관심사로 남아 있습니다16, 17, 18. 많은 연구들은 전처리 절차, 소프트웨어 환경, 하이퍼파라미터 구성, 검증 전략, 구현 워크플로우에 관한 제한된 정보를 제공하여 독립 복제가 어렵습니다19, 20, 21. 더불어, 의료 AI 연구는 예측 성과에 초점을 맞추는 경우가 많지만, 설명 품질 평가, 임상가 중심 평가, 실질적 실행 고려사항에 관한 제한적인 지침을 제공합니다22. 이러한 한계는 설명 가능한 AI 시스템을 연구 환경에서 실제 의료 환경으로 전환하는 데 장애물이 될 수 있습니다 23,24,25,26,27.
현재 의료 XAI 워크플로우는 개별 설명 기법이나 예측 모델을 개별적으로 평가하며, 데이터 준비, 예측 모델링, 설명 가능성 평가, 인간 중심 평가, 재현성 자원을 통합한 표준화된 프로토콜을 거의 제공하지 않습니다. 28,29,30,31. 따라서 연구자와 실무자는 워크플로우를 재현하거나, 설명 방법 비교하거나, 다양한 의료 데이터셋과 응용 분야에서 설명 가능한 AI 시스템의 실용성을 평가하는 데 어려움을 겪을 수 있습니다. 따라서 의료 설명 가능한 AI 워크플로우의 일관된 구현, 평가 및 보고를 촉진하기 위해 포괄적이고 재현 가능한 프로토콜이 필요합니다 32,33,34,35.
여기서는 의료 분석 분야에서 설명 가능한 인공지능 시스템을 개발, 평가 및 해석하기 위한 재현 가능한 프로토콜을 제시합니다. 프로토콜은 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM을 이용한 설명 가능성 평가, 임상 중심 평가, 검증 절차, 재현성 자원을 통합된 워크플로우 내에 통합합니다. 목표는 투명한 모델 개발, 설명 품질 평가, 그리고 다양한 의료 데이터셋 36,37,38,39에서 재현 가능한 구현을 지원하는 표준화된 프레임워크를 제공하는 것입니다. 이 연구의 방법론적 기여는 예측 분석, 설명 가능성 평가, 임상의사 검증, 재현성 관행을 의료 AI 연구, 교육 및 배포 지향 연구에 적합한 단일 프로토콜로 통합한 데 있습니다 40,41,42,43.
이 연구의 주요 기여는 새로운 설명 가능성 알고리즘의 개발이 아닙니다.
오히려 예측 모델링, 설명 가능성 평가, 시각화, 평가, 인간 중심 해석을 통합하여 의료 분석 및 JoVE 기반 프로토콜 배포에 적합한 통합 워크플로우로 통합한 표준화되고 재현 가능하며 실험적으로 검증된 프로토콜을 제공합니다. 이 연구의 주요 목적은 새로운 예측 알고리즘을 도입하는 것이 아니라, 의료 분석에서 설명 가능한 인공지능 워크플로우를 구현하기 위한 표준화되고 재현 가능하며 실험적으로 검증된 프로토콜을 제공하는 것입니다. 프로토콜은 데이터 전처리, 예측 모델링, 설명 가능성 평가, 임상가 중심 평가, 재현성 자원을 통합하여 채택, 재현, 교육 배포에 적합한 통합 프레임워크를 만듭니다.
본 연구에 사용된 모든 데이터셋은 UCI 머신러닝 저장소, PhysioNet MIMIC-III 데이터베이스, NIH 흉부 X선 데이터셋 등 공개 및 완전 익명화된 저장소에서 수집되었습니다. 식별 가능한 환자 정보는 접근되지 않았습니다. 이 연구는 공개된 익명성 해제 데이터의 2차 분석에 대한 기관 연구 윤리 지침을 준수하였습니다. 인간 참여자가 직접 모집되지 않았고 보호 건강 정보가 사용되지 않았기 때문에 공식 기관심의위원회(JB) 승인이 필요하지 않았습니다.
1. 실험 프레임워크 개요
2. 계산 환경 및 시스템 구성
| 구성 요소 | 매개변수 | 가치 | 설명 |
| 랜덤 포레스트 | n_estimators | 100 | 나무 수 |
| 랜덤 포레스트 | max_depth | 전혀 없습니다 | 나무 깊이 |
| XGBoost | learning_rate | 0.01 | 학습 속도 |
| XGBoost | n_estimators | 100 | 부스터 탄환 |
| CNN | 시대 | 25 | 훈련 시기 |
| CNN | batch_size | 32 | 배치 크기 |
| CNN | 옵티마이저 | 아담 | 최적화 알고리즘 |
| MLP | hidden_layers | 2 | 숨겨진 층의 수 |
| MLP | 활성화 | ReLU | 활성화 함수 |
| 일반 | train_split | 70% | 학습 데이터 비율 |
| 일반 | validation_split | 15% | 검증 비율 |
| 일반 | test_split | 15% | 검사 비율 |
표 1: 구현 세부사항 및 하이퍼파라미터 구성.
이 표는 제안된 설명 가능한 AI 프레임워크의 실험 평가 전반에 걸쳐 사용되는 계산 환경, 소프트웨어 라이브러리, 머신러닝 및 딥러닝 모델 구성, 최적화 설정, 학습률, 배치 크기, 학습 매개변수, 하이퍼파라미터 값을 요약합니다.
3. 데이터셋 준비 및 전처리
| 데이터셋 | 유형 | 샘플 | 특징 | 목표 |
| 유방암 | 표 형식 | 569 | 30 | 양성/악성 |
| 당뇨병 | 표 형식 | 768 | 8 | 당뇨병 결과 |
| 미믹-III | 전자건강기록(EHR) | ~60,000 | 임상 변수 | 사망자 |
| 흉부 엑스레이 | 영상 | ~112,000 | 이미지 | 질병 라벨 |
표 2: 데이터셋 특성 및 의료 사용 사례.
이 표는 연구에 사용된 의료 데이터셋의 요약을 제공하며, 데이터셋 유형, 샘플 수, 특징 수, 대상 변수, 의료 응용 도메인 및 관련 임상 사용 사례를 포함합니다. 데이터셋은 구조화된 임상 기록, 전자 건강 기록, 의료 영상 데이터를 포함하여, 다양한 의료 분석 시나리오에서 프레임워크의 적용 가능성을 보여줍니다.
| 데이터셋 | 표본 크기 | 클래스 분포 | 분할 전략 | 누수 방지 | 하이퍼파라미터 탐색 | 교차 검증 | 외부 시험 |
| 유방암 (UCI 위스콘신) | 569 | 357 양성 / 212 악성 | 70/15/15 | 열차 전용 전처리 | 그리드 탐색 | 5겹 층화 CV | 독립 홀드아웃 집합 |
| 피마 인디언 당뇨병 | 768 | 비당뇨병 500명 / 당뇨병 268명 | 70/15/15 | 열차 전용 전처리 | 그리드 탐색 | 5겹 층화 CV | 독립 홀드아웃 집합 |
| 미믹-III EHR | 5274 | 결과 계층화 코호트 | 70/15/15 환자 수준 | 환자 수준 분리 | 랜덤 서치 | 5단계 환자 수준 CV | 독립 홀드아웃 집합 |
| NIH 흉부 엑스레이 | 112120 | 폐렴/정상 층화 | 70/15/15 | 이미지 수준 분리 | 랜덤 서치 | 5겹 층화 CV | 독립 홀드아웃 집합 |
표 3: 데이터셋 수준 검증 및 실험 설계.
이 표는 각 데이터셋에 사용되는 검증 방법론을 요약하는데, 여기에는 표본 크기, 클래스 분포, 훈련-검증-테스트 분할 전략, 누수 방지 절차, 하이퍼파라미터 최적화 방법, 교차 검증 설계, 외부 테스트 프로토콜 등이 포함됩니다. 이러한 조치들은 방법론적 엄격성, 재현성, 편향 없는 모델 평가를 보장하기 위해 시행되었습니다.

그림 1: 데이터 전처리 파이프라인 검증.
모델 개발 전에 수행된 주요 전처리 작업의 검증 결과. (A) 대표적인 의료 특징에 걸친 결핍 가치 분석. (B) 이상치 처리 전후의 수치 변수 분포. (C) 표준화를 이용한 기능 확장성 검증. (D) 범주 인코딩 검증. (E) 전처리 후 클래스 분포. (F) 트레인-검증-테스트 데이터 분할의 검증. 이 결과는 예측 모델링 및 설명 가능성 분석을 위한 데이터셋의 성공적인 전처리 및 준비를 확인시켜 줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
4. 설명 가능한 AI 프레임워크의 시스템 아키텍처

그림 2: 의료 분석을 위한 설명 가능한 AI 프레임워크의 시스템 아키텍처. 이 그림의 더 큰 버전을 보려면 여기를 클릭해 주세요.
5. 워크플로우 실행

그림 3: 설명 가능한 AI 파이프라인의 종단 간 워크플로우. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
6. 모델 평가 및 설명 가능성 평가
7. 인간 중심 평가
| 매개변수 | 가치 |
| 전문가들 | 12 |
| 의사들 | 6 |
| 방사선과 전문의 | 3 |
| 임상 데이터 분석가 | 3 |
| 검토된 사건들 | 100 |
| 평가 설계 | 무작위 (예측 전용 vs 예측+설명) |
| 측량 기기 | 5점 리커트 척도 |
| 신탁 평가 | 해석 가능성, 신뢰도, 사용성 |
| 통계 검정 | 쌍 t-검정 (p 0.05) |
| 평가자 간 신뢰성 | 플라이스 카파 |
| 객관적 측정 | 결정 합의, 검토 시간 |
표 4: 인간 중심 평가 프로토콜 및 임상가 평가 설계.
이 표는 설명 가능한 AI 시스템의 해석 가능성, 신뢰성, 사용성을 평가하는 임상의 평가 프레임워크를 제시합니다. 참여자 인구통계, 사례 검토 방법론, 설문 설계, 통계 분석 절차, 평가자 간 신뢰도 평가 및 객관적 평가 지표에 관한 정보가 요약되어 있습니다.
8. 검증 및 재현성 평가
9. 재현성 자원
| 자료 | 설명 |
| 소스 코드 | 데이터 전처리, 모델 학습, 설명 가능성 및 평가를 위한 Python 구현 스크립트 |
| 환경 파일 | requirements.txt 패키지 의존성 및 버전을 포함함 |
| 구성 파일 | 모델 아키텍처 설정, 하이퍼파라미터 및 실험 구성 |
| 고정된 무작위 시드 | 재현 가능한 실험에 사용되는 씨앗 = 42 |
| 데이터셋 접근 지침 | 공공 의료 데이터셋 획득을 위한 링크 및 절차 |
| 전처리 스크립트 | 데이터 정제, 정규화, 인코딩 및 기능 선택을 위한 스크립트 |
| 피규어 생성 스크립트 | 모든 원고 도형을 재생하는 스크립트 |
| 테이블 생성 스크립트 | 보고된 표와 지표를 재현하는 스크립트 |
| 입력 예시 | 샘플 데이터셋 및 입력 파일 |
| 예제 출력 | 예측 결과, 설명 및 평가 보고서 |
표 5: 재현성 자원 및 실험 자산.
이 표는 실험적 재현성을 지원하기 위해 제공된 자원을 요약하는데, 여기에는 소스 코드, 전처리 스크립트, 구성 파일, 환경 사양, 데이터셋 접근 지침, 고정된 무작위 시드 설정, 그림 생성 스크립트, 보고된 결과를 재현하는 데 필요한 예시 입출력 파일 등이 포함됩니다.
우리는 전체 파이프라인의 설명 AI 요소를 철저히 평가하여, 구조화된 임상 데이터와 의료 이미지 등 다양한 유형의 의료 데이터 전반에서 얼마나 잘 예측하는지 평가했습니다. 결과는 평가된 데이터셋 전반에 걸쳐 일관된 예측 성능을 나타냈습니다. 테스트 모델 중 구배 부스트 모델이 97.4%로 가장 높은 정확도를 기록했으며, 그 다음으로 무작위 숲 모델이 94.2%로 뒤를 이었습니다. 이미지 세트에 적용된 딥러닝 기법은 91.3%의 정확도를 달성한 반면, 다층 지각론 모델은 약간 낮은 90.8%의 결과를 냈습니다. 이는 앙상블 기반 머신러닝 모델이 구조화된 의료 데이터에서 가장 우수한 성능을 보이는 반면, 딥러닝 아키텍처는 영상 작업에 뛰어나다는 것을 시사합니다. 표 6은 정확도, 정밀도, 회상율, F1 점수 등 예측 함수의 다양한 성능 지표와 충실도와 안정성과 같은 설명 가능성 지표를 자세히 설명합니다. 우리는 5배 교차 검증을 적용하고 결과를 평균 값(95% 신뢰구간 포함)으로 제시함으로써 이 성과 수치를 도출했습니다. 신뢰구간은 모델의 불확실성을 나타낼 뿐만 아니라, 데이터셋 메모리와 모델 아키텍처 차이를 고려하여 예측 성과 비교를 더 신뢰할 수 있게 합니다.
| 모델 | 정확도 (%) | 정밀도 | 리콜 | F1-점수 | 충실도 | 안정성 | 신뢰감시구간(95%) |
| 랜덤 포레스트 | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN(영상) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
표 6: 예측 모델 및 설명 가능성 방법의 비교 성과.
이 표는 정확도, 정밀도, 회상률, F1 점수, ROC-AUC 등 예측 성능 지표를 사용하여 머신러닝과 딥러닝 모델의 비교 평가를 제시합니다. 또한, 충실도, 안정성, 이해 가능성, 인간 신뢰 점수와 같은 설명 가능성 지표는 예측 효과와 해석 가능성 모두를 포괄적으로 평가하는 것으로 보고됩니다.
결과는 그라디언트 부스팅이 전체 예측 성능(97.4% 정확도)을 기록했으며, 랜덤 포레스트보다 3.2%포인트, 딥러닝 모델보다 6%포인트 이상 앞섰습니다. 이 관찰은 이 연구에 포함된 구조화된 의료 데이터셋에서 앙상블 기반 학습 방법이 특히 효과적이었음을 시사합니다. CNN과 MLP 모델 간의 성능 차이가 작다는 것은 모델 복잡성 증가만으로 평가된 실험 조건에서 반드시 우수한 예측 성능으로 이어지지는 않았음을 의미합니다.
다양한 의료 분석 과제에서 제안된 프레임워크의 유용성을 보여주기 위해, 표 7 에 데이터셋별 예측 성능 결과를 제시합니다.
데이터셋 특이적 분석.
특성 복잡도, 표본 크기, 클래스 분포, 데이터 방식의 차이로 인해 데이터셋마다 성능이 달랐습니다. 유방암 데이터셋은 명확하게 정의된 특징 분리성 덕분으로 가장 높은 예측 정확도를 달성했습니다. MIMIC-III와 NIH 흉부 X선 데이터셋에서 약간 낮은 성능은 종단 임상 기록과 의료 영상 데이터의 복잡성이 더 크기 때문이다. 이 결과들은 프레임워크 성능이 데이터셋의 특성과 임상 맥락에 의해 영향을 받는다는 것을 보여줍니다.
| 데이터셋 | 정확도 (%) | 정밀도 (%) | 리콜 (%) | F1 점수 (%) |
| 유방암 | 97.4 | 97.2 | 97.6 | 97.1 |
| 당뇨병 | 94.2 | 93.9 | 94.4 | 94 |
| 미믹-III | 91.3 | 91 | 91.5 | 91.1 |
| NIH 흉부 엑스레이 | 90.8 | 90.4 | 91.2 | 90.6 |
표 7: 데이터셋별 예측 성과 결과.
제안된 설명 가능한 AI 프레임워크의 네 가지 대표적인 의료 데이터셋에서의 예측 성능. 정확도, 정확도, 회상력, F1 점수는 독립 시험 세트에서 백분율(%)로 보고됩니다. 값이 높을수록 분류 성과가 더 우수함을 의미합니다.
예측 성능을 평가하기 위해 4개의 기계 학습 및 딥러닝 모델인 그라디언트 부스팅, 랜덤 포레스트, 합성곱 신경망(CNN), 다층 퍼셉트론(MLP)을 네 가지 대표적인 의료 데이터셋에서 평가했습니다. 모델 성능은 70:15:15 열차-검증-테스트 분할과 5배 교차 검증을 거쳐 독립 테스트 데이터셋에서 정확도, 정밀도, 회상률, F1 점수, ROC-AUC 지표를 사용하여 평가하였습니다. 예측 성능 향상은 동일한 전처리 및 검증 조건 내에서 모델별 평가 지표를 비교하여 확인되었습니다.
모델 성능이 다양한 방법으로 어떻게 다른지 밝히기 위해, 그림 4 는 앙상블, 신경망, 딥러닝 모델의 장단점을 그림으로 보여줍니다.

그림 4: 의료 예측 과제에서 머신러닝과 딥러닝 모델의 성능 비교. (a) 테스트 데이터셋에서 그라디언트 부스팅, 랜덤 포레스트, CNN, MLP 모델의 정확도 비교. (B) 테스트 데이터셋에서 그라디언트 부스팅, 랜덤 포레스트, CNN, MLP 모델의 F1 점수 비교. (C) 테스트 데이터셋에서 그라디언트 부스팅, 랜덤 포레스트, CNN, MLP 모델의 정밀 비교. (D) 테스트 데이터셋에서 그라디언트 부스팅, 랜덤 포레스트, CNN, MLP 모델의 비교를 회상합니다. 값이 높을수록 더 나은 예측 성능을 나타냅니다. Gradient Boosting은 모든 평가 지표에서 가장 높은 전체 성과를 기록했으며, 그 다음으로 Random Forest가 뒤를 이었습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
설명 가능성 수행 해석.
SHAP은 평가된 설명 가능성 방법 중 가장 높은 충실도와 안정성 점수를 꾸준히 기록했으며, 생성된 설명과 기저 모델 예측 간의 더 강한 일치를 나타냈습니다. 석회암은 상대적으로 낮은 안정성을 보였으며, 이는 국소 교란과 샘플링 변동성에 대한 민감도가 더 높음을 시사합니다. Grad-CAM은 이미지 기반 모델에 대해 시각적으로 해석 가능한 설명을 제공했으나, SHAP보다 약간 낮은 충실도를 보였습니다. 이 결과들은 설명의 질이 선택된 설명 기법과 기저 예측 모델 아키텍처 모두에 의존함을 나타냅니다.
파이프라인에 통합된 설명 가능성 기법들은 정량적, 정성적 성과를 평가했습니다. 구체적으로, 특징 귀속 방법은 서로 다른 데이터 세트에서 모델 내부 논리를 일관되게 밝혀내는 데 성공했습니다.
연구에서 고려된 모든 방법인 SHAP은 평가된 설명 가능성 방법 중 가장 높은 충실도(0.92)와 안정성(0.89)을 달성했습니다. 간단히 말해, 설명들은 모델이 실제로 예측한 바를 매우 정확하게 반영한 것이었습니다. 국소 설명 방법은 특정 예측을 보고 모델이 의사결정의 근거로 사용한 내용을 이해할 수 있는 일종의 창입니다.
해석 가능성 수행은 인간 중심 평가에서 얻은 충실도, 안정성, 이해 가능성, 임상가 신뢰 점수를 사용하여 평가하였습니다. SHAP, LIME, Grad-CAM 설명을 동일한 데이터셋과 학습된 모델을 사용해 비교하였습니다. 설명 가능성의 향상은 평가된 설명 능력 방법 간 설명 품질 지표와 임상가 평가를 통해 평가하였다. 이미지와 관련된 딥러닝 모델의 시각화 기법은 본질적으로 히트맵을 생성하는데, 이는 모델 예측과 가장 관련 있는 이미지 영역을 식별합니다. 특징 중요도 분포와 다양한 방법 간 설명 가능성 성능 비교는 그림 5에 나와 있습니다.

그림 5: 설명 가능성 성과 평가.그림은 충실도와 안정성 지표를 활용한 설명 가능성 방법의 성능을 보여줍니다. SHAP은 충실도(0.92)와 안정성(0.89)에서 선두를 달리며, 이는 설명과 모델 예측 간의 좋은 일치를 반영합니다. LIME은 개별 예시의 해석 가능성에 가장 적합한 도구로 나옵니다. 반면, Grad-CAM은 주로 영상 모델에서 사용되는 시각적 열맵을 출력하여, 모델 예측에 가장 중요한 영역을 대략적으로 보여주는데, 이는 임상 관점에서 매우 관련성이 있을 수 있습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
해석 가능성에 대한 예측 모델과 기법을 평가한 결과, 모델의 정확성과 그 설명의 신뢰성 사이의 상관관계가 매우 강하다는 것이 밝혀졌습니다. 실제로 예측 개선을 보여준 동일한 모델들이 해석 가능성 기법이 제대로 적용되었을 때 결과를 더 안정적이고 일관되게 설명하고 있었습니다. 앙상블 모델은 특징 귀속 기법과 함께 있을 때 가장 해석 가능했으며, 딥러닝 모델은 시각화 기반의 설명 가능한 방법이 더 잘 활용되었습니다. 예측의 정확성과 설명의 신뢰성을 연결하는 연관성은 모델 및 설명 가능성 간의 개념적 역학을 상세히 설명한 그림 6 에서 확인할 수 있습니다.

그림 6: 모델의 비교 분석 및 능력 설명 방법.이 차트는 다양한 모델의 정확도와 능력 측정치를 상세히 비교한 내용을 보여줍니다. 정확도와 설명 안정성 간의 상관관계를 나타내는 산점도, 성과의 표 비교, 그리고 SHAP, LIME, Grad-CAM의 다양한 설명 능력 방법과 이들의 다양한 모델 유형에서의 효과를 설명한 적합성 행렬로 구성되어 있습니다. 시각적 자료는 앙상블 모델과 SHAP이 뛰어난 해석 가능성을 제공하는 반면, 딥러닝 모델은 시각화 기법으로 설명 가능함을 명확히 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
인간 중심 평가는 제안된 시스템이 병원 및 기타 임상 시설에서 실제로 유용함을 확인했습니다. 의료 전문가들은 설명 유무에 따라 모델 출력을 검토했습니다. 설명과 함께 결과를 보여주면 사용자 신뢰도와 해석 가능성이 크게 향상되었습니다; 평균 신탁 가치는 1에서 5 척도에서 3.1에서 4.7로 상승했습니다. 신뢰 점수가 3.1에서 4.7로 상승한 것은 대략 51.6%의 상대적 향상을 의미합니다. 상당한 평가자 간 합의(Fleiss' κ = 0.81)는 설명 유용성에 대한 임상의의 일관된 평가를 더욱 보여준다. 이러한 발견은 설명 가능성 산출물이 사용자 신뢰를 높이고 AI 지원 임상 의사결정 해석을 용이하게 할 수 있음을 시사합니다. 전문가들은 모델 결과에 대한 이해가 더 높고 임상 상황에 대한 AI 지원 판단에 대한 신뢰도가 높아졌다고 밝혔으며, 이는 실제 의료 구현에서 해석 가능성의 중요성을 시사합니다.
또한 절제 분석을 통해 프레임워크의 견고성을 확인했습니다. 설명 가능성 방법을 통해 필수적이라고 판단된 중요한 특징들을 제거하면 예측 성능이 크게 저하되었습니다. 따라서 이 발견은 특징들이 예측 과제에 관련성뿐만 아니라 중요한 의미를 가졌음을 반영합니다. 또한, 서로 다른 입력 샘플을 설명할 때 설명 결과는 무시할 만한 차이만 나타났으며, 이는 설명 가능성 방법의 안정성과 신뢰성을 보여줍니다.
파이프라인의 실용적 사용 가능성을 확인하기 위해 계산 속도를 측정했습니다. 설명 가능성 기법의 도입으로 인해 특히 특징 귀속과 시각화 생성 시 계산 시간이 다소 늘어났습니다. 그럼에도 불구하고 총 실행 시간은 여전히 가능했고 너무 길지 않았다. 그림 7 은 파이프라인의 여러 단계(예: 전처리, 모델 학습, 설명 가능성 생성, 평가, 시각화 등) 간에 계산 시간이 어떻게 분배되는지를 보여줍니다.

그림 7: 파이프라인 실행 시간 내역. 이 차트는 계산 시간이 설명 가능한 AI 파이프라인의 여러 단계(예: 전처리, 모델 훈련, 능력 생성, 평가, 시각화 등)에 어떻게 분배되는지 보여줍니다. 데이터는 대부분의 시간 동안 모델 학습에 할당되며, 그 다음에 기술 처리 과정이 이어진다는 것을 보여줍니다. 반면, 사전 처리와 보고에 소요되는 시간은 매우 적습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
또한 소작 분석을 통해 제안된 프레임워크의 강도를 테스트했습니다. 설명 가능성 방법으로 발견된 필수 특징들을 제거하면, 예측 성과가 명확히 감소했는데, 이는 해당 특징들이 단순히 관련성이 있을 뿐만 아니라 매우 중요하다는 명확한 신호입니다. 그 외에도, 입력 샘플에 약간의 변화가 있어도 설명 출력은 꽤 안정적이었는데, 이는 설명 가능성 기법의 일관성과 신뢰성을 입증합니다.
요약하자면, 예측 성과 측정, 설명 가능성, 인간 중심 검증 측정을 결합하여 제안된 프레임워크가 효과적임이 입증되었습니다. 이 시스템은 매우 정확한 예측을 제공할 뿐만 아니라 해석 가능성도 높고 사용이 용이했습니다. 설명 가능성 기법을 도입함으로써 전체 과정을 투명하게 만들었고, 모델 성능에는 영향을 주지 않았습니다. 예측 정확도와 해석 가능성의 향상은 엄격한 실험 통제 하에 이루어졌을 뿐만 아니라, 통계적으로 유의미했는데, 이는 제안된 방법의 지속성과 신뢰성을 보여줍니다. 예측 모델 간 쌍별 비교는 교차 검증 접합 간 쌍 t-검정을 사용하여 수행되었습니다. 그라디언트 부스팅과 경쟁 모델 간에 통계적으로 유의미한 차이가 관찰되었으며(p < 0.05), 제안된 구성의 우수성을 확인했습니다.
전체 결과.
종합적으로 결과들은 예측 수행, 설명의 질, 임상의의 신뢰를 통합되고 재현 가능한 워크플로우 내에서 평가할 수 있음을 보여줍니다. 이 프레임워크는 여러 의료 데이터셋에서 일관된 성능을 유지하면서도 SHAP, LIME, Grad-CAM 설명을 통한 투명한 해석을 지원했습니다. 그러나 결과는 선택된 데이터셋과 검증 설정의 맥락 내에서 해석되어야 하며, 실제 배포 전에 추가 외부 검증이 필요합니다.
데이터 가용성:
우리는 현재 연구에 사용된 데이터셋을 공개 출처에서 확보했으며, 잘 알려진 데이터 저장소에서 찾아볼 수 있습니다. 예를 들어, 유방암과 당뇨병 관련 데이터는 UCI 머신러닝 저장소에서 다운로드할 수 있습니다: https://archive.ics.uci.edu/ml/index.php
전자 건강 기록 데이터셋(MIMIC-III)은 Physio Net을 통해 다음 사이트에서 확인할 수 있습니다:
https://physionet.org/content/mimiciii/1.4/
흉부 X선 영상 데이터는 NIH 흉부 X선 데이터셋에서 수집되었으며, 다음 지역에서 확인할 수 있습니다: https://www.kaggle.com/datasets/nih-chest-xrays/data
이 연구에서 탐구한 모든 데이터셋은 익명화되어 공개되어 있습니다. 연구 중 생성된 전처리 단계, 학습된 모델, 설명 능력 출력은 합리적인 요청이 있을 경우 교신저자를 통해 제공됩니다. 소스 코드, 전처리 스크립트, 구성 파일, 재현 가능 자원은 원고 승인 시 공개 저장소에 보관됩니다.
이 연구는 예측 모델링, 설명 가능성 평가, 임상가 중심 평가, 재현 자원을 단일 프로토콜 내에 통합한 의료 분석을 위한 재현 가능한 설명 가능한 인공지능(XAI) 워크플로우를 개발하고 평가했습니다. 결과는 앙상블 기반 머신러닝 모델, 특히 그라디언트 부스팅과 랜덤 포레스트가 평가된 구조화된 의료 데이터셋에서 가장 높은 예측 성능을 보였으며, 딥러닝 모델이 이미지 기반 분석에 더 적합함을 보여주었습니다. 이러한 발견은 더 복잡한 모델이 항상 우수한 성능을 낼 것이라고 가정하기보다는 데이터 특성에 따라 모델 아키텍처를 선택하는 것의 중요성을 강조합니다. 이 연구의 핵심 기여는 예측 모델링, 설명 가능성 평가, 인간 중심 평가, 재현성 관행을 표준화된 워크플로우 내에 통합한 것입니다. 설명 가능성 기법을 고립적으로 평가하는 연구와 달리, 제안된 프레임워크는 다양한 의료 데이터셋에서 투명하고 재현 가능한 실험을 지원하는 프로토콜 기반 방법론을 제공합니다.
설명 가능성 분석 결과, 평가된 방법 간에 측정 가능한 차이가 있음을 보여주었습니다. SHAP은 평가된 실험 조건 내에서 가장 높은 충실도와 안정성 점수를 달성했으며, 생성된 설명과 모델 예측 간의 유사성을 나타냈습니다. LIME은 유용한 국소적 설명을 제공했으나 안정성이 낮았고, Grad-CAM은 영상 데이터에 대한 직관적인 시각적 설명을 생성했습니다. 이러한 발견은 설명의 질이 선택된 설명 가능성 방법과 기저 예측 모델 모두에 달려 있음을 시사합니다. 인간 중심 평가는 설명의 포함이 임상의의 신뢰와 해석 가능성을 향상시킨다는 점을 추가로 입증했습니다. 신뢰 점수 증가와 평가자 간 상당한 일치(Fleiss' κ = 0.81)는 참가자 간 설명 유용성 평가가 일관되었음을 나타냅니다. 이러한 발견은 의료 의사결정 지원 시스템에서 투명성과 사용자 수용을 개선하는 데 있어 설명 가능성 방법의 잠재적 가치를 지지합니다.
결과를 해석할 때 여러 가지 제한 사항을 고려해야 합니다. 첫째, 이 프레임워크는 공개된 제한된 데이터셋을 사용해 평가되었으며, 실제 임상 환경에서 마주치는 변동성을 완전히 반영하지 못할 수 있습니다. 둘째, 임상가 평가는 비교적 적은 참가자 집단을 대상으로 하여 일반화 가능성을 제한할 수 있습니다. 셋째, 본 연구에서 조사된 설명 가능성 방법은 사후 기법에 불과하며, 따라서 교란에 대한 민감성 및 설명과 진정한 모델 추론 간의 잠재적 불일치 등 알려진 한계에 노출되어 있습니다. 마지막으로, 독립 의료 기관 간 외부 검증은 본 연구의 범위를 벗어났습니다.
향후 연구에서는 임상 기록, 의료 영상, 생리 신호, 웨어러블 센서 데이터를 통합한 다중 모달 의료 분석을 탐구해야 합니다. 인과적 및 반사실적 설명 방법, 불확실성 정량화, 공정성 평가, 교정 분석, 그리고 전향적 임상 검증을 평가하기 위한 추가 연구가 필요합니다. 이러한 연구들은 의료 분야에서 설명 가능한 AI 시스템의 투명성, 신뢰성, 적용성을 더욱 향상시킬 수 있습니다.
성능 평가 외에도, 제안된 설명 가능한 AI 프레임워크가 다양한 의료 환경에서 견고하게 배포되도록 여러 실질적인 구현 과제와 프로토콜 수정이 고려되어야 합니다.
설명 가능성 방법의 한계
SHAP, LIME, Grad-CAM은 모델 행동에 관한 유용한 통찰을 제공하지만, 몇 가지 단점도 가지고 있습니다. 문헌에서는 이러한 도구들이 반복 실행 시 불안정할 수 있고, 섭동에 매우 민감하며, 데이터셋마다 다르고, 때로는 모델의 실제 이유를 정확히 반영하지 못할 수 있다는 점이 지적되어 있습니다. 따라서 사후 설명은 보충적 증거로만 보고되어야 하며, 인과 결정 메커니즘의 실제 묘사는 아니다. 설명의 신뢰성을 적절히 검증하는 것은 여전히 매우 중요한 단계이며, 이는 매우 영향력 있는 임상 환경에서 사용되기 전의 필수 단계입니다.
이는 최근 생의학 AI 연구의 결과와도 일치하는데, 임상 현장에서 신뢰성 검증을 도입하기 전에 설명의 필요성을 강조한 결과이기도 합니다. 설명 가능성의 도입은 심장마비 예측 시스템에서 검증의 핵심 요소로 사용되어 더 투명해지고 임상 예측의 신뢰를 얻기 위해 사용되었습니다41. 마찬가지로, 시각화 기반 설명 기법을 이용한 간 초음파 영상 분할은 사후 설명이 제한적이라는 사실을 무시하면서도 해석 가능성을 높이는 것을 목표로 했습니다. 이 논문들은 설명 일관성 검사, 설명 강건성 검사, 임상적으로 의미 있는 설명 가능성 검증이 임상 사용 준비 수준 최고 수준에 도달하기 위해 필요함을 확인한다42.
보정, 공정성, 견고성 및 외부 일반화
제안된 프레임워크의 향후 버전에는 보정 곡선과 브라이어 점수를 이용한 확률 보정 평가, 베이지안 및 앙상블 기반 방법을 이용한 불확실성 추정, 인구통계학적 하위 그룹의 공정성 감사, 잡음이 있는 데이터와 변화하는 도메인 조건 하에서의 강건성 검사가 포함될 것입니다. 이러한 분석은 모델 신뢰도, 공정한 성과, 변화하는 임상 환경 하에서의 신뢰성이 환자 안전과 임상 채택에 직접적인 영향을 미치는 의료 환경에서 특히 중요합니다. 최근 AI 기반 과학 프레임워크도 기존의 예측 성과 평가를 넘어 신뢰할 수 있고 투명하며 신뢰할 수 있는 의사결정 지원 시스템의 중요성을 강조했습니다. 최근 AI 기반 과학 프레임워크들도 기존의 예측 성과 평가를 넘어 신뢰할 수 있고 투명하며 신뢰할 수 있는 의사결정 지원 시스템의 중요성을 강조했습니다 43.
문제 해결 및 프로토콜 수정
제안된 설명 가능한 AI 프레임워크의 성공적인 도입을 위해서는 여러 실질적인 점들이 고려해야 합니다. 일반적인 문제는 예를 들어 비교적 작은 의료 데이터셋에서 딥러닝 모델을 학습할 때 과적합(overfiting)입니다. 교차 검증, 조기 정지, 드롭아웃 정규화, 데이터 증강, 철저한 하이퍼파라미터 최적화를 적용하여 과적합을 줄일 수 있습니다. 훈련 중 검증 성능을 관찰하는 것은 매우 복잡한 모델을 피하는 좋은 방법입니다.
의료 데이터셋에서 또 다른 매우 중요한 문제는 클래스 불균형, 즉 긍정적인 임상 결과가 부정적 사례보다 훨씬 드물다는 점입니다. 이 문제를 해결하기 위해 계층화된 표본추출, 클래스 가중치 조정, 합성 소수자 과잉표본, F1 점수 및 ROC-AUC와 같은 균형 평가 지표 사용이 모델링 파이프라인에 포함되어야 합니다. 계급 불균형을 무시하면 모델을 진정으로 대표하지 못하는 성과 지표나 편향된 임상 예측이 발생할 위험이 있습니다.
의료 영상 데이터셋은 일반적으로 완벽하지 않으며, 노이즈, 획득 아티팩트, 일관성 없는 품질 등으로 인해 손상될 수 있습니다. 이러한 요소들은 영상 장비의 종류에 따라 다릅니다. 이러한 요인들은 예측 성과에 부정적인 영향을 미칠 수 있으며, 설명 가능성 산출에도 영향을 미칠 수 있습니다. 따라서 모델의 견고성과 신뢰성을 달성하기 위해 표준화된 전처리 단계, 이미지 정규화, 품질 관리 검사, 데이터 보강 기법을 적용해야 합니다.
SHAP은 매우 유익한 특징 귀속 설명을 추론할 수 있게 합니다. 하지만 불안정성의 발생은 무시할 수 없으며, 특히 상관관계가 높은 특징이 존재하거나 모델 결과가 입력 데이터의 미세한 변화에 매우 민감할 때 더욱 그렇습니다. 설명의 일관성과 신뢰성을 높이기 위해 설명을 여러 번 작성하고, 여러 실행 시 안정성을 평가하며, 특징 그룹 전략을 사용하고, LIME과 같은 다른 설명 가능성 방법과 비교하는 것이 권장됩니다.
대규모 의료 데이터와 거대한 심층 신경망 아키텍처에 관해서는, GPU 메모리 한계가 주요 제약 중 하나가 될 수 있습니다. 배치 크기 변경, 혼합 정밀 훈련, 모델 가지치기, 특징 차원 감소, 효율적인 데이터 로딩 도입을 통해 메모리 요구량을 크게 줄일 수 있습니다. 또한, 저자원 시스템에 프레임워크를 배포하는 연구자들은 클라우드 컴퓨팅 환경이나 분산 학습 사용을 고려할 수 있습니다.
제안된 프레임워크의 모듈식 설계는 다양한 의료 응용 분야에 대해 쉽게 변경할 수 있도록 합니다. 임상 과제에 따라 과학자들은 하나 이상의 개별 예측 모델을 변경하거나, 새로운 설명 방법을 추가하거나, 다양한 유형의 의료 데이터를 함께 사용하거나, 전체 워크플로우를 변경하지 않고도 불확실성 정량화 및 보정 모듈을 포함할 수 있습니다. 이러한 유연성 덕분에 프레임워크는 매우 다양한 의료 분석 사례에서 사용할 수 있으면서도 재현 가능하고 해석 가능하도록 돕습니다.
규제 및 윤리적 고려사항:
AI 시스템을 더 이해하기 쉽게 만드는 것은 의료 분야에서 큰 도움이 될 수 있습니다. 하지만 그것만으로는 충분하지 않습니다. 투명성, 책임성, 프라이버시, 환자 안전을 요구하는 규제 당국 규칙은 반드시 이행되어야 합니다. 설명 가능성이 신뢰와 해석 가능성을 높일 수 있지만, 그것만으로는 임상적 타당성을 보장할 수 없습니다. 책임 있는 실행에는 전향적인 임상 검증, 공정성 평가, 규제 검토, 배포 후 모니터링이 필요합니다. 또한, 향후 프레임워크를 도입할 때 환자 기밀유지, 임상의 감독, 인구통계학적 그룹 간 공평한 성과도 고려해야 합니다. 실제 임상 워크플로우에 통합되려면 AI 시스템과 의료 전문가가 문제 없이 상호작용해야 합니다. 따라서 설명 가능성 정보는 현재의 전자 건강 기록 및 임상 의사결정 지원 플랫폼의 일부가 되어야 하며, 독립적으로 작동하는 별도의 도구가 되어서는 안 됩니다. 궁극적인 선택은 의사들이 내려야 하며, 설명 가능한 AI는 투명성을 높이고 근거 기반 추론을 뒷받침하며 의료진과 환자 간의 소통을 용이하게 하는 보조 기술에 불과합니다.
이 글은 의료 분석 분야에서 설명 가능한 인공지능 시스템을 개발, 평가 및 해석하기 위한 재현 가능한 프로토콜을 제시합니다. 이 기여는 방법론적이고 워크플로우 지향적이며, 연구자와 임상의에게 여러 의료 응용 분야에서 복제, 조정 및 확장이 가능한 표준화된 프레임워크를 제공합니다. 데이터 전처리, 예측 모델링, 설명 가능성 방법, 성능 평가 등 다양한 측면을 하나의 통합된 방식으로 결합합니다. 이 방법론은 여러 의료 데이터셋에서 강력한 예측 성능을 입증했습니다. 구조화된 데이터 분석에서는 모델 앙상블이 가장 우수한 성능을 보이고, 딥러닝 모델은 의료 영상 작업에 매우 효과적인 것으로 나타났습니다. 더불어, 설명 기법을 사용하면 예측 결과에 대한 전역 및 국소적 해석을 모두 제공하여 사용자가 모델을 더 쉽게 이해할 수 있습니다. 따라서 임상의의 신뢰를 높일 뿐만 아니라 모델의 사용성도 향상시킵니다. 연구 결과는 설명 가능한 AI가 투명하고 해석 가능한 의료 분석 시스템 개발을 지원할 수 있음을 시사하며, 신뢰성 있고 신뢰할 수 있는 의료 분석에 필수적인 모델의 정확성과 해석 가능성 사이의 타협점을 찾을 수 있습니다. 따라서 여기서 제시된 방법은 의료 데이터 분석에 매우 효과적이고 직관적인 도구로, 의료 전문가들이 신뢰하는 AI 기술을 활용하는 데 도움을 줍니다. 이 글은 의료 분석에서 설명 가능한 인공지능 모델을 개발, 평가 및 해석하기 위한 재현 가능한 프로토콜을 제시합니다. 데이터 전처리, 예측 모델링, 설명 가능성 평가, 임상가 중심 평가, 재현성 자원을 통합된 워크플로우 내에 통합함으로써, 프로토콜은 투명한 의료 AI 연구를 위한 실질적인 틀을 제공합니다. 워크플로우는 다양한 의료 데이터셋과 응용 분야에 맞게 조정할 수 있으며, 설명 가능한 머신러닝 시스템의 재현 가능한 구현, 평가 및 보고를 지원합니다.
저자들은 이 작업과 관련된 상충하는 재정적 이해관계나 이해 충돌이 없음을 선언합니다. 이 연구는 잠재적 이해 충돌로 해석될 수 있는 상업적 또는 금융적 관계 없이 독립적으로 수행되었습니다.
인공지능 사용 공개
인공지능 도구는 언어 개선, 문법 검사, 원고 준비 중 편집 지원에 사용되었습니다. 모든 과학적 내용, 실험 설계, 데이터 분석, 해석, 최종 원고 검증은 저자들이 수행하였습니다. 저자들은 모든 AI 지원 산출물을 검토하고 검증하여 정확성, 무결성, 저널 가이드라인 준수를 보장했습니다.
저자들은 이 연구를 수행하는 데 필요한 인프라와 연구 지원을 제공해 준 각 기관에 감사의 뜻을 전합니다. 저자들은 또한 제안된 설명 가능한 AI 프레임워크의 개발과 평가를 용이하게 한 공개 데이터셋과 오픈소스 도구의 사용을 인정합니다. 인간 중심 평가 단계에서 귀중한 통찰을 제공해 준 도메인 전문가분들께 특별한 감사를 전합니다.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| GPU 워크스테이션 | 제조업체 종속 | NA | 딥러닝 모델 훈련 |
| Jupyter Notebook | Project Jupyter | 최신 안정 릴리즈 | 대화형 실험 실행 |
| LIME | LIME | 버전 0.2.0 | 로컬 해석 가능한 설명 |
| Matplotlib | Matplotlib 프로젝트 | 버전 3.9 | 데이터 시각화 |
| MIMIC-III 데이터베이스 | PhysioNet | 버전 1.4 | 전자 건강 기록 분석 |
| NIH 가슴 X-ray 데이터셋 | NIH Clinical Center | 공개 데이터셋 | 흉부 질환 분류 |
| NumPy | NumPy 개발자 | 버전 1.26 | 수치 계산 및 배열 작업 |
| OpenCV | OpenCV 재단 | 버전 4.10 | 이미지 사전 처리 |
| Pandas | Pandas 개발팀 | 버전 2.1 | 데이터 조작 및 사전 처리 |
| Pima Indians 당뇨병 데이터셋 | UCI 머신 러닝 저장소 | 공개 데이터셋 | 당뇨병 위험 예측 |
| Python 3.11 | Python 소프트웨어 재단 | 버전 3.11 | 기본 프로그래밍 환경 |
| Scikit-learn | scikit-learn | 버전 1.5 | 머신러닝 알고리즘 및 평가 |
| Seaborn | Seaborn | 버전 0.13 | 통계 시각화 |
| SHAP | SHAP | 버전 0.46 | 특징 기여 및 설명 가능성 |
| TensorFlow | TensorFlow | 버전 2.15 | 딥러닝 모델 개발 |
| Windows / Ubuntu Linux | Microsoft / Canonical | NA | 운영 체제 |
| Wisconsin 유방암 데이터셋 | UCI 머신 러닝 저장소 | 공개 데이터셋 | 유방암 진단 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청