여기서는 의료 분석을 위한 설명 가능한 인공지능 모델을 개발하고 평가하기 위한 재현 가능한 프로토콜을 제시합니다. 이 워크플로우는 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM 기반 설명 가능성, 정량적 평가, 인간 중심 검증을 통합하여 투명하고 신뢰할 수 있는 임상 의사결정을 지원합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
여기서는 의료 분석을 위한 설명 가능한 인공지능 모델을 개발하고 평가하기 위한 재현 가능한 프로토콜을 제시합니다. 이 워크플로우는 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM 기반 설명 가능성, 정량적 평가, 인간 중심 검증을 통합하여 투명하고 신뢰할 수 있는 임상 의사결정을 지원합니다.
설명 가능한 인공지능(XAI)은 투명성과 의사결정 설명 능력이 임상 의사결정의 필수 요소인 신뢰할 수 있는 AI 시스템 구축에 필수적인 도구로 점점 더 인정받고 있습니다. 이 출판물은 의료 분석을 위한 설명 가능한 AI 시스템 개발 및 평가를 위한 재현 가능한 실험적 접근법을 제시합니다. 개발된 파이프라인은 데이터 전처리, 예측 모델링, 해석 생성, 평가 단계를 하나의 원활한 워크플로우로 통합하여 구조화된 임상 데이터와 의료 영상 데이터셋 모두에 적용할 수 있습니다. 앙상블 머신러닝 모델은 구조화된 표 형식 데이터셋에서 강력한 예측 성능을 보여주었으며, 딥러닝 모델은 의료 영상 데이터의 복잡한 패턴을 학습하는 데 효과적입니다. SHAP, LIME, Grad-CAM과 같은 기법들은 모델 해석을 용이하게 하는 전역 및 국소적 설명입니다. 정말 도움이 많이 됐어요. 프레임워크의 정량적 평가는 정확성, 정밀도, 회상률, F1 점수, ROC-AUC, 설명 지표, 충실도, 안정성 등 다양한 지표를 아우릅니다. 결과는 실험 조건이 통제되었을 때, 프레임워크가 평가된 실험 조건 하에서 예측 성능과 설명 품질이 향상되었음을 보여줍니다. 프로토콜에 의해 이끄는 문서로서, 이 작업은 재현성과 확장성, 그리고 다른 생명체에 의한 지속적인 구현을 뒷받침합니다. 이 투명하고 이해하기 쉬운 AI 모델은 임상 의사결정 지원과 의료 분석 시스템이 대규모로 신뢰와 활용을 얻는 기반이 됩니다.
인공지능(AI)은 질병 진단, 예후, 위험 계층화, 의료 영상 분석 및 임상 의사결정을 지원함으로써 현대 의료의 중요한 구성 요소가 되었습니다. 머신러닝과 딥러닝의 발전으로 의료 시스템은 대량의 구조화 및 비구조화 데이터를 처리할 수 있게 되었으며, 종종 기존 통계 접근법과 동등하거나 그 이상으로 예측 성능을 달성할 수 있게 되었습니다2. 이러한 발전에도 불구하고, 많은 AI 모델은 복잡한 블랙박스 시스템처럼 작동하여 임상의와 의료 이해관계자가 예측이 어떻게 생성되는지 이해하기 어렵습니다. 이러한 투명성 부족은 고위험 의료 환경에서 신뢰, 채택, 책임성을 제한할 수 있습니다 4,5.
설명 가능한 인공지능(XAI)은 머신러닝 모델의 투명성과 해석 가능성을 향상시키는 유망한 접근법으로 떠올랐습니다6. SHAP(Shapley 가산 설명), LIME(국소 해석 가능한 모델 무관적 설명), 그리고 구배 가중 클래스 활성화 매핑(Grad-CAM) 등 널리 사용되는 설명 기법들은 특징 귀속과 시각적 설명 메커니즘 7,8,9를 통해 모델 행동에 대한 통찰을 제공합니다. 이러한 방법들은 임상 해석, 모델 감사, 의사결정 지원을 지원하는 의료 응용 분야에 점점 더 많이 적용되고 있습니다10,11. 하지만 설명 가능성만으로는 신뢰성, 재현성, 임상적 유용성을 보장하지 않습니다. 최근 연구들은 설명 불안정성, 교란에 대한 민감성, 임상의의 검증 부족, 설명 출력과 진정한 모델 추론 간의 불일치 등과 관련된 도전 과제를 강조했습니다 12,13,14,15.
설명 가능성 문제 외에도, 재현성은 의료 머신러닝 연구에서 여전히 중요한 관심사로 남아 있습니다16, 17, 18. 많은 연구들은 전처리 절차, 소프트웨어 환경, 하이퍼파라미터 구성, 검증 전략, 구현 워크플로우에 관한 제한된 정보를 제공하여 독립 복제가 어렵습니다19, 20, 21. 더불어, 의료 AI 연구는 예측 성과에 초점을 맞추는 경우가 많지만, 설명 품질 평가, 임상가 중심 평가, 실질적 실행 고려사항에 관한 제한적인 지침을 제공합니다22. 이러한 한계는 설명 가능한 AI 시스템을 연구 환경에서 실제 의료 환경으로 전환하는 데 장애물이 될 수 있습니다 23,24,25,26,27.
현재 의료 XAI 워크플로우는 개별 설명 기법이나 예측 모델을 개별적으로 평가하며, 데이터 준비, 예측 모델링, 설명 가능성 평가, 인간 중심 평가, 재현성 자원을 통합한 표준화된 프로토콜을 거의 제공하지 않습니다. 28,29,30,31. 따라서 연구자와 실무자는 워크플로우를 재현하거나, 설명 방법 비교하거나, 다양한 의료 데이터셋과 응용 분야에서 설명 가능한 AI 시스템의 실용성을 평가하는 데 어려움을 겪을 수 있습니다. 따라서 의료 설명 가능한 AI 워크플로우의 일관된 구현, 평가 및 보고를 촉진하기 위해 포괄적이고 재현 가능한 프로토콜이 필요합니다 32,33,34,35.
여기서는 의료 분석 분야에서 설명 가능한 인공지능 시스템을 개발, 평가 및 해석하기 위한 재현 가능한 프로토콜을 제시합니다. 프로토콜은 데이터 전처리, 예측 모델링, SHAP, LIME, Grad-CAM을 이용한 설명 가능성 평가, 임상 중심 평가, 검증 절차, 재현성 자원을 통합된 워크플로우 내에 통합합니다. 목표는 투명한 모델 개발, 설명 품질 평가, 그리고 다양한 의료 데이터셋 36,37,38,39에서 재현 가능한 구현을 지원하는 표준화된 프레임워크를 제공하는 것입니다. 이 연구의 방법론적 기여는 예측 분석, 설명 가능성 평가, 임상의사 검증, 재현성 관행을 의료 AI 연구, 교육 및 배포 지향 연구에 적합한 단일 프로토콜로 통합한 데 있습니다 40,41,42,43.
이 연구의 주요 기여는 새로운 설명 가능성 알고리즘의 개발이 아닙니다.
오히려 예측 모델링, 설명 가능성 평가, 시각화, 평가, 인간 중심 해석을 통합하여 의료 분석 및 JoVE 기반 프로토콜 배포에 적합한 통합 워크플로우로 통합한 표준화되고 재현 가능하며 실험적으로 검증된 프로토콜을 제공합니다. 이 연구의 주요 목적은 새로운 예측 알고리즘을 도입하는 것이 아니라, 의료 분석에서 설명 가능한 인공지능 워크플로우를 구현하기 위한 표준화되고 재현 가능하며 실험적으로 검증된 프로토콜을 제공하는 것입니다. 프로토콜은 데이터 전처리, 예측 모델링, 설명 가능성 평가, 임상가 중심 평가, 재현성 자원을 통합하여 채택, 재현, 교육 배포에 적합한 통합 프레임워크를 만듭니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구에 사용된 모든 데이터셋은 UCI 머신러닝 저장소, PhysioNet MIMIC-III 데이터베이스, NIH 흉부 X선 데이터셋 등 공개 및 완전 익명화된 저장소에서 수집되었습니다. 식별 가능한 환자 정보는 접근되지 않았습니다. 이 연구는 공개된 익명성 해제 데이터의 2차 분석에 대한 기관 연구 윤리 지침을 준수하였습니다. 인간 참여자가 직접 모집되지 않았고 보호 건강 정보가 사용되지 않았기 때문에 공식 기관심의위원회(JB) 승인이 필요하지 않았습니다.
1. 실험 프레임워크 개요
2. 계산 환경 및 시스템 구성
| 구성 요소 | 매개변수 | 가치 | 설명 |
| 랜덤 포레스트 | n_estimators | 100 | 나무 수 |
| 랜덤 포레스트 | max_depth | 전혀 없습니다 | 나무 깊이 |
| XGBoost | learning_rate | 0.01 | 학습 속도 |
| XGBoost | n_estimators | 100 | 부스터 탄환 |
| CNN | 시대 | 25 | 훈련 시기 |
| CNN | batch_size | 32 | 배치 크기 |
| CNN | 옵티마이저 | 아담 | 최적화 알고리즘 |
| MLP | hidden_layers | 2 | 숨겨진 층의 수 |
| MLP | 활성화 | ReLU | 활성화 함수 |
| 일반 | train_split | 70% | 학습 데이터 비율 |
| 일반 | validation_split | 15% | 검증 비율 |
| 일반 | test_split | 15% | 검사 비율 |
표 1: 구현 세부사항 및 하이퍼파라미터 구성.
이 표는 제안된 설명 가능한 AI 프레임워크의 실험 평가 전반에 걸쳐 사용되는 계산 환경, 소프트웨어 라이브러리, 머신러닝 및 딥러닝 모델 구성, 최적화 설정, 학습률, 배치 크기, 학습 매개변수, 하이퍼파라미터 값을 요약합니다.
3. 데이터셋 준비 및 전처리
| 데이터셋 | 유형 | 샘플 | 특징 | 목표 |
| 유방암 | 표 형식 | 569 | 30 | 양성/악성 |
| 당뇨병 | 표 형식 | 768 | 8 | 당뇨병 결과 |
| 미믹-III | 전자건강기록(EHR) | ~60,000 | 임상 변수 | 사망자 |
| 흉부 엑스레이 | 영상 | ~112,000 | 이미지 | 질병 라벨 |
표 2: 데이터셋 특성 및 의료 사용 사례.
이 표는 연구에 사용된 의료 데이터셋의 요약을 제공하며, 데이터셋 유형, 샘플 수, 특징 수, 대상 변수, 의료 응용 도메인 및 관련 임상 사용 사례를 포함합니다. 데이터셋은 구조화된 임상 기록, 전자 건강 기록, 의료 영상 데이터를 포함하여, 다양한 의료 분석 시나리오에서 프레임워크의 적용 가능성을 보여줍니다.
| 데이터셋 | 표본 크기 | 클래스 분포 | 분할 전략 | 누수 방지 | 하이퍼파라미터 탐색 | 교차 검증 | 외부 시험 |
| 유방암 (UCI 위스콘신) | 569 | 357 양성 / 212 악성 | 70/15/15 | 열차 전용 전처리 | 그리드 탐색 | 5겹 층화 CV | 독립 홀드아웃 집합 |
| 피마 인디언 당뇨병 | 768 | 비당뇨병 500명 / 당뇨병 268명 | 70/15/15 | 열차 전용 전처리 | 그리드 탐색 | 5겹 층화 CV | 독립 홀드아웃 집합 |
| 미믹-III EHR | 5274 | 결과 계층화 코호트 | 70/15/15 환자 수준 | 환자 수준 분리 | 랜덤 서치 | 5단계 환자 수준 CV | 독립 홀드아웃 집합 |
| NIH 흉부 엑스레이 | 112120 | 폐렴/정상 층화 | 70/15/15 | 이미지 수준 분리 | 랜덤 서치 | 5겹 층화 CV | 독립 홀드아웃 집합 |
표 3: 데이터셋 수준 검증 및 실험 설계.
이 표는 각 데이터셋에 사용되는 검증 방법론을 요약하는데, 여기에는 표본 크기, 클래스 분포, 훈련-검증-테스트 분할 전략, 누수 방지 절차, 하이퍼파라미터 최적화 방법, 교차 검증 설계, 외부 테스트 프로토콜 등이 포함됩니다. 이러한 조치들은 방법론적 엄격성, 재현성, 편향 없는 모델 평가를 보장하기 위해 시행되었습니다.

그림 1: 데이터 전처리 파이프라인 검증.
모델 개발 전에 수행된 주요 전처리 작업의 검증 결과. (A) 대표적인 의료 특징에 걸친 결핍 가치 분석. (B) 이상치 처리 전후의 수치 변수 분포. (C) 표준화를 이용한 기능 확장성 검증. (D) 범주 인코딩 검증. (E) 전처리 후 클래스 분포. (F) 트레인-검증-테스트 데이터 분할의 검증. 이 결과는 예측 모델링 및 설명 가능성 분석을 위한 데이터셋의 성공적인 전처리 및 준비를 확인시켜 줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
4. 설명 가능한 AI 프레임워크의 시스템 아키텍처

그림 2: 의료 분석을 위한 설명 가능한 AI 프레임워크의 시스템 아키텍처. 이 그림의 더 큰 버전을 보려면 여기를 클릭해 주세요.
5. 워크플로우 실행

그림 3: 설명 가능한 AI 파이프라인의 종단 간 워크플로우. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.
6. 모델 평가 및 설명 가능성 평가
7. 인간 중심 평가
| 매개변수 | 가치 |
| 전문가들 | 12 |
| 의사들 | 6 |
| 방사선과 전문의 | 3 |
| 임상 데이터 분석가 | 3 |
| 검토된 사건들 | 100 |
| 평가 설계 | 무작위 (예측 전용 vs 예측+설명) |
| 측량 기기 | 5점 리커트 척도 |
| 신탁 평가 | 해석 가능성, 신뢰도, 사용성 |
| 통계 검정 | 쌍 t-검정 (p 0.05) |
| 평가자 간 신뢰성 | 플라이스 카파 |
| 객관적 측정 | 결정 합의, 검토 시간 |
표 4: 인간 중심 평가 프로토콜 및 임상가 평가 설계.
이 표는 설명 가능한 AI 시스템의 해석 가능성, 신뢰성, 사용성을 평가하는 임상의 평가 프레임워크를 제시합니다. 참여자 인구통계, 사례 검토 방법론, 설문 설계, 통계 분석 절차, 평가자 간 신뢰도 평가 및 객관적 평가 지표에 관한 정보가 요약되어 있습니다.
8. 검증 및 재현성 평가
9. 재현성 자원
| 자료 | 설명 |
| 소스 코드 | 데이터 전처리, 모델 학습, 설명 가능성 및 평가를 위한 Python 구현 스크립트 |
| 환경 파일 | requirements.txt 패키지 의존성 및 버전을 포함함 |
| 구성 파일 | 모델 아키텍처 설정, 하이퍼파라미터 및 실험 구성 |
| 고정된 무작위 시드 | 재현 가능한 실험에 사용되는 씨앗 = 42 |
| 데이터셋 접근 지침 | 공공 의료 데이터셋 획득을 위한 링크 및 절차 |
| 전처리 스크립트 | 데이터 정제, 정규화, 인코딩 및 기능 선택을 위한 스크립트 |
| 피규어 생성 스크립트 | 모든 원고 도형을 재생하는 스크립트 |
| 테이블 생성 스크립트 | 보고된 표와 지표를 재현하는 스크립트 |
| 입력 예시 | 샘플 데이터셋 및 입력 파일 |
| 예제 출력 | 예측 결과, 설명 및 평가 보고서 |
표 5: 재현성 자원 및 실험 자산.
이 표는 실험적 재현성을 지원하기 위해 제공된 자원을 요약하는데, 여기에는 소스 코드, 전처리 스크립트, 구성 파일, 환경 사양, 데이터셋 접근 지침, 고정된 무작위 시드 설정, 그림 생성 스크립트, 보고된 결과를 재현하는 데 필요한 예시 입출력 파일 등이 포함됩니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
우리는 전체 파이프라인의 설명 AI 요소를 철저히 평가하여, 구조화된 임상 데이터와 의료 이미지 등 다양한 유형의 의료 데이터 전반에서 얼마나 잘 예측하는지 평가했습니다. 결과는 평가된 데이터셋 전반에 걸쳐 일관된 예측 성능을 나타냈습니다. 테스트 모델 중 구배 부스트 모델이 97.4%로 가장 높은 정확도를 기록했으며, 그 다음으로 무작위 숲 모델이 94.2%로 뒤를 이었습니다. 이미지 세트에 적용된 딥러닝 기법은 91.3%의 정확도를 달성한 반면, 다층 지각론 모델은 약간 낮은 90.8%의 결과를 냈습니다. 이는 앙상블 기반 머신러닝 모델이 구조화된 의료 데이터에서 가장 우수한 성능을 보이는 반면, 딥러닝 아키텍처는 영상 작업에 뛰어나다는 것을 시사합니다. 표 6은 정확도, 정밀도, 회상율, F1 점수 등 예측 함수의 다양한 성능 지표와 충실도와 안정성과 같은 설명 가능성 지표를 자세히 설명합니다. 우리는 5배 교차 검증을 적용하고 결과...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 예측 모델링, 설명 가능성 평가, 임상가 중심 평가, 재현 자원을 단일 프로토콜 내에 통합한 의료 분석을 위한 재현 가능한 설명 가능한 인공지능(XAI) 워크플로우를 개발하고 평가했습니다. 결과는 앙상블 기반 머신러닝 모델, 특히 그라디언트 부스팅과 랜덤 포레스트가 평가된 구조화된 의료 데이터셋에서 가장 높은 예측 성능을 보였으며, 딥러닝 모델이 이미지 기반 분석에 더 적합함을 보여주었습니다. 이러한 발견은 더 복잡한 모델이 항상 우수한 성능을 낼 것이라고 가정하기보다는 데이터 특성에 따라 모델 아키텍처를 선택하는 것의 중요성을 강조합니다. 이 연구의 핵심 기여는 예측 모델링, 설명 가능성 평가, 인간 중심 평가, 재현성 관행을 표준화된 워크플로우 내에 통합한 것입니다. 설명 가능성 기법을 고립적으로 평가하는 연구와 달리, 제안된 프레임워크는 다양한 의료 데이터셋에서 투명하고 재현 가능한 실험을 지원하는 프로토콜 기반 방법론을 제공합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이 작업과 관련된 상충하는 재정적 이해관계나 이해 충돌이 없음을 선언합니다. 이 연구는 잠재적 이해 충돌로 해석될 수 있는 상업적 또는 금융적 관계 없이 독립적으로 수행되었습니다.
인공지능 사용 공개
인공지능 도구는 언어 개선, 문법 검사, 원고 준비 중 편집 지원에 사용되었습니다. 모든 과학적 내용, 실험 설계, 데이터 분석, 해석, 최종 원고 검증은 저자들이 수행하였습니다. 저자들은 모든 AI 지원 산출물을 검토하고 검증하여 정확성, 무결성, 저널 가이드라인 준수를 보장했습니다.
저자들은 이 연구를 수행하는 데 필요한 인프라와 연구 지원을 제공해 준 각 기관에 감사의 뜻을 전합니다. 저자들은 또한 제안된 설명 가능한 AI 프레임워크의 개발과 평가를 용이하게 한 공개 데이터셋과 오픈소스 도구의 사용을 인정합니다. 인간 중심 평가 단계에서 귀중한 통찰을 제공해 준 도메인 전문가분들께 특별한 감사를 전합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| GPU 워크스테이션 | 제조업체 종속 | NA | 딥러닝 모델 훈련 |
| Jupyter Notebook | Project Jupyter | 최신 안정 릴리즈 | 대화형 실험 실행 |
| LIME | LIME | 버전 0.2.0 | 로컬 해석 가능한 설명 |
| Matplotlib | Matplotlib 프로젝트 | 버전 3.9 | 데이터 시각화 |
| MIMIC-III 데이터베이스 | PhysioNet | 버전 1.4 | 전자 건강 기록 분석 |
| NIH 가슴 X-ray 데이터셋 | NIH Clinical Center | 공개 데이터셋 | 흉부 질환 분류 |
| NumPy | NumPy 개발자 | 버전 1.26 | 수치 계산 및 배열 작업 |
| OpenCV | OpenCV 재단 | 버전 4.10 | 이미지 사전 처리 |
| Pandas | Pandas 개발팀 | 버전 2.1 | 데이터 조작 및 사전 처리 |
| Pima Indians 당뇨병 데이터셋 | UCI 머신 러닝 저장소 | 공개 데이터셋 | 당뇨병 위험 예측 |
| Python 3.11 | Python 소프트웨어 재단 | 버전 3.11 | 기본 프로그래밍 환경 |
| Scikit-learn | scikit-learn | 버전 1.5 | 머신러닝 알고리즘 및 평가 |
| Seaborn | Seaborn | 버전 0.13 | 통계 시각화 |
| SHAP | SHAP | 버전 0.46 | 특징 기여 및 설명 가능성 |
| TensorFlow | TensorFlow | 버전 2.15 | 딥러닝 모델 개발 |
| Windows / Ubuntu Linux | Microsoft / Canonical | NA | 운영 체제 |
| Wisconsin 유방암 데이터셋 | UCI 머신 러닝 저장소 | 공개 데이터셋 | 유방암 진단 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.