연구 논문

딥러닝을 이용한 피부 병변 분류를 위한 설명 가능한 컴퓨터 보조 프레임워크

60 조회수

DOI:

10.3791/72639

2026년 8월 25일

이 논문에서

요약

본 논문은 높은 진단 정확도와 모델 해석 가능성을 결합한 피부 병변 분류를 위한 설명 가능한 CNN 기반 프레임워크를 제시합니다. 이 프레임워크는 병변 이미지를 분류하고 예측에 대한 시각적 설명을 생성합니다. 연구 결과는 강력한 성능과 향상된 투명성을 보여주며, 이는 임상적 의사결정을 지원하고 피부과 전문의의 조기 피부 질환 발견을 돕습니다.

초록

피부 질환 진단을 위한 심층 합성곱 신경망(deep convolutional neural networks)의 활용은 여러 연구에서 피부과 전문의가 도달하는 수준과 유사한 정확도를 나타내는 것으로 입증되었습니다. 그럼에도 불구하고, 일부 사례에서의 성능 저하 및 부족한 일반화 능력과 더불어 블랙박스 모델 사용과 관련된 낮은 해석 가능성 등 여전히 많은 과제가 남아 있습니다. 이는 정확한 진단뿐만 아니라 설명 가능성이 요구되는 실제 구현에 큰 장애물이 되며, 이에 대한 해결책을 찾는 것이 필수적입니다. 이러한 어려움을 극복하기 위해, 본 연구에서는 피부 병변 분류를 위한 설명 가능한 딥러닝 프레임워크(EDLF-SLC)를 개발하였습니다. 이 프레임워크는 머신러닝과 설명 가능한 인공지능(XAI)의 다양한 접근 방식을 활용하여 3단계 방식으로 정확도와 해석 가능성을 모두 개선합니다. 첫 번째 단계에서는, RBF(radial basis function) 커널을 사용하는 SVM으로 분류하기 전, 서로 다른 네트워크 구조가 학습한 상호 보완적인 판별 정보를 보존하기 위해 여러 사전 학습된 CNN 아키텍처에서 추출한 심층 표현들을 융합합니다. 다음으로, RBF 커널을 갖춘 서포트 벡터 머신(SVM) 분류기를 사용하여 획득한 특징들을 분류합니다. 마지막으로, 모델이 내린 예측 결과는 LIME(local interpretable model-agnostic explanations)을 통해 해석됩니다. 실험 결과, EDLF-SLC는 정확도 88.0%, 정밀도 89.0%, 재현율 87.0%, F1 스코어 88.0%를 달성하였으며, 이는 본 연구의 실험 조건 하에서 최근 보고된 여러 방법들과 비교하여 경쟁력 있는 성능임을 보여줍니다.

서론

피부 병변은 양성 이상부터 피부암 중 가장 치명적인 형태인 흑색종과 같은 악성 암까지 다양하게 나타나기 때문에 피부과 및 종양학 분야에서 주요한 관심사입니다. 2020년 기준, 전 세계적으로 흑색종으로 인한 신규 사례는 약 325,000건이었으며 사망자는 57,000명 이상이었습니다1. 선별 검사와 치료 기술의 발전으로 환자의 예후가 개선되었음에도 불구하고, 진단 지연과 제한적인 의료 서비스 접근성은 특히 젊은 층에서 높은 사망률과 기대 수명 감소의 원인이 되고 있습니다2,3.

전통적인 진단은 주로 육안 검사와 더모스코피(dermoscopy)에 의존하므로, 그 과정이 임상의의 전문성에 좌우되며 주관성, 관찰자 간 변동성, 불필요한 생검 및 검사 시간 연장 등의 문제가 발생하기 쉽습니다4,5,6. 이러한 한계를 해결하기 위해 딥러닝, 특히 CNN이 자동 피부 병변 분류를 위한 효과적인 솔루션으로 등장했습니다. DDCNN-F7, YOLOv7-XAI8 및 기타 여러 아키텍처9,10,11,12,13를 포함한 CNN 기반 모델들은 변별력 있는 이미지 특징을 자동으로 학습함으로써 높은 진단 정확도를 입증해 왔습니다. 이러한 성공에도 불구하고 대부분의 딥러닝 모델은 "블랙박스" 형태로 작동하여 임상의의 신뢰를 제한하고 일상적인 의료 실무로의 도입을 저해합니다. 따라서 예측에 대한 시각적 설명을 제공함으로써 모델의 투명성을 향상시키기 위해 설명 가능한 인공지능 기술이 도입되었습니다. 이러한 방법들 중 Local Interpretable Model-Agnostic Explanations는 모델의 결정에 가장 큰 영향을 미치는 이미지 영역을 식별함으로써 해석 가능한 지역적 설명을 생성합니다14.

피부 병변 분류는 정확하고 신뢰할 수 있는 조기 피부암 진단의 필요성에 따라 전통적인 임상 평가에서 고급 AI 기반 진단 시스템으로 발전해 왔습니다. 이러한 진화는 전통적 진단 방법, 컴퓨터 보조 진단(CAD), 머신러닝(ML), 딥러닝(DL), 그리고 최근의 설명 가능한 AI(XAI) 및 연합 학습(FL)까지 총 5가지 주요 단계를 거쳤으며, 이는 기존 검사의 한계를 극복하고 진단 정확도, 일관성, 확장성 및 임상적 신뢰도를 향상시키려는 지속적인 노력의 결과입니다. 초기 계산 방법은 비대칭성, 경계 불규칙성, 색상 변화, 병변 직경을 포함하는 ABCD 규칙에서 파생된 수작업 이미지 기술자를 통해 임상적 추론을 모방하려 시도했습니다. 이러한 특징들은 베이지안 네트워크, 결정 트리, 전문가 시스템 및 퍼지 추론 모델과 결합되어 흑색종 진단을 지원했으며, 여러 연구에서 90% 이상의 분류 정확도를 보고했습니다15,16,17. 컴퓨터 보조 진단을 위한 중요한 토대를 제공했음에도 불구하고, 이러한 방법들은 전적으로 수동으로 설계된 특징과 미리 정의된 진단 규칙에 의존했습니다. 결과적으로 이미지 품질, 병변 형태, 조명 및 획득 조건의 변화에 대해 제한적인 강건성을 보였습니다.

이러한 단점들을 해결하기 위해, 전통적인 이미지 분석과 현대적인 AI 기반 프레임워크 사이의 중간 단계로 고전적인 CAD 시스템이 등장했습니다. CAD 시스템은 수작업으로 설계된 특징 추출(feature extraction)과 기존의 분류기를 결합하여 진단의 일관성을 높이고 임상적 의사결정을 지원했습니다. 몇몇 하이브리드 접근 방식은 계층적 군집 분석을 순환 신경망 및 장단기 메모리(long short-term memory) 구조와 통합하여 99.5%18에 근접하는 분류 정확도를 달성했습니다. 다른 CAD 기반 프레임워크는 그래디언트 부스팅 분류기에 SHAP 기반 설명을 도입하여, 모델의 투명성을 개선하는 동시에 경쟁력 있는 진단 정확도를 입증했습니다19. 이러한 시스템은 순수하게 규칙 기반이었던 접근 방식에 비해 상당한 발전을 이루었으나, 여전히 수작업 특징 추출, 광범위한 전처리, 세심하게 주석이 달린 데이터셋 및 다단계 처리 파이프라인에 크게 의존했습니다.

머신러닝 기법은 명시적인 규칙 설계 대신 데이터 기반 학습을 가능하게 함으로써 자동화된 피부 병변 분류를 더욱 발전시켰습니다. 로지스틱 회귀 및 k-최근접 이웃을 포함한 전통적인 머신러닝 분류기와 합성곱 신경망을 결합한 하이브리드 프레임워크는 벤치마크 데이터셋에서 95% 이상의 정확도를 달성하며 강력한 분류 성능을 입증하였습니다9. 자기 지도 다중 모달 학습은 더모스코피 이미지와 임상 이미지를 함께 활용하여 특징 표현을 더욱 개선했으며, 이를 통해 방대한 수동 주석에 대한 의존도를 낮추는 동시에 분류 성능을 향상시켰습니다20. 추가 연구에서는 특징 판별력과 분류 정확도를 높이기 위해 CNN을 일반화 판별 분석, SURF 기술자 및 최적화 알고리즘과 결합하였습니다21. DenseNet-201, InceptionV3 및 이진 트리 최적화 알고리즘을 사용하는 자동 특징 선택 기법은 경쟁력 있는 진단 성능을 유지하면서 특징 표현을 더욱 강화했습니다22. AlexNet 및 GoogLeNet과 같은 사전 학습된 아키텍처를 활용하는 전이 학습 접근 방식 또한 제한된 학습 데이터에도 불구하고 유망한 분류 능력을 보여주었습니다23. 그럼에도 불구하고, 대부분의 ML 방법은 여전히 정밀하게 설계된 전처리 절차, 수작업으로 최적화된 전략, 균형 잡힌 데이터셋 및 광범위한 하이퍼파라미터 튜닝에 의존하고 있습니다. 제한적인 외부 검증과 클래스 불균형에 대한 민감성은 다양한 임상 현장에서의 실제 적용 가능성을 더욱 제한하는 요소가 되었습니다.

딥러닝(DL)의 도입은 원본 이미지 데이터로부터 직접적인 엔드투엔드(end-to-end) 학습을 가능하게 함으로써 자동화된 피부 병변 분류 체계를 근본적으로 변화시켰습니다. 합성곱 신경망(CNN)은 수작업 기반의 특징 공학(feature engineering)의 필요성을 없애는 동시에 여러 벤치마크 데이터셋에 걸쳐 진단 성능을 상당히 향상시켰습니다. 대부분의 CNN 기반 접근 방식은 점차 정교해지는 아키텍처를 통해 병변 분류에서 유의미한 개선을 보여주었습니다. 대칭성 인식 CNN 모델은 임상적으로 유의미한 병변 특성을 탐색하였으나, 균형 정확도(balanced accuracy)는 보통 수준에 그쳤습니다24. 다른 연구에서는 EfficientNet 아키텍처를 LIME 및 SHAP 설명 방식과 통합하여 해석 가능성을 높이는 동시에 정량적 신뢰성 측정 지표를 도입하였습니다25. 병변 분할, 앙상블 학습 및 CNN을 결합한 하이브리드 DL 시스템은 여러 ISIC 데이터셋에서 우수한 성능을 달성하였으나, 분할 품질과 클래스 불균형에 민감한 특성을 보였습니다26.

보다 최근에는 상호 보완적인 DL 기술들을 통합한 더욱 정교한 하이브리드 아키텍처를 통해 분류 정확도를 더욱 향상시켰습니다. YOLOv5 및 독립 성분 분석과 결합된 조건부 생성적 적대 신경망은 99%가 넘는 분류 정확도를 달성했으나, 계산 복잡성으로 인해 실제 배포에는 한계가 있었습니다27. 마찬가지로, 하이브리드 LSTM–ResNet 아키텍처는 시공간적 표현을 효과적으로 학습했지만, 상당히 더 많은 계산 자원이 필요했습니다28. Sap-Former를 포함한 트랜스포머 기반 모델들은 전역적 문맥 정보를 활용하여 특징 표현을 강화했으나, 광범위한 전처리, 대규모 주석 데이터셋 및 상당한 계산 능력이 요구되었습니다29. S-MobileNet과 같은 경량화 대안들은 계산 효율성과 진단 정확도 사이의 균형을 맞추려 시도했으며30, 비지도 도메인 적응 방법들은 훈련 샘플이 제한적인 경우 효율성이 떨어짐에도 불구하고 교차 도메인 일반화 성능을 개선했습니다31. 수정된 합성곱 어텐션 모듈과 스냅샷 앙상블 학습을 통합한 어텐션 강화 하이브리드 네트워크 또한 원숭이두창 피부 병변 분류에서 유망한 성능을 보였으나, 클래스 불균형, 이미지 다양성 및 제한적인 설명 가능성과 관련된 과제들은 여전히 해결되지 않은 채로 남아 있습니다32. 더 깊은 네트워크 설계와 하이브리드 손실 함수를 채택한 맞춤형 잔차 아키텍처는 분류 정확도를 99% 이상으로 더욱 향상시켰지만, 상당히 더 큰 계산 오버헤드와 훈련 시간이 소요되었습니다33. 종합적인 검토 연구들은 DL이 판별적 이미지 표현을 자동으로 학습함으로써 전통적인 수동 특징 추출 방식보다 실질적으로 우수한 성능을 보인다고 일관되게 결론지었으며, 동시에 영상 아티팩트, 조명 변동성, 계산 복잡성 및 제한적인 임상 일반화와 관련된 지속적인 과제들을 확인했습니다34.

DL은 진단 정확도를 획기적으로 향상시켰으나, 모델의 투명성, 불확실성 추정 및 신뢰할 수 있는 임상 적용에 대한 우려로 인해 XAI와 연합 학습에 대한 관심이 높아지고 있습니다. 여러 연구에서 conformal prediction, Monte Carlo dropout, evidential deep learning을 포함한 불확실성 정량화 기술을 조사했으며, 추가적인 계산 및 데이터 관련 제약이 있음에도 불구하고 신뢰할 수 있는 신뢰도 추정이 의사결정 지원을 실질적으로 개선할 수 있음을 입증했습니다35. 클래스 불균형 문제를 해결하는 동시에 특징 학습 효율을 높이기 위해 Transformer 기반의 상호 학습 프레임워크도 제안되었습니다36. 다른 접근 방식으로는 병변 분할 및 분류를 개선하기 위해 고해상도 CNN과 그래프 기반 최적화 기술을 결합한 연구가 있었으며37, 여러 상보적 특징 표현을 통합한 하이브리드 딥러닝 프레임워크는 광범위한 전처리가 필요함에도 불구하고 99.5%에 근접하는 분류 정확도를 달성했습니다38.

최근 연구는 임상의의 신뢰를 높이고 실제 임상 적용을 촉진하기 위해 설명 가능성을 DL 프레임워크에 직접 통합하는 데 점점 더 집중하고 있습니다. Grad-CAM 및 Score-CAM과 함께 여러 합성곱 신경망 아키텍처를 사용하는 설명 가능한 시스템은 내부 및 외부 데이터 세트 모두에서 경쟁력 있는 분류 성능을 유지하면서 진단적으로 관련 있는 병변 부위를 성공적으로 국소화하였습니다39. 더모스코피 이미지와 임상 메타데이터를 결합한 하이브리드 CNN-Transformer 프레임워크는 SHAP 및 Grad-CAM을 사용하여 임상적으로 의미 있는 시각적 설명을 생성하는 동시에 예측 성능을 더욱 향상시켰습니다40. EfficientNetV2S, Swin Transformer, 수정된 Xception 네트워크 및 그래프 주의 집중 메커니즘을 통합한 추가적인 Transformer 기반 하이브리드 아키텍처는 상보적인 전역 및 국소 병변 특성을 효과적으로 포착하였으나, 방대한 파라미터 수와 소수 클래스에 대한 제한적인 성능으로 인해 실제 배포에는 한계가 있었습니다41. 마찬가지로, 하이브리드 YOLOv8-Vision Transformer 프레임워크는 적응형 증강과 SHAP 및 Grad-CAM 설명을 통해 개선된 병변 국소화, 다중 클래스 분류 및 시각적 해석력을 보여주었으나, 이러한 방법들은 여전히 주로 벤치마크 데이터 세트에 의존하였으며 소수 병변 범주에 대한 견고성이 제한적이었습니다42. 여러 리뷰 논문에서 이러한 발전 과정을 요약하며, 현대 딥러닝 기술이 달성한 괄목할 만한 진전과 더불어 계산 효율성, 설명 가능성, 데이터 세트 의존성 및 임상 검증과 관련된 지속적인 과제들을 모두 강조하였습니다43,44,45. 표 1은 피부 병변 분류를 위해 딥러닝 알고리즘을 활용한 최근 발표된 연구들을 요약하여 보여줍니다.

최근 딥러닝(DL) 방법론이 피부 병변 분류에서 괄목할 만한 성과를 거두었음에도 불구하고, 대부분의 기존 접근 방식은 높은 계산 복잡도, 대규모 주석 데이터셋에 대한 의존성, 제한적인 모델 해석 가능성, 그리고 다양한 실제 임상 환경에서의 불충분한 검증이라는 한계가 있습니다. 이러한 제한점을 극복하기 위해, 본 논문은 여러 CNN 아키텍처에서 추출한 상호 보완적인 특징을 SVM 분류기와 통합하여 견고하고 정확한 분류를 수행하는 EDLF-SLC 프레임워크를 제안합니다. 또한, 이 프레임워크는 이미지 품질을 개선하고 클래스 불균형 문제를 해결하기 위해 강화된 전처리를 적용하며, LIME 기법을 도입하여 개별 예측에 대한 시각적 설명을 제공함으로써 모델의 투명성과 임상적 신뢰도를 높였습니다.

본 연구의 기여점은 세 가지입니다. 첫째, 저자들은 정밀하고 신뢰할 수 있는 피부 병변 분류를 달성하기 위해 고급 합성곱 신경망(CNN)과 서포트 벡터 머신(SVM) 분류기를 통합한 견고한 프레임워크인 EDLF-SLC를 제안합니다. 둘째, 저자들은 클래스 불균형 문제를 해결하고 이미지 노이즈를 줄이기 위해 강화된 전처리 기술을 구현함으로써, 입력 이미지의 품질과 분류 모델의 전반적인 성능을 향상시켰습니다. 셋째, 저자들은 LIME(Local Interpretable Model-agnostic Explanations) 방법을 도입하여 분류 결정에 가장 강력한 영향을 미치는 이미지 영역을 강조함으로써 개별 모델의 예측을 시각화하고 해석함으로써, 제안된 프레임워크의 투명성과 해석 가능성을 높였습니다.

프로토콜

본 연구는 인간 대상자 모집이나 식별 가능한 환자 데이터 수집을 포함하지 않았습니다. 모든 실험은 Kaggle 저장소에서 얻은 공개적으로 이용 가능한 ISIC 2020 피부 병변 데이터셋을 사용하여 수행되었으므로, 기관 윤리 위원회의 승인 및 고지된 동의가 필요하지 않았습니다. 본 연구에 사용된 모든 재료는 재료 표(Table of Materials)에 기재되어 있습니다.

특징 추출 및 융합
피부 병변 이미지는 여러 개의 사전 학습된 CNN 모델을 사용하여 처리되었습니다. 선택된 사전 학습된 CNN 아키텍처에서 추출된 딥 특징 벡터들을 연결하여 각 피부 병변 이미지에 대한 통합 특징 표현을 구성합니다. 채택된 융합 전략은 서로 다른 CNN 아키텍처에서 학습된 상보적인 시각적 정보를 보존하여, 후속 SVM 분류기가 저수준 텍스처 특성과 고수준 시맨틱 표현을 모두 활용할 수 있도록 합니다. 주성분 분석이나 상호 정보량 기반 특징 선택과 같은 차원 축소 기술이 특징 차원을 줄일 수 있지만, 융합된 특징 공간이 사용된 RBF-SVM 분류기에서 계산 가능하게 유지되면서 서로 다른 CNN 백본에서 추출된 상보적 진단 정보를 보존하므로, 전체 융합 표현을 의도적으로 유지하였습니다.

분류
융합된 특징 벡터를 사용하여 RBF 커널 기반의 SVM 분류기를 학습시켰습니다. 최적의 분류 설정을 결정하기 위해 하이퍼파라미터 최적화 기법이 적용되었습니다. 그 후 분류기는 피부 병변을 각각의 클래스로 분류하였습니다.

설명 가능성
해석력을 높이기 위해, 분류 결과에 가장 크게 기여하는 이미지 영역을 강조하는 시각적 설명을 생성하고자 LIME을 적용하였습니다. 이러한 설명은 임상의가 모델의 결정 사항을 이해하고 검증하는 데 도움이 될 것입니다.

평가 계획
제안된 프레임워크는 벤치마크 피부 병변 데이터셋을 사용하여 평가되었습니다. 성능은 정확도(Accuracy), 정밀도(Precision), 재현율(Recall) 및 F1-Score를 통해 분석되었습니다. 제안된 프레임워크의 효과를 입증하기 위해 기존의 머신러닝 및 딥러닝 접근 방식과 비교 실험을 수행하였습니다.

예상 결과
본 연구를 통해 정확하고 해석 가능한 피부 병변 분류 시스템을 구축할 수 있을 것으로 기대되었습니다. 예비 실험 결과, EDLF-SLC는 정확도 88.0%, 정밀도 89.0%, 재현율 87.0%, F1-score 8.0%를 달성하여 여러 경쟁 방법들보다 우수한 성능을 보였습니다. LIME 설명의 통합은 AI 보조 진단 시스템의 신뢰성을 높이고 임상 현장에서의 도입을 촉진할 것으로 예상되었습니다.


본 연구는 피부 병변 진단의 성능과 투명성 문제를 모두 해결함으로써 설명 가능한 헬스케어 AI 분야의 발전에 기여합니다. 제안된 프레임워크는 피부과 전문의가 더욱 신뢰할 수 있고 해석 가능한 진단 결정을 내릴 수 있도록 지원하여, 궁극적으로 환자 진료의 질을 향상시킬 잠재력을 가지고 있습니다. 또한, 본 섹션에서 저자들은 본 연구에 적용된 재료 및 방법론에 관한 정보를 제공하였습니다. 구체적으로, 저자들은 실험에 사용된 데이터셋에 대한 설명부터 시작하여 피부 병변 분류를 위한 설명 가능한 딥러닝 프레임워크에 대한 상세한 논의로 이어갔습니다.

데이터셋
본 연구는 Kaggle 웹사이트(https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign)에서 접근 가능한 공개 ISIC 2020(International Skin Imaging Collaboration) 데이터셋을 활용하였습니다. 그림 1에서 볼 수 있듯이, ISIC 저장소는 다양한 유형의 피부 병변에 대한 방대한 더모스코피(dermoscopic) 이미지를 제공하므로 피부과 영상 분야에서 최고의 리소스 중 하나로 인정받고 있습니다. 특히, 이 데이터셋에는 양성과 악성 상태의 이미지가 모두 포함되어 있어 피부암의 이진 분류 작업을 수행하는 데 유용합니다 46. 현재 데이터셋에는 총 3,297장의 이미지가 있으며, 그중 1,80장은 양성, 1,497장은 악성입니다. 보다 효율적인 실험을 위해 데이터를 훈련 세트와 테스트 세트로 나누었습니다. 구체적으로 훈련 이미지 2,637장(양성 1,440장, 악성 1,197장)과 테스트 세트 660장(양성 360장, 악성 30장)으로 구성되었습니다. 데이터셋의 요약 내용은 표 2에 나타나 있습니다.

제안된 EDLF-SLC 모델
본 논문에서는 여러 사전 훈련된 합성곱 신경망 모델의 장점을 결합한 하이브리드 접근 방식 기반의 새로운 설명 가능한 딥러닝 기술을 사용하여, 피부 병변을 양성과 악성 범주로 분류하기 위한 효율적이고 이해 가능한 솔루션을 제안하였습니다. 합성곱 신경망은 의료 영상에서 고수준의 의미론적 특징을 추출하는 데 매우 효과적인 것으로 입증되었습니다. 이러한 능력을 활용하여, 제안된 피부 병변 분류를 위한 설명 가능한 딥러닝 프레임워크(EDLF-SLC)는 다수의 사전 훈련된 CNN 모델을 사용하여 우수한 성능을 달성합니다. 의료 의사 결정 과정에 필요한 투명성을 확보하기 위해, 제안된 접근 방식에서는 출력 결과에 대해 인간이 읽을 수 있는 국소적 설명을 생성하는 LIME을 채택하였습니다. 전체 프레임워크는 그림 2에 나타낸 바와 같이 (1) 데이터 전처리, (2) 특징 추출 및 분류, (3) 해석 가능성의 세 가지 주요 단계로 나눌 수 있습니다.

모델 아키텍처 및 통합
예비 단계로, 7가지 대중적인 딥러닝 모델(MobileNetV2, ResNet50, EfficientNetB0, Xception, InceptionResNetV2, NASNetLarge, MobileNet)을 선정하여 검증 데이터셋에서 각각 평가하였으며, 가장 효과적인 4가지 모델(ResNet50, EfficientNetB0, MobileNet, Xception)을 특징 추출 단계에 사용하도록 선택하였습니다. 제안된 프레임워크에서는 각 입력 이미지 x가 선택된 사전 학습 모델들을 독립적으로 통과합니다. 각 모델에서 마지막 완전 연결 계층(fully connected layer)을 제거하고, 이전 계층에서 특징 벡터를 추출하였습니다. fResNet50(x), fEfficientNetB0(x), fMobileNet(x), fXception(x)는 상기 언급된 각 모델에서 출력된 특징 벡터를 나타냅니다. 이러한 특징 벡터들을 결합하여 새로운 통합 특징 벡터 F(xi)를 얻습니다:

F(xi) = [f(ResNet50)(xi);f(EfficientNetB0)(xi);f(MobileNet)(xi);f(Xception)(xi)] (1)

그 후, F(xi)는 방사 기저 함수(radial basis function, RBF) 커널을 사용하는 SVM 분류기에 전달되어 분류 결과를 얻었습니다. 제안된 프레임워크의 전체 알고리즘은 다음에서 제시합니다. 보충 파일 1.

제안된 프레임워크는 각 사전 학습된 CNN 아키텍처가 고유한 네트워크 구조와 학습된 특징 계층을 통해 피부 병변의 서로 다른 판별적 특성을 포착하기 때문에 직접적인 특징 수준 융합(direct feature-level fusion) 방식을 채택하였습니다. 결과적으로, 이러한 이질적인 특징 표현들을 연결함으로써 분류 전 단계에서 더욱 포괄적인 병변 특성 분석에 기여하는 상호 보완적인 정보를 보존할 수 있습니다. 주성분 분석(PCA) 또는 상호 정보량 기반 특징 선택과 같은 차원 축소 기술을 통해 융합된 표현의 차원을 줄일 수 있으나, 채택된 RBF-SVM 분류기에서 계산적으로 처리 가능한 수준의 차원을 유지하면서 서로 다른 CNN 백본에서 추출된 상호 보완적 진단 정보를 보존하기 위해 융합된 전체 특징 벡터를 의도적으로 유지하였습니다. 따라서 이러한 설계는 분류 전 잠재적으로 유용한 특징을 제거하는 것보다 상호 보완적인 딥 표현을 유지하는 것에 우선순위를 두었습니다.

데이터 준비
데이터 준비 단계에는 데이터 세트의 전처리와 학습 세트 및 테스트 세트로의 분할 과정이 포함되었습니다. 전처리는 불일치 항목 제거, 중복 요소 삭제, 입력 이미지 포맷팅 및 우수한 모델의 안정적인 학습을 위한 피처 스케일링(feature scaling)을 통해 데이터 품질을 향상시키는 것을 목적으로 합니다. 모든 이미지는 Z-score 정규화를 통해 [−1, 1] 범위로 정규화되었습니다.

정규화 값 공식 (X-μ)/σ, 통계적 개념, 수식 도표. (2)

여기서 µ와 σ는 각각 해당 이미지의 평균값과 표준편차를 나타냅니다. 데이터 세트는 훈련 세트(70.0%)와 테스트 세트(30.0%)의 두 서브셋으로 나누었습니다.

데이터 증강
과적합을 방지하고 모델의 일반화 능력을 향상시키기 위해 훈련 세트에 일부 증강 기법을 적용하였습니다. 이미지 증강은 의료 상태의 핵심적인 특징을 변경하지 않으면서 데이터 세트를 인위적으로 확장하기 위해 이미지를 수정하는 과정을 포함합니다. 증강 파이프라인은 Keras Sequential API를 사용하여 구축되었습니다. 무작위 수평 뒤집기, 좁은 각도 내 회전, 크기 조정, 스케일링, 밝기/대비 조정, 줌 및 일부 미세 이동과 같은 변환이 사용되었습니다. 증강된 이미지의 대표적인 예시는 그림 3에 나와 있습니다.

사전 훈련된 모델
입력 이미지에서 특징을 추출하기 위해 제안된 프레임워크에 여러 사전 훈련된 딥러닝 모델이 채택되었습니다. 해당 모델에는 MobileNet, ResNet50, EfficientNetB0, Xception, NASNetLarge, Inception-ResNet-v2 및 MobileNetV2가 포함됩니다. MobileNet과 MobileNetV2는 깊이별 분리 합성곱(depth-wise separable convolutions)을 사용하여 효율적인 연산을 수행하는 경량 딥러닝 모델입니다. ResNet50은 모델 훈련을 위해 잔차 연결(residual connections) 메커니즘을 사용하여 훈련 중 기울기 소실 문제를 방지합니다. EfficientNetB0는 복합 스케일링(compound scaling) 방식을 통해 효율성과 정밀도 사이의 균형을 맞춥니다. Xception은 깊이별 분리 합성곱을 사용하여 Inception 네트워크를 확장한 모델입니다. NASNetLarge는 최적의 심층 신경망 구조를 구축하기 위해 신경망 구조 탐색(neural architecture search)을 사용하며, Inception-ResNet-v2는 Inception 모델과 잔차 연결 메커니즘의 하이브리드 형태로 구축되었습니다. ResNet50(1,024개 특징), EfficientNetB0(1,280개 특징), MobileNet(1,024개 특징) 및 Xception(2,048개 특징)에서 추출된 특징 벡터는 결합되어 통합된 5,376차원 표현을 생성합니다. 이러한 융합 전략은 분류 전 표현을 축소하기보다 서로 다른 CNN 아키텍처에 의해 학습된 상보적 표현을 보존하기 위해 선택되었습니다. 결과로 생성된 특징 벡터는 이후 RBF-SVM 분류기로 전달되며, 이 분류기는 융합된 특징 공간 내에서 최적의 비선형 결정 경계를 결정합니다.

설명 가능한 AI 모델 (LIME)
모델 예측에 대한 국소적 해석 가능성을 제공하기 위해, 저자들은 각 특정 모델 예측에 대해 인간이 읽을 수 있는 국소적 설명을 생성하는 방법인 LIME47을 채택하였습니다. 입력 이미지에 대해 LIME은 먼저 이를 슈퍼픽셀이라고 불리는 더 작은 단위로 분할합니다. 그런 다음 원본 이미지로부터 섭동(perturbation)을 생성하고, 각 섭동에 대해 딥 뉴럴 모델의 예측값을 추정합니다. 이어서 원본 입력 인스턴스와의 근접도에 따른 가중치를 사용하여 섭동에 대한 가중 선형 모델을 적합시킵니다. 선형 모델을 적합시킨 후, 최종 라벨 예측에서 각 슈퍼픽셀의 역할을 나타내는 특성 중요도 점수를 추정합니다. 이러한 중요도 점수는 최종 설명 이미지에서 시각적으로 강조됩니다. LIME 알고리즘은 보충 파일 2에 제시되어 있습니다.

결과

개발된 분류 프레임워크의 성능 평가는 혼동 행렬(confusion matrix)에서 파생된 전통적인 평가 지표를 기반으로 합니다. 혼동 행렬은 정의된 각 클래스에 대해 분류된 정답 및 오답의 수를 표현함으로써 분류기의 성능을 완전히 파악할 수 있게 합니다. 이러한 방식으로 모든 유형의 오류를 분석할 수 있습니다. 예를 들어, 질병 진단에서는 위양성(false positives)과 위음성(false negatives) 모두 특히 중요합니다. 위양성 값이 높으면 분류기의 민감도가 높음을 나타낼 수 있지만, 동시에 위음성 수치가 많으면 민감도가 낮음을 나타내며 잠재적인 건강 위험을 초래할 수 있습니다. 본 논문에서는 정확도(accuracy), 정밀도(precision), 재현율(recall), F1-점수(F1-score), 특이도(specificity), 진양성률(TPR), 위양성률(FPR)의 성능 지표를 활용합니다. 해당 지표들의 공식은 다음과 같습니다.

정확도=(TP+TN)/(TP+TN+FP+FN) (3)

정밀도(Precision)TP/(TP+FP) (4)

성능 지표의 데이터 분석에 사용되는 재현율(Recall) 계산 공식, TP/(TP+FN) (5)

F1 스코어 공식; F1=(2×정밀도×재현율)/(정밀도+재현율); 효율성 평가.(6)

특이도 공식, 진음성률 계산식, 교육용 도표. (7)

진양성률 및 위양성률 방정식, 통계 분석용 공식 도표. (8)

이 사례에서 TP는 프레임워크에 의해 검출된 악성 피부암의 수를 나타내며, TN은 양성 병변의 수를 나타냅니다. 반면, FP는 실제로는 양성임에도 불구하고 병변이 악성으로 분류되어 잘못 결정된 횟수를 보여줍니다. FN은 양성 샘플을 잘못 인식한 횟수를 반영합니다. 피부암 분류와 관련하여, 위음성(false negatives)으로 인해 발생할 수 있는 잠재적인 부작용 때문에 이를 최소화하는 것이 매우 중요합니다.

기준 모델의 성능
모든 계산 실험은 Google Colab의 클라우드 기반 환경에서 수행되었습니다. 이 플랫폼은 사전 정의된 Ubuntu 20.04를 운영 체제로 사용하는 가상 머신 인스턴스를 실행할 수 있다는 점에 주목할 필요가 있습니다. 기준 모델을 학습시키기 위해 Python 버전 3.9와 PyTorch 프레임워크 버전 2.3.1이 사용되었습니다. 또한, 모든 계산 노드는 2.2 GHz 주파수의 Intel Xeon CPU, NVIDIA Tesla T4 GPU, 16 GB RAM 및 70 GB의 저장 용량이라는 동일한 사양을 갖추고 있었습니다. 따라서 이러한 실험 설정은 서로 다른 하드웨어 플랫폼으로 인해 발생하는 가변성을 줄이고 결과의 신뢰성과 재현성을 높일 수 있었습니다. 실험 환경에 대한 전체 요약은 표 3에서 확인할 수 있습니다.

그림 4는 ResNet-50 아키텍처의 100 epoch 학습에 따른 학습 곡선을 보여줍니다. 학습은 2,10장의 이미지가 포함된 데이터셋을 기반으로 수행되었으며, 검증 데이터셋의 크기는 60장이었습니다. 보시는 바와 같이, 학습 과정 동안 정확도는 거의 90.0%까지 지속적으로 증가했습니다. 동시에, 처음 50 epoch까지는 정확도의 향상이 관찰되었으며, 이 시점 이후부터는 정확도가 거의 일정하게 유지되었는데, 이는 모델의 수렴 징후로 볼 수 있습니다. 검증 결과, 모델은 86.0%의 AUC 값을 나타내어 합리적인 판별 특성을 입증했습니다.

그림 5에 제시된 혼동 행렬은 60장의 이미지로 구성된 테스트 세트에서 분류 정확도 측면의 ResNet-50 모델 성능을 나타냅니다. 평가 과정에서 모델은 양성 샘플 360개 중 310개를, 악성 샘플 300개 중 239개를 정확하게 인식하였습니다. 그러나 비교적 많은 수의 악성 샘플이 잘못 분류되어 위음성(false negatives) 값이 상대적으로 크게 나타났습니다. 분류기를 실제 현장에 적용할 때 이러한 유형의 오류는 심각한 영향을 미칠 수 있으므로, 이 결과는 더욱 세밀하게 검토되어야 합니다. 종합적으로 모델은 83.0%의 정확도, 83.3%의 정밀도, 83.3%의 재현율 및 83.3%의 F1-score를 달성하였습니다.

표 4는 두 클래스 모두에 대한 ResNet-50 모델의 성능 특성에 대한 상세 설명을 포함하고 있습니다. 분류기는 정밀도 측면에서 비교적 균형 잡힌 성능을 보였으며, 양성 샘플의 경우 그 값이 83.0%였고, 악성 샘플의 정밀도는 84.0%로 나타났습니다. 마찬가지로 재현율 값은 양성 병변의 경우 8.0%, 악성 병변의 경우 78.0%에 달했습니다. 표의 Support는 각 클래스에 해당하는 샘플 수를 나타냅니다.

제안된 EDLF-SLC 모델
그림 6은 30 에포크(epoch) 동안 제안된 모델의 훈련 및 검증 AUC를 보여줍니다. AUC 지표는 양성과 악성 클래스를 구별하는 모델의 능력을 반영하며, 값이 높을수록 판별 성능이 더 우수함을 나타냅니다. 관찰된 바와 같이, 훈련 AUC는 훈련 과정 전반에 걸쳐 꾸준히 증가하여 약 20 에포크에서 최대값인 1.0에 도달합니다. 검증 AUC 또한 초기 훈련 단계에서 점진적으로 개선되지만, 약 150 에포크 이후부터는 정체되기 시작하여 모델의 수렴을 시사합니다. 최종 검증 AUC 0.95는 강력한 일반화 능력과 효과적인 클래스 분리 능력을 입증합니다.

그림 7에 제시된 제안 모델의 혼동 행렬을 보면, 모델이 299개의 양성 샘플과 272개의 악성 샘플을 정확하게 분류한 반면, 28개의 양성 사례를 악성으로, 61개의 악성 사례를 양성으로 오분류했음을 알 수 있습니다. 결과적으로 모델은 총 571건의 정확한 예측과 89건의 오분류를 기록했습니다. 특히, 위음성(악성 사례를 양성으로 오분류)의 수가 더 높다는 점은 이러한 오류가 임상적으로 중대한 영향을 미칠 수 있다는 점에서 중요한 한계점을 시사합니다. 그럼에도 불구하고 전반적인 분류 성능은 견고하게 유지되었습니다. 분류 전 차원을 의도적으로 제거하는 특성 선택 방식과 달리, 제안된 프레임워크는 여러 이질적인 CNN 아키텍처에 의해 생성된 완전한 융합 딥 표현(fused deep representation)을 보존합니다. 이러한 설계는 각 백본이 상호 보완적인 병변 특성을 추출하며, 전체 표현을 유지함으로써 SVM 분류기가 잠재적으로 유용한 특성을 배제하지 않고 결합된 판별 정보를 활용할 수 있도록 하기 위해 채택되었습니다. 결과적으로, 채택된 특성 융합 전략은 계산 가능성을 유지하면서 상호 보완적인 표현 학습을 우선시합니다.

그림 8은 제안된 모델에 의해 생성된 분류 결과의 대표적인 사례를 보여줍니다. 결과는 모델이 정확하게 분류된 사례에 대해 높은 신뢰도 점수를 부여함을 입증합니다. 구체적으로, 양성 사례는 높은 예측 확률(예: 99.84% 및 99.85%)을 나타내는 반면, 악성 사례 또한 강력한 신뢰 수준(예: 9.98% 및 9.96%)을 보여줍니다. 이러한 결과는 모델이 시각적으로 까다로운 시나리오에서도 양성 병변과 악성 병변을 효과적으로 구별할 수 있음을 나타냅니다. 해석 가능성을 높이기 위해 그림 9A–D에 표시된 바와 같이 LIME 프레임워크를 사용하여 모델 예측에 대한 국소적 설명을 생성합니다. LIME은 국소적으로 해석 가능한 선형 모델을 사용하여 모델의 복잡한 결정 경계를 근사합니다. 각 입력 이미지에 대해, 이 방법은 슈퍼픽셀을 선택적으로 마스킹하고 해당 예측을 평가함으로써 섭동 샘플을 생성합니다. 그런 다음 방사 기저 함수 커널을 사용하여 원래 입력과의 근접성을 기반으로 가중치를 결정하고, 이 샘플들에 가중 선형 모델을 적합시킵니다. 결과적으로 얻어진 계수는 최종 예측에 대한 각 슈퍼픽셀의 기여도를 나타내며 다음과 같이 정의됩니다:

통계 모델 요소를 나타내는 선형 회귀 방정식 공식, E(Y)=B0+ΣBjXj. (9)

여기서 Xj ∈ {0, 1}은 j번째 슈퍼픽셀의 존재 여부를 나타내고, Bj는 그에 해당하는 기여 가중치를, B0은 기본 예측값을 나타냅니다. 양의 계수(Bj > 0)는 악성 클래스에 기여하는 영역을 나타내며, 음의 계수(Bj < 0)는 양성 특징에 해당합니다. 그림 9B, D에 제시된 LIME 기반 시각화는 각 분류 결정에 기여하는 가장 영향력 있는 영역을 강조하여 보여줍니다. 양성 병변의 경우, 모델은 균일한 색소 침착과 명확한 경계가 특징인 영역을 강조합니다. 반면, 악성 사례의 경우, 강조된 영역은 불규칙한 경계, 색상의 불균질성, 비정형 질감과 같은 임상적으로 유의미한 특징에 해당합니다. 강조된 영역의 강도는 해당 계수 Bj의 크기를 반영합니다.

이러한 결과는 EDLF-SLC 모델이 ABCD 법칙과 같은 기성 피부과 기준과 일치하며 임상적으로 의미 있는 특징에 집중한다는 것을 입증합니다. 이러한 일치성은 모델의 해석 가능성과 신뢰도를 높여 임상 의사 결정 지원에 더 적합하게 만듭니다. 또한, 그림 10은 Grad-CAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM 및 EigenCAM을 포함한 추가적인 설명 가능성 기법을 사용하여 얻은 비교 시각화 결과를 보여주며, 서로 다른 방법들 간에 식별된 핵심 영역의 일관성을 추가로 검증합니다. 10 epoch 동안 학습시킨 후 제안된 EDLF-SLC 모델과 7가지 베이스라인 모델의 성능에 대한 비교는 표 5에서 확인할 수 있습니다. EDLF-SLC는 실험 환경을 기반으로 평가된 베이스라인 아키텍처들과 비교하여 각 평가 지표에서 0.8이라는 경쟁력 있는 성능을 확보했습니다. EfficientNetB0와 ResNet50 역시 각각 0.85와 0.83의 정확도를 기록하며 좋은 결과를 보였습니다. 반면, Inception-ResNetV2는 평가된 모델 중 가장 낮은 분류 성능을 보였습니다. 한편, 분류 정확도는 상대적으로 낮았음에도 불구하고 계산 효율성은 베이스라인 모델들과 대등한 수준이었습니다. 제안된 EDLF-SLC 모델은 채택된 실험 조건 하에서 평가된 베이스라인 모델들 대비 경쟁력 있는 성능을 입증하였습니다.

제안된 프레임워크의 성능을 기존 방식과 비교하여 평가하기 위해, 표 6에서 피부 병변 분류를 위한 대표적인 최신 기술 방법들과의 비교 결과를 제시합니다. 예를 들어47에서는 0.86의 정확도를 보고하였으며, 48에서는 앙상블 기반 모델을 사용하여 유사한 정확도를 달성했으나 정밀도, 재현율 및 F1-score는 더 낮았습니다. 앙상블 학습 및 다중 CNN 아키텍처를 기반으로 한 최근 연구들25,49은 최대 0.87의 정확도를 보고했습니다. 채택된 실험 조건 하에서, 제안된 EDLF-SLC 프레임워크는 병변 분할 모델과 같은 추가 구성 요소 없이 통합된 설명 가능한 아키텍처를 사용하여 0.8의 정확도를 달성했습니다.

데이터 가용성
본 연구의 결과를 뒷받침하는 데이터는 Kaggle의 https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign에서 공개적으로 이용 가능합니다.

피부 병변 분석, 흑색종 분류; 진단 이미지, 더모스코피 검사 결과
그림 1본 연구에서 사용된 두 가지 진단 클래스를 보여주는 ISIC 데이터셋의 대표 더모스코피(dermoscopic) 이미지. 시료는 양성(0)과 악성(1)으로 라벨링되었으며, 이는 데이터셋 전반에 걸친 병변의 형태, 색상 및 질감의 가변성을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

피부 병변 데이터셋 분석 워크플로우; CNN 기반 특징 추출, SVM 분류 다이어그램.
그림 2제안된 EDLF-SLC 프레임워크의 전체 워크플로. 이 프로토콜은 ISIC 2020 이미지 획득으로 시작하여 전처리, 데이터 증강, 데이터셋 분할, 4가지 사전 학습된 CNN 아키텍처를 이용한 딥 피처 추출, 피처 퓨전, SVM 분류, 성능 평가, 그리고 LIME 기반의 설명 생성 순으로 진행됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

피부 병변 패턴을 검사하는 현미경 기술, 다각도 확대 이미지, 의학적 분석.
그림 3데이터 증강 기술을 사용하여 생성된 증강된 피부 병변 이미지의 예시. 여기에는 수평 및 수직 뒤집기, 회전, 크기 조정 및 밝기 조절이 포함됩니다. 이러한 변환은 데이터셋의 다양성을 높이고 모델의 강건성을 개선하며, 훈련 중 과적합 위험을 줄여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

ROC 곡선 학습 결과, AUC 대 에포크(epoch), 모델 검증 및 학습 정확도 추세를 나타내는 도표.
그림 410회 학습 에포크(epoch) 동안 ResNet-50 모델의 훈련 및 검증 수신자 작동 특성 곡선 아래 면적(ROC-AUC). 파란색 곡선은 훈련 AUC를 나타내며, 주황색 곡선은 검증 AUC를 나타냅니다. 이 곡선들은 초기 훈련 에포크 동안 빠른 수렴을 보인 후, 일관되게 높은 검증 성능과 함께 안정적인 최적화가 이루어졌음을 보여주며, 이는 효과적인 학습과 검증 데이터셋에 대한 만족스러운 일반화가 이루어졌음을 시사합니다. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.

양성 대 악성 병변 분류 분석에서 ResNet-50의 혼동 행렬 도표.
그림 5테스트 데이터셋에 대한 ResNet-50 모델의 혼동 행렬. 행은 실제 클래스 레이블(0 = 양성, 1 = 악성)을 나타내며, 열은 예측된 클래스 레이블을 나타냅니다. 대각 요소는 정확하게 분류된 샘플(양성 310개 및 악성 239개)을 나타내고, 비대각 요소는 위양성 50개와 위음성 61개를 포함하여 잘못 분류된 샘플을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

ROC-AUC 곡선, EDLF-SLC 모델, 훈련 대 검증, 그래프, 30 에포크, 데이터 분석.
그림 630회 학습 에포크 동안 제안된 EDLF-SLC 모델의 훈련 및 검증 수신자 조작 특성 곡선 아래 면적(ROC-AUC). 파란색 곡선은 훈련 AUC를 나타내며, 주황색 곡선은 검증 AUC를 나타냅니다. 모델은 초기 훈련 에포크(epoch) 동안 빠르게 수렴하며, 이후 나머지 에포크 전체에서 일관되게 높은 훈련 및 검증 AUC 값을 유지하며 안정적인 최적화를 보입니다. 지속적인 검증 성능은 제안된 EDLF-SLC 프레임워크가 검증 데이터셋에서 우수한 일반화 능력과 안정적인 학습 동작을 나타냄을 입증합니다.. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

양성 및 악성 병변의 분류 정확도를 보여주는 EDLF-SLC 모델의 혼동 행렬 도표.
그림 7테스트 데이터셋에 대한 제안된 EDLF-SLC 모델의 혼동 행렬행은 실제 클래스 레이블(0 = 양성, 1 = 악성)을 나타내며, 열은 예측된 클래스 레이블을 나타냅니다. 대각선 요소는 정확하게 분류된 샘플(양성 29개 및 악성 272개)을 나타내고, 비대각선 요소는 61개의 위양성과 28개의 위음성을 포함하여 잘못 분류된 샘플에 해당합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

피부과 분석: 양성과 악성 피부 병변 분류의 예측 결과가 표시된 이미지.
그림 8제안된 EDLF-SLC 모델에 의해 생성된 샘플 예측 결과. 이 그림은 양성 및 악성 병변에 대한 분류 신뢰 수준을 보여주며, 모델의 판별 능력을 입증합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

피부 병변 경계 분석; 다이어그램 A-D는 피부과에서의 병변 및 윤곽 구분 과정을 보여줍니다.
그림 9제안된 EDLF-SLC 모델에 대한 LIME 기반의 국소적 설명. 이 그림은 모델의 분류 결정에 가장 큰 영향을 미치는 슈퍼픽셀 영역을 강조하여 보여줍니다.A) 양성 피부 병변의 원본 더모스코피 이미지. (B) 양성 병변에 대한 LIME 설명으로, 양성 예측에 가장 크게 기여한 영역이 강조된 슈퍼픽셀(superpixels)이 표시되어 있다. (C) 악성 피부 병변의 원본 더모스코피 이미지. (D) 악성 병변에 대한 LIME 설명으로, 악성 분류에 지배적인 영향을 미친 판별적 슈퍼픽셀 영역을 보여준다. 노란색 경계는 LIME에 의해 식별된 영향력 있는 슈퍼픽셀을 나타내며, 회색 영역은 예측에 기여도가 낮은 영역을 나타낸다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

GradCAM 방법을 이용한 이미지 분석; 시각적 설명을 위한 원본 및 오버레이 결과 도식.
그림 10제안된 EDLF-SLC 모델에 적용된 클래스 활성화 매핑(CAM) 기반 설명 가능성 방법들의 비교. 이 그림은 동일한 피부경 확대경 이미지에 대해 GradCAM, HiResCAM, GradCAM++, XGradCAM, LayerCAM, EigenGradCAM 및 EigenCAM으로 생성한 국소화 맵을 비교합니다. 첫 번째 패널은 원래의 입력 이미지를 보여주며, 이어서 각 설명 가능성 방법으로 생성된 해당 raw 활성화 맵과 히트맵 오버레이가 제시됩니다. 이러한 시각화는 공간적 국소화의 차이를 보여주며, 제안된 EDLF-SLC 프레임워크의 분류 결정에 가장 강력하게 기여하는 이미지 영역을 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

참고 문헌연도데이터세트데이터 크기특징 추출방법정확도
92022HAM100 데이터셋10,015장의 피부 병변 이미지색상 및 형태 특징ML 알고리즘 및 합성곱 신경망(Convolutional NN) 모델95.1%
192023PH2 데이터셋20장의 어노테이션 처리된 이미지비대칭, 줄무늬, 점/구상체, 퇴행성 부위 특징ML 모델94.0%
302024HAM10 데이터셋10,00장의 이미지색상 및 형태 특징S-MobileNet97.7%
282025ISIC2020 및 HAM100 데이터셋ISIC2020 (12,670개 이미지) 및 HAM10 (10,015개 이미지)색상 및 모양잔차 네트워크-장단기 메모리 (R-LSTM50)95.7% (ISIC2020); 94.2% (HAM100)
322026원숭이두창 피부 병변 데이터셋 (MSLD)70개 이미지맥락 및 질감DenseNet121, Xception, InceptionV3 및 CBAM8% (DenseNet121)
392025HAM10038,569장의 이미지맥락 및 질감MobileNet, ResNet50, InceptionV3 및 EfficientNet93.6% (MobileNet)
402025ISIC 20192357장의 이미지맥락 및 공간적 분석CNN-트랜스포머 기반 다중 모달 딥러닝98.71%
412026ISIC 201925,0장의 이미지맥락 및 질감TransXV2S95.26%
422025HAM1010,015장 이미지색상 및 모양YOLOv8 기반의 ViT93%

표 1: 문헌 비교. 피부 병변 분류를 위해 딥러닝 알고리즘을 활용한 최근 발표 연구들의 요약.

데이터셋양성악성총계
훈련 데이터144011972637
테스트 데이터360300660
전체 데이터180014973297

표 2: 데이터셋 분포. 훈련 및 테스트 분할을 포함한 ISIC 2020 데이터셋의 양성 및 악성 샘플 분포.

구성 요소사양서
운영 체제Ubuntu 20.04
프로그래밍 언어Python 3.9
DL 프레임워크PyTorch 2.3.1
옵티마이저아담
학습률 스케줄링1e−3
에포크 수100/300
중앙 처리 장치2 vCPU 2.2 GHz
그래픽 처리 장치Tesla T4 (16 GB) × 1
램(RAM)16 GB
학습 가능한 파라미터2,430,353 (9.27 MB)
학습 불가능 파라미터13,434,397 (509.01 MB)

표 3: 시스템 사양. 모델 훈련 및 평가에 활용된 소프트웨어 프레임워크와 하드웨어 리소스를 포함한 계산 환경의 상세 사양.

클래스정밀도(Precision)재현율(Recall)F1-스코어지원수(Support)
양성 클래스0.830.80.85360
악성 클래스0.840.780.81300
정확도--0.832660
매크로 평균0.840.830.8360
가중 평균0.840.830.8360

표 4: 분류 보고서. 테스트 데이터셋에 대한 ResNet-50 모델의 분류 성능으로, 각 클래스별 정밀도(precision), 재현율(recall), F1-score 및 서포트(support)를 포함한다.

모델정확도정밀도재현율F1 스코어시간 (s)
NASNetLarge0.770.760.770.762002.47
EfficientNetB00.850.850.850.85734.8
Xception0.80.810.80.8732.23
ResNetV20.630.640.630.6111072.34
모바일넷(MobileNet)0.790.80.790.79629.29
MobileNetV20.770.790.770.77660.5
ResNet500.830.830.830.83749.77
EDLF-SLC0.880.890.870.883279.77

표 5: 모델 성능 비교. 제안된 EDLF-SLC 모델과 기본 딥러닝 모델의 정확도, 정밀도, 재현율, F1-스코어 및 계산 시간의 비교 성능.

모델정확도정밀도재현율F1-스코어
ResNet-18 [25]0.850.850.850.85
SVM을 결합한 ResNet-50 [50]0.870.880.980.93
하이브리드 DL 모델 + SVM [48]0.860.840.80.84
하이브리드 딥러닝(DL) 모델 + SVM [49]0.860.80.60.68
제안된 EDLF-SLC0.880.890.870.88

표 6: 모델 비교 지표. 제안된 EDLF-SLC 프레임워크와 피부 병변 분류를 위한 최신 최첨단 접근법 간의 성능 비교.

보충 파일 1: 알고리즘 1. 데이터 전처리, 다중 CNN 아키텍처를 이용한 딥 피처 추출, SVM 기반 분류, 피부 병변 예측을 위한 LIME 기반 설명 가능성을 개요로 하는 제안된 EDLF-SLC 프레임워크의 워크플로. 이 파일을 다운로드하려면 여기를 클릭하십시오.

보충 파일 2: 알고리즘 2. 슈퍼픽셀 생성, 섭동 샘플링, 대리 모델 구축 및 분류 결정에 가장 크게 기여하는 이미지 영역의 시각화를 보여주는 LIME 기반 국소 설명 프로세스의 워크플로우. 이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

피부 병변 분류를 위해 제안된 설명 가능한 딥러닝 프레임워크(EDLF-SLC)는 상호 보완적인 딥 피처 표현을 설명 가능한 인공지능과 결합함으로써 분류 성능과 모델 투명성을 모두 향상시킬 수 있음을 보여줍니다. 특징 추출을 위해 여러 사전 학습된 CNN 아키텍처(ResNet50, EfficientNetB0, MobileNet, Xception)를 통합하고 최종 분류를 위해 서포트 벡터 머신(SVM)을 활용함으로써, 이 프레임워크는 서로 다른 특징 추출기의 강점을 이용하여 단일 백본 네트워크에서 얻은 것보다 더 풍부하고 판별력 있는 병변 표현을 생성합니다. 또한, 국소 해석 가능 모델 불가지론적 설명(LIME)의 통합은 국소적인 시각적 설명을 제공하여 임상의가 각 예측에 가장 크게 기여하는 이미지 영역을 이해할 수 있게 하며, 모델의 진단 결정에 대한 신뢰도를 높여줍니다.

실험 결과, EDLF-SLC는 MobileNet, Xception, ResNet50을 포함한 기본 CNN 모델과 비교하여 경쟁력 있는 성능을 달성했으며, 이는 상보적 특징 융합과 SVM 기반 분류의 효과를 입증합니다. 최근의 최첨단 접근 방식들과의 비교를 통해 제안된 프레임워크의 경쟁력이 더욱 확인되었습니다. 예를 들어, 두 건의 연구48,49에서는 앙상블 기반 방법을 사용하여 약 0.86의 정확도를 보고했으며, 다른 하이브리드 CNN-SVM 프레임워크25,50,51,52,53는 최대 0.87의 정확도를 달성했으나 더 복잡한 아키텍처와 추가적인 전처리 또는 세그멘테이션 모듈에 의존했습니다. 반면, 제안된 프레임워크는 명시적인 병변 세그멘테이션 없이 상대적으로 간소화된 아키텍처를 사용하여 0.88의 정확도를 달성하는 동시에 LIME을 통해 해석 가능한 예측을 제공합니다. 이러한 결과는 SVM 분류 전에 상보적인 CNN 특징 추출기를 결합함으로써 아키텍처의 단순성과 투명성을 유지하면서 진단 성능을 향상시킬 수 있음을 나타냅니다.

제안된 프레임워크는 분류 정확도와 해석 가능성을 향상시키지만, 이러한 개선은 계산 비용의 증가라는 대가를 수반합니다. EDLF-SLC의 총 학습 시간은 약 3279.77 s로, ResNet50 (749.77 s) 및 MobileNet (629.29 s)과 같은 개별 CNN 모델보다 상당히 높습니다. 이러한 추가적인 계산 오버헤드는 여러 개의 사전 학습된 CNN을 학습시키고 분류 전 단계에서 특징 융합(feature fusion)을 수행하기 때문에 발생합니다. 이러한 트레이드오프는 더 높은 계산 요구 사항을 대가로 예측 성능 향상을 달성하는 하이브리드 및 앙상블 학습 접근 방식에서 흔히 관찰됩니다. 그럼에도 불구하고, 임상 의사 결정 지원 시스템에서는 진단 정확도, 강건성 및 신뢰성이 환자의 결과에 직접적인 영향을 미치므로 일반적으로 학습 효율성보다 더 중요하게 간주됩니다.

제안된 프레임워크의 또 다른 중요한 장점은 설명 가능성입니다. 흔히 블랙박스로 작동하는 기존의 딥러닝 모델과 달리, EDLF-SLC는 LIME을 통합하여 예측 과정에 대한 사례별 시각적 설명을 제공합니다. 이러한 설명은 임상의가 모델이 임상적으로 유의미한 병변 영역에 집중하고 있는지 확인하는 데 도움을 주며, 이를 통해 투명성을 높이고 임상적 해석을 지원하며 AI 보조 진단에 대한 신뢰를 촉진합니다. 결과적으로, 제안된 프레임워크는 예측 성능과 모델 해석 가능성 사이의 실질적인 균형을 제공하여, 피부 병변 분류를 위한 유망한 컴퓨터 보조 의사결정 지원 도구가 될 수 있습니다.

이러한 고무적인 결과에도 불구하고, 몇 가지 한계점이 인정되어야 합니다. 첫째, 본 프레임워크는 공개적으로 사용 가능한 ISIC 데이터셋만을 사용하여 평가되었으며, 서로 다른 임상 조건, 영상 장치 및 환자군에서 획득한 이미지에 대한 일반화 능력은 여전히 검증이 필요합니다. 둘째, 여러 개의 사전 학습된 CNN 아키텍처를 사용함에 따라 단일 백본 모델에 비해 계산 복잡성과 학습 시간이 필연적으로 증가합니다. 셋째, 실험 전반에 걸쳐 고정된 하이퍼파라미터 설정을 채택하였으며, 추가적인 최적화를 통해 다양한 데이터셋에서의 성능과 적응성을 향상시킬 수 있을 것입니다. 마지막으로, LIME이 모델의 투명성을 높여주기는 하지만, 그 설명은 국소적이며 섭동(perturbation)에 의존하므로 실행 시마다 설명의 일관성이 다를 수 있으며, 일상적인 임상 배포 전에 피부과 전문가를 통한 추가 검증이 이루어져야 합니다.

향후 연구는 다수의 대규모 및 다기관 피부 병변 데이터셋을 사용하여 제안된 프레임워크를 검증하고, 경량 특징 융합 및 모델 압축 기술을 통해 계산 효율성을 최적화하며, 고급 하이퍼파라미터 최적화 전략을 조사하고, 프레임워크를 다중 클래스 피부 병변 분류로 확장하는 데 중점을 둘 것입니다. 또한, 추가적인 설명 가능한 AI 기술을 통합하고 피부과 전문의와 함께 전향적 임상 평가를 수행함으로써, 실제 임상 환경에서 제안된 프레임워크의 신뢰성, 해석 가능성 및 실질적인 적용 가능성을 더욱 강화할 것입니다.

공개 사항

저자들은 이해 상충이 없음을 선언합니다.

감사의 글

저자들은 본 연구의 완성을 가능하게 한 연구 환경과 기관적 지원을 제공해 준 Taif University에 진심으로 감사를 표합니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
ISIC 2020 피부 병변 데이터셋International Skin Imaging Collaboration (ISIC)ISIC 2020 Challenge Dataset모델 개발 및 평가에 사용된 더모스코피 이미지 데이터셋.
KerasKeras TeamTensorFlow와 통합됨딥러닝 모델의 구축 및 학습.
LIME (Local Interpretable Model-Agnostic Explanations)Ribeiro et al.Python 패키지모델 예측에 대한 국소적 시각적 설명 생성.
MatplotlibMatplotlib Developers최신 호환 버전학습 곡선, 혼동 행렬 및 평가 플롯의 시각화.
NumPyNumPy Developers최신 호환 버전수치 계산 및 배열 조작.
NVIDIA Tesla T4 GPUNVIDIA Corporation16 GB VRAM모델 학습 및 추론 가속화.
PandasPandas Development Team최신 호환 버전데이터 처리 및 실험 결과 관리.
사전 학습된 CNN 모델TensorFlow/Keras ApplicationsResNet50, EfficientNetB0, MobileNet, Xception더모스코피 이미지의 딥 피처 추출.
PythonPython Software FoundationVersion 3.9구현에 사용된 프로그래밍 언어.
PyTorchPyTorch FoundationVersion 2.3.1피처 추출 및 모델 구현에 사용된 딥러닝 프레임워크.
Scikit-learnScikit-learn Developers최신 호환 버전Support Vector Machine (SVM), 평가 지표 및 데이터 전처리.
Support Vector Machine (RBF 커널)Scikit-learnSVC융합된 딥 피처 표현의 분류.
TensorFlowGoogle LLCVersion 2.x모델 학습 및 추론을 위한 딥러닝 프레임워크.
Ubuntu 운영 체제Canonical Ltd.Ubuntu 20.04실험 운영 환경.

참고문헌

  1. Chan S, Reddy V, Myers B, Thibodeaux Q, Brown-Stone N, Liao W. Machine learning in dermatology: current applications, opportunities, and limitations. Dermatol Ther (Heidelb). 2020;10:365-386.
  2. Olsen CM. Global trends in melanoma mortality differ by sex and age. Br J Dermatol. 2020;183(6):985-986.
  3. Sun Y, Shen Y, Liu Q, Zhang H, Jia L, Chai Y, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021. J Am Acad Dermatol. 2025;92(1):100-107.
  4. Monika MK, Vignesh NA, Kumari CU, Kumar M, Lydia EL. Skin cancer detection and classification using machine learning. Mater Today Proc. 2020;33:4266-4270.
  5. Hosny KM, Elshora D, Mohamed ER, Vrochidou E, Papakostas GA. Deep learning and optimization-based methods for skin lesions segmentation: a review. IEEE Access. 2023.
  6. Baghdadi NA, Farghaly Abdelaliem SM, Malki A, Gad I, Ewis A, Atlam ES. Advanced machine learning techniques for cardiovascular disease early detection and diagnosis. J Big Data. 2023;10(1):144.
  7. Veeramani N, Jayaraman P, Krishankumar R, Ravichandran KS, Gandomi AH. DDCNN-F: double decker convolutional neural network feature fusion as a medical image classification framework. Sci Rep. 2024;14(1).
  8. Veeramani N, Jayaraman P. YOLOv7-XAI: multiclass skin lesion diagnosis using explainable artificial intelligence with fair decision making. Int J Imaging Syst Technol. 2024;34(6).
  9. Shetty B, Fernandes R, Rodrigues AP, Chengoden R, Bhattacharya S, Lakshmanna K. Skin lesion classification of dermoscopic images using machine learning and convolutional neural network. Sci Rep. 2022;12(1):18134.
  10. Ali AR, Li J, Yang G, O'Shea SJ. A machine learning approach to automatic detection of irregularity in skin lesion border using dermoscopic images. PeerJ Comput Sci. 2020;6:e268.
  11. Pham TTH, Luu TN, Nguyen TV, Huynh NT, Phan QH, Le TH. Polarimetric imaging combining optical parameters for classification of mice non-melanoma skin cancer tissue using machine learning. Heliyon. 2023;9(11).
  12. Liu N, Rejeesh M, Sundararaj V, Gunasundari B. ACO-KELM: anti coronavirus optimized kernel-based softplus extreme learning machine for classification of skin cancer. Expert Syst Appl. 2023;232:120719.
  13. Masud M, Almars AM, Rokaya MB, Meshref H, Gad I, Atlam ES. A novel lightweight convolutional neural network model to predict Alzheimer's disease applying weighted loss function. J Disabil Res. 2024;3(4):20240042.
  14. Kumar A, Veeraiah V, Gongada TN, Ahamad S, Khan H, Gupta A. Explainable machine learning models for clinical decision support systems. In: 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT). Piscataway (NJ): IEEE; 2024. p. 1-6.
  15. Shahzad K, Wasim M, Pires IM, Garcia NM. Multi-classification of skin lesions using a deep learning-based convolutional neural network. Procedia Comput Sci. 2024;241:588-593.
  16. Celebi ME, Kingravi HA, Uddin B, Iyatomi H, Aslandogan YA, Stoecker WV, et al. A methodological approach to the classification of dermoscopy images. Comput Med Imaging Graph. 2007;31(6):362-373.
  17. Li CX, Shen CB, Xue K, Shen X, Jing Y, Wang ZY, et al. Artificial intelligence in dermatology: past, present, and future. Chin Med J (Engl). 2019;132(17):2017-2020.
  18. Ramprasad M, Nagesh S, Sahith V, Lankalapalli RK. Hierarchical agglomerative clustering based skin lesion detection with region-based neural networks classification. Meas Sens. 2023;29:100865.
  19. Khater T, Ansari S, Mahmoud S, Hussain A, Tawfik H. Skin cancer classification using explainable artificial intelligence on pre-extracted image features. Intell Syst Appl. 2023;20:200275.
  20. Wang H, Ahn E, Bi L, Kim J. Self-supervised multi-modality learning for multi-label skin lesion classification. Comput Methods Programs Biomed. 2025;265:108729.
  21. Thapar P, Rakhra M, Alsaadi M, Quraishi A, Deka A, Naga Ramesh JV. A hybrid grasshopper optimization algorithm for skin lesion segmentation and melanoma classification using deep learning. Healthc Anal. 2024;5:100326.
  22. Kumar S, Nath VK, Hazarika D. Blend of deep features and binary tree growth algorithm for skin lesion classification. Symmetry (Basel). 2023;15(12):2213.
  23. Chandrahaas BV, Mohanty SN, Panda SK, et al. An empirical study on classification of monkeypox skin lesion detection. EAI Endorsed Trans Pervasive Health Technol. 2023;9:e4.
  24. Talavera-Martínez L, Bibiloni P, Giacaman A, Taberner R, de Paz Hernando LJD, González-Hidalgo M. A novel approach for skin lesion symmetry classification with a deep learning model. Comput Biol Med. 2022;145:105450.
  25. Ieracitano C, Morabito FC, Hussain A, Suffian M, Mammone N. TIXAI: a trustworthiness index for explainable artificial intelligence in skin lesion classification. Neurocomputing. 2025;630:129701.
  26. Hasan MK, Elahi MTE, Alam MA, Jawad MT, Martí R. DermoExpert: skin lesion classification using a hybrid convolutional neural network through segmentation, transfer learning, and augmentation. Inform Med Unlocked. 2022;28:100819.
  27. Koparde S, Kotwal J, Deshmukh S, Adsure S, Chaudhari P, Kimbahune V. Conditional generative adversarial networks and YOLOv5 Darknet-based skin lesion localization and classification using an independent component analysis model. Inform Med Unlocked. 2024;47:101515.
  28. Padhy S, Dash S, Kumar N, Singh SP, Kumar G, Moral P. Temporal integration of ResNet features with LSTM for enhanced skin lesion classification. Results Eng. 2025;25:104201.
  29. Xin C, Liu Z, Ma Y, Wang D, Zhang J, Li L, et al. Transformer-guided self-adaptive network for multi-scale skin lesion image segmentation. Comput Biol Med. 2024;169:107846.
  30. Sulthana R, Chamola V, Hussain Z, Albalwy F, Hussain A. A novel end-to-end deep convolutional neural network-based skin lesion classification framework. Expert Syst Appl. 2024;246:123056.
  31. Chamarthi S, Fogelberg K, Brinker TJ, Niebling J. Mitigating the influence of domain shift in skin lesion classification: a benchmark study of unsupervised domain adaptation methods. Inform Med Unlocked. 2024;44:101430.
  32. Maity S, Paul S, Guha S, Dasgupta S, Ghosh M. Automated classification of monkeypox skin lesions using a hybrid deep learning model. Biomed Signal Process Control. 2026;126:110955.
  33. Nasir S, Bilal M, Khalidi H. Detection and classification of skin cancer by using CNN-enabled cloud storage data access control algorithm based on blockchain technology. Int J Theor Appl Comput Intell. 2025:145-169.
  34. Saba T. Computer vision for microscopic skin cancer diagnosis using handcrafted and non-handcrafted features. Microsc Res Tech. 2021;84(6):1272-1283.
  35. Fayyad J, Alijani S, Najjaran H. Empirical validation of conformal prediction for trustworthy skin lesion classification. Comput Methods Programs Biomed. 2024;253:108231.
  36. Liu P, Qian W, Li H, Cao J. A relationship-aware mutual learning method for lightweight skin lesion classification. Digit Commun Netw. 2025;11(3):603-612.
  37. Adla D, Reddy GVR, Nayak P, Karuna G. A full-resolution convolutional network with a dynamic graph cut algorithm for skin cancer classification and detection. Healthc Anal. 2023;3:100154.
  38. Thamizhamuthu R, Maniraj SP. Deep learning-based dermoscopic image classification system for robust skin lesion analysis. Trait Signal. 2023;40(3).
  39. Di Giammarco M, Santone A, Cesarelli M, Martinelli F, Mercaldo F. A method for skin lesion detection and localization by means of deep learning and reliable prediction explainability. Image Vis Comput. 2025;162:105675.
  40. Haq IU, Joarder HA, Khan AA, Shi X, Alsayaydeh JAJ, Yusof MFB, et al. XAAI-ledger: an explainable CNN-transformer-based multimodal deep learning framework for early detection of melanoma and non-melanoma skin cancers using dermoscopic and clinical data. Biomed Signal Process Control. 2026;123:110410.
  41. Saeed K, Shehzad M, Malik MGA, Ahmed S, Azar AT. TransXV2S-NET: a novel hybrid deep learning architecture with dual-contextual graph attention for multi-class skin lesion classification. Knowl Based Syst. 2026;337:115407.
  42. AbuAlkebash H, Saleh RAA, Ertunç HM. Automated explainable deep learning framework for multiclass skin cancer detection and classification using hybrid YOLOv8 and vision transformer (ViT). Biomed Signal Process Control. 2025;108:107934.
  43. Hasan MK, Ahamad MA, Yap CH, Yang G. A survey, review, and future trends of skin lesion segmentation and classification. Comput Biol Med. 2023;155:106624.
  44. Li H, Pan Y, Zhao J, Zhang L. Skin disease diagnosis with deep learning: a review. Neurocomputing. 2021;464:364-393.
  45. Wu Y, Chen B, Zeng A, Pan D, Wang R, Zhao S. Skin cancer classification with deep learning: a systematic review. Front Oncol. 2022;12:893972.
  46. Fanconic. Skin cancer: malignant vs benign dataset. Kaggle; 2023. Available from: https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign
  47. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16). New York (NY): ACM; 2016. p. 1135-1144.
  48. Bassel A, Abdulkareem AB, Alyasseri ZAA, Sani NS, Mohammed HJ. Automatic malignant and benign skin cancer classification using a hybrid deep learning approach. Diagnostics (Basel). 2022;12(10):2472.
  49. Bhardwaj A, Rege PP. Skin lesion classification using deep learning. In: Advances in Signal and Data Processing: Select Proceedings of ICSDP 2019. Singapore: Springer; 2021. p. 575-589.
  50. Keerthana D, Venugopal V, Nath MK, Mishra M. Hybrid convolutional neural networks with SVM classifier for classification of skin cancer. Biomed Eng Adv. 2023;5:100069.
  51. Ahmed A, Siam AI, Atwa MA, Atwa EM, Abdelrahim EM, Atlam ES. An explainable YOLO-based deep learning framework for pneumonia detection from chest X-ray images. Algorithms. 2025;18(11):703.
  52. Farsi M, ZainEldin H, Sayed RF, El-Agamy ES, Atlam SA, Alsaedi M, et al. Deep learning for pathology: YOLOv8 with EigenCAM for reliable colorectal cancer diagnostics. Bioengineering (Basel). 2025;12(11):1203.
  53. Atwa EA, Atlam ES, Ahmed A, Atwa MA, Abdelrahim EM, Siam AI. Interpretable deep learning models for arrhythmia classification based on ECG signals using the PTB-XL dataset. Diagnostics (Basel). 2025;15(15):1950.

재인쇄 및 허가

태그

설명 가능한 AI합성곱 신경망서포트 벡터 머신모델 해석 가능성특징 융합사전 훈련된 CNNLIME 설명질병 진단