EfficientNet-B0와 Grad-CAM을 활용한 설명 가능한 전이 학습 프로토콜이 개발되어 유방 초음파 영상을 양성, 악성, 정상 범주로 분류하여 임상 의사결정 지원 응용 분야에 적합한 해석 가능한 진단 열맵을 제공합니다.
방법 논문
EfficientNet-B0와 Grad-CAM을 활용한 설명 가능한 전이 학습 프로토콜이 개발되어 유방 초음파 영상을 양성, 악성, 정상 범주로 분류하여 임상 의사결정 지원 응용 분야에 적합한 해석 가능한 진단 열맵을 제공합니다.
초음파 영상을 통한 유방암 식별은 임상의가 적절한 결정을 내리는 데 도움을 주기 위해 높은 정확도와 투명성이 필요합니다. 이 연구는 Efficient Net-B0 아키텍처를 사용하여 유방 초음파 영상을 양성, 악성, 정상 이미지로 분류하는 딥러닝 시스템을 시연하며, 이는 유방 초음파 식별(BUSI) 데이터셋에서 세밀하게 조정된 것입니다. 클래스 불균형을 완화하고 네트워크를 안정시키기 위해 무작위 수평 뒤집기, 회전, 색상 지터 등 데이터 증강이 적용됩니다. 그라디언트 가중 클래스 활성화 매핑(Grad-CAM)은 종양 경계와 텍스처 패턴과 같은 관심 영역을 식별하여 시각적 설명을 생성하는 데 사용됩니다. 이 모델은 평균 99%의 정확도를 달성하며 병변 발견에서 높은 효율성을 입증했습니다. 설명 가능한 AI(XAI)의 통합은 진단 신뢰도를 높일 뿐만 아니라 임상 실무와 AI 간의 간극을 메우는 역할을 합니다. 이 결과는 고성능 딥러닝 모델과 해석 가능성 방법을 결합하여 실제 임상 실무에 적합한 신뢰할 수 있는 유방암 진단 도구를 개발할 수 있는 잠재력을 입증합니다.
유방암은 전 세계 여성들에게 영향을 미치는 가장 중요한 생명을 위협하는 질병 중 하나입니다. 세계보건기구(WHO)에 따르면, 유방암은 암 관련 사망의 대다수를 차지하며, 조기 진단은생존율 향상에 매우 중요합니다. 초음파 영상은 안전하고 저렴하며 실시간 영상을 생성할 수 있어 유방암의 일상적인 진단 절차가 되었습니다. 유방촬영술과 달리 초음파는 액체가 포함된 고형 덩어리와 종양을 구분하는 데 매우 효과적이며, 따라서 유방 병리학적 특성이 있을 때 훌륭한 진단 보조 수단으로 작용합니다. 초음파 영상 해석은 매우 주관적이며 고급 전문성에 의존하므로 진단의 변동성과 인적 오류 가능성을 초래합니다.
지난 몇 년간 AI와 딥러닝은 의료 영상 분석 자동화에 있어 막대한 능력을 입증해 왔습니다. 딥러닝 기반 모델, 특히 CNN은 객체 분할, 탐지 및 분류에 뛰어납니다2. 하지만 이러한 모델의 '블랙박스' 특성 때문에 의료 분야에서의 AI 도입이 제약되고 있습니다. "블랙박스"라는 용어는 모델이 특정 결론에 도달하는 과정에 대한 투명성 부족을 의미합니다; 입력과 출력은 알려져 있지만, 임상 예측을 수행하는 데 사용되는 내부 논리와 구체적인 기능은 사용자에게 숨겨져 있습니다.
이 연구의 동기는 전 세계적으로 여성 사망의 주요 원인인 유방암의 조기 진단을 지원할 신뢰할 수 있는 기기의 긴급한 필요성에서 비롯됩니다. 딥러닝 모델은 매우 효과적이지만, 해석 가능성의 부족으로 임상 환경에서의 통합이 제한됩니다. 본 연구는 고성능 분류를 위해 EfficientNet-B0를 활용하고, Grad-CAM과 같은 설명 가능한 AI(XAI) 기법을 통합하여 모델의 의사결정 과정에 대한 시각적 통찰을 제공함으로써 이러한 공백을 해소합니다. 투명성과 정확성의 균형을 맞춰 이 연구는 임상의에게 신뢰할 수 있는 진단 지원을 제공하는 신뢰할 수 있는 AI 시스템을 개발하는 것을 목표로 합니다. XAI 방법은 모델 예측의 근본 추론을 드러내어 임상의가 결과를 검증하고 임상 실무와 자동화 시스템 간의 간극을 메울 수 있게 합니다. 유방 초음파 분류에서 이러한 해석 가능성은 AI 기반 진단이 정확하고 임상적으로 정당화될 수 있도록 보장합니다.
딥러닝의 발전에도 불구하고, 유방 초음파 영상 분류는 악성 종양과 같은 소수 집단이 과소대표되어 편향된 모델로 이어지는 등 계급 불균형 등 도전 과제도 있습니다. 딥러닝 모델의 해석 가능성 부족은 임상의가 투명한 의사결정을 요구하기 때문에 임상 실무에 적용하기 어렵게 만듭니다. 제한된 크기와 다양성 등 데이터셋의 제약은 모델의 일반화를 제한하며, 초음파 이미지의 종양 경계나 텍스처 같은 복잡한 이미지 특징은 배우기 어렵습니다. 앞서 언급한 문제들에 대한 해결책은 높은 정확성과 명확한 통찰을 보장하는 견고하고 해석 가능한 프레임워크를 요구합니다.
이 연구는 유방 초음파 영상을 양성, 악성, 정상 범주로 분류할 수 있는 딥러닝 프레임워크를 개발하고, 소수자 계층에 대한 표적 증강을 통해 일반화를 개선하는 것을 목표로 합니다. 이 프레임워크는 경배 가중 클래스 활성화 매핑을 통합하여 예측에 대한 시각적 설명을 제공하며, 정확성, 정밀도, 회상력, F1 점수를 사용하여 성능을 평가하여 해석 가능한 임상 의사결정 지원 시스템으로서의 적합성을 입증합니다. 이전에 진행된 설명 가능한 초음파 기반 유방암 연구들에서 Grad-CAM이 주로 사후 시각화 도구로 사용된 것과달리, 제안된 프레임워크는 병변 의식 전처리와 훈련 단계에서 계급 의식 학습을 결합합니다. 유방 초음파 이미지(BUSI) 데이터셋의 현장 진실 마스크는 병변 경계와 내부 반향 패턴을 강조하기 위해 초음파 이미지에 겹쳐 사용되며, 소수 진단 그룹에서는 임상적으로 유의미한 외관 특징을 변경하지 않고 분류 불균형을 줄이기 위해 선택적 증강이 사용됩니다9. 병변 기반 병변 강화, EfficientNet-B0 전이 학습, Grad-CAM 설명 가능성의 결합은 진단의 견고성을 높이고 병변 형태학과 일치하는 해석을 도출하며, 해부학적으로 유도된 병변 증강성과 설명 가능성이 AI 보조 유방암 진단을 신뢰할 수 있고 신뢰할 수 있게 만든다는 가설을 뒷받침합니다.
전통적인 의료 영상은 필터링, 분할, 형태학적 조작을 포함하여 진단을 위해 가시적 구조를 식별하는 전통적인 영상 처리 방법에 의존해 왔습니다.11. 하지만 이러한 프로세스는 일반적으로 수작업 조정이 필요했고, 의료 영상의 고유한 변동성과 복잡성을 수용하는 데 어려움을 겪었습니다. 예를 들어, 유방 초음파 해석은 역사적으로 방사선 전문의의 주관적 전문성에 의존했으며, 악성 및 양성 병변의 식별은 인간의 오류나 오해가 발생할 가능성이 높은 시각적 묘사에 의존했습니다.
딥러닝의 등장은 주로 합성곱신경망(CNN)의 도입을 통해 의료 영상 분야에 혁신적인 혁명을 촉매했습니다12. 이 중 EfficientNet-B0는 네트워크 깊이, 폭, 해상도를 균형 있게 조정하여 매우 효율적이고 정확한 계산을 달성하는 복합 확장 방식을 사용하는 중요한 혁신을 나타냅니다. 유방 초음파 영상 맥락에서, 이 모델은 순차적 합성곱 계층을 활용하여 계층적 특징을 자동으로 학습하여, 주관적인 수동 특징 추출 필요성을 효과적으로 없애고 진단 정확도와 신뢰성을 크게 향상시킵니다13. 이러한 놀라운 잠재력에도 불구하고, 의료 영상 분야의 딥러닝은 여전히 해결되지 않은 도전과제를 안고 진화 중인 분야입니다. 데이터의 품질과 가용성이 매우 중요하며, 딥러닝 모델은 성공적인 일반화를 위해 방대한 주석 이미지 저장소가 필요합니다. 더불어, 이러한 모델의 '블랙박스' 특성은 임상적 수용에 상당한 장애물을 제기합니다; 훈련 데이터의 잠재적 편향에 대한 윤리적 우려도 진단 예측이 왜곡되거나 차별적으로 나타날 수있습니다. 따라서 이 연구는 모델이 객관적이고 임상적으로 타당한지 확인하기 위해 엄격한 시험 및 검증 프로토콜이 필요합니다. 이러한 한계를 해결하기 위해 딥러닝의 현재 발전은 모델 해석 가능성과 견고성 향상에 중점을 두고 있습니다. 본 연구에 적용된 그라디언트 가중 클래스 활성화 매핑(Grad-CAM)과 같은 기법은 모델 결과에 영향을 미치는 특정 이미지 영역을 시각화할 수 있게 하여 모델 행동에 대한 더 깊은 이해를 촉진하고 임상 의사결정을 지원합니다. 또한, 연합 학습 프레임워크의 돌파구는 기관 간 프라이버시를 중시하는 협업을 촉진하여, 원시 데이터셋을 공유하지 않고도 이기종적인 데이터를 사용할 수 있게 합니다. 이러한 발전은 의료 영상에서 더 신뢰할 수 있고 해석 가능하며 편향 없는 딥러닝 응용 분야를 점차 가능하게 하여 궁극적으로 임상 기준과 환자 치료를 향상시키고 있습니다 15.
해석 가능한 의료 의사결정 시스템의 중요성은 최근 설명 가능한 인공지능의 발전을 통해 부각되었습니다. 해석 가능한 프레임워크: 융합 기반 해석 가능한 프레임워크는 두 가지 이상의 특징 표현과 설명 메커니즘의 결합을 통해 더 나은 분류와 투명성을 보여주었습니다. 최근 연구는 딥러닝 모델을 XAI 방법과 함께 활용하여 유방암 진단 및 기타 의료 예측 과제에 대한 진단 신뢰도를 높이는 데 큰 잠재력을 보여주었습니다. 이 논문들은 임상의가 높은 예측력과 해석 가능한 추론력을 모두 갖추어야 함을 지지하며, 이는 효과적이고 이해하기 쉬운 초음파분류 체계를 만드는 이번 연구의 목표와 일치합니다.
표 1은 문헌 검토와 기존 기술을 제시합니다.
| 연구 | 목표 | 비주 |
| Humayra Afrin 외 (2023)19 | 유방 종양 초음파 진단 및 예후를 위한 딥러닝 애플리케이션을 검토하세요. | 병변 분류가 가장 높은 성과를 보였으며, 예후에 관한 연구는 적었습니다. |
| 겔란, 아야나 외 (2022)20 | 유방암 화학요법용 초음파 유도 나노캐리어를 검토하세요. | 초음파 반응 나노캐리어는 약물 전달을 개선하지만 생리학적 장벽에 직면합니다. |
| 발레리오 디 파올라 외 (2022)21 | 유방암에서 정확한 N-단계 측정을 위한 영상 기법을 분석합니다. | MRI와 초음파가 중요한 역할을 하지만, 위양성/위음성은 진단 정확도에 영향을 줍니다. |
| 아디야샤 사후 외 (2024)22 | 유방암 탐지를 위한 앙상블 딥러닝 분류기를 제안합니다. | AlexNet, ResNet, MobileNetV2를 사용해 LoG와 고부스트를 사용해 높은 정확도를 달성했습니다. |
| 알리레자 레자자데 외 (2022)23 | 초음파 영상을 활용한 유방암 진단을 위한 설명 가능한 ML 파이프라인을 개발하세요. | 텍스처 특징과 의사결정 트리 앙상블을 사용하여 예측의 해석 가능성을 향상시킵니다. |
| Asaf Raza 외 (2023)24 | 강력한 유방암 탐지를 위해 DeepBreastCancerNet을 개발하세요. | 24계층 아키텍처와 다중 최적화를 통해 99.63%의 정확도를 달성했습니다. |
| 키란 자빈 외 (2022)25 | DarkNet-53과 기능 융합을 활용한 딥러닝 프레임워크를 제안합니다. | 최적화된 특징 선택 기법을 사용하여 99.1%의 정확도를 달성했습니다. |
| 겔란, 아야나 외 (2022)26 | 초음파 유방암 분류를 위한 다단계 전이 학습(MSTL)을 개발합니다. | EfficientNetB2, InceptionV3, ResNet50을 이용한 의료 영상 기반 전이 학습을 통해 정확도가 향상되었습니다. |
| 삭샴 굽타 외 (2023)27 | 초음파 유방암 분류를 위해 수정된 ResNet50을 사용하세요. | 97.8%의 정확도를 달성하여 진단 시간을 단축하고 조기 발견을 개선했습니다. |
| 칼 크라트키에비치 외 (2022)28 | 초음파 단층촬영(UST)과 광음향 단층촬영(PAT)과 같은 첨단 영상 기법을 검토하세요. | UST와 PAT는 정량적 영상을 통해 유방암 발견을 향상시킵니다. |
표 1: 기존 기술에 대한 문헌과 검토를 보여줍니다.
제안된 모델은 유방 초음파 이미지 분류에서 딥러닝의 성과를 바탕으로, 데이터 품질, 모델 해석 가능성, 계산 효율성 등 이 연구의 주요 과제를 극복합니다. 기존의 수동 특징 추출 기법과 달리, 이 연구에서는 깊이, 너비, 해상도를 결합해 최적의 작업 방식을 만드는 최신 아키텍처인 EfficientNet-B0를 활용합니다. 이 모델은 Grad-CAM을 사용하여 예측 설명을 시각화하여 투명성과 임상적 신뢰도를 높입니다. 현재 앙상블 모델과 전이 학습을 포함한 솔루션들은 매우 정확해졌지만, 쉽게 해석하기 어렵거나 많은 컴퓨팅 파워를 요구할 수 있습니다. 본 연구는 매우 정확하고(99) 해석 가능하여 임상 의사결정의 실질적 측면에서 모델이 신뢰할 수 있고 실현 가능함을 보장하기 위해 이러한 공백을 해결합니다. 클래스 불균형과 실용적 활용에 집중하는 접근법은 AI 기반 유방암 진단의 새로운 기준입니다.
이 논문은 이전에 수집된 익명화된 임상 이미지 집합인 공개된 BUSI를 사용합니다. 이 연구에는 직접적인 인간 대상 및 동물이 없었으므로 기관 윤리 승인(IRB/IACUC)이 필요하지 않았습니다. 모든 작업은 공개된 의료 영상 데이터의 2차 사용에 관한 공통 기준에 따라 이루어집니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
1. 데이터셋 특성
이 연구는 공개된 유방 초음파 영상(BUSI) 데이터셋을 활용하여 유방암 분석 및 분류를 위한 잘 문서화된 저장소를 제공했습니다29. 이 데이터셋은 의료 영상용 딥러닝 모델을 구축하고 검증하는 데 필요한 방대한 초음파 이미지 컬렉션을 포함하고 있어 특히 적합했습니다. 이 데이터셋은 25세에서 75세 사이의 600명 여성으로부터 수집된 780장의 초음파 이미지로 구성되었으며, 유방암 진단을 위한 다양한 인구를 대표합니다. 모든 이미지는 평균 해상도 500 x 500 픽셀을 유지했으며, 분석을 위해 고품질 시각 데이터를 보존하기 위해 PNG 형식을 사용했습니다. 그림 1 은 제안된 프레임워크의 전체 워크플로우를 보여주며, 여기에는 전처리, 증강, 효율적인 Net-B0 특징 추출, 분류, 그리고 Grad-CAM 해석 가능성이 포함됩니다.

그림 1: BUSI 데이터셋의 대표 샘플. (A) 양성, (B) 악성, (C) 정상 이미지. 패널들은 훈련에 사용되는 형태학적 다양성을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
2. 실험적 워크플로우
재현성을 보장하기 위해 조사는 처리 파이프라인을 순차적으로 실행했습니다. 먼저 시스템은 BUSI 초음파 이미지와 해당 지상 진실 마스크를 불러와 224×224 픽셀로 크기 조정한 뒤 ImageNet 정규화를 진행했습니다. 둘째, 프레임워크는 각 이미지를 마스크로 겹쳐 병변 영역을 강조한 뒤, 데이터셋을 훈련(70%), 검증(15%), 테스트(15%) 하위 집합으로 나누어 층화 샘플링을 사용했습니다. 셋째, 연구는 주로 소수 계급에 수평 뒤집기, 회전(±15°), 색상 지터링을 포함한 표적 증강을 적용했습니다. 넷째, 연구진은 ImageNet에서 사전 학습된 EfficientNet-B0 모델을 최종 분류 계층을 3클래스 출력 계층으로 대체하여 미세 조정했습니다. 훈련 과정에는 Adam 옵티마이저(학습률 0.00005), 단계별 학습률 감소(7 에포크마다 γ = 0.1), 교차 엔트로피 손실, 배치 크기 8, 인내심 2의 조기 중단이 사용되었습니다. 마지막으로, Grad-CAM은 진단에 관련 영역을 시각화하고 임상 해석을 지원하기 위해 마지막 합성곱 층에서 주의 열맵을 생성했습니다. 자료표는 연구의 유방 초음파 분류 및 해석 가능성 프레임워크를 재현하는 데 필요한 필수 데이터셋, 소프트웨어 라이브러리 및 하드웨어 구성을 나열합니다.
BUSI 데이터셋은 의료 데이터셋에서 자주 관찰되는 자연스러운 클래스 불균형을 보였습니다. 분포는 양성 그룹이 우세했고, 그 다음으로 악성 및 정상 환자가 순이었습니다. 구체적으로, 데이터셋에는 양성 이미지 487장, 악성 이미지 210장, 정상 이미지 133장이 포함되어 있었습니다. 데이터 증강은 훈련 변동성을 증가시켰지만, 각 클래스의 기본 표본 수에는 변화를 주지 않았습니다. 이 분포는 양성 질환이 악성 종양보다 더 자주 발생하는 실제 임상 상황을 반영한 것입니다. 이러한 불균형은 임상 환경에서 유방 이상 유병률을 정확히 보여주었지만, 소수자 학급의 편향된 예측과 최적의 성과를 초래할 수 있어 딥러닝 훈련에는 도전 과제가 되었습니다. 따라서 이 불균형을 완화하는 것이 모든 진단 범주에서 효율적으로 작동하는 효과적이고 일반화 가능한 모델을 수립하는 데 필수적이었습니다. 그림 2 는 양성, 악성, 정상 유방 조직 샘플의 예를 보여주는 데이터셋의 대표적인 초음파 이미지를 보여줍니다.

그림 2: 제안된 모델 워크플로우. 입력 및 마스크 오버레이 전처리부터 EfficientNet-B0 훈련, Grad-CAM 출력까지 순차적 파이프라인을 진행합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
3. 데이터 전처리
연구는 모든 이미지를 224 x 224 픽셀로 크기 조정하여 EfficientNet-B0 아키텍처의 표준 입력 치수를 준수했습니다. 이 크기 조정은 데이터셋의 일관성을 보장하고 계산 요구사항을 줄였으며, 이는 방정식 1에 정의된 것입니다.
프레임워크는 ImageNet 데이터셋의 평균 및 표준편차(평균은 [0.485, 0.456, 0.406], 표준값은 [0.229, 0.224, 0.225])를 사용하여 픽셀 값을 정규화했습니다. 이 정규화는 입력 데이터를 확장하여 훈련 안정성과 수렴 속도를 향상시켰으며, 이는 방정식 2에 따라 계산되었습니다.
특징 추출과 관심 영역 식별을 개선하기 위해 연구진은 원본 이미지를 해당 실제 실성 마스크에 겹쳐 보았습니다. 그림 3 은 지상 진실 병변 마스크와 종양 경계를 강조하는 겹쳐진 초음파 이미지를 보여줍니다.

그림 3: 마스크와 겹쳐진 이미지. (A) 원본 초음파, (B) 진실성 마스크, 그리고 (C) 공간적 주의를 위한 종양 경계를 강조하는 오버레이. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 오버레이는 종양 경계와 텍스처 패턴과 같은 중요한 영역을 식별하여 모델에 국소화된 공간적 맥락을 제공하여 분류 정확도를 향상시켰습니다. 이는 방정식 3에서 보여준 바와 같습니다.
연구는 특징 학습 중 병변 경계 지식을 보완하기 위해 훈련 데이터 준비 시 마스크 오버레이 연산을 독점적으로 활용했습니다. 반면, 검증 및 추론 단계는 마스크 없이 원본 초음파 이미지만 사용하여 전통적인 이미지 분류 파이프라인을 유지했습니다. BUSI 데이터셋의 이진 분할 마스크는 이미 초음파 이미지에 내재된 구조를 나타내기 때문에 새로운 클래스 라벨을 도입하지 않았습니다. 정보 유출을 방지하기 위해 조사에서는 데이터셋을 학습, 검증, 테스트 세트로 나누어 이미지나 마스크가 하위 집합 간에 겹치는 쌍이 공유되지 않도록 했습니다. 결과적으로 오버레이는 평가 데이터의 독립성을 해치지 않으면서 해부학적으로 중요한 부위를 강조하는 공간적 주의 가이드 역할을 했습니다.
4. 데이터 증강
이 연구는 훈련 세트 내 분류 불균형을 완화하기 위해 표적 데이터 증강을 도입했으며, 특히 악성 및 정상 소수 계층에 초점을 맞췄습니다. 이 프레임워크는 다양한 변환을 활용하여 학습 데이터의 변동성을 인위적으로 높이고, 다양한 영상 조건에 걸쳐 일반화할 수 있는 모델을 개선했습니다.
첫째, 시스템은 0.9%(90%)의 확률로 수평 뒤집기를 수행하여 모델이 스캔 방향과 상관없이 특징을 인식할 수 있게 했습니다. 이 변환은 식4를 따릅니다:
둘째, 연구는 ±15° 범위 내에서 무작위 회전을 적용하여 스캔 각도와 환자 위치 변화를 시뮬레이션하였습니다. 이 과정은 모델이 방정식 5에 정의된 종양 경계와 텍스처 패턴과 같은 회전 불변 특징을 학습하도록 강제했습니다:
셋째, 연구진은 색상 지터링을 이용해 조명, 대비, 색상 균형의 변화를 시뮬레이션했습니다. 프레임워크는 밝기, 명암비, 채도를 0.2배, 색조를 0.1배 조정했습니다. 이러한 확률적 조정은 모델의 외관 변화에 대한 견고성을 향상시켰으며, 이는 식6에 따라 계산되었습니다:
이러한 특정 하이퍼파라미터 범위(수평 뒤집힘 0.9, 회전 +15, -15, 밝기/대비/채도 0.2, 색조 0.1)의 선택은 경험적 안정성 평가를 통해 이루어졌습니다. 조사 결과, 이러한 환경이 다양성 생성과 해부학적 현실성 간의 균형을 최적화하여 비현실적인 병변 변형을 유발하지 않으면서도 안정적인 수렴과 검증 정확도를 보장했다는 점이 밝혀졌습니다.
5. 모델 아키텍처
이 연구는 다른 이미지 분류 아키텍처에 비해 효율성, 확장성, 성능으로 유명한 최신 CNN 모델인 EfficientNet-B0를 활용했습니다. 이 모델은 네트워크의 깊이, 폭, 해상도를 비례적으로 확장하는 방식을 사용하여, ResNet이나 VGG와 같은 표준 아키텍처에 비해 매개변수 수를 크게 줄이면서 높은 정확도를 달성할 수 있었습니다. 이러한 확장 방식 덕분에 프레임워크는 의료 영상의 특정 요구에 부합하면서도 계산 효율성을 유지하면서도 고해상도 이미지를 처리할 수 있게 되었습니다. 그림 4 는 EfficientNet-B0의 아키텍처를 보여주며, 계층적 특징 추출에 사용되는 컨볼루션 블록과 MBConv 블록의 순서를 강조합니다.

그림 4: 효율적인 Net-B0 아키텍처. 계층적 특징 추출에 사용되는 MBConv 블록과 복합 스케일링 인자의 개략도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
유방 초음파 분류 과제에 맞게 EfficientNet-B0를 수정하기 위해 연구진은 모델 구조에 구체적인 조정을 도입했습니다. 시스템은 1,000클래스 ImageNet 데이터셋을 위한 초기 분류 계층을 3개의 출력 뉴런으로 구성된 완전 연결(조밀) 계층으로 교체했습니다. 연구는 사전 학습된 EfficientNet-B0 백본의 모든 계층을 훈련 가능한 것으로 설정하고, 새로운 분류 계층과 함께 완전한 미세 조정 전략을 따라 최적화하였습니다. 훈련 과정은 단계적 냉동이나 점진적 해동 방식을 적용하지 않았습니다. 이 프레임워크는 학습률 0.00005의 Adam 최적화 도구를 사용해 학습률을 7에포크마다 0.1배 감소시키는 단계별 학습률 스케줄러를 사용해 훈련을 수행했습니다. 이 뉴런들은 BUSI 데이터셋 내 세 가지 표적 클래스인 양성, 정상, 악성에 해당합니다. 모델은 출력 계층에서 SoftMax 활성화를 사용하여 원시 점수를 확률 분포로 변환했으며, 이는 방정식 7에서 계산된 바 있습니다. 표 2는 모델 아키텍처의 설명을 보여줍니다.
| 레이어 유형 | 설명 |
| 입력 계층 | 224 x 224 x 3 크기의 이미지를 수용합니다 |
| 합성곱 계층 | 특징 추출을 위한 초기 합성곱 및 MBConv 블록을 포함합니다. |
| 글로벌 평균 풀링 | 공간 차원을 1차원 특징 벡터로 축소합니다. |
| 완전 연결 계층 | 특징 벡터를 3개의 출력 뉴런(정상, 양성, 악성)에 매핑합니다. |
| 소프트맥스 활성화 | 로그트를 다중 클래스 분류를 위한 확률로 변환합니다. |
표 2: 모델 아키텍처의 설명을 보여줍니다.
모델 훈련에 사용된 매개변수는 Adam 최적화기, 초기 학습률 0.00005, 그리고 방정식 9에 따라 수학적으로 계산된 범주별 교차엔트로피 손실(세 클래스)이었습니다. ImageNet 사전 학습된 가중치를 사용해 EfficientNet-B0를 초기화했고, 완전히 학습되었고, 모든 백본 계층이 학습되어 단계별 프리즈가 적용되지 않았습니다. 초기 분류기는 완전히 연결된 층과 세 개의 출력 뉴런, 그리고 양성, 악성, 정상 계열을 나타내는 SoftMax 활성화로 대체되었습니다. 이미지는 224 x 224 픽셀로 축소된 후 ImageNet의 평균 및 표준편차로 정규화되어 8개씩 소량으로 불러왔습니다. 단계학습률 스케줄러는 7시대마다 학습률을 0.1% 감소시켰습니다. 검증 손실은 과적합을 피하기 위해 2 에포크의 인내심을 가지고 조기 정지하는 데 사용되었다. Grad-CAM 활성화는 마지막 합성곱층을 기반으로 그라디언트 계산, 채널 가중치를 얻기 위한 전역 평균 풀링, 그리고 활성화 맵을 입력 해상도로 업스케일링하여 생성되었습니다.
안정성을 확인하기 위해 여러 차례 실행에 걸쳐 Matching 검증 성능을 적용한 훈련이 반복되었습니다. 훈련 및 검증 손실 곡선의 모니터링을 통해 과적합을 식별하였고, 최종 평가에는 훈련에 의존하지 않는 층화된 홀드아웃 테스트 세트를 사용하였습니다. 검증 성능과 테스트 성능 간의 차이는 작아 일관된 수렴과 최적화 재현성을 보여줍니다. 방정식 10은 단계별 학습 속도 일정을 정의합니다. 식15는 검증 손실이 두 번 연속으로 증가했음을 나타내며, 과적합 가능성을 나타냅니다.
EfficientNet-B0는 아키텍처에 여러 혁신적인 아키텍처 요소를 포함하여 효율성과 속도를 가능하게 하여 유방 초음파 분류 작업에 특히 유연합니다. 핵심 부분은 MBConv로, 깊이별 분리 가능한 합성곱과 압축 및 여기 모듈을 결합하여 정확도 손실 없이 낮은 계산 복잡도를 제공합니다. 이 모델은 또한 모든 자원 제약 조건에서 최적의 성능을 낼 수 있도록 깊이, 너비, 해상도를 균일하게 확장하는 화합물 스케일링을 지원하며, 다음 식8과 같이 수학적으로 도출된 작업 애자일 모델도 지원합니다. 이 모델은 이미 ImageNet 데이터셋에서 학습된 가중치를 포함하고 있어 학습 시 이전할 수 있으며, 상당 부분 작은 의료 데이터셋으로 모델을 학습시킬 필요가 없습니다. 이러한 고수준 기능과 최종 분류 계층 변경, Adam 최적화 도구, 학습률 스케줄러 사용, 조기 정지 기능을 포함한 맞춤형 학습 환경의 조합은 모델이 매우 정확하면서도 계산 효율성을 보장합니다. 이러한 아키텍처적 창의성과 교육 접근법의 결합은 부실한 의료 영상 정보를 바탕으로 모델이 효율적으로 학습할 수 있게 하여 유방 초음파 분류에 유용한 도구가 될 것입니다.
알고리즘 1: 효율적인 Net-B0와 Grad-CAM을 이용한 유방 초음파 영상 분류
입력: 유방 초음파 영상.
결과물: 분류(정상, 양성, 악성) 및 Grad-CAM 히트맵.
1. 이미지 전처리:
224×224224×224로 크기 조정.
ImageNet 평균과 표준값을 사용해 정규화하세요.
플립, 회전, 색상 지터링으로 보강하세요.
2. 모델 초기화:
Load EfficientNet-B0 (사전 학습, 최상위 계층 제외).
글로벌 평균 풀링과 조밀한 층(3개의 뉴런, SoftMax)을 추가하세요.
3. 기차 모형:
옵티마이저: 아담(학습률 = 0.00005).
손실: 교차 엔트로피.
조기 정지(인내심 = 2)를 두고 18에이포크를 훈련하세요.
4. 대학원 CAM 시각화:
대상 클래스의 구배를 계산합니다.
입력 이미지에 히트맵을 생성하고 오버레이하세요.
이 알고리즘은 EfficientNet-B0와 Grad-CAM을 이용해 유방 초음파 이미지를 분류하는 워크플로우를 제공하며, 전처리, 학습, 모델 추론, 그리고 임상적으로 검증할 수 있는 해석 가능한 히트맵을 포함합니다.
6. 설명 가능한 AI로서의 대학원 CAM
연구에서 사용된 강력한 도구인 딥러닝 모델에 해석 가능성을 더할 수 있는 Gradient-weighted Class Activation Mapping이 있습니다. 임상 영상에서 XAI의 절박한 수요에 대한 해결책을 고려하며, 이 방법은 Grad-CAM을 활용하여 임상의가 모델 예측에 사용되는 이미지 내 가장 중요한 영역 주변의 시각적으로 설명 가능한 열지도를 통해 모델의 의사결정을 직관적으로 이해할 수 있도록 합니다. 이러한 해석 가능성의 수렴은 특히 책임성과 투명성이 필수적인 의료와 같은 고위험 시스템에서 AI 시스템에 대한 신뢰를 구축하는 데 매우 중요할 것입니다. 그림 5 는 양성, 악성, 정상 사례에 대한 모델 예측에 가장 큰 영향을 준 이미지 영역을 강조한 Grad-CAM 히트맵을 보여줍니다.

그림 5: Grad-CAM 활성화 열지도. (A) 양성, (B) 악성, (C) 정상 사례. 따뜻한 색상(빨간색)은 높은 진단 효과를 나타냅니다; 차가운 색(파란색)은 관심이 적다는 뜻입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
모델에 입력된 이미지와 함께 모든 Grad-CAM 이미지가 표시됩니다. 그림 5는 원본 초음파 이미지와 모델 입력 이미지를 보여주어, 주목 영역이 예측에 고려되는 처리 입력과 직접적으로 관련되어 있는지 확인합니다. 채널별 중요도를 얻기 위해 Grad-CAM은 최종 합성곱층의 특징 맵을 사용하여 예측 클래스의 기울기를 계산하는 데 사용됩니다. 이 구배들은 전 세계적으로 평균을 내어 가중 계수를 얻고, 해당 특징 지도와 곱하여 국소화 히트맵(식16, 17)을 산출합니다. 히트맵은 입력 해상도로 업샘플링되어 초음파 이미지에 겹쳐져 진단 관심 영역(예: 종양 경계, 질감 변화 등)을 표시합니다. 이 시각화는 모델에서 예측을 수행하는 데 사용되는 영역에 대한 공간적 이해를 제공합니다. 이 논문은 주의의 국지화를 시각적으로 분석하여 해석 가능성을 측정합니다. 이들은 여전히 미래의 임상 관련성 검증에 유용한 국소화 및 임상 기반 평가의 정량적 측정을 포함하지 않았습니다.
Grad-CAM은 예측에 기여한 이미지 영역을 강조하여 모델이 시각적으로 어떻게 작동하는지 예측합니다. 히트맵은 네트워크가 종양 경계와 음향 패턴을 포함한 임상적으로 중요한 구조에 집중하고 있음을 확인하는 데 사용될 수 있습니다. 오경보 시에는 시각화가 관련 없는 영역에 집중하는 데 도움을 주어 모델 평가 및 최적화에 도움을 줍니다. 이러한 의학적 특징과 모델의 주의력 간의 상관관계는 AI 보조 진단의 해석 가능성을 향상시킵니다. 그림 6 은 GradCAM 시각화를 보여줍니다.

그림 6: GradCAM 시각화. 분류를 위한 중요한 영역(빨간색 = 높음, 파란색 = 하위)을 보여주는 Grad-CAM 히트맵; 색상 강도는 특징의 중요성을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
Grad-CAM은 분류 선택에 가장 큰 기여를 하는 이미지 영역을 강조하여 EfficientNet-B0 모델의 해석 가능성을 높이기 위해 추가됩니다. 결과된 열지도는 임상적으로 중요한 종양 경계 구조와 조직 변화를 나타내며, 이는 모델 예측의 명확한 분석을 용이하게 합니다. 이러한 높은 분류 정확도와 시각적 해석 가능성은 이 제안된 프레임워크를 유방 초음파 영상 분석의 신뢰성 측면에서 더욱 강력하게 만듭니다.
7. 통계 분석
모델은 긍정적 예측의 정확성을 측정하기 위해 정밀도와 같은 광범위한 지표 세트로 평가되며; 모든 관련 사례를 식별하는 데 있어 모델의 효과성을 측정하기 위해 회상; 그리고 F1 점수는 정밀도와 기억의 조화평균으로, 전체 성능의 균형 잡힌 척도를 제공하며, 방정식 18–21에 따라 수학적으로 계산됩니다.
평균 절대 오차(MAE)는 예측값과 진정값 간의 평균 절대 차이를 수학적으로 계산한 방정식 22에 따라 정량화됩니다.
평균평균오차근(RMSE)은 방정식 23에 따라 수학적으로 계산된 예측값과 실제 값의 평균 편차를 측정합니다.
평균 절대 오차(MAE)는 예측값과 진짜값 간의 평균 절대 차이를 수학적으로 계산한 24식 기준으로 정량화합니다.
혼동 행렬은 진양성, 진음성, 거짓 양성, 거짓 음성, 거짓 음성의 분류를 상세히 분류하는 데 사용되며, 모델이30을 어떻게 분류하는지에 대한 추가 정보를 제공합니다. 이러한 평가 측정을 결합하면 관측되지 않은 데이터에 대한 모델 오류, 강도, 일반화를 전반적으로 평가할 수 있어 유방 초음파 영상을 분류하는 신뢰할 수 있는 도구가 됩니다. BUSI 데이터셋에서 병변 마스크가 존재한다는 점은 앞으로 교차-합집합(intersection-over-union)과 같은 정량적 위치 측정을 도입하여 설명의 정확성을 객관적으로 평가할 수 있음을 의미합니다. 계층화된 홀드아웃 검증은 훈련 및 평가 하위 집합 간의 독립성을 유지하면서 클래스 분포를 유지하기 위해 선택되었습니다. 교차 검증을 사용하지 않은 이유는 검증 샘플이 최적화 과정에 반복적으로 노출되는 것을 방지하기 위함이었으나, 향후 연구에서는 반복 또는 중첩된 교차 검증을 통해 성능 변동을 더 자세히 확인할 예정입니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
입력 치수를 24 X 224 픽셀로 표준화하고 ImageNet 기반 정규화를 통해 안정적인 학습 동작과 손실 곡선의 부드러운 수렴이 가능해졌습니다. 마스크 오버레이 작업을 훈련 샘플에 적용했을 때, 원시 초음파 이미지에 비해 병변 경계의 가시성이 크게 향상되었습니다. 이 관찰은 해부학적 유도 강화가 특징 분리성을 개선한다는 가설을 뒷받침했습니다. 훈련 단계에서는 이러한 오버레이를 사용했지만, 검증 및 테스트 세트는 마스크 강화 없이 대조군으로 남아 있었습니다; 이 세트들 간의 일관된 성능은 모델이 외부 마스크 인공물에 의존하지 않고 내재적 해부학적 표지자를 학습했음을 증명했습니다. 이 결과는 전처리가 특히 시각적으로 미묘한 병변에서 배경 변이성을 효과적으로 최소화한다는 것을 확인시켜 주었습니다.
악성 및 정상 소수 집단에 대한 표적 증강은 균형 잡힌 집단 분포를 이루고 우세한 양성 집단에 대한 예측 편향을 완화했습니다....
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제안된 프레임워크는 세밀하게 조정된 EfficientNet-B0 아키텍처와 그라디언트 가중 클래스 활성화 매핑(Grad-CAM)을 결합하여 유방 초음파 분류를 위한 고성능의 해석 가능한 시스템을 제공합니다. 이 연구는 '블랙박스' 딥러닝 모델과 임상 투명성 사이의 간극을 메워 과학 분야를 발전시키며, 계산 효율성이설명 가능성을 위해 희생될 필요가 없음을 입증합니다. 병변 인식 전처리와 표적 증강을 구현함으로써, 본 연구는 의학 데이터셋에 내재된 클래스 불균형을 다룰 수 있는 견고한 방법론을 제공하여 종양학에서 AI 보조 진단의 신뢰성을 높입니다.
높은 정확도를 달성했음에도 불구하고, 이 연구는 여러 한계에 직면해 있습니다. BUSI 데이터셋은 단일 출처의 임상 획득 시나리오를 나타내며, 서로 다른 스캐너 특성이나 다양한 집단 분포에 노출될 경우 모델의 영역 간 견고성이 제한될 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없다고 선언한다.
저자들은 이 연구 전반에 걸쳐 지속적인 지원과 격려를 해주신 각 기관과 동료들에게 진심으로 감사의 뜻을 전하고자 합니다. 저자들은 또한 이 연구를 가능하게 한 공개 데이터셋을 제공한 BUSI 유방 초음파 데이터셋 제작자들에게 감사를 표합니다. 이 연구는 누라빈트 압둘라흐만 대학교 연구자 지원 프로젝트 번호(PNURSP2026R432), 사우디아라비아 리야드 공주 누라 빈트 압둘라흐만 대학교의 지원을 받았습니다. 저자들은 King Khalid 대학교 연구 및 대학원장직에 이 연구를 지원해 준 대규모 그룹 연구(Large Group Research)를 통해 연구비 지원에 감사를 표합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 유방 초음파 이미지(BUSI 데이터세트) | N/A | 780개의 PNG 이미지(양성 487개, 악성 210개, 정상 133개) | |
| Matplotlib | Matplotlib 개발자들 | N/A | 버전 3.7.1 |
| NumPy | NumPy 개발자들 | N/A | 버전 1.23.5 |
| NVIDIA Tesla T4 GPU | NVIDIA | N/A | 16GB VRAM |
| OpenCV | OpenCV.org | N/A | 버전 4.7.0 |
| Pillow (PIL) | Python 이미지 라이브러리 | N/A | 버전 9.4.0 |
| Python | Python 소프트웨어 재단 | N/A | 버전 3.9.12 |
| PyTorch | Meta AI | N/A | 버전 2.0.1+cu117 |
| Scikit-learn | Scikit-learn 개발자들 | N/A | 버전 1.2.2 |
| Seaborn | Seaborn 개발자들 | N/A | 버전 0.12.2 |
| Ubuntu OS | Canonical | N/A | 64비트 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청