연구 논문

HMP-MUNet: 피부 영상에서 피부 병변 분할을 자동화하는 하이브리드 딥러닝 프레임워크

167 조회수

DOI:

10.3791/69449

2026년 3월 17일

* These authors contributed equally

이 논문에서

요약

HMP-MUNet은 자동 피부 병변 분할을 위한 하이브리드 딥러닝 프레임워크를 도입합니다. 상태 공간 모델을 다중 스케일 주의 메커니즘과 통합함으로써 분할 정확도를 높이고 계산 효율성을 최적화하여 임상 환경에서 피부암 진단에 강력한 솔루션을 제공합니다.

초록

피부 병변에 대한 컴퓨터 지원 진단 시스템은 높은 진단 정확도와 계산 효율성 달성에 큰 어려움을 겪고 있습니다. 현재의 딥러닝 접근법은 상당한 연산 자원을 필요로 하며, 다양한 규모에서 피부 병변에 내재된 복잡한 형태학적 변이를 포착하는 데 어려움을 겪고 있습니다. 고차 다중 스케일 병렬 시야 맘바 U-Net(HMP-MUNet)은 상태 공간 모델과 고급 다중 스케일 처리 능력을 결합한 혁신적인 아키텍처 설계를 통해 이러한 한계를 해결한 새로운 딥러닝 프레임워크입니다.

본 연구에서 설명하는 접근법은 글로벌 맥락 모델링을 위한 고차 시각 상태 공간 모듈, 다중 수용 필드에 걸친 계층적 특징 추출을 위한 다중 규모 확장 주의 융합 네트워크, 그리고 계산 최적화를 위한 병렬 다중 깊이 유연성 네트워크를 결합한 하이브리드 U-Net 프레임워크를 통합합니다. 이 아키텍처는 채널 차원을 증가시키고 고급 주의 메커니즘을 갖춘 수정된 U자형 인코더-디코더를 사용하여 특징 학습을 향상시킵니다.

벤치마크 데이터셋에 대한 종합 평가에서 PH2 주사위 유사도 계수는 95.85%, ISIC2018에서 90.44%로 나타났습니다. 이 모델은 단 761만 개의 매개변수만으로도 뛰어난 정확도를 달성하며, 기존 Vision Mamba 아키텍처에 비해 72.2%의 놀라운 감소를 보여주면서도 높은 세분화 정확도를 유지합니다. 이 경량 설계는 임상 검증을 앞두고 전문 피부과 센터부터 1차 진료 시설에 이르기까지 다양한 임상 환경과 영상 기법에 적용될 가능성을 보여줍니다.

HMP-MUNet은 진단의 일관성을 향상시키고 임상 워크플로우를 지원하는 피부 병변 분할을 자동화한 솔루션을 제공하며, 임상 활용에서의 추가 검증 가능성도 있습니다. 고차 모델링 능력과 실용적 배포 고려의 통합은 피부암 선별 프로토콜 개선과 컴퓨터 지원 진단 응용 분야에서 의료 접근성 확대를 위한 잠재적 해결책을 제공합니다.

서론

컴퓨터 지원 진단(CAD) 시스템은 임상 전문 분야 전반에 걸쳐 의료 영상 실무를 개선하여 질병 발견, 진단 및 치료 계획 접근법을 향상시키는 것을 목표로 합니다. 1. 피부과에서는 인공지능(AI)과 첨단 영상 기술의 통합이 진단 정확도와 임상 결과를 향상시키는 데 중요한 도구로 부상했으며, 특히 피부암의 조기 발견에서 이 암은 전체 피부암의 약 90%를 차지합니다. 자동화된 피부 병변 분석을 위한 정교한 알고리즘 접근법의 개발은 정밀 의학의 발전에 기여하며, 표준화되고 재현 가능한 진단 지원을 가능하게 하여 다양한 의료 환경에서 임상 의사결정을 향상시키는 데 기여합니다 3,4.

현대 피부과 영상은 피부 경, 디지털 촬영, 광학 코히어런스 단층촬영, 다중분광 영상 시스템 등 다양한 기법을 포함합니다. 의료진은 피부암을 수작업으로 진단하기 위해 피부암을 피부 검지 이미지를 활용하며, 상당한 전문성을 요구하는 노동 집약적이고 시간이 많이 소요되는 방법을 사용합니다6. 다양한 임상 환경과 영상 상태에서 진단 일관성을 유지하는 어려움이 피부 병변의 객관적이고 정량적인 분석을 제공하는 CAD 시스템 개발을 촉진했습니다. 피부 병변을 피부 영상에서 분리하는 것은 이후 분류 정확도와 임상적 유용성에 직접적인 영향을 미치는 근본적인 전처리 단계입니다7. 일반적으로 컴퓨터 보조 피부암 진단은 이미지 획득, 전처리, 세분화, 특징 추출, 분류 5단계를 포함합니다. 정확한 경계 구분은 정확한 병변 특성화에 필수적이며, 임상의가 비대칭, 경계 불규칙성, 색상 변이, 직경 등 확립된 진단 기준의 핵심 매개변수인 형태학적 특징을 평가할 수 있게합니다.

상태-공간 모델(SSM), 특히 맘바 아키텍처의 등장은 선형 계산 복잡성을 제공하여 계산 효율성을 향상시키면서도 우수한 장거리 의존성 모델링 능력을 유지합니다. 최근 피부 병변 분할11의 발전들, 예를 들어 U-Net9, Att-UNet12, UTNetV213, UNet++14는 분할 정확도에서 눈에 띄는 향상을 보여주었습니다. 예를 들어, U-Net은 ISIC2018 데이터셋에서 주사위 유사 계수(DSC)가 87.55%를 달성하는 반면, UNet++는 87.83%, Att-UNet은 87.91%를 달성합니다. PH2 데이터셋에서 U-Net은 90.6%의 DSC를 달성하며, C2SDG15와 SCR-Net16은 각각 90.3%와 89.89%를 기록합니다. HMP-MUNet은 다중 스케일 주의 메커니즘과 병렬 처리 기능을 통합하여 매개변수 수를 72.2% 줄이고, PH2 데이터셋에서 95.85%, ISIC2018 데이터셋에서 90.44%의 우수한 정확도를 달성했습니다. 시각적 표현 학습 능력과 컴퓨팅 자원 소모의 균형을 맞추는 것이 중요하다는 점을 고려할 때, 최적의 절충을 달성하는 일반 의료 영상 분류 아키텍처를 탐구하는 것은 지능형 임상 진단 시스템 개발에 중요합니다17. 구조화된 공간 SSM 프레임워크는 상태 전이 행렬을 최적화하고, 계산 효율성을 높이며, 다양한 영상 모달리즘에서 임상 배포에 필수적인 특성인 메모리 오버헤드를 줄임으로써 전통적인 맘바 아키텍처를 강화합니다.

최근 연구에 따르면, 특히 고차 비전 맘바 기반 스삐칭 스킴(H-VSS)을 사용하는 Vision Mamba 아키텍처는 기존 변압기보다 훨씬 적은 매개변수 수로 우수한 성능을 달성하여 임상 워크플로우 통합에 특히 적합함을 보여줍니다19. 그러나 기존 Vision Mamba 구현은 임상배포 조건에서 메모리 소비 제한과 확장성 제약 등 도전에 직면해 있습니다. 현재 의료 영상 분할 방법은 일반적으로 CNN과 트랜스포머 기반 모델로 나뉘며, 전통적인 CNN은 수용장 제약에 의해 제한되어 장거리 의존성 포착이 어렵습니다. 의료 영상에서는 병변과 같은 중요한 부위와 건강한 피부를 구분하는 데 높은 정밀도가 필요하며,이러한 문제를 해결하기 위해 첨단 기술 솔루션의 도입이 필요합니다. 현대의 세분화 아키텍처는 실시간 응용을 위한 계산 효율성, 중요한 진단 작업의 정확성, 다양한 영상 프로토콜 전반의 견고성 등 특정 임상 요구사항을 충족하도록 진화해 왔습니다23. 주의 메커니즘, 다중 스케일 특징 융합 전략, 트랜스포머 기반 인코더를 통합한 고급 U-Net 변형들은 복잡한 의료 영상 시나리오에서 우수한 성능을 입증했습니다12,24. 이러한 아키텍처 혁신은 해부학적 구조의 정확한 구분, 병리학적 영역의 식별, 정량적 바이오마커 추출을 가능하게 하여 임상 적용을 직접적으로 향상시켜, 근거 기반 의학에 매우 중요합니다25,26. 그러나 기존 전자의무기록(EMR)과의 인터페이스 호환성, 대형 이미지의 저장 및 검색, 다양한 기관 시스템 간 상호운용성 등 통합 과제는 임상 전반의 광범위한 도입에 여전히 큰 장애물로 남아 있습니다27.

본 논문은 임상 실무에서 자동 피부 병변 분할을 위해 특별히 설계된 새로운 CAD 시스템인 고차 다규모 평행 시각 Mamba U-Net(HMP-MUNet)을 소개합니다. 이 프레임워크는 혁신적인 아키텍처 구성 요소인 다중 규모 확장 집중 융합 네트워크(MSDAFN)와 병렬 다중 깊이 유연 네트워크(PMFlex)를 통합하여 현재 의료 영상 시스템의 중요한 공백을 해결합니다. MSDAFN은 공간 및 채널 주의 메커니즘과 다중 스케일 확장된 합성곱을 결합한 정교한 특징 추출 전략을 구현하여, 다양한 규모에서 미묘한 병변 특성을 향상시키는 데 도움을 주어 임상 실무에서 접하는 다양한 병변 유형의 정확한 진단에 매우 중요합니다28. PMFlex는 여러 입력 스트림의 동시 분석을 가능하게 하는 병렬 처리 기능을 도입하여 계산 효율성을 크게 향상시키면서도 임상급 정확도에 필수적인 고차 모델링 능력을 유지합니다29. HMP-MUNet은 혁신적인 세분화 기법과 계산 전략을 통해 피부암 진단의 경계를 넓혀 실시간 및 정확한 임상 진단을 가능하게 하는 것을 목표로 합니다30,31.

이 연구의 주요 기여는 의료 영상 분야에서 CAD 발전이라는 핵심 목표와 일치합니다: MSDAFN을 통한 전역 맥락 모델링의 향상, 다양한 임상 증상에서 정확한 병변 위치 파악을 위한 특징 추출 및 융합 효율 향상; PMFlex를 통한 효율적인 병렬 처리를 통해 임상 수준의 정확도를 유지하면서 계산 오버헤드를 줄여 자원이 제한된 임상 환경에서의 배포를 용이하게 합니다; 하드웨어 인식 설계를 통한 임상 배포 최적화를 통해 실시간 임상 워크플로우를 지원하는 고해상도 피부경 영상의 효율적인 처리를 가능하게 합니다; 임상 통합에 적합한 성과 지표를 갖춘 표준 데이터셋에서의 종합적 평가를 통해 입증된 임상 성과; 그리고 고차 모델링, 다중 규모 분석, 병렬 계산을 결합한 통합 진단 솔루션으로, 정밀 피부과 진단을 위한 종합 솔루션을 제공합니다. 이 연구는 현대 의료 환경에서 자동화된 피부 병변 분석의 기술적·실용적 요구사항을 모두 충족하는 혁신적이고 임상적으로 적용 가능한 솔루션을 제공함으로써 컴퓨터 의료 영상을 발전시켰습니다.

이 프레임워크는 일반적으로 256× 256의 입력 해상도를 가진 고해상도 피부경 이미지를 처리하도록 설계되어 계산 효율성과 이미지 세부 사항 사이의 균형을 제공합니다. 하지만 조명, 피부 톤, 모발 유제 등 장비와 이미지 품질의 변동성은 분할 성능에 영향을 줄 수 있습니다. 이러한 도전에도 불구하고, 시스템 설계는 실시간 임상 워크플로우에 최적화되어 다양한 영상 장치에 적응할 수 있어 다양한 임상 환경에서 견고한 성능을 보장합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

이 연구는 계산 연구 및 데이터 처리에 관한 기관 지침을 준수하여 수행되었습니다. 이 연구에는 인간 대상이나 척추동물이 참여하지 않았습니다.

데이터셋 준비 및 전처리

데이터셋 수집 및 조직

피부 촬영 이미지는 PH2, ISIC2018, ISIC2017 데이터셋에서 수집되었으며, 특정 링크 는 재료표에 제공되었습니다. PH2 데이터셋에는 200장의 고해상도 이미지(1000 × 1000픽셀)가 포함되어 있으며, ISIC2018 해당 분할 마스크가 포함된 2,594장의 이미지, ISIC2017 분할 마스크가 포함된 2,150장의 이미지가 포함되어 있습니다. 데이터는 표준 프로토콜에 따라 훈련, 검증, 테스트 세트로 구성되었으며, 이미지가 호환 가능한 형식(예: .jpg, .png, .tiff)이고 이진 형식의 해당 지상 진실 마스크가 포함되도록 했습니다.

데이터는 표준 프로토콜에 따라 훈련, 검증, 테스트 세트로 정리되었습니다. 데이터셋은 다음과 같이 나뉘었는데, ISIC2018 1,815장의 이미지가 학습용, 259장의 검증용, 520장이 테스트용으로 할당되었습니다. ISIC2017 동안 1,500장의 이미지가 훈련용, 220장의 검증용, 430장의 테스트용으로 할당되었습니다. PH2의 경우 데이터셋은 160장의 훈련 이미지, 10장의 검증 이미지, 30장의 테스트 이미지로 나뉘었습니다. 전처리 파이프라인 전반에 걸쳐 256× 256픽셀의 일관된 이미지 해상도가 유지되었습니다.

데이터 증강 및 정규화

모델 일반화를 강화하기 위해 데이터 증강 기법이 적용되었습니다. 수평 뒤집기, 수직 뒤집기, 그리고 ±15° 범위 내의 무작위 회전이 구현되었습니다. 감마 보정과 로그 변환은 각각 0.3의 확률로 적용되었다. 픽셀 값은 ImageNet 통계(평균 = [0.485, 0.456, 0.406], 표준편차 = [0.229, 0.224, 0.225])를 사용해 정규화되었습니다.

입력 이미지의 크기 조절 × 256 픽셀: 계산 효율성을 보장하기 위해 모든 입력 이미지는 256 × 256 픽셀의 균일한 해상도로 재조정되었습니다. 데이터셋에 포함된 고해상도 이미지(1000 × 1000픽셀)는 정확한 병변 경계 구분에 필수적인 세밀한 디테일과 질감 정보를 포함하지만, 해상도를 높여도 모델 성능이 크게 향상되지는 않았습니다. 따라서 계산 효율성과 모델 정확도 간의 균형을 유지하기 위해 해상도를 높이지 않았습니다. 향후 연구에서는 고해상도 입력의 효과를 더 조사하여 분할 정확도의 이점이 계산 비용 증가를 정당화하는지 여부를 확인할 수 있습니다. 필요할 경우 이미지는 RGB 형식으로 변환되었습니다. 사전 처리된 데이터는 원래 데이터셋 분할을 유지하면서 구조화된 디렉터리에 저장되었습니다.

HMP-MUNet 아키텍처 구현

네트워크 아키텍처 설계

HMP-MUNet은 그림 1에 나타난 것처럼 계층적 U자형 인코더-디코더 구조에 따라 구성되었습니다. 네트워크는 프로그레시브 채널 확장으로 구성되었으며, 인코더 레벨 전반에 걸쳐 8→16→32→64→128→256 채널을 지원했습니다.

네트워크 깊이를 네 단계에서 두 단계로 줄이는 중요한 아키텍처 변경이 이루어졌으며, 이는 모델을 단순화하고 계산 효율성을 향상시키는 데 도움이 되었습니다. 깊이는 줄었지만, 각 레벨마다 채널 크기가 커져 네트워크가 더 풍부하고 표현력 있는 특징을 포착할 수 있게 되었습니다. 모델의 특징 학습을 더욱 향상시키기 위해, 네트워크를 여러 척도에서 가장 관련 있는 특징에 집중시키는 주의 메커니즘이 도입되었습니다. 이러한 주의 메커니즘은 얕은 아키텍처로 인한 계층적 특징 추상화 손실 가능성을 효과적으로 보완합니다.

인코더는 입력 텐서 X(C, H×W)에서 초기 특징 추출을 위한 이중 Conv2D 연산으로 초기화되었습니다. 세 가지 특수 모듈의 교대 구성이 구현되었습니다: 고차 비전 맘바 기반 스위칭 스위칭 스킴(H-VSS), 병렬 다중 깊이 유연 네트워크(PMFlex), 그리고 다중 규모 확장 주의 융합 네트워크(MSDAFN).

이 모델은 정규화를 위해 ImageNet 통계(평균 및 표준편차)를 사용하여 각 데이터셋마다 재계산할 필요가 없어 계산 효율을 향상시킵니다. 이는 ImageNet이 컴퓨터 비전 작업에서 광범위하게 활용되는 점을 활용하여 안정성과 일반화 가능성을 보장합니다. 이 선택은 전처리 복잡성을 줄여 설계를 단순화하고 데이터셋 간 전이성을 높여 다양한 피부 병변 이미지에 효과적으로 일반화할 수 있게 합니다.

고차 비전 맘바 기반 스위칭 방식(H-VSS) 구현                

H-VSS 모듈은 그림 2의 아키텍처에 따라 구현되었습니다. 레이어 정규화(LN)와 하드위시 활성화(HS)는 식(1)에 따라 잔류 연결로 구성되었습니다:

figure-protocol-1

공간적 일관성을 유지하기 위해 로컬 공간 디스크립터(LSD) 구성 요소가 구현되었습니다. 공간 선택 2D 스캐닝(SS2D) 모듈은 식(2)에 따라 다방향 스캔 패턴으로 구성되었습니다:

figure-protocol-2

식(3)에 명시된 잔차 연결을 포함한 다중 계층 지각론(MLP) 처리가 추가되었습니다:

figure-protocol-3

고차 2D 선택적 스캐닝(H-SS2D) 메커니즘은 입력 특징을 2차원 공간에 투사하여 향상된 맥락 모델링을 수행합니다.

병렬 다중 깊이 유연 네트워크(PMFlex) 구현

PMFlex 모듈은 그림 3 사양에 따라 구성되었습니다. 레이어 정규화는 입력 특징 맵 X(C, H×W)에 적용된 후, 채널 차원을 따라 식(4)에 따라 네 개의 세그먼트로 분할되었습니다:

figure-protocol-4

각 분할된 특징Y_i 공유 Visual Mamba(VMamba) 모듈을 통해 처리되었습니다. 처리된 출력은 연결되었고, 방정식(5)에 설명된 레이어 정규화 및 투영을 통해 정제가 적용되었습니다:

figure-protocol-5

다중 규모 확장 주의 융합 네트워크(MSDAFN) 구현

MSDAFN 모듈은 Figure 4 아키텍처를 따라 구현되었습니다. 병렬 합성곱 연산은 식(6)에 따라 다중 스케일 특징 추출을 위해 6, 12, 18의 지연률로 구성되었습니다:

figure-protocol-6

다중 규모 특징은 방정식 (7)에 명시된 채널 연결(channel concatenation)을 통해 통합되었습니다:

figure-protocol-7

특징 재보정을 위해 이중 주의 메커니즘이 구현되었습니다. 채널 주의 가중치는 방정식 (8)에 따라 전역 평균 풀링을 사용하여 계산되었습니다:

figure-protocol-8

채널 주의 가중치는 식(9)에 설명된 대로 적용되었습니다:

figure-protocol-9

공간 주의는 식(10)에 따른 합성곱 연산을 통해 구성되었습니다:

figure-protocol-10

채널과 공간적 주의는 식(11)에 명시된 대로 결합되었습니다:

figure-protocol-11

훈련 구성 및 최적화

환경 설정

실험 환경은 GPU가 장착된 Ubuntu 20.04 시스템(32GB VRAM)에서 구성되었습니다. Python 3.8, 딥러닝 프레임워크(RRID: SCR_018536), CUDA 11.8이 설치되었습니다. 입력 이미지 크기는 피부 병변 과제를 위해 256 × 256 픽셀로 설정되었습니다.

손실 함수와 옵티마이저 구성

BceDice 손실 함수는 훈련 최적화를 위해 구현되었습니다. AdamW 옵티마이저는 초기 학습률 0.001, 배치 크기 8, 250 훈련 에포크로 구성되었습니다. 정규화를 위해 1 × 10⁻5 의 무게 감쇠가 적용되었다.

기초 구성에 대해, 본 연구는 Liu 등(2024)이 의한 Vmamba 모델을 참조하며, 이는 의료 영상 분류 작업11의 시각 상태 공간 모델로 사용되었습니다. Vmamba 구현에 사용되는 정확한 구성과 스크립트는 그들의 발표된 연구를 기반으로 하며, 이 연구를 위해 조정되었으며, 의료 영상 데이터셋에 더 적합하도록 구체적인 조정이 이루어졌습니다.

학습 속도 스케줄링은 워밍 재시작을 이용한 코사인 어닐링을 사용해 설정되었습니다. 초기 재시작 기간은 T_0 = 10 에포크, 주기 곱셈은 T_mult = 2, 최소 학습률은 η_min = 1 × 10⁻6 으로 설정하세요.

하이퍼파라미터 최적화

재현성과 일관성을 보장하기 위해 모든 실험은 고정된 무작위 시드 42를 사용하여 수행되었습니다. 체계적인 하이퍼파라미터 최적화는 배치 크기, 학습률, 드롭 경로 속도에 중점을 두고 수행되었습니다. 배치 크기는 4, 8, 16, 32로 평가되었습니다. 학습률 0.0005, 0.001, 0.0015, 0.002가 검사되었습니다. 검증 성과는 주사위 유사도 계수(DSC)를 주요 지표로 모니터링했습니다. 배치 크기가 8을 초과하면 32GB 미만의 GPU에서 메모리 오버플로우가 발생할 수 있습니다.

모델 평가 및 성과 평가

평가 메트릭 구성

평균 교차 비교(mIoU), 주사위 유사도 계수(DSC), 민감도(Sen), 특이도(Spe), 정확도(Acc) 등 포괄적인 평가 지표가 구현되었습니다. 이 지표들은 다음과 같은 공식에 따라 계산되었습니다:

평균적 교차 오버 유니언(mIoU)은 예측된 세분화와 실제 세분화 간의 중복을 정량화합니다:

figure-protocol-12

주사위 유사도 계수(DSC)는 세분화 일관성을 측정합니다. 수치는 0에서 1까지 다양하며, 더 높은 값은 더 나은 성능을 나타냅니다:

figure-protocol-13

민감도(Sen)는 모델이 양성 샘플을 감지하는 능력을 측정합니다:

figure-protocol-14

S특수성(Spe)은 올바른 부정적 표본 인식을 평가합니다:

figure-protocol-15

정확도(Acc)는 전체 예측 정확성을 측정합니다:

figure-protocol-16

매개변수(M)는 모델 복잡도를 반영하여 총 훈련 가능한 매개변수를 측정합니다:

figure-protocol-17

여기서 Pii번째 계층의 매개변수 수이고, N 은 전체 계층 수입니다. 매개변수 수가 적을수록 임상 배포에 적합한 더 경량화된 모델임을 나타냅니다.

소작 연구 프로토콜

표 1의 실험 설계에 따라 아키텍처 구성 요소의 기여도를 검증하기 위한 포괄적인 소작 연구가 수행되었습니다. 네 가지 아키텍처 변형이 평가되었습니다: H-MUNet(MSDAFN 및 PMFlex 없는 기준선), HP-MUNet(MSDAFN 제외), HM-MUNet(PMFlex 제외), 그리고 HMP-MUNet(완전 모델).

모든 변형에서 동일한 훈련 매개변수가 구성되었습니다: 학습률 0.001, 배치 크기 8, 250 에포크. 훈련 수렴 현상이 모니터링되었고, 각 구성 요소 추가마다 성과 향상이 검증되었습니다.

계산 효율성 분석

매개변수 수, FLOP, 추론 시간 등 다양한 아키텍처 간 계산 효율성 지표가 측정되었습니다. 표준 임상용 GPU에서의 모델 추론 시간 평가 결과, 고성능 GPU에서 가장 좋은 성능을 보이지만, 일반적으로 사용되는 하드웨어에서는 약 70% 느린 것으로 나타났습니다. 그럼에도 불구하고 효율적인 추론 속도를 유지할 수 있어 실용적인 임상 적용에 적합합니다. 훈련 중 GPU 메모리 사용량을 모니터링하여 시스템 안정성을 확인하세요. 배치 크기 8에 권장되는 최소 16GB GPU 메모리 사용 권장입니다.

검증 및 분석

성능 벤치마킹

HMP-MUNet의 성능은 두 데이터셋에서 최첨단 방법과 비교되었습니다. 비교된 모든 모델은 동일한 데이터 분할, 전처리, 데이터 증강, 학습 프로토콜 하에 구현 및 학습하여 성능 차이가 오로지 아키텍처적 차이 때문임을 확인했습니다. ISIC2018 데이터셋과 PH2 데이터셋에서 DSC 개선이 각각 2.89%와 5.25%로 이루어진 정량적 결과가 문서화되었습니다. 연구는 U-Net 기준선에 비해 매개변수 수가 4.55배 감소함을 확인했습니다.

통계 분석

통계적 유의성 검정은 성과 비교를 위해 쌍 t-검정을 사용하여 수행되었습니다. 보고된 지표에 대해 신뢰구간이 계산되었습니다. 재현성은 여러 번의 무작위 시드를 사용한 훈련 실행을 통해 보장되었습니다.

최적의 하이퍼파라미터 구성은 배치 크기 8과 학습률 0.001로 기록되었으며, 실험 결과에 문서화된 대로 PH2 데이터셋에서 최대 DSC 0.9585, ISIC2018 데이터셋에서 0.9044를 달성했습니다. 과적합을 방지하기 위해 충분한 검증 데이터가 확보되었습니다. 조기 중단 기준을 적용하기 위해 검증 손실 곡선을 모니터링하였습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

의료 영상 분할을 위한 HMP-MUNet 아키텍처 설계

제안된 HMP-MUNet 아키텍처는 자동화된 피부 병변 분할 작업에서 탁월한 성능을 입증했습니다. 그림 1 은 8채널에서 256채널로 점진적으로 확장되는 계층적 U자형 인코더-디코더 구조를 보여주는 완전한 네트워크 아키텍처를 보여줍니다. 세 개의 특수 모듈을 교대로 통합한 것은 국소적 형태학적 특징과 정확한 병변 경계 구분에 필수적인 전역 맥락 정보를 모두 포착하는 데 매우 효과적임이 입증되었습니다.

실험적 검증 결과, 깊이를 줄인 수정된 U자형 설계가 4층에서 2층으로 줄여 특징 추출 능력을 성공적으로 유지하면서 계산 부하를 크게 줄였음이 확인되었습니다. 초기 특징 추출을 위한 이중 Conv2D 연산은 256 × 256 × 3 픽셀...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

본 연구는 HMP-MUNet(고차 다규모 병렬 시각 Mamba U-Net)이라는 새로운 딥러닝 프레임워크를 제시하는데, 이는 상태 공간 모델(SSM)과 고급 아키텍처 구성 요소의 혁신적 통합을 통해 피부 병변 분할을 위한 컴퓨터 진단(CAD)의 근본적인 과제를 해결하는 새로운 딥러닝 프레임워크입니다. 여기서 설명된 접근법은 고차 특징 상호작용 메커니즘과 다중 스케일 주의 및 병렬 처리를 결합하면 임상 배포에 중요한 계산 오버헤드를 크게 줄이면서 우수한 진단 정확도를 달성할 수 있음을 보여줍니다. 제안된 프레임워크는 첨단 인공지능(AI) 역량과 실제 임상 적용성 간의 간극을 성공적으로 메우며, PH2에서 95.85%(95% 신뢰구간: [95.5%, 96.2%]), ISIC2018 데이터셋에서 90.44%(95% 신뢰구간: [89.9%, 90.9%]) 데이터셋에서 90.44%의 주사위 유사 계수(DSC)를 달성하며, 기존 Visi...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 이 연구와 이해 상충이 없다고 선언합니다. 저자들과 상업적 단체 간에는 이 원고에 수록된 작업에 부적절하게 영향을 미칠 수 있는 금전적 관계가 존재하지 않습니다. 이 연구는 독립적으로 수행되었으며, 결과와 결론은 전적으로 저자들의 개인적인 견해입니다. 이 원고의 텍스트는 영어가 저자의 모국어가 아니기 때문에 ChatGPT의 도움을 받아 수정 및 다듬어졌습니다. 저자들은 AI 지원이 언어 편집에 한정되었으며, 연구의 과학적 신뢰성에 영향을 미칠 콘텐츠 생성이나 분석은 포함되지 않았다고 확인했습니다.

감사의 글

저자들은 랴오닝성 교육부 과학연구사업이 제공한 재정 지원에 감사드립니다. 이 연구는 랴오닝성 국가자연과학기단 보조금 LJ212510149013 및 일반 프로그램 2024-MSLH-377 하에 제공된 재정 지원을 통해 이루어졌습니다. 이 연구에 사용된 공개 데이터셋에 기여해 주신 연구 참여자와 기관 여러분께 감사드립니다. 덕분에 제안된 방법론의 포괄적 검증이 가능했습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
CUDA 11.8엔비디아 코퍼레이션, 캘리포니아주 산타클라라, 미국소프트웨어
GPU (32GB VRAM)엔비디아운영 체제
ISIC2017 데이터셋ISIC 챌린지https://challenge.isic-archive.com/data데이터셋
ISIC2018 데이터셋ISIC 챌린지https://challenge.isic-archive.com/data데이터셋
NVIDIA V100 GPU엔비디아 코퍼레이션, 캘리포니아주 산타클라라, 미국하드웨어
PH2 데이터셋Universidade Do Portohttps://www.fc.up.pt/addi/ph2데이터셋
파이썬 3.8파이썬RRID:SCR_018536소프트웨어
파이토치 1.13.0파이토치RRID:SCR_018536소프트웨어
Ubuntu 20.04정경하드웨어

참고문헌

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

U NetVision Mamba

관련 논문