방법 논문

의료 영상 분할을 위한 다중 뷰 비전 맘바 U자형 네트워크 프레임워크

DOI:

10.3791/72616

2026년 8월 7일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 의료 이미지 분할을 위한 다중 뷰 Vision Mamba U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 방법을 설명하며, 표준화된 데이터셋 준비, 모델 구현, 성능 평가를 통해 피부 병변과 복부 장기의 재현 가능한 분할을 가능하게 합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

의료 이미지 분할은 전반적 맥락, 국소 경계, 다층 해부학적 구조를 정확히 포착하면서도 다양한 응용 분야에서 재현 가능한 계산 방법이 필요합니다. 이 글은 2차원 의료 이미지 분할을 위한 다중 뷰 비전 맘바 U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 프로토콜을 제시합니다. 이 프로토콜은 공개 데이터셋 획득, 이미지 및 마스크 전처리, 네트워크 구축, 모델 학습, 체크포인트 선택, 정량적 및 정성적 성능 평가를 포함한 재현 가능한 워크플로우를 제공합니다. 이 프레임워크는 다중 뷰 특징 스캔을 통합하여 보완적인 공간, 윤곽, 축척, 경계 정보를 포착하고, U자형 인코더-디코더 아키텍처 내에서 다단계 특징 융합을 적용하여 세분화 중 특징 통합을 향상시킵니다. 이 프로토콜은 공개된 피부 병변 및 복부 장기 분할 데이터셋을 사용하여 시연됩니다. 설명된 구현 워크플로우 하에서, 프레임워크는 표준 평가 지표를 사용하여 경쟁력 있는 세분화 성능을 달성합니다. 이 프로토콜에서 제시된 절차를 따르면, 연구자들은 모델 구현을 재현하고, 정의된 실험 설정을 사용해 네트워크를 훈련하며, 분할 성능을 평가하고, 재현 가능한 딥러닝 기반 분석이 필요한 관련 의료 영상 분할 작업에 맞게 워크플로우를 조정할 수 있습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

의료 영상 분할은 컴퓨터 비전 및 의료 영상 분석 분야에서 기본적인 작업입니다. 1,2,3. 이 과정은 이미지를 여러 영역이나 객체로 나누어 추가 분석과 처리를 수행하는 과정을 포함합니다. 이 기술은 임상의가 병리 영역을 식별하고 국소화하는 데 도움을 주어 진단 정확도와 치료 계획을 향상시키기 때문에 특히 의료 영상에서 중요합니다. 자기공명영상(MRI), 컴퓨터 단층촬영(CT), 양전자 방출 단층촬영(PET)과 같은 의료 영상 기술의 발전과 함께 정확한 의료 영상 분할 기술에 대한 수요가 계속 증가하고 있습니다. 현재 의료 영상 분할 방법은 크게 세 가지 주요 접근법으로 분류할 수 있습니다: 합성곱 신경망(CNN) 기반 방법4, 트랜스포머 기반 방법5, 상태 공간 모델(SSM) 기반 방법 6,7. CNN 기반 방법은 일반적으로 의료 영상 분할을 위해 U자형 네트워크 아키텍처를 사용합니다. 이 범주에서 가장 널리 사용되는 아키텍처는 U-Net8로, 이는 생의학 이미지 분할을 위한 U자형 인코더-디코더 아키텍처의 효율성을 입증했습니다. U-Net3+는 UNet++9의 밀집 스킵 연결과 풀스케일 스킵 연결을 결합하여 다중 스케일 특징 집계를 향상시킵니다. 그러나 CNN 기반 방법은 장거리 의존성을 포착하는 데 한계가 있어 장거리 맥락 정보를 효과적으로 모델링하지 못할 수 있습니다.

트랜스포머 기반 방법은 자기 주의 메커니즘을 통해 장거리 의존성을 효과적으로 포착하며, 병렬 계산을 가능하게 하고 관심 영역별로 다른 주의 가중치를 할당합니다. UNETR++10 은 매개변수 수와 계산 비용을 줄이기 위해 효율적인 쌍 주의(EPA) 모듈을 도입했습니다. nnFormer11 은 인터리브 합성곱 연산과 자기 주의 연산을 결합하고, 3차원(3D) 의료 이미지 분할에서 부피 표현을 학습하기 위한 국소-전역 부피 기반 자기 주의 메커니즘을 도입합니다. H2Former12 는 인코더에서 주의 메커니즘과 CNN 기반 특징 추출을 결합한 효율적인 계층적 하이브리드 비전 트랜스포머를 제안합니다. 하지만 트랜스포머 기반 방법은 시퀀스 길이가 증가할수록 계산 복잡도가 2차 증가하여 계산 비용이 크게 증가합니다. 그림 1 은 MVM-UNet의 동기를 보여주며, 제안된 다중 뷰 스캔 전략을 기존 SSM 기반 분할 프레임워크와 비교합니다.

figure-introduction-1
그림 1. MVM-UNet과 기존의 순수 상태-공간-모델(SSM) 기반 분할 아키텍처 비교. 기존의 순수 상태 공간 모델(SSM) 기반 세분화 프레임워크와 제안된 다중 뷰 맘바 U-Net(MVM-UNet) 아키텍처 간의 비교. 상단 패널은 MVM-UNet을 보여주는데, 이 모듈에서는 다중 뷰 4방향(MV4D) 모듈이 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 이용해 공간을 융합 Mamba(SFusion Mamba)로 통합하여 상호 보완적인 특징을 추출하고, Multi-stage Fusion Mamba(MFusion Mamba)는 디코딩 전에 다중 스케일 인코더 기능을 집계합니다. 하단 패널은 교차 스캔이 가능한 선택적 스캔 2차원(SS2D) 모듈을 사용한 대표적인 순수 SSM 기반 아키텍처를 보여줍니다. 도표는 기존 SSM 기반 세분화 네트워크와 제안된 MVM-UNet 간의 아키텍처적 차이를 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

SSM 기반 방법은 트랜스포머의 전역 모델링 능력과 선형 계산 복잡도를 결합합니다. 맘바 아키텍처는 선택적 상태 공간 모델(Selective-SSM)을 사용하여 입력 정보를 선택적으로 처리하여, 입력에 따라 모델이 매개변수를 동적으로 조정하면서 관련 없는 정보를 필터링하고 정보 제공 기능을 강조할 수 있습니다. Vim13 과 VMamba14 는 Mamba 아키텍처를 컴퓨터 비전 작업에 맞게 적용합니다. U-Mamba15 는 의료 영상 분할에 SSM의 적용을 탐구하기 위해 하이브리드 CNN–SSM 아키텍처를 사용하는 반면, Mamba-UNet16 은 의료 영상 분할을 위해 완전한 SSM 기반 인코더-디코더 아키텍처를 채택합니다. 이 방법들은 훨씬 적은 매개변수를 사용하면서도 경쟁력 있는 성능을 달성합니다. 그러나 현재의 SSM/맘바 기반 방법은 주로 간단한 이미지 패치와 SS2D 스캐닝 전략을 사용하여 이미지 특징을 추출하며, 이는 의료 이미지 분할에 여러 한계를 제공합니다. 첫째, SS2D 및 패치 기반 기법은 주로 일반적인 컴퓨터 비전 작업을 위해 설계되었습니다. Local Mamba17 과 Motion Mamba18 은 SS2D 스캐닝 전략이 모든 시각 작업에 충분하지 않다고 제안했는데, 이는 서로 다른 유형의 시각 정보를 포착하기 때문입니다. 둘째, SS2D 스캔 전략은 비교적 단순하여 수평 및 수직 스캔 방향에만 의존합니다. 따라서 복잡한 공간적 관계나 세밀한 구조적 세부사항을 충분히 포착하지 못할 수 있습니다. 의료 이미지 분할은 전 지구적 공간적 맥락과 정밀한 국부 해부학적 특징을 동시에 모델링해야 합니다. 더불어, 현재의 SSM/맘바 기반 방법은 인코더와 디코더 간의 제한된 기능 융합을 제공합니다. UNet++, FATNet과 같은 아키텍처는 향상된 특징 융합을 통해 분할 정확도를 높이며, 의료 이미지 분할에 효과적인 특징 통합의 중요성을 강조합니다.

이러한 한계를 해결하기 위해 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제안합니다. 그림 1에 나타난 것처럼, 제안된 다중 뷰 4방향(MV4D) 모듈은 MVM-UNet의 핵심 특징 추출 구성 요소로, 네 가지 서로 다른 스캐닝 전략의 정보를 통합하여 의료 이미지 분할을 위해 특별히 설계되었습니다. 각 스캐닝 전략은 상호 보완적인 이미지 특징을 추출하여 입력 이미지의 서로 다른 뷰를 나타냅니다. 지그재그 스캐닝19 는 각 행 또는 열의 끝에서 이동 방향을 번갈아 사용하여 국부와 전역 공간 정보를 균형 있게 조정합니다. 반면, 나선형 및 방사형 스캔 방식20 은 중심에서 바깥쪽이나 주변부에서 안쪽으로 확장하여 포괄적인 범위 커버리지를 제공합니다. 계층적 스캐닝18 은 여러 규모에서 국적·전역적 특징을 모두 포착합니다. 각 스캔 전략의 견고성을 높이기 위해 스캔 쌍은 S6 블록에 입력되기 전에 병합됩니다. 스캔뷰 퓨전 맘바(SFusion Mamba) 모듈은 네 가지 스캔 방식에서 추출한 특징을 통합합니다. 멀티스케일 인코더 기능을 효과적으로 활용하기 위해, 본 논문은 각 인코더 단계의 출력을 축적하고 융합한 후 퓨전 기능을 디코더에 전달하는 멀티스케일 맘바 퓨전 모듈(MFusion Mamba)을 제안합니다. MVM-UNet은 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 평가되었습니다. 실험 결과는 MVM-UNet이 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 경쟁력 있는 세분화 성능을 달성함을 보여줍니다.

대표적인 세분화 아키텍처는 의료 이미지 세분화를 더욱 발전시켰습니다. U-Net은 세포 계수, 검출, 형태계측21과 같은 생의학 영상 분석 과제에도 성공적으로 적용되었습니다. CA-Net22와 같은 주의 강화 CNN 아키텍처는 포괄적인 주의 메커니즘을 통해 특징 표현을 향상시킵니다. TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26, TransCUNet27 등 대표적인 Transformer 기반 세분화 프레임워크들은 의료 이미지 분할을 위한 주의 기반 글로벌 특징 모델링의 효과를 더욱 입증합니다.

MVM-UNet의 설계는 기존 SSM/맘바 기반 분할 방법의 두 가지 한계에 의해 동기부여되었습니다. 첫째, 현재 많은 Vision Mamba 모델은 단순한 2차원 스캐닝 전략에 의존하는데, 이는 불규칙한 병변 경계, 작은 표적 영역, 다층 해부학적 구조를 포함하는 의료 이미지에는 부족할 수 있습니다. 둘째, 기존의 U자형 인코더-디코더 아키텍처는 주로 해당 스킵 연결을 통해 기능을 전송하여, 디코딩 시 다단계 인코더 정보를 직접 사용하는 것을 제한합니다. 따라서 MVM-UNet은 다중 뷰 공간 모델링을 향상시키기 위해 MV4D를, 다단계 인코더 기능을 명시적으로 집계하는 MFusion Mamba를 도입합니다. 이 설계는 맘바 기반 장거리 모델링을 의료 영상 분할의 특정 요구사항에 맞게 조정하기 위해 설계되었습니다.

MVM-UNet은 일반적인 인코더-디코더 패러다임과 맘바 기반 시퀀스 모델링을 기반으로 하지만, 이 구성 요소들이 의료 영상 분할에 맞게 어떻게 적응되고 통합되는지에 새로움이 있습니다. 표준 맘바 블록을 U자형 네트워크 백본에 단순히 통합하는 대신, 제안된 프레임워크는 여러 작업 지향 스캔 쌍 분기를 통해 공간 모델링 과정을 재설계하고, 스캔별 표현을 통합하는 SFusion Mamba를 도입하며, 잔차 및 투영 경로로 MVV 블록을 강화하고, 인코더와 디코더 사이에 MFusion Mamba를 삽입하여 다단계 인코더 기능을 집계한 후 디코딩합니다. 이 아키텍처 수준의 설계는 의료 이미지에서 흔히 관찰되는 불규칙한 경계, 작은 목표 영역, 다층 해부학적 구조를 해결하는 것을 목표로 합니다.

이 프로토콜은 2차원 의료 이미지에서 장거리 맥락 정보, 불규칙한 물체 경계, 다중 규모 해부학적 구조를 동시에 모델링해야 하는 분할 작업에 가장 적합합니다. CNN 기반 분할 방법과 비교할 때, 맘바 기반 인코더-디코더 설계는 의료 이미지 분할 연구자들이 익숙한 U자형 워크플로우를 유지하면서 효과적인 맥락 모델링 메커니즘을 제공합니다. 트랜스포머 기반 방법과 비교할 때, 제안된 프레임워크는 이차 자기 주의를 직접 사용하지 않으며, 비교적 효율적인 시퀀스 모델링 메커니즘을 이용한 전역 맥락 모델링을 추구하는 연구자들을 위한 것입니다. 따라서 이 프로토콜은 피부 병변 분할, 복부 장기 분할 및 전반적 구조 정보와 국소 경계 세부사항이 모두 중요한 유사한 2차원 의료 영상 분할 작업에 적합합니다.

이 프로토콜에는 사용 전에 고려해야 할 제한 사항도 있습니다. 경량 CNN이 이미 충분한 성능을 제공하는 비교적 단순한 분할 작업에는 필요하지 않을 수 있습니다. 또한, 아키텍처적 적응 없이 완전한 3차원 체적 분할을 위해 직접 설계된 것은 아닙니다. 주석이 달린 데이터가 매우 제한적이거나, 그래픽 처리 장치(GPU) 자원이 제한적이거나, 해석 가능한 고전 모델이 요구되는 연구자들도 프로토콜을 적용하기 전에 이러한 제약 조건을 고려해야 합니다. 전반적으로 이 방법은 장거리 맥락 모델링, 국소 경계 표현, 다단계 특징 융합을 균형 있게 결합한 맘바 기반 U자형 분할 프레임워크를 재현하고 평가하려는 연구자들을 위한 것입니다.

주요 기여는 다음과 같습니다:

1. 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제시합니다. 기존의 SS2D 기반 또는 표준 맘바 블록을 직접 통합하는 접근법과 달리, MVM-UNet은 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 뷰에서 의료 영상 특징을 모델링하는 MV4D를 도입합니다.

2. 본 논문은 SFusion Mamba와 MVV 블록을 설계하여 스캔 특화 표현을 통합하고 특징 변환을 향상시키도록 합니다. SFusion Mamba는 서로 다른 스캔쌍 가지에서 추출한 특징들을 융합하는 반면, MVV 블록 내의 잔류 및 상하 투사 분기는 특징 표현을 안정화하고 풍부하게 하는 상호 보완적인 특징 경로를 제공합니다.

3. 본 논문은 인코더와 디코더 사이의 중간 다단계 융합 모듈로서 MFusion Mamba를 소개합니다. 주로 대응하는 단계 특징을 전달하는 기존의 스킵 연결과 달리, MFusion Mamba는 다단계 인코더 기능을 거친 융합에서 미세한 융합으로 명시적으로 집계하며, 디코딩을 위한 풍부한 정보를 제공합니다.

4. 광범위한 실험 결과에 따르면 제안된 MVM-UNet은 ISIC 2017 및 ISIC 2018 데이터셋에서 경쟁력 있는 세분화 성능을 보이며, Synapse 다기관 세분화 데이터셋에서는 강력한 성능을 보입니다. 더 나아가, 포괄적인 절제 연구는 MVM-UNet 내 각 구성 요소의 기여를 검증합니다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 ISIC 2017, ISIC 2018, Synapse 등 공개적으로 이용 가능한 및 식별 해제된 의료 이미지 데이터셋만을 사용했습니다. 이 연구에서는 새로운 인간 참가자, 동물 대상 또는 식별 가능한 개인 의료 기록이 수집되지 않았습니다. 본 연구에 사용된 ISIC 2017 데이터셋은 공식 국제 피부 영상 협력 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2017)에서 얻은 ISIC 2017 챌린지 피부 병변 분절 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2017 병변 분할 과제에 해당하며, 공식 훈련, 검증 및 테스트 파티션을 포함합니다. 이 데이터셋은 2024년 3월 15일에 다운로드되었습니다. 본 연구에 사용된 ISIC 2018 데이터셋은 공식 국제 피부 영상 협력체 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2018)에서 얻은 ISIC 2018 챌린지 과제 1 병변 경계 분할 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2018 과제 1: 병변 경계 분할에 해당합니다. 데이터셋은 2024년 7월 8일에 다운로드되었습니다.

본 연구에서 사용된 시냅스 데이터셋은 Synapse 저장소에서 accession identifier syn3193805 (https://www.synapse.org/Synapse:syn3193805) 하에 얻은 Multi-Atlas Labeling Beyond the Cranial Vault 복부 CT 데이터셋이었습니다. 본 연구에서 사용된 데이터셋은 일반적으로 사용되는 30건의 복부 CT 다기관 분할 데이터셋에 해당합니다. 다운로드된 아카이브는 Abdomen/RawData.zip로, accession syn3193805로 이용 가능하다. 다운로드 당시 저장소에서는 별도의 버전 번호, 릴리스 라벨, 날짜가 명시된 릴리스 태그를 제공하지 않았습니다. 이전 연구에서 채택된 표준 분할에 따라 18건은 훈련에, 12건은 시험에 사용되었습니다. 데이터 분할은 TransUNet23가 사용한 사례 목록을 따랐습니다. 구체적으로, 교육 사례는 case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, case0037이었으며, 테스트 사례는 case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, case0035였습니다. 이 데이터셋은 2024년 7월 9일에 다운로드되었습니다. 이 연구는 공개된 식별 해제 데이터셋만을 사용했고, 새로운 인간-피험자 데이터나 식별 가능한 개인 정보 수집을 포함하지 않았기 때문에, 이 프로토콜에 설명된 계산 실험에 대해 기관심사위원회의 승인이 필요하지 않았습니다. 공식적인 기관 면제 결정은 이루어지지 않았다. 지역 기관 정책에 의해 요구되는 경우, 연구자들은 공개된 데이터셋에 대한 2차 분석을 수행하기 전에 기관 면제 결정을 받아야 합니다. 이 연구에는 기관 윤리 면제 참조 번호나 공식 면제 문서가 제공되지 않았습니다.

1. 데이터셋 준비

  1. ISIC 2017 피부병변 분할 데이터셋을 공식 국제 피부 영상 협력 저장소에서 다운로드하세요. 공식 교육, 검증, 테스트 파티션을 사용하세요. 데이터셋에 2,000개의 학습 이미지, 150개의 검증 이미지, 600개의 테스트 이미지가 포함되어 있는지 확인하세요.
  2. ISIC 2018 피부 병변 분할 데이터셋을 국제 피부 영상 협력 공식 저장소에서 다운로드하세요. 공식 교육, 검증, 테스트 파티션을 사용하세요. 세분화 데이터셋에 2,594개의 학습 이미지, 100개의 검증 이미지, 1,000개의 테스트 이미지가 포함되어 있는지 확인하세요.
  3. 시냅스 다기관 분할 데이터셋을 다운로드하세요. 훈련용으로 18사례(2,212 축 단면)와 12 사례(1,567 축 단면)로 구성된 표준 분할을 사용하세요. 별도의 검증 세트를 도입하지 마세요.
    1. 12건의 검사 사례는 최종 평가용으로 예약하세요. 테스트 케이스를 모델 학습, 하이퍼파라미터 튜닝, 모델 선택에 사용하지 마십시오. 분할 작업에는 대동맥, 담낭, 비장, 왼쪽 신장, 오른쪽 신장, 간, 췌장, 위 등 8개의 복부 장기가 포함됩니다.
    2. 다음 Synapse 데이터셋 분할을 사용하세요. 18개의 교육 사례는 case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, case0037입니다. 12건의 검사 사례는 case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, case0035였습니다.
  4. 각 데이터셋을 별도의 이미지 폴더와 마스크 폴더로 정리하세요. 각 이미지가 동일한 케이스 식별자를 가진 해당 세분화 마스크를 갖도록 하세요.
    1. 각 피부 병변 마스크를 이진 전경-배경 분할 맵으로 변환합니다. Synapse 데이터셋의 원래 다중 클래스 기관 라벨을 유지하세요.
    2. ISIC 2017 및 ISIC 2018 데이터셋의 경우, 이진 마스크 변환 후 배경 픽셀에는 0, 병변(전경) 픽셀에 1을 라벨 값을 할당합니다. 원본 마스크 값이 0보다 큰 픽셀은 전경으로 간주되어 1로 변환되고, 원본 마스크 값이 0인 픽셀은 배경으로 간주되어 0으로 유지됩니다. Synapse 데이터셋의 경우, 0은 배경 클래스, 1–8은 전경 8개의 전경 오르간 클래스를 나타내는 원래 정수 라벨 값을 유지합니다.
  5. ISIC 2017과 ISIC 2018의 이미지와 마스크를 원본 화면 비율을 유지하지 않고 256 × 256 픽셀로 크기 조정합니다. 크롭이나 패딩을 적용하지 마세요.
    1. 각 Synapse CT 슬라이스와 해당 라벨을 224 × 224 픽셀로 크기 조정하세요. RGB 이미지에는 쌍선형 보간을, CT 슬라이스에는 3차 스플라인 보간을, 세그멘테이션 마스크에는 최근이웃 보간을 사용하세요.
    2. 파이썬에서 이미지 크기 조절.
      1. ISIC 2017 및 ISIC 2018 데이터셋의 경우, utils.py 에서 구현된 맞춤형 myResize 변환을 사용하여 torchvision.transforms.functional.resize를 호출하여 이미지 및 마스크 텐서를 256 × 256 픽셀로 재조정합니다. 이 변환에서 명시적인 보간 모드나 안티앨리어싱 인수를 지정하지 마세요.
      2. Synapse 데이터셋은 datasets/dataset.py 에서 scipy.ndimage.zoom을 사용하세요. 3차 스플라인 보간(차수 = 3)을 사용해 CT 이미지 슬라이스를 224 × 224 픽셀로 크기 조정하고, 최근접 이웃 보간(차수 = 0)으로 라벨 맵을 크기 조정합니다. 크기 조절 시 별도의 안티앨리어싱 작업이나 anti_aliasing=True 설정을 적용하지 마세요.
  6. 텐서 변환 전에 데이터셋별 평균 및 표준편차(SD)를 사용하여 다음과 같은 을 사용하여 각 ISIC RGB 이미지를 정규화합니다:
    figure-protocol-1(1)
    그 후 최소 최대(min–max) 정규화를 사용해 0–255 범위로 정규화된 이미지를 재조정합니다.
    1. ISIC 2017 학습 세트에는 μ = 159.922, σ = 28.871, ISIC 2017 검증 및 테스트 세트에는 μ = 148.429, σ = 25.748을 사용하세요. ISIC 2018 훈련 세트에는 μ = 157.561, σ = 26.706을, ISIC 2018 검증 및 테스트 세트에는 μ = 149.034, σ = 32.022를 사용하세요.
    2. 각 정규화된 이미지를 3 × 256 × 256의 텐서로 변환합니다. 각 이진 마스크를 1 × 256 × 256의 텐서로 변환합니다.
    3. 데이터셋별 평균 및 표준편차 정규화 후 각 이미지에 대해 독립적으로 최소-최대 정규화를 수행합니다. 구체적으로, 각 이미지에서 데이터셋별 평균을 빼고 해당 표준편차로 나누는 것입니다.
    4. 정규화된 이미지에서 최소 및 최대 강도 값을 계산하고, 이 이미지별 최소값과 최대 값을 사용하여 0–255 범위로 이미지를 재조정합니다. 이 최소 최대 재조정 단계에 대해 데이터셋 전체 최소값과 최대값을 사용하지 마십시오.
  7. 각 Synapse CT 슬라이스를 2차원 그레이스케일 이미지로 준비하세요. 각 CT 슬라이스를 float32로 변환하고 단일 채널 차원을 더하면 1 × 224 × 224의 입력 텐서를 얻습니다.
    1. 각 Synapse 라벨 맵은 224 × 224 모양의 단일 채널 정수 마스크로 유지합니다. 데이터 로더에서 추가적인 데이터셋 수준의 평균 표준값 정규화를 적용하지 마십시오.
    2. 학습 슬라이스에는 .npz 형식으로 제공된 사전 처리된 Synapse 파일을 사용하고, 볼륨 테스트에는 .npy.h5 형식을 사용하세요. 교육 중에는 각 .npz 파일에서, 테스트 중에는 각 .npy.h5 파일에서 직접 이미지 및 라벨 배열을 불러오세요. 공개된 데이터 로더에서는 추가적인 강도 클리핑, CT 윈도잉, 데이터셋 수준 정규화, 원시 볼륨 재샘플링을 적용하지 마십시오.
    3. 모델 학습 중에는 로드된 각 2차원 슬라이스를 float32로 변환하고, scipy.ndimage.zoom을 사용해 이미지 슬라이스의 순서는 = 3, 라벨 맵은 순서 = 0으로 하여 목표 공간 크기로 크기를 조정한 후, 크기 변경된 배열을 싱글톤 채널 차원의 텐서로 변환합니다.
  8. 데이터 증강은 훈련 세트에만 적용하세요. ISIC 2017과 ISIC 2018에서는 0°에서 360°까지 샘플링한 각도로 무작위 수평 뒤집기(p = 0.5), 무작위 수직 뒤집기(p = 0.5), 무작위 회전(p = 0.5)을 적용합니다.
    1. 각 이미지 마스크 쌍에 동일한 기하학적 변환을 적용합니다. 검증 및 테스트 중에는 크기 조정, 정규화, 텐서 변환만 적용하세요.
    2. Synapse 데이터셋의 경우, 훈련 중에 무작위 회전과 무작위 뒤집기를 적용하세요. 각 이미지 라벨 쌍을 무작위로 k × 90°(여기서 k ∈ {0,1,2,3})로 회전시키거나, 한 공간 축을 따라 무작위로 뒤집거나, −20°에서 20° 사이에서 샘플링한 각도로 이미지-라벨 쌍을 무작위로 회전시키세요.
    3. 테스트 중에는 확률적 증강을 적용하지 마십시오.
    4. RandomGenerator 변환에서 구현된 상호 배타적 분기를 사용하여 Synapse 데이터셋에 데이터 증강을 적용합니다.
      1. 각 학습 샘플에 대해 먼저 조건 random.random() > 0.5를 평가합니다. 이 조건이 충족되면 무작위로 90° 회전(k = 0, 1, 2, 3)과 한 공간 축을 따라 무작위 뒤집는 random_rot_flip을 적용합니다.
      2. 첫 번째 분기가 선택되지 않으면 두 번째 조건인 random.random() > 0.5를 평가합니다. 이 조건이 충족되면 −20°에서 20° 사이의 무작위 회전각을 선택해 random_rotate 적용합니다. 두 조건 모두 충족되지 않으면 표본에 확률적 증강을 적용하지 마십시오.
      3. 동일한 변환을 입력 이미지와 해당 라벨 맵 모두에 적용합니다.
  9. 데이터셋 로딩, 전처리, 학습 전에 랜덤 시드를 설정하세요. 주요 비교 실험에는 무작위 씨앗 1, 52, 100을 사용하고, 별도 명시가 없는 한 소작 검사에는 씨앗 100을 사용하세요.
    1. 데이터 로더를 구축하기 전에 Python, NumPy, PyTorch CPU, PyTorch CUDA, cuDNN 무작위 생성기를 초기화하세요. 모든 시드 실행에서 데이터셋 파티션, 전처리 절차, 증강 설정, 정규화 매개변수, 크기 조절 전략, 평가 전처리는 변경하지 않도록 유지하세요.
    2. ISIC과 Synapse 실험 모두에 대해 num_workers = 0으로 설정하여 메인 프로세스에서 데이터 로딩을 수행합니다. 데이터셋을 구성하고 DataLoader를 만들기 전에, Python, NumPy, PyTorch CPU, PyTorch CUDA, cuDNN 난수 생성기를 시딩하는 set_seed 함수를 사용해 글로벌 랜덤 시드를 초기화합니다. 별도의 worker_init_fn 또는 DataLoader 전용 무작위 생성기를 정의하지 마세요. 이들은 출시된 구현에서 사용되지 않습니다.

2. MVM-UNet 아키텍처의 구성

  1. U자형 인코더-디코더 아키텍처를 사용하여 제안된 다중 뷰 비전 맘바 유닛(MVM-UNet)을 구축합니다.
  2. 입력 이미지 크기를 H × W × 3으로 설정하세요. 입력 이미지를 패치 임베딩 레이어를 통과시킵니다.
    1. 커널 크기가 4× 4, 스트라이드가 4, 입력 채널 3개, 출력 채널 96개인 2D 합성곱을 사용해 패치 임베딩 계층을 구현합니다.
    2. 입력 특징 맵을 H/4 × W/4의 공간 해상도로 변환하고, C = 96개의 출력 채널을 사용합니다.
  3. 네 개의 인코더 단계와 네 개의 디코더 단계를 구성합니다. 인코더 단계마다 공간 해상도를 절반으로 줄이고 채널 차원을 두 배로 늘리세요.
  4. 대칭 인코더-디코더 구성을 사용하세요. 인코더와 디코더 모두에서 MVV 블록 수를 {2, 2, 2, 2}로 설정하세요.
    1. 각 인코더 단계에 MVV 블록 2개, 디코더 단계마다 2개의 MVV 블록을 배치하세요.
  5. 모든 인코더와 디코더 단계에 MVV 블록을 삽입하세요. 각 MVV 블록 내에서 MV4D 모듈을 핵심 특징 추출 모듈로 사용하세요.
  6. 인코더와 디코더 사이에 MFusion Mamba 모듈을 삽입하세요. 이 모듈을 사용해 디코딩 전에 다단계 인코더 기능을 융합하세요.
  7. 전체 MVM-UNet 워크플로우를 구성하세요. 인코더 전체에서 특징 추출을 위해 MV4D를 사용하세요.
    1. 인코더 출력은 스킵 연결로 유지하세요. 인코더 출력을 해당 디코더 단계로 전달합니다.
    2. 디코딩 전에 인코더 기능을 MFusion Mamba에 전달하세요. 퓨전 표현을 디코더를 통해 점진적으로 업샘플링하여 분할 헤드를 사용해 최종 분할 맵을 생성합니다.
  8. 입력 ∈이미지를 RB×H×W×3 을 패치 임베딩 레이어를 통과시키면 여기서 C = 96을 얻 figure-protocol-2 습니다.
    1. 인코더 특징 맵 생성: E1 ∈ RB×H/4×W/4×C, E2 ∈ RB×H/8×W/8×2C, E3 ∈ RB×H/16×W/16×4C, E4 ∈ RB×H/32×W/32×8C. 모든 인코더 단계에 MV4D가 포함된 MVV 블록을 사용하세요.
    2. 해당 스킵 연결에 대해 모든 인코더 기능을 보존하세요. 모든 인코더 기능을 MFusion Mamba로 전달하여 다단계 기능 융합을 진행하세요.
    3. MFusion Mamba 내에서 거칠고 미세 융합하기 전에 인코더 특징을 공통 특징 공간에 정렬하세요. 퓨즈 표현을 디코더에 전달합니다.
    4. 디코더 표현을 점진적으로 업샘플링하세요. 디코더 기능을 H/16 × W/16, E2 H/8 × W/8, E1 H/4 × W/4 퓨전합니다.
    5. 최종 디코더 기능을 원본 이미지 해상도로 업샘플링합니다. RB×H×W×K ∈ 예측 지도 figure-protocol-3 를 생성합니다. 여기서 이중 병변 분할은 K = 1, 시냅스 다기관 분할은 K = 8입니다.
    6. 전체 네트워크 아키텍처는 그림 2 를, 각 단계별 연산, 주요 매개변수, 출력 기능 치수를 포함한 전체 계층별 아키텍처 명세는 보조 표 1 을 참조하십시오
    7. 인코더-디코더 전이 계층
      1. 다운샘플 인코더는 패치 머징 전환 계층을 사용하는 기능입니다. 각 전이마다 2× 2 이웃에서 공간적으로 교차된 네 가지 특징군을 샘플링하여 채널 차원을 따라 연결하고, 레이어 정규화(Layer Norm)를 적용한 뒤, 결과 4C 차원 특징을 바이어스 없는 선형 층을 사용해 2C 채널에 투영합니다. 이 연산은 공간 해상도를 2배로 낮추면서 채널 차원을 두 배로 늘립니다.
      2. 패치 확장 전이 계층을 사용하는 업샘플 디코더 기능. 바이어스 없는 선형 투영법을 적용하고, 확장된 특징을 공간적으로 재배열하여 해상도를 2배 높인 뒤, 공간 확장 후에 레이어노름을 적용합니다. 이 과정을 반복하여 H/32 × W/32에서 H/16 × W/16, H/8 × W/8, H/4 × W/4로 점진적으로 특징 지도를 재구성합니다.
      3. MFusion Mamba 모듈 내 인코더 특징을 쌍선형 보간(align_corners = False)으로 대상 공간 해상도에 맞게 크기 조정한 후, 특징 융합 전에 학습 가능한 선형 채널 투영을 적용합니다.
    8. 세분화 헤드
      1. 최종 패치 확장 레이어를 사용해 최종 디코더 특징 맵을 H/×4에서 W/4에서 원래 이미지 해상도(H × W)로 업샘플링합니다. 선형 투영을 적용하고, 팽창 계수 4로 공간 재배열을 수행한 후 LayerNorm을 적용합니다.
      2. 텐서를 채널 우선 형식으로 변환한 후 1 × 1 합성곱을 사용해 재구성된 특징 맵을 K 출력 채널로 투영합니다.
      3. 평가 시 이진 병변 분할에는 S모이드 활성화 함수를, 시냅스 다기관 분할에는 소프트맥스 활성화 후 argmax를 적용하여 최종 예측을 생성합니다. 세그멘테이션 헤드 자체에 활성화 기능을 적용하지 마세요.

figure-protocol-4
그림 2. 멀티뷰 맘바 U-Net(MVM-UNet)의 전체 아키텍처. 제안된 멀티뷰 맘바 U-Net(MVM-UNet) 아키텍처 개요. 입력 이미지는 패치 임베딩으로 변환되며, 멀티뷰 비전(MVV) 블록으로 구성된 네 개의 인코더 단계를 거치며 패치 머지 작업으로 분리됩니다. 인코더 기능은 다단계 퓨전 맘바(MFusion Mamba)에 의해 집계되어 스킵 연결을 통해 디코더로 전파됩니다. 디코더는 패치 확장 연산을 통해 공간 해상도를 점진적으로 복원하고, 투영 계층을 통해 최종 분할 지도를 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

3. MV4D 모듈 제작

  1. MVV 블록에서 기본 특징 추출 장치로 MV4D 모듈을 사용하세요. 입력 기능 패치를 네 개의 스캔 쌍 분기로 입력합니다. 공간 평탄화, 스캔 쌍 인덱스 생성, 서열 수집, S6/맘바 처리, 역공간 재정렬, 스캔 쌍 융합, SFusion 맘바 융합, 투영, 출력 재형성의 완전한 의사 코드를 참조하라.
  2. 모델/mvmunet/core.py 에서 구현된 정확한 지그재그, 계층, 나선, 방사형 스캔 인덱스 생성 절차를 사용하세요. 각 스캔 전략에 대해 순방향 스캔 순서와 역방향 순서를 하나의 양방향 스캔 쌍으로 사용합니다.
  3. 지그재그 스캔 쌍을 구성하세요. 각 행이나 열의 끝에서 이미지를 교차 방향으로 횡단시킵니다. 이 스캔 패턴을 사용해 국소와 전 세계 공간 정보를 균형 있게 조정하세요.
  4. 계층적 스캔 쌍을 구성합니다. 포획 특징은 여러 공간 규모에서 이루어집니다. 이 스캔 패턴을 활용해 로컬 및 글로벌 표현 추출을 강화하세요.
  5. 나선형 스캔 쌍을 구성하세요. 이미지 특징을 중심에서 경계 쪽으로 또는 경계에서 중심으로 스캔하세요. 이 스캔 패턴을 사용하여 전역 윤곽 정보 추출을 강화합니다.
  6. 방사형 스캔 쌍을 구성하세요. 여러 방사형 방향에 따라 이미지 특징을 스캔합니다. 이 스캔 패턴을 사용하여 국소 경계 및 경계 세부 정보를 추출하는 데 도움을 줍니다.
  7. 각 스캔 쌍을 병합한 후 병합된 시퀀스를 S6 블록에 입력하세요. 쌍 설계를 활용해 각 스캔 전략의 견고성을 높이면서도 계산 효율성을 유지하세요.
  8. 각 스캔 쌍 분기의 출력 시퀀스를 S6 블록에 입력합니다. 지그재그, 계층적, 나선형, 방사형 스캐닝 뷰에 해당하는 네 가지 특징 표현을 얻습니다.
  9. SFusion Mamba 모듈을 사용해 추출한 네 가지 특징 표현을 융합합니다. 두 개의 평행한 융합 경로를 사용하세요. 첫 번째 경로에서는 네 가지 특징을 요소별 덧셈으로 통합합니다.
  10. 두 번째 SFusion Mamba 경로에서는 네 가지 특징을 연결하세요. Conv1d와 Mamba를 사용하여 연속된 표현을 처리합니다. 채널 치수를 S6 블록 출력 치수에 맞게 프로젝션 레이어를 사용해 줄이세요.
  11. 모델 차원으로 특징 차원 C를 사용하여 S6/Mamba 블록을 구성하세요. 투영 레이어를 사용해 융합 전에 각 병합된 스캔 쌍 특징을 채널 차원 C로 매핑하세요.
  12. SFusion Mamba에서는 첫 번째 경로에서 원소별 덧셈을 수행하세요. Conv1d, Mamba, 선형 투영 앞의 두 번째 경로에서 네 개의 스캔 뷰 특징을 연결한다. 4단계에서 설명한 대로 MV4D를 둘러싼 정규화, 선형 투영, 깊이별 분리 합성곱, 활성화 연산을 사용하세요.
  13. 두 융합 경로의 출력을 더해 MV4D 모듈의 최종 출력을 얻습니다.
  14. 수평 및 수직 스캔 방향만 사용하는 대신 네 개의 상호 보완적인 스캔 쌍 분기를 구성하세요. 지그재그 스캐닝을 사용해 연속적인 공간 횡단을 강조하고, 계층적 스캐닝을 통해 다중 스케일 표현을 강화하며, 나선형 스캐닝을 통해 중심에서 경계까지의 윤곽선 정보를 캡처하고, 방사형 스캐닝을 통해 경계 지향적 지역 세부 정보 추출을 강화합니다.
  15. 각 스캔 쌍 분기를 독립적으로 처리합니다. 결과물들을 SFusion Mamba로 융합하세요. 각 처리된 서열을 융합 전 원래 공간 순서로 다시 매핑합니다.
  16. 입력 특징 사상 X가 RB×H×W×C ∈주어지면, 이를 RB×L×CX연속으로 평평화하는데, 여기서 L = H × W
  17. 평탄화된 시퀀스를 각 스캔 쌍 분기의 스캔 인덱스에 따라 재정렬합니다. 재정렬된 각 서열을 S6 블록을 사용해 처리합니다. 처리된 시퀀스를 원래의 공간 순서로 복원합니다.
  18. 네 가지 스캔 뷰 기능을 가산 경로와 SFusion Mamba 경로를 융합하여 최종 MV4D 출력을 얻습니다. MV4D 아키텍처는 그림 3 과 전체 텐서 수준 구현 워크플로우는 알고리즘 1, 보충 파일 1 을 참조하십시오.
  19. 모델/mvmunet/core.py 에서 완전한 소프트웨어 구현을 사용하세요. 이 파일에는 스캔 인덱스 생성기인 PairwiseScanMamba, SequenceS6, SFusion Mamba, 그리고 MV4D 래퍼 모듈이 포함되어 있습니다.
  20. 멀티뷰 스캔 인덱스 생성
    1. models/mvmunet/core.py 에서 공개된 구현을 따라 스캔 인덱스를 생성하세요. 공간 크기의 입력 특징 지도를 H× W를 사용하면, 각 픽셀 위치를 1차원 인덱스로 평탄화하는데, 인덱스 = r × W + c를 사용하며, 여기서 are와 c는 각각 행과 열의 좌표를 나타냅니다.
    2. 이미지 대각선을 상수 r + c로 횡단하여 지그재그 스캔을 생성합니다. 각 대각선의 유효한 픽셀 인덱스를 수집하고, 짝수 번호 대각선의 순서를 반대로 하여 이동 방향을 번갈아 가며 진행합니다.
    3. 이미지를 재귀적으로 네 개의 사분면으로 나누어 계층적 스캔을 생성합니다. 왼쪽 위, 오른쪽 위, 왼쪽 아래, 오른쪽 아래 사분면을 차례로 방문하여 하위 영역의 높이나 너비가 2픽셀을 넘지 않을 때까지 한 후, 나머지 픽셀들은 행 순서대로 순회합니다.
    4. 나선형 스캔은 상단 행을 따라 왼쪽에서 오른쪽으로, 오른쪽 열을 따라 아래로, 아래쪽 행을 따라 오른쪽에서 왼쪽으로, 왼쪽 열을 따라 위쪽으로 이동하면서 화면 중앙 쪽으로 경계를 점차 줄여가면서 생성합니다.
    5. 각 픽셀을 이미지 중심으로부터의 제곱 거리로 정렬하고, atan2 함수를 사용해 계산한 극각에 따라 반경 스캔을 생성합니다.
    6. 각 스캔 전략에 대해 해당 순방향 스캔 순서를 역방향으로 하여 역스캔을 생성합니다. 순방향 및 후진 스캔 시퀀스를 결합하여 각 스캐닝 전략에 대해 하나의 스캔 쌍을 형성한 후 MV4D 모듈로 스캔 쌍을 전달합니다.

figure-protocol-5
그림 3. 멀티뷰 4방향(MV4D) 모듈의 아키텍처. 다중 뷰 4방향(MV4D) 특징 추출 모듈의 구조. 입력 패치는 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 분기를 통해 처리됩니다. 네 가지 분기에서 추출한 특징들은 병합되고, 상태 공간 블록을 사용해 처리되며, Spatial Fusion Mamba(SFusion Mamba)에 의해 통합되어 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

4. MVV 블록 건설

  1. MVV 블록은 하나의 메인 지선과 두 개의 보조 지선을 사용해 건설합니다. 그림 4에 표시된 전체 구조를 사용하세요.
  2. 메인 브랜치의 입력 기능에 레이어 정규화를 적용하세요. 정규화된 특징을 선형 층에 입력하세요. 변환된 특징을 깊이별 분리 가능한 합성곱에 전달합니다.
  3. 변환된 특징을 깊이별 분리 합성곱을 사용해 처리합니다. GELU 활성화 기능을 적용하세요. 활성화된 기능을 MV4D 모듈에 입력하세요.
  4. 첫 번째 보조 분기를 항등 잔류 연결로 구성한다. 입력 기능을 최종 출력에 직접 연결하세요. 이 분기를 사용해 원래의 표현을 보존하고 훈련을 안정화하세요.
  5. 두 번째 보조 가지를 투영 하행 가지로 구성하세요. 입력 특징을 다운프로젝션 레이어를 사용해 압축합니다. 업프로젝션 레이어를 사용해 특징 차원을 복원합니다.
  6. 메인 브랜치와 두 보조 브랜치의 출력을 병합하세요. 최종 MVV 블록 출력을 얻으세요. 전체 아키텍처는 그림 4를 참조하세요.
  7. 메인 브랜치의 숨겨진 차원을 입력 채널 차원 Cs와 같게 설정합니다. 주요 선형 투영 전에 LayerNorm(Cs)을 적용하고, 치수 CsCs의 선형 레이어를 사용하세요. 깊이별로 분리 가능한 컨볼루션을 사용하는데, 3×3 깊이 방향 합성 컨볼루션을 패딩 1, 군 = Cs, 편향 없는 1×1 점별 컨볼루션으로 구성됩니다.
  8. 깊이별 분리 가능한 합성곱 후에 GELU 활성화 함수를 적용합니다. 활성화된 특징을 MV4D에 입력하고, CsCs의 출력 선형 투영법을 적용합니다. LayerNorm(Cs), 투영 비율 4, 하행 투영 CsCs/4, GELU 활성화, 그리고 상향 투영 Cs/4→Cs를 사용하여 투영 하행 분기를 구성합니다.
  9. 원소별 덧셈을 사용하여 동일 분기, 투영 다운업 분기, 드롭 패스 처리된 메인 분기를 결합하여 최종 MVV 블록 출력을 얻습니다.

figure-protocol-6
그림 4. 멀티뷰 비전(MVV) 블록의 아키텍처. 멀티뷰 비전(MVV) 블록의 구조. 이 블록은 다중 뷰 4방향(MV4D) 모듈과 깊이별 합성곱, 정규화, 선형 투영 계층을 포함하는 주요 특징 추출 분기로 구성되어 있습니다. 보조 상하 투영 분기는 요소별 곱셈을 통해 게이티드 특징 변조를 제공하며, 잔류 덧셈을 통해 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

5. MFusion Mamba 건설

  1. 모든 인코더 단계의 특징 맵을 수집하세요. 필요 시 인코더 기능을 크기를 조정하거나 투영하여 통합 표현 공간에 정렬하세요. 전체 텐서 수준 구현 워크플로우는 알고리즘 2, 보조 파일 1 을 참조하십시오.
  2. 필요 시 인코더 특징을 목표 공간 해상도에 맞게 크기 조정합니다. 서로 다른 채널 차원의 특징을 같은 채널 차원에 투영합니다. 다단계 융합 전에 모든 인코더 기능을 정렬하세요.
  3. 정렬된 인코더 기능을 거친 융합 컴포넌트에 입력하세요. Hadamard 제품을 사용하여 거칠게 융합을 수행하세요. 거친 융합 표현을 생성하세요.
  4. 거친 융합 표현을 미세 융합 성분에 넣습니다. 두 개의 평행한 미세 융합 경로를 구축하세요. 두 경로를 독립적으로 처리하세요.
  5. 선형 레이어를 사용하여 첫 번째 미세 융합 경로를 처리합니다. 두 번째 미세 융합 경로를 업프로젝션, Conv1d, Mamba, 다운프로젝션을 사용해 처리합니다. 하향 투사 후 특징 차원을 복원합니다.
  6. 두 미세 융합 경로의 출력을 Hadamard 곱을 사용해 병합합니다. 최종 선형 레이어를 적용하세요. MFusion Mamba 출력을 얻으세요.
  7. MFusion Mamba 출력을 디코더에 입력하세요. 퓨즈드 다단계 표현과 인코더-디코더 스킵 기능을 함께 디코딩합니다. 최종 세분화 지도를 생성하세요.
  8. 서로 다른 단계의 인코더 특징들을 통합된 특징 공간으로 정렬한 후 거친 융합을 진행하세요. 조잡 및 미세 융합 단계를 사용하여 정렬된 특징 표현을 처리합니다. MFusion Mamba 아키텍처는 그림 5 를 참조하고, 전체 텐서 수준 구현 워크플로우는 보조 알고리즘 2를 참조하세요.
  9. MFusion Mamba 구현 매개변수를 다음과 같이 사용하세요. 각 인코더 특징 Ei 에 대해 채널 차원을 Ci 에서 Ct로 투영합니다. 필요 시 align_corners=False를 적용한 쌍선형 보간법을 사용해 투영된 특징을 목표 공간 크기로 재조정합니다.
  10. Hadamard 제품을 적용하여 정렬된 인코더 특징에 대해 거친 융합을 수행합니다. 첫 번째 미세 융합 경로를 C t → C t의 선형 층으로 구성합니다. 두 번째 미세 융합 경로를 2Ct→ 상향 투영 C t, Conv1d, 모델 차원 2Ct, 하나의 스캔 방향, 상태 차원 16, 그리고 하향 투영 2Ct Ct를 사용하여 구성합니다.
  11. 미세 융합 경로의 출력을 Hadamard 곱을 사용해 융합합니다. 최종 선형 투영법을 C t에 대한 차원 C t로 적용합니다. 퓨즈된 다단계 표현을 디코더에 입력하세요.
  12. MFusion Mamba 활용 퓨즈 다단계 인코더 기능
    1. 네 개의 인코더 단계(E1,E 2,E 3, E4) 모두에서 인코더 기능을 수집하여 MFusion Mamba 모듈의 입력으로 사용합니다. 디코더 퓨전을 위해 해당 단계 인코더 기능만 선택하지 마십시오.
    2. 모든 인코더 기능을 현재 디코더 단계에 필요한 공간 해상도에 맞춰 정렬하세요. 인코더 피처를 목표 해상도에 맞게 재조정하고, 특징 융합 전에 필요한 채널 크기로 프로젝션하세요.
    3. 각 디코더 단계마다 특징 정렬 절차를 반복합니다. 디코더가 H/16 × W/16, H/8 × W/8, H/4 × W/4에서 동작할 때, E1,E 2,E 3, E4 를 해당 목표 특징 공간으로 크기 조정하고 투영합니다.
    4. MFusion Mamba 모듈의 거친 융합 및 파인 융합 연산을 사용하여 정렬된 다단계 인코더 특징을 융합하고, 해당 스케일에서 퓨즈된 표현과 디코더 기능을 결합합니다.
    5. 모델/mvmunet/core.py 에서 공개된 구현에 따라 특징 투영, 크기 조정, 융합 작업을 수행하세요.

figure-protocol-7
그림 5. 다단계 핵융합 맘바(MFusion Mamba) 모듈의 아키텍처. 다단계 융합 맘바(MFusion Mamba) 모듈의 구조. 다중 스케일 인코더 특징들은 먼저 거친 융합으로 결합되고, 이후 선형 투영, 1차원 컨볼루션(Conv1d), 맘바 블록, 특징 투영 층으로 구성된 파인 퓨전 모듈을 통해 정제되어 디코더가 사용하는 융합 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

6. 모델 훈련

  1. Ubuntu 22.04.1에서 리눅스 커널 버전 6.8.0을 탑재한 MVM-UNet을 학습하세요. 13세대 인텔 코어 i9-13900K CPU와 NVIDIA A800 GPU가 장착된 워크스테이션을 사용하세요. 교육과 평가 내내 동일한 하드웨어 구성을 사용하세요.
  2. CUDA 11.8이 적용된 PyTorch 2.0.1을 사용해 모델을 구현하고 학습하세요. 교육 전에 필요한 모든 소프트웨어 의존성을 설치하세요.
  3. 초기 학습률 3 × 10⁻⁻, β1 = 0.9, β2 = 0.999, ε = 1 × 10⁻⁹, 가중치 감쇠 0.01의 AdamW 옵티마이저를 사용하세요. 별도 명시가 없는 한 배치 크기를 32로 설정하세요.
  4. 각 모델을 300 에포크에 대해 훈련시키세요. η = 1 × 10⁻⁻⁻ 코사인 어닐링 학습률 일정을 사용하세요. 입력 이미지 크기를 ISIC 2017과 ISIC 2018은 256× 256, Synapse는 224× 224로 설정하세요.
  5. 주요 비교 실험에는 세 개의 독립적인 무작위 시드(1, 52, 100)를 사용하세요. 각 씨앗에 대해 완전한 훈련과 평가 과정을 반복하세요. 최종 정량적 결과를 세 번의 연속 평균 ± SD로 보고하세요.
  6. 별도 명시가 없는 한 모든 절제 검사에는 고정된 무작위 시드인 100을 사용하세요. 모든 소작 실험에서 데이터셋 파티션, 전처리 전략, 네트워크 아키텍처, 옵티마이저, 학습률, 배치 크기, 학습 에포크 수를 변경하지 않도록 하세요.
  7. ISIC 2017과 ISIC 2018에서 이진 병변 분할에 BCE-Dice 손실을 사용하세요. BCE와 주사위 손실 가중치를 1.0으로 설정하세요. Synapse의 CE-Dice 손실을 사용하고, 교차 엔트로피와 Dice 손실 가중치를 모두 1.0으로 설정하세요.
  8. 1단계에서 설명한 전처리 절차를 사용하여 ISIC 2017과 ISIC 2018 학습 이미지를 재크기, 정규화, 보강할 수 있습니다. 1단계에서 설명한 대로 Synapse 학습 이미지에 크기 조정, 무작위 회전, 무작위 뒤집기를 적용하세요. 모든 훈련 실행 시 동일한 전처리 설정을 사용하세요.
  9. 데이터셋별 검증 프로토콜에 따라 모델 체크포인트를 선택합니다. ISIC 2017과 ISIC 2018의 검증 성능이 가장 좋은 체크포인트를 저장하고, 30 에포크마다 검증을 수행하세요. 검증 세트 없이 300 에포크간 Synapse를 훈련시키고, 최종 훈련 체크포인트를 테스트용으로 사용하세요.
  10. ISIC 2017과 ISIC 2018에서는 모델 선택에만 공식 검증 세트를 사용하세요. Synapse 테스트 세트를 훈련, 하이퍼파라미터 튜닝, 체크포인트 선택에 사용하지 마세요. 모든 검사 데이터는 최종 평가용으로 독점적으로 예약하세요.
  11. 재현성을 위해 다음 훈련 매개변수를 사용하세요. 모든 데이터셋의 배치 크기를 32로 설정하세요. 초기 학습률이 3 × 10⁻⁻, β1 = 0.9, β2 = 0.999, ε = 1 × 10⁻⁹, 가중치 감쇠 1 × 10⁻²인 AdamW를 사용한다.
  12. ISIC 2017과 ISIC 2018을 위해 코사인 어닐링 학습율 스케줄러를 Tmax = 50, ηmin = 1×10⁻⁻으로 설정하세요. Synapse의 경우 스케줄러를 Tmax = 100, min = 1 η×10−5로 설정하세요. 모든 반복 실험에서 스케줄러 설정을 변경하지 마세요.
  13. 모든 모델을 완전 정밀도 FP32 산술로 훈련시키세요. 자동 혼합정밀 훈련을 비활성화하세요. 최적화 중에는 그라데이션 클리핑을 적용하지 마세요.
  14. 정밀 설정, 구배 업데이트 전략, 최적화기 구성, 학습률 일정, 무작위 시드 프로토콜은 모든 비교 실험, 소작 연구, 재현성 실행에서 변경하지 않도록 유지하세요.
  15. 최적의 모델 체크포인트를 선택하세요
    1. ISIC 2017 및 ISIC 2018 데이터셋의 각 학습 에포크가 끝난 후 검증 세트에서 모델을 평가합니다.
    2. 각 검증 배치에 대해 이진 교차 엔트로피(BCE)-주사위 손실을 계산하고, 전체 검증 세트에 걸친 평균 검증 손실을 계산합니다.
    3. 평균 검증 손실이 이전에 기록된 최소 검증 손실보다 낮을 때 현재 모델을 최적의 체크포인트로 저장합니다.
    4. 성능 모니터링 시 성능 모니터링을 위해 연합 간 평균 교차(mIoU), 주사위 유사 계수(DSC), 정확도(Acc), 특이도(Spe), 민감도(Sen)를 기록하세요. 이 지표들을 체크포인트 선택 기준으로 사용하지 마십시오.

7. 모델 평가

  1. 각 데이터셋의 공식 테스트 세트를 사용해 학습된 모델을 평가하세요. 최종 성과 평가에는 시험 세트만 사용하세요.
  2. ISIC 2017과 ISIC 2018의 경우, mIoU, DSC, Acc, Sen, Spe를 계산하세요. 모든 계산에 픽셀 단위의 진실양성(TP), 거짓 양성(FP), 진음성(TN), 거짓 음성(FN)을 사용하세요.
  3. ISIC 2017과 ISIC 2018의 모델 출력에 시그모이드 활성화 함수를 적용합니다. 확률 맵을 0.5의 임계값을 사용하여 이진 분할 마스크로 변환합니다. 평가 지표는 방 정식 2–6을 사용하여 계산합니다:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. Synapse의 경우 모델 출력에 softmax 활성화 함수를 적용하세요. argmax 연산을 사용하여 각 픽셀 또는 복셀을 가장 확률이 높은 클래스에 할당합니다. 각 전경 기관에 대해 DSC와 95백분위수 하우스도르프 거리(HD95)를 계산하고 모든 검사 사례의 평균 값을 보고합니다.
  5. MVM-UNet과 대표적인 CNN 기반, 트랜스포머 기반, 상태 공간 모델(SSM) 기반 분할 방법과 비교해 보십시오. 모든 방법에 동일한 데이터셋 파티션, 전처리 절차, 입력 해상도, 평가 지표를 사용하세요.
  6. ISIC 2017 및 ISIC 2018의 공식 교육, 검증, 테스트 파티션을 사용하세요. Synapse는 18개의 훈련 케이스와 12개의 테스트 케이스로 표준 분할을 사용하세요. ISIC 데이터셋과 Synapse에 대해 입력 해상도를 각각 다음과 같이 설정하세요.
  7. 공식 구현 방식을 사용할 수 있을 때 기본 방법을 재현하세요. 보고서는 반복 실행 ± 평균 SD로 결과를 재현했습니다. 문헌에서 처음 발표된 값을 유지하고 해당 표 노트에서 구분하세요.
  8. 별도 명시가 없는 한 고정된 무작위 시드 100을 사용하여 소작 연구를 수행하십시오. 데이터셋 파티션, 전처리 절차, 입력 해상도, 옵티마이저, 학습률 일정, 배치 크기, 에포크 수, 손실 함수, 평가 지표는 모든 소작 실험에서 변경하지 않습니다.
  9. MV4D, SFusion Mamba, MVV 블록 내 업-다운 투사 분기, MFusion Mamba, 입력 이미지 크기, 드롭아웃 값, 인코더-디코더 계층 구성의 기여를 평가합니다. 각 소작 실험에서는 목표 성분이나 매개변수만 수정하세요.
  10. ISIC 2017과 ISIC 2018의 이미지별 결과와 Synapse의 사례별 결과를 쌍으로 사용하여 Wilcoxon 서명 순위 검정을 수행합니다. 통계적 유의성을 나타내기 위해 0.05보다 작은 p-값을 고려합니다.
  11. 모든 방법에 대해 동일한 하드웨어 환경과 입력 해상도를 사용하여 계산 효율성을 평가합니다. 에포크별 훈련 시간, 이미지당 추론 시간, 훈련 중 GPU 메모리 최대 사용량, 모델 매개변수 수, 부동소수점 연산(FLOP)을 측정합니다. 단일 전진 패스를 사용해 FLOP을 계산하세요.
  12. 모델 평가를 완료한 후 테스트 세트에서 대표적인 정성적 예시만 선택하세요. 원본 이미지, 지상 진실 마스크, 예측 마스크를 동일한 테스트 케이스를 모든 방법으로 비교합니다. 작은 표적, 불규칙한 경계, 모호한 경계, 대표적인 다기관 구조 등 대표적인 예시를 선택하세요.
  13. 평가 지표를 계산하고 통계 분석을 수행합니다
    1. NumPy와 sklearn.metrics.confusion_matrix를 사용해 Python으로 ISIC 2017 및 ISIC 2018 데이터셋의 세분화 지표를 계산하세요. 예측 확률 맵을 0.5에서 임계값을 계산하고, 픽셀 단위의 TP, FP, TN, FN을 얻은 뒤, 이 값들로부터 mIoU, DSC, Acc, Sen, Spe를 계산합니다.
    2. medipy.metric.binary.dc 및 medpy.metric.binary.hd95를 사용하여 Synapse 데이터셋의 DSC와 HD95를 각각 계산하세요. 평가 지표를 계산하기 전에 모델 출력에 softmax 다음에 argmax를 적용하세요.
    3. thop.profile을 사용하여 단일 포워드 패스로 FLOP의 수와 학습 가능한 매개변수를 계산합니다.
    4. scipy.stats.wilcoxon을 사용하여 Python에서 Wilcoxon 부호 순위 검정을 수행하세요. ISIC 2017 및 ISIC 2018 데이터셋에는 이미지별 지표 값을 짝지어, Synapse 데이터셋에는 사례별 지표 값을 짝지어 사용하세요.

8. 손실 함수 정의

  1. 다중 클래스 분할에는 표준 교차 엔트로피(CE) 손실을, 이진 분할에는 표준 BCE 손실을 사용하세요. 세분화에는 표준 주사위 손실 공식을 사용하세요. 방 정식 7–11 은 이 프로토콜에서 사용되는 손실 함수를 정의합니다.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. ISIC 2017과 ISIC 2018의 BCE와 Dice 손실 가중치를 1.0으로 설정하여 1 = 1.0, figure-protocol-182 = 1.0이 figure-protocol-19 되도록 설정하세요. 시냅스의 CE와 주사위 손실 가중치를 1.0으로 설정하세요. 예를 들어 1 = 1.0, φ2 = 1.0 φ
  3. 손실 함수를 utils.py 에 구현하세요. nn을 사용하세요. BCE 학기와 nn에 대한 BCELoss CE 항에 대한 CrossEntropyLoss. 각 예측된 마스크와 근전 진실 마스크를 평탄화하고, 각 샘플의 다이스 손실을 계산하며, 배치 전체의 손실을 평균화하여 이진 다이스 손실을 계산합니다. 대상 라벨 맵을 원핫 형식으로 변환하고, 모델 출력에 softmax를 적용하며, 각 클래스별 주사위 손실을 계산하고 모든 클래스에 걸쳐 손실을 평균화하여 다중 클래스 주사위 손실을 계산합니다.
  4. 이진 주사위 손실은 평탄화 상수를 1, 다중류 주사위 손실은 1×10⁻⁵ 으로 설정합니다. bceDiceLoss 클래스를 사용하여 bb = 1, wd = 1로 BCE-Dice 손실을 구현합니다. CeDiceLoss 클래스를 사용하여 loss_weight = [1, 1]로 CE-Dice 손실을 구현합니다. 모든 데이터셋, 무작위 시드, 실험에 대해 평활화 상수, 감축 전략, 소프트웨어 구현은 변경하지 마세요.
  5. 손실 감소 설정
    1. nn을 인스턴스화하세요. BCELoss()와 nn. 감소 인자를 명시적으로 명시하지 않은 CrossEntropyLoss()
    2. 두 손실 함수 모두 기본 PyTorch 손실 감소 설정(reduction = "mean")을 사용하세요. reduction = "합" 또는 감축되지 않은 손실 출력은 사용하지 마십시오.

9. 재현성 설정 및 실행

  1. https://github.com/LIXUEGUANG002/MVM-UNet 에서 공개된 구현 버전을 다운로드하세요. 저장소를 재료표에 나열된 소프트웨어 패키지, 데이터셋, 하드웨어 사양 및 계산 자원과 함께 사용하세요.
  2. 저장소를 복제하고 프로젝트 디렉터리에 git clone https://github.com/LIXUEGUANG002/MVM-UNet.git 실행한 뒤 cd MVM-Unet을 실행하세요.
  3. ISIC 2017 또는 ISIC 2018 실험은 config/config_setting.py에서 데이터셋 이름, 데이터셋 경로, 입력 크기, 배치 크기, 에포크 수, 손실 함수, 옵티마이저, 학습률 스케줄러, 무작위 시드를 설정하여 구성하세요. 저장소 루트에서 파이썬 train.py 로 학습 스크립트를 실행하세요.
  4. Synapse 실험을 구성하려면 config/config_setting_synapse.py에서 데이터셋 이름, 학습 데이터 경로, 테스트 볼륨 경로, 리스트 디렉터리, 입력 크기, 클래스 수, 배치 크기, 에포크 수, 손실 함수, 옵티마이저, 학습률 스케줄러, 무작위 시드를 설정하세요. 저장소 루트에서 파이썬 train_synapse.py로 훈련 스크립트를 실행하세요.
  5. only_test_and_save_figs = True를 설정하고, 학습된 체크포인트로 best_ckpt_path하며, 해당 구성 파일의 출력 디렉터리로 img_save_path하여 추론 전용 평가를 수행합니다. ISIC 2017 또는 ISIC 2018을 위해 파이썬 train.py 을 실행하거나, Synapse에서 파이썬 train_synapse.py을 실행해 예측 결과와 정성적 수치를 생성할 수 있습니다.
  6. 공개된 소스 코드 버전을 사용하세요
    1. 공개된 GitHub 저장소를 복제하고, 데이터셋, 학습 스크립트, 평가 설정을 설정하기 전에 마스터 브랜치에서 ee891b42c2f2f083c4990eed72f1d4463adc5e103e를 확인해 보세요.
    2. 이 커밋을 사용해 이 연구에서 보고된 실험을 재현하세요. 원고 개정 당시 저장소에는 태그가 붙은 릴리스 버전이 없었습니다.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

예상 결과 및 해석
이 프로토콜이 올바르게 구현되면, 훈련된 MVM-UNet 모델은 반복 실행에서 안정적인 분할 성능을 보이며, 대부분의 평가 지표에서 서로 다른 무작위 시드 간에 약간의 변동만 있을 것으로 기대됩니다. ISIC 2017과 ISIC 2018의 성공적인 결과는 높은 DSC, mIoU, Acc, Sen, Spe 값과 함께 실제 병변 경계를 밀접하게 따르는 예측 병변 마스크로 반영됩니다(그림 6 및 7). 시냅스의 경우, 성공적인 결과는 전경 기관 전반에서 높은 평균 DSC 값과 낮은 HD95 수치로 나타납니다(그림 8). 프로토콜 실행 중에는 정량적 지표와 이에 대응하는 정성적 세분화 결과가 함께 해석되어야 합니다. 높은 DSC를 달성하지만 경계 누설, 작은 구조의 누락, 또는 예측이 단편화된 모델은 부분적으로만 성공한 것으로 간주되어야 하며, 전처리 절차, 체크포인트 선택, 추론 설정을 검증해야 합니다.

figure-results-1
그림 6. ISIC 2017 데이터셋에서의 대표성 세분화 결과. 국제 피부 영상 협력(ISIC) 2017년 피부 병변 분할 데이터셋에서 얻은 대표적인 질적 분할 결과. 각 예시는 원본 피부경 이미지(Image), 해당 지상 진실 분할 마스크(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 테스트 케이스들은 크기, 형태, 경계 복잡도가 다양한 병변에 대한 분할 성능을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-2
그림 7. ISIC 2018 데이터셋에서의 대표적인 질적 세분화 결과. 국제 피부 영상 협력체(ISIC) 2018년 피부 병변 분할 데이터셋에서 얻은 대표적인 질적 분할 결과입니다. 각 예시는 원본 피부경 이미지(Image), 해당 지상 진실 분할 마스크(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 테스트 케이스는 다양한 병변 외관과 경계 특성에서 분할 성능을 입증합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-3
그림 8. Synapse 다기관 컴퓨터 단층촬영 데이터셋에서의 대표적인 질적 분할 결과. Synapse Multi-Atlas Labeling Beyond the Cranial Vault 데이터셋에서 얻은 대표적인 질적 다기관 분할 결과. 각 예시는 원본 컴퓨터 단층촬영 영상(Image), 해당 실제 장기 주석(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 예시는 여러 복부 장기에서 예측된 분절과 기준 분절 간의 일치를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

ISIC 2017에서의 공연
MVM-UNet의 재현성을 평가하기 위해 모든 주요 비교 실험을 세 개의 독립적인 무작위 시드(1, 52, 100)를 사용해 반복했으며, 결과는 표준편± 평균으로 보고되었습니다. 통계적 유의성은 ISIC 2017과 ISIC 2018의 이미지별 결과와 Synapse의 사례별 쌍 결과를 바탕으로 Wilcoxon 부호 순위 검정을 사용하여 평가하였습니다. 통계 분석은 시드 수준 평균이 아닌 쌍 측정 값을 사용하여 수행되었습니다. 공정한 비교를 위해, 평균 ± SD로 보고된 결과는 가능한 한 동일한 데이터셋 파티션, 입력 해상도, 평가 지표 하에 공식 구현을 사용해 재현했으며, 단일 값 결과는 해당 원본 출판물에서 유지되었습니다.

MVM-UNet은 ISIC 2017 피부 병변 분할 데이터셋에서 평가되었으며, UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36, H2Former12 등 대표적인 분절 방법들과 비교되었습니다(표 1). MVM-UNet은 세 차례의 독립 실험에서 mIoU 80.94± 1.01%, DSC 91.32% ± 0.68%, 정확도 96.58% ± 0.27%, 특이성 98.31% ± 0.23%, 민감도는 91.65% ± 0.77%를 달성했습니다. 평가된 방법들과 비교했을 때, MVM-UNet은 가장 높은 mIoU, DSC, 그리고 감도도를 달성했습니다. 대표성 정성적 분할 결과는 그림 6에 나타나며, 예측된 마스크는 대표성 테스트 이미지 전반에 걸쳐 실제 병변 경계를 밀접하게 따릅니다.

모델참고문헌.mIoU (%)DSC (%)수익률 (%)Spe (%)센 (%)
유닛876.9886.9995.6597.4386.82
트랜스유닛2375.3281.2391.4595.7782.63
말룬넷3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
유니엑스트-S3378.2687.8095.9597.7487.04
HResFormer3479.89 ± 1.0588.82 ± 0.6596.25 ± 0.2497.73 ± 0.2287.72 ± 0.79
H-브무넷2880.34 ± 1.0290.68 ± 0.5596.42 ± 0.1898.23 ± 0.3288.97 ± 0.88
포머 양3080.16 ± 0.7889.27 ± 0.6194.36 ± 0.2897.52 ± 0.3887.71 ± 0.69
H2포터1280.35 ± 0.9588.56 ± 0.7296.61 ± 0.1998.15 ± 0.1488.21 ± 0.81
메드스케일-포머3580.31 ± 0.8289.11 ± 0.5995.68 ± 0.3398.24 ± 0.2189.96 ± 0.92
MCAFT3680.59 ± 0.9389.27 ± 0.6396.42 ± 0.2097.95 ± 0.1790.05 ± 0.84
MVM-UNet (우리 회사)80.94 ± 1.0191.32 ± 0.6896.58 ± 0.2798.31 ± 0.2391.65 ± 0.77

표 1: ISIC 2017 피부 병변 분할 데이터셋에서의 성과 비교. MVM-UNet을 평균적 교차 단합(mIoU), 주사위 유사도 계수(DSC), 정확도(Acc.), 특이도(Spe.), 민감도(Sen.)를 사용하여 대표적인 합성곱 신경망(CNN), 트랜스포머, 상태 공간 모델(SSM) 기반 분할 방법과 비교합니다. MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.

정성적 예시는 MVM-UNet이 경계가 불규칙한 작은 병변과 큰 병변 모두를 정확히 구분했음을 보여줍니다. 이 대표적인 예시들에서 예측된 마스크는 해당 진실성 주석과 매우 유사하게 일치했고, 누출이나 파편화가 최소화된 상태로 병변 경계를 보존했습니다.

관찰된 개선이 통계적으로 유의미한지 추가 평가하기 위해, Wilcoxon 부호 순위 검정을 이미지별 분할 결과를 사용하여 수행하였습니다. mIoU 지표에서 MVM-UNet은 MCAFT보다 통계적으로 유의한 개선을 보였으며, p-값은 0.0114였습니다. DSC 지표에서도 MVM-UNet은 p값 0.0031로 H-vmunet보다 현저히 우수한 성과를 냈습니다. 이 결과는 ISIC 2017에서 관찰된 개선이 무작위 변동에 기인할 가능성은 낮다는 것을 뒷받침합니다.

전반적으로 MVM-UNet은 비교 방법 중 ISIC 2017 데이터셋에서 mIoU, DSC, 민감도에서 가장 높은 성과를 달성했습니다(표 1). 그림 6 에 나타난 정성적 세분화 예시는 이러한 정량적 결과와 일치합니다.

ISIC 2018에서의 공연
MVM-UNet은 ISIC 2018 피부 병변 분할 데이터셋에서 추가 평가되었으며, UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, MCAFT36 등 대표적인 분할 방법들과 비교되었습니다(표 2). MVM-UNet은 세 차례의 독립 유± 3개 독립 실행에서 mIoU 82.47% 1.28%, DSC 90.65% ± 0.94%, 정확도 96.02% ± 0.36%, 특이성 97.06% ± 0.31%, 민감도는 91.80% ± 0.82%를 달성했습니다. 이 결과들은 MVM-UNet의 성능이 다양한 무작위 시드에서 일관되게 유지되었음을 보여줍니다. 대표적인 정성적 세분화 결과는 그림 7에 나와 있습니다.

모델참고문헌.mIoU (%)DSC (%)수익률 (%)Spe (%)센 (%)
유닛877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
사네트3879.5288.5994.3995.9789.46
말룬넷3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-브무넷2881.93 ± 1.4590.46 ± 0.6295.19 ± 0.3096.82 ± 0.2188.37 ± 1.13
포머 양3080.27 ± 1.2189.91 ± 0.4694.76 ± 0.2797.22 ± 0.1590.84 ± 1.07
H2포터1280.40 ± 0.8390.26 ± 0.7394.89 ± 0.3896.98 ± 0.2591.57 ± 0.54
HResFormer3481.12 ± 1.1888.86 ± 0.8494.96 ± 0.3396.43 ± 0.2291.86 ± 1.01
메드스케일-포머3580.97 ± 0.7490.47 ± 0.6895.02 ± 0.4195.89 ± 0.2690.65 ± 0.92
MCAFT3681.46 ± 1.0389.06 ± 0.7695.23 ± 0.2996.72 ± 0.1791.82 ± 0.57
MVM-UNet (우리 회사)82.47 ± 1.2890.65 ± 0.9496.02 ± 0.3697.06 ± 0.3191.80 ± 0.82

표 2: ISIC 2018 피부 병변 분할 데이터셋에서의 성과 비교. MVM-UNet을 평균 교차 결합(mIoU), 주사위 유사 계수(DSC), 정확도(Acc.), 특이도(Spe.), 민감도(Sen.)를 사용하여 대표적인 CNN, 트랜스포머, SSM 기반 분할 방법과 비교. MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.

H-vmunet과 비교했을 때, MVM-UNet은 mIoU를 0.54% 개선했습니다. MedScale-Former와 비교했을 때, MVM-UNet은 DSC를 0.18% 개선했습니다. MVM-UNet은 비교 방법 중 가장 높은 정확도를 달성했습니다. 그림 7 에 제시된 대표적인 질적 예시들은 작은 병변 영역과 불규칙한 경계를 가진 병변을 포함한 대표적인 피부 병변의 정확한 분절을 보여줍니다.

ISIC 2018에서는 쌍별 이미지별 분할 결과를 기반으로 Wilcoxon 부호 순위 검정을 사용하여 통계적 유의성을 평가하였습니다. mIoU 지표에서 MVM-UNet은 MCAFT보다 통계적으로 유의한 개선을 보였으며, p값은 < 0.001이었습니다. 이 결과들은 ISIC 2018에서 관찰된 성능 향상이 무작위 변동에 기인할 가능성은 낮다는 것을 뒷받침합니다.

전반적으로 MVM-UNet은 ISIC 2018 데이터셋에서 비교 방법 중 가장 높은 mIoU, DSC, 정확도를 달성했습니다(표 2). 그림 7에 나타난 정성적 예시들은 이러한 정량적 개선과 일치합니다.

Synapse에서의 공연
제안된 방법은 Synapse 다기관 분할 데이터셋에서도 평가되었으며, UNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, MCAFT36 등 대표적인 방법들과 비교되었습니다(표 3). 시냅스 데이터셋에는 대동맥, 담낭, 비장, 왼쪽 신장, 오른쪽 신장, 간, 췌장, 위 등 8개의 복부 장기가 포함되었습니다. 표준 실험 프로토콜에 따라 18건(2,212개의 축방향 단면)이 훈련용으로, 12건(1,567개의 축방향 단면)이 시험에 사용되었습니다. 별도의 검증 세트는 도입되지 않았습니다. 테스트 케이스는 최종 평가에만 사용되었으며, 모델 훈련, 하이퍼파라미터 튜닝, 모델 선택에는 사용되지 않았습니다. 대표적인 질적 다기관 분절 결과는 그림 8에 나타나 있으며, 정량적 비교는 표 3에 요약되어 있습니다.

모델참고문헌.DSCHD95Aor.갤.애야. (L)애야. (R)리브.팬.Spl.스토.
유닛876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
Att-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
트랜스유닛2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
트랜스노름4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
스윈 U-넷2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
트랜스딥랩4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
뮤-유닛4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
포머 양3080.92 ± 4.2320.09 ± 1.8986.43 ± 0.9869.81 ± 4.5684.29 ± 2.1181.03 ± 3.3493.85 ± 0.8961.11 ± 4.6790.05 ± 3.7880.62 ± 1.02
H2포터1281.05 ± 2.5620.13 ± 7.2386.61 ± 3.2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561.16 ± 0.7689.97 ± 4.1280.94 ± 3.56
HResFormer3480.65 ± 4.0217.48 ± 6.8989.16 ± 2.7866.94 ± 0.7884.61 ± 4.3482.15 ± 2.5693.11 ± 1.3459.92 ± 4.1291.08 ± 3.4580.75 ± 2.01
메드스케일-포머3580.78 ± 1.3420.02 ± 3.7888.79 ± 4.0269.82 ± 2.5685.13 ± 0.8781.63 ± 4.7894.10 ± 2.7860.72 ± 1.8990.14 ± 1.5680.93 ± 4.56
MCAFT3681.03 ± 3.4519.98 ± 5.1289.76 ± 0.7668.96 ± 3.8984.54 ± 2.5681.98 ± 3.1294.32 ± 4.0160.85 ± 3.6789.06 ± 4.8980.91 ± 1.78
MVM-UNet (우리 회사)81.26 ± 1.8918.72 ± 2.1688.53 ± 3.2269.84 ± 4.2385.37 ± 2.6982.67 ± 1.6794.41 ± 3.5661.02 ± 2.7890.19 ± 0.6781.48 ± 3.12

표 3: Synapse 다기관 분할 데이터셋에서의 성과 비교. MVM-UNet을 Dice 유사도 계수(DSC), 95백분위수 하우스도르프 거리(HD95), 대동맥(Aor.), 담낭(Gal.), 왼쪽 신장(Kid)에 대한 장기 특이적 Dice 점수를 사용하여 대표적인 CNN, Transformer, SSM 기반 분할 방법과 비교하였습니다. (L)), 오른쪽 신장 (키드. (R)), 간(Liv.), 췌장(Pan.), 비장(Spl.), 위(Sto.). MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.

MVM-UNet는 세 차례 독립 선거에서 평균 DSC 81.26%± 1.89%, 평균 HD95 점수 18.72± 2.16을 기록했습니다. 결과는 Synapse 데이터셋에서 안정적인 세분화 성능을 보여줍니다. 평가된 방법 중 MVM-UNet은 가장 높은 평균 DSC와 두 번째로 낮은 평균 HD95를 달성했습니다.

Synapse의 경우, 쌍화된 사례별 DSC 값을 기반으로 Wilcoxon 부호 순위 검정을 사용하여 통계적 유의성을 평가하였습니다. MVM-UNet은 H2Former에 비해 통계적으로 유의한 개선을 보였으며, p-값은 0.026으로, 세분화 성능 향상이 통계적으로 유의미함을 나타냈다.

대표적인 성공 결과 및 최적에 부적합한 결과
대표적인 성공적인 질적 결과는 그림 6–8에 나타난다. 성공적인 결과는 실제 주석과 밀접하게 일치하고 원발 병변 또는 장기 경계를 정확히 구분하는 예측된 분절 마스크로 특징지어집니다. 대표적인 비최적 결과는 매우 작은 표적, 저대비 경계, 불규칙한 병변 형태, 약한 강도 대비 기관, 해부학적으로 모호한 경계에서 발생할 수 있으며, 일반적으로 저분절, 과분절, 경계 누출, 또는 불연속적인 마스크 조각으로 나타납니다. 이러한 결과가 관찰될 경우, 사용자는 이미지 크기 조정, 정규화, 마스크 보간, 모델 체크포인트 선택, 추론 임계값(ISIC 데이터셋의 경우) 또는 argmax 예측(Synapse의 경우), 그리고 메트릭 계산 절차가 프로토콜에 설명된 것과 일치하는지 확인해야 합니다.

MV4D 모듈의 절제 연구
MV4D 모듈의 기여도는 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 차례로 추가하여 평가되었으며, 이어서 SFusion Mamba 모듈(표 4; 그림 9). 지그재그 스캔 쌍만 사용할 때는 분할 성능이 제한적이었습니다. 계층적 스캔 쌍을 추가하면 성능이 크게 향상되었으며, 다중 스케일 정보 통합의 이점을 보여줍니다. 이후 나선형 및 방사형 스캔 쌍의 추가로 윤곽과 경계 표현을 강화하여 분할 성능을 더욱 향상시켰습니다. SFusion Mamba 모듈의 도입은 평가된 구성 중 가장 높은 성능을 보여주었습니다.

모델지그재그 스캔 쌍계층적 스캔 쌍나선형 스캔 쌍방사형 스캔 쌍SFusion MambaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-유닛56.7572.4658.0373.45
MVM-유닛72.3884.0173.4584.7
MVM-유닛75.6986.2076.9486.94
MVM-유닛76.4186.6178.2887.82
MVM-유닛80.9491.3282.4790.65

표 4: 다중 뷰 4방향(MV4D) 모듈의 절제 연구. 계층적, 나선형, 방사형 스캔 쌍과 공간 융합 맘바(SFusion Mamba) 모듈을 기본 지그재그 스캔 쌍 아키텍처에 점진적으로 통합하여 성능을 얻었습니다. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.

figure-results-4
그림 9. 다중 뷰 4방향(MV4D) 모듈의 소작 연구. (A) 계층적 스캐닝 쌍, 나선형 스캔 쌍, 방사형 스캔 쌍, 공간 융합 맘바(SFusion Mamba)를 순차적으로 통합한 후 결합 간 평균 교차(mIoU)의 변화. (B) 계층적 스캔 쌍, 나선형 스캔 쌍, 방사선 스캔 쌍, 공간 융합 맘바(SFusion Mamba)를 기본 아키텍처에 순차적으로 통합한 후 주사위 유사도 계수(DSC)의 변화. (C) 두 번째 실험 환경에서 계층적 스캔 쌍, 나선형 스캔 쌍, 방사형 쌍, 공간 융합 맘바(SFusion Mamba) 가 순차적으로 기본 구조에 통합된 후 mIoU 변화. (D) 두 번째 실험 환경에서 계층적 스캔 쌍, 나선형 스캔 쌍, 방사형 스캔 쌍, 공간 융합 맘바(SFusion Mamba)가 순차적으로 기본 구조에 통합된 후 DSC의 변화. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

ISIC 2017 데이터셋에서 전체 MV4D 모듈은 80.94%의 mIoU와 91.32%의 DSC를 달성했습니다. mIoU와 DSC의 해당 성능 추세는 각각 그림 9A그림 9B에 나타난다. ISIC 2018 데이터셋에서 완전한 MV4D 모듈은 82.47%의 mIoU와 90.65%의 DSC를 달성했습니다. 해당 성능 추세는 각각 그림 9C그림 9D에 나와 있습니다.

별도 명시가 없는 한, 모든 소작 실험은 고정된 무작위 시드인 100을 사용하여 수행되었으며, 주요 비교 결과는 세 개의 독립적인 무작위 시드(1, 52, 100)에 대한 평균 ± SD로 보고되었습니다. 따라서 소작 결과는 주요 비교 실험에서 보고된 최종 다중 시드 성능을 재현하는 것이 아니라, 통제된 단일 시드 환경에서 개별 구성 요소의 상대적 기여도를 비교하는 것을 목적으로 합니다.

전반적으로 추가 스캔 쌍과 SFusion Mamba 모듈을 점진적으로 통합하면서 분할 성능이 꾸준히 향상되었으며, 완전한 MV4D 구성이 두 데이터셋 모두에서 최고 성능을 달성했습니다.

멀티뷰 시각(MVV) 블록의 절제 연구
MVV 블록은 기본 아키텍처와 업다운 투영 분기를 포함한 버전을 비교하여 평가되었습니다(표 5). ISIC 2017 데이터셋에서 업-다운 투영 분기의 포함으로 mIoU는 78.83%에서 80.96%로, DSC는 88.15%에서 91.02%로 증가했습니다. ISIC 2018 데이터셋에서 mIoU는 80.32%에서 82.46%로, DSC는 89.15%에서 90.57%로 증가했습니다.

모델기본 MVV 블록업-다운 프로젝션ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-유닛78.8388.1580.3289.15
MVM-유닛80.9691.0282.4690.57

표 5: 다중 시야 시각(MVV) 블록의 절제 연구. 업다운 투사 분기가 있는 기준 멀티뷰 비전(MVV) 블록의 성능 비교. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.

MVV 블록 소작 실험은 고정된 무작위 시드 100을 사용하여 수행되었습니다. 따라서 업-다운 투영 분기를 포함한 구성의 성능은 통제된 단일 시드 제거 설정을 반영하며, 주요 비교 실험에서 전체 MVM-UNet 모델에 대해 보고된 3시드 평균 성능과 약간 다를 수 있습니다.

전반적으로 상하 투영 분기의 도입은 두 데이터셋 모두에서 분할 성능을 지속적으로 향상시켰으며, mIoU와 DSC 모두에서 증가가 관찰되었습니다.

다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구
MFusion Mamba 모듈은 다양한 거친 융합 전략과 미세 융합 구성 요소를 비교하여 평가되었습니다(표 6; 그림 10). MFusion Mamba 없이, MVM-UNet은 ISIC 2017 데이터셋에서 mIoU 75.47%와 DSC 86.01%를 달성했으며, ISIC 2018 데이터셋에서는 mIoU 77.49%와 DSC 87.29%를 달성했습니다. 평가된 거친 융합 전략 중에서 Hadamard 제품이 가장 큰 개선을 이루었습니다. 파인 퓨전 구성 요소의 도입으로 세분화 성능이 더욱 향상되었습니다. 전체 MFusion Mamba 구성은 ISIC 2017에서 80.95%의 mIoU와 91.18%의 DSC를, ISIC 2018에서는 82.51%의 mIoU와 90.58%의 DSC를 달성했습니다.

모델거친 융합 원소별 최대 값거친 융합 원소별 덧셈거칠 융합 하다마르 곱파인 퓨전 모듈ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-유닛75.4786.0177.4987.29
MVM-유닛76.2186.4778.3587.82
MVM-유닛76.8386.8679.1188.30
MVM-유닛78.2687.8380.0688.96
MVM-유닛80.9591.1882.5190.58

표 6: 다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구. 최대 융합(Max), 원소별 첨가(⊕), Hadamard 곱(⊙) 등 다양한 거친 융합 전략의 성능 비교와 완전한 미세 융합 모듈을 포함합니다. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.

figure-results-5
그림 10. 다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구. (A) 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 평균 교차 변화(mIoU). (B) 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 주사위 유사 계수(DSC)의 변화. (C) 두 번째 실험 설정에서 얻은 다양한 조잡 융합 전략(최대치, 원소별 첨가, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 mIoU 변화. (D) 두 번째 실험 설정에서 얻은 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 DSC 변화. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

ISIC 2017 데이터셋에서 완전한 MFusion Mamba 구성은 80.95%의 mIoU와 91.18%의 DSC를 달성했습니다. mIoU와 DSC의 해당 성능 추세는 각각 그림 10A그림 10B에 나타난다. ISIC 2018 데이터셋에서 전체 MFusion Mamba 구성은 82.51%의 mIoU와 90.58%의 DSC를 달성했습니다. 해당 성능 추세는 각각 그림 10C그림 10D에 나타난다. MFusion Mamba 소작 실험은 고정된 무작위 시드 100을 사용하여 수행되었습니다. 따라서 완전한 MFusion Mamba 구성은 통제된 단일 시드 소작 결과를 나타내며, 주요 비교 실험에서 전체 MVM-UNet 모델의 3시드 평균 성능과 약간 다를 수 있습니다.

전반적으로, Hadamard 곱 거친 융합 전략과 Fine Fusion 구성 요소를 점진적으로 도입하면서 세분화 성능이 꾸준히 향상되었으며, 완전한 MFusion Mamba 구성이 두 데이터셋 모두에서 최고 성능을 보였습니다.

소작술 연구 요약
소작 실험 전반에 걸쳐, 계층형, 나선형, 방사형 스캔쌍 분기와 SFusion Mamba 모듈을 점진적으로 통합하면서 분할 성능이 일관되게 향상되었습니다(표 4; 그림 9). 마찬가지로, MVV 블록에 업-다운 투영 분기(Up-Down Projection) 분기가 포함되면서 ISIC 2017 및 ISIC 2018 데이터셋의 mIoU와 DSC 모두가 향상되었습니다(표 5). 완전한 MFusion Mamba 구성은 평가된 다단계 특징 융합 전략 중 가장 높은 성능을 달성했습니다(표 6; 그림 10).

하이퍼파라미터의 소작 연구
입력 크기와 드롭아웃 값의 효과는 ISIC 2017 및 ISIC 2018 데이터셋에서 평가되었습니다(표 7). 세 가지 입력 해상도(256 × 256, 384 × 384, 512 × 512)가 비교되었습니다. 평가된 설정에서 256 × 256 입력 해상도가 두 데이터셋 모두에서 가장 높은 분할 성능을 달성했습니다.

모델입력 크기 256 × 256입력 크기 384 × 384입력 크기 512 × 512드롭아웃 0.0드롭아웃 0.1드롭아웃 0.2드롭아웃 0.3ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-유닛80.0288.9181.7689.92
MVM-유닛79.9688.8780.9789.47
MVM-유닛77.4887.2878.7688.11
MVM-유닛79.3688.5381.1389.62
MVM-유닛80.9490.1582.4990.50
MVM-유닛79.7188.7180.4689.18

표 7: 입력 이미지 크기 및 드롭아웃 값의 소작 연구. 서로 다른 입력 이미지 크기와 드롭아웃 값을 사용한 MVM-UNet의 성능 비교. 세분화 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대 합집합(mIoU)과 주사위 유사도 계수(DSC)를 사용하여 보고됩니다.

또한 다양한 중도 고치가 평가되었습니다. 테스트된 구성 중에서 드롭아웃 값 0.2가 두 데이터셋 모두에서 가장 높은 분할 성능을 달성했으며, 따라서 주요 실험에서 사용되었습니다.

인코더-디코더 계층 구성의 소작 연구
네트워크 깊이가 세그멘테이션 성능과 계산 비용에 미치는 영향을 조사하기 위해 다양한 인코더-디코더 계층 구성을 평가하였습니다(표 8). 평가된 구성 중에서 대칭 {2, 2, 2, 2}-{2, 2, 2, 2} 아키텍처가 상대적으로 낮은 모델 복잡도를 유지하면서 가장 높은 전체 분할 성능을 달성했습니다. 네트워크 깊이를 {2, 2, 9, 2}-{2, 9, 2, 2}로 늘리면 세분화 성능은 비슷했지만, 매개변수 수와 계산 비용이 증가했습니다.

모델인코더-디코더 계층 구성매개변수 (M)플랍 (G)ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-유닛{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-유닛{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-유닛{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-유닛{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-유닛{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

표 8: 인코더-디코더 층 구성의 소작 연구. 서로 다른 인코더-디코더 계층 구성의 성능 비교. 이 표는 ISIC 2017 및 ISIC 2018 데이터셋에서 모델 매개변수(Parameters), 부동소수점 연산(FLOP), 결합 간 평균 교차점(mIoU), 주사위 유사도 계수(DSC)의 수를 보고합니다.

계산 비용 비교
최종 MVM-UNet 모델의 계산 효율성은 동일한 하드웨어 환경과 입력 해상도 하에서 HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former, MCAFT 등 대표적인 기초 방법들과 비교되었습니다(표 9). 평가된 지표에는 에포크별 훈련 시간, 이미지당 추론 시간, 훈련 중 GPU 메모리 사용량의 최대 시간, 학습 가능한 매개변수(Param) 수, FLOP 수가 포함되었습니다. 훈련 시간은 한 훈련 에포크를 완료하는 데 필요한 시간으로, 추론 시간은 테스트 이미지당 평균 처리 시간으로, FLOP은 단일 순방향 패스에 대해 계산되었습니다.

방법참고문헌.훈련 시간 (시대 기준)추론 시간 (ms/image)최대 GPU 메모리 (GB)매개변수 (M)플랍 (G)
HResFormer34520213.0819.2117.00131.70
H-브무넷288827.005.010.748.97
포머 양3035592.8612.642.33109.45
H2포터1213029.028.833.7133.56
메드스케일-포머358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (우리 회사)10426.807.928.364.39

표 9: MVM-UNet과 대표적 기준선 방법의 계산 비용 비교. 동일한 하드웨어 환경과 입력 해상도 하에서의 계산 효율성 비교. 보고된 지표로는 에포크별 학습 시간, 이미지당 추론 시간, 학습 중 그래픽 처리 장치(GPU) 메모리 사용량, 모델 매개변수(매개변수) 수(매개변수), 부동소수점 연산(FLOP) 등이 포함됩니다. 가능한 한 동일한 실험 환경에서 구현된 방법을 평가했습니다.

표 9에 요약된 바와 같이, MVM-UNet은 훈련 에포크당 104초, 추론 이미지당 26.8ms, 최대 GPU 메모리 7.9GB, 학습 가능 매개변수 2,836만 개, GFLOP 4.39개를 필요로 했습니다. HResFormer, MISSFormer, H2Former, MCAFT와 비교할 때, MVM-UNet은 더 낮은 훈련 시간, 더 짧은 추론 시간, 낮은 최대 GPU 메모리 사용량, 그리고 더 적은 FLOP을 요구했습니다. 경량 H-vmunet 및 MedScale-Former 모델과 비교할 때, MVM-UNet은 더 많은 학습 시간과 메모리 사용량이 필요했지만, 비교적 낮은 계산 복잡도를 유지하면서 비슷한 추론 속도를 유지했습니다.

데이터 및 코드 이용 가능성
ISIC 2017 및 ISIC 2018 데이터셋은 국제 피부 영상 협력체(ISIC) 아카이브에서 공개되어 있으며, Synapse 데이터셋은 Synapse 저장소에서 공개되어 있습니다. 데이터셋 획득 세부 사항은 윤리 성명서에 제공되어 있습니다. 간단히 말해, ISIC 2017 데이터셋은 공식 ISIC 2017 챌린지 데이터 저장소(https://challenge.isic-archive.com/data/#2017 에서), ISIC 2018 데이터셋은 공식 ISIC 2018 챌린지 태스크 1 데이터 저장소(https://challenge.isic-archive.com/data/#2018)에서, Synapse 데이터셋은 Synapse 저장소에서 accession identifier syn3193805(https://www.synapse.org/Synapse:syn3193805)에서 획득했습니다. 해당 다운로드 날짜는 윤리 성명서에 보고되어 있습니다. MVM-UNet 소스 코드의 초기 공개 버전은 https://github.com/LIXUEGUANG002/MVM-UNet 에서 제공됩니다. 저장소에는 모델 구현, 주요 네트워크 모듈, 구성 파일, 데이터셋 조직 지침, 학습 스크립트, 평가 스크립트가 포함되어 있습니다. 최종 설정 파일, 완전한 실험 스크립트, 추가 문서, 학습된 모델 체크포인트를 포함한 완전한 재현성 패키지는 공개 시 공개될 예정입니다.

보충 표 1. 멀티뷰 비전 맘바 유닛(MVM-UNet)의 계층별 아키텍처. 표는 MVM-UNet의 순차 네트워크 아키텍처를 요약하며, 입력 계층, 패치 임베딩, 인코더 단계, 멀티뷰 비전(MVV) 블록, 패치 머징 작업, 다단계 퓨전 맘바(MFusion Mamba), 디코더 단계, 최종 업샘플링, 세그멘테이션 헤드를 포함합니다. 각 단계별로 해당 연산, 주 매개변수, 출력 특징 크기가 나열됩니다. E1–E4 는 다단계 피처 융합에 사용되는 인코더 단계 특징 맵을 나타냅니다. B, H, W 는 각각 배치 크기, 이미지 높이, 이미지 너비를 나타내며, K 는 출력 클래스 수를 나타냅니다(이진 피부 병변 분할의 K = 1 , 시냅스 다중 클래스의 K = 9 , 배경 클래스 1개와 전경 기관 클래스 8개로 구성됩니다). MFusion Mamba는 디코더 재구성 과정에서 해당 디코더 기능과 통합된 퓨즈 다단계 인코더 기능을 생성합니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충 파일 1. 다중 뷰 4방향(MV4D) 모듈과 다중 단계 핵융합 맘바(MFusion Mamba)의 의사 코드. 보조 파일은 MVM-UNet에서 사용되는 두 주요 모듈의 알고리즘 워크플로우를 보여줍니다. 알고리즘 1은 다중 뷰 4방향(MV4D) 모듈의 전체 처리 파이프라인을 설명하며, 특징 평탄화, 네 개의 스캔 쌍 시퀀스(지그재그, 계층, 나선, 방사형) 구성, 선택적 상태 공간(S6) 처리, 스캔 뷰 융합 맘바(SFusion Mamba), 그리고 출력 특징 맵 재구성을 포함합니다. 알고리즘 2는 다단계 퓨전 맘바(MFusion Mamba) 모듈을 설명하며, 다단계 인코더 기능 정렬, 거친 융합, 미세 융합, 디코더 통합, 퓨즈 디코더 입력 기능 생성을 포함합니다. 변수와 텐서 차원은 알고리즘 내에서 정의됩니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보조 코딩 파일 1. MVM-UNet용 소스 코드 패키지(MVM-UNet-master). 보조 ZIP 아카이브에는 본 연구에서 사용된 MVM-UNet의 완전한 소스 코드 구현체가 포함되어 있습니다. 이 패키지에는 네트워크 아키텍처, 다중 뷰 4방향(MV4D) 및 다중 단계 퓨전 맘바(MFusion Mamba) 모듈, 구성 파일, ISIC 2017, ISIC 2018, Synapse 데이터셋의 교육 및 평가 스크립트, 유틸리티 함수, 그리고 이 프로토콜에서 설명된 실험을 재현하는 데 필요한 프로젝트 문서가 포함되어 있습니다. 패키지에는 설치 지침, 소프트웨어 의존성, 데이터셋 조직, 학습 및 추론 워크플로우가 포함된 README 파일도 포함되어 있습니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 맘바 기반의 의료 영상 분할 프레임워크인 MVM-UNet을 설명합니다. 이 방법은 기존 세분화 모델의 두 가지 한계를 해결하기 위해 설계되었습니다. 첫째, 기존 CNN 기반 방법은 복잡한 의료 영상에서 장거리 의존성과 계층적 맥락 정보를 모델링하는 데 제한적인 능력을 가지고 있습니다43. 둘째, 트랜스포머 기반 방법은 전역 맥락을 모델링할 수 있지만 보통 더 높은 계산 비용이 필요합니다23,25. MVM-UNet은 Mamba아키텍처 13,14,15,16,17,18,19,20을 사용하여 효율적인 장거리 모델링을 구현하고, 멀티뷰 스캔과 다단계 기능 융합을 도입하여 세분화 정확도를 향상시켰습니다. 프로토콜 실행과 재현성 관점에서 본 연구에서 보고된 결과와 유사한 결과를 얻기 위해서는 여러 단계가 매우 중요합니다. 첫째, 데이터셋 분할, 이미지 크기 조정, 마스크 보간, 정규화 전략, 채널 변환 등이 프로토콜과 일치하도록 유지해야 합니다. 왜냐하면 전처리 차이가 입력 분포와 마스크 경계를 직접 바꿀 수 있기 때문입니다. 특히, 분할 마스크는 비정수 레이블 값44를 도입하지 않도록 최근접 이웃 보간법(nearest-neighbor interpolation)을 사용하여 크기를 조정해야 합니다. 둘째, 입력 해상도, 배치 크기, 최적화기 설정, 학습률 일정, 무작위 시드, 손실 가중 계수, 체크포인트 선택 규칙, 추론 임계값 또는 ARGMAX 연산 등 훈련 구성을 비교 전에 반드시 확인해야 합니다. 재현된 결과가 보고된 값보다 명확히 낮다면, 사용자는 먼저 데이터셋 경로, 주석 형식, 전경-배경 라벨 규칙, 체크포인트 로딩, 검증 또는 테스트 분할, 메트릭 계산 절차를 확인해야 합니다. 경계 누설, 단편화된 마스크, 또는 작은 구조의 누락은 보통 전처리, 마스크 보간, 체크포인트 선택 또는 추론 후처리에서의 잠재적 불일치를 나타냅니다.

MVM-UNet의 주요 기여는 MV4D 모듈입니다. 이전의 상태 공간 모델 기반 아키텍처(14,15,16,17,18,19,20)에서 채택된 단순한 2차원 스캐닝 전략과 달리, MV4D는 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 사용하여 상호 보완적인 시각 정보를 포착합니다. 지그재그 스캔 쌍은 국소 및 전역 공간 정보의 균형을 맞추는 데 도움을 주고, 계층적 스캔 쌍은 다중 스케일 특징 추출을 향상시키며, 나선형 스캔 쌍은 전역 윤곽 표현을 강화하고, 방사형 스캔 쌍은 국부 가장자리 및 경계 특징 추출을 향상시킵니다. SFusion Mamba는 이러한 상호 보완적인 스캔 방식을 통합합니다. 대표적인 결과 및 소작 실험(표 4 및 5; 그림 9) 스캔 패턴의 다양성과 융합 메커니즘이 분할 성능 향상에 기여함을 입증합니다. 또 다른 중요한 구성 요소는 MFusion Mamba로, 인코더와 디코더 사이의 기능 융합 모듈 역할을 합니다. 기존의 U자형 아키텍처, 예를 들어 U-Net 8,21, V-Net44, 그리고 이후 많은 변형 9,23,25는 주로 단계별 스킵 연결을 통해 정보를 전송합니다. 이 전략은 상보적 다단계 인코더 표현을 완전히 활용하지 못할 수 있습니다. MFusion Mamba는 디코딩 전에 Coarse Fusion과 Fine Fusion을 통해 인코더 기능을 결합하여 이 한계를 해결합니다. 대표 결과(표 6; 그림 10) MFusion Mamba가 세분화 성능을 지속적으로 향상시키며, 명시적 다단계 특징 융합이 의료 이미지 분할에 유익함을 나타냅니다.

MVM-UNet의 방법론적 기여는 모든 개별 작업을 처음부터 발명한 것이 아니라 아키텍처 수준의 재설계로 이해되어야 합니다. U자형 인코더-디코더 아키텍처, 잔류 연결, 투영 계층, 맘바/상태 공간 모델(SSM) 블록은이전 연구에서 광범위하게 연구되었습니다 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. 하지만 이러한 구성 요소를 직접 결합하는 것이 반드시 의료 영상 분할의 특정 문제를 해결하지는 못합니다. MVM-UNet의 새로움은 세 가지 측면의 조율된 설계에 있습니다. 첫째, MV4D 모듈은 단일 또는 제한된 스캔 패턴을 네 개의 상호 보완적인 스캔 쌍 분기로 대체하여 공간 연속성, 다중 규모 구조, 전 지구 윤곽 정보, 국부 경계 세부 정보를 포착할 수 있게 합니다. 둘째, SFusion Mamba와 MVV 블록은 스캔 전용 기능을 융합하고 강화한 후 다음 네트워크 단계로 넘어갑니다. 셋째, MFusion Mamba는 디코딩 전에 다단계 인코더 기능을 명시적으로 집계하여 기존 스킵 연결8, 21, 44를 보완하고 계층적 정보 사용을 개선합니다. 소작 결과(표 4–6; 그림 9와 10) 이 설계 근거를 더욱 뒷받침하며, 멀티뷰 스캐닝, 스캔별 융합, 상하 투영 분기, 다단계 기능 융합이 분할 성능 향상에 기여함을 보여줍니다. 따라서 MVM-UNet의 기여는 Mamba 기반 공간 모델링과 인코더-디코더 특징 융합의 과제별 실험적 검증된 통합 의료 영상 분할에 있습니다.

강력한 성능에도 불구하고 MVM-UNet에는 몇 가지 한계가 있습니다. 첫째, 입력 이미지 크기가 커질수록 분할 성능이 꾸준히 향상되지 않아 현재 아키텍처가 고해상도 이미지 정보를 완전히 활용하지 못할 수 있음을 시사합니다. 둘째, 이 모델은 임상 실무에서 자주 발생하는 고노이즈 또는 저대비 영상 조건에서 광범위하게 평가되지 않았으며, 이는 분할의 견고성에 영향을 줄 수 있습니다. 셋째, 이 모델은 공개된 세 개의 데이터셋에서 강력한 성능을 보였지만, 더 크고 다양한 의료 영상 데이터셋에 대한 추가 검증이 필요합니다. 프로토콜은 다른 의료 영상 분할 작업에 적용할 수 있으나, 여러 수정사항을 신중하게 구현해야 합니다. 새로운 이진 분할 작업의 경우, 사용자는 이진 BCE-Dice 손실 및 평가 절차를 유지하면서 데이터셋 로더, 정규화 매개변수, 입력 해상도, 전경 임계값을 수정해야 합니다. 새로운 다중 클래스 분할 작업의 경우, 사용자는 출력 클래스 수, 클래스-인덱스 매핑, 원-핫 라벨 변환, CE-Dice 손실 구성, 클래스별 평가 지표44를 업데이트해야 합니다. 그레이스케일 데이터셋의 경우, 입력 채널 구성을 모델 아키텍처에 맞게 단일 채널 입력 투영을 사용하거나 그레이스케일 이미지를 반복하여 3채널 입력을 생성해야 합니다. 목표 구조가 매우 작거나, 경계가 약하거나 모호하거나, 이미지 대비가 훈련 데이터와 크게 다르거나, 목표 데이터셋이 상당한 도메인 이동을 보일 경우 이 방법은 최적이 아닌 성능을 보일 수 있습니다. 이러한 조건에서 사용자는 공정한 비교를 위해 동일한 평가 프로토콜을 유지하면서 입력 해상도, 증강 전략, 클래스 밸런싱, 손실 가중치, 미세 조정 일정을 조정해야 할 수 있습니다.

Synapse 데이터셋에서 MVM-UNet은 일반적으로 사용되는 18사례 훈련과 12사례 검사 분할 체계에서 강력한 다중 기관 분할 성능을 달성했습니다. 제안된 방법은 본 연구에서 평가된 대표적인 기초 방법 중 가장 높은 평균 DSC를 기록했지만(표 3), 최근 일부 방법에서는 다양한 훈련 환경과 평가 프로토콜에서 더 높은 시냅스 성능을 보고했습니다29. 따라서 MVM-UNet을 Synapse에서 전반적으로 최첨단 성능을 달성했다고 설명하는 것은 피하고, 대신 평가된 실험 환경에서 강한 성능을 달성했다고 설명합니다. 이 결과는 MVM-UNet의 성능이 의료 이미지분할 13,14,15,16,17,18,19,20을 위한 맘바 기반 모델링의 과제별 적응에서 비롯되었음을 시사합니다. 단일 스캔 전략에 의존하는 대신, MVM-UNet은 시각적 특징 모델링을 여러 상호 보완적인 스캐닝 뷰로 분해하고 SFusion Mamba 방식으로 통합합니다. 또한 MFusion Mamba는 기존의 스킵 연결8, 21, 44를 넘어 다단계 인코더 기능을 명시적으로 집계하여 인코더와 디코더 간의 정보 흐름을 개선합니다. 이 설계는 제안된 모델이 이진 피부 병변 분할과 다기관 분할 과제 모두에서 강력한 성능을 발휘할 수 있게 합니다.

향후 작업은 고해상도 의료 영상 분할을 위한 MVM-UNet 개선에 집중해야 합니다. 더 깊거나 적응적인 다중 규모 아키텍처는 모델이 고해상도 이미지 정보를 보다 효과적으로 활용할 수 있게 할 수 있습니다. 향후 연구에서는 노이즈가 많고 대비가 낮으며 도메인 이동이 있는 영상 조건에서 MVM-UNet의 견고성도 평가해야 합니다. 또한, 제안된 다중 시점 스캐닝 전략은 병변 탐지4, 장기 위치, 종양 분류, 3차원 분할 등 다른 의료 영상 분석 과제로 확장될 수 있습니다10,11. 요약하자면, MVM-UNet은 의료 영상 분할을 위한 효과적이고 재현 가능한 프레임워크를 제공합니다. MV4D 모듈과 MFusion Mamba의 통합을 통해 모델은 상호 보완적인 공간 정보, 다중 스케일 맥락, 전역 등고선 정보, 지역 경계 세부사항, 다단계 의미적 특징을 포착할 수 있습니다. ISIC 2017, ISIC 2018, Synapse 데이터셋에서 얻은 대표적인 결과는 제안된 아키텍처의 효율성을 입증합니다. 이 프로토콜은 의료 영상분할 13,14,15,16,17,18,19,20을 위한 효율적인 SSM/맘바 기반 아키텍처를 개발하는 연구자들에게 실용적인 참고 자료를 제공합니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 경쟁하는 재정적 이해관계가 없다고 선언합니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 외부 자금 지원을 받지 못했습니다.

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage.Computational platform for training, validation, testing, ablation, and inference-only experiments.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationNVIDIA A800 GPU (80 GB memory).GPU-accelerated model training and inference.
Hardware - Central processing unit (CPU)Intel Corporation / AMD13th Gen Intel Core i9-13900K CPU.Host processor for data loading, preprocessing, and experiment execution.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB system RAMMemory for dataset loading, preprocessing, and training.
Hardware - StorageInstitutional computing platform / local workstation2 TB NVMe solid-state drive.Storage for datasets, checkpoints, logs, and generated prediction figures.
Software environment - Operating systemCanonical Ltd.Recommended: Ubuntu 22.04.1 LTSOperating system for the computational environment.
Software environment - Conda environmentAnaconda, Inc. / MinicondaEnvironment name: mvmunetPython environment used to install and isolate dependencies.
Software environment - PythonPython Software FoundationPython 3.8Programming language used for implementation and experiment execution.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8GPU computing backend required by PyTorch and Mamba-related packages.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.GPU-accelerated deep-learning primitives used through PyTorch.
Python package - PyTorchPyTorchtorch == 2.0.1Deep-learning framework for model training, loss calculation, optimization, and inference.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Image transform utilities used in preprocessing and augmentation.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Installed with the recommended PyTorch environment.
Python package - timmtimm developerstimm == 0.4.12Model-component or utility dependency listed in the repository environment instructions.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0Dependency used by GPU-accelerated sequence modeling components.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Efficient causal convolution dependency required by the Mamba implementation.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1State-space sequence modeling package used for Mamba/S6-related components.
Python package - NumPyNumPy developersNumPy version 1.24.3.Numerical computation and array operations.
Python package - SciPySciPy developersSciPy version 1.10.1.Scientific computation; scipy.ndimage.zoom is imported in utils.py.
Python package - SimpleITKInsight Software ConsortiumSimpleITK version 2.2.1.Medical image input/output and preprocessing utility imported in utils.py.
Python package - MedPyMedPy developersMedPy version 0.4.0.Medical image metric calculation package imported in utils.py.
Python package - scikit-imagescikit-image developersscikit-image version 0.21.0.Image-processing dependency listed in README.
Python package - scikit-learnscikit-learn developersscikit-learn version 1.3.2.Machine-learning utility package listed in README.
Python package - matplotlibMatplotlib developersMatplotlib version 3.7.2.Used for saving qualitative visualization figures.
Python package - h5pyh5py developersh5py version 3.9.0.HDF5 file support for Synapse test volumes.
Python package - thopTHOP developersTHOP version 0.1.1.post2209072238.Used when calculating FLOPs and parameter-related computational cost.
Python package - packagingPython Packaging Authoritypackaging version 23.1.Dependency listed in README.
Python package - pytestpytest developerspytest version 7.4.0.Dependency listed in README.
Python package - chardetchardet developerschardet version 5.2.0.Dependency listed in README.
Python package - yacsYACS developersyacs version 0.1.8.Configuration utility dependency listed in README.
Python package - termcolortermcolor developerstermcolor version 2.3.0.Logging/terminal utility dependency listed in README.
Python package - submititsubmitit developerssubmitit version 1.4.5.Experiment/job utility dependency listed in README.
Python package - tensorboardXtensorboardX developerstensorboardX version 2.6.2.2.Training log visualization utility listed in README.
Python package - ml-collectionsml_collections developersml-collections version 0.1.1.Imported by configs/config_setting_synapse.py.
Dataset - ISIC 2017 Challenge datasetInternational Skin Imaging CollaborationISIC 2017 skin lesion segmentation datasetPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - ISIC 2018 Challenge Task 1 datasetInternational Skin Imaging CollaborationISIC 2018 Task 1: Lesion Boundary SegmentationPublic de-identified dermoscopic skin lesion images and masks used for binary segmentation.
Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault datasetSynapse / Sage BionetworksAccession identifier: syn3193805Public abdominal CT multi-organ segmentation dataset.
Data organization - ISIC 2017 data folderAuthors / repository layoutdata/isic2017/Expected local folder containing train and validation images/masks.
Data organization - ISIC 2018 data folderAuthors / repository layoutdata/isic2018/Expected local folder containing train and validation images/masks.
Data organization - Synapse data folderAuthors / repository layoutdata/Synapse/Expected local folder for Synapse lists, train_npz, and test_vol_h

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

234234

관련 논문