이 프로토콜은 의료 이미지 분할을 위한 다중 뷰 Vision Mamba U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 방법을 설명하며, 표준화된 데이터셋 준비, 모델 구현, 성능 평가를 통해 피부 병변과 복부 장기의 재현 가능한 분할을 가능하게 합니다.
방법 논문
이 프로토콜은 의료 이미지 분할을 위한 다중 뷰 Vision Mamba U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 방법을 설명하며, 표준화된 데이터셋 준비, 모델 구현, 성능 평가를 통해 피부 병변과 복부 장기의 재현 가능한 분할을 가능하게 합니다.
의료 이미지 분할은 전반적 맥락, 국소 경계, 다층 해부학적 구조를 정확히 포착하면서도 다양한 응용 분야에서 재현 가능한 계산 방법이 필요합니다. 이 글은 2차원 의료 이미지 분할을 위한 다중 뷰 비전 맘바 U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 프로토콜을 제시합니다. 이 프로토콜은 공개 데이터셋 획득, 이미지 및 마스크 전처리, 네트워크 구축, 모델 학습, 체크포인트 선택, 정량적 및 정성적 성능 평가를 포함한 재현 가능한 워크플로우를 제공합니다. 이 프레임워크는 다중 뷰 특징 스캔을 통합하여 보완적인 공간, 윤곽, 축척, 경계 정보를 포착하고, U자형 인코더-디코더 아키텍처 내에서 다단계 특징 융합을 적용하여 세분화 중 특징 통합을 향상시킵니다. 이 프로토콜은 공개된 피부 병변 및 복부 장기 분할 데이터셋을 사용하여 시연됩니다. 설명된 구현 워크플로우 하에서, 프레임워크는 표준 평가 지표를 사용하여 경쟁력 있는 세분화 성능을 달성합니다. 이 프로토콜에서 제시된 절차를 따르면, 연구자들은 모델 구현을 재현하고, 정의된 실험 설정을 사용해 네트워크를 훈련하며, 분할 성능을 평가하고, 재현 가능한 딥러닝 기반 분석이 필요한 관련 의료 영상 분할 작업에 맞게 워크플로우를 조정할 수 있습니다.
의료 영상 분할은 컴퓨터 비전 및 의료 영상 분석 분야에서 기본적인 작업입니다. 1,2,3. 이 과정은 이미지를 여러 영역이나 객체로 나누어 추가 분석과 처리를 수행하는 과정을 포함합니다. 이 기술은 임상의가 병리 영역을 식별하고 국소화하는 데 도움을 주어 진단 정확도와 치료 계획을 향상시키기 때문에 특히 의료 영상에서 중요합니다. 자기공명영상(MRI), 컴퓨터 단층촬영(CT), 양전자 방출 단층촬영(PET)과 같은 의료 영상 기술의 발전과 함께 정확한 의료 영상 분할 기술에 대한 수요가 계속 증가하고 있습니다. 현재 의료 영상 분할 방법은 크게 세 가지 주요 접근법으로 분류할 수 있습니다: 합성곱 신경망(CNN) 기반 방법4, 트랜스포머 기반 방법5, 상태 공간 모델(SSM) 기반 방법 6,7. CNN 기반 방법은 일반적으로 의료 영상 분할을 위해 U자형 네트워크 아키텍처를 사용합니다. 이 범주에서 가장 널리 사용되는 아키텍처는 U-Net8로, 이는 생의학 이미지 분할을 위한 U자형 인코더-디코더 아키텍처의 효율성을 입증했습니다. U-Net3+는 UNet++9의 밀집 스킵 연결과 풀스케일 스킵 연결을 결합하여 다중 스케일 특징 집계를 향상시킵니다. 그러나 CNN 기반 방법은 장거리 의존성을 포착하는 데 한계가 있어 장거리 맥락 정보를 효과적으로 모델링하지 못할 수 있습니다.
트랜스포머 기반 방법은 자기 주의 메커니즘을 통해 장거리 의존성을 효과적으로 포착하며, 병렬 계산을 가능하게 하고 관심 영역별로 다른 주의 가중치를 할당합니다. UNETR++10 은 매개변수 수와 계산 비용을 줄이기 위해 효율적인 쌍 주의(EPA) 모듈을 도입했습니다. nnFormer11 은 인터리브 합성곱 연산과 자기 주의 연산을 결합하고, 3차원(3D) 의료 이미지 분할에서 부피 표현을 학습하기 위한 국소-전역 부피 기반 자기 주의 메커니즘을 도입합니다. H2Former12 는 인코더에서 주의 메커니즘과 CNN 기반 특징 추출을 결합한 효율적인 계층적 하이브리드 비전 트랜스포머를 제안합니다. 하지만 트랜스포머 기반 방법은 시퀀스 길이가 증가할수록 계산 복잡도가 2차 증가하여 계산 비용이 크게 증가합니다. 그림 1 은 MVM-UNet의 동기를 보여주며, 제안된 다중 뷰 스캔 전략을 기존 SSM 기반 분할 프레임워크와 비교합니다.

그림 1. MVM-UNet과 기존의 순수 상태-공간-모델(SSM) 기반 분할 아키텍처 비교. 기존의 순수 상태 공간 모델(SSM) 기반 세분화 프레임워크와 제안된 다중 뷰 맘바 U-Net(MVM-UNet) 아키텍처 간의 비교. 상단 패널은 MVM-UNet을 보여주는데, 이 모듈에서는 다중 뷰 4방향(MV4D) 모듈이 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 이용해 공간을 융합 Mamba(SFusion Mamba)로 통합하여 상호 보완적인 특징을 추출하고, Multi-stage Fusion Mamba(MFusion Mamba)는 디코딩 전에 다중 스케일 인코더 기능을 집계합니다. 하단 패널은 교차 스캔이 가능한 선택적 스캔 2차원(SS2D) 모듈을 사용한 대표적인 순수 SSM 기반 아키텍처를 보여줍니다. 도표는 기존 SSM 기반 세분화 네트워크와 제안된 MVM-UNet 간의 아키텍처적 차이를 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
SSM 기반 방법은 트랜스포머의 전역 모델링 능력과 선형 계산 복잡도를 결합합니다. 맘바 아키텍처는 선택적 상태 공간 모델(Selective-SSM)을 사용하여 입력 정보를 선택적으로 처리하여, 입력에 따라 모델이 매개변수를 동적으로 조정하면서 관련 없는 정보를 필터링하고 정보 제공 기능을 강조할 수 있습니다. Vim13 과 VMamba14 는 Mamba 아키텍처를 컴퓨터 비전 작업에 맞게 적용합니다. U-Mamba15 는 의료 영상 분할에 SSM의 적용을 탐구하기 위해 하이브리드 CNN–SSM 아키텍처를 사용하는 반면, Mamba-UNet16 은 의료 영상 분할을 위해 완전한 SSM 기반 인코더-디코더 아키텍처를 채택합니다. 이 방법들은 훨씬 적은 매개변수를 사용하면서도 경쟁력 있는 성능을 달성합니다. 그러나 현재의 SSM/맘바 기반 방법은 주로 간단한 이미지 패치와 SS2D 스캐닝 전략을 사용하여 이미지 특징을 추출하며, 이는 의료 이미지 분할에 여러 한계를 제공합니다. 첫째, SS2D 및 패치 기반 기법은 주로 일반적인 컴퓨터 비전 작업을 위해 설계되었습니다. Local Mamba17 과 Motion Mamba18 은 SS2D 스캐닝 전략이 모든 시각 작업에 충분하지 않다고 제안했는데, 이는 서로 다른 유형의 시각 정보를 포착하기 때문입니다. 둘째, SS2D 스캔 전략은 비교적 단순하여 수평 및 수직 스캔 방향에만 의존합니다. 따라서 복잡한 공간적 관계나 세밀한 구조적 세부사항을 충분히 포착하지 못할 수 있습니다. 의료 이미지 분할은 전 지구적 공간적 맥락과 정밀한 국부 해부학적 특징을 동시에 모델링해야 합니다. 더불어, 현재의 SSM/맘바 기반 방법은 인코더와 디코더 간의 제한된 기능 융합을 제공합니다. UNet++, FATNet과 같은 아키텍처는 향상된 특징 융합을 통해 분할 정확도를 높이며, 의료 이미지 분할에 효과적인 특징 통합의 중요성을 강조합니다.
이러한 한계를 해결하기 위해 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제안합니다. 그림 1에 나타난 것처럼, 제안된 다중 뷰 4방향(MV4D) 모듈은 MVM-UNet의 핵심 특징 추출 구성 요소로, 네 가지 서로 다른 스캐닝 전략의 정보를 통합하여 의료 이미지 분할을 위해 특별히 설계되었습니다. 각 스캐닝 전략은 상호 보완적인 이미지 특징을 추출하여 입력 이미지의 서로 다른 뷰를 나타냅니다. 지그재그 스캐닝19 는 각 행 또는 열의 끝에서 이동 방향을 번갈아 사용하여 국부와 전역 공간 정보를 균형 있게 조정합니다. 반면, 나선형 및 방사형 스캔 방식20 은 중심에서 바깥쪽이나 주변부에서 안쪽으로 확장하여 포괄적인 범위 커버리지를 제공합니다. 계층적 스캐닝18 은 여러 규모에서 국적·전역적 특징을 모두 포착합니다. 각 스캔 전략의 견고성을 높이기 위해 스캔 쌍은 S6 블록에 입력되기 전에 병합됩니다. 스캔뷰 퓨전 맘바(SFusion Mamba) 모듈은 네 가지 스캔 방식에서 추출한 특징을 통합합니다. 멀티스케일 인코더 기능을 효과적으로 활용하기 위해, 본 논문은 각 인코더 단계의 출력을 축적하고 융합한 후 퓨전 기능을 디코더에 전달하는 멀티스케일 맘바 퓨전 모듈(MFusion Mamba)을 제안합니다. MVM-UNet은 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 평가되었습니다. 실험 결과는 MVM-UNet이 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 경쟁력 있는 세분화 성능을 달성함을 보여줍니다.
대표적인 세분화 아키텍처는 의료 이미지 세분화를 더욱 발전시켰습니다. U-Net은 세포 계수, 검출, 형태계측21과 같은 생의학 영상 분석 과제에도 성공적으로 적용되었습니다. CA-Net22와 같은 주의 강화 CNN 아키텍처는 포괄적인 주의 메커니즘을 통해 특징 표현을 향상시킵니다. TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26, TransCUNet27 등 대표적인 Transformer 기반 세분화 프레임워크들은 의료 이미지 분할을 위한 주의 기반 글로벌 특징 모델링의 효과를 더욱 입증합니다.
MVM-UNet의 설계는 기존 SSM/맘바 기반 분할 방법의 두 가지 한계에 의해 동기부여되었습니다. 첫째, 현재 많은 Vision Mamba 모델은 단순한 2차원 스캐닝 전략에 의존하는데, 이는 불규칙한 병변 경계, 작은 표적 영역, 다층 해부학적 구조를 포함하는 의료 이미지에는 부족할 수 있습니다. 둘째, 기존의 U자형 인코더-디코더 아키텍처는 주로 해당 스킵 연결을 통해 기능을 전송하여, 디코딩 시 다단계 인코더 정보를 직접 사용하는 것을 제한합니다. 따라서 MVM-UNet은 다중 뷰 공간 모델링을 향상시키기 위해 MV4D를, 다단계 인코더 기능을 명시적으로 집계하는 MFusion Mamba를 도입합니다. 이 설계는 맘바 기반 장거리 모델링을 의료 영상 분할의 특정 요구사항에 맞게 조정하기 위해 설계되었습니다.
MVM-UNet은 일반적인 인코더-디코더 패러다임과 맘바 기반 시퀀스 모델링을 기반으로 하지만, 이 구성 요소들이 의료 영상 분할에 맞게 어떻게 적응되고 통합되는지에 새로움이 있습니다. 표준 맘바 블록을 U자형 네트워크 백본에 단순히 통합하는 대신, 제안된 프레임워크는 여러 작업 지향 스캔 쌍 분기를 통해 공간 모델링 과정을 재설계하고, 스캔별 표현을 통합하는 SFusion Mamba를 도입하며, 잔차 및 투영 경로로 MVV 블록을 강화하고, 인코더와 디코더 사이에 MFusion Mamba를 삽입하여 다단계 인코더 기능을 집계한 후 디코딩합니다. 이 아키텍처 수준의 설계는 의료 이미지에서 흔히 관찰되는 불규칙한 경계, 작은 목표 영역, 다층 해부학적 구조를 해결하는 것을 목표로 합니다.
이 프로토콜은 2차원 의료 이미지에서 장거리 맥락 정보, 불규칙한 물체 경계, 다중 규모 해부학적 구조를 동시에 모델링해야 하는 분할 작업에 가장 적합합니다. CNN 기반 분할 방법과 비교할 때, 맘바 기반 인코더-디코더 설계는 의료 이미지 분할 연구자들이 익숙한 U자형 워크플로우를 유지하면서 효과적인 맥락 모델링 메커니즘을 제공합니다. 트랜스포머 기반 방법과 비교할 때, 제안된 프레임워크는 이차 자기 주의를 직접 사용하지 않으며, 비교적 효율적인 시퀀스 모델링 메커니즘을 이용한 전역 맥락 모델링을 추구하는 연구자들을 위한 것입니다. 따라서 이 프로토콜은 피부 병변 분할, 복부 장기 분할 및 전반적 구조 정보와 국소 경계 세부사항이 모두 중요한 유사한 2차원 의료 영상 분할 작업에 적합합니다.
이 프로토콜에는 사용 전에 고려해야 할 제한 사항도 있습니다. 경량 CNN이 이미 충분한 성능을 제공하는 비교적 단순한 분할 작업에는 필요하지 않을 수 있습니다. 또한, 아키텍처적 적응 없이 완전한 3차원 체적 분할을 위해 직접 설계된 것은 아닙니다. 주석이 달린 데이터가 매우 제한적이거나, 그래픽 처리 장치(GPU) 자원이 제한적이거나, 해석 가능한 고전 모델이 요구되는 연구자들도 프로토콜을 적용하기 전에 이러한 제약 조건을 고려해야 합니다. 전반적으로 이 방법은 장거리 맥락 모델링, 국소 경계 표현, 다단계 특징 융합을 균형 있게 결합한 맘바 기반 U자형 분할 프레임워크를 재현하고 평가하려는 연구자들을 위한 것입니다.
주요 기여는 다음과 같습니다:
1. 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제시합니다. 기존의 SS2D 기반 또는 표준 맘바 블록을 직접 통합하는 접근법과 달리, MVM-UNet은 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 뷰에서 의료 영상 특징을 모델링하는 MV4D를 도입합니다.
2. 본 논문은 SFusion Mamba와 MVV 블록을 설계하여 스캔 특화 표현을 통합하고 특징 변환을 향상시키도록 합니다. SFusion Mamba는 서로 다른 스캔쌍 가지에서 추출한 특징들을 융합하는 반면, MVV 블록 내의 잔류 및 상하 투사 분기는 특징 표현을 안정화하고 풍부하게 하는 상호 보완적인 특징 경로를 제공합니다.
3. 본 논문은 인코더와 디코더 사이의 중간 다단계 융합 모듈로서 MFusion Mamba를 소개합니다. 주로 대응하는 단계 특징을 전달하는 기존의 스킵 연결과 달리, MFusion Mamba는 다단계 인코더 기능을 거친 융합에서 미세한 융합으로 명시적으로 집계하며, 디코딩을 위한 풍부한 정보를 제공합니다.
4. 광범위한 실험 결과에 따르면 제안된 MVM-UNet은 ISIC 2017 및 ISIC 2018 데이터셋에서 경쟁력 있는 세분화 성능을 보이며, Synapse 다기관 세분화 데이터셋에서는 강력한 성능을 보입니다. 더 나아가, 포괄적인 절제 연구는 MVM-UNet 내 각 구성 요소의 기여를 검증합니다.
이 연구는 ISIC 2017, ISIC 2018, Synapse 등 공개적으로 이용 가능한 및 식별 해제된 의료 이미지 데이터셋만을 사용했습니다. 이 연구에서는 새로운 인간 참가자, 동물 대상 또는 식별 가능한 개인 의료 기록이 수집되지 않았습니다. 본 연구에 사용된 ISIC 2017 데이터셋은 공식 국제 피부 영상 협력 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2017)에서 얻은 ISIC 2017 챌린지 피부 병변 분절 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2017 병변 분할 과제에 해당하며, 공식 훈련, 검증 및 테스트 파티션을 포함합니다. 이 데이터셋은 2024년 3월 15일에 다운로드되었습니다. 본 연구에 사용된 ISIC 2018 데이터셋은 공식 국제 피부 영상 협력체 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2018)에서 얻은 ISIC 2018 챌린지 과제 1 병변 경계 분할 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2018 과제 1: 병변 경계 분할에 해당합니다. 데이터셋은 2024년 7월 8일에 다운로드되었습니다.
본 연구에서 사용된 시냅스 데이터셋은 Synapse 저장소에서 accession identifier syn3193805 (https://www.synapse.org/Synapse:syn3193805) 하에 얻은 Multi-Atlas Labeling Beyond the Cranial Vault 복부 CT 데이터셋이었습니다. 본 연구에서 사용된 데이터셋은 일반적으로 사용되는 30건의 복부 CT 다기관 분할 데이터셋에 해당합니다. 다운로드된 아카이브는 Abdomen/RawData.zip로, accession syn3193805로 이용 가능하다. 다운로드 당시 저장소에서는 별도의 버전 번호, 릴리스 라벨, 날짜가 명시된 릴리스 태그를 제공하지 않았습니다. 이전 연구에서 채택된 표준 분할에 따라 18건은 훈련에, 12건은 시험에 사용되었습니다. 데이터 분할은 TransUNet23가 사용한 사례 목록을 따랐습니다. 구체적으로, 교육 사례는 case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, case0037이었으며, 테스트 사례는 case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, case0035였습니다. 이 데이터셋은 2024년 7월 9일에 다운로드되었습니다. 이 연구는 공개된 식별 해제 데이터셋만을 사용했고, 새로운 인간-피험자 데이터나 식별 가능한 개인 정보 수집을 포함하지 않았기 때문에, 이 프로토콜에 설명된 계산 실험에 대해 기관심사위원회의 승인이 필요하지 않았습니다. 공식적인 기관 면제 결정은 이루어지지 않았다. 지역 기관 정책에 의해 요구되는 경우, 연구자들은 공개된 데이터셋에 대한 2차 분석을 수행하기 전에 기관 면제 결정을 받아야 합니다. 이 연구에는 기관 윤리 면제 참조 번호나 공식 면제 문서가 제공되지 않았습니다.
1. 데이터셋 준비
(1)2. MVM-UNet 아키텍처의 구성
습니다.
를 생성합니다. 여기서 이중 병변 분할은 K = 1, 시냅스 다기관 분할은 K = 8입니다.
그림 2. 멀티뷰 맘바 U-Net(MVM-UNet)의 전체 아키텍처. 제안된 멀티뷰 맘바 U-Net(MVM-UNet) 아키텍처 개요. 입력 이미지는 패치 임베딩으로 변환되며, 멀티뷰 비전(MVV) 블록으로 구성된 네 개의 인코더 단계를 거치며 패치 머지 작업으로 분리됩니다. 인코더 기능은 다단계 퓨전 맘바(MFusion Mamba)에 의해 집계되어 스킵 연결을 통해 디코더로 전파됩니다. 디코더는 패치 확장 연산을 통해 공간 해상도를 점진적으로 복원하고, 투영 계층을 통해 최종 분할 지도를 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
3. MV4D 모듈 제작

그림 3. 멀티뷰 4방향(MV4D) 모듈의 아키텍처. 다중 뷰 4방향(MV4D) 특징 추출 모듈의 구조. 입력 패치는 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 분기를 통해 처리됩니다. 네 가지 분기에서 추출한 특징들은 병합되고, 상태 공간 블록을 사용해 처리되며, Spatial Fusion Mamba(SFusion Mamba)에 의해 통합되어 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
4. MVV 블록 건설

그림 4. 멀티뷰 비전(MVV) 블록의 아키텍처. 멀티뷰 비전(MVV) 블록의 구조. 이 블록은 다중 뷰 4방향(MV4D) 모듈과 깊이별 합성곱, 정규화, 선형 투영 계층을 포함하는 주요 특징 추출 분기로 구성되어 있습니다. 보조 상하 투영 분기는 요소별 곱셈을 통해 게이티드 특징 변조를 제공하며, 잔류 덧셈을 통해 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
5. MFusion Mamba 건설

그림 5. 다단계 핵융합 맘바(MFusion Mamba) 모듈의 아키텍처. 다단계 융합 맘바(MFusion Mamba) 모듈의 구조. 다중 스케일 인코더 특징들은 먼저 거친 융합으로 결합되고, 이후 선형 투영, 1차원 컨볼루션(Conv1d), 맘바 블록, 특징 투영 층으로 구성된 파인 퓨전 모듈을 통해 정제되어 디코더가 사용하는 융합 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
6. 모델 훈련
7. 모델 평가
(2)
(3)
(4)
(5)
(6)8. 손실 함수 정의
(7)
(8)
(9)
(10)
(11)
2 = 1.0이
되도록 설정하세요. 시냅스의 CE와 주사위 손실 가중치를 1.0으로 설정하세요. 예를 들어 1 = 1.0, φ2 = 1.0 φ9. 재현성 설정 및 실행
예상 결과 및 해석
이 프로토콜이 올바르게 구현되면, 훈련된 MVM-UNet 모델은 반복 실행에서 안정적인 분할 성능을 보이며, 대부분의 평가 지표에서 서로 다른 무작위 시드 간에 약간의 변동만 있을 것으로 기대됩니다. ISIC 2017과 ISIC 2018의 성공적인 결과는 높은 DSC, mIoU, Acc, Sen, Spe 값과 함께 실제 병변 경계를 밀접하게 따르는 예측 병변 마스크로 반영됩니다(그림 6 및 7). 시냅스의 경우, 성공적인 결과는 전경 기관 전반에서 높은 평균 DSC 값과 낮은 HD95 수치로 나타납니다(그림 8). 프로토콜 실행 중에는 정량적 지표와 이에 대응하는 정성적 세분화 결과가 함께 해석되어야 합니다. 높은 DSC를 달성하지만 경계 누설, 작은 구조의 누락, 또는 예측이 단편화된 모델은 부분적으로만 성공한 것으로 간주되어야 하며, 전처리 절차, 체크포인트 선택, 추론 설정을 검증해야 합니다.

그림 6. ISIC 2017 데이터셋에서의 대표성 세분화 결과. 국제 피부 영상 협력(ISIC) 2017년 피부 병변 분할 데이터셋에서 얻은 대표적인 질적 분할 결과. 각 예시는 원본 피부경 이미지(Image), 해당 지상 진실 분할 마스크(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 테스트 케이스들은 크기, 형태, 경계 복잡도가 다양한 병변에 대한 분할 성능을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 7. ISIC 2018 데이터셋에서의 대표적인 질적 세분화 결과. 국제 피부 영상 협력체(ISIC) 2018년 피부 병변 분할 데이터셋에서 얻은 대표적인 질적 분할 결과입니다. 각 예시는 원본 피부경 이미지(Image), 해당 지상 진실 분할 마스크(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 테스트 케이스는 다양한 병변 외관과 경계 특성에서 분할 성능을 입증합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 8. Synapse 다기관 컴퓨터 단층촬영 데이터셋에서의 대표적인 질적 분할 결과. Synapse Multi-Atlas Labeling Beyond the Cranial Vault 데이터셋에서 얻은 대표적인 질적 다기관 분할 결과. 각 예시는 원본 컴퓨터 단층촬영 영상(Image), 해당 실제 장기 주석(GT), 그리고 MVM-UNet(Pred)에서 생성된 예측을 보여줍니다. 대표적인 예시는 여러 복부 장기에서 예측된 분절과 기준 분절 간의 일치를 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
ISIC 2017에서의 공연
MVM-UNet의 재현성을 평가하기 위해 모든 주요 비교 실험을 세 개의 독립적인 무작위 시드(1, 52, 100)를 사용해 반복했으며, 결과는 표준편± 평균으로 보고되었습니다. 통계적 유의성은 ISIC 2017과 ISIC 2018의 이미지별 결과와 Synapse의 사례별 쌍 결과를 바탕으로 Wilcoxon 부호 순위 검정을 사용하여 평가하였습니다. 통계 분석은 시드 수준 평균이 아닌 쌍 측정 값을 사용하여 수행되었습니다. 공정한 비교를 위해, 평균 ± SD로 보고된 결과는 가능한 한 동일한 데이터셋 파티션, 입력 해상도, 평가 지표 하에 공식 구현을 사용해 재현했으며, 단일 값 결과는 해당 원본 출판물에서 유지되었습니다.
MVM-UNet은 ISIC 2017 피부 병변 분할 데이터셋에서 평가되었으며, UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36, H2Former12 등 대표적인 분절 방법들과 비교되었습니다(표 1). MVM-UNet은 세 차례의 독립 실험에서 mIoU 80.94± 1.01%, DSC 91.32% ± 0.68%, 정확도 96.58% ± 0.27%, 특이성 98.31% ± 0.23%, 민감도는 91.65% ± 0.77%를 달성했습니다. 평가된 방법들과 비교했을 때, MVM-UNet은 가장 높은 mIoU, DSC, 그리고 감도도를 달성했습니다. 대표성 정성적 분할 결과는 그림 6에 나타나며, 예측된 마스크는 대표성 테스트 이미지 전반에 걸쳐 실제 병변 경계를 밀접하게 따릅니다.
| 모델 | 참고문헌. | mIoU (%) | DSC (%) | 수익률 (%) | Spe (%) | 센 (%) |
| 유닛 | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| 트랜스유닛 | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| 말룬넷 | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| 유니엑스트-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResFormer | 34 | 79.89 ± 1.05 | 88.82 ± 0.65 | 96.25 ± 0.24 | 97.73 ± 0.22 | 87.72 ± 0.79 |
| H-브무넷 | 28 | 80.34 ± 1.02 | 90.68 ± 0.55 | 96.42 ± 0.18 | 98.23 ± 0.32 | 88.97 ± 0.88 |
| 포머 양 | 30 | 80.16 ± 0.78 | 89.27 ± 0.61 | 94.36 ± 0.28 | 97.52 ± 0.38 | 87.71 ± 0.69 |
| H2포터 | 12 | 80.35 ± 0.95 | 88.56 ± 0.72 | 96.61 ± 0.19 | 98.15 ± 0.14 | 88.21 ± 0.81 |
| 메드스케일-포머 | 35 | 80.31 ± 0.82 | 89.11 ± 0.59 | 95.68 ± 0.33 | 98.24 ± 0.21 | 89.96 ± 0.92 |
| MCAFT | 36 | 80.59 ± 0.93 | 89.27 ± 0.63 | 96.42 ± 0.20 | 97.95 ± 0.17 | 90.05 ± 0.84 |
| MVM-UNet (우리 회사) | — | 80.94 ± 1.01 | 91.32 ± 0.68 | 96.58 ± 0.27 | 98.31 ± 0.23 | 91.65 ± 0.77 |
표 1: ISIC 2017 피부 병변 분할 데이터셋에서의 성과 비교. MVM-UNet을 평균적 교차 단합(mIoU), 주사위 유사도 계수(DSC), 정확도(Acc.), 특이도(Spe.), 민감도(Sen.)를 사용하여 대표적인 합성곱 신경망(CNN), 트랜스포머, 상태 공간 모델(SSM) 기반 분할 방법과 비교합니다. MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.
정성적 예시는 MVM-UNet이 경계가 불규칙한 작은 병변과 큰 병변 모두를 정확히 구분했음을 보여줍니다. 이 대표적인 예시들에서 예측된 마스크는 해당 진실성 주석과 매우 유사하게 일치했고, 누출이나 파편화가 최소화된 상태로 병변 경계를 보존했습니다.
관찰된 개선이 통계적으로 유의미한지 추가 평가하기 위해, Wilcoxon 부호 순위 검정을 이미지별 분할 결과를 사용하여 수행하였습니다. mIoU 지표에서 MVM-UNet은 MCAFT보다 통계적으로 유의한 개선을 보였으며, p-값은 0.0114였습니다. DSC 지표에서도 MVM-UNet은 p값 0.0031로 H-vmunet보다 현저히 우수한 성과를 냈습니다. 이 결과는 ISIC 2017에서 관찰된 개선이 무작위 변동에 기인할 가능성은 낮다는 것을 뒷받침합니다.
전반적으로 MVM-UNet은 비교 방법 중 ISIC 2017 데이터셋에서 mIoU, DSC, 민감도에서 가장 높은 성과를 달성했습니다(표 1). 그림 6 에 나타난 정성적 세분화 예시는 이러한 정량적 결과와 일치합니다.
ISIC 2018에서의 공연
MVM-UNet은 ISIC 2018 피부 병변 분할 데이터셋에서 추가 평가되었으며, UNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, MCAFT36 등 대표적인 분할 방법들과 비교되었습니다(표 2). MVM-UNet은 세 차례의 독립 유± 3개 독립 실행에서 mIoU 82.47% 1.28%, DSC 90.65% ± 0.94%, 정확도 96.02% ± 0.36%, 특이성 97.06% ± 0.31%, 민감도는 91.80% ± 0.82%를 달성했습니다. 이 결과들은 MVM-UNet의 성능이 다양한 무작위 시드에서 일관되게 유지되었음을 보여줍니다. 대표적인 정성적 세분화 결과는 그림 7에 나와 있습니다.
| 모델 | 참고문헌. | mIoU (%) | DSC (%) | 수익률 (%) | Spe (%) | 센 (%) |
| 유닛 | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| 사네트 | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| 말룬넷 | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-브무넷 | 28 | 81.93 ± 1.45 | 90.46 ± 0.62 | 95.19 ± 0.30 | 96.82 ± 0.21 | 88.37 ± 1.13 |
| 포머 양 | 30 | 80.27 ± 1.21 | 89.91 ± 0.46 | 94.76 ± 0.27 | 97.22 ± 0.15 | 90.84 ± 1.07 |
| H2포터 | 12 | 80.40 ± 0.83 | 90.26 ± 0.73 | 94.89 ± 0.38 | 96.98 ± 0.25 | 91.57 ± 0.54 |
| HResFormer | 34 | 81.12 ± 1.18 | 88.86 ± 0.84 | 94.96 ± 0.33 | 96.43 ± 0.22 | 91.86 ± 1.01 |
| 메드스케일-포머 | 35 | 80.97 ± 0.74 | 90.47 ± 0.68 | 95.02 ± 0.41 | 95.89 ± 0.26 | 90.65 ± 0.92 |
| MCAFT | 36 | 81.46 ± 1.03 | 89.06 ± 0.76 | 95.23 ± 0.29 | 96.72 ± 0.17 | 91.82 ± 0.57 |
| MVM-UNet (우리 회사) | — | 82.47 ± 1.28 | 90.65 ± 0.94 | 96.02 ± 0.36 | 97.06 ± 0.31 | 91.80 ± 0.82 |
표 2: ISIC 2018 피부 병변 분할 데이터셋에서의 성과 비교. MVM-UNet을 평균 교차 결합(mIoU), 주사위 유사 계수(DSC), 정확도(Acc.), 특이도(Spe.), 민감도(Sen.)를 사용하여 대표적인 CNN, 트랜스포머, SSM 기반 분할 방법과 비교. MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.
H-vmunet과 비교했을 때, MVM-UNet은 mIoU를 0.54% 개선했습니다. MedScale-Former와 비교했을 때, MVM-UNet은 DSC를 0.18% 개선했습니다. MVM-UNet은 비교 방법 중 가장 높은 정확도를 달성했습니다. 그림 7 에 제시된 대표적인 질적 예시들은 작은 병변 영역과 불규칙한 경계를 가진 병변을 포함한 대표적인 피부 병변의 정확한 분절을 보여줍니다.
ISIC 2018에서는 쌍별 이미지별 분할 결과를 기반으로 Wilcoxon 부호 순위 검정을 사용하여 통계적 유의성을 평가하였습니다. mIoU 지표에서 MVM-UNet은 MCAFT보다 통계적으로 유의한 개선을 보였으며, p값은 < 0.001이었습니다. 이 결과들은 ISIC 2018에서 관찰된 성능 향상이 무작위 변동에 기인할 가능성은 낮다는 것을 뒷받침합니다.
전반적으로 MVM-UNet은 ISIC 2018 데이터셋에서 비교 방법 중 가장 높은 mIoU, DSC, 정확도를 달성했습니다(표 2). 그림 7에 나타난 정성적 예시들은 이러한 정량적 개선과 일치합니다.
Synapse에서의 공연
제안된 방법은 Synapse 다기관 분할 데이터셋에서도 평가되었으며, UNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35, MCAFT36 등 대표적인 방법들과 비교되었습니다(표 3). 시냅스 데이터셋에는 대동맥, 담낭, 비장, 왼쪽 신장, 오른쪽 신장, 간, 췌장, 위 등 8개의 복부 장기가 포함되었습니다. 표준 실험 프로토콜에 따라 18건(2,212개의 축방향 단면)이 훈련용으로, 12건(1,567개의 축방향 단면)이 시험에 사용되었습니다. 별도의 검증 세트는 도입되지 않았습니다. 테스트 케이스는 최종 평가에만 사용되었으며, 모델 훈련, 하이퍼파라미터 튜닝, 모델 선택에는 사용되지 않았습니다. 대표적인 질적 다기관 분절 결과는 그림 8에 나타나 있으며, 정량적 비교는 표 3에 요약되어 있습니다.
| 모델 | 참고문헌. | DSC | HD95 | Aor. | 갤. | 애야. (L) | 애야. (R) | 리브. | 팬. | Spl. | 스토. |
| 유닛 | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| 트랜스유닛 | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| 트랜스노름 | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| 스윈 U-넷 | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| 트랜스딥랩 | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| 뮤-유닛 | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| 포머 양 | 30 | 80.92 ± 4.23 | 20.09 ± 1.89 | 86.43 ± 0.98 | 69.81 ± 4.56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93.85 ± 0.89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80.62 ± 1.02 |
| H2포터 | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86.61 ± 3.21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61.16 ± 0.76 | 89.97 ± 4.12 | 80.94 ± 3.56 |
| HResFormer | 34 | 80.65 ± 4.02 | 17.48 ± 6.89 | 89.16 ± 2.78 | 66.94 ± 0.78 | 84.61 ± 4.34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59.92 ± 4.12 | 91.08 ± 3.45 | 80.75 ± 2.01 |
| 메드스케일-포머 | 35 | 80.78 ± 1.34 | 20.02 ± 3.78 | 88.79 ± 4.02 | 69.82 ± 2.56 | 85.13 ± 0.87 | 81.63 ± 4.78 | 94.10 ± 2.78 | 60.72 ± 1.89 | 90.14 ± 1.56 | 80.93 ± 4.56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89.76 ± 0.76 | 68.96 ± 3.89 | 84.54 ± 2.56 | 81.98 ± 3.12 | 94.32 ± 4.01 | 60.85 ± 3.67 | 89.06 ± 4.89 | 80.91 ± 1.78 |
| MVM-UNet (우리 회사) | — | 81.26 ± 1.89 | 18.72 ± 2.16 | 88.53 ± 3.22 | 69.84 ± 4.23 | 85.37 ± 2.69 | 82.67 ± 1.67 | 94.41 ± 3.56 | 61.02 ± 2.78 | 90.19 ± 0.67 | 81.48 ± 3.12 |
표 3: Synapse 다기관 분할 데이터셋에서의 성과 비교. MVM-UNet을 Dice 유사도 계수(DSC), 95백분위수 하우스도르프 거리(HD95), 대동맥(Aor.), 담낭(Gal.), 왼쪽 신장(Kid)에 대한 장기 특이적 Dice 점수를 사용하여 대표적인 CNN, Transformer, SSM 기반 분할 방법과 비교하였습니다. (L)), 오른쪽 신장 (키드. (R)), 간(Liv.), 췌장(Pan.), 비장(Spl.), 위(Sto.). MVM-UNet의 결과는 세 개의 독립적인 무작위 시드 실험에서 평균 ± 표준편차로 보고되었습니다. 단일 값으로 보고된 결과는 해당 원본 출판물에서 재현되었습니다.
MVM-UNet는 세 차례 독립 선거에서 평균 DSC 81.26%± 1.89%, 평균 HD95 점수 18.72± 2.16을 기록했습니다. 결과는 Synapse 데이터셋에서 안정적인 세분화 성능을 보여줍니다. 평가된 방법 중 MVM-UNet은 가장 높은 평균 DSC와 두 번째로 낮은 평균 HD95를 달성했습니다.
Synapse의 경우, 쌍화된 사례별 DSC 값을 기반으로 Wilcoxon 부호 순위 검정을 사용하여 통계적 유의성을 평가하였습니다. MVM-UNet은 H2Former에 비해 통계적으로 유의한 개선을 보였으며, p-값은 0.026으로, 세분화 성능 향상이 통계적으로 유의미함을 나타냈다.
대표적인 성공 결과 및 최적에 부적합한 결과
대표적인 성공적인 질적 결과는 그림 6–8에 나타난다. 성공적인 결과는 실제 주석과 밀접하게 일치하고 원발 병변 또는 장기 경계를 정확히 구분하는 예측된 분절 마스크로 특징지어집니다. 대표적인 비최적 결과는 매우 작은 표적, 저대비 경계, 불규칙한 병변 형태, 약한 강도 대비 기관, 해부학적으로 모호한 경계에서 발생할 수 있으며, 일반적으로 저분절, 과분절, 경계 누출, 또는 불연속적인 마스크 조각으로 나타납니다. 이러한 결과가 관찰될 경우, 사용자는 이미지 크기 조정, 정규화, 마스크 보간, 모델 체크포인트 선택, 추론 임계값(ISIC 데이터셋의 경우) 또는 argmax 예측(Synapse의 경우), 그리고 메트릭 계산 절차가 프로토콜에 설명된 것과 일치하는지 확인해야 합니다.
MV4D 모듈의 절제 연구
MV4D 모듈의 기여도는 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 차례로 추가하여 평가되었으며, 이어서 SFusion Mamba 모듈(표 4; 그림 9). 지그재그 스캔 쌍만 사용할 때는 분할 성능이 제한적이었습니다. 계층적 스캔 쌍을 추가하면 성능이 크게 향상되었으며, 다중 스케일 정보 통합의 이점을 보여줍니다. 이후 나선형 및 방사형 스캔 쌍의 추가로 윤곽과 경계 표현을 강화하여 분할 성능을 더욱 향상시켰습니다. SFusion Mamba 모듈의 도입은 평가된 구성 중 가장 높은 성능을 보여주었습니다.
| 모델 | 지그재그 스캔 쌍 | 계층적 스캔 쌍 | 나선형 스캔 쌍 | 방사형 스캔 쌍 | SFusion Mamba | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-유닛 | ✓ | 56.75 | 72.46 | 58.03 | 73.45 | ||||
| MVM-유닛 | ✓ | ✓ | 72.38 | 84.01 | 73.45 | 84.7 | |||
| MVM-유닛 | ✓ | ✓ | ✓ | 75.69 | 86.20 | 76.94 | 86.94 | ||
| MVM-유닛 | ✓ | ✓ | ✓ | ✓ | 76.41 | 86.61 | 78.28 | 87.82 | |
| MVM-유닛 | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
표 4: 다중 뷰 4방향(MV4D) 모듈의 절제 연구. 계층적, 나선형, 방사형 스캔 쌍과 공간 융합 맘바(SFusion Mamba) 모듈을 기본 지그재그 스캔 쌍 아키텍처에 점진적으로 통합하여 성능을 얻었습니다. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.

그림 9. 다중 뷰 4방향(MV4D) 모듈의 소작 연구. (A) 계층적 스캐닝 쌍, 나선형 스캔 쌍, 방사형 스캔 쌍, 공간 융합 맘바(SFusion Mamba)를 순차적으로 통합한 후 결합 간 평균 교차(mIoU)의 변화. (B) 계층적 스캔 쌍, 나선형 스캔 쌍, 방사선 스캔 쌍, 공간 융합 맘바(SFusion Mamba)를 기본 아키텍처에 순차적으로 통합한 후 주사위 유사도 계수(DSC)의 변화. (C) 두 번째 실험 환경에서 계층적 스캔 쌍, 나선형 스캔 쌍, 방사형 쌍, 공간 융합 맘바(SFusion Mamba) 가 순차적으로 기본 구조에 통합된 후 mIoU 변화. (D) 두 번째 실험 환경에서 계층적 스캔 쌍, 나선형 스캔 쌍, 방사형 스캔 쌍, 공간 융합 맘바(SFusion Mamba)가 순차적으로 기본 구조에 통합된 후 DSC의 변화. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
ISIC 2017 데이터셋에서 전체 MV4D 모듈은 80.94%의 mIoU와 91.32%의 DSC를 달성했습니다. mIoU와 DSC의 해당 성능 추세는 각각 그림 9A 와 그림 9B에 나타난다. ISIC 2018 데이터셋에서 완전한 MV4D 모듈은 82.47%의 mIoU와 90.65%의 DSC를 달성했습니다. 해당 성능 추세는 각각 그림 9C 와 그림 9D에 나와 있습니다.
별도 명시가 없는 한, 모든 소작 실험은 고정된 무작위 시드인 100을 사용하여 수행되었으며, 주요 비교 결과는 세 개의 독립적인 무작위 시드(1, 52, 100)에 대한 평균 ± SD로 보고되었습니다. 따라서 소작 결과는 주요 비교 실험에서 보고된 최종 다중 시드 성능을 재현하는 것이 아니라, 통제된 단일 시드 환경에서 개별 구성 요소의 상대적 기여도를 비교하는 것을 목적으로 합니다.
전반적으로 추가 스캔 쌍과 SFusion Mamba 모듈을 점진적으로 통합하면서 분할 성능이 꾸준히 향상되었으며, 완전한 MV4D 구성이 두 데이터셋 모두에서 최고 성능을 달성했습니다.
멀티뷰 시각(MVV) 블록의 절제 연구
MVV 블록은 기본 아키텍처와 업다운 투영 분기를 포함한 버전을 비교하여 평가되었습니다(표 5). ISIC 2017 데이터셋에서 업-다운 투영 분기의 포함으로 mIoU는 78.83%에서 80.96%로, DSC는 88.15%에서 91.02%로 증가했습니다. ISIC 2018 데이터셋에서 mIoU는 80.32%에서 82.46%로, DSC는 89.15%에서 90.57%로 증가했습니다.
| 모델 | 기본 MVV 블록 | 업-다운 프로젝션 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-유닛 | ✓ | 78.83 | 88.15 | 80.32 | 89.15 | |
| MVM-유닛 | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
표 5: 다중 시야 시각(MVV) 블록의 절제 연구. 업다운 투사 분기가 있는 기준 멀티뷰 비전(MVV) 블록의 성능 비교. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.
MVV 블록 소작 실험은 고정된 무작위 시드 100을 사용하여 수행되었습니다. 따라서 업-다운 투영 분기를 포함한 구성의 성능은 통제된 단일 시드 제거 설정을 반영하며, 주요 비교 실험에서 전체 MVM-UNet 모델에 대해 보고된 3시드 평균 성능과 약간 다를 수 있습니다.
전반적으로 상하 투영 분기의 도입은 두 데이터셋 모두에서 분할 성능을 지속적으로 향상시켰으며, mIoU와 DSC 모두에서 증가가 관찰되었습니다.
다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구
MFusion Mamba 모듈은 다양한 거친 융합 전략과 미세 융합 구성 요소를 비교하여 평가되었습니다(표 6; 그림 10). MFusion Mamba 없이, MVM-UNet은 ISIC 2017 데이터셋에서 mIoU 75.47%와 DSC 86.01%를 달성했으며, ISIC 2018 데이터셋에서는 mIoU 77.49%와 DSC 87.29%를 달성했습니다. 평가된 거친 융합 전략 중에서 Hadamard 제품이 가장 큰 개선을 이루었습니다. 파인 퓨전 구성 요소의 도입으로 세분화 성능이 더욱 향상되었습니다. 전체 MFusion Mamba 구성은 ISIC 2017에서 80.95%의 mIoU와 91.18%의 DSC를, ISIC 2018에서는 82.51%의 mIoU와 90.58%의 DSC를 달성했습니다.
| 모델 | 거친 융합 원소별 최대 값 | 거친 융합 원소별 덧셈 | 거칠 융합 하다마르 곱 | 파인 퓨전 모듈 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-유닛 | 75.47 | 86.01 | 77.49 | 87.29 | ||||
| MVM-유닛 | ✓ | 76.21 | 86.47 | 78.35 | 87.82 | |||
| MVM-유닛 | ✓ | 76.83 | 86.86 | 79.11 | 88.30 | |||
| MVM-유닛 | ✓ | 78.26 | 87.83 | 80.06 | 88.96 | |||
| MVM-유닛 | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
표 6: 다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구. 최대 융합(Max), 원소별 첨가(⊕), Hadamard 곱(⊙) 등 다양한 거친 융합 전략의 성능 비교와 완전한 미세 융합 모듈을 포함합니다. 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대비 결합(mIoU)과 다이스 유사도 계수(DSC)를 사용하여 보고됩니다.

그림 10. 다단계 융합 맘바(MFusion Mamba) 모듈의 절제 연구. (A) 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 평균 교차 변화(mIoU). (B) 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 주사위 유사 계수(DSC)의 변화. (C) 두 번째 실험 설정에서 얻은 다양한 조잡 융합 전략(최대치, 원소별 첨가, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 mIoU 변화. (D) 두 번째 실험 설정에서 얻은 다양한 거친 융합 전략(최대치, 원소별 덧셈, Hadamard 곱)과 완전한 미세 융합 모듈을 사용하여 얻은 DSC 변화. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
ISIC 2017 데이터셋에서 완전한 MFusion Mamba 구성은 80.95%의 mIoU와 91.18%의 DSC를 달성했습니다. mIoU와 DSC의 해당 성능 추세는 각각 그림 10A 와 그림 10B에 나타난다. ISIC 2018 데이터셋에서 전체 MFusion Mamba 구성은 82.51%의 mIoU와 90.58%의 DSC를 달성했습니다. 해당 성능 추세는 각각 그림 10C 와 그림 10D에 나타난다. MFusion Mamba 소작 실험은 고정된 무작위 시드 100을 사용하여 수행되었습니다. 따라서 완전한 MFusion Mamba 구성은 통제된 단일 시드 소작 결과를 나타내며, 주요 비교 실험에서 전체 MVM-UNet 모델의 3시드 평균 성능과 약간 다를 수 있습니다.
전반적으로, Hadamard 곱 거친 융합 전략과 Fine Fusion 구성 요소를 점진적으로 도입하면서 세분화 성능이 꾸준히 향상되었으며, 완전한 MFusion Mamba 구성이 두 데이터셋 모두에서 최고 성능을 보였습니다.
소작술 연구 요약
소작 실험 전반에 걸쳐, 계층형, 나선형, 방사형 스캔쌍 분기와 SFusion Mamba 모듈을 점진적으로 통합하면서 분할 성능이 일관되게 향상되었습니다(표 4; 그림 9). 마찬가지로, MVV 블록에 업-다운 투영 분기(Up-Down Projection) 분기가 포함되면서 ISIC 2017 및 ISIC 2018 데이터셋의 mIoU와 DSC 모두가 향상되었습니다(표 5). 완전한 MFusion Mamba 구성은 평가된 다단계 특징 융합 전략 중 가장 높은 성능을 달성했습니다(표 6; 그림 10).
하이퍼파라미터의 소작 연구
입력 크기와 드롭아웃 값의 효과는 ISIC 2017 및 ISIC 2018 데이터셋에서 평가되었습니다(표 7). 세 가지 입력 해상도(256 × 256, 384 × 384, 512 × 512)가 비교되었습니다. 평가된 설정에서 256 × 256 입력 해상도가 두 데이터셋 모두에서 가장 높은 분할 성능을 달성했습니다.
| 모델 | 입력 크기 256 × 256 | 입력 크기 384 × 384 | 입력 크기 512 × 512 | 드롭아웃 0.0 | 드롭아웃 0.1 | 드롭아웃 0.2 | 드롭아웃 0.3 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-유닛 | ✓ | ✓ | 80.02 | 88.91 | 81.76 | 89.92 | |||||
| MVM-유닛 | ✓ | ✓ | 79.96 | 88.87 | 80.97 | 89.47 | |||||
| MVM-유닛 | ✓ | ✓ | 77.48 | 87.28 | 78.76 | 88.11 | |||||
| MVM-유닛 | ✓ | ✓ | 79.36 | 88.53 | 81.13 | 89.62 | |||||
| MVM-유닛 | ✓ | ✓ | 80.94 | 90.15 | 82.49 | 90.50 | |||||
| MVM-유닛 | ✓ | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
표 7: 입력 이미지 크기 및 드롭아웃 값의 소작 연구. 서로 다른 입력 이미지 크기와 드롭아웃 값을 사용한 MVM-UNet의 성능 비교. 세분화 성능은 ISIC 2017 및 ISIC 2018 데이터셋에서 평균 교차 대 합집합(mIoU)과 주사위 유사도 계수(DSC)를 사용하여 보고됩니다.
또한 다양한 중도 고치가 평가되었습니다. 테스트된 구성 중에서 드롭아웃 값 0.2가 두 데이터셋 모두에서 가장 높은 분할 성능을 달성했으며, 따라서 주요 실험에서 사용되었습니다.
인코더-디코더 계층 구성의 소작 연구
네트워크 깊이가 세그멘테이션 성능과 계산 비용에 미치는 영향을 조사하기 위해 다양한 인코더-디코더 계층 구성을 평가하였습니다(표 8). 평가된 구성 중에서 대칭 {2, 2, 2, 2}-{2, 2, 2, 2} 아키텍처가 상대적으로 낮은 모델 복잡도를 유지하면서 가장 높은 전체 분할 성능을 달성했습니다. 네트워크 깊이를 {2, 2, 9, 2}-{2, 9, 2, 2}로 늘리면 세분화 성능은 비슷했지만, 매개변수 수와 계산 비용이 증가했습니다.
| 모델 | 인코더-디코더 계층 구성 | 매개변수 (M) | 플랍 (G) | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-유닛 | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-유닛 | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-유닛 | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-유닛 | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-유닛 | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
표 8: 인코더-디코더 층 구성의 소작 연구. 서로 다른 인코더-디코더 계층 구성의 성능 비교. 이 표는 ISIC 2017 및 ISIC 2018 데이터셋에서 모델 매개변수(Parameters), 부동소수점 연산(FLOP), 결합 간 평균 교차점(mIoU), 주사위 유사도 계수(DSC)의 수를 보고합니다.
계산 비용 비교
최종 MVM-UNet 모델의 계산 효율성은 동일한 하드웨어 환경과 입력 해상도 하에서 HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former, MCAFT 등 대표적인 기초 방법들과 비교되었습니다(표 9). 평가된 지표에는 에포크별 훈련 시간, 이미지당 추론 시간, 훈련 중 GPU 메모리 사용량의 최대 시간, 학습 가능한 매개변수(Param) 수, FLOP 수가 포함되었습니다. 훈련 시간은 한 훈련 에포크를 완료하는 데 필요한 시간으로, 추론 시간은 테스트 이미지당 평균 처리 시간으로, FLOP은 단일 순방향 패스에 대해 계산되었습니다.
| 방법 | 참고문헌. | 훈련 시간 (시대 기준) | 추론 시간 (ms/image) | 최대 GPU 메모리 (GB) | 매개변수 (M) | 플랍 (G) |
| HResFormer | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-브무넷 | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| 포머 양 | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2포터 | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| 메드스케일-포머 | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (우리 회사) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
표 9: MVM-UNet과 대표적 기준선 방법의 계산 비용 비교. 동일한 하드웨어 환경과 입력 해상도 하에서의 계산 효율성 비교. 보고된 지표로는 에포크별 학습 시간, 이미지당 추론 시간, 학습 중 그래픽 처리 장치(GPU) 메모리 사용량, 모델 매개변수(매개변수) 수(매개변수), 부동소수점 연산(FLOP) 등이 포함됩니다. 가능한 한 동일한 실험 환경에서 구현된 방법을 평가했습니다.
표 9에 요약된 바와 같이, MVM-UNet은 훈련 에포크당 104초, 추론 이미지당 26.8ms, 최대 GPU 메모리 7.9GB, 학습 가능 매개변수 2,836만 개, GFLOP 4.39개를 필요로 했습니다. HResFormer, MISSFormer, H2Former, MCAFT와 비교할 때, MVM-UNet은 더 낮은 훈련 시간, 더 짧은 추론 시간, 낮은 최대 GPU 메모리 사용량, 그리고 더 적은 FLOP을 요구했습니다. 경량 H-vmunet 및 MedScale-Former 모델과 비교할 때, MVM-UNet은 더 많은 학습 시간과 메모리 사용량이 필요했지만, 비교적 낮은 계산 복잡도를 유지하면서 비슷한 추론 속도를 유지했습니다.
데이터 및 코드 이용 가능성
ISIC 2017 및 ISIC 2018 데이터셋은 국제 피부 영상 협력체(ISIC) 아카이브에서 공개되어 있으며, Synapse 데이터셋은 Synapse 저장소에서 공개되어 있습니다. 데이터셋 획득 세부 사항은 윤리 성명서에 제공되어 있습니다. 간단히 말해, ISIC 2017 데이터셋은 공식 ISIC 2017 챌린지 데이터 저장소(https://challenge.isic-archive.com/data/#2017 에서), ISIC 2018 데이터셋은 공식 ISIC 2018 챌린지 태스크 1 데이터 저장소(https://challenge.isic-archive.com/data/#2018)에서, Synapse 데이터셋은 Synapse 저장소에서 accession identifier syn3193805(https://www.synapse.org/Synapse:syn3193805)에서 획득했습니다. 해당 다운로드 날짜는 윤리 성명서에 보고되어 있습니다. MVM-UNet 소스 코드의 초기 공개 버전은 https://github.com/LIXUEGUANG002/MVM-UNet 에서 제공됩니다. 저장소에는 모델 구현, 주요 네트워크 모듈, 구성 파일, 데이터셋 조직 지침, 학습 스크립트, 평가 스크립트가 포함되어 있습니다. 최종 설정 파일, 완전한 실험 스크립트, 추가 문서, 학습된 모델 체크포인트를 포함한 완전한 재현성 패키지는 공개 시 공개될 예정입니다.
보충 표 1. 멀티뷰 비전 맘바 유닛(MVM-UNet)의 계층별 아키텍처. 표는 MVM-UNet의 순차 네트워크 아키텍처를 요약하며, 입력 계층, 패치 임베딩, 인코더 단계, 멀티뷰 비전(MVV) 블록, 패치 머징 작업, 다단계 퓨전 맘바(MFusion Mamba), 디코더 단계, 최종 업샘플링, 세그멘테이션 헤드를 포함합니다. 각 단계별로 해당 연산, 주 매개변수, 출력 특징 크기가 나열됩니다. E1–E4 는 다단계 피처 융합에 사용되는 인코더 단계 특징 맵을 나타냅니다. B, H, W 는 각각 배치 크기, 이미지 높이, 이미지 너비를 나타내며, K 는 출력 클래스 수를 나타냅니다(이진 피부 병변 분할의 K = 1 , 시냅스 다중 클래스의 K = 9 , 배경 클래스 1개와 전경 기관 클래스 8개로 구성됩니다). MFusion Mamba는 디코더 재구성 과정에서 해당 디코더 기능과 통합된 퓨즈 다단계 인코더 기능을 생성합니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충 파일 1. 다중 뷰 4방향(MV4D) 모듈과 다중 단계 핵융합 맘바(MFusion Mamba)의 의사 코드. 보조 파일은 MVM-UNet에서 사용되는 두 주요 모듈의 알고리즘 워크플로우를 보여줍니다. 알고리즘 1은 다중 뷰 4방향(MV4D) 모듈의 전체 처리 파이프라인을 설명하며, 특징 평탄화, 네 개의 스캔 쌍 시퀀스(지그재그, 계층, 나선, 방사형) 구성, 선택적 상태 공간(S6) 처리, 스캔 뷰 융합 맘바(SFusion Mamba), 그리고 출력 특징 맵 재구성을 포함합니다. 알고리즘 2는 다단계 퓨전 맘바(MFusion Mamba) 모듈을 설명하며, 다단계 인코더 기능 정렬, 거친 융합, 미세 융합, 디코더 통합, 퓨즈 디코더 입력 기능 생성을 포함합니다. 변수와 텐서 차원은 알고리즘 내에서 정의됩니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보조 코딩 파일 1. MVM-UNet용 소스 코드 패키지(MVM-UNet-master). 보조 ZIP 아카이브에는 본 연구에서 사용된 MVM-UNet의 완전한 소스 코드 구현체가 포함되어 있습니다. 이 패키지에는 네트워크 아키텍처, 다중 뷰 4방향(MV4D) 및 다중 단계 퓨전 맘바(MFusion Mamba) 모듈, 구성 파일, ISIC 2017, ISIC 2018, Synapse 데이터셋의 교육 및 평가 스크립트, 유틸리티 함수, 그리고 이 프로토콜에서 설명된 실험을 재현하는 데 필요한 프로젝트 문서가 포함되어 있습니다. 패키지에는 설치 지침, 소프트웨어 의존성, 데이터셋 조직, 학습 및 추론 워크플로우가 포함된 README 파일도 포함되어 있습니다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
이 프로토콜은 맘바 기반의 의료 영상 분할 프레임워크인 MVM-UNet을 설명합니다. 이 방법은 기존 세분화 모델의 두 가지 한계를 해결하기 위해 설계되었습니다. 첫째, 기존 CNN 기반 방법은 복잡한 의료 영상에서 장거리 의존성과 계층적 맥락 정보를 모델링하는 데 제한적인 능력을 가지고 있습니다43. 둘째, 트랜스포머 기반 방법은 전역 맥락을 모델링할 수 있지만 보통 더 높은 계산 비용이 필요합니다23,25. MVM-UNet은 Mamba아키텍처 13,14,15,16,17,18,19,20을 사용하여 효율적인 장거리 모델링을 구현하고, 멀티뷰 스캔과 다단계 기능 융합을 도입하여 세분화 정확도를 향상시켰습니다. 프로토콜 실행과 재현성 관점에서 본 연구에서 보고된 결과와 유사한 결과를 얻기 위해서는 여러 단계가 매우 중요합니다. 첫째, 데이터셋 분할, 이미지 크기 조정, 마스크 보간, 정규화 전략, 채널 변환 등이 프로토콜과 일치하도록 유지해야 합니다. 왜냐하면 전처리 차이가 입력 분포와 마스크 경계를 직접 바꿀 수 있기 때문입니다. 특히, 분할 마스크는 비정수 레이블 값44를 도입하지 않도록 최근접 이웃 보간법(nearest-neighbor interpolation)을 사용하여 크기를 조정해야 합니다. 둘째, 입력 해상도, 배치 크기, 최적화기 설정, 학습률 일정, 무작위 시드, 손실 가중 계수, 체크포인트 선택 규칙, 추론 임계값 또는 ARGMAX 연산 등 훈련 구성을 비교 전에 반드시 확인해야 합니다. 재현된 결과가 보고된 값보다 명확히 낮다면, 사용자는 먼저 데이터셋 경로, 주석 형식, 전경-배경 라벨 규칙, 체크포인트 로딩, 검증 또는 테스트 분할, 메트릭 계산 절차를 확인해야 합니다. 경계 누설, 단편화된 마스크, 또는 작은 구조의 누락은 보통 전처리, 마스크 보간, 체크포인트 선택 또는 추론 후처리에서의 잠재적 불일치를 나타냅니다.
MVM-UNet의 주요 기여는 MV4D 모듈입니다. 이전의 상태 공간 모델 기반 아키텍처(14,15,16,17,18,19,20)에서 채택된 단순한 2차원 스캐닝 전략과 달리, MV4D는 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 사용하여 상호 보완적인 시각 정보를 포착합니다. 지그재그 스캔 쌍은 국소 및 전역 공간 정보의 균형을 맞추는 데 도움을 주고, 계층적 스캔 쌍은 다중 스케일 특징 추출을 향상시키며, 나선형 스캔 쌍은 전역 윤곽 표현을 강화하고, 방사형 스캔 쌍은 국부 가장자리 및 경계 특징 추출을 향상시킵니다. SFusion Mamba는 이러한 상호 보완적인 스캔 방식을 통합합니다. 대표적인 결과 및 소작 실험(표 4 및 5; 그림 9) 스캔 패턴의 다양성과 융합 메커니즘이 분할 성능 향상에 기여함을 입증합니다. 또 다른 중요한 구성 요소는 MFusion Mamba로, 인코더와 디코더 사이의 기능 융합 모듈 역할을 합니다. 기존의 U자형 아키텍처, 예를 들어 U-Net 8,21, V-Net44, 그리고 이후 많은 변형 9,23,25는 주로 단계별 스킵 연결을 통해 정보를 전송합니다. 이 전략은 상보적 다단계 인코더 표현을 완전히 활용하지 못할 수 있습니다. MFusion Mamba는 디코딩 전에 Coarse Fusion과 Fine Fusion을 통해 인코더 기능을 결합하여 이 한계를 해결합니다. 대표 결과(표 6; 그림 10) MFusion Mamba가 세분화 성능을 지속적으로 향상시키며, 명시적 다단계 특징 융합이 의료 이미지 분할에 유익함을 나타냅니다.
MVM-UNet의 방법론적 기여는 모든 개별 작업을 처음부터 발명한 것이 아니라 아키텍처 수준의 재설계로 이해되어야 합니다. U자형 인코더-디코더 아키텍처, 잔류 연결, 투영 계층, 맘바/상태 공간 모델(SSM) 블록은이전 연구에서 광범위하게 연구되었습니다 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. 하지만 이러한 구성 요소를 직접 결합하는 것이 반드시 의료 영상 분할의 특정 문제를 해결하지는 못합니다. MVM-UNet의 새로움은 세 가지 측면의 조율된 설계에 있습니다. 첫째, MV4D 모듈은 단일 또는 제한된 스캔 패턴을 네 개의 상호 보완적인 스캔 쌍 분기로 대체하여 공간 연속성, 다중 규모 구조, 전 지구 윤곽 정보, 국부 경계 세부 정보를 포착할 수 있게 합니다. 둘째, SFusion Mamba와 MVV 블록은 스캔 전용 기능을 융합하고 강화한 후 다음 네트워크 단계로 넘어갑니다. 셋째, MFusion Mamba는 디코딩 전에 다단계 인코더 기능을 명시적으로 집계하여 기존 스킵 연결8, 21, 44를 보완하고 계층적 정보 사용을 개선합니다. 소작 결과(표 4–6; 그림 9와 10) 이 설계 근거를 더욱 뒷받침하며, 멀티뷰 스캐닝, 스캔별 융합, 상하 투영 분기, 다단계 기능 융합이 분할 성능 향상에 기여함을 보여줍니다. 따라서 MVM-UNet의 기여는 Mamba 기반 공간 모델링과 인코더-디코더 특징 융합의 과제별 실험적 검증된 통합 의료 영상 분할에 있습니다.
강력한 성능에도 불구하고 MVM-UNet에는 몇 가지 한계가 있습니다. 첫째, 입력 이미지 크기가 커질수록 분할 성능이 꾸준히 향상되지 않아 현재 아키텍처가 고해상도 이미지 정보를 완전히 활용하지 못할 수 있음을 시사합니다. 둘째, 이 모델은 임상 실무에서 자주 발생하는 고노이즈 또는 저대비 영상 조건에서 광범위하게 평가되지 않았으며, 이는 분할의 견고성에 영향을 줄 수 있습니다. 셋째, 이 모델은 공개된 세 개의 데이터셋에서 강력한 성능을 보였지만, 더 크고 다양한 의료 영상 데이터셋에 대한 추가 검증이 필요합니다. 프로토콜은 다른 의료 영상 분할 작업에 적용할 수 있으나, 여러 수정사항을 신중하게 구현해야 합니다. 새로운 이진 분할 작업의 경우, 사용자는 이진 BCE-Dice 손실 및 평가 절차를 유지하면서 데이터셋 로더, 정규화 매개변수, 입력 해상도, 전경 임계값을 수정해야 합니다. 새로운 다중 클래스 분할 작업의 경우, 사용자는 출력 클래스 수, 클래스-인덱스 매핑, 원-핫 라벨 변환, CE-Dice 손실 구성, 클래스별 평가 지표44를 업데이트해야 합니다. 그레이스케일 데이터셋의 경우, 입력 채널 구성을 모델 아키텍처에 맞게 단일 채널 입력 투영을 사용하거나 그레이스케일 이미지를 반복하여 3채널 입력을 생성해야 합니다. 목표 구조가 매우 작거나, 경계가 약하거나 모호하거나, 이미지 대비가 훈련 데이터와 크게 다르거나, 목표 데이터셋이 상당한 도메인 이동을 보일 경우 이 방법은 최적이 아닌 성능을 보일 수 있습니다. 이러한 조건에서 사용자는 공정한 비교를 위해 동일한 평가 프로토콜을 유지하면서 입력 해상도, 증강 전략, 클래스 밸런싱, 손실 가중치, 미세 조정 일정을 조정해야 할 수 있습니다.
Synapse 데이터셋에서 MVM-UNet은 일반적으로 사용되는 18사례 훈련과 12사례 검사 분할 체계에서 강력한 다중 기관 분할 성능을 달성했습니다. 제안된 방법은 본 연구에서 평가된 대표적인 기초 방법 중 가장 높은 평균 DSC를 기록했지만(표 3), 최근 일부 방법에서는 다양한 훈련 환경과 평가 프로토콜에서 더 높은 시냅스 성능을 보고했습니다29. 따라서 MVM-UNet을 Synapse에서 전반적으로 최첨단 성능을 달성했다고 설명하는 것은 피하고, 대신 평가된 실험 환경에서 강한 성능을 달성했다고 설명합니다. 이 결과는 MVM-UNet의 성능이 의료 이미지분할 13,14,15,16,17,18,19,20을 위한 맘바 기반 모델링의 과제별 적응에서 비롯되었음을 시사합니다. 단일 스캔 전략에 의존하는 대신, MVM-UNet은 시각적 특징 모델링을 여러 상호 보완적인 스캐닝 뷰로 분해하고 SFusion Mamba 방식으로 통합합니다. 또한 MFusion Mamba는 기존의 스킵 연결8, 21, 44를 넘어 다단계 인코더 기능을 명시적으로 집계하여 인코더와 디코더 간의 정보 흐름을 개선합니다. 이 설계는 제안된 모델이 이진 피부 병변 분할과 다기관 분할 과제 모두에서 강력한 성능을 발휘할 수 있게 합니다.
향후 작업은 고해상도 의료 영상 분할을 위한 MVM-UNet 개선에 집중해야 합니다. 더 깊거나 적응적인 다중 규모 아키텍처는 모델이 고해상도 이미지 정보를 보다 효과적으로 활용할 수 있게 할 수 있습니다. 향후 연구에서는 노이즈가 많고 대비가 낮으며 도메인 이동이 있는 영상 조건에서 MVM-UNet의 견고성도 평가해야 합니다. 또한, 제안된 다중 시점 스캐닝 전략은 병변 탐지4, 장기 위치, 종양 분류, 3차원 분할 등 다른 의료 영상 분석 과제로 확장될 수 있습니다10,11. 요약하자면, MVM-UNet은 의료 영상 분할을 위한 효과적이고 재현 가능한 프레임워크를 제공합니다. MV4D 모듈과 MFusion Mamba의 통합을 통해 모델은 상호 보완적인 공간 정보, 다중 스케일 맥락, 전역 등고선 정보, 지역 경계 세부사항, 다단계 의미적 특징을 포착할 수 있습니다. ISIC 2017, ISIC 2018, Synapse 데이터셋에서 얻은 대표적인 결과는 제안된 아키텍처의 효율성을 입증합니다. 이 프로토콜은 의료 영상분할 13,14,15,16,17,18,19,20을 위한 효율적인 SSM/맘바 기반 아키텍처를 개발하는 연구자들에게 실용적인 참고 자료를 제공합니다.
저자들은 경쟁하는 재정적 이해관계가 없다고 선언합니다.
이 연구는 외부 자금 지원을 받지 못했습니다.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청