이 프로토콜은 의료 이미지 분할을 위한 다중 뷰 Vision Mamba U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 방법을 설명하며, 표준화된 데이터셋 준비, 모델 구현, 성능 평가를 통해 피부 병변과 복부 장기의 재현 가능한 분할을 가능하게 합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 프로토콜은 의료 이미지 분할을 위한 다중 뷰 Vision Mamba U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 방법을 설명하며, 표준화된 데이터셋 준비, 모델 구현, 성능 평가를 통해 피부 병변과 복부 장기의 재현 가능한 분할을 가능하게 합니다.
의료 이미지 분할은 전반적 맥락, 국소 경계, 다층 해부학적 구조를 정확히 포착하면서도 다양한 응용 분야에서 재현 가능한 계산 방법이 필요합니다. 이 글은 2차원 의료 이미지 분할을 위한 다중 뷰 비전 맘바 U-Shaped 네트워크 프레임워크를 구축, 훈련 및 평가하는 프로토콜을 제시합니다. 이 프로토콜은 공개 데이터셋 획득, 이미지 및 마스크 전처리, 네트워크 구축, 모델 학습, 체크포인트 선택, 정량적 및 정성적 성능 평가를 포함한 재현 가능한 워크플로우를 제공합니다. 이 프레임워크는 다중 뷰 특징 스캔을 통합하여 보완적인 공간, 윤곽, 축척, 경계 정보를 포착하고, U자형 인코더-디코더 아키텍처 내에서 다단계 특징 융합을 적용하여 세분화 중 특징 통합을 향상시킵니다. 이 프로토콜은 공개된 피부 병변 및 복부 장기 분할 데이터셋을 사용하여 시연됩니다. 설명된 구현 워크플로우 하에서, 프레임워크는 표준 평가 지표를 사용하여 경쟁력 있는 세분화 성능을 달성합니다. 이 프로토콜에서 제시된 절차를 따르면, 연구자들은 모델 구현을 재현하고, 정의된 실험 설정을 사용해 네트워크를 훈련하며, 분할 성능을 평가하고, 재현 가능한 딥러닝 기반 분석이 필요한 관련 의료 영상 분할 작업에 맞게 워크플로우를 조정할 수 있습니다.
의료 영상 분할은 컴퓨터 비전 및 의료 영상 분석 분야에서 기본적인 작업입니다. 1,2,3. 이 과정은 이미지를 여러 영역이나 객체로 나누어 추가 분석과 처리를 수행하는 과정을 포함합니다. 이 기술은 임상의가 병리 영역을 식별하고 국소화하는 데 도움을 주어 진단 정확도와 치료 계획을 향상시키기 때문에 특히 의료 영상에서 중요합니다. 자기공명영상(MRI), 컴퓨터 단층촬영(CT), 양전자 방출 단층촬영(PET)과 같은 의료 영상 기술의 발전과 함께 정확한 의료 영상 분할 기술에 대한 수요가 계속 증가하고 있습니다. 현재 의료 영상 분할 방법은 크게 세 가지 주요 접근법으로 분류할 수 있습니다: 합성곱 신경망(CNN) 기반 방법4, 트랜스포머 기반 방법5, 상태 공간 모델(SSM) 기반 방법 6,7. CNN 기반 방법은 일반적으로 의료 영상 분할을 위해 U자형 네트워크 아키텍처를 사용합니다. 이 범주에서 가장 널리 사용되는 아키텍처는 U-Net8로, 이는 생의학 이미지 분할을 위한 U자형 인코더-디코더 아키텍처의 효율성을 입증했습니다. U-Net3+는 UNet++9의 밀집 스킵 연결과 풀스케일 스킵 연결을 결합하여 다중 스케일 특징 집계를 향상시킵니다. 그러나 CNN 기반 방법은 장거리 의존성을 포착하는 데 한계가 있어 장거리 맥락 정보를 효과적으로 모델링하지 못할 수 있습니다.
트랜스포머 기반 방법은 자기 주의 메커니즘을 통해 장거리 의존성을 효과적으로 포착하며, 병렬 계산을 가능하게 하고 관심 영역별로 다른 주의 가중치를 할당합니다. UNETR++10 은 매개변수 수와 계산 비용을 줄이기 위해 효율적인 쌍 주의(EPA) 모듈을 도입했습니다. nnFormer11 은 인터리브 합성곱 연산과 자기 주의 연산을 결합하고, 3차원(3D) 의료 이미지 분할에서 부피 표현을 학습하기 위한 국소-전역 부피 기반 자기 주의 메커니즘을 도입합니다. H2Former12 는 인코더에서 주의 메커니즘과 CNN 기반 특징 추출을 결합한 효율적인 계층적 하이브리드 비전 트랜스포머를 제안합니다. 하지만 트랜스포머 기반 방법은 시퀀스 길이가 증가할수록 계산 복잡도가 2차 증가하여 계산 비용이 크게 증가합니다. 그림 1 은 MVM-UNet의 동기를 보여주며, 제안된 다중 뷰 스캔 전략을 기존 SSM 기반 분할 프레임워크와 비교합니다.

그림 1. MVM-UNet과 기존의 순수 상태-공간-모델(SSM) 기반 분할 아키텍처 비교. 기존의 순수 상태 공간 모델(SSM) 기반 세분화 프레임워크와 제안된 다중 뷰 맘바 U-Net(MVM-UNet) 아키텍처 간의 비교. 상단 패널은 MVM-UNet을 보여주는데, 이 모듈에서는 다중 뷰 4방향(MV4D) 모듈이 지그재그, 계층형, 나선형, 방사형 스캔 쌍을 이용해 공간을 융합 Mamba(SFusion Mamba)로 통합하여 상호 보완적인 특징을 추출하고, Multi-stage Fusion Mamba(MFusion Mamba)는 디코딩 전에 다중 스케일 인코더 기능을 집계합니다. 하단 패널은 교차 스캔이 가능한 선택적 스캔 2차원(SS2D) 모듈을 사용한 대표적인 순수 SSM 기반 아키텍처를 보여줍니다. 도표는 기존 SSM 기반 세분화 네트워크와 제안된 MVM-UNet 간의 아키텍처적 차이를 강조합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
SSM 기반 방법은 트랜스포머의 전역 모델링 능력과 선형 계산 복잡도를 결합합니다. 맘바 아키텍처는 선택적 상태 공간 모델(Selective-SSM)을 사용하여 입력 정보를 선택적으로 처리하여, 입력에 따라 모델이 매개변수를 동적으로 조정하면서 관련 없는 정보를 필터링하고 정보 제공 기능을 강조할 수 있습니다. Vim13 과 VMamba14 는 Mamba 아키텍처를 컴퓨터 비전 작업에 맞게 적용합니다. U-Mamba15 는 의료 영상 분할에 SSM의 적용을 탐구하기 위해 하이브리드 CNN–SSM 아키텍처를 사용하는 반면, Mamba-UNet16 은 의료 영상 분할을 위해 완전한 SSM 기반 인코더-디코더 아키텍처를 채택합니다. 이 방법들은 훨씬 적은 매개변수를 사용하면서도 경쟁력 있는 성능을 달성합니다. 그러나 현재의 SSM/맘바 기반 방법은 주로 간단한 이미지 패치와 SS2D 스캐닝 전략을 사용하여 이미지 특징을 추출하며, 이는 의료 이미지 분할에 여러 한계를 제공합니다. 첫째, SS2D 및 패치 기반 기법은 주로 일반적인 컴퓨터 비전 작업을 위해 설계되었습니다. Local Mamba17 과 Motion Mamba18 은 SS2D 스캐닝 전략이 모든 시각 작업에 충분하지 않다고 제안했는데, 이는 서로 다른 유형의 시각 정보를 포착하기 때문입니다. 둘째, SS2D 스캔 전략은 비교적 단순하여 수평 및 수직 스캔 방향에만 의존합니다. 따라서 복잡한 공간적 관계나 세밀한 구조적 세부사항을 충분히 포착하지 못할 수 있습니다. 의료 이미지 분할은 전 지구적 공간적 맥락과 정밀한 국부 해부학적 특징을 동시에 모델링해야 합니다. 더불어, 현재의 SSM/맘바 기반 방법은 인코더와 디코더 간의 제한된 기능 융합을 제공합니다. UNet++, FATNet과 같은 아키텍처는 향상된 특징 융합을 통해 분할 정확도를 높이며, 의료 이미지 분할에 효과적인 특징 통합의 중요성을 강조합니다.
이러한 한계를 해결하기 위해 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제안합니다. 그림 1에 나타난 것처럼, 제안된 다중 뷰 4방향(MV4D) 모듈은 MVM-UNet의 핵심 특징 추출 구성 요소로, 네 가지 서로 다른 스캐닝 전략의 정보를 통합하여 의료 이미지 분할을 위해 특별히 설계되었습니다. 각 스캐닝 전략은 상호 보완적인 이미지 특징을 추출하여 입력 이미지의 서로 다른 뷰를 나타냅니다. 지그재그 스캐닝19 는 각 행 또는 열의 끝에서 이동 방향을 번갈아 사용하여 국부와 전역 공간 정보를 균형 있게 조정합니다. 반면, 나선형 및 방사형 스캔 방식20 은 중심에서 바깥쪽이나 주변부에서 안쪽으로 확장하여 포괄적인 범위 커버리지를 제공합니다. 계층적 스캐닝18 은 여러 규모에서 국적·전역적 특징을 모두 포착합니다. 각 스캔 전략의 견고성을 높이기 위해 스캔 쌍은 S6 블록에 입력되기 전에 병합됩니다. 스캔뷰 퓨전 맘바(SFusion Mamba) 모듈은 네 가지 스캔 방식에서 추출한 특징을 통합합니다. 멀티스케일 인코더 기능을 효과적으로 활용하기 위해, 본 논문은 각 인코더 단계의 출력을 축적하고 융합한 후 퓨전 기능을 디코더에 전달하는 멀티스케일 맘바 퓨전 모듈(MFusion Mamba)을 제안합니다. MVM-UNet은 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 평가되었습니다. 실험 결과는 MVM-UNet이 ISIC 2017, ISIC 2018, Synapse 데이터셋에서 경쟁력 있는 세분화 성능을 달성함을 보여줍니다.
대표적인 세분화 아키텍처는 의료 이미지 세분화를 더욱 발전시켰습니다. U-Net은 세포 계수, 검출, 형태계측21과 같은 생의학 영상 분석 과제에도 성공적으로 적용되었습니다. CA-Net22와 같은 주의 강화 CNN 아키텍처는 포괄적인 주의 메커니즘을 통해 특징 표현을 향상시킵니다. TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26, TransCUNet27 등 대표적인 Transformer 기반 세분화 프레임워크들은 의료 이미지 분할을 위한 주의 기반 글로벌 특징 모델링의 효과를 더욱 입증합니다.
MVM-UNet의 설계는 기존 SSM/맘바 기반 분할 방법의 두 가지 한계에 의해 동기부여되었습니다. 첫째, 현재 많은 Vision Mamba 모델은 단순한 2차원 스캐닝 전략에 의존하는데, 이는 불규칙한 병변 경계, 작은 표적 영역, 다층 해부학적 구조를 포함하는 의료 이미지에는 부족할 수 있습니다. 둘째, 기존의 U자형 인코더-디코더 아키텍처는 주로 해당 스킵 연결을 통해 기능을 전송하여, 디코딩 시 다단계 인코더 정보를 직접 사용하는 것을 제한합니다. 따라서 MVM-UNet은 다중 뷰 공간 모델링을 향상시키기 위해 MV4D를, 다단계 인코더 기능을 명시적으로 집계하는 MFusion Mamba를 도입합니다. 이 설계는 맘바 기반 장거리 모델링을 의료 영상 분할의 특정 요구사항에 맞게 조정하기 위해 설계되었습니다.
MVM-UNet은 일반적인 인코더-디코더 패러다임과 맘바 기반 시퀀스 모델링을 기반으로 하지만, 이 구성 요소들이 의료 영상 분할에 맞게 어떻게 적응되고 통합되는지에 새로움이 있습니다. 표준 맘바 블록을 U자형 네트워크 백본에 단순히 통합하는 대신, 제안된 프레임워크는 여러 작업 지향 스캔 쌍 분기를 통해 공간 모델링 과정을 재설계하고, 스캔별 표현을 통합하는 SFusion Mamba를 도입하며, 잔차 및 투영 경로로 MVV 블록을 강화하고, 인코더와 디코더 사이에 MFusion Mamba를 삽입하여 다단계 인코더 기능을 집계한 후 디코딩합니다. 이 아키텍처 수준의 설계는 의료 이미지에서 흔히 관찰되는 불규칙한 경계, 작은 목표 영역, 다층 해부학적 구조를 해결하는 것을 목표로 합니다.
이 프로토콜은 2차원 의료 이미지에서 장거리 맥락 정보, 불규칙한 물체 경계, 다중 규모 해부학적 구조를 동시에 모델링해야 하는 분할 작업에 가장 적합합니다. CNN 기반 분할 방법과 비교할 때, 맘바 기반 인코더-디코더 설계는 의료 이미지 분할 연구자들이 익숙한 U자형 워크플로우를 유지하면서 효과적인 맥락 모델링 메커니즘을 제공합니다. 트랜스포머 기반 방법과 비교할 때, 제안된 프레임워크는 이차 자기 주의를 직접 사용하지 않으며, 비교적 효율적인 시퀀스 모델링 메커니즘을 이용한 전역 맥락 모델링을 추구하는 연구자들을 위한 것입니다. 따라서 이 프로토콜은 피부 병변 분할, 복부 장기 분할 및 전반적 구조 정보와 국소 경계 세부사항이 모두 중요한 유사한 2차원 의료 영상 분할 작업에 적합합니다.
이 프로토콜에는 사용 전에 고려해야 할 제한 사항도 있습니다. 경량 CNN이 이미 충분한 성능을 제공하는 비교적 단순한 분할 작업에는 필요하지 않을 수 있습니다. 또한, 아키텍처적 적응 없이 완전한 3차원 체적 분할을 위해 직접 설계된 것은 아닙니다. 주석이 달린 데이터가 매우 제한적이거나, 그래픽 처리 장치(GPU) 자원이 제한적이거나, 해석 가능한 고전 모델이 요구되는 연구자들도 프로토콜을 적용하기 전에 이러한 제약 조건을 고려해야 합니다. 전반적으로 이 방법은 장거리 맥락 모델링, 국소 경계 표현, 다단계 특징 융합을 균형 있게 결합한 맘바 기반 U자형 분할 프레임워크를 재현하고 평가하려는 연구자들을 위한 것입니다.
주요 기여는 다음과 같습니다:
1. 본 논문은 MVM-UNet이라 불리는 새로운 맘바 기반 의료 영상 분할 프레임워크를 제시합니다. 기존의 SS2D 기반 또는 표준 맘바 블록을 직접 통합하는 접근법과 달리, MVM-UNet은 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 뷰에서 의료 영상 특징을 모델링하는 MV4D를 도입합니다.
2. 본 논문은 SFusion Mamba와 MVV 블록을 설계하여 스캔 특화 표현을 통합하고 특징 변환을 향상시키도록 합니다. SFusion Mamba는 서로 다른 스캔쌍 가지에서 추출한 특징들을 융합하는 반면, MVV 블록 내의 잔류 및 상하 투사 분기는 특징 표현을 안정화하고 풍부하게 하는 상호 보완적인 특징 경로를 제공합니다.
3. 본 논문은 인코더와 디코더 사이의 중간 다단계 융합 모듈로서 MFusion Mamba를 소개합니다. 주로 대응하는 단계 특징을 전달하는 기존의 스킵 연결과 달리, MFusion Mamba는 다단계 인코더 기능을 거친 융합에서 미세한 융합으로 명시적으로 집계하며, 디코딩을 위한 풍부한 정보를 제공합니다.
4. 광범위한 실험 결과에 따르면 제안된 MVM-UNet은 ISIC 2017 및 ISIC 2018 데이터셋에서 경쟁력 있는 세분화 성능을 보이며, Synapse 다기관 세분화 데이터셋에서는 강력한 성능을 보입니다. 더 나아가, 포괄적인 절제 연구는 MVM-UNet 내 각 구성 요소의 기여를 검증합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 ISIC 2017, ISIC 2018, Synapse 등 공개적으로 이용 가능한 및 식별 해제된 의료 이미지 데이터셋만을 사용했습니다. 이 연구에서는 새로운 인간 참가자, 동물 대상 또는 식별 가능한 개인 의료 기록이 수집되지 않았습니다. 본 연구에 사용된 ISIC 2017 데이터셋은 공식 국제 피부 영상 협력 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2017)에서 얻은 ISIC 2017 챌린지 피부 병변 분절 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2017 병변 분할 과제에 해당하며, 공식 훈련, 검증 및 테스트 파티션을 포함합니다. 이 데이터셋은 2024년 3월 15일에 다운로드되었습니다. 본 연구에 사용된 ISIC 2018 데이터셋은 공식 국제 피부 영상 협력체 도전 데이터 저장소(https://challenge.isic-archive.com/data/#2018)에서 얻은 ISIC 2018 챌린지 과제 1 병변 경계 분할 데이터셋입니다. 본 연구에서 사용된 데이터셋 버전은 ISIC 2018 과제 1: 병변 경계 분할에 해당합니다. 데이터셋은 2024년 7월 8일에 다운로드되었습니다.
본 연구에서 사용된 시냅스 데이터셋은 Synapse 저장소에서 accession identifier syn3193805 (https://www.synapse.org/Synapse:syn3193805) 하에 얻은 Multi-Atlas Labeling Beyond the Cranial Vault 복부 CT 데이터셋이었습니다. 본 연구에서 사용된 데이터셋은 일반적으로 사용되는 30건의 복부 CT 다기관 분할 데이터셋에 해당합니다. 다운로드된 아카이브는 Abdomen/RawData.zip로, accession syn3193805로 이용 가능하다. 다운로드 당시 저장소에서는 별도의 버전 번호, 릴리스 라벨, 날짜가 명시된 릴리스 태그를 제공하지 않았습니다. 이전 연구에서 채택된 표준 분할에 따라 18건은 훈련에, 12건은 시험에 사용되었습니다. 데이터 분할은 TransUNet23가 사용한 사례 목록을 따랐습니다. 구체적으로, 교육 사례는 case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028, case0037이었으며, 테스트 사례는 case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025, case0035였습니다. 이 데이터셋은 2024년 7월 9일에 다운로드되었습니다. 이 연구는 공개된 식별 해제 데이터셋만을 사용했고, 새로운 인간-피험자 데이터나 식별 가능한 개인 정보 수집을 포함하지 않았기 때문에, 이 프로토콜에 설명된 계산 실험에 대해 기관심사위원회의 승인이 필요하지 않았습니다. 공식적인 기관 면제 결정은 이루어지지 않았다. 지역 기관 정책에 의해 요구되는 경우, 연구자들은 공개된 데이터셋에 대한 2차 분석을 수행하기 전에 기관 면제 결정을 받아야 합니다. 이 연구에는 기관 윤리 면제 참조 번호나 공식 면제 문서가 제공되지 않았습니다.
1. 데이터셋 준비
(1)2. MVM-UNet 아키텍처의 구성
습니다.
를 생성합니다. 여기서 이중 병변 분할은 K = 1, 시냅스 다기관 분할은 K = 8입니다.
그림 2. 멀티뷰 맘바 U-Net(MVM-UNet)의 전체 아키텍처. 제안된 멀티뷰 맘바 U-Net(MVM-UNet) 아키텍처 개요. 입력 이미지는 패치 임베딩으로 변환되며, 멀티뷰 비전(MVV) 블록으로 구성된 네 개의 인코더 단계를 거치며 패치 머지 작업으로 분리됩니다. 인코더 기능은 다단계 퓨전 맘바(MFusion Mamba)에 의해 집계되어 스킵 연결을 통해 디코더로 전파됩니다. 디코더는 패치 확장 연산을 통해 공간 해상도를 점진적으로 복원하고, 투영 계층을 통해 최종 분할 지도를 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
3. MV4D 모듈 제작

그림 3. 멀티뷰 4방향(MV4D) 모듈의 아키텍처. 다중 뷰 4방향(MV4D) 특징 추출 모듈의 구조. 입력 패치는 지그재그, 계층, 나선, 방사형 스캔 등 네 가지 상호 보완적인 스캔 쌍 분기를 통해 처리됩니다. 네 가지 분기에서 추출한 특징들은 병합되고, 상태 공간 블록을 사용해 처리되며, Spatial Fusion Mamba(SFusion Mamba)에 의해 통합되어 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
4. MVV 블록 건설

그림 4. 멀티뷰 비전(MVV) 블록의 아키텍처. 멀티뷰 비전(MVV) 블록의 구조. 이 블록은 다중 뷰 4방향(MV4D) 모듈과 깊이별 합성곱, 정규화, 선형 투영 계층을 포함하는 주요 특징 추출 분기로 구성되어 있습니다. 보조 상하 투영 분기는 요소별 곱셈을 통해 게이티드 특징 변조를 제공하며, 잔류 덧셈을 통해 출력 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
5. MFusion Mamba 건설

그림 5. 다단계 핵융합 맘바(MFusion Mamba) 모듈의 아키텍처. 다단계 융합 맘바(MFusion Mamba) 모듈의 구조. 다중 스케일 인코더 특징들은 먼저 거친 융합으로 결합되고, 이후 선형 투영, 1차원 컨볼루션(Conv1d), 맘바 블록, 특징 투영 층으로 구성된 파인 퓨전 모듈을 통해 정제되어 디코더가 사용하는 융합 특징 표현을 생성합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
6. 모델 훈련
7. 모델 평가
(2)
(3)
(4)
(5)
(6)8. 손실 함수 정의
(7)
(8)
(9)
(10)
(11)
2 = 1.0이
되도록 설정하세요. 시냅스의 CE와 주사위 손실 가중치를 1.0으로 설정하세요. 예를 들어 1 = 1.0, φ2 = 1.0 φ9. 재현성 설정 및 실행
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
예상 결과 및 해석
이 프로토콜이 올바르게 구현되면, 훈련된 MVM-UNet 모델은 반복 실행에서 안정적인 분할 성능을 보이며, 대부분의 평가 지표에서 서로 다른 무작위 시드 간에 약간의 변동만 있을 것으로 기대됩니다. ISIC 2017과 ISIC 2018의 성공적인 결과는 높은 DSC, mIoU, Acc, Sen, Spe 값과 함께 실제 병변 경계를 밀접하게 따르는 예측 병변 마스크로 반영됩니다(그림 6 및 7). 시냅스의 경우, 성공적인 결과는 전경 기관 전반에서 높은 평균 DSC 값과 낮은 HD95 수치로 나타납니다(그림 8). 프로토콜 실행 중에는 정량적 지표와 이에 대응하는 정성적 세분화 결과가 함께 해석되어야 합니다. 높은 DSC를 달성하지만 경계 누설, 작은 구조의 누락, 또는 예측이 단편화된 모델은 부분적으로만 성공한 것으로 간주되어야 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 프로토콜은 맘바 기반의 의료 영상 분할 프레임워크인 MVM-UNet을 설명합니다. 이 방법은 기존 세분화 모델의 두 가지 한계를 해결하기 위해 설계되었습니다. 첫째, 기존 CNN 기반 방법은 복잡한 의료 영상에서 장거리 의존성과 계층적 맥락 정보를 모델링하는 데 제한적인 능력을 가지고 있습니다43. 둘째, 트랜스포머 기반 방법은 전역 맥락을 모델링할 수 있지만 보통 더 높은 계산 비용이 필요합니다23,25. MVM-UNet은 Mamba아키텍처 13,14,15,16,17,18,19,20을 사용하여 효율적인 장거리 모델링을 구현하고, 멀티뷰 스캔과 다단계 기능 융합을 도입하여 세분화 정확도를 향상시켰습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 경쟁하는 재정적 이해관계가 없다고 선언합니다.
이 연구는 외부 자금 지원을 받지 못했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Hardware - GPU workstation or GPU server | Institutional computing platform / local workstation | Custom-built local GPU workstation; Ubuntu 22.04.1 with Linux kernel 6.8.0; Intel Core i9-13900K CPU; NVIDIA A800 GPU; 128 GB RAM; 512 GB local storage. | Computational platform for training, validation, testing, ablation, and inference-only experiments. |
| Hardware - Graphics processing unit (GPU) | NVIDIA Corporation | NVIDIA A800 GPU (80 GB memory). | GPU-accelerated model training and inference. |
| Hardware - Central processing unit (CPU) | Intel Corporation / AMD | 13th Gen Intel Core i9-13900K CPU. | Host processor for data loading, preprocessing, and experiment execution. |
| Hardware - System memory (RAM) | Institutional computing platform / local workstation | 128 GB system RAM | Memory for dataset loading, preprocessing, and training. |
| Hardware - Storage | Institutional computing platform / local workstation | 2 TB NVMe solid-state drive. | Storage for datasets, checkpoints, logs, and generated prediction figures. |
| Software environment - Operating system | Canonical Ltd. | Recommended: Ubuntu 22.04.1 LTS | Operating system for the computational environment. |
| Software environment - Conda environment | Anaconda, Inc. / Miniconda | Environment name: mvmunet | Python environment used to install and isolate dependencies. |
| Software environment - Python | Python Software Foundation | Python 3.8 | Programming language used for implementation and experiment execution. |
| Software environment - CUDA toolkit | NVIDIA Corporation | CUDA Toolkit 11.8 | GPU computing backend required by PyTorch and Mamba-related packages. |
| Software environment - cuDNN | NVIDIA Corporation | cuDNN 8.7.0. | GPU-accelerated deep-learning primitives used through PyTorch. |
| Python package - PyTorch | PyTorch | torch == 2.0.1 | Deep-learning framework for model training, loss calculation, optimization, and inference. |
| Python package - Torchvision | PyTorch | torchvision == 0.14.0 | Image transform utilities used in preprocessing and augmentation. |
| Python package - Torchaudio | PyTorch | torchaudio == 0.13.0 | Installed with the recommended PyTorch environment. |
| Python package - timm | timm developers | timm == 0.4.12 | Model-component or utility dependency listed in the repository environment instructions. |
| Python package - triton | OpenAI / Triton developers | triton == 2.0.0 | Dependency used by GPU-accelerated sequence modeling components. |
| Python package - causal-conv1d | causal-conv1d developers | causal_conv1d == 1.0.0 | Efficient causal convolution dependency required by the Mamba implementation. |
| Python package - mamba-ssm | Mamba SSM developers | mamba_ssm == 1.0.1 | State-space sequence modeling package used for Mamba/S6-related components. |
| Python package - NumPy | NumPy developers | NumPy version 1.24.3. | Numerical computation and array operations. |
| Python package - SciPy | SciPy developers | SciPy version 1.10.1. | Scientific computation; scipy.ndimage.zoom is imported in utils.py. |
| Python package - SimpleITK | Insight Software Consortium | SimpleITK version 2.2.1. | Medical image input/output and preprocessing utility imported in utils.py. |
| Python package - MedPy | MedPy developers | MedPy version 0.4.0. | Medical image metric calculation package imported in utils.py. |
| Python package - scikit-image | scikit-image developers | scikit-image version 0.21.0. | Image-processing dependency listed in README. |
| Python package - scikit-learn | scikit-learn developers | scikit-learn version 1.3.2. | Machine-learning utility package listed in README. |
| Python package - matplotlib | Matplotlib developers | Matplotlib version 3.7.2. | Used for saving qualitative visualization figures. |
| Python package - h5py | h5py developers | h5py version 3.9.0. | HDF5 file support for Synapse test volumes. |
| Python package - thop | THOP developers | THOP version 0.1.1.post2209072238. | Used when calculating FLOPs and parameter-related computational cost. |
| Python package - packaging | Python Packaging Authority | packaging version 23.1. | Dependency listed in README. |
| Python package - pytest | pytest developers | pytest version 7.4.0. | Dependency listed in README. |
| Python package - chardet | chardet developers | chardet version 5.2.0. | Dependency listed in README. |
| Python package - yacs | YACS developers | yacs version 0.1.8. | Configuration utility dependency listed in README. |
| Python package - termcolor | termcolor developers | termcolor version 2.3.0. | Logging/terminal utility dependency listed in README. |
| Python package - submitit | submitit developers | submitit version 1.4.5. | Experiment/job utility dependency listed in README. |
| Python package - tensorboardX | tensorboardX developers | tensorboardX version 2.6.2.2. | Training log visualization utility listed in README. |
| Python package - ml-collections | ml_collections developers | ml-collections version 0.1.1. | Imported by configs/config_setting_synapse.py. |
| Dataset - ISIC 2017 Challenge dataset | International Skin Imaging Collaboration | ISIC 2017 skin lesion segmentation dataset | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - ISIC 2018 Challenge Task 1 dataset | International Skin Imaging Collaboration | ISIC 2018 Task 1: Lesion Boundary Segmentation | Public de-identified dermoscopic skin lesion images and masks used for binary segmentation. |
| Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault dataset | Synapse / Sage Bionetworks | Accession identifier: syn3193805 | Public abdominal CT multi-organ segmentation dataset. |
| Data organization - ISIC 2017 data folder | Authors / repository layout | data/isic2017/ | Expected local folder containing train and validation images/masks. |
| Data organization - ISIC 2018 data folder | Authors / repository layout | data/isic2018/ | Expected local folder containing train and validation images/masks. |
| Data organization - Synapse data folder | Authors / repository layout | data/Synapse/ | Expected local folder for Synapse lists, train_npz, and test_vol_h |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.