이 연구는 하이브리드 컨볼루션 및 채널 어텐션을 사용하여 세분화 정확도가 향상된 경량 U-Net 변형을 제시하여 더 적은 매개변수로 MoNuseg 및 GlaS에서 최첨단 결과를 달성했습니다.
방법 논문
이 연구는 하이브리드 컨볼루션 및 채널 어텐션을 사용하여 세분화 정확도가 향상된 경량 U-Net 변형을 제시하여 더 적은 매개변수로 MoNuseg 및 GlaS에서 최첨단 결과를 달성했습니다.
인공 신경망 기반 컴퓨터 이미지 처리 기술은 최근 몇 년 동안 빠르게 발전했으며 여러 분야에서 널리 적용되고 있습니다. 의료 이미지 처리에서 UNet과 그 변형은 병변 감지, 세포 분할 및 용종 분할 작업에서 큰 성공을 거두었습니다. 본 연구는 모델의 학습 능력을 향상시키기 위해 네트워크 깊이를 줄이고 네트워크 채널을 증가시킴으로써 달성된 네트워크 매개변수를 감소시킨 수정된 U자형 네트워크를 제시합니다. 깊이 압축으로 인한 학습 용량의 감소에 대응하기 위해 하이브리드 채널 컨볼루션 모듈이 도입되어 원래 네트워크의 컨볼루션 모듈을 대체합니다. 이 모델은 레이어와 포인트 컨볼루션 레이어 사이에 채널 어텐션 메커니즘을 도입하여 실용적인 채널 특징 추출 기능을 향상시킵니다. 또한 이 기사에서는 혼합 깊이 컨볼루션을 사용하면 세분화 대상의 크기 범위를 효과적으로 해결할 수 있으므로 하나의 모델을 여러 데이터 세트에 맞추기 어렵다는 결론을 내렸습니다. 제안된 모델은 두 개의 인기 있는 공개 데이터 세트인 MoNuseg 및 GlaS에서 각각 평균 1.0% 및 1.37%의 주사위 증가로 최첨단 결과를 달성합니다. 수정된 모델의 총 매개변수는 1.71M로 감소하여 UCtransNet에 비해 38.6배 감소했으며 매개변수는 65.6M입니다.
의료 영상 세분화는 진단, 치료 계획 및 질병 모니터링을 포함한 다양한 임상 응용 분야에서 매우 중요합니다. 기능 엔지니어링 알고리즘을 기반으로 하는 기존 이미지 처리 방법은 현대 의료 환경에서 생성된 대량의 데이터를 처리하는 데 더 이상 적합하지 않습니다. 다행히 인공 신경망 기술의 발전과 컴퓨터 하드웨어 기능의 향상으로 대규모 신경망 모델을 훈련하고 배포할 수 있게 되었습니다. 이에 따라 머신러닝 모델을 기반으로 한 컴퓨터 비전 처리 알고리즘이 지속적으로 개발되어 다양한 분야에 적용되고 있다.
의료 이미지의 의미론적 분할에서 가장 대표적인 모델 구조는 인코딩-디코딩 아키텍처를 사용하는 UNet1 입니다. 이 모델은 먼저 다중 레벨 인코더를 사용하여 입력 이미지에서 다양한 스케일의 기능을 추출합니다. 그런 다음, 디코더는 해당 레벨의 인코더에 의해 출력된 시맨틱 기능을 스킵 연결로 결합하면서 단계별로 업샘플링합니다. 그러나 UNet 아키텍처의 성능은 몇 가지 방법을 적용하여 더욱 향상시킬 수 있습니다. 예를 들어, 주의 메커니즘은 컨볼루션 신경망의 성능을 향상시키는 데 효과적인 것으로 나타났습니다. 이러한 메커니즘은 입력 데이터의 필수 기능을 선택적으로 강조할 수 있으므로 표현 학습 및 세분화 정확도가 향상됩니다.
현재 많은 연구자들은 디코딩 단계에서 인코더가 추출한 기능을 효과적으로 융합하는 데 중점을 두고 있습니다. UNet의 가장 일반적인 변형 중 일부는 Attention UNet2, Recurrent UNet3 및 V-Net4를 포함합니다. 이러한 접근법은 공간 어텐션(spatial attention)과 같은 어텐션 메카니즘(attention mechanism)5을 사용하여 피처 맵의 정보 영역을 강조하고 비정보 영역을 억제한다. 또한 일부 변형은 순환 신경망을 통합하여 의료 이미지의 순차적 특성을 모델링하고 특징 표현을 개선합니다. VGG6, ResNet7 및 DenseNet8과 같은 사전 학습 모델은 대규모 데이터 세트에서 학습한 풍부한 지식을 활용하여 U자형 네트워크의 성능을 개선하는 데 널리 사용되었습니다. 또한 self-attention 및 multi-head attention과 같은 트랜스포머 메커니즘이 장거리 모델 종속성에 도입되고 글로벌 컨텍스트 정보를 캡처하여 세분화 성능을 향상시킵니다.
그러나 이러한 변형은 원래 UNet1보다 개선되었지만 다양한 스케일과 모양의 복잡한 의료 이미지를 처리하는 데 여전히 특정 제한이 있습니다. 또한 이러한 변형의 복잡성 증가로 인해 계산 비용이 높아지고 학습 시간이 길어지는 경우가 많아 실제 환경에서의 적용 가능성이 제한됩니다.
UNet1 아키텍처를 향상시키기 위해 MixKNet(Mix Kernel Size U-shape Net)이라는 수정된 모델을 제안하여 네트워크 깊이를 줄이는 동시에 채널 수를 늘려 학습 능력을 향상시킵니다. 그러나 깊이가 감소하면 전반적인 성능이 저하될 수 있습니다. 이 문제를 완화하기 위해 하이브리드 채널 컨볼루션 모듈이 도입되어 원래의 컨볼루션 신경 모듈을 대체합니다. 이 모듈은 깊이별 컨볼루션 레이어와 포인트별 컨볼루션 레이어 사이에 채널 어텐션 메커니즘을 통합하여 효과적인 채널 기능을 추출하는 모델의 기능을 강화하는 것을 목표로 합니다.
실제 적용 가능성을 안내하기 위해 제안된 방법은 500 × 500에서 1000 × 1000 픽셀 범위의 개별 이미지 해상도를 가진 비교적 작은 규모의 의료 이미지 데이터 세트에서 평가되었다는 점에 유의하는 것이 중요합니다. 모델 학습의 경우 모든 이미지의 크기가 224 × 224 픽셀로 조정되었습니다. 구현은 단일 NVIDIA RTX 3090 GPU에서 PyTorch를 사용하여 수행되었습니다. 이러한 작동 매개변수는 이 방법이 중간 정도의 실험 설정에 대해 계산적으로 실현 가능하고 제한된 데이터 세트 크기에 적용할 수 있음을 시사합니다.
결론적으로, 이 기사에서는 U자형 네트워크 구조에 대한 새로운 수정 사항을 제시하고 채널 어텐션 메커니즘과 함께 하이브리드 채널 컨볼루션 모듈을 소개하며, 둘 다 의료 이미지 데이터 세트의 세분화 성능을 향상시킵니다. 이 작업의 주요 기여는 다음과 같습니다: (1) 원래의 컨볼루션 신경 모듈을 대체하는 하이브리드 딥 와이즈 컨볼루션 모듈로 수정된 U자형 네트워크 구조를 제안합니다. (2) 모델의 효과적인 채널 특징 추출 능력을 향상시키기 위해 deep-wised 및 point-wised convolution layer 사이에 채널 어텐션 메커니즘을 도입합니다. (3) MoNuseg9 핵 세분화 데이터 세트의 두 가지 인기 있는 공개 데이터 세트에서 모델 매개변수가 현저히 적고(64M 매개변수가 있는 UCtransNet10 과 비교) GlaS11 분비선 분할 데이터 세트의 성능을 개선한 동시에 최첨단 결과를 달성했습니다.
이 문서의 나머지 부분은 다음과 같이 구성되어 있습니다. 2단계에서는 UNet1 에 대한 이전 연구와 의료 이미지 분할의 다양성에 대한 포괄적인 검토를 제공합니다. 기존 접근 방식의 강점과 한계를 검토하고, 주의 메커니즘, 혼합 깊이 컨볼루션 네트워크 및 세분화 모델에서의 적용에 대한 관련 작업을 검토합니다. 3단계에서는 UNet 구조 수정, 채널 어텐션 메커니즘 통합, 혼합 깊이 컨볼루션 사용을 포함하여 제안된 MixKNet 모델의 아키텍처를 자세히 설명합니다. 4단계는 광범위한 실험의 결과를 보고하며, 각 구성 요소의 기여도를 평가하기 위한 토론 및 절제 연구가 함께 제공됩니다. 마지막으로 5단계에서는 논문을 마무리하고 향후 연구를 위한 잠재적 방향을 간략하게 설명합니다.
이 섹션에서는 의료 이미지 세분화에서 UNet과 그 변형에 대한 이전 연구를 검토하는 것으로 시작하여 기존 방법의 강점과 한계를 간략하게 설명합니다. 또한 주의 메커니즘과 세분화 모델에서의 적용에 대한 관련 연구가 논의됩니다. 세분화 성능을 향상시키기 위한 깊이 컨볼루션 기술과 관련된 최근 개발도 검토됩니다. 제안된 MixKNet(c) 및 기타 모델에 대한 비교 분석이 그림 1에 나와 있으며, 여기서 점선은 건너뛰기 연결을 나타냅니다.
UNet 및 그 변형
UNet 아키텍처는 2015년 Ronneberger et al.에 의해 처음 제안되었으며 이후 의료 이미지 분할에 널리 사용되었습니다. 모델은 인코딩 경로와 디코딩 경로로 구성됩니다. 인코더는 입력 이미지에서 높은 수준의 기능을 추출하는 반면 디코더는 기능을 업 샘플링하고 결합하여 세분화 맵을 생성합니다. 그 이후로 의료 이미지 분할의 성능을 개선하기 위해 UNet 아키텍처에 다양한 수정이 이루어졌습니다. 가장 일반적인 수정 사항 중 하나는 건너뛰기 연결의 도입으로, 세분화의 정확도를 향상시키는 것으로 나타났습니다. Zhou et al.12은 조밀한 스킵 연결을 사용하여 모델이 공간 정보를 더 잘 보존할 수 있도록 하는 UNet 변형을 제안했습니다.
UNet 아키텍처에 대한 또 다른 인기 있는 수정 사항은 어텐션 메커니즘의 추가입니다. 이러한 메커니즘은 모델이 가장 중요한 기능을 선택적으로 강조하는 데 도움이 될 수 있으며, 이는 더 나은 표현 학습 및 세분화 정확도로 이어질 수 있습니다. 어텐션 메커니즘이 있는 변형의 몇 가지 예로는 어텐션 UNet2, 어텐션 게이트(attention gate) 13이 있는 ResUNet, 어텐션 게이트(attention gate)14가 있는 Dense-UNet이 있습니다. 위의 수정 사항 외에도 의료 이미지 분할을 위해 UNet 아키텍처의 다른 많은 변형이 제안되었습니다. UCTransNet10 은 건너뛰기 연결과 트랜스포머 모듈을 통합하는 U-Net 아키텍처의 변형입니다. UCTransNet10 의 스킵 연결은 채널 별 관점에서 다시 생각되어 더 나은 기능 재사용을 허용하고 매개 변수 수를 줄입니다. Transformer 모듈이 추가되어 장기 종속성을 캡처하고 번역 품질을 개선합니다. UCTransNet10 은 여러 기계 번역 벤치마크에서 최첨단 결과를 달성하는 것으로 나타났습니다. Zihan 등은 LViT15라는 딥 러닝 모델을 제안하여 의료 이미지 분석 작업에 적용했습니다. LViT15 의 준감독 버전을 확장하고 이미지 데이터의 품질 결함을 보완하기 위해 그들은 EPI(Exponential Pseudo Label Iteration 메커니즘)를 제안했습니다. 또한 이미지의 로컬 기능을 보존하기 위해 중요한 이미지 기능에 선택적으로 초점을 맞춘 PLAM(Pixel-Level Attention Module)을 제안했습니다.
주의 메커니즘
주의 메커니즘은 기계 학습, 특히 자연어 처리 및 컴퓨터 비전에서 널리 연구되었습니다. 최근 몇 년 동안 주의 메커니즘은 이미지 분할을 포함한 의료 이미지 분석 작업에도 적용되었습니다. Bahdanau 등[16 ]은 번역의 질을 향상시키기 위해 신경 기계 번역에 주의 메커니즘을 도입했습니다. 이 메커니즘을 통해 모델은 입력 시퀀스의 관련 부분에 선택적으로 초점을 맞출 수 있어 번역 품질이 향상됩니다. 그 이후로 이미지 분석 작업을 위한 다양한 주의 메커니즘이 제안되었습니다. 어텐션 메커니즘의 일반적인 유형 중 하나는 공간 어텐션 메커니즘(spatial attention mechanism)으로, 중요도에 따라 피처 맵의 각 픽셀에 가중치를 적용하는 것을 포함합니다. 예를 들어, Guo 등[17 ]은 망막 혈관 분할 작업을 위한 공간적 주의 메커니즘을 제안했습니다. 이 메커니즘은 게이팅 메커니즘을 사용하여 공간 기능의 가중치를 조정하여 용기 픽셀과 비 용기 픽셀을 구별하는 모델의 기능을 향상시킵니다. 또 다른 유형의 어텐션 메커니즘은 채널 어텐션(channel attention)으로, 채널 전반에 걸쳐 피처 맵의 가중치를 조정하는 데 중점을 둡니다. Hu et al.18 은 기능 맵에 채널별 주의를 적용하여 이미지 분류 작업의 성능을 향상시키는 SENet(squeeze-and-excitation Network)을 제안했습니다. 보다 최근에는 이미지 분할 작업을 위해 주의 메커니즘이 CNN(Convolutional Neural Network)과 결합되었습니다. 예를 들어, Chen 등[19 ]은 공간적 주의 메커니즘과 채널별 주의 메커니즘을 결합한 뇌종양 세분화를 위한 주의 유도 네트워크를 제안했습니다.
의료 이미지 분석 및 원격 감지를 위한 반지도 학습(semi-supervised learning) 및 멀티모달 학습(multimodal learning)의 최근 발전은 유망한 성능 향상을 보여주었습니다. Yang et al.20 은 교차 양식 생성 학습과 반지도 전략을 활용하는 새로운 짝을 이루지 않은 다중 모드 세분화 프레임워크인 UMSCS를 제안했습니다. Zhang 등은 몇 가지 최첨단 기술을 소개했습니다: semi-supervised segmentation21을 위한 증거 강화 tri-branch consistency 모델, 의료 이미지 세분화22를 위한 자체 인식 및 교차 샘플 프로토타입 학습 프레임워크, 항공우주 영역에서 합성 개구 레이더(SAR) 재밍 인식을 위한 시간 주파수 인식 계층적 특징 최적화 접근 방식23. 이러한 작업은 의료 및 엔지니어링 이미징 작업 모두에서 하이브리드 감독 및 도메인 인식 기능 모델링의 중요성을 총체적으로 강조합니다.
Depth-wised 컨볼루션
Depth-wise Convolution은 입력 기능 맵에서 채널별 상관 관계를 캡처하도록 설계되었으며 Convolutional Neural Network의 효율성과 정확성을 향상시키는 것으로 나타났습니다.
가장 초기의 가장 영향력 있는 깊이 별 컨볼루션 모델 중 하나는 2017년 Howard et al.이 제안한 MobileNet24입니다. MobileNet은 깊이 별 분리 가능한 컨볼루션을 사용하여 깊이 별 컨볼루션을 적용한 다음 점별 컨볼루션을 적용하여 컨볼루션 레이어에 필요한 매개 변수 수와 계산을 줄입니다. 이를 통해 MobileNet은 기존의 컨볼루션 신경망보다 훨씬 적은 매개변수를 사용하면서 이미지 분류 작업에서 최첨단 정확도를 달성할 수 있습니다. MobileNet이 도입된 이후 ShuffleNet25, Xception26 및 ResNeXt27을 비롯한 여러 가지 깊이 별 컨볼루션 아키텍처가 제안되었습니다. 이러한 모델은 deep-wise convolution의 구체적인 구현에 따라 다르지만 모두 정확도를 유지하거나 개선하면서 컨볼루션 계층의 계산 복잡성을 줄인다는 목표를 공유합니다. PSPNet28 과 같은 모델은 깊이 분리 가능한 컨볼루션을 사용하여 대규모 컨볼루션 계층의 계산 및 메모리 요구 사항을 줄임으로써 의미론적 세분화 작업에도 심층 컨볼루션이 적용되었습니다. MixNet29 는 여러 커널 크기를 활용하여 다양한 스케일의 기능을 캡처하는 혼합 깊이 별 컨볼루션을 도입하여 딥 와이즈 컨볼루션의 아이디어를 더욱 확장합니다. 다른 최첨단 모델보다 성능이 뛰어나면서도 유사한 매개변수와 FLOP를 유지하는 것으로 나타났습니다. 이러한 모델은 다양한 의미론적 세분화 작업에서 기존의 컨볼루션 신경망에 비해 정확성과 효율성이 크게 향상되었음을 보여주었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 섹션에서는 의료 이미지 분할을 위해 제안된 MixKNet 아키텍처에 대해 설명합니다. MixKNet 모델은 어텐션 메커니즘과 혼합된 깊이 컨볼루션 계층을 통합하여 UNet 아키텍처를 확장합니다. 이 연구에 사용된 소프트웨어는 Table of Materials에 나열되어 있습니다.
1. 전체 아키텍처
2. 평평하게 한 U-형태
참고: 신경망 아키텍처의 깊이를 줄여 계산 복잡성과 모델 크기를 줄이는 동시에 복잡한 데이터 표현을 학습할 수 있는 능력이 줄어들 수 있음을 유의하십시오.
3. 인코더의 커널 크기 혼합
4. 채널 관심
5. 데이터 세트
참고: 이 연구에서는 표 1 및 표 2에 제시된 바와 같이 공개적으로 사용 가능한 두 가지 의료 이미지 데이터 세트인 GlaS(Sirinukunwattana et al.11) 및 MoNuSeg(Kumar et al.9)가 사용됩니다.
6. 구현 세부 정보
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
최첨단 방법과의 비교
MixKNet 아키텍처는 GlaS 및 MoNuSeg의 두 가지 의료 이미지 분할 데이터 세트에서 평가되었으며 해당 분야의 최첨단 방법과 비교되었습니다. 평가는 표 3과 같이 제안된 방법과 몇 가지 유사한 모델의 주사위 및 IoU 점수를 보고하여 수행되었습니다. 결과는 MixKNet 아키텍처가 다른 모델보다 성능이 뛰어나 두 데이터 세트 모두에서 가장 높은 평균 주사위와 IoU 점수를 달성했음을 나타냅니다. GlaS11 데이터 세트에서 제안된 MixKNet은 평균 주사위 점수 91.18%와 평균 IoU 점수 84.51%를 달성했으며, 이는 다른 모델보다 높습니다. MoNuSeg9 데이터 세트에서 제안된 MixKNet은 각각 80.45%와 67.55%의 가장 높은 평균 주사위와 IoU 점수를 달성했습니다. 이러한 결과는 MixKNet 아키텍처가 의료 이미지 분할에 매우 효과적이며 최첨단 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구에서는 의료 이미지 분할을 위한 UNet1 아키텍처의 새로운 변형인 MixKNet을 제시하며, 혼합 심도 컨볼루션과 채널 어텐션 메커니즘을 통합하여 세분화 성능을 향상시키는 동시에 계산 복잡성을 크게 줄입니다. 하이브리드 채널 컨볼루션은 별도의 채널 그룹에서 작동하는 여러 컨볼루션 커널을 결합합니다. 이 설계를 통해 네트워크는 동일한 레이어 내에서 서로 다른 수용 필드 스케일에서 다양한 공간 및 상황적 기능을 캡처할 수 있으므로 지역 및 글로벌 구조를 모두 표현하는 모델의 능력이 향상됩니다. 모든 채널을 균일하게 처리하는 표준 컨볼루션과 달리, 이 하이브리드 전략은 계산 비용의 증가를 최소화하면서 표현 유연성을 향상시킵니다.
한편, 채널 어텐션(channel attention)을 통합하면 모델이 관련성에 따라 기능 맵에 적응적으로 가중치를 다시 부여할 수 있습니다. 이론...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자는 경쟁하는 재정적 이해관계나 기타 이해상충이 없음을 선언합니다.
닝보시의 2023년 사회복지 연구 프로젝트의 두 번째 배치: 온톨로지 및 NLP를 기반으로 한 통신 네트워크 사기 식별을 위한 핵심 기술 연구 및 적용(2023S169).
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 리눅스 OS(Ubuntu 22.04) | 다양 (오픈 소스 커뮤니티) | N/A(버전 22.04 LTS) | 개발용 오픈 소스 운영 체제 https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | 고성능 GPU https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (버전 > 3.8) | AI/ML 개발을 위한 프로그래밍 언어 https://www.python.org/ |
| PyTorch | Meta AI | N/A(버전 1.13) | 오픈 소스 기계 학습 프레임워크 https://pytorch.org/ |
| Visual Studio Code(VS Code)Microsoft | N/A | 가볍고 강력한 코드 편집기 https://code.visualstudio.com/ |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청