이 프로토콜은 핀휠 컨볼루션, 이중 주의, 다중 스케일 융합을 통합하여 대장항문 폴립을 분할하는 U자형 딥러닝 네트워크를 구현합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
방법 논문
* These authors contributed equally
이 프로토콜은 핀휠 컨볼루션, 이중 주의, 다중 스케일 융합을 통합하여 대장항문 폴립을 분할하는 U자형 딥러닝 네트워크를 구현합니다.
대장 폴립의 정확한 분절은 대장암의 조기 예방과 진단에 매우 중요합니다. 그러나 폴립의 형태, 크기, 질감이 매우 이질적이며, 장 환경의 복잡성(주름, 반사, 대변 잔류물 등)으로 인해 기존 방법들은 경계 위치 파악과 소형 폴립 검출에 여전히 큰 어려움을 겪고 있습니다. 이러한 문제를 해결하기 위해 본 논문은 핀휠 컨볼루션과 이중 주의(PWD-Net)를 기반으로 한 폴립 분할 네트워크를 제안합니다. 제안된 네트워크는 U자형 인코더-디코더 아키텍처를 채택하며, 사전 학습된 ResNet을 인코더로 사용하여 다층 로컬 특징을 추출합니다. 구체적으로, 병목 계층에 핀휠 컨볼루션 모듈(PCM)이 도입되어 다중 각도 회전 컨볼루션 커널을 통해 폴립의 전역 기하학적 구조와 다방향 맥락 정보를 포착합니다. 채널 주의와 공간적 주의를 통합하는 이중 주의 메커니즘(DAM)은 배경 소음을 적응적으로 억제하고 폴립 영역 특징을 강화하도록 설계되었습니다. 또한, 다중 규모 특징 융합(MSF) 전략을 사용하여 깊은 의미 정보와 얕은 경계 세부사항을 결합하여 세분화 결과의 완전성과 정밀도를 모두 보장합니다. Kvasir-SEG 및 CVC-ClinicDB 데이터셋에서 수행된 실험 결과, PWD-Net은 각각 평균 Dice 계수 0.865와 0.944, IoU 점수 0.765와 0.892를 달성하여 기존 최첨단 방법을 크게 우수하게 달성했습니다. 제거 연구는 각 모듈의 효과를 검증하며, 교차 데이터셋 평가를 통해 모델의 강력한 일반화 능력을 확인한다. 이 연구는 임상 용종 분할에 대한 고정밀도이자 견고한 해결책을 제공하며, 대장암 전암성 병변의 조기 진단과 컴퓨터 지원 개입을 지원하는 데 큰 가치를 제공합니다.
대장암은 전 세계적으로 가장 흔한 악성 종양 중 하나로, 발생률과 사망률이 꾸준히 높습니다. 연구에 따르면 대부분의 대장암은 선종성 용종에서 발생하며, 이 과정은 보통 10년에서 15년 정도 걸려 조기 발견과 개입을 위한 귀중한 시간 창을 제공합니다. 선종 발견률(ADR)을 1% 증가시키면 대장암 위험을 약 3% 감소시켜 환자 사망률을 유의미하게 낮출 수 있습니다. 대장내시경은 대장암 검진의 금본위로 여겨지며, 검사 중 용종을 직접 제거할 수 있어 암 발생률과 사망률을 효과적으로 줄입니다.
하지만 기존 대장내시경은 내시경 전문의의 경험과 기술 수준에 크게 좌우됩니다. 주관적 판단, 시각 피로, 산만함과 같은 요인들이 20%에서 30%의 실패율을 초래할 수 있으며, 이는 선별 효과에 직접적인 영향을 미칩니다. 따라서 대장 용종의 자동 분할을 위한 컴퓨터 지원 탐지(CAD) 시스템 개발은 ADR 개선과 진단 누락 감소에 매우 중요합니다. 최근 임상 조사들은 인공지능을 내시경 병변 평가 워크플로우에 통합하려는 관심을 더욱 부각시키며, 견고하고 재현 가능한 분할 방법의 필요성을 강화했습니다.
최근 몇 년간 딥러닝은 특히 합성곱신경망(CNN)에서 의료 영상 분석에서 눈에 띄는 진전을 이루었으며, 이는 이미지분할 작업에 대한 특징 추출과 표현에 강력한 능력을 보여줍니다. 고전적인 의료 영상 분할 모델인 U-Net은 대칭 인코더-디코더 아키텍처를 사용하며 연결을 건너뛰어 정확한 픽셀 수준 분할을 달성하여 이 분야의 벤치마크가 되었습니다5. U-Net을 기반으로 복잡한 의료 영상 분할 작업을 해결하기 위해 많은 개선된 아키텍처가 제안되었습니다. UNet++는 중첩 및 밀집 스킵 연결을 도입하여 인코더와 디코더 특징 맵 간의 의미적 간극을 줄입니다. ResUNet++는 잔류 블록, 압축 및 여기 모듈, 확장된 컨볼루션, 주의 메커니즘을 통합하여 폴립 분할7에서 강력한 성능을 달성합니다. U2-Net은 다중 스케일 특징 정보를 포착하기 위해 2단계 중첩된 U자형 구조를 채택합니다. 최근에는 병렬 인코딩 및 디코딩 경로를 활용해분할 정확도를 더욱 향상시키는 이중 인코더-디코더 기반의 딥 폴립 분할 네트워크가 제안되었습니다.
한편, 주의 메커니즘의 도입은 기능 향상과 노이즈 억제를 위한 새로운 해결책을 제공합니다. 주의 U-Net은 주의 게이트를 사용해 목표 영역에 집중하고 무관한 배경 정보를 억제합니다.10. 이중 주의 네트워크(DANet)는 채널 및 공간 차원 모두에서 특징을 적응적으로 가중치하여 중요한 특징의 인식을 향상시킵니다. 트리플 어텐션 네트워크(TANet)는 다중 스케일 특징의 적응형 선택을 통해 세분화 성능을 더욱 향상시킵니다12.
자연어 처리와 컴퓨터 비전13에서 트랜스포머 아키텍처의 성공에 힘입어, 연구자들은 의료 이미지 분할에 대한 적용을 탐구하기 시작했습니다. TransUNet은 장거리 의존성을 사실상 모델링하기 위해 인코더로 트랜스포머를 처음으로 사용한 회사였습니다. Swin-UNet은 순수 트랜스포머 아키텍처를 채택하여 시프트 윈도우 메커니즘을 통해 효율적인 글로벌 정보 집계를 달성합니다. UTNet은 CNN의 로컬 특징 추출 능력과 Transformers16의 글로벌 모델링 능력을 결합한 하이브리드 아키텍처를 제안합니다.
폴립 세분화 분야에서 Polyp-PVT는 피라미드 비전 Transformer를 활용해 다중 스케일 글로벌의미 정보를 포착하며, 다중 스케일 중첩 UNet은 Transformers18을 통합하여 맥락적 이해를 향상시킵니다. 최근 연구들은 또한 교차 영역 폴립 분할에 대한 부정적 상관 학습 전략(19), 곰퍼츠 증강 분할 강화20, 경계 안내를 포함하는 주의 기반 아키텍처(21)를 탐구했습니다. 이러한 접근법들이 분할 성능을 어느 정도 향상시키긴 하지만, 폴립 분할은 여전히 여러 도전 과제에 직면해 있습니다. 첫째, 폴립은 형태, 크기, 질감에서 매우 이질적이며, 5mm 미만의 미세한 폴립부터 30mm를 넘는 큰 폴립까지 다양하며, 형태는 원형, 타원형부터 매우 불규칙한 형태까지 다양합니다. 둘째, 장 환경은 복잡하고 변동적이며, 점막 주름, 반사, 배설물 잔여물, 음식물 찌꺼기가 심각한 배경 간섭을 일으킵니다. 셋째, 많은 폴립은 경계가 흐릿하거나, 주름에 의해 부분적으로 막히거나, 장액에 잠겨 있어 경계 위치를 정확히 파악하는 것이 매우 어렵습니다.
기존 방법들은 이러한 문제를 해결하는 데 여전히 명확한 한계를 제시하고 있습니다. 전통적인 CNN은 국소 질감과 가장자리 특징을 추출하는 데 효과적이며; 그러나 고정된 정사각형 컨볼루션 커널은 특히 고도로 불규칙한 폴립의 경우 다양한 기하학적 형태를 포착하는 데 적합하지 않으며, 다방향 기하학적 특징을 효과적으로 모델링할 수 없습니다. 트랜스포머 기반 방법은 전역 의존성을 모델링할 수 있지만, 세밀한 국소 세부사항과 경계 정보를 포착하는 데는 덜 효과적입니다. 더불어, 계산 복잡성이 높아 실시간 임상 응용에는 덜 적합하다24. 최근 폴립 분할 기법인 PraNet(역주의 모듈을 사용해 주요 영역25), 경계 유도 캐스케이드 주의 네트워크(경계 특징 추출을 향상시키는26), 교차 주의 메커니즘을 통해 인코더와 디코더 기능을 융합하는 CAFE-Net(27)과 같은 최근 폴립 분할 방법들도 작은 폴립을 다룰 때 특징 표현이 불충분하고 경계 위치가 부정확합니다28, 흐릿한 경계와 복잡한 배경들. 더욱이 대부분의 방법은 기하학적 형태를 소홀히 하고, 다방향 맥락 정보를 충분히 활용하지 못해 불규칙한 폴립의 최적이 아닌 분할을 초래합니다.
요약하자면, 현재의 CNN 기반 방법은 고정된 정사각형 컨볼루션 커널에 의존하기 때문에 다방향 기하학적 특징을 포착할 수 없습니다. 트랜스포머 기반 접근법은 전역 모델링을 제공하지만 국소 경계 정밀도를 희생하고 높은 계산 비용을 부과합니다. 한편, 기존의 주의력 강화 및 다중 규모 융합 전략은 폴립 분할에 특별히 맞춤화된 통합 프레임워크 내에서 공동으로 최적화되지 않았습니다29. 이러한 격차는 기하학적 특징 모델링, 적응적 노이즈 억제, 그리고 교차 규모 특징 통합을 동시에 다루는 방법 개발을 촉진합니다.
이러한 문제를 해결하기 위해 이 프로토콜은 핀휠 컨볼루션과 이중 주의(PWD-Net)를 기반으로 한 폴리프 세그멘테이션 네트워크를 제시합니다. 제안된 네트워크는 기하학적 특징 모델링, 다차원 주의력 향상, 다중 규모 특징 융합을 통합하여 복잡한 폴립의 정밀한 분할을 가능하게 합니다. 이 연구의 주요 기여는 다음과 같이 요약됩니다: 핀휠 구조에서 영감을 받은 핀휠 컨볼루션 모듈(PCM)은 0°, 45°, 90°, 135°, 180°, 225°, 270°, 315° 등 여러 각도에서 합성곱 연산을 통해 폴립의 다방향 기하학적 특징을 포착하는 새로운 회전 컨볼루션 커널 설계를 제안합니다. 이 모듈은 병목 단계에서 기존의 합성곱 층을 대체하여 다양한 가장자리 방향을 효과적으로 인식하고 불규칙한 폴립의 표현을 크게 향상시킵니다. 이중 주의 메커니즘(DAM)은 대장내시경 이미지에서 주름, 반사, 대변 잔여물과 같은 배경 잡음을 다룹니다. 채널 주의와 공간적 주의를 통합하는 이중 주의 모듈이 설계되었습니다. 스킵 연결에 내장된 이 모듈은 배경 간섭을 적응적으로 억제하고 폴립 영역의 특징 반응을 향상시키며, "무엇이 중요한지"(채널 차원)와 "어디"가 목표가 위치한지(공간 차원)를 동시에 식별하여 이후 융합에 정제된 특징만 포함되도록 보장합니다. 다중 규모 특징 융합 전략(MSF)은 디코더에 도입된 계층적 메커니즘을 통해 깊은 의미 정보와 얕은 경계 세부사항을 모두 보존합니다. DAM 강화 인코더 기능과 업샘플링 디코더 기능을 점진적으로 통합함으로써, 이 전략은 다운샘플링으로 인한 공간적 세부 손실을 효과적으로 보정하여 작은 폴립을 정확히 탐지하고 경계를 정밀하게 구분할 수 있게 합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 공개된 익명화된 대장내시경 이미지 데이터셋(Kvasir-SEG)만을 사용합니다. 새로운 인간 대상 데이터는 수집되지 않았습니다. 식별 해제된 공개 데이터셋의 사후 분석에 대한 기관 검토 정책에서 확인된 바와 같이, 기관 윤리 승인과 환자 사전 동의는 필요하지 않았습니다.
1. 데이터 준비
2. 전체 건축
참고: PWD-Net의 매크로 수준 인코더-디코더 백본은 그림 1 을, 피처 플로우 내 핵심 모듈의 통합 및 상호작용은 그림 2 를 참조하세요. 전체 아키텍처는 용종의 크기 변화와 대장내시경 이미지에서의 배경 간섭을 처리하기 위해 U자형 인코더-디코더 설계를 따릅니다.
3. 핀휠 컨볼루션 모듈 (그림 3)

4. 이중 주의 메커니즘 (그림 4)
참고: 이중 주의 메커니즘(DAM)은 각 스킵 연결에 내장되어 배경 소음을 억제하고 채널 및 공간 차원 모두에서 폴립 영역 특징을 강화합니다.


5. 다중 규모 특징 융합
6. 손실 함수 및 훈련 구성



7. 의사 코드
알고리즘 1: PWD-넷 폴립 분할
1: 입력: 대장내시경 영상 I ∈ RH×W×3
2: 출력: 세그멘테이션 마스크 M ∈ {0,1}(H×W)
3:
4: 기능 PCM(X) ▷ 핀휠 컨볼루션 모듈
5: 기본 핵 W(3 x 3)를 정의하라. 각도 Θ = {0°, 45°, ..., 315°}
6: 각 θ에 대해 θ∈ do(행)
7: Wθ ← BilinearRotate(W, θ) ▷ 핵 회전
8: Yθ ← Conv2d(X, Wθ) ▷ 방향별 특징
9: 끝
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Yθ})))) ▷ 집계
11: Y반환 아웃
12: 끝 함수
13:
14: 기능 DAM(F) ▷ 이중 주의 메커니즘
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ 채널 주의 (r=16)
16: As ← 시그모이드(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ 공간적 주의
17: F' ← F ⊗ (α · Ac + β · As) ▷ 학습 가능한 α과 퓨즈, β (init=0.5)
18: 귀환 F'
19: 기능 종료
20:
21: 기능 PWD-Net(I)
22: 인코더: e1,e 2, e3, e4, e5 ← ResNet50_Stages(I) ▷ 5단계 사전 학습 인코더
23: 병목 현상: b ← PCM(e5) ▷ 병목 현상 PCM 적용
24: 연결 건너뛰기: si ← DAM(ei) = 1, 2, 3, 4 ▷ 필터 인코더 기능
25: 디코더:
26: d4 ← 더블 컨브(Concat(Up(b), s4))
27: d3 ← 더블 컨브(Concat(업(d4), s3))
28: d2 ← 더블 컨브(Concat(위(d3), s2))
29: d1 ← 더블 컨브(Concat(업(d2), s1))
30: M ← 시그모이드(Conv1 x 1(d1))
31: 귀환 M
32: 기능 종료
33:
34: 훈련:
35: 각 에포크 도에 대해
36: M̂ ← PWD-Net(I)
37: L ← 0.5 · BCE(M̂, Mgt) + 0.5 · DiceLoss(M̂, Mgt) ▷ λ = 0.5
38: 역전파를 통한 매개변수 업데이트 (Adam optimizer)
39: 끝
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
실험 장치
데이터셋
Kvasir SEG 데이터셋은 이질적인 폴립 외관을 가진 대장내시경 이미지에서 PWD Net의 분할 행동을 평가하는 데 사용되었습니다. 이 데이터셋은 1,000개의 주석이 달린 폴립 이미지를 포함하고 있으며, 폴립 크기, 형태, 질감, 조명, 배경 복잡성의 변동성을 포함하여 작은 표적 탐지, 경계 위치 파악, 시각적 간섭에 대한 견고성 평가에 적합합니다. 데이터셋은 훈련, 검증, 테스트 하위 집합으로 나뉘었으며, 최종 테스트 세트는 성능 평가에만 사용되었습니다. 이미지 분포는 표 1에 요약되어 있습니다.
구현 세부사항
재현성을 위해 필요한 구현 설정은 표 2 에 요약되어 있으며, 전체 절차적 세부사항은 데이...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
PWD-Net 프로토콜의 여러 설계 선택은 신뢰할 수 있는 세분화 결과를 달성하기 위해 매우 중요하며, 구현 시 세심한 주의가 필요합니다. 첫째, 인코더 백본의 선택과 초기화는 수렴 동작과 최종 성능에 직접적인 영향을 미칩니다. 이 프로토콜은 ImageNet에서 사전 학습된 ResNet-50 인코더를 사용하여 강력한 저수준 및 중간 수준 기능 초기화를 제공합니다. 이는 특히 훈련 데이터가 제한된 의료 이미지 분할 작업(본 연구에서 800장의 이미지)에서 중요합니다. 모든 인코더 계층을 정지 대신 미세 조정하면, 네트워크는 점막 질감과 스펙큘러 반사와 같은 대장내시경 이미지의 특정 특성에 미리 학습된 특징을 적응시킬 수 있습니다. 둘째, 각 핵심 모듈의 아키텍처 내 배치는 의도적입니다. 핀휠 컨볼루션 모듈(PCM)은 공간 해상도가 가장 낮지만 의미 정보가 가장 풍부한 병목 지점에 위치해 있어 과도한 계산 비용 없이 전 세계 기하학적 패턴을 효율적으로 캡처할 수 있습니다....
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
이 연구는 중국 국가 중점 연구개발 프로그램(프로그램 번호 2022YFC3500200 및 2022YFC3500204)의 지원을 받았습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Adam Optimizer | — | — | PyTorch에 포함됨 |
| Albumentations | Albumentations Team | v1.0+ | 데이터 증강 라이브러리 |
| CUDA Toolkit | NVIDIA | v11.3+ | GPU 가속 |
| Kvasir-SEG 데이터셋 | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | 학습 곡선 시각화 |
| NumPy | NumPy Community | v1.21+ | 수치 계산 |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | 학습 및 추론용 GPU |
| OpenCV | OpenCV Community | v4.5+ | 이미지 전처리 |
| Python | Python Software Foundation | v3.8+ | 프로그래밍 언어 |
| PyTorch | Meta Platforms | v1.12+ | 딥러닝 프레임워크 |
| ResNet-50 사전 학습된 가중치 | PyTorch Model Zoo | — | ImageNet-1K 사전 학습 |
| Ubuntu | Canonical | 18.04+ | 운영 체제 |