Współczesna interwencja kliniczna, obejmująca diagnostykę chorób, opracowywanie planów leczenia oraz monitorowanie wyników terapii, opiera się na dokładnej segmentacji obrazów medycznych1. Jednak złożone zależności strukturalne między narządami jamy brzusznej2 sprawiają, że precyzyjna segmentacja wielu organów brzusznych jest zadaniem trudnym3. W ciągu ostatnich kilku dekad dynamiczny rozwój obrazowania medycznego i wizji komputerowej przyniósł zarówno nowe możliwości, jak i wyzwania w dziedzinie wielonarządowej segmentacji jamy brzusznej. Zaawansowana technologia obrazowania metodą rezonansu magnetycznego (MRI)4 oraz tomografii komputerowej (CT)5 umożliwia pozyskiwanie obrazów jamy brzusznej o wysokiej rozdzielczości. Precyzyjna segmentacja wielu narządów z obrazów CT ma istotną wartość kliniczną w ocenie i leczeniu kluczowych organów, takich jak wątroba, nerki, śledziona, trzustka itp.6,7,8,9,10 Jednak ręczna adnotacja tych struktur anatomicznych, zwłaszcza tych wymagających udziału radiologów lub radioterapeutów, jest czasochłonna i podatna na wpływ subiektywny1. W związku z tym istnieje pilna potrzeba opracowania zautomatyzowanych i dokładnych metod wielonarządowej segmentacji jamy brzusznej.
Poprzednie badania nad segmentacją obrazu opierały się głównie na konwolucyjnych sieciach neuronowych (CNN), które zwiększają wydajność segmentacji poprzez nakładanie warstw oraz wprowadzenie architektury ResNet12. W 2020 roku zespół badawczy Google wprowadził model Vision Transformer (VIT)13, co stanowiło pionierski przykład zastosowania architektury Transformer w tradycyjnej domenie wizualnej dla szeregu zadań związanych z obrazowaniem14. Podczas gdy operacje konwolucyjne mogą uwzględniać jedynie lokalne informacje o cechach, mechanizm uwagi w Transformerach umożliwia kompleksowe uwzględnienie globalnych informacji o cechach.
Biorąc pod uwagę przewagę architektur opartych na Transformerach nad tradycyjnymi sieciami splotowymi15, wiele zespołów badawczych podjęło szeroko zakrojone próby optymalizacji synergii między mocnymi stronami Transformerów a sieciami splotowymi16,17,18,19. Chen i wsp. wprowadzili model TransUNet do zadań segmentacji obrazów medycznych16, który wykorzystuje Transformery do wyodrębniania globalnych cech z obrazów. Ze względu na wysoki koszt trenowania sieci oraz brak wykorzystania koncepcji hierarchii ekstrakcji cech, zalety Transformerów nie zostały w pełni zrealizowane.
Aby rozwiązać te problemy, wielu badaczy zaczęło eksperymentować z wykorzystaniem Transformerów jako szkieletu do trenowania sieci segmentacyjnych. Liu i wsp.17 wprowadzili Swin Transformer, który wykorzystywał hierarchiczną metodę konstrukcji do warstwowej ekstrakcji cech. Zaproponowano koncepcję Windows Multi-Head Self-Attention (W-MSA), która znacząco zredukowała koszt obliczeniowy, szczególnie w przypadku większych map cech na niskim poziomie. Choć podejście to zmniejszyło wymagania obliczeniowe, doprowadziło jednocześnie do izolacji transmisji informacji między różnymi oknami. Aby rozwiązać ten problem, autorzy wprowadzili dodatkowo koncepcję Shifted Windows Multi-Head Self-Attention (SW-MSA), umożliwiającą propagację informacji pomiędzy sąsiednimi oknami. Opierając się na tej metodologii, Cao i wsp. opracowali Swin-UNet18, zastępując sploty 2D w U-Net modułami Swin oraz włączając W-MSA i SW-MSA do procesów kodowania i dekodowania, co pozwoliło osiągnąć satysfakcjonujące wyniki segmentacji.
Z kolei Zhou i wsp. podkreślili, że podczas przetwarzania obrazów o wysokiej rozdzielczości nie można zignorować zalet operacji splotu (conv)19. Zaproponowany przez nich model nnFormer wykorzystuje metodę obliczeń mechanizmu self-attention opartą na lokalnych trójwymiarowych blokach obrazu, tworząc model Transformer o strukturze w kształcie krzyża. Zastosowanie uwagi opartej na lokalnych blokach trójwymiarowych znacząco zredukowało obciążenie sieci podczas procesu trenowania.
Biorąc pod uwagę problemy związane z powyższą analizą, zaproponowano wydajną hybrydową strukturę hierarchiczną do segmentacji trójwymiarowych obrazów medycznych, nazwaną Swin-PSAxialNet. Metoda ta zawiera blok downsamplingu, blok Space-to-depth (SPD)20, który jest zdolny do ekstrakcji informacji globalnych21. Ponadto dodano moduł współdzielonej parametrami uwagi osiowej (PSAA), który redukuje liczbę parametrów uczenia z kwadratowej do liniowej, co pozytywnie wpływa na dokładność trenowania sieci oraz złożoność modeli treningowych2.
Sieć Swin-PSAxialNet
Ogólna architektura sieci przyjmuje strukturę w kształcie litery U charakterystyczną dla nnU-Net23, składającą się ze struktur koder i dekoder. Struktury te służą do lokalnej ekstrakcji cech oraz konkatenacji cech z obrazów w dużej i małej skali, co przedstawiono na Rysunku 1.

Rycina 1Schemat architektury sieci Swin-PSAxialNet. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.
W strukturze koderach tradycyjny blok Conv został połączony z blokiem SPD20 w celu utworzenia objętości podpróbkowanej. Pierwsza warstwa kodera zawiera Patch Embedding – moduł, który dzieli dane 3D na fragmenty (patche) 3D
, (P1, P2, P3) reprezentuje w tym kontekście niezachodzące na siebie fragmenty,
oznacza długość sekwencji fragmentów 3D (patchy). Po warstwie osadzania (embedding layer) kolejnym krokiem jest jednostka zmniejszająca próbkowanie splotowe bez nakładania się, składająca się z bloku splotowego oraz bloku SPD. W tej konfiguracji blok splotowy ma ustawiony krok (stride) równy 1, a blok SPD służy do skalowania obrazu, co prowadzi do czterokrotnej redukcji rozdzielczości i dwukrotnego zwiększenia liczby kanałów.
W strukturze dekodera każdy blok upsamplingu po warstwie Bottleneck Feature składa się z kombinacji bloku upsamplingu i bloku PSAA. Rozdzielczość mapy cech jest dwukrotnie zwiększana, a liczba kanałów zmniejszana o połowę pomiędzy każdą parą etapów dekodera. W celu przywrócenia informacji przestrzennych i poprawy reprezentacji cech, pomiędzy blokami upsamplingu przeprowadza się fuzję cech obrazów o dużej i małej skali. Ostatecznie wyniki upsamplingu są przekazywane do warstwy Head w celu przywrócenia oryginalnego rozmiaru obrazu, z rozmiarem wyjściowym (H × W × D × C, C = 3).
Architektura bloku SPD
W tradycyjnych metodach sekcja downsamplingu wykorzystuje pojedynczy krok o rozmiarze 2. Wiąże się to z pulowaniem splotowym w lokalnych pozycjach obrazu, co ogranicza pole recepcyjne i zmusza model do ekstrakcji cech z niewielkich fragmentów obrazu. Metoda ta wykorzystuje blok SPD, który precyzyjnie dzieli oryginalny obraz na trzy wymiary. Oryginalny obraz 3D jest równomiernie segmentowany wzdłuż osi x, y i z, co skutkuje powstaniem czterech podobjętości (Rysunek 2). Następnie cztery objętości są łączone za pomocą operacji „cat”, a otrzymany obraz poddawany jest splotowi 1 × 1 × 1 w celu uzyskania obrazu po downsamplingu20.

Rysunek 2Schemat blokowy SPD. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Architektura bloku PSAA
W przeciwieństwie do tradycyjnych sieci CNN, proponowany blok PSAA jest bardziej efektywny w koncentrowaniu informacji globalnych oraz wydajniejszy w procesie uczenia i trenowania sieci. Pozwala to na przechwycenie bogatszych cech obrazów i cech przestrzennych. Blok PSAA obejmuje uczenie uwagi osiowej (axial attention) oparte na współdzieleniu parametrów w trzech wymiarach: wysokości, szerokości i głębokości. W porównaniu do konwencjonalnego mechanizmu uwagi, który przeprowadza uczenie uwagi dla każdego piksela obrazu, metoda ta niezależnie realizuje uczenie uwagi dla każdego z trzech wymiarów, co redukuje złożoność samo-uwagi (self-attention) z kwadratowej do liniowej. Ponadto zastosowano mechanizm współdzielenia parametrów kluczy-zapytań (keys-queries) z możliwością uczenia, co pozwala sieci na równoległe wykonywanie operacji mechanizmu uwagi w trzech wymiarach, prowadząc do szybszej, lepszej i bardziej efektywnej reprezentacji cech.