Artykuł metodologiczny

Swin-PSAxialNet: skuteczna technika segmentacji wielonarządowej

DOI:

10.3791/66459

5 lipca 2024

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół opisuje wydajną metodę segmentacji wielonarządowej o nazwie Swin-PSAxialNet, która osiągnęła doskonałą dokładność w porównaniu z poprzednimi metodami segmentacji. Kluczowe kroki tej procedury obejmują zbieranie zestawów danych, konfigurację środowiska, wstępne przetwarzanie danych, trenowanie i porównywanie modeli oraz eksperymenty ablacyjne.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentacja wielonarządowa jamy brzusznej jest jednym z najważniejszych tematów w dziedzinie analizy obrazów medycznych i odgrywa ważną rolę we wspieraniu klinicznych przepływów pracy, takich jak diagnozowanie chorób i planowanie leczenia. W niniejszej pracy zaproponowano wydajną metodę segmentacji wielonarządowej o nazwie Swin-PSAxialNet opartą na architekturze nnU-Net. Został zaprojektowany specjalnie do precyzyjnej segmentacji 11 narządów jamy brzusznej na obrazach TK. Proponowana sieć wprowadziła następujące ulepszenia w porównaniu z nnU-Net. Po pierwsze, wprowadzono moduły SPD (Space-to-depth) i bloki ekstrakcji cech PSAA (Sharement-shared axial attention), zwiększając możliwości ekstrakcji cech obrazu 3D. Po drugie, zastosowano wieloskalowe podejście do fuzji obrazów w celu uchwycenia szczegółowych informacji i cech przestrzennych, poprawiając możliwości wyodrębniania subtelnych cech i cech krawędziowych. Na koniec wprowadzono metodę współdzielenia parametrów w celu zmniejszenia kosztów obliczeniowych modelu i szybkości trenowania. Proponowana sieć osiąga średni współczynnik Dice'a wynoszący 0,93342 dla zadania segmentacji obejmującego 11 narządów. Wyniki eksperymentalne wskazują na znaczną wyższość Swin-PSAxialNet nad poprzednimi metodami segmentacji głównego nurtu. Metoda wykazuje doskonałą dokładność i niskie koszty obliczeniowe w segmentacji głównych narządów jamy brzusznej.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Współczesna interwencja kliniczna, obejmująca diagnozowanie chorób, formułowanie planów leczenia i śledzenie wyników leczenia, opiera się na dokładnej segmentacji obrazów medycznych1. Jednak złożone relacje strukturalne między narządami jamy brzusznej2sprawiają, że osiągnięcie dokładnej segmentacji wielu narządów jamy brzusznej3 jest trudnym zadaniem. W ciągu ostatnich kilku dekad rozkwit obrazowania medycznego i widzenia komputerowego stworzył zarówno nowe możliwości, jak i wyzwania w dziedzinie segmentacji wielonarządowej jamy brzusznej. Zaawansowana technologia rezonansu magnetycznego (MRI)4 i tomografii komputerowej (CT)5 umożliwia nam uzyskanie obrazów jamy brzusznej w wysokiej rozdzielczości. Precyzyjna segmentacja wielu narządów na podstawie obrazów tomografii komputerowej ma istotną wartość kliniczną dla oceny i leczenia ważnych narządów, takich jak wątroba, nerki, śledziona, trzustka itp.6,7,8,9,10 Jednak ręczne opisywanie tych struktur anatomicznych, zwłaszcza tych wymagających interwencji radiologów lub radioonkologów, jest zarówno czasochłonne, jak i podatne na wpływy subiektywne 11. W związku z tym istnieje pilna potrzeba opracowania zautomatyzowanych i dokładnych metod segmentacji wielonarządowej jamy brzusznej.

Wcześniejsze badania nad segmentacją obrazów opierały się głównie na konwolucyjnych sieciach neuronowych (CNN), które poprawiają wydajność segmentacji poprzez układanie warstw i wprowadzenie ResNet12. W 2020 r. zespół badawczy Google wprowadził model Vision Transformer (VIT)13, który stanowi pionierski przykład włączenia architektury Transformer do tradycyjnej domeny wizualnej w celu wykonania szeregu zadań wizualnych14. Podczas gdy operacje konwolucyjne mogą uwzględniać tylko lokalne informacje o cechach, mechanizm uwagi w Transformers umożliwia kompleksowe uwzględnienie globalnych informacji o cechach.

Biorąc pod uwagę wyższość architektur opartych na transformatorach nad tradycyjnymi sieciami konwolucyjnymi15, liczne zespoły badawcze podjęły szeroko zakrojone badania nad optymalizacją synergii między mocnymi stronami transformatorów a sieciami konwolucyjnymi 16,17,18,19. Chen i in. wprowadzili TransUNet do zadań segmentacji obrazów medycznych16, który wykorzystuje Transformers do wyodrębniania globalnych cech z obrazów. Ze względu na wysokie koszty szkolenia sieci i brak wykorzystania koncepcji hierarchii ekstrakcji cech, zalety Transformera nie zostały w pełni wykorzystane.

Aby rozwiązać te problemy, wielu badaczy zaczęło eksperymentować z włączeniem transformatorów jako szkieletu do trenowania sieci segmentacji. Liu i wsp.17 wprowadzili transformator Swin, który wykorzystywał hierarchiczną metodę konstrukcyjną do ekstrakcji cech warstwowych. Zaproponowano koncepcję wielogłowicowej samouwagi systemu Windows (W-MSA), która znacznie zmniejszyła koszty obliczeń, szczególnie w przypadku większych map obiektów na płytkim poziomie. Podejście to zmniejszyło wymagania obliczeniowe, ale jednocześnie odizolowało transmisję informacji między różnymi oknami. Aby rozwiązać ten problem, autorzy wprowadzili koncepcję wielogłowicowej uwagi (Shifted Windows, Multi-Head Self-Attention, SW-MSA), umożliwiającą propagację informacji między sąsiednimi oknami. Opierając się na tej metodologii, Cao i in. sformułowali Swin-UNet18, zastępując konwolucje 2D w U-Net modułami Swin i włączając W-MSA i SW-MSA do procesów kodowania i dekodowania, osiągając godne pochwały wyniki segmentacji.

Z kolei Zhou i in. podkreślili, że nie można ignorować zalet operacji konw. podczas przetwarzania obrazów o wysokiej rozdzielczości19. Proponowany przez nich nnFormer wykorzystuje metodę obliczania samouwagi opartą na lokalnych trójwymiarowych blokach obrazu, stanowiących model transformera charakteryzujący się strukturą w kształcie krzyża. Wykorzystanie uwagi w oparciu o lokalne bloki trójwymiarowe znacznie zmniejszyło obciążenie sieci związane z trenowaniem.

Biorąc pod uwagę problemy związane z powyższym badaniem, zaproponowano wydajną hybrydową strukturę hierarchiczną do segmentacji obrazów medycznych 3D, nazwaną Swin-PSAxialNet. Ta metoda obejmuje blok próbkowania w dół, blok SPD (Space-to-depth)20 , zdolny do wyodrębniania informacji globalnych21. Dodatkowo dodaje moduł współdzielonej uwagi osiowej (PSAA), który zmniejsza liczbę parametrów uczenia się z kwadratowej na liniową i będzie miał dobry wpływ na dokładność trenowania sieci i złożoność modeli treningowych22.

Sieć Swin-PSAxialNet
Ogólna architektura sieci przyjmuje strukturę nnU-Net23 w kształcie litery U, składającą się ze struktur kodera i dekodera. Struktury te angażują się w ekstrakcję cech lokalnych i konkatenację cech z obrazów w dużej i małej skali, jak pokazano na rysunku 1.

figure-introduction-1
Rysunek 1: Schemat ideowy architektury sieci Swin-PSAxialNet. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

W strukturze enkodera tradycyjny blok Conv jest łączony z blokiem SPD20 w celu utworzenia objętości próbkowania w dół. Pierwsza warstwa kodera zawiera Patch Embedding, moduł, który dzieli dane 3D na łaty figure-introduction-23D , (P1, P2, P3) reprezentuje w tym kontekście nienakładające się łaty, figure-introduction-3 oznacza długość sekwencji łat 3D. Po warstwie osadzania, następnym krokiem jest nienakładająca się konwolucyjna jednostka próbkowania w dół, składająca się zarówno z bloku konwolucyjnego, jak i bloku SPD. W tej konfiguracji blok konwolucyjny ma krok ustawiony na 1, a blok SPD jest używany do skalowania obrazu, co prowadzi do czterokrotnego zmniejszenia rozdzielczości i dwukrotnego zwiększenia kanałów.

W strukturze dekodera każdy blok upsamplingu po warstwie Bottleneck Feature składa się z kombinacji bloku upsamplingu i bloku PSAA. Rozdzielczość mapy funkcji jest zwiększona dwukrotnie, a liczba kanałów jest zmniejszona o połowę między każdą parą stopni dekodera. Aby przywrócić informacje przestrzenne i poprawić reprezentację obiektów, między blokami upsamplingu przeprowadzana jest fuzja cech między dużymi i małymi obrazami. Ostatecznie wyniki upsamplingu są wprowadzane do warstwy Head w celu przywrócenia oryginalnego rozmiaru obrazu, z rozmiarem wyjściowym (H × W × D × C, C = 3).

Architektura blokowa SPD
W tradycyjnych metodach sekcja próbkowania w dół wykorzystuje pojedynczy krok o wielkości kroku 2. Wiąże się to z konwolucyjnym łączeniem w lokalnych pozycjach obrazu, ograniczaniem pola recepcyjnego i ograniczaniem modelu do ekstrakcji cech z małych plam obrazu. Ta metoda wykorzystuje blok SPD, który precyzyjnie dzieli oryginalny obraz na trzy wymiary. Oryginalny obraz 3D jest równomiernie podzielony wzdłuż osi x, y i z, co daje w wyniku cztery bryły podobjętościowe. (Rysunek 2) Następnie cztery tomy są łączone za pomocą operacji "cat", a wynikowy obraz jest poddawany konwolucji 1 × 1 × 1 w celu uzyskania obrazu20 próbkowanego w dół.

figure-introduction-4
Rysunek 2: Schemat blokowy SPD. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Architektura blokowa PSAA
W przeciwieństwie do tradycyjnych sieci CNN, proponowany blok PSAA jest bardziej skuteczny w prowadzeniu globalnej koncentracji informacji i bardziej wydajny w uczeniu się i szkoleniu sieci. Umożliwia to rejestrowanie bogatszych obrazów i cech przestrzennych. Blok PSAA obejmuje osiowe uczenie uwagi oparte na współdzieleniu parametrów w trzech wymiarach: wysokości, szerokości i głębokości. W porównaniu z konwencjonalnym mechanizmem uwagi, który przeprowadza uczenie uwagi dla każdego piksela obrazu, ta metoda niezależnie przeprowadza uczenie uwagi dla każdego z trzech wymiarów, zmniejszając złożoność uwagi z kwadratowej do liniowej. Co więcej, zastosowano możliwy do nauczenia się mechanizm współdzielenia parametrów kluczy i zapytań, dzięki czemu sieć może wykonywać operacje mechanizmu uwagi równolegle w trzech wymiarach, co skutkuje szybszą, lepszą i bardziej efektywną reprezentacją funkcji.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół został zatwierdzony przez Komisję Etyki Uniwersytetu w Nantong. Polega na inteligentnej ocenie i badaniu pozyskanych nieinwazyjnych lub minimalnie inwazyjnych danych multimodalnych, w tym obrazów medycznych ludzi, ruchów kończyn i obrazowania naczyniowego, z wykorzystaniem technologii sztucznej inteligencji. Rysunek 3 przedstawia ogólny schemat segmentacji wielonarządowej. Wszystkie niezbędne linki internetowe znajdują się w Tabeli Materiałów.

figure-protocol-1
Rysunek 3: Ogólny schemat blokowy segmentacji wielonarządowej. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

1. Gromadzenie zbiorów danych

  1. Pobierz zestaw danych AMOS202224 (zob. Spis materiałów).
  2. Wybierz 160 obrazów jako zestaw danych treningowych i 40 obrazów jako zestaw danych testowych.
  3. Terminalnie wykonaj mkdir ~/PaddleSeg/contrib/MedicalSeg/data/raw_data.
  4. Otwórz ścieżkę raw_data.
  5. Umieść zestaw danych w katalogu raw_data i upewnij się, że są one poprawne i zgodne z nazwami plików w katalogach "imagesTr" i "labelsTr".
  6. Utwórz plik dataset.json .
  7. Dodaj informacje o zestawie danych, takie jak numTraining, numTest i nazwa etykiet, do pliku "dataset.json".
    UWAGA: Zestaw danych dla tego badania składa się z 200 wysokiej jakości zestawów danych CT wybranych z AMOS2022 oficjalnego zestawu danych 500 CT do celów szkoleniowych i testowych. Zestaw danych obejmuje 11 narządów, w tym śledzionę, prawą nerkę, lewą nerkę, pęcherzyk żółciowy, przełyk, wątrobę, żołądek, aortę, żyłę główną dolną, trzustkę i pęcherz moczowy.

2. Konfiguracja środowiska

  1. Zainstaluj środowisko Paddlepaddle (patrz Tabela materiałów) i odpowiednią wersję CUDA25.
    UWAGA: Zaleca się korzystanie z Paddlepaddle w wersji 2.5.0 i CUDA w wersji 11.7.
  2. Git sklonował repozytorium PaddleSeg25.
  3. Wykonaj terminalnie cd ~/PaddleSeg/contrib/MedicalSeg/.
  4. Wykonaj polecenie install -r requirements.txt.
  5. Wykonaj polecenie install medpy.

3. Wstępne przetwarzanie danych

  1. Zmodyfikuj plik "yml", w tym parametry, takie jak data_root, batch_size, model, train_dataset, val_dataset, optymalizator, lr_scheduler i strata.
  2. Określ wymagane parametry do wykonania, w tym "-config, --log_iters, --precision, --nnunet, --save_dir, --save_interval itd.
    UWAGA: Oryginalny plik "raw_data" jest przekształcany w trzy typy plików danych: "Przycięte", "Decathlon" i "Wstępnie przetworzone", spełniające różne wymagania dotyczące trenowania i oceny w celu zwiększenia wydajności modelu i efektywności szkolenia.

4. Trenowanie i porównywanie modeli

UWAGA: Jako szeroko stosowany punkt odniesienia w dziedzinie segmentacji obrazu, nnU-Net23 służy jako model bazowy w badaniu. Konkretny proces porównywania modeli jest następujący.

  1. Pociąg nnU-Net
    1. Konfiguruj z rozmiarem partii 2 i 80 000 iteracji, rejestruj co 20 iteracji i wykorzystuj precyzję fp16.
    2. Ustaw save_dir jako folder "wyjściowy" w katalogu roboczym, z interwałem zapisywania ustawionym na 1,000 iteracji.
    3. Dodaj parametr --use_vdl do wizualizacji parametrów VisualDL.
    4. Uruchom train.py.
    5. Utwórz cztery pliki yml , określ fałdy 1–4 i wytrenuj model przy użyciu pięciokrotnej krzyżowej walidacji.
  2. Pociąg Swin-UNet
    1. Zachowaj spójność z wcześniej ustalonymi warunkami eksperymentalnymi.
    2. Usuń parametr --nnunet i użyj --swinunet.
    3. Uruchom plik train.py.
    4. Pociąg składa się od 1 do 4 pojedynczo, a następnie poddaje obróbce zespołowej.
  3. Pociąg TransUNet
    1. Postępuj zgodnie z procedurami opisanymi w kroku 4.1.
    2. Otwórz plik yml .
    3. Zmień type: nnunet na typ: transunet.
    4. Zmodyfikuj parametr --nnunet na --transunet.
    5. Uruchom plik train.py.
    6. Pociąg składa 1-4 indywidualnie i przetwarza przetwarzanie zespołowe.
  4. Pociąg UNETR
    1. Utrzymuj spójne zmienne eksperymentalne.
    2. Powtórz opisane wcześniej procedury, takie jak Swin-UNet i TransUNet (krok 4.2 i krok 4.3).
    3. Uruchom train.py.
    4. Pociąg składa 1-4 indywidualnie i przetwarza przetwarzanie zespołowe.
  5. Pociąg nnFormer
    1. Zmodyfikuj parametry, takie jak Swin-UNet i TransUNet.
    2. Uruchamianie pojedynczego składania train.py.
    3. Uruchom przetwarzanie zespołu.

5. Eksperyment z ablacją

  1. Blok PSAA dla całej sieci
    1. Zachowaj spójność zmiennych z krokiem 4.1.
    2. Ustaw volume_shape = (64 192 192) i Axial_attention = Prawda.
    3. Uruchamianie pojedynczego składania train.py.
    4. Przetwarzanie zespołu procesowego w pięciu składaniach.
  2. Blok SPD dla całej sieci
    1. Zachowaj spójność zmiennych z krokiem 4.1.
    2. Ustaw SPD_enable = Prawda i Axial_attention = Fałsz.
    3. Uruchamianie pojedynczego składania train.py.
    4. Przetwarzanie zespołu procesowego w pięciu składaniach.
  3. Blok PSAA do upsamplingu
    UWAGA: Nie używaj bloku SPD do zmniejszania próbkowania.
    1. Użyj bloku PSAA do próbkowania w górę.
    2. Zachowaj spójność zmiennych z krokiem 4.1.
    3. Ustaw Axial_attention = False w części próbkowania w dół , a SPD_enable = False.
    4. Uruchom train.py składania pojedynczego.
    5. Przetwarzaj pięciokrotne przetwarzanie zespołowe.
  4. Blok PSAA do upsamplingu
    UWAGA: Użyj bloku SPD do próbkowania w dół.
    1. Użyj bloku SPD do próbkowania w dół i bloku PSAA do próbkowania w górę.
    2. Zachowaj spójność zmiennych z krokiem 4.1.
    3. Ustaw Axial_attention = False w części dotyczącej próbkowania w dół, a SPD_enable = True.
    4. Uruchamianie pojedynczego składania train.py.
    5. Przetwarzaj pięciokrotne przetwarzanie zespołowe.
    6. Ustaw liczbę iteracji na 2 000 000 ze względu na lepsze wyniki.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten wykorzystuje dwie metryki do oceny modelu: Dice Similarity Score (DSC) i 95% Hausdorff Distance (HD95). DSC mierzy nakładanie się przewidywań segmentacji wokseli i prawdy podstawowej, podczas gdy 95% HD ocenia nakładanie się granic przewidywania segmentacji wokseli i prawdy podstawowej, odfiltrowując 5% wartości odstających. Definicja DSC26 jest następująca:

figure-results-1      (1)

Gdzie T i P reprezentują odpowiednio podstawowe wartości prawdy i wartości przewidywane dla wszystkich wokseli. Definicja 95% HD26 jest następująca:

figure-results-2      (2)

Gdzie d T,P jest 95. percentylem maksymalnej odległości HD95 między prawdą podstawową a przewidywanymi wokselami, a d T,P oznacza 95. percentyl odległości maksymalnej HD95 między przewidywanymi wokselami a prawdą podstawową.

Swin-PSAxialNet porównano z różnymi popularnymi algorytmami segmentacji wielonarządowej w Tabeli 1. Wyniki wskazują na poprawę wydajności segmentacji narządów jamy brzusznej w proponowanym algorytmie. Dokładność kości w metodzie segmentacji przewyższa średnią wartość kości innych metod o 2-3 punkty procentowe, a nawet przewyższa nnFormer o 1 punkt procentowy. Swin-PSAxialNet wykazuje również wysoką dokładność w segmentacji granic, ze średnim współczynnikiem HD95 wynoszącym 5,63, najniższym spośród wszystkich porównywanych algorytmów.

MetodyLkn powiedział:SplLivPatelniaAroBlaStoGbd (Gbd)Poz.EsoKsięga RknAvg
DSCDysk HD95
nnU-Net96.396.897.2185.295.2286.5791.4784.791.7982.595.4491.27.13
Swin-Unet96.0396.6897.2285.7495.387.8291.7784.6491.6783.2696.1491.489.68
TransUNet96.4296.7497.0585.0994.8685.291.8183.3391.5282.2296.1290.9413.77
Międzynarodowa Organizacja Narodów Zjednoczonych ds. Współpracy (95.9496.4896.8584.1494.6285.0190.1881.1690.7980.3495.1590.0612.92
nnFormer96.5997.2297.3386.7995.3189.7492.8284.8892.4384.2496.3292.156.59
Swin-PSAxialNet96.8597.6797.6488.3995.9792.0394.487.7893.1586.2496.5993.345.63

Tabela 1: Porównanie głównych algorytmów segmentacji. Skróty oznaczają następujące narządy: Lkn dla lewej nerki, Spl dla śledziony, Liv dla wątroby, Pan dla trzustki, Aro dla aorty, Bla dla pęcherza, Sto dla żołądka, Gbd dla pęcherzyka żółciowego, Pos dla postcava, Eso dla przełyku, Rkn dla prawej nerki i DSC dla średniego współczynnika Dice, HD95 dla średniej 95% odległości Hausdorffa.

Co więcej, wprowadzenie mechanizmu współdzielenia parametrów i ulepszenia struktury transformatora zapewniają znaczące korzyści zarówno pod względem złożoności modelu, jak i szybkości wnioskowania (tabela 2, rysunek 4 i rysunek 5).

ModeleParametry (M)Płyty FLOP (G)Czas wnioskowania (s)
nn-Unet17.96398.549.07
Międzynarodowa Organizacja Narodów Zjednoczonych ds. Współpracy (89.5839.6712.51
nnFormer134.78152.4311.24
Swin-PSAxialNet37.6443.1510.31

Tabela 2: Tabela porównawcza wskaźników modelu sieci.

figure-results-3
Rysunek 4: Krzywa zmienności kości sieci treningowej modelu. (A) Bieżąca sieć. (B) nnFormer. (C) Sieć nnU-Net. d) UNETR. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-4
Rysunek 5: Porównanie wyników trenowania modelu. Na rysunku przedstawiono wyniki obecnej sieci, wyniki nnFormer, wyniki nnU-Net oraz wyniki UNETR. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

W badaniu tym przeprowadzono kompleksowe eksperymenty ablacyjne w sieci algorytmów, wykorzystując blok PSAA i blok SPD jako zmienne oraz porównując trening jednokrotny z pięciokrotnym. Współczynniki kości z wyników eksperymentalnych przedstawiono w tabeli 3. Wyniki te pokazują, że wykorzystanie bloku SPD do próbkowania w dół i bloku PSAA do zwiększania próbkowania skutecznie zwiększa wydajność segmentacji w porównaniu z niezmodyfikowanym nnU-Net (ilustracja 6).

ModeleBlok PSAA dla całej sieciBlok SPD dla całej sieciBlok PSAA tylko do upsamplinguBlok PSAA do upsamplingu, użyj SPD
Szkolenie jednokrotne92.1790.5192.2492.39
Pięciokrotne szkolenie92.8291.2692.7993.34

Tabela 3: Wyniki eksperymentu ablacyjnego Swin-PSAxialNet. Przedstawiono wyniki eksperymentu ablacyjnego Swin PSAxialNet. W eksperymencie ablacyjnym porównano użycie PSAA Block i SPD Block, a wyniki treningu DSC przedstawiono w tabeli.

figure-results-5
Rysunek 6: Wyniki segmentacji. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentacja narządów jamy brzusznej to skomplikowana praca. W porównaniu z innymi wewnętrznymi strukturami ludzkiego ciała, takimi jak mózg czy serce, segmentacja narządów jamy brzusznej wydaje się trudniejsza ze względu na niski kontrast i duże zmiany kształtu w obrazach TK27,28. W celu rozwiązania tego trudnego problemu zaproponowano tutaj Swin-PSAxialNet.

Na etapie zbierania danych w ramach tego badania pobrano 200 obrazów z oficjalnej strony internetowej AMOS202224. Na etapie konfiguracji środowiska konfiguracja eksperymentalna obejmowała środowisko Paddlepaddle wraz z odpowiadającą mu wersją CUDA. Na etapie wstępnego przetwarzania danych zastosowano losowe przycinanie i losowe przerzucanie w celu zwiększenia niezawodności danych. W krokach trenowania i porównywania modelu, w oparciu o model bazowy nnU-Net, w eksperymencie dodano blok SPD do próbkowania w dół i blok ekstrakcji cech PSAA do próbkowania w górę, osiągając doskonałe wyniki segmentacji. Swin-PSAxialNet porównano z różnymi popularnymi modelami segmentacji i uzyskano obiecujące wyniki na publicznym zbiorze danych AMOS2022. Osiągnięto wyższą dokładność segmentacji niż inne metody segmentacji wymienione w tym badaniu 16,17,18,19. W części dotyczącej eksperymentu ablacyjnego użycie bloku PSAA i bloku SPD zostało zróżnicowane w celu znalezienia optymalnej sieci segmentacji. Wyniki eksperymentu ablacyjnego wskazały, że użycie modułu PSAA tylko do upsamplingu pozwala osiągnąć o jeden punkt procentowy więcej niż użycie go dla całej sieci.

Innowacje tego badania są następujące: Po pierwsze, moduł SPD jest włączony do sieci, aby stanowić jednostkę próbkowania w dół obok bloku Conv, zwiększając w ten sposób możliwości ekstrakcji cech sieci. Po drugie, wprowadzenie bloku ekstrakcji cech PSAA skutecznie zmniejsza złożoność sieci, jednocześnie poprawiając dokładność trenowania. Wreszcie, wprowadzenie mechanizmu współdzielenia parametrów znacznie zmniejsza złożoność modelu treningowego.

To badanie ma ograniczenia w następujących aspektach: Zostało ono zastosowane tylko do AMOS2022 zbioru danych, a wyniki nie zostały zweryfikowane na innych zestawach danych. Ponownie, chociaż nnU-Net osiągnął wysoką wydajność w zadaniach segmentacji narządów jamy brzusznej po serii optymalizacji jako zautomatyzowana struktura segmentacji, niektóre parametry nadal mają pewien stopień subiektywizmu, takie jak początkowa szybkość uczenia się, liczba iteracji, architektura sieci itp. Przyszłe badania będą dotyczyły metod automatycznego obliczania tych parametrów29.

W ramach projektu Swin-PSAxialNet osiągnięto doskonałe wyniki segmentacji w zadaniach związanych z segmentacją narządów jamy brzusznej, wykazując duże możliwości uogólniania i stabilność. W przyszłych badaniach zostaną wykorzystane dodatkowe zestawy danych w celu dalszego zbadania możliwości uogólnienia algorytmu i wprowadzenia poprawek do modelu. Co więcej, struktura algorytmu może być poddawana dalszej optymalizacji w celu zwiększenia ogólnej dokładności i solidności sieci. Celem jest zintegrowanie sieci z możliwościami multimodalnymi w celu przekształcenia jej w medyczny model multimodalny.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak konfliktu interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie to było wspierane przez Projekt Inżynieryjny "333" prowincji Jiangsu ([2022]21-003), Program Ogólny Komisji Zdrowia Wuxi (M202205) oraz Fundusz Rozwoju Nauki i Technologii Wuxi (Y20212002-1), których wkład był nieoceniony dla sukcesu tej pracy". Autorzy dziękują wszystkim asystentom naukowym i uczestnikom badania za ich wsparcie.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AMOS2022 zestaw danychŻadenŻadenZestawy danych do trenowania i testowania sieci. Link do strony internetowej: https://pan.baidu.com/s/1x2ZW5FiZtVap0er55Wk4VQ?pwd=xhpb
Komputer mainframe ASUSASUS (Międzynarodowa Sieć AShttps://www.asusparts.eu/en/asus-13020-01910200
CUDA w wersji 11.7Technologia NVIDIAhttps://developer.nvidia.com/cuda-11-7-0-download-archive
NVIDIA GeForce RTX 3090Technologia NVIDIAhttps://www.nvidia.com/en-in/geforce/graphics-cards/30-series/rtx-3090-3090ti/
Środowisko wiosła Baidu (Język baiduŻadenPrzygotowanie środowiskowe do szkolenia sieciowego. Link do strony internetowej: https://www.paddlepaddle.org.cn/
Wiosło SegBaidu (Język baiduŻadenLinia bazowa, której używamy: https://github.com/PaddlePaddle/PaddleSeg

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Liu, X., Song, L., Liu, S., Zhang, Y. A review of deep-learning-based medical image segmentation methods. Sustain. 13 (3), 1224(2021).
  2. Popilock, R., Sandrasagaren, K., Harris, L., Kaser, K. A. CT artifact recognition for the nuclear technologist. J Nucl Med Technol. 36 (2), 79-81 (2008).
  3. Rehman, A., Khan, F. G. A deep learning based review on abdominal images. Multimed Tools Appl. 80, 30321-30352 (2021).
  4. Schenck, J. F. The role of magnetic susceptibility in magnetic resonance imaging: Mri magnetic compatibility of the first and second kinds. Med Phys. 23 (6), 815-850 (1996).
  5. Palmisano, A., et al. Myocardial late contrast enhancement ct in troponin-positive acute chest pain syndrome. Radiol. 302 (3), 545-553 (2022).
  6. Chen, E. -L., Chung, P. -C., Chen, C. -L., Tsai, H. -M., Chang, C. -I. An automatic diagnostic system for CT liver image classification. IEEE Trans Biomed Eng. 45 (6), 783-794 (1998).
  7. Sagel, S. S., Stanley, R. J., Levitt, R. G., Geisse, G. J. R. Computed tomography of the kidney. Radiol. 124 (2), 359-370 (1977).
  8. Freeman, J. L., Jafri, S., Roberts, J. L., Mezwa, D. G., Shirkhoda, A. CT of congenital and acquired abnormalities of the spleen. Radiographics. 13 (3), 597-610 (1993).
  9. Almeida, R. R., et al. Advances in pancreatic CT imaging. AJR Am J Roentgenol. 211 (1), 52-66 (2018).
  10. Eisen, G. M., et al. Guidelines for credentialing and granting privileges for endoscopic ultrasound. Gastrointest Endosc. 54 (6), 811-814 (2001).
  11. Sykes, J. Reflections on the current status of commercial automated segmentation systems in clinical practice. J Med Radiat Sci. 61 (3), 131-134 (2014).
  12. He, K., Zhang, X., Ren, S., Sun, J. Deep residual learning for image recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). , Vegas, NV, USA. 770-778 (2016).
  13. Dosovitskiy, A., et al. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv. arXiv. , 11929(2020).
  14. Ramachandran, P., et al. Stand-alone self-attention in vision models. Adv Neural Inf Process Syst. 32, NIPS2019 (2019).
  15. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, NIPS2019 (2017).
  16. Chen, J., et al. TransUNET: Transformers make strong encoders for medical image segmentation. arXiv. , arXiv:2102 04396(2021).
  17. Liu, Z., et al. Swin transformer: Hierarchical vision transformer using shifted windows. Proc IEEE Int Conf Comput Vis. , 10012-10022 (2021).
  18. Cao, H., et al. Swin-UNET: Unet-like pure transformer for medical image segmentation. Comput Vis ECCV. , 205-218 (2022).
  19. Zhou, H. -Y., et al. nnformer: Interleaved transformer for volumetric segmentation. arXiv. arXiv. , arXiv:2109 03201(2021).
  20. Sunkara, R., Luo, T. No more strided convolutions or pooling: A new CNN building block for low-resolution images and small objects. Mach Learn Knowl Discov Databases. , 443-459 (2023).
  21. Çiçek, Ö, Abdulkadir, A., Lienkamp, S. S., Brox, T., Ronneberger, O. 3D U-Net: learning dense volumetric segmentation from sparse annotation. Med Comput Vis Bayesian Graph Models Biomed Imaging. 2016, 424-432 (2016).
  22. Kim, H., et al. Abdominal multi-organ auto-segmentation using 3D-patch-based deep convolutional neural network. Scientific reports. 10 (1), 6204(2020).
  23. Isensee, F., et al. nnu-net: Self-adapting framework for u-net-based medical image segmentation. arXiv. , arXiv:1809 10486(2018).
  24. Ji, Y., et al. A large-scale abdominal multi-organ benchmark for versatile medical image segmentation. Adv Neural Inf Process Syst. 35, 36722-36732 (2022).
  25. Liu, Y., et al. Paddleseg: A high-efficient development toolkit for image segmentation. arXiv. , arXiv:2101 06175(2021).
  26. Hatamizadeh, A., et al. UNETR: Transformers for 3D medical image segmentation. Proc IEEE Int Conf Comput Vis. , https://api.semanticscholar.org/CorpusID:232290634 574-584 (2022).
  27. Zhou, H., Zeng, D., Bian, Z., Ma, J. A semi-supervised network-based tissue-aware contrast enhancement method for ct images. Nan Fang Yi Ke Da Xue Xue Bao. 43 (6), 985-993 (2023).
  28. Ma, J., et al. Abdomenct-1k: Is abdominal organ segmentation a solved problem. IEEE Trans Pattern Anal Mach Intell. 44 (10), 6695-6714 (2021).
  29. Galván, E., Mooney, P. Neuroevolution in deep neural networks: Current trends and future challenges. IEEE Trans Artif Intell. 2 (6), 476-493 (2021).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Segmentacja narz d w jamy brzusznejanaliza obraz w medycznychsegmentacja obraz w CTarchitektura nnU Netmodu Space To Depthuwaga osiowawieloskalowe czenie obraz wwsp czynnik Dice a

Powiązane artykuły