To badanie przedstawia lekki wariant U-Net z poprawioną dokładnością segmentacji przy użyciu hybrydowej konwolucji i uwagi kanałów, osiągając najnowocześniejsze wyniki na MoNuseg i GlaS przy mniejszej liczbie parametrów.
Artykuł metodologiczny
To badanie przedstawia lekki wariant U-Net z poprawioną dokładnością segmentacji przy użyciu hybrydowej konwolucji i uwagi kanałów, osiągając najnowocześniejsze wyniki na MoNuseg i GlaS przy mniejszej liczbie parametrów.
Technologia przetwarzania obrazów komputerowych oparta na sztucznej sieci neuronowej szybko się rozwinęła w ostatnich latach i znalazła szerokie zastosowanie w wielu dziedzinach. W przetwarzaniu obrazów medycznych UNet i jego warianty wykazały duży sukces w wykrywaniu zmian, segmentacji komórek i segmentacji polipów. Niniejsze badanie przedstawia zmodyfikowaną sieć w kształcie litery U ze zmniejszonymi parametrami sieci uzyskanymi poprzez zmniejszenie głębokości sieci i zwiększenie kanałów sieci w celu zwiększenia zdolności uczenia się modelu. Aby przeciwdziałać zmniejszeniu zdolności uczenia się spowodowanemu kompresją głębokości, wprowadzono moduł konwolucyjny kanału hybrydowego, który zastępuje moduł konwolucyjny oryginalnej sieci. Model wprowadza mechanizm uwagi kanału między warstwą a warstwą konwolucji punktowej, aby poprawić praktyczną zdolność ekstrakcji cech kanału. W artykule stwierdzono również, że użycie konwolucji o mieszanej głębokości może skutecznie rozwiązać problem rozpiętości rozmiaru celu segmentacji, co utrudnia dopasowanie jednego modelu do wielu zestawów danych. Proponowany model pozwala uzyskać najnowocześniejsze wyniki na dwóch popularnych publicznych zbiorach danych, MoNuseg i GlaS, ze średnim wzrostem liczby kości wynoszącym odpowiednio 1,0% i 1,37%. Łączna liczba parametrów zmodyfikowanego modelu została zmniejszona do 1,71 mln, co stanowi 38,6-krotną redukcję w porównaniu z UCtransNet, przy 65,6 mln parametrów.
Segmentacja obrazów medycznych jest kluczowa w różnych zastosowaniach klinicznych, w tym w diagnozie, planowaniu leczenia i monitorowaniu chorób. Tradycyjne metody przetwarzania obrazu oparte na algorytmach inżynierii cech nie są już odpowiednie do obsługi dużych ilości danych generowanych w nowoczesnych środowiskach opieki zdrowotnej. Na szczęście postęp technologii sztucznych sieci neuronowych i poprawa możliwości sprzętu komputerowego umożliwiły trenowanie i wdrażanie modeli sieci neuronowych na dużą skalę. W związku z tym algorytmy przetwarzania wizji komputerowej oparte na modelach uczenia maszynowego są stale rozwijane i stosowane w różnych dziedzinach.
Najbardziej reprezentatywną strukturą modelu w segmentacji semantycznej obrazów medycznych jest UNet1 z architekturą kodująco-dekodującą. Model najpierw używa kodera wielopoziomowego do wyodrębniania cech różnych skal z obrazu wejściowego. Następnie dekoder zwiększa próbkowanie krok po kroku, łącząc cechy semantyczne wyprowadzane przez koder odpowiedniego poziomu jako połączenie z pominięciem. Jednak wydajność architektury UNet można jeszcze poprawić, stosując kilka metod. Na przykład wykazano, że mechanizmy uwagi są skuteczne w zwiększaniu wydajności konwolucyjnych sieci neuronowych. Mechanizmy te mogą selektywnie podkreślać podstawowe cechy danych wejściowych, co prowadzi do lepszego uczenia się reprezentacji i dokładności segmentacji.
Obecnie wielu badaczy skupia się na skutecznym łączeniu cech wyodrębnionych przez koder na etapie dekodowania. Niektóre z najpopularniejszych wariantów UNet to Attention UNet2, Recurrent UNet3 i V-Net4. Podejścia te wykorzystują mechanizmy uwagi5, takie jak uwaga przestrzenna, w celu wyróżnienia regionów informacyjnych na mapach obiektów i pominięcia regionów nieinformacyjnych. Ponadto niektóre warianty zawierają rekurencyjne sieci neuronowe w celu modelowania sekwencyjnego charakteru obrazów medycznych i ulepszania reprezentacji cech. Modele przed trenowaniem, takie jak VGG6, ResNet7 i DenseNet8, są szeroko stosowane w celu poprawy wydajności sieci w kształcie litery U poprzez wykorzystanie ich bogatej wiedzy zdobytej na podstawie dużych zbiorów danych. Ponadto mechanizmy transformatorowe, takie jak samouwaga i uwaga wielogłowicowa, zostały wprowadzone do zależności modelu dalekiego zasięgu i przechwytują globalne informacje kontekstowe, co prowadzi do lepszej wydajności segmentacji.
Jednakże, mimo że te warianty są lepsze od oryginalnego UNet1, nadal mają pewne ograniczenia w obsłudze złożonych obrazów medycznych o różnych skalach i kształtach. Co więcej, zwiększona złożoność tych wariantów często prowadzi do wyższych kosztów obliczeniowych i dłuższego czasu szkolenia, co ogranicza ich zastosowanie w praktyce.
Aby ulepszyć architekturę UNet1, zaproponowano zmodyfikowany model o nazwie MixKNet (Mix Kernel Size U-shape Net), który zmniejsza głębokość sieci, jednocześnie zwiększając liczbę kanałów, aby poprawić zdolność uczenia się. Jednak zmniejszenie głębokości może prowadzić do spadku ogólnej wydajności. Aby złagodzić ten problem, wprowadzono hybrydowy moduł konwolucyjny, który zastępuje oryginalny konwolucyjny moduł neuronowy. Moduł ten zawiera mechanizm uwagi kanału między warstwami konwolucji głębokościowej i punktowej, mając na celu wzmocnienie zdolności modelu do wyodrębniania efektywnych cech kanału.
Aby wskazać praktyczne zastosowanie, ważne jest, aby zauważyć, że proponowana metoda została oceniona na stosunkowo małych zestawach danych obrazów medycznych, z indywidualnymi rozdzielczościami obrazów od 500 × 500 do 1000 × 1000 pikseli. Na potrzeby trenowania modelu wszystkie obrazy zostały przeskalowane na 224 × 224 piksele. Implementacja została przeprowadzona przy użyciu PyTorch na pojedynczym procesorze graficznym NVIDIA RTX 3090. Te parametry operacyjne sugerują, że metoda jest obliczeniowo wykonalna w przypadku umiarkowanych konfiguracji eksperymentalnych i można ją dostosować do ograniczonych rozmiarów zbiorów danych.
Podsumowując, ten artykuł przedstawia nowatorską modyfikację struktury sieci w kształcie litery U i wprowadza hybrydowy moduł konwolucji kanałów wraz z mechanizmem uwagi kanału, co poprawia wydajność segmentacji na zestawach danych obrazów medycznych. Główne wkłady tej pracy są następujące: (1) Zaproponowanie zmodyfikowanej struktury sieci w kształcie litery U z hybrydowym modułem konwolucji głębokiej sprężyny, który zastępuje oryginalny konwolucyjny moduł neuronowy. (2) Wprowadzenie mechanizmu uwagi kanału między warstwą konwolucyjną głębokiej i punktowej w celu poprawy efektywnej zdolności modelu do ekstrakcji cech kanału. (3) Osiągnięcie najnowocześniejszych wyników jednocześnie na dwóch popularnych publicznych zbiorach danych w zbiorze danych segmentacji jądrowej MoNuseg9 ze znacznie mniejszą liczbą parametrów modelu (w porównaniu z UCtransNet10 z parametrami 64M) i poprawioną wydajnością na zbiorze danych segmentacji gruczołów GlaS11.
Reszta tego artykułu jest zorganizowana w następujący sposób. Krok 2 zawiera obszerny przegląd wcześniejszych badań nad UNet1 i jego odmianami w segmentacji obrazów medycznych. Badane są mocne i słabe strony istniejących podejść, a także powiązane prace nad mechanizmami uwagi, sieciami konwolucyjnymi o mieszanej głębokości i ich zastosowaniami w modelach segmentacji. Krok 3 szczegółowo opisuje architekturę proponowanego modelu MixKNet, w tym modyfikacje struktury UNet, integrację mechanizmu uwagi kanału oraz użycie konwolucji o mieszanej głębokości. Krok 4 przedstawia wyniki szeroko zakrojonych eksperymentów, którym towarzyszy dyskusja i badanie ablacji w celu oceny wkładu każdego składnika. Wreszcie, krok 5 kończy artykuł i nakreśla potencjalne kierunki przyszłych badań.
Ta sekcja zaczyna się od przeglądu wcześniejszych badań nad UNet i jego wariantami w segmentacji obrazów medycznych, przedstawiając mocne strony i ograniczenia istniejących metod. Ponadto omówiono powiązane badania nad mechanizmami uwagi i ich zastosowaniami w modelach segmentacji. Przeanalizowano również najnowsze osiągnięcia w zakresie technik konwolucji głębokościowej w celu zwiększenia wydajności segmentacji. Analiza porównawcza proponowanego MixKNet (c) i innych modeli jest przedstawiona w Rysunek 1, gdzie linie przerywane wskazują połączenia pominięte.
UNet i jego odmiany
Architektura UNet została po raz pierwszy zaproponowana przez Ronnebergera i in. w 2015 roku1 i od tego czasu jest szeroko stosowana w segmentacji obrazów medycznych. Model składa się ze ścieżki kodowania i ścieżki dekodowania. Koder wyodrębnia cechy wysokiego poziomu z obrazu wejściowego, podczas gdy dekoder próbkuje w górę i łączy funkcje w celu wygenerowania mapy segmentacji. Od tego czasu wprowadzono różne modyfikacje w architekturze UNet, aby poprawić jej wydajność w segmentacji obrazów medycznych. Jedną z najczęstszych modyfikacji jest wprowadzenie połączeń pomijających, które, jak wykazano, poprawiają dokładność segmentacji. Zhou et al.12 zaproponowali wariant UNet, który wykorzystuje gęste połączenia pomijania, co pozwala modelowi lepiej zachować informacje przestrzenne.
Inną popularną modyfikacją architektury UNet jest dodanie mechanizmów uwagi. Mechanizmy te mogą pomóc modelowi selektywnie podkreślać najważniejsze cechy, prowadząc do lepszego uczenia się reprezentacji i dokładności segmentacji. Niektóre przykłady wariantów z mechanizmami uwagi to Attention UNet2, ResUNet z attention gates13 i Dense-UNet z attention gates14. Oprócz powyższych modyfikacji, zaproponowano wiele innych wariantów architektury UNet do segmentacji obrazów medycznych. UCTransNet10 to wariant architektury U-Net, który zawiera połączenia z pominięciem i moduł Transformer. Pomijanie połączeń w UCTransNet10 zostało przemyślane z perspektywy kanału, co pozwala na lepsze ponowne wykorzystanie funkcji i zmniejsza liczbę parametrów. Moduł Transformer został dodany w celu uchwycenia zależności dalekiego zasięgu i poprawy jakości tłumaczenia. UCTransNet10 okazał się osiągać najlepsze wyniki w kilku testach porównawczych tłumaczenia maszynowego. Zihan i in. zaproponowali model głębokiego uczenia o nazwie LViT15, który zastosowali do zadań związanych z analizą obrazów medycznych. Aby rozszerzyć częściowo nadzorowaną wersję LViT15 i zrekompensować braki jakościowe w danych obrazu, zaproponowano mechanizm Exponential Pseudo Label Iteration (EPI). Dodatkowo, aby zachować lokalne cechy obrazów, zaproponowali moduł Pixel-Level Attention Module (PLAM), który selektywnie skupia się na ważnych cechach obrazu.
Uwaga mechanizm
Mechanizmy uwagi są szeroko badane w uczeniu maszynowym, szczególnie w przetwarzaniu języka naturalnego i widzeniu komputerowym. W ostatnich latach mechanizmy uwagi zostały również zastosowane do zadań związanych z analizą obrazu medycznego, w tym do segmentacji obrazu. Bahdanau et al.16 wprowadzili mechanizm uwagi w neuronowym tłumaczeniu maszynowym, aby poprawić jakość tłumaczenia. Mechanizm ten pozwala modelowi selektywnie skupić się na odpowiednich częściach sekwencji wejściowej, poprawiając jakość tłumaczenia. Od tego czasu zaproponowano różne mechanizmy uwagi do zadań związanych z analizą obrazu. Jednym z powszechnych typów mechanizmów uwagi jest mechanizm uwagi przestrzennej, który polega na przyłożeniu wagi do każdego piksela na mapie obiektów na podstawie jego ważności. Na przykład Guo i wsp.17zaproponowali mechanizm uwagi przestrzennej do zadania segmentacji naczyń siatkówki. Mechanizm wykorzystuje mechanizm bramkowania w celu dostosowania wagi cech przestrzennych, poprawiając zdolność modelu do rozróżniania pikseli naczynia i pikseli niebędących naczyniami. Innym typem mechanizmu uwagi jest uwaga kanału, która koncentruje się na dostosowywaniu wag map obiektów w różnych kanałach. Hu et al.18 zaproponowali sieć ściskania i wzbudzania (SENet), która stosuje uwagę kanałową do map cech, poprawiając wydajność zadania klasyfikacji obrazów. Ostatnio mechanizmy uwagi zostały połączone z konwolucyjnymi sieciami neuronowymi (CNN) w celu realizacji zadań związanych z segmentacją obrazu. Na przykład Chen i wsp.19 zaproponowali sieć kierowaną uwagą do segmentacji guzów mózgu, która łączy w sobie mechanizmy uwagi przestrzennej i kanałowej.
Ostatnie postępy w częściowo nadzorowanym i multimodalnym uczeniu się do analizy obrazów medycznych i teledetekcji wykazały obiecującą poprawę wydajności. Yang i in.20 zaproponowali UMSCS, nowatorską strukturę segmentacji multimodalnej bez par, która wykorzystuje generatywne uczenie się międzymodalne i strategie częściowo nadzorowane. Zhang i in. przedstawili kilka najnowocześniejszych technik: wzmocniony dowodami model spójności trójgałęziowej dla segmentacji częściowo nadzorowanej21, samoświadome i krzyżowe prototypowe ramy uczenia się do segmentacji obrazów medycznych22 oraz hierarchiczne podejście do optymalizacji cech uwzględniające częstotliwość czasową dla rozpoznawania zagłuszania radaru z syntetyczną aperturą (SAR) w domenie lotniczej23. Prace te podkreślają znaczenie nadzoru hybrydowego i modelowania cech z uwzględnieniem domeny zarówno w zadaniach obrazowania medycznego, jak i inżynieryjnego.
Dogłębna konwolucja
Konwolucja głębokościowa została zaprojektowana w celu uchwycenia korelacji kanałowych na mapach cech wejściowych i wykazano, że poprawia wydajność i dokładność konwolucyjnych sieci neuronowych.
Jednym z najwcześniejszych i najbardziej wpływowych modeli konwolucji pod względem głębokości jest MobileNet24, zaproponowany przez Howarda i in. w 2017 roku. MobileNet wykorzystuje konwolucję rozłączną według głębokości, która stosuje konwolucję według głębokości, a następnie konwolucję punktową, aby zmniejszyć liczbę parametrów i obliczeń wymaganych dla warstw konwolucyjnych. Dzięki temu MobileNet może osiągnąć najnowocześniejszą dokładność w zadaniach klasyfikacji obrazów przy użyciu znacznie mniejszej liczby parametrów niż tradycyjne konwolucyjne sieci neuronowe. Od czasu wprowadzenia MobileNet, zaproponowano wiele innych architektur konwolucji pod względem głębokości, w tym ShuffleNet25, Xception26 i ResNeXt27. Modele te różnią się między sobą specyficzną implementacją konwolucji głębokiej, ale wszystkie mają wspólny cel, jakim jest zmniejszenie złożoności obliczeniowej warstw konwolucyjnych przy jednoczesnym zachowaniu lub poprawie dokładności. Konwolucja głęboka została również zastosowana do zadania segmentacji semantycznej, a modele takie jak PSPNet28 wykorzystują konwolucję rozdzielalną pod względem głębokości w celu zmniejszenia wymagań obliczeniowych i pamięciowych warstw konwolucyjnych na dużą skalę. MixNet29 rozszerza ideę konwolucji głębokiej, wprowadzając konwolucję mieszaną pod względem głębokości, która wykorzystuje wiele rozmiarów jąder do przechwytywania cech w różnych skalach. Wykazano, że przewyższa inne najnowocześniejsze modele przy zachowaniu porównywalnych parametrów i FLOPs. Modele te wykazały znaczną poprawę dokładności i wydajności w porównaniu z tradycyjnymi konwolucyjnymi sieciami neuronowymi w różnych zadaniach segmentacji semantycznej.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ta sekcja opisuje proponowaną architekturę MixKNet do segmentacji obrazów medycznych. Model MixKNet rozszerza architekturę UNet, włączając mechanizmy uwagi i mieszane warstwy konwolucyjne głębokości. Oprogramowanie użyte w tym badaniu jest wymienione w Tabeli Materiałów.
1. Ogólna architektura
2. Spłaszczony kształt litery U
UWAGA: Zmniejsz głębokość architektury sieci neuronowej, aby zmniejszyć złożoność obliczeniową i rozmiar modelu, mając jednocześnie świadomość, że może to zmniejszyć zdolność do uczenia się złożonych reprezentacji danych.
3. Mieszanie rozmiaru jądra dla kodera
4. Uwaga kanału
5. Zestawy danych
UWAGA: W tym badaniu wykorzystano dwa publicznie dostępne zestawy danych obrazów medycznych, przedstawione w Tabeli 1 i Tabeli 2: GlaS (Sirinukunwattana et al.11) i MoNuSeg (Kumar et al.9).
6. Szczegóły implementacji
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Porównanie z najnowocześniejszymi metodami
Architektura MixKNet została oceniona na dwóch zestawach danych segmentacji obrazów medycznych, GlaS i MoNuSeg, i porównana z najnowocześniejszymi metodami w tej dziedzinie. Ocena została przeprowadzona poprzez przedstawienie wyników kostki i IoU proponowanej metody oraz kilku porównywalnych modeli, jak pokazano w Tabeli 3. Wyniki wskazują, że architektura MixKNet przewyższa inne modele, osiągając najwyższe ś...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
W tym badaniu przedstawiono MixKNet, nowatorską modyfikację architektury UNet1 do segmentacji obrazów medycznych, integrującą konwolucję o mieszanej głębokości i mechanizm uwagi kanału w celu zwiększenia wydajności segmentacji przy jednoczesnym znacznym zmniejszeniu złożoności obliczeniowej. Hybrydowa konwolucja kanałów łączy wiele konwolucyjnych jąder działających na oddzielnych grupach kanałów. Taka konstrukcja pozwala sieci na uchwycenie różnych cech przestrzennych i kontekstowych w różnych ska...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy deklarują brak sprzecznych interesów finansowych lub innych konfliktów interesów.
Druga partia Projektów Badawczych Dobrobytu Społecznego Miasta Ningbo 2023: Badania i zastosowanie kluczowych technologii do identyfikacji oszustw sieci telekomunikacyjnych w oparciu o ontologię i NLP (2023S169).
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| System operacyjny Linux (Ubuntu 22.04) | Różne (społeczność open source) | Nie dotyczy(wersja 22.04 LTS) | System operacyjny typu open source do programowania https://releases.ubuntu.com/22.04/ |
| Procesor graficzny NVIDIA RTX 3090 | NVIDIA | 3090 | do głębokiego uczenia https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | Nie dotyczy (wersja ≥ 3.8) | Język programowania do programowania AI/ML https://www.python.org/ |
| PyTorch | Meta | AI N/A (wersja 1.13) | Platforma uczenia maszynowego typu open source https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Lekki i wydajny edytor kodu https://code.visualstudio.com/ |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie