Artykuł metodologiczny

MixKNet: zmodyfikowana sieć w kształcie litery U z hybrydową konwolucją kanałów do segmentacji obrazów medycznych

DOI:

10.3791/68450

15 lipca 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie przedstawia lekki wariant U-Net z poprawioną dokładnością segmentacji przy użyciu hybrydowej konwolucji i uwagi kanałów, osiągając najnowocześniejsze wyniki na MoNuseg i GlaS przy mniejszej liczbie parametrów.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Technologia przetwarzania obrazów komputerowych oparta na sztucznej sieci neuronowej szybko się rozwinęła w ostatnich latach i znalazła szerokie zastosowanie w wielu dziedzinach. W przetwarzaniu obrazów medycznych UNet i jego warianty wykazały duży sukces w wykrywaniu zmian, segmentacji komórek i segmentacji polipów. Niniejsze badanie przedstawia zmodyfikowaną sieć w kształcie litery U ze zmniejszonymi parametrami sieci uzyskanymi poprzez zmniejszenie głębokości sieci i zwiększenie kanałów sieci w celu zwiększenia zdolności uczenia się modelu. Aby przeciwdziałać zmniejszeniu zdolności uczenia się spowodowanemu kompresją głębokości, wprowadzono moduł konwolucyjny kanału hybrydowego, który zastępuje moduł konwolucyjny oryginalnej sieci. Model wprowadza mechanizm uwagi kanału między warstwą a warstwą konwolucji punktowej, aby poprawić praktyczną zdolność ekstrakcji cech kanału. W artykule stwierdzono również, że użycie konwolucji o mieszanej głębokości może skutecznie rozwiązać problem rozpiętości rozmiaru celu segmentacji, co utrudnia dopasowanie jednego modelu do wielu zestawów danych. Proponowany model pozwala uzyskać najnowocześniejsze wyniki na dwóch popularnych publicznych zbiorach danych, MoNuseg i GlaS, ze średnim wzrostem liczby kości wynoszącym odpowiednio 1,0% i 1,37%. Łączna liczba parametrów zmodyfikowanego modelu została zmniejszona do 1,71 mln, co stanowi 38,6-krotną redukcję w porównaniu z UCtransNet, przy 65,6 mln parametrów.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Segmentacja obrazów medycznych jest kluczowa w różnych zastosowaniach klinicznych, w tym w diagnozie, planowaniu leczenia i monitorowaniu chorób. Tradycyjne metody przetwarzania obrazu oparte na algorytmach inżynierii cech nie są już odpowiednie do obsługi dużych ilości danych generowanych w nowoczesnych środowiskach opieki zdrowotnej. Na szczęście postęp technologii sztucznych sieci neuronowych i poprawa możliwości sprzętu komputerowego umożliwiły trenowanie i wdrażanie modeli sieci neuronowych na dużą skalę. W związku z tym algorytmy przetwarzania wizji komputerowej oparte na modelach uczenia maszynowego są stale rozwijane i stosowane w różnych dziedzinach.

Najbardziej reprezentatywną strukturą modelu w segmentacji semantycznej obrazów medycznych jest UNet1 z architekturą kodująco-dekodującą. Model najpierw używa kodera wielopoziomowego do wyodrębniania cech różnych skal z obrazu wejściowego. Następnie dekoder zwiększa próbkowanie krok po kroku, łącząc cechy semantyczne wyprowadzane przez koder odpowiedniego poziomu jako połączenie z pominięciem. Jednak wydajność architektury UNet można jeszcze poprawić, stosując kilka metod. Na przykład wykazano, że mechanizmy uwagi są skuteczne w zwiększaniu wydajności konwolucyjnych sieci neuronowych. Mechanizmy te mogą selektywnie podkreślać podstawowe cechy danych wejściowych, co prowadzi do lepszego uczenia się reprezentacji i dokładności segmentacji.

Obecnie wielu badaczy skupia się na skutecznym łączeniu cech wyodrębnionych przez koder na etapie dekodowania. Niektóre z najpopularniejszych wariantów UNet to Attention UNet2, Recurrent UNet3 i V-Net4. Podejścia te wykorzystują mechanizmy uwagi5, takie jak uwaga przestrzenna, w celu wyróżnienia regionów informacyjnych na mapach obiektów i pominięcia regionów nieinformacyjnych. Ponadto niektóre warianty zawierają rekurencyjne sieci neuronowe w celu modelowania sekwencyjnego charakteru obrazów medycznych i ulepszania reprezentacji cech. Modele przed trenowaniem, takie jak VGG6, ResNet7 i DenseNet8, są szeroko stosowane w celu poprawy wydajności sieci w kształcie litery U poprzez wykorzystanie ich bogatej wiedzy zdobytej na podstawie dużych zbiorów danych. Ponadto mechanizmy transformatorowe, takie jak samouwaga i uwaga wielogłowicowa, zostały wprowadzone do zależności modelu dalekiego zasięgu i przechwytują globalne informacje kontekstowe, co prowadzi do lepszej wydajności segmentacji.

Jednakże, mimo że te warianty są lepsze od oryginalnego UNet1, nadal mają pewne ograniczenia w obsłudze złożonych obrazów medycznych o różnych skalach i kształtach. Co więcej, zwiększona złożoność tych wariantów często prowadzi do wyższych kosztów obliczeniowych i dłuższego czasu szkolenia, co ogranicza ich zastosowanie w praktyce.

Aby ulepszyć architekturę UNet1, zaproponowano zmodyfikowany model o nazwie MixKNet (Mix Kernel Size U-shape Net), który zmniejsza głębokość sieci, jednocześnie zwiększając liczbę kanałów, aby poprawić zdolność uczenia się. Jednak zmniejszenie głębokości może prowadzić do spadku ogólnej wydajności. Aby złagodzić ten problem, wprowadzono hybrydowy moduł konwolucyjny, który zastępuje oryginalny konwolucyjny moduł neuronowy. Moduł ten zawiera mechanizm uwagi kanału między warstwami konwolucji głębokościowej i punktowej, mając na celu wzmocnienie zdolności modelu do wyodrębniania efektywnych cech kanału.

Aby wskazać praktyczne zastosowanie, ważne jest, aby zauważyć, że proponowana metoda została oceniona na stosunkowo małych zestawach danych obrazów medycznych, z indywidualnymi rozdzielczościami obrazów od 500 × 500 do 1000 × 1000 pikseli. Na potrzeby trenowania modelu wszystkie obrazy zostały przeskalowane na 224 × 224 piksele. Implementacja została przeprowadzona przy użyciu PyTorch na pojedynczym procesorze graficznym NVIDIA RTX 3090. Te parametry operacyjne sugerują, że metoda jest obliczeniowo wykonalna w przypadku umiarkowanych konfiguracji eksperymentalnych i można ją dostosować do ograniczonych rozmiarów zbiorów danych.

Podsumowując, ten artykuł przedstawia nowatorską modyfikację struktury sieci w kształcie litery U i wprowadza hybrydowy moduł konwolucji kanałów wraz z mechanizmem uwagi kanału, co poprawia wydajność segmentacji na zestawach danych obrazów medycznych. Główne wkłady tej pracy są następujące: (1) Zaproponowanie zmodyfikowanej struktury sieci w kształcie litery U z hybrydowym modułem konwolucji głębokiej sprężyny, który zastępuje oryginalny konwolucyjny moduł neuronowy. (2) Wprowadzenie mechanizmu uwagi kanału między warstwą konwolucyjną głębokiej i punktowej w celu poprawy efektywnej zdolności modelu do ekstrakcji cech kanału. (3) Osiągnięcie najnowocześniejszych wyników jednocześnie na dwóch popularnych publicznych zbiorach danych w zbiorze danych segmentacji jądrowej MoNuseg9 ze znacznie mniejszą liczbą parametrów modelu (w porównaniu z UCtransNet10 z parametrami 64M) i poprawioną wydajnością na zbiorze danych segmentacji gruczołów GlaS11.

Reszta tego artykułu jest zorganizowana w następujący sposób. Krok 2 zawiera obszerny przegląd wcześniejszych badań nad UNet1 i jego odmianami w segmentacji obrazów medycznych. Badane są mocne i słabe strony istniejących podejść, a także powiązane prace nad mechanizmami uwagi, sieciami konwolucyjnymi o mieszanej głębokości i ich zastosowaniami w modelach segmentacji. Krok 3 szczegółowo opisuje architekturę proponowanego modelu MixKNet, w tym modyfikacje struktury UNet, integrację mechanizmu uwagi kanału oraz użycie konwolucji o mieszanej głębokości. Krok 4 przedstawia wyniki szeroko zakrojonych eksperymentów, którym towarzyszy dyskusja i badanie ablacji w celu oceny wkładu każdego składnika. Wreszcie, krok 5 kończy artykuł i nakreśla potencjalne kierunki przyszłych badań.

Ta sekcja zaczyna się od przeglądu wcześniejszych badań nad UNet i jego wariantami w segmentacji obrazów medycznych, przedstawiając mocne strony i ograniczenia istniejących metod. Ponadto omówiono powiązane badania nad mechanizmami uwagi i ich zastosowaniami w modelach segmentacji. Przeanalizowano również najnowsze osiągnięcia w zakresie technik konwolucji głębokościowej w celu zwiększenia wydajności segmentacji. Analiza porównawcza proponowanego MixKNet (c) i innych modeli jest przedstawiona w Rysunek 1, gdzie linie przerywane wskazują połączenia pominięte.

UNet i jego odmiany
Architektura UNet została po raz pierwszy zaproponowana przez Ronnebergera i in. w 2015 roku1 i od tego czasu jest szeroko stosowana w segmentacji obrazów medycznych. Model składa się ze ścieżki kodowania i ścieżki dekodowania. Koder wyodrębnia cechy wysokiego poziomu z obrazu wejściowego, podczas gdy dekoder próbkuje w górę i łączy funkcje w celu wygenerowania mapy segmentacji. Od tego czasu wprowadzono różne modyfikacje w architekturze UNet, aby poprawić jej wydajność w segmentacji obrazów medycznych. Jedną z najczęstszych modyfikacji jest wprowadzenie połączeń pomijających, które, jak wykazano, poprawiają dokładność segmentacji. Zhou et al.12 zaproponowali wariant UNet, który wykorzystuje gęste połączenia pomijania, co pozwala modelowi lepiej zachować informacje przestrzenne.

Inną popularną modyfikacją architektury UNet jest dodanie mechanizmów uwagi. Mechanizmy te mogą pomóc modelowi selektywnie podkreślać najważniejsze cechy, prowadząc do lepszego uczenia się reprezentacji i dokładności segmentacji. Niektóre przykłady wariantów z mechanizmami uwagi to Attention UNet2, ResUNet z attention gates13 i Dense-UNet z attention gates14. Oprócz powyższych modyfikacji, zaproponowano wiele innych wariantów architektury UNet do segmentacji obrazów medycznych. UCTransNet10 to wariant architektury U-Net, który zawiera połączenia z pominięciem i moduł Transformer. Pomijanie połączeń w UCTransNet10 zostało przemyślane z perspektywy kanału, co pozwala na lepsze ponowne wykorzystanie funkcji i zmniejsza liczbę parametrów. Moduł Transformer został dodany w celu uchwycenia zależności dalekiego zasięgu i poprawy jakości tłumaczenia. UCTransNet10 okazał się osiągać najlepsze wyniki w kilku testach porównawczych tłumaczenia maszynowego. Zihan i in. zaproponowali model głębokiego uczenia o nazwie LViT15, który zastosowali do zadań związanych z analizą obrazów medycznych. Aby rozszerzyć częściowo nadzorowaną wersję LViT15 i zrekompensować braki jakościowe w danych obrazu, zaproponowano mechanizm Exponential Pseudo Label Iteration (EPI). Dodatkowo, aby zachować lokalne cechy obrazów, zaproponowali moduł Pixel-Level Attention Module (PLAM), który selektywnie skupia się na ważnych cechach obrazu.

Uwaga mechanizm
Mechanizmy uwagi są szeroko badane w uczeniu maszynowym, szczególnie w przetwarzaniu języka naturalnego i widzeniu komputerowym. W ostatnich latach mechanizmy uwagi zostały również zastosowane do zadań związanych z analizą obrazu medycznego, w tym do segmentacji obrazu. Bahdanau et al.16 wprowadzili mechanizm uwagi w neuronowym tłumaczeniu maszynowym, aby poprawić jakość tłumaczenia. Mechanizm ten pozwala modelowi selektywnie skupić się na odpowiednich częściach sekwencji wejściowej, poprawiając jakość tłumaczenia. Od tego czasu zaproponowano różne mechanizmy uwagi do zadań związanych z analizą obrazu. Jednym z powszechnych typów mechanizmów uwagi jest mechanizm uwagi przestrzennej, który polega na przyłożeniu wagi do każdego piksela na mapie obiektów na podstawie jego ważności. Na przykład Guo i wsp.17zaproponowali mechanizm uwagi przestrzennej do zadania segmentacji naczyń siatkówki. Mechanizm wykorzystuje mechanizm bramkowania w celu dostosowania wagi cech przestrzennych, poprawiając zdolność modelu do rozróżniania pikseli naczynia i pikseli niebędących naczyniami. Innym typem mechanizmu uwagi jest uwaga kanału, która koncentruje się na dostosowywaniu wag map obiektów w różnych kanałach. Hu et al.18 zaproponowali sieć ściskania i wzbudzania (SENet), która stosuje uwagę kanałową do map cech, poprawiając wydajność zadania klasyfikacji obrazów. Ostatnio mechanizmy uwagi zostały połączone z konwolucyjnymi sieciami neuronowymi (CNN) w celu realizacji zadań związanych z segmentacją obrazu. Na przykład Chen i wsp.19 zaproponowali sieć kierowaną uwagą do segmentacji guzów mózgu, która łączy w sobie mechanizmy uwagi przestrzennej i kanałowej.

Ostatnie postępy w częściowo nadzorowanym i multimodalnym uczeniu się do analizy obrazów medycznych i teledetekcji wykazały obiecującą poprawę wydajności. Yang i in.20 zaproponowali UMSCS, nowatorską strukturę segmentacji multimodalnej bez par, która wykorzystuje generatywne uczenie się międzymodalne i strategie częściowo nadzorowane. Zhang i in. przedstawili kilka najnowocześniejszych technik: wzmocniony dowodami model spójności trójgałęziowej dla segmentacji częściowo nadzorowanej21, samoświadome i krzyżowe prototypowe ramy uczenia się do segmentacji obrazów medycznych22 oraz hierarchiczne podejście do optymalizacji cech uwzględniające częstotliwość czasową dla rozpoznawania zagłuszania radaru z syntetyczną aperturą (SAR) w domenie lotniczej23. Prace te podkreślają znaczenie nadzoru hybrydowego i modelowania cech z uwzględnieniem domeny zarówno w zadaniach obrazowania medycznego, jak i inżynieryjnego.

Dogłębna konwolucja
Konwolucja głębokościowa została zaprojektowana w celu uchwycenia korelacji kanałowych na mapach cech wejściowych i wykazano, że poprawia wydajność i dokładność konwolucyjnych sieci neuronowych.

Jednym z najwcześniejszych i najbardziej wpływowych modeli konwolucji pod względem głębokości jest MobileNet24, zaproponowany przez Howarda i in. w 2017 roku. MobileNet wykorzystuje konwolucję rozłączną według głębokości, która stosuje konwolucję według głębokości, a następnie konwolucję punktową, aby zmniejszyć liczbę parametrów i obliczeń wymaganych dla warstw konwolucyjnych. Dzięki temu MobileNet może osiągnąć najnowocześniejszą dokładność w zadaniach klasyfikacji obrazów przy użyciu znacznie mniejszej liczby parametrów niż tradycyjne konwolucyjne sieci neuronowe. Od czasu wprowadzenia MobileNet, zaproponowano wiele innych architektur konwolucji pod względem głębokości, w tym ShuffleNet25, Xception26 i ResNeXt27. Modele te różnią się między sobą specyficzną implementacją konwolucji głębokiej, ale wszystkie mają wspólny cel, jakim jest zmniejszenie złożoności obliczeniowej warstw konwolucyjnych przy jednoczesnym zachowaniu lub poprawie dokładności. Konwolucja głęboka została również zastosowana do zadania segmentacji semantycznej, a modele takie jak PSPNet28 wykorzystują konwolucję rozdzielalną pod względem głębokości w celu zmniejszenia wymagań obliczeniowych i pamięciowych warstw konwolucyjnych na dużą skalę. MixNet29 rozszerza ideę konwolucji głębokiej, wprowadzając konwolucję mieszaną pod względem głębokości, która wykorzystuje wiele rozmiarów jąder do przechwytywania cech w różnych skalach. Wykazano, że przewyższa inne najnowocześniejsze modele przy zachowaniu porównywalnych parametrów i FLOPs. Modele te wykazały znaczną poprawę dokładności i wydajności w porównaniu z tradycyjnymi konwolucyjnymi sieciami neuronowymi w różnych zadaniach segmentacji semantycznej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta sekcja opisuje proponowaną architekturę MixKNet do segmentacji obrazów medycznych. Model MixKNet rozszerza architekturę UNet, włączając mechanizmy uwagi i mieszane warstwy konwolucyjne głębokości. Oprogramowanie użyte w tym badaniu jest wymienione w Tabeli Materiałów.

1. Ogólna architektura

  1. Architektura MixKNet, pokazana w Rysunek 2, jest zgodna ze standardową strukturą UNet, składającą się z kodera i dekodera. Ustaw kształt wejściowy na 224 × 224 × 3. W koderze użyj dwóch modułów DownBlock — każdy z nich zawiera konwolucję głębokości 1×1, maksymalną warstwę puli 2×2 i konwolucję wielojądrową (MDConv) z rozmiarami jądra, takimi jak [1, 3, 5] lub [3-13].
  2. W dekoderze użyj dwóch modułów UpBlock - każdy z nich wykonuje dwuliniowe upsampling, pomijanie łączenia połączeń, konwolucję głębokości 1×1 i konwolucję wielojądrową.
  3. Używaj aktywacji ReLU po każdym bloku konwolucyjnym. Zastosuj końcową konwolucję 1×1, aby wygenerować dane wyjściowe, a następnie aktywację Sigmoida dla segmentacji binarnej lub pozostaw nieaktywowaną dla zewnętrznego Softmax w zadaniach wieloklasowych.

2. Spłaszczony kształt litery U

UWAGA: Zmniejsz głębokość architektury sieci neuronowej, aby zmniejszyć złożoność obliczeniową i rozmiar modelu, mając jednocześnie świadomość, że może to zmniejszyć zdolność do uczenia się złożonych reprezentacji danych.

  1. Zredukuj czteropoziomową architekturę UNet do wersji dwupoziomowej, jak pokazano na rysunku Rysunek 3, aby zmniejszyć liczbę parametrów modelu przy zachowaniu podstawowych komponentów kodowania i dekodowania.
    1. Skonstruuj spłaszczoną architekturę, usuwając poziomy 3 i 4 zarówno ze ścieżek kodera, jak i dekodera, i zachowaj połączenia funkcji na poziomie 2.
    2. Dostosuj odpowiednio operacje próbkowania w dół i w górę, aby dopasować je do zmniejszonej głębokości - użyj tylko jednego kroku próbkowania w dół przed wąskim gardłem i jednego kroku w górę po .
      UWAGA: To zmniejszenie głębokości może zmniejszyć zdolność uczenia się modelu, ponieważ może on nie uchwycić złożonych relacji między danymi wejściowymi i wyjściowymi. Zwiększenie liczby podstawowych kanałów konwolucji w każdej warstwie modelu może pomóc w przezwyciężeniu tego ograniczenia poprzez zwiększenie zdolności modelu do uczenia się cech dyskryminacyjnych. Dzięki większej liczbie kanałów konwolucji model może przechwytywać bardziej złożone wzorce i relacje w danych wejściowych, kompensując zmniejszoną głębokość i poprawiając wydajność.
  2. Należy wziąć pod uwagę, że zwiększenie liczby kanałów konwolucji może również zwiększyć złożoność obliczeniową modelu i użycie pamięci, co stanowi kompromis z szybkością uczenia i wnioskowania. Znajdź odpowiednią równowagę między pojemnością modelu a wydajnością obliczeniową.

3. Mieszanie rozmiaru jądra dla kodera

  1. Aby zwiększyć wydajność kodera, zastosuj podejście oparte na mieszanym rozmiarze jądra w module DC-CA (Depthwise Convolution and Channel Attention), jak pokazano na Rysunek 4. Zamiast polegać na jednym rozmiarze jądra, zastosuj wiele zwojów głębokości równolegle z różnymi rozmiarami ziaren (np. 1, 3, 5, 7, 9, 11, 13), aby wyodrębnić cechy w wielu polach recepcyjnych.
  2. Zastosuj normalizację wsadową i aktywację ReLU do każdej gałęzi indywidualnie przed konkatenacją. Połącz dane wyjściowe z każdej gałęzi jądra wzdłuż wymiaru kanału.
  3. Użyj punktowej konwolucji 1×1 po konkatenacji, aby połączyć cechy i rzutować je na ustaloną liczbę kanałów wyjściowych, zachowując spójność z oczekiwanym rozmiarem wejściowym następnej warstwy.
    UWAGA: Mieszana warstwa konwolucji głębokościowej składa się z wielu splotów głębokościowych o różnych rozmiarach ziaren, po których następuje splot punktowy. Taka konstrukcja umożliwia uchwycenie cech w różnych skalach, co ma kluczowe znaczenie w zadaniach segmentacji obrazów medycznych. Pierwszy moduł wykorzystuje trzy rozmiary jąder - 1, 3 i 5 - w celu zwiększenia pola recepcyjnego, podczas gdy drugi moduł wykorzystuje większe rozmiary ziaren i więcej grup, w szczególności 3, 5, 7, 9, 11 i 13.

4. Uwaga kanału

  1. Zintegruj mechanizm uwagi kanału z modułem DC-CA, aby poprawić reprezentację funkcji.
    1. Użyj konwolucji 1×1 z "takim samym" dopełnieniem, aby wygenerować mapy uwagi dla kanałów. Zastosuj globalną pulę średnich między wymiarami przestrzennymi, aby utworzyć kompaktowy deskryptor dla każdego kanału.
    2. Użyj lekkiej sieci konwolucyjnej składającej się z dwóch konwolucji 1×1 z aktywacją ReLU pomiędzy nimi. Unikaj dzielenia się wagą między kanałami – poznaj unikalne wagi uwagi dla każdego kanału.
    3. Zastosuj aktywację sigmoidalną do końcowego wyniku, aby uzyskać znormalizowane wyniki uwagi. Zmień wagę wejściowych map cech za pomocą mnożenia kanałów.
      UWAGA: Niech tensor wejściowy będzie równy x. Uwaga kanału jest implementowana za pomocą następującego wyrażenia:
      (uwaga)_tensor = σ(conv(ReLU(conv(x)))) (1)
      gdzie σ reprezentuje funkcję aktywacji esicy, conv jest operacją konwolucji, a ReLU jest wyprostowaną funkcją aktywacji jednostki liniowej.
  2. Uzyskaj mapę uwagi, wykonując adaptacyjną operację puli średniej na tensorze uwagi, a następnie rozszerzając ją w celu dopasowania do rozmiaru tensora wyjściowego po splotzie z innym rozmiarem jądra y:
    uwaga = expand(avg_pool([uwaga]_tensor),rozmiar(y)) (2)
  3. Oblicz tensor wyjściowy z, wykonując mnożenie tensora wejściowego y w zależności od elementów z mapą uwagi:
    z = z * Uwaga (3)
    gdzie * oznacza mnożenie pierwiastkowe

5. Zestawy danych

UWAGA: W tym badaniu wykorzystano dwa publicznie dostępne zestawy danych obrazów medycznych, przedstawione w Tabeli 1 i Tabeli 2: GlaS (Sirinukunwattana et al.11) i MoNuSeg (Kumar et al.9).

  1. Użyj zestawu danych segmentacji gruczołów (Sirinukunwattana et al.11), uzyskanego za pomocą cyfrowego skanera patologicznego i ręcznie opisanego w celu segmentacji poszczególnych struktur gruczołowych w próbkach tkanek.
    UWAGA: Zestaw danych składa się ze 165 obrazów, każdy o rozdzielczości 500 × 500 pikseli, wraz z odpowiadającymi im maskami segmentacji prawdy podstawowej. Zestaw danych MoNuSeg (Kumar et al.9) składa się z 51 obrazów mikroskopijnych jąder, każdy o rozdzielczości 1000 × 1000 pikseli.

6. Szczegóły implementacji

  1. Zaimplementuj model przy użyciu platformy PyTorch na jednym procesorze GPU NVIDIA RTX 3090. Użyj Ubuntu 22.04 jako systemu operacyjnego.
  2. Zmień rozmiar wszystkich obrazów wejściowych do stałego rozmiaru 224 × 224 pikseli. Zastosuj techniki rozszerzania danych, aby zwiększyć różnorodność szkoleń.
    1. Ulepszenia należy stosować losowo w następującej kolejności: odwrócenie w poziomie → odwrócenie w pionie → obrót → korekcja gamma → transformacja logarytmiczna → skalowanie losowe.
    2. Zastosuj losowe przeskoki w poziomie z prawdopodobieństwem 0,5, pionowe z prawdopodobieństwem 0,5 i obroty w zakresie ±15 stopni z prawdopodobieństwem 0,5.
    3. Zastosuj korekcję gamma z prawdopodobieństwem 0,3, transformację logarytmiczną z prawdopodobieństwem 0,3 i losowe skalowanie ze współczynnikiem skalowania z zakresu od 0,9 do 1,1, zastosowane z prawdopodobieństwem 0,3.
    4. Normalizuj obrazy, używając średnich wartości [0,485, 0,456, 0,406] i odchyleń standardowych [0,229, 0,224, 0,225].
  3. Trenowanie modelu przy użyciu optymalizatora Adama ze współczynnikiem uczenia się 0,001 i rozmiarem partii 4. Zastosuj technikę wyżarzania cosinusowego z ciepłym ponownym startem techniki planowania szybkości uczenia się, aby wprowadzić zmienność do harmonogramu szybkości uczenia się i zapobiec zbieżności z lokalnymi optimami.
    UWAGA: Użyj wbudowanego torch.optim.lr_scheduler PyTorch. CosineAnnealingWarmResetuje harmonogram. Optymalizator i harmonogram zostały zaimplementowane w następujący sposób:
    optymalizator = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    Harmonogram = torch.optim.lr_scheduler. CosinusAnnealingWarmRestarts(
    Optymalizator, T_0=10, T_mult=2, eta_min=1E-6)
    Tutaj T_0=10 oznacza liczbę epok przed pierwszym ponownym uruchomieniem, T_mult=2 podwaja okres ponownego uruchomienia po każdym cyklu, a eta_min=1e-6 określa minimalny współczynnik uczenia się. Zaktualizuj szybkość uczenia się na końcu każdej epoki, wywołując metodę scheduler.step().
  4. Użyj binarnej entropii krzyżowej jako funkcji straty. Zastosuj wczesne zatrzymanie, aby zapobiec nadmiernemu dopasowaniu. Trenowanie modelu przez maksymalnie 5000 epok.
  5. Oceń wydajność modelu przy użyciu średniej liczby przecięć przez sumę (mIoU) i współczynnika kostki.
    Kości =(2|A∩B|)/(|A|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    UWAGA: mIoU jest stosunkiem przecięcia między maskami segmentacji prawdy przewidywanej i podstawowej do ich połączenia. Jednocześnie współczynnik kości jest stosunkiem dwukrotności przecięcia do sumy przewidywanych i podstawowych masek segmentacji prawdy
  6. .
  7. Przeprowadź rygorystyczną ocenę małych zbiorów danych przy użyciu trzech rund 5-krotnej walidacji krzyżowej, co daje w sumie 15 ocen. Losowo tasuj podziały walidacji krzyżowej w każdej rundzie, aby zapewnić zmienność między fałdami. Stratyfikacja składań na podstawie rozkładów klas w celu zachowania równowagi etykiet w każdym składaniu.
  8. Oblicz średnią wydajność między fałdami, aby zminimalizować ryzyko zbieżności do lokalnych optimów. Przeprowadzić test statystyczny w celu wykazania, że proponowane podejście prowadzi do statystycznie istotnej poprawy w porównaniu z porównywalnymi metodami.
  9. Pokaż reprezentatywne przewidywania walidacji podczas trenowania w Rysunek 5, aby zilustrować postępującą poprawę jakości segmentacji. Po zakończeniu trenowania załaduj najlepiej działający punkt kontrolny modelu na podstawie wydajności walidacji (np. najwyższy wynik mIoU i Dice).
    1. Uruchom model na zestawie walidacji, aby wygenerować przewidywane maski segmentacji przy użyciu zapisanych parametrów.
    2. Wizualizuj wyniki przy użyciu biblioteki Matplotlib, wyświetlając obraz wejściowy, maskę prawdy podstawowej i maskę przewidywaną w formacie obok siebie.
    3. Podkreśl wyższość proponowanej metody pod względem wydajności segmentacji, oznaczając reprezentatywne regiony czerwonymi ramkami na wizualizacji.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Porównanie z najnowocześniejszymi metodami
Architektura MixKNet została oceniona na dwóch zestawach danych segmentacji obrazów medycznych, GlaS i MoNuSeg, i porównana z najnowocześniejszymi metodami w tej dziedzinie. Ocena została przeprowadzona poprzez przedstawienie wyników kostki i IoU proponowanej metody oraz kilku porównywalnych modeli, jak pokazano w Tabeli 3. Wyniki wskazują, że architektura MixKNet przewyższa inne modele, osiągając najwyższe ś...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tym badaniu przedstawiono MixKNet, nowatorską modyfikację architektury UNet1 do segmentacji obrazów medycznych, integrującą konwolucję o mieszanej głębokości i mechanizm uwagi kanału w celu zwiększenia wydajności segmentacji przy jednoczesnym znacznym zmniejszeniu złożoności obliczeniowej. Hybrydowa konwolucja kanałów łączy wiele konwolucyjnych jąder działających na oddzielnych grupach kanałów. Taka konstrukcja pozwala sieci na uchwycenie różnych cech przestrzennych i kontekstowych w różnych ska...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak sprzecznych interesów finansowych lub innych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Druga partia Projektów Badawczych Dobrobytu Społecznego Miasta Ningbo 2023: Badania i zastosowanie kluczowych technologii do identyfikacji oszustw sieci telekomunikacyjnych w oparciu o ontologię i NLP (2023S169).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
System operacyjny Linux (Ubuntu 22.04)  Różne (społeczność open source)Nie dotyczy(wersja 22.04 LTS)System operacyjny typu open source do programowania
https://releases.ubuntu.com/22.04/
Procesor graficzny NVIDIA RTX 3090NVIDIA3090do głębokiego uczenia
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationNie dotyczy (wersja ≥ 3.8)Język programowania do programowania AI/ML
https://www.python.org/
PyTorchMetaAI N/A (wersja 1.13)Platforma uczenia maszynowego typu open source
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/ALekki i wydajny edytor kodu
https://code.visualstudio.com/
Wysokowydajny procesor graficzny

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Warianty U Netuwaga kana owasploty o mieszanej g boko cidetekcja zmian chorobowychsegmentacja kom reksegmentacja polip wredukcja parametr w modeluekstrakcja cech
Film wkrótce dostępny

Powiązane artykuły