Ten protokół wdraża sieć głębokiego uczenia się w kształcie litery U, integrującą zwiniętą konwolucję, podwójną uwagę i wieloskalową fuzję w celu segmentacji polipów jelita grubego.
Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.
Artykuł metodologiczny
* These authors contributed equally
Ten protokół wdraża sieć głębokiego uczenia się w kształcie litery U, integrującą zwiniętą konwolucję, podwójną uwagę i wieloskalową fuzję w celu segmentacji polipów jelita grubego.
Dokładne segmentowanie polipów jelita grubego jest kluczowe dla wczesnej prewencji i diagnozy raka jelita grubego. Jednak ze względu na wysoką niejednorodność polipów pod względem kształtu, wielkości i tekstury, a także złożoność środowiska jelitowego (takie jak fałdy, odblaskowe odbicia i resztki kału), istniejące metody nadal napotykają na znaczne wyzwania w zakresie lokalizacji granic i wykrywania małych polipów. Aby rozwiązać te problemy, w niniejszym artykule proponowany jest Polyp Segmentation Network oparty na Pinwheel Convolution i Dual Attention (PWD-Net). Zaproponowana sieć przyjmuje architekturę U-kształtnego enkodera-dekodera, gdzie jako enkoder wykorzystywany jest wstępnie wytrenowany ResNet do ekstrakcji wielowarstwowych lokalnych cech. Szczegółowo, moduł Pinwheel Convolution (PCM) jest wprowadzany na warstwie wąskiej części sieci, aby uchwycić globalną strukturę geometryczną i wielokierunkowe informacje kontekstowe polipów poprzez wielokątne obracane jądra konwolucji. Mechanizm Dual-Attention (DAM), który integruje uwagę kanałową i przestrzenną, został zaprojektowany w celu adaptacyjnego tłumienia szumów tła i ulepszania cech regionów polipów. Ponadto zastosowana została strategia Multi-scale Feature Fusion (MSF) w celu połączenia głębokich informacji semantycznych z płytkimi detalami granic, zapewniając zarówno kompletność, jak i precyzję wyników segmentacji. Przeprowadzone eksperymenty na zbiorach danych Kvasir-SEG i CVC-ClinicDB wykazują, że PWD-Net osiąga średnie współczynniki Dice wynoszące 0,865 i 0,944 oraz wskaźniki IoU wynoszące 0,765 i 0,892, znacznie przewyższając istniejące najlepsze metody. Badania ablacyjne zweryfikowały efektywność każdego modułu, a oceny między zbiorami potwierdziły silną zdolność generalizacji modelu. Niniejsze badanie zapewnia wysokoprecyzyjne i trwałe rozwiązanie dla klinicznego segmentowania polipów, oferując znaczącą wartość dla wczesnej diagnozy przedraków jelita grubego i wspierając interwencję wspomaganą komputerowo.
Rak jelita grubego jest jednym z najczęstszych nowotworów złośliwych na całym świecie, z konsekwentnie wysokimi współczynnikami występowania i śmiertelności. Badania wykazały, że większość nowotworów jelita grubego rozwija się z polipów gruczolakowych, proces, który zwykle trwa 10–15 lat, zapewniając cenny okres czasowy na wczesne wykrywanie i interwencję. Wzrost o 1% współczynnika wykrywania polipów (ADR) może zmniejszyć ryzyko raka jelita grubego o około 3%, znacząco obniżając śmiertelność pacjentów1. Kolonoskopia, uważana za złoty standard w badaniu przesiewowym raka jelita grubego, umożliwia bezpośrednie usuwanie polipów podczas badania, skutecznie zmniejszając częstość występowania i śmiertelność z powodu raka.
Jednak konwencjonalna kolonoskopia znacznie zależy od doświadczenia i poziomu umiejętności endoskopisty. Czynniki takie jak subiektywne osądy, zmęczenie wzroku i rozproszenie uwagi mogą prowadzić do wskaźnika pominięć 20–30%, co bezpośrednio wpływa na efektywność badania przesiewowego2. Dlatego rozwój systemów wspomaganego komputerowo wykrywania (CAD) do automatycznej segmentacji polipów jelita grubego ma znaczące znaczenie dla poprawy ADR i zmniejszenia liczby niewykrytych przypadków. Ostatnie badania kliniczne jeszcze bardziej podkreśliły zainteresowanie integracją sztucznej inteligencji w procesach oceny endoskopowych zmian chorobowych, wzmacniając potrzebę opracowania solidnych i powtarzalnych metod segmentacji3.
W ostatnich latach głębokie uczenie osiągnęło niezwykły postęp w analizie obrazów medycznych, szczególnie sieci neuronowe z konwolucyjnymi warstwami (CNN), które wykazują mocne zdolności ekstrakcji i reprezentacji cech dla zadań segmentacji obrazów4. Jako klasyczny model segmentacji obrazów medycznych, U-Net wykorzystuje symetryczną architekturę kodera-dekoder z połączeniami pomijanymi, aby osiągnąć dokładną segmentację na poziomie pikseli, stając się punktem odniesienia w tej dziedzinie5. Na bazie U-Net, wiele udoskonalonych architektur zostało zaproponowanych, aby radzić sobie ze złożonymi zadaniami segmentacji obrazów medycznych. UNet++ zmniejsza lukę semantyczną między mapami cech kodera i dekodera, wprowadzając zagnieżdżone i gęste połączenia pomijane6. ResUNet++ integruje bloki rezydualne, moduły squeeze-and-excitation, rozszerzone konwolucje i mechanizmy uwagi, osiągając silną wydajność w segmencie polipów7. U2-Net stosuje dwupoziomową zagnieżdżoną strukturę w kształcie litery U, aby uchwycić informacje o cechach wieloskalowych8. Niedawno zaproponowano sieć głębokiej segmentacji polipów z podwójnym enkoderem-dekoderem, wykorzystującą równoległe ścieżki kodowania i dekodowania, aby jeszcze bardziej zwiększyć dokładność segmentacji9.
Tymczasem wprowadzenie mechanizmów uwagi zapewnia nowe rozwiązania dla ulepszania cech i tłumienia szumów. U-Net z uwagią wykorzystuje bramy uwagi, aby skupić się na docelowym obszarze, tłumiąc nieistotne informacje z tła10. Dual Attention Network (DANet) adaptacyjnie waży cechy zarówno z wymiaru kanałowego, jak i przestrzennego11, poprawiając percepcję krytycznych cech. Triple Attention Networks (TANet) dodatkowo poprawiają wydajność segmentacji poprzez adaptacyjny wybór cech wieloskalowych12.
Dzięki sukcesowi architektur Transformerów w przetwarzaniu języka naturalnego i wizji komputerowej13, naukowcy zaczęli badać ich zastosowanie w segmencie obrazów medycznych. TransUNet był pierwszym, który zastosował Transformer jako enkoder do efektywnego modelowania zależności długozasięgowych14. Swin-UNet przyjmuje czystą architekturę Transformera i osiąga wydajne globalne agregowanie informacji poprzez mechanizm przesuniętych okien15. UTNet proponuje hybrydową architekturę, która łączy zdolność ekstrakcji lokalnych cech CNN z globalną zdolnością modelowania Transformerów16.
W dziedzinie segmentacji polipów, Polyp-PVT wykorzystuje piramidalny Transformer do przechwytywania wieloskalowych globalnych informacji semantycznych17, podczas gdy wieloskalowa zagnieżdżona UNet poprawia zrozumienie kontekstu poprzez integrację Transformerów18. Ostatnie badania również badały strategie uczenia się o korelacji ujemnej dla segmentacji polipów w różnych domenach19, ulepszenie segmentacji poprzez zwiększenie Gompertz20 oraz architektury oparte na uwagi z uwzględnieniem wskazówek granicznych21. Chociaż te podejścia w pewnym stopniu poprawiają wydajność segmentacji, segmentacja polipów nadal stawia przed sobą kilka wyzwań. Po pierwsze, polipy wykazują dużą różnorodność w morfologii, wielkości i fakturze, wahając się od mikropolipów mniejszych niż 5 mm do dużych polipów przekraczających 30 mm, z kształtami od okr
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
To studium korzysta tylko z publicznie dostępnych, anonimizowanych zestawów danych z obrazów kolonoskopowych (Kvasir-SEG). Nie zebrano żadnych nowych danych od osób. Zatwierdzenie instytucjonalnej etyki i zgoda pacjenta nie były wymagane, jak potwierdzono w zasadach przeglądu instytucjonalnego dla retrospektywnych analiz zidentyfikowanych publicznych zestawów danych.
1. Przygotowanie danych
2. Architektura ogólna
UWAGA: Zobacz Rysunek 1 dla makro-poziomowej struktury kodującej-dekodującej PWD-Net, a dla Rysunku 2 dla integracji i interakcji modułów rdzeniowych w obrębie przepływu cech. Ogólna architektura naśladuje projekt U-kształtnego kodera-dekodera, aby radzić sobie z różnymi skalami polipów i zakłóceniami tła na obrazach z kolonoskopii.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ustawienia eksperymentalne
Zestaw danych
Zestaw danych Kvasir SEG został wykorzystany do oceny zachowania segmentacji sieci PWD Net na obrazach z kolonoskopii z niejednorodnym wyglądem polipów. Zestaw zawiera 1000 obrazów polipów z adnotacjami pikseli i obejmuje różnorodność wielkości, kształtu, tekstury, iluminacji i złożoności tła, co sprawia, że nadaje się do oceny wykrywania małych celów, lokalizowania granic i odporności na zakłócenia wizualne. Zestaw danych został ...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Kilka wyborów projektowych w protokole PWD-Net jest kluczowych dla osiągnięcia wiarygodnych wyników segmentacji i zasługuje na szczególną uwagę podczas implementacji. Po pierwsze, wybór i inicjalizacja części kodera bezpośrednio wpływają na zachowanie konwergencji i ostateczną wydajność. Protokół wykorzystuje enkoder ResNet-50 przetrenowany na ImageNet, który zapewnia solidną inicjalizację funkcji na poziomie niskim i średnim. Jest to szczególnie ważne w przypadku zadań segmentacji obrazów medycznych, gdzie dostępne dane...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy nie mają nic do ujawnięcia.
To badanie zostało sfinansowane przez Narodowy Kluczowy Program B&R Chin (Numery programów 2022YFC3500200 i 2022YFC3500204).
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Adam Optimizer | — | — | Ujęte w PyTorch |
| Albumentations | Albumentations Team | v1.0+ | Biblioteka do powiększania danych |
| CUDA Toolkit | NVIDIA | v11.3+ | Przyspieszenie GPU |
| Zestaw danych Kvasir-SEG | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Wiзуalizacja krzywych treningowych |
| NumPy | NumPy Community | v1.21+ | Obliczenia numeryczne |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU do treningu i inferencji |
| OpenCV | OpenCV Community | v4.5+ | Przetwarzanie obrazów |
| Python | Python Software Foundation | v3.8+ | Język programowania |
| PyTorch | Meta Platforms | v1.12+ | Framework do uczenia głębokiego |
| Pretrenowany model ResNet-50 | PyTorch Model Zoo | — | Pretrenowany na ImageNet-1K |
| Ubuntu | Canonical | 18.04+ | System operacyjny |