$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Częstość występowania raka tarczycy gwałtownie wzrosła od 1970 roku, szczególnie wśród kobiet w średnim wieku1. Guzki tarczycy mogą przewidywać pojawienie się raka tarczycy, a większość guzków tarczycy przebiega bezobjawowo2. Wczesne wykrycie guzków tarczycy jest bardzo pomocne w leczeniu raka tarczycy. W związku z tym, zgodnie z aktualnymi wytycznymi praktyki, wszyscy pacjenci z podejrzeniem wola guzkowego w badaniu fizykalnym lub z nieprawidłowymi wynikami obrazowania powinni zostać poddani dalszym badaniom3,4.
USG tarczycy (US) jest powszechną metodą używaną do wykrywania i charakteryzowania zmian w tarczycy5,6. US to wygodna, niedroga i wolna od promieniowania technologia. Jednak zastosowanie US jest łatwo wpływane przez operator7,8. Cechy takie jak kształt, rozmiar, echogeniczność i tekstura guzków tarczycy są łatwo rozpoznawalne na zdjęciach amerykańskich. Chociaż niektóre cechy amerykańskie - zwapnienia, echogeniczność i nieregularne granice - są często uważane za kryteria identyfikacji guzków tarczycy, obecność zmienności między obserwatorami jest nieunikniona8,9. Wyniki diagnozy radiologów o różnym poziomie doświadczenia są różne. Niedoświadczeni radiolodzy są bardziej narażeni na błędną diagnozę niż doświadczeni radiolodzy. Niektóre cechy US, takie jak odbicia, cienie i echa, mogą pogorszyć jakość obrazu. To pogorszenie jakości obrazu spowodowane naturą obrazowania w USA utrudnia nawet doświadczonym lekarzom dokładne zlokalizowanie guzków.
Diagnostyka wspomagana komputerowo (CAD) guzków tarczycy szybko się rozwinęła w ostatnich latach i może skutecznie zmniejszyć liczbę błędów spowodowanych przez różnych lekarzy oraz pomóc radiologom w szybkim i dokładnym diagnozowaniu guzków10,11. Do analizy guzków tarczycy w USA zaproponowano różne systemy CAD oparte na CNN, w tym segmentation12,13, detection14,15 i classification16,17. CNN to wielowarstwowy, nadzorowany model uczenia się18, a podstawowymi modułami CNN są warstwy konwolucji i łączenia. Warstwy konwolucyjne są używane do wyodrębniania obiektów, a warstwy puli są używane do próbkowania w dół. Warstwy konwolucyjne cieni mogą wyodrębniać podstawowe cechy, takie jak tekstura, krawędzie i kontury, podczas gdy głębokie warstwy konwolucyjne uczą się cech semantycznych wysokiego poziomu.
CNN odniosły wielki sukces w dziedzinie widzenia komputerowego19,20,21. Jednak CNN nie są w stanie uchwycić długodystansowych zależności kontekstowych ze względu na ograniczone prawidłowe pole recepcyjne warstw konwolucyjnych. W przeszłości architektury szkieletowe do klasyfikacji obrazów korzystały głównie z sieci CNN. Wraz z pojawieniem się transformatora wizyjnego (ViT)22,23, trend ten uległ zmianie i obecnie wiele najnowocześniejszych modeli wykorzystuje transformatory jako szkielety. Opierając się na nienakładających się na siebie łatach obrazu, ViT używa standardowego kodera transformatora25 do globalnego modelowania relacji przestrzennych. Swin Transformer24 wprowadza dalsze okna przesunięcia do nauki funkcji. Okna przesuwu nie tylko zapewniają większą wydajność, ale także znacznie skracają długość sekwencji, ponieważ w oknie obliczana jest samouwaga. Jednocześnie interakcja między dwoma sąsiednimi oknami może odbywać się poprzez operację przesuwania (ruchu). Udane zastosowanie transformatora Swin w komputerowym widzeniu doprowadziło do zbadania architektur opartych na transformatorach do analizy obrazów ultradźwiękowych26.
Niedawno, Li et al. zaproponowali podejście do głębokiego uczenia się28 do wykrywania raka brodawkowatego tarczycy zainspirowane Faster R-CNN27. Faster R-CNN to klasyczna architektura wykrywania obiektów oparta na CNN. Oryginalny Faster R-CNN ma cztery moduły - szkielet CNN, sieć propozycji regionów (RPN), warstwę puli ROI i głowicę detekcyjną. Sieć szkieletowa CNN wykorzystuje zestaw podstawowych warstw conv+bn+relu+pooling do wyodrębniania map obiektów z obrazu wejściowego. Następnie mapy obiektów są wprowadzane do warstwy puli RPN i ROI. Rolą sieci RPN jest generowanie propozycji regionalnych. Ten moduł używa softmax do określenia, czy kotwice są dodatnie i generuje dokładne kotwice przez regresję pola ograniczenia. Warstwa puli ROI wyodrębnia mapy funkcji propozycji, zbierając mapy obiektów wejściowych i propozycje, a następnie przekazuje mapy funkcji propozycji do późniejszej głowicy wykrywania. Głowica detekcji używa map funkcji propozycji do klasyfikowania obiektów i uzyskiwania dokładnych pozycji pól wykrywania za pomocą regresji pola ograniczenia.
Ten artykuł przedstawia nową sieć wykrywania guzków tarczycy o nazwie Swin Faster R-CNN, utworzoną przez zastąpienie szkieletu CNN w Faster R-CNN przez Transformer Swin, co skutkuje lepszym wydobyciem cech wykrywania guzków z obrazów ultrasonograficznych. Ponadto sieć piramidy cech (FPN)29 służy do poprawy wydajności wykrywania modelu dla guzków o różnych rozmiarach poprzez agregację cech o różnych skalach.