$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
To badania wykorzystały publicznie dostępny, anonimowy zestaw danych; dlatego nie było wymagane wyrażenie zgody. Proponowany podejście składa się z sześciu komponentów: przetwarzanie wstępne, moduł konwolucyjny, moduł uwagi, integracja modułów konwolucyjnych i uwagi oraz warstwy w pełni połączone (FC). Rysunek 1 przedstawia pełny przepływ naszej metody.
Uzyskiwanie danych
Oznaczone obrazy rezonansu magnetycznego mózgu są uzyskiwane z publicznie dostępnego zestawu danych Kaggle, zawierającego cztery kategorie guzów i normalne tkanki.
Przetwarzanie danych
Obrazy są skalowane do jednolitej rozdzielczości i normalizowane pod względem intensywności. Opcjonalne zwiększenie (rotacja, odbicie, zoom) jest stosowane w celu poprawy generalizacji. Zestaw danych jest podzielony na zbiór treningowy (70%) i testowy (30%).
Architektura modelu
Do klasyfikacji guzów mózgu w czterech kategoriach za pomocą obrazów MRI wykorzystano trzy sieci CNN przedtrenowanych na ImageNet – MobileNetV2, EfficientNetV1 i Inception-ResNet-V2. MobileNetV2 i EfficientNetV1 zostały skonfigurowane z wymiarem wejściowym 224 x 224 pikseli, podczas gdy Inception-ResNet-V2 wymagał wielkości wejściowej 299 x 299 pikseli. W procesie uczenia transferowego, początkowe warstwy konwolucyjne były zamrożone na początku, aby zachować ogólne cechy obrazu, podczas gdy warstwy górne były dostrajane, aby dostosować model do klasyfikacji guzów mózgu. Każda baza została sparowana z lekkim nagłówkiem klasyfikacyjnym, który zawierał globalne średnie pulowanie, gęste warstwy, dropout do regularyzacji i funkcję aktywacji Softmax do przewidywania czterech klas. Dropout został zaimplementowany w celu zmniejszenia przetrenowania i poprawy generalizacji. Zaprojektowana architektura skutecznie łączyła wydajne wyodrębnianie cech z niższymi wymaganiami obliczeniowymi, ułatwiając precyzyjną klasyfikację, pozostając jednocześnie odpowiednią do wdrożenia w scenariuszach o ograniczonych zasobach i dowodach koncepcji.
Wyodrębnianie cech oparte na uważności
Wejściowe obrazy są przetwarzane przez początkową warstwę konwolucyjną, a następnie przez niestandardowy moduł uwagi. Równoległe pulowanie maksimum i średnie przechwytują ważne i kontekstowe cechy, które są scalone i udoskonalane poprzez konwolucję, aby podkreślić regiony istotne dla guza.
Konwolucyjna baza i fuzja
Wagi uwagi są przekazywane do przedtrenowanych baz (MobileNetV2, EfficientNetV1 lub Inception-ResNet-V2). Wysokiej klasy warstwy konwolucyjne są logicznie scalane, aby zmniejszyć dostęp do pamięci i poprawić wydajność obliczeniową.
Klasyfikacja
Spłaszczone cechy są przekazywane przez warstwy w pełni połączone z aktywacją ReLU6 i dropout, produkując zwarte reprezentacje dla końcowej klasyfikacji czteroklasowej z funkcją softmax.
Ocena
Wydajność modelu jest oceniana na zbiorze testowym za pomocą dokładności, precyzji, odzysku, wskaźnika F1 i macierzy pomyłek.
Rozwój frameworku
Zaproponowane rozwiązanie jest implementowane w Pythonie i używa Keras do wykonania. Tabela 1 przedstawia hiperparametry. Zestaw danych jest podzielony na zbiór treningowy i zbiór testowy według proporcji 70:30. Pięć różnych dowolnych podziałów treningu/testu jest używanych, aby wyświetlić końcową zrównoważoną wydajność dla każdego zestawu danych.
Przetwarzanie wstępne
Wejściowe obrazy muszą zostać zaktualizowane, ponieważ framework MobileNetV2 służy jako podstawa dla zaproponowanej rozwiązania. Aby wyodrębnić wysokiej rozdzielczości cechy ze zdjęć, użyto wstępnie przetrenowanego modelu MobileNetV2 z jego wymiarem wejściowym. Każdy wejściowy obraz jest następnie skalowany do 224x224 pikseli w zakresie [-1, 1].
Model konwolucji
MobileNetV2 poprawia rozpoznawanie obrazów poprzez wykorzystanie wydajnej architektury konwolucyjnej sieci neuronowej (CNN), zaprojektowanej tak, aby zminimalizować wymagania obliczeniowe. Podczas gdy tradycyjne CNN osiągają wysoką dokładność, często wymagają znacznego pamięci i mocy przetwarzania. MobileNetV1 wprowadził koncepcję przestrzennej konwolucji rozdzielnej, która oddziela standardową konwolucję na dwie odrębne operacje: konwolucję przestrzenną dla filtrowania wejść i konwolucję punktowo dla integrowania cech. MobileNetV2 opiera się na tej idei poprzez włączenie bloków resztowych butelkowych, które składają się z warstw ekspansji, konwolucji przestrzennej, warstw projekcji i połączeń resztowych. Warstwa projekcji kompresuje kanały cech, podczas gdy połączenia resztowe ułatwiają lepszy przepływ informacji w całej sieci. Aby poprawić stabilność i ulepszyć wydajność uczenia, po operacjach konwolucyjnych stosuje się funkcję aktywacji ReLU6 i normalizację wsadów.
W tym badaniu MobileNetV2, przedtrenowany na ImageNet, został użyty jako baza modelu do wyodrębniania cech, dostarczając efekt