$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
To badanie wykorzystało publicznie dostępny, anonimowy zestaw danych; dlatego nie była wymagana pisemna zgoda. Zaproponowany podejście obejmuje sześć komponentów: przetwarzanie wstępne, moduł konwolucji, moduł uwagi, integrację modułów konwolucji i uwagi oraz warstwy w pełni połączone (FC). Rysunek 1 przedstawia pełen przepływ naszej metody.
Uzyskiwanie danych
Oznaczone obrazy rezonansowe jąder mózgu pochodzą z publicznie dostępnego zestawu danych Kaggle, zawierającego cztery kategorie guzów i tkanki normalnej.
Przetwarzanie danych
Obrazy są skalowane do jednolitej rozdzielczości i normalizowane pod względem intensywności. Opcjonalnie stosuje się zwiększenie (rotacja, odbicie, zoom) w celu poprawy uogólnienia. Zestaw danych jest podzielony na zbiór treningowy (70%) i testowy (30%).
Architektura modelu
Do klasyfikacji guzów mózgu w czterech kategoriach za pomocą obrazów MRI wykorzystano trzy sieci CNN pretrenowanych na ImageNet - MobileNetV2, EfficientNetV1 i Inception-ResNet-V2. MobileNetV2 i EfficientNetV1 zostały skonfigurowane z wymiarem wejściowym 224 × 224 pikseli, podczas gdy Inception-ResNet-V2 wymagał rozmiaru wejścia 299 × 299 pikseli. W procesie uczenia transferowego początkowe warstwy konwolucyjne były zamrożone na początku, aby zachować ogólne cechy obrazu, podczas gdy warstwy górne były dostrajane, aby dostosować model do klasyfikacji guzów mózgu. Każdy szkielet został sparowany z lekkim nagłówkiem klasyfikującym, który zawierał globalne średnie pulowanie, gęste warstwy, dropout do regularyzacji i funkcję aktywacji Softmax do przewidywania czterech klas. Dropout został zaimplementowany, aby złagodzić przetrenowanie i poprawić uogólnienie. Zaprojektowana architektura skutecznie łączyła wydajne wyodrębnianie cech z niższymi wymaganiami obliczeniowymi, ułatwiając precyzyjną klasyfikację, pozostając jednocześnie odpowiednia do wdrożenia w scenariuszach ograniczonych zasobów i dowodu koncepcji.
Ekstrakcja cech oparta na uważności
Wejściowe obrazy są przetwarzane przez początkową warstwę konwolucyjną, po czym następuje niestandardowy moduł uwagi. Równoległe max pooling i average pooling wychwytują saliencyjne i kontekstowe cechy, które są sklejane i udoskonalane poprzez konwolucję, aby podkreślić regiony istotne dla guza.
Konwolucyjny szkielet i fuzja
Uwagowe ważone cechy są przekazywane do wstępnie nauczonych szkieletów (MobileNetV2, EfficientNetV1 lub Inception-ResNet-V2). Wysokiej klasy warstwy konwolucyjne są logicznie scalone, aby zmniejszyć dostęp do pamięci i poprawić efektywność obliczeniową.
Klasyfikacja
Spłaszczone cechy są przekazywane przez warstwy w pełni połączone z aktywacją ReLU6 i dropout, generując kompaktowy reprezentacji dla ostatecznej klasyfikacji softmax w czterech klasach.
Oceny
Wydajność modelu jest oceniana na zbiorze testowym za pomocą dokładności, precyzji, odzysku, wskaźnika F1 i macierzy pomyłek.
Rozwijanie frameworku
Zaproponowane rozwiązanie jest zaimplementowane w Pythonie i używa Keras do wykonania. Tabela 1 przedstawia hiperparametry. Zestaw danych jest podzielony na zestaw treningowy i zbiór testowy w proporcji 70:30. Pięć różnych dowolnych podziałów tren/test służy do wyświetlania ostatecznej zrównoważonej wydajności dla każdego zestawu danych.
Przetwarzanie wstępne
Wejściowe obrazy muszą zostać zaktualizowane, ponieważ ramowy MobileNetV2 służy jako fundament dla zaproponowanego rozwiązania. Aby wyodrębnić cechy o wysokiej rozdzielczości z fotografii, wykorzystywany jest wstępnie nauczony model MobileNetV2 z jego wymiarem wejściowym. Każdy wejściowy obraz jest następnie skalowany do 224×224 pikseli w zakresie [-1, 1].
Model konwolucji
MobileNetV2 poprawia rozpoznawanie obrazów poprzez wykorzystanie wydajnej architektury sieci neuronowej konwolucyjnej (CNN), zaprojektowanej w celu zminimalizowania wymagań obliczeniowych. Podczas gdy tradycyjne CNN osiągają wysoką dokładność, często wymagają znacznych zasobów pamięci i mocy obliczeniowej. MobileNetV1 wprowadził koncepcję przestrzennej konwolucji oddzielnej, która oddziela standardową konwolucję na dwie odrębne operacje: konwolucję przestrzenną do filtrowania wejść i konwolucję punktowo do integrowania funkcji. MobileNetV2 rozwija tę ideę, wprowadzając bloki rezydualne butelkowe, które składają się z warstw ekspansji, konwolucji przestrzennej, warstw projekcji i połączeń rezydualnych. Warstwa projekcji kompresuje kanały funkcji, podczas gdy połączenia rezydualne ułatwiają lepszy przepływ informacji w całej sieci. Aby poprawić stabilność i zwiększyć wydajność uczenia, aktywację ReLU6 i normalizację wsadów stosuje się po operacjach konwolucyjnych.
W tym badaniu MobileNetV2, wstępnie nauczone na ImageNet, zostało użyte jako model szkieletowy do wyodr