Artykuł badawczy

Uwaga-kierowane ramy uczenia transferowego dla klasyfikacji guzów mózgu z czterema klasami za pomocą rezonansu magnetycznego

DOI:

10.3791/69087

10 lipca 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie przedstawia lekki framework oparty na uwadze i głębokim uczeniu się do klasyfikacji guzów mózgu w czterech klasach na podstawie obrazów MRI z wykorzystaniem transfer learning z MobileNetV2, EfficientNetV1 i Inception-ResNet-V2. Model osiąga wysoką dokładność klasyfikacji przy obniżonej złożoności obliczeniowej, wspierając aplikacje wspomagające decyzje kliniczne o ograniczonych zasobach.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem niniejszego badania jest opracowanie lekkiej, a jednocześnie dokładnej ramy głębokiego uczenia dla klasyfikacji guzów mózgu w czterech kategoriach—gliomy, miażdżyki, guzy przysadki i zdrowa tkanka mózgowa—z wykorzystaniem danych z obrazowania metodą rezonansu magnetycznego (MRI). Zaproponowana metodologia łączy transfer learning z trzema wstępnie wytrenowanymi modelami sieci konwolucyjnych—MobileNetV2, EfficientNetV1 i Inception-ResNet-V2—zintegrowanymi z mechanizmem uwagi, który naśladuje zdolność ludzkiego układu wzrokowego do koncentracji na klinicznie istotnych obszarach obrazu. To podejście z wykorzystaniem uwagi poprawia lokalizacje guza, jednocześnie tłumiąc nieistotne informacje tła. Rama jest oceniana na dużym, publicznie dostępnym zbiorze danych MRI mózgu zawierającym tysiące oznaczonych obrazów w czterech klasach. Zastosowano standardową preprocesję, zwiększanie danych i protokoły treningowe, aby umożliwić bezpośrednie powtórzenie zaproponowanej metody. Wyniki eksperymentów wykazują, że EfficientNetV1 osiąga najwyższą wydajność klasyfikacji, osiągając wyższą dokładność w porównaniu zarówno z MobileNetV2, jak i Inception-ResNet-V2. Badanie wynika, że zaproponowana lekka, oparta na uwagi rama skutecznie równoważy dokładność i złożoność obliczeniową, co czyni ją bardzo odpowiednią dla aplikacji opieki zdrowotnej w czasie rzeczywistym i mobilnych, szczególnie w środowiskach o ograniczonych zasobach.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dokładna klasyfikacja guzów mózgu za pomocą rezonansu magnetycznego (MRI) odgrywa kluczowa rolę w diagnostyce klinicznej, planowaniu leczenia i ocenie rokowania1. Guzy mózgu, w tym glioma, miąższoma i guzy przysadki, wykazują charakterystyczne cechy patologiczne i reakcje na leczenie; dlatego wczesne i niezawodne zidentyfikowanie jest niezbędne do poprawy wyników terapeutycznych i zmniejszenia progresji choroby. MRI jest szeroko stosowane do oceny guzów mózgu ze względu na jego doskonały kontrast tkanek miękkich, nieinwazyjność i zdolność do wizualizowania morfologii guza na wielu płaszczyznach anatomicznych. Jednak manualna interpretacja obrazów MRI jest często czasochłonna i silnie zależy od doświadczenia radiologa, zwłaszcza gdy granice guza są nieregularne lub gdy istnieją wizualne podobieństwa między klasami guzów. W związku z tym, zautomatyzowane systemy wspomagające diagnozę komputerową stały się coraz ważniejsze dla wsparcia radiologów w dokładnej i wydajnej klasyfikacji guzów.

Techniki analizy obrazów oparte na głębokim uczeniu (DL) znacząco poszerzyły zautomatyzowane klasyfikowanie chorób w zastosowaniach biomedycznych i w wizji komputerowej2,3. W neuro-onkologii, techniki uczenia maszynowego i uczenia przenoszeniowego wykazały obiecującą wydajność w wykrywaniu, segmentacji i klasyfikacji guzów4. Szczególnie, sieci konwolucyjne (CNN) wykazały doskonałą zdolność do automatycznego wyodrębniania hierarchicznych cech obrazowych bezpośrednio ze skanów MRI bez konieczności korzystania z ręcznie tworzonych cech. Architektury CNN mogą uczyć się dyskryminacyjnych reprezentacji związanych z guzem z danych obrazowych, poprawiając wydajność klasyfikacji w porównaniu z konwencjonalnymi podejściami do uczenia maszynowego. Ostatnie osiągnięcia w DL umożliwiły opracowanie wysokowydajnych systemów klasyfikacji obrazów zdolnych do przetwarzania dużych zestawów danych obrazowych z lepszą precyzją i mniejszą interwencją człowieka.

Mimo tych postępów, konwencjonalne głębokie architektury CNN często wymagają znacznych zasobów obliczeniowych, w tym dużego zużycia pamięci, zwiększonej złożoności parametrów i długiego czasu treningu5. Takie wymagania obliczeniowe ograniczają ich implementację w ograniczonych zasobowo środowiskach klinicznych i systemach opieki zdrowotnej mobilnej. Ponadto, lekkie architektury sieci konwolucyjnych przyciągnęły coraz większą uwagę ze względu na zmniejszoną złożoność obliczeniową i nadające się do wdrożenia w aplikacjach o ograniczonych zasobach5. Kilka ostatnich badań zbadano zoptymalizowane strategie CNN, wydajne mechanizmy ekstrakcji cech i lekkie ramy wdrożeniowe, aby poprawić wydajność klasyfikacji bez znacznego kompromisu w dokładności predykcji6,7,8. Jednakże, uzgadnianie wydajności obliczeniowej z solidną wydajnością klasyfikacji wieloklasowej guzów pozostaje głównym wyzwaniem w analizie guzów mózgu opartej na MRI9.

Ramy uczenia głębokiego oparte na uważności wyłoniły się jako efektywne rozwiązania dla poprawy reprezentacji cech w analizie medycznych obrazów10. Mechanizmy uważności umożliwiają sieciom neuronowym selektywne podkreślanie diagnostycznie istotnych regionów obrazu, jednocześnie tłumiąc nieistotne informacje tła. Zainspirowane ludzkim układem wzrokowym, architektury kierujące uważnością poprawiają uczenie dyskryminacyjnych cech poprzez kierowanie uwagi obliczeniowej na specyficzne dla guza przestrzenne regiony i cechy kontekstowe. Takie mechanizmy są szczególnie korzystne dla analizy MRI guzów mózgu, ponieważ tkanki guza często wykazują heterogeniczne wzorce intensywności, nieregularną morfologię i nakładające się cechy wizualne między kategoriami guzów. W związku z tym, integracja modułów uważności do architektur opartych na CNN może poprawić dokładność klasyfikacji i poprawić wydajność lokalizowania cech.

Kilka ostatnich badań wykazało potencjał ram uczenia głębokiego dla zautomatyzowanej diagnozy guzów mózgu i klasyfikacji guzów opartej na MRI11,12. Gao i wsp. opracowali i zweryfikowali model DL do diagnozy guzów mózgu za pomocą danych MRI, wykazując silną zdolność klasyfikacji dla zautomatyzowanej analizy neuroobrazowej11. Podobnie, Abdusalomov i wsp. zbadali podejścia do wykrywania guzów mózgu opartych na DL przy użyciu skanów MRI i zgłosili obiecującą wydajność diagnostyczną12. Chociaż te badania osiągnęły lepszą dokładność klasyfikacji, ograniczenia dotyczące zróżnicowania zestawu danych, generalizacji modelu i wymagań obliczeniowych pozostają nierozwiązane. W wielu przypadkach, zbiory treningowe były ograniczone pod względem wielkości lub pochodzenia z ograniczonych źródeł klinicznych, co zwiększa ryzyko przetrenowania i zmniejsza trwałość w populacjach pacjentów o różnorodnych cechach.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badania wykorzystały publicznie dostępny, anonimowy zestaw danych; dlatego nie było wymagane wyrażenie zgody. Proponowany podejście składa się z sześciu komponentów: przetwarzanie wstępne, moduł konwolucyjny, moduł uwagi, integracja modułów konwolucyjnych i uwagi oraz warstwy w pełni połączone (FC). Rysunek 1 przedstawia pełny przepływ naszej metody.

Uzyskiwanie danych
Oznaczone obrazy rezonansu magnetycznego mózgu są uzyskiwane z publicznie dostępnego zestawu danych Kaggle, zawierającego cztery kategorie guzów i normalne tkanki.

Przetwarzanie danych
Obrazy są skalowane do jednolitej rozdzielczości i normalizowane pod względem intensywności. Opcjonalne zwiększenie (rotacja, odbicie, zoom) jest stosowane w celu poprawy generalizacji. Zestaw danych jest podzielony na zbiór treningowy (70%) i testowy (30%).

Architektura modelu
Do klasyfikacji guzów mózgu w czterech kategoriach za pomocą obrazów MRI wykorzystano trzy sieci CNN przedtrenowanych na ImageNet – MobileNetV2, EfficientNetV1 i Inception-ResNet-V2. MobileNetV2 i EfficientNetV1 zostały skonfigurowane z wymiarem wejściowym 224 x 224 pikseli, podczas gdy Inception-ResNet-V2 wymagał wielkości wejściowej 299 x 299 pikseli. W procesie uczenia transferowego, początkowe warstwy konwolucyjne były zamrożone na początku, aby zachować ogólne cechy obrazu, podczas gdy warstwy górne były dostrajane, aby dostosować model do klasyfikacji guzów mózgu. Każda baza została sparowana z lekkim nagłówkiem klasyfikacyjnym, który zawierał globalne średnie pulowanie, gęste warstwy, dropout do regularyzacji i funkcję aktywacji Softmax do przewidywania czterech klas. Dropout został zaimplementowany w celu zmniejszenia przetrenowania i poprawy generalizacji. Zaprojektowana architektura skutecznie łączyła wydajne wyodrębnianie cech z niższymi wymaganiami obliczeniowymi, ułatwiając precyzyjną klasyfikację, pozostając jednocześnie odpowiednią do wdrożenia w scenariuszach o ograniczonych zasobach i dowodach koncepcji.

Wyodrębnianie cech oparte na uważności
Wejściowe obrazy są przetwarzane przez początkową warstwę konwolucyjną, a następnie przez niestandardowy moduł uwagi. Równoległe pulowanie maksimum i średnie przechwytują ważne i kontekstowe cechy, które są scalone i udoskonalane poprzez konwolucję, aby podkreślić regiony istotne dla guza.

Konwolucyjna baza i fuzja
Wagi uwagi są przekazywane do przedtrenowanych baz (MobileNetV2, EfficientNetV1 lub Inception-ResNet-V2). Wysokiej klasy warstwy konwolucyjne są logicznie scalane, aby zmniejszyć dostęp do pamięci i poprawić wydajność obliczeniową.

Klasyfikacja
Spłaszczone cechy są przekazywane przez warstwy w pełni połączone z aktywacją ReLU6 i dropout, produkując zwarte reprezentacje dla końcowej klasyfikacji czteroklasowej z funkcją softmax.

Ocena
Wydajność modelu jest oceniana na zbiorze testowym za pomocą dokładności, precyzji, odzysku, wskaźnika F1 i macierzy pomyłek.

Rozwój frameworku
Zaproponowane rozwiązanie jest implementowane w Pythonie i używa Keras do wykonania. Tabela 1 przedstawia hiperparametry. Zestaw danych jest podzielony na zbiór treningowy i zbiór testowy według proporcji 70:30. Pięć różnych dowolnych podziałów treningu/testu jest używanych, aby wyświetlić końcową zrównoważoną wydajność dla każdego zestawu danych.

Przetwarzanie wstępne
Wejściowe obrazy muszą zostać zaktualizowane, ponieważ framework MobileNetV2 służy jako podstawa dla zaproponowanej rozwiązania. Aby wyodrębnić wysokiej rozdzielczości cechy ze zdjęć, użyto wstępnie przetrenowanego modelu MobileNetV2 z jego wymiarem wejściowym. Każdy wejściowy obraz jest następnie skalowany do 224x224 pikseli w zakresie [-1, 1].

Model konwolucji
MobileNetV2 poprawia rozpoznawanie obrazów poprzez wykorzystanie wydajnej architektury konwolucyjnej sieci neuronowej (CNN), zaprojektowanej tak, aby zminimalizować wymagania obliczeniowe. Podczas gdy tradycyjne CNN osiągają wysoką dokładność, często wymagają znacznego pamięci i mocy przetwarzania. MobileNetV1 wprowadził koncepcję przestrzennej konwolucji rozdzielnej, która oddziela standardową konwolucję na dwie odrębne operacje: konwolucję przestrzenną dla filtrowania wejść i konwolucję punktowo dla integrowania cech. MobileNetV2 opiera się na tej idei poprzez włączenie bloków resztowych butelkowych, które składają się z warstw ekspansji, konwolucji przestrzennej, warstw projekcji i połączeń resztowych. Warstwa projekcji kompresuje kanały cech, podczas gdy połączenia resztowe ułatwiają lepszy przepływ informacji w całej sieci. Aby poprawić stabilność i ulepszyć wydajność uczenia, po operacjach konwolucyjnych stosuje się funkcję aktywacji ReLU6 i normalizację wsadów.

W tym badaniu MobileNetV2, przedtrenowany na ImageNet, został użyty jako baza modelu do wyodrębniania cech, dostarczając efekt

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Three pre-trained deep learning models, namely MobileNetV2, EfficientNetV1, and Inception-ResNet-V2, were evaluated for four-class brain tumor classification using MRI images.

Dataset Used
The proposed framework was evaluated using a publicly available brain tumor MRI dataset obtained from the Kaggle platform. The dataset consisted of 835 normal brain MRI images, 826 glioma images, 822 meningioma images, and 827 pituitary tumor images. Representative MRI samples from the...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

Ocena wydajności, oparta na dokładności, odzyskaniu, wynikach F1 i precyzji, ujawnia, że zarówno MobileNetV2, jak i Inception-ResNet-V2 osiągają porównywalne wyniki w klasyfikacji guzów mózgu, osiągając łączną i ważoną średnią dokładność 97–98%. Natomiast EfficientNet przewyższa pozostałe modele, osiągając 99% dokładności według wskaźników makro i ważonej średniej, dzięki swojej ulepszonej generalizacji i strategii skalowania złożonego. Te wyniki są zgodne z poprzednimi badaniami wykazującymi skuteczność architek...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają konfliktów interesów do zadeklarowania.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Na niniejsze badanie nie otrzymano żadnych zewnętrznych funduszy.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

```html

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Brain MRI DatasetIEEEhttps://dx.doi.org/10.21227/q2vt-tf46Zestaw danych MRI jest pobierany z dostępem instytucjonalnym. Zestaw danych MRI zawiera cztery klasy: glioma, miażdżyca, guz przysadki i normalny mózg
CNN Accelerator (Layer Fusion)Proponowana pracaLogiczne łączenie górnych warstw konwolucyjnych w celu zmniejszenia dostępu do pamięci i poprawy efektywności obliczeniowej
Custom Attention ModuleProponowana pracaMechanizm uwagi integrujący max-pooling i average-pooling w celu podkreślenia regionów związanych z guzem
EfficientNetV1GooglePre-trained (ImageNet)Skalowany architektura CNN zapewniająca optymalny stosunek dokładności do efektywności
Google ColaboratoryGooglehttps://colab.research.google.com/Środowisko oparte na chmurze używane do trenowania modeli, oceny i eksperymentowania z obsługą GPU
Inception-ResNet-V2GooglePre-trained (ImageNet)Głęboka hybrydowa architektura CNN łącząca moduły Inception z połączeniami resztkowymi
KerasGooglev2.6.0Wysokiego poziomu API sieci neuronowych zbudowane na TensorFlow do szybkiego prototypowania modeli
MatplotlibMatplotlib Developersv3.4.3Biblioteka wizualizacji używana do rysowania krzywych trenowania, macierzy pomyłek i wskaźników wydajności
MobileNetV2GooglePre-trained (ImageNet)Lekka główna struktura CNN zoptymalizowana pod względem wdrożenia mobilnego i na brzegu
NumPyNumPy Developersv1.21.4Podstawowa biblioteka do obliczeń naukowych używana do operacji numerycznych
PandasPandas Development Teamv1.3.4Biblioteka do obsługi i manipulacji danymi używana do organizacji zestawu danych i przetwarzania metadanych
PythonPython Software Foundationv3.8.10Główny język programowania używany do przetwarzania danych, opracowywania modeli i oceny
Scikit-learnScikit-learn DevelopersNajnowsza stabilnaUżywane do metryk oceny wydajności, takich jak precyzja, czułość, wynik F1 i macierze pomyłek
SeabornSeaborn DevelopersNajnowsza stabilnaBiblioteka wizualizacji statystycznych na wysokim poziomie używana do ulepszanej analizy graficznej
TensorFlowGooglev2.6.0End-to-end framework do głębokiego uczenia się używany do implementacji głównych struktur CNN i modułów uwagi
```

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Badania nad rakiemWydanie 233Wydanie 233MobileNetV2EfficientNetV1Inception ResNet V2

Powiązane artykuły