Artykuł badawczy

HMP-MUNet: Hybrydowe ramy głębokiego uczenia do automatycznego segmentowania zmian skórnych na obrazach dermoskopowych

166 wyświetleń

DOI:

10.3791/69449

17 marca 2026

* These authors contributed equally

W tym artykule

Podsumowanie

HMP-MUNet wprowadza hybrydowe ramy głębokiego uczenia do automatycznego segmentowania zmian skórnych. Integrując modele stanów-przestrzeni z wieloskalowymi mechanizmami uwagi, zwiększa dokładność segmentacji i optymalizuje efektywność obliczeniową, oferując solidne rozwiązanie w diagnostyce raka skóry w warunkach klinicznych.

Streszczenie

Komputerowo wspomagane systemy diagnostyczne zmian skórnych napotykają poważne wyzwania w osiąganiu wysokiej dokładności diagnostycznej oraz efektywności obliczeniowej. Obecne podejścia do głębokiego uczenia często wymagają znacznych zasobów obliczeniowych, jednocześnie trudno uchwycić złożone warianty morfologiczne charakterystyczne dla zmian skórnych na różnych skalach. High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), nowatorski framework deep learning, który odpowiada tym ograniczeniom poprzez innowacyjny projekt architektoniczny łączący modele stan-przestrzenne z zaawansowanymi możliwościami przetwarzania wieloskalowego.

Podejście opisane w tym badaniu integruje hybrydowy framework U-Net, który łączy moduł stanu przestrzeni stanów wysokiego rzędu do globalnego modelowania kontekstu, wieloskalową sieć fuzji uwagi o dylatacji uwagi do hierarchicznej ekstrakcji cech w wielu polach recepcyjnym oraz równoległą, wielogłęboką elastyczną sieć do optymalizacji obliczeniowej. Ta architektura wykorzystuje zmodyfikowany enkoder-dekoder w kształcie litery U z większymi wymiarami kanału i zaawansowanymi mechanizmami uwagi, aby usprawnić uczenie cech.

Kompleksowa ocena zbiorów danych benchmarkowych pokazuje współczynnik podobieństwa kości na poziomie 95,85% dla PH2 i 90,44% dla ISIC2018. Model osiąga tę lepszą dokładność przy użyciu zaledwie 7,61 mln parametrów, co stanowi imponujące 72,2% spadek w porównaniu z istniejącymi architekturami Vision Mamba, zachowując jednocześnie wysoką dokładność segmentacji. Lekka konstrukcja wykazuje potencjał do zastosowania w różnych środowiskach klinicznych i metodach obrazowania, w oczekiwaniu na zatwierdzenie kliniczne, od specjalistycznych ośrodków dermatologicznych po placówki podstawowej opieki zdrowotnej.

HMP-MUNet oferuje zautomatyzowane rozwiązanie segmentacji zmian skórnych, które poprawia spójność diagnostyczną i wspiera procesy kliniczne, z potencjałem dalszej walidacji w zastosowaniu klinicznym. Integracja możliwości modelowania wysokiego rzędu z praktycznymi aspektami wdrożenia oferuje potencjalne rozwiązanie dla usprawnienia protokołów przesiewowych raka skóry oraz rozszerzenia dostępności opieki zdrowotnej w aplikacjach diagnostyki wspomaganej komputerowo.

Wprowadzenie

Systemy diagnostyki wspomaganej komputerowo (CAD) mają na celu usprawnienie praktyk obrazowania medycznego w różnych specjalizacjach klinicznych, wzmacniając podejścia do wykrywania, diagnozowania i planowania leczenia1. W dermatologii integracja sztucznej inteligencji (AI) i zaawansowanych technik obrazowania stała się kluczowym narzędziem do poprawy dokładności diagnostycznej i wyników klinicznych, szczególnie we wczesnym wykrywaniu raka skóry, który stanowi około 90% wszystkich nowotworów skóry2. Rozwój zaawansowanych algorytmicznych metod do automatycznej analizy zmian skórnych przyczynia się do rozwoju medycyny precyzyjnej, umożliwiając standaryzowane, powtarzalne wsparcie diagnostyczne, które usprawnia podejmowanie decyzji klinicznych w różnych placówkach opieki zdrowotnej 3,4.

Nowoczesne obrazowanie dermatologiczne obejmuje wiele metod, w tym dermoskopię, fotografię cyfrową, optyczną tomografię koherencyjną oraz systemy obrazowania wielospektralnego5. Lekarze wykorzystują obrazy dermoskopowe do ręcznej diagnozy raka skóry za pomocą pracochłonnych i czasochłonnych metod, które wymagają dużej wiedzy6. Wyzwanie związane z utrzymaniem spójności diagnostycznej w różnych warunkach klinicznych i warunkach obrazowania przyczyniło się do rozwoju systemów CAD zapewniających obiektywną, ilościową analizę zmian skórnych. Segmentacja zmian skórnych na podstawie obrazów dermoskopowych stanowi podstawowy etap wstępnego przetwarzania, który bezpośrednio wpływa na dokładność klasyfikacji i użyteczność kliniczną7. Zazwyczaj komputerowo wspomagana diagnostyka raka skóry obejmuje pięć etapów: pozyskiwanie obrazów, wstępne przetwarzanie, segmentację, ekstrakcję cech oraz klasyfikację8. Precyzyjne wyznaczenie granic jest niezbędne do dokładnej charakterystyki zmian, umożliwiając klinicystom ocenę cech morfologicznych, takich jak asymetria, nieregularność granic, zmienność koloru i średnica — kluczowe parametry w ustalonych kryteriach diagnostycznych9.

Pojawienie się modeli stanów-przestrzeni (SSM), szczególnie architektury Mamba, oferuje liniową złożoność obliczeniową, poprawiając efektywność obliczeniową przy jednoczesnym zachowaniu zaawansowanych możliwości modelowania zależności na daleki zasięg10. Najnowsze osiągnięcia w segmentacji zmian skórnych11, takie jak U-Net9, Att-UNet12, UTNetV213 oraz UNet++14 , wykazały znaczącą poprawę dokładności segmentacji. Na przykład U-Net osiąga współczynnik podobieństwa kości (DSC) na poziomie 87,55% na zbiorze danych ISIC2018, podczas gdy UNet++ osiąga 87,83%, a Att-UNet 87,91%. Na zbiorze danych PH2 U-Net osiąga DSC na poziomie 90,6%, natomiast C2SDG15 i SCR-Net16odpowiednio 90,3% i 89,89%. HMP-MUNet ulepsza te modele, integrując wieloskalowy mechanizm uwagi i możliwości przetwarzania równoległego, zmniejszając liczbę parametrów o 72,2%, jednocześnie osiągając wyższą dokładność przy DSC 95,85% na zbiorze danych PH2 i 90,44% na zbiorze danych ISIC2018. Biorąc pod uwagę znaczenie równoważenia zdolności uczenia się reprezentacji wizualnej z zużyciem zasobów obliczeniowych, badanie ogólnych architektur klasyfikacji obrazów medycznych, które osiągają optymalne kompromisy, jest istotne dla rozwoju inteligentnych systemów diagnostyki klinicznej17. Strukturalne ramy SSM przestrzenne wzmacniają tradycyjne architektury Mamba poprzez optymalizację macierzy przejść stanów, poprawę efektywności obliczeniowej oraz redukcję narzutu pamięci — cechy niezbędne do zastosowania klinicznego w różnych modalnościach obrazowania18.

Najnowsze badania pokazują, że architektury Vision Mamba, szczególnie te wykorzystujące High-order Vision Mamba Switching Scheme (H-VSS), osiągają lepszą wydajność przy znacznie mniejszej liczbie parametrów w porównaniu z konwencjonalnymi transformatorami, co czyni je szczególnie odpowiednimi do integracji klinicznych przepływówpracy 19. Jednak istniejące implementacje Vision Mamba napotykają jednak wyzwania, w tym ograniczenia zużycia pamięci oraz skalowalność w warunkach wdrożenia klinicznego20. Obecne metody segmentacji obrazów medycznych dzielą się zazwyczaj na modele CNN i oparte na transformatorach, gdzie tradycyjne CNN są ograniczone przez ograniczenia pola recepcyjnego, co utrudnia długoterminowe przechwytywanie zależności21. W obrazowaniu medycznym rozróżnienie kluczowych obszarów, takich jak zmiany, od zdrowej skóry, wymaga wysokiej precyzji, co wymaga zastosowania zaawansowanych rozwiązań technologicznych w celu rozwiązania tych wyzwań22. Współczesne architektury segmentacji ewoluowały, aby sprostać specyficznym wymaganiom klinicznym, w tym efektywności obliczeniowej dla zastosowań w czasie rzeczywistym, dokładności w kluczowych zadaniach diagnostycznych oraz odporności na różnorodnych protokołach obrazowania23. Zaawansowane warianty U-Net, obejmujące mechanizmy uwagi, wieloskalowe strategie fuzji cech oraz enkodery oparte na transformatorach, wykazały wyższą wydajność w złożonych scenariuszach obrazowania medycznego12,24. Te innowacje architektoniczne bezpośrednio wzmacniają zastosowania kliniczne, umożliwiając dokładne wyznaczanie struktur anatomicznych, identyfikację regionów patologicznych oraz ekstrakcję ilościowych biomarkerów, co jest kluczowe dla medycyny opartej na dowodachnaukowych 25,26. Jednak wyzwania integracyjne, takie jak kompatybilność interfejsów z istniejącą elektroniczną dokumentacją medyczną (EMR), przechowywanie i pobieranie dużych obrazów oraz interoperacyjność między różnymi systemami instytucjonalnymi, pozostają istotnymi przeszkodami dla szerokiego przyjęcia klinicznego27.

Niniejszy artykuł wprowadza High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), nowatorski system CAD specjalnie zaprojektowany do automatycznego segmentowania zmian skórnych w praktyce klinicznej. Ramy te odpowiadają na kluczowe luki w obecnych systemach obrazowania medycznego, wprowadzając innowacyjne elementy architektoniczne: Multi-Scale Dilated Attention Fusion Network (MSDAFN) oraz Parallel Multi-depth Flexible Network (PMFlex). MSDAFN wdraża zaawansowane strategie ekstrakcji cech, łączące mechanizmy przestrzennej i kanałowej uwagi z wieloskalowymi rozszerzeniami splotowymi, umożliwiającymi lepsze wykrywanie subtelnych cech zmian na różnych skalach — kluczowe dla dokładnej diagnozy różnych typów zmian spotykanych w praktyce klinicznej28. PMFlex wprowadza możliwości przetwarzania równoległego, umożliwiając jednoczesną analizę wielu strumieni wejściowych, znacząco poprawiając efektywność obliczeniową przy jednoczesnym zachowaniu możliwości modelowania wysokiego rzędu, niezbędnych do dokładności klinicznej29. HMP-MUNet, dzięki swoim innowacyjnym technikom segmentacji i strategiom obliczeniowym, dąży do przesuwania granic diagnozy raka skóry, umożliwiając dokładną i dokładną diagnostykę kliniczną w czasie rzeczywistym30,31.

Główne osiągnięcia tych badań są zgodne z głównymi celami rozwoju CAD w obrazowaniu medycznym: ulepszonym modelowaniu kontekstu globalnego dzięki MSDAFN poprawiającym ekstrakcję cech i efektywność fuzji dla precyzyjnej lokalizacji zmian w różnych prezentacjach klinicznych; efektywne przetwarzanie równoległe dzięki PMFlex, zmniejszające narzut obliczeniowy przy zachowaniu dokładności klinicznej, ułatwiając wdrożenie w środowiskach klinicznych o ograniczonych zasobach; optymalizacja wdrożenia klinicznego poprzez projektowanie świadome sprzętu, umożliwiające efektywne przetwarzanie wysokorozdzielczych obrazów dermoskopowych wspierających procesy kliniczne w czasie rzeczywistym; Wyniki kliniczne wykazane poprzez kompleksową ocenę na standardowych zbiorach danych z metrykami wydajności odpowiednimi do integracji klinicznej; oraz zintegrowane rozwiązanie diagnostyczne łączące modelowanie wysokiego rzędu, analizę wieloskalową i obliczenia równoległe, oferujące kompleksowe rozwiązania dla precyzyjnej diagnostyki dermatologicznej. Badania te rozwijają komputerowe obrazowanie medyczne, dostarczając innowacyjne, klinicznie praktyczne rozwiązania odpowiadające zarówno na wymagania technologiczne, jak i praktyczne dotyczące zautomatyzowanej analizy zmian skórnych we współczesnych placówkach opieki zdrowotnej.

Framework został zaprojektowany do obsługi obrazów dermoskopowych o wysokiej rozdzielczości, zazwyczaj o rozdzielczościach wejściowych 256 × 256, zapewniając równowagę między efektywnością obliczeniową a szczegółowością obrazu. Jednak zmienność sprzętu i jakości obrazu, taka jak różnice w oświetleniu, odcieniu skóry czy obecności włosów, może wpływać na wydajność segmentacji. Pomimo tych wyzwań, projekt systemu jest zoptymalizowany pod kątem klinicznych procesów w czasie rzeczywistym i można go dostosować do różnych urządzeń obrazujących, zapewniając solidną wydajność w różnorodnych środowiskach klinicznych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Badania te zostały przeprowadzone zgodnie z wytycznymi instytucjonalnymi dotyczącymi badań obliczeniowych i przetwarzania danych. W badaniu nie brał udziału żaden człowiek ani kręgowce.

Przygotowanie i wstępne przetwarzanie zbioru danych

Zbieranie i organizacja zbiorów danych

Zdjęcia dermoskopowe zostały zebrane z zbiorów danych PH2, ISIC2018 i ISIC2017, z konkretnymi linkami podanymi w Tabeli Materiałów. Zbiór danych PH2 zawiera 200 obrazów o wysokiej rozdzielczości (1000 × 1000 pikseli), ISIC2018 2 594 obrazy z odpowiadającymi maskami segmentacyjnymi, a ISIC2017 2 150 obrazów z maskami segmentacyjnymi. Dane zostały zorganizowane w zestawy treningowe, walidacyjne i testowe zgodnie ze standardowymi protokołami, zapewniając, że obrazy są w kompatybilnych formatach (np. .jpg, .png lub .tiff) oraz zawierają odpowiadające im maski ground truth w formacie binarnym.

Dane były organizowane w zestawy treningowe, walidacyjne i testowe zgodnie ze standardowymi protokołami. Zbiory danych zostały podzielone następująco: dla ISIC2018 przydzielono 1 815 obrazów do treningu, 259 do walidacji i 520 do testów. Dla ISIC2017 przeznaczono 1 500 obrazów na szkolenia, 220 na walidację i 430 na testy. W przypadku PH2 zbiór danych podzielono na 160 obrazów treningowych, 10 obrazów walidacyjnych oraz 30 obrazów testowych. Przez cały proces przetwarzania wstępnego utrzymywano stałą rozdzielczość obrazu wynoszącą 256 × 256 pikseli.

Augmentacja i normalizacja danych

Zastosowano techniki uzupełniania danych, aby usprawnić uogólnianie modeli. Zastosowano poziome przewracanie, pionowe przewracanie oraz losowy obrót w zakresie ±15°. Zastosowano korektę gamma i transformację logarytmiczną z prawdopodobieństwem 0,3 każda. Wartości pikseli zostały znormalizowane za pomocą statystyk ImageNet (średnia = [0,485, 0,456, 0,406], odchylenie standardowe = [0,229, 0,224, 0,225]).

Zmień rozmiar wszystkich obrazów wejściowych do 256 × 256 pikseli: Aby zapewnić efektywność obliczeniową, wszystkie obrazy wejściowe zostały zmienione do jednolitej rozdzielczości 256 × 256 pikseli. Podczas gdy obrazy o wysokiej rozdzielczości, takie jak te w zbiorze danych (1000 × 1000 pikseli), zawierają drobnoziarniste detale i informacje teksturalne kluczowe dla dokładnego wyznaczania granic zmian, zwiększenie rozdzielczości nie poprawiło znacząco wydajności modelu. Dlatego rozdzielczość nie została zwiększona, aby zachować równowagę między efektywnością obliczeniową a dokładnością modelu. Przyszłe badania mogą dalej badać wpływ danych wejściowych o wyższej rozdzielczości, aby ustalić, czy korzyści z dokładności segmentacji uzasadniają wzrost kosztów obliczeniowych. Obrazy były konwertowane do formatu RGB, gdy było to konieczne. Dane przetworzone wcześniej były zapisywane w katalogach strukturalnych, zachowując oryginalne podziały zbioru danych.

Implementacja architektury HMP-MUNet

Projektowanie architektury sieci

HMP-MUNet został skonfigurowany według hierarchicznej struktury enkodera-dekodera w kształcie litery U, jak pokazano na Rysunku 1. Sieć była skonfigurowana z progresywną rozbudową kanałów: 8→16→32→64→128→256 kanałów na poziomach enkodera.

Znaczącą zmianą architektoniczną wprowadzono zmniejszenie głębokości sieci z czterech poziomów hierarchicznych do dwóch, co upraszcza model i poprawia efektywność obliczeniową. Chociaż głębokość została zmniejszona, wymiary kanału były zwiększane na każdym poziomie, co umożliwiło sieci uchwycenie bogatszych i bardziej wyrazistych cech. Aby jeszcze bardziej wzmocnić uczenie się cech modelu, wprowadzono mechanizmy uwagi, które skoncentrowały sieć na najbardziej istotnych cechach w różnych skalach. Te mechanizmy uwagi skutecznie kompensują potencjalną utratę hierarchicznej abstrakcji cech spowodowaną płytszą architekturą.

Koder został zainicjowany podwójnymi operacjami Conv2D do początkowej ekstrakcji cech z tensorów wejściowych X(C, H×W). Wprowadzono naprzemienną konfigurację trzech wyspecjalizowanych modułów: High-order Vision Mamba-based Switching Scheme (H-VSS), Parallel Multi-depth Flexible Network (PMFlex) oraz Multi-Scale Dilated Attention Fusion Network (MSDAFN).

Model wykorzystuje statystyki ImageNet (średnią i odchylenie standardowe) do normalizacji, eliminując konieczność ponownego obliczania dla każdego zbioru danych, co zwiększa efektywność obliczeniową. Zapewnia stabilność i uogólnialność, wykorzystując szerokie zastosowanie ImageNet w zadaniach widzenia komputerowego. Ten wybór upraszcza projektowanie, zmniejszając złożoność wstępnego przetwarzania i poprawia przenośność między zbiorami danych, pozwalając modelu skutecznie uogólniać na różnorodne obrazy zmian skórnych.

Implementacja schematu przełączania opartego na mamba wysokiego rzędu (H-VSS)

Moduł H-VSS został zaimplementowany zgodnie z architekturą przedstawioną na Rysunku 2. Normalizacja warstw (LN) i aktywacja Hardswisha (HS) zostały skonfigurowane z połączeniami resztkowymi zgodnie z Równaniem (1):

figure-protocol-1

Komponent Local Spatial Descriptor (LSD) został wdrożony, aby utrzymać spójność przestrzenną. Moduł Spatial Selective 2D Scanning (SS2D) został skonfigurowany z wielokierunkowymi wzorcami skanowania zgodnie z Równaniem (2):

figure-protocol-2

Dodano przetwarzanie wielowarstwowego Perceptron (MLP) z połączeniami rezydualnymi, zgodnie z Równaniem (3):

figure-protocol-3

Mechanizm High-order 2D Selective Scanning (H-SS2D) projektuje funkcje wejściowe do przestrzeni 2C w celu ulepszonego modelowania kontekstowego.

Implementacja równoległej wielogłębokiej elastycznej sieci (PMFlex)

Moduł PMFlex został skonfigurowany zgodnie ze specyfikacją Rysunku 3 . Zastosowano normalizację warstw do wejścia map cech X(C, H×W), a następnie podział na cztery segmenty wzdłuż wymiaru kanału, zgodnie z równaniem (4):

figure-protocol-4

Każda segmentowana funkcja Y_i przetwarzana przez wspólne moduły Visual Mamba (VMamba). Przetworzone wyjścia były łączone, a dopracowywanie stosowano poprzez normalizację warstw i projekcję, jak opisano w równaniu (5):

figure-protocol-5

Implementacja wieloskalowej sieci fuzji uwagi (MSDAFN)

Moduł MSDAFN został zaimplementowany według architektury Rysunku 4. Równoległe operacje splotowe zostały skonfigurowane z szybkościami dylatacji 6, 12 i 18 dla wieloskalowej ekstrakcji cech zgodnie z Równaniem (6):

figure-protocol-6

Cechy wieloskalowe zostały zintegrowane poprzez konkatenację kanałów, zgodnie z Równaniem (7):

figure-protocol-7

Wprowadzono mechanizmy podwójnej uwagi do rekalibracji cech. Wagi uwagi kanału zostały obliczone przy użyciu globalnej średniej pulacji według równania (8):

figure-protocol-8

Ważenie uwagi kanału zostało zastosowane zgodnie z Równaniem (9):

figure-protocol-9

Uwaga przestrzenna była konfigurowana za pomocą operacji splotowych zgodnie z Równaniem (10):

figure-protocol-10

Uwaga kanałowa i przestrzenna zostały połączone zgodnie z Równaniem (11):

figure-protocol-11

Konfiguracja treningowa i optymalizacja

Konfiguracja środowiska

Środowisko eksperymentalne zostało skonfigurowane na systemie Ubuntu 20.04 z GPU (32 GB VRAM). Zainstalowano Python 3.8, framework deep learning (RRID: SCR_018536) oraz CUDA 11.8. Rozmiar obrazu wejściowego został ustawiony na 256 × 256 pikseli dla zadań związanych z uszkodzeniami skóry.

Funkcja strat i konfiguracja optymalizatora

Funkcja strat BceDice została zaimplementowana do optymalizacji treningowej. Optymalizator AdamW został skonfigurowany z początkową częstotliwością uczenia 0,001, wielkością partii 8 oraz 250 epokami treningowymi. Do regularizacji zastosowano spadek masy 1 × 10⁻5 .

W przypadku konfiguracji bazowej badanie odnosi się do prac Liu i in. (2024) nad modelem Vmamba, który był używany jako model przestrzeni stanu wzrokowego dla zadania klasyfikacji obrazów medycznych11. Dokładne konfiguracje i skrypty użyte do implementacji Vmamba opierają się na ich opublikowanych pracach i zostały dostosowane do tego badania, z konkretnymi poprawkami, aby lepiej pasować do zbioru obrazów medycznych.

Harmonogramowanie tempa uczenia było skonfigurowane za pomocą wyżarzania kosinusowego z ciepłymi restartami. Konfiguruj T_0 = 10 epok dla okresu początkowego restartu, T_mult = 2 dla mnożenia okresów oraz η_min = 1 × 10⁻6 dla minimalnego tempa uczenia się.

Optymalizacja hiperparametrów

Aby zapewnić powtarzalność i spójność, wszystkie eksperymenty przeprowadzono z ustalonym losowym nasionem 42. Systematyczna optymalizacja hiperparametrów została przeprowadzona, koncentrując się na wielkości partii, tempie uczenia się i wskaźniku ścieżki urzutu. Oceniono grupy 4, 8, 16 i 32 osoby. Testowano wskaźniki uczenia się 0,0005, 0,001, 0,0015 i 0,002. Wydajność walidacji monitorowano przy użyciu współczynnika podobieństwa kości (DSC) jako głównej metryki. Rozmiary partii większe niż 8 mogą prowadzić do przepełnienia pamięci na GPU z mniej niż 32 GB VRAM.

Ocena modelu i ocena wydajności

Konfiguracja metryk ewaluacji

Wprowadzono kompleksowe metryki ewaluacyjne, w tym średnią przecięcie przez sumę (mIoU), współczynnik podobieństwa kości (DSC), czułość (Sen), specyficzność (Spe) oraz dokładność (Acc). Metryki zostały obliczone według następujących sformułowań:

Średnia przecięcie przez sumę (mIoU) ilościowo określa nakładanie się segmentacji przewidywanej a segmentacji rzeczywistości z podstaw:

figure-protocol-12

Współczynnik podobieństwa kości (DSC) mierzy spójność segmentacji. Wartości wahają się od 0 do 1, przy czym wyższe wartości oznaczają lepszą wydajność:

figure-protocol-13

Czułość (Sen) mierzy zdolność modelu do wykrywania próbek pozytywnych:

figure-protocol-14

S-specjakcja (Spe) ocenia poprawne rozpoznanie negatywnej próby:

figure-protocol-15

Dokładność (Acc) mierzy ogólną poprawność predykcji:

figure-protocol-16

Parametry (M) odzwierciedlają złożoność modelu, mierząc całkowite parametry treningowe:

figure-protocol-17

gdzie Pi to liczba parametrów w i-tej warstwie, a N to całkowita liczba warstw. Mniejsza liczba parametrów wskazuje na lżejsze modele odpowiednie do zastosowań klinicznych.

Protokół badania ablacji

Przeprowadzono kompleksowe badania ablacyjne, aby zweryfikować wkład komponentów architektonicznych po projekcie eksperymentalnym z Tabeli 1. Oceniono cztery warianty architektury: H-MUNet (bazowy bez MSDAFN i PMFlex), HP-MUNet (bez MSDAFN), HM-MUNet (bez PMFlex) oraz HMP-MUNet (model kompletny).

Identyczne parametry treningowe były skonfigurowane we wszystkich wariantach: wskaźnik uczenia 0,001, wielkość partii 8, 250 epok. Monitorowano zbieżność treningów, a poprawy wydajności weryfikowano dla każdego dodanego komponentu.

Analiza efektywności obliczeniowej

Mierzono metryki efektywności obliczeniowej, w tym liczbę parametrów, FLOP-y oraz czas wnioskowania na różnych architekturach. Ocena czasu wnioskowania modelu na standardowej klinicznej GPU pokazuje, że choć najlepiej działa na wysokowydajnych GPU, model jest około 70% wolniejszy na częściej używanym sprzęcie. Niemniej jednak nadal jest zdolny do efektywnych prędkości wnioskowania, co czyni go odpowiednim do praktycznego zastosowania klinicznego. Monitoruj zużycie pamięci GPU podczas treningu, aby zapewnić stabilność systemu. Zalecana minimalna pamięć GPU 16 GB dla rozmiaru partii 8.

Walidacja i analiza

Benchmarking wydajności

Wydajność HMP-MUNet porównano z najnowocześniejszymi metodami na obu zbiorach danych. Wszystkie porównywane modele zostały zaimplementowane i wytrenowane na tych samych protokołach podziału danych, wstępnego przetwarzania, uzupełniania danych i treningu, aby zapewnić, że różnice w wydajności wynikają wyłącznie z różnic architektonicznych. Udokumentowano wyniki ilościowe, w tym poprawy DSC o 2,89% i 5,25% na zbiorach danych ISIC2018 i PH2. Badanie potwierdziło, że liczba parametrów jest zmniejszona 4,55 razy w porównaniu do poziomu wyjściowego U-Net.

Analiza statystyczna

Testy istotności statystycznej przeprowadzono za pomocą sparowanych testów t do porównań wydajności. Dla przedstawionych wskaźników obliczono przedziały ufności. Powtarzalność została zapewniona dzięki wielokrotnym treningom z różnymi losowymi nasionami.

Optymalne konfiguracje hiperparametrów zostały zapisane jako rozmiar partii 8 i wskaźnik uczenia 0,001, osiągając szczytowy DSC 0,9585 na zbiorze danych PH2 i 0,9044 na zbiorze ISIC2018, co zostało udokumentowane w wynikach eksperymentalnych. Zapewniono wystarczającą ilość danych walidacyjnych, aby zapobiec nadmiernemu dopasowaniu. Krzywe strat walidacyjnych były monitorowane w celu zastosowania kryteriów wczesnego zatrzymania.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Projekt architektury HMP-MUNet do segmentacji obrazów medycznych

Proponowana architektura HMP-MUNet wykazała wyjątkową wydajność w automatycznych zadaniach segmentacji zmian skórnych. Rysunek 1 ilustruje pełną architekturę sieci, prezentując hierarchiczną strukturę enkodera-dekodera w kształcie litery U z progresywnym rozszerzeniem kanałów od 8 do 256 kanałów. Integracja trzech wyspecjalizowanych modułów w naprzemiennej konfiguracji okazała się ba...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Niniejsze badanie przedstawia HMP-MUNet (High-order Multi-scale Parallel Vision Mamba U-Net), nowatorski framework deep learning, który odpowiada na fundamentalne wyzwania w diagnostyce wspomaganej komputerowo (CAD) segmentacji zmian skórnych poprzez innowacyjną integrację modeli stanów-przestrzeni (SSM) z zaawansowanymi komponentami architektonicznymi1. Opisane tutaj podejście pokazuje, że połączenie mechanizmów interakcji cech wysokiego rzędu z wieloskalową uwagą i przetwarzaniem równoległym moż...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy deklarują, że nie mają żadnych konfliktów interesów związanych z tymi badaniami. Nie istnieją żadne relacje finansowe między autorami a podmiotami komercyjnymi, które mogłyby niewłaściwie wpływać na dzieło przedstawione w tym rękopisie. Badania te zostały przeprowadzone niezależnie, a wyniki i wnioski są wyłącznie autorami. Tekst tego rękopisu został poprawiony i dopracowany przy pomocy ChatGPT, ponieważ angielski nie jest językiem ojczystym autorów. Autorzy potwierdzają, że korzystanie z pomocy AI ograniczało się do edycji językowej i nie wiązało się z generowaniem treści ani analizą, która mogłaby wpłynąć na naukową integralność pracy.

Podziękowania

Autorzy z wdzięcznością doceniają wsparcie finansowe udzielone przez Projekt Badawczy Prowincji Liaoning w ramach grantu LJ212510149013 oraz Programu Ogólnego Narodowej Fundacji Nauk Przyrodniczych prowincji Liaoning 2024-MSLH-377, który umożliwił realizację tych badań. Dziękujemy uczestnikom badań i instytucjom, które przyczyniły się do publicznie dostępnych zbiorów danych użytych w tym badaniu, co umożliwiło kompleksową weryfikację naszej proponowanej metodologii.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CUDA 11.8NVIDIA Corporation, Santa Clara, CA, USAOprogramowanie
GPU (32 GB VRAM)NVIDIASystem operacyjny
ISIC2017 Zbiór danychISIC Challengehttps://challenge.isic-archive.com/dataZbiory danych
ISIC2018 Zbiór danychISIC Challengehttps://challenge.isic-archive.com/dataZbiory danych
NVIDIA V100 GPUNVIDIA Corporation, Santa Clara, CA, USASprzęt
Zbiór danych PH2Universidade Do Portohttps://www.fc.up.pt/addi/ph2Zbiory danych
Python 3.8PythonRRID:SCR_018536Oprogramowanie
PyTorch 1.13.0PyTorchRRID:SCR_018536Oprogramowanie
Ubuntu 20.04KanoniczneSprzęt

Bibliografia

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Architektura U Netmodele przestrzeni stan wprzetwarzanie wieloskalowemechanizmy uwagidiagnostyka wspomagana komputerowoekstrakcja cechVision Mamba

Powiązane artykuły