Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

HMP-MUNet: Een hybride deep learning-framework voor geautomatiseerde segmentatie van huidlaesies in dermoscopische beelden

167 weergaven

DOI:

10.3791/69449

17 maart 2026

* These authors contributed equally

In dit artikel

Samenvatting

HMP-MUNet introduceert een hybride deep learning-framework voor geautomatiseerde segmentatie van huidlaesies. Door State-Space Models te integreren met multi-scale aandachtsmechanismen verbetert het de segmentatienauwkeurigheid terwijl de computationele efficiëntie wordt geoptimaliseerd, wat een robuuste oplossing biedt voor de diagnose van huidkanker in klinische omgevingen.

Samenvatting

Computerondersteunde diagnosesystemen voor cutane laesies ondervinden aanzienlijke uitdagingen bij het bereiken van zowel hoge diagnostische nauwkeurigheid als rekenkundige efficiëntie. Huidige deep learning-benaderingen vereisen vaak aanzienlijke computationele middelen terwijl ze worstelen om de complexe morfologische variaties die inherent zijn aan huidlaesies over verschillende schalen te vatten. High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), een nieuw deep learning-framework dat deze beperkingen aanpakt door een innovatief architectonisch ontwerp dat State-Space Models combineert met geavanceerde multi-scale verwerkingsmogelijkheden.

De in deze studie beschreven aanpak integreert een hybride U-Net-framework dat een high-order vision state-space module combineert voor globale contextmodellering, een multischaal gedilateerd aandachtsfusienetwerk voor hiërarchische feature-extractie over meerdere receptieve velden, en een parallel multi-diepte flexibel netwerk voor computationele optimalisatie. Deze architectuur gebruikt een aangepaste U-vormige encoder-decoder met grotere kanaalafmetingen en geavanceerde aandachtsmechanismen om het leren van functies te verbeteren.

Een uitgebreide evaluatie van benchmarkdatasets toont een dobbelsteengelijkheidscoëfficiënt van 95,85% op PH2 en 90,44% op ISIC2018. Het model bereikt deze superieure nauwkeurigheid met slechts 7,61 miljoen parameters, wat een opmerkelijke vermindering van 72,2% vertegenwoordigt ten opzichte van bestaande Vision Mamba-architecturen, terwijl het een hoge segmentatienauwkeurigheid behoudt. Het lichte ontwerp toont potentieel voor toepassing in diverse klinische omgevingen en beeldvormingsmodaliteiten, in afwachting van klinische validatie, van gespecialiseerde dermatologiecentra tot eerstelijnszorginstellingen.

HMP-MUNet biedt een geautomatiseerde oplossing voor segmentatie van huidlaesies die de diagnostische consistentie verbetert en klinische workflows ondersteunt, met potentie voor verdere validatie in klinisch gebruik. De integratie van hoog-orde modelleringsmogelijkheden met praktische implementatieoverwegingen biedt een potentiële oplossing om de screeningsprotocollen voor huidkanker te verbeteren en de toegankelijkheid van de gezondheidszorg in computerondersteunde diagnosetoepassingen uit te breiden.

Inleiding

Computerondersteunde diagnosesystemen (CAD) zijn bedoeld om medische beeldvormingspraktijken binnen klinische specialismen te verbeteren, waardoorde benaderingen van ziektedetectie, diagnose en behandelplanning worden verbeterd. In de dermatologie is de integratie van kunstmatige intelligentie (AI) en geavanceerde beeldvormingstechnieken uitgegroeid tot een cruciaal hulpmiddel om de diagnostische nauwkeurigheid en klinische uitkomsten te verbeteren, met name bij vroege opsporing van huidkanker, wat ongeveer 90% van alle huidkankers uitmaakt. De ontwikkeling van geavanceerde algoritmische benaderingen voor geautomatiseerde cutane laesieanalyse draagt bij aan de vooruitgang van precisiegeneeskunde, waardoor gestandaardiseerde, reproduceerbare diagnostische ondersteuning mogelijk is die klinische besluitvorming in diverse zorgomgevingen verbetert 3,4.

Moderne dermatologische beeldvorming omvat meerdere modaliteiten, waaronder dermoscopie, digitale fotografie, optische coherentietomografie en multispectrale beeldvormingssystemen5. Artsen gebruiken dermoscopische beelden om huidkanker handmatig vast te stellen via arbeidsintensieve en tijdrovende methoden die aanzienlijke expertisevereisen. De uitdaging om diagnostische consistentie te behouden tussen verschillende klinische omgevingen en beeldvormingsomstandigheden heeft geleid tot de ontwikkeling van CAD-systemen die objectieve, kwantitatieve analyse van cutane laesies bieden. De segmentatie van cutane laesies uit dermoscopische beelden vormt een fundamentele preprocessingstap die direct invloed heeft op de nauwkeurigheid van latere classificatie en klinische bruikbaarheid7. Over het algemeen omvat computerondersteunde diagnose van huidkanker vijf stappen: beeldverwerving, preprocessing, segmentatie, feature-extractie en classificatie8. Nauwkeurige grensafbakening is essentieel voor nauwkeurige karakterisering van laesies, waardoor clinici morfologische kenmerken zoals asymmetrie, randonregelmatigheid, kleurvariatie en diameter kunnen beoordelen—sleutelparameters in vastgestelde diagnostische criteria9.

De opkomst van State-Space Models (SSM's), met name de Mamba-architectuur, biedt lineaire computationele complexiteit, wat de rekenefficiëntie verbetert en tegelijkertijd superieure langetermijnafhankelijkheidsmodellering behoudt10. Recente ontwikkelingen in huidlaesiesegmentatie11, zoals U-Net9, Att-UNet12, UTNetV213 en UNet++14 , hebben aanzienlijke verbeteringen in segmentatienauwkeurigheid laten zien. Zo behaalt U-Net een Dice Similarity Coefficient (DSC) van 87,55% op de ISIC2018-dataset, terwijl UNet++ 87,83% bereikt en Att-UNet 87,91%. Op de PH2-dataset bereikt U-Net een DSC van 90,6%, terwijl C2SDG15 en SCR-Net16respectievelijk 90,3% en 89,89% behalen. HMP-MUNet verbetert deze modellen door een multi-schaal aandachtsmechanisme en parallelle verwerkingsmogelijkheden te integreren, waarbij het aantal parameters met 72,2% wordt verlaagd en een superieure nauwkeurigheid wordt behaald met een DSC van 95,85% op de PH2-dataset en 90,44% op de ISIC2018-dataset. Gezien het belang van het balanceren van visuele representatie-leermogelijkheden met het gebruik van computerbronnen, is het verkennen van generieke medische beeldclassificatiearchitecturen die optimale afwegingen bereiken van groot belang voor de ontwikkeling van intelligente klinische diagnosesystemen17. Het structured spatial SSMS-framework versterkt traditionele Mamba-architecturen door toestandsovergangsmatrices te optimaliseren, de computationele efficiëntie te verbeteren en geheugenoverhead te verminderen—kenmerken die essentieel zijn voor klinische inzet over diverse beeldvormingsmodaliteiten18.

Recent onderzoek toont aan dat Vision Mamba-architecturen, met name die welke gebruikmaken van High-order Vision Mamba-based Switching Scheme (H-VSS), superieure prestaties leveren met aanzienlijk minder parameteraantallen vergeleken met conventionele transformatoren, waardoor ze bijzonder geschikt zijn voor klinische workflowintegratie19. Bestaande Vision Mamba-implementaties ondervinden echter uitdagingen, waaronder geheugenverbruik en schaalbaarheidsbeperkingen onder klinische implementatievoorwaarden20. Huidige medische beeldsegmentatiemethoden worden over het algemeen onderverdeeld in CNN's en transformator-gebaseerde modellen, waarbij traditionele CNN's worden beperkt door receptieve veldbeperkingen, waardoor langeafstandsafhankelijkheidsopname uitdagend is21. In medische beeldvorming vereist het onderscheiden van kritieke regio's, zoals laesies van een gezonde huid, hoge precisie, waardoor geavanceerde technologische oplossingen worden toegepast omdeze uitdagingen aan te pakken. Hedendaagse segmentatiearchitecturen zijn geëvolueerd om te voldoen aan specifieke klinische eisen, waaronder computationele efficiëntie voor realtime toepassingen, nauwkeurigheid voor kritieke diagnostische taken en robuustheid over diverse beeldvormingsprotocollen23. Geavanceerde U-Net-varianten met aandachtsmechanismen, multi-scale feature fusion-strategieën en transformator-gebaseerde encoders hebben superieure prestaties aangetoond in complexe medische beeldvormingsscenario's12,24. Deze architectonische innovaties versterken direct klinische toepassingen door nauwkeurige afbakening van anatomische structuren, identificatie van pathologische gebieden en extractie van kwantitatieve biomarkers mogelijk te maken, die allemaal cruciaal zijn voor evidence-based medicine25,26. Integratieproblemen, waaronder interfacecompatibiliteit met bestaande elektronische medische dossiers (EPD), opslag en opvraging van grote beelden, en interoperabiliteit tussen verschillende institutionele systemen, blijven echter aanzienlijke obstakels voor brede klinische adoptie27.

Dit artikel introduceert High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), een nieuw CAD-systeem dat specifiek is ontworpen voor geautomatiseerde segmentatie van cutane laesies in de klinische praktijk. Het kader hier pakt kritieke lacunes in huidige medische beeldvormingssystemen aan door innovatieve architecturale componenten te integreren: het Multi-Scale Dilated Attention Fusion Network (MSDAFN) en het Parallel Multi-depth Flexible Network (PMFlex). Het MSDAFN implementeert geavanceerde feature-extractiestrategieën die ruimtelijke en kanaalaandachtmechanismen combineren met multischaal gedilateerde convoluties, waardoor subtiele laesiekenmerken op verschillende schalen beter kunnen worden gedetecteerd—cruciaal voor een nauwkeurige diagnose van verschillende soorten laesies die in klinische praktijk worden aangetroffen28. De PMFlex introduceert parallelle verwerkingsmogelijkheden die gelijktijdige analyse van meerdere invoerstromen mogelijk maken, wat de rekenefficiëntie aanzienlijk verbetert terwijl hoog-orde modelleringsmogelijkheden behouden blijven die essentieel zijn voor klinisch nauwkeurigheid29. HMP-MUNet streeft ernaar met innovatieve segmentatietechnieken en computationele strategieën de grenzen van huidkankerdiagnose te verleggen, waardoor realtime en nauwkeurige klinische diagnose mogelijk wordt30,31.

De belangrijkste bijdragen van dit onderzoek sluiten aan bij de kerndoelstellingen van het bevorderen van CAD in medische beeldvorming: verbeterde globale contextmodellering via MSDAFN, verbetering van feature-extractie en fusie-efficiëntie voor nauwkeurige laesielokalisatie over diverse klinische presentaties; efficiënte parallelle verwerking via PMFlex, waardoor de rekenkracht wordt verminderd terwijl klinisch nauwkeurigheid behouden blijft, wat de inzet in klinische omgevingen met beperkte middelen vergemakkelijkt; klinische implementatieoptimalisatie door hardwarebewust ontwerp, waardoor efficiënte verwerking van hoogresolutie dermoscopische beelden mogelijk is ter ondersteuning van realtime klinische workflows; Klinische prestaties aangetoond door uitgebreide evaluatie van standaarddatasets met prestatie-indicatoren geschikt voor klinische integratie; en geïntegreerde diagnostische oplossing die hoog-orde modellering, multischaalanalyse en parallelle berekening combineert, en uitgebreide oplossingen biedt voor precisie-dermatologische diagnose. Dit onderzoek bevordert gecomputeriseerde medische beeldvorming door innovatieve, klinisch toepasbare oplossingen te bieden die zowel technologische als praktische eisen voor geautomatiseerde cutane laesieanalyse in hedendaagse zorgomgevingen aanpakken.

Het framework is ontworpen om dermoscopische beelden met hoge resolutie te verwerken, meestal met inputresoluties van 256 × 256, wat een balans biedt tussen rekenefficiëntie en beelddetail. Echter, variabiliteit in apparatuur en beeldkwaliteit, zoals verschillen in verlichting, huidskleur en de aanwezigheid van haar, kan de segmentatieprestaties beïnvloeden. Ondanks deze uitdagingen is het ontwerp van het systeem geoptimaliseerd voor realtime klinische workflows en is het aanpasbaar aan verschillende beeldvormingsapparaten, wat zorgt voor robuuste prestaties in diverse klinische omgevingen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Dit onderzoek werd uitgevoerd in overeenstemming met de institutionele richtlijnen voor computationeel onderzoek en gegevensverwerking. Er waren geen menselijke proefpersonen of gewervelde dieren betrokken bij deze studie.

Datasetvoorbereiding en voorverwerking

Datasetverzameling en organisatie

Dermoscopische beelden werden verzameld uit de datasets PH2, ISIC2018 en ISIC2017, met specifieke links in de Table of Materials. De PH2-dataset bevat 200 afbeeldingen met hoge resolutie (1000 × 1000 pixels), ISIC2018 bevat 2.594 afbeeldingen met bijbehorende segmentatiemaskers, en ISIC2017 bevat 2.150 afbeeldingen met segmentatiemaskers. De gegevens werden georganiseerd in trainings-, validatie- en testsets volgens standaardprotocollen, waarbij werd gegarandeerd dat de beelden in compatibele formaten zijn (bijvoorbeeld .jpg, .png of .tiff) en bijbehorende grondwaarheidsmaskers in binair formaat bevatten.

De gegevens werden georganiseerd in trainings-, validatie- en testsets volgens standaardprotocollen. De datasets waren als volgt verdeeld: voor ISIC2018 werden 1.815 beelden toegewezen voor training, 259 voor validatie en 520 voor testen. Voor ISIC2017 werden 1.500 beelden toegewezen voor training, 220 voor validatie en 430 voor testen. Voor PH2 werd de dataset verdeeld in 160 trainingsafbeeldingen, 10 validatiebeelden en 30 testbeelden. Een consistente beeldresolutie van 256 × 256 pixels werd gedurende de hele voorverwerkingspijplijn gehandhaafd.

Data-augmentatie en normalisatie

Data-augmentatietechnieken werden toegepast om de generalisatie van het model te verbeteren. Horizontale flipping, verticale flipping en willekeurige rotatie binnen een bereik van ±15° werden geïmplementeerd. Gamma-correctie en logaritmische transformatie werden toegepast met een kans van 0,3 elk. Pixelwaarden werden genormaliseerd met behulp van ImageNet-statistieken (gemiddelde = [0,485, 0,456, 0,406], standaarddeviatie = [0,229, 0,224, 0,225]).

Verander alle invoerbeelden van formaat naar 256 × 256 pixels: Om rekenefficiëntie te waarborgen, werden alle invoerbeelden aangepast tot een uniforme resolutie van 256 × 256 pixels. Hoewel afbeeldingen met hoge resolutie, zoals die in de dataset (1000 × 1000 pixels), fijnkorrelige details en textuurinformatie bevatten die cruciaal zijn voor nauwkeurige afbakening van laesiesgrensen, verbeterde het verhogen van de resolutie de prestaties van het model niet significant. Daarom werd de resolutie niet verhoogd om een balans te behouden tussen computationele efficiëntie en modelnauwkeurigheid. Toekomstig werk kan de effecten van inputs met hogere resolutie verder onderzoeken om te bepalen of de voordelen in segmentatienauwkeurigheid de verhoogde rekenkosten rechtvaardigen. Afbeeldingen werden indien nodig omgezet naar RGB-formaat. De vooraf bewerkte gegevens werden opgeslagen in gestructureerde directories terwijl de oorspronkelijke datasetsplitsing behouden bleef.

HMP-MUNet architectuurimplementatie

Ontwerp van netwerkarchitectuur

HMP-MUNet werd geconfigureerd volgens de hiërarchische U-vormige encoder-decoderstructuur zoals weergegeven in Figuur 1. Het netwerk was geconfigureerd met progressieve kanaaluitbreiding: 8→16→32→64→128→256 kanalen over encoderniveaus.

Een belangrijke architectonische wijziging werd doorgevoerd door de netwerkdiepte te verkleinen van vier hiërarchische niveaus naar twee, wat helpt het model te vereenvoudigen en de rekenkundige efficiëntie te verbeteren. Hoewel de diepte is verminderd, zijn de kanaalafmetingen op elk niveau vergroot, waardoor het netwerk rijkere en expressievere kenmerken kan vastleggen. Om het feature learning van het model verder te verbeteren, werden aandachtmechanismen geïntroduceerd om het netwerk te richten op de meest relevante features over meerdere schalen. Deze aandachtsmechanismen compenseren effectief het potentiële verlies van hiërarchische feature-abstractie door de ondiepere architectuur.

De encoder werd geïnitialiseerd met dubbele Conv2D-bewerkingen voor het initiële feature-extractie uit de invoertensoren X(C, H×W). De afwisselende configuratie van drie gespecialiseerde modules werd geïmplementeerd: High-order Vision Mamba-based Switching Scheme (H-VSS), Parallel Multi-depth Flexible Network (PMFlex) en Multi-Scale Dilated Attention Fusion Network (MSDAFN).

Het model gebruikt ImageNet-statistieken (gemiddelde en standaarddeviatie) voor normalisatie, waardoor het niet nodig is om voor elke dataset opnieuw te berekenen, waardoor de rekenefficiëntie verbetert. Het zorgt voor stabiliteit en generaliseerbaarheid, gebruikmakend van het uitgebreide gebruik van ImageNet bij computer vision-taken. Deze keuze vereenvoudigt het ontwerp door de complexiteit van de voorverwerking te verminderen en verbetert de overdraagbare overdraagbare data tussen datasets, waardoor het model effectief kan generaliseren over diverse afbeeldingen van huidlaesies.

Implementatie van een High-order vision mamba-gebaseerd schakelschema (H-VSS)                

De H-VSS-module werd geïmplementeerd volgens de architectuur in Figuur 2. Laagnormalisatie (LN) en Hardswish-activatie (HS) werden geconfigureerd met residuele verbindingen volgens Vergelijking (1):

figure-protocol-1

De Local Spatial Descriptor (LSD)-component is geïmplementeerd om ruimtelijke coherentie te behouden. De Spatial Selective 2D Scanning (SS2D) module was geconfigureerd met multidirectionele scanpatronen volgens Vergelijking (2):

figure-protocol-2

Multi-layer Perceptron (MLP) verwerking werd toegevoegd met residuele verbindingen zoals gespecificeerd in Vergelijking (3):

figure-protocol-3

Het High-order 2D Selective Scanning (H-SS2D) mechanisme projecteert invoerkenmerken naar 2C-dimensionale ruimte voor verbeterde contextuele modellering.

Parallelle implementatie van multi-diepte flexibel netwerk (PMFlex)

De PMFlex-module was geconfigureerd volgens specificaties in figuur 3 . Laagnormalisatie werd toegepast op invoerfeaturekaarten X(C, H×W), waarna ze werden opgedeeld in vier segmenten langs de kanaaldimensie volgens Vergelijking (4):

figure-protocol-4

Elke gesegmenteerde functie Y_i werd verwerkt via gedeelde Visual Mamba (VMamba) modules. Verwerkte uitvoeren werden samengevoegd en verfijning werd toegepast via Laagnormalisatie en projectie zoals beschreven in Vergelijking (5):

figure-protocol-5

Multi-Scale gedilateerde aandacht fusie netwerk (MSDAFN) implementatie

De MSDAFN-module werd geïmplementeerd volgens de Figuur 4-architectuur. Parallelle convolutieoperaties werden geconfigureerd met dilatatieraten van 6, 12 en 18 voor multischaal feature-extractie volgens Vergelijking (6):

figure-protocol-6

Multi-scale features werden geïntegreerd via kanaalconcatenatie zoals gespecificeerd in Vergelijking (7):

figure-protocol-7

Dubbele aandachtmechanismen werden geïmplementeerd voor herkalibratie van kenmerken. Kanaalaandachtgewichten werden berekend met behulp van globale gemiddelde pooling volgens Vergelijking (8):

figure-protocol-8

Kanaalaandachtsweging werd toegepast zoals beschreven in Vergelijking (9):

figure-protocol-9

Ruimtelijke aandacht werd geconfigureerd via convolutieoperaties volgens Vergelijking (10):

figure-protocol-10

Kanaal- en ruimtelijke aandacht werden gecombineerd zoals gespecificeerd in Vergelijking (11):

figure-protocol-11

Trainingsconfiguratie en optimalisatie

Omgevingsopstelling

De experimentele omgeving was geconfigureerd op een Ubuntu 20.04-systeem met een GPU (32 GB VRAM). Python 3.8, deep learning framework (RRID: SCR_018536) en CUDA 11.8 werden geïnstalleerd. De invoerbeeldgrootte werd ingesteld op 256 × 256 pixels voor taken met cutane laesies.

Verliesfunctie en optimalisatieconfiguratie

De BceDice-verliesfunctie werd geïmplementeerd voor trainingsoptimalisatie. De AdamW-optimizer was geconfigureerd met een initiële leersnelheid van 0,001, batchgrootte van 8 en 250 trainingsepochen. Voor regularisatie werd een gewichtsafname van 1 × 10⁻5 toegepast.

Voor de basisconfiguratie verwijst deze studie naar het werk van Liu et al. (2024) aan het Vmamba-model, dat werd gebruikt als een visueel toestandsruimtemodel voor de medische beeldclassificatietaak11. De exacte configuraties en scripts die zijn gebruikt om Vmamba te implementeren, zijn gebaseerd op hun gepubliceerde werk en aangepast voor deze studie, met specifieke aanpassingen om beter aan te sluiten bij de medische beeldvormingsdataset.

Learning rate scheduling werd opgezet met cosinus-annealing met warme herstarts. Configureer T_0 = 10 epochs voor de initiële herstartperiode, T_mult = 2 voor periodevermenigvuldiging, en η_min = 1 × 10⁻6 voor de minimale leersnelheid.

Hyperparameteroptimalisatie

Om reproduceerbaarheid en consistentie te waarborgen, werden alle experimenten uitgevoerd met een vaste willekeurige seed van 42. De systematische hyperparameteroptimalisatie werd uitgevoerd met de focus op batchgrootte, leersnelheid en droppadsnelheid. Batchgroottes van 4, 8, 16 en 32 werden geëvalueerd. De leersnelheden van 0,0005, 0,001, 0,0015 en 0,002 werden getest. De validatieprestaties werden gemonitord met behulp van de Dice Similarity Coefficient (DSC) als primaire maatstaf. Batchgroottes groter dan 8 kunnen leiden tot geheugenoverloop op GPU's met minder dan 32 GB VRAM.

Modelevaluatie en prestatiebeoordeling

Configuratie van evaluatiemetrieken

Uitgebreide evaluatiemetrics, waaronder Gemiddelde Snede over Unie (mIoU), Dobbelsteengelijkheidscoëfficiënt (DSC), Gevoeligheid (Sen), Specificiteit (Spe) en Nauwkeurigheid (Acc), werden geïmplementeerd. De metrieken werden berekend volgens de volgende formuleringen:

Gemiddelde doorsnede over Unie (mIoU) kwantificeert overlap tussen voorspelde en grond-waarheidssegmentatie:

figure-protocol-12

De dobbelsteengelijkheidscoëfficiënt (DSC) meet segmentatieconsistentie. Waarden variëren van 0 tot 1, waarbij hogere waarden betere prestaties aangeven:

figure-protocol-13

Gevoeligheid (Sen) meet het vermogen van het model om positieve monsters te detecteren:

figure-protocol-14

S-specififikiteit(Spe) beoordeelt correcte negatieve monsterherkenning:

figure-protocol-15

Nauwkeurigheid (Acc) meet de algehele voorspellingscorrectheid:

figure-protocol-16

Parameters (M) weerspiegelen de modelcomplexiteit en meten het totaal aantal trainbare parameters:

figure-protocol-17

waarbij Pi het aantal parameters in de i-de laag is, en N het totale aantal lagen. Kleinere parametertellingen duiden op lichtere modellen die geschikt zijn voor klinische inzet.

Ablatiestudieprotocol

Uitgebreide ablatiestudies werden uitgevoerd om bijdragen van architectonische componenten te valideren na het experimentele ontwerp in Tabel 1. Er werden vier architecturale varianten geëvalueerd: H-MUNet (uitgangspunt zonder MSDAFN en PMFlex), HP-MUNet (zonder MSDAFN), HM-MUNet (zonder PMFlex) en HMP-MUNet (volledig model).

Identieke trainingsparameters werden geconfigureerd over alle varianten: leersnelheid 0,001, batchgrootte 8, 250 epochs. De trainingsconvergentie werd gemonitord en prestatieverbeteringen werden gevalideerd voor elke componententoevoeging.

Computationele efficiëntieanalyse

De berekeningsefficiëntiemetrics, waaronder parameteraantal, FLOPs en inferentietijd over verschillende architecturen, werden gemeten. De evaluatie van de inferentietijd van het model op een standaard klinisch GPU toont aan dat, hoewel het het beste presteert op high-performance GPU's, het model ongeveer 70% trager is op meer gangbaar gebruikte hardware. Desondanks is het nog steeds in staat tot efficiënte inferentiesnelheden, waardoor het geschikt is voor praktische klinische toepassing. Monitor het GPU-geheugengebruik tijdens training om systeemstabiliteit te waarborgen. Aanbevolen minimaal 16 GB GPU-geheugen voor batchgrootte 8.

Validatie en analyse

Prestatiebenchmarking

De prestaties van HMP-MUNet werden vergeleken met state-of-the-art methoden op beide datasets. Alle vergeleken modellen werden geïmplementeerd en getraind onder dezelfde data-splitsingen, preprocessing-, data-augmentatie- en trainingsprotocollen om ervoor te zorgen dat prestatieverschillen uitsluitend door architecturale verschillen werden veroorzaakt. De kwantitatieve resultaten, waaronder DSC-verbeteringen van 2,89% en 5,25% op de ISIC2018- en PH2-datasets, werden respectievelijk gedocumenteerd. De studie bevestigde dat het aantal parameters 4,55 keer is verminderd ten opzichte van de U-Net baseline.

Statistische analyse

Statistische significantietests werden uitgevoerd met behulp van gepaarde t-tests voor prestatievergelijkingen. Betrouwbaarheidsintervallen werden berekend voor de gerapporteerde metrics. Reproduceerbaarheid werd gegarandeerd door meerdere trainingsruns met verschillende willekeurige zaden.

De optimale hyperparameterconfiguraties werden geregistreerd als batchgrootte 8 en leersnelheid 0,001, met een piek DSC van 0,9585 op de PH2-dataset en 0,9044 op de ISIC2018-dataset, zoals gedocumenteerd in de experimentele resultaten. Voldoende validatiegegevens werden gegarandeerd om overfitting te voorkomen. Validatieverliescurves werden gemonitord om vroegtijdige stopcriteria toe te passen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

HMP-MUNet architectuurontwerp voor medische beeldsegmentatie

De voorgestelde HMP-MUNet-architectuur toonde uitzonderlijke prestaties bij geautomatiseerde cutane laesiesegmentatietaken. Figuur 1 illustreert de volledige netwerkarchitectuur en toont de hiërarchische U-vormige encoder-decoderstructuur met progressieve kanaaluitbreiding van 8 naar 256 kanalen. De integratie van drie gespecialiseerde modules in afwisse...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Deze studie presenteert HMP-MUNet (High-order Multi-scale Parallel Vision Mamba U-Net), een nieuw deep learning-framework dat fundamentele uitdagingen in computerondersteunde diagnose (CAD) voor cutane laesiesegmentatie aanpakt door innovatieve integratie van State-Space Models (SSM's) met geavanceerde architecturale componenten1. De hier beschreven aanpak toont aan dat het combineren van mechanismen voor interactie met hoogwaardige functies met multischaalaandach...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs geven aan dat zij geen belangenconflicten hebben met betrekking tot dit onderzoek. Er bestaan geen financiële relaties tussen de auteurs en commerciële entiteiten die het werk in dit manuscript onterecht kunnen beïnvloeden. Dit onderzoek is onafhankelijk uitgevoerd en de bevindingen en conclusies zijn uitsluitend die van de auteurs. De tekst van dit manuscript werd herzien en verfijnd met hulp van ChatGPT, aangezien Engels niet de moedertaal van de auteurs is. De auteurs bevestigen dat het gebruik van AI-ondersteuning beperkt was tot taalbewerking en geen inhoudsproductie of analyse betrof die de wetenschappelijke integriteit van het werk zou beïnvloeden.

Dankbetuigingen

De auteurs erkennen dankbaar de financiële steun die is verleend door het Wetenschappelijk Onderzoeksproject van het Liaoning Provinciale Ministerie van Onderwijs onder Subsidie LJ212510149013 en Algemeen Programma van de National Natural Science Foundation van de provincie Liaoning 2024-MSLH-377, die dit onderzoek mogelijk maakte. Wij danken de onderzoeksdeelnemers en instellingen die hebben bijgedragen aan de publiek beschikbare datasets die in deze studie zijn gebruikt, wat een uitgebreide validatie van onze voorgestelde methodologie mogelijk maakte.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
CUDA 11.8NVIDIA Corporation, Santa Clara, CA, USASoftware
GPU (32 GB VRAM)NVIDIABesturingssysteem
ISIC2017 DatasetISIC Challengehttps://challenge.isic-archive.com/dataDatasets
ISIC2018 DatasetISIC Challengehttps://challenge.isic-archive.com/dataDatasets
NVIDIA V100 GPUNVIDIA Corporation, Santa Clara, CA, USAHardware
PH2 DatasetUniversidade Do Portohttps://www.fc.up.pt/addi/ph2Datasets
Python 3.8PythonRRID:SCR_018536Software
PyTorch 1.13.0PyTorchRRID:SCR_018536Software
Ubuntu 20.04CanonicalHardware

Referenties

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Trefwoorden

U Net architectuurstate space modellenmultiscale verwerkingattentiemechanismencomputerondersteunde diagnostiekkenmerkextractieVision Mamba