Segmentatie van medische beelden is een fundamentele taak op het gebied van computer vision en medische beeldanalyse 1,2,3. Het houdt in dat een afbeelding wordt opgedeeld in meerdere regio's of objecten voor verdere analyse en verwerking. Deze technologie is vooral belangrijk in medische beeldvorming omdat ze clinici helpt pathologische gebieden te identificeren en te lokaliseren, waardoor de diagnostische nauwkeurigheid en behandelingsplanning verbetert. Met de vooruitgang van medische beeldvormingstechnologieën, zoals magnetische resonantiebeeldvorming (MRI), computertomografie (CT) en positronemissietomografie (PET), is de vraag naar nauwkeurige medische beeldsegmentatietechnieken blijven toenemen. Huidige methoden voor medische beeldsegmentatie kunnen globaal worden ingedeeld in drie hoofdbenaderingen: convolutioneel neuraal netwerk (CNN)-gebaseerde methoden4, Transformer-gebaseerde methoden5, en toestandsruimtemodel (SSM)-gebaseerde methoden 6,7. CNN-gebaseerde methoden maken doorgaans gebruik van U-vormige netwerkarchitecturen voor medische beeldsegmentatie. De meest gebruikte architectuur in deze categorie is U-Net8, die de effectiviteit van een U-vormige encoder–decoder-architectuur voor biomedische beeldsegmentatie aantoonde. U-Net3+ combineert dichte skipverbindingen van UNet++9 met full-scale skipverbindingen om multiscale feature-aggregatie te verbeteren. CNN-gebaseerde methoden hebben echter beperkte mogelijkheden om langetermijnafhankelijkheden vast te leggen en modelleren daarom mogelijk niet effectief langetermijncontextuele informatie.
Transformer-gebaseerde methoden vangen effectief langeafstandsafhankelijkheden vast via het zelf-aandachtmechanisme, dat parallelle berekening mogelijk maakt en verschillende aandachtsgewichten toekent aan verschillende interessegebieden. UNETR++10 introduceert de Efficient Paired Attention (EPA)-module om het aantal parameters en de rekenkosten te verminderen. nnFormer11 combineert verwevende convolutionele en zelf-aandacht operaties en introduceert een lokaal-globaal volume-gebaseerd zelf-aandachtsmechanisme voor het leren van volumetrische representaties in driedimensionale (3D) medische beeldsegmentatie. H2Former12 stelt een efficiënte hiërarchische hybride Vision Transformer voor die aandachtsmechanismen combineert met CNN-gebaseerde feature-extractie in de encoder. Transformer-gebaseerde methoden vertonen echter kwadratische computationele complexiteit met toenemende sequentielengte, wat resulteert in aanzienlijk hogere rekenkosten. Figuur 1 illustreert de motivatie voor MVM-UNet en vergelijkt de voorgestelde multiview scanningsstrategie met bestaande SSM-gebaseerde segmentatiekaders.

Figuur 1. Vergelijking van MVM-UNet met bestaande pure state-space-model (SSM)-gebaseerde segmentatiearchitecturen. Vergelijking tussen een conventioneel puur state-space model (SSM)-segmentatieframework en de voorgestelde Multi-View Mamba U-Net (MVM-UNet) architectuur. Het bovenste paneel illustreert MVM-UNet, waarin de Multi-View 4-Directional (MV4D) module complementaire kenmerken extrahereert met zigzag-, hiërarchische, spiraal- en radiale scanparen die worden geïntegreerd door Spatial Fusion Mamba (SFusion Mamba), terwijl Multistage Fusion Mamba (MFusion Mamba) multiscale encoderkenmerken aggregeert voordat het wordt gedecodeerd. Het onderste paneel toont een representatieve pure SSM-gebaseerde architectuur met Selective Scan 2-Dimensional (SS2D) modules met cross-scanning. De figuur benadrukt de architecturale verschillen tussen conventionele SSM-gebaseerde segmentatienetwerken en het voorgestelde MVM-UNet. Klik hier om een grotere versie van deze figuur te bekijken.
SSM-gebaseerde methoden combineren de wereldwijde modelleringscapaciteit van Transformers met lineaire computationele complexiteit. De Mamba-architectuur verwerkt selectief invoerinformatie met behulp van een selectief toestandsruimtemodel (Selective-SSM), waardoor het model zijn parameters dynamisch kan aanpassen aan de invoer, terwijl irrelevante informatie wordt gefilterd en informatieve kenmerken worden benadrukt. Vim13 en VMamba14 passen de Mamba-architectuur aan voor computer vision-taken. U-Mamba15 gebruikt een hybride CNN–SSM-architectuur om de toepassing van SSM's in medische beeldsegmentatie te verkennen, terwijl Mamba-UNet16 een volledig SSM-gebaseerde encoder–decoder-architectuur hanteert voor medische beeldsegmentatie. Deze methoden leveren concurrerende prestaties met aanzienlijk minder parameters. Huidige SSM/Mamba-gebaseerde methoden extraheren echter voornamelijk beeldkenmerken met behulp van eenvoudige beeldpatches en SS2D-scanstrategieën, wat verschillende beperkingen met zich meebrengt voor medische beeldsegmentatie. Ten eerste zijn SS2D- en patchgebaseerde technieken voornamelijk ontworpen voor algemene computer vision-taken. Local Mamba17 en Motion Mamba18 hebben gesuggereerd dat de SS2D-scanstrategie onvoldoende is voor alle visuele taken omdat verschillende scanstrategieën verschillende soorten visuele informatie vastleggen. Ten tweede is de SS2D-scanstrategie relatief eenvoudig, waarbij alleen wordt vertrouwd op horizontale en verticale scanrichtingen. Daardoor kan het complexe ruimtelijke relaties en fijne structurele details mogelijk niet adequaat vastleggen. Medische beeldsegmentatie vereist gelijktijdige modellering van zowel de globale ruimtelijke context als precieze lokale anatomische kenmerken. Bovendien bieden huidige SSM/Mamba-gebaseerde methoden beperkte functiefusie tussen de encoder en decoder. Architecturen zoals UNet++ en FATNet verbeteren de segmentatienauwkeurigheid door verbeterde feature-fusie, wat het belang van effectieve feature-integratie voor medische beeldsegmentatie benadrukt.
Om deze beperkingen aan te pakken, stelt dit artikel een nieuw Mamba-gebaseerd medisch beeldsegmentatiekader voor, genaamd MVM-UNet. Zoals weergegeven in Figuur 1, dient de voorgestelde Multi-View Four-Directional (MV4D) module als het kernonderdeel van feature-extractie van MVM-UNet en is specifiek ontworpen voor medische beeldsegmentatie door informatie te integreren van vier verschillende scanstrategieën. Elke scanstrategie haalt complementaire beeldkenmerken uit en geeft een andere weergave van de invoerafbeelding weer. Zigzagscannen 19 wisselt de doorlooprichting af aan het einde van elke rij of kolom, waardoor lokale en globale ruimtelijke informatie in balans worden gebracht. Daarentegen bieden spiraal- en radiale scanschema's20 een uitgebreide dekking door zich uit te strekken vanuit het centrum of naar binnen vanaf de periferie. Hiërarchisch scannen18 legt zowel lokale als globale kenmerken op meerdere schalen vast. Om de robuustheid van elke scanstrategie te verbeteren, worden scanparen samengevoegd voordat ze in het S6-blok worden ingevoerd. De Scan-view Fusion Mamba (SFusion Mamba) module integreert vervolgens de functies die uit de vier scanmodaliteiten zijn geëxtraheerd. Om multiscale encoderfuncties effectief te benutten, stelt dit artikel verder een multiscale Mamba fusiemodule (MFusion Mamba) voor, die de uitgangen van elke encodertrap verzamelt en fuseert voordat de gefuseerde features aan de decoder worden doorgegeven. MVM-UNet werd geëvalueerd op de ISIC 2017, ISIC 2018 en Synapse datasets. Experimentele resultaten tonen aan dat MVM-UNet concurrerende segmentatieprestaties behaalt op de ISIC 2017, ISIC 2018 en Synapse datasets.
Representatieve segmentatiearchitecturen hebben de segmentatie van medische beelden verder verbeterd. U-Net is ook met succes toegepast op biomedische beeldanalysetaken zoals celtelling, detectie en morfometrie21. Aandacht-versterkte CNN-architecturen, zoals CA-Net22, verbeteren de featurerepresentatie via uitgebreide aandachtsmechanismen. Segmentatiekaders gebaseerd op representatieve transformers, waaronder TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 en TransCUNet27, tonen verder de effectiviteit van aandachtsgebaseerde globale feature-modellering voor medische beeldsegmentatie aan.
Het ontwerp van MVM-UNet wordt gemotiveerd door twee beperkingen van bestaande SSM/Mamba-gebaseerde segmentatiemethoden. Ten eerste vertrouwen veel huidige Vision Mamba-modellen op eenvoudige tweedimensionale scanstrategieën, die mogelijk onvoldoende zijn voor medische beelden met onregelmatige laesiegrenzen, kleine doelgebieden en multiscale anatomische structuren. Ten tweede dragen conventionele U-vormige encoder–decoder-architecturen vooral kenmerken over via overeenkomstige skipverbindingen, waardoor het directe gebruik van meertraps-encoderinformatie tijdens het decoderen wordt beperkt. Daarom introduceert MVM-UNet MV4D om multiview ruimtelijke modellering te verbeteren en MFusion Mamba om expliciet multistage encoderkenmerken te aggregeren. Dit ontwerp is bedoeld om Mamba-gebaseerde langeafstandmodellering aan te passen aan de specifieke eisen van medische beeldsegmentatie.
Hoewel MVM-UNet is gebaseerd op het algemene encoder–decoder-paradigma en Mamba-gebaseerde sequentiemodellering, ligt de nieuwigheid ervan in de manier waarop deze componenten worden aangepast en geïntegreerd voor medische beeldsegmentatie. In plaats van simpelweg een standaard Mamba-blok in een U-vormige netwerkruggengraat te integreren, herontwerpt het voorgestelde framework het ruimtelijke modelleringsproces via meerdere taakgerichte scan-paar-takken, introduceert SFusion Mamba om scan-specifieke representaties te integreren, verbetert het MVV Block met residuele en projectiepaden, en voegt MFusion Mamba in tussen de encoder en decoder om multistage encoderkenmerken te aggregeren voordat het decodert. Dit architectuurniveau ontwerp is bedoeld om de onregelmatige grenzen, kleine doelgebieden en multiscale anatomische structuren aan te pakken die vaak worden waargenomen in medische beelden.
Dit protocol is het meest geschikt voor segmentatietaken die gelijktijdige modellering vereisen van contextuele informatie over lange afstand, onregelmatige objectgrenzen en multiscale anatomische structuren in tweedimensionale medische beelden. In vergelijking met op CNN gebaseerde segmentatiemethoden biedt het Mamba-gebaseerde encoder–decoder-ontwerp een effectief contextmodelleringsmechanisme, terwijl het een U-vormige workflow behoudt die bekend is bij onderzoekers in medische beeldsegmentatie. In vergelijking met op Transformers gebaseerde methoden vermijdt het voorgestelde kader het directe gebruik van kwadratische zelfaandacht en is het bedoeld voor onderzoekers die globale contextuele modellering zoeken met een relatief efficiënt sequentiemodelleringsmechanisme. Dit protocol is dienovereenkomstig geschikt voor segmentatie van huidlaesies, segmentatie van buikorganen en vergelijkbare tweedimensionale medische beeldsegmentatietaken waarbij zowel globale structurele informatie als lokale grensdetails belangrijk zijn.
Dit protocol heeft ook beperkingen die vóór gebruik in overweging moeten worden genomen. Het is mogelijk niet nodig voor relatief eenvoudige segmentatietaken waarbij een lichtgewicht CNN al voldoende prestaties levert. Daarnaast is het niet direct ontworpen voor volledige driedimensionale volumetrische segmentatie zonder architecturale aanpassing. Onderzoekers met zeer beperkte geannoteerde data, beperkte grafische verwerkingsunits (GPU) of een vereiste voor zeer interpreteerbare klassieke modellen moeten deze beperkingen ook overwegen voordat ze het protocol toepassen. Al met al is deze methode bedoeld voor onderzoekers die een Mamba-gebaseerd U-vormig segmentatiekader willen reproduceren en evalueren dat een balans biedt tussen langetermijncontextmodellering, lokale grensrepresentatie en multifase-featurefusie.
De belangrijkste bijdragen zijn als volgt:
1. Dit artikel presenteert een nieuw Mamba-gebaseerd medisch beeldsegmentatiekader, genaamd MVM-UNet. In tegenstelling tot benaderingen die bestaande SS2D-gebaseerde of standaard Mamba-blokken direct integreren, introduceert MVM-UNet MV4D om medische beeldkenmerken te modelleren vanuit vier complementaire scan-paar-aanzichten, waaronder zigzag-, hiërarchische, spiraal- en radiale scanning.
2. Dit artikel ontwerpt SFusion Mamba en het MVV Block om scan-specifieke representaties te integreren en de transformatie van kenmerken te verbeteren. SFusion Mamba fuseert de kenmerken die uit verschillende scanpaartakken zijn geëxtraheerd, terwijl de residuele en Up-Down Projection-takken binnen het MVV-blok complementaire feature-routes bieden die feature-representaties stabiliseren en verrijken.
3. Dit artikel introduceert MFusion Mamba als een tussenliggende multitraps fusiemodule tussen de encoder en decoder. In tegenstelling tot conventionele skipverbindingen die voornamelijk corresponderende fase-features overdragen, aggregeert MFusion Mamba expliciet multi-traps encoderkenmerken via grove tot fijne fusie en levert verrijkte informatie voor decodering.
4. Uitgebreide experimentele resultaten tonen aan dat het voorgestelde MVM-UNet concurrerende segmentatieprestaties behaalt op de ISIC 2017- en ISIC 2018-datasets en sterke prestaties op de Synapse-multiorgansegmentatiedataset. Bovendien valideren uitgebreide ablatiestudies de bijdrage van elk onderdeel binnen MVM-UNet.