La segmentazione delle immagini mediche è un compito fondamentale nei campi della visione artificiale e dell'analisi delle immaginimediche 1,2,3. Consiste nel partizionare un'immagine in più regioni o oggetti per ulteriori analisi e elaborazioni. Questa tecnologia è particolarmente importante nell'imaging medico perché aiuta i clinici a identificare e localizzare le regioni patologiche, migliorando così l'accuratezza diagnostica e la pianificazione del trattamento. Con il progresso delle tecnologie di imaging medico, come la risonanza magnetica (MRI), la tomografia computerizzata (TC) e la tomografia a emissione di positroni (PET), la domanda di tecniche accurate di segmentazione delle immagini mediche è continuata ad aumentare. I metodi attuali per la segmentazione delle immagini mediche possono essere ampiamente suddivisi in tre approcci principali: metodi basati su reti neurali convoluzionali (CNN) 4, metodibasati su Transformer 5 e metodi basati su modelli nello spazio di stati (SSM) 6,7. I metodi basati su CNN impiegano tipicamente architetture di rete a forma di U per la segmentazione delle immagini mediche. L'architettura più diffusa in questa categoria èU-Net 8, che ha dimostrato l'efficacia di un'architettura encoder–decoder a forma di U per la segmentazione delle immagini biomediche. U-Net3+ combina connessioni di salto dense da UNet++9 con connessioni di salto su larga scala per migliorare l'aggregazione di caratteristiche multiscala. Tuttavia, i metodi basati su CNN hanno una capacità limitata di catturare dipendenze a lungo raggio e, di conseguenza, potrebbero non modellare efficacemente le informazioni contestuali a lungo raggio.
I metodi basati su trasformatori catturano efficacemente le dipendenze a lungo raggio attraverso il meccanismo di auto-attenzione, che consente il calcolo parallelo e assegna diversi pesi di attenzione a diverse regioni di interesse. UNETR++10 introduce il modulo Efficient Pair Attention (EPA) per ridurre il numero di parametri e i costi computazionali. nnFormer11 combina operazioni convoluzionali intercalate e di auto-attenzione e introduce un meccanismo di auto-attenzione locale–globale basato su volume per l'apprendimento delle rappresentazioni volumetriche nella segmentazione tridimensionale (3D) di immagini mediche. H2Former12 propone un efficiente Transformation di Visione ibrido gerarchico che combina meccanismi di attenzione con l'estrazione di caratteristiche basata su CNN nell'encoder. Tuttavia, i metodi basati su Transformer mostrano complessità computazionale quadratica con l'aumento della lunghezza della sequenza, risultando in costi computazionali sostanzialmente superiori. La Figura 1 illustra la motivazione per MVM-UNet e confronta la strategia proposta di scansione multiview con i framework di segmentazione basati su SSM esistenti.

Figura 1. Confronto di MVM-UNet con le architetture di segmentazione basate su modello di spazio di stato puro (SSM) esistenti. Confronto tra un framework di segmentazione convenzionale basato su modello di spazio di stati puro (SSM) e l'architettura proposta Multi-View Mamba U-Net (MVM-UNet). Il pannello superiore illustra MVM-UNet, in cui il modulo Multi-View 4-Directional (MV4D) estrae caratteristiche complementari utilizzando coppie di scansione a zigzag, gerarchiche, a spirale e radiali integrate tramite Spatial Fusion Mamba (SFusion Mamba), mentre Multi-stage Fusion Mamba (MFusion Mamba) aggrega le caratteristiche degli encoder multiscala prima della decodifica. Il pannello inferiore mostra un'architettura rappresentativa basata su SSM puro utilizzando moduli Selective Scan 2-Dimensional (SS2D) con cross scanning. La figura evidenzia le differenze architettoniche tra le reti di segmentazione convenzionali basate su SSM e il proposto MVM-UNet. Clicca qui per visualizzare una versione più grande di questa figura.
I metodi basati su SSM combinano la capacità globale di modellazione dei Transformers con la complessità computazionale lineare. L'architettura Mamba elabora selettivamente le informazioni di input utilizzando un modello selettivo dello spazio degli stati (Selective-SSM), permettendo al modello di regolare dinamicamente i propri parametri in base all'input, filtrando le informazioni irrilevanti e enfatizzando le caratteristiche informative. Vim13 e VMamba14 adattano l'architettura Mamba per compiti di visione artificiale. U-Mamba15 impiega un'architettura ibrida CNN–SSM per esplorare l'applicazione degli SSM nella segmentazione delle immagini mediche, mentre Mamba-UNet16 adotta un'architettura encoder-decoder completamente basata su SSM per la segmentazione delle immagini mediche. Questi metodi raggiungono prestazioni competitive utilizzando parametri sostanzialmente inferiori. Tuttavia, i metodi attuali basati su SSM/Mamba estraggono principalmente le caratteristiche dell'immagine utilizzando semplici patch e strategie di scansione SS2D, che presentano diverse limitazioni per la segmentazione delle immagini mediche. Innanzitutto, le tecniche SS2D e basate su patch sono progettate principalmente per compiti generali di visione artificiale. Local Mamba17 e MotionMamba 18 hanno suggerito che la strategia di scansione SS2D sia insufficiente per tutti i compiti visivi perché diverse strategie catturano diversi tipi di informazioni visive. In secondo luogo, la strategia di scansione SS2D è relativamente semplice, basandosi solo su direzioni di scansione orizzontali e verticali. Di conseguenza, potrebbe non catturare adeguatamente relazioni spaziali complesse e dettagli strutturali fini. La segmentazione delle immagini mediche richiede la modellazione simultanea sia del contesto spaziale globale sia delle precise caratteristiche anatomiche locali. Inoltre, i metodi attuali basati su SSM/Mamba forniscono una fusione limitata delle caratteristiche tra encoder e decoder. Architetture come UNet++ e FATNet migliorano la precisione della segmentazione attraverso una fusione di funzionalità migliorata, evidenziando l'importanza di un'integrazione efficace delle funzionalità per la segmentazione delle immagini mediche.
Per affrontare queste limitazioni, questo articolo propone un nuovo framework di segmentazione delle immagini mediche basato su Mamba, denominato MVM-UNet. Come mostrato nella Figura 1, il modulo proposto Multi-View Four-Directional (MV4D) funge da componente centrale per l'estrazione delle caratteristiche di MVM-UNet ed è specificamente progettato per la segmentazione delle immagini mediche integrando informazioni provenienti da quattro strategie di scansione distinte. Ogni strategia di scansione estrae caratteristiche dell'immagine complementare e rappresenta una vista diversa dell'immagine di input. La scansionea zigzag 19 alterna la direzione di percorrenza alla fine di ogni riga o colonna, bilanciando così le informazioni spaziali locali e globali. Al contrario, gli schemi a scansione a spirale e radiale20 offrono una copertura completa estendendosi sia verso l'esterno dal centro sia verso l'interno dalla periferia. La scansione gerarchica18 cattura sia caratteristiche locali che globali su più scale. Per migliorare la robustezza di ogni strategia di scansione, le coppie di scansione vengono unite prima di essere inserite nel blocco S6. Il modulo Scan-view Fusion Mamba (SFusion Mamba) integra successivamente le caratteristiche estratte dalle quattro modalità di scansione. Per utilizzare efficacemente le funzionalità degli encoder multiscala, questo articolo propone inoltre un modulo di fusione Mamba multiscala (MFusion Mamba), che accumula e fonde le uscite di ogni stadio del codificatore prima di passare le caratteristiche fuse al decodificatore. MVM-UNet è stato valutato sui dataset ISIC 2017, ISIC 2018 e Synapse. I risultati sperimentali dimostrano che MVM-UNet raggiunge performance di segmentazione competitive sui dataset ISIC 2017, ISIC 2018 e Synapse.
Le architetture di segmentazione rappresentativa hanno ulteriormente avanzato la segmentazione delle immagini mediche. U-Net è stato applicato con successo anche a compiti di analisi delle immagini biomediche come il conteggio delle cellule, la rilevazione e lamorfometria 21. Le architetture CNN potenziate dall'attenzione, comeCA-Net 22, migliorano la rappresentazione delle caratteristiche attraverso meccanismi di attenzione completi. I framework rappresentativi di segmentazione basati su Transformer, tra cui TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25, TransAttUNet26 eTransCUNet 27, dimostrano ulteriormente l'efficacia della modellazione globale delle caratteristiche basata sull'attenzione per la segmentazione delle immagini mediche.
La progettazione di MVM-UNet è motivata da due limitazioni dei metodi di segmentazione esistenti basati su SSM/Mamba. Innanzitutto, molti modelli attuali di Vision Mamba si basano su semplici strategie di scansione bidimensionale, che potrebbero essere insufficienti per immagini mediche con confini irregolari delle lesioni, piccole regioni bersaglio e strutture anatomiche multiscala. In secondo luogo, le architetture convenzionali encoder–decoder a forma di U trasferiscono principalmente caratteristiche attraverso le corrispondenti connessioni di salto, limitando l'uso diretto delle informazioni degli encoder multistadio durante la decodifica. Pertanto, MVM-UNet introduce MV4D per migliorare la modellazione spaziale multiview e MFusion Mamba per aggregare esplicitamente le caratteristiche degli encoder multistadio. Questo design è pensato per adattare la modellazione a lungo raggio basata su Mamba ai requisiti specifici della segmentazione delle immagini mediche.
Sebbene MVM-UNet sia costruito sul paradigma generale encoder–decoder e sulla modellazione di sequenze basata su Mamba, la sua novità risiede nel modo in cui questi componenti vengono adattati e integrati per la segmentazione delle immagini mediche. Piuttosto che semplicemente incorporare un blocco Mamba standard in una rete a forma di U, il framework proposto ridisegna il processo di modellazione spaziale attraverso più ramificazioni scan-pair orientate al compito, introduce SFusion Mamba per integrare rappresentazioni specifiche per la scansione, migliora il blocco MVV con percorsi residui e di proiezione, e inserisce MFusion Mamba tra encoder e decoder per aggregare le caratteristiche multistadio dell'encoder prima della decodifica. Questo design a livello architettonico mira ad affrontare i confini irregolari, le piccole regioni target e le strutture anatomiche multiscala comunemente osservate nelle immagini mediche.
Questo protocollo è più adatto per compiti di segmentazione che richiedono la modellazione simultanea di informazioni contestuali a lungo raggio, confini irregolari degli oggetti e strutture anatomiche multiscala in immagini mediche bidimensionali. Rispetto ai metodi di segmentazione basati su CNN, il design encoder–decoder basato su Mamba offre un meccanismo efficace di modellazione contestuale mantenendo un flusso di lavoro a forma di U familiare ai ricercatori di segmentazione delle immagini mediche. Rispetto ai metodi basati su Transformer, il framework proposto evita l'uso diretto dell'autoattenzione quadratica ed è destinato ai ricercatori che cercano modellazione contestuale globale utilizzando un meccanismo di modellazione di sequenza relativamente efficiente. Di conseguenza, questo protocollo è adatto per la segmentazione delle lesioni cutanee, la segmentazione degli organi addominali e compiti simili di segmentazione delle immagini mediche bidimensionali, in cui sono importanti sia le informazioni strutturali globali sia i dettagli dei confini locali.
Questo protocollo presenta anche delle limitazioni che dovrebbero essere considerate prima dell'utilizzo. Potrebbe non essere necessario per compiti di segmentazione relativamente semplici in cui una CNN leggera fornisce già prestazioni sufficienti. Inoltre, non è progettato direttamente per una segmentazione volumetrica tridimensionale completa senza un adattamento architettonico. I ricercatori con dati annotati molto limitati, risorse limitate per unità di elaborazione grafica (GPU) o requisiti di modelli classici altamente interpretabili dovrebbero considerare questi vincoli prima di applicare il protocollo. In generale, questo metodo è pensato per ricercatori che desiderano riprodurre e valutare un framework di segmentazione a forma di U basato su Mamba che bilancia la modellazione del contesto a lungo raggio, la rappresentazione locale dei confini e la fusione di caratteristiche multistadio.
I contributi chiave sono i seguenti:
1. Questo articolo presenta un nuovo framework di segmentazione delle immagini mediche basato su Mamba, denominato MVM-UNet. A differenza degli approcci che incorporano direttamente blocchi Mamba esistenti basati su SS2D o standard, MVM-UNet introduce MV4D per modellare le caratteristiche dell'immagine medica da quattro viste a coppie di scansione complementari, inclusi scansione a zigzag, gerarchica, a spirale e radiale.
2. Questo articolo progetta SFusion Mamba e il blocco MVV per integrare rappresentazioni specifiche per la scansione e migliorare la trasformazione delle caratteristiche. SFusion Mamba fonde le caratteristiche estratte da diversi rami di coppie di scansione, mentre i rami residui e quelli di proiezione Up-Down all'interno del blocco MVV forniscono percorsi complementari di caratteristiche che stabilizzano e arricchiscono le rappresentazioni delle caratteristiche.
3. Questo articolo introduce MFusion Mamba come modulo di fusione multistadio intermedio tra encoder e decoder. A differenza delle connessioni di salto convenzionali che trasferiscono principalmente caratteristiche dello stadio corrispondente, MFusion Mamba aggrega esplicitamente le caratteristiche dell'encoder multistadio tramite fusione da grossolano a fine e fornisce informazioni arricchite per la decodifica.
4. Ampi risultati sperimentali dimostrano che il proposto MVM-UNet raggiunge performance di segmentazione competitiva sui dataset ISIC 2017 e ISIC 2018 e forti prestazioni sul dataset di segmentazione multiorgano Synapse. Inoltre, studi di ablazione approfonditi validano il contributo di ciascun componente all'interno di MVM-UNet.