Medizinische Bildsegmentierung ist eine grundlegende Aufgabe in den Bereichen Computer Vision und medizinische Bildanalyse 1,2,3. Dabei wird ein Bild in mehrere Bereiche oder Objekte unterteilt, um es weiter zu analysieren und zu verarbeiten. Diese Technologie ist besonders wichtig in der medizinischen Bildgebung, da sie Klinikern hilft, pathologische Regionen zu identifizieren und zu lokalisieren, wodurch die diagnostische Genauigkeit und Behandlungsplanung verbessert werden. Mit dem Fortschritt medizinischer Bildgebungstechnologien wie Magnetresonanztomographie (MRT), Computertomographie (CT) und Positronenemissionstomographie (PET) ist die Nachfrage nach präzisen medizinischen Bildsegmentierungstechniken weiter gestiegen. Aktuelle Methoden zur Segmentierung medizinischer Bilder lassen sich grob in drei Hauptansätze einteilen: konvolutionelle neuronale Netzwerke (CNN)-basierte Methoden4, Transformer-basierte Methoden5 und Zustandsraummodell-(SSM)-basierte Methoden 6,7. CNN-basierte Methoden verwenden typischerweise U-förmige Netzwerkarchitekturen für die Segmentierung medizinischer Bilde. Die am weitesten verbreitete Architektur in dieser Kategorie ist U-Net8, die die Wirksamkeit einer U-förmigen Encoder-Decoder-Architektur für biomedizinische Bildsegmentierung demonstrierte. U-Net3+ kombiniert dichte Skip-Verbindungen von UNet++9 mit vollmaßstäblichen Skip-Verbindungen, um die Multiscale-Feature-Aggregation zu verbessern. CNN-basierte Methoden haben jedoch nur begrenzte Fähigkeit, Langstreckenabhängigkeiten zu erfassen, und modellieren daher möglicherweise nicht effektiv langfristige kontextuelle Informationen.
Transformatorbasierte Methoden erfassen langfristige Abhängigkeiten effektiv durch den Selbst-Aufmerksamkeitsmechanismus, der parallele Berechnungen ermöglicht und unterschiedliche Aufmerksamkeitsgewichte für verschiedene Interessensgebiete zuweist. UNETR++10 führt das Modul Efficient Paired Attention (EPA) ein, um die Anzahl der Parameter und die Rechenkosten zu reduzieren. nnFormer11 kombiniert ineinandergreifende Faltungs- und Selbstaufmerksamkeitsoperationen und führt einen lokal–globalen, volumenbasierten Selbst-Aufmerksamkeitsmechanismus zum Erlernen volumetrischer Darstellungen in dreidimensionaler (3D) medizinischer Bildsegmentierung ein. H2Former12 schlägt einen effizienten hierarchischen hybriden Vision Transformer vor, der Aufmerksamkeitsmechanismen mit CNN-basierter Merkmalsextraktion im Encoder kombiniert. Transformatorbasierte Methoden zeigen jedoch quadratische Rechenkomplexität mit zunehmender Sequenzlänge, was zu deutlich höheren Rechenkosten führt. Abbildung 1 veranschaulicht die Motivation für MVM-UNet und vergleicht die vorgeschlagene Multiview-Scan-Strategie mit bestehenden SSM-basierten Segmentierungsrahmen.

Abbildung 1. Vergleich von MVM-UNet mit bestehenden reinen Zustandsraummodell-(SSM)-basierten Segmentierungsarchitekturen. Vergleich zwischen einem konventionellen, auf reinem Zustandsraummodell (SSM)-basierten Segmentierungsrahmen und der vorgeschlagenen Multi-View Mamba U-Net (MVM-UNet)-Architektur. Das obere Panel zeigt MVM-UNet, in dem das Multi-View 4-Directional (MV4D) Modul komplementäre Merkmale mithilfe von Zickzack-, Hierarchische-, Spiral- und Radialscan-Paaren extrahiert, die durch Spatial Fusion Mamba (SFusion Mamba) integriert werden, während Multistage Fusion Mamba (MFusion Mamba) Multiscale-Encoder-Features vor der Dekodierung aggregiert. Das untere Panel zeigt eine repräsentative, reine SSM-basierte Architektur, die Selective Scan 2-Dimensional (SS2D) Module mit Cross-Scanning verwendet. Die Abbildung hebt die architektonischen Unterschiede zwischen konventionellen SSM-basierten Segmentierungsnetzwerken und dem vorgeschlagenen MVM-UNet hervor. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
SSM-basierte Methoden kombinieren die globale Modellierungsfähigkeit von Transformatoren mit linearer Rechenkomplexität. Die Mamba-Architektur verarbeitet Eingabeinformationen selektiv mittels eines selektiven Zustandsraummodells (Selective-SSM), wodurch das Modell seine Parameter dynamisch entsprechend der Eingabe anpassen kann, während irrelevante Informationen gefiltert und informative Funktionen hervorgehoben werden. Vim13 und VMamba14 passen die Mamba-Architektur für Computer-Vision-Aufgaben an. U-Mamba15 verwendet eine hybride CNN–SSM-Architektur, um die Anwendung von SSMs in der Segmentierung medizinischer Bilder zu erforschen, während Mamba-UNet16 eine vollständig SSM-basierte Encoder-Decoder-Architektur für die Segmentierung medizinischer Bilder verwendet. Diese Methoden erzielen wettbewerbsfähige Leistungen bei deutlich weniger Parametern. Derzeit extrahieren SSM/Mamba-basierte Methoden jedoch hauptsächlich Bildmerkmale mittels einfacher Bildpatches und SS2D-Scanningsstrategien, die mehrere Einschränkungen für die medizinische Bildsegmentierung mit sich bringen. Erstens sind SS2D- und patchbasierte Techniken hauptsächlich für allgemeine Computer-Vision-Aufgaben konzipiert. Local Mamba17 und Motion Mamba18 haben vorgeschlagen, dass die SS2D-Scan-Strategie für alle visuellen Aufgaben unzureichend ist, da verschiedene Scan-Strategien unterschiedliche Arten visueller Informationen erfassen. Zweitens ist die SS2D-Scanstrategie relativ einfach und verlässt sich nur auf horizontale und vertikale Scanrichtungen. Folglich erfasst sie möglicherweise nicht ausreichend komplexe räumliche Beziehungen und feine strukturelle Details. Die Segmentierung medizinischer Bilder erfordert eine gleichzeitige Modellierung sowohl des globalen räumlichen Kontexts als auch präziser lokaler anatomischer Merkmale. Darüber hinaus bieten aktuelle SSM/Mamba-basierte Methoden eine begrenzte Funktionsfusion zwischen Encoder und Decoder. Architekturen wie UNet++ und FATNet verbessern die Segmentierungsgenauigkeit durch verbesserte Feature-Fusion und unterstreichen die Bedeutung einer effektiven Feature-Integration für die Segmentierung medizinischer Bilder.
Um diese Einschränkungen zu beheben, schlägt dieses Papier ein neuartiges, auf Mamba basierendes medizinisches Bildsegmentierungssystem vor, das MVM-UNet genannt wird. Wie in Abbildung 1 dargestellt, dient das vorgeschlagene Multi-View Four-Directional (MV4D)-Modul als Kernkomponente zur Feature-Extraktion von MVM-UNet und ist speziell für die Segmentierung medizinischer Bilder konzipiert, indem Informationen aus vier unterschiedlichen Scanstrategien integriert werden. Jede Scan-Strategie extrahiert komplementäre Bildmerkmale und stellt eine andere Ansicht des Eingabebildes dar. Zickzack-Scanning19 wechselt die Durchlaufrichtung am Ende jeder Reihe oder Spalte ab und balanciert so lokale und globale räumliche Informationen aus. Im Gegensatz dazu bieten spiralförmige und radiale Scanschemata20 eine umfassende Abdeckung, indem sie entweder vom Zentrum nach außen oder vom Rand nach innen erstrecken. Hierarchisches Scannen18 erfasst sowohl lokale als auch globale Merkmale auf mehreren Skalen. Um die Robustheit jeder Scan-Strategie zu verbessern, werden die Scanpaare zusammengeführt, bevor sie in den S6-Block eingegeben werden. Das Scan-view Fusion Mamba (SFusion Mamba)-Modul integriert anschließend die aus den vier Scanmodalitäten extrahierten Merkmale. Um Multiscale-Encoder-Funktionen effektiv zu nutzen, schlägt dieses Paper außerdem ein Multiscale-Mamba-Fusionsmodul (MFusion Mamba) vor, das die Ausgänge jeder Encoderstufe sammelt und fusioniert, bevor die fusionierten Features an den Decoder weitergeleitet werden. MVM-UNet wurde auf den Datensätzen ISIC 2017, ISIC 2018 und Synapse ausgewertet. Experimentelle Ergebnisse zeigen, dass MVM-UNet auf den ISIC 2017, ISIC 2018 und Synapse-Datensätzen eine wettbewerbsfähige Segmentierungsleistung erzielt.
Repräsentative Segmentierungsarchitekturen haben die Segmentierung medizinischer Bilder weiter vorangebracht. U-Net wurde auch erfolgreich für biomedizinische Bildanalyseaufgaben wie Zellzählung, -erkennung und Morphometrie21 eingesetzt. Aufmerksamkeitsverstärkte CNN-Architekturen wie CA-Net22 verbessern die Merkmalsrepräsentation durch umfassende Aufmerksamkeitsmechanismen. Repräsentative, transformatorbasierte Segmentierungsrahmen, darunter TransUNet23, Pyramid Medical Transformer24, Swin U-Net25, TransAttUNet26 und TransCUNet27, demonstrieren zudem die Wirksamkeit aufmerksamkeitsbasierter globaler Merkmalmodellierung für medizinische Bildsegmentierung.
Das Design von MVM-UNet wird durch zwei Einschränkungen bestehender SSM/Mamba-basierter Segmentierungsmethoden motiviert. Erstens basieren viele aktuelle Vision Mamba-Modelle auf einfachen zweidimensionalen Scan-Strategien, die für medizinische Bilder mit unregelmäßigen Läsionsgrenzen, kleinen Zielregionen und multiskaligen anatomischen Strukturen möglicherweise unzureichend sind. Zweitens übertragen konventionelle U-förmige Encoder-Decoder-Architekturen hauptsächlich Funktionen über entsprechende Skip-Verbindungen, was die direkte Nutzung von mehrstufigen Encoderinformationen während der Dekodierung einschränkt. Daher führt MVM-UNet MV4D ein, um die Multiview-Raummodellierung zu verbessern, und MFusion Mamba, um explizit mehrstufige Encoderfunktionen zu aggregieren. Dieses Design soll die auf Mamba basierende Langstreckenmodellierung an die spezifischen Anforderungen der medizinischen Bildsegmentierung anpassen.
Obwohl MVM-UNet auf dem allgemeinen Encoder-Decoder-Paradigma und der Mamba-basierten Sequenzmodellierung basiert, liegt seine Neuheit darin, wie diese Komponenten für die medizinische Bildsegmentierung angepasst und integriert werden. Anstatt einfach einen Standard-Mamba-Block in ein U-förmiges Netzwerk-Backbone zu integrieren, gestaltet das vorgeschlagene Framework den räumlichen Modellierungsprozess durch mehrere aufgabenorientierte Scan-Pair-Zweige neu, führt SFusion Mamba ein, um scan-spezifische Darstellungen zu integrieren, verbessert den MVV-Block mit Rest- und Projektionspfaden und fügt MFusion Mamba zwischen Encoder und Decoder ein, um mehrstufige Encoder-Funktionen vor der Dekodierung zu aggregieren. Dieses Design auf Architekturebene zielt darauf ab, die unregelmäßigen Grenzen, kleinen Zielregionen und multiskaligen anatomischen Strukturen zu adressieren, die häufig in medizinischen Bildern beobachtet werden.
Dieses Protokoll eignet sich am besten für Segmentierungsaufgaben, die eine gleichzeitige Modellierung von Fernkontextinformationen, unregelmäßigen Objektgrenzen und multiskaligen anatomischen Strukturen in zweidimensionalen medizinischen Bildern erfordern. Im Vergleich zu CNN-basierten Segmentierungsmethoden bietet das Mamba-basierte Encoder-Decoder-Design einen effektiven Kontextmodellierungsmechanismus, während ein U-förmiger Arbeitsablauf beibehalten bleibt, der medizinischen Bildsegmentierungsforschern vertraut ist. Im Vergleich zu Transformer-basierten Methoden vermeidet das vorgeschlagene Framework die direkte Nutzung quadratischer Selbstaufmerksamkeit und richtet sich an Forscher, die globale kontextuelle Modellierung mit einem relativ effizienten Sequenzmodellierungsmechanismus suchen. Dementsprechend eignet sich dieses Protokoll für Hautläsionsegmentierung, Segmentierung von Bauchorganen und ähnliche zweidimensionale medizinische Bildsegmentierungsaufgaben, bei denen sowohl globale strukturelle Informationen als auch lokale Randdetails wichtig sind.
Dieses Protokoll hat zudem Einschränkungen, die vor der Anwendung berücksichtigt werden sollten. Für relativ einfache Segmentierungsaufgaben, bei denen ein leichtes CNN bereits ausreichende Leistung bietet, ist es möglicherweise nicht notwendig. Außerdem ist sie nicht direkt für eine vollständige dreidimensionale volumetrische Segmentierung ohne architektonische Anpassung konzipiert. Forscher mit sehr begrenzten annotierten Daten, begrenzten Ressourcen der Grafikeinheit (GPU) oder einem Bedarf an hochinterpretierbaren klassischen Modellen sollten diese Einschränkungen ebenfalls berücksichtigen, bevor sie das Protokoll anwenden. Insgesamt ist diese Methode für Forscher gedacht, die ein Mamba-basiertes, U-förmiges Segmentierungsframework reproduzieren und evaluieren möchten, das Langzeitkontextmodellierung, lokale Randdarstellung und mehrstufige Merkmalsfusion ausbalanciert.
Die wichtigsten Beiträge sind wie folgt:
1. Dieses Papier präsentiert ein neuartiges, auf Mamba basierendes medizinisches Bildsegmentierungs-Framework, das MVM-UNet genannt wird. Im Gegensatz zu Ansätzen, die bereits bestehende SS2D-basierte oder Standard-Mamba-Blöcke direkt integrieren, führt MVM-UNet MV4D ein, um medizinische Bildmerkmale aus vier komplementären Scanpaar-Ansichten zu modellieren, darunter Zickzack-, hierarchische, spiral- und radiale Scans.
2. Dieses Paper entwirft SFusion Mamba und den MVV-Block, um scan-spezifische Darstellungen zu integrieren und die Feature-Transformation zu verbessern. SFusion Mamba fusioniert die aus verschiedenen Scanpaar-Zweigen extrahierten Merkmale, während die Residual- und Up-Down-Projektion-Zweige im MVV-Block komplementäre Merkmalswege bieten, die die Merkmalsrepräsentationen stabilisieren und bereichern.
3. Dieses Paper führt MFusion Mamba als intermediäres mehrstufiges Fusionsmodul zwischen Encoder und Decoder ein. Im Gegensatz zu herkömmlichen Skip-Verbindungen, die hauptsächlich korrespondierende Stufenmerkmale übertragen, aggregiert MFusion Mamba explizit mehrstufige Encoderfunktionen durch grobe bis feine Fusion und liefert erweiterte Informationen für die Dekodierung.
4. Umfangreiche experimentelle Ergebnisse zeigen, dass das vorgeschlagene MVM-UNet eine wettbewerbsfähige Segmentierungsleistung auf den ISIC 2017- und ISIC 2018-Datensätzen sowie eine starke Leistung auf dem Synapse-Multiorgan-Segmentierungsdatensatz erzielt. Darüber hinaus validieren umfassende Ablationsstudien den Beitrag jeder einzelnen Komponente innerhalb von MVM-UNet.