La segmentation d’images médicales est une tâche fondamentale dans les domaines de la vision par ordinateur et de l’analyse d’imagesmédicales 1,2,3. Il consiste à partitionner une image en plusieurs régions ou objets pour une analyse et un traitement ultérieurs. Cette technologie est particulièrement importante en imagerie médicale car elle aide les cliniciens à identifier et localiser les régions pathologiques, améliorant ainsi la précision diagnostique et la planification du traitement. Avec l’avancement des technologies d’imagerie médicale, telles que l’imagerie par résonance magnétique (IRM), la tomodensitométrie (CT) et la tomographie par émission de positons (TEP), la demande pour des techniques précises de segmentation médicale d’images n’a cessé d’augmenter. Les méthodes actuelles pour la segmentation d’images médicales peuvent être globalement catégorisées en trois approches principales : méthodes basées sur réseaux neuronauxconvolutionnels (CNN) 4, méthodes basées surTransformer 5, et méthodes basées sur le modèle d’espace d’états (SSM) 6,7. Les méthodes basées sur CNN utilisent généralement des architectures réseau en forme de U pour la segmentation d’images médicales. L’architecture la plus utilisée dans cette catégorie estU-Net 8, qui a démontré l’efficacité d’une architecture encodeur-décodeur en forme de U pour la segmentation d’images biomédicales. U-Net3+ combine des connexions de saut denses de UNet++9 avec des connexions de saut à grande échelle pour améliorer l’agrégation de caractéristiques multiéchelle. Cependant, les méthodes basées sur CNN ont une capacité limitée à capturer des dépendances à longue portée et, par conséquent, peuvent ne pas modéliser efficacement les informations contextuelles à longue portée.
Les méthodes basées sur les transformateurs capturent efficacement les dépendances à longue portée grâce au mécanisme d’auto-attention, qui permet le calcul parallèle et attribue différents poids d’attention à différentes régions d’intérêt. UNETR++10 introduit le module Attention Pairée Efficace (EPA) pour réduire le nombre de paramètres et le coût de calcul. nnFormer11 combine des opérations convolutionnelles entrelacées et d’auto-attention, et introduit un mécanisme d’auto-attention local–global basé sur le volume pour apprendre les représentations volumétriques dans la segmentation d’images médicales tridimensionnelle (3D). H2Former12 propose un transformateur de vision hybride hiérarchique efficace qui combine des mécanismes d’attention avec l’extraction de caractéristiques basée sur CNN dans l’encodeur. Cependant, les méthodes basées sur les transformateurs présentent une complexité de calcul quadratique avec l’augmentation de la longueur de la séquence, ce qui entraîne un coût computationnel nettement plus élevé. La Figure 1 illustre la motivation de MVM-UNet et compare la stratégie proposée de balayage multiview avec les cadres de segmentation existants basés sur le SSM.

Figure 1. Comparaison de MVM-UNet avec les architectures de segmentation existantes basées sur des modèles purement d’espace d’états (SSM). Comparaison entre un cadre de segmentation conventionnel basé sur un modèle d’espace d’états pur (SSM) et l’architecture proposée Multi-View Mamba U-Net (MVM-UNet). Le panneau supérieur illustre MVM-UNet, dans lequel le module Multi-View 4-Directional (MV4D) extrait des caractéristiques complémentaires à l’aide de paires de balayage en zigzag, hiérarchique, spirale et radiale intégrées par Spatial Fusion Mamba (SFusion Mamba), tandis que Multi-stage Fusion Mamba (MFusion Mamba) agrège des caractéristiques d’encodeurs multi-échelle avant le décodage. Le panneau inférieur présente une architecture représentative basée uniquement sur le SSM utilisant des modules à balayage sélectif 2-dimensionnel (SS2D) avec balayage croisé. La figure met en lumière les différences architecturales entre les réseaux de segmentation conventionnels basés sur le SSM et le MVM-UNet proposé. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Les méthodes basées sur SSM combinent la capacité de modélisation globale des Transformers avec une complexité computationnelle linéaire. L’architecture Mamba traite sélectivement les informations d’entrée à l’aide d’un modèle sélectif d’espace d’états (Selective-SSM), permettant au modèle d’ajuster dynamiquement ses paramètres selon l’entrée tout en filtrant les informations non pertinentes et en mettant l’accent sur les caractéristiques informatives. Vim13 et VMamba14 adaptent l’architecture Mamba aux tâches de vision par ordinateur. U-Mamba15 utilise une architecture hybride CNN–SSM pour explorer l’application des SSM dans la segmentation d’images médicales, tandis que Mamba-UNet16 adopte une architecture encodeur-décodeur entièrement basée sur SSM pour la segmentation d’images médicales. Ces méthodes permettent d’obtenir des performances compétitives tout en utilisant beaucoup moins de paramètres. Cependant, les méthodes actuelles basées sur SSM/Mamba extraient principalement les caractéristiques d’image à l’aide de patches simples et de stratégies de balayage SS2D, ce qui présente plusieurs limites pour la segmentation médicale de l’image. Premièrement, les techniques SS2D et basées sur les correctifs sont principalement conçues pour des tâches générales de vision par ordinateur. Local Mamba17 et MotionMamba 18 ont suggéré que la stratégie de balayage SS2D est insuffisante pour toutes les tâches visuelles car différentes stratégies de balayage capturent différents types d’informations visuelles. Deuxièmement, la stratégie de balayage SS2D est relativement simple, ne reposant que sur les directions de balayage horizontales et verticales. Par conséquent, il peut ne pas capturer adéquatement des relations spatiales complexes et des détails structurels fins. La segmentation médicale de l’image nécessite une modélisation simultanée à la fois du contexte spatial global et des caractéristiques anatomiques locales précises. De plus, les méthodes actuelles basées sur SSM/Mamba offrent une fusion limitée des fonctionnalités entre l’encodeur et le décodeur. Des architectures telles que UNet++ et FATNet améliorent la précision de segmentation grâce à une fusion de fonctionnalités renforcée, soulignant l’importance d’une intégration efficace des fonctionnalités pour la segmentation d’images médicales.
Pour remédier à ces limitations, cet article propose un nouveau cadre de segmentation d’images médicales basé sur Mamba, appelé MVM-UNet. Comme montré à la Figure 1, le module Multi-View Four-Directional (MV4D) proposé sert de composant central d’extraction de caractéristiques de MVM-UNet et est spécifiquement conçu pour la segmentation d’images médicales en intégrant des informations issues de quatre stratégies de balayage distinctes. Chaque stratégie de balayage extrait des caractéristiques d’image complémentaires et représente une vue différente de l’image d’entrée. Le balayageen zigzag 19 alterne la direction de parcours à la fin de chaque ligne ou colonne, équilibrant ainsi les informations spatiales locales et globales. En revanche, les schémas de balayage en spirale et radial20 offrent une couverture complète en s’étendant soit vers l’extérieur depuis le centre, soit vers l’intérieur depuis la périphérie. Le balayagehiérarchique 18 capture à la fois des caractéristiques locales et globales à plusieurs échelles. Pour améliorer la robustesse de chaque stratégie de balayage, les paires de balayage sont fusionnées avant d’être saisies dans le bloc S6. Le module Scan-view Fusion Mamba (SFusion Mamba) intègre ensuite les fonctionnalités extraites des quatre modalités de balayage. Pour exploiter efficacement les caractéristiques des encodeurs multiéchelle, cet article propose également un module de fusion Mamba multi-échelle (MFusion Mamba), qui accumule et fusionne les sorties de chaque étage d’encodeur avant de transmettre les caractéristiques fusionnées au décodeur. MVM-UNet a été évalué sur les ensembles de données ISIC 2017, ISIC 2018 et Synapse. Les résultats expérimentaux démontrent que MVM-UNet atteint des performances de segmentation compétitives sur les ensembles de données ISIC 2017, ISIC 2018 et Synapse.
Les architectures de segmentation représentative ont encore fait progresser la segmentation d’images médicales. U-Net a également été appliqué avec succès à des tâches d’analyse d’images biomédicales telles que le comptage cellulaire, la détection et la morphométrie21. Les architectures CNN à assistance améliorée, telles queCA-Net 22, améliorent la représentation des caractéristiques grâce à des mécanismes d’attention complets. Des cadres de segmentation représentatifs basés sur Transformers, dont TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25,TransAttUNet 26 etTransCUNet 27, démontrent également l’efficacité de la modélisation globale des caractéristiques basée sur l’attention pour la segmentation d’images médicales.
La conception de MVM-UNet est motivée par deux limitations des méthodes de segmentation existantes basées sur SSM/Mamba. Tout d’abord, de nombreux modèles actuels de Vision Mamba reposent sur des stratégies de balayage bidimensionnelle simples, qui peuvent être insuffisantes pour des images médicales présentant des limites irrégulières de lésions, de petites régions cibles et des structures anatomiques multi-échelles. Deuxièmement, les architectures conventionnelles encodeur-décodeur en U transfèrent principalement des caractéristiques via des connexions de saut correspondantes, limitant l’utilisation directe des informations des encodeurs multi-étages lors du décodage. Par conséquent, MVM-UNet introduit MV4D pour améliorer la modélisation spatiale multiview et MFusion Mamba pour agréger explicitement les caractéristiques de l’encodeur multi-étages. Cette conception vise à adapter la modélisation à longue portée basée sur Mamba aux exigences spécifiques de la segmentation d’images médicales.
Bien que MVM-UNet soit construit sur le paradigme général encodeur-décodeur et la modélisation de séquences basée sur Mamba, sa nouveauté réside dans l’adaptation et l’intégration de ces composants pour la segmentation d’images médicales. Plutôt que d’incorporer simplement un bloc Mamba standard dans un réseau en forme de U, le cadre proposé redessine le processus de modélisation spatiale à travers plusieurs branches de paires de balayage orientées tâche, introduit SFusion Mamba pour intégrer des représentations spécifiques au balayage, améliore le bloc MVV avec des voies résiduelles et de projection, et insère MFusion Mamba entre l’encodeur et le décodeur pour agréger les fonctionnalités de l’encodeur multi-étages avant le décodage. Cette conception au niveau architectural vise à traiter les limites irrégulières, les petites régions cibles et les structures anatomiques multi-échelle couramment observées dans les images médicales.
Ce protocole est particulièrement adapté aux tâches de segmentation nécessitant la modélisation simultanée d’informations contextuelles à longue portée, de frontières irrégulières d’objets et de structures anatomiques multi-échelle dans des images médicales bidimensionnelles. Comparé aux méthodes de segmentation basées sur CNN, la conception encodeur-décodeur basée sur Mamba offre un mécanisme efficace de modélisation contextuelle tout en conservant un flux de travail en U familier aux chercheurs en segmentation d’images médicales. Comparé aux méthodes basées sur Transformer, le cadre proposé évite l’utilisation directe de l’auto-attention quadratique et s’adresse aux chercheurs recherchant une modélisation contextuelle globale utilisant un mécanisme de modélisation de séquences relativement efficace. En conséquence, ce protocole convient à la segmentation des lésions cutanées, à la segmentation des organes abdominaux et à d’autres tâches bidimensionnelles de segmentation d’images médicales bidimensionnelles où l’information structurelle globale et les détails locaux des limites sont importants.
Ce protocole présente également des limites à prendre en compte avant utilisation. Il peut ne pas être nécessaire pour des tâches de segmentation relativement simples dans lesquelles un CNN léger offre déjà des performances suffisantes. De plus, il n’est pas directement conçu pour une segmentation volumétrique complète en trois dimensions sans adaptation architecturale. Les chercheurs disposant de données annotées très limitées, de ressources limitées en unités de traitement graphique (GPU) ou d’un besoin de modèles classiques hautement interprétables devraient également prendre en compte ces contraintes avant d’appliquer le protocole. Dans l’ensemble, cette méthode est destinée aux chercheurs cherchant à reproduire et évaluer un cadre de segmentation en forme de U basé sur Mamba, qui équilibre modélisation contextuelle à long terme, représentation des frontières locales et fusion de caractéristiques à plusieurs étages.
Les contributions clés sont les suivantes :
1. Cet article présente un nouveau cadre de segmentation d’images médicales basé sur Mamba, appelé MVM-UNet. Contrairement aux approches qui intègrent directement des blocs Mamba existants basés sur SS2D ou standards, MVM-UNet introduit MV4D pour modéliser les caractéristiques d’images médicales à partir de quatre vues complémentaires de paires de balayage, incluant le balayage en zigzag, hiérarchique, spiral et radial.
2. Cet article conçoit SFusion Mamba et le bloc MVV pour intégrer des représentations spécifiques au balayage et améliorer la transformation des caractéristiques. SFusion Mamba fusionne les caractéristiques extraites de différentes branches de paires de balayage, tandis que les branches résiduelles et de projection haut-bas au sein du bloc MVV fournissent des voies complémentaires qui stabilisent et enrichissent les représentations des caractéristiques.
3. Cet article présente MFusion Mamba comme module de fusion multi-étage intermédiaire entre l’encodeur et le décodeur. Contrairement aux connexions de saut conventionnelles qui transfèrent principalement des caractéristiques correspondantes, MFusion Mamba agrège explicitement les caractéristiques des encodeurs multi-étages par fusion grossière-fine-fine et fournit des informations enrichies pour le décodage.
4. Des résultats expérimentaux étendus démontrent que le MVM-UNet proposé atteint des performances de segmentation compétitive sur les ensembles de données ISIC 2017 et ISIC 2018 ainsi que de fortes performances sur le jeu de données de segmentation multiorgane Synapse. De plus, des études d’ablation complètes valident la contribution de chaque composant au sein du MVM-UNet.