La segmentación de imágenes médicas es una tarea fundamental en los campos de la visión por ordenador y el análisis de imágenesmédicas 1,2,3. Consiste en particionar una imagen en múltiples regiones u objetos para su análisis y procesamiento posteriores. Esta tecnología es especialmente importante en la imagen médica porque ayuda a los clínicos a identificar y localizar regiones patológicas, mejorando así la precisión diagnóstica y la planificación del tratamiento. Con el avance de las tecnologías de imagen médica, como la resonancia magnética (IRM), la tomografía computarizada (TC) y la tomografía por emisión de positrones (PET), la demanda de técnicas precisas de segmentación de imágenes médicas ha seguido aumentando. Los métodos actuales para la segmentación de imágenes médicas pueden categorizarse en tres enfoques principales: métodos basados en redes neuronales convolucionales (CNN) 4, métodosbasados en transformadores 5 y métodos basados en modelos de espacio de estados (SSM) 6,7. Los métodos basados en CNN suelen emplear arquitecturas de red en forma de U para la segmentación de imágenes médicas. La arquitectura más utilizada en esta categoría esU-Net 8, que demostró la eficacia de una arquitectura codificador-decodificador en forma de U para la segmentación de imágenes biomédicas. U-Net3+ combina conexiones de salto denso de UNet++9 con conexiones de salto a escala real para mejorar la agregación de características multiescala. Sin embargo, los métodos basados en CNN tienen una capacidad limitada para capturar dependencias a largo plazo y, por tanto, pueden no modelar eficazmente la información contextual a largo plazo.
Los métodos basados en transformadores capturan eficazmente dependencias a largo alcance mediante el mecanismo de autoatención, que permite el cálculo paralelo y asigna diferentes pesos de atención a distintas regiones de interés. UNETR++10 introduce el módulo de Atención Eficiente en Pareja (EPA) para reducir el número de parámetros y el coste computacional. nnFormer11 combina operaciones convolucionales entrelazadas y de autoatención, e introduce un mecanismo de autoatención local–global basado en volumen para aprender representaciones volumétricas en segmentación de imágenes médicas tridimensionales (3D). H2Former12 propone un transformador de visión híbrido jerárquico eficiente que combina mecanismos de atención con la extracción de características basada en CNN en el codificador. Sin embargo, los métodos basados en transformadores presentan complejidad computacional cuadrática con el aumento de la longitud de la secuencia, lo que resulta en un coste computacional sustancialmente mayor. La Figura 1 ilustra la motivación para MVM-UNet y compara la estrategia propuesta de escaneo multivista con los marcos de segmentación basados en SSM existentes.

Figura 1. Comparación de MVM-UNet con las arquitecturas de segmentación basadas en modelos puros de espacio de estados (SSM) existentes. Comparación entre un marco convencional de segmentación basado en un modelo de espacio de estados puro (SSM) y la arquitectura propuesta Multi-View Mamba U-Net (MVM-UNet). El panel superior ilustra MVM-UNet, en el que el módulo Multi-View 4-Directional (MV4D) extrae características complementarias usando pares de escaneo en zigzag, jerárquico, espiral y radial que se integran mediante Spatial Fusion Mamba (SFusion Mamba), mientras que Multistage Fusion Mamba (MFusion Mamba) agrega características del codificador multiescala antes de decodificarlas. El panel inferior muestra una arquitectura representativa basada en SSM pura utilizando módulos de escaneo selectivo bidimensional (SS2D) con barrido cruzado. La figura destaca las diferencias arquitectónicas entre las redes de segmentación convencionales basadas en SSM y el MVM-UNet propuesto. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Los métodos basados en SSM combinan la capacidad global de modelado de los Transformers con la complejidad computacional lineal. La arquitectura Mamba procesa selectivamente la información de entrada usando un modelo selectivo de espacio de estados (Selective-SSM), lo que permite al modelo ajustar dinámicamente sus parámetros según la entrada mientras filtra información irrelevante y enfatiza características informativas. Vim13 y VMamba14 adaptan la arquitectura Mamba para tareas de visión por ordenador. U-Mamba15 emplea una arquitectura híbrida CNN–SSM para explorar la aplicación de los SSM en la segmentación de imágenes médicas, mientras que Mamba-UNet16 adopta una arquitectura codificador-decodificador completamente basada en SSM para la segmentación de imágenes médicas. Estos métodos logran un rendimiento competitivo utilizando parámetros sustancialmente menores. Sin embargo, los métodos actuales basados en SSM/Mamba extraen principalmente características de imagen utilizando parches simples y estrategias de escaneo SS2D, lo que presenta varias limitaciones para la segmentación de imágenes médicas. En primer lugar, las técnicas SS2D y basadas en parches están diseñadas principalmente para tareas generales de visión por ordenador. Local Mamba17 y MotionMamba 18 han sugerido que la estrategia de escaneo SS2D es insuficiente para todas las tareas visuales porque diferentes estrategias capturan distintos tipos de información visual. En segundo lugar, la estrategia de escaneo SS2D es relativamente sencilla, basándose únicamente en direcciones de escaneo horizontales y verticales. En consecuencia, puede que no capture adecuadamente relaciones espaciales complejas ni detalles estructurales finos. La segmentación de imágenes médicas requiere modelado simultáneo tanto del contexto espacial global como de características anatómicas locales precisas. Además, los métodos actuales basados en SSM/Mamba proporcionan una fusión limitada de características entre el codificador y el decodificador. Arquitecturas como UNet++ y FATNet mejoran la precisión de la segmentación mediante una fusión de características mejorada, destacando la importancia de una integración eficaz de características para la segmentación de imágenes médicas.
Para abordar estas limitaciones, este artículo propone un novedoso marco de segmentación de imágenes médicas basado en Mamba, denominado MVM-UNet. Como se muestra en la Figura 1, el módulo propuesto Multi-View Four-Directional (MV4D) sirve como el componente central de extracción de características de MVM-UNet y está diseñado específicamente para la segmentación de imágenes médicas integrando información de cuatro estrategias de escaneo distintas. Cada estrategia de escaneo extrae características complementarias de la imagen y representa una vista diferente de la imagen de entrada. El escaneo en zigzag19 alterna la dirección de recorrido al final de cada fila o columna, equilibrando así la información espacial local y global. En cambio, los esquemas de escaneo espiral y radial20 proporcionan una cobertura integral extendiéndose hacia fuera desde el centro o hacia el interior desde la periferia. El escaneo jerárquico18 captura tanto características locales como globales a múltiples escalas. Para mejorar la robustez de cada estrategia de escaneo, se fusionan pares de escaneo antes de introducirse en el Bloque S6. El módulo Scan-view Fusion Mamba (SFusion Mamba) integra posteriormente las características extraídas de las cuatro modalidades de escaneo. Para utilizar eficazmente las características del codificador multiescala, este artículo propone además un módulo de fusión Mamba multiescala (MFusion Mamba), que acumula y fusiona las salidas de cada etapa del codificador antes de pasar las características fusionadas al decodificador. MVM-UNet fue evaluado en los conjuntos de datos ISIC 2017, ISIC 2018 y Synapse. Los resultados experimentales demuestran que MVM-UNet logra un rendimiento competitivo en segmentación en los conjuntos de datos ISIC 2017, ISIC 2018 y Synapse.
Las arquitecturas de segmentación representativa han avanzado aún más la segmentación de imágenes médicas. U-Net también se ha aplicado con éxito a tareas de análisis de imágenes biomédicas como el recuento celular, la detección y la morfometría21. Las arquitecturas CNN mejoradas por la atención, comoCA-Net 22, mejoran la representación de características mediante mecanismos de atención integrales. Los marcos representativos de segmentación basados en Transformers, incluyendo TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25,TransAttUNet 26 yTransCUNet 27, demuestran aún más la eficacia del modelado global de características basado en atención para la segmentación de imágenes médicas.
El diseño de MVM-UNet está motivado por dos limitaciones de los métodos de segmentación basados en SSM/Mamba. En primer lugar, muchos modelos actuales de Vision Mamba dependen de estrategias de escaneo bidimensionales simples, que pueden ser insuficientes para imágenes médicas que contengan límites irregulares de lesiones, regiones objetivo pequeñas y estructuras anatómicas a escala multipla. En segundo lugar, las arquitecturas convencionales codificador-decodificador en forma de U transfieren principalmente características a través de conexiones de salto correspondientes, limitando el uso directo de información del codificador multietapa durante la decodificación. Por ello, MVM-UNet introduce MV4D para mejorar el modelado espacial multivista y MFusion Mamba para agregar explícitamente características del codificador multietapa. Este diseño está destinado a adaptar el modelado de largo alcance basado en Mamba a los requisitos específicos de la segmentación de imágenes médicas.
Aunque MVM-UNet se basa en el paradigma general codificador-decodificador y en el modelado de secuencias basado en Mamba, su novedad radica en cómo estos componentes se adaptan e integran para la segmentación de imágenes médicas. En lugar de simplemente incorporar un bloque Mamba estándar en una red troncal en forma de U, el marco propuesto rediseña el proceso de modelado espacial mediante múltiples ramas de pares de escaneo orientadas a tareas, introduce SFusion Mamba para integrar representaciones específicas de escaneo, mejora el bloque MVV con rutas residuales y de proyección, e inserta MFusion Mamba entre el codificador y el decodificador para agregar características del codificador multietapa antes de decodificar. Este diseño a nivel arquitectónico pretende abordar los límites irregulares, las pequeñas regiones objetivo y las estructuras anatómicas multiescala comúnmente observadas en imágenes médicas.
Este protocolo es más adecuado para tareas de segmentación que requieren modelado simultáneo de información contextual a largo alcance, límites irregulares de objetos y estructuras anatómicas multiescala en imágenes médicas bidimensionales. En comparación con los métodos de segmentación basados en CNN, el diseño codificador-decodificador basado en Mamba proporciona un mecanismo eficaz de modelado del contexto, manteniendo un flujo de trabajo en forma de U familiar para los investigadores de segmentación de imágenes médicas. En comparación con los métodos basados en Transformer, el marco propuesto evita el uso directo de la autoatención cuadrática y está destinado a investigadores que buscan modelado contextual global utilizando un mecanismo de modelado de secuencias relativamente eficiente. Por tanto, este protocolo es adecuado para la segmentación de lesiones cutáneas, segmentación de órganos abdominales y tareas médicas bidimensionales similares de segmentación de imágenes médicas en las que tanto la información estructural global como los detalles locales de los límites son importantes.
Este protocolo también tiene limitaciones que deben considerarse antes de su uso. Puede que no sea necesario para tareas de segmentación relativamente simples en las que una CNN ligera ya proporciona un rendimiento suficiente. Además, no está diseñado directamente para una segmentación volumétrica tridimensional completa sin una adaptación arquitectónica. Los investigadores con datos anotados muy limitados, recursos limitados de unidades de procesamiento gráfico (GPU) o un requisito de modelos clásicos altamente interpretables también deberían considerar estas restricciones antes de aplicar el protocolo. En general, este método está destinado a investigadores que buscan reproducir y evaluar un marco de segmentación en forma de U basado en Mamba, que equilibra el modelado de contexto a largo plazo, la representación local de fronteras y la fusión de características en varias etapas.
Las contribuciones clave son las siguientes:
1. Este artículo presenta un novedoso marco de segmentación de imágenes médicas basado en Mamba, denominado MVM-UNet. A diferencia de los enfoques que incorporan directamente bloques Mamba basados en SS2D o estándar, MVM-UNet introduce MV4D para modelar características de imagen médica a partir de cuatro vistas complementarias de pares de escaneo, incluyendo escaneo en zigzag, jerárquico, espiral y radial.
2. Este artículo diseña SFusion Mamba y el bloque MVV para integrar representaciones específicas de escaneo y mejorar la transformación de características. SFusion Mamba fusiona las características extraídas de diferentes ramas de par de escaneo, mientras que las ramas residual y de proyección arriba-abajo dentro del bloque MVV proporcionan vías de características complementarias que estabilizan y enriquecen las representaciones de características.
3. Este artículo introduce MFusion Mamba como un módulo de fusión multietapa intermedio entre el codificador y el decodificador. A diferencia de las conexiones de salto convencionales que transfieren principalmente características correspondientes de la etapa, MFusion Mamba agrega explícitamente características del codificador multietapa mediante fusión de grueso a fino y proporciona información enriquecida para la decodificación.
4. Numerosos resultados experimentales demuestran que el MVM-UNet propuesto logra un rendimiento de segmentación competitiva en los conjuntos de datos ISIC 2017 e ISIC 2018 y un rendimiento sólido en el conjunto de datos de segmentación multiórgano Synapse. Además, estudios exhaustivos de ablación validan la contribución de cada componente dentro del MVM-UNet.