Artículo de método

Marco de Red en forma de U de Visión Mamba Multi-View para la Segmentación de Imágenes Médicas

DOI:

10.3791/72616

7 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe cómo construir, entrenar y evaluar un marco multivista de la Red en forma de U de Vision Mamba para segmentación de imágenes médicas, permitiendo la segmentación reproducible de lesiones cutáneas y órganos abdominales mediante la preparación estandarizada de conjuntos de datos, la implementación de modelos y la evaluación del rendimiento.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentación de imágenes médicas requiere métodos computacionales que capturen con precisión el contexto global, los límites locales y las estructuras anatómicas multiescala, manteniéndose reproducibles en diferentes aplicaciones. Este artículo presenta un protocolo para construir, entrenar y evaluar un marco de red en forma de U Multi-View Vision Mamba para la segmentación bidimensional de imágenes médicas. El protocolo proporciona un flujo de trabajo reproducible que incluye la adquisición de conjuntos de datos públicos, el preprocesamiento de imágenes y máscaras, la construcción de redes, el entrenamiento de modelos, la selección de puntos de control y la evaluación cuantitativa y cualitativa del rendimiento. El marco incorpora el escaneo de características multivista para capturar información complementaria espacial, de contorno, escala y límites, y aplica fusión de características multietapa dentro de una arquitectura codificador-decodificador en forma de U para mejorar la integración de características durante la segmentación. El protocolo se demuestra utilizando conjuntos de datos de segmentación de lesiones cutáneas y órganos abdominales disponibles públicamente. Bajo el flujo de trabajo de implementación descrito, el marco logra un rendimiento competitivo en segmentación utilizando métricas estándar de evaluación. Siguiendo los procedimientos presentados en este protocolo, los investigadores pueden reproducir la implementación del modelo, entrenar la red usando configuraciones experimentales definidas, evaluar el rendimiento de la segmentación y adaptar el flujo de trabajo para tareas relacionadas de segmentación de imágenes médicas que requieren análisis reproducible basado en aprendizaje profundo.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentación de imágenes médicas es una tarea fundamental en los campos de la visión por ordenador y el análisis de imágenesmédicas 1,2,3. Consiste en particionar una imagen en múltiples regiones u objetos para su análisis y procesamiento posteriores. Esta tecnología es especialmente importante en la imagen médica porque ayuda a los clínicos a identificar y localizar regiones patológicas, mejorando así la precisión diagnóstica y la planificación del tratamiento. Con el avance de las tecnologías de imagen médica, como la resonancia magnética (IRM), la tomografía computarizada (TC) y la tomografía por emisión de positrones (PET), la demanda de técnicas precisas de segmentación de imágenes médicas ha seguido aumentando. Los métodos actuales para la segmentación de imágenes médicas pueden categorizarse en tres enfoques principales: métodos basados en redes neuronales convolucionales (CNN) 4, métodosbasados en transformadores 5 y métodos basados en modelos de espacio de estados (SSM) 6,7. Los métodos basados en CNN suelen emplear arquitecturas de red en forma de U para la segmentación de imágenes médicas. La arquitectura más utilizada en esta categoría esU-Net 8, que demostró la eficacia de una arquitectura codificador-decodificador en forma de U para la segmentación de imágenes biomédicas. U-Net3+ combina conexiones de salto denso de UNet++9 con conexiones de salto a escala real para mejorar la agregación de características multiescala. Sin embargo, los métodos basados en CNN tienen una capacidad limitada para capturar dependencias a largo plazo y, por tanto, pueden no modelar eficazmente la información contextual a largo plazo.

Los métodos basados en transformadores capturan eficazmente dependencias a largo alcance mediante el mecanismo de autoatención, que permite el cálculo paralelo y asigna diferentes pesos de atención a distintas regiones de interés. UNETR++10 introduce el módulo de Atención Eficiente en Pareja (EPA) para reducir el número de parámetros y el coste computacional. nnFormer11 combina operaciones convolucionales entrelazadas y de autoatención, e introduce un mecanismo de autoatención local–global basado en volumen para aprender representaciones volumétricas en segmentación de imágenes médicas tridimensionales (3D). H2Former12 propone un transformador de visión híbrido jerárquico eficiente que combina mecanismos de atención con la extracción de características basada en CNN en el codificador. Sin embargo, los métodos basados en transformadores presentan complejidad computacional cuadrática con el aumento de la longitud de la secuencia, lo que resulta en un coste computacional sustancialmente mayor. La Figura 1 ilustra la motivación para MVM-UNet y compara la estrategia propuesta de escaneo multivista con los marcos de segmentación basados en SSM existentes.

figure-introduction-1
Figura 1. Comparación de MVM-UNet con las arquitecturas de segmentación basadas en modelos puros de espacio de estados (SSM) existentes. Comparación entre un marco convencional de segmentación basado en un modelo de espacio de estados puro (SSM) y la arquitectura propuesta Multi-View Mamba U-Net (MVM-UNet). El panel superior ilustra MVM-UNet, en el que el módulo Multi-View 4-Directional (MV4D) extrae características complementarias usando pares de escaneo en zigzag, jerárquico, espiral y radial que se integran mediante Spatial Fusion Mamba (SFusion Mamba), mientras que Multistage Fusion Mamba (MFusion Mamba) agrega características del codificador multiescala antes de decodificarlas. El panel inferior muestra una arquitectura representativa basada en SSM pura utilizando módulos de escaneo selectivo bidimensional (SS2D) con barrido cruzado. La figura destaca las diferencias arquitectónicas entre las redes de segmentación convencionales basadas en SSM y el MVM-UNet propuesto. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Los métodos basados en SSM combinan la capacidad global de modelado de los Transformers con la complejidad computacional lineal. La arquitectura Mamba procesa selectivamente la información de entrada usando un modelo selectivo de espacio de estados (Selective-SSM), lo que permite al modelo ajustar dinámicamente sus parámetros según la entrada mientras filtra información irrelevante y enfatiza características informativas. Vim13 y VMamba14 adaptan la arquitectura Mamba para tareas de visión por ordenador. U-Mamba15 emplea una arquitectura híbrida CNN–SSM para explorar la aplicación de los SSM en la segmentación de imágenes médicas, mientras que Mamba-UNet16 adopta una arquitectura codificador-decodificador completamente basada en SSM para la segmentación de imágenes médicas. Estos métodos logran un rendimiento competitivo utilizando parámetros sustancialmente menores. Sin embargo, los métodos actuales basados en SSM/Mamba extraen principalmente características de imagen utilizando parches simples y estrategias de escaneo SS2D, lo que presenta varias limitaciones para la segmentación de imágenes médicas. En primer lugar, las técnicas SS2D y basadas en parches están diseñadas principalmente para tareas generales de visión por ordenador. Local Mamba17 y MotionMamba 18 han sugerido que la estrategia de escaneo SS2D es insuficiente para todas las tareas visuales porque diferentes estrategias capturan distintos tipos de información visual. En segundo lugar, la estrategia de escaneo SS2D es relativamente sencilla, basándose únicamente en direcciones de escaneo horizontales y verticales. En consecuencia, puede que no capture adecuadamente relaciones espaciales complejas ni detalles estructurales finos. La segmentación de imágenes médicas requiere modelado simultáneo tanto del contexto espacial global como de características anatómicas locales precisas. Además, los métodos actuales basados en SSM/Mamba proporcionan una fusión limitada de características entre el codificador y el decodificador. Arquitecturas como UNet++ y FATNet mejoran la precisión de la segmentación mediante una fusión de características mejorada, destacando la importancia de una integración eficaz de características para la segmentación de imágenes médicas.

Para abordar estas limitaciones, este artículo propone un novedoso marco de segmentación de imágenes médicas basado en Mamba, denominado MVM-UNet. Como se muestra en la Figura 1, el módulo propuesto Multi-View Four-Directional (MV4D) sirve como el componente central de extracción de características de MVM-UNet y está diseñado específicamente para la segmentación de imágenes médicas integrando información de cuatro estrategias de escaneo distintas. Cada estrategia de escaneo extrae características complementarias de la imagen y representa una vista diferente de la imagen de entrada. El escaneo en zigzag19 alterna la dirección de recorrido al final de cada fila o columna, equilibrando así la información espacial local y global. En cambio, los esquemas de escaneo espiral y radial20 proporcionan una cobertura integral extendiéndose hacia fuera desde el centro o hacia el interior desde la periferia. El escaneo jerárquico18 captura tanto características locales como globales a múltiples escalas. Para mejorar la robustez de cada estrategia de escaneo, se fusionan pares de escaneo antes de introducirse en el Bloque S6. El módulo Scan-view Fusion Mamba (SFusion Mamba) integra posteriormente las características extraídas de las cuatro modalidades de escaneo. Para utilizar eficazmente las características del codificador multiescala, este artículo propone además un módulo de fusión Mamba multiescala (MFusion Mamba), que acumula y fusiona las salidas de cada etapa del codificador antes de pasar las características fusionadas al decodificador. MVM-UNet fue evaluado en los conjuntos de datos ISIC 2017, ISIC 2018 y Synapse. Los resultados experimentales demuestran que MVM-UNet logra un rendimiento competitivo en segmentación en los conjuntos de datos ISIC 2017, ISIC 2018 y Synapse.

Las arquitecturas de segmentación representativa han avanzado aún más la segmentación de imágenes médicas. U-Net también se ha aplicado con éxito a tareas de análisis de imágenes biomédicas como el recuento celular, la detección y la morfometría21. Las arquitecturas CNN mejoradas por la atención, comoCA-Net 22, mejoran la representación de características mediante mecanismos de atención integrales. Los marcos representativos de segmentación basados en Transformers, incluyendo TransUNet23, Pyramid MedicalTransformer 24, SwinU-Net 25,TransAttUNet 26 yTransCUNet 27, demuestran aún más la eficacia del modelado global de características basado en atención para la segmentación de imágenes médicas.

El diseño de MVM-UNet está motivado por dos limitaciones de los métodos de segmentación basados en SSM/Mamba. En primer lugar, muchos modelos actuales de Vision Mamba dependen de estrategias de escaneo bidimensionales simples, que pueden ser insuficientes para imágenes médicas que contengan límites irregulares de lesiones, regiones objetivo pequeñas y estructuras anatómicas a escala multipla. En segundo lugar, las arquitecturas convencionales codificador-decodificador en forma de U transfieren principalmente características a través de conexiones de salto correspondientes, limitando el uso directo de información del codificador multietapa durante la decodificación. Por ello, MVM-UNet introduce MV4D para mejorar el modelado espacial multivista y MFusion Mamba para agregar explícitamente características del codificador multietapa. Este diseño está destinado a adaptar el modelado de largo alcance basado en Mamba a los requisitos específicos de la segmentación de imágenes médicas.

Aunque MVM-UNet se basa en el paradigma general codificador-decodificador y en el modelado de secuencias basado en Mamba, su novedad radica en cómo estos componentes se adaptan e integran para la segmentación de imágenes médicas. En lugar de simplemente incorporar un bloque Mamba estándar en una red troncal en forma de U, el marco propuesto rediseña el proceso de modelado espacial mediante múltiples ramas de pares de escaneo orientadas a tareas, introduce SFusion Mamba para integrar representaciones específicas de escaneo, mejora el bloque MVV con rutas residuales y de proyección, e inserta MFusion Mamba entre el codificador y el decodificador para agregar características del codificador multietapa antes de decodificar. Este diseño a nivel arquitectónico pretende abordar los límites irregulares, las pequeñas regiones objetivo y las estructuras anatómicas multiescala comúnmente observadas en imágenes médicas.

Este protocolo es más adecuado para tareas de segmentación que requieren modelado simultáneo de información contextual a largo alcance, límites irregulares de objetos y estructuras anatómicas multiescala en imágenes médicas bidimensionales. En comparación con los métodos de segmentación basados en CNN, el diseño codificador-decodificador basado en Mamba proporciona un mecanismo eficaz de modelado del contexto, manteniendo un flujo de trabajo en forma de U familiar para los investigadores de segmentación de imágenes médicas. En comparación con los métodos basados en Transformer, el marco propuesto evita el uso directo de la autoatención cuadrática y está destinado a investigadores que buscan modelado contextual global utilizando un mecanismo de modelado de secuencias relativamente eficiente. Por tanto, este protocolo es adecuado para la segmentación de lesiones cutáneas, segmentación de órganos abdominales y tareas médicas bidimensionales similares de segmentación de imágenes médicas en las que tanto la información estructural global como los detalles locales de los límites son importantes.

Este protocolo también tiene limitaciones que deben considerarse antes de su uso. Puede que no sea necesario para tareas de segmentación relativamente simples en las que una CNN ligera ya proporciona un rendimiento suficiente. Además, no está diseñado directamente para una segmentación volumétrica tridimensional completa sin una adaptación arquitectónica. Los investigadores con datos anotados muy limitados, recursos limitados de unidades de procesamiento gráfico (GPU) o un requisito de modelos clásicos altamente interpretables también deberían considerar estas restricciones antes de aplicar el protocolo. En general, este método está destinado a investigadores que buscan reproducir y evaluar un marco de segmentación en forma de U basado en Mamba, que equilibra el modelado de contexto a largo plazo, la representación local de fronteras y la fusión de características en varias etapas.

Las contribuciones clave son las siguientes:

1. Este artículo presenta un novedoso marco de segmentación de imágenes médicas basado en Mamba, denominado MVM-UNet. A diferencia de los enfoques que incorporan directamente bloques Mamba basados en SS2D o estándar, MVM-UNet introduce MV4D para modelar características de imagen médica a partir de cuatro vistas complementarias de pares de escaneo, incluyendo escaneo en zigzag, jerárquico, espiral y radial.

2. Este artículo diseña SFusion Mamba y el bloque MVV para integrar representaciones específicas de escaneo y mejorar la transformación de características. SFusion Mamba fusiona las características extraídas de diferentes ramas de par de escaneo, mientras que las ramas residual y de proyección arriba-abajo dentro del bloque MVV proporcionan vías de características complementarias que estabilizan y enriquecen las representaciones de características.

3. Este artículo introduce MFusion Mamba como un módulo de fusión multietapa intermedio entre el codificador y el decodificador. A diferencia de las conexiones de salto convencionales que transfieren principalmente características correspondientes de la etapa, MFusion Mamba agrega explícitamente características del codificador multietapa mediante fusión de grueso a fino y proporciona información enriquecida para la decodificación.

4. Numerosos resultados experimentales demuestran que el MVM-UNet propuesto logra un rendimiento de segmentación competitiva en los conjuntos de datos ISIC 2017 e ISIC 2018 y un rendimiento sólido en el conjunto de datos de segmentación multiórgano Synapse. Además, estudios exhaustivos de ablación validan la contribución de cada componente dentro del MVM-UNet.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó únicamente conjuntos de datos de imágenes médicas disponibles públicamente y desidentificados, incluyendo ISIC 2017, ISIC 2018 y Synapse. No se recogieron nuevos participantes humanos, sujetos animales ni registros médicos privados identificables en este estudio. El conjunto de datos ISIC 2017 utilizado en este estudio fue el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017 Challenge, obtenido del repositorio oficial de datos de la International Skin Imaging Collaboration (https://challenge.isic-archive.com/data/#2017). La versión del conjunto de datos utilizada en este estudio corresponde a la tarea de segmentación de lesiones ISIC 2017, incluyendo las particiones oficiales de entrenamiento, validación y prueba. El conjunto de datos fue descargado el 15 de marzo de 2024. El conjunto de datos ISIC 2018 utilizado en este estudio fue el conjunto de datos de segmentación de límites de lesiones ISIC Challenge Task 1, obtenido del repositorio oficial de datos de desafíos de la International Imaging Imaging Collaboration (https://challenge.isic-archive.com/data/#2018). La versión del conjunto de datos utilizada en este estudio corresponde a la Tarea 1 de ISIC 2018: Segmentación de Límites de Lesiones. El conjunto de datos se descargó el 8 de julio de 2024.

El conjunto de datos de Synapse utilizado en este estudio fue el conjunto de datos de tomografía abdominal Multi-Atlas Labeling Beyond the Cranial Vault, obtenido del repositorio Synapse bajo el identificador de acceso syn3193805 (https://www.synapse.org/Synapse:syn3193805). El conjunto de datos utilizado en este estudio corresponde al conjunto de datos de segmentación multiorganáctica de 30 casos para tomografía computarizada abdominal de 30 casos. El archivo descargado fue Abdomen/RawData.zip, disponible bajo la sinsina de acceso 3193805. El repositorio no proporcionó ningún número de versión, etiqueta de lanzamiento ni etiqueta fechada en el momento de la descarga. Siguiendo la división estándar adoptada en estudios previos, se utilizaron 18 casos para entrenamiento y 12 casos para pruebas. La división de datos siguió a la lista de casos utilizada por TransUNet23. Específicamente, los casos de formación fueron case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 y case0037, mientras que los casos de prueba fueron case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0003, case0001, case0004, case0025 y case0035. El conjunto de datos se descargó el 9 de julio de 2024. Dado que este estudio utilizó únicamente conjuntos de datos públicos y desidentificados y no implicó la recopilación de nuevos datos de sujetos humanos ni información privada identificable, no se requirió la aprobación del comité de revisión institucional para los experimentos computacionales descritos en este protocolo. No se obtuvo ninguna determinación formal por escrito sobre la exención institucional. Si la política institucional local lo requiere, los investigadores deberían obtener una determinación de exención institucional antes de realizar análisis secundarios de conjuntos de datos disponibles públicamente. No se disponía de número de referencia de exención ética institucional ni documentación formal de exención para este estudio.

1. Preparación de conjuntos de datos

  1. Descargue el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017 desde el repositorio oficial de la Colaboración Internacional de Imagen Cutana. Utiliza las particiones oficiales de formación, validación y prueba. Verifica que el conjunto de datos contiene 2.000 imágenes de entrenamiento, 150 imágenes de validación y 600 imágenes de prueba.
  2. Descargue el conjunto de datos de segmentación de lesiones cutáneas ISIC 2018 desde el repositorio oficial de la Colaboración Internacional de Imagen Cutana. Utiliza las particiones oficiales de formación, validación y prueba. Verifica que el conjunto de datos de segmentación contiene 2.594 imágenes de entrenamiento, 100 imágenes de validación y 1.000 imágenes de prueba.
  3. Descarga el conjunto de datos de segmentación multiórgano Synapse. Utiliza la división estándar que consta de 18 cajas (2.212 cortes axiales) para entrenamiento y 12 cajas (1.567 cortes axiales) para pruebas. No introduzcas un conjunto de validación separado.
    1. Reserva los 12 casos de prueba exclusivamente para la evaluación final. No utilices los casos de prueba para entrenamiento de modelos, ajuste de hiperparámetros o selección de modelos. La tarea de segmentación incluye ocho órganos abdominales: aorta, vesícula biliar, bazo, riñón izquierdo, riñón derecho, hígado, páncreas y estómago.
    2. Utiliza la siguiente división del conjunto de datos de Synapse. Los 18 casos de formación fueron case0031, case0007, case0009, case0005, case0026, case0039, case0024, case0034, case0033, case0030, case0023, case0040, case0010, case0021, case0006, case0027, case0028 y case0037. Los 12 casos de prueba fueron case0008, case0022, case0038, case0036, case0032, case0002, case0029, case0003, case0001, case0004, case0025 y case0035.
  4. Organiza cada conjunto de datos en carpetas separadas de imágenes y máscaras. Asegúrate de que cada imagen tenga una máscara de segmentación correspondiente con el mismo identificador de mayúsculas.
    1. Convierte cada máscara de lesión cutánea en un mapa binario de segmentación de primer plano y fondo. Conservar las etiquetas originales de órganos multiclase para el conjunto de datos Synapse.
    2. Para los conjuntos de datos ISIC 2017 e ISIC 2018, asignar un valor de etiqueta de 0 a los píxeles de fondo y 1 a los píxeles de lesión (primer plano) tras la conversión binaria de máscaras. Los píxeles con valores de máscara originales superiores a 0 se tratan como primer plano y se convierten a 1, mientras que los píxeles con valores originales de máscara igual a 0 se consideran fondo y se mantienen como 0. Para el conjunto de datos Synapse, conservar los valores originales de etiquetas enteras, siendo 0 la clase de fondo y 1–8 las ocho clases de órgano en primer plano.
  5. Redimensionar las imágenes y máscaras ISIC 2017 e ISIC 2018 a 256 × 256 píxeles sin preservar la relación de aspecto original. No apliques recorte ni relleno.
    1. Redimensiona cada segmento de Synapse CT y el correspondiente mapa de etiquetas a 224 × 224 píxeles. Utiliza interpolación bilineal para imágenes RGB, interpolación spline de tercer orden para cortes CT y interpolación de vecinos más cercanos para máscaras de segmentación.
    2. Redimensiona imágenes en Python.
      1. Para los conjuntos de datos ISIC 2017 e ISIC 2018, utiliza la transformada personalizada myResize implementada en utils.py, que llama a torchvision.transforms.functional.resize para redimensionar tanto los tensores de imagen como de máscara a 256 × 256 píxeles. No especifique un modo de interpolación explícito ni un argumento de antialiasing en esta transformación.
      2. Para el conjunto de datos Synapse, usa scipy.ndimage.zoom en datasets/dataset.py. Redimensionar los cortes de imagen CT a 224 × 224 píxeles usando interpolación spline de tercer orden (orden = 3), y redimensionar mapas de etiquetas usando interpolación de vecinos más cercanos (orden = 0). No aplique una operación de antialiasing separada ni una configuración anti_aliasing=Verdadero durante el redimensionado.
  6. Normaliza cada imagen RGB ISIC antes de la conversión tensorial usando la media y desviación estándar (SD) específicas del conjunto de datos usando la Ecuación 1 de la siguiente manera:
    figure-protocol-1(1)
    Luego reescala la imagen normalizada al rango de 0–255 usando la normalización min–max.
    1. Utilice μ = 159,922 y σ = 28,871 para el conjunto de entrenamiento ISIC 2017 y μ = 148,429 y σ = 25,748 para los conjuntos de validación y prueba ISIC 2017. Utilice μ = 157,561 y σ = 26,706 para el conjunto de entrenamiento ISIC 2018 y μ = 149,034 y σ = 32,022 para los conjuntos de validación y prueba ISIC 2018.
    2. Convierta cada imagen normalizada en un tensor de forma 3 × 256 × 256. Convierte cada máscara binaria en un tensor de forma 1 × 256 × 256.
    3. Realizar la normalización min–max de forma independiente para cada imagen tras la normalización de media y desviación estándar específicas del conjunto de datos. Específicamente, resta la media específica del conjunto de datos de cada imagen y divide por la desviación estándar correspondiente.
    4. Calcula los valores de intensidad mínima y máxima de la imagen normalizada y reescala la imagen al rango 0–255 usando estos valores mínimos y máximos por imagen. No utilices valores mínimos y máximos a nivel de conjunto de datos para este paso de reescalado mínimo-máximo.
  7. Prepara cada corte de Synapse CT como una imagen bidimensional en escala de grises. Convierte cada corte CT a float32 y añade una dimensión de canal singleton para obtener un tensor de entrada con forma 1 × 224 × 224.
    1. Conserva cada mapa de etiquetas Synapse como una máscara entera de canal único con las formas 224 × 224. No aplique una normalización adicional de media-SD a nivel de conjunto de datos en el cargador de datos.
    2. Utiliza los archivos Synapse preprocesados proporcionados en formato .npz para los slices de entrenamiento y en formato .npy.h5 para probar volúmenes. Carga los arrays de imagen y etiquetas directamente desde cada archivo .npz durante el entrenamiento y directamente desde cada archivo .npy.h5 durante las pruebas. No aplique recorte de intensidad adicional, ventanas CT, normalización a nivel de conjunto de datos ni remuestreo de volumen bruto en el cargador de datos liberado.
    3. Durante el entrenamiento del modelo, convierte cada segmento bidimensional cargado a float32, redimensionarlo al tamaño espacial objetivo usando scipy.ndimage.zoom con orden = 3 para cortes de imagen y orden = 0 para mapas de etiquetas, y luego convierte los arrays redimensionados a tensores con dimensión de canal único.
  8. Aplica la aumentación de datos solo al conjunto de entrenamiento. Para ISIC 2017 e ISIC 2018, aplica volteamiento horizontal aleatorio (p = 0,5), volteo vertical aleatorio (p = 0,5) y rotación aleatoria (p = 0,5) con un ángulo muestreado de 0° a 360°.
    1. Aplica la misma transformación geométrica a cada par imagen-máscara. Durante la validación y prueba, aplica solo redimensionamiento, normalización y conversión de tensores.
    2. Para el conjunto de datos Synapse, aplica rotación aleatoria y cambios aleatorios durante el entrenamiento. Gira aleatoriamente cada par imagen-etiqueta en k × 90°, donde k ∈ {0,1,2,3}, invierte aleatoriamente el par imagen-etiqueta a lo largo de un eje espacial, o rota aleatoriamente el par imagen-etiqueta en un ángulo muestreado de −20° a 20°.
    3. No apliques aumentos estocásticos durante las pruebas.
    4. Aplicar la ampliación de datos al conjunto de datos Synapse utilizando las ramas mutuamente excluyentes implementadas en la transformación RandomGenerator.
      1. Para cada muestra de entrenamiento, primero evalúa la condición random.random() > 0,5. Si se cumple esta condición, se aplica random_rot_flip, que consiste en una rotación aleatoria de 90° (k = 0, 1, 2 o 3) seguida de un giro aleatorio a lo largo de un eje espacial.
      2. Si no se selecciona la primera rama, evalúa una segunda condición, random.random() > 0,5. Si se cumple esta condición, se aplica random_rotate usando un ángulo de rotación seleccionado aleatoriamente entre −20° y 20°. Si ninguna de las dos condiciones se cumple, no se aplique aumento estocástico a la muestra.
      3. Aplica la misma transformación tanto a la imagen de entrada como al correspondiente mapa de etiquetas.
  9. Establece la semilla aleatoria antes de cargar el conjunto de datos, preprocesar y entrenar. Utiliza semillas aleatorias 1, 52 y 100 para los experimentos principales de comparación y usa semilla 100 para estudios de ablación, salvo que se especifique lo contrario.
    1. Inicializa los generadores aleatorios de Python, NumPy, CPU PyTorch, CUDA y cuDNN antes de construir el cargador de datos. Mantén sin cambios las particiones de conjuntos de datos, los procedimientos de preprocesamiento, los ajustes de aumento, los parámetros de normalización, la estrategia de redimensionamiento y el preprocesamiento de evaluación en todas las ejecuciones semilla.
    2. Fija num_workers = 0 tanto para los experimentos ISIC como Synapse para realizar la carga de datos en el proceso principal. Antes de construir el conjunto de datos y crear el DataLoader, inicializa la semilla aleatoria global usando la función set_seed para iniciar los generadores de números aleatorios en Python, NumPy, CPU PyTorch, CUDA y cuDNN. No definas un worker_init_fn separado ni un generador aleatorio específico de DataLoader, ya que estos no se utilizan en la implementación publicada.

2. Construcción de la arquitectura MVM-UNet

  1. Construye la propuesta Multi-view Vision Mamba UNet (MVM-UNet) utilizando una arquitectura codificador-decodificador en forma de U.
  2. Configura la dimensión de la imagen de entrada en H × W × 3. Pasa la imagen de entrada a través de la capa de incrustación de parches.
    1. Implementa la capa de incrustación de parches usando una convolución 2D con un tamaño de kernel de 4 × 4, paso de 4, tres canales de entrada y 96 canales de salida.
    2. Transforma el mapa de características de entrada a una resolución espacial de H/4 × W/4 con C = 96 canales de salida.
  3. Construye cuatro etapas codificadoras y cuatro etapas decodificadoras. Reduce la resolución espacial a la mitad y duplica la dimensión del canal tras cada etapa del codificador.
  4. Utiliza una configuración codificador-decodificador simétrica. Establece el número de bloques MVV tanto en el codificador como en el decodificador a {2, 2, 2, 2}.
    1. Coloca dos bloques MVV en cada etapa codificadora y dos bloques MVV en cada etapa del decodificador.
  5. Inserta un bloque MVV en cada etapa del codificador y decodificador. Utiliza el módulo MV4D como módulo principal de extracción de características dentro de cada bloque MVV.
  6. Inserta el módulo MFusion Mamba entre el codificador y el decodificador. Utiliza este módulo para fusionar las características del codificador multietapa antes de decodificar.
  7. Configura el flujo de trabajo general de MVM-UNet. Usa MV4D para la extracción de características a lo largo del codificador.
    1. Conserva las salidas del codificador como conexiones de salto. Pasa las salidas del codificador a las etapas correspondientes del decodificador.
    2. Pasa las funciones del codificador a MFusion Mamba antes de decodificar. Incrementar progresivamente la representación fusionada a través del decodificador y generar el mapa final de segmentación usando la cabeza de segmentación.
  8. Pasa la imagen de entrada I ∈ RH×W×3 a través de la capa de incrustación de parches para obtener figure-protocol-2 Aquí, C = 96.
    1. Generar mapas de características del codificador: E1 ∈ RB×H/4×W/4×C, E2 R B×H/8×W/8×2C, E 3 R B×H/16×W/16×4C y E4 R B×H/32×W/32×8C. Utiliza bloques MVV que contienen MV4D en cada etapa del codificador.
    2. Conserva todas las funciones del codificador para la conexión de salto correspondiente. Pasa todas las características del codificador a MFusion Mamba para la fusión de características multietapa.
    3. Alinear las características del codificador con un espacio común de características antes de la fusión gruesa y fina dentro de MFusion Mamba. Pasa la representación fusionada al decodificador.
    4. Muestreo progresivamente en la representación del decodificador. Fusiona las características del decodificador con E3 en H/16 × W/16, E2 en H/8 × W/8 y E1 en H/4 × W/4.
    5. Muestrea la función final del decodificador a la resolución original de la imagen. Genera el mapa figure-protocol-3 de predicción ∈R B×H×W×K. Aquí, K = 1 para la segmentación binaria de lesiones y K = 8 para la segmentación multiorgano de sinapsis.
    6. Consulte la Figura 2 para la arquitectura general de red y la Tabla Suplementaria 1 para la especificación completa de la arquitectura capa por capa, incluyendo las operaciones, parámetros principales y dimensiones de las características de salida para cada etapa
    7. Capas de transición codificador–decodificador
      1. Reducir las características del codificador usando capas de transición con fusión de parches. Para cada transición, muestrear cuatro grupos de características espacialmente entrelazados de un vecindario 2 × 2, concatenarlos a lo largo de la dimensión del canal, aplicar la Normalización de Capa (LayerNorm) y proyectar la característica resultante de dimensión 4C en canales 2C usando una capa lineal libre de sesgo. Esta operación reduce la resolución espacial en un factor de 2 mientras duplica la dimensión del canal.
      2. Upmuestrear características del decodificador usando capas de transición que expanden parches. Aplicar una proyección lineal libre de sesgos, reorganizar las características ampliadas espacialmente para aumentar la resolución por un factor de 2, y aplicar LayerNorm tras la expansión espacial. Repita esta operación para reconstruir progresivamente los mapas de características desde H/32 × W/32 hasta H/16 × W/16, H/8 × W/8 y H/4 × W/4.
      3. Alinea las características del codificador dentro del módulo MFusion Mamba redimensionándolas a la resolución espacial objetivo mediante interpolación bilineal (align_corners = Falso) y luego aplicando una proyección lineal de canal aprendible antes de la fusión de características.
    8. Cabezal de segmentación
      1. Upsampliza el mapa final de características del decodificador desde H/4 × W/4 hasta la resolución original de imagen (H × W) usando la capa final de expansión de parches. Aplicar proyección lineal, realizar reordenaciones espaciales con un factor de expansión de 4 y aplicar LayerNorm.
      2. Proyecta el mapa de características reconstruido a K canales de salida usando una convolución 1 × 1 después de convertir el tensor a formato canal primero.
      3. Generar la predicción final durante la evaluación aplicando una función de activación sigmoide para la segmentación binaria de lesiones o una activación softmax seguida de argmax para la segmentación multiorgánica de sinapsis. No apliques una función de activación dentro del propio cabezal de segmentación.

figure-protocol-4
Figura 2. Arquitectura general de Multi-View Mamba U-Net (MVM-UNet). Visión general de la arquitectura propuesta Multi-View Mamba U-Net (MVM-UNet). La imagen de entrada se convierte en incrustaciones de parches y se procesa a través de cuatro etapas de codificador compuestas por bloques Multi-View Vision (MVV) separados por operaciones de fusión de parches. Las características del codificador se agregan mediante Multi-stage Fusion Mamba (MFusion Mamba) y se propagan al decodificador mediante conexiones de salto. El decodificador restaura progresivamente la resolución espacial mediante operaciones de expansión de parches y genera el mapa final de segmentación a través de la capa de proyección. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

3. Construcción del módulo MV4D

  1. Utiliza el módulo MV4D como la unidad básica de extracción de características en el bloque MVV. Alimenta los parches de características de entrada en cuatro ramas de pares de escaneo. Consulte el Algoritmo 1, Archivo Suplementario 1 para el pseudocódigo completo de aplanamiento espacial, construcción de índices de pares de escaneo, recopilación de secuencias, procesamiento S6/Mamba, reordenación espacial inversa, fusión de pares de barrido, fusión SFusion Mamba, proyección y remodelado de salida.
  2. Utiliza los procedimientos exactos de generación de índices de escaneo en zigzag, jerárquicos, espirales y radiales implementados en modelos/mvmunet/core.py. Para cada estrategia de escaneo, utiliza el orden de escaneo directo y su orden inverso como un par de escaneo bidireccional.
  3. Construye el par de escaneo en zigzag. Recorre las características de la imagen en direcciones alternas al final de cada fila o columna. Utiliza este patrón de escaneo para equilibrar la información espacial local y global.
  4. Construye el par jerárquico de escaneo. Captura características a múltiples escalas espaciales. Utiliza este patrón de escaneo para reforzar la extracción tanto de representaciones locales como globales.
  5. Construye el par de escaneo en espiral. Escanea las características de la imagen desde el centro hacia el límite o desde el límite hacia el centro. Utiliza este patrón de escaneo para mejorar la extracción de información global de contornos.
  6. Construye el par de escaneo radial. Escanea las características de imagen en múltiples direcciones radiales. Utiliza este patrón de escaneo para mejorar la extracción de detalles locales de límites y bordes.
  7. Fusiona cada par de escaneo antes de introducir la secuencia fusionada en el bloque S6. Utiliza el diseño emparejado para mejorar la robustez de cada estrategia de escaneo preservando la eficiencia computacional.
  8. Alimenta la secuencia de salida de cada rama de par de escaneo en un bloque S6. Obtén cuatro representaciones de características correspondientes a las vistas en zigzag, jerárquica, espiral y radial de escaneo.
  9. Fusiona las cuatro representaciones de características extraídas usando el módulo SFusion Mamba. Utiliza dos vías de fusión paralelas. En la primera ruta, integra las cuatro características mediante una adición elemento a elemento.
  10. En la segunda vía SFusion Mamba, concatena las cuatro características. Procesa la representación concatenada usando Conv1d y Mamba. Reduce la dimensión del canal usando una capa de proyección para que coincida con la dimensión de salida del bloque S6.
  11. Configura el bloque S6/Mamba usando la dimensión de característica C como dimensión del modelo. Utiliza una capa de proyección para mapear cada característica de par de escaneo fusionada de vuelta a la dimensión del canal C antes de la fusión.
  12. En SFusion Mamba, realiza la suma elemento por elemento en la primera vía. Concatena las cuatro características de vista de escaneo en la segunda vía antes de Conv1d, Mamba y proyección lineal. Utiliza las operaciones de normalización, proyección lineal, convolución separable en profundidad y activación que rodean MV4D como se describe en el Paso 4.
  13. Sumar las salidas de las dos vías de fusión para obtener la salida final del módulo MV4D.
  14. Construir cuatro ramas complementarias de par de escaneo en lugar de usar solo direcciones de escaneo horizontales y verticales. Utiliza el escaneo en zigzag para enfatizar la travesía espacial continua, el escaneo jerárquico para reforzar la representación multiescala, el escaneo en espiral para capturar información de contorno de centro a frontera y el escaneo radial para mejorar la extracción de detalles locales orientados a fronteras.
  15. Procesa cada rama de par de escaneo de forma independiente. Fusiona las características resultantes usando SFusion Mamba. Mapea cada secuencia procesada de vuelta a su orden espacial original antes de la fusión.
  16. Dado un mapa de características de entrada X ∈ RB×H×W×C, aplanarla en Xseq ∈ RB×L×C, donde L = H × W.
  17. Reordenar la secuencia aplanada según los índices de escaneo de cada rama de par de barrido. Procesa cada secuencia reordenada usando el bloque S6. Restaura la secuencia procesada al orden espacial original.
  18. Fusiona las cuatro características de vista de escaneo a través de la vía aditiva y la vía SFusion Mamba para obtener la salida final MV4D. Consulte la Figura 3 para la arquitectura MV4D y el Algoritmo 1, Archivo Suplementario 1 para el flujo de trabajo completo de implementación a nivel de tensor.
  19. Utiliza toda la implementación de software en models/mvmunet/core.py. Este archivo contiene los generadores de índices de escaneo, PairwiseScanMamba, SequenceS6, SFusion Mamba y el módulo envolvente MV4D.
  20. Generar índices de escaneo multivista
    1. Genera los índices de escaneo siguiendo la implementación publicada en models/mvmunet/core.py. Para un mapa de características de entrada de tamaño espacial H × W, aplanar cada ubicación de píxel en un índice unidimensional usando: índice = r × W + c, donde r y c denotan las coordenadas de fila y columna, respectivamente.
    2. Genera el escaneo en zigzag recorriendo diagonales de imagen con r + c constante. Recoge los índices de píxeles válidos para cada diagonal y alterna la dirección de recorrido invirtiendo el orden de cada diagonal par.
    3. Genera el escaneo jerárquico dividiendo recursivamente la imagen en cuatro cuadrantes. Visita los cuadrantes superior izquierdo, superior derecho, inferior izquierdo e inferior derecho secuencialmente hasta que la altura o ancho de la subregión no supere 2 píxeles, y luego recorre los píxeles restantes en orden de fila mayor.
    4. Genera el escaneo en espiral recorriendo el límite exterior de la imagen de izquierda a derecha a lo largo de la fila superior, hacia abajo por la columna derecha, de derecha a izquierda por la fila inferior y hacia arriba por la columna izquierda mientras se va reduciendo progresivamente el límite hacia el centro de la imagen.
    5. Genera el escaneo radial ordenando cada píxel según su distancia cuadrada desde el centro de la imagen y luego según su ángulo polar calculado usando la función atan2.
    6. Genera el escaneo inverso para cada estrategia de escaneo invirtiendo el orden correspondiente de escaneo hacia adelante. Combina las secuencias de escaneo hacia adelante e inverso para formar un par de escaneo para cada estrategia de escaneo antes de pasar los pares de escaneo al módulo MV4D.

figure-protocol-5
Figura 3. Arquitectura del módulo Multi-View 4-Directional (MV4D). Estructura del módulo de extracción de características Multi-View 4-Directional (MV4D). Los parches de entrada se procesan a través de cuatro ramas complementarias de pares de escaneo, incluyendo escaneo en zigzag, jerárquico, espiral y radial. Las características extraídas de las cuatro ramas se fusionan, se procesan usando bloques de espacio de estados e integran Spatial Fusion Mamba (SFusion Mamba) para generar la representación de características de salida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

4. Construcción del bloque MVV

  1. Construye el bloque MVV usando una rama principal y dos ramas auxiliares. Utiliza la estructura general mostrada en la Figura 4.
  2. Aplica la normalización de capas a la característica de entrada en la rama principal. Alimenta la característica normalizada en una capa lineal. Pasa la característica transformada a la convolución separable en profundidad.
  3. Procesa la característica transformada usando la convolución separable en profundidad. Aplica la función de activación GELU. Introduce la función activada en el módulo MV4D.
  4. Construye la primera rama auxiliar como una conexión residual de identidad. Conecta la función de entrada directamente a la salida final. Utiliza esta rama para preservar la representación original y estabilizar la formación.
  5. Construye la segunda rama auxiliar como una rama de proyección descendente-ascendente. Comprime la característica de entrada usando una capa de proyección hacia abajo. Restaura la dimensión de la característica usando una capa de proyección hacia arriba.
  6. Fusiona las salidas de la rama principal y de ambas ramas auxiliares. Obtén la salida final del bloque MVV. Consulte la Figura 4 para la arquitectura completa.
  7. Establezca la dimensión oculta de la rama principal igual a la dimensión del canal de entrada Cs. Aplica LayerNorm(Cs) antes de la proyección lineal principal y utiliza una capa lineal con dimensiones CsCs. Utiliza una convolución separable en profundidad que consiste en una convolución 3×3 por profundidad con relleno 1, grupos = Cs y sin sesgo, seguida de una convolución punto a punto 1×1 sin sesgo.
  8. Aplica la función de activación GELU después de la convolución separable en profundidad. Introduce la característica activada en MV4D y aplica una proyección lineal de salida con dimensiones CsC s. Configura la rama de proyección descendente-ascendente usando LayerNorm(Cs), una proporción de proyección de 4, una proyección descendente Cs→Cs/4, activación GELU y una proyección ascendente Cs/4→Cs.
  9. Combina la rama identidad, la rama de proyección descendente-ascendente y la rama principal procesada por rutas de caída usando la suma elemento por elemento para obtener la salida final del bloque MVV.

figure-protocol-6
Figura 4. Arquitectura del bloque Multi-View Vision (MVV). Estructura del bloque Multi-View Vision (MVV). El bloque consiste en una rama principal de extracción de características que contiene el módulo Multi-View 4-Directional (MV4D) junto con capas de convolución en profundidad, normalización y proyección lineal. Una rama auxiliar de proyección arriba-abajo proporciona modulación de características con puertas mediante multiplicación elemento por elemento antes de la suma residual para generar la representación de características de salida. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

5. Construcción de MFusion Mamba

  1. Recoge los mapas de características de todas las etapas del codificador. Alinea las características del codificador a un espacio de representación unificado redimensionándolas o proyectándolas cuando sea necesario. Consulte el Algoritmo 2, Archivo Suplementario 1 para el flujo de trabajo completo de implementación a nivel de tensor.
  2. Redimensionar las características del codificador a la resolución espacial objetivo cuando sea necesario. Características del proyecto con diferentes dimensiones de canal dentro de la misma dimensión de canal. Alinea todas las características del codificador antes de la fusión multietapa.
  3. Introduce las características del codificador alineado en el componente de fusión gruesa. Realizar fusión gruesa usando el producto de Hadamard. Genera la representación fundida gruesa.
  4. Introduce la representación fusionada gruesa en el componente de fusión fina. Construye dos vías paralelas de fusión fina. Procesa ambas vías de forma independiente.
  5. Procesa la primera vía de fusión fina usando una capa lineal. Procesa la segunda vía de fusión fina usando proyección hacia arriba, Conv1d, Mamba y proyección hacia abajo. Restaura la dimensión de la característica tras la proyección hacia abajo.
  6. Fusiona las salidas de las dos vías de fusión fina usando el producto de Hadamard. Aplica la capa lineal final. Obtén la salida MFusion Mamba.
  7. Introduce la salida MFusion Mamba en el decodificador. Decodifica la representación multietapa fusionada junto con las características de salto codificador-decodificador. Genera el mapa final de segmentación.
  8. Alinear las características del codificador de diferentes etapas en un espacio unificado de características antes de la fusión gruesa. Procesa las representaciones de características alineadas usando las etapas de fusión gruesa y fina. Consulte la Figura 5 para la arquitectura MFusion Mamba y el Algoritmo Suplementario 2 para el flujo de trabajo completo de implementación a nivel de tensor.
  9. Utiliza los parámetros de implementación de MFusion Mamba de la siguiente manera. Para cada característica del codificador Ei, proyecta la dimensión del canal de Ci a Ct. Redimensionar las características proyectadas al tamaño espacial objetivo usando interpolación bilineal con align_corners=False cuando sea necesario.
  10. Aplicar el producto de Hadamard para realizar fusión gruesa a través de las características del codificador alineado. Configura la primera vía de fusión fina usando una capa lineal con dimensiones Ct Ct. Configura la segunda vía de fusión fina usando una proyección ascendente Ct → 2Ct, Conv1d, un bloque Mamba/S6 con dimensión de modelo 2Ct, una dirección de barrido, dimensión de estado 16 y una proyección descendente 2Ct Ct.
  11. Fusiona las salidas de las vías de fusión fina usando el producto de Hadamard. Aplica una proyección lineal final con dimensiones Ct a Ct. Introduce la representación multietapa fusionada en el decodificador.
  12. Características del codificador multietapa de fusibles usando MFusion Mamba
    1. Recoge las características del codificador de las cuatro etapas del codificador (E1, E2, E3 y E4) y úsalas como entrada al módulo MFusion Mamba. No seleccione solo la característica del codificador de etapa correspondiente para la fusión del decodificador.
    2. Alinear todas las características del codificador con la resolución espacial requerida para la etapa actual del decodificador. Redimensiona las características del codificador a la resolución objetivo y projéctalas a la dimensión del canal requerida antes de la fusión de características.
    3. Repite el procedimiento de alineación de características para cada etapa del decodificador. Cuando el decodificador opera en H/16 × W/16, H/8 × W/8 y H/4 × W/4, redimensiona y proyecta E1, E2,E 3 y E4 al espacio de características objetivo correspondiente.
    4. Fusiona las características alineadas del codificador multietapa usando las operaciones de fusión gruesa y fusión fina del módulo MFusion Mamba, y combina la representación fusionada con las características del decodificador a la escala correspondiente.
    5. Realiza las operaciones de proyección de características, redimensionamiento y fusión según la implementación publicada en models/mvmunet/core.py.

figure-protocol-7
Figura 5. Arquitectura del módulo Multi-stage Fusion Mamba (MFusion Mamba). Estructura del módulo Multi-stage Fusion Mamba (MFusion Mamba). Las características del codificador multiescala se combinan primero mediante fusión gruesa y posteriormente se refinan mediante el módulo de fusión fina, que consiste en proyección lineal, convolución unidimensional (Conv1d), un bloque Mamba y capas de proyección de características antes de la generación de la representación fusionada utilizada por el decodificador. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

6. Entrenamiento con modelos

  1. Entrena MVM-UNet en Ubuntu 22.04.1 con la versión 6.8.0 del núcleo de Linux. Utiliza una estación de trabajo equipada con un procesador Intel Core i9-13900K de 13ª generación y una GPU NVIDIA A800. Utiliza la misma configuración de hardware durante toda la formación y la evaluación.
  2. Implementa y entrena el modelo usando PyTorch 2.0.1 con CUDA 11.8. Instala todas las dependencias de software necesarias antes de entrenar.
  3. Utiliza el optimizador AdamW con una tasa de aprendizaje inicial de 3 × 10−5, β1 = 0,9, β2 = 0,999, ε = 1 × 10−8 y una decaída en peso de 0,01. Configura el tamaño del lote en 32 salvo que se especifique lo contrario.
  4. Entrena cada modelo durante 300 épocas. Utiliza un calendario de tasa de aprendizaje de recocido coseno con ηmin = 1 × 10−5. Establece el tamaño de la imagen de entrada a 256 × 256 para ISIC 2017 e ISIC 2018, y a 224 × 224 para Synapse.
  5. Utiliza tres semillas aleatorias independientes (1, 52 y 100) para los experimentos principales de comparación. Repite todo el proceso de entrenamiento y evaluación para cada semilla. Informa los resultados cuantitativos finales como media ± SD a lo largo de las tres partidas.
  6. Usa una semilla aleatoria fija de 100 para todos los estudios de ablación, salvo que se especifique lo contrario. Mantén las particiones de conjuntos de datos, la estrategia de preprocesamiento, la arquitectura de red, el optimizador, la tasa de aprendizaje, el tamaño del lote y el número de épocas de entrenamiento sin cambios en todos los experimentos de ablación.
  7. Utiliza la pérdida BCE-Dice para segmentación binaria de lesiones en ISIC 2017 e ISIC 2018. Establece los pesos de pérdida de BCE y Dice a 1.0. Usa la pérdida de dados de CE para Sinapsis y establece tanto los pesos de entropía cruzada como de pérdida de dados en 1.0.
  8. Redimensionar, normalizar e ampliar las imágenes de entrenamiento ISIC 2017 e ISIC 2018 utilizando el procedimiento de preprocesamiento descrito en el Paso 1. Aplica el redimensionamiento, la rotación aleatoria y el cambio aleatorio a las imágenes de entrenamiento de Synapse como se describe en el Paso 1. Usa los mismos ajustes de preprocesamiento durante todas las sesiones de entrenamiento.
  9. Selecciona los puntos de control del modelo según el protocolo de validación específico del conjunto de datos. Guarda el punto de control con el mejor rendimiento de validación para ISIC 2017 e ISIC 2018, y realiza validaciones cada 30 épocas. Entrena Synapse durante 300 épocas sin un conjunto de validación y utiliza el punto de control final de entrenamiento para las pruebas.
  10. Utiliza el conjunto oficial de validación solo para la selección de modelos en ISIC 2017 e ISIC 2018. No utilices el conjunto de pruebas Synapse para entrenamiento, ajuste de hiperparámetros o selección de puntos de control. Reserva todos los datos de las pruebas exclusivamente para la evaluación final.
  11. Utiliza los siguientes parámetros de entrenamiento para la reproducibilidad. Establece el tamaño del lote en 32 para todos los conjuntos de datos. Utiliza AdamW con una tasa de aprendizaje inicial de 3 × 10−5, β1 = 0,9, β2 = 0,999, ε = 1 × 10−8, y una disminución de peso de 1 × 10−2.
  12. Configura el planificador de tasa de aprendizaje de recocido coseno con Tmax = 50 y ηmin = 1×10−5 para ISIC 2017 e ISIC 2018. Configura el planificador con Tmax = 100 y ηmin = 1×10−5 para Synapse. Mantén la configuración del planificador sin cambios para todos los experimentos repetidos.
  13. Entrena todos los modelos usando aritmética FP32 de máxima precisión. Desactiva el entrenamiento automático de precisión mixta. No apliques recorte de gradiente durante la optimización.
  14. Mantén sin cambios los ajustes de precisión, la estrategia de actualización de gradientes, la configuración del optimizador, el calendario de tasa de aprendizaje y el protocolo de semilla aleatoria sin cambios en todos los experimentos de comparación, estudios de ablación y ejecuciones de reproducibilidad.
  15. Selecciona el mejor modelo de punto de control
    1. Evalúa el modelo en el conjunto de validación tras cada época de entrenamiento para los conjuntos de datos ISIC 2017 e ISIC 2018.
    2. Calcula la pérdida de dados de Binary Cross-Entropy (BCE)-Dice para cada lote de validación y calcula la pérdida media de validación en todo el conjunto de validación.
    3. Guarda el modelo actual como mejor punto de control cuando la pérdida media de validación sea menor que la pérdida mínima de validación registrada previamente.
    4. Registrar la intersección media sobre la unión (mIoU), el coeficiente de similitud de dados (DSC), la precisión (Acc), la especificidad (Spe) y la sensibilidad (Sen) durante la validación solo para monitorización del rendimiento. No utilices estas métricas como criterio de selección de puntos de control.

7. Evaluación del modelo

  1. Evalúa el modelo entrenado usando el conjunto oficial de pruebas para cada conjunto de datos. Usa el conjunto de pruebas solo para la evaluación final del rendimiento.
  2. Para ISIC 2017 e ISIC 2018, calcula el mIoU, DSC, Acc, Sen y Spe. Utiliza los verdaderos positivos (TP), falsos positivos (FP), negativos verdaderos (TN) y falsos negativos (FN) para todos los cálculos.
  3. Aplicar una función de activación sigmoide a la salida del modelo para ISIC 2017 e ISIC 2018. Convierte el mapa de probabilidad en una máscara de segmentación binaria usando un umbral de 0,5. Calcula las métricas de evaluación usando las Ecuaciones 2–6:
    figure-protocol-8 (2)
    figure-protocol-9 (3)
    figure-protocol-10 (4)
    figure-protocol-11 (5)
    figure-protocol-12 (6)
  4. Para Synapse, aplica la función de activación softmax a la salida del modelo. Asigna cada píxel o vóxel a la clase con mayor probabilidad usando la operación argmax. Calcula el DSC y la distancia de Hausdorff del percentil 95 (HD95) para cada órgano de primer plano y reporta los valores medios en todos los casos de prueba.
  5. Compare MVM-UNet con métodos de segmentación representativos basados en CNN, Transformer y modelos de espacio de estados (SSM). Utiliza particiones de conjuntos de datos, procedimientos de preprocesamiento, resoluciones de entrada y métricas de evaluación idénticas para todos los métodos.
  6. Utiliza las particiones oficiales de formación, validación y pruebas para ISIC 2017 e ISIC 2018. Utiliza la división estándar de 18 casos de entrenamiento y 12 casos de prueba para Synapse. Establece la resolución de entrada en para conjuntos de datos ISIC y para Synapse.
  7. Reproduce métodos de referencia usando sus implementaciones oficiales siempre que estén disponibles. Informa los resultados como media ± SD a lo largo de repetidas ejecuciones. Conservar los valores reportados por la literatura tal como se publicaron originalmente y distinguirlos en las notas correspondientes de la tabla.
  8. Realiza estudios de ablación usando la semilla aleatoria fija de 100, salvo que se especifique lo contrario. Mantén sin cambios las particiones de conjuntos de datos, el procedimiento de preprocesamiento, la resolución de entrada, el optimizador, el calendario de tasa de aprendizaje, el tamaño del lote, el número de épocas, la función de pérdida y las métricas de evaluación sin cambios en todos los experimentos de ablación.
  9. Evalúa las contribuciones de MV4D, SFusion Mamba, la rama de proyección Up-Down en el bloque MVV, MFusion Mamba, el tamaño de la imagen de entrada, el valor de dropout y la configuración de la capa codificador-decodificador. Modificar solo el componente o parámetro objetivo en cada experimento de ablación.
  10. Realizar la prueba de rango por signos de Wilcoxon utilizando resultados por imagen emparejados para ISIC 2017 e ISIC 2018 y resultados por caso pareados para Synapse. Consideremos un valor p menor que 0,05 para indicar significación estadística.
  11. Evalúa la eficiencia computacional utilizando el mismo entorno de hardware y resolución de entrada para todos los métodos. Mide el tiempo de entrenamiento por época, el tiempo de inferencia por imagen, el uso máximo de memoria de la GPU durante el entrenamiento, el número de parámetros del modelo y las operaciones de coma flotante (FLOPs). Calcula los FLOPs usando un solo pase hacia adelante.
  12. Selecciona ejemplos cualitativos representativos solo del conjunto de pruebas tras completar la evaluación del modelo. Compara la imagen original, la máscara de la verdad en el terreno y la máscara predicha usando casos de prueba idénticos en todos los métodos. Selecciona ejemplos representativos que incluyan objetivos pequeños, límites irregulares, límites ambiguos y estructuras representativas de múltiples órganos.
  13. Calcular métricas de evaluación y realizar análisis estadísticos
    1. Calcula las métricas de segmentación para los conjuntos de datos ISIC 2017 e ISIC 2018 en Python usando NumPy y sklearn.metrics.confusion_matrix. Limita el mapa de probabilidad predicha en 0,5, obtén los TP, FP, TN y FN a nivel de píxel, y calcula el mIoU, DSC, Acc, Sen y Spe a partir de estos valores.
    2. Calcula el DSC y el HD95 para el conjunto de datos de Synapse usando medpy.metric.binary.dc y medpy.metric.binary.hd95, respectivamente. Aplica softmax seguido de argmax a la salida del modelo antes de calcular las métricas de evaluación.
    3. Calcula el número de FLOPs y parámetros entreenables usando thop.profile con un solo pase hacia adelante.
    4. Realiza la prueba de rango con signos de Wilcoxon en Python usando scipy.stats.wilcoxon. Utiliza valores de métrica por imagen emparejada para los conjuntos de datos ISIC 2017 e ISIC 2018 y valores métricos por caso emparejados para el conjunto de datos Synapse.

8. Definición de la función de pérdida

  1. Utiliza la pérdida estándar de Entropía Cruzada (CE) para segmentación multiclase y la pérdida estándar BCE para segmentación binaria. Utiliza la fórmula estándar de pérdida de dados para segmentación. Las ecuaciones 7–11 definen las funciones de pérdida utilizadas en este protocolo.
    figure-protocol-13(7)
    figure-protocol-14(8)
    figure-protocol-15(9)
    figure-protocol-16(10)
    figure-protocol-17(11)
  2. Establece los pesos de pérdida BCE y Dice a 1.0 para ISIC 2017 e ISIC 2018, de modo que figure-protocol-181 = 1.0 y figure-protocol-192 = 1.0. Establece los pesos de pérdida de CE y Dados a 1,0 para Synapse, φ1 = 1,0 y φ2 = 1,0.
  3. Implementa las funciones de pérdida en utils.py. Usa nn. BCELoss para el término BCE y nn. CrossEntropyLoss para el término CE. Calcula la pérdida binaria de dados aplanando cada máscara predicha y máscara de verdad en el terreno, calculando la pérdida de dados para cada muestra y promediando la pérdida a lo largo del lote. Calcula la pérdida de dados multiclase convirtiendo el mapa de etiquetas objetivo a formato de un solo hot, aplicando softmax a la salida del modelo, calculando la pérdida de dados para cada clase y promediando la pérdida entre todas las clases.
  4. Establece la constante de suavizado en 1 para la pérdida binaria de dados y en 1×10−5 para la pérdida multiclase de dados. Implementa la pérdida de BCE-Dice usando la clase BceDiceLoss con wb = 1 y wd = 1. Implementa la pérdida CE-Dice usando la clase CeDiceLoss con loss_weight = [1, 1]. Mantén las constantes de suavizado, la estrategia de reducción y la implementación del software sin cambios para todos los conjuntos de datos, semillas aleatorias y experimentos.
  5. Configurar la reducción de pérdidas
    1. Instanciar nn. BCELoss() y nn. PérdidaCruzEntropía() sin especificar explícitamente el argumento de reducción.
    2. Utiliza la configuración predeterminada de reducción de pérdidas de PyTorch (reducción = "media") para ambas funciones de pérdida. No use reducción = "suma" o una salida de pérdida no reducida.

9. Ajustes de reproducibilidad y ejecución

  1. Descarga la implementación publicada desde https://github.com/LIXUEGUANG002/MVM-UNet. Utiliza el repositorio junto con los paquetes de software, conjuntos de datos, especificaciones de hardware y recursos computacionales listados en la Tabla de Materiales.
  2. Clona el repositorio y accede al directorio del proyecto ejecutando git clone https://github.com/LIXUEGUANG002/MVM-UNet.git, seguido de cd MVM-Unet.
  3. Configura el experimento ISIC 2017 o ISIC 2018 estableciendo el nombre del conjunto de datos, la ruta del conjunto, el tamaño de entrada, el tamaño del lote, el número de épocas, la función de pérdida, el optimizador, el planificador de tasa de aprendizaje y la semilla aleatoria en configuraciones/config_setting.py. Ejecuta el script de entrenamiento desde la raíz del repositorio usando train.py de Python.
  4. Configura el experimento Synapse estableciendo el nombre del conjunto de datos, la ruta de datos de entrenamiento, la ruta del volumen de pruebas, el directorio de listas, el tamaño de entrada, el número de clases, el tamaño del lote, el número de épocas, la función de pérdida, el optimizador, el planificador de tasa de aprendizaje y la semilla aleatoria en configuraciones/config_setting_synapse.py. Ejecuta el script de entrenamiento desde la raíz del repositorio usando train_synapse.py en python.
  5. Realiza una evaluación solo por inferencia estableciendo only_test_and_save_figs = True, best_ckpt_path al punto de control entrenado y img_save_path al directorio de salida en el archivo de configuración correspondiente. Ejecuta train.py de Python para ISIC 2017 o ISIC 2018, o ejecuta train_synapse.py de Python para Synapse para generar resultados de predicción y cifras cualitativas.
  6. Utiliza la versión publicada del código fuente
    1. Clona el repositorio de GitHub publicado y consulta el commit ee891b42c2f083c4990eed72f1dd4463adc5e103e en la rama maestra antes de configurar los conjuntos de datos, scripts de entrenamiento y ajustes de evaluación.
    2. Utiliza este compromiso para reproducir los experimentos reportados en este estudio. No había ninguna versión de lanzamiento etiquetada disponible para el repositorio en el momento de la revisión del manuscrito.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Resultados esperados e interpretación
Cuando este protocolo se implementa correctamente, se espera que el modelo entrenado MVM-UNet produzca un rendimiento de segmentación estable a lo largo de ejecuciones repetidas, con solo pequeñas variaciones entre diferentes semillas aleatorias para la mayoría de las métricas de evaluación. Para ISIC 2017 e ISIC 2018, los resultados exitosos se reflejan en valores altos de DSC, mIoU, Acc, Sen y Spe, junto con mascarillas de lesión predichas que siguen de cerca los límites de lesión de la verdad en el terreno (Figuras 6 y 7). Para Synapse, los resultados exitosos se reflejan en valores medios altos de DSC y bajos valores de HD95 en los órganos del primer plano (Figura 8). Durante la ejecución del protocolo, las métricas cuantitativas deben interpretarse junto con los resultados de segmentación cualitativa correspondientes. Un modelo que logre una DSC alta pero que muestre fuga de límites, omisión de estructuras pequeñas o predicciones fragmentadas debe considerarse solo parcialmente exitoso, y debe verificarse el procedimiento de preprocesamiento, la selección de puntos de control y los ajustes de inferencia.

figure-results-1
Figura 6. Resultados representativos de segmentación cualitativa en el conjunto de datos ISIC 2017. Resultados cualitativos representativos de segmentación obtenidos en el conjunto de datos de segmentación de lesiones cutáneas de la International Skin Imaging Collaboration (ISIC) 2017. Cada ejemplo muestra la imagen dermoscópica original (Imagen), la correspondiente máscara de segmentación de la verdad en tierra (GT) y la predicción generada por MVM-UNet (Pred). Casos de prueba representativos ilustran el rendimiento de segmentación para lesiones de tamaño, morfología y complejidad de límite variables. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 7. Resultados representativos de segmentación cualitativa en el conjunto de datos ISIC 2018. Resultados representativos de segmentación cualitativa obtenidos en el conjunto de datos de segmentación de lesiones cutáneas de la International Skin Imaging Collaboration (ISIC) 2018. Cada ejemplo muestra la imagen dermoscópica original (Imagen), la correspondiente máscara de segmentación de la verdad en tierra (GT) y la predicción generada por MVM-UNet (Pred). Los casos de prueba representativos demuestran el rendimiento de segmentación a lo largo de diversas apariencias de lesiones y características de los límites. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 8. Resultados representativos de segmentación cualitativa en el conjunto de datos de tomografía computarizada multiórgano Synapse. Resultados representativos de segmentación cualitativa multiorgánica obtenidos en el conjunto de datos Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Cada ejemplo muestra la imagen original de tomografía computarizada (Imagen), las correspondientes anotaciones de órganos de verdad en el terreno (GT) y la predicción generada por MVM-UNet (Pred). Ejemplos representativos ilustran la concordancia entre segmentaciones predichas y de referencia a través de múltiples órganos abdominales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Rendimiento en ISIC 2017
Para evaluar la reproducibilidad de MVM-UNet, se repitieron todos los experimentos principales de comparación utilizando tres semillas aleatorias independientes (1, 52 y 100), y los resultados se reportaron como media ± DS. La significación estadística se evaluó usando la prueba de rangos por signo de Wilcoxon basada en resultados emparejados por imagen para ISIC 2017 e ISIC 2018 y resultados emparejados por caso para Synapse. El análisis estadístico se realizó utilizando valores métricos emparejados en lugar de promedios a nivel semilla. Para una comparación justa, los resultados reportados como media ± SD se reprodujeron usando las implementaciones oficiales bajo las mismas particiones de conjuntos de datos, resoluciones de entrada y métricas de evaluación siempre que fuera posible, mientras que los resultados de valor único se conservaron de las publicaciones originales correspondientes.

MVM-UNet fue evaluado en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017 y comparado con métodos representativos de segmentación, incluyendo UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 y H2Former12 (Tabla 1)). MVM-UNet logró un mIoU de 80,94 ± 1,01%, un DSC del 91,32% ± 0,68%, una precisión del 96,58% ± 0,27%, una especificidad del 98,31% ± 0,23%, y una sensibilidad del 91,65% ± 0,77% en tres etapas independientes. En comparación con los métodos evaluados, MVM-UNet alcanzó el mayor mIoU, DSC y sensibilidad. Los resultados representativos de segmentación cualitativa se muestran en la Figura 6, donde las mascarillas predichas siguen de cerca los límites de la lesión de base a través de imágenes de prueba representativas.

ModeloÁrbitro.mIoU (%)DSC (%)Cuenta (%)Spe (%)Sen (%)
UNet876.9886.9995.6597.4386.82
TransUNet2375.3281.2391.4595.7782.63
MaLUNet3178.7888.1396.1898.4784.78
VM-UNet3280.2389.0396.2997.5889.90
UNeXt-S3378.2687.8095.9597.7487.04
HResEx3479,89 ± 1,0588,82 ± 0,6596,25 ± 0,2497,73 ± 0,2287,72 ± 0,79
H-vmunet2880.34 ± 1.0290,68 ± 0,5596,42 ± 0,1898,23 ± 0,3288,97 ± 0,88
MISSFormer3080,16 ± 0,7889,27 ± 0,6194,36 ± 0,2897,52 ± 0,3887,71 ± 0,69
H2Former1280,35 ± 0,9588,56 ± 0,7296,61 ± 0,1998,15 ± 0,1488,21 ± 0,81
MedScale-Former3580,31 ± 0,8289,11 ± 0,5995,68 ± 0,3398,24 ± 0,2189,96 ± 0,92
MCAFT3680,59 ± 0,9389,27 ± 0,6396,42 ± 0,2097,95 ± 0,1790,05 ± 0,84
MVM-UNet (Nuestro)80,94 ± 1,0191,32 ± 0,6896,58 ± 0,2798,31 ± 0,2391,65 ± 0,77

Tabla 1: Comparación de rendimiento en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017. Comparación de MVM-UNet con métodos de segmentación basados en redes neuronales convolucionales representativas (CNN), Transformers y modelos de espacio de estados (SSM) utilizando la intersección media sobre la unión (mIoU), el coeficiente de similitud de dados (DSC), la precisión (Acc.), la especificidad (Spe.) y la sensibilidad (Sen.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.

Los ejemplos cualitativos demuestran además que MVM-UNet segmentó con precisión tanto lesiones pequeñas como lesiones mayores con límites irregulares. En estos ejemplos representativos, las máscaras predichas coincidían estrechamente con las anotaciones correspondientes de la verdad del terreno y preservaban los límites de las lesiones con una fuga o fragmentación mínima.

Para evaluar mejor si las mejoras observadas eran estadísticamente significativas, se realizaron pruebas de Wilcoxon con rango por signo utilizando resultados de segmentación por imagen emparejados. Para la métrica mIoU, MVM-UNet mostró una mejora estadísticamente significativa respecto a MCAFT, con un valor p de 0,0114. Para la métrica DSC, MVM-UNet también superó significativamente a H-vmunet, con un valor p de 0,0031. Estos resultados apoyan que las mejoras observadas en ISIC 2017 probablemente no se debían a la variación aleatoria.

En general, MVM-UNet logró el mayor rendimiento entre los métodos comparados para mIoU, DSC y sensibilidad en el conjunto de datos ISIC 2017 (Tabla 1). Los ejemplos de segmentación cualitativa mostrados en la Figura 6 son coherentes con estos hallazgos cuantitativos.

Rendimiento en ISIC 2018
MVM-UNet fue evaluado posteriormente en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2018 y comparado con métodos representativos de segmentación, incluyendoUNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 y MCAFT36 (Tabla 2)). MVM-UNet logró un mIoU del 82,47% ± 1,28%, un DSC del 90,65% ± 0,94%, una precisión del 96,02% ± 0,36%, una especificidad del 97,06% ± 0,31%, y una sensibilidad del 91,80% ± 0,82% en tres etapas independientes. Estos resultados demuestran que el rendimiento de MVM-UNet se mantuvo consistente entre diferentes semillas aleatorias. Los resultados representativos de segmentación cualitativa se muestran en la Figura 7.

ModeloÁrbitro.mIoU (%)DSC (%)Cuenta (%)Spe (%)Sen (%)
UNet877.8687.5594.0596.6985.86
UNet++978.3187.8394.0295.7588.65
UTNetV23778.9788.2594.3296.4887.60
SANet3879.5288.5994.3995.9789.46
MaLUNet3180.2589.0494.6296.1989.74
VM-UNet3281.3589.7194.9196.1391.12
H-vmunet2881,93 ± 1,4590,46 ± 0,6295.19 ± 0.3096,82 ± 0,2188,37 ± 1,13
MISSFormer3080.27 ± 1.2189,91 ± 0,4694,76 ± 0,2797,22 ± 0,1590.84 ± 1.07
H2Former1280,40 ± 0,8390,26 ± 0,7394,89 ± 0,3896,98 ± 0,2591,57 ± 0,54
HResEx3481.12 ± 1.1888,86 ± 0,8494,96 ± 0,3396,43 ± 0,2291,86 ± 1,01
MedScale-Former3580,97 ± 0,7490,47 ± 0,6895,02 ± 0,4195,89 ± 0,2690,65 ± 0,92
MCAFT3681,46 ± 1,0389,06 ± 0,7695,23 ± 0,2996,72 ± 0,1791,82 ± 0,57
MVM-UNet (Nuestro)82,47 ± 1,2890,65 ± 0,9496,02 ± 0,3697,06 ± 0,3191,80 ± 0,82

Tabla 2: Comparación de rendimiento en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2018. Comparación de MVM-UNet con métodos representativos de segmentación basados en CNN, transformador y SSM utilizando intersección media sobre unión (mIoU), coeficiente de similitud de dados (DSC), precisión (Acc.), especificidad (Spe.) y sensibilidad (Sen.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.

En comparación con H-vmunet, MVM-UNet mejoró el mIoU en un 0,54%. En comparación con MedScale-Former, MVM-UNet mejoró la DSC en un 0,18%. MVM-UNet también logró la mayor precisión entre los métodos comparados. Los ejemplos cualitativos representativos mostrados en la Figura 7 demuestran una segmentación precisa de lesiones cutáneas representativas, incluyendo regiones pequeñas de la lesión y lesiones con límites irregulares.

Para ISIC 2018, la significación estadística se evaluó utilizando la prueba de rango de signos de Wilcoxon basada en resultados de segmentación por imagen emparejada. Para la métrica mIoU, MVM-UNet logró una mejora estadísticamente significativa respecto a MCAFT, con un valor p de < 0,001. Estos resultados apoyan que la mejora observada en el rendimiento en ISIC 2018 probablemente no se debía a la variación aleatoria.

En general, MVM-UNet logró el mayor mIoU, DSC y precisión entre los métodos comparados en el conjunto de datos ISIC 2018 (Tabla 2). Los ejemplos cualitativos mostrados en la Figura 7 son coherentes con estas mejoras cuantitativas.

Actuación en Synapse
El método propuesto también fue evaluado en el conjunto de datos de segmentación multiorgánica Synapse y comparado con métodos representativos, incluyendoUNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 y MCAFT36 (Tabla 3)). El conjunto de datos de Synapse incluía ocho órganos abdominales: la aorta, la vesícula biliar, el bazo, el riñón izquierdo, el derecho, el hígado, el páncreas y el estómago. Siguiendo el protocolo experimental estándar, se utilizaron 18 casos (2.212 cortes axiales) para entrenamiento y 12 casos (1.567 cortes axiales) para pruebas. No se introdujo ningún conjunto de validación separado. Los casos de prueba se usaron exclusivamente para la evaluación final y no se emplearon para el entrenamiento de modelos, la afinación de hiperparámetros ni la selección de modelos. Los resultados representativos de segmentación cualitativa multiórgano se muestran en la Figura 8, y la comparación cuantitativa se resume en la Tabla 3.

ModeloÁrbitro.DSCHD95Aor.Gal.Chaval. (L)Chaval. (R)Liv.Pan.Spl.Sto.
UNet876.8539.7889.0769.7277.7768.6993.4354.0186.6675.59
Att-UNet3977.7736.0289.5468.8877.9871.1193.5758.0487.3175.74
TransUNet2377.4831.6987.2363.1381.8777.0294.0855.8485.0675.62
TransNorm4078.430.2586.2365.1882.1878.6394.2255.3289.5376.02
Swin U-Net2579.1321.5585.4766.5383.2879.6194.2956.5890.6276.59
TransDeepLab4180.1621.2586.0469.1684.0879.8893.5361.1589.0178.36
MEW-UNet4278.9221.6886.6865.3282.8780.0293.6358.3890.1674.27
MISSFormer3080,92 ± 4,2320.09 ± 1.8986,43 ± 0,9869,81 ± 4,5684.29 ± 2.1181.03 ± 3.3493,85 ± 0,8961.11 ± 4.6790.05 ± 3.7880,62 ± 1,02
H2Former1281.05 ± 2.5620.13 ± 7.2386,61 ± 3,2169.32 ± 1.2385.12 ± 4.7882.01 ± 2.8994.09 ± 2.4561,16 ± 0,7689,97 ± 4,1280,94 ± 3,56
HResEx3480,65 ± 4,0217.48 ± 6.8989.16 ± 2.7866,94 ± 0,7884,61 ± 4,3482.15 ± 2.5693.11 ± 1.3459,92 ± 4,1291.08 ± 3.4580,75 ± 2,01
MedScale-Former3580,78 ± 1,3420.02 ± 3.7888,79 ± 4,0269,82 ± 2,5685,13 ± 0,8781,63 ± 4,7894.10 ± 2.7860,72 ± 1,8990.14 ± 1.5680,93 ± 4,56
MCAFT3681.03 ± 3.4519.98 ± 5.1289,76 ± 0,7668,96 ± 3,8984,54 ± 2,5681,98 ± 3,1294.32 ± 4.0160,85 ± 3,6789.06 ± 4.8980,91 ± 1,78
MVM-UNet (Nuestro)81,26 ± 1,8918.72 ± 2.1688,53 ± 3,2269,84 ± 4,2385,37 ± 2,6982,67 ± 1,6794.41 ± 3.5661,02 ± 2,7890.19 ± 0.6781,48 ± 3,12

Tabla 3: Comparación de rendimiento en el conjunto de datos de segmentación multiórgano Synapse. Comparación de MVM-UNet con métodos representativos de segmentación basados en CNN, Transformer y SSM utilizando el Coeficiente de Similitud de Dados (DSC), la distancia de Hausdorff en percentil 95 (HD95) y puntuaciones de Dice específicas de órganos para la aorta (Aor.), vesícula biliar (Gal.), riñón izquierdo (Kid. (L)), riñón derecho (Kid. (R)), hígado (Liv.), páncreas (Pan.), bazo (Spl.) y estómago (Sto.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.

MVM-UNet logró un DSC medio del 81,26% ± 1,89% y un HD95 medio de 18,72 ± 2,16 en tres etapas independientes. Los resultados demuestran un rendimiento estable en la segmentación en el conjunto de datos Synapse. Entre los métodos evaluados, MVM-UNet logró la mayor media de la DSC y la segunda media más baja de HD95.

Para Synapse, la significación estadística se evaluó utilizando la prueba de rangos por signos de Wilcoxon basada en valores de DSC pareados por caso. MVM-UNet mostró una mejora estadísticamente significativa respecto a H2Former, con un valor p de 0,026, lo que indica que la mejora observada en el rendimiento de segmentación fue estadísticamente significativa.

Resultados representativos exitosos y subóptimos
Los resultados cualitativos positivos representativos se muestran en las Figuras 6–8. Los resultados exitosos se caracterizan por máscaras de segmentación predichas que corresponden estrechamente a las anotaciones de base y delimitan con precisión los límites primarios de la lesión u órgano. Resultados representativos subóptimos pueden darse para objetivos muy pequeños, límites de bajo contraste, formas irregulares de lesiones, órganos con contraste de intensidad débil o límites anatómicamente ambiguos, y típicamente aparecen como subsegmentación, sobresegmentación, fuga de límites o fragmentos discontinuos de la máscara. Cuando se observan estos resultados, los usuarios deben verificar que el redimensionamiento de imágenes, la normalización, la interpolación de máscaras, la selección de puntos de control del modelo, el umbral de inferencia (para conjuntos de datos ISIC) o la predicción argmax (para Synapse) y los procedimientos de cálculo métrico son consistentes con los descritos en el Protocolo.

Estudio de ablación del módulo MV4D
La contribución del módulo MV4D se evaluó añadiendo progresivamente los pares de escaneo zigzag, jerárquico, espiral y radial, seguido por el módulo SFusion Mamba (Tabla 4; Figura 9). Cuando solo se usaba el par de escaneo en zigzag, el rendimiento de segmentación se veía limitado. Añadir el par jerárquico mejoró sustancialmente el rendimiento, lo que indica el beneficio de incorporar información multiescala. La posterior adición de los pares de escaneo espiral y radial mejoró aún más el rendimiento de la segmentación al mejorar la representación de contornos y fronteras. La incorporación del módulo SFusion Mamba resultó en el mayor rendimiento entre las configuraciones evaluadas.

ModeloPar de escaneo en zigzagPar de escaneo jerárquicoPar de escaneo espiralPar de escaneo radialSFusion MambaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet56.7572.4658.0373.45
MVM-UNet72.3884.0173.4584.7
MVM-UNet75.6986.2076.9486.94
MVM-UNet76.4186.6178.2887.82
MVM-UNet80.9491.3282.4790.65

Tabla 4: Estudio de ablación del módulo Multi-View 4-Directional (MV4D). El rendimiento se obtiene incorporando progresivamente los pares jerárquicos, espirales y radiales y el módulo Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base de pares de escaneo en zigzag. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

figure-results-4
Figura 9. Estudio de ablación del módulo Multi-View 4-Directional (MV4D). (A) Cambio en la intersección media sobre la unión (mIoU) tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base. (B) Cambio en el Coeficiente de Similitud de Dados (DSC) tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base. (C) Cambio en el mIoU tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base bajo el segundo entorno experimental. (D) Cambio en el DSC tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base bajo el segundo entorno experimental. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En el conjunto de datos ISIC 2017, el módulo completo MV4D alcanzó un mIoU del 80,94% y un DSC del 91,32%. Las tendencias de rendimiento correspondientes para mIoU y DSC se muestran en la Figura 9A y la Figura 9B, respectivamente. En el conjunto de datos ISIC 2018, el módulo completo MV4D alcanzó un mIoU del 82,47% y un DSC del 90,65%. Las tendencias de rendimiento correspondientes se muestran en la Figura 9C y la Figura 9D, respectivamente.

Salvo que se especifique lo contrario, todos los experimentos de ablación se realizaron utilizando una semilla aleatoria fija de 100, mientras que los principales resultados de la comparación se reportaron como media ± DS sobre tres semillas aleatorias independientes (1, 52 y 100). En consecuencia, los resultados de la ablación pretenden comparar las contribuciones relativas de los componentes individuales bajo un entorno controlado de semilla única, en lugar de reproducir el rendimiento final multisemilla reportado en los experimentos principales de comparación.

En general, incorporar progresivamente los pares de escaneo adicionales y el módulo SFusion Mamba mejoró de forma consistente el rendimiento de segmentación, con la configuración completa de MV4D logrando el mayor rendimiento en ambos conjuntos de datos.

Estudio de ablación del bloque de visión multivista (MVV)
El bloque MVV se evaluó comparando la arquitectura base con una versión que incorpora la rama de proyección Up-Down (Tabla 5). En el conjunto de datos ISIC 2017, la inclusión de la rama de Proyección Up-Down aumentó el mIoU del 78,83% al 80,96% y el DSC del 88,15% al 91,02%. En el conjunto de datos ISIC 2018, el mIoU aumentó del 80,32% al 82,46%, mientras que el DSC pasó del 89,15% al 90,57%.

ModeloBloque base de MVVProyección arriba-abajoISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet78.8388.1580.3289.15
MVM-UNet80.9691.0282.4690.57

Tabla 5: Estudio de ablación del bloque de visión multivista (MVV). Comparación de rendimiento del bloque base de Visión Multivista (MVV) con y sin la rama de proyección Up-Down. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

Los experimentos de ablación por bloque MVV se realizaron utilizando la semilla aleatoria fija de 100. En consecuencia, el rendimiento de la configuración que contiene la rama de Proyección Up-Down refleja la configuración controlada de ablación de semilla única y puede diferir ligeramente del rendimiento medio de tres semillas reportado para el modelo completo MVM-UNet en los experimentos principales de comparación.

En general, la incorporación de la rama de Proyección Up-Down mejoró de forma constante el rendimiento de segmentación en ambos conjuntos de datos, observándose aumentos tanto para mIoU como para DSC.

Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba)
El módulo MFusion Mamba fue evaluado comparando diferentes estrategias de fusión gruesa junto con el componente de fusión fina (Tabla 6; Figura 10). Sin MFusion Mamba, MVM-UNet logró un mIoU del 75,47% y un DSC del 86,01% en el conjunto de datos ISIC 2017, y un mIoU del 77,49% y un DSC del 87,29% en el conjunto ISIC 2018. Entre las estrategias de fusión gruesa evaluadas, el producto de Hadamard logró la mayor mejora. La incorporación del componente de fusión fina aumentó aún más el rendimiento de segmentación. La configuración completa de MFusion Mamba logró un mIoU del 80,95% y un DSC del 91,18% en ISIC 2017, y un mIoU del 82,51% y un DSC del 90,58% en ISIC 2018.

ModeloFusión gruesaMáximo por elementoFusión gruesa Adición por elementoFusión gruesa Producto HadamardMódulo de fusión finaISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet75.4786.0177.4987.29
MVM-UNet76.2186.4778.3587.82
MVM-UNet76.8386.8679.1188.30
MVM-UNet78.2687.8380.0688.96
MVM-UNet80.9591.1882.5190.58

Tabla 6: Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba). Comparación de rendimiento de diferentes estrategias de fusión gruesa, incluyendo fusión máxima (Max), suma elemental (⊕) y producto de Hadamard (⊙), junto con el módulo completo de fusión fina. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

figure-results-5
Figura 10. Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba). (A) Cambio en la intersección media sobre la unión (mIoU) obtenida utilizando diferentes estrategias de fusión gruesa (máxima suma elemental y producto de Hadamard) y el módulo completo de fusión fina. (B) Cambio en el Coeficiente de Similitud de los Dados (DSC) obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento a elemento y producto de Hadamard) y el módulo completo de Fusión Fina. (C) Cambio en el mIoU obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento por elemento y producto Hadamard) y el módulo completo de fusión fina bajo el segundo entorno experimental. (D) Cambio en el DSC obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento por elemento y producto Hadamard) y en el módulo completo de fusión fina bajo el segundo entorno experimental. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En el conjunto de datos ISIC 2017, la configuración completa de MUsion Mamba alcanzó un mIoU del 80,95% y un DSC del 91,18%. Las tendencias de rendimiento correspondientes para mIoU y DSC se muestran en la Figura 10A y la Figura 10B, respectivamente. En el conjunto de datos ISIC 2018, la configuración completa de MUsion Mamba alcanzó un mIoU del 82,51% y un DSC del 90,58%. Las tendencias de rendimiento correspondientes se muestran en la Figura 10C y la Figura 10D, respectivamente. Los experimentos de ablación MFusion Mamba se realizaron utilizando la semilla aleatoria fija de 100. En consecuencia, la configuración completa de MFusion Mamba representa el resultado controlado de ablación de semilla única y puede diferir ligeramente del rendimiento medio de tres semillas reportado para el modelo completo MVM-UNet en los experimentos principales de comparación.

En general, incorporar progresivamente la estrategia de fusión gruesa de productos de Hadamard y el componente de fusión fina mejoró de forma constante el rendimiento de segmentación, con la configuración completa de MFusion Mamba logrando el mayor rendimiento en ambos conjuntos de datos.

Resumen de los estudios de ablación
A lo largo de los experimentos de ablación, incorporando progresivamente las ramas jerárquicas, espiral y radial de par de escaneo, junto con el módulo SFusion Mamba, mejoró consistentemente el rendimiento de segmentación (Tabla 4; Figura 9). De manera similar, la inclusión de la rama de Proyección Up-Down en el bloque MVV mejoró tanto mIoU como DSC en los conjuntos de datos ISIC 2017 e ISIC 2018 (Tabla 5). La configuración completa de MFusion Mamba también logró el mayor rendimiento entre las estrategias evaluadas de fusión de características multietapa (Tabla 6; Figura 10).

Estudio de ablación de hiperparámetros
Se evaluaron los efectos del tamaño de la entrada y el valor de abandono en los conjuntos de datos ISIC 2017 e ISIC 2018 (Tabla 7). Se compararon tres resoluciones de entrada (256 × 256, 384 × 384 y 512 × 512). Bajo la configuración evaluada, la resolución de entrada 256 × 256 logró el mayor rendimiento de segmentación en ambos conjuntos de datos.

ModeloTamaño de entrada 256 × 256Tamaño de entrada: 384 × 384Tamaño de entrada: 512 × 512Abandono 0.0Abandono 0.1Dropout 0.2Abandono 0.3ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet80.0288.9181.7689.92
MVM-UNet79.9688.8780.9789.47
MVM-UNet77.4887.2878.7688.11
MVM-UNet79.3688.5381.1389.62
MVM-UNet80.9490.1582.4990.50
MVM-UNet79.7188.7180.4689.18

Tabla 7: Estudio de ablación del tamaño de la imagen de entrada y el valor de dropout. Comparación de rendimiento de MVM-UNet usando diferentes tamaños de imagen de entrada y valores de dropout. El rendimiento de segmentación se informa utilizando la intersección media sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

También se evaluaron diferentes valores de abandono. Entre las configuraciones probadas, un valor de abandono de 0,2 logró el mayor rendimiento de segmentación en ambos conjuntos de datos y, por tanto, se utilizó en los experimentos principales.

Estudio de ablación de la configuración de la capa codificador-decodificador
Se evaluaron diferentes configuraciones de capa codificador-decodificador para examinar el efecto de la profundidad de red en el rendimiento de segmentación y el coste computacional (Tabla 8). Entre las configuraciones evaluadas, la arquitectura simétrica {2, 2, 2, 2}-{2, 2, 2, 2} logró el mayor rendimiento global de segmentación manteniendo una complejidad relativamente baja. Aumentar la profundidad de la red a {2, 2, 9, 2}-{2, 9, 2, 2} produjo un rendimiento de segmentación comparable, pero incrementó tanto el número de parámetros como el coste computacional.

ModeloConfiguración de capa encoder-decoderParámetros (M)FLOPs (G)ISIC 2017 mIoU (%)ISIC 2017 DSC (%)ISIC 2018 mIoU (%)ISIC 2018 DSC (%)
MVM-UNet{2,2,2,1}-{2,2,2,2}28.224.1280.0288.9181.1689.64
MVM-UNet{2,2,2,2}-{2,2,2,2}28.364.3980.9590.1782.590.41
MVM-UNet{2,2,2,3}-{2,3,2,2}30.144.8879.8388.881.5689.85
MVM-UNet{2,4,2,2}-{2,2,4,2}33.465.3279.6588.781.4589.79
MVM-UNet{2,2,9,2}-{2,9,2,2}45.637.7880.9690.0982.4890.43

Tabla 8: Estudio de ablación de configuraciones de capas codificador-decodificador. Comparación de rendimiento de diferentes configuraciones de capas codificador-decodificador. La tabla informa sobre el número de parámetros del modelo (Parámetros), operaciones en coma flotante (FLOPs), la intersección media sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

Comparación de costes computacionales
La eficiencia computacional del modelo final MVM-UNet se comparó con métodos de referencia representativa, incluyendo HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former y MCAFT, bajo el mismo entorno hardware y resolución de entrada (Tabla 9). Las métricas evaluadas incluían tiempo de entrenamiento por época, tiempo de inferencia por imagen, uso máximo de memoria GPU durante el entrenamiento, número de parámetros entreenables (Params) y FLOPs. El tiempo de entrenamiento se midió como el tiempo requerido para completar una época de entrenamiento, el tiempo de inferencia como el tiempo medio de procesamiento por imagen de prueba, y los FLOPs se calcularon para un solo pase hacia adelante.

MétodoÁrbitro.Tiempo de entrenamiento (epoca)Tiempo de inferencia (ms/imagen)Memoria máxima de la GPU (GB)Parámetros (M)FLOPs (G)
HResEx34520213.0819.2117.00131.70
H-vmunet288827.005.010.748.97
MISSFormer3035592.8612.642.33109.45
H2Former1213029.028.833.7133.56
MedScale-Former358023.505.94.963.79
MCAFT3614534.008.730.0012.00
MVM-UNet (Nuestro)10426.807.928.364.39

Tabla 9: Comparación de costes computacionales de MVM-UNet y métodos de referencia representativa. Comparación de la eficiencia computacional bajo el mismo entorno de hardware y resolución de entrada. Las métricas reportadas incluyen el tiempo de entrenamiento por época, el tiempo de inferencia por imagen, el uso máximo de memoria de la unidad de procesamiento gráfico (GPU) durante el entrenamiento, el número de parámetros del modelo (Parámetros) y las operaciones en coma flotante (FLOPs). Los métodos con implementaciones disponibles se evaluaron utilizando el mismo entorno experimental siempre que fue posible.

Como se resume en la Tabla 9, MVM-UNet requería 104 s por época de entrenamiento, 26,8 ms por imagen para inferencia, 7,9 GB de memoria GPU de pico, 28,36 millones de parámetros entrenables y 4,39 GFLOPs. En comparación con HResFormer, MISSFormer, H2Former y MCAFT, MVM-UNet requería menos tiempo de entrenamiento, menor tiempo de inferencia, menor consumo máximo de memoria GPU y menos FLOPs. En comparación con los modelos ligeros H-vmunet y MedScale-Forter, MVM-UNet requirió mayor tiempo de entrenamiento y uso de memoria, pero mantuvo una velocidad de inferencia comparable manteniendo una complejidad computacional relativamente baja.

Disponibilidad de datos y código
Los conjuntos de datos ISIC 2017 e ISIC 2018 están disponibles públicamente a través del archivo de la International Skin Imaging Collaboration (ISIC), y el conjunto de datos Synapse está disponible públicamente desde el repositorio Synapse. Los detalles sobre la adquisición de conjuntos de datos se proporcionan en la declaración de Ética. En resumen, el conjunto de datos ISIC 2017 se obtuvo del repositorio oficial de datos ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), el conjunto de datos ISIC 2018 se obtuvo del repositorio oficial de datos ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), y el conjunto de datos Synapse se obtuvo del repositorio Synapse bajo el identificador de acceso syn3193805 (https://www.synapse.org/Synapse:syn3193805). Las fechas de descarga correspondientes se indican en la declaración de Ética. Una versión pública inicial del código fuente MVM-UNet está disponible en https://github.com/LIXUEGUANG002/MVM-UNet. El repositorio incluye la implementación del modelo, módulos principales de red, archivos de configuración, instrucciones de organización de conjuntos de datos, scripts de entrenamiento y scripts de evaluación. El paquete completo de reproducibilidad, que incluye archivos de configuración finalizados, scripts de experimentos completos, documentación adicional y puntos de control de modelos entrenados, estará disponible públicamente en cuanto se publique.

Tabla suplementaria 1. Arquitectura capa por capa de la Multi-view Vision Mamba UNet (MVM-UNet). La tabla resume la arquitectura de red secuencial de MVM-UNet, incluyendo la capa de entrada, incrustación de parches, etapas del codificador, bloques Multi-View Vision (MVV), operaciones de fusión de parches, Multi-stage Fusion Mamba (MFusion Mamba), etapas del decodificador, upsampling final y cabeza de segmentación. Para cada etapa, se listan la operación correspondiente, los parámetros principales y el tamaño de la característica de salida. E1–E4 denotan los mapas de características de etapa codificador usados para la fusión de características en múltiples etapas. B, H y W denotan el tamaño del lote, la altura de la imagen y el ancho de la imagen, respectivamente, y K denota el número de clases de salida (K = 1 para la segmentación binaria de lesiones cutáneas y K = 9 para la segmentación multiclase Synapse, que comprende una clase de fondo y ocho clases de órganos en primer plano). MFusion Mamba genera características de codificador multietapa fusionadas que se integran con las características correspondientes del decodificador durante la reconstrucción del decodificador. Por favor, haga clic aquí para descargar este archivo.

Archivo suplementario 1. Pseudocódigo del módulo Multi-View Four-Directional (MV4D) y Multi-stage Fusion Mamba (MFusion Mamba). El archivo suplementario presenta el flujo de trabajo algorítmico de los dos módulos principales utilizados en MVM-UNet. El algoritmo 1 describe toda la cadena de procesamiento del módulo Multi-View Four-Directional (MV4D), incluyendo aplanamiento de características, construcción de cuatro secuencias de par de escaneo (zigzag, jerárquico, espiral y radial), procesamiento selectivo en espacio de estados (S6), Scan-view Fusion Mamba (SFusion Mamba) y reconstrucción del mapa de características de salida. El algoritmo 2 describe el módulo Multi-stage Fusion Mamba (MFusion Mamba), incluyendo alineación de características del codificador multietapa, fusión gruesa, fusión fina, integración del decodificador y generación de la característica de entrada del decodificador fusionado. Las variables y dimensiones tensoriales se definen dentro de los algoritmos. Por favor, haga clic aquí para descargar este archivo.

Archivo de codificación suplementaria 1. Paquete de código fuente para MVM-UNet (MVM-UNet-master). El archivo suplementario ZIP contiene la implementación completa en código fuente de MVM-UNet utilizada en este estudio. El paquete incluye la arquitectura de red, módulos Multi-View Four-Directional (MV4D) y Multi-stage Fusion Mamba (MFusion Mamba), archivos de configuración, scripts de entrenamiento y evaluación para ISIC 2017, ISIC 2018, y conjuntos de datos Synapse, funciones de utilidad y documentación del proyecto necesarias para reproducir los experimentos descritos en este protocolo. El paquete también incluye el archivo README con instrucciones de instalación, dependencias de software, organización de conjuntos de datos y flujos de trabajo de entrenamiento e inferencia. Por favor, haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe MVM-UNet, un marco de segmentación de imágenes médicas basado en Mamba. El método fue diseñado para abordar dos limitaciones de los modelos de segmentación existentes. En primer lugar, los métodos convencionales basados en CNN tienen una capacidad limitada para modelar dependencias a largo alcance e información contextual jerárquica en imágenes médicascomplejas 43. En segundo lugar, los métodos basados en transformadores pueden modelar el contexto global pero normalmente requieren un coste computacionalmás alto 23,25. MVM-UNet utiliza la arquitecturaMamba 13,14,15,16,17,18,19,20 para lograr un modelado eficiente a largo alcance e introduce el escaneo multivista y la fusión de características en varias etapas para mejorar la precisión de segmentación. Desde la perspectiva de la ejecución y reproducibilidad del protocolo, varios pasos son críticos para obtener resultados comparables a los reportados en este estudio. Primero, la división del conjunto de datos, el redimensionamiento de imágenes, la interpolación de máscaras, la estrategia de normalización y la conversión de canales deben mantenerse consistentes con el protocolo porque las diferencias en el preprocesamiento pueden cambiar directamente la distribución de entrada y los límites de la máscara. En particular, las máscaras de segmentación deben redimensionarse mediante interpolación de vecinos más cercanos para evitar introducir valores de etiqueta noenteros 44. En segundo lugar, la configuración de entrenamiento, incluyendo la resolución de entrada, el tamaño del lote, los ajustes del optimizador, el calendario de tasa de aprendizaje, la semilla aleatoria, los coeficientes de ponderación de pérdida, la regla de selección de puntos de control y la operación umbral de inferencia o argmax, debe comprobarse antes de comparar los resultados. Si los resultados reproducidos son claramente inferiores a los valores reportados, los usuarios deben primero verificar la ruta del conjunto de datos, el formato de anotación, la convención de etiquetas en primer plano-fondo, la carga de puntos de control, la división de validación o prueba y el procedimiento de cálculo de métricas. La fuga de límites, las máscaras fragmentadas o la ausencia de pequeñas estructuras suelen indicar posibles inconsistencias en el preprocesamiento, interpolación de máscaras, selección de puntos de control o post-procesamiento de inferencia.

La principal contribución de MVM-UNet es el módulo MV4D. A diferencia de las estrategias de escaneo bidimensional simples adoptadas en arquitecturas anteriores basadas en modelos de espacio de estados 14,15,16,17,18,19,20, MV4D utiliza pares de escaneo en zigzag, jerárquicos, espirales y radiales para capturar información visual complementaria. Los pares de escaneo en zigzag ayudan a equilibrar la información espacial local y global, los pares jerárquicos mejoran la extracción de características multiescala, los pares de escaneo en espiral refuerzan la representación global de contornos y los pares radiales mejoran la extracción local de rasgos y fronteras. SFusion Mamba integra entonces estas modalidades complementarias de escaneo. Los resultados representativos y los experimentos de ablación (Tablas 4 y 5; Figura 9) demuestran que tanto la diversidad de patrones de escaneo como el mecanismo de fusión contribuyen a una mejora del rendimiento de segmentación. Otro componente importante es MFusion Mamba, que funciona como módulo de fusión de características entre el codificador y el decodificador. Las arquitecturas convencionales en forma de U, incluyendoU-Net 8,21,V-Net 44 y muchas variantesposteriores 9,23,25, transfieren principalmente información a través de conexiones de salto por etapas. Esta estrategia puede no aprovechar completamente las representaciones complementarias de codificadores multietapa. MFusion Mamba aborda esta limitación combinando características del codificador mediante fusión gruesa y fusión fina antes de decodificar. Los resultados representativos (Tabla 6; Figura 10) muestran que MFusion Mamba mejora consistentemente el rendimiento de segmentación, lo que indica que la fusión explícita de características multietapa es beneficiosa para la segmentación de imágenes médicas.

La contribución metodológica de MVM-UNet debe entenderse como un rediseño a nivel arquitectónico y no como la invención de cada operación individual desde cero. Enestudios previos se han investigado extensamente las arquitecturas codificador-decodificador en forma de U, conexiones residuales, capas de proyección y bloques de modelos Mamba/espacio de estados (SSM) 8,13,14,15,16,17,18,19,20,21,23,24,25 ,29,44. Sin embargo, combinar directamente estos componentes no aborda necesariamente los desafíos específicos de la segmentación de imágenes médicas. La novedad de MVM-UNet radica en el diseño coordinado de tres aspectos. Primero, el módulo MV4D sustituye un patrón de escaneo único o limitado por cuatro ramas complementarias de pares de escaneo, permitiendo al modelo capturar continuidad espacial, estructura multiescala, información global de contornos y detalles locales de los límites. En segundo lugar, SFusion Mamba y el MVV Block fusionan y mejoran las funciones específicas del escaneo antes de pasarlas a la siguiente etapa de red. En tercer lugar, MFusion Mamba agrega explícitamente las características del codificador multietapa antes de decodificar, complementando las conexiones de saltoconvencionales 8,21,44 y mejorando el uso de la información jerárquica. Los resultados de la ablación (Tablas 4–6; Figuras 9 y 10) apoyan aún más esta lógica de diseño, mostrando que el escaneo multivista, la fusión específica de escaneo, la rama de proyección Up-Down y la fusión de características multietapa contribuyen cada una a un mejor rendimiento de segmentación. Por lo tanto, la contribución de MVM-UNet radica en una integración específica de tarea y validada experimentalmente de la modelización espacial basada en Mamba y la fusión de características codificador-decodificador para la segmentación de imágenes médicas.

A pesar de su buen desempeño, MVM-UNet presenta varias limitaciones. En primer lugar, el rendimiento de segmentación no mejoró de forma consistente con tamaños de imagen de entrada más grandes, lo que sugiere que la arquitectura actual puede no aprovechar completamente la información de imagen de alta resolución. En segundo lugar, el modelo no fue evaluado extensamente bajo condiciones de imagen de alto ruido o bajo contraste, que se encuentran con frecuencia en la práctica clínica y pueden afectar la robustez a la segmentación. En tercer lugar, aunque el modelo logró un rendimiento sólido en tres conjuntos de datos públicos disponibles, es necesaria una validación adicional en conjuntos de datos de imagen médica más grandes y diversos. El protocolo puede adaptarse a otras tareas de segmentación de imágenes médicas, pero deben implementarse varias modificaciones con cuidado. Para una nueva tarea de segmentación binaria, los usuarios deben modificar el cargador de conjuntos de datos, los parámetros de normalización, la resolución de entrada y el umbral de primer plano manteniendo el procedimiento binario de pérdida y evaluación BCE-Dice. Para una nueva tarea de segmentación multiclase, los usuarios deben actualizar el número de clases de salida, el mapeo de índices de clase, la conversión de etiquetas de un solo momento, la configuración de pérdida CE-Dice y las métricas de evaluación clasepor clase 44. Para conjuntos de datos en escala de grises, la configuración del canal de entrada debe adaptarse a la arquitectura del modelo mediante una proyección de entrada de un solo canal o repitiendo la imagen en escala de grises para crear una entrada de tres canales, dependiendo de la implementación. El método puede funcionar de forma subóptima cuando las estructuras objetivo son extremadamente pequeñas, los límites son débiles o ambiguos, el contraste de la imagen difiere sustancialmente de los datos de entrenamiento o el conjunto de datos objetivo muestra un cambio de dominio sustancial. Bajo estas condiciones, los usuarios pueden necesitar ajustar la resolución de entrada, la estrategia de aumento, el equilibrio de clases, la ponderación de pérdida o el calendario de ajuste fino, manteniendo el mismo protocolo de evaluación para garantizar comparaciones justas.

En el conjunto de datos Synapse, MVM-UNet logró un fuerte rendimiento en segmentación multiórgano bajo la división comúnmente utilizada en entrenamiento de 18 casos y pruebas de 12 casos. Aunque el método propuesto logró la mayor media de DCS entre los métodos representativos de referencia evaluados en este estudio (Tabla 3), algunos métodos más recientes han reportado un mayor rendimiento de Synapse bajo diferentes entornos de entrenamiento y protocolosde evaluación 29. Por lo tanto, evitamos describir MVM-UNet como alguien que logra un rendimiento global de vanguardia en Synapse y, en su lugar, lo describimos como un rendimiento sólido en el entorno experimental evaluado. Estos hallazgos sugieren que el rendimiento de MVM-UNet surge de la adaptación específica por tarea del modelado basado en Mamba para la segmentación de imágenesmédicas 13,14,15,16,17,18,19,20. En lugar de depender de una única estrategia de escaneo, MVM-UNet descompone el modelado de características visuales en múltiples vistas de escaneo complementarias e integras a través de SFusion Mamba. Además, MFusion Mamba mejora el flujo de información entre el codificador y el decodificador al agregar explícitamente características del codificador multietapa más allá de las conexiones de saltoconvencionales 8,21,44. Este diseño permite que el modelo propuesto logre un rendimiento sólido tanto en tareas de segmentación binaria de lesiones cutáneas como en tareas de segmentación multiorgánica.

Los trabajos futuros deberían centrarse en mejorar MVM-UNet para la segmentación de imágenes médicas de alta resolución. Arquitecturas multiescala más profundas o adaptativas pueden permitir al modelo explotar la información de imagen de alta resolución de forma más eficaz. Futuros estudios también deberían evaluar la robustez de MVM-UNet bajo condiciones de imagen ruidosas, de bajo contraste y desplazadas de dominio. Además, la estrategia propuesta de escaneo multivista podría extenderse a otras tareas médicas de análisis de imágenes, incluyendo la detecciónde lesiones 4, la localización de órganos, la clasificación tumoral y la segmentación tridimensional10,11. En resumen, MVM-UNet proporciona un marco eficaz y reproducible para la segmentación de imágenes médicas. La integración del módulo MV4D y MFusion Mamba permite al modelo capturar información espacial complementaria, contexto multiescala, información global de contornos, detalles locales de los límites y características semánticas multietapa. Los resultados representativos obtenidos en los conjuntos de datos ISIC 2017, ISIC 2018 y Synapse demuestran la efectividad de la arquitectura propuesta. Este protocolo proporciona una referencia práctica para investigadores que desarrollan arquitecturas eficientes basadas en SSM/Mamba para la segmentación de imágenesmédicas 13,14,15,16,17,18,19,20.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió financiación externa.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Hardware - GPU workstation or GPU serverInstitutional computing platform / local workstationCustom-built local GPU workstation; Ubuntu 22.04.1 con kernel de Linux 6.8.0; CPU Intel Core i9-13900K; GPU NVIDIA A800; 128 GB de RAM; 512 GB de almacenamiento local.Plataforma computacional para entrenamiento, validación, pruebas, ablación y experimentos solo de inferencia.
Hardware - Graphics processing unit (GPU)NVIDIA CorporationGPU NVIDIA A800 (80 GB de memoria).Entrenamiento e inferencia acelerados por GPU.
Hardware - Central processing unit (CPU)Intel Corporation / AMDCPU Intel Core i9-13900K de 13.ª generación.Procesador host para carga de datos, preprocesamiento y ejecución de experimentos.
Hardware - System memory (RAM)Institutional computing platform / local workstation128 GB de RAM del sistemaMemoria para carga de conjuntos de datos, preprocesamiento y entrenamiento.
Hardware - StorageInstitutional computing platform / local workstationUnidad de estado sólido NVMe de 2 TB.Almacenamiento para conjuntos de datos, puntos de control, registros y figuras de predicción generadas.
Software environment - Operating systemCanonical Ltd.Recomendado: Ubuntu 22.04.1 LTSSistema operativo para el entorno computacional.
Software environment - Conda environmentAnaconda, Inc. / MinicondaNombre del entorno: mvmunetEntorno de Python utilizado para instalar y aislar dependencias.
Software environment - PythonPython Software FoundationPython 3.8Lenguaje de programación utilizado para la implementación y ejecución de experimentos.
Software environment - CUDA toolkitNVIDIA CorporationCUDA Toolkit 11.8Backend de computación GPU requerido por PyTorch y paquetes relacionados con Mamba.
Software environment - cuDNNNVIDIA CorporationcuDNN 8.7.0.Primitivas de aprendizaje profundo aceleradas por GPU utilizadas a través de PyTorch.
Python package - PyTorchPyTorchtorch == 2.0.1Marco de aprendizaje profundo para entrenamiento de modelos, cálculo de pérdidas, optimización e inferencia.
Python package - TorchvisionPyTorchtorchvision == 0.14.0Utilidades de transformación de imágenes utilizadas en preprocesamiento y aumento.
Python package - TorchaudioPyTorchtorchaudio == 0.13.0Instalado con el entorno recomendado de PyTorch.
Python package - timmtimm developerstimm == 0.4.12Dependencia de componentes de modelo o utilidad listada en las instrucciones de entorno del repositorio.
Python package - tritonOpenAI / Triton developerstriton == 2.0.0Dependencia utilizada por componentes de modelado de secuencias acelerados por GPU.
Python package - causal-conv1dcausal-conv1d developerscausal_conv1d == 1.0.0Dependencia de convolución causal eficiente requerida por la implementación de Mamba.
Python package - mamba-ssmMamba SSM developersmamba_ssm == 1.0.1Paquete de modelado de secuencias de espacio de estados utilizado para componentes relacionados con Mamba/S6.
Python package - NumPyNumPy developersVersión de NumPy 1.24.3.Cálculo numérico y operaciones de matrices.
Python package - SciPySciPy developersVersión de SciPy 1.10.1.Cálculo científico; scipy.ndimage.zoom se importa en utils.py.
Python package - SimpleITKInsight Software ConsortiumVersión de SimpleITK 2.2.1.Utilidad de entrada/salida e imagen médica preprocesada importada en utils.py.
Python package - MedPyMedPy developersVersión de MedPy 0.4.0.Paquete de cálculo de métricas de imágenes médicas importado en utils.py.
Python package - scikit-imagescikit-image developersVersión de scikit-image 0.21.0.Dependencia de procesamiento de imágenes listada en README.
Python package - scikit-learnscikit-learn developersVersión de scikit-learn 1.3.2.Paquete de utilidades de aprendizaje automático listado en README.
Python package - matplotlibMatplotlib developersVersión de Matplotlib 3.7.2.Utilizado para guardar figuras de visualización cualitativa.
Python package - h5pyh5py developersVersión de h5py 3.9.0.Soporte de archivo HDF5 para volúmenes de prueba de Synapse.
Python package - thopTHOP developersVersión de THOP 0.1.1.post2209072238.Utilizado al calcular FLOPs y costo computacional relacionado con parámetros.
Python package - packagingPython Packaging AuthorityVersión de packaging 23.1.Dependencia listada en README.
Python package - pytestpytest developersVersión de pytest 7.4.0.Dependencia listada en README.
Python package - chardetchardet developersVersión de chardet 5.2.0.Dependencia listada en README.
Python package - yacsYACS developersVersión de yacs 0.1.8.Dependencia de utilidad de configuración listada en README.
Python package - termcolortermcolor developersVersión de termcolor 2.3.0.Dependencia de utilidad de registro/terminal listada en README.
Python package - submititsubmitit developersVersión de submitit 1.4.5.Dependencia de utilidad de experimento/trabajo listada en README.
Python package - tensorboardXtensorboardX developersVersión de tensorboardX 2.6.2.2.Utilidad de visualización de registro de entrenamiento listada en README.
Python package - ml-collectionsml_collections developersVersión de ml-collections 0.1.1.Importado por configs/config_setting_synapse.py.
Dataset - ISIC 2017 Challenge datasetInternational Skin Imaging CollaborationConjunto de datos de segmentación de lesiones cutáneas ISIC 2017Imágenes y máscaras de lesiones cutáneas dermatoscópicas públicas y anónimas utilizadas para segmentación binaria.
Dataset - ISIC 2018 Challenge Task 1 datasetInternational Skin Imaging CollaborationISIC 2018 Tarea 1: Segmentación de límites de lesionesImágenes y máscaras de lesiones cutáneas dermatoscópicas públicas y anónimas utilizadas para segmentación binaria.
Dataset - Synapse Multi-Atlas Labeling Beyond the Cranial Vault datasetSynapse / Sage BionetworksIdentificador de acceso: syn3193805Conjunto de datos público de segmentación multiorgánica de TC abdominal.
Data organization - ISIC 2017 data folderAuthors / repository layoutdata/isic2017/Carpeta local esperada que contiene imágenes/máscaras de entrenamiento y validación.
Data organization - ISIC 2018 data folderAuthors / repository layoutdata/isic2018/Carpeta local esperada que contiene imágenes/máscaras de entrenamiento y validación.
Data organization - Synapse data folderAuthor

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang F, et al. Cross co-teaching for semi-supervised medical image segmentation. Pattern Recognit. 2024;152:110485.
  2. Gu Y, et al. Dual-scale enhanced and cross-generative consistency learning for semi-supervised medical image segmentation. Pattern Recognit. 2025;158:111140.
  3. Zhu X, Wang W, Zhang C, Wang H. Polyp-Mamba: A hybrid multi-frequency perception gated selection network for polyp segmentation. Inf Fusion. 2025;115:103161.
  4. Iqbal S, et al. TBConvL-Net: A hybrid deep learning architecture for robust medical image segmentation. Pattern Recognit. 2025;158:111147.
  5. Zhao Z, et al. Balanced feature fusion collaborative training for semi-supervised medical image segmentation. Pattern Recognit. 2025;157:110986.
  6. Zhou T, et al. MambaYOLACT: You only look at Mamba prediction head for head-neck lymph nodes. Artif Intell Rev. 2025;58(6).
  7. Zhao Y, et al. MGF-GCN: Multimodal interaction Mamba-aided graph convolutional fusion network for semantic segmentation of remote sensing images. Inf Fusion. 2025;122:103268.
  8. Ronneberger O, Fischer P, Brox T. U-Net: Convolutional networks for biomedical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2015.
  9. Zhou Z, Siddiquee MMR, Tajbakhsh N, Liang J. UNet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE Trans Med Imaging. 2019;39(6):1856-1867.
  10. Shaker A, et al. UNETR++: Delving into efficient and accurate 3D medical image segmentation. IEEE Trans Med Imaging. 2024;43(9):3377-3390.
  11. Zhou HY, et al. nnFormer: Volumetric medical image segmentation via a 3D Transformer. IEEE Trans Image Process. 2023;32:4036-4045.
  12. He A, et al. H2Former: An efficient hierarchical hybrid Transformer for medical image segmentation. IEEE Trans Med Imaging. 2023;42(9):2763-2775.
  13. Zhu L, et al. Vision Mamba: Efficient visual representation learning with bidirectional state space model. In: Proceedings of the 41st International Conference on Machine Learning (ICML). 2024.
  14. Liu Y, et al. VMamba: Visual state space model. Adv Neural Inf Process Syst. 2024;37:103031-103063.
  15. Ma J, Li F, Wang B. U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv. 2024;arXiv:2401.04722.
  16. Wang Z, et al. Mamba-UNet: UNet-like pure visual Mamba for medical image segmentation. arXiv. 2024;arXiv:2402.05079.
  17. Huang T, et al. LocalMamba: Visual state space model with windowed selective scan. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  18. Zhang Z, et al. Motion Mamba: Efficient and long sequence motion generation. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  19. Hu VT, et al. Zigma: A DiT-style zigzag Mamba diffusion model. In: European Conference on Computer Vision (ECCV). Springer; 2024.
  20. Rahman MM, et al. Mamba in vision: A comprehensive survey of techniques and applications. arXiv. 2024;arXiv:2410.03105.
  21. Falk T, et al. U-Net: Deep learning for cell counting, detection, and morphometry. Nat Methods. 2019;16(1):67-70.
  22. Gu R, et al. CA-Net: Comprehensive attention convolutional neural networks for explainable medical image segmentation. IEEE Trans Med Imaging. 2020;40(2):699-711.
  23. Chen J, et al. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of Transformers. Med Image Anal. 2024;97:103280.
  24. Zhang Z, Zhang W. Pyramid medical Transformer for medical image segmentation. arXiv. 2021;arXiv:2104.14702.
  25. Cao H, et al. Swin-Unet: UNet-like pure Transformer for medical image segmentation. In: European Conference on Computer Vision (ECCV). Springer; 2022.
  26. Chen B, et al. TransAttUNet: Multi-level attention-guided U-Net with Transformer for medical image segmentation. IEEE Trans Emerg Top Comput Intell. 2023.
  27. Jiang S, Li J. TransCUNet: UNet cross-fused Transformer for medical image segmentation. Comput Biol Med. 2022;150:106207.
  28. Wu R, Liu Y, Liang P, Chang Q. H-vmunet: High-order Vision Mamba UNet for medical image segmentation. Neurocomputing. 2025;624:129447.
  29. Liu J, et al. Swin-UMamba: Adapting Mamba-based vision foundation models for medical image segmentation. IEEE Trans Med Imaging. 2024.
  30. Huang X, et al. MISSFormer: An effective Transformer for 2D medical image segmentation. IEEE Trans Med Imaging. 2023;42(5):1484-1494.
  31. Ruan J, et al. MALUNet: A multi-attention and lightweight U-Net for skin lesion segmentation. In: 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE; 2022.
  32. Ruan J, Xiang S. VM-UNet: Vision Mamba UNet for medical image segmentation. arXiv. 2024;arXiv:2402.02491.
  33. Valanarasu JMJ, Patel VM. UNeXt: MLP-based rapid medical image segmentation network. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2022.
  34. Ren S, Li X. HResFormer: Hybrid residual Transformer for volumetric medical image segmentation. IEEE Trans Neural Netw Learn Syst. 2025;36(6):10558-10566.
  35. Karimijafarbigloo S, Azad R, Kazerouni A, Merhof D. MedScale-Former: Self-guided multiscale Transformer for medical image segmentation. Med Image Anal. 2025;103.
  36. Yan S, et al. Multi-scale convolutional attention frequency-enhanced Transformer network for medical image segmentation. Inf Fusion. 2025;119.
  37. Gao Y, Zhou M, Metaxas DN. UTNet: A hybrid Transformer architecture for medical image segmentation. In: Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer; 2021.
  38. Mei J, et al. SANet: A slice-aware network for pulmonary nodule detection. IEEE Trans Pattern Anal Mach Intell. 2021;44(8):4374-4387.
  39. Hu XZ, Jeon WS, Rhee SY. ATT-UNet: Pixel-wise staircase attention for weed and crop detection. In: 2023 International Conference on Fuzzy Theory and Its Applications (iFUZZY). IEEE; 2023.
  40. Wang X, et al. Transferable normalization: Towards improving transferability of deep neural networks. Adv Neural Inf Process Syst. 2019;32.
  41. Azad R, et al. TransDeepLab: Convolution-free Transformer-based DeepLabV3+ for medical image segmentation. In: International Workshop on Predictive Intelligence in Medicine (PRIME). Springer; 2022.
  42. Ruan J, Gao J, Xie M, Xiang S. Learning multi-axis representation in frequency domain for medical image segmentation. Mach Learn. 2025;114(1):10.
  43. Goodfellow I, Bengio Y, Courville A. Deep Learning. MIT Press; Cambridge, MA; 2016.
  44. Milletari F, Navab N, Ahmadi SA. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. In: 2016 Fourth International Conference on 3D Vision (3DV). IEEE; 2016.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

MedicinaN mero 234N mero 234Modelo de lenguaje extensoSSMUNet

Artículos relacionados