$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Resultados esperados e interpretación
Cuando este protocolo se implementa correctamente, se espera que el modelo entrenado MVM-UNet produzca un rendimiento de segmentación estable a lo largo de ejecuciones repetidas, con solo pequeñas variaciones entre diferentes semillas aleatorias para la mayoría de las métricas de evaluación. Para ISIC 2017 e ISIC 2018, los resultados exitosos se reflejan en valores altos de DSC, mIoU, Acc, Sen y Spe, junto con mascarillas de lesión predichas que siguen de cerca los límites de lesión de la verdad en el terreno (Figuras 6 y 7). Para Synapse, los resultados exitosos se reflejan en valores medios altos de DSC y bajos valores de HD95 en los órganos del primer plano (Figura 8). Durante la ejecución del protocolo, las métricas cuantitativas deben interpretarse junto con los resultados de segmentación cualitativa correspondientes. Un modelo que logre una DSC alta pero que muestre fuga de límites, omisión de estructuras pequeñas o predicciones fragmentadas debe considerarse solo parcialmente exitoso, y debe verificarse el procedimiento de preprocesamiento, la selección de puntos de control y los ajustes de inferencia.

Figura 6. Resultados representativos de segmentación cualitativa en el conjunto de datos ISIC 2017. Resultados cualitativos representativos de segmentación obtenidos en el conjunto de datos de segmentación de lesiones cutáneas de la International Skin Imaging Collaboration (ISIC) 2017. Cada ejemplo muestra la imagen dermoscópica original (Imagen), la correspondiente máscara de segmentación de la verdad en tierra (GT) y la predicción generada por MVM-UNet (Pred). Casos de prueba representativos ilustran el rendimiento de segmentación para lesiones de tamaño, morfología y complejidad de límite variables. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 7. Resultados representativos de segmentación cualitativa en el conjunto de datos ISIC 2018. Resultados representativos de segmentación cualitativa obtenidos en el conjunto de datos de segmentación de lesiones cutáneas de la International Skin Imaging Collaboration (ISIC) 2018. Cada ejemplo muestra la imagen dermoscópica original (Imagen), la correspondiente máscara de segmentación de la verdad en tierra (GT) y la predicción generada por MVM-UNet (Pred). Los casos de prueba representativos demuestran el rendimiento de segmentación a lo largo de diversas apariencias de lesiones y características de los límites. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 8. Resultados representativos de segmentación cualitativa en el conjunto de datos de tomografía computarizada multiórgano Synapse. Resultados representativos de segmentación cualitativa multiorgánica obtenidos en el conjunto de datos Synapse Multi-Atlas Labeling Beyond the Cranial Vault. Cada ejemplo muestra la imagen original de tomografía computarizada (Imagen), las correspondientes anotaciones de órganos de verdad en el terreno (GT) y la predicción generada por MVM-UNet (Pred). Ejemplos representativos ilustran la concordancia entre segmentaciones predichas y de referencia a través de múltiples órganos abdominales. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Rendimiento en ISIC 2017
Para evaluar la reproducibilidad de MVM-UNet, se repitieron todos los experimentos principales de comparación utilizando tres semillas aleatorias independientes (1, 52 y 100), y los resultados se reportaron como media ± DS. La significación estadística se evaluó usando la prueba de rangos por signo de Wilcoxon basada en resultados emparejados por imagen para ISIC 2017 e ISIC 2018 y resultados emparejados por caso para Synapse. El análisis estadístico se realizó utilizando valores métricos emparejados en lugar de promedios a nivel semilla. Para una comparación justa, los resultados reportados como media ± SD se reprodujeron usando las implementaciones oficiales bajo las mismas particiones de conjuntos de datos, resoluciones de entrada y métricas de evaluación siempre que fuera posible, mientras que los resultados de valor único se conservaron de las publicaciones originales correspondientes.
MVM-UNet fue evaluado en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017 y comparado con métodos representativos de segmentación, incluyendo UNet 8,21, TransUNet23, H-vmunet28, MISSFormer30, MaLUNet31, VM-UNet32, UNeXt-S33, HResFormer34, MedScale-Former35, MCAFT36 y H2Former12 (Tabla 1)). MVM-UNet logró un mIoU de 80,94 ± 1,01%, un DSC del 91,32% ± 0,68%, una precisión del 96,58% ± 0,27%, una especificidad del 98,31% ± 0,23%, y una sensibilidad del 91,65% ± 0,77% en tres etapas independientes. En comparación con los métodos evaluados, MVM-UNet alcanzó el mayor mIoU, DSC y sensibilidad. Los resultados representativos de segmentación cualitativa se muestran en la Figura 6, donde las mascarillas predichas siguen de cerca los límites de la lesión de base a través de imágenes de prueba representativas.
| Modelo | Árbitro. | mIoU (%) | DSC (%) | Cuenta (%) | Spe (%) | Sen (%) |
| UNet | 8 | 76.98 | 86.99 | 95.65 | 97.43 | 86.82 |
| TransUNet | 23 | 75.32 | 81.23 | 91.45 | 95.77 | 82.63 |
| MaLUNet | 31 | 78.78 | 88.13 | 96.18 | 98.47 | 84.78 |
| VM-UNet | 32 | 80.23 | 89.03 | 96.29 | 97.58 | 89.90 |
| UNeXt-S | 33 | 78.26 | 87.80 | 95.95 | 97.74 | 87.04 |
| HResEx | 34 | 79,89 ± 1,05 | 88,82 ± 0,65 | 96,25 ± 0,24 | 97,73 ± 0,22 | 87,72 ± 0,79 |
| H-vmunet | 28 | 80.34 ± 1.02 | 90,68 ± 0,55 | 96,42 ± 0,18 | 98,23 ± 0,32 | 88,97 ± 0,88 |
| MISSFormer | 30 | 80,16 ± 0,78 | 89,27 ± 0,61 | 94,36 ± 0,28 | 97,52 ± 0,38 | 87,71 ± 0,69 |
| H2Former | 12 | 80,35 ± 0,95 | 88,56 ± 0,72 | 96,61 ± 0,19 | 98,15 ± 0,14 | 88,21 ± 0,81 |
| MedScale-Former | 35 | 80,31 ± 0,82 | 89,11 ± 0,59 | 95,68 ± 0,33 | 98,24 ± 0,21 | 89,96 ± 0,92 |
| MCAFT | 36 | 80,59 ± 0,93 | 89,27 ± 0,63 | 96,42 ± 0,20 | 97,95 ± 0,17 | 90,05 ± 0,84 |
| MVM-UNet (Nuestro) | — | 80,94 ± 1,01 | 91,32 ± 0,68 | 96,58 ± 0,27 | 98,31 ± 0,23 | 91,65 ± 0,77 |
Tabla 1: Comparación de rendimiento en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2017. Comparación de MVM-UNet con métodos de segmentación basados en redes neuronales convolucionales representativas (CNN), Transformers y modelos de espacio de estados (SSM) utilizando la intersección media sobre la unión (mIoU), el coeficiente de similitud de dados (DSC), la precisión (Acc.), la especificidad (Spe.) y la sensibilidad (Sen.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.
Los ejemplos cualitativos demuestran además que MVM-UNet segmentó con precisión tanto lesiones pequeñas como lesiones mayores con límites irregulares. En estos ejemplos representativos, las máscaras predichas coincidían estrechamente con las anotaciones correspondientes de la verdad del terreno y preservaban los límites de las lesiones con una fuga o fragmentación mínima.
Para evaluar mejor si las mejoras observadas eran estadísticamente significativas, se realizaron pruebas de Wilcoxon con rango por signo utilizando resultados de segmentación por imagen emparejados. Para la métrica mIoU, MVM-UNet mostró una mejora estadísticamente significativa respecto a MCAFT, con un valor p de 0,0114. Para la métrica DSC, MVM-UNet también superó significativamente a H-vmunet, con un valor p de 0,0031. Estos resultados apoyan que las mejoras observadas en ISIC 2017 probablemente no se debían a la variación aleatoria.
En general, MVM-UNet logró el mayor rendimiento entre los métodos comparados para mIoU, DSC y sensibilidad en el conjunto de datos ISIC 2017 (Tabla 1). Los ejemplos de segmentación cualitativa mostrados en la Figura 6 son coherentes con estos hallazgos cuantitativos.
Rendimiento en ISIC 2018
MVM-UNet fue evaluado posteriormente en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2018 y comparado con métodos representativos de segmentación, incluyendoUNet 8,21, UNet++9, UTNetV237, SANet38, MaLUNet31, VM-UNet32, H-vmunet28, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 y MCAFT36 (Tabla 2)). MVM-UNet logró un mIoU del 82,47% ± 1,28%, un DSC del 90,65% ± 0,94%, una precisión del 96,02% ± 0,36%, una especificidad del 97,06% ± 0,31%, y una sensibilidad del 91,80% ± 0,82% en tres etapas independientes. Estos resultados demuestran que el rendimiento de MVM-UNet se mantuvo consistente entre diferentes semillas aleatorias. Los resultados representativos de segmentación cualitativa se muestran en la Figura 7.
| Modelo | Árbitro. | mIoU (%) | DSC (%) | Cuenta (%) | Spe (%) | Sen (%) |
| UNet | 8 | 77.86 | 87.55 | 94.05 | 96.69 | 85.86 |
| UNet++ | 9 | 78.31 | 87.83 | 94.02 | 95.75 | 88.65 |
| UTNetV2 | 37 | 78.97 | 88.25 | 94.32 | 96.48 | 87.60 |
| SANet | 38 | 79.52 | 88.59 | 94.39 | 95.97 | 89.46 |
| MaLUNet | 31 | 80.25 | 89.04 | 94.62 | 96.19 | 89.74 |
| VM-UNet | 32 | 81.35 | 89.71 | 94.91 | 96.13 | 91.12 |
| H-vmunet | 28 | 81,93 ± 1,45 | 90,46 ± 0,62 | 95.19 ± 0.30 | 96,82 ± 0,21 | 88,37 ± 1,13 |
| MISSFormer | 30 | 80.27 ± 1.21 | 89,91 ± 0,46 | 94,76 ± 0,27 | 97,22 ± 0,15 | 90.84 ± 1.07 |
| H2Former | 12 | 80,40 ± 0,83 | 90,26 ± 0,73 | 94,89 ± 0,38 | 96,98 ± 0,25 | 91,57 ± 0,54 |
| HResEx | 34 | 81.12 ± 1.18 | 88,86 ± 0,84 | 94,96 ± 0,33 | 96,43 ± 0,22 | 91,86 ± 1,01 |
| MedScale-Former | 35 | 80,97 ± 0,74 | 90,47 ± 0,68 | 95,02 ± 0,41 | 95,89 ± 0,26 | 90,65 ± 0,92 |
| MCAFT | 36 | 81,46 ± 1,03 | 89,06 ± 0,76 | 95,23 ± 0,29 | 96,72 ± 0,17 | 91,82 ± 0,57 |
| MVM-UNet (Nuestro) | — | 82,47 ± 1,28 | 90,65 ± 0,94 | 96,02 ± 0,36 | 97,06 ± 0,31 | 91,80 ± 0,82 |
Tabla 2: Comparación de rendimiento en el conjunto de datos de segmentación de lesiones cutáneas ISIC 2018. Comparación de MVM-UNet con métodos representativos de segmentación basados en CNN, transformador y SSM utilizando intersección media sobre unión (mIoU), coeficiente de similitud de dados (DSC), precisión (Acc.), especificidad (Spe.) y sensibilidad (Sen.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.
En comparación con H-vmunet, MVM-UNet mejoró el mIoU en un 0,54%. En comparación con MedScale-Former, MVM-UNet mejoró la DSC en un 0,18%. MVM-UNet también logró la mayor precisión entre los métodos comparados. Los ejemplos cualitativos representativos mostrados en la Figura 7 demuestran una segmentación precisa de lesiones cutáneas representativas, incluyendo regiones pequeñas de la lesión y lesiones con límites irregulares.
Para ISIC 2018, la significación estadística se evaluó utilizando la prueba de rango de signos de Wilcoxon basada en resultados de segmentación por imagen emparejada. Para la métrica mIoU, MVM-UNet logró una mejora estadísticamente significativa respecto a MCAFT, con un valor p de < 0,001. Estos resultados apoyan que la mejora observada en el rendimiento en ISIC 2018 probablemente no se debía a la variación aleatoria.
En general, MVM-UNet logró el mayor mIoU, DSC y precisión entre los métodos comparados en el conjunto de datos ISIC 2018 (Tabla 2). Los ejemplos cualitativos mostrados en la Figura 7 son coherentes con estas mejoras cuantitativas.
Actuación en Synapse
El método propuesto también fue evaluado en el conjunto de datos de segmentación multiorgánica Synapse y comparado con métodos representativos, incluyendoUNet 8,21, Attention U-Net39, TransUNet23, TransNorm40, Swin U-Net25, TransDeepLab41, MEW-UNet42, MISSFormer30, H2Former12, HResFormer34, MedScale-Former35 y MCAFT36 (Tabla 3)). El conjunto de datos de Synapse incluía ocho órganos abdominales: la aorta, la vesícula biliar, el bazo, el riñón izquierdo, el derecho, el hígado, el páncreas y el estómago. Siguiendo el protocolo experimental estándar, se utilizaron 18 casos (2.212 cortes axiales) para entrenamiento y 12 casos (1.567 cortes axiales) para pruebas. No se introdujo ningún conjunto de validación separado. Los casos de prueba se usaron exclusivamente para la evaluación final y no se emplearon para el entrenamiento de modelos, la afinación de hiperparámetros ni la selección de modelos. Los resultados representativos de segmentación cualitativa multiórgano se muestran en la Figura 8, y la comparación cuantitativa se resume en la Tabla 3.
| Modelo | Árbitro. | DSC | HD95 | Aor. | Gal. | Chaval. (L) | Chaval. (R) | Liv. | Pan. | Spl. | Sto. |
| UNet | 8 | 76.85 | 39.78 | 89.07 | 69.72 | 77.77 | 68.69 | 93.43 | 54.01 | 86.66 | 75.59 |
| Att-UNet | 39 | 77.77 | 36.02 | 89.54 | 68.88 | 77.98 | 71.11 | 93.57 | 58.04 | 87.31 | 75.74 |
| TransUNet | 23 | 77.48 | 31.69 | 87.23 | 63.13 | 81.87 | 77.02 | 94.08 | 55.84 | 85.06 | 75.62 |
| TransNorm | 40 | 78.4 | 30.25 | 86.23 | 65.18 | 82.18 | 78.63 | 94.22 | 55.32 | 89.53 | 76.02 |
| Swin U-Net | 25 | 79.13 | 21.55 | 85.47 | 66.53 | 83.28 | 79.61 | 94.29 | 56.58 | 90.62 | 76.59 |
| TransDeepLab | 41 | 80.16 | 21.25 | 86.04 | 69.16 | 84.08 | 79.88 | 93.53 | 61.15 | 89.01 | 78.36 |
| MEW-UNet | 42 | 78.92 | 21.68 | 86.68 | 65.32 | 82.87 | 80.02 | 93.63 | 58.38 | 90.16 | 74.27 |
| MISSFormer | 30 | 80,92 ± 4,23 | 20.09 ± 1.89 | 86,43 ± 0,98 | 69,81 ± 4,56 | 84.29 ± 2.11 | 81.03 ± 3.34 | 93,85 ± 0,89 | 61.11 ± 4.67 | 90.05 ± 3.78 | 80,62 ± 1,02 |
| H2Former | 12 | 81.05 ± 2.56 | 20.13 ± 7.23 | 86,61 ± 3,21 | 69.32 ± 1.23 | 85.12 ± 4.78 | 82.01 ± 2.89 | 94.09 ± 2.45 | 61,16 ± 0,76 | 89,97 ± 4,12 | 80,94 ± 3,56 |
| HResEx | 34 | 80,65 ± 4,02 | 17.48 ± 6.89 | 89.16 ± 2.78 | 66,94 ± 0,78 | 84,61 ± 4,34 | 82.15 ± 2.56 | 93.11 ± 1.34 | 59,92 ± 4,12 | 91.08 ± 3.45 | 80,75 ± 2,01 |
| MedScale-Former | 35 | 80,78 ± 1,34 | 20.02 ± 3.78 | 88,79 ± 4,02 | 69,82 ± 2,56 | 85,13 ± 0,87 | 81,63 ± 4,78 | 94.10 ± 2.78 | 60,72 ± 1,89 | 90.14 ± 1.56 | 80,93 ± 4,56 |
| MCAFT | 36 | 81.03 ± 3.45 | 19.98 ± 5.12 | 89,76 ± 0,76 | 68,96 ± 3,89 | 84,54 ± 2,56 | 81,98 ± 3,12 | 94.32 ± 4.01 | 60,85 ± 3,67 | 89.06 ± 4.89 | 80,91 ± 1,78 |
| MVM-UNet (Nuestro) | — | 81,26 ± 1,89 | 18.72 ± 2.16 | 88,53 ± 3,22 | 69,84 ± 4,23 | 85,37 ± 2,69 | 82,67 ± 1,67 | 94.41 ± 3.56 | 61,02 ± 2,78 | 90.19 ± 0.67 | 81,48 ± 3,12 |
Tabla 3: Comparación de rendimiento en el conjunto de datos de segmentación multiórgano Synapse. Comparación de MVM-UNet con métodos representativos de segmentación basados en CNN, Transformer y SSM utilizando el Coeficiente de Similitud de Dados (DSC), la distancia de Hausdorff en percentil 95 (HD95) y puntuaciones de Dice específicas de órganos para la aorta (Aor.), vesícula biliar (Gal.), riñón izquierdo (Kid. (L)), riñón derecho (Kid. (R)), hígado (Liv.), páncreas (Pan.), bazo (Spl.) y estómago (Sto.). Los resultados de MVM-UNet se informan como media ± desviación estándar de tres experimentos independientes de semilla aleatoria. Los resultados reportados como valores individuales se reproducían de las publicaciones originales correspondientes.
MVM-UNet logró un DSC medio del 81,26% ± 1,89% y un HD95 medio de 18,72 ± 2,16 en tres etapas independientes. Los resultados demuestran un rendimiento estable en la segmentación en el conjunto de datos Synapse. Entre los métodos evaluados, MVM-UNet logró la mayor media de la DSC y la segunda media más baja de HD95.
Para Synapse, la significación estadística se evaluó utilizando la prueba de rangos por signos de Wilcoxon basada en valores de DSC pareados por caso. MVM-UNet mostró una mejora estadísticamente significativa respecto a H2Former, con un valor p de 0,026, lo que indica que la mejora observada en el rendimiento de segmentación fue estadísticamente significativa.
Resultados representativos exitosos y subóptimos
Los resultados cualitativos positivos representativos se muestran en las Figuras 6–8. Los resultados exitosos se caracterizan por máscaras de segmentación predichas que corresponden estrechamente a las anotaciones de base y delimitan con precisión los límites primarios de la lesión u órgano. Resultados representativos subóptimos pueden darse para objetivos muy pequeños, límites de bajo contraste, formas irregulares de lesiones, órganos con contraste de intensidad débil o límites anatómicamente ambiguos, y típicamente aparecen como subsegmentación, sobresegmentación, fuga de límites o fragmentos discontinuos de la máscara. Cuando se observan estos resultados, los usuarios deben verificar que el redimensionamiento de imágenes, la normalización, la interpolación de máscaras, la selección de puntos de control del modelo, el umbral de inferencia (para conjuntos de datos ISIC) o la predicción argmax (para Synapse) y los procedimientos de cálculo métrico son consistentes con los descritos en el Protocolo.
Estudio de ablación del módulo MV4D
La contribución del módulo MV4D se evaluó añadiendo progresivamente los pares de escaneo zigzag, jerárquico, espiral y radial, seguido por el módulo SFusion Mamba (Tabla 4; Figura 9). Cuando solo se usaba el par de escaneo en zigzag, el rendimiento de segmentación se veía limitado. Añadir el par jerárquico mejoró sustancialmente el rendimiento, lo que indica el beneficio de incorporar información multiescala. La posterior adición de los pares de escaneo espiral y radial mejoró aún más el rendimiento de la segmentación al mejorar la representación de contornos y fronteras. La incorporación del módulo SFusion Mamba resultó en el mayor rendimiento entre las configuraciones evaluadas.
| Modelo | Par de escaneo en zigzag | Par de escaneo jerárquico | Par de escaneo espiral | Par de escaneo radial | SFusion Mamba | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | | | | | 56.75 | 72.46 | 58.03 | 73.45 |
| MVM-UNet | ✓ | ✓ | | | | 72.38 | 84.01 | 73.45 | 84.7 |
| MVM-UNet | ✓ | ✓ | ✓ | | | 75.69 | 86.20 | 76.94 | 86.94 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | | 76.41 | 86.61 | 78.28 | 87.82 |
| MVM-UNet | ✓ | ✓ | ✓ | ✓ | ✓ | 80.94 | 91.32 | 82.47 | 90.65 |
Tabla 4: Estudio de ablación del módulo Multi-View 4-Directional (MV4D). El rendimiento se obtiene incorporando progresivamente los pares jerárquicos, espirales y radiales y el módulo Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base de pares de escaneo en zigzag. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

Figura 9. Estudio de ablación del módulo Multi-View 4-Directional (MV4D). (A) Cambio en la intersección media sobre la unión (mIoU) tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base. (B) Cambio en el Coeficiente de Similitud de Dados (DSC) tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base. (C) Cambio en el mIoU tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base bajo el segundo entorno experimental. (D) Cambio en el DSC tras la incorporación secuencial del par jerárquico de escaneo, par de escaneo espiral, par de escaneo radial y Spatial Fusion Mamba (SFusion Mamba) en la arquitectura base bajo el segundo entorno experimental. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En el conjunto de datos ISIC 2017, el módulo completo MV4D alcanzó un mIoU del 80,94% y un DSC del 91,32%. Las tendencias de rendimiento correspondientes para mIoU y DSC se muestran en la Figura 9A y la Figura 9B, respectivamente. En el conjunto de datos ISIC 2018, el módulo completo MV4D alcanzó un mIoU del 82,47% y un DSC del 90,65%. Las tendencias de rendimiento correspondientes se muestran en la Figura 9C y la Figura 9D, respectivamente.
Salvo que se especifique lo contrario, todos los experimentos de ablación se realizaron utilizando una semilla aleatoria fija de 100, mientras que los principales resultados de la comparación se reportaron como media ± DS sobre tres semillas aleatorias independientes (1, 52 y 100). En consecuencia, los resultados de la ablación pretenden comparar las contribuciones relativas de los componentes individuales bajo un entorno controlado de semilla única, en lugar de reproducir el rendimiento final multisemilla reportado en los experimentos principales de comparación.
En general, incorporar progresivamente los pares de escaneo adicionales y el módulo SFusion Mamba mejoró de forma consistente el rendimiento de segmentación, con la configuración completa de MV4D logrando el mayor rendimiento en ambos conjuntos de datos.
Estudio de ablación del bloque de visión multivista (MVV)
El bloque MVV se evaluó comparando la arquitectura base con una versión que incorpora la rama de proyección Up-Down (Tabla 5). En el conjunto de datos ISIC 2017, la inclusión de la rama de Proyección Up-Down aumentó el mIoU del 78,83% al 80,96% y el DSC del 88,15% al 91,02%. En el conjunto de datos ISIC 2018, el mIoU aumentó del 80,32% al 82,46%, mientras que el DSC pasó del 89,15% al 90,57%.
| Modelo | Bloque base de MVV | Proyección arriba-abajo | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | ✓ | | 78.83 | 88.15 | 80.32 | 89.15 |
| MVM-UNet | ✓ | ✓ | 80.96 | 91.02 | 82.46 | 90.57 |
Tabla 5: Estudio de ablación del bloque de visión multivista (MVV). Comparación de rendimiento del bloque base de Visión Multivista (MVV) con y sin la rama de proyección Up-Down. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.
Los experimentos de ablación por bloque MVV se realizaron utilizando la semilla aleatoria fija de 100. En consecuencia, el rendimiento de la configuración que contiene la rama de Proyección Up-Down refleja la configuración controlada de ablación de semilla única y puede diferir ligeramente del rendimiento medio de tres semillas reportado para el modelo completo MVM-UNet en los experimentos principales de comparación.
En general, la incorporación de la rama de Proyección Up-Down mejoró de forma constante el rendimiento de segmentación en ambos conjuntos de datos, observándose aumentos tanto para mIoU como para DSC.
Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba)
El módulo MFusion Mamba fue evaluado comparando diferentes estrategias de fusión gruesa junto con el componente de fusión fina (Tabla 6; Figura 10). Sin MFusion Mamba, MVM-UNet logró un mIoU del 75,47% y un DSC del 86,01% en el conjunto de datos ISIC 2017, y un mIoU del 77,49% y un DSC del 87,29% en el conjunto ISIC 2018. Entre las estrategias de fusión gruesa evaluadas, el producto de Hadamard logró la mayor mejora. La incorporación del componente de fusión fina aumentó aún más el rendimiento de segmentación. La configuración completa de MFusion Mamba logró un mIoU del 80,95% y un DSC del 91,18% en ISIC 2017, y un mIoU del 82,51% y un DSC del 90,58% en ISIC 2018.
| Modelo | Fusión gruesaMáximo por elemento | Fusión gruesa Adición por elemento | Fusión gruesa Producto Hadamard | Módulo de fusión fina | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | | | | | 75.47 | 86.01 | 77.49 | 87.29 |
| MVM-UNet | ✓ | | | | 76.21 | 86.47 | 78.35 | 87.82 |
| MVM-UNet | | ✓ | | | 76.83 | 86.86 | 79.11 | 88.30 |
| MVM-UNet | | | ✓ | | 78.26 | 87.83 | 80.06 | 88.96 |
| MVM-UNet | | | ✓ | ✓ | 80.95 | 91.18 | 82.51 | 90.58 |
Tabla 6: Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba). Comparación de rendimiento de diferentes estrategias de fusión gruesa, incluyendo fusión máxima (Max), suma elemental (⊕) y producto de Hadamard (⊙), junto con el módulo completo de fusión fina. El rendimiento se informa utilizando la media de intersección sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.

Figura 10. Estudio de ablación del módulo Multi-stage Fusion Mamba (MFusion Mamba). (A) Cambio en la intersección media sobre la unión (mIoU) obtenida utilizando diferentes estrategias de fusión gruesa (máxima suma elemental y producto de Hadamard) y el módulo completo de fusión fina. (B) Cambio en el Coeficiente de Similitud de los Dados (DSC) obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento a elemento y producto de Hadamard) y el módulo completo de Fusión Fina. (C) Cambio en el mIoU obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento por elemento y producto Hadamard) y el módulo completo de fusión fina bajo el segundo entorno experimental. (D) Cambio en el DSC obtenido usando diferentes estrategias de fusión gruesa (sumas máximas, elemento por elemento y producto Hadamard) y en el módulo completo de fusión fina bajo el segundo entorno experimental. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En el conjunto de datos ISIC 2017, la configuración completa de MUsion Mamba alcanzó un mIoU del 80,95% y un DSC del 91,18%. Las tendencias de rendimiento correspondientes para mIoU y DSC se muestran en la Figura 10A y la Figura 10B, respectivamente. En el conjunto de datos ISIC 2018, la configuración completa de MUsion Mamba alcanzó un mIoU del 82,51% y un DSC del 90,58%. Las tendencias de rendimiento correspondientes se muestran en la Figura 10C y la Figura 10D, respectivamente. Los experimentos de ablación MFusion Mamba se realizaron utilizando la semilla aleatoria fija de 100. En consecuencia, la configuración completa de MFusion Mamba representa el resultado controlado de ablación de semilla única y puede diferir ligeramente del rendimiento medio de tres semillas reportado para el modelo completo MVM-UNet en los experimentos principales de comparación.
En general, incorporar progresivamente la estrategia de fusión gruesa de productos de Hadamard y el componente de fusión fina mejoró de forma constante el rendimiento de segmentación, con la configuración completa de MFusion Mamba logrando el mayor rendimiento en ambos conjuntos de datos.
Resumen de los estudios de ablación
A lo largo de los experimentos de ablación, incorporando progresivamente las ramas jerárquicas, espiral y radial de par de escaneo, junto con el módulo SFusion Mamba, mejoró consistentemente el rendimiento de segmentación (Tabla 4; Figura 9). De manera similar, la inclusión de la rama de Proyección Up-Down en el bloque MVV mejoró tanto mIoU como DSC en los conjuntos de datos ISIC 2017 e ISIC 2018 (Tabla 5). La configuración completa de MFusion Mamba también logró el mayor rendimiento entre las estrategias evaluadas de fusión de características multietapa (Tabla 6; Figura 10).
Estudio de ablación de hiperparámetros
Se evaluaron los efectos del tamaño de la entrada y el valor de abandono en los conjuntos de datos ISIC 2017 e ISIC 2018 (Tabla 7). Se compararon tres resoluciones de entrada (256 × 256, 384 × 384 y 512 × 512). Bajo la configuración evaluada, la resolución de entrada 256 × 256 logró el mayor rendimiento de segmentación en ambos conjuntos de datos.
| Modelo | Tamaño de entrada 256 × 256 | Tamaño de entrada: 384 × 384 | Tamaño de entrada: 512 × 512 | Abandono 0.0 | Abandono 0.1 | Dropout 0.2 | Abandono 0.3 | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | | ✓ | | | | ✓ | | 80.02 | 88.91 | 81.76 | 89.92 |
| MVM-UNet | | | ✓ | | | ✓ | | 79.96 | 88.87 | 80.97 | 89.47 |
| MVM-UNet | ✓ | | | ✓ | | | | 77.48 | 87.28 | 78.76 | 88.11 |
| MVM-UNet | ✓ | | | | ✓ | | | 79.36 | 88.53 | 81.13 | 89.62 |
| MVM-UNet | ✓ | | | | | ✓ | | 80.94 | 90.15 | 82.49 | 90.50 |
| MVM-UNet | ✓ | | | | | | ✓ | 79.71 | 88.71 | 80.46 | 89.18 |
Tabla 7: Estudio de ablación del tamaño de la imagen de entrada y el valor de dropout. Comparación de rendimiento de MVM-UNet usando diferentes tamaños de imagen de entrada y valores de dropout. El rendimiento de segmentación se informa utilizando la intersección media sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.
También se evaluaron diferentes valores de abandono. Entre las configuraciones probadas, un valor de abandono de 0,2 logró el mayor rendimiento de segmentación en ambos conjuntos de datos y, por tanto, se utilizó en los experimentos principales.
Estudio de ablación de la configuración de la capa codificador-decodificador
Se evaluaron diferentes configuraciones de capa codificador-decodificador para examinar el efecto de la profundidad de red en el rendimiento de segmentación y el coste computacional (Tabla 8). Entre las configuraciones evaluadas, la arquitectura simétrica {2, 2, 2, 2}-{2, 2, 2, 2} logró el mayor rendimiento global de segmentación manteniendo una complejidad relativamente baja. Aumentar la profundidad de la red a {2, 2, 9, 2}-{2, 9, 2, 2} produjo un rendimiento de segmentación comparable, pero incrementó tanto el número de parámetros como el coste computacional.
| Modelo | Configuración de capa encoder-decoder | Parámetros (M) | FLOPs (G) | ISIC 2017 mIoU (%) | ISIC 2017 DSC (%) | ISIC 2018 mIoU (%) | ISIC 2018 DSC (%) |
| MVM-UNet | {2,2,2,1}-{2,2,2,2} | 28.22 | 4.12 | 80.02 | 88.91 | 81.16 | 89.64 |
| MVM-UNet | {2,2,2,2}-{2,2,2,2} | 28.36 | 4.39 | 80.95 | 90.17 | 82.5 | 90.41 |
| MVM-UNet | {2,2,2,3}-{2,3,2,2} | 30.14 | 4.88 | 79.83 | 88.8 | 81.56 | 89.85 |
| MVM-UNet | {2,4,2,2}-{2,2,4,2} | 33.46 | 5.32 | 79.65 | 88.7 | 81.45 | 89.79 |
| MVM-UNet | {2,2,9,2}-{2,9,2,2} | 45.63 | 7.78 | 80.96 | 90.09 | 82.48 | 90.43 |
Tabla 8: Estudio de ablación de configuraciones de capas codificador-decodificador. Comparación de rendimiento de diferentes configuraciones de capas codificador-decodificador. La tabla informa sobre el número de parámetros del modelo (Parámetros), operaciones en coma flotante (FLOPs), la intersección media sobre la unión (mIoU) y el coeficiente de similitud de dados de dados ISIC 2017 e ISIC 2018.
Comparación de costes computacionales
La eficiencia computacional del modelo final MVM-UNet se comparó con métodos de referencia representativa, incluyendo HResFormer, H-vmunet, MISSFormer, H2Former, MedScale-Former y MCAFT, bajo el mismo entorno hardware y resolución de entrada (Tabla 9). Las métricas evaluadas incluían tiempo de entrenamiento por época, tiempo de inferencia por imagen, uso máximo de memoria GPU durante el entrenamiento, número de parámetros entreenables (Params) y FLOPs. El tiempo de entrenamiento se midió como el tiempo requerido para completar una época de entrenamiento, el tiempo de inferencia como el tiempo medio de procesamiento por imagen de prueba, y los FLOPs se calcularon para un solo pase hacia adelante.
| Método | Árbitro. | Tiempo de entrenamiento (epoca) | Tiempo de inferencia (ms/imagen) | Memoria máxima de la GPU (GB) | Parámetros (M) | FLOPs (G) |
| HResEx | 34 | 520 | 213.08 | 19.2 | 117.00 | 131.70 |
| H-vmunet | 28 | 88 | 27.00 | 5.0 | 10.74 | 8.97 |
| MISSFormer | 30 | 355 | 92.86 | 12.6 | 42.33 | 109.45 |
| H2Former | 12 | 130 | 29.02 | 8.8 | 33.71 | 33.56 |
| MedScale-Former | 35 | 80 | 23.50 | 5.9 | 4.96 | 3.79 |
| MCAFT | 36 | 145 | 34.00 | 8.7 | 30.00 | 12.00 |
| MVM-UNet (Nuestro) | — | 104 | 26.80 | 7.9 | 28.36 | 4.39 |
Tabla 9: Comparación de costes computacionales de MVM-UNet y métodos de referencia representativa. Comparación de la eficiencia computacional bajo el mismo entorno de hardware y resolución de entrada. Las métricas reportadas incluyen el tiempo de entrenamiento por época, el tiempo de inferencia por imagen, el uso máximo de memoria de la unidad de procesamiento gráfico (GPU) durante el entrenamiento, el número de parámetros del modelo (Parámetros) y las operaciones en coma flotante (FLOPs). Los métodos con implementaciones disponibles se evaluaron utilizando el mismo entorno experimental siempre que fue posible.
Como se resume en la Tabla 9, MVM-UNet requería 104 s por época de entrenamiento, 26,8 ms por imagen para inferencia, 7,9 GB de memoria GPU de pico, 28,36 millones de parámetros entrenables y 4,39 GFLOPs. En comparación con HResFormer, MISSFormer, H2Former y MCAFT, MVM-UNet requería menos tiempo de entrenamiento, menor tiempo de inferencia, menor consumo máximo de memoria GPU y menos FLOPs. En comparación con los modelos ligeros H-vmunet y MedScale-Forter, MVM-UNet requirió mayor tiempo de entrenamiento y uso de memoria, pero mantuvo una velocidad de inferencia comparable manteniendo una complejidad computacional relativamente baja.
Disponibilidad de datos y código
Los conjuntos de datos ISIC 2017 e ISIC 2018 están disponibles públicamente a través del archivo de la International Skin Imaging Collaboration (ISIC), y el conjunto de datos Synapse está disponible públicamente desde el repositorio Synapse. Los detalles sobre la adquisición de conjuntos de datos se proporcionan en la declaración de Ética. En resumen, el conjunto de datos ISIC 2017 se obtuvo del repositorio oficial de datos ISIC 2017 Challenge (https://challenge.isic-archive.com/data/#2017), el conjunto de datos ISIC 2018 se obtuvo del repositorio oficial de datos ISIC 2018 Challenge Task 1 (https://challenge.isic-archive.com/data/#2018), y el conjunto de datos Synapse se obtuvo del repositorio Synapse bajo el identificador de acceso syn3193805 (https://www.synapse.org/Synapse:syn3193805). Las fechas de descarga correspondientes se indican en la declaración de Ética. Una versión pública inicial del código fuente MVM-UNet está disponible en https://github.com/LIXUEGUANG002/MVM-UNet. El repositorio incluye la implementación del modelo, módulos principales de red, archivos de configuración, instrucciones de organización de conjuntos de datos, scripts de entrenamiento y scripts de evaluación. El paquete completo de reproducibilidad, que incluye archivos de configuración finalizados, scripts de experimentos completos, documentación adicional y puntos de control de modelos entrenados, estará disponible públicamente en cuanto se publique.
Tabla suplementaria 1. Arquitectura capa por capa de la Multi-view Vision Mamba UNet (MVM-UNet). La tabla resume la arquitectura de red secuencial de MVM-UNet, incluyendo la capa de entrada, incrustación de parches, etapas del codificador, bloques Multi-View Vision (MVV), operaciones de fusión de parches, Multi-stage Fusion Mamba (MFusion Mamba), etapas del decodificador, upsampling final y cabeza de segmentación. Para cada etapa, se listan la operación correspondiente, los parámetros principales y el tamaño de la característica de salida. E1–E4 denotan los mapas de características de etapa codificador usados para la fusión de características en múltiples etapas. B, H y W denotan el tamaño del lote, la altura de la imagen y el ancho de la imagen, respectivamente, y K denota el número de clases de salida (K = 1 para la segmentación binaria de lesiones cutáneas y K = 9 para la segmentación multiclase Synapse, que comprende una clase de fondo y ocho clases de órganos en primer plano). MFusion Mamba genera características de codificador multietapa fusionadas que se integran con las características correspondientes del decodificador durante la reconstrucción del decodificador. Por favor, haga clic aquí para descargar este archivo.
Archivo suplementario 1. Pseudocódigo del módulo Multi-View Four-Directional (MV4D) y Multi-stage Fusion Mamba (MFusion Mamba). El archivo suplementario presenta el flujo de trabajo algorítmico de los dos módulos principales utilizados en MVM-UNet. El algoritmo 1 describe toda la cadena de procesamiento del módulo Multi-View Four-Directional (MV4D), incluyendo aplanamiento de características, construcción de cuatro secuencias de par de escaneo (zigzag, jerárquico, espiral y radial), procesamiento selectivo en espacio de estados (S6), Scan-view Fusion Mamba (SFusion Mamba) y reconstrucción del mapa de características de salida. El algoritmo 2 describe el módulo Multi-stage Fusion Mamba (MFusion Mamba), incluyendo alineación de características del codificador multietapa, fusión gruesa, fusión fina, integración del decodificador y generación de la característica de entrada del decodificador fusionado. Las variables y dimensiones tensoriales se definen dentro de los algoritmos. Por favor, haga clic aquí para descargar este archivo.
Archivo de codificación suplementaria 1. Paquete de código fuente para MVM-UNet (MVM-UNet-master). El archivo suplementario ZIP contiene la implementación completa en código fuente de MVM-UNet utilizada en este estudio. El paquete incluye la arquitectura de red, módulos Multi-View Four-Directional (MV4D) y Multi-stage Fusion Mamba (MFusion Mamba), archivos de configuración, scripts de entrenamiento y evaluación para ISIC 2017, ISIC 2018, y conjuntos de datos Synapse, funciones de utilidad y documentación del proyecto necesarias para reproducir los experimentos descritos en este protocolo. El paquete también incluye el archivo README con instrucciones de instalación, dependencias de software, organización de conjuntos de datos y flujos de trabajo de entrenamiento e inferencia. Por favor, haga clic aquí para descargar este archivo.