Esta investigación se realizó en cumplimiento de las directrices institucionales para la investigación computacional y el procesamiento de datos. No participaron en este estudio sujetos humanos ni animales vertebrados.
Preparación y preprocesamiento del conjunto de datos
Recogida y organización de conjuntos de datos
Se recogieron imágenes dermoscópicas de los conjuntos de datos PH2, ISIC2018 y ISIC2017, con enlaces específicos proporcionados en la Tabla de Materiales. El conjunto de datos PH2 contiene 200 imágenes de alta resolución (1000 × 1000 píxeles), ISIC2018 incluye 2.594 imágenes con las correspondientes máscaras de segmentación y ISIC2017 incluye 2.150 imágenes con máscaras de segmentación. Los datos se organizaron en conjuntos de entrenamiento, validación y prueba siguiendo protocolos estándar, asegurando que las imágenes estén en formatos compatibles (por ejemplo, .jpg, .png o .tiff) e incluyan las correspondientes máscaras de verdad terrestre en formato binario.
Los datos se organizaron en conjuntos de entrenamiento, validación y prueba siguiendo protocolos estándar. Los conjuntos de datos se distribuyeron de la siguiente manera: para ISIC2018, se asignaron 1.815 imágenes para entrenamiento, 259 para validación y 520 para pruebas. Durante ISIC2017, se asignaron 1.500 imágenes para entrenamiento, 220 para validación y 430 para pruebas. Para PH2, el conjunto de datos se dividió en 160 imágenes de entrenamiento, 10 imágenes de validación y 30 imágenes de prueba. Se mantuvo una resolución de imagen constante de 256 × 256 píxeles durante toda la cadena de preprocesamiento.
Aumento y normalización de datos
Se aplicaron técnicas de aumento de datos para mejorar la generalización de modelos. Se implementaron volteretas horizontales, vertiginosas y rotación aleatoria dentro de un rango de ±15°. Se aplicaron corrección gamma y transformación logarítmica con una probabilidad de 0,3 cada una. Los valores de píxeles se normalizaron usando estadísticas de ImageNet (media = [0,485, 0,456, 0,406], desviación estándar = [0,229, 0,224, 0,225]).
Redimensionar todas las imágenes de entrada a 256 × 256 píxeles: Para garantizar la eficiencia computacional, todas las imágenes de entrada se redimensionaron a una resolución uniforme de 256 × 256 píxeles. Aunque las imágenes de alta resolución, como las del conjunto de datos (1000 × 1000 píxeles), contienen detalles finos e información de texturas cruciales para una delimitación precisa de los límites de las lesiones, aumentar la resolución no mejoró significativamente el rendimiento del modelo. Por lo tanto, la resolución no se incrementó para mantener un equilibrio entre la eficiencia computacional y la precisión del modelo. Futuros trabajos podrían investigar más a fondo los efectos de entradas de mayor resolución para determinar si los beneficios en la precisión de segmentación justifican el aumento del coste computacional. Las imágenes se convertían a formato RGB cuando era necesario. Los datos preprocesados se guardaban en directorios estructurados manteniendo las divisiones originales del conjunto de datos.
Implementación de la arquitectura HMP-MUNet
Diseño de arquitectura de red
HMP-MUNet se configuró siguiendo la estructura jerárquica codificador-decodificador en forma de U, como se muestra en la Figura 1. La red estaba configurada con expansión progresiva de canales: 8→16→32→64→128→256 canales a través de los niveles del codificador.
Se realizó un cambio arquitectónico significativo al reducir la profundidad de la red de cuatro niveles jerárquicos a dos, lo que ayuda a simplificar el modelo y mejorar la eficiencia computacional. Aunque la profundidad se reduce, las dimensiones del canal se incrementaron en cada nivel, lo que permitió a la red captar características más ricas y expresivas. Para potenciar aún más el aprendizaje de características del modelo, se introdujeron mecanismos de atención para enfocar la red en las características más relevantes a múltiples escalas. Estos mecanismos de atención compensan eficazmente la posible pérdida de abstracción jerárquica de características debido a la arquitectura más superficial.
El codificador se inicializaba con operaciones duales Conv2D para la extracción inicial de características de los tensores de entrada X(C, H×W). Se implementó la configuración alterna de tres módulos especializados: Esquema de Conmutación Basado en Mamba de Visión de Alto Orden (H-VSS), Red Flexible Paralela Multiprofundidad (PMFlex) y Red de Fusión de Atención Dilatada Multiescala (MSDAFN).
El modelo utiliza estadísticas de ImageNet (media y desviación estándar) para la normalización, evitando la necesidad de recalcular para cada conjunto de datos, mejorando así la eficiencia computacional. Garantiza estabilidad y generalización, aprovechando el extenso uso de ImageNet en tareas de visión por ordenador. Esta elección simplifica el diseño al reducir la complejidad del preprocesamiento y mejora la transferibilidad entre conjuntos de datos, permitiendo que el modelo se generalice eficazmente a diversas imágenes de lesiones cutáneas.
Implementación del esquema de conmutación basado en mamba de visión de alto orden (H-VSS)
El módulo H-VSS se implementó según la arquitectura de la Figura 2. La Normalización de Capa (LN) y la activación Hardswish (HS) se configuraron con conexiones residuales siguiendo la Ecuación (1):

Se implementó el componente de Descriptor Espacial Local (LSD) para mantener la coherencia espacial. El módulo de Escaneo Selectivo Espacial 2D (SS2D) se configuró con patrones de escaneo multidireccional siguiendo la Ecuación (2):

Se añadió procesamiento de Perceptrón Multicapa (MLP) con conexiones residuales según lo especificado en la Ecuación (3):

El mecanismo de Escaneo Selectivo 2D de Alto Orden (H-SS2D) proyecta características de entrada en un espacio bidimensional para un modelado contextual mejorado.
Implementación de red flexible paralela multiprofundidad (PMFlex)
El módulo PMFlex se configuró según las especificaciones de la Figura 3 . La normalización de capa se aplicó a los mapas de características de entrada X(C, H×W), y luego se particionó en cuatro segmentos a lo largo de la dimensión del canal siguiendo la Ecuación (4):

Cada Y_i segmentada de características se procesaba a través de módulos compartidos de Visual Mamba (VMamba). Las salidas procesadas se concatenaron y se aplicó el refinamiento mediante Normalización de Capa y proyección como se describe en la Ecuación (5):

Implementación de la red de fusión de atención dilatada a escala múltiple (MSDAFN)
El módulo MSDAFN se implementó siguiendo la arquitectura de la Figura 4. Las operaciones de convolución paralelas se configuraron con tasas de dilatación de 6, 12 y 18 para la extracción de características a escala múltiple según la Ecuación (6):

Las características multiescala se integraron mediante concatenación de canales según lo especificado en la Ecuación (7):

Se implementaron mecanismos de doble atención para la recalibración de características. Los pesos de atención del canal se calcularon usando la agrupación promedio global siguiendo la Ecuación (8):

La ponderación de atención del canal se aplicó tal y como se describe en la Ecuación (9):

La atención espacial se configuró mediante operaciones de convolución siguiendo la Ecuación (10):

La atención de canal y espacial se combinó según especificado en la Ecuación (11):

Configuración y optimización del entrenamiento
Configuración del entorno
El entorno experimental estaba configurado en un sistema Ubuntu 20.04 con una GPU (32 GB de VRAM). Se instalaron Python 3.8, el framework de aprendizaje profundo (RRID: SCR_018536) y CUDA 11.8. El tamaño de la imagen de entrada se estableció en 256 × 256 píxeles para las tareas de lesiones cutáneas.
Función de pérdida y configuración del optimizador
La función de pérdida BceDice se implementó para optimizar el entrenamiento. El optimizador AdamW estaba configurado con una tasa de aprendizaje inicial de 0,001, tamaño de lote de 8 y 250 épocas de entrenamiento. Se aplicó una disminución de peso de 1 × 10⁻5 para la regularización.
Para la configuración base, este estudio se refiere al trabajo de Liu et al. (2024) sobre el modelo Vmamba, que se utilizó como modelo visual de espacio de estados para la tarea11 de clasificación de imágenes médicas. Las configuraciones y scripts exactos utilizados para implementar Vmamba se basan en su trabajo publicado y se adaptan para este estudio, con ajustes específicos para adaptarse mejor al conjunto de datos de imágenes médicas.
La programación de la velocidad de aprendizaje se configuró usando recocido coseno con reinicios en caliente. Configura T_0 = 10 épocas para el periodo de reinicio inicial, T_mult = 2 para la multiplicación de periodos y η_min = 1 × 10⁻6 para la tasa mínima de aprendizaje.
Optimización de hiperparámetros
Para garantizar la reproducibilidad y consistencia, todos los experimentos se realizaron utilizando una semilla aleatoria fija de 42. La optimización sistemática de los hiperparámetros se llevó a cabo centrándose en el tamaño del lote, la tasa de aprendizaje y la tasa de rutas de caída. Se evaluaron los tamaños de lote 4, 8, 16 y 32. Se probaron las tasas de aprendizaje de 0,0005, 0,001, 0,0015 y 0,002. El rendimiento de validación se monitorizó utilizando el Coeficiente de Similitud de Dados (DSC) como métrica principal. Los tamaños de lote superiores a 8 pueden provocar un desbordamiento de memoria en GPUs con menos de 32 GB de VRAM.
Evaluación de modelos y evaluación del rendimiento
Configuración de métricas de evaluación
Se implementaron métricas de evaluación integrales, incluyendo Intersección Media sobre Unión (mIoU), Coeficiente de Similitud de Dados (DSC), Sensibilidad (Sen), Especificidad (Spe) y Precisión (Acc). Las métricas se calcularon según las siguientes formulaciones:
La intersección media sobre la unión (mIoU) cuantifica la superposición entre la segmentación predicha y la segmentación de la verdad fundamental:

El Coeficiente de Similitud de los Dados (DSC) mide la consistencia de segmentación. Los valores varían de 0 a 1, siendo valores más altos que indican mejor rendimiento:

La sensibilidad (Sen) mide la capacidad del modelo para detectar muestras positivas:

La especificidad S(Spe) evalúa el reconocimiento correcto de muestras negativas:

La precisión (Acc) mide la corrección global de la predicción:

Los parámetros (M) reflejan la complejidad del modelo, midiendo los parámetros totales entrenables:

donde Pi es el número de parámetros en la i-ésima capa, y N es el número total de capas. Un menor número de parámetros indica modelos más ligeros adecuados para su despliegue clínico.
Protocolo del estudio de ablación
Se realizaron estudios exhaustivos de ablación para validar las contribuciones de los componentes arquitectónicos siguiendo el diseño experimental de la Tabla 1. Se evaluaron cuatro variantes arquitectónicas: H-MUNet (línea base sin MSDAFN ni PMFlex), HP-MUNet (sin MSDAFN), HM-MUNet (sin PMFlex) y HMP-MUNet (modelo completo).
Se configuraron parámetros de entrenamiento idénticos en todas las variantes: tasa de aprendizaje 0,001, tamaño de lote 8, 250 épocas. Se monitorizó la convergencia de entrenamiento y se validaron mejoras de rendimiento para cada adición de componentes.
Análisis de eficiencia computacional
Se midieron las métricas de eficiencia computacional, incluyendo el recuento de parámetros, los FLOPs y el tiempo de inferencia entre diferentes arquitecturas. La evaluación del tiempo de inferencia del modelo en una GPU estándar de grado clínico muestra que, aunque funciona mejor en GPUs de alto rendimiento, el modelo es aproximadamente un 70% más lento en hardware más comúnmente utilizado. No obstante, sigue siendo capaz de alcanzar velocidades de inferencia eficientes, lo que lo hace adecuado para su despliegue clínico práctico. Monitoriza el uso de la memoria de la GPU durante el entrenamiento para garantizar la estabilidad del sistema. Mínimo de memoria GPU recomendada para el lote 8.
Validación y análisis
Evaluación de rendimiento
El rendimiento de HMP-MUNet se comparó con métodos de última generación en ambos conjuntos de datos. Todos los modelos comparados se implementaron y entrenaron bajo los mismos protocolos de división de datos, preprocesamiento, aumento de datos y entrenamiento para asegurar que las diferencias de rendimiento se debieran únicamente a diferencias arquitectónicas. Los resultados cuantitativos, incluyendo mejoras en la DSC del 2,89% y 5,25% en los conjuntos de datos ISIC2018 y PH2, fueron documentados respectivamente. El estudio validó que el recuento de parámetros se reduce 4,55 veces en comparación con la línea base de U-Net.
Análisis estadístico
Se realizaron pruebas de significación estadística utilizando pruebas t pareadas para comparar el rendimiento. Se calcularon intervalos de confianza para las métricas reportadas. La reproducibilidad se aseguró mediante múltiples entrenamientos con diferentes semillas aleatorias.
Las configuraciones óptimas de hiperparámetros se registraron como tamaño de lote 8 y tasa de aprendizaje de 0,001, alcanzando un DSC máximo de 0,9585 en el conjunto de datos PH2 y 0,9044 en el conjunto de datos ISIC2018, según documentado en los resultados experimentales. Se aseguraron datos de validación suficientes para evitar el sobreajuste. Se monitorizaron las curvas de pérdida por validación para aplicar criterios de parada temprana.