Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

HMP-MUNet: Un marco híbrido de aprendizaje profundo para la segmentación automatizada de lesiones cutáneas en imágenes dermoscópicas

167 vistas

DOI:

10.3791/69449

17 de marzo de 2026

* These authors contributed equally

En este artículo

Resumen

HMP-MUNet introduce un marco híbrido de aprendizaje profundo para la segmentación automatizada de lesiones cutáneas. Al integrar modelos de espacio de estados con mecanismos de atención multiescala, mejora la precisión de la segmentación mientras optimiza la eficiencia computacional, ofreciendo una solución robusta para el diagnóstico del cáncer de piel en entornos clínicos.

Resumen

Los sistemas de diagnóstico asistido por ordenador para lesiones cutáneas enfrentan desafíos significativos para lograr tanto una alta precisión diagnóstica como eficiencia computacional. Los enfoques actuales de aprendizaje profundo suelen requerir recursos computacionales considerables mientras luchan por capturar las complejas variaciones morfológicas inherentes a las lesiones cutáneas a diferentes escalas. High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), un novedoso marco de aprendizaje profundo que aborda estas limitaciones mediante un diseño arquitectónico innovador que combina modelos de espacio de estados con capacidades avanzadas de procesamiento multiescala.

El enfoque descrito en este estudio integra un marco híbrido U-Net que combina un módulo de espacio de estados de visión de alto orden para la modelización global del contexto, una red de fusión de atención dilatada a múltiples escalas para la extracción jerárquica de características a través de múltiples campos receptivos, y una red flexible paralela de múltiples profundidades para optimización computacional. Esta arquitectura utiliza un codificador-decodificador en forma de U modificado con dimensiones de canal aumentadas y mecanismos avanzados de atención para mejorar el aprendizaje de características.

Una evaluación exhaustiva de conjuntos de datos de referencia muestra un coeficiente de similitud de Dice del 95,85% en PH2 y del 90,44% en ISIC2018. El modelo logra esta precisión superior utilizando solo 7,61 millones de parámetros, lo que representa una reducción notable del 72,2% en comparación con las arquitecturas existentes de Vision Mamba, manteniendo una alta precisión de segmentación. El diseño ligero muestra potencial para su despliegue en diversos entornos clínicos y modalidades de imagen, pendiente de validación clínica, desde centros dermatológicos especializados hasta centros de atención primaria.

HMP-MUNet ofrece una solución automatizada para la segmentación de lesiones cutáneas que mejora la consistencia diagnóstica y apoya los flujos de trabajo clínicos, con potencial para una validación adicional en el uso clínico. La integración de capacidades de modelado de alto nivel con consideraciones prácticas de despliegue ofrece una solución potencial para mejorar los protocolos de cribado del cáncer de piel y ampliar la accesibilidad sanitaria en aplicaciones de diagnóstico asistido por ordenador.

Introducción

Los sistemas de diagnóstico asistido por ordenador (CAD) tienen como objetivo mejorar las prácticas de imagen médica en todas las especialidades clínicas, mejorando la detección, el diagnóstico y los enfoques de planificación del tratamientode enfermedades. En dermatología, la integración de la inteligencia artificial (IA) y técnicas avanzadas de imagen ha surgido como una herramienta fundamental para mejorar la precisión diagnóstica y los resultados clínicos, especialmente en la detección precoz del cáncer de piel, que representa aproximadamente el 90% de todas las malignidadescutáneas 2. El desarrollo de sofisticados enfoques algorítmicos para el análisis automatizado de lesiones cutáneas contribuye al avance de la medicina de precisión, permitiendo un soporte diagnóstico estandarizado y reproducible que mejora la toma de decisiones clínicas en diversos entornos sanitarios 3,4.

La imagen dermatológica moderna abarca múltiples modalidades, incluyendo dermoscopia, fotografía digital, tomografía de coherencia óptica y sistemas de imagenmultiespectral. Los profesionales médicos utilizan imágenes dermoscópicas para diagnosticar manualmente el cáncer de piel mediante métodos laboriosos y que requieren mucho tiempo y que requieren una gran experiencia6. El reto de mantener la consistencia diagnóstica en diferentes entornos clínicos y condiciones de imagen ha impulsado el desarrollo de sistemas CAD que proporcionan un análisis objetivo y cuantitativo de las lesiones cutáneas. La segmentación de lesiones cutáneas a partir de imágenes dermoscópicas constituye un paso fundamental de preprocesamiento que afecta directamente a la precisión posterior de la clasificación y a la utilidadclínica 7. Generalmente, el diagnóstico asistido por ordenador del cáncer de piel implica cinco pasos: adquisición de imágenes, preprocesado, segmentación, extracción de características yclasificación 8. La delimitación precisa de los límites es esencial para una caracterización precisa de las lesiones, permitiendo a los clínicos evaluar características morfológicas como asimetría, irregularidad de los bordes, variación de color y diámetro, parámetros clave en los criterios diagnósticosestablecidos 9.

La aparición de los Modelos de Espacio de Estados (SSMs), especialmente la arquitectura Mamba, ofrece complejidad computacional lineal, mejorando la eficiencia computacional mientras mantiene capacidades superiores de modelado de dependencias a largoalcance 10. Los avances recientes en la segmentación de lesionescutáneas 11, como U-Net9, Att-UNet12, UTNetV213 y UNet++14 , han demostrado mejoras notables en la precisión de la segmentación. Por ejemplo, U-Net alcanza un coeficiente de similitud de dados (DSC) del 87,55% en el conjunto de datos ISIC2018, mientras que UNet++ alcanza el 87,83% y Att-UNet el 87,91%. En el conjunto de datos PH2, U-Net alcanza un DSC del 90,6%, mientras que C2SDG15 ySCR-Net 16alcanzan un 90,3% y 89,89%, respectivamente. HMP-MUNet mejora estos modelos integrando un mecanismo de atención multiescala y capacidades de procesamiento paralelo, reduciendo el conteo de parámetros en un 72,2% y logrando una precisión superior con un DSC del 95,85% en el conjunto de datos PH2 y 90,44% en el conjunto de datos ISIC2018. Dada la importancia de equilibrar las capacidades de aprendizaje por representación visual con el consumo de recursos informáticos, explorar arquitecturas genéricas de clasificación de imágenes médicas que logren compensaciones óptimas es significativo para el desarrollo de sistemas de diagnóstico clínicointeligente 17. El marco estructurado de SSMs espaciales mejora las arquitecturas tradicionales Mamba optimizando matrices de transición de estado, mejorando la eficiencia computacional y reduciendo la sobrecarga de memoria—características esenciales para el despliegue clínico en diversas modalidadesde imagen 18.

Investigaciones recientes demuestran que las arquitecturas Vision Mamba, especialmente aquellas que utilizan el Esquema de Conmutación basado en Vision Mamba de Alto Orden (H-VSS), logran un rendimiento superior con un número significativamente reducido de parámetros en comparación con los transformadores convencionales, lo que las hace especialmente adecuadas para la integración de flujos de trabajoclínicos 19. Sin embargo, las implementaciones existentes de Vision Mamba enfrentan desafíos, incluyendo limitaciones en el consumo de memoria y restricciones de escalabilidad bajo condiciones clínicasde despliegue 20. Los métodos actuales de segmentación de imágenes médicas se dividen generalmente en CNN y modelos basados en transformadores, donde las CNN tradicionales están limitadas por restricciones de campo receptivo, lo que dificulta la captura de dependencias a largo alcance21. En la imagen médica, distinguir regiones críticas como las lesiones de la piel sana requiere alta precisión, lo que requiere la adopción de soluciones tecnológicas avanzadas para abordar estosdesafíos 22. Las arquitecturas de segmentación contemporáneas han evolucionado para atender requisitos clínicos específicos, incluyendo eficiencia computacional para aplicaciones en tiempo real, precisión para tareas diagnósticas críticas y robustez a través de diversos protocolosde imagen 23. Variantes avanzadas de U-Net que incorporan mecanismos de atención, estrategias de fusión de características a múltiples escalas y codificadores basados en transformadores han demostrado un rendimiento superior en escenarios complejos de imagenmédica 12,24. Estas innovaciones arquitectónicas mejoran directamente las aplicaciones clínicas al permitir la delimitación precisa de estructuras anatómicas, la identificación de regiones patológicas y la extracción de biomarcadores cuantitativos, todos ellos cruciales para la medicina basada en la evidencia25,26. Sin embargo, los desafíos de integración, incluyendo la compatibilidad de interfaces con los registros médicos electrónicos (EMR) existentes, el almacenamiento y recuperación de imágenes grandes y la interoperabilidad entre diferentes sistemas institucionales, siguen siendo obstáculos significativos para la adopción clínicageneralizada 27.

Este artículo presenta High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), un novedoso sistema CAD diseñado específicamente para la segmentación automatizada de lesiones cutáneas en la práctica clínica. El marco aborda aquí las carencias críticas en los sistemas actuales de imagen médica incorporando componentes arquitectónicos innovadores: la Red de Fusión de Atención Dilatada Multiescala (MSDAFN) y la Red Flexible Paralela Multiprofundidad (PMFlex). El MSDAFN implementa estrategias sofisticadas de extracción de características que combinan mecanismos de atención espacial y canalizada con convoluciones dilatadas a múltiples escalas, permitiendo una detección mejorada de características sutiles de lesiones en diferentes escalas, algo crucial para un diagnóstico preciso de los distintos tipos de lesiones encontradas en la prácticaclínica 28. El PMFlex introduce capacidades de procesamiento paralelo que permiten el análisis simultáneo de múltiples flujos de entrada, mejorando significativamente la eficiencia computacional mientras mantiene capacidades de modelado de alto orden esenciales para la precisión de gradoclínico 29. HMP-MUNet, a través de sus innovadoras técnicas de segmentación y estrategias computacionales, pretende ampliar los límites del diagnóstico del cáncer de piel, permitiendo un diagnóstico clínico precisoy en tiempo real 30,31.

Las principales contribuciones de esta investigación se alinean con los objetivos principales de avanzar en la CAD en imagen médica: mejoramiento del modelado global del contexto mediante MSDAFN, mejora de la extracción de características y la eficiencia de la fusión para una localización precisa de lesiones en diversas presentaciones clínicas; procesamiento paralelo eficiente mediante PMFlex reduciendo la sobrecarga computacional manteniendo la precisión de nivel clínico, facilitando el despliegue en entornos clínicos con recursos limitados; optimización del despliegue clínico mediante diseño consciente del hardware que permite un procesamiento eficiente de imágenes dermoscópicas de alta resolución que apoyan flujos de trabajo clínicos en tiempo real; Rendimiento clínico demostrado mediante evaluación integral de conjuntos de datos estándar con métricas de rendimiento adecuadas para la integración clínica; y solución diagnóstica integrada que combina modelado de alto orden, análisis multiescala y computación paralela, proporcionando soluciones integrales para un diagnóstico dermatológico de precisión. Esta investigación impulsa la imagen médica informatizada al ofrecer soluciones innovadoras y clínicamente aplicables que abordan tanto los requisitos tecnológicos como prácticos para el análisis automatizado de lesiones cutáneas en entornos sanitarios contemporáneos.

El marco está diseñado para gestionar imágenes dermoscópicas de alta resolución, normalmente con resoluciones de entrada de 256 × 256, proporcionando un equilibrio entre eficiencia computacional y detalle de imagen. Sin embargo, la variabilidad en el equipo y la calidad de imagen, como diferencias en la iluminación, el tono de piel y la presencia de cabello, puede afectar al rendimiento de la segmentación. A pesar de estos desafíos, el diseño del sistema está optimizado para flujos de trabajo clínicos en tiempo real y es adaptable a diferentes dispositivos de imagen, garantizando un rendimiento robusto en diversos entornos clínicos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Esta investigación se realizó en cumplimiento de las directrices institucionales para la investigación computacional y el procesamiento de datos. No participaron en este estudio sujetos humanos ni animales vertebrados.

Preparación y preprocesamiento del conjunto de datos

Recogida y organización de conjuntos de datos

Se recogieron imágenes dermoscópicas de los conjuntos de datos PH2, ISIC2018 y ISIC2017, con enlaces específicos proporcionados en la Tabla de Materiales. El conjunto de datos PH2 contiene 200 imágenes de alta resolución (1000 × 1000 píxeles), ISIC2018 incluye 2.594 imágenes con las correspondientes máscaras de segmentación y ISIC2017 incluye 2.150 imágenes con máscaras de segmentación. Los datos se organizaron en conjuntos de entrenamiento, validación y prueba siguiendo protocolos estándar, asegurando que las imágenes estén en formatos compatibles (por ejemplo, .jpg, .png o .tiff) e incluyan las correspondientes máscaras de verdad terrestre en formato binario.

Los datos se organizaron en conjuntos de entrenamiento, validación y prueba siguiendo protocolos estándar. Los conjuntos de datos se distribuyeron de la siguiente manera: para ISIC2018, se asignaron 1.815 imágenes para entrenamiento, 259 para validación y 520 para pruebas. Durante ISIC2017, se asignaron 1.500 imágenes para entrenamiento, 220 para validación y 430 para pruebas. Para PH2, el conjunto de datos se dividió en 160 imágenes de entrenamiento, 10 imágenes de validación y 30 imágenes de prueba. Se mantuvo una resolución de imagen constante de 256 × 256 píxeles durante toda la cadena de preprocesamiento.

Aumento y normalización de datos

Se aplicaron técnicas de aumento de datos para mejorar la generalización de modelos. Se implementaron volteretas horizontales, vertiginosas y rotación aleatoria dentro de un rango de ±15°. Se aplicaron corrección gamma y transformación logarítmica con una probabilidad de 0,3 cada una. Los valores de píxeles se normalizaron usando estadísticas de ImageNet (media = [0,485, 0,456, 0,406], desviación estándar = [0,229, 0,224, 0,225]).

Redimensionar todas las imágenes de entrada a 256 × 256 píxeles: Para garantizar la eficiencia computacional, todas las imágenes de entrada se redimensionaron a una resolución uniforme de 256 × 256 píxeles. Aunque las imágenes de alta resolución, como las del conjunto de datos (1000 × 1000 píxeles), contienen detalles finos e información de texturas cruciales para una delimitación precisa de los límites de las lesiones, aumentar la resolución no mejoró significativamente el rendimiento del modelo. Por lo tanto, la resolución no se incrementó para mantener un equilibrio entre la eficiencia computacional y la precisión del modelo. Futuros trabajos podrían investigar más a fondo los efectos de entradas de mayor resolución para determinar si los beneficios en la precisión de segmentación justifican el aumento del coste computacional. Las imágenes se convertían a formato RGB cuando era necesario. Los datos preprocesados se guardaban en directorios estructurados manteniendo las divisiones originales del conjunto de datos.

Implementación de la arquitectura HMP-MUNet

Diseño de arquitectura de red

HMP-MUNet se configuró siguiendo la estructura jerárquica codificador-decodificador en forma de U, como se muestra en la Figura 1. La red estaba configurada con expansión progresiva de canales: 8→16→32→64→128→256 canales a través de los niveles del codificador.

Se realizó un cambio arquitectónico significativo al reducir la profundidad de la red de cuatro niveles jerárquicos a dos, lo que ayuda a simplificar el modelo y mejorar la eficiencia computacional. Aunque la profundidad se reduce, las dimensiones del canal se incrementaron en cada nivel, lo que permitió a la red captar características más ricas y expresivas. Para potenciar aún más el aprendizaje de características del modelo, se introdujeron mecanismos de atención para enfocar la red en las características más relevantes a múltiples escalas. Estos mecanismos de atención compensan eficazmente la posible pérdida de abstracción jerárquica de características debido a la arquitectura más superficial.

El codificador se inicializaba con operaciones duales Conv2D para la extracción inicial de características de los tensores de entrada X(C, H×W). Se implementó la configuración alterna de tres módulos especializados: Esquema de Conmutación Basado en Mamba de Visión de Alto Orden (H-VSS), Red Flexible Paralela Multiprofundidad (PMFlex) y Red de Fusión de Atención Dilatada Multiescala (MSDAFN).

El modelo utiliza estadísticas de ImageNet (media y desviación estándar) para la normalización, evitando la necesidad de recalcular para cada conjunto de datos, mejorando así la eficiencia computacional. Garantiza estabilidad y generalización, aprovechando el extenso uso de ImageNet en tareas de visión por ordenador. Esta elección simplifica el diseño al reducir la complejidad del preprocesamiento y mejora la transferibilidad entre conjuntos de datos, permitiendo que el modelo se generalice eficazmente a diversas imágenes de lesiones cutáneas.

Implementación del esquema de conmutación basado en mamba de visión de alto orden (H-VSS)                

El módulo H-VSS se implementó según la arquitectura de la Figura 2. La Normalización de Capa (LN) y la activación Hardswish (HS) se configuraron con conexiones residuales siguiendo la Ecuación (1):

figure-protocol-1

Se implementó el componente de Descriptor Espacial Local (LSD) para mantener la coherencia espacial. El módulo de Escaneo Selectivo Espacial 2D (SS2D) se configuró con patrones de escaneo multidireccional siguiendo la Ecuación (2):

figure-protocol-2

Se añadió procesamiento de Perceptrón Multicapa (MLP) con conexiones residuales según lo especificado en la Ecuación (3):

figure-protocol-3

El mecanismo de Escaneo Selectivo 2D de Alto Orden (H-SS2D) proyecta características de entrada en un espacio bidimensional para un modelado contextual mejorado.

Implementación de red flexible paralela multiprofundidad (PMFlex)

El módulo PMFlex se configuró según las especificaciones de la Figura 3 . La normalización de capa se aplicó a los mapas de características de entrada X(C, H×W), y luego se particionó en cuatro segmentos a lo largo de la dimensión del canal siguiendo la Ecuación (4):

figure-protocol-4

Cada Y_i segmentada de características se procesaba a través de módulos compartidos de Visual Mamba (VMamba). Las salidas procesadas se concatenaron y se aplicó el refinamiento mediante Normalización de Capa y proyección como se describe en la Ecuación (5):

figure-protocol-5

Implementación de la red de fusión de atención dilatada a escala múltiple (MSDAFN)

El módulo MSDAFN se implementó siguiendo la arquitectura de la Figura 4. Las operaciones de convolución paralelas se configuraron con tasas de dilatación de 6, 12 y 18 para la extracción de características a escala múltiple según la Ecuación (6):

figure-protocol-6

Las características multiescala se integraron mediante concatenación de canales según lo especificado en la Ecuación (7):

figure-protocol-7

Se implementaron mecanismos de doble atención para la recalibración de características. Los pesos de atención del canal se calcularon usando la agrupación promedio global siguiendo la Ecuación (8):

figure-protocol-8

La ponderación de atención del canal se aplicó tal y como se describe en la Ecuación (9):

figure-protocol-9

La atención espacial se configuró mediante operaciones de convolución siguiendo la Ecuación (10):

figure-protocol-10

La atención de canal y espacial se combinó según especificado en la Ecuación (11):

figure-protocol-11

Configuración y optimización del entrenamiento

Configuración del entorno

El entorno experimental estaba configurado en un sistema Ubuntu 20.04 con una GPU (32 GB de VRAM). Se instalaron Python 3.8, el framework de aprendizaje profundo (RRID: SCR_018536) y CUDA 11.8. El tamaño de la imagen de entrada se estableció en 256 × 256 píxeles para las tareas de lesiones cutáneas.

Función de pérdida y configuración del optimizador

La función de pérdida BceDice se implementó para optimizar el entrenamiento. El optimizador AdamW estaba configurado con una tasa de aprendizaje inicial de 0,001, tamaño de lote de 8 y 250 épocas de entrenamiento. Se aplicó una disminución de peso de 1 × 10⁻5 para la regularización.

Para la configuración base, este estudio se refiere al trabajo de Liu et al. (2024) sobre el modelo Vmamba, que se utilizó como modelo visual de espacio de estados para la tarea11 de clasificación de imágenes médicas. Las configuraciones y scripts exactos utilizados para implementar Vmamba se basan en su trabajo publicado y se adaptan para este estudio, con ajustes específicos para adaptarse mejor al conjunto de datos de imágenes médicas.

La programación de la velocidad de aprendizaje se configuró usando recocido coseno con reinicios en caliente. Configura T_0 = 10 épocas para el periodo de reinicio inicial, T_mult = 2 para la multiplicación de periodos y η_min = 1 × 10⁻6 para la tasa mínima de aprendizaje.

Optimización de hiperparámetros

Para garantizar la reproducibilidad y consistencia, todos los experimentos se realizaron utilizando una semilla aleatoria fija de 42. La optimización sistemática de los hiperparámetros se llevó a cabo centrándose en el tamaño del lote, la tasa de aprendizaje y la tasa de rutas de caída. Se evaluaron los tamaños de lote 4, 8, 16 y 32. Se probaron las tasas de aprendizaje de 0,0005, 0,001, 0,0015 y 0,002. El rendimiento de validación se monitorizó utilizando el Coeficiente de Similitud de Dados (DSC) como métrica principal. Los tamaños de lote superiores a 8 pueden provocar un desbordamiento de memoria en GPUs con menos de 32 GB de VRAM.

Evaluación de modelos y evaluación del rendimiento

Configuración de métricas de evaluación

Se implementaron métricas de evaluación integrales, incluyendo Intersección Media sobre Unión (mIoU), Coeficiente de Similitud de Dados (DSC), Sensibilidad (Sen), Especificidad (Spe) y Precisión (Acc). Las métricas se calcularon según las siguientes formulaciones:

La intersección media sobre la unión (mIoU) cuantifica la superposición entre la segmentación predicha y la segmentación de la verdad fundamental:

figure-protocol-12

El Coeficiente de Similitud de los Dados (DSC) mide la consistencia de segmentación. Los valores varían de 0 a 1, siendo valores más altos que indican mejor rendimiento:

figure-protocol-13

La sensibilidad (Sen) mide la capacidad del modelo para detectar muestras positivas:

figure-protocol-14

La especificidad S(Spe) evalúa el reconocimiento correcto de muestras negativas:

figure-protocol-15

La precisión (Acc) mide la corrección global de la predicción:

figure-protocol-16

Los parámetros (M) reflejan la complejidad del modelo, midiendo los parámetros totales entrenables:

figure-protocol-17

donde Pi es el número de parámetros en la i-ésima capa, y N es el número total de capas. Un menor número de parámetros indica modelos más ligeros adecuados para su despliegue clínico.

Protocolo del estudio de ablación

Se realizaron estudios exhaustivos de ablación para validar las contribuciones de los componentes arquitectónicos siguiendo el diseño experimental de la Tabla 1. Se evaluaron cuatro variantes arquitectónicas: H-MUNet (línea base sin MSDAFN ni PMFlex), HP-MUNet (sin MSDAFN), HM-MUNet (sin PMFlex) y HMP-MUNet (modelo completo).

Se configuraron parámetros de entrenamiento idénticos en todas las variantes: tasa de aprendizaje 0,001, tamaño de lote 8, 250 épocas. Se monitorizó la convergencia de entrenamiento y se validaron mejoras de rendimiento para cada adición de componentes.

Análisis de eficiencia computacional

Se midieron las métricas de eficiencia computacional, incluyendo el recuento de parámetros, los FLOPs y el tiempo de inferencia entre diferentes arquitecturas. La evaluación del tiempo de inferencia del modelo en una GPU estándar de grado clínico muestra que, aunque funciona mejor en GPUs de alto rendimiento, el modelo es aproximadamente un 70% más lento en hardware más comúnmente utilizado. No obstante, sigue siendo capaz de alcanzar velocidades de inferencia eficientes, lo que lo hace adecuado para su despliegue clínico práctico. Monitoriza el uso de la memoria de la GPU durante el entrenamiento para garantizar la estabilidad del sistema. Mínimo de memoria GPU recomendada para el lote 8.

Validación y análisis

Evaluación de rendimiento

El rendimiento de HMP-MUNet se comparó con métodos de última generación en ambos conjuntos de datos. Todos los modelos comparados se implementaron y entrenaron bajo los mismos protocolos de división de datos, preprocesamiento, aumento de datos y entrenamiento para asegurar que las diferencias de rendimiento se debieran únicamente a diferencias arquitectónicas. Los resultados cuantitativos, incluyendo mejoras en la DSC del 2,89% y 5,25% en los conjuntos de datos ISIC2018 y PH2, fueron documentados respectivamente. El estudio validó que el recuento de parámetros se reduce 4,55 veces en comparación con la línea base de U-Net.

Análisis estadístico

Se realizaron pruebas de significación estadística utilizando pruebas t pareadas para comparar el rendimiento. Se calcularon intervalos de confianza para las métricas reportadas. La reproducibilidad se aseguró mediante múltiples entrenamientos con diferentes semillas aleatorias.

Las configuraciones óptimas de hiperparámetros se registraron como tamaño de lote 8 y tasa de aprendizaje de 0,001, alcanzando un DSC máximo de 0,9585 en el conjunto de datos PH2 y 0,9044 en el conjunto de datos ISIC2018, según documentado en los resultados experimentales. Se aseguraron datos de validación suficientes para evitar el sobreajuste. Se monitorizaron las curvas de pérdida por validación para aplicar criterios de parada temprana.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Diseño de la arquitectura HMP-MUNet para segmentación de imágenes médicas

La arquitectura propuesta de HMP-MUNet demostró un rendimiento excepcional en tareas automatizadas de segmentación cutánea de lesiones. La Figura 1 ilustra la arquitectura completa de la red, mostrando la estructura jerárquica codificador-decodificador en forma de U con expansión progresiva del canal de 8 a 256 canales. La integración de tre...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio presenta HMP-MUNet (High-order Multi-scale Parallel Vision Mamba U-Net), un novedoso marco de aprendizaje profundo que aborda desafíos fundamentales en el diagnóstico asistido por ordenador (CAD) para la segmentación de lesiones cutáneas mediante la integración innovadora de Modelos de Estado-Espacio (SSM) con componentes arquitectónicosavanzados 1. El enfoque descrito aquí demuestra que combinar mecanismos de interacción de características de alto or...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no tienen conflictos de interés relacionados con esta investigación. No existen relaciones financieras entre los autores y cualquier entidad comercial que pudiera influir inapropiadamente en la obra presentada en este manuscrito. Esta investigación se realizó de forma independiente, y los hallazgos y conclusiones son únicamente responsabilidad de los autores. El texto de este manuscrito fue revisado y pulido con la ayuda de ChatGPT, ya que el inglés no es la lengua materna de los autores. Los autores confirman que el uso de la asistencia de IA se limitó a la edición de idiomas y no implicó ninguna generación o análisis de contenido que pudiera afectar la integridad científica del trabajo.

Agradecimientos

Los autores agradecen el apoyo financiero proporcionado por el Proyecto de Investigación Científica del Departamento de Educación de la Provincia de Liaoning bajo la LJ212510149013 de Subvenciones y el Programa General de la Fundación Nacional de Ciencias Naturales de la Provincia de Liaoning 2024-MSLH-377, que hizo posible esta investigación. Agradecemos a los participantes e instituciones de la investigación que contribuyeron a los conjuntos de datos públicos utilizados en este estudio, que permitieron una validación integral de nuestra metodología propuesta.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CUDA 11.8NVIDIA Corporation, Santa Clara, CA, EE. UU.Software
GPU (32 GB VRAM)NVIDIASistema operativo
ISIC2017 Conjunto de datosReto ISIChttps://challenge.isic-archive.com/dataConjuntos de datos
ISIC2018 Conjunto de datosReto ISIChttps://challenge.isic-archive.com/dataConjuntos de datos
NVIDIA V100 GPUNVIDIA Corporation, Santa Clara, CA, EE. UU.Hardware
Conjunto de datos PH2Universidade Do Portohttps://www.fc.up.pt/addi/ph2Conjuntos de datos
Python 3.8PythonRRID:SCR_018536Software
PyTorch 1.13.0PyTorchRRID:SCR_018536Software
Ubuntu 20.04CanónicoHardware

Referencias

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Arquitectura U Netmodelos de espacio de estadosprocesamiento multiescalamecanismos de atenci ndiagn stico asistido por computadoraextracci n de caracter sticasVision Mamba