Artículo de método

MixKNet: Una red modificada en forma de U con convolución de canales híbridos para la segmentación de imágenes médicas

DOI:

10.3791/68450

15 de julio de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta una variante ligera de U-Net con una precisión de segmentación mejorada utilizando convolución híbrida y atención de canal, logrando resultados de última generación en MoNuseg y GlaS con menos parámetros.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La tecnología de procesamiento de imágenes por computadora basada en redes neuronales artificiales se ha desarrollado rápidamente en los últimos años y ha encontrado aplicaciones generalizadas en múltiples campos. En el procesamiento de imágenes médicas, UNet y sus variantes han demostrado un gran éxito en las tareas de detección de lesiones, segmentación celular y segmentación de pólipos. Esta investigación presenta una red modificada en forma de U con parámetros de red reducidos logrados mediante la disminución de la profundidad de la red y el aumento de los canales de red para mejorar la capacidad de aprendizaje del modelo. Para contrarrestar la reducción de la capacidad de aprendizaje causada por la compresión de profundidad, se introduce un módulo convolucional de canal híbrido para reemplazar el módulo convolucional de la red original. El modelo introduce un mecanismo de atención de canal entre la capa y la capa de convolución de puntos para mejorar la capacidad práctica de extracción de características de canal. El artículo también concluye que el uso de la convolución de profundidad mixta puede resolver eficazmente el intervalo de tamaño del objetivo de segmentación, lo que dificulta que un modelo sea adecuado para múltiples conjuntos de datos. El modelo propuesto logra resultados de última generación en dos conjuntos de datos públicos populares, MoNuseg y GlaS, con un aumento medio de dados del 1,0% y el 1,37%, respectivamente. Los parámetros totales del modelo modificado se reducen a 1,71M, lo que representa una reducción de 38,6x en comparación con UCtransNet, con 65,6M de parámetros.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentación de imágenes médicas es fundamental en diversas aplicaciones clínicas, como el diagnóstico, la planificación del tratamiento y el seguimiento de enfermedades. Los métodos tradicionales de procesamiento de imágenes basados en algoritmos de ingeniería de características ya no son adecuados para manejar los grandes volúmenes de datos generados en los entornos sanitarios modernos. Afortunadamente, el avance de la tecnología de redes neuronales artificiales y las mejoras en las capacidades del hardware de las computadoras han hecho posible entrenar e implementar modelos de redes neuronales a gran escala. Como resultado, los algoritmos de procesamiento de visión artificial basados en modelos de aprendizaje automático se desarrollan y aplican continuamente en diversos campos.

La estructura del modelo más representativa en la segmentación semántica de imágenes médicas es UNet1 con una arquitectura de codificación-decodificación. En primer lugar, el modelo utiliza un codificador de varios niveles para extraer características de diferentes escalas de la imagen de entrada. A continuación, el decodificador realiza un muestreo paso a paso mientras combina las características semánticas emitidas por el codificador del nivel correspondiente como una conexión de omisión. Sin embargo, el rendimiento de la arquitectura UNet se puede mejorar aún más mediante la aplicación de varios métodos. Por ejemplo, se ha demostrado que los mecanismos de atención son eficaces para mejorar el rendimiento de las redes neuronales convolucionales. Estos mecanismos pueden enfatizar selectivamente las características esenciales de los datos de entrada, lo que conduce a un mejor aprendizaje de la representación y la precisión de la segmentación.

En la actualidad, muchos investigadores se centran en fusionar eficazmente las características extraídas por el codificador en la etapa de decodificación. Algunas de las variantes más comunes de UNet incluyen Attention UNet2, Recurrent UNet3 y V-Net4. Estos enfoques emplean mecanismos de atención5, como la atención espacial, para resaltar las regiones informativas de los mapas de características y suprimir las regiones no informativas. Además, algunas variantes incorporan redes neuronales recurrentes para modelar la naturaleza secuencial de las imágenes médicas y mejorar las representaciones de características. Los modelos de preentrenamiento, como VGG6, ResNet7 y DenseNet8, se han utilizado ampliamente para mejorar el rendimiento de las redes en forma de U aprovechando su rico conocimiento aprendido de conjuntos de datos a gran escala. Además, se han introducido mecanismos de transformación, como la autoatención y la atención multicabezal, en las dependencias de modelos de largo alcance y capturan información contextual global, lo que conduce a un mejor rendimiento de la segmentación.

Sin embargo, aunque estas variantes han mejorado con respecto al UNet1 original, todavía tienen ciertas limitaciones en el manejo de imágenes médicas complejas con diferentes escalas y formas. Además, la mayor complejidad de estas variantes a menudo conduce a mayores costos computacionales y tiempos de entrenamiento más largos, lo que limita su aplicabilidad en entornos prácticos.

Para mejorar la arquitectura UNet1 , se propone un modelo modificado denominado MixKNet (Mix Kernel Size U-shape Net), que reduce la profundidad de la red al tiempo que aumenta el número de canales para mejorar la capacidad de aprendizaje. Sin embargo, la reducción de la profundidad puede provocar una disminución del rendimiento general. Para mitigar este problema, se introduce un módulo convolucional de canal híbrido, que reemplaza el módulo neuronal convolucional original. Este módulo incorpora un mecanismo de atención de canal entre las capas de convolución en profundidad y punto, con el objetivo de fortalecer la capacidad del modelo para extraer características de canal efectivas.

Para guiar la aplicabilidad práctica, es importante señalar que el método propuesto se evaluó en conjuntos de datos de imágenes médicas a escala relativamente pequeña, con resoluciones de imagen individuales que oscilan entre 500 × 500 y 1000 × 1000 píxeles. Para el entrenamiento del modelo, se cambió el tamaño de todas las imágenes a 224 × 224 píxeles. La implementación se llevó a cabo utilizando PyTorch en una sola GPU NVIDIA RTX 3090. Estos parámetros operacionales sugieren que el método es computacionalmente factible para configuraciones experimentales moderadas y adaptable a tamaños de conjuntos de datos limitados.

En conclusión, este artículo presenta una modificación novedosa de la estructura de red en forma de U e introduce un módulo de convolución de canal híbrido junto con un mecanismo de atención de canal, los cuales mejoran el rendimiento de la segmentación en conjuntos de datos de imágenes médicas. Las principales contribuciones de este trabajo son las siguientes: (1) Proponer una estructura de red modificada en forma de U con un módulo de convolución híbrido de conocimiento profundo que reemplaza al módulo neuronal convolucional original. (2) Introducción de un mecanismo de atención de canal entre la capa de convolución de referencia profunda y la capa de convolución de observación puntual para mejorar la capacidad efectiva de extracción de características de canal del modelo. (3) Lograr resultados de última generación simultáneamente en dos conjuntos de datos públicos populares en el conjunto de datos de segmentación nuclear MoNuseg9 con significativamente menos parámetros del modelo (en comparación con UCtransNet10 con 64 millones de parámetros) y un rendimiento mejorado en el conjunto de datos de segmentación de glándulas GlaS11 .

El resto de este artículo está organizado de la siguiente manera. El paso 2 proporciona una revisión exhaustiva de estudios previos sobre UNet1 y sus variaciones en la segmentación de imágenes médicas. Se examinan las fortalezas y limitaciones de los enfoques existentes, junto con el trabajo relacionado con los mecanismos de atención, las redes convolucionales de profundidad mixta y sus aplicaciones en modelos de segmentación. En el paso 3 se detalla la arquitectura del modelo MixKNet propuesto, incluidas las modificaciones en la estructura de UNet, la integración de un mecanismo de atención de canal y el uso de la convolución de profundidad mixta. En el paso 4 se presentan los resultados de experimentos extensos, acompañados de una discusión y un estudio de ablación para evaluar las contribuciones de cada componente. Finalmente, el paso 5 concluye el documento y esboza posibles direcciones para futuras investigaciones.

Esta sección comienza con una revisión de estudios previos sobre UNet y sus variantes en la segmentación de imágenes médicas, describiendo las fortalezas y limitaciones de los métodos existentes. Además, se discuten investigaciones relacionadas sobre los mecanismos de atención y sus aplicaciones en modelos de segmentación. También se examinan los desarrollos recientes relacionados con técnicas de convolución en profundidad para mejorar el rendimiento de la segmentación. En la Figura 1 se presenta un análisis comparativo de la MixKNet (c) propuesta y otros modelos, donde las líneas discontinuas indican conexiones de salto.

UNet y sus variantes
La arquitectura UNet fue propuesta por primera vez por Ronneberger et al. en 20151 y desde entonces se ha utilizado ampliamente en la segmentación de imágenes médicas. El modelo consta de una ruta de codificación y una ruta de decodificación. El codificador extrae características de alto nivel de la imagen de entrada, mientras que el decodificador sobremuestrea y combina las características para generar un mapa de segmentación. Desde entonces, se han realizado varias modificaciones en la arquitectura de UNet para mejorar su rendimiento en la segmentación de imágenes médicas. Una de las modificaciones más comunes es la introducción de conexiones de omisión, que se ha demostrado que mejoran la precisión de la segmentación. Zhou et al.12 propusieron una variante de UNet que utiliza conexiones de salto densas, lo que permite que el modelo conserve mejor la información espacial.

Otra modificación popular de la arquitectura UNet es la adición de mecanismos de atención. Estos mecanismos pueden ayudar al modelo a enfatizar selectivamente las características más importantes, lo que conduce a un mejor aprendizaje de la representación y la precisión de la segmentación. Algunos ejemplos de variantes con mecanismos de atención incluyen Attention UNet2, ResUNet con puertas de atención13 y Dense-UNet con puertas de atención14. Además de las modificaciones anteriores, se han propuesto muchas otras variantes de la arquitectura UNet para la segmentación de imágenes médicas. UCTransNet10 es una variante de la arquitectura U-Net que incorpora conexiones de salto y un módulo Transformer. Las conexiones de omisión en UCTransNet10 se replantean desde una perspectiva de canal, lo que permite una mejor reutilización de características y reduce el número de parámetros. Se agrega el módulo Transformer para capturar dependencias de largo alcance y mejorar la calidad de la traducción. Se ha demostrado que UCTransNet10 logra resultados de última generación en varios puntos de referencia de traducción automática. Zihan et al. propusieron un modelo de aprendizaje profundo llamado LViT15, que aplicaron a tareas de análisis de imágenes médicas. Para ampliar la versión semi-supervisada de LViT15 y compensar la deficiencia de calidad en los datos de imagen, propusieron el mecanismo de Iteración Exponencial de Pseudo Etiquetas (EPI). Además, para preservar las características locales de las imágenes, propusieron el Módulo de Atención a Nivel de Píxel (PLAM), que se centra selectivamente en las características importantes de la imagen.

Mecanismo de atención
Los mecanismos de atención han sido ampliamente estudiados en el aprendizaje automático, particularmente en el procesamiento del lenguaje natural y la visión por computadora. En los últimos años, los mecanismos de atención también se han aplicado a las tareas de análisis de imágenes médicas, incluida la segmentación de imágenes. Bahdanau et al.16 introdujeron un mecanismo de atención en la traducción automática neuronal para mejorar la calidad de la traducción. El mecanismo permite que el modelo se centre selectivamente en partes relevantes de la secuencia de entrada, lo que mejora la calidad de la traducción. Desde entonces, se han propuesto diversos mecanismos de atención para las tareas de análisis de imágenes. Un tipo común de mecanismo de atención es el mecanismo de atención espacial, que consiste en aplicar un peso a cada píxel del mapa de características en función de su importancia. Por ejemplo, Guo et al.17 propusieron un mecanismo de atención espacial para la tarea de segmentación de los vasos retinianos. El mecanismo utiliza un mecanismo de compuerta para ajustar la ponderación de las características espaciales, lo que mejora la capacidad del modelo para distinguir entre los píxeles del recipiente y los no del recipiente. Otro tipo de mecanismo de atención es la atención de canal, que se centra en ajustar los pesos de los mapas de características en todos los canales. Hu et al.18 propusieron una red de compresión y excitación (SENet) que aplica atención por canal a los mapas de características, mejorando el rendimiento de la tarea de clasificación de imágenes. Más recientemente, los mecanismos de atención se han combinado con redes neuronales convolucionales (CNN) para tareas de segmentación de imágenes. Por ejemplo, Chen et al.19 propusieron una red guiada por la atención para la segmentación de tumores cerebrales que combina mecanismos de atención espaciales y canales.

Los avances recientes en el aprendizaje semisupervisado y multimodal para el análisis de imágenes médicas y la teledetección han demostrado mejoras prometedoras en el rendimiento. Yang et al.20 propusieron UMSCS, un novedoso marco de segmentación multimodal no apareado que aprovecha el aprendizaje generativo intermodal y las estrategias semisupervisadas. Zhang et al. introdujeron varias técnicas de vanguardia: un modelo de consistencia de tres ramas mejorado por evidencia para la segmentación semisupervisada21, un marco de aprendizaje prototípico autoconsciente y de muestras cruzadas para la segmentación de imágenes médicas22, y un enfoque de optimización de características jerárquicas consciente del tiempo para el reconocimiento de interferencias de radar de apertura sintética (SAR) en el dominio aeroespacial23. Estos trabajos destacan colectivamente la importancia de la supervisión híbrida y el modelado de características con reconocimiento de dominio en las tareas de imágenes médicas y de ingeniería.

Convolución con control de profundidad
La convolución en profundidad está diseñada para capturar correlaciones de canal en los mapas de características de entrada y se ha demostrado que mejora la eficiencia y la precisión de las redes neuronales convolucionales.

Uno de los primeros y más influyentes modelos de convolución en profundidad es MobileNet24, propuesto por Howard et al. en 2017. MobileNet utiliza la convolución separable en profundidad, que aplica una convolución en profundidad seguida de una convolución puntual, para reducir el número de parámetros y el cálculo necesarios para las capas convolucionales. Esto permite a MobileNet lograr una precisión de última generación en las tareas de clasificación de imágenes mientras utiliza significativamente menos parámetros que las redes neuronales convolucionales tradicionales. Desde la introducción de MobileNet, se han propuesto otras arquitecturas de convolución en profundidad, incluyendo ShuffleNet25, Xception26 y ResNeXt27. Estos modelos varían en su implementación específica de la convolución profunda, pero todos comparten el objetivo de reducir la complejidad computacional de las capas convolucionales mientras se mantiene o mejora la precisión. La convolución profunda también se ha aplicado a la tarea de segmentación semántica, con modelos como PSPNet28 que utilizan la convolución separable en profundidad para reducir los requisitos de cálculo y memoria de las capas convolucionales a gran escala. MixNet29 amplía aún más la idea de la convolución profunda mediante la introducción de una convolución mixta en profundidad, que utiliza varios tamaños de kernel para capturar características a diferentes escalas. Se ha demostrado que supera a otros modelos de última generación al tiempo que mantiene parámetros y FLOPs comparables. Estos modelos han demostrado mejoras significativas en la precisión y la eficiencia con respecto a las redes neuronales convolucionales tradicionales en diversas tareas de segmentación semántica.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En esta sección se describe la arquitectura MixKNet propuesta para la segmentación de imágenes médicas. El modelo MixKNet amplía la arquitectura UNet, incorporando mecanismos de atención y capas mixtas de convolución en profundidad. El software utilizado en este estudio se enumera en la Tabla de Materiales.

1. Arquitectura general

  1. La arquitectura MixKNet, que se muestra en la figura 2, sigue la estructura estándar de UNet, que consta de un codificador y un descodificador. Establezca la forma de entrada en 224 × 224 × 3. En el codificador, use dos módulos DownBlock, cada uno incluye una convolución de profundidad 1×1, una capa de agrupación máxima de 2×2 y una convolución de varios kernels (MDConv) con tamaños de kernel como [1, 3, 5] o [3-13].
  2. En el decodificador, use dos módulos UpBlock, cada uno de los cuales realiza un muestreo bilineal, concatenación de conexiones de omisión, una convolución de profundidad 1×1 y una convolución de varios núcleos.
  3. Utilice las activaciones de ReLU después de cada bloque convolucional. Aplique una convolución final 1×1 para producir la salida, seguida de una activación sigmoide para la segmentación binaria, o déjela sin activar para Softmax externo en tareas multiclase.

2. Forma de U aplanada

NOTA: Reduzca la profundidad de la arquitectura de la red neuronal para disminuir la complejidad computacional y el tamaño del modelo, teniendo en cuenta que esto puede reducir la capacidad de aprender representaciones de datos complejas.

  1. Reduzca una arquitectura UNet de cuatro niveles a una versión de dos niveles, como se muestra en la figura 3, para reducir el número de parámetros del modelo y conservar los componentes principales de codificación y decodificación.
    1. Construya la arquitectura acoplada eliminando los niveles 3 y 4 de las rutas del codificador y del descodificador, y conserve las conexiones de características en el nivel 2.
    2. Ajuste las operaciones de submuestreo y submuestreo en consecuencia para que coincidan con el uso reducido de profundidad, solo un paso de reducción de muestreo antes del cuello de botella y un paso de sobremuestreo después.
      NOTA: Esta reducción en la profundidad puede disminuir la capacidad de aprendizaje del modelo, ya que es posible que no capture relaciones complejas entre la entrada y la salida. El aumento del número de canales de convolución base en cada capa del modelo puede ayudar a superar esta limitación al mejorar la capacidad del modelo para aprender características discriminativas. Con más canales de convolución, el modelo puede capturar patrones y relaciones más complejos en los datos de entrada, compensando la profundidad reducida y mejorando el rendimiento.
  2. Tenga en cuenta que aumentar el número de canales de convolución también puede aumentar la complejidad computacional del modelo y el uso de memoria, lo que presenta una compensación con la velocidad de entrenamiento e inferencia. Encuentre un equilibrio adecuado entre la capacidad del modelo y la eficiencia computacional.

3. Mezcle el tamaño del kernel para el codificador

  1. Para mejorar el rendimiento del codificador, emplee un enfoque de tamaño de kernel mixto en el módulo DC-CA (Depthwise Convolution and Channel Attention), como se ilustra en la Figura 4. En lugar de depender de un solo tamaño de kernel, aplique múltiples convoluciones en profundidad en paralelo con diferentes tamaños de kernel (por ejemplo, 1, 3, 5, 7, 9, 11, 13) para extraer características en múltiples campos receptivos.
  2. Aplique la normalización por lotes y la activación de ReLU a cada rama individualmente antes de la concatenación. Concatene las salidas de cada rama del kernel a lo largo de la dimensión del canal.
  3. Utilice una convolución 1×1 puntual después de la concatenación para fusionar entidades y proyectarlas en un número fijo de canales de salida, manteniendo la coherencia con el tamaño de entrada esperado de la siguiente capa.
    NOTA: La capa mixta de convolución en profundidad consta de múltiples convoluciones en profundidad con diferentes tamaños de kernel, seguidas de una convolución puntual. Este diseño permite la captura de características a diferentes escalas, lo cual es fundamental en las tareas de segmentación de imágenes médicas. El primer módulo emplea tres tamaños de kernel (1, 3 y 5) para aumentar el campo receptivo, mientras que el segundo módulo utiliza tamaños de kernel más grandes y más grupos, específicamente 3, 5, 7, 9, 11 y 13.

4. Canaliza la atención

  1. Integre un mecanismo de atención de canal en el módulo DC-CA para mejorar la representación de características.
    1. Utilice una convolución 1×1 con "el mismo" relleno para generar mapas de atención por canal. Aplique la agrupación de promedios globales a través de dimensiones espaciales para producir un descriptor compacto para cada canal.
    2. Utilice una red convolucional ligera que conste de dos convoluciones 1×1 con una activación de ReLU en el medio. Evite compartir el peso entre canales: aprenda los pesos de atención únicos por canal.
    3. Aplique una activación sigmoide a la salida final para obtener puntuaciones de atención normalizadas. Vuelva a ponderar los mapas de entidades de entrada mediante la multiplicación por canales.
      NOTA: Sea el tensor de entrada x. La atención del canal se implementa a través de la siguiente expresión:
      (atención)_tensor = σ(conv(ReLU(conv(x)))) (1)
      donde σ representa la función de activación sigmoide, conv es la operación de convolución y ReLU es la función de activación de unidad lineal rectificada.
  2. Obtenga el mapa de atención realizando una operación de agrupación de promedio adaptativo en el tensor de atención, seguido de expandirlo para que coincida con el tamaño del tensor de salida después de la convolución con un tamaño de kernel diferente y:
    atención = expandir(avg_pool([atención]_tensor),tamaño(y)) (2)
  3. Calcule el tensor de salida z realizando la multiplicación por elementos del tensor de entrada y con el mapa de atención:
    z = z * atención (3)
    donde * representa la multiplicación por elementos

5. Conjuntos de datos

NOTA: En este estudio se utilizan dos conjuntos de datos de imágenes médicas disponibles públicamente, como se presentan en la Tabla 1 y la Tabla 2: GlaS (Sirinukunwattana et al.11) y MoNuSeg (Kumar et al.9).

  1. Utilice el conjunto de datos de segmentación de glándulas (Sirinukunwattana et al.11), adquirido con un escáner de patología digital y anotado manualmente para segmentar estructuras glandulares individuales dentro de muestras de tejido.
    NOTA: El conjunto de datos consta de 165 imágenes, cada una con una resolución de 500 × 500 píxeles, junto con las correspondientes máscaras de segmentación de realidad del terreno. El conjunto de datos de MoNuSeg (Kumar et al.9) comprende 51 imágenes de núcleos microscópicos, cada una con una resolución de 1000 × 1000 píxeles.

6. Detalles de implementación

  1. Implemente el modelo usando PyTorch en una sola GPU NVIDIA RTX 3090. Utilice Ubuntu 22.04 como sistema operativo.
  2. Cambie el tamaño de todas las imágenes de entrada a un tamaño fijo de 224 × 224 píxeles. Aplicar técnicas de aumento de datos para mejorar la diversidad de la formación.
    1. Aplique aumentos aleatoriamente en el siguiente orden: volteo horizontal → volteo vertical → rotación → corrección gamma → transformación logarítmica → escalado aleatorio.
    2. Aplique volteretas horizontales aleatorias con una probabilidad de 0,5, volteretas verticales con una probabilidad de 0,5 y rotaciones dentro de ±15 grados con una probabilidad de 0,5.
    3. Aplique la corrección gamma con una probabilidad de 0,3, la transformación logarítmica con una probabilidad de 0,3 y el escalado aleatorio con un factor de escala entre 0,9 y 1,1, aplicado con una probabilidad de 0,3.
    4. Normalice las imágenes utilizando valores medios de [0,485, 0,456, 0,406] y desviaciones estándar de [0,229, 0,224, 0,225].
  3. Entrene el modelo con el optimizador de Adam con una tasa de aprendizaje de 0,001 y un tamaño de lote de 4. Emplee la técnica de programación de la tasa de aprendizaje Cosine Annealing with Warm Restarts para introducir variabilidad en el programa de tasas de aprendizaje y evitar la convergencia a los óptimos locales.
    NOTA: Utilice el torch.optim.lr_scheduler integrado de PyTorch. Programador CosineAnnealingWarmRestarts. El optimizador y el programador se implementaron de la siguiente manera:
    optimizador = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    programador = torch.optim.lr_scheduler. CosineAnnealingWarmRestarts(
    optimizador, T_0=10, T_mult=2, eta_min=1E-6)
    Aquí, T_0=10 denota el número de épocas antes del primer reinicio, T_mult=2 duplica el período de reinicio después de cada ciclo, y eta_min=1e-6 establece la tasa mínima de aprendizaje. Actualiza la tasa de aprendizaje al final de cada época llamando a scheduler.step().
  4. Utilice la entropía cruzada binaria como función de pérdida. Aplique la detención temprana para evitar el sobreajuste. Entrene el modelo durante un máximo de 5000 épocas.
  5. Evalúe el rendimiento del modelo utilizando la intersección media sobre la unión (mIoU) y el coeficiente de Dice.
    Dados =(2|A∩B|)/(|A|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    NOTA: El mIoU es la relación entre la intersección entre las máscaras de segmentación de verdad predicha y del terreno a su unión. Al mismo tiempo, el coeficiente de Dice es la relación entre el doble de la intersección y la suma de las máscaras de segmentación predichas y de verdad fundamental.
  6. Llevar a cabo una evaluación rigurosa en conjuntos de datos pequeños utilizando tres rondas de validación cruzada de 5 veces, lo que da como resultado un total de 15 evaluaciones. Baraja aleatoriamente las divisiones de validación cruzada en cada ronda para garantizar la variabilidad entre los pliegues. Estratifica los pliegues en función de las distribuciones de clases para mantener el equilibrio de las etiquetas dentro de cada pliegue.
  7. Calcule el rendimiento medio entre pliegues para mitigar el riesgo de convergencia a los óptimos locales. Realizar una prueba estadística para demostrar que el enfoque propuesto logra mejoras estadísticamente significativas con respecto a métodos comparables.
  8. Muestre predicciones de validación representativas durante el entrenamiento en la Figura 5 para ilustrar la mejora progresiva en la calidad de la segmentación. Una vez finalizado el entrenamiento, cargue el punto de control del modelo con mejor rendimiento en función del rendimiento de la validación (por ejemplo, la puntuación más alta de mIoU y Dice).
    1. Ejecute el modelo en el conjunto de validación para generar máscaras de segmentación predichas mediante los parámetros guardados.
    2. Visualice los resultados mediante Matplotlib mostrando la imagen de entrada, la máscara de realidad del terreno y la máscara de predicción en un formato de lado a lado.
    3. Resalte la superioridad del método propuesto en el rendimiento de la segmentación marcando las regiones representativas con cuadros rojos en la visualización.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparación con los métodos más avanzados
La arquitectura de MixKNet se ha evaluado en dos conjuntos de datos de segmentación de imágenes médicas, GlaS y MoNuSeg, y se ha comparado con métodos de última generación en el campo. La evaluación se ha llevado a cabo informando de las puntuaciones de los dados y de los IoU del método propuesto y de varios modelos comparables, como se muestra en la Tabla 3. Los resultados indican que la arquitectura MixKNet s...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta MixKNet, una modificación novedosa de la arquitectura UNet1 para la segmentación de imágenes médicas, que integra convolución de profundidad mixta y un mecanismo de atención de canal para mejorar el rendimiento de la segmentación al tiempo que reduce significativamente la complejidad computacional. La convolución de canal híbrido combina múltiples kernels convolucionales que operan en grupos de canales separados. Este diseño permite a la red ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran no tener intereses financieros contrapuestos ni otros conflictos de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El segundo lote de Proyectos de Investigación de Bienestar Social 2023 de la ciudad de Ningbo: Investigación y aplicación de tecnologías clave para la identificación de fraudes en redes de telecomunicaciones basadas en ontología y PNL (2023S169).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Sistema operativo Linux (Ubuntu 22.04)  Varios (Comunidad de código abierto)N/A(Versión 22.04 LTS)Sistema operativo de código abierto para desarrollo
https://releases.ubuntu.com/22.04/
GPU NVIDIA RTX 3090 GPUNVIDIA3090de alto rendimiento para aprendizaje profundo
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (Versión ≥ 3.8)Lenguaje de programación para el desarrollo de IA/ML
https://www.python.org/
PyTorchMeta AIN/A (Versión 1.13)Marco de aprendizaje automático de código abierto
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/AEditor de código ligero y potente
https://code.visualstudio.com/

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Variantes de U Netatenci n de canalconvoluci n de profundidad mixtadetecci n de lesionessegmentaci n celularsegmentaci n de p liposreducci n de par metros del modeloextracci n de caracter sticas
Video próximamente

Artículos relacionados