Este estudio presenta una variante ligera de U-Net con una precisión de segmentación mejorada utilizando convolución híbrida y atención de canal, logrando resultados de última generación en MoNuseg y GlaS con menos parámetros.
Artículo de método
Este estudio presenta una variante ligera de U-Net con una precisión de segmentación mejorada utilizando convolución híbrida y atención de canal, logrando resultados de última generación en MoNuseg y GlaS con menos parámetros.
La tecnología de procesamiento de imágenes por computadora basada en redes neuronales artificiales se ha desarrollado rápidamente en los últimos años y ha encontrado aplicaciones generalizadas en múltiples campos. En el procesamiento de imágenes médicas, UNet y sus variantes han demostrado un gran éxito en las tareas de detección de lesiones, segmentación celular y segmentación de pólipos. Esta investigación presenta una red modificada en forma de U con parámetros de red reducidos logrados mediante la disminución de la profundidad de la red y el aumento de los canales de red para mejorar la capacidad de aprendizaje del modelo. Para contrarrestar la reducción de la capacidad de aprendizaje causada por la compresión de profundidad, se introduce un módulo convolucional de canal híbrido para reemplazar el módulo convolucional de la red original. El modelo introduce un mecanismo de atención de canal entre la capa y la capa de convolución de puntos para mejorar la capacidad práctica de extracción de características de canal. El artículo también concluye que el uso de la convolución de profundidad mixta puede resolver eficazmente el intervalo de tamaño del objetivo de segmentación, lo que dificulta que un modelo sea adecuado para múltiples conjuntos de datos. El modelo propuesto logra resultados de última generación en dos conjuntos de datos públicos populares, MoNuseg y GlaS, con un aumento medio de dados del 1,0% y el 1,37%, respectivamente. Los parámetros totales del modelo modificado se reducen a 1,71M, lo que representa una reducción de 38,6x en comparación con UCtransNet, con 65,6M de parámetros.
La segmentación de imágenes médicas es fundamental en diversas aplicaciones clínicas, como el diagnóstico, la planificación del tratamiento y el seguimiento de enfermedades. Los métodos tradicionales de procesamiento de imágenes basados en algoritmos de ingeniería de características ya no son adecuados para manejar los grandes volúmenes de datos generados en los entornos sanitarios modernos. Afortunadamente, el avance de la tecnología de redes neuronales artificiales y las mejoras en las capacidades del hardware de las computadoras han hecho posible entrenar e implementar modelos de redes neuronales a gran escala. Como resultado, los algoritmos de procesamiento de visión artificial basados en modelos de aprendizaje automático se desarrollan y aplican continuamente en diversos campos.
La estructura del modelo más representativa en la segmentación semántica de imágenes médicas es UNet1 con una arquitectura de codificación-decodificación. En primer lugar, el modelo utiliza un codificador de varios niveles para extraer características de diferentes escalas de la imagen de entrada. A continuación, el decodificador realiza un muestreo paso a paso mientras combina las características semánticas emitidas por el codificador del nivel correspondiente como una conexión de omisión. Sin embargo, el rendimiento de la arquitectura UNet se puede mejorar aún más mediante la aplicación de varios métodos. Por ejemplo, se ha demostrado que los mecanismos de atención son eficaces para mejorar el rendimiento de las redes neuronales convolucionales. Estos mecanismos pueden enfatizar selectivamente las características esenciales de los datos de entrada, lo que conduce a un mejor aprendizaje de la representación y la precisión de la segmentación.
En la actualidad, muchos investigadores se centran en fusionar eficazmente las características extraídas por el codificador en la etapa de decodificación. Algunas de las variantes más comunes de UNet incluyen Attention UNet2, Recurrent UNet3 y V-Net4. Estos enfoques emplean mecanismos de atención5, como la atención espacial, para resaltar las regiones informativas de los mapas de características y suprimir las regiones no informativas. Además, algunas variantes incorporan redes neuronales recurrentes para modelar la naturaleza secuencial de las imágenes médicas y mejorar las representaciones de características. Los modelos de preentrenamiento, como VGG6, ResNet7 y DenseNet8, se han utilizado ampliamente para mejorar el rendimiento de las redes en forma de U aprovechando su rico conocimiento aprendido de conjuntos de datos a gran escala. Además, se han introducido mecanismos de transformación, como la autoatención y la atención multicabezal, en las dependencias de modelos de largo alcance y capturan información contextual global, lo que conduce a un mejor rendimiento de la segmentación.
Sin embargo, aunque estas variantes han mejorado con respecto al UNet1 original, todavía tienen ciertas limitaciones en el manejo de imágenes médicas complejas con diferentes escalas y formas. Además, la mayor complejidad de estas variantes a menudo conduce a mayores costos computacionales y tiempos de entrenamiento más largos, lo que limita su aplicabilidad en entornos prácticos.
Para mejorar la arquitectura UNet1 , se propone un modelo modificado denominado MixKNet (Mix Kernel Size U-shape Net), que reduce la profundidad de la red al tiempo que aumenta el número de canales para mejorar la capacidad de aprendizaje. Sin embargo, la reducción de la profundidad puede provocar una disminución del rendimiento general. Para mitigar este problema, se introduce un módulo convolucional de canal híbrido, que reemplaza el módulo neuronal convolucional original. Este módulo incorpora un mecanismo de atención de canal entre las capas de convolución en profundidad y punto, con el objetivo de fortalecer la capacidad del modelo para extraer características de canal efectivas.
Para guiar la aplicabilidad práctica, es importante señalar que el método propuesto se evaluó en conjuntos de datos de imágenes médicas a escala relativamente pequeña, con resoluciones de imagen individuales que oscilan entre 500 × 500 y 1000 × 1000 píxeles. Para el entrenamiento del modelo, se cambió el tamaño de todas las imágenes a 224 × 224 píxeles. La implementación se llevó a cabo utilizando PyTorch en una sola GPU NVIDIA RTX 3090. Estos parámetros operacionales sugieren que el método es computacionalmente factible para configuraciones experimentales moderadas y adaptable a tamaños de conjuntos de datos limitados.
En conclusión, este artículo presenta una modificación novedosa de la estructura de red en forma de U e introduce un módulo de convolución de canal híbrido junto con un mecanismo de atención de canal, los cuales mejoran el rendimiento de la segmentación en conjuntos de datos de imágenes médicas. Las principales contribuciones de este trabajo son las siguientes: (1) Proponer una estructura de red modificada en forma de U con un módulo de convolución híbrido de conocimiento profundo que reemplaza al módulo neuronal convolucional original. (2) Introducción de un mecanismo de atención de canal entre la capa de convolución de referencia profunda y la capa de convolución de observación puntual para mejorar la capacidad efectiva de extracción de características de canal del modelo. (3) Lograr resultados de última generación simultáneamente en dos conjuntos de datos públicos populares en el conjunto de datos de segmentación nuclear MoNuseg9 con significativamente menos parámetros del modelo (en comparación con UCtransNet10 con 64 millones de parámetros) y un rendimiento mejorado en el conjunto de datos de segmentación de glándulas GlaS11 .
El resto de este artículo está organizado de la siguiente manera. El paso 2 proporciona una revisión exhaustiva de estudios previos sobre UNet1 y sus variaciones en la segmentación de imágenes médicas. Se examinan las fortalezas y limitaciones de los enfoques existentes, junto con el trabajo relacionado con los mecanismos de atención, las redes convolucionales de profundidad mixta y sus aplicaciones en modelos de segmentación. En el paso 3 se detalla la arquitectura del modelo MixKNet propuesto, incluidas las modificaciones en la estructura de UNet, la integración de un mecanismo de atención de canal y el uso de la convolución de profundidad mixta. En el paso 4 se presentan los resultados de experimentos extensos, acompañados de una discusión y un estudio de ablación para evaluar las contribuciones de cada componente. Finalmente, el paso 5 concluye el documento y esboza posibles direcciones para futuras investigaciones.
Esta sección comienza con una revisión de estudios previos sobre UNet y sus variantes en la segmentación de imágenes médicas, describiendo las fortalezas y limitaciones de los métodos existentes. Además, se discuten investigaciones relacionadas sobre los mecanismos de atención y sus aplicaciones en modelos de segmentación. También se examinan los desarrollos recientes relacionados con técnicas de convolución en profundidad para mejorar el rendimiento de la segmentación. En la Figura 1 se presenta un análisis comparativo de la MixKNet (c) propuesta y otros modelos, donde las líneas discontinuas indican conexiones de salto.
UNet y sus variantes
La arquitectura UNet fue propuesta por primera vez por Ronneberger et al. en 20151 y desde entonces se ha utilizado ampliamente en la segmentación de imágenes médicas. El modelo consta de una ruta de codificación y una ruta de decodificación. El codificador extrae características de alto nivel de la imagen de entrada, mientras que el decodificador sobremuestrea y combina las características para generar un mapa de segmentación. Desde entonces, se han realizado varias modificaciones en la arquitectura de UNet para mejorar su rendimiento en la segmentación de imágenes médicas. Una de las modificaciones más comunes es la introducción de conexiones de omisión, que se ha demostrado que mejoran la precisión de la segmentación. Zhou et al.12 propusieron una variante de UNet que utiliza conexiones de salto densas, lo que permite que el modelo conserve mejor la información espacial.
Otra modificación popular de la arquitectura UNet es la adición de mecanismos de atención. Estos mecanismos pueden ayudar al modelo a enfatizar selectivamente las características más importantes, lo que conduce a un mejor aprendizaje de la representación y la precisión de la segmentación. Algunos ejemplos de variantes con mecanismos de atención incluyen Attention UNet2, ResUNet con puertas de atención13 y Dense-UNet con puertas de atención14. Además de las modificaciones anteriores, se han propuesto muchas otras variantes de la arquitectura UNet para la segmentación de imágenes médicas. UCTransNet10 es una variante de la arquitectura U-Net que incorpora conexiones de salto y un módulo Transformer. Las conexiones de omisión en UCTransNet10 se replantean desde una perspectiva de canal, lo que permite una mejor reutilización de características y reduce el número de parámetros. Se agrega el módulo Transformer para capturar dependencias de largo alcance y mejorar la calidad de la traducción. Se ha demostrado que UCTransNet10 logra resultados de última generación en varios puntos de referencia de traducción automática. Zihan et al. propusieron un modelo de aprendizaje profundo llamado LViT15, que aplicaron a tareas de análisis de imágenes médicas. Para ampliar la versión semi-supervisada de LViT15 y compensar la deficiencia de calidad en los datos de imagen, propusieron el mecanismo de Iteración Exponencial de Pseudo Etiquetas (EPI). Además, para preservar las características locales de las imágenes, propusieron el Módulo de Atención a Nivel de Píxel (PLAM), que se centra selectivamente en las características importantes de la imagen.
Mecanismo de atención
Los mecanismos de atención han sido ampliamente estudiados en el aprendizaje automático, particularmente en el procesamiento del lenguaje natural y la visión por computadora. En los últimos años, los mecanismos de atención también se han aplicado a las tareas de análisis de imágenes médicas, incluida la segmentación de imágenes. Bahdanau et al.16 introdujeron un mecanismo de atención en la traducción automática neuronal para mejorar la calidad de la traducción. El mecanismo permite que el modelo se centre selectivamente en partes relevantes de la secuencia de entrada, lo que mejora la calidad de la traducción. Desde entonces, se han propuesto diversos mecanismos de atención para las tareas de análisis de imágenes. Un tipo común de mecanismo de atención es el mecanismo de atención espacial, que consiste en aplicar un peso a cada píxel del mapa de características en función de su importancia. Por ejemplo, Guo et al.17 propusieron un mecanismo de atención espacial para la tarea de segmentación de los vasos retinianos. El mecanismo utiliza un mecanismo de compuerta para ajustar la ponderación de las características espaciales, lo que mejora la capacidad del modelo para distinguir entre los píxeles del recipiente y los no del recipiente. Otro tipo de mecanismo de atención es la atención de canal, que se centra en ajustar los pesos de los mapas de características en todos los canales. Hu et al.18 propusieron una red de compresión y excitación (SENet) que aplica atención por canal a los mapas de características, mejorando el rendimiento de la tarea de clasificación de imágenes. Más recientemente, los mecanismos de atención se han combinado con redes neuronales convolucionales (CNN) para tareas de segmentación de imágenes. Por ejemplo, Chen et al.19 propusieron una red guiada por la atención para la segmentación de tumores cerebrales que combina mecanismos de atención espaciales y canales.
Los avances recientes en el aprendizaje semisupervisado y multimodal para el análisis de imágenes médicas y la teledetección han demostrado mejoras prometedoras en el rendimiento. Yang et al.20 propusieron UMSCS, un novedoso marco de segmentación multimodal no apareado que aprovecha el aprendizaje generativo intermodal y las estrategias semisupervisadas. Zhang et al. introdujeron varias técnicas de vanguardia: un modelo de consistencia de tres ramas mejorado por evidencia para la segmentación semisupervisada21, un marco de aprendizaje prototípico autoconsciente y de muestras cruzadas para la segmentación de imágenes médicas22, y un enfoque de optimización de características jerárquicas consciente del tiempo para el reconocimiento de interferencias de radar de apertura sintética (SAR) en el dominio aeroespacial23. Estos trabajos destacan colectivamente la importancia de la supervisión híbrida y el modelado de características con reconocimiento de dominio en las tareas de imágenes médicas y de ingeniería.
Convolución con control de profundidad
La convolución en profundidad está diseñada para capturar correlaciones de canal en los mapas de características de entrada y se ha demostrado que mejora la eficiencia y la precisión de las redes neuronales convolucionales.
Uno de los primeros y más influyentes modelos de convolución en profundidad es MobileNet24, propuesto por Howard et al. en 2017. MobileNet utiliza la convolución separable en profundidad, que aplica una convolución en profundidad seguida de una convolución puntual, para reducir el número de parámetros y el cálculo necesarios para las capas convolucionales. Esto permite a MobileNet lograr una precisión de última generación en las tareas de clasificación de imágenes mientras utiliza significativamente menos parámetros que las redes neuronales convolucionales tradicionales. Desde la introducción de MobileNet, se han propuesto otras arquitecturas de convolución en profundidad, incluyendo ShuffleNet25, Xception26 y ResNeXt27. Estos modelos varían en su implementación específica de la convolución profunda, pero todos comparten el objetivo de reducir la complejidad computacional de las capas convolucionales mientras se mantiene o mejora la precisión. La convolución profunda también se ha aplicado a la tarea de segmentación semántica, con modelos como PSPNet28 que utilizan la convolución separable en profundidad para reducir los requisitos de cálculo y memoria de las capas convolucionales a gran escala. MixNet29 amplía aún más la idea de la convolución profunda mediante la introducción de una convolución mixta en profundidad, que utiliza varios tamaños de kernel para capturar características a diferentes escalas. Se ha demostrado que supera a otros modelos de última generación al tiempo que mantiene parámetros y FLOPs comparables. Estos modelos han demostrado mejoras significativas en la precisión y la eficiencia con respecto a las redes neuronales convolucionales tradicionales en diversas tareas de segmentación semántica.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
En esta sección se describe la arquitectura MixKNet propuesta para la segmentación de imágenes médicas. El modelo MixKNet amplía la arquitectura UNet, incorporando mecanismos de atención y capas mixtas de convolución en profundidad. El software utilizado en este estudio se enumera en la Tabla de Materiales.
1. Arquitectura general
2. Forma de U aplanada
NOTA: Reduzca la profundidad de la arquitectura de la red neuronal para disminuir la complejidad computacional y el tamaño del modelo, teniendo en cuenta que esto puede reducir la capacidad de aprender representaciones de datos complejas.
3. Mezcle el tamaño del kernel para el codificador
4. Canaliza la atención
5. Conjuntos de datos
NOTA: En este estudio se utilizan dos conjuntos de datos de imágenes médicas disponibles públicamente, como se presentan en la Tabla 1 y la Tabla 2: GlaS (Sirinukunwattana et al.11) y MoNuSeg (Kumar et al.9).
6. Detalles de implementación
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Comparación con los métodos más avanzados
La arquitectura de MixKNet se ha evaluado en dos conjuntos de datos de segmentación de imágenes médicas, GlaS y MoNuSeg, y se ha comparado con métodos de última generación en el campo. La evaluación se ha llevado a cabo informando de las puntuaciones de los dados y de los IoU del método propuesto y de varios modelos comparables, como se muestra en la Tabla 3. Los resultados indican que la arquitectura MixKNet s...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Este estudio presenta MixKNet, una modificación novedosa de la arquitectura UNet1 para la segmentación de imágenes médicas, que integra convolución de profundidad mixta y un mecanismo de atención de canal para mejorar el rendimiento de la segmentación al tiempo que reduce significativamente la complejidad computacional. La convolución de canal híbrido combina múltiples kernels convolucionales que operan en grupos de canales separados. Este diseño permite a la red ...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores declaran no tener intereses financieros contrapuestos ni otros conflictos de intereses.
El segundo lote de Proyectos de Investigación de Bienestar Social 2023 de la ciudad de Ningbo: Investigación y aplicación de tecnologías clave para la identificación de fraudes en redes de telecomunicaciones basadas en ontología y PNL (2023S169).
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Sistema operativo Linux (Ubuntu 22.04) | Varios (Comunidad de código abierto) | N/A(Versión 22.04 LTS) | Sistema operativo de código abierto para desarrollo https://releases.ubuntu.com/22.04/ |
| GPU NVIDIA RTX 3090 GPU | NVIDIA | 3090 | de alto rendimiento para aprendizaje profundo https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (Versión ≥ 3.8) | Lenguaje de programación para el desarrollo de IA/ML https://www.python.org/ |
| PyTorch | Meta AI | N/A (Versión 1.13) | Marco de aprendizaje automático de código abierto https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Editor de código ligero y potente https://code.visualstudio.com/ |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE
Solicitar permiso