Este protocolo implementa una red de aprendizaje profundo en forma de U que integra convolución de molinete de viento, doble atención y fusión multiescala para segmentar pólipos colorrectales.
Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.
Artículo de método
* These authors contributed equally
Este protocolo implementa una red de aprendizaje profundo en forma de U que integra convolución de molinete de viento, doble atención y fusión multiescala para segmentar pólipos colorrectales.
La segmentación precisa de los pólipos colorrectales es crucial para la prevención y el diagnóstico temprano del cáncer colorrectal. Sin embargo, debido a la alta heterogeneidad de los pólipos en términos de forma, tamaño y textura, así como a la complejidad del entorno intestinal (como pliegues, reflejos especulares y residuos fecales), los métodos existentes aún enfrentan desafíos significativos en la localización de los límites y la detección de pólipos pequeños. Para abordar estos problemas, este artículo propone una Red de Segmentación de Pólipos basada en la Convolución en Molinete y la Doble Atención (PWD-Net). La red propuesta adopta una arquitectura codificador-decodificador en forma de U, donde se emplea un ResNet preentrenado como codificador para extraer características locales multinivel. Específicamente, se introduce un Módulo de Convolución Pinwheel (PCM) en la capa de cuello de botella para capturar la estructura geométrica global y la información contextual multidireccional de los pólipos mediante núcleos de convolución rotados en múltiples ángulos. Un Mecanismo de Doble Atención (DAM) que integra la atención del canal y la atención espacial está diseñado para suprimir de forma adaptativa el ruido de fondo y mejorar las características de la región de pólipos. Además, se emplea una estrategia de Fusión de Características Multiescala (MSF) para combinar información semántica profunda con detalles superficiales en los límites, asegurando tanto la completitud como la precisión de los resultados de segmentación. Los experimentos realizados con los conjuntos de datos Kvasir-SEG y CVC-ClinicDB demuestran que PWD-Net alcanza coeficientes medios de Dice de 0,865 y 0,944, y puntuaciones IoU de 0,765 y 0,892, respectivamente, superando significativamente a los métodos de última generación existentes. Los estudios de ablación verifican la efectividad de cada módulo, y las evaluaciones entre conjuntos de datos confirman la fuerte capacidad de generalización del modelo. Este estudio ofrece una solución de alta precisión y robusta para la segmentación clínica de pólipos, ofreciendo un valor significativo para el diagnóstico precoz de lesiones precancerosas colorrectales y apoyando la intervención asistida por ordenador.
El cáncer colorrectal es uno de los tumores malignos más comunes en todo el mundo, con tasas de incidencia y mortalidad consistentemente altas. Los estudios han demostrado que la mayoría de los cánceres colorrectales se desarrollan a partir de pólipos adenomatosos, un proceso que normalmente dura entre 10 y 15 años, proporcionando una valiosa ventana temporal para la detección e intervención precoz. Un aumento del 1% en la tasa de detección de adenomas (ADR) puede reducir el riesgo de cáncer colorrectal en aproximadamente un 3%, disminuyendo significativamente la mortalidaddel paciente 1. La colonoscopia, considerada el estándar de oro para el cribado del cáncer colorrectal, permite la extirpación directa de pólipos durante el examen, reduciendo así eficazmente la incidencia y mortalidad por cáncer.
Sin embargo, la colonoscopia convencional depende en gran medida de la experiencia y el nivel de habilidad de los endoscopistas. Factores como el juicio subjetivo, la fatiga visual y la distracción pueden provocar una tasa de fallo del 20%–30%, lo que afecta directamente a la efectividad delcribado 2. Por ello, desarrollar sistemas de detección asistida por ordenador (CAD) para la segmentación automática de pólipos colorrectales tiene una importancia considerable para mejorar la ADR y reducir diagnósticos perdidos. Encuestas clínicas recientes han puesto de manifiesto aún más el interés en integrar la inteligencia artificial en los flujos de trabajo de evaluación endoscópica de lesiones, reforzando la necesidad de métodos de segmentación robustosy reproducibles.
En los últimos años, el aprendizaje profundo ha logrado avances notables en el análisis de imágenes médicas, especialmente en redes neuronales convolucionales (CNN), que demuestran una gran capacidad en la extracción de características y representación para tareas de segmentaciónde imágenes 4. Como modelo clásico de segmentación de imágenes médicas, U-Net emplea una arquitectura codificador-decodificador simétrica y conexiones de salto para lograr una segmentación precisa a nivel de píxel, convirtiéndose en un referente en estecampo 5. Basándose en U-Net, se han propuesto muchas arquitecturas mejoradas para abordar tareas complejas de segmentación de imágenes médicas. UNet++ reduce la brecha semántica entre los mapas de características del codificador y el decodificador introduciendo conexiones anidadas y de saltodenso 6. ResUNet++ integra bloques residuales, módulos de apretón y excitación, convoluciones dilatadas y mecanismos de atención, logrando un rendimiento sólido en segmentación depólipos 7. U2-Net adopta una estructura anidada en forma de U de dos niveles para capturar información de características a múltiplesescalas 8. Más recientemente, se ha propuesto una red de segmentación profunda de pólipos basada en codificador-decodificador dual, que aprovecha rutas de codificación y decodificación paralelas para mejorar aún más la precisión de lasegmentación 9.
Mientras tanto, la introducción de mecanismos de atención ofrece nuevas soluciones para la mejora de características y la supresión del ruido. Attention U-Net emplea puertas de atención para enfocarse en regiones objetivo mientras suprime información de fondo irrelevante10. La Red de Doble Atención (DANet) pondera adaptativamente características tanto de las dimensiones de canal comoespaciales 11, mejorando la percepción de características críticas. Las Redes de Triple Atención (TANet) mejoran aún más el rendimiento de la segmentación mediante la selección adaptativa de características multiescala12.
Con el éxito de las arquitecturas Transformer en procesamiento de lenguaje natural y visiónpor ordenador 13, los investigadores han comenzado a explorar su aplicación en la segmentación de imágenes médicas. TransUNet fue el primero en emplear un Transformador como codificador para modelar dependencias de largo alcance de formaefectiva 14. Swin-UNet adopta una arquitectura puramente Transformer y logra una agregación global eficiente de información mediante un mecanismo de ventanadesplazada 15. UTNet propone una arquitectura híbrida que combina la capacidad de extracción local de características de las CNN con la capacidad de modelado global de Transformers16.
En el campo de la segmentación de pólipos, Polyp-PVT utiliza un Transformer de visión piramidal para capturar información semántica globala escala múltiple 17, mientras que UNet anidado a escala múltiple mejora la comprensión contextual integrando Transformers18. Estudios recientes también han explorado estrategias de aprendizaje por correlación negativa para la segmentación de pólipos entredominios 19, la mejora de segmentación aumentada con Gompertz20 y arquitecturas basadas en la atención que incorporan guía delímites 21. Aunque estos enfoques mejoran en cierta medida el rendimiento de la segmentación, la segmentación de pólipos aún enfrenta varios desafíos. En primer lugar, los pólipos presentan una gran heterogeneidad en morfología, tamaño y textura, que van desde micropólipos de menos de 5 mm hasta pólipos grandes que superan los 30 mm, con formas que varían desde circulares y elípticas hasta formas muy irregulares. En segundo lugar, el entorno intestinal es complejo y variable, donde los pliegues mucosos, los reflejos especulares, los residuos fecales y los restos de comida introducen una interferencia de fondo severa. En tercer lugar, muchos pólipos tienen límites difusos, pueden estar parcialmente ocluidos por pliegues o sumergidos en fluidos intestinales, lo que hace que la localización precisa de los límites sea extremadamentedifícil 22.
Los métodos existentes aún presentan limitaciones claras para abordar estos desafíos. Las CNN tradicionales son eficaces para extraer texturas locales y características de bordes; sin embargo, los núcleos de convolución cuadrada fija no son adecuados para capturar diversas formas geométricas23, especialmente para pólipos muy irregulares, y no pueden modelar eficazmente características geométricas multidireccionales. Los métodos basados en transformadores pueden modelar dependencias globales, pero son menos efectivos para captar detalles locales finos e información de fronteras. Además, su alta complejidad computacional los hace menos adecuados para aplicaciones clínicas en tiemporeal 24. Enfoques recientes de segmentación de pólipos como PraNet, que utiliza módulos de atención inversa para refinar regiones clave25, redes de atención en cascada guiadas por límites que mejoran la extracción de característicasde límite 26, y CAFE-Net, que fusiona características codificadoras y decodificadoras mediante mecanismosde atención cruzada 27, aún encuentran una representación insuficiente de características y una localización inexacta de los límites al tratar con pólipospequeños 28, límites difuminados y fondos complejos. Además, la mayoría de los métodos descuidan la morfología geométrica y no aprovechan plenamente la información contextual multidireccional, lo que resulta en una segmentación subóptima de pólipos de forma irregular.
En resumen, los métodos actuales basados en CNN carecen de la capacidad de capturar características geométricas multidireccionales debido a su dependencia de núcleos de convolución cuadrada fija. Los enfoques basados en transformadores ofrecen modelado global pero sacrifican la precisión local en el límite e imponen altos costes computacionales. Mientras tanto, las estrategias de fusión actuales con atención mejorada y multiescala no se han optimizado conjuntamente dentro de un marco unificado específicamente adaptado para la segmentaciónde pólipos 29. Estas lagunas motivan el desarrollo de un método que aborda simultáneamente el modelado geométrico de características, la supresión adaptativa del ruido y la integración de características a escala cruzada.
Para abordar estos problemas, este protocolo presenta una Red de Segmentación de Pólipos basada en Convolución de Molinete y Doble Atención (PWD-Net). La red propuesta integra modelado geométrico de características, mejora de la atención multidimensional y fusión de características a múltiples escalas, permitiendo la segmentación precisa de pólipos complejos. Las principales contribuciones de este trabajo se resumen de la siguiente manera: el módulo de convolución en molinete (PCM), inspirado en la estructura de un molinillo, propone un novedoso diseño de núcleo de convolución rotado que captura características geométricas multidireccionales de los pólipos mediante operaciones de convolución en múltiples ángulos (0°, 45°, 90°, 135°, 180°, 225°, 270° y 315°). Este módulo sustituye la capa convencional de convolución en la etapa de cuello de botella, permitiendo una percepción efectiva de diversas orientaciones de bordes y mejorando significativamente la representación de pólipos de formas irregulares. El mecanismo de doble atención (DAM) aborda el ruido de fondo como pliegues, reflexiones y residuos fecales en las imágenes de colonoscopia. Se diseña un módulo de doble atención que integra la atención canalizada y la atención espacial. Integrado en conexiones de salto, este módulo suprime de forma adaptativa la interferencia de fondo y mejora las respuestas de características en regiones de pólipos al identificar conjuntamente "qué" es importante (dimensión del canal) y "dónde" se encuentra el objetivo (dimensión espacial), asegurando que solo las características refinadas estén involucradas en la fusión posterior. La estrategia de fusión de características multiescala (MSF) preserva tanto información semántica profunda como detalles superficiales de los límites mediante un mecanismo jerárquico introducido en el decodificador. Al integrar progresivamente características de codificadores mejorados con DAM con características de decodificador upamuestreado, esta estrategia compensa eficazmente la pérdida de detalle espacial causada por el muestreo descendente, permitiendo la detección precisa de pólipos pequeños y una delimitación precisa de los límites.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Este estudio utiliza únicamente conjuntos de datos de imágenes de colonoscopia anonimizadas y disponibles públicamente (Kvasir-SEG). No se recogieron nuevos datos de sujetos humanos. No se requería la aprobación ética institucional ni el consentimiento informado del paciente, como confirman las políticas de revisión institucional para análisis retrospectivos de conjuntos de datos públicos desidentificados.
1. Preparación de datos
2. Arquitectura general
NOTA: Consulte la Figura 1 para la columna vertebral codificador-decodificador a nivel macro de PWD-Net, y la Figura 2 para la integración e interacción de módulos centrales dentro del flujo de características. La arquitectura general sigue un diseño codificador-decodificador en forma de U para manejar variaciones de escala de pólipos e interferencias de fondo en imágenes de colonoscopia.
3. Módulo de convolución del molinete (Figura 3)

4. Mecanismo de doble atención (Figura 4)
NOTA: El Mecanismo de Doble Atención (DAM) está integrado en cada conexión de salto para suprimir el ruido de fondo y realzar las características de la región de pólipos tanto en el canal como en las dimensiones espaciales.


5. Fusión de características a escala múltiple
6. Función de pérdida y configuración de entrenamiento



7. Pseudocódigo
Algoritmo 1: Segmentación de pólipos PWD-Net
1: Entrada: Imagen de colonoscopia I ∈R H×W×3
2: Salida: Máscara de segmentación M ∈ {0,1}(H×W)
3:
4: función Módulo de convolución PCM(X) ▷ Pinwheel
5: Definamos núcleo base W (3 x 3), ángulos Θ = {0°, 45°, ..., 315°}
6: para cada θ ∈ Θ do
7: Wθ ← BilinearRotate(W, θ) ▷ Rotate kernel
8: Yθ ← Conv2d(X,W θ) ▷ Características específicas de la dirección
9: fin para
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Yθ})))) ▷ Aggregate
11: devuelve Yfuera
12: función final
13:
14: función DAM(F) ▷ Mecanismo de doble atención
15: Ac ← Sigmoide(MLP(AvgPool(F))) ▷ Atención de canal (r=16)
16: As ← Sigmoide(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ Atención espacial
17: F' ← F ⊗ (α · Ac + β · As) ▷ Fusionar con α aprendible, β (init=0,5)
18: Regreso F'
19: función final
20:
21: función PWD-Net(I)
22: Codificador: e1,e 2,e 3,e 4,e 5 ← ResNet50_Stages(I) ▷ codificador preentrenado de 5 etapas
23: Cuello de botella: b ← PCM(e5) ▷ Aplicar PCM en cuello de botella
24: Saltar conexiones: si ← DAM(e i) para i = 1, 2, 3, 4 ▷ Características del codificador de filtro
25: Decodificador:
26: d 4 ← DoubleConv(Concat(Up(b),s 4))
27: d 3 ← DoubleConv(Concat(Up(d 4), s3))
28: d 2 ← DoubleConv(Concat(Up(d 3), s2))
29: d 1 ← DoubleConv(Concat(Up(d2), s1))
30: M ← Sigmoid (Conv1 x 1(d1))
31: regreso M
32: función final
33:
34: Entrenamiento:
35: para cada época haz
36: M̂ ← PWD-Net(I)
37: L ← 0,5 · A.C. (M̂,M gt) + 0,5 · Pérdida de dados (M̂,M gt) ▷ λ = 0,5
38: Actualizar parámetros mediante retropropagación (Adamoptimizar r)
39: fin para
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Montaje experimental
Conjunto de datos
El conjunto de datos Kvasir SEG se utilizó para evaluar el comportamiento de segmentación de PWD Net en imágenes de colonoscopia con apariencias heterogéneas de pólipos. El conjunto de datos contiene imágenes de pólipos anotadas de 1.000 píxeles e incluye variaciones en tamaño, forma, textura, iluminación y complejidad de fondo de pólipo, lo que lo hace adecuado para evaluar la detección de objetivos p...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Varias opciones de diseño en el protocolo PWD-Net son fundamentales para lograr resultados de segmentación fiables y merecen una atención cuidadosa durante la implementación. Primero, la selección e inicialización de la columna vertebral del codificador influye directamente en el comportamiento de convergencia y el rendimiento final. El protocolo emplea un codificador ResNet-50 preentrenado en ImageNet, que proporciona una inicialización robusta de características de bajo y nivel medio. ...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores no tienen nada que revelar.
Este estudio fue financiado por el Programa Nacional de Investigación y Desarrollo de Claves de China (Números de Programa 2022YFC3500200 y 2022YFC3500204).
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Adam Optimizer | — | — | Incluido en PyTorch |
| Albumentations | Albumentations Team | v1.0+ | Biblioteca de aumento de datos |
| CUDA Toolkit | NVIDIA | v11.3+ | Aceleración GPU |
| Kvasir-SEG dataset | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Visualización de curvas de entrenamiento |
| NumPy | NumPy Community | v1.21+ | Cálculo numérico |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU para entrenamiento e inferencia |
| OpenCV | OpenCV Community | v4.5+ | Preprocesamiento de imágenes |
| Python | Python Software Foundation | v3.8+ | Lenguaje de programación |
| PyTorch | Meta Platforms | v1.12+ | Marco de aprendizaje profundo |
| ResNet-50 pretrained weights | PyTorch Model Zoo | — | Preentrenado ImageNet-1K |
| Ubuntu | Canonical | 18.04+ | Sistema operativo |