Questo protocollo implementa una rete di deep learning a forma di U che integra convoluzione a spirale, doppia attenzione e fusione multi-scala per segmentare polipi colorettali.
È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.
Articolo metodologico
* These authors contributed equally
Questo protocollo implementa una rete di deep learning a forma di U che integra convoluzione a spirale, doppia attenzione e fusione multi-scala per segmentare polipi colorettali.
Una segmentazione accurata dei polipi colorettali è fondamentale per la prevenzione precoce e la diagnosi del cancro colorettale. Tuttavia, a causa dell'elevata eterogeneità dei polipi in termini di forma, dimensione e consistenza, nonché della complessità dell'ambiente intestinale (come pieghe, riflessioni speculari e residui fecali), i metodi esistenti affrontano ancora sfide significative nella localizzazione dei confini e nel rilevamento di piccoli polipi. Per affrontare questi problemi, questo articolo propone una Rete di Segmentazione dei Polipi basata su Convoluzione a Ruota e Doppia Attenzione (PWD-Net). La rete proposta adotta un'architettura encoder–decoder a forma di U, in cui un ResNet pre-addestrato viene impiegato come codificatore per estrarre caratteristiche locali multilivello. In particolare, un Modulo di Convoluzione a Ruota (PCM) viene introdotto al livello di collo di bottiglia per catturare la struttura geometrica globale e le informazioni contestuali multidirezionali dei polipi attraverso nuclei di convoluzione ruotati a più angoli. Un Meccanismo di Doppia Attenzione (DAM) che integra l'attenzione del canale e l'attenzione spaziale è progettato per sopprimere in modo adattivo il rumore di fondo e migliorare le caratteristiche della regione dei polipi. Inoltre, viene impiegata una strategia Multi-scale Feature Fusion (MSF) per combinare informazioni semantiche profonde con dettagli di confine superficiali, garantendo sia completezza che precisione dei risultati di segmentazione. Esperimenti condotti sui dataset Kvasir-SEG e CVC-ClinicDB dimostrano che PWD-Net raggiunge coefficienti medi di DICE di 0,865 e 0,944, e punteggi IoU rispettivamente di 0,765 e 0,892, superando significativamente i metodi all'avanguardia esistenti. Gli studi di ablazione verificano l'efficacia di ogni modulo e le valutazioni cross-dataset confermano la forte capacità di generalizzazione del modello. Questo studio offre una soluzione ad alta precisione e robusta per la segmentazione clinica dei polipi, offrendo un valore significativo per la diagnosi precoce delle lesioni precancerose colorettali e supportando l'intervento assistito da computer.
Il cancro colorettale è uno dei tumori maligni più comuni nel mondo, con tassi costantemente elevati di incidenza e mortalità. Gli studi hanno dimostrato che la maggior parte dei tumori colorettali si sviluppa a partire dai polipi adenomatosi, un processo che tipicamente dura 10–15 anni, offrendo una preziosa finestra temporale per la diagnosi precoce e l'intervento. Un aumento dell'1% del tasso di rilevamento degli adenomi (ADR) può ridurre il rischio di cancro colorettale di circa il 3%, diminuendo significativamente la mortalitàdei pazienti 1. La colonscopia, considerata il punto di riferimento per lo screening del cancro colorettale, consente la rimozione diretta dei polipi durante l'esame, riducendo così efficacemente l'incidenza e la mortalità del cancro.
Tuttavia, la colonscopia convenzionale dipende molto dall'esperienza e dal livello di competenza degli endoscopisti. Fattori come il giudizio soggettivo, la stanchezza visiva e la distrazione possono portare a un tasso di mancato controllo del 20%–30%, che influisce direttamente sull'efficacia dello screening2. Pertanto, sviluppare sistemi di rilevamento assistito da computer (CAD) per la segmentazione automatica dei polipi colorettali è di grande importanza per migliorare l'ADR e ridurre le diagnosi mancate. Recenti indagini cliniche hanno ulteriormente evidenziato l'interesse nell'integrazione dell'intelligenza artificiale nei flussi di lavoro di valutazione endoscopica delle lesioni, rafforzando la necessità di metodi di segmentazione robustie riproducibili 3.
Negli ultimi anni, il deep learning ha raggiunto notevoli progressi nell'analisi delle immagini mediche, in particolare nelle reti neurali convoluzionali (CNN), che dimostrano una forte capacità nell'estrazione e rappresentazione delle caratteristiche per compiti di segmentazionedelle immagini 4. Come modello classico di segmentazione delle immagini mediche, U-Net impiega un'architettura codificatore–decodifica simmetrica e salti connessioni per ottenere una segmentazione accurata a livello di pixel, diventando un punto di riferimento in questocampo 5. Basandosi su U-Net, sono state proposte molte architetture migliorate per affrontare compiti complessi di segmentazione delle immagini mediche. UNet++ riduce il divario semantico tra le feature maps di encoder e decoder introducendo connessioni di skip annidate edense 6. ResUNet++ integra blocchi residui, moduli di compressione e eccitazione, convoluzioni dilatate e meccanismi di attenzione, ottenendo ottime prestazioni nella segmentazione deipolipi 7. U2-Net adotta una struttura a forma di U annidata a due livelli per catturare informazioni di caratteristichemultiscala 8. Più recentemente, è stata proposta una rete di segmentazione profonda a doppio encoder e decodificatore, basata su doppio codifica e decodifica, che sfrutta percorsi paralleli di codifica e decodifica per migliorare ulteriormente la precisione dellasegmentazione 9.
Nel frattempo, l'introduzione dei meccanismi di attenzione offre nuove soluzioni per il potenziamento delle caratteristiche e la soppressione del rumore. Attention U-Net utilizza porte di attenzione per concentrarsi sulle regioni target mentre sopprime informazioni di background irrilevanti10. La Dual Attention Network (DANet) pesa in modo adattivo le caratteristiche sia dal canale che dalle dimensionispaziali 11, migliorando la percezione delle caratteristiche critiche. Le Triple Attention Networks (TANet) migliorano ulteriormente le prestazioni di segmentazione attraverso la selezione adattiva di funzionalitàmultiscala 12.
Con il successo delle architetture Transformer nell'elaborazione del linguaggio naturale e nella visioneartificiale 13, i ricercatori hanno iniziato a esplorarne l'applicazione nella segmentazione delle immagini mediche. TransUNet fu il primo a impiegare un Transformer come codificatore per modellare efficacemente dipendenze a lungoraggio 14. Swin-UNet adotta un'architettura puramente Transformer e raggiunge un'aggregazione globale efficiente delle informazioni tramite un meccanismo a finestraspostata 15. UTNet propone un'architettura ibrida che combina la capacità di estrazione delle caratteristiche locali delle CNN con la capacità di modellazione globale di Transformers16.
Nel campo della segmentazione dei polipi, Polyp-PVT utilizza un Transformer a visione piramidale per catturare informazioni semantiche globalisu scala più 17, mentre UNet annidato multiscala migliora la comprensione contestuale integrando Transformers18. Studi recenti hanno inoltre esplorato strategie di apprendimento per correlazione negativa per la segmentazione multi-dominiodei polipi 19, il potenziamento della segmentazione aumentata con Gompertz20 e architetture basate sull'attenzione che incorporano la guida deiconfini 21. Sebbene questi approcci migliorino in una certa misura le prestazioni della segmentazione, la segmentazione dei polipi affronta ancora diverse sfide. Innanzitutto, i polipi mostrano un'elevata eterogeneità nella morfologia, dimensione e texture, variando da micropolipi più piccoli di 5 mm a polipi grandi che superano i 30 mm, con forme che variano da circolari ed ellittiche a forme altamente irregolari. In secondo luogo, l'ambiente intestinale è complesso e variabile, dove le pieghe mucose, le riflessioni speculari, i residui fecali e i detriti alimentari introducono gravi interferenze di fondo. In terzo luogo, molti polipi hanno confini sfocati, possono essere parzialmente occlusi da pieghe o sommersi nei fluidi intestinali, rendendo la localizzazione precisa dei confini estremamentedifficile 22.
I metodi esistenti presentano ancora chiari limiti nell'affrontare queste sfide. Le CNN tradizionali sono efficaci nell'estrarre le caratteristiche locali di texture e bordi; tuttavia, i nuclei a convoluzione quadrata fissa non sono adatti a catturare forme geometriche diverse23, specialmente per polipi altamente irregolari, e non possono modellare efficacemente caratteristiche geometriche multidirezionali. I metodi basati su trasformatori possono modellare dipendenze globali ma sono meno efficaci nel catturare dettagli locali fini e informazioni di confine. Inoltre, la loro elevata complessità computazionale li rende meno adatti ad applicazioni cliniche in temporeale 24. Approcci recenti di segmentazione dei polipi come PraNet, che utilizza moduli di attenzione inversa per affinare le regioni chiave25, le reti di attenzione a cascata guidate dai confini che migliorano l'estrazione delle caratteristichedei confini 26, e CAFE-Net, che fonde le caratteristiche di encoder e decoder tramite meccanismi di attenzioneincrociata 27, incontrano ancora una rappresentazione delle caratteristiche insufficiente e una localizzazione dei confini imprecisa quando si lavora con piccolipolipi 28, confini sfocati e sfondi complessi. Inoltre, la maggior parte dei metodi trascura la morfologia geometrica e non sfrutta appieno le informazioni contestuali multidirezionali, portando a una segmentazione subottimale dei polipi di forma irregolare.
In sintesi, i metodi attuali basati su CNN non sono in grado di catturare caratteristiche geometriche multidirezionali a causa della loro dipendenza da nuclei a convoluzione quadrata fissa. Gli approcci basati su trasformatori offrono modellazione globale ma sacrificano la precisione locale dei confini e impongono elevati costi computazionali. Nel frattempo, le strategie di fusione attuali a attenzione potenziata e multiscala non sono state ottimizzate congiuntamente all'interno di un quadro unificato specificamente pensato per la segmentazionedei polipi 29. Queste lacune motivano lo sviluppo di un metodo che affronta contemporaneamente la modellazione geometrica delle caratteristiche, la soppressione adattiva del rumore e l'integrazione delle caratteristiche su scala trasversale.
Per affrontare questi problemi, questo protocollo presenta una Rete di Segmentazione di Polipi basata su Convoluzione a Ruota e Doppia Attenzione (PWD-Net). La rete proposta integra modellazione geometrica delle caratteristiche, miglioramento dell'attenzione multidimensionale e fusione di caratteristiche su più scala, consentendo una segmentazione precisa dei polipi complessi. I principali contributi di questo lavoro sono riassunti come segue: il modulo convoluzione a pinwheel (PCM), ispirato alla struttura di una pinwheel, è proposto un nuovo design di kernel a convoluzione ruotata che cattura caratteristiche geometriche multidirezionali dei polipi tramite operazioni di convoluzione a più angoli (0°, 45°, 90°, 135°, 180°, 225°, 270° e 315°). Questo modulo sostituisce lo strato di convoluzione convenzionale nella fase di collo di bottiglia, consentendo una percezione efficace delle diverse orientazioni dei bordi e migliorando significativamente la rappresentazione dei polipi dalla forma irregolare. Il meccanismo di doppia attenzione (DAM) affronta il rumore di fondo come pieghe, riflessioni e residui fecali nelle immagini della colonscopia. È progettato un modulo a doppia attenzione che integra l'attenzione canale e l'attenzione spaziale. Integrato all'interno delle connessioni di salto, questo modulo sopprime in modo adattivo le interferenze di fondo e migliora le risposte delle caratteristiche nelle regioni polipali, identificando congiuntamente "cosa" è importante (dimensione del canale) e "dove" si trova il bersaglio (dimensione spaziale), assicurando che solo le caratteristiche raffinate siano coinvolte nella fusione successiva. La strategia di fusione delle caratteristiche multiscala (MSF) preserva sia informazioni semantiche profonde sia dettagli di confine superficiali attraverso un meccanismo gerarchico introdotto nel decodificatore. Integrando progressivamente le caratteristiche degli encoder potenziati da DAM con le caratteristiche del decoder upcampionate, questa strategia compensa efficacemente la perdita di dettaglio spaziale causata dal downsampling, consentendo una rilevazione accurata di piccoli polipi e una delineazione precisa dei confini.
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Questo studio utilizza solo dataset di immagini anonime per colonscopia pubblicamente disponibili (Kvasir-SEG). Non sono stati raccolti nuovi dati sui soggetti umani. Non erano richieste l'approvazione etica istituzionale e il consenso informato del paziente, come confermato dalle politiche di revisione istituzionale per analisi retrospettive di dataset pubblici deidentificati.
1. Preparazione dei dati
2. Architettura complessiva
NOTA: Consulta la Figura 1 per la backbone encoder–decoder a livello macro di PWD-Net, e la Figura 2 per l'integrazione e l'interazione dei moduli core all'interno del feature flow. L'architettura complessiva segue un design codificatore-decodificatore a forma di U per gestire variazioni di scala di polipi e interferenze di fondo nelle immagini di colonscopia.
3. Modulo di convoluzione a ruota a spirale (Figura 3)

4. Meccanismo di doppia attenzione (Figura 4)
NOTA: Il Dual-Attention Mechanism (DAM) è incorporato in ogni connessione skip per sopprimere il rumore di fondo e migliorare le caratteristiche della regione dei polipi sia dal canale che da quello spaziale.


5. Fusione di caratteristiche multi-scala
6. Funzione di perdita e configurazione di addestramento



7. Pseudocodice
Algoritmo 1: Segmentazione PWD-Net dei polipi
1: Input: Immagine della colonscopia I ∈R H×W×3
2: Output: Maschera di segmentazione M ∈ {0,1}(H×W)
3:
4: funzione PCM(X) ▷ Modulo di Convoluzione a Ruota
5: Definiamo nucleo base W (3 x 3), angoli Θ = {0°, 45°, ..., 315°}
6: per ogni θ ∈ Θ do
7: Wθ ← BilinearRotate(W, θ) ▷ Rotate kernel
8: Yθ ← Conv2d(X, Wθ) ▷ Caratteristiche specifiche per la direzione
9: fine per
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Y θ})))) ▷ Aggregate
11: riporta Yfuori
12: funzione finale
13:
14: funzione DAM(F) ▷ Meccanismo di doppia attenzione
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ Attenzione canale (r=16)
16: As ← Sigmoid(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ Attenzione spaziale
17: F' ← F ⊗ (α · Ac + β · As) ▷ Fusi con α imparabile, β (init=0.5)
18: ritorno F'
19: fine della funzione
20:
21: funzione PWD-Net(I)
22: Codificatore: e1,e 2,e 3,e 4,e 5 ← ResNet50_Stages(I) ▷ Codificatore preaddestrato a 5 stadi
23: Collo di bottiglia: b ← PCM(e5) ▷ Applicare PCM al collo di bottiglia
24: Saltare le connessioni: si ← DAM(e i) per i = 1, 2, 3, 4 ▷ Caratteristiche dell'encoder del filtro
25: Decodificatore:
26: d 4 ← DoubleConv(Concat(Up(b), s4))
27: d 3 ← DoubleConv(Concat(Up(d 4),s 3))
28: d 2 ← DoubleConv(Concat(Up(d3), s2))
29: d 1 ← DoubleConv(Concat(Up(d2), s1))
30: M ← Sigmoid (Conv1 x 1(d1))
31: ritorno M
32: funzione finale
33:
34: Allenamento:
35: per ogni epoca fai
36: M̂ ← PWD-Net(I)
37: L ← 0,5 · A.C.(M̂, MGT) + 0,5 · DadoLoss(M̂,M gt) ▷ λ = 0,5
38: Aggiornare i parametri tramite retropropagazione (Adam ottimizzar)
39: fine per
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Configurazione sperimentale
Dataset
Il dataset Kvasir SEG è stato utilizzato per valutare il comportamento di segmentazione di PWD Net su immagini di colonscopia con aspetto eterogeneo di polipi. Il dataset contiene immagini di polipi annotate in pixel da 1.000 e include variazioni nella dimensione, forma, texture, illuminazione e complessità dello sfondo, rendendolo adatto per valutare il rilevamento di piccoli bersagli, la localizzazione ...
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Diverse scelte di progettazione nel protocollo PWD-Net sono fondamentali per ottenere risultati di segmentazione affidabili e meritano un'attenta attenzione durante l'implementazione. Innanzitutto, la selezione e l'inizializzazione della backbone dell'encoder influenzano direttamente il comportamento di convergenza e le prestazioni finali. Il protocollo impiega un codificatore ResNet-50 pre-addestrato su ImageNet, che fornisce un'inizializzazione robusta delle funzionalità di basso e med...
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
Gli autori non hanno nulla da rivelare.
Questo studio è stato finanziato dal National Key R&D Program of China (Programmi n. 2022YFC3500200 e 2022YFC3500204).
Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.
| Nome | Azienda | Numero di catalogo | Commenti |
|---|---|---|---|
| Adam Optimizer | — | — | Incluso in PyTorch |
| Albumentations | Albumentations Team | v1.0+ | Libreria di augmentazione dei dati |
| CUDA Toolkit | NVIDIA | v11.3+ | Accelerazione GPU |
| Kvasir-SEG dataset | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Visualizzazione delle curve di addestramento |
| NumPy | NumPy Community | v1.21+ | Calcolo numerico |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU per l'addestramento e l'inferenza |
| OpenCV | OpenCV Community | v4.5+ | Pre-elaborazione delle immagini |
| Python | Python Software Foundation | v3.8+ | Lingua di programmazione |
| PyTorch | Meta Platforms | v1.12+ | Framework di apprendimento profondo |
| Pesi preaddestrati ResNet-50 | PyTorch Model Zoo | — | Preaddestrati su ImageNet-1K |
| Ubuntu | Canonical | 18.04+ | Sistema operativo |