Dieses Protokoll implementiert ein U-förmiges Deep-Learning-Netzwerk, das Pinwheel-Konfaltung, Dual Attention und multiskalige Fusion integriert, um kolorektale Polypen zu segmentieren.
Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.
Methodenartikel
* These authors contributed equally
Dieses Protokoll implementiert ein U-förmiges Deep-Learning-Netzwerk, das Pinwheel-Konfaltung, Dual Attention und multiskalige Fusion integriert, um kolorektale Polypen zu segmentieren.
Eine genaue Segmentierung der kolorektalen Polypen ist entscheidend für die frühzeitige Prävention und Diagnose von Darmkrebs. Aufgrund der hohen Heterogenität der Polypen hinsichtlich Form, Größe und Textur sowie der Komplexität der Darmumgebung (wie Falten, spekulare Reflexionen und Kotreste) stehen bestehende Methoden jedoch weiterhin vor erheblichen Herausforderungen bei der Randlokalisierung und der Erkennung von kleinen Polypen. Um diese Probleme anzugehen, schlägt dieses Papier ein Polyp-Segmentierungsnetzwerk vor, das auf Pinwheel-Konvolution und Dual Attention (PWD-Net) basiert. Das vorgeschlagene Netzwerk verwendet eine U-förmige Encoder-Decoder-Architektur, bei der ein vortrainiertes ResNet als Encoder verwendet wird, um mehrstufige lokale Features zu extrahieren. Konkret wird an der Flaschenhalsschicht ein Pinwheel-Faltungsmodul (PCM) eingeführt, um die globale geometrische Struktur und multidirektionale kontextuelle Informationen von Polypen durch mehreckig rotierte Faltungskerne zu erfassen. Ein Dual-Attention-Mechanismus (DAM), der Kanal-Aufmerksamkeit und räumliche Aufmerksamkeit integriert, ist darauf ausgelegt, Hintergrundrauschen adaptiv zu unterdrücken und Polypen-Regionen-Merkmale zu verbessern. Darüber hinaus wird eine Multi-scale Feature Fusion (MSF)-Strategie eingesetzt, um tiefe semantische Informationen mit flachen Randdetails zu kombinieren und so sowohl Vollständigkeit als auch Präzision der Segmentierungsergebnisse sicherzustellen. Experimente an den Datensätzen Kvasir-SEG und CVC-ClinicDB zeigen, dass PWD-Net durchschnittliche Würfelkoeffizienten von 0,865 bzw. 0,944 sowie IoU-Werte von 0,765 bzw. 0,892 erreicht und damit bestehende State-of-the-Art-Methoden deutlich übertrifft. Ablationsstudien überprüfen die Wirksamkeit jedes Moduls, und Datensatz-übergreifende Bewertungen bestätigen die starke Verallgemeinerungsfähigkeit des Modells. Diese Studie bietet eine hochpräzise und robuste Lösung für die klinische Polypensegmentierung, bietet einen erheblichen Nutzen für die frühzeitige Diagnose kolorektaler präkanzeröser Läsionen und unterstützt computergestützte Interventionen.
Darmkrebs ist einer der häufigsten bösartigen Tumore weltweit und weist durchgehend hohe Inzidenz- und Sterblichkeitsraten auf. Studien haben gezeigt, dass die meisten Darmkrebserkrankungen durch adenomatöse Polypen entstehen, ein Prozess, der typischerweise 10–15 Jahre dauert und ein wertvolles Zeitfenster für frühzeitige Erkennung und Intervention bietet. Ein Anstieg der Adenom-Erkennungsrate (ADR) um 1 % kann das Risiko für Darmkrebs um etwa 3 % senken und die Patientensterblichkeit signifikantsenken. Die Koloskopie, die als Goldstandard für die Darmkrebsvorsorge gilt, ermöglicht die direkte Entfernung von Polypen während der Untersuchung und reduziert so die Krebshäufigkeit und Sterblichkeit effektiv.
Die konventionelle Koloskopie hängt jedoch stark von der Erfahrung und dem Können der Endoskopisten ab. Faktoren wie subjektives Urteil, visuelle Müdigkeit und Ablenkung können zu einer Fehlquote von 20 % bis 30 % führen, was die Effektivität des Screenings direkt beeinflusst2. Daher ist die Entwicklung computergestützter Erkennungssysteme (CAD) zur automatischen Segmentierung kolorektaler Polypen von großer Bedeutung, um ADR zu verbessern und übersehene Diagnosen zu reduzieren. Jüngste klinische Umfragen haben zudem das Interesse an der Integration künstlicher Intelligenz in die Untersuchung endoskopischer Läsionen hervorgehoben, was die Notwendigkeit robuster und reproduzierbarerSegmentierungsmethoden unterstreicht.
In den letzten Jahren hat Deep Learning bemerkenswerte Fortschritte in der medizinischen Bildanalyse erzielt, insbesondere bei konvolutionellen neuronalen Netzwerken (CNNs), die eine starke Fähigkeit zur Feature-Extraktion und -Darstellung für Bildsegmentierungsaufgaben zeigen4. Als klassisches Modell der medizinischen Bildsegmentierung verwendet U-Net eine symmetrische Encoder-Decoder-Architektur und überspringt Verbindungen, um eine genaue Pixel-Segmentierung zu erreichen, womit es zu einem Maßstab in diesem Bereichwird. Aufbauend auf U-Net wurden viele verbesserte Architekturen vorgeschlagen, um komplexe Aufgaben der medizinischen Bildsegmentierung zu bewältigen. UNet++ verringert die semantische Lücke zwischen Encoder- und Decoder-Feature-Maps, indem es verschachtelte und dichte Skip-Verbindungen6 einführt. ResUNet++ integriert Residualblöcke, Quetsch- und Anregungsmodule, dilatierte Faltungen und Aufmerksamkeitsmechanismen und erzielt eine starke Leistung bei Polypensegmentierung7. U2-Net verwendet eine zweistufe, verschachtelte U-förmige Struktur, um mehrskalige Feature-Informationen8 zu erfassen. In jüngerer Zeit wurde ein auf Doppel-Encoder-Decoder-basiertem Deep Polyp Segmentation Network vorgeschlagen, das parallele Codierungs- und Dekodierungspfade nutzt, um die Segmentierungsgenauigkeitweiter zu verbessern.
Unterdessen bietet die Einführung von Aufmerksamkeitsmechanismen neue Lösungen zur Feature-Enhancement und Rauschunterdrückung. Aufmerksamkeits-U-Net verwendet Aufmerksamkeitsgatter, um sich auf Zielbereiche zu konzentrieren und dabei irrelevante Hintergrundinformationen zu unterdrücken10. Das Dual Attention Network (DANet) gewichtet adaptiv Features sowohl aus Kanal- als auch aus der räumlichenDimension 11 und verbessert so die Wahrnehmung kritischer Merkmale. Triple Attention Networks (TANet) verbessern die Segmentierungsleistung weiter durch adaptive Auswahl von Multi-Scale-Funktionen12.
Mit dem Erfolg von Transformer-Architekturen in der Verarbeitung natürlicher Sprachen und Computer Vision13 haben Forscher begonnen, deren Anwendungen in der Segmentierung medizinischer Bilder zu erforschen. TransUNet war das erste, das einen Transformator als Encoder einsetzte, um Langstreckenabhängigkeiten effektiv14 zu modellieren. Swin-UNet verwendet eine reine Transformer-Architektur und erreicht eine effiziente globale Informationsaggregation durch einen verschobenen Fenstermechanismus15. UTNet schlägt eine hybride Architektur vor, die die lokale Feature-Extraction-Fähigkeit von CNNs mit der globalen Modellierungsfähigkeit von Transformers16 kombiniert.
Im Bereich der Polypensegmentierung nutzt Polyp-PVT einen Pyramidenvision-Transformer, um multiskalige globale semantische Informationen17 zu erfassen, während multiskaliges verschachteltes UNet das kontextuelle Verständnis durch Integration von Transformers18 verbessert. Jüngste Studien haben auch negative Korrelationslernstrategien für domänenübergreifende Polypensegmentierung19, Gompertz-verstärkte Segmentierungsverbesserung20 und aufmerksamkeitsbasierte Architekturen mit Randsteuerung21 untersucht. Obwohl diese Ansätze die Segmentierungsleistung bis zu einem gewissen Grad verbessern, steht die Polypensegmentierung weiterhin vor mehreren Herausforderungen. Erstens zeigen Polypen eine hohe Heterogenität in Morphologie, Größe und Textur, die von Mikropolypen kleiner als 5 mm bis zu großen Polypen von über 30 mm reichen, mit Formen von kreisförmigen und elliptischen bis hin zu sehr unregelmäßigen Formen. Zweitens ist die Darmumgebung komplex und variabel, wobei Schleimhautfalten, spiegelnde Reflexionen, Fäkalrückstände und Nahrungsmittelreste starke Hintergrundstörungen verursachen. Drittens haben viele Polypen verschwommene Grenzen, können teilweise durch Falten verdeckt oder in Darmflüssigkeiten eingetaucht sein, was die präzise Grenzlokalisierung äußerstschwierig macht.
Bestehende Methoden weisen weiterhin klare Einschränkungen bei der Bewältigung dieser Herausforderungen auf. Traditionelle CNNs sind effektiv darin, lokale Textur- und Kantenmerkmale zu extrahieren; Allerdings eignen sich feste quadratische Faltungskerne nicht gut zur Erfassung verschiedener geometrischer Formen23, insbesondere für hochgradig unregelmäßige Polypen, und können multidirektionale geometrische Merkmale nicht effektiv modellieren. Transformatorbasierte Methoden können globale Abhängigkeiten modellieren, sind jedoch weniger effektiv bei der Erfassung feiner lokaler Details und Randinformationen. Darüber hinaus macht ihre hohe Rechenkomplexität sie für Echtzeit-klinische Anwendungenweniger geeignet 24. Jüngste Polypensegmentierungsansätze wie PraNet, das Reverse-Attention-Module zur Verfeinerung von Schlüsselregionen25 verwendet, randgelenkte Kaskaden-Aufmerksamkeitsnetzwerke, die die Randfeature-Extraktionverbessern 26, und CAFE-Net, das Encoder- und Decoder-Features durch Cross-Attention-Mechanismenfusioniert 27, stoßen weiterhin auf unzureichende Merkmalsrepräsentation und ungenaue Randlokalisierung bei kleinen Polypen28, verschwommene Grenzen und komplexe Hintergründe. Darüber hinaus vernachlässigen die meisten Methoden die geometrische Morphologie und nutzen multidirektionale kontextuelle Informationen nicht vollständig aus, was zu einer suboptimalen Segmentierung unregelmäßig geformter Polypen führt.
Zusammenfassend sind derzeit CNN-basierte Methoden nicht in der Lage, multidirektionale geometrische Merkmale zu erfassen, da sie auf Faltungskernen mit festen Quadraten angewiesen sind. Transformatorbasierte Ansätze bieten globale Modellierung, opfern jedoch die lokale Randgenauigkeit und verursachen hohe Rechenkosten. Unterdessen wurden bestehende aufmerksamkeitsverstärkte und multiskalige Fusionsstrategien nicht gemeinsam innerhalb eines einheitlichen Rahmens optimiert, der speziell auf Polypensegmentierungzugeschnitten ist 29. Diese Lücken motivieren die Entwicklung einer Methode, die gleichzeitig geometrische Merkmalsmodellierung, adaptive Rauschunterdrückung und maßstabsübergreifende Merkmalsintegration berücksichtigt.
Um diese Probleme zu lösen, stellt dieses Protokoll ein Polyp Segmentation Network auf Basis von Pinwheel Convolution and Dual Attention (PWD-Net) vor. Das vorgeschlagene Netzwerk integriert geometrische Merkmalsmodellierung, mehrdimensionale Aufmerksamkeitssteigerung und mehrskalige Merkmalsfusion, was eine präzise Segmentierung komplexer Polypen ermöglicht. Die Hauptbeiträge dieser Arbeit werden wie folgt zusammengefasst: Das Pinwheel-Faltungsmodul (PCM), inspiriert von der Struktur eines Windrads, ein neuartiges rotiertes Faltungskern-Design wird vorgeschlagen, das multidirektionale geometrische Merkmale von Polypen durch Faltungsoperationen in mehreren Winkeln (0°, 45°, 90°, 135°, 180°, 225°, 270° und 315°) erfasst. Dieses Modul ersetzt die konventionelle Faltungsschicht im Engpassstadium, ermöglicht eine effektive Wahrnehmung unterschiedlicher Kantenorientierungen und verbessert die Darstellung unregelmäßig geformter Polypen erheblich. Der Dual-Attention-Mechanismus (DAM) adressiert Hintergrundrauschen wie Falten, Reflexionen und Kotreste in Koloskopiebildern. Ein Dual-Attention-Modul wird entwickelt, das Kanal-Aufmerksamkeit und räumliche Aufmerksamkeit integriert. In Skip-Verbindungen eingebettet, unterdrückt dieses Modul adaptiv Hintergrundinterferenzen und verbessert die Feature-Reaktionen in Polypenregionen, indem es gemeinsam identifiziert, "was" wichtig ist (Kanaldimension) und "wo" sich das Ziel befindet (räumliche Dimension), wodurch sichergestellt wird, dass bei der anschließenden Fusion nur verfeinerte Merkmale beteiligt sind. Die Multi-Scale Feature Fusion Strategy (MSF) bewahrt sowohl tiefe semantische Informationen als auch oberflächliche Randdetails durch einen hierarchischen Mechanismus, der im Decoder eingeführt wurde. Durch die schrittweise Integration von DAM-verbesserten Encoderfunktionen mit hochgemusterten Decoderfunktionen kompensiert diese Strategie effektiv den durch Downsampling verursachten räumlichen Detailverlust und ermöglicht so eine genaue Erkennung kleiner Polypen und eine präzise Grenzabgrenzung.
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Diese Studie verwendet ausschließlich öffentlich zugängliche, anonymisierte Koloskopie-Bilddatensätze (Kvasir-SEG). Es wurden keine neuen Daten aus menschlichen Probanden erhoben. Eine institutionelle Ethikgenehmigung und die informierte Patienteneinwilligung waren nicht erforderlich, wie die institutionellen Überprüfungsrichtlinien für retrospektive Analysen de-identifizierter öffentlicher Datensätze bestätigen.
1. Datenvorbereitung
2. Gesamtarchitektur
HINWEIS: Siehe Abbildung 1 für das Makro-Encoder-Decoder-Backbone von PWD-Net und Abbildung 2 für die Integration und Interaktion der Kernmodule im Feature-Flow. Die Gesamtarchitektur folgt einem U-förmigen Encoder-Decoder-Design, um Skalenvariationen von Polypen und Hintergrundinterferenzen in Koloskopiebildern zu bewältigen.
3. Pinwheel-Faltungsmodul (Abbildung 3)

4. Dual-Aufmerksamkeits-Mechanismus (Abbildung 4)
HINWEIS: Der Dual-Attention-Mechanismus (DAM) ist in jede Skip-Verbindung eingebettet, um Hintergrundrauschen zu unterdrücken und Polypenregionenmerkmale sowohl in Kanal- als auch in räumlichen Dimensionen zu verbessern.


5. Multi-Scale Feature Fusion
6. Verlustfunktion und Trainingskonfiguration



7. Pseudocode
Algorithmus 1: PWD-Net-Polypensegmentierung
1: Eingabe: Koloskopie-Bild I ∈ RH×W×3
2: Ausgabe: Segmentierungsmaske M ∈ {0,1}(H×W)
3:
4: Funktion PCM(X) ▷ Pinwheel-Faltungsmodul
5: Definiere den Basiskern W (3 x 3), Winkel Θ = {0°, 45°, ..., 315°}
6: für jedes θ ∈ Θ tun
7: Wθ ← BilinearRotate(W, θ) ▷ Rotate Kernel
8: Yθ ← Conv2d(X, Wθ) ▷ Richtungsspezifische Merkmale
9: Ende für
10: Yout ← ReLU(BN(Conv1 x 1(Concat({Yθ})))) ▷ Aggregate
11: Yzurück
12: Funktion beenden
13:
14: Funktion DAM(F) ▷ Dual-Aufmerksamkeitsmechanismus
15: Ac ← Sigmoid(MLP(AvgPool(F))) ▷ Kanal-Aufmerksamkeit (r=16)
16: As ← Sigmoid(Conv7 x 7([AvgPool(F); MaxPool(F)])) ▷ Räumliche Aufmerksamkeit
17: F' ← F ⊗ (α · Ac + β · As) ▷ Verschmelzen mit lernbarer α, β (init=0.5)
18: Rückkehr F'
19: Funktion beenden
20:
21: Funktion PWD-Net(I)
22: Encoder: e1, e2, e3, e4, e5 ← ResNet50_Stages(I) ▷ 5-stufiger vortrainierter Encoder
23: Engpass: b ← PCM(e5) ▷ PCM am Engpass anwenden
24: Überspringverbindungen: si ← DAM(ei) für i = 1, 2, 3, 4 ▷ Funktionen des Filter-Encoders
25: Decoder:
26: d4 ← DoubleConv(Concat(Up(b), s4))
27: D3 ← DoubleConv(Concat(Up(D4), S3))
28: Sieg2 ← Doppelkonv (Concat (Oben(D 3), S.2))
29: Sieg1 ← DoubleConv(Concat(Up(D2), S. 1))
30: M ← Sigmoid (Konv1 x 1(d1))
31: Rückkehr M
32: Funktion beenden
33:
34: Training:
35: Für jede Epoche tun Sie
36: M̂ ← PWD-Net(I)
37: L ← 0,5 · BCE(M̂, Mgt) + 0,5 · DiceLoss(M̂, Mgt) ▷ λ = 0,5
38: Aktualisieren Sie Parameter über Backpropagation (Adam optimizer)
39: Ende für
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Versuchsaufbau
Datensatz
Der Kvasir SEG-Datensatz wurde verwendet, um das Segmentierungsverhalten von PWD Net auf Koloskopiebildern mit heterogenen Polypenerscheinungen zu bewerten. Der Datensatz enthält 1.000 Pixel annotierte Polypenbilder und beinhaltet Variationen in Polypengröße, Form, Textur, Beleuchtung und Hintergrundkomplexität, was ihn geeignet macht, um Kleinzielerkennung, Randlokalisierung und Robustheit gegenüber visuellen Inter...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Mehrere Designentscheidungen im PWD-Net-Protokoll sind entscheidend für die Erzielung zuverlässiger Segmentierungsergebnisse und erfordern sorgfältige Aufmerksamkeit während der Implementierung. Erstens beeinflusst die Auswahl und Initialisierung des Encoder-Backbone direkt das Konvergenzverhalten und die Endleistung. Das Protokoll verwendet einen ResNet-50-Encoder, der auf ImageNet vortrainiert ist und eine robuste Low-Level- und Mid-Level-Feature-Initialisierung ermöglicht. Dies ist be...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Die Autoren haben nichts offenzulegen.
Diese Studie wurde vom National Key R&D Program Chinas finanziert (Programmnummern 2022YFC3500200 und 2022YFC3500204).
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
| Name | Unternehmen | Katalognummer | Kommentare |
|---|---|---|---|
| Adam Optimizer | — | — | In PyTorch enthalten |
| Albumentations | Albumentations Team | v1.0+ | Bibliothek für Datenerweiterung |
| CUDA Toolkit | NVIDIA | v11.3+ | GPU-Beschleunigung |
| Kvasir-SEG-Datensatz | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Visualisierung von Trainingskurven |
| NumPy | NumPy Community | v1.21+ | Numerische Berechnung |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU für Training und Inferenz |
| OpenCV | OpenCV Community | v4.5+ | Bildvorverarbeitung |
| Python | Python Software Foundation | v3.8+ | Programmiersprache |
| PyTorch | Meta Platforms | v1.12+ | Deep-Learning-Framework |
| ResNet-50 vortrainierte Gewichte | PyTorch Model Zoo | — | ImageNet-1K vortrainiert |
| Ubuntu | Canonical | 18.04+ | Betriebssystem |