Ce protocole implémente un réseau d’apprentissage profond en forme de U intégrant convolution en moulin à vent, double attention et fusion multi-échelle pour segmenter les polypes colorectals.
Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.
Article de méthode
* These authors contributed equally
Ce protocole implémente un réseau d’apprentissage profond en forme de U intégrant convolution en moulin à vent, double attention et fusion multi-échelle pour segmenter les polypes colorectals.
Une segmentation précise des polypes colorectaux est cruciale pour la prévention précoce et le diagnostic du cancer colorectal. Cependant, en raison de la forte hétérogénéité des polypes en termes de forme, de taille et de texture, ainsi que de la complexité de l’environnement intestinal (tels que les plis, les réflexions spéculaires et les résidus fécals), les méthodes existantes rencontrent encore des défis importants dans la localisation des limites et la détection des petits polypes. Pour répondre à ces problèmes, cet article propose un réseau de segmentation des polypes basé sur la convolution en moulin à épingle et la double attention (PWD-Net). Le réseau proposé adopte une architecture encodeur-décodeur en U, où un ResNet pré-entraîné est employé comme encodeur pour extraire des fonctionnalités locales multi-niveaux. Plus précisément, un module de convolution Pinwheel (PCM) est introduit à la couche goulot d’étranglement pour capturer la structure géométrique globale et l’information contextuelle multidirectionnelle des polypes via des noyaux de convolution rotés à plusieurs angles. Un mécanisme à double attention (DAM) qui intègre l’attention du canal et l’attention spatiale est conçu pour supprimer de manière adaptative le bruit de fond et renforcer les caractéristiques de la région des polypes. De plus, une stratégie de fusion multi-échelle (MSF) est employée pour combiner des informations sémantiques profondes avec des détails de frontières peu profonds, garantissant à la fois l’exhaustivité et la précision des résultats de segmentation. Des expériences menées sur les ensembles de données Kvasir-SEG et CVC-ClinicDB démontrent que PWD-Net atteint des coefficients Dice moyens de 0,865 et 0,944, et des scores IoU de 0,765 et 0,892 respectivement, surpassant nettement les méthodes de pointe existantes. Les études d’ablation vérifient l’efficacité de chaque module, et les évaluations croisées confirment la forte capacité de généralisation du modèle. Cette étude propose une solution robuste et de haute précision pour la segmentation clinique des polypes, offrant une valeur significative pour le diagnostic précoce des lésions précancéreuses colorectales et soutenant l’intervention assistée par ordinateur.
Le cancer colorectal est l’une des tumeurs malignes les plus courantes dans le monde, avec des taux d’incidence et de mortalité constamment élevés. Des études ont montré que la plupart des cancers colorectaux se développent à partir de polypes adénomateux, un processus qui dure généralement 10 à 15 ans, offrant une fenêtre temporelle précieuse pour la détection précoce et l’intervention. Une augmentation de 1 % du taux de détection des adénomes (ADR) peut réduire le risque de cancer colorectal d’environ 3 %, diminuant significativement la mortalité despatients 1. La coloscopie, considérée comme la référence en matière de dépistage du cancer colorectal, permet l’élimination directe des polypes lors de l’examen, réduisant ainsi efficacement l’incidence et la mortalité du cancer.
Cependant, la coloscopie conventionnelle dépend fortement de l’expérience et du niveau de compétence des endoscopistes. Des facteurs tels que le jugement subjectif, la fatigue visuelle et la distraction peuvent entraîner un taux d’échec de 20 % à 30 %, ce qui affecte directement l’efficacité du dépistage2. Par conséquent, développer des systèmes de détection assistée par ordinateur (CAO) pour la segmentation automatique des polypes colorrectaux revêt une importance considérable pour améliorer la RAM et réduire les diagnostics manqués. Des enquêtes cliniques récentes ont également mis en lumière l’intérêt pour l’intégration de l’intelligence artificielle dans les flux de travail d’évaluation endoscopique des lésions, renforçant ainsi la nécessité de méthodes de segmentation robusteset reproductibles 3.
Ces dernières années, l’apprentissage profond a réalisé des progrès remarquables dans l’analyse d’images médicales, en particulier les réseaux neuronaux convolutionnels (CNN), qui démontrent une forte capacité d’extraction et de représentation de caractéristiques pour les tâches de segmentationd’images 4. En tant que modèle classique de segmentation d’image médicale, U-Net utilise une architecture encodeur-décodeur symétrique et des connexions à saut pour obtenir une segmentation précise au niveau des pixels, devenant une référence dans cedomaine 5. S’appuyant sur U-Net, de nombreuses architectures améliorées ont été proposées pour répondre à des tâches complexes de segmentation d’images médicales. UNet++ réduit l’écart sémantique entre les cartes de caractéristiques de l’encodeur et du décodeur en introduisant des connexions de saut imbriquées etdenses 6. ResUNet++ intègre des blocs résiduels, des modules de compression et d’excitation, des convolutions dilatées et des mécanismes d’attention, atteignant de fortes performances en segmentation depolypes 7. U2-Net adopte une structure imbriquée en forme de U à deux niveaux pour capturer des informations de caractéristiquesmulti-échelle 8. Plus récemment, un réseau de segmentation profonde de polypes basé sur un double encodeur-décodeur a été proposé, exploitant les chemins d’encodage et de décodage parallèles pour améliorer encore la précision desegmentation 9.
Par contre, l’introduction de mécanismes d’attention apporte de nouvelles solutions pour l’amélioration des caractéristiques et la suppression du bruit. Attention U-Net utilise des portails d’attention pour se concentrer sur les régions cibles tout en supprimant les informations de fond nonpertinentes 10. Le Double Attention Network (DANet) pondère adaptativement les caractéristiques à partir des dimensions du canal etspatiales 11, améliorant ainsi la perception des caractéristiques critiques. Les réseaux à triple attention (TANet) améliorent encore la performance de segmentation grâce à la sélection adaptative de fonctionnalitésmulti-échelle 12.
Avec le succès des architectures Transformer dans le traitement du langage naturel et la vision parordinateur 13, les chercheurs ont commencé à explorer leur application dans la segmentation d’images médicales. TransUNet a été le premier à utiliser un Transformer comme encodeur pour modéliser efficacement les dépendances à longueportée 14. Swin-UNet adopte une architecture purement Transformer et réalise une agrégation globale efficace de l’information grâce à un mécanisme à fenêtredécalée 15. UTNet propose une architecture hybride qui combine la capacité d’extraction locale des caractéristiques des CNN avec la modélisation globale de Transformers16.
Dans le domaine de la segmentation des polypes, Polyp-PVT utilise un Transformer à vision pyramidale pour capturer l’information sémantique globalemulti-échelle 17, tandis que l’UNet imbriqué multi-échelle améliore la compréhension contextuelle en intégrant Transformers18. Des études récentes ont également exploré des stratégies d’apprentissage par corrélation négative pour la segmentation inter-domainedes polypes 19, l’amélioration de la segmentation augmentée parGompertz 20, ainsi que des architectures basées sur l’attention incorporant un guidage de frontière21. Bien que ces approches améliorent dans une certaine mesure la performance de la segmentation, la segmentation des polypes rencontre encore plusieurs défis. Premièrement, les polypes présentent une forte hétérogénéité morphologie, taille et texture, allant de micro-polypes de plus de 5 mm à de gros polypes dépassant 30 mm, avec des formes allant de circulaires et elliptiques à des formes très irrégulières. Deuxièmement, l’environnement intestinal est complexe et variable, où les plis muqueuss, les réflexions spéculaires, les résidus fécaux et les débris alimentaires introduisent une interférence de fond sévère. Troisièmement, de nombreux polypes présentent des frontières floues, peuvent être partiellement obstrués par des plis ou submergés dans des liquides intestinaux, rendant la localisation précise des limites extrêmementdifficile 22.
Les méthodes existantes présentent encore des limites claires pour relever ces défis. Les CNN traditionnels sont efficaces pour extraire les textures locales et les contours ; cependant, les noyaux de convolution carrés fixes ne sont pas bien adaptés à la capture de formes géométriques diverses23, en particulier pour les polypes très irréguliers, et ne peuvent pas modéliser efficacement des caractéristiques géométriques multidirectionnelles. Les méthodes basées sur des transformateurs peuvent modéliser les dépendances globales mais sont moins efficaces pour capturer des détails locaux fins et des informations de frontière. De plus, leur grande complexité de calcul les rend moins adaptés aux applications cliniques en tempsréel 24. Les approches récentes de segmentation des polypes telles que PraNet, qui utilise des modules d’attention inversée pour affiner les régionsclés 25, les réseaux d’attention en cascade guidés par les frontières qui améliorent l’extraction des caractéristiquesdes limites 26, et CAFE-Net, qui fusionne les caractéristiques encodeur et décodeur via des mécanismes d’attentioncroisée 27, rencontrent encore une représentation des caractéristiques insuffisante et une localisation des limites imprécise lors de la gestion de petitspolypes 28, des frontières floues et des arrière-plans complexes. De plus, la plupart des méthodes négligent la morphologie géométrique et ne parviennent pas à exploiter pleinement les informations contextuelles multidirectionnelles, ce qui entraîne une segmentation sous-optimale des polypes de forme irrégulière.
En résumé, les méthodes actuelles basées sur CNN ne permettent pas de capturer des caractéristiques géométriques multidirectionnelles en raison de leur dépendance aux noyaux de convolution carrés fixes. Les approches basées sur les transformateurs offrent une modélisation globale mais sacrifient la précision des frontières locales et imposent des coûts de calcul élevés. Par ailleurs, les stratégies existantes de fusion à attention améliorée et à plusieurs échelles n’ont pas été optimisées conjointement dans un cadre unifié spécifiquement adapté à la segmentationdes polypes 29. Ces lacunes motivent le développement d’une méthode qui aborde simultanément la modélisation géométrique des caractéristiques, la suppression adaptative du bruit et l’intégration des caractéristiques à l’échelle croisée.
Pour résoudre ces problèmes, ce protocole présente un réseau de segmentation de polypes basé sur la convolution en moulin à éponge et la double attention (PWD-Net). Le réseau proposé intègre la modélisation géométrique des caractéristiques, l’amélioration de l’attention multidimensionnelle et la fusion de caractéristiques à plusieurs échelles, permettant une segmentation précise des polypes complexes. Les principales contributions de ce travail sont résumées ainsi : le module de convolution en moulin à pile (PCM), inspiré de la structure d’un moulin à vent, propose un nouveau noyau de convolution tourné qui capture les caractéristiques géométriques multidirectionnelles des polypes par des opérations de convolution à plusieurs angles (0°, 45°, 90°, 135°, 180°, 225°, 270° et 315°). Ce module remplace la couche de convolution conventionnelle à l’étape du goulot d’étranglement, permettant une perception efficace des orientations diverses des arêtes et améliorant significativement la représentation des polypes de forme irrégulière. Le mécanisme de double attention (DAM) traite les bruits de fond tels que les plis, les réflexions et les résidus fécaux dans les images de coloscopie. Un module à double attention intégrant l’attention canalisée et l’attention spatiale est conçu. Intégré dans les connexions à saut, ce module supprime de manière adaptative les interférences de fond et améliore les réponses des caractéristiques dans les régions polypes en identifiant conjointement « ce qui » est important (dimension du canal) et « où » la cible se trouve (dimension spatiale), garantissant que seules les caractéristiques affinées sont impliquées dans la fusion ultérieure. La stratégie de fusion de caractéristiques multi-échelles (MSF) préserve à la fois des informations sémantiques profondes et des détails superficiels des frontières grâce à un mécanisme hiérarchique introduit dans le décodeur. En intégrant progressivement les caractéristiques de l’encodeur amélioré par DAM avec des caractéristiques de décodeur suréchantillonné, cette stratégie compense efficacement la perte de détails spatiale causée par le downsampling, permettant une détection précise de petits polypes et une délimitation précise des frontières.
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Cette étude utilise uniquement des ensembles de données d’images anonymisées et anonymisées publiques (Kvasir-SEG). Aucune nouvelle donnée sur les sujets humains n’a été collectée. L’approbation éthique institutionnelle et le consentement éclairé des patients n’étaient pas requis, comme le confirment les politiques d’examen institutionnel pour les analyses rétrospectives de jeux de données publics désidentifiés.
1. Préparation des données
2. Architecture générale
REMARQUE : Voir la Figure 1 pour la colonne vertébrale encodeur-décodeur au niveau macro de PWD-Net, et la Figure 2 pour l’intégration et l’interaction des modules de base dans le flux de fonctionnalités. L’architecture globale suit un design encodeur-décodeur en forme de U pour gérer les variations d’échelle des polypes et les interférences de fond dans les images de coloscopie.
3. Module de convolution des moulins à piquet (Figure 3)

4. Mécanisme de double attention (Figure 4)
REMARQUE : Le mécanisme de double attention (DAM) est intégré à chaque connexion de saut pour supprimer le bruit de fond et renforcer les caractéristiques de la région polyp, tant dans les dimensions du canal que spatiales.


5. Fusion multi-échelle des caractéristiques
6. Fonction de perte et configuration d’entraînement



7. Pseudocode
Algorithme 1 : Segmentation des polypes PWD-Net
1 : Entrée : Image de coloscopie I ∈ RH×W×3
2 : Sortie : Masque de segmentation M ∈ {0,1}(H×W)
3:
4 : fonction Module de convolution PCM(X) ▷ Moulin à vent
5 : Définissons le noyau de base W (3 x 3), angles Θ = {0°, 45°, ..., 315°}
6 : pour chaque θ ∈ Θ faire
7 : Wθ ← BilinearRotate(W, θ) ▷ Rotate kernel
8 : Yθ ← Conv2d(X, Wθ) ▷ Caractéristiques spécifiques à la direction
9 : fin pour
10 : Yout ← ReLU(BN(Conv1 x 1(Concat({Yθ})))) ▷ Aggregate
11 : retour de Ydehors
12 : fin de fonction
13:
14 : fonction DAM(F) ▷ Mécanisme à double attention
15 : Ac ← Sigmoid(MLP(AvgPool(F))) ▷ Attention de canal (r=16)
16 : As ← Sigmoid (Conv7 x 7([AvgPool(F) ; MaxPool(F)])) ▷ Attention spatiale
17 : F' ← F ⊗ (α · Ac + β · As) ▷ Fusionner avec α apprenable, β (init=0,5)
18 : retour F'
19 : fonction finale
20:
21 : fonction PWD-Net(I)
22 : Encodeur : e1,e 2,e 3,e 4,e 5 ← ResNet50_Stages(I) ▷ Encodeur préentraîné à 5 étapes
23 : Goulot d’étranglement : b ← PCM(e5) ▷ Appliquer PCM au goulot d’étranglement
24 : Ignorer les connexions : si ← DAM(e i) pour i = 1, 2, 3, 4 ▷ Fonctionnalités de l’encodeur du filtre
25 : Décodeur :
26 : d 4 ← DoubleConv(Concat(Up(b), s4))
27 : d 3 ← DoubleConv(Concat(Up(d4), s3))
28 : d 2 ← DoubleConv(Concat(Up(d3), s2))
29 : d 1 ← DoubleConv(Concat(Up(d 2), s1))
30 : M ← Sigmoïde (Conv1 x 1(d1))
31 : retour M
32 : fonction finale
33:
34 : Entraînement :
35 : pour chaque époque, faire
36 : M̂ ← PWD-Net(I)
37 : L ← 0,5 · av. J.-C. (M̂,M gt) + 0,5 · DésPerte (M̂,M gt) ▷ λ = 0,5
38 : Mettre à jour les paramètres via rétropropagation (Adamoptimiser r)
39 : fin pour
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Installation expérimentale
Jeu de données
Le jeu de données Kvasir SEG a été utilisé pour évaluer le comportement de segmentation de PWD Net sur des images de coloscopie présentant des apparences de polypes hétérogènes. Le jeu de données contient des images annotées de 1 000 pixels de polypes et comprend des variations de taille, de forme, de texture, d’illumination et de complexité de fond des polypes, ce qui le rend adapté à l’évaluation ...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Plusieurs choix de conception dans le protocole PWD-Net sont essentiels pour obtenir des résultats de segmentation fiables et méritent une attention particulière lors de la mise en œuvre. Premièrement, la sélection et l’initialisation de la dorsale de l’encodeur influencent directement le comportement de convergence et la performance finale. Le protocole utilise un encodeur ResNet-50 pré-entraîné sur ImageNet, qui offre une initialisation robuste des fonctionnalités bas et moyen niveau. ...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Les auteurs n’ont rien à divulguer.
Cette étude a été financée par le Programme national de recherche et développement clé de Chine (programmes n° 2022YFC3500200 et 2022YFC3500204).
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
| Nom | Entreprise | Numéro de catalogue | Commentaires |
|---|---|---|---|
| Adam Optimizer | — | — | Inclus dans PyTorch |
| Albumentations | Albumentations Team | v1.0+ | Bibliothèque d'augmentation de données |
| CUDA Toolkit | NVIDIA | v11.3+ | Accélération GPU |
| Kvasir-SEG dataset | SimulaMet | — | https://datasets.simula.no/kvasir-seg/ |
| Matplotlib | Matplotlib Community | v3.4+ | Visualisation des courbes d'apprentissage |
| NumPy | NumPy Community | v1.21+ | Calcul numérique |
| NVIDIA Tesla P100 | NVIDIA | P100-PCIE-16GB | GPU pour l'entraînement et l'inférence |
| OpenCV | OpenCV Community | v4.5+ | Prétraitement d'image |
| Python | Python Software Foundation | v3.8+ | Langage de programmation |
| PyTorch | Meta Platforms | v1.12+ | Cadre de deep learning |
| ResNet-50 pretrained weights | PyTorch Model Zoo | — | Préentraîné sur ImageNet-1K |
| Ubuntu | Canonical | 18.04+ | Système d'exploitation |