Cette étude présente une variante légère d’U-Net avec une précision de segmentation améliorée en utilisant la convolution hybride et l’attention des canaux, obtenant des résultats de pointe sur MoNuseg et GlaS avec moins de paramètres.
Article de méthode
Cette étude présente une variante légère d’U-Net avec une précision de segmentation améliorée en utilisant la convolution hybride et l’attention des canaux, obtenant des résultats de pointe sur MoNuseg et GlaS avec moins de paramètres.
La technologie de traitement d’images par ordinateur basée sur un réseau de neurones artificiels s’est rapidement développée ces dernières années et a trouvé des applications généralisées dans de multiples domaines. Dans le traitement d’images médicales, UNet et ses variantes ont montré un grand succès dans la détection des lésions, la segmentation cellulaire et la segmentation des polypes. Cette recherche présente un réseau modifié en forme de U avec des paramètres de réseau réduits obtenus en diminuant la profondeur du réseau et en augmentant les canaux du réseau pour améliorer la capacité d’apprentissage du modèle. Pour contrer la réduction de la capacité d’apprentissage causée par la compression en profondeur, un module convolutif à canaux hybrides est introduit pour remplacer le module convolutif du réseau d’origine. Le modèle introduit un mécanisme d’attention de canal entre la couche et la couche de convolution ponctuelle pour améliorer la capacité pratique d’extraction des caractéristiques du canal. L’article conclut également que l’utilisation d’une convolution à profondeur mixte peut résoudre efficacement la plage de taille de la cible de segmentation, ce qui rend difficile l’ajustement d’un modèle pour plusieurs ensembles de données. Le modèle proposé permet d’obtenir des résultats de pointe sur deux ensembles de données publics populaires, MoNuseg et GlaS, avec une augmentation moyenne des dés de 1,0 % et 1,37 %, respectivement. Le total des paramètres du modèle modifié est réduit à 1,71 million, soit une réduction de 38,6 fois par rapport à UCtransNet, avec 65,6 millions de paramètres.
La segmentation des images médicales est essentielle dans diverses applications cliniques, notamment le diagnostic, la planification du traitement et la surveillance des maladies. Les méthodes traditionnelles de traitement d’images basées sur des algorithmes d’ingénierie des caractéristiques ne sont plus adaptées au traitement des grands volumes de données générés dans les environnements de santé modernes. Heureusement, les progrès de la technologie des réseaux neuronaux artificiels et les améliorations des capacités du matériel informatique ont permis d’entraîner et de déployer des modèles de réseaux neuronaux à grande échelle. Par conséquent, des algorithmes de traitement de la vision par ordinateur basés sur des modèles d’apprentissage automatique sont continuellement développés et appliqués dans divers domaines.
La structure modèle la plus représentative dans la segmentation sémantique des images médicales est UNet1 avec une architecture d’encodage-décodage. Le modèle utilise d’abord un encodeur à plusieurs niveaux pour extraire des caractéristiques de différentes échelles à partir de l’image d’entrée. Ensuite, le décodeur suréchantillonne pas à pas tout en combinant les caractéristiques sémantiques émises par l’encodeur du niveau correspondant sous forme de connexion de saut. Cependant, les performances de l’architecture UNet peuvent être encore améliorées en appliquant plusieurs méthodes. Par exemple, les mécanismes d’attention se sont révélés efficaces pour améliorer les performances des réseaux neuronaux convolutifs. Ces mécanismes peuvent mettre l’accent de manière sélective sur les caractéristiques essentielles des données d’entrée, ce qui permet d’améliorer l’apprentissage de la représentation et la précision de la segmentation.
À l’heure actuelle, de nombreux chercheurs se concentrent sur la fusion efficace des caractéristiques extraites par l’encodeur lors de l’étape de décodage. Parmi les variantes les plus courantes d’UNet, citons Attention UNet2, Recurrent UNet3 et V-Net4. Ces approches emploient des mécanismes d’attention5, tels que l’attention spatiale, pour mettre en évidence les régions informatives des cartes de caractéristiques et supprimer les régions non informatives. De plus, certaines variantes intègrent des réseaux neuronaux récurrents pour modéliser la nature séquentielle des images médicales et améliorer les représentations des caractéristiques. Les modèles de pré-entraînement, tels que VGG6, ResNet7 et DenseNet8, ont été largement utilisés pour améliorer les performances des réseaux en forme de U en tirant parti de leurs riches connaissances acquises à partir d’ensembles de données à grande échelle. De plus, des mécanismes de transformateur, tels que l’auto-attention et l’attention multi-têtes, ont été introduits dans les dépendances de modèles à longue portée et capturent des informations contextuelles globales, ce qui permet d’améliorer les performances de segmentation.
Cependant, bien que ces variantes se soient améliorées par rapport à l’UNet1 d’origine, elles présentent toujours certaines limites dans la gestion d’images médicales complexes à des échelles et des formes variables. De plus, la complexité accrue de ces variantes entraîne souvent des coûts de calcul plus élevés et des temps de formation plus longs, ce qui limite leur applicabilité dans des contextes pratiques.
Pour améliorer l’architecture UNet1 , un modèle modifié nommé MixKNet (Mix Kernel Size U-shape Net) est proposé, qui réduit la profondeur du réseau tout en augmentant le nombre de canaux pour améliorer la capacité d’apprentissage. Cependant, la réduction de la profondeur peut entraîner une baisse des performances globales. Pour atténuer ce problème, un module convolutif à canal hybride est introduit, remplaçant le module neuronal convolutif d’origine. Ce module intègre un mécanisme d’attention de canal entre les couches de convolution en profondeur et en point, dans le but de renforcer la capacité du modèle à extraire des caractéristiques de canal efficaces.
Pour guider l’applicabilité pratique, il est important de noter que la méthode proposée a été évaluée sur des ensembles de données d’images médicales à relativement petite échelle, avec des résolutions d’images individuelles allant de 500 × 500 à 1000 × 1000 pixels. Pour l’entraînement du modèle, toutes les images ont été redimensionnées à 224 × 224 pixels. L’implémentation a été réalisée à l’aide de PyTorch sur un seul GPU NVIDIA RTX 3090. Ces paramètres opérationnels suggèrent que la méthode est réalisable sur le plan informatique pour des configurations expérimentales modérées et qu’elle peut être adaptée à des ensembles de données de taille limitée.
En conclusion, cet article présente une nouvelle modification de la structure du réseau en forme de U et introduit un module de convolution de canal hybride ainsi qu’un mécanisme d’attention de canal, qui améliorent tous deux les performances de segmentation sur les ensembles de données d’images médicales. Les principales contributions de ce travail sont les suivantes : (1) Proposer une structure de réseau en forme de U modifiée avec un module de convolution hybride à sens profond qui remplace le module neuronal convolutif d’origine. (2) Introduction d’un mécanisme d’attention de canal entre la couche de convolution à sens profond et la couche de convolution à sens ponctuel pour améliorer la capacité efficace d’extraction des caractéristiques de canal du modèle. (3) Obtenir des résultats de pointe simultanément sur deux ensembles de données publics populaires dans l’ensemble de données de segmentation nucléaire MoNuseg9 avec significativement moins de paramètres de modèle (par rapport à UCtransNet10 avec 64M de paramètres) et des performances améliorées sur l’ensemble de données de segmentation des presse-étoupes GlaS11 .
Le reste de cet article est organisé comme suit. L’étape 2 fournit un examen complet des études antérieures sur UNet1 et ses variations dans la segmentation de l’image médicale. Les forces et les limites des approches existantes sont examinées, ainsi que les travaux connexes sur les mécanismes d’attention, les réseaux convolutifs à profondeur mixte et leurs applications dans les modèles de segmentation. L’étape 3 détaille l’architecture du modèle MixKNet proposé, y compris les modifications apportées à la structure UNet, l’intégration d’un mécanisme d’attention de canal et l’utilisation de la convolution à profondeur mixte. L’étape 4 présente les résultats d’expériences approfondies, accompagnées d’une discussion et d’une étude d’ablation afin d’évaluer les contributions de chaque composant. Enfin, l’étape 5 conclut l’article et décrit les orientations potentielles pour les recherches futures.
Cette section commence par un examen des études antérieures sur l’UNet et ses variantes dans la segmentation de l’image médicale, en soulignant les forces et les limites des méthodes existantes. En outre, des recherches connexes sur les mécanismes d’attention et leurs applications dans les modèles de segmentation sont discutées. Les développements récents impliquant des techniques de convolution en profondeur pour améliorer les performances de segmentation sont également examinés. Une analyse comparative du MixKNet (c) proposé et d’autres modèles est présentée à la figure 1, où les lignes pointillées indiquent les connexions sautées.
UNet et ses variantes
L’architecture UNet a été proposée pour la première fois par Ronneberger et al. en 20151 et a depuis été largement utilisée dans la segmentation d’images médicales. Le modèle se compose d’un chemin d’encodage et d’un chemin de décodage. L’encodeur extrait les caractéristiques de haut niveau de l’image d’entrée tandis que le décodeur suréchantillonne et combine les caractéristiques pour générer une carte de segmentation. Depuis, diverses modifications ont été apportées à l’architecture de l’UNet afin d’améliorer ses performances en matière de segmentation d’images médicales. L’une des modifications les plus courantes est l’introduction de connexions à benne basculante, dont il a été démontré qu’elles améliorent la précision de la segmentation. Zhou et al.12 ont proposé une variante UNet qui utilise des connexions de saut denses, ce qui permet au modèle de mieux préserver les informations spatiales.
Une autre modification populaire de l’architecture de l’UNet est l’ajout de mécanismes d’attention. Ces mécanismes peuvent aider le modèle à mettre l’accent de manière sélective sur les caractéristiques les plus importantes, ce qui permet un meilleur apprentissage de la représentation et une meilleure précision de segmentation. Parmi les exemples de variantes avec des mécanismes d’attention, citons Attention UNet2, ResUNet avec les portesd’attention 13 et Dense-UNet avec les portesd’attention 14. En plus des modifications ci-dessus, de nombreuses autres variantes de l’architecture UNet ont été proposées pour la segmentation d’images médicales. UCTransNet10 est une variante de l’architecture U-Net qui intègre des connexions skip et un module Transformer. Les connexions de saut dans UCTransNet10 sont repensées du point de vue des canaux, ce qui permet une meilleure réutilisation des fonctionnalités et réduit le nombre de paramètres. Le module Transformer est ajouté pour capturer les dépendances à longue portée et améliorer la qualité de la traduction. Il a été démontré que UCTransNet10 obtient des résultats de pointe sur plusieurs benchmarks de traduction automatique. Zihan et al. ont proposé un modèle d’apprentissage profond appelé LViT15, qu’ils ont appliqué à des tâches d’analyse d’images médicales. Pour étendre la version semi-supervisée de LViT15 et compenser le manque de qualité des données d’image, ils ont proposé le mécanisme d’itération exponentielle de pseudo-étiquette (EPI). De plus, pour préserver les caractéristiques locales des images, ils ont proposé le module d’attention au niveau du pixel (PLAM), qui se concentre de manière sélective sur les caractéristiques importantes de l’image.
Mécanisme d’attention
Les mécanismes de l’attention ont été largement étudiés dans l’apprentissage automatique, en particulier dans le traitement du langage naturel et la vision par ordinateur. Au cours des dernières années, des mécanismes d’attention ont également été appliqués à des tâches d’analyse d’images médicales, y compris la segmentation d’images. Bahdanau et al.16 ont introduit un mécanisme d’attention dans la traduction automatique neuronale pour améliorer la qualité de la traduction. Le mécanisme permet au modèle de se concentrer de manière sélective sur les parties pertinentes de la séquence d’entrée, améliorant ainsi la qualité de la traduction. Depuis lors, divers mécanismes d’attention ont été proposés pour les tâches d’analyse d’images. Un type courant de mécanisme d’attention est le mécanisme d’attention spatiale, qui consiste à appliquer un poids à chaque pixel de la carte des caractéristiques en fonction de son importance. Par exemple, Guo et al.17 ont proposé un mécanisme d’attention spatiale pour la tâche de segmentation des vaisseaux rétiniens. Le mécanisme utilise un mécanisme de contrôle pour ajuster la pondération des caractéristiques spatiales, améliorant ainsi la capacité du modèle à faire la distinction entre les pixels du navire et ceux qui ne sont pas du navire. Un autre type de mécanisme d’attention est l’attention de canal, qui se concentre sur l’ajustement des poids des cartes de caractéristiques entre les canaux. Hu et al.18 ont proposé un réseau de compression et d’excitation (SENet) qui applique une attention par canal aux cartes de caractéristiques, améliorant ainsi les performances de la tâche de classification d’images. Plus récemment, les mécanismes d’attention ont été combinés avec des réseaux de neurones convolutifs (CNN) pour des tâches de segmentation d’images. Par exemple, Chen et al.19 ont proposé un réseau guidé par l’attention pour la segmentation des tumeurs cérébrales qui combine des mécanismes d’attention spatiaux et par canal.
Les progrès récents de l’apprentissage semi-supervisé et multimodal pour l’analyse d’images médicales et la télédétection ont démontré des améliorations prometteuses des performances. Yang et al.20 ont proposé UMSCS, un nouveau cadre de segmentation multimodale non apparié qui exploite l’apprentissage génératif intermodal et les stratégies semi-supervisées. Zhang et al. ont introduit plusieurs techniques de pointe : un modèle de cohérence à trois branches amélioré par la preuve pour la segmentation semi-supervisée21, un cadre d’apprentissage prototypique auto-conscient et inter-échantillons pour la segmentation d’images médicales22, et une approche d’optimisation des caractéristiques hiérarchiques sensible au temps et à la fréquence pour la reconnaissance du brouillage par radar à synthèse d’ouverture (SAR) dans le domaine aérospatial23. Ces travaux soulignent collectivement l’importance de la supervision hybride et de la modélisation des caractéristiques sensibles au domaine dans les tâches d’imagerie médicale et d’ingénierie.
Convolution à profondeur
La convolution en profondeur est conçue pour capturer les corrélations par canal dans les cartes de caractéristiques d’entrée et il a été démontré qu’elle améliore l’efficacité et la précision des réseaux neuronaux convolutifs.
L’un des modèles de convolution en profondeur les plus anciens et les plus influents est MobileNet24, proposé par Howard et al. en 2017. MobileNet utilise la convolution séparable en profondeur, qui applique une convolution en profondeur suivie d’une convolution ponctuelle, afin de réduire le nombre de paramètres et de calculs requis pour les couches convolutives. Cela permet à MobileNet d’atteindre une précision de pointe sur les tâches de classification d’images tout en utilisant beaucoup moins de paramètres que les réseaux neuronaux convolutifs traditionnels. Depuis l’introduction de MobileNet, un certain nombre d’autres architectures de convolution en profondeur ont été proposées, notamment ShuffleNet25, Xception26 et ResNeXt27. Ces modèles varient dans leur implémentation spécifique de la convolution profonde, mais tous partagent l’objectif de réduire la complexité de calcul des couches convolutives tout en maintenant ou en améliorant la précision. La convolution profonde a également été appliquée à la tâche de segmentation sémantique, avec des modèles tels que PSPNet28 utilisant la convolution séparable en profondeur pour réduire les besoins en calcul et en mémoire des couches convolutives à grande échelle. MixNet29 étend encore l’idée de la convolution profonde en introduisant une convolution mixte en profondeur, qui utilise plusieurs tailles de noyau pour capturer des caractéristiques à différentes échelles. Il a été démontré qu’il surpasse d’autres modèles de pointe tout en conservant des paramètres et des FLOPs comparables. Ces modèles ont démontré des améliorations significatives de la précision et de l’efficacité par rapport aux réseaux de neurones convolutifs traditionnels sur diverses tâches de segmentation sémantique.
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Cette section décrit l’architecture MixKNet proposée pour la segmentation d’images médicales. Le modèle MixKNet étend l’architecture UNet, en incorporant des mécanismes d’attention et des couches de convolution mixtes en profondeur. Les logiciels utilisés dans cette étude sont énumérés dans la table des matériaux.
1. Architecture générale
2. Forme en U aplatie
REMARQUE : Réduisez la profondeur de l’architecture du réseau neuronal pour diminuer la complexité du calcul et la taille du modèle, tout en sachant que cela peut réduire la capacité d’apprentissage de représentations de données complexes.
3. Mélanger la taille du noyau pour l’encodeur
4. Canalisez l’attention
5. Ensembles de données
REMARQUE : Deux ensembles de données d’images médicales accessibles au public, tels que présentés dans les tableaux 1 et 2, sont utilisés dans cette étude : GlaS (Sirinukunwattana et al.11) et MoNuSeg (Kumar et al.9).
6. Détails de la mise en œuvre
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Comparaison avec les méthodes les plus récentes
L’architecture MixKNet a été évaluée sur deux ensembles de données de segmentation d’images médicales, GlaS et MoNuSeg, et comparée à des méthodes de pointe dans le domaine. L’évaluation a été réalisée en rapportant les scores dice et IoU de la méthode proposée et de plusieurs modèles comparables, comme le montre le tableau 3. Les résultats indiquent que l’architecture MixKNet surpasse les autres modèles,...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Cette étude présente MixKNet, une nouvelle modification de l’architecture UNet1 pour la segmentation d’images médicales, intégrant une convolution à profondeur mixte et un mécanisme d’attention de canal pour améliorer les performances de segmentation tout en réduisant considérablement la complexité de calcul. La convolution de canaux hybrides combine plusieurs noyaux convolutifs fonctionnant sur des groupes de canaux distincts. Cette conception permet au réseau de...
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Les auteurs ne déclarent aucun intérêt financier concurrent ou autre conflit d’intérêts.
Le deuxième lot des projets de recherche sur le bien-être social 2023 de la ville de Ningbo : recherche et application de technologies clés pour l’identification des fraudes sur les réseaux de télécommunications basée sur l’ontologie et le NLP (2023S169).
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
| Nom | Entreprise | Numéro de catalogue | Commentaires |
|---|---|---|---|
| Système d’exploitation Linux (Ubuntu 22.04) | ; Divers (Communauté Open Source) | N/A(Version 22.04 LTS) | Système d’exploitation open source pour le développement https://releases.ubuntu.com/22.04/ |
| RTX 3090 GPU | NVIDIA | 3090 | GPU haute performance pour l’apprentissage profond https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (Version &ge ; 3.8) | Langage de programmation pour le développement de l’IA/ML https://www.python.org/ |
| PyTorch | Meta AI | N/A (Version 1.13) | Framework d’apprentissage automatique open source https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Éditeur de code léger et puissant https://code.visualstudio.com/ |
Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.
Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE
Demander une autorisation