Article de méthode

MixKNet : un réseau en forme de U modifié avec convolution de canaux hybrides pour la segmentation d’images médicales

DOI :

10.3791/68450

15 juillet 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente une variante légère d’U-Net avec une précision de segmentation améliorée en utilisant la convolution hybride et l’attention des canaux, obtenant des résultats de pointe sur MoNuseg et GlaS avec moins de paramètres.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La technologie de traitement d’images par ordinateur basée sur un réseau de neurones artificiels s’est rapidement développée ces dernières années et a trouvé des applications généralisées dans de multiples domaines. Dans le traitement d’images médicales, UNet et ses variantes ont montré un grand succès dans la détection des lésions, la segmentation cellulaire et la segmentation des polypes. Cette recherche présente un réseau modifié en forme de U avec des paramètres de réseau réduits obtenus en diminuant la profondeur du réseau et en augmentant les canaux du réseau pour améliorer la capacité d’apprentissage du modèle. Pour contrer la réduction de la capacité d’apprentissage causée par la compression en profondeur, un module convolutif à canaux hybrides est introduit pour remplacer le module convolutif du réseau d’origine. Le modèle introduit un mécanisme d’attention de canal entre la couche et la couche de convolution ponctuelle pour améliorer la capacité pratique d’extraction des caractéristiques du canal. L’article conclut également que l’utilisation d’une convolution à profondeur mixte peut résoudre efficacement la plage de taille de la cible de segmentation, ce qui rend difficile l’ajustement d’un modèle pour plusieurs ensembles de données. Le modèle proposé permet d’obtenir des résultats de pointe sur deux ensembles de données publics populaires, MoNuseg et GlaS, avec une augmentation moyenne des dés de 1,0 % et 1,37 %, respectivement. Le total des paramètres du modèle modifié est réduit à 1,71 million, soit une réduction de 38,6 fois par rapport à UCtransNet, avec 65,6 millions de paramètres.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La segmentation des images médicales est essentielle dans diverses applications cliniques, notamment le diagnostic, la planification du traitement et la surveillance des maladies. Les méthodes traditionnelles de traitement d’images basées sur des algorithmes d’ingénierie des caractéristiques ne sont plus adaptées au traitement des grands volumes de données générés dans les environnements de santé modernes. Heureusement, les progrès de la technologie des réseaux neuronaux artificiels et les améliorations des capacités du matériel informatique ont permis d’entraîner et de déployer des modèles de réseaux neuronaux à grande échelle. Par conséquent, des algorithmes de traitement de la vision par ordinateur basés sur des modèles d’apprentissage automatique sont continuellement développés et appliqués dans divers domaines.

La structure modèle la plus représentative dans la segmentation sémantique des images médicales est UNet1 avec une architecture d’encodage-décodage. Le modèle utilise d’abord un encodeur à plusieurs niveaux pour extraire des caractéristiques de différentes échelles à partir de l’image d’entrée. Ensuite, le décodeur suréchantillonne pas à pas tout en combinant les caractéristiques sémantiques émises par l’encodeur du niveau correspondant sous forme de connexion de saut. Cependant, les performances de l’architecture UNet peuvent être encore améliorées en appliquant plusieurs méthodes. Par exemple, les mécanismes d’attention se sont révélés efficaces pour améliorer les performances des réseaux neuronaux convolutifs. Ces mécanismes peuvent mettre l’accent de manière sélective sur les caractéristiques essentielles des données d’entrée, ce qui permet d’améliorer l’apprentissage de la représentation et la précision de la segmentation.

À l’heure actuelle, de nombreux chercheurs se concentrent sur la fusion efficace des caractéristiques extraites par l’encodeur lors de l’étape de décodage. Parmi les variantes les plus courantes d’UNet, citons Attention UNet2, Recurrent UNet3 et V-Net4. Ces approches emploient des mécanismes d’attention5, tels que l’attention spatiale, pour mettre en évidence les régions informatives des cartes de caractéristiques et supprimer les régions non informatives. De plus, certaines variantes intègrent des réseaux neuronaux récurrents pour modéliser la nature séquentielle des images médicales et améliorer les représentations des caractéristiques. Les modèles de pré-entraînement, tels que VGG6, ResNet7 et DenseNet8, ont été largement utilisés pour améliorer les performances des réseaux en forme de U en tirant parti de leurs riches connaissances acquises à partir d’ensembles de données à grande échelle. De plus, des mécanismes de transformateur, tels que l’auto-attention et l’attention multi-têtes, ont été introduits dans les dépendances de modèles à longue portée et capturent des informations contextuelles globales, ce qui permet d’améliorer les performances de segmentation.

Cependant, bien que ces variantes se soient améliorées par rapport à l’UNet1 d’origine, elles présentent toujours certaines limites dans la gestion d’images médicales complexes à des échelles et des formes variables. De plus, la complexité accrue de ces variantes entraîne souvent des coûts de calcul plus élevés et des temps de formation plus longs, ce qui limite leur applicabilité dans des contextes pratiques.

Pour améliorer l’architecture UNet1 , un modèle modifié nommé MixKNet (Mix Kernel Size U-shape Net) est proposé, qui réduit la profondeur du réseau tout en augmentant le nombre de canaux pour améliorer la capacité d’apprentissage. Cependant, la réduction de la profondeur peut entraîner une baisse des performances globales. Pour atténuer ce problème, un module convolutif à canal hybride est introduit, remplaçant le module neuronal convolutif d’origine. Ce module intègre un mécanisme d’attention de canal entre les couches de convolution en profondeur et en point, dans le but de renforcer la capacité du modèle à extraire des caractéristiques de canal efficaces.

Pour guider l’applicabilité pratique, il est important de noter que la méthode proposée a été évaluée sur des ensembles de données d’images médicales à relativement petite échelle, avec des résolutions d’images individuelles allant de 500 × 500 à 1000 × 1000 pixels. Pour l’entraînement du modèle, toutes les images ont été redimensionnées à 224 × 224 pixels. L’implémentation a été réalisée à l’aide de PyTorch sur un seul GPU NVIDIA RTX 3090. Ces paramètres opérationnels suggèrent que la méthode est réalisable sur le plan informatique pour des configurations expérimentales modérées et qu’elle peut être adaptée à des ensembles de données de taille limitée.

En conclusion, cet article présente une nouvelle modification de la structure du réseau en forme de U et introduit un module de convolution de canal hybride ainsi qu’un mécanisme d’attention de canal, qui améliorent tous deux les performances de segmentation sur les ensembles de données d’images médicales. Les principales contributions de ce travail sont les suivantes : (1) Proposer une structure de réseau en forme de U modifiée avec un module de convolution hybride à sens profond qui remplace le module neuronal convolutif d’origine. (2) Introduction d’un mécanisme d’attention de canal entre la couche de convolution à sens profond et la couche de convolution à sens ponctuel pour améliorer la capacité efficace d’extraction des caractéristiques de canal du modèle. (3) Obtenir des résultats de pointe simultanément sur deux ensembles de données publics populaires dans l’ensemble de données de segmentation nucléaire MoNuseg9 avec significativement moins de paramètres de modèle (par rapport à UCtransNet10 avec 64M de paramètres) et des performances améliorées sur l’ensemble de données de segmentation des presse-étoupes GlaS11 .

Le reste de cet article est organisé comme suit. L’étape 2 fournit un examen complet des études antérieures sur UNet1 et ses variations dans la segmentation de l’image médicale. Les forces et les limites des approches existantes sont examinées, ainsi que les travaux connexes sur les mécanismes d’attention, les réseaux convolutifs à profondeur mixte et leurs applications dans les modèles de segmentation. L’étape 3 détaille l’architecture du modèle MixKNet proposé, y compris les modifications apportées à la structure UNet, l’intégration d’un mécanisme d’attention de canal et l’utilisation de la convolution à profondeur mixte. L’étape 4 présente les résultats d’expériences approfondies, accompagnées d’une discussion et d’une étude d’ablation afin d’évaluer les contributions de chaque composant. Enfin, l’étape 5 conclut l’article et décrit les orientations potentielles pour les recherches futures.

Cette section commence par un examen des études antérieures sur l’UNet et ses variantes dans la segmentation de l’image médicale, en soulignant les forces et les limites des méthodes existantes. En outre, des recherches connexes sur les mécanismes d’attention et leurs applications dans les modèles de segmentation sont discutées. Les développements récents impliquant des techniques de convolution en profondeur pour améliorer les performances de segmentation sont également examinés. Une analyse comparative du MixKNet (c) proposé et d’autres modèles est présentée à la figure 1, où les lignes pointillées indiquent les connexions sautées.

UNet et ses variantes
L’architecture UNet a été proposée pour la première fois par Ronneberger et al. en 20151 et a depuis été largement utilisée dans la segmentation d’images médicales. Le modèle se compose d’un chemin d’encodage et d’un chemin de décodage. L’encodeur extrait les caractéristiques de haut niveau de l’image d’entrée tandis que le décodeur suréchantillonne et combine les caractéristiques pour générer une carte de segmentation. Depuis, diverses modifications ont été apportées à l’architecture de l’UNet afin d’améliorer ses performances en matière de segmentation d’images médicales. L’une des modifications les plus courantes est l’introduction de connexions à benne basculante, dont il a été démontré qu’elles améliorent la précision de la segmentation. Zhou et al.12 ont proposé une variante UNet qui utilise des connexions de saut denses, ce qui permet au modèle de mieux préserver les informations spatiales.

Une autre modification populaire de l’architecture de l’UNet est l’ajout de mécanismes d’attention. Ces mécanismes peuvent aider le modèle à mettre l’accent de manière sélective sur les caractéristiques les plus importantes, ce qui permet un meilleur apprentissage de la représentation et une meilleure précision de segmentation. Parmi les exemples de variantes avec des mécanismes d’attention, citons Attention UNet2, ResUNet avec les portesd’attention 13 et Dense-UNet avec les portesd’attention 14. En plus des modifications ci-dessus, de nombreuses autres variantes de l’architecture UNet ont été proposées pour la segmentation d’images médicales. UCTransNet10 est une variante de l’architecture U-Net qui intègre des connexions skip et un module Transformer. Les connexions de saut dans UCTransNet10 sont repensées du point de vue des canaux, ce qui permet une meilleure réutilisation des fonctionnalités et réduit le nombre de paramètres. Le module Transformer est ajouté pour capturer les dépendances à longue portée et améliorer la qualité de la traduction. Il a été démontré que UCTransNet10 obtient des résultats de pointe sur plusieurs benchmarks de traduction automatique. Zihan et al. ont proposé un modèle d’apprentissage profond appelé LViT15, qu’ils ont appliqué à des tâches d’analyse d’images médicales. Pour étendre la version semi-supervisée de LViT15 et compenser le manque de qualité des données d’image, ils ont proposé le mécanisme d’itération exponentielle de pseudo-étiquette (EPI). De plus, pour préserver les caractéristiques locales des images, ils ont proposé le module d’attention au niveau du pixel (PLAM), qui se concentre de manière sélective sur les caractéristiques importantes de l’image.

Mécanisme d’attention
Les mécanismes de l’attention ont été largement étudiés dans l’apprentissage automatique, en particulier dans le traitement du langage naturel et la vision par ordinateur. Au cours des dernières années, des mécanismes d’attention ont également été appliqués à des tâches d’analyse d’images médicales, y compris la segmentation d’images. Bahdanau et al.16 ont introduit un mécanisme d’attention dans la traduction automatique neuronale pour améliorer la qualité de la traduction. Le mécanisme permet au modèle de se concentrer de manière sélective sur les parties pertinentes de la séquence d’entrée, améliorant ainsi la qualité de la traduction. Depuis lors, divers mécanismes d’attention ont été proposés pour les tâches d’analyse d’images. Un type courant de mécanisme d’attention est le mécanisme d’attention spatiale, qui consiste à appliquer un poids à chaque pixel de la carte des caractéristiques en fonction de son importance. Par exemple, Guo et al.17 ont proposé un mécanisme d’attention spatiale pour la tâche de segmentation des vaisseaux rétiniens. Le mécanisme utilise un mécanisme de contrôle pour ajuster la pondération des caractéristiques spatiales, améliorant ainsi la capacité du modèle à faire la distinction entre les pixels du navire et ceux qui ne sont pas du navire. Un autre type de mécanisme d’attention est l’attention de canal, qui se concentre sur l’ajustement des poids des cartes de caractéristiques entre les canaux. Hu et al.18 ont proposé un réseau de compression et d’excitation (SENet) qui applique une attention par canal aux cartes de caractéristiques, améliorant ainsi les performances de la tâche de classification d’images. Plus récemment, les mécanismes d’attention ont été combinés avec des réseaux de neurones convolutifs (CNN) pour des tâches de segmentation d’images. Par exemple, Chen et al.19 ont proposé un réseau guidé par l’attention pour la segmentation des tumeurs cérébrales qui combine des mécanismes d’attention spatiaux et par canal.

Les progrès récents de l’apprentissage semi-supervisé et multimodal pour l’analyse d’images médicales et la télédétection ont démontré des améliorations prometteuses des performances. Yang et al.20 ont proposé UMSCS, un nouveau cadre de segmentation multimodale non apparié qui exploite l’apprentissage génératif intermodal et les stratégies semi-supervisées. Zhang et al. ont introduit plusieurs techniques de pointe : un modèle de cohérence à trois branches amélioré par la preuve pour la segmentation semi-supervisée21, un cadre d’apprentissage prototypique auto-conscient et inter-échantillons pour la segmentation d’images médicales22, et une approche d’optimisation des caractéristiques hiérarchiques sensible au temps et à la fréquence pour la reconnaissance du brouillage par radar à synthèse d’ouverture (SAR) dans le domaine aérospatial23. Ces travaux soulignent collectivement l’importance de la supervision hybride et de la modélisation des caractéristiques sensibles au domaine dans les tâches d’imagerie médicale et d’ingénierie.

Convolution à profondeur
La convolution en profondeur est conçue pour capturer les corrélations par canal dans les cartes de caractéristiques d’entrée et il a été démontré qu’elle améliore l’efficacité et la précision des réseaux neuronaux convolutifs.

L’un des modèles de convolution en profondeur les plus anciens et les plus influents est MobileNet24, proposé par Howard et al. en 2017. MobileNet utilise la convolution séparable en profondeur, qui applique une convolution en profondeur suivie d’une convolution ponctuelle, afin de réduire le nombre de paramètres et de calculs requis pour les couches convolutives. Cela permet à MobileNet d’atteindre une précision de pointe sur les tâches de classification d’images tout en utilisant beaucoup moins de paramètres que les réseaux neuronaux convolutifs traditionnels. Depuis l’introduction de MobileNet, un certain nombre d’autres architectures de convolution en profondeur ont été proposées, notamment ShuffleNet25, Xception26 et ResNeXt27. Ces modèles varient dans leur implémentation spécifique de la convolution profonde, mais tous partagent l’objectif de réduire la complexité de calcul des couches convolutives tout en maintenant ou en améliorant la précision. La convolution profonde a également été appliquée à la tâche de segmentation sémantique, avec des modèles tels que PSPNet28 utilisant la convolution séparable en profondeur pour réduire les besoins en calcul et en mémoire des couches convolutives à grande échelle. MixNet29 étend encore l’idée de la convolution profonde en introduisant une convolution mixte en profondeur, qui utilise plusieurs tailles de noyau pour capturer des caractéristiques à différentes échelles. Il a été démontré qu’il surpasse d’autres modèles de pointe tout en conservant des paramètres et des FLOPs comparables. Ces modèles ont démontré des améliorations significatives de la précision et de l’efficacité par rapport aux réseaux de neurones convolutifs traditionnels sur diverses tâches de segmentation sémantique.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette section décrit l’architecture MixKNet proposée pour la segmentation d’images médicales. Le modèle MixKNet étend l’architecture UNet, en incorporant des mécanismes d’attention et des couches de convolution mixtes en profondeur. Les logiciels utilisés dans cette étude sont énumérés dans la table des matériaux.

1. Architecture générale

  1. L’architecture MixKNet, illustrée à la figure 2, suit la structure standard UNet, composée d’un encodeur et d’un décodeur. Définissez la forme d’entrée sur 224 × 224 × 3. Dans l’encodeur, utilisez deux modules DownBlock, chacun comprenant une convolution de profondeur de 1×1, une couche de regroupement maximale de 2×2 et une convolution multi-noyaux (MDConv) avec des tailles de noyau telles que [1, 3, 5] ou [3-13].
  2. Dans le décodeur, utilisez deux modules UpBlock : chacun effectue un suréchantillonnage bilinéaire, une concaténation de connexion par saut, une convolution 1×1 en profondeur et une convolution multi-noyau.
  3. Utilisez les activations ReLU après chaque bloc convolutif. Appliquez une convolution finale 1×1 pour produire la sortie, suivie d’une activation Sigmoid pour la segmentation binaire, ou laissez inactivé pour un Softmax externe dans les tâches multiclasses.

2. Forme en U aplatie

REMARQUE : Réduisez la profondeur de l’architecture du réseau neuronal pour diminuer la complexité du calcul et la taille du modèle, tout en sachant que cela peut réduire la capacité d’apprentissage de représentations de données complexes.

  1. Réduire une architecture UNet à quatre niveaux à une version à deux niveaux, comme le montre la figure 3, afin de réduire le nombre de paramètres du modèle tout en conservant les composants de codage et de décodage de base.
    1. Construisez l’architecture aplatie en supprimant les niveaux 3 et 4 des chemins de l’encodeur et du décodeur, et conservez les connexions de fonctionnalités au niveau 2.
    2. Ajustez les opérations de sous-échantillonnage et de suréchantillonnage en conséquence pour correspondre à la profondeur réduite : utilisez une seule étape de sous-échantillonnage avant le goulot d’étranglement et une étape de suréchantillonnage après.
      REMARQUE : Cette réduction de la profondeur peut diminuer la capacité d’apprentissage du modèle, car il peut ne pas capturer les relations complexes entre l’entrée et la sortie. L’augmentation du nombre de canaux de convolution de base dans chaque couche du modèle peut aider à surmonter cette limitation en améliorant la capacité du modèle à apprendre des caractéristiques discriminantes. Avec plus de canaux de convolution, le modèle peut capturer des modèles et des relations plus complexes dans les données d’entrée, compensant ainsi la profondeur réduite et améliorant les performances.
  2. Considérez que l’augmentation du nombre de canaux de convolution peut également augmenter la complexité de calcul du modèle et l’utilisation de la mémoire, ce qui présente un compromis avec l’entraînement et la vitesse d’inférence. Trouvez un équilibre approprié entre la capacité du modèle et l’efficacité de calcul.

3. Mélanger la taille du noyau pour l’encodeur

  1. Pour améliorer les performances de l’encodeur, utilisez une approche de taille de noyau mixte dans le module DC-CA (Depthwise Convolution and Channel Attention), comme illustré à la figure 4. Au lieu de vous appuyer sur une seule taille de noyau, appliquez plusieurs convolutions en profondeur en parallèle avec des tailles de noyau variables (par exemple, 1, 3, 5, 7, 9, 11, 13) pour extraire des caractéristiques à plusieurs champs réceptifs.
  2. Appliquez la normalisation par lots et l’activation de ReLU à chaque branche individuellement avant la concaténation. Concaténez les sorties de chaque branche du noyau le long de la dimension du canal.
  3. Utilisez une convolution 1×1 ponctuelle après la concaténation pour fusionner des entités et les projeter sur un nombre fixe de canaux de sortie, en maintenant la cohérence avec la taille d’entrée attendue de la couche suivante.
    REMARQUE : La couche de convolution mixte dans le sens de la profondeur se compose de plusieurs circonvolutions dans le sens de la profondeur avec des tailles de noyau variables, suivies d’une convolution ponctuelle. Cette conception permet de capturer des caractéristiques à différentes échelles, ce qui est essentiel dans les tâches de segmentation d’images médicales. Le premier module utilise trois tailles de noyau (1, 3 et 5) pour augmenter le champ réceptif, tandis que le second module utilise des tailles de noyau plus grandes et plus de groupes, en particulier 3, 5, 7, 9, 11 et 13.

4. Canalisez l’attention

  1. Intégrez un mécanisme d’attention de canal dans le module DC-CA pour améliorer la représentation des caractéristiques.
    1. Utilisez une convolution 1×1 avec un remplissage « identique » pour générer des cartes d’attention par canal. Appliquez un regroupement moyen global sur les dimensions spatiales pour produire un descripteur compact pour chaque canal.
    2. Utilisez un réseau convolutif léger composé de deux convolutions 1×1 avec une activation ReLU entre les deux. Évitez le partage de poids entre les canaux - apprenez les poids d’attention uniques par canal.
    3. Appliquez une activation sigmoïde à la sortie finale pour obtenir des scores d’attention normalisés. Repondérez les mappages de fonctions d’entrée via la multiplication par canal.
      REMARQUE : Soit le tenseur d’entrée x. L’attention du canal est mise en œuvre par l’expression suivante :
      (attention)_tensor = σ(conv(ReLU(conv(x)))) (1)
      où σ représente la fonction d’activation sigmoïde, conv est l’opération de convolution et ReLU est la fonction d’activation d’unité linéaire rectifiée.
  2. Obtenez la carte d’attention en effectuant une opération de regroupement de moyenne adaptative sur le tenseur d’attention, puis en l’étendant pour qu’elle corresponde à la taille du tenseur de sortie après convolution avec une taille de noyau y différente :
    attention = agrandir(avg_pool([attention]_tensor),taille(y)) (2)
  3. Calculez le tenseur de sortie z en multipliant élément par élément le tenseur d’entrée y avec la carte d’attention :
    z = z * attention (3)
    où * représente la multiplication élément par élément

5. Ensembles de données

REMARQUE : Deux ensembles de données d’images médicales accessibles au public, tels que présentés dans les tableaux 1 et 2, sont utilisés dans cette étude : GlaS (Sirinukunwattana et al.11) et MoNuSeg (Kumar et al.9).

  1. Utilisez l’ensemble de données de segmentation des glandes (Sirinukunwattana et al.11), acquis à l’aide d’un scanner de pathologie numérique et annoté manuellement pour segmenter les structures glandulaires individuelles dans des échantillons de tissus.
    REMARQUE : L’ensemble de données se compose de 165 images, chacune avec une résolution de 500 × 500 pixels, ainsi que des masques de segmentation de vérité terrain correspondants. L’ensemble de données MoNuSeg (Kumar et al.9) comprend 51 images de noyaux microscopiques, chacune ayant une résolution de 1000 × 1000 pixels.

6. Détails de la mise en œuvre

  1. Implémentez le modèle à l’aide de PyTorch sur un seul GPU NVIDIA RTX 3090. Utilisez Ubuntu 22.04 comme système d’exploitation.
  2. Redimensionnez toutes les images d’entrée à une taille fixe de 224 × 224 pixels. Appliquer des techniques d’augmentation des données pour améliorer la diversité de l’entraînement.
    1. Appliquez des augmentations aléatoires dans l’ordre suivant : retournement horizontal → retournement vertical → rotation → correction gamma → transformation logarithmique → mise à l’échelle aléatoire.
    2. Appliquez des retournements horizontaux aléatoires avec une probabilité de 0,5, des retournements verticaux avec une probabilité de 0,5 et des rotations à moins de ±15 degrés avec une probabilité de 0,5.
    3. Appliquez la correction gamma avec une probabilité de 0,3, la transformation logarithmique avec une probabilité de 0,3 et la mise à l’échelle aléatoire avec un facteur d’échelle compris entre 0,9 et 1,1, appliquée avec une probabilité de 0,3.
    4. Normalisez les images à l’aide de valeurs moyennes de [0,485, 0,456, 0,406] et d’écarts-types de [0,229, 0,224, 0,225].
  3. Entraînez le modèle à l’aide de l’optimiseur Adam avec un taux d’apprentissage de 0,001 et une taille de lot de 4. Utilisez la technique d’ordonnancement du taux d’apprentissage par recuit cosinus avec redémarrages à chaud pour introduire de la variabilité dans le calendrier des taux d’apprentissage et empêcher la convergence vers les optima locaux.
    REMARQUE : Utilisez le torch.optim.lr_scheduler intégré de PyTorch. CosineAnnealingWarmRestarts scheduler. L’optimiseur et le planificateur ont été mis en œuvre comme suit :
    optimizer = torch.optim.Adam(model.parameters(), lr=0.001, weight_decay=1e-5)
    planificateur = torch.optim.lr_scheduler. CosineAnnealingWarmRestarts(
    optimiseur, T_0=10, T_mult=2, eta_min=1e-6)
    Ici, T_0=10 désigne le nombre d’époques avant le premier redémarrage, T_mult=2 double la période de redémarrage après chaque cycle, et eta_min=1e-6 fixe le taux d’apprentissage minimum. Mettez à jour le taux d’apprentissage à la fin de chaque époque en appelant scheduler.step().
  4. Utilisez l’entropie croisée binaire comme fonction de perte. Appliquez un arrêt précoce pour éviter le surapprentissage. Entraînez le modèle pour un maximum de 5000 époques.
  5. Évaluez les performances du modèle à l’aide de l’intersection moyenne sur l’union (mIoU) et du coefficient de dés.
    Dés =(2|A∩B|)/(|A|+|B|) (4)
    IoU=(|A∩B|)/(|A∪B|) (5)
    REMARQUE : Le mIoU est le rapport de l’intersection entre les masques de segmentation prédits et de vérité terrain et leur union. Dans le même temps, le coefficient de dés est le rapport entre deux fois l’intersection et la somme des masques de segmentation prédits et de vérité terrain.
  6. Effectuez une évaluation rigoureuse sur de petits ensembles de données à l’aide de trois séries de validation croisée en 5 parties, ce qui donne un total de 15 évaluations. Mélangez aléatoirement les divisions de validation croisée à chaque tour pour assurer la variabilité entre les plis. Stratifiez les plis en fonction des distributions de classe pour maintenir l’équilibre de l’étiquette dans chaque pli.
  7. Calculez les performances moyennes sur les plis pour atténuer le risque de convergence vers les optima locaux. Effectuer un test statistique pour démontrer que l’approche proposée permet d’obtenir des améliorations statistiquement significatives par rapport à des méthodes comparables.
  8. Affichez des prédictions de validation représentatives pendant l’entraînement dans la figure 5 pour illustrer l’amélioration progressive de la qualité de la segmentation. Une fois l’entraînement terminé, chargez le point de contrôle du modèle le plus performant en fonction des performances de validation (par exemple, le mIoU le plus élevé et le score Dice).
    1. Exécutez le modèle sur le jeu de validation pour générer des masques de segmentation prédits à l’aide des paramètres enregistrés.
    2. Visualisez les résultats à l’aide de Matplotlib en affichant l’image d’entrée, le masque de vérité terrain et le masque prédit dans un format côte à côte.
    3. Mettez en évidence la supériorité de la méthode proposée en termes de performances de segmentation en marquant les régions représentatives par des cases rouges dans la visualisation.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparaison avec les méthodes les plus récentes
L’architecture MixKNet a été évaluée sur deux ensembles de données de segmentation d’images médicales, GlaS et MoNuSeg, et comparée à des méthodes de pointe dans le domaine. L’évaluation a été réalisée en rapportant les scores dice et IoU de la méthode proposée et de plusieurs modèles comparables, comme le montre le tableau 3. Les résultats indiquent que l’architecture MixKNet surpasse les autres modèles,...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente MixKNet, une nouvelle modification de l’architecture UNet1 pour la segmentation d’images médicales, intégrant une convolution à profondeur mixte et un mécanisme d’attention de canal pour améliorer les performances de segmentation tout en réduisant considérablement la complexité de calcul. La convolution de canaux hybrides combine plusieurs noyaux convolutifs fonctionnant sur des groupes de canaux distincts. Cette conception permet au réseau de...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs ne déclarent aucun intérêt financier concurrent ou autre conflit d’intérêts.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le deuxième lot des projets de recherche sur le bien-être social 2023 de la ville de Ningbo : recherche et application de technologies clés pour l’identification des fraudes sur les réseaux de télécommunications basée sur l’ontologie et le NLP (2023S169).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Système d’exploitation Linux (Ubuntu 22.04)  ; Divers (Communauté Open Source)N/A(Version 22.04 LTS)Système d’exploitation open source pour le développement
https://releases.ubuntu.com/22.04/
RTX 3090 GPUNVIDIA3090GPU haute performance pour l’apprentissage profond
https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/
PythonPython Software FoundationN/A (Version &ge ; 3.8)Langage de programmation pour le développement de l’IA/ML
https://www.python.org/
PyTorchMeta AIN/A (Version 1.13)Framework d’apprentissage automatique open source
https://pytorch.org/
Visual Studio Code (VS Code)MicrosoftN/AÉditeur de code léger et puissant
https://code.visualstudio.com/
NVIDIA

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ronneberger, O., Fischer, P., Brox, T. U-Net: Convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  2. Oktay, O., et al. Attention U-Net: Learning where to look for the pancreas. arXiv. , (2018).
  3. Alom, M. Z., Yakopcic, C., Hasan, M., Taha, T. M., Asari, V. K. Recurrent residual U-Net for medical image segmentation. J Med Imaging. 6 (1), 014006-014006 (2019).
  4. Milletari, F., Navab, N., Ahmadi, S. -A. V-Net: Fully convolutional neural networks for volumetric medical image segmentation. 3DV. , 565-571 (2016).
  5. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  6. Simonyan, K., Zisserman, A. Very deep convolutional networks for large-scale image recognition. arXiv. , (2014).
  7. Deep residual learning for image recognition. He, K., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 770-778 (2016).
  8. Densely connected convolutional networks. Huang, G., Liu, Z., Van der Maaten, L., Weinberger, K. Q. Proc IEEE Conf Comput Vis Pattern Recognit, , 4700-4708 (2017).
  9. Kumar, N., et al. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE Trans Med Imaging. 36 (7), 1550-1560 (2017).
  10. Wang, H., Cao, P., Wang, J., Zaiane, O. R. UCTransNet: Rethinking the skip connections in U-Net from a channel-wise perspective with Transformer. Proc AAAI Conf Artif Intell. 36 (3), 2441-2449 (2022).
  11. Sirinukunwattana, K., et al. Gland segmentation in colon histology images: The GlaS challenge contest. Med Image Anal. 35, 489-502 (2017).
  12. Zhou, Z., Rahman Siddiquee, M. M., Tajbakhsh, N., Liang, J. UNet++: A nested U-Net architecture for medical image segmentation. Lect Notes Comput Sci. 11045, 3-11 (2018).
  13. Diakogiannis, F. I., Waldner, F., Caccetta, P., Wu, C. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS J Photogramm Remote Sens. 162, 94-114 (2020).
  14. Cai, S., Tian, Y., Lui, H., Zeng, H., Wu, Y., Chen, G. Dense-UNet: A novel multiphoton in vivo cellular image segmentation model based on a convolutional neural network. Quant Imaging Med Surg. 10 (6), 1275-1285 (2020).
  15. Li, Z., et al. LViT: Language meets Vision Transformer in medical image segmentation. IEEE Trans Med Imaging. 43 (1), 96-107 (2023).
  16. Bahdanau, D., Cho, K., Bengio, Y. Neural machine translation by jointly learning to align and translate. arXiv. , (2014).
  17. Guo, C., Szemenyei, M., Yi, Y., Zhou, W., Bian, H. Residual spatial attention network for retinal vessel segmentation. Proc ICONIP. 27, 509-519 (2020).
  18. Squeeze-and-excitation networks. Hu, J., Shen, L., Sun, G. Proc IEEE Conf Comput Vis Pattern Recognit, , 7132-7141 (2018).
  19. Chen, H., Qi, X., Yu, L., Dou, Q., Qin, J., Heng, P. -A. DCAN: Deep contour-aware networks for object instance segmentation from histology images. Med Image Anal. 36, 135-146 (2017).
  20. Yang, F., Li, X., Wang, B., Teng, P., Liu, G. UMSCS: A novel unpaired multimodal image segmentation method via cross-modality generative and semi-supervised learning. Int J Comput Vis. , 1-23 (2025).
  21. Zhang, Z., et al. An evidential-enhanced tri-branch consistency learning method for semi-supervised medical image segmentation. IEEE Trans Instrum Meas. , 1-15 (2024).
  22. Zhang, Z., et al. Self-aware and cross-sample prototypical learning for semi-supervised medical image segmentation. Med Image Comput Comput Assist Interv. 14372, 192-201 (2023).
  23. Zhang, Z., et al. A time-frequency-aware hierarchical feature optimization method for SAR jamming recognition. IEEE Trans Aerosp Electron Syst. , 1-15 (2025).
  24. Howard, A. G., et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv. , (2017).
  25. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Zhang, X., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 6848-6856 (2018).
  26. Xception: Deep learning with depthwise separable convolutions. Chollet, F. Proc IEEE Conf Comput Vis Pattern Recognit, , 1251-1258 (2017).
  27. Aggregated residual transformations for deep neural networks. Xie, S., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 1492-1500 (2017).
  28. Pyramid scene parsing network. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J. Proc IEEE Conf Comput Vis Pattern Recognit, , 2881-2890 (2017).
  29. Tan, M., Le, Q. V. MixConv: Mixed depthwise convolutional kernels. arXiv. , (2019).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Variantes de U Netattention des canauxconvolution profondeur mixted tection de l sionssegmentation cellulairesegmentation de polypesr duction des param tres du mod leextraction de caract ristiques
Vidéo bientôt disponible

Articles connexes