$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L’incidence du cancer de la thyroïde a augmenté rapidement depuis 1970, en particulier chez les femmes d’âge moyen1. Les nodules thyroïdiens peuvent prédire l’émergence d’un cancer de la thyroïde, et la plupart des nodules thyroïdiens sont asymptomatiques2. La détection précoce des nodules thyroïdiens est très utile pour guérir le cancer de la thyroïde. Par conséquent, selon les directives de pratique actuelles, tous les patients présentant un goitre nodulaire suspecté à l’examen physique ou présentant des résultats d’imagerie anormaux devraient subir un examen plus approfondi 3,4.
L’échographie thyroïdienne (US) est une méthode couramment utilisée pour détecter et caractériser les lésions thyroïdiennes 5,6. Les États-Unis sont une technologie pratique, peu coûteuse et sans rayonnement. Cependant, l’application des États-Unis est facilement affectée par l’opérateur 7,8. Des caractéristiques telles que la forme, la taille, l’échogénicité et la texture des nodules thyroïdiens sont facilement reconnaissables sur les images américaines. Bien que certaines caractéristiques américaines - calcifications, échogénicité et bordures irrégulières - soient souvent considérées comme des critères d’identification des nodules thyroïdiens, la présence d’une variabilité inter-observateurs est inévitable 8,9. Les résultats de diagnostic des radiologues ayant différents niveaux d’expérience sont différents. Les radiologistes inexpérimentés sont plus susceptibles de mal diagnostiquer que les radiologistes expérimentés. Certaines caractéristiques de l’US telles que les reflets, les ombres et les échos peuvent dégrader la qualité de l’image. Cette dégradation de la qualité d’image causée par la nature de l’imagerie américaine rend difficile même pour les médecins expérimentés de localiser les nodules avec précision.
Le diagnostic assisté par ordinateur (CAD) des nodules thyroïdiens s’est développé rapidement ces dernières années et peut réduire efficacement les erreurs causées par différents médecins et aider les radiologues à diagnostiquer les nodules rapidement et avec précision10,11. Divers systèmes de CAO basés sur CNN ont été proposés pour l’analyse des nodules thyroïdiens américains, y compris la segmentation 12,13, la détection 14,15 et la classification 16,17. CNN est un modèle d’apprentissage supervisémulticouche 18, et les modules de base de CNN sont les couches de convolution et de pooling. Les couches de convolution sont utilisées pour l’extraction d’entités et les couches de regroupement sont utilisées pour le sous-échantillonnage. Les calques convolutifs d’ombre peuvent extraire des entités primaires telles que la texture, les bords et les contours, tandis que les calques convolutifs profonds apprennent des entités sémantiques de haut niveau.
Les CNN ont eu beaucoup de succès dans la vision par ordinateur 19,20,21. Cependant, les CNN ne parviennent pas à capturer les dépendances contextuelles à longue portée en raison du champ récepteur valide limité des couches convolutionnelles. Dans le passé, les architectures de base pour la classification d’images utilisaient principalement des CNN. Avec l’avènement de Vision Transformer (ViT)22,23, cette tendance a changé, et maintenant de nombreux modèles de pointe utilisent des transformateurs comme épine dorsale. Basé sur des patchs d’image qui ne se chevauchent pas, ViT utilise un codeur de transformateur standard25 pour modéliser globalement les relations spatiales. Le Swin Transformer24 introduit en outre des fenêtres de changement de vitesse pour apprendre les fonctionnalités. Les fenêtres de changement de vitesse apportent non seulement une plus grande efficacité, mais réduisent également considérablement la longueur de la séquence car l’attention personnelle est calculée dans la fenêtre. Dans le même temps, l’interaction entre deux fenêtres adjacentes peut se faire par l’opération de déplacement (mouvement). L’application réussie du transformateur Swin en vision par ordinateur a conduit à l’étude d’architectures basées sur des transformateurs pour l’analyse d’images par ultrasons26.
Récemment, Li et al. ont proposé une approche d’apprentissage profond28 pour la détection du cancer papillaire thyroïdien inspirée de Faster R-CNN27. Faster R-CNN est une architecture classique de détection d’objets basée sur CNN. Le Faster R-CNN original comporte quatre modules: le backbone CNN, le réseau de proposition de région (RPN), la couche de mise en commun du retour sur investissement et la tête de détection. Le backbone CNN utilise un ensemble de couches conv+bn+relu+pooling de base pour extraire les cartes d’entités de l’image d’entrée. Ensuite, les cartes d’entités sont introduites dans le RPN et la couche de regroupement de retour sur investissement. Le rôle du réseau RPN est de générer des propositions régionales. Ce module utilise softmax pour déterminer si les ancres sont positives et génère des ancres précises par régression du cadre englobant. La couche de regroupement de ROI extrait les cartes d’entités de proposition en collectant les cartes d’entités et les propositions d’entrée et alimente les cartes d’entités de proposition dans la tête de détection suivante. La tête de détection utilise les cartes d’entités de proposition pour classer les objets et obtenir des positions précises des boîtes de détection par régression du cadre englobant.
Cet article présente un nouveau réseau de détection de nodules thyroïdiens appelé Swin Faster R-CNN formé en remplaçant le réseau fédérateur CNN dans Faster R-CNN par le transformateur Swin, ce qui permet une meilleure extraction des caractéristiques de détection des nodules à partir d’images échographiques. En outre, le réseau pyramidal de caractéristiques (FPN)29 est utilisé pour améliorer les performances de détection du modèle pour les nodules de différentes tailles en agrégeant des caractéristiques de différentes échelles.