$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Cette étude a utilisé un ensemble de données anonymisées et accessibles au public; par conséquent, aucun consentement éclairé n'était requis. L'approche proposée comprend six composants : prétraitement, module de convolution, module d'attention, intégration des modules de convolution et d'attention, et des couches entièrement connectées (FC). La figure 1 illustre le flux de travail complet de notre méthode.
Obtention du jeu de données
Les images IRM cérébrales étiquetées sont obtenues à partir d'un jeu de données Kaggle accessible au public comprenant quatre catégories de tumeurs et des tissus normaux.
Prétraitement des données
Les images sont redimensionnées à une résolution uniforme et normalisées en intensité. Une augmentation optionnelle (rotation, retournement, zoom) est appliquée pour améliorer la généralisation. Le jeu de données est divisé en ensembles d'entraînement (70%) et de test (30%).
Architecture du modèle
Trois CNN de base pré-entraînées sur ImageNet - MobileNetV2, EfficientNetV1 et Inception-ResNet-V2 - ont été utilisées pour classer les tumeurs cérébrales en quatre catégories à l'aide d'images IRM. MobileNetV2 et EfficientNetV1 ont été configurés avec une dimension d'entrée de 224 × 224 pixels, tandis que Inception-ResNet-V2 nécessitait une taille d'entrée de 299 × 299 pixels. Dans le processus d'apprentissage par transfert, les couches de convolution initiales ont été gelées au début pour conserver les caractéristiques d'image généralisées, tandis que les couches supérieures ont été ajustées pour adapter le modèle à la classification des tumeurs cérébrales. Chaque backbone a été associé à une tête de classification légère qui comprenait un Global Average Pooling, des couches denses, un dropout pour la régularisation et une fonction d'activation Softmax pour prédire quatre classes. Le dropout a été mis en œuvre pour atténuer le surapprentissage et améliorer la généralisation. L'architecture conçue a efficacement fusionné l'extraction efficace des caractéristiques avec des exigences de calcul plus faibles, facilitant une classification précise tout en restant adaptée au déploiement dans des scénarios à ressources limitées et de preuve de concept.
Extraction de caractéristiques basée sur l'attention
Les images d'entrée sont traitées par une couche de convolution initiale suivie d'un module d'attention personnalisé. Le pooling maximal et le pooling moyen en parallèle capturent les caractéristiques saillantes et contextuelles, qui sont concaténées et affinées par convolution pour mettre en évidence les régions pertinentes pour les tumeurs.
Backbone convolutionnel et fusion
Les caractéristiques pondérées par l'attention sont transmises aux backbones pré-entraînées (MobileNetV2, EfficientNetV1 ou Inception-ResNet-V2). Les couches de convolution de haut niveau sont logiquement fusionnées pour réduire l'accès à la mémoire et améliorer l'efficacité de calcul.
Classification
Les caractéristiques aplaties sont transmises par des couches entièrement connectées avec une activation ReLU6 et un dropout, produisant une représentation compacte pour la classification finale par softmax en quatre classes.
Évaluation
Les performances du modèle sont évaluées sur l'ensemble de test à l'aide de la précision, de la recall, du score F1 et des matrices de confusion.
Développement du cadre
La solution proposée est implémentée en Python et utilise Keras pour l'exécution. Le tableau 1 illustre les hyperparamètres. Le jeu de données est divisé en un ensemble d'entraînement et un ensemble de test suivant un rapport de 70:30. Cinq différents découpages arbitraires d'entraînements/tests sont utilisés pour afficher les performances équilibrées finales pour chaque ensemble de données.
Prétraitement
Les images d'entrée doivent être mises à jour car le cadre MobileNetV2 sert de base à la solution proposée. Pour extraire des caractéristiques haute résolution à partir de photographies, le modèle MobileNetV2 pré-entraîné est utilisé avec sa dimension d'entrée. Chaque image d'entrée est ensuite mise à l'échelle de 224×224 pixels dans la plage [-1, 1].
Le modèle de convolution
MobileNetV2 améliore la reconnaissance d'images en exploitant une architecture de réseau de neurones convolutionnels (CNN) efficace conçue pour minimiser les exigences de calcul. Bien que les CNN traditionnels atteignent une haute précision, ils nécessitent souvent une mémoire et une puissance de traitement considérables. MobileNetV1 a introduit le concept de convolution séparable par profondeur, qui sépare la convolution standard en deux opérations distinctes : la convolution par profondeur pour filtrer les entrées et la convolution par point pour intégrer les caractéristiques. MobileNetV2 s'appuie sur cette idée en incorporant des blocs résiduels à goulotte qui se composent de couches d'expansion, de convolution par profondeur, de couches de projection et de connexions résiduelles. La couche de projection compresse les canaux de caractéristiques, tandis que les connexions résiduelles facilitent un meilleur flux d'informations dans l'ensemble du réseau. Pour améliorer la stabilité et améliorer les performances d'apprentissage, l'activation ReLU6 et la normalisation par lot sont appliquées après les opérations de convolution.
Dans cette recherche, MobileNetV2, pré-entraîné sur ImageNet, a été utilisé comme modèle de base pour extraire les caractéristiques, fournissant des représentations sémantiques de haut niveau efficaces tout en maintenant des coûts de calcul faibles pour la classification des tumeurs cérébrales. Après chaque couche de convolution, il y a une couche d'activation ReLU6, qui est une adaptation de la fonction d'activation ReLU, où la taille est maximisée à six, et une couche de normalisation par lot. Les couches de convolution 1x1, de pooling moyen et de classification courantes sont appliquées à 17 des blocs de goulot restants, formant l'architecture complète de MobileNetV2. Nous avons utilisé MobileNetV2 comme réseau de base pré-entraîné sur ImageNet. Dans ce cas, la carte convolutionnelle est obtenue à partir du dernier bloc résiduel après passage par la couche convolutionnelle MobileNetV2. Les blocs résiduels de niveau inférieur produisent des cartes de caractéristiques plus petites. Ces blocs ne contribuent pas à notre recherche car ils ne recueillent pas de données de haut niveau pour l'identification globale de l'image. Pendant la construction et l'entraînement du modèle, les couches précédant les couches de convolution qui génèrent une carte de caractéristiques 3D de 7 × 7 sont maintenues fixes. En termes mathématiques, cela s'exprime comme suit dans l'équation (1):
F1(I) = Conv(I) (1)
Ici, F1(I) représente la caractéristique convolutionnelle extraite de l'image d'entrée, I.
Le module de focalisation
Le mécanisme d'attention du cerveau humain, qui implique que les gens se concentrent naturelle