Method Article

Un cadre d'apprentissage par transfert guidé par l'attention pour la classification des tumeurs cérébrales en quatre classes à l'aide de l'IRM

DOI:

10.3791/69087

July 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un cadre d'apprentissage profond léger basé sur l'attention pour la classification de tumeurs cérébrales en quatre classes à partir d'images IRM en utilisant l'apprentissage par transfert avec MobileNetV2, EfficientNetV1 et Inception-ResNet-V2. Le modèle atteint une précision élevée de classification avec une complexité computationnelle réduite, prenant en charge les applications de support décisionnel clinique à ressources limitées.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'objectif de cette recherche est de développer un cadre d'apprentissage automatique léger mais précis pour classifier les tumeurs cérébrales en quatre catégories—gliomes, méningiomes, tumeurs hypophysaires et tissus cérébraux sains—en utilisant des données d'imagerie par résonance magnétique (IRM). La méthodologie proposée combine l'apprentissage par transfert avec trois modèles de réseau de neurones convolutifs pré-entraînés—MobileNetV2, EfficientNetV1 et Inception-ResNet-V2—intégrés avec un mécanisme d'attention qui émulera la capacité du système visuel humain à se concentrer sur des régions cliniquement pertinentes d'une image. Cette approche guidée par l'attention améliore la localisation des tumeurs tout en supprimant les informations de fond non pertinentes. Le cadre est évalué sur un grand ensemble de données d'IRM cérébrales publiquement disponibles contenant des milliers d'images étiquetées réparties sur les quatre classes. Des protocoles standard de prétraitement, d'augmentation des données et d'entraînement sont employés pour permettre une réplication directe de la méthode proposée. Les résultats expérimentaux démontrent qu'EfficientNetV1 atteint la meilleure performance de classification, atteignant une précision supérieure à celle de MobileNetV2 et d'Inception-ResNet-V2. L'étude conclut que le cadre léger basé sur l'attention proposé équilibre efficacement la précision et la complexité computationnelle, le rendant hautement approprié pour les applications de santé en temps réel et mobiles, en particulier dans des environnements à ressources limitées.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La classification précise des tumeurs cérébrales à l'aide de l'imagerie par résonance magnétique (IRM) joue un rôle crucial dans le diagnostic clinique, la planification du traitement et l'estimation du pronostic1. Les tumeurs cérébrales, y compris le gliome, les méningiomes et les tumeurs hypophysaires, présentent des caractéristiques pathologiques et des réponses au traitement distinctes ; par conséquent, une identification précoce et fiable est essentielle pour améliorer les résultats thérapeutiques et réduire la progression de la maladie. L'IRM est largement préférée pour l'évaluation des tumeurs cérébrales en raison de son contraste supérieur des tissus mous, de sa nature non invasive et de sa capacité à visualiser la morphologie de la tumeur sur plusieurs plans anatomiques. Cependant, l'interprétation manuelle des IRM est souvent chronophage et fortement dépendante de l'expertise radiologique, en particulier lorsque les limites de la tumeur sont irrégulières ou lorsqu'il existe des similitudes visuelles entre les classes de tumeurs. Par conséquent, les systèmes automatisés d'aide au diagnostic par ordinateur sont devenus de plus en plus importants pour aider les radiologues dans la classification précise et efficace des tumeurs.

Les techniques d'analyse d'images basées sur l'apprentissage profond (AP) ont considérablement fait progresser la classification automatisée des maladies dans les applications biomédicales et de vision par ordinateur2,3. En neuro-oncologie, les techniques d'apprentissage automatique et d'apprentissage par transfert ont démontré des performances prometteuses pour les tâches de détection, de segmentation et de classification des tumeurs4. Les réseaux de neurones convolutionnels (CNN), en particulier, ont montré une capacité supérieure à extraire automatiquement des caractéristiques d'images hiérarchiques directement à partir des IRM sans recourir à une ingénierie de fonctions manuelle. Les architectures de CNN peuvent apprendre des représentations discriminatoires liées aux tumeurs à partir des données d'imagerie, améliorant ainsi les performances de classification par rapport aux approches d'apprentissage automatique conventionnelles. Les progrès récents de l'AP ont permis le développement de systèmes de classification d'images haute performance capables de traiter des ensembles de données d'imagerie à grande échelle avec une précision améliorée et une intervention humaine réduite.

Malgré ces avancées, les architectures de CNN profondes conventionnelles nécessitent souvent des ressources informatiques substantielles, y compris une consommation élevée de mémoire, une complexité accrue des paramètres et un temps d'entraînement important5. Ces exigences computationnelles limitent leur mise en œuvre dans des environnements cliniques à ressources limitées et dans les systèmes de santé mobile. De plus, les architectures de réseaux de neurones convolutionnels légers ont attiré une attention croissante en raison de leur complexité computationnelle réduite et de leur adéquation pour le déploiement dans des applications à faibles ressources5. Plusieurs études récentes ont exploré des stratégies de CNN optimisées, des mécanismes d'extraction de fonctions efficaces et des cadres de déploiement légers pour améliorer l'efficacité de la classification sans compromettre significativement la précision prédictive6,7,8. Cependant, l'équilibre entre l'efficacité computationnelle et les performances robustes de classification multi-classes des tumeurs reste un défi majeur dans l'analyse des tumeurs cérébrales basée sur l'IRM9.

Les cadres d'apprentissage profond basés sur l'attention sont apparus comme des solutions efficaces pour améliorer la représentation des fonctionnalités dans l'analyse d'images médicales10. Les mécanismes d'attention permettent aux réseaux de neurones de mettre sélectivement l'accent sur les régions d'images diagnostiquement pertinentes tout en supprimant les informations de fond non pertinentes. Inspirés du système visuel humain, les architectures guidées par l'attention améliorent l'apprentissage des caractéristiques discriminatoires en dirigeant la concentration computationnelle vers les régions spatiales spécifiques aux tumeurs et les caractéristiques contextuelles. Ces mécanismes sont particulièrement bénéfiques pour l'analyse des IRM des tumeurs cérébrales car les tissus tumoraux présentent fréquemment des motifs d'intensité hétérogènes, une morphologie irrégulière et des caractéristiques visuelles qui se chevauchent entre les catégories de tumeurs. Par conséquent, l'intégration de modules d'attention dans les architectures basées sur les CNN peut améliorer la précision de la classification et améliorer les performances de localisation des caractéristiques.

Plusieurs études récentes ont démontré le potentiel des cadres d'apprentissage profond pour le diagnostic automatisé des tumeurs cérébrales et la classification des tumeurs basée sur l'IRM11,12. Gao et al. ont développé et validé un modèle d'apprentissage profond pour le diagnostic des tumeurs cérébrales à l'aide de données IRM, démontrant une forte capacité de classification pour l'analyse automatisée des images neurologiques11. De même, Abdusalomov et al. ont étudié des approches de détection des tumeurs cérébrales basées sur l'apprentissage profond à l'aide de scans IRM et ont rapporté des performances diagnostiques prometteuses12. Bien que ces études aient amélioré la précision de la classification, les limitations liées à la diversité des ensembles de données, à la généralisation des modèles et aux exigences computationnelles restent non résolues. Dans de nombreux cas, les ensembles de données d'entraînement étaient de taille limitée ou dérivés de sources cliniques restreintes, augmentant ainsi le risque de surapprentissage et réduisant la robustesse dans des populations de patients hétérogènes.

Pour améliorer la visualisation et l'extraction des caractéristiques des tumeurs, les techniques d'analyse et de reconstruction IRM multimodales ont également été explorées13,14. Sun et al. ont étudié l'évaluation des gliomes basée sur l'IRM multimodale à l'aide d'un cadre de reconstruction IRM profonde combiné à des stratégies de débruitage13. Leur travail a démontré l'importance de l'amélioration de la qualité d'image pour améliorer la précision de détection des gliomes. De même, Srinivas et Rao ont proposé un cadre de segmentation basé sur l'apprentissage profond pour l'analyse des sous-régions des tumeurs cérébrales IRM multimodales14. Leur approche a amélioré la délimitation des sous-régions tumorales et a contribué à la planification du traitement individualisé. Néanmoins, les cadres multimodales nécessitent généralement un prétraitement extensif, des ressources computationnelles accrues et une enregistrement précis des images entre les modalités d'imagerie, ce qui peut limiter leur applicabilité dans les environnements cliniques pratiques.

Des méthodes de fusion multimodale guidées par l'

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a utilisé un ensemble de données anonymisées et accessibles au public; par conséquent, aucun consentement éclairé n'était requis. L'approche proposée comprend six composants : prétraitement, module de convolution, module d'attention, intégration des modules de convolution et d'attention, et des couches entièrement connectées (FC). La figure 1 illustre le flux de travail complet de notre méthode.

Obtention du jeu de données
Les images IRM cérébrales étiquetées sont obtenues à partir d'un jeu de données Kaggle accessible au public comprenant quatre catégories de tumeurs et des tissus normaux.

Prétraitement des données
Les images sont redimensionnées à une résolution uniforme et normalisées en intensité. Une augmentation optionnelle (rotation, retournement, zoom) est appliquée pour améliorer la généralisation. Le jeu de données est divisé en ensembles d'entraînement (70%) et de test (30%).

Architecture du modèle
Trois CNN de base pré-entraînées sur ImageNet - MobileNetV2, EfficientNetV1 et Inception-ResNet-V2 - ont été utilisées pour classer les tumeurs cérébrales en quatre catégories à l'aide d'images IRM. MobileNetV2 et EfficientNetV1 ont été configurés avec une dimension d'entrée de 224 × 224 pixels, tandis que Inception-ResNet-V2 nécessitait une taille d'entrée de 299 × 299 pixels. Dans le processus d'apprentissage par transfert, les couches de convolution initiales ont été gelées au début pour conserver les caractéristiques d'image généralisées, tandis que les couches supérieures ont été ajustées pour adapter le modèle à la classification des tumeurs cérébrales. Chaque backbone a été associé à une tête de classification légère qui comprenait un Global Average Pooling, des couches denses, un dropout pour la régularisation et une fonction d'activation Softmax pour prédire quatre classes. Le dropout a été mis en œuvre pour atténuer le surapprentissage et améliorer la généralisation. L'architecture conçue a efficacement fusionné l'extraction efficace des caractéristiques avec des exigences de calcul plus faibles, facilitant une classification précise tout en restant adaptée au déploiement dans des scénarios à ressources limitées et de preuve de concept.

Extraction de caractéristiques basée sur l'attention
Les images d'entrée sont traitées par une couche de convolution initiale suivie d'un module d'attention personnalisé. Le pooling maximal et le pooling moyen en parallèle capturent les caractéristiques saillantes et contextuelles, qui sont concaténées et affinées par convolution pour mettre en évidence les régions pertinentes pour les tumeurs.

Backbone convolutionnel et fusion
Les caractéristiques pondérées par l'attention sont transmises aux backbones pré-entraînées (MobileNetV2, EfficientNetV1 ou Inception-ResNet-V2). Les couches de convolution de haut niveau sont logiquement fusionnées pour réduire l'accès à la mémoire et améliorer l'efficacité de calcul.

Classification
Les caractéristiques aplaties sont transmises par des couches entièrement connectées avec une activation ReLU6 et un dropout, produisant une représentation compacte pour la classification finale par softmax en quatre classes.

Évaluation
Les performances du modèle sont évaluées sur l'ensemble de test à l'aide de la précision, de la recall, du score F1 et des matrices de confusion.

Développement du cadre
La solution proposée est implémentée en Python et utilise Keras pour l'exécution. Le tableau 1 illustre les hyperparamètres. Le jeu de données est divisé en un ensemble d'entraînement et un ensemble de test suivant un rapport de 70:30. Cinq différents découpages arbitraires d'entraînements/tests sont utilisés pour afficher les performances équilibrées finales pour chaque ensemble de données.

Prétraitement
Les images d'entrée doivent être mises à jour car le cadre MobileNetV2 sert de base à la solution proposée. Pour extraire des caractéristiques haute résolution à partir de photographies, le modèle MobileNetV2 pré-entraîné est utilisé avec sa dimension d'entrée. Chaque image d'entrée est ensuite mise à l'échelle de 224×224 pixels dans la plage [-1, 1].

Le modèle de convolution
MobileNetV2 améliore la reconnaissance d'images en exploitant une architecture de réseau de neurones convolutionnels (CNN) efficace conçue pour minimiser les exigences de calcul. Bien que les CNN traditionnels atteignent une haute précision, ils nécessitent souvent une mémoire et une puissance de traitement considérables. MobileNetV1 a introduit le concept de convolution séparable par profondeur, qui sépare la convolution standard en deux opérations distinctes : la convolution par profondeur pour filtrer les entrées et la convolution par point pour intégrer les caractéristiques. MobileNetV2 s'appuie sur cette idée en incorporant des blocs résiduels à goulotte qui se composent de couches d'expansion, de convolution par profondeur, de couches de projection et de connexions résiduelles. La couche de projection compresse les canaux de caractéristiques, tandis que les connexions résiduelles facilitent un meilleur flux d'informations dans l'ensemble du réseau. Pour améliorer la stabilité et améliorer les performances d'apprentissage, l'activation ReLU6 et la normalisation par lot sont appliquées après les opérations de convolution.

Dans cette recherche, MobileNetV2, pré-entraîné sur ImageNet, a été utilisé comme modèle de base pour extraire les caractéristiques, fournissant des représentations sémantiques de haut niveau efficaces tout en maintenant des coûts de calcul faibles pour la classification des tumeurs cérébrales. Après chaque couche de convolution, il y a une couche d'activation ReLU6, qui est une adaptation de la fonction d'activation ReLU, où la taille est maximisée à six, et une couche de normalisation par lot. Les couches de convolution 1x1, de pooling moyen et de classification courantes sont appliquées à 17 des blocs de goulot restants, formant l'architecture complète de MobileNetV2. Nous avons utilisé MobileNetV2 comme réseau de base pré-entraîné sur ImageNet. Dans ce cas, la carte convolutionnelle est obtenue à partir du dernier bloc résiduel après passage par la couche convolutionnelle MobileNetV2. Les blocs résiduels de niveau inférieur produisent des cartes de caractéristiques plus petites. Ces blocs ne contribuent pas à notre recherche car ils ne recueillent pas de données de haut niveau pour l'identification globale de l'image. Pendant la construction et l'entraînement du modèle, les couches précédant les couches de convolution qui génèrent une carte de caractéristiques 3D de 7 × 7 sont maintenues fixes. En termes mathématiques, cela s'exprime comme suit dans l'équation (1):

F1(I) = Conv(I)        (1)

Ici, F1(I) représente la caractéristique convolutionnelle extraite de l'image d'entrée, I.

Le module de focalisation
Le mécanisme d'attention du cerveau humain, qui implique que les gens se concentrent naturelle

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Trois modèles de deep learning pré-entraînés, à savoir MobileNetV2, EfficientNetV1 et Inception-ResNet-V2, ont été évalués pour la classification de tumeurs cérébrales en quatre classes à l'aide d'images IRM.

Jeu de données utilisé
Le cadre proposé a été évalué à l'aide d'un ensemble de données IRM de tumeurs cérébrales publiquement disponible obtenu sur la plateforme Kaggle. L'ensemble de données comprenait 835 images IRM de cerveaux normaux, 826 images de gliomes, 822 images de méningiomes et 827 images de tumeurs hypophysaires. Des échantillons IRM représentatifs de l'ensemble de données sont présentés dans la Figure 2.

MobileNetV2
Le modèle MobileNetV2 contenait 2 263 108 paramètres au total, dont 2 228 996 entrainables et 34 112 non entrainables. Les métriques de performance de classification sont présentées dans le Tableau 2. Le modèle a atteint une précision de classification globale de 97%, avec des scores F1 macro et pondérés moyens comparables. La matrice de confusion présentée dans le Tableau 3 démontre une performance de classification solide pour toutes les quatre catégories de tumeurs, avec relativement peu de mauvaises classifications entre le gliome et le méningiome.

La Figure 3 présente les courbes de précision/perte d'entraînement et de validation pour MobileNetV2. Le modèle a démontré une convergence stable après plusieurs époques d'entraînement, avec une performance de validation s'améliorant progressivement.

Inception-ResNet-V2
Le modèle Inception-ResNet-V2 comportait 54 342 884 paramètres au total, dont 54 282 340 entrainables et 60 544 non entrainables. Les métriques de classification sont résumées dans le Tableau 4. Le modèle a atteint une précision de classification globale de 98%, démontrant une performance améliorée par rapport à MobileNetV2.

La matrice de confusion du Tableau 5 indique une haute précision de classification pour toutes les catégories de tumeurs avec des taux de mauvaise classification réduits. Une meilleure discrimination entre les classes de tumeurs a été observée par rapport au modèle MobileNetV2. La Figure 4 illustre les courbes de performance d'entraînement et de validation pour Inception-ResNet-V2. Le modèle a démontré un comportement d'apprentissage stable et une convergence constante à travers les époques d'entraînement.

EfficientNetV1
Le modèle EfficientNetV1 contenait 6 580 363 paramètres au total, dont 6 518 308 entrainables et 62 055 non entrainables. Les métriques de classification résumées dans le Tableau 6 démontrent la performance la plus élevée parmi les modèles évalués, atteignant environ 99% de précision, de rappel et de score F1.

La matrice de confusion du Tableau 7 démontre une performance de classification solide pour toutes les quatre classes de tumeurs, avec une mauvaise classification minime. Le modèle a correctement classifié la plupart des images de gliome, de méningiome, de cerveau sans tumeur et de tumeur hypophysaire.

La Figure 5 présente les courbes de précision/perte d'entraînement et de validation pour EfficientNetV1. Le modèle a atteint une convergence stable avec des fluctuations de validation plus faibles par rapport aux autres architectures évaluées.

Comparaison globale
Parmi les modèles évalués, EfficientNetV1 a atteint la meilleure performance de classification tout en maintenant une complexité computationnelle plus faible que Inception-ResNet-V2. MobileNetV2 a démontré une performance légère efficace avec des exigences en paramètres réduites, tandis que Inception-ResNet-V2 a atteint une précision de classification améliorée au prix d'une complexité de modèle nettement plus élevée. Les résultats indiquent qu'EfficientNetV1 offre le meilleur équilibre entre précision de classification et efficacité computationnelle pour la classification IRM des tumeurs cérébrales en quatre classes.

Disponibilité des données
L'ensemble de données IRM cérébrales analysé dans cette étude est publiquement disponible sur la plateforme Kaggle. Toutes les données générées et analysées au cours de cette étude, y compris les résultats de classification, les métriques de performance, les matrices de confusion et les résultats d'entraînement/validation, sont présentés dans les figures et les tableaux de cet article. Le code personnalisé utilisé pour le développement et l'évaluation des modèles est disponible auprès de l'auteur correspondant sur demande raisonnable.

Figure 1
Figure 1: Cadre d'apprentissage par transfert guidé par l'attention pour la classification en quatre classes des tumeurs cérébrales. Le flux de travail illustre le prétraitement, l'extraction de caractéristiques basée sur l'attention, l'apprentissage des caractéristiques convolutives, la fusion des caractéristiques et les couches de classification entièrement connectées utilisées pour la classification des tumeurs basée sur l'IRM. Veuillez cliquer ici pour voir une version plus grande de cette figure.

Figure 2
Figure 2: Images IRM représentatives de l'ensemble de données de tumeurs cérébrales en quatre classes.
Des échantillons d'IRM correspondant aux classes de gliome, de méningiome, de tumeur hypophysaire et de cerveau normal utilisés pour l'entraînement et l'évaluation du modèle sont présentés. Veuillez cliquer ici pour voir une version plus grande de cette figure.

Figure 3
Figure 3: Courbes de précision/perte d'entraînement et de validation pour MobileNetV2. Les graphiques démontrent le comportement de convergence de MobileNetV2 pendant l'entraînement, y compris les changements de précision de classification et de perte à travers les époques.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

L'évaluation des performances, basée sur la précision, le rappel, le score F1 et la précision, révèle que MobileNetV2 et Inception-ResNet-V2 obtiennent des résultats comparables dans la classification des tumeurs cérébrales, atteignant tous deux une précision agrégée et une précision moyenne pondérée de 97 à 98%. En revanche, EfficientNet surpasse les autres modèles, atteignant une précision de 99% sur les métriques macro et pondérées, grâce à sa généralisation améliorée et à sa stratégie de mise à l'échelle composée. Ces résultats sont cohérents avec des études antérieures démontrant l'efficacité des architectures EfficientNet pour la classification multi-classes des tumeurs IRM et l'apprentissage de fonctionnalités efficace sur le plan informatique22. De même, les cadres MobileNetV2 basés sur l'apprentissage par transfert ont auparavant montré de solides performances dans les tâches de classification légère des tumeurs cérébrales tout en maintenant une complexité computationnelle plus faible21.

La performance améliorée d'EfficientNetV1 peut être attribuée à son équilibre entre l'échelle de la profondeur du réseau, la largeur et la résolution d'entrée, qui permet une extraction efficace des caractéristiques discriminatoires liées aux tumeurs. Des observations comparables concernant les avantages des stratégies de mise à l'échelle composée ont été rapportées dans des études antérieures d'optimisation de CNN7,8. De plus, l'intégration du module d'extraction de caractéristiques guidé par l'attention a probablement contribué à l'amélioration de la localisation des régions pertinentes aux tumeurs en supprimant les informations de fond non pertinentes, ce qui s'aligne sur les résultats des études de classification d'images médicales basées sur l'attention10,15.

Malgré ces résultats, plusieurs défis subsistent dans la classification des tumeurs cérébrales, notamment la différenciation précise des tumeurs irrégulières, la segmentation des sous-régions au-delà du cœur de la tumeur et la classification précise à travers divers types de tissus cérébraux. Des études antérieures ont également mis en évidence des limitations liées à la diversité des ensembles de données, à la capacité de généralisation et à la complexité computationnelle dans les systèmes de classification des tumeurs basés sur l'IRM9,11,12. De plus, les cadres IRM multimodales ont démontré une représentation améliorée des caractéristiques et une visualisation des tumeurs, bien que ces méthodes nécessitent souvent un prétraitement approfondi et des ressources computationnelles plus importantes13,17,18,20.

Le tableau 8 présente une analyse de validation croisée consolidée de MobileNetV2, Inception-ResNet-V2 et EfficientNetV1 avec une validation en 5 plis. Le tableau présente la moyenne et l'écart type de la précision, de la précision, du rappel et du score F1, ainsi que les précisions par pli. MobileNetV2 démontre des performances stables mais comparativement plus faibles, tandis que Inception-ResNet-V2 améliore à la fois la précision et la cohérence. EfficientNetV1 atteint la précision moyenne la plus élevée (0,989 ± 0,003) avec la variance la plus faible, indiquant une excellente capacité de généralisation. Ses précisions par pli constamment élevées (0,986 à 0,992) démontrent des performances robustes et stables sur plusieurs divisions de données, l'établissant comme le modèle le plus efficace pour la classification IRM des tumeurs cérébrales en quatre classes dans cette étude.

Limitations de l'étude
L'évaluation actuelle du cadre repose uniquement sur l'augmentation de données en ligne, ce qui peut limiter sa robustesse dans la gestion d'une plus grande variabilité des données dans des scénarios réels. De plus, l'étude explore principalement l'extraction de caractéristiques à partir des couches de convolution finales, sans évaluer les avantages potentiels de l'incorporation d'une fusion de caractéristiques multicouches. La recherche est également limitée aux ensembles de données IRM statiques et n'a pas été validée dans un flux de travail clinique en direct, ce qui peut présenter des défis d'intégration.

Orientations de recherche futures
Les travaux futurs devraient explorer l'agrégation de caractéristiques multicouches de MobileNetV2 et d'autres réseaux de base pour améliorer davantage la précision de la classification. Étendre le cadre pour prendre en charge les données d'imagerie multimodales et valider ses performances dans des environnements cliniques en temps réel renforcera son applicabilité pratique. De plus, l'optimisation de l'architecture pour le déploiement sur des plateformes mobiles et IoT, associée à des techniques d'augmentation avancées et à des ensembles de données de patients réels, peut permettre des diagnostics de tumeurs cérébrales évolutifs et performants dans divers contextes de soins de santé.

Conclusion
Cette étude présente un cadre léger d'apprentissage par transfert guidé par l'attention pour la classification en quatre classes des tumeurs cérébrales à l'aide d'images IRM. En tirant parti de l'apprentissage par transfert avec MobileNetV2, EfficientNetV1 et Inception-ResNet-V2, le modèle atteint une haute précision tout en maintenant l'efficacité computationnelle, le rendant potentiellement adapté aux environnements cliniques à ressources limitées. Les expériences sur un ensemble de données IRM équilibré en quatre classes démontrent qu'EfficientNetV1 fournit les meilleurs résultats, atteignant 99% de précision, de rappel et de score F1. L'architecture proposée équilibre efficacement les performances et l'utilisation des ressources, offrant une approche prometteuse pour les scénarios d'imagerie médicale à ressources limitées.

```

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n'ont aucun conflit d'intérêts à déclarer.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aucun financement externe n'a été reçu pour cette étude.

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
Brain MRI DatasetIEEEhttps://dx.doi.org/10.21227/q2vt-tf46Le dataset est téléchargé avec l'accès à l'institut. Le dataset IRM comprend quatre classes : gliome, méningiome, tumeur hypophysaire et cerveau normal
CNN Accelerator (Layer Fusion)Proposed workFusion logique des couches convolutionnelles supérieures pour réduire l'accès à la mémoire et améliorer l'efficacité computationnelle
Custom Attention ModuleProposed workMécanisme d'attention intégrant le max-pooling et le average-pooling pour mettre en évidence les régions pertinentes au niveau de la tumeur
EfficientNetV1GooglePrentraîné (ImageNet)Architecture CNN évolutive offrant un compromis optimal entre précision et efficacité
Google ColaboratoryGooglehttps://colab.research.google.com/Environnement basé sur le cloud utilisé pour l'entraînement, l'évaluation et l'expérimentation de modèles avec support GPU
Inception-ResNet-V2GooglePrentraîné (ImageNet)Architecture CNN hybride profonde combinant les modules Inception avec des connexions résiduelles
KerasGooglev2.6.0API de réseau neuronal de haut niveau construite sur TensorFlow pour la prototypage rapide de modèles
MatplotlibMatplotlib Developersv3.4.3Bibliothèque de visualisation utilisée pour tracer les courbes d'entraînement, les matrices de confusion et les métriques de performance
MobileNetV2GooglePrentraîné (ImageNet)Backbone CNN léger optimisé pour le déploiement sur mobile et en périphérie
NumPyNumPy Developersv1.21.4Bibliothèque de calcul scientifique de base utilisée pour les opérations numériques
PandasPandas Development Teamv1.3.4Bibliothèque de manipulation et de gestion des données utilisée pour l'organisation des ensembles de données et le traitement des métadonnées
PythonPython Software Foundationv3.8.10Langage de programmation principal utilisé pour le prétraitement des données, le développement et l'évaluation des modèles
Scikit-learnScikit-learn DevelopersDernière version stableUtilisé pour les métriques d'évaluation des performances telles que la précision, le rappel, le score F1 et les matrices de confusion
SeabornSeaborn DevelopersDernière version stableBibliothèque de visualisation statistique de haut niveau utilisée pour une analyse graphique améliorée
TensorFlowGooglev2.6.0Cadre de deep learning de bout en bout utilisé pour implémenter les backbones CNN et les modules d'attention
```

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cancer ResearchMobileNetV2EfficientNetV1Inception ResNet V2transfer learningbrain tumor

Related Articles