Article de recherche

Cadre d’apprentissage par transfert guidé par l’attention pour la classification des tumeurs cérébrales en quatre classes utilisant l’IRM

DOI :

10.3791/69087

10 juillet 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un cadre d’apprentissage profond léger basé sur l’attention pour la classification des tumeurs cérébrales en quatre classes à partir d’images IRM utilisant l’apprentissage par transfert avec MobileNetV2, EfficientNetV1 et Inception-ResNet-V2. Le modèle atteint une grande précision de classification avec une complexité computationnelle réduite, supportant des applications de soutien à la décision clinique limitées en ressources.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’objectif de cette recherche est de développer un cadre d’apprentissage profond léger mais précis pour classer les tumeurs cérébrales en quatre catégories — gliomes, méningiomes, tumeurs hypophysaires et tissu cérébral sain — à l’aide de données d’imagerie par résonance magnétique (IRM). La méthodologie proposée combine l’apprentissage par transfert avec trois modèles de réseaux neuronaux convolutionnels pré-entraînés — MobileNetV2, EfficientNetV1 et Inception-ResNet-V2 — intégrés à un mécanisme d’attention qui émule la capacité du système visuel humain à se concentrer sur des régions cliniquement pertinentes d’une image. Cette approche guidée par l’attention améliore la localisation des tumeurs tout en supprimant les informations de fond non pertinentes. Le cadre est évalué sur un vaste ensemble de données IRM cérébrale accessible au public, contenant des milliers d’images marquées réparties sur les quatre classes. Des protocoles standards de prétraitement, d’augmentation de données et d’entraînement sont utilisés pour permettre une réplication simple de la méthode proposée. Les résultats expérimentaux démontrent qu’EfficientNetV1 atteint les performances de classification les plus élevées, atteignant une précision supérieure à la fois à MobileNetV2 et Inception-ResNet-V2. L’étude conclut que le cadre léger et basé sur l’attention proposé équilibre efficacement précision et complexité computationnelle, le rendant très adapté aux applications de santé en temps réel et mobiles, en particulier dans des environnements à ressources limitées.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La classification précise des tumeurs cérébrales par imagerie par résonance magnétique (IRM) joue un rôle crucial dans le diagnostic clinique, la planification du traitement et l’estimation dupronostic. 1. Les tumeurs cérébrales, notamment le gliome, le méningiome et les tumeurs hypophysaires, présentent des caractéristiques pathologiques distinctes et des réponses au traitement ; Par conséquent, une identification précoce et fiable est essentielle pour améliorer les résultats thérapeutiques et réduire la progression de la maladie. L’IRM est largement privilégiée pour l’évaluation des tumeurs cérébrales en raison de son contraste supérieur des tissus mous, de sa nature non invasive et de sa capacité à visualiser la morphologie tumorale sur plusieurs plans anatomiques. Cependant, l’interprétation manuelle des IRM est souvent longue et dépend fortement de l’expertise radiologique, en particulier lorsque les limites tumorales sont irrégulières ou que des similitudes visuelles existent entre les classes tumorales. Par conséquent, les systèmes automatisés de diagnostic assisté par ordinateur sont devenus de plus en plus importants pour aider les radiologues à une classification tumorale précise et efficace.

Les techniques d’analyse d’images basées sur l’apprentissage profond (DL) ont considérablement progressé la classification automatisée des maladies dans les applications biomédicales et de vision parordinateur 2,3. En neuro-oncologie, l’apprentissage automatique et les techniques d’apprentissage par transfert ont démontré des performances prometteuses pour la détection, la segmentation et la classification destumeurs 4. Les réseaux neuronaux convolutionnels (CNN), en particulier, ont montré une capacité supérieure à extraire automatiquement des caractéristiques hiérarchiques d’images directement à partir des IRM sans dépendre d’une ingénierie de caractéristiques artisanale. Les architectures CNN peuvent apprendre des représentations discriminantes liées aux tumeurs à partir de données d’imagerie, améliorant ainsi les performances de classification par rapport aux approches conventionnelles d’apprentissage automatique. Les avancées récentes en DL ont permis le développement de systèmes de classification d’images haute performance capables de traiter des ensembles de données d’imagerie à grande échelle avec une meilleure précision et une intervention humaine réduite.

Malgré ces avancées, les architectures CNN profondes conventionnelles nécessitent souvent des ressources computationnelles importantes, notamment une forte consommation de mémoire, une complexité accrue des paramètres et un temps d’entraînementétendu 5. De telles exigences computationnelles restreignent leur mise en œuvre dans des environnements cliniques à ressources limitées et des systèmes de santé mobiles. De plus, les architectures de réseaux neuronaux convolutionnels légers ont attiré une attention croissante en raison de leur complexité computationnelle réduite et de leur adéquation au déploiement dans des applications à ressourceslimitées 5. Plusieurs études récentes ont exploré des stratégies CNN optimisées, des mécanismes efficaces d’extraction de caractéristiques et des cadres de déploiement légers pour améliorer l’efficacité de la classification sans compromettre significativement la précisionprédictive 6,7,8. Cependant, équilibrer l’efficacité computationnelle avec une performance robuste dans la classification tumorale multi-classes reste un défi majeur dans l’analyse des tumeurs cérébrales basée surIRM.

Les cadres d’apprentissage profond basés sur l’attention sont apparus comme des solutions efficaces pour améliorer la représentation des caractéristiques dans l’analyse médicaled’images 10. Les mécanismes d’attention permettent aux réseaux de neurones de mettre en avant sélectivement des régions d’image diagnostiquement pertinentes tout en supprimant les informations de fond non pertinentes. Inspirées par le système visuel humain, les architectures guidées par l’attention améliorent l’apprentissage des caractéristiques discriminatives en orientant l’attention computationnelle vers les régions spatiales spécifiques à la tumeur et les caractéristiques contextuelles. Ces mécanismes sont particulièrement bénéfiques pour l’IRM des tumeurs cérébrales car les tissus tumoraux présentent fréquemment des schémas d’intensité hétérogènes, une morphologie irrégulière et des caractéristiques visuelles qui se chevauchent entre les catégories tumorales. Par conséquent, intégrer des modules d’attention dans les architectures basées sur CNN peut améliorer la précision de la classification et la performance de la localisation des fonctionnalités.

Plusieurs études récentes ont démontré le potentiel des cadres DL pour le diagnostic automatisé des tumeurs cérébrales et la classification des tumeurs parIRM 11,12. Gao et al. ont développé et validé un modèle DL pour le diagnostic des tumeurs cérébrales à partir de données IRM, démontrant une forte capacité de classification pour l’analyse neuroimagerieautomatisée 11. De même, Abdusalomov et al. ont étudié des approches de détection des tumeurs cérébrales basées sur la DL à l’aide d’IRM et ont rapporté des performances diagnostiquesprometteuses 12. Bien que ces études aient amélioré la précision de la classification, les limites liées à la diversité des ensembles de données, à la généralisation des modèles et aux exigences informatiques restent non résolues. Dans de nombreux cas, les ensembles de données d’entraînement étaient limités en taille ou dérivés de sources cliniques restreintes, augmentant ainsi le risque de sur-ajustement et réduisant la robustesse à travers des populations de patients hétérogènes.

Pour améliorer la visualisation des tumeurs et l’extraction des caractéristiques, l’analyse et la reconstruction par IRM multimodale ont également étéexplorées 13,14. Sun et al. ont étudié l’évaluation multimodale du gliome basée sur une IRM en utilisant un cadre de reconstruction de l’apprentissage profond combiné à des stratégies dedébruitage 13. Leurs travaux ont démontré l’importance de l’amélioration de la qualité d’image pour améliorer la précision de la détection du gliome. De même, Srinivas et Rao ont proposé un cadre de segmentation basé sur la DL pour l’analyse multimodale des sous-régions de tumeurs cérébralespar IRM 14. Leur approche a amélioré la délimitation des sous-régions tumorales et contribué à une planification individualisée des traitements. Néanmoins, les cadres multimodaux nécessitent généralement un prétraitement étendu, des ressources computationnelles accrues et un enregistrement précis des images parmi les modalités d’imagerie, ce qui peut limiter leur applicabilité dans des environnements cliniques pratiques.

Des méthodes de fusion multimodale guidées par l’attention ont également été proposées pour améliorer la précision de segmentation et l’intégration des caractéristiquesIRM 15, 16, 17, 18. Zhou et al. ont introduit un cadre de fusion basé sur un mécanisme d’attention pour la segmentation multimodale des tumeurscérébrales 15. L’étude a démontré une amélioration des performances de segmentation grâce à l’apprentissage des caractéristiques contextuelles ; cependant, l’approche s’est principalement concentrée sur la segmentation plutôt que sur la classification des tumeurs légères. De même, Zhou et Du ont proposé un réseau multimodal 3D pour la reconstruction accélérée del’IRM 16, tandis que Huang et al. ont développé AMF-Net, un réseau de fusion multiséquence adaptatif pour le diagnostic multimodal de tumeurscérébrales 17. Zhou et al. ont également proposé MLMFNet pour la reconstruction accélérée multimodalede l’IRM 18. Bien que ces méthodes aient amélioré la qualité de la reconstruction et la capacité de fusion des caractéristiques, elles reposaient fortement sur plusieurs modalités d’IRM, des architectures profondes et des opérations de fusion coûteuses en calcul. De telles exigences peuvent réduire leur faisabilité de déploiement dans des systèmes de santé limités en ressources et des plateformes de diagnostic en périphérie.

D’autres études ont étudié des cadres de DL spécifiquement destinés à classer le gliome, le méningiome et les tumeurs hypophysaires à l’aide d’imagesIRM 19. Mokri et al. ont développé un système de classification basé sur la DL pour identifier trois principaux types de tumeurs cérébrales à l’aide des IRM19. Bien que l’étude ait démontré des performances encourageantes, le modèle s’appuyait sur des ensembles de données relativement petits et manquait de comparaisons avec des cadres d’apprentissage par transfert légers. Les architectures basées sur des transformateurs ont également récemment attiré l’attention en imagerie médicale en raison de leur capacité à modéliser les dépendances de caractéristiques à longue portée et les relations contextuelles20. Feng et al. ont proposé un cadre de transformateurs multimodaux pour la reconstruction accélérée d’imagesen RM 20. Leur approche améliorait la performance de reconstruction par rapport aux méthodes conventionnelles ; cependant, les architectures transformateurs nécessitent généralement des ressources computationnelles étendues et des ensembles de données d’entraînement à grande échelle, ce qui peut limiter leur déploiement pratique dans des systèmes médicaux à ressources limitées.

Les architectures CNN légères basées sur l’apprentissage par transfert ont montré un potentiel considérable pour réduire la complexité de calcul tout en maintenant la précision de classification 21,22,23. Rahman et al. ont démontré une amélioration des performances dans la classification des tumeurs cérébrales grâce à MobileNetV2, combinée à des approches avancées de prétraitement et d’ajustementfin 21. MobileNetV2 est particulièrement adapté aux applications légères d’imagerie médicale grâce à ses convolutions séparables en profondeur, son nombre réduit de paramètres et son extraction efficace des caractéristiques. De même, les frameworks basés sur EfficientNet ont montré de solides performances en classification multi-classes grâce à des stratégies de mise à l’échelle composée qui optimisent simultanément la profondeur, la largeur et la résolution d’entréedu réseau 22. Les architectures EfficientNet améliorent l’efficacité de la classification tout en maintenant une surcharge de calcul inférieure par rapport aux CNN conventionnels. De plus, les architectures Inception-ResNet intègrent l’apprentissage résiduel avec des mécanismes efficaces d’extraction de caractéristiques pour améliorer la performance de classificationd’image 23. De telles architectures hybrides permettent une propagation efficace du gradient et un apprentissage plus profond de la représentation du réseau tout en préservant l’efficacité de calcul.

Bien que des progrès significatifs aient été réalisés dans la classification des tumeurs cérébrales par IRM, plusieurs limitations restent non résolues. De nombreuses approches existantes privilégient la précision de la classification avec des architectures à forte intensité de calcul, sans prendre en compte adéquatement l’efficacité du déploiement ou les contraintes de calcul. D’autres études se concentrent principalement sur la segmentation, la reconstruction multimodale ou la fusion des caractéristiques plutôt que sur la classification directe des tumeurs en quatre classes. De plus, relativement peu de cadres intègrent des architectures d’apprentissage par transfert léger avec un apprentissage des caractéristiques guidé par l’attention pour une classification efficace des tumeurs cérébrales multi-classes. Par conséquent, il reste nécessaire d’un cadre efficace en calcul qui équilibre la précision de la classification, un déploiement léger et l’extraction discriminative de caractéristiques dans des environnements cliniques à ressources limitées.

Par conséquent, cette étude propose un cadre léger d’apprentissage par transfert guidé par l’attention pour la classification des tumeurs cérébrales en quatre classes à l’aide d’images IRM. Le cadre proposé intègre MobileNetV2, EfficientNetV1 et Inception-ResNet-V2 avec un mécanisme d’attention qui met l’accent sélectivement sur les régions tumorales diagnostiquement pertinentes tout en supprimant les caractéristiques de fond non pertinentes. Le cadre vise à améliorer la discrimination des caractéristiques et la performance en classification tout en réduisant la complexité de calcul. En combinant des colonnes vertébrales légères par transfert et une extraction de caractéristiques guidée par l’attention, l’approche proposée vise à fournir une solution efficace et évolutive pour la classification automatisée des tumeurs cérébrales par IRM dans des environnements cliniques de soutien à la décision aux ressources limitées.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude utilisait un ensemble de données anonymisé accessible au public ; par conséquent, le consentement éclairé n’était pas requis. L’approche proposée comprend six composantes : prétraitement, module de convolution, module d’attention, intégration des modules convolution et d’attention, et couches entièrement connectées (FC). La figure 1 illustre le flux de travail complet de notre méthode.

Acquisition de jeux de données
Les images IRM cérébrales marquées sont obtenues à partir d’un ensemble de données Kaggle accessible au public, comprenant quatre catégories tumorales et tissu normal.

Prétraitement des données
Les images sont redimensionnées à une résolution uniforme et à une normalisation d’intensité. Une augmentation optionnelle (rotation, basculement, zoom) est appliquée pour améliorer la généralisation. Le jeu de données est divisé en ensembles d’entraînement (70 %) et de test (30 %).

Architecture du modèle
Trois CNN dorsale pré-entraînées sur ImageNet — MobileNetV2, EfficientNetV1 et Inception-ResNet-V2 — ont été utilisées pour classer les tumeurs cérébrales en quatre catégories à l’aide d’images IRM. MobileNetV2 et EfficientNetV1 étaient configurés avec une dimension d’entrée de 224 × 224 pixels, tandis qu’Inception-ResNet-V2 nécessitait une taille d’entrée de 299 × 299 pixels. Dans le processus d’apprentissage par transfert, les premières couches convolutionnelles ont été figées au début pour conserver les caractéristiques d’image généralisées, tandis que les couches supérieures ont été affinées pour adapter le modèle à la classification des tumeurs cérébrales. Chaque colonne vertébrale était associée à une tête de classification légère comprenant le Global Average Pooling, des couches denses, un dropout pour la régularisation, et une fonction d’activation Softmax pour prédire quatre classes. Le dropout a été mis en place pour atténuer le surapprentissage et améliorer la généralisation. L’architecture conçue a efficacement fusionné une extraction efficace des caractéristiques avec des exigences computationnelles plus faibles, facilitant une classification précise tout en restant adaptée au déploiement dans des scénarios à ressources limitées et à preuve de concept.

Extraction de caractéristiques basée sur l’attention
Les images d’entrée sont traitées à travers une couche convolutionnelle initiale suivie d’un module d’attention personnalisé. Le pooling parallèle max et le pooling moyen capturent des caractéristiques saillantes et contextuelles, qui sont concaténées et affinées par convolution pour mettre en valeur les régions pertinentes pour la tumeur.

Colonne vertébrale convolutionnelle et fusion
Les fonctionnalités pondérées par l’attention sont transmises à des backbondes pré-entraînées (MobileNetV2, EfficientNetV1 ou Inception-ResNet-V2). Les couches convolutionnelles de haut niveau sont logiquement fusionnées pour réduire l’accès à la mémoire et améliorer l’efficacité de calcul.

Classification
Les caractéristiques aplaties sont transmises à travers des couches entièrement connectées avec activation et abandon de ReLU6, produisant une représentation compacte pour la classification finale en quatre classes softmax.

Évaluation
La performance du modèle est évaluée sur l’ensemble de test à l’aide de matrices de précision, de précision, de rappel, de score F1 et de confusion.

Développement du cadre
La solution proposée est implémentée en Python et utilise Keras pour l’exécution. Le tableau 1 illustre les hyperparamètres. Le jeu de données est divisé en un ensemble d’entraînement et un ensemble de test selon un ratio de 70:30. Cinq divisions arbitraires différentes de trains/tests sont utilisées pour afficher la performance équilibrée finale pour chaque ensemble de données.

Prétraitement
Les images d’entrée doivent être mises à jour car le cadre MobileNetV2 sert de base à la solution proposée. Pour extraire des caractéristiques haute résolution à partir de photographies, le modèle MobileNetV2 pré-entraîné est utilisé avec sa dimension d’entrée. Chaque image d’entrée est ensuite mise à l’échelle à 224×224 pixels dans la plage [-1, 1].

Le modèle de convolution
MobileNetV2 améliore la reconnaissance d’images en tirant parti d’une architecture efficace de réseau neuronal convolutionnel (CNN) conçue pour minimiser les besoins de calcul. Bien que les CNN traditionnels atteignent une grande précision, ils nécessitent souvent une mémoire et une puissance de traitement considérables. MobileNetV1 a introduit le concept de convolution séparable en profondeur, qui sépare la convolution standard en deux opérations distinctes : la convolution en profondeur pour filtrer les entrées et la convolution ponctuelle pour intégrer les caractéristiques. MobileNetV2 s’appuie sur cette idée en incorporant des blocs résiduels de goulot d’étranglement composés de couches d’expansion, de convolutions en profondeur, de couches de projection et de connexions résiduelles. La couche de projection compresse les canaux de caractéristiques, tandis que les connexions résiduelles facilitent un meilleur flux d’information à travers le réseau. Pour améliorer la stabilité et améliorer les performances d’apprentissage, l’activation de ReLU6 et la normalisation en lot sont appliquées après des opérations convolutives.

Dans cette recherche, MobileNetV2, pré-entraîné sur ImageNet, a été utilisé comme modèle dorsale pour extraire des caractéristiques, fournissant des représentations sémantiques efficaces de haut niveau tout en maintenant les coûts computationnels bas pour la classification des tumeurs cérébrales. Après chaque couche de convolution, il existe une couche d’activation ReLU6, qui est une adaptation de la fonction d’activation ReLU, où la taille est maximisée à six, et une couche de normalisation batch. Les couches communes de convolution 1x1, de pooling moyen et de classification sont appliquées à 17 des blocs de goulot d’étranglement restants, formant l’architecture complète de MobileNetV2. Nous avons utilisé MobileNetV2 comme réseau dorsale pré-entraîné sur ImageNet. Dans ce cas, l’application convolutionnelle est obtenue à partir du dernier bloc résiduel après avoir traversé la couche convolutionnelle de MobileNetV2. Les blocs résiduels de niveau inférieur produisent des cartes de caractéristiques plus petites. Ces blocs ne contribuent pas à nos recherches car ils ne collectent pas de données de haut niveau pour l’identification globale de l’image. Pendant la construction et l’entraînement du modèle, les couches précédant les couches convolutionnelles générant une carte de caractéristiques 3D 7 × 7 sont maintenues fixes. En termes mathématiques, cela s’exprime comme suit dans l’équation (1) :

F1(I) = Conv(I) (1)

Ici, F1(I) représente la caractéristique convolutionnelle extraite de l’image d’entrée, I.

Le module de focus
Le mécanisme d’attention du cerveau humain, qui implique que les gens se concentrent naturellement davantage sur des entrées visuelles significatives que sur chaque détail d’une image, sert de base à la conception de ce réseau de transformation. De nombreux modèles basés sur l’attention ont été créés dans la recherche en apprentissage profond grâce à cette idée. Les corrélations spatiales observées dans les représentations des tumeurs cérébrales sont mises en évidence par le mécanisme d’attention suggéré. Alors que le module d’attention sur le canal capture les informations les plus importantes liées aux tumeurs à travers les canaux de caractéristiques, l’unité d’attention régionale identifie les régions les plus informatives de l’image IRM. En utilisant une méthode d’attention structurée, l’unité de focalisation suggérée se concentre sur les zones contenant des informations tumorales discriminantes.

Pour améliorer la représentation des caractéristiques, des techniques telles que le Top Activation Pooling et l’extraction équilibrée des caractéristiques sont utilisées avant la phase de détection spatiale des caractéristiques. Cette stratégie améliore la capacité du modèle à mettre en avant des régions tumorales cliniquement significatives tout en minimisant les détails de fond non pertinents, améliorant ainsi la précision de la classification et l’efficacité de l’apprentissage des caractéristiques. La seconde est la concaténation des tenseurs max-pooled et moyen-poolé. Enfin, la fonction d’activation sigma, combinée à un filtre convolutif 7x7, doit être utilisée pour activer les stimuli visuels dans les visuels. Les différentes étapes du module de focalisation sont indiquées dans les équations (2) et (3). où Pool(F) ∈ RHxWx1 en équilibre représente l’opération moyenne de mise en commun et MaxPool(F) ∈ RHxWx1 décrit l’opération de mise en commun maximale.

F2(I) = [AvgPool(F) ; MaxPool (F)] (2)

Ces deux applications d’éléments peuvent être combinées en 3D pour créer une application d’éléments

F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)

où σ est la fonction d’activation indiquant sigma. Les caractéristiques d’attention, représentées par un tenseur HxWxC codé en hauteur (V), largeur (W) et épaisseur (C), sont représentées par F3(I), tandis que f7x7 représente l’opération de convolution de taille du filtre (7x7).

Fusion de l’attention et d’un modèle de convolution
Contrairement à un réseau qui repose sur un seul encodeur, une unité de fusion multimodale pourrait extraire des informations bien plus efficaces et complètes pour la grande majorité des modalités. Le bloc fusion est destiné à orienter vers les caractéristiques transversales essentielles maximales ; il cible donc les zones d’attention pour l’extraction de la région tumorale. Il s’agit d’une simple concaténation de représentations latentes individuelles, mais certaines informations seraient perdues. Une carte d’objets combinée a ainsi été générée en combinant les cartes de caractéristiques des modules de convolution et d’observation en utilisant la méthode de concaténation de caractéristiques de base de Sitaula et al. Ces deux cartes de caractéristiques ont capturé des différences dans diverses propriétés d’image, nous avons donc décidé d’utiliser une méthode simple de concaténation plutôt que des stratégies basées sur max, min ou somme. Cela le rend également plus léger en calcul que les méthodes alternatives qui utilisent des méthodes bilinéaires comme forme de calcul du produit tensoriel. Lorsque ces deux caractéristiques sont combinées, le résultant est appelé tenseur de caractéristiques. L’expression mathématique de la sortie tensorielle agrégée des caractères T est donnée par l’équation (4).

[F1(I), F3(I)] = T(I) (4)

Où F1(I) ∈ RHxWx1 et F2(I) ∈ RHxWx1280. Ce sont des tenseurs 3D de la même largeur (W) et de la même hauteur (H). De plus, ils peuvent être concaténés dans la création 3D k de tenseurs 3D, où T(I) ∈ LxWx1281.

Couches entièrement connectées (FC)
Nous avons utilisé une série de couches FC après fusion de caractéristiques pour convertir un tenseur volumétrique remodelé en un vecteur de caractéristiques linéaire. La tête de classification se compose d’une couche de pooling global moyen, de couches denses entièrement connectées, d’une régularisation de dropout et d’une couche de sortie Softmax. La fonction d’activation ReLU6 est utilisée, avec 128 unités et une probabilité de perte de 50 %.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Trois modèles d’apprentissage profond pré-entraînés, à savoir MobileNetV2, EfficientNetV1 et Inception-ResNet-V2, ont été évalués pour une classification de tumeurs cérébrales en quatre classes à l’aide d’images IRM.

Jeu de données utilisé
Le cadre proposé a été évalué à l’aide d’un ensemble de données IRM de tumeurs cérébrales accessible au public obtenu sur la plateforme Kaggle. L’ensemble de données comprenait 835 images IRM cérébrales n...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’évaluation des performances, basée sur la précision, la mémoire, le score F1 et la précision, révèle que MobileNetV2 et Inception-ResNet-V2 obtiennent des résultats comparables dans la classification des tumeurs cérébrales, chacun atteignant une précision agrégée et moyenne pondérée de 97–98 %. En revanche, EfficientNet surpasse les autres modèles, atteignant une précision de 99 % sur des métriques macro et moyennes pondérées, grâce à sa généralisation améliorée et à sa stratégie de mi...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aucun financement externe n’a été reçu pour cette étude.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

```html

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Brain MRI DatasetIEEEhttps://dx.doi.org/10.21227/q2vt-tf46Le dataset est téléchargé avec un accès institutite. Le dataset IRM contient quatre classes : gliome, méningiome, tumeur hypophysaire et cerveau normal
CNN Accelerator (Layer Fusion)Proposed workFusion logique des couches convolutionnelles supérieures pour réduire l'accès à la mémoire et améliorer l'efficacité computationnelle
Custom Attention ModuleProposed workMécanisme d'attention intégrant le max-pooling et le average-pooling pour mettre en évidence les régions pertinentes pour les tumeurs
EfficientNetV1GooglePré-entraîné (ImageNet)Architecture CNN évolutive offrant un compromis optimal entre précision et efficacité
Google ColaboratoryGooglehttps://colab.research.google.com/Environnement basé sur le cloud utilisé pour l'entraînement, l'évaluation et l'expérimentation des modèles avec support GPU
Inception-ResNet-V2GooglePré-entraîné (ImageNet)Architecture CNN hybride profonde combinant des modules Inception avec des connexions résiduelles
KerasGooglev2.6.0API de réseau neuronal de haut niveau construite sur TensorFlow pour la prototypage rapide des modèles
MatplotlibMatplotlib Developersv3.4.3Bibliothèque de visualisation utilisée pour tracer les courbes d'entraînement, les matrices de confusion et les métriques de performance
MobileNetV2GooglePré-entraîné (ImageNet)Backbone CNN léger optimisé pour le déploiement mobile et en périphérie
NumPyNumPy Developersv1.21.4Bibliothèque de calcul scientifique de base utilisée pour les opérations numériques
PandasPandas Development Teamv1.3.4Bibliothèque de manipulation et de gestion des données utilisée pour l'organisation des datasets et le traitement des métadonnées
PythonPython Software Foundationv3.8.10Langage de programmation principal utilisé pour le prétraitement des données, le développement et l'évaluation des modèles
Scikit-learnScikit-learn DevelopersLatest stableUtilisé pour les métriques d'évaluation des performances telles que la précision, le rappel, le score F1 et les matrices de confusion
SeabornSeaborn DevelopersLatest stableBibliothèque de visualisation statistique de haut niveau utilisée pour une analyse graphique améliorée
TensorFlowGooglev2.6.0Framework d'apprentissage profond de bout en bout utilisé pour la mise en œuvre des backbones CNN et des modules d'attention
```

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Recherche sur le cancerNum ro 233Num ro 233MobileNetV2EfficientNetV1Inception ResNet V2

Articles connexes