$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Caractéristiques du jeu de données
L’étude a utilisé le jeu de données public Breast Ultrasound Images (BUSI), qui a fourni un dépôt bien documenté pour l’analyse et la classification ducancer du sein 29. Cet ensemble de données s’est avéré particulièrement approprié car il incorporait une vaste collection d’images ultrasonores nécessaires pour établir et valider des modèles d’apprentissage profond pour l’imagerie médicale. L’ensemble de données comprenait 780 images d’échographies collectées auprès de 600 femmes âgées de 25 à 75 ans, représentant une population diversifiée pour le diagnostic du cancer du sein. Toutes les images maintenaient une résolution moyenne de 500 x 500 pixels et utilisaient le format PNG pour préserver des données visuelles de haute qualité pour analyse. La figure 1 illustre le flux de travail global du cadre proposé, incluant le prétraitement, l’augmentation, l’extraction de caractéristiques EfficientNet-B0, la classification et l’interprétabilité Grad-CAM.

Figure 1 : Échantillons représentatifs issus du jeu de données BUSI. (A) Images bénignes, (B) malignes, et (C) Normales. Les panneaux illustrent la diversité morphologique utilisée pour la formation. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
2. Flux de travail expérimental
Pour garantir la reproductibilité, l’enquête a exécuté le pipeline de traitement en étapes séquentielles. D’abord, le système a chargé les images ultrasonores BUSI et les masques de géovérité correspondants, puis les a redimensionnés à 224×224 pixels, suivi de la normalisation ImageNet. Deuxièmement, le cadre superposait chaque image de son masque pour mettre en avant de diviser le jeu de données en sous-ensembles d’entraînement (70 %), de validation (15 %) et de test (15 %) utilisant un échantillonnage stratifié. Troisièmement, l’étude a appliqué une augmentation ciblée comprenant le retournement horizontal, la rotation (±15°) et le jittering des couleurs, principalement aux classes minoritaires. Quatrièmement, les chercheurs ont affiné le modèle EfficientNet-B0, qui était pré-entraîné sur ImageNet, en remplaçant la couche finale de classification par une couche de sortie à trois classes. Le processus d’entraînement utilisait l’optimiseur Adam (taux d’apprentissage 0,00005), la décroissance du taux d’apprentissage par étapes (γ = 0,1 toutes les 7 époques), la perte d’entropie croisée, une taille de lot de 8, et un arrêt précoce avec une patience de 2. Enfin, Grad-CAM a généré des cartes thermiques de l’attention à partir de la dernière couche convolutionnelle afin de visualiser les régions diagnostiquement pertinentes et de soutenir l’interprétation clinique. Le tableau des matériaux liste les ensembles de données essentiels, les bibliothèques logicielles et les configurations matérielles nécessaires pour reproduire le cadre de classification et d’interprétabilité par échographie mammaire de l’étude.
L’ensemble de données BUSI présentait un déséquilibre naturel de classes, une caractéristique fréquemment observée dans les ensembles médicaux. La distribution favorisait la classe bénigne, suivie des cas malins et normaux. Plus précisément, le jeu de données contenait 487 images bénignes, 210 malignes et 133 images normales. Bien que l’augmentation des données ait augmenté la variabilité de l’entraînement, elle n’a pas modifié le nombre fondamental d’échantillons dans chaque classe. Cette distribution reflétait des scénarios cliniques réels où les affections bénignes surviennent plus fréquemment que les tumeurs malignes. Bien qu’un tel déséquilibre ait représenté avec précision la prévalence des anomalies mammaires en milieu clinique, il posait des défis pour la formation en apprentissage profond, car il pouvait conduire à des prédictions biaisées et à des performances sous-optimales pour les classes minoritaires. Par conséquent, atténuer ce déséquilibre est devenu essentiel pour formuler un modèle efficace et généralisable qui fonctionne efficacement dans chaque catégorie diagnostique. La figure 2 présente des images échographiques représentatives issues de l’ensemble de données, illustrant des exemples d’échantillons de tissu mammaire bénins, malins et normaux.

Figure 2 : Flux de travail proposé pour le modèle. Pipeline séquentiel allant du prétraitement d’entrée et de superposition masque à la formation EfficientNet-B0 et à la sortie Grad-CAM. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
3. Prétraitement des données
L’étude a redimensionné toutes les images à 224 x 224 pixels, en respectant les dimensions d’entrée standard pour l’architecture EfficientNet-B0. Ce redimensionnement a assuré la cohérence des ensembles de données et réduit les exigences de calcul, telles que définies par l’équation 1.
Le cadre a normalisé les valeurs des pixels en utilisant la moyenne et l’écart-type de l’ensemble de données ImageNet ([0,485, 0,456, 0,406] pour la moyenne et [0,229, 0,224, 0,225] pour la standard). Cette normalisation a mis à l’échelle les données d’entrée afin d’améliorer la stabilité de l’entraînement et la vitesse de convergence, calculées selon l’équation 2.
Pour améliorer l’extraction des caractéristiques et l’identification des régions d’intérêt, les chercheurs ont superposé les images originales à leurs masques de réalité sur le terrain correspondants. La figure 3 illustre les masques de lésion sur le terrain et les images ultrasonores superposées qui ont mis en évidence les limites tumorales.

Figure 3 : Masque et images superposées. (A) Échographie originale, (B) masque de réflexion sur le terrain, et (C) superposition résultante mettant en évidence les limites tumorales pour l’attention spatiale. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Cette superposition a identifié des régions critiques, telles que les marges tumorales et les motifs de textures, fournissant au modèle un contexte spatial localisé pour améliorer la précision de la classification, comme montré dans l’équation 3.
L’étude a utilisé exclusivement l’opération de superposition masque lors de la préparation des données d’entraînement pour compléter la connaissance des limites de lésions lors de l’apprentissage des caractéristiques. En revanche, les phases de validation et d’inférence n’utilisaient que les images échographiques originales sans masques, maintenant un pipeline conventionnel de classification des images. Comme les masques de segmentation binaire dans le jeu de données BUSI représentaient des structures déjà inhérentes aux images ultrasoniques, ils n’ont pas introduit de nouvelles étiquettes de classe. Pour éviter toute fuite d’informations, l’enquête a divisé le jeu de données en ensembles d’entraînement, de validation et de test, garantissant qu’aucune paire d’images ou de masques chevauchant n’était partagée entre les sous-ensembles. Par conséquent, la superposition fonctionnait comme un guide d’attention spatiale qui mettait en évidence des zones anatomiquement significatives sans compromettre l’indépendance des données d’évaluation.
4. Augmentation des données
L’étude a mis en œuvre une augmentation ciblée des données afin de réduire le déséquilibre de classes au sein de l’ensemble d’entraînement, en se concentrant spécifiquement sur les classes minoritaires malignes et normales. Le cadre utilisait une large gamme de transformations pour augmenter artificiellement la variabilité des données d’entraînement et améliorer la capacité du modèle à généraliser à diverses conditions d’imagerie.
Premièrement, le système effectuait un retournement horizontal avec une probabilité de 0,9 (90 %), permettant au modèle de reconnaître les caractéristiques quelle que soit la direction de balayage. Cette transformation suivait l’équation 4 :
Deuxièmement, l’étude a appliqué des rotations aléatoires dans une plage de ±15° pour simuler les variations des angles de balayage et la position des patients. Ce processus a obligé le modèle à apprendre des caractéristiques invariantes par rotation, telles que les marges tumorales et les motifs de textures, telles que définies par l’équation 5 :
Troisièmement, les chercheurs ont utilisé le vibration des couleurs pour simuler des variations d’éclairage, de contraste et d’équilibre des couleurs. Le cadre ajustait la luminosité, le contraste et la saturation d’un facteur de 0,2, et la teinte de 0,1. Ces ajustements stochastiques ont amélioré la robustesse du modèle face aux changements d’apparence, calculés selon l’équation 6 :
La sélection de ces plages d’hyperparamètres spécifiques (basculement horizontal 0,9, rotation +15, -15, luminosité/contraste/saturation 0,2, teinte 0,1) résulte d’une évaluation empirique de la stabilité. L’étude a déterminé que ces réglages optimisaient l’équilibre entre la génération de diversité et le réalisme anatomique, assurant une convergence constante et une précision de validation sans induire de déformations irréalistes des lésions.
5. Architecture du modèle
L’étude a utilisé EfficientNet-B0, un modèle CNN moderne reconnu pour son efficacité, sa scalabilité et ses performances par rapport à d’autres architectures de classification d’images. Ce modèle utilisait une méthode d’échelle proportionnelle à la profondeur, la largeur et la résolution du réseau, ce qui permettait une grande précision avec un nombre de paramètres nettement réduit par rapport aux architectures standard comme ResNet et VGG. Cette approche d’échelle a permis au cadre de gérer des images haute résolution tout en restant efficace sur le plan informatique, répondant aux besoins spécifiques de l’imagerie médicale. La figure 4 illustre l’architecture d’EfficientNet-B0, en mettant en évidence la séquence des blocs convolutifs et MBConv utilisés pour l’extraction hiérarchique des caractéristiques.

Figure 4 : Architecture EfficientNet-B0. Schéma des blocs MBConv et des facteurs d’échelle composés utilisés pour l’extraction hiérarchique des caractéristiques. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Afin de modifier EfficientNet-B0 pour la tâche de classification par échographie mammaire, les chercheurs ont introduit des ajustements spécifiques à la structure du modèle. Le système a remplacé la couche de classification initiale, prévue pour le jeu de données ImageNet de 1 000 classes, par une couche entièrement connectée (dense) composée de 3 neurones de sortie. L’enquête a établi toutes les couches de la dorsale préentraînée EfficientNet-B0 comme entraînables et les a optimisées conjointement avec la nouvelle couche de classification, en suivant une stratégie complète d’ajustement fin. Le processus de formation n’a pas appliqué de gel par étapes ni de dégel progressif. Le cadre effectuait l’entraînement en utilisant l’optimiseur Adam avec un taux d’apprentissage de 0,00005 et un planificateur de taux d’apprentissage par étapes qui réduisait le taux d’un facteur 0,1 toutes les 7 époques. Ces neurones correspondaient aux trois classes cibles dans l’ensemble de données BUSI : bénignes, normales et malignes. Le modèle utilisait une activation SoftMax sur la couche de sortie, transformant les scores bruts en distributions de probabilité, comme calculé dans l’équation 7. Le tableau 2 présente la description de l’architecture du modèle.
| Type de couche | Description |
| Couche d’entrée | Accepte des images de taille 224 x 224 x 3 |
| Couches convolutionnelles | Inclut des blocs de convolution initiale et MBConv pour l’extraction des caractéristiques. |
| Regroupement de la moyenne mondiale | Réduit les dimensions spatiales à un vecteur de caractéristiques 1D. |
| Couche entièrement connectée | Mappe le vecteur caractéristique vers 3 neurones de sortie (normal, bénin, malin). |
| SoftMax Activation | Convertit les logits en probabilités pour la classification multi-classes. |
Tableau 2 : Montre la description de l’architecture du modèle.
Les paramètres utilisés pour entraîner le modèle étaient l’optimiseur d’Adam, un taux d’apprentissage initial de 0,00005, et la perte d’entropie croisée catégorique (trois classes), calculée mathématiquement selon l’équation 9. Des poids pré-entraînés ImageNet ont été utilisés pour initialiser EfficientNet-B0, et l’entraînement complet, et toutes les couches de la colonne vertébrale ont été entraînées sans qu’aucun gel par étapes n’ait été appliqué. Le classificateur initial a été remplacé par une couche entièrement connectée et trois neurones de sortie, puis enfin par une activation SoftMax, qui représentait les classes bénigne, maligne et normale. Les images ont été réduites à 224 x 224 pixels, puis normalisées par la moyenne et l’écart-type d’ImageNet, et chargées en mini-lots de 8. Un planificateur de taux d’apprentissage par étapes réduisait ce taux de 0,1 sur 7 époques. La perte de validation a été utilisée pour s’arrêter tôt avec une patience de 2 époques afin d’éviter le surapprentissage. Les activations Grad-CAM ont été produites à partir de la dernière couche convolutionnelle en calculant les gradients, en combinant la moyenne globale pour obtenir les poids des canaux, et en augmentant les cartes d’activation à la résolution d’entrée.
Pour confirmer cette stabilité, l’entraînement a été répété sur plusieurs passages avec des performances de validation Matching. La surveillance des courbes de perte d’entraînement et de validation a été utilisée pour identifier le surapprentissage, et un ensemble de tests stratifiés de résistance ne dépendait pas de l’entraînement utilisé pour effectuer l’évaluation finale. La différence entre la performance de validation et la performance des tests est faible, ce qui montre une convergence cohérente et une reproductibilité d’optimisation. L’équation 10 définit un rythme d’apprentissage par étapes. L’équation 15 signifie deux augmentations consécutives de la perte de validation, indiquant un possible surapprentissage.
EfficientNet-B0 est particulièrement flexible pour la classification par échographie mammaire car l’architecture intègre plusieurs aspects architecturaux innovants permettant l’efficacité et la rapidité de l’architecture. La partie centrale est le MBConv, qui unit des convolutions séparables en profondeur avec des modules de compression et d’excitation pour offrir une complexité de calcul réduite sans perte de précision. Le modèle supporte également une mise à l’échelle des composés qui met à l’échelle la profondeur, la largeur et la résolution de manière uniforme afin d’offrir des performances optimales dans toutes sortes de contraintes de ressources, et le modèle est également agile en tâches, qui est mathématiquement dérivé comme dans l’équation 8 suivante. Le modèle contient déjà des poids entraînés sur l’ensemble de données ImageNet et il peut donc être transféré pour apprendre et, dans une large mesure, il n’est pas nécessaire d’entraîner le modèle sur de petits ensembles médicaux. Cette combinaison de fonctionnalités de haut niveau, ainsi que l’environnement d’entraînement personnalisé, qui contient également les modifications de la couche finale de classification, l’utilisation de l’optimiseur Adam, de l’ordonnanceur de taux d’apprentissage et de l’arrêt précoce, garantit que le modèle est très précis, tout en étant efficace sur le plan informatique. Cette combinaison d’inventivité architecturale et d’approches de formation permettra au modèle d’apprendre efficacement à partir de mauvaises informations en imagerie médicale et s’avérera ainsi un instrument utile dans la catégorisation des ultrasons mammaires.
Algorithme 1 : Classification des images par échographie mammaire utilisant EfficientNet-B0 et Grad-CAM
Entrée : Images échographiques mammaires.
Résultats : Classification (normale, bénigne, maligne) et cartes thermiques Grad-CAM.
1. Prétraitement des images :
Redimensionnez à 224×224224×224.
Normalisez en utilisant la moyenne et l’éticence d’ImageNet.
Ajoutez des flippings, des rotations et des vibrations de couleur.
2. Initialiser le modèle :
Load Efficient Net-B0 (pré-entraîné, excluez la couche supérieure).
Ajoutez le Global Average Pooling et une couche dense (3 neurones, SoftMax).
3. Modèle de train :
Optimiseur : Adam (taux d’apprentissage = 0,00005).
Perte : Entropie croisée.
Entraînez-vous pendant 18 époques avec arrêt anticipé (patience = 2).
4. Visualisation Grad-CAM :
Calculer les gradients de la classe cible.
Générez et superposez des heatmaps sur les images d’entrée.
L’algorithme fournit le flux de travail de classification des images échographies mammaires avec EfficientNet-B0 et Grad-CAM, incluant le prétraitement, l’entraînement et l’inférence du modèle, ainsi que la carte thermique interprétable pour valider cliniquement.
6. Grad-CAM comme IA explicable
Un outil solide utilisé dans l’étude est capable d’ajouter de l’interprétabilité au modèle d’apprentissage profond, la cartographie pondérée par gradient par activation des classes. Considérant comme une solution au besoin actuel de XAI en imagerie clinique, la méthode utilise Grad-CAM pour permettre aux cliniciens de comprendre intuitivement la prise de décision du modèle via des cartes de chaleur visuellement explicables autour des régions les plus significatives d’une image utilisée dans la prédiction du modèle. Une telle convergence de l’interprétabilité sera cruciale pour instaurer la confiance dans les systèmes d’IA, en particulier dans les systèmes à enjeux élevés comme la santé, où la responsabilité et la transparence sont essentielles. La figure 5 présente des cartes thermiques Grad-CAM mettant en évidence les régions de l’image qui ont le plus influencé les prédictions du modèle pour les cas bénignes, malins et normaux.

Figure 5 : Cartes thermiques d’activation Grad-CAM. (A) Cas bénins, (B) Malins, et (C) Cas normaux. Les couleurs chaudes (rouge) signifient une forte influence diagnostique ; Les couleurs froides (bleu) indiquent une attention moindre. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Toutes les images Grad-CAM sont affichées en plus de l’image d’entrée que le modèle a reçue. La figure 5 présente l’image échographique originale et l’image d’entrée du modèle afin de garantir que les régions d’attention étroite sont directement liées à l’entrée traitée prise en compte dans la prédiction. Pour obtenir une importance canal-circuit, Grad-CAM est utilisé pour calculer les gradients de la classe prédite à l’aide des cartes de caractéristiques de la couche convolutionnelle finale. Ces gradients sont moyennés dans le monde entier pour obtenir les coefficients de pondération, puis multipliés par les cartes de caractéristiques respectives pour produire une carte thermique de localisation (équations 16 et 17). La carte thermique est ensuite suréchantillonnée à la résolution d’entrée et superposée à l’image échographique pour indiquer les zones d’intérêt diagnostique (c’est-à-dire les marges tumorales, changements de texture, etc.) dans l’image. Cette visualisation offre une compréhension spatiale des zones utilisées pour faire la prédiction dans le modèle. Cet article mesure l’interprétabilité par analyse visuelle de la localisation de l’attention. Ils n’ont pas inclus de mesures quantitatives de localisation ni d’évaluation par le clinicien, qui restent des voies précieuses pour la validation future de leur pertinence clinique.
Grad-CAM propose des prédictions sur le fonctionnement visuel d’un modèle en mettant en évidence les zones d’une image qui ont contribué à la prédiction. Les cartes thermiques peuvent être utilisées pour confirmer que le réseau se concentre sur des structures cliniquement pertinentes incluant les marges tumorales et les motifs acoustiques. Lors des fausses alertes, les visualisations peuvent aider à remarquer l’attention sur des zones non pertinentes, facilitant ainsi l’évaluation et l’optimisation du modèle. Une telle correspondance entre les caractéristiques médicales et l’attention du modèle améliore l’interprétabilité du diagnostic assisté par IA. La figure 6 montre la visualisation GradCAM.

Figure 6 : Visualisation GradCAM. Carte thermique Grad-CAM montrant les régions importantes (rouge = haut, bleu = bas) pour la classification ; L’intensité des couleurs indique l’importance des caractéristiques. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Grad-CAM est ajouté pour augmenter l’interprétabilité du modèle EfficientNet-B0 en mettant en évidence les régions d’image qui apportent le plus de contributions aux choix de classification. Les cartes thermiques résultantes indiquent des structures cliniquement significatives des marges tumorales et des changements de texture, ce qui facilite une analyse claire des prédictions du modèle. Cette grande précision de classification et cette interprétabilité visuelle renforcent ce cadre proposé en termes de fiabilité dans l’analyse des images échographies mammaires.
7. Analyse statistique
Le modèle est évalué sur un large ensemble de métriques, telles que la précision, comme mesure de la précision des prédictions positives ; rappel, comme mesure de l’efficacité du modèle pour identifier tous les cas pertinents ; et le score F1, la moyenne harmonique de la précision et du rappel, fournissant une mesure équilibrée de la performance globale calculée mathématiquement selon les équations 18 à 21.
L’erreur absolue moyenne (MAE) quantifie la différence absolue moyenne entre les prédictions et les valeurs vraies, calculée mathématiquement selon l’équation 22.
L’erreur quadratique moyenne de la racine (RMSE) mesure l’écart moyen des prédictions par rapport aux valeurs vraies, calculée mathématiquement selon l’équation 23.
L’erreur absolue moyenne (MAE) quantifie la différence absolue moyenne entre les prédictions et les valeurs vraies, calculée mathématiquement selon l’équation 24.
La matrice de confusion est utilisée pour fournir une répartition détaillée des vrais positifs, vrais négatifs, faux positifs et faux négatifs par classe, fournissant des informations supplémentaires sur la façon dont le modèle classe30. Ces mesures d’évaluation combinées fournissent une évaluation globale de l’erreur du modèle, de la force et de la généralisation sur des données non observées, en faisant ainsi un outil fiable pour classifier les images d’une échographie mammaire. La disponibilité des masques de lésion dans le jeu de données BUSI implique qu’à l’avenir, des mesures de localisation quantitatives, par exemple l’intersection sur l’union, pourront être introduites pour évaluer objectivement la précision de l’explication. La validation stratifiée de la résistance avait été choisie afin de préserver l’indépendance entre les sous-ensembles d’entraînement et d’évaluation conservant la distribution des classes. La raison de ne pas utiliser la validation croisée était d’éviter l’exposition répétée des échantillons de validation au processus d’optimisation, mais dans de futures études, la validation croisée répétée ou imbriquée sera utilisée pour déterminer davantage les variations de performance.