La maladie la plus menaçante au monde est la tumeur cérébrale. Un diagnostic précis peut être bénéfique pour la survie des patients. Toutefois, il existe un besoin urgent d’un système diagnostique précis capable de détecter les tumeurs cérébrales à un stade précoce. Pour résoudre ce problème, une technique plus fiable permettant de détecter avec précision les tumeurs cérébrales à un stade précoce a été proposée, en utilisant un mécanisme hybride de double apprentissage profond avec des hyperparamètres optimisés et des couches ajustées finement, basé sur les modèles DenseNet121 et EfficientNetB7. L'approche proposée prend en entrée des images IRM 2D et fournit en sortie une prédiction indiquant la présence ou l'absence de tumeur pour le jeu de données de classification binaire Br35H, ainsi qu'une catégorisation des tumeurs pour quatre autres jeux de données de classification multiclasse. Ainsi, cette section décrit les principales étapes de l'approche proposée, du recueil des données jusqu'à l'obtention du résultat final, incluant l'acquisition des données, le prétraitement des données, la séparation des données, la sélection du modèle, l'extraction des caractéristiques, la prédiction de la tumeur et l'évaluation du modèle proposé, comme illustré dans Figure 1.

Figure 1 : Flux de travail de la méthodologie proposée. Ce diagramme présente l'architecture générale du modèle proposé, incluant l'acquisition et le prétraitement des données, deux modèles préentraînés pour l'extraction de caractéristiques, la concaténation de leurs caractéristiques, ainsi que l'ajustement fin des hyperparamètres pour la classification et le typage des tumeurs. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Acquisition des données
Dans toute recherche expérimentale, la première étape consiste à acquérir des données. À cet effet, cinq ensembles de données différents et accessibles publiquement ont été sélectionnés, notamment Br35H24, Figshare25, Sartaj26, Masoud27 et un ensemble d'images IRM de tumeurs cérébrales provenant de la bibliothèque open source Kaggle28, déjà utilisés par de nombreux chercheurs pour le diagnostic de la détection des tumeurs cérébrales. L'ensemble de données Br35H contient 3 000 images réparties en deux classes : images cérébrales saines et non saines (tumorales), avec 1 500 images dans chaque classe, tandis que l'ensemble de données Figshare comprend 3 064 images, réparties en trois groupes selon le type de tumeur : 1 426 images de gliome, 708 images de méningiome et 930 images de tumeurs hypophysaires. L'ensemble de données Sartaj contient 3 264 images classées en quatre catégories de tumeurs : gliomes (926 images), méningiomes (937 images), tumeurs hypophysaires (901 images) et absence de tumeur ou cerveau sain (500 images). De plus, l'ensemble de données Masoud comprend également quatre classes différentes de tumeurs, dont les images ont été extraites des trois ensembles de données mentionnés ci-dessus, pour un total de 7 023 images, réparties en gliome (1 621 images), méningiome (1 645 images), hypophyse (1 757 images) et absence de tumeur ou cerveau sain (2 000 images). Le dernier ensemble de données choisi est un ensemble basé sur des images IRM, qui comprend également quatre classes pour un total de 5 248 images, réparties en types de tumeurs : 1 312 images de gliome, 1 312 images de méningiome, 1 312 images de tumeur hypophysaire et 1 312 images saines ou sans tumeur, déjà réparties de manière égale selon les types de tumeurs et considérées comme un ensemble de données équilibré.
Prétraitement des données
Après l'acquisition des données, l'étape suivante est le prétraitement, qui est essentiel pour obtenir de meilleurs résultats et s'avère plus utile pour les approches computationnelles afin d'extraire et d'apprendre les meilleures caractéristiques à partir des données, produisant ainsi des résultats plus précis. La première étape appliquée a été le redimensionnement des images. Cinq jeux de données accessibles publiquement, comportant différentes classes et tailles d'images, même au sein d'un même jeu de données selon les classes de tumeurs, ont été sélectionnés et uniformément redimensionnés à 224 x 224 pour améliorer l'interprétation et l'apprentissage par le modèle. En outre, une augmentation des données a été appliquée à tous les jeux de données en générant des échantillons supplémentaires sous différents angles, améliorant ainsi l'extraction et l'apprentissage des caractéristiques par les modèles d'apprentissage profond (DL). Pour cela, une plage de rotation de 7 % a été appliquée à toutes les images, les faisant pivoter jusqu'à 7 degrés. Par ailleurs, un décalage aléatoire de 5 % a été appliqué à toutes les images horizontalement et verticalement, avec un décalage de 5 % en hauteur et en largeur par rapport aux images d'origine. Ensuite, les images ont été agrandies de 10 % par rapport aux images d'origine, et enfin, toutes les images ont été retournées horizontalement et verticalement. La principale raison de réaliser l'augmentation des données29 est de surmonter le surapprentissage (overfitting) et d'améliorer la généralisation des modèles en les entraînant sur diverses versions transformées des échantillons de données d'origine. Avant de diviser les jeux de données en ensembles d'entraînement et de validation, un encodage des étiquettes a été appliqué, ce qui facilite le calcul de la perte (loss) pendant l'entraînement et la validation, tout en rendant les échantillons de données plus pertinents pour que les modèles traitent correctement les étiquettes. De plus, le jeu de données a été réparti en ensembles d'entraînement et de validation selon un ratio de 80 % à 20 %30 pour chacun, et Tableau 2 présente la répartition globale des échantillons de données ainsi que leurs ratios d'entraînement et de validation.
| Jeu de données | Classes de tumeurs | Images totales | Images d'apprentissage | Images de validation |
| Br35H | Sain | 1500 | 1200 | 300 |
| Tumeur | 1500 | 1200 | 300 |
| Images totales | 3000 | 2400 | 600 |
| Figshare | Gliome | 1426 | 1141 | 285 |
| Méningiome | 708 | 566 | 142 |
| Pituitaire | 930 | 744 | 186 |
| Images totales | 3064 | 2451 | 613 |
| Sartaj | Gliome | 926 | 741 | 185 |
| Méningiome | 937 | 749 | 188 |
| Absence de tumeur | 500 | 400 | 100 |
| Pituitaire | 901 | 721 | 180 |
| Images totales | 3264 | 2611 | 653 |
| Masoud | Gliome | 1621 | 1297 | 324 |
| Méningiome | 1645 | 1316 | 329 |
| Absence de tumeur | 2000 | 1600 | 400 |
| Pituitaire | 1757 | 1405 | 352 |
| Images totales | 7023 | 5618 | 1405 |
| Jeu de données équilibré de tumeurs cérébrales (BBT-Dataset) | Gliome | 1312 | 1050 | 262 |
| Méningiome | 1312 | 1050 | 262 |
| Absence de tumeur | 1312 | 1050 | 262 |
| Pituitaire | 1312 | 1050 | 262 |
| Images totales | 5248 | 4200 | 1048 |
Tableau 2 : Répartition du jeu de données. Le tableau présente des statistiques par classe concernant le nombre total d'images, ainsi que les nombres d'images d'entraînement et de validation dans les jeux de données de tumeurs cérébrales.
Le jeu de données Br35H comprend 3000 images, dont 2400 ont été sélectionnées pour l'entraînement et 600 pour la validation. Le jeu de données Figshare comprend 3064 images. Sur l'ensemble des images, 2451 ont été sélectionnées pour l'entraînement, et les 613 restantes pour la validation. Le jeu de données Sartaj compte au total 3264 images, dont 2611 ont été utilisées pour l'entraînement et les 653 restantes pour la validation. Le jeu de données Masoud comprend au total 7023 images ; parmi celles-ci, 5618 ont été utilisées pour l'entraînement, et les 1405 restantes pour la validation. Le jeu de données BBT compte au total 5248 images. Sur l'ensemble des images, 4200 ont été retenues à des fins d'entraînement, tandis que les 1048 images restantes ont été considérées à des fins de validation. De plus, la Figure 2 ci-dessous illustre diverses images de tumeurs cérébrales.

Figure 2 : Images de tumeurs cérébrales, incluant les types de tumeurs. Le jeu de données contient quatre images de tissu cérébral sain et trois images tumorales : gliome, méningiome et tumeur hypophysaire. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Modèle proposé
Après l'étape de prétraitement, la prochaine étape consiste à proposer un modèle d'apprentissage efficace uniquement pour la classification des tumeurs cérébrales. À cet effet, un modèle efficace d'entraînement a été proposé, spécifiquement conçu pour classifier les tumeurs cérébrales. Pour ce faire, un nouveau modèle hybride préentraîné, fondé sur la fusion efficace de caractéristiques, est proposé, combinant DenseNet12131,32 et EfficientNetB733, utilisés pour extraire les caractéristiques des images. Ensuite, ces caractéristiques extraites sont concaténées puis transmises à différents hyperparamètres ajustés finement, incluant des couches entraînables et non entraînables, afin de diagnostiquer précisément les tumeurs cérébrales. Ce modèle a été mis en œuvre sur cinq jeux de données différents disponibles publiquement, qui ont été abordés dans les sections précédentes. Par ailleurs, le modèle DenseNet121 a été développé par Gao Huang et ses collaborateurs en 2017 et comprend 121 couches. L'objectif principal de ce modèle était de maximiser la réutilisation des caractéristiques et d'éviter le problème du gradient évanescent34. Les couches de ce modèle sont organisées en blocs denses, chacun contenant plusieurs couches de convolution chargées d'extraire et d'apprendre des caractéristiques. Chaque couche prend la carte de caractéristiques de toutes les couches précédentes comme entrée, et sa sortie est reliée aux sorties de ces couches, puis transmise comme entrée aux couches suivantes du même bloc selon un mode avant. De plus, des couches de transition sont ajoutées entre les blocs denses, chacune composée d'une couche de convolution 1 × 1, d'une couche de normalisation par lots (BatchNormalization) et de couches de moyennage 2 × 2, qui réduisent la carte de caractéristiques afin de contrôler la complexité du modèle. Enfin, une couche terminale dotée d'une fonction d'activation SoftMax (AF) est ajoutée avant une couche de moyennage global pour la classification. La structure fondamentale du modèle DenseNet121 est illustrée dans Figure 334 ci-dessous.

Figure 3 : Détail de l'architecture DenseNet12134. Cette figure présente le détail architectural du modèle DenseNet121, incluant tous les blocs denses et de transition. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
De plus, le modèle EfficientNetB7 a été conçu par Tan et Lee en 2019. Il appartient à la famille EfficientNet, qui comprend des variantes allant de B0 à B7, et son objectif principal est de surpasser les autres modèles tout en utilisant moins de paramètres et une puissance de calcul réduite. La largeur du modèle (nombre de canaux par couche), la profondeur (nombre de couches) et la résolution peuvent toutes être ajustées grâce à une mise à l'échelle composée, qui constitue la caractéristique fondamentale du modèle. Ce modèle comprend par ailleurs des blocs MBConv (convolution à goulot d'étranglement inversé mobile), qui intègrent une couche d'expansion convolutive 1 × 1 chargée d'augmenter le nombre de canaux, une convolution séparable par profondeur responsable de l'application de la convolution à chaque canal séparément, et une couche de projection convolutive 1 × 1 qui réduit le nombre de canaux à leur valeur initiale. Chaque bloc MBConv intègre également des blocs Squeeze and Excitation (SE)35, qui recalibrent les caractéristiques par canal, aidant ainsi le réseau à se concentrer sur les plus importantes. Au lieu de la fonction sigmoïde ou de toute autre fonction d'activation (AF), la fonction Swish est utilisée, car elle offre de meilleures performances que ReLU en autorisant des valeurs négatives, ce qui facilite la circulation du gradient. En outre, une couche de sortie finale équipée d'une fonction d'activation SoftMax est ajoutée avant une couche de moyennage global (global average pooling) pour la classification. Figure 435 illustre la structure de base du modèle EfficientNetB7, tandis que Figure 5 présente l'architecture recommandée du modèle.

Figure 4 : Détail de l'architecture EfficientNetB735. Cette figure présente le détail architectural du modèle EfficientNetB7, incluant tous les blocs de convolution à goulot d'étranglement inversé mobiles. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Architecture proposée d'un modèle hybride fusionné. L'architecture proposée illustre comment les images prétraitées sont transmises à l'extracteur de caractéristiques, composé de trois blocs personnalisés aux hyperparamètres différents, suivis d'une couche de sortie. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
De plus, des caractéristiques initiales ont été extraites des modèles pré-entraînés DenseNet121 et EfficientNetB7. Les poids mis à jour des modèles pré-entraînés ont été chargés dans les modèles entraînés, et les couches de base non entraînables des modèles ont été figées afin d'empêcher un nouvel entraînement du modèle. Cela devrait permettre au modèle de conserver ses meilleures connaissances acquises précédemment, de les adapter à la lumière de nouveaux échantillons de données pour améliorer la convergence, et de se concentrer sur les couches supplémentaires à entraîner afin d'extraire des caractéristiques avancées. Les équations 1 et 2 ci-dessous illustrent le fonctionnement des modèles DenseNet121 et EfficientNetB7.
(1)
(2)
Les équations ci-dessus 1 et 2 illustrent le fonctionnement du modèle préentraîné en matière d'extraction de caractéristiques ; F1 désigne les cartes de caractéristiques en sortie produites par le modèle DenseNet121 préentraîné et F2 désigne les cartes de caractéristiques en sortie produites par le modèle EfficientNetB7 préentraîné après traitement des images d'entrée, représentées par X. Par ailleurs, W1 et W2 sont les paramètres ajustables ou poids associés respectivement aux premiers blocs et couches des modèles DenseNet121 et EfficientNetB7. En outre, ∈ RN ×H1×W1×C1 et ∈ RN ×H2×W2×C2 représentent la dimensionnalité des cartes de caractéristiques en sortie des modèles DenseNet121 et EfficientNetB7, respectivement, avec des dimensions de H1 ×N×W1×C1 et H2 ×N×W2×C2, où N représente la taille du lot d'images, fixée à 16. De plus, H1×W1 indique respectivement la hauteur et la largeur des images pour le modèle DenseNet121, et H2×W2 indique la hauteur et la largeur des images pour le modèle EfficientNetB7, choisies avec des dimensions de 224 × 224. C1 et C2 représentent respectivement le canal de couleur pour les modèles DenseNet121 et EfficientNetB7. Après obtention des cartes de caractéristiques en sortie du modèle, soit 2560 canaux pour EfficientNetB7 et 1024 pour DenseNet121, une couche de moyennage global 2D36 est appliquée aux cartes de caractéristiques afin de réduire la dimension spatiale en prenant la moyenne de toutes les dimensions spatiales pour former un unique vecteur, ce qui facilite la transmission à la couche suivante et améliore l'extraction de caractéristiques et la reconnaissance de motifs en termes de caractéristiques interprétables.
(3)
(4)
Les équations ci-dessus 3 et 4 illustrent le fonctionnement de la couche de moyennage global 2D appliquée aux modèles DenseNet121 et EfficientNetB7, respectivement, où
et
montrent la procédure de normalisation de la somme en divisant par le nombre total de positions spatiales pour les deux modèles, afin de s'assurer que la sortie agrégée correspond à une moyenne plutôt qu'à une somme simple.
et
représentent la sommation effectuée sur les dimensions spatiales des cartes de caractéristiques, tandis que i et j servent uniquement à itérer respectivement sur la hauteur et la largeur, afin de sommer les cartes de caractéristiques pour les deux modèles. De plus, F1(i, j, :) et F2(i, j, :) représentent les valeurs des cartes de caractéristiques à des positions spatiales spécifiques (i, j) à travers tous les canaux, respectivement pour les modèles DenseNet121 et EfficientNetB7. Cette opération de regroupement agrège l'information spatiale en une représentation plus compacte et plus précise, tout en préservant les caractéristiques les plus importantes de chaque image. En outre, les sorties des couches de moyennage global sont concaténées pour produire un unique vecteur de caractéristiques par échantillon, ce qui est souvent utilisé pour fusionner des caractéristiques provenant de différents modèles afin d'améliorer les performances en exploitant les forces de chacun ; l'équation 5 montre comment cela fonctionne.
(5)
L'équation ci-dessus 5 illustre la procédure de concaténation de deux vecteurs de caractéristiques de modèles différents [G1, G2], où G1 représente le vecteur de caractéristiques du modèle DenseNet121 et G2 représente le vecteur de caractéristiques du modèle EfficientNetB7, tandis que la forme du vecteur de caractéristiques concaténé est représentée par RN ×(C1+ C2), où N est la taille du lot, qui indique le nombre d'échantillons traités en parallèle, et (C1+ C2) correspond au nombre total de caractéristiques extraites respectivement des modèles 1 et 2, soit environ 3584, qui sont traitées en parallèle, et le vecteur de caractéristiques de sortie concaténé est noté G. En outre, trois blocs distincts ont été ajoutés afin de modifier le modèle fusionné pour extraire des caractéristiques plus complexes, améliorer la généralisation et éviter le surapprentissage, dans le seul but d'obtenir des résultats plus précis et plus efficaces. Chaque bloc est composé d'une couche dense comportant un nombre différent de neurones : le premier bloc comprend 1024 neurones dans sa couche dense, ce qui lui permet de capturer un large éventail de caractéristiques et des motifs plus génériques dans les données, tandis que le second bloc dispose de 512 neurones dans sa couche dense, ce qui affine spécifiquement les caractéristiques en réduisant la dimensionnalité et en se concentrant sur des motifs plus précis. Le troisième bloc contient 256 neurones dans sa couche dense, qui distillent davantage les caractéristiques afin de garantir que seules les caractéristiques et les motifs les plus pertinents soient transmis à la couche de sortie pour accomplir une tâche plus ciblée. De plus, des méthodes de régularisation L237 sont appliquées à chaque couche dense de chaque bloc afin d'éviter le surapprentissage en pénalisant les poids élevés, ce qui contribue également à augmenter la complexité du modèle. Une couche de dropout38 est également introduite après chaque bloc pour ignorer aléatoirement 30 %, 20 % et 10 % des neurones respectivement pour les blocs 1, 2 et 3, ce qui oblige les réseaux à développer des caractéristiques plus robustes, non dépendantes d'un seul neurone. Par ailleurs, afin de stabiliser le processus d'apprentissage, une couche de normalisation par lot (BatchNormalization)39 est appliquée après chaque couche dense, ce qui garantit que les activations restent dans une plage stable et aide également le modèle à éviter des problèmes tels que les gradients nuls ou explosifs durant la phase d'apprentissage. En outre, cette couche de BatchNormalization accélère également le processus d'apprentissage, permettant au modèle de converger plus rapidement en lissant le paysage de la fonction de perte, ce qui facilite l'atteinte des minima globaux par les optimiseurs. Enfin, dans chaque bloc, une fonction d'activation de type ReLU fuyante (leaky ReLU)40 est utilisée afin de produire une non-linéarité, ce qui permet au modèle d'apprendre des motifs complexes. La ReLU fuyante présente des avantages par rapport à d'autres fonctions d'activation, notamment celui de garantir que le neurone ne devienne pas inactif en autorisant un petit gradient non nul pour les entrées négatives. Enfin, l'équation ci-dessous 6 illustre le fonctionnement des différents blocs intégrés au modèle hybride fusionné.
(6)
Après obtention du vecteur concaténé, G est transmis à la couche dense du bloc 1 (entièrement connectée) comportant 1024 neurones, où la matrice de poids W1 transforme le vecteur d'entrée G en un vecteur de sortie à 1024 dimensions, chaque élément du vecteur de sortie étant une combinaison linéaire des caractéristiques d'entrée. Ensuite, le vecteur de biais b1 est ajouté à chacun des 1024 éléments du vecteur de sortie, ce qui permet au modèle de décaler indépendamment la sortie des caractéristiques d'entrée. De plus, le terme de régularisation L2 : λ||W1||22 pénalise les poids élevés, ce qui dissuade le modèle de dépendre excessivement d'un seul neurone et contribue ainsi à éviter le surapprentissage. Ici, la matrice de poids d'une couche donnée est notée W1 dans le réseau de neurones, tandis que ||W1||22 désigne la norme L2 au carré de la matrice de poids W1 et λ représente le paramètre de régularisation qui contrôle l'intensité de la régularisation appliquée, fixé à 0,1 dans tous les blocs. Z1 devient la nouvelle représentation des caractéristiques après application de la couche dense ainsi que de la régularisation L2 sur l'entrée provenant du vecteur concaténé G, comme indiqué dans l'équation 6.
Après avoir obtenu la sortie de la couche dense du bloc 1 sous la forme de Z1, la couche de normalisation par lots a été appliquée afin d'accélérer le processus d'apprentissage, et l'équation 7 ci-dessous illustre son fonctionnement.
(7)
σ2 représente la variance de la sortie de la dernière couche Z1 sur l'ensemble du lot, tandis que μ est la moyenne de la sortie Z1, calculée séparément pour chaque neurone, qui était de 1024 dans la première couche dense. Quant à ε, il s'agit d'une petite constante intégrée afin d'assurer la stabilité numérique et d'éviter la division par zéro. La sortie normalisée peut être ajustée par le modèle grâce au paramètre d'échelle apprenable γ, tandis que la sortie normalisée peut être décalée par le paramètre de translation apprenable β. Enfin, après l'application de la couche de normalisation par lot (BatchNormalization) à la sortie de la couche dense, la sortie normalisée Z1 garantit que les activations ont une distribution cohérente à travers les différentes couches, ce qui contribue à stabiliser et accélérer l'apprentissage. Après la normalisation par lot, la sortie normalisée Z1 passe par la fonction d'activation ReLU fuyante (leaky ReLU), qui introduit une non-linéarité dans le réseau et permet ainsi d'apprendre des motifs complexes dans les données. Plutôt que de choisir ReLU ou une autre fonction d'activation, on a opté pour la ReLU fuyante, une version modifiée de la fonction ReLU qui prend en compte également les petites valeurs négatives au lieu de les ramener à 0 comme le fait la fonction d'activation ReLU, permettant ainsi de surmonter le problème du « ReLU mourant » (dying ReLU). L'équation 8 ci-dessous montre son fonctionnement.
(8)
Où Z1 appartient à la sortie de la couche de normalisation par lots (BatchNormalization), qui est transmise à Leaky ReLU comme entrée pour appliquer la non-linéarité, tandis que ∝ est une constante faible utilisée pour déterminer la pente de la partie négative de la fonction. En outre, A1 représente la sortie obtenue après l'application de la non-linéarité. Enfin, une couche de dropout est appliquée à la sortie A1 reçue en entrée depuis l'activation Leaky ReLU, comme indiqué dans l'équation 9.
(9)
Où A1 est la sortie initiale de la fonction d'activation reçue de la dernière fonction d'activation ReLu, et où p est le taux de dropout, variant entre 0 et 1, choisi respectivement à 0,3, 0,2 et 0,1 pour trois couches de blocs, simplement pour supprimer une fraction des neurones. De plus, A1′ indique la sortie modifiée après l'application de la couche de dropout, dans laquelle certains neurones ont été fixés à 0. Le principal avantage de son utilisation est de prévenir les problèmes de surapprentissage ainsi que de réduire la co-adaptation. Ensuite, la sortie du bloc1 A1′ est transmise au bloc suivant afin d'extraire à nouveau des caractéristiques plus abstraites, en appliquant les mêmes paramètres que dans le bloc 1, à l'exception de 512 neurones dans la couche dense au lieu de 1024 et d'un taux de dropout de 0,2 au lieu de 0,3, les autres séquences opérationnelles restant identiques, comme décrit dans les équations 10 à 13 ci-dessous.
(10)
(11)
(12)
(13)
Après avoir obtenu la sortie du bloc 1, notée A1′, celle-ci est transmise à la couche dense (entièrement connectée) du bloc 2 composée de 512 neurones, où la matrice de poids W2 transforme le vecteur d'entrée A1′ en un vecteur de sortie à 512 dimensions, chaque élément du vecteur de sortie étant une combinaison linéaire des caractéristiques d'entrée. Ensuite, le vecteur de biais b2 est ajouté à chacun des 512 éléments du vecteur de sortie, ce qui permet au modèle de décaler indépendamment la sortie des caractéristiques d'entrée. De plus, une régularisation L2 est également appliquée, où λ||W2||22 pénalise les poids élevés, ce qui permet d'atténuer le surajustement en empêchant le modèle de trop dépendre d'un neurone particulier dans ce bloc spécifique. Ici, W2 représente la matrice de poids d'une couche donnée du réseau de neurones, tandis que λ est le paramètre de régularisation qui contrôle l'intensité de la régularisation appliquée, fixé ici à 0,1. Z2 devient la nouvelle représentation des caractéristiques après application de la couche dense ainsi que de la régularisation L2 sur l'entrée provenant du bloc 1, comme indiqué dans l'équation 10.
En outre, la couche de normalisation par lots a été appliquée à la nouvelle caractéristique Z2, ce qui permet d'accélérer le processus d'apprentissage ; σ22 représente la variance sur l'ensemble du lot, tandis que μ2 est la moyenne de la sortie Z2. Bien que ε soit une petite constante intégrée afin d'assurer la stabilité numérique, γ est un paramètre d'échelle ajustable qui permet au modèle de modifier la sortie normalisée, et β est un paramètre de décalage ajustable qui permet au modèle de décaler la sortie normalisée. Enfin, après avoir appliqué la couche de normalisation par lots, comme indiqué dans l'équation 11, la sortie normalisée Z2 passe par la fonction d'activation ReLU fuiteuse, ce qui introduit une non-linéarité dans le réseau, comme illustré dans l'équation 12. Ici, Z2 correspond à la sortie de la couche de normalisation par lots, qui est transmise comme entrée à la ReLU fuiteuse afin d'introduire la non-linéarité. Tandis que A2 indique la sortie obtenue après l'application de la non-linéarité.
Enfin, une couche de dropout est appliquée à la sortie A2 reçue en entrée depuis l'activation Leaky ReLU, comme indiqué dans l'équation 13. Ici, A2 correspond à la sortie provenant de la dernière fonction d'activation ReLU, et p2 représente le taux de dropout, choisi à 0,2 pour ce bloc, afin simplement d'annuler une fraction des neurones. Par ailleurs, A2′ indique la sortie modifiée après application de la couche de dropout, dans laquelle certains neurones ont été fixés à 0. Ensuite, la sortie du bloc 2, A2′, est transmise au troisième bloc afin d'extraire à nouveau des caractéristiques plus abstraites, en appliquant les mêmes paramètres que dans le bloc 2, à l'exception de 256 neurones dans la couche dense au lieu de 512 et d'un taux de dropout de 0,1 au lieu de 0,2 ; les autres séquences opérationnelles restent identiques, comme décrit dans les équations 14 à 17 ci-dessous.
(14)
(15)
(16)
(17)
Après avoir obtenu la sortie du bloc 2, notée A2′, celle-ci est transmise à la couche dense (entièrement connectée) du bloc 3 composée de 256 neurones, où la matrice de poids W3 transforme le vecteur d'entrée A2′ en un vecteur de sortie à 256 dimensions, chaque élément du vecteur de sortie étant une combinaison linéaire des caractéristiques d'entrée. Ensuite, le vecteur de biais b3 est ajouté à chacun des 256 éléments du vecteur de sortie, ce qui permet au modèle de décaler indépendamment la sortie des caractéristiques d'entrée. Par ailleurs, une régularisation L2 est également appliquée, où λ||W3||22 pénalise les poids élevés, ce qui dissuade le modèle de dépendre excessivement d'un seul neurone et contribue ainsi à éviter le surapprentissage. Ici, W3 représente la matrice de poids d'une couche particulière du réseau de neurones, tandis que le degré de régularisation utilisé est contrôlé par le paramètre de régularisation λ, fixé à 0,01. Z3 devient la nouvelle représentation des caractéristiques après application de la couche dense ainsi que de la régularisation L2 sur l'entrée provenant du bloc 3, comme indiqué dans l'équation 14.
En outre, la couche de normalisation par lots a été appliquée à la nouvelle caractéristique Z3, ce qui permet d'accélérer le processus d'apprentissage ; σ32 représente la variance sur l'ensemble du lot, tandis que μ3 est la moyenne de la sortie Z3. Quant à ε, il s'agit d'une petite constante ajoutée pour assurer la stabilité numérique. La sortie normalisée peut être ajustée par le modèle à l'aide du paramètre d'échelle apprenable γ3, puis décalée à l'aide du paramètre de translation apprenable β3. Enfin, après l'application de la couche de normalisation par lots, illustrée dans l'équation 15, la sortie normalisée Z3 traverse la fonction d'activation ReLU fuyante, qui introduit une non-linéarité dans le réseau, comme indiqué dans l'équation 16. Ici, Z3 correspond à la sortie de la couche de normalisation par lots, qui est transmise comme entrée à la ReLU fuyante afin d'appliquer la non-linéarité. Quant à A3, elle représente la sortie obtenue après l'application de la non-linéarité.
Enfin, une couche de dropout est appliquée à la sortie A3 reçue en entrée depuis l'activation Leaky ReLU, comme indiqué dans l'équation 17. Où A3 correspond à la sortie provenant de la dernière fonction d'activation ReLU, et où p3 est le taux de dropout, choisi à 0,1 pour ce bloc, afin simplement d'annuler une fraction des neurones. Par ailleurs, A3′ représente la sortie modifiée après application de la couche de dropout, dans laquelle certains neurones ont été fixés à 0.
En outre, la sortie du bloc 3 A3′ traverse la dernière couche dense à des fins de classification, avec un nombre K de neurones représentant le nombre réel de classes dans le jeu de données, comme décrit dans l'équation 18 ci-dessous.
(18)
La matrice de poids associée à la couche dense est Wk, qui est chargée de transformer le vecteur à 256 dimensions A3′ en un vecteur à k dimensions, représentant les caractéristiques apprises à partir du bloc précédent et fournies en sortie. De plus, bk représente le vecteur de biais qui ajuste la prédiction afin de garantir que la fonction d'activation produise une sortie non nulle lorsque l'entrée est nulle, et Zk est la sortie de la couche finale avant l'application de la fonction d'activation ; elle génère les logits pour chaque classe. Enfin, un classificateur SoftMax41 est appliqué, qui convertit le logit Zk en probabilités pour chaque classe, comme indiqué dans les équations 19 et 20.
(19)
(20)
La probabilité prédite de la classe ième est représentée par yi, K est le nombre de classes, tandis que Zk, i est le logit pour la classe ième, et eZk, i est l'exponentielle du logit de la classe ième. y indique la distribution de probabilité de toutes les classes possibles et garantit que la somme des probabilités est égale à 1. Tableau 3 ci-dessous fournit les détails des hyperparamètres utilisés pour entraîner le modèle hybride proposé, y compris les détails architecturaux adoptés afin d'améliorer la reproductibilité et les performances.
| Paramètres hyper | Modèle proposé (FusionNetX) |
| Taille de l'image | 224 × 224 |
| Architecture du réseau de base | EfficientNetB7 et DenseNet121 préentraînés respectivement utilisés comme BBA1 et BBA2 |
| Augmentation des données | Plage de rotation = 7, |
| Décalage en largeur/hauteur jusqu'à 0,05, |
| Plage de zoom jusqu'à 0,01, |
| Retournement horizontal/vertical |
| Ratio de division des données | 80 % pour l'entraînement et 20 % pour la validation, avec un échantillonnage stratifié et un état aléatoire fixe = 42 |
| Extraction et fusion des caractéristiques | Un regroupement par moyenne globale est appliqué sur la sortie de chaque réseau de base : 2560 pour BBA1 et 1024 pour BBA2, puis fusionnés pour obtenir 3584 vecteurs de caractéristiques conjointes. |
| Composition du bloc entièrement connecté | 3 blocs entièrement connectés avec 1 couche de sortie. Chaque bloc contient une régularisation L2 (λ=0,01), une normalisation par lot, une fonction LeakyReLU (α=0,01), une désactivation (0,3, 0,2 et 0,1) et une dimension cachée (1024, 512, 256) respectivement. Aucune connexion de saut supplémentaire n'est introduite dans la tête de fusion. |
| Fonction d'activation | Leaky ReLU & SoftMax |
| Optimiseur et taux d'apprentissage | Adam avec un taux fixe de 0,00001, sans planificateur de taux d'apprentissage. |
| Fonction de perte | sparse_categorical_crossentropy |
| Taille du lot | 16 |
| Époques | 100 époques fixes pour chaque jeu de données |
| Plateforme utilisée | Carnet Kaggle équipé d'un GPU P100 et de 16 Go de mémoire vidéo, avec les plateformes TensorFlow et Keras. |
Tableau 3 : Hyperparamètres utilisés pour entraîner le modèle proposé et détails architecturaux proposés. Ce tableau fournit les détails structurels et architecturaux du modèle proposé, ainsi que les paramètres finement ajustés et l'environnement d'implémentation.