$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Aperçu
Un cadre d’apprentissage fédéré intelligent (IFLF) a été développé pour gérer efficacement l’hétérogénéité des données et des systèmes dans des environnements non colocalisés. L’architecture système se composait de cinq couches : la couche données, la couche client, la couche d’agrégation, la couche d’adaptation et d’optimisation, et la couche d’interprétabilité. Les modules étaient déployés via une configuration de calcul distribué avec un serveur d’agrégation central et plusieurs nœuds clients. Les connexions sécurisées par socket (SSL/TLS) étaient utilisées pour la communication entre les nœuds afin d’assurer la confidentialité et l’intégrité des données. La procédure suivante a été utilisée pour préparer des ensembles de données, mettre en place l’architecture, mener des formations fédérées et évaluer l’interprétabilité.
Configuration de l’environnement de calcul
L’environnement informatique a été configuré en installant les cadres logiciels nécessaires à la mise en œuvre du cadre d’apprentissage fédéré. Python a été utilisé comme principal langage de programmation pour le développement et l’expérimentation de modèles. Des bibliothèques d’apprentissage automatique, dont TensorFlow ou PyTorch, ont été installées pour l’entraînement des réseaux neuronaux, ainsi que d’autres bibliothèques telles que NumPy, Scikit-learn et Pandas pour le prétraitement et l’analyse des données. Des bibliothèques d’apprentissage fédérées telles que Flower ou PySyft ont été installées pour simuler des environnements clients distribués. L’environnement informatique était configuré sur une station de travail équipée d’accélération GPU, lorsque disponible. Tous les clients et le serveur d’agrégation étaient configurés pour communiquer via des connexions socket sécurisées (SSL/TLS). Tous les ensembles de données requis ont été vérifiés pour être accessibles dans le stockage local de chaque nœud client avant d’initier la formation fédérée. Les cadres logiciels, les ensembles de données et l’environnement informatique nécessaires à la reproduction du protocole sont résumés dans le Table of Materials.
Initialisation des nœuds fédérés
Le serveur central d’agrégation a été configuré à l’aide du cadre d’apprentissage fédéré Flower. Le serveur d’agrégation a été lancé à l’aide de la commande suivante :
python server.py --rondes 100 --clients 10 --secure_connection Vrai
Les nœuds clients individuels étaient lancés sur des terminaux ou environnements informatiques distincts à l’aide de la commande suivante :
Python client.py --client_id 01
La communication sécurisée par socket était configurée en générant des certificats SSL/TLS à l’aide de la boîte à outils OpenSSL.
openssl req -x509 -newkey rsa :4096 -keyout key.pem -out cert.pem -days 365
La communication sécurisée entre le serveur et les clients était rendue possible en spécifiant les chemins des certificats dans le fichier de configuration. La connectivité a été vérifiée en effectuant un tour de communication test avant le lancement du processus d’entraînement fédéré.
Préparation et description de l’ensemble de données
Des ensembles de données publics représentatifs ont été sélectionnés pour évaluer les performances dans différents domaines et modalités de données. FEMNIST est une base de données MNIST avancée pour la reconnaissance manuscrite de caractères, contenant 62 classes (A–Z, a–z, chiffres 0–9), où chaque client représente les données d’un auteur, induisant des distributions naturelles non-IID. FLamby est une référence d’imagerie médicale composée de différents ensembles de données médicaux inter-silos (par exemple, IRM cardiaque, images histopathologiques), où chaque hôpital ou institution agit comme un client fédéré. FedGraphNN est une référence pour les réseaux de neurones à graphes couvrant des tâches telles que les réseaux de citation, la classification des molécules et les graphes sociaux, où les clients contiennent des sous-graphes ou des caractéristiques de nœuds différentes. CICIDS2017 est un ensemble de données de cybersécurité pour la détection d’intrusion avec plus de 80 caractéristiques des flux de trafic réseau à travers différents types d’attaques tels que DDoS, PortScan et Botnet, où chaque client représente un domaine réseau ou un capteur distinct.
Statistiques de jeu de données
Les caractéristiques clés des ensembles de données utilisés dans les expériences ont été résumées afin d’assurer la reproductibilité de la configuration d’apprentissage fédéré. FEMNIST contient environ 805 263 exemples de caractères manuscrits répartis sur 3 550 auteurs, avec 62 classes représentant les lettres majuscules, minuscules et chiffres, et chaque client correspond à un seul auteur avec environ 200 à 300 échantillons en moyenne. FLamby fournit des ensembles de données de santé inter-silos et, dans cette étude, l’ensemble d’images médicales contient environ 20 000 échantillons collectés dans plusieurs hôpitaux, où chaque hôpital agit comme un client fédéré indépendant. FedGraphNN inclut plusieurs ensembles de données d’apprentissage de graphes tels que des réseaux de citations et des graphes moléculaires, contenant généralement des milliers de nœuds et d’arêtes avec des vecteurs de caractéristiques de nœuds variant de 50 à 500 dimensions selon la tâche. CICIDS2017 contient environ 2,8 millions de flux de trafic réseau avec 80 caractéristiques statistiques extraites de paquets réseau et inclut plusieurs catégories d’attaque telles que DDoS, PortScan et Botnet, où chaque client fédéré représente un environnement réseau ou un capteur de surveillance différent. Les ensembles de données utilisés dans cette étude ont été publiés entre 2017 et 2023 et sont disponibles publiquement pour la recherche sur l’apprentissage fédéré. Les caractéristiques statistiques des ensembles de données utilisés dans les expériences sont résumées dans le tableau 1.
| Jeu de données | Domaine | Échantillons | Caractéristiques | Classes | Clients | Année de sortie |
| FEMNIST | Vision (caractères manuscrits) | 8,05,263 | Pixels d’image (28×28) | 62 | 3,550 | 2017 |
| FLamby | Imagerie de santé | ~20 000 | Caractéristiques d’image | Binaire / multi-classe | 5 | 2023 |
| FedGraphNN | Apprentissage des graphes | ~10k–100k nœuds | Caractéristiques de 50–500 nœuds | Dépendant de la tâche | 7 | 2021 |
| CICIDS2017 | Cybersécurité | ~2,8 millions de débits | 80 | Classes d’attaque multiples | 10 | 2017 |
Tableau 1 : Résumé des ensembles de données utilisés dans les expériences du Cadre d’apprentissage intelligent fédéré. Le tableau résume les caractéristiques des ensembles de données utilisés dans cette étude, incluant le domaine applicatif, le nombre total d’échantillons, le nombre de caractéristiques, le nombre de classes, le nombre de clients fédérés et l’année de publication du jeu de données. Ces statistiques offrent un aperçu des modalités de données hétérogènes utilisées pour évaluer le cadre.
Hétérodégénéité au niveau du client
L’hétérogénéité au niveau du client a été introduite via le partitionnement des ensembles de données. Bien que quatre ensembles de données provenant de domaines différents aient été utilisés pour l’évaluation, l’hétérogénéité a été introduite au sein de chaque jeu de données fédéré via un partitionnement au niveau client. Chaque jeu de données était réparti entre plusieurs clients, aboutissant à des distributions locales de données non identiques (non-IID). Différents sous-ensembles d’échantillons ou de classes ont été attribués à chaque client pour simuler des conditions d’apprentissage fédérées réalistes, représentant l’hétérogénéité statistique au sein de chaque ensemble de données. Environ 5 à 10 % de l’ensemble des données étaient attribués à chaque client tout en maintenant un déséquilibre de classe pour émuler des environnements fédérés non IID réels. Le terme ensembles de données hétérogènes dans cette étude fait référence à l’hétérogénéité statistique au niveau du client plutôt qu’aux différences entre des ensembles de données expérimentales indépendants. Les ensembles de données de référence présentaient différentes formes d’hétérogénéité statistique, incluant des variations dans les styles d’écriture individuels dans FEMNIST, des différences dans les protocoles d’imagerie et la démographie des patients dans les ensembles de données FLamby, des variations structurelles dans les ensembles de données FedGraphNN, ainsi que des schémas de trafic réseau diversifiés dans CICIDS2017, créant collectivement des distributions de données non-IID réalistes qui remettent en cause les algorithmes d’optimisation fédérée.
Prétraitement spécifique à chaque jeu de données
Des opérations de prétraitement spécifiques à chaque ensemble de données ont été réalisées pour standardiser les formats d’entrée avant l’entraînement fédéré. Pour FEMNIST, les images manuscrites de caractères étaient converties en niveaux de gris, redimensionnées à 28×28 pixels, et normalisées à l’intervalle [0, 1], avec des échantillons corrompus ou incomplets supprimés, les étiquettes de classe encodées en one-hot, et les échantillons organisés par identifiants d’auteur afin que chaque auteur corresponde à un client fédéré. Pour FLamby, les images médicales ont été redimensionnées à 224×224 pixels, normalisées à l’aide de la moyenne et de l’écart-type spécifiques à chaque ensemble de données, augmentées par des techniques telles que le basculement horizontal, la rotation et l’ajustement du contraste, puis partitionnées selon les identifiants hospitaliers. Pour FedGraphNN, les structures de graphes ont été construites en définissant les caractéristiques des nœuds, les matrices d’adjacence et les relations d’arête, les vecteurs de caractéristiques des nœuds ont été normalisés, les données des graphes ont été converties en représentations d’adjacence clairsemées, et les graphes ont été répartis entre les clients en tant que sous-graphes. Pour CICIDS2017, les enregistrements en double ont été supprimés, les valeurs manquantes ont été imputées à la moyenne, les caractéristiques catégorielles ont été encodées, la normalisation des caractéristiques a été appliquée, et le trafic bénin et d’attaque a été équilibré à l’aide d’un échantillonnage stratifié. Chaque jeu de données client était divisé en sous-ensembles de 80 % d’entraînement, 10 % de validation et 10 % de tests, garantissant ainsi la préservation des distributions de classes. Les ensembles de données clients étaient stockés dans des dossiers séparés (Client_01, Client_02, ...), et l’accès aux nœuds locaux était restreint pour des raisons de confidentialité.
Architecture du Cadre d’apprentissage fédéré intelligent (IFLF)
Le Cadre d’apprentissage fédéré intelligent était organisé en une architecture à cinq couches comprenant la couche des données, la couche client, la couche d’agrégation, la couche d’adaptation et d’optimisation, et la couche d’interprétabilité, comme illustré dans la Figure 1. Les couches architecturales ont été conçues pour transmettre l’information de manière séquentielle. Après avoir préparé et partitionné des ensembles de données hétérogènes selon la propriété du client, la couche de données transmettait les informations à la couche client, où les modèles locaux étaient entraînés et les mises à jour des modèles générées. Ces mises à jour étaient envoyées à la couche d’agrégation, où les métriques de fiabilité et de similarité guidaient l’agrégation des contributions pondérées des clients. La couche d’adaptation et d’optimisation assurait un processus d’entraînement global fluide en variant les paramètres du taux d’apprentissage en fonction de la variance du gradient. Enfin, la couche d’interprétabilité a exploité des méthodes d’intelligence artificielle explicables telles que SHAP et LIME pour interpréter le modèle global et produire des explications des prédictions.

Figure 1. Architecture du cadre d’apprentissage fédéré intelligent. Le cadre est divisé en cinq couches : Données, Client, Agrégation, Adaptation et Optimisation, et Interprétabilité. Les données provenant de clients hétérogènes non colocats sont traitées localement, agrégées en fonction de la fiabilité et de la similarité, optimisées de manière adaptative et interprétées à l’aide de SHAP ou de LIME. Des flèches indiquent la communication itérative entre les clients et le serveur central formant la boucle d’apprentissage fédérée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Couche de données
Les ensembles de données étaient divisés selon la propriété du client et les exigences de confidentialité, avec des emplacements de stockage dédiés maintenus pour chaque client. Différents pipelines de prétraitement ont été appliqués, et des fonctionnalités ont été normalisées pour garantir des formats d’entrée standardisés entre les domaines.
Couche client
Des clients distribués représentant des appareils, organisations ou institutions ont été mis en place, chacun recevant une copie identique du modèle global initialisée avec les mêmes paramètres. L’entraînement local était réalisé à l’aide de jeux de données spécifiques au client, avec des méthodes d’optimisation telles que la descente du gradient stochastique ou Adam, tandis que seuls les paramètres ou gradients du modèle étaient communiqués pour préserver la confidentialité des données.
Couche d’agrégation
Une unité centrale d’agrégation recevait les mises à jour chiffrées des modèles de tous les clients et évaluait leur fiabilité et similarité avant l’agrégation. Des scores de fiabilité basés sur la performance de validation ont été utilisés pour déterminer l’importance des mises à jour clients, et la similarité entre les mises à jour a été évaluée à l’aide de méthodes telles que le clustering ou la similarité cosinus. L’agrégation pondérée a été réalisée, et le modèle global mis à jour a été redistribué aux clients.
Couche d’adaptation et d’optimisation
Les paramètres d’optimisation ont été ajustés dynamiquement en fonction de l’avancement de la formation chez les clients. Les taux d’apprentissage ont été programmés pour réduire la variance des mises à jour, et des techniques supplémentaires telles que la régularisation proximale et la pondération adaptative ont été appliquées pour atténuer la dérive client et améliorer la stabilité de convergence.
Couche d’interprétabilité
Des méthodes d’intelligence artificielle explicables telles que SHAP et LIME ont été utilisées pour générer des scores d’attribution de caractéristiques et des explications de modèles. Les résultats comprenaient des classements d’importance des caractéristiques, des cartes d’attribution et des explications visuelles, interprétées dans le contexte des connaissances spécifiques au domaine afin d’assurer la transparence.
Entraînement fédéré
Le Cadre d’Apprentissage Fédéré Intelligent a été implémenté par l’initialisation du modèle global au serveur central d’agrégation, suivi de la définition des hyperparamètres d’entraînement, incluant le taux d’apprentissage, les rondes de communication et les époques locales. Les paramètres mondiaux du modèle ont été distribués à tous les clients, qui ont ensuite effectué des entraînements locaux en utilisant leurs jeux de données privés. La perte locale d’entraînement et la précision de validation étaient calculées, et des mises à jour de modèles étaient générées et chiffrées avant transmission au serveur d’agrégation. La fiabilité des mises à jour clients a été évaluée en fonction de la performance de validation à l’aide de l’Équation 1.
(1)
Où Acci représente la précision de validation du client i.
La similarité entre les mises à jour des clients a été calculée à l’aide de similarité cosinus des vecteurs de gradient, telle que définie dans l’équation 2.
(2)
Où gi et g j représentent les vecteurs de gradient de différents clients.
Les poids d’agrégation adaptative ont été calculés en combinant les scores de fiabilité et de similarité, tels que définis dans l’équation 3.
(3)
Le poids d’agrégation adaptatif pour chaque client a été déterminé en combinant les scores de fiabilité et de similarité. La métrique de fiabilité reflétait la précision de validation du modèle client local, tandis que la métrique de similarité mesurait la similarité cosinus entre les mises à jour du gradient client.
Le poids d’agrégation wi a donc priorisé des clients qui démontraient à la fois une performance de validation fiable et affichaient des orientations de mise à jour cohérentes avec l’objectif global d’optimisation.
Les pondérations normalisées ont permis de totaliser la contribution totale de tous les clients participants à un, maintenant ainsi la stabilité dans la mise à jour globale du modèle.
Les poids ont été normalisés de sorte que
.
Mise à jour mondiale du modèle
Les modèles clients ont été agrégés à l’aide d’une moyenne pondérée, comme montré dans l’équation 4.
(4)
Où Mi représente les paramètres locaux du client i.
Les paramètres mondiaux mis à jour du modèle ont été diffusés à tous les clients.
Modulation du taux d’apprentissage adaptatif
La variance des gradients clients entre les rondes de communication a été surveillée. Le taux d’apprentissage a été ajusté dynamiquement selon l’équation 5.
(5)
Où Var(g) représente la variance du gradient entre les clients.
Le taux d’apprentissage mis à jour a été appliqué lors du cycle local de formation suivant. Le taux d’apprentissage adaptatif était contrôlé par le serveur central d’agrégation et appliqué globalement sur tous les clients lors des tours d’entraînement suivants. Cet ajustement global a permis un comportement d’optimisation cohérent tout en tenant compte de la variance dans les mises à jour des clients. Comme la modulation du taux d’apprentissage était effectuée au niveau du serveur, tous les clients participants recevaient le taux d’apprentissage mis à jour ainsi que les paramètres du modèle global de diffusion.
Évaluation de la performance en apprentissage fédérée
La précision globale du modèle a été évaluée à l’aide du jeu de données de tests agrégé, comme montré dans l’équation 6.
(6)
Où TP représente le nombre de prédictions véritablement positives, TN représente les prédictions véritablement négatives, FP représente les prédictions faussement positives, et FN représente les prédictions faussement négatives
L’équité entre les clients a été mesurée en calculant la variance de la précision client.
Le coût de communication était calculé comme le nombre total de paramètres du modèle transmis entre les clients et le serveur d’agrégation sur toutes les rondes de communication. La surcharge totale de communication a donc été estimée comme montré dans l’équation 7.
(7)
Où R est le nombre de tours de communication, C le nombre de clients, et S représente la taille du modèle.
L’analyse de l’interprétabilité du modèle a été réalisée à l’aide de SHAP pour calculer les scores globaux d’importance des caractéristiques et de LIME pour générer des explications locales pour les prédictions individuelles. Les résultats d’attribution des caractéristiques ont été visualisés pour interpréter le comportement du modèle.
Dépannage
La convergence instable s’est produite lorsque les ensembles de données clients étaient très hétérogènes ou contenaient des distributions de classes extrêmement déséquilibrées. Dans de tels cas, les époques d’entraînement locales ont été réduites ou le taux d’apprentissage initial a été diminué pour stabiliser les mises à jour du gradient. Des distributions clients fortement asymétriques ont conduit à la domination d’un petit nombre de clients lors de l’agrégation, ce qui a été atténué en ajustant le seuil de pondération de fiabilité ou en augmentant la diversité de la participation des clients. La participation client peu fiable causée par des interruptions réseau perturbait les rondes de communication ; par conséquent, une participation partielle a été autorisée, permettant au serveur d’agrégation de poursuivre les mises à jour disponibles des clients. Une défaillance d’interprétabilité ou une attribution de caractéristiques incohérente survenaient lorsque les modèles étaient sur-régularisés ou entraînés sur des données insuffisantes, et les étapes de prétraitement des données étaient vérifiées tout en garantissant que des explications SHAP ou LIME étaient générées après la convergence des modèles.
La séquence itérative d’initialisation du modèle, d’entraînement local, d’agrégation intelligente, d’optimisation adaptative et d’analyse interprétable est représentée à la Figure 2, qui représente le flux de travail global du Cadre d’Apprentissage Fédéré Intelligent (IFLF).

Figure 2. Flux de travail du Cadre d’Apprentissage Fédéré Intelligent. La figure illustre le cycle itératif des phases, incluant l’initialisation, la formation locale, l’agrégation, l’optimisation adaptative et l’interprétabilité, illustrant le fonctionnement de bout en bout du framework. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
Évaluation des performances
Des indicateurs globaux et locaux, notamment la précision, la propreté, la mémoire et le score F1, ont été calculés. L’équité était mesurée par la variance de la précision locale des clients. L’efficacité de la communication a été examinée comme la taille des données transférées par tour. La performance du modèle a été évaluée selon des références fédérées typiques telles que FedAvg, FedProx et FedOpt. Les résultats ont été présentés à l’aide de courbes de convergence, de matrices de confusion et de graphiques d’interprétabilité. Tous les paramètres expérimentaux, journaux et points de contrôle étaient stockés pour garantir leur reproductibilité.
Résumé du flux de travail
Le cycle IFLF a été réalisé par une répétition continue de la formation locale, une agrégation intelligente, une optimisation adaptative et une analyse interprétable. La confidentialité des données était assurée en conservant les données sur les nœuds locaux tout en permettant l’amélioration collaborative du modèle. Ces étapes ont intégré des mécanismes visant à garantir l’équité, la transparence et la performance entre les clients non colocalisés.