$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Przegląd
Opracowano Inteligentny Federacyjny Framework Uczenia się (IFLF) do efektywnego zarządzania heterogenicznością danych i systemów w środowiskach nielokalizowanych. Architektura systemu składała się z pięciu warstw: warstwy danych, warstwy klienta, warstwy agregacji, warstwy adaptacji i optymalizacji oraz warstwy interpretowalności. Moduły były wdrażane w rozproszonej konfiguracji obliczeniowej z centralnym serwerem agregacji i wieloma węzłami klienckimi. Do komunikacji między węzłami stosowano bezpieczne połączenia gniazdowe (SSL/TLS), aby zapewnić prywatność i integralność danych. Poniższa procedura została wykorzystana do przygotowania zbiorów danych, konfiguracji architektury, przeprowadzenia szkoleń federacyjnych oraz oceny interpretowalności.
Konfiguracja środowiska obliczeniowego
Środowisko obliczeniowe zostało skonfigurowane poprzez instalację wymaganych frameworków programowych do implementacji federated learning framework. Python był głównym językiem programowania do tworzenia modeli i eksperymentowania. Zainstalowano biblioteki uczenia maszynowego, w tym TensorFlow lub PyTorch, do treningu sieci neuronowych, a także dodatkowe biblioteki, takie jak NumPy, Scikit-learn i Pandas, do wstępnego przetwarzania i analizy danych. Zainstalowano federacyjne biblioteki uczące się, takie jak Flower czy PySyft, aby symulować rozproszone środowiska klienckie. Środowisko obliczeniowe było skonfigurowane na stacji roboczej wyposażonej w akcelerację GPU, gdzie była dostępna. Wszyscy klienci oraz serwer agregacji byli skonfigurowani do komunikacji za pomocą bezpiecznych połączeń socket (SSL/TLS). Wszystkie wymagane zbiory danych zostały zweryfikowane jako dostępne w lokalnej pamięci magazynowej każdego węzła klienta przed rozpoczęciem federacyjnego treningu. Frameworki oprogramowania, zbiory danych oraz środowisko obliczeniowe potrzebne do odtworzenia protokołu zostały podsumowane w Tabeli Materiałów.
Inicjalizacja federowanych węzłów
Centralny serwer agregacji został skonfigurowany za pomocą federacyjnego frameworka Flower. Serwer agregacji został uruchomiony za pomocą następującego polecenia:
Python server.py --zaokrągla 100 --klientów 10 --secure_connection Prawda
Poszczególne węzły klienckie były uruchamiane na oddzielnych terminalach lub środowiskach obliczeniowych za pomocą następującego polecenia:
Python client.py --client_id 01
Komunikacja przez bezpieczne gniazdo była konfigurowana poprzez generowanie certyfikatów SSL/TLS za pomocą narzędzi OpenSSL.
OpenSSL Req -x509 -newkey rsa:4096 -keyout key.pem -out cert.pem -dni 365
Bezpieczna komunikacja między serwerem a klientami była umożliwiana poprzez określenie ścieżek certyfikatów w pliku konfiguracyjnym. Łączność weryfikowano poprzez przeprowadzenie testowej rundy komunikacyjnej przed rozpoczęciem federacyjnego procesu szkolenia.
Przygotowanie i opis zbioru danych
Wybrano reprezentatywne publiczne zbiory danych do oceny wydajności w różnych dziedzinach i modalnościach danych. FEMNIST to zaawansowana baza danych MNIST do rozpoznawania znaków odręcznych, zawierająca 62 klasy (A–Z, a–z, cyfry 0–9), gdzie każdy klient reprezentuje dane jednego autora, co prowadzi do naturalnych rozkładów nie-IID. FLamby to medyczny benchmark obrazowania składający się z różnych zestawów medycznych z różnych zestawów medycznych (np. rezonans magnetyczny serca, obrazy histopatologiczne), gdzie każdy szpital lub instytucja pełni rolę klienta federalnego. FedGraphNN to benchmark dla grafowych sieci neuronowych obejmujących zadania takie jak sieci cytowań, klasyfikacja cząsteczek oraz grafy społeczne, gdzie klienci zawierają różne podgrafy lub cechy węzłów. CICIDS2017 to zbiór danych cyberbezpieczeństwa do wykrywania włamań, zawierający ponad 80 cech przepływów ruchu sieciowego w różnych typach ataków takich jak DDoS, PortScan i Botnet, gdzie każdy klient reprezentuje osobną domenę sieciową lub czujnik.
Statystyki zbioru danych
Kluczowe cechy zestawów danych użytych w eksperymentach zostały podsumowane, aby zapewnić powtarzalność systemu uczenia się federacyjnego. FEMNIST zawiera około 805 263 próbek znaków ręcznie napisanych rozproszonych wśród 3 550 autorów, z czego 62 klasy reprezentują wielkie litery, małe litery i cyfry, a każdy klient odpowiada pojedynczemu autorowi ze średnio około 200–300 próbkami. FLamby udostępnia zbiory danych medycznych obejmujące różne obszary medyczne, a w tym badaniu zbiór obrazowania medycznego zawiera około 20 000 próbek zebranych z wielu szpitali, gdzie każdy szpital działa jako niezależny klient federacyjny. FedGraphNN zawiera wiele zbiorów danych uczących grafy, takich jak sieci cytowań i grafy cząsteczkowe, zazwyczaj zawierające tysiące węzłów i krawędzi z wektorami cech węzłów o wymiarach od 50 do 500 w zależności od zadania. CICIDS2017 zawiera około 2,8 miliona przepływów ruchu sieciowego z 80 cechami statystycznymi wyodrębnionymi z pakietów sieciowych i obejmuje wiele kategorii ataków, takich jak DDoS, PortSkan i ruch Botnet, gdzie każdy federowany klient reprezentuje inne środowisko sieciowe lub czujnik monitorujący. Zbiory danych użyte w tym badaniu zostały opublikowane w latach 2017–2023 i są publicznie dostępne do badań w zakresie nauki federacyjnej. Charakterystyki statystyczne zestawów danych użytych w eksperymentach są podsumowane w Tabeli 1.
| Zbiór danych | Domena | Próbki | Cechy | Klasy | Klienci | Rok premiery |
| FEMNIST | Vision (Znaki odręczne) | 8,05,263 | Piksele obrazu (28×28) | 62 | 3,550 | 2017 |
| Fallamby | Obrazowanie medyczne | ~20 000 | Funkcje obrazowe | Binarne / wieloklasowe | 5 | 2023 |
| FedGraphNN | Uczenie grafów | ~10k–100k węzłów | Cechy 50–500 węzłów | Zależność od zadania | 7 | 2021 |
| CICIDS2017 | Cyberbezpieczeństwo | ~2,8 miliona przepływów | 80 | Klasy ataku wielokrotnego | 10 | 2017 |
Tabela 1: Podsumowanie zbiorów danych wykorzystywanych w eksperymentach Intelligent Federated Learning Framework. Tabela podsumowuje cechy zestawów danych użytych w tym badaniu, w tym domenę aplikacji, łączną liczbę próbek, liczbę cech, liczbę klas, liczbę federowanych klientów oraz rok wydania zbioru. Statystyki te przedstawiają przegląd heterogenicznych modalności danych wykorzystywanych do oceny ram.
Heterogeniczność na poziomie klienta
Heterogeniczność na poziomie klienta została wprowadzona poprzez partycjonowanie zbiorów danych. Chociaż do oceny użyto czterech zbiorów danych z różnych domen, heterogeniczność wprowadzono w każdym federowanym zbiorze danych poprzez partycjonowanie na poziomie klienta. Każdy zbiór danych był podzielony między wielu klientów, co skutkowało nieidentycznymi lokalnymi rozkładami danych (nie-IID). Różne podzbiory próbek lub klas zostały przypisane poszczególnym klientom, aby symulować realistyczne warunki federacji uczenia się, reprezentując statystyczną heterogeniczność w obrębie każdego zbioru danych. Około 5–10% całego zbioru danych przypisano każdemu klientowi, przy jednoczesnym zachowaniu nierównowagi klasowej, aby emulować rzeczywiste środowiska federacyjne niezwiązane z IID. Termin heterogeniczne zbiory danych w tym badaniu odnosi się do statystycznej heterogeniczności na poziomie klienta, a nie do różnic między niezależnymi zbiorami danych eksperymentalnych. Zbiory danych benchmarkowe wykazywały różne formy statystycznej heterogeniczności, w tym różnice w indywidualnych stylach pisania w FEMNIST, różnice w protokołach obrazowania i demografii pacjentów w zbiorach FLamby, zróżnicowanie strukturalne w zbiorach danych FedGraphNN oraz różnorodne wzorce ruchu sieciowego w CICIDS2017, co wspólnie tworzyło realistyczne rozkłady danych nie-IID, które kwestionują federacyjne algorytmy optymalizacyjne.
Specyficzne dla zbioru danych wstępne przetwarzanie
Przeprowadzono operacje wstępnego przetwarzania specyficznego dla zbioru danych, aby ustandaryzować formaty wejściowe przed federacyjnym treningiem. W FEMNIST obrazy znaków pisanych ręcznie były konwertowane na skalę szarości, zmniejszane do 28×28 pikseli i normalizowane do przedziału [0, 1], usuwając uszkodzone lub niepełne próbki, kodując etykiety klas na jedną gorącą kartę oraz organizując próbki według identyfikatorów pisarzy, tak aby każdy pisarz odpowiadał federalnemu klientowi. W przypadku FLamby obrazy medyczne zostały zmniejszone do 224×224 pikseli, znormalizowane przy użyciu średniej i odchylenia standardowego specyficznego dla zbioru danych, rozszerzone technikami takimi jak odwrócenie poziome, rotacja i regulacja kontrastu oraz podzielone według identyfikatorów szpitala. W FedGraphNN struktury grafów zostały skonstruowane poprzez zdefiniowanie cech węzłów, macierzy sąsiedztwa i relacji krawędziowych, wektory cech węzłów zostały znormalizowane, dane grafowe przekształcone w rzadkie reprezentacje sąsiedztwa, a grafy podzielono na klientów jako podgrafy. Przez CICIDS2017 usuwano duplikaty rekordów, przypisywano brakujące wartości ze średnią, kodowano cechy kategoryczne, stosowano normalizację cech, a ruch benigny i atakujący równoważono za pomocą próbkowania stratyfikacyjnego. Każdy zbiór danych klienta podzielono na 80% podzbiorów treningowych, 10% walidacyjnych i 10% testowych, co zapewniało zachowanie rozkładów klas. Zbiory danych klientów były przechowywane w oddzielnych folderach (Client_01, Client_02, ...), a dostęp do lokalnych węzłów był ograniczony ze względów prywatności.
Architektura Inteligentnych Federacyjnych Ram Uczenia (IFLF)
Intelligent Federated Learning Framework został zorganizowany w pięciowarstwową architekturę składającą się z warstwy danych, warstwy klienta, warstwy agregacji, warstwy adaptacji i optymalizacji oraz warstwy interpretowalności, jak pokazano na rysunku 1. Warstwy architektoniczne zostały zaprojektowane tak, aby przekazywać informacje sekwencyjnie. Po przygotowaniu i podziałowaniu heterogenicznych zbiorów danych według własności klienta, warstwa danych przesyłała informacje do warstwy klienta, gdzie trenowano modele lokalne i generowano aktualizacje modeli. Aktualizacje te były przesyłane do warstwy agregacji, gdzie wskaźniki wiarygodności i podobieństwa kierowały agregacją ważonych wkładów klientów. Warstwa adaptacji i optymalizacji zapewniała płynny globalny proces treningu poprzez zmianę parametrów tempa uczenia się zgodnie z wariancją gradientu. Wreszcie, warstwa interpretowalności wykorzystała wyjaśnialne metody sztucznej inteligencji, takie jak SHAP i LIME, do interpretacji globalnego modelu i tworzenia wyjaśnień prognoz.

Rysunek 1. Architektura Inteligentnego Federacyjnego Frameworka Uczenia się. Ramy podzielone są na pięć warstw: Dane, Klient, Agregacja, Adaptacja i optymalizacja oraz Interpretowalność. Dane z klientów nielokalizowanych, heterogenicznych są przetwarzane lokalnie, agregowane na podstawie wiarygodności i podobieństwa, adaptacyjnie optymalizowane oraz interpretowane za pomocą SHAP lub LIME. Strzałki wskazują iteracyjny komunikat między klientami a serwerem centralnym, tworzący federacyjną pętlę uczenia. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Warstwa danych
Zbiory danych były podzielone według wymagań dotyczących własności klienta i prywatności, z dedykowanymi miejscami przechowywania dla każdego klienta. Zastosowano różne potoki przetwarzania wstępnego, a funkcje znormalizowano, aby zapewnić standaryzowane formaty wejściowe w różnych dziedzinach.
Warstwa klienta
Utworzono rozproszonych klientów reprezentujących urządzenia, organizacje lub instytucje, z których każdy otrzymał identyczną kopię globalnego modelu inicjalizowanego tymi samymi parametrami. Trening lokalny przeprowadzono przy użyciu specyficznych dla klienta zbiorów danych z metodami optymalizacyjnymi takimi jak stochastyczne zejście gradientu czy Adam, podczas gdy komunikowano jedynie parametry lub gradienty modelu, aby zachować prywatność danych.
Warstwa agregacji
Centralna jednostka agregacji otrzymywała szyfrowane aktualizacje modelu od wszystkich klientów i oceniała ich wiarygodność oraz podobieństwo przed agregacją. Do określenia znaczenia aktualizacji klientów wykorzystano oceny wiarygodności oparte na wydajności walidacji, a podobieństwo między aktualizacjami oceniano metodami takimi jak klasteryzacja czy podobieństwo kosinusowe. Przeprowadzono agregację ważoną, a zaktualizowany globalny model został redystrybuowany do klientów.
Warstwa adaptacji i optymalizacji
Parametry optymalizacji były dynamicznie dostosowywane w zależności od postępów treningowych między klientami. Tempo uczenia zostało zaplanowane w celu zmniejszenia wariancji aktualizacji, a zastosowano dodatkowe techniki, takie jak regularizacja bliższa i wagowanie adaptacyjne, aby ograniczyć dryf klienta i poprawić stabilność zbieżności.
Warstwa interpretowalności
Metody sztucznej inteligencji do wyjaśnienia, takie jak SHAP i LIME, zostały wykorzystane do generowania wyników atrybucji cech i wyjaśnień modeli. Wyniki obejmowały rankingi ważności cech, mapy atrybucji oraz wizualne wyjaśnienia, które interpretowano w kontekście wiedzy specyficznej dla danej dziedziny, aby zapewnić przejrzystość.
Szkolenie federacyjne
Intelligent Federated Learning Framework został zaimplementowany poprzez inicjalizację globalnego modelu na centralnym serwerze agregacji, a następnie zdefiniowano hiperparametry treningowe, w tym tempo uczenia, rundy komunikacyjne i epoki lokalne. Parametry globalnego modelu były rozprowadzane do wszystkich klientów, którzy następnie wykonywali lokalne treningi na podstawie swoich prywatnych zbiorów danych. Obliczono lokalne straty treningowe i dokładność walidacji, a aktualizacje modeli generowano i szyfrowano przed przesłaniem na serwer agregacji. Wiarygodność aktualizacji klientów oceniano na podstawie wydajności walidacyjnej za pomocą Równania 1.
(1)
Gdzie Acci oznacza dokładność walidacji klienta i.
Podobieństwo między aktualizacjami klientów obliczono za pomocą współsinusowego podobieństwa wektorów gradientowych, jak zdefiniowano w równaniu 2.
(2)
Gdzie gi i g j reprezentują wektory gradientowe różnych klientów.
Wagi agregacji adaptacyjnej obliczono przez połączenie wyników wiarygodności i podobieństwa, zgodnie z definicją w równaniu 3.
(3)
Waga agregacji adaptacyjnej dla każdego klienta została określona przez połączenie wyników wiarygodności i podobieństwa. Metryka niezawodności odzwierciedlała dokładność walidacji lokalnego modelu klienta, natomiast metryka podobieństwa mierzyła podobieństwo cosinusowe między aktualizacjami gradientu klienta.
Waga agregacji wi zatem priorytetowo traktowała klientów, którzy zarówno wykazywali niezawodną wydajność walidacyjną, jak i wykazywali spójne kierunki aktualizacji zgodnie z globalnym celem optymalizacji.
Znormalizowane wagi zapewniały, że łączny wkład wszystkich uczestniczących klientów dawał jeden, co utrzymywało stabilność w globalnej aktualizacji modelu.
Wagi zostały znormalizowane tak, że
.
Aktualizacja globalnego modelu
Modele klientów zostały zagregowane za pomocą ważonej średniej, jak pokazano w równaniu 4.
(4)
Gdzie Mi reprezentuje lokalne parametry klienta i.
Zaktualizowane parametry globalnego modelu były nadawane wszystkim klientom.
Adaptacyjna modulacja szybkości uczenia się
Monitorowano zmienność gradientów klientów w rundach komunikacyjnych. Tempo uczenia się było dynamicznie dostosowane zgodnie z Równaniem 5.
(5)
Gdzie Var(g) reprezentuje wariancję gradientu między klientami.
Zaktualizowany wskaźnik nauki został zastosowany podczas kolejnego lokalnego cyklu szkoleniowego. Wskaźnik adaptacyjnego uczenia był kontrolowany przez centralny serwer agregacji i stosowany globalnie we wszystkich klientach podczas kolejnych rund szkoleniowych. Ta globalna korekta zapewniła spójne zachowanie optymalizacyjne, uwzględniając zmienność w aktualizacjach klienta. Ponieważ modulacja szybkości uczenia była wykonywana na poziomie serwera, wszyscy uczestniczący klienci otrzymywali zaktualizowaną szybkość uczenia wraz z globalnymi parametrami modelu rozgłoszeniowego.
Federowana ocena wyników uczenia się
Globalna dokładność modelu została oceniona na podstawie zagregowanego zbioru danych testowych, jak pokazano w równaniu 6.
(6)
Gdzie TP oznacza liczbę prawdziwie pozytywnych prognoz, TN oznacza prawdziwie negatywne prognozy, FP fałszywie pozytywne, a FN fałszywie negatywne
Sprawiedliwość wśród klientów była mierzona poprzez obliczanie różnic w ich dokładności.
Koszt komunikacji obliczano jako łączną liczbę parametrów modelu przesyłanych między klientami a serwerem agregacji we wszystkich rundach komunikacyjnych. Całkowity narzut komunikacyjny został więc oszacowany, jak pokazano w równaniu 7.
(7)
Gdzie R to liczba rund komunikacyjnych, C to liczba klientów, a S oznacza rozmiar modelu.
Analiza interpretowalności modelu została przeprowadzona za pomocą SHAP do obliczania globalnych wskaźników ważności cech oraz LIME do generowania lokalnych wyjaśnień dla poszczególnych prognoz. Wyniki atrybucji cech zostały zwizualizowane, aby interpretować zachowanie modelu.
Rozwiązywanie problemów
Niestabilna zbieżność występowała, gdy zestawy danych klientów były wysoce heterogeniczne lub zawierały skrajnie niezrównoważone rozkłady klas. W takich przypadkach lokalne epoki szkoleniowe były ograniczane lub początkowa szybkość uczenia się była zmniejszana, aby ustabilizować aktualizacje gradientów. Silnie nierówne dystrybucje klientów prowadziły do dominacji niewielkiej liczby klientów podczas agregacji, co zostało złagodzone przez dostosowanie progu ważenia niezawodności lub zwiększenie różnorodności udziału klientów. Niewiarygodna część klientów spowodowana przerwami w sieci zakłócała rundy komunikacyjne; dlatego włączono częściowy udział, co pozwoliło serwerowi agregacji kontynuować dostępne aktualizacje klientów. Awaria interpretowalności lub niespójna attrybucja cech pojawiała się, gdy modele były nadmiernie regularizowane lub trenowane na niewystarczającej liczbie danych, a etapy wstępnego przetwarzania danych były weryfikowane, jednocześnie zapewniając, że wyjaśnienia SHAP lub LIME zostały wygenerowane po zbieżności modeli.
Iteracyjny ciąg inicjalizacji modelu, lokalnego treningu, inteligentnej agregacji, adaptacyjnej optymalizacji oraz analizy interpretowalności przedstawiony jest na Rysunku 2, który przedstawia ogólny przepływ pracy Intelligent Federated Learning Framework (IFLF).

Rysunek 2. Przepływ pracy Inteligentnego Federacyjnego Frameworka Uczenia się. Rysunek przedstawia iteracyjny cykl faz, w tym inicjalizację, lokalne trenowanie, agregację, optymalizację adaptacyjną oraz interpretowalność, ilustrując działanie ramy od początku do końca. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.
Ocena wyników
Obliczano globalne i lokalne metryki, takie jak dokładność, precyzja, przypomnienie oraz wynik F1. Sprawiedliwość mierzono przez różnice w dokładności lokalnych klientów. Efektywność komunikacji oceniano jako wielkość danych przesyłanych w jednej rundzie. Wydajność modelu oceniano w porównaniu z typowymi federacyjnymi bazami, takimi jak FedAvg, FedProx i FedOpt. Wyniki prezentowano za pomocą krzywych zbieżności, macierzy pomyłek oraz wykresów interpretowalności. Wszystkie ustawienia eksperymentalne, logi i punkty kontrolne były przechowywane, aby zapewnić powtarzalność.
Podsumowanie przepływu pracy
Cykl IFLF realizowano poprzez ciągłe powtarzanie lokalnych szkoleń, inteligentną agregację, optymalizację adaptacyjną oraz analizę interpretowalności. Prywatność danych była utrzymywana poprzez przechowywanie danych w lokalnych węzłach, jednocześnie umożliwiając wspólny rozwój modelu. Te kroki obejmowały mechanizmy mające na celu zapewnienie sprawiedliwości, przejrzystości i wydajności wśród klientów niezwiązanych z lokalizacją.