$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Dogłębny rozwój finansów cyfrowych przekształca modele usług, od kontroli ryzyka kredytowego po finansowanie łańcucha dostaw MŚP, ustanawiając dane jako kluczowy czynnik produkcyjny. Według "Raportu Fintech Development Report 2023" Chin 2023, pod koniec 2023 roku skala cyfrowych kredytów w Chinach przekroczyła 65 bilionów juanów, stanowiąc 38% całkowitego salda, a dzienne dane transakcyjne przekroczyły 500TB1. Jednak "silosy danych" pozostają istotną barierą. Instytucje zazwyczaj przyjmują zamknięte modele danych ze względu na konkurencję i obawy dotyczące bezpieczeństwa. Na przykład w wykrywaniu oszustw kart kredytowych banki polegające wyłącznie na danych wewnętrznych pomijają kluczowe międzyinstytucjonalne rekordy, co skutkuje wskaźnikiem identyfikacji poniżej 60% dla nowych typów oszustw. Podobnie w przypadku kredytów dla MŚP brak zewnętrznych danych ubezpieczeniowych i podatkowych prowadzi do błędów przewidywania niewypłacalności przekraczających 25%. Ta fragmentacja powoduje podwójne wyzwania: ograniczenie dostępu dla 200 milionów niedostatecznie obsługiwanych klientów oraz zwiększenie ryzyka przenoszenia się o 18% (raport CBIRC 2023). W konsekwencji silosy danych stały się głównym ograniczeniem utrudniającym wysokiej jakości rozwój finansów cyfrowych.
W ostatnich latach wzrost globalnych przepisów dotyczących prywatności danych znacząco ograniczył scentralizowaną wymianę danych. Instytucje finansowe muszą teraz przestrzegać trzech podstawowych zasad: "minimalnej konieczności", "świadomej zgody" oraz "śledzenia". Choć ramy regionalne różnią się, wszystkie nakładają surowe progi dotyczące wykorzystania danych międzyinstytucjonalnych, jak opisano w Tabeli 1.
| Ramy regulacyjne | Podstawowe klauzule ograniczające | Wpływ na współpracę w danych finansowych |
| Ogólne rozporządzenie UE o ochronie danych danych (RODO) | 1. Transgraniczny transfer danych musi spełniać "decyzję o wystarczalności"; 2. Osoby mają prawo do dostępu do swoich danych i ich usuwania; 3. Naruszenia danych muszą być zgłaszane w ciągu 72 godzin | Nieautoryzowane przesyłanie surowych danych przez granicę jest zabronione, a scentralizowane udostępnianie wymaga oceny wpływu na prywatność (PIA), co zwiększa koszty zgodności o 30% |
| Kalifornijska ustawa o prywatności konsumentów (CCPA) | 1. Konsumenci mogą prosić firmy o usunięcie ich danych osobowych; 2. Udostępnianie danych wymaga jasnego powiadomienia o tym, do czego będą używane | Scentralizowane platformy wymagają interfejsów dostępu do danych dla każdego konsumenta, co zwiększa koszty operacyjne o 25% i ułatwia użytkownikom usuwanie danych oraz brak danych treningowych dla modelu |
| Chińska ustawa o ochronie danych osobowych | 1. Przetwarzanie danych osobowych wymaga odrębnej zgody; 2. Przetwarzanie wrażliwych danych osobowych wymaga dodatkowych dokumentów autoryzujących; 3. Ustanowienie systemu "klasyfikacji i ochrony danych" | Wymiana danych między instytucjami wymaga autoryzacji od każdego klienta, a wskaźnik autoryzacji w praktyce wynosi mniej niż 40%. Tryb centralizowany jest trudny do wdrożenia |
| Dyrektywa UE dotycząca usług płatniczych II (PSD2) | 1. Otwórz interfejs danych bankowych; 2. Udostępnianie danych powinno opierać się na autoryzacji klienta i ograniczonym użyciu | Chociaż wspiera udostępnianie danych, wymaga śledzenia całego procesu dostępu do interfejsów, a scentralizowana platforma powinna przejąć odpowiedzialność za bezpieczeństwo interfejsów i audyt, co znacząco zwiększa złożoność techniczną |
Tabela 1: Porównanie podstawowych wymagań głównych ram regulacji danych.
Niniejsze badanie wprowadza trzy kluczowe innowacje mające na celu rozwiązanie wyzwań w międzyinstytucjonalnym federacyjnym modelowaniu ryzyka. Po pierwsze, architektura siatki danych z ontologiczną warstwą semantyczną standaryzuje heterogeniczne schematy, osiągając ponad 85% wykorzystania funkcji przy zachowaniu suwerenności danych. Po drugie, hybrydowy model AI łączy lokalnie interpretowalny GBDT z regulacjami zgodnymi z regulacjami monotonicznymi ograniczeniami oraz globalnym transformatorem opartym na uwagi. Dzięki dynamicznemu ważeniu wyników instytucjonalnych model ten zmniejsza spadek wydajności nie-IID o 7,6%, utrzymując AUC-ROC na poziomie 0,912. Po trzecie, trójstronny mechanizm zgodności z prywatnością integruje adaptacyjne zróżnicowanie prywatności (ε=5), dodatkowe udostępnianie tajemnic oraz regularizację świadomą uczciwości, aby zapewnić zgodność z RODO, ograniczyć stronniczość ΔDP do < 0,05 oraz oprzeć się atakom wnioskującym członkostw (AUC=0,58). Razem te innowacje łączą wymagania dotyczące fragmentacji danych, interpretowalności regulacyjnej oraz kompromisów między prywatnością a bezpieczeństwem w federacyjnej finansowej AI.
Federacja w finansach dzieli się na poziomą federację nauki (HFL)2, pionową federację (VFL)3 oraz federację transferową (FTL)4 na podstawie rozkładu danych (Tabela 2).
| Paradygmat federalny | Podstawowe cechy | Scenariusz adaptacji do kontroli ryzyka finansowego | Badania reprezentatywne | Ograniczenie |
| Poziome uczenie federalne | Przestrzeń cech danych uczestników jest spójna, ale przestrzeń prób jest inna | Międzyorganizacyjne wykrywanie oszustw kart kredytowych | McMahan i in. [[i]](2017) zaproponowali algorytm FedAvg, który po raz pierwszy zastosował HFL do przeciwdziałania oszustwom finansowym, osiągając współpracę międzyinstytucjonalną poprzez uśrednianie parametrów, oraz poprawił wskaźnik wykrywania oszustw o 12% na zbiorze danych 10 banków | Nie uwzględniając cech danych finansowych nieniezależnych i identycznie rozłożonych (Non-IID), gdy różnica rozkładu ryzyka klienta między instytucjami przekracza 30%, AUC-ROC modelu maleje o ponad 15% |
| Pionowe nauczanie federalne | Przestrzeń prób uczestników jest spójna, ale przestrzeń cech jest inna | Wspólna kontrola ryzyka kredytowego między bankami a firmami ubezpieczeniowymi | Yang i in. [[ii]] (2020) zaproponowali algorytm SecureBoost, który umożliwia wspólne trenowanie pionowych cech poprzez szyfrowanie homomorficzne i osiąga domyślną dokładność predykcji na poziomie 89,3% w scenariuszu kredytów dla małych i mikroprzedsiębiorstw | Opiera się na ścisłym wyrównaniu podmiotów, co niesie ze sobą wysokie ryzyko wycieku prywatności, a wydajność treningu gwałtownie spada, gdy wymiar funkcji jest zbyt duży |
| Federalne Transfer Learning | Występują różnice w rozkładzie danych i przestrzeni cech uczestników | Migracja ryzyka między scenariuszami | Pan i in.[[iii]] (2021) rozwiązali problem niedoboru próbek w finansach łańcucha dostaw, inicjalizując model optymalizacji migracji parametrów, który poprawił prędkość zbieżności o 60% | "Negatywna migracja" prawdopodobnie wystąpi podczas procesu migracji. Gdy różnica mechanizmów ryzyka między scenariuszem źródłowym a docelowym przekracza 40%, wydajność modelu przewyższa tradycyjne |
| [[i]]McMahan, B., Moore, E., Ramage, D., Hampson, S., & y Arcas, B. A. (2017). Efektywne uczenie się głębokich sieci z zdecentralizowanych danych. Materiały z 20. Międzynarodowej Konferencji na temat Sztucznej Inteligencji i Statystyki, 1273–1282. |
| [[ii]]Yang, Q., Liu, Y., Chen, T., & Tong, Y. (2020). Federowane uczenie maszynowe: koncepcja i zastosowania. ACM Transactions on Intelligent Systems and Technology, 10(2), 1–19. |
| [[iii]]Pan, S. J., & Yang, Q. (2021). Ankieta dotycząca nauki transferowej. IEEE Transactions on Knowledge and Data Engineering, 33(12), 2345–2359. |
Tabela 2: Porównanie paradygmatów uczenia się w sektorze finansowym.5,6,7
Najnowsze osiągnięcia rozwiązują wyzwania specyficzne dla konkretnych scenariuszy: FedSSL8 rozwiązuje problem etykiet poprzez uczenie kontrastowe, podczas gdy FedLite9 osiąga redukcję komunikacji o 490× dla instytucji o ograniczonych zasobach. Rozszerzenia dotyczące opieki zdrowotnej10, luki bezpieczeństwa11, finansów multimodalnych12 orazskalowalność 13 pokazują szerokie zastosowanie FL.
Ochrona prywatności jest kluczowa dla kontroli ryzyka finansowego. Trzy główne techniki – Różnicowa Prywatność (DP)14, Bezpieczne Obliczenia Wielostronne (SMC)15 oraz Szyfrowanie Homomorficzne (HE)16 – oferują wyraźne przewagi w zakresie wytrzymałości, efektywności i elastyczności. DP jest formalnie definiowane jako Pr[M(x) = y] ≤ e∈ ⋅ Pr[M(x') = y] + δ, gdzie M oznacza algorytm losowy, $x$ i $x'$ oznaczają sąsiednie zbiory danych, a y to wyjście algorytmu. Zapewnia to podobieństwo wyników między zbiorami danych, ściśle ograniczając indywidualne wycieki poprzez kontrolowany szum. Analiza porównawcza ich cech technicznych przedstawiona jest w Tabeli 3.
| Rodzaj technologii | Podstawowe zasady | Siła prywatności (ε wartość) | Złożoność obliczeniowa | Elastyczność sytuacji finansowej |
| Różnica prywatności | Pojedyncze wkłady do zbioru danych są nie do odróżnienia przez dodanie szumu | ε=1-5 (zalecana wartość dla scenariuszy finansowych) | O (n) (n to wielkość próby) | High, odpowiedni do całego procesu treningu modeli, można płynnie łączyć z uczeniem federacyjnym |
| Bezpieczne obliczenia wielostronne | Wielu uczestników współpracuje przy obliczaniu bez ujawniania wyników pośrednich | Bezpieczeństwo teoretyczne informacji | O (n²) (pionowy scenariusz federalny) | Tak, nadaje się do obliczania czułych łączeń cech, ale w dużych przypadkach próbkowych zajmuje zbyt dużo czasu |
| Szyfrowanie homomorficzne | Zaszyfrowane dane są obliczane bezpośrednio, a poprawny wynik uzyskuje się po odszyfrowaniu | Zabezpieczenie obliczeniowe | O (n³) (na podstawie kryptografii kratowej) | Niski, odpowiedni tylko do transmisji parametrów na małą skalę, miliony próbek obliczania scenariusza trwają ponad 24 godziny |
Tabela 3: Porównanie charakterystyk technologii ochrony prywatności.
W zastosowaniach finansowych różnica prywatności stała się głównym wyborem ze względu na "kontrolę równowagi efektu prywatności". Dwork, C.17 zaproponował klasyczną definicję (ε, δ)-DP, ustanawiającą ilościowy standard ochrony prywatności. Podstawowy wzór jest następujący:
(1)
Tutaj M Jako algorytm ochrony prywatności, D i D to sąsiadujący zestaw danych (różnica tylko jednej próbki), budżet prywatności (im mniejsza ochrona, tym silniejsza), r budżet prywatności (im mniejsza ochrona prywatności, tym silniejsza), δ prawdopodobieństwo awarii (zwykle mierzone 10-5).
Abadi, M. i in.18 opracowali różnicowy spadek stochastyczny gradientu prywatności (DP-SGD), wykorzystujący gradientowe przycinanie i wstrzykiwanie szumów, aby zmniejszyć wyciek prywatności modelu ryzyka kredytowego do poniżej 8%. Bezpieczne przetwarzanie wielostronne (SMC) oraz szyfrowanie homomorficzne są stosowane głównie do przetwarzania wrażliwego. Na przykład Bogetoft, P. i in.19 zastosowali SMC do oceny kredytowej między bankami, zapewniając, że dostępne były jedynie końcowe wyniki. Perri, L.2 zaproponował w pełni homomorficzny algorytm szyfrowania dla bezpiecznej agregacji parametrów, choć wysoka złożoność obliczeniowa ogranicza jego zastosowanie do małoskalowych treningów wśród średniej wielkości banków.
Modele kontroli ryzyka AI ewoluowały od tradycyjnych scentralizowanych architektur do architektur rozproszonych, a dwa paradygmaty wykazują istotne różnice w zależności od danych, wydajności i kosztach zgodności. Scentralizowane modele obejmują Gradient Boosting Trees (GBDT) oraz modele głębokiego uczenia. Algorytm GBDT zaproponowany przez Friedmana, J., Hastie, T. Tibshirani, R.21 zwiększa dokładność prognozowania ryzyka dzięki integracji wielu drzew, osiągając AUC-ROC na poziomie 0,93 w scenariuszach kredytów osobistych. Jednak wymaga to zbierania kompletnych danych klientów, co niesie ze sobą ryzyko naruszeń danych i problemów z zgodnością. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 opracowali model kontroli ryzyka oparty na transformatorach, który poprawia wskaźniki wykrywania oszustw o 15%, a jego rozmiar parametrów przekracza 10 GB. Paradygmat rozproszony obejmuje podejścia do dzielenia się parametrami i funkcjami. Dzielenie parametrów (np. FedAvg) agreguje lokalne parametry, ale ma trudności z cechami nie-IID: AUC-ROC spadł z 0,89 do 0,82, a różnice w stopie niewypłacalności wzrosły z 0,5% do 3,5%. Udostępnianie funkcji (np. SecureBoost) umożliwia współpracę pionową, ale wymaga precyzyjnego dopasowania, a wydajność spada o 20%, gdy błędy przekraczają 5%.
Sednem nauki federacyjnej jest umożliwienie wieloinstytucjowego szkolenia współpracy bez konieczności transferu surowych danych. Ten system definiuje uczestników, proces szkolenia oraz funkcję celową. W tym badaniu system składa się z węzłów instytucji Kfinancial (oznaczanych jako P1, P2, ..., PK) oraz koordynatora C. Każda instytucja PK posiada lokalny zbiór
danych , Xk,i∈Rd , które są wektorami cech klienta yk,i∈{0,1}, dla etykiet ryzyka (0 jest normalne, 1 to oszustwo domyślne), lokalnej wielkości próby, pełnej skali
danych. Szkolenie odbywa się w procesie "lokalnej iteracji – globalnej agregacji": i) Inicjalizacja: Koordynator generuje początkowe parametry globalne θ0 i rozdziela je do wszystkich instytucji; ii) Iteracja lokalna: w rundzie treningowej instytucja PK opiera się na danych lokalnych i aktualnych parametrach globalnych θt, minimalizując lokalną funkcję strat poprzez spadek gradientu, otrzymuje zaktualizowane parametry lokalne θt,k, czyli:
(2)
Gdzie n to szybkość uczenia się, a ∇θL,k(θt) to gradient lokalnej straty, a θt to gradient lokalnej straty a θt; iii) Agregacja globalna: Instytucja szyfruje i przesyła parametr lokalny do koordynatora, koordynator generuje nowe globalne parametry θt+1 poprzez ważoną agregację wielkości próby:
(3)
iv) Warunek końcowy: Powtarzaj kroki 2-3, aż wydajność globalnego modelu na zbiorze walidacyjnym nie poprawi się przez kolejne rundy, następnie wydaj ostateczny model. θ* = θT. Biorąc pod uwagę nieniezależne cechy danych finansowych dotyczące nie-identycznego rozkładu (Non-IID), konieczne jest rozszerzenie założeń tradycyjnego federacyjnego uśredniania (Fed AvgPk). Niniejsze badanie wykorzystuje podwójne wymiary: "heterogeniczność rozkładu etykiet" oraz "heterogeniczność rozkładu cech" do charakteryzowania nie-IID: Niech proporcja pozytywnych przypadków (zdarzeń domyślnych) w instytucjach zostanie zdefiniowana jako:
(4)
Zdefiniuj współczynnik izomorfizmu tagów ; Niech średnia różnica cech zbioru wyniesie ,Gdy α>0,03 i kiedy, Określa się jako scenariusz o wysokim poziomie nie-IID.
W zależności od zdolności i celu atakującego, scenariusze zagrożenia dzielą się na trzy kategorie, jak pokazano w Tabeli 4
| Rodzaj zagrożenia | Tożsamość atakującego | worek treningowy | Typowe środki |
| Atak półprawdy | Instytucje uczestniczące/koordynatorzy | Wywnioskuj cechy klientów innych instytucji | Inwersja gradientu i ataki z rozumowaniem członków oparte na parametrach modelu |
| Atak wrogi | Złośliwe instytucje | Globalny model zanieczyszczenia | Przesyłaj fałszywe gradienty i modele trucizny |
| Atak zewnętrzny | Nieautoryzowane osoby trzecie | Parametry/cechy kradzieży w trakcie transportu | Ataki pośrednie, podsłuchiwanie łączy komunikacyjnych |
Tabela 4: Klasyfikacja modelu zagrożeń systemu finansowego.
Stosując (ε,δ) -Różnicową prywatność (Differential Privacy, DP) jako podstawowy standard ochrony prywatności, jej istotą jest dodanie szumów, aby wpływ "czy zbiór danych zawiera próbkę" na wyjście modelu można było zignorować. Formalna definicja jest następująca: Dla algorytmów uczenia federacyjnego M, jeśli dla dowolnych dwóch sąsiadujących zbiorów danych i różniących się tylko o jedną próbę (DΔD' = 1), a także dowolnego wyjścia S⊆Range(M), spełnia ona:
Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)
Wtedy nazywa się go spełnionym (ε,δ)-DP. Jednym z nich jest "budżet prywatności" (im mniejsza ochrona prywatności, tym silniejsza jest i zwykle bierze się pod uwagę scenariusz finansowy), δ "prawdopodobieństwo niepowodzenia" (zazwyczaj δ≤10-5, aby zapewnić, że zdarzenia o niskim prawdopodobieństwie nie wpływają na prywatność i bezpieczeństwo). Aby dostosować się do cech wielorundowych iteracji w federowanym treningu, całkowite zużycie prywatności oblicza się za pomocą twierdzenia o kombinacji "Renyi differential privacy" (RDP). Niech budżet prywatności każdej rundy szkolenia będzie εt, to całkowity budżet prywatności po zakończeniu cyklu spełnia:
(6)
Twierdzenie to stanowi teoretyczną podstawę adaptacyjnej kalibracji szumu poprzez dynamiczne przydzielanie budżetu prywatności na rundę.
FedRisk stosuje rygorystyczny (ε, δ) system różnicowy dotyczący prywatności (DP), dynamicznie alokując budżety prywatności za pomocą twierdzenia o kompozycji Rényi DP (RDP). Definiuje globalną czułość Δf jako maksymalną zmianę parametrów modelu w normie L1 wywołaną przez sąsiednie zbiory danych (różniące się pojedynczą próbką), z uwzględnieniem wariancji kalibracji szumu Laplace'a (współczynnik szumu κ_t proporcjonalny do fluktuacji rozkładu danych). W ramach całkowitego budżetu prywatności ε=5 (spełniających progi zgodności z RODO), RDP przekształca wielorundowe zużycie prywatności na (ε, δ)-DP (δ=10⁻⁵), równoważąc siłę ochrony z użytecznością modelu empiryczne, pokazując, że ogranicza to AUC ataków inferencyjnego przez członków do 0,58, jednocześnie utrzymując prognozę ryzyka AUC-ROC na poziomie 0,912.
Optymalizacja modeli kontroli ryzyka finansowego musi jednocześnie spełniać trzy wymogi regulacyjne: "predykcyjną dokładność", "ochronę prywatności" oraz "sprawiedliwość". Tradycyjne funkcje optymalizacyjne, które dążyły wyłącznie do minimalizacji strat, nie są już stosowalne. Należy ustanowić wielocelowe ramy optymalizacyjne, które przekształcą ograniczenia regulacyjne w mierzalne terminy regularizacji. W scenariuszach klasyfikacji binarnej (domyślnie/normalnie) logaritmowa strata (LogLoss) jest przyjmowana jako podstawowa funkcja strat do pomiaru odchylenia między prawdopodobieństwami prognozowanymi przez model a rzeczywistymi etykietami, definiowana jako:
(13)
Gdzie pk,i = σ(θ; xk,i) to przewidywane domyślne prawdopodobieństwo próby (xk,i,y k,i) dla modelu, σ(⋅) to funkcja aktywacji Sigmoidal.
Wymogi RODO, Ustawy o ochronie danych osobowych oraz innych regulacji zostały przekształcone w trzy rodzaje terminów regularizacji, które łączą się z podstawową funkcją utraty, tworząc ostateczny cel optymalizacji:
(14)
Definicja i funkcja każdego terminu regularizacyjnego przedstawiają się następująco: i) Ograniczenia prywatności: Na podstawie kosztu dodawania szumu różnicowego prywatności omawiany jest wpływ ilościowej ochrony prywatności na dokładność modelu. Niech globalna czułość modelu Δparametrów wynosi (czyli maksymalna zmiana parametrów spowodowana sąsiednimi zbiorami danych), wtedy:
(15)
Ten termin zapewnia, że zwiększona intensywność hałasu odpowiada budżetowi prywatności i unika nadmiernych poświęceń dla dokładności modelu. II) Ograniczenie uczciwości: W świetle wymogów "antydyskryminacyjnych" zawartych w Ustawie o ochronie danych osobowych, błędy predykcyjne różnych grup są ograniczone. Weźmy jako przykład "parytet demograficzny" (DemographicParity), niech dodatnia progencja zbioru wynosi
, wtedy:
(16)
Ten termin minimalizuje różnicę w wskaźniku predykcji między różnymi grupami i unika dyskryminacji modelu. III) Ograniczenia odporności: W odpowiedzi na wymagania "zdolności modelowania antyinterferencyjnego" w Basel III, należy zapewnić, że drobne zaburzenia danych nie wpływają znacząco na wyniki modelu. Dodając próbkę przeciwną Δx perturbacji (spełniających |Δx|∞≤γ) badania definiują:
(17)
Poprawia się odporność modelu poprawy terminu na nieprawidłowe dane, a ryzyko błędnej oceny jest zmniejszone. W tym wzorze jest współczynnikiem regularizacji, który został określony przez walidację krzyżową (w tym badaniu λ1=0,01,λ2=0,05,λ3=0,02). Zapewniono równowagę między trzema celami regulacyjnymi a dokładnością prognozy.