Forschungsartikel

Erklärbares föderiertes Lernmodell für institutionelle Zusammenarbeit mit digitalen Finanzdaten und Risikokontrolle

DOI:

10.3791/69805

3. März 2026

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wir demonstrieren ein reproduzierbares Protokoll zur Implementierung von FedRisk, einem erklärbaren föderierten Lernframework. Das Verfahren umfasst semantische Datenharmonisierung, datenschutzschützende Entität, differenzielle Datenschutzkalibrierung, lokale GBDT-Schulungen, globale Transformer-Fusion und gradient-komprimierte asynchrone Updates, die eine sichere, skalierbare und regulierungskonforme Finanzrisikovorhersage über mehrere Institutionen ermöglichen.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Fragmentierung von Finanzdaten zwischen Institutionen und strenge Datenschutzbestimmungen behindern das kollaborative Risikomanagement erheblich, was zu einer suboptimalen Betrugserkennung mit einer Genauigkeit von unter 60 % und hohen Fehlfällen bei KMU-Darlehen von über 25 % führt. Bestehende föderierte Lernlösungen stehen vor Herausforderungen bei Non-IID-Daten, Modellinterpretierbarkeit und Konformität, was zu realen Nutzungsraten unter 20 % führt. Um diese Lücken zu schließen, schlagen wir FedRisk vor, ein erklärbares föderiertes Lernframework, das vier zentrale Innovationen integriert. Erstens erreicht ein institutionelles Datennetz mit ontologischer semantischer Harmonisierung eine Merkmalauslastung von über 85 %. Zweitens kombiniert ein hybrides KI-Modell lokal interpretierbares GBDT mit monotonen Einschränkungen und einem globalen, aufmerksamkeitsbasierten Transformer, wodurch der Leistungsverlust in Nicht-IID-Szenarien um 7,6 % im Vergleich zu FedAvg reduziert wird. Drittens verwendet ein dreiteiliger Datenschutzmechanismus adaptive differentielle Privatsphäre mit einem Gesamtbudget von ε=5, additives Geheimnis-Teilen und fairness-aware Regularisierung, wodurch der Gruppenvorhersage-Bias unter 0,05 und der RAROC-Verlust unter 2,1 % begrenzt wird. Viertens reduzieren kommunikationseffiziente Optimierungen die Bandbreite pro Runde auf 8,5 MB und die Trainingszeit auf 85 Minuten. Bewertet auf über 5 Millionen multiinstitutionellen Datensätzen erreicht FedRisk einen AUC-ROC von 0,912, nur 1,8 % unter dem zentralisierten GBDT, während es mit einem AUC von 0,58 Mitgliederinferenzangriffe widersteht. Es reduziert die institutionelle Datenübertragung um 99 % und übertrifft die klassischen FL-Baselines in AUC-ROC um 7,3 %. Durch die Möglichkeit einer sicheren, transparenten und regulierungskonformen Risikovorhersage ohne Rohdatenaustausch bietet FedRisk eine skalierbare Lösung für institutionelle Finanzkooperationen.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die tiefgehende Entwicklung digitaler Finanzen gestaltet Dienstleistungsmodelle neu – von persönlicher Kreditrisikokontrolle bis hin zur Finanzierung der KMU-Lieferkette – und etabliert Daten als zentralen Produktionsfaktor. Laut dem "2023 China Fintech Development Report" der PBOC überstieg Chinas digitale Kreditskala Ende 2023 65 Billionen Yuan, was 38 % des Gesamtsaldos entspricht, wobei die täglichen Transaktionsdaten über 500TB1 lagen. Dennoch bleiben "Datensilos" eine bedeutende Hürde. Institutionen verwenden in der Regel geschlossene Datenmodelle aufgrund von Wettbewerbs- und Sicherheitsbedenken. Beispielsweise übersehen Banken bei der Erkennung von Kreditkartenbetrug ausschließlich interne Daten kritische institutionelle Daten, was zu einer Identifizierungsrate von unter 60 % bei neuen Betrugsarten führt. Ähnlich führt das Fehlen externer Versicherungs- und Steuerdaten bei KMU-Krediten zu fehlerhaften Vorhersagen von über 25 %. Diese Fragmentierung führt zu doppelten Herausforderungen: Sie begrenzen den Zugang für 200 Millionen unterversorgte Kunden und erhöhen das Risiko der Kreuzkontamination um 18 % (CBIRC 2023 Bericht). Folglich sind Datensilos zum zentralen Engpass geworden, das die hochwertige Entwicklung digitaler Finanzen behindert.

In den letzten Jahren hat ein Anstieg globaler Datenschutzgesetze den zentralen Datenaustausch erheblich eingeschränkt. Finanzinstitute müssen nun drei Kernprinzipien einhalten: "Mindestnotwendigkeit", "informierte Einwilligung" und "Rückverfolgbarkeit". Obwohl regionale Rahmenwerke variieren, setzen sie alle strenge Schwellenwerte für die interinstitutionelle Datennutzung, wie in Tabelle 1 dargestellt.

Regulatorischer RahmenKernrestriktive KlauselnAuswirkungen auf die Zusammenarbeit mit Finanzdaten
Datenschutzverordnung der EU (DSGVO)1. Grenzüberschreitende Datenübertragung muss die "Suffizienzfeststellung" erfüllen; 2. Einzelpersonen haben das Recht, auf ihre Daten zuzugreifen und sie zu löschen; 3. Datenpannen müssen innerhalb von 72 Stunden gemeldet werdenDie unautorisierte grenzüberschreitende Übertragung von Rohdaten ist verboten, und ein zentrales Teilen erfordert eine Datenschutz-Folgenabschätzung (PIA), was die Compliance-Kosten um 30 % erhöht
Kalifornisches Verbraucherschutzgesetz (CCPA)1. Verbraucher können Unternehmen bitten, ihre persönlichen Daten zu löschen; 2. Datenfreigabe erfordert eine klare Benachrichtigung darüber, wofür sie verwendet werden sollenZentralisierte Plattformen benötigen Datenzugriffsschnittstellen für jeden Verbraucher, was die Betriebskosten um 25 % erhöht und es den Verbrauchern erleichtert, Daten zu löschen und dadurch fehlende Trainingsdaten für das Modell zu verursachen
Chinas Gesetz zum Schutz personenbezogener Daten1. Die Verarbeitung personenbezogener Daten erfordert eine separate Einwilligung; 2. Die Verarbeitung sensibler personenbezogener Daten erfordert zusätzliche Genehmigungsdokumente; 3. Ein System zur "Datenklassifizierung und zum Schutz" einzurichtenDer institutionelle Datenaustausch erfordert eine Genehmigung jedes Kunden, und die Autorisierungsrate liegt in der Praxis bei weniger als 40 %. Der zentralisierte Modus ist schwierig umzusetzen
EU-Zahlungsdienstrichtlinie II (PSD2)1. Öffnen Sie die Bankdatenschnittstelle; 2. Die Datenfreigabe sollte auf der Autorisierung des Kunden und einer begrenzten Nutzung basierenObwohl sie den Datenaustausch unterstützt, verlangt sie, dass der gesamte Prozess des Schnittstellenzugriffs nachverfolgt wird, und die zentralisierte Plattform sollte die Verantwortung für die Schnittstellensicherheit und -prüfung übernehmen, was die technische Komplexität erheblich erhöht

Tabelle 1: Vergleich der Kernanforderungen wichtiger Datenregulierungsrahmen.

Diese Studie führt drei grundlegende Innovationen ein, um Herausforderungen in der institutionellen föderierten Risikomodellierung zu adressieren. Erstens standardisiert eine Data-Mesh-Architektur mit einer ontologischen semantischen Schicht heterogene Schemata und erreicht über 85 % Merkmalauslastung, während die Datensouveränität erhalten bleibt. Zweitens kombiniert ein hybrides KI-Modell lokal interpretierbare GBDT mit regulatorisch konformen monotonen Einschränkungen und einem globalen, aufmerksamkeitsbasierten Transformer. Durch die dynamische Gewichtung institutioneller Ergebnisse reduziert dieses Modell den Leistungsverlust von Non-IID um 7,6 % und hält einen AUC-ROC von 0,912 bei. Drittens integriert ein dreiteiliger Datenschutz-Compliance-Mechanismus adaptive differentielle Privatsphäre (ε=5), additives Geheimnis-Sharing und fairness-bewusste Regularisierung, um die DSGVO-Konformität sicherzustellen, den ΔDP-Bias auf < 0,05 zu begrenzen und Mitgliedschaftsinferenzangriffe (AUC=0,58) zu verhindern. Gemeinsam bringen diese Innovationen die Anforderungen von Datenfragmentierung, regulatorischer Interpretierbarkeit und Datenschutz-Sicherheits-Kompromissen in föderierter Finanz-KI in Ordnung.

Föderiertes Lernen im Finanzwesen wird basierend auf Datenverteilung in Horizontal Federated Learning (HFL)2, Vertical Federated Learning (VFL)3 und Federated Transfer Learning (FTL)4 kategorisiert (Tabelle 2).

Föderales ParadigmaKernmerkmaleAnpassungsszenario zur finanziellen RisikokontrolleRepräsentative StudienBegrenztheit
Horizontales föderales LernenDer Daten-Feature-Raum der Teilnehmer ist konsistent, aber der Stichprobenraum ist andersOrganisationsübergreifende Erkennung von KreditkartenbetrugMcMahan et al. [[i]](2017) schlugen den FedAvg-Algorithmus vor, der HFL erstmals auf finanzielle Betrugsbekämpfung anwendete, indem er eine institutionelle Zusammenarbeit zwischen Modellen durch Parametermittelung erreichte, und die Betrugserkennungsrate auf einem 10-Bank-Datensatz um 12 % verbesserteOhne Berücksichtigung der nicht unabhängigen und identisch verteilten (Nicht-IID) Merkmale von Finanzdaten sinkt bei einer Differenz der Kundenrisikoverteilung zwischen Institutionen 30 % der AUC-ROC des Modells um mehr als 15 %.
Vertikales föderales LernenDer Stichprobenraum der Teilnehmer ist konsistent, aber der Merkmalsraum ist andersKollaborative Kreditrisikokontrolle zwischen Banken und VersicherungsgesellschaftenYang et al. [[ii]] (2020) schlugen den SecureBoost-Algorithmus vor, der vertikales gemeinsames Training von Merkmalen durch homomorphe Verschlüsselung erreicht und eine Standardvorhersagegenauigkeit von 89,3 % im Szenario von Klein- und Mikrounternehmenskrediten erreichtEs basiert auf strikter Entitätsausrichtung , was ein hohes Risiko für Privatsphäre birgt, und die Trainingseffizienz sinkt stark, wenn die Feature-Dimension zu groß ist
Bundesstaatliches TransferlernenEs gibt Unterschiede in der Datenverteilung und im Merkmalsraum der TeilnehmerCross-Scenario-RisikomigrationPan et al.[[iii]] (2021) lösten das Problem der Stichprobenknappheit in der Lieferkettenfinanzierung, indem sie das Parametermigrationsoptimierungsmodell initialisierten, das die Konvergenzgeschwindigkeit um 60 % verbesserte"Negative Migration" tritt wahrscheinlich während des Migrationsprozesses auf. Wenn die Risikomechanismusdifferenz zwischen Quellszenario und Zielszenario 40 % übersteigt, übersteigt die Modellleistung die traditionelle Modell
[[i]]McMahan, B., Moore, E., Ramage, D., Hampson, S., & y Arcas, B. A. (2017). Kommunikationseffizientes Lernen von tiefen Netzwerken aus dezentralen Daten. Tagungsband der 20. Internationalen Konferenz für Künstliche Intelligenz und Statistik, 1273–1282.
[[ii]]Yang, Q., Liu, Y., Chen, T. und Tong, Y. (2020). Föderiertes maschinelles Lernen: Konzept und Anwendungen. ACM Transactions on Intelligent Systems and Technology, 10(2), 1–19.
[[iii]]Pan, S. J., & Yang, Q. (2021). Eine Umfrage zum Transfer Learning. IEEE Transactions on Knowledge and Data Engineering, 33(12), 2345–2359.

Tabelle 2: Vergleich von Lernparadigmen im Finanzsektor.5,6,7

Jüngste Fortschritte adressieren szenariospezifische Herausforderungen: FedSSL8 bekämpft Label-Knappheit durch kontrastives Lernen, während FedLite9 eine Kommunikationsreduktion von 490 × für ressourcenbegrenzte Institutionen erreicht. Erweiterungen im Gesundheitswesen10, Sicherheitslücken11, multimodale Finanzen12 und Skalierbarkeit13 zeigen die breite Anwendbarkeit von FL.

Datenschutz ist zentral für die Kontrolle finanzieller Risiken. Die drei Haupttechniken – Differential Privacy (DP)14, Secure Multi-Party Computation (SMC)15 und Homomorphic Encryption (HE)16 – bieten deutliche Vorteile in Stärke, Effizienz und Anpassungsfähigkeit. DP ist formal definiert durch Pr[M(x) = y] ≤ e ⋅ Pr[M(x') = y] + δ, wobei M den randomisierten Algorithmus darstellt, $x$ und $x'$ benachbarte Datensätze bezeichnen und y die Ausgabe des Algorithmus ist. Dies gewährleistet eine Ausgabeähnlichkeit über Datensätze hinweg und begrenzt individuelle Leckage durch kontrollierbares Rauschen strikt. Eine vergleichende Analyse ihrer technischen Eigenschaften ist in Tabelle 3 dargestellt.

Art der TechnologieKernprinzipienDatenschutzstärke (ε Wert)BerechnungskomplexitätAnpassungsfähigkeit finanzieller Szenarien
Unterschiedliche PrivatsphäreEinzelne Beiträge zum Datensatz sind durch das Hinzufügen von Rauschen nicht zu unterscheidenε=1-5 (empfohlener Wert für Finanzszenarien)O (n) (n ist die Stichprobengröße)High, geeignet für den gesamten Prozess des Modelltrainings, kann nahtlos mit federiertem Lernen kombiniert werden
Sicheres MehrparteiencomputingMehrere Teilnehmer arbeiten zusammen, um zu berechnen, ohne Zwischenergebnisse preiszugebenInformationstheoretische SicherheitO (n²) (vertikales föderales Szenario)Ja, sie eignet sich für die Berechnung der Sensitive Feature Joints, aber in großen Stichprobenszenarien dauert sie zu lange
Homomorphe VerschlüsselungDie verschlüsselten Daten werden direkt berechnet und das korrekte Ergebnis wird nach der Entschlüsselung erhaltenBerechnungssicherO (n³) (basierend auf Gitterkryptographie)Niedrig, nur geeignet für kleinräumige Parameterübertragung, Millionen von Proben, Szenarioberechnungszeit von mehr als 24 Stunden

Tabelle 3: Vergleich der Eigenschaften der Datenschutztechnologie.

In Finanzanwendungen ist differenzierte Privatsphäre aufgrund ihrer "Datenschutzeffekt-Balancekontrolle" zur gängigen Wahl geworden. Dwork, C.17 schlug die klassische (ε, δ)-DP-Definition vor, die einen quantitativen Standard für den Datenschutz bietet. Die Kernformel lautet wie folgt:

Gleichung 3(1)

Hier M Als Datenschutzalgorithmus sind D und D ein benachbarter Datensatz (nur eine Stichprobendifferenz), Datenschutzbudget (je kleiner der Datenschutz, desto stärker), r Datenschutzbudget (je kleiner der Datenschutz, desto stärker) δ Die Wahrscheinlichkeit des Scheiterns (üblicherweise 10–5).

Abadi, M. et al.18 entwickelten den Differential Privacy Stochastic Gradient Descent Descent (DP-SGD), bei dem Gradient Clipping und Rauschinjektion genutzt werden, um die Datenschutzleckage im Kreditrisikomodell auf unter 8 % zu reduzieren. Sichere Mehrparteienberechnung (SMC) und homomorphe Verschlüsselung werden hauptsächlich für sensible Verarbeitung eingesetzt. So wandten Bogetoft, P. et al.19 SMC beispielsweise auf die Bankgrenz-Kreditbewertung an und stellten sicher, dass nur endgültige Scores zugänglich waren. Perri, L.2 schlug einen vollständig homomorphen Verschlüsselungsalgorithmus für sichere Parameteraggregation vor, wobei die hohe Rechenkomplexität seine Anwendung auf kleinflächige Schulungen mittelgroßer Banken beschränkt.

KI-Risikokontrollmodelle haben sich von traditionellen zentralisierten Architekturen zu verteilten Architekturen entwickelt, wobei zwei Paradigmen signifikante Unterschiede in Datenabhängigkeit, Leistung und Compliance-Kosten aufweisen. Zentralisierte Modelle umfassen Gradient Boosting Trees (GBDT) und Deep-Learning-Modelle. Der von Friedman, J., Hastie, T. Tibshirani, R.21 vorgeschlagene GBDT-Algorithmus verbessert die Genauigkeit der Risikovorhersage durch Multi-Tree-Integration und erreicht einen AUC-ROC von 0,93 in persönlichen Kreditszenarien. Es erfordert jedoch die vollständige Erfassung von Kundendaten, was das Risiko von Datenpannen und Compliance-Herausforderungen darstellt. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 entwickelten ein transformatorbasiertes Risikokontrollmodell, das die Betrugserkennungsraten um 15 % verbessert, obwohl die Parametergröße 10 GB übersteigt. Das verteilte Paradigma umfasst Ansätze wie Parameter- und Feature-Sharing. Parameter-Sharing (z. B. FedAvg) aggregiert lokale Parameter, hat jedoch Schwierigkeiten mit Nicht-IID-Merkmalen: AUC-ROC sank von 0,89 auf 0,82, da die Differenzen in der Ausfallrate von 0,5 % auf 3,5 % anstiegen. Feature-Sharing (z. B. SecureBoost) ermöglicht vertikale Zusammenarbeit, erfordert jedoch eine präzise Ausrichtung, wobei die Leistung um 20 % abbricht, wenn Fehler 5 % überschreiten.

Der Kern des föderierten Lernens besteht darin, multiinstitutionelles kollaboratives Training ohne Rohdatenübertragung zu ermöglichen. Dieser Rahmen definiert die Teilnehmer, den Trainingsprozess und die Zielfunktion. In dieser Studie besteht das System aus K-Finanzinstitutsknoten (bezeichnet als P1, P2, ..., PK) und einem Koordinator C. Jede Institution PK hält einen lokalen Datensatz Gleichung 10, Xk,i∈Rd , der die Kundenmerkmale yk,i∈{0,1} für Risikolabels (0 ist normal, 1 ist defaultfraud), lokale Stichprobengröße, vollständige Datenskala Gleichung 13sind. Das Training folgt einem Prozess der "lokalen Iteration-globalen Aggregation": i) Initialisierung: Der Koordinator generiert initiale globale Parameter θ0 und verteilt sie an alle Institutionen; ii) Lokale Iteration: In der Ausbildungsrunde basiert die Institution PK auf lokalen Daten und aktuellen globalen Parametern θt, minimiert die lokale Verlustfunktion durch Gradientenabstieg, erhält die aktualisierten lokalen Parameter θt,k, das heißt:

Gleichung 18(2)

Dabei ist n die Lernrate und ∇θL,kt) der Gradient des lokalen Verlusts a θt ist der Gradient des lokalen Verlusts a θt; iii) Globale Aggregation: Die Institution verschlüsselt und lädt lokale Parameter an den Koordinator hoch, der Koordinator generiert neue globale Parameter θt+1 durch stichprobengrößengewichtete Aggregation:

Gleichung 22(3)

iv) Endbedingung: Schritt 2-3 wiederholen, bis sich die Leistung des globalen Modells auf dem Validierungsset für aufeinanderfolgende Runden nicht verbessert, das endgültige Modell ausgeben. θ* = θT. Angesichts der nicht-unabhängigen identischen Verteilung (Nicht-IID) Eigenschaften von Finanzdaten ist es notwendig, die Annahmen des traditionellen föderierten Mittelwerts (Fed AvgPk) zu erweitern. Diese Studie verwendet duale Dimensionen der "Label-Verteilungsheterogenität" und "Merkmalsverteilungsheterogenität", um Non-IID zu charakterisieren: Sei der Anteil positiver Instanzen (Standardereignisse) in Institutionen definiert als:

Gleichung 24(4)

Definiere den Tag-Isomorphiekoeffizienten ; Sei die mittlere Differenz der Mengenmerkmale ,When α>0,03 und wenn, Es wird als ein High-Non-IID-Szenario bestimmt.

Je nach Fähigkeit und Ziel des Angreifers werden die Bedrohungsszenarien in drei Kategorien unterteilt, wie in Tabelle 4 gezeigt

Art der BedrohungAngreifer-IdentitätBoxsackTypische Mittel
Ein HalbwahrheitsangriffTeilnehmende Institutionen/KoordinatorenErschließen Sie Kundenmerkmale anderer InstitutionenGradienteninversion und Angriffe auf Mitgliederargumentation basierend auf Modellparametern
feindlicher AngriffBöswillige InstitutionenGlobales Modell der VerschmutzungLade falsche Gradienten und Giftmodelle hoch
Externer AngriffUnautorisierte DritteParameter/Funktionen während des Transports stehlenZwischenangriffe, Abhören von Kommunikationsverbindungen

Tabelle 4: Bedrohungsmodell-Klassifikation des Finanzsystems.

Unter Verwendung von (ε,δ) -Differential Privacy (Differential Privacy, DP) als Kernstandard zum Datenschutzschutz besteht das Wesentliche darin, Rauschen hinzuzufügen, sodass der Einfluss von "ob der Datensatz eine Probe enthält" auf die Modellausgabe ignoriert werden kann. Die formale Definition lautet wie folgt: Für föderierte Lern-M-Algorithmen, wenn für zwei benachbarte Datensätze und die sich nur um eine Stichprobe unterscheiden (DΔD' = 1), sowie für jede Ausgabe-S⊆Range(M)-Menge, erfüllt sie:

Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)

Dann nennt man sie zufrieden (ε,δ)-DP. Eines davon ist das "Datenschutzbudget" (je kleiner der Datenschutz, desto stärker ist er, und das finanzielle Szenario wird üblicherweise berücksichtigt), δ für die "Ausfallwahrscheinlichkeit" (im Allgemeinen δ≤10-5, um sicherzustellen, dass Ereignisse mit geringer Wahrscheinlichkeit die Privatsphäre und Sicherheit nicht beeinträchtigen). Um sich an die Mehrrunden-Iterationsmerkmale föderierter Ausbildung anzupassen, wird der gesamte Datenschutzverbrauch mithilfe des Kombinationssatzes "Renyi differentielle Privatsphäre" (RDP) berechnet. Sei das Datenschutzbudget jeder Trainingsrunde εt, dann erfüllt das gesamte Datenschutzbudget nach dem Training des Zyklus:

Gleichung 32(6)

Dieser Satz liefert eine theoretische Grundlage für adaptive Rauschkalibrierung, indem es das Privatsphäre-Budget pro Runde dynamisch zuweist.

FedRisk verwendet ein rigoroses (ε, δ)-differentielles Datenschutz-(DP)-Framework und verteilt Datenschutzbudgets dynamisch über den Rényi DP (RDP)-Kompositionssatz. Es definiert die globale Sensitivität Δf als die maximale L1-Normänderung der Modellparameter, induziert durch benachbarte Datensätze (die sich um eine einzelne Stichprobe unterscheiden), mit varianzbewusster Laplace-Rauschkalibrierung (Rauschkoeffizient κ_t proportional zu den Schwankungen der Datenverteilung). Unter der Gesamt-Datenschutz-Budgetbeschränkung ε=5 (Einhaltung der DSGVO-Konformitätsschwellen) wandelt RDP den Mehrrunden-Trainings-Datenschutzverbrauch in (ε, δ)-DP (δ=10⁻⁵) um, wobei die Schutzstärke und die empirischen Ergebnisse des Modellnutzens zeigen, dass dies den Mitglieder-Inferenzangriff-AUC auf 0,58 unterdrückt, während die Risikoprognose-AUC-ROC bei 0,912 beibehalten wird.

Die Optimierung von Finanzrisikokontrollmodellen muss gleichzeitig drei regulatorische Anforderungen erfüllen: "prädiktive Genauigkeit", "Datenschutzschutz" und "Fairness". Traditionelle Optimierungsfunktionen, die ausschließlich auf Verlustminimierung abzielen, sind nicht mehr anwendbar. Ein multiobjektives Optimierungsrahmen muss etabliert werden, um regulatorische Einschränkungen in quantifizierbare Regularisierungsterme umzuwandeln. Für binäre Klassifikationsszenarien (Standard/Normal) wird der Log-Verlust (LogLoss) als Basis-Verlustfunktion verwendet, um die Abweichung zwischen modellvorhergesagten Wahrscheinlichkeiten und tatsächlichen Labels zu messen, definiert als:

Gleichung 33(13)

Wobei pk,i = σ(θ; xk,i) ist die vorhergesagte Standardwahrscheinlichkeit der Stichprobe (xk,i,y k,i) für das Modell, σ(⋅) ist die Sigmoid-Aktivierungsfunktion.

Die Anforderungen der DSGVO, des Datenschutzgesetzes und anderer Vorschriften werden in drei Arten von Regularisierungsbegriffen umgewandelt, die mit der grundlegenden Verlustfunktion kombiniert werden, um das endgültige Optimierungsziel zu bilden:

Gleichung 37(14)

Die Definition und Funktion jedes Regularisierungsbegriffs sind wie folgt: i) Datenschutzbeschränkungen: Basierend auf den Lärmzusatzkosten durch unterschiedliche Privatsphäre wird der Einfluss des quantitativen Datenschutzes auf die Modellgenauigkeit diskutiert. Sei die globale Sensitivität der Modellparameter Δ (also die maximale Änderung der Parameter, die durch benachbarte Datensätze verursacht wird), dann:

Gleichung 39(15)

Dieser Begriff stellt sicher, dass die zusätzliche Lärmintensität dem Datenschutzbudget entspricht und übermäßige Verluste an der Modellgenauigkeit vermeiden. Ii) Fairness-Beschränkung: Angesichts der "Anti-Diskriminierungs"-Anforderungen im Datenschutzgesetz für personenbezogene Daten ist die Vorhersage-Verzerrung verschiedener Gruppen eingeschränkt. Nehmen wir "demografische Parität" (DemographicParity) als Beispiel: Sei die positive Gprediction-Rate der Menge , Gleichung 41dann:

Gleichung 210 (16)

Dieser Begriff minimiert den Unterschied in der Vorhersagerate zwischen verschiedenen Gruppen und vermeidet Modelldiskriminierung. III) Robustheitsbeschränkungen: Als Antwort auf die Anforderungen der "Modell-Anti-Interferenzfähigkeit" in Basel III: Stellen Sie sicher, dass kleine Störungen der Daten die Modellausgabe nicht wesentlich beeinflussen. Durch das Hinzufügen adversarialer Stichproben-Δx-Störungen (wobei |Δx| erfüllt wird).≤γ) definiert die Forschung:

Gleichung 45(17)

Die Robustheit des Begriffsverbesserungsmodells gegenüber abnormalen Daten wird verbessert und das Risiko von Fehlureinschätzungen reduziert. In dieser Formel ist der Regularisierungskoeffizient; er wurde durch Kreuzvalidierung bestimmt (in dieser Studie λ1=0,01,λ2=0,05,λ3=0,02). Sicherstellen Sie ein Gleichgewicht zwischen den drei regulatorischen Zielen und der Genauigkeit der Prognose.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Systemarchitektur

Institutionelles Datennetz und semantische Schicht

Um die interinstitutionelle Datenheterogenität zu adressieren, konstruiert die Forschung eine Data-Mesh-Architektur mittels domänengesteuerter Knotenpartitionierung. Jede Finanzinstitution fungiert als unabhängiger Datendomänenknoten, bewahrt dabei Eigentums- und Kontrollrechte, wobei die semantische Schicht eine einheitliche Datenerfassung und -interaktion ermöglicht. Die ontologiebasierte semantische Schicht etabliert ein einheitliches Modell der Finanzrisikokontrolle, das Kernentitäten, fMap-Attribute und Entitätsbeziehungen definiert. Spezifische semantische Abbildungsregeln sind in Tabelle 5 detailliert beschrieben. Für institutionenspezifische Fachgebiete werden standardisierte Umwandlungen durch semantische Abbildungsfunktionen erreicht:

Gleichung 48(18)

Kernel-EntitätDer A-Feldname der InstitutionName des Fachbereichs B in der InstitutionSemantischer Schicht-UniformfeldnameDatentypStandardisierte Regeln
AuftraggeberPremium-Kundenbewertung (1-5)VIP-Kundenstufen (Bronze bis Diamant)Kundenkreditwürdigkeit (1-5)GanzzahlBronze→1, Silber→2, Gold→3, Platin→4, Diamant→5
GeschäftTransaktionsbetrag (zehntausend Yuan)Transaktionsbetrag (Yuan)Transaktionsbetrag (Yuan)Gleitende ZahlDer Wert des A-Feldes in der Institution beträgt das 10.000-fache
KreditantragBewerberquote (Kreditquote)Erwarteter DarlehensbetragAntragstellerdarlehensbetrag (Yuan)Gleitende ZahlInstitution A: Gesamtleistung × Verhältnis des Antragsbetrags; Institution B: direkte Zuordnung

Tabelle 5: Zentrale semantische Abbildungsregeln für Entitäten im Bereich der finanziellen Risikokontrolle.

Hier ist xi,j , der i-te spezifische Feldwert der Institution j, min(xj) und max(xj) sind die Minimal- und Maximumswerte des Körpers innerhalb der Institution, Uj und Lj definieren die oberen und unteren Grenzen des einheitlichen Wertbereichs dieses Körpers auf der semantischen Schicht.

Blockchain-basiertes globales Modellregister und Audit-Trail

Um Probleme wie chaotisches Modellversionsmanagement und nicht nachverfolgbare Trainingsprozesse im föderierten Lernen zu lösen, wird Blockchain-Technologie eingesetzt, um ein globales Modellregister und ein Audit-Tracing-System aufzubauen. Durch die Nutzung einer Konsortium-Blockchain-Architektur sind die teilnehmenden Knoten Finanzinstitute, föderierte Koordinatoren und Regulierungsbehörden, was Datenunveränderlichkeit und Mehrparteienkonsens sicherstellt23. Das globale Modellregister speichert Kernmetadaten der Modelle, einschließlich Versionsnummern, Trainingsrunden Hv, Listen teilnehmender Institutionen, strukturelle Parameter und Leistungskennzahlen. Diese Metadaten werden mithilfe einer Merkle-Baumstruktur gespeichert, wobei jede Modellversion einem eindeutigen Hashwert entspricht:

Gleichung 57(19)

Hier ist v die Modellversionsnummer, T ist die Gesamtzahl der Trainingsrunden, S ist die Sammlung der Institutionen, die an der Ausbildung teilnehmen, IDi ist die eindeutige Kennung einer Institution i, θv ist der Modellparametervektor für die Version v, und AUCv ist der AUC-ROC-Wert dieser Version des Modells.

Federated Feature Engineering Pipeline

Sichere Entitätsausrichtung und Schema-Harmonisierung

Feature Engineering dient als Kernkomponente der institutionellen Datenkollaboration und erfordert eine effektive Extraktion, Ausrichtung und Aggregation von Features bei gleichzeitiger Wahrnehmung des Datenschutzes. Diese Studie entwirft eine umfassende Pipeline, die sichere Entitätenausrichtung, Schemakoordination und differenzielle, datenschutzintegrierte Transaktionsgraphenaggregation umfasst, um sowohl institutionelle Heterogenität von Merkmalen als auch Risiken von Datenschutzlecks zu adressieren24. Die institutionelle Ausrichtung von Einrichtungen ist entscheidend, um eine Zusammenarbeit mit Merkmalen zu erreichen. Die direkte Übertragung von Kundenkennungen würde jedoch die Privatsphäre gefährden. Daher verwendet die Forschung eine datenschutzwahrende Entitätsausrichtungsmethode, die homomorphe Verschlüsselung (HE) mit lokalitätssensitiver Hashing-Technologie (LSH) kombiniert. Institutionen verarbeiten Kundenkennungen mit SHA-256-Hashfunktionen vor, um vorläufige Kennungen zu erzeugen. Diese Identifikatoren werden dann über LSH in denselben "Eimer" abgebildet, um die nachfolgende Verschlüsselungsberechnung zu reduzieren. Identifikatoren innerhalb desselben Buckets werden der Paillier-homomorphen Verschlüsselung unterzogen. Die verschlüsselten Identifikatoren werden an den föderierten Koordinator hochgeladen, der durch den Vergleich der Ähnlichkeit der verschlüsselten Identifikatoren mit Kosinusähnlichkeit die Entitätsausrichtung erreicht.

Gleichung 64(20)

Wenn die Ähnlichkeit größer als der vorgegebene Schwellenwert liegt (in dieser Studie wird sie als τ=0,95 gewertet), wird festgestellt, dass es sich um dieselbe Entität handelt, und es wird eine einheitliche Entitäts-ID über alle Institutionen hinweg generiert, um eine sichere Entitätsausrichtung zu erreichen.

Differenziell private Aggregation von Transaktionsgraph-Embeddings

Finanzielle Transaktionsdaten zeigen unterschiedliche, graphisch strukturierte Merkmale (mit Kunden als Knoten und Transaktionen als Kanten). Die Einbettung von Transaktionsdiagrammen erfasst effektiv die Transaktionsmuster der Verwandten der Kunden und bietet so wichtige Funktionen für Risikokontrollmodelle. Allerdings kann die direkte Aggregation von institutionellen Gi=(Vi,E i)ViiEie i,v∈Rd dd Transaktionsgraph-Embeddings die transaktionsbezogenen Informationen der Kunden durchsickern lassen. Daher wird die DifferentialPrivacy-(DP)-Technologie eingeführt, um eine datenschutzschützende Aggregation von Transaktionsgraph-Embeddings zu erreichen. Jede Institution erstellt lokal einen Transaktionsgraphen, wobei die Menge der Client-Knoten für die Institution repräsentiert und die Menge der Transaktionskanten (Kantengewichte gleich Transaktionsbeträgen). Der GraphSAGE-Algorithmus wird verwendet, um Knoten-Einbettungen zu erzeugen (mit 256-dimensionalen Einbettungsdimensionen in dieser Studie). Um unterschiedliche Datenschutzanforderungen zu erfüllen, wird Laplace-Rauschen zu den lokalen Einbettungen hinzugefügt:

Gleichung 67(21)

Hier ΔG Globale Sensitivität des GraphSAGE-Algorithmus (geschätzt durch Experiment in dieser Studie ΔG=0,8), für das lokale Datenschutzbudget der Behörde,

Gleichung 70(22)

Für das gesamte Datenschutzbudget des Systems nimmt diese Studie εGesamt = 1,5). Der Koordinator aggregiert das Noise Embedding jeder Institution mithilfe einer gewichteten Gleichung 72 Durchschnittsstrategie, mit Gewichtungen basierend auf dem Prozentsatz der Kunden jeder Institution:

Gleichung 73(23)

Der aggregierte globale Transaktionsgraph Gleichung 200 wird eingebettet und an jede Institution zurückgegeben. Als zentrales Eingabeelement des Risikokontrollmodells behält er nicht nur die institutionellen Transaktionskorrelationsinformationen, sondern schützt auch die Privatsphäre der Kunden durch differenzielle Privatsphäre.

Gleichung 201 (24)

Hybrides KI-Risikomodell

Lokale Teilmodelle: Gradienten-Boosting mit monotonen Nebenbedingungen

Traditionelle zentralisierte KI-Risikokontrollmodelle haben Schwierigkeiten, sich an institutionelle föderierte Szenarien anzupassen. Diese Studie entwickelt ein hybrides KI-Risikomodell, das "lokale Submodelle + globales Fusionsmodell" kombiniert und die hohe Interpretierbarkeit von Gradient Boosting Trees (GBDT) mit der Anpassungsfähigkeit von Transformer an nicht-unabhängige und identisch verteilte (NID) Daten integriert. Ein Interpretationsmodul wird eingeführt, um die Modellleistung und Erklärbarkeit in föderierten Umgebungen auszubalancieren. Jede Institution erstellt vor Ort GBDT-Submodelle, die aufgrund ihrer starken strukturellen Datenanpassungsfähigkeit und hoher Interpretierbarkeit ausgewählt werden – wesentliche Anforderungen für Finanzrisikokontrollvorschriften. Um Overfitting und unlogische Schlussfolgerungen zu vermeiden, werden während des GBDT-Trainings monotone Einschränkungen implementiert, die monotone Muster für Schlüsselmerkmale wie Kundeneinkommen und Kredit-Scores erzwingen. Der erste Baum, der von GBTD gesetzt wird, ist ht(x), und die Modellausgabe ist:

Gleichung 76(25)

Hier ist η die Lernrate (diese Studie dauert η=0,1). Die monotone Nebenbedingung wird durch die Regularisierung der Verlustfunktion xj realisiert.

Fügen Sie den Nebenterm hinzu:

Gleichung 80(26)

Hier stellt x≺x' dar, dass der Eigenwert von x kleiner ist als der von x', und die Endverlustfunktion lautet:

Gleichung 84(27)

Hier ist l die logarithmische Verlustfunktion (verwendet im binärenRisikokontroll-y∈{0,1}-Szenario, die angibt, ob der Kunde in Zahlungsverzug fällt). Gleichung 87 ist der Komplexitätsregularisierungsterm für den Baum, λ und γ sind der Regularisierungskoeffizient (Diese Studie wurde durch λ=0,01 γ=0,5 Kreuzvalidierung durchgeführt, ni ist die Anzahl der lokalen Stichproben für die Institution i, T ist die Anzahl der Bäume (Diese Studie umfasste T=100).

Globale Fusion: Aufmerksamkeitsbasierter Transformator für Nicht-IID-Adaption

Institutionelle Daten zeigen bedeutende Merkmale der Nicht-IID-Verteilung. Traditionelle FedAvg-Algorithmen, die einfach lokale Modellparameter durchschnittlich bestimmen, haben Schwierigkeiten, sich an Nicht-IID-Daten anzupassen. Um dem gerecht zu werden, führt die Forschung ein auf Attention pi(x)=σ(Fi(x))σFi(x)iai-basiertes Transformer-Modell für intelligente Fusion lokaler Submodelle ein. Das globale Fusionsmodell nimmt als Eingabe die Ausgabewahrscheinlichkeiten aus dem lokalen Submodell jeder Institution (Sigmoid-Funktionen-Ausgaben aus institutionellen GBDT-Modellen). Die Transformer-Architektur besteht aus einem Encoder und einer Aufmerksamkeitsschicht, wobei die Aufmerksamkeitsschicht Aufmerksamkeitsgewichte aus den Ausgaben verschiedener Institutionen berechnet, um adaptive Gewichtung zu erreichen. Die Aufmerksamkeitsgewichte werden mit Scaled Dot-Product Attention berechnet:

Gleichung 94(28)

Hier ist q der Abfragevektor (erzeugt durch die durchschnittlichen Risikomerkmale globaler Stichproben), Gleichung 96 ist der Schlüsselvektor der Institution i, dk ist die Dimension des Schlüsselvektors (in dieser Studie ist dk=64), n ist die Anzahl der an der Föderation teilnehmenden Behörden.

Die endgültige Ausgabewahrscheinlichkeit des globalen Modells lautet:

Gleichung 101(29)

Durch den Aufmerksamkeitsmechanismus kann das globale Modell den Institutionen mit hoher Datenqualität und genauer Risikovorhersage automatisch ein höheres Gewicht zuweisen und die Anpassungsfähigkeit an nicht-IID-Daten verbessern.

Erklärbarkeitsmodul: SHAP bei föderierten Bäumen + kontrafaktischer Generator

Finanzrisikokontrollmodelle müssen interpretierbar bleiben, um regulatorische Anforderungen zu erfüllen und das Recht der Kunden auf Kenntnis zu schützen. Um dies zu beheben, entwickelt die Forschung ein Interpretierbarkeitsmodul, das föderierte SHAP+-Gegenfaktgeneratoren kombiniert. Für lokale GBDT-Submodelle verwendet die Forschung SHAP-Werte, um die Merkmalsbedeutung zu messen, die Si∈RNi×m quantifizieren und den Beitrag jedes Merkmals zu den Vorhersageergebnissen quantifizieren. In föderierten Szenarien könnte das direkte Übertragen lokaler SHAP-Werte die Verteilungsinformationen der Features kompromittieren. Daher implementiert die Forschung eine sichere Aggregationsstrategie, bei der jede Institution lokal die SHAP-Wertmatrix (für die Anzahl der Merkmale) berechnet, differenziellen Datenschutzlärm auf die SHAP-Werte anwendet und sie an den föderierten Koordinator hochlädt. Der Koordinator berechnet dann die globalen SHAP-Werte:

Gleichung 103(30)

Hier ist Si' die SHAP-Wertmatrix der Institution i, und wi ist der Anteil der Stichprobengröße der Institutionen.

Geben Sie den aktuellen Eigenvektor x des Kunden und die Zielrisikobewertung yZiel ein. Das Ergebnis ist ein antifaktischerxcf-Merkmalvektor, erfüllt (die θ-Zielwahrscheinlichkeitsschwelle, die der Zielrisikobewertung entspricht). Und |xcf-x|2. Das Minimum (d. h. die niedrigsten Anpassungskosten). Die Verlustfunktion des Faktengenerators ist:

Gleichung 110(31)

Hier sind α,β,γ die Gewichtskoeffizienten (in dieser Studie α=10,β=5,γ=1),LGAN Die adversariale Verlustfunktion wird für GAN verwendet, um die Rationalität und Authentizität des kontrafaktischen Merkmalsvektors sicherzustellen.

Datenschutz- und Sicherheitsschicht

Sichere Aggregation mit additiver Geheimnisverteilung

Beim föderierten Lernen ist die Übertragung und Aggregation lokaler Modellparameter ein Schlüssellink bei Datenschutzlecks. Die AdditiveSecretSharing (ASS)-Technologie wird eingesetzt, um eine sichere Aggregation zu erreichen und die direkte Übernahme lokaler Modellparameter jeder Organisation durch den Koordinator zu vermeiden. Der spezifische Prozess ist wie folgt: i) Jede Institution teilt die lokalen Modellparameter in geheime Anteile θ i,1,θi,2,...,θi,n , die Gleichung 118erfüllen , Hier ist die Anzahl der teilnehmenden Institutionen; ii) Die Institution i sendet den Anteil θi,k an die Institution (k≠i), behält ihren eigenen Anteil θi,i; iii) Jede Institution k sammelt Anteile ein, die von allen anderen Institutionen θ1,k,θ 2,k,...,θn,k gesendet wurden, und summiert dies mit dem von ihr selbst behaltenen θk,k-Anteil und erhält die Teilsumme; iv) Alle Institutionen laden Sk einen Teil davon hoch und teilen sie dem Koordinator, der Koordinator berechnet die globalen ParameteraggregationsergebnisseGleichung 126. Durch additives Geheimnis-Sharing kann der Koordinator nur globale aggregierte Parameter erhalten und kann keine lokalen Parameter einer einzelnen Institution ableiten, n-1ttt=⌈n/2⌉ nicht. Selbst eine Absprache zwischen mehreren Institutionen kann keine Parameter von anderen wiederherstellen, was Privatsphäre und Sicherheit während der Parameterübertragung gewährleistet. Um Aktienverluste durch institutionelle Trennungen zu beheben, wird der Shamir-Geheimnis-Teilemechanismus als Backup eingeführt. Jeder Anteil wird weiter in Fragmente unterteilt. Durch das Sammeln eines beliebigen Fragments kann der vollständige Anteil wiederhergestellt werden, was die Systemrobustheit erhöht.

Adaptive Rausch-Kalibrierung unter (ε, δ)-DP-Budgetplanung

Die zentrale Herausforderung des differenzierten Datenschutzes besteht darin, die Stärke des Datenschutzes mit der Modellleistung auszubalancieren. Traditionelle Methoden zur Fixrauschaddition haben Schwierigkeiten, sich an Szenarien anzupassen, in denen sich die Datenverteilungen während federierter Ausbildung dynamisch ändern. Diese Studie entwickelt einen adaptiven Rauschkalibrierungsmechanismus auf Basis von (ε,δ)-DP, kombiniert mit einer Strategie zur Planung des Privatsphärebudgets, um eine dynamische Anpassung der Rauschintensität zu erreichen. Definieren Sie das gesamte Datenschutzbudget des Systems wie folgt (Diese Studie nimmt δGesamt = 10-5 , entspricht den GDPR-Anforderungen für Datenschutzrisiken), Verfolgen Sie die segmentierte Budgetplanungsstrategie, Das Gesamtbudget wird gemäß dem Trainingszyklus {ε1,ε 2,...,εT} wie folgt zugewiesen, erfüllt:

Gleichung 130(32)

In jeder Trainingsrunde wird die Rauschintensität dynamisch entsprechend den Verteilungsmerkmalen lokaler Daten angepasst. Unter der Annahme, dass die lokale Daten-Merkmalsvarianz der t-ten Runde der Institution ist Gleichung 132, definiere den Rauschanpassungskoeffizienten αi,t:

Gleichung 134(33)

Wenn αi,t≥0,8 (die Datenverteilung stabil ist), unter Verwendung einer kleinen Rauschintensität Gleichung 136; Wenn αi,t<0,8 (die Datenverteilung schwankt) , erhöht sich die Rauschintensität . Dazu gehört die globale Empfindlichkeit der Modellparameter (diese Untersuchung wird durch Gradientenclipping sichergestellt).

Kommunikationseffizientes Trainingsprotokoll

Asynchrone Client-Updates mit Stagnationskontrolle

Institutionelles federiertes Lernen steht vor Herausforderungen wie hoher Kommunikationslatenz und erheblichem Bandbreitenverbrauch (insbesondere bei kleinen und mittelständischen Finanzinstituten mit begrenzten Netzwerkressourcen). Diese Studie entwickelt ein effizientes Kommunikationstrainingsprotokoll, das asynchrone Client-Updates, Gradientenkompression und Fehlerrückmeldung integriert, um Kommunikationskosten zu senken und die Systemskalierbarkeitzu verbessern 25. Traditionelle synchrone föderierte Trainingsmethoden wie FedAvg erfordern, dass alle Kunden das lokale Training abgeschlossen haben, bevor die Parameteraggregation durchgeführt wird, was zu langen Trainingszyklen führt. Der asynchrone Client-Update-Mechanismus ermöglicht es den Clienten, lokale Schulungen unabhängig durchzuführen und sofort Parameter hochzuladen. Nach Erhalt dieser Parameter aktualisiert der föderierte Koordinator das globale Modell in Echtzeit, ohne auf andere Clients zu warten. Dies behebt das Problem des Modell-Alters im asynchronen Training . Mit der Strategie zur Stagnationskontrolle definieren wir den Stagnationswert für den Client (Für taktuell die aktuelle globale Trainingsrunde, tlast_update die Runde, in der der Client zuletzt das globale Modell erhalten hat). Wenn (Smax die maximal zulässige Stagnation ist, nimmt diese Studie smax=5). Der Klient nimmt normal am Training teil; Ander maximalen Zeit muss der Kunde das neueste globale Modell vor >dem lokalen Training erneut herunterladen. Die Hardwarekonfiguration besteht aus Intel Xeon E5-2678 v3 CPUs (12 Kerne, 2,5 GHz), kombiniert mit NVIDIA Tesla V100 GPUs (16 GB VRAM) und 64 GB DDR4-Speicher pro Knoten, um verteilte Trainingsarbeitslasten effizient zu bewältigen. Für die Softwareinitialisierung werden PySyft-Befehle wie hook = sy verwendet. TorchHook(Torch)andvirtual_worker = sy. VirtualWorker(hook, id="client1") werden verwendet, um sichere föderierte Verbindungen herzustellen, während federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) ermöglicht federiertes Datenladen über Teilnehmer hinweg. Semantic Mapping transformiert finanzielle Merkmale zwischen Institutionen – zum Beispiel wird Transaktionsbeträge von USD in CNY mit einer dynamischen Wechselkursformel umgewandelt: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), wobei der Wechselkurs periodisch über die API aktualisiert wird. Um unausgeglichene Datensätze zu ergänzen, erzeugt CopulaGAN synthetische Adversarial-Samples mit einem Codeschnipsel wie aus sdv.tabular import CopulaGAN; Synthesizer = CopulaGAN(epochs=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), wodurch die statistischen Eigenschaften der ursprünglichen Daten erhalten bleiben. Lokales GBDT-Training erzwingt monotone Einschränkungen (z. B. stellt sicher, dass "credit_score" positiv mit "approval_probability" korreliert) Viaparams = {"monotonic_constraints": (1, 0, -1)}in LightGBM, während Transformer-Fusion in PyTorch mit mehreren Kopf-Aufmerksamkeitsschichten implementiert ist:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention(query, key, value, key_padding_mask=padding_mask), gefolgt von Layer-Normalisierung und Residualverbindungen für Stabilität. Differenzielle Privatsphäre injiziert Laplace-Rauschen, skaliert auf die L1-Sensitivität (Δf) und das Privatsphärebudget (ε) – z. B. indem Rauschen hinzugefügt wird, das aus np.random.laplace(loc=0, scale=Δf/ε) gesampelt wird, wobei Δf=1,2 und ε=0,5-to-Gradienten vor der Aggregation abgeschnitten sind. Fairness-Einschränkungen werden nach dem Training angewendet, indem Stichproben umgekehrt proportional zu ihrer Gruppenprävalenz (sample_weight = 1 / group_counts[y_train]) neu gewichtet werden, um demografische Paritätsverletzungen zu mildern. Gleichzeitig wird die gewichtete Aggregationsstrategie verwendet, um das Gewicht der Kundenparameter entsprechend dem Stagnationswert anzupassen:

Gleichung 143(34)

Wobei λ=0,1 der Stagnations-Strafkoeffizient ist; Je größer die Stagnation, desto geringer das Gewicht, was den Einfluss veralteter Parameter auf das globale Modell verringert.

Gradientenkompression und Fehlerrückkopplungsakkumulation

Modellparameter (insbesondere die Aufmerksamkeitsgewichte in Transformer-globalen Fusionsmodellen) haben eine hohe dimensionale Komplexität. Die direkte Übertragung würde eine übermäßige Bandbreite verbrauchen, was Gradientenkompressionstechniken zur Reduzierung des Datentransfersum 26 erforderlich machen würde. Diese Studie integriert Top-K-Sparsifizierung mit Quantisierungskompression und folgt diesen spezifischen Schritten: i) Top-K spärlich: Für das lokale Modell ∇θi Gradient wählen Sie das Gradientenelement K% mit dem größten Absolutwert, das beibehalten werden soll, K. Die übrigen Elemente sind null, der Wert wird dynamisch entsprechend der Bandbreitenbedingung angepasst (wenn die Bandbreite K=30 ausreicht, wenn die Bandbreite begrenzt ist K=10); ii) Quantisierungskompression: Die erhaltenen Gradientenelemente werden von 32-Bit-Gleitkomma- auf 8-Bit-Ganzzahlen quantisiert. Die Quantisierungsformel lautet:

Gleichung 150(35)

  

iii) Fehlerrückmeldung: Speichere den verworfenen Gradienten Δ∇=∇θi-∇θikomprimierter Fehler während der Kompression auf der Client-Seite. In der nächsten Gradientenberechnung wird der Fehler in den neuen Gradienten akkumuliert, Annäherung, Gleichung 202 , Kompensierung für Kompressionsverluste. Die Auswirkungen von Gradientenkompression und Fehlerrückkopplung sind in Tabelle 6 dargestellt, 8 K=20%-Bit-Quantisierungsbedingungen, das Kompressionsverhältnis erreicht 15:1 (ursprüngliches Datenvolumen/komprimiertes Datenvolumen), und durch Fehlerrückkopplung sinkt der AUC-ROC des Modells nur um 0,5%–1,0 %, wodurch das Gleichgewicht zwischen Kommunikationskosten und Modellleistung27 realisiert wird.

KompressionsstrategienReduktionsverhältnisUpload-Bandbreitenverbrauch (MB/Runde)Rückgangsrate AUC-ROCVerkürzungsrate der Ausbildungszeit
unkomprimiert (32-Bit-Gleitkomma)1:011280.00%0.00%
Top-30 % Sparse+16-Bit-Quantisierung6.7:119.10.30%35.20%
Top-20 % Sparse + 8-Bit-Quantisierung15:018.50.80%58.70%
Top-10 % Sparse + 8-Bit-Quantisierung30:01:004.32.10%72.10%

Tabelle 6: Leistungsvergleich von Gradientenkompressionsstrategien.

Fairness-bewusste Regularisierung

Finanzrisikokontrollmodelle müssen Diskriminierung gegenüber bestimmten Gruppen vermeiden und regulatorische Anforderungen einhalten, darunter das Gesetz zum Schutz personenbezogener Daten und das Gesetz zur fairen Kreditauskunft. Diese Studie führt einen fairness-sensiblen Regularisierungsmechanismus ein, um intergruppenbasierte Vorhersagefehler während des Modelltrainings einzuschränken und so die Modellfairness sicherzustellen. Zwei zentrale Fairness-Indikatoren sind definiert: i) Demografische Parität (DP): Die positive Vorhersagerate ist für verschiedene Gruppen gleich, Ansatz Gleichung 154, Unter g ist der Gruppenidentifikator ; ii) Chancengleichheit (EO): Die wahre positive Rate ist zwischen den Gruppen gleich, Ansatz Gleichung 155. Fügen Sie Fairnessregularisierungstermen zur Verlustfunktion des hybriden KI-Risikomodells hinzu und legen Einschränkungen auf das lokale GBDT-Submodell bzw. das globale Transformer-Modell auf: iii) Lokale Modell-Fairness-Constraints:

Gleichung 156

Hier ist PR(g=A) die positive Prädiktionsrate für die Gruppe g, λ, und ist der Regularisierungskoeffizient für die Fairness.

iv) Globale Modell-Fairness-Constraint: Fügt man der Transformer-Aufmerksamkeitsschicht eine Anpassung der Gruppegerechtigkeit hinzu, erhält das Modellergebnis für verletzliche Gruppen alsg = eineBasis×(1+β⋅Δunfair) ein höheres Aufmerksamkeitsgewicht. Hier steht Δunfair für den Fairness-Bias zwischen dieser Gruppe und der dominanten Gruppe (Δunfair=PR (dominante Gruppe)-PR (vulnerable groups)); λEO ist der Abweichungskompensationskoeffizient. Der Effekt der Regulierung der Fairness-Wahrnehmung wird durch ΔDP (DP-Abweichung), ΔEO (EO-Abweichung) und Gruppenkalibrierungsfehler bewertet.

Model Governance und Compliance-Dashboard

Echtzeit-Bias-Überwachung

Um die Anforderungen der Finanzregulierung im Bereich des Modelllebenszyklus-Managements zu erfüllen, hat die Forschung ein Model Governance and Compliance-Dashboard entwickelt, das Echtzeit-Abweichungsüberwachungs- und regulatorische Berichts-APIs integriert und so eine vollständige Prozessüberwachung und Rückverfolgbarkeit während des gesamten Modelltrainings, der Implementierung und Iteration ermöglicht. Das Echtzeit-Abweichungsüberwachungsmodul erreicht eine dynamische Nachverfolgung der Modellfairness und -leistung anhand folgender Dimensionen: i) Überwachung von Gruppenabweichungen: Kategorisierung von Gruppen nach Kundengeschlecht, Alter, Region, Einkommensniveau usw., wobei PR, TPR und FPR (False Positive Rate) für jede Gruppe stündlich berechnet wird. Abweichungswarnungen werden ausgelöst, wenn PR-Unterschiede zwischen Gruppen 0,08 oder TPR-Unterschiede 0,05 überschreiten; ii) Überwachung von Leistungsabweichungen: Kontinuierliche Berechnung von Metriken wie AUC-ROC und PR-AUC. Wenn diese Kennzahlen innerhalb von drei Stunden aufeinanderfolgend um mehr als 2 % sinken, wird dies als Leistungsabweichung definiert und startet automatisch den Modell-Retraining-Prozess. iii) Datenschutz-Compliance-Überwachung: Erfassung des Datenschutzbudgetverbrauchs und der Lärmzusatz εGesamt/10 Intensität jeder Schulungsrunde. Wenn der ε Verbrauch einer einzelnen Runde übersteigt, pausieren Sie das Training und passen Sie die Lärmstrategie an. iv) Überwachungsdaten werden über visuelle Dashboards dargestellt, sodass Regulierungsbehörden und teilnehmenden Institutionen sie in Echtzeit einsehen und ein transparentes Management von Modellrisiken gewährleistet wird.

API für regulatorische Berichterstattung

Um den Prozess der regulatorischen Berichterstattung zu vereinfachen, wurde eine standardisierte Reporting API entwickelt, die die automatische Erstellung von Berichten unterstützt, die Vorschriften wie DSGVO, CCPA und Chinas Datenschutzgesetz entsprechen. Zu den Kernfunktionen gehören: i) Datenquellen-Compliance-Bericht: Automatisch aggregiert Datentypen, Volumina und den Autorisierungsstatus teilnehmender Institutionen, um die Einhaltung des "Mindestnotwendigkeits"-Prinzips zu überprüfen; ii) Muster-Trainings-Compliance-Bericht: Akten-Trainings-Iterationen, teilnehmende Institutionen, Datenschutzmaßnahmen und Fairness-Kennzahlen zur Erstellung eines Modell-Trainings-Rückverfolgbarkeitsberichts; iii) Risk Prediction Compliance Report: Zeigt regulatorisch konforme Verteilungsmuster von Modellvorhersagen über verschiedene Gruppen hinweg sowie kontrafaktische Erklärungsfälle, um Nichtdiskriminierung zu demonstrieren. Die API verwendet einen RESTful-Designstil und unterstützt JSON- und XML-Formatausgaben. Regulierungsbehörden können über API-Schnittstellen direkt auf Berichtsdaten zugreifen oder automatische Meldezyklen festlegen, um automatisierte und standardisierte Regulierungsprozesse zu erreichen. Die Berichtsvorlagen entsprechen den Regulierungsstandards der Internationalen Organisation für Standardisierung (ISO) und gewährleisten so die Autorität und Universalität der Berichte.

Versuchsdesign: Datensatzbeschreibung

Daten zu multiinstitutionellen Kreditkarten- und KMU-Darlehen

Die experimentellen Daten stammten von Finanzinstituten in China und umfassten Datentypen wie persönliche Kreditkartentransaktionen sowie Antrags- und Abwicklungsaufzeichnungen für KMU-Darlehen. Die CopulaGAN-Technologie wurde eingesetzt, um seltene betrügerische Ereignisse zu synthetisieren und zu verbessern und so einen experimentellen Datensatz zu erstellen, der Authentizität mit Integrität verbindet. Die im Experiment verwendeten tatsächlichen Daten umfassen zwei Hauptkategorien: persönliche Kreditkartentransaktionsdaten und KMU-Darlehensdaten, insgesamt über 5 Millionen Datensätze von Januar 2022 bis Dezember 2023. Die Daten decken vier große Wirtschaftsregionen ab – Nordchina, Ostchina, Südchina und Südwestchina –, um geografische Repräsentativität und Vielfalt in der Stichprobenverteilung sicherzustellen. Die Kerngebiete und statistischen Merkmale der institutionellen Daten sind in Tabelle 7 dargestellt. Darunter sind die Institutionen A und B landesweite Geschäftsbanken mit großen Kundenstammen aller Altersgruppen; Die Institutionen C und D sind Internetbanken, die hauptsächlich jüngere Zielgruppen (20-35 Jahre alt) bedienen; Institution E ist ein Verbraucherfinanzunternehmen, das Nutzer in niedrigeren Märkten anspricht, wobei die Datenverteilung signifikante Nicht-IID-Merkmale aufweist. Der Datensatz enthält 115.610 Datensätze. Der Datensatz wird von Finanzinstituten bereitgestellt, die mit Universitäten zusammenarbeiten

DatentypInstitutionAnzahl der Aufzeichnungen (10.000)Anzahl der Kunden (10.000)KerngebieteDefaultfraud-RateMerkmale der Datenverteilung
KreditkartentransaktionenA18085Transaktionszeit, Betrag, Händlertyp, Transaktionsort, ob die Karte gestohlen werden soll0.32%Große Transaktionen machen einen hohen Anteil aus (> 5000 Yuan)
KreditkartentransaktionenB15072Transaktionsflussnummer, Betrag (USD/RMB), Zahlungskanal, Kundenbewertung0.28%Grenzüberschreitende Transaktionen machen 15 % aus
KreditkartentransaktionenC12068Zeitstempel der Transaktion, Betrag, ob installiert werden soll, Kundenalter, Standort der Mobiltelefonnummer0.45%Kleiner Hochfrequenzhandel (<1000 Yuan macht 60 % aus)
Kredite für kleine und kleine UnternehmenD321.2Firmenname, Darlehensbetrag, Kreditlaufzeit, Einnahmen, Steuerbetrag, ob überfällig2.80%Fertigungskunden machen 40 % aus
Kredite für kleine und kleine UnternehmenE180.8Kreditantragsdatum, erwarteter Betrag, Art des Unternehmens, Anzahl der Mitarbeiter, historische Leistungsbilanz3.50%Servicekunden machen 70 % aus

Tabelle 7: Statistische Merkmale eines multi-institutionellen realen Finanzdatensatzes.

Um die Heterogenität interinstitutioneller Daten zu adressieren, hielt sich das Experiment strikt an Datengitter- und semantische Schichtspezifikationen, indem institutionelle Felder standardisiert wurden: Zum Beispiel wurde der "Transaktionsbetrag (USD)" von Institution B in RMB unter Verwendung des Wechselkurses des Transaktionsdatums umgewandelt und der Feldname auf "Transaktionsbetrag (YUAN)" vereinheitlicht; die Umwandlung des "Kundenalters" von Institution C (Format "1990-01-01") in ein ganzzahliges Alter; und die Abbildung der "Enterprise Revenue Scale" (klassifiziert als "unter 1 Million / 1-5 Millionen / über 5 Millionen") auf Mittelpunkte numerischer Bereiche (500.000,3.000.000,7.500.000), wodurch die Konsistenz zwischen Datenformat und semantischer Bedeutung gewährleistet ist.

Synthetische Augmentation über CopulaGAN bei seltenen Betrugsereignissen

In Szenarien der finanziellen Risikokontrolle machen Betrugs-/Default-Stichproben typischerweise einen extrem geringen Anteil aus. Die direkte Verwendung so kleiner Stichprobengrößen für das Modelltraining würde zu erheblichen Klassenungleichgewichten führen und die Verallgemeinerungsmöglichkeiten des Modells beeinträchtigen. Das Experiment verwendet Copula GAN (ein generatives adversariales Netzwerk, das auf Copula-Funktionen basiert), um erweiterte Daten für seltene Betrugsfälle zu synthetisieren. Diese Methode vereint die Fähigkeit der Copula-Funktion, hochdimensionale Datenverteilungen zu modellieren, mit den generativen Fähigkeiten von GAN und ermöglicht so die Erstellung synthetischer Daten, die mit echten Betrugsmustern übereinstimmen, während das "Musterkollaps"-Problem bei der traditionellen GAN-Generierung vermieden wird.

CopulaGAN-Modellstruktur

CopulaGAN besteht aus drei Teilen: Generator-, Discriminator- und Kopula-Verteilungs-Constraint-Modul: (1) Generator: Die Eingabe ist ein 128-dimensionaler Zufallsrauschvektor z∼N(0,1) und gibt einen synthetischen Merkmalvektor aus, der mit der wahren Probendimension übereinstimmt, über ein 3-schichtiges vollständig verbundenes Netzwerk (versteckte Schichtdimensionen sind 256, 512, 256); (2) Diskriminator: Die Eingabe ist eine reale oder synthetische Probe xSyn, und über ein zweischichtiges, vollständig verbundenes Netzwerk + Sigmoid-Aktivierungsfunktion wird die Wahrscheinlichkeit ausgegeben, dass die Probe reale Daten sind; (3) Kupulaverteilungs-Constraint-Modul: Passen Sie die gemeinsame Verteilung der realen Betrugsproben durch die Gaußsche Kopula-Funktion an (wobei der Wert der Kantenverteilungsfunktion des achten Merkmals von i ist) an und fügen Sie die Kopula-Entfernungsbedingung in den Generatorverlust hinzu, um sicherzustellen, dass die gemeinsame Verteilung der synthetischen Proben mit den realen Stichproben konsistent ist.

Gleichung 165(36)

Prozess- und Effektverifikation verbessern

Der Trainings- und Verbesserungsprozess von CopulaGAN ist wie folgt: i) Datenvorverarbeitung: Betrugs-/Default-Proben (insgesamt 18.200) aus den echten Daten verschiedener Institutionen extrahieren; Standardisieren Sie kontinuierliche Merkmale (x'=(x-μ)/σ); Diskrete Merkmale sind mit einzigartiger Wärme codiert; ii) Kopula-Anpassung: Die Gaußsche Kopulafunktion wird verwendet, um die gemeinsame Verteilung der vorverarbeiteten Betrugsproben anzupassen, die Kantenverteilung Fiθ und die Kopula-Funktionsparameter jedes Merkmals zu berechnen; iii) GAN-Training: Der Generator und der Diskriminator werden abwechselnd trainiert. Die Verlustfunktion des Generators ist:

Gleichung 168(37)

Hier ist λ das Constraint-Gewicht, und Distance (Csyn, Creal) ist die KL-Divergenz zwischen der Copula-Verteilung synthetischer Proben und der Copula-Verteilung der reellen Proben; Die Diskriminator-Verlustfunktion ist der standardmäßige binäre Kreuzentropieverlust:

Gleichung 170(38)

Nach der Modellkonvergenz (mit stabilisierter Diskriminatorgenauigkeit bei 50 %±5%) erzeugte der Generator 50.000 synthetische Betrugsproben. Diese wurden gemäß semantischen Spezifikationen auf den ursprünglichen Feature-Raum zurückgeordnet und mit echten Proben kombiniert, um ein ausgewogenes Trainingsset zu erstellen. Um die Wirksamkeit der synthetischen Proben zu validieren, bewertete die Forschung sie mittels eines zweiprobigen KS-Tests und einer Merkmalsverteilungsvisualisierung. Die KS-Testergebnisse zeigten, dass die Unterschiede in den Merkmalsverteilungen zwischen synthetischen und realen Stichproben alle unter 0,05 lagen (KS-Statistik <0,05, p-Wert>0,05), was auf eine gute Verteilungskonsistenz hinweist. Der Vergleich der Feature-Verteilung zeigte, dass synthetische Stichproben die Verteilungsmerkmale echter Betrugsproben genau reproduzieren konnten und so ausreichend valide Daten für das Modelltraining lieferten, wie in Abbildung 1 dargestellt.

Abbildung 1
Abbildung 1: Vergleich der Funktionsverteilung zwischen echten Betrugsproben und CopulaGAN Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Bewertungsmetriken

Das Experiment erstellt ein Multi-Index-Bewertungssystem aus vier Kerndimensionen: Vorhersageleistung, Datenschutz, Fairness und Kommunikationseffizienz, um die umfassende Leistung des föderierten Lernrahmens und des KI-Risikokontrollmodells umfassend zu messen. Die Definition, das Berechnungsverfahren und die Bewertungskriterien jeder Dimension sind in Tabelle 8 dargestellt.

BewertungsdimensionenName des IndexDefinition und BerechnungsmethodeBewertungskriterium
Geschätzte LeistungAUC-ROCDie Fläche unter der charakteristischen Arbeitskurve des Probanden misst die Fähigkeit des Modells, zwischen positiven (Default/Betrug) und negativen Beispielen zu unterscheidenJe höher der Wert, desto besser. Der AUC-ROC des hervorragenden Modells beträgt >0,9
PR-AUCDer Genauigkeitsabrufbereich unter der Kurve, anwendbar auf unausgewogen Daten, misst die Leistung eines Modells in Szenarien, in denen positive Beispiele selten sindJe höher der Wert, desto besser. Der PR-AUC eines ausgezeichneten Modells ist>0,8
BrierbruchMittlerer Quadratfehler zwischen der vorhergesagten Wahrscheinlichkeit und dem wahren Label, B=1Ni=1N(pi-yi)2Je niedriger der Wert, desto besser. Der Brier-Wert eines ausgezeichneten Modells liegt unter 0,05
Falsch-positiv-Rate (FPR)Der Anteil negativer Beispiele FPR=FPFP+TNthatJe niedriger der Wert, desto besser. Finanzielle Szenarien verlangen in der Regel eine FPR von <1 % (um keine Ablehnung guter Kunden zu vermeiden).
Datenschutzε-Konsumkurve (ε-Kurve)Erfassen Sie die Verbrauchsrate des angesammelten Datenschutzbudgets während der Schulung, um die dynamische Balance des Datenschutzes widerzuspiegelnDie Kurve stabilisiert sich und der Gesamtwert ε liegt unter oder gleich 5 (im Einklang mit den DSGVO-Datenschutzrisiken).
Angriff auf Mitgliederbegründung AUC (MI-AUC)Die Fähigkeit eines Angreifers, anhand der Modellvorhersageergebnisse festzustellen, ob eine Probe zum Trainingsset gehört, und je näher der AUC-Wert 0,5 ist, desto besser ist die PrivatsphäreMI-AUC<0.6 ist effektiv für Datenschutz, MI-AUC<0.55 ist ausgezeichnet
Merkmals-Leckrate (FLR)Der Angreifer aggregiert die Merkmale, um den Fehler FLR=1-KL(P∥∥Q)Dmaxrate der ursprünglichen Datenverteilung rückgängig zu machen,FLR <0.1 zeigt an, dass Datenschutz wirksam ist (P ist Dmax die wahre Verteilung, Q ist die abgeleitete Verteilung und ist die maximale KL-Distanz)
FairnessDP-Verzerrung in der Statistik (ΔDP)Der maximale Unterschied in der Vorhersage ΔDP=max∥PRg-PRavg∥Rate positiver Beispiele zwischen verschiedenen Gruppen,ΔDP<0,05 für Fairness, für Exzellenz (PRg für die positive Rate der Gruppe g)
EO-Verzerrung (ΔEO)Der maximale Unterschied in wahr positiven ΔEO=max∥TPRg-TPRavg∥Raten zwischen verschiedenen Gruppen,GCE <0,02 ist gut kalibriert (K ist die Gruppenzahl, die vorhergesagte Rate und die tatsächliche Rate)
Gruppenkalibrierungsfehler (GCE)Die durchschnittliche Abweichung zwischen der vorhergesagten Wahrscheinlichkeit GCE=1Kg=1K∥pg-rg∥ jeder Gruppe und der tatsächlichen Ausfallrate,Je niedriger der Wert, desto besser. Die Szenarioanforderungen kleiner und mittelständischer Organisationen liegen bei <10 MB/Runde
KommunikationseffizienzUplink-Bandbreite pro RundeGesamt-Bandbreitenverbrauch der von jeder Organisation an den Koordinator hochgeladenen Daten während eines einzigen ZeitraumsJe niedriger der Wert, desto besser. Institutionsübergreifende Szenarien benötigen weniger als 120 Minuten
Reduktionsverhältnis (CR)Das Verhältnis des ursprünglichen Datenvolumens zum komprimierten Datenvolumens, CR=SizerawSizecompJe höher das Verdichtungsverhältnis, desto besser. Ausgezeichnete Lösungen CR>10:1

Tabelle 8: Experimentelles Bewertungsindexsystem.

Metrik-Erklärung: i) Membership Inference Attack: Mit Black-Box-Angriffsmethodik trainiert der Angreifer ein binäres Klassifikationsmodell, das vorhergesagte Wahrscheinlichkeiten aus dem Zielmodell eingibt und den Stichproben-Mitgliedschaftsstatus ausgibt. Das Risiko von Privatsphären-Leckage wird durch das AUC des Modells gemessen (d. h. MI-AUC). ii) Gruppenklassifikationskriterien: In der Fairness-Bewertung werden die Gruppen in vier Dimensionen eingeteilt: Geschlecht (männlich/weiblich), Alter (unter 25/25-40/>40), Region (erste Stufe/neue Erste-Stufe/zweite Kategorie/Tochtermarkt) und Einkommensniveau (<5k/5k-15k/15k-30k/>30k RMB/Monat). Dies gewährleistet die Abdeckung sensibler Gruppen, die von Finanzaufsichtsbehörden identifiziert wurden. iii) Konvergenzkriterien: Während des Modelltrainings, wenn der Validierungssatz AUC-ROC einen Rückgang von weniger als 0,001 über drei aufeinanderfolgende Runden (jede Runde enthält 10 Epochen) zeigt, gilt das Training als konvergiert und gestoppt.

Baselines

Um die Überlegenheit des vorgeschlagenen "Federated Learning + Hybrid AI Risk Control Model" zu validieren, legt diese Studie fünf Basismodelle fest: traditionelle zentralisierte Modelle, klassische föderierte Lernmodelle und datenschutzfördernde verbesserte Modelle. Die Kernparameter und Trainingsstrategien jedes Basismodells sind in Tabelle 9 detailliert dargestellt, um Fairness in vergleichenden Experimenten zu gewährleisten (alle Modelle verwenden identische Trainingssätze, Validierungssätze und Hyperparameter-Optimierungsstrategien).

ModelltypenModellnameKernarchitekturTrainingsmodusDatenschutzmaßnahmenWichtige Hyperparameter
Zentralisiertes ModellTradition GBDTXGBoost Gradient-Boosting-BaumAlle Einrichtungen speichern Ausbildungsdaten zentralNicht habenAnzahl der Bäume = 100, Lernrate = 0,1, Baumtiefe = 6, Regularisierungskoeffizient λ=1,0
Zentralisiertes ModellDeep-Learning-Modell (MLP)Das dreischichtige, vollständig verbundene Netzwerk (Eingangsschicht 256 Dimensionen → versteckte Schicht 128 Dimensionen → versteckte Schicht 64 Dimensionen → Ausgabeschicht 1 Dimension)Alle Einrichtungen speichern Ausbildungsdaten zentralNicht habenOptimizer=Adam, Learning Rate=0,001, Batchgröße=256, Dropout=0,3
Klassisches BundesmodellFedAvg (Bundesdurchschnitt)Das lokale Modell ist GBDT, und das globale Modell verwendet die Aggregation von ParameterdurchschnittenBundessynchrone AusbildungNicht habenTeilnahmequote = 0,8, lokale Epoche = 5, Aggregationsrunde = 50, Lernrate = 0,1
Klassisches BundesmodellFedProx (Bundes-Near-End-Aggregation)Das lokale Modell ist GBDT, und das proximale ModellBundessynchrone AusbildungNicht habenTeilnahmequote = 0,8, lokale Epoche = 5, Aggregationsrunde = 50, proximaler Parameter μ = 0,01
μ=0.01
Term-Constraint wird während der Aggregation hinzugefügt ().
Datenschutzbefähigte FöderationFedAvg+DP (festes Rauschen)Füge dem FedAvg festes Laplace-Rauschen hinzu (ε=5, δ=1e-5)Bundessynchrone AusbildungFeste differenzierte PrivatsphäreRauschintensität=0,1, Teilnahmerate=0,8, lokale Epoche=5, Aggregationsrunden=50
Das ForschungsmodellFedRisk (Bundesrisikokontrollmodell)Lokale GDT (monotone Constraint) + Global Transformer (Attention Fusion) + DP + Secure AggregationFöderale Asynchrone AusbildungAdaptive DP+ additive GeheimnisverteilungLokale Epoche=5, Aggregationsrunden=50, Aufmerksamkeitsdimension=64, Datenschutzbudgetε=5, Kompressionsverhältnis=15:1

Tabelle 9: Parametervergleich zwischen dem Baseline-Modell und diesem Studienmodell.

Vergleichende Dimension Erklärung: (1) Zentralisiert vs. föderiert: Durch den Vergleich von "traditionellem GBDT/MLP" mit "FedAvg/FedProx/FedRisk" untersucht diese Studie den Leistungsverlust föderiertes Lernens in "Daten-Offsite"-Szenarien. (2) Classic vs. Privacy-Enhanced Federated: Durch "FedAvg" versus "FedAvg+DP" bewertet die Forschung die Auswirkungen differenzierter Privatsphäre auf die Modellleistung. (3) Synchron vs. asynchron föderiert: Der Vergleich zwischen "FedAvg" (synchron) und "FedRisk" (asynchron) zeigt die Vorteile der Kommunikationseffizienz asynchroner Trainings. (4) Einfache Aggregation vs. intelligente Fusion: Der Kontrast zwischen "FedAvg" (Parametermittelung) und "FedRisk" (Aufmerksamkeitsfusion) bestätigt die Anpassungsfähigkeit von Transformer-Integrationsstrategien an Nicht-IID-Daten. (5) Keine Zensur vs. Fairness-Zensur: Der Vergleich zwischen "FedAvg" (keine Fairness Constraints) und "FedRisk" (fairness-conscious constraints) untersucht die Auswirkungen von Fairness-Mechanismen auf die Modellfairness und -leistung.

Ablationsstudien

Auswirkungen variierender ε auf den Modellnutzen

Mit dem gesamten Datenschutzbudget ε als Variable (mit den Werten 1, 3, 5, 7 und 10) fixierte die Forschung δ=1e-5, während andere Module (Attention Fusion und die monotone Constraint GBDT) unverändert blieben, um den Kompromiss zwischen der Stärke des Datenschutzes und dem Modellnutzen zu bewerten. Das Experiment maß sowohl AUC-ROC (Model Utility) als auch MI-AUC (Privacy Risk) als duale Indikatoren, wobei die Ergebnisse in Tabelle 10 dargestellt sind. Bei ε=1 fiel MI-AUC auf 0,53 (ausgezeichneter Datenschutz), aber AUC-ROC erreichte nur 0,821 (erheblicher Nutzenverlust). Bei ε=5 erholte sich AUC-ROC auf 0,912 (erfüllte damit Anforderungen an finanzielle Risikokontrolle) und MI-AUC=0,58 (wirksamer Datenschutz). Mit ε>5 betrug die Verbesserung von AUC-ROC weniger als 0,01, während MI-AUC rasch auf 0,63 anstieg (was die Datenschutzrisikogrenzen überschritt). Dies bestätigt, dass ε=5 das optimale Gesamtdatenschutzbudget ist und so ein Gleichgewicht zwischen Privatsphäre und Nutzen erreicht.

Totales DatenschutzbudgetεModell AUC-ROCMI-AUC (Datenschutzrisiko)Feature leakage rate FLRBrierbruch
10.8210.530.040.078
30.8760.550.060.061
50.9120.580.080.042
70.9190.60.110.039
100.9230.630.150.037

Tabelle 10: Vergleich der Modellleistung mit verschiedenen Datenschutzbudgets ε.

Beitrag der Aufmerksamkeitsfusion vs. einfacher Mittelwert

Um die Leistungsunterschiede zwischen "Attention Fusion" (der vorgeschlagenen Strategie) und "Simple Amediaging" (FedAvg-Strategie) in nicht-unabhängigen Datenszenarien zu bewerten, wurden zwei Variablen experimentell konfiguriert: (1) Daten Nicht-IID-Schweregrad (gemessen an institutionsspezifischen Ausfallquotenschwankungen, geringe Schwankung: 0,2%–0,5%, hohe Schwankung: 0,2%–3,5%); (2) Fusionsstrategien (Aufmerksamkeitsfusion vs. einfaches Durchschnitt). Wie in Abbildung 2 gezeigt, betrug die AUC-ROC-Lücke zwischen den beiden Strategien lediglich 0,023 (0,912 vs 0,889) in niedrigen Nicht-IID-Szenarien. Diese Lücke vergrößerte sich jedoch auf 0,076 (0,905 vs 0,829) in hohen Nicht-IID-Szenarien, wobei das einfache Durchschnittsmodell signifikante Überanpassung aufwies (Trainingssatz AUC-ROC 0,941 vs. Validierungssatz 0,829). Dies zeigt, dass Aufmerksamkeitsmechanismen Leistungsverschlechterungen durch nicht-unabhängige Daten durch dynamische Gewichtung wirksam abmildern können – etwa indem Institution E mit genauen Standardvorhersagen 0,32 Gewicht und Institution C mit größeren Abweichungen 0,12 Gewicht zugewiesen werden.

Abbildung 2
Abbildung 2: Vergleich der Fusionsstrategien unter verschiedenen Nicht-IID-Graden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung zu sehen.

Auswirkungen von Fairness-Regularizern auf gewinnorientierte KPIs

Die Kernanforderung der Finanzinstitute besteht darin, Geschäftsgewinne unter dem Vorwand der Fairness sicherzustellen, daher führt das Experiment einen gewinnorientierten Index ein – "risikoadjustierte Kapitalrendite (RAROC)". Die Formel lautet wie folgt:

Gleichung 171(39)

Der erwartete Verlust wird als Ausfallwahrscheinlichkeit multipliziert mit der festen Ausfallverlustquote (festgelegt auf 40 %), während das wirtschaftliche Kapital durch die Risikobelastung multipliziert mit dem Risikogewicht (gemäß Basel-III-Anforderungen) bestimmt wird. Die Fairness-Metriken (ΔDP, ΔEO) und RAROC des Modells mit Fairness-Regularisierung im Vergleich zum Modell ohne Fairness werden in Tabelle 11 verglichen. Nach der Umsetzung der Fairness-Regularisierung sank ΔDP von 0,15 auf 0,04, ΔEO von 0,12 auf 0,03 und RAROC sank nur um 2,1 % (18,3 % gegenüber 18,7 %), deutlich unter der branchenüblichen Schwelle von 5 %. Dies zeigt, dass der Fairness-Mechanismus in unserer Studie die regulatorischen Anforderungen zur Nichtdiskriminierung effektiv erfüllt und gleichzeitig Gewinnverluste kontrolliert.

ModellaufbauΔDP (gruppenpositiver Ratenunterschied)ΔEO (Gruppen-TPR-Unterschied)GCE (Gruppenkalibrierungsfehler)RAROC (Risikobereinigte Kapitalrendite)FPR (Falsch-Positiv-Rate)
Keine Fairness-Regel0.150.120.03518.70%0.95%
Es gibt Fairness und Regelmäßigkeit0.040.030.01818.30%1.02%

Tabelle 11: Einfluss der Fairness-Regularisierung auf Fairness- und Gewinnindikatoren.

Implementierungsdetails

Um die Reproduzierbarkeit des Experiments sicherzustellen, wurden in der Forschung Details zum technischen Stack und zum Trainingsprozess klargestellt: (1) Hardware-Umgebung: Jeder institutionelle Knoten verwendet Intel Xeon Gold 6248 Prozessoren, 64 GB RAM und NVIDIA Tesla V100 GPUs; der föderierte Koordinator verwendet zwei Xeon Gold 6348-Prozessoren mit 128 GB RAM, um paralleles Rechnen und effiziente Parameteraggregation sicherzustellen. (2) Software-Framework: Das föderierte Lern-Framework wird mit PySyft 0.8.6 entwickelt, das Blockchain-Modul nutzt Hyperledger Fabric 2.5 (Konsensmechanismus: Raft), das Modelltraining basiert auf PyTorch 2.0 und XGBoost 2.0.3, während das Modul für differenzielle Privatsphäre IBM DP Library integriert. (3) Trainingsprozess: (1) Datenvorverarbeitung (2 Stunden, einschließlich semantischer Normalisierung und CopulaGAN-Verbesserung); (2) Lokale Ausbildung (5 Epochen pro Runde, Lernrate durch Kosinusglühung abgenommen); (3) Asynchrone Aggregation (globale Modellupdates erfolgen, wenn der Koordinator Parameter von 3 Institutionen erhält); (4) Modellbewertung (AUC-ROC und Fairness-Kennzahlen, berechnet nach 10 Runden); (5) Hyperparameter-Optimierung (Bayessche Optimierung mit 50 Iterationen zur Bestimmung optimaler Parameter). (4) Robustheitstests: simulierte institutionelle Disconnects (zufällige Auswahl einer Institution, die 1–3 Trainingsrunden unterbricht) und Datenrauschen (Hinzufügen von 5 % Merkmalswert-Störungen) Szenarien. Die Ergebnisse zeigten AUC-ROC-Schwankungen unter 0,02, was die Anti-Interferenz-Fähigkeit des Systems demonstriert.

Diese Studie verwendete eine Koordinatus-Annealing-Planungsstrategie mit einer anfänglichen Lernrate von 0,05. Die Lernrate wurde in jeder Epoche dynamisch gemäß der Formel über insgesamt 100 Trainingsphasen aktualisiert. Diese Strategie hielt in den frühen Trainingsphasen eine hohe Lernrate aufrecht, zum Beispiel 0,05 im ersten Epoche, um die Modellkonvergenz zu beschleunigen, und reduzierte sie allmählich auf nahezu null, zum Beispiel 0,00025 in der hundertsten Epoche, um die Stabilität der Parameterfeinabstimmung zu verbessern. Experimentelle Ergebnisse zeigten, dass diese Strategie im Vergleich zu einer festen Lernrate das Validierungsset AUC-ROC um 2,3 % verbesserte und die Konvergenzgeschwindigkeit um 37 % beschleunigte. Die Datenaufteilung basierte auf einem Rohdatensatz von fünf Finanzinstituten mit insgesamt 5 Millionen Stichproben und hielt sich strikt an das Prinzip der institutionellen Datenisolation. Die lokalen Daten jeder Institution wurden chronologisch aufgeteilt, wobei Daten von Januar 2022 bis Juni 2023 als Schulungsset (70 %), Daten von Juli bis September 2023 als Validierungssatz (15 %) und Daten von Oktober bis Dezember 2023 als Testsatz (15 %) ausgewählt wurden. Diese Aufteilung gewährleistete die zeitliche Fensterunabhängigkeit der Trainings-, Validierungs- und Testsätze und simulierte effektiv die Entwicklung zeitlicher Risikomuster in realen Szenarien. Wichtige Hyperparameter wurden mittels Bayesscher Optimierung bestimmt. Innerhalb eines gemeinsamen Suchraums mit einer anfänglichen Lernrate zwischen 0,01 und 0,1, GBDT-Baumzahlen zwischen 50 und 200 sowie Transformer-Aufmerksamkeitsköpfen aus der Menge {2, 4, 8} wurden 50 Iterationen ausgeführt, mit dem Ziel, die Validierungsmenge AUC-ROC zu maximieren. Die endgültige optimale Kombination wurde als eine anfängliche Lernrate von 0,05, 120 GBDT-Bäume und 4 Aufmerksamkeitsköpfe identifiziert.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prädiktive Leistung: Annäherung an das Niveau zentralisierter Modelle in Nicht-IID-Szenarien

In realen Szenarien mit stark nicht-IID-Daten (institutionelle Ausfallquotenschwankungen von 0,2 % bis 3,5 %) zeigt FedRisk außergewöhnliche Risikodifferenzierungsfähigkeiten, wie in Tabelle 12 gezeigt. Sein AUC-ROC erreicht 0,912, PR-AUC 0,823, Brier-Score 0,042 und die False Positive-Rate (FPR) 1,02 %. Diese Kennzahlen erfüllen nicht...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die dynamische Hyperparameter-Tuning-Strategie, insbesondere der Koordinatus-Annealing-Lernrate-Scheduler, erwies sich als wesentlich für das Ausbalancieren von Konvergenzgeschwindigkeit und Modellstabilität. Durch die Verringerung der Lernrate von 0,05 auf 0,00025 über 100 Epochen beschleunigte dieser Ansatz die Konvergenz in der Frühphase, minimierte die Trainingszeit der späten Volatilitätsreduktion um 37 % und verbesserte die Validierungs-AUC-ROC um 2,3 % im Vergleich zu festen Zeitp...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Laptop ComputerDell TechnologiesN/AVerwendet für Datenverarbeitung und Dokumentation
Statistische Software (SPSS)IBM Corp.Version 26.0Verwendung für statistische Analysen
Microsoft ExcelMicrosoftBüro 365Dateneingabe und grundlegende Datenverarbeitung

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).
  2. Zhang, X., Mavromatis, A., Vafeas, A., Nejabati, R., Simeonidou, D. Federated feature selection for horizontal federated learning in IoT networks. IEEE Internet Things J. 10 (11), 10095-10112 (2023).
  3. Liu, Y., et al. Vertical federated learning: concepts, advances, and challenges. IEEE Trans. Knowl. Data Eng. 36 (7), 3615-3634 (2024).
  4. Saha, S., Ahmad, T. Federated transfer learning: concept and applications. Intell. Artif. 15 (1), 35-44 (2020).
  5. McMahan, H. B., Moore, E., Ramage, D., Hampson, S., Arcas, B. A. Y. Communication-efficient learning of deep networks from decentralized data. In Proc. 20th Int. Conf. Artif. Intell. Stat. , 1273-1282 (2017).
  6. Yang, Q., Liu, Y., Chen, T., Tong, Y. Federated machine learning: concept and applications. ACM Trans. Intell. Syst. Technol. 10 (2), Article 12(2019).
  7. Pan, S. J., Yang, Q. A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22 (10), 1345-1359 (2010).
  8. Long, Z., Wang, J., Wang, Y., Xiao, H., Ma, F. FedCon: a contrastive framework for federated semi-supervised learning. arXiv. , (2021).
  9. Wang, J., et al. FedLite: a scalable approach for federated learning on resource-constrained clients. arXiv. , (2022).
  10. Hanser, T., et al. Data-driven federated learning in drug discovery with knowledge distillation. Nat. Mach. Intell. 7, 1-14 (2025).
  11. Feng, Y., et al. A survey of security threats in federated learning. Complex Intell. Syst. 11 (2), 165(2025).
  12. Chen, D., et al. Bridging data silos in finance via federated learning. IEEE Netw. , https://ieeexplore.ieee.org/document/11062627 (2025).
  13. Haripriya, R., et al. Navigating the fusion of federated learning and big data: a systematic review for the AI landscape. Clust. Comput. 28 (5), 1-27 (2025).
  14. Dong, J., Roth, A., Su, W. J. Gaussian differential privacy. J. R. Stat. Soc. Ser. B Stat. Methodol. 84 (1), 3-37 (2022).
  15. Bayatbabolghani, F., Blanton, M. Secure comparison protocols for privacy-preserving federated learning. In Proc. 2018 ACM SIGSAC Conf. Comput. Commun. Secur. , 2157-2159 (2018).
  16. Acar, A., Aksu, H., Uluagac, A. S., Conti, M. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput. Surv. 51 (4), (2018).
  17. Dwork, C. Differential privacy. In Proc. Int. Colloq. Automata Lang. Program. , 1-19 (2006).
  18. Abadi, M., et al. Deep learning with differential privacy. In Proc. 2016 ACM SIGSAC Conf. Comput. Commun. Secur. , 308-318 (2016).
  19. Bogetoft, P., et al. Secure multiparty computation goes live. In Financ. Cryptogr. Data Secur. 5628, 325-343 (2009).
  20. Perri, L. What's new in the 2023 Gartner Hype Cycle for emerging technologies. , https://www.gartner.com/en/articles/what-s-new-in-the-2023-gartner-hype-cycle-for-emerging-technologies (2023).
  21. Friedman, J., Hastie, T., Tibshirani, R. The elements of statistical learning. , Springer. New York. (2001).
  22. Zhang, H., Liu, Y., Zhang, X., Yin, Z., Li, Y. A lightweight approach for federated learning in edge devices. In Proc. 7th Int. Conf. Artif. Intell. Big Data (ICAIBD). , 53-58 (2024).
  23. Liu, J., Liu, P., Ou, Z., Zhang, G., Song, M. Optimizing edge intelligence through privacy-preserving learning. In Proc. Int. Conf. Edge Comput. , 419-429 (2024).
  24. Kim, J., Kim, K., Sohn, M., Park, G. Deep model-based security-aware entity alignment method for edge-specific knowledge graphs. Sustainability. 14 (14), 8877(2022).
  25. Xue, J., Qu, Z., Xu, J., Liu, Y., Lu, Z. Bandwidth allocation for federated learning with wireless providers and cost constraints. IEEE Trans. Mob. Comput. 23 (6), 7470-7482 (2024).
  26. Sharma, M., Kaur, P. Scalable federated learning for smart city applications. In Proc. 2nd Int. Conf. Informatics (ICI). , 1-4 (2023).
  27. Li, B., Zheng, S., Raman, P., Shrivastava, A., Giannakis, G. B. Contractive error feedback for gradient compression. arXiv. , (2023).
  28. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Federated LearningExplainable AICross Institutional CollaborationFinancial Risk ControlData PrivacyNon IID DataModel InterpretabilityDifferential PrivacyFraud DetectionSME Loan Default

Verwandte Artikel