Articolo di ricerca

Modello di Apprendimento Federato Spiegabile per la Collaborazione e il Controllo del Rischio tra Dati Finanziari Digitali Inter-Istituzionali

DOI:

10.3791/69805

3 marzo 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dimostriamo un protocollo riproducibile per implementare FedRisk, un framework di apprendimento federato spiegabile. La procedura include armonizzazione semantica dei dati, allineamento delle entità che preserva la privacy, calibrazione differenziale della privacy, addestramento locale GBDT, fusione globale con Transformer e aggiornamenti asincroni compressi in gradiente, consentendo previsioni del rischio finanziario sicure, scalabili e conformi alla regolamentazione su più istituzioni.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La frammentazione dei dati finanziari tra le istituzioni e le rigide normative sulla privacy ostacolano gravemente la gestione collaborativa del rischio, portando a un rilevamento subottimale delle frodi con una precisione inferiore al 60% e ad alti errori di insolvenza nei prestiti delle PMI superiori al 25%. Le soluzioni di apprendimento federato esistenti affrontano sfide con i dati Non-IID, l'interpretabilità del modello e la conformità, con tassi di adozione reali inferiori al 20%. Per colmare queste lacune, proponiamo FedRisk, un framework di apprendimento federato spiegabile che integra quattro innovazioni chiave. Innanzitutto, una mesh dati inter-istituzionale con armonizzazione semantica ontologica raggiunge un utilizzo delle caratteristiche superiore all'85%. In secondo luogo, un modello ibrido di IA combina GBDT localmente interpretabile con vincoli monotoni e un Transformer globale basato sull'attenzione, riducendo la perdita di prestazioni negli scenari Non-IID del 7,6% rispetto a FedAvg. In terzo luogo, un meccanismo tripartito di privacy adottiva differenziale con un budget totale di ε=5, condivisione additiva di segreti e regolarizzazione consapevole dell'equità, limitando il bias di previsione di gruppo sotto lo 0,05 e la perdita RAROC sotto il 2,1%. In quarto luogo, ottimizzazioni efficienti nella comunicazione riducono la larghezza di banda per round a 8,5 MB e il tempo di addestramento a 85 minuti. Valutato su oltre 5 milioni di record multi-istituzionali, FedRisk ottiene un AUC-ROC di 0,912, solo l'1,8% inferiore rispetto al GBDT centralizzato, resistendo agli attacchi di inferenza di appartenenza con un AUC di 0,58. Riduce la trasmissione dati tra istituzioni del 99% e supera le linee di base FL classiche del 7,3% in AUC-ROC. Consentendo una previsione del rischio sicura, trasparente e conforme alle normative senza condivisione dei dati grezzi, FedRisk offre una soluzione scalabile per la collaborazione finanziaria interistituzionale.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Lo sviluppo approfondito della finanza digitale sta rimodellando i modelli di servizio, dal controllo del rischio creditizio personale al finanziamento della catena di approvvigionamento per PMI, stabilendo i dati come fattore centrale di produzione. Secondo il "China Fintech Development Report 2023" della PBOC, alla fine del 2023, la scala del credito digitale cinese ha superato i 65 trilioni di yuan, rappresentando il 38% del saldo totale, con i dati giornalieri sulle transazioni che superavano i 500TB1. Tuttavia, i "silos dei dati" rimangono una barriera significativa. Le istituzioni generalmente adottano modelli di dati chiusi a causa della concorrenza e delle preoccupazioni di sicurezza. Ad esempio, nel rilevamento delle frodi con carte di credito, le banche che si affidano esclusivamente a dati interni trascurano i registri critici interistituzionali, portando a tassi di identificazione inferiori al 60% per i nuovi tipi di frode. Analogamente, per il credito PMI, la mancanza di dati esterni sull'assicurazione e sulle tasse porta a errori di previsione di default superiori al 25%. Questa frammentazione comporta due sfide: limitare l'accesso per 200 milioni di clienti svantaggiati e aumentare il rischio di contagio incrociato del 18% (Rapporto CBIRC 2023). Di conseguenza, i silos dei dati sono diventati il collo di bottiglia principale che ostacola lo sviluppo di alta qualità della finanza digitale.

Negli ultimi anni, un aumento delle leggi globali sulla privacy dei dati ha limitato in modo significativo la condivisione centralizzata dei dati. Le istituzioni finanziarie devono ora aderire a tre principi fondamentali: "minima necessità", "consenso informato" e "tracciabilità". Sebbene i quadri regionali varino, tutti impongono soglie rigorose all'uso dei dati tra istituzioni, come dettagliato nella Tabella 1.

Quadro normativoClausole restrittive fondamentaliImpatto sulla collaborazione con i dati finanziari
Regolamento generale sulla protezione dei dati (GDPR) dell'UE1. Il trasferimento transfrontaliero dei dati deve soddisfare la "determinazione di sufficienza"; 2. Gli individui hanno il diritto di accedere ed eliminare i propri dati; 3. Le violazioni dei dati devono essere segnalate entro 72 oreLa trasmissione non autorizzata transfrontaliera di dati grezzi è vietata, e la condivisione centralizzata richiede una valutazione dell'impatto sulla privacy (PIA), aumentando i costi di conformità del 30%
Legge sulla Privacy dei Consumatori della California (CCPA)1. I consumatori possono chiedere alle aziende di cancellare i propri dati personali; 2. La condivisione dei dati richiede una notifica chiara di cosa verranno utilizzatiLe piattaforme centralizzate richiedono interfacce di accesso ai dati per ogni consumatore, aumentando i costi operativi del 25% e rendendo facile per i consumatori eliminare i dati e causare la mancanza di dati di addestramento per il modello
Legge cinese sulla protezione delle informazioni personali1. Il trattamento delle informazioni personali richiede un consenso separato; 2. Il trattamento di informazioni personali sensibili richiede documenti di autorizzazione aggiuntivi; 3. Istituire un sistema di "classificazione e protezione dei dati"La condivisione dei dati tra istituzioni richiede l'autorizzazione da ciascun cliente, e il tasso di autorizzazione è inferiore al 40% nella pratica. La modalità centralizzata è difficile da implementare
Direttiva UE sui servizi di pagamento II (PSD2)1. Aprire l'interfaccia dati bancari; 2. La condivisione dei dati dovrebbe basarsi sull'autorizzazione del cliente e sull'uso limitatoSebbene supporti la condivisione dei dati, richiede che l'intero processo di accesso all'interfaccia sia tracciato e la piattaforma centralizzata debba assumersi la responsabilità della sicurezza e dell'audit dell'interfaccia, il che aumenta significativamente la complessità tecnica

Tabella 1: Confronto dei requisiti fondamentali dei principali quadri normativi dei dati.

Questo studio introduce tre innovazioni fondamentali per affrontare le sfide nella modellazione federata del rischio inter-istituzionale. Innanzitutto, un'architettura mesh dati con uno strato semantico ontologico standardizza schemi eterogenei, raggiungendo oltre l'85% di utilizzo delle funzionalità preservando la sovranità dei dati. In secondo luogo, un modello ibrido di IA combina GBDT interpretabile localmente con vincoli monotoni conformi alle normative e un Transformer globale basato sull'attenzione. Ponderando dinamicamente i risultati istituzionali, questo modello riduce la perdita di performance dei Non-IID del 7,6% mantenendo un AUC-ROC di 0,912. In terzo luogo, un meccanismo tripartito di conformità alla privacy integra la privacy differenziale adattiva (ε=5), la condivisione additiva di segreti e la regolarizzazione consapevole della equità per garantire la conformità al GDPR, limitare il bias ΔDP a < 0,05 e resistere agli attacchi di inferenza di appartenenza (AUC=0,58). Insieme, queste innovazioni conciliano le esigenze della frammentazione dei dati, dell'interpretabilità normativa e dei compromessi tra privacy e sicurezza nell'IA finanziaria federata.

L'apprendimento federato in finanza è classificato in Apprendimento Federato Orizzontale (HFL)2, Apprendimento Federato Verticale (VFL)3 e Apprendimento Federato per Trasferimento (FTL)4 in base alla distribuzione dei dati (Tabella 2).

Paradigma federaleCaratteristiche principaliScenario di adattamento al controllo del rischio finanziarioStudi rappresentativiLimitazione
Apprendimento federale orizzontaleLo spazio delle caratteristiche dati dei partecipanti è coerente, ma lo spazio campionario è diversoRilevamento delle frodi con carte di credito tra organizzazioni diverseMcMahan et al. [[i]](2017) hanno proposto l'algoritmo FedAvg, che per la prima volta applicava HFL all'antifrode finanziaria ottenendo la collaborazione tra modelli interistituzionali tramite la media dei parametri, e migliorava il tasso di rilevamento delle frodi del 12% su un set di dati con 10 bancheSenza considerare le caratteristiche non indipendenti e distribuite identicamente (Non-IID) dei dati finanziari, quando la differenza di distribuzione del rischio per i clienti tra istituzioni supera il 30%, l'AUC-ROC del modello diminuisce di oltre il 15%
Apprendimento federale verticaleLo spazio campionario dei partecipanti è coerente, ma lo spazio delle feature è diversoControllo collaborativo del rischio creditizio tra banche e compagnie assicurativeYang et al. [[ii]] (2020) hanno proposto l'algoritmo SecureBoost, che raggiunge l'addestramento verticale delle feature joint tramite crittografia omomorfa e raggiunge un tasso di accuratezza predittiva predefinito dell'89,3% nello scenario dei prestiti per piccole e microimpreseSi basa su un allineamento rigoroso delle entità, che comporta un alto rischio di perdita di privacy, e l'efficienza dell'addestramento diminuisce drasticamente quando la dimensione delle caratteristiche è troppo grande
Apprendimento Federale per TrasferimentoCi sono differenze nella distribuzione dei dati e nello spazio delle caratteristiche dei partecipantiMigrazione tra scenari di rischioPan et al.[[iii]] (2021) hanno risolto il problema della scarsità di campioni nella finanza della supply chain inizializzando il modello di ottimizzazione della migrazione dei parametri, che ha migliorato la velocità di convergenza del 60%La "migrazione negativa" è probabile che si verifichi durante il processo migratorio. Quando la differenza del meccanismo di rischio tra lo scenario di origine e quello target supera il 40%, le prestazioni del modello superano quelle del modello tradizionale
[[i]]McMahan, B., Moore, E., Ramage, D., Hampson, S., & y Arcas, B. A. (2017). Apprendimento efficiente della comunicazione di reti profonde da dati decentralizzati. Atti della 20ª Conferenza Internazionale su Intelligenza Artificiale e Statistica, 1273–1282.
[[ii]]Yang, Q., Liu, Y., Chen, T., & Tong, Y. (2020). Machine learning federato: concetto e applicazioni. ACM Transactions on Intelligent Systems and Technology, 10(2), 1–19.
[[iii]]Pan, S. J., & Yang, Q. (2021). Un sondaggio sull'apprendimento trasferito. IEEE Transactions on Knowledge and Data Engineering, 33(12), 2345–2359.

Tabella 2: Confronto dei paradigmi di apprendimento nel settore finanziario.5,6,7

I progressi recenti affrontano le sfide specifiche di scenario: FedSSL8 affronta la scarsità di etichette tramite apprendimento contrastivo, mentre FedLite9 raggiunge una riduzione della comunicazione del 490× per istituzioni a risorse limitate. Le estensioni per la sanità10, vulnerabilità di sicurezza11, finanza multimodale12 e scalabilità13 dimostrano l'ampia applicabilità di FL.

La protezione della privacy è centrale nel controllo del rischio finanziario. Le tre tecniche principali - Differential Privacy (DP)14, Secure Multi-Party Computation (SMC)15 e Homomorphic Encryption (HE)16 - offrono vantaggi distinti in termini di resistenza, efficienza e adattabilità. DP è formalmente definita da Pr[M(x) = y] ≤ e ⋅ Pr[M(x') = y] + δ, dove M rappresenta l'algoritmo randomizzato, $x$ e $x'$ indicano dataset vicini, e y è l'output dell'algoritmo. Questo garantisce la somiglianza di output tra i dataset, limitando rigorosamente la fuga individuale tramite rumore controllabile. Un'analisi comparativa delle loro caratteristiche tecniche è presentata nella Tabella 3.

Tipo di tecnologiaPrincipi fondamentaliSolidità della privacy (ε valore)Complessità di calcoloAdattabilità degli scenari finanziari
Privacy differenzialeI singoli contributi al set di dati sono indistinguibili aggiungendo rumoreε=1-5 (valore raccomandato per scenari finanziari)O (n) (n è la dimensione del campione)High, adatto a tutto il processo di addestramento del modello, può essere integrato senza soluzione di continuità con l'apprendimento federato
Calcolatura multi-party sicuraPiù partecipanti collaborano per calcolare senza divulgare risultati intermediSicurezza teorica dell'informazioneO (n²) (scenario federale verticale)Sì, è adatto per il calcolo di giunti caratteristici sensibili, ma richiede troppo tempo in scenari di campione di grandi dimensioni
Crittografia omomorfaI dati criptati vengono calcolati direttamente e il risultato corretto viene ottenuto dopo la decrittazioneSicurità computazionaleO (n³) (basato sulla crittografia a reticolo)Basso, adatto solo per la trasmissione di parametri su piccola scala, milioni di campioni di tempo di calcolo dello scenario superiore a 24 ore

Tabella 3: Confronto delle caratteristiche della tecnologia di protezione della privacy.

Nelle applicazioni finanziarie, la privacy differenziale è diventata la scelta principale grazie al suo "controllo dell'equilibrio effetto privacy". Dwork, C.17 propose la definizione classica (ε, δ)-DP, che fornisce uno standard quantitativo per la protezione della privacy. La formula di base è la seguente:

Equazione 3(1)

Qui M Come algoritmo di protezione della privacy, D e D sono un insieme di dati adiacente (solo una differenza campionaria), budget per la privacy (più piccola è la protezione della privacy, più forte), r budget per la privacy (minore è la protezione della privacy, più forte) δ La probabilità di guasto (di solito presa 10-5).

Abadi, M. et al.18 hanno sviluppato la Differential Privacy Stocastic Gradient Descent (DP-SGD), utilizzando clipping di gradiente e iniezione di rumore per ridurre la perdita di privacy del modello di rischio creditizio sotto l'8%. Il calcolo sicuro multi-parte (SMC) e la crittografia omomorfa sono impiegati principalmente per l'elaborazione sensibile. Ad esempio, Bogetoft, P. et al.19 hanno applicato SMC al punteggio creditizio cross-bank, assicurando che fossero accessibili solo i punteggi finali. Perri, L.2 propose un algoritmo di crittografia completamente omomorfa per l'aggregazione sicura dei parametri, anche se l'elevata complessità computazionale limita la sua applicazione all'addestramento su piccola scala tra banche di medie dimensioni.

I modelli di controllo del rischio IA si sono evoluti da architetture centralizzate tradizionali ad architetture distribuite, con due paradigmi che mostrano differenze significative nella dipendenza dai dati, nelle prestazioni e nei costi di conformità. I modelli centralizzati includono Gradient Boosting Trees (GBDT) e modelli di deep learning. L'algoritmo GBDT proposto da Friedman, J., Hastie, T. Tibshirani, R.21 migliora la precisione della previsione del rischio attraverso l'integrazione multi-albero, raggiungendo un AUC-ROC di 0,93 negli scenari di credito personale. Tuttavia, richiede la raccolta completa dei dati dei clienti, con rischi di violazioni dei dati e sfide di conformità. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 hanno sviluppato un modello di controllo del rischio basato su trasformatori che migliora i tassi di rilevamento delle frodi del 15%, ma la dimensione dei parametri supera i 10 GB. Il paradigma distribuito include approcci di condivisione dei parametri e condivisione delle caratteristiche. La condivisione dei parametri (ad esempio, FedAvg) aggrega i parametri locali ma ha difficoltà con le caratteristiche Non-IID: AUC-ROC è sceso da 0,89 a 0,82 mentre le differenze di tasso di default sono aumentate dallo 0,5% al 3,5%. La condivisione delle funzionalità (ad esempio, SecureBoost) consente la collaborazione verticale ma richiede un allineamento preciso, con le prestazioni che crollano del 20% quando gli errori superano il 5%.

Il nucleo dell'apprendimento federato è consentire la formazione collaborativa multiistituzionale senza il trasferimento di dati grezzi. Questo quadro definisce i partecipanti, il processo formativo e la funzione obiettiva. In questo studio, il sistema è composto da nodi istituzionali Kfinancial (indicati come P1, P2, ...,P K) e da un coordinatore C. Ogni istituzioneP K possiede un dataset Equazione 10locale , Xk,i∈Rd , che sono i vettori di caratteristiche clienti yk,i∈{0,1}, per le etichette di rischio (0 è normale, 1 è defaultfraud), dimensione locale del campione, scala Equazione 13dati completa. La formazione segue un processo di "iterazione locale-aggregazione globale": i) Inizializzazione: Il coordinatore genera parametri globali iniziali θ0 e li distribuisce a tutte le istituzioni; ii) Iterazione locale: nel ciclo di formazione, l'istituzioneP K si basa su dati locali e parametri globali attuali θt, minimizzando la funzione di perdita locale tramite discesa gradiente, ottenendo i parametri locali aggiornati θt,k, cioè:

Equazione 18(2)

Dove n è il tasso di apprendimento e ∇θLkt) è il gradiente della perdita locale, θt è il gradiente della perdita locale, θt; iii) Aggregazione globale: L'istituzione cripta e carica i parametri locali al coordinatore, che genera nuovi parametri globali θt+1 tramite aggregazione ponderata per dimensione del campione:

Equazione 22(3)

iv) Condizione finale: Ripetere i passaggi 2-3 finché le prestazioni del modello globale sul set di validazione non migliorano per i round successivi, Emettere in uscita il modello finale. θ* = θT. Date le caratteristiche di distribuzione identica non indipendente (Non-IID) dei dati finanziari, è necessario estendere le assunzioni della media federata tradizionale (FedAvgP k). Questo studio utilizza le due dimensioni di "eterogeneità della distribuzione delle etichette" e "eterogeneità della distribuzione delle caratteristiche" per caratterizzare il Non-IID: Definiamo la proporzione di istanze positive (eventi predefiniti) nelle istituzioni come:

Equazione 24(4)

Definisci il coefficiente di isomorfismo del tag ; Sia la differenza media delle caratteristiche dell'insieme , Quando α>0,03 e quando, si determina che si tratta di uno scenario Non-IID alto.

A seconda dell'abilità e del bersaglio dell'attaccante, gli scenari di minaccia sono suddivisi in tre categorie, come mostrato nella Tabella 4

Tipo di minacciaIdentità dell'aggressoreSacco da boxeMezzi tipici
Un attacco di semi-veritàIstituzioni/coordinatori partecipantiInferire le caratteristiche dei clienti di altre istituzioniAttacchi a inversione del gradiente e ragionamento dei membri basati sui parametri del modello
Attacco ostileIstituzioni malevoleModello globale di inquinamentoCarica falsi gradienti e modelli velenosi
Attacco esternoTerzi non autorizzatiParametri/caratteristiche di rubo durante il trasportoAttacchi intermedi, intercettazione dei collegamenti di comunicazione

Tabella 4: Classificazione del sistema finanziario con modelli di minaccia.

Utilizzando (ε,δ) -Differential Privacy (Differential Privacy, DP) come standard fondamentale di protezione della privacy, la sua essenza è aggiungere rumore affinché l'influenza di "se il set di dati contiene un campione" sull'output del modello possa essere ignorata. La definizione formale è la seguente: Per algoritmi di apprendimento federato M, se per due dataset adiacenti e che differiscono solo di un campione (DΔD' = 1), così come per qualsiasi insieme S⊆Range(M) di output, soddisfa:

Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)

Allora si chiama (ε,δ)-DP soddisfatto. Uno è il "budget per la privacy" (più piccola è la protezione della privacy, più è forte, e di solito si prende in considerazione lo scenario finanziario), δ per la "probabilità di fallimento" (generalmente δ≤10-5 per assicurarsi che eventi a bassa probabilità non influenzino la privacy e la sicurezza). Per adattarsi alle caratteristiche di iterazione multi-round dell'addestramento federato, il consumo totale di privacy viene calcolato utilizzando il teorema di combinazione della "privacy differenziale di Renyi" (RDP). Sia che il budget per la privacy di ogni ciclo di addestramento sia εt, allora il budget totale per la privacy dopo l'allenamento del ciclo soddisfa:

Equazione 32(6)

Questo teorema fornisce una base teorica per la calibrazione adattiva del rumore allocando dinamicamente il budget per la privacy per ogni round.

FedRisk impiega un rigoroso framework di privacy (DP) differenziale (ε, δ), che alloca dinamicamente i budget sulla privacy tramite il teorema di composizione di Rényi DP (RDP). Definisce la sensibilità globale Δf come il massimo cambiamento dei parametri del modello in norma L1 indotto da dataset adiacenti (che differiscono per un singolo campione), con la calibrazione del rumore Laplace consapevole della varianza (coefficiente di rumore κ_t proporzionale alle fluttuazioni della distribuzione dei dati). Sotto il vincolo del budget totale sulla privacy ε=5 (rispetto delle soglie di conformità GDPR), RDP converte il consumo di privacy dell'addestramento multi-round in (ε, δ)-DP (δ=10⁻⁵), bilanciando la forza della protezione e i risultati empirici dell'utilità del modello dimostrano che ciò sopprime l'AUC dell'attacco di inferenza del membro a 0,58 mantenendo la previsione del rischio AUC-ROC a 0,912.

L'ottimizzazione dei modelli di controllo del rischio finanziario deve soddisfare contemporaneamente tre requisiti normativi: "accuratezza predittiva", "protezione della privacy" e "equità". Le funzioni di ottimizzazione tradizionali che mirano esclusivamente alla minimizzazione delle perdite non sono più applicabili. È necessario istituire un quadro di ottimizzazione multi-obiettivo per trasformare i vincoli normativi in termini di regolarizzazione quantificabili. Per gli scenari di classificazione binaria (predefinito/normale), la perdita logaritmica (LogLoss) viene adottata come funzione base di perdita per misurare la deviazione tra probabilità previste dal modello e etichette effettive, definita come:

Equazione 33(13)

Dove pk,i = σ(θ; xk,i) è la probabilità predefinita prevista del campione (x k,i,i,y k,i) per il modello, σ(⋅) è la funzione di attivazione Sigmoide.

I requisiti del GDPR, della Legge sulla Protezione delle Informazioni Personali e di altri regolamenti sono trasformati in tre tipi di termini di regolarizzazione, che vengono combinati con la funzione di perdita di base per formare l'obiettivo finale di ottimizzazione:

Equazione 37(14)

La definizione e la funzione di ciascun termine di regolarizzazione sono le seguenti: i) Vincoli di privacy: In base al costo di aggiunta del rumore della privacy differenziale, si discute l'influenza della protezione quantitativa della privacy sull'accuratezza del modello. Sia la sensibilità globale dei parametri Δ del modello (cioè il cambiamento massimo dei parametri causato da insiemi di dati adiacenti), allora:

Equazione 39(15)

Questo termine garantisce che l'intensità del rumore aggiuntiva corrisponda al budget per la privacy ed evita un eccessivo sacrificio della precisione del modello. II) Vincolo di equità: In considerazione dei requisiti "anti-discriminazione" previsti dalla Legge sulla Protezione delle Informazioni Personali, il bias di previsione dei diversi gruppi è limitato. Prendiamo come esempio la "parità demografica" (DemographicParity), sia il tasso di previsione g positivo dell'insieme Equazione 41, allora:

Equazione 210 (16)

Questo termine minimizza la differenza nel tasso di previsione tra gruppi diversi ed evita la discriminazione dei modelli. III) Vincoli di robustezza: In risposta ai requisiti di "capacità anti-interferenza del modello" in Basilea III, assicurarsi che piccole perturbazioni dei dati non influenzino significativamente l'output del modello. Aggiungendo il campione avversario Δx perturbazioni (soddisfacendo |Δx|≤γ), la ricerca definisce così:

Equazione 45(17)

La robustezza del modello di potenziamento a termine ai dati anomali è migliorata e il rischio di errori di valutazione è ridotti. In questa formula, è il coefficiente di regolarizzazione, determinato tramite validazione incrociata (in questo studio λ1=0,01,λ2=0,05,λ3=0,02). Garantire un equilibrio tra i tre obiettivi regolatori e l'accuratezza della previsione.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Architettura di sistema

Mesh dati interistituzionale e livello semantico

Per affrontare l'eterogeneità dei dati tra istituzioni, la ricerca costruisce un'architettura Data Mesh tramite la partizionazione dei nodi guidata dal dominio. Ogni istituto finanziario opera come un nodo indipendente del dominio dei dati, mantenendo i diritti di proprietà e controllo, con il livello semantico che consente la comprensione e l'interazione unificata dei dati. Il livello semantico basato su ontologie stabilisce un modello unificato di controllo del rischio finanziario, definendo le entità centrali, gli attributidella map f e le relazioni con le entità. Le regole specifiche di mappatura semantica sono dettagliate nella Tabella 5. Per i campi specifici dell'istituzione, le conversioni standardizzate vengono ottenute tramite funzioni di mappatura semantica:

Equazione 48(18)

Entità kernelIl nome di campo A dell'istituzioneNome del campo B nell'istituzioneNome di campo uniforme di livello semanticoTipo di datiRegole standardizzate
ClienteValutazione premium dei clienti (1-5)Livelli VIP per i clienti (bronzo a diamante)Punteggio creditizio del cliente (1-5)InteroBronzo→1, Argento→2, Oro→3, Platino→4, Diamante→5
AttivitàImporto della transazione (diecimila yuan)Importo della transazione (yuan)Importo della transazione (yuan)Numero fluttuanteIl valore del campo A nell'istituzione è di 10.000 volte
Domanda di creditoQuota di candidati (rapporto crediti)Importo previsto del prestitoImporto del prestito richiedente (yuan)Numero fluttuanteIstituzione A: Rapporto totale di crediti × importo della domanda; Istituzione B: mappatura diretta

Tabella 5: Regole semantiche fondamentali per la mappatura delle entità nel campo del controllo del rischio finanziario.

Qui è xi,j il valore specifico i-esimo del campo dell'istituzione j, min(x j) e max(x j) sono rispettivamente i valori minimi e massimi del campo all'interno dell'istituzione, Uj e Lj definiscono i limiti superiori e inferiori dell'intervallo di valori unificato per questo campo a livello semantico.

Registro globale di modelli basati su blockchain e traccia di audit

Per risolvere problemi di gestione caotica delle versioni dei modelli e processi di formazione non rintracciabili nell'apprendimento federato, la tecnologia blockchain viene impiegata per istituire un registro globale dei modelli e un sistema di audit - tracciamento. Utilizzando un'architettura blockchain a consorzio, i nodi partecipanti includono istituzioni finanziarie, coordinatori federati e enti regolatori, garantendo l'immutabilità dei dati e il consensomultipartito 23. Il registro globale dei modelli memorizza i metadati principali dei modelli, inclusi numeri di versione, round di addestramentoH v, elenchi delle istituzioni partecipanti, parametri strutturali e metriche di prestazione. Questi metadati sono memorizzati utilizzando una struttura ad albero di Merkle, con ogni versione del modello corrispondente a un valore hash univoco:

Equazione 57(19)

Qui v è il numero di versione del modello, T il numero totale di round di addestramento, S è la collezione di istituzioni che partecipano all'addestramento, IDi è l'identificatore unico di un'istituzione i, θv è il vettore dei parametri del modello per la versione v, e AUCv è il valore AUC-ROC di questa versione del modello mostrata.

Pipeline federata di ingegneria delle caratteristiche

Allineamento sicuro delle entità e armonizzazione degli schemi

L'ingegneria delle caratteristiche rappresenta il componente centrale della collaborazione tra istituzioni sui dati, richiedendo un'estrazione, un allineamento e un'aggregazione efficaci delle funzionalità garantendo al contempo la privacy dei dati. Questo studio progetta una pipeline completa che comprende l'allineamento sicuro delle entità, la coordinazione degli schemi e l'aggregazione differenziale di grafi di transazioni integrati nella privacy, per affrontare sia l'eterogeneità delle caratteristiche tra istituzioni sia i rischi di fuga di privacy24. L'allineamento tra entità istituzionali è essenziale per raggiungere la collaborazione con le funzionalità. Tuttavia, trasmettere direttamente gli identificatori dei clienti comprometterebbe la privacy. Pertanto, la ricerca adotta un metodo di allineamento delle entità che preserva la privacy che combina crittografia omomorfa (HE) con tecnologia di hashing sensibile alla località (LSH). Le istituzioni pre-elaborano gli identificatori dei clienti utilizzando le funzioni hash SHA-256 per generare identificatori preliminari. Questi identificatori vengono poi mappati nello stesso "bucket" tramite LSH per ridurre i calcoli di crittografia successivi. Gli identificatori all'interno dello stesso bucket subiscono una crittografia omomorfa Paillier. Gli identificatori criptati vengono caricati al coordinatore federato, che ottiene l'allineamento delle entità confrontando la somiglianza degli identificatori criptati usando la cosenosimilezza.

Equazione 64(20)

Quando la somiglianza è superiore alla soglia preimpostata (in questo studio, viene considerata τ=0,95), si determina che si tratta della stessa entità e viene generato un ID unificato tra le istituzioni per ottenere un allineamento sicuro delle entità.

Aggregazione differenzialmente privata degli embeddings nei grafi delle transazioni

I dati delle transazioni finanziarie presentano caratteristiche distinte a struttura di grafo (con i clienti come nodi e le transazioni come archi). L'incorporamento dei graphi delle transazioni cattura efficacemente i modelli di transazione delle parti correlate dei clienti, fornendo funzionalità critiche per i modelli di controllo del rischio. Tuttavia, l'aggregazione diretta di embeddings transistituzionali Gi=(Vi,E i)ViiEi i i,v∈Rdd di transazioni può far trapelare informazioni relative alle transazioni dei clienti. Pertanto, viene introdotta la tecnologia DifferentialPrivacy (DP) per ottenere un'aggregazione preservativa della privacy degli embedding nei grafi delle transazioni. Ogni istituzione costruisce localmente un grafo delle transazioni, dove rappresenta l'insieme dei nodi client dell'istituzione e rappresenta l'insieme degli archi delle transazioni (pesi degli archi uguali agli importi delle transazioni). L'algoritmo GraphSAGE viene utilizzato per generare embedding di nodi (con dimensioni di embedding a 256 dimensioni in questo studio). Per soddisfare i requisiti di privacy differenziati, il rumore laplaciano viene aggiunto agli embedding locali:

Equazione 67(21)

Qui ΔG Sensibilità globale dell'algoritmo GraphSAGE (stimata tramite esperimento in questo studio ΔG=0,8), per il budget locale sulla privacy dell'agenzia,

Equazione 70(22)

Per il budget totale della privacy del sistema, questo studio prende εtotale = 1,5). Il coordinatore aggrega l'incorporamento del rumore di ogni istituzione utilizzando una strategia Equazione 72 di media ponderata, con pesi basati sulla percentuale di clienti di ciascuna istituzione:

Equazione 73(23)

Il grafico globale aggregato delle transazioni Equazione 200 viene incorporato e inviato a ciascuna istituzione. Come caratteristica chiave del modello di controllo del rischio, non solo mantiene le informazioni di correlazione tra le transazioni istituzionali, ma protegge anche la privacy dei clienti attraverso la privacy differenziata.

Equazione 201 (24)

Modello ibrido di rischio di IA

Sottomodelli locali: Gradient boosting con vincoli monotoni

I tradizionali modelli di controllo del rischio centralizzato con IA faticano ad adattarsi a scenari federati interistituzionali. Questo studio sviluppa un modello ibrido di rischio IA che combina "sottomodelli locali + modello di fusione globale", integrando l'alta interpretabilità degli Alberi di Aumento di Gradiente (GBDT) con l'adattabilità di Transformer a dati non indipendenti e identicamente distribuiti (NID). Viene introdotto un modulo di interpretazione per bilanciare le prestazioni del modello e la spiegabilità in ambienti federati. Ogni istituzione costruisce localmente sottomodelli GBDT, scelti per la loro forte capacità di adattamento strutturale dei dati e l'elevata interpretabilità - requisiti essenziali per le regolamentazioni sul controllo del rischio finanziario. Per evitare sovrafitting e conclusioni illogiche, durante la formazione GBDT vengono implementati vincoli monotoni, imponendo schemi monotoni di aumento o decrescente per caratteristiche chiave come il reddito dei clienti e i punteggi di credito. Il primo albero creato da GBTD è ht(x), e l'output del modello è:

Equazione 76(25)

Qui, η è il tasso di apprendimento (questo studio richiede η=0,1). Il vincolo monotono si realizza tramite regolarizzazione della funzione di perdita xj.

Aggiungi termine di vincolo:

Equazione 80(26)

Qui, x≺x' rappresenta che l'autovalore di x è minore dell'autovalore di x', e la funzione di perdita finale è:

Equazione 84(27)

Qui, l è la funzione di perdita logaritmica (utilizzata nello scenario binario di controllo del rischio yi∈{0,1}, che indica se il cliente non si sente in default). Equazione 87 è il termine di regolarizzazione della complessità per l'albero, λ e γ sono il coefficiente di regolarizzazione (Questo studio è stato condotto tramite λ=0,01 γ=0,5 di validazione incrociata, ni è il numero di campioni locali per l'istituzione i,T è il numero di alberi (Questo studio ha preso T=100).

Fusione globale: trasformatore basato sull'attenzione per l'adattamento non-IID

I dati interistituzionali mostrano caratteristiche significative di distribuzione Non-IID. Gli algoritmi FedAvg tradizionali, che si limitano a mediare i parametri locali del modello, faticano ad adattarsi ai dati Non-IID. Per affrontare questo problema, la ricerca introduce un'attenzione a pi(x)=σ(Fi(x))σFi(x)ia i-based su un modello di Transformer per la fusione intelligente di sottomodelli locali. Il modello di fusione globale prende in input le probabilità di output provenienti dal sottomodello locale di ciascuna istituzione (output della funzione sigmoide dai modelli GBDT istituzionali). L'architettura Transformer comprende un encoder e uno strato di attenzione, in cui il livello di attenzione calcola i pesi di attenzione dagli output di diverse istituzioni per ottenere un peso adattivo. I pesi di attenzione vengono calcolati usando l'Attenzione Scaled Scaled Product-Product:

Equazione 94(28)

Qui, q è il vettore di query (generato dalle caratteristiche medie di rischio dei campioni globali), Equazione 96 è il vettore chiave dell'istituzione i, dk è la dimensione del vettore chiave (in questo studiod k=64), n è il numero di agenzie che partecipano alla federazione.

La probabilità finale di output del modello globale è:

Equazione 101(29)

Attraverso il meccanismo di attenzione, il modello globale può attribuire automaticamente un peso maggiore alle istituzioni con alta qualità dei dati e previsione accurata del rischio, migliorando l'adattabilità ai dati non-IID.

Modulo di spiegabilità: SHAP sugli alberi federati + generatore controfattuale

I modelli di controllo del rischio finanziario devono mantenere l'interpretabilità per soddisfare i requisiti normativi e proteggere il 'diritto di sapere dei clienti. Per affrontare questo problema, la ricerca sviluppa un modulo di interpretabilità che combina generatori federati SHAP+ controfattuali. Per i sottomodelli locali GBDT, la ricerca utilizza valori SHAP per misurare l'importanza delle caratteristiche, che SiR N i×mquantifica il contributo di ciascuna caratteristica agli esiti previsionali. Negli scenari federati, trasmettere direttamente i valori locali di SHAP potrebbe compromettere le informazioni sulla distribuzione delle caratteristiche. Pertanto, la ricerca implementa una strategia di aggregazione sicura in cui ogni istituzione calcola localmente la matrice dei valori SHAP (per il conteggio delle caratteristiche), applica rumore differenziale sulla privacy ai valori SHAP e li carica al coordinatore federato. Il coordinatore poi calcola i valori globali di SHAP:

Equazione 103(30)

Qui, Si' è la matrice dei valori SHAP dell'istituzione i, e wi è la proporzione della dimensione del campione delle istituzioni.

Inserisci l'attuale autovettore x del cliente e il rating di rischio target ytarget, l'output è un vettore di caratteristica antifattuale xcf, soddisfatto (la soglia θ diprobabilità target corrispondente al rating target risk). E |xcf-x|2 il minimo (cioè, il costo di aggiustamento più basso). La funzione di perdita del generatore di fatti è:

Equazione 110(31)

Qui α,β,γ sono i coefficienti di peso (in questo studio α=10,β=5,γ=1),LGAN La funzione di perdita avversaria viene utilizzata per GAN per garantire la razionalità e l'autenticità del vettore caratteristico controfattuale.

Livello di privacy e sicurezza

Aggregazione sicura con condivisione additiva di segreti

Nell'apprendimento federato, la trasmissione e l'aggregazione dei parametri locali del modello sono un anello chiave nella fuga di privacy. La tecnologia AdditiveSecretSharing (ASS) viene adottata per ottenere aggregazione sicura ed evitare l'acquisizione diretta dei parametri locali del modello di ciascuna organizzazione da parte del coordinatore. Il processo specifico è il seguente: i) Ogni istituzione dividerà i parametri del modello locale in quote segrete θ i,1,θi,2,...,θ i,n , soddisfacenti Equazione 118, ecco il numero delle istituzioni partecipanti; ii) L'istituzione i invia la quota θi,k all'istituzione (k≠i), mantenendo la propria quota θi,i; iii) Ogni istituzione k raccoglie le azioni inviate da tutte le altre istituzioni θ1,k,θ 2,k,...,θn,k , e somma con la quota θk,k trattenuta da sé stessa, ottenendo la somma parziale ; iv) Tutte le istituzionicaricheranno e condivideranno parte di esso con il coordinatore, il coordinatore calcola i risultati Equazione 126dell'aggregazione globale dei parametri. Attraverso la condivisione additiva dei segreti, il coordinatore può ottenere solo parametri aggregati globali e non può dedurre n-1ttt=⌈n/2⌉ dedurre i parametri locali di nessuna individuale istituzione. Anche la collusione tra più istituzioni non può recuperare parametri da altre, garantendo privacy e sicurezza durante la trasmissione dei parametri. Per affrontare la perdita di quote causata dalle disconnessioni istituzionali, viene introdotto il meccanismo di condivisione segreta di Shamir come backup. Ogni quota è ulteriormente suddivisa in frammenti. Raccogliendo qualsiasi frammento, la quota completa può essere ripristinata, migliorando così la robustezza del sistema.

Calibrazione adattiva del rumore secondo la pianificazione del budget (ε, δ) del DP

La sfida centrale della privacy differenziale risiede nell'equilibrare la forza della protezione della privacy con le prestazioni del modello. I metodi tradizionali di aggiunta a rumore fisso faticano ad adattarsi a scenari in cui le distribuzioni dei dati cambiano dinamicamente durante l'addestramento federato. Questo studio progetta un meccanismo adattivo di calibrazione del rumore basato su (ε,δ)-DP, combinato con una strategia di pianificazione del budget per la privacy, per ottenere una regolazione dinamica dell'intensità del rumore. Definire il budget totale per la privacy del sistema come (Questo studio prende δtotal=10-5, rispetta i requisiti GDPR per il rischio di privacy), adottare la strategia di pianificazione del budget segmentato, il budget totale è assegnato tramite {ε 1.ε 2,...,εT} ciclo di formazione come segue, soddisfatto:

Equazione 130(32)

In ogni ciclo di addestramento, l'intensità del rumore viene regolata dinamicamente in base alle caratteristiche di distribuzione dei dati locali. Assumendo che la varianza locale delle caratteristiche dati del t-esimo ciclo di istituzione sia Equazione 132, Definire il coefficiente di aggiustamento del rumore αi,t:

Equazione 134(33)

Quando αi,t≥0,8 (la distribuzione dei dati è stabile), usando una bassa intensità Equazione 136di rumore ; Quando αi,t<0,8 (la distribuzione dei dati fluttua), aumenta l'intensità del rumore . Tra queste, c'è la sensibilità globale dei parametri del modello (questo studio garantisce tramite il gradient clipping).

Protocollo di addestramento efficiente nella comunicazione

Aggiornamenti asincroni del client con controllo della stagnazione

L'apprendimento federato interistituzionale affronta sfide come un'elevata latenza nelle comunicazioni e un significativo consumo di banda (in particolare per le piccole e medie istituzioni finanziarie con risorse di rete limitate). Questo studio progetta un protocollo efficiente di addestramento alla comunicazione che incorpora aggiornamenti asincroni del cliente, compressione del gradiente e feedback sugli errori per ridurre i costi di comunicazione e migliorare la scalabilità delsistema 25. I metodi tradizionali di addestramento federato sincrono come FedAvg richiedono di attendere che tutti i client completino l'addestramento locale prima dell'aggregazione dei parametri, con conseguente lunghi cicli di addestramento. Il meccanismo asincrono di aggiornamento client consente ai client di completare autonomamente l'addestramento locale e caricare immediatamente i parametri. Ricevuti questi parametri, il coordinatore federato aggiorna il modello globale in tempo reale senza attendere altri clienti. Questo risolve il problema della vecchia scadenza del modello nell'addestramento asincrono. Introducendo la strategia di controllo dello stagno, si definisce il valore di stagnazione per il cliente ,(Per tattuale il round di addestramento globale corrente, tlast_update Il round in cui il client ha ottenuto l'ultima volta il modello globale). Quando (Smax è la massima stagnazione ammessa, questo studio prende smax=5). Il cliente partecipa normalmente all'addestramento; Almassimo > quel momento, il client deve scaricare nuovamente l'ultimo modello globale prima dell'addestramento locale. La configurazione hardware consiste in CPU Intel Xeon E5-2678 v3 (12 core, 2,5GHz) abbinate a GPU NVIDIA Tesla V100 (16GB di VRAM) e 64GB di memoria DDR4 per nodo per gestire in modo efficiente i carichi di lavoro di addestramento distribuiti. Per l'inizializzazione software, comandi PySyft come hook = sy. TorchHook (torcia)andvirtual_worker = sy. VirtualWorker(hook, id="client1") sono usati per stabilire connessioni federate sicure, mentre federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) consente il caricamento federato dei dati tra i partecipanti. La mappatura semantica trasforma le caratteristiche finanziarie tra le istituzioni—ad esempio, convertendo gli importi delle transazioni da USD a CNY usando una formula di tasso di cambio dinamico: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), dove il tasso di cambio viene aggiornato periodicamente tramite API. Per aumentare dataset sbilanciati, CopulaGAN genera campioni antagotici sintetici con un frammento di codice simile a quello dell'importazione sdv.tabular CopulaGAN; sintetizzatore = CopulaGAN(epoche=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), preservando le proprietà statistiche dei dati originali. L'addestramento locale GBDT impone vincoli monotoni (ad esempio, assicurando che "credit_score" corrisponda positivamente a "approval_probability") viaparams = {"monotonic_constraints": (1, 0, -1)}in LightGBM, mentre la fusione Transformer è implementata in PyTorch con strati di attenzione multi-testa: self.attention = nn. Attenzione multitesta (embed_dim=64, num_heads=4); attn_output, _ = self.attention(interroga, chiave, valore, key_padding_mask=padding_mask), seguita dalla normalizzazione dello strato e dalle connessioni residue per la stabilità. La privacy differenziale inietta rumore Laplace scalato in modo L1 sensibilità (Δf) e budget di privacy (ε)—ad esempio, aggiungendo rumore campionato da np.random.laplace(loc=0, scale=Δf/ε) dove Δf=1.2 e ε=0.5 a gradienti prima dell'aggregazione. I vincoli di equità vengono applicati dopo l'addestramento riponderando i campioni inversamente proporzionali alla loro prevalenza di gruppo (sample_weight = 1 / group_counts[y_train]) per mitigare le violazioni della parità demografica. Allo stesso tempo, la strategia di aggregazione pesata viene utilizzata per regolare il peso dei parametri del cliente in base al valore di stagnazione:

Equazione 143(34)

Dove λ=0,1 è il coefficiente di penalità di stagnazione; Più grande è la stantiezza, minore è il peso, riducendo così l'impatto dei parametri obsoleti sul modello globale.

Compressione del gradiente e accumulo di errore-feedback

I parametri del modello (in particolare i pesi di attenzione nei modelli globali di fusione Transformer) hanno un'elevata complessità dimensionale. La trasmissione diretta consumerebbe una larghezza di banda eccessiva, rendendo necessarie tecniche di compressione gradiente per ridurreil trasferimento dati a 26. Questo studio integra la sparsificazione Top-K con la compressione di quantizzazione, seguendo questi passaggi specifici: i) Scarso Top-K: Per il modello locale ∇θi gradiente, Seleziona l'elemento gradiente K% con il valore assoluto più grande da mantenere, K Gli altri elementi sono zero, Il valore viene regolato dinamicamente in base alla condizione di larghezza di banda (quando la larghezza di banda è sufficiente K=30, quando la larghezza di banda è limitata K=10); ii) Compressione di quantizzazione: Gli elementi del gradiente trattenuto vengono quantizzati da virgola mobile a 32 bit a interi a 8 bit. La formula di quantizzazione è:

Equazione 150(35)

  

iii) Feedback dell'errore: Memorizza il gradiente scartato Δ∇=∇θi-∇θierrore compresso durante la compressione lato client, Nel calcolo successivo del gradiente, l'errore viene accumulato nel nuovo gradiente, avvicinandosi, Equazione 202 , Compensando le perdite di compressione. Gli effetti della compressione del gradiente e del feedback di errore sono mostrati nella Tabella 6, In, condizioni di quantizzazione a bit 8 K=20%. Il rapporto di compressione raggiunge 15:1 (volume dati originale/volume dati compresso), e tramite feedback di errore, l'AUC-ROC del modello diminuisce solo dello 0,5%-1,0%, realizzando l'equilibrio tra costo di comunicazione e prestazioni delmodello 27.

Strategie di compressioneRapporto di riduzioneConsumo di larghezza di banda di upload (MB/round)Tasso di declino AUC-ROCTasso di riduzione del tempo di allenamento
Non compresso (virgola mobile a 32 bit)1:011280.00%0.00%
Quantizzazione massima sparsa al 30% + 16 bit6.7:119.10.30%35.20%
Sparso top 20% + quantizzazione a 8 bit15:018.50.80%58.70%
Scarno top 10% + quantizzazione a 8 bit30:01:004.32.10%72.10%

Tabella 6: Confronto delle prestazioni delle strategie di compressione gradiente.

Regolarizzazione consapevole della equità

I modelli di controllo del rischio finanziario devono evitare discriminazioni contro gruppi specifici e rispettare i requisiti normativi, tra cui la Legge sulla Protezione delle Informazioni Personali e la Legge sulla Giusta Segnalazione del Credito. Questo studio introduce un meccanismo di regolarizzazione consapevole dell'equità per limitare i bias di previsione inter-gruppo durante l'addestramento del modello, garantendo l'equità del modello. Sono definiti due indicatori fondamentali di equità: i) Parità demografica (DP): Il tasso di previsione positiva è uguale per diversi gruppi, approccio, Equazione 154, tra questi, c'è l'identificatore di gruppo ; ii) Pari opportunità (EO): Il tasso di vere positività è uguale tra i gruppi, approccio Equazione 155. Aggiungere termini di regolarizzazione della equità alla funzione di perdita del modello ibrido di rischio IA e imporre vincoli rispettivamente sul sottomodello locale GBDT e sul modello globale Transformer: iii) Vincoli di equità del modello locale:

Equazione 156

Qui PR(g=A) è il tasso di previsione positivo per il gruppo g, λ, ed è il coefficiente di regolarizzazione per la correttezza.

iv) Vincolo globale di equità del modello: Aggiungi l'aggiustamento del peso di equità del gruppo allo strato di attenzione del Transformer, l'output del modello per i gruppi vulnerabili ag=a base×(1+β⋅Δslea) riceve un peso di attenzione più alto, qui,Δ ingiusto rappresenta il bias di equità tra questo gruppo e il gruppo dominante (Δslea=PR (gruppo dominante)-PR (gruppi vulnerabili)); λEO è il coefficiente di compensazione della deviazione. L'effetto della regolarizzazione della percezione della equità viene valutato tramite ΔDP (deviazione DP), ΔEO (deviazione EO) e errore di calibrazione di gruppo.

Dashboard di governance e conformità modello

Monitoraggio del bias in tempo reale

Per soddisfare i requisiti della regolamentazione finanziaria sulla gestione del ciclo di vita dei modelli, la ricerca ha sviluppato un cruscotto di governance e conformità del modello che integra API di monitoraggio delle deviazioni in tempo reale e reportistica regolamentare, consentendo una supervisione e tracciabilità di tutto il processo durante l'addestramento, la distribuzione e l'iterazione del modello. Il modulo di monitoraggio della deviazione in tempo reale consente un monitoraggio dinamico dell'equità e delle prestazioni del modello attraverso le seguenti dimensioni: i) Monitoraggio delle deviazioni di gruppo: Categorizzazione dei gruppi per genere del cliente, età, regione, livello di reddito, ecc., calcolando PR, TPR e FPR (Tasso di Falsi Positivi) per ogni gruppo ogni ora. Gli allerti di deviazione vengono attivati quando le differenze PR tra gruppi superano 0,08 o le differenze TPR superano 0,05; ii) Monitoraggio della deriva delle prestazioni: Calcolo continuo di metriche come AUC-ROC e PR-AUC. Quando queste metriche diminuiscono di oltre il 2% consecutivamente in tre ore, si determina come deriva delle prestazioni, avviando automaticamente il processo di riaddestramento del modello. iii) Monitoraggio della conformità alla privacy: Registra il consumo del budget privacy e l'aggiunta di rumore εintensità totale/10 di ogni ciclo di addestramento. Quando il consumo ε di un singolo colpo supera, si interrompe l'addestramento e si regola la strategia del rumore. iv) Il monitoraggio dei dati viene visualizzato tramite cruscotti visivi, permettendo ai regolatori e alle istituzioni partecipanti di visualizzarli in tempo reale e realizzando una gestione trasparente dei rischi modelli.

API di reportistica normativa

Per semplificare il processo di rendicontazione regolamentare, è stata progettata un'API standardizzata per la segnalazione normativa a supporto della generazione automatica di report conformi a regolamenti come GDPR, CCPA e la Legge cinese sulla protezione delle informazioni personali. Le funzioni principali includono: i) Data Source Compliance Report: Aggrega automaticamente tipi di dati, volumi e stato di autorizzazione delle istituzioni partecipanti per verificare la conformità al principio del "minimo necessario"; ii) Rapporto di Conformità alla Formazione Modello: Documenta le iterazioni di formazione, le istituzioni partecipanti, le misure di protezione della privacy e le metriche di equità per generare un rapporto di tracciabilità della formazione modello; iii) Rapporto di conformità alla previsione del rischio: Mostra i modelli di distribuzione conformi alle normative delle previsioni dei modelli tra diversi gruppi e casi di spiegazione controfattuale per dimostrare la non discriminazione. L'API adotta uno stile di design RESTful, supportando output in formato JSON e XML. Le autorità regolatorie possono accedere direttamente ai dati dei report tramite interfacce API o impostare cicli automatici di reportistica per realizzare processi regolatori automatizzati e standardizzati. I modelli di rapporto sono conformi agli standard normativi del modello finanziario dell'Organizzazione Internazionale per la Normalizzazione (ISO), garantendo l'autorità e l'universalità dei rapporti.

Disegno sperimentale: Descrizione del dataset

Dati su carte di credito multiistituzionali e prestiti per PMI

I dati sperimentali provenivano da istituzioni finanziarie in Cina, coprendo tipi di dati come transazioni personali con carta di credito e registri di richiesta e gestione di prestiti per PMI. La tecnologia CopulaGAN è stata impiegata per sintetizzare e migliorare eventi fraudolenti rari, costruendo così un dataset sperimentale che combina autenticità e integrità. I dati reali utilizzati nell'esperimento includono due categorie principali: dati sulle transazioni personali con carta di credito e dati sui prestiti per PMI, per un totale di oltre 5 milioni di registrazioni che coprono da gennaio 2022 a dicembre 2023. I dati coprono quattro principali regioni economiche: Nord Cina, Cina orientale, Meridionale e Sud-ovest della Cina—per garantire la rappresentanza geografica e la diversità nella distribuzione dei campioni. I campi fondamentali e le caratteristiche statistiche dei dati istituzionali sono mostrati nella Tabella 7. Tra queste, le Istituzioni A e B sono banche commerciali nazionali con ampie basi di clienti che coprono tutte le fasce d'età; Le istituzioni C e D sono banche internet che servono principalmente i giovani (20-35 anni); Institution E è una società di finanziamento al consumo che mira agli utenti di mercati di livello inferiore, con una distribuzione dei dati che mostra caratteristiche significative Non-IID. Il dataset contiene 115.610 dati. Il dataset è fornito da istituzioni finanziarie che collaborano con università

Tipo di datiIstituzioneNumero di record (10.000)Numero di clienti (10.000)Nuclei di carattereTasso di frode in defaultCaratteristiche della distribuzione dei dati
Transazioni con carta di creditoA18085Tempo della transazione, importo, tipo di commerciante, posizione della transazione, se rubare la carta0.32%Le transazioni grandi rappresentano una percentuale elevata (> 5000 yuan)
Transazioni con carta di creditoB15072Numero di flusso delle transazioni, importo (USD/RMB), canale di pagamento, valutazione dei clienti0.28%Le transazioni transfrontaliere rappresentano il 15%
Transazioni con carta di creditoC12068Ora della transazione, importo, se installare, età del cliente, posizione del numero di cellulare0.45%Il piccolo trading ad alta frequenza (<1000 yuan rappresenta il 60%)
Prestiti per piccole e microimpreseD321.2Nome della società, importo del prestito, durata del credito, scala dei ricavi, importo delle tasse, se in ritardo2.80%I clienti manifatturieri rappresentano il 40%
Prestiti per piccole e microimpreseE180.8Data della domanda di prestito, importo previsto, tipo di attività, numero di dipendenti, record storico delle prestazioni3.50%I clienti del servizio rappresentano il 70%

Tabella 7: Caratteristiche statistiche del set di dati finanziari reali multi-istituzioni.

Per affrontare l'eterogeneità dei dati interistituzionali, l'esperimento ha rispettato rigorosamente le specifiche della griglia di dati e dei livelli semantici standardizzando i campi istituzionali: ad esempio, convertendo l'"importo della transazione (USD)" dell'Istituzione B in RMB usando il tasso di cambio della data della transazione e unificando il nome del campo in "importo della transazione (YUAN)"; convertendo l'"età del cliente" dell'Istituzione C (formato "1990-01-01") in un'età intera; e la mappatura della "scala di ricavi aziendali" dell'Istituzione D (classificata come "sotto 1 milione / 1-5 milioni / oltre 5 milioni") fino ai punti intermedi degli intervalli numerici (500.000, 3.000.000, 7.500.000), garantendo coerenza tra formato dei dati e significato semantico.

Aumento sintetico tramite CopulaGAN per eventi di frode rari

Negli scenari di controllo del rischio finanziario, i campioni di frode/default rappresentano tipicamente una proporzione estremamente bassa. L'uso diretto di tali dimensioni di campioni per l'addestramento del modello porterebbe a gravi problemi di squilibrio di classe, compromettendo le capacità di generalizzazione del modello. L'esperimento utilizza Copula GAN (una rete generativa antagionale basata sulle funzioni Copula) per sintetizzare dati aumentati in casi rari di frode. Questo metodo combina la capacità della funzione Copula di modellare distribuzioni dati ad alta dimensione con le capacità generative di GAN, permettendo la creazione di dati sintetici che si allineano con i modelli reali di frode evitando il problema del "collasso dei pattern" comunemente osservato nella generazione tradizionale di GAN.

Struttura del modello CopulaGAN

CopulaGAN è composto da tre parti: Generatore, Discriminatore e modulo di vincolo della distribuzione della Copula: (1) Generatore: L'ingresso è un vettore di rumore casuale z∼N(0,1) a 128 dimensioni, e produce un vettore caratteristico sintetico coerente con la dimensione reale del campione attraverso una rete completamente connessa a 3 strati (le dimensioni nascoste dello strato sono 256, 512, 256); (2) Discriminatore: L'input è campione reale o campione sintetico xsyn, e attraverso una rete completamente connessa a due livelli + funzione di attivazione sigmoide, si fornisce la probabilità che il campione sia dato reale; (3) Modulo di vincolo della distribuzione della copula: adattare la distribuzione congiunta dei campioni reali di frode tramite la funzione di Copula gaussiana (dove è il valore della funzione di distribuzione degli archi dell'ottava caratteristica di i), e aggiungere il vincolo della distanza di Copula nella perdita del generatore per garantire che la distribuzione congiunta dei campioni sintetici sia coerente con i campioni reali.

Equazione 165(36)

Migliorare la verifica dei processi ed effetti

Il processo di addestramento e miglioramento di CopulaGAN è il seguente: i) Preprocessing dei dati: estrarre campioni di frode/default (18.200 in totale) dai dati reali di varie istituzioni; Standardizzare le caratteristiche continue (x'=(x-μ)/σ); Le caratteristiche discrete sono codificate con calore unico; ii) Adattamento della copula: la funzione Copula gaussiana viene utilizzata per adattare la distribuzione congiunta dei campioni di frode preprocessati, calcolare la distribuzione degli archi Fiθ e i parametri della funzione Copula di ciascuna caratteristica; iii) Addestramento GAN: Il generatore e il discriminatore vengono addestrati alternativamente. La funzione di perdita del generatore è:

Equazione 168(37)

Qui, λ è il peso vincolante, e Distance (Csin, Creale) è la divergenza KL tra la distribuzione di Copola di campioni sintetici e la distribuzione di Copula di campioni reali; La funzione di perdita del discriminatore è la perdita binaria standard di entropia incrociata:

Equazione 170(38)

Dopo la convergenza del modello (con la precisione del discriminatore stabilizzata al 50%±5%), il generatore ha prodotto 50.000 campioni sintetici di frode. Questi venivano mappati allo spazio delle caratteristiche originale secondo specifiche semantiche e fusi con campioni reali per costruire un set di allenamento bilanciato. Per convalidare l'efficacia dei campioni sintetici, la ricerca li ha valutati utilizzando un test KS a due campioni e la visualizzazione della distribuzione delle caratteristiche. I risultati del test KS hanno mostrato che le differenze nelle distribuzioni delle caratteristiche tra campioni sintetici e reali erano tutte inferiori a 0,05 (statistica KS <0,05, p-value>0,05), indicando una buona coerenza distributiva. Il confronto della distribuzione delle caratteristiche ha dimostrato che i campioni sintetici potevano riprodurre accuratamente le caratteristiche di distribuzione dei campioni reali di frode, fornendo dati validi sufficienti per l'addestramento del modello come mostrato nella Figura 1.

Figura 1
Figura 1: Confronto della distribuzione delle caratteristiche tra campioni reali di frode e CopulaGAN Clicca qui per visualizzare una versione più grande di questa figura.

Metriche di valutazione

L'esperimento costruisce un sistema di valutazione multi-indice basato su quattro dimensioni fondamentali: prestazioni previsionali, protezione della privacy, equità ed efficienza della comunicazione per misurare in modo completo la performance completa del framework di apprendimento federato e del modello di controllo del rischio AI. La definizione, il metodo di calcolo e i criteri di valutazione di ogni dimensione sono mostrati nella Tabella 8.

Dimensioni della valutazioneNome dell'indiceDefinizione e metodo di calcoloCriterio di valutazione
Prestazioni stimateAUC-ROCL'area sotto la curva di lavoro caratteristica del soggetto misura la capacità del modello di distinguere tra esempi positivi (predefiniti/frodi) e negativiPiù alto è il valore, meglio è. L'AUC-ROC del modello eccellente è>0,9
PR-AUCL'area di richiamo di precisione sotto la curva, applicabile a dati sbilanciati, misura la prestazione di un modello in scenari in cui gli esempi positivi sono scarsiPiù alto è il valore, meglio è. Il PR-AUC di un modello eccellente è>0,8
Frazione di BrierErrore quadratico medio tra probabilità prevista e etichetta vera,B=1Ni=1N(pi-yi)2Più basso è il valore, meglio è. Il punteggio Brier di un modello eccellente è inferiore a 0,05
Tasso di falsi positivi (FPR)La proporzione di esempi negativi FPR=FPFP+TNchePiù basso è il valore, meglio è. Gli scenari finanziari di solito richiedono un FPR <1% (per evitare di rifiutare clienti validi)
Protezione della privacyε-Curva di consumo (curva ε)Registrare il tasso di consumo del budget accumulato per la privacy durante la formazione per riflettere la capacità dinamica di bilanciamento della protezione della privacyLa curva si sta stabilizzando e il ε totale è inferiore o uguale a 5 (in linea con i requisiti GDPR sul rischio della privacy)
Attacco di ragionamento dei membri AUC (MI-AUC)La capacità di un attaccante di dedurre se un campione appartiene al set di addestramento dai risultati della previsione del modello, e più il valore AUC è vicino a 0,5, migliore sarà la privacyMI-AUC<0.6 è efficace per la protezione della privacy, MI-AUC<0.55 è eccellente
Tasso di perdita di funzionalità (FLR)L'attaccante aggrega le caratteristiche per invertire l'errore FLR=1-KL(P∥∥Q)Dmaxrate della distribuzione dati originale,FLR <0.1 indica che la protezione della privacy è efficace (P è Dmax, la distribuzione vera, Q è la distribuzione inferita, ed è la distanza massima KL)
EquitàBias DP in statistica (ΔDP)La differenza massima nella predizione ΔDP=max∥PRg-PRavg∥tasso di esempi positivi tra i diversi gruppi,ΔDP<0,05 per equità, per eccellenza (PRg per il tasso positivo del gruppo g)
Bias EO (ΔEO)La differenza massima nei tassi di ΔEO=max∥TPRg-TPRavg∥ varie tra i diversi gruppi,GCE <0,02 è ben calibrata (K è il numero di gruppo, è il tasso previsto ed è il tasso effettivo)
Errore di calibrazione di gruppo (GCE)La deviazione media tra la probabilità prevista GCE=1Kg=1K∥pg-rg∥di ciascun gruppo e il tasso effettivo di default,Più basso è il valore, meglio è. I requisiti di scenario per le organizzazioni di piccole e medie dimensioni sono <10MB/round
Efficienza della comunicazioneLarghezza di banda uplink per roundConsumo totale di banda dei dati caricati da ciascuna organizzazione al coordinatore durante una singolaPiù basso è il valore, meglio è. Gli scenari interistituzionali richiedono meno di 120 minuti
Rapporto di riduzione (CR)Il rapporto tra il volume dati originale e il volume dati compresso, CR=SizerawSizecompPiù alto è il rapporto di compressione, meglio è. Eccellenti soluzioni CR>10:1

Tabella 8: Sistema di indice di valutazione sperimentale.

Spiegazione della metrica: i) Attacco di Inferenza di Appartenenza: Utilizzando la metodologia dell'attacco black-box, l'attaccante addestra un modello di classificazione binaria che inserisce le probabilità previste dal modello target e fornisce lo stato di appartenenza al campione. Il rischio di perdita di privacy viene misurato dall'AUC del modello (cioè MI-AUC). ii) Criteri di classificazione dei gruppi: nella valutazione dell'equità, i gruppi sono suddivisi in quattro dimensioni: genere (maschio/femmina), età (sotto i 25/25-40/>40), regione (mercati di primo livello/nuovi di primo livello/secondo/sussidiarie) e livello di reddito (<5k/5k-15k/15k-30k/>30k RMB/mese). Questo garantisce la copertura dei gruppi sensibili identificati dai regolatori finanziari. iii) Criteri di convergenza: Durante l'addestramento del modello, se il set di validazione AUC-ROC mostra una diminuzione inferiore a 0,001 su tre round consecutivi (ciascuno contenente 10 epoche), l'addestramento è considerato convergente e interrotto.

Linee di base

Per convalidare la superiorità del proposto "Federated Learning + Hybrid AI Risk Control Model", questo studio stabilisce cinque modelli di base: modelli centralizzati tradizionali, modelli classici di apprendimento federato e modelli migliorati che preservano la privacy. I parametri fondamentali e le strategie di addestramento di ciascun modello di base sono dettagliati nella Tabella 9 per garantire l'equità negli esperimenti comparativi (tutti i modelli utilizzano insiemi di addestramento, insiemi di validazione e strategie di ottimizzazione per iperparametri identici).

Tipi di modelliNome del modelloArchitettura del nucleoModalità di allenamentoMisure di protezione della privacyIperparametri chiave
Modello centralizzatoTradizione GBDTAlbero di potenziamento gradiente XGBoostTutte le istituzioni memorizzano centralmente i dati di addestramentoNon avereNumero di alberi = 100, tasso di apprendimento = 0,1, profondità albero = 6, coefficiente di regolarizzazione λ=1,0
Modello centralizzatoModello di deep learning (MLP)La rete completamente connessa a tre livelli (livello di ingresso 256 dimensioni → strato nascosto 128 dimensioni → strato nascosto 64 dimensioni → 1 dimensione strato di output)Tutte le istituzioni memorizzano centralmente i dati di addestramentoNon avereOttimizzatore=Adam, tasso di apprendimento=0,001, dimensione del lotto=256, Dropout=0,3
Modello federale classicoFedAvg (media federale)Il modello locale è GBDT, e il modello globale adotta l'aggregazione della media dei parametriAddestramento federale sincronizzatoNon avereTasso di partecipazione = 0,8, epoca locale = 5, turno aggregato = 50, tasso di apprendimento = 0,1
Modello federale classicoFedProx (aggregazione federale a livello vicino)Il modello locale è GBDT, e quello prossimaleAddestramento federale sincronizzatoNon avereTasso di partecipazione = 0,8, epoca locale = 5, turno aggregato = 50, parametro prossimale μ = 0,01
μ=0.01
Il vincolo di termini viene aggiunto durante l'aggregazione ().
Federazione Empowerata dalla PrivacyFedAvg+DP (rumore fisso)Aggiungere rumore laplaciano fisso a FedAvg (ε=5, δ=1e-5)Addestramento federale sincronizzatoPrivacy differenziale fissaIntensità del rumore=0,1, tasso di partecipazione=0,8, epoca locale=5, turni di aggregazione=50
Il modello di ricercaFedRisk (Modello Federale di Controllo del Rischio)GDT locale (vincolo monotono) + trasformatore globale (attenzione fusione) + DP + aggregazione sicuraAddestramento Federale AsincronoCondivisione additiva di segreti ADIVE DP+Epoca locale=5, round aggregati=50, dimensione attenzione=64, budget privacyε=5, rapporto di compressione=15:1

Tabella 9: Confronto dei parametri tra il modello di base e questo modello di studio.

Spiegazione della dimensione comparativa: (1) Centralizzato vs. Federato: Confrontando "Traditional GBDT/MLP" con "FedAvg/FedProx/FedRisk", questo studio esamina la degradazione delle prestazioni dell'apprendimento federato in scenari "data off-site". (2) Federato classico vs. Privacy-Potenziato: Attraverso "FedAvg" rispetto a "FedAvg+DP", la ricerca valuta l'impatto della privacy differenziale sulle prestazioni del modello. (3) Sincrono vs. Federato Asincrono: Il confronto tra "FedAvg" (sincrono) e "FedRisk" (asincrono) dimostra i vantaggi di efficienza comunicativa dell'addestramento asincrono. (4) Aggregazione Semplice vs. Fusione Intelligente: Il contrasto tra "FedAvg" (media dei parametri) e "FedRisk" (attenzione fusione) valida l'adattabilità delle strategie di integrazione Transformer ai dati Non-IID. (5) No-Censorship vs. Fairness-Censorship: Il confronto tra "FedAvg" (nessun vincolo di equità) e "FedRisk" (vincoli consapevoli della equità) esamina gli effetti dei meccanismi di equità sulla equità e sulle prestazioni del modello.

Studi sull'ablazione

Impatto di ε variabili sull'utilità del modello

Utilizzando il budget totale della privacy ε come variabile (con valori di 1, 3, 5, 7 e 10), la ricerca ha fissato δ=1e-5 mantenendo invariati gli altri moduli (attenzione fusione e vincolo monotonico GBDT) per valutare il compromesso tra la forza della protezione della privacy e l'utilità del modello. L'esperimento ha misurato sia AUC-ROC (utility modello) sia MI-AUC (rischio per la privacy) come indicatori doppi, con i risultati mostrati nella Tabella 10. Quando ε=1, MI-AUC scendeva a 0,53 (eccellente protezione della privacy), ma AUC-ROC raggiunse solo 0,821 (significativa perdita di utilità). A ε=5, AUC-ROC è rimbalzato a 0,912 (soddisfacendo i requisiti di controllo del rischio finanziario) con MI-AUC=0,58 (protezione efficace della privacy). Al ε>5, il miglioramento dell'AUC-ROC è sceso sotto 0,01, mentre il MI-AUC è rapidamente salito a 0,63 (superando i limiti di rischio per la privacy). Questo conferma che ε=5 è il budget totale ottimale per la privacy, raggiungendo un equilibrio tra privacy e utilità.

Budget Totale per la Privacy*Modello AUC-ROCMI-AUC (rischio per la privacy)Tasso di perdita di funzionalità FLRFrazione di Brier
10.8210.530.040.078
30.8760.550.060.061
50.9120.580.080.042
70.9190.60.110.039
100.9230.630.150.037

Tabella 10: Confronto delle prestazioni del modello con i diversi budget per la privacy ε.

Contributo della fusione dell'attenzione vs. media semplice

Per valutare le differenze di prestazioni tra "fusion dell'attenzione" (la strategia proposta) e "media semplice" (strategia FedAvg) in scenari dati non indipendenti, sono state configurate sperimentalmente due variabili: (1) Severità dei dati Non-IID (misurata da variazioni specifiche del tasso di default per istituzione), bassa variazione: 0,2%-0,5%, alta variazione: 0,2%-3,5%); (2) Strategie di fusione (attenzione fusione vs media semplice). Come mostrato nella Figura 2, il divario AUC-ROC tra le due strategie era solo di 0,023 (0,912 contro 0,889) in scenari non-IID bassi. Tuttavia, questo divario si è allargato a 0,076 (0,905 contro 0,829) negli scenari Non-IID ad alto livello, con il modello di media semplice che ha mostrato un overfitting significativo (set di addestramento AUC-ROC 0,941 vs set di validazione 0,829). Ciò dimostra che i meccanismi di attenzione possono mitigare efficacemente il degrado delle prestazioni causato da dati non indipendenti tramite un pesaggio dinamico, ad esempio assegnando un peso di 0,32 all'istituzione E con previsioni predefinite accurate e un peso di 0,12 all'istituzione C con deviazioni maggiori.

Figura 2
Figura 2: Confronto delle strategie di fusione sotto diversi gradi Non-IID. Clicca qui per visualizzare una versione più grande di questa figura.

Effetto dei regolarizzatori di equità sui KPI basati sul profitto

La domanda principale delle istituzioni finanziarie è garantire profitti aziendali sotto il vincolo dell'equità; pertanto, l'esperimento introduce un indice orientato al profitto - "rendimento sul capitale corretta al rischio (RAROC)". La formula è la seguente:

Equazione 171(39)

La perdita attesa viene calcolata come la probabilità di default moltiplicata per il tasso fisso di perdita in default (fissato al 40%), mentre il capitale economico è determinato dall'esposizione al rischio moltiplicata per il peso del rischio (secondo i requisiti di Basilea III). Le metriche di equità (ΔDP, ΔEO) e RAROC del modello con regolarizzazione di equità rispetto al modello senza di essa sono confrontate nella Tabella 11. Dopo l'implementazione della regolarizzazione della equità, il ΔDP è diminuito da 0,15 a 0,04, il ΔEO è sceso da 0,12 a 0,03 e il RAROC è diminuito solo del 2,1% (18,3% contro 18,7%), significativamente al di sotto della soglia accettabile dal settore del 5%. Ciò dimostra che il meccanismo di equità nel nostro studio rispetta efficacemente i requisiti normativi di non discriminazione controllando al contempo le perdite di profitto.

Configurazione del modelloΔDP (differenza di tasso positivo di gruppo)ΔEO (differenza TPR di gruppo)GCE (errore di calibrazione di gruppo)RAROC (Rendimento sugli Asset Corretta al Rischio)FPR (tasso di falsi positivi)
Nessuna regola di equità0.150.120.03518.70%0.95%
C'è equità e regolarità0.040.030.01818.30%1.02%

Tabella 11: Influenza della regolarizzazione dell'equità sugli indicatori di equità e profitto.

Dettagli di implementazione

Per garantire la riproducibilità dell'esperimento, la ricerca ha chiarito i dettagli dello stack tecnico e del processo di addestramento: (1) Ambiente hardware: ogni nodo istituzionale utilizza processori Intel Xeon Gold 6248, 64GB di RAM e GPU NVIDIA Tesla V100; il coordinatore federato utilizza due processori Xeon Gold 6348 con 128GB RAM per garantire calcolo parallelo e aggregazione efficiente dei parametri. (2) Framework software: Il framework di apprendimento federato è sviluppato utilizzando PySyft 0.8.6, il modulo blockchain utilizza Hyperledger Fabric 2.5 (meccanismo di consenso: Raft), l'addestramento dei modelli si basa su PyTorch 2.0 e XGBoost 2.0.3, mentre il modulo sulla privacy differenziale integra IBM DP Library. (3) Processo di addestramento: (1) Preprocessing dei dati (2 ore, inclusa normalizzazione semantica e miglioramento di CopulaGAN); (2) Addestramento locale (5 epoche per round, tasso di apprendimento decalato tramite ricottura coseno); (3) Aggregazione asincrona (gli aggiornamenti globali del modello avvengono quando il coordinatore riceve parametri da 3 istituzioni); (4) Valutazione del modello (AUC-ROC e metriche di equità calcolate dopo 10 turni); (5) Ottimizzazione degli iperparametri (ottimizzazione bayesiana con 50 iterazioni per determinare i parametri ottimali). (4) Test di robustezza: scenari simulati di disconnessioni istituzionali (selezione casuale di un'istituzione per interrompere 1-3 round di addestramento) e rumori di dati (aggiunta di perturbazioni del valore delle caratteristiche al 5%). I risultati hanno mostrato fluttuazioni AUC-ROC sotto 0,02, dimostrando la capacità anti-interferenza del sistema.

Questo studio ha utilizzato una strategia di schedulazione per ricottura del coseno con un tasso di apprendimento iniziale di 0,05. Il tasso di apprendimento veniva aggiornato dinamicamente in ogni epoca secondo la formula in un totale di 100 epoche di addestramento. Questa strategia manteneva un alto tasso di apprendimento nelle prime fasi dell'addestramento, ad esempio 0,05 nella prima epoca, per accelerare la convergenza del modello, e gradualmente la decadeva fino a quasi zero, ad esempio 0,00025 alla centesima epoca, per migliorare la stabilità della fine messa a punto dei parametri. I risultati sperimentali hanno dimostrato che, rispetto a un tasso di apprendimento fisso, questa strategia migliorava il set di validazione AUC-ROC del 2,3% e accelerava la velocità di convergenza del 37%. La partizione dei dati si basava su un dataset grezzo di cinque istituzioni finanziarie per un totale di 5 milioni di campioni, aderendo rigorosamente al principio dell'isolamento dei dati interistituzionali. I dati locali di ciascuna istituzione sono stati suddivisi cronologicamente, selezionando dati da gennaio 2022 a giugno 2023 come set di addestramento (70%), dati da luglio a settembre 2023 come set di validazione (15%) e dati da ottobre a dicembre 2023 come set di test (15%). Questa partizione garantiva l'indipendenza temporale dei set di addestramento, validazione e test, simulando efficacemente l'evoluzione dei modelli temporali di rischio in scenari reali. Gli iperparametri chiave sono stati determinati tramite ottimizzazione bayesiana. All'interno di uno spazio di ricerca congiunto che comprende un tasso di apprendimento iniziale tra 0,01 e 0,1, numeri di albero GBDT tra 50 e 200, e teste di attenzione Transformer dal set {2, 4, 8}, sono state eseguite 50 iterazioni con l'obiettivo di massimizzare il set di validazione AUC-ROC. La combinazione ottimale finale è stata identificata come un tasso di apprendimento iniziale di 0,05, 120 alberi GBDT e 4 teste di attenzione.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prestazioni predittive: avvicinarsi al livello dei modelli centralizzati in scenari non-IID

In scenari reali con dati fortemente Non-IID (variazioni istituzionali del tasso di default dello 0,2%-3,5%), FedRisk dimostra eccezionali capacità di differenziazione del rischio, come mostrato nella Tabella 12. Il suo AUC-ROC raggiunge 0,912, il PR-AUC è 0,823, il punteggio Brier 0,042 e il tasso di falsi positivi (FPR) è 1,02%. Quest...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La strategia di accordatura dinamica degli iperparametri, in particolare lo scheduler del tasso di apprendimento per ricottura coseno, si è rivelata essenziale per bilanciare velocità di convergenza e stabilità del modello. Decausando il tasso di apprendimento da 0,05 a 0,00025 in 100 epoche, questo approccio accelerava la convergenza nelle prime fasi, minimizzando al 37% i tempi di addestramento nella fase avanzata riducendo la volatilità e migliorando la validazione AUC-ROC del 2,3% ri...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno nulla da rivelare.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Computer portatileDell TechnologiesN/AUtilizzato per l'elaborazione e la documentazione dei dati
Software Statistico (SPSS)IBM Corp.Versione 26.0Utilizzato per l'analisi statistica
Microsoft ExcelMicrosoftUfficio 365Inserimento dati e gestione di base dei dati

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).
  2. Zhang, X., Mavromatis, A., Vafeas, A., Nejabati, R., Simeonidou, D. Federated feature selection for horizontal federated learning in IoT networks. IEEE Internet Things J. 10 (11), 10095-10112 (2023).
  3. Liu, Y., et al. Vertical federated learning: concepts, advances, and challenges. IEEE Trans. Knowl. Data Eng. 36 (7), 3615-3634 (2024).
  4. Saha, S., Ahmad, T. Federated transfer learning: concept and applications. Intell. Artif. 15 (1), 35-44 (2020).
  5. McMahan, H. B., Moore, E., Ramage, D., Hampson, S., Arcas, B. A. Y. Communication-efficient learning of deep networks from decentralized data. In Proc. 20th Int. Conf. Artif. Intell. Stat. , 1273-1282 (2017).
  6. Yang, Q., Liu, Y., Chen, T., Tong, Y. Federated machine learning: concept and applications. ACM Trans. Intell. Syst. Technol. 10 (2), Article 12(2019).
  7. Pan, S. J., Yang, Q. A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22 (10), 1345-1359 (2010).
  8. Long, Z., Wang, J., Wang, Y., Xiao, H., Ma, F. FedCon: a contrastive framework for federated semi-supervised learning. arXiv. , (2021).
  9. Wang, J., et al. FedLite: a scalable approach for federated learning on resource-constrained clients. arXiv. , (2022).
  10. Hanser, T., et al. Data-driven federated learning in drug discovery with knowledge distillation. Nat. Mach. Intell. 7, 1-14 (2025).
  11. Feng, Y., et al. A survey of security threats in federated learning. Complex Intell. Syst. 11 (2), 165(2025).
  12. Chen, D., et al. Bridging data silos in finance via federated learning. IEEE Netw. , https://ieeexplore.ieee.org/document/11062627 (2025).
  13. Haripriya, R., et al. Navigating the fusion of federated learning and big data: a systematic review for the AI landscape. Clust. Comput. 28 (5), 1-27 (2025).
  14. Dong, J., Roth, A., Su, W. J. Gaussian differential privacy. J. R. Stat. Soc. Ser. B Stat. Methodol. 84 (1), 3-37 (2022).
  15. Bayatbabolghani, F., Blanton, M. Secure comparison protocols for privacy-preserving federated learning. In Proc. 2018 ACM SIGSAC Conf. Comput. Commun. Secur. , 2157-2159 (2018).
  16. Acar, A., Aksu, H., Uluagac, A. S., Conti, M. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput. Surv. 51 (4), (2018).
  17. Dwork, C. Differential privacy. In Proc. Int. Colloq. Automata Lang. Program. , 1-19 (2006).
  18. Abadi, M., et al. Deep learning with differential privacy. In Proc. 2016 ACM SIGSAC Conf. Comput. Commun. Secur. , 308-318 (2016).
  19. Bogetoft, P., et al. Secure multiparty computation goes live. In Financ. Cryptogr. Data Secur. 5628, 325-343 (2009).
  20. Perri, L. What's new in the 2023 Gartner Hype Cycle for emerging technologies. , https://www.gartner.com/en/articles/what-s-new-in-the-2023-gartner-hype-cycle-for-emerging-technologies (2023).
  21. Friedman, J., Hastie, T., Tibshirani, R. The elements of statistical learning. , Springer. New York. (2001).
  22. Zhang, H., Liu, Y., Zhang, X., Yin, Z., Li, Y. A lightweight approach for federated learning in edge devices. In Proc. 7th Int. Conf. Artif. Intell. Big Data (ICAIBD). , 53-58 (2024).
  23. Liu, J., Liu, P., Ou, Z., Zhang, G., Song, M. Optimizing edge intelligence through privacy-preserving learning. In Proc. Int. Conf. Edge Comput. , 419-429 (2024).
  24. Kim, J., Kim, K., Sohn, M., Park, G. Deep model-based security-aware entity alignment method for edge-specific knowledge graphs. Sustainability. 14 (14), 8877(2022).
  25. Xue, J., Qu, Z., Xu, J., Liu, Y., Lu, Z. Bandwidth allocation for federated learning with wireless providers and cost constraints. IEEE Trans. Mob. Comput. 23 (6), 7470-7482 (2024).
  26. Sharma, M., Kaur, P. Scalable federated learning for smart city applications. In Proc. 2nd Int. Conf. Informatics (ICI). , 1-4 (2023).
  27. Li, B., Zheng, S., Raman, P., Shrivastava, A., Giannakis, G. B. Contractive error feedback for gradient compression. arXiv. , (2023).
  28. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Federated LearningExplainable AICross Institutional CollaborationFinancial Risk ControlData PrivacyNon IID DataModel InterpretabilityDifferential PrivacyFraud DetectionSME Loan Default

Articoli correlati