$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Architettura di sistema
Mesh dati interistituzionale e livello semantico
Per affrontare l'eterogeneità dei dati tra istituzioni, la ricerca costruisce un'architettura Data Mesh tramite la partizionazione dei nodi guidata dal dominio. Ogni istituto finanziario opera come un nodo indipendente del dominio dei dati, mantenendo i diritti di proprietà e controllo, con il livello semantico che consente la comprensione e l'interazione unificata dei dati. Il livello semantico basato su ontologie stabilisce un modello unificato di controllo del rischio finanziario, definendo le entità centrali, gli attributidella map f e le relazioni con le entità. Le regole specifiche di mappatura semantica sono dettagliate nella Tabella 5. Per i campi specifici dell'istituzione, le conversioni standardizzate vengono ottenute tramite funzioni di mappatura semantica:
(18)
| Entità kernel | Il nome di campo A dell'istituzione | Nome del campo B nell'istituzione | Nome di campo uniforme di livello semantico | Tipo di dati | Regole standardizzate |
| Cliente | Valutazione premium dei clienti (1-5) | Livelli VIP per i clienti (bronzo a diamante) | Punteggio creditizio del cliente (1-5) | Intero | Bronzo→1, Argento→2, Oro→3, Platino→4, Diamante→5 |
| Attività | Importo della transazione (diecimila yuan) | Importo della transazione (yuan) | Importo della transazione (yuan) | Numero fluttuante | Il valore del campo A nell'istituzione è di 10.000 volte |
| Domanda di credito | Quota di candidati (rapporto crediti) | Importo previsto del prestito | Importo del prestito richiedente (yuan) | Numero fluttuante | Istituzione A: Rapporto totale di crediti × importo della domanda; Istituzione B: mappatura diretta |
Tabella 5: Regole semantiche fondamentali per la mappatura delle entità nel campo del controllo del rischio finanziario.
Qui è xi,j il valore specifico i-esimo del campo dell'istituzione j, min(x j) e max(x j) sono rispettivamente i valori minimi e massimi del campo all'interno dell'istituzione, Uj e Lj definiscono i limiti superiori e inferiori dell'intervallo di valori unificato per questo campo a livello semantico.
Registro globale di modelli basati su blockchain e traccia di audit
Per risolvere problemi di gestione caotica delle versioni dei modelli e processi di formazione non rintracciabili nell'apprendimento federato, la tecnologia blockchain viene impiegata per istituire un registro globale dei modelli e un sistema di audit - tracciamento. Utilizzando un'architettura blockchain a consorzio, i nodi partecipanti includono istituzioni finanziarie, coordinatori federati e enti regolatori, garantendo l'immutabilità dei dati e il consensomultipartito 23. Il registro globale dei modelli memorizza i metadati principali dei modelli, inclusi numeri di versione, round di addestramentoH v, elenchi delle istituzioni partecipanti, parametri strutturali e metriche di prestazione. Questi metadati sono memorizzati utilizzando una struttura ad albero di Merkle, con ogni versione del modello corrispondente a un valore hash univoco:
(19)
Qui v è il numero di versione del modello, T il numero totale di round di addestramento, S è la collezione di istituzioni che partecipano all'addestramento, IDi è l'identificatore unico di un'istituzione i, θv è il vettore dei parametri del modello per la versione v, e AUCv è il valore AUC-ROC di questa versione del modello mostrata.
Pipeline federata di ingegneria delle caratteristiche
Allineamento sicuro delle entità e armonizzazione degli schemi
L'ingegneria delle caratteristiche rappresenta il componente centrale della collaborazione tra istituzioni sui dati, richiedendo un'estrazione, un allineamento e un'aggregazione efficaci delle funzionalità garantendo al contempo la privacy dei dati. Questo studio progetta una pipeline completa che comprende l'allineamento sicuro delle entità, la coordinazione degli schemi e l'aggregazione differenziale di grafi di transazioni integrati nella privacy, per affrontare sia l'eterogeneità delle caratteristiche tra istituzioni sia i rischi di fuga di privacy24. L'allineamento tra entità istituzionali è essenziale per raggiungere la collaborazione con le funzionalità. Tuttavia, trasmettere direttamente gli identificatori dei clienti comprometterebbe la privacy. Pertanto, la ricerca adotta un metodo di allineamento delle entità che preserva la privacy che combina crittografia omomorfa (HE) con tecnologia di hashing sensibile alla località (LSH). Le istituzioni pre-elaborano gli identificatori dei clienti utilizzando le funzioni hash SHA-256 per generare identificatori preliminari. Questi identificatori vengono poi mappati nello stesso "bucket" tramite LSH per ridurre i calcoli di crittografia successivi. Gli identificatori all'interno dello stesso bucket subiscono una crittografia omomorfa Paillier. Gli identificatori criptati vengono caricati al coordinatore federato, che ottiene l'allineamento delle entità confrontando la somiglianza degli identificatori criptati usando la cosenosimilezza.
(20)
Quando la somiglianza è superiore alla soglia preimpostata (in questo studio, viene considerata τ=0,95), si determina che si tratta della stessa entità e viene generato un ID unificato tra le istituzioni per ottenere un allineamento sicuro delle entità.
Aggregazione differenzialmente privata degli embeddings nei grafi delle transazioni
I dati delle transazioni finanziarie presentano caratteristiche distinte a struttura di grafo (con i clienti come nodi e le transazioni come archi). L'incorporamento dei graphi delle transazioni cattura efficacemente i modelli di transazione delle parti correlate dei clienti, fornendo funzionalità critiche per i modelli di controllo del rischio. Tuttavia, l'aggregazione diretta di embeddings transistituzionali Gi=(Vi,E i)ViiEi i i,v∈Rdd di transazioni può far trapelare informazioni relative alle transazioni dei clienti. Pertanto, viene introdotta la tecnologia DifferentialPrivacy (DP) per ottenere un'aggregazione preservativa della privacy degli embedding nei grafi delle transazioni. Ogni istituzione costruisce localmente un grafo delle transazioni, dove rappresenta l'insieme dei nodi client dell'istituzione e rappresenta l'insieme degli archi delle transazioni (pesi degli archi uguali agli importi delle transazioni). L'algoritmo GraphSAGE viene utilizzato per generare embedding di nodi (con dimensioni di embedding a 256 dimensioni in questo studio). Per soddisfare i requisiti di privacy differenziati, il rumore laplaciano viene aggiunto agli embedding locali:
(21)
Qui ΔG Sensibilità globale dell'algoritmo GraphSAGE (stimata tramite esperimento in questo studio ΔG=0,8), per il budget locale sulla privacy dell'agenzia,
(22)
Per il budget totale della privacy del sistema, questo studio prende εtotale = 1,5). Il coordinatore aggrega l'incorporamento del rumore di ogni istituzione utilizzando una strategia
di media ponderata, con pesi basati sulla percentuale di clienti di ciascuna istituzione:
(23)
Il grafico globale aggregato delle transazioni
viene incorporato e inviato a ciascuna istituzione. Come caratteristica chiave del modello di controllo del rischio, non solo mantiene le informazioni di correlazione tra le transazioni istituzionali, ma protegge anche la privacy dei clienti attraverso la privacy differenziata.
(24)
Modello ibrido di rischio di IA
Sottomodelli locali: Gradient boosting con vincoli monotoni
I tradizionali modelli di controllo del rischio centralizzato con IA faticano ad adattarsi a scenari federati interistituzionali. Questo studio sviluppa un modello ibrido di rischio IA che combina "sottomodelli locali + modello di fusione globale", integrando l'alta interpretabilità degli Alberi di Aumento di Gradiente (GBDT) con l'adattabilità di Transformer a dati non indipendenti e identicamente distribuiti (NID). Viene introdotto un modulo di interpretazione per bilanciare le prestazioni del modello e la spiegabilità in ambienti federati. Ogni istituzione costruisce localmente sottomodelli GBDT, scelti per la loro forte capacità di adattamento strutturale dei dati e l'elevata interpretabilità - requisiti essenziali per le regolamentazioni sul controllo del rischio finanziario. Per evitare sovrafitting e conclusioni illogiche, durante la formazione GBDT vengono implementati vincoli monotoni, imponendo schemi monotoni di aumento o decrescente per caratteristiche chiave come il reddito dei clienti e i punteggi di credito. Il primo albero creato da GBTD è ht(x), e l'output del modello è:
(25)
Qui, η è il tasso di apprendimento (questo studio richiede η=0,1). Il vincolo monotono si realizza tramite regolarizzazione della funzione di perdita xj.
Aggiungi termine di vincolo:
(26)
Qui, x≺x' rappresenta che l'autovalore di x è minore dell'autovalore di x', e la funzione di perdita finale è:
(27)
Qui, l è la funzione di perdita logaritmica (utilizzata nello scenario binario di controllo del rischio yi∈{0,1}, che indica se il cliente non si sente in default).
è il termine di regolarizzazione della complessità per l'albero, λ e γ sono il coefficiente di regolarizzazione (Questo studio è stato condotto tramite λ=0,01 γ=0,5 di validazione incrociata, ni è il numero di campioni locali per l'istituzione i,T è il numero di alberi (Questo studio ha preso T=100).
Fusione globale: trasformatore basato sull'attenzione per l'adattamento non-IID
I dati interistituzionali mostrano caratteristiche significative di distribuzione Non-IID. Gli algoritmi FedAvg tradizionali, che si limitano a mediare i parametri locali del modello, faticano ad adattarsi ai dati Non-IID. Per affrontare questo problema, la ricerca introduce un'attenzione a pi(x)=σ(Fi(x))σFi(x)ia i-based su un modello di Transformer per la fusione intelligente di sottomodelli locali. Il modello di fusione globale prende in input le probabilità di output provenienti dal sottomodello locale di ciascuna istituzione (output della funzione sigmoide dai modelli GBDT istituzionali). L'architettura Transformer comprende un encoder e uno strato di attenzione, in cui il livello di attenzione calcola i pesi di attenzione dagli output di diverse istituzioni per ottenere un peso adattivo. I pesi di attenzione vengono calcolati usando l'Attenzione Scaled Scaled Product-Product:
(28)
Qui, q è il vettore di query (generato dalle caratteristiche medie di rischio dei campioni globali),
è il vettore chiave dell'istituzione i, dk è la dimensione del vettore chiave (in questo studiod k=64), n è il numero di agenzie che partecipano alla federazione.
La probabilità finale di output del modello globale è:
(29)
Attraverso il meccanismo di attenzione, il modello globale può attribuire automaticamente un peso maggiore alle istituzioni con alta qualità dei dati e previsione accurata del rischio, migliorando l'adattabilità ai dati non-IID.
Modulo di spiegabilità: SHAP sugli alberi federati + generatore controfattuale
I modelli di controllo del rischio finanziario devono mantenere l'interpretabilità per soddisfare i requisiti normativi e proteggere il 'diritto di sapere dei clienti. Per affrontare questo problema, la ricerca sviluppa un modulo di interpretabilità che combina generatori federati SHAP+ controfattuali. Per i sottomodelli locali GBDT, la ricerca utilizza valori SHAP per misurare l'importanza delle caratteristiche, che Si∈R N i×mquantifica il contributo di ciascuna caratteristica agli esiti previsionali. Negli scenari federati, trasmettere direttamente i valori locali di SHAP potrebbe compromettere le informazioni sulla distribuzione delle caratteristiche. Pertanto, la ricerca implementa una strategia di aggregazione sicura in cui ogni istituzione calcola localmente la matrice dei valori SHAP (per il conteggio delle caratteristiche), applica rumore differenziale sulla privacy ai valori SHAP e li carica al coordinatore federato. Il coordinatore poi calcola i valori globali di SHAP:
(30)
Qui, Si' è la matrice dei valori SHAP dell'istituzione i, e wi è la proporzione della dimensione del campione delle istituzioni.
Inserisci l'attuale autovettore x del cliente e il rating di rischio target ytarget, l'output è un vettore di caratteristica antifattuale xcf, soddisfatto (la soglia θ diprobabilità target corrispondente al rating target risk). E |xcf-x|2 il minimo (cioè, il costo di aggiustamento più basso). La funzione di perdita del generatore di fatti è:
(31)
Qui α,β,γ sono i coefficienti di peso (in questo studio α=10,β=5,γ=1),LGAN La funzione di perdita avversaria viene utilizzata per GAN per garantire la razionalità e l'autenticità del vettore caratteristico controfattuale.
Livello di privacy e sicurezza
Aggregazione sicura con condivisione additiva di segreti
Nell'apprendimento federato, la trasmissione e l'aggregazione dei parametri locali del modello sono un anello chiave nella fuga di privacy. La tecnologia AdditiveSecretSharing (ASS) viene adottata per ottenere aggregazione sicura ed evitare l'acquisizione diretta dei parametri locali del modello di ciascuna organizzazione da parte del coordinatore. Il processo specifico è il seguente: i) Ogni istituzione dividerà i parametri del modello locale in quote segrete θ i,1,θi,2,...,θ i,n , soddisfacenti
, ecco il numero delle istituzioni partecipanti; ii) L'istituzione i invia la quota θi,k all'istituzione (k≠i), mantenendo la propria quota θi,i; iii) Ogni istituzione k raccoglie le azioni inviate da tutte le altre istituzioni θ1,k,θ 2,k,...,θn,k , e somma con la quota θk,k trattenuta da sé stessa, ottenendo la somma parziale ; iv) Tutte le istituzionicaricheranno e condivideranno parte di esso con il coordinatore, il coordinatore calcola i risultati
dell'aggregazione globale dei parametri. Attraverso la condivisione additiva dei segreti, il coordinatore può ottenere solo parametri aggregati globali e non può dedurre n-1ttt=⌈n/2⌉ dedurre i parametri locali di nessuna individuale istituzione. Anche la collusione tra più istituzioni non può recuperare parametri da altre, garantendo privacy e sicurezza durante la trasmissione dei parametri. Per affrontare la perdita di quote causata dalle disconnessioni istituzionali, viene introdotto il meccanismo di condivisione segreta di Shamir come backup. Ogni quota è ulteriormente suddivisa in frammenti. Raccogliendo qualsiasi frammento, la quota completa può essere ripristinata, migliorando così la robustezza del sistema.
Calibrazione adattiva del rumore secondo la pianificazione del budget (ε, δ) del DP
La sfida centrale della privacy differenziale risiede nell'equilibrare la forza della protezione della privacy con le prestazioni del modello. I metodi tradizionali di aggiunta a rumore fisso faticano ad adattarsi a scenari in cui le distribuzioni dei dati cambiano dinamicamente durante l'addestramento federato. Questo studio progetta un meccanismo adattivo di calibrazione del rumore basato su (ε,δ)-DP, combinato con una strategia di pianificazione del budget per la privacy, per ottenere una regolazione dinamica dell'intensità del rumore. Definire il budget totale per la privacy del sistema come (Questo studio prende δtotal=10-5, rispetta i requisiti GDPR per il rischio di privacy), adottare la strategia di pianificazione del budget segmentato, il budget totale è assegnato tramite {ε 1.ε 2,...,εT} ciclo di formazione come segue, soddisfatto:
(32)
In ogni ciclo di addestramento, l'intensità del rumore viene regolata dinamicamente in base alle caratteristiche di distribuzione dei dati locali. Assumendo che la varianza locale delle caratteristiche dati del t-esimo ciclo di istituzione sia
, Definire il coefficiente di aggiustamento del rumore αi,t:
(33)
Quando αi,t≥0,8 (la distribuzione dei dati è stabile), usando una bassa intensità
di rumore ; Quando αi,t<0,8 (la distribuzione dei dati fluttua), aumenta l'intensità del rumore . Tra queste, c'è la sensibilità globale dei parametri del modello (questo studio garantisce tramite il gradient clipping).
Protocollo di addestramento efficiente nella comunicazione
Aggiornamenti asincroni del client con controllo della stagnazione
L'apprendimento federato interistituzionale affronta sfide come un'elevata latenza nelle comunicazioni e un significativo consumo di banda (in particolare per le piccole e medie istituzioni finanziarie con risorse di rete limitate). Questo studio progetta un protocollo efficiente di addestramento alla comunicazione che incorpora aggiornamenti asincroni del cliente, compressione del gradiente e feedback sugli errori per ridurre i costi di comunicazione e migliorare la scalabilità delsistema 25. I metodi tradizionali di addestramento federato sincrono come FedAvg richiedono di attendere che tutti i client completino l'addestramento locale prima dell'aggregazione dei parametri, con conseguente lunghi cicli di addestramento. Il meccanismo asincrono di aggiornamento client consente ai client di completare autonomamente l'addestramento locale e caricare immediatamente i parametri. Ricevuti questi parametri, il coordinatore federato aggiorna il modello globale in tempo reale senza attendere altri clienti. Questo risolve il problema della vecchia scadenza del modello nell'addestramento asincrono. Introducendo la strategia di controllo dello stagno, si definisce il valore di stagnazione per il cliente ,(Per tattuale il round di addestramento globale corrente, tlast_update Il round in cui il client ha ottenuto l'ultima volta il modello globale). Quando (Smax è la massima stagnazione ammessa, questo studio prende smax=5). Il cliente partecipa normalmente all'addestramento; Almassimo > quel momento, il client deve scaricare nuovamente l'ultimo modello globale prima dell'addestramento locale. La configurazione hardware consiste in CPU Intel Xeon E5-2678 v3 (12 core, 2,5GHz) abbinate a GPU NVIDIA Tesla V100 (16GB di VRAM) e 64GB di memoria DDR4 per nodo per gestire in modo efficiente i carichi di lavoro di addestramento distribuiti. Per l'inizializzazione software, comandi PySyft come hook = sy. TorchHook (torcia)andvirtual_worker = sy. VirtualWorker(hook, id="client1") sono usati per stabilire connessioni federate sicure, mentre federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) consente il caricamento federato dei dati tra i partecipanti. La mappatura semantica trasforma le caratteristiche finanziarie tra le istituzioni—ad esempio, convertendo gli importi delle transazioni da USD a CNY usando una formula di tasso di cambio dinamico: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), dove il tasso di cambio viene aggiornato periodicamente tramite API. Per aumentare dataset sbilanciati, CopulaGAN genera campioni antagotici sintetici con un frammento di codice simile a quello dell'importazione sdv.tabular CopulaGAN; sintetizzatore = CopulaGAN(epoche=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), preservando le proprietà statistiche dei dati originali. L'addestramento locale GBDT impone vincoli monotoni (ad esempio, assicurando che "credit_score" corrisponda positivamente a "approval_probability") viaparams = {"monotonic_constraints": (1, 0, -1)}in LightGBM, mentre la fusione Transformer è implementata in PyTorch con strati di attenzione multi-testa: self.attention = nn. Attenzione multitesta (embed_dim=64, num_heads=4); attn_output, _ = self.attention(interroga, chiave, valore, key_padding_mask=padding_mask), seguita dalla normalizzazione dello strato e dalle connessioni residue per la stabilità. La privacy differenziale inietta rumore Laplace scalato in modo L1 sensibilità (Δf) e budget di privacy (ε)—ad esempio, aggiungendo rumore campionato da np.random.laplace(loc=0, scale=Δf/ε) dove Δf=1.2 e ε=0.5 a gradienti prima dell'aggregazione. I vincoli di equità vengono applicati dopo l'addestramento riponderando i campioni inversamente proporzionali alla loro prevalenza di gruppo (sample_weight = 1 / group_counts[y_train]) per mitigare le violazioni della parità demografica. Allo stesso tempo, la strategia di aggregazione pesata viene utilizzata per regolare il peso dei parametri del cliente in base al valore di stagnazione:
(34)
Dove λ=0,1 è il coefficiente di penalità di stagnazione; Più grande è la stantiezza, minore è il peso, riducendo così l'impatto dei parametri obsoleti sul modello globale.
Compressione del gradiente e accumulo di errore-feedback
I parametri del modello (in particolare i pesi di attenzione nei modelli globali di fusione Transformer) hanno un'elevata complessità dimensionale. La trasmissione diretta consumerebbe una larghezza di banda eccessiva, rendendo necessarie tecniche di compressione gradiente per ridurreil trasferimento dati a 26. Questo studio integra la sparsificazione Top-K con la compressione di quantizzazione, seguendo questi passaggi specifici: i) Scarso Top-K: Per il modello locale ∇θi gradiente, Seleziona l'elemento gradiente K% con il valore assoluto più grande da mantenere, K Gli altri elementi sono zero, Il valore viene regolato dinamicamente in base alla condizione di larghezza di banda (quando la larghezza di banda è sufficiente K=30, quando la larghezza di banda è limitata K=10); ii) Compressione di quantizzazione: Gli elementi del gradiente trattenuto vengono quantizzati da virgola mobile a 32 bit a interi a 8 bit. La formula di quantizzazione è:
(35)
iii) Feedback dell'errore: Memorizza il gradiente scartato Δ∇=∇θi-∇θierrore compresso durante la compressione lato client, Nel calcolo successivo del gradiente, l'errore viene accumulato nel nuovo gradiente, avvicinandosi,
, Compensando le perdite di compressione. Gli effetti della compressione del gradiente e del feedback di errore sono mostrati nella Tabella 6, In, condizioni di quantizzazione a bit 8 K=20%. Il rapporto di compressione raggiunge 15:1 (volume dati originale/volume dati compresso), e tramite feedback di errore, l'AUC-ROC del modello diminuisce solo dello 0,5%-1,0%, realizzando l'equilibrio tra costo di comunicazione e prestazioni delmodello 27.
| Strategie di compressione | Rapporto di riduzione | Consumo di larghezza di banda di upload (MB/round) | Tasso di declino AUC-ROC | Tasso di riduzione del tempo di allenamento |
| Non compresso (virgola mobile a 32 bit) | 1:01 | 128 | 0.00% | 0.00% |
| Quantizzazione massima sparsa al 30% + 16 bit | 6.7:1 | 19.1 | 0.30% | 35.20% |
| Sparso top 20% + quantizzazione a 8 bit | 15:01 | 8.5 | 0.80% | 58.70% |
| Scarno top 10% + quantizzazione a 8 bit | 30:01:00 | 4.3 | 2.10% | 72.10% |
Tabella 6: Confronto delle prestazioni delle strategie di compressione gradiente.
Regolarizzazione consapevole della equità
I modelli di controllo del rischio finanziario devono evitare discriminazioni contro gruppi specifici e rispettare i requisiti normativi, tra cui la Legge sulla Protezione delle Informazioni Personali e la Legge sulla Giusta Segnalazione del Credito. Questo studio introduce un meccanismo di regolarizzazione consapevole dell'equità per limitare i bias di previsione inter-gruppo durante l'addestramento del modello, garantendo l'equità del modello. Sono definiti due indicatori fondamentali di equità: i) Parità demografica (DP): Il tasso di previsione positiva è uguale per diversi gruppi, approccio,
, tra questi, c'è l'identificatore di gruppo ; ii) Pari opportunità (EO): Il tasso di vere positività è uguale tra i gruppi, approccio
. Aggiungere termini di regolarizzazione della equità alla funzione di perdita del modello ibrido di rischio IA e imporre vincoli rispettivamente sul sottomodello locale GBDT e sul modello globale Transformer: iii) Vincoli di equità del modello locale:

Qui PR(g=A) è il tasso di previsione positivo per il gruppo g, λ, ed è il coefficiente di regolarizzazione per la correttezza.
iv) Vincolo globale di equità del modello: Aggiungi l'aggiustamento del peso di equità del gruppo allo strato di attenzione del Transformer, l'output del modello per i gruppi vulnerabili ag=a base×(1+β⋅Δslea) riceve un peso di attenzione più alto, qui,Δ ingiusto rappresenta il bias di equità tra questo gruppo e il gruppo dominante (Δslea=PR (gruppo dominante)-PR (gruppi vulnerabili)); λEO è il coefficiente di compensazione della deviazione. L'effetto della regolarizzazione della percezione della equità viene valutato tramite ΔDP (deviazione DP), ΔEO (deviazione EO) e errore di calibrazione di gruppo.
Dashboard di governance e conformità modello
Monitoraggio del bias in tempo reale
Per soddisfare i requisiti della regolamentazione finanziaria sulla gestione del ciclo di vita dei modelli, la ricerca ha sviluppato un cruscotto di governance e conformità del modello che integra API di monitoraggio delle deviazioni in tempo reale e reportistica regolamentare, consentendo una supervisione e tracciabilità di tutto il processo durante l'addestramento, la distribuzione e l'iterazione del modello. Il modulo di monitoraggio della deviazione in tempo reale consente un monitoraggio dinamico dell'equità e delle prestazioni del modello attraverso le seguenti dimensioni: i) Monitoraggio delle deviazioni di gruppo: Categorizzazione dei gruppi per genere del cliente, età, regione, livello di reddito, ecc., calcolando PR, TPR e FPR (Tasso di Falsi Positivi) per ogni gruppo ogni ora. Gli allerti di deviazione vengono attivati quando le differenze PR tra gruppi superano 0,08 o le differenze TPR superano 0,05; ii) Monitoraggio della deriva delle prestazioni: Calcolo continuo di metriche come AUC-ROC e PR-AUC. Quando queste metriche diminuiscono di oltre il 2% consecutivamente in tre ore, si determina come deriva delle prestazioni, avviando automaticamente il processo di riaddestramento del modello. iii) Monitoraggio della conformità alla privacy: Registra il consumo del budget privacy e l'aggiunta di rumore εintensità totale/10 di ogni ciclo di addestramento. Quando il consumo ε di un singolo colpo supera, si interrompe l'addestramento e si regola la strategia del rumore. iv) Il monitoraggio dei dati viene visualizzato tramite cruscotti visivi, permettendo ai regolatori e alle istituzioni partecipanti di visualizzarli in tempo reale e realizzando una gestione trasparente dei rischi modelli.
API di reportistica normativa
Per semplificare il processo di rendicontazione regolamentare, è stata progettata un'API standardizzata per la segnalazione normativa a supporto della generazione automatica di report conformi a regolamenti come GDPR, CCPA e la Legge cinese sulla protezione delle informazioni personali. Le funzioni principali includono: i) Data Source Compliance Report: Aggrega automaticamente tipi di dati, volumi e stato di autorizzazione delle istituzioni partecipanti per verificare la conformità al principio del "minimo necessario"; ii) Rapporto di Conformità alla Formazione Modello: Documenta le iterazioni di formazione, le istituzioni partecipanti, le misure di protezione della privacy e le metriche di equità per generare un rapporto di tracciabilità della formazione modello; iii) Rapporto di conformità alla previsione del rischio: Mostra i modelli di distribuzione conformi alle normative delle previsioni dei modelli tra diversi gruppi e casi di spiegazione controfattuale per dimostrare la non discriminazione. L'API adotta uno stile di design RESTful, supportando output in formato JSON e XML. Le autorità regolatorie possono accedere direttamente ai dati dei report tramite interfacce API o impostare cicli automatici di reportistica per realizzare processi regolatori automatizzati e standardizzati. I modelli di rapporto sono conformi agli standard normativi del modello finanziario dell'Organizzazione Internazionale per la Normalizzazione (ISO), garantendo l'autorità e l'universalità dei rapporti.
Disegno sperimentale: Descrizione del dataset
Dati su carte di credito multiistituzionali e prestiti per PMI
I dati sperimentali provenivano da istituzioni finanziarie in Cina, coprendo tipi di dati come transazioni personali con carta di credito e registri di richiesta e gestione di prestiti per PMI. La tecnologia CopulaGAN è stata impiegata per sintetizzare e migliorare eventi fraudolenti rari, costruendo così un dataset sperimentale che combina autenticità e integrità. I dati reali utilizzati nell'esperimento includono due categorie principali: dati sulle transazioni personali con carta di credito e dati sui prestiti per PMI, per un totale di oltre 5 milioni di registrazioni che coprono da gennaio 2022 a dicembre 2023. I dati coprono quattro principali regioni economiche: Nord Cina, Cina orientale, Meridionale e Sud-ovest della Cina—per garantire la rappresentanza geografica e la diversità nella distribuzione dei campioni. I campi fondamentali e le caratteristiche statistiche dei dati istituzionali sono mostrati nella Tabella 7. Tra queste, le Istituzioni A e B sono banche commerciali nazionali con ampie basi di clienti che coprono tutte le fasce d'età; Le istituzioni C e D sono banche internet che servono principalmente i giovani (20-35 anni); Institution E è una società di finanziamento al consumo che mira agli utenti di mercati di livello inferiore, con una distribuzione dei dati che mostra caratteristiche significative Non-IID. Il dataset contiene 115.610 dati. Il dataset è fornito da istituzioni finanziarie che collaborano con università
| Tipo di dati | Istituzione | Numero di record (10.000) | Numero di clienti (10.000) | Nuclei di carattere | Tasso di frode in default | Caratteristiche della distribuzione dei dati |
| Transazioni con carta di credito | A | 180 | 85 | Tempo della transazione, importo, tipo di commerciante, posizione della transazione, se rubare la carta | 0.32% | Le transazioni grandi rappresentano una percentuale elevata (> 5000 yuan) |
| Transazioni con carta di credito | B | 150 | 72 | Numero di flusso delle transazioni, importo (USD/RMB), canale di pagamento, valutazione dei clienti | 0.28% | Le transazioni transfrontaliere rappresentano il 15% |
| Transazioni con carta di credito | C | 120 | 68 | Ora della transazione, importo, se installare, età del cliente, posizione del numero di cellulare | 0.45% | Il piccolo trading ad alta frequenza (<1000 yuan rappresenta il 60%) |
| Prestiti per piccole e microimprese | D | 32 | 1.2 | Nome della società, importo del prestito, durata del credito, scala dei ricavi, importo delle tasse, se in ritardo | 2.80% | I clienti manifatturieri rappresentano il 40% |
| Prestiti per piccole e microimprese | E | 18 | 0.8 | Data della domanda di prestito, importo previsto, tipo di attività, numero di dipendenti, record storico delle prestazioni | 3.50% | I clienti del servizio rappresentano il 70% |
Tabella 7: Caratteristiche statistiche del set di dati finanziari reali multi-istituzioni.
Per affrontare l'eterogeneità dei dati interistituzionali, l'esperimento ha rispettato rigorosamente le specifiche della griglia di dati e dei livelli semantici standardizzando i campi istituzionali: ad esempio, convertendo l'"importo della transazione (USD)" dell'Istituzione B in RMB usando il tasso di cambio della data della transazione e unificando il nome del campo in "importo della transazione (YUAN)"; convertendo l'"età del cliente" dell'Istituzione C (formato "1990-01-01") in un'età intera; e la mappatura della "scala di ricavi aziendali" dell'Istituzione D (classificata come "sotto 1 milione / 1-5 milioni / oltre 5 milioni") fino ai punti intermedi degli intervalli numerici (500.000, 3.000.000, 7.500.000), garantendo coerenza tra formato dei dati e significato semantico.
Aumento sintetico tramite CopulaGAN per eventi di frode rari
Negli scenari di controllo del rischio finanziario, i campioni di frode/default rappresentano tipicamente una proporzione estremamente bassa. L'uso diretto di tali dimensioni di campioni per l'addestramento del modello porterebbe a gravi problemi di squilibrio di classe, compromettendo le capacità di generalizzazione del modello. L'esperimento utilizza Copula GAN (una rete generativa antagionale basata sulle funzioni Copula) per sintetizzare dati aumentati in casi rari di frode. Questo metodo combina la capacità della funzione Copula di modellare distribuzioni dati ad alta dimensione con le capacità generative di GAN, permettendo la creazione di dati sintetici che si allineano con i modelli reali di frode evitando il problema del "collasso dei pattern" comunemente osservato nella generazione tradizionale di GAN.
Struttura del modello CopulaGAN
CopulaGAN è composto da tre parti: Generatore, Discriminatore e modulo di vincolo della distribuzione della Copula: (1) Generatore: L'ingresso è un vettore di rumore casuale z∼N(0,1) a 128 dimensioni, e produce un vettore caratteristico sintetico coerente con la dimensione reale del campione attraverso una rete completamente connessa a 3 strati (le dimensioni nascoste dello strato sono 256, 512, 256); (2) Discriminatore: L'input è campione reale o campione sintetico xsyn, e attraverso una rete completamente connessa a due livelli + funzione di attivazione sigmoide, si fornisce la probabilità che il campione sia dato reale; (3) Modulo di vincolo della distribuzione della copula: adattare la distribuzione congiunta dei campioni reali di frode tramite la funzione di Copula gaussiana (dove è il valore della funzione di distribuzione degli archi dell'ottava caratteristica di i), e aggiungere il vincolo della distanza di Copula nella perdita del generatore per garantire che la distribuzione congiunta dei campioni sintetici sia coerente con i campioni reali.
(36)
Migliorare la verifica dei processi ed effetti
Il processo di addestramento e miglioramento di CopulaGAN è il seguente: i) Preprocessing dei dati: estrarre campioni di frode/default (18.200 in totale) dai dati reali di varie istituzioni; Standardizzare le caratteristiche continue (x'=(x-μ)/σ); Le caratteristiche discrete sono codificate con calore unico; ii) Adattamento della copula: la funzione Copula gaussiana viene utilizzata per adattare la distribuzione congiunta dei campioni di frode preprocessati, calcolare la distribuzione degli archi Fiθ e i parametri della funzione Copula di ciascuna caratteristica; iii) Addestramento GAN: Il generatore e il discriminatore vengono addestrati alternativamente. La funzione di perdita del generatore è:
(37)
Qui, λ è il peso vincolante, e Distance (Csin, Creale) è la divergenza KL tra la distribuzione di Copola di campioni sintetici e la distribuzione di Copula di campioni reali; La funzione di perdita del discriminatore è la perdita binaria standard di entropia incrociata:
(38)
Dopo la convergenza del modello (con la precisione del discriminatore stabilizzata al 50%±5%), il generatore ha prodotto 50.000 campioni sintetici di frode. Questi venivano mappati allo spazio delle caratteristiche originale secondo specifiche semantiche e fusi con campioni reali per costruire un set di allenamento bilanciato. Per convalidare l'efficacia dei campioni sintetici, la ricerca li ha valutati utilizzando un test KS a due campioni e la visualizzazione della distribuzione delle caratteristiche. I risultati del test KS hanno mostrato che le differenze nelle distribuzioni delle caratteristiche tra campioni sintetici e reali erano tutte inferiori a 0,05 (statistica KS <0,05, p-value>0,05), indicando una buona coerenza distributiva. Il confronto della distribuzione delle caratteristiche ha dimostrato che i campioni sintetici potevano riprodurre accuratamente le caratteristiche di distribuzione dei campioni reali di frode, fornendo dati validi sufficienti per l'addestramento del modello come mostrato nella Figura 1.

Figura 1: Confronto della distribuzione delle caratteristiche tra campioni reali di frode e CopulaGAN Clicca qui per visualizzare una versione più grande di questa figura.
Metriche di valutazione
L'esperimento costruisce un sistema di valutazione multi-indice basato su quattro dimensioni fondamentali: prestazioni previsionali, protezione della privacy, equità ed efficienza della comunicazione per misurare in modo completo la performance completa del framework di apprendimento federato e del modello di controllo del rischio AI. La definizione, il metodo di calcolo e i criteri di valutazione di ogni dimensione sono mostrati nella Tabella 8.
| Dimensioni della valutazione | Nome dell'indice | Definizione e metodo di calcolo | Criterio di valutazione |
| Prestazioni stimate | AUC-ROC | L'area sotto la curva di lavoro caratteristica del soggetto misura la capacità del modello di distinguere tra esempi positivi (predefiniti/frodi) e negativi | Più alto è il valore, meglio è. L'AUC-ROC del modello eccellente è>0,9 |
| PR-AUC | L'area di richiamo di precisione sotto la curva, applicabile a dati sbilanciati, misura la prestazione di un modello in scenari in cui gli esempi positivi sono scarsi | Più alto è il valore, meglio è. Il PR-AUC di un modello eccellente è>0,8 |
| Frazione di Brier | Errore quadratico medio tra probabilità prevista e etichetta vera,B=1Ni=1N(pi-yi)2 | Più basso è il valore, meglio è. Il punteggio Brier di un modello eccellente è inferiore a 0,05 |
| Tasso di falsi positivi (FPR) | La proporzione di esempi negativi FPR=FPFP+TNche | Più basso è il valore, meglio è. Gli scenari finanziari di solito richiedono un FPR <1% (per evitare di rifiutare clienti validi) |
| Protezione della privacy | ε-Curva di consumo (curva ε) | Registrare il tasso di consumo del budget accumulato per la privacy durante la formazione per riflettere la capacità dinamica di bilanciamento della protezione della privacy | La curva si sta stabilizzando e il ε totale è inferiore o uguale a 5 (in linea con i requisiti GDPR sul rischio della privacy) |
| Attacco di ragionamento dei membri AUC (MI-AUC) | La capacità di un attaccante di dedurre se un campione appartiene al set di addestramento dai risultati della previsione del modello, e più il valore AUC è vicino a 0,5, migliore sarà la privacy | MI-AUC<0.6 è efficace per la protezione della privacy, MI-AUC<0.55 è eccellente |
| Tasso di perdita di funzionalità (FLR) | L'attaccante aggrega le caratteristiche per invertire l'errore FLR=1-KL(P∥∥Q)Dmaxrate della distribuzione dati originale, | FLR <0.1 indica che la protezione della privacy è efficace (P è Dmax, la distribuzione vera, Q è la distribuzione inferita, ed è la distanza massima KL) |
| Equità | Bias DP in statistica (ΔDP) | La differenza massima nella predizione ΔDP=max∥PRg-PRavg∥tasso di esempi positivi tra i diversi gruppi, | ΔDP<0,05 per equità, per eccellenza (PRg per il tasso positivo del gruppo g) |
| Bias EO (ΔEO) | La differenza massima nei tassi di ΔEO=max∥TPRg-TPRavg∥ varie tra i diversi gruppi, | GCE <0,02 è ben calibrata (K è il numero di gruppo, è il tasso previsto ed è il tasso effettivo) |
| Errore di calibrazione di gruppo (GCE) | La deviazione media tra la probabilità prevista GCE=1Kg=1K∥pg-rg∥di ciascun gruppo e il tasso effettivo di default, | Più basso è il valore, meglio è. I requisiti di scenario per le organizzazioni di piccole e medie dimensioni sono <10MB/round |
| Efficienza della comunicazione | Larghezza di banda uplink per round | Consumo totale di banda dei dati caricati da ciascuna organizzazione al coordinatore durante una singola | Più basso è il valore, meglio è. Gli scenari interistituzionali richiedono meno di 120 minuti |
| Rapporto di riduzione (CR) | Il rapporto tra il volume dati originale e il volume dati compresso, CR=SizerawSizecomp | Più alto è il rapporto di compressione, meglio è. Eccellenti soluzioni CR>10:1 |
Tabella 8: Sistema di indice di valutazione sperimentale.
Spiegazione della metrica: i) Attacco di Inferenza di Appartenenza: Utilizzando la metodologia dell'attacco black-box, l'attaccante addestra un modello di classificazione binaria che inserisce le probabilità previste dal modello target e fornisce lo stato di appartenenza al campione. Il rischio di perdita di privacy viene misurato dall'AUC del modello (cioè MI-AUC). ii) Criteri di classificazione dei gruppi: nella valutazione dell'equità, i gruppi sono suddivisi in quattro dimensioni: genere (maschio/femmina), età (sotto i 25/25-40/>40), regione (mercati di primo livello/nuovi di primo livello/secondo/sussidiarie) e livello di reddito (<5k/5k-15k/15k-30k/>30k RMB/mese). Questo garantisce la copertura dei gruppi sensibili identificati dai regolatori finanziari. iii) Criteri di convergenza: Durante l'addestramento del modello, se il set di validazione AUC-ROC mostra una diminuzione inferiore a 0,001 su tre round consecutivi (ciascuno contenente 10 epoche), l'addestramento è considerato convergente e interrotto.
Linee di base
Per convalidare la superiorità del proposto "Federated Learning + Hybrid AI Risk Control Model", questo studio stabilisce cinque modelli di base: modelli centralizzati tradizionali, modelli classici di apprendimento federato e modelli migliorati che preservano la privacy. I parametri fondamentali e le strategie di addestramento di ciascun modello di base sono dettagliati nella Tabella 9 per garantire l'equità negli esperimenti comparativi (tutti i modelli utilizzano insiemi di addestramento, insiemi di validazione e strategie di ottimizzazione per iperparametri identici).
| Tipi di modelli | Nome del modello | Architettura del nucleo | Modalità di allenamento | Misure di protezione della privacy | Iperparametri chiave |
| Modello centralizzato | Tradizione GBDT | Albero di potenziamento gradiente XGBoost | Tutte le istituzioni memorizzano centralmente i dati di addestramento | Non avere | Numero di alberi = 100, tasso di apprendimento = 0,1, profondità albero = 6, coefficiente di regolarizzazione λ=1,0 |
| Modello centralizzato | Modello di deep learning (MLP) | La rete completamente connessa a tre livelli (livello di ingresso 256 dimensioni → strato nascosto 128 dimensioni → strato nascosto 64 dimensioni → 1 dimensione strato di output) | Tutte le istituzioni memorizzano centralmente i dati di addestramento | Non avere | Ottimizzatore=Adam, tasso di apprendimento=0,001, dimensione del lotto=256, Dropout=0,3 |
| Modello federale classico | FedAvg (media federale) | Il modello locale è GBDT, e il modello globale adotta l'aggregazione della media dei parametri | Addestramento federale sincronizzato | Non avere | Tasso di partecipazione = 0,8, epoca locale = 5, turno aggregato = 50, tasso di apprendimento = 0,1 |
| Modello federale classico | FedProx (aggregazione federale a livello vicino) | Il modello locale è GBDT, e quello prossimale | Addestramento federale sincronizzato | Non avere | Tasso di partecipazione = 0,8, epoca locale = 5, turno aggregato = 50, parametro prossimale μ = 0,01 |
μ=0.01 Il vincolo di termini viene aggiunto durante l'aggregazione (). |
| Federazione Empowerata dalla Privacy | FedAvg+DP (rumore fisso) | Aggiungere rumore laplaciano fisso a FedAvg (ε=5, δ=1e-5) | Addestramento federale sincronizzato | Privacy differenziale fissa | Intensità del rumore=0,1, tasso di partecipazione=0,8, epoca locale=5, turni di aggregazione=50 |
| Il modello di ricerca | FedRisk (Modello Federale di Controllo del Rischio) | GDT locale (vincolo monotono) + trasformatore globale (attenzione fusione) + DP + aggregazione sicura | Addestramento Federale Asincrono | Condivisione additiva di segreti ADIVE DP+ | Epoca locale=5, round aggregati=50, dimensione attenzione=64, budget privacyε=5, rapporto di compressione=15:1 |
Tabella 9: Confronto dei parametri tra il modello di base e questo modello di studio.
Spiegazione della dimensione comparativa: (1) Centralizzato vs. Federato: Confrontando "Traditional GBDT/MLP" con "FedAvg/FedProx/FedRisk", questo studio esamina la degradazione delle prestazioni dell'apprendimento federato in scenari "data off-site". (2) Federato classico vs. Privacy-Potenziato: Attraverso "FedAvg" rispetto a "FedAvg+DP", la ricerca valuta l'impatto della privacy differenziale sulle prestazioni del modello. (3) Sincrono vs. Federato Asincrono: Il confronto tra "FedAvg" (sincrono) e "FedRisk" (asincrono) dimostra i vantaggi di efficienza comunicativa dell'addestramento asincrono. (4) Aggregazione Semplice vs. Fusione Intelligente: Il contrasto tra "FedAvg" (media dei parametri) e "FedRisk" (attenzione fusione) valida l'adattabilità delle strategie di integrazione Transformer ai dati Non-IID. (5) No-Censorship vs. Fairness-Censorship: Il confronto tra "FedAvg" (nessun vincolo di equità) e "FedRisk" (vincoli consapevoli della equità) esamina gli effetti dei meccanismi di equità sulla equità e sulle prestazioni del modello.
Studi sull'ablazione
Impatto di ε variabili sull'utilità del modello
Utilizzando il budget totale della privacy ε come variabile (con valori di 1, 3, 5, 7 e 10), la ricerca ha fissato δ=1e-5 mantenendo invariati gli altri moduli (attenzione fusione e vincolo monotonico GBDT) per valutare il compromesso tra la forza della protezione della privacy e l'utilità del modello. L'esperimento ha misurato sia AUC-ROC (utility modello) sia MI-AUC (rischio per la privacy) come indicatori doppi, con i risultati mostrati nella Tabella 10. Quando ε=1, MI-AUC scendeva a 0,53 (eccellente protezione della privacy), ma AUC-ROC raggiunse solo 0,821 (significativa perdita di utilità). A ε=5, AUC-ROC è rimbalzato a 0,912 (soddisfacendo i requisiti di controllo del rischio finanziario) con MI-AUC=0,58 (protezione efficace della privacy). Al ε>5, il miglioramento dell'AUC-ROC è sceso sotto 0,01, mentre il MI-AUC è rapidamente salito a 0,63 (superando i limiti di rischio per la privacy). Questo conferma che ε=5 è il budget totale ottimale per la privacy, raggiungendo un equilibrio tra privacy e utilità.
| Budget Totale per la Privacy* | Modello AUC-ROC | MI-AUC (rischio per la privacy) | Tasso di perdita di funzionalità FLR | Frazione di Brier |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
Tabella 10: Confronto delle prestazioni del modello con i diversi budget per la privacy ε.
Contributo della fusione dell'attenzione vs. media semplice
Per valutare le differenze di prestazioni tra "fusion dell'attenzione" (la strategia proposta) e "media semplice" (strategia FedAvg) in scenari dati non indipendenti, sono state configurate sperimentalmente due variabili: (1) Severità dei dati Non-IID (misurata da variazioni specifiche del tasso di default per istituzione), bassa variazione: 0,2%-0,5%, alta variazione: 0,2%-3,5%); (2) Strategie di fusione (attenzione fusione vs media semplice). Come mostrato nella Figura 2, il divario AUC-ROC tra le due strategie era solo di 0,023 (0,912 contro 0,889) in scenari non-IID bassi. Tuttavia, questo divario si è allargato a 0,076 (0,905 contro 0,829) negli scenari Non-IID ad alto livello, con il modello di media semplice che ha mostrato un overfitting significativo (set di addestramento AUC-ROC 0,941 vs set di validazione 0,829). Ciò dimostra che i meccanismi di attenzione possono mitigare efficacemente il degrado delle prestazioni causato da dati non indipendenti tramite un pesaggio dinamico, ad esempio assegnando un peso di 0,32 all'istituzione E con previsioni predefinite accurate e un peso di 0,12 all'istituzione C con deviazioni maggiori.

Figura 2: Confronto delle strategie di fusione sotto diversi gradi Non-IID. Clicca qui per visualizzare una versione più grande di questa figura.
Effetto dei regolarizzatori di equità sui KPI basati sul profitto
La domanda principale delle istituzioni finanziarie è garantire profitti aziendali sotto il vincolo dell'equità; pertanto, l'esperimento introduce un indice orientato al profitto - "rendimento sul capitale corretta al rischio (RAROC)". La formula è la seguente:
(39)
La perdita attesa viene calcolata come la probabilità di default moltiplicata per il tasso fisso di perdita in default (fissato al 40%), mentre il capitale economico è determinato dall'esposizione al rischio moltiplicata per il peso del rischio (secondo i requisiti di Basilea III). Le metriche di equità (ΔDP, ΔEO) e RAROC del modello con regolarizzazione di equità rispetto al modello senza di essa sono confrontate nella Tabella 11. Dopo l'implementazione della regolarizzazione della equità, il ΔDP è diminuito da 0,15 a 0,04, il ΔEO è sceso da 0,12 a 0,03 e il RAROC è diminuito solo del 2,1% (18,3% contro 18,7%), significativamente al di sotto della soglia accettabile dal settore del 5%. Ciò dimostra che il meccanismo di equità nel nostro studio rispetta efficacemente i requisiti normativi di non discriminazione controllando al contempo le perdite di profitto.
| Configurazione del modello | ΔDP (differenza di tasso positivo di gruppo) | ΔEO (differenza TPR di gruppo) | GCE (errore di calibrazione di gruppo) | RAROC (Rendimento sugli Asset Corretta al Rischio) | FPR (tasso di falsi positivi) |
| Nessuna regola di equità | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| C'è equità e regolarità | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
Tabella 11: Influenza della regolarizzazione dell'equità sugli indicatori di equità e profitto.
Dettagli di implementazione
Per garantire la riproducibilità dell'esperimento, la ricerca ha chiarito i dettagli dello stack tecnico e del processo di addestramento: (1) Ambiente hardware: ogni nodo istituzionale utilizza processori Intel Xeon Gold 6248, 64GB di RAM e GPU NVIDIA Tesla V100; il coordinatore federato utilizza due processori Xeon Gold 6348 con 128GB RAM per garantire calcolo parallelo e aggregazione efficiente dei parametri. (2) Framework software: Il framework di apprendimento federato è sviluppato utilizzando PySyft 0.8.6, il modulo blockchain utilizza Hyperledger Fabric 2.5 (meccanismo di consenso: Raft), l'addestramento dei modelli si basa su PyTorch 2.0 e XGBoost 2.0.3, mentre il modulo sulla privacy differenziale integra IBM DP Library. (3) Processo di addestramento: (1) Preprocessing dei dati (2 ore, inclusa normalizzazione semantica e miglioramento di CopulaGAN); (2) Addestramento locale (5 epoche per round, tasso di apprendimento decalato tramite ricottura coseno); (3) Aggregazione asincrona (gli aggiornamenti globali del modello avvengono quando il coordinatore riceve parametri da 3 istituzioni); (4) Valutazione del modello (AUC-ROC e metriche di equità calcolate dopo 10 turni); (5) Ottimizzazione degli iperparametri (ottimizzazione bayesiana con 50 iterazioni per determinare i parametri ottimali). (4) Test di robustezza: scenari simulati di disconnessioni istituzionali (selezione casuale di un'istituzione per interrompere 1-3 round di addestramento) e rumori di dati (aggiunta di perturbazioni del valore delle caratteristiche al 5%). I risultati hanno mostrato fluttuazioni AUC-ROC sotto 0,02, dimostrando la capacità anti-interferenza del sistema.
Questo studio ha utilizzato una strategia di schedulazione per ricottura del coseno con un tasso di apprendimento iniziale di 0,05. Il tasso di apprendimento veniva aggiornato dinamicamente in ogni epoca secondo la formula in un totale di 100 epoche di addestramento. Questa strategia manteneva un alto tasso di apprendimento nelle prime fasi dell'addestramento, ad esempio 0,05 nella prima epoca, per accelerare la convergenza del modello, e gradualmente la decadeva fino a quasi zero, ad esempio 0,00025 alla centesima epoca, per migliorare la stabilità della fine messa a punto dei parametri. I risultati sperimentali hanno dimostrato che, rispetto a un tasso di apprendimento fisso, questa strategia migliorava il set di validazione AUC-ROC del 2,3% e accelerava la velocità di convergenza del 37%. La partizione dei dati si basava su un dataset grezzo di cinque istituzioni finanziarie per un totale di 5 milioni di campioni, aderendo rigorosamente al principio dell'isolamento dei dati interistituzionali. I dati locali di ciascuna istituzione sono stati suddivisi cronologicamente, selezionando dati da gennaio 2022 a giugno 2023 come set di addestramento (70%), dati da luglio a settembre 2023 come set di validazione (15%) e dati da ottobre a dicembre 2023 come set di test (15%). Questa partizione garantiva l'indipendenza temporale dei set di addestramento, validazione e test, simulando efficacemente l'evoluzione dei modelli temporali di rischio in scenari reali. Gli iperparametri chiave sono stati determinati tramite ottimizzazione bayesiana. All'interno di uno spazio di ricerca congiunto che comprende un tasso di apprendimento iniziale tra 0,01 e 0,1, numeri di albero GBDT tra 50 e 200, e teste di attenzione Transformer dal set {2, 4, 8}, sono state eseguite 50 iterazioni con l'obiettivo di massimizzare il set di validazione AUC-ROC. La combinazione ottimale finale è stata identificata come un tasso di apprendimento iniziale di 0,05, 120 alberi GBDT e 4 teste di attenzione.