Artigo de investigação

Modelo de Aprendizagem Federado Explicável para Colaboração e Controle de Riscos entre Dados Financeiros Digitais Interinstitucionais

DOI:

10.3791/69805

3 de março de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Demonstramos um protocolo reproduzível para implementar o FedRisk, uma estrutura de aprendizagem federada explicável. O procedimento inclui harmonização semântica de dados, alinhamento de entidades preservando a privacidade, calibração diferencial de privacidade, treinamento local de GBDT, fusão global de Transformers e atualizações assíncronas comprimidas em gradiente, possibilitando previsão de risco financeiro segura, escalável e conforme regulamentação em múltiplas instituições.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A fragmentação dos dados financeiros entre instituições e as rigorosas regulamentações de privacidade dificultam severamente a gestão colaborativa de riscos, levando a uma detecção de fraudes subótima com precisão abaixo de 60% e altos erros de inadimplência em PMEs superiores a 25%. Soluções de aprendizagem federada existentes enfrentam desafios com dados não-IID, interpretabilidade de modelos e conformidade, resultando em taxas de adoção no mundo real abaixo de 20%. Para suprir essas lacunas, propomos o FedRisk, um framework de aprendizagem federada explicável que integra quatro inovações principais. Primeiro, uma malha de dados interinstitucional com harmonização semântica ontológica alcança a utilização de características acima de 85%. Segundo, um modelo híbrido de IA combina GBDT localmente interpretável com restrições monotônicas e um Transformer global baseado em atenção, reduzindo a perda de desempenho em cenários não-IID em 7,6% em comparação com o FedAvg. Terceiro, um mecanismo de privacidade tripartite emprega privacidade diferencial adaptativa com um orçamento total de ε=5, compartilhamento aditivo de segredos e regularização consciente da justiça, limitando o viés de previsão de grupo abaixo de 0,05 e a perda RAROC abaixo de 2,1%. Quarto, otimizações eficientes em comunicação reduzem a largura de banda por rodada para 8,5 MB e o tempo de treinamento para 85 min. Avaliado em mais de 5 milhões de registros multi-institucionais, o FedRisk alcança um AUC-ROC de 0,912, apenas 1,8% menor que o GBDT centralizado, enquanto resiste a ataques de inferência de membros com um AUC de 0,58. Ele reduz a transmissão de dados entre instituções em 99% e supera as linhas de base CL clássicas em 7,3% no AUC-ROC. Ao possibilitar uma previsão de risco segura, transparente e conforme as regulamentações sem compartilhamento de dados brutos, a FedRisk oferece uma solução escalável para colaboração financeira entre institucionais.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O desenvolvimento aprofundado das finanças digitais está remodelando modelos de serviço, desde o controle do risco de crédito pessoal até o financiamento da cadeia de suprimentos de PMEs, estabelecendo dados como um fator central de produção. De acordo com o "Relatório de Desenvolvimento Fintech da China 2023" da PBOC, no final de 2023, a escala de crédito digital da China ultrapassou 65 trilhões de yuans, representando 38% do saldo total, com dados de transações diárias ultrapassando 500TB1. No entanto, os "silos de dados" continuam sendo uma barreira significativa. As instituições geralmente adotam modelos de dados fechados devido à concorrência e preocupações com segurança. Por exemplo, na detecção de fraudes com cartão de crédito, bancos que dependem exclusivamente de dados internos perdem registros críticos entre institucionais, resultando em taxas de identificação abaixo de 60% para novos tipos de fraude. Da mesma forma, para crédito para PMEs, a falta de dados externos de seguros e impostos leva a erros de previsão de inadimpleção superiores a 25%. Essa fragmentação causa dois desafios: limitar o acesso para 200 milhões de clientes carentes e aumentar o risco de contágio cruzado em 18% (Relatório CBIRC 2023). Consequentemente, os silos de dados se tornaram o principal gargalo que dificulta o desenvolvimento de alta qualidade das finanças digitais.

Nos últimos anos, um aumento das leis globais de privacidade de dados limitou significativamente o compartilhamento centralizado de dados. As instituições financeiras devem agora aderir a três princípios fundamentais: "necessidade mínima", "consentimento informado" e "rastreabilidade". Embora os arcabous regionais variem, todos impõem limites rigorosos ao uso de dados entre institucionais, conforme detalhado na Tabela 1.

Estrutura regulatóriaOrações restritivas centraisImpacto na colaboração com dados financeiros
Regulamento Geral de Proteção de Dados (GDPR) da UE1. A transferência transfronteiriça de dados deve atender à "determinação de suficiência"; 2. Os indivíduos têm o direito de acessar e excluir seus dados; 3. Vazamentos de dados devem ser reportados em até 72 horasA transmissão não autorizada de dados brutos por via transfronteiriça é proibida, e o compartilhamento centralizado exige uma avaliação de impacto de privacidade (PIA), aumentando os custos de conformidade em 30%
Lei de Privacidade do Consumidor da Califórnia (CCPA)1. Os consumidores podem pedir às empresas que excluam seus dados pessoais; 2. O compartilhamento de dados requer uma notificação clara sobre para que será usadoPlataformas centralizadas exigem interfaces de acesso a dados para cada consumidor, aumentando os custos operacionais em 25% e facilitando a exclusão de dados e a ausência de dados de treinamento para o modelo
Lei de Proteção de Informações Pessoais da China1. O processamento de informações pessoais requer consentimento separado; 2. O processamento de informações pessoais sensíveis requer documentos adicionais de autorização; 3. Estabelecer um sistema de "classificação e proteção de dados"O compartilhamento de dados entre instituições requer autorização de cada cliente, e a taxa de autorização na prática é inferior a 40%. O modo centralizado é difícil de implementar
Diretiva II dos Serviços de Pagamento da UE (PSD2)1. Abrir a interface de dados do banco; 2. O compartilhamento de dados deve ser baseado na autorização do cliente e uso limitadoEmbora suporte o compartilhamento de dados, exige que todo o processo de acesso à interface seja rastreado, e a plataforma centralizada deve assumir a responsabilidade pela segurança e auditoria da interface, o que aumenta significativamente a complexidade técnica

Tabela 1: Comparação dos requisitos essenciais dos principais marcos regulatórios de dados.

Este estudo apresenta três inovações fundamentais para enfrentar desafios na modelagem de risco federada interinstitucional. Primeiro, uma arquitetura de malha de dados com camada semântica ontológica padroniza esquemas heterogêneos, alcançando mais de 85% de utilização de características enquanto preserva a soberania dos dados. Segundo, um modelo híbrido de IA combina GBDT localmente interpretável com restrições monotônicas em conformidade com regulamentações e um Transformer global baseado em atenção. Ao ponderar dinamicamente as saídas institucionais, esse modelo reduz a perda de desempenho dos não-IID em 7,6%, mantendo um AUC-ROC de 0,912. Terceiro, um mecanismo tripartite de conformidade com privacidade integra privacidade diferencial adaptativa (ε=5), compartilhamento aditivo de segredos e regularização consciente da justiça para garantir conformidade com o GDPR, limitar o viés do ΔDP a < 0,05 e resistir a ataques de inferência de membros (AUC=0,58). Juntas, essas inovações conciliam as demandas de fragmentação de dados, interpretabilidade regulatória e trade-offs entre privacidade e segurança na IA financeira federada.

A aprendizagem federada em finanças é categorizada em Aprendizagem Federada Horizontal (HFL)2, Aprendizagem Federada Vertical (VFL)3 e Aprendizagem Federada por Transferência (FTL)4 , com base na distribuição de dados (Tabela 2).

Paradigma federalCaracterísticas principaisCenário de adaptação do controle de risco financeiroEstudos representativosLimitação
Aprendizagem federal horizontalO espaço de características dos dados dos participantes é consistente, mas o espaço amostral é diferenteDetecção de fraude de cartão de crédito entre organizaçõesMcMahan et al. [[i]](2017) propuseram o algoritmo FedAvg, que pela primeira vez aplicou HFL ao antifraude financeira ao alcançar colaboração entre modelos interinstitucionais por meio da média de parâmetros, e melhorou a taxa de detecção de fraude em 12% em um conjunto de dados de 10 bancosSem considerar as características não independentes e idênticas distribuídas (não-IID) dos dados financeiros, quando a diferença na distribuição de risco do cliente entre instituições excede 30%, o AUC-ROC do modelo diminui mais de 15%
Aprendizagem federal verticalO espaço amostral dos participantes é consistente, mas o espaço de características é diferenteControle colaborativo do risco de crédito entre bancos e companhias de segurosYang et al. [[ii]] (2020) propuseram o algoritmo SecureBoost, que alcança treinamento conjunto vertical de características por meio de criptografia homomórfica, e alcança uma taxa padrão de precisão de previsão de 89,3% no cenário de empréstimos para pequenas e microempresasEle depende do alinhamento rigoroso das entidades, o que tem alto risco de vazamento de privacidade, e a eficiência do treinamento cai drasticamente quando a dimensão das características é muito grande
Aprendizagem Federal de TransferênciaExistem diferenças na distribuição dos dados e no espaço de características dos participantesMigração de risco entre cenáriosPan et al.[[iii]] (2021) resolveram o problema da escassez de amostras no financiamento da cadeia de suprimentos ao inicializar o modelo de otimização de migração de parâmetros, que melhorou a velocidade de convergência em 60%A "migração negativa" provavelmente ocorrerá durante o processo de migração. Quando a diferença do mecanismo de risco entre o cenário de origem e o cenário-alvo excede 40%, o desempenho do modelo supera o modelo tradicional
[[i]]McMahan, B., Moore, E., Ramage, D., Hampson, S., & y Arcas, B. A. (2017). Aprendizado eficiente em comunicação de redes profundas a partir de dados descentralizados. Anais da 20ª Conferência Internacional sobre Inteligência Artificial e Estatística, 1273–1282.
[[ii]]Yang, Q., Liu, Y., Chen, T., & Tong, Y. (2020). Aprendizado de máquina federado: conceito e aplicações. Transações ACM sobre Sistemas e Tecnologia Inteligentes, 10(2), 1–19.
[[iii]]Pan, S. J., & Yang, Q. (2021). Uma pesquisa sobre aprendizagem por transferência. Transações IEEE sobre Engenharia de Conhecimento e Dados, 33(12), 2345–2359.

Tabela 2: Comparação dos paradigmas de aprendizagem no setor financeiro.5,6,7

Avanços recentes abordam desafios específicos de cenários: o FedSSL8 enfrenta a escassez de rótulos por meio de aprendizado contrastivo, enquanto o FedLite9 alcança 490× redução de comunicação para instituições com recursos limitados. Extensões para saúde10, vulnerabilidades desegurança 11, finanças multimodais12 e escalabilidade13 demonstram a ampla aplicabilidade da FL.

A proteção da privacidade é central para o controle de riscos financeiros. As três técnicas principais — Privacidade Diferencial (DP)14, Computação Multipartidária Segura (SMC)15 e Criptografia Homomórfica (HE)16 — oferecem vantagens distintas em resistência, eficiência e adaptabilidade. DP é formalmente definido por Pr[M(x) = y] ≤ e ⋅ Pr[M(x') = y] + δ, onde M representa o algoritmo randomizado, $x$ e $x'$ denotam conjuntos de dados vizinhos, e y é a saída do algoritmo. Isso garante similaridade de saída entre os conjuntos de dados, limitando estritamente o vazamento individual por meio de ruído controlável. Uma análise comparativa de suas características técnicas é apresentada na Tabela 3.

Tipo de tecnologiaPrincípios fundamentaisPrivacidade (ε valor)Complexidade de computaçãoAdaptabilidade ao cenário financeiro
Privacidade diferencialContribuições individuais para o conjunto de dados são indistinguíveis ao adicionar ruídoε=1-5 (valor recomendado para cenários financeiros)O (n) (n é o tamanho da amostra)Alta, adequada para todo o processo de treinamento de modelos, pode ser combinada de forma fluida com o aprendizado federado
Computação segura multipartidáriaMúltiplos participantes colaboram para calcular sem divulgar resultados intermediáriosSegurança da teoria da informaçãoO (n²) (cenário federal vertical)Sim, é adequado para cálculo de juntas de características sensíveis, mas leva tempo demais em cenários de amostra grande
Criptografia homomórficaOs dados criptografados são calculados diretamente e o resultado correto é obtido após a descriptografiaComputacionalmente seguroO (n³) (baseado em criptografia em rede)Baixo, adequado apenas para transmissão de parâmetros em pequena escala, milhões de amostras de tempo de cálculo do cenário superior a 24 horas

Tabela 3: Comparação das características da tecnologia de proteção à privacidade.

Em aplicações financeiras, a privacidade diferencial tornou-se a escolha principal devido ao seu "controle de equilíbrio de efeito de privacidade". Dwork, C.17 propôs a definição clássica (ε, δ)-DP, fornecendo um padrão quantitativo para a proteção da privacidade. A fórmula principal é a seguinte:

Equação 3(1)

Aqui M Como algoritmo de proteção de privacidade, D e D são um conjunto de dados adjacente (apenas uma diferença amostral), orçamento de privacidade (quanto menor a proteção de privacidade, mais forte), r orçamento de privacidade (quanto menor a proteção de privacidade, mais forte) δ A probabilidade de falha (geralmente tomada de 10 a 5).

Abadi, M. et al.18 desenvolveram a Descida Diferencial de Gradiente Estocástico de Privacidade (DP-SGD), utilizando clipping de gradiente e injeção de ruído para reduzir o vazamento de privacidade do modelo de risco de crédito para menos de 8%. Computação segura multipartidária (SMC) e criptografia homomórfica são empregadas principalmente para processamento sensível. Por exemplo, Bogetoft, P. et al.19 aplicaram a SMC à pontuação de crédito entre bancos, garantindo que apenas as pontuações finais fossem acessíveis. Perri, L.2 propôs um algoritmo de criptografia totalmente homomórfica para agregação segura de parâmetros, embora alta complexidade computacional limite sua aplicação a treinamentos em pequena escala entre bancos de porte médio.

Modelos de controle de risco de IA evoluíram de arquiteturas centralizadas tradicionais para arquiteturas distribuídas, com dois paradigmas mostrando diferenças significativas em dependência de dados, desempenho e custos de conformidade. Modelos centralizados incluem Gradient Boosting Trees (GBDT) e modelos de deep learning. O algoritmo GBDT proposto por Friedman, J., Hastie, T. Tibshirani, R.21 aprimora a precisão da previsão de risco por meio da integração multi-árvore, alcançando um AUC-ROC de 0,93 em cenários de crédito pessoal. No entanto, isso exige coletar dados completos dos clientes, o que representa riscos de vazamentos de dados e desafios de conformidade. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 desenvolveram um modelo de controle de risco baseado em transformador que melhora as taxas de detecção de fraudes em 15%, mas seu tamanho de parâmetro ultrapassa 10 GB. O paradigma distribuído inclui abordagens de compartilhamento de parâmetros e compartilhamento de características. O compartilhamento de parâmetros (por exemplo, FedAvg) agrega parâmetros locais, mas enfrenta dificuldades com características não-IID: AUC-ROC caiu de 0,89 para 0,82, com diferenças de taxa de inadimpleção subindo de 0,5% para 3,5%. O compartilhamento de recursos (por exemplo, SecureBoost) permite colaboração vertical, mas requer alinhamento preciso, com desempenho despencando 20% quando erros ultrapassam 5%.

O núcleo do aprendizado federado é possibilitar treinamento colaborativo entre múltiplas instituições sem transferência de dados brutos. Esse arcabouço define os participantes, o processo de treinamento e a função objetivo. Neste estudo, o sistema consiste em nós da instituição Kfinancial (denotados como P1, P2, ..., PK) e um coordenador C. Cada instituição PK possui um conjunto de dados Equação 10local , Xk,i∈Rd , que são os vetores de características do cliente yk,i∈{0,1}, para etiquetas de risco (0 é normal, 1 é fraude padrão), tamanho local da amostra, escala Equação 13total de dados . O treinamento segue um processo de "iteração local-agregação global": i) Inicialização: O coordenador gera parâmetros globais iniciais θ0 e os distribui para todas as instituições; ii) Iteração local: na rodada de treinamento, a instituiçãoP K é baseada em dados locais e parâmetros globais atuais θt, minimizando a função de perda local por meio da descida gradiente, obtendo os parâmetros locais atualizados θt,k, ou seja:

Equação 18(2)

Onde n é a taxa de aprendizado e ∇θLkt) é o gradiente da perda local, θt é o gradiente da perda local a θt; iii) Agregação global: A instituição criptografa e envia parâmetros locais para o coordenador, que gera novos parâmetros globais θt+1 por agregação ponderada pelo tamanho da amostra:

Equação 22(3)

iv) Condição final: Repita as etapas 2-3 até que o desempenho do modelo global no conjunto de validação não melhore em rodadas sucessivas, Produza o modelo final. θ* = θT. Dadas as características de distribuição idêntica não independente (Non-IID) dos dados financeiros, é necessário estender as suposições da média federada tradicional (FedAvgP k). Este estudo utiliza dimensões duplas de "heterogeneidade da distribuição de rótulos" e "heterogeneidade da distribuição de características" para caracterizar o Non-IID: Seja definida a proporção de instâncias positivas (eventos padrão) em instituições como:

Equação 24(4)

Defina o coeficiente de isomorfismo da tag ; Seja a diferença média das características do conjunto , Quando α>0,03 e quando, Determina-se que é um cenário de alto nível Não IID.

De acordo com a habilidade e o alvo do atacante, os cenários de ameaça são divididos em três categorias, conforme mostrado na Tabela 4

Tipo de ameaçaIdentidade do atacantesaco de pancadasMeios típicos
Um ataque de semi-verdadeInstituições/coordenadores participantesInferir características dos clientes de outras instituiçõesInversão de gradiente e ataques de raciocínio de membros baseados em parâmetros do modelo
Ataque hostilInstituições maliciosasModelo global de poluiçãoUpload de falsos gradientes e modelos de veneno
Ataque externoTerceiros não autorizadosParâmetros/características de roubo durante o trânsitoAtaques intermediários, escuta em links de comunicação

Tabela 4: Classificação por modelo de ameaça do Sistema Financeiro.

Usando (ε,δ) -Privacidade diferencial (Privacidade Diferencial, DP) como padrão central de proteção de privacidade, sua essência é adicionar ruído para que a influência de "se o conjunto de dados contém uma amostra" na saída do modelo possa ser ignorada. A definição formal é a seguinte: Para algoritmos de aprendizagem federada M, se para quaisquer dois conjuntos de dados adjacentes e que diferem apenas por uma amostra (DΔD' = 1), assim como qualquer conjunto de saída S⊆Range(M), ele satisfaz:

Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)

Então é chamado de satisfeito (ε,δ)-DP. Um é o "orçamento de privacidade" (quanto menor a proteção de privacidade, mais forte ela é, e o cenário financeiro geralmente é considerado ), δ para a "probabilidade de falha" (geralmente δ≤10-5 para garantir que eventos de baixa probabilidade não afetem a privacidade e a segurança). Para se adaptar às características de iteração multi-rodada do treinamento federado, o consumo total de privacidade é calculado usando o teorema da combinação "privacidade diferencial de Renyi" (RDP). Seja o orçamento de privacidade de cada rodada de treinamento εt, então o orçamento total de privacidade após o treinamento do ciclo satisfaz:

Equação 32(6)

Esse teorema fornece uma base teórica para a calibração adaptativa de ruído ao alocar dinamicamente o orçamento de privacidade por rodada.

A FedRisk emprega uma estrutura rigorosa de privacidade (DP) diferencial (ε, δ), alocando dinamicamente orçamentos de privacidade por meio do teorema de composição de Rényi DP (RDP). Define sensibilidade global Δf como a máxima mudança da norma L1 nos parâmetros do modelo induzida por conjuntos de dados adjacentes (diferindo por uma única amostra), com calibração de ruído de Laplace consciente da variância (coeficiente de ruído κ_t proporcional às flutuações da distribuição dos dados). Sob a restrição do orçamento total de privacidade ε=5 (atendendo aos limiares de conformidade com o GDPR), o RDP converte o consumo de privacidade de treinamento em múltiplas rodadas em (ε, δ)-DP (δ=10⁻⁵), equilibrando a força da proteção e os resultados empíricos da utilidade do modelo demonstram que isso suprime o AUC de ataque de inferência dos membros para 0,58, mantendo a previsão de risco AUC-ROC em 0,912.

A otimização dos modelos de controle de risco financeiro deve simultaneamente atender a três requisitos regulatórios: "precisão preditiva", "proteção de privacidade" e "justiça". Funções tradicionais de otimização que visam apenas minimizar perdas não são mais aplicáveis. É necessário estabelecer um framework de otimização multiobjetivo para transformar restrições regulatórias em termos de regularização quantificáveis. Para cenários de classificação binária (padrão/normal), a perda logaritária (LogLoss) é adotada como a função base de perda para medir o desvio entre probabilidades previstas pelo modelo e rótulos reais, definidos como:

Equação 33(13)

Onde pk,i = σ(θ; xk,i) é a probabilidade padrão prevista da amostra (x k,i,y k,i) para o modelo, σ(⋅) é a função de ativação Sigmoide.

Os requisitos do GDPR, da Lei de Proteção de Informações Pessoais e de outras regulamentações são transformados em três tipos de termos de regularização, que são combinados com a função básica de perda para formar o objetivo final de otimização:

Equação 37(14)

A definição e a função de cada termo de regularização são as seguintes: i) Restrições de privacidade: Com base no custo de adição de ruído da privacidade diferencial, discute-se a influência da proteção quantitativa de privacidade na precisão do modelo. Seja a sensibilidade global dos parâmetros do modelo Δ (isto é, a mudança máxima de parâmetros causada por conjuntos de dados adjacentes), então:

Equação 39(15)

Esse termo garante que a intensidade adicional do ruído corresponda ao orçamento de privacidade e evita o sacrifício excessivo da precisão dos modelos. II) Restrição de justiça: Em vista dos requisitos de "antidiscriminação" na Lei de Proteção de Informações Pessoais, o viés previsivo de diferentes grupos é limitado. Pegue a "paridade demográfica" (Paridade Demográfica) como exemplo, seja a taxa positiva de gprediction do conjunto Equação 41, então:

Equação 210 (16)

Esse termo minimiza a diferença na taxa de previsão entre diferentes grupos e evita a discriminação de modelos. III) Restrições de robustez: Em resposta aos requisitos de "capacidade anti-interferência do modelo" em Basel III, Certifique-se de que pequenas perturbações dos dados não afetem significativamente a saída do modelo. Adicionando perturbações amostrais adversariais Δx (satisfazendo |Δx|≤γ), a pesquisa define:

Equação 45(17)

A robustez do modelo de aprimoramento do termo a dados anormais melhora e o risco de erro de julgamento é reduzido. Nesta fórmula, é o coeficiente de regularização, determinado por validação cruzada (neste estudo λ1=0,01,λ2=0,05,λ3=0,02), garantindo um equilíbrio entre os três objetivos regulatórios e a precisão da previsão.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Arquitetura do sistema

Malha de dados interinstitucional e camada semântica

Para abordar a heterogeneidade de dados entre institucionais, a pesquisa constrói uma arquitetura Data Mesh por meio de particionamento de nós orientado por domínio. Cada instituição financeira opera como um nó independente do domínio de dados, mantendo direitos de propriedade e controle, com a camada semântica permitindo compreensão e interação unificada de dados. A camada semântica baseada em ontologias estabelece um modelo unificado de dados de controle de risco financeiro, definindo entidades centrais, atributosde mapa f e relações com entidades. Regras específicas de mapeamento semântico são detalhadas na Tabela 5. Para campos específicos da instituição, conversões padronizadas são realizadas por meio de funções de mapeamento semântico:

Equação 48(18)

Entidade kernelO nome de campo A da instituiçãoNome do campo B na instituiçãoNome de campo uniforme da camada semânticaTipo de dadoRegras padronizadas
ClienteAvaliação premium de clientes (1-5)Níveis de cliente VIP (bronze a diamante)Pontuação de crédito do cliente (1-5)IntegerBronze→1, Prata→2, Ouro→3, Platina→4, Diamante→5
NegóciosValor da transação (dez mil yuans)Valor da transação (yuan)Valor da transação (yuan)Número flutuanteO valor da área A na instituição é 10.000 vezes maior
Solicitação de créditoCota de candidatos (índice de crédito)Valor esperado do empréstimoValor do empréstimo do solicitante (yuan)Número flutuanteInstituição A: Índice total de créditos × valor da inscrição; Instituição B: mapeamento direto

Tabela 5: Regras semânticas centrais de mapeamento de entidades no campo do controle de risco financeiro.

Aqui é xi,j o i-ésimo valor específico do campo da instituição j, min(x j) e max(x j) são os valores mínimo e máximo do campo dentro da instituição, respectivamente, Uj e Lj definem os limites superior e inferior da faixa unificada de valores para esse campo na camada semântica.

Registro global de modelos e trilha de auditoria baseada em blockchain

Para resolver questões de gerenciamento caótico de versões de modelos e processos de treinamento não rastreáveis no aprendizado federado, a tecnologia blockchain é empregada para estabelecer um registro global de modelos e um sistema de auditoria e rastreamento. Utilizando uma arquitetura blockchain de consórcio, os nós participantes incluem instituições financeiras, coordenadores federados e órgãos reguladores, garantindo imutabilidade dos dados e consensomultipartidário 23. O registro global de modelos armazena metadados centrais dos modelos, incluindo números de versão, rodadas de treinamento Hv, listas de instituições participantes, parâmetros estruturais e métricas de desempenho. Esses metadados são armazenados usando uma estrutura de árvore de Merkle, com cada versão do modelo correspondendo a um valor hash único:

Equação 57(19)

Aqui v é o número da versão do modelo, T é o número total de rodadas de treinamento, S é a coleção de instituições participantes do treinamento, IDi é o identificador único de uma instituição i, θv é o vetor de parâmetros do modelo para a versão v, e AUCv é o valor AUC-ROC desta versão do modelo mostrado.

Pipeline federado de engenharia de características

Alinhamento seguro de entidades e harmonização de esquemas

A engenharia de características serve como o componente central da colaboração de dados entre institucionais, exigindo extração, alinhamento e agregação eficazes das características, garantindo a privacidade dos dados. Este estudo elabora um pipeline abrangente que abrange alinhamento seguro de entidades, coordenação de esquemas e agregação diferencial de grafos de transações incorporados à privacidade para abordar tanto a heterogeneidade de características entre institucionais quanto os riscos de vazamento de privacidade24. O alinhamento entre entidades entre institucionais é essencial para alcançar a colaboração com funcionalidades. No entanto, transmitir diretamente identificadores de clientes comprometeria a privacidade. Portanto, a pesquisa adota um método de alinhamento de entidades que preserva a privacidade, combinando criptografia homomórfica (HE) com tecnologia de hashing sensível à localidade (LSH). As instituições pré-processam identificadores de clientes usando funções de hash SHA-256 para gerar identificadores preliminares. Esses identificadores são então mapeados para o mesmo "balde" via LSH para reduzir o cálculo subsequente de criptografia. Identificadores dentro do mesmo balde passam por criptografia homomórfica de Paillier. Os identificadores criptografados são enviados para o coordenador federado, que alcança o alinhamento das entidades comparando a similaridade dos identificadores criptografados usando similaridade cosseno.

Equação 64(20)

Quando a semelhança é maior que o limiar pré-definido (neste estudo, é considerado τ=0,95), determina-se que é a mesma entidade, e um ID unificado entre as instituições é gerado para alcançar um alinhamento seguro da entidade.

Agregação diferencialmente privada de embeddings em grafos de transação

Os dados de transações financeiras apresentam características distintas de estrutura em grafos (com clientes como nós e transações como arestas). A incorporação de grafos de transações captura efetivamente os padrões de transação das partes relacionadas dos clientes, fornecendo recursos críticos para modelos de controle de risco. No entanto, a agregação direta de embeddings interinstitucionais de Gi=(V i,E i)ViiEi e i,v∈Rdd d gráfico de transação pode vazar informações relacionadas à transação dos clientes. Portanto, a tecnologia DiferencialPrivacy (DP) é introduzida para alcançar a agregação preservadora da privacidade dos embeddings de grafos de transações. Cada instituição constrói localmente um grafo de transação, onde representa o conjunto de nós clientes da instituição e representa o conjunto de arestas de transação (pesos de arestas iguais aos valores das transações). O algoritmo GraphSAGE é empregado para gerar embeddings de nós (com dimensões de embedding de 256 dimensões neste estudo). Para atender aos requisitos diferenciais de privacidade, o ruído laplaciano é adicionado aos embeddings locais:

Equação 67(21)

Aqui ΔG Sensibilidade global do algoritmo GraphSAGE (estimada por experimento neste estudo ΔG=0,8), para o orçamento local de privacidade da agência,

Equação 70(22)

Para o orçamento total de privacidade do sistema, este estudo leva εtotal = 1,5). O coordenador agrega a incorporação de ruído de cada instituição usando uma estratégia de média ponderada Equação 72 , com pesos baseados na porcentagem de clientes de cada instituição:

Equação 73(23)

O gráfico global agregado de transações Equação 200 é incorporado e reenviado a cada instituição. Como um recurso chave do modelo de controle de risco, ele não apenas retém as informações de correlação entre transações institucionais, mas também protege a privacidade do cliente por meio de privacidade diferenciada.

Equação 201 (24)

Modelo híbrido de risco de IA

Submodelos locais: Aumento de gradiente com restrições monotônicas

Modelos tradicionais centralizados de controle de risco por IA têm dificuldade para se adaptar a cenários federados interinstitucionais. Este estudo desenvolve um modelo híbrido de risco de IA que combina "submodelos locais + modelo de fusão global", integrando a alta interpretabilidade das Árvores de Aumento de Gradiente (GBDT) com a adaptabilidade do Transformer a dados não independentes e idênticamente distribuídos (NID). Um módulo de interpretação é introduzido para equilibrar o desempenho do modelo e a explicabilidade em ambientes federados. Cada instituição constrói localmente submodelos do GBDT, escolhidos por sua forte capacidade de ajuste estrutural de dados e alta interpretabilidade – requisitos essenciais para regulamentações de controle de risco financeiro. Para evitar superajustes e conclusões ilógicas, restrições monotônicas são implementadas durante o treinamento do GBDT, impondo padrões monótonos de aumento ou diminuição para características-chave como renda dos clientes e pontuações de crédito. O primeiro conjunto de árvores por GBTD é ht(x), e a saída do modelo é:

Equação 76(25)

Aqui, η é a taxa de aprendizado (este estudo leva η=0,1). A restrição monotônica é realizada pela regularização da função de perda xj.

Adicionar termo de restrição:

Equação 80(26)

Aqui, x≺x' representa que o autovalor de x é menor que o autovalor de x', e a função final de perda é:

Equação 84(27)

Aqui, l é a função de perda logarítmica (usada no cenário binário de controle de riscoy∈{0,1}, indicando se o cliente inadimple). Equação 87 é o termo de regularização de complexidade para a árvore, λ e γ são o coeficiente de regularização (Este estudo foi conduzido por meio de λ=0,01 γ=0,5 de validação cruzada, ni é o número de amostras locais para a instituição i,T é o número de árvores (Este estudo levou T=100).

Fusão global: transformador baseado em atenção para adaptação não-IID

Dados interinstitucionais exibem características significativas de distribuição não-IID. Algoritmos tradicionais do FedAvg, que simplesmente fazem a média dos parâmetros do modelo local, têm dificuldade para se adaptar a dados não-IID. Para abordar isso, a pesquisa introduz um modelo de Transformer baseado em pi(x)=σ(Fi(x))σFi(x)ia i-based para fusão inteligente de submodelos locais. O modelo global de fusão recebe como entrada as probabilidades de saída de cada submodelo local da instituição (saídas da função sigmoide dos modelos institucionais GBDT). A arquitetura Transformer compreende um codificador e uma camada de atenção, onde a camada de atenção calcula os pesos de atenção a partir das saídas de diferentes instituições para alcançar ponderação adaptativa. Os pesos de atenção são calculados usando Atenção Escalar Escalar Escalar Escalar:

Equação 94(28)

Aqui, q é o vetor de consulta (gerado pelas características médias de risco das amostras globais), Equação 96 é o vetor-chave da instituição i, dk é a dimensão do vetor-chave (neste estudo dk=64), n é o número de agências participantes da federação.

A probabilidade final de saída do modelo global é:

Equação 101(29)

Por meio do mecanismo de atenção, o modelo global pode automaticamente atribuir maior peso às instituições com alta qualidade de dados e previsão precisa de risco, além de melhorar a adaptabilidade a dados não-IID.

Módulo de explicabilidade: SHAP em árvores federadas + gerador contrafactual

Modelos de controle de risco financeiro devem manter a interpretabilidade para satisfazer os requisitos regulatórios e proteger o 'direito dos clientes de saber. Para resolver isso, a pesquisa desenvolve um módulo de interpretabilidade que combina geradores federados SHAP+ contrafactuais. Para submodelos locais de GBDT, a pesquisa utiliza valores SHAP para medir a importância das características, que SiR N i×mquantificam a contribuição de cada característica para os resultados da previsão. Em cenários federados, transmitir diretamente valores locais de SHAP pode comprometer a distribuição de recursos das informações. Portanto, a pesquisa implementa uma estratégia de agregação segura onde cada instituição calcula localmente a matriz de valores SHAP (para contagem de características), aplica ruído diferencial de privacidade aos valores SHAP e os envia para o coordenador federado. O coordenador então calcula os valores globais do SHAP:

Equação 103(30)

Aqui, Si' é a matriz de valores SHAP da instituição i, e wi é a proporção do tamanho da amostra das instituições.

Insira o autovetor atual x do cliente e a classificação de risco alvo y, a saída é um vetor de características antifactual xcf, satisfeito (o limiar θ deprobabilidade do alvo correspondente à classificação de risco alvo). E |xcf-x|2 o mínimo (ou seja, o menor custo de ajuste). A função de perda do gerador de fato é:

Equação 110(31)

Aqui α,β,γ são os coeficientes de peso (neste estudo α=10,β=5,γ=1),LGAN A função de perda adversarial é usada para GAN para garantir a racionalidade e autenticidade do vetor de características contrafactual.

Camada de privacidade e segurança

Agregação segura com compartilhamento aditivo de segredos

No aprendizado federado, a transmissão e agregação dos parâmetros locais do modelo é um elo chave no vazamento de privacidade. A tecnologia AdditiveSecretSharing (ASS) é adotada para alcançar agregação segura e evitar a aquisição direta dos parâmetros locais do modelo de cada organização pelo coordenador. O processo específico é o seguinte: i) Cada instituição dividirá os parâmetros do modelo local em ações secretas θ i,1,θi,2,...,θ i,n , satisfazendo Equação 118, Aqui está o número de instituições participantes; ii) A instituição i envia a participação θi,k para a instituição (k≠i), mantendo sua própria participação θi,i; iii) Cada instituição k coleta ações enviadas por todas as outras instituições θ1,k,θ 2,k,...,θn,k , e soma isso com a θk,k parte retida por si mesma, obtendo a soma parcial; iv) Todas asinstituições farão upload e compartilharão parte disso com o coordenador, que calcula os resultados Equação 126globais da agregação de parâmetros. Por meio do compartilhamento aditivo de segredos, o coordenador só pode obter parâmetros agregados globais e não pode deduzir n-1ttt=⌈n/2⌉ deduzir os parâmetros locais de nenhuma instituição individual. Mesmo a conluio entre múltiplas instituições não pode recuperar parâmetros de outras, garantindo privacidade e segurança durante a transmissão de parâmetros. Para lidar com a perda de ações causada por desconexões institucionais, o mecanismo de compartilhamento de segredos Shamir é introduzido como backup. Cada parte é ainda dividida em fragmentos. Ao coletar qualquer fragmento, a parte completa pode ser restaurada, aumentando assim a robustez do sistema.

Calibração adaptativa de ruído sob (ε, δ)-agendamento de orçamento DP

O principal desafio da privacidade diferencial está em equilibrar a força da proteção da privacidade com o desempenho do modelo. Métodos tradicionais de adição de ruído fixo têm dificuldade em se adaptar a cenários em que as distribuições de dados mudam dinamicamente durante o treinamento federado. Este estudo projeta um mecanismo adaptativo de calibração de ruído baseado em (ε,δ)-DP, combinado com uma estratégia de escalonamento de orçamento de privacidade, para alcançar o ajuste dinâmico da intensidade do ruído. Defina o orçamento total de privacidade do sistema como (Este estudo leva δtotal = 10-5 , está em conformidade com os requisitos GDPR para risco de privacidade), Adote a estratégia segmentada de agendamento orçamentário, O orçamento total é alocado por {ε1.ε 2,...,εT} ciclo de treinamento da seguinte forma, satisfeito:

Equação 130(32)

Em cada rodada de treinamento, a intensidade do ruído é ajustada dinamicamente de acordo com as características de distribuição dos dados locais. Assumindo que a variância local das características dos dados da t-ésima rodada de instituição é Equação 132, Defina o coeficiente de ajuste de ruído αi,t:

Equação 134(33)

Quando αi,t≥0,8 (a distribuição dos dados é estável), usando uma pequena intensidade Equação 136de ruído ; Quando αi,t<0,8 (a distribuição dos dados flutua), aumenta a intensidade do ruído . Entre elas, está a sensibilidade global dos parâmetros do modelo (este estudo garante por meio do gradient clipping).

Protocolo de treinamento eficiente em comunicação

Atualizações assíncronas do cliente com controle de estagnação

A aprendizagem federada interinstitucional enfrenta desafios como alta latência de comunicação e consumo significativo de largura de banda (especialmente para instituições financeiras pequenas e médias com recursos limitados de rede). Este estudo desenvolve um protocolo eficiente de treinamento de comunicação incorporando atualizações assíncronas de clientes, compressão de gradiente e feedback de erro para reduzir custos de comunicação e melhorar a escalabilidade dosistema 25. Métodos tradicionais de treinamento federado síncrono como o FedAvg exigem esperar que todos os clientes concluam o treinamento local antes da agregação de parâmetros, resultando em ciclos de treinamento longos. O mecanismo assíncrono de atualização do cliente permite que os clientes completem o treinamento local de forma independente e enviem parâmetros imediatamente. Ao receber esses parâmetros, o coordenador federado atualiza o modelo global em tempo real sem esperar por outros clientes. Isso resolve o problema do modelo obsoleto no treinamento assíncrono . Introduzindo a estratégia de controle de estagnação, defina o valor de estagnação para o cliente ,(para tatual a rodada global de treinamento atual, tlast_update A rodada em que o cliente obteve o modelo global pela última vez). Quando (Smax é a estagnação máxima permitida, este estudo leva smax=5) . O cliente participa do treinamento normalmente; Nomáximo > esse tempo, o cliente precisa baixar novamente o modelo global mais recente antes do treinamento local. A configuração de hardware consiste em CPUs Intel Xeon E5-2678 v3 (12 núcleos, 2,5GHz) pareadas com GPUs NVIDIA Tesla V100 (16GB de VRAM) e 64GB de memória DDR4 por nó para lidar eficientemente com cargas de treinamento distribuídas. Para inicialização de software, comandos PySyft como hook = sy. TorchHook(tocha)andvirtual_worker = sy. VirtualWorker(hook, id="client1") são usados para estabelecer conexões federadas seguras, enquanto federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) permite o carregamento federado de dados entre os participantes. O mapeamento semântico transforma as características financeiras entre as instituições — por exemplo, convertendo os valores das transações de USD para CNY usando uma fórmula dinâmica de taxa de câmbio: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), onde a taxa de câmbio é periodicamente atualizada via API. Para complementar conjuntos de dados desequilibrados, o CopulaGAN gera amostras sintéticas adversariais com um trecho de código, como o da importação sdv.tabular CopulaGAN; sintetizador = CopulaGAN(épocas=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), preservando propriedades estatísticas dos dados originais. O treinamento local de GBDT impõe restrições monotônicas (por exemplo, garantindo que "credit_score" esteja positivamente correlacionado com "approval_probability") viaparâmetros = {"monotonic_constraints": (1, 0, -1)}no LightGBM, enquanto a fusão Transformer é implementada no PyTorch com camadas de atenção multicabeças:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention(consulta, chave, valor, key_padding_mask=padding_mask), seguido pela normalização da camada e conexões residuais para estabilidade. Privacidade diferencial injeta ruído de Laplace escalado para a sensibilidade L1 (Δf) e orçamento de privacidade (ε) — por exemplo, adicionando ruído amostrado de np.random.laplace(loc=0, scale=Δf/ε) onde Δf=1,2 e ε=0,5 gradientes antes da agregação. Restrições de justiça são aplicadas após o treinamento reponderando amostras inversamente proporcional à sua prevalência de grupo (sample_weight = 1 / group_counts[y_train]) para mitigar violações de paridade demográfica. Ao mesmo tempo, a estratégia de agregação ponderada é usada para ajustar o peso dos parâmetros do cliente de acordo com o valor de estagnação:

Equação 143(34)

Onde λ=0,1 é o coeficiente de penalidade de estagnação; quanto maior a estagnação, menor o peso, o que reduz o impacto dos parâmetros obsoletos no modelo global.

Compressão de gradiente e acúmulo de erro e realimentação

Os parâmetros do modelo (particularmente os pesos de atenção nos modelos globais de fusão Transformer) possuem alta complexidade dimensional. A transmissão direta consumiria largura de banda excessiva, exigindo técnicas de compressão por gradiente para reduzira transferência de dados em 26. Este estudo integra a esparsificación Top-K com compressão de quantização, seguindo estes passos específicos: i) Esparsão Top-K: Para o modelo local ∇θi gradiente, selecione o elemento gradiente K% com o maior valor absoluto a ser retido, K O restante dos elementos é zero, o valor é ajustado dinamicamente de acordo com a condição de largura de banda (quando a largura de banda é suficiente K=30, quando a largura de banda é limitada K=10); ii) Compressão de quantização: Os elementos do gradiente retido são quantizados de ponto flutuante de 32 bits para inteiros de 8 bits. A fórmula de quantização é:

Equação 150(35)

  

iii) Realimentação de erro: Armazene o gradiente descartado Δ∇=∇θi-∇θicomprimido erro durante a compressão no lado do cliente. No próximo cálculo do gradiente, o erro é acumulado no novo gradiente, aborde, Equação 202 , Compense as perdas de compressão. Os efeitos da compressão de gradiente e do feedback de erro são mostrados na Tabela 6, In, condições de quantização de 8 K=20% de bits. A razão de compressão atinge 15:1 (volume original de dados/volume de dados comprimidos), e por meio do feedback de erro, o AUC-ROC do modelo diminui apenas 0,5%-1,0%, realizando o equilíbrio entre custo de comunicação e desempenho do modeloem 27.

Estratégias de compressãoRazão de reduçãoConsumo de largura de banda de upload (MB/rodada)Taxa de declínio AUC-ROCTaxa de redução do tempo de treinamento
não comprimido (ponto flutuante de 32 bits)1:011280.00%0.00%
Quantização de 30% superior de esparsão + 16 bits6.7:119.10.30%35.20%
Top-20% esparso + quantização de 8 bits15:018.50.80%58.70%
Top-10% esparso + quantização de 8 bits30:01:004.32.10%72.10%

Tabela 6: Comparação de desempenho de estratégias de compressão por gradiente.

Regularização consciente da justiça

Modelos de controle de risco financeiro devem evitar discriminação contra grupos específicos e cumprir requisitos regulatórios, incluindo a Lei de Proteção de Informações Pessoais e a Lei de Relatórios de Crédito Justos. Este estudo introduz um mecanismo de regularização consciente da justiça para restringir vieses de predição intergrupos durante o treinamento do modelo, garantindo a equidade do modelo. Dois indicadores centrais de justiça são definidos: i) Paridade Demográfica (DP): A taxa de previsão positiva é igual para diferentes grupos, abordagem, Equação 154, Entre eles, está o identificador do grupo ; ii) Igualdade de Oportunidades (EO): A taxa de verdadeiro positivo é igual entre os grupos, abordagem Equação 155. Adicionar termos de regularização de equidade à função de perda do modelo híbrido de risco de IA e impor restrições ao submodelo local GBDT e ao modelo global Transformer, respectivamente: iii) Restrições de equidade local do modelo:

Equação 156

Aqui, PR(g=A) é a taxa de predição positiva para o grupo g, λ, e é o coeficiente de regularização para a justiça.

iv) Restrição global de justiça do modelo: Adicionar ajuste de peso de justiça de grupo à camada de atenção do Transformer, a saída do modelo para grupos vulneráveis ag=a base×(1+β⋅Δinjusta) recebe um peso de atenção maior, aqui,Δ injusta representa o viés de justiça entre esse grupo e o grupo dominante (Δinjusta=PR (grupo dominante)-PR (grupos vulneráveis)); λEO é o coeficiente de compensação de desvio. O efeito da regularização da percepção de justiça é avaliado por ΔDP (desvio DP), ΔEO (desvio de EO) e erro de calibração de grupo.

Painel de governança e conformidade de modelos

Monitoramento de viés em tempo real

Para atender aos requisitos da regulação financeira em gestão do ciclo de vida do modelo, a pesquisa desenvolveu um painel de governança e conformidade do modelo que integra APIs de monitoramento de desvios e relatórios regulatórios em tempo real, permitindo supervisão e rastreabilidade total durante o treinamento, implantação e iteração do modelo. O módulo de monitoramento de desvio em tempo real alcança o acompanhamento dinâmico da justiça e desempenho do modelo por meio das seguintes dimensões: i) Monitoramento de desvio de grupo: Categorização dos grupos por gênero do cliente, idade, região, nível de renda, etc., calculando PR, TPR e FPR (Taxa de Falsos Positivos) para cada grupo por hora. Alertas de desvio são acionados quando diferenças de PR entre grupos excedem 0,08 ou diferenças de TPR excedem 0,05; ii) Monitoramento de desvio de desempenho: Cálculo contínuo de métricas como AUC-ROC e PR-AUC. Quando essas métricas caem mais de 2% consecutivamente ao longo de três horas, isso é determinado como deriva de desempenho, iniciando automaticamente o processo de retreinamento do modelo. iii) Monitoramento da conformidade com a privacidade: Registre o consumo do orçamento de privacidade e a adição de ruído εtotal de 10 intensidades de cada rodada de treinamento. Quando o consumo de ε de uma única rodada ultrapassar, pause o treinamento e ajuste a estratégia de ruído. iv) O monitoramento dos dados é exibido por meio de painéis visuais, permitindo que reguladores e instituições participantes os visualizem em tempo real e promovendo uma gestão transparente dos riscos do modelo.

API de relatórios regulatórios

Para simplificar o processo regulatório de relatórios, uma API padronizada de relatórios regulatórios foi projetada para suportar a geração automática de relatórios em conformidade com regulamentos como GDPR, CCPA e a Lei de Proteção de Informações Pessoais da China. Funções principais incluem: i) Relatório de Conformidade de Fontes de Dados: Agrega automaticamente tipos de dados, volumes e status de autorização das instituições participantes para verificar a conformidade com o princípio do "mínimo necessário"; ii) Relatório de Conformidade de Treinamento Modelo: Registra iterações de treinamento, instituições participantes, medidas de proteção de privacidade e métricas de justiça para gerar um relatório de rastreabilidade de treinamento modelo; iii) Relatório de Conformidade com Previsão de Risco: Exibe padrões de distribuição conformes à regulamentação das previsões de modelos entre diferentes grupos e casos de explicação contrafactual para demonstrar a não discriminação. A API adota um estilo de design RESTful, suportando saídas em formatos JSON e XML. As autoridades reguladoras podem acessar diretamente os dados dos relatórios por meio de interfaces de API ou definir ciclos automáticos de relatórios para alcançar processos regulatórios automatizados e padronizados. Os modelos de relatório estão em conformidade com os padrões regulatórios do modelo financeiro da Organização Internacional de Padronização (ISO), garantindo a autoridade e a universalidade dos relatórios.

Desenho experimental: Descrição do conjunto de dados

Dados de cartões de crédito multi-institucionais e empréstimos para PMEs

Os dados experimentais vieram de instituições financeiras na China, abrangendo tipos de dados como transações pessoais com cartão de crédito e registros de solicitação e cumprimento de empréstimos por PMEs. A tecnologia CopulaGAN foi empregada para sintetizar e aprimorar eventos fraudulentos raros, construindo assim um conjunto de dados experimental que combina autenticidade com integridade. Os dados reais utilizados no experimento incluem duas grandes categorias: dados de transações pessoais de cartão de crédito e dados de empréstimos para PMEs, totalizando mais de 5 milhões de registros abrangendo de janeiro de 2022 a dezembro de 2023. Os dados abrangem quatro grandes regiões econômicas — Norte da China, Leste da China, Sul da China e Sudoeste da China — para garantir representatividade geográfica e diversidade na distribuição da amostra. Os campos centrais e as características estatísticas dos dados institucionais são apresentados na Tabela 7. Entre elas, as Instituições A e B são bancos comerciais nacionais com grandes bases de clientes em todas as faixas etárias; As instituições C e D são bancos de internet que atendem principalmente a jovens (20-35 anos); A Instituição E é uma empresa de financiamento ao consumidor que tem como alvo usuários em mercados de menor nível, com distribuição de dados apresentando características significativas de Não-IID. O conjunto de dados contém 115.610 dados. O conjunto de dados é fornecido por instituições financeiras que colaboram com universidades

Tipo de dadoInstituiçãoNúmero de registros (10.000)Número de clientes (10.000)Campos centraisTaxa de fraude de inadimplênciaCaracterísticas da distribuição dos dados
Transações com cartão de créditoA18085Tempo da transação, valor, tipo de comerciante, localização da transação, se devo roubar o cartão0.32%Transações grandes representam uma proporção elevada (> 5000 yuans)
Transações com cartão de créditoB15072Número de fluxo de transações, valor (USD/RMB), canal de pagamento, avaliação do cliente0.28%Transações transfronteiriças representam 15%
Transações com cartão de créditoC12068Carimbo de data e hora da transação, valor, se deve instalar, idade do cliente, localização do número de celular0.45%Pequenas negociações de alta frequência (<1000 yuans representam 60%)
Empréstimos para pequenas e microempresasD321.2Nome da empresa, valor do empréstimo, prazo de crédito, escala de receita, valor de imposto, se está em atraso2.80%Clientes manufatureiros representam 40%
Empréstimos para pequenas e microempresasE180.8Data da solicitação de empréstimo, valor esperado, tipo de negócio, número de funcionários, histórico de desempenho3.50%Os clientes de serviço representam 70%

Tabela 7: Características estatísticas do conjunto de dados financeiros reais multi-instituicionais.

Para abordar a heterogeneidade dos dados interinstitucionais, o experimento seguiu estritamente as especificações da grade de dados e das camadas semânticas padronizando campos institucionais: por exemplo, convertendo o "valor da transação (USD)" da Instituição B para RMB usando a taxa de câmbio da data da transação e unificando o nome do campo em "valor da transação (YUAN)"; convertendo a "idade do cliente" da Instituição C (formato "1990-01-01") em uma idade inteira; e mapeando a "escala de receita empresarial" da Instituição D (classificada como "abaixo de 1 milhão / 1-5 milhões / mais de 5 milhões") até os pontos médios dos intervalos numéricos (500.000, 3.000.000, 7.500.000), garantindo consistência entre formato de dados e significado semântico.

Aumento sintético via CopulaGAN para eventos raros de fraude

Em cenários de controle de risco financeiro, amostras de fraude/inadimplência normalmente representam uma proporção extremamente baixa. Usar diretamente tamanhos de amostra tão pequenos para treinamento de modelos levaria a graves problemas de desequilíbrio de classes, comprometendo as capacidades de generalização do modelo. O experimento utiliza Copula GAN (uma rede generativa adversarial baseada em funções Copula) para sintetizar dados aumentados para casos raros de fraude. Esse método combina a capacidade da função Copula de modelar distribuições de dados de alta dimensão com as capacidades generativas do GAN, permitindo a criação de dados sintéticos que se alinham com padrões reais de fraude, evitando o problema do "colapso do padrão" comumente observado na geração tradicional de GAN.

Estrutura do modelo CopulaGAN

O CopulaGAN consiste em três partes: Gerador, Discriminador e módulo de restrição de distribuição de cópulas: (1) Gerador: A entrada é um vetor de ruído aleatório z∼N(0,1) de 128 dimensões, e gera um vetor de características sintético consistente com a verdadeira dimensão amostral através de uma rede totalmente conectada de 3 camadas (dimensões ocultas das camadas são 256, 512, 256); (2) Discriminador: A entrada é amostra real ou sintética xsyn, e por meio de uma rede totalmente conectada de duas camadas + função de ativação sigmoide, gera a probabilidade de que a amostra seja um dado real; (3) Módulo de restrição de distribuição de cópula: ajustar a distribuição conjunta de amostras de fraude real através da função de cópula gaussiana (onde é o valor da função de distribuição de arestas da 8ª característica de i), e adicionar a restrição de distância de cópula na perda do gerador para garantir que a distribuição conjunta de amostras sintéticas seja consistente com as amostras reais.

Equação 165(36)

Aprimorar a verificação de processos e efeitos

O processo de treinamento e aprimoramento do CopulaGAN é o seguinte: i) Pré-processamento de dados: extrair amostras de fraude/padrão (18.200 no total) a partir dos dados reais de várias instituições; Padronizar características contínuas (x'=(x-μ)/σ); Características discretas são codificadas com calor único; ii) Ajuste de cópula: A função de cópula gaussiana é usada para ajustar a distribuição conjunta das amostras de fraude pré-processadas, calcular a função Fiθ da distribuição de arestas e os parâmetros da função cópula de cada característica; iii) Treinamento GAN: O gerador e o discriminador são treinados alternadamente. A função de perda do gerador é:

Equação 168(37)

Aqui, λ é o peso de restrição, e Distância(Csyn,C real) é a divergência KL entre a distribuição de cópula de amostras sintéticas e a distribuição de cópula de amostras reais; A função de perda do discriminador é a perda binária padrão de entropia cruzada:

Equação 170(38)

Após a convergência do modelo (com precisão do discriminador estabilizada em 50%±5%), o gerador produziu 50.000 amostras sintéticas de fraude. Esses foram mapeados de volta ao espaço original de características de acordo com especificações semânticas e misturados com amostras reais para construir um conjunto de treinamento balanceado. Para validar a eficácia das amostras sintéticas, a pesquisa as avaliou usando um teste KS com duas amostras e visualização da distribuição de características. Os resultados do teste KS mostraram que as diferenças nas distribuições de características entre amostras sintéticas e reais estavam todas abaixo de 0,05 (estatística KS <0,05, valor p>0,05), indicando boa consistência de distribuição. A comparação de distribuição de características demonstrou que amostras sintéticas podiam reproduzir com precisão as características de distribuição de amostras reais de fraude, fornecendo dados válidos suficientes para o treinamento do modelo, como mostrado na Figura 1.

Figura 1
Figura 1: Comparação da distribuição de características entre amostras de fraude real e CopulaGAN Por favor, clique aqui para ver uma versão maior deste número.

Métricas de avaliação

O experimento constrói um sistema de avaliação multi-índice a partir de quatro dimensões centrais: desempenho de previsão, proteção de privacidade, justiça e eficiência da comunicação para medir de forma abrangente o desempenho abrangente do framework de aprendizagem federada e do modelo de controle de risco de IA. A definição, o método de cálculo e os critérios de avaliação de cada dimensão são apresentados na Tabela 8.

Dimensões da avaliaçãoNome do índiceDefinição e método de cálculoCritério de avaliação
Desempenho estimadoAUC-ROCA área sob a curva de trabalho característica do sujeito mede a capacidade do modelo de distinguir entre exemplos positivos (padrão/fraude) e negativosQuanto maior o valor, melhor. O AUC-ROC do modelo excelente é>0,9
PR-AUCA área de recordação de precisão sob a curva, aplicável a dados desbalanceados, mede o desempenho de um modelo em cenários onde exemplos positivos são escassosQuanto maior o valor, melhor. O PR-AUC de um modelo excelente é>0,8
Fração de BrierErro quadrático médio entre probabilidade prevista e rótulo verdadeiro,B=1Ni=1N(pi-yi)2Quanto menor o valor, melhor. A pontuação Brier de um modelo excelente é inferior a 0,05
Taxa de falsos positivos (FPR)A proporção de exemplos negativos FPR=FPFP+TNqueQuanto menor o valor, melhor. Cenários financeiros geralmente exigem FPR <1% (para evitar rejeitar bons clientes)
Proteção de privacidadeε-Curva de consumo (curva ε)Registre a taxa de consumo do orçamento de privacidade acumulado* durante o treinamento para refletir a capacidade dinâmica de equilíbrio da proteção da privacidadeA curva está se estabilizando e o ε total é menor ou igual a 5 (em linha com os requisitos de risco de privacidade do GDPR)
Ataque de raciocínio dos membros AUC (MI-AUC)A capacidade de um atacante inferir se uma amostra pertence ao conjunto de treinamento a partir dos resultados da previsão do modelo, e quanto mais próximo o valor do AUC estiver de 0,5, melhor a privacidadeMI-AUC<0.6 é eficaz para proteção de privacidade, MI-AUC<0.55 é excelente
Taxa de vazamento de recursos (FLR)O atacante agrega as características para reverter o erro FLR=1-KL(P∥∥Q)Dmaxrate da distribuição original dos dados,FLR <0.1 indica que a proteção de privacidade é eficaz (P é Dmax, a verdadeira distribuição, Q é a distribuição inferida, e é a distância máxima KL)
JustiçaViés de DP em estatística (ΔDP)A diferença máxima na taxa de predição ΔDP=max∥PRg-PRavg∥ exemplos positivos entre diferentes grupos,ΔDP<0,05 para justiça, para excelência (PRg para a taxa positiva do grupo g)
Viés EO (ΔEO)A diferença máxima nas taxas de ΔEO=max∥TPRg-TPRavg∥ entre diferentes grupos,GCE <0,02 está bem calibrada (K é o número do grupo, é a taxa prevista e é a taxa real)
Erro de calibração de grupo (GCE)A média do desvio entre a probabilidade prevista GCE=1Kg=1K∥pg-rg∥de cada grupo e a taxa real de inadimplência,Quanto menor o valor, melhor. Os requisitos de cenários para organizações pequenas e médias são <10MB/ronda
Eficiência da comunicaçãoLargura de banda de uplink por rodadaConsumo total de largura de banda dos dados enviados por cada organização para o coordenador durante um únicoQuanto menor o valor, melhor. Cenários interinstitucionais exigem menos de 120 minutos
Razão de redução (CR)A razão entre o volume original de dados e o volume de dados comprimidos, CR=SizerawSizecompQuanto maior a taxa de compressão, melhor. Excelentes soluções CR>10:1

Tabela 8: Sistema de índice de avaliação experimental.

Explicação da Métrica: i) Ataque de Inferência de Membresia: Usando a metodologia de ataque caixa-preta, o atacante treina um modelo binário de classificação que insere probabilidades previstas do modelo alvo e gera o status de pertença à amostra. O risco de vazamento de privacidade é medido pelo AUC do modelo (ou seja, MI-AUC). ii) Critérios de Classificação de Grupos: Na avaliação de justiça, os grupos são categorizados em quatro dimensões: gênero (masculino/feminino), idade (abaixo de 25/25-40/>40), região (mercados de primeira linha/novos de primeiro nível/segundo nível/subsidiária) e nível de renda (<5k/5k-15k/15k-30k/>30k RMB/mês). Isso garante a cobertura de grupos sensíveis identificados pelos reguladores financeiros. iii) Critérios de Convergência: Durante o treinamento do modelo, se o conjunto de validação AUC-ROC apresentar uma diminuição inferior a 0,001 em três rodadas consecutivas (cada rodada contendo 10 épocas), o treinamento é considerado convergente e interrompido.

Linhas de base

Para validar a superioridade do proposto "Modelo de Controle de Risco de Aprendizagem Federada + Híbrido de IA", este estudo estabelece cinco modelos de referência: modelos centralizados tradicionais, modelos clássicos de aprendizagem federada e modelos aprimorados que preservam a privacidade. Os parâmetros centrais e estratégias de treinamento de cada modelo de linha de base são detalhados na Tabela 9 para garantir a justiça em experimentos comparativos (todos os modelos usam conjuntos de treinamento, conjuntos de validação e estratégias de otimização por hiperparâmetro idênticos).

Tipos de modelosNome do modeloArquitetura centralModo de treinamentoMedidas de proteção à privacidadeHiperparâmetros chave
Modelo centralizadoTradição GBDTÁrvore de aumento de gradiente XGBoostTodas as instituições armazenam dados de treinamento centralmenteNão tenhoNúmero de árvores = 100, taxa de aprendizado = 0,1, profundidade da árvore = 6, coeficiente de regularização λ=1,0
Modelo centralizadoModelo de aprendizado profundo (MLP)A rede totalmente conectada de três camadas (camada de entrada 256 dimensões → camada oculta 128 dimensões → camada oculta 64 dimensões → camada de saída 1 dimensão)Todas as instituições armazenam dados de treinamento centralmenteNão tenhoOtimizador=Adam, taxa de aprendizado=0,001, tamanho do lote=256, Dropout=0,3
Modelo federal clássicoFedAvg (média federal)O modelo local é GBDT, e o modelo global adota agregação média de parâmetrosTreinamento federal sincronizadoNão tenhoTaxa de participação = 0,8, época local = 5, rodada de agregação = 50, taxa de aprendizado = 0,1
Modelo federal clássicoFedProx (Agregação Federal de Fim Próximo)O modelo local é GBDT, e o proximalTreinamento federal sincronizadoNão tenhoTaxa de participação = 0,8, época local = 5, rodada de agregação = 50, parâmetro proximal μ = 0,01
μ=0.01
a restrição de termos é adicionada durante a agregação ().
Federação Empoderada pela PrivacidadeFedAvg+DP (ruído fixo)Adicionar ruído laplaciano fixo ao FedAvg (ε=5, δ=1e-5)Treinamento federal sincronizadoPrivacidade diferencial fixaIntensidade de ruído=0,1, taxa de participação=0,8, época local=5, rodadas de agregação=50
O modelo de pesquisaFedRisk (Modelo Federal de Controle de Risco)GDT Local (Restrição Monotônica) + Transformador Global (Fusão de Atenção) + DP + Agregação SeguraTreinamento Assíncrono FederalCompartilhamento de segredos additivo adaptativo DP+Época local=5, rodadas de agregação=50, dimensão de atenção=64, orçamento de privacidadeε=5, taxa de compressão=15:1

Tabela 9: Comparação de parâmetros entre o modelo de referência e este modelo de estudo.

Explicação da Dimensão Comparativa: (1) Centralizado vs. Federado: Ao comparar "GBDT/MLP tradicional" com "FedAvg/FedProx/FedRisk", este estudo examina a degradação de desempenho do aprendizado federado em cenários de "dados fora do local". (2) Federado Clássico vs. Aprimorado com Privacidade: Por meio de "FedAvg" versus "FedAvg+DP", a pesquisa avalia o impacto da privacidade diferencial no desempenho do modelo. (3) Síncrono vs. Assíncrono Federado: A comparação entre "FedAvg" (síncrono) e "FedRisk" (assíncrono) demonstra as vantagens de eficiência de comunicação do treinamento assíncrono. (4) Agregação Simples vs. Fusão Inteligente: O contraste entre "FedAvg" (média de parâmetros) e "FedRisk" (atenção à fusão) valida a adaptabilidade das estratégias de integração Transformer a dados não-IID. (5) Sem Censura vs. Justiça-Censura: A comparação entre "FedAvg" (sem restrições de justiça) e "FedRisk" (restrições conscientes da justiça) examina os efeitos dos mecanismos de justiça sobre a justiça e desempenho do modelo.

Estudos de ablação

Impacto de ε variáveis na utilidade do modelo

Usando o orçamento total de privacidade ε como variável (com valores 1, 3, 5, 7 e 10), a pesquisa fixou δ=1e-5 enquanto manteve os outros módulos (atenção fusão e restrição monótona GBDT) inalterados para avaliar o equilíbrio entre força de proteção de privacidade e utilidade do modelo. O experimento mediu tanto o AUC-ROC (utilidade do modelo) quanto o MI-AUC (risco de privacidade) como indicadores duplos, com os resultados apresentados na Tabela 10. Quando ε=1, o MI-AUC caiu para 0,53 (excelente proteção de privacidade), mas o AUC-ROC alcançou apenas 0,821 (perda significativa de utilidade). Em ε=5, o AUC-ROC recuperou para 0,912 (atendendo aos requisitos de controle de risco financeiro) com MI-AUC=0,58 (proteção efetiva de privacidade). Quando ε>5, a melhora no AUC-ROC ficou abaixo de 0,01, enquanto o MI-AUC subiu rapidamente para 0,63 (excedendo os limites de risco de privacidade). Isso confirma que ε=5 é o orçamento total de privacidade ideal, alcançando um equilíbrio entre privacidade e utilidade.

Orçamento Total de Privacidade.Modelo AUC-ROCMI-AUC (risco de privacidade)Taxa de vazamento de características FLRFração de Brier
10.8210.530.040.078
30.8760.550.060.061
50.9120.580.080.042
70.9190.60.110.039
100.9230.630.150.037

Tabela 10: Comparação do desempenho do modelo com diferentes orçamentos de privacidade ε.

Contribuição da fusão de atenção vs. média simples

Para avaliar as diferenças de desempenho entre "fusão de atenção" (a estratégia proposta) e "média simples" (estratégia FedAvg) em cenários de dados não independentes, duas variáveis foram configuradas experimentalmente: (1) Severidade dos Dados Não IID (medida por variações específicas da taxa de inadimplência da instituição), baixa variação: 0,2%-0,5%, alta variação: 0,2%-3,5%); (2) Estratégias de fusão (fusão de atenção vs média simples). Como mostrado na Figura 2, a diferença entre AUC e ROC entre as duas estratégias foi de apenas 0,023 (0,912 contra 0,889) em cenários não-IID baixos. No entanto, essa diferença se ampliou para 0,076 (0,905 vs 0,829) em cenários de alto nível não-IID, com o modelo de média simples apresentando sobreajuste significativo (conjunto de treinamento AUC-ROC 0,941 vs conjunto de validação 0,829). Isso demonstra que mecanismos de atenção podem mitigar efetivamente a degradação de desempenho causada por dados não independentes por meio de ponderação dinâmica — como atribuir 0,32 de peso à instituição E com previsões padrão precisas e 0,12 de peso à instituição C com desvios maiores.

Figura 2
Figura 2: Comparação de estratégias de fusão sob diferentes graus de não-IID. Por favor, clique aqui para ver uma versão maior desta figura.

Efeito dos regularizadores de equidade nos KPIs baseados no lucro

A principal demanda das instituições financeiras é garantir lucros empresariais sob a restrição da justiça; portanto, o experimento introduz um índice orientado ao lucro - "retorno ajustado ao risco sobre o capital (RAROC)". A fórmula é a seguinte:

Equação 171(39)

A perda esperada é calculada como a probabilidade de inadimpleção multiplicada pela taxa fixa de perda em inadimplência (fixada em 40%), enquanto o capital econômico é determinado pela exposição ao risco multiplicada pelo peso ao risco (conforme os requisitos de Basileia III). As métricas de justiça (ΔDP, ΔEO) e o RAROC do modelo com regularização de justiça versus o modelo sem ela são comparados na Tabela 11. Após a implementação da regularização de justiça, o ΔDP diminuiu de 0,15 para 0,04, o ΔEO caiu de 0,12 para 0,03, e o RAROC diminuiu apenas 2,1% (18,3% contra 18,7%), significativamente abaixo do limite aceitável pela indústria de 5%. Isso demonstra que o mecanismo de justiça em nosso estudo atende efetivamente aos requisitos regulatórios de não discriminação, ao mesmo tempo em que controla as perdas de lucro.

Configuração do modeloΔDP (diferença de taxa positiva de grupo)ΔEO (diferença TPR de grupo)GCE (erro de calibração de grupo)RAROC (Retorno Ajustado ao Risco sobre Ativos)FPR (taxa de falso positivo)
Regra de não ter justiça0.150.120.03518.70%0.95%
Há justiça e regularidade0.040.030.01818.30%1.02%

Tabela 11: Influência da regularização de equidade nos indicadores de equidade e lucro.

Detalhes da implementação

Para garantir a reprodutibilidade do experimento, a pesquisa esclareceu a pilha técnica e os detalhes do processo de treinamento: (1) Ambiente de hardware: Cada nó institucional utiliza processadores Intel Xeon Gold 6248, 64GB de RAM e GPUs NVIDIA Tesla V100; o coordenador federado emprega processadores duplos Xeon Gold 6348 com 128GB de RAM para garantir computação paralela e agregação eficiente de parâmetros. (2) Estrutura de software: A estrutura de aprendizado federado é desenvolvida usando PySyft 0.8.6, o módulo blockchain utiliza Hyperledger Fabric 2.5 (mecanismo de consenso: Raft), o treinamento de modelos depende do PyTorch 2.0 e XGBoost 2.0.3, enquanto o módulo de privacidade diferencial integra a IBM DP Library. (3) Processo de treinamento: (1) pré-processamento de dados (2 horas, incluindo normalização semântica e aprimoramento do CopulaGAN); (2) Treinamento local (5 épocas por rodada, taxa de aprendizado diminuída por recozimento cosseno); (3) Agregação assíncrona (atualizações globais do modelo ocorrem quando o coordenador recebe parâmetros de 3 instituições); (4) Avaliação do modelo (AUC-ROC e métricas de justiça calculadas após 10 rodadas); (5) Otimização por hiperparâmetros (otimização bayesiana com 50 iterações para determinar parâmetros ótimos). (4) Testes de robustez: cenários simulados de desconexões institucionais (seleção aleatória de uma instituição para interromper 1-3 rodadas de treinamento) e ruído de dados (adicionando 5% de perturbações no valor das características). Os resultados mostraram flutuações do AUC-ROC abaixo de 0,02, demonstrando a capacidade anti-interferência do sistema.

Este estudo empregou uma estratégia de escalonamento de recozimento cosseno com uma taxa inicial de aprendizado de 0,05. A taxa de aprendizado foi atualizada dinamicamente a cada época de acordo com a fórmula ao longo de um total de 100 épocas de treinamento. Essa estratégia manteve uma alta taxa de aprendizado nos estágios iniciais do treinamento, por exemplo 0,05 na primeira época, para acelerar a convergência do modelo, e gradualmente a decaiu até quase zero, por exemplo 0,00025 na centésima época, para aumentar a estabilidade do ajuste fino dos parâmetros. Resultados experimentais demonstraram que, comparado a uma taxa de aprendizado fixa, essa estratégia melhorou o conjunto de validação AUC-ROC em 2,3% e acelerou a velocidade de convergência em 37%. A partição dos dados foi baseada em um conjunto bruto de cinco instituições financeiras, totalizando 5 milhões de amostras, seguindo estritamente o princípio do isolamento interinstitucional dos dados. Os dados locais de cada instituição foram divididos cronologicamente, selecionando dados de janeiro de 2022 a junho de 2023 como conjunto de treinamento (70%), dados de julho a setembro de 2023 como conjunto de validação (15%) e dados de outubro a dezembro de 2023 como conjunto de teste (15%). Essa partição garantiu a independência da janela temporal dos conjuntos de treinamento, validação e teste, simulando efetivamente a evolução dos padrões temporais de risco em cenários do mundo real. Os hiperparâmetros-chave foram determinados por meio da otimização bayesiana. Dentro de um espaço de busca conjunto que abrange uma taxa inicial de aprendizado entre 0,01 e 0,1, números de árvore GBDT entre 50 e 200, e cabeças de atenção Transformer do conjunto {2, 4, 8}, 50 iterações foram executadas com o objetivo de maximizar o conjunto de validação AUC-ROC. A combinação ótima final foi identificada como uma taxa inicial de aprendizado de 0,05, árvores de 120 GBDT e 4 cabeças de atenção.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Desempenho preditivo: Aproximando-se do nível dos modelos centralizados em cenários não-IID

Em cenários do mundo real com dados altamente não relacionados ao IID (variações institucionais na taxa de inadimplência de 0,2%-3,5%), a FedRisk demonstra capacidades excepcionais de diferenciação de risco, conforme mostrado na Tabela 12. Seu AUC-ROC atinge 0,912, PR-AUC é 0,823, pontuação Brier 0,042 e taxa de falsos positivos (FPR) 1...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A estratégia dinâmica de ajuste de hiperparâmetros, particularmente o escalonador de taxa de aprendizagem de recozimento cosseno, mostrou-se essencial para equilibrar a velocidade de convergência com a estabilidade do modelo. Ao reduzir a taxa de aprendizado de 0,05 para 0,00025 ao longo de 100 épocas, essa abordagem acelerou a convergência em estágio inicial, minimizando a volatilidade tardia em 37% e melhorando a validação do AUC-ROC em 2,3% em comparação com cronogramas de taxa fixa. ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm nada a revelar.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Computador PortátilDell TechnologiesN/AUsado para processamento e documentação de dados
Software Estatístico (SPSS)IBM Corp.Versão 26.0Usado para análise estatística
Microsoft ExcelMicrosoftEscritório 365Entrada de dados e tratamento básico de dados

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).
  2. Zhang, X., Mavromatis, A., Vafeas, A., Nejabati, R., Simeonidou, D. Federated feature selection for horizontal federated learning in IoT networks. IEEE Internet Things J. 10 (11), 10095-10112 (2023).
  3. Liu, Y., et al. Vertical federated learning: concepts, advances, and challenges. IEEE Trans. Knowl. Data Eng. 36 (7), 3615-3634 (2024).
  4. Saha, S., Ahmad, T. Federated transfer learning: concept and applications. Intell. Artif. 15 (1), 35-44 (2020).
  5. McMahan, H. B., Moore, E., Ramage, D., Hampson, S., Arcas, B. A. Y. Communication-efficient learning of deep networks from decentralized data. In Proc. 20th Int. Conf. Artif. Intell. Stat. , 1273-1282 (2017).
  6. Yang, Q., Liu, Y., Chen, T., Tong, Y. Federated machine learning: concept and applications. ACM Trans. Intell. Syst. Technol. 10 (2), Article 12(2019).
  7. Pan, S. J., Yang, Q. A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22 (10), 1345-1359 (2010).
  8. Long, Z., Wang, J., Wang, Y., Xiao, H., Ma, F. FedCon: a contrastive framework for federated semi-supervised learning. arXiv. , (2021).
  9. Wang, J., et al. FedLite: a scalable approach for federated learning on resource-constrained clients. arXiv. , (2022).
  10. Hanser, T., et al. Data-driven federated learning in drug discovery with knowledge distillation. Nat. Mach. Intell. 7, 1-14 (2025).
  11. Feng, Y., et al. A survey of security threats in federated learning. Complex Intell. Syst. 11 (2), 165(2025).
  12. Chen, D., et al. Bridging data silos in finance via federated learning. IEEE Netw. , https://ieeexplore.ieee.org/document/11062627 (2025).
  13. Haripriya, R., et al. Navigating the fusion of federated learning and big data: a systematic review for the AI landscape. Clust. Comput. 28 (5), 1-27 (2025).
  14. Dong, J., Roth, A., Su, W. J. Gaussian differential privacy. J. R. Stat. Soc. Ser. B Stat. Methodol. 84 (1), 3-37 (2022).
  15. Bayatbabolghani, F., Blanton, M. Secure comparison protocols for privacy-preserving federated learning. In Proc. 2018 ACM SIGSAC Conf. Comput. Commun. Secur. , 2157-2159 (2018).
  16. Acar, A., Aksu, H., Uluagac, A. S., Conti, M. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput. Surv. 51 (4), (2018).
  17. Dwork, C. Differential privacy. In Proc. Int. Colloq. Automata Lang. Program. , 1-19 (2006).
  18. Abadi, M., et al. Deep learning with differential privacy. In Proc. 2016 ACM SIGSAC Conf. Comput. Commun. Secur. , 308-318 (2016).
  19. Bogetoft, P., et al. Secure multiparty computation goes live. In Financ. Cryptogr. Data Secur. 5628, 325-343 (2009).
  20. Perri, L. What's new in the 2023 Gartner Hype Cycle for emerging technologies. , https://www.gartner.com/en/articles/what-s-new-in-the-2023-gartner-hype-cycle-for-emerging-technologies (2023).
  21. Friedman, J., Hastie, T., Tibshirani, R. The elements of statistical learning. , Springer. New York. (2001).
  22. Zhang, H., Liu, Y., Zhang, X., Yin, Z., Li, Y. A lightweight approach for federated learning in edge devices. In Proc. 7th Int. Conf. Artif. Intell. Big Data (ICAIBD). , 53-58 (2024).
  23. Liu, J., Liu, P., Ou, Z., Zhang, G., Song, M. Optimizing edge intelligence through privacy-preserving learning. In Proc. Int. Conf. Edge Comput. , 419-429 (2024).
  24. Kim, J., Kim, K., Sohn, M., Park, G. Deep model-based security-aware entity alignment method for edge-specific knowledge graphs. Sustainability. 14 (14), 8877(2022).
  25. Xue, J., Qu, Z., Xu, J., Liu, Y., Lu, Z. Bandwidth allocation for federated learning with wireless providers and cost constraints. IEEE Trans. Mob. Comput. 23 (6), 7470-7482 (2024).
  26. Sharma, M., Kaur, P. Scalable federated learning for smart city applications. In Proc. 2nd Int. Conf. Informatics (ICI). , 1-4 (2023).
  27. Li, B., Zheng, S., Raman, P., Shrivastava, A., Giannakis, G. B. Contractive error feedback for gradient compression. arXiv. , (2023).
  28. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Federated LearningExplainable AICross Institutional CollaborationFinancial Risk ControlData PrivacyNon IID DataModel InterpretabilityDifferential PrivacyFraud DetectionSME Loan Default

Artigos relacionados