$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Arquitetura do sistema
Malha de dados interinstitucional e camada semântica
Para abordar a heterogeneidade de dados entre institucionais, a pesquisa constrói uma arquitetura Data Mesh por meio de particionamento de nós orientado por domínio. Cada instituição financeira opera como um nó independente do domínio de dados, mantendo direitos de propriedade e controle, com a camada semântica permitindo compreensão e interação unificada de dados. A camada semântica baseada em ontologias estabelece um modelo unificado de dados de controle de risco financeiro, definindo entidades centrais, atributosde mapa f e relações com entidades. Regras específicas de mapeamento semântico são detalhadas na Tabela 5. Para campos específicos da instituição, conversões padronizadas são realizadas por meio de funções de mapeamento semântico:
(18)
| Entidade kernel | O nome de campo A da instituição | Nome do campo B na instituição | Nome de campo uniforme da camada semântica | Tipo de dado | Regras padronizadas |
| Cliente | Avaliação premium de clientes (1-5) | Níveis de cliente VIP (bronze a diamante) | Pontuação de crédito do cliente (1-5) | Integer | Bronze→1, Prata→2, Ouro→3, Platina→4, Diamante→5 |
| Negócios | Valor da transação (dez mil yuans) | Valor da transação (yuan) | Valor da transação (yuan) | Número flutuante | O valor da área A na instituição é 10.000 vezes maior |
| Solicitação de crédito | Cota de candidatos (índice de crédito) | Valor esperado do empréstimo | Valor do empréstimo do solicitante (yuan) | Número flutuante | Instituição A: Índice total de créditos × valor da inscrição; Instituição B: mapeamento direto |
Tabela 5: Regras semânticas centrais de mapeamento de entidades no campo do controle de risco financeiro.
Aqui é xi,j o i-ésimo valor específico do campo da instituição j, min(x j) e max(x j) são os valores mínimo e máximo do campo dentro da instituição, respectivamente, Uj e Lj definem os limites superior e inferior da faixa unificada de valores para esse campo na camada semântica.
Registro global de modelos e trilha de auditoria baseada em blockchain
Para resolver questões de gerenciamento caótico de versões de modelos e processos de treinamento não rastreáveis no aprendizado federado, a tecnologia blockchain é empregada para estabelecer um registro global de modelos e um sistema de auditoria e rastreamento. Utilizando uma arquitetura blockchain de consórcio, os nós participantes incluem instituições financeiras, coordenadores federados e órgãos reguladores, garantindo imutabilidade dos dados e consensomultipartidário 23. O registro global de modelos armazena metadados centrais dos modelos, incluindo números de versão, rodadas de treinamento Hv, listas de instituições participantes, parâmetros estruturais e métricas de desempenho. Esses metadados são armazenados usando uma estrutura de árvore de Merkle, com cada versão do modelo correspondendo a um valor hash único:
(19)
Aqui v é o número da versão do modelo, T é o número total de rodadas de treinamento, S é a coleção de instituições participantes do treinamento, IDi é o identificador único de uma instituição i, θv é o vetor de parâmetros do modelo para a versão v, e AUCv é o valor AUC-ROC desta versão do modelo mostrado.
Pipeline federado de engenharia de características
Alinhamento seguro de entidades e harmonização de esquemas
A engenharia de características serve como o componente central da colaboração de dados entre institucionais, exigindo extração, alinhamento e agregação eficazes das características, garantindo a privacidade dos dados. Este estudo elabora um pipeline abrangente que abrange alinhamento seguro de entidades, coordenação de esquemas e agregação diferencial de grafos de transações incorporados à privacidade para abordar tanto a heterogeneidade de características entre institucionais quanto os riscos de vazamento de privacidade24. O alinhamento entre entidades entre institucionais é essencial para alcançar a colaboração com funcionalidades. No entanto, transmitir diretamente identificadores de clientes comprometeria a privacidade. Portanto, a pesquisa adota um método de alinhamento de entidades que preserva a privacidade, combinando criptografia homomórfica (HE) com tecnologia de hashing sensível à localidade (LSH). As instituições pré-processam identificadores de clientes usando funções de hash SHA-256 para gerar identificadores preliminares. Esses identificadores são então mapeados para o mesmo "balde" via LSH para reduzir o cálculo subsequente de criptografia. Identificadores dentro do mesmo balde passam por criptografia homomórfica de Paillier. Os identificadores criptografados são enviados para o coordenador federado, que alcança o alinhamento das entidades comparando a similaridade dos identificadores criptografados usando similaridade cosseno.
(20)
Quando a semelhança é maior que o limiar pré-definido (neste estudo, é considerado τ=0,95), determina-se que é a mesma entidade, e um ID unificado entre as instituições é gerado para alcançar um alinhamento seguro da entidade.
Agregação diferencialmente privada de embeddings em grafos de transação
Os dados de transações financeiras apresentam características distintas de estrutura em grafos (com clientes como nós e transações como arestas). A incorporação de grafos de transações captura efetivamente os padrões de transação das partes relacionadas dos clientes, fornecendo recursos críticos para modelos de controle de risco. No entanto, a agregação direta de embeddings interinstitucionais de Gi=(V i,E i)ViiEi e i,v∈Rdd d gráfico de transação pode vazar informações relacionadas à transação dos clientes. Portanto, a tecnologia DiferencialPrivacy (DP) é introduzida para alcançar a agregação preservadora da privacidade dos embeddings de grafos de transações. Cada instituição constrói localmente um grafo de transação, onde representa o conjunto de nós clientes da instituição e representa o conjunto de arestas de transação (pesos de arestas iguais aos valores das transações). O algoritmo GraphSAGE é empregado para gerar embeddings de nós (com dimensões de embedding de 256 dimensões neste estudo). Para atender aos requisitos diferenciais de privacidade, o ruído laplaciano é adicionado aos embeddings locais:
(21)
Aqui ΔG Sensibilidade global do algoritmo GraphSAGE (estimada por experimento neste estudo ΔG=0,8), para o orçamento local de privacidade da agência,
(22)
Para o orçamento total de privacidade do sistema, este estudo leva εtotal = 1,5). O coordenador agrega a incorporação de ruído de cada instituição usando uma estratégia de média ponderada
, com pesos baseados na porcentagem de clientes de cada instituição:
(23)
O gráfico global agregado de transações
é incorporado e reenviado a cada instituição. Como um recurso chave do modelo de controle de risco, ele não apenas retém as informações de correlação entre transações institucionais, mas também protege a privacidade do cliente por meio de privacidade diferenciada.
(24)
Modelo híbrido de risco de IA
Submodelos locais: Aumento de gradiente com restrições monotônicas
Modelos tradicionais centralizados de controle de risco por IA têm dificuldade para se adaptar a cenários federados interinstitucionais. Este estudo desenvolve um modelo híbrido de risco de IA que combina "submodelos locais + modelo de fusão global", integrando a alta interpretabilidade das Árvores de Aumento de Gradiente (GBDT) com a adaptabilidade do Transformer a dados não independentes e idênticamente distribuídos (NID). Um módulo de interpretação é introduzido para equilibrar o desempenho do modelo e a explicabilidade em ambientes federados. Cada instituição constrói localmente submodelos do GBDT, escolhidos por sua forte capacidade de ajuste estrutural de dados e alta interpretabilidade – requisitos essenciais para regulamentações de controle de risco financeiro. Para evitar superajustes e conclusões ilógicas, restrições monotônicas são implementadas durante o treinamento do GBDT, impondo padrões monótonos de aumento ou diminuição para características-chave como renda dos clientes e pontuações de crédito. O primeiro conjunto de árvores por GBTD é ht(x), e a saída do modelo é:
(25)
Aqui, η é a taxa de aprendizado (este estudo leva η=0,1). A restrição monotônica é realizada pela regularização da função de perda xj.
Adicionar termo de restrição:
(26)
Aqui, x≺x' representa que o autovalor de x é menor que o autovalor de x', e a função final de perda é:
(27)
Aqui, l é a função de perda logarítmica (usada no cenário binário de controle de riscoy∈{0,1}, indicando se o cliente inadimple).
é o termo de regularização de complexidade para a árvore, λ e γ são o coeficiente de regularização (Este estudo foi conduzido por meio de λ=0,01 γ=0,5 de validação cruzada, ni é o número de amostras locais para a instituição i,T é o número de árvores (Este estudo levou T=100).
Fusão global: transformador baseado em atenção para adaptação não-IID
Dados interinstitucionais exibem características significativas de distribuição não-IID. Algoritmos tradicionais do FedAvg, que simplesmente fazem a média dos parâmetros do modelo local, têm dificuldade para se adaptar a dados não-IID. Para abordar isso, a pesquisa introduz um modelo de Transformer baseado em pi(x)=σ(Fi(x))σFi(x)ia i-based para fusão inteligente de submodelos locais. O modelo global de fusão recebe como entrada as probabilidades de saída de cada submodelo local da instituição (saídas da função sigmoide dos modelos institucionais GBDT). A arquitetura Transformer compreende um codificador e uma camada de atenção, onde a camada de atenção calcula os pesos de atenção a partir das saídas de diferentes instituições para alcançar ponderação adaptativa. Os pesos de atenção são calculados usando Atenção Escalar Escalar Escalar Escalar:
(28)
Aqui, q é o vetor de consulta (gerado pelas características médias de risco das amostras globais),
é o vetor-chave da instituição i, dk é a dimensão do vetor-chave (neste estudo dk=64), n é o número de agências participantes da federação.
A probabilidade final de saída do modelo global é:
(29)
Por meio do mecanismo de atenção, o modelo global pode automaticamente atribuir maior peso às instituições com alta qualidade de dados e previsão precisa de risco, além de melhorar a adaptabilidade a dados não-IID.
Módulo de explicabilidade: SHAP em árvores federadas + gerador contrafactual
Modelos de controle de risco financeiro devem manter a interpretabilidade para satisfazer os requisitos regulatórios e proteger o 'direito dos clientes de saber. Para resolver isso, a pesquisa desenvolve um módulo de interpretabilidade que combina geradores federados SHAP+ contrafactuais. Para submodelos locais de GBDT, a pesquisa utiliza valores SHAP para medir a importância das características, que Si∈R N i×mquantificam a contribuição de cada característica para os resultados da previsão. Em cenários federados, transmitir diretamente valores locais de SHAP pode comprometer a distribuição de recursos das informações. Portanto, a pesquisa implementa uma estratégia de agregação segura onde cada instituição calcula localmente a matriz de valores SHAP (para contagem de características), aplica ruído diferencial de privacidade aos valores SHAP e os envia para o coordenador federado. O coordenador então calcula os valores globais do SHAP:
(30)
Aqui, Si' é a matriz de valores SHAP da instituição i, e wi é a proporção do tamanho da amostra das instituições.
Insira o autovetor atual x do cliente e a classificação de risco alvo y, a saída é um vetor de características antifactual xcf, satisfeito (o limiar θ deprobabilidade do alvo correspondente à classificação de risco alvo). E |xcf-x|2 o mínimo (ou seja, o menor custo de ajuste). A função de perda do gerador de fato é:
(31)
Aqui α,β,γ são os coeficientes de peso (neste estudo α=10,β=5,γ=1),LGAN A função de perda adversarial é usada para GAN para garantir a racionalidade e autenticidade do vetor de características contrafactual.
Camada de privacidade e segurança
Agregação segura com compartilhamento aditivo de segredos
No aprendizado federado, a transmissão e agregação dos parâmetros locais do modelo é um elo chave no vazamento de privacidade. A tecnologia AdditiveSecretSharing (ASS) é adotada para alcançar agregação segura e evitar a aquisição direta dos parâmetros locais do modelo de cada organização pelo coordenador. O processo específico é o seguinte: i) Cada instituição dividirá os parâmetros do modelo local em ações secretas θ i,1,θi,2,...,θ i,n , satisfazendo
, Aqui está o número de instituições participantes; ii) A instituição i envia a participação θi,k para a instituição (k≠i), mantendo sua própria participação θi,i; iii) Cada instituição k coleta ações enviadas por todas as outras instituições θ1,k,θ 2,k,...,θn,k , e soma isso com a θk,k parte retida por si mesma, obtendo a soma parcial; iv) Todas asinstituições farão upload e compartilharão parte disso com o coordenador, que calcula os resultados
globais da agregação de parâmetros. Por meio do compartilhamento aditivo de segredos, o coordenador só pode obter parâmetros agregados globais e não pode deduzir n-1ttt=⌈n/2⌉ deduzir os parâmetros locais de nenhuma instituição individual. Mesmo a conluio entre múltiplas instituições não pode recuperar parâmetros de outras, garantindo privacidade e segurança durante a transmissão de parâmetros. Para lidar com a perda de ações causada por desconexões institucionais, o mecanismo de compartilhamento de segredos Shamir é introduzido como backup. Cada parte é ainda dividida em fragmentos. Ao coletar qualquer fragmento, a parte completa pode ser restaurada, aumentando assim a robustez do sistema.
Calibração adaptativa de ruído sob (ε, δ)-agendamento de orçamento DP
O principal desafio da privacidade diferencial está em equilibrar a força da proteção da privacidade com o desempenho do modelo. Métodos tradicionais de adição de ruído fixo têm dificuldade em se adaptar a cenários em que as distribuições de dados mudam dinamicamente durante o treinamento federado. Este estudo projeta um mecanismo adaptativo de calibração de ruído baseado em (ε,δ)-DP, combinado com uma estratégia de escalonamento de orçamento de privacidade, para alcançar o ajuste dinâmico da intensidade do ruído. Defina o orçamento total de privacidade do sistema como (Este estudo leva δtotal = 10-5 , está em conformidade com os requisitos GDPR para risco de privacidade), Adote a estratégia segmentada de agendamento orçamentário, O orçamento total é alocado por {ε1.ε 2,...,εT} ciclo de treinamento da seguinte forma, satisfeito:
(32)
Em cada rodada de treinamento, a intensidade do ruído é ajustada dinamicamente de acordo com as características de distribuição dos dados locais. Assumindo que a variância local das características dos dados da t-ésima rodada de instituição é
, Defina o coeficiente de ajuste de ruído αi,t:
(33)
Quando αi,t≥0,8 (a distribuição dos dados é estável), usando uma pequena intensidade
de ruído ; Quando αi,t<0,8 (a distribuição dos dados flutua), aumenta a intensidade do ruído . Entre elas, está a sensibilidade global dos parâmetros do modelo (este estudo garante por meio do gradient clipping).
Protocolo de treinamento eficiente em comunicação
Atualizações assíncronas do cliente com controle de estagnação
A aprendizagem federada interinstitucional enfrenta desafios como alta latência de comunicação e consumo significativo de largura de banda (especialmente para instituições financeiras pequenas e médias com recursos limitados de rede). Este estudo desenvolve um protocolo eficiente de treinamento de comunicação incorporando atualizações assíncronas de clientes, compressão de gradiente e feedback de erro para reduzir custos de comunicação e melhorar a escalabilidade dosistema 25. Métodos tradicionais de treinamento federado síncrono como o FedAvg exigem esperar que todos os clientes concluam o treinamento local antes da agregação de parâmetros, resultando em ciclos de treinamento longos. O mecanismo assíncrono de atualização do cliente permite que os clientes completem o treinamento local de forma independente e enviem parâmetros imediatamente. Ao receber esses parâmetros, o coordenador federado atualiza o modelo global em tempo real sem esperar por outros clientes. Isso resolve o problema do modelo obsoleto no treinamento assíncrono . Introduzindo a estratégia de controle de estagnação, defina o valor de estagnação para o cliente ,(para tatual a rodada global de treinamento atual, tlast_update A rodada em que o cliente obteve o modelo global pela última vez). Quando (Smax é a estagnação máxima permitida, este estudo leva smax=5) . O cliente participa do treinamento normalmente; Nomáximo > esse tempo, o cliente precisa baixar novamente o modelo global mais recente antes do treinamento local. A configuração de hardware consiste em CPUs Intel Xeon E5-2678 v3 (12 núcleos, 2,5GHz) pareadas com GPUs NVIDIA Tesla V100 (16GB de VRAM) e 64GB de memória DDR4 por nó para lidar eficientemente com cargas de treinamento distribuídas. Para inicialização de software, comandos PySyft como hook = sy. TorchHook(tocha)andvirtual_worker = sy. VirtualWorker(hook, id="client1") são usados para estabelecer conexões federadas seguras, enquanto federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) permite o carregamento federado de dados entre os participantes. O mapeamento semântico transforma as características financeiras entre as instituições — por exemplo, convertendo os valores das transações de USD para CNY usando uma fórmula dinâmica de taxa de câmbio: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), onde a taxa de câmbio é periodicamente atualizada via API. Para complementar conjuntos de dados desequilibrados, o CopulaGAN gera amostras sintéticas adversariais com um trecho de código, como o da importação sdv.tabular CopulaGAN; sintetizador = CopulaGAN(épocas=50); synthesizer.fit (train_data); synthetic_samples = synthesizer.sample(num_rows=1000), preservando propriedades estatísticas dos dados originais. O treinamento local de GBDT impõe restrições monotônicas (por exemplo, garantindo que "credit_score" esteja positivamente correlacionado com "approval_probability") viaparâmetros = {"monotonic_constraints": (1, 0, -1)}no LightGBM, enquanto a fusão Transformer é implementada no PyTorch com camadas de atenção multicabeças:self.attention = nn. MultiheadAttention (embed_dim=64, num_heads=4); attn_output, _ = self.attention(consulta, chave, valor, key_padding_mask=padding_mask), seguido pela normalização da camada e conexões residuais para estabilidade. Privacidade diferencial injeta ruído de Laplace escalado para a sensibilidade L1 (Δf) e orçamento de privacidade (ε) — por exemplo, adicionando ruído amostrado de np.random.laplace(loc=0, scale=Δf/ε) onde Δf=1,2 e ε=0,5 gradientes antes da agregação. Restrições de justiça são aplicadas após o treinamento reponderando amostras inversamente proporcional à sua prevalência de grupo (sample_weight = 1 / group_counts[y_train]) para mitigar violações de paridade demográfica. Ao mesmo tempo, a estratégia de agregação ponderada é usada para ajustar o peso dos parâmetros do cliente de acordo com o valor de estagnação:
(34)
Onde λ=0,1 é o coeficiente de penalidade de estagnação; quanto maior a estagnação, menor o peso, o que reduz o impacto dos parâmetros obsoletos no modelo global.
Compressão de gradiente e acúmulo de erro e realimentação
Os parâmetros do modelo (particularmente os pesos de atenção nos modelos globais de fusão Transformer) possuem alta complexidade dimensional. A transmissão direta consumiria largura de banda excessiva, exigindo técnicas de compressão por gradiente para reduzira transferência de dados em 26. Este estudo integra a esparsificación Top-K com compressão de quantização, seguindo estes passos específicos: i) Esparsão Top-K: Para o modelo local ∇θi gradiente, selecione o elemento gradiente K% com o maior valor absoluto a ser retido, K O restante dos elementos é zero, o valor é ajustado dinamicamente de acordo com a condição de largura de banda (quando a largura de banda é suficiente K=30, quando a largura de banda é limitada K=10); ii) Compressão de quantização: Os elementos do gradiente retido são quantizados de ponto flutuante de 32 bits para inteiros de 8 bits. A fórmula de quantização é:
(35)
iii) Realimentação de erro: Armazene o gradiente descartado Δ∇=∇θi-∇θicomprimido erro durante a compressão no lado do cliente. No próximo cálculo do gradiente, o erro é acumulado no novo gradiente, aborde,
, Compense as perdas de compressão. Os efeitos da compressão de gradiente e do feedback de erro são mostrados na Tabela 6, In, condições de quantização de 8 K=20% de bits. A razão de compressão atinge 15:1 (volume original de dados/volume de dados comprimidos), e por meio do feedback de erro, o AUC-ROC do modelo diminui apenas 0,5%-1,0%, realizando o equilíbrio entre custo de comunicação e desempenho do modeloem 27.
| Estratégias de compressão | Razão de redução | Consumo de largura de banda de upload (MB/rodada) | Taxa de declínio AUC-ROC | Taxa de redução do tempo de treinamento |
| não comprimido (ponto flutuante de 32 bits) | 1:01 | 128 | 0.00% | 0.00% |
| Quantização de 30% superior de esparsão + 16 bits | 6.7:1 | 19.1 | 0.30% | 35.20% |
| Top-20% esparso + quantização de 8 bits | 15:01 | 8.5 | 0.80% | 58.70% |
| Top-10% esparso + quantização de 8 bits | 30:01:00 | 4.3 | 2.10% | 72.10% |
Tabela 6: Comparação de desempenho de estratégias de compressão por gradiente.
Regularização consciente da justiça
Modelos de controle de risco financeiro devem evitar discriminação contra grupos específicos e cumprir requisitos regulatórios, incluindo a Lei de Proteção de Informações Pessoais e a Lei de Relatórios de Crédito Justos. Este estudo introduz um mecanismo de regularização consciente da justiça para restringir vieses de predição intergrupos durante o treinamento do modelo, garantindo a equidade do modelo. Dois indicadores centrais de justiça são definidos: i) Paridade Demográfica (DP): A taxa de previsão positiva é igual para diferentes grupos, abordagem,
, Entre eles, está o identificador do grupo ; ii) Igualdade de Oportunidades (EO): A taxa de verdadeiro positivo é igual entre os grupos, abordagem
. Adicionar termos de regularização de equidade à função de perda do modelo híbrido de risco de IA e impor restrições ao submodelo local GBDT e ao modelo global Transformer, respectivamente: iii) Restrições de equidade local do modelo:

Aqui, PR(g=A) é a taxa de predição positiva para o grupo g, λ, e é o coeficiente de regularização para a justiça.
iv) Restrição global de justiça do modelo: Adicionar ajuste de peso de justiça de grupo à camada de atenção do Transformer, a saída do modelo para grupos vulneráveis ag=a base×(1+β⋅Δinjusta) recebe um peso de atenção maior, aqui,Δ injusta representa o viés de justiça entre esse grupo e o grupo dominante (Δinjusta=PR (grupo dominante)-PR (grupos vulneráveis)); λEO é o coeficiente de compensação de desvio. O efeito da regularização da percepção de justiça é avaliado por ΔDP (desvio DP), ΔEO (desvio de EO) e erro de calibração de grupo.
Painel de governança e conformidade de modelos
Monitoramento de viés em tempo real
Para atender aos requisitos da regulação financeira em gestão do ciclo de vida do modelo, a pesquisa desenvolveu um painel de governança e conformidade do modelo que integra APIs de monitoramento de desvios e relatórios regulatórios em tempo real, permitindo supervisão e rastreabilidade total durante o treinamento, implantação e iteração do modelo. O módulo de monitoramento de desvio em tempo real alcança o acompanhamento dinâmico da justiça e desempenho do modelo por meio das seguintes dimensões: i) Monitoramento de desvio de grupo: Categorização dos grupos por gênero do cliente, idade, região, nível de renda, etc., calculando PR, TPR e FPR (Taxa de Falsos Positivos) para cada grupo por hora. Alertas de desvio são acionados quando diferenças de PR entre grupos excedem 0,08 ou diferenças de TPR excedem 0,05; ii) Monitoramento de desvio de desempenho: Cálculo contínuo de métricas como AUC-ROC e PR-AUC. Quando essas métricas caem mais de 2% consecutivamente ao longo de três horas, isso é determinado como deriva de desempenho, iniciando automaticamente o processo de retreinamento do modelo. iii) Monitoramento da conformidade com a privacidade: Registre o consumo do orçamento de privacidade e a adição de ruído εtotal de 10 intensidades de cada rodada de treinamento. Quando o consumo de ε de uma única rodada ultrapassar, pause o treinamento e ajuste a estratégia de ruído. iv) O monitoramento dos dados é exibido por meio de painéis visuais, permitindo que reguladores e instituições participantes os visualizem em tempo real e promovendo uma gestão transparente dos riscos do modelo.
API de relatórios regulatórios
Para simplificar o processo regulatório de relatórios, uma API padronizada de relatórios regulatórios foi projetada para suportar a geração automática de relatórios em conformidade com regulamentos como GDPR, CCPA e a Lei de Proteção de Informações Pessoais da China. Funções principais incluem: i) Relatório de Conformidade de Fontes de Dados: Agrega automaticamente tipos de dados, volumes e status de autorização das instituições participantes para verificar a conformidade com o princípio do "mínimo necessário"; ii) Relatório de Conformidade de Treinamento Modelo: Registra iterações de treinamento, instituições participantes, medidas de proteção de privacidade e métricas de justiça para gerar um relatório de rastreabilidade de treinamento modelo; iii) Relatório de Conformidade com Previsão de Risco: Exibe padrões de distribuição conformes à regulamentação das previsões de modelos entre diferentes grupos e casos de explicação contrafactual para demonstrar a não discriminação. A API adota um estilo de design RESTful, suportando saídas em formatos JSON e XML. As autoridades reguladoras podem acessar diretamente os dados dos relatórios por meio de interfaces de API ou definir ciclos automáticos de relatórios para alcançar processos regulatórios automatizados e padronizados. Os modelos de relatório estão em conformidade com os padrões regulatórios do modelo financeiro da Organização Internacional de Padronização (ISO), garantindo a autoridade e a universalidade dos relatórios.
Desenho experimental: Descrição do conjunto de dados
Dados de cartões de crédito multi-institucionais e empréstimos para PMEs
Os dados experimentais vieram de instituições financeiras na China, abrangendo tipos de dados como transações pessoais com cartão de crédito e registros de solicitação e cumprimento de empréstimos por PMEs. A tecnologia CopulaGAN foi empregada para sintetizar e aprimorar eventos fraudulentos raros, construindo assim um conjunto de dados experimental que combina autenticidade com integridade. Os dados reais utilizados no experimento incluem duas grandes categorias: dados de transações pessoais de cartão de crédito e dados de empréstimos para PMEs, totalizando mais de 5 milhões de registros abrangendo de janeiro de 2022 a dezembro de 2023. Os dados abrangem quatro grandes regiões econômicas — Norte da China, Leste da China, Sul da China e Sudoeste da China — para garantir representatividade geográfica e diversidade na distribuição da amostra. Os campos centrais e as características estatísticas dos dados institucionais são apresentados na Tabela 7. Entre elas, as Instituições A e B são bancos comerciais nacionais com grandes bases de clientes em todas as faixas etárias; As instituições C e D são bancos de internet que atendem principalmente a jovens (20-35 anos); A Instituição E é uma empresa de financiamento ao consumidor que tem como alvo usuários em mercados de menor nível, com distribuição de dados apresentando características significativas de Não-IID. O conjunto de dados contém 115.610 dados. O conjunto de dados é fornecido por instituições financeiras que colaboram com universidades
| Tipo de dado | Instituição | Número de registros (10.000) | Número de clientes (10.000) | Campos centrais | Taxa de fraude de inadimplência | Características da distribuição dos dados |
| Transações com cartão de crédito | A | 180 | 85 | Tempo da transação, valor, tipo de comerciante, localização da transação, se devo roubar o cartão | 0.32% | Transações grandes representam uma proporção elevada (> 5000 yuans) |
| Transações com cartão de crédito | B | 150 | 72 | Número de fluxo de transações, valor (USD/RMB), canal de pagamento, avaliação do cliente | 0.28% | Transações transfronteiriças representam 15% |
| Transações com cartão de crédito | C | 120 | 68 | Carimbo de data e hora da transação, valor, se deve instalar, idade do cliente, localização do número de celular | 0.45% | Pequenas negociações de alta frequência (<1000 yuans representam 60%) |
| Empréstimos para pequenas e microempresas | D | 32 | 1.2 | Nome da empresa, valor do empréstimo, prazo de crédito, escala de receita, valor de imposto, se está em atraso | 2.80% | Clientes manufatureiros representam 40% |
| Empréstimos para pequenas e microempresas | E | 18 | 0.8 | Data da solicitação de empréstimo, valor esperado, tipo de negócio, número de funcionários, histórico de desempenho | 3.50% | Os clientes de serviço representam 70% |
Tabela 7: Características estatísticas do conjunto de dados financeiros reais multi-instituicionais.
Para abordar a heterogeneidade dos dados interinstitucionais, o experimento seguiu estritamente as especificações da grade de dados e das camadas semânticas padronizando campos institucionais: por exemplo, convertendo o "valor da transação (USD)" da Instituição B para RMB usando a taxa de câmbio da data da transação e unificando o nome do campo em "valor da transação (YUAN)"; convertendo a "idade do cliente" da Instituição C (formato "1990-01-01") em uma idade inteira; e mapeando a "escala de receita empresarial" da Instituição D (classificada como "abaixo de 1 milhão / 1-5 milhões / mais de 5 milhões") até os pontos médios dos intervalos numéricos (500.000, 3.000.000, 7.500.000), garantindo consistência entre formato de dados e significado semântico.
Aumento sintético via CopulaGAN para eventos raros de fraude
Em cenários de controle de risco financeiro, amostras de fraude/inadimplência normalmente representam uma proporção extremamente baixa. Usar diretamente tamanhos de amostra tão pequenos para treinamento de modelos levaria a graves problemas de desequilíbrio de classes, comprometendo as capacidades de generalização do modelo. O experimento utiliza Copula GAN (uma rede generativa adversarial baseada em funções Copula) para sintetizar dados aumentados para casos raros de fraude. Esse método combina a capacidade da função Copula de modelar distribuições de dados de alta dimensão com as capacidades generativas do GAN, permitindo a criação de dados sintéticos que se alinham com padrões reais de fraude, evitando o problema do "colapso do padrão" comumente observado na geração tradicional de GAN.
Estrutura do modelo CopulaGAN
O CopulaGAN consiste em três partes: Gerador, Discriminador e módulo de restrição de distribuição de cópulas: (1) Gerador: A entrada é um vetor de ruído aleatório z∼N(0,1) de 128 dimensões, e gera um vetor de características sintético consistente com a verdadeira dimensão amostral através de uma rede totalmente conectada de 3 camadas (dimensões ocultas das camadas são 256, 512, 256); (2) Discriminador: A entrada é amostra real ou sintética xsyn, e por meio de uma rede totalmente conectada de duas camadas + função de ativação sigmoide, gera a probabilidade de que a amostra seja um dado real; (3) Módulo de restrição de distribuição de cópula: ajustar a distribuição conjunta de amostras de fraude real através da função de cópula gaussiana (onde é o valor da função de distribuição de arestas da 8ª característica de i), e adicionar a restrição de distância de cópula na perda do gerador para garantir que a distribuição conjunta de amostras sintéticas seja consistente com as amostras reais.
(36)
Aprimorar a verificação de processos e efeitos
O processo de treinamento e aprimoramento do CopulaGAN é o seguinte: i) Pré-processamento de dados: extrair amostras de fraude/padrão (18.200 no total) a partir dos dados reais de várias instituições; Padronizar características contínuas (x'=(x-μ)/σ); Características discretas são codificadas com calor único; ii) Ajuste de cópula: A função de cópula gaussiana é usada para ajustar a distribuição conjunta das amostras de fraude pré-processadas, calcular a função Fiθ da distribuição de arestas e os parâmetros da função cópula de cada característica; iii) Treinamento GAN: O gerador e o discriminador são treinados alternadamente. A função de perda do gerador é:
(37)
Aqui, λ é o peso de restrição, e Distância(Csyn,C real) é a divergência KL entre a distribuição de cópula de amostras sintéticas e a distribuição de cópula de amostras reais; A função de perda do discriminador é a perda binária padrão de entropia cruzada:
(38)
Após a convergência do modelo (com precisão do discriminador estabilizada em 50%±5%), o gerador produziu 50.000 amostras sintéticas de fraude. Esses foram mapeados de volta ao espaço original de características de acordo com especificações semânticas e misturados com amostras reais para construir um conjunto de treinamento balanceado. Para validar a eficácia das amostras sintéticas, a pesquisa as avaliou usando um teste KS com duas amostras e visualização da distribuição de características. Os resultados do teste KS mostraram que as diferenças nas distribuições de características entre amostras sintéticas e reais estavam todas abaixo de 0,05 (estatística KS <0,05, valor p>0,05), indicando boa consistência de distribuição. A comparação de distribuição de características demonstrou que amostras sintéticas podiam reproduzir com precisão as características de distribuição de amostras reais de fraude, fornecendo dados válidos suficientes para o treinamento do modelo, como mostrado na Figura 1.

Figura 1: Comparação da distribuição de características entre amostras de fraude real e CopulaGAN Por favor, clique aqui para ver uma versão maior deste número.
Métricas de avaliação
O experimento constrói um sistema de avaliação multi-índice a partir de quatro dimensões centrais: desempenho de previsão, proteção de privacidade, justiça e eficiência da comunicação para medir de forma abrangente o desempenho abrangente do framework de aprendizagem federada e do modelo de controle de risco de IA. A definição, o método de cálculo e os critérios de avaliação de cada dimensão são apresentados na Tabela 8.
| Dimensões da avaliação | Nome do índice | Definição e método de cálculo | Critério de avaliação |
| Desempenho estimado | AUC-ROC | A área sob a curva de trabalho característica do sujeito mede a capacidade do modelo de distinguir entre exemplos positivos (padrão/fraude) e negativos | Quanto maior o valor, melhor. O AUC-ROC do modelo excelente é>0,9 |
| PR-AUC | A área de recordação de precisão sob a curva, aplicável a dados desbalanceados, mede o desempenho de um modelo em cenários onde exemplos positivos são escassos | Quanto maior o valor, melhor. O PR-AUC de um modelo excelente é>0,8 |
| Fração de Brier | Erro quadrático médio entre probabilidade prevista e rótulo verdadeiro,B=1Ni=1N(pi-yi)2 | Quanto menor o valor, melhor. A pontuação Brier de um modelo excelente é inferior a 0,05 |
| Taxa de falsos positivos (FPR) | A proporção de exemplos negativos FPR=FPFP+TNque | Quanto menor o valor, melhor. Cenários financeiros geralmente exigem FPR <1% (para evitar rejeitar bons clientes) |
| Proteção de privacidade | ε-Curva de consumo (curva ε) | Registre a taxa de consumo do orçamento de privacidade acumulado* durante o treinamento para refletir a capacidade dinâmica de equilíbrio da proteção da privacidade | A curva está se estabilizando e o ε total é menor ou igual a 5 (em linha com os requisitos de risco de privacidade do GDPR) |
| Ataque de raciocínio dos membros AUC (MI-AUC) | A capacidade de um atacante inferir se uma amostra pertence ao conjunto de treinamento a partir dos resultados da previsão do modelo, e quanto mais próximo o valor do AUC estiver de 0,5, melhor a privacidade | MI-AUC<0.6 é eficaz para proteção de privacidade, MI-AUC<0.55 é excelente |
| Taxa de vazamento de recursos (FLR) | O atacante agrega as características para reverter o erro FLR=1-KL(P∥∥Q)Dmaxrate da distribuição original dos dados, | FLR <0.1 indica que a proteção de privacidade é eficaz (P é Dmax, a verdadeira distribuição, Q é a distribuição inferida, e é a distância máxima KL) |
| Justiça | Viés de DP em estatística (ΔDP) | A diferença máxima na taxa de predição ΔDP=max∥PRg-PRavg∥ exemplos positivos entre diferentes grupos, | ΔDP<0,05 para justiça, para excelência (PRg para a taxa positiva do grupo g) |
| Viés EO (ΔEO) | A diferença máxima nas taxas de ΔEO=max∥TPRg-TPRavg∥ entre diferentes grupos, | GCE <0,02 está bem calibrada (K é o número do grupo, é a taxa prevista e é a taxa real) |
| Erro de calibração de grupo (GCE) | A média do desvio entre a probabilidade prevista GCE=1Kg=1K∥pg-rg∥de cada grupo e a taxa real de inadimplência, | Quanto menor o valor, melhor. Os requisitos de cenários para organizações pequenas e médias são <10MB/ronda |
| Eficiência da comunicação | Largura de banda de uplink por rodada | Consumo total de largura de banda dos dados enviados por cada organização para o coordenador durante um único | Quanto menor o valor, melhor. Cenários interinstitucionais exigem menos de 120 minutos |
| Razão de redução (CR) | A razão entre o volume original de dados e o volume de dados comprimidos, CR=SizerawSizecomp | Quanto maior a taxa de compressão, melhor. Excelentes soluções CR>10:1 |
Tabela 8: Sistema de índice de avaliação experimental.
Explicação da Métrica: i) Ataque de Inferência de Membresia: Usando a metodologia de ataque caixa-preta, o atacante treina um modelo binário de classificação que insere probabilidades previstas do modelo alvo e gera o status de pertença à amostra. O risco de vazamento de privacidade é medido pelo AUC do modelo (ou seja, MI-AUC). ii) Critérios de Classificação de Grupos: Na avaliação de justiça, os grupos são categorizados em quatro dimensões: gênero (masculino/feminino), idade (abaixo de 25/25-40/>40), região (mercados de primeira linha/novos de primeiro nível/segundo nível/subsidiária) e nível de renda (<5k/5k-15k/15k-30k/>30k RMB/mês). Isso garante a cobertura de grupos sensíveis identificados pelos reguladores financeiros. iii) Critérios de Convergência: Durante o treinamento do modelo, se o conjunto de validação AUC-ROC apresentar uma diminuição inferior a 0,001 em três rodadas consecutivas (cada rodada contendo 10 épocas), o treinamento é considerado convergente e interrompido.
Linhas de base
Para validar a superioridade do proposto "Modelo de Controle de Risco de Aprendizagem Federada + Híbrido de IA", este estudo estabelece cinco modelos de referência: modelos centralizados tradicionais, modelos clássicos de aprendizagem federada e modelos aprimorados que preservam a privacidade. Os parâmetros centrais e estratégias de treinamento de cada modelo de linha de base são detalhados na Tabela 9 para garantir a justiça em experimentos comparativos (todos os modelos usam conjuntos de treinamento, conjuntos de validação e estratégias de otimização por hiperparâmetro idênticos).
| Tipos de modelos | Nome do modelo | Arquitetura central | Modo de treinamento | Medidas de proteção à privacidade | Hiperparâmetros chave |
| Modelo centralizado | Tradição GBDT | Árvore de aumento de gradiente XGBoost | Todas as instituições armazenam dados de treinamento centralmente | Não tenho | Número de árvores = 100, taxa de aprendizado = 0,1, profundidade da árvore = 6, coeficiente de regularização λ=1,0 |
| Modelo centralizado | Modelo de aprendizado profundo (MLP) | A rede totalmente conectada de três camadas (camada de entrada 256 dimensões → camada oculta 128 dimensões → camada oculta 64 dimensões → camada de saída 1 dimensão) | Todas as instituições armazenam dados de treinamento centralmente | Não tenho | Otimizador=Adam, taxa de aprendizado=0,001, tamanho do lote=256, Dropout=0,3 |
| Modelo federal clássico | FedAvg (média federal) | O modelo local é GBDT, e o modelo global adota agregação média de parâmetros | Treinamento federal sincronizado | Não tenho | Taxa de participação = 0,8, época local = 5, rodada de agregação = 50, taxa de aprendizado = 0,1 |
| Modelo federal clássico | FedProx (Agregação Federal de Fim Próximo) | O modelo local é GBDT, e o proximal | Treinamento federal sincronizado | Não tenho | Taxa de participação = 0,8, época local = 5, rodada de agregação = 50, parâmetro proximal μ = 0,01 |
μ=0.01 a restrição de termos é adicionada durante a agregação (). |
| Federação Empoderada pela Privacidade | FedAvg+DP (ruído fixo) | Adicionar ruído laplaciano fixo ao FedAvg (ε=5, δ=1e-5) | Treinamento federal sincronizado | Privacidade diferencial fixa | Intensidade de ruído=0,1, taxa de participação=0,8, época local=5, rodadas de agregação=50 |
| O modelo de pesquisa | FedRisk (Modelo Federal de Controle de Risco) | GDT Local (Restrição Monotônica) + Transformador Global (Fusão de Atenção) + DP + Agregação Segura | Treinamento Assíncrono Federal | Compartilhamento de segredos additivo adaptativo DP+ | Época local=5, rodadas de agregação=50, dimensão de atenção=64, orçamento de privacidadeε=5, taxa de compressão=15:1 |
Tabela 9: Comparação de parâmetros entre o modelo de referência e este modelo de estudo.
Explicação da Dimensão Comparativa: (1) Centralizado vs. Federado: Ao comparar "GBDT/MLP tradicional" com "FedAvg/FedProx/FedRisk", este estudo examina a degradação de desempenho do aprendizado federado em cenários de "dados fora do local". (2) Federado Clássico vs. Aprimorado com Privacidade: Por meio de "FedAvg" versus "FedAvg+DP", a pesquisa avalia o impacto da privacidade diferencial no desempenho do modelo. (3) Síncrono vs. Assíncrono Federado: A comparação entre "FedAvg" (síncrono) e "FedRisk" (assíncrono) demonstra as vantagens de eficiência de comunicação do treinamento assíncrono. (4) Agregação Simples vs. Fusão Inteligente: O contraste entre "FedAvg" (média de parâmetros) e "FedRisk" (atenção à fusão) valida a adaptabilidade das estratégias de integração Transformer a dados não-IID. (5) Sem Censura vs. Justiça-Censura: A comparação entre "FedAvg" (sem restrições de justiça) e "FedRisk" (restrições conscientes da justiça) examina os efeitos dos mecanismos de justiça sobre a justiça e desempenho do modelo.
Estudos de ablação
Impacto de ε variáveis na utilidade do modelo
Usando o orçamento total de privacidade ε como variável (com valores 1, 3, 5, 7 e 10), a pesquisa fixou δ=1e-5 enquanto manteve os outros módulos (atenção fusão e restrição monótona GBDT) inalterados para avaliar o equilíbrio entre força de proteção de privacidade e utilidade do modelo. O experimento mediu tanto o AUC-ROC (utilidade do modelo) quanto o MI-AUC (risco de privacidade) como indicadores duplos, com os resultados apresentados na Tabela 10. Quando ε=1, o MI-AUC caiu para 0,53 (excelente proteção de privacidade), mas o AUC-ROC alcançou apenas 0,821 (perda significativa de utilidade). Em ε=5, o AUC-ROC recuperou para 0,912 (atendendo aos requisitos de controle de risco financeiro) com MI-AUC=0,58 (proteção efetiva de privacidade). Quando ε>5, a melhora no AUC-ROC ficou abaixo de 0,01, enquanto o MI-AUC subiu rapidamente para 0,63 (excedendo os limites de risco de privacidade). Isso confirma que ε=5 é o orçamento total de privacidade ideal, alcançando um equilíbrio entre privacidade e utilidade.
| Orçamento Total de Privacidade. | Modelo AUC-ROC | MI-AUC (risco de privacidade) | Taxa de vazamento de características FLR | Fração de Brier |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
Tabela 10: Comparação do desempenho do modelo com diferentes orçamentos de privacidade ε.
Contribuição da fusão de atenção vs. média simples
Para avaliar as diferenças de desempenho entre "fusão de atenção" (a estratégia proposta) e "média simples" (estratégia FedAvg) em cenários de dados não independentes, duas variáveis foram configuradas experimentalmente: (1) Severidade dos Dados Não IID (medida por variações específicas da taxa de inadimplência da instituição), baixa variação: 0,2%-0,5%, alta variação: 0,2%-3,5%); (2) Estratégias de fusão (fusão de atenção vs média simples). Como mostrado na Figura 2, a diferença entre AUC e ROC entre as duas estratégias foi de apenas 0,023 (0,912 contra 0,889) em cenários não-IID baixos. No entanto, essa diferença se ampliou para 0,076 (0,905 vs 0,829) em cenários de alto nível não-IID, com o modelo de média simples apresentando sobreajuste significativo (conjunto de treinamento AUC-ROC 0,941 vs conjunto de validação 0,829). Isso demonstra que mecanismos de atenção podem mitigar efetivamente a degradação de desempenho causada por dados não independentes por meio de ponderação dinâmica — como atribuir 0,32 de peso à instituição E com previsões padrão precisas e 0,12 de peso à instituição C com desvios maiores.

Figura 2: Comparação de estratégias de fusão sob diferentes graus de não-IID. Por favor, clique aqui para ver uma versão maior desta figura.
Efeito dos regularizadores de equidade nos KPIs baseados no lucro
A principal demanda das instituições financeiras é garantir lucros empresariais sob a restrição da justiça; portanto, o experimento introduz um índice orientado ao lucro - "retorno ajustado ao risco sobre o capital (RAROC)". A fórmula é a seguinte:
(39)
A perda esperada é calculada como a probabilidade de inadimpleção multiplicada pela taxa fixa de perda em inadimplência (fixada em 40%), enquanto o capital econômico é determinado pela exposição ao risco multiplicada pelo peso ao risco (conforme os requisitos de Basileia III). As métricas de justiça (ΔDP, ΔEO) e o RAROC do modelo com regularização de justiça versus o modelo sem ela são comparados na Tabela 11. Após a implementação da regularização de justiça, o ΔDP diminuiu de 0,15 para 0,04, o ΔEO caiu de 0,12 para 0,03, e o RAROC diminuiu apenas 2,1% (18,3% contra 18,7%), significativamente abaixo do limite aceitável pela indústria de 5%. Isso demonstra que o mecanismo de justiça em nosso estudo atende efetivamente aos requisitos regulatórios de não discriminação, ao mesmo tempo em que controla as perdas de lucro.
| Configuração do modelo | ΔDP (diferença de taxa positiva de grupo) | ΔEO (diferença TPR de grupo) | GCE (erro de calibração de grupo) | RAROC (Retorno Ajustado ao Risco sobre Ativos) | FPR (taxa de falso positivo) |
| Regra de não ter justiça | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| Há justiça e regularidade | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
Tabela 11: Influência da regularização de equidade nos indicadores de equidade e lucro.
Detalhes da implementação
Para garantir a reprodutibilidade do experimento, a pesquisa esclareceu a pilha técnica e os detalhes do processo de treinamento: (1) Ambiente de hardware: Cada nó institucional utiliza processadores Intel Xeon Gold 6248, 64GB de RAM e GPUs NVIDIA Tesla V100; o coordenador federado emprega processadores duplos Xeon Gold 6348 com 128GB de RAM para garantir computação paralela e agregação eficiente de parâmetros. (2) Estrutura de software: A estrutura de aprendizado federado é desenvolvida usando PySyft 0.8.6, o módulo blockchain utiliza Hyperledger Fabric 2.5 (mecanismo de consenso: Raft), o treinamento de modelos depende do PyTorch 2.0 e XGBoost 2.0.3, enquanto o módulo de privacidade diferencial integra a IBM DP Library. (3) Processo de treinamento: (1) pré-processamento de dados (2 horas, incluindo normalização semântica e aprimoramento do CopulaGAN); (2) Treinamento local (5 épocas por rodada, taxa de aprendizado diminuída por recozimento cosseno); (3) Agregação assíncrona (atualizações globais do modelo ocorrem quando o coordenador recebe parâmetros de 3 instituições); (4) Avaliação do modelo (AUC-ROC e métricas de justiça calculadas após 10 rodadas); (5) Otimização por hiperparâmetros (otimização bayesiana com 50 iterações para determinar parâmetros ótimos). (4) Testes de robustez: cenários simulados de desconexões institucionais (seleção aleatória de uma instituição para interromper 1-3 rodadas de treinamento) e ruído de dados (adicionando 5% de perturbações no valor das características). Os resultados mostraram flutuações do AUC-ROC abaixo de 0,02, demonstrando a capacidade anti-interferência do sistema.
Este estudo empregou uma estratégia de escalonamento de recozimento cosseno com uma taxa inicial de aprendizado de 0,05. A taxa de aprendizado foi atualizada dinamicamente a cada época de acordo com a fórmula ao longo de um total de 100 épocas de treinamento. Essa estratégia manteve uma alta taxa de aprendizado nos estágios iniciais do treinamento, por exemplo 0,05 na primeira época, para acelerar a convergência do modelo, e gradualmente a decaiu até quase zero, por exemplo 0,00025 na centésima época, para aumentar a estabilidade do ajuste fino dos parâmetros. Resultados experimentais demonstraram que, comparado a uma taxa de aprendizado fixa, essa estratégia melhorou o conjunto de validação AUC-ROC em 2,3% e acelerou a velocidade de convergência em 37%. A partição dos dados foi baseada em um conjunto bruto de cinco instituições financeiras, totalizando 5 milhões de amostras, seguindo estritamente o princípio do isolamento interinstitucional dos dados. Os dados locais de cada instituição foram divididos cronologicamente, selecionando dados de janeiro de 2022 a junho de 2023 como conjunto de treinamento (70%), dados de julho a setembro de 2023 como conjunto de validação (15%) e dados de outubro a dezembro de 2023 como conjunto de teste (15%). Essa partição garantiu a independência da janela temporal dos conjuntos de treinamento, validação e teste, simulando efetivamente a evolução dos padrões temporais de risco em cenários do mundo real. Os hiperparâmetros-chave foram determinados por meio da otimização bayesiana. Dentro de um espaço de busca conjunto que abrange uma taxa inicial de aprendizado entre 0,01 e 0,1, números de árvore GBDT entre 50 e 200, e cabeças de atenção Transformer do conjunto {2, 4, 8}, 50 iterações foram executadas com o objetivo de maximizar o conjunto de validação AUC-ROC. A combinação ótima final foi identificada como uma taxa inicial de aprendizado de 0,05, árvores de 120 GBDT e 4 cabeças de atenção.