$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Arquitectura del sistema
Malla de datos interinstitucional y capa semántica
Para abordar la heterogeneidad de datos entre instituciones, la investigación construye una arquitectura Data Mesh mediante la partición de nodos basada en dominios. Cada institución financiera opera como un nodo independiente del dominio de datos, manteniendo los derechos de propiedad y control, con la capa semántica que permite la comprensión e interacción unificada de datos. La capa semántica basada en ontologías establece un modelo unificado de datos de control de riesgos financieros, definiendo entidades centrales, atributos demapa f y relaciones entre las entidades. Las reglas específicas de mapeo semántico se detallan en la Tabla 5. Para campos específicos de la institución, las conversiones estandarizadas se logran mediante funciones de mapeo semántico:
(18)
| Entidad núcleo | El nombre de campo A de la institución | Nombre del campo B en la institución | Nombre de campo uniforme de capa semántica | Tipo de datos | Reglas estandarizadas |
| Cliente | Valoración premium de clientes (1-5) | Niveles VIP de clientes (bronce a diamante) | Calificación crediticia del cliente (1-5) | Entero | Bronce→1, Plata→2, Oro→3, Platino→4, Diamante→5 |
| Negocios | Importe de la transacción (diez mil yuanes) | Importe de la transacción (yuan) | Importe de la transacción (yuan) | Número flotante | El valor del campo A en la institución es 10.000 veces |
| Solicitud de crédito | Cuota de solicitantes (ratio de créditos) | Importe esperado del préstamo | Cuantero del préstamo solicitante (yuan) | Número flotante | Institución A: Ratio total de créditos × cantidad de solicitud; Institución B: mapeo directo |
Tabla 5: Reglas semánticas de mapeo de entidades centrales en el ámbito del control de riesgos financieros.
Aquí es xi,j el valor específico i-ésimo del campo de la institución j, min(x j) y max(x j) son los valores mínimo y máximo del campo dentro de la institución, respectivamente, Uj y Lj definen los límites superior e inferior del rango unificado de valores para este campo en la capa semántica.
Registro global de modelos y rastreo de auditoría basado en blockchain
Para resolver problemas de gestión caótica de versiones de modelos y procesos de formación no rastreables en el aprendizaje federado, se emplea la tecnología blockchain para establecer un registro global de modelos y un sistema de auditoría y rastreo. Utilizando una arquitectura blockchain de consorcio, los nodos participantes incluyen instituciones financieras, coordinadores federados y organismos reguladores, garantizando la inmutabilidad de los datos y el consensomultipartito 23. El registro global de modelos almacena metadatos centrales de los modelos, incluyendo números de versión, rondas de entrenamiento Hv, listas de instituciones participantes, parámetros estructurales y métricas de rendimiento. Estos metadatos se almacenan usando una estructura de árbol de Merkle, y cada versión del modelo corresponde a un valor hash único:
(19)
Aquí v es el número de versión del modelo, T es el número total de rondas de entrenamiento, S es el conjunto de instituciones que participan en la formación, IDi es el identificador único de una institución i, θv es el vector de parámetro del modelo para la versión v, y AUCv es el valor AUC-ROC de esta versión del modelo que se muestra.
Pipeline federado de ingeniería de características
Alineación segura de entidades y armonización de esquemas
La ingeniería de características es el componente central de la colaboración interinstitucional de datos, requiriendo una extracción, alineación y agregación efectivas de características, garantizando al mismo tiempo la privacidad de los datos. Este estudio diseña una pipeline integral que abarca alineación segura de entidades, coordinación de esquemas y agregación diferencial de grafos de transacciones integrados en privacidad para abordar tanto la heterogeneidad de características interinstitucionales como los riesgos de fuga de privacidad24. La alineación entre entidades entre instituciones es esencial para lograr la colaboración de funcionalidades. Sin embargo, transmitir directamente identificadores de clientes comprometería la privacidad. Por ello, la investigación adopta un método de alineamiento de entidades que preserva la privacidad, combinando cifrado homomórfico (HE) con tecnología de hashing sensible a la localidad (LSH). Las instituciones preprocesan identificadores de clientes utilizando funciones hash SHA-256 para generar identificadores preliminares. Estos identificadores se mapean entonces en el mismo "cubo" a través de LSH para reducir el cálculo posterior de cifrado. Los identificadores dentro del mismo cubo pasan por cifrado homomórfico de Paillier. Los identificadores cifrados se suben al coordinador federado, que logra la alineación de entidades comparando la similitud de identificadores cifrados usando similitud coseno.
(20)
Cuando la similitud es mayor que el umbral preestablecido (en este estudio, se toma como τ=0,95), se determina que es la misma entidad y se genera un ID unificado entre instituciones para lograr una alineación segura de entidades.
Agregación diferencial privada de incrustaciones en grafos de transacciones
Los datos de transacciones financieras presentan características estructuradas en grafos distintas (con clientes como nodos y transacciones como aristas). La incrustación de grafos de transacciones captura eficazmente los patrones de transacción de las partes relacionadas de los clientes, proporcionando características críticas para los modelos de control de riesgos. Sin embargo, la agregación directa de incrustaciones interinstitucionales de Gi=(V i,E i)ViiEi e i,v∈Rdd d de la transacción puede filtrar información relacionada con transacciones de los clientes. Por ello, se introduce la tecnología DiferencialPrivacy (DP) para lograr la agregación preservadora de la privacidad de las incrustaciones de grafos de transacciones. Cada institución construye localmente un grafo de transacciones, donde representa el conjunto de nodos cliente de la institución y representa el conjunto de aristas de transacción (ponderaciones de aristas iguales a los importes de las transacciones). El algoritmo GraphSAGE se emplea para generar incrustaciones de nodos (con dimensiones de incrustación de 256 dimensiones en este estudio). Para cumplir con los requisitos diferenciales de privacidad, se añade ruido laplaciano a las incrustaciones locales:
(21)
Aquí ΔG Sensibilidad global del algoritmo GraphSAGE (estimada por experimento en este estudio ΔG=0,8), para el presupuesto local de privacidad de la agencia,
(22)
Para el presupuesto total de privacidad del sistema, este estudio toma εtotal = 1,5). El coordinador agrega la incrustación de ruido de cada institución utilizando una estrategia de media ponderada
, con pesos basados en el porcentaje de clientes de cada institución:
(23)
El gráfico global agregado de transacciones
se integra y se reenvía a cada institución. Como característica clave del modelo de control de riesgos, no solo conserva la información de correlación transinstitucional, sino que también protege la privacidad del cliente mediante una privacidad diferencial.
(24)
Modelo híbrido de riesgo de IA
Submodelos locales: Aumento de gradiente con restricciones monótonas
Los modelos tradicionales de control de riesgos centralizados por IA tienen dificultades para adaptarse a escenarios federados interinstitucionales. Este estudio desarrolla un modelo híbrido de riesgo de IA que combina "submodelos locales + modelo de fusión global", integrando la alta interpretabilidad de los Gradient Boosting Trees (GBDT) con la adaptabilidad de Transformer a datos no independientes e idénticamente distribuidos (NID). Se introduce un módulo de interpretación para equilibrar el rendimiento y la explicabilidad del modelo en entornos federados. Cada institución construye localmente submodelos de GBDT, elegidos por su fuerte capacidad de ajuste de datos estructurales y alta interpretabilidad, requisitos esenciales para las regulaciones de control de riesgos financieros. Para evitar el sobreajuste y conclusiones ilógicas, se implementan restricciones monótonas durante la formación en GBDT, imponiendo patrones monótonos de aumento o disminución para características clave como los ingresos de los clientes y las puntuaciones crediticias. El primer conjunto de árbol por GBTD es ht(x), y la salida del modelo es:
(25)
Aquí, η es la tasa de aprendizaje (este estudio toma η=0,1). La restricción monótona se realiza mediante regularización de la función de pérdida xj.
Añadir término de restricción:
(26)
Aquí, x≺x' representa que el valor propio de x es menor que el valor propio de x', y la función de pérdida final es:
(27)
Aquí, l es la función de pérdida logarítmica (utilizada en el escenario binario de control de riesgo yi∈{0,1}, que indica si el cliente incumple).
es el término de regularización de complejidad para el árbol, λ y γ son el coeficiente de regularización (Este estudio se realizó mediante λ=0,01 γ=0,5 de validación cruzada, ni es el número de muestras locales para la institución i,T es el número de árboles (Este estudio tomó T=100).
Fusión global: transformador basado en la atención para adaptación no IID
Los datos interinstitucionales muestran características significativas de distribución no IID. Los algoritmos tradicionales de FedAvg, que simplemente promedian los parámetros locales del modelo, tienen dificultades para adaptarse a los datos no IID. Para abordar esto, la investigación introduce una atención pi(x)=σ(Fi(x))σFi(x)ia i-based en un modelo de Transformer para la fusión inteligente de submodelos locales. El modelo de fusión global toma como entrada las probabilidades de salida del submodelo local de cada institución (salidas de funciones sigmoides de modelos institucionales GBDT). La arquitectura Transformer comprende un codificador y una capa de atención, donde la capa de atención calcula los pesos de atención a partir de las salidas de diferentes instituciones para lograr una ponderación adaptativa. Los pesos de atención se calculan usando Atención Escalar Producto Escalar:
(28)
Aquí, q es el vector de consulta (generado por las características de riesgo promedio de muestras globales),
es el vector clave de la institución i, dk es la dimensión del vector clave (en este estudio dk=64), n es el número de agencias que participan en la federación.
La probabilidad final de salida del modelo global es:
(29)
A través del mecanismo de atención, el modelo global puede asignar automáticamente un mayor peso a las instituciones con alta calidad de datos y predicción precisa del riesgo, y mejorar la adaptabilidad a los datos no IID.
Módulo de explicabilidad: SHAP en árboles federados + generador de contrafactuales
Los modelos de control de riesgos financieros deben mantener la interpretabilidad para cumplir con los requisitos regulatorios y proteger el 'derecho de los clientes a saberlo'. Para abordar esto, la investigación desarrolla un módulo de interpretabilidad que combina generadores contrafactuales federados SHAP+. Para los submodelos locales de GBDT, la investigación emplea valores SHAP para medir la importancia de las características, que Si∈R N i×m cuantifican la contribución de cada característica a los resultados de predicción. En escenarios federados, transmitir directamente valores locales de SHAP podría comprometer la información de distribución de características. Por ello, la investigación implementa una estrategia de agregación segura en la que cada institución calcula localmente la matriz de valores SHAP (para el recuento de características), aplica ruido diferencial de privacidad a los valores SHAP y los sube al coordinador federado. El coordinador entonces calcula los valores globales de SHAP:
(30)
Aquí, Si' es la matriz de valores SHAP de la institución i, y wi es la proporción del tamaño de la muestra de las instituciones.
Introduce el vector propio actual del cliente x y la calificación deriesgo objetivo y, la salida es un vector de características antifactual xcf, satisfecho (el umbral θ deprobabilidad objetivo correspondiente a la calificación de riesgo objetivo). Y |xcf-x|2 el mínimo (es decir, el coste de ajuste más bajo). La función de pérdida del generador de hechos es:
(31)
Aquí α,β,γ son los coeficientes de peso (en este estudio α=10,β=5,γ=1),LGAN La función de pérdida adversarial se utiliza para GAN para asegurar la racionalidad y autenticidad del vector de características contrafactuales.
Capa de privacidad y seguridad
Agregación segura con compartición aditiva de secretos
En el aprendizaje federado, la transmisión y agregación de parámetros locales del modelo es un eslabón clave en la fuga de privacidad. Se adopta la tecnología AdditiveSecretSharing (ASS) para lograr una agregación segura y evitar la adquisición directa de parámetros locales del modelo de cada organización por parte del coordinador. El proceso específico es el siguiente: i) Cada institución dividirá los parámetros del modelo local en acciones secretas θ i,1,θi,2,...,θi,n , satisfaciendo
, Aquí está el número de instituciones participantes; ii) La institución i envía la parte θi,k a la institución (k≠i), conservando su propia parte θi,i; iii) Cada institución k recoge acciones enviadas por todas las demás instituciones θ1,k,θ 2,k,...,θn,k , y suma todo con la θk,k parte retenida por sí misma, obteniendo la suma parcial; iv) Todas lasinstituciones subirán y compartirán parte con el coordinador, que calcula los resultados
de la agregación global de parámetros. Mediante el intercambio aditivo de secretos, el coordinador solo puede obtener parámetros agregados globales y no puede deducir n-1ttt=⌈n/2⌉ los parámetros locales de ninguna institución individual. Incluso la colusión entre múltiples instituciones no puede recuperar parámetros de otras, garantizando la privacidad y la seguridad durante la transmisión de parámetros. Para abordar la pérdida de cuotas causada por desconexiones institucionales, se introduce el mecanismo de intercambio de secretos de Shamir como respaldo. Cada parte se divide a su vez en fragmentos. Al recoger cualquier fragmento, se puede restaurar la parte completa, mejorando así la robustez del sistema.
Calibración adaptativa de ruido bajo (ε, δ)-planificación de presupuesto DP
El principal desafío de la privacidad diferencial radica en equilibrar la solidez de la protección de la privacidad con el rendimiento del modelo. Los métodos tradicionales de adición de ruido fijo tienen dificultades para adaptarse a escenarios en los que las distribuciones de datos cambian dinámicamente durante el entrenamiento federado. Este estudio diseña un mecanismo adaptativo de calibración de ruido basado en (ε,δ)-DP, combinado con una estrategia de planificación del presupuesto de privacidad, para lograr un ajuste dinámico de la intensidad del ruido. Definir el presupuesto total de privacidad del sistema como (Este estudio toma δtotal = 10-5 , cumple con los requisitos del RGPD para el riesgo de privacidad), adoptar la estrategia de planificación segmentada del presupuesto, el presupuesto total se asigna mediante {ε1.ε 2,...,εT} ciclo de formación de la siguiente manera, satisfecho:
(32)
En cada ronda de entrenamiento, la intensidad del ruido se ajusta dinámicamente según las características de distribución de los datos locales. Suponiendo que la varianza local de características de datos de la t-ésima ronda de institución es
, Defina el coeficiente de ajuste de ruido αi,t:
(33)
Cuando αi,t≥0,8 (la distribución de datos es estable), usando una intensidad
de ruido baja ; Cuando αi,t<0,8 (la distribución de datos fluctúa), aumentan la intensidad del ruido. Entre ellas, está la sensibilidad global de los parámetros del modelo (este estudio lo asegura mediante el recorte de gradientes).
Protocolo de entrenamiento eficiente en la comunicación
Actualizaciones asíncronas del cliente con control de estadía
El aprendizaje federado interinstitucional se enfrenta a desafíos como una alta latencia de comunicación y un consumo significativo de ancho de banda (especialmente para instituciones financieras pequeñas y medianas con recursos de red limitados). Este estudio diseña un protocolo eficiente de entrenamiento de comunicaciones que incorpora actualizaciones asíncronas del cliente, compresión de gradiente y retroalimentación de errores para reducir los costes de comunicación y mejorar la escalabilidad delsistema 25. Los métodos tradicionales de entrenamiento federado síncrono como FedAvg requieren esperar a que todos los clientes completen el entrenamiento local antes de la agregación de parámetros, lo que resulta en ciclos de entrenamiento largos. El mecanismo de actualización asíncrona del cliente permite a los clientes completar de forma independiente el entrenamiento local y subir parámetros de forma independiente. Al recibir estos parámetros, el coordinador federado actualiza el modelo global en tiempo real sin esperar a otros clientes. Esto aborda el problema de la anticuación del modelo en el entrenamiento asincrónico. Introduciendo la estrategia de control de estancamiento, define el valor de estancamiento para el cliente , (para tactual la ronda global de entrenamiento actual, tlast_update La ronda en la que el cliente obtuvo por última vez el modelo global). Cuando (Smax es la máxima estagnación permitida, este estudio toma smax=5) . El cliente participa en la formación de forma normal; A> s s como máximo ese momento, el cliente necesita descargar el último modelo global antes del entrenamiento local. La configuración de hardware consiste en CPUs Intel Xeon E5-2678 v3 (12 núcleos, 2,5GHz) emparejadas con GPUs NVIDIA Tesla V100 (16GB de VRAM) y 64GB de memoria DDR4 por nodo para manejar cargas de entrenamiento distribuidas de forma eficiente. Para la inicialización de software, comandos PySyft como hook = sy. TorchHook (antorcha)andvirtual_worker = sy. VirtualWorker(hook, id="client1") se utilizan para establecer conexiones federadas seguras, mientras que federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) permite la carga de datos federada entre los participantes. El mapeo semántico transforma las características financieras entre instituciones, por ejemplo, convirtiendo los importes de las transacciones de USD a CNY usando una fórmula dinámica de tipo de cambio: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), donde el tipo de cambio se actualiza periódicamente mediante API. Para complementar conjuntos de datos desbalanceados, CopulaGAN genera muestras sintéticas adversariales con un fragmento de código similar al de la importación sdv.tabular CopulaGAN; sintetizador = CopulaGAN(epochs=50); synthesizer.fit (train_data); synthetic_samples = sintetizador.sample(num_rows=1000), preservando las propiedades estadísticas de los datos originales. El entrenamiento local de GBDT impone restricciones monótonas (por ejemplo, asegurando que "credit_score" se correlacione positivamente con "approval_probability") viaparams = {"monotonic_constraints": (1, 0, -1)}en LightGBM, mientras que la fusión con Transformers se implementa en PyTorch con capas de atención multicabezas:self.attention = nn. Atención Multicabeza (embed_dim=64, num_heads=4); attn_output, _ = auto.atención (consulta, clave, valor, key_padding_mask=padding_mask), seguido de normalización de capas y conexiones residuales para la estabilidad. La privacidad diferencial inyecta ruido de Laplace escalado a la sensibilidad L1 (Δf) y al presupuesto de privacidad (ε)—por ejemplo, añadiendo ruido muestreado de np.random.laplace(loc=0, scale=Δf/ε) donde Δf=1.2 y ε=0.5 a gradientes antes de la agregación. Las restricciones de equidad se aplican después del entrenamiento reponderando las muestras inversamente proporcional a su prevalencia de grupo (sample_weight = 1 / group_counts[y_train]) para mitigar las violaciones de paridad demográfica. Al mismo tiempo, se utiliza la estrategia de agregación ponderada para ajustar el peso de los parámetros del cliente según el valor de estancamiento:
(34)
Donde λ=0,1 es el coeficiente de penalización por estancamiento; cuanto mayor es la estancamiento, menor es el peso, lo que reduce el impacto de los parámetros obsoletos en el modelo global.
Compresión de gradiente y acumulación de error-retroalimentación
Los parámetros del modelo (particularmente los pesos de atención en los modelos globales de fusión Transformer) tienen una alta complejidad dimensional. La transmisión directa consumiría un ancho de banda excesivo, lo que requeriría técnicas de compresión de gradiente para reducirla transferencia de datos 26. Este estudio integra la dispersión Top-K con compresión de cuantización, siguiendo estos pasos específicos: i) Top-K escaso: Para el modelo local ∇θi gradiente, seleccione el elemento gradiente K% con el valor absoluto más grande a conservar, K El resto de los elementos son cero, El valor se ajusta dinámicamente según la condición de ancho de banda (cuando el ancho de banda es suficiente K=30, cuando el ancho de banda es limitado K=10); ii) Compresión de cuantización: Los elementos del gradiente retenido se cuantizan desde punto flotante de 32 bits hasta enteros de 8 bits. La fórmula de cuantización es:
(35)
iii) Realimentación de error: Almacenar el gradiente descartado Δ∇=∇θi-∇θierror comprimido durante la compresión en el lado del cliente, en el siguiente cálculo del gradiente, el error se acumula en el nuevo gradiente, acercándose ,
, Compensar las pérdidas por compresión. Los efectos de la compresión por gradiente y la retroalimentación de error se muestran en la Tabla 6, Entrada, 8 K=20% de condiciones de cuantización de bits. La relación de compresión alcanza 15:1 (volumen de datos original/volumen de datos comprimidos), y mediante la retroalimentación de errores, el AUC-ROC del modelo solo disminuye entre un 0,5% y un 1,0%, logrando el equilibrio entre el coste de comunicación y el rendimiento del modeloen 27.
| Estrategias de compresión | Relación de reducción | Consumo de ancho de banda de subida (MB/ronda) | Tasa de declive AUC-ROC | Tasa de reducción del tiempo de entrenamiento |
| sin comprimir (punto flotante de 32 bits) | 1:01 | 128 | 0.00% | 0.00% |
| Cuantización de 30% superior dispersa + 16 bits | 6.7:1 | 19.1 | 0.30% | 35.20% |
| 20% superior de dispersión + cuantización de 8 bits | 15:01 | 8.5 | 0.80% | 58.70% |
| Esparso del 10% superior + cuantización de 8 bits | 30:01:00 | 4.3 | 2.10% | 72.10% |
Tabla 6: Comparación de rendimiento de estrategias de compresión por gradiente.
Regularización consciente de la equidad
Los modelos de control de riesgos financieros deben evitar la discriminación contra grupos específicos y cumplir con requisitos regulatorios, incluyendo la Ley de Protección de Información Personal y la Ley de Información Justa en la Información Crediticia. Este estudio introduce un mecanismo de regularización consciente de la equidad para restringir los sesgos de predicción intergrupal durante el entrenamiento del modelo, asegurando la equidad del modelo. Se definen dos indicadores clave de equidad: i) Paridad demográfica (DP): La tasa de predicción positiva es igual para diferentes grupos, enfoque,
, Entre ellos, está el identificador del grupo ; ii) Igualdad de Oportunidades (EO): La tasa de verdaderos positivos es igual entre los grupos, enfoque
. Añadir términos de regularización de equidad a la función de pérdida del modelo híbrido de riesgo de IA, e imponer restricciones al submodelo local GBDT y al modelo global Transformer respectivamente: iii) Restricciones de equidad local del modelo:

Aquí PR(g=A) es la tasa de predicción positiva para el grupo g, λ, y es el coeficiente de regularización para la equidad.
iv) Restricción global de equidad del modelo: Añadir el ajuste de peso de equidad de grupo a la capa de atención de Transformer, la salida del modelo para grupos vulnerables ag=a base×(1+β⋅Δinjusta) recibe un mayor peso de atención, aquí,Δ infair representa el sesgo de equidad entre este grupo y el grupo dominante (Δinjusta=PR (grupo dominante)-PR (grupos vulnerables)); λEO es el coeficiente de compensación por desviación. El efecto de la regularización de la percepción de la equidad se evalúa mediante ΔDP (desviación DP), ΔEO (desviación EO) y error de calibración de grupo.
Panel de control de gobernanza y cumplimiento del modelo
Monitorización de sesgo en tiempo real
Para cumplir con los requisitos de la regulación financiera en la gestión del ciclo de vida de los modelos, la investigación ha desarrollado un panel de control de gobernanza y cumplimiento del modelo que integra APIs de monitorización de desviaciones en tiempo real y de informes regulatorios, permitiendo la supervisión y trazabilidad de procesos completos durante la formación, despliegue e iteración del modelo. El módulo de monitorización de desviaciones en tiempo real logra un seguimiento dinámico de la equidad y el rendimiento del modelo mediante las siguientes dimensiones: i) Monitorización de desviaciones de grupos: Categorizar grupos por género del cliente, edad, región, nivel de ingresos, etc., calcular PR, TPR y FPR (Tasa de Falsos Positivos) para cada grupo cada hora. Las alertas de desviación se activan cuando las diferencias de PR entre grupos superan 0,08 o las diferencias de TPR superan 0,05; ii) Monitorización de deriva de rendimiento: Cálculo continuo de métricas como AUC-ROC y PR-AUC. Cuando estas métricas disminuyen más del 2% consecutivamente durante tres horas, se determina como deriva de rendimiento, iniciando automáticamente el proceso de reentrenamiento del modelo. iii) Monitorización del cumplimiento de la privacidad: Registrar el consumo del presupuesto de privacidad y la adición de ruido εtotal o 10 intensidad de cada ronda de entrenamiento. Cuando el consumo de ε de una sola ronda supere, pausa el entrenamiento y ajusta la estrategia de ruido. iv) El seguimiento de los datos se muestra a través de paneles visuales, lo que permite a los reguladores y las instituciones participantes verlos en tiempo real y lograr una gestión transparente de los riesgos del modelo.
API de informes regulatorios
Para simplificar el proceso regulatorio de informes, se diseña una API estandarizada de informes regulatorios para apoyar la generación automática de informes que cumplan con normativas como el RGPD, la CCPA y la Ley de Protección de Información Personal de China. Las funciones principales incluyen: i) Informe de Cumplimiento de Fuentes de Datos: Agrega automáticamente tipos de datos, volúmenes y estado de autorización de las instituciones participantes para verificar el cumplimiento del principio de "mínimo necesario"; ii) Informe de Cumplimiento de Formación Modelo: Registra iteraciones de formación, instituciones participantes, medidas de protección de la privacidad y métricas de equidad para generar un informe de trazabilidad de formación modelo; iii) Informe de cumplimiento de predicción de riesgos: Muestra patrones de distribución conformes con la normativa de predicciones de modelos entre diferentes grupos y casos de explicación contrafactual para demostrar la no discriminación. La API adopta un estilo de diseño RESTful, soportando salidas en formatos JSON y XML. Las autoridades regulatorias pueden acceder directamente a los datos de los informes a través de interfaces API o establecer ciclos automáticos de informes para lograr procesos regulatorios automatizados y estandarizados. Las plantillas de informes cumplen con las normas regulatorias del modelo financiero de la Organización Internacional de Normalización (ISO), garantizando la autoridad y universalidad de los informes.
Diseño experimental: Descripción del conjunto de datos
Datos de tarjetas de crédito multiinstitucionales y préstamos para pymes
Los datos experimentales se originaron en instituciones financieras en China, cubriendo tipos de datos como transacciones personales con tarjeta de crédito y registros de solicitudes y cumplimientos de préstamos para pymes. La tecnología CopulaGAN se empleó para sintetizar y mejorar eventos fraudulentos raros, construyendo así un conjunto de datos experimental que combina autenticidad con integridad. Los datos reales utilizados en el experimento incluyen dos categorías principales: datos personales de transacciones con tarjeta de crédito y datos de préstamos para pymes, sumando más de 5 millones de registros desde enero de 2022 hasta diciembre de 2023. Los datos cubren cuatro grandes regiones económicas: Norte de China, Este de China, Sur de China y Suroeste de China, para garantizar la representatividad geográfica y la diversidad en la distribución de las muestras. Los campos centrales y las características estadísticas de los datos institucionales se muestran en la Tabla 7. Entre ellas, las Instituciones A y B son bancos comerciales nacionales con amplias bases de clientes que abarcan todos los grupos de edad; Las instituciones C y D son bancos de internet que atienden principalmente a jóvenes (20-35 años); La Institución E es una empresa de financiación al consumidor que se dirige a usuarios en mercados de menor nivel, con una distribución de datos que presenta características significativas no relacionadas con IID. El conjunto de datos contiene 115.610 piezas de datos. El conjunto de datos es proporcionado por instituciones financieras que colaboran con universidades
| Tipo de datos | Institución | Número de registros (10.000) | Número de clientes (10.000) | Campos núcleo | Tasa de fraude por impago | Características de distribución de datos |
| Transacciones con tarjeta de crédito | A | 180 | 85 | Tiempo de la transacción, importe, tipo de comerciante, ubicación de la transacción, si robar la tarjeta | 0.32% | Las transacciones grandes representan una proporción elevada (> 5000 yuanes) |
| Transacciones con tarjeta de crédito | B | 150 | 72 | Número de flujo de transacción, importe (USD/RMB), canal de pago, valoración del cliente | 0.28% | Las transacciones transfronterizas representan el 15% |
| Transacciones con tarjeta de crédito | C | 120 | 68 | Marca temporal de la transacción, importe, si instalar, edad del cliente, ubicación del número de teléfono móvil | 0.45% | El pequeño comercio de alta frecuencia (<1000 yuanes representa el 60%) |
| Préstamos para pequeñas y microempresas | D | 32 | 1.2 | Nombre de la empresa, importe del préstamo, plazo de crédito, escala de ingresos, importe del impuesto, si venció | 2.80% | Los clientes manufactureros representan el 40% |
| Préstamos para pequeñas y microempresas | E | 18 | 0.8 | Fecha de solicitud de préstamo, importe esperado, tipo de negocio, número de empleados, historial de desempeño | 3.50% | Los clientes de servicio representan el 70% |
Tabla 7: Características estadísticas de un conjunto de datos financieros reales multiinstitucional.
Para abordar la heterogeneidad de los datos interinstitucionales, el experimento se apegó estrictamente a las especificaciones de la cuadrícula de datos y de la capa semántica estandarizando los campos institucionales: por ejemplo, convertir el "importe de transacción (USD)" de la Institución B a RMB usando el tipo de cambio de la fecha de transacción y unificar el nombre del campo a "importe de transacción (YUAN)"; convirtiendo la "edad del cliente" de la Institución C (formato "1990-01-01") en una edad entera; y el mapeo de la "escala de ingresos empresariales" de la Institución D (clasificada como "por debajo de 1 millón / 1-5 millones / más de 5 millones") hasta los puntos medios de rangos numéricos (500.000, 3.000.000, 7.500.000), asegurando la coherencia entre el formato de datos y el significado semántico.
Aumento sintético vía CopulaGAN para eventos de fraude poco comunes
En escenarios de control de riesgos financieros, las muestras de fraude/impago suelen representar una proporción extremadamente baja. Utilizar directamente tamaños de muestra tan pequeños para el entrenamiento del modelo conduciría a graves problemas de desequilibrio de clases, comprometiendo las capacidades de generalización del modelo. El experimento emplea Copula GAN (una red generativa adversarial basada en funciones Cópula) para sintetizar datos aumentados en casos raros de fraude. Este método combina la capacidad de la función Copula para modelar distribuciones de datos de alta dimensión con las capacidades generativas de GAN, permitiendo la creación de datos sintéticos que se alinean con patrones reales de fraude evitando el problema del "colapso de patrones" comúnmente observado en la generación tradicional de GAN.
Estructura del modelo CopulaGAN
CopulaGAN consta de tres partes: Generador, Discriminador y módulo de restricción de distribución de cópula: (1) Generador: La entrada es un vector de ruido aleatorio de 128 dimensiones z∼N(0,1), y la salida de un vector de características sintético consistente con la dimensión real de la muestra a través de una red totalmente conectada de 3 capas (las dimensiones ocultas de capa son 256, 512, 256); (2) Discriminador: La entrada es muestra real o muestra sintética xsin, y a través de una red totalmente conectada de dos capas + función de activación sigmoide, se genera la probabilidad de que la muestra sea un dato real; (3) Módulo de restricción de distribución de cópula: ajustar la distribución conjunta de muestras reales de fraude mediante la función de cópula gaussiana (donde es el valor de la función de distribución de aristas de la octava característica de i), y añadir la restricción de distancia de cópula en la pérdida del generador para asegurar que la distribución conjunta de muestras sintéticas sea consistente con las muestras reales.
(36)
Mejorar la verificación de procesos y efectos
El proceso de formación y mejora de CopulaGAN es el siguiente: i) Preprocesamiento de datos: Extraer muestras de fraude/por defecto (18.200 en total) de los datos reales de diversas instituciones; Estandarizar características continuas (x'=(x-μ)/σ); Las características discretas están codificadas con calor único; ii) Ajuste de la cópula: La función de cópula gaussiana se utiliza para ajustar la distribución conjunta de las muestras de fraude preprocesadas, calcular la función de distribución de aristas Fiθ y los parámetros de la función de cópula de cada característica; iii) Entrenamiento GAN: El generador y el discriminador se entrenan alternativamente. La función de pérdida del generador es:
(37)
Aquí, λ es el peso de restricción, y Distancia (Csin, Creal) es la divergencia KL entre la distribución de cópulas de muestras sintéticas y la distribución de cópula de muestras reales; La función de pérdida discriminadora es la pérdida binaria estándar de entropía cruzada:
(38)
Tras la convergencia del modelo (con la precisión del discriminador estabilizada al 50%±5%), el generador produjo 50.000 muestras sintéticas de fraude. Estos se mapearon de nuevo al espacio de características original según especificaciones semánticas y se mezclaron con muestras reales para construir un conjunto de entrenamiento equilibrado. Para validar la eficacia de las muestras sintéticas, la investigación las evaluó mediante una prueba KS de dos muestras y visualización de la distribución de características. Los resultados de la prueba KS mostraron que las diferencias en la distribución de características entre muestras sintéticas y reales estaban todas por debajo de 0,05 (estadística KS <0,05, valor p>0,05), indicando una buena consistencia en la distribución. La comparación de distribución de características demostró que las muestras sintéticas podían reproducir con precisión las características de distribución de muestras reales de fraude, proporcionando datos válidos suficientes para el entrenamiento del modelo, como se muestra en la Figura 1.

Figura 1: Comparación de la distribución de características entre muestras reales de fraude y CopulaGAN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Métricas de evaluación
El experimento construye un sistema de evaluación multiíndice a partir de cuatro dimensiones principales: rendimiento predictivo, protección de la privacidad, equidad y eficiencia en la comunicación para medir de forma integral el rendimiento integral del marco de aprendizaje federado y el modelo de control de riesgos con IA. La definición, el método de cálculo y los criterios de evaluación de cada dimensión se muestran en la Tabla 8.
| Dimensiones de la evaluación | Nombre del índice | Definición y método de cálculo | Criterio de evaluación |
| Rendimiento estimado | AUC-ROC | El área bajo la curva de trabajo característica del sujeto mide la capacidad del modelo para distinguir entre ejemplos positivos (por defecto/fraude) y negativos | Cuanto mayor sea el valor, mejor. El AUC-ROC del modelo excelente es>0,9 |
| PR-AUC | El área de recuerdo de precisión bajo la curva, aplicable a datos desbalanceados, mide el rendimiento de un modelo en escenarios donde los ejemplos positivos son escasos | Cuanto mayor sea el valor, mejor. El PR-AUC de un modelo excelente es>0,8 |
| Fracción de Brier | Error cuadrático medio entre la probabilidad predicha y la etiqueta verdadera, B=1Ni=1N(pi-yi)2 | Cuanto menor sea el valor, mejor. La puntuación Brier de un modelo excelente es inferior a 0,05 |
| Tasa de falsos positivos (FPR) | La proporción de ejemplos negativos FPR=FPFP+TNque | Cuanto menor sea el valor, mejor. Los escenarios financieros suelen requerir un FPR <1% (para evitar rechazar buenos clientes) |
| Protección de la privacidad | ε-Curva de consumo (ε-Curva) | Registrar la tasa de consumo del presupuesto acumulado de privacidad durante la formación para reflejar la capacidad de equilibrio dinámico de la protección de la privacidad | La curva se está estabilizando y el ε total es menor o igual a 5 (en línea con los requisitos de riesgo de privacidad del RGPD) |
| Ataque de razonamiento de miembros AUC (MI-AUC) | La capacidad de un atacante para inferir si una muestra pertenece al conjunto de entrenamiento a partir de los resultados de predicción del modelo, y cuanto más cerca esté el valor de AUC de 0,5, mejor será la privacidad | MI-AUC<0.6 es eficaz para la protección de la privacidad, MI-AUC<0.55 es excelente |
| Tasa de fuga de características (FLR) | El atacante agrega las características para revertir el error FLR=1-KL(P∥∥Q)Dmaxrate de la distribución original de datos, | FLR <0.1 indica que la protección de la privacidad es efectiva (P es Dmax, la verdadera distribución, Q es la inferida y es la distancia máxima KL) |
| Justicia | Sesgo de DP en estadística (ΔDP) | La diferencia máxima en la tasa de predicción ΔDP=max∥PRg-PRavg∥ de ejemplos positivos entre diferentes grupos, | ΔDP<0,05 para equidad, para excelencia (PRg para la tasa positiva del grupo g) |
| Sesgo EO (ΔEO) | La diferencia máxima en las tasas de ΔEO=max∥TPRg-TPRavg∥ entre diferentes grupos, | GCE <0,02 está bien calibrada (K es el número de grupo, es la tasa predicha y es la tasa real) |
| Error de calibración de grupo (GCE) | La desviación media entre la probabilidad predicha GCE=1Kg=1K∥pg-rg∥de cada grupo y la tasa real de impago, | Cuanto menor sea el valor, mejor. Los requisitos de escenarios de las organizaciones pequeñas y medianas son <10MB/ronda |
| Eficiencia de la comunicación | Ancho de banda de enlace ascendente por ronda | Consumo total de ancho de banda de los datos subidos por cada organización al coordinador durante una única | Cuanto menor sea el valor, mejor. Los escenarios interinstitucionales requieren menos de 120 minutos |
| Relación de reducción (CR) | La proporción del volumen de datos original respecto al volumen de datos comprimidos, CR=SizerawSizecomp | Cuanto mayor sea la relación de compresión, mejor. Soluciones excelentes CR>10:1 |
Tabla 8: Sistema de índice de evaluación experimental.
Explicación de la métrica: i) Ataque de Inferencia de Membresía: Utilizando la metodología de ataque caja negra, el atacante entrena un modelo binario de clasificación que introduce probabilidades predichas del modelo objetivo y genera el estado de pertenencia a la muestra. El riesgo de fuga de privacidad se mide mediante el AUC del modelo (es decir, MI-AUC). ii) Criterios de clasificación de grupos: En la evaluación de la equidad, los grupos se categorizan en cuatro dimensiones: género (hombre/mujer), edad (menores de 25/25-40/>40), región (mercados de primer nivel/nuevo primer nivel/segundo nivel/subsidiarias) y nivel de ingresos (<5k/5k-15k-15k/15k-30k/>30k RMB/mes). Esto garantiza la cobertura de grupos sensibles identificados por los reguladores financieros. iii) Criterios de convergencia: Durante el entrenamiento del modelo, si el conjunto de validación AUC-ROC muestra una disminución inferior a 0,001 en tres rondas consecutivas (cada ronda contiene 10 épocas), el entrenamiento se considera convergente y detenido.
Líneas base
Para validar la superioridad del propuesto "Modelo de Control de Riesgos de Aprendizaje Federado + Híbrido de IA", este estudio establece cinco modelos de referencia: modelos centralizados tradicionales, modelos clásicos de aprendizaje federado y modelos mejorados que preservan la privacidad. Los parámetros centrales y las estrategias de entrenamiento de cada modelo de referencia se detallan en la Tabla 9 para garantizar la equidad en experimentos comparativos (todos los modelos utilizan conjuntos de entrenamiento, conjuntos de validación y estrategias de optimización de hiperparámetros idénticos).
| Tipos de modelos | Nombre del modelo | Arquitectura central | Modo de entrenamiento | Medidas de protección de la privacidad | Hiperparámetros clave |
| Modelo centralizado | Tradición GBDT | Árbol de aumento de gradiente XGBoost | Todas las instituciones almacenan los datos de entrenamiento de forma centralizada | No tener | Número de árboles = 100, tasa de aprendizaje = 0,1, profundidad del árbol = 6, coeficiente de regularización λ=1,0 |
| Modelo centralizado | Modelo de aprendizaje profundo (MLP) | La red totalmente conectada de tres capas (capa de entrada 256 dimensiones → capa oculta 128 dimensiones → capa oculta 64 dimensiones → capa de salida 1 dimensión) | Todas las instituciones almacenan los datos de entrenamiento de forma centralizada | No tener | Optimizador=Adam, tasa de aprendizaje=0,001, tamaño del lote=256, Abandono=0,3 |
| Modelo federal clásico | FedAvg (promedio federal) | El modelo local es GBDT, y el modelo global adopta la agregación de medias de parámetros | Entrenamiento federal sincronizado | No tener | Tasa de participación = 0,8, época local = 5, ronda de agregación = 50, tasa de aprendizaje = 0,1 |
| Modelo federal clásico | FedProx (Agregación Federal de Extremo Cercano) | El modelo local es GBDT, y el proximal | Entrenamiento federal sincronizado | No tener | Tasa de participación = 0,8, época local = 5, ronda de agregación = 50, parámetro proximal μ = 0,01 |
μ=0.01 La restricción de términos se añade durante la agregación (). |
| Federación Empoderada por la Privacidad | FedAvg+DP (ruido fijo) | Añadir ruido laplaciano fijo a FedAvg (ε=5, δ=1e-5) | Entrenamiento federal sincronizado | Privacidad diferencial fija | Intensidad de ruido=0,1, tasa de participación=0,8, época local=5, rondas de agregación=50 |
| El modelo de investigación | FedRisk (Modelo Federal de Control de Riesgos) | GDT local (restricción monótona) + transformador global (fusión de atención) + DP + agregación segura | Formación Federal Asincrónica | Compartición de secretos additiva adaptativa DP+ | Época local=5, rondas de agregación=50, dimensión de atención=64, presupuesto de privacidadε=5, relación de compresión=15:1 |
Tabla 9: Comparación de parámetros entre el modelo de referencia y este modelo de estudio.
Explicación de la dimensión comparativa: (1) Centralizado vs. Federado: Al comparar "Traditional GBDT/MLP" con "FedAvg/FedProx/FedRisk", este estudio examina la degradación del rendimiento del aprendizaje federado en escenarios de "datos fuera del sitio". (2) Federado clásico vs. Mejorado en la privacidad: A través de "FedAvg" frente a "FedAvg+DP", la investigación evalúa el impacto de la privacidad diferencial en el rendimiento del modelo. (3) Federado síncrono vs. asíncrono: La comparación entre "FedAvg" (síncrono) y "FedRisk" (asincrónico) demuestra las ventajas de eficiencia en la comunicación del entrenamiento asincrónico. (4) Agregación simple vs. fusión inteligente: El contraste entre "FedAvg" (promedio de parámetros) y "FedRisk" (atención fusión) valida la adaptabilidad de las estrategias de integración de Transformers a datos no IID. (5) No-Censura vs. Equidad-Censura: La comparación entre "FedAvg" (sin restricciones de equidad) y "FedRisk" (restricciones conscientes de la equidad) examina los efectos de los mecanismos de equidad sobre la equidad y el rendimiento del modelo.
Estudios de ablación
Impacto de ε variables en la utilidad del modelo
Utilizando el presupuesto total de privacidad ε como variable (con valores de 1, 3, 5, 7 y 10), la investigación fijó δ=1e-5 manteniendo sin cambios otros módulos (atención fusión y GBDT con restricción monótona) para evaluar el equilibrio entre la fuerza de protección de privacidad y la utilidad del modelo. El experimento midió tanto AUC-ROC (utilidad del modelo) como MI-AUC (riesgo de privacidad) como indicadores duales, con resultados mostrados en la Tabla 10. Cuando ε=1, MI-AUC bajó a 0,53 (excelente protección de privacidad), pero AUC-ROC solo alcanzó 0,821 (pérdida significativa de utilidad). A ε=5, AUC-ROC repuntó hasta 0,912 (cumpliendo con los requisitos de control de riesgos financieros) con MI-AUC=0,58 (protección efectiva de la privacidad). Al ε>5, la mejora en AUC-ROC fue inferior a 0,01, mientras que MI-AUC subió rápidamente a 0,63 (superando los límites de riesgo de privacidad). Esto confirma que ε=5 es el presupuesto total óptimo de privacidad, logrando un equilibrio entre privacidad y utilidad.
| Presupuesto Total de Privacidad | Modelo AUC-ROC | MI-AUC (riesgo de privacidad) | Tasa de fuga de características FLR | Fracción de Brier |
| 1 | 0.821 | 0.53 | 0.04 | 0.078 |
| 3 | 0.876 | 0.55 | 0.06 | 0.061 |
| 5 | 0.912 | 0.58 | 0.08 | 0.042 |
| 7 | 0.919 | 0.6 | 0.11 | 0.039 |
| 10 | 0.923 | 0.63 | 0.15 | 0.037 |
Tabla 10: Comparación del rendimiento del modelo con diferentes presupuestos de privacidad ε.
Contribución de la fusión de atención frente al promediado simple
Para evaluar las diferencias de rendimiento entre la "fusión de atención" (la estrategia propuesta) y el "promediado simple" (estrategia FedAvg) en escenarios de datos no independientes, se configuraron experimentalmente dos variables: (1) Severidad de los datos no IID (medida por variaciones en la tasa de impago específicas de la institución), baja variación: 0,2%-0,5%, alta variación: 0,2%-3,5%); (2) Estrategias de fusión (atención fusión vs promediado simple). Como se muestra en la Figura 2, la brecha AUC-ROC entre ambas estrategias era de solo 0,023 (0,912 frente a 0,889) en escenarios no IID bajos. Sin embargo, esta brecha se amplió a 0,076 (0,905 frente a 0,829) en escenarios de alto contenido no IID, con el modelo de promedio simple mostrando un sobreajuste significativo (conjunto de entrenamiento AUC-ROC 0,941 frente a conjunto de validación 0,829). Esto demuestra que los mecanismos de atención pueden mitigar eficazmente la degradación del rendimiento causada por datos no independientes mediante ponderaciones dinámicas, como asignar un peso de 0,32 a la institución E con predicciones por defecto precisas y un peso de 0,12 a la institución C con desviaciones mayores.

Figura 2: Comparación de estrategias de fusión bajo diferentes grados de No-IID. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Efecto de los regularizadores de capital justo en los KPIs basados en el beneficio
La demanda principal de las instituciones financieras es garantizar beneficios empresariales bajo la limitación de la equidad; por ello, el experimento introduce un índice orientado al beneficio: "rentabilidad ajustada al riesgo sobre el capital (RAROC)". La fórmula es la siguiente:
(39)
La pérdida esperada se calcula como la probabilidad de impago multiplicada por la tasa fija de pérdidas por moro (fijada en el 40%), mientras que el capital económico se determina por la exposición al riesgo multiplicada por el peso del riesgo (según los requisitos de Basilea III). Las métricas de equidad (ΔDP, ΔEO) y RAROC del modelo con regularización de equidad frente al modelo sin ella se comparan en la Tabla 11. Tras implementar la regularización de la equidad, el ΔDP disminuyó de 0,15 a 0,04, el ΔEO bajó de 0,12 a 0,03 y el RAROC solo disminuyó un 2,1% (18,3% frente al 18,7%), significativamente por debajo del umbral aceptable por la industria del 5%. Esto demuestra que el mecanismo de equidad en nuestro estudio cumple eficazmente con los requisitos regulatorios de no discriminación mientras controla las pérdidas de beneficios.
| Configuración del modelo | ΔDP (diferencia de tasa positiva de grupo) | ΔEO (diferencia TPR de grupo) | GCE (error de calibración de grupo) | RAROC (Rentabilidad ajustada al riesgo sobre activos) | FPR (tasa de falsos positivos) |
| No hay regla de equidad | 0.15 | 0.12 | 0.035 | 18.70% | 0.95% |
| Hay justicia y regularidad | 0.04 | 0.03 | 0.018 | 18.30% | 1.02% |
Tabla 11: Influencia de la regularización de la equidad en los indicadores de equidad y beneficios.
Detalles de implementación
Para garantizar la reproducibilidad del experimento, la investigación aclaró la pila técnica y los detalles del proceso de entrenamiento: (1) Entorno de hardware: Cada nodo institucional utiliza procesadores Intel Xeon Gold 6248, 64GB de RAM y GPUs NVIDIA Tesla V100; el coordinador federado emplea dos procesadores Xeon Gold 6348 con 128GB de RAM para garantizar computación paralela y una agregación eficiente de parámetros. (2) Marco de software: El marco de aprendizaje federado se desarrolla usando PySyft 0.8.6, el módulo blockchain utiliza Hyperledger Fabric 2.5 (mecanismo de consenso: Raft), el entrenamiento de modelos se basa en PyTorch 2.0 y XGBoost 2.0.3, mientras que el módulo de privacidad diferencial integra IBM DP Library. (3) Proceso de entrenamiento: (1) Preprocesamiento de datos (2 horas, incluyendo normalización semántica y mejora de CopulaGAN); (2) Entrenamiento local (5 épocas por ronda, tasa de aprendizaje disminuida mediante recocido coseno); (3) Agregación asíncrona (las actualizaciones globales del modelo ocurren cuando el coordinador recibe parámetros de 3 instituciones); (4) Evaluación del modelo (AUC-ROC y métricas de equidad calculadas tras 10 rondas); (5) Optimización por hiperparámetros (optimización bayesiana con 50 iteraciones para determinar parámetros óptimos). (4) Pruebas de robustez: simulaciones de desconexiones institucionales (seleccionando aleatoriamente una institución para detener 1-3 rondas de formación) y ruido de datos (añadiendo perturbaciones en valores de características al 5%). Los resultados mostraron fluctuaciones AUC-ROC por debajo de 0,02, demostrando la capacidad anti-interferencia del sistema.
Este estudio empleó una estrategia de planificación de recocido coseno con una tasa inicial de aprendizaje de 0,05. La tasa de aprendizaje se actualizaba dinámicamente en cada época según la fórmula a lo largo de un total de 100 épocas de entrenamiento. Esta estrategia mantuvo una alta tasa de aprendizaje en las primeras etapas del entrenamiento, por ejemplo 0,05 en la primera época, para acelerar la convergencia del modelo, y la fue decayendo gradualmente hasta casi cero, por ejemplo 0,00025 en la centésima época, para mejorar la estabilidad del ajuste fino de los parámetros. Los resultados experimentales demostraron que, en comparación con una tasa de aprendizaje fija, esta estrategia mejoró el conjunto de validación AUC-ROC en un 2,3% y aceleró la velocidad de convergencia en un 37%. La partición de datos se basó en un conjunto de datos en bruto de cinco instituciones financieras que sumaba 5 millones de muestras, cumpliendo estrictamente con el principio de aislamiento interinstitucional de datos. Los datos locales de cada institución se dividieron cronológicamente, seleccionando datos de enero de 2022 a junio de 2023 como conjunto de entrenamiento (70%), datos de julio a septiembre de 2023 como conjunto de validación (15%) y datos de octubre a diciembre de 2023 como conjunto de prueba (15%). Esta partición aseguró la independencia temporal de la ventana temporal de los conjuntos de entrenamiento, validación y prueba, simulando eficazmente la evolución de los patrones de riesgo temporal en escenarios del mundo real. Los hiperparámetros clave se determinaron mediante optimización bayesiana. Dentro de un espacio de búsqueda conjunto que abarca una tasa de aprendizaje inicial entre 0,01 y 0,1, números de árboles GBDT entre 50 y 200, y cabezas de atención Transformer del conjunto {2, 4, 8}, se ejecutaron 50 iteraciones con el objetivo de maximizar el conjunto de validación AUC-ROC. La combinación óptima final se identificó como una tasa inicial de aprendizaje de 0,05, 120 árboles GBDT y 4 cabezas de atención.