Artículo de investigación

Modelo de Aprendizaje Federado Explicable para la Colaboración y Control de Riesgos entre Datos Financieros Digitales Interinstitucionales

DOI:

10.3791/69805

3 de marzo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Demostramos un protocolo reproducible para implementar FedRisk, un marco de aprendizaje federado explicable. El procedimiento incluye armonización semántica de datos, alineación de entidades que preservan la privacidad, calibración diferencial de privacidad, entrenamiento local de GBDT, fusión global de Transformers y actualizaciones asíncronas con compresión gradual, permitiendo una predicción de riesgos financieros segura, escalable y conforme a la regulación en múltiples instituciones.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La fragmentación de los datos financieros entre instituciones y las estrictas normativas de privacidad dificultan gravemente la gestión colaborativa de riesgos, lo que conduce a una detección subóptima de fraudes con una precisión inferior al 60% y a altos errores de impago de préstamos en PYMES superiores al 25%. Las soluciones de aprendizaje federado existentes enfrentan desafíos con los datos no IID, la interpretabilidad del modelo y el cumplimiento, lo que resulta en tasas de adopción en el mundo real inferiores al 20%. Para abordar estas carencias, proponemos FedRisk, un marco explicable de aprendizaje federado que integra cuatro innovaciones clave. Primero, una malla de datos interinstitucional con armonización semántica ontológica logra una utilización de características superior al 85%. En segundo lugar, un modelo híbrido de IA combina GBDT interpretable localmente con restricciones monótonas y un Transformer global basado en la atención, reduciendo la pérdida de rendimiento en escenarios sin IID en un 7,6% en comparación con FedAvg. En tercer lugar, un mecanismo de privacidad tripartito emplea privacidad diferencial adaptativa con un presupuesto total de ε=5, el intercambio de secretos aditivo y la regularización consciente de la equidad, limitando el sesgo de predicción de grupo por debajo de 0,05 y la pérdida RAROC por debajo del 2,1%. Cuarto, las optimizaciones eficientes en la comunicación reducen el ancho de banda por ronda a 8,5 MB y el tiempo de entrenamiento a 85 minutos. Evaluado sobre más de 5 millones de registros multiinstitucionales, FedRisk logra un AUC-ROC de 0,912, solo un 1,8% inferior al GBDT centralizado, mientras resiste ataques de inferencia de membresía con un AUC de 0,58. Reduce la transmisión de datos entre instituciones en un 99% y supera las líneas base clásicas de Florida en un 7,3% en AUC-ROC. Al permitir una predicción de riesgos segura, transparente y conforme a la normativa sin compartir datos en bruto, FedRisk ofrece una solución escalable para la colaboración financiera interinstitucional.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El desarrollo profundo de las finanzas digitales está transformando los modelos de servicio, desde el control del riesgo crediticio personal hasta la financiación de la cadena de suministro de pymes, estableciendo los datos como un factor central de producción. Según el "Informe de Desarrollo Fintech de China 2023" de la PBOC, a finales de 2023, la escala de crédito digital de China superaba los 65 billones de yuanes, representando el 38% del saldo total, con los datos diarios de transacciones que superaban los500TB 1. Sin embargo, los "silos de datos" siguen siendo una barrera significativa. Las instituciones generalmente adoptan modelos de datos cerrados debido a la competencia y a las preocupaciones de seguridad. Por ejemplo, en la detección de fraude con tarjetas de crédito, los bancos que dependen únicamente de datos internos pasan por alto registros críticos interinstitucionales, lo que resulta en tasas de identificación inferiores al 60% para nuevos tipos de fraude. De manera similar, para el crédito para pymes, la falta de datos externos de seguros y fiscales conduce a errores de predicción de impago superiores al 25%. Esta fragmentación plantea dos desafíos: limitar el acceso para 200 millones de clientes desatendidos y aumentar el riesgo de contagio cruzado en un 18% (Informe CBIRC 2023). En consecuencia, los silos de datos se han convertido en el principal cuello de botella que dificulta el desarrollo de alta calidad de las finanzas digitales.

En los últimos años, el auge de las leyes globales de privacidad de datos ha limitado significativamente el intercambio centralizado de datos. Las instituciones financieras deben ahora adherirse a tres principios fundamentales: "mínima necesidad", "consentimiento informado" y "trazabilidad". Aunque los marcos regionales varían, todos imponen umbrales estrictos al uso de datos entre instituciones, como se detalla en la Tabla 1.

Marco regulatorioCláusulas restrictivas centralesImpacto en la colaboración con datos financieros
Reglamento General de Protección de Datos (RGPD) de la UE1. La transferencia transfronteriza de datos debe cumplir con la "determinación de suficiencia"; 2. Las personas tienen derecho a acceder y eliminar sus datos; 3. Las brechas de datos deben reportarse en un plazo de 72 horasEstá prohibida la transmisión no autorizada transfronteriza de datos en bruto, y el intercambio centralizado requiere una evaluación del impacto en la privacidad (PIA), aumentando los costes de cumplimiento en un 30%
Ley de Privacidad del Consumidor de California (CCPA)1. Los consumidores pueden pedir a las empresas que eliminen sus datos personales; 2. El intercambio de datos requiere una notificación clara de para qué se utilizaránLas plataformas centralizadas requieren interfaces de acceso a datos para cada consumidor, lo que incrementa los costes operativos en un 25% y facilita que los consumidores eliminen datos y causen la ausencia de datos de entrenamiento para el modelo
Ley de Protección de Información Personal de China1. El tratamiento de información personal requiere consentimiento separado; 2. El procesamiento de información personal sensible requiere documentos adicionales de autorización; 3. Establecer un sistema de "clasificación y protección de datos"El intercambio de datos entre instituciones requiere autorización de cada cliente, y la tasa de autorización en la práctica es inferior al 40%. El modo centralizado es difícil de implementar
Directiva de Servicios de Pago II de la UE (PSD2)1. Abrir la interfaz de datos del banco; 2. El intercambio de datos debe basarse en la autorización del cliente y en un uso limitadoAunque soporta el intercambio de datos, requiere que todo el proceso de acceso a la interfaz sea rastreado, y la plataforma centralizada debe asumir la responsabilidad de la seguridad y auditoría de la interfaz, lo que aumenta significativamente la complejidad técnica

Tabla 1: Comparación de los requisitos fundamentales de los principales marcos regulatorios de datos.

Este estudio introduce tres innovaciones fundamentales para abordar los desafíos de la modelización de riesgos federada interinstitucional. Primero, una arquitectura de malla de datos con una capa semántica ontológica estandariza esquemas heterogéneos, logrando más del 85% de utilización de características mientras preserva la soberanía de los datos. En segundo lugar, un modelo híbrido de IA combina GBDT interpretable localmente con restricciones monótonas que cumplen con la normativa y un Transformer basado en la atención global. Al ponderar dinámicamente los resultados institucionales, este modelo reduce la pérdida de rendimiento no IID en un 7,6%, manteniendo un AUC-ROC de 0,912. En tercer lugar, un mecanismo tripartito de cumplimiento de privacidad integra privacidad diferencial adaptativa (ε=5), compartición aditiva de secretos y regularización consciente de la equidad para garantizar el cumplimiento del RGPD, limitar el sesgo ΔDP a < 0,05 y resistir ataques de inferencia de membresía (AUC=0,58). En conjunto, estas innovaciones concilian las exigencias de fragmentación de datos, la interpretabilidad regulatoria y los compromisos entre privacidad y seguridad en la IA financiera federada.

El aprendizaje federado en finanzas se categoriza en Aprendizaje Federado Horizontal (HFL)2, Aprendizaje Federado Vertical (VFL)3 y Aprendizaje de Transferencia Federado (FTL)4 según la distribución de datos (Tabla 2).

Paradigma federalCaracterísticas principalesEscenario de adaptación al control de riesgos financierosEstudios representativosAcotamiento
Aprendizaje federal horizontalEl espacio de características de datos de los participantes es consistente, pero el espacio muestral es diferenteDetección de fraude con tarjetas de crédito entre organizacionesMcMahan et al. [[i]](2017) propusieron el algoritmo FedAvg, que por primera vez aplicó HFL a la lucha antifraude financiera al lograr la colaboración entre modelos interinstitucionales mediante el promedio de parámetros, y mejoró la tasa de detección de fraude en un 12% en un conjunto de datos de 10 bancosSin considerar las características no independientes e idénticamente distribuidas (No IID) de los datos financieros, cuando la diferencia de distribución del riesgo entre instituciones supera el 30%, el AUC-ROC del modelo disminuye en más de un 15%
Aprendizaje federal verticalEl espacio muestral de los participantes es consistente, pero el espacio de características es diferenteControl colaborativo del riesgo crediticio entre bancos y compañías de segurosYang et al. [[ii]] (2020) propusieron el algoritmo SecureBoost, que logra entrenamiento conjunto vertical de características mediante cifrado homomórfico, y alcanza una tasa de precisión predictiva por defecto del 89,3% en el escenario de préstamos para pequeñas y microempresasSe basa en una alineación estricta de entidades, lo que conlleva un alto riesgo de fuga de privacidad, y la eficiencia del entrenamiento cae bruscamente cuando la dimensión de la característica es demasiado grande
Aprendizaje Federal de TransferenciaExisten diferencias en la distribución de datos y el espacio de características de los participantesMigración de riesgo entre escenariosPan et al.[[iii]] (2021) resolvieron el problema de la escasez de muestras en la financiación de la cadena de suministro inicializando el modelo de optimización de migración de parámetros, que mejoró la velocidad de convergencia en un 60%La "migración negativa" probablemente ocurra durante el proceso migratorio. Cuando la diferencia del mecanismo de riesgo entre el escenario fuente y el escenario objetivo supera el 40%, el rendimiento del modelo supera al modelo tradicional
[[i]]McMahan, B., Moore, E., Ramage, D., Hampson, S., & y Arcas, B. A. (2017). Aprendizaje eficiente en la comunicación de redes profundas a partir de datos descentralizados. Actas de la 20ª Conferencia Internacional sobre Inteligencia Artificial y Estadística, 1273–1282.
[[ii]]Yang, Q., Liu, Y., Chen, T., & Tong, Y. (2020). Aprendizaje automático federado: concepto y aplicaciones. ACM Transactions on Intelligent Systems and Technology, 10(2), 1–19.
[[iii]]Pan, S. J., & Yang, Q. (2021). Una encuesta sobre aprendizaje transferido. IEEE Transactions on Knowledge and Data Engineering, 33(12), 2345–2359.

Tabla 2: Comparación de paradigmas de aprendizaje en el sector financiero.5,6,7

Los avances recientes abordan desafíos específicos de escenarios: FedSSL8 aborda la escasez de etiquetas mediante aprendizaje contrastivo, mientras que FedLite9 logra una reducción del 490× en la comunicación para instituciones con recursos limitados. Las extensiones a la sanidad10, vulnerabilidadesde seguridad 11, finanzas multimodales12 y escalabilidad13 demuestran la amplia aplicabilidad de FL.

La protección de la privacidad es fundamental para el control del riesgo financiero. Las tres técnicas principales —Privacidad Diferencial (DP)14, Computación Multipartita Segura (SMC)15 y Cifrado Homomórfico (HE)16— ofrecen ventajas claras en resistencia, eficiencia y adaptabilidad. DP se define formalmente por Pr[M(x) = y] ≤ e ⋅ Pr[M(x') = y] + δ, donde M representa el algoritmo aleatorizado, $x$ y $x'$ denotan conjuntos de datos vecinos, y y es la salida del algoritmo. Esto garantiza la similitud de salida entre conjuntos de datos, limitando estrictamente la fuga individual mediante ruido controlable. Un análisis comparativo de sus características técnicas se presenta en la Tabla 3.

Tipo de tecnologíaPrincipios fundamentalesFortaleza en la privacidad (valor ε)Complejidad de cálculoAdaptabilidad a la situación financiera
Privacidad diferencialLas contribuciones individuales al conjunto de datos son indistinguibles añadiendo ruidoε=1-5 (valor recomendado para escenarios financieros)O (n) (n es el tamaño de la muestra)Alta, adecuada para todo el proceso de entrenamiento de modelos, puede combinarse sin problemas con el aprendizaje federado
Computación multipartidista seguraVarios participantes colaboran para calcular sin revelar resultados intermediosSeguridad en teoría de la informaciónO (n²) (escenario federal vertical)Sí, es adecuado para el cálculo de juntas sensibles de características, pero tarda demasiado en escenarios de muestras grandes
Cifrado homomórficoLos datos cifrados se calculan directamente y el resultado correcto se obtiene tras la descifraciónComputacionalmente seguroO (n³) (basado en criptografía de red)Bajo, solo adecuado para la transmisión de parámetros a pequeña escala, millones de muestras de tiempo de cálculo de escenario superior a 24 horas

Tabla 3: Comparación de las características de la tecnología de protección de la privacidad.

En aplicaciones financieras, la privacidad diferencial se ha convertido en la opción principal debido a su "control de equilibrio de efecto privacidad". Dwork, C.17 propuso la definición clásica (ε, δ)-DP, que proporciona un estándar cuantitativo para la protección de la privacidad. La fórmula principal es la siguiente:

Ecuación 3(1)

Aquí M Como algoritmo de protección de privacidad, D y D son un conjunto de datos adyacente (solo una diferencia muestral), presupuesto de privacidad (cuanto menor es la protección de privacidad, más fuerte), r presupuesto de privacidad (cuanto menor es la protección de privacidad, más fuerte) δ La probabilidad de fallo (normalmente tomada 10-5).

Abadi, M. et al.18 desarrollaron el Descenso Diferencial de Gradiente Estocástico de Privacidad (DP-SGD), utilizando recorte de gradiente e inyección de ruido para reducir la fuga de privacidad en el modelo de riesgo crediticio a menos del 8%. La computación multipartita segura (SMC) y el cifrado homomórfico se emplean principalmente para el procesamiento sensible. Por ejemplo, Bogetoft, P. et al.19 aplicaron la SMC a la puntuación crediticia entre bancos, asegurando que solo estuvieran accesibles las puntuaciones finales. Perri, L.2 propuso un algoritmo de cifrado totalmente homomórfico para la agregación segura de parámetros, aunque la alta complejidad computacional limita su aplicación a entrenamiento a pequeña escala entre bancos de tamaño medio.

Los modelos de control de riesgos de IA han evolucionado de arquitecturas centralizadas tradicionales a arquitecturas distribuidas, con dos paradigmas que muestran diferencias significativas en dependencia de datos, rendimiento y costes de cumplimiento. Los modelos centralizados incluyen Gradient Boosting Trees (GBDT) y modelos de aprendizaje profundo. El algoritmo GBDT propuesto por Friedman, J., Hastie, T. Tibshirani, R.21 mejora la precisión de la predicción de riesgos mediante la integración multiárbol, logrando un AUC-ROC de 0,93 en escenarios de crédito personal. Sin embargo, requiere recopilar datos completos de los clientes, lo que supone riesgos de brechas de datos y desafíos de cumplimiento. Zhang, H., Liu, Y., Zhang, X., Yin, Z.Li, Y.22 desarrollaron un modelo de control de riesgos basado en transformadores que mejora las tasas de detección de fraude en un 15%, aunque su tamaño de parámetro supera los 10 GB. El paradigma distribuido incluye enfoques de compartición de parámetros y de características compartibles. El parámetro compartido (por ejemplo, FedAvg) agrega parámetros locales pero tiene dificultades con las características no IID: AUC-ROC bajó de 0,89 a 0,82 mientras las diferencias de tasa de impago subieron del 0,5% al 3,5%. El intercambio de funciones (por ejemplo, SecureBoost) permite la colaboración vertical pero requiere una alineación precisa, con el rendimiento que cae un 20% cuando los errores superan el 5%.

El núcleo del aprendizaje federado es permitir la formación colaborativa multiinstitucional sin transferencia de datos en bruto. Este marco define a los participantes, el proceso de formación y la función objetivo. En este estudio, el sistema está formado por nodos de la institución Kfinancial (denotados como P1, P2, ...,P K) y un coordinador C. Cada institución PK posee un conjunto de datos Ecuación 10local , Xk,i∈Rd , que son los vectores de características del cliente yk,i∈{0,1}, para etiquetas de riesgo (0 es normal, 1 es fraude por defecto), tamaño local de muestra y escala Ecuación 13completa de datos. La formación sigue un proceso de "iteración local-agregación global": i) Inicialización: El coordinador genera parámetros globales iniciales θ0 y los distribuye a todas las instituciones; ii) Iteración local: en la ronda de formación, la instituciónP K se basa en datos locales y parámetros globales actuales θt, minimizando la función de pérdida local mediante el descenso del gradiente, obteniendo los parámetros locales actualizados θt,k, es decir:

Ecuación 18(2)

Donde n es la tasa de aprendizaje y ∇θLkt) es el gradiente de la pérdida local, θt es el gradiente de la pérdida local a θt; iii) Agregación global: La institución cifra y sube parámetros locales al coordinador, que genera nuevos parámetros globales θt+1 mediante agregación ponderada por tamaño muestral:

Ecuación 22(3)

iv) Condición final: Repetir los pasos 2-3 hasta que el rendimiento del modelo global en el conjunto de validación no mejore en rondas sucesivas, Obtener la salida del modelo final. θ* = θT. Dadas las características de distribución idéntica no independiente (Non-IID) de los datos financieros, es necesario ampliar los supuestos del promedio federado tradicional (FedAvgP k). Este estudio emplea dimensiones duales de "heterogeneidad de distribución de etiquetas" y "heterogeneidad de distribución de características" para caracterizar el Non-IID: Sea definida la proporción de instancias positivas (eventos por defecto) en las instituciones como:

Ecuación 24(4)

Definamos el coeficiente de isomorfismo de etiquetas ; Sea la diferencia media de características del conjunto , Cuando α>0,03 y cuando, se determina que es un escenario no IID alto.

Según la capacidad y el objetivo del atacante, los escenarios de amenaza se dividen en tres categorías, como se muestra en la Tabla 4

Tipo de amenazaIdentidad del atacantesaco de boxeoMedios típicos
Un ataque de semi-verdadInstituciones/coordinadores participantesInferir características de los clientes de otras institucionesInversión de gradiente y ataques de razonamiento de miembros basados en parámetros del modelo
Ataque hostilInstituciones maliciosasModelo global de contaminaciónSubir falsos gradientes y modelos de veneno
Ataque externoTerceros no autorizadosParámetros y características de robo en tránsitoAtaques intermedios, escuchas en enlaces de comunicación

Tabla 4: Clasificación por modelos de amenazas del Sistema Financiero.

Utilizando (ε,δ) -Privacidad diferencial (Privacidad Diferencial, DP) como estándar central de protección de privacidad, su esencia es añadir ruido para que se pueda ignorar la influencia de "si el conjunto de datos contiene una muestra" en la salida del modelo. La definición formal es la siguiente: Para algoritmos de aprendizaje federado M, si para dos conjuntos de datos adyacentes cualesquiera y que difieren solo por una muestra (DΔD' = 1), así como cualquier conjunto de salida S⊆Range(M), satisface:

Pr[M(D)∈S]≤eε⋅Pr[M(D')∈S]+δ (5)

Entonces se denomina (ε,δ)-DP satisfecho. Uno es el "presupuesto de privacidad" (cuanto menor es la protección de la privacidad, más fuerte es, y normalmente se tiene en cuenta el escenario financiero), δ para la "probabilidad de fallo" (generalmente δ≤10-5 para asegurar que los eventos de baja probabilidad no afecten a la privacidad y la seguridad). Para adaptarse a las características de iteración multi-ronda del entrenamiento federado, el consumo total de privacidad se calcula utilizando el teorema de combinación de "privacidad diferencial de Renyi" (RDP). Supongamos que el presupuesto de privacidad de cada ronda de entrenamiento sea εt, entonces el presupuesto total de privacidad tras el entrenamiento del ciclo satisface:

Ecuación 32(6)

Este teorema proporciona una base teórica para la calibración adaptativa del ruido asignando dinámicamente el presupuesto de privacidad por ronda.

FedRisk emplea un riguroso marco de privacidad (DP) diferencial (ε, δ), asignando dinámicamente los presupuestos de privacidad mediante el teorema de composición de Rényi DP (RDP). Define la sensibilidad global Δf como el cambio máximo de parámetros de la norma L1 inducido por conjuntos de datos adyacentes (que difieren por una sola muestra), con calibración de ruido Laplace consciente de la varianza (coeficiente de ruido κ_t proporcional a las fluctuaciones de distribución de datos). Bajo la restricción del presupuesto total de privacidad ε=5 (cumpliendo los umbrales de cumplimiento del RGPD), RDP convierte el consumo de privacidad de entrenamiento en (ε, δ)-DP (δ=10⁻⁵), equilibrando la fortaleza de la protección y los resultados empíricos de utilidad del modelo demuestran que esto suprime el AUC de ataque por inferencia de miembro a 0,58 manteniendo la predicción de riesgo AUC-ROC en 0,912.

La optimización de los modelos de control de riesgos financieros debe cumplir simultáneamente tres requisitos regulatorios: "precisión predictiva", "protección de la privacidad" y "equidad". Las funciones tradicionales de optimización que buscan únicamente minimizar pérdidas ya no son aplicables. Es necesario establecer un marco de optimización multiobjetivo para transformar las restricciones regulatorias en términos de regularización cuantificables. Para escenarios de clasificación binaria (por defecto/normal), se adopta la pérdida logarítmica (LogLoss) como función base de pérdida para medir la desviación entre las probabilidades predichas por el modelo y las etiquetas reales, definida como:

Ecuación 33(13)

Donde pk,i = σ(θ; xk,i) es la probabilidad predeterminada predicha de la muestra (x k,i,y, k,i) para el modelo, σ(⋅) es la función de activación sigmoide.

Los requisitos del RGPD, la Ley de Protección de la Información Personal y otras normativas se transforman en tres tipos de términos de regularización, que se combinan con la función básica de pérdida para formar el objetivo final de optimización:

Ecuación 37(14)

La definición y función de cada término de regularización son las siguientes: i) Restricciones de privacidad: En función del coste de adición de ruido de la privacidad diferencial, se discute la influencia de la protección cuantitativa de la privacidad en la precisión del modelo. Sea la sensibilidad global de los parámetros Δ del modelo (es decir, el cambio máximo de parámetros causado por conjuntos de datos adyacentes), entonces:

Ecuación 39(15)

Este término garantiza que la intensidad adicional de ruido coincida con el presupuesto de privacidad y evita un sacrificio excesivo de la precisión del modelo. II) Restricción de equidad: En vista de los requisitos de "antidiscriminación" de la Ley de Protección de Información Personal, el sesgo predictivo de los distintos grupos está limitado. Tomemos como ejemplo la "paridad demográfica" (Paridad demográfica), pongamos la tasa de predicción positiva del conjunto Ecuación 41, entonces:

Ecuación 210 (16)

Este término minimiza la diferencia en la tasa de predicción entre distintos grupos y evita la discriminación de modelos. III) Restricciones de robustez: En respuesta a los requisitos de "capacidad anti-interferencia del modelo" en Basilea III, Asegúrese de que pequeñas perturbaciones de los datos no afecten significativamente a la salida del modelo. Añadiendo perturbaciones de muestra adversarial Δx (satisfaciendo |Δx|≤γ), la investigación define:

Ecuación 45(17)

Se mejora la robustez del modelo de mejora de términos a datos anormales y se reduce el riesgo de error de juicio. En esta fórmula, es el coeficiente de regularización, se determinó mediante validación cruzada (en este estudio λ1=0,01,λ2=0,05,λ3=0,02), asegurando un equilibrio entre los tres objetivos regulatorios y la precisión de la prevision.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Arquitectura del sistema

Malla de datos interinstitucional y capa semántica

Para abordar la heterogeneidad de datos entre instituciones, la investigación construye una arquitectura Data Mesh mediante la partición de nodos basada en dominios. Cada institución financiera opera como un nodo independiente del dominio de datos, manteniendo los derechos de propiedad y control, con la capa semántica que permite la comprensión e interacción unificada de datos. La capa semántica basada en ontologías establece un modelo unificado de datos de control de riesgos financieros, definiendo entidades centrales, atributos demapa f y relaciones entre las entidades. Las reglas específicas de mapeo semántico se detallan en la Tabla 5. Para campos específicos de la institución, las conversiones estandarizadas se logran mediante funciones de mapeo semántico:

Ecuación 48(18)

Entidad núcleoEl nombre de campo A de la instituciónNombre del campo B en la instituciónNombre de campo uniforme de capa semánticaTipo de datosReglas estandarizadas
ClienteValoración premium de clientes (1-5)Niveles VIP de clientes (bronce a diamante)Calificación crediticia del cliente (1-5)EnteroBronce→1, Plata→2, Oro→3, Platino→4, Diamante→5
NegociosImporte de la transacción (diez mil yuanes)Importe de la transacción (yuan)Importe de la transacción (yuan)Número flotanteEl valor del campo A en la institución es 10.000 veces
Solicitud de créditoCuota de solicitantes (ratio de créditos)Importe esperado del préstamoCuantero del préstamo solicitante (yuan)Número flotanteInstitución A: Ratio total de créditos × cantidad de solicitud; Institución B: mapeo directo

Tabla 5: Reglas semánticas de mapeo de entidades centrales en el ámbito del control de riesgos financieros.

Aquí es xi,j el valor específico i-ésimo del campo de la institución j, min(x j) y max(x j) son los valores mínimo y máximo del campo dentro de la institución, respectivamente, Uj y Lj definen los límites superior e inferior del rango unificado de valores para este campo en la capa semántica.

Registro global de modelos y rastreo de auditoría basado en blockchain

Para resolver problemas de gestión caótica de versiones de modelos y procesos de formación no rastreables en el aprendizaje federado, se emplea la tecnología blockchain para establecer un registro global de modelos y un sistema de auditoría y rastreo. Utilizando una arquitectura blockchain de consorcio, los nodos participantes incluyen instituciones financieras, coordinadores federados y organismos reguladores, garantizando la inmutabilidad de los datos y el consensomultipartito 23. El registro global de modelos almacena metadatos centrales de los modelos, incluyendo números de versión, rondas de entrenamiento Hv, listas de instituciones participantes, parámetros estructurales y métricas de rendimiento. Estos metadatos se almacenan usando una estructura de árbol de Merkle, y cada versión del modelo corresponde a un valor hash único:

Ecuación 57(19)

Aquí v es el número de versión del modelo, T es el número total de rondas de entrenamiento, S es el conjunto de instituciones que participan en la formación, IDi es el identificador único de una institución i, θv es el vector de parámetro del modelo para la versión v, y AUCv es el valor AUC-ROC de esta versión del modelo que se muestra.

Pipeline federado de ingeniería de características

Alineación segura de entidades y armonización de esquemas

La ingeniería de características es el componente central de la colaboración interinstitucional de datos, requiriendo una extracción, alineación y agregación efectivas de características, garantizando al mismo tiempo la privacidad de los datos. Este estudio diseña una pipeline integral que abarca alineación segura de entidades, coordinación de esquemas y agregación diferencial de grafos de transacciones integrados en privacidad para abordar tanto la heterogeneidad de características interinstitucionales como los riesgos de fuga de privacidad24. La alineación entre entidades entre instituciones es esencial para lograr la colaboración de funcionalidades. Sin embargo, transmitir directamente identificadores de clientes comprometería la privacidad. Por ello, la investigación adopta un método de alineamiento de entidades que preserva la privacidad, combinando cifrado homomórfico (HE) con tecnología de hashing sensible a la localidad (LSH). Las instituciones preprocesan identificadores de clientes utilizando funciones hash SHA-256 para generar identificadores preliminares. Estos identificadores se mapean entonces en el mismo "cubo" a través de LSH para reducir el cálculo posterior de cifrado. Los identificadores dentro del mismo cubo pasan por cifrado homomórfico de Paillier. Los identificadores cifrados se suben al coordinador federado, que logra la alineación de entidades comparando la similitud de identificadores cifrados usando similitud coseno.

Ecuación 64(20)

Cuando la similitud es mayor que el umbral preestablecido (en este estudio, se toma como τ=0,95), se determina que es la misma entidad y se genera un ID unificado entre instituciones para lograr una alineación segura de entidades.

Agregación diferencial privada de incrustaciones en grafos de transacciones

Los datos de transacciones financieras presentan características estructuradas en grafos distintas (con clientes como nodos y transacciones como aristas). La incrustación de grafos de transacciones captura eficazmente los patrones de transacción de las partes relacionadas de los clientes, proporcionando características críticas para los modelos de control de riesgos. Sin embargo, la agregación directa de incrustaciones interinstitucionales de Gi=(V i,E i)ViiEi e i,vRdd d de la transacción puede filtrar información relacionada con transacciones de los clientes. Por ello, se introduce la tecnología DiferencialPrivacy (DP) para lograr la agregación preservadora de la privacidad de las incrustaciones de grafos de transacciones. Cada institución construye localmente un grafo de transacciones, donde representa el conjunto de nodos cliente de la institución y representa el conjunto de aristas de transacción (ponderaciones de aristas iguales a los importes de las transacciones). El algoritmo GraphSAGE se emplea para generar incrustaciones de nodos (con dimensiones de incrustación de 256 dimensiones en este estudio). Para cumplir con los requisitos diferenciales de privacidad, se añade ruido laplaciano a las incrustaciones locales:

Ecuación 67(21)

Aquí ΔG Sensibilidad global del algoritmo GraphSAGE (estimada por experimento en este estudio ΔG=0,8), para el presupuesto local de privacidad de la agencia,

Ecuación 70(22)

Para el presupuesto total de privacidad del sistema, este estudio toma εtotal = 1,5). El coordinador agrega la incrustación de ruido de cada institución utilizando una estrategia de media ponderada Ecuación 72 , con pesos basados en el porcentaje de clientes de cada institución:

Ecuación 73(23)

El gráfico global agregado de transacciones Ecuación 200 se integra y se reenvía a cada institución. Como característica clave del modelo de control de riesgos, no solo conserva la información de correlación transinstitucional, sino que también protege la privacidad del cliente mediante una privacidad diferencial.

Ecuación 201 (24)

Modelo híbrido de riesgo de IA

Submodelos locales: Aumento de gradiente con restricciones monótonas

Los modelos tradicionales de control de riesgos centralizados por IA tienen dificultades para adaptarse a escenarios federados interinstitucionales. Este estudio desarrolla un modelo híbrido de riesgo de IA que combina "submodelos locales + modelo de fusión global", integrando la alta interpretabilidad de los Gradient Boosting Trees (GBDT) con la adaptabilidad de Transformer a datos no independientes e idénticamente distribuidos (NID). Se introduce un módulo de interpretación para equilibrar el rendimiento y la explicabilidad del modelo en entornos federados. Cada institución construye localmente submodelos de GBDT, elegidos por su fuerte capacidad de ajuste de datos estructurales y alta interpretabilidad, requisitos esenciales para las regulaciones de control de riesgos financieros. Para evitar el sobreajuste y conclusiones ilógicas, se implementan restricciones monótonas durante la formación en GBDT, imponiendo patrones monótonos de aumento o disminución para características clave como los ingresos de los clientes y las puntuaciones crediticias. El primer conjunto de árbol por GBTD es ht(x), y la salida del modelo es:

Ecuación 76(25)

Aquí, η es la tasa de aprendizaje (este estudio toma η=0,1). La restricción monótona se realiza mediante regularización de la función de pérdida xj.

Añadir término de restricción:

Ecuación 80(26)

Aquí, x≺x' representa que el valor propio de x es menor que el valor propio de x', y la función de pérdida final es:

Ecuación 84(27)

Aquí, l es la función de pérdida logarítmica (utilizada en el escenario binario de control de riesgo yi∈{0,1}, que indica si el cliente incumple). Ecuación 87 es el término de regularización de complejidad para el árbol, λ y γ son el coeficiente de regularización (Este estudio se realizó mediante λ=0,01 γ=0,5 de validación cruzada, ni es el número de muestras locales para la institución i,T es el número de árboles (Este estudio tomó T=100).

Fusión global: transformador basado en la atención para adaptación no IID

Los datos interinstitucionales muestran características significativas de distribución no IID. Los algoritmos tradicionales de FedAvg, que simplemente promedian los parámetros locales del modelo, tienen dificultades para adaptarse a los datos no IID. Para abordar esto, la investigación introduce una atención pi(x)=σ(Fi(x))σFi(x)ia i-based en un modelo de Transformer para la fusión inteligente de submodelos locales. El modelo de fusión global toma como entrada las probabilidades de salida del submodelo local de cada institución (salidas de funciones sigmoides de modelos institucionales GBDT). La arquitectura Transformer comprende un codificador y una capa de atención, donde la capa de atención calcula los pesos de atención a partir de las salidas de diferentes instituciones para lograr una ponderación adaptativa. Los pesos de atención se calculan usando Atención Escalar Producto Escalar:

Ecuación 94(28)

Aquí, q es el vector de consulta (generado por las características de riesgo promedio de muestras globales), Ecuación 96 es el vector clave de la institución i, dk es la dimensión del vector clave (en este estudio dk=64), n es el número de agencias que participan en la federación.

La probabilidad final de salida del modelo global es:

Ecuación 101(29)

A través del mecanismo de atención, el modelo global puede asignar automáticamente un mayor peso a las instituciones con alta calidad de datos y predicción precisa del riesgo, y mejorar la adaptabilidad a los datos no IID.

Módulo de explicabilidad: SHAP en árboles federados + generador de contrafactuales

Los modelos de control de riesgos financieros deben mantener la interpretabilidad para cumplir con los requisitos regulatorios y proteger el 'derecho de los clientes a saberlo'. Para abordar esto, la investigación desarrolla un módulo de interpretabilidad que combina generadores contrafactuales federados SHAP+. Para los submodelos locales de GBDT, la investigación emplea valores SHAP para medir la importancia de las características, que SiR N m cuantifican la contribución de cada característica a los resultados de predicción. En escenarios federados, transmitir directamente valores locales de SHAP podría comprometer la información de distribución de características. Por ello, la investigación implementa una estrategia de agregación segura en la que cada institución calcula localmente la matriz de valores SHAP (para el recuento de características), aplica ruido diferencial de privacidad a los valores SHAP y los sube al coordinador federado. El coordinador entonces calcula los valores globales de SHAP:

Ecuación 103(30)

Aquí, Si' es la matriz de valores SHAP de la institución i, y wi es la proporción del tamaño de la muestra de las instituciones.

Introduce el vector propio actual del cliente x y la calificación deriesgo objetivo y, la salida es un vector de características antifactual xcf, satisfecho (el umbral θ deprobabilidad objetivo correspondiente a la calificación de riesgo objetivo). Y |xcf-x|2 el mínimo (es decir, el coste de ajuste más bajo). La función de pérdida del generador de hechos es:

Ecuación 110(31)

Aquí α,β,γ son los coeficientes de peso (en este estudio α=10,β=5,γ=1),LGAN La función de pérdida adversarial se utiliza para GAN para asegurar la racionalidad y autenticidad del vector de características contrafactuales.

Capa de privacidad y seguridad

Agregación segura con compartición aditiva de secretos

En el aprendizaje federado, la transmisión y agregación de parámetros locales del modelo es un eslabón clave en la fuga de privacidad. Se adopta la tecnología AdditiveSecretSharing (ASS) para lograr una agregación segura y evitar la adquisición directa de parámetros locales del modelo de cada organización por parte del coordinador. El proceso específico es el siguiente: i) Cada institución dividirá los parámetros del modelo local en acciones secretas θ i,1,θi,2,...,θi,n , satisfaciendo Ecuación 118, Aquí está el número de instituciones participantes; ii) La institución i envía la parte θi,k a la institución (k≠i), conservando su propia parte θi,i; iii) Cada institución k recoge acciones enviadas por todas las demás instituciones θ1,k,θ 2,k,...,θn,k , y suma todo con la θk,k parte retenida por sí misma, obteniendo la suma parcial; iv) Todas lasinstituciones subirán y compartirán parte con el coordinador, que calcula los resultados Ecuación 126de la agregación global de parámetros. Mediante el intercambio aditivo de secretos, el coordinador solo puede obtener parámetros agregados globales y no puede deducir n-1ttt=⌈n/2⌉ los parámetros locales de ninguna institución individual. Incluso la colusión entre múltiples instituciones no puede recuperar parámetros de otras, garantizando la privacidad y la seguridad durante la transmisión de parámetros. Para abordar la pérdida de cuotas causada por desconexiones institucionales, se introduce el mecanismo de intercambio de secretos de Shamir como respaldo. Cada parte se divide a su vez en fragmentos. Al recoger cualquier fragmento, se puede restaurar la parte completa, mejorando así la robustez del sistema.

Calibración adaptativa de ruido bajo (ε, δ)-planificación de presupuesto DP

El principal desafío de la privacidad diferencial radica en equilibrar la solidez de la protección de la privacidad con el rendimiento del modelo. Los métodos tradicionales de adición de ruido fijo tienen dificultades para adaptarse a escenarios en los que las distribuciones de datos cambian dinámicamente durante el entrenamiento federado. Este estudio diseña un mecanismo adaptativo de calibración de ruido basado en (ε,δ)-DP, combinado con una estrategia de planificación del presupuesto de privacidad, para lograr un ajuste dinámico de la intensidad del ruido. Definir el presupuesto total de privacidad del sistema como (Este estudio toma δtotal = 10-5 , cumple con los requisitos del RGPD para el riesgo de privacidad), adoptar la estrategia de planificación segmentada del presupuesto, el presupuesto total se asigna mediante {ε1.ε 2,...,εT} ciclo de formación de la siguiente manera, satisfecho:

Ecuación 130(32)

En cada ronda de entrenamiento, la intensidad del ruido se ajusta dinámicamente según las características de distribución de los datos locales. Suponiendo que la varianza local de características de datos de la t-ésima ronda de institución es Ecuación 132, Defina el coeficiente de ajuste de ruido αi,t:

Ecuación 134(33)

Cuando αi,t≥0,8 (la distribución de datos es estable), usando una intensidad Ecuación 136de ruido baja ; Cuando αi,t<0,8 (la distribución de datos fluctúa), aumentan la intensidad del ruido. Entre ellas, está la sensibilidad global de los parámetros del modelo (este estudio lo asegura mediante el recorte de gradientes).

Protocolo de entrenamiento eficiente en la comunicación

Actualizaciones asíncronas del cliente con control de estadía

El aprendizaje federado interinstitucional se enfrenta a desafíos como una alta latencia de comunicación y un consumo significativo de ancho de banda (especialmente para instituciones financieras pequeñas y medianas con recursos de red limitados). Este estudio diseña un protocolo eficiente de entrenamiento de comunicaciones que incorpora actualizaciones asíncronas del cliente, compresión de gradiente y retroalimentación de errores para reducir los costes de comunicación y mejorar la escalabilidad delsistema 25. Los métodos tradicionales de entrenamiento federado síncrono como FedAvg requieren esperar a que todos los clientes completen el entrenamiento local antes de la agregación de parámetros, lo que resulta en ciclos de entrenamiento largos. El mecanismo de actualización asíncrona del cliente permite a los clientes completar de forma independiente el entrenamiento local y subir parámetros de forma independiente. Al recibir estos parámetros, el coordinador federado actualiza el modelo global en tiempo real sin esperar a otros clientes. Esto aborda el problema de la anticuación del modelo en el entrenamiento asincrónico. Introduciendo la estrategia de control de estancamiento, define el valor de estancamiento para el cliente , (para tactual la ronda global de entrenamiento actual, tlast_update La ronda en la que el cliente obtuvo por última vez el modelo global). Cuando (Smax es la máxima estagnación permitida, este estudio toma smax=5) . El cliente participa en la formación de forma normal; A> s s como máximo ese momento, el cliente necesita descargar el último modelo global antes del entrenamiento local. La configuración de hardware consiste en CPUs Intel Xeon E5-2678 v3 (12 núcleos, 2,5GHz) emparejadas con GPUs NVIDIA Tesla V100 (16GB de VRAM) y 64GB de memoria DDR4 por nodo para manejar cargas de entrenamiento distribuidas de forma eficiente. Para la inicialización de software, comandos PySyft como hook = sy. TorchHook (antorcha)andvirtual_worker = sy. VirtualWorker(hook, id="client1") se utilizan para establecer conexiones federadas seguras, mientras que federated_train_loader = sy. FederatedDataLoader(dataset.federate((client1, client2)), batch_size=32) permite la carga de datos federada entre los participantes. El mapeo semántico transforma las características financieras entre instituciones, por ejemplo, convirtiendo los importes de las transacciones de USD a CNY usando una fórmula dinámica de tipo de cambio: transaction_amount_CNY = transaction_amount_USD exchange_rate + (0,001 randn()), donde el tipo de cambio se actualiza periódicamente mediante API. Para complementar conjuntos de datos desbalanceados, CopulaGAN genera muestras sintéticas adversariales con un fragmento de código similar al de la importación sdv.tabular CopulaGAN; sintetizador = CopulaGAN(epochs=50); synthesizer.fit (train_data); synthetic_samples = sintetizador.sample(num_rows=1000), preservando las propiedades estadísticas de los datos originales. El entrenamiento local de GBDT impone restricciones monótonas (por ejemplo, asegurando que "credit_score" se correlacione positivamente con "approval_probability") viaparams = {"monotonic_constraints": (1, 0, -1)}en LightGBM, mientras que la fusión con Transformers se implementa en PyTorch con capas de atención multicabezas:self.attention = nn. Atención Multicabeza (embed_dim=64, num_heads=4); attn_output, _ = auto.atención (consulta, clave, valor, key_padding_mask=padding_mask), seguido de normalización de capas y conexiones residuales para la estabilidad. La privacidad diferencial inyecta ruido de Laplace escalado a la sensibilidad L1 (Δf) y al presupuesto de privacidad (ε)—por ejemplo, añadiendo ruido muestreado de np.random.laplace(loc=0, scale=Δf/ε) donde Δf=1.2 y ε=0.5 a gradientes antes de la agregación. Las restricciones de equidad se aplican después del entrenamiento reponderando las muestras inversamente proporcional a su prevalencia de grupo (sample_weight = 1 / group_counts[y_train]) para mitigar las violaciones de paridad demográfica. Al mismo tiempo, se utiliza la estrategia de agregación ponderada para ajustar el peso de los parámetros del cliente según el valor de estancamiento:

Ecuación 143(34)

Donde λ=0,1 es el coeficiente de penalización por estancamiento; cuanto mayor es la estancamiento, menor es el peso, lo que reduce el impacto de los parámetros obsoletos en el modelo global.

Compresión de gradiente y acumulación de error-retroalimentación

Los parámetros del modelo (particularmente los pesos de atención en los modelos globales de fusión Transformer) tienen una alta complejidad dimensional. La transmisión directa consumiría un ancho de banda excesivo, lo que requeriría técnicas de compresión de gradiente para reducirla transferencia de datos 26. Este estudio integra la dispersión Top-K con compresión de cuantización, siguiendo estos pasos específicos: i) Top-K escaso: Para el modelo local ∇θi gradiente, seleccione el elemento gradiente K% con el valor absoluto más grande a conservar, K El resto de los elementos son cero, El valor se ajusta dinámicamente según la condición de ancho de banda (cuando el ancho de banda es suficiente K=30, cuando el ancho de banda es limitado K=10); ii) Compresión de cuantización: Los elementos del gradiente retenido se cuantizan desde punto flotante de 32 bits hasta enteros de 8 bits. La fórmula de cuantización es:

Ecuación 150(35)

  

iii) Realimentación de error: Almacenar el gradiente descartado Δ∇=∇θi-∇θierror comprimido durante la compresión en el lado del cliente, en el siguiente cálculo del gradiente, el error se acumula en el nuevo gradiente, acercándose , Ecuación 202 , Compensar las pérdidas por compresión. Los efectos de la compresión por gradiente y la retroalimentación de error se muestran en la Tabla 6, Entrada, 8 K=20% de condiciones de cuantización de bits. La relación de compresión alcanza 15:1 (volumen de datos original/volumen de datos comprimidos), y mediante la retroalimentación de errores, el AUC-ROC del modelo solo disminuye entre un 0,5% y un 1,0%, logrando el equilibrio entre el coste de comunicación y el rendimiento del modeloen 27.

Estrategias de compresiónRelación de reducciónConsumo de ancho de banda de subida (MB/ronda)Tasa de declive AUC-ROCTasa de reducción del tiempo de entrenamiento
sin comprimir (punto flotante de 32 bits)1:011280.00%0.00%
Cuantización de 30% superior dispersa + 16 bits6.7:119.10.30%35.20%
20% superior de dispersión + cuantización de 8 bits15:018.50.80%58.70%
Esparso del 10% superior + cuantización de 8 bits30:01:004.32.10%72.10%

Tabla 6: Comparación de rendimiento de estrategias de compresión por gradiente.

Regularización consciente de la equidad

Los modelos de control de riesgos financieros deben evitar la discriminación contra grupos específicos y cumplir con requisitos regulatorios, incluyendo la Ley de Protección de Información Personal y la Ley de Información Justa en la Información Crediticia. Este estudio introduce un mecanismo de regularización consciente de la equidad para restringir los sesgos de predicción intergrupal durante el entrenamiento del modelo, asegurando la equidad del modelo. Se definen dos indicadores clave de equidad: i) Paridad demográfica (DP): La tasa de predicción positiva es igual para diferentes grupos, enfoque, Ecuación 154, Entre ellos, está el identificador del grupo ; ii) Igualdad de Oportunidades (EO): La tasa de verdaderos positivos es igual entre los grupos, enfoque Ecuación 155. Añadir términos de regularización de equidad a la función de pérdida del modelo híbrido de riesgo de IA, e imponer restricciones al submodelo local GBDT y al modelo global Transformer respectivamente: iii) Restricciones de equidad local del modelo:

Ecuación 156

Aquí PR(g=A) es la tasa de predicción positiva para el grupo g, λ, y es el coeficiente de regularización para la equidad.

iv) Restricción global de equidad del modelo: Añadir el ajuste de peso de equidad de grupo a la capa de atención de Transformer, la salida del modelo para grupos vulnerables ag=a base×(1+β⋅Δinjusta) recibe un mayor peso de atención, aquí,Δ infair representa el sesgo de equidad entre este grupo y el grupo dominante (Δinjusta=PR (grupo dominante)-PR (grupos vulnerables)); λEO es el coeficiente de compensación por desviación. El efecto de la regularización de la percepción de la equidad se evalúa mediante ΔDP (desviación DP), ΔEO (desviación EO) y error de calibración de grupo.

Panel de control de gobernanza y cumplimiento del modelo

Monitorización de sesgo en tiempo real

Para cumplir con los requisitos de la regulación financiera en la gestión del ciclo de vida de los modelos, la investigación ha desarrollado un panel de control de gobernanza y cumplimiento del modelo que integra APIs de monitorización de desviaciones en tiempo real y de informes regulatorios, permitiendo la supervisión y trazabilidad de procesos completos durante la formación, despliegue e iteración del modelo. El módulo de monitorización de desviaciones en tiempo real logra un seguimiento dinámico de la equidad y el rendimiento del modelo mediante las siguientes dimensiones: i) Monitorización de desviaciones de grupos: Categorizar grupos por género del cliente, edad, región, nivel de ingresos, etc., calcular PR, TPR y FPR (Tasa de Falsos Positivos) para cada grupo cada hora. Las alertas de desviación se activan cuando las diferencias de PR entre grupos superan 0,08 o las diferencias de TPR superan 0,05; ii) Monitorización de deriva de rendimiento: Cálculo continuo de métricas como AUC-ROC y PR-AUC. Cuando estas métricas disminuyen más del 2% consecutivamente durante tres horas, se determina como deriva de rendimiento, iniciando automáticamente el proceso de reentrenamiento del modelo. iii) Monitorización del cumplimiento de la privacidad: Registrar el consumo del presupuesto de privacidad y la adición de ruido εtotal o 10 intensidad de cada ronda de entrenamiento. Cuando el consumo de ε de una sola ronda supere, pausa el entrenamiento y ajusta la estrategia de ruido. iv) El seguimiento de los datos se muestra a través de paneles visuales, lo que permite a los reguladores y las instituciones participantes verlos en tiempo real y lograr una gestión transparente de los riesgos del modelo.

API de informes regulatorios

Para simplificar el proceso regulatorio de informes, se diseña una API estandarizada de informes regulatorios para apoyar la generación automática de informes que cumplan con normativas como el RGPD, la CCPA y la Ley de Protección de Información Personal de China. Las funciones principales incluyen: i) Informe de Cumplimiento de Fuentes de Datos: Agrega automáticamente tipos de datos, volúmenes y estado de autorización de las instituciones participantes para verificar el cumplimiento del principio de "mínimo necesario"; ii) Informe de Cumplimiento de Formación Modelo: Registra iteraciones de formación, instituciones participantes, medidas de protección de la privacidad y métricas de equidad para generar un informe de trazabilidad de formación modelo; iii) Informe de cumplimiento de predicción de riesgos: Muestra patrones de distribución conformes con la normativa de predicciones de modelos entre diferentes grupos y casos de explicación contrafactual para demostrar la no discriminación. La API adopta un estilo de diseño RESTful, soportando salidas en formatos JSON y XML. Las autoridades regulatorias pueden acceder directamente a los datos de los informes a través de interfaces API o establecer ciclos automáticos de informes para lograr procesos regulatorios automatizados y estandarizados. Las plantillas de informes cumplen con las normas regulatorias del modelo financiero de la Organización Internacional de Normalización (ISO), garantizando la autoridad y universalidad de los informes.

Diseño experimental: Descripción del conjunto de datos

Datos de tarjetas de crédito multiinstitucionales y préstamos para pymes

Los datos experimentales se originaron en instituciones financieras en China, cubriendo tipos de datos como transacciones personales con tarjeta de crédito y registros de solicitudes y cumplimientos de préstamos para pymes. La tecnología CopulaGAN se empleó para sintetizar y mejorar eventos fraudulentos raros, construyendo así un conjunto de datos experimental que combina autenticidad con integridad. Los datos reales utilizados en el experimento incluyen dos categorías principales: datos personales de transacciones con tarjeta de crédito y datos de préstamos para pymes, sumando más de 5 millones de registros desde enero de 2022 hasta diciembre de 2023. Los datos cubren cuatro grandes regiones económicas: Norte de China, Este de China, Sur de China y Suroeste de China, para garantizar la representatividad geográfica y la diversidad en la distribución de las muestras. Los campos centrales y las características estadísticas de los datos institucionales se muestran en la Tabla 7. Entre ellas, las Instituciones A y B son bancos comerciales nacionales con amplias bases de clientes que abarcan todos los grupos de edad; Las instituciones C y D son bancos de internet que atienden principalmente a jóvenes (20-35 años); La Institución E es una empresa de financiación al consumidor que se dirige a usuarios en mercados de menor nivel, con una distribución de datos que presenta características significativas no relacionadas con IID. El conjunto de datos contiene 115.610 piezas de datos. El conjunto de datos es proporcionado por instituciones financieras que colaboran con universidades

Tipo de datosInstituciónNúmero de registros (10.000)Número de clientes (10.000)Campos núcleoTasa de fraude por impagoCaracterísticas de distribución de datos
Transacciones con tarjeta de créditoA18085Tiempo de la transacción, importe, tipo de comerciante, ubicación de la transacción, si robar la tarjeta0.32%Las transacciones grandes representan una proporción elevada (> 5000 yuanes)
Transacciones con tarjeta de créditoB15072Número de flujo de transacción, importe (USD/RMB), canal de pago, valoración del cliente0.28%Las transacciones transfronterizas representan el 15%
Transacciones con tarjeta de créditoC12068Marca temporal de la transacción, importe, si instalar, edad del cliente, ubicación del número de teléfono móvil0.45%El pequeño comercio de alta frecuencia (<1000 yuanes representa el 60%)
Préstamos para pequeñas y microempresasD321.2Nombre de la empresa, importe del préstamo, plazo de crédito, escala de ingresos, importe del impuesto, si venció2.80%Los clientes manufactureros representan el 40%
Préstamos para pequeñas y microempresasE180.8Fecha de solicitud de préstamo, importe esperado, tipo de negocio, número de empleados, historial de desempeño3.50%Los clientes de servicio representan el 70%

Tabla 7: Características estadísticas de un conjunto de datos financieros reales multiinstitucional.

Para abordar la heterogeneidad de los datos interinstitucionales, el experimento se apegó estrictamente a las especificaciones de la cuadrícula de datos y de la capa semántica estandarizando los campos institucionales: por ejemplo, convertir el "importe de transacción (USD)" de la Institución B a RMB usando el tipo de cambio de la fecha de transacción y unificar el nombre del campo a "importe de transacción (YUAN)"; convirtiendo la "edad del cliente" de la Institución C (formato "1990-01-01") en una edad entera; y el mapeo de la "escala de ingresos empresariales" de la Institución D (clasificada como "por debajo de 1 millón / 1-5 millones / más de 5 millones") hasta los puntos medios de rangos numéricos (500.000, 3.000.000, 7.500.000), asegurando la coherencia entre el formato de datos y el significado semántico.

Aumento sintético vía CopulaGAN para eventos de fraude poco comunes

En escenarios de control de riesgos financieros, las muestras de fraude/impago suelen representar una proporción extremadamente baja. Utilizar directamente tamaños de muestra tan pequeños para el entrenamiento del modelo conduciría a graves problemas de desequilibrio de clases, comprometiendo las capacidades de generalización del modelo. El experimento emplea Copula GAN (una red generativa adversarial basada en funciones Cópula) para sintetizar datos aumentados en casos raros de fraude. Este método combina la capacidad de la función Copula para modelar distribuciones de datos de alta dimensión con las capacidades generativas de GAN, permitiendo la creación de datos sintéticos que se alinean con patrones reales de fraude evitando el problema del "colapso de patrones" comúnmente observado en la generación tradicional de GAN.

Estructura del modelo CopulaGAN

CopulaGAN consta de tres partes: Generador, Discriminador y módulo de restricción de distribución de cópula: (1) Generador: La entrada es un vector de ruido aleatorio de 128 dimensiones z∼N(0,1), y la salida de un vector de características sintético consistente con la dimensión real de la muestra a través de una red totalmente conectada de 3 capas (las dimensiones ocultas de capa son 256, 512, 256); (2) Discriminador: La entrada es muestra real o muestra sintética xsin, y a través de una red totalmente conectada de dos capas + función de activación sigmoide, se genera la probabilidad de que la muestra sea un dato real; (3) Módulo de restricción de distribución de cópula: ajustar la distribución conjunta de muestras reales de fraude mediante la función de cópula gaussiana (donde es el valor de la función de distribución de aristas de la octava característica de i), y añadir la restricción de distancia de cópula en la pérdida del generador para asegurar que la distribución conjunta de muestras sintéticas sea consistente con las muestras reales.

Ecuación 165(36)

Mejorar la verificación de procesos y efectos

El proceso de formación y mejora de CopulaGAN es el siguiente: i) Preprocesamiento de datos: Extraer muestras de fraude/por defecto (18.200 en total) de los datos reales de diversas instituciones; Estandarizar características continuas (x'=(x-μ)/σ); Las características discretas están codificadas con calor único; ii) Ajuste de la cópula: La función de cópula gaussiana se utiliza para ajustar la distribución conjunta de las muestras de fraude preprocesadas, calcular la función de distribución de aristas Fiθ y los parámetros de la función de cópula de cada característica; iii) Entrenamiento GAN: El generador y el discriminador se entrenan alternativamente. La función de pérdida del generador es:

Ecuación 168(37)

Aquí, λ es el peso de restricción, y Distancia (Csin, Creal) es la divergencia KL entre la distribución de cópulas de muestras sintéticas y la distribución de cópula de muestras reales; La función de pérdida discriminadora es la pérdida binaria estándar de entropía cruzada:

Ecuación 170(38)

Tras la convergencia del modelo (con la precisión del discriminador estabilizada al 50%±5%), el generador produjo 50.000 muestras sintéticas de fraude. Estos se mapearon de nuevo al espacio de características original según especificaciones semánticas y se mezclaron con muestras reales para construir un conjunto de entrenamiento equilibrado. Para validar la eficacia de las muestras sintéticas, la investigación las evaluó mediante una prueba KS de dos muestras y visualización de la distribución de características. Los resultados de la prueba KS mostraron que las diferencias en la distribución de características entre muestras sintéticas y reales estaban todas por debajo de 0,05 (estadística KS <0,05, valor p>0,05), indicando una buena consistencia en la distribución. La comparación de distribución de características demostró que las muestras sintéticas podían reproducir con precisión las características de distribución de muestras reales de fraude, proporcionando datos válidos suficientes para el entrenamiento del modelo, como se muestra en la Figura 1.

Figura 1
Figura 1: Comparación de la distribución de características entre muestras reales de fraude y CopulaGAN. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Métricas de evaluación

El experimento construye un sistema de evaluación multiíndice a partir de cuatro dimensiones principales: rendimiento predictivo, protección de la privacidad, equidad y eficiencia en la comunicación para medir de forma integral el rendimiento integral del marco de aprendizaje federado y el modelo de control de riesgos con IA. La definición, el método de cálculo y los criterios de evaluación de cada dimensión se muestran en la Tabla 8.

Dimensiones de la evaluaciónNombre del índiceDefinición y método de cálculoCriterio de evaluación
Rendimiento estimadoAUC-ROCEl área bajo la curva de trabajo característica del sujeto mide la capacidad del modelo para distinguir entre ejemplos positivos (por defecto/fraude) y negativosCuanto mayor sea el valor, mejor. El AUC-ROC del modelo excelente es>0,9
PR-AUCEl área de recuerdo de precisión bajo la curva, aplicable a datos desbalanceados, mide el rendimiento de un modelo en escenarios donde los ejemplos positivos son escasosCuanto mayor sea el valor, mejor. El PR-AUC de un modelo excelente es>0,8
Fracción de BrierError cuadrático medio entre la probabilidad predicha y la etiqueta verdadera, B=1Ni=1N(pi-yi)2Cuanto menor sea el valor, mejor. La puntuación Brier de un modelo excelente es inferior a 0,05
Tasa de falsos positivos (FPR)La proporción de ejemplos negativos FPR=FPFP+TNqueCuanto menor sea el valor, mejor. Los escenarios financieros suelen requerir un FPR <1% (para evitar rechazar buenos clientes)
Protección de la privacidadε-Curva de consumo (ε-Curva)Registrar la tasa de consumo del presupuesto acumulado de privacidad durante la formación para reflejar la capacidad de equilibrio dinámico de la protección de la privacidadLa curva se está estabilizando y el ε total es menor o igual a 5 (en línea con los requisitos de riesgo de privacidad del RGPD)
Ataque de razonamiento de miembros AUC (MI-AUC)La capacidad de un atacante para inferir si una muestra pertenece al conjunto de entrenamiento a partir de los resultados de predicción del modelo, y cuanto más cerca esté el valor de AUC de 0,5, mejor será la privacidadMI-AUC<0.6 es eficaz para la protección de la privacidad, MI-AUC<0.55 es excelente
Tasa de fuga de características (FLR)El atacante agrega las características para revertir el error FLR=1-KL(P∥∥Q)Dmaxrate de la distribución original de datos,FLR <0.1 indica que la protección de la privacidad es efectiva (P es Dmax, la verdadera distribución, Q es la inferida y es la distancia máxima KL)
JusticiaSesgo de DP en estadística (ΔDP)La diferencia máxima en la tasa de predicción ΔDP=max∥PRg-PRavg∥ de ejemplos positivos entre diferentes grupos,ΔDP<0,05 para equidad, para excelencia (PRg para la tasa positiva del grupo g)
Sesgo EO (ΔEO)La diferencia máxima en las tasas de ΔEO=max∥TPRg-TPRavg∥ entre diferentes grupos,GCE <0,02 está bien calibrada (K es el número de grupo, es la tasa predicha y es la tasa real)
Error de calibración de grupo (GCE)La desviación media entre la probabilidad predicha GCE=1Kg=1K∥pg-rg∥de cada grupo y la tasa real de impago,Cuanto menor sea el valor, mejor. Los requisitos de escenarios de las organizaciones pequeñas y medianas son <10MB/ronda
Eficiencia de la comunicaciónAncho de banda de enlace ascendente por rondaConsumo total de ancho de banda de los datos subidos por cada organización al coordinador durante una únicaCuanto menor sea el valor, mejor. Los escenarios interinstitucionales requieren menos de 120 minutos
Relación de reducción (CR)La proporción del volumen de datos original respecto al volumen de datos comprimidos, CR=SizerawSizecompCuanto mayor sea la relación de compresión, mejor. Soluciones excelentes CR>10:1

Tabla 8: Sistema de índice de evaluación experimental.

Explicación de la métrica: i) Ataque de Inferencia de Membresía: Utilizando la metodología de ataque caja negra, el atacante entrena un modelo binario de clasificación que introduce probabilidades predichas del modelo objetivo y genera el estado de pertenencia a la muestra. El riesgo de fuga de privacidad se mide mediante el AUC del modelo (es decir, MI-AUC). ii) Criterios de clasificación de grupos: En la evaluación de la equidad, los grupos se categorizan en cuatro dimensiones: género (hombre/mujer), edad (menores de 25/25-40/>40), región (mercados de primer nivel/nuevo primer nivel/segundo nivel/subsidiarias) y nivel de ingresos (<5k/5k-15k-15k/15k-30k/>30k RMB/mes). Esto garantiza la cobertura de grupos sensibles identificados por los reguladores financieros. iii) Criterios de convergencia: Durante el entrenamiento del modelo, si el conjunto de validación AUC-ROC muestra una disminución inferior a 0,001 en tres rondas consecutivas (cada ronda contiene 10 épocas), el entrenamiento se considera convergente y detenido.

Líneas base

Para validar la superioridad del propuesto "Modelo de Control de Riesgos de Aprendizaje Federado + Híbrido de IA", este estudio establece cinco modelos de referencia: modelos centralizados tradicionales, modelos clásicos de aprendizaje federado y modelos mejorados que preservan la privacidad. Los parámetros centrales y las estrategias de entrenamiento de cada modelo de referencia se detallan en la Tabla 9 para garantizar la equidad en experimentos comparativos (todos los modelos utilizan conjuntos de entrenamiento, conjuntos de validación y estrategias de optimización de hiperparámetros idénticos).

Tipos de modelosNombre del modeloArquitectura centralModo de entrenamientoMedidas de protección de la privacidadHiperparámetros clave
Modelo centralizadoTradición GBDTÁrbol de aumento de gradiente XGBoostTodas las instituciones almacenan los datos de entrenamiento de forma centralizadaNo tenerNúmero de árboles = 100, tasa de aprendizaje = 0,1, profundidad del árbol = 6, coeficiente de regularización λ=1,0
Modelo centralizadoModelo de aprendizaje profundo (MLP)La red totalmente conectada de tres capas (capa de entrada 256 dimensiones → capa oculta 128 dimensiones → capa oculta 64 dimensiones → capa de salida 1 dimensión)Todas las instituciones almacenan los datos de entrenamiento de forma centralizadaNo tenerOptimizador=Adam, tasa de aprendizaje=0,001, tamaño del lote=256, Abandono=0,3
Modelo federal clásicoFedAvg (promedio federal)El modelo local es GBDT, y el modelo global adopta la agregación de medias de parámetrosEntrenamiento federal sincronizadoNo tenerTasa de participación = 0,8, época local = 5, ronda de agregación = 50, tasa de aprendizaje = 0,1
Modelo federal clásicoFedProx (Agregación Federal de Extremo Cercano)El modelo local es GBDT, y el proximalEntrenamiento federal sincronizadoNo tenerTasa de participación = 0,8, época local = 5, ronda de agregación = 50, parámetro proximal μ = 0,01
μ=0.01
La restricción de términos se añade durante la agregación ().
Federación Empoderada por la PrivacidadFedAvg+DP (ruido fijo)Añadir ruido laplaciano fijo a FedAvg (ε=5, δ=1e-5)Entrenamiento federal sincronizadoPrivacidad diferencial fijaIntensidad de ruido=0,1, tasa de participación=0,8, época local=5, rondas de agregación=50
El modelo de investigaciónFedRisk (Modelo Federal de Control de Riesgos)GDT local (restricción monótona) + transformador global (fusión de atención) + DP + agregación seguraFormación Federal AsincrónicaCompartición de secretos additiva adaptativa DP+Época local=5, rondas de agregación=50, dimensión de atención=64, presupuesto de privacidadε=5, relación de compresión=15:1

Tabla 9: Comparación de parámetros entre el modelo de referencia y este modelo de estudio.

Explicación de la dimensión comparativa: (1) Centralizado vs. Federado: Al comparar "Traditional GBDT/MLP" con "FedAvg/FedProx/FedRisk", este estudio examina la degradación del rendimiento del aprendizaje federado en escenarios de "datos fuera del sitio". (2) Federado clásico vs. Mejorado en la privacidad: A través de "FedAvg" frente a "FedAvg+DP", la investigación evalúa el impacto de la privacidad diferencial en el rendimiento del modelo. (3) Federado síncrono vs. asíncrono: La comparación entre "FedAvg" (síncrono) y "FedRisk" (asincrónico) demuestra las ventajas de eficiencia en la comunicación del entrenamiento asincrónico. (4) Agregación simple vs. fusión inteligente: El contraste entre "FedAvg" (promedio de parámetros) y "FedRisk" (atención fusión) valida la adaptabilidad de las estrategias de integración de Transformers a datos no IID. (5) No-Censura vs. Equidad-Censura: La comparación entre "FedAvg" (sin restricciones de equidad) y "FedRisk" (restricciones conscientes de la equidad) examina los efectos de los mecanismos de equidad sobre la equidad y el rendimiento del modelo.

Estudios de ablación

Impacto de ε variables en la utilidad del modelo

Utilizando el presupuesto total de privacidad ε como variable (con valores de 1, 3, 5, 7 y 10), la investigación fijó δ=1e-5 manteniendo sin cambios otros módulos (atención fusión y GBDT con restricción monótona) para evaluar el equilibrio entre la fuerza de protección de privacidad y la utilidad del modelo. El experimento midió tanto AUC-ROC (utilidad del modelo) como MI-AUC (riesgo de privacidad) como indicadores duales, con resultados mostrados en la Tabla 10. Cuando ε=1, MI-AUC bajó a 0,53 (excelente protección de privacidad), pero AUC-ROC solo alcanzó 0,821 (pérdida significativa de utilidad). A ε=5, AUC-ROC repuntó hasta 0,912 (cumpliendo con los requisitos de control de riesgos financieros) con MI-AUC=0,58 (protección efectiva de la privacidad). Al ε>5, la mejora en AUC-ROC fue inferior a 0,01, mientras que MI-AUC subió rápidamente a 0,63 (superando los límites de riesgo de privacidad). Esto confirma que ε=5 es el presupuesto total óptimo de privacidad, logrando un equilibrio entre privacidad y utilidad.

Presupuesto Total de PrivacidadModelo AUC-ROCMI-AUC (riesgo de privacidad)Tasa de fuga de características FLRFracción de Brier
10.8210.530.040.078
30.8760.550.060.061
50.9120.580.080.042
70.9190.60.110.039
100.9230.630.150.037

Tabla 10: Comparación del rendimiento del modelo con diferentes presupuestos de privacidad ε.

Contribución de la fusión de atención frente al promediado simple

Para evaluar las diferencias de rendimiento entre la "fusión de atención" (la estrategia propuesta) y el "promediado simple" (estrategia FedAvg) en escenarios de datos no independientes, se configuraron experimentalmente dos variables: (1) Severidad de los datos no IID (medida por variaciones en la tasa de impago específicas de la institución), baja variación: 0,2%-0,5%, alta variación: 0,2%-3,5%); (2) Estrategias de fusión (atención fusión vs promediado simple). Como se muestra en la Figura 2, la brecha AUC-ROC entre ambas estrategias era de solo 0,023 (0,912 frente a 0,889) en escenarios no IID bajos. Sin embargo, esta brecha se amplió a 0,076 (0,905 frente a 0,829) en escenarios de alto contenido no IID, con el modelo de promedio simple mostrando un sobreajuste significativo (conjunto de entrenamiento AUC-ROC 0,941 frente a conjunto de validación 0,829). Esto demuestra que los mecanismos de atención pueden mitigar eficazmente la degradación del rendimiento causada por datos no independientes mediante ponderaciones dinámicas, como asignar un peso de 0,32 a la institución E con predicciones por defecto precisas y un peso de 0,12 a la institución C con desviaciones mayores.

Figura 2
Figura 2: Comparación de estrategias de fusión bajo diferentes grados de No-IID. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Efecto de los regularizadores de capital justo en los KPIs basados en el beneficio

La demanda principal de las instituciones financieras es garantizar beneficios empresariales bajo la limitación de la equidad; por ello, el experimento introduce un índice orientado al beneficio: "rentabilidad ajustada al riesgo sobre el capital (RAROC)". La fórmula es la siguiente:

Ecuación 171(39)

La pérdida esperada se calcula como la probabilidad de impago multiplicada por la tasa fija de pérdidas por moro (fijada en el 40%), mientras que el capital económico se determina por la exposición al riesgo multiplicada por el peso del riesgo (según los requisitos de Basilea III). Las métricas de equidad (ΔDP, ΔEO) y RAROC del modelo con regularización de equidad frente al modelo sin ella se comparan en la Tabla 11. Tras implementar la regularización de la equidad, el ΔDP disminuyó de 0,15 a 0,04, el ΔEO bajó de 0,12 a 0,03 y el RAROC solo disminuyó un 2,1% (18,3% frente al 18,7%), significativamente por debajo del umbral aceptable por la industria del 5%. Esto demuestra que el mecanismo de equidad en nuestro estudio cumple eficazmente con los requisitos regulatorios de no discriminación mientras controla las pérdidas de beneficios.

Configuración del modeloΔDP (diferencia de tasa positiva de grupo)ΔEO (diferencia TPR de grupo)GCE (error de calibración de grupo)RAROC (Rentabilidad ajustada al riesgo sobre activos)FPR (tasa de falsos positivos)
No hay regla de equidad0.150.120.03518.70%0.95%
Hay justicia y regularidad0.040.030.01818.30%1.02%

Tabla 11: Influencia de la regularización de la equidad en los indicadores de equidad y beneficios.

Detalles de implementación

Para garantizar la reproducibilidad del experimento, la investigación aclaró la pila técnica y los detalles del proceso de entrenamiento: (1) Entorno de hardware: Cada nodo institucional utiliza procesadores Intel Xeon Gold 6248, 64GB de RAM y GPUs NVIDIA Tesla V100; el coordinador federado emplea dos procesadores Xeon Gold 6348 con 128GB de RAM para garantizar computación paralela y una agregación eficiente de parámetros. (2) Marco de software: El marco de aprendizaje federado se desarrolla usando PySyft 0.8.6, el módulo blockchain utiliza Hyperledger Fabric 2.5 (mecanismo de consenso: Raft), el entrenamiento de modelos se basa en PyTorch 2.0 y XGBoost 2.0.3, mientras que el módulo de privacidad diferencial integra IBM DP Library. (3) Proceso de entrenamiento: (1) Preprocesamiento de datos (2 horas, incluyendo normalización semántica y mejora de CopulaGAN); (2) Entrenamiento local (5 épocas por ronda, tasa de aprendizaje disminuida mediante recocido coseno); (3) Agregación asíncrona (las actualizaciones globales del modelo ocurren cuando el coordinador recibe parámetros de 3 instituciones); (4) Evaluación del modelo (AUC-ROC y métricas de equidad calculadas tras 10 rondas); (5) Optimización por hiperparámetros (optimización bayesiana con 50 iteraciones para determinar parámetros óptimos). (4) Pruebas de robustez: simulaciones de desconexiones institucionales (seleccionando aleatoriamente una institución para detener 1-3 rondas de formación) y ruido de datos (añadiendo perturbaciones en valores de características al 5%). Los resultados mostraron fluctuaciones AUC-ROC por debajo de 0,02, demostrando la capacidad anti-interferencia del sistema.

Este estudio empleó una estrategia de planificación de recocido coseno con una tasa inicial de aprendizaje de 0,05. La tasa de aprendizaje se actualizaba dinámicamente en cada época según la fórmula a lo largo de un total de 100 épocas de entrenamiento. Esta estrategia mantuvo una alta tasa de aprendizaje en las primeras etapas del entrenamiento, por ejemplo 0,05 en la primera época, para acelerar la convergencia del modelo, y la fue decayendo gradualmente hasta casi cero, por ejemplo 0,00025 en la centésima época, para mejorar la estabilidad del ajuste fino de los parámetros. Los resultados experimentales demostraron que, en comparación con una tasa de aprendizaje fija, esta estrategia mejoró el conjunto de validación AUC-ROC en un 2,3% y aceleró la velocidad de convergencia en un 37%. La partición de datos se basó en un conjunto de datos en bruto de cinco instituciones financieras que sumaba 5 millones de muestras, cumpliendo estrictamente con el principio de aislamiento interinstitucional de datos. Los datos locales de cada institución se dividieron cronológicamente, seleccionando datos de enero de 2022 a junio de 2023 como conjunto de entrenamiento (70%), datos de julio a septiembre de 2023 como conjunto de validación (15%) y datos de octubre a diciembre de 2023 como conjunto de prueba (15%). Esta partición aseguró la independencia temporal de la ventana temporal de los conjuntos de entrenamiento, validación y prueba, simulando eficazmente la evolución de los patrones de riesgo temporal en escenarios del mundo real. Los hiperparámetros clave se determinaron mediante optimización bayesiana. Dentro de un espacio de búsqueda conjunto que abarca una tasa de aprendizaje inicial entre 0,01 y 0,1, números de árboles GBDT entre 50 y 200, y cabezas de atención Transformer del conjunto {2, 4, 8}, se ejecutaron 50 iteraciones con el objetivo de maximizar el conjunto de validación AUC-ROC. La combinación óptima final se identificó como una tasa inicial de aprendizaje de 0,05, 120 árboles GBDT y 4 cabezas de atención.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rendimiento predictivo: Aproximarse al nivel de los modelos centralizados en escenarios no IID

En escenarios reales con datos altamente no relacionados con la discapacidad intelectual (variaciones institucionales en las tasas de impago del 0,2%-3,5%), FedRisk demuestra capacidades excepcionales de diferenciación de riesgos, como se muestra en la Tabla 12. Su AUC-ROC alcanza 0,912, PR-AUC es 0,823, puntuación Brier 0,042 y tasa...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La estrategia dinámica de ajuste de hiperparámetros, especialmente el planificador de tasa de aprendizaje de recocido coseno, resultó esencial para equilibrar la velocidad de convergencia y la estabilidad del modelo. Al decaer la tasa de aprendizaje de 0,05 a 0,00025 durante 100 épocas, este enfoque aceleró la convergencia en etapas tempranas mientras minimizaba la volatilidad en etapas avanzadas en un 37% y mejoraba la validación AUC-ROC en un 2,3% en comparación con los programas de ta...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Ordenador portátilDell TechnologiesN/AUtilizado para el procesamiento y documentación de datos
Software Estadístico (SPSS)IBM Corp.Versión 26.0Utilizado para análisis estadístico
Microsoft ExcelMicrosoftOficina 365Entrada de datos y manejo básico de datos

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).
  2. Zhang, X., Mavromatis, A., Vafeas, A., Nejabati, R., Simeonidou, D. Federated feature selection for horizontal federated learning in IoT networks. IEEE Internet Things J. 10 (11), 10095-10112 (2023).
  3. Liu, Y., et al. Vertical federated learning: concepts, advances, and challenges. IEEE Trans. Knowl. Data Eng. 36 (7), 3615-3634 (2024).
  4. Saha, S., Ahmad, T. Federated transfer learning: concept and applications. Intell. Artif. 15 (1), 35-44 (2020).
  5. McMahan, H. B., Moore, E., Ramage, D., Hampson, S., Arcas, B. A. Y. Communication-efficient learning of deep networks from decentralized data. In Proc. 20th Int. Conf. Artif. Intell. Stat. , 1273-1282 (2017).
  6. Yang, Q., Liu, Y., Chen, T., Tong, Y. Federated machine learning: concept and applications. ACM Trans. Intell. Syst. Technol. 10 (2), Article 12(2019).
  7. Pan, S. J., Yang, Q. A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22 (10), 1345-1359 (2010).
  8. Long, Z., Wang, J., Wang, Y., Xiao, H., Ma, F. FedCon: a contrastive framework for federated semi-supervised learning. arXiv. , (2021).
  9. Wang, J., et al. FedLite: a scalable approach for federated learning on resource-constrained clients. arXiv. , (2022).
  10. Hanser, T., et al. Data-driven federated learning in drug discovery with knowledge distillation. Nat. Mach. Intell. 7, 1-14 (2025).
  11. Feng, Y., et al. A survey of security threats in federated learning. Complex Intell. Syst. 11 (2), 165(2025).
  12. Chen, D., et al. Bridging data silos in finance via federated learning. IEEE Netw. , https://ieeexplore.ieee.org/document/11062627 (2025).
  13. Haripriya, R., et al. Navigating the fusion of federated learning and big data: a systematic review for the AI landscape. Clust. Comput. 28 (5), 1-27 (2025).
  14. Dong, J., Roth, A., Su, W. J. Gaussian differential privacy. J. R. Stat. Soc. Ser. B Stat. Methodol. 84 (1), 3-37 (2022).
  15. Bayatbabolghani, F., Blanton, M. Secure comparison protocols for privacy-preserving federated learning. In Proc. 2018 ACM SIGSAC Conf. Comput. Commun. Secur. , 2157-2159 (2018).
  16. Acar, A., Aksu, H., Uluagac, A. S., Conti, M. A survey on homomorphic encryption schemes: theory and implementation. ACM Comput. Surv. 51 (4), (2018).
  17. Dwork, C. Differential privacy. In Proc. Int. Colloq. Automata Lang. Program. , 1-19 (2006).
  18. Abadi, M., et al. Deep learning with differential privacy. In Proc. 2016 ACM SIGSAC Conf. Comput. Commun. Secur. , 308-318 (2016).
  19. Bogetoft, P., et al. Secure multiparty computation goes live. In Financ. Cryptogr. Data Secur. 5628, 325-343 (2009).
  20. Perri, L. What's new in the 2023 Gartner Hype Cycle for emerging technologies. , https://www.gartner.com/en/articles/what-s-new-in-the-2023-gartner-hype-cycle-for-emerging-technologies (2023).
  21. Friedman, J., Hastie, T., Tibshirani, R. The elements of statistical learning. , Springer. New York. (2001).
  22. Zhang, H., Liu, Y., Zhang, X., Yin, Z., Li, Y. A lightweight approach for federated learning in edge devices. In Proc. 7th Int. Conf. Artif. Intell. Big Data (ICAIBD). , 53-58 (2024).
  23. Liu, J., Liu, P., Ou, Z., Zhang, G., Song, M. Optimizing edge intelligence through privacy-preserving learning. In Proc. Int. Conf. Edge Comput. , 419-429 (2024).
  24. Kim, J., Kim, K., Sohn, M., Park, G. Deep model-based security-aware entity alignment method for edge-specific knowledge graphs. Sustainability. 14 (14), 8877(2022).
  25. Xue, J., Qu, Z., Xu, J., Liu, Y., Lu, Z. Bandwidth allocation for federated learning with wireless providers and cost constraints. IEEE Trans. Mob. Comput. 23 (6), 7470-7482 (2024).
  26. Sharma, M., Kaur, P. Scalable federated learning for smart city applications. In Proc. 2nd Int. Conf. Informatics (ICI). , 1-4 (2023).
  27. Li, B., Zheng, S., Raman, P., Shrivastava, A., Giannakis, G. B. Contractive error feedback for gradient compression. arXiv. , (2023).
  28. 2023 risk monitoring report. , China banking and insurance regulatory commission. https://www.cbirc.gov.cn (2023).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Federated LearningExplainable AICross Institutional CollaborationFinancial Risk ControlData PrivacyNon IID DataModel InterpretabilityDifferential PrivacyFraud DetectionSME Loan Default

Artículos relacionados