$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Resumen
Se desarrolló un Marco de Aprendizaje Inteligente Federado (IFLF) para gestionar de manera eficiente la heterogeneidad de datos y sistemas en entornos no colocados. La arquitectura del sistema constaba de cinco capas: la Capa de Datos, la Capa Cliente, la Capa de Agregación, la Capa de Adaptación y Optimización, y la Capa de Interpretabilidad. Los módulos se desplegaron sobre una configuración de computación distribuida con un servidor central de agregación y múltiples nodos cliente. Se usaban conexiones seguras por socket (SSL/TLS) para la comunicación entre nodos y así garantizar la privacidad e integridad de los datos. El siguiente procedimiento se utilizó para preparar conjuntos de datos, establecer la arquitectura, realizar formación federada y evaluar la interpretabilidad.
Configuración del entorno computacional
El entorno computacional se configuró instalando los marcos de software necesarios para implementar el marco de aprendizaje federado. Python se utilizó como el lenguaje de programación principal para el desarrollo y experimentación de modelos. Se instalaron bibliotecas de aprendizaje automático, incluyendo TensorFlow o PyTorch, para el entrenamiento de redes neuronales, junto con bibliotecas adicionales como NumPy, Scikit-learn y Pandas para el preprocesamiento y análisis de datos. Se instalaron bibliotecas de aprendizaje federadas como Flower o PySyft para simular entornos de cliente distribuidos. El entorno informático se configuraba en una estación de trabajo equipada con aceleración GPU, cuando estaba disponible. Todos los clientes y el servidor de agregación estaban configurados para comunicarse mediante conexiones de socket seguras (SSL/TLS). Se verificó que todos los conjuntos de datos requeridos eran accesibles dentro del almacenamiento local de cada nodo cliente antes de iniciar el entrenamiento federado. Los marcos de software, conjuntos de datos y entorno computacional necesarios para reproducir el protocolo se resumen en la Tabla de Materiales.
Inicialización de nodos federados
El servidor central de agregación se configuró usando el marco de aprendizaje federado Flower. El servidor de agregación se inició usando el siguiente comando:
Python server.py --redondeas 100 --clientes 10 --secure_connection Verdadero
Los nodos cliente individuales se lanzaban en terminales o entornos informáticos separados usando el siguiente comando:
Python client.py --client_id 01
La comunicación segura por socket se configuraba generando certificados SSL/TLS usando el toolkit OpenSSL.
openssl req -x509 -newkey rsa:4096 -keyout key.pem -out cert.pem -days 365
La comunicación segura entre el servidor y los clientes se habilitaba especificando las rutas de los certificados en el archivo de configuración. La conectividad se verificó ejecutando una ronda de comunicación de prueba antes de iniciar el proceso de entrenamiento federado.
Preparación y descripción del conjunto de datos
Se seleccionaron conjuntos de datos públicos representativos para evaluar el rendimiento en diferentes dominios y modalidades de datos. FEMNIST es una base de datos avanzada de MNIST para el reconocimiento de caracteres manuscritos, que contiene 62 clases (A–Z, a–z, dígitos 0–9), donde cada cliente representa los datos de un escritor, induciendo distribuciones naturales no IID. FLamby es un referente de imagen médica compuesto por diferentes conjuntos de datos médicos trans-silos (por ejemplo, resonancia magnética cardíaca, imágenes histopatológicas), donde cada hospital o institución actúa como un cliente federado. FedGraphNN es un benchmark para redes neuronales de grafos que cubre tareas como redes de citas, clasificación de moléculas y grafos sociales, donde los clientes contienen diferentes subgrafos o características de nodos. CICIDS2017 es un conjunto de datos de ciberseguridad para la detección de intrusiones con más de 80 características de flujo de tráfico de red a través de tipos de ataques como DDoS, PortScan y Botnet, donde cada cliente representa un dominio o sensor de red separado.
Estadísticas del conjunto de datos
Se resumieron las características clave de los conjuntos de datos utilizados en los experimentos para asegurar la reproducibilidad del sistema de aprendizaje federado. FEMNIST contiene aproximadamente 805.263 muestras de caracteres manuscritos distribuidas entre 3.550 escritores, con 62 clases que representan mayúsculas, minúsculas y dígitos, y cada cliente corresponde a un solo escritor con aproximadamente 200–300 muestras de media. FLamby proporciona conjuntos de datos sanitarios transversales y, en este estudio, el conjunto de datos de imagen médica contiene aproximadamente 20.000 muestras recogidas de varios hospitales, donde cada hospital actúa como un cliente federado independiente. FedGraphNN incluye múltiples conjuntos de datos de aprendizaje de grafos, como redes de citas y grafos moleculares, que normalmente contienen miles de nodos y aristas con vectores de características nodosales que varían entre 50 y 500 dimensiones según la tarea. CICIDS2017 contiene aproximadamente 2,8 millones de flujos de tráfico de red con 80 características estadísticas extraídas de paquetes de red e incluye múltiples categorías de ataque como tráfico DDoS, PortScan y Botnet, donde cada cliente federado representa un entorno de red o sensor de monitorización diferente. Los conjuntos de datos utilizados en este estudio se publicaron entre 2017 y 2023 y están disponibles públicamente para la investigación en aprendizaje federado. Las características estadísticas de los conjuntos de datos utilizados en los experimentos se resumen en la Tabla 1.
| Conjunto de datos | Dominio | Muestras | Características | Clases | Clientes | Año de lanzamiento |
| FEMNIST | Visión (caracteres manuscritos) | 8,05,263 | Píxeles de imagen (28×28) | 62 | 3,550 | 2017 |
| FLamby | Imagen sanitaria | ~20.000 | Características de la imagen | Binario / multiclase | 5 | 2023 |
| FedGraphNN | Aprendizaje de grafos | ~10k–100k nodos | Características de nodos 50–500 | Dependiente de la tarea | 7 | 2021 |
| CICIDS2017 | Ciberseguridad | ~2,8 millones de caudales | 80 | Clases de ataque múltiples | 10 | 2017 |
Tabla 1: Resumen de los conjuntos de datos utilizados en los experimentos del Marco de Aprendizaje Inteligente Federado. La tabla resume las características de los conjuntos de datos utilizados en este estudio, incluyendo el dominio de aplicación, el número total de muestras, el número de características, el número de clases, el número de clientes federados y el año de publicación del conjunto de datos. Estas estadísticas ofrecen una visión general de las modalidades de datos heterogéneas utilizadas para evaluar el marco.
Heterogeneidad a nivel de cliente
La heterogeneidad a nivel de cliente se introdujo mediante la partición de conjuntos de datos. Aunque se utilizaron cuatro conjuntos de datos de diferentes dominios para la evaluación, se introdujo heterogeneidad dentro de cada conjunto federado mediante la partición a nivel cliente. Cada conjunto de datos se dividió entre varios clientes, resultando en distribuciones locales de datos no idénticas (no IID). Se asignaron diferentes subconjuntos de muestras o clases a clientes individuales para simular condiciones de aprendizaje federadas realistas, representando la heterogeneidad estadística dentro de cada conjunto de datos. Aproximadamente entre el 5 y el 10% del conjunto total de datos se asignó a cada cliente, manteniendo el desequilibrio de clases para emular entornos federados no IID reales. El término conjuntos de datos heterogéneos en este estudio se refiere a la heterogeneidad estadística a nivel de cliente, más que a diferencias entre conjuntos de datos experimentales independientes. Los conjuntos de datos de referencia mostraron diferentes formas de heterogeneidad estadística, incluyendo variaciones en estilos de escritura individuales en FEMNIST, diferencias en protocolos de imagen y demografía de pacientes en los conjuntos de datos FLamby, variaciones estructurales en los conjuntos de datos de FedGraphNN y diversos patrones de tráfico de red en CICIDS2017, creando colectivamente distribuciones realistas de datos no IID que desafían algoritmos de optimización federada.
Preprocesamiento específico de conjunto de datos
Se realizaron operaciones de preprocesamiento específicas de conjunto de datos para estandarizar los formatos de entrada antes del entrenamiento federado. Para FEMNIST, las imágenes de caracteres manuscritas se convertían a escala de grises, se redimensionaban a 28×28 píxeles y se normalizaban al intervalo [0, 1], eliminando muestras corruptas o incompletas y codificando etiquetas de clase one-hot, y las muestras organizadas por IDs de escritor para que cada escritor correspondiera a un cliente federado. Para FLamby, las imágenes médicas se redimensionaron a 224×224 píxeles, se normalizaron usando media y desviación estándar específicas de cada conjunto, se aumentaron mediante técnicas como el cambio horizontal, la rotación y el ajuste de contraste, y se particionaron según identificadores hospitalarios. Para FedGraphNN, las estructuras de grafos se construyeron definiendo características de nodos, matrices de adyacencia y relaciones de borde, los vectores de características de nodos se normalizaron, los datos de grafos se convirtieron en representaciones de adyacencia dispersas y los grafos se particionaron entre clientes como subgrafos. Para CICIDS2017, se eliminaron los registros duplicados, se imputaron valores faltantes con la media, se codificaron características categóricas, se aplicó la normalización de características y se equilibró el tráfico benigno y de ataque usando muestreo estratificado. Cada conjunto de datos del cliente se dividió en subconjuntos de 80% de entrenamiento, 10% de validación y 10% de pruebas, asegurando que se preservaran las distribuciones de clase. Los conjuntos de datos cliente se almacenaban en carpetas separadas (Client_01, Client_02, ...), y el acceso a nodos locales se restringió por motivos de privacidad.
Arquitectura del Marco de Aprendizaje Inteligente Federado (IFLF)
El Marco de Aprendizaje Federado Inteligente se organizó en una arquitectura de cinco capas que consiste en la Capa de Datos, la Capa de Cliente, la Capa de Agregación, la Capa de Adaptación y Optimización, y la Capa de Interpretabilidad, como se ilustra en la Figura 1. Las capas arquitectónicas estaban diseñadas para transmitir la información de forma secuencial. Tras preparar y particionar conjuntos de datos heterogéneos según la propiedad del cliente, la Capa de Datos transmitía información a la Capa de Cliente, donde se entrenaban modelos locales y se generaban actualizaciones de modelos. Estas actualizaciones se enviaban a la Capa de Agregación, donde las métricas de fiabilidad y similitud guiaban la agregación de las contribuciones ponderadas de los clientes. La Capa de Adaptación y Optimización aseguraba un proceso global de entrenamiento fluido variando los parámetros de la tasa de aprendizaje de acuerdo con la varianza del gradiente. Finalmente, la Capa de Interpretabilidad utilizó métodos explicables de inteligencia artificial como SHAP y LIME para interpretar el modelo global y producir explicaciones de predicciones.

Figura 1. Arquitectura del Marco de Aprendizaje Inteligente Federado. El marco se divide en cinco capas: Datos, Cliente, Agregación, Adaptación y Optimización, y Interpretabilidad. Los datos de clientes heterogéneos no colocados se procesan, agregan localmente en función de la fiabilidad y similitud, se optimizan adaptativamente e interpretan usando SHAP o LIME. Las flechas indican la comunicación iterativa entre los clientes y el servidor central que forman el bucle de aprendizaje federado. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Capa de datos
Los conjuntos de datos se dividían según los requisitos de propiedad del cliente y privacidad, manteniendo ubicaciones de almacenamiento dedicadas para cada cliente. Se aplicaron diferentes pipelines de preprocesamiento y se normalizaron las características para asegurar formatos de entrada estandarizados entre dominios.
Capa cliente
Se configuraron clientes distribuidos que representaban dispositivos, organizaciones o instituciones, cada uno recibiendo una copia idéntica del modelo global inicializada con los mismos parámetros. El entrenamiento local se realizó utilizando conjuntos de datos específicos del cliente con métodos de optimización como el descenso de gradiente estocástico o Adam, mientras que solo se comunicaron parámetros o gradientes del modelo para preservar la privacidad de los datos.
Capa de agregación
Una unidad central de agregación recibía actualizaciones cifradas de modelos de todos los clientes y evaluaba su fiabilidad y similitud antes de la agregación. Se utilizaron puntuaciones de fiabilidad basadas en el rendimiento de validación para determinar la importancia de las actualizaciones del cliente, y la similitud entre actualizaciones se evaluó mediante métodos como el agrupamiento o la similitud coseno. Se realizó agregación ponderada y el modelo global actualizado se redistribuyó a los clientes.
Capa de adaptación y optimización
Los parámetros de optimización se ajustaron dinámicamente en función del progreso de la formación entre los clientes. Se programaron tasas de aprendizaje para reducir la varianza de actualización, y se aplicaron técnicas adicionales como la regularización proximal y el ponderado adaptativo para mitigar la deriva del cliente y mejorar la estabilidad de convergencia.
Capa de interpretabilidad
Se utilizaron métodos explicables de inteligencia artificial como SHAP y LIME para generar puntuaciones de atribución de características y explicaciones de modelos. Los resultados incluyeron clasificaciones de importancia de características, mapas de atribución y explicaciones visuales, que se interpretaron en el contexto del conocimiento específico del dominio para garantizar la transparencia.
Entrenamiento federado
El Marco de Aprendizaje Federado Inteligente se implementó mediante la inicialización del modelo global en el servidor central de agregación, seguido de la definición de los hiperparámetros de entrenamiento, incluyendo la tasa de aprendizaje, rondas de comunicación y épocas locales. Los parámetros globales del modelo se distribuyeron a todos los clientes, quienes luego realizaron entrenamiento local utilizando sus conjuntos de datos privados. Se calculaban la pérdida local de entrenamiento y la precisión de validación, y se generaban y cifraban actualizaciones de modelos antes de la transmisión al servidor de agregación. La fiabilidad de las actualizaciones del cliente se evaluó en función del rendimiento de validación utilizando la Ecuación 1.
(1)
Donde Acci representa la precisión de validación del cliente i.
La similitud entre las actualizaciones del cliente se calculó usando similitud coseno de vectores de gradiente, tal como se define en la Ecuación 2.
(2)
Donde gi y g j representan los vectores de gradiente de diferentes clientes.
Los pesos de agregación adaptativa se calcularon combinando puntuaciones de fiabilidad y similitud, tal como se define en la Ecuación 3.
(3)
El peso de agregación adaptativa para cada cliente se determinó combinando puntuaciones de fiabilidad y similitud. La métrica de fiabilidad reflejaba la precisión de validación del modelo cliente local, mientras que la métrica de similitud medía la similitud coseno entre las actualizaciones de gradiente del cliente.
Por tanto, el peso de agregación wi priorizó a clientes que demostraran un rendimiento fiable en la validación y que mostraran direcciones de actualización consistentes con el objetivo global de optimización.
Los pesos normalizados aseguraban que la contribución total de todos los clientes participantes sumara uno, manteniendo así la estabilidad en la actualización global del modelo.
Los pesos se normalizaron de tal forma que
.
Actualización global del modelo
Los modelos de cliente se agregaron mediante un promedio ponderado, como se muestra en la Ecuación 4.
(4)
Donde Mi representa los parámetros locales del cliente i.
Los parámetros actualizados del modelo global se transmitieron a todos los clientes.
Modulación adaptativa de la velocidad de aprendizaje
Se monitorizó la variación de los gradientes de clientes entre rondas de comunicación. La tasa de aprendizaje se ajustó dinámicamente según la Ecuación 5.
(5)
Donde Var(g) representa la varianza del gradiente entre clientes.
La tasa de aprendizaje actualizada se aplicó durante el siguiente ciclo local de formación. La tasa de aprendizaje adaptativo fue controlada por el servidor central de agregación y aplicada globalmente en todos los clientes durante las rondas de entrenamiento posteriores. Este ajuste global aseguró un comportamiento de optimización consistente teniendo en cuenta la variación en las actualizaciones del cliente. Como la modulación de la tasa de aprendizaje se realizaba a nivel de servidor, todos los clientes participantes recibían la tasa de aprendizaje actualizada junto con los parámetros del modelo global de difusión.
Evaluación del rendimiento del aprendizaje por parte de federación
La precisión global del modelo se evaluó utilizando el conjunto de datos agregado de pruebas, como se muestra en la Ecuación 6.
(6)
Donde TP representa el número de predicciones verdaderosamente positivas, TN representa predicciones verdadeiramente negativas, FP representa predicciones falsas positivas y FN representa predicciones falsas negativas
La equidad entre clientes se midió calculando la varianza de precisión del cliente.
El coste de comunicación se calculaba como el número total de parámetros del modelo transmitidos entre los clientes y el servidor de agregación a lo largo de todas las rondas de comunicación. Por tanto, se estimó la sobrecarga total de comunicación como se muestra en la Ecuación 7.
(7)
Donde R es el número de rondas de comunicación, C es el número de clientes y S representa el tamaño del modelo.
El análisis de interpretabilidad del modelo se realizó utilizando SHAP para calcular puntuaciones globales de importancia de características y LIME para generar explicaciones locales para predicciones individuales. Los resultados de atribución de características se visualizaron para interpretar el comportamiento del modelo.
Resolución de problemas
La convergencia inestable se produjo cuando los conjuntos de datos de clientes eran altamente heterogéneos o contenían distribuciones de clases extremadamente desequilibradas. En tales casos, las épocas de entrenamiento local se redujeron o la tasa inicial de aprendizaje disminuyó para estabilizar las actualizaciones del gradiente. Las distribuciones de clientes altamente sesgadas llevaron a la dominancia de un pequeño número de clientes durante la agregación, lo cual se mitigó ajustando el umbral de ponderación de fiabilidad o aumentando la diversidad de participación de los clientes. La participación poco fiable del cliente causada por interrupciones en la red interrumpía las rondas de comunicación; por lo tanto, se habilitó la participación parcial, lo que permitió al servidor de agregación continuar con las actualizaciones disponibles del cliente. El fallo en la interpretabilidad o la atribución inconsistente de características surgió cuando los modelos se sobreregularizaron o entrenaron con datos insuficientes, y se verificaron los pasos de preprocesamiento de datos asegurándose que se generaran explicaciones SHAP o LIME tras la convergencia del modelo.
La secuencia iterativa de inicialización del modelo, entrenamiento local, agregación inteligente, optimización adaptativa y análisis de interpretabilidad se representa en la Figura 2, que representa el flujo de trabajo general del Marco de Aprendizaje Inteligente Federado (IFLF).

Figura 2. Flujo de trabajo del Marco de Aprendizaje Inteligente Federado. La figura muestra el ciclo iterativo de fases, incluyendo inicialización, entrenamiento local, agregación, optimización adaptativa e interpretabilidad, ilustrando la operación de extremo a extremo del marco. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Evaluación del desempeño
Se calcularon métricas globales y locales, incluyendo precisión, exactitud, recuerdo y puntuación F1. La equidad se midió mediante la variación de la precisión del cliente local. La eficiencia de la comunicación se examinó como el tamaño de los datos transferidos por ronda. El rendimiento del modelo se evaluó frente a las líneas base federadas típicas como FedAvg, FedProx y FedOpt. Los resultados se presentaron utilizando curvas de convergencia, matrices de confusión y gráficos de interpretabilidad. Se almacenaron todos los entornos experimentales, registros y puntos de control para garantizar la reproducibilidad.
Resumen del flujo de trabajo
El ciclo IFLF se llevó a cabo mediante entrenamiento local repetido continuamente, agregación inteligente, optimización adaptativa y análisis de interpretabilidad. La privacidad de los datos se mantenía manteniendo los datos en nodos locales mientras se permitía la mejora colaborativa del modelo. Estos pasos incorporaron mecanismos para abordar la equidad, la transparencia y el rendimiento entre clientes no colocados.