Artículo de investigación

Orquestación dinámica de aceptación de alimentadores basada en RL multiagente utilizando el conjunto de datos FeederBW y una red de distribución de baja tensión de 236 barras

20 visualizaciones

DOI:

10.3791/72365

8 de septiembre de 2026

En este artículo

Resumen

Este estudio presenta una Estrategia de Orquestación Dinámica para la aceptación de alimentadores de bajo voltaje mediante aprendizaje por refuerzo colaborativo con múltiples agentes. Agentes inteligentes coordinan la operación del alimentador, la gestión de congestión, la estabilidad de voltaje y la integración de energías renovables bajo condiciones inciertas. El enfoque fue evaluado mediante simulaciones utilizando los conjuntos de datos FeederBW y 236-bus.

Resumen

La amplia integración de fuentes de energía renovable distribuidas y la rápida expansión de alimentadores de baja tensión (LV) han creado desafíos operativos relacionados con la aceptación de alimentadores y la coordinación de congestión. Los enfoques actuales de control de voltaje y gestión de alimentadores pueden tener escalabilidad y adaptabilidad limitadas bajo generación renovable intermitente y condiciones de red cambiantes. Para abordar estas limitaciones, este estudio propone un Marco de Orquestación Dinámica para la Aceptación de Alimentadores de Baja Tensión basado en la colaboración de agentes inteligentes dentro de un enfoque de aprendizaje por refuerzo multiagente. A diferencia de las estrategias de control de voltaje centradas principalmente en la estabilización del voltaje, el marco propuesto permite la aceptación dinámica de alimentadores mediante la operación coordinada de agentes responsables del monitoreo de alimentadores, la gestión de congestión y la priorización basada en la sensibilidad al voltaje. Los agentes observaron de forma independiente los estados de los alimentadores, evaluaron la congestión y las sensibilidades de voltaje, y colaboraron en las decisiones de aceptación de alimentadores. El marco fue evaluado mediante simulaciones utilizando el conjunto de datos FeederBW y el conjunto de datos de red de distribución de baja tensión de 236 nodos bajo diferentes niveles de integración renovable y condiciones de carga. El marco propuesto alcanzó una Tasa de Aceptación de Alimentadores del 97 %, un Índice de Cumplimiento de Voltaje del 98 %, una latencia de orquestación de 98 ms medida como el tiempo de ejecución real del algoritmo de orquestación en el hardware reportado, y una velocidad de convergencia del 98,5 %, superando a los métodos de coordinación centralizada evaluados. Los resultados también indicaron una mejor adaptabilidad, resiliencia operativa y eficiencia en la toma de decisiones descentralizada bajo las condiciones simuladas de red de distribución de baja tensión.

Introducción

Los sistemas eléctricos modernos enfrentan importantes desafíos operativos debido al creciente consumo de electricidad y al aumento del uso de generación distribuida. Los desequilibrios entre la oferta y la demanda de electricidad, o los aumentos rápidos en la generación distribuida, pueden generar presión financiera sobre las empresas eléctricas y los usuarios finales, y comprometer la estabilidad de la red. Por ello, la infraestructura eléctrica convencional, basada en control centralizado y combustibles fósiles, está pasando a un diseño distribuido impulsado por energías renovables. Esta transición ha mejorado el acceso a fuentes de energía más asequibles y ambientalmente sostenibles. Sin embargo, la naturaleza intermitente e impredecible de la generación fotovoltaica (PV) genera preocupaciones sobre la fiabilidad de la red1,2.

La transición energética global está acelerando la implementación de la energía fotovoltaica debido a sus beneficios ambientales, escalabilidad y costo decreciente. Según la Agencia Internacional de Energías Renovables, se espera que la capacidad fotovoltaica represente más del 22 % del suministro eléctrico mundial para 2050, y se prevé que la energía solar fotovoltaica se convierta en un contribuyente importante al suministro eléctrico global para 20303. Esta integración generalizada plantea desafíos sustanciales para los sistemas eléctricos convencionales, particularmente en cuanto a la estabilidad y confiabilidad operativa. La fluctuación de voltaje es una preocupación crítica porque la generación fotovoltaica es intermitente y no programable, y sus efectos se vuelven más pronunciados a medida que aumenta la penetración en las redes de distribución y transmisión4.

Las variaciones en la irradiación solar afectan directamente el rendimiento de los paneles fotovoltaicos y pueden provocar cambios rápidos de voltaje. El movimiento de nubes, las variaciones bruscas de irradiación y los transitorios de carga pueden causar fluctuaciones de voltaje que las arquitecturas actuales de la red no pueden acomodar adecuadamente5. Aunque las tecnologías convencionales han sido efectivas en configuraciones de red centralizadas y relativamente estables, son menos adecuadas para redes cada vez más distribuidas. Cambios rápidos de voltaje en ambas direcciones pueden exceder las capacidades de los sistemas eléctricos convencionales, especialmente bajo una alta penetración de energía fotovoltaica6. Las fluctuaciones no controladas pueden violar los límites de voltaje, afectar cargas sensibles y comprometer la seguridad de la red.

Por lo tanto, la integración de cargas inteligentes y recursos distribuidos en las redes de distribución ha motivado el desarrollo de estrategias de control más avanzadas. Los sistemas de control inteligentes que monitorean y coordinan continuamente los equipos distribuidos pueden ayudar a mitigar los desafíos en redes de baja tensión (LV) con alta generación distribuida7. La integración a gran escala de energía fotovoltaica (PV) también crea dificultades operativas para la generación térmica, particularmente cuando la producción fotovoltaica disminuye y las unidades térmicas deben responder rápidamente, a veces superando los límites de velocidad de rampa8. Al mismo tiempo, los programas de respuesta a la demanda (DR) deben equilibrar la sostenibilidad a largo plazo con la viabilidad económica9.

Los programas de respuesta a la demanda (DR) pueden facilitar la integración de la generación distribuida mientras ayudan a equilibrar la oferta y la demanda de electricidad. Estos programas se clasifican como DR basada en precios o DR basada en incentivos (IBDR). La DR basada en precios incentiva a los consumidores a modificar su consumo de electricidad en respuesta a tarifas variables según el momento, mientras que la IBDR ofrece incentivos económicos fijos o variables para reducir el consumo cuando se solicita10. Sin embargo, la DR basada en precios expone a los consumidores a precios mayoristas fluctuantes y ofrece una flexibilidad operativa limitada desde la perspectiva de la empresa suministradora, lo que podría desalentar a los participantes adversos al riesgo11,12.

Varios estudios han examinado la IDR basada en incentivos en sistemas de distribución con alta penetración de energía fotovoltaica. Un estudio evaluó los desafíos y beneficios de combinar la IDR basada en incentivos con una alta penetración de energía fotovoltaica, pero se centró en el uso agregado de energía eléctrica en lugar de sistemas de gestión energética doméstica a nivel de vivienda13. Otro propuso un método de gestión de voltaje basado en incentivos en el que las señales de precios controlaban indirectamente la operación de baterías para mantener los límites de voltaje, aunque la demanda doméstica no fue modelada explícitamente14. Un método basado en lógica difusa para determinar pagos de incentivos consideró la satisfacción del consumidor y los costos de integración de energías renovables, pero no incluyó análisis a nivel de alimentador15. También se ha estudiado la planificación a largo plazo de generación que incorpora tanto la respuesta a la demanda basada en precios como la basada en incentivos, incluyendo generación térmica y renovable, pero sin tener en cuenta la comodidad del usuario ni la demanda a nivel doméstico16.

El aprendizaje por refuerzo profundo (RL) también se ha aplicado a la respuesta a la demanda (DR) residencial. Se han propuesto métodos de RL profundo para el control de carga agregada bajo tarifas horarias, aunque su capacidad de generalización se vio limitada por poblaciones pequeñas de usuarios y la ausencia de programación a nivel de electrodomésticos17. Un marco de aprendizaje por refuerzo multiagente que combina DR y control de voltaje utilizó redes neuronales de memoria a corto y largo plazo para la predicción de carga, pero no resolvió la insatisfacción de los clientes derivada de la restricción de carga18. Otros estudios se han centrado en la coordinación de DR para sistemas de aire acondicionado en edificios comerciales mediante un proceso de decisión de Markov, sin considerar otras cargas residenciales19. En general, los estudios existentes sobre control de voltaje mediante RL profundo no han integrado simultáneamente DR y generación fotovoltaica (PV)20,21.

Los inversores inteligentes pueden responder rápidamente a cambios bruscos e irregulares en la salida de la energía fotovoltaica22. Cuando ocurren violaciones de voltaje, los inversores fotovoltaicos pueden actuar en cuestión de milisegundos, mientras que los dispositivos convencionales pueden requerir varios segundos23. Algunos estudios han propuesto modificaciones a los procedimientos estándar de control de dispositivos, incluyendo enfoques multiagente para coordinar reguladores de voltaje y modificar las acciones de los controladores convencionales de voltaje24. Sin embargo, la generación fotovoltaica independiente sin almacenamiento colocado en el mismo lugar puede agravar las desviaciones de voltaje y no alivia los picos vespertinos, incluso cuando reduce las importaciones netas diurnas24,25. Las baterías domésticas también pueden agotarse durante períodos de excedente fotovoltaico diurno y volverse no disponibles para la carga nocturna de vehículos eléctricos si su despacho no se coordina con la demanda y generación local26,27. Los efectos combinados de la demanda estocástica, la generación intermitente y el comportamiento diverso del almacenamiento hacen que la gestión de la capacidad, la longevidad de los activos y la resiliencia sean preocupaciones importantes para los operadores de sistemas de distribución28. Los Sistemas de Gestión Energética Doméstica ofrecen un medio potencial para implementar el control automatizado a nivel del cliente. El aprendizaje por refuerzo (RL) es especialmente adecuado para tales aplicaciones porque los agentes pueden aprender estrategias de control mediante la interacción con el entorno, manejando al mismo tiempo la incertidumbre y tomando decisiones de baja latencia.

Los avances en la planificación de rutas para vehículos eléctricos también ilustran cómo el aprendizaje por refuerzo profundo puede gestionar restricciones energéticas dinámicas. El problema de rutas para flotas heterogéneas de vehículos eléctricos con capacidad limitada incorpora la dinámica de conducción, las características del terreno, la resistencia cinética y la eficiencia de carga, mientras minimiza el consumo máximo de energía en una flota diversa29. Un método de aprendizaje por refuerzo profundo consciente de la dinámica plantea este problema como un proceso de decisión de Markov personalizado y utiliza una arquitectura de codificador-actualizador-decodificador. En este diseño, el codificador desarrolla representaciones específicas del rol para vértices y vehículos, el actualizador perfecciona los tokens del vehículo conforme cambia la información contextual, y el decodificador separa la selección del vehículo de la selección de vértices específica del vehículo para favorecer una toma de decisiones adaptativa. De forma similar, un problema de rutas óptimas en términos de energía para vehículos eléctricos con recogida-entrega y ventanas de tiempo utiliza un modelo de consumo energético de alta resolución que incluye el comportamiento de carga, la dinámica de conducción dependiente del tiempo y información detallada de la ruta30. Un marco de aprendizaje por refuerzo profundo heterogéneo basado en atención representa la tarea de planificación de rutas como un proceso de decisión de Markov, con un codificador que captura las interacciones específicas del rol entre centros de distribución, clientes y estaciones de carga, y un decodificador que rastrea las transiciones de estado y la viabilidad temporal.

A pesar de estos avances, la mayoría de los estudios sobre gestión de la distribución en redes de baja tensión enfatizan la estabilización de voltaje y la optimización de la potencia reactiva, más que la orquestación dinámica de la aceptación de alimentadores bajo incertidumbre renovable. Los métodos distribuidos de control de voltaje basados en inversores inteligentes y aprendizaje automático generalmente se centran en la compensación de voltaje y la optimización de la potencia reactiva, sin abordar el control adaptativo de aceptación de alimentadores ni la orquestación basada en congestión en redes complejas de baja tensión. Asimismo, los enfoques de aprendizaje por refuerzo multiagente con restricciones de voltaje para la respuesta a la demanda no abordan directamente la gestión colaborativa de aceptación de alimentadores, la orquestación descentralizada con conciencia de congestión ni el control de admisión a nivel de nodo en sistemas interconectados de distribución de baja tensión. Los métodos cooperativos de regulación de voltaje basados en coordinación multiagente suelen minimizar las desviaciones de voltaje y las operaciones de derivación utilizando inversores de generación fotovoltaica, pero no consideran la admisión adaptativa de alimentadores, la inestabilidad de aceptación relacionada con fuentes renovables ni la orquestación descentralizada bajo condiciones dinámicas de la red.

Los métodos actuales de coordinación de recursos distribuidos y multiagente también enfrentan limitaciones en cuanto a la percepción de congestión, la adaptabilidad temporal y la escalabilidad. La mayoría hace hincapié en el análisis de sobrecarga, las interacciones de recursos energéticos distribuidos o la gestión energética basada en tarifas, en lugar de la aceptación adaptativa a nivel de alimentador y la orquestación sensible al voltaje. Su dependencia de una centralización parcial y de prioridades estáticas puede limitar aún más la toma de decisiones descentralizada, la respuesta rápida a la propagación de congestión y la adaptación a la variabilidad de las energías renovables. Por lo tanto, se necesita un marco completamente descentralizado basado en aprendizaje por refuerzo que combine la coordinación cooperativa de agentes con análisis sensible al voltaje y a la congestión, para una gestión adaptativa de la aceptación en alimentadores utilizando conjuntos de datos a gran escala como FeederBW y la red de distribución de baja tensión de 236 buses.

En este estudio, la aceptación de alimentadores se refiere al proceso operativo adaptativo para determinar si un alimentador de media tensión puede alojar recursos energéticos distribuidos adicionales o cargas eléctricas manteniendo la seguridad de la red, el cumplimiento de voltaje, los límites de carga térmica y la confiabilidad operativa. El límite operativo para la aceptación de alimentadores incluye la evaluación de la capacidad del alimentador, la sensibilidad de voltaje, las condiciones de congestión y la variabilidad de la energía renovable antes de aceptar o priorizar nuevas conexiones de alimentadores. A diferencia del control convencional de voltaje, que regula los perfiles de voltaje, la coordinación de recursos energéticos distribuidos, que gestiona la operación de los recursos, o la gestión de congestión, que mitiga sobrecargas en la red, la aceptación de alimentadores integra estas funciones dentro de un marco colaborativo de aprendizaje por refuerzo multiagente para apoyar una orquestación dinámica, descentralizada y adaptativa en condiciones con alta penetración de energías renovables.

El objetivo de este estudio es desarrollar una estrategia dinámica de orquestación basada en agentes inteligentes colaborativos para la aceptación de alimentadores de baja tensión bajo condiciones operativas cambiantes e incertidumbre de fuentes renovables. El marco propuesto realiza una orquestación descentralizada de la aceptación de alimentadores mediante la evaluación dinámica de los estados de los alimentadores, la sensibilidad al voltaje, la sensibilidad a la congestión y la capacidad de aceptación, permitiendo así una priorización adaptativa y una toma de decisiones más allá de los métodos estáticos de control de voltaje. Utilizando el conjunto de datos FeederBW y el conjunto de datos de la red de distribución de baja tensión de 236 nodos, el estudio también desarrolla una arquitectura escalable de aprendizaje por refuerzo multiagente para sistemas de baja tensión a gran escala. A través del aprendizaje impulsado por refuerzo y una optimización colaborativa de baja latencia realizada en cada intervalo operativo simulado, el marco está diseñado para reducir la propagación de congestión, mejorar el cumplimiento del voltaje, disminuir la latencia de orquestación y aumentar la eficiencia de la coordinación descentralizada.

El marco aporta un enfoque dinámico de orquestación de aceptación en alimentadores de MT que sustituye las estrategias estáticas de gestión de alimentadores basadas en control de voltaje; una arquitectura descentralizada de aprendizaje por refuerzo multiagente para condiciones de incertidumbre en energías renovables y cargas variables; gestión descentralizada de admisión basada en condiciones de baja latencia y priorización dinámica de alimentadores; índices conjuntos de sensibilidad al voltaje y a la congestión para identificar alimentadores críticos y priorizar las decisiones de aceptación; comunicación colaborativa entre agentes vecinos; optimización continua de políticas basada en aprendizaje por refuerzo para mejorar la estabilidad de los alimentadores, la mitigación de congestión, el cumplimiento de voltaje y la convergencia; y validación a gran escala mediante simulación utilizando los conjuntos de datos FeederBW y LV de 236 buses. Los resultados comparativos indican una mejor aceptación de alimentadores, mitigación de congestión, retardo de orquestación, velocidad de convergencia y cumplimiento de voltaje en comparación con los métodos tradicionales centralizados de coordinación.

Protocolo

No se utilizaron sujetos humanos, animales vertebrados, tejidos humanos ni tejidos animales en esta investigación. Únicamente se emplearon conjuntos de datos de acceso público (el conjunto de datos FeederBW y el conjunto de datos de red de distribución de baja tensión de 236 nodos) y simulaciones basadas en computadora en el estudio. Por lo tanto, este estudio no requirió aprobación del comité de revisión institucional (IRB), ética ni consentimiento informado.

La estrategia de orquestación dinámica para la aceptación de alimentadores de baja tensión basada en colaboración entre agentes se desarrolló utilizando aprendizaje por refuerzo multiagente (MARL) para condiciones operativas con alta penetración de energías renovables. Los conjuntos de datos del alimentador FeederBW y de la red de 236 nodos se preprocesaron, normalizaron y sincronizaron temporalmente para construir un modelo de red dinámico que represente los estados del alimentador, los recursos energéticos distribuidos, las zonas sensibles a la tensión y las condiciones de congestión. Se asignaron agentes inteligentes a secciones del alimentador y a nodos de la red para monitorear localmente la tensión, la congestión, la incertidumbre en la generación renovable y la capacidad de aceptación del alimentador, intercambiar información con agentes vecinos y actualizar las políticas de orquestación mediante aprendizaje por refuerzo descentralizado. La función de recompensa se diseñó para mejorar la aceptación del alimentador, limitando al mismo tiempo la congestión, la inestabilidad de tensión y los retrasos en la coordinación. Se consideraron restricciones de tensión, carga del alimentador, carga del transformador y congestión, mientras que no se modelaron explícitamente el funcionamiento desequilibrado trifásico, el control avanzado del inversor fotovoltaico ni la compensación de potencia reactiva. El marco general se muestra en Figura 1. Las herramientas de investigación utilizadas en este estudio se enumeran en la Tabla de Materiales.

Diagrama de red de modelado dinámico de red LV con sistemas multiagente y aprendizaje por refuerzo.
Figura 1: Arquitectura del marco propuesto. Esquema del Marco de Orquestación Dinámica que incorpora agentes inteligentes, aprendizaje por refuerzo, análisis de congestión y coordinación adaptativa de alimentadores. Haga clic aquí para ver una versión más grande de esta figura.

1. Adquisición de datos

Los datos se obtuvieron del conjunto de datos FeederBW31 y del conjunto de datos de distribución de baja tensión de 236 nodos32. Se seleccionaron estos conjuntos de datos porque contenían información sobre la topología del alimentador, condiciones de voltaje, comportamiento de generación renovable, demanda de carga, congestión y perfiles operativos dinámicos necesarios para la orquestación descentralizada y el aprendizaje de agentes basado en refuerzo.

El conjunto de datos FeederBW se utilizó principalmente para modelar el funcionamiento del alimentador, la intermitencia de la energía renovable, la desviación de voltaje y la propagación de congestión en redes de baja tensión. Contenía datos de operación del alimentador, comportamiento de generación distribuida, mediciones de voltaje en nodos y fluctuaciones de carga que apoyaban el análisis de orquestación adaptativa. El conjunto de datos de 236 nodos se utilizó para evaluar la escalabilidad y la coordinación descentralizada. Incluía información sobre conexiones de nodos, condiciones de carga del alimentador, características de voltaje en nodos, penetración de energías renovables distribuidas y casos operativos sensibles a la congestión. Juntos, los dos conjuntos de datos permitieron análisis a nivel de alimentador y a gran escala bajo condiciones de alta penetración de energía renovable. Las características de los conjuntos de datos y sus propósitos dentro del marco se resumen en Tabla 1.

Nombre del conjunto de datosTipo de conjunto de datosNúmero de nodos/busesAtributos de los datosPropósito en el trabajo propuesto
Conjunto de datos FeederBWConjunto de datos operativos de alimentadores de baja tensiónMúltiples nodos de alimentadorPerfiles de voltaje, generación renovable, demanda de carga, estados de congestión, comportamiento operativo del alimentadororquestación de alimentadores de baja latencia, análisis de congestión, priorización adaptativa de aceptación
Conjunto de datos LV de 236 busesConjunto de datos de distribución de baja tensión a gran escala236 busesTopología del bus, carga del alimentador, sensibilidad de voltaje, penetración renovable, dinámica de congestiónValidación de escalabilidad, evaluación de coordinación descentralizada, análisis de orquestación a gran escala

Tabla 1: Características del conjunto de datos. Descripción de los conjuntos de datos, atributos operativos y sus propósitos dentro del marco de orquestación de bajo voltaje propuesto.

2. Preprocesamiento de datos

Los conjuntos de datos adquiridos se preprocesaron para mejorar la consistencia, la alineación temporal y la estabilidad del aprendizaje por refuerzo. Se filtraron entradas faltantes, mediciones erróneas, registros duplicados y datos inconsistentes del alimentador mediante procedimientos estadísticos de preprocesamiento. Este paso se utilizó para mantener la consistencia entre los datos de operación del alimentador, los perfiles de generación renovable, las mediciones de voltaje y los datos del estado de congestión. Todas las variables operativas se normalizaron mediante la técnica min-máx para transformar las características de entrada a una escala común adecuada para el aprendizaje del agente. Las variables normalizadas incluyeron el voltaje del alimentador, la demanda de potencia activa, la generación renovable, el estado de congestión y la capacidad de aceptación del alimentador. La formulación matemática del procedimiento de preprocesamiento se proporciona en Archivo Suplementario 1 (Sección 1).

3. Modelado dinámico de redes de baja tensión

Después de la adquisición de datos y el preprocesamiento, se construyó un modelo dinámico de red de distribución para simular el comportamiento de un sistema de distribución con una alta proporción de generación renovable bajo condiciones variables de carga y generación. El modelo rastreó dinámicamente la topología del alimentador, el comportamiento de los recursos energéticos distribuidos, las regiones sensibles a la tensión y la propagación de congestión.

A diferencia de una representación estática de red, el modelo actualiza el comportamiento del alimentador según la intermitencia renovable, la demanda del consumidor y las condiciones de congestión. Se utilizaron los conjuntos de datos FeederBW y LV de 236 nodos para construir alimentadores interconectados en los que los nodos, transformadores, fuentes renovables distribuidas y cargas se representaron como nodos de red. Cada nodo del alimentador proporcionó información actualizada sobre la magnitud de voltaje, demanda de potencia activa, generación renovable, estado de carga del alimentador y estado de congestión. Estas variables fueron utilizadas por los agentes inteligentes para monitorear el comportamiento del alimentador y tomar decisiones descentralizadas de coordinación. El modelo de red también permitió la identificación de regiones sensibles y la priorización de la aceptación de alimentadores mediante un análisis continuo de sensibilidad.

La red de distribución de BT se representó como una red basada en grafos que contiene estaciones de buses, líneas alimentadoras, transformadores, fuentes renovables y nodos de carga para consumidores. En el Archivo Suplementario 1 (Sección 2) se proporcionan las derivaciones matemáticas detalladas del modelo de red. El estado dinámico de la red y el índice de congestión se monitorearon continuamente. El índice de congestión se normalizó al rango [0,1], y se inició la orquestación colaborativa de aceptación de alimentadores cuando el índice de congestión superó 0,80.

4. Inicialización del entorno multiagente

Después de haber construido el modelo dinámico de la red de BT, se inicializó el entorno multiagente para apoyar la aceptación descentralizada de alimentadores. Se asignaron agentes inteligentes a los segmentos de alimentadores, puntos de conexión de recursos energéticos distribuidos, ubicaciones de transformadores y nodos propensos a congestión dentro de la red de BT.

Cada agente actuó como una entidad independiente de toma de decisiones que supervisó la operación del alimentador local, intercambió información con los agentes vecinos y ejecutó acciones de orquestación adaptativa. A los agentes se les asignaron nodos clave del alimentador según la sensibilidad de voltaje, la penetración de energías renovables, el nivel de congestión y la importancia del alimentador. La red de baja tensión se configuró como un entorno basado en agentes en el cual los agentes monitorearon continuamente el voltaje del alimentador, la demanda de potencia activa, la variación de la generación renovable, el estado de congestión y la capacidad de aceptación del alimentador. La formulación matemática del entorno multiagente se proporciona en Archivo Suplementario 1 (Sección 3).

5. Aprendizaje del agente impulsado por refuerzo

Tras la inicialización del entorno multiagente, se implementó un aprendizaje basado en refuerzo para permitir que los agentes aprendieran políticas de orquestación de alimentadores mediante la interacción con condiciones operativas variables del sistema de baja tensión. Durante cada interacción, un agente observaba el estado actual del alimentador, seleccionaba una acción de orquestación y recibía una recompensa o penalización. El proceso de aprendizaje descentralizado permitió a los agentes adaptarse a la incertidumbre en la generación renovable, a las condiciones cambiantes de congestión, a las variaciones de voltaje y a los cambios en la capacidad de aceptación del alimentador. Cada agente seleccionaba una acción de orquestación de acuerdo con su política aprendida. Las derivaciones matemáticas asociadas se proporcionan en Archivo Suplementario 1 (Sección 4).

Se desplegó un total de 64 agentes inteligentes. Según la topología del alimentador, el nivel de penetración de energías renovables, la sensibilidad de voltaje y la gravedad de la congestión, cada agente se asignó a un segmento de alimentador, un sitio de transformador, un punto de conexión de recursos energéticos distribuidos o un nodo de red sensible a la congestión. Manteniendo una complejidad computacional razonable, el despliegue descentralizado permitió un monitoreo cooperativo y una aceptación adaptativa del alimentador en toda la red de distribución de baja tensión de 236 nodos. Cada agente observó un vector de estado de cinco dimensiones compuesto por la magnitud de voltaje, la demanda de carga del alimentador, la generación renovable, el estado de congestión y la capacidad de aceptación del alimentador. El espacio de acciones consistió en cinco acciones de orquestación: priorización de la aceptación del alimentador, mitigación de la congestión, coordinación de renovables, equilibrio de carga y control de voltaje. La toma de decisiones cooperativa se apoyó mediante una topología de comunicación vecinal descentralizada en la que cada agente intercambió índices de sensibilidad e información operativa local únicamente con los agentes de alimentadores vecinos.

Se implementó un método de aprendizaje por refuerzo multiagente basado en Q-learning utilizando una red neuronal completamente conectada con dos capas ocultas que contienen 128 y 64 neuronas. Se aplicó la activación de unidad lineal rectificada en las capas ocultas. Los parámetros de la red se optimizaron utilizando el optimizador Adam con una tasa de aprendizaje de 0,001 y un factor de descuento de 0,99. Se utilizó un tamaño de mini-lote de 64, y el búfer de reproducción de experiencias tenía una capacidad de 100 000 transiciones. Se consideró que el entrenamiento había convergido cuando el promedio móvil de la recompensa acumulada durante los últimos 20 episodios cambió menos del 0,1% durante 10 ventanas de evaluación consecutivas. Si no se cumplía este criterio, el entrenamiento continuaba hasta alcanzar un máximo de 500 episodios. El flujo de trabajo del aprendizaje por refuerzo se muestra en la Figura 2.

Diagrama del proceso de aprendizaje por refuerzo; interacción agente-entorno, actualización de la política, bucle de recompensas.
Figura 2: Diagrama de flujo del aprendizaje del agente guiado por refuerzo. Diagrama de flujo que ilustra el proceso de aprendizaje del agente basado en refuerzo para la orquestación descentralizada de alimentadores y la optimización de decisiones. Haga clic aquí para ver una versión más grande de esta figura.

El proceso de aprendizaje comenzó con la inicialización del entorno de distribución de BT, los estados de los agentes y los parámetros de aprendizaje. Los agentes inteligentes se colocaron en regiones de alimentadores, ubicaciones de recursos energéticos distribuidos y buses propensos a congestión. Luego se definieron el espacio de observación, la tasa de aprendizaje, la estrategia de exploración, los factores de recompensa y las funciones de política. En cada paso de interacción, cada agente observaba el estado actual de su región de alimentador asignada. El estado consistía en la magnitud del voltaje del nodo, la demanda de carga del alimentador, las características de generación renovable, el nivel de congestión y la capacidad de aceptación del alimentador. Estas observaciones conformaban el estado ambiental utilizado para la toma de decisiones de orquestación. Cada agente seleccionaba una acción de acuerdo con su política de aprendizaje por refuerzo. Las acciones disponibles incluían la priorización de aceptación del alimentador, la gestión de congestión, la coordinación de energía renovable, el equilibrio de carga y la gestión de voltaje. La acción seleccionada se aplicaba al entorno dinámico de BT, tras lo cual se actualizaba el estado del alimentador.

Se calculó una recompensa después de cada acción. Se asignó una recompensa positiva cuando la acción seleccionada mejoró la aceptación del alimentador, evitó la propagación de congestión, mantuvo el cumplimiento del voltaje o mejoró la estabilidad de la red. Se aplicó una penalización cuando la acción provocó, o no logró prevenir, sobrecarga del alimentador, violaciones de voltaje o retrasos en la orquestación. La recompensa calculada se utilizó para actualizar la función de valor y la política de decisión del agente mediante optimización por refuerzo. La secuencia de observación, selección de acción, transición del entorno, cálculo de recompensa y actualización de la política se repitió hasta que se cumplió el criterio de detención.

6. Evaluación de la sensibilidad al voltaje y a la congestión

Tras el aprendizaje basado en refuerzo, se evaluaron las sensibilidades al voltaje y a la congestión para identificar regiones vulnerables del alimentador y apoyar decisiones dinámicas de aceptación del alimentador bajo incertidumbre de energía renovable.

En cada intervalo de operación, se determinaron los efectos de los cambios en la potencia de alimentación, la generación renovable y la demanda de carga sobre el voltaje del nodo y la congestión de la red. Los índices de sensibilidad al voltaje y a la congestión se recalcularon en cada intervalo de operación simulado, en lugar de derivarse únicamente de condiciones estáticas de la red. Los índices de sensibilidad para cada nodo del alimentador se actualizaron según las condiciones actuales de la red, la variación de la generación renovable y el estado de carga del alimentador. Los valores resultantes se utilizaron para clasificar los nodos del alimentador según la aceptación del alimentador, la gestión de la congestión y las acciones de control de voltaje.

El índice de sensibilidad al voltaje cuantificó el cambio en el voltaje del nodo resultante de una variación en el flujo de potencia activa. Después de calcular los índices de sensibilidad al voltaje y a la congestión, se combinaron en una puntuación compuesta de sensibilidad para la priorización adaptativa de la aceptación del alimentador. El método de puntuación compuesta se describe en Archivo Suplementario 1 (Sección 5). A los nodos del alimentador con puntuaciones de sensibilidad más altas se les asignaron prioridades más altas de orquestación durante las operaciones de alivio de congestión, corrección de aceptación del alimentador y regulación de voltaje. Las puntuaciones de sensibilidad se recalculaban en cada intervalo de operación y se compartían con agentes vecinos a través del entorno colaborativo de comunicación.

7. Orquestación colaborativa de la aceptación y optimización adaptativa de decisiones en cada intervalo operativo simulado

Tras una evaluación de sensibilidad, se realizó una orquestación colaborativa de aceptación para permitir que agentes descentralizados tomaran decisiones coordinadas sobre la aceptación de alimentadores bajo incertidumbre de fuentes renovables y condiciones dinámicas de congestión. Los agentes intercambiaron estados locales de los alimentadores, índices de sensibilidad, alertas de congestión y prioridades operativas. Cada agente evaluó de forma independiente la condición de su alimentador local mientras coordinaba con agentes vecinos para apoyar la estabilidad general de la red.

La aceptación de alimentadores se priorizó según la sensibilidad al voltaje, la gravedad de la congestión, la variabilidad de la generación renovable y la capacidad disponible del alimentador. Las observaciones locales con sensibilidad espacial se agregaron entre los agentes, y se generaron acciones coordinadas de aceptación de alimentadores. La formulación matemática del proceso de orquestación colaborativa se proporciona en Archivo Suplementario 1 (Sección 6). El entorno dinámico de la red de baja tensión se implementó con agentes colaborativos ubicados en regiones de alimentadores, puntos de integración de energía renovable y barras propensas a congestión, como se describe en Archivo Suplementario 1 (Algoritmo 1). En cada intervalo de operación, cada agente observó los parámetros locales del alimentador, incluyendo la magnitud de voltaje, la variación de la generación renovable, la carga del alimentador, el nivel de congestión y la capacidad de aceptación del alimentador.

Luego se calcularon los índices de sensibilidad al voltaje y de sensibilidad a la congestión para identificar las regiones alimentadoras susceptibles a inestabilidad de voltaje o propagación de congestión. Estos índices se combinaron en una puntuación general de sensibilidad del alimentador que determinó la aceptación del alimentador y la prioridad de orquestación. Se intercambió información sobre el estado local, niveles de congestión, indicadores de inestabilidad de voltaje y prioridades de aceptación entre agentes vecinos. Basándose en las observaciones locales y la información compartida, cada agente seleccionó e implementó una acción de orquestación adaptativa. Tras cada acción, se obtuvo una retroalimentación de refuerzo del entorno dinámico de la red de baja tensión según la estabilidad del alimentador, la reducción de congestión, el cumplimiento del voltaje y la eficiencia de aceptación del alimentador. Esta retroalimentación se utilizó para actualizar la política de cada agente mediante una optimización basada en refuerzo. La función objetivo global de orquestación proporcionó simultáneamente retroalimentación coordinada para la optimización adaptativa en toda la población de agentes. Las actualizaciones de la política continuaron hasta que las políticas de los agentes convergieron hacia una estrategia óptima de orquestación descentralizada.

8. Validación a gran escala

La estrategia de orquestación dinámica fue validada utilizando el conjunto de datos FeederBW y el conjunto de datos de la red de distribución de baja tensión de 236 nodos, bajo escenarios operativos con alta penetración de energía renovable. La validación evaluó la capacidad del marco de orquestación descentralizada para gestionar la aceptación dinámica de alimentadores, la intermitencia de las energías renovables, la propagación de congestión y la inestabilidad de voltaje en sistemas interconectados de distribución en baja tensión. Los escenarios operativos evaluados incluyeron alta penetración de energías renovables, demanda de carga cambiante, propagación dinámica de congestión, condiciones sensibles al voltaje y capacidad variable de aceptación de alimentadores.

El rendimiento del marco se evaluó utilizando la tasa de aceptación del alimentador, el índice de cumplimiento de voltaje, la tasa de reducción de congestión, la latencia de orquestación, la velocidad de convergencia, la eficiencia de coordinación descentralizada y la capacidad de integración de energías renovables. Estas métricas se utilizaron para evaluar la escalabilidad, robustez, adaptabilidad y rendimiento de coordinación. El marco propuesto se comparó con enfoques tradicionales centralizados de orquestación de alimentadores bajo las mismas configuraciones de red. Se aplicaron a los métodos de comparación conjuntos de datos equivalentes, escenarios operativos, condiciones de evaluación y medidas de rendimiento.

Tabla 2 resume los conjuntos de datos, condiciones operativas, entornos de orquestación y variables de rendimiento utilizados para la validación experimental. El conjunto de datos FeederBW se utilizó para evaluar la dinámica operativa del alimentador, la intermitencia de las energías renovables, el desarrollo de congestión, la variación de la carga residencial y las fluctuaciones de voltaje bajo condiciones de alimentador de baja tensión. El conjunto de datos de 236 nodos de baja tensión se utilizó para evaluar la orquestación descentralizada en una red interconectada más grande. La arquitectura fue validada bajo condiciones variables de generación renovable, demanda de carga, voltaje y congestión. La coordinación descentralizada y la optimización de políticas basada en aprendizaje por refuerzo se evaluaron conjuntamente entre los agentes inteligentes.

Se utilizaron la tasa de aceptación de alimentadores, el índice de cumplimiento de voltaje, la tasa de reducción de congestión, la velocidad de convergencia y la latencia de orquestación para cuantificar el rendimiento bajo condiciones operativas dinámicas en sistemas de energía renovable.

Parámetro ExperimentalConjunto de Datos FeederBWConjunto de Datos 236-bus LVPropósito de Validación
Tipo de RedRed de Alimentadores de Baja TensiónRed de Distribución LV a Gran EscalaEvaluación de orquestación dinámica
Número de Nodos/BarrajesMúltiples nodos de alimentador236 barrajesAnálisis de escalabilidad
Integración de Energías RenovablesFuentes fotovoltaicas y renovables distribuidasBarrajes con alta penetración de renovablesValidación de incertidumbre renovable
Comportamiento de la Demanda de CargaPerfiles dinámicos de carga residencialVariaciones de carga en alimentadores a gran escalaOrquestación adaptativa de carga
Escenarios de CongestiónEstados de sobrecarga y congestión del alimentadorPropagación de congestión en múltiples barrajesAnálisis de mitigación de congestión
Condiciones de VoltajePerfiles de fluctuación de voltajeCondiciones de barrajes sensibles al voltajeEvaluación de cumplimiento de voltaje
Agentes InteligentesAgentes distribuidos de alimentadorAgentes colaborativos a gran escalaAnálisis de coordinación descentralizada
Entorno de AprendizajeOrquestación basada en refuerzoAprendizaje adaptativo multiagenteValidación de optimización de políticas
Condiciones de SimulaciónVariabilidad dinámica de fuentes renovablesOperación dinámica a gran escalaPruebas de orquestación de baja latencia
Métricas de RendimientoTasa de aceptación, reducción de congestiónCumplimiento de voltaje, velocidad de convergenciaRendimiento general de la orquestación

Tabla 2: Validación experimental a gran escala. Configuraciones experimentales utilizadas para evaluar la escalabilidad, la incertidumbre de la energía renovable y la coordinación descentralizada.

Resultados

Todos los experimentos se realizaron cinco veces utilizando diferentes semillas aleatorias para reducir la influencia del aprendizaje estocástico. Se calcularon los valores medios a partir de las cinco ejecuciones. Se utilizaron los mismos conjuntos de datos, parámetros de simulación, hiperparámetros, criterios de detención y procedimientos de evaluación para todos los métodos. Se emplearon como métodos de comparación el Control Centralizado de Voltaje (CVC)33, el Control Convencional Multiagente (CMAC)21, la Regulación de Voltaje Basada en Aprendizaje por Refuerzo (RLVR)20, la Coordinación de Recursos Energéticos Distribuidos (DERC)26 y la Gestión de Congestión Basada en Sensibilidad (SBCM)34.

Utilizando un análisis de varianza de un solo factor (ANOVA), se realizaron comparaciones estadísticas entre el marco propuesto y las técnicas básicas (CVC, CMAC, RLVR, DERC y SBCM) de forma independiente para cada métrica de evaluación. Se empleó la prueba post hoc de diferencia significativa honesta de Tukey (HSD) para comparaciones por pares cuando el ANOVA reveló diferencias estadísticamente significativas. El umbral de significancia estadística se estableció en p < 0,001. Todos los análisis estadísticos se realizaron mediante un análisis de varianza de un solo factor, seguido de una prueba post hoc de diferencia significativa cuando correspondía. El ANOVA de un solo factor se llevó a cabo utilizando el módulo statsmodels.stats.anova. Para la prueba de significancia estadística se utilizaron los valores de rendimiento finales convergentes obtenidos de cinco ejecuciones de simulación independientes para cada enfoque. El propósito de los episodios intermedios de entrenamiento fue visualizar el proceso de aprendizaje; no se evaluaron en cuanto a significancia estadística.

Adquisición de datos

Los conjuntos de datos FeederBW y 236-bus de distribución de baja tensión (LV) respaldaron la evaluación del marco propuesto bajo condiciones operativas complementarias. El conjunto de datos FeederBW proporcionó información temporal de alimentadores, incluyendo voltaje, generación distribuida renovable, demanda de carga, condiciones de congestión y comportamiento de aceptación del alimentador. Se utilizó para evaluar la operación dinámica del alimentador, la intermitencia renovable, la variación de la carga residencial, la propagación de la congestión y las fluctuaciones de voltaje.

El conjunto de datos de distribución de baja tensión de 236 nodos contenía 236 nodos interconectados e incluía topologías de alimentadores, regiones sensibles a la tensión, condiciones de penetración de energías renovables, estados de flujo de potencia y escenarios de propagación de congestión. Se utilizó para evaluar la coordinación descentralizada, la orquestación adaptativa y la escalabilidad en una red de distribución interconectada más amplia. Tabla 3 y Tabla 4 resumen las condiciones de validación experimental y el entorno de simulación.

Parámetro de validaciónDescripción
Conjuntos de datos utilizadosConjunto de datos FeederBW y conjunto de datos de baja tensión de 236 nodos
Entorno de redSistema de distribución dinámico de baja tensión con alta penetración de energías renovables
Fuentes renovablesGeneradores renovables distribuidos fotovoltaicos (PV)
Marco de aprendizajeAprendizaje por refuerzo multiagente (MARL)
Estrategia de coordinaciónOrquestación descentralizada colaborativa
Escenarios operativosIntermitencia renovable, fluctuación de carga, propagación de congestión
Número de agentes inteligentes64 agentes colaborativos distribuidos a nivel de alimentador
Objetivo de validaciónOptimización adaptativa de aceptación del alimentador
Proceso de evaluaciónOrquestación en tiempo real y coordinación sensible a la sensibilidad
Análisis comparativoComparado con métodos convencionales de coordinación centralizada

Tabla 3: Parámetros de validación ambiental. Parámetros de validación utilizados para evaluar la orquestación adaptativa bajo condiciones dinámicas de funcionamiento a bajo voltaje.

Componente de simulaciónConfiguración
Entorno del procesadorSistema de procesamiento multi-núcleo de alto rendimiento
Marco de programaciónPython 3.11.9
Marco de aprendizajeAprendizaje por refuerzo multiagente (MARL)
Algoritmo de aprendizajeAprendizaje por refuerzo multiagente basado en Q-learning
Arquitectura de red neuronalRed neuronal completamente conectada con dos capas ocultas (128 y 64 neuronas, activación ReLU)
OptimizadorOptimizador Adam
Tasa de aprendizaje (α)0.001
Factor de descuento (γ)0.99
Mecanismo de reproducciónMemoria de experiencia (capacidad: 100.000 transiciones)
Tamaño del mini-lote64
Política de exploraciónExploración ε-greedy (ε decae de 1,0 a 0,01)
Episodios de entrenamiento500
Críterio de detenciónAlcance del número máximo de episodios de entrenamiento o convergencia de la recompensa acumulada
Modelado de redSimulación dinámica de red de alimentadores de baja tensión
Simulación de energías renovablesPerfiles variables de generación renovable
Coordinación de agentesComunicación colaborativa distribuida
Procesamiento de datosProcesamiento en tiempo real sincronizado del estado del alimentador
Método de optimizaciónAprendizaje adaptativo de políticas basado en refuerzo
Plataforma experimentalSimulación a gran escala utilizando el conjunto de datos FeederBW y el conjunto de datos de red de distribución de baja tensión de 236 nodos
Monitoreo de rendimientoTasa de aceptación del alimentador (FAR), Índice de cumplimiento de voltaje (VCI), Tasa de reducción de congestión (CRR), Latencia de orquestación (OL), Velocidad de convergencia (CS) y Eficiencia de coordinación descentralizada (DCE)
Peso de recompensa (β)0,3
Peso de recompensa (δ)0,25
Peso objetivo (ω₁)0,30 (Aceptación del alimentador)
Peso objetivo (ω₂)0,25 (Reducción de congestión)
Peso objetivo (ω₃)0,25 (Cumplimiento de voltaje)
Peso objetivo (ω₄)0,20 (Latencia de orquestación)
Tasa de aprendizaje de la política (η)0,001
Parámetro de regularización / equilibrio (λ)0,1

Tabla 4: Entorno de simulación. Configuraciones de simulación utilizadas para experimentos de orquestación de alimentadores basados en refuerzo.

Preprocesamiento de datos

Los datos sincronizados y normalizados permitieron una comparación coherente entre el marco propuesto y los métodos de referencia. En todas las evaluaciones se utilizaron los mismos estados preprocesados del alimentador, perfiles de generación renovable, condiciones de demanda de carga, condiciones de voltaje y escenarios de congestión. Esta estructura común de entradas redujo las diferencias provocadas por la preparación del conjunto de datos y permitió asociar las diferencias de rendimiento observadas con los métodos de orquestación evaluados.

Modelado dinámico de redes de baja tensión

El modelo dinámico de red de BT representó la generación renovable cambiante, la demanda del consumidor, las condiciones de voltaje, la carga del alimentador y la propagación de congestión. Bajo estas condiciones, el marco propuesto mantuvo la aceptación del alimentador mientras respondía a estados operativos sensibles al voltaje y a la congestión. El modelo permitió la evaluación bajo generación renovable fluctuante, cargas variables del consumidor y condiciones de red propensas a congestión. En todas estas condiciones, los agentes colaborativos realizaron la priorización de alimentadores, la coordinación dependiente del voltaje, la mitigación de congestión y la integración de energías renovables sin control centralizado.

Inicialización del entorno multiagente

La disposición descentralizada del agente permitió la observación local y la toma coordinada de decisiones en las regiones alimentadoras y las intersecciones de la red. Los agentes intercambiaron información sobre el estado de los alimentadores y medidas de sensibilidad con los agentes vecinos, mientras seleccionaban de forma independiente acciones de orquestación. El comportamiento coordinado observado mostró que la configuración distribuida apoyó la priorización de alimentadores, la coordinación de carga, el manejo de voltaje y la respuesta ante congestión. La configuración descentralizada también redujo la dependencia de un único controlador centralizado y permitió una operación coordinada en toda la red más amplia de 236 nodos.

Aprendizaje de agentes impulsado por refuerzo

La política impulsada por refuerzo mejoró a lo largo del período de entrenamiento en cuanto a aceptación de alimentadores, cumplimiento de voltaje, reducción de congestión, latencia de orquestación y velocidad de convergencia. Figura 3 compara la Tasa de Aceptación de Alimentadores (FAR) del marco propuesto con CVC, CMAC, RLVR, DERC y SBCM. CVC produjo el FAR más bajo, que aumentó del 62 % al 70 %. CMAC y DERC alcanzaron valores máximos de FAR del 75 % y 78 %, respectivamente. RLVR y SBCM alcanzaron el 83 % y el 81 %, respectivamente. El marco propuesto aumentó el FAR del 72 % durante la etapa inicial de entrenamiento al 97 % durante la etapa posterior. Este resultado mostró que el proceso colaborativo de aprendizaje por refuerzo apoyó la aceptación adaptable de alimentadores bajo incertidumbre renovable y condiciones operativas cambiantes en baja tensión.

Gráfico de la tasa de aceptación del alimentador frente a las iteraciones de entrenamiento; comparación de seis métodos, análisis estadístico.
Figura 3: Tasa de Aceptación del Alimentador (FAR). Comparación de la FAR entre el marco propuesto y los métodos de coordinación de alimentadores de referencia. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación. La significancia estadística se evaluó con p < 0,001, con intervalos de confianza del 95 %. Acrónimos: FAR, Tasa de Aceptación del Alimentador; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Multiagente; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4 presenta el Índice de Cumplimiento de Voltaje (VCI). CVC aumentó del 70 % al 77 %, mientras que CMAC y DERC alcanzaron aproximadamente el 81 % y el 84 %, respectivamente. RLVR y SBCM alcanzaron el 88 % y el 86 %, respectivamente. El marco propuesto aumentó del 78 % durante el entrenamiento inicial a aproximadamente el 98 % en la convergencia. El VCI más alto indicó que el enfoque propuesto mantuvo el cumplimiento de voltaje de manera más efectiva que los métodos comparativos bajo generación renovable intermitente y demanda de carga cambiante.

Resultados del índice de cumplimiento de voltaje; gráfico de líneas; comparación de iteraciones de entrenamiento; métodos: CVC, CMAC.
Figura 4: Índice de Cumplimiento de Voltaje (VCI). Análisis comparativo del VCI bajo condiciones dinámicas de operación con bajo voltaje. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Abreviaturas: VCI, Índice de Cumplimiento de Voltaje; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Múltiples Agentes; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

El mapa de calor de VCI en la Figura 5 mostró la progresión del cumplimiento de voltaje a lo largo de los episodios de entrenamiento. El marco propuesto alcanzó valores entre el 95 % y el 98 % en las iteraciones posteriores. CVC se mantuvo entre el 70 % y el 77 %, mientras que RLVR y SBCM alcanzaron aproximadamente el 88 % y el 86 %, respectivamente. Por lo tanto, el mapa de calor mostró que el marco propuesto mantuvo el rendimiento más alto en cuanto al cumplimiento de voltaje durante las etapas finales del aprendizaje.

Mapa de calor que muestra el análisis del Índice de Cumplimiento de Voltaje, iteraciones de entrenamiento frente a métodos, porcentajes de IVC.
Figura 5: Mapa de calor del Índice de Cumplimiento de Voltaje (IVC). Mapa de calor que muestra el rendimiento del IVC a través de las iteraciones de entrenamiento y los métodos de coordinación de alimentadores. La escala de colores representa la magnitud del Índice de Cumplimiento de Voltaje, donde los colores más claros indican valores más bajos de IVC y los colores más oscuros indican valores más altos de IVC. Acrónimos: IVC, Índice de Cumplimiento de Voltaje; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Tabla 5 presenta la Tasa de Reducción de Congestión (CRR). CVC aumentó del 48 % al 63 %. CMAC y DERC alcanzaron aproximadamente el 73 % y el 75 %, respectivamente, mientras que RLVR alcanzó el 80 % y SBCM el 82 %. El marco propuesto aumentó del 64 % al inicio del entrenamiento a aproximadamente el 96 % tras la convergencia. En comparación con los valores finales de los métodos de referencia, el marco propuesto mejoró la CRR en aproximadamente un 33 % frente a CVC, un 23 % frente a CMAC, un 16 % frente a RLVR, un 21 % frente a DERC y un 14 % frente a SBCM. Estas observaciones mostraron que la política de orquestación colaborativa redujo la propagación de congestión de manera más efectiva que los métodos de comparación centralizados, multiagente convencionales, de regulación de voltaje, de recursos distribuidos y basados en sensibilidad. Figura 6 compara la Latencia de Orquestación (OL). La latencia de orquestación reportada corresponde al tiempo de ejecución real medido requerido por el algoritmo de orquestación propuesto durante la simulación en la plataforma de hardware indicada. No debe interpretarse como el tiempo de operación físico de una red de distribución implementada. El marco propuesto redujo la OL de 220 ms a 98 ms. En la convergencia, CVC, CMAC, RLVR, DERC y SBCM generaron latencias de 283 ms, 253 ms, 215 ms, 242 ms y 205 ms, respectivamente. Por lo tanto, el marco propuesto redujo la latencia en aproximadamente un 65 %, 61 %, 54 %, 59 % y 52 % respecto a CVC, CMAC, RLVR, DERC y SBCM, respectivamente. Una latencia menor indicó que la colaboración descentralizada permitió decisiones más rápidas en la orquestación de alimentadores.

Iteración de entrenamientoCVC (%)(Media ± DE)CMAC (%)(Media ± DE)RLVR (%)(Media ± DE)DERC (%)(Media ± DE)SBCM (%)(Media ± DE)Método propuesto (%)(Media ± DE)
148.0 ± 0.552.0 ± 0.556.0 ± 0.454.0 ± 0.558.0 ± 0.464.0 ± 0.3
250.0 ± 0.554.0 ± 0.559.0 ± 0.456.0 ± 0.561.0 ± 0.468.0 ± 0.3
352.0 ± 0.557.0 ± 0.462.0 ± 0.459.0 ± 0.564.0 ± 0.472.0 ± 0.3
454.0 ± 0.460.0 ± 0.465.0 ± 0.462.0 ± 0.467.0 ± 0.476.0 ± 0.2
556.0 ± 0.462.0 ± 0.468.0 ± 0.364.0 ± 0.470.0 ± 0.380.0 ± 0.2
658.0 ± 0.465.0 ± 0.471.0 ± 0.367.0 ± 0.473.0 ± 0.384.0 ± 0.2
760.0 ± 0.467.0 ± 0.474.0 ± 0.369.0 ± 0.376.0 ± 0.387.0 ± 0.2
861.0 ± 0.469.0 ± 0.376.0 ± 0.371.0 ± 0.378.0 ± 0.390.0 ± 0.2
962.0 ± 0.471.0 ± 0.378.0 ± 0.373.0 ± 0.380.0 ± 0.393.0 ± 0.2
1063.0 ± 0.473.0 ± 0.380.0 ± 0.375.0 ± 0.382.0 ± 0.396.0 ± 0.2

Tabla 5: Tasa de Reducción de Congestión (CRR): Media ± DE de la Tasa de Reducción de Congestión (CRR) obtenida de cinco ejecuciones independientes de simulación, comparando el marco propuesto con los métodos de orquestación básica basados en alimentadores. Acrónimos: CRR, Tasa de Reducción de Congestión; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad.

Gráfico de iteraciones de entrenamiento frente a latencia de orquestación; resultados de ANOVA, comparación de reducción de latencia.
Figura 6: Latencia de Orquestación (OL). Análisis comparativo de la latencia de orquestación durante la coordinación adaptativa descentralizada de alimentadores. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Acrónimos: OL, Latencia de Orquestación; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 7 presenta la Velocidad de Convergencia (CS). CVC aumentó del 42 % al 67 % después de 20 episodios de entrenamiento. CMAC y DERC alcanzaron aproximadamente el 74 % y el 79 %, respectivamente. RLVR alcanzó el 87 %, y SBCM alcanzó aproximadamente el 90 %. El marco propuesto aumentó del 58 % en el primer episodio al 98,5 % al converger, superando el 93 % en el décimo episodio. El marco propuesto mejoró el rendimiento final de convergencia en un 31,5 % frente a CVC, en un 24,5 % frente a CMAC, en un 11,5 % frente a RLVR, en un 19,5 % frente a DERC y en un 8,5 % frente a SBCM. Estos resultados mostraron que la política propuesta alcanzó un rendimiento estable de orquestación más rápidamente que los métodos de comparación.

Gráfica de velocidad de convergencia; diversos métodos; gráfico de líneas; episodios de entrenamiento; comparación de rendimiento.
Figura 7: Velocidad de Convergencia (CS). Curvas de convergencia que muestran la eficiencia del aprendizaje adaptativo y la rapidez con la que se alcanza la convergencia en la orquestación entre los métodos evaluados. Abreviaturas: CS, Velocidad de Convergencia; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Múltiples Agentes; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Orquestación colaborativa de aceptación y optimización adaptativa de decisiones de baja latencia

Figura 8 muestra la Eficiencia de Coordinación Descentralizada (DCE). CVC produjo la DCE más baja con un 68 %. CMAC alcanzó el 75 %, DERC alcanzó el 79 %, RLVR alcanzó el 84 % y SBCM alcanzó el 88 %. El marco propuesto logró una DCE del 97 %. El marco propuesto superó a CVC en 29 puntos porcentuales, a CMAC en 22 puntos porcentuales, a RLVR en 13 puntos porcentuales, a DERC en 18 puntos porcentuales y a SBCM en 9 puntos porcentuales. Este resultado mostró que el intercambio de información local, la coordinación entre agentes vecinos y la optimización de políticas descentralizadas favorecieron una coordinación más efectiva que los métodos comparativos.

Gráfico de barras de eficiencia de coordinación descentralizada; análisis ANOVA de los métodos CVC, CMAC, RLVR, DERC, SBCM.
Figura 8: Eficiencia de Coordinación Descentralizada (DCE). Análisis comparativo de la DCE durante la colaboración entre agentes inteligentes. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Abreviaturas: DCE, Eficiencia de Coordinación Descentralizada; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Multiagente; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9 y Tabla 6 muestran la Capacidad de Acomodación de Energías Renovables (RAC, por sus siglas en inglés). CVC aumentó del 52 % al 63 %. CMAC y DERC alcanzaron aproximadamente el 72 % y el 76 %, respectivamente. RLVR alcanzó aproximadamente el 83 %, y SBCM alcanzó el 86 %. El marco propuesto aumentó del 70 % al inicio del aprendizaje al 97 % en la convergencia. El marco propuesto superó a CVC en 34 puntos porcentuales, a CMAC en 25 puntos porcentuales, a RLVR en 14 puntos porcentuales, a DERC en 21 puntos porcentuales y a SBCM en 11 puntos porcentuales. Estos resultados mostraron que el enfoque de orquestación propuesto acomodó una proporción mayor de generación renovable manteniendo al mismo tiempo la operación del alimentador, el rendimiento de voltaje y la detección de congestión.

Gráfico que compara la capacidad de acomodación de energías renovables entre métodos a lo largo de las iteraciones de entrenamiento.
Figura 9: Capacidad de Acomodación de Energías Renovables (RAC). Análisis comparativo de la RAC en sistemas alimentadores con alta penetración de energías renovables. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Abreviaturas: RAC, Capacidad de Acomodación de Energías Renovables; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión ampliada de esta figura.

Iteración de entrenamientoCVC (%) (Media ± DE)CMAC (%) (Media ± DE)RLVR (%) (Media ± DE)DERC (%) (Media ± DE)SBCM (%) (Media ± DE)Método propuesto (%) (Media ± DE)
152.0 ± 0.558.0 ± 0.564.0 ± 0.460.0 ± 0.566.0 ± 0.470.0 ± 0.3
254.0 ± 0.560.0 ± 0.567.0 ± 0.462.0 ± 0.569.0 ± 0.474.0 ± 0.3
355.0 ± 0.462.0 ± 0.470.0 ± 0.464.0 ± 0.472.0 ± 0.478.0 ± 0.3
457.0 ± 0.464.0 ± 0.473.0 ± 0.366.0 ± 0.475.0 ± 0.382.0 ± 0.2
558.0 ± 0.466.0 ± 0.475.0 ± 0.368.0 ± 0.477.0 ± 0.386.0 ± 0.2
659.0 ± 0.467.0 ± 0.477.0 ± 0.370.0 ± 0.379.0 ± 0.389.0 ± 0.2
760.0 ± 0.468.0 ± 0.379.0 ± 0.372.0 ± 0.381.0 ± 0.391.0 ± 0.2
861.0 ± 0.469.0 ± 0.380.0 ± 0.373.0 ± 0.383.0 ± 0.393.0 ± 0.2
962.0 ± 0.470.0 ± 0.381.0 ± 0.374.0 ± 0.384.0 ± 0.395.0 ± 0.2
1063.0 ± 0.472.0 ± 0.383.0 ± 0.376.0 ± 0.386.0 ± 0.397.0 ± 0.2

Tabla 6: Capacidad de Acomodación de Energías Renovables (RAC): Media ± DE de la Capacidad de Acomodación de Energías Renovables (RAC) a partir de cinco ejecuciones independientes de simulación que comparan el marco propuesto con los métodos de orquestación de alimentadores de referencia. Acrónimos: RAC, Capacidad de Acomodación de Energías Renovables; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad.

Evaluación de la sensibilidad al voltaje y a la congestión

Figura 10 muestra la estabilidad de sensibilidad al voltaje (VSS). CVC aumentó del 60 % al 69 %. CMAC y DERC alcanzaron aproximadamente el 76 % y el 78 %, respectivamente, mientras que RLVR llegó al 84 %. El marco propuesto aumentó del 74 % durante el entrenamiento inicial al 98 % tras la convergencia. El marco propuesto superó a CVC en 29 puntos porcentuales, a CMAC en 22 puntos porcentuales, a RLVR en 14 puntos porcentuales, a DERC en 20 puntos porcentuales y a SBCM en 12 puntos porcentuales. Estos resultados mostraron que el marco sensible a la sensibilidad mantuvo un rendimiento más robusto en alimentadores sensibles al voltaje bajo intermitencia renovable, demanda de carga variable y congestión dinámica.

Gráfico de estabilidad de sensibilidad al voltaje, VSS% frente a iteraciones de entrenamiento, análisis ANOVA, comparación de métodos.
Figura 10: Estabilidad de la Sensibilidad al Voltaje (VSS). Análisis comparativo de la estabilidad de la sensibilidad al voltaje durante la orquestación adaptativa de alimentadores con conciencia de voltaje. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Acrónimos: VSS, Estabilidad de la Sensibilidad al Voltaje; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Múltiples Agentes; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 11 muestra el Índice de Sensibilidad a la Congestión (CSI). CVC aumentó del 52 % al 63 %. CMAC y DERC alcanzaron el 72 % y el 76 %, respectivamente. RLVR alcanzó aproximadamente el 83 %, y SBCM alcanzó aproximadamente el 86 %. El marco propuesto aumentó del 72 % durante el entrenamiento inicial a aproximadamente el 98 % al final del entrenamiento. El marco propuesto superó a CVC en aproximadamente 35 puntos porcentuales, a CMAC en 26 puntos porcentuales, a RLVR en 15 puntos porcentuales, a DERC en 22 puntos porcentuales y a SBCM en 12 puntos porcentuales. El mapa de calor mostró que el enfoque propuesto mantuvo el rendimiento más alto en sensibilidad a la congestión durante los episodios posteriores del entrenamiento.

Mapa de calor del Índice de Sensibilidad a la Congestión; métodos frente a iteraciones de entrenamiento; visualización de datos.
Figura 11: Mapa de calor del Índice de Sensibilidad a la Congestión (CSI). Mapa de calor que muestra el rendimiento de sensibilidad a la congestión a lo largo de las etapas de entrenamiento y los métodos de coordinación de alimentadores. La escala de colores representa la magnitud del Índice de Sensibilidad a la Congestión, donde los colores más claros indican valores más bajos de CSI y los colores más oscuros indican valores más altos de CSI. Acrónimos: CSI, Índice de Sensibilidad a la Congestión; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Validación a gran escala

Figura 12 y Tabla 7 muestran el Índice de Estabilidad del Alimentador (FSI). CVC produjo un FSI promedio del 64,7 %, mientras que CMAC y DERC produjeron promedios del 72,5 % y 76,0 %, respectivamente. RLVR produjo un FSI promedio del 81,5 %. El marco propuesto logró una estabilidad de voltaje del 97 %, control de congestión del 96 %, capacidad de integración de energías renovables del 95 %, eficiencia de equilibrio de carga del 94 %, eficiencia de coordinación del 98 % y velocidad de respuesta del 97 %. Estos valores componentes produjeron un FSI promedio de aproximadamente el 96,2 %. El marco propuesto mejoró el FSI promedio en aproximadamente 31,5 puntos porcentuales respecto a CVC, 23,7 puntos porcentuales respecto a CMAC, 14,7 puntos porcentuales respecto a RLVR, 20,2 puntos porcentuales respecto a DERC y 11,7 puntos porcentuales respecto a SBCM. Los valores equilibrados de los componentes mostraron que el marco mantuvo el rendimiento en estabilidad de voltaje, gestión de congestión, integración de energías renovables, equilibrio de carga, eficiencia de coordinación y velocidad de respuesta. En cada ejecución de simulación, se utilizó la media aritmética de los seis componentes de rendimiento—Estabilidad de Voltaje, Control de Congestión, Integración de Energías Renovables, Equilibrio de Carga, Eficiencia de Coordinación y Velocidad de Respuesta—para determinar el FSI general. Las cinco ejecuciones independientes de simulación se utilizaron para calcular la media y la desviación estándar indicadas.

Gráfico radial del Índice de Estabilidad del Alimentador (FSI); análisis de métricas de rendimiento de red.
Figura 12: Índice de Estabilidad del Alimentador (FSI). Comparación mediante gráfico radial del Índice de Estabilidad del Alimentador para el marco propuesto y los métodos de referencia en seis componentes de rendimiento: Estabilidad de Voltaje, Control de Congestión, Integración de Energías Renovables, Balanceo de Carga, Eficiencia de Coordinación y Velocidad de Respuesta. Valores más altos indican un mejor rendimiento en cada componente. Acrónimos: FSI, Índice de Estabilidad del Alimentador; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Parámetro de evaluaciónCVC (%) (Media ± DE)CMAC (%) (Media ± DE)RLVR (%) (Media ± DE)DERC (%) (Media ± DE)SBCM (%) (Media ± DE)Método propuesto (%) (Media ± DE)
Estabilidad de voltaje68.0 ± 0.674.0 ± 0.582.0 ± 0.477.0 ± 0.586.0 ± 0.397.0 ± 0.2
Control de congestión64.0 ± 0.671.0 ± 0.579.0 ± 0.474.0 ± 0.584.0 ± 0.396.0 ± 0.2
Integración de energías renovables62.0 ± 0.570.0 ± 0.581.0 ± 0.476.0 ± 0.483.0 ± 0.395.0 ± 0.2
Equilibrio de carga66.0 ± 0.573.0 ± 0.480.0 ± 0.475.0 ± 0.482.0 ± 0.394.0 ± 0.2
Eficiencia de coordinación65.0 ± 0.575.0 ± 0.483.0 ± 0.378.0 ± 0.487.0 ± 0.398.0 ± 0.2
Velocidad de respuesta63.0 ± 0.572.0 ± 0.484.0 ± 0.376.0 ± 0.485.0 ± 0.397.0 ± 0.2
Puntuación media FSI64.7 ± 0.572.5 ± 0.581.5 ± 0.476.0 ± 0.484.5 ± 0.396.2 ± 0.2

Tabla 7: Índice de Estabilidad del Alimentador (FSI): Media ± DE del Índice de Estabilidad del Alimentador (FSI) a partir de cinco ejecuciones independientes de simulación basadas en Estabilidad de Voltaje, Control de Congestión, Integración de Energías Renovables, Balanceo de Carga, Eficiencia de Coordinación y Velocidad de Respuesta. Acrónimos: FSI, Índice de Estabilidad del Alimentador; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad.

Figura 13 muestra la eficiencia de equilibrio de carga (LBE). CVC alcanzó una LBE general de aproximadamente 68 %, compuesta por 42 % de distribución equilibrada de carga, 18 % de estabilidad moderada de carga y 8 % de equilibrio dinámico adaptativo. CMAC y DERC alcanzaron valores generales de aproximadamente 80 % y 86 %, respectivamente. RLVR alcanzó aproximadamente 92 %, y SBCM alcanzó aproximadamente 96 %. El marco propuesto logró una LBE general de aproximadamente 98 %, compuesta por 72 % de distribución equilibrada de carga, 20 % de estabilidad moderada de carga y 6 % de equilibrio dinámico adaptativo. Este resultado mostró que el enfoque propuesto mantuvo el rendimiento de equilibrio de carga más alto entre todos los métodos evaluados.

Gráfico de barras apiladas de la eficiencia del equilibrio de carga por método: CVC, CMAC, RLVR, DERC, SBCM, Propuesto.
Figura 13: Eficiencia del equilibrio de carga (LBE). Comparación mediante barras apiladas de la eficiencia en el equilibrio de carga para el marco propuesto y los métodos de referencia. Cada barra apilada consta de tres componentes de rendimiento: Distribución equilibrada de la carga, Estabilidad bajo carga moderada, y Equilibrio dinámico adaptativo, cuyos valores combinados representan el LBE general para cada método. Valores totales más altos indican un mejor rendimiento en el equilibrio de carga. Abreviaturas: LBE, Eficiencia de Equilibrio de Carga; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 14 muestra la Eficiencia de Aprovechamiento Renovable (RUE, por sus siglas en inglés). CVC aumentó del 50 % al 61 %. CMAC y DERC alcanzaron el 70 % y el 75 %, respectivamente. RLVR alcanzó el 82 %, y SBCM alcanzó el 86 %. El marco propuesto aumentó del 72 % durante el entrenamiento inicial a aproximadamente el 98 % en la convergencia. El marco propuesto superó a CVC en aproximadamente 37 puntos porcentuales, a CMAC en 28 puntos porcentuales, a RLVR en 16 puntos porcentuales, a DERC en 23 puntos porcentuales y a SBCM en 12 puntos porcentuales. El mayor RUE mostró que la política de orquestación propuesta utilizó una proporción mayor de generación renovable disponible bajo condiciones cambiantes de carga y congestión.

Gráfico de eficiencia de utilización de energías renovables frente a iteraciones de entrenamiento; compara métodos como CVC, CMAC.
Figura 14: Eficiencia de Utilización de Energías Renovables (RUE). Análisis comparativo de la RUE durante la coordinación de alimentadores de bajo voltaje. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Abreviaturas: RUE, Eficiencia de Utilización de Energías Renovables; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Figura 15 y Tabla 8 muestran la Precisión Adaptativa de Decisión (ADA, por sus siglas en inglés). El marco propuesto aumentó del 78 % al 99 %. CVC, CMAC, RLVR, DERC y SBCM convergieron al 68 %, 76 %, 86 %, 79 % y 88 %, respectivamente. El marco propuesto superó a CVC en aproximadamente 31 puntos porcentuales, a CMAC en 23 puntos porcentuales, a RLVR en 13 puntos porcentuales, a DERC en 20 puntos porcentuales y a SBCM en 11 puntos porcentuales. La mayor ADA indicó que los agentes colaborativos seleccionaron decisiones de orquestación más precisas bajo condiciones operativas de baja tensión con alta presencia de energías renovables.

Gráfica de precisión de decisión adaptativa; épocas de entrenamiento vs métodos; resultados de ANOVA.
Figura 15: Precisión de Decisión Adaptativa (ADA). Análisis comparativo de la ADA para el marco de orquestación propuesto y los métodos de referencia. Los valores se presentan como media ± DE al comparar el marco propuesto con cada método de referencia en cinco ejecuciones independientes de simulación, con intervalos de confianza del 95 % y significancia estadística evaluada en p < 0,001. Abreviaturas: ADA, Precisión de Decisión Adaptativa; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad. Haga clic aquí para ver una versión más grande de esta figura.

Época de entrenamientoCVC (%) (Media ± DE)CMAC (%) (Media ± DE)RLVR (%) (Media ± DE)DERC (%) (Media ± DE)SBCM (%) (Media ± DE)Método propuesto (%) (Media ± DE)
158,0 ± 0,564,0 ± 0,570,0 ± 0,466,0 ± 0,572,0 ± 0,478,0 ± 0,3
260,0 ± 0,566,0 ± 0,573,0 ± 0,468,0 ± 0,575,0 ± 0,482,0 ± 0,3
361,0 ± 0,468,0 ± 0,476,0 ± 0,470,0 ± 0,478,0 ± 0,486,0 ± 0,2
462,0 ± 0,470,0 ± 0,478,0 ± 0,372,0 ± 0,480,0 ± 0,389,0 ± 0,2
563,0 ± 0,471,0 ± 0,480,0 ± 0,374,0 ± 0,482,0 ± 0,391,0 ± 0,2
664,0 ± 0,472,0 ± 0,482,0 ± 0,375,0 ± 0,384,0 ± 0,393,0 ± 0,2
765,0 ± 0,473,0 ± 0,383,0 ± 0,376,0 ± 0,385,0 ± 0,395,0 ± 0,2
866,0 ± 0,474,0 ± 0,384,0 ± 0,377,0 ± 0,386,0 ± 0,396,0 ± 0,2
967,0 ± 0,475,0 ± 0,385,0 ± 0,378,0 ± 0,387,0 ± 0,397,0 ± 0,2
1068,0 ± 0,476,0 ± 0,386,0 ± 0,379,0 ± 0,388,0 ± 0,399,0 ± 0,2

Tabla 8: Precisión de Decisión Adaptativa (ADA): Media ± DE de la Precisión de Decisión Adaptativa (ADA) a partir de cinco ejecuciones independientes de simulación que comparan el marco propuesto de orquestación inteligente de alimentadores con los métodos de referencia. Acrónimos: ADA, Precisión de Decisión Adaptativa; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad.

Tabla 9 presenta la mejora de la confiabilidad del sistema (SRI). CVC aumentó del 60 % al 69 %. CMAC alcanzó aproximadamente el 78 %, DERC aproximadamente el 81 %, RLVR aproximadamente el 86 % y SBCM aproximadamente el 88 %. El marco propuesto aumentó del 80 % durante el aprendizaje inicial a aproximadamente el 99 % en la convergencia. El marco propuesto superó a CVC en aproximadamente 30 puntos porcentuales, a CMAC en 21 puntos porcentuales, a RLVR en 13 puntos porcentuales, a DERC en 18 puntos porcentuales y a SBCM en 11 puntos porcentuales. La mayor SRI mostró que el marco propuesto mantuvo la continuidad del alimentador, la estabilidad de voltaje, el control de congestión y la integración adaptativa de energías renovables de manera más efectiva que los métodos de comparación.

Iteración de entrenamientoCVC (%) (Media ± DE)CMAC (%) (Media ± DE)RLVR (%) (Media ± DE)DERC (%) (Media ± DE)SBCM (%) (Media ± DE)Método propuesto (%) (Media ± DE)
160.0 ± 0.566.0 ± 0.572.0 ± 0.468.0 ± 0.575.0 ± 0.480.0 ± 0.3
261.0 ± 0.568.0 ± 0.574.0 ± 0.470.0 ± 0.577.0 ± 0.484.0 ± 0.3
362.0 ± 0.470.0 ± 0.476.0 ± 0.472.0 ± 0.479.0 ± 0.487.0 ± 0.2
463.0 ± 0.472.0 ± 0.478.0 ± 0.374.0 ± 0.481.0 ± 0.390.0 ± 0.2
564.0 ± 0.473.0 ± 0.480.0 ± 0.376.0 ± 0.483.0 ± 0.392.0 ± 0.2
665.0 ± 0.474.0 ± 0.482.0 ± 0.377.0 ± 0.384.0 ± 0.394.0 ± 0.2
766.0 ± 0.475.0 ± 0.383.0 ± 0.378.0 ± 0.385.0 ± 0.395.0 ± 0.2
867.0 ± 0.476.0 ± 0.384.0 ± 0.379.0 ± 0.386.0 ± 0.396.0 ± 0.2
968.0 ± 0.477.0 ± 0.385.0 ± 0.380.0 ± 0.387.0 ± 0.397.0 ± 0.2
1069.0 ± 0.478.0 ± 0.386.0 ± 0.381.0 ± 0.388.0 ± 0.399.0 ± 0.2

Tabla 9: Mejora de la Confiabilidad del Sistema (SRI): Media ± DE de la Mejora de la Confiabilidad del Sistema (SRI) a partir de cinco ejecuciones independientes de simulación en condiciones de distribución de baja tensión con alta penetración de energías renovables. Acrónimos: SRI, Mejora de la Confiabilidad del Sistema; CVC, Control Centralizado de Voltaje; CMAC, Control Convencional Basado en Agentes Múltiples; RLVR, Regulación de Voltaje Basada en Aprendizaje por Refuerzo; DERC, Coordinación de Recursos Energéticos Distribuidos; SBCM, Gestión de Congestión Basada en Sensibilidad.

El marco propuesto fue evaluado bajo diversas condiciones de generación renovable, demanda de carga, voltaje y congestión, utilizando los conjuntos de datos FeederBW y 236-bus LV. Se evaluaron la aceptación de alimentadores, el cumplimiento de voltaje, la reducción de congestión, la latencia de orquestación, la velocidad de convergencia, la coordinación descentralizada, la integración de energías renovables, la sensibilidad al voltaje, la sensibilidad a la congestión, la estabilidad del alimentador, el equilibrio de carga, la utilización de renovables, la precisión de las decisiones y la confiabilidad del sistema.

En todas estas mediciones, el marco propuesto produjo los valores finales más altos para FAR, VCI, CRR, CS, DCE, RAC, VSS, CSI, FSI, LBE, RUE, ADA y SRI, y el OL más bajo. Dado que los métodos de referencia se evaluaron con los mismos conjuntos de datos, escenarios operativos, entorno de simulación, criterios de detención y métricas de evaluación, estas comparaciones respaldaron la hipótesis de que el aprendizaje por refuerzo colaborativo con múltiples agentes, combinado con la evaluación sensible al voltaje y a la congestión, mejoró la aceptación adaptativa del alimentador en comparación con los métodos de comparación centralizados y distribuidos evaluados.

Los resultados mostraron que la Estrategia de Orquestación Dinámica mejoró la aceptación del alimentador, el cumplimiento de voltaje, la reducción de congestión, la integración de energías renovables, el equilibrio de carga, la coordinación descentralizada, la precisión de las decisiones y la confiabilidad del sistema, al tiempo que redujo la latencia de orquestación. El marco también convergió más rápidamente que los métodos de comparación. Bajo las condiciones de simulación evaluadas, estos hallazgos respaldaron la hipótesis propuesta de que el aprendizaje por refuerzo colaborativo, sensible al contexto y descentralizado podría mejorar la orquestación de alimentadores de baja tensión ante la incertidumbre en la generación renovable y las condiciones cambiantes de carga y congestión.

DISPONIBILIDAD DE LOS DATOS:

El conjunto de datos FeederBW está disponible públicamente en https://doi.org/10.5281/zenodo.17831177, y el conjunto de datos de la red de distribución de baja tensión de 236 barras está disponible públicamente en https://doi.org/10.5281/zenodo.8274780. La implementación en Python desarrollada para este estudio, junto con el entorno de simulación, los módulos de preprocesamiento, el entorno de aprendizaje por refuerzo multiagente, los scripts para el entrenamiento y evaluación del modelo, los archivos de configuración y los formatos de datos de entrada necesarios para reproducir la metodología propuesta, se han depositado en Zenodo y están disponibles públicamente en https://doi.org/10.5281/zenodo.21423239. El repositorio permite la reproducibilidad de la metodología y los experimentos descritos en este estudio.

Archivo suplementario 1. Derivaciones matemáticas, algoritmo y detalles de implementación de la Estrategia Dinámica de Orquestación propuesta. Este archivo suplementario proporciona las formulaciones matemáticas que respaldan cada etapa del marco propuesto, incluyendo el preprocesamiento de datos, modelado dinámico de redes de baja tensión, inicialización del entorno multiagente, aprendizaje de agentes impulsado por refuerzo, evaluación de sensibilidad a voltaje y congestión, orquestación colaborativa de aceptación de alimentadores y métricas de evaluación del desempeño. También incluye Algoritmo 1, que describe el procedimiento de orquestación colaborativa de aceptación de alimentadores, junto con las definiciones matemáticas de las métricas de evaluación utilizadas en este estudio.Haga clic aquí para descargar este archivo.

Discusión

Los resultados experimentales mostraron que la estrategia propuesta de Orquestación Dinámica mejoró la coordinación descentralizada de alimentadores, la integración de energías renovables, la estabilidad de voltaje, la gestión de congestión y la orquestación de baja latencia en comparación con el Control Centralizado de Voltaje (CVC)33, el Control Convencional Basado en Agentes Múltiples (CMAC)21, la Regulación de Voltaje Basada en Aprendizaje por Refuerzo (RLVR)20, la Coordinación de Recursos Energéticos Distribuidos (DERC)26 y la Gestión de Congestión Basada en Sensibilidad (SBCM)34. En todos los indicadores evaluados —Tasa de Aceptación de Alimentadores (FAR), Índice de Cumplimiento de Voltaje (VCI), Tasa de Reducción de Congestión (CRR), Eficiencia de Coordinación Descentralizada (DCE), Eficiencia de Utilización de Renovables (RUE), Precisión de Decisión Adaptativa (ADA) y Mejora de Confiabilidad del Sistema (SRI)—, el marco propuesto alcanzó un desempeño superior bajo las condiciones probadas. Los resultados obtenidos utilizando los conjuntos de datos FeederBW y 236-bus de baja tensión (LV) indicaron que combinar el aprendizaje por refuerzo multiagente colaborativo con la evaluación de sensibilidad al voltaje y a la congestión mejoró la eficiencia y velocidad de la orquestación adaptativa de alimentadores.

El análisis comparativo también mostró que los métodos de coordinación centralizados y basados en reglas presentaban respuestas de orquestación más lentas, menor capacidad de integración de energías renovables, menor eficiencia de coordinación adaptativa y escalabilidad más limitada bajo condiciones variables del alimentador33,34. Aunque RLVR y SBCM tuvieron un mejor desempeño que otros métodos de comparación debido a sus componentes de aprendizaje por refuerzo y gestión de congestión sensible a la sensibilidad, no proporcionaron un mecanismo de orquestación colaborativo y descentralizado para la aceptación del alimentador. Por el contrario, el marco propuesto combinó agentes inteligentes colaborativos, priorización de alimentadores sensible a la sensibilidad, optimización adaptativa de orquestación y aprendizaje descentralizado de políticas. Sus indicadores de convergencia más rápida y mayor estabilidad sugirieron que esta estructura combinada apoyó la operación del alimentador bajo condiciones variables de generación renovable, carga, voltaje y congestión.

La arquitectura de aprendizaje reforzado descentralizada con múltiples agentes distribuyó la toma de decisiones entre agentes de nivel de alimentador, en lugar de depender de un único controlador centralizado. A medida que aumentaba el tamaño de la red de distribución, los agentes individuales realizaban cálculos locales e intercambiaban únicamente la información de coordinación necesaria para los agentes vecinos. Esta disposición redujo los cuellos de botella computacionales centralizados y la sobrecarga de comunicación, y por lo tanto favoreció la escalabilidad35. Por consiguiente, el marco podría ser aplicable a redes más grandes con mayor penetración de energías renovables, segmentos adicionales de alimentadores y una complejidad operativa mayor. Sin embargo, una implementación a muy gran escala requeriría una mayor optimización de los recursos de computación distribuida y de los protocolos de comunicación.

El estudio también aportó un enfoque descentralizado basado en aprendizaje para la gestión de alimentadores de baja tensión. A diferencia de los métodos convencionales de control de voltaje y gestión de congestión, basados principalmente en reglas operativas estáticas o en optimización centralizada33, la estrategia propuesta integró la evaluación de sensibilidad al voltaje, la orquestación con conciencia de congestión, la optimización de políticas impulsada por refuerzo, la clasificación dinámica de aceptación de alimentadores y la comunicación entre agentes colaborativos. Esta integración amplió el uso del aprendizaje por refuerzo multiagente, desde la regulación de voltaje y la coordinación de recursos hasta la orquestación adaptativa de aceptación de alimentadores en redes de distribución de baja tensión con alta penetración de energías renovables.

El método propuesto podría apoyar la gestión de la aceptación de alimentadores para empresas eléctricas, operadores de redes inteligentes y sistemas de gestión de energías renovables. No obstante, deben abordarse varios desafíos antes de su implementación práctica. Los retrasos en la comunicación podrían afectar la velocidad del intercambio de información y la coordinación entre agentes distribuidos, especialmente en redes a gran escala. También se requerirán comunicaciones seguras y medidas de ciberseguridad para proteger las interacciones entre agentes y los datos operativos frente a accesos no autorizados y ciberataques. La integración con los Sistemas de Gestión de Distribución existentes exigirá interoperabilidad con los protocolos de comunicación de las empresas eléctricas, las arquitecturas de control de supervisión y los procedimientos operativos. Por lo tanto, la implementación práctica dependerá de estructuras de comunicación con baja latencia, transmisión segura de datos, interfaces estandarizadas y validación en campo36,37.

El estudio se vio limitado por su dependencia en los conjuntos de datos FeederBW y 236-bus LV, así como por la validación basada en simulaciones bajo condiciones operativas y de comunicación predefinidas. Estas configuraciones podrían no representar completamente la topología, las perturbaciones, las fallas de comunicación o los eventos ciberfísicos encontrados en redes reales de servicios públicos. La complejidad computacional también podría volverse más significativa bajo condiciones operativas de gran escala o con alta penetración de energías renovables. Por lo tanto, trabajos futuros deberían evaluar el marco utilizando conjuntos de datos adicionales a escala de servicios públicos, redes de distribución reales, plataformas de hardware en el lazo y pruebas piloto a escala real. Se centrarán en validar el marco propuesto mediante plataformas de hardware en el lazo, redes reales de servicios públicos y sistemas de distribución más grandes. Además, estudios futuros investigarán arquitecturas avanzadas de aprendizaje por refuerzo y estrategias mejoradas de coordinación distribuida para aumentar aún más la escalabilidad y la robustez operativa. En general, los resultados de la simulación mostraron que el aprendizaje por refuerzo colaborativo multiagente combinado con la evaluación de sensibilidad a voltaje y congestión podría mejorar la aceptación del alimentador, el cumplimiento de voltaje, la mitigación de congestión, la integración de energías renovables, la coordinación descentralizada, la convergencia, la latencia y la toma de decisiones adaptativa. Se requiere pruebas adicionales con datos reales de servicios públicos, retrasos de comunicación realistas, interrupciones ciberfísicas y condiciones de prueba en hardware en el lazo o en campo para confirmar la escalabilidad práctica y la confiabilidad operativa.

Divulgaciones

Los autores declaran que no tienen intereses en conflicto.

Agradecimientos

Esta investigación fue apoyada por la Oficina de Suministro de Energía de Guangzhou de la Compañía de Redes Eléctricas de Guangdong mediante el proyecto «Investigación sobre la Tecnología de Aceptación de Automatización de Equipos de Medición de Baja Tensión Basada en Automatización de Procesos» (Código del Proyecto: 030100KC24120100).

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datos de red de distribución de baja tensión 236-BusCanizes et al.DOI: 10.5281/zenodo.8274780Conjunto de datos de referencia público utilizado para el análisis de escalabilidad y la validación a gran escala del marco propuesto
Unidad central de procesamiento (CPU)Intel CorporationIntel Core i9-12900K (16 núcleos)Utilizada para la gestión de simulaciones y la ejecución del entorno
Módulo de análisis de sensibilidad a la congestiónMódulo desarrollado a medidaZenodo DOI: 10.5281/zenodo.21423239Realiza el cálculo en tiempo real de la sensibilidad a la congestión y la priorización de alimentadores
Kit de herramientas CUDANVIDIA CorporationCUDA 12.1Plataforma de computación GPU utilizada para acelerar el entrenamiento del modelo PyTorch
Biblioteca cuDNNNVIDIA CorporationcuDNN 9.3.0Biblioteca de aceleración de redes neuronales profundas utilizada junto con CUDA
Simulador dinámico personalizado de red de baja tensiónMódulo desarrollado a medidaVersión 1.0Plataforma de simulación desarrollada por los autores e implementada en Python y PyTorch para experimentos de orquestación dinámica de alimentadores. Los detalles de implementación se proporcionan en las secciones Métodos y Disponibilidad de datos.
Biblioteca de procesamiento de datosEquipo de desarrollo de pandaspandas 2.2.2Utilizada para el preprocesamiento, extracción de características, normalización y gestión de datos de series temporales
Entorno de aprendizaje profundoPyTorch FoundationPyTorch 2.3.1Utilizado para la implementación del modelo de aprendizaje por refuerzo multiagente (MARL), entrenamiento de redes neuronales y optimización de políticas
Módulo de comunicación distribuida entre agentesMarco desarrollado a medidaZenodo DOI: 10.5281/zenodo.21423239Permite la comunicación descentralizada y el intercambio colaborativo de políticas entre agentes inteligentes
Conjunto de datos FeederBWTreutlein et al.DOI: 10.5281/zenodo.17831177Conjunto de datos público que contiene mediciones reales de alimentadores de baja tensión, generación renovable y perfiles operativos
Unidad de procesamiento gráfico (GPU)NVIDIA CorporationGeForce RTX 3090, 24 GB GDDR6XAcelerador de hardware utilizado para el entrenamiento de redes neuronales y el cálculo paralelo
Entorno de aprendizaje por refuerzo multiagenteFarama FoundationGym 0.26.2Entorno de aprendizaje por refuerzo personalizado para la interacción y el entrenamiento colaborativo de agentes inteligentes
Biblioteca de cálculo numéricoDesarrolladores de NumPyNumPy 1.26.4Utilizada para cálculos numéricos, manipulación de tensores y operaciones matriciales
Sistema operativoCanonical Ltd.Ubuntu 22.04.5 LTS (64 bits)Sistema operativo utilizado para todas las simulaciones y experimentos de aprendizaje por refuerzo
Lenguaje de programación PythonPython Software FoundationPython 3.11.9Lenguaje de programación principal utilizado para la implementación de algoritmos, simulaciones y desarrollo de modelos
Memoria del sistemaLenovo64 GB de RAM DDR5Memoria del sistema instalada utilizada para simulaciones MARL a gran escala y procesamiento de datos.
Módulo de monitoreo de estabilidad de voltajeMódulo desarrollado a medidaZenodo DOI: 10.5281/zenodo.21423239Evalúa continuamente la estabilidad y conformidad del voltaje durante la orquestación de alimentadores

Referencias

  1. Ahmed F, et al. A multi-agent reinforcement learning framework for voltage-constrained incentive demand response in PV-rich low-voltage distribution systems. IEEE Access. 2026;14:45410–22.
  2. Lamsal D, Sreeram V, Mishra Y, Kumar DS. Smoothing control strategy of wind and photovoltaic output power fluctuation by considering the state of health of battery energy storage system. IET Renew Power Gener. 2019;13:578–86.
  3. Allahmoradi S, et al. Data-driven Volt/VAR optimization for modern distribution networks: A review. IEEE Access. 2024;12:71184–204.
  4. O'Connell N, Pinson P, Madsen H, O'Malley M. Benefits and challenges of electrical demand response: A critical review. Renew Sustain Energy Rev. 2014;39:686–99.
  5. Hossain MS, Madlool NA, Al-Fatlawi AW, El Haj Assad M. High penetration of solar photovoltaic structure on the grid system disruption: An overview of technology advancement. Sustainability. 2023;15:1174. https://doi.org/10.3390/su15021174
  6. Rahmouni A. Impact of static reactive power compensator (SVC) on the power grid. WSEAS Trans Electron. 2020;11:96–104.
  7. Chandran CV, et al. Application of demand response to improve voltage regulation with high DG penetration. Electr Power Syst Res. 2020;189:106722. https://doi.org/10.1016/j.epsr.2020.106722
  8. Wang Q, et al. A demand response strategy in high photovoltaic penetration power systems considering the thermal ramp rate limitation. IEEE Access. 2019;7:163814–22.
  9. Wang Z, et al. How to effectively implement an incentive-based residential electricity demand response policy? Experience from large-scale trials and matching questionnaires. Energy Policy. 2020;141:111450. https://doi.org/10.1016/j.enpol.2020.111450
  10. van Tilburg J, Siebert LC, Cremer JL. MARL-iDR: Multi-agent reinforcement learning for incentive-based residential demand response. arXiv. 2023. https://arxiv.org/abs/2304.04086
  11. Bahrami S, Chen YC, Wong VWS. Deep reinforcement learning for demand response in distribution networks. IEEE Trans Smart Grid. 2021;12:1496–506.
  12. Li J, et al. Model-free reinforcement learning economic dispatch algorithms for price-based residential demand response management system. IEEE Trans Ind Cyber-Phys Syst. 2023;1:123–35.
  13. Zheng S, et al. Incentive-based integrated demand response for multiple energy carriers under complex uncertainties and double coupling effects. Appl Energy. 2021;283:116254. https://doi.org/10.1016/j.apenergy.2020.116254
  14. Nainar K, Pillai JR, Bak-Jensen B. Incentive price-based demand response in active distribution grids. Appl Sci. 2020;11:1–17.
  15. Nguyen Duc T, et al. Impact of renewable energy integration on a novel method for pricing incentive payments of incentive-based demand response program. IET Gener Transm Distrib. 2022;16:1648–67.
  16. Pourramezan A, Samadi M. A novel approach for incorporating incentive-based and price-based demand response programs in long-term generation investment planning. Int J Electr Power Energy Syst. 2022;142:108315. https://doi.org/10.1016/j.ijepes.2022.108315
  17. Mathew A, Roy A, Mathew J. Intelligent residential energy management system using deep reinforcement learning. IEEE Syst J. 2020;14:5362–72.
  18. Khan DA, Arshad A, Lehtonen M, Mahmoud K. Combined DR pricing and voltage control using reinforcement learning based multi-agents and load forecasting. IEEE Access. 2022;10:130839-49.
  19. Zhang X, et al. An edge-cloud integrated solution for buildings demand response using reinforcement learning. IEEE Trans Smart Grid. 2021;12:420–31.
  20. Duan J, et al. Deep-reinforcement-learning-based autonomous voltage control for power grid operations. IEEE Trans Power Syst. 2020;35:814–7.
  21. Wang S, et al. A data-driven multi-agent autonomous voltage control framework using deep reinforcement learning. IEEE Trans Power Syst. 2020;35:4644–54.
  22. Turitsyn K, Sulc P, Backhaus S, Chertkov M. Options for control of reactive power by distributed photovoltaic generators. Proc IEEE. 2011;99:1063–73.
  23. Bedawy A, et al. Optimal voltage control strategy for voltage regulators in active unbalanced distribution systems using multi-agents. IEEE Trans Power Syst. 2020;35:1023–35.
  24. Bedawy A, Yorino N, Mahmoud K. Management of voltage regulators in unbalanced distribution networks using voltage/tap sensitivity analysis. Presented at: International Conference on Innovative Trends in Computer Engineering (ITCE); Aswan, Egypt; 2018. https://doi.org/10.1109/itce.2018.8316651
  25. Smith O, et al. The effect of renewable energy incorporation on power grid stability and resilience. Sci Adv. 2022;8:eabj6734. https://doi.org/10.1126/sciadv.abj6734
  26. Charbonnier F, Morstyn T, McCulloch MD. Scalable multi-agent reinforcement learning for distributed control of residential energy flexibility. Applied Energy. 2022;314:118825. doi:10.1016/j.apenergy.2022.118825
  27. Dugan J, Mohagheghi S, Kroposki B. Application of mobile energy storage for enhancing power grid resilience: A review. Energies. 2021;14:6476. https://doi.org/10.3390/en14206476
  28. Panossian N, et al. Challenges and opportunities of integrating electric vehicles in electricity distribution systems. Curr Sustain Renew Energy Rep. 2022;9:27–40.
  29. Guan Q, et al. Dynamic-aware deep reinforcement learning for heterogeneous fleet-based capacitated electric vehicle routing problems. Applied Energy. 2026;413:127757. https://doi.org/10.1016/j.apenergy.2026.127757
  30. Guan Q, et al. Heterogeneous attention-driven deep reinforcement learning for solving EVRPs with pickup-delivery and time windows. Applied Energy. 2026;407:127355. https://doi.org/10.1016/j.apenergy.2026.127355
  31. Treutlein M, et al. Real-world energy data of 200 feeders from low-voltage grids with metadata in Germany over two years (Version v1.0) [Data set]. Zenodo; 2025. https://doi.org/10.5281/zenodo.17831177
  32. Canizes B, Castro F, Silveira V, Vale Z. 236-Bus Low Voltage Distribution Network Data [Data set]. Zenodo; 2023. https://doi.org/10.5281/zenodo.8274780
  33. Xi, Haikuo & Chen, Can & Bai, Xuesong & Ma, Yuan & Ding, Jiachao & Chen, Qifang. (2024). Centralized and decentralized combined voltage control for distribution network with high penetration PV connected. Journal of Physics: Conference Series. 2771. 012040. 10.1088/1742-6596/2771/1/012040.
  34. Singh AK, Parida SK. Congestion management with distributed generation and its impact on electricity market. International Journal of Electrical Power & Energy Systems. 2013;48:39–47. doi:10.1016/j.ijepes.2012.11.025.
  35. Gooi HB, Wang T, Tang Y. Edge intelligence for smart grid: A survey on application potentials. CSEE Journal of Power and Energy Systems. 2023;9(5):1623–1640. https://doi.org/10.17775/CSEEJPES.2022.02210
  36. Molokomme DN, Onumanyi AJ, Abu-Mahfouz AM. Edge intelligence in smart grids: A survey on architectures, offloading models, cyber security measures, and challenges. Journal of Sensor and Actuator Networks. 2022;11(3):47. https://doi.org/10.3390/jsan11030047
  37. Chang Z, Liu S, Xiong X, Cai Z, Tu G. A survey of recent advances in edge-computing-powered artificial intelligence of things. IEEE Internet of Things Journal. 2021;8(18):13849–13875.

Reimpresiones y permisos

Etiquetas

Aprendizaje por Refuerzo MultiagenteGesti n de Congesti nSensibilidad de VoltajeIntegraci n de Energ as Renovables DistribuidasCoordinaci n DescentralizadaMonitoreo de AlimentadoresResiliencia Operativa