Artículo de investigación

Algoritmo de programación dinámica y optimización de recursos para actividades sindicales mediante la integración de Transformer y aprendizaje por refuerzo

38 visualizaciones

DOI:

10.3791/72544

28 de agosto de 2026

En este artículo

Resumen

Este artículo estudia un algoritmo dinámico de optimización de programación que integra Transformer y el aprendizaje por refuerzo PPO, centrándose en los frecuentes conflictos de recursos y los retrasos en la respuesta durante la programación de actividades sindicales.

Resumen

Para abordar el problema de la reducción de la eficiencia organizacional causada por frecuentes conflictos en la asignación de recursos y retrasos en las respuestas de programación al gestionar actividades sindicales, este artículo propone un algoritmo de programación dinámica que integra Transformer y PPO (Optimización de Política Próxima). En la implementación específica, primero se diseña una estructura unificada de modelado de escenarios de programación para convertir los estados de actividades, personal y recursos en entradas tensoriales, logrando así la integración de restricciones multidimensionales. A continuación, se utiliza el mecanismo de atención múltiple del Transformer para codificar la serie temporal de solicitudes históricas de actividades y el estado de los recursos, extraer características espacio-temporales multidimensionales y mejorar la percepción de riesgos de conflicto. Posteriormente, basándose en los resultados de codificación y en la red de estrategias PPO, se generan acciones de programación a partir del estado actual para aumentar la adaptabilidad de la estrategia a entornos complejos. Finalmente, mediante el mecanismo de actualización con poda y corrección de la función de ventaja, se garantiza la estabilidad de la estrategia durante la iteración y se mejora el rendimiento de la programación. Los experimentos han mostrado que, cuando la densidad de tareas es de 1000, el tiempo promedio de decisión del algoritmo de programación es de 0,72 s y su retardo promedio de respuesta es de 1,59 s, lo que indica una alta velocidad de respuesta y eficiencia en la toma de decisiones. En siete tipos de actividades y niveles de complejidad, la tasa de conflicto de recursos oscila entre 0,05 y 0,12; la tasa promedio de utilización de recursos está entre 0,75 y 0,86; y el índice de estabilidad en la programación varía entre 0,8 y 0,91, reduciendo eficazmente los frecuentes conflictos en la asignación de recursos y logrando una alta estabilidad en la programación. Bajo condiciones de alta concurrencia, el índice de equilibrio de recursos y el índice de robustez en la transferencia de estrategias son de 0,88 y 0,85, respectivamente, lo que indica una buena adaptabilidad a cargas de tareas concurrentes.

Introducción

Las actividades sindicales implican la programación compleja de múltiples tareas y recursos, lo que requiere que el sistema cuente con capacidades eficientes de respuesta dinámica1,2. Los requisitos de las actividades cambian con frecuencia, y la distribución del personal y de los recursos de los recintos es compleja, lo que puede provocar fácilmente conflictos de programación y desperdicio de recursos3,4. Captar con precisión el historial de actividades y el estado actualizado de los recursos, así como mejorar la capacidad de identificar y responder a posibles conflictos, es fundamental para aumentar la eficiencia operativa de la organización5,6. La integración de tecnologías avanzadas de modelado de series temporales y algoritmos de aprendizaje por refuerzo puede lograr una comprensión profunda y una optimización inteligente en entornos complejos de programación, ayudando a maximizar la utilización de recursos, acelerar la respuesta en la programación y promover la mejora inteligente de la gestión de actividades sindicales.

Sin embargo, los enfoques de programación existentes en la práctica son en gran parte basados en reglas y estáticos, por lo que no logran adaptarse a los frecuentes cambios en las tareas ni a las fluctuaciones de los recursos, lo que a menudo provoca tiempos de respuesta prolongados y graves conflictos de recursos. En la programación de actividades sindicales, los tipos de tareas son altamente diversos; el uso de recursos está altamente restringido y cambia con frecuencia; y las dependencias entre actividades, así como la competencia entre recursos, constituyen un mapa complejo de programación7,8. En la práctica, no es posible ajustar eficientemente el cronograma de actividades a las ventanas de tiempo disponibles de recursos como personal y lugares9,10, y con frecuencia surgen conflictos, lo que debilita la coherencia general de las operaciones organizativas11,12. El sistema de programación no enfrenta un único objetivo de optimización, sino que debe equilibrar múltiples indicadores dimensionales, como minimizar los conflictos de recursos, maximizar la velocidad de respuesta, la estabilidad de la estrategia de programación y la tasa de finalización de tareas13,14, lo cual presenta características típicas de optimización multiobjetivo. Además, las actividades sindicales presentan fases y ciclos claramente definidos, y las estrategias de programación deben adaptarse dinámicamente a las distintas estructuras de demanda de recursos en las diferentes etapas de las tareas. Los planes estáticos generados una sola vez no pueden soportar un entorno de ejecución con cambios de alta frecuencia15,16. La lógica de programación existente carece de una exploración profunda del comportamiento histórico de las tareas y de los patrones de cambio en el estado de los recursos. Por ello, no es capaz de ofrecer predicciones precisas ni deducciones estratégicas para el futuro17,18. La estrategia de programación del sistema responde lentamente a tareas imprevistas y cambios temporales en los recursos, afectando la sostenibilidad general de la operación19,20. La construcción de un sistema de programación con predictibilidad, flexibilidad y estabilidad se ha convertido en un requisito técnico clave en aplicaciones prácticas. Esto exige que el modelo posea capacidades de percepción de información de alta dimensión, memoria de secuencias y migración de estrategias, y que mantenga una toma de decisiones robusta y un equilibrio de recursos en un entorno multitarea, permitiendo así una coordinación inteligente y óptima de la programación de actividades sindicales.

Numerosos estudios han propuesto diversas soluciones al problema de programación dinámica. Entre ellas, la combinación del aprendizaje profundo y el aprendizaje por refuerzo ha demostrado una fuerte capacidad de adaptación y optimización. Algunos investigadores utilizan LSTM (memoria a corto y largo plazo)21,22 para modelar datos de series temporales y combinan estrategias de aprendizaje por refuerzo para optimizar el comportamiento de programación, logrando ciertos resultados. Otro tipo de investigación emplea un método heurístico basado en un algoritmo voraz, destacando la simplicidad y eficiencia de las decisiones de programación, lo cual resulta adecuado para escenarios con reglas claras23,24. Otros estudios han explorado la aplicación de redes Q profundas (DQN) a la programación, logrando estrategias mejoradas mediante la aproximación de funciones de valor25,26. Sin embargo, estos métodos presentan problemas como la captura insuficiente de dependencias a largo plazo, actualizaciones de estrategias inestables y grandes retrasos en la respuesta cuando enfrentan escenarios complejos y cambiantes de actividades conjuntas, lo que dificulta satisfacer las necesidades de programación de tareas densas y diversas. Por lo tanto, cómo construir un algoritmo de programación con capacidades eficientes de extracción de características y actualización estable de estrategias se ha convertido en un cuello de botella que debe superarse en la investigación actual.

En la investigación sobre planificación en múltiples dominios, la arquitectura Transformer se ha aplicado a diversas tareas de predicción de series temporales y optimización de planificación debido a su mecanismo de autoatención con múltiples cabezales, que captura eficazmente las dependencias temporales a largo plazo27,28. Cuando se combina con el algoritmo PPO en el aprendizaje por refuerzo, la estrategia se actualiza de forma estable y eficiente mediante el recorte de la función objetivo, y este enfoque ha demostrado un buen desempeño en áreas como el control de robots y la fabricación inteligente29,30,31. Algunos estudios han intentado integrar el Transformer con el aprendizaje por refuerzo para la planificación compleja de recursos32. Sin embargo, en la planificación dinámica de actividades sindicales, pocos estudios abordan la combinación de diversos tipos de actividades y restricciones complejas de recursos. Algunas investigaciones han utilizado redes neuronales gráficas para modelar la relación entre recursos y tareas, mejorando así la precisión en la identificación de conflictos33,34. Algunos investigadores han optimizado la planificación de recursos basándose en la computación en el borde para mejorar la eficiencia y el rendimiento del modelo35,36. No obstante, tales métodos aún tienen capacidades limitadas de modelado para el contexto temporal. Con base en esto, en este artículo se propone utilizar un Transformer para codificar secuencias históricas de estados de actividades y recursos, combinado con una red de políticas PPO, con el fin de lograr una alta percepción de los riesgos de conflicto y una actualización estable de las estrategias de planificación para hacer frente a las necesidades cambiantes y complejas de planificación de actividades sindicales.

Estudios más recientes han explorado la optimización de la programación de recursos desde diferentes perspectivas, como la consolidación de máquinas virtuales para mejorar la eficiencia energética en computación en la nube37, algoritmos de autenticación en redes celulares38, consolidación mejorada de máquinas virtuales con migración en vivo para una computación en la nube sostenible39, optimización del tráfico mediante predicción de espera y algoritmos evolutivos40, y almacenamiento en la nube basado en blockchain con optimización mejorada y preservación de la integridad41. Si bien estos trabajos aportan conocimientos valiosos sobre algoritmos de asignación y optimización de recursos, se centran principalmente en infraestructuras en la nube, telecomunicaciones o sistemas de almacenamiento, y no abordan específicamente las restricciones de actividades de múltiples tipos, los conflictos dinámicos entre recursos de personal y lugares, ni los requisitos de programación en tiempo real inherentes a la gestión de actividades sindicales. Esta diferencia subraya aún más la necesidad de un marco de programación dedicado, adaptado al contexto organizativo de las actividades sindicales.

Los métodos existentes de programación para actividades sindicales suelen no captar las dependencias espacio-temporales a largo plazo ni mantener la estabilidad de la política frente a cambios dinámicos, lo que provoca tiempos de respuesta lentos y altos conflictos de recursos. Para abordar estas lagunas de investigación, este estudio propone un modelo de optimización de programación basado en el principio de que la atención múltiple (multi-head) del Transformer puede codificar eficazmente secuencias históricas para la predicción de conflictos, y de que la Optimización de Política Próxima (Proximal Policy Optimization, PPO) con un objetivo recortado garantiza actualizaciones de política estables y adaptables. Específicamente, se aplica el Transformer para codificar secuencias de estados de actividades y recursos, extrayendo características espacio-temporales clave que mejoran la anticipación de conflictos, y se combina con PPO para generar acciones de programación eficientes y realizar actualizaciones estables. Se diseña una matriz de restricciones unificada para mapear actividades, personal y lugares, mejorando así el reconocimiento de dependencias complejas. Las innovaciones principales de este trabajo incluyen: (1) la integración de la codificación temporal y el aprendizaje por refuerzo específicamente para la programación de actividades sindicales; (2) un mecanismo de atención consciente de conflictos que prioriza la percepción de riesgos; y (3) una actualización con poda y corrección de la función de ventaja para garantizar la solidez de la estrategia bajo alta concurrencia. Extensos experimentos realizados bajo diversas densidades y complejidades de tareas validan la superioridad del modelo frente a los métodos existentes en velocidad de respuesta, utilización de recursos y estabilidad, ofreciendo una solución inteligente de programación práctica y escalable para la gestión de actividades sindicales.

Protocolo

Figura 1 muestra la estructura de un sistema de programación de actividades sindicales que integra modelado de series temporales y aprendizaje por refuerzo. La capa de entrada integra horarios de actividades, disponibilidad de recursos e información de ventanas temporales del personal, y construye una matriz multidimensional de relaciones de conflicto entre tareas y recursos mediante el módulo de grafo de restricciones. El transformador realiza una codificación de atención múltiple sobre la secuencia histórica de estados de actividades y recursos, produciendo estados ocultos con dependencias temporales. El módulo de política utiliza los resultados de codificación para generar distribuciones de acciones y estimación de estados, y ejecuta decisiones de programación tras muestrear las acciones. Los resultados de ejecución se retroalimentan al entorno, actualizando el estado de los recursos y generando recompensas inmediatas. Sobre esta base, el módulo de optimización construye una función objetivo con truncamiento, evalúa la función de ventaja y corrige la estimación de la red de valores para limitar la deriva de la política y garantizar actualizaciones estables del comportamiento de programación. Se forma un bucle cerrado de datos entre los módulos para lograr una percepción altamente sensible de los conflictos de recursos y actualizaciones adaptativas de estrategias en entornos dinámicos, mejorando así la capacidad de respuesta inteligente y la eficiencia en la asignación de recursos del sistema de programación de actividades sindicales en escenarios con múltiples tareas y altas restricciones.

Modelado de escenarios para la programación de actividades sindicales
Todas las solicitudes de actividades en el sistema de programación se organizan en secuencias de programación discretas basadas en intervalos de tiempo. Cada actividad se define con horarios claros de inicio y finalización, categorías de recursos, etapas y niveles de prioridad. El estado de uso del sitio se modela como una matriz bidimensional de franjas horarias, donde el eje horizontal representa la unidad de tiempo estandarizada y el eje vertical representa el número de recurso espacial. El estado del recurso se marca como disponible u ocupado, formando un mapa inicial de distribución de recursos con una estructura estática. La información de programación del personal se expande en la dimensión tiempo-identidad para construir un vector continuo de ventanas temporales, cada uno de los cuales registra el estado de inactividad laboral del personal y el número de departamento. Toda la información de entrada se integra en una estructura tensorial tridimensional, donde denota el intervalo de tiempo discreto, denota el número de entidades de recurso y denota el código de atributo de uso del recurso correspondiente (por ejemplo, si está ocupado, el número de actividad, la prioridad de uso, etc.). Esta estructura permite que el sistema de programación lea la configuración de recursos en cualquier momento, garantizando una representación unificada de los diferentes tipos de estado de recursos.

Después de vincular la información de la tarea al modelo, se establece el vector de intensidad de la tarea en función de la prioridad de la actividad y el período de uso del recurso. La combinación de tareas que podría generar un conflicto se marca mediante el método de detección de superposición de ventanas temporales. Las combinaciones en conflicto se convierten en conjuntos de nodos, y se construyen conjuntos de aristas basados en tipos de recursos compartidos y períodos, para representar explícitamente las dependencias implícitas. El grafo de tareas final construido contiene información límite sobre secuencia temporal, superposición de recursos o conflicto de restricciones, proporcionando una base estructural para la detección posterior de conflictos y la generación de estrategias de programación. Esta estructura conserva la naturaleza dinámica de la programación de tareas y los cambios continuos en el estado de los recursos, y permite la percepción en tiempo real de los cambios en las restricciones de programación.

La detección de conflictos utiliza las regiones superpuestas dispersas de las dimensiones de tiempo y recursos en la estructura tensorial como condiciones iniciales para la evaluación. Implementa un procesamiento de codificación estática de relaciones para pares de tareas con objetivos de programación que se superponen. Construye una estructura de grafo G=(V,E,C), donde V representa el conjunto de nodos activos, E representa las aristas generadas en función de los conflictos de recursos, y C es la matriz de codificación de pesos de conflicto para las aristas. La función de peso de conflicto se define de la siguiente forma:

Ecuación para la matriz de covarianza; incluye sumatoria, función delta, factor de peso; análisis estadístico.    (1)

Entre ellos, Cuv es el peso de conflicto entre las actividades u y v; u, v son los índices de las actividades; R es el número total de tipos de recursos; δuvr ∈ {0,1} indica si las ventanas temporales de las actividades u y v se solapan en el recurso r; ωr es el peso de sensibilidad al conflicto del recurso r. Esta función realiza una suma ponderada de las intensidades de conflicto, considerando las diferencias en la importancia de los conflictos de recursos para los resultados de la programación, al tiempo que conserva una expresión cuantificable de la distribución de la intensidad del conflicto.

La estructura del grafo de conflictos anterior se convierte en una matriz de límites de restricciones mediante una representación de matriz dispersa. Cada elemento de la matriz contiene el grado de conflicto de recursos. La matriz se integra en el proceso de toma de decisiones de planificación para determinar si las tareas pueden programarse en paralelo, mientras que la lógica de protección por acciones se encuentra en la red de políticas. Para hacer frente a la agregación periódica de actividades y a ráfagas de tareas de alta densidad, se implementa un mecanismo de actualización dinámica que supervisa los cambios en el estado de las tareas y modifica el contenido de la matriz en tiempo real conforme los recursos se liberan o añaden, asegurando la continuidad y consistencia del límite de planificación durante toda la evolución de las tareas.

La aplicación de esta estructura de grafo de conflictos permite al sistema de programación modelar visualmente posibles cuellos de botella de recursos y patrones de solapamiento de tareas, mejorando así la eficiencia del análisis de desacoplamiento de la red de decisiones en escenarios de restricciones complejas. El comportamiento de programación ya no depende de la coincidencia lógica basada en reglas. Por el contrario, busca la ruta óptima en el espacio de restricciones, mejorando la capacidad de equilibrar dinámicamente los conflictos locales de recursos con el mapa global de tareas. El sistema puede mantener la estabilidad en la programación y la coherencia de las tareas en un entorno en el que los recursos fluctúan y las tareas se añaden o eliminan con frecuencia.

Figura 2 muestra un diagrama de estructura de red basado en la relación de peso del conflicto de tareas. Cada nodo en la figura representa una tarea por programar, y las líneas entre los nodos indican conflictos en el uso de recursos. El grosor del borde refleja el peso del conflicto. Cuanto más grave sea el conflicto, más gruesa será la línea. El cálculo del peso integra la superposición de recursos y combina la sensibilidad al conflicto de diversos recursos para formar una intensidad compuesta de conflicto entre tareas. La estructura del grafo revela que algunas tareas forman áreas densamente conectadas, lo que indica una competencia significativa por la utilización de recursos. Este tipo de fenómeno de agregación local de conflictos es la fuente principal de cuellos de botella de recursos y retrasos en las tareas durante el proceso de programación, y el algoritmo de programación puede establecer en consecuencia objetivos prioritarios de mediación. La disposición de los nodos emplea una estrategia de diseño basada en fuerzas dirigidas para agrupar automáticamente las tareas con alto nivel de conflicto, permitiendo al sistema de programación identificar grupos clave de tareas y optimizar la distribución de estrategias, mejorando así la coherencia general de la programación y la coordinación de recursos.

Codificación de la secuencia de estados históricos
A partir del grafo de conflictos y la matriz de restricciones construidos, el siguiente paso consiste en codificar las secuencias históricas de actividades y los estados de los recursos, de modo que puedan extraerse los patrones temporales subyacentes a dichas restricciones para la toma de decisiones posterior. La información principal en el escenario de programación consiste en solicitudes de actividades, cambios en el estado de los recursos y registros de retroalimentación sobre las tareas. Esta información constituye múltiples series temporales heterogéneas, correspondientes a atributos tales como los instantes temporales de los eventos, los identificadores de uso de recursos y el estado de ejecución de las actividades. Para unificar la estructura de procesamiento, cada tipo de entrada se codifica como una secuencia de vectores de igual longitud, y se establece un índice temporal unificado para garantizar el alineamiento de estados bajo sincronización temporal. La unidad de entrada en cada momento se representa mediante la concatenación de tres conjuntos de vectores característicos: el vector característico de actividad representa el tipo de tarea, la prioridad y el número de etapa; el vector característico de recurso registra la ocupación actual del recurso, la capacidad restante y la posición de la ventana disponible; el vector característico de retroalimentación describe si la tarea se ejecutó sin interrupciones en el momento anterior, y si ocurrió un conflicto de recursos o un evento de retraso.

Todas las características se transforman linealmente y se proyectan en un mismo espacio dimensional para obtener una matriz de incrustación estandarizada X ∈ ℝT×d, donde T representa el número de pasos temporales y d es la dimensión unificada de la incrustación. Para preservar la estructura temporal, la matriz de entrada se suma elemento a elemento con la matriz de codificación de posición P para formar la entrada sensible a la posición:

Z = X + P   (2)

Z es la secuencia de entrada final, que sirve como entrada para el mecanismo de atención subsiguiente. El diseño de codificación de posición utiliza una plantilla fija de funciones seno y coseno para evitar la filtración de información futura y garantizar que se cumplan estrictamente las restricciones causales durante la codificación. La estructura anterior permite que el modelo perciba simultáneamente las características de la tarea, el estado de los recursos y la posición temporal. Cuenta con una base de memoria de estado completa, proporcionando una estructura unificada de alta resolución para el mecanismo de atención subsiguiente.

El módulo de atención procesa la secuencia de entrada para capturar posibles relaciones entre múltiples pasos temporales. Se utilizan múltiples grupos de cabezas de atención para procesar la secuencia por separado, mejorando la sensibilidad del modelo a diferentes tipos de trayectorias de evolución de estado. Cada cabeza de atención genera una matriz de consulta Q, una matriz de claves K y una matriz de valores V a partir de la secuencia de entrada, calcula la matriz de distribución de pesos y genera una representación ponderada. La salida de una atención de una sola cabeza es:

Fórmula del mecanismo de atención, Attention(Q,K,V)=softmax(QKᵀ/√dₖ)V, utilizada en redes neuronales.   (3)

dk es el número de dimensiones de características por cabeza. En esta fórmula, QK representa la similitud entre momentos, √dk se utiliza para la estabilidad numérica, y la función softmax garantiza la normalización de los pesos. Diferentes cabezas de atención se centran en distintas combinaciones de pasos temporales, y las dependencias dinámicas que capturan también son diversas, lo que ayuda a revelar reglas implícitas como precursoras de conflictos de tareas, patrones de consumo de recursos y tendencias anómalas de retroalimentación.

Todas las salidas de las cabezas de atención se concatenan y pasan a través de una capa de transformación lineal para generar una secuencia de codificación unificada, que sirve como entrada de estado a la red de generación de estrategias de planificación. Esta secuencia integra la trayectoria del comportamiento de la tarea, las características del cambio de recursos y el impacto de las desviaciones previas de ejecución en la ventana de planificación actual, abordando así eficazmente el problema de la alta dependencia histórica en el comportamiento de planificación y la expresión escasa de características. Se incorporan módulos de conexión residual y normalización de capa en la capa de salida de codificación para mejorar la estabilidad del entrenamiento y las capacidades de retención de expresión de la red profunda.

La secuencia de estados ocultos de salida no solo conserva la información de evolución temporal, sino que también responde a cambios derivados de tareas repentinas o desajustes temporales de recursos, lo que demuestra una gran adaptabilidad. Este diseño estructural evita la definición explícita de reglas, posibilita la modelización estructurada de entornos de programación dinámicos y apoya a los módulos de política posteriores en la generación de soluciones de programación con consistencia global y adaptabilidad local bajo condiciones multiobjetivo.

Generación de estrategias dinámicas de programación
Las secuencias codificadas de estados ocultos, que incorporan tanto las dependencias temporales como la información sobre conflictos de recursos, se introducen luego en la red de políticas para generar acciones de programación que se adaptan al entorno actual. La secuencia de estados ocultos generada por el módulo de codificación se utiliza como entrada para la red de estrategia de programación. El conjunto de vectores de estado en cada momento constituye la expresión actual de la observación del entorno, abarcando la evolución de las características de las tareas, las tendencias de uso de recursos y las trayectorias históricas de retroalimentación. La dimensión de la representación de estado y la longitud de la ventana temporal son fijas, y la continuidad de los cambios de estado se captura mediante un mecanismo de actualización deslizante. Antes de que el vector de estado se envíe a la red de políticas, se normaliza y reorganizan sus características para garantizar que la entrada mantenga una distribución numérica estable en el espacio de alta dimensión, reduciendo así la explosión de gradientes y las fluctuaciones de convergencia.

La estructura de la red de políticas emplea un módulo de salida de doble rama, donde una rama genera la distribución de acciones y la otra produce la estimación de la función de valor de estado. El espacio de acciones comprende todas las tareas programables y los recursos asignables. El mecanismo de selección de candidatos filtra combinaciones ilegales o redundantes de operaciones para formar un conjunto limitado y legal de acciones. La rama de políticas produce una distribución de probabilidad π(at|st), donde at representa la acción de programación en el paso de tiempo, y st es la entrada del estado actual. Se utiliza una estrategia de muestreo gaussiano estandarizado o de muestreo softmax para seleccionar acciones a partir de la distribución para la programación real. La otra salida es la estimación de la función de valor de estado, que representa la expectativa de recompensa a largo plazo en el estado dado y se utiliza para la evaluación y actualización de la política.

En la red de políticas, la capa oculta aplica funciones de activación y normalización por lotes para mejorar la capacidad de expresión no lineal y acelerar la convergencia de la red. En el proceso de toma de decisiones, se consideran factores de atención la prioridad de ejecución, el costo de programación de recursos y el desempeño histórico de diferentes tareas, los cuales se aplican al mecanismo de selección de acciones mediante una matriz de pesos específica para formar un marco de salida de políticas adaptable y ajustable. Este diseño evita la dependencia de reglas fijas, mejorando así la flexibilidad de la estrategia para manejar conflictos repentinos y cuellos de botella estructurales.

La estrategia de programación utiliza un mecanismo de muestreo aleatorio para generar la secuencia de acciones real. En cada ciclo de programación, se selecciona una acción ejecutable a partir de la distribución actual de acciones, y se actualiza el estado de los recursos y la marca del nodo de la tarea. Después de ejecutar la acción, el sistema calcula la recompensa inmediata basándose en los cambios de recursos y los resultados del progreso de la tarea, con el fin de medir el impacto de esta ronda de programación sobre el objetivo general. El diseño de la recompensa considera múltiples dimensiones, incluyendo la tasa de finalización de tareas, la eficiencia en la utilización de recursos y el grado de supresión de conflictos. Esta proporciona retroalimentación al módulo de actualización de la estrategia mediante indicadores integrales.

Todo el proceso de planificación construye una cadena de decisión de Markov y utiliza el método de muestreo de trayectorias empíricas para registrar la secuencia estado-acción-recompensa, denotada como (st, at, rt, st+1). La optimización de la estrategia depende de la construcción de la función de ventaja, donde la estimación de ventaja se define en la siguiente forma:

Fórmula de aprendizaje por refuerzo, At = rt + γV(st+1) - V(st), concepto matemático.    (4)

At representa el valor de ventaja, rt es la recompensa instantánea actual, γ es el factor de descuento de la recompensa, y V(st) y V(st+1) son las salidas de la función de valor de estado en los estados actual y siguiente, respectivamente. La función de ventaja refleja el grado de superioridad de la acción actual en relación con el rendimiento promedio de la estrategia. Se utiliza para guiar la mejora posterior de la estrategia. Si At > 0, significa que la acción actual es mejor que la expectativa promedio, y su probabilidad debe aumentarse; en caso contrario, su tendencia de selección debe reducirse.

Durante el proceso de actualización de la estrategia, para evitar oscilaciones causadas por amplitudes excesivas de actualización, se aplica un mecanismo de truncamiento de la distribución objetivo que limita el rango de cambio entre las estrategias nueva y antigua, manteniendo así la continuidad y estabilidad de la salida de la red. Se establece un acoplamiento estrecho entre la distribución de acciones y la recompensa de retroalimentación, lo que permite que la estrategia responda inmediatamente a cambios en restricciones complejas. Este mecanismo mantiene la estabilidad en la toma de decisiones y una programación racional de recursos en situaciones donde las tareas cambian frecuentemente o hay desajustes repentinos de recursos, evitando eficazmente problemas como asignaciones duplicadas, congestión de recursos o acumulación en colas de tareas. El sistema de programación puede mantener un estado operativo más favorable ante densidades variables de tareas y escasez de recursos, demostrando fuertes capacidades de adaptación.

Iteración de estrategias y mecanismo de actualización estable
Para garantizar que las estrategias de programación generadas permanezcan estables y no se degraden tras múltiples rondas de entrenamiento, en esta sección se introduce un mecanismo de actualización iterativa con recorte y corrección de ventaja. El intervalo de actualización del truncamiento entre las estrategias antigua y nueva se establece, y se utiliza la función objetivo de recorte para limitar la deriva de la estrategia y prevenir choques de programación durante el proceso de actualización de la estrategia. La red de valoración se corrige en combinación con la función de ventaja para mejorar la precisión de la programación a largo plazo.

La distribución de probabilidad de la salida de acciones de la red de políticas es propensa a fluctuaciones drásticas durante las iteraciones continuas de programación, lo que puede provocar un comportamiento inestable o una asignación desordenada de recursos. Para mitigar el impacto de programación causado por la deriva de la política, se diseña un intervalo de actualización truncado para controlar el rango de cambio entre las políticas nueva y antigua, y se construye un término de restricción para perfeccionar la función objetivo. La probabilidad de la política histórica se registra en la ronda de muestreo, y se construye el término de razón junto con la probabilidad de la política actual. El objetivo de actualización de la política se establece como:

Ecuación de optimización, fórmula, equilibrio estático ilustrado, uso educativo e investigativo.    (5)

Aquí, gt = πθ(at|st)/πθold(at|st) denota la razón de probabilidad entre las políticas nueva y antigua; ε es el umbral de recorte que limita el rango de actualización de la política. Cuando la razón excede el límite, se utiliza el valor recortado en su lugar para evitar que la estrategia genere gradientes excesivos a partir de muestras extremas, asegurando que el ajuste de los parámetros de la red permanezca dentro del rango preestablecido. Esta estructura restringe dinámicamente el rango de cambios en la estrategia de salida en cada ronda de planificación, manteniendo la suavidad y consistencia de la salida de la estrategia bajo distribuciones densas de tareas y reduciendo significativamente la tasa de fluctuación del comportamiento de planificación.

La función objetivo de la política se amplía con términos de regularización y recompensa de entropía durante el proceso de actualización para aumentar la diversidad de la distribución de acciones y suprimir la convergencia temprana. Cada ronda de actualización de políticas utiliza múltiples lotes de muestras de trayectorias de experiencia para el entrenamiento progresivo, manteniendo así una amplia cobertura en el espacio de estados. Cuando se compara la distribución de probabilidad de la secuencia de acciones de salida antes y después de la actualización, se calcula la tasa de desviación de la distribución, y un umbral rígido filtra el rango de perturbación aceptable de la política. Este mecanismo proporciona un control de límites para la migración de políticas de programación entre ciclos, suprimiendo así el sobreajuste debido a cambios drásticos en el estado de los recursos.

Las actualizaciones de estrategia dependen de la evaluación del estado proporcionada por la función de valor. Las desviaciones en la estimación del valor del estado pueden afectar directamente la corrección de la función de ventaja, alterando así la dirección de la iteración de estrategia. Para mejorar la precisión de la valoración, se construye un mecanismo de retroceso multiplo en series temporales, y se utiliza el valor acumulado descontado de las recompensas futuras para corregir el valor actual del estado. La recompensa de retroceso adopta la estructura de Estimación Generalizada de Ventaja (GAE, por sus siglas en inglés), que se define como:

Ecuación para la función de valor del aprendizaje por refuerzo, Σγ^t(r+γV(s'))-V(s), análisis de la fórmula.    (6)

Ât es el valor de ventaja corregido; λ es el coeficiente de equilibrio de retroceso; rt+l representa la recompensa inmediata del paso (t+l); V(st+l) es el valor de estado producido por la red de valoración. Esta estructura integra retroalimentación inmediata a corto plazo y expectativas de estado a largo plazo para corregir desviaciones en las predicciones de respuesta de la estrategia ante futuros conflictos de recursos, picos de carga y acumulación de tareas. λ controla la profundidad del retroceso y se ajusta automáticamente durante períodos de fluctuaciones drásticas en la dinámica de recursos para mejorar la robustez de la respuesta de la red de valoración ante eventos repentinos.

La estructura dependiente del tiempo a múltiples escalas integrada en la función de ventaja permite que la red de valoración modele tendencias de recursos a largo plazo. Para detectar la desviación en la salida de la política, se utiliza el índice de consistencia del comportamiento de la política para evaluar si la red presenta una respuesta excesiva al error de valoración. Los términos residuales de diferencia de retroalimentación supervisan el comportamiento de actualización de la política, y el objetivo de entrenamiento y la amplitud de actualización del peso de la función de valor se corrigen dinámicamente. La red de valoración y la red de política se optimizan conjuntamente para garantizar que la estimación del valor no se desvíe del objetivo de finalización de la tarea, a la vez que se evita que la programación de alta frecuencia juzgue erróneamente el estado de conflicto de recursos.

Este mecanismo estable de actualización de políticas puede mantener eficazmente la controlabilidad y consistencia de las actualizaciones en el comportamiento de las políticas dentro de un entorno de tareas dinámico de alta dimensión, mejorando la eficiencia en la cobertura de tareas y la flexibilidad en la utilización de recursos, y formando una estructura de programación inteligente de carácter continuamente iterativo. El comportamiento de programación evita caer en optimalidad local durante la evolución a largo plazo y mejora la adaptabilidad general ante cambios en los patrones de tareas y fluctuaciones en los ciclos de recursos.

Figura 3A muestra la tendencia del valor de la función objetivo en función del número de iteraciones de entrenamiento bajo diferentes condiciones de umbral de truncamiento. El eje horizontal representa el número de iteraciones de entrenamiento, y el eje vertical representa el valor numérico de la función objetivo recortada. Se establece ε en 0,1, 0,2 y 0,3, lo que representa distintos grados de intensidad en el control de la deriva de la política. La curva correspondiente a un valor de ε más pequeño presenta menos fluctuaciones, y la función objetivo permanece estable. Cuando ε = 0,1, el valor global de la función objetivo se sitúa entre 0,8 y 1, mostrando la gradualidad y estabilidad de la actualización de la estrategia. Sin embargo, un valor mayor de ε conduce a fluctuaciones más pronunciadas. Cuando ε = 0,3, el valor global de la función objetivo oscila entre 0,65 y 0,95, y la curva de la función objetivo muestra una mayor amplitud de oscilación, reflejando el riesgo de una desviación severa en el proceso de actualización de la estrategia. Cuanto menor sea el umbral, más estable será la estrategia, lo que la hace adecuada para entornos de programación con altas restricciones. Figura 3B muestra los cambios en la estimación de ventaja generalizada bajo diferentes coeficientes de equilibrio de retroceso. Se establece λ en 0,8, 0,9 y 1,0, respectivamente, para controlar la profundidad de retroceso de las recompensas futuras. La curva muestra que cuanto mayor es λ, menor es la fluctuación de la GAE, más suave es la tendencia a largo plazo y más precisamente captura el impacto potencial del comportamiento de programación tras múltiples pasos. La curva con un valor de λ de 0,8 presenta fluctuaciones periódicas pronunciadas, lo que indica que es más sensible a las recompensas inmediatas y más adecuada para tareas a corto plazo y repentinas. En contraste, un valor de λ de 1,0 se centra más en la modelización de tendencias a largo plazo y es adecuado para escenarios de tareas periódicas.

Análisis de complejidad computacional y escalabilidad
La complejidad computacional del marco Transformer-PPO propuesto está determinada por dos componentes principales: el codificador Transformer y la optimización de la política PPO.

Para el codificador Transformer con L capas, H cabezas de atención, dimensión de incrustación d y longitud de la secuencia de entrada T (la ventana temporal histórica), la complejidad temporal por paso hacia adelante es O(L·T2·d + L·T·d2), donde el término T2 surge del mecanismo de autoatención. En la implementación, L = 3, H = 4, d = 128 y T se fija en 100 pasos de tiempo, lo que resulta en una sobrecarga computacional manejable. Para ventanas históricas más largas, el término cuadrático T2 se convierte en el factor dominante; sin embargo, en la práctica, la programación de actividades sindicales generalmente implica horizontes históricos finitos (por ejemplo, ventanas móviles de un trimestre o un año), y la resolución del paso de tiempo puede ajustarse para equilibrar precisión y eficiencia.

Para el componente PPO, la red de política y la red de valor son MLP ligeros (256 y 128 neuronas por capa oculta), cuya complejidad de inferencia es O(d·m), donde m es el número de unidades ocultas, lo cual es despreciable en comparación con el codificador Transformer. La actualización de la política durante el entrenamiento implica múltiples épocas de actualizaciones del gradiente por mini-lotes, con una complejidad de O(B·E·d2), donde B es el tamaño del lote y E es el número de épocas de actualización.

En cuanto a la escalabilidad, el marco presenta tres propiedades favorables. En primer lugar, el mecanismo de atención puede paralelizarse a través de los pasos temporales, lo que permite una aceleración eficiente mediante GPU. En segundo lugar, el tamaño del modelo es independiente del número de actividades o recursos, ya que la matriz de restricciones se construye dinámicamente en cada paso de planificación en lugar de estar integrada como parámetros fijos. Esto permite desplegar el mismo modelo entrenado en uniones de diferentes escalas sin necesidad de reentrenamiento. En tercer lugar, para escenarios de escala extremadamente grande, puede reducirse la longitud de la ventana histórica T y la dimensión de incrustación d como un compromiso, o puede adoptarse la variante de atención dispersa para reducir la complejidad O(T2) a O(T log T) o O(T).

Resultados

Datos experimentales
Para evaluar exhaustivamente el rendimiento del algoritmo de programación dinámica Transformer-PPO presentado en este artículo, el experimento utiliza datos de gestión de actividades de un gran sindicato empresarial de los últimos tres años como conjunto de datos de referencia. Este conjunto contiene más de 5.000 registros de actividades, que abarcan diversos tipos, incluyendo reuniones, capacitaciones y entretenimiento, con información de programación para múltiples recursos, tales como instalaciones, equipos y personal. Cada registro detalla la hora de inicio y finalización de la actividad, los requisitos de recursos, la prioridad y el estado real de ejecución (incluyendo eventos de conflicto y utilización de recursos). Para simular cambios dinámicos en escenarios reales, los datos se amplían con un 10 % adicional de tareas aleatorias repentinas y eventos de cambio de recursos (como ocupación temporal de sitios y ajustes en las ventanas de tiempo del personal), con el fin de verificar la robustez del algoritmo en un entorno altamente incierto. La secuencia continua de estados proporciona una entrada estructurada para la modelización temporal del Transformer y el entrenamiento de la política PPO. El experimento comparó el rendimiento de la programación bajo diferentes densidades y complejidades de tareas para asegurar que la evaluación cubra escenarios típicos en aplicaciones reales, y lo comparó con el modelo LSTM-PPO actualmente popular, un modelo de programación basado en búsqueda voraz y un modelo de programación con política DQN.

El codificador Transformer consta de 3 capas, cada una con 4 cabezales de atención, una dimensión de incrustación de 128 y un tamaño oculto de alimentación directa de 256. La red de políticas y la red de valor comparten la misma salida del Transformer como entrada y luego se dividen en dos perceptrones multicapa (MLP) separados. Cada MLP tiene dos capas ocultas con 256 y 128 neuronas, respectivamente, utilizando activación ReLU. Todas las capas lineales se inicializan utilizando la inicialización uniforme de Xavier.

El optimizador es Adam con una tasa de aprendizaje de 3 × 10-4, un tamaño de lote de 64 y un coeficiente de entropía de 0,01. El parámetro de recorte de PPO ε se establece en 0,2, el factor de descuento γ = 0,99 y el GAE λ = 0,95. El modelo se entrena durante 5.000 episodios, cada uno con hasta 100 pasos de programación. Se aplica recorte de gradiente con una norma máxima de 0,5 para prevenir la explosión de gradientes. Estos parámetros se seleccionan mediante una búsqueda preliminar en cuadrícula y son coherentes con las prácticas comunes en tareas de programación basadas en aprendizaje por refuerzo. Todos los experimentos se ejecutan en un solo acelerador GPU (memoria de 40 GB), utilizando Python 3.9 y un marco de aprendizaje profundo (véase la Tabla de Materiales).

Tendencia temporal de la salida de la atención múltiple, mejora residual bajo variación temporal de las características de codificación y estratificación de prioridad de tareas
Utilizando el historial de programación real como entrada, se extraen la solicitud de tareas, el estado de uso de recursos y el estado de ejecución de retroalimentación en pasos de tiempo continuos, y se integra información de múltiples tipos en un espacio de características unificado mediante mapeo lineal y codificación posicional. El mecanismo de atención múltiple calcula en paralelo las correlaciones temporales entre diferentes secuencias de características, generando tres tipos de secuencias de pesos de atención: tarea, recurso y retroalimentación. Cada tipo de peso representa la intensidad de atención del modelo hacia el estado correspondiente en cada paso de tiempo. Tras la normalización, se traza una curva de tendencia que refleja el enfoque de percepción de la capa de codificación y la estructura de cambio dinámico en diferentes dimensiones de información dentro del historial de programación. Este proceso se completa basándose en la trayectoria real de ejecución de las actividades y en el registro de uso de recursos en el escenario de programación.

Figura 4 muestra la tendencia dinámica de atención del mecanismo de atención multi-cabeza sobre diferentes informaciones de estado en la programación de actividades sindicales. El paso de tiempo se encuentra en el eje horizontal, reflejando el avance continuo de la secuencia de programación, y el eje vertical representa el peso de atención normalizado, limitado entre [0,1], que indica la importancia relativa que el modelo otorga a las características de la tarea, el estado de los recursos y el estado de retroalimentación. La atención hacia las características de la tarea muestra un pico claro alrededor del paso 15. En las etapas iniciales de la programación, el modelo prioriza capturar las características temporales de las tareas clave para predecir posibles conflictos y cuellos de botella de recursos, lo que refleja la sensibilidad al riesgo en esta fase de la programación de actividades. La curva de atención respecto al estado de los recursos muestra fluctuaciones periódicas, y el peso de atención global oscila entre 0,2 y 0,8, lo que indica el seguimiento continuo por parte del sistema de programación de los cambios en la ocupación de recursos, apoyando el procesamiento complejo del uso compartido y la asignación de recursos, y respondiendo eficazmente a la competencia dinámica por los recursos entre múltiples tareas concurrentes. La atención al estado de retroalimentación aumenta gradualmente, y el pico de peso aparece cerca del paso 35, destacando la atención del modelo a la retroalimentación sobre los resultados de ejecución y las condiciones anómalas en las etapas intermedias y finales de la programación, lo que ayuda a ajustar la estrategia para manejar desviaciones en la programación y mejorar la robustez de la programación general. Esta tendencia muestra que una estructura de codificación que integra el mecanismo de atención multi-cabeza puede captar cambios sutiles en las características temporales y potenciar la adaptabilidad de las estrategias de programación a recursos diversos y dependencias complejas entre tareas, mejorando así la eficiencia y estabilidad general de la programación dinámica de actividades sindicales.

Se procesa la secuencia de codificación de estado oculto y la estructura de respuesta de características de la tarea. La parte de comparación de estados construye las rutas de propagación de características antes y después de la conexión residual bajo la misma condición de entrada, observa la evolución temporal del estado oculto a través de pasos de tiempo consecutivos y extrae sus características de estabilidad local y continuidad global para analizar la evolución suave de la expresión de estado durante la transmisión de información. La tendencia de respuesta según prioridad de tarea se extrae de la ruta de activación de características a través de diferentes estrategias de ponderación de programación. Al rastrear los niveles de activación de diferentes categorías de tareas a lo largo del tiempo, se captura el efecto dinámico del modelo sobre la capacidad de diferenciación de tareas.

Figura 5A muestra la tendencia del estado oculto del modelo antes y después de aplicar el mecanismo de conexión residual. El eje horizontal representa el paso de tiempo, y el eje vertical representa el valor del estado oculto. La salida original sin conexión residual fluctúa ampliamente, mostrando inestabilidad local pronunciada e interrupciones de tendencia. La línea continua azul representa el valor del estado tras aplicar la estructura residual. La tendencia general permanece estable, y las fluctuaciones se reducen significativamente, lo que indica que el modelo logra amortiguar el gradiente y mejorar las características durante la propagación del estado. Este fenómeno verifica el papel del mecanismo residual en mejorar la estabilidad de estructuras con dependencias a largo plazo, suprimiendo eficazmente la atenuación de información provocada por capas más profundas, y potenciando la capacidad expresiva continua de las secuencias de estados históricos. Figura 5B describe la dinámica de activación de características de tres tipos de tareas en una serie temporal. El eje horizontal es el paso de tiempo, y el eje vertical es el valor de activación de características, lo que refleja la sensibilidad temporal y la atención estratégica de las tareas en diferentes niveles de prioridad. Las tareas de baja prioridad muestran una tendencia decreciente, y el valor de activación de características decae por debajo de 0,5 en la etapa posterior, lo que indica que el modelo les presta la debida atención en la etapa inicial de planificación y debilita progresivamente la respuesta de recursos con el tiempo; las características de las tareas de prioridad media aumentan lentamente con el tiempo y presentan oscilaciones periódicas, lo que refleja que el modelo realiza una percepción y seguimiento flexible ante sus fluctuaciones de demanda; las tareas de alta prioridad mantienen una tendencia ascendente continua en el tiempo, y el valor de activación de características permanece siempre por encima de 2, con un nivel de activación alto y estable, lo que indica que el modelo mantiene constantemente un alto grado de respuesta ante tales tareas. Esta respuesta diferencial demuestra la capacidad del módulo de codificación de estado para identificar con precisión los atributos de las tareas y proporciona una base jerárquica para la toma de decisiones en la generación de estrategias de planificación.

Análisis multidimensional de la evolución del rendimiento del algoritmo dinámico de programación Transformer-PPO
Basado en la codificación mediante Transformer de secuencias históricas de programación y estado de recursos, se extraen características espacio-temporales como entrada de estado para PPO; luego, la red de políticas genera la acción de programación, y el entorno proporciona recompensas inmediatas y actualiza el estado; durante el proceso de entrenamiento, se registran los indicadores originales de cada ronda, y posteriormente se elimina el ruido mediante un filtro de promedio móvil, analizándose así la tendencia de convergencia del algoritmo; en la visualización final, los datos originales muestran dinámicas instantáneas, mientras que la curva suavizada refleja la mejora del rendimiento a largo plazo, lo que verifica que el modelo logra una programación estable mediante modelado de series temporales y optimización de políticas.

Figura 6A,B muestra el análisis de evolución del rendimiento multidimensional del algoritmo dinámico de programación Transformer-PPO. Las fluctuaciones en los datos originales reflejan el ruido instantáneo en el proceso de programación, mientras que los datos suavizados extraen la tendencia a largo plazo mediante un promedio móvil, eliminando la interferencia de perturbaciones a corto plazo en la evaluación del rendimiento del algoritmo y facilitando la observación de la evolución del rendimiento. Analizando los datos suavizados, la relación dinámica entre la recompensa y la entropía de la política muestra que la curva de recompensa presenta un crecimiento logarítmico, y la política aprende rápidamente a programar acciones de forma eficaz mediante la exploración; en la etapa posterior, el crecimiento tiende a estabilizarse, y el valor de saturación de la recompensa se mantiene alrededor de 12, lo que indica que la política se encuentra cerca del óptimo local. La entropía de la política decae gradualmente desde aproximadamente 2,2 al inicio hasta unos 0,6. PPO mantiene la capacidad necesaria de exploración a través del término de recompensa por entropía. Una exploración alta (alta entropía) en las primeras etapas promueve un aumento rápido de las recompensas, mientras que la estrategia posterior equilibra exploración y explotación mediante poda y actualización. La optimización coordinada de la tasa de conflictos y la utilización de recursos muestra que la tasa de conflictos disminuye a niveles inferiores al 10 %, y su límite inferior refleja conflictos que no pueden eliminarse en el sistema real debido a la aleatoriedad de las tareas. Esta tendencia descendente se atribuye directamente a la capacidad del Transformer para codificar secuencias históricas de actividad, permitiendo al modelo predecir proactivamente la contención de recursos. La utilización de recursos ha aumentado hasta casi el 75 %, en concordancia con la ley de rendimientos marginales decrecientes. Es razonable que la utilización no alcance niveles más altos, ya que una utilización excesiva podría provocar retrasos por colas. La reducción de conflictos ha liberado más recursos disponibles, y la asignación optimizada de recursos ha suprimido aún más los conflictos.

Evaluación de la velocidad de respuesta y la eficiencia en la toma de decisiones
Comparación del tiempo medio de decisión y del retardo medio de respuesta bajo diferentes densidades de tareas (número de tareas: 100, 300, 500, 700, 1000). Comparación del modelo de programación Transformer-PPO presentado en este artículo con el modelo LSTM-PPO, el modelo de programación por búsqueda voraz y el modelo de programación estratégica DQN.

Figura 7A,B muestra el tiempo medio de decisión y el retardo medio de respuesta para las cuatro estrategias de programación en diferentes condiciones de densidad de tareas, reflejando la capacidad del algoritmo para tomar decisiones en tiempo real y la capacidad de respuesta del sistema en escenarios con alta carga. A medida que aumenta el número de tareas, cada estrategia muestra una tendencia ascendente en ambos indicadores, aunque las magnitudes del aumento y la estabilidad varían. En escenarios con alta intensidad de tareas, la estructura Transformer-PPO mantiene un rendimiento relativamente estable en cuanto al tiempo medio de decisión. Cuando la densidad de tareas es de 1000, el tiempo medio de decisión es de 0,72 s y el retardo medio de respuesta es de 1,59 s, lo cual se debe principalmente al efecto de compresión del codificador de características temporales en el espacio de estados y a la evitación eficaz de operaciones inválidas en el espacio de acciones. En contraste, la estrategia DQN presenta tiempos de decisión y retardos de respuesta más largos a medida que aumenta el número de tareas, lo que refleja su capacidad limitada para generalizar políticas en transiciones de estados de alta dimensión. Aunque la estrategia Greedy toma decisiones más rápidamente en diferentes cantidades de tareas, su rendimiento de respuesta se degrada en grafos de tareas complejos debido a la falta de modelado de dependencias a largo plazo. LSTM-PPO posee cierta capacidad de percepción temporal en el modelado de secuencias, pero su desempeño es deficiente en escenarios con dependencias a largo plazo debido a la profundidad estructural limitada. Los resultados revelan el impacto clave del diseño estructural en la capacidad de respuesta del sistema de programación y subrayan la necesidad de una optimización coordinada del mecanismo de codificación y de la eficiencia en el muestreo de políticas bajo condiciones de alta concurrencia.

Evaluación de la tasa de conflictos y de la utilización de recursos
Bajo diferentes condiciones de complejidad del tipo de actividad (tipo único, múltiples tipos independientes, múltiples tipos cruzados, flujo de trabajo multietapa, colaboración interdepartamental, inserción temporal, ciclo repetido), se analizan estadísticamente la tasa de conflictos de recursos y la tasa promedio de utilización de recursos. El modelo de programación Transformer-PPO presentado en este artículo se compara con los modelos de programación LSTM-PPO, búsqueda voraz y DQN.

Figura 8A,B muestra la tasa de conflicto de recursos y la utilización media de recursos para diferentes modelos de programación en siete niveles de complejidad de actividades. El eje vertical representa el modelo de programación y el eje horizontal representa el tipo de actividad. La tendencia general indica que, a medida que aumenta la complejidad de la estructura de la actividad (como procesos multietapa, colaboración interdepartamental, inserción temporal y ciclos repetidos), la tasa de conflicto aumenta en todos los modelos. La estrategia voraz y el esquema DQN muestran una adaptabilidad limitada a los cambios dinámicos y son claramente insuficientes en el control de conflictos. El modelo Transformer-PPO mantiene aún una tasa baja de conflictos bajo condiciones de alta complejidad, con una tasa de conflicto de recursos general entre 0,05 y 0,12, lo que refleja su profundo entendimiento de la estructura de dependencias de tareas y los cambios en los recursos. En cuanto a la utilización de recursos, Transformer-PPO mantiene un nivel alto en todas las condiciones, especialmente con cruces de múltiples tipos e inserción temporal. Su estrategia de ajuste dinámico reduce eficazmente la inactividad de los recursos, con una tasa media de utilización de recursos entre 0,75 y 0,86. Los datos confirman que el modelo Transformer-PPO logra un mejor equilibrio entre flexibilidad en la programación y eficiencia en el uso de recursos, ofreciendo mayor practicidad y escalabilidad.

Estabilidad de la programación
El índice de estabilidad de la programación se calcula bajo diferentes condiciones de complejidad del tipo de actividad (tipo único, múltiples tipos independientes, múltiples tipos cruzados, proceso multifase, colaboración interdepartamental, inserción temporal y ciclo repetido). El modelo de programación Transformer-PPO presentado en este artículo se compara con los modelos LSTM-PPO, búsqueda voraz y DQN.

Tabla 1 presenta los resultados de comparación del índice de estabilidad de programación entre diferentes modelos de programación bajo siete condiciones de complejidad de tipos de actividades. El tipo de complejidad seleccionado refleja el rendimiento de estabilidad del sistema de programación en múltiples escenarios. El valor del índice oscila entre 0 y 1. Cuanto mayor sea el valor, mayor será la resistencia del modelo a las perturbaciones en la programación y más estable será la salida de la estrategia. Los resultados experimentales muestran que Transformer-PPO mantiene un índice de estabilidad alto en todas las estructuras de tareas. Especialmente en escenarios de colaboración multi-tipo, interdepartamental y de ciclos repetidos, la estabilidad de su estrategia de programación es superior a la de otros modelos, lo que demuestra sólidas capacidades de preservación estructural y de programación adaptativa. El índice de estabilidad general de la programación oscila entre 0,8 y 0,91. En contraste, la estabilidad del algoritmo voraz y de la DQN disminuyó significativamente a medida que la estructura de la tarea se volvió más compleja, con evidentes fluctuaciones en la política y desviaciones en la ejecución. LSTM-PPO muestra cierta estabilidad, pero su rendimiento general sigue siendo inferior al de Transformer-PPO. Esta comparación verifica las contribuciones positivas del mecanismo de atención multi-cabeza y del mecanismo de actualización con poda de políticas a la estabilidad de la salida de programación, destacando la ventaja del modelo en escenarios complejos de actividades combinadas.

Análisis de adaptación a la carga de concurrencia de tareas
A medida que el número de tareas concurrentes sigue aumentando, el sistema de planificación debe abordar los dos desafíos de los conflictos en la distribución de recursos y la reducción de la generalización de la política. Para evaluar la adaptabilidad de planificación de diferentes modelos ante el incremento de carga de tareas, en esta sección se establecen tres niveles de concurrencia de tareas (bajo: 100 elementos, medio: 500 elementos y alto: 1000 elementos) con el fin de monitorear la distribución de recursos del sistema y la consistencia de la respuesta de la política durante el ciclo de planificación. El índice de equilibrio de recursos se utiliza para reflejar el equilibrio de carga de diferentes unidades de recursos durante el proceso de planificación, y se calcula de la siguiente manera:

Fórmula de equilibrio estático, ecuación Br, análisis matemático simbólico.    (7)

ui representa la tasa real de utilización de las unidades de recursos; ū representa la tasa promedio de utilización de todos los recursos; y N representa el número total de recursos. El rango de valores es [0,1], y cuanto más cercano a 1, más equilibrada es la distribución de recursos.

El índice de robustez en la transferencia de políticas Rs mide el grado de consistencia de la salida de la política bajo diferentes condiciones de carga de tareas y se define como:

Fórmula de equilibrio estático: Rs=1−(1/T)ΣTt=1 ||πt(L)−πt(H)||1/2, diagrama de análisis matemático.    (8)

πt(L) y πt(H) son las distribuciones de estrategias de programación bajo escenarios de carga baja y carga alta, respectivamente, y T es el paso de tiempo total. Cuanto más cercano sea a 1, mayor será la robustez de la migración de estrategias y mayor la adaptabilidad.

Tabla 2 presenta sistemáticamente el desempeño de los cuatro modelos de planificación en términos de equilibrio de recursos y robustez en la transferencia de políticas bajo cargas variables de concurrencia de tareas. Los niveles de concurrencia de tareas se establecen como bajos (100 elementos), medios (500 elementos) y altos (1000 elementos), respectivamente, reflejando la adaptabilidad del modelo ante diferentes presiones de escala de tareas. Los resultados muestran que el modelo Transformer-PPO alcanza el índice más alto de equilibrio de recursos en todos los niveles de carga, lo que refleja su capacidad para asignar racionalmente los recursos en escenarios concurrentes de múltiples tareas. Al mismo tiempo, el índice de robustez en la transferencia de políticas también es significativamente mejor que el del modelo de comparación, mostrando una fuerte consistencia y adaptabilidad de la política. Bajo condiciones de alta concurrencia, los índices de equilibrio de recursos y de robustez en la transferencia de políticas son 0,88 y 0,85, respectivamente. En comparación, LSTM-PPO ocupó el segundo lugar, mientras que el algoritmo Greedy y el modelo DQN mostraron una degradación significativa del desempeño bajo cargas altas, con una distribución desigual de recursos y fluctuaciones de política más pronunciadas. Esta evaluación reveló claramente las diferencias en la gestión de recursos y la robustez de las políticas en el sistema de planificación ante el aumento de la carga de tareas, y verificó además la aplicabilidad y superioridad de la solución de fusión Transformer-PPO para la programación dinámica y compleja de actividades conjuntas.

Comparación con métodos adicionales de vanguardia
Para evaluar aún más el método propuesto frente a enfoques recientes de última generación (SOTA), se implementaron tres algoritmos representativos de la literatura más reciente que combinan aprendizaje profundo con aprendizaje por refuerzo para problemas de planificación: (1) Transformer+DQN42, que utiliza el mismo codificador Transformer que el nuestro, pero sustituye PPO por DQN en el aprendizaje de la política, como se ha explorado en estudios recientes de planificación basados en valores; (2) GRU+PPO43, que reemplaza el codificador Transformer por una unidad recurrente con puertas (Gated Recurrent Unit, GRU) para capturar dependencias temporales, representando métodos avanzados basados en RNN; y (3) GraphSAGE+PPO44, que emplea un codificador GraphSAGE para modelar las relaciones entre tareas y recursos como grafos, reflejando enfoques recientes de redes neuronales en grafos aplicadas a la planificación. Todos los métodos se entrenaron bajo condiciones experimentales idénticas (mismo conjunto de datos, densidad de tareas de 1000 y configuración de episodios) con los hiperparámetros ajustados mediante búsqueda en cuadrícula para garantizar una comparación justa. Cada método se evaluó en 10 ejecuciones independientes, y se registraron los valores promedio de métricas clave de rendimiento (retraso de respuesta, tasa de conflictos de recursos, utilización de recursos e índice de estabilidad de la planificación).

Como se muestra en la Tabla 3, el método propuesto Transformer+PPO supera consistentemente a los tres modelos básicos SOTA en todas las métricas evaluadas. El retardo promedio de respuesta del método propuesto (1,59 s) es significativamente menor que el de Transformer+DQN (2,13 s), GRU+PPO (1,89 s) y GraphSAGE+PPO (1,72 s), lo que indica una eficiencia superior en la toma de decisiones. La tasa de conflicto de recursos del método propuesto (0,09) también es la más baja, lo que indica una mejor prevención proactiva de conflictos. Esta mejora se atribuye a la atención multi-cabeza del Transformer, que captura dependencias de largo alcance de manera más efectiva que el GRU o GraphSAGE, combinada con las actualizaciones de política estables del PPO. En cuanto a la utilización de recursos, el método propuesto alcanza un valor de 0,82, superando a los demás en al menos 8 puntos porcentuales, lo que demuestra una asignación de recursos más eficiente. El índice de estabilidad del método propuesto (0,88) también es el más alto, lo que confirma que el objetivo de recorte y la corrección GAE en el PPO producen políticas de programación más robustas que el DQN u otras variantes del PPO. En conjunto, los resultados validan que la combinación específica de Transformer y PPO en el marco propuesto ofrece ventajas claras frente a otras arquitecturas recientes, reforzando aún más su aplicabilidad en la programación de actividades sindicales dinámicas.

DECLARACIÓN DE DISPONIBILIDAD DE DATOS:
El conjunto de datos anonimizado utilizado en este estudio, junto con la canalización de preprocesamiento de datos y los scripts de evaluación, se ha depositado en el repositorio Figshare y está disponible públicamente en https://doi.org/10.6084/m9.figshare.33059243 (DOI: 10.6084/m9.figshare.33059243). El conjunto de datos contiene horarios de actividades, registros de uso de recursos y registros de eventos de conflicto de un gran sindicato empresarial, con toda la información identificable personalmente y comercialmente sensible eliminada.

Diagrama del flujo de trabajo del aprendizaje automático que muestra la asignación de tareas, bucles de retroalimentación y optimización de políticas.
Figura 1: Estructura del sistema de programación de actividades sindicales. Las solicitudes de actividades, la disponibilidad de recursos y la información sobre las ventanas temporales del personal se integran para construir un grafo de restricciones entre tareas y recursos y una matriz de conflictos. Las secuencias históricas de actividades y de estados de los recursos se codifican utilizando un Transformador con atención múltiple. Los estados codificados se proporcionan a las redes de política y de valor de optimización de política proximal (PPO), que generan probabilidades de acciones de programación y estimaciones del valor del estado. Las acciones seleccionadas actualizan el entorno de programación y generan recompensas. Luego, se utiliza el objetivo PPO con recorte y la estimación de ventaja generalizada para actualizar el modelo, formando un bucle de retroalimentación cerrado para la programación adaptativa y la asignación de recursos. Haga clic aquí para ver una versión ampliada de esta figura.

Diagrama de topología de red, nodos conectados por tareas, que ilustra la estructura del sistema interconectado.
Figura 2: Red de pesos de conflicto de tareas (el grosor de las líneas refleja la gravedad del conflicto). Cada nodo representa una actividad pendiente de programación, y cada arista representa un conflicto causado por el uso superpuesto de personal, lugares, equipos u otros recursos. El grosor de las aristas es proporcional al peso de conflicto calculado, siendo más gruesas las aristas que indican conflictos más severos. Los grupos de nodos densamente conectados representan cuellos de botella potenciales y agrupaciones de tareas en competencia. Se utiliza un diseño basado en fuerzas para posicionar más cerca las tareas con conflictos más intensos. Haga clic aquí para ver una versión más grande de esta figura.

Gráficos de aprendizaje por refuerzo: objetivo de política recortado, estimaciones GAE; análisis de iteración de entrenamiento.
Figura 3: Características dinámicas de la estabilidad de la estrategia y de la estimación de ventaja durante la iteración de optimización de programación. (A) Objetivo de política recortado bajo diferentes valores de ε. (B) Fluctuación de GAE según distintos valores de λ. Haga clic aquí para ver una versión más grande de esta figura.

Gráfico de peso de atención frente a paso de tiempo; comparación de estado de tarea, recurso y retroalimentación; valores normalizados.
Figura 4: Tendencia temporal de la salida de atención múltiple Haga clic aquí para ver una versión más grande de esta figura.

Dinámica de estados ocultos, comparación de activación de características, gráficos por paso de tiempo, análisis de conexiones residuales.
Figura 5: Mejora residual y estratificación de prioridades de tareas bajo variación temporal de características de codificación. (A) Comparación del estado oculto antes y después de la conexión residual. (B) Activación de características basada en el tiempo para diferentes prioridades de tareas. Haga clic aquí para ver una versión más grande de esta figura.

Gráficos de recompensa y entropía de la política; tasa de conflicto y utilización de recursos a lo largo de las épocas de entrenamiento.
Figura 6: Análisis de la evolución del rendimiento multidimensional. (A) Recompensa y Entropía de la Política (B) Tasa de Conflicto y Utilización de Recursos. Haga clic aquí para ver una versión más grande de esta figura.

Gráficos que comparan el tiempo de decisión y la latencia de respuesta frente al volumen de tareas para los algoritmos: Transformer-PPO, LSTM-PPO, Greedy, DQN.
Figura 7: Tiempo medio de decisión y retraso medio de respuesta. (A): Tiempo de decisión bajo cargas de trabajo variables. (B): Latencia de respuesta bajo cargas de trabajo variables. Haga clic aquí para ver una versión ampliada de esta figura.

Comparación de mapas de calor de la tasa de conflicto de recursos y la utilización promedio; análisis del rendimiento del algoritmo.
Figura 8: Comparación de la tasa de conflicto de recursos y la utilización promedio de recursos (A) Tasa de conflicto de recursos. (B) Utilización promedio de recursos Haga clic aquí para ver una versión más grande de esta figura.

Condición de complejidad de la actividadTransformer-PPOLSTM-PPOAlgoritmo codiciosoDQN
Tipo único0.910.860.740.78
Múltiples tipos independientes0.880.810.70.73
Múltiples tipos entrelazados0.850.760.650.68
Flujo de trabajo de múltiples etapas0.830.730.610.66
Colaboración entre departamentos0.80.70.590.63
Inserción temporal0.860.780.680.72
Período de repetición0.840.750.640.69

Tabla 1: Comparación del Índice de Estabilidad de Programación entre Diferentes Complejidades de Actividades. Se comparan los índices de estabilidad de programación de los modelos Transformer–PPO, memoria a corto y largo plazo–PPO (LSTM–PPO), búsqueda voraz y red profunda Q (DQN) en siete condiciones: actividades de un solo tipo, actividades múltiples independientes, actividades múltiples superpuestas, flujos de trabajo multietapa, colaboración interdepartamental, inserción de tareas temporales y actividades de ciclo repetido. El índice de estabilidad oscila entre 0 y 1, donde valores más altos indican mayor resistencia a las perturbaciones en la programación y salidas de política más consistentes.

Condición de concurrencia de tareasModelo de programaciónÍndice de equilibrio de recursosÍndice de robustez de transferencia de políticas
Baja concurrencia (100 tareas)Transformer-PPO0.940.92
LSTM-PPO0.890.85
Algoritmo voraz0.830.78
DQN0.850.81
Concurrencia media (500 tareas)Transformer-PPO0.910.89
LSTM-PPO0.860.82
Algoritmo voraz0.780.71
DQN0.810.76
Alta concurrencia (1000 tareas)Transformer-PPO0.880.85
LSTM-PPO0.820.76
Algoritmo voraz0.70.63
DQN0.750.68

Tabla 2: Evaluación de la Adaptabilidad a la Carga de Concurrencia de Tareas. Se comparan el índice de equilibrio de recursos y el índice de robustez de transferencia de políticas de los cuatro modelos de planificación bajo condiciones de baja, media y alta concurrencia, correspondientes a 100, 500 y 1.000 tareas simultáneas, respectivamente. Ambos índices varían de 0 a 1, donde valores más altos indican una asignación de recursos más equilibrada y una mayor consistencia en las políticas de planificación frente a cambios en la carga de tareas.

MétodoRetraso promedio de respuesta (s)Tasa de conflicto de recursosUtilización de recursosÍndice de estabilidad
Transformer+DQN2.13 ± 0.120.18 ± 0.020.68 ± 0.030.76 ± 0.04
GRU+PPO1.89 ± 0.090.15 ± 0.010.72 ± 0.020.79 ± 0.03
GraphSAGE+PPO1.72 ± 0.080.13 ± 0.010.74 ± 0.020.82 ± 0.03
Propuesto1.59 ± 0.050.09 ± 0.010.82 ± 0.020.88 ± 0.02
(Transformer+PPO)

Tabla 3: Comparación de rendimiento con métodos adicionales de última generación. Se compara el método propuesto Transformer–PPO con Transformer–DQN, unidad de memoria recurrente con puertas–PPO (GRU–PPO) y GraphSAGE–PPO bajo condiciones experimentales idénticas con una densidad de tareas de 1.000. Los resultados representan los valores promedio de 10 ejecuciones independientes. Las métricas evaluadas incluyen el retardo de respuesta en segundos, la tasa de conflictos por recursos, la tasa de utilización de recursos y el índice de estabilidad en la programación. Retardos de respuesta y tasas de conflicto más bajas indican un mejor rendimiento, mientras que tasas de utilización de recursos e índices de estabilidad más altos indican un mejor rendimiento.

Discusión

Los resultados experimentales demuestran que el algoritmo propuesto Transformer-PPO supera consistentemente a los métodos de referencia (LSTM-PPO, búsqueda codiciosa y DQN) en todas las métricas de evaluación. El rendimiento superior se puede atribuir a dos factores clave. Primero, el mecanismo de autoatención multi-cabeza del Transformer captura de manera efectiva las dependencias temporales de largo alcance en las secuencias de estados de actividad y recursos, lo que permite la identificación proactiva de posibles conflictos. Esto explica por qué la tasa de conflictos permanece baja incluso bajo alta complejidad (por ejemplo, colaboración entre departamentos e inserción temporal), ya que el modelo puede anticipar la competencia por recursos antes de que ocurra. Segundo, la función objetivo recortada y la corrección del valor de ventaja basada en GAE en PPO garantizan actualizaciones estables de la política, evitando fluctuaciones drásticas en las decisiones de programación y manteniendo una alta robustez bajo cargas de trabajo variables.

En comparación con los enfoques de planificación existentes, el método propuesto aborda las limitaciones de los modelos basados en LSTM que sufren de gradientes que desaparecen en secuencias largas, y supera la baja generalización de los métodos voraces y DQN en entornos dinámicos. Aunque LSTM-PPO muestra un rendimiento moderado, no logra mantener la estabilidad cuando las dependencias entre tareas abarcan largos horizontes temporales, como se refleja en sus tasas más altas de conflictos y menor equilibrio de recursos bajo alta concurrencia. El algoritmo voraz, aunque computacionalmente eficiente, carece de visión prospectiva y conduce a una asignación subóptima de recursos, aumentando los retrasos en la respuesta. Por otro lado, DQN presenta oscilación de políticas debido a la falta de una restricción de región de confianza, lo que degrada su rendimiento en escenarios con múltiples tareas.

Sin embargo, este estudio tiene varias limitaciones. El conjunto de datos se deriva de una única unión empresarial, lo que podría limitar la generalización de los hallazgos a otros contextos organizacionales. Además, el modelo supone que toda la información sobre actividades y recursos es completamente observable, lo cual puede no cumplirse en entornos del mundo real donde los datos son incompletos o ruidosos. La sobrecarga computacional del codificador Transformer también aumenta con la longitud de la ventana histórica, lo que podría afectar la aplicabilidad en tiempo real en sistemas de escala extremadamente grande.

Trabajos futuros pueden centrarse en extender el modelo para manejar entornos parcialmente observables utilizando estimación recurrente de estados, e incorporar técnicas de metaaprendizaje para permitir una rápida adaptación a nuevas uniones con datos históricos limitados. También planeamos implementar el algoritmo en una arquitectura colaborativa nube-borde para reducir la latencia de decisión y apoyar la programación distribuida. Además, la integración de componentes de inteligencia artificial interpretable podría proporcionar razones interpretables para la programación a los operadores humanos, mejorando la confianza y la adopción práctica.

Este artículo estudia un algoritmo dinámico de optimización de programación que integra Transformer y el aprendizaje por refuerzo PPO, centrándose en los frecuentes conflictos de recursos y los retrasos de respuesta en la programación de actividades sindicales. El algoritmo examina minuciosamente las características espacio-temporales del historial de actividades y del estado de los recursos mediante un mecanismo de atención multi-cabeza, mejorando así la capacidad de identificar riesgos potenciales de conflicto. Combinado con el mecanismo de actualización estable de la estrategia para la función objetivo de recorte, logra una respuesta eficiente y una asignación óptima de recursos en un entorno dinámico. Este método demuestra excelentes capacidades de estabilidad en la programación, utilización de recursos y control de conflictos para tipos complejos y diversos de actividades y cargas de trabajo. El análisis empírico muestra que el algoritmo presenta un retardo de respuesta pequeño bajo alta densidad de tareas. En siete tipos diferentes de actividades y complejidades, la tasa de conflicto de recursos oscila entre 0,05 y 0,12, la utilización promedio de recursos está entre 0,75 y 0,86, y el índice de estabilidad en la programación varía de 0,8 a 0,91. Mantiene una tasa baja de conflictos de recursos y un alto equilibrio en la utilización, resultados significativamente mejores que los de los modelos actuales predominantes de programación LSTM-PPO, búsqueda voraz y DQN. Al mismo tiempo, tanto la robustez de la transferencia de estrategias como la estabilidad en la programación son buenas, lo que indica que el algoritmo posee una fuerte adaptabilidad y capacidad anti-interferencias. Esta ventaja de desempeño proporciona un sólido respaldo técnico al sistema de gestión de actividades sindicales en escenarios dinámicos y cambiantes de programación de recursos.

Divulgaciones

Los autores declaran que no tienen conflictos financieros de interés.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Lenguaje de programación principal
PyTorch 1.12Meta AIhttps://pytorch.org/get-started/previous-versions/Entorno de aprendizaje profundo (implementación de Transformer/PPO)
NumPy 1.23Desarrolladores de NumPyhttps://numpy.org/doc/stable/release/1.23.0-notes.htmlBiblioteca para cálculos numéricos
Matplotlib 3.5Equipo de desarrollo de Matplotlibhttps://matplotlib.org/stable/users/installing.htmlVisualización de resultados
Conjunto de datos de programación de actividades sindicalesBase de datos interna de una empresa colaboradora (anonimizada)No disponible públicamente debido a un acuerdo de confidencialidad; los investigadores pueden contactar al autor correspondiente para obtener accesoMás de 5.000 registros de actividades (reuniones, capacitaciones, entretenimiento) de un sindicato de una gran empresa durante tres años
NVIDIA A100 GPU
PyTorch

Referencias

  1. Bosire RK, Muya J, Matula D. Employee recognition programs and employee output as moderated by workers’ union activities: evidence from Kenyatta National Hospital (KNH), Kenya. Saudi J Bus Manag Stud. 2021;6(3):61-70.
  2. Carneiro B, Costa HA. Digital unionism as a renewal strategy? Social media use by trade union confederations. J Ind Relat. 2022;64(1):26-51.
  3. Geelan T. Introduction to the special issue: the internet, social media and trade union revitalization—still behind the digital curve or catching up? New Technol Work Employ. 2021;36(2):123-39.
  4. Hennebert MA, Pasquier V, Lévesque C. What do unions do…with digital technologies? An affordance approach. New Technol Work Employ. 2021;36(2):177-200.
  5. Panagiotopoulos P. Digital audiences of union organising: a social media analysis. New Technol Work Employ. 2021;36(2):201-18.
  6. Wang W, Seifert R. Trade-union-engendered employee trust in senior management: a case study of digitalisation. Ind Relat J. 2024;55(6):472-91.
  7. Katsabian T. Collective action in the digital reality: the case of platform-based workers. Mod Law Rev. 2021;84(5):1005-40.
  8. Holgate J. Trade unions in the community: building broad spaces of solidarity. Econ Ind Democr. 2021;42(2):226-47.
  9. Ovi RP, Rana MS, Jodder PK, Sarkar B. Performance evaluation of e-service delivery of union digital centers at the local level using composite indexing method: a study of Batiaghata upazilla in Khulna district. Inf Dev. 2024;40(4):620-34.
  10. Crossan J, et al. Colours of democracy: trade union banners and the contested articulations of democratic spatial practices. Trans Inst Br Geogr. 2023;48(1):23-38.
  11. Victor C, Kavishe AM. The challenges faced by trade unions in improving employee welfare and strategies to address them: a case of the Tanzania Union of Government and Health Employees (TUGHE) at the National Health Insurance Fund (NHIF). Afr J Empir Res. 2025;6(1):189-200.
  12. Rogalewski A. Trade unions challenges in organising Polish workers: a comparative case study of British and Swiss trade union strategies. Eur J Ind Relat. 2022;28(4):385-404.
  13. Pacetti V, Rossi P, Romens AI. Remotizzare, o non remotizzare: questo è il dilemma. Imprese e sindacati di fronte alla remotizzazione ibrida del lavoro. Stato Merc. 2023;43(3):421-49.
  14. Hunt T, Connolly H. COVID-19 and the work of trade unions: adaptation, transition and renewal. Ind Relat J. 2023;54(2):150-66.
  15. Joyce S, Stuart M, Forde C. Theorising labour unrest and trade unionism in the platform economy. New Technol Work Employ. 2023;38(1):21-40.
  16. Dupuis M. Algorithmic management and control at work in a manufacturing sector: workplace regime, union power and shopfloor conflict over digitalisation. New Technol Work Employ. 2025;40(1):81-101.
  17. Suryadevara S. Real-time task scheduling optimization in WirelessHART networks: challenges and solutions. Int J Adv Eng Technol Innov. 2022;1(3):29-55.
  18. Roşu D, Cojanu F, Ştefănică V, et al. Experimental management of work collectives through social and socialization activities. J Phys Educ Sport. 2022;22(7):1742-47.
  19. Ahmed AAA, et al. Multi-project scheduling and material planning using Lagrangian relaxation algorithm. Ind Eng Manag Syst. 2021;20(4):580-87.
  20. Gao H, et al. TBDB: token bucket-based dynamic batching for resource scheduling supporting neural network inference in intelligent consumer electronics. IEEE Trans Consum Electron. 2024;70(1):1134-44.
  21. Ouhame S, Hadi Y, Ullah A. An efficient forecasting approach for resource utilization in cloud data centers using a CNN-LSTM model. Neural Comput Appl. 2021;33(16):10043-55.
  22. Valarmathi K, Kanaga Suba Raja S. Resource utilization prediction technique in the cloud using a knowledge-based ensemble random forest with an LSTM model. Concurr Eng. 2021;29(4):396-404.
  23. Yang Y, Shen H. Deep reinforcement learning enhanced greedy optimization for online scheduling of batched tasks in cloud HPC systems. IEEE Trans Parallel Distrib Syst. 2022;33(11):3003-14.
  24. Tang B, Luo J, Obaidat MS, Vijayakumar P. Container-based task scheduling in a cloud-edge collaborative environment using a priority-aware greedy strategy. Cluster Comput. 2023;26(6):3689-705.
  25. Zhang Y, Zou YH, Zhang XD. Manufacturing resource scheduling based on a deep Q-network. Wuhan Univ J Nat Sci. 2022;27(6):531-38.
  26. Mangalampalli S, et al. DRLBTSA: deep reinforcement learning-based task-scheduling algorithm in cloud computing. Multimed Tools Appl. 2024;83(3):8359-87.
  27. Wang Y, Wang Q, Chu X. Energy-efficient online scheduling of transformer inference services on GPU servers. IEEE Trans Green Commun Netw. 2022;6(3):1649-59.
  28. Liu L, et al. Dynamic sparse attention for scalable transformer acceleration. IEEE Trans Comput. 2022;71(12):3165-78.
  29. He X, et al. Channel assignment and power allocation for throughput improvement with PPO in B5G heterogeneous edge networks. Digit Commun Netw. 2024;10(1):109-16.
  30. Liu H, et al. A new multi-domain cooperative resource scheduling method using proximal policy optimization. Neural Comput Appl. 2024;36(9):4931-45.
  31. Jin J, Xu Y. Optimal policy characterization enhanced proximal policy optimization for multitask scheduling in cloud computing. IEEE Internet Things J. 2022;9(9):6418-33.
  32. Chavva M, Veera S. Dynamic cost-aware language models: a real-time framework for optimizing cloud resource recommendations. Int J Mach Learn Sustain Dev. 2023;5(2):1-15.
  33. Zhao Z, et al. Link scheduling using graph neural networks. IEEE Trans Wirel Commun. 2023;22(6):3997-4012.
  34. Zhang Z, et al. A resource optimization scheduling model and algorithm for heterogeneous computing clusters based on GNN and RL. J Supercomput. 2024;80(16):24138-72.
  35. Chai F, et al. Joint multi-task offloading and resource allocation for mobile edge computing systems in satellite IoT. IEEE Trans Veh Technol. 2023;72(6):7783-95.
  36. Luo Q, et al. Resource scheduling in edge computing: a survey. IEEE Commun Surv Tutor. 2021;23(4):2131-65.
  37. Gupta A, Namasudra S, Kumar P. An enhanced strategy for energy-efficient cloud computing environment through VM consolidation. In: Dagur A, Singh K, Mehra PS, Shukla DK, editors. Intelligent Computing and Communication Techniques. Boca Raton (FL): CRC Press; 2025. p. 330–34. https://doi.org/10.1201/9781003530176-46
  38. Sombo B, Apeh ST, Edeoghon IA. Review on authentication algorithms in cellular communication networks. Cloud Comput Data Sci. 2025;6(1):54-66.
  39. Gupta A, Kumar P, Namasudra S. Sustainable cloud computing: an enhanced energy-efficient VM consolidation approach using live migration. Iran J Comput Sci. 2026;9:27. doi:10.1007/s42044-025-00385-y.
  40. García F, et al. Traffic optimization through waiting prediction and evolutive algorithms. Int J Interact Multimed Artif Intell. 2025;9(3):96-103.
  41. Sharma P, Namasudra S, Lorenz P. Blockchain-based cloud storage system with enhanced optimization and integrity preservation. Presented at: IEEE International Conference on Communications (ICC); Rome, Italy; 2023. p. 3744-49.
  42. Ding F, et al. Transformer-enhanced DQN approach for energy- and cost-efficient large-scale dynamic workflow scheduling in a heterogeneous environment. IEEE Internet Things J. 2024;11(22):37351-67.
  43. Yu H, Tang N, Zhu Z, Guo Z. Flexible job-shop scheduling via gated recurrent unit and deep reinforcement learning. Knowl Based Syst. 2025;330:114734. doi:10.1016/j.knosys.2025.114734.
  44. Do KH, et al. Graph Neural PPO for joint user association and resource allocation in Open RAN [conference paper]. Presented at: 40th International Conference on Information Networking (ICOIN); Hanoi, Vietnam; 2026. p. 37-42.

Reimpresiones y permisos

Etiquetas

Algoritmo TransformerOptimización de Política PróximaAtención Multi-cabezalEstabilidad de la ProgramaciónAsignación de RecursosCaracterísticas EspaciotemporalesPercepción del Riesgo de Conflicto