Datos experimentales
Para evaluar exhaustivamente el rendimiento del algoritmo de programación dinámica Transformer-PPO presentado en este artículo, el experimento utiliza datos de gestión de actividades de un gran sindicato empresarial de los últimos tres años como conjunto de datos de referencia. Este conjunto contiene más de 5.000 registros de actividades, que abarcan diversos tipos, incluyendo reuniones, capacitaciones y entretenimiento, con información de programación para múltiples recursos, tales como instalaciones, equipos y personal. Cada registro detalla la hora de inicio y finalización de la actividad, los requisitos de recursos, la prioridad y el estado real de ejecución (incluyendo eventos de conflicto y utilización de recursos). Para simular cambios dinámicos en escenarios reales, los datos se amplían con un 10 % adicional de tareas aleatorias repentinas y eventos de cambio de recursos (como ocupación temporal de sitios y ajustes en las ventanas de tiempo del personal), con el fin de verificar la robustez del algoritmo en un entorno altamente incierto. La secuencia continua de estados proporciona una entrada estructurada para la modelización temporal del Transformer y el entrenamiento de la política PPO. El experimento comparó el rendimiento de la programación bajo diferentes densidades y complejidades de tareas para asegurar que la evaluación cubra escenarios típicos en aplicaciones reales, y lo comparó con el modelo LSTM-PPO actualmente popular, un modelo de programación basado en búsqueda voraz y un modelo de programación con política DQN.
El codificador Transformer consta de 3 capas, cada una con 4 cabezales de atención, una dimensión de incrustación de 128 y un tamaño oculto de alimentación directa de 256. La red de políticas y la red de valor comparten la misma salida del Transformer como entrada y luego se dividen en dos perceptrones multicapa (MLP) separados. Cada MLP tiene dos capas ocultas con 256 y 128 neuronas, respectivamente, utilizando activación ReLU. Todas las capas lineales se inicializan utilizando la inicialización uniforme de Xavier.
El optimizador es Adam con una tasa de aprendizaje de 3 × 10-4, un tamaño de lote de 64 y un coeficiente de entropía de 0,01. El parámetro de recorte de PPO ε se establece en 0,2, el factor de descuento γ = 0,99 y el GAE λ = 0,95. El modelo se entrena durante 5.000 episodios, cada uno con hasta 100 pasos de programación. Se aplica recorte de gradiente con una norma máxima de 0,5 para prevenir la explosión de gradientes. Estos parámetros se seleccionan mediante una búsqueda preliminar en cuadrícula y son coherentes con las prácticas comunes en tareas de programación basadas en aprendizaje por refuerzo. Todos los experimentos se ejecutan en un solo acelerador GPU (memoria de 40 GB), utilizando Python 3.9 y un marco de aprendizaje profundo (véase la Tabla de Materiales).
Tendencia temporal de la salida de la atención múltiple, mejora residual bajo variación temporal de las características de codificación y estratificación de prioridad de tareas
Utilizando el historial de programación real como entrada, se extraen la solicitud de tareas, el estado de uso de recursos y el estado de ejecución de retroalimentación en pasos de tiempo continuos, y se integra información de múltiples tipos en un espacio de características unificado mediante mapeo lineal y codificación posicional. El mecanismo de atención múltiple calcula en paralelo las correlaciones temporales entre diferentes secuencias de características, generando tres tipos de secuencias de pesos de atención: tarea, recurso y retroalimentación. Cada tipo de peso representa la intensidad de atención del modelo hacia el estado correspondiente en cada paso de tiempo. Tras la normalización, se traza una curva de tendencia que refleja el enfoque de percepción de la capa de codificación y la estructura de cambio dinámico en diferentes dimensiones de información dentro del historial de programación. Este proceso se completa basándose en la trayectoria real de ejecución de las actividades y en el registro de uso de recursos en el escenario de programación.
Figura 4 muestra la tendencia dinámica de atención del mecanismo de atención multi-cabeza sobre diferentes informaciones de estado en la programación de actividades sindicales. El paso de tiempo se encuentra en el eje horizontal, reflejando el avance continuo de la secuencia de programación, y el eje vertical representa el peso de atención normalizado, limitado entre [0,1], que indica la importancia relativa que el modelo otorga a las características de la tarea, el estado de los recursos y el estado de retroalimentación. La atención hacia las características de la tarea muestra un pico claro alrededor del paso 15. En las etapas iniciales de la programación, el modelo prioriza capturar las características temporales de las tareas clave para predecir posibles conflictos y cuellos de botella de recursos, lo que refleja la sensibilidad al riesgo en esta fase de la programación de actividades. La curva de atención respecto al estado de los recursos muestra fluctuaciones periódicas, y el peso de atención global oscila entre 0,2 y 0,8, lo que indica el seguimiento continuo por parte del sistema de programación de los cambios en la ocupación de recursos, apoyando el procesamiento complejo del uso compartido y la asignación de recursos, y respondiendo eficazmente a la competencia dinámica por los recursos entre múltiples tareas concurrentes. La atención al estado de retroalimentación aumenta gradualmente, y el pico de peso aparece cerca del paso 35, destacando la atención del modelo a la retroalimentación sobre los resultados de ejecución y las condiciones anómalas en las etapas intermedias y finales de la programación, lo que ayuda a ajustar la estrategia para manejar desviaciones en la programación y mejorar la robustez de la programación general. Esta tendencia muestra que una estructura de codificación que integra el mecanismo de atención multi-cabeza puede captar cambios sutiles en las características temporales y potenciar la adaptabilidad de las estrategias de programación a recursos diversos y dependencias complejas entre tareas, mejorando así la eficiencia y estabilidad general de la programación dinámica de actividades sindicales.
Se procesa la secuencia de codificación de estado oculto y la estructura de respuesta de características de la tarea. La parte de comparación de estados construye las rutas de propagación de características antes y después de la conexión residual bajo la misma condición de entrada, observa la evolución temporal del estado oculto a través de pasos de tiempo consecutivos y extrae sus características de estabilidad local y continuidad global para analizar la evolución suave de la expresión de estado durante la transmisión de información. La tendencia de respuesta según prioridad de tarea se extrae de la ruta de activación de características a través de diferentes estrategias de ponderación de programación. Al rastrear los niveles de activación de diferentes categorías de tareas a lo largo del tiempo, se captura el efecto dinámico del modelo sobre la capacidad de diferenciación de tareas.
Figura 5A muestra la tendencia del estado oculto del modelo antes y después de aplicar el mecanismo de conexión residual. El eje horizontal representa el paso de tiempo, y el eje vertical representa el valor del estado oculto. La salida original sin conexión residual fluctúa ampliamente, mostrando inestabilidad local pronunciada e interrupciones de tendencia. La línea continua azul representa el valor del estado tras aplicar la estructura residual. La tendencia general permanece estable, y las fluctuaciones se reducen significativamente, lo que indica que el modelo logra amortiguar el gradiente y mejorar las características durante la propagación del estado. Este fenómeno verifica el papel del mecanismo residual en mejorar la estabilidad de estructuras con dependencias a largo plazo, suprimiendo eficazmente la atenuación de información provocada por capas más profundas, y potenciando la capacidad expresiva continua de las secuencias de estados históricos. Figura 5B describe la dinámica de activación de características de tres tipos de tareas en una serie temporal. El eje horizontal es el paso de tiempo, y el eje vertical es el valor de activación de características, lo que refleja la sensibilidad temporal y la atención estratégica de las tareas en diferentes niveles de prioridad. Las tareas de baja prioridad muestran una tendencia decreciente, y el valor de activación de características decae por debajo de 0,5 en la etapa posterior, lo que indica que el modelo les presta la debida atención en la etapa inicial de planificación y debilita progresivamente la respuesta de recursos con el tiempo; las características de las tareas de prioridad media aumentan lentamente con el tiempo y presentan oscilaciones periódicas, lo que refleja que el modelo realiza una percepción y seguimiento flexible ante sus fluctuaciones de demanda; las tareas de alta prioridad mantienen una tendencia ascendente continua en el tiempo, y el valor de activación de características permanece siempre por encima de 2, con un nivel de activación alto y estable, lo que indica que el modelo mantiene constantemente un alto grado de respuesta ante tales tareas. Esta respuesta diferencial demuestra la capacidad del módulo de codificación de estado para identificar con precisión los atributos de las tareas y proporciona una base jerárquica para la toma de decisiones en la generación de estrategias de planificación.
Análisis multidimensional de la evolución del rendimiento del algoritmo dinámico de programación Transformer-PPO
Basado en la codificación mediante Transformer de secuencias históricas de programación y estado de recursos, se extraen características espacio-temporales como entrada de estado para PPO; luego, la red de políticas genera la acción de programación, y el entorno proporciona recompensas inmediatas y actualiza el estado; durante el proceso de entrenamiento, se registran los indicadores originales de cada ronda, y posteriormente se elimina el ruido mediante un filtro de promedio móvil, analizándose así la tendencia de convergencia del algoritmo; en la visualización final, los datos originales muestran dinámicas instantáneas, mientras que la curva suavizada refleja la mejora del rendimiento a largo plazo, lo que verifica que el modelo logra una programación estable mediante modelado de series temporales y optimización de políticas.
Figura 6A,B muestra el análisis de evolución del rendimiento multidimensional del algoritmo dinámico de programación Transformer-PPO. Las fluctuaciones en los datos originales reflejan el ruido instantáneo en el proceso de programación, mientras que los datos suavizados extraen la tendencia a largo plazo mediante un promedio móvil, eliminando la interferencia de perturbaciones a corto plazo en la evaluación del rendimiento del algoritmo y facilitando la observación de la evolución del rendimiento. Analizando los datos suavizados, la relación dinámica entre la recompensa y la entropía de la política muestra que la curva de recompensa presenta un crecimiento logarítmico, y la política aprende rápidamente a programar acciones de forma eficaz mediante la exploración; en la etapa posterior, el crecimiento tiende a estabilizarse, y el valor de saturación de la recompensa se mantiene alrededor de 12, lo que indica que la política se encuentra cerca del óptimo local. La entropía de la política decae gradualmente desde aproximadamente 2,2 al inicio hasta unos 0,6. PPO mantiene la capacidad necesaria de exploración a través del término de recompensa por entropía. Una exploración alta (alta entropía) en las primeras etapas promueve un aumento rápido de las recompensas, mientras que la estrategia posterior equilibra exploración y explotación mediante poda y actualización. La optimización coordinada de la tasa de conflictos y la utilización de recursos muestra que la tasa de conflictos disminuye a niveles inferiores al 10 %, y su límite inferior refleja conflictos que no pueden eliminarse en el sistema real debido a la aleatoriedad de las tareas. Esta tendencia descendente se atribuye directamente a la capacidad del Transformer para codificar secuencias históricas de actividad, permitiendo al modelo predecir proactivamente la contención de recursos. La utilización de recursos ha aumentado hasta casi el 75 %, en concordancia con la ley de rendimientos marginales decrecientes. Es razonable que la utilización no alcance niveles más altos, ya que una utilización excesiva podría provocar retrasos por colas. La reducción de conflictos ha liberado más recursos disponibles, y la asignación optimizada de recursos ha suprimido aún más los conflictos.
Evaluación de la velocidad de respuesta y la eficiencia en la toma de decisiones
Comparación del tiempo medio de decisión y del retardo medio de respuesta bajo diferentes densidades de tareas (número de tareas: 100, 300, 500, 700, 1000). Comparación del modelo de programación Transformer-PPO presentado en este artículo con el modelo LSTM-PPO, el modelo de programación por búsqueda voraz y el modelo de programación estratégica DQN.
Figura 7A,B muestra el tiempo medio de decisión y el retardo medio de respuesta para las cuatro estrategias de programación en diferentes condiciones de densidad de tareas, reflejando la capacidad del algoritmo para tomar decisiones en tiempo real y la capacidad de respuesta del sistema en escenarios con alta carga. A medida que aumenta el número de tareas, cada estrategia muestra una tendencia ascendente en ambos indicadores, aunque las magnitudes del aumento y la estabilidad varían. En escenarios con alta intensidad de tareas, la estructura Transformer-PPO mantiene un rendimiento relativamente estable en cuanto al tiempo medio de decisión. Cuando la densidad de tareas es de 1000, el tiempo medio de decisión es de 0,72 s y el retardo medio de respuesta es de 1,59 s, lo cual se debe principalmente al efecto de compresión del codificador de características temporales en el espacio de estados y a la evitación eficaz de operaciones inválidas en el espacio de acciones. En contraste, la estrategia DQN presenta tiempos de decisión y retardos de respuesta más largos a medida que aumenta el número de tareas, lo que refleja su capacidad limitada para generalizar políticas en transiciones de estados de alta dimensión. Aunque la estrategia Greedy toma decisiones más rápidamente en diferentes cantidades de tareas, su rendimiento de respuesta se degrada en grafos de tareas complejos debido a la falta de modelado de dependencias a largo plazo. LSTM-PPO posee cierta capacidad de percepción temporal en el modelado de secuencias, pero su desempeño es deficiente en escenarios con dependencias a largo plazo debido a la profundidad estructural limitada. Los resultados revelan el impacto clave del diseño estructural en la capacidad de respuesta del sistema de programación y subrayan la necesidad de una optimización coordinada del mecanismo de codificación y de la eficiencia en el muestreo de políticas bajo condiciones de alta concurrencia.
Evaluación de la tasa de conflictos y de la utilización de recursos
Bajo diferentes condiciones de complejidad del tipo de actividad (tipo único, múltiples tipos independientes, múltiples tipos cruzados, flujo de trabajo multietapa, colaboración interdepartamental, inserción temporal, ciclo repetido), se analizan estadísticamente la tasa de conflictos de recursos y la tasa promedio de utilización de recursos. El modelo de programación Transformer-PPO presentado en este artículo se compara con los modelos de programación LSTM-PPO, búsqueda voraz y DQN.
Figura 8A,B muestra la tasa de conflicto de recursos y la utilización media de recursos para diferentes modelos de programación en siete niveles de complejidad de actividades. El eje vertical representa el modelo de programación y el eje horizontal representa el tipo de actividad. La tendencia general indica que, a medida que aumenta la complejidad de la estructura de la actividad (como procesos multietapa, colaboración interdepartamental, inserción temporal y ciclos repetidos), la tasa de conflicto aumenta en todos los modelos. La estrategia voraz y el esquema DQN muestran una adaptabilidad limitada a los cambios dinámicos y son claramente insuficientes en el control de conflictos. El modelo Transformer-PPO mantiene aún una tasa baja de conflictos bajo condiciones de alta complejidad, con una tasa de conflicto de recursos general entre 0,05 y 0,12, lo que refleja su profundo entendimiento de la estructura de dependencias de tareas y los cambios en los recursos. En cuanto a la utilización de recursos, Transformer-PPO mantiene un nivel alto en todas las condiciones, especialmente con cruces de múltiples tipos e inserción temporal. Su estrategia de ajuste dinámico reduce eficazmente la inactividad de los recursos, con una tasa media de utilización de recursos entre 0,75 y 0,86. Los datos confirman que el modelo Transformer-PPO logra un mejor equilibrio entre flexibilidad en la programación y eficiencia en el uso de recursos, ofreciendo mayor practicidad y escalabilidad.
Estabilidad de la programación
El índice de estabilidad de la programación se calcula bajo diferentes condiciones de complejidad del tipo de actividad (tipo único, múltiples tipos independientes, múltiples tipos cruzados, proceso multifase, colaboración interdepartamental, inserción temporal y ciclo repetido). El modelo de programación Transformer-PPO presentado en este artículo se compara con los modelos LSTM-PPO, búsqueda voraz y DQN.
Tabla 1 presenta los resultados de comparación del índice de estabilidad de programación entre diferentes modelos de programación bajo siete condiciones de complejidad de tipos de actividades. El tipo de complejidad seleccionado refleja el rendimiento de estabilidad del sistema de programación en múltiples escenarios. El valor del índice oscila entre 0 y 1. Cuanto mayor sea el valor, mayor será la resistencia del modelo a las perturbaciones en la programación y más estable será la salida de la estrategia. Los resultados experimentales muestran que Transformer-PPO mantiene un índice de estabilidad alto en todas las estructuras de tareas. Especialmente en escenarios de colaboración multi-tipo, interdepartamental y de ciclos repetidos, la estabilidad de su estrategia de programación es superior a la de otros modelos, lo que demuestra sólidas capacidades de preservación estructural y de programación adaptativa. El índice de estabilidad general de la programación oscila entre 0,8 y 0,91. En contraste, la estabilidad del algoritmo voraz y de la DQN disminuyó significativamente a medida que la estructura de la tarea se volvió más compleja, con evidentes fluctuaciones en la política y desviaciones en la ejecución. LSTM-PPO muestra cierta estabilidad, pero su rendimiento general sigue siendo inferior al de Transformer-PPO. Esta comparación verifica las contribuciones positivas del mecanismo de atención multi-cabeza y del mecanismo de actualización con poda de políticas a la estabilidad de la salida de programación, destacando la ventaja del modelo en escenarios complejos de actividades combinadas.
Análisis de adaptación a la carga de concurrencia de tareas
A medida que el número de tareas concurrentes sigue aumentando, el sistema de planificación debe abordar los dos desafíos de los conflictos en la distribución de recursos y la reducción de la generalización de la política. Para evaluar la adaptabilidad de planificación de diferentes modelos ante el incremento de carga de tareas, en esta sección se establecen tres niveles de concurrencia de tareas (bajo: 100 elementos, medio: 500 elementos y alto: 1000 elementos) con el fin de monitorear la distribución de recursos del sistema y la consistencia de la respuesta de la política durante el ciclo de planificación. El índice de equilibrio de recursos se utiliza para reflejar el equilibrio de carga de diferentes unidades de recursos durante el proceso de planificación, y se calcula de la siguiente manera:
(7)
ui representa la tasa real de utilización de las unidades de recursos; ū representa la tasa promedio de utilización de todos los recursos; y N representa el número total de recursos. El rango de valores es [0,1], y cuanto más cercano a 1, más equilibrada es la distribución de recursos.
El índice de robustez en la transferencia de políticas Rs mide el grado de consistencia de la salida de la política bajo diferentes condiciones de carga de tareas y se define como:
(8)
πt(L) y πt(H) son las distribuciones de estrategias de programación bajo escenarios de carga baja y carga alta, respectivamente, y T es el paso de tiempo total. Cuanto más cercano sea a 1, mayor será la robustez de la migración de estrategias y mayor la adaptabilidad.
Tabla 2 presenta sistemáticamente el desempeño de los cuatro modelos de planificación en términos de equilibrio de recursos y robustez en la transferencia de políticas bajo cargas variables de concurrencia de tareas. Los niveles de concurrencia de tareas se establecen como bajos (100 elementos), medios (500 elementos) y altos (1000 elementos), respectivamente, reflejando la adaptabilidad del modelo ante diferentes presiones de escala de tareas. Los resultados muestran que el modelo Transformer-PPO alcanza el índice más alto de equilibrio de recursos en todos los niveles de carga, lo que refleja su capacidad para asignar racionalmente los recursos en escenarios concurrentes de múltiples tareas. Al mismo tiempo, el índice de robustez en la transferencia de políticas también es significativamente mejor que el del modelo de comparación, mostrando una fuerte consistencia y adaptabilidad de la política. Bajo condiciones de alta concurrencia, los índices de equilibrio de recursos y de robustez en la transferencia de políticas son 0,88 y 0,85, respectivamente. En comparación, LSTM-PPO ocupó el segundo lugar, mientras que el algoritmo Greedy y el modelo DQN mostraron una degradación significativa del desempeño bajo cargas altas, con una distribución desigual de recursos y fluctuaciones de política más pronunciadas. Esta evaluación reveló claramente las diferencias en la gestión de recursos y la robustez de las políticas en el sistema de planificación ante el aumento de la carga de tareas, y verificó además la aplicabilidad y superioridad de la solución de fusión Transformer-PPO para la programación dinámica y compleja de actividades conjuntas.
Comparación con métodos adicionales de vanguardia
Para evaluar aún más el método propuesto frente a enfoques recientes de última generación (SOTA), se implementaron tres algoritmos representativos de la literatura más reciente que combinan aprendizaje profundo con aprendizaje por refuerzo para problemas de planificación: (1) Transformer+DQN42, que utiliza el mismo codificador Transformer que el nuestro, pero sustituye PPO por DQN en el aprendizaje de la política, como se ha explorado en estudios recientes de planificación basados en valores; (2) GRU+PPO43, que reemplaza el codificador Transformer por una unidad recurrente con puertas (Gated Recurrent Unit, GRU) para capturar dependencias temporales, representando métodos avanzados basados en RNN; y (3) GraphSAGE+PPO44, que emplea un codificador GraphSAGE para modelar las relaciones entre tareas y recursos como grafos, reflejando enfoques recientes de redes neuronales en grafos aplicadas a la planificación. Todos los métodos se entrenaron bajo condiciones experimentales idénticas (mismo conjunto de datos, densidad de tareas de 1000 y configuración de episodios) con los hiperparámetros ajustados mediante búsqueda en cuadrícula para garantizar una comparación justa. Cada método se evaluó en 10 ejecuciones independientes, y se registraron los valores promedio de métricas clave de rendimiento (retraso de respuesta, tasa de conflictos de recursos, utilización de recursos e índice de estabilidad de la planificación).
Como se muestra en la Tabla 3, el método propuesto Transformer+PPO supera consistentemente a los tres modelos básicos SOTA en todas las métricas evaluadas. El retardo promedio de respuesta del método propuesto (1,59 s) es significativamente menor que el de Transformer+DQN (2,13 s), GRU+PPO (1,89 s) y GraphSAGE+PPO (1,72 s), lo que indica una eficiencia superior en la toma de decisiones. La tasa de conflicto de recursos del método propuesto (0,09) también es la más baja, lo que indica una mejor prevención proactiva de conflictos. Esta mejora se atribuye a la atención multi-cabeza del Transformer, que captura dependencias de largo alcance de manera más efectiva que el GRU o GraphSAGE, combinada con las actualizaciones de política estables del PPO. En cuanto a la utilización de recursos, el método propuesto alcanza un valor de 0,82, superando a los demás en al menos 8 puntos porcentuales, lo que demuestra una asignación de recursos más eficiente. El índice de estabilidad del método propuesto (0,88) también es el más alto, lo que confirma que el objetivo de recorte y la corrección GAE en el PPO producen políticas de programación más robustas que el DQN u otras variantes del PPO. En conjunto, los resultados validan que la combinación específica de Transformer y PPO en el marco propuesto ofrece ventajas claras frente a otras arquitecturas recientes, reforzando aún más su aplicabilidad en la programación de actividades sindicales dinámicas.
DECLARACIÓN DE DISPONIBILIDAD DE DATOS:
El conjunto de datos anonimizado utilizado en este estudio, junto con la canalización de preprocesamiento de datos y los scripts de evaluación, se ha depositado en el repositorio Figshare y está disponible públicamente en https://doi.org/10.6084/m9.figshare.33059243 (DOI: 10.6084/m9.figshare.33059243). El conjunto de datos contiene horarios de actividades, registros de uso de recursos y registros de eventos de conflicto de un gran sindicato empresarial, con toda la información identificable personalmente y comercialmente sensible eliminada.

Figura 1: Estructura del sistema de programación de actividades sindicales. Las solicitudes de actividades, la disponibilidad de recursos y la información sobre las ventanas temporales del personal se integran para construir un grafo de restricciones entre tareas y recursos y una matriz de conflictos. Las secuencias históricas de actividades y de estados de los recursos se codifican utilizando un Transformador con atención múltiple. Los estados codificados se proporcionan a las redes de política y de valor de optimización de política proximal (PPO), que generan probabilidades de acciones de programación y estimaciones del valor del estado. Las acciones seleccionadas actualizan el entorno de programación y generan recompensas. Luego, se utiliza el objetivo PPO con recorte y la estimación de ventaja generalizada para actualizar el modelo, formando un bucle de retroalimentación cerrado para la programación adaptativa y la asignación de recursos. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 2: Red de pesos de conflicto de tareas (el grosor de las líneas refleja la gravedad del conflicto). Cada nodo representa una actividad pendiente de programación, y cada arista representa un conflicto causado por el uso superpuesto de personal, lugares, equipos u otros recursos. El grosor de las aristas es proporcional al peso de conflicto calculado, siendo más gruesas las aristas que indican conflictos más severos. Los grupos de nodos densamente conectados representan cuellos de botella potenciales y agrupaciones de tareas en competencia. Se utiliza un diseño basado en fuerzas para posicionar más cerca las tareas con conflictos más intensos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Características dinámicas de la estabilidad de la estrategia y de la estimación de ventaja durante la iteración de optimización de programación. (A) Objetivo de política recortado bajo diferentes valores de ε. (B) Fluctuación de GAE según distintos valores de λ. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Tendencia temporal de la salida de atención múltiple Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Mejora residual y estratificación de prioridades de tareas bajo variación temporal de características de codificación. (A) Comparación del estado oculto antes y después de la conexión residual. (B) Activación de características basada en el tiempo para diferentes prioridades de tareas. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Análisis de la evolución del rendimiento multidimensional. (A) Recompensa y Entropía de la Política (B) Tasa de Conflicto y Utilización de Recursos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Tiempo medio de decisión y retraso medio de respuesta. (A): Tiempo de decisión bajo cargas de trabajo variables. (B): Latencia de respuesta bajo cargas de trabajo variables. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 8: Comparación de la tasa de conflicto de recursos y la utilización promedio de recursos (A) Tasa de conflicto de recursos. (B) Utilización promedio de recursos Haga clic aquí para ver una versión más grande de esta figura.
| Condición de complejidad de la actividad | Transformer-PPO | LSTM-PPO | Algoritmo codicioso | DQN |
| Tipo único | 0.91 | 0.86 | 0.74 | 0.78 |
| Múltiples tipos independientes | 0.88 | 0.81 | 0.7 | 0.73 |
| Múltiples tipos entrelazados | 0.85 | 0.76 | 0.65 | 0.68 |
| Flujo de trabajo de múltiples etapas | 0.83 | 0.73 | 0.61 | 0.66 |
| Colaboración entre departamentos | 0.8 | 0.7 | 0.59 | 0.63 |
| Inserción temporal | 0.86 | 0.78 | 0.68 | 0.72 |
| Período de repetición | 0.84 | 0.75 | 0.64 | 0.69 |
Tabla 1: Comparación del Índice de Estabilidad de Programación entre Diferentes Complejidades de Actividades. Se comparan los índices de estabilidad de programación de los modelos Transformer–PPO, memoria a corto y largo plazo–PPO (LSTM–PPO), búsqueda voraz y red profunda Q (DQN) en siete condiciones: actividades de un solo tipo, actividades múltiples independientes, actividades múltiples superpuestas, flujos de trabajo multietapa, colaboración interdepartamental, inserción de tareas temporales y actividades de ciclo repetido. El índice de estabilidad oscila entre 0 y 1, donde valores más altos indican mayor resistencia a las perturbaciones en la programación y salidas de política más consistentes.
| Condición de concurrencia de tareas | Modelo de programación | Índice de equilibrio de recursos | Índice de robustez de transferencia de políticas |
| Baja concurrencia (100 tareas) | Transformer-PPO | 0.94 | 0.92 |
| LSTM-PPO | 0.89 | 0.85 |
| Algoritmo voraz | 0.83 | 0.78 |
| DQN | 0.85 | 0.81 |
| Concurrencia media (500 tareas) | Transformer-PPO | 0.91 | 0.89 |
| LSTM-PPO | 0.86 | 0.82 |
| Algoritmo voraz | 0.78 | 0.71 |
| DQN | 0.81 | 0.76 |
| Alta concurrencia (1000 tareas) | Transformer-PPO | 0.88 | 0.85 |
| LSTM-PPO | 0.82 | 0.76 |
| Algoritmo voraz | 0.7 | 0.63 |
| DQN | 0.75 | 0.68 |
Tabla 2: Evaluación de la Adaptabilidad a la Carga de Concurrencia de Tareas. Se comparan el índice de equilibrio de recursos y el índice de robustez de transferencia de políticas de los cuatro modelos de planificación bajo condiciones de baja, media y alta concurrencia, correspondientes a 100, 500 y 1.000 tareas simultáneas, respectivamente. Ambos índices varían de 0 a 1, donde valores más altos indican una asignación de recursos más equilibrada y una mayor consistencia en las políticas de planificación frente a cambios en la carga de tareas.
| Método | Retraso promedio de respuesta (s) | Tasa de conflicto de recursos | Utilización de recursos | Índice de estabilidad |
| Transformer+DQN | 2.13 ± 0.12 | 0.18 ± 0.02 | 0.68 ± 0.03 | 0.76 ± 0.04 |
| GRU+PPO | 1.89 ± 0.09 | 0.15 ± 0.01 | 0.72 ± 0.02 | 0.79 ± 0.03 |
| GraphSAGE+PPO | 1.72 ± 0.08 | 0.13 ± 0.01 | 0.74 ± 0.02 | 0.82 ± 0.03 |
| Propuesto | 1.59 ± 0.05 | 0.09 ± 0.01 | 0.82 ± 0.02 | 0.88 ± 0.02 |
| (Transformer+PPO) |
Tabla 3: Comparación de rendimiento con métodos adicionales de última generación. Se compara el método propuesto Transformer–PPO con Transformer–DQN, unidad de memoria recurrente con puertas–PPO (GRU–PPO) y GraphSAGE–PPO bajo condiciones experimentales idénticas con una densidad de tareas de 1.000. Los resultados representan los valores promedio de 10 ejecuciones independientes. Las métricas evaluadas incluyen el retardo de respuesta en segundos, la tasa de conflictos por recursos, la tasa de utilización de recursos y el índice de estabilidad en la programación. Retardos de respuesta y tasas de conflicto más bajas indican un mejor rendimiento, mientras que tasas de utilización de recursos e índices de estabilidad más altos indican un mejor rendimiento.