Données expérimentales
Afin d'évaluer de manière exhaustive les performances de l'algorithme de planification dynamique Transformer-PPO présenté dans cet article, l'expérience utilise comme jeu de données de référence des données de gestion d'activités provenant d'un grand syndicat d'entreprise sur les trois dernières années. Ce jeu de données contient plus de 5 000 enregistrements d'activités, couvrant divers types, notamment des réunions, des formations et des événements de divertissement, ainsi que des informations de planification relatives à plusieurs ressources, telles que les lieux, le matériel et le personnel. Chaque enregistrement précise l'heure de début et de fin de l'activité, les besoins en ressources, la priorité et le statut réel d'exécution (y compris les conflits et l'utilisation des ressources). Afin de simuler des changements dynamiques proches de la réalité, les données ont été enrichies avec un supplément de 10 % de tâches soudaines aléatoires et d'événements de modification des ressources (comme l'occupation temporaire d'un lieu ou l'ajustement des plages horaires du personnel), afin de vérifier la robustesse de l'algorithme dans un environnement fortement incertain. La séquence continue d'états fournit une entrée structurée pour la modélisation temporelle par le Transformer et l'apprentissage de la politique par le PPO. L'expérience a comparé les performances de planification sous différentes densités et complexités de tâches afin de garantir que l'évaluation couvre des scénarios typiques des applications réelles, et a été confrontée au modèle LSTM-PPO actuellement populaire, à un modèle de planification par recherche gloutonne et à un modèle de planification par politique DQN.
L'encodeur Transformer comprend 3 couches, chacune dotée de 4 têtes d'attention, d'une dimension d'incorporation de 128 et d'une taille cachée de la couche entièrement connectée de 256. Le réseau de politique et le réseau de valeur partagent la même sortie du Transformer comme entrée, puis se divisent en deux perceptrons multicouches (MLP) distincts. Chaque MLP comporte deux couches cachées avec respectivement 256 et 128 neurones, en utilisant l'activation ReLU. Toutes les couches linéaires sont initialisées selon l'initialisation uniforme de Xavier.
L'optimiseur est Adam avec un taux d'apprentissage de 3 × 10-4, une taille de lot de 64 et un coefficient d'entropie de 0,01. Le paramètre de rognage PPO ε est fixé à 0,2, le facteur d'actualisation γ = 0,99, et le paramètre GAE λ = 0,95. Le modèle est entraîné sur 5 000 épisodes, chaque épisode comprenant jusqu'à 100 étapes de planification. Un rognage de gradient avec une norme maximale de 0,5 est appliqué afin d'éviter l'explosion des gradients. Ces paramètres sont choisis à l'aide d'une recherche préliminaire en grille et sont conformes aux pratiques courantes dans les tâches de planification basées sur l'apprentissage par renforcement. Toutes les expériences sont exécutées sur un seul accélérateur GPU (mémoire de 40 Go), en utilisant Python 3.9 et un framework d'apprentissage profond (voir le Tableau des matériaux).
Évolution temporelle de la sortie de l'attention multi-tête, amélioration résiduelle sous variation temporelle des caractéristiques d'encodage et stratification par priorité de tâche
À l’aide de l’historique réel de planification comme entrée, la demande de tâche, l’état d’utilisation des ressources et l’état d’exécution du retour sont extraits à des pas de temps consécutifs, et l’information de type multiple est intégrée dans un espace de caractéristiques unifié par une application linéaire et un encodage de position. Le mécanisme d’attention multi-tête calcule en parallèle les corrélations temporelles entre différentes séquences de caractéristiques et produit trois types de séquences de poids d’attention : tâche, ressource et retour. Chaque type de poids représente l’intensité d’attention du modèle portée à l’état correspondant à chaque pas de temps. Après normalisation, une courbe d’évolution est tracée afin de refléter le focus de perception de la couche d’encodage ainsi que la structure de changement dynamique des différentes dimensions d’information dans l’historique de planification. Ce processus est réalisé à partir de la trajectoire réelle d’exécution des activités et du journal d’utilisation des ressources dans le scénario de planification.
Figure 4 montre la tendance dynamique de l'attention du mécanisme d'attention multi-têtes sur différentes informations d'état dans la planification des activités syndicales. L'axe horizontal représente l'étape temporelle, reflétant l'avancement continu de la séquence de planification, tandis que l'axe vertical indique le poids d'attention normalisé, compris entre [0,1], représentant l'importance relative accordée par le modèle aux caractéristiques des tâches, à l'état des ressources et à l'état des retours. L'attention portée aux caractéristiques des tâches présente un pic net vers la 15e étape. Au stade initial de la planification, le modèle privilégie la capture des caractéristiques temporelles des tâches clés afin de prédire d'éventuels conflits et goulots d'étranglement des ressources, reflétant ainsi la sensibilité au risque à cette phase de la planification des activités. La courbe d'attention relative à l'état des ressources présente des fluctuations périodiques, et le poids d'attention global varie entre 0,2 et 0,8, reflétant le suivi continu par le système de planification des changements dans l'occupation des ressources, soutenant ainsi le traitement complexe du partage et de l'allocation des ressources, et permettant de répondre efficacement à la concurrence dynamique pour les ressources entre plusieurs tâches simultanées. L'attention portée à l'état de retour augmente progressivement, et le pic de poids apparaît vers l'étape 35, soulignant l'attention accrue du modèle aux retours sur les résultats d'exécution et aux conditions anormales durant les phases intermédiaires et finales de la planification, ce qui contribue à l'ajustement de la stratégie pour gérer les écarts de planification et améliorer la robustesse de l'ensemble du processus de planification. Cette tendance montre qu'une structure d'encodage intégrant le mécanisme d'attention multi-têtes peut capter des variations subtiles dans les caractéristiques temporelles et renforcer l'adaptabilité des stratégies de planification aux ressources variées et aux dépendances complexes entre tâches, améliorant ainsi l'efficacité et la stabilité globales de la planification dynamique des activités syndicales.
La séquence de codage de l'état caché et la structure de réponse aux caractéristiques de la tâche sont traitées. La partie de comparaison d'état construit les chemins de propagation des caractéristiques avant et après la connexion résiduelle dans les mêmes conditions d'entrée, observe l'évolution temporelle de l'état caché au fil des pas de temps consécutifs, et en extrait les caractéristiques de stabilité locale et de continuité globale afin d'analyser l'évolution fluide de l'expression de l'état durant la transmission de l'information. La tendance de réponse prioritaire selon la tâche est extraite à partir du chemin d'activation des caractéristiques à travers différentes stratégies de pondération de planification. En suivant les niveaux d'activation des différentes catégories de tâches au fil du temps, on capture l'effet d'ajustement dynamique du modèle sur sa capacité à différencier les tâches.
Figure 5A montre l'évolution de l'état caché du modèle avant et après l'application du mécanisme de connexion résiduelle. L'axe horizontal représente l'étape temporelle, et l'axe vertical représente la valeur de l'état caché. La sortie initiale, sans connexion résiduelle, présente des fluctuations importantes, marquées par une instabilité locale prononcée et des ruptures de tendance. La ligne pleine bleue représente la valeur d'état après l'application de la structure résiduelle. La tendance globale reste stable, et les fluctuations sont nettement réduites, ce qui indique que le modèle parvient à un amortissement du gradient et à un renforcement des caractéristiques lors de la propagation de l'état. Ce phénomène confirme le rôle du mécanisme résiduel dans l'amélioration de la stabilité des structures à dépendance longue, en supprimant efficacement l'atténuation de l'information causée par des couches plus profondes, et en renforçant la capacité expressive continue des séquences d'états historiques. Figure 5B illustre la dynamique d'activation des caractéristiques pour trois types de tâches dans une série temporelle. L'axe horizontal correspond à l'étape temporelle, et l'axe vertical à la valeur d'activation des caractéristiques, reflétant la sensibilité temporelle et l'attention stratégique accordée aux tâches de différents niveaux de priorité. Les tâches à faible priorité présentent une tendance décroissante, et la valeur d'activation des caractéristiques chute en dessous de 0,5 en phase finale, indiquant que le modèle leur accorde une attention appropriée au début de l'ordonnancement, puis réduit progressivement la réponse en ressources au fil du temps. Les caractéristiques des tâches à priorité moyenne augmentent lentement au fil du temps, avec des oscillations périodiques, reflétant une perception et un suivi flexibles des fluctuations de leurs besoins. Les tâches à haute priorité conservent une tendance ascendante continue, et la valeur d'activation des caractéristiques reste toujours supérieure à 2, avec un niveau d'activation élevé et stable, ce qui indique que le modèle maintient en permanence un haut degré de réactivité vis-à-vis de ces tâches. Cette réponse différenciée démontre la capacité du module de codage d'état à identifier précisément les attributs des tâches et fournit une base hiérarchique pour la prise de décision dans la génération des stratégies d'ordonnancement.
Analyse de l'évolution des performances multidimensionnelles de l'algorithme de planification dynamique Transformer-PP0
À partir du codage Transformer des séquences historiques de planification et de l'état des ressources, des caractéristiques spatiotemporelles sont extraites comme entrée d'état du PP0 ; ensuite, le réseau de politique produit l'action de planification, et l'environnement renvoie des récompenses immédiates et met à jour l'état ; au cours du processus d'apprentissage, les indicateurs bruts de chaque itération sont enregistrés, puis le bruit est éliminé par un filtrage à moyenne glissante, permettant d'analyser la tendance de convergence de l'algorithme ; lors de la visualisation finale, les données brutes montrent la dynamique instantanée, tandis que la courbe lissée reflète l'amélioration progressive des performances, confirmant que le modèle parvient à une planification stable grâce à la modélisation des séries temporelles et à l'optimisation de la politique.
Figure 6A,B montre l'analyse de l'évolution des performances multidimensionnelles de l'algorithme de planification dynamique Transformer-PPO. Les fluctuations des données initiales reflètent le bruit instantané du processus de planification, tandis que les données lissées extraient la tendance à long terme au moyen d'une moyenne glissante, éliminant ainsi les interférences des perturbations à court terme sur l'évaluation des performances de l'algorithme et facilitant l'observation de l'évolution des performances. L'analyse des données lissées révèle la relation dynamique entre la récompense et l'entropie de la politique : la courbe de récompense présente une croissance logarithmique, et la politique apprend rapidement à planifier efficacement les actions par l'exploration ; la croissance tend à s'aplatir en fin de processus, et la valeur de saturation de la récompense se stabilise autour de 12, indiquant que la politique est proche d'un optimum local. L'entropie de la politique décroît progressivement d'environ 2,2 au début à environ 0,6. PPO conserve une capacité d'exploration nécessaire grâce au terme de récompense d'entropie. Une exploration élevée (entropie élevée) au début favorise une augmentation rapide des récompenses, tandis que la stratégie ultérieure équilibre exploration et exploitation par élagage et mise à jour. L'optimisation coordonnée du taux de conflits et de l'utilisation des ressources montre que le taux de conflits chute à un niveau inférieur à 10 %, dont la limite inférieure reflète les conflits impossibles à éliminer dans le système réel en raison de l'aléatoire des tâches. Cette tendance à la baisse est directement attribuable à la capacité du Transformer à encoder les séquences d'activités passées, permettant au modèle de prédire proactivement les contentions de ressources. L'utilisation des ressources a augmenté jusqu'à près de 75 %, conformément à la loi des rendements marginaux décroissants. Il est raisonnable que l'utilisation n'atteigne pas un niveau plus élevé, car une utilisation excessive pourrait entraîner des retards de mise en file d'attente. La réduction des conflits a libéré davantage de ressources disponibles, et l'allocation optimisée des ressources a davantage réduit les conflits.
Évaluation de la rapidité de réponse et de l'efficacité de la prise de décision
Comparaison du temps de décision moyen et du délai de réponse moyen sous différentes densités de tâches (nombre de tâches : 100, 300, 500, 700, 1000). Comparaison du modèle de planification Transformer-PPO présenté dans cet article avec le modèle LSTM-PPO, le modèle de planification par recherche gloutonne et le modèle de planification stratégique DQN.
Figure 7A,B montre le temps de décision moyen et le délai de réponse moyen pour les quatre stratégies d'ordonnancement dans différentes conditions de densité de tâches, reflétant la capacité de prise de décision en temps réel de l'algorithme et la réactivité du système dans des scénarios à forte charge. À mesure que le nombre de tâches augmente, chaque stratégie présente une tendance à la hausse pour les deux indicateurs, mais les augmentations et la stabilité diffèrent. Dans les scénarios à forte intensité de tâches, la structure Transformer-PPO conserve une performance relativement stable en termes de temps de décision moyen. Lorsque la densité de tâches est de 1000, le temps de décision moyen est de 0,72 s et le délai de réponse moyen est de 1,59 s, ce qui est principalement dû à l'effet de compression de son encodage des caractéristiques temporelles sur l'espace d'état et à l'évitement efficace des opérations non valides dans l'espace d'action. En revanche, la stratégie DQN présente des temps de décision et des délais de réponse plus longs à mesure que le nombre de tâches augmente, reflétant sa capacité limitée à généraliser les politiques à travers des transitions d'état de haute dimension. Bien que la stratégie gloutonne prenne des décisions plus rapidement quel que soit le nombre de tâches, ses performances de réponse se dégradent sur des graphes de tâches complexes en raison d'un manque de modélisation des dépendances à long terme. LSTM-PPO possède une certaine capacité de perception temporelle dans la modélisation de séquences, mais elle obtient de mauvais résultats dans les scénarios de dépendance à long terme en raison d'une profondeur structurelle limitée. Les résultats révèlent l'impact clé de la conception structurelle sur la réactivité du système d'ordonnancement et soulignent la nécessité d'une optimisation coordonnée du mécanisme d'encodage et de l'efficacité de l'échantillonnage des politiques dans des conditions de forte concurrence.
Taux de conflit et évaluation de l'utilisation des ressources
Dans différentes conditions de complexité des types d'activités (type unique, types multiples indépendants, types multiples croisés, flux de travail multi-étapes, collaboration interdépartementale, insertion temporaire, cycle répété), le taux de conflit des ressources et le taux moyen d'utilisation des ressources sont analysés statistiquement. Le modèle d'ordonnancement Transformer-PPO présenté dans cet article est comparé aux modèles d'ordonnancement LSTM-PPO, recherche gloutonne et DQN.
Figure 8A,B montre le taux de conflit de ressources et l'utilisation moyenne des ressources pour différents modèles d'ordonnancement à travers sept niveaux de complexité d'activité. L'axe vertical représente le modèle d'ordonnancement, et l'axe horizontal représente le type d'activité. La tendance générale montre qu'avec l'augmentation de la complexité de la structure des activités (telles que les processus multi-étapes, la collaboration interdépartementale, l'insertion temporaire et les cycles répétés), le taux de conflit augmente pour tous les modèles. La stratégie gloutonne et le schéma DQN présentent une adaptabilité limitée aux changements dynamiques et sont clairement insuffisants en matière de contrôle des conflits. Le modèle Transformer-PPO maintient toutefois un taux de conflit faible dans des conditions de forte complexité, avec un taux global de conflit de ressources compris entre 0,05 et 0,12, reflétant sa compréhension approfondie de la structure des dépendances des tâches et des variations des ressources. En ce qui concerne l'utilisation des ressources, Transformer-PPO maintient un niveau élevé dans toutes les conditions, particulièrement en présence de croisements de types multiples et d'insertions temporaires. Sa stratégie d'ajustement dynamique réduit efficacement l'inactivité des ressources, avec un taux moyen d'utilisation des ressources compris entre 0,75 et 0,86. Les données confirment que le modèle Transformer-PPO parvient à un meilleur équilibre entre flexibilité d'ordonnancement et efficacité des ressources, offrant ainsi une plus grande praticité et évolutivité.
Stabilité de l'ordonnancement
L'indice de stabilité de l'ordonnancement est calculé dans différentes conditions de complexité des types d'activités (type unique, types multiples indépendants, types multiples croisés, processus multi-étapes, collaboration interdépartementale, insertion temporaire et cycle répété). Le modèle d'ordonnancement Transformer-PPO présenté dans cet article est comparé aux modèles d'ordonnancement LSTM-PPO, recherche gloutonne et DQN.
Tableau 1 présente les résultats comparatifs de l'indice de stabilité de planification entre différents modèles de planification, sous sept conditions de complexité de types d'activités. Le type de complexité retenu reflète la performance de stabilité du système de planification dans plusieurs scénarios. La valeur de l'indice varie de 0 à 1. Plus cette valeur est élevée, plus la résistance du modèle aux perturbations de planification est forte et plus la stratégie produite est stable. Les résultats expérimentaux montrent que Transformer-PPO conserve un indice de stabilité élevé dans toutes les structures de tâches. En particulier dans les scénarios impliquant des activités de types multiples, une collaboration interdépartementale et des cycles répétés, la stabilité de sa stratégie de planification est supérieure à celle des autres modèles, démontrant ainsi de solides capacités de préservation structurelle et d'adaptation dynamique. L'indice global de stabilité de planification varie entre 0,8 et 0,91. En revanche, la stabilité de l'algorithme glouton et du DQN diminue nettement lorsque la structure des tâches devient plus complexe, avec des oscillations évidentes de la politique et des écarts d'exécution. LSTM-PPO présente une certaine stabilité, mais ses performances globales restent inférieures à celles de Transformer-PPO. Cette comparaison confirme l'apport positif du mécanisme d'attention multi-têtes et du mécanisme de mise à jour par élagage de politique à la stabilité de la sortie de planification, soulignant l'avantage du modèle en termes de stabilité dans des scénarios complexes d'activités combinées.
Analyse de l'adaptation à la charge de concurrence des tâches
À mesure que le nombre de tâches simultanées augmente, le système d'ordonnancement doit relever les deux défis que sont les conflits de répartition des ressources et la réduction de la généralisation de la politique. Afin d'évaluer l'adaptabilité à l'ordonnancement de différents modèles face à une augmentation de la charge de tâches, cette section définit trois niveaux de concurrence des tâches (faible : 100 éléments, moyen : 500 éléments et élevé : 1000 éléments) afin de surveiller la répartition des ressources du système et la cohérence de la réponse de la politique durant le cycle d'ordonnancement. L'indice d'équilibre des ressources est utilisé pour refléter l'équilibre de charge des différentes unités de ressources durant le processus d'ordonnancement, et est calculé comme suit :
(7)
ui représente le taux d'utilisation réel des unités de ressource ; ū représente le taux d'utilisation moyen de toutes les ressources ; et N représente le nombre total de ressources. La plage de valeurs est [0,1], et plus elle est proche de 1, plus la répartition des ressources est équilibrée.
L'indice de robustesse du transfert de politique Rs mesure le degré de cohérence de la sortie politique dans différentes conditions de charge de tâche et est défini par :
(8)
πt(L) et πt(H) sont respectivement les distributions des stratégies d'ordonnancement dans des scénarios de faible charge et de forte charge, et T est le pas de temps total. Plus cette valeur est proche de 1, plus la robustesse de la migration des stratégies est forte et plus l'adaptabilité est élevée.
Tableau 2 présente de manière systématique les performances des quatre modèles d'ordonnancement en termes d'équilibre des ressources et de robustesse du transfert de politique sous des charges de concurrence aux tâches variables. Les niveaux de concurrence aux tâches sont définis comme faibles (100 éléments), moyens (500 éléments) et élevés (1000 éléments), respectivement, reflétant l'adaptabilité du modèle à différents niveaux de pression liés à l'échelle des tâches. Les résultats montrent que le modèle Transformer-PPO atteint l'indice d'équilibre des ressources le plus élevé à tous les niveaux de charge, reflétant sa capacité à allouer rationnellement les ressources dans des scénarios de tâches multiples concurrentes. En même temps, l'indice de robustesse du transfert de politique est également nettement supérieur à celui des modèles comparatifs, démontrant une forte cohérence et adaptabilité des politiques. Dans des conditions de forte concurrence, les indices d'équilibre des ressources et de robustesse du transfert de politique sont respectivement de 0,88 et 0,85. En comparaison, LSTM-PPO se classe au deuxième rang, tandis que l'algorithme glouton et le modèle DQN montrent une dégradation significative des performances sous une charge élevée, avec une répartition inégale des ressources et des fluctuations de politique plus marquées. Cette évaluation a clairement mis en évidence les différences en matière de gestion des ressources et de robustesse des politiques dans le système d'ordonnancement lorsque la charge de tâches augmente, et a en outre confirmé l'applicabilité et la supériorité de la solution hybride Transformer-PPO pour l'ordonnancement dynamique et complexe d'activités en réunion.
Comparaison avec d'autres méthodes de pointe
Afin de comparer davantage la méthode proposée à des approches récentes de pointe (SOTA), trois algorithmes représentatifs issus des dernières publications combinant apprentissage profond et apprentissage par renforcement ont été implémentés pour des problèmes d'ordonnancement : (1) Transformer+DQN42, utilisant le même encodeur Transformer que le nôtre mais remplaçant PPO par DQN pour l'apprentissage de la politique, comme cela a été exploré dans des études récentes sur l'ordonnancement basé sur les valeurs ; (2) GRU+PPO43, remplaçant l'encodeur Transformer par une unité récurrente à porte d'entrée (Gated Recurrent Unit, GRU) afin de capturer les dépendances temporelles, représentant ainsi les méthodes avancées basées sur les RNN ; et (3) GraphSAGE+PPO44, utilisant un encodeur GraphSAGE pour modéliser les relations tâche-ressource sous forme de graphes, reflétant les approches récentes utilisant les réseaux de neurones graphiques pour l'ordonnancement. Toutes les méthodes sont entraînées dans des conditions expérimentales identiques (même jeu de données, densité de tâches de 1000, et configuration des épisodes) avec des hyperparamètres optimisés par recherche en grille afin d'assurer une comparaison équitable. Chaque méthode est évaluée sur 10 exécutions indépendantes, et les valeurs moyennes des métriques clés de performance (délai de réponse, taux de conflit de ressources, taux d'utilisation des ressources et indice de stabilité de l'ordonnancement) sont enregistrées.
Comme indiqué dans le Tableau 3, la méthode proposée Transformer+PPO surpasse systématiquement les trois modèles de référence SOTA sur l'ensemble des métriques évaluées. Le délai de réponse moyen de la méthode proposée (1,59 s) est nettement inférieur à celui de Transformer+DQN (2,13 s), de GRU+PPO (1,89 s) et de GraphSAGE+PPO (1,72 s), ce qui indique une efficacité supérieure en matière de prise de décision. Le taux de conflit de ressources de la méthode proposée (0,09) est également le plus faible, ce qui témoigne d'une meilleure anticipation des conflits. Cette amélioration s'explique par l'attention multi-têtes du Transformer, qui capture plus efficacement les dépendances à longue portée que le GRU ou GraphSAGE, combinée aux mises à jour de politique stables de PPO. En ce qui concerne l'utilisation des ressources, la méthode proposée atteint 0,82, dépassant les autres d'au moins 8 points de pourcentage, ce qui démontre une allocation des ressources plus efficace. L'indice de stabilité de la méthode proposée (0,88) est également le plus élevé, confirmant que l'objectif de limitation et la correction GAE dans PPO produisent des politiques d'ordonnancement plus robustes que DQN ou d'autres variantes de PPO. Dans l'ensemble, ces résultats valident le fait que la combinaison spécifique de Transformer et de PPO dans le cadre proposé offre des avantages clairs par rapport aux architectures alternatives récentes, renforçant ainsi l'intérêt de son application à la planification dynamique des activités syndicales.
DÉCLARATION DE DISPONIBILITÉ DES DONNÉES :
L'ensemble de données anonymisé utilisé dans cette étude, ainsi que le pipeline de prétraitement des données et les scripts d'évaluation, ont été déposés dans le dépôt Figshare et sont accessibles publiquement à l'adresse https://doi.org/10.6084/m9.figshare.33059243 (DOI : 10.6084/m9.figshare.33059243). L'ensemble de données contient des plannings d'activités, des journaux d'utilisation des ressources et des enregistrements d'événements de conflit provenant d'un grand syndicat d'entreprise, toutes les informations personnelles identifiables et sensibles sur le plan commercial ayant été supprimées.

Figure 1 : Structure du système de planification des activités syndicales. Les demandes d'activités, la disponibilité des ressources et les informations sur les plages horaires du personnel sont intégrées afin de construire un graphe de contraintes tâche–ressource et une matrice de conflits. Les séquences historiques d'activités et d'états des ressources sont encodées à l'aide d'un modèle Transformer doté d'une attention multi-têtes. Les états encodés sont transmis aux réseaux de politique et de valeur de l'optimisation de politique proximale (PPO), qui génèrent des probabilités d'actions de planification et des estimations de valeur d'état. Les actions sélectionnées mettent à jour l'environnement de planification et génèrent des récompenses. L'objectif PPO tronqué et l'estimation généralisée de l'avantage sont ensuite utilisés pour mettre à jour le modèle, formant ainsi une boucle de rétroaction fermée destinée à la planification et à l'allocation des ressources adaptatives. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 2 : Réseau de poids des conflits de tâches (l'épaisseur des arêtes reflète la gravité du conflit). Chaque nœud représente une activité en attente de planification, et chaque arête représente un conflit causé par une utilisation simultanée de personnel, de lieux, d'équipements ou d'autres ressources. L'épaisseur des arêtes est proportionnelle au poids de conflit calculé, les arêtes plus épaisses indiquant des conflits plus graves. Les groupes de nœuds fortement connectés représentent des goulots d'étranglement potentiels en ressources et des ensembles de tâches concurrentes. Une disposition de type force dirigée est utilisée pour rapprocher les tâches en conflit marqué. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 3 : Caractéristiques dynamiques de la stabilité de la stratégie et de l'estimation de l'avantage au cours de l'itération d'optimisation de planification. (A) Objectif de politique tronquée selon différentes valeurs de ε. (B) Variation de l'estimation GAE selon différents paramètres de λ. Veuillez cliquer ici pour consulter une version agrandie de cette figure.

Figure 4 : Évolution temporelle de la sortie de l'attention multi-têtes Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Renforcement résiduel et stratification de la priorité des tâches sous variation temporelle des caractéristiques d'encodage. (A) Comparaison de l'état caché avant et après la connexion résiduelle. (B) Activation des caractéristiques en fonction du temps pour différentes priorités de tâche. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Analyse de l'évolution des performances multidimensionnelles. (A) Récompense et entropie de la politique (B) Taux de conflit et utilisation des ressources. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Temps moyen de décision et retard moyen de réponse. (A) : Temps de décision selon des charges de tâches variables. (B) : Latence de réponse selon des charges de tâches variables. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 8 : Comparaison du taux de conflit de ressources et de l'utilisation moyenne des ressources (A) Taux de conflit de ressources. (B) Utilisation moyenne des ressources Veuillez cliquer ici pour afficher une version agrandie de cette figure.
| Condition de complexité de l'activité | Transformer-PPO | LSTM-PPO | Algorithme glouton | DQN |
| Type unique | 0.91 | 0.86 | 0.74 | 0.78 |
| Multi-type indépendant | 0.88 | 0.81 | 0.7 | 0.73 |
| Multi-type entrelacé | 0.85 | 0.76 | 0.65 | 0.68 |
| Flux de travail multi-étape | 0.83 | 0.73 | 0.61 | 0.66 |
| Collaboration interdépartementale | 0.8 | 0.7 | 0.59 | 0.63 |
| Insertion temporaire | 0.86 | 0.78 | 0.68 | 0.72 |
| Période de répétition | 0.84 | 0.75 | 0.64 | 0.69 |
Tableau 1 : Comparaison de l'indice de stabilité de planification selon différentes complexités d'activités. Les indices de stabilité de planification des modèles Transformer–PPO, mémoire à long court terme–PPO (LSTM–PPO), recherche gloutonne et réseau profond de Q-apprentissage (DQN) sont comparés selon sept conditions : activités d'un seul type, activités indépendantes de plusieurs types, activités de plusieurs types avec intersections, flux de travail multicouches, collaboration interdépartementale, insertion de tâches temporaires et activités à cycles répétés. L'indice de stabilité varie de 0 à 1, les valeurs plus élevées indiquant une résistance accrue aux perturbations de planification et des sorties de politique plus stables.
| Condition de concurrence des tâches | Modèle d'ordonnancement | Indice d'équilibre des ressources | Indice de robustesse du transfert de politique |
| Basse concurrence (100 tâches) | Transformer-PPO | 0.94 | 0.92 |
| LSTM-PPO | 0.89 | 0.85 |
| Algorithme glouton | 0.83 | 0.78 |
| DQN | 0.85 | 0.81 |
| Concurrence moyenne (500 tâches) | Transformer-PPO | 0.91 | 0.89 |
| LSTM-PPO | 0.86 | 0.82 |
| Algorithme glouton | 0.78 | 0.71 |
| DQN | 0.81 | 0.76 |
| Haute concurrence (1000 tâches) | Transformer-PPO | 0.88 | 0.85 |
| LSTM-PPO | 0.82 | 0.76 |
| Algorithme glouton | 0.7 | 0.63 |
| DQN | 0.75 | 0.68 |
Tableau 2 : Évaluation de l'adaptabilité à la charge de concurrence des tâches. L'indice d'équilibre des ressources et l'indice de robustesse du transfert de politique des quatre modèles d'ordonnancement sont comparés dans des conditions de faible, moyenne et forte concurrence, correspondant respectivement à 100, 500 et 1 000 tâches simultanées. Les deux indices varient de 0 à 1, des valeurs plus élevées indiquant une répartition plus équilibrée des ressources et une plus grande cohérence des politiques d'ordonnancement face aux variations de la charge de travail.
| Méthode | Délai moyen de réponse (s) | Taux de conflit de ressources | Utilisation des ressources | Indice de stabilité |
| Transformer+DQN | 2.13 ± 0.12 | 0.18 ± 0.02 | 0.68 ± 0.03 | 0.76 ± 0.04 |
| GRU+PPO | 1.89 ± 0.09 | 0.15 ± 0.01 | 0.72 ± 0.02 | 0.79 ± 0.03 |
| GraphSAGE+PPO | 1.72 ± 0.08 | 0.13 ± 0.01 | 0.74 ± 0.02 | 0.82 ± 0.03 |
| Proposée | 1.59 ± 0.05 | 0.09 ± 0.01 | 0.82 ± 0.02 | 0.88 ± 0.02 |
| (Transformer+PPO) |
Tableau 3 : Comparaison des performances avec d'autres méthodes à l'état de l'art. La méthode proposée Transformer–PPO est comparée aux approches Transformer–DQN, unité récurrente à porte d'entrée–PPO (GRU–PPO) et GraphSAGE–PPO dans des conditions expérimentales identiques à une densité de tâches de 1 000. Les résultats représentent les valeurs moyennes obtenues lors de 10 exécutions indépendantes. Les critères évalués incluent le délai de réponse en secondes, le taux de conflits liés aux ressources, le taux d'utilisation des ressources et l'indice de stabilité de l'ordonnancement. Des délais de réponse et des taux de conflits plus faibles indiquent de meilleures performances, tandis que des taux d'utilisation des ressources et des indices de stabilité plus élevés indiquent de meilleures performances.